Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

12 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

RU LLM Benchmark

Сравнение языковых и vision-моделей на русском языке. Задачи прикладные: бухгалтерия и налоги, юридический комплаенс, корпоративные финансы, BI и данные, ВЭД и логистика, стройка, нефтегаз, промышленность, банки.

  • Текст — 181 задача, 22 модели, 21 категория
  • Зрение — 303 задачи, 18 моделей, 17 способностей на 8 отраслей

Отчёты с разбором каждой задачи: текстовый · по зрению

Результаты

Балл 0–10, усреднённый по категориям.

Текст

# Модель Балл # Модель Балл
1 GPT-5.6 Sol (medium) 9.04 12 MiniMax-M3 8.39
2 GPT-5.6 Sol (low) 8.87 13 GPT-5.6 Luna (low) 8.34
3 GPT-5.5 (medium) 8.85 14 Kimi K2.6 8.33
4 GPT-5.6 Luna (high) 8.84 15 DeepSeek v4-flash (до 0731) 8.19
5 GPT-5.6 Terra (high) 8.77 16 Qwen3.6-27B-FP8 8.16
6 GPT-5.5 (low) 8.76 17 Gemma-4-31B 8.00
7 GPT-5.6 Terra (medium) 8.74 18 Qwen3.6-35B-A3B-FP8 7.85
8 GPT-5.6 Terra (low) 8.62 19 gpt-oss-120b 7.34
9 DeepSeek v4-flash-0731 8.56 20 DiffusionGemma 6.08
10 DeepSeek v4-pro 8.49 21 Nemotron-3-Nano-Omni-30B 4.57
11 GPT-5.6 Luna (medium) 8.53 22 Nemotron-3-Super-120B 4.36

Зрение

# Модель Балл # Модель Балл
1 Kimi K2.6 9.01 10 GPT-5.6 Terra (low) 8.73
2 GPT-5.6 Sol (medium) 8.99 11 GPT-5.6 Luna (high) 8.72
3 GPT-5.5 (medium) 8.95 12 GPT-5.6 Luna (medium) 8.69
4 GPT-5.6 Sol (low) 8.94 13 GPT-5.6 Luna (low) 8.57
5 GPT-5.5 (low) 8.89 14 Gemma-4-31B 8.46
6 GPT-5.6 Terra (medium) 8.86 15 DiffusionGemma 8.20
7 Qwen3.6-35B-A3B-FP8 8.84 16 MiniMax-M3 8.10
8 Qwen3.6-27B-FP8 8.77 17 Llama-4-Scout-17B 7.53
9 GPT-5.6 Terra (high) 8.75 18 Nemotron-3-Nano-Omni-30B 6.80

Как считалось

Параметры инференса — вендорские. Для каждой модели temperature, top_p, top_k и способ включения reasoning взяты из её карточки или документации провайдера. Одно отклонение: Qwen запускался на temperature 0.6 вместо рекомендованной 1.0 — на русском это заметно чище по языку и не стоит корректности.

Судейство — один проход Claude Opus на все модели. Агент получает задачу, эталонный разбор (notes_for_judge) и ответы всех участников сразу, затем выставляет каждому correctness, reasoning, format и russian по шкале 0–10. Критерии корректности и формата конкретизированы под тип задачи (judge-args-v3.json). В пакет судьи попадает только видимый ответ модели: reasoning-трейсы исключены, иначе модели с отдельным трейсом получили бы преимущество перед теми, у кого его нет.

Итоговый балл — взвешенная свёртка трёх критериев; reasoning в зачёт не идёт, потому что доступен не у всех моделей одинаково.

correctness format russian
Текст 0.6 0.1 0.3
Зрение 0.8 0.1 0.1

В зрении русский и формат почти у всех ≥9 и модели не различают, поэтому вес отдан точности распознавания. В тексте язык различает сильно.

Заголовочный балл считается по категориям (каждая весит одинаково), чтобы крупные категории не перетягивали итог. Среднее по задачам показано в отчётах рядом.

Ограничения

Задачи и эталоны открыты, поэтому со временем попадут в обучающие выборки — для моделей, вышедших позже этой публикации, результаты уже не будут чистыми.

Судья сам является моделью и на отдельных типах задач систематически мягче или строже. Относительный порядок надёжнее абсолютных значений; разница до 0.15 балла — шум. Прогон один, температура ненулевая, отсюда ещё ±0.1–0.2 разброса.

Сырые ответы моделей в репозиторий не вошли из-за объёма, публикуются только оценки судьи.

Воспроизведение

pip install requests pillow
cp .env.example .env && chmod 600 .env   # заполнить ключи

python3 rerun_vendor.py text 8           # инференс, resumable
python3 rerun_vendor.py vl 6             # картинки уже в vl-ru-images/

# модели, доступные только через codex CLI
CODEX_MODEL=gpt-5.6-sol python3 codex_model.py text medium 2
python3 merge_codex_contestants.py text gpt-5.6

python3 build_unified_judge.py text      # -> unified_judge_text_full.js
python3 build_unified_judge.py vl

python3 build_standalone.py text \
  --results master-benchmark-results-v3.json --scores-dir judging-scores-v4 \
  --out text-benchmark.html --tags "<теги моделей>" --title "Сравнение языковых моделей"

build_unified_judge.py собирает пакеты и workflow-скрипт, который запускает по одному судейскому агенту на задачу — батчами, с продолжением после обрыва. Оркестратор агентов в репозиторий не входит: подойдёт любой, который умеет выполнить промпт и сохранить JSON по заданному пути.

Структура

rerun_vendor.py инференс по вендорским параметрам: HTTP, resumable, ретраи
codex_model.py участники, доступные только через codex CLI
endpoints.py реестр эндпоинтов, URL и ключи из окружения
neuraldeep.py клиент провайдера с поддержкой изображений
build_unified_judge.py судейские пакеты и workflow-скрипт
merge_codex_contestants.py вливание ответов codex-моделей в общий набор
build_standalone.py сборка отчёта
build_html_report_v2.py, build_vl_report.py рабочие отчёты и общие утилиты
judging-scores-v4/, vl-judging-scores-v4/ оценки судьи: 187 и 303 файла
master-benchmark-tasks-v3.json, vl-ru-tasks.json задачи и эталоны
vl-ru-images/ изображения для VL, 374 файла (архивом)

Лицензия

Код — MIT. Задачи, эталоны и оценки судьи — CC BY 4.0, со ссылкой на репозиторий. Подробнее в LICENSE.

About

Бенчмарк языковых и vision-моделей на русском языке: 187 текстовых задач на 20 моделях, 303 задачи по изображениям на 17 моделях. Вендорские параметры инференса, единое судейство, разбор каждой задачи.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages