Сравнение языковых и vision-моделей на русском языке. Задачи прикладные: бухгалтерия и налоги, юридический комплаенс, корпоративные финансы, BI и данные, ВЭД и логистика, стройка, нефтегаз, промышленность, банки.
- Текст — 181 задача, 22 модели, 21 категория
- Зрение — 303 задачи, 18 моделей, 17 способностей на 8 отраслей
Отчёты с разбором каждой задачи: текстовый · по зрению
Балл 0–10, усреднённый по категориям.
| # | Модель | Балл | # | Модель | Балл | |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol (medium) | 9.04 | 12 | MiniMax-M3 | 8.39 | |
| 2 | GPT-5.6 Sol (low) | 8.87 | 13 | GPT-5.6 Luna (low) | 8.34 | |
| 3 | GPT-5.5 (medium) | 8.85 | 14 | Kimi K2.6 | 8.33 | |
| 4 | GPT-5.6 Luna (high) | 8.84 | 15 | DeepSeek v4-flash (до 0731) | 8.19 | |
| 5 | GPT-5.6 Terra (high) | 8.77 | 16 | Qwen3.6-27B-FP8 | 8.16 | |
| 6 | GPT-5.5 (low) | 8.76 | 17 | Gemma-4-31B | 8.00 | |
| 7 | GPT-5.6 Terra (medium) | 8.74 | 18 | Qwen3.6-35B-A3B-FP8 | 7.85 | |
| 8 | GPT-5.6 Terra (low) | 8.62 | 19 | gpt-oss-120b | 7.34 | |
| 9 | DeepSeek v4-flash-0731 | 8.56 | 20 | DiffusionGemma | 6.08 | |
| 10 | DeepSeek v4-pro | 8.49 | 21 | Nemotron-3-Nano-Omni-30B | 4.57 | |
| 11 | GPT-5.6 Luna (medium) | 8.53 | 22 | Nemotron-3-Super-120B | 4.36 |
| # | Модель | Балл | # | Модель | Балл | |
|---|---|---|---|---|---|---|
| 1 | Kimi K2.6 | 9.01 | 10 | GPT-5.6 Terra (low) | 8.73 | |
| 2 | GPT-5.6 Sol (medium) | 8.99 | 11 | GPT-5.6 Luna (high) | 8.72 | |
| 3 | GPT-5.5 (medium) | 8.95 | 12 | GPT-5.6 Luna (medium) | 8.69 | |
| 4 | GPT-5.6 Sol (low) | 8.94 | 13 | GPT-5.6 Luna (low) | 8.57 | |
| 5 | GPT-5.5 (low) | 8.89 | 14 | Gemma-4-31B | 8.46 | |
| 6 | GPT-5.6 Terra (medium) | 8.86 | 15 | DiffusionGemma | 8.20 | |
| 7 | Qwen3.6-35B-A3B-FP8 | 8.84 | 16 | MiniMax-M3 | 8.10 | |
| 8 | Qwen3.6-27B-FP8 | 8.77 | 17 | Llama-4-Scout-17B | 7.53 | |
| 9 | GPT-5.6 Terra (high) | 8.75 | 18 | Nemotron-3-Nano-Omni-30B | 6.80 |
Параметры инференса — вендорские. Для каждой модели temperature, top_p, top_k и способ включения reasoning взяты из её карточки или документации провайдера. Одно отклонение: Qwen запускался на temperature 0.6 вместо рекомендованной 1.0 — на русском это заметно чище по языку и не стоит корректности.
Судейство — один проход Claude Opus на все модели. Агент получает задачу, эталонный
разбор (notes_for_judge) и ответы всех участников сразу, затем выставляет каждому
correctness, reasoning, format и russian по шкале 0–10. Критерии корректности и формата
конкретизированы под тип задачи (judge-args-v3.json). В пакет судьи попадает только видимый
ответ модели: reasoning-трейсы исключены, иначе модели с отдельным трейсом получили бы
преимущество перед теми, у кого его нет.
Итоговый балл — взвешенная свёртка трёх критериев; reasoning в зачёт не идёт, потому что доступен не у всех моделей одинаково.
| correctness | format | russian | |
|---|---|---|---|
| Текст | 0.6 | 0.1 | 0.3 |
| Зрение | 0.8 | 0.1 | 0.1 |
В зрении русский и формат почти у всех ≥9 и модели не различают, поэтому вес отдан точности распознавания. В тексте язык различает сильно.
Заголовочный балл считается по категориям (каждая весит одинаково), чтобы крупные категории не перетягивали итог. Среднее по задачам показано в отчётах рядом.
Задачи и эталоны открыты, поэтому со временем попадут в обучающие выборки — для моделей, вышедших позже этой публикации, результаты уже не будут чистыми.
Судья сам является моделью и на отдельных типах задач систематически мягче или строже. Относительный порядок надёжнее абсолютных значений; разница до 0.15 балла — шум. Прогон один, температура ненулевая, отсюда ещё ±0.1–0.2 разброса.
Сырые ответы моделей в репозиторий не вошли из-за объёма, публикуются только оценки судьи.
pip install requests pillow
cp .env.example .env && chmod 600 .env # заполнить ключи
python3 rerun_vendor.py text 8 # инференс, resumable
python3 rerun_vendor.py vl 6 # картинки уже в vl-ru-images/
# модели, доступные только через codex CLI
CODEX_MODEL=gpt-5.6-sol python3 codex_model.py text medium 2
python3 merge_codex_contestants.py text gpt-5.6
python3 build_unified_judge.py text # -> unified_judge_text_full.js
python3 build_unified_judge.py vl
python3 build_standalone.py text \
--results master-benchmark-results-v3.json --scores-dir judging-scores-v4 \
--out text-benchmark.html --tags "<теги моделей>" --title "Сравнение языковых моделей"build_unified_judge.py собирает пакеты и workflow-скрипт, который запускает по одному
судейскому агенту на задачу — батчами, с продолжением после обрыва. Оркестратор агентов в
репозиторий не входит: подойдёт любой, который умеет выполнить промпт и сохранить JSON по
заданному пути.
rerun_vendor.py |
инференс по вендорским параметрам: HTTP, resumable, ретраи |
codex_model.py |
участники, доступные только через codex CLI |
endpoints.py |
реестр эндпоинтов, URL и ключи из окружения |
neuraldeep.py |
клиент провайдера с поддержкой изображений |
build_unified_judge.py |
судейские пакеты и workflow-скрипт |
merge_codex_contestants.py |
вливание ответов codex-моделей в общий набор |
build_standalone.py |
сборка отчёта |
build_html_report_v2.py, build_vl_report.py |
рабочие отчёты и общие утилиты |
judging-scores-v4/, vl-judging-scores-v4/ |
оценки судьи: 187 и 303 файла |
master-benchmark-tasks-v3.json, vl-ru-tasks.json |
задачи и эталоны |
vl-ru-images/ |
изображения для VL, 374 файла (архивом) |
Код — MIT. Задачи, эталоны и оценки судьи — CC BY 4.0, со ссылкой на репозиторий. Подробнее в LICENSE.