Опубликованные результаты
Бенчмарки моделей
Независимые рейтинги по разным задачам. Оценки не объединяются в искусственный общий балл: методики, наборы данных и условия запуска у каждого бенчмарка различаются.
Как читать результатыAIhoster ничего не пересчитывает: данные берутся из публичных таблиц авторов бенчмарков. Сопоставление выполняется только по точному ID репозитория. Балл одной ревизии или режима запуска может не описывать другие версии модели. Обновлено: 18.08.2026 10:54.
MMLU-Pro
Сложные вопросы по разным областям знаний.
GPQA
Экспертные вопросы по физике, химии и биологии.
| Место | Модель | Результат | Источник |
|---|---|---|---|
| 1 | moonshotai/Kimi-K32,8 трлн параметров | 93,5% | Model Card ↗ |
| 2 | Qwen/Qwen3.8-2.4T-A95B2,4 трлн параметров | 92,6% | Model Card ↗ |
| 3 | zai-org/GLM-5.2753 млрд параметров | 91,2% | Model Card ↗ |
| 4 | RedHatAI/GLM-5.2-MXFP4xMXFP8753 млрд параметров | 91,2% | Model Card ↗ |
| 5 | FINAL-Bench/Darwin-398B-JGOS403 млрд параметровgreedy decoding (temperature=0), single-sample (no voting / no test-time engine), max_tokens=16384, options shuffled seed=42; hardware: NVIDIA B200 x6 (TP2 x PP3), vLLM bfloat16 | 90,9% | Model Card ↗ |
| 6 | moonshotai/Kimi-K2.61 трлн параметров | 90,5% | Model Card ↗ |
| 7 | INCModel/Kimi-K2.6-MXFP4-CT-AutoRound1 трлн параметров | 90,5% | Model Card ↗ |
| 8 | tencent/Hy3299 млрд параметров | 90,4% | Model Card ↗ |
| 9 | deepseek-ai/DeepSeek-V4-Pro1,6 трлн параметров | 90,1% | Model Card ↗ |
| 10 | thinkingmachines/Inkling-Small266 млрд параметров | 89,5% | Model Card ↗ |
| 11 | FINAL-Bench/Darwin-28B-REASON26,9 млрд параметровDarwin-DELPHI test-time engine, Pass@1 | 89,4% | Model Card ↗ |
| 12 | Qwen/Qwen3.8-27B27,8 млрд параметров | 89,2% | Qwen3.8-27B model card ↗ |
| 13 | Qwen/Qwen3.5-397B-A17B403 млрд параметров | 88,4% | Model Card ↗ |
| 14 | FINAL-Bench/Darwin-36B-Opus34,7 млрд параметровStandard inference, Pass@1 | 88,4% | Model Card ↗ |
| 15 | FINAL-Bench/Darwin-60B-DUODELPHI cascade system, Pass@1 | 88,4% | Model Card ↗ |
| 16 | inclusionAI/Ring-2.6-1T1 трлн параметровxhigh reasoning effort, Pass@1 | 88,3% | Model Card ↗ |
| 17 | deepseek-ai/DeepSeek-V4-Flash291 млрд параметров | 88,1% | Model Card ↗ |
| 18 | nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4335 млрд параметровNo tools | 87,9% | Model Card ↗ |
| 19 | zai-org/GLM-4.7-FP8358 млрд параметровGPQA Diamond | 87,9% | EvalEval ↗ |
| 20 | Qwen/Qwen3.6-27B27,8 млрд параметров | 87,8% | Model Card ↗ |
GSM8K
Многошаговые текстовые задачи школьного уровня.
MTEB · ArguAna
Поиск наиболее подходящего контраргумента.
| Место | Модель | Результат | Источник |
|---|---|---|---|
| 1 | google/embeddinggemma-300m303 млн параметровObtained using MTEB v1.34.7 | 71,5% | Obtained using MTEB v1.34.7 ↗ |
| 2 | mteb/baseline-bm25sObtained using MTEB v1.12.22 | 49,3% | Obtained using MTEB v1.12.22 ↗ |
| 3 | Surpem/Supertron-embedding-190M130 млн параметровOfficial mteb/arguana retrieval task. Metric: nDCG@10. | 42,0% | Supetron Modal benchmark run ↗ |
Open ASR Leaderboard
Качество автоматического распознавания речи.
olmOCR-bench
Преобразование PDF-документов в структурированный текст.
MERA Text
Российский лидерборд для оценки русскоязычных языковых моделей.
| Место | Модель | Результат | Источник |
|---|---|---|---|
| 1 | Claude-Opus-4.6 ↗MERAclosed, api, sft | 86,2% | Карточка сабмита MERA ↗ |
| 2 | Human Benchmark ↗MERAclosed, api, opened, pretrain, sft, moe | 85,2% | Карточка сабмита MERA ↗ |
| 3 | BerryLM-XLWildberries & Russ358 млрд параметровclosed, sft, moe | 83,5% | Карточка сабмита MERA ↗ |
| 4 | Cotype Pro 3 ↗MWS AI27 млрд параметровclosed, sft | 82,4% | Карточка сабмита MERA ↗ |
| 5 | BerryLM-L-v2-early-ckptWildberrie&Russ120 параметровclosed, sft, moe | 82,2% | Карточка сабмита MERA ↗ |
| 6 | GPT-5.4 ↗MERAclosed | 82,1% | Карточка сабмита MERA ↗ |
| 7 | BerryLM-v2-reasoning-budget-lowWildberries & Russ30 млрд параметровclosed, api, sft, moe | 81% | Карточка сабмита MERA ↗ |
| 8 | GLM-5.1 ↗MERA754 млрд параметровapi, opened, sft, moe | 80,4% | Карточка сабмита MERA ↗ |
| 9 | Qwen3-235B-A22B-Thinking-2507MERA235 млрд параметровopened, sft, moe | 79,5% | Карточка сабмита MERA ↗ |
| 10 | Cotype Light 3 ↗MWS AI9 млрд параметровclosed, sft | 79,2% | Карточка сабмита MERA ↗ |
VibeCoding 1C
Публичный рейтинг моделей на задачах генерации кода и запросов для 1С.