Опубликованные результаты
Бенчмарки моделей
Независимые рейтинги по разным задачам. Оценки не объединяются в искусственный общий балл: методики, наборы данных и условия запуска у каждого бенчмарка различаются.
Как читать результатыAIhoster ничего не пересчитывает: данные берутся из публичных таблиц авторов бенчмарков. Сопоставление выполняется только по точному ID репозитория. Балл одной ревизии или режима запуска может не описывать другие версии модели. Обновлено: 02.10.2026 20:03.
MMLU-Pro
Сложные вопросы по разным областям знаний.
GPQA
Экспертные вопросы по физике, химии и биологии.
| Место | Модель | Результат | Источник |
|---|---|---|---|
| 1 | FINAL-Bench/Darwin-180B-RSI180 млрд параметровGPQA Diamond, all 198 items; majority vote over up to 16 samples (temperature=1.0, top_p=0.95, top_k=20); thinking budget 131,072 tokens; bf16 | 94,4% | Model Card ↗ |
| 2 | moonshotai/Kimi-K32,8 трлн параметров | 93,5% | Model Card ↗ |
| 3 | FINAL-Bench/Darwin-397B-ZTC404 млрд параметровGPQA Diamond, all 198 items; greedy decoding (temperature=0), single sample (no voting / no test-time engine); weights released in FP8 (W8A8, compressed-tensors) | 93,4% | Model Card ↗ |
| 4 | ornith-ai/Ornith-1.5-397B403 млрд параметров | 92,8% | Ornith-1.5-397B model card ↗ |
| 5 | Qwen/Qwen3.8-2.4T-A95B2,4 трлн параметров | 92,6% | Model Card ↗ |
| 6 | tencent/Hy4-preview780 млрд параметров | 92,3% | Model Card ↗ |
| 7 | Qwen/Qwen3.8-Flash-Next180 млрд параметров | 91,7% | Qwen3.8-Flash-Next model card ↗ |
| 8 | zai-org/GLM-5.2753 млрд параметров | 91,2% | Model Card ↗ |
| 9 | FINAL-Bench/Darwin-398B-JGOS403 млрд параметровgreedy decoding (temperature=0), single-sample (no voting / no test-time engine), max_tokens=16384, options shuffled seed=42; hardware: NVIDIA B200 x6 (TP2 x PP3), vLLM bfloat16 | 90,9% | Model Card ↗ |
| 10 | deepseek-ai/DeepSeek-V4.1-Flash763 млрд параметров | 90,9% | DeepSeek-V4.1-Flash model card ↗ |
| 11 | moonshotai/Kimi-K2.61 трлн параметров | 90,5% | Model Card ↗ |
| 12 | tencent/Hy3299 млрд параметров | 90,4% | Model Card ↗ |
| 13 | deepseek-ai/DeepSeek-V4-Pro1,6 трлн параметров | 90,1% | Model Card ↗ |
| 14 | thinkingmachines/Inkling-Small266 млрд параметров | 89,5% | Model Card ↗ |
| 15 | FINAL-Bench/Darwin-28B-REASON26,9 млрд параметровDarwin-DELPHI test-time engine, Pass@1 | 89,4% | Model Card ↗ |
| 16 | Qwen/Qwen3.8-27B27,8 млрд параметров | 89,2% | Qwen3.8-27B model card ↗ |
| 17 | ornith-ai/Ornith-1.5-35B-A3B36 млрд параметров | 89,2% | Ornith-1.5-35B-A3B model card ↗ |
| 18 | Qwen/Qwen3.5-397B-A17B403 млрд параметров | 88,4% | Model Card ↗ |
| 19 | FINAL-Bench/Darwin-36B-Opus34,7 млрд параметровStandard inference, Pass@1 | 88,4% | Model Card ↗ |
| 20 | FINAL-Bench/Darwin-60B-DUODELPHI cascade system, Pass@1 | 88,4% | Model Card ↗ |
GSM8K
Многошаговые текстовые задачи школьного уровня.
MTEB · ArguAna
Поиск наиболее подходящего контраргумента.
| Место | Модель | Результат | Источник |
|---|---|---|---|
| 1 | google/embeddinggemma-300m303 млн параметровObtained using MTEB v1.34.7 | 71,5% | Obtained using MTEB v1.34.7 ↗ |
| 2 | mteb/baseline-bm25sObtained using MTEB v1.12.22 | 49,3% | Obtained using MTEB v1.12.22 ↗ |
| 3 | Surpem/Supertron-embedding-190M130 млн параметровOfficial mteb/arguana retrieval task. Metric: nDCG@10. | 42,0% | Supetron Modal benchmark run ↗ |
Open ASR Leaderboard
Качество автоматического распознавания речи.
olmOCR-bench
Преобразование PDF-документов в структурированный текст.
| Место | Модель | Результат | Источник |
|---|---|---|---|
| 1 | infly/Infinity-Parser2-Pro35,1 млрд параметров | 87,6 | Infinity Parser technical report ↗ |
| 2 | datalab-to/chandra-ocr-25,3 млрд параметров | 85,8 | Chandra OCR 2 Model Card ↗ |
| 3 | dots-studio/dots.mocr3 млрд параметров | 83,9 | dots.mocr technical report ↗ |
| 4 | jinaai/jina-ocr-v13,4 млрд параметров | 83,4 | Jina-OCR-v1 technical report ↗ |
| 5 | datalab-to/surya-ocr-2686 млн параметров | 83,3 | Surya OCR 2 Model Card ↗ |
| 6 | onnx-community/Surya-Ocr-2-Onnx | 83,3 | Surya OCR 2 Model Card ↗ |
| 7 | lightonai/LightOnOCR-2-1B1 млрд параметровH&F rewards omission, not transcription thus a model that outputs nothing scores perfectly. Excluded to keep Overall focused on real OCR quality. | 83,2 | LightOnOCR technical report ↗ |
| 8 | datalab-to/chandra8,8 млрд параметров | 83,1 | OlmOCR-Bench Github repository ↗ |
| 9 | infly/Infinity-Parser-7B8,3 млрд параметров | 82,5 | Infinity Parser technical report ↗ |
| 10 | tiiuae/Falcon-OCR270 млн параметровEnglish-subset only | 80,3 | Falcon-OCR Model Card ↗ |
| 11 | baidu/Qianfan-OCR4,7 млрд параметров | 79,8 | Qianfan-OCR technical report ↗ |
| 12 | dots-studio/dots.ocr3 млрд параметров | 79,1 | dots.ocr technical report ↗ |
| 13 | deepseek-ai/DeepSeek-OCR-23,4 млрд параметров | 76,3 | Tweet by @staghado ↗ |
| 14 | lightonai/LightOnOCR-1B-10251,2 млрд параметровExcluding Headers & Footers category | 76,1 | LightOnOCR technical report ↗ |
| 15 | deepseek-ai/DeepSeek-OCR3,3 млрд параметров | 75,7 | OlmOCR-Bench Github repository ↗ |
| 16 | opendatalab/MinerU2.5-2509-1.2B1,2 млрд параметров | 75,2 | MinerU2.5 technical report ↗ |
| 17 | zai-org/GLM-OCR1,3 млрд параметровExcluding Headers & Footers category. Using ZAI API. | 75,2 | GLM-OCR API evaluation ↗ |
| 18 | small-models-for-glam/kraken-ppocrv6-mediumKraken BLLA segmentation + PP-OCRv6 medium; full 1,403 pages at 300 DPI; raw newline-joined text; no table reconstruction, LaTeX generation or header suppression. Official scorer; pipeline test pass rate, not CER. Macro-average including automatic baseline; 95% bootstrap CI 35.9-37.7%. | 36,8 | Reproducible Kraken olmOCR-bench run ↗ |
MERA Text
Российский лидерборд для оценки русскоязычных языковых моделей.
Источник временно не вернул результатов.
VibeCoding 1C
Публичный рейтинг моделей на задачах генерации кода и запросов для 1С.