AIhoster
Опубликованные результаты

Бенчмарки моделей

Независимые рейтинги по разным задачам. Оценки не объединяются в искусственный общий балл: методики, наборы данных и условия запуска у каждого бенчмарка различаются.

Как читать результатыAIhoster ничего не пересчитывает: данные берутся из публичных таблиц авторов бенчмарков. Сопоставление выполняется только по точному ID репозитория. Балл одной ревизии или режима запуска может не описывать другие версии модели. Обновлено: 02.10.2026 20:03.

MMLU-Pro

Сложные вопросы по разным областям знаний.

точностьбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1FINAL-Bench/Darwin-180B-RSI180 млрд параметровMMLU-Pro test, all 12,032 items; single sample (temperature=1.0, top_p=0.95, top_k=20); thinking budget 131,072 tokens; bf1688,1%Model Card ↗
2MiniMaxAI/MiniMax-M2.1229 млрд параметров88%EvalEval ↗
3internlm/Intern-S2-Preview36,1 млрд параметров88%Model Card ↗
4Qwen/Qwen3.5-397B-A17B403 млрд параметров87,8%Model Card ↗
5deepseek-ai/DeepSeek-V4-Pro1,6 трлн параметров87,5%Model Card ↗
6moonshotai/Kimi-K2.51 трлн параметров87,1%Model Card ↗
7nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16561 млрд параметров86,8%Model Card ↗
8nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4303 млрд параметров86,8%Model Card ↗
9Qwen/Qwen3.5-122B-A10B125 млрд параметров86,7%EvalEval ↗
10deepseek-ai/DeepSeek-V4-Flash291 млрд параметров86,4%Model Card ↗
11Qwen/Qwen3.6-27B27,8 млрд параметров86,2%Model Card ↗
12upstage/Solar-Open2-250B250 млрд параметров86,2%Model Card ↗
13Qwen/Qwen3.5-27B27,8 млрд параметров86,1%EvalEval ↗
14zai-org/GLM-5754 млрд параметров86%EvalEval ↗
15Qwen/Qwen3.6-35B-A3B36 млрд параметров85,2%Model Card ↗
16deepseek-ai/DeepSeek-R1-0528685 млрд параметров85%Model Card ↗
17zai-org/GLM-4.5358 млрд параметров84,6%EvalEval ↗
18stepfun-ai/Step-3.5-Flash199 млрд параметров84,4%Step 3.5 Flash Paper ↗
19deepseek-ai/DeepSeek-R1684 млрд параметров84%Model Card ↗
20LGAI-EXAONE/K-EXAONE-236B-A23B237 млрд параметров83,8%Model Card ↗

GPQA

Экспертные вопросы по физике, химии и биологии.

точностьбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1FINAL-Bench/Darwin-180B-RSI180 млрд параметровGPQA Diamond, all 198 items; majority vote over up to 16 samples (temperature=1.0, top_p=0.95, top_k=20); thinking budget 131,072 tokens; bf1694,4%Model Card ↗
2moonshotai/Kimi-K32,8 трлн параметров93,5%Model Card ↗
3FINAL-Bench/Darwin-397B-ZTC404 млрд параметровGPQA Diamond, all 198 items; greedy decoding (temperature=0), single sample (no voting / no test-time engine); weights released in FP8 (W8A8, compressed-tensors)93,4%Model Card ↗
4ornith-ai/Ornith-1.5-397B403 млрд параметров92,8%Ornith-1.5-397B model card ↗
5Qwen/Qwen3.8-2.4T-A95B2,4 трлн параметров92,6%Model Card ↗
6tencent/Hy4-preview780 млрд параметров92,3%Model Card ↗
7Qwen/Qwen3.8-Flash-Next180 млрд параметров91,7%Qwen3.8-Flash-Next model card ↗
8zai-org/GLM-5.2753 млрд параметров91,2%Model Card ↗
9FINAL-Bench/Darwin-398B-JGOS403 млрд параметровgreedy decoding (temperature=0), single-sample (no voting / no test-time engine), max_tokens=16384, options shuffled seed=42; hardware: NVIDIA B200 x6 (TP2 x PP3), vLLM bfloat1690,9%Model Card ↗
10deepseek-ai/DeepSeek-V4.1-Flash763 млрд параметров90,9%DeepSeek-V4.1-Flash model card ↗
11moonshotai/Kimi-K2.61 трлн параметров90,5%Model Card ↗
12tencent/Hy3299 млрд параметров90,4%Model Card ↗
13deepseek-ai/DeepSeek-V4-Pro1,6 трлн параметров90,1%Model Card ↗
14thinkingmachines/Inkling-Small266 млрд параметров89,5%Model Card ↗
15FINAL-Bench/Darwin-28B-REASON26,9 млрд параметровDarwin-DELPHI test-time engine, Pass@189,4%Model Card ↗
16Qwen/Qwen3.8-27B27,8 млрд параметров89,2%Qwen3.8-27B model card ↗
17ornith-ai/Ornith-1.5-35B-A3B36 млрд параметров89,2%Ornith-1.5-35B-A3B model card ↗
18Qwen/Qwen3.5-397B-A17B403 млрд параметров88,4%Model Card ↗
19FINAL-Bench/Darwin-36B-Opus34,7 млрд параметровStandard inference, Pass@188,4%Model Card ↗
20FINAL-Bench/Darwin-60B-DUODELPHI cascade system, Pass@188,4%Model Card ↗

GSM8K

Многошаговые текстовые задачи школьного уровня.

точностьбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1XiaomiMiMo/MiMo-V2.5-Pro1 трлн параметров99,6%Model Card ↗
2meta-llama/Llama-3.1-405B406 млрд параметров8-shot CoT96,8%Model Card ↗
3ibm-granite/granite-4.1-30b28,9 млрд параметров94,2%Model Card ↗
4meta-llama/Llama-3.2-90B-Vision-Instruct88,6 млрд параметров93,1%EvalEval ↗
5deepseek-ai/DeepSeek-V4-Pro1,6 трлн параметров92,6%Model Card ↗
6ibm-granite/granite-4.1-8b8,8 млрд параметров92,5%Model Card ↗
7microsoft/Phi-3-medium-4k-instruct14 млрд параметров8-shot CoT91%Model Card ↗
8Qwen/Qwen2-72B72,7 млрд параметров89,5%Model Card ↗
9deepseek-ai/DeepSeek-V3685 млрд параметров89,3%Model Card ↗
10ibm-granite/granite-4.1-3b3,4 млрд параметров86,9%Model Card ↗
11microsoft/Phi-3.5-mini-instruct3,8 млрд параметров86,2%Phi-3 Technical Report ↗
12internlm/internlm2_5-7b-chat7,7 млрд параметров0-shot CoT86%Model Card ↗
13microsoft/Phi-3-mini-4k-instruct3,8 млрд параметров8-shot CoT85,7%Model Card ↗
14JetBrains/Mellum2-12B-A2.5B-Base-Pretrain12,1 млрд параметровpre-training eval, no-tools, exact match81,7%Первичный результат ↗
15JetBrains/Mellum2-12B-A2.5B-Base12,1 млрд параметровpre-training eval (pre-YaRN), no-tools, exact match81,7%Первичный результат ↗
16Qwen/Qwen2-7B7,6 млрд параметров4-shot79,9%Model Card ↗
17internlm/internlm2-chat-20b19,9 млрд параметров79,6%Model Card ↗
18deepseek-ai/DeepSeek-V2236 млрд параметров79,2%Model Card ↗

MTEB · ArguAna

Поиск наиболее подходящего контраргумента.

nDCG@10больше — лучше · методика ↗
МестоМодельРезультатИсточник
1google/embeddinggemma-300m303 млн параметровObtained using MTEB v1.34.771,5%Obtained using MTEB v1.34.7 ↗
2mteb/baseline-bm25sObtained using MTEB v1.12.2249,3%Obtained using MTEB v1.12.22 ↗
3Surpem/Supertron-embedding-190M130 млн параметровOfficial mteb/arguana retrieval task. Metric: nDCG@10.42,0%Supetron Modal benchmark run ↗

Open ASR Leaderboard

Качество автоматического распознавания речи.

WERменьше — лучше · методика ↗
МестоМодельРезультатИсточник
1Edge0/ARK-ASR-3B4,1 млрд параметров4,76%open-asr-leaderboard ↗
2OpenMOSS-Team/MOSS-Transcribe-preview-2B2,4 млрд параметров4,87%open-asr-leaderboard ↗
3OpenMOSS-Team/MOSS-Transcribe-Diarize909 млн параметров5,17%open-asr-leaderboard ↗
4moondream/parakeet-ultra627 млн параметров5,32%moondream ↗
5CohereLabs/cohere-transcribe-03-20262,1 млрд параметров5,42%open-asr-leaderboard ↗
6Edge0/ARK-ASR-0.6B1,3 млрд параметров5,53%open-asr-leaderboard ↗
7soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M5,56%open-asr-leaderboard ↗
8Qwen/Qwen3-ASR-1.7B2,3 млрд параметров5,76%open-asr-leaderboard ↗
9microsoft/Phi-4-multimodal-instruct5,6 млрд параметров6,02%open-asr-leaderboard ↗
10nvidia/parakeet-tdt-0.6b-v26,05%open-asr-leaderboard ↗
11moondream/parakeet-redux149 млн параметров6,05%moondream ↗
12nvidia/canary-1b-flash811 млн параметров6,35%open-asr-leaderboard ↗
13kyutai/stt-2.6b-en2,6 млрд параметров6,40%open-asr-leaderboard ↗
14Qwen/Qwen3-ASR-0.6B938 млн параметров6,42%open-asr-leaderboard ↗
15nvidia/canary-1b6,50%open-asr-leaderboard ↗
16moonshine-ai/moonshine-streaming-medium266 млн параметров6,66%open-asr-leaderboard ↗
17soundsgoodai/Zipformer-transducer-XL-290M6,71%open-asr-leaderboard ↗
18nvidia/parakeet-tdt-1.1b7,01%open-asr-leaderboard ↗
19zai-org/GLM-ASR-Nano-25122,3 млрд параметров7,03%open-asr-leaderboard ↗
20Edge0/Audio8-ASR-0.1B324 млн параметров7,03%open-asr-leaderboard ↗

olmOCR-bench

Преобразование PDF-документов в структурированный текст.

итоговый баллбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1infly/Infinity-Parser2-Pro35,1 млрд параметров87,6Infinity Parser technical report ↗
2datalab-to/chandra-ocr-25,3 млрд параметров85,8Chandra OCR 2 Model Card ↗
3dots-studio/dots.mocr3 млрд параметров83,9dots.mocr technical report ↗
4jinaai/jina-ocr-v13,4 млрд параметров83,4Jina-OCR-v1 technical report ↗
5datalab-to/surya-ocr-2686 млн параметров83,3Surya OCR 2 Model Card ↗
6onnx-community/Surya-Ocr-2-Onnx83,3Surya OCR 2 Model Card ↗
7lightonai/LightOnOCR-2-1B1 млрд параметровH&F rewards omission, not transcription thus a model that outputs nothing scores perfectly. Excluded to keep Overall focused on real OCR quality.83,2LightOnOCR technical report ↗
8datalab-to/chandra8,8 млрд параметров83,1OlmOCR-Bench Github repository ↗
9infly/Infinity-Parser-7B8,3 млрд параметров82,5Infinity Parser technical report ↗
10tiiuae/Falcon-OCR270 млн параметровEnglish-subset only80,3Falcon-OCR Model Card ↗
11baidu/Qianfan-OCR4,7 млрд параметров79,8Qianfan-OCR technical report ↗
12dots-studio/dots.ocr3 млрд параметров79,1dots.ocr technical report ↗
13deepseek-ai/DeepSeek-OCR-23,4 млрд параметров76,3Tweet by @staghado ↗
14lightonai/LightOnOCR-1B-10251,2 млрд параметровExcluding Headers & Footers category76,1LightOnOCR technical report ↗
15deepseek-ai/DeepSeek-OCR3,3 млрд параметров75,7OlmOCR-Bench Github repository ↗
16opendatalab/MinerU2.5-2509-1.2B1,2 млрд параметров75,2MinerU2.5 technical report ↗
17zai-org/GLM-OCR1,3 млрд параметровExcluding Headers & Footers category. Using ZAI API.75,2GLM-OCR API evaluation ↗
18small-models-for-glam/kraken-ppocrv6-mediumKraken BLLA segmentation + PP-OCRv6 medium; full 1,403 pages at 300 DPI; raw newline-joined text; no table reconstruction, LaTeX generation or header suppression. Official scorer; pipeline test pass rate, not CER. Macro-average including automatic baseline; 95% bootstrap CI 35.9-37.7%.36,8Reproducible Kraken olmOCR-bench run ↗

MERA Text

Российский лидерборд для оценки русскоязычных языковых моделей.

итоговый баллбольше — лучше · методика ↗

Источник временно не вернул результатов.

VibeCoding 1C

Публичный рейтинг моделей на задачах генерации кода и запросов для 1С.

средний баллбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1Claude Opus 5.5 ↗Anthropic23 оценок · V29,04/10Карточка в рейтинге 1С ↗
2Grok 4.7 ↗xAI34 оценок · V28,85/10Карточка в рейтинге 1С ↗
3Claude Sonnet 5.5 ↗Anthropic11 оценок · V28,73/10Карточка в рейтинге 1С ↗
4Claude Opus 5 ↗Anthropic34 оценок · V28,71/10Карточка в рейтинге 1С ↗
5GPT 6.1 Sol ↗OpenAI14 оценок · V28,57/10Карточка в рейтинге 1С ↗
6GPT 5.6 Sol ↗OpenAI28 оценок · V28,50/10Карточка в рейтинге 1С ↗
7Kimi K3 ↗Moonshot AI29 оценок · V28,21/10Карточка в рейтинге 1С ↗
8GPT 6 Astra ↗OpenAI25 оценок · V28,20/10Карточка в рейтинге 1С ↗
9Grok 4.5 ↗xAI25 оценок · V27,92/10Карточка в рейтинге 1С ↗
10DeepSeek V4.1 Flash ↗DeepSeek25 оценок · V27,72/10Карточка в рейтинге 1С ↗
11Claude Opus 4.8 ↗Anthropic24 оценок · V27,58/10Карточка в рейтинге 1С ↗
12Claude Fable 5.1 ↗Anthropic34 оценок · V27,56/10Карточка в рейтинге 1С ↗
13Grok 4.6 ↗xAI / Cursor13 оценок · V27,54/10Карточка в рейтинге 1С ↗
14Composer 2.5 ↗Cursor28 оценок · V27,54/10Карточка в рейтинге 1С ↗
15Gemini 3.8 Flash ↗Google / Cursor34 оценок · V27,50/10Карточка в рейтинге 1С ↗
16GPT 5.5 ↗OpenAI24 оценок · V27,50/10Карточка в рейтинге 1С ↗
17Claude Fable 5 ↗Anthropic31 оценок · V27,39/10Карточка в рейтинге 1С ↗
18DeepSeek V4 Pro 0813 ↗DeepSeek30 оценок · V27,17/10Карточка в рейтинге 1С ↗
19GPT 6 Luna ↗OpenAI17 оценок · V27,12/10Карточка в рейтинге 1С ↗
20GPT 5.6 Terra ↗OpenAI34 оценок · V26,91/10Карточка в рейтинге 1С ↗