AIhoster
Опубликованные результаты

Бенчмарки моделей

Независимые рейтинги по разным задачам. Оценки не объединяются в искусственный общий балл: методики, наборы данных и условия запуска у каждого бенчмарка различаются.

Как читать результатыAIhoster ничего не пересчитывает: данные берутся из публичных таблиц авторов бенчмарков. Сопоставление выполняется только по точному ID репозитория. Балл одной ревизии или режима запуска может не описывать другие версии модели. Обновлено: 18.08.2026 10:54.

MMLU-Pro

Сложные вопросы по разным областям знаний.

точностьбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1MiniMaxAI/MiniMax-M2.1229 млрд параметров88%EvalEval ↗
2internlm/Intern-S2-Preview36,1 млрд параметров88%Model Card ↗
3Qwen/Qwen3.5-397B-A17B403 млрд параметров87,8%Model Card ↗
4deepseek-ai/DeepSeek-V4-Pro1,6 трлн параметров87,5%Model Card ↗
5moonshotai/Kimi-K2.51 трлн параметров87,1%Model Card ↗
6nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16561 млрд параметров86,8%Model Card ↗
7nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4335 млрд параметров86,8%Model Card ↗
8Qwen/Qwen3.5-122B-A10B125 млрд параметров86,7%EvalEval ↗
9deepseek-ai/DeepSeek-V4-Flash291 млрд параметров86,4%Model Card ↗
10Qwen/Qwen3.6-27B27,8 млрд параметров86,2%Model Card ↗
11upstage/Solar-Open2-250B250 млрд параметров86,2%Model Card ↗
12Qwen/Qwen3.5-27B27,8 млрд параметров86,1%EvalEval ↗
13zai-org/GLM-5754 млрд параметров86%EvalEval ↗
14Qwen/Qwen3.6-35B-A3B36 млрд параметров85,2%Model Card ↗
15deepseek-ai/DeepSeek-R1-0528685 млрд параметров85%Model Card ↗
16zai-org/GLM-4.5358 млрд параметров84,6%EvalEval ↗
17stepfun-ai/Step-3.5-Flash199 млрд параметров84,4%Step 3.5 Flash Paper ↗
18deepseek-ai/DeepSeek-R1685 млрд параметров84%Model Card ↗
19LGAI-EXAONE/K-EXAONE-236B-A23B237 млрд параметров83,8%Model Card ↗
20nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16124 млрд параметров83,7%Model Card ↗

GPQA

Экспертные вопросы по физике, химии и биологии.

точностьбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1moonshotai/Kimi-K32,8 трлн параметров93,5%Model Card ↗
2Qwen/Qwen3.8-2.4T-A95B2,4 трлн параметров92,6%Model Card ↗
3zai-org/GLM-5.2753 млрд параметров91,2%Model Card ↗
4RedHatAI/GLM-5.2-MXFP4xMXFP8753 млрд параметров91,2%Model Card ↗
5FINAL-Bench/Darwin-398B-JGOS403 млрд параметровgreedy decoding (temperature=0), single-sample (no voting / no test-time engine), max_tokens=16384, options shuffled seed=42; hardware: NVIDIA B200 x6 (TP2 x PP3), vLLM bfloat1690,9%Model Card ↗
6moonshotai/Kimi-K2.61 трлн параметров90,5%Model Card ↗
7INCModel/Kimi-K2.6-MXFP4-CT-AutoRound1 трлн параметров90,5%Model Card ↗
8tencent/Hy3299 млрд параметров90,4%Model Card ↗
9deepseek-ai/DeepSeek-V4-Pro1,6 трлн параметров90,1%Model Card ↗
10thinkingmachines/Inkling-Small266 млрд параметров89,5%Model Card ↗
11FINAL-Bench/Darwin-28B-REASON26,9 млрд параметровDarwin-DELPHI test-time engine, Pass@189,4%Model Card ↗
12Qwen/Qwen3.8-27B27,8 млрд параметров89,2%Qwen3.8-27B model card ↗
13Qwen/Qwen3.5-397B-A17B403 млрд параметров88,4%Model Card ↗
14FINAL-Bench/Darwin-36B-Opus34,7 млрд параметровStandard inference, Pass@188,4%Model Card ↗
15FINAL-Bench/Darwin-60B-DUODELPHI cascade system, Pass@188,4%Model Card ↗
16inclusionAI/Ring-2.6-1T1 трлн параметровxhigh reasoning effort, Pass@188,3%Model Card ↗
17deepseek-ai/DeepSeek-V4-Flash291 млрд параметров88,1%Model Card ↗
18nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4335 млрд параметровNo tools87,9%Model Card ↗
19zai-org/GLM-4.7-FP8358 млрд параметровGPQA Diamond87,9%EvalEval ↗
20Qwen/Qwen3.6-27B27,8 млрд параметров87,8%Model Card ↗

GSM8K

Многошаговые текстовые задачи школьного уровня.

точностьбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1XiaomiMiMo/MiMo-V2.5-Pro1 трлн параметров99,6%Model Card ↗
2meta-llama/Llama-3.1-405B406 млрд параметров8-shot CoT96,8%Model Card ↗
3ibm-granite/granite-4.1-30b28,9 млрд параметров94,2%Model Card ↗
4meta-llama/Llama-3.2-90B-Vision-Instruct88,6 млрд параметров93,1%EvalEval ↗
5deepseek-ai/DeepSeek-V4-Pro1,6 трлн параметров92,6%Model Card ↗
6ibm-granite/granite-4.1-8b8,8 млрд параметров92,5%Model Card ↗
7microsoft/Phi-3-medium-4k-instruct14 млрд параметров8-shot CoT91%Model Card ↗
8Qwen/Qwen2-72B72,7 млрд параметров89,5%Model Card ↗
9deepseek-ai/DeepSeek-V3685 млрд параметров89,3%Model Card ↗
10ibm-granite/granite-4.1-3b3,4 млрд параметров86,9%Model Card ↗
11microsoft/Phi-3.5-mini-instruct3,8 млрд параметров86,2%Phi-3 Technical Report ↗
12internlm/internlm2_5-7b-chat7,7 млрд параметров0-shot CoT86%Model Card ↗
13microsoft/Phi-3-mini-4k-instruct3,8 млрд параметров8-shot CoT85,7%Model Card ↗
14JetBrains/Mellum2-12B-A2.5B-Base-Pretrain12,1 млрд параметровpre-training eval, no-tools, exact match81,7%Первичный результат ↗
15JetBrains/Mellum2-12B-A2.5B-Base12,1 млрд параметровpre-training eval (pre-YaRN), no-tools, exact match81,7%Первичный результат ↗
16Qwen/Qwen2-7B7,6 млрд параметров4-shot79,9%Model Card ↗
17internlm/internlm2-chat-20b19,9 млрд параметров79,6%Model Card ↗
18deepseek-ai/DeepSeek-V2236 млрд параметров79,2%Model Card ↗

MTEB · ArguAna

Поиск наиболее подходящего контраргумента.

nDCG@10больше — лучше · методика ↗
МестоМодельРезультатИсточник
1google/embeddinggemma-300m303 млн параметровObtained using MTEB v1.34.771,5%Obtained using MTEB v1.34.7 ↗
2mteb/baseline-bm25sObtained using MTEB v1.12.2249,3%Obtained using MTEB v1.12.22 ↗
3Surpem/Supertron-embedding-190M130 млн параметровOfficial mteb/arguana retrieval task. Metric: nDCG@10.42,0%Supetron Modal benchmark run ↗

Open ASR Leaderboard

Качество автоматического распознавания речи.

WERменьше — лучше · методика ↗
МестоМодельРезультатИсточник
1Audio8/ARK-ASR-3B4,1 млрд параметров4,76%open-asr-leaderboard ↗
2OpenMOSS-Team/MOSS-Transcribe-preview-2B2,4 млрд параметров4,87%open-asr-leaderboard ↗
3OpenMOSS-Team/MOSS-Transcribe-Diarize909 млн параметров5,17%open-asr-leaderboard ↗
4CohereLabs/cohere-transcribe-03-20262,1 млрд параметров5,42%open-asr-leaderboard ↗
5Audio8/ARK-ASR-0.6B1,3 млрд параметров5,53%open-asr-leaderboard ↗
6soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M5,56%open-asr-leaderboard ↗
7Qwen/Qwen3-ASR-1.7B2,3 млрд параметров5,76%open-asr-leaderboard ↗
8microsoft/Phi-4-multimodal-instruct5,6 млрд параметров6,02%open-asr-leaderboard ↗
9nvidia/parakeet-tdt-0.6b-v26,05%open-asr-leaderboard ↗
10nvidia/canary-1b-flash811 млн параметров6,35%open-asr-leaderboard ↗
11kyutai/stt-2.6b-en2,6 млрд параметров6,40%open-asr-leaderboard ↗
12Qwen/Qwen3-ASR-0.6B938 млн параметров6,42%open-asr-leaderboard ↗
13nvidia/canary-1b6,50%open-asr-leaderboard ↗
14moonshine-ai/moonshine-streaming-medium266 млн параметров6,66%open-asr-leaderboard ↗
15soundsgoodai/Zipformer-transducer-XL-290M6,71%open-asr-leaderboard ↗
16nvidia/parakeet-tdt-1.1b7,01%open-asr-leaderboard ↗
17zai-org/GLM-ASR-Nano-25122,3 млрд параметров7,03%open-asr-leaderboard ↗
18Audio8/Audio8-ASR-0.1B324 млн параметров7,03%open-asr-leaderboard ↗
19mistralai/Voxtral-Mini-3B-25074,7 млрд параметров7,05%open-asr-leaderboard ↗
20nvidia/canary-180m-flash7,12%open-asr-leaderboard ↗

olmOCR-bench

Преобразование PDF-документов в структурированный текст.

итоговый баллбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1infly/Infinity-Parser2-Pro35,1 млрд параметров87,6Infinity Parser technical report ↗
2datalab-to/chandra-ocr-25,3 млрд параметров85,8Chandra OCR 2 Model Card ↗
3dots-studio/dots.mocr3 млрд параметров83,9dots.mocr technical report ↗
4datalab-to/surya-ocr-2686 млн параметров83,3Surya OCR 2 Model Card ↗
5onnx-community/Surya-Ocr-2-Onnx83,3Surya OCR 2 Model Card ↗
6lightonai/LightOnOCR-2-1B1 млрд параметровH&F rewards omission, not transcription thus a model that outputs nothing scores perfectly. Excluded to keep Overall focused on real OCR quality.83,2LightOnOCR technical report ↗
7datalab-to/chandra8,8 млрд параметров83,1OlmOCR-Bench Github repository ↗
8infly/Infinity-Parser-7B8,3 млрд параметров82,5Infinity Parser technical report ↗
9tiiuae/Falcon-OCR270 млн параметровEnglish-subset only80,3Falcon-OCR Model Card ↗
10baidu/Qianfan-OCR4,7 млрд параметров79,8Qianfan-OCR technical report ↗
11dots-studio/dots.ocr3 млрд параметров79,1dots.ocr technical report ↗
12deepseek-ai/DeepSeek-OCR-23,4 млрд параметров76,3Tweet by @staghado ↗
13lightonai/LightOnOCR-1B-10251,2 млрд параметровExcluding Headers & Footers category76,1LightOnOCR technical report ↗
14deepseek-ai/DeepSeek-OCR3,3 млрд параметров75,7OlmOCR-Bench Github repository ↗
15opendatalab/MinerU2.5-2509-1.2B1,2 млрд параметров75,2MinerU2.5 technical report ↗
16zai-org/GLM-OCR1,3 млрд параметровExcluding Headers & Footers category. Using ZAI API.75,2GLM-OCR API evaluation ↗

MERA Text

Российский лидерборд для оценки русскоязычных языковых моделей.

итоговый баллбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1Claude-Opus-4.6 ↗MERAclosed, api, sft86,2%Карточка сабмита MERA ↗
2Human Benchmark ↗MERAclosed, api, opened, pretrain, sft, moe85,2%Карточка сабмита MERA ↗
3BerryLM-XLWildberries & Russ358 млрд параметровclosed, sft, moe83,5%Карточка сабмита MERA ↗
4Cotype Pro 3 ↗MWS AI27 млрд параметровclosed, sft82,4%Карточка сабмита MERA ↗
5BerryLM-L-v2-early-ckptWildberrie&Russ120 параметровclosed, sft, moe82,2%Карточка сабмита MERA ↗
6GPT-5.4 ↗MERAclosed82,1%Карточка сабмита MERA ↗
7BerryLM-v2-reasoning-budget-lowWildberries & Russ30 млрд параметровclosed, api, sft, moe81%Карточка сабмита MERA ↗
8GLM-5.1 ↗MERA754 млрд параметровapi, opened, sft, moe80,4%Карточка сабмита MERA ↗
9Qwen3-235B-A22B-Thinking-2507MERA235 млрд параметровopened, sft, moe79,5%Карточка сабмита MERA ↗
10Cotype Light 3 ↗MWS AI9 млрд параметровclosed, sft79,2%Карточка сабмита MERA ↗

VibeCoding 1C

Публичный рейтинг моделей на задачах генерации кода и запросов для 1С.

средний баллбольше — лучше · методика ↗
МестоМодельРезультатИсточник
1Claude Opus 5 ↗Anthropic34 оценок · V28,71/10Карточка в рейтинге 1С ↗
2Grok 4.6 ↗xAI / Cursor34 оценок · V28,21/10Карточка в рейтинге 1С ↗
3GPT 5.6 Sol ↗OpenAI34 оценок · V28,09/10Карточка в рейтинге 1С ↗
4Kimi K3 ↗Moonshot AI34 оценок · V28,00/10Карточка в рейтинге 1С ↗
5Claude Opus 4.8 ↗Anthropic34 оценок · V27,68/10Карточка в рейтинге 1С ↗
6Grok 4.5 ↗xAI34 оценок · V27,68/10Карточка в рейтинге 1С ↗
7GPT 5.5 ↗OpenAI34 оценок · V27,53/10Карточка в рейтинге 1С ↗
8Claude Fable 5 ↗Anthropic34 оценок · V27,41/10Карточка в рейтинге 1С ↗
9Composer 2.5 ↗Cursor34 оценок · V27,18/10Карточка в рейтинге 1С ↗
10GPT 5.6 Terra ↗OpenAI34 оценок · V26,91/10Карточка в рейтинге 1С ↗
11DeepSeek V4 Pro 0813 ↗DeepSeek34 оценок · V26,65/10Карточка в рейтинге 1С ↗
12Claude Sonnet 5 ↗Anthropic34 оценок · V26,62/10Карточка в рейтинге 1С ↗
13GPT 5.6 Luna ↗OpenAI34 оценок · V26,35/10Карточка в рейтинге 1С ↗
14GLM 5.2 ↗34 оценок · V25,97/10Карточка в рейтинге 1С ↗
15GLM 5.3 ↗Z.AI Coding Plan34 оценок · V25,74/10Карточка в рейтинге 1С ↗
16Qwen 3.8 Max ↗Qwen34 оценок · V25,65/10Карточка в рейтинге 1С ↗
17DeepSeek-V4-Flash ↗DeepSeek / OpenRouter34 оценок · V25,44/10Карточка в рейтинге 1С ↗
18Mimo 2.5Xiaomi34 оценок · V24,50/10Карточка в рейтинге 1С ↗
19MiniMax M2.7 ↗MiniMax / OpenRouter34 оценок · V24,00/10Карточка в рейтинге 1С ↗