Бенчмарки AI Моделей
Стандартные: 36 · HF: 22
О бенчмарках
Бенчмарки - это стандартизированные тесты, оценивающие, насколько хорошо ИИ-модели справляются с рассуждением, знаниями, математикой и программированием. Используйте их, чтобы объективно сравнивать модели и выбирать подходящую под задачу.
📊 Стандартные. Стандартные - четыре самых цитируемых публичных бенчмарка (MMLU, GPQA, HumanEval, SWE-Bench), взятые со страниц анонсов моделей; наша Оценка сводит их в одно число.
🤗 HF Open LLM Leaderboard. HF Open LLM Leaderboard - шесть задач (IFEval, BBH, MATH, GPQA, MuSR, MMLU-Pro), измеренных единообразно для open-source моделей; ранжирование по Среднему.
📚MMLU
57 академических предметов
🔬GPQA Diamond
Вопросы уровня PhD
💻HumanEval
Генерация Python-кода
🔧SWE-Bench
Реальные задачи с GitHub
| # | Модель↕ | Провайдер↕ | MMLU↕ | GPQA↕ | HumanEval↕ | SWE-Bench↕ | Оценка↑ |
|---|---|---|---|---|---|---|---|
| 1 | OpenAI | 82.0 | 40.1 | 87.1 | 22.8 | 55.9 | |
| 2 | OpenAI | 88.7 | 53.6 | 90.2 | 38.3 | 65.9 | |
| 3 | OpenAI | 86.9 | 67.4 | 91.7 | 49.3 | 72.9 | |
| 4 | OpenAI | 92.3 | 77.3 | 92.4 | 48.9 | 77.0 |
Score = MMLU×20% + GPQA×30% + HumanEval×25% + SWE-Bench×25%Все оценки в % · выше - лучше→ Полная таблица моделей с ценами и скоростью

