Бенчмарки AI Моделей
Стандартные: 36 · HF: 22
О бенчмарках
Бенчмарки - это стандартизированные тесты, оценивающие, насколько хорошо ИИ-модели справляются с рассуждением, знаниями, математикой и программированием. Используйте их, чтобы объективно сравнивать модели и выбирать подходящую под задачу.
📊 Стандартные. Стандартные - четыре самых цитируемых публичных бенчмарка (MMLU, GPQA, HumanEval, SWE-Bench), взятые со страниц анонсов моделей; наша Оценка сводит их в одно число.
🤗 HF Open LLM Leaderboard. HF Open LLM Leaderboard - шесть задач (IFEval, BBH, MATH, GPQA, MuSR, MMLU-Pro), измеренных единообразно для open-source моделей; ранжирование по Среднему.
🤗Открыть в HF →
HF Open LLM Leaderboard v2
IFEval · BBH · MATH · GPQA · MuSR · MMLU-Pro - опенсорс модели по стандартным тестам.
| # | Модель↕ | Провайдер↕ | IFEval↕ | BBH↕ | MATH↕ | GPQA↕ | MuSR↕ | MMLU-Pro↕ | Среднее↓ |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Alibaba/Qwen | 86.4 | 61.9 | 59.8 | 16.7 | 11.7 | 51.4 | 48.0 | |
| 2 | Alibaba/Qwen | 86.4 | 61.9 | 59.8 | 16.7 | 11.7 | 51.4 | 48.0 | |
| 3 | Alibaba/Qwen | 72.7 | 52.3 | 49.5 | 13.2 | 13.7 | 37.9 | 39.9 | |
| 4 | Alibaba/Qwen | 72.7 | 52.3 | 49.5 | 13.2 | 13.7 | 37.9 | 39.9 | |
| 5 | Alibaba/Qwen | 75.8 | 34.9 | 50.0 | 5.5 | 8.4 | 36.5 | 35.2 |
Среднее = IFEval · BBH · MATH · GPQA · MuSR · MMLU-ProВсе оценки в % · выше - лучше

