Comparativos de mercado do modelo de IA
Padrão: 36 · HF: 22
Sobre os benchmarks
Benchmarks são testes padronizados que avaliam o desempenho de modelos de IA em raciocínio, conhecimento, matemática e programação. Use-os para comparar modelos de forma objetiva e escolher o modelo certo para sua tarefa.
📊 Padrão. Padrão - os quatro benchmarks públicos mais citados (MMLU, GPQA, HumanEval, SWE-Bench), retirados da página de anúncio de cada modelo; nossa pontuação os combina em um único número.
🤗 Tabela de classificação HF Open LLM. HF Open LLM Leaderboard - seis tarefas (IFEval, BBH, MATH, GPQA, MuSR, MMLU-Pro) medidas uniformemente para modelos de código aberto; ordenada pela média.
🤗Abrir em HF →
HF Open LLM Leaderboard v2
IFEval · BBH · MATH · GPQA · MuSR · MMLU-Pro - modelos de código aberto em tarefas padronizadas.
| # | Modelo↕ | Fornecedor↕ | IFEval↕ | BBH↕ | MATH↕ | GPQA↕ | MuSR↕ | MMLU-Pro↕ | Média↑ |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Microsoft | 73.8 | 38.7 | 17.0 | 7.9 | 6.5 | 32.6 | 29.4 | |
| 2 | Microsoft | 52.7 | 48.6 | 25.0 | 17.6 | 14.5 | 40.0 | 33.1 | |
| 3 | Microsoft | 68.8 | 55.3 | 50.0 | 11.5 | 10.1 | 48.6 | 40.7 |
Média = IFEval · BBH · MATH · GPQA · MuSR · MMLU-ProTodas as pontuações em % · quanto maior, melhor

