Comparativos de mercado do modelo de IA

Padrão: 36 · HF: 22

Sobre os benchmarks

Benchmarks são testes padronizados que avaliam o desempenho de modelos de IA em raciocínio, conhecimento, matemática e programação. Use-os para comparar modelos de forma objetiva e escolher o modelo certo para sua tarefa.

📊 Padrão. Padrão - os quatro benchmarks públicos mais citados (MMLU, GPQA, HumanEval, SWE-Bench), retirados da página de anúncio de cada modelo; nossa pontuação os combina em um único número.

🤗 Tabela de classificação HF Open LLM. HF Open LLM Leaderboard - seis tarefas (IFEval, BBH, MATH, GPQA, MuSR, MMLU-Pro) medidas uniformemente para modelos de código aberto; ordenada pela média.

📊 Padrão (MMLU · GPQA · HumanEval · SWE-Bench)🤗 Tabela de classificação HF Open LLM

🤗

HF Open LLM Leaderboard v2

IFEval · BBH · MATH · GPQA · MuSR · MMLU-Pro - modelos de código aberto em tarefas padronizadas.

Abrir em HF →

Todos Código abertoMeta (8)Alibaba/Qwen (5)Microsoft (3)

#	Modelo↕	Fornecedor↕	IFEval↕	BBH↕	MATH↕	GPQA↕	MuSR↕	MMLU-Pro↕	Média↓
1	Phi 4OSS	Microsoft	68.8	55.3	50.0	11.5	10.1	48.6	40.7
2	WizardLM-2 8x22BOSS	Microsoft	52.7	48.6	25.0	17.6	14.5	40.0	33.1
3	Phi 4 Mini InstructOSS	Microsoft	73.8	38.7	17.0	7.9	6.5	32.6	29.4

Média = IFEval · BBH · MATH · GPQA · MuSR · MMLU-ProTodas as pontuações em % · quanto maior, melhor