Comparativos de mercado do modelo de IA

Padrão: 36 · HF: 22

Sobre os benchmarks

Benchmarks são testes padronizados que avaliam o desempenho de modelos de IA em raciocínio, conhecimento, matemática e programação. Use-os para comparar modelos de forma objetiva e escolher o modelo certo para sua tarefa.

📊 Padrão. Padrão - os quatro benchmarks públicos mais citados (MMLU, GPQA, HumanEval, SWE-Bench), retirados da página de anúncio de cada modelo; nossa pontuação os combina em um único número.

🤗 Tabela de classificação HF Open LLM. HF Open LLM Leaderboard - seis tarefas (IFEval, BBH, MATH, GPQA, MuSR, MMLU-Pro) medidas uniformemente para modelos de código aberto; ordenada pela média.

📊 Padrão (MMLU · GPQA · HumanEval · SWE-Bench)🤗 Tabela de classificação HF Open LLM

🤗

HF Open LLM Leaderboard v2

IFEval · BBH · MATH · GPQA · MuSR · MMLU-Pro - modelos de código aberto em tarefas padronizadas.

Abrir em HF →

Todos Código abertoMeta (8)Alibaba/Qwen (5)Microsoft (3)

#	Modelo↕	Fornecedor↕	IFEval↕	BBH↕	MATH↕	GPQA↕	MuSR↕	MMLU-Pro↕	Média↓
1	Qwen2.5 72B InstructOSS	Alibaba/Qwen	86.4	61.9	59.8	16.7	11.7	51.4	48.0
2	Qwen 2.5 72BOSS	Alibaba/Qwen	86.4	61.9	59.8	16.7	11.7	51.4	48.0
3	Qwen2.5 Coder 32B InstructOSS	Alibaba/Qwen	72.7	52.3	49.5	13.2	13.7	37.9	39.9
4	Qwen 2.5 Coder 32BOSS	Alibaba/Qwen	72.7	52.3	49.5	13.2	13.7	37.9	39.9
5	Qwen2.5 7B InstructOSS	Alibaba/Qwen	75.8	34.9	50.0	5.5	8.4	36.5	35.2

Média = IFEval · BBH · MATH · GPQA · MuSR · MMLU-ProTodas as pontuações em % · quanto maior, melhor