TECHAGENT - MY AI LIFE

AI模型基准测试

标准: 36 · HF: 22

关于基准测试

基准测试是标准化测试,用于评估 AI 模型在推理、知识、数学和编程方面的表现。借助它们可以客观比较模型,并为任务选择合适的模型。

📊 标准. 标准 - 四个最常被引用的公开基准(MMLU、GPQA、HumanEval、SWE-Bench),取自各模型的发布页;我们的评分将其汇总为一个数值。

🤗 HF开放LLM排行榜. HF Open LLM Leaderboard - 对开源模型统一测量的六项任务(IFEval、BBH、MATH、GPQA、MuSR、MMLU-Pro),按平均分排名。

📚MMLU
57个学术科目
o1
OpenAI
92.3%
🔬GPQA Diamond
博士级科学问题
o1
OpenAI
77.3%
💻HumanEval
Python代码生成
DeepSeek R1
DeepSeek
92.6%
🔧SWE-Bench
真实GitHub工程任务
Claude Opus 4.1
Anthropic
74.5%
📚MMLU

57个学术科目

🔬GPQA Diamond

博士级科学问题

💻HumanEval

Python代码生成

🔧SWE-Bench

真实GitHub工程任务

#模型提供商MMLUGPQAHumanEvalSWE-Bench评分
1AnthropicClaude Opus 4.7Anthropic
90.1
74.3
92.1
72.5
81.5
2AnthropicClaude Sonnet 4.6Anthropic
88.3
65.0
92.0
57.0
74.4
3AnthropicClaude Haiku 4.5Anthropic
82.9
43.0
88.3
33.2
59.9
4AnthropicClaude Opus 4.1Anthropic---
74.5
-
Score = MMLU×20% + GPQA×30% + HumanEval×25% + SWE-Bench×25%所有分数以%表示 · 越高越好→ 含价格与速度的完整模型表