TECHAGENT - MY AI LIFE

معايير نماذج AI

قياسي: 36 · HF: 22

حول المعايير

المعايير اختبارات موحّدة تقيّم أداء نماذج الذكاء الاصطناعي في الاستدلال والمعرفة والرياضيات والبرمجة. استخدمها لمقارنة النماذج بموضوعية واختيار الأنسب لمهمتك.

📊 قياسي. المعايير القياسية - أربعة معايير عامة الأكثر استشهاداً (MMLU وGPQA وHumanEval وSWE-Bench)، مأخوذة من صفحة إعلان كل نموذج؛ وتجمعها درجتنا في رقم واحد.

🤗 HF Open LLM Leaderboard. HF Open LLM Leaderboard - ست مهام (IFEval وBBH وMATH وGPQA وMuSR وMMLU-Pro) تُقاس بشكل موحّد للنماذج مفتوحة المصدر؛ ويُرتّبها المتوسط.

📚MMLU
57 مادة أكاديمية
o1
OpenAI
92.3%
🔬GPQA Diamond
أسئلة علمية بمستوى دكتوراه
o1
OpenAI
77.3%
💻HumanEval
توليد كود Python
DeepSeek R1
DeepSeek
92.6%
🔧SWE-Bench
مهام هندسية حقيقية من GitHub
Claude Opus 4.1
Anthropic
74.5%
📚MMLU

57 مادة أكاديمية

🔬GPQA Diamond

أسئلة علمية بمستوى دكتوراه

💻HumanEval

توليد كود Python

🔧SWE-Bench

مهام هندسية حقيقية من GitHub

#النموذجالمزودMMLUGPQAHumanEvalSWE-Benchالنقاط
1AnthropicClaude Opus 4.7Anthropic
90.1
74.3
92.1
72.5
81.5
2AnthropicClaude Sonnet 4.6Anthropic
88.3
65.0
92.0
57.0
74.4
3AnthropicClaude Haiku 4.5Anthropic
82.9
43.0
88.3
33.2
59.9
4AnthropicClaude Opus 4.1Anthropic---
74.5
-
Score = MMLU×20% + GPQA×30% + HumanEval×25% + SWE-Bench×25%جميع النقاط بنسبة % · الأعلى أفضل→ جدول النماذج الكامل مع الأسعار والسرعة