TECHAGENT - MY AI LIFE

معايير نماذج AI

قياسي: 36 · HF: 22

حول المعايير

المعايير اختبارات موحّدة تقيّم أداء نماذج الذكاء الاصطناعي في الاستدلال والمعرفة والرياضيات والبرمجة. استخدمها لمقارنة النماذج بموضوعية واختيار الأنسب لمهمتك.

📊 قياسي. المعايير القياسية - أربعة معايير عامة الأكثر استشهاداً (MMLU وGPQA وHumanEval وSWE-Bench)، مأخوذة من صفحة إعلان كل نموذج؛ وتجمعها درجتنا في رقم واحد.

🤗 HF Open LLM Leaderboard. HF Open LLM Leaderboard - ست مهام (IFEval وBBH وMATH وGPQA وMuSR وMMLU-Pro) تُقاس بشكل موحّد للنماذج مفتوحة المصدر؛ ويُرتّبها المتوسط.

📚MMLU
57 مادة أكاديمية
o1
OpenAI
92.3%
🔬GPQA Diamond
أسئلة علمية بمستوى دكتوراه
o1
OpenAI
77.3%
💻HumanEval
توليد كود Python
DeepSeek R1
DeepSeek
92.6%
🔧SWE-Bench
مهام هندسية حقيقية من GitHub
Claude Opus 4.1
Anthropic
74.5%
📚MMLU

57 مادة أكاديمية

🔬GPQA Diamond

أسئلة علمية بمستوى دكتوراه

💻HumanEval

توليد كود Python

🔧SWE-Bench

مهام هندسية حقيقية من GitHub

#النموذجالمزودMMLUGPQAHumanEvalSWE-Benchالنقاط
1DeepSeekDeepSeek R1DeepSeek
90.8
71.5
92.6
49.2
75.1
2DeepSeekDeepSeek V3DeepSeek
88.5
59.1
89.4
42.0
68.3
3MetaLlama 3.1 405BMeta
88.6
50.7
89.0
34.1
63.7
4Alibaba/QwenQwen 2.5 72BAlibaba/Qwen
86.1
49.0
86.5
23.7
59.5
5Alibaba/QwenQwen 2.5 Coder 32BAlibaba/Qwen
80.0
42.0
92.3
30.0
59.2
6MetaLlama 3.1 70BMeta
83.6
46.7
80.5
21.8
56.3
7GoogleGemma 2 27BGoogle
75.2
38.4
74.0
14.7
48.7
8Mistral AIMistral NeMoMistral AI
68.0
32.0
73.4
15.0
45.3
9MetaLlama 3.2 3BMeta
63.4
24.7
58.3
9.5
37.0
Score = MMLU×20% + GPQA×30% + HumanEval×25% + SWE-Bench×25%جميع النقاط بنسبة % · الأعلى أفضل→ جدول النماذج الكامل مع الأسعار والسرعة