معايير نماذج AI
قياسي: 36 · HF: 22
حول المعايير
المعايير اختبارات موحّدة تقيّم أداء نماذج الذكاء الاصطناعي في الاستدلال والمعرفة والرياضيات والبرمجة. استخدمها لمقارنة النماذج بموضوعية واختيار الأنسب لمهمتك.
📊 قياسي. المعايير القياسية - أربعة معايير عامة الأكثر استشهاداً (MMLU وGPQA وHumanEval وSWE-Bench)، مأخوذة من صفحة إعلان كل نموذج؛ وتجمعها درجتنا في رقم واحد.
🤗 HF Open LLM Leaderboard. HF Open LLM Leaderboard - ست مهام (IFEval وBBH وMATH وGPQA وMuSR وMMLU-Pro) تُقاس بشكل موحّد للنماذج مفتوحة المصدر؛ ويُرتّبها المتوسط.
| # | النموذج↕ | المزود↕ | IFEval↕ | BBH↕ | MATH↕ | GPQA↕ | MuSR↕ | MMLU-Pro↕ | متوسط↓ |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Alibaba/Qwen | 86.4 | 61.9 | 59.8 | 16.7 | 11.7 | 51.4 | 48.0 | |
| 2 | Alibaba/Qwen | 86.4 | 61.9 | 59.8 | 16.7 | 11.7 | 51.4 | 48.0 | |
| 3 | Alibaba/Qwen | 72.7 | 52.3 | 49.5 | 13.2 | 13.7 | 37.9 | 39.9 | |
| 4 | Alibaba/Qwen | 72.7 | 52.3 | 49.5 | 13.2 | 13.7 | 37.9 | 39.9 | |
| 5 | Alibaba/Qwen | 75.8 | 34.9 | 50.0 | 5.5 | 8.4 | 36.5 | 35.2 |
متوسط = IFEval · BBH · MATH · GPQA · MuSR · MMLU-Proجميع النقاط بنسبة % · الأعلى أفضل

