AI মডেল বেঞ্চমার্ক
মানক: 36 · HF: 22
বেঞ্চমার্ক সম্পর্কে
বেঞ্চমার্ক হলো মানসম্মত পরীক্ষা যা যাচাই করে AI মডেল যুক্তি, জ্ঞান, গণিত ও কোডিংয়ে কতটা ভালো করে। এগুলো দিয়ে মডেল নিরপেক্ষভাবে তুলনা করুন এবং কাজের জন্য সঠিকটি বেছে নিন।
📊 মানক. স্ট্যান্ডার্ড - সর্বাধিক উদ্ধৃত চারটি পাবলিক বেঞ্চমার্ক (MMLU, GPQA, HumanEval, SWE-Bench), প্রতিটি মডেলের ঘোষণা পৃষ্ঠা থেকে নেওয়া; আমাদের স্কোর এগুলোকে একটি সংখ্যায় মেলায়।
🤗 HF Open LLM Leaderboard. HF Open LLM Leaderboard - ওপেন-সোর্স মডেলের জন্য অভিন্নভাবে মাপা ছয়টি টাস্ক (IFEval, BBH, MATH, GPQA, MuSR, MMLU-Pro); গড় অনুযায়ী র্যাঙ্কিং।
📚MMLU
৫৭টি একাডেমিক বিষয়
🔬GPQA Diamond
PhD স্তরের বিজ্ঞান প্রশ্ন
💻HumanEval
Python কোড জেনারেশন
🔧SWE-Bench
বাস্তব GitHub ইঞ্জিনিয়ারিং কাজ
| # | মডেল↕ | প্রদানকারী↕ | MMLU↕ | GPQA↕ | HumanEval↕ | SWE-Bench↕ | স্কোর↓ |
|---|---|---|---|---|---|---|---|
| 1 | Anthropic | 90.1 | 74.3 | 92.1 | 72.5 | 81.5 | |
| 2 | Anthropic | 88.3 | 65.0 | 92.0 | 57.0 | 74.4 | |
| 3 | Anthropic | 82.9 | 43.0 | 88.3 | 33.2 | 59.9 | |
| 4 | Anthropic | - | - | - | 74.5 | - |
Score = MMLU×20% + GPQA×30% + HumanEval×25% + SWE-Bench×25%সব স্কোর % এ · বেশি মানে ভালো→ মূল্য ও গতিসহ সম্পূর্ণ মডেল টেবিল

