Leaderboard
Compare AI models across standardized evals.
| Model | Parameters | MMLU | HumanEval | MATH |
|---|---|---|---|---|
1 Llama 3.1 405B Meta | 405B | 88.6% | - | - |
2 Qwen3.7 Plus Alibaba | UNDISCLOSED | 88.5 | - | 84.0 |
3 Grok 2 xAI | APPROX. 270B MOE | 87.5% | - | - |
4 | 550B | 86.8 (accuracy) | - | - |
5 Nemotron 3 Ultra NVIDIA | 550B TOTAL / 55B ACTIVE | 86.8% | - | 97.0% |
6 Qwen3.5 27B Alibaba | 27B | 86.1 | - | 71.2 |
7 Qwen 2.5 72B Instruct Alibaba | 72.7B | 86.1% | 86.6% | 83.1% |
8 Qwen3.5 35B-A3B Alibaba | 35B | 85.3 | - | 64.4 |
9 Phi-4 Microsoft | 14B | 82.7% | - | - |
10 | 30B | 78.3 | - | - |
11 Mixtral 8x22B Mistral AI | 8X22B MOE (~39B ACTIVE) | 77.75% | - | - |
12 Bonsai 27B PrismML | 27B | - | 86.0 (Ternary) | - |
13 GPT-5.6 Sol OpenAI | UNDISCLOSED | - | - | 89 (accuracy) |
14 GPT-5.6 Luna OpenAI | UNDISCLOSED | - | - | 78.6 (accuracy) |
15 GPT-5.6 Terra OpenAI | UNDISCLOSED | - | - | 84.9 (accuracy) |
16 North Mini Code Cohere | 30B (3B ACTIVE) | - | 50.0% | - |
17 GPT-5.5 Pro OpenAI | UNDISCLOSED | - | - | 52.4 (accuracy) |
18 GPT-5.4 Pro OpenAI | UNDISCLOSED | - | - | 50 (accuracy) |
| 17B (16-EXPERTS MOE) | - | - | 65.2% | |
20 Qwen2.5-Coder 32B Instruct Alibaba | 32.5B | - | 92.7% | - |
21 DeepSeek-Coder-V2 Instruct DeepSeek | 236B MOE (21B ACTIVE) | - | 90.2% | - |
22 Codestral 22B Mistral AI | 22B | - | 81.1% | - |