Best Open Source LLM Leaderboard 2026 | Open Source Model Rankings and Tier List | Onyx AI
Open Source LLM Leaderboard
The definitive ranking of every major open source model — compared across reasoning, coding, math, software engineering, and instruction following benchmarks.
Roshan Desai · Last updated: 2026-07-20
OverallCodingMathChatReasoning
SmallMediumLarge
| Rank | Model | Params |
|---|---|---|
| S | Kimi K3 | 2.8T |
| GLM-5.2 | 753B | |
| DeepSeek-V4-Pro | 1.6T | |
| Kimi K2.6 | 1T | |
| A | MiniMax M3 | 428B |
| DeepSeek-V4-Flash | 284B | |
| Hunyuan Hy3 | 295B | |
| Step-3.7-Flash | 198B | |
| Qwen3.6-27B | 27B | |
| Qwen3.6-35B-A3B | 35B | |
| Nemotron 3 Ultra | 550B | |
| GLM-4.7 | 355B | |
| MiMo-V2-Flash | 309B | |
| B | MiniMax M2.7 | 230B |
| Gemma 4 31B | 31B | |
| Mistral Medium 3.5 | 128B | |
| Command A+ | 218B | |
| Ling-2.6-1T | 1T | |
| Nemotron 3 Super | 120B | |
| MiMo-V2.5-Pro | 1.02T | |
| Mistral Small 4 | 119B | |
| GPT-oss 120B | 117B | |
| Nemotron Ultra 253B | 253B | |
| Nemotron Super 49B | 49B | |
| Step3 | 316B | |
| C | Llama 4 Maverick | 400B |
| Gemma 3 27B | 27B | |
| Nemotron Nano 30B | 30B | |
| D | See Why |
Best Open Source Models by Task — Benchmark Rankings
Which open source LLM is best for coding, reasoning, or math? See how every model stacks up across key benchmarks — hover any bar for details.
OverallCodingMathChatReasoning
Best Overall (MMLU)
General knowledge across 57 subjects (MMLU)
| Model | Score |
|---|---|
| DeepSeek R1 | 70% |
| GLM-4.7 | 77% |
| GPT-oss 120B | 84% |
| MiMo-V2.5-Pro | 91% |
| Qwen 3.5 | 95% |
| DeepSeek V3.2 | |
| MiMo-V2-Flash | |
| Llama 4 Maverick | |
| Command A+ |
Best Overall Knowledge
Advanced knowledge across subjects (MMLU-Pro)
| Model | Score |
|---|---|
| GPT-oss 120B | 60% |
| Qwen 3.5 | 69% |
| DeepSeek-V4-Pro | 78% |
| Nemotron 3 Ultra | 87% |
| DeepSeek-V4-Flash | 95% |
| Qwen3.6-27B | |
| Step-3.5-Flash | |
| Gemma 4 31B | |
| Qwen3.6-35B-A3B | |
| DeepSeek V3.2 | |
| MiMo-V2-Flash | |
| GLM-4.7 | |
| DeepSeek R1 | |
| Nemotron 3 Super | |
| Llama 4 Maverick | |
| Nemotron Super 49B | |
| Nemotron Nano 30B | |
| MiMo-V2.5-Pro | |
| Gemma 3 27B | |
Open Source Model Benchmark Scores
Complete benchmark results for every open source LLM. Click any column header to sort and rank. Scores sourced from official tech reports.
| Model | Params | Context | MMLU-Pro | GPQA Diamond | IFEval | Chatbot Arena | SWE-bench Verified | HumanEval | LiveCodeBench | AIME 2025 | MATH-500 | MMLU |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Command A+ Cohere |
218B | 128K | N/A | 76.1 | N/A | N/A | N/A | N/A | N/A | N/A | N/A | 75.1 |
| DeepSeek R1 DeepSeek |
671B | 128K | 84.0 | 71.5 | 83.3 | 1398 | 49.2 | 90.2 | 65.9 | 87.5 | 97.3 | 90.8 |
| DeepSeek V3.2 DeepSeek |
685B | 130K | 85.0 | 79.9 | N/A | 1423 | 67.8 | N/A | 74.1 | 89.3 | N/A | 88.5 |
| DeepSeek-V4-Flash DeepSeek |
284B | 1M | 86.2 | 88.1 | N/A | N/A | 79.0 | N/A | 91.6 | N/A | N/A | N/A |
| DeepSeek-V4-Pro DeepSeek |
1.6T | 1M | 87.5 | 90.1 | N/A | N/A | 80.6 | N/A | 93.5 | N/A | N/A | N/A |
| Gemma 3 27B |
27B | 128K | 67.5 | 42.4 | N/A | 1366 | N/A | N/A | 29.7 | N/A | 89.0 | N/A |
| Gemma 4 31B |
31B | 262K | 85.2 | 84.3 | N/A | 1451 | N/A | N/A | 80.0 | N/A | N/A | N/A |
| GLM-4.7 Zhipu AI |
355B | 200K | 84.3 | 85.7 | 88.0 | 1441 | 73.8 | 94.2 | 84.9 | 95.7 | N/A | 90.1 |
| GLM-5.2 Zhipu AI |
753B | 1M | N/A | 91.2 | N/A | 1468 | N/A | N/A | N/A | N/A | N/A | N/A |
| GPT-oss 120B OpenAI |
117B | 128K | 90.0 | 80.9 | N/A | 1355 | 62.4 | 88.3 | 60.0 | 97.9 | N/A | 90.0 |
| Hunyuan Hy3 Tencent |
295B | 262K | N/A | 90.4 | N/A | 1412 | 78.0 | N/A | N/A | N/A | N/A | N/A |
| Kimi K2.6 Moonshot |
1T | 262K | N/A | 90.5 | N/A | N/A | 80.2 | N/A | 89.6 | N/A | N/A | N/A |
| Kimi K3 Moonshot |
2.8T | 1M | N/A | 93.5 | N/A | 1486 | N/A | N/A | N/A | N/A | N/A | N/A |
| Ling-2.6-1T Ant Group |
1T | 262K | N/A | 76.2 | N/A | N/A | 72.2 | N/A | 65.6 | N/A | N/A | N/A |
| Llama 4 Maverick Meta |
400B | 1M | 80.5 | 69.8 | N/A | 1328 | N/A | 62.0 | 43.4 | N/A | N/A | 85.5 |
| MiMo-V2-Flash Xiaomi |
309B | 262K | 84.9 | 83.7 | N/A | 1393 | 73.4 | 84.8 | 80.6 | 94.1 | N/A | 86.7 |
| MiMo-V2.5-Pro Xiaomi |
1.02T | 1M | 68.5 | 66.7 | N/A | N/A | N/A | N/A | 39.6 | N/A | N/A | 89.4 |
| MiniMax M2.7 MiniMax |
230B | 205K | N/A | N/A | N/A | 1417 | N/A | N/A | N/A | N/A | N/A | N/A |
| MiniMax M3 MiniMax |
428B | 1M | N/A | N/A | N/A | 1445 | 80.5 | N/A | N/A | N/A | N/A | N/A |
| Mistral Medium 3.5 Mistral |
128B | 256K | N/A | 74.8 | N/A | 1427 | 77.6 | N/A | N/A | N/A | N/A | N/A |
| Mistral Small 4 Mistral |
119B | 262K | N/A | 71.2 | N/A | N/A | N/A | N/A | N/A | N/A | N/A | N/A |
| Nemotron 3 Super Nvidia |
120B | 1M | 83.7 | 79.2 | N/A | N/A | 60.5 | N/A | 81.2 | 90.2 | N/A | N/A |
| Nemotron 3 Ultra Nvidia |
550B | 1M | 86.8 | 87.0 | 81.7 | N/A | 70.7 | N/A | 89.0 | N/A | N/A | N/A |
| Nemotron Nano 30B Nvidia |
30B | 1M | 78.1 | 78.1 | N/A | 1318 | N/A | N/A | N/A | N/A | N/A | N/A |
| Nemotron Super 49B Nvidia |
49B | 128K | 79.5 | 72.0 | 88.6 | 1342 | N/A | N/A | 73.6 | 82.7 | 97.4 | N/A |
| Nemotron Ultra 253B Nvidia |
253B | 128K | N/A | 76.0 | 89.5 | 1348 | N/A | N/A | 66.3 | 72.5 | 97.0 | N/A |
| Qwen 3.5 Qwen |
397B | 262K | 87.8 | 88.4 | 92.6 | 1450 | 76.4 | N/A | 83.6 | N/A | N/A | 88.5 |
| Qwen3.6-27B Qwen |
27B | 262K | 86.2 | 87.8 | N/A | N/A | 77.2 | N/A | 83.9 | N/A | N/A | N/A |
| Qwen3.6-35B-A3B Qwen |
35B | 262K | 85.2 | 86.0 | N/A | N/A | 73.4 | N/A | 80.4 | N/A | N/A | N/A |
| Step-3.5-Flash Stepfun |
196B | 262K | 85.8 | N/A | N/A | 1389 | 74.4 | 81.1 | 86.4 | 99.8 | N/A | N/A |
| Step-3.7-Flash Stepfun |
198B | 262K | N/A | N/A | N/A | N/A | 76.5 | N/A | N/A | N/A | N/A | N/A |
| Step3 Stepfun |
316B | 66K | N/A | 73.0 | N/A | 1348 | N/A | N/A | 67.1 | 82.9 | N/A | N/A |
Compare Open Source LLMs Head-to-Head
Select two open source models to see how they stack up across all benchmarks.
Model A
Gemma 4 31B
Model B
Mistral Small 4
Gemma 4 31B
Mistral Small 4
GPQA Diamond
84.3
vs
71.2
Benchmarks won
1
vs