Best Open Source LLM Leaderboard 2026 | Open Source Model Rankings and Tier List | Onyx AI

Open Source LLM Leaderboard

The definitive ranking of every major open source model — compared across reasoning, coding, math, software engineering, and instruction following benchmarks.

Roshan Desai · Last updated: 2026-07-20

OverallCodingMathChatReasoning

SmallMediumLarge

Rank Model Params
S Kimi K3 2.8T
GLM-5.2 753B
DeepSeek-V4-Pro 1.6T
Kimi K2.6 1T
A MiniMax M3 428B
DeepSeek-V4-Flash 284B
Hunyuan Hy3 295B
Step-3.7-Flash 198B
Qwen3.6-27B 27B
Qwen3.6-35B-A3B 35B
Nemotron 3 Ultra 550B
GLM-4.7 355B
MiMo-V2-Flash 309B
B MiniMax M2.7 230B
Gemma 4 31B 31B
Mistral Medium 3.5 128B
Command A+ 218B
Ling-2.6-1T 1T
Nemotron 3 Super 120B
MiMo-V2.5-Pro 1.02T
Mistral Small 4 119B
GPT-oss 120B 117B
Nemotron Ultra 253B 253B
Nemotron Super 49B 49B
Step3 316B
C Llama 4 Maverick 400B
Gemma 3 27B 27B
Nemotron Nano 30B 30B
D See Why

Best Open Source Models by Task — Benchmark Rankings

Which open source LLM is best for coding, reasoning, or math? See how every model stacks up across key benchmarks — hover any bar for details.

OverallCodingMathChatReasoning

Best Overall (MMLU)

General knowledge across 57 subjects (MMLU)

Model Score
DeepSeek R1 70%
GLM-4.7 77%
GPT-oss 120B 84%
MiMo-V2.5-Pro 91%
Qwen 3.5 95%
DeepSeek V3.2
MiMo-V2-Flash
Llama 4 Maverick
Command A+

Best Overall Knowledge

Advanced knowledge across subjects (MMLU-Pro)

Model Score
GPT-oss 120B 60%
Qwen 3.5 69%
DeepSeek-V4-Pro 78%
Nemotron 3 Ultra 87%
DeepSeek-V4-Flash 95%
Qwen3.6-27B
Step-3.5-Flash
Gemma 4 31B
Qwen3.6-35B-A3B
DeepSeek V3.2
MiMo-V2-Flash
GLM-4.7
DeepSeek R1
Nemotron 3 Super
Llama 4 Maverick
Nemotron Super 49B
Nemotron Nano 30B
MiMo-V2.5-Pro
Gemma 3 27B

Open Source Model Benchmark Scores

Complete benchmark results for every open source LLM. Click any column header to sort and rank. Scores sourced from official tech reports.

Model Params Context MMLU-Pro GPQA Diamond IFEval Chatbot Arena SWE-bench Verified HumanEval LiveCodeBench AIME 2025 MATH-500 MMLU
Command A+
Cohere
218B 128K N/A 76.1 N/A N/A N/A N/A N/A N/A N/A 75.1
DeepSeek R1
DeepSeek
671B 128K 84.0 71.5 83.3 1398 49.2 90.2 65.9 87.5 97.3 90.8
DeepSeek V3.2
DeepSeek
685B 130K 85.0 79.9 N/A 1423 67.8 N/A 74.1 89.3 N/A 88.5
DeepSeek-V4-Flash
DeepSeek
284B 1M 86.2 88.1 N/A N/A 79.0 N/A 91.6 N/A N/A N/A
DeepSeek-V4-Pro
DeepSeek
1.6T 1M 87.5 90.1 N/A N/A 80.6 N/A 93.5 N/A N/A N/A
Gemma 3 27B
Google
27B 128K 67.5 42.4 N/A 1366 N/A N/A 29.7 N/A 89.0 N/A
Gemma 4 31B
Google
31B 262K 85.2 84.3 N/A 1451 N/A N/A 80.0 N/A N/A N/A
GLM-4.7
Zhipu AI
355B 200K 84.3 85.7 88.0 1441 73.8 94.2 84.9 95.7 N/A 90.1
GLM-5.2
Zhipu AI
753B 1M N/A 91.2 N/A 1468 N/A N/A N/A N/A N/A N/A
GPT-oss 120B
OpenAI
117B 128K 90.0 80.9 N/A 1355 62.4 88.3 60.0 97.9 N/A 90.0
Hunyuan Hy3
Tencent
295B 262K N/A 90.4 N/A 1412 78.0 N/A N/A N/A N/A N/A
Kimi K2.6
Moonshot
1T 262K N/A 90.5 N/A N/A 80.2 N/A 89.6 N/A N/A N/A
Kimi K3
Moonshot
2.8T 1M N/A 93.5 N/A 1486 N/A N/A N/A N/A N/A N/A
Ling-2.6-1T
Ant Group
1T 262K N/A 76.2 N/A N/A 72.2 N/A 65.6 N/A N/A N/A
Llama 4 Maverick
Meta
400B 1M 80.5 69.8 N/A 1328 N/A 62.0 43.4 N/A N/A 85.5
MiMo-V2-Flash
Xiaomi
309B 262K 84.9 83.7 N/A 1393 73.4 84.8 80.6 94.1 N/A 86.7
MiMo-V2.5-Pro
Xiaomi
1.02T 1M 68.5 66.7 N/A N/A N/A N/A 39.6 N/A N/A 89.4
MiniMax M2.7
MiniMax
230B 205K N/A N/A N/A 1417 N/A N/A N/A N/A N/A N/A
MiniMax M3
MiniMax
428B 1M N/A N/A N/A 1445 80.5 N/A N/A N/A N/A N/A
Mistral Medium 3.5
Mistral
128B 256K N/A 74.8 N/A 1427 77.6 N/A N/A N/A N/A N/A
Mistral Small 4
Mistral
119B 262K N/A 71.2 N/A N/A N/A N/A N/A N/A N/A N/A
Nemotron 3 Super
Nvidia
120B 1M 83.7 79.2 N/A N/A 60.5 N/A 81.2 90.2 N/A N/A
Nemotron 3 Ultra
Nvidia
550B 1M 86.8 87.0 81.7 N/A 70.7 N/A 89.0 N/A N/A N/A
Nemotron Nano 30B
Nvidia
30B 1M 78.1 78.1 N/A 1318 N/A N/A N/A N/A N/A N/A
Nemotron Super 49B
Nvidia
49B 128K 79.5 72.0 88.6 1342 N/A N/A 73.6 82.7 97.4 N/A
Nemotron Ultra 253B
Nvidia
253B 128K N/A 76.0 89.5 1348 N/A N/A 66.3 72.5 97.0 N/A
Qwen 3.5
Qwen
397B 262K 87.8 88.4 92.6 1450 76.4 N/A 83.6 N/A N/A 88.5
Qwen3.6-27B
Qwen
27B 262K 86.2 87.8 N/A N/A 77.2 N/A 83.9 N/A N/A N/A
Qwen3.6-35B-A3B
Qwen
35B 262K 85.2 86.0 N/A N/A 73.4 N/A 80.4 N/A N/A N/A
Step-3.5-Flash
Stepfun
196B 262K 85.8 N/A N/A 1389 74.4 81.1 86.4 99.8 N/A N/A
Step-3.7-Flash
Stepfun
198B 262K N/A N/A N/A N/A 76.5 N/A N/A N/A N/A N/A
Step3
Stepfun
316B 66K N/A 73.0 N/A 1348 N/A N/A 67.1 82.9 N/A N/A

Compare Open Source LLMs Head-to-Head

Select two open source models to see how they stack up across all benchmarks.

Model A

Gemma 4 31B

Model B

Mistral Small 4

Gemma 4 31B

Mistral Small 4

GPQA Diamond

84.3

vs

71.2

Benchmarks won

1

vs