Best LLM Leaderboard 2026 | AI Model Rankings, Benchmarks & Pricing | Onyx AI

LLM Leaderboard

The definitive ranking of every major LLM — open and closed source — compared across reasoning, coding, math, agentic, software engineering, and chat benchmarks.

Roshan Desai · Last updated: 2026-07-20

Overall Coding Math Chat Reasoning Agentic

Model Params Context Input $/1M Output $/1M MMLU-Pro GPQA Diamond IFEval Chatbot Arena SWE-bench Verified HumanEval LiveCodeBench AIME 2025 MATH-500 MMLU MMMLU MMMU-Pro HLE Terminal-Bench 2.0 ARC-AGI-2 τ2-bench OSWorld BrowseComp SWE-bench Pro Terminal-Bench 2.1
Claude Fable 5 1M $10.00 $50.00 N/A N/A N/A 1507 95.0 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A 85.0 N/A 80.0
Claude Opus 4.8 1M $5.00 $25.00 N/A 93.6 N/A 1476 88.6 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A 83.4 84.3 69.2 74.6
Claude Sonnet 5 1M $2.00 $10.00 N/A N/A N/A 1486 85.2 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A 81.2 84.7 63.2 80.4
DeepSeek R1 671B 128K $0.28 $0.42 84.0 71.5 83.3 1398 49.2 90.2 65.9 87.5 97.3 90.8 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A
DeepSeek V3.2 685B 130K $0.28 $0.42 85.0 79.9 N/A 1423 67.8 N/A 74.1 89.3 N/A 88.5 N/A N/A 39.6 N/A N/A N/A N/A N/A N/A N/A
DeepSeek-V4-Pro 1.6T 1M $0.43 $0.87 87.5 90.1 N/A N/A 80.6 N/A 93.5 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A
ERNIE 5.1 128K $0.59 $2.65 N/A N/A N/A 1468 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A
Gemini 3.1 Pro N/A 1M $2.00 $12.00 85.0 91.9 85.0 1492 78.0 93.0 81.3 100.0 94.0 91.8 91.8 81.0 45.8 56.2 31.1 85.3 N/A 59.2 N/A N/A
Gemini 3.5 Flash 1M $1.50 $9.00 N/A N/A N/A 1486 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A 76.2 N/A
GLM-5.2 753B 1M $1.40 $4.40 N/A 91.2 N/A 1468 N/A N/A N/A N/A N/A N/A N/A N/A 40.5 N/A N/A N/A N/A N/A N/A N/A
GPT-5.5 1M $5.00 $30.00 88.1 93.6 92.1 1481 88.7 94.2 78.0 100.0 N/A 92.5 N/A N/A N/A N/A 82.7 N/A N/A 78.7 84.4 59.4
GPT-5.6 Luna 1M $1.00 $6.00 N/A 92.3 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A
GPT-5.6 Sol 1M $5.00 $30.00 N/A 94.6 N/A 1486 N/A N/A N/A N/A N/A N/A N/A N/A 47.2 N/A N/A N/A N/A N/A 90.4 64.6
GPT-5.6 Terra 1M $2.50 $15.00 N/A 92.9 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A 87.5 63.4
GPT-oss 120B 117B 128K N/A N/A 90.0 80.9 N/A 1355 62.4 88.3 60.0 97.9 N/A 90.0 N/A N/A 18.7 N/A N/A N/A N/A N/A N/A N/A
Grok 3 N/A 131K $3.00 $15.00 N/A 84.6 N/A 1412 49.0 94.5 79.4 93.3 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A
Grok 4.5 500K $2.00 $6.00 N/A N/A N/A 1485 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A 64.7
Hunyuan Hy3 295B 262K N/A N/A N/A 90.4 N/A 1412 78.0 N/A N/A N/A N/A N/A N/A N/A 37.0 N/A N/A N/A N/A N/A N/A N/A
Kimi K2.6 1T 262K $0.95 $4.00 N/A 90.5 N/A N/A 80.2 N/A 89.6 N/A N/A N/A N/A 79.4 N/A N/A 66.7 N/A N/A N/A 73.1 83.2
Kimi K3 2.8T 1M $3.00 $15.00 N/A 93.5 N/A 1486 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A 90.4 N/A
Llama 4 Maverick 400B 1M N/A N/A 80.5 69.8 N/A 1328 N/A 62.0 43.4 N/A N/A 85.5 84.6 N/A N/A N/A N/A N/A N/A N/A N/A N/A
MiMo-V2-Flash 309B 262K N/A N/A 84.9 83.7 N/A 1393 73.4 84.8 80.6 94.1 N/A 86.7 N/A N/A 38.5 N/A N/A N/A N/A N/A N/A N/A
MiMo-V2.5-Pro 1.02T 1M $0.43 $0.87 68.5 66.7 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A
MiniMax M3 428B 1M $0.30 $1.20 N/A N/A N/A 1445 80.5 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A 83.5
Muse Spark 1.1 1M $1.25 $4.25 N/A N/A N/A 1493 N/A N/A N/A N/A N/A N/A N/A N/A 52.2 N/A N/A N/A N/A 80.8 N/A 80.0
Nemotron 3 Ultra 550B 1M N/A N/A 86.8 87.0 81.7 N/A 70.7 N/A 89.0 N/A N/A N/A N/A N/A 26.7 N/A N/A N/A N/A N/A N/A N/A
Nemotron Ultra 253B 253B 128K N/A N/A N/A 76.0 89.5 1348 N/A N/A 66.3 72.5 97.0 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A
Nova 2 Pro 1M N/A N/A 81.6 81.4 80.2 N/A 70.0 N/A 74.6 92.3 N/A N/A N/A N/A 63.5 N/A N/A N/A N/A 78.5 N/A N/A
Qwen 3.5 397B 262K N/A N/A 87.8 88.4 92.6 1450 76.4 N/A 83.6 N/A N/A 88.5 88.5 79.0 28.7 52.5 N/A 86.7 62.2 78.6 N/A N/A
Qwen3.7-Max 1M $2.50 $7.50 N/A N/A N/A 1475 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A
Step-3.5-Flash 196B 262K $0.10 $0.30 85.8 N/A N/A 1389 74.4 81.1 86.4 99.8 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A
Step-3.7-Flash 198B 262K $0.20 $1.15 N/A N/A N/A N/A 76.5 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A 75.8

Compare LLMs Head-to-Head

Select two models to see how they stack up across all benchmarks.

Model A

Claude Fable 5

Model B

GPT-5.6 Sol

Metric Claude Fable 5 GPT-5.6 Sol
Chatbot Arena 1507 1486
SWE-bench Pro 80.0 64.6
Terminal-Bench 2.1 84.3 88.8
Benchmarks won 2 1