LLM leaderboard
Every tracked language model by intelligence, with what it costs and how fast it answers.
ranked by intelligence · 611 models · updated Aug 30 · 201–250
| # | Model | Creator | Intelligence | $/1M in | $/1M out | tok/s |
|---|---|---|---|---|---|---|
| 201 | GPT-5.2 (Non-reasoning) | OpenAI | 26.50 | $1.75 | $14 | 68 |
| 202 | Gemma 4 26B A4B (Reasoning) | 26.10 | $0.12 | $0.37 | — | |
| 203 | o4-mini (high) | OpenAI | 26.10 | $1.1 | $4.4 | 137 |
| 204 | Claude 4 Opus (Non-reasoning) | Anthropic | 26.00 | $15 | $75 | — |
| 205 | Step 3.5 Flash | StepFun | 26.00 | $0.1 | $0.3 | 224 |
| 206 | Claude 4 Sonnet (Non-reasoning) | Anthropic | 26.00 | $3 | $15 | — |
| 207 | Gemini 2.5 Pro | 25.90 | $1.25 | $10 | 130 | |
| 208 | DeepSeek V3.2 Exp (Reasoning) | DeepSeek | 25.90 | $0.28 | $0.42 | — |
| 209 | GPT-5 mini (high) | OpenAI | 25.80 | $0.25 | $2 | 97 |
| 210 | Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 25.70 | $0.2 | $0.8 | 142 |
| 211 | Gemini 3.1 Flash-Lite | 25.60 | $0.25 | $1.5 | 311 | |
| 212 | Qwen3 Max Thinking (Preview) | Alibaba | 25.50 | $1.2 | $6 | 58 |
| 213 | DeepSeek V3.2 (Non-reasoning) | DeepSeek | 25.10 | $0.28 | $0.42 | — |
| 214 | MiMo-V2-Flash (Non-reasoning) | Xiaomi | 25.10 | — | — | — |
| 215 | Grok 4.3 (Non-reasoning) | SpaceXAI | 25.00 | $1.25 | $2.5 | 115 |
| 216 | Qwen3.6 35B A3B (Non-reasoning) | Alibaba | 24.60 | $0.38 | $2.25 | 137 |
| 217 | Qwen3 Max | Alibaba | 24.50 | $1.2 | $6 | 37 |
| 218 | Ling 3.0 Tiny | InclusionAI | 24.50 | $0 | $0 | 154 |
| 219 | Qwen3.5 35B A3B (Non-reasoning) | Alibaba | 24.30 | $0.25 | $2 | 165 |
| 220 | Gemini 2.5 Flash Preview (Sep '25) (Reasoning) | 24.20 | — | — | — | |
| 221 | Claude 4.5 Haiku (Non-reasoning) | Anthropic | 24.10 | $1 | $5 | 100 |
| 222 | gpt-oss-120b (high) | OpenAI | 24.10 | $0.15 | $0.6 | 156 |
| 223 | Kimi K2 0905 | Kimi | 24.00 | $0.6 | $2.5 | 41 |
| 224 | o1 | OpenAI | 23.90 | $15 | $60 | — |
| 225 | Claude 3.7 Sonnet (Non-reasoning) | Anthropic | 23.90 | $3 | $15 | — |
| 226 | Granite 4.2 30B | IBM | 23.70 | $0.16 | $0.65 | 75 |
| 227 | Nemotron 3.5 Lightning | NVIDIA | 23.60 | $0.07 | $0.22 | 299 |
| 228 | Gemini 2.5 Pro Preview (Mar' 25) | 23.40 | — | — | — | |
| 229 | GLM-4.6 (Non-reasoning) | Z AI | 23.40 | $0.57 | $2.2 | 59 |
| 230 | GLM-4.7-Flash (Reasoning) | Z AI | 23.30 | $0.07 | $0.4 | 95 |
| 231 | Grok 4.20 0309 (Non-reasoning) | SpaceXAI | 22.90 | $2 | $6 | — |
| 232 | Grok 3 mini Reasoning (high) | SpaceXAI | 22.90 | $0.3 | $0.5 | 74 |
| 233 | Command A+ | Cohere | 22.80 | $0 | $0 | 239 |
| 234 | Gemini 2.5 Pro Preview (May' 25) | 22.70 | $1.25 | $10 | — | |
| 235 | DeepSeek V3.2 Speciale | DeepSeek | 22.60 | — | — | — |
| 236 | K-EXAONE (Reasoning) | LG AI Research | 22.50 | — | — | — |
| 237 | ERNIE 5.0 Thinking Preview | Baidu | 22.30 | — | — | — |
| 238 | Gemma 4 31B (Non-reasoning) | 22.30 | $0.15 | $0.4 | 81 | |
| 239 | Grok 4.20 0309 v2 (Non-reasoning) | SpaceXAI | 22.20 | $1.25 | $2.5 | 98 |
| 240 | Gemma 4 12B (Reasoning) | 22.20 | $0.1 | $0.3 | 112 | |
| 241 | Nova 2.0 Pro Preview (medium) | Amazon | 22.10 | $1.25 | $10 | 115 |
| 242 | Grok Code Fast 1 | SpaceXAI | 22.00 | — | — | — |
| 243 | Mercury 2 | Inception | 21.90 | $0.25 | $0.75 | 770 |
| 244 | Qwen3.5 9B (Reasoning) | Alibaba | 21.80 | $0.14 | $0.2 | 85 |
| 245 | DeepSeek V3.2 Exp (Non-reasoning) | DeepSeek | 21.70 | $0.28 | $0.42 | — |
| 246 | DeepSeek V3.1 Terminus (Non-reasoning) | DeepSeek | 21.70 | $0.27 | $1 | — |
| 247 | Apriel-v1.5-15B-Thinker | ServiceNow | 21.60 | $0 | $0 | — |
| 248 | DeepSeek V3.1 (Non-reasoning) | DeepSeek | 21.40 | $0.57 | $1.68 | — |
| 249 | Nova 2.0 Omni (medium) | Amazon | 21.30 | $0.3 | $2.5 | — |
| 250 | Qwen3 Coder Next | Alibaba | 21.30 | $0.35 | $1.2 | 138 |
what intelligence means
A composite of nine independent evaluations covering reasoning, coding, agentic work and knowledge. Higher is better. It is versioned, so scores are comparable within a version rather than across all time.
