LLM leaderboard
Every tracked language model by intelligence, with what it costs and how fast it answers.
ranked by intelligence · 611 models · updated Aug 30 · 351–400
| # | Model | Creator | Intelligence | $/1M in | $/1M out | tok/s |
|---|---|---|---|---|---|---|
| 351 | Gemini 2.0 Flash Thinking Experimental (Jan '25) | 13.30 | — | — | — | |
| 352 | Gemma 4 12B (Non-reasoning) | 13.20 | $0.1 | $0.3 | 111 | |
| 353 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) | 13.10 | $0.1 | $0.4 | — | |
| 354 | Motif-2-12.7B-Reasoning | Motif Technologies | 12.80 | — | — | — |
| 355 | Ling-1T | InclusionAI | 12.70 | — | — | — |
| 356 | Nova Premier | Amazon | 12.70 | $2.5 | $12.5 | 31 |
| 357 | Mistral Medium 3 | Mistral | 12.50 | $0.4 | $2 | 58 |
| 358 | Magistral Medium 1 | Mistral | 12.50 | — | — | — |
| 359 | Solar Pro 2 (Preview) (Reasoning) | Upstage | 12.50 | — | — | — |
| 360 | Celeris-1 | Celeris | 12.40 | $0.2 | $0.7 | 1574 |
| 361 | Devstral Medium | Mistral | 12.40 | — | — | — |
| 362 | K2-V2 (medium) | MBZUAI Institute of Foundation Models | 12.40 | — | — | — |
| 363 | Llama Nemotron Super 49B v1.5 (Reasoning) | NVIDIA | 12.40 | $0.4 | $0.4 | 86 |
| 364 | Mistral Small 4 (Non-reasoning) | Mistral | 12.30 | $0.15 | $0.6 | 143 |
| 365 | GPT-4o (March 2025, chatgpt-4o-latest) | OpenAI | 12.30 | — | — | — |
| 366 | Tri-21B-Think | Trillion Labs | 12.30 | — | — | — |
| 367 | Claude 3.5 Haiku | Anthropic | 12.20 | — | — | — |
| 368 | Llama 3.3 Nemotron Super 49B v1 (Reasoning) | NVIDIA | 12.20 | — | — | — |
| 369 | Gemini 2.0 Flash (Feb '25) | 12.20 | — | — | — | |
| 370 | Gemma 4 E4B (Reasoning) | 12.20 | $0.02 | $0.1 | 52 | |
| 371 | Qwen3 4B 2507 (Reasoning) | Alibaba | 11.90 | — | — | — |
| 372 | Sarvam 105B (high) | Sarvam | 11.90 | $0.04 | $0.17 | — |
| 373 | MiniCPM5-1B (Reasoning) | OpenBMB | 11.90 | — | — | — |
| 374 | Nova 2.0 Lite (Non-reasoning) | Amazon | 11.80 | $0.3 | $2.5 | 166 |
| 375 | Claude 3 Opus | Anthropic | 11.80 | $15 | $75 | — |
| 376 | Gemini 2.0 Pro Experimental (Feb '25) | 11.80 | — | — | — | |
| 377 | Devstral Small (May '25) | Mistral | 11.80 | — | — | — |
| 378 | MiniCPM5-1B (Non-reasoning) | OpenBMB | 11.70 | — | — | — |
| 379 | Sonar Reasoning | Perplexity | 11.60 | — | — | — |
| 380 | Gemini 2.5 Flash Preview (Non-reasoning) | 11.60 | — | — | — | |
| 381 | Magistral Small 1.2 | Mistral | 11.50 | $0.5 | $1.5 | — |
| 382 | Qwen3 32B (Reasoning) | Alibaba | 11.40 | $0.16 | $0.64 | 105 |
| 383 | Gemini 2.5 Flash-Lite (Reasoning) | 11.40 | $0.1 | $0.4 | 391 | |
| 384 | Ministral 3 14B | Mistral | 11.20 | $0.2 | $0.2 | 95 |
| 385 | GPT-4o (Nov '24) | OpenAI | 11.10 | $2.5 | $10 | 141 |
| 386 | Qwen3 VL 32B Instruct | Alibaba | 11.00 | $0.16 | $0.64 | 65 |
| 387 | Nanbeige4.1-3B | Nanbeige | 11.00 | — | — | — |
| 388 | DeepSeek R1 Distill Qwen 32B | DeepSeek | 11.00 | — | — | — |
| 389 | LFM2.5-2.6B | Liquid AI | 11.00 | $0 | $0 | — |
| 390 | GLM-4.6V (Non-reasoning) | Z AI | 10.90 | $0.3 | $0.9 | 72 |
| 391 | Qwen3 235B A22B (Non-reasoning) | Alibaba | 10.80 | $0.7 | $2.8 | 57 |
| 392 | Mistral Small 3.2 | Mistral | 10.70 | $0.1 | $0.3 | 128 |
| 393 | Magistral Small 1 | Mistral | 10.60 | — | — | — |
| 394 | Gemini 2.0 Flash (experimental) | 10.60 | $0 | $0 | — | |
| 395 | EXAONE 4.0 32B (Reasoning) | LG AI Research | 10.50 | — | — | — |
| 396 | Qwen3 VL 8B (Reasoning) | Alibaba | 10.50 | $0.18 | $2.1 | 115 |
| 397 | Nova 2.0 Omni (Non-reasoning) | Amazon | 10.40 | $0.3 | $2.5 | — |
| 398 | Qwen3 14B (Reasoning) | Alibaba | 10.40 | $0.35 | $4.2 | 61 |
| 399 | DeepSeek R1 0528 Qwen3 8B | DeepSeek | 10.30 | — | — | — |
| 400 | Llama 4 Scout | Meta | 10.30 | $0.18 | $0.66 | 133 |
what intelligence means
A composite of nine independent evaluations covering reasoning, coding, agentic work and knowledge. Higher is better. It is versioned, so scores are comparable within a version rather than across all time.
