LLM leaderboard

Every tracked language model by intelligence, with what it costs and how fast it answers.

ranked by intelligence · 611 models · updated Aug 30 · 401–450

#ModelIntelligence
401Qwen2.5 Max
10.10
402Gemini 1.5 Pro (Sep '24)
9.90
403Solar Pro 2 (Preview) (Non-reasoning)
9.90
404Qwen3 VL 30B A3B Instruct
9.90
405Hermes 4 - Llama-3.1 70B (Reasoning)
9.90
406Claude 3.5 Sonnet (Oct '24)
9.80
407DeepSeek R1 Distill Llama 70B
9.80
408DeepSeek R1 Distill Qwen 14B
9.70
409Falcon-H1R-7B
9.70
410GPT-4.1 nano
9.60
411Ling-flash-2.0
9.60
412Gemma 4 E2B (Reasoning)
9.50
413Qwen3 Omni 30B A3B (Reasoning)
9.50
414Sonar
9.40
415GPT-4o (Aug '24)
9.40
416Qwen2.5 Instruct 72B
9.40
417Llama 3.3 Instruct 70B
9.30
418Step3 VL 10B
9.30
419Qwen3 30B A3B (Reasoning)
9.20
420Sonar Pro
9.10
421QwQ 32B-Preview
9.10
422Devstral Small (Jul '25)
9.10
423GLM-4.5V (Reasoning)
9.00
424Mistral Large 2 (Nov '24)
9.00
425Ministral 3 8B
9.00
426Qwen3 30B A3B 2507 Instruct
8.90
427ERNIE 4.5 300B A47B
8.90
428Llama 3.1 Nemotron Ultra 253B v1 (Reasoning)
8.90
429NVIDIA Nemotron Nano 12B v2 VL (Reasoning)
8.80
430Hermes 4 - Llama-3.1 405B (Reasoning)
8.80
431Solar Pro 2 (Reasoning)
8.80
432Gemma 4 E4B (Non-reasoning)
8.70
433Granite 4.1 30B
8.70
434NVIDIA Nemotron Nano 9B V2 (Reasoning)
8.70
435Gemini 2.0 Flash-Lite (Feb '25)
8.60
436NVIDIA Nemotron 3 Nano 4B
8.60
437Hermes 4 - Llama-3.1 405B (Non-reasoning)
8.60
438Llama Nemotron Super 49B v1.5 (Non-reasoning)
8.50
439Qwen3 32B (Non-reasoning)
8.50
440Gemini 2.0 Flash-Lite (Preview)
8.40
441Kimi Linear 48B A3B Instruct
8.40
442Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning)
8.40
443K2-V2 (low)
8.40
444GPT-4o (May '24)
8.40
445Llama 3.1 Instruct 405B
8.30
446Qwen3 8B (Reasoning)
8.30
447Llama 3.3 Nemotron Super 49B v1 (Non-reasoning)
8.30
448Qwen3 4B (Reasoning)
8.20
449Qwen3 VL 8B Instruct
8.20
450Claude 3.5 Sonnet (June '24)
8.10

what intelligence means

A composite of nine independent evaluations covering reasoning, coding, agentic work and knowledge. Higher is better. It is versioned, so scores are comparable within a version rather than across all time.