LLM leaderboard

Every tracked language model by intelligence, with what it costs and how fast it answers.

ranked by intelligence · 611 models · updated Aug 30 · 451–500

#ModelIntelligence
451GPT-4o (ChatGPT)
8.10
452LFM2.5-8B-A1B
8.10
453Llama 3.1 Tulu3 405B
8.10
454Ring-flash-2.0
8.00
455Pixtral Large
8.00
456Olmo 3.1 32B Think
7.90
457GPT-5 nano (minimal)
7.80
458Grok 2 (Dec '24)
7.80
459Gemini 1.5 Flash (Sep '24)
7.80
460GPT-4 Turbo
7.70
461Qwen3 VL 4B (Reasoning)
7.70
462Solar Pro 2 (Non-reasoning)
7.60
463Command A
7.50
464Nova Pro
7.50
465Gemma 3 27B Instruct
7.40
466Qwen3.5 2B (Reasoning)
7.40
467Llama 3.1 Nemotron Instruct 70B
7.40
468Llama 3.1 Instruct 8B
7.40
469Grok Beta
7.30
470Qwen2.5 Instruct 32B
7.20
471NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)
7.20
472NVIDIA Nemotron Nano 9B V2 (Non-reasoning)
7.20
473Ministral 3 3B
7.10
474Mistral Large 2 (Jul '24)
7.00
475Qwen2.5 Coder Instruct 32B
6.90
476Qwen3 4B 2507 Instruct
6.90
477GLM-4.5V (Non-reasoning)
6.80
478GPT-4
6.80
479Qwen3 14B (Non-reasoning)
6.80
480Gemini 2.5 Flash-Lite (Non-reasoning)
6.70
481Hermes 4 - Llama-3.1 70B (Non-reasoning)
6.70
482Nova Lite
6.70
483GPT-4o mini
6.70
484Mistral Small 3
6.70
485Qwen3 30B A3B (Non-reasoning)
6.60
486Llama 3.1 Instruct 70B
6.50
487DeepSeek-V2.5 (Dec '24)
6.50
488Qwen3 4B (Non-reasoning)
6.50
489Sarvam 30B (high)
6.40
490Granite 4.1 8B
6.40
491DeepSeek-V2.5
6.40
492Gemini 2.0 Flash Thinking Experimental (Dec '24)
6.40
493DeepSeek R1 Distill Llama 8B
6.20
494Gemma 4 E2B (Non-reasoning)
6.20
495Mistral Saba
6.20
496Olmo 3.1 32B Instruct
6.20
497Gemini 1.5 Pro (May '24)
6.10
498Olmo 3 32B Think
6.10
499Qwen2.5 Turbo
6.00
500R1 1776
6.00

what intelligence means

A composite of nine independent evaluations covering reasoning, coding, agentic work and knowledge. Higher is better. It is versioned, so scores are comparable within a version rather than across all time.