LLM leaderboard

Every tracked language model by intelligence, with what it costs and how fast it answers.

ranked by intelligence · 611 models · updated Aug 30 · 101–150

#ModelIntelligence
101Gemini 3 Flash Preview (Reasoning)
38.70
102Nemotron 3 Ultra 550B A55B (Reasoning)
38.30
103MiMo-V2.5
38.00
104Grok 4.20 0309 v2 (Reasoning)
38.00
105Grok 4.3 (high)
37.90
106Ling 3.0 Flash
37.80
107Qwen3.6 27B (Reasoning)
37.70
108GPT-5.1 (high)
37.50
109Grok 4.20 0309 (Reasoning)
37.40
110Gemini 3.5 Flash-Lite
37.40
111Solar Open2 250B
37.40
112Claude 4.5 Sonnet (Reasoning)
37.40
113MiMo-V2-Omni-0327
37.30
114GPT-5 Codex (high)
37.00
115Grok 4.3 (medium)
36.90
116Claude Sonnet 4.6 (Non-reasoning, High Effort)
36.80
117GLM-5.1 (Non-reasoning)
36.30
118Grok 4.3 (low)
36.30
119Kimi K2.5 (Reasoning)
36.00
120MiMo-V2-Omni
35.90
121Gemini 3.5 Flash (minimal)
35.80
122GPT-5.5 (Non-reasoning)
35.80
123GPT-5.1 Codex (high)
35.60
124Claude Opus 4.5 (Non-reasoning)
35.60
125Kimi K2.6 (Non-reasoning)
35.40
126GLM 5V Turbo (Reasoning)
35.30
127GPT-5 (high)
35.30
128Muse Glimmer (high)
35.10
129Claude Sonnet 4.6 (Non-reasoning, Low Effort)
35.10
130A.X-K2
35.00
131GLM-5.2 (Non-reasoning)
34.80
132Qwen3.8 27B (Non-reasoning)
34.70
133Qwen3.5 27B (Reasoning)
34.60
134GPT-5 (medium)
34.60
135GPT-5.6 Terra (Non-reasoning)
34.60
136MiniMax-M2.5
34.50
137GLM-4.7 (Reasoning)
34.50
138Claude 4.1 Opus (Reasoning)
34.50
139Hy3-preview (Reasoning)
34.40
140Qwen3.5 397B A17B (Reasoning)
34.30
141GPT-5.5 Instant (May 2026)
34.30
142Grok 4
34.10
143MiMo-V2-Flash (Feb 2026)
34.00
144LongCat 2.0
34.00
145G9v3-39A5B
34.00
146GPT-5.6 Luna (low)
33.90
147Gemini 3 Pro Preview (low)
33.90
148KAT Coder Pro V2
33.70
149Kimi K2 Thinking
33.50
150o3-pro
33.30

what intelligence means

A composite of nine independent evaluations covering reasoning, coding, agentic work and knowledge. Higher is better. It is versioned, so scores are comparable within a version rather than across all time.