LLM leaderboard

Every tracked language model by intelligence, with what it costs and how fast it answers.

ranked by intelligence · 611 models · updated Aug 30 · 251–300

#ModelIntelligence
251DeepSeek V3.1 (Reasoning)
21.00
252Qwen3 VL 235B A22B (Reasoning)
20.90
253Nova 2.0 Lite (high)
20.80
254Apriel-v1.6-15B-Thinker
20.80
255GPT-5.1 (Non-reasoning)
20.70
256Qwen3.5 9B (Non-reasoning)
20.60
257EXAONE 4.5 33B
20.50
258Qwen3.5 4B (Reasoning)
20.40
259Gemma 4 26B A4B (Non-reasoning)
20.40
260DeepSeek R1 0528 (May '25)
20.40
261Gemini 2.5 Flash (Reasoning)
20.30
262North Mini Code
20.20
263GPT-5 nano (high)
20.10
264Qwen3 235B A22B 2507 (Reasoning)
19.90
265Nova 2.0 Pro Preview (low)
19.80
266GLM-4.5 (Reasoning)
19.70
267Mistral Small 4 (Reasoning)
19.70
268Kimi K2
19.70
269GPT-4.1
19.60
270Granite 4.2 8B
19.60
271Qwen3 Max (Preview)
19.40
272Devstral 2
19.20
273o3-mini
19.20
274Qwen3.5 Omni Flash
19.20
275GPT-5 nano (medium)
19.20
276Nova 2.0 Lite (medium)
19.20
277Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning)
19.10
278o1-pro
19.10
279JT-MINI
18.80
280Trinity Large Thinking
18.70
281DeepSeek R1 (Jan '25)
18.60
282Grok 3
18.60
283Seed-OSS-36B-Instruct
18.50
284Qwen3 235B A22B 2507 Instruct
18.40
285HyperNova 60B 2605
18.30
286Qwen3 Coder 480B A35B Instruct
18.20
287Qwen3 VL 32B (Reasoning)
18.10
288Sonar Reasoning Pro
18.00
289Nova 2.0 Lite (low)
18.00
290Magistral Medium 1.2
18.00
291MiniMax M1 80k
17.90
292Nemotron Cascade 2 30B A3B
17.80
293GPT-5.4 nano (Non-Reasoning)
17.80
294Gemini 2.5 Flash Preview (Reasoning)
17.70
295Devstral Small 2
17.70
296K2 Think V2
17.40
297LongCat Flash Lite
17.40
298GPT-5 (minimal)
17.30
299o1-preview
17.20
300HyperCLOVA X SEED Think (32B)
17.20

what intelligence means

A composite of nine independent evaluations covering reasoning, coding, agentic work and knowledge. Higher is better. It is versioned, so scores are comparable within a version rather than across all time.