LLM leaderboard

Every tracked language model by intelligence, with what it costs and how fast it answers.

ranked by intelligence · 611 models · updated Aug 30 · 351–400

#ModelIntelligence
351Gemini 2.0 Flash Thinking Experimental (Jan '25)
13.30
352Gemma 4 12B (Non-reasoning)
13.20
353Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning)
13.10
354Motif-2-12.7B-Reasoning
12.80
355Ling-1T
12.70
356Nova Premier
12.70
357Mistral Medium 3
12.50
358Magistral Medium 1
12.50
359Solar Pro 2 (Preview) (Reasoning)
12.50
360Celeris-1
12.40
361Devstral Medium
12.40
362K2-V2 (medium)
12.40
363Llama Nemotron Super 49B v1.5 (Reasoning)
12.40
364Mistral Small 4 (Non-reasoning)
12.30
365GPT-4o (March 2025, chatgpt-4o-latest)
12.30
366Tri-21B-Think
12.30
367Claude 3.5 Haiku
12.20
368Llama 3.3 Nemotron Super 49B v1 (Reasoning)
12.20
369Gemini 2.0 Flash (Feb '25)
12.20
370Gemma 4 E4B (Reasoning)
12.20
371Qwen3 4B 2507 (Reasoning)
11.90
372Sarvam 105B (high)
11.90
373MiniCPM5-1B (Reasoning)
11.90
374Nova 2.0 Lite (Non-reasoning)
11.80
375Claude 3 Opus
11.80
376Gemini 2.0 Pro Experimental (Feb '25)
11.80
377Devstral Small (May '25)
11.80
378MiniCPM5-1B (Non-reasoning)
11.70
379Sonar Reasoning
11.60
380Gemini 2.5 Flash Preview (Non-reasoning)
11.60
381Magistral Small 1.2
11.50
382Qwen3 32B (Reasoning)
11.40
383Gemini 2.5 Flash-Lite (Reasoning)
11.40
384Ministral 3 14B
11.20
385GPT-4o (Nov '24)
11.10
386Qwen3 VL 32B Instruct
11.00
387Nanbeige4.1-3B
11.00
388DeepSeek R1 Distill Qwen 32B
11.00
389LFM2.5-2.6B
11.00
390GLM-4.6V (Non-reasoning)
10.90
391Qwen3 235B A22B (Non-reasoning)
10.80
392Mistral Small 3.2
10.70
393Magistral Small 1
10.60
394Gemini 2.0 Flash (experimental)
10.60
395EXAONE 4.0 32B (Reasoning)
10.50
396Qwen3 VL 8B (Reasoning)
10.50
397Nova 2.0 Omni (Non-reasoning)
10.40
398Qwen3 14B (Reasoning)
10.40
399DeepSeek R1 0528 Qwen3 8B
10.30
400Llama 4 Scout
10.30

what intelligence means

A composite of nine independent evaluations covering reasoning, coding, agentic work and knowledge. Higher is better. It is versioned, so scores are comparable within a version rather than across all time.