LLM leaderboard

Every tracked language model by intelligence, with what it costs and how fast it answers.

ranked by intelligence · 611 models · updated Aug 30 · 501–550

#ModelIntelligence
501Llama 3.2 Instruct 90B (Vision)
6.00
502Reka Flash (Sep '24)
6.00
503Solar Mini
6.00
504Grok-1
5.80
505EXAONE 4.0 32B (Non-reasoning)
5.70
506Qwen2 Instruct 72B
5.70
507Phi-4 Mini Instruct
5.70
508Gemma 3 12B Instruct
5.50
509Qwen3.5 2B (Non-reasoning)
5.30
510Gemini 1.5 Flash-8B
5.20
511Qwen3.5 0.8B (Reasoning)
5.20
512Jamba 1.7 Large
5.00
513DeepHermes 3 - Mistral 24B Preview (Non-reasoning)
5.00
514Granite 4.0 H Small
4.90
515Qwen3 Omni 30B A3B Instruct
4.80
516Hermes 3 - Llama-3.1 70B
4.80
517Qwen3 8B (Non-reasoning)
4.80
518Jamba 1.5 Large
4.80
519OLMo 2 32B
4.70
520DeepSeek-Coder-V2
4.70
521Jamba 1.6 Large
4.70
522Gemini 1.5 Flash (May '24)
4.60
523Phi-4
4.60
524LFM2 24B A2B
4.60
525Nova Micro
4.40
526Granite 4.1 3B
4.40
527Claude 3 Sonnet
4.40
528Gemini 1.0 Ultra
4.30
529Mistral Small (Sep '24)
4.30
530Phi-3 Mini Instruct 3.8B
4.30
531Phi-4 Multimodal Instruct
4.20
532NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)
4.20
533Gemma 3n E4B Instruct Preview (May '25)
4.20
534Mistral Large (Feb '24)
4.10
535Qwen2.5 Coder Instruct 7B
4.10
536Mixtral 8x22B Instruct
4.00
537Llama 3.2 Instruct 3B
3.90
538Llama 2 Chat 7B
3.90
539MiniCPM-V 4.6 1.3B
3.80
540Jamba Reasoning 3B
3.80
541Qwen1.5 Chat 110B
3.70
542Reka Flash 3
3.70
543Qwen3 VL 4B Instruct
3.70
544Olmo 3 7B Think
3.60
545Claude 3 Haiku
3.50
546Claude 2.1
3.50
547OLMo 2 7B
3.50
548Ling-mini-2.0
3.40
549Molmo 7B-D
3.40
550DeepSeek-V2-Chat
3.30

what intelligence means

A composite of nine independent evaluations covering reasoning, coding, agentic work and knowledge. Higher is better. It is versioned, so scores are comparable within a version rather than across all time.