Best speech-to-speech models
Realtime voice models, scored on Big Bench Audio.
Qwen3.5 Omni Plus Realtime leads from Alibaba, ahead of 33 others.
- 1Alibaba
Qwen3.5 Omni Plus Realtime
0.99 big bench audio
- 2Alibaba
Qwen Audio 3.0 Realtime Plus
0.99 big bench audio
- 3StepFun
Step-Audio R1.1 (Realtime)
0.98 big bench audio
ranked by big bench audio · 34 models · updated Aug 30
| # | Model | Creator | Big Bench Audio |
|---|---|---|---|
| 1 | Qwen3.5 Omni Plus Realtime | Alibaba | 0.99 |
| 2 | Qwen Audio 3.0 Realtime Plus | Alibaba | 0.99 |
| 3 | Step-Audio R1.1 (Realtime) | StepFun | 0.98 |
| 4 | Gemini 3.1 Flash Audio Preview (Mar 2026) - High | 0.97 | |
| 5 | Grok Voice Think Fast 1.0 | SpaceXAI | 0.97 |
| 6 | GPT-Realtime-2 High | OpenAI | 0.97 |
| 7 | Grok Voice Think Fast 2.0 High | SpaceXAI | 0.97 |
| 8 | Qwen Audio 3.0 Realtime Flash | Alibaba | 0.96 |
| 9 | GPT-Realtime-2.1 High | OpenAI | 0.96 |
| 10 | Grok Voice Agent | SpaceXAI | 0.93 |
| 11 | GPT-Realtime-2 Medium | OpenAI | 0.93 |
| 12 | Gemini 2.5 Flash Native Audio Dialog Thinking | 0.91 | |
| 13 | Nova 2.0 Sonic | Amazon | 0.88 |
| 14 | GPT-Realtime-2.1 Minimal | OpenAI | 0.87 |
| 15 | Deepslate Opal | Deepslate | 0.85 |
| 16 | GPT Realtime (Aug 2025) | OpenAI | 0.83 |
| 17 | GPT-Realtime-1.5 | OpenAI | 0.81 |
| 18 | GPT-Realtime-2.1 Mini High | OpenAI | 0.75 |
| 19 | GPT-Realtime-2 Minimal | OpenAI | 0.72 |
| 20 | Gemini 3.1 Flash Audio Preview (Mar 2026) - Minimal | 0.71 | |
| 21 | Gemini 2.5 Flash Native Audio Dialog | 0.69 | |
| 22 | GPT-4o mini Realtime (Dec '24) | OpenAI | 0.69 |
| 23 | Higgs Realtime | Boson AI | 0.69 |
| 24 | GPT Realtime Mini (Oct 2025) | OpenAI | 0.64 |
| 25 | GPT-Realtime-2.1 Mini Minimal | OpenAI | 0.63 |
| 26 | Qwen3.5 Omni Flash Realtime | Alibaba | 0.59 |
| 27 | Qwen3 Omni 30B A3B Instruct | Alibaba | 0.59 |
| 28 | Qwen3 Omni 30B A3B Instruct (Realtime) | Alibaba | 0.57 |
| 29 | GPT 4o audio chatcompletions | OpenAI | 0.54 |
| 30 | Freeze-Omni | VITA-MLLM | 0.33 |
| 31 | Nemotron 3 VoiceChat (V1) | NVIDIA | 0.27 |
| 32 | PersonaPlex | NVIDIA | 0.19 |
| 33 | FLM-Audio | Cofe AI | 0.16 |
| 34 | Moshi | Kyutai | 0.04 |
what big bench audio means
A spoken reasoning benchmark, scored from zero to one. Higher is better.
