Best speech-to-speech models

Realtime voice models, scored on Big Bench Audio.

Qwen3.5 Omni Plus Realtime leads from Alibaba, ahead of 33 others.

  1. 1Alibaba

    Qwen3.5 Omni Plus Realtime

    0.99 big bench audio

  2. 2Alibaba

    Qwen Audio 3.0 Realtime Plus

    0.99 big bench audio

  3. 3StepFun

    Step-Audio R1.1 (Realtime)

    0.98 big bench audio

ranked by big bench audio · 34 models · updated Aug 30

#ModelBig Bench Audio
1Qwen3.5 Omni Plus Realtime
0.99
2Qwen Audio 3.0 Realtime Plus
0.99
3Step-Audio R1.1 (Realtime)
0.98
4Gemini 3.1 Flash Audio Preview (Mar 2026) - High
0.97
5Grok Voice Think Fast 1.0
0.97
6GPT-Realtime-2 High
0.97
7Grok Voice Think Fast 2.0 High
0.97
8Qwen Audio 3.0 Realtime Flash
0.96
9GPT-Realtime-2.1 High
0.96
10Grok Voice Agent
0.93
11GPT-Realtime-2 Medium
0.93
12Gemini 2.5 Flash Native Audio Dialog Thinking
0.91
13Nova 2.0 Sonic
0.88
14GPT-Realtime-2.1 Minimal
0.87
15Deepslate Opal
0.85
16GPT Realtime (Aug 2025)
0.83
17GPT-Realtime-1.5
0.81
18GPT-Realtime-2.1 Mini High
0.75
19GPT-Realtime-2 Minimal
0.72
20Gemini 3.1 Flash Audio Preview (Mar 2026) - Minimal
0.71
21Gemini 2.5 Flash Native Audio Dialog
0.69
22GPT-4o mini Realtime (Dec '24)
0.69
23Higgs Realtime
0.69
24GPT Realtime Mini (Oct 2025)
0.64
25GPT-Realtime-2.1 Mini Minimal
0.63
26Qwen3.5 Omni Flash Realtime
0.59
27Qwen3 Omni 30B A3B Instruct
0.59
28Qwen3 Omni 30B A3B Instruct (Realtime)
0.57
29GPT 4o audio chatcompletions
0.54
30Freeze-Omni
0.33
31Nemotron 3 VoiceChat (V1)
0.27
32PersonaPlex
0.19
33FLM-Audio
0.16
34Moshi
0.04

what big bench audio means

A spoken reasoning benchmark, scored from zero to one. Higher is better.