
StepAudio 3 Realtime vs Sesame Preview: La voce che tutti lodano vs quella che ha un punteggio
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Per gran parte del 2026, l'affermazione più forte che si potesse fare sull'IA vocale era un'impressione d'ascolto. L'assistente di Sesame suonava più umano di qualsiasi altra cosa, e così tante persone lo hanno detto che è diventato il punto di riferimento — senza benchmark, senza un numero e senza alcun modo di verificarlo. Il 15 settembre 2026, StepAudio 3 Realtime è arrivato da StepFun con un numero associato alla versione misurabile più vicina di quella qualità: 98,9% nella valutazione Conversational Dynamics di Artificial Analysis, primo posto. Sesame Preview non compare in quella classifica.
La parte interessante non è che uno abbia battuto l'altro. È che la qualità per cui Sesame è diventato famoso è ora qualcosa che una terza parte valuta, e il modello con la reputazione non è mai stato misurato rispetto ad essa.
Che cosa è in realtà ognuno di questi
Non sono lo stesso tipo di oggetto, e questo determina il confronto più di qualsiasi punteggio.
Sesame Preview è un assistente vocale per consumatori. Gratuito su iOS da maggio 2026 e ampiamente diffuso su Android dall'inizio di agosto 2026, è costruito attorno a quattro agenti con un nome — Maya, Miles, Simone e Charlie — che mantengono il contesto tra le sessioni, cercano sul web e impostano promemoria. È disponibile solo in inglese. Le chiamate hanno un limite di 30 minuti, che scende a cinque minuti quando si è disconnessi. Non esiste un'API per la sua voce di produzione, né un livello enterprise né un prezzo pubblico.
StepAudio 3 Realtime è una superficie per sviluppatori. È uno dei cinque modelli della famiglia StepAudio 3, tutti rilasciati lo stesso giorno e tutti disponibili sulla piattaforma aperta di StepFun come API commerciali. Gestisce conversazioni native full-duplex, ragiona direttamente sul parlato invece di trascriverlo prima e supporta le chiamate agli strumenti e l'esecuzione asincrona di attività di lunga durata mentre la conversazione prosegue. È progettato dando priorità al cinese. Non ha pesi aperti ed è attualmente disponibile con prezzo di anteprima gratuito a tempo limitato, senza che sia stata annunciata una tariffa successiva all'anteprima.
Su uno di questi puoi costruire. L'altro puoi visitarlo.
La cosa misurabile per cui Sesame è famosa
Conversational Dynamics è un benchmark specifico, e vale la pena sapere cosa racchiude. Valuta l'alternanza dei turni, la gestione delle pause, il recupero dopo un'interruzione e se un modello interpreta correttamente un breve backchannel — "uh-huh", "right", "mm" — come incoraggiamento anziché come un tentativo di prendere la parola. Questi sono esattamente i comportamenti che gli ascoltatori descrivono quando dicono che una voce sembra umana anziché robotica, e sono i comportamenti che rendono un assistente piacevole con cui parlare anziché semplicemente accurato.
StepAudio 3 Realtime guida quella classifica al 98,9%, davanti a Qwen Audio 3.0 Realtime Plus al 98,4% e GPT-Realtime-2 al 95,3%. Si posiziona anche primo su Speech Reasoning al 99,7%, come citato da StepFun, dietro cui si cela l'affermazione architetturale secondo cui il ragionamento sull'audio grezzo preserva tono ed enfasi che un passaggio di trascrizione appiattirebbe — la differenza tra sentire il sarcasmo e sentire un complimento.
Ecco come inquadrare onestamente quel risultato. Il benchmark è la cosa più vicina che l'industria abbia a una misura di ciò per cui Sesame è lodato, e Sesame non è stato inserito. Non è una prova che StepAudio 3 Realtime suoni meglio di Sesame. È la prova che una di queste affermazioni è verificabile e l'altra, finora, non lo è — e che quella verificabile è attualmente detenuta da un modello con cui la maggior parte delle persone non ha mai parlato.

L'asimmetria di disponibilità, che è la vera decisione
Tutto quanto sopra è interessante. Questa parte è decisiva.
La voce di Sesame — quella che tutti decantano — è un modello di produzione più grande e chiuso che Sesame non ha mai rilasciato come API. Non puoi acquistarlo, ottenerne una licenza o richiamarlo dal tuo prodotto. Se hai letto che la tempistica conversazionale di Sesame è la migliore disponibile e hai concluso di poterla avere, la conclusione non consegue dalle prove.
Ciò che Sesame ha effettivamente reso open source è CSM-1B, rilasciato con licenza Apache-2.0. È un blocco di sintesi, non un assistente: un backbone Llama predice il primo codebook Mimi e un decoder Llama più piccolo predice il resto, che un codec Mimi rende in una forma d'onda a 24 kHz. È solo in inglese, clona una voce da una clip di riferimento di 10-15 secondi e non può generare testo — lo si abbina a un modello linguistico separato. Chi li ha provati entrambi descrive la voce di CSM-1B come nettamente più debole di quella dell'app Preview, e la scheda del modello dichiara apertamente la parte scomoda: una variante fine-tuned di CSM alimenta la demo interattiva, e quella variante non è il checkpoint che si può scaricare.
StepAudio 3 Realtime non ha nulla di quell'ambiguità. È un'API commerciale con alle spalle una famiglia di modelli pubblicata, un insieme di capacità dichiarato e posizionamenti di terze parti che puoi consultare. È inoltre pensato innanzitutto per il cinese, con prezzo di anteprima, e registra un tempo al primo audio di 8,83 secondi sulla stessa classifica in cui vince per dinamica conversazionale — contro 1,18 secondi di Gemini 3.8 Live e 1,24-1,34 secondi di GPT-Live-1. Qualunque cosa offra in termini di qualità conversazionale, non ha ancora dimostrato di poterla fornire a velocità conversazionale al di fuori della configurazione di serving propria di StepFun.

Cosa fare con questo se stai scegliendo uno stack vocale
Inizia separando le due domande. "Che sensazione dovrebbe dare una conversazione?" e "Cosa posso rilasciare?" hanno risposte diverse, e solo una delle due è una decisione di approvvigionamento.
Se stai calibrando il gusto — decidere quanto calore debba avere il tuo prodotto, quanto silenzio sia confortevole, con quanta rapidità un agente debba cedere la parola — Sesame Preview è gratuito, davvero eccellente e un buon posto dove passare un pomeriggio. Usalo come punto di riferimento. Non pianificare un'integrazione basata su di esso, perché non c'è nulla con cui integrarsi.
Se stai per lanciare, StepAudio 3 Realtime è un candidato reale con avvertenze altrettanto reali: prezzo in anteprima, copertura cinese-first, nessun punteggio indice su Artificial Analysis e la questione della latenza irrisolta. Testa la latenza prima della qualità della conversazione. Un modello che vince il benchmark di turn-taking ma impiega quasi il tempo di una frase per iniziare a parlare è un modello la cui migliore qualità potresti non riuscire mai a dimostrare.
E se la voce di produzione di Sesame ottenesse mai un'API, questo intero confronto verrebbe rieseguito — perché il benchmark che lo risolverebbe esiste già, e Sesame dovrebbe finalmente comparirvi.
Dove il routing è appropriato, e dove non lo è
Gli agenti vocali non sono un unico modello. Che tu stia eseguendo StepAudio 3 Realtime o qualcos'altro, la conversazione affida costantemente lavoro a modelli di testo ordinari — una ricerca, un'estrazione, una chiamata di ragionamento in esecuzione dietro una pausa mantenuta. È in quello strato di delega che risiede la varianza dei costi e dove un'ora negativa di un provider diventa il tuo disservizio.
Per essere precisi sulla nostra copertura: gli endpoint live e vocali della famiglia StepAudio 3 non sono su OrcaRouter, e nemmeno lo è qualsiasi cosa Sesame abbia costruito. Ciò che è su OrcaRouter è il livello di testo a cui un agente vocale delega — quasi 200 modelli dietro un'unica API, failover automatico, un DSL di routing che ne compone diversi in un'unica chiamata, e fusione di modelli quando il giudizio di un singolo modello non è sufficiente, con il prezzo di listino del provider trasferito senza markup.
È questa separazione a rendere la questione della disponibilità meno fatale di quanto sembri. Il modello vocale è una decisione che puoi rivedere; il livello di delega è quello che diventa costoso da districare, ed è quello che vale la pena mettere dietro un router prima di impegnarti con qualsiasi fornitore di voce.

Il verdetto
Sesame Preview vince su ciò che non può essere misurato e perde su tutto ciò che si può comprare. È la voce dal suono migliore disponibile, è gratuita, e non puoi metterla in produzione — e ora che una terza parte assegna un punteggio alla qualità per cui è famosa, la sua assenza da quel tabellone è una lacuna nelle prove, non un vantaggio protetto.
StepAudio 3 Realtime vince su disponibilità, misurabilità e capacità, e solleva autentici interrogativi aperti su prezzo, copertura linguistica e latenza. È l'unico dei due su cui puoi costruire oggi, il che risolve la questione pratica più rapidamente di qualsiasi benchmark.
Cosa tenere d'occhio è semplice, e vale in entrambe le direzioni: un punteggio Conversational Dynamics per la voce di produzione di Sesame, oppure un dato di latenza per StepAudio 3 Realtime che lo collochi nella stessa fascia dei modelli che attualmente batte sulla qualità. L'uno o l'altro trasformerebbe questa da un confronto tra una misurazione e una reputazione in un vero testa a testa.
