
GPT-Live-1 vs Sesame Preview: La migliore voce in questo confronto è quella che non puoi comprare
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice

Chiedete a chiunque li abbia usati entrambi e il confronto non è nemmeno ravvicinato: Sesame Preview è l'assistente vocale più convincente con cui la maggior parte delle persone abbia mai parlato. È anche quello su cui non si può costruire nulla. GPT-Live-1 e Sesame Preview vengono paragonati di continuo — entrambi sono conversazionali, entrambi gestiscono le interruzioni, entrambi suonano come una persona anziché come un centralino automatico — ma sono offerti in modi opposti. GPT-Live-1 è un modello ospitato che si noleggia al minuto, accessibile pubblicamente dal 10 settembre 2026. Sesame Preview è un'app consumer gratuita senza alcuna API, e la voce che impressiona tutti gira su un modello di produzione che non è mai stato rilasciato.
Cosa sia in realtà ognuno
• GPT-Live-1 — il modello vocale full-duplex di OpenAI, in ChatGPT dall'8 luglio 2026, nell'API dal 10 settembre a $0,05 al minuto vocale. Dodici voci API, nessuna clonazione, nessun input di immagini o video, trascrizioni e testo della risposta restituiti con ogni sessione.
• Sesame Preview — l'assistente vocale per i consumatori di Sesame. Gratuito su iOS da maggio 2026, ampiamente disponibile su Android dall'inizio di agosto 2026, oltre a un'anteprima web voice-first. Quattro agenti — Maya, Miles, Simone e Charlie — solo in inglese, con un limite di 30 minuti per chiamata che scende a 5 minuti quando non si è connessi.
• CSM-1B — la parte di Sesame che è aperta: un modello vocale conversazionale da 1B rilasciato con licenza Apache 2.0 il 23 aprile 2026, costruito su una backbone con architettura Llama, con un decoder separato e il codec Mimi di Kyutai, che produce parlato inglese mono a 24 kHz a partire da un contesto di circa 4K token.
Le tre righe sopra sono l'intera forma della decisione. Una società vende un modello al minuto. L'altra regala un'app e rilascia in open source un modello più piccolo che non è quello presente nell'app.
Il divario tra la demo e il download
Sesame è stata insolitamente diretta al riguardo, ed è il fatto più importante in assoluto per chiunque valuti la coppia. La voce nell'app Preview — quella che ha prodotto i clip virali e le recensioni sulla "modalità vocale migliore della categoria" — è un modello di produzione più grande e chiuso. CSM-1B è un checkpoint aperto con 1 miliardo di parametri dello stesso laboratorio e, secondo la valutazione di chi li ha provati entrambi, è una voce decisamente più debole. Inoltre, le sessioni su Preview sono soggette a un tetto massimo e limitate all'inglese, e non c'è alcuna esecuzione di attività: gli agenti parlano, non prenotano, non acquistano e non archiviano nulla.
Ciò lascia agli sviluppatori un'offerta reale ma più ristretta: un checkpoint vocale conversazionale auto-ospitabile senza costi di licenza, ospitato da un fornitore di inferenza di terze parti a 7 dollari per milione di caratteri — circa 0,35 dollari per ora di audio sintetizzato — oppure gratuito sul proprio hardware. Nessuno ha pubblicato un benchmark indipendente né della voce Preview né di CSM-1B, quindi qualsiasi affermazione sulla qualità in un senso o nell'altro è un'impressione d'ascolto, non una misurazione. Inoltre, Sesame non ha pubblicato prezzi pubblici, né un livello enterprise, né un piano di monetizzazione; la direzione dichiarata dall'azienda è orientata a partnership di ricerca e a un prodotto hardware pianificato.

Cosa si ottiene con 0,05 $ al minuto che il gratuito non offre
La proposta di GPT-Live-1 a uno sviluppatore non è che suoni migliore, perché quell'argomento è impossibile da vincere contro un modello chiuso che nessuno può misurare. È che la cosa è invocabile e ha un prezzo. Concretamente, quello che ottieni con il contatore in funzione:
• Una sessione che controlli — un ID modello, un endpoint Live Sessions, l'esempio di integrazione pubblicato in esecuzione su WebRTC e una sessione che configuri con istruzioni, voci e un blocco di delega.
• Gestione delle interruzioni come comportamento documentato — 80,1% di interattività su Full Duplex Bench v1.5 contro il 45,4% di GPT-Realtime-2.1, con una latenza di turn-taking di 0,798 secondi e un tasso di successo del 87% nel tool-calling. Tutti e tre sono numeri di OpenAI stessa, pubblicati con il rilascio e non riprodotti da nessuno al momento della scrittura.
• Un backend di ragionamento che scegli tu — il livello vocale passa il lavoro pesante attraverso un confine asincrono a un modello separato indicato nella configurazione della sessione, che continua a lavorare mentre la conversazione prosegue. Nell'esempio della documentazione di OpenAI quel backend è GPT-5.6 Terra; al lancio consumer di luglio era GPT-5.5.
• Trascrizioni, testo di risposta e fatturazione modellata sulla telefonia — 3,00 $ per un'ora di linea aperta in modo continuo, addebitata al secondo, con 15 secondi di inizializzazione della sessione accreditati anziché aggiunti.
Sesame ti offre una conversazione migliore e niente di tutto ciò. Se stai costruendo un prodotto, "conversazione migliore, nessuna API, nessun prezzo, nessun benchmark, solo in inglese, limite di 30 minuti" non è un confronto — è una lista d'attesa.
C'è un numero su GPT-Live-1 ora che non esisteva al suo lancio per i consumatori, ed è l'onesto contrappeso a tutto quanto sopra. L'Speech to Speech Index di Artificial Analysis assegna a GPT-Live-1 un punteggio del 69,8% — settimo su undici modelli, dietro a GPT-Realtime-2.1 al 73,9% e dietro a Grok Voice Think Fast 2.0 al 79,0%. Quindi il modello che puoi acquistare non è nemmeno il migliore sulla classifica indipendente. Ciò che la classifica non può valutare è la cosa su cui Sesame sta effettivamente vincendo: nessuno degli undici modelli su quell'indice è stato valutato su come ci si sente a parlarci, e la voce Sesame Preview non ha alcuna riga da nessuna parte.

La parte dello stack che non appartiene a nessuna delle due aziende
Ecco dove le due opzioni convergono, e dove la decisione smette di essere binaria. Né Sesame Preview né GPT-Live-1 è un agente completo. Gli agenti di Sesame non eseguono compiti; GPT-Live-1 delega esplicitamente a un modello backend tutto ciò che richiede ragionamento, recupero di informazioni o l'uso di uno strumento. In entrambi i progetti il lavoro interessante avviene dietro la voce, in una chiamata a un modello di solo testo, e quello strato è portabile in un modo in cui lo strato vocale non lo è: puoi spostare un backend senza registrare di nuovo un solo prompt per il modello vocale.
Quel backend è anche il punto in cui OrcaRouter è utile, e vale la pena essere precisi su ciò che instradiamo e ciò che non instradiamo. Non instradiamo GPT-Live-1: l'endpoint Live Sessions è di OpenAI, e lo strato vocale lì è fuori portata. Non instradiamo nemmeno il modello di produzione di Sesame, per la ragione più semplice che non è mai stato offerto come API. Ciò che invece instradiamo è lo strato a cui entrambi i prodotti delegano il lavoro. Circa 190 modelli provenienti da undici provider a monte girano dietrouna sola chiave al prezzo di listino del provider, senza ricarichi, con failover automatico tra provider e un DSL di routing che può comporre diversi modelli in un'unica chiamata. Per un team che costruisce su un front end vocale non collaudato, è la protezione che conta: lo strato vocale può essere sostituito o abbandonato senza portarsi dietro lo strato di ragionamento, e il modello su cui hai puntato a marzo può essere rimpiazzato a giugno modificando una sola riga.
Cosa guardare
Tre cose cambierebbero questo confronto, e nessuna di esse è ancora in mano a nessuno. Un'API Sesame — anche a pagamento — trasformerebbe all'istante la voce più forte della categoria in un'opzione su cui costruire, e metterebbe un prezzo reale accanto ai 0,05 $ di GPT-Live-1. Un benchmark pubblicato della voce Preview trasformerebbe un'impressione d'ascolto in un numero, e le valutazioni indipendenti tendono a essere impietose con le voci che hanno sempre e solo gareggiato in demo. E la prima riproduzione esterna dei dati di interattività e latenza di OpenAI chiarirebbe se il full duplex è un vero divario di capacità o una valutazione ben scelta.
Fino ad allora, la distinzione onesta è questa. Se stai scegliendo una voce per te stesso, usa Sesame Preview: è gratuita, è migliore e non ti costa nulla preferirla. Se stai scegliendo una voce per un prodotto che devi rilasciare, vendere e supportare, GPT-Live-1 è l'unico dei due che puoi effettivamente acquistare, e il fatto che non sia quello dal suono migliore è il prezzo d'ingresso.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
