Card del titolo principale per 'GPT-Live-1 vs Sesame Preview', con sottotitolo 'La voce migliore qui è quella senza API', con un badge che recita 'Una è gratuita e chiusa, l'altra è a pagamento e richiamabile' e tre card: 'Sesame Preview — app gratuita, nessuna API, voce di produzione non rilasciata', 'GPT-Live-1 — $0,05 al minuto vocale, API pubblica dal 10 settembre 2026' e 'La parte costruibile di Sesame — CSM-1B, Apache-2.0, 1 miliardo di parametri, $7 per 1M caratteri o self-host', sopra una striscia a piè di pagina che recita 'La voce di produzione di Sesame non ha un benchmark pubblicato; i dati vocali di GPT-Live-1 sono riportati da OpenAI.' Il logo OrcaRouter è composto in basso a destra.
Guides & Insights

GPT-Live-1 vs Sesame Preview: La migliore voce in questo confronto è quella che non puoi comprare

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

Chiedete a chiunque li abbia usati entrambi e il confronto non è nemmeno ravvicinato: Sesame Preview è l'assistente vocale più convincente con cui la maggior parte delle persone abbia mai parlato. È anche quello su cui non si può costruire nulla. GPT-Live-1 e Sesame Preview vengono paragonati di continuo — entrambi sono conversazionali, entrambi gestiscono le interruzioni, entrambi suonano come una persona anziché come un centralino automatico — ma sono offerti in modi opposti. GPT-Live-1 è un modello ospitato che si noleggia al minuto, accessibile pubblicamente dal 10 settembre 2026. Sesame Preview è un'app consumer gratuita senza alcuna API, e la voce che impressiona tutti gira su un modello di produzione che non è mai stato rilasciato.

Cosa sia in realtà ognuno

• GPT-Live-1 — il modello vocale full-duplex di OpenAI, in ChatGPT dall'8 luglio 2026, nell'API dal 10 settembre a $0,05 al minuto vocale. Dodici voci API, nessuna clonazione, nessun input di immagini o video, trascrizioni e testo della risposta restituiti con ogni sessione.

• Sesame Preview — l'assistente vocale per i consumatori di Sesame. Gratuito su iOS da maggio 2026, ampiamente disponibile su Android dall'inizio di agosto 2026, oltre a un'anteprima web voice-first. Quattro agenti — Maya, Miles, Simone e Charlie — solo in inglese, con un limite di 30 minuti per chiamata che scende a 5 minuti quando non si è connessi.

• CSM-1B — la parte di Sesame che è aperta: un modello vocale conversazionale da 1B rilasciato con licenza Apache 2.0 il 23 aprile 2026, costruito su una backbone con architettura Llama, con un decoder separato e il codec Mimi di Kyutai, che produce parlato inglese mono a 24 kHz a partire da un contesto di circa 4K token.

Le tre righe sopra sono l'intera forma della decisione. Una società vende un modello al minuto. L'altra regala un'app e rilascia in open source un modello più piccolo che non è quello presente nell'app.

Il divario tra la demo e il download

Sesame è stata insolitamente diretta al riguardo, ed è il fatto più importante in assoluto per chiunque valuti la coppia. La voce nell'app Preview — quella che ha prodotto i clip virali e le recensioni sulla "modalità vocale migliore della categoria" — è un modello di produzione più grande e chiuso. CSM-1B è un checkpoint aperto con 1 miliardo di parametri dello stesso laboratorio e, secondo la valutazione di chi li ha provati entrambi, è una voce decisamente più debole. Inoltre, le sessioni su Preview sono soggette a un tetto massimo e limitate all'inglese, e non c'è alcuna esecuzione di attività: gli agenti parlano, non prenotano, non acquistano e non archiviano nulla.

Ciò lascia agli sviluppatori un'offerta reale ma più ristretta: un checkpoint vocale conversazionale auto-ospitabile senza costi di licenza, ospitato da un fornitore di inferenza di terze parti a 7 dollari per milione di caratteri — circa 0,35 dollari per ora di audio sintetizzato — oppure gratuito sul proprio hardware. Nessuno ha pubblicato un benchmark indipendente né della voce Preview né di CSM-1B, quindi qualsiasi affermazione sulla qualità in un senso o nell'altro è un'impressione d'ascolto, non una misurazione. Inoltre, Sesame non ha pubblicato prezzi pubblici, né un livello enterprise, né un piano di monetizzazione; la direzione dichiarata dall'azienda è orientata a partnership di ricerca e a un prodotto hardware pianificato.

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

Cosa si ottiene con 0,05 $ al minuto che il gratuito non offre

La proposta di GPT-Live-1 a uno sviluppatore non è che suoni migliore, perché quell'argomento è impossibile da vincere contro un modello chiuso che nessuno può misurare. È che la cosa è invocabile e ha un prezzo. Concretamente, quello che ottieni con il contatore in funzione:

• Una sessione che controlli — un ID modello, un endpoint Live Sessions, l'esempio di integrazione pubblicato in esecuzione su WebRTC e una sessione che configuri con istruzioni, voci e un blocco di delega.

• Gestione delle interruzioni come comportamento documentato — 80,1% di interattività su Full Duplex Bench v1.5 contro il 45,4% di GPT-Realtime-2.1, con una latenza di turn-taking di 0,798 secondi e un tasso di successo del 87% nel tool-calling. Tutti e tre sono numeri di OpenAI stessa, pubblicati con il rilascio e non riprodotti da nessuno al momento della scrittura.

• Un backend di ragionamento che scegli tu — il livello vocale passa il lavoro pesante attraverso un confine asincrono a un modello separato indicato nella configurazione della sessione, che continua a lavorare mentre la conversazione prosegue. Nell'esempio della documentazione di Ope​nAI quel backend è GPT-5.6 Terra; al lancio consumer di luglio era GPT-5.5.

• Trascrizioni, testo di risposta e fatturazione modellata sulla telefonia — 3,00 $ per un'ora di linea aperta in modo continuo, addebitata al secondo, con 15 secondi di inizializzazione della sessione accreditati anziché aggiunti.

Sesame ti offre una conversazione migliore e niente di tutto ciò. Se stai costruendo un prodotto, "conversazione migliore, nessuna API, nessun prezzo, nessun benchmark, solo in inglese, limite di 30 minuti" non è un confronto — è una lista d'attesa.

C'è un numero su GPT-Live-1 ora che non esisteva al suo lancio per i consumatori, ed è l'onesto contrappeso a tutto quanto sopra. L'Speech to Speech Index di Artificial Analysis assegna a GPT-Live-1 un punteggio del 69,8% — settimo su undici modelli, dietro a GPT-Realtime-2.1 al 73,9% e dietro a Grok Voice Think Fast 2.0 al 79,0%. Quindi il modello che puoi acquistare non è nemmeno il migliore sulla classifica indipendente. Ciò che la classifica non può valutare è la cosa su cui Sesame sta effettivamente vincendo: nessuno degli undici modelli su quell'indice è stato valutato su come ci si sente a parlarci, e la voce Sesame Preview non ha alcuna riga da nessuna parte.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

La parte dello stack che non appartiene a nessuna delle due aziende

Ecco dove le due opzioni convergono, e dove la decisione smette di essere binaria. Né Sesame Preview né GPT-Live-1 è un agente completo. Gli agenti di Sesame non eseguono compiti; GPT-Live-1 delega esplicitamente a un modello backend tutto ciò che richiede ragionamento, recupero di informazioni o l'uso di uno strumento. In entrambi i progetti il lavoro interessante avviene dietro la voce, in una chiamata a un modello di solo testo, e quello strato è portabile in un modo in cui lo strato vocale non lo è: puoi spostare un backend senza registrare di nuovo un solo prompt per il modello vocale.

Quel backend è anche il punto in cui OrcaRouter è utile, e vale la pena essere precisi su ciò che instradiamo e ciò che non instradiamo. Non instradiamo GPT-Live-1: l'endpoint Live Sessions è di OpenAI, e lo strato vocale lì è fuori portata. Non instradiamo nemmeno il modello di produzione di Sesame, per la ragione più semplice che non è mai stato offerto come API. Ciò che invece instradiamo è lo strato a cui entrambi i prodotti delegano il lavoro. Circa 190 modelli provenienti da undici provider a monte girano dietrouna sola chiave al prezzo di listino del provider, senza ricarichi, con failover automatico tra provider e un DSL di routing che può comporre diversi modelli in un'unica chiamata. Per un team che costruisce su un front end vocale non collaudato, è la protezione che conta: lo strato vocale può essere sostituito o abbandonato senza portarsi dietro lo strato di ragionamento, e il modello su cui hai puntato a marzo può essere rimpiazzato a giugno modificando una sola riga.

Cosa guardare

Tre cose cambierebbero questo confronto, e nessuna di esse è ancora in mano a nessuno. Un'API Sesame — anche a pagamento — trasformerebbe all'istante la voce più forte della categoria in un'opzione su cui costruire, e metterebbe un prezzo reale accanto ai 0,05 $ di GPT-Live-1. Un benchmark pubblicato della voce Preview trasformerebbe un'impressione d'ascolto in un numero, e le valutazioni indipendenti tendono a essere impietose con le voci che hanno sempre e solo gareggiato in demo. E la prima riproduzione esterna dei dati di interattività e latenza di Ope​nAI chiarirebbe se il full duplex è un vero divario di capacità o una valutazione ben scelta.

Fino ad allora, la distinzione onesta è questa. Se stai scegliendo una voce per te stesso, usa Sesame Preview: è gratuita, è migliore e non ti costa nulla preferirla. Se stai scegliendo una voce per un prodotto che devi rilasciare, vendere e supportare, GPT-Live-1 è l'unico dei due che puoi effettivamente acquistare, e il fatto che non sia quello dal suono migliore è il prezzo d'ingresso.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno