Una hero card generata per 'Gemini 3.8 TTS vs Sesame Preview' su sfondo bianco con delicati accenti a gradiente blu e ciano. La card di sinistra 'Gemini 3.8 Flash TTS' elenca Elo 1.260 al rango 2, 8 voci dell'arena, un endpoint API e $16,50 per 1M caratteri normalizzati; la card di destra 'Sesame' si suddivide in 'app Preview — gratuita, solo inglese, nessuna API, nessun ID modello' e 'checkpoint CSM-1B — Apache 2.0, 2B parametri, backbone Llama'. Una riga a piè di pagina recita 'Elo secondo Artificial Analysis Provider Voice Arena, settembre 2026; dettagli CSM-1B secondo la sua model card'. Il logo OrcaRouter è compositato nell'angolo in basso a destra.
Guides & Insights

Gemini 3.8 TTS vs Sesame Preview: Uno di questi è un download, l'altro è un'app

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Cerca un confronto tra Gemini 3.8 Flash TTS e Sesame Preview e troverai moltissimi testi che li trattano come due prodotti della stessa categoria. Non lo sono, e la differenza non è un tecnicismo. Gemini 3.8 Flash TTS è un endpoint API: ha un identificatore di modello, una tabella tariffaria pubblicata, una riga in classifica al secondo posto con un Elo di 1.260 su 1.999 campioni nella Artificial Analysis Provider Voice Arena, e un formato di richiesta documentato. Sesame Preview è un'app gratuita di assistente vocale per consumatori, con agenti dai nomi propri, conversazioni multi-turno e un limite di 30 minuti per chiamata. Non ha API, né ID di modello, né piano di fatturazione, né punteggio in quella classifica.

L'unico artefatto di Sesame su cui puoi effettivamente costruire è ancora qualcosa di diverso: CSM-1B, un checkpoint Apache 2.0 su Hugging Face che genera codici audio dal testo usando un backbone Llama e un decodificatore audio Mimi. Non è la voce di cui le persone parlano quando descrivono quanto suoni umana l'app. Quindi il confronto si risolve in una domanda a cui si può rispondere: vuoi noleggiare un modello vocale o vuoi scaricarne uno?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

Due cose chiamate Sesame, e solo una di esse è costruibile

La denominazione è la fonte di gran parte della confusione, quindi separala prima di andare avanti.

• Sesame Preview — l'app. Utilizzabile gratuitamente, agenti chiamati Maya, Miles, Simone e Charlie, conversazione multi-turno con contesto che persiste tra i turni, ricerca web e promemoria come funzionalità, solo in inglese, un limite di 30 minuti per chiamata. Non esiste alcuna superficie per sviluppatori: nulla con cui autenticarsi, nulla da misurare, nessun endpoint da chiamare.

• CSM-1B — il checkpoint. Pubblicato su Hugging Face con licenza Apache 2.0, un backbone Llama e un decoder più piccolo che produce codici audio Mimi. Circa 2 miliardi di parametri, inglese, pesi F32, e funziona tramite Hugging Face Transformers. La model card documenta che la variante 1B è stata distribuita a marzo 2025 e che il supporto nativo per Transformers è arrivato a maggio 2025.

Quei due condividono un'azienda e una discendenza di ricerca, e più o meno è lì che finisce la loro relazione. L'app è un prodotto; il checkpoint è un artefatto della ricerca che l'ha preceduta. I recensori che elogiano la memoria conversazionale dell'app stanno descrivendo un sistema con retrieval e gestione dello stato attorno a un modello vocale, non una proprietà del checkpoint 2B che puoi scaricare.

Che cosa c'è effettivamente nel checkpoint

CSM-1B è un modello text-to-speech nel senso architetturale che conta per chiunque abbia in programma di eseguirlo: accetta in input testo e contesto audio ed emette codici audio RVQ, che il decoder trasforma in forma d'onda. I fatti pratici dalla model card:

• Licenza — Apache 2.0. Questa è la riga più importante dell'intera pagina. A differenza delle licenze sui pesi destinate solo alla ricerca, Apache 2.0 consente l'uso commerciale senza un accordo separato, il che rende CSM-1B uno dei pochi checkpoint vocali aperti realmente utilizzabili.

• Dimensione — circa 2 miliardi di parametri in F32. Abbastanza grande da richiedere hardware reale per qualsiasi operazione concorrente, abbastanza piccolo da essere eseguito su un singolo acceleratore per lo sviluppo.

• Lingua — Inglese, secondo la scheda. Non un modello multilingue.

• Trazione — 141.461 download nell'ultimo mese al momento in cui scriviamo, con circa 245.000 like sul repository. Si tratta di un checkpoint ampiamente utilizzato secondo gli standard dei modelli vocali aperti, ed è l'argomento più forte a dimostrazione del fatto che l'artefatto abbia una base di utenti reale indipendente dalla copertura mediatica dell'app.

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

Quello che la scheda non ti dà è una dichiarazione di qualità che puoi confrontare con qualsiasi cosa. Non c'è alcuna riga di arena, nessun benchmark del fornitore riprodotto da terzi e nessuna valutazione pubblicata di come l'output del checkpoint si rapporti a quello dell'app. Chiunque ti dica che il modello scaricabile suona come l'app lo sta deducendo dal nome.

Perché non esiste un confronto diretto, e perché non è una lacuna di ricerca

Non esiste un confronto tra Gemini 3.8 TTS e Sesame Preview nelle classifiche perché non può esistere. L'arena classifica i modelli facendo confrontare agli ascoltatori clip prodotte da un endpoint ospitato. Uno dei due lati di questo abbinamento non ha un endpoint, quindi non può essere inserito.

Vale la pena essere precisi al riguardo, perché «non esiste alcun confronto testa a testa» viene spesso descritto come se i dati mancassero. Non mancano. Sono indefiniti. Le due cose messe a confronto non condividono una superficie misurabile:

• Gemini 3.8 Flash TTS viene valutato in base alle sue voci native ospitate. Sesame Preview non ha voci native da valutare in quel senso — ha degli agenti.

• Gemini 3.8 Flash TTS pubblica un listino prezzi in token. Sesame Preview è gratuito e non pubblica nulla, perché non c'è nulla da fatturare.

Gemini 3.8 Flash TTS prende in input uno script e restituisce audio. Sesame Preview prende in input una conversazione e restituisce una conversazione, con tutto il retrieval e la memoria che l'app vi aggiunge sopra.

La cosa più vicina a un confronto legittimo è tra Gemini 3.8 Flash TTS e CSM-1B, e anche quello è squilibrato: uno ha un Elo indipendente e un listino tariffe del fornitore, l'altro non ha né l'uno né l'altro. Ciò che si può confrontare è la forma dell'impegno — un'API a consumo rispetto a un checkpoint scaricabile — e quel confronto non ha bisogno di una classifica.

L'unico lato di questo con sopra dei numeri

Tutto ciò che è quantitativo in questo abbinamento sta dalla parte di Google, il che è di per sé il punto.

Nell'Artificial Analysis Provider Voice Arena, rilevato il 24 settembre 2026, Gemini 3.8 Flash TTS è al 2° posto con un Elo di 1.260 su 1.999 campioni e 8 voci dell'arena, rilasciato il 23 settembre 2026. Il suo gemello Gemini 3.8 Flash-Lite TTS è al 6° posto con 1.235. Google fattura Flash TTS a 0,50 $ per milione di token di testo in ingresso e 9,00 $ per milione di token audio in uscita fino al 31 dicembre 2026, poi 18,00 $, con Flash-Lite TTS a 0,50 $ e 6,00 $, poi 12,00 $; Artificial Analysis li normalizza a 16,50 $ e 11,00 $ per milione di caratteri, così possono condividere una classifica con modelli fatturati in altre unità. Tale normalizzazione è l'aritmetica della classifica, non una quotazione di Google.

Al contrario, CSM-1B non ha un prezzo perché non ha un contatore. Ha un numero di download, una licenza e un numero di parametri. Se il tuo quadro decisionale richiede un Elo, questo confronto non ne fornirà uno per il lato Sesame, e la conclusione onesta è che le due opzioni vengono valutate secondo criteri diversi, piuttosto che una di esse sia non dimostrata.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

Se quello che volevi era l'esperienza dell'app

Molte persone che cercano questo confronto non stanno affatto scegliendo un modello. Hanno usato l'app Sesame, hanno apprezzato come si sentiva la conversazione e vogliono questo nel loro prodotto. Questo è un problema diverso, e il download non lo risolverà.

Ciò che rende l'app come la si percepisce non è principalmente il modello vocale. Il contesto persistente tra i turni, la decisione di cercare sul web a metà conversazione, il tempismo con cui parla un agente: quella è orchestrazione, e nulla di tutto ciò risiede in un checkpoint da 2B. Scaricare CSM-1B ti dà una voce. Costruire il comportamento dell'app sopra di essa è la tua ingegneria, e il limite di 30 minuti per chiamata e l'assenza di un'API fanno sì che tu non possa nemmeno affittare la versione finita.

Se quello che volevi era un modello vocale che puoi chiamare, la risposta onesta è che Gemini 3.8 Flash TTS è l'opzione con un'interfaccia documentata, un prezzo pubblicato, un punteggio indipendente e un dialogo a due voci in un'unica richiesta. Se quello che volevi erano dei pesi che puoi conservare, CSM-1B sotto Apache 2.0 è quello dei due che puoi effettivamente possedere — e il compromesso è che devi fornire tu l'hardware, lo stack di serving e ogni garanzia di qualità.

OrcaRouter non ospita nessuno dei due. Il modello di Google viene chiamato tramite l'API di Google stessa e le superfici citate nel suo annuncio del 23 settembre; CSM-1B è un checkpoint che esegui tu. OrcaRouter serve per lo strato al di sopra di quella scelta: oltre 200 modelli dietro un'unica chiave al prezzo di listino del provider, senza ricarichi, così una variazione delle tariffe del fornitore è attiva lo stesso giorno, failover automatico così una rotta sperimentale non è una dipendenza di produzione, e un DSL di routing che compone i modelli in un'unica chiamata quando una sola voce non basta per l'intero lavoro.

La versione breve di questo confronto è che non è davvero un confronto. Un lato ha un tariffario e un Elo; l'altro ha una licenza e un numero di download. Scegli quello di cui riesci davvero a compilare la colonna.