Een gegenereerde hero-kaart voor 'Gemini 3.8 TTS vs Sesame Preview' op een witte achtergrond met zachte blauw-en-cyaan gradientaccenten. De linkerkaart 'Gemini 3.8 Flash TTS' vermeldt Elo 1.260 op rang 2, 8 arenastemmen, een API-endpoint en $16,50 per 1M tekens genormaliseerd; de rechterkaart 'Sesame' splitst zich in 'Preview-app — gratis, alleen Engels, geen API, geen model-ID' en 'CSM-1B-checkpoint — Apache 2.0, 2B parameters, Llama-backbone'. Een voetregel luidt: 'Elo volgens Artificial Analysis Provider Voice Arena, sept. 2026; details over CSM-1B volgens de bijbehorende modelkaart.' Het OrcaRouter-logo is in de rechteronderhoek samengevoegd.
Guides & Insights

Gemini 3.8 TTS vs Sesame Preview: Een van deze is een download, de andere is een app

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zoek naar een vergelijking tussen Gemini 3.8 Flash TTS en Sesame Preview en je zult volop teksten vinden die ze als twee producten in dezelfde categorie behandelen. Dat zijn ze niet, en het verschil is geen technisch detail. Gemini 3.8 Flash TTS is een API-endpoint: het heeft een model-ID, een gepubliceerde prijslijst, een notering op plaats 2 met een Elo van 1.260 over 1.999 samples in de Artificial Analysis Provider Voice Arena, en een gedocumenteerd aanvraagformaat. Sesame Preview is een gratis consumenten-app voor spraakassistentie met benoemde agents, gesprekken met meerdere beurten en een limiet van 30 minuten per gesprek. Het heeft geen API, geen model-ID, geen factureringsplan en geen score op die ranglijst.

Het enige Sesame-artefact waarop je daadwerkelijk kunt voortbouwen, is weer iets anders: CSM-1B, een Apache 2.0-checkpoint op Hugging Face dat audiocodes uit tekst genereert met een Llama-backbone en een Mimi-audiodecoder. Het is niet de stem waar mensen het over hebben wanneer ze beschrijven hoe menselijk de app klinkt. Dus de vergelijking komt neer op een vraag die beantwoordbaar is: wil je een spraakmodel huren, of wil je er een downloaden?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

Twee dingen die Sesame heten, en slechts één ervan is bouwbaar.

De naamgeving is de bron van de meeste verwarring, dus scheid dat eerst af voordat je verdergaat.

• Sesame Preview — de app. Gratis te gebruiken, agents genaamd Maya, Miles, Simone en Charlie, gesprekken met meerdere beurten waarbij context over beurten heen behouden blijft, webzoekopdrachten en herinneringen als mogelijkheden, alleen Engels, een limiet van 30 minuten per gesprek. Er is geen ontwikkelaarsoppervlak: niets om tegen te authenticeren, niets om te meten, geen endpoint om aan te roepen.

• CSM-1B — het checkpoint. Gepubliceerd op Hugging Face onder sesame/csm-1b met een Apache 2.0-licentie, een Llama-backbone en een kleinere decoder die Mimi-audiocodes produceert. Ongeveer 2 miljard parameters, Engels, F32-gewichten, en het draait via Hugging Face Transformers. De modelkaart vermeldt dat de 1B-variant in maart 2025 uitkwam en dat native Transformers-ondersteuning in mei 2025 beschikbaar kwam.

Die twee delen een bedrijf en een onderzoekslijn, en daar houdt de relatie ongeveer op. De app is een product; de checkpoint is een artefact uit het onderzoek dat eraan voorafging. Recensenten die het gespreksgeheugen van de app prijzen, beschrijven een systeem met retrieval en statusbeheer rondom een spraakmodel, niet een eigenschap van de 2B-checkpoint die je kunt downloaden.

Wat er eigenlijk in het checkpoint zit

CSM-1B is een tekst-naar-spraakmodel in de architectonische zin die ertoe doet voor iedereen die van plan is het te draaien: het neemt tekst en audiocontext als invoer en geeft RVQ-audiocodes uit, die de decoder omzet in een golfvorm. De praktische feiten uit de modelkaart:

• Licentie — Apache 2.0. Dit is de meest ingrijpende regel op de pagina. Anders dan licenties voor gewichten die uitsluitend voor onderzoek zijn, staat Apache 2.0 commercieel gebruik toe zonder een afzonderlijke overeenkomst, waardoor CSM-1B een van de weinige werkelijk bruikbare open spraak-checkpoints is.

• Grootte — ongeveer 2 miljard parameters in F32. Groot genoeg om echte hardware nodig te hebben voor alles wat gelijktijdig draait, klein genoeg om voor ontwikkeling op één accelerator te draaien.

• Taal — Engels, volgens de kaart. Geen meertalig model.

• Tractie — 141.461 downloads in de afgelopen maand op het moment van schrijven, met ongeveer 245.000 likes op de repository. Dat is een veelgebruikt checkpoint naar de maatstaven van open spraakmodellen, en het is het sterkste argument dat het artefact een echte gebruikersbasis heeft, onafhankelijk van de persaandacht voor de app.

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

Wat de kaart je niet geeft, is een kwaliteitsclaim die je met iets kunt vergelijken. Er is geen arena-rij, geen door een derde partij gereproduceerde leveranciersbenchmark, en geen gepubliceerde evaluatie van hoe de output van het checkpoint zich verhoudt tot die van de app. Iedereen die je vertelt dat het downloadbare model klinkt als de app, leidt dat uit de naam af.

Waarom er geen head-to-head is, en waarom dat geen onderzoekskloof is

Er is geen vergelijking tussen Gemini 3.8 TTS en Sesame Preview op de leaderboards, omdat die er niet kan zijn. De arena rangschikt modellen door luisteraars clips te laten vergelijken die via een gehost endpoint zijn geproduceerd. Eén kant van dit paar heeft geen endpoint en kan dus niet worden ingeschreven.

Het is de moeite waard om daar precies over te zijn, want "er bestaat geen head-to-head" wordt vaak beschreven alsof de gegevens ontbreken. Ze ontbreken niet. Ze zijn ongedefinieerd. De twee dingen die worden vergeleken, hebben geen meetbaar oppervlak gemeen:

• Gemini 3.8 Flash TTS wordt beoordeeld op zijn native gehoste stemmen. Sesame Preview heeft in die zin geen native stemmen om te beoordelen — het heeft agents.

• Gemini 3.8 Flash TTS publiceert een tariefkaart in tokens. Sesame Preview is gratis en publiceert niets, omdat er niets te factureren valt.

• Gemini 3.8 Flash TTS neemt een script en retourneert audio. Sesame Preview neemt een gesprek en retourneert een gesprek, met welke retrieval en geheugen de app er ook bovenop legt.

Het dichtst bij een legitieme vergelijking komt de vergelijking tussen Gemini 3.8 Flash TTS en CSM-1B, en zelfs die is onevenwichtig: de ene heeft een onafhankelijke Elo en een tariefkaart van de leverancier, de andere heeft geen van beide. Wat je kunt vergelijken, is de vorm van de verbintenis — een API met verbruiksmeter tegenover een downloadbaar checkpoint — en die vergelijking heeft geen ranglijst nodig.

De enige kant hiervan met nummers erop

Alles wat kwantitatief is in deze combinatie bevindt zich aan de kant van Google, en dat is precies het punt.

In de Artificial Analysis Provider Voice Arena, vastgelegd op 24 september 2026, staat Gemini 3.8 Flash TTS op rang 2 met een Elo van 1.260 op basis van 1.999 samples en 8 stemmen in de arena, uitgebracht op 23 september 2026. Het zustermodel Gemini 3.8 Flash-Lite TTS staat op rang 6 met 1.235. Google rekent voor Flash TTS $0,50 per miljoen teksttokens als invoer en $9,00 per miljoen audiotokens als uitvoer tot en met 31 december 2026, daarna $18,00, terwijl voor Flash-Lite TTS $0,50 en $6,00 geldt, daarna $12,00; Artificial Analysis normaliseert die naar $16,50 en $11,00 per miljoen tekens, zodat ze op dezelfde ranglijst kunnen staan als modellen die in andere eenheden factureren. Die normalisatie is de rekenkundige bewerking van de ranglijst, niet een uitspraak van Google.

Daar staat tegenover dat CSM-1B geen prijs heeft omdat het geen meter heeft. Het heeft een aantal downloads, een licentie en een aantal parameters. Als jouw beslissingskader een Elo nodig heeft, levert deze vergelijking er geen voor de Sesame-kant, en de eerlijke conclusie is dat de twee opties op verschillende criteria worden beoordeeld, in plaats van dat een van beide onbewezen is.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

Als de app-ervaring was wat je wilde

Veel mensen die naar deze vergelijking zoeken, kiezen helemaal geen model. Ze hebben de Sesame-app gebruikt, vonden hoe het gesprek aanvoelde prettig, en willen dat in hun product. Dat is een ander probleem, en de download zal dat niet oplossen.

Wat bepaalt hoe de app aanvoelt, is grotendeels niet het spraakmodel. Blijvende context tussen gespreksbeurten, de beslissing om tijdens een gesprek het web te doorzoeken, de timing van wanneer een agent spreekt — dat is orkestratie, en niets daarvan zit in een 2B-checkpoint. CSM-1B downloaden geeft je een stem. Het gedrag van de app daarbovenop bouwen is jouw engineering, en de limiet van 30 minuten per gesprek en het ontbreken van een API betekenen dat je de afgewerkte versie ook niet kunt huren.

Als je een spraakmodel wilde dat je kunt aanroepen, dan is het eerlijke antwoord dat Gemini 3.8 Flash TTS de optie is met een gedocumenteerde interface, een gepubliceerde prijs, een onafhankelijke score en een dialoog tussen twee sprekers in één verzoek. Als je gewichten wilde die je kunt behouden, dan is CSM-1B onder Apache 2.0 degene van de twee die je daadwerkelijk in handen kunt houden — en de afweging is dat je zelf zorgt voor de hardware, de servingstack en elke kwaliteitsgarantie.

OrcaRouter host geen van beide. Het model van Google wordt aangeroepen via de eigen API van Google en de oppervlakken die in de aankondiging van 23 september worden genoemd; CSM-1B is een checkpoint dat je zelf draait. Waar OrcaRouter voor dient, is de laag boven die keuze: meer dan 200 modellen achter één sleutel tegen de lijstprijs van de provider zonder prijsopslag, zodat een tariefswijziging van een leverancier dezelfde dag live is, automatische failover zodat een experimentele route geen productieafhankelijkheid is, en een routing-DSL die modellen samenvoegt tot één aanroep wanneer één stem niet het hele werk is.

De korte versie van deze vergelijking is dat het niet echt een vergelijking is. De ene kant heeft een tariefkaart en een Elo; de andere heeft een licentie en een aantal downloads. Kies degene waarvan je de kolom daadwerkelijk kunt invullen.