
Gemini 3.8 TTS vs Sesame Preview: En av dessa är en nedladdning, den andra är en app
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
Sök efter en jämförelse mellan Gemini 3.8 Flash TTS och Sesame Preview och du kommer att hitta massor av texter som behandlar dem som två produkter i samma kategori. De är det inte, och skillnaden är inte en teknikalitet. Gemini 3.8 Flash TTS är en API-slutpunkt: den har en modellidentifierare, ett publicerat prisblad, en rad på en resultattavla på plats 2 med en Elo på 1 260 över 1 999 sampel på Artificial Analysis Provider Voice Arena, och ett dokumenterat förfrågningsformat. Sesame Preview är en gratis konsumentapp för röstassistenter med namngivna agenter, samtal med flera turer och en samtalsgräns på 30 minuter. Den har inget API, inget modell-ID, ingen faktureringsplan och ingen poäng på den tavlan.
Den enda Sesame-artefakten som du faktiskt kan bygga vidare på är återigen en helt annan sak: CSM-1B, en Apache 2.0-checkpoint på Hugging Face som genererar ljudkoder från text med en Llama-backbone och en Mimi-ljudavkodare. Det är inte rösten som folk pratar om när de beskriver hur mänsklig appen låter. Så jämförelsen landar i en fråga som går att besvara: vill du hyra en talmodell, eller vill du ladda ner en?

Två saker som heter Sesame, och bara en av dem går att bygga
Namngivningen är källan till det mesta av förvirringen, så separera den innan du går vidare.
• Sesame Preview – appen. Gratis att använda, agenter som heter Maya, Miles, Simone och Charlie, konversation i flera turer med kontext som består mellan turerna, webbsökning och påminnelser som funktioner, endast engelska, en gräns på 30 minuter per samtal. Det finns ingen utvecklaryta: inget att autentisera mot, inget att mäta, ingen slutpunkt att anropa.
• CSM-1B — checkpointen. Publicerad på Hugging Face under sesame/csm-1b med en Apache 2.0-licens, en Llama-backbone och en mindre avkodare som producerar Mimi-ljudkoder. Ungefär 2 miljarder parametrar, engelska, F32-vikter, och den körs via Hugging Face Transformers. Modellkortet dokumenterar att 1B-varianten släpptes i mars 2025 och att inbyggt Transformers-stöd kom i maj 2025.
De två delar ett företag och en forskningslinje, och det är ungefär där relationen slutar. Appen är en produkt; checkpointen är en artefakt från forskningen som föregick den. Recensenter som berömmer appens samtalsminne beskriver ett system med retrieval och tillståndshantering kring en talmodell, inte en egenskap hos 2B-checkpointen du kan ladda ner.
Vad finns det egentligen i checkpointen?
CSM-1B är en text-till-tal-modell i den arkitektoniska bemärkelse som spelar roll för alla som planerar att köra den: den tar text och ljudkontext som indata och ger ut RVQ-ljudkoder, som dekodern omvandlar till vågform. De praktiska fakta från modellkortet:
• Licens — Apache 2.0. Detta är den enskilt mest avgörande raden på sidan. Till skillnad från licenser för modellvikter som endast är avsedda för forskning tillåter Apache 2.0 kommersiell användning utan ett separat avtal, vilket gör CSM-1B till en av få genuint användbara öppna checkpointar för tal.
• Storlek — cirka 2B parametrar i F32. Stor nog att kräva riktig hårdvara för allt som körs parallellt, liten nog att köras på en enda accelerator för utveckling.
• Språk — engelska, enligt kortet. Inte en flerspråkig modell.
• Genomslag — 141 461 nedladdningar den senaste månaden när detta skrivs, med ungefär 245 000 gillningar i repositoriet. Det är en flitigt använd checkpoint med öppna talmodellers mått mätt, och det är det starkaste argumentet för att artefakten har en verklig användarbas oberoende av pressen kring appen.

Det kortet inte ger dig är ett kvalitetsanspråk som du kan jämföra med något. Det finns ingen arena-rad, inget leverantörsbenchmark som återgetts av en tredje part, och ingen publicerad utvärdering av hur checkpointens utdata förhåller sig till appens. Den som säger att den nedladdningsbara modellen låter som appen drar den slutsatsen från namnet.
Varför det inte finns någon direkt jämförelse, och varför det inte är ett forskningsgap
Det finns ingen jämförelse mellan Gemini 3.8 TTS och Sesame Preview på topplistorna, eftersom det inte kan finnas någon. Arenan rangordnar modeller genom att låta lyssnare jämföra klipp som producerats av en hostad endpoint. Den ena sidan av detta par har ingen endpoint, så den kan inte registreras.
Det är värt att vara precis om, eftersom "ingen direkt jämförelse finns" ofta skrivs som om data saknades. Den saknas inte. Den är odefinierad. De två sakerna som jämförs delar inte en mätbar yta:
• Gemini 3.8 Flash TTS poängsätts utifrån sina inbyggda hostade röster. Sesame Preview har inga inbyggda röster att poängsätta i den bemärkelsen – den har agenter.
• Gemini 3.8 Flash TTS publicerar en prislista i tokens. Sesame Preview är gratis och publicerar ingenting, eftersom det inte finns något att fakturera.
• Gemini 3.8 Flash TTS tar ett manus och returnerar ljud. Sesame Preview tar en konversation och returnerar en konversation, med vilken hämtning och vilket minne appen än lägger ovanpå.
Det närmaste en legitim jämförelse man kan komma är mellan Gemini 3.8 Flash TTS och CSM-1B, och även den är ojämn: den ena har ett oberoende Elo och en prislista från leverantören, den andra har ingetdera. Det man kan jämföra är formen på åtagandet — ett mätarstyrt API mot en nedladdningsbar checkpoint — och den jämförelsen behöver ingen topplista.
Den enda sidan av detta som har siffror på sig
Allt kvantitativt i den här konstellationen ligger på Googles sida, vilket i sig är poängen.
På Artificial Analysis Provider Voice Arena, hämtad den 24 september 2026, ligger Gemini 3.8 Flash TTS på plats 2 med ett Elo på 1 260 över 1 999 sampel och 8 arena-röster, släppt den 23 september 2026. Dess syskonmodell Gemini 3.8 Flash-Lite TTS ligger på plats 6 med 1 235. Google fakturerar för Flash TTS 0,50 USD per miljon inkommande texttokens och 9,00 USD per miljon utgående ljudtokens fram till och med den 31 december 2026, därefter 18,00 USD, medan Flash-Lite TTS ligger på 0,50 USD och 6,00 USD, därefter 12,00 USD; Artificial Analysis normaliserar dessa till 16,50 USD och 11,00 USD per miljon tecken så att de kan dela en resultattavla med modeller som fakturerar i andra enheter. Den normaliseringen är resultattavlans aritmetik, inte ett citat från Google.
I motsats till det har CSM-1B inget pris eftersom den inte har någon mätare. Den har ett nedladdningsantal, en licens och ett parameterantal. Om ditt beslutsramverk behöver ett Elo kommer den här jämförelsen inte att tillhandahålla ett för Sesame-sidan, och den ärliga slutsatsen är att de två alternativen utvärderas utifrån olika kriterier snarare än att ett av dem är obevisat.

Om det du ville ha var appupplevelsen
Många som söker på den här jämförelsen väljer egentligen inte en modell alls. De har använt Sesame-appen, gillade hur samtalet kändes och vill ha det i sin produkt. Det är ett annat problem, och nedladdningen kommer inte att lösa det.
Det som får appen att kännas som den gör är till största delen inte talmodellen. Beständig kontext mellan turer, beslutet att söka på webben mitt i en konversation, tajmingen för när en agent talar – det är orkestrering, och inget av det finns i en 2B-checkpoint. Att ladda ner CSM-1B ger dig en röst. Att bygga appens beteende ovanpå det är ditt ingenjörsarbete, och 30-minutersgränsen för samtal och avsaknaden av ett API gör att du inte heller kan hyra den färdiga versionen.
Om det du ville ha var en talmodell du kan anropa är det ärliga svaret att {{1}}Gemini 3.8 Flash TTS{{/1}} är alternativet med ett dokumenterat gränssnitt, ett publicerat pris, en oberoende poäng och tvåtalardialog i en enda begäran. Om det du ville ha var vikter du kan behålla är {{2}}CSM-1B{{/2}} under {{3}}Apache 2.0{{/3}} den av de två som du faktiskt kan hålla i handen — och bytet är att du själv står för hårdvaran, serveringsstacken och varje kvalitetsgaranti.
OrcaRouter hostar ingen av dessa. Googles modell anropas via Googles eget API och de ytor som nämns i dess tillkännagivande den 23 september; CSM-1B är en checkpoint som du kör själv. Vad OrcaRouter är till för är lagret ovanför det valet: över 200 modeller bakom en enda nyckel till leverantörens listpris utan påslag, så att en ändring av leverantörens taxa är aktiv samma dag, automatisk redundansväxling så att en experimentell rutt inte blir ett produktionsberoende, och ett routing-DSL som sätter samman modeller till ett enda anrop när en enda röst inte är hela jobbet.
Den korta versionen av den här jämförelsen är att det inte egentligen är en jämförelse. Den ena sidan har ett prisschema och ett Elo; den andra har en licens och ett nedladdningsantal. Välj den vars kolumn du faktiskt kan fylla i.
