
Gemini 3.8 Live vs Gemini 3.8 TTS: En samtalsloop och en uppläsningsröst delar ett generationsnamn
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 36 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 181 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Gemini 3.8 Live är en tal-till-tal-modell som lanserades den 15 september 2026 som gemini-3.8-live och gemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" är inte en modell alls – det är samlingsbegreppet som bevakningen av lanseringen, inklusive Googles egen rubrik, använder för de två text-till-tal-endpoints som kom den 23 september 2026 som gemini-3.8-flash-tts och gemini-3.8-flash-lite-tts. Så det här är inte den vanliga jämförelsesidan, där två produkter slåss om en och samma uppgift. Det är en sida om två uppgifter som delar ett generationsnummer, och om det specifika misstag folk gör när de behandlar orden "Live" och "TTS" som två varianter av samma sak.
Förgreningen som det delade generationsnumret döljer
Googles dokumentation om talgenerering drar själv gränsen, och meningen är lätt att ögna förbi: "TTS-funktionen skiljer sig från talgenerering som tillhandahålls via Live API." Samma stycke förklarar varför, och orsaken är strukturell snarare än en fråga om kvalitet. Live API är byggt för "interaktivt, ostrukturerat ljud och multimodala indata och utdata." TTS via Gemini API "är skräddarsytt för scenarier som kräver exakt uppläsning av text med finkornig kontroll." En senare not gör indataformen explicit: TTS-modellerna tar endast text och returnerar endast ljud.
Den enda begränsningen – text in, ljud ut, ingen ljudingång – är hela jämförelsen. En Gemini 3.8 Live-modell hör personen som talar till den. En Gemini 3.8 Flash TTS- eller Flash-Lite TTS-modell hör aldrig någon; den läser en sträng och framför den. Allt annat följer av det: benchmarkarna som finns för den ena är meningslösa för den andra, prissättningen mäts i olika enheter, och felmoderna är inte jämförbara alls.
Detta spelar roll eftersom de två användningsfallen ser identiska ut utifrån. En röstagent och en berättarpipeline producerar båda i slutändan människoliknande tal. Bara en av dem kan avbrytas.
Där "Gemini 3.8 TTS" faktiskt löses upp
Öppna tabellen över modeller som stöds för Gemini API:s talgenerering så hittar du fyra TTS-poster och ingen post som heter Gemini 3.8 TTS. Två av dem är den här generationen: Gemini 3.8 Flash TTS, modell-ID gemini-3.8-flash-tts, med 130 språk, och Gemini 3.8 Flash-Lite TTS, modell-ID gemini-3.8-flash-lite-tts, med 101 språk. De andra två – Gemini 3.1 Flash TTS Preview och Gemini 2.5 Pro Preview TTS – är den förhandsversionsgeneration som Flash-Lite ersätter.
Så när någon säger ”Gemini 3.8 TTS” syftar de vanligtvis på Flash-nivån, eftersom det är den som lanseringsinlägget lyfter fram och den som Arena-tavlan rankar högst. När de säger det om en live-röstagent syftar de på ingenting, eftersom det de vill ha finns på en annan endpoint med ett annat namn och ett annat indatakontrakt.
Det finns en tredje kollision värd att nämna, eftersom den ger de sämsta råden. Gemini 3.8 Live är inte en text-till-tal-modell med extrafunktioner. Det är en tal-till-tal-modell, och anledningen till att den kostar mer per enhet är att den utför mer arbete per enhet: lyssnar, resonerar mitt i yttranden, hanterar avbrott och, i varianten Extended Thinking, överlägger innan den svarar.
Det enda numret som verkligen jämför
Kvalitetspoäng överförs inte mellan dessa två familjer; det finns ingen enskild resultattavla som poängsätter en berättarröst och en samtalsröst på samma axel. Pengar överförs däremot, när man väl väljer enhet på ett ärligt sätt, och den ärliga enheten för allt som rör röst är ljudtimmen.
• Debiteras in — Gemini 3.8 Live fakturerar per minut ljud, $0,005 per minut in och $0,018 per minut ut jämfört med Gemini 3.8 Flash TTS som fakturerar per miljon ljudtoken, $9,00 fram till 31 december 2026 och $18,00 därefter
• Debiteras ut — Gemini 3.8 Live tvåvägsljud kostar cirka $1,38 för en timme med samtidig in- och utmatning enligt listpris, före eventuell prompt-cachning, jämfört med att Gemini 3.8 Flash TTS är en enkelriktad ström, och en miljon tecken färdig berättarröst landar på $16,5 enligt normaliseringen från Artificial Analysis
• Textinmatning — Gemini 3.8 Live fakturerar text och ljud på separata rader, $0,75 per miljon texttoken in och $4,50 ut jämfört med TTS-slutpunkterna som fakturerar textinmatning till $0,50 per miljon token
• Flash-Lite-nivå — Gemini 3.8 Live har ingen billigare syskonmodell; valet är Live eller Extended Thinking jämfört med Gemini 3.8 Flash-Lite TTS som listas till $6,00 och sedan $12,00 per miljon ljudtoken, med Artificial Analysis på $11,0 per miljon tecken
• Ingångsformat — Gemini 3.8 Live ljud, video och text in, ljud ut jämfört med TTS-slutpunkterna text in, ljud ut
Live-siffran är vår beräkning utifrån Googles publicerade minutpriser, inte en timsiffra som Google har publicerat. Teckensiffrorna är normaliseringen från Artificial Analysis och är de som ska anges när du jämför syntesnivåer. Observera att Artificial Analysis har en egen Speech to Speech-tavla med en separat kolumn för kostnad per timme för ljudinmatning för Live-modellerna – cirka 3,50 USD för Gemini 3.8 Live och 0,84 USD för varianten Extended Thinking – vilket är ännu en annan normalisering och inte bör ställas mot minutprislistan som om de två vore samma mätning.

Vad går sönder när du väljer fel?
Felmoderna är lärorika eftersom de är så olika.
Anropa en TTS-endpunkt när du behövde en samtalsloop och inget går fel. Anropet returnerar giltigt ljud. Du får ett flytande, väluppläst svar på en fast sträng, och sedan tystnad — för det fanns aldrig någon som lyssnade. Team upptäcker detta när de bygger sitt första barge-in-test och inser att "användaren" måste vänta på att hela klippet ska spelas klart innan nästa tur kan börja. Att i efterhand bygga in en konversation i en syntesendpunkt innebär att lägga till taligenkänning, en turordningspolicy och en avbrottsmekanism runt den, och vid det laget har du byggt upp en kaskad igen och betalar för två modeller istället för en.
Anropa en Live-endpoint när du behövde uppläsning, och du betalar för kapacitet du inte använder. En Live-modell mäts i båda riktningarna, eftersom den förväntar sig båda riktningarna. För en ljudbok eller en voiceover till en utbildningsvideo är inputsidan ett manus som aldrig ändras, och modellen behöver aldrig höra något. Du köper en konversationsloop för att läsa upp ett dokument högt.
Det enda fallet där valet verkligen är svårt är kaskaden: igenkänning, sedan resonemang, sedan syntes. Den arkitekturen är inte föråldrad, och för många produktionssystem är den fortfarande den rätta, eftersom den låter dig byta ut varje steg oberoende av de andra och välja en annan leverantör för varje. Den kostar dig latens, och den kostar dig den prosodi som en enda end-to-end-modell behåller över en turgräns. Avvägningen är verklig åt båda hållen.
Där rutten redan finns
OrcaRouter tillhandahåller inte Gemini 3.8 Live-slutpunkterna eller 3.8 TTS-slutpunkterna, och det förtjänar att sägas innan något annat om routing sägs, eftersom motsatsen är lätt att anta utifrån en så här bred katalog. Vad katalogen däremot innehåller är resten av familjen – google/gemini-3.8-flash bland 28 Google-modeller och över 200 modeller totalt, från en enda nyckel till leverantörens listpris utan påslag.
Det spelar särskilt stor roll för kaskaden. Om din arkitektur är igenkänning, sedan resonemang, sedan syntes, är resonemangssteget det där en enda nyckel hos många leverantörer lönar sig, eftersom det är steget du byter oftast och steget där en leverantörs prissänkning bör nå din faktura samma dag i stället för vid nästa avtalsförnyelse. Det är också steget där automatisk redundansväxling gör nytta: en kaskad har tre ställen att brista på, och det mellersta är billigast att göra redundant.

En kort beslutsregel
Om modellen måste svara på något som den inte redan hade som text vill du ha Gemini 3.8 Live, och du bör budgetera utifrån Googles ljudpriser per minut och räkna med att behöva fundera över vilken av de två varianterna du behöver. Om texten redan är skriven och uppgiften är att framföra den vill du ha Gemini 3.8 Flash TTS eller Flash-Lite TTS, och du bör budgetera per miljon tecken och välja nivå utifrån språktäckning och utifrån om kvalitetsgapet är värt prisskillnaden.
Och om du blir ombedd att jämföra ”Gemini 3.8 Live och Gemini 3.8 TTS” som om de vore två produkter, är det första användbara du kan göra att fråga vilken endpoint det gäller. Namnet i briefen motsvarar inte en enda, och svaret förändrar arkitekturen snarare än bara fakturan.

