Ett genererat herokort för ”Gemini 3.8 Live vs Gemini 3.8 TTS” på vit bakgrund med mjuka gradientaccenter i blått och cyan. En vänsterkolumn med rubriken ”Levereras via Live API” listar ”gemini-3.8-live”, ”hör och talar”, ”ljud in, ljud ut”; en högerkolumn med rubriken ”Levereras via TTS-slutpunkterna” listar ”gemini-3.8-flash-tts”, ”läser skriven text”, ”text in, ljud ut”. En sidfotsrad lyder ”Ingen av dem heter Gemini 3.8 TTS.” OrcaRouter-logotypen är inkomponerad i det nedre högra hörnet.
Guides & Insights

Gemini 3.8 Live vs Gemini 3.8 TTS: En samtalsloop och en uppläsningsröst delar ett generationsnamn

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Gemini 3.8 Live är en tal-till-tal-modell som lanserades den 15 september 2026 som gemini-3.8-live och gemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" är inte en modell alls – det är samlingsbegreppet som bevakningen av lanseringen, inklusive Googles egen rubrik, använder för de två text-till-tal-endpoints som kom den 23 september 2026 som gemini-3.8-flash-tts och gemini-3.8-flash-lite-tts. Så det här är inte den vanliga jämförelsesidan, där två produkter slåss om en och samma uppgift. Det är en sida om två uppgifter som delar ett generationsnummer, och om det specifika misstag folk gör när de behandlar orden "Live" och "TTS" som två varianter av samma sak.

Förgreningen som det delade generationsnumret döljer

Googles dokumentation om talgenerering drar själv gränsen, och meningen är lätt att ögna förbi: "TTS-funktionen skiljer sig från talgenerering som tillhandahålls via Live API." Samma stycke förklarar varför, och orsaken är strukturell snarare än en fråga om kvalitet. Live API är byggt för "interaktivt, ostrukturerat ljud och multimodala indata och utdata." TTS via Gemini API "är skräddarsytt för scenarier som kräver exakt uppläsning av text med finkornig kontroll." En senare not gör indataformen explicit: TTS-modellerna tar endast text och returnerar endast ljud.

Den enda begränsningen – text in, ljud ut, ingen ljudingång – är hela jämförelsen. En Gemini 3.8 Live-modell hör personen som talar till den. En Gemini 3.8 Flash TTS- eller Flash-Lite TTS-modell hör aldrig någon; den läser en sträng och framför den. Allt annat följer av det: benchmarkarna som finns för den ena är meningslösa för den andra, prissättningen mäts i olika enheter, och felmoderna är inte jämförbara alls.

Detta spelar roll eftersom de två användningsfallen ser identiska ut utifrån. En röstagent och en berättarpipeline producerar båda i slutändan människoliknande tal. Bara en av dem kan avbrytas.

Där "Gemini 3.8 TTS" faktiskt löses upp

Öppna tabellen över modeller som stöds för Gemini API:s talgenerering så hittar du fyra TTS-poster och ingen post som heter Gemini 3.8 TTS. Två av dem är den här generationen: Gemini 3.8 Flash TTS, modell-ID gemini-3.8-flash-tts, med 130 språk, och Gemini 3.8 Flash-Lite TTS, modell-ID gemini-3.8-flash-lite-tts, med 101 språk. De andra två – Gemini 3.1 Flash TTS Preview och Gemini 2.5 Pro Preview TTS – är den förhandsversionsgeneration som Flash-Lite ersätter.

Så när någon säger ”Gemini 3.8 TTS” syftar de vanligtvis på Flash-nivån, eftersom det är den som lanseringsinlägget lyfter fram och den som Arena-tavlan rankar högst. När de säger det om en live-röstagent syftar de på ingenting, eftersom det de vill ha finns på en annan endpoint med ett annat namn och ett annat indatakontrakt.

Det finns en tredje kollision värd att nämna, eftersom den ger de sämsta råden. Gemini 3.8 Live är inte en text-till-tal-modell med extrafunktioner. Det är en tal-till-tal-modell, och anledningen till att den kostar mer per enhet är att den utför mer arbete per enhet: lyssnar, resonerar mitt i yttranden, hanterar avbrott och, i varianten Extended Thinking, överlägger innan den svarar.

Det enda numret som verkligen jämför

Kvalitetspoäng överförs inte mellan dessa två familjer; det finns ingen enskild resultattavla som poängsätter en berättarröst och en samtalsröst på samma axel. Pengar överförs däremot, när man väl väljer enhet på ett ärligt sätt, och den ärliga enheten för allt som rör röst är ljudtimmen.

• Debiteras in — Gemini 3.8 Live fakturerar per minut ljud, $0,005 per minut in och $0,018 per minut ut jämfört med Gemini 3.8 Flash TTS som fakturerar per miljon ljudtoken, $9,00 fram till 31 december 2026 och $18,00 därefter
• Debiteras ut — Gemini 3.8 Live tvåvägsljud kostar cirka $1,38 för en timme med samtidig in- och utmatning enligt listpris, före eventuell prompt-cachning, jämfört med att Gemini 3.8 Flash TTS är en enkelriktad ström, och en miljon tecken färdig berättarröst landar på $16,5 enligt normaliseringen från Artificial Analysis
• Textinmatning — Gemini 3.8 Live fakturerar text och ljud på separata rader, $0,75 per miljon texttoken in och $4,50 ut jämfört med TTS-slutpunkterna som fakturerar textinmatning till $0,50 per miljon token
• Flash-Lite-nivå — Gemini 3.8 Live har ingen billigare syskonmodell; valet är Live eller Extended Thinking jämfört med Gemini 3.8 Flash-Lite TTS som listas till $6,00 och sedan $12,00 per miljon ljudtoken, med Artificial Analysis på $11,0 per miljon tecken
• Ingångsformat — Gemini 3.8 Live ljud, video och text in, ljud ut jämfört med TTS-slutpunkterna text in, ljud ut

Live-siffran är vår beräkning utifrån Googles publicerade minutpriser, inte en timsiffra som Google har publicerat. Teckensiffrorna är normaliseringen från Artificial Analysis och är de som ska anges när du jämför syntesnivåer. Observera att Artificial Analysis har en egen Speech to Speech-tavla med en separat kolumn för kostnad per timme för ljudinmatning för Live-modellerna – cirka 3,50 USD för Gemini 3.8 Live och 0,84 USD för varianten Extended Thinking – vilket är ännu en annan normalisering och inte bör ställas mot minutprislistan som om de två vore samma mätning.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

Vad går sönder när du väljer fel?

Felmoderna är lärorika eftersom de är så olika.

Anropa en TTS-endpunkt när du behövde en samtalsloop och inget går fel. Anropet returnerar giltigt ljud. Du får ett flytande, väluppläst svar på en fast sträng, och sedan tystnad — för det fanns aldrig någon som lyssnade. Team upptäcker detta när de bygger sitt första barge-in-test och inser att "användaren" måste vänta på att hela klippet ska spelas klart innan nästa tur kan börja. Att i efterhand bygga in en konversation i en syntesendpunkt innebär att lägga till taligenkänning, en turordningspolicy och en avbrottsmekanism runt den, och vid det laget har du byggt upp en kaskad igen och betalar för två modeller istället för en.

Anropa en Live-endpoint när du behövde uppläsning, och du betalar för kapacitet du inte använder. En Live-modell mäts i båda riktningarna, eftersom den förväntar sig båda riktningarna. För en ljudbok eller en voiceover till en utbildningsvideo är inputsidan ett manus som aldrig ändras, och modellen behöver aldrig höra något. Du köper en konversationsloop för att läsa upp ett dokument högt.

Det enda fallet där valet verkligen är svårt är kaskaden: igenkänning, sedan resonemang, sedan syntes. Den arkitekturen är inte föråldrad, och för många produktionssystem är den fortfarande den rätta, eftersom den låter dig byta ut varje steg oberoende av de andra och välja en annan leverantör för varje. Den kostar dig latens, och den kostar dig den prosodi som en enda end-to-end-modell behåller över en turgräns. Avvägningen är verklig åt båda hållen.

Där rutten redan finns

OrcaRouter tillhandahåller inte Gemini 3.8 Live-slutpunkterna eller 3.8 TTS-slutpunkterna, och det förtjänar att sägas innan något annat om routing sägs, eftersom motsatsen är lätt att anta utifrån en så här bred katalog. Vad katalogen däremot innehåller är resten av familjen – google/gemini-3.8-flash bland 28 Google-modeller och över 200 modeller totalt, från en enda nyckel till leverantörens listpris utan påslag.

Det spelar särskilt stor roll för kaskaden. Om din arkitektur är igenkänning, sedan resonemang, sedan syntes, är resonemangssteget det där en enda nyckel hos många leverantörer lönar sig, eftersom det är steget du byter oftast och steget där en leverantörs prissänkning bör nå din faktura samma dag i stället för vid nästa avtalsförnyelse. Det är också steget där automatisk redundansväxling gör nytta: en kaskad har tre ställen att brista på, och det mellersta är billigast att göra redundant.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

En kort beslutsregel

Om modellen måste svara på något som den inte redan hade som text vill du ha Gemini 3.8 Live, och du bör budgetera utifrån Googles ljudpriser per minut och räkna med att behöva fundera över vilken av de två varianterna du behöver. Om texten redan är skriven och uppgiften är att framföra den vill du ha Gemini 3.8 Flash TTS eller Flash-Lite TTS, och du bör budgetera per miljon tecken och välja nivå utifrån språktäckning och utifrån om kvalitetsgapet är värt prisskillnaden.

Och om du blir ombedd att jämföra ”Gemini 3.8 Live och Gemini 3.8 TTS” som om de vore två produkter, är det första användbara du kan göra att fråga vilken endpoint det gäller. Namnet i briefen motsvarar inte en enda, och svaret förändrar arkitekturen snarare än bara fakturan.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.