Ett genererat hero-kort för 'Gemini 3.8 TTS: två pelikaner, två modeller' på en vit bakgrund med mjuka gradientaccenter i blått och cyan. Tre kort visar 'Gemini 3.8 Flash TTS – Elo 1 260, rang 2, 8 arenaröster, 9,00 $ per 1 miljon ljudtokens', 'Gemini 3.8 Flash-Lite TTS – Elo 1 235, rang 6, 6,00 $ per 1 miljon ljudtokens' och 'Tvåtalardialog – stöds, röstdesign, 30-sekundersreplikering'. En sidfotsrad lyder 'Elo enligt Artificial Analysis Provider Voice Arena, sept. 2026; listpriser enligt Google.' OrcaRouter-logotypen är inkomponerad i det nedre högra hörnet.
Guides & Insights

Gemini 3.8 TTS: Två pelikaner, två modeller och ett pris som fördubblas i januari

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det snabbaste sättet att förstå vad leverantören släppte den 23 september 2026 är att titta på demon som cirkulerade med den: två pelikaner som bråkar om huruvida de ska flytta till Pacifica Pier, en röst per fågel, manusstyrd tur för tur. Gemini 3.8 Flash TTS och Gemini 3.8 Flash-Lite TTS är de två modellerna bakom den demon, båda allmänt tillgängliga på Gemini API, och pelikanerna är inte en gimmick. De är det första i den här generationen som de tidigare Gemini-talmodelerna inte kunde göra alls: två talare, en generering, ett manus som styr vem som säger vad.

Priset är den andra halvan av historien, och det är där de två modellerna skiljer sig. Flash TTS fakturerar $0,50 per miljon texttokens som indata och $9,00 per miljon ljudtokens som utdata fram till och med den 31 december 2026, därefter $18,00; Flash-Lite TTS fakturerar $0,50 och $6,00 enligt samma schema, därefter $12,00. Det är Googles egna priser. Omräknade av Artificial Analysis till en bas per miljon tecken så att de kan ligga på samma jämförelsetabell som alla andra, landar de på $16,50 och $11,00 — ungefär en tredjedel billigare för Lite-modellen, och båda ligger väl under vad toppen av den jämförelsetabellen tar betalt.

Så den intressanta frågan är inte om modellerna är bra. Det är vilken av de två du bör bygga på, eftersom gapet mellan dem inte är det gap du skulle gissa utifrån namnen.

Vad tillkännagivandet den 23 september faktiskt innehåller

Två modeller, inte en, och Google är tydliga med att det är en uppdelning snarare än en liten och en stor version av samma sak. I tillkännagivandet nämns fem platser där de finns – Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook och Google Vids – och API-identifierarna är enkla: gemini-3.8-flash-tts och gemini-3.8-flash-lite-tts.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

Funktionslistan är längre än vad rubriken antyder. Från Googles tillkännagivande och dokumentationen för talgenerering i Gemini API:

• Röstdesign — du beskriver en röst med ord och får ett anpassat röst-ID tillbaka, i stället för att välja från en fast lista.

• Röstreplikering – ett 30-sekunders prov skapar ett röst-ID, vilket är den väg de flesta team faktiskt kommer att använda för en varumärkesröst eller en berättarröst.

• Tvåtalardialog — pelikanfallet. Manuset innehåller talarbyten i stället för ett enda prosablock.

• Styling på turnivå — dokumentationen beskriver en speech_metadata-annotering som fäster regi vid en specifik tur snarare än vid hela förfrågan.

• Färdigbyggda röster, plus ett utökat röstbibliotek som nås via GET /v1beta/voices.

• Tre ljudkodningar — WAV som standard, med mulaw och alaw tillgängliga för telefonianpassade pipelines.

• Endast text in, endast ljud ut. Dokumentationen är tydlig med detta: TTS-modeller tar ingen annan indatamodalitet och producerar ingen annan utdata, och det finns ett separat avsnitt med begränsningar som listar restriktionerna.

Det som inte finns i tillkännagivandet är någon av de siffror som en kapacitetsplanerare behöver. Hastighetsgränser, kvoter och lagringstiden för en designad röst finns alla i dokumentationen och på prissättningssidan, inte i lanseringsinlägget, vilket är den vanliga anledningen till att en lanseringsvecka går smidigt för demos och dåligt för produktion.

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

Pelikanerna är de verkliga nyheterna

TTS med en enda talare har varit ett tillräckligt löst problem i två år. Det som saknades var en modell som kunde hålla två identiteter åtskilda genom ett långt manus utan att glida, och det är vad demon egentligen testar – inte huruvida rösten låter mänsklig, utan huruvida talare A fortfarande är talare A efter fyra minuter.

Två saker följer av det, och de är anledningen till att detta spelar roll bortom poddleksaker.

Det första är att arbetsenheten förändras. Med en en-talarmodell är en tjugominutersdialog tjugo minuter ljud som du syr ihop från två oberoende körningar, och varje skarv är en plats där prosodin återställs. Med en två-talarmodell är det ett anrop, en kontext, och modellen kan reagera på föregående replik. Det är en kvalitetsskillnad som du inte kan köpa tillbaka med efterbearbetning.

Det andra är att skriptformatet blir gränssnittet. Om din pipeline redan skickar ut något SSML-liknande – en annotering per fras – är den här generationen nära att vara direkt användbar. Om din pipeline ger en modell en vägg av text och hoppas, har du nu en anledning att strukturera om den, eftersom den styling som tidigare var implicit nu är något du måste säga högt. Det är samma avvägning som resten av fältet gör på olika sätt, och det är den axel där dessa två Google-modeller konkurrerar med allt annat på spelplanen.

Vad en timmes tvåpelikanljud kostar

Det är värt att räkna på tokens en gång, för siffran per miljon ljudtokens är inte en siffra per timme, och skillnaden har förvånat folk.

Ljudtoken genereras med en fast hastighet per sekund utdata, så kostnaden skalas med längden på den färdiga ljudfilen, inte med längden på manuset. Ta Googles egen taxa för Flash TTS – 9,00 USD per miljon ljudtoken ut – och räkningen för en färdig timme landar på ensiffriga dollar på standardnivån, med Lite-modellen på två tredjedelar av det. Prissättningen för Batch och Flex, med 0,25 USD in och 4,50 USD ut för Flash TTS mot 0,25 USD och 3,00 USD för Flash-Lite TTS, sänker det ytterligare för allt som inte behöver genereras på begäran. Priority, med 0,90 USD och 16,00 USD, är till för det arbete som behöver det.

Tre praktiska konsekvenser:

• Att generera om ett stycke är billigt; att generera om en serie är ett beslut. Med de här priserna slutar den dyra delen av en talpipeline att vara inferens och blir återigen människan som godkänner tagningen.

• Kostnaden för textinmatning är försumbar. $0,50 per miljon texttoken för ett manus på några tusen ord är ett avrundningsfel jämfört med ljudsidan. Optimera inte manuset för längd.

• Stupet den 31 december är verkligt och det fördubblar ljudpriset. Om du planerar en utrullning under 2027 ska du budgetera med siffran efter kampanjen, inte lanseringssiffran, annars får du planera om i januari.

Talet som är oberoende, och de som inte är det

En siffra i den här lanseringen kommer från någon annanstans än Google. På Artificial Analysis Provider Voice Arena, hämtad den 24 september 2026, ligger Gemini 3.8 Flash TTS på plats 2 med en Elo på 1 260 över 1 999 prover och 8 arenaröster, och Gemini 3.8 Flash-Lite TTS ligger på plats 6 med 1 235 över 2 000 prover. Båda ligger inom varandras konfidensintervall på ±16 respektive ±17, så resultattavlan säger att de är statistiskt oskiljaktiga vad gäller preferens – vilket är ett verkligt användbart resultat, eftersom det betyder att den billigare inte är mätbart sämre för lyssnarna.

Allt annat är Googles egna påståenden och bör läsas som sådana: språket för uttrycksfullhet, antalet språk, replikeringskvaliteten. Arenan ger dig en preferensrankning och inget annat. Den säger dig inte hur någon av modellerna hanterar ett 40-minutersmanus utan drift, hur den beter sig med ett egennamn den aldrig har sett, eller vad som händer med en designad röst efter en vecka.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

Lite-modellen är också det bättre argumentet för att paret är en verklig uppdelning snarare än en marknadsföringsnivå. En Elo-skillnad på 25 punkter som ligger inom felstaplarna, mot en prisskillnad på 33 %, är formen av ett beslut som priskänsliga pipelines nästan alltid bör fatta till förmån för Lite — och formen av ett beslut som latenskänsliga pipelines bör fatta i motsatt riktning, eftersom de två skiljer sig åt både på klockan och på notan.

Var man ska köra det, och den ärliga versionen av det svaret

OrcaRouter har inte Gemini 3.8 TTS-endpoints. Det är värt att säga rakt ut i stället för att antyda något annat, för det användbara vi kan säga om dessa två modeller är inte att vi tillhandahåller dem – det gör vi inte – utan att en leverantörsprissänkning som ändringen den 31 december är precis den typ av händelse som gör routing värt att ha.

OrcaRouter placerar över 200 modeller bakom en enda API-nyckel till leverantörens listpris utan påslag, så leverantörens prislista är vad du betalar, och en ändring av den är live hos oss samma dag i stället för vid nästa faktureringscykel. För en talpipeline som är mitt i en migrering är failover-lagret viktigare än katalogen: du kan lägga en förfrågningsväg på en modell som fortfarande utvärderas utan att satsa en produktionsrutt på den, eftersom ett misslyckat anrop kan falla vidare till något som redan är beprövat. Routnings-DSL:en komponerar flera modeller till ett anrop för de fall där ingen enskild röst är tillräckligt bra, och modellfusion svarar på en prompt med en panel när svaret betyder mer än latensen.

För Gemini 3.8 TTS-modellerna själva är platsen att anropa dem Googles eget API, och de ytor som Google namngav den 23 september. Vad de två gör med din arkitektur – ett anrop för två talare, styling som en annotering, en röst som kan beskrivas i stället för att väljas – är den del som överlever lanseringsrabatten.

Vad du ska titta på härnäst

Tre saker kommer att avgöra om den här generationen är en stegförändring eller en funktion.

Det första är drift. Ingen har publicerat en utvärdering i långformat av huruvida tvåtalarvägen behåller identiteten under en hel timme, och tills någon gör det är pelikandemon en demo. Det andra är röstens livslängd. En designad röst som upphör inom en vecka är en prototyp; en röst som kan återhärledas från en lagrad konfiguration är en produkt, och svaret beror på vilken av de två identifierarna du behåller. Det tredje är vad som händer efter den 31 december, när kampanjpriset upphör och timkostnaden för en talpipeline fördubblas över en natt.

Ingen av dem syns i lanseringsinlägget. Alla tre syns i dokumentationen, vilket är där lanseringsbevakningen slutar läsa.