Ett genererat hero-kort för 'Gemini 3.8 Flash TTS säger hej' på en vit bakgrund med mjuka blå- och cyanfärgade gradientaccenter. Ett brett rundat kort innehåller en vågformsikon bredvid '30 studioröster', '130 språk' och 'per ljudtoken', med ett andra kort till höger med texten 'Flash-Lite TTS - 101 språk'. En sidfotsrad lyder 'Gemini API, 23 september 2026. Leverantörsuppgifter.' OrcaRouter-logotypen är inkomponerad i det nedre högra hörnet.
Guides & Insights

Gemini 3.8 Flash TTS säger hej: Google delar sin talsynteslinje i två och sänker priset

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Leverantören släppte två talmodeller den 23 september 2026, och tillkännagivandet är skrivet som om rubriken vore röstkvalitet. Det är den inte. Gemini 3.8 Flash TTS och Gemini 3.8 Flash-Lite TTS är de första text-till-tal-modellerna som leverantören har lagt ut på Gemini Developer API till ett pris under den förhandsvisningsmodell de ersätter – och för alla som har betalat per tecken någon annanstans är det den delen som ändrar en budgetpost. Priset för ljudutdata på Gemini 3.8 Flash TTS är $9.00 per miljon tokens till och med slutet av 2026. Ljud faktureras med 25 tokens per sekund, vilket motsvarar ungefär 0,02 cent per sekund genererat tal. Modellen den ersätter, Gemini 3.1 Flash TTS Preview, prissattes till $20.00 per miljon ljudtokens.

Den andra halvan av historien är att det nu finns två modeller, inte en. Google delade upp linjen: Flash TTS har hela språkuppsättningen och den högre ljudsamplingsfrekvensen, medan Flash-Lite TTS har en kortare språklista och är billigare. Det är en annan form än den med en enda förhandsvisningsmodell som har funnits i API:et sedan april, och det säger dig vad Google tror att marknaden ser ut som – ett litet antal applikationer som behöver 130 språk och röstkloning, och ett mycket större antal som behöver en kompetent engelsk röst för en supportbot och inget annat.

Vad som faktiskt släpptes den 23 september

Båda modellerna är allmänt tillgängliga via Gemini API och i AI Studio från och med tillkännagivandet, inte begränsade av någon väntelista. Namnen i API:et är gemini-3.8-flash-tts och gemini-3.8-flash-lite-tts.

• Flash TTS — 130 språk, språket identifieras automatiskt från texten, 30 inbyggda studioröster inklusive Kore och Puck.

Flash-Lite TTS — 101 språk, samma gränssnitt för röstdesign, positionerad som högvolymsnivån.

• Båda — röstdesign utifrån en beskrivning i naturligt språk, radvis regi för framförande, iscensättning av scener med två talare och icke-verbala signaler skrivna direkt i manuset.

• Utdata — WAV 24 kHz mono 16-bitars signerad PCM på unary-slutpunkten; PCM utan header (audio/l16) på strömningsslutpunkten; audio/mulaw och audio/alaw accepteras också, med en konfigurerbar samplingsfrekvens.

Prislistan, per miljon tokens, är värd att läsa i sin helhet eftersom nivåerna skiljer sig åt på mer än rubriksiffran:

• Flash TTS Standard — 0,50 USD text in / 9,00 USD ljud ut, ökar till 1,00 USD / 18,00 USD efter den 31 december 2026.

• Flash TTS Batch och Flex — 0,25 $ / 4,50 $.

• Flash TTS Priority — $0,90 / $16,20.

• Flash-Lite TTS Standard — $0.50 / $6.00, stiger till $1.00 / $12.00 efter 31 december 2026.

• Flash-Lite TTS Batch och Flex — 0,25 $ / 3,00 $.

• Flash-Lite TTS Prioritet — 0,90 $ / 10,80 $.

Gemini 3.1 Flash TTS Preview, för jämförelse — 1,00 $ / 20,00 $, batch 0,50 $ / 10,00 $.

Det som är värt att notera är kampanjperioden. Google har prissatt båda nya modellerna till halva priset fram till slutet av året och publicerat siffrorna efter kampanjen i samma tabell. Den som modellerar kostnad per tusen minuter bör använda januarisiffran, inte septembersiffran.

A generated scoreboard for Gemini 3.8 Flash TTS with six rows — Arena Elo 1,260 at rank 2, audio out $9.00 per 1M tokens, 130 languages on Flash against 101 on Flash-Lite, 30 prebuilt studio voices plus voice design, cloning from a 30-second sample with SynthID, and GA availability on the Gemini API — over the footer 'Price per Google rate card; Elo per Artificial Analysis Provider Voice Arena, Sept 2026.'

Röstdesign är den genuint nya förmågan

Färdiga röster är ett minimikrav. Det Google lade till i 3.8 är ett sätt att beskriva en röst med ord och få den, och ett sätt att klona en från ett kort ljudprov med en samtyckeskontroll kopplad.

Röstdesign tar en prompt i naturligt språk – tempo, klang, accent, sådant du annars skulle spendera en eftermiddag på att provlyssna på – och returnerar en användbar röst utan en referensinspelning. Röstreplikering går åt andra hållet: du tillhandahåller ett 30-sekunders prov, systemet verifierar samtycke, och den resulterande rösten märks med en SynthID-vattenstämpel och C2PA-uppgifter på det genererade ljudet. Röstremixning, som låter dig blanda eller ändra en befintlig anpassad röst, listas som kommande i stället för att vara släppt.

Anpassade röster finns i två varianter och de beter sig tillräckligt olika för att distinktionen spelar roll i produktion. Tillståndsbaserade anpassade röster lagras per projekt, med en gräns på 200 per projekt och en livstid på ett år. Tillståndslösa röster adresseras via ett voicekey_...-handtag och upphör efter sju dagar. Om din applikation provisionerar en röst per kund, är gränsen och TTL:en de två siffrorna som avgör om du behöver ett eget lagringslager.

Framförandekontrollerna är den andra halvan av "nytt". Du kan regissera en replik på samma sätt som du skulle regissera en skådespelare — tempo, betoning, känsloregister — i stället för att bara välja en röst och hoppas. Scener med två talare kan iscensättas i ett enda anrop. Och icke-verbala vokaliseringar är förstklassiga manuselement: <skrattar>, <suckar> och <flämtar> som inline-signaler, plus |mhm| och |ja| för de små backchannel-ljuden som får ett syntetiskt samtal att låta som ett samtal. Lång uppläsning påstås behålla talaridentiteten med minimal drift, vilket är det felläge som visar sig först när du genererar ett 40-minuterskapitel i en ljudbok.

Benchmarkarna, och vem som körde dem

Googles lanseringsmaterial bygger på två externa utvärderingar och en uppsättning arenaplaceringar. Alla dessa är rapporterade av leverantören – Google citerar dem, och de underliggande körningarna är inte offentliga – så behandla dem som påståenden snarare än mätningar.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', captured in English and dated Sep 23, 2026, showing the header credited to Leland Rechis and Alan Cowen, the 'Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS' hero card, and the opening bullets describing the two models.

• Hume AI Voice Design Benchmark — Gemini 3.8 Flash TTS kom på första plats med 71,4 och på första plats inom accentmodellering med 60,8.

• Humes övergripande kvalitetsindex — Flash TTS först, Flash-Lite TTS andra.

• Blind preferens i Speech Arena — topplaceringar uppnådda på japanska, brasiliansk portugisiska, vietnamesiska, modern standardarabiska, mexikansk spanska och hindi.

• Jämfört med Gemini 3.1 Flash TTS – Google hävdar förbättringar när det gäller långformskonsekvens och kontroll över manus med två talare, vilket är exakt de två saker som funktionerna för framförandeanvisningar är utformade för.

En dokumenterad avvikelse är värd att flagga eftersom den kommer att förvirra alla som jämför källor. Blogginlägget beskriver ett bibliotek med över 2 000 produktionsklara röster. Utvecklardokumentationen beskriver "hundratals" röster i Extended Voice Library vid sidan av de 30 färdigbyggda studiorösterna. Tredjepartsrapportering har citerat siffror som är ännu en storleksordning högre. Dessa går inte att förena utifrån — den ärliga tolkningen är att den färdigbyggda uppsättning du får som standard är 30, att Extended Voice Library är större och vagt beskrivet, och att de stora siffrorna syftar på en katalog som inkluderar användarskapade röster. Om antalet röster är avgörande för ditt beslut bör du testa den specifika röst du behöver i stället för att lita på någon av de tre siffrorna.

Vad det innebär om du bygger vidare på det

Den praktiska förändringen är att text-till-tal har gått från att vara en specialiserad budgetpost till något du kan lägga in i samma kostnadsmodell som dina språktokens. Vid 25 tokens per sekund är en timme genererat ljud 90 000 ljudtokens, vilket med kampanjpriset för Flash-Lite är ungefär 54 cent. Det är tillräckligt billigt för att den intressanta frågan slutar vara "har vi råd med en syntetisk röst" och blir "vilken av de två nivåerna behöver den här ytan".

Den andra praktiska förändringen är att en helt ny TTS-modell är precis den typ av sak man vill testa utan att satsa en produktionsväg på den. Det är argumentet för att lägga en ny modell bakom en router i stället för att koppla in den direkt: OrcaRouter exponerar 200+ modeller bakom en enda nyckel till leverantörens listpris utan påslag, och dess automatiska redundansväxling innebär att en ny taländpunkt som vacklar under belastning degraderas till en modell du redan litar på i stället för att samtalet tappas. Vi hostar inte Gemini 3.8 TTS-ändpunkterna – de kommer från Googles eget API – men textlagret under rösten, och reservvägen när ett syntesanrop misslyckas, är de delar som en router faktiskt är till för.

Vad saknas fortfarande

Tre saker saknas i lanseringen, och var och en av dem är en verklig begränsning, inte ett hårklyveri.

Det finns ingen publicerad oberoende utvärdering. Googles Hume-siffror är leverantören som citerar ett tredjepartsbenchmark, vilket är bättre än ingenting och sämre än en granskning. Tills Artificial Analysis eller en motsvarighet publicerar sin egen körning på samma modeller bör varje kvalitetsanspråk i den här artikeln läsas som just ett påstående.

Det finns inget alternativ med öppna vikter. Båda modellerna är stängda och endast tillgängliga via API, vilket placerar dem i en annan kategori än de öppna talmodeller som har landat på samma arena. Om din driftsättning kräver att du kör modellen själv, riktar sig den här lanseringen inte till dig.

Och kampanjprissättningen upphör. Taxan i januari 2027 för Flash TTS är dubbelt så hög som septembertaxan, och varje affärsfall som bygger på lanseringssiffrorna kommer att behöva göras om under det första kvartalet. Det är inte en kritik – att publicera båda siffrorna redan från början är ärligare än vad de flesta gör – men det är siffran som hör hemma i kalkylarket.

Google har inte sagt huruvida Gemini 3.1 Flash TTS Preview kommer att fasas ut, bara att Flash-Lite TTS positioneras som den arbetshäst som ska ersätta den. Den som fortfarande använder förhandsversionsmodellen bör planera en migrering i stället för att vänta på ett nedstängningsbesked.

A generated summary card titled 'Gemini 3.8 TTS: what changed in five lines', listing the split into Flash TTS and Flash-Lite TTS, the audio-out cut to $9.00 per 1M tokens, voice design and 30-second cloning, 130 languages on Flash against 101 on Flash-Lite, and half price until December 31, 2026.