Een gegenereerde hero-kaart voor 'Gemini 3.8 Flash TTS zegt hallo' op een witte achtergrond met zachte blauw- en cyaan gradientaccenten. Een brede afgeronde kaart bevat een golfvormpictogram naast '30 studio-stemmen', '130 talen' en 'per audiotoken', met rechts een tweede kaart met de tekst 'Flash-Lite TTS - 101 talen'. In een voettekst staat 'Gemini API, 23 september 2026. Cijfers van de leverancier.' Het OrcaRouter-logo is in de rechteronderhoek gemonteerd.
Guides & Insights

Gemini 3.8 Flash TTS zegt hallo: Google splitst zijn spraaklijn in tweeën en verlaagt de prijs

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De leverancier heeft op 23 september 2026 twee spraakmodellen uitgebracht, en de aankondiging is geschreven alsof de kop over stemkwaliteit ging. Dat is niet zo. Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS zijn de eerste tekst-naar-spraakmodellen die de leverancier op de Gemini Developer API beschikbaar heeft gesteld tegen een prijs onder die van het previewmodel dat ze vervangen — en voor iedereen die ergens anders per teken betaalde, is dat het onderdeel dat een begrotingspost verandert. Het audio-uitvoertarief voor Gemini 3.8 Flash TTS is $9,00 per miljoen tokens tot eind 2026. Audio wordt gefactureerd tegen 25 tokens per seconde, wat neerkomt op ongeveer 0,02 cent per seconde gegenereerde spraak. Het model dat het vervangt, Gemini 3.1 Flash TTS Preview, kostte $20,00 per miljoen audiotokens.

De tweede helft van het verhaal is dat er nu twee modellen zijn, niet één. Google splitste de lijn: Flash TTS heeft de volledige talenset en de hogere audiosnelheid, Flash-Lite TTS heeft een kortere talenlijst en een lagere prijs. Dat is een andere vorm dan de opzet met één previewmodel die sinds april op de API staat, en het vertelt je hoe Google denkt dat de markt eruitziet — een klein aantal applicaties die 130 talen en stemkloning nodig hebben, en een veel groter aantal dat een competente Engelse stem voor een supportbot nodig heeft en verder niets.

Wat is er op 23 september daadwerkelijk uitgebracht?

Beide modellen zijn vanaf de aankondiging algemeen beschikbaar op de Gemini API en in AI Studio, niet achter een wachtlijst. De namen op de API zijn gemini-3.8-flash-tts en gemini-3.8-flash-lite-tts.

• Flash TTS — 130 talen, taal automatisch gedetecteerd op basis van de tekst, 30 kant-en-klare studiostemmen, waaronder Kore en Puck.

• Flash-Lite TTS — 101 talen, hetzelfde voice-designoppervlak, gepositioneerd als de high-volume tier.

• Beide — stemontwerp op basis van een beschrijving in natuurlijke taal, voordrachtsaanwijzingen per regel, enscenering van scènes met twee sprekers, en non-verbale signalen die direct in het script zijn geschreven.

• Uitvoer — WAV 24 kHz mono 16-bits signed PCM op het unary-eindpunt; headerloze PCM (audio/l16) op het streaming-eindpunt; audio/mulaw en audio/alaw worden ook geaccepteerd, met een configureerbare samplefrequentie.

De tariefkaart, per miljoen tokens, is de moeite waard om volledig te lezen, omdat de tariefniveaus meer van elkaar verschillen dan alleen het hoofdtarief:

• Flash TTS Standard — $0,50 tekst in / $9,00 audio uit, stijgt naar $1,00 / $18,00 na 31 december 2026.

• Flash TTS Batch en Flex — $0,25 / $4,50.

• Flash TTS Priority — $0,90 / $16,20.

• Flash-Lite TTS Standard — $0,50 / $6,00, stijgt naar $1,00 / $12,00 na 31 december 2026.

• Flash-Lite TTS Batch en Flex — $0,25 / $3,00.

• Flash-Lite TTS Priority — $0,90 / $10,80.

Gemini 3.1 Flash TTS Preview, ter vergelijking — $1.00 / $20.00, batch $0.50 / $10.00.

Het belangrijkste om op te merken is de promotieperiode. Google heeft beide nieuwe modellen tot het einde van het jaar tegen half tarief geprijsd en de cijfers na de promotie in dezelfde tabel gepubliceerd. Wie de kosten per duizend minuten modelleert, moet het cijfer van januari gebruiken, niet dat van september.

A generated scoreboard for Gemini 3.8 Flash TTS with six rows — Arena Elo 1,260 at rank 2, audio out $9.00 per 1M tokens, 130 languages on Flash against 101 on Flash-Lite, 30 prebuilt studio voices plus voice design, cloning from a 30-second sample with SynthID, and GA availability on the Gemini API — over the footer 'Price per Google rate card; Elo per Artificial Analysis Provider Voice Arena, Sept 2026.'

Stemontwerp is de werkelijk nieuwe mogelijkheid

Kant-en-klare stemmen zijn een minimumvereiste. Wat Google in 3.8 heeft toegevoegd, is een manier om een stem in woorden te beschrijven en die te verkrijgen, en een manier om er een te klonen uit een korte sample, met een toestemmingscontrole eraan gekoppeld.

Stemontwerp neemt een prompt in natuurlijke taal — tempo, timbre, accent, het soort eigenschap waarvoor je anders een middag zou uittrekken om audities te doen — en levert een bruikbare stem op zonder referentieopname. Stemreplicatie werkt omgekeerd: je levert een sample van 30 seconden aan, het systeem verifieert toestemming, en de resulterende stem wordt gemarkeerd met een SynthID-watermerk en C2PA-referenties op de gegenereerde audio. Stemremixen, waarmee je een bestaande aangepaste stem kunt mengen of wijzigen, staat vermeld als binnenkort beschikbaar in plaats van uitgebracht.

Aangepaste stemmen komen in twee varianten en ze gedragen zich zodanig verschillend dat het onderscheid in productie van belang is. Stateful aangepaste stemmen worden bij het project opgeslagen, met een maximum van 200 per project en een levensduur van één jaar. Stateless stemmen worden aangesproken via een voicekey_... handle en verlopen na zeven dagen. Als uw applicatie per klant een stem aanmaakt, zijn de limiet en de TTL de twee getallen die bepalen of u een eigen opslaglaag nodig hebt.

De regelaars voor de voordracht zijn de andere helft van "nieuw". Je kunt een regel sturen zoals je een acteur zou sturen — tempo, nadruk, emotioneel register — in plaats van alleen een stem te kiezen en er het beste van te hopen. Scènes met twee sprekers kun je binnen één call ensceneren. En non-verbale vocalisaties zijn volwaardige scriptelementen: <lacht>, <zucht> en <snakt naar adem> als inline-cues, plus |mhm| en |ja| voor de kleine backchannel-geluidjes waardoor een synthetisch gesprek als een gesprek klinkt. Er wordt beweerd dat langdurig voorlezen de stemidentiteit met minimale drift vasthoudt — precies de faalmodus die zich het eerst voordoet wanneer je een audioboekhoofdstuk van 40 minuten genereert.

De benchmarks, en wie ze heeft uitgevoerd

Het lanceermateriaal van Google leunt op twee externe evaluaties en een reeks posities in een arena. Al deze zijn door de leverancier gerapporteerd — Google citeert ze, en de onderliggende runs zijn niet openbaar — dus behandel ze als beweringen in plaats van metingen.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', captured in English and dated Sep 23, 2026, showing the header credited to Leland Rechis and Alan Cowen, the 'Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS' hero card, and the opening bullets describing the two models.

• Hume AI Voice Design Benchmark — Gemini 3.8 Flash TTS eindigde op de eerste plaats met 71,4, en als eerste op accentmodellering met 60,8.

• Hume Algemene Kwaliteitsindex — Flash TTS eerst, Flash-Lite TTS tweede.

• Blinde voorkeur in de Speech Arena — topposities behaald in het Japans, Braziliaans-Portugees, Vietnamees, Modern Standaardarabisch, Mexicaans Spaans en Hindi.

• Versus Gemini 3.1 Flash TTS — Google claimt verbeteringen in consistentie bij lange teksten en regie over scripts met twee sprekers, precies de twee dingen waarvoor de functies voor spreekregie zijn gebouwd.

Eén gedocumenteerde discrepantie is het vermelden waard, want die zal iedereen die bronnen vergelijkt in verwarring brengen. De blogpost beschrijft een bibliotheek van meer dan 2.000 productieklare stemmen. De ontwikkelaarsdocumentatie beschrijft "honderden" stemmen in de Extended Voice Library, naast de 30 vooraf ingebouwde studiostemmen. Berichtgeving door derden heeft cijfers genoemd die weer een orde van grootte hoger liggen. Deze zijn van buitenaf niet met elkaar te verzoenen — de eerlijke lezing is dat de vooraf ingebouwde set die je standaard krijgt 30 is, de Extended Voice Library groter en vaag omschreven is, en de grote aantallen verwijzen naar een catalogus die door gebruikers gemaakte stemmen bevat. Als een stemmentotaal bepalend is voor je beslissing, test dan de specifieke stem die je nodig hebt in plaats van een van de drie cijfers te vertrouwen.

Wat het betekent als je erop voortbouwt

De praktische verandering is dat tekst-naar-spraak is verschoven van een gespecialiseerde kostenpost naar iets dat je in hetzelfde kostenmodel kunt opnemen als je taaltokens. Bij 25 tokens per seconde is een uur gegenereerde audio 90.000 audiotokens, wat tegen het promotietarief van Flash-Lite ongeveer 54 cent kost. Dat is goedkoop genoeg dat de interessante vraag niet langer luidt: "Kunnen we ons een synthetische stem veroorloven?", maar wordt: "Welke van de twee niveaus heeft dit oppervlak nodig?"

De tweede praktische verandering is dat een gloednieuw TTS-model precies het soort ding is dat je wilt uitproberen zonder er een productiepad op te verwedden. Dat pleit ervoor een nieuw model achter een router te zetten in plaats van het direct aan te sluiten: OrcaRouter stelt meer dan 200 modellen beschikbaar achter één sleutel tegen de adviesprijs van de provider, zonder opslag, en de automatische failover betekent dat een nieuw spraakeindpunt dat onder belasting wankelt, terugvalt op een model dat je al vertrouwt in plaats van de oproep te laten vallen. Wij hosten de Gemini 3.8 TTS-eindpunten niet — die komen van de eigen API van Google — maar de tekstlaag onder de stem, en het fallbackpad wanneer een syntheseaanroep mislukt, zijn precies waar een router eigenlijk voor bedoeld is.

Wat ontbreekt er nog?

Drie dingen ontbreken bij de lancering en elk daarvan is een echte beperking, geen muggenzifterij.

Er is geen gepubliceerde onafhankelijke evaluatie. De Hume-cijfers van Google zijn afkomstig van de leverancier die een benchmark van een derde partij citeert, wat beter is dan niets en slechter dan een audit. Totdat Artificial Analysis of een gelijkwaardige partij een eigen run op dezelfde modellen publiceert, moet elke kwaliteitsclaim in dit artikel als een claim worden gelezen.

Er is geen open-weights-optie. Beide modellen zijn gesloten en alleen via API beschikbaar, wat ze in een andere categorie plaatst dan de open spraakmodellen die in dezelfde arena zijn verschenen. Als jouw deployment vereist dat je het model zelf draait, is deze lancering niet op jou gericht.

En de promotieprijs eindigt. Het tarief voor januari 2027 voor Flash TTS is het dubbele van het tarief van september, en elke businesscase die op de lanceercijfers is gebaseerd, moet in het eerste kwartaal opnieuw worden gemaakt. Dat is geen kritiek — beide cijfers vooraf publiceren is eerlijker dan wat de meeste doen — maar het is het cijfer dat in de spreadsheet thuishoort.

Google heeft niet gezegd of Gemini 3.1 Flash TTS Preview wordt afgeschaft, alleen dat Flash-Lite TTS wordt gepositioneerd als de werkpaard-vervanging. Iedereen die nog het previewmodel gebruikt, kan beter een migratie plannen dan te wachten op een bericht dat het wordt stopgezet.

A generated summary card titled 'Gemini 3.8 TTS: what changed in five lines', listing the split into Flash TTS and Flash-Lite TTS, the audio-out cut to $9.00 per 1M tokens, voice design and 30-second cloning, 130 languages on Flash against 101 on Flash-Lite, and half price until December 31, 2026.