
Gemini 3.8 TTS: Twee pelikanen, twee modellen en een prijs die in januari verdubbelt
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
De snelste manier om te begrijpen wat de leverancier op 23 september 2026 heeft uitgebracht, is kijken naar de demo die daarmee rondging: twee pelikanen die ruziën over de vraag of ze naar Pacifica Pier moeten verhuizen, één stem per vogel, scriptmatig beurt voor beurt. Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS zijn de twee modellen onder die demo, beide algemeen beschikbaar op de Gemini API, en de pelikanen zijn geen gimmick. Zij zijn het eerste in deze generatie dat de eerdere spraakmodellen van Gemini helemaal niet konden: twee sprekers, één generatie, een script dat bepaalt wie wat zegt.
De prijs is de andere helft van het verhaal, en daar lopen de twee modellen uiteen. Flash TTS rekent $0,50 per miljoen teksttokens voor invoer en $9,00 per miljoen audiotokens voor uitvoer tot en met 31 december 2026, daarna $18,00; Flash-Lite TTS rekent $0,50 en $6,00 volgens hetzelfde schema, daarna $12,00. Dat zijn de eigen tarieven van Google. Omgerekend door Artificial Analysis naar een prijs per miljoen tekens, zodat ze op dezelfde ranglijst als alle anderen kunnen staan, komen ze uit op $16,50 en $11,00 — ongeveer een derde goedkoper voor het Lite-model, en beide ruim onder wat de top van die ranglijst rekent.
Dus de interessante vraag is niet of de modellen goed zijn. Het is op welke van de twee je moet voortbouwen, want de kloof tussen hen is niet de kloof die je op basis van de namen zou vermoeden.
Wat de aankondiging van 23 september daadwerkelijk bevat
Twee modellen, niet één, en Google is er expliciet over dat het om een splitsing gaat en niet om een kleine en een grote versie van hetzelfde. De aankondiging noemt vijf plekken waar ze landen — Google AI Studio, de Gemini API, Gemini Enterprise, Gemini Notebook en Google Vids — en de API-identificaties zijn simpel: gemini-3.8-flash-tts en gemini-3.8-flash-lite-tts.

De lijst met mogelijkheden is langer dan de kop doet vermoeden. Uit Googles aankondiging en de documentatie over spraakgeneratie van de Gemini API:
• Voice design — je beschrijft een stem in woorden en krijgt een aangepaste voice-ID terug, in plaats van er een uit een vaste lijst te kiezen.
• Stemreplicatie — een sample van 30 seconden levert een stem-ID op, het pad dat de meeste teams daadwerkelijk zullen gebruiken voor een merkstem of een verteller.
• Dialoog tussen twee sprekers — de pelikaanzaak. Het script bevat sprekersbeurten in plaats van één enkel blok proza.
• Styling op beurtniveau — de documentatie beschrijft een speech_metadata-annotatie die regieaanwijzingen aan een specifieke beurt koppelt in plaats van aan het hele verzoek.
• Vooraf ingebouwde stemmen, plus een Uitgebreide stemmenbibliotheek die beschikbaar is via GET /v1beta/voices.
• Drie audio-encodings — standaard WAV, met mulaw en alaw beschikbaar voor telefonie-achtige pipelines.
• Alleen tekst als invoer, alleen audio als uitvoer. De documentatie zegt het ronduit: TTS-modellen accepteren geen andere invoermodaliteit en produceren geen andere uitvoer, en er is een aparte sectie Limitations met de beperkingen.
Wat niet in de aankondiging staat, zijn de cijfers die een capaciteitsplanner nodig heeft. Snelheidslimieten, quota's en de opslagduur van een ontworpen stem staan allemaal in de documentatie en op de prijzenpagina, niet in het lanceringsbericht, wat de gebruikelijke reden is dat een lanceringsweek soepel verloopt voor demo's en slecht voor productie.

De pelikanen zijn het echte nieuws
Single-speaker-TTS is al twee jaar een voldoende opgelost probleem. Wat ontbrak, was een model dat twee identiteiten uit elkaar houdt gedurende een lang script zonder weg te drijven, en dat is wat de demo echt test — niet of de stem menselijk klinkt, maar of spreker A vier minuten later nog steeds spreker A is.
Daaruit volgen twee dingen, en zij zijn de reden dat dit meer is dan alleen podcastspeeltjes.
Het eerste is dat de werkeenheid verandert. Met een model met één spreker is een dialoog van twintig minuten twintig minuten audio die je uit twee onafhankelijke runs aan elkaar rijgt, en elke naad is een plek waar de prosodie opnieuw wordt ingesteld. Met een model met twee sprekers is het één aanroep, één context, en het model kan reageren op de regel ervoor. Dat is een kwaliteitsverschil dat je met nabewerking niet kunt goedmaken.
Het tweede is dat het scriptformaat de interface wordt. Als je pipeline al iets in SSML-vorm uitstuurt — een annotatie per frase — dan is deze generatie bijna een drop-in. Als je pipeline een model een muur van tekst voorlegt en hoopt, dan heb je nu een reden om die te herstructureren, want de styling die vroeger impliciet was, is nu iets wat je hardop moet zeggen. Dat is dezelfde afweging die de rest van het veld op verschillende manieren maakt, en het is de as waarop deze twee Google-modellen concurreren met al het andere op het bord.
Wat een uur audio met twee pelikanen kost
Het is de moeite waard om de tokenberekening één keer te maken, want het getal per miljoen audiotokens is geen getal per uur en dat verschil heeft mensen verrast.
Audio-tokens worden geproduceerd tegen een vast tarief per seconde output, dus de kosten schalen met de lengte van de voltooide audio, niet met de lengte van het script. Neem Google's eigen tarief voor Flash TTS — $9,00 per miljoen audio-tokens output — en de rekensom voor een voltooid stuk van een uur komt uit op enkele dollars op de standaardlaag, met het Lite-model op twee derde daarvan. Batch- en Flex-prijzen, met $0,25 in en $4,50 out voor Flash TTS tegen $0,25 en $3,00 voor Flash-Lite TTS, verlagen dit verder voor alles wat niet on demand hoeft te worden gegenereerd. Priority, met $0,90 en $16,00, is voor het werk dat dat wel moet.
Drie praktische gevolgen:
• Een alinea opnieuw genereren is goedkoop; een serie opnieuw genereren is een beslissing. Bij deze tarieven is het dure deel van een spraakpijplijn niet langer inferentie, maar weer de mens die de take goedkeurt.
• Het tarief voor tekstinvoer is verwaarloosbaar. $0,50 per miljoen teksttokens voor een script van een paar duizend woorden is een afrondingsfout vergeleken met de audiokant. Optimaliseer het script niet op lengte.
• De kloof van 31 december is reëel en verdubbelt het audiotarief. Als je een uitrol voor 2027 plant, begroot dan het bedrag na de promotie, niet het introductiebedrag, anders moet je in januari opnieuw plannen.
Het getal dat onafhankelijk is, en de getallen die dat niet zijn.
Eén cijfer in deze lancering komt ergens anders vandaan dan Google. In de Artificial Analysis Provider Voice Arena, vastgelegd op 24 september 2026, staat Gemini 3.8 Flash TTS op rang 2 met een Elo van 1.260 over 1.999 samples en 8 stemmen in de arena, en Gemini 3.8 Flash-Lite TTS staat op rang 6 met 1.235 over 2.000 samples. Beide vallen binnen elkaars betrouwbaarheidsintervallen van ±16 en ±17, dus de ranglijst vertelt je dat ze statistisch niet van elkaar te onderscheiden zijn qua voorkeur — wat een echt nuttig resultaat is, want het betekent dat de goedkopere voor luisteraars niet meetbaar slechter is.
Al het overige is een bewering van Google zelf en moet als zodanig worden gelezen: de taal van expressiviteit, de taalaantallen, de replicatiekwaliteit. De arena geeft je een voorkeursrangschikking en verder niets. Die vertelt je niet hoe elk model omgaat met een script van 40 minuten zonder drift, hoe het zich gedraagt bij een eigennaam die het nooit heeft gezien, of wat er na een week gebeurt met een ontworpen stem.

Het Lite-model is ook het sterkere argument dat het duo een echte tweedeling vormt en niet een marketingcategorie. Een Elo-verschil van 25 punten dat binnen de foutmarges valt, tegenover een prijsverschil van 33%, is de vorm van een beslissing die prijsgevoelige pipelines bijna altijd in het voordeel van Lite zouden moeten nemen — en de vorm van een beslissing die latentiegevoelige pipelines in de andere richting zouden moeten nemen, aangezien de twee zowel op de klok als op de factuur van elkaar verschillen.
Waar je het kunt uitvoeren, en de eerlijke versie van dat antwoord
OrcaRouter host de Gemini 3.8 TTS-endpoints niet. Dat is het waard om ronduit te zeggen in plaats van iets anders te suggereren, want het nuttige dat we over deze twee modellen kunnen zeggen is niet dat wij ze aanbieden — dat doen we niet — maar dat een prijsverlaging van een leverancier zoals de wijziging van 31 december precies het soort gebeurtenis is dat routing de moeite waard maakt.
OrcaRouter plaatst meer dan 200 modellen achter één enkele API-sleutel tegen de lijstprijs van de provider, zonder opslag, dus de tariefkaart van een leverancier is wat je betaalt, en een wijziging daarin is bij ons dezelfde dag live in plaats van bij de volgende factureringscyclus. Voor een spraakpijplijn die midden in een migratie zit, is de failoverlaag belangrijker dan de catalogus: je kunt een verzoekpad op een model zetten dat nog wordt geëvalueerd zonder een productieroute erop te wagen, omdat een mislukte oproep kan terugvallen op iets dat al bewezen is. De routing-DSL combineert meerdere modellen in één aanroep voor de gevallen waarin geen enkele stem goed genoeg is, en model fusion beantwoordt een prompt met een panel wanneer het antwoord belangrijker is dan de latentie.
Voor de Gemini 3.8 TTS-modellen zelf is de plek om ze aan te roepen de eigen API van Google, en de oppervlakken die Google op 23 september noemde. Wat het duo met je architectuur doet — één aanroep voor twee sprekers, styling als annotatie, een stem die kan worden beschreven in plaats van gekozen — is het deel dat de introductiekorting overleeft.
Wat nu te kijken
Drie dingen zullen bepalen of deze generatie een fundamentele verandering is of slechts een functie.
De eerste is drift. Niemand heeft een uitgebreide evaluatie gepubliceerd van de vraag of het tweesprekerpad identiteit behoudt gedurende een vol uur, en totdat iemand dat doet, is de pelican-demo een demo. De tweede is de levensduur van de stem. Een ontworpen stem die binnen een week verloopt, is een prototype; een stem die opnieuw kan worden afgeleid uit een opgeslagen configuratie, is een product, en het antwoord hangt af van welke van de twee identificatoren je bewaart. De derde is wat er gebeurt na 31 december, wanneer het promotietarief eindigt en de kosten per uur van een spraakpijplijn van de ene op de andere dag verdubbelen.
Geen van die is te zien in het launchbericht. Alle drie zijn ze te zien in de documentatie, en dat is precies waar de verslaggeving over de launch ophoudt met lezen.
