
Maak en implementeer aangepaste audio met Gemini 3.8 Flash TTS: stemontwerp, klonen en de twee klokken die beslissen
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 506 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 184 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS laten je beide een stem bedenken op basis van een geschreven beschrijving in plaats van er een uit een lijst te kiezen, en beide zijn op 23 september 2026 algemeen beschikbaar gekomen op de Gemini API. De kop die mensen herhalen, is het stemontwerp. Het deel waar je omheen moet plannen, is wat er daarna met een ontworpen stem gebeurt, want de leverancier geeft je twee manieren om er een te behouden en verbindt aan elk daarvan een andere levensduur. Kies de verkeerde en de stem waarvan je product afhankelijk is, verloopt binnen een week.
Dat is de leemte in de berichtgeving rond de lancering tot nu toe. De aankondigingsberichten leggen uit dat je een stem met een prompt tot stand kunt brengen, en een paar ervan noemen klonen op basis van een sample van 30 seconden. Geen van alle gaat in op het opslagmodel, hetgeen bepaalt of een spraakpijplijn reproduceerbaar is vanuit een configuratiebestand of volgens een schema opnieuw moet worden geprovisioneerd. Dit artikel behandelt het hele traject — ontwerpen, opslaan, aanroepen en betalen — met de prijzen en de quota zoals Google die publiceert.
Wat is er op 23 september uitgebracht?
Twee modellen, één API-schema. De identifiers zijn gemini-3.8-flash-tts en gemini-3.8-flash-lite-tts, en in de documentatie van Google staat expliciet dat beide "exact hetzelfde API-schema en promptformaat" gebruiken — overstappen tussen beide is een wijziging van één parameter, geen herschrijving.
• Invoer — alleen tekst. Beide modellen accepteren tekst en retourneren audio; ze zijn niet multimodaal en genereren geen tekst terug.
• Uitvoer — WAV, 24 kHz mono 16-bit signed PCM op de unary endpoint; PCM zonder header (audio/l16) op de streaming endpoint; audio/mulaw en audio/alaw geaccepteerd met een configureerbare sample rate.
• Talen — 130 op Flash TTS, 101 op Flash-Lite TTS, automatisch gedetecteerd aan de hand van de tekst in plaats van aangegeven in het verzoek.
• Voices — 30 gecureerde studiostemmen die in de documentatie staan (waaronder Kore en Puck), een Extended Voice Library met "honderden" meer die op te vragen zijn via het voices-endpoint, plus de twee onderstaande creatiepaden.
• Regie — regel-voor-regel sturing van de voordracht, scènes met twee sprekers opgevoerd vanuit één script, en non-verbale aanwijzingen zoals <laughs>, <sigh> en |mhm| die rechtstreeks in het transcript zijn geschreven.
De twee niveaus bestaan omdat de workloads zijn uiteengelopen. Flash TTS is gepositioneerd voor maximale akoestische getrouwheid en complex acteerwerk; Flash-Lite TTS wordt in Google's eigen woorden beschreven als de "workhorse replacement" voor gemini-3.1-flash-tts-preview, gericht op bulk-dubbing, voorleesfuncties en voice-agent-cascades. Beide vervangen een enkel preview-model dat sinds april 2026 op de API stond, dus als je op de preview zat, is de migratie een keuze tussen niveaus in plaats van een versie-update.

Het ontwerpen van een stem is een prompt, en dat verandert de beoordelingsstap.
Het creatieoppervlak is het echt nieuwe in deze generatie. Een geprompte stem wordt opgebouwd uit een beschrijving in natuurlijke taal — rol, accent, stemkarakter — en retourneert een identificatiecode die je hergebruikt. In de API is dit een aanroep voor het maken van een stem met store: true en een geprompte invoer; in Google's eigen voorbeelden lopen de beschrijvingen van een energieke Melbourne-dj tot een Japanse draak. Zodra de stem is gemaakt, wordt er in een spraakverzoek naar verwezen via de identificatiecode, en de stijlinstructies per verzoek kunnen dan minimaal of leeg zijn, omdat het personage al in de stem is ingebakken.
De praktische consequentie is een workflowverandering, niet alleen een functie. Stemcasting was vroeger een licentieonderhandeling of een studioreservering, wat betekende dat de stemselectie eenmalig en vroeg plaatsvond en de beoordeling overleefde, omdat het wijzigen ervan duur was. Wanneer een stem een alinea tekst is, wordt casting een design token — iets wat een productmanager kan vragen om op dinsdag opnieuw te laten genereren. Teams die de beschrijvingsstring in versiebeheer zetten en de gegenereerde stem-ID als een build-artefact behandelen, krijgen consistente output in alle omgevingen. Teams die stemmen handmatig aanmaken in AI Studio zullen dat niet doen, en de fout zal lijken op een onverklaarbaar verschil tussen staging- en productie-audio.
De twee klokken
Dit is het gedeelte dat lanceringsposts overslaan. Google laat je een ontworpen of gerepliceerde stem in een van twee toestanden behouden, en ze verlopen in sterk uiteenlopende tempo's.
Opgeslagen stemmen — gemaakt met opslag ingeschakeld, ze leven in je project en vallen onder een quotum van 200 stemmen per project met een levensduur van één jaar.
• Toestandsloze sleutels — stemreplicatie kan een door de client beheerde sleutel retourneren (de voicekey_… vorm) in plaats van een opgeslagen identificatie, en die sleutel heeft een levensduur van zeven dagen.
Samen gelezen vormen die twee een ontwerpinstructie. Een opgeslagen stem is een verbintenis van een jaar en een hard plafond van 200 per project, wat royaal is voor een product met een vaste cast en nutteloos voor alles wat per klant een nieuwe stem genereert. De stateless sleutel is het tegenovergestelde: geen quotadruk, maar een sleutel die je wekelijks opnieuw moet aanmaken, wat betekent dat je applicatie een verversingspad nodig heeft en je infrastructuur inloggegevens moet opslaan die roteren. Geen van beide is verkeerd. Kiezen zonder te merken welke je hebt gekozen, is hoe een spraakagent op dag acht stilvalt.
Er kleven nog twee eigenschappen aan replicatie die de moeite waard zijn om te weten voordat je iets belooft aan een juridisch team. Het creëren van een gerepliceerde stem vereist een mondelinge toestemmingsopname van de eigenaar van de stem die moet overeenkomen met de referentiespreker — een gesproken controle, geen selectievakje. En de output draagt herkomst: elke clip is voorzien van een SynthID-watermerk, en gerepliceerde stemmen dragen daarnaast C2PA-contentreferenties. Het ontwerppad is bewust de moeilijkere om te misbruiken, en beide barrières zijn structureel in plaats van beleidsverklaringen.
Eén discrepantie die het vermelden waard is in plaats van op te lossen. De tabel met ondersteunde modellen van Google vermeldt stemontwerp en stemreplicatie als beschikbaar op beide 3.8 TTS-modellen. De meeste berichtgeving rond de lancering beschrijft replicatie specifiek als onderdeel van het Flash TTS-verhaal. Als replicatie van belang is voor uw beslissing tussen de niveaus, verifieer dit dan aan de hand van de documentatie voor het niveau dat u wilt uitrollen, in plaats van een van beide samenvattingen te vertrouwen.
Wat een uur audio kost
Google factureert spraak in tokens, niet in tekens of seconden, en de omrekening is gepubliceerd: audio wordt getarifeerd op 25 tokens per seconde output, wat neerkomt op 90.000 tokens per uur. Dat maakt de rekensom ongewoon eenvoudig, en dat is het getal dat je in een budget moet opnemen in plaats van het tarief per miljoen.
• Flash TTS standard — $0,50 per miljoen teksttokens in, $9,00 per miljoen audiotokens uit tot en met 31 december 2026, daarna $1,00 en $18,00. Batch en Flex zijn $0,25 en $4,50; Priority is $0,90 en $16,20.
• Flash-Lite TTS standaard — $0,50 en $6,00 tot dezelfde datum, daarna $1,00 en $12,00. Batch en Flex $0,25 en $3,00; Priority $0,90 en $10,80.
• In seconden — Flash TTS komt neer op ongeveer $0,81 per uur gegenereerde audio tijdens de promotieperiode en ongeveer $1,62 daarna; Flash-Lite TTS is ongeveer $0,54 en daarna $1,08.
• Vergeleken met het model dat het vervangt — gemini-3.1-flash-tts-preview kost $1,00 en $20,00 per miljoen, dus de audio-outputlijn daalde met 55 procent bij Flash TTS en 70 procent bij Flash-Lite TTS.
Plan niet op basis van het promotietarief. Google publiceert beide kolommen in dezelfde tabel, wat betekent dat het tarief voor januari geen gerucht is dat later moet worden ontdekt — het staat vandaag al op de tariefkaart, en elke schatting per duizend minuten die op $0,81 is gebaseerd, moet een verdubbeling kunnen doorstaan.
Eén onafhankelijk getal, en verscheidene die dat niet zijn.
De aankondiging van Google begint met benchmarkresultaten, en die moeten worden gelezen voor precies wat ze zijn. Het bedrijf zegt dat Flash TTS de eerste plaats behaalde op Hume AI's Voice Design Benchmark met 71,4, aan de top stond bij accentmodellering met 60,8, en dat Flash TTS en Flash-Lite TTS eerste en tweede werden op Hume's Overall Quality Index, met sterke plaatsingen op basis van blinde voorkeur op Voice Arena voor Japans, Braziliaans-Portugees, Vietnamees, Modern Standaardarabisch, Mexicaans Spaans en Hindi. Allemaal door de leverancier gerapporteerd, geen van de runs openbaar.
Er zit een detail in die lijst dat het opmerken waard is. Alan Cowen, vermeld als auteur van de aankondiging van Google, is de oprichter van Hume AI — het lab waarvan de Voice Design Benchmark het kopcijfer levert. Dat maakt het cijfer niet onjuist, en de benchmark van Hume is een echte, maar de twee zijn niet onafhankelijk van elkaar, en een lezer die de 71,4 afweegt, zou dat moeten weten voordat hij het als validatie door derden herhaalt.
Het onafhankelijk verzamelde cijfer staat op Artificial Analysis' Provider Voice Arena, vastgelegd voor dit artikel op 24 september 2026: Gemini 3.8 Flash TTS staat tweede met een Elo van 1.260, met een interval van 17 punten over 1.999 samples, achter Cartesia Sonic 3.6 op 1.273. Gemini 3.8 Flash-Lite TTS staat zesde op 1.235. Het model dat wordt vervangen, Gemini 3.1 Flash TTS, staat tiende op 1.199 over 3.430 samples. Voorkeur van blinde luisteraars, niet de eigen evaluatie van een lab — en het enige kwaliteitscijfer hier dat Google niet heeft laten uitvoeren.

Waar je het kunt draaien, en waar nog niet
Beide modellen zijn vandaag beschikbaar in de Gemini API en Google AI Studio, zonder wachtlijst. De consumenten- en zakelijke interfaces zijn gefaseerd in plaats van uitgebracht: Flash TTS komt naar Gemini Notebook en Flash-Lite TTS naar Google Vids, toegang tot Gemini Enterprise wordt beschreven als binnenkort beschikbaar, en voice remixing — het aanpassen van timbre, toonhoogte, tempo en accent van een bestaande stem — wordt vermeld als een toekomstige functie in plaats van een huidige. Als je plan afhangt van remixing, bestaat het nog niet.
Wat ons eigen aanbod betreft, eerlijkheid voorop: de Gemini 3.8 TTS-endpoints staan niet op de routingtabel van OrcaRouter. De generatie die ze vervangen wel — google/gemini-3.1-flash-tts-preview staat in de catalogus voor dezelfde $1,00 en $20,00 per miljoen tokens die Google publiceert, omdat de adviesprijs van de provider zonder opslag wordt doorgegeven, en die antwoordt op hetzelfde /v1/audio/speech-endpoint dat je OpenAI-compatibele SDK al aanspreekt. Dat is belangrijker dan het klinkt voor een spraakworkload, want wat je feitelijk koopt is een stabiel endpoint dat je applicatie kan aanroepen terwijl de modellen erachter veranderen. Je code bevat een modelstring; de catalogus bevat de routing. Wanneer de promotieperiode van Google op 31 december afloopt en Flash TTS twee keer zo duur wordt, verandert de prijs van een gerouteerd model dezelfde dag in plaats van bij de volgende contractverlenging — en een model dat uitvalt, wordt automatisch overgenomen in plaats van dat je voice-overwachtrij erin meegaat.

Als je deze generatie beoordeelt voordat je je vastlegt, is het goedkope experiment er een met twee niveaus. Laat hetzelfde script door Flash TTS en Flash-Lite TTS gaan, want het schema is identiek en het verschil is een parameter — beslis daarna met je eigen audio in plaats van met een benchmarkgrafiek, en controleer op Artificial Analysis of de kwaliteitskloof de foutmarges overleeft voordat je de meerprijs betaalt. Voor een grootformaat narratieproject is de meerprijs echt geld; voor een supportbot die een telefoonnummer hardop voorleest, levert die je niet duidelijk iets op dat een luisteraar kan horen.
