
Gemini 3.8 TTS vs VoxCPM2: Een stem huren of er zelf een draaien, in echte cijfers
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Er is geen leaderboardrij die Gemini 3.8 Flash TTS en VoxCPM2 naast elkaar zet, en dat ontbreken is het nuttigste gegeven in deze vergelijking. Gemini 3.8 Flash TTS is een gehost endpoint met een Elo van 1.260 op rang 2 in de Artificial Analysis Provider Voice Arena en een gepubliceerde tariefkaart in tokens. VoxCPM2 is een OpenBMB-checkpoint — 2 miljard parameters, Apache 2.0, uitgebracht in april 2026 — dat geen enkele inferentieprovider host. Je kunt het niet huren. Je draait het zelf.
Dus de vraag is niet welk model beter klinkt. Het is of je werklast beter gediend is bij het per teken betalen voor de GPU's van iemand anders, of bij het bezitten van de GPU's en ervoor betalen of ze nu werken of niet. Dat is een rekenkundige kwestie, en anders dan bij de meeste modelvergelijkingen heeft ze een antwoord dat je kunt berekenen voordat je je vastlegt.

Een van deze huur je, de andere bedien je
Begin met wat ieder je daadwerkelijk in handen geeft.
• Toegang — Gemini 3.8 Flash TTS is uitsluitend via API beschikbaar, aangeroepen via de Gemini API en de Google-oppervlakken die genoemd worden in de aankondiging van 23 september 2026. VoxCPM2 heeft geen first-party endpoint in productie en geen inference provider die het bedient; het checkpoint is het product.
• Licentie — VoxCPM2 wordt uitgebracht onder Apache 2.0, wat commercieel gebruik zonder een aparte overeenkomst toestaat. Dat is een echt permissieve licentie, en het is niet de standaard voor open spraakgewichten, waarvan er verschillende onder voorwaarden voor uitsluitend onderzoek worden uitgebracht die commercieel gebruik via een gehoste API laten verlopen.
• Grootte — VoxCPM2 heeft 2 miljard parameters en past bij verlaagde precisie voor ontwikkeling in ongeveer 8 GB VRAM, met een piek tijdens serving van ongeveer 22 GB op een 24GB-kaart. Google heeft voor geen van beide Gemini 3.8 TTS-modellen een parameteraantal gepubliceerd.
• Stemcreatie — Gemini 3.8 Flash TTS verzorgt stemontwerp op basis van een geschreven beschrijving, stemreplicatie op basis van een sample van 30 seconden, en een dialoog tussen twee sprekers in één aanroep. VoxCPM2 is een tekst-naar-spraakmodel voor één stem; een gesprek bestaat uit twee aan elkaar geregen runs.
• Onafhankelijke score — Flash TTS heeft er een. VoxCPM2 staat niet tussen de gerangschikte rijen op de Provider Voice Arena zoals vastgelegd op 24 september 2026. Afwezigheid op een ranglijst is geen oordeel over kwaliteit — het betekent meestal dat niemand het model heeft ingediend — maar het betekent wel dat er geen voorkeursscore van derden is om mee te wegen.

Dat laatste punt snijdt aan twee kanten en het is de moeite waard om het ronduit te zeggen in plaats van te verdoezelen: als je een onafhankelijk kwaliteitssignaal nodig hebt voordat je je vastlegt, levert slechts één van deze twee dat.
Het getal dat de doorslag geeft: real-time factor
Het zelf hosten van een spraakmodel verandert een rekening per teken in een rekening per GPU-uur, en de wisselkoers tussen die twee eenheden is de real-timefactor van het model — hoeveel seconden rekentijd het kost om één seconde audio te produceren.
VoxCPM2's gepubliceerde cijfers zijn 0,30 in gewone PyTorch en 0,13 onder Nano-VLLM. Lees die als doorvoer in plaats van latentie: bij 0,13 levert één GPU-uur kloktijd iets in de orde van 7,7 uur voltooide audio op. Bij 0,30 levert hetzelfde GPU-uur dichter bij 3,3 uur op. Dat zijn de eigen cijfers van de modelkaart, gemeten door OpenBMB, en ze vormen de allerbelangrijkste input voor elke build-versus-buy-beslissing hier.
Daaruit volgen drie dingen.
• De servingstack is belangrijker dan het model. De overstap van gewone PyTorch naar Nano-VLLM verdubbelt de doorvoer op identieke hardware ruimschoots. Elk kostenmodel dat op het cijfer 0,30 is gebaseerd, overschat de kosten voor zelf hosten met een factor van ongeveer 2,3.
• Benutting is alles. Een gehuurde GPU die 90% van de tijd inactief is, is tegen geen enkele prijs goedkoper dan een API. Het break-evenpunt verschijnt pas wanneer je de kaart bezig houdt.
• Batchverwerking verandert de rekensom opnieuw. De realtimefactor wordt per stream gemeten; een server die gelijktijdige verzoeken verwerkt, amortiseert de vaste kosten daarover, en dat is precies het regime waarin zelfhosting begint te winnen.
Wat een uur audio kost, in beide richtingen
Zet de twee factureringsmodellen op dezelfde as. Eén uur voltooide audio is 3.600 seconden output.
Aan de huurkant factureert Google in tokens in plaats van tekens: $0,50 per miljoen teksttokens in en $9,00 per miljoen audiotokens uit tot en met 31 december 2026, daarna $18,00; Flash-Lite TTS is $0,50 en $6,00, daarna $12,00. Batch en Flex rekenen $0,25 en $4,50 voor Flash TTS tegenover $0,25 en $3,00 voor Flash-Lite TTS, en Priority rekent $0,90 en $16,00. Artificial Analysis normaliseert de standaardtarieven naar $16,50 en $11,00 per miljoen tekens, wat de conversie van het leaderboard is in plaats van een prijsopgave van Google, en het is het cijfer dat je moet gebruiken bij het vergelijken met een model dat in tekens factureert.
Aan de kant van eigen beheer is er helemaal geen tarief per teken. De kosten zijn het GPU-uur, vermenigvuldigd met het aantal uren dat je bij de hierboven genoemde doorvoer nodig hebt, plus de servingstack, plus de mensen die het draaiende houden. Het voordeel van VoxCPM2 is dat de marginale kosten van het duizendste uur gelijk zijn aan die van het eerste — en het nadeel is dat de marginale kosten van het eerste uur een GPU zijn.
Daarom is de beslissing ongewoon helder:
• Onder een bepaald volume wint de API, en niet zo'n beetje ook. Je betaalt enkele dollars per uur audio tegenover een kapitaalkost, en het promotietarief van Google maakt die kloof nog groter tot 1 januari 2027.
• Boven dat volume wint de Apache 2.0-checkpoint overtuigend op hardware die je al bezit en kunt blijven benutten — en anders dan bij een checkpoint met een onderzoekslicentie, weerhoudt niets in de licentie je ervan het uit te brengen.
• De eerlijke waarheid daartussen is dat je flexibiliteit koopt in plaats van besparingen. Self-hosting geeft je de mogelijkheid om een versie vast te pinnen, audio op je eigen infrastructuur te houden en je niet langer druk te maken over een tariefwijziging van een leverancier.
Waar elk ervan het juiste antwoord is
Kies Gemini 3.8 Flash TTS als je het beter gedocumenteerde product wilt. Het heeft een onafhankelijke score, een gepubliceerde prijs, tweesprekerdialoog in één aanroep, stemontwerp en -replicatie, en geen operationeel oppervlak buiten een API-sleutel. Het zustermodel Flash-Lite TTS biedt je een tweede prijspunt binnen dezelfde interface tegen een genormaliseerde $11,00 per miljoen tekens. Wat je daarvoor in ruil accepteert, is een tarief dat op 1 januari 2027 verdubbelt en geen mogelijkheid om het model ergens te draaien.
Kies VoxCPM2 wanneer het operationele werk het punt is. Apache 2.0 betekent dat commercieel gebruik zonder meer is toegestaan, de 2B-grootte betekent dat één accelerator genoeg is, en de realtimefactor van 0,13 onder Nano-VLLM betekent dat een bescheiden kaart meerdere uren audio per uur kloktijd produceert. Wat je accepteert, is dat niemand anders het voor je gaat draaien: geen gehoste endpoint, geen arena-rij, geen tariefkaart van een leverancier, en elke kwaliteitsgarantie die je krijgt, is er een die je zelf bouwt en meet.

Geen van beide modellen wordt gehost door OrcaRouter, en dat is het waard om direct te zeggen in plaats van iets anders te suggereren. De plek om Gemini 3.8 Flash TTS aan te roepen is Google's eigen API en de oppervlakken die Google heeft genoemd; VoxCPM2 is een checkpoint dat je zelf uitrolt. Wat OrcaRouter dekt, is de laag boven die beslissing — meer dan 200 modellen achter één sleutel tegen de lijstprijs van de provider zonder opslag, zodat een prijswijziging van een leverancier dezelfde dag bij ons live staat in plaats van bij de volgende factureringscyclus, automatische failover zodat een model dat wordt geëvalueerd nooit een productieafhankelijkheid hoeft te zijn, en een routing-DSL die meerdere modellen samenbrengt in één aanroep wanneer één stem niet de hele klus draagt.
Wat nu te kijken
Twee dingen zouden deze vergelijking wezenlijk veranderen, en geen van beide is nog gebeurd.
De eerste is iemand die VoxCPM2 host. Het ontbreken ervan op de inferentiemarkt is de belangrijkste reden waarom de twee modellen op economische gronden in plaats van op kwaliteit worden vergeleken — als een aanbieder het oppakt, is de rekensom huren versus zelf bezitten niet langer de beslissende factor en wordt de ontbrekende arena-rij het ding dat je ingevuld wilt hebben.
Het tweede is de tariefswijziging van januari aan de kant van Google. Bij het promotietarief is de API goedkoop genoeg dat de meeste workloads niets zelf zouden moeten hosten; bij het tarief na de promotieperiode wordt de kloof zo klein dat een team met bestaande GPU-capaciteit en een stabiel volume de berekening opnieuw moet maken in plaats van aan te nemen dat de API nog steeds wint.
Totdat een van die dingen verandert, is de beslissende input geen leaderboard. Het is hoeveel uur audio je per maand produceert, en of de kaart bezet is.
