
Gemini 3.8 TTS vs Inworld Realtime TTS-2: Welk scorebord je gelooft, verandert het antwoord
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Zet Gemini 3.8 Flash TTS en Inworld Realtime TTS-2 naast elkaar op de Artificial Analysis Provider Voice Arena en het antwoord lijkt voor de hand te liggen: rang 2 tegenover rang 4, Elo 1.260 tegenover 1.245, elk 8 arenastemmen, en een genormaliseerde $16,50 per miljoen tekens tegenover $20,80. De leverancier wint op positie en op prijs, en het verschil van 15 punten valt sowieso binnen de betrouwbaarheidsintervallen van beide rijen.
Ga naar het andere leaderboard dat Artificial Analysis publiceert en de volgorde keert om. Inworld Realtime TTS-2 staat bovenaan de Controlled Voice Arena met een Elo van 1.123, met zijn Flash-variant op 1.075. Dat is geen afrondingsverschil — het is een ander model dat wint, en de reden is dat de twee leaderboards niet hetzelfde meten. Als je een stem voor een product kiest, is weten welke van die twee vragen je use case feitelijk stelt, de hele beslissing.

Twee besturen, twee verschillende vragen
De Provider Voice Arena beoordeelt de eigen native stemmen van een model — de stemmen die de leverancier meelevert en host. De Controlled Voice Arena houdt de stem constant en beoordeelt hoe goed elk model presteert wanneer het wordt gevraagd om te spreken met een stem die niet de zijne is. Dezelfde juryleden, hetzelfde soort blinde vergelijking, een andere variabele.
Dat onderscheid komt overeen met twee verschillende taken:
• Provider-ranglijst beantwoordt de vraag: "klinkt dit model goed out of the box". Het is de juiste ranglijst voor een product dat wordt geleverd met een vaste set vertelstemmen en nooit iets kloont.
• Gecontroleerde ranking beantwoordt de vraag: "gehoorzaamt dit model aan een stemspecificatie?" Het is het juiste scorebord voor een product waarbij de stem aan de klant toebehoort — een gekloonde merkstem, een gelicentieerde acteur, een identiteit per tenant.
De modellen van Google voeren de eerste aan. Die van Inworld voeren de tweede aan. Beide uitspraken zijn tegelijkertijd waar en geen van beide is een tegenspraak, en dat is precies waarom één enkel antwoord op de vraag "welk TTS-model is het beste" meestal een teken is dat de schrijver één ranglijst heeft gekozen en niet naar de andere heeft gekeken.

Wat de nummer-éénpositie van Inworld in de praktijk impliceert
Een eerste plaats in een Controlled-resultaat is een claim over trouw aan een instructie, en trouw aan een instructie is de eigenschap die bepaalt of clonen überhaupt bruikbaar is.
Inworlds kloonroute komt in twee vormen. Instant-klooning werkt op basis van een korte sample — het door de leverancier opgegeven cijfer is 5 tot 15 seconden referentie-audio — en een professionele kloonlaag zit in bèta en vraagt in de orde van tien minuten. Beide zijn door de leverancier gerapporteerd, en geen van beide wordt onafhankelijk geverifieerd door de arena; wat de arena meet is het gedrag van het model zodra het een stem heeft, niet de kwaliteit van de kloonstap die die heeft geproduceerd.
De latencyclaims die aan de familie zijn verbonden, vallen in dezelfde categorie. Het first-bytecijfer van de Flash-variant — 25 milliseconden, gerapporteerd via een meting door een derde partij — en de p99-cijfers voor het volledige model zijn van Inworld zelf, en de arena heeft over geen van beide iets te zeggen. Ze zijn aannemelijk voor een op realtime gericht model en ze zijn niet geverifieerd, wat de juiste manier is om ze te behandelen.
De praktische lezing is dus: als jouw product stemmen kloont, is het Controlled-resultaat van Inworld de relevantste van de twee scores, en het is de reden waarom een lagere Provider-rang niet diskwalificerend is. Als jouw product niet kloont, blijft dat voordeel voor jou onzichtbaar en moet je het Provider-overzicht lezen.
De prijsladder heeft drie treden, en de goedkope is een abonnement.
Als je één prijs tegen één prijs afzet, klopt deze vergelijking niet, want Inworld heeft geen prijs — het heeft een ladder.
• On-demand — Realtime TTS-2 voor $25,00 per miljoen tekens, Flash voor $15,00. Dit is het tarief dat een pay-as-you-go-gebruiker ziet, en het is het door de leverancier zelf gepubliceerde cijfer.
• Creator-abonnement — $20,00 en $10,00 voor dezelfde twee modellen, wat een korting van 20% en 33% betekent voor het kiezen van een abonnement in plaats van per gebruik af te rekenen. Volgens de leverancier, en de optie die het meest de moeite waard is om opnieuw te controleren op de actuele prijspagina voordat je je vastlegt, aangezien de voorwaarden van abonnementen sneller veranderen dan lijsttarieven.
• Genormaliseerd — de omrekening per miljoen tekens van de arena geeft $20,80 voor Realtime TTS-2 en $10,40 voor Flash, wat de rekenkunde van het scorebord is en niet de prijsopgave van een van beide leveranciers.
Daar staat tegenover dat de tarieven van Google op tokens zijn gebaseerd en promotioneel zijn: $0,50 per miljoen teksttokens in en $9,00 per miljoen audiotokens uit tot en met 31 december 2026, daarna $18,00; Flash-Lite TTS kost $0,50 en $6,00, daarna $12,00. Genormaliseerd komt dat neer op $16,50 en $11,00.

Lees de twee samen en het beeld is interessanter dan "Google is goedkoper". Op basis van de cijfers zoals vandaag gepubliceerd, is Flash TTS het goedkoopst van de drie modellen en Inworlds Flash-variant het op een na goedkoopst — de twee Flash-modellen liggen zo dicht bij elkaar dat een kleine verandering in je audio-naar-tekstverhouding kan omkeren welke van de twee lager factureert. Op 1 januari 2027, wanneer het Google-tarief verdubbelt, stabiliseert de rangorde zich en wordt Inworld de goedkopere optie op elke trede van zijn ladder. Wie deze twee in september vergelijkt en zich in december vastlegt, vergelijkt de verkeerde cijfers.
Waar elk ervan het betere antwoord is
De twee modellen liggen qua kwaliteit dicht genoeg bij elkaar dat de onderscheidende factoren structureel zijn, dus de eerlijke versie is een lijst met voorwaarden in plaats van een eindoordeel.
Kies Gemini 3.8 Flash TTS wanneer de stemkeuze aan jou is. Stemontwerp op basis van een geschreven beschrijving, tweesprekersdialoog in één enkele aanroep, styling op beurtniveau, en de breedste taaldekking van de twee volgens Google's eigen telling — niets daarvan evenaart Inworld in deze vergelijking. Het is vandaag ook het goedkopere model, en zijn broertje Flash-Lite geeft je een tweede prijspunt binnen dezelfde API.
Kies Inworld Realtime TTS-2 wanneer het om de stem van de klant gaat. Een toonaangevende Controlled Voice-rij, een directe kloonroute gemeten in seconden referentieaudio, een professioneel kloonniveau voor de gevallen die meer nodig hebben, en een realtime-oriëntatie onderbouwd met first-byte-claims die de leverancier publiceert — met de kanttekening dat het claims van de leverancier zelf zijn. Het is volgens de eigen documentatie van de leverancier alleen Engelstalig, wat een harde beperking is als je iets anders nodig hebt.
Geen van deze modellen wordt gehost door OrcaRouter, en dat is het vermelden waard in plaats van iets anders te suggereren: de plek om Gemini 3.8 Flash TTS aan te roepen is Google's eigen API en de oppervlakken die Google op 23 september noemde, en de plek om Inworld Realtime TTS-2 aan te roepen is Inworlds eigen platform. Waar OrcaRouter voor dient, is alles rondom die keuze — meer dan 200 modellen achter één enkele sleutel tegen de lijstprijs van de provider zonder opslag, zodat een tariefwijziging van een leverancier zoals de stap in januari dezelfde dag aan onze kant live is, automatische failover zodat een geëvalueerd model geen productieafhankelijkheid hoeft te zijn, en een routing-DSL om modellen samen te stellen tot één aanroep wanneer geen enkele stem de hele klus draagt.
De reden om deze beide in de race te houden, is dat de rentewijziging van januari en het onderscheid tussen Controlled en Provider twee afzonderlijke redenen zijn waarom het antwoord kan veranderen. Een pijplijn die er slechts één van kan aanroepen, kan geen van beide volgen.
