
Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: De Stem die Luistert vs de Koning van de Arena's
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Er zijn twee concurrerende theorieën over waarom een synthetische stem menselijk aanvoelt, en op dit moment zijn de twee beste commerciële voorbeelden ervan Inworld Realtime TTS-2 en Cartesia Sonic 3.6. De theorie van Cartesia is dat de menselijkheid in de audio zit: maak het timbre, de prosodie en de timing niet te onderscheiden van die van een persoon, en luisteraars zetten je op de eerste plaats — dat is wat Sonic 3.6 in augustus deed, door naar de top van de Provider Voice-arena van Artificial Analysis te springen met een Elo van 1.282. De theorie van Inworld is dat de menselijkheid in het luisteren zit: TTS-2 stemt zijn voordracht af op de daadwerkelijke audio van het gesprek dat eraan voorafging, dus het klinkt niet alleen als een mens, maar het reageert ook als een mens. Deze week kwamen de twee theorieën op het scorebord in botsing: dezelfde herberekening die Inworld Realtime TTS-2 met een Elo van 1.252 op #2 van het providerbord plaatste, zette het ook op #1 van de Controlled Voice-arena — het bord dat Cartesia had aangevoerd — met 1.123 tegenover de 1.119 van Sonic 3.6. Het ene model houdt de kroon op het providerbord. Het andere heeft net die van de Controlled Voice-arena veroverd.
Dit is geen vergelijking waarin één kant overduidelijk fout zit. De twee modellen zijn gebouwd voor overlappende maar niet identieke taken, en het prijsverschil — Sonic 3.6 voor $49.0 per miljoen tekens tegenover $25 on-demand voor Inworld Realtime TTS-2 — is reëel genoeg dat de beslissing zowel een budget- als een kwaliteitscomponent heeft.
Twee theorieën over een menselijk klinkende stem
Cartesia heeft Sonic 3.6 in augustus 2026 geruisloos uitgebracht, een point release die Sonic 3.5 verbeterde zonder de prijs of het architectuurverhaal te veranderen. De verbetering kwam precies waar Cartesia die nodig had: het model sprong naar Elo 1.282 op de Provider Voice-arena van Artificial Analysis — waar elk model met zijn eigen stemmen spreekt — en hield in augustus de toppositie in de Controlled Voice-arena vast. Op de gecontroleerde ranglijst wordt elk model naar dezelfde acht referentiesprekers gekloond, dus die kroon is een oordeel over de synthesemotor zelf, onafhankelijk van het stemtalent. Nadat de scores deze week zijn herberekend naar aanleiding van Inworlds algemene beschikbaarheid, leidt Cartesia nog altijd de providerranglijst, maar Sonic 3.6 staat nu op nummer 2 van de gecontroleerde ranglijst, op Elo 1.119, vier punten achter Inworld Realtime TTS-2 op 1.123.
Inworld Realtime TTS-2 komt uit een andere traditie. Zijn voorgangerreeks, TTS 1.5, stond begin 2026 bij de top van dezelfde arena's, en de research preview van TTS-2 haalde in juni een Elo van 1.209 op de providerranglijst. Het GA-model is sindsdien gestegen: op de huidige ranglijsten staat het op 1.252 bij Provider Voice (#2, achter de 1.282 van Sonic 3.6) en op 1.123 bij Controlled Voice (#1). De echte onderscheidende factor van het vlaggenschip is echter niet de Elo, maar het feit dat het model de eerdere beurten van een gesprek als audio-invoer neemt en op basis daarvan bepaalt hoe het de volgende zin uitspreekt. Cartesia kalibreert emotie op basis van het transcript. Inworld luistert naar hoe het laatste werd gezegd.
Het scorebord, eerlijk gelabeld.
De Elo-cijfers zijn afkomstig van de spraakarena's van Artificial Analysis en zijn afgelezen van de live-borden in september 2026. De latentiecijfers worden door leveranciers opgegeven tenzij anders vermeld, en voor geen van beide modellen is een onafhankelijke latentie-audit gepubliceerd.
• Onafhankelijke kwaliteit — Cartesia Sonic 3.6: Elo 1.282 (#1, Provider Voice) en 1.119 (#2, Controlled Voice) vs Inworld Realtime TTS-2: Elo 1.252 (#2, Provider Voice) en 1.123 (#1, Controlled Voice)
• Prijs per 1M tekens — $49,0 (Artificial Analysis-tracking) vs $25 op aanvraag, $20,8 gewogen zoals gevolgd door Artificial Analysis, aflopend tot $12,50 bij volume (leverancier).
• Tijd tot eerste audio — onder de 90 ms (door leverancier opgegeven) versus mediaan onder de 200 ms, onder de 100 ms op p99 in Inworlds lanceringstests (door leverancier opgegeven); Inworlds antwoord met lage latentie op Sonic is de afzonderlijke TTS-2 Flash-laag met ~25 ms tijd tot eerste byte.
• Talen — 42 talen gelokaliseerd vs. 100+ talen voor leveringssturing, waarbij de one-voice-identity-claim van Inworld zich uitstrekt tot 200+ locales (volgens de leverancier).
• Directe stemklonering — ~10 seconden audio versus 5–15 seconden, plus een professionele kloneringsbèta die ~10 minuten audio nodig heeft voor klonen met een hogere getrouwheid.
• Voordrachtcontrole — inline transcript-tags zoals [laughter], plus volume- en snelheidsmodulatie versus sturing in gewoon Engels zoals “[calm, reassuring]” of [whisper], instructies per verzoek, en drie stabiliteitsmodi van Stable tot Expressive.

Waarom "listens to the conversation" een andere as is
Het scorebord hierboven meet hoe een stem in isolatie klinkt. De dimensie waarin de twee modellen daadwerkelijk uiteenlopen, verschijnt op geen enkel leaderboard, omdat die alleen bestaat over meerdere beurten heen.
Inworld Realtime TTS-2 is gebouwd voor het scenario waarin iemand zojuist iets tegen het systeem heeft gezegd. Het model verwerkt de audio van eerdere beurten — niet alleen een transcript daarvan — redeneert over toon, tempo en emotionele toestand, en kiest een reactietoestand voordat het gaat spreken. Als een beller gefrustreerd is, verschuift de spreekstijl; als die ontspannen is, schakelt hij terug. Dat is waarom Inworld het model op de markt brengt voor agents, metgezellen en games in plaats van voor vertelling: de functie is betekenisloos bij een eenmalige tekst-naar-spraakaanroep, en betekenisvol in een gesprek.
Cartesia Sonic 3.6 werkt anders. Het is een snelle, hoogwaardige streaming-engine, en de eigen claim van Cartesia is automatische emotionele kalibratie op basis van het transcript: het leest de woorden en moduleert dienovereenkomstig. Wat het niet doet, is luisteren naar de audio van de voorgaande beurten. Bij één enkele uiting kunnen de twee vergelijkbaar klinken; over een heel gesprek gezien modelleert Inworld iets wat Sonic niet probeert. Als je product een eenmalige voice-over is, is die modellering overhead. Als het een live-agent is, is het het product.

Snelheid, prijs en de Flash-waarschuwing.
Wat pure latentie betreft kan Cartesia de eer opeisen: een time-to-first-audio van onder de 90 ms is door de leverancier opgegeven, maar het is wel het cijfer dat het bedrijf sinds de Sonic 3-generatie heeft geleverd, en niemand heeft een audit gepubliceerd die dit tegenspreekt. Het vlaggenschip van Inworld antwoordt in een vergelijkbare conversatieklasse, met een latentie onder de 200 ms — wat prima is voor live agents. De echte latentietroef van Inworld is de Flash-tier die samen met het GA-model is uitgebracht — een apart model met een time-to-first-byte van ~25 ms, gericht op workloads met een hoog volume, waar kosten en latentie in de Sonic-klasse belangrijker zijn dan expressiviteit. Het voorbehoud is dat Flash het afgeslankte familielid is: direct klonen en inline non-verbale uitingen, maar geen professioneel klonen en geen volledige aansturing via natuurlijke taal.
Qua prijs ligt het echter omgekeerd. Sonic 3.6 kost $49.0 per miljoen karakters — ongeveer het dubbele van Inworlds on-demandtarief van $25, en bijna vier keer de hoogste prijsklasse van $12.50. De kwaliteitskloof tussen beide, op de ranglijsten waar beide voorkomen, rechtvaardigt die factor niet voor een grootafnemer. Voor een realtime voiceagent die duizenden karakters per gesprek genereert, is het prijsverschil per karakter het verschil tussen een gezonde en een magere unit-economie.
Welke te kiezen?
• Kies Cartesia Sonic 3.6 als je de kroon van het providerklassement wilt — de stem met de hoogste score die gebruikmaakt van zijn eigen native stemmen, Elo 1,282, voor korte op zichzelf staande uitingen zoals assistent-antwoorden, zinnen uit games en statusmeldingen. Voor $49 per miljoen tekens betaal je voor de kroon, en het blijft het model om te verslaan op dat klassement.
• Kies Inworld Realtime TTS-2 als het product een gesprek met meerdere beurten is, waarbij de spraak moet reageren op de persoon aan de andere kant — supportgesprekken, een metgezel, een interview, een bijlesessie. Het voert nu het gecontroleerde klassement aan, waar elk model met dezelfde acht referentiestemmen spreekt, en doet dat tegen ongeveer de helft van de prijs terwijl het naar de audio van het gesprek luistert.
• Integreer de switch in de routing als je niet van tevoren kunt weten welke stem een gesprek nodig heeft. Geen van beide modellen is op dit moment beschikbaar op OrcaRouter — Sonic is bereikbaar via Cartesia's eigen API en verschillende platforms van derden, Inworld via zijn eigen API — maar een routinglaag is precies de structuur waarmee een gesprek met de ene stem kan starten en naar de andere kan overschakelen, waarbij de lijstprijs van elke provider zonder opslag wordt doorberekend. Op de dag dat een van deze besturen weer omslaat — en deze week was het zover — wordt de keuze een configuratiewijziging in plaats van een herschrijving.
De korte versie
Dit is een echte splitsing, en het eerlijke antwoord is dat de splitsing draait om beurtwisseling, niet om audiokwaliteit. Als je de best scorende standalone stem nodig hebt die gebruikmaakt van eigen native stemmen, heeft Cartesia Sonic 3.6 de kroon onder de aanbieders met een Elo van 1.282 en rekent daarvoor $49 per miljoen tekens. Als je een stem nodig hebt die reageert op hoe er tegen haar werd gesproken, is Inworld Realtime TTS-2 deze week GA gegaan tegen $25 on demand, staat bovenaan het gecontroleerde klassement waar de twee op gelijke stemmen tegen elkaar worden gemeten, en beschikt over een conversatiebewustzijnsfunctie die door geen enkele arena volledig wordt gemeten. De klassementen zijn nu verdeeld tussen de twee modellen — wat het eerlijkst mogelijke beeld is van een markt waar 'beste' afhangt van de test.

