
GPT-Live-1 vs Inworld Realtime TTS-2: Een prijzenoorlog om stemmen, een premie op luisteren
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Inworld Realtime TTS-2 bereikte algemene beschikbaarheid met iets dat de stemmarkt miste: een gepubliceerde tarievenkaart. Het vlaggenschipmodel kost $25 per miljoen tekens on-demand, het snellere broertje Inworld Realtime TTS-2 Flash kost $15, en beide dalen via volumetarieven naar $12,50 en $7. Met een Elo van 1.244 en een tweede plaats in de spraakarena van Artificial Analysis maakt dat het vlaggenschip ongeveer half zo duur als de huidige koploper in de arena en een van de goedkoopste manieren om een stem uit de top vijf te kopen. GPT-Live-1 is het andere model in deze vergelijking en het tegenovergestelde voorstel — $0,05 per minuut stem, geen tekens, en geen manier om het te kopen zonder ook het luisteren, het beurtnemen en de onderbrekingsafhandeling te kopen die eraan vastzitten.
Het interessante aan de vergelijking is dat het prijsverschil enorm lijkt en vervolgens grotendeels verdampt. Synthese zit in een prijzenoorlog. Conversatie niet.
Wat Inworld daadwerkelijk heeft uitgebracht
De TTS-2-reeks begon in mei 2026 als een onderzoekspreview met een specifieke claim: dat dit een model is dat spraak niet op zichzelf genereert. Het neemt de eerdere beurten van een gesprek als audio-invoer, redeneert over toon en tempo, en past zijn reactie daarop aan. Die positionering — gespreksbewustzijn in plaats van schonere audio — is wat het onderscheidde van de narratie-engines die tot en met 2025 tekst-naar-spraak domineerden.
Algemene beschikbaarheid maakte van de preview een familie en hing er een prijslijst aan. Flash is de doorvoeroptie, waarbij Inworld ongeveer 20 milliseconden server-side tijd tot de eerste byte op het 90e percentiel noemt, tegenover 100 milliseconden voor het vlaggenschip en een mediaan van minder dan 200 milliseconden tot de eerste audio. Dat zijn leverancierscijfers uit Inworlds eigen documentatie; de enige meting door een derde partij die in omloop is, van Coval, plaatst Flash op ongeveer 25 milliseconden en het vlaggenschip in de lage honderden. Geen van beide is onafhankelijk end-to-end geauditeerd.
De functie die het meest het vermelden waard is, heeft niets met latentie te maken. Inworld heeft een verbatim-modus toegevoegd zodat ordernummers, bevestigingscodes, adressen en serienummers teken voor teken worden teruggelezen in plaats van te worden genormaliseerd naar iets dat natuurlijk klinkt maar onjuist is. Voor een spraakagent die net een boeking heeft aangenomen, is die ene tag het verschil tussen een werkend product en een demo die naar een mens wordt geëscaleerd.

Dimensie voor dimensie
• Soort — GPT-Live-1: full-duplex spraak-naar-spraak in één model versus Inworld Realtime TTS-2: een tekst-naar-spraakmodel, met duplex apart beschikbaar via Inworlds Realtime API
• Prijs per eenheid — GPT-Live-1: $0,05 per spraakminuut, per seconde gefactureerd, reasoning-backend apart gemeten vs Inworld Realtime TTS-2: $25 per miljoen tekens on demand, $20 op het Creator-plan en $12,50 op het hoogste tier, met Flash op $15, $10 en $7
• Onafhankelijke kwaliteit — GPT-Live-1: 70,3% op de Speech to Speech Index, gedeeld zesde van veertien vs Inworld Realtime TTS-2: Elo 1.244 uit 1.091 samples en tweede op de Artificial Analysis Provider Voice arena, met Flash op Elo 1.211 uit 1.626 samples en zesde
• Onderbreking — GPT-Live-1: native, vele malen per seconde binnen het model bepaald vs Inworld Realtime TTS-2: geen eigenschap van het TTS-model; Inworld's Realtime API ondersteunt barge-in met ongeveer 100 milliseconden onderbrekingslatentie, via één enkele socket die het OpenAI Realtime-protocol spreekt
• Latentie — GPT-Live-1: 0,798 seconden latentie bij beurtwisseling in OpenAI's eigen tests, geen time-to-first-audio gepubliceerd vs Inworld Realtime TTS-2: 100 milliseconden aan serverzijde op het 90e percentiel, Flash op 20, met een mediane tijd van minder dan één seconde tot de eerste audiochunk over de volledige Realtime API-pijplijn
• Talen — GPT-Live-1: grote talen worden goed ondersteund, daarbuiten wisselend, tegenover Inworld Realtime TTS-2: meer dan 200 locales, waarvan 15 op Tier 1-kwaliteit en nog eens 79 op Tier 2, en één stemidentiteit die in alle locales behouden blijft
• Stemmen en cloning — GPT-Live-1: twaalf presets, geen cloning vs Inworld Realtime TTS-2: 282 ingebouwde stemmen, directe zero-shot-cloning op basis van 5 tot 15 seconden geautoriseerde audio, professionele cloning en volledige sturing van de voordracht, alleen op het vlaggenschipmodel
• Implementatie — GPT-Live-1: alleen gehost, één endpoint, geen gratis tier, gelijktijdigheid beperkt tot 25 tot 500 sessies vs. Inworld Realtime TTS-2: gehoste API plus een afgeschermde on-premises container die een H100 vereist, en een gratis on-demand tier die tot ongeveer 70 minuten synthese omvat

De duplexvraag, precies beantwoord
Het zou gemakkelijk zijn deze vergelijking te schrijven als "de een luistert, de ander spreekt alleen", en het zou op een manier fout zijn die ertoe doet. De tekst-naar-spraakmodellen van Inworld zijn tekst-in, audio-uit. Maar Inworld verkoopt ook een Realtime API die via één enkele WebSocket-, WebRTC- of SIP-verbinding loopt en full-duplex is in de zin die voor een bouwer belangrijk is: het biedt semantische spraakactiviteitsdetectie met een instelbare eagerness-instelling, ondersteunt handmatige beurtregeling en onderbreekt bij barge-in in ongeveer 100 milliseconden. Het is protocolcompatibel met de OpenAI Realtime-interface, waardoor migratie een configuratiekwestie is in plaats van een herschrijving.
Wat Inworlds Realtime API niet is, is een native spraak-naar-spraakmodel. Het is een cascade — een verwisselbaar spraakherkenningsmodel, een taalmodel naar keuze en een synthesizer — georkestreerd binnen één verbinding. Dat is een legitieme architectuurkeuze, en het is dezelfde die de meeste productie-stemagenten maken. Het is simpelweg een andere dan GPT-Live-1, waar één model beslist wanneer het de beurt afstaat.
Het praktische verschil komt naar voren wanneer de beller midden in een zinsdeel onderbreekt. In een cascade wordt de onderbreking gedetecteerd, wordt de generatie geannuleerd en begint er een nieuwe beurt — een reeks die goed werkt en je een round trip kost. In het end-to-endmodel werd de beslissing al continu genomen. Het eerste is een systeem dat snel reageert. Het laatste is een systeem dat nooit is gestopt met luisteren.

Even de cijfers doornemen, want de eenheden verbergen het antwoord.
Spraak gaat met ongeveer 150 woorden per minuut, en het Engels telt gemiddeld ongeveer vijf en een half tekens per woord, dus een minuut gesproken output is ongeveer 800 tot 900 tekens. Bij $25 per miljoen produceert Inworld Realtime TTS-2 een minuut spraak voor ongeveer twee cent. Bij de $15 van Flash is dat minder dan anderhalve cent.
Vergeleken met de $0,05 per stemminuut van GPT-Live-1 lijkt dat een afslachting — totdat je de rest van wat GPT-Live-1 doet erbij prijst. Inworld's Realtime API heeft nog steeds spraakherkenning en een taalmodel nodig, die beide apart worden gefactureerd en beide hun eigen latentie hebben. Tel je die erbij op, dan klimmen de kosten per minuut van de cascade boven een stuiver uit voor elk gesprek dat een echte vraag bevat. De meerprijs van het end-to-endmodel zit niet in de stem. Die zit in de beurtwisseling, en die is ongeveer gelijk aan de kosten van de spraakherkenningsfase die je niet meer koopt.
Waar de cascade beslissend wint, is bij volume zonder gesprek. Meldingsoproepen, bezorgbevestigingen, afspraakherinneringen, gescripte IVR — alles waarbij de tekst bekend is voordat het gesprek begint en niemand gaat onderbreken. Daar is prijsstelling per teken van $7 tot $15 per miljoen simpelweg goedkoper dan duplex per minuut, en betalen voor beurtwisseling die je nooit gebruikt is verspilling.
Er is ook een middenweg die de tweemodel-benadering verbergt. Als je toch een cascade samenstelt, hoeft de spraaklaag niet van een gespecialiseerde stemleverancier te komen: OpenAI's eigen TTS-modellen en Google's Gemini TTS-previewmodellen zijn gewone API-endpoints, en ze zijn gerouteerd. Ongeveer 190 modellen van elf upstream-providers bevinden zich achter één OrcaRouter-sleutel tegen de lijstprijs van de provider, zonder markup — dus een synthesemodel kan in dezelfde catalogus, op dezelfde sleutel en dezelfde factuur staan als het redeneermodel dat het voedt, met automatische failover als een endpoint tijdens de uitrol verslechtert. Het is de minst glamoureuze fase van een spraakstack en de gemakkelijkste om te consolideren. Noch Inworlds Realtime TTS-2, noch het Live Sessions-endpoint van GPT-Live-1 is op die manier beschikbaar; die twee behoren toe aan hun leveranciers.
Welke moet je kiezen?
Kies Inworld Realtime TTS-2 als volume het belangrijkste is en het gesprek gescript is. Agents met een hoge doorvoer, notificaties, meertalige producten waarbij 200 locales en één behouden stemidentiteit belangrijk zijn, of elke implementatie die de on-premises container nodig heeft. Je krijgt een top-twee arena-stem voor ongeveer de helft van de prijs van de koploper, een gratis tier om op te prototypen, cloning die GPT-Live-1 helemaal niet biedt, en een Realtime API die onderbrekingen bekwaam afhandelt in het cascade-patroon dat je waarschijnlijk al draait.
Kies GPT-Live-1 als de onderbreking het product is. Gesprekken die van het script afwijken, bellers die door de agent heen praten, workflows waarin beurtwisseling het verschil is tussen een gesprek en een menu. Je betaalt een tarief per minuut dat niet daalt wanneer spraak goedkoop wordt, je geeft cloning en 200 talen op, en je koopt de naden terug.
De prijzenoorlog in spraaksynthese is echt, en dat is goed nieuws voor iedereen die een spraakagent bouwt — een top-vijfstem kost nu een vijfde van wat die achttien maanden geleden kostte. Maar dat beslecht deze vergelijking niet, omdat hetgeen waarvoor GPT-Live-1 rekent niet hetzelfde is als hetgeen waarop Inworld korting geeft.
