Hero-titelkaart voor 'GPT-Live-1 vs Inworld Realtime TTS-2', met als ondertitel 'Synthese wordt goedkoop; horen is nog steeds duur', met drie kaarten met de tekst 'Inworld Realtime TTS-2: $25 per 1 miljoen tekens, met staffelprijzen tot $12,50', 'Inworld Realtime TTS-2 Flash: $15 per 1 miljoen tekens, met staffelprijzen tot $7', 'GPT-Live-1: $0,05 per stemminuut, plus de redenering erachter', boven een voetbalk met de tekst 'Inworld-prijzen door de leverancier gepubliceerd, september 2026; prijzen van GPT-Live-1 volgens de documentatie van OpenAI.' Het OrcaRouter-logo is in de rechteronderhoek samengevoegd.
Guides & Insights

GPT-Live-1 vs Inworld Realtime TTS-2: Een prijzenoorlog om stemmen, een premie op luisteren

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Inworld Realtime TTS-2 bereikte algemene beschikbaarheid met iets dat de stemmarkt miste: een gepubliceerde tarievenkaart. Het vlaggenschipmodel kost $25 per miljoen tekens on-demand, het snellere broertje Inworld Realtime TTS-2 Flash kost $15, en beide dalen via volumetarieven naar $12,50 en $7. Met een Elo van 1.244 en een tweede plaats in de spraakarena van Artificial Analysis maakt dat het vlaggenschip ongeveer half zo duur als de huidige koploper in de arena en een van de goedkoopste manieren om een stem uit de top vijf te kopen. GPT-Live-1 is het andere model in deze vergelijking en het tegenovergestelde voorstel — $0,05 per minuut stem, geen tekens, en geen manier om het te kopen zonder ook het luisteren, het beurtnemen en de onderbrekingsafhandeling te kopen die eraan vastzitten.

Het interessante aan de vergelijking is dat het prijsverschil enorm lijkt en vervolgens grotendeels verdampt. Synthese zit in een prijzenoorlog. Conversatie niet.

Wat Inworld daadwerkelijk heeft uitgebracht

De TTS-2-reeks begon in mei 2026 als een onderzoekspreview met een specifieke claim: dat dit een model is dat spraak niet op zichzelf genereert. Het neemt de eerdere beurten van een gesprek als audio-invoer, redeneert over toon en tempo, en past zijn reactie daarop aan. Die positionering — gespreksbewustzijn in plaats van schonere audio — is wat het onderscheidde van de narratie-engines die tot en met 2025 tekst-naar-spraak domineerden.

Algemene beschikbaarheid maakte van de preview een familie en hing er een prijslijst aan. Flash is de doorvoeroptie, waarbij Inworld ongeveer 20 milliseconden server-side tijd tot de eerste byte op het 90e percentiel noemt, tegenover 100 milliseconden voor het vlaggenschip en een mediaan van minder dan 200 milliseconden tot de eerste audio. Dat zijn leverancierscijfers uit Inworlds eigen documentatie; de enige meting door een derde partij die in omloop is, van Coval, plaatst Flash op ongeveer 25 milliseconden en het vlaggenschip in de lage honderden. Geen van beide is onafhankelijk end-to-end geauditeerd.

De functie die het meest het vermelden waard is, heeft niets met latentie te maken. Inworld heeft een verbatim-modus toegevoegd zodat ordernummers, bevestigingscodes, adressen en serienummers teken voor teken worden teruggelezen in plaats van te worden genormaliseerd naar iets dat natuurlijk klinkt maar onjuist is. Voor een spraakagent die net een boeking heeft aangenomen, is die ene tag het verschil tussen een werkend product en een demo die naar een mens wordt geëscaleerd.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Dimensie voor dimensie

• Soort — GPT-Live-1: full-duplex spraak-naar-spraak in één model versus Inworld Realtime TTS-2: een tekst-naar-spraakmodel, met duplex apart beschikbaar via Inworlds Realtime API

• Prijs per eenheid — GPT-Live-1: $0,05 per spraakminuut, per seconde gefactureerd, reasoning-backend apart gemeten vs Inworld Realtime TTS-2: $25 per miljoen tekens on demand, $20 op het Creator-plan en $12,50 op het hoogste tier, met Flash op $15, $10 en $7

• Onafhankelijke kwaliteit — GPT-Live-1: 70,3% op de Speech to Speech Index, gedeeld zesde van veertien vs Inworld Realtime TTS-2: Elo 1.244 uit 1.091 samples en tweede op de Artificial Analysis Provider Voice arena, met Flash op Elo 1.211 uit 1.626 samples en zesde

• Onderbreking — GPT-Live-1: native, vele malen per seconde binnen het model bepaald vs Inworld Realtime TTS-2: geen eigenschap van het TTS-model; Inworld's Realtime API ondersteunt barge-in met ongeveer 100 milliseconden onderbrekingslatentie, via één enkele socket die het OpenAI Realtime-protocol spreekt

• Latentie — GPT-Live-1: 0,798 seconden latentie bij beurtwisseling in OpenAI's eigen tests, geen time-to-first-audio gepubliceerd vs Inworld Realtime TTS-2: 100 milliseconden aan serverzijde op het 90e percentiel, Flash op 20, met een mediane tijd van minder dan één seconde tot de eerste audiochunk over de volledige Realtime API-pijplijn

• Talen — GPT-Live-1: grote talen worden goed ondersteund, daarbuiten wisselend, tegenover Inworld Realtime TTS-2: meer dan 200 locales, waarvan 15 op Tier 1-kwaliteit en nog eens 79 op Tier 2, en één stemidentiteit die in alle locales behouden blijft

• Stemmen en cloning — GPT-Live-1: twaalf presets, geen cloning vs Inworld Realtime TTS-2: 282 ingebouwde stemmen, directe zero-shot-cloning op basis van 5 tot 15 seconden geautoriseerde audio, professionele cloning en volledige sturing van de voordracht, alleen op het vlaggenschipmodel

• Implementatie — GPT-Live-1: alleen gehost, één endpoint, geen gratis tier, gelijktijdigheid beperkt tot 25 tot 500 sessies vs. Inworld Realtime TTS-2: gehoste API plus een afgeschermde on-premises container die een H100 vereist, en een gratis on-demand tier die tot ongeveer 70 minuten synthese omvat

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Inworld Realtime TTS-2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Languages: major languages only'. The right column, labelled Inworld Realtime TTS-2, reads 'Kind: text-to-speech; duplex via the separate Realtime API', 'Price: $25 per 1M characters, from $12.50 on volume', 'Time to first byte: 100 ms p90, 20 ms for Flash (vendor)', 'Barge-in: ~100 ms, cascade-level', 'Independent score: Elo 1,244, #2 on the AA Provider Voice arena', 'Languages: 200+ locales, 15 at Tier 1 quality'. The footer reads 'Inworld latency and pricing vendor-published; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

De duplexvraag, precies beantwoord

Het zou gemakkelijk zijn deze vergelijking te schrijven als "de een luistert, de ander spreekt alleen", en het zou op een manier fout zijn die ertoe doet. De tekst-naar-spraakmodellen van Inworld zijn tekst-in, audio-uit. Maar Inworld verkoopt ook een Realtime API die via één enkele WebSocket-, WebRTC- of SIP-verbinding loopt en full-duplex is in de zin die voor een bouwer belangrijk is: het biedt semantische spraakactiviteitsdetectie met een instelbare eagerness-instelling, ondersteunt handmatige beurtregeling en onderbreekt bij barge-in in ongeveer 100 milliseconden. Het is protocolcompatibel met de Open​AI Realtime-interface, waardoor migratie een configuratiekwestie is in plaats van een herschrijving.

Wat Inworlds Realtime API niet is, is een native spraak-naar-spraakmodel. Het is een cascade — een verwisselbaar spraakherkenningsmodel, een taalmodel naar keuze en een synthesizer — georkestreerd binnen één verbinding. Dat is een legitieme architectuurkeuze, en het is dezelfde die de meeste productie-stemagenten maken. Het is simpelweg een andere dan GPT-Live-1, waar één model beslist wanneer het de beurt afstaat.

Het praktische verschil komt naar voren wanneer de beller midden in een zinsdeel onderbreekt. In een cascade wordt de onderbreking gedetecteerd, wordt de generatie geannuleerd en begint er een nieuwe beurt — een reeks die goed werkt en je een round trip kost. In het end-to-endmodel werd de beslissing al continu genomen. Het eerste is een systeem dat snel reageert. Het laatste is een systeem dat nooit is gestopt met luisteren.

A screenshot of Inworld AI's official pricing page, showing per-million-character rates for its speech models. The On-Demand column lists TTS-2 at $25 per 1M characters, TTS-2 Flash at $15, STT-1 at $0.15 per hour and LLMs at cost, alongside the inclusions 'Up to 70 min TTS included', '100 custom voices', 'Voice cloning & voice design', 'Realtime API access', '220+ LLM models via Router' and 'Commercial license'. The Creator column at $25 per month shows TTS-2 reduced to $20 and Flash to $10, with 500 custom voices and up to 33% off TTS and STT rates.

Even de cijfers doornemen, want de eenheden verbergen het antwoord.

Spraak gaat met ongeveer 150 woorden per minuut, en het Engels telt gemiddeld ongeveer vijf en een half tekens per woord, dus een minuut gesproken output is ongeveer 800 tot 900 tekens. Bij $25 per miljoen produceert Inworld Realtime TTS-2 een minuut spraak voor ongeveer twee cent. Bij de $15 van Flash is dat minder dan anderhalve cent.

Vergeleken met de $0,05 per stemminuut van GPT-Live-1 lijkt dat een afslachting — totdat je de rest van wat GPT-Live-1 doet erbij prijst. Inworld's Realtime API heeft nog steeds spraakherkenning en een taalmodel nodig, die beide apart worden gefactureerd en beide hun eigen latentie hebben. Tel je die erbij op, dan klimmen de kosten per minuut van de cascade boven een stuiver uit voor elk gesprek dat een echte vraag bevat. De meerprijs van het end-to-endmodel zit niet in de stem. Die zit in de beurtwisseling, en die is ongeveer gelijk aan de kosten van de spraakherkenningsfase die je niet meer koopt.

Waar de cascade beslissend wint, is bij volume zonder gesprek. Meldingsoproepen, bezorgbevestigingen, afspraakherinneringen, gescripte IVR — alles waarbij de tekst bekend is voordat het gesprek begint en niemand gaat onderbreken. Daar is prijsstelling per teken van $7 tot $15 per miljoen simpelweg goedkoper dan duplex per minuut, en betalen voor beurtwisseling die je nooit gebruikt is verspilling.

Er is ook een middenweg die de tweemodel-benadering verbergt. Als je toch een cascade samenstelt, hoeft de spraaklaag niet van een gespecialiseerde stemleverancier te komen: Open​AI's eigen TTS-modellen en Goog​le's Gem​ini TTS-previewmodellen zijn gewone API-endpoints, en ze zijn gerouteerd. Ongeveer 190 modellen van elf upstream-providers bevinden zich achter één OrcaRouter-sleutel tegen de lijstprijs van de provider, zonder markup — dus een synthesemodel kan in dezelfde catalogus, op dezelfde sleutel en dezelfde factuur staan als het redeneermodel dat het voedt, met automatische failover als een endpoint tijdens de uitrol verslechtert. Het is de minst glamoureuze fase van een spraakstack en de gemakkelijkste om te consolideren. Noch Inworlds Realtime TTS-2, noch het Live Sessions-endpoint van GPT-Live-1 is op die manier beschikbaar; die twee behoren toe aan hun leveranciers.

Welke moet je kiezen?

Kies Inworld Realtime TTS-2 als volume het belangrijkste is en het gesprek gescript is. Agents met een hoge doorvoer, notificaties, meertalige producten waarbij 200 locales en één behouden stemidentiteit belangrijk zijn, of elke implementatie die de on-premises container nodig heeft. Je krijgt een top-twee arena-stem voor ongeveer de helft van de prijs van de koploper, een gratis tier om op te prototypen, cloning die GPT-Live-1 helemaal niet biedt, en een Realtime API die onderbrekingen bekwaam afhandelt in het cascade-patroon dat je waarschijnlijk al draait.

Kies GPT-Live-1 als de onderbreking het product is. Gesprekken die van het script afwijken, bellers die door de agent heen praten, workflows waarin beurtwisseling het verschil is tussen een gesprek en een menu. Je betaalt een tarief per minuut dat niet daalt wanneer spraak goedkoop wordt, je geeft cloning en 200 talen op, en je koopt de naden terug.

De prijzenoorlog in spraaksynthese is echt, en dat is goed nieuws voor iedereen die een spraakagent bouwt — een top-vijfstem kost nu een vijfde van wat die achttien maanden geleden kostte. Maar dat beslecht deze vergelijking niet, omdat hetgeen waarvoor GPT-Live-1 rekent niet hetzelfde is als hetgeen waarop Inworld korting geeft.