Hjältetitelkort för 'GPT-Live-1 vs Inworld Realtime TTS-2', med undertiteln 'Syntes blir allt billigare; att höra är fortfarande dyrt', med tre kort som lyder 'Inworld Realtime TTS-2: $25 per 1M tecken, med trappstegspris ner till $12.50', 'Inworld Realtime TTS-2 Flash: $15 per 1M tecken, med trappstegspris ner till $7', 'GPT-Live-1: $0.05 per röstminut, plus resonemanget bakom det', ovanför en sidfotsremsa som lyder 'Inworld-priser publicerade av leverantören, september 2026; GPT-Live-1-priser enligt OpenAI-dokumentation.' OrcaRouter-logotypen är kompositerad i det nedre högra hörnet.
Guides & Insights

GPT-Live-1 vs Inworld Realtime TTS-2: Ett priskrig om röster, ett premium på lyssnande

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Inworld Realtime TTS-2 nådde allmän tillgänglighet med något som röstmarknaden hade saknat: en publicerad prislista. Flaggskeppsmodellen kostar 25 USD per miljon tecken on demand, dess snabbare syskon Inworld Realtime TTS-2 Flash kostar 15 USD, och båda trappas ned genom volymbaserade nivåer till 12,50 USD respektive 7 USD. Med en placering på Elo 1 244 och en andraplats på talarenan hos Artificial Analysis gör det flaggskeppet till ungefär halva priset mot den nuvarande arenans ledare och ett av de billigaste sätten att köpa en röst bland de fem bästa. GPT-Live-1 är den andra modellen i den här jämförelsen och erbjuder det motsatta – 0,05 USD per minut röst, inga tecken inblandade, och inget sätt att köpa den utan att också köpa lyssnandet, turtagningen och avbrottshanteringen som följer med.

Det intressanta med att jämföra dem är att prisgapet verkar enormt och sedan till största delen dunstar bort. Syntes är i ett priskrig. Konversation är det inte.

Vad Inworld faktiskt släppte

TTS-2-serien började som en forskningsförhandsvisning i maj 2026 med ett specifikt påstående: att detta är en modell som inte genererar tal isolerat. Den tar de tidigare turerna i ett samtal som ljudinmatning, resonerar kring ton och tempo och anpassar hur den svarar. Den positioneringen – samtalsmedvetenhet snarare än renare ljud – var det som skilde den från de berättarmotorer som dominerade text-till-tal under 2025.

Allmän tillgänglighet gjorde förhandsversionen till en familj och knöt en prislista till den. Flash är alternativet för genomströmning, där Inworld anger cirka 20 millisekunder i serversidig tid till första byte vid 90:e percentilen, jämfört med 100 millisekunder för flaggskeppet och en median på under 200 millisekunder till första ljudet. Det är leverantörssiffror från Inworlds egen dokumentation; den enda tredjepartsmätning som finns i omlopp, från Coval, uppskattar Flash till cirka 25 millisekunder och flaggskeppet till låga hundratal. Ingen av dem har genomgått en oberoende granskning från början till slut.

Funktionen som är mest värd att notera har inget med latens att göra. Inworld lade till ett ordagrant läge så att ordernummer, bekräftelsekoder, adresser och serienummer läses tillbaka tecken för tecken i stället för att normaliseras till något som låter naturligt men är fel. För en röstagent som just har tagit en bokning är den där enda taggen skillnaden mellan en fungerande produkt och en demo som eskaleras till en människa.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Dimension för dimension

• Typ — GPT-Live-1: full duplex tal-till-tal i en enda modell jämfört med Inworld Realtime TTS-2: en text-till-tal-modell, där duplex finns separat via Inworld's Realtime API

• Prisenhet — GPT-Live-1: 0,05 USD per röstminut, faktureras per sekund, reasoning-backend mäts separat mot Inworld Realtime TTS-2: 25 USD per miljon tecken vid behov, 20 USD på Creator-planen och 12,50 USD på högsta nivån, med Flash på 15, 10 och 7 USD

• Oberoende kvalitet — GPT-Live-1: 70,3 % på Speech to Speech Index, delad sjätteplats av fjorton mot Inworld Realtime TTS-2: Elo 1 244 från 1 091 prover och tvåa på Artificial Analysis Provider Voice arena, med Flash på Elo 1 211 från 1 626 prover och på sjätte plats

• Avbrott — GPT-Live-1: inbyggt, beslutas inuti modellen många gånger per sekund jämfört med Inworld Realtime TTS-2: inte en egenskap hos TTS-modellen; Inworlds Realtime API stöder barge-in med ungefär 100 millisekunders avbrottsfördröjning, över en enda socket som talar Open​AI Realtime-protokollet

• Latens — GPT-Live-1: 0,798 sekunders turtagningslatens i Open​AI:s egen testning, ingen publicerad tid till första ljud mot Inworld Realtime TTS-2: 100 millisekunder på serversidan vid 90:e percentilen, Flash vid 20, med en median på under en sekund till den första ljudchunken genom hela Realtime API-pipelinen

• Språk — GPT-Live-1: större språk välbetjänade, ojämnt utanför dem vs Inworld Realtime TTS-2: över 200 språkvarianter, med 15 i Tier 1-kvalitet och ytterligare 79 i Tier 2, samt en röstidentitet bevarad över alla dem

• Röster och kloning — GPT-Live-1: tolv förinställningar, ingen kloning vs Inworld Realtime TTS-2: 282 inbyggda röster, omedelbar zero-shot-kloning från 5 till 15 sekunder auktoriserat ljud, professionell kloning och full leveransstyrning endast på flaggskeppet

• Driftsättning — GPT-Live-1: endast hostad, en slutpunkt, ingen gratisnivå, samtidighet begränsad till 25 till 500 sessioner vs Inworld Realtime TTS-2: hostat API plus en åtkomstbegränsad lokal container som kräver ett H100, och en gratis on-demand-nivå som inkluderar upp till cirka 70 minuters syntes

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Inworld Realtime TTS-2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Languages: major languages only'. The right column, labelled Inworld Realtime TTS-2, reads 'Kind: text-to-speech; duplex via the separate Realtime API', 'Price: $25 per 1M characters, from $12.50 on volume', 'Time to first byte: 100 ms p90, 20 ms for Flash (vendor)', 'Barge-in: ~100 ms, cascade-level', 'Independent score: Elo 1,244, #2 on the AA Provider Voice arena', 'Languages: 200+ locales, 15 at Tier 1 quality'. The footer reads 'Inworld latency and pricing vendor-published; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Duplexfrågan, besvarad med precision

Det skulle vara lätt att skriva den här jämförelsen som "den ena lyssnar, den andra talar bara", och det skulle vara fel på ett sätt som spelar roll. Inworlds text-till-tal-modeller är text in, ljud ut. Men Inworld säljer också ett Realtime API som körs över en enda WebSocket-, WebRTC- eller SIP-anslutning och är full duplex på det sätt en utvecklare bryr sig om: det har semantisk röstaktivitetsdetektering med en justerbar eagerness-inställning, stöder manuell turkontroll och avbryter vid barge-in på ungefär 100 millisekunder. Det är protokollkompatibelt med OpenAI Realtime-gränssnittet, vilket gör migrering till en konfigurationsövning snarare än en omskrivning.

Det som Inworlds Realtime API inte är, är en inbyggd tal-till-tal-modell. Det är en kaskad – en utbytbar taligenkänningsmodell, en språkmodell som du själv väljer och en syntetiserare – orkestrerad inom en och samma anslutning. Det är ett legitimt arkitekturval, och det är samma val som de flesta röstagenter i produktion gör. Det är helt enkelt ett annat val än GPT-Live-1, där en enda modell avgör när turen ska lämnas över.

Den praktiska skillnaden visar sig när den som ringer avbryter mitt i en sats. I en kaskad upptäcks avbrottet, genereringen avbryts och en ny tur börjar – en sekvens som fungerar bra och kostar dig en tur och retur. I end-to-end-modellen fattades beslutet redan kontinuerligt. Det förra är ett system som svarar snabbt. Det senare är ett system som aldrig slutade lyssna.

A screenshot of Inworld AI's official pricing page, showing per-million-character rates for its speech models. The On-Demand column lists TTS-2 at $25 per 1M characters, TTS-2 Flash at $15, STT-1 at $0.15 per hour and LLMs at cost, alongside the inclusions 'Up to 70 min TTS included', '100 custom voices', 'Voice cloning & voice design', 'Realtime API access', '220+ LLM models via Router' and 'Commercial license'. The Creator column at $25 per month shows TTS-2 reduced to $20 and Flash to $10, with 500 custom voices and up to 33% off TTS and STT rates.

Räkna på siffrorna, eftersom enheterna döljer svaret.

Tal går i ungefär 150 ord per minut, och engelska har i genomsnitt omkring fem och ett halvt tecken per ord, så en minuts talad utdata är ungefär 800 till 900 tecken. Till $25 per miljon producerar Inworld Realtime TTS-2 en minuts tal för ungefär två cent. Med Flash-priset $15 ligger det under en och en halv cent.

Jämfört med GPT-Live-1:s $0,05 per röstminut ser det ut som en kross — tills man räknar in resten av vad GPT-Live-1 gör. Inworlds Realtime API behöver fortfarande taligenkänning och en språkmodell, båda faktureras separat och båda medför sin egen latens. Lägger man in dem stiger kaskadens kostnad per minut förbi en femcentare för varje samtal som innehåller en riktig fråga. Premien för end-to-end-modellen är inte för rösten. Den är för turtagningen, och den motsvarar ungefär kostnaden för taligenkänningssteget som du inte längre betalar för.

Det är på volym utan konversation som kaskaden vinner stort. Aviseringssamtal, leveransbekräftelser, påminnelser om bokade tider, skriptad IVR – allt där texten är känd innan samtalet börjar och ingen kommer att avbryta. Där är teckenprissättning på 7–15 dollar per miljon tecken helt enkelt billigare än duplex per minut, och att betala för turtagning som man aldrig använder är slöseri.

Det finns också en mellanväg som tvåmodellsramverket döljer. Om du ändå sätter ihop en kaskad behöver tallagret inte komma från en dedikerad röstleverantör: OpenAIs egna TTS-modeller och Googles Gemini TTS-förhandsvisningsmodeller är vanliga API-slutpunkter, och de är routade. Runt 190 modeller från elva uppströmsleverantörer ligger bakom en enda OrcaRouter-nyckel till leverantörens listpris utan påslag — så en syntesmodell kan finnas i samma katalog, på samma nyckel och samma faktura, som den resonemangsmodell den försörjer, med automatisk redundansväxling om en slutpunkt försämras mitt under driftsättningen. Det är det minst glamorösa steget i en röststack och det enklaste att konsolidera. Varken Inworlds Realtime TTS-2 eller GPT-Live-1:s Live Sessions-slutpunkt är tillgänglig på det sättet; de två tillhör sina leverantörer.

Vilken ska man välja?

Välj Inworld Realtime TTS-2 om volymen är poängen och samtalet är manusstyrt. Agenter med hög genomströmning, aviseringar, flerspråkiga produkter där 200 språkversioner och en bevarad röstidentitet spelar roll, eller alla distributioner som behöver den lokala containern. Du får en röst i topp två i arenan till ungefär halva ledarens pris, en gratisnivå att prototypa på, kloning som GPT-Live-1 inte erbjuder alls, och ett Realtime API som hanterar avbrott kompetent i det kaskadmönster du förmodligen redan kör.

Välj GPT-Live-1 om avbrottet är produkten. Samtal som går utanför manus, uppringare som pratar över agenten, arbetsflöden där turtagningen är skillnaden mellan ett samtal och en meny. Du betalar en minutavgift som inte sjunker när tal blir billigt, du avstår från kloning och 200 språk, och du köper tillbaka sömmarna.

Priskriget inom talsyntes är verkligt och det är goda nyheter för alla som bygger en röstagent — en av de fem bästa rösterna kostar nu en femtedel av vad den gjorde för arton månader sedan. Det avgör helt enkelt inte den här jämförelsen, eftersom det som GPT-Live-1 tar betalt för inte är detsamma som Inworld rabatterar.