
GPT-Live-1 vs Inworld Realtime TTS-2: Ett priskrig om röster, ett premium på lyssnande
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Inworld Realtime TTS-2 nådde allmän tillgänglighet med något som röstmarknaden hade saknat: en publicerad prislista. Flaggskeppsmodellen kostar 25 USD per miljon tecken on demand, dess snabbare syskon Inworld Realtime TTS-2 Flash kostar 15 USD, och båda trappas ned genom volymbaserade nivåer till 12,50 USD respektive 7 USD. Med en placering på Elo 1 244 och en andraplats på talarenan hos Artificial Analysis gör det flaggskeppet till ungefär halva priset mot den nuvarande arenans ledare och ett av de billigaste sätten att köpa en röst bland de fem bästa. GPT-Live-1 är den andra modellen i den här jämförelsen och erbjuder det motsatta – 0,05 USD per minut röst, inga tecken inblandade, och inget sätt att köpa den utan att också köpa lyssnandet, turtagningen och avbrottshanteringen som följer med.
Det intressanta med att jämföra dem är att prisgapet verkar enormt och sedan till största delen dunstar bort. Syntes är i ett priskrig. Konversation är det inte.
Vad Inworld faktiskt släppte
TTS-2-serien började som en forskningsförhandsvisning i maj 2026 med ett specifikt påstående: att detta är en modell som inte genererar tal isolerat. Den tar de tidigare turerna i ett samtal som ljudinmatning, resonerar kring ton och tempo och anpassar hur den svarar. Den positioneringen – samtalsmedvetenhet snarare än renare ljud – var det som skilde den från de berättarmotorer som dominerade text-till-tal under 2025.
Allmän tillgänglighet gjorde förhandsversionen till en familj och knöt en prislista till den. Flash är alternativet för genomströmning, där Inworld anger cirka 20 millisekunder i serversidig tid till första byte vid 90:e percentilen, jämfört med 100 millisekunder för flaggskeppet och en median på under 200 millisekunder till första ljudet. Det är leverantörssiffror från Inworlds egen dokumentation; den enda tredjepartsmätning som finns i omlopp, från Coval, uppskattar Flash till cirka 25 millisekunder och flaggskeppet till låga hundratal. Ingen av dem har genomgått en oberoende granskning från början till slut.
Funktionen som är mest värd att notera har inget med latens att göra. Inworld lade till ett ordagrant läge så att ordernummer, bekräftelsekoder, adresser och serienummer läses tillbaka tecken för tecken i stället för att normaliseras till något som låter naturligt men är fel. För en röstagent som just har tagit en bokning är den där enda taggen skillnaden mellan en fungerande produkt och en demo som eskaleras till en människa.

Dimension för dimension
• Typ — GPT-Live-1: full duplex tal-till-tal i en enda modell jämfört med Inworld Realtime TTS-2: en text-till-tal-modell, där duplex finns separat via Inworld's Realtime API
• Prisenhet — GPT-Live-1: 0,05 USD per röstminut, faktureras per sekund, reasoning-backend mäts separat mot Inworld Realtime TTS-2: 25 USD per miljon tecken vid behov, 20 USD på Creator-planen och 12,50 USD på högsta nivån, med Flash på 15, 10 och 7 USD
• Oberoende kvalitet — GPT-Live-1: 70,3 % på Speech to Speech Index, delad sjätteplats av fjorton mot Inworld Realtime TTS-2: Elo 1 244 från 1 091 prover och tvåa på Artificial Analysis Provider Voice arena, med Flash på Elo 1 211 från 1 626 prover och på sjätte plats
• Avbrott — GPT-Live-1: inbyggt, beslutas inuti modellen många gånger per sekund jämfört med Inworld Realtime TTS-2: inte en egenskap hos TTS-modellen; Inworlds Realtime API stöder barge-in med ungefär 100 millisekunders avbrottsfördröjning, över en enda socket som talar OpenAI Realtime-protokollet
• Latens — GPT-Live-1: 0,798 sekunders turtagningslatens i OpenAI:s egen testning, ingen publicerad tid till första ljud mot Inworld Realtime TTS-2: 100 millisekunder på serversidan vid 90:e percentilen, Flash vid 20, med en median på under en sekund till den första ljudchunken genom hela Realtime API-pipelinen
• Språk — GPT-Live-1: större språk välbetjänade, ojämnt utanför dem vs Inworld Realtime TTS-2: över 200 språkvarianter, med 15 i Tier 1-kvalitet och ytterligare 79 i Tier 2, samt en röstidentitet bevarad över alla dem
• Röster och kloning — GPT-Live-1: tolv förinställningar, ingen kloning vs Inworld Realtime TTS-2: 282 inbyggda röster, omedelbar zero-shot-kloning från 5 till 15 sekunder auktoriserat ljud, professionell kloning och full leveransstyrning endast på flaggskeppet
• Driftsättning — GPT-Live-1: endast hostad, en slutpunkt, ingen gratisnivå, samtidighet begränsad till 25 till 500 sessioner vs Inworld Realtime TTS-2: hostat API plus en åtkomstbegränsad lokal container som kräver ett H100, och en gratis on-demand-nivå som inkluderar upp till cirka 70 minuters syntes

Duplexfrågan, besvarad med precision
Det skulle vara lätt att skriva den här jämförelsen som "den ena lyssnar, den andra talar bara", och det skulle vara fel på ett sätt som spelar roll. Inworlds text-till-tal-modeller är text in, ljud ut. Men Inworld säljer också ett Realtime API som körs över en enda WebSocket-, WebRTC- eller SIP-anslutning och är full duplex på det sätt en utvecklare bryr sig om: det har semantisk röstaktivitetsdetektering med en justerbar eagerness-inställning, stöder manuell turkontroll och avbryter vid barge-in på ungefär 100 millisekunder. Det är protokollkompatibelt med OpenAI Realtime-gränssnittet, vilket gör migrering till en konfigurationsövning snarare än en omskrivning.
Det som Inworlds Realtime API inte är, är en inbyggd tal-till-tal-modell. Det är en kaskad – en utbytbar taligenkänningsmodell, en språkmodell som du själv väljer och en syntetiserare – orkestrerad inom en och samma anslutning. Det är ett legitimt arkitekturval, och det är samma val som de flesta röstagenter i produktion gör. Det är helt enkelt ett annat val än GPT-Live-1, där en enda modell avgör när turen ska lämnas över.
Den praktiska skillnaden visar sig när den som ringer avbryter mitt i en sats. I en kaskad upptäcks avbrottet, genereringen avbryts och en ny tur börjar – en sekvens som fungerar bra och kostar dig en tur och retur. I end-to-end-modellen fattades beslutet redan kontinuerligt. Det förra är ett system som svarar snabbt. Det senare är ett system som aldrig slutade lyssna.

Räkna på siffrorna, eftersom enheterna döljer svaret.
Tal går i ungefär 150 ord per minut, och engelska har i genomsnitt omkring fem och ett halvt tecken per ord, så en minuts talad utdata är ungefär 800 till 900 tecken. Till $25 per miljon producerar Inworld Realtime TTS-2 en minuts tal för ungefär två cent. Med Flash-priset $15 ligger det under en och en halv cent.
Jämfört med GPT-Live-1:s $0,05 per röstminut ser det ut som en kross — tills man räknar in resten av vad GPT-Live-1 gör. Inworlds Realtime API behöver fortfarande taligenkänning och en språkmodell, båda faktureras separat och båda medför sin egen latens. Lägger man in dem stiger kaskadens kostnad per minut förbi en femcentare för varje samtal som innehåller en riktig fråga. Premien för end-to-end-modellen är inte för rösten. Den är för turtagningen, och den motsvarar ungefär kostnaden för taligenkänningssteget som du inte längre betalar för.
Det är på volym utan konversation som kaskaden vinner stort. Aviseringssamtal, leveransbekräftelser, påminnelser om bokade tider, skriptad IVR – allt där texten är känd innan samtalet börjar och ingen kommer att avbryta. Där är teckenprissättning på 7–15 dollar per miljon tecken helt enkelt billigare än duplex per minut, och att betala för turtagning som man aldrig använder är slöseri.
Det finns också en mellanväg som tvåmodellsramverket döljer. Om du ändå sätter ihop en kaskad behöver tallagret inte komma från en dedikerad röstleverantör: OpenAIs egna TTS-modeller och Googles Gemini TTS-förhandsvisningsmodeller är vanliga API-slutpunkter, och de är routade. Runt 190 modeller från elva uppströmsleverantörer ligger bakom en enda OrcaRouter-nyckel till leverantörens listpris utan påslag — så en syntesmodell kan finnas i samma katalog, på samma nyckel och samma faktura, som den resonemangsmodell den försörjer, med automatisk redundansväxling om en slutpunkt försämras mitt under driftsättningen. Det är det minst glamorösa steget i en röststack och det enklaste att konsolidera. Varken Inworlds Realtime TTS-2 eller GPT-Live-1:s Live Sessions-slutpunkt är tillgänglig på det sättet; de två tillhör sina leverantörer.
Vilken ska man välja?
Välj Inworld Realtime TTS-2 om volymen är poängen och samtalet är manusstyrt. Agenter med hög genomströmning, aviseringar, flerspråkiga produkter där 200 språkversioner och en bevarad röstidentitet spelar roll, eller alla distributioner som behöver den lokala containern. Du får en röst i topp två i arenan till ungefär halva ledarens pris, en gratisnivå att prototypa på, kloning som GPT-Live-1 inte erbjuder alls, och ett Realtime API som hanterar avbrott kompetent i det kaskadmönster du förmodligen redan kör.
Välj GPT-Live-1 om avbrottet är produkten. Samtal som går utanför manus, uppringare som pratar över agenten, arbetsflöden där turtagningen är skillnaden mellan ett samtal och en meny. Du betalar en minutavgift som inte sjunker när tal blir billigt, du avstår från kloning och 200 språk, och du köper tillbaka sömmarna.
Priskriget inom talsyntes är verkligt och det är goda nyheter för alla som bygger en röstagent — en av de fem bästa rösterna kostar nu en femtedel av vad den gjorde för arton månader sedan. Det avgör helt enkelt inte den här jämförelsen, eftersom det som GPT-Live-1 tar betalt för inte är detsamma som Inworld rabatterar.
