
GPT-Live-1 når API:et: full-duplexröst för 0,05 dollar i minuten – utan någon drop-in-väg från GPT-Realtime-2.1
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
GPT-Live-1 finns i API:et från och med den 10 september, och siffran som faktiskt kommer att forma om budgetar är inte ett benchmark — det är faktureringsenheten. OpenAIOpenAI:s röstmodell med full duplex debiteras nu med en fast avgift på 0,05 USD per minut röst, debiterad per sekund, medan modellen som den jämförs med, GPT-Realtime-2.1, mättes i ljudtoken till 32 USD per miljon in och 64 USD per miljon ut. Själva modellen är inte ny: GPT-Live-1 släpptes i ChatGPT den 8 juli 2026 som ersättning för Advanced Voice Mode. Det nya är att utvecklare äntligen kan anropa den — och att anropa den nästan inte alls liknar den Realtime-integration som de flesta team redan har. OpenAIOpenAI:s egen dokumentation parar ihop röstlagret med en separat resonemangsbackend, och i det publicerade WebRTC-exemplet är den backenden GPT-5.6 Terra.
Vad släpptes den 10 september, och vad släpptes inte?
API-ytan är medvetet smal. Det finns exakt ett modell-ID, gpt-live-1, som också är sin egen standardögonblicksbild — inga daterade varianter att pinna. Det finns exakt en endpoint, Live Sessions-endpointen på v1/live/sessions. Allt annat på OpenAIOpenAI:s plattform är avstängt för den här modellen: ingen Chat Completions, inga Responses, ingen Realtime (inklusive varianterna för översättning och transkribering), inga Assistants, ingen Batch, ingen finjustering, inga embeddings, ingen bild- eller videogenerering, inga endpoints för talsyntes eller transkribering, ingen moderering.
Indata och utdata är ljud och text. Streaming och funktionsanrop stöds; strukturerade utdata, finjustering och förutsagda utdata stöds inte. Bild- och videoindata stöds uttryckligen inte – så den "röst med video"-yta som OpenAIOpenAI har hintat om är inte en del av den här versionen. Gratisnivån kan inte anropa den alls, och hastighetsbegränsningar mäts i samtidiga sessioner i stället för förfrågningar per minut: 25 på nivå 1, som stiger till 50, 200, 300 och 500 för nivåerna 2 till 5.

Den där samtidighetsinramningen är den första ledtråden till att detta inte är en plug-in-ersättning. Hastighetsbegränsningar uttryckta i samtidiga live-samtal säger dig vad OpenAIOpenAI förväntar sig att skalenheten ska vara: en telefonlinje, inte en förfrågan.
Prisändringen är den tystare, större nyheten.
Schablonmässig fakturering per minut är ett genuint avsteg. Med tokenmätning måste du modellera ljudförbrukningen – hur många tokens en sekund tystnad kostar, hur en uppringare som fortsätter prata över agenten förändrar utdatans längd – innan du kunde prognostisera ett enda samtal. Vid 0,05 USD per minut kollapsar aritmetiken till multiplikation:
• Ett 5-minuterssamtal med supporten — 0,25 USD i rösttid
• Ett 10-minuterssamtal — $0.50
• Ett genomsnitt på 4 minuter för 1 000 samtal per dag — 200 dollar per dag, ungefär 6 000 dollar i månaden
• En timme med kontinuerlig öppen linje — 3,00 $
Tre detaljer skärper bilden. För det första avrundas varaktigheten inte uppåt till nästa hela minut, så ett samtal på 40 sekunder kostar cirka 3,3 cent i stället för ett helt nickel. För det andra faktureras 15 sekunders röstvaraktighet i förskott vid sessionsinitiering – men det krediteras mot senare varaktighetsavgifter, inte adderas ovanpå, så ett samtal kortare än 15 sekunder hamnar ändå på priset för 15 sekunder. För det tredje är rösten bara halva notan. Resonemangsmodellen i backend, dess verktygsanrop och eventuella webbsökningar faktureras separat enligt den modellens normala taxor, vilket innebär att en "billig röstmodell" ändå kan leda till ett dyrt samtal om du riktar delegeringen mot en resonemangsmotor i framkant och låter den söka vid varje tur.
Den där två meter stora strukturen är där routning slutar vara en finess. På OrcaRouter är backend-halvan av en GPT-Live-1-session bara ännu ett modellanrop – ungefär 190 modeller från elva uppströmsleverantörer bakom en enda nyckel, till leverantörens listpris, vidarebefordrat utan påslag, och automatisk failover om din valda backend ger fel eller får timeout. Du kan inte routa själva röstlagret; Live Sessions-slutpunkten är enbart OpenAIOpenAI:s. Du kan absolut routa allt som röstlagret delegerar till, vilket är den halva som skalar med hur mycket dina uppringare tänker.
Endast WebRTC — varför din Realtime-kod inte går att porta
Det här är den praktiska kostnaden för migreringen, och de flesta artiklar om lanseringen hoppar över den. GPT-Live-1-sessioner körs över WebRTC, inte den WebSocket-transport som många befintliga Realtime-integrationer bygger på. Att prova den äldre vägen med ett GPT-Live-modell-ID returnerar ett fel som i klartext säger att sessioner kräver WebRTC.
Handskakningen, enligt OpenAIOpenAI:s WebRTC-guide: din webbläsare öppnar en RTCPeerConnection, kopplar på mikrofonspår, öppnar en datakanal och registrerar lyssnare innan den skickar offer, anger den lokala beskrivningen, väntar på ICE-insamling och skickar offer till din egen server. Din server anropar sedan POST /v1/live/sessions med sessionskonfigurationen plus transport: { type: "webrtc", sdp: ... }. Ett lyckat svar returnerar HTTP 201 med session.id och transport.sdp, som webbläsaren tillämpar som fjärrbeskrivning. Media färdas över de förhandlade spåren; datakanalen – etiketten oai-events – bär transkriptioner, sessionsuppdateringar och delegerat arbete. För att lägga på skickar du session.close och fortsätter läsa tills session.closed anländer.
Två fallgropar värda att tejpa fast på skärmen. Själva HTTP-anropet startar sessionen, så du får inte också skicka session.start på datakanalen. Och du bör inte lägga till indataljud eller vänta på utdataljudsdeltan över den kanalen – lämna audio.format utanför konfigurationen och låt SDP hantera det. Serverexemplen begränsar förfrågningskroppen till 64 KB, har timeout för ICE-insamling efter 10 sekunder och slutförande av session efter 15.
Inget av det är svårt. Allt är ny kod. Om din produkt är en turordningsbaserad realtidsagent är migreringen till GPT-Live-1 en omskrivning av transporten plus en omskrivning av delegeringen, inte ett byte av modell-ID – värt att budgetera som en sprint snarare än en eftermiddag.
Benchmarkarna, och vem som körde varenda en av dem
Varje siffra nedan är OpenAIOpenAI:s egen, publicerad i samband med API-släppet och inte oberoende reproducerad av någon när detta skrevs. Det förbehållet är viktigare än vanligt här, eftersom skillnaderna är tillräckligt stora för att de inbjuder till att citeras som vedertagna fakta.

• Full-duplex-interaktivitet — GPT-Live-1 80,1 % mot 45,4 % för GPT-Realtime-2.1
• Turtagningslatens — 0,8 s vs 1,4 s
• Noggrannhet vid verktygsanrop — 87 % mot 60 %
• Benchmark för röstsupport inom bank, godkännandegrad — 32 % mot 12,4 %
Läs den sista raden två gånger. En godkännandegrad på 32 % är en stor förbättring jämfört med 12,4 % och betyder fortfarande att systemet misslyckades med ungefär två tredjedelar av uppgifterna i den utvärderingen. Hoppen i interaktivitet och verktygsanrop är de som beskriver en genuint annan produkt; siffran för bank är den ärliga om hur långt röstagenter fortfarande är från att hantera ett reglerat arbetsflöde utan övervakning.
Kundbevisen är tunnare än benchmarktabellen och pekar åt samma håll. Yelp använder GPT-Live-1 för telefonbaserade bokningar, och CTO Alex Levy citeras om förbättrad samtalshantering. Språkinlärningsplattformen Speak rapporterade nästan 80 % färre avbrott än sitt tidigare turbaserade system – en självrapporterad siffra från ett företag med ett intresse i resultatet, och fortfarande den mest konkreta driftsättningssiffran som finns.
Röstlagret är en frontend; du väljer hjärnan.
Den arkitektoniska satsningen är delegering, och det är den del av den här utgåvan som ett routningslager passar naturligt in i. GPT-Live-1 utför inte det djupa tänkandet. När en anropare frågar något som kräver resonemang, hämtning eller ett verktyg, lämnar modellen över uppgiften över en asynkron gräns till en separat backend som fortsätter arbeta medan det talade samtalet pågår, och fogar sedan tillbaka svaret när det är klart.
Konfigurationen är explicit, och det är värt att läsa dokumentationsexemplet noga. Tillsammans med model: "gpt-live-1" och instruktionerna bär sessionen ett delegation-objekt av typen responses, vars inre responses-block namnger backendmodellen, dess egna instruktioner, dess verktyg – exemplet använder web_search – och en tool_choice. I OpenAIOpenAI:s publicerade WebRTC-exempel är den backendmodellen GPT-5.6 Terra.

Det är designens egentliga påstående: byt backend och röstupplevelsen blir smartare utan att träna om talmodellen. Det innebär också att delegationsbackenden är portabel på ett sätt som röstlagret inte är. OrcaRouter har inte gpt-live-1 – Live Sessions-slutpunkten är endast för OpenAI, och vi routar inget av det. Men delegationshalvan talar Responses-API:et, och den halvan är helt upp till dig att välja. GPT-5.6 Terra är live på OrcaRouter till OpenAIOpenAI:s listpris – $2.00 per miljon indatatoken och $12.00 per miljon utdatatoken, med Responses-slutpunkten exponerad – så den exakta modellen i OpenAIOpenAI:s eget exempel är ett anrop bort utan ett andra avtal eller SDK.
I praktiken gör det att valet av backend blir en konfigurationsfråga. Du kan A/B-testa en billig resonemangsmodell mot en frontier-modell på verklig samtalsstrafik genom att ändra en rad och följa kostnaden per samtal, eller lägga delegeringsmodellen bakom automatisk failover så att en dålig eftermiddag uppströms inte tar ner din telefonlinje med sig. Röstlagret som du betalar 0,05 USD per minut för ligger kvar där det är; allt det delegerar körs via en enda nyckel över cirka 190 modeller från elva uppströmsleverantörer, till leverantörernas listpris utan påslag.
Vad saknas fortfarande
• Ingen bild- eller videoinmatning – stillbilder och skärmdelning finns inte i den här versionen, så den multimodala röstytan som äldre ChatGPT-lägen fortfarande har förblir oåtgärdad
• Inga strukturerade utdata – om din agent behöver schemavaliderade verktygsargument måste den valideringen ligga i din backendmodell, inte i röstlagret
• Ingen åtkomst till gratisnivån och ingen finjustering — både kostnad och anpassning börjar på betalnivåerna
• Ingen oberoende utvärdering av någon huvudsiffra — varje siffra ovan är framtagen av leverantören
• Ett samtidighetstak på 25 samtidiga sessioner på Tier 1 – generöst för en pilot, snävt för ett callcenter redan dag ett
Vem ska flytta, och vem ska vänta
Agera nu om du bygger telefoni – bokningslinjer, tidsbokning, förstalinjesupport – och din nuvarande stack är den klassiska ASR-till-LLM-till-TTS-kaskaden. Latensen och avbrottshanteringen är precis vad den pipelinen förlorar, minutpriset är tillräckligt förutsägbart för att läggas in i ett kalkylark, och dokumentationen från OpenAIOpenAI innehåller nu ett serverexempel i Twilio-form att kopiera från. Agera nu också om du redan använder en Realtime-modell och din produkt är genuint konversationell snarare än turbaserad, eftersom avbrottshanteringen är den del där GPT-Realtime-2.1 var sämst.
Vänta om din integration är turbaserad och fungerar. Omskrivningen av transporten är ett riktigt arbete, slutpunkten stöder inget annat, och det finns ingen migrationsväg som bevarar din befintliga WebSocket-kod. Vänta också om ditt användningsfall är beroende av strukturerade verktygsutdata eller videoindata, vilka båda saknas här.
Vad man bör hålla ett öga på under de kommande veckorna: den första oberoende reproduktionen av siffran 80,1 % för interaktivitet, huruvida priset på 0,05 dollar är ett introduktionspris, huruvida en mindre GPT-Live-1 mini når API:et på samma sätt som den gjorde på konsumentsidan, och huruvida bild- och skärminmatning sluter gapet. Tills ett externt labb genomför den utvärderingen är den ärliga sammanfattningen att detta är den mest kapabla röstmodell som någon har levererat till utvecklare, med kvittot för det påståendet skrivet av dem som säljer den.
