
GPT-Live-1 vs Grok Voice Think Fast 2.0: Två röst-API:er som rör sig i motsatta prisriktningar
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M tokens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Det mest användbara faktumet om den här matchningen är en riktning, inte en siffra. När xAI släppte Grok Voice Think Fast 2.0 i slutet av juli 2026 höjde man minutpriset för ljud med 60 %, från $0,05 som Think Fast 1.0 tog till $0,08. Sex veckor senare, den 10 september 2026, lade OpenAI in GPT-Live-1 i utvecklar-API:et till exakt det pris som xAI just hade övergett. Det ger dig den sällsynta situationen där de två ledande full-duplex-röst-API:erna kan jämföras direkt på pris, och där den nyare aktören är den billigare — medan den äldre, dyrare modellen är den som har tredjepartsbenchmarkresultat bakom sig.
Huvudboken, före några benchmarks
Båda dessa är tal-till-tal-modeller byggda för telefonformade arbetsbelastningar: ett realtidssamtal med en kund, ett avbrott, ett verktygsanrop och en faktura som mäts i minuter. Utöver det går de snabbt isär.
• Pris per minut ljud — GPT-Live-1 $0,05 vs Grok Voice Think Fast 2.0 $0,08
• Faktureringsenhet — GPT-Live-1 fakturerar per sekund utan avrundning uppåt till nästa hela minut; Grok Voice Think Fast 2.0 prissätts per ljudminut och motsvarar ungefär $4,80 i timmen
• Släpp — GPT-Live-1 släpptes i ChatGPT den 8 juli 2026 och nådde API:et den 10 september 2026; Grok Voice Think Fast 2.0 tillkännagavs omkring den 29–30 juli 2026, ungefär tre månader efter Think Fast 1.0
• Endpunkter — GPT-Live-1 är endast Live Sessions, på v1/live/sessions, över WebRTC; Grok Voice Think Fast 2.0 körs på xAI:s Speech-to-Speech-API över både WebSocket och WebRTC
• Verktygsyta — GPT-Live-1 delegerar till en backend-resonemangsmodell via Responses API; Grok Voice Think Fast 2.0 har webbsökning, X-sökning, filsökning, MCP-servrar och klientsidofunktioner tillgängliga i sessionen
• Röstportabilitet — GPT-Live-1 använder OpenAI:s remastrade uppsättning av tolv röster; Grok Voice Think Fast 2.0 stöder inbyggda och anpassade röster
WebSocket-linjen är mindre än den ser ut och betyder mer än den borde. En stor andel av teleinfrastrukturen — medieströms-rördragningen inuti de flesta CPaaS-produkter — talar WebSocket, inte WebRTC. Grok Voice Think Fast 2.0 möter den infrastrukturen där den är; GPT-Live-1 gör det inte, och att ta sig till WebRTC från en samtalsväg som enbart använder WebSocket är ett riktigt ingenjörsarbete snarare än en konfigurationsflagga.

Benchmark-asymmetrin är den egentliga historien.
Här slutar jämförelsen vara ett dött lopp, och här får de flesta texter det om bakfoten genom att behandla båda uppsättningarna siffror som samma slags bevis.
De främsta resultaten för Grok Voice Think Fast 2.0 kommer från Artificial Analysis Speech-to-Speech Quality Index, en tredjepartsmätning som placerar modellen på 82,9 %, upp från 75,7 % i version 1.0, före GPT-Realtime-2.1 på 79,1 % och Gemini 3.1 Flash på 69,5 %. xAI rapporterar också en förstaplats på τ-voice Bench för agentiskt beteende på 56,5 %, före GPT-Realtime-2.1 på 45,7 %. Det är externt genomförda mätningar av xAI:s modell.
GPT-Live-1:s huvudresultat är OpenAI:s egna. Företaget rapporterar full-duplex-interaktivitet på 80,1 % mot GPT-Realtime-2.1:s 45,4 %, att latensen vid turtagning har kortats från 1,4 sekunder till 0,8, och att träffsäkerheten för verktygsanrop har ökat från 60 % till 87 %. Var och en av dessa siffror är leverantörsrapporterad, har inte reproducerats av ett oberoende labb och jämför OpenAI:s nya modell med OpenAI:s egen tidigare modell i stället för med en konkurrent.
Det är inte ett skäl att avfärda siffrorna — utvecklingsriktningen stämmer överens med vad tidiga driftsättare rapporterar — men det betyder att den enda jämförelsen mellan leverantörer som för närvarande finns tillgänglig gynnar xAI:s modell i oberoende tester, medan den enda tillgängliga siffran för OpenAI:s latensfördel är OpenAI:s. Behandla inte 0,8 sekunder och 0,70 sekunder som en riktig tävling; bara en av dessa två siffror mättes av någon som inte har något intresse i resultatet.

Aliasfällan, och varför prishöjningen tog folk på sängen
Den 60-procentiga ökningen skulle ha varit ett avrundningsfel i de flesta versionsanteckningar om inte xAI också hade rullat ut den via ett alias. Applikationer som pekade på aliaset grok-voice-latest ärvde automatiskt både den nya modellen och det högre priset den 5 augusti 2026, om de inte uttryckligen hade låst till grok-voice-think-fast-1.0. Det är ett designbeslut som är värt att förstå snarare än att klaga på: flytande alias ger dig gratis uppgraderingar, och de ändrar också din enhetsekonomi utan att fråga.
Den självklara åtgärden är svagare än den verkar. Grok Voice Think Fast 1.0 – modellen för 0,05 dollar i minuten, släppt den 23 april 2026 – är nu markerad som föråldrad i xAI:s egen modellista. Att pinna den skyddar dig från den automatiska uppgraderingen, och det köper tid snarare än en permanent billigare väg, eftersom en föråldrad modell har ett avvecklingsdatum någonstans framför sig. Planera migreringen efter din egen tidsplan i stället för aliasets.
Prissättningsytan i sig är värd att läsas noggrant innan du bestämmer dig för en siffra. xAI:s modellsida listar uttryckligen de versionsspecifika priserna — grok-voice-think-fast-2.0 till $0.08 per minut ljud, $4.80 i timmen, plus $0.004 per textinmatning — medan det separata Voice API-kortet på samma sida annonserar ett agentpris på "från $0.05 i minuten", vilket är ingångspriset snarare än den taxa som 2.0-modellen debiterar. Om din kapacitetsplanering gjordes utifrån marknadsföringssiffran, är den ungefär 60 % för låg.
OpenAIs modell har inte detta problem i samma form, eftersom det inte finns något att flyta till. GPT-Live-1 har exakt ett modell-ID, gpt-live-1, som också är dess egen standardsnapshot – det finns inga daterade varianter att låsa fast vid, och därför inget alias som i tysthet kan ändra antingen modellen eller priset. Avvägningen är att du inte heller kan frysa ett känt fungerande beteende och köra vidare på det medan något nytt sätter sig.
Båda modellerna fakturerar resonemangslagret separat från röstlagret, och det är här det annonserade priset slutar vara hela kostnaden. GPT-Live-1:s delegerade Responses-anrop faktureras enligt den konfigurerade backendmodellens vanliga priser per token. xAI lägger till $0,004 per textinmatning i röstsessionen, plus verktygsanrop, ett tillhandahållet telefonnummer för omkring $0,01 per minut där man behöver ett, telefoni och lagring, utöver minutpriset för ljud. En röstagent som mest lyssnar och ibland slår upp något kommer att ligga nära sitt annonserade pris; en som anropar verktyg i varje tur kommer inte att göra det, och de två kommer inte att divergera åt samma håll, eftersom designen med delegerad backend och designen med verktyg i sessionen bränner tokens på olika ställen.
För vår del är anledningen till att ändringar i minutpriser är värda att bevaka noga att OrcaRouter förmedlar leverantörens listpris vidare utan påslag. När en leverantör ändrar ett publicerat pris ändras siffran hos oss samma dag i stället för vid nästa avtalscykel.

Vad delegeringsdelningen kostar dig inom ingenjörsarbetet
Om du väljer mellan dessa två utifrån arkitektur snarare än pris, är den avgörande frågan var sömmen ligger.
xAI:s modell håller verktygen inne i sessionen. Det är enklare att resonera kring — en anslutning, en konversation, en plats där ett funktionsanrop sker — och det innebär att modellen kan bestämma mitt i en mening att den behöver söka och fortsätta prata medan den väntar.
OpenAI:s modell skjuter ut det arbetet. Röstlagret håller samtalet vid liv och överlämnar uppgiften till en separat resonemangsmodell via Responses API, vilket innebär att dina verktygsdefinitioner, din hämtning och din affärslogik ligger i en vanlig textmodellsintegration i stället för inuti en sessionhändelseström. Det är fler rörliga delar, och det är också mer portabelt: den delegerade halvan är ett vanligt API-anrop som du kan byta ut, prissätta och felväxla oberoende av röstlagret.
Det spelar roll av exakt en anledning. Varken GPT-Live-1 eller Grok Voice Think Fast 2.0 tillhandahålls av någon annan än sin egen leverantör — båda har en enda källa, och en router kan inte hjälpa dig med ljudhalvan. Vad en router kan göra är att konsolidera den halva du faktiskt kan välja. GPT-5.6 Terra, backend i OpenAI:s eget delegeringsexempel, är tillgänglig via OrcaRouter till $2,00 per miljon indatatokens och $12,00 per miljon utdatatokens med både /v1/chat/completions och /v1/responses exponerade, tillsammans med ungefär 190 andra modeller på en enda nyckel. Om din röstagent anropar en resonemangsmodell för varje tur är det den kostnadspost där routning kan ge hävstång.
Domen, uppdelad efter arbetsbelastning
• Välj GPT-Live-1 om priset per minut är begränsningen, om din samtalsväg redan talar WebRTC, eller om du vill att den resonerande hjärnan bakom rösten ska vara en utbytbar textmodell snarare än en fast del av sessionen.
• Välj Grok Voice Think Fast 2.0 om du behöver oberoende verifierad kvalitet på bordet innan du bestämmer dig, om din telefoni-stack är WebSocket-native, eller om verktyg i sessionen – särskilt X-sökning – utgör kärnan i produkten snarare än en tillfällighet.
• Håll koll på aliaset om du redan använder xAI. Att låsa ett versionerat modell-ID är det enda som står mellan dig och nästa automatiska prisändring, och samma disciplin är värd att tillämpa överallt där ett flytande alias förekommer.
Den obekväma sammanfattningen är att den billigare modellen är den utan tredjepartsbevis bakom sig, och den bättre dokumenterade modellen är den som just har blivit 60 % dyrare. Om du är tillräckligt tidigt i bygget att ingen av integrationerna är låst, är den minst riskfyllda åtgärden att prototypa mot båda — ljudvägen är några hundra rader hur som helst — och låta din egen transkriptionskvalitet avgöra, eftersom den offentliga bevisningen för närvarande inte avgör saken.
