Hero-titelkort för Gemini 3.8 Live Extended Thinking vs GPT-Live-1, som visar de två röstmodellerna 1,1 indexpunkter ifrån varandra med olika faktureringsmodeller.
Guides & Insights

Gemini 3.8 Live Extended Thinking vs GPT-Live-1: Ett oavgjort resultat på 1,1 poäng och två olika räkningar

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

På den sammansatta poängen är detta oavgjort. Gemini 3.8 Live Extended Thinking ligger på 82,6 i Artificial Analysis Speech to Speech Index; GPT-Live-1, i sin Astra-backend vid medelhög resonemangsansträngning, ligger på 81,5. På den underliggande agentiska komponenten – τ-Voice uppgiftslösning – är gapet 0,7 poäng, 68,6 % mot 67,9 %. På resonemangskomponenten är det större och går åt andra hållet: 97,7 % på Big Bench Audio för Gemini-modellen, 90,1 % för GPT-Live-1. Inget i den spridningen överlever en andra benchmarkkörning, och inget av det är vad du bör fatta beslut utifrån.

Det som skiljer dessa två åt är inte kvalitet. Det är att de är oense om vad en röstagent är, vem som gör tänkandet, och – den del som först träffar en budgetpost – hur sessionen debiteras. Gemini 3.8 Live Extended Thinking tar betalt per ljudtoken och resonerar i samma modell som talar. GPT-Live-1 tar en fast avgift för samtalsklockan, oavsett om någon talar eller inte, och lägger själva tänkandet på en separat textmodell som du väljer och betalar för separat. Det är två olika produkter som bär samma benchmarkpoäng, och vilken som passar beror på en fråga som resultattavlan aldrig ställer: hur ser ett genomsnittligt samtal ut på din linje?

1,1-poängsdödläget, och var det faktiskt bryts

Börja med siffrorna, eftersom tunnheten i rubriken är poängen:

Tal-till-tal-index — Gemini 3.8 Live Extended Thinking (Hög) 82,6 vs GPT-Live-1 (Astra-backend, medelinsats) 81,5

Agentisk prestanda (τ-Voice uppgiftslösning) — 68,6 % mot 67,9 %, med GPT-Live-1 på 59,3 % när den kör Sol-backenden på låg ansträngningsnivå

Talresonemang (Big Bench Audio) — 97,7 % mot 90,1 %, den enda komponenten där gapet inte är brus

Komplexa bankarbetsflöden (Sierra τ³-Banking, enligt leverantören) — 35,1 % mot 32,0 %

Tid till första ljudet — 1,35 s mot 1,24–1,34 s via API:et

Uppmätt kostnad per timme — 3,50 $ mot 5,83 $ för Astra-konfigurationen, båda enligt Artificial Analysys mätning av indataljud

Den ärliga tolkningen är att de två modellerna är omöjliga att skilja åt på det sammansatta måttet, men urskiljbara i talresonemang, där Gemini-modellen leder med nästan åtta punkter, och urskiljbara i kostnad, där den leder med omkring 40 %. Där GPT-Live-1 drar ifrån är i de delar av upplevelsen som ett benchmark har svårt att poängsätta: den är genuint full-duplex, lyssnar medan den talar, sänder ut backchannel-signaler och beslutar flera gånger i sekunden om den ska tala eller ge vika. Gemini 3.8 Live Extended Thinking är turordningsbaserad. Den löser samma underliggande problem – en uppringare som lämnas i tystnad medan agenten arbetar – genom att i stället berätta, resonera och tala samtidigt med ledtrådar som "Låt mig kolla det där…" medan uppgiften körs.

Båda metoderna håller linjen vid liv. De känns olika. Bara en av dem dyker upp i ett index.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

Två faktureringsmodeller, och varför prislistan vilseleder

Det här är avsnittet som avgör de flesta driftsättningar, och det är just det som täckningen hoppar över.

Gemini 3.8 Live Extended Thinking faktureras på samma sätt som en tokenmodell. Via Live API är de publicerade priserna 3,00 USD per miljon ljudindatatoken – ungefär 0,005 USD per minut för ljudinmatning – och 12,00 USD per miljon ljudutdatatoken, ungefär 0,018 USD per minut, där tänktoken räknas in i utdata. Du betalar för ljud som rör sig. En uppringare som pausar, tänker eller sätts på vänteläge kostar dig ingenting så länge den är tyst.

GPT-Live-1 debiteras på samma sätt som en telefonlinje. Det är en fast avgift på 0,05 USD per minut av sessionstid, debiterad per sekund, oavsett vem som talar eller om någon gör det. Resonemangsbackenden ingår inte: textmodellen som står för tänkandet, och eventuella verktyg som den anropar, debiteras separat utöver det. Det är så ett annonserat pris på 0,05 USD blir en total summa på ungefär 4,47 USD per timme på Sol-backenden och 5,83 USD per timme på Astra medium, mätt av Artificial Analysis.

Ställ dem sida vid sida och den naiva jämförelsen – $0,018 mot $0,05 per minut, en skillnad på 2,8× – är fel i båda riktningarna. De uppmätta timsiffrorna visar att den verkliga skillnaden ligger på $3,50 mot $5,83, närmare 1,7×. Men sessionsklocksmodellen förändrar också formen på din faktura, inte bara nivån: på GPT-Live-1 följer din kostnad samtalslängden, så en linje med långa, tysta samtal med lågt innehåll – en supportkö, ett verifieringssteg, en IVR-överlämning – betalar samma som en innehållstät. På Gemini-sidan följer kostnaden ljudet, så tystnad är gratis och ordrikedom är det inte. Räkna på din egen genomsnittliga samtalslängd innan du räknar på en minutpris, för det är siffran som avgör vilket av dessa som är billigare för dig, och det är inte samma svar för en bokningslinje och en triagelinje.

Där tänkandet sker

Den andra strukturella skillnaden är delegering, och det är den som avgör hur mycket av den här stacken du faktiskt kan byta ut.

GPT-Live-1 är ett front-end. Det hanterar duplexljud, och när en fråga kräver verkligt resonemang lämnar det arbetet till en separat backend-modell — GPT-5.5 och GPT-6 Astra är båda dokumenterade som backends — med väljare för resonemangsansträngning som låter dig välja hur mycket av den backendmodellen du vill köpa. Det är därför resultattavlan listar GPT-Live-1 två gånger med olika poäng: 81,5 på Astra vid medelhög ansträngning, 80,1 på Sol vid låg. Den där spridningen på 1,4 poäng mellan dess egna två konfigurationer är större än gapet på 1,1 poäng mellan de två modellerna i den här matchningen, vilket säger dig att på OpenAI-sidan spelar konfigurationen du väljer större roll än leverantören du väljer.

Gemini 3.8 Live Extended Thinking resonerar i samma modell som talar. Det finns ingen separat backend att välja och ingen separat fakturering för en; avvägningen är att du ställer in djupet med tankenivåer – låg, medel och hög – på samma modell, och siffrorna 82,6 och 68,6 gäller (Hög)-konfigurationen. Bakgrundsverktyg och API-exekvering körs asynkront på båda sidor, så ingen av modellerna hänger sig medan den arbetar.

En praktisk konsekvens: eftersom GPT-Live-1:s intelligens är en inköpt textmodell bakom ett röstgränssnitt, flyttas dess kvalitetstak när OpenAI släpper en textmodell, inte när de släpper en röstmodell. Taket för Gemini 3.8 Live Extended Thinking flyttas när Google tränar om ljudmodellen. Om du satsar på en röstplattform på två års sikt är skillnaden i uppgraderingstakt värd mer eftertanke än 1,1 indexpunkter.

Vad ett byte kostar, oavsett vilken väg du väljer

Inget av dessa är ett byte av modell-ID, och team som behandlar det som ett sådant upptäcker det i produktion. Att gå över till Gemini 3.8 Live Extended Thinking innebär att acceptera ett annat turkontrakt: funktionsanrop är alltid asynkrona, så en blockerande verktygsdeklaration returnerar ett hårt fel i stället för att köas, och klienter måste läsa fältet interaction_statusIN_PROGRESS medan resonemang pågår eller ett verktyg fortfarande körs, IDLE endast när hela uppgiften slutförs — i stället för att lita på att turnComplete betyder att arbetet är klart. Att gå över till GPT-Live-1 innebär att införa dess mekanismer för val av backend och en andra faktureringsyta, och leva med ett API som inte blev allmänt tillgängligt för utvecklare förrän den 10 september 2026, efter att ha debuterat i ChatGPT den 8 juli — så tredjepartsverktyg, SDK:er och observerbarhet kring det är månader gamla, inte år. Vilken riktning du än väljer, budgetera integrationsarbetet vid sidan av tokenräkningen. I en mogen röststack är refaktoreringen vanligtvis den större av de två.

Hur man gör en sådan här jämförelse utan att satsa på den

Det förnuftiga sättet att avgöra en fråga som skiljer 1,1 punkt är att köra båda på din egen trafik, och det besvärliga är att det normalt innebär två integrationer, två avtal och två uppsättningar autentiseringsuppgifter. Det behöver inte innebära två arkitekturer. I båda dessa system är röstgränssnittet ett tunt lager ovanpå vanliga textmodellanrop – för GPT-Live-1 är det explicit, och för Gemini-sidan löses bakgrundsverktygskörning på samma sätt – och det textlagret är där din kostnadsvariation finns och där byte är genuint billigt.

OrcaRouter tillhandahåller 190 modeller från en enda nyckel till leverantörens listpris utan påslag, så en prisändring uppströms slår igenom hos oss samma dag i stället för vid nästa avtalsförnyelse. För en röststack är de två egenskaper som spelar roll att delegeringsmålet kan bytas ut i live-trafik utan att röstintegrationen rörs, och att automatisk failover håller ett samtal vid liv när en backend får fel eller timeouter — vilket är vad som gör att du kan testa en oprövad konfiguration på verklig trafik utan att sätta en produktionslinje bakom den. För att vara exakta om vad vi hostar och inte hostar: varken slutpunkten Gemini 3.8 Live Extended Thinking eller slutpunkten GPT-Live-1 finns på vår router — de kommer från Googles och OpenAIs egna API:er. De textmodeller som de delegerar till finns mycket ofta där, däribland Gemini 3.8 Flash.

Toppen av tavlan, och hur lite den stabiliseras.

Bilden nedan togs den 16 september 2026:

Gemini 3.8 Live Extended Thinking (High) — 82,6, första plats

GPT-Live-1 (Astra-backend, medelinsats) — 81,5

Grok Voice Think Fast 2.0 High — 81,3

• GPT-Live-1 (Sol-backend, låg insats) — 80.1

• Gemini 3.8 Live — 76,0

• GPT-Realtime-2.1 High — 73,9

• Gemini 3.1 Flash Live High — 71.5

Tre saker värda att lägga märke till. För det första: första- och tredjeplats skiljs åt av 1,3 poäng och första- och femteplats av 6,6, så toppen av den här tabellen är en klunga, inte en rangordning. För det andra: modellen i den här matchningens titel är inte den femteplacerade Gemini-posten – det är standardversionen Gemini 3.8 Live, en annan och mycket billigare produkt som inte bör förväxlas med den resonemangsvariant som jämförs här. För det tredje: det finns ett prejudikat för att behandla varje enskild indexsiffra som preliminär: xAI rapporterade 82,9 för Grok Voice Think Fast 2.0 i juli, och den modellen visas som 81,3 i den här tabellen. Leverantörsrapporterade indexpoäng klarar sig inte alltid i mötet med en live-topplista. Siffrorna 68,6 % och 67,9 % för τ-Voice ligger nu på en offentlig tabell som körs under Artificial Analysis eget harness, så de är styrkta snarare än bara påstådda – men en skillnad på 0,7 poäng mellan två modeller i samma harness är inte en skillnad. Verifiera det mot din egen trafik eller ignorera det.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Ytterligare en siffra som är värd att väga in i beslutet, eftersom det är den minst bekväma siffran i den här jämförelsen: Google rapporterar 35,1 % för Gemini 3.8 Live Extended Thinking på Sierras τ³-Banking-leaderboard, mot 32,0 % för GPT-Live-1 Astra. Dessa är leverantörsrapporterade och icke reproducerade, och de beskriver en värld där den ledande röstagenten på den listan misslyckas med ungefär två av tre realistiska bankuppgiftsförsök. Om din agent måste slutföra reglerat arbete i flera steg är ingen av dessa modeller färdig – och en 3,1-punktsledning på det riktmärket är inte ett skäl att välja en leverantör, det är ett skäl att behålla en människa i loopen.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

Så: om samtalsnaturalitet är produkten och dina samtal är korta och täta, är GPT-Live-1:s full-duplex-beteende en verklig fördel som indexet inte kan se, och den sessionsklockbaserade faktureringen är tolerabel vid den samtalslängden. Om samtalen är långa, tysta eller varierande, eller om talresonemang och kostnad per timme dominerar, ligger Gemini 3.8 Live Extended Thinking före på de komponenter som spelar roll och är omkring 40 % billigare per timme medan den gör det – med förbehållet att den är turordningsbaserad, fortfarande i förhandsversion för företag och kräver en klientrefaktorering innan den kan köra dina verktyg. Vad inget av detta rättfärdigar är att välja någon av dem med stöd av 1,1 indexpoäng. Utifrån den tillgängliga evidensen är det ärliga skälet att välja mellan dessa två faktureringsmodellen och arkitekturen bakom den, och båda dessa är saker du kan mäta på din egen trafik den här veckan.

På OrcaRouter, automatisk failover håller ett samtal vid liv när en backend ger fel eller får timeout.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen