Hero-titelkort för Gemini 3.8 Live vs GPT-Live-1 med överrubriken ”OrcaRouter · modellradar — head to head” och underrubriken ”Full-duplex kontra turbaserat – arkitekturargumentet, återläst.” Två kort lyder ”Gemini 3.8 Live — turbaserat, vision idag, 97 språk, billigare minuter” och ”GPT-Live-1 — full-duplex, backkanaler, delegerar till en frontier-backend”, med chips för Index 76,0 vs 81,5, 0,018 $ vs 0,05 $ per minut, och video kommer snart på OpenAI. OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Gemini 3.8 Live vs GPT-Live-1: Full-duplex vs modellen som tänker medan den talar

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

I ungefär två månader avgjordes argumentet av arkitekturen. GPT-Live-1 är verkligen full-duplex – den lyssnar medan den talar, producerar backchannel-signaler som "mhmm" och "jag fattar", och avgör flera gånger i sekunden om den ska tala eller lämna över. Gemini 3.8 Live, som tillkännagavs den 15 september 2026, är en turbaserad modell. Enligt det gamla synsättet gjorde det jämförelsen enkel, och nu är det fel sätt att läsa den.

Det som har förändrats är inte att Google matchade full-duplex. Det är att Google levererade det som full-duplex användes för att kompensera för: en röstmodell som kan föra en konversation medan en uppgift i flera steg körs i bakgrunden, och en andra variant som resonerar högt medan den arbetar. Den arkitektoniska skillnaden är verklig. Den är bara inte längre den axel som avgör köpet.

Två sätt att hålla en konversation levande

Satsningen på full duplex bygger på att samtalskvaliteten är produkten. GPT-Live-1 bearbetar indata- och utdata-ljud kontinuerligt och synkront i en och samma modell, i stället för att kedja tal-till-text till en språkmodell till text-till-tal. Det eliminerar informationsförlusten mellan stegen och ger det beteende som folk faktiskt lägger märke till: du kan avbryta mitt i ett svar och den anpassar sig; den tar inte en paus eller ett bakgrundsljud för att din tur är slut; den är tyst tills den tilltalas.

Den turordningsbaserade satsningen som Gemini 3.8 Live gör är att samtalet är en byggnadsställning för arbete. Dess funktioner handlar om att hålla sessionen produktiv snarare än att hålla rytmen naturlig: nästan realtidsbearbetning av visuell indata, automatiskt byte mellan 97 språk som stöds mitt i samtalet, och bakgrundsexekvering av verktyg och API:er som bekräftar en begäran och fortsätter prata medan anropet slutförs.

Båda modellerna vägrar lägga på dig medan de tänker. De vägrar bara på olika sätt. GPT-Live-1 gör det genom att aldrig stoppa ljudströmmen. Google gör det genom att prata över arbetet.

A two-column scoreboard comparing Gemini 3.8 Live and GPT-Live-1. Index score 76.0 vs 81.5; architecture turn-based vs full-duplex; video and screen available today vs not at launch; agentic tau-Voice not published vs 67.9%; languages 97 vs a narrower set; voice price $0.005 in and $0.018 out per minute vs $0.05 per minute plus backend tokens. Footer reads 'Index figures per Artificial Analysis, Sep 16 2026; GPT-Live-1 all-in measured at $4.47-$5.83 per hour.' The OrcaRouter logo is composited in the bottom-right corner.

Vad indexet faktiskt säger

Artificial Analysis underhåller ett Speech to Speech Index – ett viktat sammansatt mått av talresonemang, agentisk prestanda, arena-preferens och andel lyckade uppgifter. Läs resultattavlan som registrerades den 16 september 2026 noggrant, eftersom rubriken döljer strukturen:

Gemini 3.8 Live Extended Thinking — 82.6 (först)

• GPT-Live-1 (Astra-backend, medel ansträngning) — 81.5

Grok Voice Think Fast 2.0 High — 81,3

• GPT-Live-1 (Sol-backend, låg insats) — 80.1

Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73,9

• Gemini 3.1 Flash Live High — 71.5

Tre saker följer av den ordningen. För det första har Google topplaceringen, men den har den med den dyra varianten, inte den som de flesta kommer att driftsätta. För det andra förekommer GPT-Live-1 två gånger, eftersom Artificial Analysis poängsätter hela systemet snarare än röstgränssnittet — och gapet på 1,4 punkter mellan dess två konfigurationer är sju gånger större än gapet på 0,2 punkter mellan första- och andraplatsen. För det tredje ligger modellen i titeln för den här matchen, Gemini 3.8 Live, på femte plats, under båda GPT-Live-1-konfigurationerna.

Om du jämför lika för lika – standardnivån mot standardnivån – vinner GPT-Live-1 den här duellen på det sammansatta indexet, och det är inte ens nära. 82,6 tillhör Gemini 3.8 Live Extended Thinking, som är en annan produkt till ett annat pris med en annan utrullning.

Screenshot of the Artificial Analysis Speech to Speech leaderboard page, captured September 16, 2026. The AA-Speech to Speech Index bar chart shows Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 (Astra) at 81.5, Grok Voice Think Fast 2.0 at 81.3, GPT-Live-1 (Sol) at 80.1 and Gemini 3.8 Live at 76.0, alongside speed and cost-per-hour-of-input-audio panels.

Där GPT-Live-1 fortfarande ligger före

Full-duplex är inte en marknadsföringsskillnad, och benchmark-uppdelningen visar var det omvandlas till en verklig fördel:

Agentisk prestanda — GPT-Live-1 leder avgörande på τ-Voice med 67,9 % mot Groks 56,5 %. Google har inte publicerat någon jämförbar τ-Voice-siffra för Gemini 3.8 Live, endast 68,6 % för varianten Extended Thinking.

Samtalsdynamik — full-duplex-turtagning förblir riktmärket för naturlighet, och turbaserade modeller har historiskt sett legat efter på detta.

Delegeringsdjup — GPT-Live-1 lämnar över svåra frågor till en frontier-textmodell, med både GPT-5.5 och GPT-6 Astra dokumenterade som backends, och exponerar väljare för resonemangsansträngning.

Källhänvisning — rösttranskriptioner från ChatGPT innehåller citeringslänkar, vilket fortfarande är ovanligt i röstinteraktioner i allmänhet.

Motvikten är att GPT-Live-1 ligger efter när det gäller rå talresonemang: 90,1 % på Big Bench Audio mot Groks 97,2 %. Och dess huvudsakliga latenssiffra på 0,798 sekunder i Full Duplex Bench är ett annat mått än API:ets tid till första ljud, som ligger på 1,24–1,34 sekunder.

Där Gemini 3.8 Live ligger före

Googles fördelar handlar mindre om konversation och mer om vad sessionen kan göra:

Vision, i dag — Gemini har stöttat kamerainmatning och skärmdelning ett tag. GPT-Live-1 lanserades utan video eller skärmdelning, och OpenAI säger att de är på väg och hänvisar till det äldre Advanced Voice Mode som en tillfällig lösning. Gemini 3.8 Live lägger till nästan realtidsbearbetning av visuell inmatning ovanpå det.

Språktäckning — 97 språk som stöds med automatisk växling mitt i konversationen, jämfört med ett mycket smalare utbud på OpenAI-sidan.

Kostnad — det annonserade priset är $0,005 per minut för ljudinmatning och $0,018 per minut för ljudutmatning. GPT-Live-1 faktureras med $0,05 per röstminut enbart för front-end, med en uppmätt totalkostnad på ungefär $4,47–$5,83 per timme när backend-tokens räknas in.

En andra nivå som resonerar högt — Gemini 3.8 Live Extended Thinking berättar om framstegen med fraser som "Låt mig kolla upp det…", vilket är ett annat svar på tystnadsproblemet än vad full-duplex är.

Kostnadsjämförelsen som spelar roll

Front-end-priserna ser ut som en kross – $0.018 mot $0.05 per minut – och siffrorna per timme är ännu mer talande. Artificial Analysiss diagram över kostnaden per timme för indataljud placerar Gemini 3.8 Live på $1.50 per timme, mot $4.14 för GPT-Realtime-2 High och $10.75 för GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 ligger på $4.80.

Haken är att ingendera siffran är den verkliga räkningen. GPT-Live-1:s 0,05 dollar per minut täcker bara röstgränssnittet; den bakomliggande textmodellen som står för själva resonerandet faktureras separat, och det är så ett rubrikpris på 0,05 dollar blir 4,47–5,83 dollar i timmen inklusive allt. Gemini 3.8 Live har samma strukturella form – körning av verktyg i bakgrunden är textmodellarbete – och Google har inte publicerat vad det kostar.

Så den ärliga tolkningen är att Gemini 3.8 Live är billigare vid ingången med stor marginal, och jämförelsen av total kostnad är okänd för båda tills du mäter din egen arbetsbelastning. Det är inte en undanflykt; det är det faktiska informationsläget.

Lagret som båda två delegerar till

Här är det strukturella faktum som gör att den här jämförelsen är mindre av ett inlåsningsbeslut än den verkar. Båda modellerna delegerar. GPT-Live-1 lämnar per design över svåra frågor till en textmodell i backend, och verktygskörning i bakgrunden på Gemini-sidan mynnar ut i vanliga modellanrop. I båda fallen är röstgränssnittet ett tunt lager ovanpå en textmodell som gör resonemanget – och det textlagret är där din kostnadsvariation ligger och där det är billigt att byta.

OrcaRouter har 190 modeller bakom en enda nyckel till leverantörens listpris utan påslag, så en prissänkning uppströms slår igenom på vår sida samma dag i stället för vid nästa avtalsförnyelse. För en röststack är de två egenskaperna som spelar roll att delegeringsmålet kan bytas ut på live-trafik utan att röra röstintegrationen, och att automatisk failover håller ett samtal vid liv när en backend får fel eller timeout. Ett förtydligande, eftersom det är lätt att antyda något annat: vi hostar inte röstslutpunkterna Gemini 3.8 Live eller GPT-Live-1 — de kommer från leverantörernas egna API:er. De textmodeller de vanligtvis delegerar arbete till finns på routern.

Screenshot of the OrcaRouter model page for google/gemini-3.8-flash, showing the 1M-token context window, 65K max output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and p50 time to first token of 3.35 seconds.

Hur man väljer

Välj GPT-Live-1 om samtalskvaliteten är själva produkten — naturlig hantering av avbrott, backchannels och känslan av att man talar med något snarare än manövrerar det — och om du kan bära den sammanlagda kostnaden, som är betydligt högre än vad priset i rubriken antyder. Observera att dess API blev tillgängligt först i september 2026, så tredjepartsverktyg kring det är unga.

Välj Gemini 3.8 Live om du behöver bildseende nu, om du behöver fler än ett par dussin språk, eller om ekonomin per minut dominerar din modell. Acceptera att du köper standardnivån, som placerar sig femma på det sammansatta indexet snarare än etta, och att 82,6 som alla kommer att citera tillhör varianten Extended Thinking.

Välj Gemini 3.8 Live Extended Thinking om resonemanget är själva poängen och du vill ha den aktuella indexledaren – men kontrollera dess utrullning först, eftersom dess distributionsväg genom Gemini Live, Docs, Gmail och Keep är bredare än standardmodellens och dess företagstillgänglighet fortfarande är i privat förhandsversion.

Det man bör hålla ögonen på under nästa kvartal är om full-duplex fortsätter att vara en vallgrav. Turbaserade modeller stänger samtalsgapet via en annan väg – att hålla ljudet upptaget med berättarröst medan arbete pågår – och om det håller under verklig trafik kommer den arkitektoniska skillnad som har definierat den här kategorin i ett år att sluta vara det köpare frågar om.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen