
Gemini 3.8 Live vs GPT-Live-1: Full-duplex vs modellen som tänker medan den talar
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
I ungefär två månader avgjordes argumentet av arkitekturen. GPT-Live-1 är verkligen full-duplex – den lyssnar medan den talar, producerar backchannel-signaler som "mhmm" och "jag fattar", och avgör flera gånger i sekunden om den ska tala eller lämna över. Gemini 3.8 Live, som tillkännagavs den 15 september 2026, är en turbaserad modell. Enligt det gamla synsättet gjorde det jämförelsen enkel, och nu är det fel sätt att läsa den.
Det som har förändrats är inte att Google matchade full-duplex. Det är att Google levererade det som full-duplex användes för att kompensera för: en röstmodell som kan föra en konversation medan en uppgift i flera steg körs i bakgrunden, och en andra variant som resonerar högt medan den arbetar. Den arkitektoniska skillnaden är verklig. Den är bara inte längre den axel som avgör köpet.
Två sätt att hålla en konversation levande
Satsningen på full duplex bygger på att samtalskvaliteten är produkten. GPT-Live-1 bearbetar indata- och utdata-ljud kontinuerligt och synkront i en och samma modell, i stället för att kedja tal-till-text till en språkmodell till text-till-tal. Det eliminerar informationsförlusten mellan stegen och ger det beteende som folk faktiskt lägger märke till: du kan avbryta mitt i ett svar och den anpassar sig; den tar inte en paus eller ett bakgrundsljud för att din tur är slut; den är tyst tills den tilltalas.
Den turordningsbaserade satsningen som Gemini 3.8 Live gör är att samtalet är en byggnadsställning för arbete. Dess funktioner handlar om att hålla sessionen produktiv snarare än att hålla rytmen naturlig: nästan realtidsbearbetning av visuell indata, automatiskt byte mellan 97 språk som stöds mitt i samtalet, och bakgrundsexekvering av verktyg och API:er som bekräftar en begäran och fortsätter prata medan anropet slutförs.
Båda modellerna vägrar lägga på dig medan de tänker. De vägrar bara på olika sätt. GPT-Live-1 gör det genom att aldrig stoppa ljudströmmen. Google gör det genom att prata över arbetet.

Vad indexet faktiskt säger
Artificial Analysis underhåller ett Speech to Speech Index – ett viktat sammansatt mått av talresonemang, agentisk prestanda, arena-preferens och andel lyckade uppgifter. Läs resultattavlan som registrerades den 16 september 2026 noggrant, eftersom rubriken döljer strukturen:
• Gemini 3.8 Live Extended Thinking — 82.6 (först)
• GPT-Live-1 (Astra-backend, medel ansträngning) — 81.5
• Grok Voice Think Fast 2.0 High — 81,3
• GPT-Live-1 (Sol-backend, låg insats) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73,9
• Gemini 3.1 Flash Live High — 71.5
Tre saker följer av den ordningen. För det första har Google topplaceringen, men den har den med den dyra varianten, inte den som de flesta kommer att driftsätta. För det andra förekommer GPT-Live-1 två gånger, eftersom Artificial Analysis poängsätter hela systemet snarare än röstgränssnittet — och gapet på 1,4 punkter mellan dess två konfigurationer är sju gånger större än gapet på 0,2 punkter mellan första- och andraplatsen. För det tredje ligger modellen i titeln för den här matchen, Gemini 3.8 Live, på femte plats, under båda GPT-Live-1-konfigurationerna.
Om du jämför lika för lika – standardnivån mot standardnivån – vinner GPT-Live-1 den här duellen på det sammansatta indexet, och det är inte ens nära. 82,6 tillhör Gemini 3.8 Live Extended Thinking, som är en annan produkt till ett annat pris med en annan utrullning.

Där GPT-Live-1 fortfarande ligger före
Full-duplex är inte en marknadsföringsskillnad, och benchmark-uppdelningen visar var det omvandlas till en verklig fördel:
• Agentisk prestanda — GPT-Live-1 leder avgörande på τ-Voice med 67,9 % mot Groks 56,5 %. Google har inte publicerat någon jämförbar τ-Voice-siffra för Gemini 3.8 Live, endast 68,6 % för varianten Extended Thinking.
• Samtalsdynamik — full-duplex-turtagning förblir riktmärket för naturlighet, och turbaserade modeller har historiskt sett legat efter på detta.
• Delegeringsdjup — GPT-Live-1 lämnar över svåra frågor till en frontier-textmodell, med både GPT-5.5 och GPT-6 Astra dokumenterade som backends, och exponerar väljare för resonemangsansträngning.
• Källhänvisning — rösttranskriptioner från ChatGPT innehåller citeringslänkar, vilket fortfarande är ovanligt i röstinteraktioner i allmänhet.
Motvikten är att GPT-Live-1 ligger efter när det gäller rå talresonemang: 90,1 % på Big Bench Audio mot Groks 97,2 %. Och dess huvudsakliga latenssiffra på 0,798 sekunder i Full Duplex Bench är ett annat mått än API:ets tid till första ljud, som ligger på 1,24–1,34 sekunder.
Där Gemini 3.8 Live ligger före
Googles fördelar handlar mindre om konversation och mer om vad sessionen kan göra:
• Vision, i dag — Gemini har stöttat kamerainmatning och skärmdelning ett tag. GPT-Live-1 lanserades utan video eller skärmdelning, och OpenAI säger att de är på väg och hänvisar till det äldre Advanced Voice Mode som en tillfällig lösning. Gemini 3.8 Live lägger till nästan realtidsbearbetning av visuell inmatning ovanpå det.
• Språktäckning — 97 språk som stöds med automatisk växling mitt i konversationen, jämfört med ett mycket smalare utbud på OpenAI-sidan.
• Kostnad — det annonserade priset är $0,005 per minut för ljudinmatning och $0,018 per minut för ljudutmatning. GPT-Live-1 faktureras med $0,05 per röstminut enbart för front-end, med en uppmätt totalkostnad på ungefär $4,47–$5,83 per timme när backend-tokens räknas in.
• En andra nivå som resonerar högt — Gemini 3.8 Live Extended Thinking berättar om framstegen med fraser som "Låt mig kolla upp det…", vilket är ett annat svar på tystnadsproblemet än vad full-duplex är.
Kostnadsjämförelsen som spelar roll
Front-end-priserna ser ut som en kross – $0.018 mot $0.05 per minut – och siffrorna per timme är ännu mer talande. Artificial Analysiss diagram över kostnaden per timme för indataljud placerar Gemini 3.8 Live på $1.50 per timme, mot $4.14 för GPT-Realtime-2 High och $10.75 för GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 ligger på $4.80.
Haken är att ingendera siffran är den verkliga räkningen. GPT-Live-1:s 0,05 dollar per minut täcker bara röstgränssnittet; den bakomliggande textmodellen som står för själva resonerandet faktureras separat, och det är så ett rubrikpris på 0,05 dollar blir 4,47–5,83 dollar i timmen inklusive allt. Gemini 3.8 Live har samma strukturella form – körning av verktyg i bakgrunden är textmodellarbete – och Google har inte publicerat vad det kostar.
Så den ärliga tolkningen är att Gemini 3.8 Live är billigare vid ingången med stor marginal, och jämförelsen av total kostnad är okänd för båda tills du mäter din egen arbetsbelastning. Det är inte en undanflykt; det är det faktiska informationsläget.
Lagret som båda två delegerar till
Här är det strukturella faktum som gör att den här jämförelsen är mindre av ett inlåsningsbeslut än den verkar. Båda modellerna delegerar. GPT-Live-1 lämnar per design över svåra frågor till en textmodell i backend, och verktygskörning i bakgrunden på Gemini-sidan mynnar ut i vanliga modellanrop. I båda fallen är röstgränssnittet ett tunt lager ovanpå en textmodell som gör resonemanget – och det textlagret är där din kostnadsvariation ligger och där det är billigt att byta.
OrcaRouter har 190 modeller bakom en enda nyckel till leverantörens listpris utan påslag, så en prissänkning uppströms slår igenom på vår sida samma dag i stället för vid nästa avtalsförnyelse. För en röststack är de två egenskaperna som spelar roll att delegeringsmålet kan bytas ut på live-trafik utan att röra röstintegrationen, och att automatisk failover håller ett samtal vid liv när en backend får fel eller timeout. Ett förtydligande, eftersom det är lätt att antyda något annat: vi hostar inte röstslutpunkterna Gemini 3.8 Live eller GPT-Live-1 — de kommer från leverantörernas egna API:er. De textmodeller de vanligtvis delegerar arbete till finns på routern.

Hur man väljer
Välj GPT-Live-1 om samtalskvaliteten är själva produkten — naturlig hantering av avbrott, backchannels och känslan av att man talar med något snarare än manövrerar det — och om du kan bära den sammanlagda kostnaden, som är betydligt högre än vad priset i rubriken antyder. Observera att dess API blev tillgängligt först i september 2026, så tredjepartsverktyg kring det är unga.
Välj Gemini 3.8 Live om du behöver bildseende nu, om du behöver fler än ett par dussin språk, eller om ekonomin per minut dominerar din modell. Acceptera att du köper standardnivån, som placerar sig femma på det sammansatta indexet snarare än etta, och att 82,6 som alla kommer att citera tillhör varianten Extended Thinking.
Välj Gemini 3.8 Live Extended Thinking om resonemanget är själva poängen och du vill ha den aktuella indexledaren – men kontrollera dess utrullning först, eftersom dess distributionsväg genom Gemini Live, Docs, Gmail och Keep är bredare än standardmodellens och dess företagstillgänglighet fortfarande är i privat förhandsversion.
Det man bör hålla ögonen på under nästa kvartal är om full-duplex fortsätter att vara en vallgrav. Turbaserade modeller stänger samtalsgapet via en annan väg – att hålla ljudet upptaget med berättarröst medan arbete pågår – och om det håller under verklig trafik kommer den arkitektoniska skillnad som har definierat den här kategorin i ett år att sluta vara det köpare frågar om.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
