Hero-titelkort för Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live, som visar de två modellerna åtskilda av en 4x timkostnad för ljud, 3,50 dollar mot 0,84 dollar.
Guides & Insights

Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live: Att betala 4x för de 38 poäng som spelar roll

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två modeller, en lansering, en prislista och ett beslut som de flesta texter får fel på åt samma håll. Gemini 3.8 Live Extended Thinking och Gemini 3.8 Live släpptes tillsammans den 15 september 2026, båda byggda på Gemini 3 Pro, båda hanterar 97 språk med automatisk växling mitt i samtalet, båda tar emot visuell inmatning i nära realtid, båda vattenmärker genererat ljud med SynthID. I det sammansatta Speech to Speech Index som Artificial Analysis publicerar ligger de 6,6 poäng ifrån varandra – 82,6 mot 76,0. På den ljudkostnad per timme som samma resultattavla mäter ligger de drygt fyra gånger ifrån varandra.

Ingen av dem är den siffra som bör avgöra din arkitektur. Den siffra som bör göra det är 38: gapet mellan de två på τ-Voice, den agentiska komponenten för uppgiftslösning, där den resonerande varianten löser 68,6 % av replikerade kundtjänstscenarier och standardvarianten löser 30,1 %. Du väljer inte mellan en bra modell och en bättre. Du väljer mellan ett konversationsgränssnitt och ett resonemangssystem som råkar prata, och prisskillnaden är det minst intressanta med det valet.

Prisgaffeln, i de enheter du faktiskt debiteras i

Börja med fakturan, för det är den del som folk har rätt om och sedan överbetonar. Båda modellerna har samma publicerade pris via Live API: $0.005 per minut för ljudinmatning och $0.018 per minut för ljudutmatning, och på Extended Thinking-sidan inkluderar de utdatatokenarna tänkandet. Samma kort, samma priser, ingen separat premiumnivå för resonemang.

Divergensen visar sig när man mäter arbete i stället för minuter. Artificial Analysiss kolumn för kostnad per timme för indataljud – kostnaden för att slutföra en fast 40-frågors delmängd av Big Bench Audio, normaliserad till en timsiffra – placerar de två modellerna i helt olika kategorier:

Gemini 3.8 Live Extended Thinking (High) — 3,50 $ per timme för inmatat ljud, enligt Artificial Analysis egen mätning

Gemini 3.8 Live — $0.84 per timme, den lägsta betalda ersättningen på den anslagstavlan

• GPT-Live-1 (Astra-backend, medelhög ansträngning) — $5,83 per timme, så resonemangsvarianten ligger fortfarande cirka 40 % under modellen den slår

Grok Voice Think Fast 2.0 High — 4,80 $ per timme

• GPT-Realtime-2.1 High — $10.75 per timme

Det är vägskälet: fyra gånger timkostnaden för ljud, till samma publicerade minutpris, eftersom resonemangsvarianten gör av med fler tokens för att lyssna lika mycket. Standardmodellens 0,84 dollar är ingen rabatt, det är golvet för hela tavlan.

Vad 38 poäng köper

Dela upp kompositen och de två modellerna slutar se ut som ett par:

Tal-till-tal-index — Gemini 3.8 Live Extended Thinking (High) 82,6 vs Gemini 3.8 Live 76,0

Agentisk prestanda (τ-Voice uppgiftslösning) — 68,6 % mot 30,1 %

Talresonemang (Big Bench Audio) — 98 % mot 92 %

Samtalsdynamik — 91,9 % mot 96,1 %

Arenapreferens (Elo) — 990 mot 1083

Framgångsgrad för uppgifter — 89,1 % mot 93,2 %

Tid till första ljudet — 1,35 s mot 1,18 s

Kostnad per timme för inmatat ljud — 3,50 $ vs 0,84 $

Läs det ärligt och den billigare modellen vinner fyra av de åtta raderna. Den är snabbare till första ljudet, föredras av arenan, har större sannolikhet att slutföra en ytlig uppgift och får bättre betyg på samtalsdynamik — det sista av dessa är inte ett tröstpris, eftersom samtalsdynamik är vad en uppringare lägger märke till. Vad den inte kan göra är att slutföra ett jobb som har steg. 31,1 procent mot 68,6 % är den största enskilda skillnaden någonstans i den här utgåvan, och den hamnar på den enda axeln som skiljer en agent från ett gränssnitt.

Två förbehåll för de raderna. Arenapreferenssiffran i indexet är fryst vid den tidpunkt då en modell blir kvalificerad för publicering, så det är en ögonblicksbild snarare än ett löpande Elo – läs den som en betygssättning vid en given tidpunkt och inte som det live Speech Agent Arena-diagrammet. Och toppen av τ-Voice-tavlan är tät: resonemangsvariantens 68,6 % leder över GPT-Live-1 på 67,9 % (Astra-backend, medelhög ansträngning) med 0,7 punkter, med GPT-Live-1 (Sol, låg ansträngning) på 59,3 % och Grok Voice Think Fast 2.0 High på 56,5 % efter. Ledningen på 0,7 punkter över GPT-Live-1 ligger inom bruset. Gapet på 38 punkter inom detta par är det inte.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

Den andra 4x: vad resonemangsnivån kostar dig i kod

Det finns en andra fork i den här utgåvan, och den visas inte på någon resultattavla. De två modellerna är inte direkt utbytbara, eftersom resonemangsvarianten ändrar det kontrakt som din klient måste uppfylla.

På standardmodellen Gemini 3.8 Live beter sig som en Live API-klient förväntar sig: anrop till bakgrundsverktyg och API:er körs medan modellen fortsätter tala, och turnComplete: true markerar fortfarande slutet på en tur. Det finns ingen inställning för tankenivå att välja, eftersom det inte finns något separat att konfigurera – modellen svarar, och när den har svarat är turen klar.

Gemini 3.8 Live Extended Thinking förändras tre saker samtidigt:

Funktionsanrop är alltid asynkrona. En blockerande verktygsdeklaration ställer sig inte snällt i kö – den returnerar ett hårt fel. Alla verktygsscheman du har skrivit för standardmodellen måste deklareras om som icke-blockerande.

Ett nytt statusfält bär det verkliga tillståndet. Klienter måste läsa interaction_status i stället för att lita på turnComplete: fältet visar IN_PROGRESS medan modellen fortfarande resonerar eller ett verktyg fortfarande körs, och övergår till IDLE först när hela uppgiften är klar. En tur kan avslutas medan uppgiften ännu inte är klar.

Tankdjupet är en ratt. Modellen erbjuder konfigurerbara resonemangsnivåer – låg, medel och hög – och siffrorna 82,6 och 68,6 på tavlan är den (Hög)-konfigurationen. Att gå ner till låg förändrar både kvaliteten och tokenkostnaden, och inget i indexet talar om vad låg kostar dig när det gäller att slutföra uppgifter.

Den tredje punkten är migreringsfällan. Eftersom Extended Thinking svarar likadant på tråden som standardmodellen tills ett verktygsanrop är inblandat, kan ett team byta ut modell-ID:t, se en fungerande demo och först i produktion upptäcka det asynkrona kontraktet när ett bokningsverktyg returnerar ett fel i stället för ett resultat. Budgetera för klientrefaktoreringen vid sidan av 4×-ljudtaxan; i en mogen integration är den den större av de två kostnaderna.

Vilken din arbetsbelastning faktiskt efterfrågar

Det enkla sättet att avgöra är att fråga vad sessionen är till för, inte hur smart du vill att den ska vara.

Välj Gemini 3.8 Livenär samtalet är slutprodukten. Att svara, hålla en tråd, ta emot ett meddelande, kvalificera en uppringare, vara trevlig och snabb och billig. Vid 0,84 dollar per timme för inljud är den den billigaste kompetenta röstmodellen som någon för närvarande publicerar, den föredras av arenan, den är mer tillförlitlig på ytliga uppgifter, och den är 170 millisekunder snabbare till första ljudet — en skillnad en uppringare känner. Det enda att acceptera är taket: 30,1 % på slutförande av flerstegsuppgifter innebär att den inte kommer att slutföra arbete som har steg, och ingen mängd promptteknik flyttar den siffran.

Välj Gemini 3.8 Live Extended Thinking när sessionen har en uppgift. Bokning, ändring, avbokning, lösa ett kontoärende, guida en uppringare genom en process i flera steg medan de väntar. Det är 38-poängslinjen, och den är värd 3,50 dollar i timmen – vilket, notera, fortfarande är billigare än båda modellerna som den överträffar i kompositmätningen. Du får också berättarbeteendet som gör väntan dräglig: den här modellen resonerar och talar samtidigt, så i stället för tystnad medan den slår upp något hör den som ringer "Låt mig kolla det…" och framsteg allteftersom. Det är samma problem som full-duplex-arkitekturer löser genom att aldrig stoppa ljudet; Googles svar är att fortsätta prata medan arbetet pågår.

Ytterligare två rader värda att väga. Google rapporterar också 35,1 % för Extended Thinking-modellen på Sierras τ³-Banking-topplista, mot 32,0 % för GPT-Live-1 Astra – en leverantörsrapporterad siffra utan oberoende mätning bakom sig, och en nedslående sådan i absoluta tal, eftersom 35,1 % innebär att den bästa modellen på den listan misslyckas i ungefär två av tre försök med realistiska bankuppgifter. Och standardmodellens andraplats i Speech Agent Arena, som Google hänvisar till i sitt eget material, är ett verkligt resultat på en annan topplista som mäter preferens snarare än slutförande av uppgifter. Båda påståendena håller. Tillsammans säger de att den billiga modellen är mycket bra på att bli pratad med och att den dyra modellen är den enda av de två som kan tilldelas arbete.

Kör båda, utan två integrationer

Den praktiska invändningen mot allt detta är att val per arbetsbelastning innebär att underhålla två spår. Det behöver inte vara så. Båda varianterna ligger framför samma typ av backend – bakgrundskörning av verktyg och planering i flera steg löses upp i vanliga anrop till textmodeller – och det är i det lagret som din kostnadsvariation ligger och där det är billigt att byta.

OrcaRouter ger 190 modeller från en enda nyckel till leverantörens listpris utan påslag, så en leverantörs prisförändring slår igenom hos oss samma dag i stället för vid nästa avtalsförnyelse. För en stack som routar mellan en billig konversationsnivå och en dyr resonemangsnivå är de två egenskaper som spelar roll att delegeringsmålet kan bytas ut på livetrafik utan att röra röstintegrationen, och att automatisk redundansväxling håller en session vid liv när en backend ger fel eller får timeout. För att vara exakt om vad vi driftar och inte driftar: slutpunkterna Gemini 3.8 Live och Gemini 3.8 Live Extended Thinking finns inte på vår router – de kommer från Googles eget API, i Gemini API, Live API och Google AI Studio. De textmodeller som dessa agenter lämnar över sitt arbete till är mycket ofta just dessa, bland dem Gemini 3.8 Flash.

Var varje modell befinner sig på tavlan

Skärmbilden nedan togs den 16 september 2026, och överst i Speech to Speech Index står följande:

Gemini 3.8 Live Extended Thinking (High) — 82,6, första plats

• GPT-Live-1 (Astra-backend, medel ansträngning) — 81.5

• Grok Voice Think Fast 2.0 High — 81,3

• GPT-Live-1 (Sol-backend, låg insats) — 80.1

Gemini 3.8 Live — 76,0, femte plats

• GPT-Realtime-2.1 High — 73,9

• Gemini 3.1 Flash Live High — 71.5

En notering om namngivningen medan du läser den listan: (High)-suffixet som är kopplat till den här modellen i bevakningen är en etikett för konfiguration av resonemangsinsats, inte en separat utgåva. Det är samma konvention som styrelsen använder för Grok Voice Think Fast 2.0 High och GPT-Realtime-2.1 High.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Vad är fortfarande ocommittat?

En sak med det här paret är lätt att misstolka, så det är värt att säga rakt ut: ingen av modellerna är allmänt tillgänglig i kontraktuell mening, även om båda är prissatta och dokumenterade.

Utvecklare får Gemini 3.8 Live i Gemini API, Live API och Google AI Studio under ID:t gemini-3.8-live; företag får privat förhandsversion i Gemini Enterprise, med Gemini Enterprise for Customer Experience listad som kommande; konsumenter får det i Search Live. Gemini 3.8 Live Extended Thinking har samma utvecklaryta under gemini-3.8-live-extended-thinking, plus en bredare konsumentväg — Gemini Live, Docs Live för Google AI Pro- och Ultra-prenumeranter, samt Gmail Live och Keep Live för alla Google AI-prenumeranter. Workspace-företagskunder listas som kommande.

Det som saknas är det ett företag behöver innan det sätter en intäktsrad på detta: ett åtagande om allmän tillgänglighet, en publicerad drifttidssiffra och en prisnivå som Google har lovat att hålla. Priserna är publicerade, och förhandspriser har en tendens att förändras. Prototypa nu, planera för migreringen och skriv inte under ett tillgänglighetsmål som du inte har fått.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

Det beslut som det här paret faktiskt presenterar är snävare än indexet får det att verka, och det är inte en kvalitetsstege. Om din agents uppgift är att prata är den billiga modellen ingen kompromiss – den är den bättre produkten till det lägre priset, och den fyra gånger lägre kostnaden är en bonus snarare än argumentet. Om din agents uppgift är att slutföra något är resonemangsvarianten den enda av de två som över huvud taget kan ges uppgiften, och $3,50 i timmen är ett avrundningsfel mot en bokning som annars fallerar. Misstaget att undvika är att kompromissa på mitten: att betala för resonemangsdjup för en arbetsbelastning som aldrig behövde mer än ett bra samtal, vilket är vad som händer när ett team läser den sammansatta skillnaden på 6,6 punkter och aldrig scrollar ner till 38.