
Gemini 3.8 live-läcka: två nya röstslugs, och varför "Live Extended Thinking" spelar större roll
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Två strängar som inte förekommer i någon publicerad dokumentation dök upp den här veckan på en GCP-kvotsida: Gemini 3.8 Live, och något som kallas Live Extended Thinking. De upptäcktes av release-spårningskontot @testingcatalog och publicerades den 15 september, med den raka brasklappen att ingen av dem är offentlig. Det är hela det offentliga underlaget så här långt – inget modellkort, ingen prisrad, ingen post i API:ets ändringslogg, ingen bekräftelse. Men de två namnen ligger i slutet av en mycket tydlig linje. Gemini 3.1 Flash Live är fortfarande modellen som företagets egen dokumentation rekommenderar för Live API-arbete, Gemini 3.5 Live och Gemini 3.5 Live Experimental anlände den 26 augusti som Gemini Audio-familjen, och textsidan av samma familj – Gemini 3.8 Flash – har varit tillgänglig sedan den 2 september. En ”3.8 Live” skulle täppa till det gapet. Den andra sluggen är den intressantare av de två.
Etiketter först, för en läckageartikel lever eller dör med dem. Det här är inte en lansering. Ingen av arbetsnamnen har tillkännagivits, dokumenterats, prissatts eller bekräftats av Google, och källan är ett enda konto som bevakar släpp. Allt nedan om specifikt Gemini 3.8 Live och Live Extended Thinking är overifierat. Allt nedan om modeller som redan är släppta — Gemini 3.1 Flash Live, Gemini 3.5 Live, Gemini 3.8 Flash — är dokumenterat och kontrollerbart, och jag har markerat vilket som är vilket genomgående.
Vad signalen säger, och vad den inte gör
• Rapporterat – två slugs, ”Gemini 3.8 Live” och ”Live Extended Thinking”, som förekommer på en kvotsida för Google Cloud, publicerat den 15 september med noteringen att de ”inte är offentliga”
• Inte rapporterat – ett tillkännagivande, ett modellkort, ett pris, ett kontextfönster, ett releasedatum, ett API-id, en benchmark-siffra eller någon bekräftelse från Google
• Bekräftelse – ingen i skrivande stund. Googles Gemini API-modellsida, senast uppdaterad den 4 september, listar exakt två konversationella Live-modeller, gemini-3.1-flash-live-preview och gemini-3.5-live-translate-preview, och ingen av dem har en variant av "Live Extended Thinking"
• Samma brief, separat påstående — samma inlägg från 15 september förutspådde också att Grok 4.7 "borde landa nära Opus 5.0, inte 5.1" och att dess multimodala arbete "fortfarande kräver arbete." Det är en annan leverantörs modell och en prognos snarare än en artefakt; det nämns här endast för att källan ska vara fullständig.
• Namnets egen innebörd — Googles Cloud-kvotposter är per modell-SKU:er, vilket talar för en debiterbar API-modell snarare än en funktion i Gemini-appen för konsumenter. Det är en slutsats utifrån den yta som strängen förekom på, inte ett bekräftat faktum

Varför en kvotsida är platsen där en modell läcker först
Den här delen är värd att förstå, eftersom den förklarar varför en tvåordsartefakt förtjänar en hel artikel. Kvotsidor är inte marknadsföringsytor. De är fakturerings- och hastighetsbegränsningsinfrastruktur: varje modell som en Cloud-kund kan anropa behöver en kvotpost per projekt innan den första betalande begäran betjänas, och dessa poster etableras genom samma ingenjörsarbete som gör en modell redo för allmän tillgänglighet. Att en slug dyker upp där betyder att någon har byggt infrastrukturen för en SKU – inte att någon har skrivit ett pressmeddelande.
Det kan slå åt båda hållen, och den ärliga tolkningen är den försiktiga. En kvotpost har kommit längre än ett kodnamn i en forskningsartikel, eftersom den antyder en avsedd kundvänd yta. Det är också precis den sorts sak som skapas, testas och i tysthet byter namn före lansering. Textdelen av den här familjen har rört sig tillräckligt snabbt för att göra det konkret: Gemini 3.6 Flash landade den 21 juli, Gemini 3.7 Flash den 13 augusti och Gemini 3.8 Flash den 2 september – tre Flash-släpp på sex veckor. En modellinje som itererar så snabbt är en modellinje som tar fram fler SKU:er än den släpper under de namnen.
Live-serien har legat en version efter
Här är vad som gör "Gemini 3.8 Live" till en riktig historia snarare än en namnkuriösitet: Googles röstmodeller har inte alls hängt med dess textmodeller.
• Rekommenderad Live API-modell idag — gemini-3.1-flash-live-preview, senaste uppdateringen mars 2026, fortfarande beskriven i Googles egna dokumentation som modellen att använda för alla användningsområden inom Live API
• Dess gränser – 131 072 indatatokens och 65 536 utdatatokens, tar in text, bilder, ljud och video och skickar ut text och ljud
• Gemini Audio-familjen, som tillkännagavs den 26 augusti — Gemini 3.5 Live, Gemini 3.5 Live Experimental och Gemini 3.5 Transcribe, där Transcribe-modellerna ersätter Chirp 3 för tal-till-text
• Under tiden gick textlinjen — Gemini 3.5 Flash, Gemini 3.6 Flash, Gemini 3.7 Flash och Gemini 3.8 Flash — igenom fyra offentliga versioner under ungefär samma tidsfönster

Så ljudlinjen ligger på 3.5-generationen medan textlinjen ligger på 3.8. En "Gemini 3.8 Live"-slug är det första beviset på att Google avser att sätta tillbaka rösten på samma generation som texten – vilket, för den som bygger en röstagent, innebär att resonemanget under en Live-session skulle kunna hoppa tre textmodellsgenerationer på en gång i stället för en.
Varför "Live Extended Thinking" är den mer intressanta sluggen
I dag är tänkandet i en Gemini Live-modell ett vred, inte en modell. Live-API:et exponerar en thinkingLevel-parameter med fyra inställningar – minimal, låg, medium och hög – och standardvärdet är minimal, valt uttryckligen för att optimera för lägsta latens. Det standardvärdet berättar vad produkten är till för: en konversation där en paus är en bugg.
En separat slug som kallas "Live Extended Thinking" antyder att Google förbereder att dela upp det i två produkter i stället för ett enda reglage, och resonemanget är enkelt. Latens och eftertanke står i direkt konflikt med varandra i en röstmodell – man kan inte både svara direkt och tänka ordentligt innan man svarar – så en enda modell med en växlingsfunktion tvingar varje anropare att välja en punkt på den skalan för varje begäran. Två SKU:er gör att en kund kan routa den snabba vägen (avbrottshantering, barge-in, snabba uppslagningar) och den långsamma vägen (en röstagent som arbetar sig igenom en uppgift i flera steg) till slutpunkter med olika trimning, utan att den ena försämrar den andra.
Precedenten finns redan inom Googles egen lansering i augusti. Gemini 3.5 Live Experimental beskrevs som varianten som kan "resonera direkt medan den talar" och berätta om sina framsteg steg för steg under en uppgift — en uttalat tänkandepräglad röstmodell, släppt med ett eget id i stället för som en inställning. "Live Extended Thinking" låter som att den instinkten tar steget från en experimentell etikett till en namngiven produkt. Det är en slutledning från en sträng, och det är en slutledning — men det är den sort som just den här linjen har belönat förut.
Vad du faktiskt kan ringa idag
Inget här förändrar vad du kan nå just nu, och det är värt att vara rak om det. Det finns ingen Gemini 3.8 Live-slutpunkt att anropa, ingen inställning för Live Extended Thinking att slå på, och inget sätt att köpa åtkomst till någon av dem. Varje konto som i dag säljer "Gemini 3.8 Live access" säljer en etikett, inte en modell. De Live-modeller du verkligen kan använda är gemini-3.1-flash-live-preview och gemini-3.5-live-translate-preview, båda i förhandsversion via Googles eget API.
Textsidan är en annan historia, och det är den del som faktiskt är routbar. Gemini 3.8 Flash – släpptes den 2 september för 0,75 dollar per miljon input-tokens och 3,75 dollar per miljon output-tokens enligt Googles eget listpris, med planerad fördubbling till 1,50 och 7,50 dollar den 1 januari 2027 – körs på OrcaRouter till samma listpris, med 0 % påslag ovanpå. Pass-through-prissättning spelar större roll än vanligt för en modell med en förannonserad höjning: när januarisiffran träder i kraft ändras den här samma dag, utan ett andra avtal att omförhandla och utan någon kodändring att göra.

Röstlinjen finns inte på OrcaRouter i dag – ingen Live-SKU och ingen native-audio-SKU gör det, från någon leverantör – så inget här bör läsas som att vi är värd för den. Vad ett routningslager verkligen är användbart för är den andra halvan av den här historien. När en Live-modell av 3.8-generationen väl landar, och när en andra, tänkande variant landar vid sidan av den, blir valet mellan en snabb röstväg och en som överväger ett routningsbeslut i stället för en omskrivning: två slutpunkter bakom en nyckel, med automatisk failover om det förhandsgransknings-ID du byggde mot dras tillbaka. På en linje som redan har bytt namn en gång i år är det inte hypotetiskt.
Vad skulle bekräfta detta – och vad skulle döda det
En läckartikel bör berätta hur den skulle kunna vara fel. För Gemini 3.8 Live och Live Extended Thinking är de bekräftande bevisen specifika och kontrollerbara:
• Kvotposten som blir offentlig — samma slug som dyker upp i en modellista för Google Cloud eller Vertex AI med en kopplad hastighetsbegränsning, i stället för bara i en skärmbild
• Ett changelog-inlägg för Gemini API eller en rad på modellsidan, som för närvarande slutar vid gemini-3.1-flash-live-preview och gemini-3.5-live-translate-preview
• Ett DeepMind-modellkort — ljudmodellerna från augusti dokumenterades där som "Gemini 3.5 Audio" trots att rapporteringen kallade dem Live och Transcribe, så kortet är artefakten som fastställer ett namn
• En prisrad, vilket är det enda som förvandlar en förberedd SKU till en produkt som någon kan köpa
• Desbekräftelse – att sluggarna byter namn, införlivas i den befintliga modellens tänkandeinställningar eller helt enkelt aldrig dyker upp igen. Alla tre är vanliga utfall för en kvotsida, och vilket som helst av dem innebär att den här texten var tidig snarare än rätt
Vad man bör bevaka, och vem som bör agera
Om du bygger en röstagent på Live API behöver ingenting i din arkitektur ändras den här veckan – modellen du skulle bygga på är fortfarande gemini-3.1-flash-live-preview, och det ärliga rådet är att hålla modell-id:t bakom ett konfigvärde och hålla en andra Live-endpoint varm, eftersom den här linjen redan har bytt namn en gång och kan göra det igen. Om du väljer en textmodell är den här läckan irrelevant för dig; Gemini 3.8 Flash släpps, är prissatt och mätbar nu, och den mer användbara frågan är prisändringen i januari snarare än en röst-slug.
Det man faktiskt bör hålla ögonen på är inte lanseringen. Det är huruvida "Live Extended Thinking" kommer som en andra modell eller som en femte inställning på den första modellen. Om det är en separat SKU säger Google till utvecklare att en röstagent som tänker och en röstagent som talar är olika produkter – och det är ett påstående med större konsekvenser än något versionsnummer i namnet.
Vad ett routinglager verkligen är användbart för är den andra halvan av den här historien.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
