
Gemini 3.8 Live vs GLM-4-Voice: Vad 21 månader av röst-AI faktiskt har gett
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 459 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 183 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
GLM-4-Voice släpptes den 3 december 2024. Gemini 3.8 Live tillkännagavs den 15 september 2026. Det är 21 månader, och det är det viktigaste faktumet i den här jämförelsen – viktigare än något benchmark, eftersom det avgör vilken typ av fråga du faktiskt ställer.
Dessa två modeller är inte rivaler. Ingen som driftsätter röst i stor skala under 2026 väljer mellan dem utifrån kvalitet. Den verkliga frågan är den som GLM-4-Voice ställer och Gemini 3.8 Live inte kan svara på: vad skulle krävas för att äga detta i stället för att hyra det? Den frågan har ett verkligt svar, och det har förändrats mindre under 21 månader än man kanske förväntar sig.
Vad Google släppte, och vad Zhipu släppte
Gemini 3.8 Live är en hostad live-dialogmodell med slutna vikter. Den hanterar visuell indata i nära realtid, identifierar och växlar automatiskt mellan 97 språk som stöds mitt i en konversation och kör verktyg och API-anrop i bakgrunden medan konversationen fortsätter. Den är tillgänglig för utvecklare via Gemini API och Google AI Studio, i privat förhandsversion i Gemini Enterprise och i Search Live. Annonserad prissättning är $0,005 per minut för ljudindata och $0,018 per minut för ljudutdata via Live API; diagrammet från Artificial Analysis över kostnaden per timme för ljudindata uppskattar den oberoende till $1,50 per timme. Dess syskon, Gemini 3.8 Live Extended Thinking, toppar för närvarande samma index på 82,6, medan Gemini 3.8 Live självt ligger på 76,0.
GLM-4-Voice är Zhipu AI:s första end-to-end-talmodell, och den är en nedladdningsbar checkpoint. Den består av tre delar: en taltokeniserare byggd på en Whisper-large-v3-encoder med en vektorkvantiserad flaskhals på cirka 0,4B parametrar, en autoregressiv språkmodell (GLM-4-Voice-9B, initierad från GLM-4-9B) på cirka 9B parametrar, och en flödesmatchningsdekoder omtränad från CosyVoice. Den talar kinesiska och engelska, stöder instruktionsstyrd känsla, ton, taltempo och dialekt – däribland kantonesiska, chongqingmandarin och pekingska – och tokeniserar tal vid 12,5 Hz till en enda kodboksström på cirka 175 bps, en storleksordning lägre än typiska neurala ljudkodekar.
Måtten, sida vid sida:
• Släpps — Gemini 3.8 Live: 15 september 2026. GLM-4-Voice: 3 december 2024.
• Vikter — stängda, endast hostade kontra nedladdningsbara, Apache-2.0-kod med en anpassad viktlicens.
• Språk — 97 med byte mitt i konversationen jämfört med kinesiska och engelska.
• Vision — nästan realtidsvisuell inmatning kontra ingen.
• Verktygsanrop — bakgrundsexekvering av verktyg och API:er mitt i konversationen kontra ingen verktygskanal alls.
• Kontext — inte publicerat av Google jämfört med 8K-kontext, 4K max utdata.
• Miniminivå för egen hosting — ej tillämpligt jämfört med 32 GB RAM plus en CUDA-GPU officiellt; ungefär 12 GB VRAM vid int4.
• Vattenmärkning — SynthID på allt genererat ljud jämfört med inget beskrivet.

21 månader köpte kapacitet, inte bara kvalitet
Den enkla berättelsen är att en frontiermodell från 2026 slår en öppen checkpoint från 2024. Det gör den, och marginalen är stor — men den mer användbara observationen är att kategorin ändrade form i stället för att röra sig längs en enda axel.
I Zhipus egen tekniska rapport får GLM-4-Voice 93,6 % tal-till-text-noggrannhet på Topic-StoryCloze, 82,9 % tal-till-tal, en UTMOS-naturlighet på 4,45 och talad QA på 5,40/10 allmänt och 5,20/10 kunskap – allt egenrapporterat och icke reproducerat. Oberoende utvärdering är mer sällsynt och mindre smickrande: på VoiceBench noterar den ett totalresultat på 56,48, vilket placerar den runt 29:e av 42 i en sammanställning och 30:e av 40 i en annan, med fleromgångsförståelse beskriven som svag på båda språken. På C³-benchmarken för fleromgångsdialogförståelse landar den på 11,09 % på kinesiska och 33,22 % på engelska. VCB Bench fann att den ledde inom emotionell kontroll med 93,0 på den kinesiska SIF-delmetriken, och stark text–tal-alignering, men TELEVAL:s dialekthantering kom in på 4,57 % utan explicit instruktion.
De siffrorna beskriver en modell som är bra på vokalt uttryck och dålig på långvarig förståelse. Det är en talmodell från 2024 i en mening.
76,0 för Gemini 3.8 Live i Artificial Analysis Speech to Speech Index är ett sammansatt mått över talresonemang, agentisk prestanda, arena-preferens och uppgiftsframgångsgrad. Det är inte så att den nyare modellen är bättre på samma uppgift med en större faktor. Det är att sammansättningen nu överhuvudtaget inkluderar agentisk prestanda och uppgiftsframgång – kategorier som GLM-4-Voice inte kan tävla i eftersom den inte har någon verktygskanal. 2024 års modell poängsätts i ett spel som den aldrig byggdes för att spela.

Licensen är den delen folk hoppar över.
Om du tittar på GLM-4-Voice eftersom det är öppet, läs villkoren innan vikterna hinner laddas ner. Uppdelningen är verklig och det är lätt att misstolka:
• Code — Apache-2.0. Verkligen tillåtande.
• Vikter — en anpassad licens som kräver attribution och registrering hos Zhipu för kommersiell användning.
”Öppna vikter” och ”Apache-2.0” är inte samma påstående, och en hel del sekundär bevakning av den här modellen blandar ihop dem. Om du tänker lansera en kommersiell produkt baserad på GLM-4-Voice är registreringskravet ett juridiskt steg, inte en formalitet, och det bör ligga på den kritiska vägen. En bevakningstjänst går längre och beskriver modellen som proprietär med villkorad kommersiell användning. Hur som helst är avsaknaden av en minutbaserad faktura inte detsamma som avsaknaden av en kommersiell relation.
Kostnadsaritmetiken, ärligt gjord
Argumentet för självhosting är att en fast månadskostnad slår en kostnad per minut vid stora volymer. Det argumentet är verkligt, och det är mindre än det verkar när man räknar in vad man driftar.
GLM-4-Voice kräver officiellt 32 GB RAM och ett CUDA-grafikkort. Community-int4-kvantiseringar körs på ungefär 12 GB VRAM, cirka 10–11 GB i praktiken, vilket är RTX 3060-territorium, med ett praktiskt tak på omkring 30 sekunders tal per tur. En moln-A10 till ungefär $0,50–$1,00 per timme motsvarar någonstans mellan $350 och $700 i månaden för en kontinuerligt körande instans — innan du har betjänat en enda användare, och utan failover, utan burst-kapacitet och ingen att larma när dekodern producerar brus klockan 3 på natten.
Mot det innebär Gemini 3.8 Live till $1.50 per timme för inmatat ljud att $350 köper dig ungefär 233 timmars röst. Det är inte uppenbart sämre, och det kommer med kapacitet som du inte har avsatt. Skärningspunkten finns; den är högre än rubrikjämförelsen antyder, och den förändras beroende på om din trafik är jämn eller burstig. Burstig trafik är fallet där prissättning per minut vinner avgörande, eftersom inaktiva GPU:er faktureras exakt likadant som upptagna.
Det finns också en skillnad i vad man får för pengarna. Communityrapporter om kvantiserade driftsättningar av GLM-4-Voice anger latensen för kontinuerlig dialog till 38–120 ms, men dessa siffror kommer från artiklar snarare än från Zhipu. Latensen för Gemini 3.8 Live har inte publicerats av Google överhuvudtaget. Om låg latens är ett hårt krav har ingen av dem en siffra att planera efter – en har tredjepartsmätningar från communityn, den andra har partneromdömen och ingen siffra.

Det mellersta alternativet: äg logiken, hyr kapaciteten
Att rama in det här som egenhostat kontra hostat missar det upplägg som de flesta team faktiskt hamnar i. GLM-4-Voice har ingen verktygskanal, så alla produkter som byggs på den behöver en separat textmodell för att göra uppslagningen — vilket innebär att den egenhostade talmodellen ändå sitter framför en hostad textmodell. Beslutet om driftsättning och beslutet om kapabilitet går att separera.
Den uppdelningen är där en router gör verkligt arbete. OrcaRouter har 190 modeller bakom en enda nyckel till leverantörens listpris utan påslag, så delegeringsmålet bakom din talfront-end kan bytas ut i live-trafik utan att något byggs om, och en prissänkning uppströms når dig samma dag i stället för vid nästa förnyelse. Automatisk redundansväxling är viktigare än vanligt i en egenhostad miljö, för när din egen GPU-instans är det som har fallerat är backendmodellen fortfarande nåbar och sessionen behöver inte dö med den. Två förtydliganden, eftersom den här jämförelsen inbjuder till förvirring: vi hostar inte GLM-4-Voice, och Gemini 3.8 Live-slutpunkterna finns inte heller på vår router — de kommer från deras leverantörer. Det som finns på routern är det textlager som båda lämnar över arbete till.
Beslutet, och lärdomen under det
Välj GLM-4-Voiceom du behöver modellen på din egen hårdvara, om din trafik verkligen är jämn vid hög volym, om du enbart bygger på kinesiska eller engelska, och om du behöver modifiera modellen snarare än att anropa den. Räkna med licensregistreringen som en riktig uppgift, och förvänta dig att lösa förståelse över flera turer själv – det är modellens dokumenterade svaghet och ingen mängd finjustering kring ett utdatatak på 4K kommer att dölja det helt.
Välj Gemini 3.8 Live om dina krav omfattar vision, verktygsanrop, fler än två språk eller något trafikmönster som du skulle beskriva som spikigt. Det är en förhandsversionsmodell med opublicerade siffror för kontext och latens, vilket är en verklig planeringsrisk, men det är också den enda av de två som kan slå upp något mitt i en mening.
Den allmänna lärdomen är värd mer än båda utfallen. Tjugoen månader av röst-AI har producerat en modell som inte i första hand är en bättre röstmodell – den är ett röstgränssnitt mot en agent. Om ditt skäl att vilja ha öppna vikter var kostnad, är kalkylen närmare än den licensfria framställningen antyder. Om skälet var kontroll har det inte alls blivit en handelsvara, och GLM-4-Voice förblir ett legitimt svar på en fråga som Gemini 3.8 Live inte behandlar.
