Hero-titelkaart voor Gemini 3.8 Live vs GLM-4-Voice met de kicker 'OrcaRouter · modelradar — head to head' en de ondertitel 'Wat 21 maanden voice-AI werkelijk heeft opgeleverd.' Op twee kaarten staat 'Gemini 3.8 Live — sep 2026, gehost, tools, 97 talen' en 'GLM-4-Voice — dec 2024, open weights, 9B, Chinees en Engels', met chips voor 21 maanden verschil, Apache-2.0-code en een licentie voor aangepaste gewichten. Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

Gemini 3.8 Live vs GLM-4-Voice: Wat 21 maanden spraak-AI daadwerkelijk hebben opgeleverd

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

GLM-4-Voice is op 3 december 2024 uitgebracht. Gemini 3.8 Live werd aangekondigd op 15 september 2026. Dat is 21 maanden, en het is het belangrijkste feit in deze vergelijking — belangrijker dan welke benchmark dan ook, omdat het bepaalt wat voor soort vraag je eigenlijk stelt.

Deze twee modellen zijn geen rivalen. Niemand die in 2026 spraak op schaal inzet, kiest tussen hen op basis van kwaliteit. De echte vraag is degene die GLM-4-Voice stelt en Gemini 3.8 Live niet kan beantwoorden: wat zou ervoor nodig zijn om dit te bezitten in plaats van te huren? Die vraag heeft een echt antwoord, en dat is in 21 maanden minder veranderd dan je misschien zou verwachten.

Wat Google uitbracht, en wat Zhipu uitbracht

Gemini 3.8 Live is een gehost live-dialoogmodel met gesloten gewichten. Het verwerkt bijna realtime visuele input, detecteert automatisch 97 ondersteunde talen en schakelt automatisch midden in het gesprek daartussen over, en voert tools en API-aanroepen op de achtergrond uit terwijl het gesprek doorgaat. Het is beschikbaar voor ontwikkelaars via de Gemini API en Google AI Studio, in private preview in Gemini Enterprise en in Search Live. De aangekondigde prijsstelling is $0,005 per minuut audio-invoer en $0,018 per minuut audio-uitvoer via de Live API; de grafiek van Artificial Analysis voor kosten per uur aan audio-invoer komt onafhankelijk uit op $1,50 per uur. Het zustermodel, Gemini 3.8 Live Extended Thinking, voert diezelfde index momenteel aan met 82,6, terwijl Gemini 3.8 Live zelf op 76,0 staat.

GLM-4-Voice is het eerste end-to-end spraakmodel van Zhipu AI, en het is een downloadbare checkpoint. Het is een samenstelling van drie delen: een spraaktokenizer gebouwd op een Whisper-large-v3-encoder met een vector-gekwantiseerde bottleneck van ongeveer 0,4B parameters, een autoregressief taalmodel (GLM-4-Voice-9B, geïnitialiseerd vanuit GLM-4-9B) met ongeveer 9B parameters, en een flow-matching-decoder die opnieuw is getraind op basis van CosyVoice. Het spreekt Chinees en Engels, ondersteunt via instructies aangestuurde emotie, toon, spreeksnelheid en dialect — waaronder Kantonees, Chongqing-Mandarijn en Pekingse spraak — en tokeniseert spraak op 12,5 Hz tot één enkele codebook-stream van ongeveer 175 bps, een orde van grootte lager dan typische neurale audiocodecs.

De afmetingen, naast elkaar:

• Release — Gemini 3.8 Live: 15 september 2026. GLM-4-Voice: 3 december 2024.

• Gewichten — gesloten, alleen gehost vs. downloadbaar, Apache-2.0-code met een aangepaste gewichtenlicentie.

• Talen — 97 met wisselen midden in het gesprek vs Chinees en Engels.

• Vision — bijna realtime visuele invoer versus geen.

• Tool calling — uitvoering van achtergrondtools en API's midden in een gesprek versus helemaal geen toolkanaal.

• Context — niet door Google gepubliceerd vs 8K-context, 4K maximale uitvoer.

• Drempel voor self-hosting — niet van toepassing vs. officieel 32 GB RAM plus een CUDA-GPU; ongeveer 12 GB VRAM bij int4.

• Watermerken — SynthID op alle gegenereerde audio versus geen enkele beschreven.

A two-column scoreboard comparing Gemini 3.8 Live and GLM-4-Voice. Released Sep 15 2026 vs Dec 3 2024; weights closed and hosted vs open with a custom licence; languages 97 vs Chinese and English; tool calling background execution vs none; self-host floor not applicable vs 32 GB RAM plus a GPU or about 12 GB VRAM at int4; cost $1.50 per hour of input audio vs no per-minute bill. Footer reads 'GLM-4-Voice VoiceBench and UTMOS figures self-reported or third-party, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

21 maanden kocht capaciteit, niet alleen kwaliteit

Het gemakkelijkste verhaal is dat een frontiermodel uit 2026 een open checkpoint uit 2024 verslaat. Dat is ook zo, en de marge is groot — maar de nuttigere observatie is dat de categorie van vorm veranderde in plaats van zich langs één as te bewegen.

In het eigen technische rapport van Zhipu scoort GLM-4-Voice 93,6% nauwkeurigheid voor spraak-naar-tekst op Topic-StoryCloze, 82,9% voor spraak-naar-spraak, een UTMOS-naturaliteit van 4,45, en gesproken QA van 5,40/10 algemeen en 5,20/10 kennis — allemaal zelfgerapporteerd en niet gereproduceerd. Onafhankelijke evaluatie is schaarser en minder flatteus: op VoiceBench noteert het een algemene score van 56,48, waarmee het in de ene rangschikking rond de 29e plaats van 42 staat en in een andere op de 30e van 40, waarbij meerbeurtig begrip in beide talen als zwak wordt beschreven. Op de C³-benchmark voor meerbeurtig dialoogbegrip komt het uit op 11,09% in het Chinees en 33,22% in het Engels. VCB Bench constateerde dat het vooropliep op emotionele beheersing met 93,0 op de Chinese SIF-submetriek, en dat het een sterke tekst-spraakafstemming had, maar de dialectverwerking van TELEVAL kwam uit op 4,57% zonder expliciete instructie.

Die cijfers beschrijven een model dat goed is in vocale expressie en slecht in volgehouden begrip. Dat is een spraakmodel uit 2024 in één zin.

De 76,0 van Gemini 3.8 Live op de Speech to Speech Index van Artificial Analysis is een samengestelde score over spraakredenering, agentische prestaties, arena-voorkeur en taaksuccespercentage. Het is niet zo dat het nieuwere model bij dezelfde taak met een grotere factor beter presteert. Het is dat de samengestelde score nu überhaupt agentische prestaties en taaksucces meeneemt — categorieën waarin GLM-4-Voice niet kan concurreren, omdat het geen toolkanaal heeft. Het model uit 2024 wordt beoordeeld op een spel waarvoor het nooit is gebouwd.

Screenshot of the OrcaRouter models catalogue, showing hosted models listed with provider names and per-million-token pricing behind a single API key.

De licentie is het onderdeel dat mensen overslaan.

Als je naar GLM-4-Voice kijkt omdat het open is, lees dan de voorwaarden voordat het downloaden van de gewichten is voltooid. De tweedeling is reëel en het is makkelijk om die verkeerd te interpreteren:

• Code — Apache-2.0. Echt permissief.

• Gewichten — een aangepaste licentie die naamsvermelding en registratie bij Zhipu vereist voor commercieel gebruik.

"Open weights" en "Apache-2.0" zijn niet dezelfde bewering, en veel secundaire berichtgeving over dit model haalt ze door elkaar. Als je van plan bent een commercieel product op GLM-4-Voice uit te brengen, is de registratievereiste een juridische stap, niet een formaliteit, en die zou op het kritieke pad moeten staan. Eén tracker gaat verder en beschrijft het model als propriëtair met voorwaardelijk commercieel gebruik. Hoe dan ook, de afwezigheid van een rekening per minuut is niet de afwezigheid van een commerciële relatie.

De kostenberekening, eerlijk gemaakt

Het argument voor zelfhosting is dat een vaste maandelijkse kostenpost bij volume wint van een per-minuuttarief. Dat argument is reëel, en het is kleiner dan het lijkt zodra je meetelt wat je draaiende houdt.

GLM-4-Voice wil officieel 32 GB RAM en een CUDA-GPU. Community-int4-quantisaties draaien in ongeveer 12 GB VRAM, in de praktijk zo'n 10–11 GB, wat het terrein van een RTX 3060 is, met een praktisch plafond van ongeveer 30 seconden spraak per beurt. Een cloud-A10 van ongeveer $0,50–$1,00 per uur komt neer op ergens tussen $350 en $700 per maand voor een continu draaiende instance — nog voordat je één enkele gebruiker hebt bediend, en zonder failover, zonder burstcapaciteit, en zonder iemand om te alarmeren wanneer de decoder om 3 uur 's nachts ruis produceert.

Daar staat tegenover dat Gemini 3.8 Live tegen $1,50 per uur aan audio-invoer betekent dat $350 je ongeveer 233 uur aan spraak oplevert. Dat is niet duidelijk slechter, en het gaat gepaard met capaciteit die je niet hebt geprovisioneerd. Het omslagpunt bestaat; het ligt hoger dan de vergelijking in de kop suggereert, en het verschuift afhankelijk van of je verkeer gelijkmatig of bursty is. Bursty verkeer is het geval waarin prijsstelling per minuut beslissend wint, omdat voor inactieve GPU's exact hetzelfde in rekening wordt gebracht als voor bezette.

Er is ook een verschil in wat je voor je geld krijgt. Communityrapporten over gequantiseerde GLM-4-Voice-implementaties stellen de latentie bij continue dialoog op 38–120 ms, hoewel die cijfers uit artikelen komen en niet van Zhipu. De latentie van Gemini 3.8 Live is door Google helemaal niet gepubliceerd. Als lage latentie een harde eis is, heeft geen van beide een getal waarop je kunt plannen — de een heeft metingen van derden uit de community, de ander heeft getuigenissen van partners en geen cijfer.

Screenshot of Google's official blog post titled 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated Sep 15, 2026 and credited to Tom Ouyang and Malini Jaganathan of the Gemini Audio Team, with the summary describing the models as Google's most advanced live dialogue models with major upgrades in intelligence and parallel reasoning.

De middenweg: de logica bezitten, de capaciteit huren

Als je dit framet als zelf hosten versus gehost, mis je de opzet waarin de meeste teams uiteindelijk terechtkomen. GLM-4-Voice heeft geen toolkanaal, dus elk product dat erop is gebouwd heeft een apart tekstmodel nodig om het opzoekwerk te doen — wat betekent dat het zelfgehoste spraakmodel hoe dan ook vóór een gehost tekstmodel komt te staan. De deploymentbeslissing en de beslissing over de mogelijkheden staan los van elkaar.

Die splitsing is waar een router echt werk verricht. OrcaRouter draagt 190 modellen achter één enkele sleutel tegen de catalogusprijs van de provider, zonder opslag, zodat het delegatiedoel achter je spraakfront-end kan worden verwisseld in liveverkeer zonder dat je iets hoeft om te bouwen, en een prijsverlaging van een upstream-partij je dezelfde dag bereikt in plaats van bij de volgende verlenging. Automatische failover is belangrijker dan gebruikelijk in een self-hosted opstelling, want wanneer je eigen GPU-instantie het ding is dat omvalt, blijft het backendmodel nog steeds bereikbaar en hoeft de sessie niet daarmee te sneuvelen. Twee ophelderingen, aangezien deze vergelijking tot verwarring leidt: wij hosten GLM-4-Voice niet, en de Gemini 3.8 Live-endpoints staan ook niet op onze router — die komen van hun leveranciers. Wat wél op de router staat, is de tekstlaag waaraan beide partijen werk overdragen.

De beslissing, en de les eronder

Kies GLM-4-Voice als je het model op je eigen hardware nodig hebt, als je verkeer echt stabiel is bij een hoog volume, als je alleen in het Chinees of Engels bouwt, en als je het model moet aanpassen in plaats van het aan te roepen. Begroot de licentieregistratie als een echte taak, en verwacht dat je meerbeurtige begrip zelf oplost — het is het gedocumenteerde zwakke punt van het model en geen enkele mate van fine-tuning rond een uitvoerplafond van 4K zal dat volledig verbergen.

Kies Gemini 3.8 Live als je vereisten beeldherkenning, het aanroepen van tools, meer dan twee talen of een verkeerspatroon met pieken omvatten. Het is een previewmodel met niet-gepubliceerde cijfers voor context en latentie, wat een reëel planningsrisico is, maar het is ook de enige van de twee die iets midden in een zin kan opzoeken.

De algemene les is meer waard dan beide conclusies afzonderlijk. Eenentwintig maanden spraak-AI hebben een model opgeleverd dat niet in de eerste plaats een beter spraakmodel is — het is een spraakinterface naar een agent. Als je reden om open weights te willen kosten was, ligt de rekensom dichter bij elkaar dan de licentievrije framing suggereert. Als je reden controle was, dan is die helemaal niet gecommoditiseerd, en GLM-4-Voice blijft een legitiem antwoord op een vraag die Gemini 3.8 Live niet behandelt.