
Gemini 3.8 Live vs. GLM-4-Voice: Was 21 Monate Voice-KI tatsächlich gebracht haben
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 459 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 183 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
GLM-4-Voice wurde am 3. Dezember 2024 veröffentlicht. Gemini 3.8 Live wurde am 15. September 2026 angekündigt. Das sind 21 Monate, und das ist die wichtigste Tatsache in diesem Vergleich – wichtiger als jeder Benchmark, denn sie bestimmt, welche Art von Frage man eigentlich stellt.
Diese beiden Modelle sind keine Konkurrenten. Niemand, der 2026 Voice im großen Maßstab einsetzt, entscheidet anhand der Qualität zwischen ihnen. Die eigentliche Frage ist die, die GLM-4-Voice aufwirft und Gemini 3.8 Live nicht beantworten kann: Was wäre nötig, um das zu besitzen, statt es zu mieten? Diese Frage hat eine echte Antwort, und sie hat sich in 21 Monaten weniger verändert, als man erwarten würde.
Was Google ausgeliefert hat, und was Zhipu ausgeliefert hat
Gemini 3.8 Live ist ein gehostetes Live-Dialogmodell mit geschlossenen Gewichten. Es verarbeitet visuelle Eingaben nahezu in Echtzeit, erkennt und wechselt während eines Gesprächs automatisch zwischen 97 unterstützten Sprachen und führt Tools und API-Aufrufe im Hintergrund aus, während das Gespräch weiterläuft. Es ist für Entwickler über die Gemini API und Google AI Studio verfügbar, in der privaten Vorschau in Gemini Enterprise und in Search Live. Die angekündigte Preisgestaltung beträgt 0,005 $ pro Minute für Audioeingabe und 0,018 $ pro Minute für Audioausgabe über die Live API; das Diagramm von Artificial Analysis zu den Kosten pro Stunde für Audioeingabe beziffert es unabhängig auf 1,50 $ pro Stunde. Sein Schwestermodell, Gemini 3.8 Live Extended Thinking, führt derzeit denselben Index mit 82,6 an, während Gemini 3.8 Live selbst bei 76,0 liegt.
GLM-4-Voice ist das erste End-to-End-Sprachmodell von Zhipu AI und ein herunterladbarer Checkpoint. Es setzt sich aus drei Teilen zusammen: einem Sprach-Tokenizer, der auf einem Whisper-large-v3-Encoder mit einem vektorquantisierten Bottleneck bei rund 0,4 Mrd. Parametern aufbaut, einem autoregressiven Sprachmodell (GLM-4-Voice-9B, initialisiert aus GLM-4-9B) mit etwa 9 Mrd. Parametern und einem Flow-Matching-Decoder, der von CosyVoice aus neu trainiert wurde. Es spricht Chinesisch und Englisch, unterstützt instruktionsgesteuerte Emotion, Tonlage, Sprechgeschwindigkeit und Dialekt – darunter Kantonesisch, Chongqing-Mandarin und Pekinger Mundart – und tokenisiert Sprache mit 12,5 Hz in einen einzelnen Codebook-Stream mit etwa 175 Bit/s, eine Größenordnung niedriger als bei typischen neuronalen Audiocodecs.
Die Abmessungen, Seite an Seite:
• Veröffentlichung — Gemini 3.8 Live: 15. September 2026. GLM-4-Voice: 3. Dezember 2024.
• Gewichte — geschlossen, nur gehostet vs. herunterladbar, Apache-2.0-Code mit einer eigenen Lizenz für die Gewichte.
• Sprachen — 97 mit Wechsel mitten im Gespräch gegenüber Chinesisch und Englisch.
• Vision — visuelle Eingabe nahezu in Echtzeit vs. keine.
• Tool-Aufruf — Hintergrund-Ausführung von Tools und APIs mitten im Gespräch vs. überhaupt kein Tool-Kanal.
• Kontext – nicht von Google veröffentlicht vs. 8K Kontext, 4K maximale Ausgabe.
• Mindestvoraussetzung für Self-Hosting — nicht zutreffend vs. offiziell 32 GB RAM plus eine CUDA-GPU; bei int4 etwa 12 GB VRAM.
• Wasserzeichnung — SynthID bei allen generierten Audiodaten vs. keine beschrieben.

21 Monate erkauften Leistungsfähigkeit, nicht nur Qualität
Die einfache Geschichte ist, dass ein Frontier-Modell von 2026 einen offenen Checkpoint von 2024 schlägt. Das tut es, und der Abstand ist groß – aber die nützlichere Beobachtung ist, dass sich die Kategorie in ihrer Form verändert hat, statt sich entlang einer einzigen Achse zu bewegen.
In dem eigenen technischen Bericht von Zhipu erzielt GLM-4-Voice 93,6 % Sprach-zu-Text-Genauigkeit bei Topic-StoryCloze, 82,9 % bei Sprach-zu-Sprach, eine UTMOS-Natürlichkeit von 4,45 und bei gesprochener QA 5,40/10 im Allgemeinen sowie 5,20/10 im Wissensbereich – alles selbst berichtet und nicht reproduziert. Unabhängige Evaluierung ist seltener und weniger schmeichelhaft: Bei VoiceBench verzeichnet es insgesamt 56,48, womit es in einer Aufstellung etwa Platz 29 von 42 und in einer anderen Platz 30 von 40 belegt, wobei das Mehrrunden-Verständnis in beiden Sprachen als schwach beschrieben wird. Beim C³-Benchmark für mehrrundiges Dialogverständnis landet es bei 11,09 % auf Chinesisch und 33,22 % auf Englisch. VCB Bench ergab, dass es bei der emotionalen Kontrolle mit 93,0 in der chinesischen SIF-Teilmetrik führend war und eine starke Text-Sprache-Ausrichtung aufwies, doch die Dialektverarbeitung bei TELEVAL kam ohne explizite Anweisung auf 4,57 %.
Diese Zahlen beschreiben ein Modell, das gut im stimmlichen Ausdruck und schlecht im anhaltenden Verständnis ist. Das ist ein Sprachmodell aus dem Jahr 2024 in einem Satz.
Der Wert von 76,0, den Gemini 3.8 Live im Speech to Speech Index von Artificial Analysis erzielt, ist ein zusammengesetzter Wert aus Sprachschlussfolgerung, agentischer Leistung, Arena-Präferenz und Aufgaben-Erfolgsrate. Es ist nicht so, dass das neuere Modell bei derselben Aufgabe um ein größeres Vielfaches besser ist. Es ist vielmehr so, dass der zusammengesetzte Wert nun überhaupt agentische Leistung und Aufgabenerfolg einbezieht – Kategorien, in denen GLM-4-Voice nicht konkurrieren kann, weil es über keinen Tool-Kanal verfügt. Das Modell aus 2024 wird anhand eines Spiels bewertet, für das es nie gebaut wurde.

Die Lizenz ist der Teil, den die Leute überspringen
Wenn du dir GLM-4-Voice ansiehst, weil es offen ist, lies die Bedingungen, bevor die Gewichte fertig heruntergeladen sind. Die Spaltung ist real, und es ist leicht, sie falsch zu verstehen:
• Code — Apache-2.0. Wirklich permissiv.
• Gewichte — eine individuelle Lizenz, die Namensnennung und Registrierung bei Zhipu für die kommerzielle Nutzung erfordert.
„Open Weights“ und „Apache-2.0“ sind nicht dieselbe Aussage, und in vielen Sekundärberichten über dieses Modell wird beides vermengt. Wenn Sie ein kommerzielles Produkt auf Basis von GLM-4-Voice ausliefern wollen, ist die Registrierungspflicht ein rechtlicher Schritt, keine Formsache, und sie sollte auf dem kritischen Pfad stehen. Ein Tracker geht noch weiter und beschreibt das Modell als proprietär mit bedingter kommerzieller Nutzung. So oder so: Das Fehlen einer Minutenabrechnung bedeutet nicht, dass keine Geschäftsbeziehung besteht.
Die Kostenarithmetik, ehrlich gerechnet
Das Argument für Self-Hosting ist, dass feste monatliche Kosten bei hohem Volumen eine Abrechnung pro Minute schlagen. Dieses Argument ist berechtigt, und es ist kleiner, als es aussieht, sobald man mitzählt, was man selbst betreibt.
GLM-4-Voice verlangt offiziell 32 GB RAM und eine CUDA-GPU. Community-Int4-Quantisierungen laufen mit ungefähr 12 GB VRAM, in der Praxis etwa 10–11 GB, was in den Bereich einer RTX 3060 fällt, mit einer praktischen Obergrenze von rund 30 Sekunden Sprache pro Turn. Eine Cloud-A10 für ungefähr 0,50–1,00 $ pro Stunde entspricht irgendwo zwischen 350 und 700 $ im Monat für eine durchgehend laufende Instanz – bevor Sie auch nur einen einzigen Nutzer bedient haben, und ohne Failover, ohne Burst-Kapazität und ohne jemanden, den man alarmieren kann, wenn der Decoder um 3 Uhr morgens Rauschen erzeugt.
Dem steht gegenüber, dass Gemini 3.8 Live bei 1,50 $ pro Stunde für eingehendes Audio bedeutet, dass man für 350 $ ungefähr 233 Stunden Stimme bekommt. Das ist nicht offensichtlich schlechter und bringt Kapazität mit, die Sie nicht bereitgestellt haben. Der Schnittpunkt existiert; er liegt höher, als der Schlagzeilenvergleich nahelegt, und er verschiebt sich je nachdem, ob Ihr Verkehr gleichmäßig oder stoßweise ist. Stoßweiser Verkehr ist der Fall, in dem die Abrechnung pro Minute klar gewinnt, weil untätige GPUs exakt genauso abgerechnet werden wie ausgelastete.
Es gibt außerdem einen Unterschied darin, was man für sein Geld bekommt. Community-Berichte über quantisierte GLM-4-Voice-Deployments beziffern die Latenz bei kontinuierlichem Dialog auf 38–120 ms, wobei diese Werte aus Erfahrungsberichten und nicht von Zhipu stammen. Die Latenz von Gemini 3.8 Live wurde von Google überhaupt nicht veröffentlicht. Wenn niedrige Latenz für Sie eine harte Anforderung ist, hat keines von beiden eine Zahl, mit der Sie planen können – das eine hat Community-Messungen von Drittanbietern, das andere hat Partner-Testimonials und keine Zahl.

Die mittlere Option: die Logik besitzen, die Fähigkeit mieten
Die Einordnung als Selbsthosting versus gehostet verfehlt die Konstellation, in der die meisten Teams tatsächlich landen. GLM-4-Voice hat keinen Tool-Kanal, daher braucht jedes darauf aufbauende Produkt ein separates Textmodell zum Nachschlagen – was bedeutet, dass das selbst gehostete Sprachmodell so oder so vor einem gehosteten Textmodell sitzt. Die Entscheidung über das Deployment und die Entscheidung über die Fähigkeiten sind voneinander trennbar.
Diese Trennung ist der Punkt, an dem ein Router echte Arbeit leistet. OrcaRouter führt 190 Modelle hinter einem einzigen Schlüssel zum Listenpreis der Anbieter, ohne Aufschlag, sodass das Delegationsziel hinter Ihrem Sprach-Frontend im laufenden Verkehr ausgetauscht werden kann, ohne irgendetwas neu aufzubauen, und eine Preissenkung seitens der Upstream-Anbieter Sie noch am selben Tag erreicht statt erst bei der nächsten Verlängerung. Automatisches Failover ist in einem selbst gehosteten Setup wichtiger als sonst, denn wenn Ihre eigene GPU-Instanz ausgefallen ist, bleibt das Backend-Modell weiterhin erreichbar und die Sitzung muss nicht mit ihr sterben. Zwei Klarstellungen, da dieser Vergleich zu Verwechslungen einlädt: Wir hosten GLM-4-Voice nicht, und die Endpunkte von Gemini 3.8 Live sind ebenfalls nicht auf unserem Router – diese stammen von ihren Anbietern. Was auf dem Router liegt, ist die Textebene, an die beide Arbeit abgeben.
Die Entscheidung und die Lehre darunter
Wählen Sie GLM-4-Voice, wenn Sie das Modell auf Ihrer eigenen Hardware benötigen, wenn Ihr Datenverkehr wirklich konstant hoch ist, wenn Sie ausschließlich für Chinesisch oder Englisch entwickeln und wenn Sie das Modell verändern müssen, statt es aufzurufen. Planen Sie die Lizenzregistrierung als echte Aufgabe ein, und rechnen Sie damit, das Verständnis über mehrere Gesprächsrunden hinweg selbst lösen zu müssen – das ist der dokumentierte Schwachpunkt des Modells, und keine noch so aufwendige Feinabstimmung im Rahmen einer Obergrenze von 4K Ausgabe wird das vollständig verbergen können.
Wählen Sie Gemini 3.8 Live, wenn Ihre Anforderungen Vision, Tool-Aufrufe, mehr als zwei Sprachen oder ein Traffic-Muster umfassen, das Sie als sprunghaft bezeichnen würden. Es ist ein Vorschaumodell mit unveröffentlichten Kontext- und Latenzangaben, was ein echtes Planungsrisiko darstellt, aber es ist auch das einzige der beiden, das mitten im Satz etwas nachschlagen kann.
Die allgemeine Lehre ist mehr wert als jedes der beiden Urteile. Einundzwanzig Monate Voice-KI brachten ein Modell hervor, das nicht in erster Linie ein besseres Sprachmodell ist – es ist eine Sprachschnittstelle zu einem Agenten. Wenn Ihr Grund für offene Gewichte die Kosten waren, ist die Rechnung enger, als die lizenzfreie Darstellung nahelegt. Wenn Ihr Grund Kontrolle war, wurde das überhaupt nicht zur Ware gemacht, und GLM-4-Voice bleibt eine legitime Antwort auf eine Frage, die Gemini 3.8 Live nicht behandelt.
