Carte de titre principale pour Gemini 3.8 Live vs GLM-4-Voice avec le sur-titre « OrcaRouter · radar des modèles — face-à-face » et le sous-titre « Ce que 21 mois d’IA vocale ont réellement apporté. » Deux cartes indiquent « Gemini 3.8 Live — sept. 2026, hébergé, outils, 97 langues » et « GLM-4-Voice — déc. 2024, poids ouverts, 9B, chinois et anglais », avec des puces indiquant 21 mois d’écart, le code Apache-2.0 et une licence de poids personnalisés. Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Gemini 3.8 Live vs GLM-4-Voice : Ce que 21 mois d’IA vocale ont réellement apporté

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

GLM-4-Voice est sorti le 3 décembre 2024. Gemini 3.8 Live a été annoncé le 15 septembre 2026. Cela fait 21 mois, et c'est le fait le plus important de cette comparaison — plus important que n'importe quel benchmark, car cela détermine le type de question que vous posez réellement.

Ces deux modèles ne sont pas des rivaux. Personne qui déploie la voix à grande échelle en 2026 ne choisit entre eux en fonction de la qualité. La vraie question est celle que GLM-4-Voice pose et à laquelle Gemini 3.8 Live ne peut pas répondre : que faudrait-il pour posséder cela plutôt que de le louer ? Cette question a une véritable réponse, et elle a moins changé en 21 mois que vous ne pourriez le penser.

Ce que Google a livré, et ce que Zhipu a livré

Gemini 3.8 Live est un modèle de dialogue en direct hébergé à poids fermés. Il gère les entrées visuelles en temps quasi réel, détecte et bascule automatiquement entre 97 langues prises en charge en cours de conversation, et exécute des outils et des appels d'API en arrière-plan pendant que la conversation se poursuit. Il est accessible aux développeurs via l'API Gemini et Google AI Studio, en aperçu privé dans Gemini Enterprise, ainsi que dans Search Live. Le tarif annoncé est de 0,005 $ par minute d'entrée audio et 0,018 $ par minute de sortie audio via l'API Live ; le graphique du coût par heure d'audio d'entrée d'Artificial Analysis le situe indépendamment à 1,50 $ par heure. Son homologue, Gemini 3.8 Live Extended Thinking, occupe actuellement la première place de ce même indice avec 82,6, tandis que Gemini 3.8 Live lui-même se situe à 76,0.

GLM-4-Voice est le premier modèle vocal de bout en bout de Zhipu AI, et il s'agit d'un checkpoint téléchargeable. Il s'agit d'un assemblage en trois parties : un tokeniseur vocal construit sur un encodeur Whisper-large-v3 avec un goulot d'étranglement à quantification vectorielle d'environ 0,4 B de paramètres, un modèle de langage autorégressif (GLM-4-Voice-9B, initialisé à partir de GLM-4-9B) d'environ 9 B de paramètres, et un décodeur à correspondance de flux réentraîné à partir de CosyVoice. Il parle chinois et anglais, prend en charge l'émotion, le ton, le débit de parole et le dialecte contrôlés par instruction — notamment le cantonais, le mandarin de Chongqing, le parler de Pékin — et tokenise la parole à 12,5 Hz en un flux de livre de codes unique à environ 175 bps, soit un ordre de grandeur inférieur à celui des codecs audio neuronaux typiques.

Les dimensions, côte à côte :

• Sortie — Gemini 3.8 Live : 15 septembre 2026. GLM-4-Voice : 3 décembre 2024.

• Poids — fermés, hébergés uniquement vs téléchargeables, code Apache-2.0 avec une licence personnalisée pour les poids.

• Langues — 97 avec changement en cours de conversation par rapport au chinois et à l'anglais.

• Vision — entrée visuelle en quasi temps réel vs aucune.

• Appel d’outils — exécution d’outils et d’API en arrière-plan en cours de conversation vs aucun canal d’outil du tout.

• Contexte — non publié par Google vs contexte 8K, sortie max 4K.

• Configuration minimale pour l'auto-hébergement — sans objet par rapport à la configuration officielle de 32 Go de RAM plus un GPU CUDA ; environ 12 Go de VRAM en int4.

• Filigrane — SynthID appliqué à tout l'audio généré, contre aucun décrit.

A two-column scoreboard comparing Gemini 3.8 Live and GLM-4-Voice. Released Sep 15 2026 vs Dec 3 2024; weights closed and hosted vs open with a custom licence; languages 97 vs Chinese and English; tool calling background execution vs none; self-host floor not applicable vs 32 GB RAM plus a GPU or about 12 GB VRAM at int4; cost $1.50 per hour of input audio vs no per-minute bill. Footer reads 'GLM-4-Voice VoiceBench and UTMOS figures self-reported or third-party, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

21 mois ont acheté la capacité, pas seulement la qualité

Le récit facile est qu’un modèle frontière de 2026 bat un checkpoint ouvert de 2024. C’est le cas, et l’écart est large — mais l’observation plus utile est que la catégorie a changé de forme plutôt que d’avancer sur un seul axe.

Selon le rapport technique de Zhipu lui-même, GLM-4-Voice obtient 93,6 % de précision parole-texte sur Topic-StoryCloze, 82,9 % en parole-parole, un naturel UTMOS de 4,45, et des scores de 5,40/10 en questions-réponses orales générales et de 5,20/10 en connaissances — tous auto-déclarés et non reproduits. L'évaluation indépendante est plus rare et moins flatteuse : sur VoiceBench, il enregistre un score global de 56,48, ce qui le place autour de la 29e place sur 42 dans un classement et de la 30e sur 40 dans un autre, la compréhension multi-tours étant décrite comme faible dans les deux langues. Sur le benchmark C³ de compréhension de dialogue multi-tours, il se situe à 11,09 % en chinois et 33,22 % en anglais. VCB Bench a constaté qu'il arrivait en tête pour le contrôle émotionnel, avec 93,0 sur la sous-métrique SIF en chinois, et qu'il affichait un fort alignement texte–parole, mais la gestion des dialectes de TELEVAL s'établissait à 4,57 % sans instruction explicite.

Ces chiffres décrivent un modèle doué pour l'expression vocale mais médiocre pour la compréhension soutenue. Voilà un modèle vocal de 2024 en une phrase.

Le score de 76,0 obtenu par Gemini 3.8 Live au Speech to Speech Index d'Artificial Analysis est un score composite établi à partir du raisonnement vocal, de la performance agentique, de la préférence d'arène et du taux de réussite des tâches. Ce n'est pas que le modèle plus récent soit meilleur sur la même tâche par un multiple plus élevé. C'est que le composite inclut désormais la performance agentique et la réussite des tâches, tout simplement — des catégories dans lesquelles GLM-4-Voice ne peut pas concourir, car il n'a pas de canal d'outils. Le modèle de 2024 est noté sur un jeu auquel il n'a jamais été destiné à jouer.

Screenshot of the OrcaRouter models catalogue, showing hosted models listed with provider names and per-million-token pricing behind a single API key.

La licence est la partie que les gens sautent.

Si vous vous intéressez à GLM-4-Voice parce qu'il est ouvert, lisez les conditions avant que les poids n'aient fini de se télécharger. La fracture est réelle et il est facile de mal l'interpréter :

• Code — Apache-2.0. Vraiment permissive.

• Poids — une licence personnalisée qui exige l'attribution et l'enregistrement auprès de Zhipu pour un usage commercial.

« Poids ouverts » et « Apache-2.0 » ne constituent pas la même affirmation, et de nombreux articles secondaires consacrés à ce modèle confondent les deux. Si vous comptez commercialiser un produit basé sur GLM-4-Voice, l’obligation d’enregistrement est une étape juridique, pas une formalité, et elle devrait figurer sur le chemin critique. Un site de suivi va plus loin et décrit le modèle comme propriétaire, avec une utilisation commerciale conditionnelle. Dans un cas comme dans l’autre, l’absence de facturation à la minute ne signifie pas l’absence de relation commerciale.

L’arithmétique des coûts, faite honnêtement.

L’argument en faveur de l’auto-hébergement est qu’un coût mensuel fixe l’emporte sur un coût à la minute dès qu’il y a du volume. Cet argument est réel, et il est plus mince qu’il n’y paraît quand on compte ce que l’on exploite.

GLM-4-Voice requiert officiellement 32 Go de RAM et un GPU CUDA. Les quantifications int4 de la communauté tournent dans environ 12 Go de VRAM, en pratique environ 10 à 11 Go, ce qui correspond au territoire d'une RTX 3060, avec un plafond pratique d'environ 30 secondes de parole par tour. Une A10 cloud à environ 0,50 à 1,00 $ l'heure équivaut à entre 350 et 700 $ par mois pour une instance fonctionnant en continu — avant même d'avoir servi un seul utilisateur, et sans basculement automatique, sans capacité d'élasticité, et sans personne à alerter quand le décodeur produit du bruit à 3 h du matin.

En revanche, Gemini 3.8 Live à 1,50 $ par heure d'audio en entrée signifie que 350 $ vous achètent environ 233 heures de voix. Ce n'est pas manifestement moins bien, et cela s'accompagne d'une capacité que vous n'avez pas provisionnée. Le point de bascule existe ; il est plus élevé que ne le suggère la comparaison mise en avant, et il varie selon que votre trafic est régulier ou en rafales. Le trafic en rafales est le cas où la tarification à la minute l'emporte nettement, car des GPU inactifs sont facturés exactement comme des GPU occupés.

Il y a aussi une différence dans ce que vous obtenez pour le prix. Les rapports de la communauté sur les déploiements quantifiés de GLM-4-Voice situent la latence du dialogue continu entre 38 et 120 ms, bien que ces chiffres proviennent d’articles plutôt que de la part de Zhipu. La latence de Gemini 3.8 Live n’a pas du tout été publiée par Google. Si une faible latence est une exigence absolue pour vous, ni l’un ni l’autre ne dispose d’un chiffre sur lequel vous pouvez vous baser pour planifier — l’un a des mesures tierces de la communauté, l’autre a des témoignages de partenaires et aucun chiffre.

Screenshot of Google's official blog post titled 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated Sep 15, 2026 and credited to Tom Ouyang and Malini Jaganathan of the Gemini Audio Team, with the summary describing the models as Google's most advanced live dialogue models with major upgrades in intelligence and parallel reasoning.

L'option intermédiaire : posséder la logique, louer la capacité

Présenter la chose comme un choix entre auto-hébergement et service hébergé passe à côté de l'architecture à laquelle la plupart des équipes aboutissent en réalité. GLM-4-Voice n'a pas de canal d'outils, si bien que tout produit bâti sur ce modèle a besoin d'un modèle de texte distinct pour effectuer les recherches — ce qui signifie que, dans un cas comme dans l'autre, le modèle vocal auto-hébergé se trouve placé devant un modèle de texte hébergé. La décision de déploiement et la décision de capacités sont dissociables.

C'est dans cette séparation qu'un routeur fait un vrai travail. OrcaRouter propose 190 modèles derrière une seule clé, au prix catalogue du fournisseur et sans marge, ainsi la cible de délégation derrière votre interface vocale peut être changée sur du trafic en direct sans rien reconstruire, et une baisse de prix en amont vous parvient le jour même plutôt qu'au prochain renouvellement. Le basculement automatique compte plus que jamais dans une installation auto-hébergée, car lorsque c'est votre propre instance GPU qui est tombée, le modèle backend reste joignable et la session n'a pas à mourir avec elle. Deux précisions, car cette comparaison prête à confusion : nous n'hébergeons pas GLM-4-Voice, et les points de terminaison Gemini 3.8 Live ne sont pas non plus sur notre routeur — ils viennent de leurs fournisseurs. Ce qui est sur le routeur, c'est la couche texte à laquelle les deux confient le travail.

La décision, et la leçon qui la sous-tend

Choisissez GLM-4-Voice si vous avez besoin du modèle sur votre propre matériel, si votre trafic est véritablement stable à volume élevé, si vous ne développez qu'en chinois ou en anglais, et si vous devez modifier le modèle plutôt que de l'appeler. Prévoyez l'enregistrement de la licence comme une véritable tâche, et attendez-vous à résoudre vous-même la compréhension multi-tours — c'est le point faible documenté du modèle, et aucun ajustement fin autour d'un plafond de sortie de 4K ne pourra totalement le masquer.

Choisissez Gemini 3.8 Live si vos besoins incluent la vision, l’appel d’outils, plus de deux langues, ou tout profil de trafic que vous qualifieriez de « en pics ». Il s’agit d’un modèle en aperçu dont les chiffres de contexte et de latence ne sont pas publiés, ce qui représente un véritable risque de planification, mais c’est aussi le seul des deux qui peut effectuer une recherche en pleine phrase.

La leçon générale vaut plus que l’un ou l’autre verdict. Vingt et un mois d’IA vocale ont produit un modèle qui n’est pas d’abord un meilleur modèle vocal — c’est une interface vocale vers un agent. Si votre raison de vouloir des poids ouverts était le coût, l’arithmétique est plus serrée que ne le suggère le cadrage sans licence. Si votre raison était le contrôle, celui-ci n’a pas du tout été banalisé, et GLM-4-Voice reste une réponse légitime à une question que Gemini 3.8 Live n’aborde pas.