Титульная карточка главного баннера для Gemini 3.8 Live против GLM-4-Voice с надзаголовком «OrcaRouter · радар моделей — лицом к лицу» и подзаголовком «Что на самом деле принесли 21 месяц голосового ИИ». На двух карточках написано: «Gemini 3.8 Live — сентябрь 2026, хостинг, инструменты, 97 языков» и «GLM-4-Voice — декабрь 2024, открытые веса, 9B, китайский и английский», с чипами: разница в 21 месяц, код Apache-2.0 и лицензия на кастомные веса. Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

Gemini 3.8 Live против GLM-4-Voice: что на самом деле дали 21 месяц голосового ИИ

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

GLM-4-Voice вышла 3 декабря 2024 года. Gemini 3.8 Live была анонсирована 15 сентября 2026 года. Это 21 месяц, и это самый важный факт в этом сравнении — важнее любого бенчмарка, потому что он определяет, какой именно вопрос вы на самом деле задаёте.

Эти две модели — не соперники. Никто, кто развёртывает голосовые технологии в масштабе в 2026 году, не выбирает между ними по качеству. Настоящий вопрос — тот, который ставит GLM-4-Voice и на который Gemini 3.8 Live не может ответить: что потребовалось бы, чтобы владеть этим, а не арендовать? У этого вопроса есть настоящий ответ, и за 21 месяц он изменился меньше, чем вы могли бы ожидать.

Что выпустила Google и что выпустила Zhipu

Gemini 3.8 Live — это облачная модель живого диалога с закрытыми весами. Она обрабатывает визуальный ввод почти в реальном времени, автоматически определяет и переключается между 97 поддерживаемыми языками прямо во время разговора и выполняет вызовы инструментов и API в фоне, пока разговор продолжается. Она доступна разработчикам через Gemini API и Google AI Studio, в закрытом предпросмотре в Gemini Enterprise и в Search Live. Заявленная стоимость — $0,005 за минуту аудиоввода и $0,018 за минуту аудиовывода через Live API; график стоимости часа аудиоввода от Artificial Analysis независимо оценивает её в $1,50 в час. Её родственная модель, Gemini 3.8 Live Extended Thinking, сейчас возглавляет тот же индекс с показателем 82,6, тогда как сам Gemini 3.8 Live находится на уровне 76,0.

GLM-4-Voice — первая сквозная речевая модель Zhipu AI, и это чекпоинт, доступный для скачивания. Она состоит из трёх частей: речевой токенизатор на базе энкодера Whisper-large-v3 с узким местом векторного квантования примерно на 0,4 млрд параметров, авторегрессионная языковая модель (GLM-4-Voice-9B, инициализированная на основе GLM-4-9B) примерно на 9 млрд параметров и декодер на основе flow matching, дообученный из CosyVoice. Она говорит на китайском и английском языках, поддерживает управляемые инструкциями эмоцию, тон, темп речи и диалект — среди них кантонский, чунцинский мандарин, пекинская речь — и токенизирует речь с частотой 12,5 Гц в единый поток одной кодовой книги примерно на 175 бит/с, что на порядок ниже, чем у типичных нейронных аудиокодеков.

Размеры, рядом:

• Релиз — Gemini 3.8 Live: 15 сентября 2026 г. GLM-4-Voice: 3 декабря 2024 г.

• Веса — закрытые, доступны только в виде хостинга, а не для скачивания, код Apache-2.0 с кастомной лицензией на веса.

• Языки — 97 с переключением в середине разговора по сравнению с китайским и английским.

• Зрение — визуальный ввод почти в реальном времени в сравнении с его отсутствием.

• Вызов инструментов — фоновое выполнение инструментов и API в середине разговора vs полное отсутствие канала инструментов.

• Контекст — не опубликован Google, в отличие от контекста 8K и максимального вывода 4K.

• Минимальные требования для самостоятельного хостинга — не применимо против официальных 32 ГБ ОЗУ плюс CUDA-GPU; примерно 12 ГБ видеопамяти при int4.

• Водяные знаки — SynthID на всём сгенерированном аудио против отсутствия таковых.

A two-column scoreboard comparing Gemini 3.8 Live and GLM-4-Voice. Released Sep 15 2026 vs Dec 3 2024; weights closed and hosted vs open with a custom licence; languages 97 vs Chinese and English; tool calling background execution vs none; self-host floor not applicable vs 32 GB RAM plus a GPU or about 12 GB VRAM at int4; cost $1.50 per hour of input audio vs no per-minute bill. Footer reads 'GLM-4-Voice VoiceBench and UTMOS figures self-reported or third-party, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

21 месяц — это приобретённая возможность, а не только качество.

Простая история заключается в том, что фронтирная модель 2026 года превосходит открытый чекпойнт 2024 года. Так и есть, и разрыв велик — но более полезное наблюдение состоит в том, что категория изменила форму, а не сместилась вдоль одной оси.

В собственном техническом отчёте Zhipu GLM-4-Voice набирает 93,6% точности преобразования речи в текст на Topic-StoryCloze, 82,9% в режиме речь-в-речь, естественность по UTMOS 4,45 и устный QA 5,40/10 по общим знаниям и 5,20/10 по знаниям — всё заявлено самостоятельно и не воспроизведено. Независимых оценок меньше, и они менее лестны: в VoiceBench он показывает общий результат 56,48, занимая примерно 29-е место из 42 в одной таблице и 30-е из 40 в другой, при этом многоходовое понимание описывается как слабое в обоих языках. В бенчмарке понимания многоходовых диалогов C³ он набирает 11,09% на китайском и 33,22% на английском. VCB Bench обнаружил, что он лидирует по эмоциональному контролю с 93,0 в китайской субметрике SIF и сильным соответствием текста и речи, но обработка диалектов в TELEVAL составила 4,57% без явных инструкций.

Эти цифры описывают модель, которая хорошо справляется с голосовой выразительностью и плохо — с длительным пониманием. Это речевая модель 2024 года в одном предложении.

Балл 76,0 у Gemini 3.8 Live в Speech to Speech Index от Artificial Analysis — это составной показатель, охватывающий речевое рассуждение, агентную производительность, предпочтения на арене и успешность выполнения задач. Дело не в том, что более новая модель лучше справляется с той же задачей в разы. Дело в том, что составной показатель теперь вообще включает агентную производительность и успешность выполнения задач — категории, в которых GLM-4-Voice не может конкурировать, потому что у неё нет инструментального канала. Модель 2024 года оценивают по игре, в которую она никогда не должна была играть.

Screenshot of the OrcaRouter models catalogue, showing hosted models listed with provider names and per-million-token pricing behind a single API key.

Лицензия — это та часть, которую люди пропускают.

Если вы смотрите на GLM-4-Voice, потому что он открыт, прочитайте условия, пока веса ещё не докачались. Этот раскол реален, и его легко понять неправильно:

• Code — Apache-2.0. По-настоящему пермиссивная.

• Веса — специальная лицензия, требующая указания авторства и регистрации в Zhipu для коммерческого использования.

«Открытые веса» и «Apache-2.0» — это не одно и то же утверждение, и многие вторичные материалы об этой модели их смешивают. Если вы собираетесь выпускать коммерческий продукт на базе GLM-4-Voice, требование о регистрации — это юридический шаг, а не формальность, и его следует включить в критический путь. Один трекер идёт дальше и описывает модель как проприетарную с условным коммерческим использованием. В любом случае, отсутствие поминутной оплаты — это не отсутствие коммерческих отношений.

Арифметика затрат, честно посчитанная

Аргумент в пользу самостоятельного хостинга состоит в том, что фиксированная месячная стоимость при больших объёмах выгоднее поминутной. Этот аргумент реален, но он меньше, чем кажется, если учесть, чем вы управляете.

GLM-4-Voice официально требует 32 ГБ оперативной памяти и GPU с поддержкой CUDA. int4-квантованные сборки от сообщества укладываются примерно в 12 ГБ видеопамяти, а на практике — в 10–11 ГБ, что соответствует уровню RTX 3060, с практическим потолком около 30 секунд речи на один ход. Облачный инстанс A10 по цене примерно $0,50–$1,00 в час — это от $350 до $700 в месяц за постоянно работающий экземпляр, ещё до того, как вы обслужите хотя бы одного пользователя, и без отказоустойчивого переключения, без запаса на пиковую нагрузку и без дежурного, которому можно отправить вызов, когда в 3 часа ночи декодер начинает выдавать шум.

В противовес этому, Gemini 3.8 Live по цене $1,50 за час входного аудио означает, что $350 покупают вам примерно 233 часа голоса. Это не очевидно хуже, и это идёт с мощностью, которую вы не выделяли. Точка безубыточности существует; она выше, чем предполагает поверхностное сравнение, и она смещается в зависимости от того, является ли ваш трафик равномерным или пиковым. Пиковый трафик — это случай, когда поминутная тарификация решительно выигрывает, потому что простаивающие GPU тарифицируются точно так же, как и занятые.

Также есть разница в том, что вы получаете за эти деньги. Отчёты сообщества о развёртываниях GLM-4-Voice с квантованием оценивают задержку непрерывного диалога в 38–120 мс, хотя эти цифры взяты из публикаций, а не от Zhipu. Google вообще не публиковал данные о задержке Gemini 3.8 Live. Если низкая задержка — ваше жёсткое требование, ни у одного из них нет цифры, на которую можно было бы ориентироваться при планировании — у одного есть сторонние измерения сообщества, у другого — отзывы партнёров и ни одной цифры.

Screenshot of Google's official blog post titled 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated Sep 15, 2026 and credited to Tom Ouyang and Malini Jaganathan of the Gemini Audio Team, with the summary describing the models as Google's most advanced live dialogue models with major upgrades in intelligence and parallel reasoning.

Средний вариант: владеть логикой, арендовать возможности

Противопоставление «самостоятельное развёртывание или хостинг» упускает ту схему, к которой на деле приходит большинство команд. У GLM-4-Voice нет канала инструментов, поэтому любому продукту на его основе нужна отдельная текстовая модель для поиска — а значит, самостоятельно развёрнутая речевая модель в любом случае стоит перед текстовой моделью, размещённой у провайдера. Решение о развёртывании и решение о возможностях можно принимать отдельно.

Именно на этом разделении роутер и выполняет реальную работу. OrcaRouter несёт 190 моделей за одним ключом по каталожной цене провайдера без наценки, поэтому цель делегирования за вашим речевым фронтендом можно менять на живом трафике, ничего не перестраивая, а снижение цены у вышестоящего поставщика доходит до вас в тот же день, а не при следующем продлении. Автоматическое переключение при сбое важнее, чем обычно, в self-hosted конфигурации, потому что, когда упал именно ваш собственный GPU-инстанс, бэкенд-модель всё ещё доступна, и сессии не обязательно умирать вместе с ним. Два уточнения, поскольку это сравнение располагает к путанице: мы не размещаем у себя GLM-4-Voice, и эндпоинты Gemini 3.8 Live тоже не на нашем роутере — они идут от их вендоров. А что на роутере — так это текстовый слой, которому оба они передают работу.

Решение и урок, лежащий в его основе

Выберите GLM-4-Voice, если вам нужна модель на собственном оборудовании, если ваш трафик действительно стабилен при высоком объёме, если вы создаёте только на китайском или английском и если вам нужно модифицировать модель, а не вызывать её. Заложите регистрацию лицензии как реальную задачу и будьте готовы самостоятельно решать задачу понимания в многоходовых диалогах — это задокументированное слабое место модели, и сколько бы вы ни занимались тонкой настройкой в условиях ограничения вывода в 4K, полностью скрыть это не удастся.

Выбирайте Gemini 3.8 Live, если ваши требования включают работу с изображениями, вызов инструментов, более двух языков или любой профиль трафика, который вы бы назвали пиковым. Это предварительная модель с неопубликованными данными о контексте и задержке, что создаёт реальный риск при планировании, но при этом это единственная из двух, способная найти информацию прямо посреди предложения.

Общий урок ценнее любого из этих вердиктов. Двадцать один месяц работы над голосовым ИИ породил модель, которая прежде всего не является улучшенной голосовой моделью — это голосовой интерфейс к агенту. Если вашей причиной желать открытые веса была стоимость, то расчёт оказывается ближе, чем предполагает формулировка о свободе от лицензионных ограничений. Если вашей причиной был контроль, то он вовсе не стал товаром, и GLM-4-Voice остаётся законным ответом на вопрос, на который Gemini 3.8 Live не даёт ответа.