
Qwen3.8-LiveTranslate против Gemini 3.5 Live Translate: один выпускает число, другой — карту
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Две ведущие модели синхронного перевода речи расходятся в том, по каким показателям они готовы дать себя измерить, и это расхождение полезнее любого сравнения характеристик. Qwen3.8-LiveTranslate, выпущенная 19 сентября 2026 года, во главу угла ставит одну конкретную цифру: среднее отставание 2,3 секунды против 2,8 у предыдущего поколения. Gemini 3.5 Live Translate, модель перевода речи в речь этого вендора, анонсированная в июне 2026 года и всё ещё использующая идентификатор предварительной версии, во главу угла ставит охват — более 70 языков, автоматическое определение, переключение в середине разговора и интеграцию в приложения Translate и Meet этого вендора. Одна компания опубликовала показатель задержки, за который готова отвечать. Другая опубликовала число языков. Если вы выбираете между ними, понимание того, почему это обещания разного рода, важнее, чем то, какой список длиннее.
Две архитектуры, которые сходятся в цели и ни в чём другом.
Обе модели существуют, чтобы уничтожить одно и то же поведение: переводчик с поочерёдными репликами, который ждёт, пока вы закончите предложение, прежде чем что-либо сказать. Именно эта пауза заставляет машинную интерпретацию ощущаться машинной интерпретацией.
Qwen3.8-LiveTranslate добивается этого с помощью архитектуры Interleave на гибридном MoE-бэкбоне, разделённой на модуль Thinker, который сводит аудио, видео, исходный текст и перевод в одну каузальную последовательность, и модуль Talker, который заново синтезирует перевод в тембре исходного говорящего. Утверждается, что сведение распознавания, перевода и синтеза в одну последовательность устраняет задержку и семантические потери, которыми трёхступенчатый конвейер расплачивается на каждой границе между модулями.
Gemini 3.5 Live Translate занимает ту же сквозную позицию с другой стороны: он построен на Gemini 3 Pro как нативная аудио-аудио модель, непрерывно передающая поток через Gemini Live API, а не выполняющая дискретный каскад ASR → MT → TTS. На практике вы удерживаете постоянное двунаправленное WebSocket-соединение, отправляете вверх 100-мс аудиофрагменты и получаете переведённые аудиофрагменты вниз. Ни одна из моделей не делает старого. Обе теперь делают новое. Все различия — во второстепенных деталях.
Сравнение задержек — не такая ничья, как кажется.
Google описывает Gemini 3.5 Live Translate как отстающий от говорящего «на несколько секунд». Google не опубликовала для модели значение LAAL или любую другую именованную воспроизводимую метрику задержки. Qwen опубликовал 2,3 секунды и определил, что это означает.
Эта асимметрия обычно сглаживается до «и то и другое — примерно две–три секунды». Такое прочтение не подтверждается ничем из сказанного ни одной из компаний. Формулировка Google совместима и с 2, и с 4 секундами; компания просто отказалась фиксировать конкретную цифру. Сравнение, которое действительно можно провести сегодня, таково:
• Публикуемый показатель задержки — Qwen3.8-LiveTranslate: LAAL 2,3 с, по данным производителя. Gemini 3.5 Live Translate: не публикуется.
• Независимое измерение задержки — ни для одной из моделей. Ни одна третья сторона не публиковала прямого сравнения.
Честный вывод таков: в отношении задержки со стороны Qwen прозвучало опровержимое утверждение, а со стороны Google — расплывчатое. Это плюс в пользу Qwen в плане прозрачности и ровно ноль очков в её пользу в плане производительности, пока кто-нибудь не измерит и то, и другое. Если задержка — решающий фактор для вашего развёртывания, текущее состояние доказательств не поддерживает решение о покупке ни в ту, ни в другую сторону.

60 языков против 70 с лишним — это не тот счёт.
Данные о количестве языков постоянно цитируются, и они вводят в заблуждение в обоих направлениях.
Qwen3.8-LiveTranslate распознаёт 60 исходных языков и обеспечивает голосовой вывод на 29 из них. Gemini 3.5 Live Translate поддерживает более 70 языков с автоматическим определением, а в Google Meet это расширяется до более чем 2000 языковых комбинаций, тогда как ранее максимум составлял перевод на основе английского для пяти языков.
Прежде чем считать это тройной победой, внимательно вчитайтесь во второе число. Показатель Google «более 2000» подсчитывает упорядоченные пары — каждый исходный язык в сочетании с каждым целевым, — что является обоснованным и действительно полезным показателем охвата, но не сравнимо с подсчётом для одного языка. А список Google, хотя и шире, сильно смещён в сторону языков с большой численностью носителей: африкаанс, арабский, бенгальский, нидерландский, английский, французский, немецкий, хинди, индонезийский, итальянский, японский, корейский, малайский, персидский, польский, португальский, русский, испанский, суахили, тамильский, телугу, тайский, турецкий, украинский, урду, вьетнамский, зулу. 29 языков устного вывода у Qwen — ещё более узкий набор, и ни один из списков ни одного из вендоров не является серьёзным ответом на длинный хвост — региональные диалекты и низкоресурсные языки, на которых инструменты устного перевода исторически терпели самые сильные неудачи. Обе компании утверждают, что работают над этим. Ни одна из них это не выпустила.
Где эти двое на самом деле расходятся: комната, полная людей
Единственное место, где модели дают по-настоящему разные обещания, — это обработка нескольких говорящих, и именно эта разница с наибольшей вероятностью определит реальное развёртывание.
Qwen3.8-LiveTranslate обеспечивает диаризацию говорящих в реальном времени: каждое предложение приписывается говорящему по мере поступления, а воспроизведение голоса описывается как стабильное при смене реплик. Qwen сообщает о собственной частоте ошибок диаризации 9,7% на своём длинном тестовом наборе с множеством говорящих против 30,6% у Seed LiveInterpret 2.0 — это сравнение от поставщика на оценке, проведённой самим поставщиком, так что следует воспринимать его как заявление с приложенной цифрой, а не как результат. Модель также выдаёт исходный текст и перевод на одной временной шкале, что и позволяет создавать синхронизированные двуязычные субтитры без отдельного этапа выравнивания.
Gemini 3.5 Live Translate делает противоположный акцент. Его задокументированная сильная сторона — сохранение просодии: сохранение высоты тона, темпа, интонации и эмоциональной окраски говорящего, так что переведённый голос передаёт ощущение оригинала. Его задокументированные слабые стороны — как раз там, где помогла бы диаризация: непоследовательное клонирование голоса, которое может «уплывать» после длинных пауз или выбирать не тот пол, слабое переключение реплик без чёткого сигнала конца предложения, проблемы с сильными акцентами и с близкородственными языковыми парами, такими как испанский и португальский, а также несовершенная обработка фонового шума. Google также ограничивает чисто аудиосессии 15 минутами, если их не продлить, и помечает каждый сгенерированный аудиопоток водяным знаком SynthID, который на данный момент невозможно удалить.
• Атрибуция нескольких говорящих — Qwen: диаризация в реальном времени, заявленный DER 9,7 %. Gemini: документированно слабое переключение реплик, заявлений о диаризации нет.
• Точность воспроизведения голоса — Qwen: воспроизведение исходного тембра через модуль Talker. Gemini: сохранение просодии, высоты тона и темпа; задокументированный дрейф при клонировании.
• Двуязычный вывод — Qwen: исходный текст и перевод выводятся на одной временной шкале. Gemini: опциональная транскрипция входного и выходного текста, настраиваемая для каждой сессии.
• Водяные знаки — Qwen: не указано. Gemini: SynthID для всего сгенерированного аудио, нет способа удаления.
• Длительность сессии — Qwen: не указано. Gemini: ограничение в 15 минут для чисто аудиосессий.
• Типы входных данных — Qwen: аудио и изображения. Gemini: только аудио, без текстового ввода.

Сколько на самом деле стоит эксплуатация каждого из них
Qwen3.8-LiveTranslate тарифицируется за миллион токенов при работе через WebSocket Realtime API. В регионе Сингапур: 7,50 $ за аудиовход, 0,55 $ за ввод изображений, 20,00 $ за вывод текста, 30,00 $ за вывод аудио. В Пекине: 40 ¥ / 3,3 ¥ / 100 ¥ / 160 ¥ за миллион — примерно 5,65 $ / 0,47 $ / 14,13 $ / 22,61 $. Объём контекста составляет 53 248 токенов, а лимиты — 10 запросов в минуту и 100 000 токенов в минуту в обоих регионах.
Этот потолок в 10 RPM — самое значимое число в тарифной сетке. Коммерческие условия Gemini 3.5 Live Translate публикуются не так же, что само по себе является сигналом о зрелости: Google распространяет его через Live API и AI Studio в режиме публичного предпросмотра, Google Meet — в закрытом предпросмотре для избранных клиентов Workspace, и приложение Translate на Android и iOS. Цены и лимиты предварительной версии могут быть изменены без уведомления, и Google не обязалась назвать дату GA.
Итак, сравнение затрат сейчас идёт между моделью с опубликованной ценой и жёстким потолком параллелизма и моделью без опубликованной цены и с неуказанным потолком. Если вам нужно смоделировать юнит-экономику в этом квартале, только одну из них можно заложить в бюджет.

Что должен был бы показать независимый тест
Всё вышесказанное построено на собственных анонсах двух поставщиков, потому что никто ещё не запускал эти модели друг против друга. Результат, который действительно позволил бы разрешить это противостояние, требует четырёх вещей, и ни одной из них пока не существует:
• LAAL измеряли одинаковым образом на обеих моделях, на одном и том же аудио, в одних и тех же языковых парах — показатель Qwen в 2,3 с нельзя сравнивать ни с чем, что Google отказалась сообщить.
• Частота ошибок диаризации на общем многоспикерном корпусе, а не на собственном наборе Omnilingua-MSpeaker от Qwen.
• Стабильность клонирования голоса в ходе длительных сессий — именно здесь собственная документация Gemini указывает на дрейф, а Qwen делает своё самое сильное заявление.
• Поведение при достижении пределов параллелизма — выдержит ли Qwen с его 10 RPM реальную нагрузку совещаний и выживут ли preview-квоты Gemini при столкновении с продакшеном.
Пока такого теста не существует, защитимая позиция узка: Qwen опубликовала больше и обещала более конкретные вещи; у Google шире языковой охват и масштаб дистрибуции, с которым не сравнится ни одна модель, доступная только через API.
Какой выбрать?
Ориентируйтесь на форму своей проблемы, а не на табло, потому что табло пока не заслуживает доверия.
Если ваша нагрузка предполагает участие нескольких сторон и важна атрибуция — транскрибация встреч, панельная дискуссия, зал суда, что угодно, где знание того, кто произнёс переведённое предложение, является частью ценности, — Qwen3.8-LiveTranslate — единственный из этих двух, кто заявляет о такой возможности, а задокументированная слабость Gemini в соблюдении очерёдности реплик указывает в ту же сторону. Если ваша нагрузка требует широкого языкового охвата, ориентирована на потребителя и уже находится внутри экосистемы Google, то более 70 языков Gemini 3.5 Live Translate и его присутствие в приложении Translate и в Meet — это преимущества, которым ни один конкурент, работающий только через API, не может противопоставить ничего по охвату.
Если вы создаёте продукт, а не покупаете демо, учтите: и то и другое — узкоспециализированные решения. Ни одно из них не запускает агентный цикл, ни одно не занимается суммаризацией, а Qwen3.8-LiveTranslate явно не поддерживает ни вызов функций, ни структурированный вывод, ни кэширование контекста, ни дообучение. Интерпретатор — это передний край вашего пайплайна, а не весь он. OrcaRouter — не то место, где сегодня стоит вызывать любую из этих моделей перевода: ни одной из них нет в нашем каталоге, и мы предпочтём сказать об этом прямо, а не намекать на обратное. Что мы действительно предоставляем — так это ту половину стека, которая потребляет транскрипт: один ключ к более чем 200 моделям по прайс-листу провайдера с нулевой наценкой, так что суммаризатор, контролёр глоссария или нижестоящий агент, читающий этот транскрипт, можно заменить или переключить при сбое, не затрагивая второй договор с вендором.
Его дно
Qwen3.8-LiveTranslate и Gemini 3.5 Live Translate достаточно близки по фундаментальным показателям, так что маркетинг стал решающим отличием: один опубликовал число задержки и тарифную сетку, другой — карту языков и экосистему. Ни один из них не прошёл независимое тестирование. Версия этого противостояния, которую стоит прочитать, — та, что будет написана после того, как кто-то прогонит оба на одном и том же аудио, — и, учитывая, как быстро движется эта категория, это может быть совсем не за горами.
Сравнение в этой статье3
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
