Титульная карточка с надписью «Qwen3.8-LiveTranslate vs Qwen 3.8» и подзаголовком «Столкновение имён, а не честная схватка».
Guides & Insights

Qwen3.8-LiveTranslate против Qwen 3.8: столкновение названий, а не честная схватка

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Найдите одну из этих моделей — и вам покажут другую. Qwen3.8-LiveTranslate, выпущенная 19 сентября 2026 года, и Qwen3.8-Max — модель, которую большинство людей имеют в виду, когда пишут «Qwen 3.8» без суффикса, общедоступная с 3 августа 2026 года и обновлённая как Qwen3.8-Max-0902 2 сентября, — имеют общий префикс поколения и почти ничего больше. Одна — это система синхронного перевода, которая принимает аудио на входе и возвращает переведённые аудио и текст на выходе, тарифицируется через WebSocket под идентификатором qwen3.8-livetranslate-flash-realtime. Другая — универсальная разреженная модель-смесь экспертов с 2,4 триллиона параметров и контекстным окном в 1 млн токенов, которая вообще ничего не слышит. Ставить их лицом к лицу — категориальная ошибка, и то, что столько людей приходят к этой ошибке, и есть настоящая суть: теперь вендор выпускает под именем Qwen 3.8 как минимум четыре разные вещи, а схема именования не говорит, какая из них вам нужна.

Что каждый из них на самом деле из себя представляет

Поколение Qwen 3.8 выпускалось слоями во второй половине 2026 года, и эти слои не взаимозаменяемы.

Qwen3.8-Max — это флагманская модель, доступная через хостинг: разреженная MoE-модель с примерно 2,4 трлн общих параметров и около 95 млрд активных параметров на прямой проход, контекстом в 1 млн токенов и вводом текста, изображений и видео с выводом только текста. Стоимость составляет $2,00 за миллион входных токенов и $6,00 за миллион выходных токенов, при этом чтение из кэша — $0,250 за миллион. По заявленным производителем оценкам, она набирает 86,6 в Terminal-Bench 2.1, 92,6 в GPQA Diamond, 67,7 в SWE-bench Pro и 43,6 в Humanity's Last Exam.

Qwen3.8-2.4T-A95B — это открытая по весам модель того же поколения, выпущенная 12 августа 2026 года: 512 маршрутизируемых экспертов в 92 слоях, 69 из этих слоёв используют линейное внимание, и примерно 4,89 ТБ весов. Именно её большинство людей имеет в виду под «Qwen 3.8», когда речь идёт о запуске модели у себя, а не об обращении к API.

Qwen3.8-27B — это небольшой открытый чекпоинт в том же семействе, а Qwen3.8-LiveTranslate — это специализированное решение: интерпретатор архитектуры Interleave, построенный на гибридной схеме MoE «Thinker–Talker», с распознаванием 60 исходных языков и 29 языками, доступными для речевого вывода.

Ось, которая их разделяет, — не размер. Это модальность. У Qwen3.8-Max нет ни пути аудиовхода, ни аудиовыхода вообще. Просить её интерпретировать живой разговор — это не вопрос лучшего промптинга; этой возможности в модели нет.

Контраст спецификации

Если поставить их рядом, эти две модели едва пересекаются хоть по одному параметру, важному для покупателя:

Основная задача — Qwen3.8-LiveTranslate: синхронный перевод речи в речь. Qwen3.8-Max: общие рассуждения, программирование, агентная и мультимодальная работа с текстом.

Модальность ввода — Qwen3.8-LiveTranslate: аудио и изображения. Qwen3.8-Max: текст, изображения и видео.

Модальность вывода — Qwen3.8-LiveTranslate: текст и синтезированное аудио. Qwen3.8-Max: только текст.

Контекстное окно — Qwen3.8-LiveTranslate: 53 248 токенов (49 152 на входе / 4 096 на выходе). Qwen3.8-Max: 1 000 000 токенов.

Веса — Qwen3.8-LiveTranslate: закрытая модель, доступ только через API. Qwen3.8-Max: хостинговый вариант, а её открытый собрат Qwen3.8-2.4T-A95B опубликован в рамках того же поколения.

Ограничения скорости — Qwen3.8-LiveTranslate: 10 запросов и 100 000 токенов в минуту. Qwen3.8-Max: стандартная пропускная способность хостинга, без ограничения в реальном времени на один запрос.

Разница в контексте — это то, что удивляет людей. Qwen3.8-Max вмещает миллион токенов; интерпретатор — около пяти процентов от этого. Но синхронному интерпретатору не нужен длинный контекст — ему нужна короткая память, и очень быстрая. Его предельный объём входных данных в 49 152 токена рассчитан на то, чтобы переносить последние несколько минут разговора вперёд и сохранять единообразие имён и терминологии, — а это как раз та задача, которую решает «разрешение неоднозначностей с помощью длинного контекста». Судить об интерпретаторе по числу его контекста — всё равно что судить гоночный двигатель по топливному баку.

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: primary job live interpretation, input audio plus image, output text plus audio, context 53,248 tokens, weights closed and API-only, audio in and out $7.50 and $30.00. Qwen3.8-Max column: primary job general reasoning, input text plus image plus video, output text only, context 1,000,000 tokens, weights hosted with the open sibling 2.4T-A95B, text in and out $2.00 and $6.00. Footer reads 'LiveTranslate per Alibaba Cloud; Qwen3.8-Max per OrcaRouter. Neither independently audited.'

Почему сравнение цен — это ловушка

В пересчёте на миллион токенов интерпретатор выглядит значительно дороже флагманской модели: $7,50 за миллион входных аудиотокенов против $2,00 за миллион входных текстовых токенов и $30,00 за миллион выходных аудиотокенов против $6,00 за миллион выходных текстовых токенов.

Это сравнение бессмысленно, и это самая распространённая ошибка в отношении моделей этого класса. Аудиотокены и текстовые токены — не одна и та же единица. Речь кодируется в аудиотокены с плотностью, никак не связанной с тем же содержанием, записанным в виде текста, — минута разговора потребляет намного больше аудиотокенов, чем её текстовая расшифровка потребляет текстовых токенов, а выходное аудио добавляет сверху второй поток. Сопоставление этих двух скоростей расхода создаёт впечатление соотношения затрат, которого на практике не существует.

Структурное различие важнее разницы в цене. Qwen тарифицирует переводчика по токенам, тогда как значительная часть рынка речевого перевода в реальном времени тарифицирует по минутам сессии. Эти две модели ценообразования ведут себя совершенно по-разному, когда ваш звук становится тише, сессии — короче, а говорящие делают паузы: поминутный счётчик начисляет плату за тишину, а потокенный — нет. Если вы строите модель затрат, вопрос не в том, какой тариф ниже; вопрос в том, какой счётчик наказывает ваш профиль использования. И обратите внимание на региональное разделение: пекинские тарифы составляют ¥40 / ¥3,3 / ¥100 / ¥160 за миллион для аудиовхода, ввода изображений, текстового вывода и аудиовыхода соответственно, что существенно ниже сингапурских ставок, — и это как раз тот вид различия, который становится заметен только при построчном сравнении.

Ещё один пункт в пользу интерпретатора по стоимости: Qwen сохранил эти тарифы практически без изменений относительно Qwen3.5-LiveTranslate — в Пекине они остались прежними, а в Сингапуре стали немного дешевле. Появление нового поколения без повышения цены — не норма для этого рынка.

Открытые веса против только API — вот настоящая разделительная линия

Если вы выбираете между этими двумя по принципиальным соображениям, а не по возможностям, решающим фактором является лицензирование.

Qwen3.8-Max доступна в виде размещённого сервиса, а веса Max-класса этого поколения были открыто опубликованы под названием Qwen3.8-2.4T-A95B в августе. Такой путь существует, но он не из лёгких: 4,89 ТБ весов — это оборудование дата-центра, а лицензия на открытые веса требует, чтобы организации с доходом выше 50 млн долларов за двенадцатимесячный период получали коммерческую лицензию от Alibaba Cloud.

У Qwen3.8-LiveTranslate нет такого пути. У неё закрытые веса, и она доступна только через API; до неё можно добраться через WebSocket Realtime API, который требует, чтобы target_language был установлен в session.update-событии перед передачей любого аудио, не поддерживает вызов функций, структурированный вывод, кэширование контекста, пакетный инференс и дообучение. Если ваше требование — запускать интерпретатор на собственном железе, эта модель ему не соответствует, и никакие инженерные усилия этого не изменят.

Это важно для определённого типа покупателя: того, кто не может отправлять аудио третьей стороне, — больницы, юридической фирмы, государственного подрядчика. Для всех остальных практический вопрос заключается в том, достаточно ли хорош переводчик, чтобы оправдать зависимость, и ответ на него — это измерение, которое Qwen пока никому не позволил провести.

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint, the required target_language session parameter, and the published per-million-token rates.

Выбор по должности, а не по имени

Правильный ответ на «Qwen3.8-LiveTranslate или Qwen 3.8» заключается в том, что вам, вероятно, нужен ответ на другой вопрос.

• Если задача — синхронный перевод — встреча, звонок, трансляция — справиться с этим сможет только один из них, и это вовсе не флагман.

• Если задача — суммировать сказанное, извлекать пункты действий, отвечать на вопросы по расшифровке или писать последующее письмо, — только флагманская модель способна на это, и это не интерпретатор.

• Если задача включает и то, и другое, вы строите конвейер и будете платить двум поставщикам по двум договорам и с двумя наборами учётных данных, если только не объедините это намеренно.

Этот третий случай — самый распространённый, и именно здесь запуск обеих половин за единой конечной точкой перестаёт быть удобством и становится архитектурой. Qwen3.8-Max доступен на OrcaRouter по прайсовой цене провайдера: $2,00 за миллион входных и $6,00 за миллион выходных токенов, с нулевой наценкой, передаваемой напрямую, так что снижение цены Qwen отражается в вашем счёте в тот же день, а не при следующем продлении контракта, а автоматическое переключение при сбое означает, что половина конвейера, отвечающая за суммаризацию, не отключается, когда у одного из провайдеров неудачный час.

Чтобы внести ясность относительно другой половины, поскольку это различие важно: Qwen3.8-LiveTranslate нет в нашем каталоге. Он доступен через собственный API Model Studio от Alibaba и пробную конечную точку поставщика по адресу omni.qwen.ai/live-translate, и мы не собираемся намекать, будто маршрутизируем модель, которую на самом деле не маршрутизируем. Что вы можете поставить за одним ключом сегодня — это нижестоящий стек: модели, которые потребляют то, что производит интерпретатор.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

Проблема именования — это и есть настоящий вывод.

Четыре модели, один префикс, никакого соглашения о суффиксах, на которое читатель мог бы положиться. «Qwen 3.8» может означать размещённый флагман, открытый чекпоинт 2.4T, малую модель 27B или переводчик — в зависимости от того, кто печатает и что читал последним. Опубликованные таблицы бенчмарков не помогают, потому что у флагмана они есть, а у переводчика в основном нет: Qwen3.8-Max можно проверить на Terminal-Bench или GPQA Diamond, тогда как свидетельства Qwen3.8-LiveTranslate — это среднее отставание в 2,3 секунды, заявленный производителем показатель 85,7 xCOMET-XXL на FLEURS и самостоятельно заявленная частота ошибок диаризации 9,7% без независимого воспроизведения.

Итак, сравнение, ради которого существует эта страница, на самом деле представляет собой предостережение. Прежде чем сравнивать Qwen 3.8 с чем-либо, установите, какой именно Qwen 3.8 вы имеете в виду. Если он принимает аудио, это интерпретатор, и это специалист, которого покупают для одной задачи. Если он принимает видео, это флагман, и это универсал, которого покупают для остальных двадцати. Любая оценка, в которой их смешивают, не даст вывода ни об одном из них.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно