
Встречайте Qwen3.8-LiveTranslate: полсекунды, которые позволяют ИИ-переводу работать в человеческом темпе.
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-LiveTranslate вышел 19 сентября 2026 года, и всё объявление сводится к одному вычитанию. Среднее отставание — LAAL, средняя задержка между моментом, когда слово покидает рот говорящего, и моментом, когда его перевод доходит до уха слушателя, — падает с 2,8 секунды в предыдущем поколении до 2,3 секунды. Профессиональные синхронные переводчики работают с интервалом от уха до голоса примерно 2–3 секунды. В этом и вся суть: дело не в том, что машина стала быстрее, а в том, что её задержка теперь находится в диапазоне, где слушатели вообще перестают замечать машину. В цифрах запуска качество перевода FLEURS у предыдущего поколения указано как 83,0 xCOMET-XXL; для этого заявлено 85,7. Оба числа принадлежат производителю, получены на его собственной системе оценки, и пока ни одна независимая сторона их не воспроизвела — это самое важное предостережение в этой статье.
То, что делает этот релиз достойным чтения дальше заголовка, — это механизм. Qwen сократил задержку не за счёт более быстрого распознавателя или более лёгкого синтезатора. Он устранил стыки между ними.
Что на самом деле изменилось: швы исчезли
Классический синхронный перевод — это трёхступенчатый конвейер, который уже десять лет собирают одним и тем же способом: автоматическое распознавание речи транскрибирует поток, машинный перевод преобразует транскрипт, а синтез речи озвучивает результат. Каждый этап — это отдельная модель с собственным бюджетом задержки, и при каждой передаче что-то теряется: просодия — на первом этапе, идентичность говорящего — на третьем, а также фиксированные несколько сотен миллисекунд на каждой границе, где модулю приходится ждать, пока накопится достаточно токенов, чтобы он мог быть уверен.
Qwen3.8-LiveTranslate заменяет этот каскад тем, что производитель называет архитектурой Interleave, построенной на основе Hybrid MoE и разделённой на два взаимодействующих модуля:
• Thinker — выстраивает видео, аудио, исходный текст и перевод в единую причинно-следственную последовательность, чередуя их по временному порядку, и выполняет понимание и перевод от начала до конца за один проход, а не за три.
• Talker — берёт переведённый текст вместе с оригинальным аудио и синтезирует речь, сохраняющую тембр исходного говорящего, так что дублированный голос узнаваемо принадлежит тому, кто говорил.
Архитектурное утверждение состоит в том, что, поскольку распознавание, перевод и синтез используют одну общую схему моделирования последовательностей, а не передают сообщения через границы модулей, система перестаёт платить межмодульный налог дважды за каждое высказывание. Это правдоподобное объяснение того, откуда взялись 0,5 секунды, и при этом это ровно тот тип утверждений, которые дёшево утверждать и дорого проверять. Считайте это объяснением вендора, а не установленным результатом.
Три возможности, которые действительно новые
Охват языков не изменился: распознаются 60 исходных языков, 29 доступны для речевого вывода — те же показатели, что и у Qwen3.5-LiveTranslate. Все интересные дополнения касаются того, что происходит, когда разговаривает больше одного человека.
• Диаризация говорящих в реальном времени — каждое предложение приписывается говорящему по мере его произнесения, а воспроизведение тембра голоса описывается как более стабильное при смене реплик. Qwen по собственным данным сообщает о частоте ошибок диаризации 9,7% на собственном длинном многоспикерном тестовом наборе против 30,6% у Seed LiveInterpret 2.0. Оба показателя исходят от Qwen.
• Исходный текст и перевод в одном кадре — модель выдаёт исходную расшифровку и переведённый текст на одной временной шкале, что позволяет создавать пару двуязычных субтитров на экране без повторного прохода выравнивания.
• Устранение неоднозначности с учётом длинного контекста — предыдущий контекст переносится дальше, чтобы имена, формы обращения и термины предметной области оставались согласованными. Именно это важнее всего на практике: классический сбой синхронного перевода — не неправильное слово, а то, что одного и того же человека в ходе одной встречи называют тремя разными способами.
Диаризация — это действительно тот самый по-настоящему отличающий фактор здесь. У Gemini 3.5 Live Translate, конкурирующей модели Google для речевого перевода в реальном времени «речь в речь», зафиксированы задокументированные проблемы с очерёдностью реплик — ей может быть трудно определить, когда говорящий действительно остановился. Qwen заявляет об обратном свойстве как о функции. Ни одна из компаний не опубликовала прямого сравнения, которое могло бы это разрешить.

Честное прочтение заявлений о бенчмарке
Qwen тестировали на двух наборах, и их стоит разделить, потому что они измеряют разные вещи.
• FLEURS, 70 языковых направлений — публичный, широко используемый многоязычный аудиобенчмарк. Qwen заявляет о лидерстве как над своим предшественником, так и над тем, что называет современными мейнстримными системами синхронного перевода, — по качеству перевода, средней задержке, точности распознавания речи и качеству синтеза речи. Здесь же приводится сравнение 85,7 против 83,0 по xCOMET-XXL.
• Omnilingua-MSpeaker, 14 языковых направлений — собственный набор Qwen для оценки многоспикерного длинного аудио. Компания заявляет о лучшей верности передачи, беглости и лаконичности, а также о более низком показателе ошибок диаризации. Бенчмарк, созданный производителем, не бесполезен, но и не является доказательством: его разработали те самые люди, чья модель на нём оценивается.
Честное резюме таково: FLEURS — реальный и общедоступный, поэтому 85.7 по крайней мере в принципе можно проверить; Omnilingua-MSpeaker — нет, поэтому победа в диаризации остаётся заявлением, пока кто-нибудь не воспроизведёт её. На момент написания ни одна третья сторона не опубликовала цифры Qwen3.8-LiveTranslate, а модели всего несколько часов.
Во сколько обходится API, и одно число, которое вас укусит
Qwen3.8-LiveTranslate — это модель с закрытыми весами, доступная только через API. Она работает через WebSocket Realtime API под идентификатором модели qwen3.8-livetranslate-flash-realtime, а не через обычную конечную точку HTTP. Цены указаны за миллион токенов, и, поскольку аудиотокены плотные, заявленные тарифы выглядят ошеломляюще на фоне текстовых моделей, пока не вспомнишь, что такое аудиотокен:
• Сингапурский регион — аудиовход $7.50, ввод изображений $0.55, вывод текста $20.00, вывод аудио $30.00 за миллион токенов.
• регион Пекин — ¥40 за ввод аудио, ¥3,3 за ввод изображений, ¥100 за вывод текста, ¥160 за вывод аудио за миллион токенов, что при текущих курсах составляет примерно $5,65 / $0,47 / $14,13 / $22,61.
• Контекст — всего 53 248 токенов, разделённых на 49 152 максимум на входе и 4 096 максимум на выходе.
• Лимиты — 10 запросов в минуту и 100 000 токенов в минуту, одинаковы в обоих регионах.
Вот этот лимит частоты запросов и есть то число, которое стоит подчеркнуть. Десять запросов в минуту — это щедро для нескольких переговорных, но совершенно недостаточно для развёртывания в контакт-центре или прямой трансляции с тысячами одновременных потоков. Qwen сохранил цену на интерфейс практически на уровне предыдущего поколения — тарифы в Пекине не изменились, а в Сингапуре стали немного ниже, — но модель, архитектурно готовая к масштабированию, предоставляется так, будто это предварительная версия. Всем, кто планирует продакшен-трафик, следует рассматривать потолок в 10 RPM как ключевое ограничение, а не как цену за токен.

Вызвать его — не то же самое, что вызвать чат-модель.
Realtime API управляется событиями, что представляет собой иную ментальную модель по сравнению с эндпоинтом completion. Вы открываете сокет и получаете session.created, затем отправляете session.update — событие для настройки сессии до того, как начнёт передаваться любое аудио.
• target_language — обязательный параметр, который необходимо задать до первого аудиофрагмента — неявного целевого языка по умолчанию нет.
• source_language необязателен; по умолчанию используется автоопределение.
• output_modalities выбирает ["text"] для режима только транскрипта или ["text","audio"] для переведённой речи.
• input_audio_buffer.append передаёт наверх фрагменты PCM в кодировке base64; response.text.delta и response.audio.delta приходят обратно вниз, а response.done отмечает конец хода.
Два практических замечания. Во-первых, браузер не может установить Authorization при рукопожатии WebSocket, поэтому соединение приходится открывать на стороне сервера, а аудио передавать клиенту через ваш собственный сокет — это не то, что можно напрямую подключить к фронтенду. Во-вторых, Qwen явно предупреждает, что набор параметров и событий отличается от предыдущего поколения LiveTranslate, поэтому любой код, написанный под Qwen3.5-LiveTranslate, нужно перепроверять, а не просто перенацеливать. Бесплатный пробный endpoint работает на omni.qwen.ai/live-translate, если вы хотите услышать задержку перед тем, как вкладывать время инженеров.
Чего это намеренно не делает
Qwen перечисляет ряд возможностей как недоступные, и этот список вносит ясность. Никакого вызова функций. Никакого структурированного вывода. Никакого веб-поиска. Никакого продолжения по префиксу, кэширования контекста или пакетного вывода. Никакого дообучения.
Это специалист, а не универсал, напяливший шляпу переводчика. Он не будет запускать ваш агентный цикл и не будет моделью, которая составляет краткое изложение встречи. Проектируйте соответственно: переводчик создаёт транскрипт и переведённый аудиопоток, а всё, что идёт после этого — извлечение пунктов действий, контроль глоссария, обратная запись в CRM — является задачей отдельной текстовой модели.
Именно на таком разделении роутер и оправдывает своё существование. Сам Qwen3.8-LiveTranslate доступен через собственный API вендора и несколько сторонних платформ; сегодня его нет в каталоге OrcaRouter, и мы не станем делать вид, что это не так. А что у OrcaRouter действительно есть — так это весь сопутствующий стек, включая собственный флагман Alibaba Qwen3.8-Max, разрежённую модель mixture-of-experts с 2,4 трлн параметров и контекстом в 1 млн токенов по цене $2,00 за миллион входных и $6,00 за миллион выходных токенов, тарифицируемых по прейскурантной цене провайдера без какой-либо наценки. Когда переводчик и модели, потребляющие его вывод, находятся за одним эндпоинтом и одним ключом, конвейеру транскрипции не нужен второй договор при замене суммаризатора, а автоматическое переключение при сбое сохраняет работоспособность той половины системы, что идёт дальше по конвейеру, когда один из провайдеров начинает сбоить — а при 10 запросах в минуту это сценарий, который стоит планировать заранее, а не обнаруживать постфактум.

Что посмотреть дальше
Две вещи превратили бы этот релиз из хорошо аргументированного утверждения в установленный факт. Первая — независимое измерение задержки: LAAL — это чётко определённая метрика, и любой, у кого есть пробный эндпоинт и стенд с секундомером, может получить число, которое Qwen не создавал. Вторая — собственная заявленная дорожная карта Qwen: приближение к нижнему пределу задержки, кросс-сессионная долговременная память и охват длиннохвостых языков и региональных диалектов. Именно по пункту о длиннохвостых языках и стоит требовать от них выполнения обещаний, потому что 60 исходных языков — это солидное число, которое незаметно исключает большинство говорящих в мире, а разрыв между демо, работающим на путунхуа и английском, и тем, что работает на йоруба или кечуа, — это именно то место, где продукты синхронного перевода исторически буксовали.
Пока что разумная позиция такова: Qwen3.8-LiveTranslate — первая модель синхронного перевода, чей главный показатель сопоставляется с людьми-переводчиками-синхронистами, а не с её собственной предшественницей, — и такая постановка — гораздо более сложный тест, чем тот, который она заменяет. Она пока его не прошла. Она лишь вызвалась его пройти.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
