
Qwen3.8-Omni-Flash против Qwen2.5-Omni: спустя 18 месяцев апгрейд потерял свой голос
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Вот факт, который делает это сравнение интереснее, чем обычное обновление поколения. Старая модель умеет говорить, а новая — нет. Qwen2.5-Omni, выпущенная в марте 2025 года, принимала на вход текст, изображения, аудио и видео и отвечала текстом или потоковой естественной речью, в единой сквозной модели, которую можно было скачать. Qwen3.8-Omni-Flash, выпущенная 18 сентября 2026 года, охватывает те же четыре модальности в контекстном окне в тридцать раз больше, принимает час непрерывного аудио-видео там, где её предшественница справлялась лишь с секундами, и возвращает только текст. Восемнадцать месяцев работы дали значительно более широкий вход и отняли канал вывода. Прогресс это или компромисс — целиком зависит от того, для чего вы использовали старую модель, и ответ чётко делится на две части.
Показатели для Qwen2.5-Omni — это данные вендора, из его материалов релиза в марте 2025 года, и восемнадцать месяцев широкого развертывания частично их подтвердили. Показатели для Qwen3.8-Omni-Flash также принадлежат Alibaba, из материалов запуска, опубликованных за несколько часов до написания этого текста, и ничто в них не было независимо воспроизведено. Там, где утверждение исходит от критика, а не от вендора, это указывается. Единственный структурный факт, не требующий проверки, также является самым значимым: Qwen2.5-Omni имеет открытые веса и доступен для скачивания, а Qwen3.8-Omni-Flash — нет.
Чем был Qwen2.5-Omni и почему это имело значение
Когда она вышла 26 марта 2025 года, Qwen2.5-Omni стала первой сквозной омнимодальной моделью в семействе — релиз позиционировался как ответ на проблему «зоопарка специалистов», когда для транскрипции, зрения и голоса требовались отдельная модель и отдельный связующий слой. Модель на 7B обрабатывала все четыре входные модальности, а также вывод текста и речи, заявляла о передовых результатах на фьюжн-бенчмарке OmniBench, опередив Gemini-1.5-Pro, и сообщала о показателе качества генерации речи 4,51, который Alibaba описывала как человеческий уровень. Вариант на 3B следовал той же архитектуре.
Инженерные решения, которые заставили это работать, стоит назвать, потому что новая модель их не использует. Thinker-Talker разделял задачу на две части: трансформер Thinker объединял аудио- и визуальные энкодеры и создавал семантику и текст, а Talker потоково выдавал речевые токены из скрытых состояний Thinker, разделяя полную историю диалога. Выровненный по времени мультимодальный RoPE (TMRoPE) чередовал позиции видео и аудио, чтобы оба потока оставались синхронизированными. Потоковая обработка блоками позволяла энкодерам выполнять восприятие, пока языковая модель обрабатывала длинные последовательности, что и сделало возможными речевые ответы с низкой задержкой. Вместе с ним поставлялись два фиксированных голоса — Chelsie и Ethan.
Ограничения были столь же реальными. Контекст составлял 32 768 токенов. Память была ограничивающим фактором в гораздо большей степени, чем вычисления: собственные таблицы Alibaba оценивают BF16-инференс с FlashAttention-2 примерно в 31 ГБ видеопамяти для 15-секундного видео, в 42 ГБ для 30 секунд и в 60 ГБ для полной минуты. Минута видео, на 7B-модели, на одном из крупнейших одиночных GPU, которые можно арендовать. Именно это число стоит держать в уме, потому что именно это число модель 2026 года была создана, чтобы уничтожить.
Что такое Qwen3.8-Omni-Flash
Новая модель является нативно омнимодальной, а не собранной из частей — она построена непосредственно наQwen3.8-Flash, архитектурной линии, а не представляет собой текстовую LLM с прикрученными к ней энкодерами восприятия, и это структурное различие, а не просто обозначение поколения. Она принимает текст, изображения, аудио и видео, включая стерео- и четырёхканальный пространственный звук, и возвращает текст в рамкахконтекста на один миллион токеновс максимальным объёмом ввода примерно 991K, максимальным объёмом вывода 131K и бюджетом рассуждений 262K. Она обрабатываетдо одного часа непрерывного аудио и видео за один вызов. Распознавание речи охватывает 74 языка, а генерация речи для 29 языков реализована в сопутствующих инструментах, а не самой моделью. Она доступна на платформе Qianwen AI и в Alibaba Cloud Model Studio под идентификаторомqwen3-8-omni-flash, по цене $0,15 за миллион входных токенов и $0,47 за миллион выходных, при этом кэшированный ввод стоит $0,016.

Восемнадцать месяцев, измерение за измерением
• Контекст — 32 768 токенов у Qwen2.5-Omni против одного миллиона у Qwen3.8-Omni-Flash, примерно тридцатикратное увеличение.
• Длительность медиа — секунды видео, ограниченная памятью GPU, против одного часа непрерывного аудио и видео в одном хостируемом вызове.
• Вывод — текст плюс потоковая естественная речь на старой модели; только текст на новой.
• Развёртывание — Qwen2.5-Omni — это модель с открытыми весами под Apache-2.0, которую можно скачать с Hugging Face и ModelScope; Qwen3.8-Omni-Flash доступна только через API, выпуск весов не анонсирован.
• Аппаратное обеспечение — 7B параметров, требующих до ~60 ГБ памяти GPU для минуты видео, против размещённой конечной точки, которую вы вообще не подготавливаете.
• Цена — старая модель обходится вам в GPU; новая стоит $0,15 за миллион входных токенов, и Alibaba утверждает, что аудиовход в час на 98% дешевле, чем поколение Qwen3.5-Omni-Plus, которое она заменяет.
• Генерация речи — два фиксированных голоса в 2025 году против 29 языков генерации речи в инструментарии 2026 года, и ничего из этого не создаётся самой моделью.
Сделка, которую никто не афишировал
Прочитайте обе спецификации вместе — и форма последних восемнадцати месяцев становится ясной. Alibaba потратила этот промежуток на решение задачи ввода — сколько медиаданных модель способна поглотить, насколько дёшево и какую часть решений она может принимать сама. Qwen3.8-Omni-Flash — триумф на этой оси. Режим Agentic Understanding, в котором модель сама выбирает, что сэмплировать, вместо обработки каждого кадра, сокращает число токенов на запрос с 145,736 до 79,117, одновременно повышая точность OmniVideoBench с 63.4 до 67.8, а вендор сообщает, что ошибка диаризации говорящих на AliMeeting падает с 88.11 до 3.35.
То, что этот интервал не сделал приоритетом, — это вывод. Определяющая особенность модели 2025 года — одна модель, которая слышит вас и отвечает вслух, от начала до конца, без отдельного синтезатора речи, — здесь не имеет преемника. Если вы построили голосового агента, конвейер дубляжа или инструмент доступности на Talker из Qwen2.5-Omni, модель 2026 года — не обновление для него; это компонент, к которому придётся прикрутить новый этап синтеза речи, добавив задержку и вендора в конвейер, у которого раньше не было ни того, ни другого. В материалах запуска об этом честно сказано, если внимательно вчитаться в строку о модальностях, но это не вынесено в заголовок, и любой, кто мигрирует в предположении, что «omni» означает одно и то же в обоих релизах, обнаружит разницу в продакшене.

Почему модель 2025 года всё ещё востребована
Три причины, и ни одна из них не ностальгия. Первая — голос, как выше. Вторая — открытые веса: 32K контекста и 7B-размер будут работать на оборудовании, которое вы контролируете, офлайн, без передачи данных за пределы организации и без оплаты за токен — единственный вариант, если ваше аудио подпадает под требование о резидентности данных или бюджет задержки не позволяет совершить круговой обмен. Третья — стоимость при очень малых объёмах. GPU, который у вас уже есть, не требует дополнительных затрат; 0,15 доллара за миллион токенов у облачной модели — дёшево, но не бесплатно, а фиксированные затраты на подготовку инфраструктуры для работы с ней ощутимы для нагрузки, запускаемой дважды в неделю.
Контраргумент состоит в том, что ограничения старой модели с каждым годом давят всё сильнее. Минута видео, 32K контекста и отсутствие вызова инструментов или структурированного вывода в мире, где агенты — это стандартная форма развёртывания, — это узкие рамки. Для конвейера, который должен принимать записи совещаний, Qwen3.8-Omni-Flash не просто лучше — это разница между возможным и невозможным, потому что модель 2025 года физически не способна удержать такой ввод.
Стоит говорить конкретно о том, сколько жизни ещё осталось в старых весах, ведь «legacy» их недооценивает. Этот Qwen2.5-Omni-7B репозиторий зафиксировал 343 676 загрузок за последний месяц, когда мы проверили его 18 сентября 2026 года; при этом на его основе построены около сотни Spaces сообщества и десятки дообучений, адаптеров и квантований. Что бы ни делал флагман, множество людей всё ещё выпускает решения на модели 2025 года — и, что примечательно, Hugging Face не указал ни одного провайдера инференса, развёртывающего её, а значит, почти всё это использование приходится на самостоятельный хостинг.
Новая модель улучшает старую.
Самая странная и самая убедительная деталь в анонсе спрятана ближе к концу материалов. В эксперименте, который Alibaba описывает как модель, оптимизирующую модель, Qwen3.8-Omni-Flash автономно улучшила распознавание речи на сычуаньском диалекте у модели Qwen2.5-Omni-3B — младшего собрата модели, которую она номинально заменяет, — сократив частоту ошибок на уровне символов с 25,79% до 15,30% в течение двенадцати часов и создав 3 413 обучающих образцов за четыре раунда.
Это более убедительный аргумент в пользу новой модели, чем любой бенчмарк в релизе, и он переосмысляет связь между ними. Модель 2026 года — не только замена модели 2025 года; это инструмент, который делает веса 2025 года лучше. Если вы используете Qwen2.5-Omni в продакшене для языка или диалекта, который она обрабатывает плохо, практический путь может состоять в том, чтобы сохранить развёртывание и использовать новую модель для создания обучающих данных, а не переносить нагрузку. Однако учтите, что это демонстрация, заявленная производителем, без опубликованной методологии, и её следует рассматривать как обнадёживающий частный пример, а не как воспроизводимый рецепт.

Если вы мигрируете
Решение редко сводится к одной модели. Команда, уходящая от развёрнутой на собственных серверах omni-модели, выбирает между тремя формами: остаться на открытых весах и продолжать обеспечивать инфраструктуру, перейти на API вендора и отказаться от контроля или разделить нагрузку так, чтобы на размещённую у провайдера модель попадала только та часть, которой требуется приём миллиона токенов. Этот третий вариант обычно правильный, и именно его люди пропускают, потому что он звучит как больше работы, чем есть на самом деле, — дообучение под диалект, на которое вы потратили месяц, не обязательно выбрасывать из-за того, что этап составления сводок по встречам переместился.
Маршрутизация помогает на стыках. OrcaRouter даёт вам один ключ к более чем 200 моделям с наценкой 0% к прайс-листу провайдера и автоматическим переключением при отказе, если эндпоинт деградирует, а значит, размещённой половине разделённого пайплайна не нужны ни собственный договор, ни собственный клиентский код, ни собственный мониторинг, прежде чем вы поймёте, оправдывает ли нагрузка всё это. Чтобы внести ясность в то, чего мы не делаем: ни одна omni-модель не входит в наш каталог — обе работают на платформах Alibaba или на вашем собственном оборудовании, — так что это решение о маршрутизации, которое вы принимаете вокруг моделей, а не через нас.
Кому стоит переезжать, а кому — нет
Переходите, если ваша нагрузка — это длинные аудио- или видеоматериалы, если именно 32K контекста мешают появлению пайплайна, если вам нужно агентное поведение при работе с медиа или если диаризация говорящих в масштабе — ваша проблема. Оставайтесь, если вам нужно, чтобы модель говорила, если ваше аудио не может покидать вашу инфраструктуру, если вы зависите от конкретных весов Qwen2.5-Omni, которые вы уже настроили, или если объём ваших вызовов достаточно низок, чтобы собственная GPU оказалась выгоднее оплаты по счётчику.
Неудобный вывод состоит в том, что это не столько замена, сколько ответвление в линейке продуктов. Alibaba потратила восемнадцать месяцев на создание лучшей из возможных моделей приёма и не создала преемника для выходной половины. Если ваша работа связана со стороной приёма, обновление почти обязательно. Если она связана со стороной вывода, модель 2025 года по-прежнему остаётся самым новым из того, что делает нужное вам, — и это стоит знать, прежде чем планировать миграцию, которая тихо удалит функциональность, от которой вы зависите.
