
Qwen3.8-Omni-Flash уже здесь: контекст в 1 млн токенов, аудио на 98% дешевле, только текстовый вывод
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Запуск открылQwen3.8-Omni-Flash сегодня, 18 сентября 2026 года, для клиентов API, и главная цифра, с которой он начал, — это счёт, а не балл. По словам Qwen, за час аудиовхода новая модель обходитсяна 98% дешевле, чем её предшественница Qwen3.5-Omni-Plus; за час комбинированного аудио и видео — на 93% дешевле. Всё остальное в анонсе вытекает из этой подачи. Qwen3.8-Omni-Flash — это нативная омнимодальная модель: текст, изображение, аудио и видео на входе, контекст в один миллион токенов, до целого часа непрерывного аудио-видео в рамках одного вызова, — и Alibaba продаёт её не как лучшего описателя медиаконтента, а как первую модель Qwen, созданную, чтобы действовать на его основе. Слоган — «Омни-восприятие. Агентное исполнение». Подвох, прямо указанный в тех же материалах, состоит в том, что модель отвечает только текстом: она слышит и видит, но не говорит.
Ничто из нижесказанного не было независимо воспроизведено. Модели всего несколько часов, независимой оценки со стороны третьих сторон для неё пока не существует, и все показатели бенчмарков и ценовые цифры в материалах запуска — собственные данные Alibaba. Там, где цифра заявлена производителем, в этом тексте об этом говорится в том предложении, где она приводится; там, где оценка исходит от критика, а не от производителя, она приводится с указанием авторства. Единственное, что поддаётся сегодня независимой проверке, — что модель работает на платформах Alibaba, а не в чьём-либо ещё каталоге, — это то, о чём на запуске меньше всего хотят говорить.
Что на самом деле было выпущено
Спецификация на удивление чиста для омнимодального запуска, и в этом-то и вся суть: предыдущее поколение омни-моделей в этом семействе собирали из отдельных энкодеров восприятия, прикрученных к текстовой LLM, а эта построена напрямую на архитектурной линии Qwen3.8-Flash, где модальности обрабатываются нативно, а не приделаны сверху.
• Ввод — текст, изображение, аудио и видео; поддерживается стереофонический и четырёхканальный пространственный звук; вывод — только текст.
• Контекст — один миллион токенов, при этом максимальный ввод составляет примерно 991K (около 983K в режиме размышления), максимальный вывод — 131K, а бюджет рассуждений достигает 262K.
• Длительность — до одного часа непрерывного аудио или аудиовидео на один вызов; именно этот показатель позволяет реализовать сценарии встреч и длинных видео без разбиения на фрагменты.
• Охват речи — распознавание на 74 языках и синтез речи на 29 языках в сопутствующих инструментах; в одной публикации об этом релизе на китайском языке указано 113 языков и диалектов для аудиовхода.
• Доступность — платформа Qianwen AI и Alibaba Cloud Model Studio (Bailian), под API id qwen3-8-omni-flash. Веса не публикуются. Realtime-вариант описывается как первая омнимодальная модель с локализацией источника звука.

98% — это утверждение о затратах, и арифметика, стоящая за ним, стоит того, чтобы её увидеть.
Снижение стоимости часа аудио на 98% — это гораздо большее число, чем снижение цены токена на 98%, и разрыв между этими двумя вещами — именно там, где это объявление делает свою работу. Показатель за час получается путём оценки двухминутного образца и умножения на тридцать, при этом видео сэмплируется с720p и один кадр в секунду. Это законный способ указать производственную нагрузку, но в то же время это описание того, на что модели предлагается смотреть: одного кадра в секунду достаточно, чтобы понять, что было сказано, и примерно что происходило на экране, и совершенно недостаточно, чтобы проверять операции на уровне кадров, оценивать качество монтажа или поймать артефакт в одном кадре. Здесь перемножаются два изменения — подлинное снижение цены за единицу и гораздо более агрессивная политика сэмплирования, — и только первое является улучшением модели.
Сами цены за единицу конкретны. Международные тарифы указаны на уровне $0,15 за миллион входных токенов, $0,016 за миллион кэшированных входных токенов и $0,47 за миллион выходных токенов. Тарифы Bailian для внутреннего рынка указаны на уровне ¥0,8 за миллион для мультимодального ввода, снижены с примерно ¥18. Обратите внимание, что системы биллинга для международного и материкового рынков раздельны, а эти показатели не взаимозаменяемы; любой, кто станет сравнивать их напрямую, получит неверный ответ.
Это та часть релиза, где маршрутизация важнее обычного. OrcaRouter передаёт цену из прайс-листа провайдера с 0% наценкой, так что снижение цены вендором такого рода доходит до наших клиентов в день, когда оно вступает в силу, а не на следующем продлении контракта. Одно по-настоящему проверяемое сравнение уже есть в нашем собственном каталоге: Qwen3.8-Flash, мультимодальная модель, вместе с которой создавалась эта, доступна для маршрутизации уже сегодня по цене $0,15 за миллион входных токенов и $0,47 за миллион выходных — тот же прайс-лист, который Alibaba указывает для новой omni-модели, — и она пропустила через наш API 2,47 миллиарда токенов трафика за семь дней до написания этого текста, что является честным показателем того, насколько велик уже имеющийся спрос на этом уровне. Сама omni-модель пока не в нашем каталоге, и до тех пор, пока это не произойдёт, она работает на собственных платформах Alibaba и больше нигде. Мы не собираемся делать вид, что это не так.
Каждый бенчмарк в рамках запуска сравнивает одну вещь
В заголовке указано среднее улучшение более чем на 26% по примерно 30 оценкам — и каждая из этих оценок сравнивается с Qwen3.5-Omni-Plus. Это правильный базовый ориентир для запуска, и при этом узкий: он говорит, что семейство сдвинулось, а не где оно оказалось относительно чего-либо, за что вы, возможно, уже платите.
Отдельные показатели, все со слов вендора: WildClawBench-MM 71.0, рост на 36.5 пункта — самое крупное изменение в наборе; UniClawBench 69.6; AgenticVBench прибавил 22.3 пункта до 36.8; LongAudioSpan 82.7, рост на 8.3; OmniVideoBench 63.4, рост на 9.6; OmniCap-IF 28.2. Самая поразительная пара — диаризация говорящих на AliMeeting, где частота ошибок падает с 88.11 до 3.35, а cpWER — с 89.61 до 17.18 — скачок настолько велик, что заслуживает не аплодисментов, а тщательной проверки. Китайский технический разбор этого запуска утверждает именно это, объясняя улучшение в значительной степени инженерией фронтенда и диаризации, обёрнутой вокруг модели, а не её собственными рассуждениями, и предупреждает, что система выглядит специализированной на слуховом восприятии при сравнительно более слабом глубоком видеорассуждении. Это мнение критика, а не воспроизведённое измерение, но именно масштаб расхождения — причина держать его в уме.

Ещё одна цифра, которую стоит запомнить, — это вовсе не оценка. В режиме, который Alibaba называет Agentic Understanding, модель сама решает, на что смотреть и что слушать, вместо обработки каждого кадра, собирая свидетельства в несколько раундов от грубого к точному. На OmniVideoBench этот режим повышает точность с 63,4 до 67,8, одновременно сокращая число токенов на запрос с 145 736 до 79 117 — снижение на 45,7%. Одновременный рост точности и снижение затрат — самое сильное утверждение в релизе, и именно оно наиболее напрямую подкрепляет агентную концепцию.
Сравнение с Gemini уже, чем можно судить по освещению.
Позиционирование Alibaba таково: аудио-видео возможности «приближаются» к Gemini 3.8 Flash, а общая аудиопроизводительность её даже превосходит. Если отбросить риторику, заявленные самим вендором сравнения выглядят так. WildClawBench-MM: 71,0 против 58,9. SpotSoundBench: 67,2 против 39,7. MMAU: 81,8 против 76,9. DailyOmni: 85,1 против 84,0. Это реальные разрывы в аудио и в использовании инструментов с упором на аудио. Но они и выборочны. А вот на AgenticVBench — бенчмарке чисто видеорассуждений — порядок обратный: Gemini 45,0 против 36,8 у Qwen, и сама Alibaba признаёт, что Gemini по-прежнему лидирует в ряде тестов на понимание видео. Разумное резюме: Qwen забрал аудиополовину omni, но по видеополовине всё ещё отстаёт, — а это уже другое утверждение, нежели то, с которым вышли заголовки.
«Первая омнимодальная модель Qwen» требует уточнения
Утверждение о том, что Qwen3.8-Omni-Flash — это первая омнимодальная модель Qwen, сегодня широко распространилось, и здесь важна точность, потому что у семейства есть более ранний представитель, имеющий полное право на этот титул. Qwen2.5-Omni, 7B-модель с открытыми весами, выпущенная в марте 2025 года в архитектуре Thinker-Talker, также принимала на вход текст, изображения, аудио и видео — и генерировала как речь, так и текст. Что здесь действительно впервые — так это нативная омнимодальность: одна модель, построенная на основе Qwen3.8-Flash, а не текстовый LLM с подключёнными перцептивными энкодерами, плюс дизайн-бриф, ориентированный в первую очередь на агентов. Оба утверждения верны; однако повторяли только одно из них. Если вы оцениваете модель исходя из предположения, что до этой недели не существовало ни одной омнимодальной модели Qwen, вы неверно оцените путь обновления с Qwen2.5-Omni — а это сравнение мы отдельно разобрали.
Именно в инструментарии на самом деле и живёт претензия на агентность.
Вместе с моделью вышли две вещи, и они важнее, чем можно предположить по карточке модели, потому что именно они превращают восприятие в результат. Qwen-MM-Plugins — это набор мультимодальных плагинов для агентных обвязок, который даёт внешнему агенту понимание изображений, аудио, видео и документов, а также память для длинных видео и редактирование видео; он заявляет поддержку Codex, Claude Code, Qwen Code, Gemini CLI и ряда других, а в комплекте идут именованные инструменты, включая Video2Note, который превращает часы видео в иллюстрированные PDF-конспекты. Qwen-Live Harness — это открытый рантайм для непрерывного омнимодального взаимодействия в реальном времени, выступающий в роли слоя планирования, где пользователь общается вживую и передаёт более тяжёлую работу фоновым агентам. Одна оговорка из материалов дня запуска: страница Qwen-Live Harness на GitHub возвращала 404, когда её проверяло издание Gigazine, так что относитесь к этим инструментам как к анонсированным, а не подтверждённым, пока репозитории не станут доступны.
Предложение, которое погребает запуск: оно не говорит.
Для модели, предыдущая версия которой генерировала речь, тот факт, что Qwen3.8-Omni-Flash принимает на входе мультимодальные данные, а на выходе выдаёт текст, — это самая значимая строка в спецификации, и в материалах она фигурирует в основном как сноска. Это означает, что модель нельзя просто так встроить в продукт для преобразования речи в речь. Для любого дубляжа, голосового агента или разговора в реальном времени, построенного на ней, требуется внешний этап синтеза речи, а для видео — внешний рендерер; именно поэтому существуют набор плагинов и live-стенд. Практическое следствие — конвейер с большим количеством движущихся частей, чем у «одной omni-модели», и задержка, бюджет которой приходится распределять между всеми ними.
В релизе спрятана наглядная демонстрация этого разрыва и того, для чего эта модель хороша. В эксперименте «модель оптимизирует модель» Qwen3.8-Omni-Flash автономно улучшила распознавание сычуаньского диалекта у Qwen2.5-Omni-3B, сократив частоту ошибок на уровне символов с 25,79% до 15,30% за двенадцать часов и создав 3 413 обучающих примеров за четыре раунда. Модель, способная диагностировать и исправлять обработку диалекта у меньшего «собрата», делает то, чего не может API транскрипции. Именно это, а не таблица бенчмарков, — самый ясный аргумент в пользу того, что здесь подразумевается под «агентностью».

Что бы изменило наше прочтение?
Честная картина такова: это хорошо прописанный запуск с убедительной ценовой историей, без независимой оценки и как минимум с одним структурным ограничением, которое в анонсе замалчивается. Три вещи могли бы внести окончательную ясность. Запись в Artificial Analysis или LMArena превратила бы вендорские цифры в сопоставимые, но такой записи пока нет. Независимая проверка сокращения числа токенов на 45,7% — утверждения, что точность растёт, а стоимость падает, — подтвердила бы самый полезный и наименее эффектный результат в релизе. А независимое измерение диаризации AliMeeting показало бы, обусловлено ли падение на 88 пунктов моделью или окружающим её пайплайном.
До тех пор разумная позиция — та же, что применима к любой модели в первый день её существования: её стоит протестировать, но не стоит делать основой производственного маршрута. Если вы уже маршрутизируете через OrcaRouter, практичный шаг — оставить рабочую нагрузку на моделях, которые вы измерили, и относиться к Qwen3.8-Omni-Flash как к кандидату, чтобы проверить его в сравнении с ними на ваших собственных аудио и видео, а не на таблице бенчмарков любого из вендоров. Если ваш сценарий — анализ длинных совещаний или медиа на китайском и английском, экономика токенов здесь достаточно сильна, чтобы оправдать тестирование уже сейчас.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
