
Qwen3.8-Omni-Flash, пять дней спустя: одна дверь, никаких весов и первые оценки не от Alibaba
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Через пять дней после того, как вендор открыл Qwen3.8-Omni-Flash для API-клиентов, у модели по-прежнему есть ровно один дом. Она работает на собственной платформе Qianwen вендора и в его облачном сервисе Bailian; сторонние листинги, появившиеся с момента запуска, являются прокси-серверами перед теми же самыми эндпоинтами, а не вторым местом, где модель живёт. Веса не были выпущены. Цифры, представленные в день запуска — сокращение стоимости часа аудио на 98%, средний прирост на 26% по сравнению с Qwen3.5-Omni-Plus, миллион токенов контекста, вывод только текста — остаются собственными данными вендора и не воспроизведены. Что действительно изменилось за пять дней — это не модель, а почва вокруг неё: появился тонкий слой сторонних оценок, поддержка фреймворков появилась в нулевой день, и сравнение, которое все пытаются провести, — это сравнение с Gemini 3.8 Flash а не с Qwen3.8-Flash с которым эта модель создавалась. Каждый из этих пунктов заслуживает более пристального внимания, чем уделило ему освещение запуска.
Дверь — хорошая дверь, и она единственная.
Доступность расширилась, но не стала множественной. Модель без изменений отвечает на запрос в формате OpenAI, а значит, существующий клиентский код по большей части работает; ломается именно эндпоинт, потому что хосты для международного и материкового рынков — это отдельные сервисы с отдельным биллингом. Код, нацеленный на значение по умолчанию, либо не сработает, либо будет тарифицироваться в неверной валюте, а история с почасовой ценой действует только на международной стороне. Клиентские библиотеки с открытым исходным кодом выпустили поддержку модели с первого дня, что действительно полезно и при этом не является вторым провайдером: библиотека, которая работает с Bailian, — это удобная обёртка вокруг того же единственного источника поставок.
Это тот структурный риск, который стоит назвать прямо. У модели из единственного источника нет пути отказоустойчивости. Если эндпоинт начинает ограничивать запросы, деградирует или целый регион отключается, идти некуда, и никакая поддержка клиентских библиотек этого не изменит. Именно поэтому мы прямо заявляем о своей позиции, а не намекаем на обратное: Qwen3.8-Omni-Flash нет в нашем каталоге. Мы его не размещаем, и читатель, который зарегистрируется в расчёте маршрутизировать его, был бы введён в заблуждение. Маршрутизировать можно остальную часть семейства — Qwen3.8-Flash и Qwen3.8-Maxоба работают в нашем API — и OrcaRouter передаёт цену провайдера из прайс-листа с наценкой 0%, поэтому когда Alibaba меняет цены на omni-модель или в тот день, когда omni-модель станет доступна для маршрутизации, изменение доходит до клиентов в тот же день, а не при следующем продлении договора.

Первые результаты, которые не от Alibaba, скудны, и они не льстят.
На Artificial Analysis для этой модели нет ничего, и это отсутствие — честный заголовок спустя пять дней: таблицы лидеров, которые все цитируют для смежных моделей, ещё не содержат строки для omni-модели. Пробел заполнило нечто другое. Сторонняя платформа оценки начала публиковать прогоны против модели, и её резюме стоит прочитать именно потому, насколько много оно не говорит. В нём сообщается о классификации электронной почты с точностью 99,0% (86-й процентиль), этике — 95,0% (23-й процентиль) и рассуждениях — 56,0%, что помещается в 28-й процентиль и называется заметной слабостью; скорость попадает в 21-й процентиль, стоимость — в 58-й, при общей успешности 89%.
Относитесь к ним с настоящей осторожностью — и не только потому, что выборка мала. Та же страница датирует выпуск модели 20 сентября, двумя днями позже того, как её выпустила Alibaba, не указывает даты запуска ни для одного из результатов и отображает пустую таблицу бенчмарков под сводкой, описывающей числа, которых в таблице нет. Это портрет раннего, слабо контролируемого испытательного стенда, а не измеренной оценки; и честное прочтение состоит в том, что это первые точки данных не от вендора, а не первые надёжные. Они — повод протестировать модель самостоятельно, а не повод делать какие-либо выводы. Направление, однако, согласуется с тем, на что материалы самого вендора намекают своим умолчанием: это модель восприятия и длинных медиа, и лидерборды с упором на рассуждения — не то, на что она была нацелена.
В результатах поиска также есть ловушка, которая будет подлавливать людей в ближайшие несколько недель. Qwen 3.8, текстовая модель, имеет Artificial Analysis Intelligence Index в районе сорока, и это число цитировалось более чем в одной сводке, как будто оно описывало омни-модель. Это не так. Это разные модели с разными задачами, и у омни-модели пока вообще нет индекса.

Таблица бенчмарков по-прежнему — это один вендор, сравнивающий себя с самим собой.
Стартовый показатель — среднее улучшение более чем на 26% примерно в тридцати оценках — измеряется исключительно в сравнении с Qwen3.5-Omni-Plus. Это говорит о том, что семейство продвинулось вперёд. Но не говорит, где модель находится относительно чего угодно, за что вы, возможно, уже платите, а избирательные сравнения, распространявшиеся вместе с ним, тоже не закрывают этот пробел. Картина, заявленная производителем в сравнении с Gemini 3.8 Flash — это настоящая победа на аудиолидербордах и поражение на тех, что измеряют агентную работу с видео: WildClawBench-MM 71,0 против 58,9 и SpotSoundBench 67,2 против 39,7 с одной стороны, AgenticVBench 36,8 против 45,0 и OmniGAIA 74,0 против 78,6 с другой. Собственные обобщающие формулировки Alibaba — аудиовизуальная производительность «приближается» к Gemini, общая аудиопроизводительность превосходит её — осторожнее, чем заголовки, к которым это привело, и именно осторожная версия является точной.
• Контекст — 1 млн токенов, при этом максимальный ввод — примерно 991 тыс. (около 983 тыс. в режиме размышления), а максимальный вывод — 131 тыс.
• Модальность — на входе текст, изображение, аудио и видео; на выходе только текст. В базовой модели нет генерации речи.
• Длительность — до одного часа непрерывного аудио или аудио-видео на вызов, что позволяет работать со встречами и длинными медиа без разбиения на фрагменты.
• Языковой охват — распознавание на 74 языках плюс 39 китайских диалектов в материалах запуска, при этом в других местах для аудиоввода приводятся более широкие цифры (113 языков и диалектов).
• Входные данные — принимается стереофонический и четырёхканальный пространственный звук; вариант Realtime описывается как первая омнимодальная модель, способная находить цель по звуку.
• Цена — $0.15 за миллион входных токенов, $0.016 для кэшированных, $0.47 за выходные на международной стороне, и отдельный прайс-лист для материкового Китая, который не подлежит сравнению.
98% — это реальность, и это не ваш счёт.
Согласно собственной методологии Alibaba — двухминутная выборка, умноженная на тридцать, видео дискретизировано в 720p с частотой один кадр в секунду — час аудиовхода падает с $0,28 до менее $0,01, а час комбинированного аудио и видео — с $3,27 до $0,20. Это крупные, конкретные сокращения, о которых сообщает поставщик, и это сокращения по одной статье затрат. Арифметика, которая имеет значение, — это какую долю вашей рабочей нагрузки составляет эта статья затрат. Пайплайн, который тратит большую часть своих токенов на вывод, на кэшированный контекст или на видеокадры, дискретизированные плотнее, чем один раз в секунду, увидит гораздо меньшее процентное изменение в счёте, чем обещает заголовок, а заголовок касается входного аудио, а не общего итога. Добавьте вывод только текста — и разрыв снова расширяется: всё, что должно отвечать голосом, требует второй модели, а эта модель оплачивается отдельно.
Это та часть картины, где маршрутизация оправдывает себя. Ценность сквозного маршрутизатора не в скидке — она в том, что вы платите по собственному прайс-листу поставщика, и в том, что рабочую нагрузку можно распределить между несколькими моделями, так что модель от одного источника становится компонентом, а не зависимостью. Универсальная модель, являющаяся единственным доступным для вызова вариантом, — это единая точка отказа как на уровне доступности, так и на уровне ценообразования.

Что на самом деле могли бы сказать вам пять дней производства
Три вещи закрыли бы открытые вопросы. Независимое измерение результата диаризации AliMeeting — падение частоты ошибок с 88,11 до 3,35 и cpWER с 89,61 до 17,18 — показало бы, относится ли это к модели или к диаризации и фронтенд-инженерии, обёрнутым вокруг неё, которым, по крайней мере, один китайский технический анализ приписывает большую часть прироста. Воспроизведённый тест сокращения токенов в агентном режиме, в котором точность выросла с 63,4 до 67,8 на OmniVideoBench, а количество токенов на запрос упало с 145 736 до 79 117, подтвердил бы самое полезное утверждение в релизе: что модель может одновременно становиться лучше и дешевле. А строка в Artificial Analysis или на арене превратила бы все приведённые выше вендорские цифры во что-то сопоставимое — а это предпосылка для того, чтобы модель выбирали, а не просто пробовали.
До тех пор разумный подход — тот же, что применим к любой модели возрастом пять дней с одним хостом и без независимой оценки: её стоит измерять на собственных аудио и видео, но не стоит делать единственным путём через ваш пайплайн. Если ваша рабочая нагрузка — это анализ длинных встреч или медиа на китайском или английском, а ваши затраты определяются в первую очередь часами входных данных, а не выходными токенами, здешняя экономика достаточно выгодна, чтобы оправдать тест уже на этой неделе. Если вашей рабочей нагрузке нужна речь на выходе или нужен запасной вариант на случай деградации провайдера, модель в её нынешнем виде не может быть полным решением — и никакая поддержка во фреймворках с первого дня этого не изменит.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
