
Qwen3.8-Omni-Flash против Qwen 3.8: специализированная сборка против флагманской
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 984 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 196 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Если вам нужна краткая версия: Qwen3.8-Omni-Flash примерно в тринадцать раз дешевле за токенчем Qwen 3.8 и единственный из двух, рассчитанный на работу с часом аудио и видео без захлёбывания — тогда как Qwen 3.8, открытое ядро с 2,4 триллиона параметров на вершине линейки Qwen3.8, — это тот, который вы используете, когда ответ должен быть правильныма не дешёвым, и единственный из двух, чьи веса можно скачать. У них общая длина контекста, название семейства и окно запуска с августа по сентябрь. Они не взаимозаменяемы, и вся ценность этого сравнения в том, чтобы понимать, какой вопрос вы на самом деле задаёте.
Если быть точными в названиях, потому что семейство перенаселено. Qwen 3.8 здесь означает открытое ядро на основе смеси экспертов 2.4T-A95B — модель, стоящую за эндпоинтом Qwen3.8-Max, которую Alibaba представила 3 августа 2026 года и опубликовала веса для неё 12 августа, и которую Artificial Analysis оценивает в 40 по своему Индексу интеллекта. Qwen3.8-Omni-Flash — это нативная омнимодальная модель, которую Alibaba ввела в API-сервис 18 сентября 2026 года, построенная на архитектурной линии Qwen3.8-Flash, принимающая текст, изображения, аудио и видео и возвращающая текст. Всё о флагмане — по данным вендора или независимо проиндексировано, как отмечено; всё об омнимодели — только по данным вендора, потому что ей всего несколько часов и никто за пределами Alibaba её не измерял.
Две модели, одно семейство, противоположные дизайн-брифы
Соблазн — читать это как большую и малую модели одного поколения, примерно как сопоставлять Qwen3.8-Max с Qwen3.8-Flash. Такое прочтение неверно, и эта ошибка стоит денег. Qwen 3.8 — это ядро, представляющее собой механизм рассуждений, который попутно принимает изображения и видео; его пропускная способность измеряется в токенах в секунду на сложных задачах, его цена отражает вычислительные затраты на прямой проход с 95 млрд активных параметров, а его оценочный лист — это список бенчмарков на рассуждение и программирование. Qwen3.8-Omni-Flash — это движок восприятия и действия, который попутно умеет рассуждать; его цена устанавливается с учётом стоимости обработки часов медиаконтента, а его оценочный лист — это список бенчмарков на аудио, видео и вызов инструментов. Первый оптимизирован под глубину на токен. Второй оптимизирован под токены на час контента.
Эта разница наиболее отчётливо проявляется там, о чём маркетинг умалчивает. Обе модели принимают примерно миллион токенов, и обе принимают видео. Но Qwen3.8-Omni-Flash явно спроектирована вокруг проблемы длительности — до одного часа непрерывного аудио и видео в одном вызове, с режимом Agentic Understanding, в котором модель сама выбирает, что сэмплировать, вместо обработки каждого кадра, сокращая число токенов на запрос с 145 736 до 79 117 и одновременно повышая точность на OmniVideoBench с 63,4 до 67,8. Qwen 3.8 не имеет опубликованного эквивалентного механизма. Подать ей два часа видео на бумаге возможно; сделать это по цене, которая выдержит контакт с финансовым отделом, — совсем другой вопрос, и именно на этот вопрос омни-модель и создавалась, чтобы ответить.
Измерения, которые на самом деле решают исход
• Цена — Qwen3.8-Omni-Flash: $0,15 за миллион входных токенов и $0,47 за миллион выходных, против Qwen 3.8 — $2,00 и $6,00. Чтение из кэша: $0,016 против $0,25.
• Открытые веса — Qwen 3.8 опубликовала веса 12 августа 2026 года по специальной лицензии; Qwen3.8-Omni-Flash доступна только через API, и Alibaba не заявляла, что выпустит её.
• Контекст — один миллион токенов с обеих сторон; максимальный ввод 991K на модели omni при максимальном выводе 131K и бюджете рассуждений 262K.
• Длительность медиа — до одного часа непрерывного аудио и видео в одном omni-вызове; для флагманской модели задокументирован ввод видео, но без информации о стоимости за час.
• Выходная модальность — текст с обеих сторон. Ни одна из них не генерирует речь, несмотря на происхождение omni-модели.
• Независимая оценка — Qwen 3.8 находится на отметке 40 в Artificial Analysis Intelligence Index. У Qwen3.8-Omni-Flash пока нет никакой независимой оценки.

Почему таблицы бенчмарков не могут разрешить этот вопрос
Никакой сравнительной таблицы «лицом к лицу» не существует, и в ближайшее время не появится. В материалах Alibaba о запуске Qwen3.8-Omni-Flashего сравнивают исключительно с Qwen3.5-Omni-Plus, его непосредственным предшественником, и с Gemini 3.8 Flash; цифры флагмана взяты из совершенно иного набора оценок на рассуждение и программирование. У этих двух таблиц нет ни одной общей строки. Любой, кто публикует таблицу, где они стоят рядом на одной оси, эту ось построил сам.
То, что можно честно сказать, носит ориентировочный характер. Судя по собственным данным производителя, omni-модель — это большой шаг вперёд по сравнению с заменяемой линейкой omni: средний прирост свыше 26% примерно по тридцати оценкам, включая WildClawBench-MM — 71,0, UniClawBench — 69,6, LongAudioSpan — 82,7, — и настоящий, но частичный шаг вперёд относительно Gemini 3.8 Flash, где она лидирует в аудиоцентричных бенчмарках, таких как SpotSoundBench (67,2 против 39,7) и MMAU (81,8 против 76,9), и уступает в бенчмарке AgenticVBench на чистое видеорассуждение (36,8 против 45,0). Что касается флагманского сегмента, показатель Qwen 3.8 в Index, равный 40, — это независимое измерение, и он значит больше любого из вышеперечисленного. Это разные типы свидетельств, и их не следует усреднять вместе.

Расчётное сравнение затрат с указанием принятого допущения
Возьмём задачу анализа длинного документа и видео: 300 000 входных токенов и 20 000 выходных токенов — правдоподобный объём для девяностоминутной записанной встречи со слайдами. Для Qwen3.8-Omni-Flash это 300 000 × $0,15 за миллион = $0,045 за входные данные и 20 000 × $0,47 за миллион = $0,0094 за выходные данные, то есть около 5,4 цента. Для Qwen 3.8 тот же запрос стоит 300 000 × $2,00 за миллион = $0,60 и 20 000 × $6,00 за миллион = $0,12, или около 72 цента. Чуть более чем в тринадцать раз дороже при том же количестве токенов.
Число, которое меняет решение, — это не соотношение, а объём. Если таких задач сто в день, это примерно 5 долларов в день против примерно 72 долларов в день — разница между функцией, которую вы выпускаете, и функцией, масштаб которой вы сокращаете. Но если задача — одно сложное извлечение из контракта на 300 тыс. токенов, где неверный ответ стоит часа человеческой проверки, 13-кратная надбавка не имеет значения, и более сильная модель рассуждений выигрывает за счёт первой ошибки, которую не совершает. Задайте допущение до того, как посмотрите на строку с ценой, а не после.
Где каждый из них действительно выигрывает
Qwen3.8-Omni-Flash выигрывает во всём, что измеряется часами. Транскрипция встреч с диаризацией и извлечением последующих задач, суммаризация длинных видео, аудиовизуальные исследовательские отчёты, конвейеры создания субтитров и любой агент, которому нужно самостоятельно решать, какая минута записи имеет значение. Заявленное производителем улучшение диаризации — падение частоты ошибок определения говорящего в AliMeeting с 88,11 до 3,35 — это тот самый прирост, который превращает конвейер с ручной проверкой в полностью автоматический, хотя китайский технический разбор этого запуска утверждает, что значительная часть выигрыша обусловлена инженерией фронтенда и диаризации вокруг модели, а не самой моделью, так что проверьте её на собственных аудиозаписях, прежде чем отказываться от этапа ручной проверки. Омни-модель также однозначно выигрывает по цене при любых больших объёмах текстовых задач, где её качество текста достаточно, — а Alibaba утверждает, что оно сопоставимо с текстовыми моделями того же размера; это утверждение независимо не воспроизводилось, и его стоит проверить, а не принимать на веру.
Qwen 3.8 побеждает там, где результат оценивают, а не считают: сложные рассуждения, долгосрочная агентная работа, крупномасштабная работа с кодом, анализ документов на миллион токенов, где синтез и есть продукт. Она также выигрывает по измерению, не имеющему никакого отношения к бенчмаркам, — у неё открытые веса. Если ваше ограничение — это резидентность данных, развёртывание на собственных серверах, тонкая настройка или просто нежелание видеть поставщика в цепочке инференса, omni-модель вообще не является кандидатом, и никакое ценовое преимущество не закроет этот разрыв. Именно это единственное ограничение определяет больше реальных внедрений, чем все числа выше.
Запуск их без двух контрактов
Практическая сложность в подобном сравнении редко заключается в выборе модели; она в том, что вам в итоге приходится интегрировать двух поставщиков, два биллинговых соглашения и два набора клиентского кода, чтобы выяснить, какая из них вам нужна. Qwen3.8-Max — эндпоинт с открытым ядром на 2,4 триллиона параметров — доступен на OrcaRouter под идентификатором модели qwen/qwen3.8-max, по цене $2.00 за миллион входных токенов и $6.00 за миллион выходных, с контекстом в один миллион токенов и вводом текста, изображений и видео, наряду с более чем 200 другими моделями на одном ключе по прайс-листу провайдера с 0% наценки и автоматическим переключением при сбое между провайдерами, если эндпоинт деградирует. Qwen3.8-Omni-Flash отсутствует в этом каталоге — он работает на собственных платформах Alibaba — поэтому честная конфигурация на сегодня такова: флагман на нашем маршруте и омни-модель, вызываемая напрямую, а слой маршрутизации даёт вам место, куда можно поместить проигравшего тест после того, как вы его проведёте.

Вердикт
Выбирайте Qwen3.8-Omni-Flash, когда входные данные длинные, выходные — короткие, а объём делает цену за единицу решающим ограничением. Выбирайте Qwen 3.8, когда входные данные плотные, выходные данные и есть продукт, и либо корректность, либо контроль развёртывания не подлежат компромиссу. Зона пересечения — понимание видео — единственное место, где действительно возможно прямое сравнение, и в этой зоне omni-модель выигрывает по стоимости и длительности, а флагман — по рассуждениям и открытым весам. Прогоните обе на собственных данных, прежде чем сделать окончательный выбор; у omni-модели пока нет независимой оценки, а ценовое преимущество в день запуска — как раз то, что стоит подтверждать по счёту, а не по анонсу.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
