
Qwen3.8-Omni-Flash против Gemini Omni 1.1 Flash: один смотрит видео, другой создаёт его
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Короткий ответ: эти двое не заменяют друг друга, и сравнение имеет смысл только тогда, когда вы перестаёте воспринимать «omni» как категорию. Qwen3.8-Omni-Flash, который вендор открыл для клиентов API 18 сентября 2026 года, принимает текст, изображения, аудио и видео и возвращает текст — это модель для того, чтобы прочитать час встречи или отснятого материала и рассказать, что произошло. Gemini Omni 1.1 Flash, который вендор выпустил 27 августа 2026 года, принимает текстовый или графический запрос и возвращает видео с синхронизированным аудио — это модель для создания отснятого материала. Одна потребляет медиа, другая его производит. Если вашему пайплайну нужно и то и другое, вам нужны обе, и честный вопрос не в том, какая побеждает, а в том, какой именно вам не хватает.
Ни одна из моделей не имеет открытых весов, ни одну нельзя маршрутизировать через OrcaRouter, и обе оцениваются по осям, которые невозможно перевести друг в друга, — токены с одной стороны, секунды сгенерированного видео с другой. Их настоящее пересечение уже, чем предполагает формулировка «omni vs omni», и это пересечение стоит точно определить до ценовой арифметики, потому что именно в ценовой арифметике эти две чаще всего сравнивают неправильно.
Категориальная ошибка, которую стоит прояснить в первую очередь
В стартовых материалах Alibaba Qwen3.8-Omni-Flash сравнивается с Gemini 3.8 Flash, и множество последовавших публикаций свело это к «превосходит Gemini». Это другая модель Google, отличная от Gemini Omni 1.1 Flash, и эти две не являются взаимозаменяемыми точками отсчёта: Gemini 3.8 Flash — это универсальная мультимодальная модель, а Gemini Omni 1.1 Flash — это модель генерации видео с отдельным прайс-листом и отдельной поверхностью API. Все числа Qwen против Gemini, циркулирующие с момента запуска — WildClawBench-MM 71.0 против 58.9, SpotSoundBench 67.2 против 39.7, AgenticVBench 36.8 против 45.0 — относятся к Gemini 3.8 Flash, а не к видеомодели Omni, и ни одно из них в любом случае не является независимым. Если вы пришли сюда с таблицей результатов, которая ставит две модели из этой статьи на одну ось, то в правой колонке почти наверняка не та модель Google.
Что на самом деле делает каждый из них
• Что принимает на вход — Qwen3.8-Omni-Flash принимает текст, изображения, аудио и видео, включая стереофонический и четырёхканальный пространственный звук; Gemini Omni 1.1 Flash принимает текстовые и графические промпты, а также до трёх секунд референсного видео.
• Что возвращает — Qwen3.8-Omni-Flash возвращает только текст; Gemini Omni 1.1 Flash возвращает видео с нативно синхронизированным аудио, в сценах, продлеваемых до 40 секунд с шагом в десять секунд.
• Поверхность управления — Qwen3.8-Omni-Flash предоставляет доступ к контексту, сэмплированию и агентному режиму, который сам решает, на что смотреть; Gemini Omni 1.1 Flash предоставляет управление первым и последним кадром, десятисекундный обратный просмотр для поддержания непрерывности и уровень черновой генерации 360p, который Google описывает как примерно треть стоимости и примерно на 60% быстрее.
• Разрешение и финишная обработка — Qwen3.8-Omni-Flash не имеет выходного разрешения, поскольку не создаёт медиаконтент; Gemini Omni 1.1 Flash выдаёт результат в 720p, 1080p и 4K.
• Контекст и длительность — Qwen3.8-Omni-Flash вмещает один миллион токенов и до одного часа непрерывного аудио-видео в одном вызове; Gemini Omni 1.1 Flash ограничен клипом, который он генерирует, а не входным окном.
• Как вы платите — Qwen3.8-Omni-Flash тарифицируется за токен: $0,15 за миллион входных, $0,016 за кэшированные, $0,47 за выходные по международному прайс-листу; Gemini Omni 1.1 Flash тарифицируется за секунду сгенерированного видео, при этом опубликованная Google ставка составляет $0,10 за секунду для 720p.
• Открытость — закрыто с обеих сторон. Веса не выложены ни для одной из моделей, и ни одну из них сегодня нельзя маршрутизировать через наш API.

Пересечение — это понимание видео, и оно асимметрично.
Единственное место, где покупатель мог бы разумно поставить их бок о бок, — это конвейер, которому нужно и понимать видеоматериал, и создавать его, — скажем, ассистент для монтажа, который читает длинную запись, находит моменты, достойные сохранения, и генерирует монтаж. Что касается понимания, Qwen3.8-Omni-Flash создан именно для этого: час непрерывного аудио и видео за один вызов, разделение говорящих и агентный режим, который повышает точность на OmniVideoBench производителя с 63,4 до 67,8, сокращая при этом число токенов на запрос с 145 736 до 79 117. Что касается создания, Gemini Omni 1.1 Flash — это тот, кто может сгенерировать получившийся клип с синхронизированным звуком, а модель Qwen вообще не способна создать ни единого кадра видео.
Асимметрия работает и в обратную сторону, и это легче не заметить. Понимание для модели видеогенерации носит инструментальный характер — ей нужно достаточно сцены, чтобы сохранять согласованность кадра при десятисекундном расширении, а это иное требование, чем ответ на вопрос о том, что было сказано в течение третьего часа встречи. У модели Google более длительная история по качеству генерации и более короткая — по анализу длинных материалов; у модели Alibaba — наоборот. Если ваша задача — «найти те три минуты, которые важны в этой записи», модель генерации — не тот инструмент. Если ваша задача — «создать тридцатисекундный клип, соответствующий этому брифу», модель понимания — тоже не тот инструмент.
Почему сравнение цен постоянно идёт не так
Ставка за секунду и ставка за токен не конвертируются друг в друга, и попытка их конвертировать порождает две ошибки, которые определяют это сравнение. Первая — сравнивать целый сгенерированный клип со ставкой за токен на входе и заключать, что видеомодель в сотни раз дороже, — что верно и бессмысленно, потому что они продают не одно и то же. Вторая — сравнивать только цены на входе и упускать, что 98%-ное снижение цены на аудио от Alibaba применяется к часам входного аудио, тогда как тариф Google применяется к секундам выходного видео, так что эти два «снижения» находятся даже не на одной стороне счётчика.
Честно говоря, можно сказать так. Согласно собственной методологии Alibaba — двухминутная выборка, умноженная на тридцать, видео в 720p и один кадр в секунду — час комбинированного аудио- и видеовхода в Qwen3.8-Omni-Flash оценивается примерно в $0,20, что ниже, чем $3,27 у предыдущего поколения. Генерация сорока секунд 720p-видео с помощью Gemini Omni 1.1 Flash при опубликованной Google цене $0,10 за секунду стоит $4,00, а черновая генерация тех же сорока секунд в 360p обходится почти в $1,20 исходя из расчёта Google, что это стоит треть. Оба набора цифр заявлены поставщиками, и ни один из них не был независимо воспроизведён. Полезный вывод не в том, какое число меньше, а в том, что анализ часа видеоматериала и генерация сорока секунд из него находятся в одном порядке величины — и именно поэтому производственному конвейеру, который делает и то и другое, нужна модель затрат, а не победитель.
Это также аргумент в пользу того, чтобы держать обе модели на одном ключе, а не на двух контрактах. Сегодня ни одну из omni-моделей нельзя маршрутизировать через OrcaRouter: Qwen3.8-Omni-Flash работает только на собственных платформах Alibaba, а Google не открыл Omni video API для сторонней маршрутизации, поэтому мы не размещаем ни одну из них и не будем делать вид, что это не так. В нашем каталоге доступны «собратья» из каждого семейства — Qwen3.8-Flash и Gemini 3.8 Flash — оба уже сегодня можно вызвать через одну конечную точку по цене из прайс-листа провайдера с наценкой 0%, и именно это делает A/B-сравнение с собственными показателями любого из вендоров вопросом изменения конфигурации, а не второй интеграции.

Где выигрывает каждый из них — прямо и без обиняков
Qwen3.8-Omni-Flash выигрывает во всём, что измеряется часами входных данных: транскрипция встреч с диаризацией, суммаризация длинных записей, агентное использование инструментов с интенсивным аудио и стоимость за час обработанных медиа. Его заявленные производителем аудиорезультаты сильны, а слабость — там, куда модель никогда не нацеливалась: на лидербордах с упором на рассуждения, где первые сторонние прогоны поместили её на 28-й процентиль по рассуждениям с показателем скорости в 21-м, причём на выборке, достаточно малой, чтобы эти цифры воспринимались как повод для проверки, а не как вердикт.
Gemini Omni 1.1 Flash выигрывает по результату: генерация планов с синхронизированным звуком, непрерывность на протяжении длинных сцен, покадровый контроль и 4K-финиш, который может просто требоваться конвейеру доставки. Его преимущество не в баллах бенчмарка — оно в том, что другая модель вообще не способна выполнить эту работу. Слабее он в тех случаях, когда требуется удерживать час контекста, потому что он для этого не создан.
Решение — и то, за чем стоит следить
Если вы выбираете между ними, вопрос в том, какая половина пайплайна остаётся неохваченной. Команда, которая уже генерирует видео и которой нужно разбираться в длинных записях, на этой неделе должна тестировать Qwen3.8-Omni-Flash на собственном аудио; команда, которая анализирует медиа и которой нужно их создавать, должна тестировать Gemini Omni 1.1 Flash. Команда, которой нужно и то и другое, имеет дело с двумя вендорами, двумя моделями биллинга и двумя интеграциями — и именно в такой ситуации единый слой маршрутизации перестаёт быть просто удобством и становится тем, что сохраняет модель затрат понятной и прозрачной.
Две вещи изменили бы эту оценку. Независимая оценка Qwen3.8-Omni-Flash заменила бы каждую приведённую выше цифру поставщика на сопоставимую — таковой пока не существует, и её отсутствие — самый крупный отдельный пробел в этом сравнении. А опубликованный тариф Google на вывод в 1080p и 4K сделал бы арифметику для верхнего сегмента проверяемой; сегодня эти цифры фигурируют лишь как оценки маркетплейсов, а не как собственный прайс-лист Google.

Одно заключительное замечание о фрейминге. «Omni» перестало означать что-либо точное — теперь оно охватывает и модель, которая обрабатывает час аудиозаписи встречи, и модель, которая создаёт сорокасекундный клип со звуком, и именно отношение к этому слову как к категории приводит к тому, что покупатели в итоге сравнивают цену за токен с ценой за секунду и делают из этого вывод. Эти модели взаимодополняющие, с узкой зоной пересечения, и правильная позиция по отношению к обеим — через пять дней и через четыре недели после их соответствующих выпусков — одна и та же: оценивайте их на собственном материале и держите открытым второй путь.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
