
Qwen3.8-Omni-Flash против InternLumina U2: арендованные органы чувств против собственных весов
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Полезный способ сравнить Qwen3.8-Omni-Flash и InternLumina U2 — не по строке бенчмарка, потому что они не появляются в одних и тех же. А по вопросу о том, кому разрешено их запускать. Вендорский Qwen3.8-Omni-Flash, открытый для клиентов API с 18 сентября 2026 года, — это закрытая модель на собственных платформах вендора: один миллион токенов контекста, до часа непрерывного аудио и видео за вызов, вывод только текста и никаких весов. Разработанная в Shanghai AI Laboratory модель InternLumina U2 — это 16B-A1B диффузионная модель на основе смеси экспертов под лицензией Apache 2.0, чьи контрольные точки для Ascend можно скачать с Hugging Face прямо сейчас, а контрольные точки для NVIDIA и технический отчёт всё ещё значатся как ожидаемые. Первый — это сервис, который вы арендуете по токенам. Второй — это файл, который можно держать у себя, с оговоркой о том, на каком оборудовании он сейчас работает. Эта разница определяет больше реальных развёртываний, чем любая оценка в таблице любого из вендоров.
Что на самом деле представляет собой InternLumina U2
Архитектура — это самая интересная часть, и она действительно необычна. InternLumina U2 — это разреженная MoE с 16 миллиардами общих параметров и 1 миллиардом активных, и это диффузионная языковая модель, а не авторегрессионная: она уточняет всю последовательность параллельно, а не выдаёт токены слева направо. Её визуальное представление полностью дискретно: восемь кодовых книг визуальных токенов, построенных на AToken от Apple, — именно это позволяет одной модели и читать изображение, и создавать его без отдельного декодера, приделанного в конце. Ответы на вопросы по тексту, генерация изображений по тексту, понимание изображений, редактирование изображений, понимание видео и понимание 3D — всё это одна и та же модель, выполняющая одну и ту же работу над одним и тем же словарём.
• Размер и форма — InternLumina U2: 16B всего, 1B активных, разреженная MoE; число параметров Qwen3.8-Omni-Flash не раскрыто.
• Генерация — InternLumina U2 генерирует и редактирует изображения, а также обеспечивает 3D-понимание; Qwen3.8-Omni-Flash вообще не генерирует медиаконтент и возвращает текст.
• Декодирование — InternLumina U2 — это диффузионная LLM, декодирующая параллельно; Qwen3.8-Omni-Flash — авторегрессионная.
• Контекст и длительность — Qwen3.8-Omni-Flash поддерживает окно в 1 млн токенов и до одного часа непрерывного аудио и видео в одном вызове; опубликованные материалы InternLumina U2 ничего из этого не описывают, а длительные аудиоматериалы не входят в число заявленных возможностей.
• Веса — InternLumina U2 распространяется под Apache 2.0: чекпоинты для Ascend опубликованы, а чекпоинты для NVIDIA пока ожидаются; у Qwen3.8-Omni-Flash весов нет, и никаких планов по их выпуску не объявлено.
• Как это получить — InternLumina U2 скачивается с Hugging Face, а код для инференса доступен на GitHub; Qwen3.8-Omni-Flash — это вызов API к Alibaba Cloud Model Studio или платформе Qianwen.
• Независимые оценки — ни у того, ни у другого. В собственной карточке InternLumina U2 её таблица бенчмарков помечена как «предварительные, частичные результаты»; а у Qwen все они получены в сравнении только с его собственным предшественником и не воспроизведены.

Вопрос о весах сместился с момента выхода предварительных обзоров.
Если вы читали наш более ранний материал о InternLumina U2, когда код только появился, ситуация изменилась в одном направлении и осталась прежней в другом, и обе части важны. Репозиторий Hugging Face больше не заглушка: папка ascend/ теперь содержит семь шардов safetensors, а также конфигурацию, токенизатор и код модели, а значит, модель действительно можно скачать и запустить на подходящем оборудовании. Папка nvidia/ по-прежнему помечена как «скоро», технический отчёт всё ещё готовится, а раздел бенчмарков в самом репозитории по-прежнему гласит: «предварительные, частичные результаты». Так что точная формулировка сегодня — не «веса вышли» и не «весов нет», а то, что чекпоинты для одного аппаратного стека опубликованы, а для другого — нет, и это реальное ограничение для всех, чей кластер — NVIDIA.
Ещё две вещи незаметно изменились. В репозиторий на GitHub продолжают поступать коммиты ещё долго после первоначального релиза 1 сентября, так что выпущенный код поддерживают, а не просто отправили на полку. А счётчик загрузок в репозитории Hugging Face по-прежнему показывает ноль, и это говорит меньше о модели, чем об аудитории: диффузионная модель 16B-A1B с чекпойнтами, ориентированными в первую очередь на Ascend, нацелена на лабораторию, а не на продуктовую команду, ищущую хостируемый эндпоинт в этом квартале.
Где они действительно пересекаются, а где — нет
Понимание изображений — это пересечение, и оно уже, чем кажется. Обе модели могут посмотреть на картинку и ответить на вопросы о ней, а это — вся работа для Qwen3.8-Omni-Flashи одна из шести задач для InternLumina U2. Всё, что дальше, резко расходится. InternLumina U2 затем может отредактировать это изображение или сгенерировать новое по промпту, в той же модели, используя тот же визуальный словарь, который она использовала, чтобы прочитать его. Qwen3.8-Omni-Flash не может создать ни одного пикселя, но примет час аудио и видео за один вызов и скажет вам, кто говорил, когда и что было решено, — а опубликованные материалы InternLumina U2 вообще не заявляют, что она это умеет.
Пересечение, которое значит меньше, чем принято считать, — это видео. Оба описываются как работающие с видео, но делают с ним разные вещи: один осмысляет длинную запись как документ, другой работает с видео как с визуальной модальностью наряду с 3D. Команде, которой нужно краткое изложение часовой записи, не поможет второй, а команде, которой нужно сгенерировать кадр, не поможет первый.

Стоимость, контроль и что вы на самом деле покупаете
Сравнение цен здесь — это сравнение несопоставимых по своей природе величин. Qwen3.8-Omni-Flash берёт плату за токен — 0,15 доллара за миллион входных, 0,016 за кэшированные, 0,47 за выходные по международному прайс-листу, при этом отдельный прайс-лист для материкового Китая несопоставим, — а его главным заявлением на запуске было сообщённое производителем сокращение более чем на 98 % стоимости часа аудиовхода, рассчитанное путём оценки двухминутного образца и умножения на тридцать при выборке видео в 720p и одном кадре в секунду. InternLumina U2 не берёт вообще ничего, потому что брать плату не за что: расходы — это ваше оборудование и ваше время, а в карточке самой модели не публикуется показатель пропускной способности, который позволил бы превратить это в число цены за токен.
Вот и весь компромисс в одной строке. API даёт вам возможности, которые вы не можете разместить у себя, и почасовую стоимость, которая растёт с использованием; открытые веса дают фиксированную стоимость и полный контроль над путём данных — ценой стека инференса, который вам придётся построить, и набора чекпоинтов, который на сегодняшний день означает оборудование Ascend. Для регулируемых рабочих нагрузок, где медиаконтент не может покидать пределы здания, второй вариант — не предпочтение, а единственная опция на этой странице. Для команды, которой в этом месяце нужен анализ длинных аудиозаписей, первый — единственный вариант на этой странице.
OrcaRouter сегодня не размещает ни одну из этих моделей, и мы предпочли бы сказать об этом прямо, чем намекать на маршрут, которого не существует: Qwen3.8-Omni-Flash работает только на собственных платформах Alibaba, а InternLumina U2 — это загружаемый файл, а не эндпоинт. Мы действительно запускаем остальную часть линейки Qwen3.8 — Qwen3.8-Flash и Qwen3.8-Max — через единый API по прейскурантной цене провайдера с наценкой 0%, и это практичный способ поддерживать рабочую базовую конфигурацию для стороны закрытых моделей в этом сравнении, пока сторона открытых весов всё ещё приводит в порядок свои контрольные точки NVIDIA.

Какой из них вам действительно стоит выбрать
Выбирайте InternLumina U2, если вам нужна одна модель, которая читает, генерирует и редактирует изображения, и вы готовы владеть всем стеком инференса — и если ваши ускорители — Ascend, или вы можете подождать контрольные точки NVIDIA. Это единственная из двух моделей, способная создавать изображение, и единственная, которую можно запустить, не отправляя данные вендору. Считайте её показатели в бенчмарках недоказанными, пока не выйдет технический отчёт, потому что карточка модели говорит именно это.
Выбирайте Qwen3.8-Omni-Flashесли ваша задача — часы аудио и видео, а не вывод пикселей: аналитика встреч, анализ длинных записей, агентные задачи с большим объёмом аудио на китайском и английском — и если вы можете принять зависимость от одного источника и вывод только в виде текста. Его история затрат сильна по часам входного аудио и гораздо слабее по итоговому счёту, его бенчмарки заявлены поставщиком и не воспроизведены, а первые появившиеся сторонние прогоны помещают его на 28-й процентиль по рассуждениям — на выборке, достаточно малой, чтобы это скорее побуждало к тестированию, чем к решению.
Если вам нужно и то и другое, они дополняют друг друга, а не заменяют друг друга: открытая по весам модель для изображений, которую вы размещаете у себя, и закрытая модель для длинных медиа, к которой вы обращаетесь. Ни то, ни другое сегодня не маршрутизируется через нас. За чем стоит следить с одной стороны — это контрольная точка NVIDIA и технический отчёт; с другой — первая независимая оценка, которой пока не существует и которая является самым большим пробелом во всём, что написано об Qwen3.8-Omni-Flash на сегодняшний день.
