Сгенерированная hero-карточка под названием «Qwen3.8-Omni-Flash vs InternLumina U2» под надзаголовком «Арендованные сенсоры vs собственные веса», с подзаголовком «Закрытый API для длинных медиа против диффузионной модели на 16B, которую можно скачать.» и четырьмя чипами: «Веса: закрытые vs Apache 2.0», «Генерация изображений: только у одной стороны», «Контекст: 1M vs не раскрыт», «Доступно для маршрутизации здесь: ни то, ни другое». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Qwen3.8-Omni-Flash против InternLumina U2: арендованные органы чувств против собственных весов

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Полезный способ сравнить Qwen3.8-Omni-Flash и InternLumina U2 — не по строке бенчмарка, потому что они не появляются в одних и тех же. А по вопросу о том, кому разрешено их запускать. Вендорский Qwen3.8-Omni-Flash, открытый для клиентов API с 18 сентября 2026 года, — это закрытая модель на собственных платформах вендора: один миллион токенов контекста, до часа непрерывного аудио и видео за вызов, вывод только текста и никаких весов. Разработанная в Shanghai AI Laboratory модель InternLumina U2 — это 16B-A1B диффузионная модель на основе смеси экспертов под лицензией Apache 2.0, чьи контрольные точки для Ascend можно скачать с Hugging Face прямо сейчас, а контрольные точки для NVIDIA и технический отчёт всё ещё значатся как ожидаемые. Первый — это сервис, который вы арендуете по токенам. Второй — это файл, который можно держать у себя, с оговоркой о том, на каком оборудовании он сейчас работает. Эта разница определяет больше реальных развёртываний, чем любая оценка в таблице любого из вендоров.

Что на самом деле представляет собой InternLumina U2

Архитектура — это самая интересная часть, и она действительно необычна. InternLumina U2 — это разреженная MoE с 16 миллиардами общих параметров и 1 миллиардом активных, и это диффузионная языковая модель, а не авторегрессионная: она уточняет всю последовательность параллельно, а не выдаёт токены слева направо. Её визуальное представление полностью дискретно: восемь кодовых книг визуальных токенов, построенных на AToken от Apple, — именно это позволяет одной модели и читать изображение, и создавать его без отдельного декодера, приделанного в конце. Ответы на вопросы по тексту, генерация изображений по тексту, понимание изображений, редактирование изображений, понимание видео и понимание 3D — всё это одна и та же модель, выполняющая одну и ту же работу над одним и тем же словарём.

• Размер и форма — InternLumina U2: 16B всего, 1B активных, разреженная MoE; число параметров Qwen3.8-Omni-Flash не раскрыто.

• Генерация — InternLumina U2 генерирует и редактирует изображения, а также обеспечивает 3D-понимание; Qwen3.8-Omni-Flash вообще не генерирует медиаконтент и возвращает текст.

• Декодирование — InternLumina U2 — это диффузионная LLM, декодирующая параллельно; Qwen3.8-Omni-Flash — авторегрессионная.

• Контекст и длительность — Qwen3.8-Omni-Flash поддерживает окно в 1 млн токенов и до одного часа непрерывного аудио и видео в одном вызове; опубликованные материалы InternLumina U2 ничего из этого не описывают, а длительные аудиоматериалы не входят в число заявленных возможностей.

• Веса — InternLumina U2 распространяется под Apache 2.0: чекпоинты для Ascend опубликованы, а чекпоинты для NVIDIA пока ожидаются; у Qwen3.8-Omni-Flash весов нет, и никаких планов по их выпуску не объявлено.

• Как это получить — InternLumina U2 скачивается с Hugging Face, а код для инференса доступен на GitHub; Qwen3.8-Omni-Flash — это вызов API к Alibaba Cloud Model Studio или платформе Qianwen.

• Независимые оценки — ни у того, ни у другого. В собственной карточке InternLumina U2 её таблица бенчмарков помечена как «предварительные, частичные результаты»; а у Qwen все они получены в сравнении только с его собственным предшественником и не воспроизведены.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

Вопрос о весах сместился с момента выхода предварительных обзоров.

Если вы читали наш более ранний материал о InternLumina U2, когда код только появился, ситуация изменилась в одном направлении и осталась прежней в другом, и обе части важны. Репозиторий Hugging Face больше не заглушка: папка ascend/ теперь содержит семь шардов safetensors, а также конфигурацию, токенизатор и код модели, а значит, модель действительно можно скачать и запустить на подходящем оборудовании. Папка nvidia/ по-прежнему помечена как «скоро», технический отчёт всё ещё готовится, а раздел бенчмарков в самом репозитории по-прежнему гласит: «предварительные, частичные результаты». Так что точная формулировка сегодня — не «веса вышли» и не «весов нет», а то, что чекпоинты для одного аппаратного стека опубликованы, а для другого — нет, и это реальное ограничение для всех, чей кластер — NVIDIA.

Ещё две вещи незаметно изменились. В репозиторий на GitHub продолжают поступать коммиты ещё долго после первоначального релиза 1 сентября, так что выпущенный код поддерживают, а не просто отправили на полку. А счётчик загрузок в репозитории Hugging Face по-прежнему показывает ноль, и это говорит меньше о модели, чем об аудитории: диффузионная модель 16B-A1B с чекпойнтами, ориентированными в первую очередь на Ascend, нацелена на лабораторию, а не на продуктовую команду, ищущую хостируемый эндпоинт в этом квартале.

Где они действительно пересекаются, а где — нет

Понимание изображений — это пересечение, и оно уже, чем кажется. Обе модели могут посмотреть на картинку и ответить на вопросы о ней, а это — вся работа для Qwen3.8-Omni-Flashи одна из шести задач для InternLumina U2. Всё, что дальше, резко расходится. InternLumina U2 затем может отредактировать это изображение или сгенерировать новое по промпту, в той же модели, используя тот же визуальный словарь, который она использовала, чтобы прочитать его. Qwen3.8-Omni-Flash не может создать ни одного пикселя, но примет час аудио и видео за один вызов и скажет вам, кто говорил, когда и что было решено, — а опубликованные материалы InternLumina U2 вообще не заявляют, что она это умеет.

Пересечение, которое значит меньше, чем принято считать, — это видео. Оба описываются как работающие с видео, но делают с ним разные вещи: один осмысляет длинную запись как документ, другой работает с видео как с визуальной модальностью наряду с 3D. Команде, которой нужно краткое изложение часовой записи, не поможет второй, а команде, которой нужно сгенерировать кадр, не поможет первый.

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

Стоимость, контроль и что вы на самом деле покупаете

Сравнение цен здесь — это сравнение несопоставимых по своей природе величин. Qwen3.8-Omni-Flash берёт плату за токен — 0,15 доллара за миллион входных, 0,016 за кэшированные, 0,47 за выходные по международному прайс-листу, при этом отдельный прайс-лист для материкового Китая несопоставим, — а его главным заявлением на запуске было сообщённое производителем сокращение более чем на 98 % стоимости часа аудиовхода, рассчитанное путём оценки двухминутного образца и умножения на тридцать при выборке видео в 720p и одном кадре в секунду. InternLumina U2 не берёт вообще ничего, потому что брать плату не за что: расходы — это ваше оборудование и ваше время, а в карточке самой модели не публикуется показатель пропускной способности, который позволил бы превратить это в число цены за токен.

Вот и весь компромисс в одной строке. API даёт вам возможности, которые вы не можете разместить у себя, и почасовую стоимость, которая растёт с использованием; открытые веса дают фиксированную стоимость и полный контроль над путём данных — ценой стека инференса, который вам придётся построить, и набора чекпоинтов, который на сегодняшний день означает оборудование Ascend. Для регулируемых рабочих нагрузок, где медиаконтент не может покидать пределы здания, второй вариант — не предпочтение, а единственная опция на этой странице. Для команды, которой в этом месяце нужен анализ длинных аудиозаписей, первый — единственный вариант на этой странице.

OrcaRouter сегодня не размещает ни одну из этих моделей, и мы предпочли бы сказать об этом прямо, чем намекать на маршрут, которого не существует: Qwen3.8-Omni-Flash работает только на собственных платформах Alibaba, а InternLumina U2 — это загружаемый файл, а не эндпоинт. Мы действительно запускаем остальную часть линейки Qwen3.8 — Qwen3.8-Flash и Qwen3.8-Max — через единый API по прейскурантной цене провайдера с наценкой 0%, и это практичный способ поддерживать рабочую базовую конфигурацию для стороны закрытых моделей в этом сравнении, пока сторона открытых весов всё ещё приводит в порядок свои контрольные точки NVIDIA.

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

Какой из них вам действительно стоит выбрать

Выбирайте InternLumina U2, если вам нужна одна модель, которая читает, генерирует и редактирует изображения, и вы готовы владеть всем стеком инференса — и если ваши ускорители — Ascend, или вы можете подождать контрольные точки NVIDIA. Это единственная из двух моделей, способная создавать изображение, и единственная, которую можно запустить, не отправляя данные вендору. Считайте её показатели в бенчмарках недоказанными, пока не выйдет технический отчёт, потому что карточка модели говорит именно это.

Выбирайте Qwen3.8-Omni-Flashесли ваша задача — часы аудио и видео, а не вывод пикселей: аналитика встреч, анализ длинных записей, агентные задачи с большим объёмом аудио на китайском и английском — и если вы можете принять зависимость от одного источника и вывод только в виде текста. Его история затрат сильна по часам входного аудио и гораздо слабее по итоговому счёту, его бенчмарки заявлены поставщиком и не воспроизведены, а первые появившиеся сторонние прогоны помещают его на 28-й процентиль по рассуждениям — на выборке, достаточно малой, чтобы это скорее побуждало к тестированию, чем к решению.

Если вам нужно и то и другое, они дополняют друг друга, а не заменяют друг друга: открытая по весам модель для изображений, которую вы размещаете у себя, и закрытая модель для длинных медиа, к которой вы обращаетесь. Ни то, ни другое сегодня не маршрутизируется через нас. За чем стоит следить с одной стороны — это контрольная точка NVIDIA и технический отчёт; с другой — первая независимая оценка, которой пока не существует и которая является самым большим пробелом во всём, что написано об Qwen3.8-Omni-Flash на сегодняшний день.