Заглавная карточка для сравнения «InternLumina-U2 vs Qwen2.5 Omni» с подзаголовком «Омни-модель, которую Alibaba уже выпустила, против той, которую до сих пор только обещают» и тремя чипами со статистикой — «Qwen2.5 Omni: 17 месяцев в продакшене», «InternLumina-U2: один день кода», «Apache-2.0 с обеих сторон» — с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

InternLumina-U2 против Qwen2.5 Omni: Omni-модель, выпущенная Alibaba, против той, которую Shanghai AI Lab всё ещё обещает

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

InternLumina-U2 и Qwen2.5 Omni — это два ответа на одно и то же стремление: одна модель, которая обрабатывает все модальности, а не зоопарк специализированных моделей, — из двух разных поколений. Qwen2.5 Omni — это ответ, который действительно был выпущен: модель с открытым весом на 7 миллиардов параметров, представленная в марте 2025 года, которой на момент написания семнадцать месяцев, принимающая на вход текст, изображения, аудио и видео и отвечающая текстом или естественной потоковой речью. InternLumina-U2 — ответ Лаборатории искусственного интеллекта Шанхая, опубликованный в виде кода для инференса 1 сентября 2026 года: разреженная диффузионная модель на 16B параметров, которая, как утверждается, воспринимает изображения, видео и 3D, а также генерирует и редактирует изображения через единый интерфейс дискретных токенов. Одно поколение идеи «omni» находится в продакшене уже полтора года; другому — один день, и его никто не может запустить, потому что его весов пока не существует. Разрыв между ними — это разница между сдержанным обещанием и обещанием, данным.

Вышедший omni: Qwen2.5 Omni

Qwen2.5 Omni заслуживает серьёзного отношения в качестве базовой линии, потому что это редкая открытая модель, которая действительно выполнила обещание «воспринимать всё и отвечать в любой форме». Её архитектура Thinker-Talker объединяет текстового «мыслителя» и «говорящего», который генерирует речь, используя выровненное по времени мультимодальное позиционное кодирование, чтобы аудио и видео оставались синхронизированными; на вход подаются текст, изображения, аудио и видео, а на выходе в той же реплике могут быть текст и голос — с четырьмя встроенными голосами. Ограничения задокументированы так же тщательно, как и возможности: контекст — 32K токенов, нет вызова функций и структурированного вывода, и это универсальный собеседник, а не агент. Чего она не делает, важно подчеркнуть для этого сравнения — она воспринимает изображения, аудио и видео, но не создаёт их. «Omni» в Qwen2.5 Omni означает омни-восприятие с синтезом речи на выходе: пиксели поступают на вход, а слова — на выход.

За ней реальный послужной список. Модель скачивали сотни тысяч раз, у неё есть размещённый API на собственной платформе разработчика и на нескольких сторонних платформах, и за семнадцать месяцев она накопила квантования, инструменты сообщества и известную цену — в каталогах агрегаторов текст указан примерно по $0,09 за миллион входных токенов и $0,34 за миллион выходных, а аудио тарифицируется отдельно. Семнадцати месяцев достаточно, чтобы были хорошо изучены и её сильные стороны, и её ограничения. Именно это даёт зрелость: не совершенство, а предсказуемость.

Обещанный omni: InternLumina-U2

InternLumina-U2 пытается сделать шаг дальше, чем Qwen2.5 Omni, и этот шаг находится ровно там, где и сосредоточена главная трудность. Её основной тезис заключается в том, что восприятие и генерация должны использовать общий интерфейс дискретных токенов: вместо языковой модели, которая воспринимает видео, и отдельной диффузионной модели, которая рисует, единый разреженный диффузионный бэкбон MoE — 16B суммарно, 1B активных — должен и читать изображение, диаграмму, видео или 3D-объект, и создавать новое изображение или правку, используя полностью дискретный визуальный словарь из восьми кодовых книг, чтобы каждая визуальная позиция несла достаточно информации для поддержки обоих направлений. Это заявление существенно весомее, чем у Qwen2.5 Omni. Одно дело — направлять все входные модальности в текст и речь; совсем другое — заставить один набор весов генерировать пиксели так же бегло, как он рассуждает о них.

В настоящий момент это также утверждение, которое невозможно проверить. Лаборатория опубликовала код для инференса, страницу проекта с «предварительной, частичной» таблицей бенчмарков и пустую заглушку на Hugging Face; веса, код обучения, технический отчёт и стек Ascend-NPU — всё помечено как «скоро». Никакой независимой оценки не существует, потому что оценивать нечего. Архитектуру Qwen2.5 Omni можно было проверить уже на неделе релиза, поскольку веса поставлялись вместе с ней; архитектура InternLumina-U2 доступна для чтения уже сегодня, но её качество остаётся лишь обещанием производителя.

Табло

Поскольку у одной из этих моделей семнадцать месяцев истории, а у другой — день кода, строки отражают происхождение данных, а не делают вид, что столбцы симметричны.

• Возраст — Qwen2.5 Omni: выпущен в марте 2025 года, семнадцать месяцев в открытом доступе, сотни тысяч загрузок. InternLumina-U2: код для инференса опубликован 1 сентября 2026 года, ноль загрузок, ноль независимых запусков.

• Форма — Qwen2.5 Omni: ~7B сквозная модель, Thinker-Talker с выровненным по времени мультимодальным позиционным кодированием. InternLumina-U2: 16B всего / 1B активных, разреженная MoE-модель диффузионного LLM с восьмикодовым дискретным визуальным токенизатором.

• Входные данные: обе принимают текст и изображения; Qwen2.5 Omni дополнительно принимает аудио и видео для omni-чата; InternLumina-U2 дополнительно заявляет о понимании видео на основе 64 выбранных кадров и о понимании 3D по отрендеренным в Blender видам GLB/GLTF.

• Вывод — Qwen2.5 Omni: текст и потоковая речь, четыре голоса. InternLumina-U2: заявлены текст, генерация изображений по тексту до 1024×1024 и редактирование изображений по инструкциям.

• Поколение — Qwen2.5 Omni: генерирует слова и голос, но не пиксели. InternLumina-U2: пытается выполнять генерацию и редактирование изображений внутри той же модели дискретных токенов, которая читает текст.

• Веса и лицензия — обе в принципе имеют открытые веса под Apache-2.0; у Qwen2.5 Omni они доступны для скачивания уже сегодня, а у InternLumina-U2 пока не публичные.

• Обслуживание — Qwen2.5 Omni: размещённый API плюс самостоятельное развёртывание (тяжёлое, в полной точности); известен контекст 32K, без вызова функций. InternLumina-U2: не подлежит обслуживанию — выпущенный драйвер ожидает чекпоинты, которых не существует.

• Ключевые цифры — Qwen2.5 Omni: давно присутствует в таблице лидеров OmniBench (результат около 0.561 в текущих таблицах); InternLumina-U2: ChartQA 86.52, MathVision 33.22, GenEval 0.81 — все данные предоставлены производителем, являются предварительными и неполными.

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

Почему конфликт поколений — это настоящая история

Оставим в стороне возраст моделей — содержательная разница в том рубеже, на котором останавливается каждая из них. Qwen2.5 Omni выбрала посильную версию омни: широко воспринимать, отвечать текстом или голосом, а синтез изображений и видео оставлять специализированным генеративным моделям в других частях стека. Такое разделение труда — то, как по сути устроена каждая промышленная мультимодальная система 2026 года, и именно поэтому Qwen2.5 Omni смогла выйти в 2025 году и оставаться полезной в 2026-м: она хорошо делает свой участок работы и компонуется с остальными. InternLumina-U2 — это ставка на то, что разделение труда как раз и есть проблема: что модель, вынужденная представлять всё — восприятие и генерацию — в одном общем дискретном словаре, разовьёт более глубокое понимание визуального мира, чем модель, которой нужно лишь описывать его. Если эта ставка сыграет, это станет более важным результатом. Если нет, InternLumina-U2 окажется более медленной и прожорливой версией Qwen2.5 Omni, к весам которой неуклюже прикручен генератор изображений. Весь этот спор — а это спор между выпущенной в продакшен архитектурой и гипотезой, а не между двумя готовыми к запуску моделями — сводится к тому, оправдывает ли себя более сложная архитектура.

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

Карточка модели Qwen/Qwen2.5-Omni-7B на Hugging Face, зафиксированная 27 августа 2026 года, — обзор Thinker-Talker, лицензия Apache-2.0 и теги модальностей модели: текст, изображение, аудио и видео.

Что на самом деле можно купить за полтора года загрузок

Зрелость — это не настроение; это список вещей, которые ты знаешь. С Qwen2.5 Omni ты знаешь, что контекст в 32K — это жёсткое ограничение, и можешь проектировать с его учётом. Ты знаешь, что пути вызова функций нет, и не будешь делать вид, что он есть. Ты примерно знаешь, сколько стоит развёртывание — и через размещённый API, и на собственных GPU, — потому что модель оценили и запустили достаточно людей, чтобы цифры устоялись. Ты знаешь, что позиция в OmniBench реальна, потому что независимые лидерборды отслеживают её уже больше года. С InternLumina-U2 ни один из этих глаголов не применим — ты не знаешь и не можешь знать, потому что артефакта нет. Когда модели день от роду и у неё нет веса, любое утверждение о ней — это заявление о намерениях. Эта асимметрия — не упрёк науке; это правильная эпистемическая позиция для любого, кто выбирает, на чём строить.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

Репозиторий GitHub InternLM/InternLumina-U2, снимок от 2 сентября 2026 года — главная страница репозитория, делающая архитектуру публичной, — описание, лицензия и скрипты для инференса, в то время как сами веса в дереве отсутствуют.

Решение о маршрутизации, честно сформулированное

Скажем прямо о доступности: OrcaRouter не размещает InternLumina-U2, потому что весов, которые можно было бы разместить, нет ни у кого. Qwen2.5 Omni мы тоже сейчас не предоставляем: эта модель работает через собственный API разработчика и сторонние платформы. Так что урок маршрутизации здесь — про позиционирование, а не про то, чтобы уже сегодня вызывать обе модели через один ключ. Устойчивый паттерн — тот, к которому рано или поздно приходит любое решение «зрелая модель против новичка»: проверенную модель держат на основном маршруте, где один API на 200+ моделей и транзит с нулевой наценкой означают, что вы платите ровно цену провайдера по прайс-листу и ничего сверху; непроверенного новичка направляют на тестовый маршрут с автоматическим переключением, чтобы при первой же заминке, уходе в сторону или бессмысленном ответе вызов автоматически переходил на модель с семнадцатимесячным послужным списком. Именно так вы сможете оценить амбициозную новую архитектуру вроде InternLumina-U2 в день, когда выйдут её веса, — не рискуя продовым маршрутом, на который вы уже полагаетесь.

Вердикт

Qwen2.5 Omni — это омни-модель, на которой можно строить уже сегодня: она выпущена, доступна для загрузки, документирована, с известными ограничениями и установленной ценой. InternLumina-U2 — омни-модель, за которой стоит следить: настоящий архитектурный шаг от восприятия к созданию, Apache-2.0, с открытым кодом и ожидающими публикации весами. Если ставка лаборатории на multi-codebook подтвердится в независимом тестировании, InternLumina-U2 будет не столько конкурентом Qwen2.5 Omni, сколько следующим поколением той же идеи. Если нет — семнадцатимесячный универсал, который реально вышел в свет, по-прежнему будет на месте и будет делать свою работу, как делал всё это время. Следите за заглушкой на Hugging Face; вердикт зависит от файлов safetensors, а не от этой статьи.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube