
InternLumina-U2 против Qwen2.5 Omni: Omni-модель, выпущенная Alibaba, против той, которую Shanghai AI Lab всё ещё обещает
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
InternLumina-U2 и Qwen2.5 Omni — это два ответа на одно и то же стремление: одна модель, которая обрабатывает все модальности, а не зоопарк специализированных моделей, — из двух разных поколений. Qwen2.5 Omni — это ответ, который действительно был выпущен: модель с открытым весом на 7 миллиардов параметров, представленная в марте 2025 года, которой на момент написания семнадцать месяцев, принимающая на вход текст, изображения, аудио и видео и отвечающая текстом или естественной потоковой речью. InternLumina-U2 — ответ Лаборатории искусственного интеллекта Шанхая, опубликованный в виде кода для инференса 1 сентября 2026 года: разреженная диффузионная модель на 16B параметров, которая, как утверждается, воспринимает изображения, видео и 3D, а также генерирует и редактирует изображения через единый интерфейс дискретных токенов. Одно поколение идеи «omni» находится в продакшене уже полтора года; другому — один день, и его никто не может запустить, потому что его весов пока не существует. Разрыв между ними — это разница между сдержанным обещанием и обещанием, данным.
Вышедший omni: Qwen2.5 Omni
Qwen2.5 Omni заслуживает серьёзного отношения в качестве базовой линии, потому что это редкая открытая модель, которая действительно выполнила обещание «воспринимать всё и отвечать в любой форме». Её архитектура Thinker-Talker объединяет текстового «мыслителя» и «говорящего», который генерирует речь, используя выровненное по времени мультимодальное позиционное кодирование, чтобы аудио и видео оставались синхронизированными; на вход подаются текст, изображения, аудио и видео, а на выходе в той же реплике могут быть текст и голос — с четырьмя встроенными голосами. Ограничения задокументированы так же тщательно, как и возможности: контекст — 32K токенов, нет вызова функций и структурированного вывода, и это универсальный собеседник, а не агент. Чего она не делает, важно подчеркнуть для этого сравнения — она воспринимает изображения, аудио и видео, но не создаёт их. «Omni» в Qwen2.5 Omni означает омни-восприятие с синтезом речи на выходе: пиксели поступают на вход, а слова — на выход.
За ней реальный послужной список. Модель скачивали сотни тысяч раз, у неё есть размещённый API на собственной платформе разработчика и на нескольких сторонних платформах, и за семнадцать месяцев она накопила квантования, инструменты сообщества и известную цену — в каталогах агрегаторов текст указан примерно по $0,09 за миллион входных токенов и $0,34 за миллион выходных, а аудио тарифицируется отдельно. Семнадцати месяцев достаточно, чтобы были хорошо изучены и её сильные стороны, и её ограничения. Именно это даёт зрелость: не совершенство, а предсказуемость.
Обещанный omni: InternLumina-U2
InternLumina-U2 пытается сделать шаг дальше, чем Qwen2.5 Omni, и этот шаг находится ровно там, где и сосредоточена главная трудность. Её основной тезис заключается в том, что восприятие и генерация должны использовать общий интерфейс дискретных токенов: вместо языковой модели, которая воспринимает видео, и отдельной диффузионной модели, которая рисует, единый разреженный диффузионный бэкбон MoE — 16B суммарно, 1B активных — должен и читать изображение, диаграмму, видео или 3D-объект, и создавать новое изображение или правку, используя полностью дискретный визуальный словарь из восьми кодовых книг, чтобы каждая визуальная позиция несла достаточно информации для поддержки обоих направлений. Это заявление существенно весомее, чем у Qwen2.5 Omni. Одно дело — направлять все входные модальности в текст и речь; совсем другое — заставить один набор весов генерировать пиксели так же бегло, как он рассуждает о них.
В настоящий момент это также утверждение, которое невозможно проверить. Лаборатория опубликовала код для инференса, страницу проекта с «предварительной, частичной» таблицей бенчмарков и пустую заглушку на Hugging Face; веса, код обучения, технический отчёт и стек Ascend-NPU — всё помечено как «скоро». Никакой независимой оценки не существует, потому что оценивать нечего. Архитектуру Qwen2.5 Omni можно было проверить уже на неделе релиза, поскольку веса поставлялись вместе с ней; архитектура InternLumina-U2 доступна для чтения уже сегодня, но её качество остаётся лишь обещанием производителя.
Табло
Поскольку у одной из этих моделей семнадцать месяцев истории, а у другой — день кода, строки отражают происхождение данных, а не делают вид, что столбцы симметричны.
• Возраст — Qwen2.5 Omni: выпущен в марте 2025 года, семнадцать месяцев в открытом доступе, сотни тысяч загрузок. InternLumina-U2: код для инференса опубликован 1 сентября 2026 года, ноль загрузок, ноль независимых запусков.
• Форма — Qwen2.5 Omni: ~7B сквозная модель, Thinker-Talker с выровненным по времени мультимодальным позиционным кодированием. InternLumina-U2: 16B всего / 1B активных, разреженная MoE-модель диффузионного LLM с восьмикодовым дискретным визуальным токенизатором.
• Входные данные: обе принимают текст и изображения; Qwen2.5 Omni дополнительно принимает аудио и видео для omni-чата; InternLumina-U2 дополнительно заявляет о понимании видео на основе 64 выбранных кадров и о понимании 3D по отрендеренным в Blender видам GLB/GLTF.
• Вывод — Qwen2.5 Omni: текст и потоковая речь, четыре голоса. InternLumina-U2: заявлены текст, генерация изображений по тексту до 1024×1024 и редактирование изображений по инструкциям.
• Поколение — Qwen2.5 Omni: генерирует слова и голос, но не пиксели. InternLumina-U2: пытается выполнять генерацию и редактирование изображений внутри той же модели дискретных токенов, которая читает текст.
• Веса и лицензия — обе в принципе имеют открытые веса под Apache-2.0; у Qwen2.5 Omni они доступны для скачивания уже сегодня, а у InternLumina-U2 пока не публичные.
• Обслуживание — Qwen2.5 Omni: размещённый API плюс самостоятельное развёртывание (тяжёлое, в полной точности); известен контекст 32K, без вызова функций. InternLumina-U2: не подлежит обслуживанию — выпущенный драйвер ожидает чекпоинты, которых не существует.
• Ключевые цифры — Qwen2.5 Omni: давно присутствует в таблице лидеров OmniBench (результат около 0.561 в текущих таблицах); InternLumina-U2: ChartQA 86.52, MathVision 33.22, GenEval 0.81 — все данные предоставлены производителем, являются предварительными и неполными.

Почему конфликт поколений — это настоящая история
Оставим в стороне возраст моделей — содержательная разница в том рубеже, на котором останавливается каждая из них. Qwen2.5 Omni выбрала посильную версию омни: широко воспринимать, отвечать текстом или голосом, а синтез изображений и видео оставлять специализированным генеративным моделям в других частях стека. Такое разделение труда — то, как по сути устроена каждая промышленная мультимодальная система 2026 года, и именно поэтому Qwen2.5 Omni смогла выйти в 2025 году и оставаться полезной в 2026-м: она хорошо делает свой участок работы и компонуется с остальными. InternLumina-U2 — это ставка на то, что разделение труда как раз и есть проблема: что модель, вынужденная представлять всё — восприятие и генерацию — в одном общем дискретном словаре, разовьёт более глубокое понимание визуального мира, чем модель, которой нужно лишь описывать его. Если эта ставка сыграет, это станет более важным результатом. Если нет, InternLumina-U2 окажется более медленной и прожорливой версией Qwen2.5 Omni, к весам которой неуклюже прикручен генератор изображений. Весь этот спор — а это спор между выпущенной в продакшен архитектурой и гипотезой, а не между двумя готовыми к запуску моделями — сводится к тому, оправдывает ли себя более сложная архитектура.

Карточка модели Qwen/Qwen2.5-Omni-7B на Hugging Face, зафиксированная 27 августа 2026 года, — обзор Thinker-Talker, лицензия Apache-2.0 и теги модальностей модели: текст, изображение, аудио и видео.
Что на самом деле можно купить за полтора года загрузок
Зрелость — это не настроение; это список вещей, которые ты знаешь. С Qwen2.5 Omni ты знаешь, что контекст в 32K — это жёсткое ограничение, и можешь проектировать с его учётом. Ты знаешь, что пути вызова функций нет, и не будешь делать вид, что он есть. Ты примерно знаешь, сколько стоит развёртывание — и через размещённый API, и на собственных GPU, — потому что модель оценили и запустили достаточно людей, чтобы цифры устоялись. Ты знаешь, что позиция в OmniBench реальна, потому что независимые лидерборды отслеживают её уже больше года. С InternLumina-U2 ни один из этих глаголов не применим — ты не знаешь и не можешь знать, потому что артефакта нет. Когда модели день от роду и у неё нет веса, любое утверждение о ней — это заявление о намерениях. Эта асимметрия — не упрёк науке; это правильная эпистемическая позиция для любого, кто выбирает, на чём строить.

Репозиторий GitHub InternLM/InternLumina-U2, снимок от 2 сентября 2026 года — главная страница репозитория, делающая архитектуру публичной, — описание, лицензия и скрипты для инференса, в то время как сами веса в дереве отсутствуют.
Решение о маршрутизации, честно сформулированное
Скажем прямо о доступности: OrcaRouter не размещает InternLumina-U2, потому что весов, которые можно было бы разместить, нет ни у кого. Qwen2.5 Omni мы тоже сейчас не предоставляем: эта модель работает через собственный API разработчика и сторонние платформы. Так что урок маршрутизации здесь — про позиционирование, а не про то, чтобы уже сегодня вызывать обе модели через один ключ. Устойчивый паттерн — тот, к которому рано или поздно приходит любое решение «зрелая модель против новичка»: проверенную модель держат на основном маршруте, где один API на 200+ моделей и транзит с нулевой наценкой означают, что вы платите ровно цену провайдера по прайс-листу и ничего сверху; непроверенного новичка направляют на тестовый маршрут с автоматическим переключением, чтобы при первой же заминке, уходе в сторону или бессмысленном ответе вызов автоматически переходил на модель с семнадцатимесячным послужным списком. Именно так вы сможете оценить амбициозную новую архитектуру вроде InternLumina-U2 в день, когда выйдут её веса, — не рискуя продовым маршрутом, на который вы уже полагаетесь.
Вердикт
Qwen2.5 Omni — это омни-модель, на которой можно строить уже сегодня: она выпущена, доступна для загрузки, документирована, с известными ограничениями и установленной ценой. InternLumina-U2 — омни-модель, за которой стоит следить: настоящий архитектурный шаг от восприятия к созданию, Apache-2.0, с открытым кодом и ожидающими публикации весами. Если ставка лаборатории на multi-codebook подтвердится в независимом тестировании, InternLumina-U2 будет не столько конкурентом Qwen2.5 Omni, сколько следующим поколением той же идеи. Если нет — семнадцатимесячный универсал, который реально вышел в свет, по-прежнему будет на месте и будет делать свою работу, как делал всё это время. Следите за заглушкой на Hugging Face; вердикт зависит от файлов safetensors, а не от этой статьи.
