
InternLumina-U2 против Microsoft Mage-VL: две тихие лаборатории делают ставку на то, что визуальные токены должны нести больше
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Microsoft Mage-VL и InternLumina-U2 вышли так же, как исследовательские лаборатории выпускают результаты, когда ещё не уверены, что это продукт: молча. Microsoft опубликовала веса и код Mage-VL на Hugging Face 25 июля 2026 года без анонса; организация InternLM Шанхайской лаборатории искусственного интеллекта опубликовала код инференса InternLumina-U2 на GitHub 1 сентября 2026 года тоже без анонса. С разницей в пять недель две крупнейшие лаборатории мира выпустили модели, объединённые тихой убеждённостью — что узким местом является то, как мы превращаем изображения в токены, — и оставили их сообществу, чтобы оно само их заметило. Одну из них можно скачать и запустить уже сегодня, хотя и с неудобствами. Другую запустить нельзя вовсе, потому что её весов ещё не существует. Это честная карта обеих моделей и объяснение того, почему «обе заявлены производителем, обе не проверены» — не одно и то же для каждой из них.
Пять недель, две ставки на эффективность представления
Сквозная нить здесь реальна, а не риторична. Mage-VL — это видеомодель, нативно работающая с кодеками: вместо того чтобы декодировать поток в равномерно семплированные кадры и прогонять плотную сетку патчей через замороженный визуальный трансформер, предобученный на веб-данных, она следует структуре современных видеокодеков, разделяя поток на опорные кадры и сжатые данные движения между ними и напрямую потребляя это компактное представление. Заявленный Microsoft выигрыш — это значительное сокращение визуальных токенов и заметно более быстрый тракт потокового восприятия; компания описывает это как исправление своего рода парадокса Моравца для видеоязыковых моделей, где небольшие задачи восприятия в реальном времени требуют столько же вычислений, сколько и сложные офлайн-рассуждения. Mage-VL — это наблюдатель: он эффективно потребляет видео и отвечает на вопросы об увиденном почти в реальном времени.
InternLumina-U2 — это ставка на то же узкое место, но с другой стороны. Если Mage-VL сжимает видео, следуя кодекам, то InternLumina-U2 сжимает все визуальные входные данные, описывая каждую позицию восемью взаимодополняющими дискретными кодами вместо одного, с помощью токенизатора, который лаборатория называет AToken. Ставка в том, что одна кодовая книга ограничивает объём информации, который может нести один визуальный токен, поэтому словарь из нескольких кодовых книг позволяет одной диффузионной модели с 16 млрд параметров выполнять понимание и генерацию через один и тот же интерфейс — читать график, отвечать на вопрос по видео, описывать 3D-объект, генерировать изображение по тексту, редактировать его по инструкции — без отдельного генеративного стека. Mage-VL стремится дёшево воспринимать потоки, а InternLumina-U2 хочет воспринимать и рисовать одним набором весов.
Табло
Показатели обеих моделей предоставлены вендором и не были воспроизведены независимо, поэтому таблица результатов помечает каждую строку указанием на источник данных.
• Shape — Mage-VL: компактная кодеко-нативная vision-language модель (примерно 5 млрд параметров в BF16), построенная на базе текстовой модели Qwen и обученная пониманию изображений и видео. InternLumina-U2: MoE с 16 млрд параметров и 1 млрд активных (16B-A1B), разреженная диффузионная LLM, охватывающая понимание, генерацию и редактирование.
• Визуальное представление — Mage-VL: кодеко-нативные токены, следующие структуре видеокодека (опорный кадр плюс движение); сообщается о сокращении визуальных токенов более чем на 75% на потоковом видео. InternLumina-U2: полностью дискретные токены из восьми кодовых книг от токенизатора AToken.
• Что делает — Mage-VL: воспринимает изображения и видео на входе, отвечает текстом; создан для потокового восприятия. InternLumina-U2: заявляет о таких возможностях, как работа с текстом, понимание изображений, генерация изображений по тексту, редактирование изображений, понимание видео и 3D-понимание.
• Веса — Mage-VL: публично доступны на Hugging Face с 25 июля 2026 года (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: не публичны — репозиторий на Hugging Face представляет собой пустую заглушку, веса помечены как «скоро будут».
• Ключевые цифры — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, все указаны Microsoft. InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81, все указаны лабораторией, предварительные и частичные.
• Реальное состояние обслуживания — Mage-VL: скачать можно, но стандартного пути через vLLM или SGLang нет; код требует trust_remote_code, и ни один инференс-провайдер сейчас его не развёртывает. InternLumina-U2: не может обслуживаться никем — веса отсутствуют в публичном доступе, а даже выпущенный инференс-драйвер ожидает файлы чекпоинтов, которых нет в репозитории.

«Доступно, но неудобно» — это не то же самое, что «недоступно».
Это различие важнее всего, если вы действительно пытаетесь что-то создать. Mage-VL реален по самому главному критерию: веса лежат на Hugging Face, карточку модели с конца июля активно скачивают, а вокруг неё сложилась небольшая экосистема квантованных версий от сообщества. «Реальный» не значит «простой». На карточке модели указан тег custom-code, визуальный энкодер — это не стандартный замороженный ViT, на который рассчитаны существующие серверные стеки, а собственный репозиторий Microsoft наглядно демонстрирует практическое следствие: для запуска требуется trust_remote_code, и готового развёртывания у провайдера нет. Но целеустремлённая команда с GPU может загрузить модель, нацелить её на видеопоток и проверить, подтверждается ли тезис о codec-native подходе на их данных. Это огромная разница с InternLumina-U2, где то же предложение заканчивается иначе: целеустремлённая команда может прочитать код инференса, и на этом всё останавливается, потому что загружать веса нечего.

Карточка модели microsoft/Mage-VL на Hugging Face, снимок от 27 августа 2026 года — описание потоковой передачи с нативным кодеком, лицензия Apache-2.0, тег arXiv и раздел поставщиков инференса, показывающий, что ни один провайдер в настоящее время не развертывает эту модель.
Асимметрия бенчмарков следует той же логике. Показатели обеих моделей — это заявления разработчиков, и независимых повторных прогонов пока не было. Но заявления Mage-VL по крайней мере опираются на доступный для загрузки артефакт, а значит, разрыв между заявлением и проверкой сводится к тому, что кто-то этот артефакт запустит. Заявления InternLumina-U2 опираются на пункт дорожной карты — «полные сравнительные таблицы появятся в предстоящем техническом отчете» — и не существует артефакта, который мог бы их проверить. Частичная таблица самой лаборатории даже показывает, что модель отстает как минимум от одного соперника, которого, по ее словам, превосходит (GenEval 0,81 против 0,89 у LLaDA2.0-Uni), — полезное напоминание читать ярлык «предварительные, частичные» буквально.
Где они могли сочинять, а не соревноваться.
Полезнее всего рассматривать эти две модели как соседние ступени одной лестницы, а не как соперников за одну и ту же работу. Наблюдатель, встроенный в кодек, вроде Mage-VL, интересен именно тем, что он достаточно дёшев, чтобы работать непрерывно: он просматривает каждый кадр потока и эскалирует только тогда, когда появляется что-то, заслуживающее внимания более крупной модели. Более крупная модель, к которой он обращается, в принципе могла бы быть унифицированной моделью того типа, которым InternLumina-U2 себя и называет: постоянно активный шлюз, который решает, на что смотреть, и глубокая модель, которая действительно читает график, отслеживает 3D-сцену или создаёт отредактированное изображение. Обе не проверены — Mage-VL не проверена, но запускаема, InternLumina-U2 не проверена и не выпущена, — так что честная постановка вопроса — это композиция, которую можно собрать после независимой проверки каждой из сторон, а не очное соревнование, которое можно запустить уже сегодня.

Репозиторий InternLM/InternLumina-U2 на GitHub, снимок от 2 сентября 2026 года — главная страница репозитория, показывающая описание многокодовой диффузии, значок лицензии Apache-2.0 и скрипты точек входа для инференса, которые составляют публичный релиз, в то время как веса остаются вне дерева репозитория.
Что делает уровень маршрутизации с непроверенными контрольными точками?
Ни одна из этих моделей не размещена на OrcaRouter, и мы не собираемся утверждать обратное — у Mage-VL нет стандартного способа развернуть модель нигде, а у InternLumina-U2 нет весов. DSL маршрутизации в этой ситуации полезен как раз тем, что позволяет выразить описанную выше композицию одним вызовом вместо специального связующего кода: дешёвая постоянно активная модель восприятия подаёт данные более глубокой модели, образуя цепочку, в которой дорогая модель запускается только тогда, когда дешёвая сообщает об изменениях. Что касается проблемы непроверенного чекпоинта — а именно в ней и заключается весь риск обеих моделей, — автоматическое переключение на резервный вариант позволяет команде попробовать модель вроде Mage-VL на реальном пути, не ставя этот путь на кон: как только новый чекпоинт зависает, возвращает мусор или выбрасывает исключение, вызов переходит к проверенной модели, и инженеру не нужно просыпаться, чтобы щёлкнуть выключателем. Один API для 200+ моделей, цена провайдера по прайс-листу передаётся с нулевой наценкой, а новая модель опробуется под страховочной сеткой, а не в боевых условиях продакшена.
Суть
Если вы хотите проверить тезис о codec-native видео сегодня, существует только Mage-VL — и слово «существует» здесь не обходится без оговорок о кастомном коде и самостоятельном сервинге. Если вы хотите проверить тезис об унифицированной модели с несколькими кодовыми книгами, сделать это нельзя: InternLumina-U2 пока остаётся спецификацией, ожидающей свои веса; всё, что можно, — прочитать её архитектуру уже сейчас, чтобы быть готовым в тот момент, когда заглушка на Hugging Face заполнится. Относитесь к модели Microsoft как к неудобному, но реальному артефакту, а к модели Shanghai AI Lab — как к хорошо документированному обещанию, и помните: в этом сравнении «заявлено вендором и не воспроизведено» применимо к обеим — просто значение у этого разное, когда есть файл, который можно скачать.
