Сгенерированная hero-карточка для InternLumina-U2 с бейджем PREVIEW, заголовком «InternLumina-U2», подзаголовком «One 16B diffusion model for image, video and 3D» — с подписью о Лаборатории искусственного интеллекта Шанхая, многокодовой диффузионной LLM, код выпущен 2026-09-01, веса скоро появятся; чипами Image, Video и 3D; абстрактными фигурами Understand-Generate-Edit синего, голубого и янтарного цветов справа; логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

InternLumina-U2 Preview: одна диффузионная модель на 16B параметров для изображений, видео и 3D — веса ещё будут опубликованы

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

1 сентября 2026 года в 04:03 UTC Шанхайская лаборатория искусственного интеллекта создала на GitHub репозиторий InternLumina-U2. Тринадцать минут спустя эта же организация зарегистрировала одноимённый репозиторий на Hugging Face. Не было ни анонсирующего поста, ни карточки модели, ни какого-либо объявления — только инференс-код для InternLumina-U2, модели смеси экспертов с 16 млрд параметров (1 млрд активных), которую лаборатория позиционирует как одну модель, охватывающую понимание изображений, генерацию изображений по тексту, редактирование изображений, понимание видео и 3D-понимание через единый интерфейс дискретных токенов. Код реален и публичен; самой модели пока нет. Веса помечены как «скоро появятся», репозиторий на Hugging Face — пустая заглушка, а обещанный технический отчёт так и не появился. И всё же то, что тихо вышло в свет 1 сентября, — это самая полная публичная картина данной модели из всех существующих.

Если вы впервые слышите об InternLumina-U2, в этом и заключается суть. О выпуске не было объявлено ничего, и независимых публикаций, судя по всему, пока не существует — именно такие ранние сигналы и есть то место, где подобная модель всплывает в первую очередь: до анонсирующего поста, а иногда и до публикации весов. Всё, что изложено ниже, взято из репозитория GitHub, со страницы проекта и из заглушки на Hugging Face, которую лаборатория опубликовала 1 сентября, а всё, что выходит за пределы этих источников, явно помечено как предположение.

Что на самом деле было выпущено 1 сентября

Репозиторий GitHub InternLM/InternLumina-U2 был создан 1 сентября 2026 года, и в тот же день в нём появились три коммита: инициализация; правка, в которой ссылка на модель отмечена как «скоро», а результаты бенчмарков — как «предварительные»; и исправление навигации. Он распространяется под лицензией Apache-2.0 и включает README под названием «Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing» (в английской и китайской версиях), полный инструментарий для инференса и дорожную карту. Стоит отметить один нюанс: новостная запись самого репозитория помечена «[2026-08]», однако инициализирующий коммит и обе временные метки репозитория датированы 1 сентября 2026 года, так что фактической датой выхода стоит считать начало сентября, а не август. Репозиторий, показанный ниже, и есть весь публичный релиз: каждый файл в дереве — часть того, что было выпущено, и больше нигде ничего пока нет.

A screenshot of the GitHub repository InternLM/InternLumina-U2 captured September 2, 2026, showing the repo description 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', an Apache-2.0 license, 4 stars, commits dated 'yesterday' including 'init repo', and the file tree with the inference entrypoints infer_1024_sft.sh, infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py.

GitHub — InternLM/InternLumina-U2, создан 2026-09-01 под лицензией Apache-2.0, с кодом инференса для текста, генерации изображений по текстовому описанию, понимания изображений, редактирования изображений, понимания видео и 3D-понимания.

Hugging Face — internlm/InternLumina-U2, created 2026-09-01, currently holds only a .gitattributes file and a 28-byte README whose entire content is the Apache-2.0 license header. No weights, no config, no tokenizer files.

Страница проекта — internlm.github.io/InternLumina-U2, со схемами архитектуры, предварительной таблицей бенчмарков и демо-заглушками; технический отчёт помечен как «скоро появится».

Инференс-код организован как один драйверный скрипт с отдельной секцией для каждой задачи: генерация текста, генерация изображений по текстовому описанию размером до 1024×1024 с настраиваемыми параметрами CFG и количества шагов, понимание изображений на естественных фотографиях и детальных диаграммах, редактирование изображений по инструкциям с опциональным режимом двойного CFG, понимание видео на основе 64 сэмплированных кадров и понимание 3D-сцен по GLB/GLTF-ассетам, которые до токенизации преобразуются в 64 вида с цветом и глубиной через встроенный конвейер Blender. Такая широта задач — вся концептуальная основа модели, и на этом стоит остановиться, прежде чем углубляться в архитектуру.

Одна модель, шесть задач, один словарь токенов

InternLumina-U2 принадлежит к быстро развивающемуся направлению исследований, делающему ставку на то, что язык и зрение должны совместно использовать единый интерфейс дискретных токенов, а не существовать в раздельных стеках понимания и генерации. Собственная более ранняя работа лаборатории в этом направлении — Lumina-DiMOO, унифицированная дискретно-диффузионная модель, представленная на WAIC 2025, — цитируется вместе с LLaDA2.0-Uni, Show-o2 и MMaDA как пионерские системы, на которые InternLumina-U2 опирается и которые, по её заявлению, превосходит. Конкретная ставка InternLumina-U2 состоит в том, что узким местом этих унифицированных моделей является не архитектура, а визуальный словарь: одна кодовая книга ограничивает объём информации, который может нести один визуальный токен, тогда как дискретно-непрерывные гибриды, разделяющие понимание и генерацию по разным представлениям, в любом случае вынуждают модель поддерживать два стека.

Ответ InternLumina-U2 — это полностью дискретное моделирование на основе нескольких кодовых книг. Визуальная часть модели использует токенизатор AToken от Apple, который описывает каждую визуальную позицию с помощью восьми взаимодополняющих кодовых книг — попытка сохранить локальную текстуру, встроенный текст, геометрию и высокочастотные детали, не увеличивая длину последовательности. На входе каждая из восьми кодовых книг имеет собственный эмбеддинг, и восемь таких эмбеддингов для каждой позиции конкатенируются и проецируются в единый backbone-токен. На выходе предсказание выполняется параллельно по пространству, но авторегрессионно по глубине кодовых книг: диффузионный backbone параллельно устраняет шум во многих замаскированных пространственных позициях, а затем авторегрессионная голова с несколькими кодовыми книгами предсказывает восемь кодов каждой позиции по порядку.

Масштаб — 16B суммарных параметров, 1B активных (16B-A1B), разреженная MoE-модель.

Языковая основа — диффузионная языковая модель LLaDA-2.0 MoE, у которой блочно-диффузионная целевая функция распространена на визуальные задачи благодаря совместному многозадачному обучению (описание поставщика).

Визуальное представление — полностью дискретные токены из 8 кодовых книг токенизатора AToken от Apple.

Аппаратное обеспечение — адаптировано к графическим процессорам NVIDIA и нейронным процессорам Huawei Ascend для обучения, оценки и вывода, с численным выравниванием на уровне операций между бэкендами.

A generated single-column state-of-play scoreboard titled 'InternLumina-U2 — the state of play' listing: Size 16B MoE, 1B active; Modalities image, video, 3D + T2I + editing; Visual tokens 8-codebook discrete (AToken); Backbone LLaDA-2.0 MoE diffusion LLM; Weights not released yet; Released code and page 2026-09-01, with a footer reading 'All details vendor-reported; no independent scores yet' and the OrcaRouter logo in the bottom-right corner.

Что это даёт на практике, если утверждения верны, — самая давняя мечта мультимодальной области: единый набор весов, который может читать изображение, редактировать его, создавать новое по текстовому описанию, отвечать на вопросы о видео и описывать 3D-объект — причём понимание и генерация усиливают друг друга через единый интерфейс, а не сшиваются из узкоспециализированных моделей. Это также утверждение, которое больше всего заслуживает скептического взгляда, потому что его труднее всего воплотить в жизнь.

Числа, каковы они есть.

Каждый результат бенчмарка InternLumina-U2 получен от вендора, является предварительным и неполным. В README и на странице проекта так и сказано: «Предварительные и неполные результаты. Полные сравнительные таблицы появятся в предстоящем техническом отчёте». Независимой оценки не существует, поскольку веса модели не публичны. Относитесь к приведённым ниже цифрам как к заявлениям самой лаборатории, а не к проверенным результатам.

Понимание графиков / документов — ChartQA 86.52, CharXiv-DQ 83.65 (по данным вендора).

Визуальные математические рассуждения — MathVision 33.22, DynaMath 56.37; по данным лаборатории, это превосходит InternVL3-8B, предназначенную только для понимания, по обоим тестам.

Устойчивость к галлюцинациям — HallusionBench 62.15.

Понимание видео — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (страница проекта).

3D-понимание — 3D MM-Vet 41.8.

Генерация изображений по тексту — DPG-Bench 87.10, TIIF-Bench Short/Long 84.60/85.95, GenEval 0.81 (страница проекта).

Редактирование изображений — ImgEdit 3.83.

История сравнений — то место, где честному читателю стоит притормозить. В README утверждается, что InternLumina-U2 превосходит унифицированные модели вроде InternVL-U, LLaDA2.0-Uni, Show-o2 и Lumina-DiMOO на бенчмарках точного понимания и генерации — однако собственная таблица на странице проекта показывает InternLumina-U2 с результатом 0,81 в GenEval против 0,89 у LLaDA2.0-Uni, так что модель отстаёт как минимум от одного конкурента как минимум по одной ключевой метрике генерации. Выбирать несколько выгодных чисел из неполной таблицы — это как раз то, что призвана смягчить оговорка о «полных сравнительных таблицах в техническом отчёте». Эти цифры — не более чем ориентировочный сигнал от лаборатории.

Что реально, а что обещано

Состав релиза расписан необычно чётко, и это важно для всех, кто решает, можно ли попробовать его уже сегодня. Выпущен код инференса. Не выпущены: веса, обучающий код (обещают выложить в отдельном репозитории), стек Ascend для обучения и инференса и технический отчёт. Репозиторий Hugging Face, в котором в итоге появится модель, — заглушка: на скриншоте ниже показано всё текущее содержимое страницы, на которую попадает читатель, нажав на ссылку «Model (coming soon)» в README.

A screenshot of the Hugging Face model page internlm/InternLumina-U2 captured September 2, 2026, showing the empty placeholder: the model name under the internlm organisation, a License badge reading apache-2.0, the notice 'README.md exists but content is empty', 'Downloads are not tracked for this model', and no inference provider yet serving the model.

Даже опубликованный код пока не может выдавать результат. Инференс-драйвер ожидает каталог с разбитой на части контрольной точкой в формате Hugging Face и веса токенизатора AToken по конкретному пути — ни того, ни другого в репозитории нет, — так что сегодня можно скачать лишь спецификацию того, как модель будет работать, а не работающую модель. А когда веса наконец появятся, самостоятельное развёртывание не будет рутинной задачей в духе pip install. Модель использует API генерации block-diffusion, а не стандартный интерфейс generate библиотеки Transformers, токенизатор AToken требует FlashAttention, при импорте коду нужна видимая GPU, корневой драйвер однопроцессный, а 3D-конвейер ожидает для кодирования ассетов Blender 4.5. Это настоящий проект по развёртыванию, а не эксперимент на выходных, — и именно такое трение призван сглаживать слой маршрутизации для большинства команд.

Когда веса появятся, обращайтесь с этой моделью как с непроверенной, какой она и является.

Никто не может запустить InternLumina-U2 сегодня, и ни один провайдер не может его обслуживать, потому что веса не находятся в открытом доступе. В какой-то момент это изменится — лицензия Apache-2.0 и модель агрессивного открытия исходного кода лаборатории на 2026 год (кампания ArchSpace «открыть всё», InternVL3.5, научные модели Intern-S2) делают выпуск весов скорее вероятным, чем гипотетическим. Когда это произойдёт, рациональный первый шаг — не ставить производственный конвейер на диффузионную модель первого дня с необычными требованиями к обслуживанию и нулевым количеством независимых оценок. Нужно запустить её рядом с моделью, которой вы уже доверяете, на тестовом контуре, с автоматическим переключением на проверенную модель в тот момент, когда новая начнёт вести себя некорректно. Именно для этого и создан слой маршрутизации: один API для более чем 200 моделей, цены провайдеров передаются без наценки, и отказоустойчивое переключение превращает «попробовать новое» в правило маршрутизации, а не в миграцию. OrcaRouter устроен именно так — и сразу проясним: мы не маршрутизируем InternLumina-U2 и не можем этого делать, потому что веса не выпущены. Этот раздел описывает порядок действий на тот случай, когда они появятся, а не заявляет, что модель доступна где-либо сегодня.

Что посмотреть дальше

Четыре события перевели бы InternLumina-U2 из разряда превью в реальность — в порядке убывания вероятности. Во-первых, наполнение репозитория Hugging Face: появление в этой заглушке файлов safetensors, конфига и весов токенизатора AToken — это и есть момент, когда модель реально существует. Во-вторых, технический отчет: предполагается, что в нем будут полные сравнительные таблицы, которые превратят приведенные выше частичные цифры от вендора во что-то проверяемое. В-третьих, репозиторий с обучающим кодом и стек Ascend — это важно для тех, кто хочет дообучать модель или запускать её на оборудовании, отличном от NVIDIA. В-четвертых, первая независимая оценка — аренный Elo, воспроизведенный прогон ChartQA или GenEval, — которая проверит обещание «одна модель — шесть задач» без предвзятости самой лаборатории. Публичность кода с 1 сентября означает, что архитектура уже известна; отсутствие весов означает, что все, что касается реального качества, — пока лишь заявление. Следите за репозиторием модели, а не за лентой анонсов: интересные части уже опубликованы, а сама модель, скорее всего, не за горами.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube