
InternLumina-U2 Preview: одна диффузионная модель на 16B параметров для изображений, видео и 3D — веса ещё будут опубликованы
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
1 сентября 2026 года в 04:03 UTC Шанхайская лаборатория искусственного интеллекта создала на GitHub репозиторий InternLumina-U2. Тринадцать минут спустя эта же организация зарегистрировала одноимённый репозиторий на Hugging Face. Не было ни анонсирующего поста, ни карточки модели, ни какого-либо объявления — только инференс-код для InternLumina-U2, модели смеси экспертов с 16 млрд параметров (1 млрд активных), которую лаборатория позиционирует как одну модель, охватывающую понимание изображений, генерацию изображений по тексту, редактирование изображений, понимание видео и 3D-понимание через единый интерфейс дискретных токенов. Код реален и публичен; самой модели пока нет. Веса помечены как «скоро появятся», репозиторий на Hugging Face — пустая заглушка, а обещанный технический отчёт так и не появился. И всё же то, что тихо вышло в свет 1 сентября, — это самая полная публичная картина данной модели из всех существующих.
Если вы впервые слышите об InternLumina-U2, в этом и заключается суть. О выпуске не было объявлено ничего, и независимых публикаций, судя по всему, пока не существует — именно такие ранние сигналы и есть то место, где подобная модель всплывает в первую очередь: до анонсирующего поста, а иногда и до публикации весов. Всё, что изложено ниже, взято из репозитория GitHub, со страницы проекта и из заглушки на Hugging Face, которую лаборатория опубликовала 1 сентября, а всё, что выходит за пределы этих источников, явно помечено как предположение.
Что на самом деле было выпущено 1 сентября
Репозиторий GitHub InternLM/InternLumina-U2 был создан 1 сентября 2026 года, и в тот же день в нём появились три коммита: инициализация; правка, в которой ссылка на модель отмечена как «скоро», а результаты бенчмарков — как «предварительные»; и исправление навигации. Он распространяется под лицензией Apache-2.0 и включает README под названием «Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing» (в английской и китайской версиях), полный инструментарий для инференса и дорожную карту. Стоит отметить один нюанс: новостная запись самого репозитория помечена «[2026-08]», однако инициализирующий коммит и обе временные метки репозитория датированы 1 сентября 2026 года, так что фактической датой выхода стоит считать начало сентября, а не август. Репозиторий, показанный ниже, и есть весь публичный релиз: каждый файл в дереве — часть того, что было выпущено, и больше нигде ничего пока нет.

• GitHub — InternLM/InternLumina-U2, создан 2026-09-01 под лицензией Apache-2.0, с кодом инференса для текста, генерации изображений по текстовому описанию, понимания изображений, редактирования изображений, понимания видео и 3D-понимания.
• Hugging Face — internlm/InternLumina-U2, created 2026-09-01, currently holds only a .gitattributes file and a 28-byte README whose entire content is the Apache-2.0 license header. No weights, no config, no tokenizer files.
• Страница проекта — internlm.github.io/InternLumina-U2, со схемами архитектуры, предварительной таблицей бенчмарков и демо-заглушками; технический отчёт помечен как «скоро появится».
Инференс-код организован как один драйверный скрипт с отдельной секцией для каждой задачи: генерация текста, генерация изображений по текстовому описанию размером до 1024×1024 с настраиваемыми параметрами CFG и количества шагов, понимание изображений на естественных фотографиях и детальных диаграммах, редактирование изображений по инструкциям с опциональным режимом двойного CFG, понимание видео на основе 64 сэмплированных кадров и понимание 3D-сцен по GLB/GLTF-ассетам, которые до токенизации преобразуются в 64 вида с цветом и глубиной через встроенный конвейер Blender. Такая широта задач — вся концептуальная основа модели, и на этом стоит остановиться, прежде чем углубляться в архитектуру.
Одна модель, шесть задач, один словарь токенов
InternLumina-U2 принадлежит к быстро развивающемуся направлению исследований, делающему ставку на то, что язык и зрение должны совместно использовать единый интерфейс дискретных токенов, а не существовать в раздельных стеках понимания и генерации. Собственная более ранняя работа лаборатории в этом направлении — Lumina-DiMOO, унифицированная дискретно-диффузионная модель, представленная на WAIC 2025, — цитируется вместе с LLaDA2.0-Uni, Show-o2 и MMaDA как пионерские системы, на которые InternLumina-U2 опирается и которые, по её заявлению, превосходит. Конкретная ставка InternLumina-U2 состоит в том, что узким местом этих унифицированных моделей является не архитектура, а визуальный словарь: одна кодовая книга ограничивает объём информации, который может нести один визуальный токен, тогда как дискретно-непрерывные гибриды, разделяющие понимание и генерацию по разным представлениям, в любом случае вынуждают модель поддерживать два стека.
Ответ InternLumina-U2 — это полностью дискретное моделирование на основе нескольких кодовых книг. Визуальная часть модели использует токенизатор AToken от Apple, который описывает каждую визуальную позицию с помощью восьми взаимодополняющих кодовых книг — попытка сохранить локальную текстуру, встроенный текст, геометрию и высокочастотные детали, не увеличивая длину последовательности. На входе каждая из восьми кодовых книг имеет собственный эмбеддинг, и восемь таких эмбеддингов для каждой позиции конкатенируются и проецируются в единый backbone-токен. На выходе предсказание выполняется параллельно по пространству, но авторегрессионно по глубине кодовых книг: диффузионный backbone параллельно устраняет шум во многих замаскированных пространственных позициях, а затем авторегрессионная голова с несколькими кодовыми книгами предсказывает восемь кодов каждой позиции по порядку.
• Масштаб — 16B суммарных параметров, 1B активных (16B-A1B), разреженная MoE-модель.
• Языковая основа — диффузионная языковая модель LLaDA-2.0 MoE, у которой блочно-диффузионная целевая функция распространена на визуальные задачи благодаря совместному многозадачному обучению (описание поставщика).
• Визуальное представление — полностью дискретные токены из 8 кодовых книг токенизатора AToken от Apple.
• Аппаратное обеспечение — адаптировано к графическим процессорам NVIDIA и нейронным процессорам Huawei Ascend для обучения, оценки и вывода, с численным выравниванием на уровне операций между бэкендами.

Что это даёт на практике, если утверждения верны, — самая давняя мечта мультимодальной области: единый набор весов, который может читать изображение, редактировать его, создавать новое по текстовому описанию, отвечать на вопросы о видео и описывать 3D-объект — причём понимание и генерация усиливают друг друга через единый интерфейс, а не сшиваются из узкоспециализированных моделей. Это также утверждение, которое больше всего заслуживает скептического взгляда, потому что его труднее всего воплотить в жизнь.
Числа, каковы они есть.
Каждый результат бенчмарка InternLumina-U2 получен от вендора, является предварительным и неполным. В README и на странице проекта так и сказано: «Предварительные и неполные результаты. Полные сравнительные таблицы появятся в предстоящем техническом отчёте». Независимой оценки не существует, поскольку веса модели не публичны. Относитесь к приведённым ниже цифрам как к заявлениям самой лаборатории, а не к проверенным результатам.
• Понимание графиков / документов — ChartQA 86.52, CharXiv-DQ 83.65 (по данным вендора).
• Визуальные математические рассуждения — MathVision 33.22, DynaMath 56.37; по данным лаборатории, это превосходит InternVL3-8B, предназначенную только для понимания, по обоим тестам.
• Устойчивость к галлюцинациям — HallusionBench 62.15.
• Понимание видео — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (страница проекта).
• 3D-понимание — 3D MM-Vet 41.8.
• Генерация изображений по тексту — DPG-Bench 87.10, TIIF-Bench Short/Long 84.60/85.95, GenEval 0.81 (страница проекта).
• Редактирование изображений — ImgEdit 3.83.
История сравнений — то место, где честному читателю стоит притормозить. В README утверждается, что InternLumina-U2 превосходит унифицированные модели вроде InternVL-U, LLaDA2.0-Uni, Show-o2 и Lumina-DiMOO на бенчмарках точного понимания и генерации — однако собственная таблица на странице проекта показывает InternLumina-U2 с результатом 0,81 в GenEval против 0,89 у LLaDA2.0-Uni, так что модель отстаёт как минимум от одного конкурента как минимум по одной ключевой метрике генерации. Выбирать несколько выгодных чисел из неполной таблицы — это как раз то, что призвана смягчить оговорка о «полных сравнительных таблицах в техническом отчёте». Эти цифры — не более чем ориентировочный сигнал от лаборатории.
Что реально, а что обещано
Состав релиза расписан необычно чётко, и это важно для всех, кто решает, можно ли попробовать его уже сегодня. Выпущен код инференса. Не выпущены: веса, обучающий код (обещают выложить в отдельном репозитории), стек Ascend для обучения и инференса и технический отчёт. Репозиторий Hugging Face, в котором в итоге появится модель, — заглушка: на скриншоте ниже показано всё текущее содержимое страницы, на которую попадает читатель, нажав на ссылку «Model (coming soon)» в README.

Даже опубликованный код пока не может выдавать результат. Инференс-драйвер ожидает каталог с разбитой на части контрольной точкой в формате Hugging Face и веса токенизатора AToken по конкретному пути — ни того, ни другого в репозитории нет, — так что сегодня можно скачать лишь спецификацию того, как модель будет работать, а не работающую модель. А когда веса наконец появятся, самостоятельное развёртывание не будет рутинной задачей в духе pip install. Модель использует API генерации block-diffusion, а не стандартный интерфейс generate библиотеки Transformers, токенизатор AToken требует FlashAttention, при импорте коду нужна видимая GPU, корневой драйвер однопроцессный, а 3D-конвейер ожидает для кодирования ассетов Blender 4.5. Это настоящий проект по развёртыванию, а не эксперимент на выходных, — и именно такое трение призван сглаживать слой маршрутизации для большинства команд.
Когда веса появятся, обращайтесь с этой моделью как с непроверенной, какой она и является.
Никто не может запустить InternLumina-U2 сегодня, и ни один провайдер не может его обслуживать, потому что веса не находятся в открытом доступе. В какой-то момент это изменится — лицензия Apache-2.0 и модель агрессивного открытия исходного кода лаборатории на 2026 год (кампания ArchSpace «открыть всё», InternVL3.5, научные модели Intern-S2) делают выпуск весов скорее вероятным, чем гипотетическим. Когда это произойдёт, рациональный первый шаг — не ставить производственный конвейер на диффузионную модель первого дня с необычными требованиями к обслуживанию и нулевым количеством независимых оценок. Нужно запустить её рядом с моделью, которой вы уже доверяете, на тестовом контуре, с автоматическим переключением на проверенную модель в тот момент, когда новая начнёт вести себя некорректно. Именно для этого и создан слой маршрутизации: один API для более чем 200 моделей, цены провайдеров передаются без наценки, и отказоустойчивое переключение превращает «попробовать новое» в правило маршрутизации, а не в миграцию. OrcaRouter устроен именно так — и сразу проясним: мы не маршрутизируем InternLumina-U2 и не можем этого делать, потому что веса не выпущены. Этот раздел описывает порядок действий на тот случай, когда они появятся, а не заявляет, что модель доступна где-либо сегодня.
Что посмотреть дальше
Четыре события перевели бы InternLumina-U2 из разряда превью в реальность — в порядке убывания вероятности. Во-первых, наполнение репозитория Hugging Face: появление в этой заглушке файлов safetensors, конфига и весов токенизатора AToken — это и есть момент, когда модель реально существует. Во-вторых, технический отчет: предполагается, что в нем будут полные сравнительные таблицы, которые превратят приведенные выше частичные цифры от вендора во что-то проверяемое. В-третьих, репозиторий с обучающим кодом и стек Ascend — это важно для тех, кто хочет дообучать модель или запускать её на оборудовании, отличном от NVIDIA. В-четвертых, первая независимая оценка — аренный Elo, воспроизведенный прогон ChartQA или GenEval, — которая проверит обещание «одна модель — шесть задач» без предвзятости самой лаборатории. Публичность кода с 1 сентября означает, что архитектура уже известна; отсутствие весов означает, что все, что касается реального качества, — пока лишь заявление. Следите за репозиторием модели, а не за лентой анонсов: интересные части уже опубликованы, а сама модель, скорее всего, не за горами.
