Титульная карточка для сравнения «InternLumina-U2 против Gemini Omni 1.1 Flash» с подзаголовком «Модель, которую вы пока не можете запустить, против той, за которую платите посекундно» и тремя информационными чипами — «InternLumina-U2: только код, веса скоро появятся», «Gemini Omni 1.1 Flash: GA 27 августа 2026 г.», «$0.03–$0.30 за секунду видео» — с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

InternLumina-U2 против Gemini Omni 1.1 Flash: модель, которую вы пока не можете запустить, против той, за которую платите посекундно

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Если ваш дедлайн на этой неделе, у этого сравнения есть ответ в одно предложение. Gemini Omni 1.1 Flash — общедоступная модель генерации видео от Google: вы вызываете её через API, она возвращает клип с синхронизированным звуком, и вы платите за каждую секунду результата. InternLumina-U2 — тихо опубликованная исследовательская модель Shanghai AI Laboratory под лицензией Apache-2.0: вы можете скачать её код для инференса, но не веса, которые лаборатория до сих пор помечает как «скоро». Одна — продукт, который можно купить прямо сейчас; другая — ставка в виде статьи, которую вы вообще не можете запустить. Интересный вопрос: зачем вообще кто-то ставит их в один ряд, и что каждая из них говорит о том, куда движется открытая мультимодальная разработка в конце 2026 года.

Всё нижеперечисленное помечено по источнику. Сведения об InternLumina-U2 взяты из репозитория GitHub и страницы проекта, опубликованных лабораторией 1 сентября 2026 года — в тот же день, когда появилась пустая заглушка на Hugging Face, — и каждый её показатель в бенчмарках предоставлен вендором, является предварительным и не воспроизведён. Сведения о Gemini Omni 1.1 Flash взяты из собственных материалов Google и страницы с ценами на модель, которая стала общедоступной 27 августа 2026 года.

Два ответа на один и тот же «мультимодальный» вопрос

Обе модели существуют под расплывчатым лозунгом «одна модель — множество модальностей», и только этот общий ярлык является причиной, почему их вообще сравнивают. Помимо него у них почти нет ничего общего. Gemini Omni 1.1 Flash — это закрытый облачный сервис генерации видео, в котором видео является приоритетом: подайте на вход текст, изображение, короткий референсный клип или аудио — и он выдаст до десяти секунд видео в разрешении 720p со встроенными речью, музыкой и звуковыми эффектами, которые можно продлевать шагами по десять секунд вплоть до сцены длительностью сорок секунд. Модель анализирует уже имеющийся у вас клип — при продлении теперь учитывается до десяти секунд предыдущего контекста вместо прежних одной — и поддерживает управление первым и последним кадром, так что вы можете зафиксировать начало и конец съёмки, а модель заполнит середину. Это инструмент для создания движущихся изображений, продаваемый посекундно.

InternLumina-U2 — это ставка в противоположном направлении: единая разреженная модель смеси экспертов, 16B суммарных параметров с 1B активных, которая, как утверждается, понимает изображения, видео и 3D-объекты, а также генерирует и редактирует изображения через единый интерфейс дискретных токенов. Её визуальная часть полностью дискретна — восемь дополняющих друг друга кодовых книг от токенизатора, который лаборатория называет AToken, поэтому каждая визуальная позиция описывается восемью кодами, а не одним, — а языковая часть представляет собой диффузионный каркас, который лаборатория развивает на основе LLaDA-2.0. Идея в том, что понимание и генерация должны усиливать друг друга в едином наборе весов, а не собираться из специализированных моделей по отдельности. Работает ли это, сейчас ответить невозможно: модель нигде не запускается, потому что веса публично не существуют.

Табло, какое оно есть

У честного табло для этой пары в каждой строке должно быть указано происхождение, поскольку в одном столбце — выпущенный продукт с опубликованными ценами, а в другом — неопубликованное исследовательское утверждение, у которого нет цены вообще.

• Что это: Gemini Omni 1.1 Flash — размещённая в облаке модель для генерации и редактирования видео (идентификатор модели: gemini-omni-1.1-flash); дата общего доступа — 27 августа 2026 года. InternLumina-U2 — диффузионная LLM с открытым кодом для всестороннего визуального понимания, генерации и редактирования изображений; исходный код выпущен 1 сентября 2026 года.

• Веса — Gemini Omni 1.1 Flash: отсутствуют, модель закрытая и доступна только через хостинг. InternLumina-U2: пока тоже нет, но лицензия Apache-2.0 и явно помечено «скоро».

• Что вы получаете — Gemini Omni 1.1 Flash: 10-секундные клипы 720p со звуком, расширяемые до 40 секунд; масштабирование до 1080p и 4K; а также текст. InternLumina-U2: пока ничего — код для инференса и дорожная карта.

• Что принимает на вход — Gemini Omni 1.1 Flash: текст, изображения, видео (до ~131K входных токенов; три 10-секундных клипа на запрос), аудио. InternLumina-U2: заявлены текст, естественные изображения, плотные диаграммы, видео на основе 64 сэмплированных кадров, а также 3D-активы GLB/GLTF, отрендеренные в 64 цветовых и глубинных вида.

• Как это запускается — Gemini Omni 1.1 Flash: API Gemini от Google через Interactions API с сохранением состояния; доступ для пользователей через Google Flow для подписчиков AI Plus, Pro и Ultra. InternLumina-U2: только self-host, и только после выхода весов; код ожидает разделённый каталог контрольных точек, веса токенизатора AToken, FlashAttention и Blender 4.5 для 3D-пути.

• Сколько это стоит — Gemini Omni 1.1 Flash: $0,03/сек при 360p в черновом режиме, $0,10/сек при 720p, $0,15/сек при 1080p, $0,30/сек при 4K, с тарифом на токены $1,50 за миллион на входе и $9,00 за миллион на текстовом выходе. InternLumina-U2: столько, сколько будут стоить ваши собственные GPU, когда он появится.

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

Эти две колонки не измеряют одну и ту же ось. Сторона Gemini имеет цену, предоставляется и сразу полезна; сторона InternLumina — это спецификация модели, которая ещё не является моделью.

Что действительно актуально: GA-версия Gemini Omni 1.1 Flash.

На этой неделе Gemini Omni 1.1 Flash важен сам по себе, потому что это момент, когда линейка omni-видео от Google перестала быть превью. Более ранняя конечная точка Gemini Omni Flash preview должна быть отключена 30 сентября 2026 года, и эта GA-модель — замена, на которую разработчиков переводят. Список улучшений конкретен: расширение сцены до сорока секунд, собираемое из десятисекундных шагов; управление ключевыми кадрами, позволяющее задать первый и последний кадр, а модель генерирует соединяющие их кадры; референсные клипы длиной до трех секунд для сохранения персонажа или обстановки; и черновой уровень 360p по цене в треть от 720p, работающий до 60% быстрее для итераций по промптам перед дорогим финальным рендером. Если вы строите видеоконвейеры, таблица цен — $0,10 за секунду 720p, $1,01 за десятисекундный клип, примерно $4 за сорокасекундную сцену 720p, собранную из четырех extension-вызовов, — это цифра, которая меняет вашу модель затрат.

Ничто из этого не делает её конкурентом InternLumina-U2 в операционном смысле. Gemini Omni 1.1 Flash генерирует движение; InternLumina-U2, если её заявления переживут контакт с весами, будет понимать движение и генерировать статичные изображения. Команда, которой нужен видеоролик о продукте в этом квартале, не выбирает между этими двумя — из этой пары вообще можно вызвать только модель Gemini, и она доступна через собственный API Google и несколько сторонних платформ.

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

Документация Gemini API «Models» на сайте Google для разработчиков ИИ, сохранено 2 сентября 2026 года — страница, перечисляющая текущее семейство Gemini, с линейкой Gemini Omni в боковой навигации.

Часть, которая совсем не актуальна: InternLumina-U2

Релиз InternLumina-U2 от 1 сентября был максимально тихим: три коммита в репозиторий GitHub, страница проекта, 28-байтовая заглушка на Hugging Face, всё содержимое которой — заголовок лицензии Apache-2.0, и никакого анонса. По-настоящему публичны только инфраструктура инференса и архитектура, и их стоит внимательно изучить именно потому, что никому не удалось протестировать саму модель. В репозитории представлен драйвер с точкой входа на каждую задачу: генерация текста, генерация изображений по текстовому описанию до 1024×1024, понимание изображений (как естественных, так и плотных диаграмм), редактирование изображений по инструкциям с опциональным режимом двойного CFG, понимание видео на основе 64 сэмплированных кадров и 3D-понимание на отрендеренных в Blender видах GLB/GLTF-моделей. Конструкторская ставка в том, что дискретный визуальный словарь с несколькими кодовыми книгами позволяет одному бэкбону делать всё это без раздувания длины последовательности — тот же инстинкт «визуальные токены должны нести больше информации», который движет видеомоделями, нативными для кодеков, применённый к единому интерфейсу понимания и генерации.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

GitHub-репозиторий InternLM/InternLumina-U2, снимок от 2 сентября 2026 года — страница репозитория под лицензией Apache-2.0 с описанием «Multi-Codebook Diffusion Large Language Model», тремя коммитами и скриптами инференса для каждой задачи, которые на данный момент составляют весь публичный релиз.

Таблица бенчмарков на странице проекта помечена самой лабораторией как «предварительные, частичные результаты», и приведённые там цифры дают неоднозначную картину: сильные показатели по диаграммам и документам (ChartQA 86,52, CharXiv-DQ 83,65, по данным вендора) соседствуют с GenEval 0,81, который уступает 0,89 по крайней мере одной модели, которую, по утверждению лаборатории, их модель превосходит. Независимой оценки нет, потому что оценивать нечего — модели не существует. Всё, что касается реального качества, остаётся лишь заявлением, пока safetensors-файлы не появятся в этой пустой заглушке Hugging Face.

Что делает уровень маршрутизации, когда существует только одна сторона

Это одно из тех сравнений, где маршрутизация по-настоящему упирается во время, а не в выбор. Мы не будем делать вид, что OrcaRouter обслуживает InternLumina-U2, — этого не может никто: веса не опубликованы, — и Gemini Omni 1.1 Flash в нашем каталоге тоже нет; вы обращаетесь к нему через собственный API Google. Настоящее назначение слоя маршрутизации в этом промежутке — держать ваши варианты открытыми, не перестраивая пайплайн дважды. Механизм — сквозная передача цены (pass-through): как только размещённая модель вендора попадает в каталог, цена из прайс-листа провайдера передаётся с нулевой наценкой, так что посекундная ставка, опубликованная вендором, становится той посекундной ставкой, которую вы платите через один ключ, а не по контракту с каждым провайдером. А когда наконец появится релиз весов под Apache-2.0 вроде InternLumina-U2, рациональный ход — не выдёргивать работающий видеостек, а развернуть новую модель на тестовом маршруте за автоматическим переключением при сбое, чтобы при первом же некорректном поведении непроверенной диффузионной модели вызов автоматически возвращался к модели, которой вы уже доверяете, — без изменения кода. Пробуйте новое там, где оно не может вам навредить; маршрутизируйте то, что приносит деньги.

Вердикт

Если вам нужна видеомодель уже в этом месяце, выбор предрешён: Gemini Omni 1.1 Flash существует, имеет цену и общедоступна, а InternLumina-U2 не может вызвать никто. Если вы следите за тем, куда движутся открытые мультимодальные исследования, InternLumina-U2 — более интересный артефакт: редкая ставка от крупной лаборатории на полностью дискретный multi-codebook подход под лицензией Apache-2.0; архитектура уже опубликована, а веса, вероятно, скоро появятся. Воспринимайте репозиторий как превью исследовательского направления, GA-видеомодель — как инструмент, на котором можно строить уже сегодня, и не позволяйте общему ярлыку «мультимодальный» убедить вас, что они конкурируют за одну и ту же задачу.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube