
InternLumina-U2 プレビュー:画像・動画・3D向け単一16B拡散モデル — ウェイトは近日公開予定
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
2026年9月1日 04:03 UTC、上海AIラボラトリーはGitHubリポジトリInternLumina-U2を作成した。その13分後、同じ組織がHugging Faceに同名のリポジトリを登録した。ローンチ告知もモデルカードも、いかなる発表もなかった——あったのはInternLumina-U2用の推論コードだけだ。これは16Bパラメータのmixture-of-expertsモデル(アクティブは1B)で、同研究所はこれを、単一の離散トークンインターフェースを通じて画像理解、テキストから画像への生成、画像編集、動画理解、3D理解をカバーする1つのモデルだと位置づけている。コードは本物で公開されている。しかしモデル本体はまだ公開されていない——まだ。重みは「近日公開」と表示され、Hugging Faceのリポジトリは空のプレースホルダで、約束された技術報告書もまだ登場していない。それでも、9月1日に静かに公開されたものは、このモデルに関する現存する最も完全な公開情報なのである。
「InternLumina-U2」について初めて耳にしたのなら、それが狙い通りです。このリリースについては何も発表されておらず、独立した報道もまだ存在していないようです。初期シグナルの記事は、まさにこのようなモデルが最初に表面化する場所であり、ローンチ投稿より前、時にはウェイトの公開より前に現れます。以下はすべて、ラボ自身が9月1日に公開したGitHubリポジトリ、プロジェクトページ、Hugging Faceスタブから引用したものであり、これらの情報源を超えるものはすべて明示的に推測として記載しています。
9月1日に実際にリリースされたもの
GitHubリポジトリInternLM/InternLumina-U2は、2026年9月1日に作成され、その日に3件のコミットが行われました。その3件とは、初期コミット、モデルリンクを「近日公開」としベンチマーク結果を「暫定」と表記した変更、そしてナビゲーション修正です。ライセンスはApache-2.0で、「Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing」というタイトルのREADME(英語版と中国語版)に加え、完全な推論ハーネスとロードマップを備えています。注目すべき点として、リポジトリ自体のニュース項目には「[2026-08]」と記載されていますが、初期コミットとリポジトリの2つのタイムスタンプはいずれも2026年9月1日付けです。したがって、実際のリリース日は8月ではなく9月初旬とみなしてください。以下のリポジトリが公開された全容であり、ツリー内に見えるすべてのファイルがリリースに含まれています。それ以外のものは、まだどこにも存在しません。

• GitHub — InternLM/InternLumina-U2。2026-09-01にApache-2.0ライセンスで作成され、テキスト、テキストから画像への生成、画像理解、画像編集、動画理解、3D理解のための推論コードを含む。
• Hugging Faceinternlm/InternLumina-U2(2026-09-01作成)。現在は .gitattributes ファイルと、内容全体が Apache-2.0 ライセンスヘッダーからなる28バイトの README のみを保持している。重みファイルも設定ファイルもトークナイザーファイルも存在しない。
• プロジェクトページ — internlm.github.io/InternLumina-U2。アーキテクチャ図、暫定ベンチマーク表、プレースホルダーデモを掲載。技術レポートは「近日公開」と記載されています。
推論コードは、タスクごとにセクションを設けた単一のドライバースクリプトとして構成されている。具体的には、プレーンテキスト生成、最大1024×1024でCFGとタイムステップを設定可能なテキストから画像への生成、自然画像と密度の高いチャートに対する画像理解、オプションのデュアルCFGモードを備えた指示ベースの画像編集、サンプリングした64フレームに対する動画理解、そしてトークン化の前に同梱のBlenderパイプラインを通じて64のカラー・深度ビューにレンダリングされるGLB/GLTFアセットに対する3D理解である。このようなタスクの幅広さこそが、このモデルの設計思想そのものであり、アーキテクチャに踏み込む前に一度立ち止まって考える価値がある。
1つのモデル、6つのジョブ、1つのトークン語彙
InternLumina-U2は、言語と視覚が別々の理解スタックと生成スタックに分かれて存在するのではなく、単一の離散トークンインターフェースを共有すべきだという信念に基づく、急速に発展している研究系統に属している。この研究室自身によるこの方向性での初期の研究——WAIC 2025で展示された統一離散拡散モデルLumina-DiMOO——は、LLaDA2.0-Uni、Show-o2、MMaDAとともに、InternLumina-U2が基盤とし、超えると主張する先駆的システムとして引用されている。InternLumina-U2が特に賭けているのは、これらの統一モデルにとってのボトルネックはアーキテクチャではなく視覚語彙であるという点だ。すなわち、単一のコードブックは1つの視覚トークンが運べる情報量を制限し、一方で理解と生成を異なる表現に分割する離散・連続ハイブリッド方式は、モデルに2つのスタックを維持することを強いることになる。
InternLumina-U2の回答は完全離散型マルチコードブックモデリングである。視覚側ではAppleのATokenトークナイザーを使用しており、これは各視覚位置を8つの相補的コードブックで記述して、局所的なテクスチャ、埋め込みテキスト、ジオメトリ、高周波ディテールをシーケンス長を増やすことなく保持しようとする試みである。入力側では、8つのコードブックそれぞれが独自の埋め込みを持ち、位置ごとの8つの埋め込みは連結されて単一のバックボーントークンへ射影される。出力側では、予測は空間的には並列であるが、コードブックの深さ方向には自己回帰的である。拡散バックボーンは多くのマスクされた空間位置を並列にデノイズし、マルチコードブック自己回帰ヘッドが各位置の8つのコードを順に予測する。
• 規模 — パラメータ総数16B、アクティブ1B(16B-A1B)、スパースMoE。
• 言語バックボーン — 共同マルチタスクトレーニングによりブロック拡散の目的を視覚タスクへ拡張した、LLaDA-2.0 MoE拡散言語モデル(ベンダー説明)。
• 視覚的表現 — AppleのATokenトークナイザーによる8コードブック完全離散トークン。
• ハードウェア — NVIDIA GPU と Huawei Ascend NPU の両方に対応し、トレーニング、評価、推論の各段階において、バックエンド間の演算子レベルの数値的整合性を実現します。

それが実際にもたらすものは、主張が正しければ、マルチモーダル分野における最も古い夢だ。すなわち、画像を読み取り、編集し、テキストから新しい画像を描き、動画に関する質問に答え、3Dアセットを説明できる単一の重みセットである——しかも、専門モデルを継ぎ接ぎするのではなく、理解と生成が同じインターフェースを通じて互いを強化し合う。それこそが最も懐疑の目を向ける価値のある主張でもある。なぜなら、それを実現することが最も難しいからだ。
数字は、まあ、その程度のものだが
InternLumina-U2 が持つすべてのベンチマーク結果は、ベンダー報告によるものであり、暫定的かつ部分的なものです。READMEとプロジェクトページにもそう明記されています:「暫定的・部分的な結果です。完全な比較表は、今後公開されるテクニカルレポートに掲載されます。」ウェイトが公開されていないため、独立した評価は存在しません。以下の数値は、検証されたスコアではなく、研究所自身の主張として扱ってください。
• チャート / ドキュメント理解 — ChartQA 86.52、CharXiv-DQ 83.65(ベンダー報告)。
• 視覚的数学推論:MathVision 33.22、DynaMath 56.37。ラボによれば、これは両方のベンチマークで理解のみのInternVL3-8Bを上回る。
• 幻覚耐性 — HallusionBench 62.15.
• 動画理解 — VideoMME 51.26、MVBench 59.74、MLVU 57.03(プロジェクトページ)。
• 3D 理解 — 3D MM-Vet 41.8.
• テキストから画像生成 — DPG-Bench 87.10、TIIF-Bench Short/Long 84.60/85.95、GenEval 0.81(プロジェクトページ)。
• 画像編集 — ImgEdit 3.83。
比較のストーリーこそ、誠実な読者が立ち止まるべき箇所である。READMEは、InternLumina-U2がInternVL-U、LLaDA2.0-Uni、Show-o2、Lumina-DiMOOといった統合モデルを、きめ細かな理解と生成のベンチマークで上回っていると主張している——だが、プロジェクトページ自身の表では、InternLumina-U2がGenEvalで0.81、LLaDA2.0-Uniが0.89となっており、つまりこのモデルは、少なくとも一つの主要な生成指標において、少なくとも一つの競合に後れを取っている。部分的な表から都合のいい数字をいくつか拾うのは、「完全な比較表はテクニカルレポートを参照」という但し書きが和らげるために設計された行為そのものである。その数字は、研究所からの方向性を示すシグナルにすぎず、それ以上ではない。
現実とは何か、約束されたものとは何か
今回のリリース範囲は異例なほど明確で、今日試せるかどうかを判断するすべての人にとって重要な意味を持ちます。含まれているもの:推論コード。含まれていないもの:重み、トレーニングコード(別リポジトリで公開予定)、Ascendのトレーニング&推論スタック、および技術レポート。最終的にモデルを格納する予定のHugging Faceリポジトリはスタブであり、下のスクリーンショットが、README内の「{{1}}Model (coming soon){{/1}}」リンクをクリックした読者がたどり着くページの現在の全内容です。

公開済みのコードでさえ、まだ出力を生成できません。推論ドライバは、分割されたHugging Faceチェックポイントディレクトリと、特定のパスに配置されたATokenトークナイザの重みを期待しますが、そのどちらもリポジトリには含まれていません。つまり、現在ダウンロードできるものは、モデルがどう実行されるかの仕様であり、実行可能なモデルではありません。そして、重みが実際に公開されたとしても、セルフホスティングは定型的なpip install作業にはならないでしょう。このモデルは、標準のTransformersのgenerateインターフェースではなく、block-diffusionのgenerate APIを使用します。ATokenトークナイザはFlashAttentionを必要とし、コードはインポート時に可視のGPUを必要とし、ルートドライバはシングルプロセスで、3DパイプラインはアセットエンコーディングにBlender 4.5を前提としています。これは週末の実験ではなく、本格的なデプロイプロジェクトであり、まさにルーティングレイヤーがほとんどのチームのために吸収すべく存在する種類の摩擦です。
重みが届いたら、それは未検証のモデルとして扱ってください。
今日、InternLumina-U2を実行できる人は誰もおらず、どのプロバイダーもそれを提供できない。重みが公開されていないからだ。しかし、それはいずれ変わるだろう。Apache-2.0ライセンスと、同ラボによる2026年の積極的なオープンソース化の傾向(ArchSpaceの「すべてをオープンにする」推進、InternVL3.5、Intern-S2科学モデル)を考えれば、重みの公開は仮説ではなく可能性が高い。それが実現したとき、合理的な第一歩は、特殊なサービス提供要件を持ち、独立した評価がゼロの公開初日拡散モデルに本番パイプラインを賭けることではない。すでに信頼しているモデルと並べてテストパス上で実行し、新しいモデルが誤動作した瞬間に実績のあるモデルへ自動フェイルオーバーすることだ。これはまさにルーティングレイヤーが想定するユースケースである。200以上のモデルにわたる単一API、プロバイダーのリスト価格を0%マークアップでそのまま通す仕組み、そして「新しいものを試す」ことを移行ではなくルーティングルールに変えるフェイルオーバー。OrcaRouterはそのように構築されている。明確にしておくと、私たちはInternLumina-U2をルーティングしておらず、ルーティングできない。重みがリリースされていないからだ。このセクションは、重みがリリースされたときのワークフローについて説明するものであり、今日このモデルがどこかで利用可能であると主張するものではない。
次に見るもの
「InternLumina-U2」をプレビューから現実のものへと変える出来事は、可能性が高い順に4つある。第一に、Hugging Faceリポジトリがコンテンツで満たされることだ。safetensorsファイル、config、そしてATokenトークナイザーの重みがそのスタブに現れた時点で、モデルは実際に存在することになる。第二に、テクニカルレポートだ。完全な比較表を載せるはずのこのレポートは、上記のベンダーによる部分的な数値を検証可能なものにしてくれる。第三に、トレーニングコードのリポジトリとAscendスタックだ。これは、非NVIDIAハードウェアでファインチューニングや実行をしたい人にとって重要である。第四に、最初の独立した評価だ。アリーナEloや、再現されたChartQA、GenEvalの実行などが、ラボ自身の選択バイアスなしに「1つのモデルで6つのジョブ」という約束を試すことになる。コードが9月1日に公開されたということは、アーキテクチャはすでに知ることが可能だということだ。一方、重みがないということは、実際の品質に関するすべてがまだ主張の域を出ないということだ。アナウンスフィードではなく、モデルリポジトリに注目すべきだ。興味深い部分はすでに公開されており、モデル自体もおそらくそう遠くないうちに公開されるだろう。
