
PixelUMM vs InternLumina-U2:エンコーダーフリーのベータ版2つ、そして決め手となる唯一の違い
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
2つのモデル、どちらも公開され、どちらも異例な設計であり、そしてそのうち製品を構築できるのは片方だけだ。PixelUMMはNVIDIAのエンコーダ不要の統合モデルであり、Qwen3-8Bをバックボーンに152億パラメータを載せ、16×16パッチと4フレームのチューブレットを通じて生のピクセルを読み書きする。スタックのどこにもVAEもビジョンエンコーダも存在しない。InternLumina-U2はShanghai AI Laboratoryの16BのMixture-of-Experts拡散モデルで、ATokenと呼ばれるトークナイザーを通じてあらゆる視覚入力を8つの相補的な離散コードへと圧縮する。両者とも、視覚インターフェースこそがボトルネックだという賭けに出た。より重要な賭けはライセンスファイルの中にある。InternLumina-U2はApache-2.0の重みを提供し、PixelUMMは非商用ライセンスの下でチェックポイントを提供している。商用目的でこの2つを選ぶのであれば、その一文が比較のすべてであり、このページの残りはその背景にすぎない。
以下の2組の数値は、いずれもラボ自身によるものです。どちらのモデルにも、独立した評価、アリーナElo、第三者による再現はありません。どちらもホスト型APIで提供されてもいません。異なるのは、ダウンロード後にその成果物に対して何を許可されているか、そして各リリースが実際にどこまで進んでいるかです。
今、それぞれがどのような状況にあるか
リリースのスケジュールはそれぞれ異なる速度で動いていて、どちらも静かに進んでいた。
• PixelUMM — GitHub リポジトリは 2026年9月4日に作成。arXiv プレプリント 2609.38597 は 2026年9月29日付。Hugging Face モデルリポジトリは 2026年10月1日 21:40 UTC に作成。NVIDIA のブログ投稿、プレスリリース、ローンチスレッドは見つからなかった。
• InternLumina-U2 — GitHubリポジトリは2026年9月1日に作成、Hugging Faceのスタブは同日に登録、Ascendで学習したチェックポイント重みは2026年9月10日に追加、NVIDIA/CUDAのチェックポイント重みは2026年9月24日に追加。各スタックにつき7つのシャードがあり、今日時点でどちらもダウンロード可能です。
9月初旬に存在していたInternLumina-U2 — コードのみで、重みは「近日公開」、空のモデルリポジトリ — は、今存在するInternLumina-U2ではありません。今月初めにそれについて読み、重みが欠けていると結論づけた人は、再確認すべきです。Huawei AscendとNVIDIA/CUDAの両方のチェックポイントが公開されており、Apache-2.0の下、トークナイザー、設定、チャットテンプレート、リモートモデリングコードも一緒に提供されています。

同じ質問に対する二つの答え
両モデルは同じ不満から出発しています:理解のための視覚エンコーダーを抱えることと、生成のためのVAEを抱えることは、すべての画像を二度表現することを意味し、視覚的コンテキストをほぼ倍増させ、トレーニングパイプラインに二つのインターフェースを維持させることになります。
PixelUMMの答えは、両方を削除することだ。生のピクセルは単層の線形射影を通してそのまま入力される——画像位置ごとに16×16パッチ、動画位置ごとに4フレームのチューブレット——そしてバックボーンはデコーダーのみのTransformerであり、そのMixture-of-Transformers設計は共有アテンションとタスク固有のパラメータを組み合わせている。テキストは自己回帰的に予測され、ピクセルはフローマッチングによって予測される。論文は8つのセクションを設計研究に費やしている——パッチサイズ、パッチアーティファクト、ピクセル空間対VAE空間のダイナミクス、計算スケーリング——これは、チームの本当の問いが、このパラダイムがそもそも成り立つのかどうかだったことを物語っている。
InternLumina-U2の答えは、離散インターフェースを維持しつつ、各トークンにはるかに多くを担わせることにある。ATokenトークナイザーは、テクスチャ、埋め込みテキスト、幾何をカバーする8つの相補的コードブックで各視覚位置を表現する。8つの埋め込みは位置ごとに連結され、1つのバックボーントークンに射影される。デコードは逆方向に進み、空間的に並列なノイズ除去と、8つのコードを順に予測するマルチコードブック自己回帰ヘッドを用いる。バックボーンはLLaDA-2.0系譜のスパース拡散LLMで、総パラメータ16B、アクティブ1Bである。
• 視覚インターフェース — PixelUMM: 生のピクセルパッチとチューブレット、トークナイザーは一切なし。InternLumina-U2: AToken による8コードブックの完全離散トークン、連続潜在表現なし。
• バックボーン — PixelUMM:Qwen3-8B(合計15.2B)、理解と生成のエキスパートを備えた単一の密なデコーダ。InternLumina-U2:合計16B/アクティブ1BのスパースMoE拡散言語モデル。
• 生成方式 — PixelUMM:ピクセル空間のフローマッチング+自己回帰型テキスト。InternLumina-U2:離散コードに対するマスク拡散ノイズ除去。
• 対応タスク — PixelUMM: テキストから画像、テキストから動画、画像からテキスト、動画からテキスト。InternLumina-U2: これらに加えて画像編集と3D理解。
• 重み形式 — PixelUMM: 128個の.distcp シャード(約30GB)が、隠された .metadata インデックスの背後にあります。InternLumina-U2: 7つの.safetensors シャード(ハードウェアスタックごと)、標準的なHugging Faceレイアウト。

スコアボード、その来歴が添えられた状態で
各行は、それぞれのラボ自身の主張として読んでください。PixelUMMのものはそのプレプリントに由来し、InternLumina-U2のものは、ラボ自身がそれらを「予備的、部分的」と説明しているもので、完全な比較表は、まだ公表されていないテクニカルレポートへ先送りされています。
• MMMU(画像推論) — PixelUMM 41.67(著者自身による)。InternLumina-U2:未報告。
• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.
• DocVQA — PixelUMM 90.42。InternLumina-U2:未報告。
• Video-MME(字幕なし) — PixelUMM 57.33。InternLumina-U2 51.26。
• MVBench — PixelUMM 70.53。InternLumina-U2 59.74。
• GenEval 総合 — LLMプロンプトリライターありで PixelUMM 0.83、なしで 0.77。InternLumina-U2 0.81。
• DPG-Bench 総合 — PixelUMM 85.74。InternLumina-U2 87.10。
• 動画生成 — PixelUMM VBench Part 1 品質 84.10 / セマンティック 79.80、Part 2 合計 83.24。InternLumina-U2: 未報告。
• 3D理解 — PixelUMM:該当タスクなし。InternLumina-U2は3D MM-Vetで41.8を報告。
この比較は対等ではない。二つの研究室が異なる表を公開しているからであり、一方が勝っているからではない。PixelUMMには動画生成のセクションが完全にあり、編集や3Dはない。InternLumina-U2は6つのタスクファミリーをうたっており、それらにまたがる部分的な表を報告している。同じベンチマーク名における研究室横断の数値は同じ測定ではない——分割、プロンプト、サンプリングが異なる——ので、ChartQAとGenEvalの行はほぼ同水準として扱い、そこで止めておく。
ライセンスの点で、これは互角ではなくなる
これはどのベンチマーク表にも表れない部分だ。PixelUMMリポジトリはApache-2.0で、モデルカードにもそう明記されている——しかも目立つ形で。チェックポイントは別個の成果物であり、NVIDIA One-Way Noncommercial Licenseの下に置かれ、非商用の研究または評価に限定されている。さらに、1つのソースファイルにはDiTから受け継いだCC BY-NC 4.0の表示が残っている。研究用途:問題なし。社内製品機能:法務との相談案件であり、おそらく短い話で済む。
InternLumina-U2 は、コードも両方のチェックポイントもエンドツーエンドで Apache-2.0 であり、非商用向けの別個の例外規定はありません。出荷する必要があるチームにとって、それは小さな利点ではなく、意思決定のすべてです。どちらのモデルも成熟度は研究グレードです。使用が制限されていないのは、そのうち片方だけです。
実際に試すべきなのはどれで、どうやるのか
あなたの仕事が動画理解である場合、または単一の重みセットから動画と画像を生成するモデルを求めるなら、PixelUMM のほうがより完全な成果物であり、その論文もより有用な読み物だ。ただし、これは非商用ライセンスの研究プロジェクトなので、評価用のベンチに置くべきもので、パイプラインに入れるものではない。あなたの仕事がグラフ、文書、画像生成の幅広さにある場合、あるいは編集や3Dが必要なら、InternLumina-U2 のほうがより広い領域をカバーし、ライセンス上の上限もない。その代償は、16B-A1B 拡散バックボーンと AToken トークナイザーが本格的なサービングエンジニアリングを意味することであり、公表されている数値が明示的に不完全である点だ。
本稿執筆時点で、どちらもホステッドAPI上にはありません。それにはOrcaRouterも含まれます — 当社はどちらのモデルもルーティングしていません。それが変われば、直接統合するのではなくルーティングレイヤー経由でそれらに到達するという主張は、新たに公開されたあらゆるモデルに当てはまる同じものになります。つまり、200以上のモデルにまたがる1つのキー、プロバイダーの定価を0%のマークアップでそのまま適用、そして自動フェイルオーバーにより、ベンダーの表に示されたより劣ることが判明したモデルを、デプロイを書き換えるのではなくルートを変更するだけで降格できます。それまでは、正直なアドバイスは退屈なものです — あなたのユースケースを許可するライセンスをダウンロードし、自分のデータで独自の評価を実行し、ラボ外の誰かが再実行するまでは、どちらのラボの数値も計画の前提にしないでください。
何が答えを変えるだろうか
影響度順に3つのこと。PixelUMMのチェックポイントに商用ライセンスがあれば、比較は本当に接近し、「論文を読む」から「重みを評価する」へと移行する。Shanghai AI Laboratoryによる完全な比較表を伴うテクニカルレポートは、InternLumina-U2の部分的な数値を検証可能なものにし、6タスクの広がりのうちどれだけが同等性によるもので、どれだけがトークン深度によるものかも明らかにする。そして、どちらかのモデルの最初の独立再現——結果に利害関係のないチームによるGenEvalまたはMVBenchの再実行——は、これらのどちらかがベンダー表でなくなる瞬間だ。それまでは、一方は研究しかできない珍しいアーキテクチャであり、他方は出荷できる珍しいアーキテクチャである。
