OrcaRouterのハウススタイルで生成されたタイトルカードには「NVIDIA PixelUMM」と記され、4つの統計タイルが並ぶ。「1 Oct 2026」(Hugging Faceリポジトリ作成、ダウンロード数ゼロ)、「15.2B」(論文の表では「8B MoT」と表記)、「0」(ベンダーによる発表)、「noncommercial」(チェックポイントのライセンス。コードはApache-2.0)。フッター行には「Sources: Hugging Face model card · arXiv:2609.38597」とある。OrcaRouterのロゴは、下部右側の余白帯に合成されている。
Engineering & Research

NVIDIA PixelUMM、アナウンスなしでリリース — 重みがひっそりと登場

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

NVIDIAが新しい統合マルチモーダルモデルを構築したと知る最も簡単な方法は、誰もあなたに知らせなかったことに気づくことだ。そのnvidia/PixelUMMリポジトリは2026年10月1日21:40 UTCにHugging Face上に現れ、152億パラメータのチェックポイントを携えていた。その学習スタック全体はQwen3-8Bバックボーンの上に載っている——そして、それに付随するブログ記事もプレスリリースも基調講演のスライドもローンチスレッドもなかった。この名前を検索しても、NVIDIA自身のブログには何も出てこない。代わりに存在するのは、GitHubリポジトリ、URL自体に今も「preview」と表示されるプロジェクトページ、2609.38597という番号のarXivプレプリント、そして、ローダーがそれなしでは実行を拒否する隠されたインデックス付きで128個のファイルに分割されたチェックポイントだ。PixelUMMは実在し、今日ダウンロードできる。NVIDIAがこれをリリース済みと見なしているかどうかは、同社が答えていない問いである。

そのギャップ——存在する成果物と、何も語っていないベンダーとの間のもの——が、ここでの話のすべてだ。そして、それぞれの事実がそのどちら側にあるのかについては、正確を期す価値がある。以下のすべては、リポジトリ、モデルカード、そして著者たち自身が発表した論文から来ている。発表から来ているものは何もない。なぜなら、発表などなかったからだ。

何が現れたのか、そしてそれはいつなのか

その連載はおよそ4週間にわたり、それぞれの記事は静かに公開された。

• 2026年9月4日 — nv-tlabs/PixelUMM が GitHub 上で Apache-2.0 リポジトリライセンスのもとで作成され、単に「エンコーダ不要の統合画像・動画理解・生成」と説明されている。9月末まで初回コミット1件のみの状態が続く。

• 2026年9月28日~29日 — リポジトリの初回コミットが行われ、arXiv は9月29日付のプレプリント arXiv:2609.38597 を割り当て、NVIDIA とウォータールー大学の著者を記載している:Cong Wei、Xuanchi Ren、Bryan Chu、Weiming Ren、Huan Ling、Jiahui Huang、Laura Leal-Taixé、Sanja Fidler、Wenhu Chen、Zian Wang、Jay Zhangjie Wu。

• 2026年10月1日 21:32 UTC — 「docs: add PixelUMM paper citation」というタイトルのリポジトリへの最終コミット。

• 2026年10月1日 21:40 UTC — Hugging Faceモデルリポジトリが作成され、その8分後にチェックポイントシャードが格納されます。

プロジェクトページは、文字通り pixelumm-project-page-preview と読めるパスでホストされており、論文には会議名の記載がない — CVPR も NeurIPS も、「accepted to」もない。まとめて見ると、この流れは研究チームが論文のアーティファクトを本番公開し、HF へのアップロードを告知そのものにしているように読める。これは証拠についての観察であり、意図についての主張ではない。NVIDIA は後日ローンチを計画している可能性は十分あり、ここにあるものはそれを否定しない。

A headless-browser capture of the PixelUMM project page, hosted at a URL path that still reads pixelumm-project-page-preview, showing the model's title, its summary line about encoder-free unified image and video understanding and generation, and the project's task links.

PixelUMMとは実際には何なのか

設計思想はモデルカードの最初の行に記されている。VAEなし、ビジョンエンコーダなし。従来の統合モデルが2つの視覚インターフェース――理解のための意味特徴を生成するビジョントランスフォーマーと、生成のための再構成潜在表現を生成する変分オートエンコーダ――を備えているのに対し、PixelUMMはどちらも備えていない。画像は16×16ピクセルのパッチに分割され、動画は4フレームの時空間チューブレットに分割される。どちらも単層の線形射影だけを通ってバックボーンに到達する。生のピクセルが入力され、生のピクセルが出力される。

• アーキテクチャ — 生のピクセルのパッチ埋め込みと反復的なピクセル生成ヘッドを備えたデコーダのみのTransformerであり、論文では、共有アテンションとタスク固有のパラメータを組み合わせたMixture-of-Transformersとして記述されている。

• バックボーン — Qwen3-8B、リビジョン b968826d9c46dd6066d109eabc6255188de91218 に固定。必要なのは設定ファイルとトークナイザーファイルのみで、チェックポイント自体が学習済みの言語ウェイトを保持しています。

• パラメータ — 15,199,672,064(約15.2B)。論文自身のベンチマーク表では「8B MoT」と表記されており、このサイズ表記ではバックボーンと生成エキスパートを別々にカウントしている。

• 目的 — 自己回帰的なテキスト予測とピクセル空間フローマッチングを同時に学習させることで、単一の重みセットが画像に関する質問に答えたり、新しい画像を描画したりできるようになります。

• タスク — テキストから画像、96フレーム / 24 fps / 4秒のテキストから動画、画像条件付きテキスト、動画条件付きテキスト。

この論文の実証セクションは、特筆に値する意味で異例だ。その8つのセクションは、リーダーボードでの順位ではなく、設計上の選択に関する研究である——画像パッチサイズ、動画パッチサイズ、パッチアーティファクト、ピクセル空間とVAE空間の学習ダイナミクス、モデルサイズ、計算スケーリング、マルチモーダル文脈条件付け、動画理解インターフェース。これは、そのアプローチが機能するかどうかを答えようとする人々が書いた論文であり、表で勝つことを狙った論文ではない。

その数字は著者自身のものである

以下のすべての数値は、PixelUMM の著者らが自身のプレプリントで報告したものです。独立した再現も、アリーナ Elo も、第三者による評価もありません。このモデルはせいぜい6週間前のもので、外部ハーネスより前に登場したからです。これらは検証済みの性能ではなく、ダウンロードリンク付きの主張として扱ってください。

• 画像理解 — MMMU 41.67、MMStar 53.99、AI2D 80.12、DocVQA 90.42、ChartQA 82.96、OCRBench 78.00、BLINK 53.46、MMMU-Pro 27.63。公式のLMMS-Evalプロトコルに基づく(21タスクにわたる64,750生成)。

• 動画理解 — MVBench 70.53、字幕なしのVideo-MME 57.33、LongVideoBench 59.61、LVBench 40.41。

• 画像生成 — LLMプロンプトリライターありでGenEval総合0.83、なしで0.77、DPG-Bench総合85.74。

• 動画生成 — VBench パート1 品質スコア 84.10、セマンティックスコア 79.80、VBench パート2 合計 83.24。

正直に読めば、これらは同クラス内で競争力のある数値であり、カテゴリーをリードする数値ではない。論文自身もそう述べている。モデル間で訓練データが異なるため、結果は「どのアーキテクチャが優れているかを確立することはできない」と指摘している。Qwen3-VL-8B に対しては、画像理解の差は MMMU で大きく(41.67 対 69.60)、著者らが競合する数値を報告していない MMMU-Pro でも大きい。Qwen-Image 20B に対しては、GenEval の差は 0.83 対 0.87 である。PixelUMM がそれ自身の数値で見て最先端モデルではない、ということだ。それが何かと言えば、それ自身の数値で見て、周囲の専門特化システムと同じ水準に収まる、本当に珍しいアーキテクチャを備えた15Bモデルである。

最も鋭い刃はベンチマークではなく、ライセンスだ

リポジトリは Apache-2.0 で、モデルカードにもそのことが明確に記載されています。チェックポイントは別の成果物であり、条件も異なります。そして、チームが最も見落としやすいのはこの点です。重みは NVIDIA One-Way Noncommercial License の下で提供され、その使用は非商用の研究または評価に限定されています — これは、すぐ隣にあるコードに比べて実質的により厳しい許諾です。リポジトリ内の 1 つのソースファイル modeling/pixelumm/modeling_utils.py には、さらに DiT に由来する CC BY-NC 4.0 の表示が保持されています。

研究グループ、評価チーム、あるいは論文を発表する人にとって、これは完全に使えるライセンスだ。製品チームが社内機能をプロトタイピングしている場合、これは法務部門にまず提示すべきものであり、回答はノーかもしれない。出荷できないモデルは、出荷できるモデルとは種類の異なる資産であり、どれだけベンチマークで同等でもその事実は変わらない。

A headless-browser capture of the Hugging Face model card for nvidia/PixelUMM, showing the model title, the licence tag, and the repository's download and like counters.

それを実行するために必要なもの

これは週末にちょっとダウンロードして済むものではない。環境ドキュメントでは、Linux x86-64、Python 3.12、CUDA 13.0 開発ツールキット、NVIDIA GPU、そしてそのツールキットに対してソースからビルドした FlashAttention が要求されている——ランタイムのみの CUDA イメージでは要件を満たせない。チェックポイント自体も model.safetensors ファイルではない。合計約 30 GB の 128 個の .distcp シャードに加えて、隠しファイルの .metadata インデックスで構成されており、ローダーは参照されているすべてのシャードとそのインデックスが存在することを要求する。

さらに2つの詳細が、実際にこれで何ができるかを左右します。第一に、text-to-video はデフォルトで Cosmos のガードレールを実行し、それにはゲート付きの nvidia/Cosmos-1.0-Guardrail リポジトリへのアクセスに加えて、異なる Transformers メジャーバージョンを使う2つ目の Python 環境が必要です — ログインするだけでは重みはアンロックされません。第二に、公開されている唯一の学習レシピである4ステップのトイ学習例は、それぞれ少なくとも48 GiBを備えた7台のGPUと、出力用に約61 GBの空きディスクを必要とすると文書化されています。ワークステーションでのファインチューニングは想定された道筋ではなく、単一の最新カードでの推論が想定された道筋です。

リポジトリには4つのチェックポイントが同梱されています。S8-F22-R05がデフォルトで、論文の評価に使用されたもので、4つのタスクすべてをカバーしています。S8-F18-R01は480pと720pで追加のファインチューニングを10,000ステップ行い、一般にテキストから動画への生成結果がわずかに良くなりますが、動画理解はできません。S8-F19-R03とS8-F21-R02は中間段階です。どれを選ぶかは細部ではなく、実際の意思決定です。

何が確認されていないのですか

短いリストだが、上の長いリストよりも重要だ。

• NVIDIAの発表はありません。 本記事執筆時点で、このモデルに関するプレスリリースも、同社自身のブログへの投稿も確認されていません。静かなリリースは意図的なものかもしれません——研究用の成果物はしばしばこのように公開されるためです——し、あるいは単にまだ発表されていないだけかもしれません。

• 独立した評価はありません。この記事のすべての数値は著者自身によるものです。NVIDIAとWaterlooの外部で再実行されたものは何もありません。

• ホスト型のルートはどこにもありません。現在、API経由でPixelUMMを呼び出すことはできません。それにはOrcaRouterも含まれます — 当社はそれをルーティングしておらず、またできません。なぜなら、非商用ライセンスのチェックポイントは、商用サービングプラットフォームが提供できるものではないからです。そうでないと言う人は、セルフホスト型のセットアップについて述べているのです。

• 将来のライセンスについて明示された立場はない。 非商用条件は出荷時の条件である。それが緩和されるかどうかは不明であり、NVIDIAの研究用チェックポイントに関するこれまでの経緯を踏まえると、それを前提に計画を立てるべきものではない。

A headless-browser capture of the GitHub repository page for nv-tlabs/PixelUMM, showing the repository description “Encoder-Free Unified Image and Video Understanding and Generation” and the Apache-2.0 repository licence.

次に注目すべき点

3つの出来事が起きれば、PixelUMMは研究用の成果物から、より広い層が使えるものへと変わる。1つ目はチェックポイントのライセンス変更だ。その単一ファイルこそが、「興味深い」と「製品で使える」の間にある唯一の障壁である。2つ目はNVIDIAによる公式リリースで、これにはリポジトリでは提供できない位置づけ、つまりモデルの用途と、それが製品の方向性なのか論文なのかということが伴う。3つ目は最初の独立した再現であり、おそらく余っているGPUクラスタを持つ誰かによるGenEvalかMVBenchの再実行で、その瞬間に著者の数値は唯一の数値ではなくなる。

それまでは、証拠が支持する姿勢が正しい。PixelUMMは存在し、コードと論文は公開されて読むことができ、重みもダウンロードでき、性能に関する主張はそれを打ち出したチームの外の誰によっても検証されていない。それはその仕事への批判ではない——6週間前に出た研究リリースとはそういうものだ。また、ライセンスがいつか緩くなるなら、ルーティングレイヤーが後でその価値を発揮するまさにその状況でもある:すでに信頼しているモデル群にまたがる1つのキー、0%のマークアップでそのまま渡される定価、そして、本番経路をそれに賭けることなく未実証のものへトラフィックの一部を向けられるフェイルオーバー。とはいえ、今のところ正直な要約はもっと単純だ。NVIDIAは型破りなものを作り、徹底的に公開し、誰にも知らせなかった。リポジトリが告知なのだ。