
PixelUMM vs North Micro Vision Instruct:非商用研究モデル 対 出荷可能な2.4Bリーダー
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
並べてみると、North Micro Vision InstructとPixelUMMのサイズ差はほとんど気を散らすほどだ。Cohereのネイティブ解像度リーダーが24億パラメータ、それに対してNVIDIAの統合モデルは152億パラメータ。興味深い軸はエンコーダにある。North Micro Vision Instructは従来どおりのやり方で作られている——SigLIP 2 SO400Mから初期化された4億パラメータの視覚エンコーダが20億パラメータの言語モデルに供給し、262,144トークンの語彙に包まれ、Apache-2.0の下で提供される。PixelUMMは、まさにこの構成こそがボトルネックだという主張の上に成り立っており、エンコーダを削除している。生の16×16ピクセルパッチが単層の線形射影を通ってQwen3-8Bバックボーンに入り、同じ重みが、それについての質問に答えるだけでなく動画も生成する。一方は、今日ダウンロードして導入できる専用の読み取り装置だ。もう一方は、ダウンロードリンクと、製品への利用を妨げるライセンスを伴う研究論文だ。
以下の両モデルの数値は、それぞれのラボ自身によるものである。どちらも独立に再現されておらず、両者は異なるベンチマークスイートを公開しているため、重なり合う部分は見た目よりも狭い。
退屈なアーキテクチャの擁護
North Micro Vision Instructは2026年8月10日にHugging Faceで公開され、ユーザーを獲得するための8週間があり、10月初旬の時点で約18万ダウンロードと150のいいねを記録していた。これは、公開から数日しか経っていないPixelUMMのリポジトリと比べて桁違いに大きな注目である。その売り文句は具体的で地味だ。ほとんどのビジョンモデルは画像を固定グリッドに縮小し、文書が依拠する微細なディテールを失ってしまう。それに対してこれは、画像をネイティブ解像度で処理し、アスペクト比と小さな文字を保つ。
• パラメータ — 合計2.4B:2Bの言語モデルと、SigLIP 2 SO400Mをもとにカスタムトレーニングされた400Mのビジョンエンコーダー。
• コンテキスト — 128Kトークンの言語バックボーンだが、検証済みのマルチモーダル動作範囲は約8Kトークン。このカードは、より長いマルチモーダルコンテキストは外挿に依存しており、ベンチマークが取られていないことを明示している。
• 入力と出力 — テキストと画像を交互に受け取り、テキストを出力。11言語以上に対応。いかなる生成も行いません。
• 報告されたスコア — DocVQA 0.921、ChartQA 0.808、OCRBench 0.792。いずれもCohereによる報告で、再現はされていない。MMMU 0.329。カードはこの点を隠していない。これは読解のスペシャリストであり、推論の汎用型ではない。
• デプロイ — Transformers 5.16.0 とアクセラレータ、単一のモダンな GPU で 2.4B を bfloat16 で実行、Flash Attention 2 は必須ではなく任意。
その設計に目新しいところは何もない。また、それが理由で、今週にもダウンロードして微調整し、実際の文書に適用できるのだ。

相手側が示した、それに反対する主張
PixelUMMのプレプリントは、そのアーキテクチャに伴うコストを明示することから始まる。凍結されたウェブ事前学習済みの視覚トランスフォーマーが理解のための意味的特徴を提供し、別個のVAEが生成のための再構成志向の潜在表現を提供する。両方を保持すると、条件付け画像あたりの視覚コンテキストがほぼ2倍になり、視覚言語事前学習パイプラインを第2のストリームを中心に再構築せざるを得なくなる。North Micro Vision Instructは、第2の役割を完全に拒否することによってのみ、この倍増を避けている。つまり、生成を行わないため、2つではなく1つのインターフェースで済む。
PixelUMMはその議論を結論まで突き詰める。エンコーダもVAEもトークナイザーもない。画像には16×16ピクセルのパッチ、動画には4フレームの時空間チューブレットを使い、どちらも単一層の線形射影を通じてデコーダのみのTransformerに到達する。理解は自己回帰テキストによって、生成はピクセル空間のフローマッチングによって行われる。その8つの実証セクションは、リーダーボードでの勝利ではなく設計上の選択を研究したものだ——パッチサイズ、パッチのアーティファクト、ピクセル空間対VAE空間の訓練ダイナミクス、計算スケーリング——これは、そのパラダイムが成り立つかを問う論文であり、すでに勝ったと主張する論文ではない。
• 視覚パス — North Micro Vision Instruct: ネイティブ解像度の400Mの事前学習済み視覚エンコーダ。PixelUMM: エンコーダなし。生のパッチを線形投影経由で処理。
• できること — North Micro Vision Instruct:画像と文書を読み取り、テキストで回答し、グラウンディングとキャプション生成を行います。PixelUMM:画像と動画を読み取り、テキストから画像と4秒の動画を生成します。
• 規模 — Qwen3-8Bバックボーン上で、denseは2.4B、総計は約15.2Bであり、論文内の表では「8B MoT」と表記されている。
• ライセンス — コードと重みにApache-2.0、対してコードにApache-2.0かつチェックポイントにNVIDIA One-Way Noncommercial License.

2つのスコアボードを正直に読み解く
2つのモデルは異なるベンチマークを公開しており、重なる部分では尺度が異なっている。
• DocVQA — North Micro Vision Instruct は精度を分数で表すと0.921。PixelUMM はパーセンテージで90.42。同じベンチマーク名でもスプリットとプロンプト設定が異なり、ネイティブ解像度処理を理由に挙げているのは2つのうち片方だけである。
• ChartQA — North Micro Vision Instruct 0.808。PixelUMM 82.96。繰り返しになるが、生の文字列を比較するのをやめれば、やはりほぼ同じ帯域に収まる。
• OCRBench — North Micro Vision Instruct 0.792。PixelUMM 78.00。
• MM Vision Instruct — 0.329、PixelUMM 41.67。どちらも大規模視覚言語モデルの水準からすると低く、両ラボともそれを飾り気なく報告している。
• PixelUMMのみ — MVBench 70.53、Video-MME 57.33、LongVideoBench 59.61、GenEval 0.83(プロンプトリライター使用時)、VBench Part 1 品質 84.10。
• North Micro Vision Instruct専用 — グラウンディング、キャプショニング、マルチ画像タスク。ツール呼び出しの欠如が文書化されており、エージェント的挙動は明示的に一切なし。
この重なりで際立っているのは、文書とチャートの読み取りにおいて、2.4Bの特化モデルが15.2Bの汎用モデルにどれほど近づいているかだ。これはエンコーダフリーのアプローチが失敗する証拠ではない——文書読み取りが、コンパクトなネイティブ解像度エンコーダーと非常に相性のよいタスクであることの証拠であり、PixelUMMのアーキテクチャは別の論点を狙っている。PixelUMM自身の論文も、引用に値する一文でこの点を認めている。モデルごとに訓練データが異なるため、その結果からは「どのアーキテクチャが優れているかは確立できない」。
決定が実際にどこに落ち着くか
文書、チャート、フォーム、スクリーンショットがあり、今月中に答えが必要なら、North Micro Vision Instruct が実用的な選択肢であり、しかも接戦ではない:Apache-2.0、2.4B、標準的な Transformers のロードパス、ガードレール環境なし、分散チェックポイントインデックスなし、2つ目の Python スタックなし。自分の文書分布でファインチューニングすれば、専門特化モデルが手に入る。注意点は適用範囲だ — 推論タスクに使うと、MMMU の数値がついて回る。
PixelUMMの売りは幅広さと研究上の問いだ。単一の重みセットから画像も動画も読み込み、生成する。そして読み物としては、大差でこちらのほうが面白い。しかしそのチェックポイントは非商用ライセンスの下にあり、重みは合計約30GBに及ぶ隠されたメタデータ索引の背後にある128個の分散チェックポイントシャードであり、CUDA 13ツールキットと、ソースからコンパイルしたFlashAttentionを要求し、そのテキストから動画への経路は、ゲート付きリポジトリと別個の環境を必要とするCosmosガードレールを走らせる。それはラボの実験台であって、デプロイではない。
ルーティングという観点が登場するのは、ずっと後のことです。そもそも登場するかどうかも怪しいですが。今日の時点で、どちらのモデルもホスト型APIからは利用できません——OrcaRouterはどちらもルーティングしていません——そしてライセンスがそれを許可するまでは、どちらも利用できるようにはなりません。North Micro Vision Instructのようなモデルが共有エンドポイントの背後に実際に現れたとき、直接統合よりもそれを選ぶ理由はごく普通のものです。200以上のモデルを1つのキーで扱え、プロバイダーの定価は0%のマークアップでそのまま渡され、カード上の性能を下回るモデルを降格させるフェイルオーバーがあり、差し替えをA/Bテストしたいときに交渉すべき2つ目の契約もないこと。これはワークフローの説明であって、可用性に関する主張ではありません。
それらを分ける唯一のテスト
同じ文書セットに対して同じ解像度で両方を実行し、小さい文字のケースを採点する。次に、変数を1つだけ反転させる。PixelUMM にネイティブ解像度の入力を与えることで、比較からビジョンエンコーダーを取り除く。エンコーダーなしのモデルが、パラメータコストのほんの一部で密なテキスト上でも持ちこたえるなら、それはこのテーゼにとって可能な限り最強の証拠だ。しかも、両方のチェックポイントがダウンロードできるのだから、余っているカードを持つ誰もが実行できるテストである。誰かがそれをやるまでは、実用的な要約はそのまま成り立つ。小さな Apache-2.0 リーダーは配備するものであり、大規模な非商用の汎用モデルは研究するものである。
