「MiniCPM-V 4.7 vs Microsoft Mage-VL」の生成されたヒーロータイトルカード。サブタイトルは「動画を見るコストを削減する2つの方法」、左のカードには「Mage-VL:コーデックネイティブなトークンスパース性、視覚トークンを75%削減」、右のカードには「MiniCPM-V 4.7:線形アテンション、256KにわたってフラットなKVキャッシュ」、ピルには「入力を圧縮するか、状態を圧縮するか」、右下隅にOrcaRouterのロゴ。
Guides & Insights

MiniCPM-V 4.7 vs Microsoft Mage-VL:ビジョンモデルの1フレームあたりのコストがどうあるべきかをめぐる、大きく異なる2つの賭け

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

MiniCPM-V 4.7 と Microsoft Mage-VL はどちらもトークンを節約するとうたう視覚言語モデルであり、そこに至る道筋は正反対です。2026年7月25日に Microsoft が公開した Mage-VL は動画側に切り込みます。動画コーデックの構造を借用し、すべてのアンカーフレームのパッチと、実際の動きを持つ予測フレームのパッチのみを保持することで、視覚トークンを75%以上削減し、均一なフレームサンプリング比で最大3.5倍の実時間高速化を実現すると主張しています。2026年10月6日に OpenBMB がアップロードした MiniCPM-V 4.7 は系列側に切り込みます。352億パラメータのスパース MoE で、40層のうち30層が線形アテンション経路にあり、これにより256Kコンテキスト全体で KV キャッシュの増加が緩やかになります。一方のモデルは見るものを圧縮する。もう一方は覚えるものを圧縮する。そして、評価できるものを伴っているのはそのうち片方だけです。

それぞれが何か

Microsoft Mage-VLは、4Bスケールのコーデックネイティブかつプロアクティブ・ストリーミング型マルチモーダル基盤モデルで、テクニカルレポートと充実した評価セクションを伴ってApache-2.0のもとで公開された。これは、著者らがVLMにおけるモラベックのパラドックスと呼ぶもの——オフライン推論は得意だがリアルタイム知覚は苦手——に真っ向から対処するため、意図的に設計されている。視覚エンコーダであるMage-ViTは、ウェブで事前学習されたViTから初期化されるのではなく、約1億枚のラベルなし画像と動画を用いて完全にゼロから学習されており、スタック内で唯一の事前学習済みコンポーネントはQwen3-4B-Instruct-2507言語バックボーンである。完全なチェックポイントは単一の統合モデルであり、画像理解、オフラインビデオ推論、イベント駆動型ストリーミング解説を、別個のバリアントなしに実行する。併せてmicrosoft/Mage-ViTのリリースでは、エンコーダを単体で提供している。公開以来、約10,600回ダウンロードされ、420件のいいねを集めている。

MiniCPM-V 4.7 は openbmb/MiniCPM-V-4.7-35B-A3B、16 個のシャードに分割された合計 70.4 GB の 35,212,875,824 パラメータの BF16 チェックポイントであり、Transformers 5.2.0 で書き出され、2026 年 10 月 6 日にモデルカードなしでアップロードされました。

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs Microsoft Mage-VL — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Token savings linear attention, Context 256K, Vision 16x downsample, Evidence no card no benchmarks. Right column 'Mage-VL' lists Parameters 4.74B dense, Licence Apache-2.0, Token savings 75% fewer visual tokens, Context up to 768 frame windows, Vision from-scratch Codec-ViT, Evidence full card with tables. The footer reads 'Mage-VL figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

そのテキスト設定にはqwen3_5_moe_textというタグが付けられており、256個のエキスパートを備え、トークンごとに8個がアクティブになります。layer_types配列は、40層にわたって全アテンション層1つにつき線形アテンション層3つという構成です。そのビジョンタワーは自社製のminicpmv4_7_visionで、27層、16倍のダウンサンプリング、最大9枚の画像スライスに対応します。コンテキストは256Kです。リポジトリのダウンロード数はゼロ、いいねは3件、ベンチマークはなく、ライセンスもありません。

読者が確認できる6つの行

同じ6つの次元を、両側に。数値が存在しない箇所では、その欠落は見えるままにされる。

• パラメータ — Mage-VL: 4.74B、密、トークンごとにすべてアクティブ。MiniCPM-V 4.7: 合計35.2B、疎、トークンあたり256エキスパート中8。MiniCPMの数値は密なモデルの数値と単純比較できない。

• ライセンス — Mage-VL: Apache-2.0、カードおよびリポジトリのタグに明記。MiniCPM-V 4.7: 宣言なし。

• トークン削減がどこから生まれるか — Mage-VL:エンコーダー側での視覚トークンのスパース性で、コーデックに整合しており、75%超の削減を主張。MiniCPM-V 4.7:デコーダー側での線形アテンションで、長い系列にわたるKVキャッシュの増大を抑えるが、入力するトークン数を減らすものではない。

• コンテキスト — Mage-VL: 長コンテキスト段階を通して、最大384または768フレームのローリングコーデックウィンドウとして35万本の動画で学習。MiniCPM-V 4.7: max_position_embeddings: 262144。

• 視覚エンコーダの由来 — Mage-VL: スクラッチから、約1億枚のラベルなしフレームで学習。カードは256トークンでImageNet 85.69%を報告し、トークン予算に伴う単調な改善を示す。MiniCPM-V 4.7: 系譜タワーはMiniCPM-V 4.6の設計を再利用し、同じ1152隠れ次元・27層構造で、デフォルト16xダウンサンプル。

• 根拠 — Mage-VL:DocVQA 95.14、InfoVQA 80.33、OCRBench 81.80、ChartQAPro 32.57、MMStar 67.32、CV-Bench-3D 94.75 を揃えた完全なスコアカードがあり、Qwen3-VL-4B に対する +53.1 の CrossPoint ギャップも示す。いずれも、条件を揃えたバックボーンに対してベンダーが報告したもの。MiniCPM-V 4.7:なし。

• ストリーミング挙動 — Mage-VL: 各ローリングウィンドウをスコアリングし、イベントが完了するまで沈黙する認知ゲート。約330万件のストリーミングサンプルで訓練。MiniCPM-V 4.7: どこにも記載されていない。

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

誰もが誤解しているMage-VLの数値の話

Mage-VLのカードに載っているベンチマーク表は強力で、その中でも最も強いものは最も誤読されやすい。比較行ではMage-VL-4BがQwen3-VL-4B、Phi-4-Multimodal-Instruct、Phi-4-Reasoning-Visionと対決しており、見出しの改善幅——QVHighlightで+22.5、VideoEval-Proで+24.5、CrossPointで+53.1——は、ベンダーの表に現れているという意味では本物である。ただしそれらはベンダー自身の測定値でもあり、モデルを訓練したチームが同じハーネスで出したものだ。独立した第三者による再現はまだない。これは登場から4か月のモデルとしては普通のことであり、欠点ではない。しかし、正しい動詞は「scores」ではなく「reports」であることを意味している。

表以外にも評価すべき点が2つある。第一に、バックボーンを揃えた設計——Qwen3-4Bデコーダを固定し、ViTのみを差し替える——は、リーダーボードの順位よりも明快な証拠である。システム全体ではなく視覚スタックを切り離して評価できるからだ。第二に、Mage-ViTの訓練コーパスは約1億枚のラベルなしフレームであり、Web事前学習済みエンコーダが用いる数十億の画像テキストペアと比べると規模が小さい。したがって、クラスタ判別においてSigLIP2-at-10B級の挙動に匹敵するというのは、一般的な自慢ではなく、データ効率に関する具体的で検証可能な主張である。

MiniCPM-V 4.7にはこれが一切ない。弱体化版ではない——皆無だ。

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured 7 October 2026) showing the model header, the mage_vl and video-understanding tags, the Apache-2.0 licence badge, the project page and GitHub links, and the opening of the Mage-VL card describing it as a codec-native, proactive-streaming multimodal foundation model at a 4B scale.

表はありません。ベンダーのものであれそうでなかれ、存在しません。そして、アーキテクチャを記述している設定ファイル自体が、精度について何も述べないことを明示的に排除しています。

アーキテクチャ:同じ問いに対する2つの答え

両モデルは「どうすればマルチモーダル推論を安くできるか」という問いに答えようとしており、その対比は示唆に富む。なぜなら、両者の答えは競合するのではなく、補い合うからだ。

Mage-VLは入力を削減する。その16×16パッチグリッドはアンカーフレームと予測フレームの間で共有され、予測フレームはコーデックがビットを割いている場所にのみパッチを提供する。つまりそこが、動きと新しいディテールが存在する場所である。その結果、フレームごとに可変長のトークンストリームが生じる。だからこそこのスタックには、可変シーケンスを因果的デコーダに渡せるプロジェクタが必要であり、同じインターフェースが再学習なしにH.264/HEVCの動きベクトルやニューラルコーデックの学習済みレートマップを受け入れられるのである。次に、3D回転エンコーディングが、このスパース性全体にわたって時空間位置の一貫性を保つ。管理されている量はトークン予算である。

MiniCPM-V 4.7は状態を削減する。その線形アテンション層は、増大し続けるキー・バリューキャッシュの代わりに固定サイズの再帰状態を保持するため、長い会話のメモリコストはトークン数に比例して増え続けることがなくなる。そのシーケンス予算が管理対象となる量であり、256Kコンテキストがその見返りである。注目すべきは、MiniCPM-V 4.7の設定が16倍の視覚ダウンサンプリングを謳っていることだ——入力も圧縮する——が、MiniCPM-V 4.6が公開していた切り替え可能な4倍モードを維持しているかどうかについては何も明かしていない。

簡単に言えば、Mage-VLの工夫は、ほとんどのフレームが隣接するフレームとほぼ同一である動画で効果を発揮する。MiniCPM-V 4.7の工夫は、トークンが蓄積される長い文書や長いマルチターンセッションで効果を発揮する。ライブストリームを取り込み、それについて長い会話を続けるパイプラインなら両方の恩恵を受けられるだろうが、どちらのモデルもまだもう一方の役割を果たしてはいない。

実際のワークフローに投入する

Mage-VLは今日試すのが現実的です。単一のチェックポイント、文書化されたアーキテクチャ、Apache-2.0、そしてリポジトリに何が同梱されているかを示すカードを備えています。7月から公開されており、それを取り巻くツール群も安定するのに十分な時間が経っています。

MiniCPM-V 4.7を今日試すのは、地味な理由で現実的ではない。量子化なしのBF16で70 GBということは、おそらく空きになっていないアクセラレータメモリを意味するし、ライセンスが欠けているということは、そもそも使用してよいのかどうかという疑問が未解決のままであることを意味する。カスタムコードパスにはtrust_remote_codeが必要であり、MoEと線形アテンションの組み合わせがあなたのサービングスタックにカーネルを持っているかどうかは未検証だ。

どちらにも当てはまるのは、セルフホスト型のビジョンモデルは、フロンティアモデルも呼び出さなければならないシステムの一構成要素にすぎないということです。ホスト側の半分を、2つ目の契約や2つ目の SDK ではなく単一のルーターの背後に置くべきなのは、まさにそのためです:OrcaRouter は 1 つのキーで 200 以上のモデルに到達でき、各プロバイダーの定価を当社が上乗せすることなくそのまま通し、プロバイダーに障害が起きたときは自動でフェイルオーバーします。OrcaRouter も MiniCPM-V 4.2 も、そのサービス上のモデルではありません — どちらも自分でサービングする重みです — ですからこれは、ハンドオフの向こう側にある配管(プランビング)として扱い、そのモデルの可用性チャネルとは考えないでください。

評決

Mage-VLは、完成し、ライセンス供与され、ベンチマーク済みのモデルであり、具体的でよく論じられた設計思想を備えている。そしてその主張の根拠は、ビデオストリーミングと空間推論にあり、そこではコーデックネイティブのエンコーダが他の誰とも構造的に異なることをしている。MiniCPM-V 4.7は、より大規模で、ライセンス未供与、未測定のチェックポイントであり、その設計思想は読み取れるものの、挙動は空白である。読者が今日行動に移せるあらゆる点において、Mage-VLはデフォルトで勝利する——それは優れているからではなく、二者のうち判断可能な唯一のものであるからだ。MiniCPM-V 4.7のREADMEが現れたときに、この比較を再訪すべきである。もしその日がベンチマークとライセンスをもたらすなら、興味深い問いは、256Kコンテキストの線形アテンションMoEが長尺ビデオにおいてコーデックネイティブのスパーシティエンコーダを打ち負かすかどうかであり、それは真に未決の戦いである。