
MiniCPM-V 4.7 vs UI-Venus 2.9B:汎用ビジョンモデル 対 目的特化型GUIエージェント
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
MiniCPM-V 4.7 と UI-Venus 2.9B はどちらも、スクリーンショットを見てテキストを生成する視覚言語モデルですが、類似点はそこまでです。というのも、そのうちの一方はまさにその作業のために作られたからです。UI-Venus 2.9B は inclusionAI による汎用 GUI エージェントで、2026年8月26日にリリースされ、その設計全体が、インターフェースを観察し、タスクの状態について推論し、アクションを出力し、その結果として得られるフィードバックを取り込むことを中心に据えています。技術レポート、GUI グラウンディング、モバイル、ウェブ、コンピューター操作、CAPTCHA タスクにわたるベンチマーク表、そして危険なアクションをどれほど頻繁に引き出され得るかについての明示的な評価も付属しています。MiniCPM-V 4.7 は、2026年10月6日に OpenBMB によってアップロードされた 352億パラメータの疎な mixture-of-experts チェックポイントで、モデルカードもライセンスもベンチマークもありません。専門特化モデルと、測定されていない汎用モデルを比較するのはやや珍しい試みであり、このページでは、その比較が成り立つ箇所と成り立たない箇所を明確にしています。
大きく異なる2種類のリリース
UI-Venus 2.9B は inclusionAI/UI-Venus-2-9Bであり、Qwen3.5-9B から初期化され、GUI エージェントとして特化したポストトレーニングを施された 9B パラメータのモデルです。モデルカードでは、インターフェースを観察し、タスクの状態を推論し、アクションを実行し、そのフィードバックを次の判断に織り込むという閉ループが説明されており、これは3つの段階にわたって訓練されています。すなわち、大規模なシミュレーションによるモバイル・ウェブ・デスクトップの軌跡を用いたマルチモーダル中間訓練、5つのタスクファミリーに分けて行われたオフライン強化学習、そしてドメイン特化型の教師モデルを単一のポリシーに統合するマルチティーチャー・オンポリシー蒸留です。評価は GUI グラウンディング、モバイル、ウェブ、コンピュータ操作、CAPTCHA の各ベンチマークで行われ、さらに重大なアクションの安全性についても別途評価されています。カードによれば、OSHarm での攻撃成功率は 11.3%、OSBlind では 48.8% であり、ベースモデルである Qwen3.5-9B の 25.3% と 79.4% と対比されています。ちなみに、OpenBMB 自身の兄弟プロジェクトも同様の領域に目を向けています。MiniCPM の組織には 2026年1月から AgentCPM-GUI プロジェクトがあるため、これは両研究室が参入したレーンだと言えます。
MiniCPM-V 4.7 はopenbmb/MiniCPM-V-4.7-35B-A3Bです。BF16 の 35,212,875,824 パラメータを 70.4 GB、16 シャードにわたって収録し、2026年10月6日にアップロードされました。

タグ付けされた疎なMoEテキストバックボーン: qwen3_5_moe_text — 256エキスパート、トークンあたり8 — 40層以上で、3つの線形アテンションに対して1つのフルアテンションというパターン、16×ダウンサンプリングと最大9枚の画像スライスを備えた27層の自社製ビジョンタワー、そして256Kのコンテキストウィンドウ。READMEがないため、ライセンスもベンチマークもありません。いいね3件、ダウンロード0件、ディスカッションは空です。
比較、空白を残したまま
• 目的 — UI-Venus 2.9B:インターフェース操作向けにエンドツーエンドで学習されたGUIエージェント。MiniCPM-V 4.7:汎用の視覚言語モデル。何に最適化されているかは明記されていない。
• パラメータ — UI-Venus 2.9B:9.41B、密。MiniCPM-V 4.7:合計35.2B、スパース、トークンあたり256エキスパート中8。
• ベースモデル — UI-Venus 2.9B: Qwen3.5-9B(dense な Qwen テキストスタック)から初期化。MiniCPM-V 4.7: Qwen3.5 由来の MoE テキストスタック、クラス qwen3_5_moe_text。同じ系統樹の異なる枝。
• インターフェース・グラウンディング — UI-Venus 2.9B:中核能力であり、トレーニングに専用のグラウンディングおよびCAPTCHAタスクファミリーを備え、マルチモデル投票を用いたキーポイント接地型検証システムを採用。MiniCPM-V 4.7:グラウンディングに特化した主張はなく、座標出力形式の文書化もなし。
• 安全性評価 — UI-Venus 2.9B:OSHarm で ASR 11.3%、OSBlind で 48.8% と報告。MiniCPM-V 4.7:なし。
• 根拠 — UI-Venus 2.9B:arXiv の技術レポート、プロジェクトページ、GitHub リポジトリ、ベンチマーク表。MiniCPM-V 4.7:設定ファイル。
• ツール — UI-Venus 2.9B:reasoning-parser フラグ付きの vLLM クイックスタート、さらにコミュニティによる GGUF 変換。MiniCPM-V 4.7:まだ何もなし。

GUIエージェントはなぜ単なる「画面を見るVLM」ではないのか
これら2つのモデルの隔たりは、主にパラメータ数の問題ではない。そしてこれは、この対決を単に一方的なものではなく興味深いものにしているまさにその点なので、明言しておく価値がある。
スクリーンショットタスクには、ほとんどの視覚ベンチマークにはない特性がある。出力が実行可能でなければならないのだ。UI-Venus 2.9B がボタンをタップするよう求められると、環境が実際に適用できる座標または構造化されたアクションを出力しなければならない。そして、グラウンディングのわずかな誤りは、リーダーボード上の不正解ではなく、タスクの失敗であり、状態の破損である。だからこそ UI-Venus 2 のカードは、その長さの多くを検証に費やしている。タスクの完了は、最終画面を全体的に一瞥するのではなく、タスクに関連する視覚的キーポイントに基づいて判定され、単一の審査員によるバイアスを減らすために異種の審査員が投票する。その仕組みの狙いは、強化学習の報酬シグナルを報酬ハッキングに対して頑健にすることにある。つまり、タスクを完了するのではなく、怠惰な検証者を満足させることを学習してしまうモデルへの対策である。
また、安全セクションについても説明しています。

スマートフォンやデスクトップを操作できるエージェントには、キャプションモデルにはない攻撃対象領域がある。そして、そのようなエージェントを出荷する際に攻撃成功率を報告することは、ラボが果たすべき最低限のことだ。UI-Venus 2.9Bは、OSHarmで11.3%、OSBlindで48.8%を報告している——2つ目の数値は絶対値として高く、カードでの位置づけは、堅牢性についての絶対的な主張ではなく、ベースモデルとの比較である。これは「出発点より意味のある形で優れている」と読むべきであり、「安全」と読むべきではない。
MiniCPM-V 4.7 のアーキテクチャは、このいずれについても何も語っていない。長いコンテキストに対する線形アテンションは、長い対話履歴を記憶しなければならないエージェントの役に立つだろうし、スパース MoE は、多数のエピソードを実行している場合にスループットの役に立つだろう。しかし、エージェントに有用なアーキテクチャはエージェントではないし、公開された成果物のどの部分も、行動出力、グラウンディング精度、安全性の振る舞いを記録していない。
MiniCPM側に対する率直な評価
このセクションを4.6の数値で埋めたくなるのは誘惑だが、それに抗うこと。MiniCPM-V 4.6はQwen3.5-0.8Bをバックボーンとする1.3Bの密なモデルで、切り替え可能な4x/16xの視覚圧縮スキームを備えており、その宣伝されている結果——Artificial Analysis Intelligence Indexで13というスコアで、ベンダー報告によるもの、同等の小型モデルと比べてごくわずかなトークンコストで達成——はそのモデルを説明するものである。MiniCPM-V 4.7はバックボーンを変え、アテンションパターンを変え、デフォルトの視覚圧縮を変える。4.6の測定値はどれもそのまま当てはまらず、そもそもそれらはどれもGUIエージェントを説明するものではない。
MiniCPM-V 4.7 について正直に言えることは、限定的で事実に即している。重みは存在し、その形状はこのファミリーとしては異例で、コンテキストウィンドウは長く、リリースは不完全である。ライセンスの欠如は実務上の障害であり、ベンチマークの欠如は評価上の障害である。そして、無関心ではなく関心を向けるささやかな理由が一つある——OpenBMB は GUI ツール群を作っており、その中には AgentCPM-GUI も含まれる。したがって、そのラボから出た長コンテキストのスパース MoE 視覚モデルが将来のエージェント基盤になり得るというのは、あり得ない話ではない。それは意図に関する仮説であり、リポジトリはそれを裏付けていない。
何を選ぶか、そしてそれをいつ選ぶか
スクリーンショットと操作——タップ、入力、スクロール、アプリやウェブサイトのナビゲート、UIからのデータ抽出——が関わるものであれば、UI-Venus 2.9Bだけが、この2つのうちそのタスクに対応している。それには学習、検証の仕組み、報告されている安全性の数値があり、今日vLLM上で立ち上げるのに十分なツールも備わっている。MiniCPM-V 4.7について、そこで競合していることを示唆するものは何もなく、カードがなければ座標を出力するかどうかすら確認できない。
一般的なマルチモーダル作業——画像の説明、文書の読み取り、画像の多い資料に対する長文脈分析——における比較は、一方の側に公表された品質エビデンスがないため、まだ結論を出せない。今日それを必要とするなら、UI-Venus 2.9B は少なくとも測定可能ではあるが、これは文書推論ではなくインターフェース向けに調整されたものであり、その用途で明らかな第一候補というわけでもない。
どちらの場合もパターンは同じです。定型作業を処理するセルフホストモデルと、難易度の高いケースを引き継ぐホスト型のフロンティアモデル。その引き継ぎこそが、ルーターの存在価値が生まれる場面です――1つのキーで200以上のホスト型モデルを利用でき、それぞれプロバイダーの定価のまま提供され当社のマークアップは一切なく、プロバイダーの品質が低下した際には自動的にフェイルオーバーします。UI-Venus 2.9B も MiniCPM-V 4.7 も OrcaRouter 上でホストされているものではなく、どちらも自分で動かす重みです。ルーターは、ローカルモデルでは不十分だとエージェントが判断したときに、そのエージェントが話しかける相手なのです。
これがあなたをどういう立場に置くのか
これは僅差の話ではない。その理由は、品質に対する判断というより構造的なものだ。UI-Venus 2.9B は、レポート、ライセンス、ベンチマーク表、安全性評価、サービングレシピを備えた専門特化型だ。MiniCPM-V 4.7 は、設定ファイルを伴う汎用型だ。一方は製品であり、もう一方は約束にすぎない。両者を比較する責任ある唯一の方法は、そう言うことだ。リポジトリを注視してほしい。OpenBMB がインターフェースのグラウンディングとアクション出力を示すカードを公開すれば、256K コンテキストのスパース MoE と蒸留された 9B エージェントの比較は、本当に興味深い問いになる。それまでは、「どちらを使うべきか」への答えは、実在する方だ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
