
MiniCPM-V 4.7 vs North Micro Vision Instruct:Cohereは文書化された2.4Bモデルを出荷し、OpenBMBは70GBの空白を出荷した
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
MiniCPM-V 4.7 と North Micro Vision Instruct はどちらも、小規模ラボが同じ課題に対して出した答えだ — 自分でファインチューニングしてデプロイできるコンパクトな視覚言語モデル — しかし、そのうち完成しているのは一方だけである。Cohere の North Micro Vision Instruct は、2026年8月10日に、Apache-2.0 の下で、24億パラメータのネイティブ解像度モデルとして登場し、アーキテクチャを説明する技術ブログ記事と、何に使うものかを記したモデルカードが付いていた。MiniCPM-V 4.7 は、2026年10月6日に、352億パラメータのスパースな Mixture-of-Experts チェックポイントとして登場した。16個のシャード、README なし、ライセンスフィールドなし、そしていかなるベンチマークもない。興味深い比較は「どちらがより賢いか」ではない。二つのリリースが、それを使わなければならないコミュニティに対して正反対の姿勢を示しているという点だ。
2つのリリースと、それぞれに同梱されたもの
North Micro Vision Instructは、CohereLabsによる2.4Bのオープンウェイト視覚言語モデルで、Apache-2.0の下でリリースされています。これは、プロトタイピング、タスク固有のファインチューニング、および専門的なマルチモーダル作業のためのコンパクトな基盤として明確に位置付けられています。その決定的な特徴は、固定グリッドにリサンプリングするのではなく、アスペクト比と細かい視覚的詳細を保持するネイティブ解像度の画像処理であり、カードにはVQA、キャプション生成、グラウンディング、OCR、チャート、ドキュメントにわたる能力が記載されています。会話ごとに複数の画像と11の言語 — 英語、ドイツ語、フランス語、スペイン語、イタリア語、ポルトガル語、ヒンディー語、日本語、韓国語、中国語、アラビア語 — をサポートします。モデルの重みはBF16で2,484,847,856パラメータで、リリース以来、MLXコミュニティは4-bit、5-bit、6-bit、8-bit、mxfp8、mxfp4、nvfp4、およびbf16変換を制作しており、これは数ヶ月後の健全な小規模モデルリリースの姿です。約166,500ダウンロードと150のいいねがあります。
MiniCPM-V 4.7 は openbmb/MiniCPM-V-4.7-35B-A3B です。BF16 で 35,212,875,824 個のパラメータ、16 個の safetensors シャードにまたがる 70.4 GB、クラスは MiniCPMV4_7ForConditionalGeneration で、Transformers 5.2.0 によって保存され、2026 年 10 月 6 日にアップロードされました。

そのテキストバックボーンはQwen3.5由来のスパースMoEだ — 256個のエキスパート、トークンごとに8個を選択 — 40層が固定の「3線形アテンション→1フルアテンション」パターンで動作し、256Kコンテキスト、さらに16×ダウンサンプリングの自社開発27層ビジョンタワーを備える。モデルカードはない。リポジトリには3件のいいねがあり、ダウンロードは0件だ。
重要な6つのポイントを並べて比較
• パラメータ — North Micro Vision Instruct:2.48B の密、トークンごとにすべてのパラメータがアクティブ。MiniCPM-V 4.7:合計 35.2B、256 中 8 のスパース。単純比較できる数字ではない。
• ライセンス — North Micro Vision Instruct:Apache-2.0、タグ付けおよび明記あり。MiniCPM-V 4.7:宣言なし。その場合の既定は全権利留保となります。
• ファインチューニング対応サーフェス — North Micro Vision Instruct:タスク固有のファインチューニングのベースとして明示的に設計されており、コミュニティによる量子化もすでに利用可能。MiniCPM-V 4.7:量子化版がなく、学習レシピも明記されていない70 GBのBF16チェックポイント。
• 解像度の扱い — North Micro Vision Instruct: ネイティブ解像度、アスペクト比を保持。MiniCPM-V 4.7: downsample_mode: "16x"、max_slice_nums: 9、スライサーベースの高解像度パス。
• 言語対応 — North Micro Vision Instruct: カードに11言語が記載。MiniCPM-V 4.7: どこにも明記されていない。
• コンテキスト — North Micro Vision Instruct: その2.4Bのデプロイクラスに合わせたサイズ。MiniCPM-V 4.7: max_position_embeddings: 262144、256K。
• 品質の裏付け — North Micro Vision Instruct:公開されたカード、技術ブログ記事、コミュニティによるコンバージョン、そして広範な採用実績。MiniCPM-V 4.7:引用できるものは何もない。

この比較を一方に偏らせる非対称性
ここで書くのがたやすい、ある種の比較記事がある。OpenBMBのGitHubからMiniCPM-V 4.6の数値を引っ張ってきて、それらが同等クラスの小型モデルを上回ると述べ、4.7がそれを受け継ぐとほのめかす。それは不誠実であり、その理由は正確に述べておく価値がある。MiniCPM-V 4.7は4.6の大型版ではない。1.3BのdenseなQwen3.5-0.8Bバックボーンを捨てて35BのsparseなQwen-MoEに置き換え、アテンションパターンをlinear-to-full比3:1に変更し、視覚圧縮のデフォルトを16xに切り替える。そのどれもが、モデルの精度を決める部分への変更だ。ファミリーの系譜はベンチマークではない。
不誠実さのもう一つの方向はより微妙だ。カードがないことを問題の証拠として扱うこと。そうではない。OpenBMB は2024年以降に MiniCPM-V を9世代出荷しており、そのうちいくつかはそのサイズにしては本当に優れている。そしてリポジトリ作成から最終コミットまでの12分という幅は、段階的に準備されてから公開された成果物が示すものであり、壊れたものが示すものではない。MiniCPM-V 4.7 の正しい読みは「不明」であり、不明は「悪い」とは別物である。
Cohere側には独自の誠実さの要件がある。

North Micro Visionカードの品質に関する主張はCohere自身の測定であり、技術的な詳細解説も同じチームによって書かれている。コミュニティが数日以内に16件のMLX量子化を構築したことは採用の証拠であり、精度の証拠ではない——人々は変換しやすいモデルを変換するものであり、クリーンな2.4B Apache-2.0リリースは変換しやすい。ダウンロード数も量子化の広がりも、スコアとして読むべきではない。
それぞれが実際に何のためにあるのか
North Micro Vision Instruct はファインチューニングの対象です。それがカード自身の言葉で述べられた設計概要のすべてです。つまり、プロトタイピングや専門的なアプリケーション向けのコンパクトな基盤です。限定的な文書解析、グラフ抽出、多言語キャプション生成のタスクがあり、ラベル付きの例が数千件あるなら、ネイティブ解像度入力と8ビット以上の量子化を備えた 2.4B Apache-2.0 モデルは、始めるのに妥当な選択肢です。そして、うまく動いたらエッジデバイスや単一のミッドレンジ GPU に移すことができます。
MiniCPM-V 4.7 は、使えると判明したとしても、そういうものではない。非量子化で 70 GB となるとサーバーモデルであり、その際立った特徴——256K のウィンドウと、KV キャッシュを一定に保つ線形アテンション——は、長文コンテキストのマルチモーダルワークロード、つまり1時間に及ぶ動画の文字起こし、大規模な文書セット、履歴に画像を含む長時間のマルチターン分析を指し示している。それらは実在するワークロードであり、このアーキテクチャはそれらに対する妥当な賭けだ。ただ、その賭けはまだ採点されていない。
2つの圧縮戦略については、心に留めておく価値のあるニュアンスがある。ネイティブ解像度と16×ダウンサンプリングは、単純に優劣の関係にあるわけではない。ネイティブ解像度のエンコーダは、細かいディテールを保持するためにトークンを使う。それはOCRやgroundingが必要とするものだ。16×ダウンサンプリングは使うトークンが少なく、まさにそのディテールを失うリスクがある。どちらが正しいかは、タスクが密なフォームを読むことなのか、シーンを記述することなのかによって変わる。そしてMiniCPM-V 4.6の切り替え可能な4x/16xモードが存在したのは、まさにその答えがタスクによって変わるからだった。4.7がその切り替えを維持したかどうかは、設定が語っていないことの一つだ。
ルーターが適する場合と、適さない場合
これらのモデルはいずれも、自分でホストして提供する重みです。North Micro Vision Instruct も MiniCPM-V 4.7 も OrcaRouter 上のホスト型モデルではなく、ここにある記述は、そうであるという主張として読まれるべきものではありません。ルーティングの話が出てくるのはその一段階後、小規模なセルフホストモデルが定型作業を担い、それが失敗するケースをより大きなモデルが処理しなければならなくなったときです。その引き継ぎこそが、単一キーのルーターの目的です — 各プロバイダーにまたがる200以上のモデルを、当社側で上乗せのない各モデルの定価で、あるプロバイダーが劣化した際の自動フェイルオーバー付きで — そして、必要になる前にインターフェースを整えておく価値があります。なぜなら、4.7の評価が成功する日こそ、2つ目の契約なしに2つ目のエンドポイントを求める日だからです。
評決、そしてそれを変えるもの
Cohereはモデルをリリースした。OpenBMBはチェックポイントをリリースした。読者が実際に判断材料にできるあらゆる軸——ライセンス、ライセンスの明確さ、文書化された挙動、ファインチューニングのしやすさ、量子化、言語カバレッジ——において、North Micro Vision Instructが今日の答えであり、それは僅差ではない。これは能力に関する主張ではない。なぜなら、能力の比較は不可能だからだ。MiniCPM-V 4.7は、比較対象のモデルのおよそ10倍のパラメータ数であり、その規模を正当化あるいは反証するものを何も公開していない。正直な姿勢は、それを保留扱いすることだ。実績のあるラボによる本物の成果物が、すべてを変えうる一つのファイル——README——を欠いたままリポジトリに置かれている。
