「North Micro Vision Instruct」用のタイトルカード。「North Micro Vision Instruct」と表示され、サブタイトルに「Cohereの2.4B Apache-2.0ドキュメントVLM」、2026年8月12日に公開されたことを示すチップが付いており、その上に文書スキャン、チャート読み取り、バウンディングボックスグラウンディングの3つのラインアイコンが配置されている。
Guides & Insights

North Micro Vision Instruct:Cohereのひっそりとした2.4B文書VLM、解説

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

CohereLabs/North-Micro-Vision-Instruct「North Micro Vision」と略されるこのモデルは、24億パラメータを持つ視覚言語モデルであり、静かに世に送り出された。2026年8月10日にHugging Faceにウェイトが公開され、8月12日にCohereが発表を行ったが、その翌日になっても、ホステッドAPIも価格表も、第三者によるリーダーボードへの掲載もない。North Micro Visionは、一つの仕事のために作られている。それは、スキャンされたA4のページを人が目を細めて読むように、ネイティブ解像度で文書を読み取ることであり、キャプションモデルがサムネイルをちらりと見るようなものではない。そして、そのモデルカードは、何ができないかについて異例なほど率直だ。ツール呼び出しはなく、推論ループもなく、システムプロンプトは積極的に推奨されない。これは、現時点で判明していることをまとめた記事であり、以下のすべての数字には出所が明記されている。リポジトリ自体が確立している事実、Cohereが主張しているが誰も再現していない事実、そしてこれまでに発表された唯一の第三者による調査が追加した事実である。

Cohereが実際に出荷したもの

このセクションの内容はすべて、リポジトリから直接読み取ったものです:config.json、README、モデルカード。これらはCohereの主要な情報源であり、モデルについて知られていることのほとんどにとって、これらが唯一の情報源です。

• サイズ — 合計 2.4B パラメータ: 約 400M のビジョンエンコーダと 2B の「North Micro LLM」言語モデル、bfloat16 形式、重みは約 4.97 GB

• ライセンス — Apache 2.0、商用利用に寛容、重みとトークナイザーはオープン

• ビジョンエンコーダー — ネイティブ解像度向けにカスタム学習され、SigLIP 2 SO400Mから初期化

• 言語モデル — Command A+ アーキテクチャに従う社内製2B North Micro LLM:3つのスライディングウィンドウアテンションレイヤーと1つのグローバルアテンションレイヤーを交互に配置、グループ化クエリアテンション(8つのKVヘッドに対する16のクエリヘッド)、タイドエンベディング、262,144トークンの語彙

プロジェクター — "DeepStack":複数のビジョンエンコーダ層からのパッチ埋め込みは、一度だけ先頭へ付加されるのではなく、初期の言語層に注入される。これにより、小さな文字や表の形状が保持される。

• 解像度 — アスペクト比を維持したネイティブ解像度の入力に対応。約1654×2339ピクセルまでで、これはおよそ200 DPIのA4用紙1枚分に相当します。

• コンテキスト — 言語バックボーン上の128Kテキストコンテキスト、検証済みの8Kマルチモーダルコンテキスト(詳細は以下)

• 言語 — 11言語対応: 英語、中国語、ドイツ語、フランス語、スペイン語、イタリア語、ポルトガル語、ヒンディー語、日本語、韓国語、アラビア語

「Instruct」という接尾辞が重要です。これは指示チューニング済みチェックポイント——チャットおよびビジュアルQAモデル——であり、本記事の執筆時点では唯一のチェックポイントです。モデルツリーにはすでに11のコミュニティ量子化と3つのファインチューンがリストされていますが、別の名前で公開された独立したベースバリアントはありません。

なぜそのアーキテクチャは段落に値するのか

多くの2-3B VLMは画像を固定グリッドにダウンスケールし、細かい文字を失います。North Micro Visionの賭けはその逆です:解像度を保ち、トークンを費やすことです。視覚エンコーダは2D RoPEと学習された1D位置埋め込みを使用し、DeepStackプロジェクタはパッチ埋め込みを単一の前置ではなく複数の言語レイヤーに供給します。これにより、密集した表や脚注が生き残ります。位置エンコーディングはインターリーブされたmRoPEであり、そのため視覚トークン数はプリセットによって上限が決められるのではなく、画像解像度に応じてスケールします。

その選択こそが製品そのものであり、それにはコストが伴う。RohitAIのローンチ分析では、最大解像度のネイティブA4ページ1枚が、約3,800の統合視覚位置に相当すると見積もられている。その数字を、以下のコンテキスト上の注意事項と並べて見てほしい。3,800のビジュアルトークンにプロンプトが加わると、質問を尋ねる前に、検証済みマルチモーダルウィンドウの大部分を占めてしまう可能性がある。

ベンチマークカードを正直に読む

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

このセクションのすべての数値はベンダーによる報告です。独立したラボによる再現はされておらず、このモデルはまだ公開リーダーボードに登場していません。書面上では、Cohereが指摘する点において記録は確かに強力です:

• DocVQA — 0.921(文書視覚質問応答)

• ChartQA — 0.808(チャート読み取り)

• OCRBench — 0.792 (実環境でのOCR)

• RefCOCO grounding — 平均P@1 0.732(物体を指し示す)

• MMMU — 0.329(大学レベルのマルチモーダル知識 — この規模では予想通り、弱点となる部分)

• IFEval — 0.749 (指示追従)

{{1}}Cohereの発表枠組みでは、North Micro Visionが「各種視覚理解ベンチマークにおいて」Gemma 4 E2BやMinistral 3 3Bを上回ると主張しており、その強みは文書理解と視覚QAに集中しています。これはCohereが自社モデルについて述べている主張であり、そのように扱うべきです。{{/1}}{{2}}1つの注意点として、CohereのLiquid社製品群との比較では3Bチェックポイントではなく1.6Bチェックポイントが使用されているため、カード内にはNorth対LFM2.5-VL-3Bの有効な比較は存在しません。{{/2}}{{3}}それにもかかわらず、両モデルは同じエッジ文書処理予算をめぐって競合することになります。{{/3}}

これまでに公開された唯一のサードパーティによる評価——研究所による一連のテストではなく、一人のブロガーによる実行だが——は、カードが省いている全体像を補足する。それによると、North Micro Visionは文書・チャート・OCRの7項目中5項目でMinistral 3 3B Instructを上回っており、これはベンダーの主張と一致する。しかし同時に、Qwen3.5-2Bがこれら7項目中6項目に加え、開示された一般VQA、推論、計数、幻覚、テキスト知識の全項目でもNorth Micro Visionを上回ったと報告している。そのセットでNorth Micro VisionがQwen3.5-2Bに勝ったのはAI2Dだけである。さらに、English OCRBench v2は0.367で、見出しとなっているOCRBenchの0.792とは対照的だ——OCRスコアは、どのスプリットとどの難易度で実行するかに大きく依存することを思い起こさせる。一度の実行は判定にはならないが、このサイズにおけるNorth Micro Visionの真の競争相手が、Cohereがベンチマーク対象に選んだモデルではなくQwen 3.5ファミリーであることを示す最初の証拠となる。

1つのコンテキストウィンドウ、2つの数字

このカードには128Kのテキストコンテキストと8Kの検証済みマルチモーダルコンテキストが記載されており、この両者の差は実際に重要な役割を果たしている。128Kという数値は言語バックボーン単体に属するものであり、8Kトークンを超える画像とテキストを組み合わせたプロンプトはトレーニングも検証もされていないため、そのラインを超えるものはすべて外挿である。密度の高いA4ページ1枚が約3,800のビジュアルポジションを消費することを考えると、文書1点と短い質問でその8Kウィンドウに到達できる。実際的な含意は次のとおりだ。パイプラインはページ全体を渡して長いやり取りを期待するのではなく、ページを領域ごとにクロッピングする計画を立てるべきである——テーブル、署名欄、請求書1枚といった具合に。

モデルカードがしてはいけないと伝えていること

North Micro Visionは認識レイヤーであり、エージェントではない——Cohereはこの点を清々しいほど明確に述べている。カードには、このモデルは推論モデルではなく、数学・コード能力は限定的で、ツール呼び出しやエージェンティックワークフローに対応しておらず、より大規模な汎用アシスタントの代わりになるべきではないと記載されている。これはほとんどのカードより一歩踏み込んでおり、システムプロンプトの使用を推奨しないとしている。モデルがシステムプロンプトでトレーニングされていないためだ。キャリブレーションされた信頼スコアも存在しない。ここから示唆される設計は分離型である:North Micro Visionが読み取りと抽出を行い、スキーマが構造を担い、ルールが不変条件を担い、より強力なモデルがあいまいな判断を処理し、人間が影響を伴う事項を承認する。ページ上のテキストはデータとして扱い、決してポリシーとしては扱わない——文書に埋め込まれたスキャン指示は、まさにこの分離が防御する視覚的プロンプトインジェクションの一種である。

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

今日それを実行する方法

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

クイックスタートは自身の摩擦について率直に述べている。モデルカードはTransformers 5.16.0を要求しているが、これは発表当日の最新安定PyPIリリースではなかったため、初期ユーザーはソースからインストールすることになる。公開のvLLMサポートは「近日対応予定」と記載されており、Cohereは社内のvLLMビルドで評価した。それ以外のリリース初日のエコシステムサポートは良好だ。NVIDIA NeMo AutoModelによるエッジおよびGPU展開のレシピ、AxolotlによるQLoRAおよび完全ファインチューニングのレシピ、Apple Silicon向けのコミュニティ製MLX量子化。4ビット版は約2.17GBである。特筆すべきデプロイの落とし穴が1つある。max_pixelsを明示的に設定すること。sequence_lenは画像トークンを制限しないため、設定しないと意図せず検証済みのマルチモーダルウィンドウを超えてしまう可能性がある。

North Micro Vision は OrcaRouter には載っておらず、そのモデルカードによれば、いかなる推論プロバイダーにも載っていない。これは完全にセルフホストの物語であり、それで話は終わりだ。まさにそれが、次の文でルーティング層が重要になる理由だ。いずれかのプロバイダーがそれ用のエンドポイントを立ち上げた瞬間、ルーターがあれば、リリースから数日しか経っていない Apache-2.0 モデルを、すでに本番で呼び出しているモデルの隣に置くことができる。API は1つのまま、新しい契約は不要、プロバイダーのリスト価格をマークアップ 0% で透過し、自動フェイルオーバーにより、実績のないモデルが実際のトラフィックを処理し、実績のあるモデルが取りこぼした呼び出しを引き受ける。そのエンドポイントが存在するまでは、今日実際に実行できる比較は、このチェックポイントと、すでに費用を支払っているホスト型ドキュメントモデルとの比較であり、それを自分のページ上で並べて行うことになる。

誰が動くべきで、誰が待つべきか

{{1}}対象が明確に限定された文書抽出業務(請求書、銀行取引明細書、契約書、定型フォーム)があり、ホステッドAPIが魅力的でなくなるデータレジデンシーや監査要件があるなら、導入を検討すべきです。{{2}}Apache 2.0ライセンス、低コストなQLoRAによるドメイン適応、そしてネイティブ解像度エンコーダーの組み合わせは、その種のワークロードにとって実に異例であり、モデルカードに記載された制約も明確なので、不意を突かれることはないでしょう。{{3}}ホステッドエンドポイント、トークン単位の課金、またはエージェント的な動作が必要なら、待つべきです。それらはまだ存在しません。{{4}}また、上記のベンチマークを確定したものと見なすのは待つべきです。主要な数値はすべてCohereによるもので、外部による唯一の実行結果はスモールモデルクラスの上位層でより拮抗した構図を示しており、しかもこのモデルが公開されてから1週間も経っていません。{{5}}注目すべきは推論サーバーまわりの状況です。標準のTransformersと一般公開されたvLLMリリースの両方がこのモデルに対応した日には、North Micro Visionは手こずるリポジトリではなく、単に文書を指し示すだけで使えるモデルになるでしょう。