Eine Titelkarte für North Micro Vision Instruct mit der Aufschrift ‚North Micro Vision Instruct‘, dem Untertitel ‚Coheres 2.4B Apache-2.0-Dokument-VLM‘ und einem Chip, der angibt, dass es am 12. August 2026 veröffentlicht wurde, über drei Liniensymbolen für Dokumentenscan, Diagrammlesen und Bounding-Box-Grounding.
Guides & Insights

North Micro Vision Instruct: Coheres stilles 2.4B-Dokumenten-VLM, erklärt

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

CohereLabs/North-Micro-Vision-Instruct – kurz „North Micro Vision“ – ist ein Vision-Sprachmodell mit 2,4 Milliarden Parametern, das leise auf den Markt kam: Die Gewichte erschienen am 10. August 2026 auf Hugging Face, die Ankündigung von Cohere folgte am 12. August, und einen Tag später gibt es immer noch keine gehostete API, keine Preisliste und keinen Eintrag in einem Leaderboard von Drittanbietern. North Micro Vision ist auf eine einzige Aufgabe ausgelegt – Dokumente in nativer Auflösung zu lesen, so wie ein Mensch bei einer eingescannten A4-Seite die Augen zusammenkneift, und nicht wie ein Caption-Modell nur einen kurzen Blick auf ein Vorschaubild wirft – und die Modellkarte ist ungewöhnlich offen darüber, was das Modell nicht ist: kein Tool-Calling, keine Reasoning-Schleife, System-Prompts werden ausdrücklich nicht empfohlen. Dies ist eine Bestandsaufnahme nach dem derzeitigen Wissensstand, daher ist jede unten genannte Zahl gekennzeichnet: was das Repository selbst belegt, was Cohere behauptet, aber niemand reproduziert hat, und was die bisher einzige veröffentlichte Untersuchung von dritter Seite zusätzlich liefert.

Was Cohere tatsächlich veröffentlicht hat

Alles in diesem Abschnitt wird direkt aus dem Repository gelesen: config.json, die README und die Modellkarte. Dies sind Coheres primäre Quellen, und für den größten Teil dessen, was über das Modell bekannt ist, sind sie die einzigen Quellen.

• Größe — insgesamt 2,4 Mrd. Parameter: ein ~400M-Vision-Encoder plus ein 2B-„North Micro LLM“-Sprachmodell, in bfloat16, etwa 4,97 GB Gewichte

• Lizenz — Apache 2.0, kommerziell freizügig, Gewichte und Tokenizer offen

• Vision-Encoder — eigens trainiert für native Auflösung, initialisiert von SigLIP 2 SO400M

• Sprachmodell — das interne 2B North Micro LLM nach der Command-A+-Architektur: drei Sliding-Window-Aufmerksamkeitsebenen, verschachtelt mit einer globalen Aufmerksamkeitsebene, gruppierte Query-Aufmerksamkeit (16 Query-Köpfe über 8 KV-Köpfe), gebundene Embeddings, ein Vokabular von 262.144 Token

Projektor — „DeepStack": Patch-Embeddings aus mehreren Vision-Encoder-Schichten werden in frühe Sprach-Schichten injiziert, statt einmal vorangestellt zu werden — so bleiben kleiner Text und Tabellengeometrie erhalten.

• Auflösung — Eingabe in nativer Auflösung mit beibehaltenem Seitenverhältnis, bis zu etwa 1654 × 2339 Pixel, was einer A4-Seite bei etwa 200 DPI entspricht

• Kontext — 128K Textkontext auf dem Sprach-Backbone; 8K validierter multimodaler Kontext (Details unten)

• Sprachen — 11 unterstützt: Englisch, Chinesisch, Deutsch, Französisch, Spanisch, Italienisch, Portugiesisch, Hindi, Japanisch, Koreanisch, Arabisch

Das "Instruct"-Suffix ist wichtig. Dies ist der instruktionsabgestimmte Checkpoint – ein Chat- und visuelles QA-Modell – und zum Zeitpunkt des Schreibens ist es der einzige Checkpoint. Der Modellbaum listet bereits elf Community-Quantisierungen und drei Fine-Tunes auf, aber es wurde keine separate Basisvariante unter einem anderen Namen veröffentlicht.

Warum die Architektur einen Absatz wert ist

Die meisten 2-3B-VLMs verkleinern dein Bild auf ein festes Raster und verlieren dabei das Kleingedruckte. North Micro Vision setzt auf das Gegenteil: Auflösung beibehalten, Tokens ausgeben. Der Vision-Encoder verwendet 2D-RoPE plus gelernte 1D-Positionsembeddings, und der DeepStack-Projektor speist Patch-Embeddings in mehrere Sprachschichten ein, statt sie nur einmal voranzustellen – so überlebt eine dicht gepackte Tabelle oder eine Fußnote. Die Positionskodierung ist verschachteltes mRoPE, sodass die Anzahl der visuellen Tokens mit der Bildauflösung skaliert, anstatt durch eine Voreinstellung begrenzt zu werden.

Diese Entscheidung ist das gesamte Produkt — und sie hat einen Preis. Die Startanalyse von RohitAI schätzt, dass eine native A4-Seite bei maximaler Auflösung ungefähr {{1}}3.800 zusammengeführte visuelle Positionen{{/1}} ergibt. Lesen Sie diese Zahl neben dem Kontextvorbehalt unten: {{2}}3.800 visuelle Tokens{{/2}} plus eine Eingabeaufforderung können einen großen Teil des validierten multimodalen Fensters füllen, bevor Sie Ihre Frage überhaupt gestellt haben.

Die Benchmark-Karte, ehrlich gelesen.

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

Jede Zahl in diesem Abschnitt stammt vom Anbieter. Keine wurde von einem unabhängigen Labor reproduziert, und das Modell erscheint noch auf keiner öffentlichen Bestenliste. Auf dem Papier ist die Bilanz dort, wo Cohere sie aufzeigt, tatsächlich stark:

• DocVQA — 0,921 (visuelle Beantwortung von Dokumentfragen)

• ChartQA — 0.808 (Diagrammlesen)

• OCRBench — 0.792 (OCR in freier Wildbahn)

RefCOCO-Grounding — 0,732 durchschnittliches P@1 (Zeigen auf Objekte)

• MMMU — 0,329 (multimodales Wissen auf College-Niveau — die Schwachstelle, wie bei dieser Größe zu erwarten)

• IFEval — 0.749 (Befolgung von Anweisungen)

Coheres Launch-Framing behauptet, dass North Micro Vision Gemma 4 E2B und Ministral 3 3B „in einer Reihe von Benchmarks zum visuellen Verständnis“ übertrifft, wobei die Stärke im Dokumentverständnis und bei visuellen Fragen/Antworten liegt. Das ist Coheres Behauptung über Coheres Modell – behandle sie als solche. Ein Haken: Coheres Vergleich mit Liquids Familie verwendete den 1.6B-Checkpoint, nicht den 3B, daher gibt es in der Karte keinen gültigen Vergleich zwischen North und LFM2.5-VL-3B, obwohl die beiden Modelle um dasselbe Edge-Dokument-Budget konkurrieren werden.

Der einzige bisher veröffentlichte Blick von außen — ein einzelner Blogger-Lauf, keine Laborsuite — ergänzt das Bild, das die Karte auslässt. Er berichtet, dass North Micro Vision Ministral 3 3B Instruct in fünf der sieben Zeilen für Dokumente, Diagramme und OCR schlägt, was der Darstellung des Anbieters entspricht. Aber er berichtet auch, dass Qwen3.5-2B North Micro Vision in sechs dieser sieben Zeilen und in jeder offengelegten Zeile für allgemeine VQA, logisches Denken, Zählen, Halluzinationen und Textwissen schlägt; North Micro Visions einziger Sieg über Qwen3.5-2B in diesem Set ist AI2D. Und English OCRBench v2 erreicht 0,367 gegenüber dem beworbenen OCRBench-Wert von 0,792 — eine Erinnerung daran, dass OCR-Ergebnisse stark davon abhängen, welchen Split und welche Schwierigkeitsstufe man ausführt. Ein Lauf ist kein Urteil, aber er ist der erste Beleg dafür, dass der tatsächliche Konkurrent von North Micro Vision in dieser Größenklasse die Qwen-3.5-Familie ist, nicht die Modelle, die Cohere als Benchmark-Vergleich gewählt hat.

Ein Kontextfenster, zwei Zahlen

Die Karte listet 128K Textkontext und 8K validierten multimodalen Kontext auf, und die Lücke zwischen beiden hat reale Konsequenzen. Die 128K-Angabe bezieht sich ausschließlich auf das Sprach-Backbone; Bild-plus-Text-Prompts über 8K Token hinaus wurden nie trainiert oder validiert, also ist alles jenseits dieser Grenze Extrapolation. Da eine dichte A4-Seite etwa 3.800 visuelle Positionen beansprucht, erreichen Sie dieses 8K-Fenster mit einem Dokument und einer kurzen Frage. Die praktische Konsequenz: Planen Sie Ihre Pipeline so, dass Sie Seiten in Bereiche zuschneiden — die Tabelle, den Signaturblock, eine einzelne Rechnung — statt ganze Seiten einzuspeisen und ein langes Hin und Her darüber zu erwarten.

Was Ihnen die Modellkarte nicht zu tun rät

{{1}}North Micro Vision ist eine Wahrnehmungsschicht, kein Agent, und Cohere ist dabei erfreulich explizit.{{/1}} Die Karte besagt, dass {{2}}das Modell kein Reasoning-Modell ist, nur begrenzte Mathematik- und Code-Fähigkeiten hat, keine Tool-Aufrufe oder agentische Workflows unterstützt und einen größeren allgemeinen Assistenten nicht ersetzen sollte.{{/2}} Sie geht einen Schritt weiter als die meisten Karten: Sie rät von System-Prompts ab, weil das Modell nicht mit ihnen trainiert wurde. Es gibt auch keine kalibrierten Konfidenzwerte. Das daraus abgeleitete Design ist eine Aufteilung: {{3}}North Micro Vision liest und extrahiert, ein Schema bestimmt die Struktur, Regeln bestimmen die Invarianten, ein stärkeres Modell übernimmt die mehrdeutigen Anfragen, und ein Mensch genehmigt alles Folgenreiche.{{/3}} {{4}}Behandeln Sie den Text auf der Seite als Daten, niemals als Richtlinie{{/4}} – eine gescannte Anweisung, die in einem Dokument vergraben ist, ist genau die Art von visueller Prompt-Injection, gegen die diese Aufteilung schützt.

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

So führen Sie es heute aus.

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

Der Schnellstart ist ehrlich, was seine eigenen Reibungspunkte angeht: Die Modellkarte erfordert Transformers 5.16.0, das zum Veröffentlichungstag nicht die neueste stabile PyPI-Version war, weshalb frühe Nutzer aus dem Quellcode installieren. Öffentliche vLLM-Unterstützung wird als „in Kürze verfügbar“ aufgeführt; Cohere hat mit einem internen vLLM-Build evaluiert. Die Ökosystem-Unterstützung am ersten Tag ist ansonsten gut: NVIDIA NeMo AutoModel-Rezepte für Edge- und GPU-Bereitstellung, Axolotl QLoRA- und vollständige Feintuning-Rezepte sowie Community-MLX-Quantisierungen für Apple Silicon — der 4-Bit-Build ist etwa 2,17 GB groß. Eine Bereitstellungsfalle, die man erwähnen sollte: Setze max_pixels explizit, denn sequence_len begrenzt die Bild-Token nicht, und ohne diese Einstellung kann man das validierte multimodale Fenster unbeabsichtigt sprengen.

North Micro Vision ist nicht auf OrcaRouter, und seiner eigenen Karte zufolge auch bei keinem Inferenz-Anbieter — das ist eine Self-Hosting-Geschichte, Punkt. Genau deshalb ist die Routing-Ebene im nächsten Satz von Bedeutung: Sobald ein Anbieter einen Endpunkt dafür bereitstellt, ist ein Router das, was dich in die Lage versetzt, ein wenige Tage altes Apache-2.0-Modell neben diejenigen zu stellen, die du bereits in Produktion aufrufst — eine API, kein neuer Vertrag, Anbieter-Listenpreis ohne Aufschlag durchgereicht und automatisches Failover, sodass ein unerprobtes Modell echten Traffic übernehmen kann, während ein bewährtes Modell die Aufrufe auffängt, die das unerprobte verpatzt. Bis dieser Endpunkt existiert, ist der Vergleich, den du heute tatsächlich durchführen kannst, der zwischen diesem Checkpoint und den gehosteten Dokumentenmodellen, für die du bereits zahlst, Seite an Seite auf deinen eigenen Seiten.

Wer sollte umziehen, und wer sollte warten

Greifen Sie zu, wenn Sie eine begrenzte Dokumentextraktions-Aufgabe haben – Rechnungen, Kontoauszüge, Verträge, strukturierte Formulare – und Anforderungen an Datenresidenz oder Auditierung, die eine gehostete API unattraktiv machen. Apache 2.0, kostengünstige QLoRA-Domänenanpassung und ein Encoder mit nativer Auflösung sind eine wirklich ungewöhnliche Kombination für diese Arbeitslast, und die Einschränkungen der Modellkarte sind klar genug, dass Sie nicht überrascht sein werden. Warten Sie, wenn Sie einen gehosteten Endpunkt, Preise pro Token oder agentisches Verhalten benötigen – keines davon existiert bisher. Und warten Sie, bevor Sie einen der obigen Benchmarks als endgültig betrachten: Jede Schlagzeilenzahl stammt von Cohere; der einzige externe Testlauf zeichnet ein umstritteneres Bild an der Spitze der Klasse kleiner Modelle, und das Modell ist seit weniger als einer Woche verfügbar. Worauf man achten sollte, ist die Geschichte rund ums Serving – an dem Tag, an dem die Standard-Transformers und eine öffentliche vLLM-Veröffentlichung es beide unterstützen, hört North Micro Vision auf, ein Repository zu sein, mit dem man sich herumschlagen muss, und wird zu einem Modell, das man einfach auf seine Dokumente richten kann.