
North Micro Vision Instruct : le discret VLM de documents de 2,4B de Cohere, expliqué
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 144 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
CohereLabs/North-Micro-Vision-Instruct — « North Micro Vision » en abrégé — est un modèle vision-langage de 2,4 milliards de paramètres qui est arrivé discrètement : les poids sont apparus sur Hugging Face le 10 août 2026, l’annonce de Cohere a suivi le 12 août, et un jour plus tard, il n’y a toujours pas d’API hébergée, ni de liste de prix, ni d’entrée dans les classements tiers. North Micro Vision est conçu pour une seule tâche — lire des documents en résolution native, comme une personne plisse les yeux sur une page A4 scannée plutôt que comme un modèle de légende qui jette un coup d’œil à une miniature — et sa fiche de modèle est inhabituellement directe sur ce qu’il n’est pas : pas d’appel d’outils, pas de boucle de raisonnement, invites système activement déconseillées. Il s’agit d’un article « ce que nous savons jusqu’à présent », donc chaque chiffre ci-dessous est étiqueté : ce que le dépôt lui-même établit, ce que Cohere affirme mais que personne n’a reproduit, et ce que la seule analyse tierce publiée jusqu’à présent ajoute.
Ce que Cohere a réellement livré
Tout le contenu de cette section est lu directement depuis le dépôt : config.json, le README et la carte du modèle. Ce sont les sources principales de Cohere et, pour la quasi-totalité de ce que l'on sait sur le modèle, les seules sources.
• Taille — 2,4 milliards de paramètres au total : un encodeur visuel d’environ 400 millions de paramètres plus un modèle de langage « North Micro LLM » de 2 milliards de paramètres, en bfloat16, soit environ 4,97 Go de poids.
• Licence — Apache 2.0, permissif pour un usage commercial, poids et tokenizer ouverts
Encodeur de vision — entraîné sur mesure pour la résolution native, initialisé à partir de SigLIP 2 SO400M
— Modèle de langage — le LLM North Micro 2B interne suivant l'architecture Command A+ : trois couches d'attention à fenêtre glissante entrelacées avec une couche d'attention globale, attention à requêtes groupées (16 têtes de requête sur 8 têtes KV), embeddings liés, vocabulaire de 262 144 jetons.
— Projecteur — « DeepStack » : les plongements de patchs de plusieurs couches de l'encodeur visuel sont injectés dans les couches linguistiques précoces, plutôt que d'être ajoutés au début en une seule fois, ce qui permet au texte de petite taille et à la géométrie des tableaux de survivre.
• Résolution — entrée en résolution native avec préservation du rapport d'aspect, jusqu'à environ 1654 × 2339 pixels, soit une page A4 à environ 200 DPI.
• Contexte — 128K de contexte textuel sur le backbone linguistique ; 8K de contexte multimodal validé (détails ci-dessous)
• Langues — 11 prises en charge : anglais, chinois, allemand, français, espagnol, italien, portugais, hindi, japonais, coréen, arabe
Le suffixe « Instruct » est important. C'est le checkpoint ajusté par instructions — un modèle de chat et de QA visuelle — et au moment où nous écrivons, c'est le seul checkpoint. L'arborescence du modèle répertorie déjà onze quantifications communautaires et trois fine-tunes, mais aucune variante de base distincte n'a été publiée sous un autre nom.
Pourquoi l’architecture mérite un paragraphe
La plupart des VLM de 2 à 3B réduisent votre image à une grille fixe et perdent les petits caractères. Le pari de North Micro Vision est l'inverse : conserver la résolution, dépenser les tokens. L'encodeur de vision utilise la RoPE 2D plus des embeddings positionnels 1D appris, et le projecteur DeepStack injecte les embeddings de patches dans plusieurs couches de langage plutôt qu'en un simple préfixe unique, c'est ainsi qu'un tableau très dense ou une note de bas de page survit. L'encodage positionnel est un mRoPE entrelacé, donc le nombre de tokens visuels évolue avec la résolution de l'image au lieu d'être plafonné par une valeur prédéfinie.
Ce choix constitue tout le produit — et il a un coût. L'analyse de lancement de RohitAI estime qu'une page A4 native en résolution maximale correspond à environ 3 800 positions visuelles fusionnées. Lisez ce chiffre en parallèle avec l'avertissement contextuel ci-dessous : 3 800 jetons visuels plus un prompt peuvent remplir une grande partie de la fenêtre multimodale validée avant même que vous ayez posé votre question.
La carte de référence, lue honnêtement

Chaque chiffre de cette section est rapporté par le fournisseur. Aucun n'a été reproduit par un laboratoire indépendant, et le modèle n'apparaît encore sur aucun classement public. Sur le papier, le bilan est véritablement solide là où Cohere le souligne :
• DocVQA — 0.921 (réponse à des questions visuelles sur documents)
• ChartQA — 0.808 (lecture de graphique)
• OCRBench — 0.792 (OCR en conditions réelles)
• Ancrage RefCOCO — 0,732 moyenne P@1 (pointage d'objets)
• MMMU — 0.329 (connaissances multimodales de niveau universitaire — le point faible, comme prévu à cette taille)
• IFEval — 0.749 (suivi d'instructions)
La présentation du lancement par Cohere affirme que North Micro Vision surpasse Gemma 4 E2B et Ministral 3 3B « sur une série de benchmarks de compréhension visuelle », avec une force concentrée dans la compréhension de documents et le Q&A visuel. C'est là l'affirmation de Cohere à propos de son propre modèle — il faut la traiter comme telle. Un bémol : la comparaison de Cohere avec la famille de Liquid utilisait le checkpoint 1.6B, et non le 3B, de sorte qu'il n'existe aucune comparaison valide North contre LFM2.5-VL-3B dans la fiche, même si les deux modèles seront en concurrence pour le même budget de documents en périphérie.
La seule évaluation tierce publiée à ce jour — le test d'un simple blogueur, pas une suite de laboratoire — apporte l'image que la carte laisse de côté. Elle rapporte que North Micro Vision bat Ministral 3 3B Instruct sur cinq des sept lignes de documents, graphiques et OCR, ce qui correspond au discours du fournisseur. Mais elle rapporte aussi que Qwen3.5-2B bat North Micro Vision sur six de ces sept lignes et sur chaque ligne divulguée de VQA générale, de raisonnement, de comptage, d'hallucination et de connaissance textuelle ; la seule victoire de North Micro Vision face à Qwen3.5-2B dans cet ensemble est AI2D. Et l'OCRBench v2 anglais arrive à 0,367 contre le 0,792 annoncé en titre — un rappel que les scores OCR dépendent fortement de la sous-partie et de la difficulté que vous exécutez. Une seule exécution ne constitue pas un verdict, mais c'est la première preuve que le véritable concurrent de North Micro Vision à cette taille est la famille Qwen 3.5, pas les modèles que Cohere a choisi de prendre comme référence.
Une fenêtre de contexte, deux nombres
La fiche indique 128K de contexte texte et 8K de contexte multimodal validé, et l’écart entre les deux joue un rôle concret. Le nombre de 128K appartient uniquement au backbone linguistique ; les invites image-plus-texte au-delà de 8K tokens n’ont jamais été entraînées ni validées, donc tout ce qui dépasse cette limite relève de l’extrapolation. Avec une page A4 dense qui consomme environ 3,800 positions visuelles, vous pouvez atteindre cette fenêtre de 8K avec un seul document et une question courte. La conséquence pratique : concevez votre pipeline autour du découpage des pages en régions — le tableau, le bloc de signature, une facture unique — plutôt que de fournir des pages entières et d’attendre un long aller-retour à leur sujet.
Ce que la fiche du modèle vous dit de ne pas faire
North Micro Vision est une couche de perception, pas un agent, et Cohere est on ne peut plus explicite à ce sujet. La fiche précise que le modèle n'est pas un modèle de raisonnement, qu'il dispose de capacités limitées en mathématiques et en code, qu'il ne prend pas en charge l'appel d'outils ni les workflows agentiques, et qu'il ne doit pas remplacer un assistant général plus complet. Elle va plus loin que la plupart des fiches : elle déconseille les prompts système, car le modèle n'a pas été entraîné avec eux. Il n'y a pas non plus de scores de confiance calibrés. La conception que cela implique est une séparation : North Micro Vision lit et extrait, un schéma détient la structure, des règles détiennent les invariants, un modèle plus puissant gère les appels ambigus, et un humain approuve toute action conséquente. Traitez le texte présent sur la page comme des données, jamais comme une politique — une instruction scannée enfouie dans un document est exactement le type d'injection visuelle de prompt contre laquelle cette séparation protège.

Comment l'exécuter aujourd'hui

Le guide de démarrage rapide fait honnêtement état de ses propres frictions : la fiche du modèle exige Transformers 5.16.0, qui n'était pas la dernière version stable sur PyPI au jour du lancement, si bien que les premiers utilisateurs doivent installer depuis les sources. La prise en charge publique de vLLM est indiquée comme « à venir » ; Cohere a évalué avec une build vLLM interne. La prise en charge écosystémique dès le premier jour est par ailleurs bonne : recettes NVIDIA NeMo AutoModel pour les déploiements edge et GPU, recettes Axolotl pour le fine-tuning QLoRA et complet, et quantifications MLX communautaires pour Apple Silicon — la build 4 bits fait environ 2,17 Go. Un piège de déploiement mérite d'être nommé : définissez max_pixels explicitement, car sequence_len ne limite pas les jetons d'image, et sans cela vous risquez de dépasser la fenêtre multimodale validée sans le vouloir.
North Micro Vision n'est pas sur OrcaRouter et, selon sa propre fiche, il n'est sur aucun fournisseur d'inférence — c'est une histoire d'auto-hébergement, point final. C'est précisément pour cela que la couche de routage prend tout son sens dans la phrase suivante : dès qu'un fournisseur déploie un endpoint pour ce modèle, c'est un routeur qui vous permet de placer un modèle Apache-2.0 vieux de quelques jours à côté de ceux que vous appelez déjà en production — une seule API, aucun nouveau contrat, prix catalogue du fournisseur répercuté sans marge, et bascule automatique pour qu'un modèle non éprouvé puisse recevoir du trafic réel pendant qu'un modèle éprouvé rattrape les appels qu'il laisse échapper. Tant que cet endpoint n'existe pas, la comparaison que vous pouvez réellement lancer aujourd'hui est celle entre ce checkpoint et les modèles documentaires hébergés que vous payez déjà, côte à côte sur vos propres pages.
Qui doit bouger, et qui doit attendre
Optez pour ce modèle {{1}}si vous avez un travail d'extraction de documents bien délimité — factures, relevés bancaires, contrats, formulaires structurés — et des exigences de résidence des données ou d'audit qui rendent une API hébergée peu attrayante{{/1}}. {{2}}Apache 2.0, une adaptation de domaine QLoRA bon marché et un encodeur en résolution native constituent une combinaison vraiment inhabituelle pour cette charge de travail{{/2}}, et {{3}}les limites de la fiche du modèle sont suffisamment claires pour que vous ne soyez pas surpris{{/3}}. Attendez {{4}}si vous avez besoin d'un point de terminaison hébergé, d'une tarification au jeton ou d'un comportement agentique — rien de tout cela n'existe encore{{/4}}. Et {{5}}attendez avant de considérer comme acquis l'un des benchmarks ci-dessus{{/5}} : {{6}}chaque chiffre phare vient de Cohere{{/6}}, {{7}}l'unique exécution externe dresse un tableau plus contesté en haut de la catégorie des petits modèles{{/7}}, et {{8}}le modèle est sorti depuis moins d'une semaine{{/8}}. Ce qu'il faut surveiller, c'est {{9}}l'histoire du déploiement{{/9}} — {{10}}le jour où les Transformers standard et une version publique de vLLM le prendront tous deux en charge, North Micro Vision cessera d'être un dépôt avec lequel il faut se débattre pour devenir un modèle que vous pouvez simplement pointer vers vos documents{{/10}}.
