Una scheda titolo per North Micro Vision Instruct con la scritta 'North Micro Vision Instruct' e il sottotitolo 'Cohere's 2.4B Apache-2.0 document VLM', oltre a un chip che indica il rilascio del 12 agosto 2026, sopra tre icone lineari per la scansione di documenti, la lettura di grafici e il grounding tramite bounding box.
Guides & Insights

North Micro Vision Instruct: il silenzioso VLM documentale da 2.4B di Cohere, spiegato

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

CohereLabs/North-Micro-Vision-Instruct — "North Micro Vision" in breve — è un modello visione-linguaggio da 2,4 miliardi di parametri che è arrivato in sordina: i pesi sono apparsi su Hugging Face il 10 agosto 2026, l'annuncio di Cohere è seguito il 12 agosto, e un giorno dopo non c'è ancora un'API ospitata, nessun listino prezzi e nessuna voce in una classifica di terze parti. North Micro Vision è progettato per un solo compito — leggere documenti a risoluzione nativa, nel modo in cui una persona strizza gli occhi su una pagina A4 scansionata piuttosto che come un modello di didascalie guarda una miniatura — e la sua scheda modello è insolitamente diretta su ciò che non è: nessuna chiamata a strumenti, nessun ciclo di ragionamento, prompt di sistema apertamente sconsigliati. Questo è un articolo "cosa sappiamo finora", quindi ogni dato qui sotto è etichettato: cosa stabilisce il repository stesso, cosa afferma Cohere ma nessuno ha riprodotto, e cosa aggiunge l'unico esame di terze parti pubblicato finora.

Ciò che Cohere ha effettivamente pubblicato

Tutto in questa sezione è letto direttamente dal repository: config.json, il README e la scheda del modello. Queste sono le fonti primarie di Cohere e, per la maggior parte di ciò che si sa sul modello, sono le uniche fonti.

• Dimensione — 2,4 miliardi di parametri in totale: un encoder visivo da ~400M più un modello linguistico "North Micro LLM" da 2B, in bfloat16, circa 4,97 GB di pesi

• Licenza — Apache 2.0, commercialmente permissiva, pesi e tokenizer open

• Encoder visivo — addestrato su misura per la risoluzione nativa, inizializzato da SigLIP 2 SO400M

• Modello linguistico — l'LLM North Micro da 2B interno che segue l'architettura Command A+: tre livelli di attenzione a finestra scorrevole intervallati da un livello di attenzione globale, attenzione a query raggruppate (16 testine di query su 8 testine KV), embeddings condivisi, vocabolario di 262.144 token

• Proiettore — "DeepStack": gli embedding dei patch provenienti da diversi layer dell'encoder visivo vengono iniettati nei primi layer linguistici anziché essere anteposti una sola volta, ed è così che il testo piccolo e la geometria delle tabelle vengono preservati.

• Risoluzione — input a risoluzione nativa con proporzioni mantenute, fino a circa 1654 × 2339 pixel, pari a una pagina A4 a circa 200 DPI.

• Contesto — 128K di contesto testuale sul backbone linguistico; 8K di contesto multimodale validato (dettagli di seguito)

• Lingue — 11 supportate: inglese, cinese, tedesco, francese, spagnolo, italiano, portoghese, hindi, giapponese, coreano, arabo

Il suffisso "Instruct" è importante. Questo è il checkpoint ottimizzato per le istruzioni — un modello per chat e QA visivo — e al momento in cui scriviamo è l'unico checkpoint disponibile. L'albero del modello elenca già undici quantizzazioni della community e tre fine-tuning, ma nessuna variante base separata è stata pubblicata con un nome diverso.

Perché l'architettura merita un paragrafo

La maggior parte dei VLM da 2-3B riduce l'immagine a una griglia fissa e perde i dettagli in piccolo. La scommessa di North Micro Vision è l'opposto: mantenere la risoluzione, spendere i token. L'encoder visivo usa RoPE 2D più embedding posizionali 1D appresi, e il proiettore DeepStack inserisce gli embedding dei patch in più livelli linguistici anziché in un singolo prepend, ed è così che una tabella fitta o una nota a piè di pagina sopravvive. La codifica posizionale è mRoPE interleaved, quindi il numero di token visivi scala con la risoluzione dell'immagine invece di essere limitato da un valore preimpostato.

La scelta è il prodotto stesso — e ha un costo. L'analisi di lancio di RohitAI stima che una pagina A4 nativa alla massima risoluzione equivalga a circa 3.800 posizioni visive unificate. Leggi questo numero accanto all'avvertenza sul contesto qui sotto: 3.800 token visivi più un prompt possono riempire gran parte della finestra multimodale validata prima ancora di aver posto la tua domanda.

La scheda di benchmark, letta onestamente

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

Ogni dato in questa sezione è riportato dal fornitore. Nessuno è stato riprodotto da un laboratorio indipendente e il modello non compare ancora in alcuna classifica pubblica. Sulla carta, il risultato è davvero solido nei punti indicati da Cohere:

• DocVQA — 0,921 (risposta a domande visive su documenti)

• ChartQA — 0.808 (lettura di grafici)

• OCRBench — 0.792 (OCR nel mondo reale)

• Grounding RefCOCO — 0.732 media P@1 (indicando gli oggetti)

• MMMU — 0.329 (conoscenza multimodale a livello universitario — il punto debole, come previsto a queste dimensioni)

• IFEval — 0.749 (aderenza alle istruzioni)

La dichiarazione di lancio di Cohere sostiene che North Micro Vision supera Gemma 4 E2B e Ministral 3 3B "in una serie di benchmark di comprensione visiva", con il punto di forza concentrato nella comprensione dei documenti e nel visual QA. Questa è l'affermazione di Cohere sul modello di Cohere — va trattata come tale. Un dettaglio: il confronto di Cohere con la famiglia di Liquid ha usato il checkpoint da 1.6B, non quello da 3B, quindi non esiste un confronto valido North-vs-LFM2.5-VL-3B nella scheda, anche se i due modelli competeranno per lo stesso budget edge-document.

{{1}}L'unica valutazione di terze parti finora pubblicata — il test di un singolo blogger, non una suite di laboratorio — aggiunge il quadro che la scheda omette.{{/1}} {{2}}Riporta che North Micro Vision batte Ministral 3 3B Instruct in cinque delle sette righe su documenti, grafici e OCR, il che corrisponde alla narrativa del fornitore.{{/2}} {{3}}Ma riporta anche che Qwen3.5-2B batte North Micro Vision in sei di quelle sette righe e in ogni riga dichiarata relativa a VQA generale, ragionamento, conteggio, allucinazioni e conoscenza testuale; l'unica vittoria di North Micro Vision su Qwen3.5-2B in quel set è AI2D.{{/3}} {{4}}E l'OCRBench v2 in inglese si attesta a 0,367 contro lo 0,792 di OCRBench che campeggia nei titoli — un promemoria che i punteggi OCR dipendono fortemente da quale split e quale difficoltà si esegue.{{/4}} {{5}}Un singolo test non è un verdetto, ma è la prima prova che il vero concorrente di North Micro Vision in questa fascia di dimensioni è la famiglia Qwen 3.5, non i modelli che Cohere ha scelto come benchmark di riferimento.{{/5}}

Una finestra di contesto, due numeri

La scheda elenca 128K di contesto testuale e 8K di contesto multimodale validato, e il divario tra i due sta facendo un lavoro concreto. Il numero 128K appartiene solo al backbone linguistico; i prompt composti da immagini e testo oltre gli 8K token non sono mai stati addestrati né validati, quindi qualsiasi cosa oltre quella soglia è un'estrapolazione. Con una pagina A4 fitta che consuma circa 3.800 posizioni visive, puoi raggiungere quella finestra di 8K con un documento e una breve domanda. La conseguenza pratica: progetta la tua pipeline attorno al ritaglio delle pagine in regioni — la tabella, il blocco firma, una singola fattura — piuttosto che inserire intere pagine e aspettarti un lungo scambio di domande e risposte su di esse.

Cosa la scheda del modello ti dice di non fare

North Micro Vision è un livello di percezione, non un agente, e Cohere lo afferma con una chiarezza rinfrescante. La scheda dice che il modello non è un modello di ragionamento, ha capacità limitate in matematica e codice, non supporta il tool calling né i flussi di lavoro agentici, e non dovrebbe sostituire un assistente generale più grande. Va oltre rispetto alla maggior parte delle schede: sconsiglia i system prompt, perché il modello non è stato addestrato con essi. Non ci sono nemmeno punteggi di confidenza calibrati. Il design che ne deriva è una separazione: North Micro Vision legge ed estrae, uno schema possiede la struttura, le regole possiedono gli invarianti, un modello più forte gestisce le chiamate ambigue, e un umano approva qualsiasi cosa rilevante. Tratta il testo sulla pagina come dati, mai come policy — un'istruzione scansionata sepolta in un documento è esattamente il tipo di iniezione visiva di prompt contro cui questa separazione protegge.

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

Come eseguirlo oggi

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

La guida rapida è onesta riguardo ai propri limiti: la scheda del modello richiede Transformers 5.16.0, che non era l'ultima release stabile di PyPI al momento del lancio, quindi i primi utenti installano dai sorgenti. Il supporto pubblico per vLLM è indicato come "coming soon"; Cohere ha svolto le valutazioni con una build vLLM interna. Per il resto, il supporto dell'ecosistema al day one è buono: ricette NVIDIA NeMo AutoModel per il deployment su edge e GPU, ricette Axolotl per QLoRA e fine-tuning completo, e quantizzazioni MLX della community per Apple Silicon — la build a 4 bit pesa circa 2,17 GB. Una trappola di deployment che vale la pena menzionare: impostare max_pixels esplicitamente, perché sequence_len non limita i token delle immagini e, senza di esso, si può sforare la finestra multimodale validata senza volerlo.

North Micro Vision non è su OrcaRouter e, stando alla sua stessa scheda, non è su nessun provider di inferenza: questa è una storia di self-hosting, punto e basta. Ed è esattamente questo il motivo per cui il layer di routing conta nella frase successiva: nel momento in cui un provider attiva un endpoint per questo modello, un router è ciò che ti permette di affiancare un modello Apache-2.0 vecchio di pochi giorni a quelli che già chiami in produzione — una sola API, nessun nuovo contratto, prezzo di listino del provider trasferito con markup 0% e failover automatico, così un modello non ancora provato può gestire traffico reale mentre uno collaudato intercetta le chiamate che sbaglia. Finché quell'endpoint non esiste, il confronto che puoi eseguire davvero oggi è quello tra questo checkpoint e i modelli documentali ospitati che già paghi, affiancati sulle tue stesse pagine.

Chi dovrebbe muoversi, e chi dovrebbe aspettare

Vai avanti se hai un lavoro di estrazione documentale ben delimitato — fatture, estratti conto bancari, contratti, moduli strutturati — e requisiti di residenza dei dati o di audit che rendono poco attraente un'API ospitata. Apache 2.0, adattamento di dominio QLoRA a basso costo e un encoder a risoluzione nativa sono una combinazione davvero insolita per quel carico di lavoro, e i limiti dichiarati nella scheda del modello sono abbastanza chiari da non riservarti sorprese. Aspetta se ti serve un endpoint ospitato, prezzi per token o comportamento agentico — nulla di tutto ciò esiste ancora. E aspetta prima di considerare assodato qualsiasi benchmark sopra: ogni cifra di punta è di Cohere, l'unica esecuzione esterna dipinge un quadro più contestato ai vertici della classe dei modelli piccoli, e il modello è stato rilasciato da meno di una settimana. La cosa da tenere d'occhio è il lato serving — il giorno in cui sia i Transformers standard sia una release pubblica di vLLM lo supporteranno, North Micro Vision smetterà di essere un repository da domare e diventerà un modello che puoi semplicemente puntare verso i tuoi documenti.