
InternLumina-U2 vs North Micro Vision Instruct: un lettore di documenti che puoi eseguire oggi vs un modello da 16B che non è ancora all'altezza
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Se questa settimana hai bisogno di un modello che legga documenti, screenshot e grafici, questo confronto ha una risposta pratica e breve: North Micro Vision Instruct è un modello open-weight da 2,4 miliardi di parametri di Cohere, rilasciato sotto licenza Apache-2.0, scaricabile dal 10 agosto 2026, e abbastanza valido nei compiti sui documenti da meritare di essere provato oggi sui tuoi file. InternLumina-U2 è il modello di diffusione da 16 miliardi di parametri dello Shanghai AI Laboratory — un progetto molto più ambizioso che dichiara di comprendere anche grafici e documenti, oltre a una mezza dozzina di altri compiti — ma i suoi pesi non sono pubblici, la sua repository Hugging Face è uno stub vuoto, e nessuno, da nessuna parte, può ancora eseguirlo. La risposta più lunga riguarda ciò che accade quando due modelli Apache-2.0 fanno affermazioni sovrapposte sulla lettura, ma solo uno dei due è qualcosa che puoi tenere in mano.
Il 2.4B che esiste realmente
North Micro Vision Instruct è lo specialista della visione nella famiglia North di Cohere: circa 2,4 miliardi di parametri totali, un modello compatto progettato per leggere alla risoluzione nativa. Il punto di progettazione è che la maggior parte dei modelli di visione riduce le immagini a una griglia fissa e perde i dettagli fini su cui si basano i documenti — quindi North Micro Vision Instruct accetta immagini alla loro risoluzione nativa fino a circa una pagina A4 a 200 dpi, preservando le proporzioni e il testo piccolo. I numeri riportati da Cohere sono solidi per la classe di dimensioni: DocVQA a 0,921, ChartQA a 0,808, OCRBench a 0,792, tutti riportati da Cohere e non riprodotti in modo indipendente, con un contesto multimodale validato di circa 8K token e un punto debole documentato su MMMU (0,329) — a ricordare che è uno specialista nella lettura, non un generalista nel ragionamento. Non ha un'API ospitata propria né un percorso di hosting standard; la realtà pratica è l'auto-hosting di un modello da 2,4B, abbastanza piccolo da girare su una singola GPU per workstation moderna. L'adozione da parte della community è stata costante: la scheda Hugging Face mostrava decine di migliaia di download al mese verso fine agosto.
Il 16B che è una promessa
InternLumina-U2 è un artefatto di tipo diverso. Ciò che lo Shanghai AI Laboratory ha pubblicato il 1° settembre 2026 è codice di inferenza e un'architettura, non un modello: un LLM di diffusione sparse mixture-of-experts, con 16B di parametri totali e 1B attivi, costruito attorno a una rappresentazione visiva completamente discreta a otto codebook. Tra le sei famiglie di task coperte dallo script driver del repository — testo, comprensione delle immagini, text-to-image, editing di immagini, comprensione video, comprensione 3D — la comprensione delle immagini include esplicitamente grafici densi e documenti. La tabella preliminare della pagina del progetto elenca figure su grafici e documenti che il laboratorio riporta nello stesso intervallo dello specialista: ChartQA 86,52, CharXiv-DQ 83,65, insieme a HallusionBench 62,15 e MathVision 33,22. La pagina definisce i risultati "preliminari, parziali", il report tecnico che conterrebbe le tabelle complete è indicato come "coming soon" e — il fatto decisivo — non ci sono pesi con cui chiunque possa verificare.
Il tabellone
Ogni cifra di seguito è dichiarata dal fornitore. Le cifre di North Micro Vision Instruct sono una valutazione di Cohere; quelle di InternLumina-U2 sono la tabella parziale preliminare del laboratorio.
• Dimensioni e forma — North Micro Vision Instruct: ~2,4B denso, lettore a risoluzione nativa. InternLumina-U2: 16B totali / 1B attivo, MoE sparso, modello di diffusione discreto multi-codebook.
• Cosa fa — North Micro Vision Instruct: legge immagini, documenti, grafici e schermate UI; risponde in testo, con grounding. InternLumina-U2: dichiara lettura più generazione — comprende immagini/video/3D, genera e modifica immagini.
• Pesi — North Micro Vision Instruct: pubblici dal 10 agosto 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: non pubblici; stub di Hugging Face vuoto, pesi contrassegnati "in arrivo".
• Punteggi di lettura principali — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (riportati da Cohere). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (riportati dal laboratorio, preliminari).
• Contesto del documento — North Micro Vision Instruct: risoluzione nativa fino a ~A4 a 200 dpi, contesto multimodale validato ~8K. InternLumina-U2: grafici densi e immagini naturali gestiti tramite l'encoder multi-codebook AToken; contesto non ancora specificato.
• Punti deboli noti — North Micro Vision Instruct: MMMU 0.329, nessuna chiamata di strumenti — un lettore, non un ragionatore o un agente. InternLumina-U2: è dietro ad almeno un rivale citato per nome su GenEval (0.81 contro 0.89) nella propria tabella parziale; tutto non verificato.
• Come eseguirlo — North Micro Vision Instruct: esegui in self-host un modello 2.4B; il supporto per vLLM era ancora in fase di integrazione quando questo è stato scritto. InternLumina-U2: nessuno può eseguirlo — non ci sono i pesi, e il driver rilasciato richiede una directory di checkpoint e file tokenizer che non sono nel repository.

Lo stesso benchmark, due epistemologie molto diverse
ChartQA è il modo più pulito per vedere la differenza tra le due affermazioni. Entrambi i modelli riportano un numero ChartQA; North Micro Vision Instruct riporta 0,808 come frazione di accuratezza, e InternLumina-U2 riporta 86,52 come percentuale — lo stesso benchmark, sostanzialmente lo stesso risultato nella fascia tra l'80% e l'86% su scale diverse, a parte le diverse suddivisioni di valutazione e le configurazioni di prompt che rendono insidiose le comparazioni ChartQA tra paper anche quando entrambi i modelli esistono. La differenza epistemica è ciò che conta: lo 0,808 di North Micro Vision Instruct è legato a un artefatto scaricabile, quindi qualsiasi team con una GPU e una serie di grafici può riprodurlo o confutarlo questa settimana. L'86,52 di InternLumina-U2 è legato a una roadmap. Un numero che non puoi verificare è un numero su cui non dovresti basarti — che è esattamente la posizione che il laboratorio stesso riconosce etichettando la sua tabella come preliminare.

The CohereLabs/North-Micro-Vision-Instruct scheda Hugging Face, catturata il 27 agosto 2026 — la descrizione vision-language a risoluzione nativa da 2,4 miliardi di parametri, la licenza Apache-2.0 e i benchmark dichiarati da Cohere per la lettura di documenti.
Leggere, versus leggere e disegnare
Il divario nella filosofia architetturale pesa più del divario nei benchmark. North Micro Vision Instruct è uno specialista di nicchia: legge, e svolge quell'unico compito in modo abbastanza economico da poterlo eseguire su ogni pagina, ogni screenshot, ogni fattura in una pipeline senza tenere d'occhio la bolletta della GPU. È proprio quella convenienza la caratteristica vincente: l'intelligenza documentale su larga scala è un problema di costi tanto quanto di accuratezza. InternLumina-U2 è la scommessa opposta: un enorme modello sparso che cerca di integrare lettura, generazione di immagini, editing di immagini, comprensione video e comprensione 3D in un'unica interfaccia condivisa a token discreti, sulla teoria che comprensione e generazione si rafforzino a vicenda. Se funziona, è una classe diversa di strumento — ma «se funziona» è un'espressione che si fa un bel carico di lavoro, e un diffusion MoE 16B-A1B con un tokenizer personalizzato e un preprocessing 3D renderizzato con Blender non sarà mai il lettore economico e sempre attivo che è uno specialista da 2.4B. Non sono realmente intercambiabili. Sono uno strumento che puoi implementare oggi e una direzione di ricerca per cui puoi prepararti.

Il repository GitHub InternLM/InternLumina-U2, catturato il 2 settembre 2026 — la landing page del repository con la descrizione "Omni-Visual Understanding, Image Generation and Editing" e gli script di inferenza per singola attività; tra questi, il percorso di comprensione delle immagini è quello rivolto a immagini naturali e grafici densi.
Cosa significa se stai costruendo una pipeline di documenti
Nessuno dei due modelli è ospitato su OrcaRouter — {{1}}North Micro Vision Instruct{{/1}} è un modello self-hosted senza API ospitata, e {{2}}InternLumina-U2{{/2}} non ha pesi che qualcuno possa ospitare — quindi l'aspetto routing qui non è "chiamarli entrambi con una sola chiave oggi". È il pattern che useresti il giorno in cui uno dei due cambiasse: una pipeline documentale quasi sempre abbina un lettore economico a un reasoner più grande, e il valore di un layer di routing sta nell'esprimere quell'abbinamento come una sola chiamata e nel mantenere onesto il pass-through a margine zero sui modelli ospitati che usi davvero. Quando finalmente arriva un checkpoint Apache-2.0 come {{2}}InternLumina-U2{{/2}}, la mossa sensata non è smantellare uno stack documentale funzionante — è mettere il nuovo arrivato su un percorso di test dietro un failover automatico, così si guadagna il traffico di produzione sopravvivendogli, e nel momento in cui fallisce su un grafico reale la chiamata ripiega sul modello che si è già dimostrato. Un'unica API su 200+ modelli è il meccanismo; il failover è la rete di sicurezza; lo specialista che puoi eseguire oggi è ciò che paga le bollette mentre la promessa dei 16B è ancora in attesa di essere mantenuta.
Il verdetto
Per la lettura di documenti e grafici nel qui e ora, North Micro Vision Instruct è l'unico dei due a esistere in forma concretamente utilizzabile — piccolo, con licenza Apache-2.0, scaricabile, con punteggi dichiarati dal fornitore che puoi davvero andare a verificare. InternLumina-U2 è l'artefatto più interessante sul lungo termine, perché sta cercando di fare della lettura una delle sei abilità in un unico modello unificato, e se funziona cambierà il significato di “modello di visione”. Osserva la sua repository Hugging Face vuota come guarderesti il conto alla rovescia di un lancio: il giorno in cui appariranno i file safetensors, la promessa diventerà un modello e il confronto diventerà reale. Fino ad allora, non lasciare che un 86,52 dichiarato dal fornitore su un benchmark di grafici abbia più peso di un 0,808 scaricabile nel tuo processo decisionale.
