Una hero title card per il confronto 'InternLumina-U2 vs North Micro Vision Instruct' con il sottotitolo 'Un lettore di documenti che puoi eseguire oggi vs un 16B che non è ancora disponibile' e tre chip di statistiche — 'North Micro: 2.4B, eseguibile oggi', 'InternLumina-U2: 16B, ancora nessun peso', 'ChartQA 0.808 vs 86.52 (entrambi riportati)' — con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

InternLumina-U2 vs North Micro Vision Instruct: un lettore di documenti che puoi eseguire oggi vs un modello da 16B che non è ancora all'altezza

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Se questa settimana hai bisogno di un modello che legga documenti, screenshot e grafici, questo confronto ha una risposta pratica e breve: North Micro Vision Instruct è un modello open-weight da 2,4 miliardi di parametri di Cohere, rilasciato sotto licenza Apache-2.0, scaricabile dal 10 agosto 2026, e abbastanza valido nei compiti sui documenti da meritare di essere provato oggi sui tuoi file. InternLumina-U2 è il modello di diffusione da 16 miliardi di parametri dello Shanghai AI Laboratory — un progetto molto più ambizioso che dichiara di comprendere anche grafici e documenti, oltre a una mezza dozzina di altri compiti — ma i suoi pesi non sono pubblici, la sua repository Hugging Face è uno stub vuoto, e nessuno, da nessuna parte, può ancora eseguirlo. La risposta più lunga riguarda ciò che accade quando due modelli Apache-2.0 fanno affermazioni sovrapposte sulla lettura, ma solo uno dei due è qualcosa che puoi tenere in mano.

Il 2.4B che esiste realmente

North Micro Vision Instruct è lo specialista della visione nella famiglia North di Cohere: circa 2,4 miliardi di parametri totali, un modello compatto progettato per leggere alla risoluzione nativa. Il punto di progettazione è che la maggior parte dei modelli di visione riduce le immagini a una griglia fissa e perde i dettagli fini su cui si basano i documenti — quindi North Micro Vision Instruct accetta immagini alla loro risoluzione nativa fino a circa una pagina A4 a 200 dpi, preservando le proporzioni e il testo piccolo. I numeri riportati da Cohere sono solidi per la classe di dimensioni: DocVQA a 0,921, ChartQA a 0,808, OCRBench a 0,792, tutti riportati da Cohere e non riprodotti in modo indipendente, con un contesto multimodale validato di circa 8K token e un punto debole documentato su MMMU (0,329) — a ricordare che è uno specialista nella lettura, non un generalista nel ragionamento. Non ha un'API ospitata propria né un percorso di hosting standard; la realtà pratica è l'auto-hosting di un modello da 2,4B, abbastanza piccolo da girare su una singola GPU per workstation moderna. L'adozione da parte della community è stata costante: la scheda Hugging Face mostrava decine di migliaia di download al mese verso fine agosto.

Il 16B che è una promessa

InternLumina-U2 è un artefatto di tipo diverso. Ciò che lo Shanghai AI Laboratory ha pubblicato il 1° settembre 2026 è codice di inferenza e un'architettura, non un modello: un LLM di diffusione sparse mixture-of-experts, con 16B di parametri totali e 1B attivi, costruito attorno a una rappresentazione visiva completamente discreta a otto codebook. Tra le sei famiglie di task coperte dallo script driver del repository — testo, comprensione delle immagini, text-to-image, editing di immagini, comprensione video, comprensione 3D — la comprensione delle immagini include esplicitamente grafici densi e documenti. La tabella preliminare della pagina del progetto elenca figure su grafici e documenti che il laboratorio riporta nello stesso intervallo dello specialista: ChartQA 86,52, CharXiv-DQ 83,65, insieme a HallusionBench 62,15 e MathVision 33,22. La pagina definisce i risultati "preliminari, parziali", il report tecnico che conterrebbe le tabelle complete è indicato come "coming soon" e — il fatto decisivo — non ci sono pesi con cui chiunque possa verificare.

Il tabellone

Ogni cifra di seguito è dichiarata dal fornitore. Le cifre di North Micro Vision Instruct sono una valutazione di Cohere; quelle di InternLumina-U2 sono la tabella parziale preliminare del laboratorio.

• Dimensioni e forma — North Micro Vision Instruct: ~2,4B denso, lettore a risoluzione nativa. InternLumina-U2: 16B totali / 1B attivo, MoE sparso, modello di diffusione discreto multi-codebook.

• Cosa fa — North Micro Vision Instruct: legge immagini, documenti, grafici e schermate UI; risponde in testo, con grounding. InternLumina-U2: dichiara lettura più generazione — comprende immagini/video/3D, genera e modifica immagini.

• Pesi — North Micro Vision Instruct: pubblici dal 10 agosto 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: non pubblici; stub di Hugging Face vuoto, pesi contrassegnati "in arrivo".

• Punteggi di lettura principali — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (riportati da Cohere). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (riportati dal laboratorio, preliminari).

• Contesto del documento — North Micro Vision Instruct: risoluzione nativa fino a ~A4 a 200 dpi, contesto multimodale validato ~8K. InternLumina-U2: grafici densi e immagini naturali gestiti tramite l'encoder multi-codebook AToken; contesto non ancora specificato.

• Punti deboli noti — North Micro Vision Instruct: MMMU 0.329, nessuna chiamata di strumenti — un lettore, non un ragionatore o un agente. InternLumina-U2: è dietro ad almeno un rivale citato per nome su GenEval (0.81 contro 0.89) nella propria tabella parziale; tutto non verificato.

• Come eseguirlo — North Micro Vision Instruct: esegui in self-host un modello 2.4B; il supporto per vLLM era ancora in fase di integrazione quando questo è stato scritto. InternLumina-U2: nessuno può eseguirlo — non ci sono i pesi, e il driver rilasciato richiede una directory di checkpoint e file tokenizer che non sono nel repository.

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Lo stesso benchmark, due epistemologie molto diverse

ChartQA è il modo più pulito per vedere la differenza tra le due affermazioni. Entrambi i modelli riportano un numero ChartQA; North Micro Vision Instruct riporta 0,808 come frazione di accuratezza, e InternLumina-U2 riporta 86,52 come percentuale — lo stesso benchmark, sostanzialmente lo stesso risultato nella fascia tra l'80% e l'86% su scale diverse, a parte le diverse suddivisioni di valutazione e le configurazioni di prompt che rendono insidiose le comparazioni ChartQA tra paper anche quando entrambi i modelli esistono. La differenza epistemica è ciò che conta: lo 0,808 di North Micro Vision Instruct è legato a un artefatto scaricabile, quindi qualsiasi team con una GPU e una serie di grafici può riprodurlo o confutarlo questa settimana. L'86,52 di InternLumina-U2 è legato a una roadmap. Un numero che non puoi verificare è un numero su cui non dovresti basarti — che è esattamente la posizione che il laboratorio stesso riconosce etichettando la sua tabella come preliminare.

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

The CohereLabs/North-Micro-Vision-Instruct scheda Hugging Face, catturata il 27 agosto 2026 — la descrizione vision-language a risoluzione nativa da 2,4 miliardi di parametri, la licenza Apache-2.0 e i benchmark dichiarati da Cohere per la lettura di documenti.

Leggere, versus leggere e disegnare

Il divario nella filosofia architetturale pesa più del divario nei benchmark. North Micro Vision Instruct è uno specialista di nicchia: legge, e svolge quell'unico compito in modo abbastanza economico da poterlo eseguire su ogni pagina, ogni screenshot, ogni fattura in una pipeline senza tenere d'occhio la bolletta della GPU. È proprio quella convenienza la caratteristica vincente: l'intelligenza documentale su larga scala è un problema di costi tanto quanto di accuratezza. InternLumina-U2 è la scommessa opposta: un enorme modello sparso che cerca di integrare lettura, generazione di immagini, editing di immagini, comprensione video e comprensione 3D in un'unica interfaccia condivisa a token discreti, sulla teoria che comprensione e generazione si rafforzino a vicenda. Se funziona, è una classe diversa di strumento — ma «se funziona» è un'espressione che si fa un bel carico di lavoro, e un diffusion MoE 16B-A1B con un tokenizer personalizzato e un preprocessing 3D renderizzato con Blender non sarà mai il lettore economico e sempre attivo che è uno specialista da 2.4B. Non sono realmente intercambiabili. Sono uno strumento che puoi implementare oggi e una direzione di ricerca per cui puoi prepararti.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

Il repository GitHub InternLM/InternLumina-U2, catturato il 2 settembre 2026 — la landing page del repository con la descrizione "Omni-Visual Understanding, Image Generation and Editing" e gli script di inferenza per singola attività; tra questi, il percorso di comprensione delle immagini è quello rivolto a immagini naturali e grafici densi.

Cosa significa se stai costruendo una pipeline di documenti

Nessuno dei due modelli è ospitato su OrcaRouter — {{1}}North Micro Vision Instruct{{/1}} è un modello self-hosted senza API ospitata, e {{2}}InternLumina-U2{{/2}} non ha pesi che qualcuno possa ospitare — quindi l'aspetto routing qui non è "chiamarli entrambi con una sola chiave oggi". È il pattern che useresti il giorno in cui uno dei due cambiasse: una pipeline documentale quasi sempre abbina un lettore economico a un reasoner più grande, e il valore di un layer di routing sta nell'esprimere quell'abbinamento come una sola chiamata e nel mantenere onesto il pass-through a margine zero sui modelli ospitati che usi davvero. Quando finalmente arriva un checkpoint Apache-2.0 come {{2}}InternLumina-U2{{/2}}, la mossa sensata non è smantellare uno stack documentale funzionante — è mettere il nuovo arrivato su un percorso di test dietro un failover automatico, così si guadagna il traffico di produzione sopravvivendogli, e nel momento in cui fallisce su un grafico reale la chiamata ripiega sul modello che si è già dimostrato. Un'unica API su 200+ modelli è il meccanismo; il failover è la rete di sicurezza; lo specialista che puoi eseguire oggi è ciò che paga le bollette mentre la promessa dei 16B è ancora in attesa di essere mantenuta.

Il verdetto

Per la lettura di documenti e grafici nel qui e ora, North Micro Vision Instruct è l'unico dei due a esistere in forma concretamente utilizzabile — piccolo, con licenza Apache-2.0, scaricabile, con punteggi dichiarati dal fornitore che puoi davvero andare a verificare. InternLumina-U2 è l'artefatto più interessante sul lungo termine, perché sta cercando di fare della lettura una delle sei abilità in un unico modello unificato, e se funziona cambierà il significato di “modello di visione”. Osserva la sua repository Hugging Face vuota come guarderesti il conto alla rovescia di un lancio: il giorno in cui appariranno i file safetensors, la promessa diventerà un modello e il confronto diventerà reale. Fino ad allora, non lasciare che un 86,52 dichiarato dal fornitore su un benchmark di grafici abbia più peso di un 0,808 scaricabile nel tuo processo decisionale.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube