
PixelUMM vs North Micro Vision Instruct: un modello di ricerca non commerciale contro un lettore da 2,4 miliardi che puoi distribuire
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Metti North Micro Vision Instruct e PixelUMM fianco a fianco e la differenza di dimensioni è quasi una distrazione: 2,4 miliardi di parametri per il lettore a risoluzione nativa di Cohere contro 15,2 miliardi per il modello unificato di NVIDIA. L'asse interessante è l'encoder. North Micro Vision Instruct è costruito in modo convenzionale — un encoder visivo da 400M inizializzato da SigLIP 2 SO400M, che alimenta un modello linguistico da 2B, racchiuso in un vocabolario di 262.144 token e distribuito sotto Apache-2.0. PixelUMM si fonda sull'argomentazione che proprio questa configurazione sia il collo di bottiglia, ed elimina l'encoder: patch di pixel grezze da 16×16 entrano in un backbone Qwen3-8B tramite proiezioni lineari a singolo strato, e gli stessi pesi generano video oltre a rispondere a domande su di essi. Uno è un dispositivo di lettura specializzato che puoi scaricare e implementare oggi. L'altro è una tesi di ricerca con un link per il download e una licenza che lo tiene fuori dai prodotti.
I numeri di entrambi i modelli riportati di seguito provengono dai rispettivi laboratori. Nessuno dei due è stato riprodotto in modo indipendente, e i due pubblicano suite di benchmark diverse, per cui la sovrapposizione è più limitata di quanto non sembri.
Argomenti a favore dell'architettura noiosa
North Micro Vision Instruct è stato pubblicato su Hugging Face il 10 agosto 2026, ha avuto otto settimane per accumulare utenti e all'inizio di ottobre mostrava all'incirca 180.000 download e 150 like — un ordine di grandezza in più di attenzione rispetto al repository di PixelUMM, vecchio di pochi giorni. La sua proposta è specifica e poco appariscente: la maggior parte dei modelli di visione ridimensiona l'immagine a una griglia fissa e perde i dettagli fini da cui dipendono i documenti, quindi questo elabora le immagini alla risoluzione nativa, preservando le proporzioni e il testo di piccole dimensioni.
• Parametri — 2,4B in totale: un modello linguistico da 2B più un encoder visivo da 400M addestrato in modo personalizzato a partire da SigLIP 2 SO400M.
• Contesto — un backbone linguistico da 128K token, ma un intervallo operativo multimodale validato di circa 8K token. La scheda è esplicita sul fatto che i contesti multimodali più lunghi si basano sull'estrapolazione e non sono sottoposti a benchmark.
• Input e output — testo e immagini interlacciati in ingresso, testo in uscita. Multilingue in oltre undici lingue. Nessuna generazione di alcun tipo.
• Punteggi dichiarati — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, tutti dichiarati da Cohere e non riprodotti. MMMU 0.329, che la scheda non nasconde: questo è uno specialista della lettura, non un generalista del ragionamento.
• Distribuzione — Transformers 5.16.0 e un acceleratore, una singola GPU moderna a 2.4B in bfloat16, Flash Attention 2 opzionale anziché obbligatorio.
Nulla di quel design è innovativo. È anche il motivo per cui è possibile scaricarlo, metterlo a punto e impiegarlo su documenti reali questa settimana.

Le argomentazioni contrarie, presentate dall'altra parte
Il preprint di PixelUMM si apre indicando il costo di quell'architettura. Un vision transformer congelato preaddestrato sul web fornisce caratteristiche semantiche per la comprensione; un VAE separato fornisce latenti orientati alla ricostruzione per la generazione; portare entrambi raddoppia all'incirca il contesto visivo per immagine di condizionamento e obbliga a ricostruire le pipeline di preaddestramento visione-linguaggio attorno a un secondo flusso. North Micro Vision Instruct evita il raddoppio solo rifiutando del tutto il secondo compito — non genera, quindi necessita di una sola interfaccia, non due.
PixelUMM porta il ragionamento fino alle sue estreme conseguenze. Nessun encoder, nessun VAE, nessun tokenizer: patch di pixel 16×16 per le immagini, tubelet spazio-temporali di 4 frame per il video, entrambi raggiungono un Transformer solo decoder attraverso proiezioni lineari a singolo strato, con la comprensione affidata al testo autoregressivo e la generazione al flow matching nello spazio dei pixel. Le sue otto sezioni empiriche sono studi di scelte progettuali più che vittorie in classifica — dimensione delle patch, artefatti delle patch, dinamiche di addestramento nello spazio dei pixel rispetto a quello VAE, scaling computazionale — cioè un articolo che si chiede se il paradigma regga, non uno che afferma che abbia già vinto.
• Percorso visivo — North Micro Vision Instruct: encoder visivo preaddestrato da 400M a risoluzione nativa. PixelUMM: nessun encoder; patch grezze attraverso una proiezione lineare.
• Cosa può fare — North Micro Vision Instruct: legge immagini e documenti, risponde in testo, grounding e didascalia. PixelUMM: legge immagini e video, e genera immagini e video di 4 secondi dal testo.
• Scala — 2,4B densi contro circa 15,2B totali su un backbone Qwen3-8B, indicato come "8B MoT" nelle tabelle dello stesso paper.
• Licenza — Apache-2.0 su codice e pesi rispetto ad Apache-2.0 sul codice con la NVIDIA One-Way Noncommercial License sul checkpoint.

Leggere i due tabelloni onestamente
I due modelli pubblicano benchmark diversi e, laddove si sovrappongono, le scale differiscono.
• DocVQA — North Micro Vision Instruct 0.921 come frazione di accuratezza. PixelUMM 90.42 come percentuale. Stesso nome di benchmark, split e configurazioni di prompt diversi, e solo uno dei due dichiara la gestione a risoluzione nativa come motivo.
• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Di nuovo, all'incirca la stessa fascia una volta che si smette di confrontare le stringhe grezze.
• OCRBench — North Micro Vision Instruct 0.792. PixelUMM 78.00.
• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Entrambi bassi secondo gli standard dei grandi modelli visione-linguaggio, ed entrambi i laboratori li riportano senza abbellimenti.
• PixelUMM-only — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 con un riscrittore di prompt, VBench Parte 1 qualità 84.10.
• North Micro Vision Instruct-only — grounding, captioning e attività multi-immagine; un'assenza documentata di chiamata di strumenti e, esplicitamente, nessun comportamento agentico.
La cosa sorprendente della sovrapposizione è quanto uno specialista da 2,4B si avvicini a un generalista da 15,2B nella lettura di documenti e grafici. Non è una prova che l'approccio senza encoder fallisca — è una prova che la lettura di documenti è un compito in cui un encoder compatto a risoluzione nativa è molto adatto, e l'architettura di PixelUMM è orientata a un argomento diverso. Il paper di PixelUMM stesso concede il punto in una frase che vale la pena citare: poiché i dati di addestramento differiscono tra i modelli, i suoi risultati "non possono stabilire quale architettura sia superiore".
Dove la decisione effettivamente si colloca
Se hai documenti, grafici, moduli o screenshot e ti servono risposte entro questo mese, North Micro Vision Instruct è la scelta pratica e non c'è paragone: Apache-2.0, 2.4B, un percorso di caricamento Transformers standard, nessun ambiente guardrail, nessun indice di checkpoint distribuito, nessun secondo stack Python. Se lo fine-tunni sulla tua distribuzione di documenti, ottieni uno specialista. L'avvertenza è l'ambito: puntalo su un compito di ragionamento e il numero MMMU ti troverà.
L'offerta di PixelUMM è l'ampiezza e una domanda di ricerca. Legge e genera, immagini e video, da un unico set di pesi, ed è di gran lunga la lettura più interessante. Ma il suo checkpoint è sotto una licenza non commerciale, i suoi pesi sono 128 shard di checkpoint distribuiti dietro un indice di metadati nascosto per un totale di circa 30 GB, richiede un toolkit CUDA 13 con FlashAttention compilato dal sorgente, e il suo percorso text-to-video esegue le guardrail di Cosmos che richiedono un repository gated e un ambiente separato. Questo è un banco di laboratorio, non un deployment.
L'aspetto del routing arriva più tardi, se arriva. Oggi nessuno dei due modelli è disponibile tramite alcuna API ospitata — OrcaRouter non ne instrada nessuno — e nessuno dei due lo sarà finché le rispettive licenze non lo consentiranno. Quando un modello come North Micro Vision Instruct compare dietro un endpoint condiviso, la ragione per preferirlo a un'integrazione diretta è quella ordinaria: una sola chiave per oltre 200 modelli, i prezzi di listino dei provider trasferiti con markup dello 0%, un failover che retrocede un modello che rende meno di quanto indicato nella sua scheda, e nessun secondo contratto da negoziare quando vuoi fare un test A/B su un sostituto. Questa è una descrizione del flusso di lavoro, non un'affermazione sulla disponibilità.
L'unico test che li distinguerebbe
Esegui entrambi sullo stesso insieme di documenti alla stessa risoluzione e valuta i casi di testo piccolo, poi cambia una variabile: togli l'encoder visivo dal confronto fornendo a PixelUMM i suoi input a risoluzione nativa. Se il modello senza encoder regge sul testo denso a una frazione del costo in parametri, è la prova più forte possibile per la tesi — ed è un test che chiunque abbia una scheda grafica in più può eseguire, perché entrambi i checkpoint si scaricano. Finché qualcuno non lo fa, vale la sintesi pragmatica: un piccolo lettore Apache-2.0 è quello che metti in produzione, e un grande generalista non commerciale è quello che studi.
