
MiniCPM-V 4.7 vs North Micro Vision Instruct: Cohere ha distribuito un modello documentato da 2,4B; OpenBMB ha distribuito un vuoto da 70 GB
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
MiniCPM-V 4.7 e North Micro Vision Instruct sono entrambe risposte di piccoli laboratori allo stesso incarico — un modello visione-linguaggio compatto che puoi mettere a punto e distribuire da solo — ma solo uno dei due è completo. North Micro Vision Instruct di Cohere è arrivato il 10 agosto 2026 come modello a risoluzione nativa da 2,4 miliardi di parametri con licenza Apache-2.0, con un post tecnico sul blog che ne spiega l'architettura e una scheda che elenca a cosa serve. MiniCPM-V 4.7 è arrivato il 6 ottobre 2026 come checkpoint sparse mixture-of-experts da 35,2 miliardi di parametri con sedici shard, nessun README, nessun campo di licenza e nessun benchmark di alcun tipo. Il confronto interessante non è "quale sia più intelligente". È che le due release rappresentano atteggiamenti opposti verso la comunità che deve usarli.
Le due release, e ciò che è stato distribuito con ciascuna
North Micro Vision Instruct è un modello visione-linguaggio open-weight da 2,4B di CohereLabs, rilasciato con licenza Apache-2.0. È esplicitamente posizionato come una base compatta per la prototipazione, il fine-tuning specifico per attività e il lavoro multimodale specializzato. La sua caratteristica distintiva è l'elaborazione nativa delle immagini a risoluzione originale, che preserva i rapporti d'aspetto e i dettagli visivi fini anziché ricampionare su una griglia fissa, e la scheda dichiara capacità in VQA, didascalizzazione, grounding, OCR, grafici e documenti. Supporta più immagini per conversazione e undici lingue — inglese, tedesco, francese, spagnolo, italiano, portoghese, hindi, giapponese, coreano, cinese e arabo. I pesi del modello sono 2.484.847.856 parametri in BF16 e, dal rilascio, la comunità MLX ha prodotto conversioni a 4 bit, 5 bit, 6 bit, 8 bit, mxfp8, mxfp4, nvfp4 e bf16, che è l'aspetto che ha un sano rilascio di un modello piccolo dopo un paio di mesi. Ha circa 166.500 download e 150 like.
MiniCPM-V 4.7 è openbmb/MiniCPM-V-4.7-35B-A3B: 35.212.875.824 parametri in BF16, 70,4 GB distribuiti su sedici shard safetensors, classe MiniCPMV4_7ForConditionalGeneration, salvato da Transformers 5.2.0 e caricato il 6 ottobre 2026.

Il suo backbone testuale è un MoE sparso derivato da Qwen3.5 — 256 esperti, 8 selezionati per token — con 40 layer che seguono un pattern di attenzione fisso da tre lineari a uno full, contesto da 256K e una torre di visione interna da 27 layer con downsampling 16×. Non esiste una model card. Il repository conta tre like e nessun download.
Fianco a fianco, sulle sei cose che contano
• Parametri — North Micro Vision Instruct: 2,48B densi, ogni parametro attivo per token. MiniCPM-V 4.7: 35,2B in totale, 8 su 256 sparsi. Non è un numero confrontabile a parità di condizioni.
• Licenza — North Micro Vision Instruct: Apache-2.0, etichettata e dichiarata. MiniCPM-V 4.7: nessuna dichiarata, il che per impostazione predefinita comporta tutti i diritti riservati.
• Superficie di fine-tuning — North Micro Vision Instruct: progettato esplicitamente come base per il fine-tuning specifico per attività, con quantizzazioni della community già disponibili. MiniCPM-V 4.7: un checkpoint BF16 da 70 GB senza quantizzazioni e senza ricetta di addestramento dichiarata.
• Gestione della risoluzione — North Micro Vision Instruct: risoluzione nativa, preservando le proporzioni. MiniCPM-V 4.7: downsample_mode: "16x" con max_slice_nums: 9, un percorso ad alta risoluzione basato su slicer.
• Copertura linguistica — North Micro Vision Instruct: undici lingue elencate sulla scheda. MiniCPM-V 4.7: non dichiarato da nessuna parte.
• Contesto — North Micro Vision Instruct: dimensionato per la sua classe di deployment da 2,4B. MiniCPM-V 4.7: max_position_embeddings: 262144, 256K.
• Prove di qualità — North Micro Vision Instruct: una scheda pubblicata, un post tecnico su blog, conversioni della community e ampia adozione. MiniCPM-V 4.7: nulla da citare.

L'asimmetria che rende questo confronto sbilanciato
C'è un tipo particolare di articolo comparativo che sarebbe facile scrivere qui: prendere i numeri di MiniCPM-V 4.6 dal GitHub di OpenBMB, notare che battono la classe equivalente di modelli piccoli e lasciare intendere che il 4.7 li erediti. Sarebbe disonesto, e vale la pena enunciare con precisione il motivo. MiniCPM-V 4.7 non è una versione più grande del 4.6. Abbandona il backbone denso da 1,3B Qwen3.5-0.8B per un Qwen-MoE sparso da 35B, cambia il pattern di attenzione in 3:1 lineare-completo e imposta a 16x la compressione visiva predefinita. Ognuno di questi è un cambiamento alla parte del modello che determina l'accuratezza. La discendenza di famiglia non è un benchmark.
L'altra direzione della disonestà è più sottile: trattare l'assenza di una scheda come prova di un problema. Non lo è. OpenBMB ha rilasciato nove generazioni di MiniCPM-V dal 2024, diverse delle quali davvero eccellenti per le loro dimensioni, e una finestra di dodici minuti tra la creazione del repository e l'ultimo commit è l'aspetto di un artefatto preparato e poi pubblicato, non il comportamento di uno rotto. La corretta interpretazione di MiniCPM-V 4.7 è "sconosciuto", e sconosciuto è una cosa distinta da "cattivo".
Il lato di Cohere ha i propri requisiti di onestà.

Le dichiarazioni sulla qualità della scheda North Micro Vision sono misurazioni di Cohere stessa, e l'analisi tecnica approfondita è scritta dallo stesso team. Il fatto che la community abbia creato sedici quantizzazioni MLX nel giro di pochi giorni è una prova di adozione, non una prova di accuratezza — le persone convertono i modelli facili da convertire, e un rilascio pulito da 2,4B con licenza Apache-2.0 è facile da convertire. Né il numero di download né la diffusione delle quantizzazioni dovrebbero essere interpretati come un punteggio.
A cosa serve ciascuno
North Micro Vision Instruct è un obiettivo di fine-tuning. Questo è l'intero brief di progettazione, espresso con le parole della scheda stessa: una base compatta per la prototipazione e le applicazioni specializzate. Se hai un compito ristretto di analisi di documenti, estrazione di grafici o didascalizzazione multilingue e alcuni esempi etichettati, un modello da 2,4B Apache-2.0 con input a risoluzione nativa e otto o più quantizzazioni è un punto di partenza sensato, e quando funziona puoi spostarlo su un dispositivo edge o su una singola GPU di fascia media.
MiniCPM-V 4.7, se si rivelerà utilizzabile, non è questo. A 70 GB non quantizzato è un modello per server, e le sue caratteristiche distintive — una finestra da 256K e l'attenzione lineare che mantiene piatta la cache KV — puntano a carichi di lavoro multimodali a contesto lungo: trascrizioni video di un'ora, grandi insiemi di documenti, analisi multi-turno estese con immagini nella cronologia. Questi sono carichi di lavoro reali, e l'architettura è una scommessa ragionevole su di essi. La scommessa, però, non è ancora stata valutata.
C'è una sfumatura sulle due strategie di compressione che vale la pena tenere a mente. La risoluzione nativa e il downsampling 16× non sono semplicemente l'una migliore e l'altra peggiore. Un encoder a risoluzione nativa spende token per preservare i dettagli fini, che è ciò di cui hanno bisogno l'OCR e il grounding. Un downsampling 16× spende meno token e rischia di perdere proprio quei dettagli. Quale sia giusto dipende dal fatto che il tuo compito sia leggere un modulo denso o descrivere una scena, e la modalità commutabile 4x/16x di MiniCPM-V 4.6 esisteva proprio perché la risposta cambia a seconda del compito. Se 4.7 abbia mantenuto o meno quell'interruttore è una delle cose che la configurazione non dice.
Dove un router è adatto, e dove no
Entrambi questi modelli sono pesi che servi tu stesso. Né North Micro Vision Instruct né MiniCPM-V 4.7 è un modello ospitato su OrcaRouter, e nulla di quanto detto qui deve essere interpretato come un'affermazione in tal senso. La questione del routing entra in gioco un passo più avanti, quando il piccolo modello self-hosted svolge il lavoro di routine e qualcosa di più grande deve gestire i casi in cui fallisce. È proprio per questo passaggio di consegne che serve un router a chiave singola — oltre 200 modelli tra diversi provider, ciascuno al suo prezzo di listino senza alcun ricarico aggiunto da parte nostra, con failover automatico quando un provider si degrada — e vale la pena avere l'interfaccia già definita prima di averne bisogno, perché il giorno in cui la tua valutazione di 4.7 avrà successo è il giorno in cui vorrai un secondo endpoint senza un secondo contratto.
Il verdetto, e cosa lo cambierebbe
Cohere ha rilasciato un modello. OpenBMB ha rilasciato un checkpoint. Su ogni asse su cui un lettore può agire — licenza, chiarezza della licenza, comportamento documentato, prontezza per il fine-tuning, quantizzazione, copertura linguistica — North Micro Vision Instruct è la risposta oggi, e non c'è partita. Non è un'affermazione sulla capacità, perché nessun confronto di capacità è possibile. MiniCPM-V 4.7 ha all'incirca dieci volte il numero di parametri del modello con cui viene confrontato e non ha pubblicato nulla per giustificare o confutare quella dimensione. La posizione onesta è trattarlo come in sospeso: un artefatto reale di un laboratorio con un track record reale, che giace in un repository a cui manca un file che cambierebbe tutto — il README.
