
MiniCPM-V 4.7 vs Microsoft Mage-VL: due scommesse molto diverse su quanto dovrebbe costare per fotogramma un modello di visione
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
MiniCPM-V 4.7 e Microsoft Mage-VL sono entrambi modelli vision-language che promettono di farti risparmiare token, e ci arrivano per vie opposte. Mage-VL, rilasciato da Microsoft il 25 luglio 2026, attacca il lato video: prende in prestito la struttura di un codec video, conserva ogni patch dei fotogrammi di ancoraggio e solo le patch dei fotogrammi predetti che contengono movimento reale, e dichiara una riduzione dei token visivi superiore al 75%, con un'accelerazione wall-clock fino a 3,5× rispetto al campionamento uniforme dei fotogrammi. MiniCPM-V 4.7, pubblicato da OpenBMB il 6 ottobre 2026, attacca il lato sequenza: un MoE sparso da 35,2 miliardi di parametri con 30 dei suoi 40 layer su un percorso di attenzione lineare, il che fa crescere lentamente la cache KV lungo un contesto di 256K. Un modello comprime ciò che guarda. L'altro comprime ciò che ricorda. E solo uno dei due include qualcosa che puoi valutare.
Che cosa è ciascuno
Microsoft Mage-VL è un modello di fondazione multimodale codec-native, proactive-streaming, su scala 4B, rilasciato sotto Apache-2.0 con un report tecnico e una sostanziosa sezione di valutazione. È stato costruito deliberatamente contro quello che i suoi autori chiamano un paradosso di Moravec per i VLM — forte nel ragionamento offline, lento nella percezione in tempo reale. L'encoder visivo, Mage-ViT, è addestrato interamente da zero su circa 100 milioni di immagini e video non etichettati, anziché essere inizializzato da un ViT pre-addestrato sul web, e l'unico componente pre-addestrato nello stack è il backbone linguistico Qwen3-4B-Instruct-2507. Il checkpoint completo è un singolo modello unificato che svolge comprensione delle immagini, ragionamento video offline e commento streaming attivato da eventi senza varianti separate, e un microsoft/Mage-ViT rilascio companion fornisce l'encoder da solo. Ha accumulato circa 10.600 download e 420 like dal rilascio.
MiniCPM-V 4.7 è openbmb/MiniCPM-V-4.7-35B-A3B, un checkpoint BF16 da 35.212.875.824 parametri suddiviso in sedici shard per un totale di 70,4 GB, scritto con Transformers 5.2.0 e caricato il 6 ottobre 2026 senza scheda del modello.

La sua configurazione testuale è contrassegnata come qwen3_5_moe_text con 256 esperti e 8 attivi per token; il suo array layer_types esegue tre livelli di attenzione lineare per ogni livello di attenzione completa su 40 livelli; la sua torre di visione è la minicpmv4_7_vision interna a 27 livelli con downsampling 16× e fino a nove sezioni di immagine. Il contesto è 256K. Il repository ha zero download, tre like, nessun benchmark e nessuna licenza.
Le sei righe che un lettore può controllare
Le stesse sei dimensioni, su entrambi i lati. Dove un numero non esiste, la lacuna viene lasciata visibile.
• Parametri — Mage-VL: 4,74B, denso, tutti attivi per token. MiniCPM-V 4.7: 35,2B totali, sparso, 8 esperti su 256 per token. Il numero di MiniCPM non è commensurabile con quello di un modello denso.
• Licenza — Mage-VL: Apache-2.0, dichiarato nella scheda e nei tag del repository. MiniCPM-V 4.7: nulla dichiarato.
• Da dove derivano i risparmi di token — Mage-VL: sparsità dei token visivi a livello dell'encoder, allineata al codec, con una riduzione dichiarata superiore al 75%. MiniCPM-V 4.7: attenzione lineare nel decoder, che riduce la crescita della KV-cache sulle sequenze lunghe ma non riduce i token che gli fornisci.
• Contesto — Mage-VL: addestrato attraverso una fase a contesto lungo su 350K video come finestre codec scorrevoli fino a 384 o 768 frame. MiniCPM-V 4.7: max_position_embeddings: 262144.
• Encoder visivo: da zero su 100M di esempi non etichettati: il modello riporta 85% su 256 token con budget di 256 token. MiniCPM-V 4.7: torre di derivazione dal design di MiniCPM-V con la stessa forma a 1152 hidden e 27 layer, con un downsample 16x predefinito.
• Prove — Mage-VL: una scheda completa con DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-B-3D 94,75 e un divario CrossPoint di +53,1 rispetto a Qwen3-VL-4B, tutti riportati dal fornitore rispetto a un backbone corrispondente. MiniCPM-V 4.7: nessuna.
• Comportamento in streaming — Mage-VL: un gate cognitivo che valuta ogni finestra scorrevole e rimane silenzioso finché un evento non si conclude, addestrato su ~3,3 M di campioni in streaming. MiniCPM-V 4.7: non descritto da nessuna parte.

L'aspetto che tutti fraintendono dei numeri di Mage-VL
Le tabelle di benchmark della scheda Mage-VL sono solide, e quelle più solide sono anche le più facilmente fraintese. Le righe di confronto mettono Mage-VL-4B contro Qwen3-VL-4B, Phi-4-Multimodal-Instruct e Phi-4-Reasoning-Vision, e i guadagni principali — +22,5 su QVHighlight, +24,5 su VideoEval-Pro, +53,1 su CrossPoint — sono reali nel senso che compaiono nelle tabelle del fornitore. Sono anche misurazioni del fornitore stesso, prodotte dal team che ha addestrato il modello, sullo stesso harness. Nessuna parte indipendente le ha riprodotte. È normale per un modello di quattro mesi e non è un demerito, ma significa che il verbo corretto è «riporta», non «ottiene».
Due cose meritano credito al di là delle tabelle. In primo luogo, il design a backbone appaiato — mantenere fisso il decoder Qwen3-4B e sostituire solo il ViT — è una prova più pulita di una posizione in classifica, perché isola lo stack visivo anziché l'intero sistema. In secondo luogo, il corpus di addestramento per Mage-ViT è di circa 100M di frame non etichettati rispetto ai miliardi di coppie immagine-testo che gli encoder preaddestrati sul web usano, quindi eguagliare il comportamento della classe SigLIP2-at-10B sulla discriminazione di cluster è un'affermazione specifica e verificabile sull'efficienza dei dati, anziché un vanto generico.
MiniCPM-V 4.7 non ha nulla di tutto questo. Non una versione più debole — nulla.

Non esiste alcuna tabella, di fornitore o di altro tipo, e il file di configurazione che descrive l'architettura si esclude esplicitamente dal dire qualsiasi cosa sull'accuratezza.
Architettura: due risposte alla stessa domanda
Entrambi i modelli stanno cercando di rispondere a "come rendere economica l'inferenza multimodale", e il contrasto è istruttivo perché le due risposte si compongono anziché competere.
Mage-VL riduce l'input. La sua 16×16 griglia di patch è condivisa tra frame anchor e frame previsti, e i frame previsti contribuiscono con patch solo dove il codec spende bit — cioè dove si trovano il movimento e i nuovi dettagli. Il risultato sono flussi di token a lunghezza variabile per frame, motivo per cui lo stack necessita di un proiettore in grado di passare una sequenza variabile a un decoder causale, e per cui la stessa interfaccia può accettare vettori di movimento H.264/HEVC o la mappa di bitrate appresa di un codec neurale senza riaddestramento. Poi una codifica rotativa 3D mantiene coerenti le posizioni spazio-temporali attraverso la sparsità. Il budget di token è la quantità che viene gestita.
MiniCPM-V 4.7 riduce lo stato. I suoi livelli di attenzione lineare mantengono uno stato ricorrente di dimensione fissa invece di una cache key-value in crescita, così il costo di memoria di una lunga conversazione smette di crescere linearmente con il numero di token. Il suo budget di sequenza è la quantità gestita, e il contesto da 256K è il guadagno. In particolare, la configurazione di MiniCPM-V 4.7 pubblicizza il downsampling visivo 16x — comprime anche l'input — ma tace sul fatto che mantenga o meno la modalità 4x commutabile che MiniCPM-V 4.6 esponeva.
In parole povere: il trucco di Mage-VL ripaga sui video, dove la maggior parte dei fotogrammi è quasi identica a quelli vicini. Il trucco di MiniCPM-V 4.7 ripaga su documenti lunghi e sessioni multi-turno lunghe, dove i token si accumulano. Una pipeline che acquisisce un flusso in diretta e poi intrattiene una lunga conversazione al riguardo trarrebbe beneficio da entrambi, e nessuno dei due modelli svolge ancora il compito dell'altro.
Integrandoli in un flusso di lavoro reale
Mage-VL è pratico da provare oggi: un checkpoint, un'architettura documentata, Apache-2.0 e una scheda che ti dice cosa include il repository. È disponibile da luglio e gli strumenti che lo circondano hanno avuto il tempo di stabilizzarsi.
MiniCPM-V 4.7 non è pratico da provare oggi, per i motivi noiosi. 70 GB in BF16 senza quantizzazione significano memoria dell'acceleratore che probabilmente non hai libera, e l'assenza di una licenza significa che resta aperta la questione se sia possibile usarlo. I percorsi di codice personalizzati richiedono trust_remote_code, e non è testato se la combinazione MoE più linear attention abbia kernel nel tuo stack di serving.
Ciò che vale per entrambi è che un modello di visione self-hosted è una componente di un sistema che deve anche chiamare modelli di frontiera. Ecco perché conviene mettere la metà ospitata dietro un unico router anziché un secondo contratto e un secondo SDK: OrcaRouter raggiunge oltre 200 modelli con una sola chiave, applica il prezzo di listino di ciascun provider senza alcun ricarico aggiunto da noi, ed esegue automaticamente il failover quando un provider peggiora. Né Mage-VL né MiniCPM-V 4.7 è un modello ospitato su quel servizio — entrambi sono pesi che servi tu stesso — quindi consideralo come il plumbing dall'altro lato del passaggio di consegne, non come un canale di disponibilità per nessuno dei due modelli.
Verdetto
Mage-VL è un modello completo, con licenza e con benchmark alle spalle, dotato di una filosofia di progettazione specifica e ben argomentata, e la sua tesi si fonda sullo streaming video e sul ragionamento spaziale, dove il suo encoder nativo per codec fa qualcosa di strutturalmente diverso da tutti gli altri. MiniCPM-V 4.7 è un checkpoint più grande, senza licenza e non misurato, la cui filosofia di progettazione è leggibile ma il cui comportamento è un'incognita totale. Su tutto ciò su cui un lettore può agire oggi, Mage-VL vince di default — non perché sia migliore, ma perché è l'unico dei due che possa essere minimamente giudicato. Riprendi in esame questo confronto quando apparirà il README di MiniCPM-V 4.7; se quel giorno porterà benchmark e una licenza, la domanda interessante sarà se un MoE con attenzione lineare e contesto da 256K batte un encoder di sparsità nativo per codec sui video lunghi, e quella è una sfida davvero aperta.
