
MiniCPM-V 4.7 vs Microsoft Mage-VL: Duas apostas muito diferentes sobre quanto um modelo de visão deve custar por quadro
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O MiniCPM-V 4.7 e o Microsoft Mage-VL são ambos modelos de visão-linguagem que afirmam economizar seus tokens, e chegam lá por caminhos opostos. O Mage-VL, lançado pela Microsoft em 25 de julho de 2026, ataca o lado do vídeo: ele empresta a estrutura de um codec de vídeo, mantém todos os patches do quadro-âncora e apenas os patches dos quadros previstos que carregam movimento real, e afirma uma redução de tokens visuais de mais de 75%, com uma aceleração de tempo real de até 3,5× em relação à amostragem uniforme de quadros. O MiniCPM-V 4.7, publicado pela OpenBMB em 6 de outubro de 2026, ataca o lado da sequência: um MoE esparso de 35,2 bilhões de parâmetros, com 30 de suas 40 camadas em um caminho de atenção linear, o que faz o cache KV crescer lentamente ao longo de um contexto de 256K. Um modelo comprime aquilo que olha. O outro comprime aquilo que lembra. E apenas um deles vem com algo que você pode avaliar.
O que cada um é
O Microsoft Mage-VL é um modelo de base multimodal nativo de codec e com streaming proativo, em escala de 4B, lançado sob Apache-2.0 com um relatório técnico e uma seção de avaliação substancial. Ele foi construído deliberadamente em oposição ao que seus autores chamam de paradoxo de Moravec para VLMs — forte no raciocínio offline, lento na percepção em tempo real. O codificador visual, Mage-ViT, é treinado inteiramente do zero em aproximadamente 100 milhões de imagens e vídeos não rotulados, em vez de ser inicializado a partir de um ViT pré-treinado na web, e o único componente pré-treinado na pilha é o backbone de linguagem Qwen3-4B-Instruct-2507. O checkpoint completo é um único modelo unificado que realiza compreensão de imagens, raciocínio offline em vídeo e comentários em streaming acionados por eventos sem variantes separadas, e um microsoft/Mage-ViT lançamento complementar fornece o codificador por si só. Ele acumulou cerca de 10.600 downloads e 420 curtidas desde o lançamento.
MiniCPM-V 4.7 é openbmb/MiniCPM-V-4.7-35B-A3B, um checkpoint BF16 de 35.212.875.824 parâmetros em dezesseis shards totalizando 70,4 GB, escrito pelo Transformers 5.2.0 e enviado em 6 de outubro de 2026 sem cartão de modelo.

A sua configuração de texto está marcada como qwen3_5_moe_text com 256 especialistas e 8 ativos por token; o seu layer_types array alterna três camadas de atenção linear para cada camada de atenção completa ao longo de 40 camadas; a sua torre de visão é a minicpmv4_7_vision interna, com 27 camadas, com downsampling de 16× e até nove fatias de imagem. O contexto é de 256K. O repositório tem zero downloads, três gostos, nenhum benchmark e nenhuma licença.
As seis linhas que um leitor pode verificar
As mesmas seis dimensões, em ambos os lados. Onde um número não existe, a lacuna é deixada visível.
• Parâmetros — Mage-VL: 4,74B, denso, todos ativos por token. MiniCPM-V 4.7: 35,2B no total, esparso, 8 de 256 especialistas por token. O número do MiniCPM não é comensurável com o de um modelo denso.
• Licença — Mage-VL: Apache-2.0, indicado no card e nas tags do repositório. MiniCPM-V 4.7: nada declarado.
• De onde vêm as economias de tokens — Mage-VL: esparsidade de tokens visuais no codificador, alinhada ao codec, com redução alegada de mais de 75%. MiniCPM-V 4.7: atenção linear no decodificador, que diminui o crescimento do cache KV em sequências longas, mas não reduz os tokens que você fornece a ele.
• Contexto — Mage-VL: treinado por meio de um estágio de contexto longo em 350 mil vídeos como janelas de codec deslizantes de até 384 ou 768 quadros. MiniCPM-V 4.7: max_position_embeddings: 262144.
• Proveniência do codificador de visão — Mage-VL: do zero, treinado em ~100M quadros não rotulados; o card reporta 85,69% no ImageNet com 256 tokens e melhoria monotônica com o orçamento de tokens. MiniCPM-V 4.7: torre de linhagem reutilizada do design do MiniCPM-V 4.6 com a mesma forma de 1152 de dimensão oculta e 27 camadas, com um downsample padrão de 16x.
• Evidência — Mage-VL: uma ficha completa com DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-Bench-3D 94,75 e uma diferença de +53,1 no CrossPoint em relação ao Qwen3-VL-4B, todos relatados pelo fornecedor em relação a um backbone correspondente. MiniCPM-V 4.7: nenhuma.
• Comportamento de streaming — Mage-VL: um portão cognitivo que pontua cada janela deslizante e permanece silencioso até que um evento seja concluído, treinado em ~3,3M de amostras de streaming. MiniCPM-V 4.7: não descrito em lugar nenhum.

The part everyone gets wrong about Mage-VL's numbers
As tabelas de benchmark da ficha do Mage-VL são fortes, e as mais fortes são também as mais facilmente mal interpretadas. As linhas de comparação colocam o Mage-VL-4B frente a frente com o Qwen3-VL-4B, o Phi-4-Multimodal-Instruct e o Phi-4-Reasoning-Vision, e os ganhos em destaque — +22,5 em QVHighlight, +24,5 em VideoEval-Pro, +53,1 em CrossPoint — são reais no sentido de que aparecem nas tabelas do fornecedor. Também são medições do próprio fornecedor, produzidas pela equipa que treinou o modelo, na mesma estrutura de avaliação. Nenhuma entidade independente as reproduziu. Isso é normal para um modelo com quatro meses e não é um demérito para ele, mas significa que o verbo correto é "relata", não "pontua".
Duas coisas merecem crédito além das tabelas. Primeiro, o design de backbone emparelhado — manter o decodificador Qwen3-4B fixo e trocar apenas o ViT — é uma evidência mais limpa do que uma posição em um leaderboard, porque isola a pilha visual em vez de todo o sistema. Segundo, o corpus de treinamento do Mage-ViT tem cerca de 100 milhões de frames não rotulados, em comparação com os bilhões de pares imagem-texto que os encoders pré-treinados na web usam, de modo que igualar o comportamento do SigLIP2 na classe de 10B em discriminação de clusters é uma alegação específica e verificável sobre eficiência de dados, e não uma vanglória genérica.
O MiniCPM-V 4.7 não tem nada disso. Não uma versão mais fraca — nada.

Não há tabela alguma, de fornecedor ou de qualquer outra natureza, e o arquivo de configuração que descreve a arquitetura exclui explicitamente a si mesmo de dizer qualquer coisa sobre precisão.
Arquitetura: duas respostas para o mesmo
Ambos os modelos estão tentando responder "como tornar a inferência multimodal barata", e o contraste é instrutivo porque as duas respostas se compõem em vez de competir.
O Mage-VL reduz a entrada. A sua 16×16 grelha de patches é partilhada entre o frame âncora e os frames previstos, e os frames previstos só contribuem com patches onde o codec está a gastar bits — que é onde estão o movimento e os novos detalhes. O resultado são fluxos de tokens de comprimento variável por frame, e é por isso que a pilha precisa de um projetor capaz de entregar uma sequência variável a um descodificador causal, e por que a mesma interface pode aceitar vetores de movimento H.264/HEVC ou um mapa de taxa aprendido de um codec neural sem retreino. Depois, uma codificação rotativa 3D mantém as posições espaciotemporais coerentes ao longo da esparsidade. O orçamento de tokens é a quantidade que está a ser gerida.
O MiniCPM-V 4.7 reduz o estado. Suas camadas de atenção linear mantêm um estado recorrente de tamanho fixo em vez de um cache de chave-valor crescente, de modo que o custo de memória de uma conversa longa deixa de escalar linearmente com a contagem de tokens. Seu orçamento de sequência é a quantidade gerenciada, e o contexto de 256K é o ganho. Notavelmente, a configuração do MiniCPM-V 4.7 anuncia a subamostragem visual de 16x — ele também comprime a entrada —, mas não diz se mantém o modo 4x alternável que o MiniCPM-V 4.6 expôs.
Em termos simples: o truque do Mage-VL compensa em vídeo, onde a maioria dos quadros é quase idêntica aos seus vizinhos. O truque do MiniCPM-V 4.7 compensa em documentos longos e sessões longas de múltiplos turnos, onde os tokens se acumulam. Um pipeline que ingere um fluxo ao vivo e depois mantém uma longa conversa sobre ele se beneficiaria de ambos, e nenhum dos modelos ainda faz o trabalho do outro.
Servindo-os em um fluxo de trabalho real
O Mage-VL é prático de experimentar hoje: um checkpoint, uma arquitetura documentada, Apache-2.0 e um card que informa o que o repositório inclui. Ele está disponível desde julho e as ferramentas em torno dele já tiveram tempo de se estabilizar.
O MiniCPM-V 4.7 não é prático de testar hoje, por motivos entediantes. 70 GB em BF16 sem quantização significa memória de acelerador que você provavelmente não tem disponível, e uma licença ausente significa que a questão de saber se você pode sequer usá-lo permanece em aberto. Os caminhos de código personalizados exigem trust_remote_code, e se a combinação de MoE com atenção linear tem kernels na sua stack de serving não foi testado.
O que é verdade para ambos é que um modelo de visão auto-hospedado é um componente de um sistema que também precisa chamar modelos de fronteira. É o caso de colocar a metade hospedada atrás de um único roteador, em vez de um segundo contrato e um segundo SDK: O OrcaRouter alcança mais de 200 modelos com uma única chave, repassa o preço de tabela de cada provedor sem qualquer margem adicionada por nós e faz failover automaticamente quando um provedor degrada. Nem o Mage-VL nem o MiniCPM-V 4.7 é um modelo hospedado nesse serviço — ambos são pesos que você mesmo serve —, então encare isto como a infraestrutura do outro lado da transferência, e não como um canal de disponibilidade para qualquer um dos modelos.
Veredito
O Mage-VL é um modelo finalizado, licenciado e avaliado por benchmarks, com uma filosofia de design específica e bem fundamentada, e o argumento a seu favor assenta em streaming de vídeo e raciocínio espacial, onde o seu codificador nativo de codec faz algo estruturalmente diferente de todos os outros. O MiniCPM-V 4.7 é um checkpoint maior, não licenciado e não medido, cuja filosofia de design é inteligível, mas cujo comportamento é uma incógnita. Em tudo aquilo sobre o que um leitor pode agir hoje, o Mage-VL vence por predefinição — não porque seja melhor, mas porque é o único dos dois que pode sequer ser avaliado. Volte a esta comparação quando o README do MiniCPM-V 4.7 aparecer; se esse dia trouxer benchmarks e uma licença, a questão interessante será se um MoE de atenção linear com contexto de 256K supera um codificador de esparsidade nativo de codec em vídeo longo, e essa é uma disputa genuinamente em aberto.
