Um cartão de título principal gerado para 'MiniCPM-V 4.7 vs Microsoft Mage-VL' com o subtítulo 'Duas formas de reduzir o custo de assistir a vídeo', um cartão à esquerda com o texto 'Mage-VL: esparsidade de tokens nativa do codec, 75% menos tokens visuais', um cartão à direita com o texto 'MiniCPM-V 4.7: atenção linear, cache KV constante acima de 256K' e uma pílula com o texto 'Comprima a entrada, ou comprima o estado', com o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

MiniCPM-V 4.7 vs Microsoft Mage-VL: Duas apostas muito diferentes sobre quanto um modelo de visão deve custar por quadro

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O MiniCPM-V 4.7 e o Microsoft Mage-VL são ambos modelos de visão-linguagem que afirmam economizar seus tokens, e chegam lá por caminhos opostos. O Mage-VL, lançado pela Microsoft em 25 de julho de 2026, ataca o lado do vídeo: ele empresta a estrutura de um codec de vídeo, mantém todos os patches do quadro-âncora e apenas os patches dos quadros previstos que carregam movimento real, e afirma uma redução de tokens visuais de mais de 75%, com uma aceleração de tempo real de até 3,5× em relação à amostragem uniforme de quadros. O MiniCPM-V 4.7, publicado pela OpenBMB em 6 de outubro de 2026, ataca o lado da sequência: um MoE esparso de 35,2 bilhões de parâmetros, com 30 de suas 40 camadas em um caminho de atenção linear, o que faz o cache KV crescer lentamente ao longo de um contexto de 256K. Um modelo comprime aquilo que olha. O outro comprime aquilo que lembra. E apenas um deles vem com algo que você pode avaliar.

O que cada um é

O Microsoft Mage-VL é um modelo de base multimodal nativo de codec e com streaming proativo, em escala de 4B, lançado sob Apache-2.0 com um relatório técnico e uma seção de avaliação substancial. Ele foi construído deliberadamente em oposição ao que seus autores chamam de paradoxo de Moravec para VLMs — forte no raciocínio offline, lento na percepção em tempo real. O codificador visual, Mage-ViT, é treinado inteiramente do zero em aproximadamente 100 milhões de imagens e vídeos não rotulados, em vez de ser inicializado a partir de um ViT pré-treinado na web, e o único componente pré-treinado na pilha é o backbone de linguagem Qwen3-4B-Instruct-2507. O checkpoint completo é um único modelo unificado que realiza compreensão de imagens, raciocínio offline em vídeo e comentários em streaming acionados por eventos sem variantes separadas, e um microsoft/Mage-ViT lançamento complementar fornece o codificador por si só. Ele acumulou cerca de 10.600 downloads e 420 curtidas desde o lançamento.

MiniCPM-V 4.7 é openbmb/MiniCPM-V-4.7-35B-A3B, um checkpoint BF16 de 35.212.875.824 parâmetros em dezesseis shards totalizando 70,4 GB, escrito pelo Transformers 5.2.0 e enviado em 6 de outubro de 2026 sem cartão de modelo.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs Microsoft Mage-VL — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Token savings linear attention, Context 256K, Vision 16x downsample, Evidence no card no benchmarks. Right column 'Mage-VL' lists Parameters 4.74B dense, Licence Apache-2.0, Token savings 75% fewer visual tokens, Context up to 768 frame windows, Vision from-scratch Codec-ViT, Evidence full card with tables. The footer reads 'Mage-VL figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

A sua configuração de texto está marcada como qwen3_5_moe_text com 256 especialistas e 8 ativos por token; o seu layer_types array alterna três camadas de atenção linear para cada camada de atenção completa ao longo de 40 camadas; a sua torre de visão é a minicpmv4_7_vision interna, com 27 camadas, com downsampling de 16× e até nove fatias de imagem. O contexto é de 256K. O repositório tem zero downloads, três gostos, nenhum benchmark e nenhuma licença.

As seis linhas que um leitor pode verificar

As mesmas seis dimensões, em ambos os lados. Onde um número não existe, a lacuna é deixada visível.

• Parâmetros — Mage-VL: 4,74B, denso, todos ativos por token. MiniCPM-V 4.7: 35,2B no total, esparso, 8 de 256 especialistas por token. O número do MiniCPM não é comensurável com o de um modelo denso.

• Licença — Mage-VL: Apache-2.0, indicado no card e nas tags do repositório. MiniCPM-V 4.7: nada declarado.

• De onde vêm as economias de tokens — Mage-VL: esparsidade de tokens visuais no codificador, alinhada ao codec, com redução alegada de mais de 75%. MiniCPM-V 4.7: atenção linear no decodificador, que diminui o crescimento do cache KV em sequências longas, mas não reduz os tokens que você fornece a ele.

• Contexto — Mage-VL: treinado por meio de um estágio de contexto longo em 350 mil vídeos como janelas de codec deslizantes de até 384 ou 768 quadros. MiniCPM-V 4.7: max_position_embeddings: 262144.

• Proveniência do codificador de visão — Mage-VL: do zero, treinado em ~100M quadros não rotulados; o card reporta 85,69% no ImageNet com 256 tokens e melhoria monotônica com o orçamento de tokens. MiniCPM-V 4.7: torre de linhagem reutilizada do design do MiniCPM-V 4.6 com a mesma forma de 1152 de dimensão oculta e 27 camadas, com um downsample padrão de 16x.

• Evidência — Mage-VL: uma ficha completa com DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-Bench-3D 94,75 e uma diferença de +53,1 no CrossPoint em relação ao Qwen3-VL-4B, todos relatados pelo fornecedor em relação a um backbone correspondente. MiniCPM-V 4.7: nenhuma.

• Comportamento de streaming — Mage-VL: um portão cognitivo que pontua cada janela deslizante e permanece silencioso até que um evento seja concluído, treinado em ~3,3M de amostras de streaming. MiniCPM-V 4.7: não descrito em lugar nenhum.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

The part everyone gets wrong about Mage-VL's numbers

As tabelas de benchmark da ficha do Mage-VL são fortes, e as mais fortes são também as mais facilmente mal interpretadas. As linhas de comparação colocam o Mage-VL-4B frente a frente com o Qwen3-VL-4B, o Phi-4-Multimodal-Instruct e o Phi-4-Reasoning-Vision, e os ganhos em destaque — +22,5 em QVHighlight, +24,5 em VideoEval-Pro, +53,1 em CrossPoint — são reais no sentido de que aparecem nas tabelas do fornecedor. Também são medições do próprio fornecedor, produzidas pela equipa que treinou o modelo, na mesma estrutura de avaliação. Nenhuma entidade independente as reproduziu. Isso é normal para um modelo com quatro meses e não é um demérito para ele, mas significa que o verbo correto é "relata", não "pontua".

Duas coisas merecem crédito além das tabelas. Primeiro, o design de backbone emparelhado — manter o decodificador Qwen3-4B fixo e trocar apenas o ViT — é uma evidência mais limpa do que uma posição em um leaderboard, porque isola a pilha visual em vez de todo o sistema. Segundo, o corpus de treinamento do Mage-ViT tem cerca de 100 milhões de frames não rotulados, em comparação com os bilhões de pares imagem-texto que os encoders pré-treinados na web usam, de modo que igualar o comportamento do SigLIP2 na classe de 10B em discriminação de clusters é uma alegação específica e verificável sobre eficiência de dados, e não uma vanglória genérica.

O MiniCPM-V 4.7 não tem nada disso. Não uma versão mais fraca — nada.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured 7 October 2026) showing the model header, the mage_vl and video-understanding tags, the Apache-2.0 licence badge, the project page and GitHub links, and the opening of the Mage-VL card describing it as a codec-native, proactive-streaming multimodal foundation model at a 4B scale.

Não há tabela alguma, de fornecedor ou de qualquer outra natureza, e o arquivo de configuração que descreve a arquitetura exclui explicitamente a si mesmo de dizer qualquer coisa sobre precisão.

Arquitetura: duas respostas para o mesmo

Ambos os modelos estão tentando responder "como tornar a inferência multimodal barata", e o contraste é instrutivo porque as duas respostas se compõem em vez de competir.

O Mage-VL reduz a entrada. A sua 16×16 grelha de patches é partilhada entre o frame âncora e os frames previstos, e os frames previstos só contribuem com patches onde o codec está a gastar bits — que é onde estão o movimento e os novos detalhes. O resultado são fluxos de tokens de comprimento variável por frame, e é por isso que a pilha precisa de um projetor capaz de entregar uma sequência variável a um descodificador causal, e por que a mesma interface pode aceitar vetores de movimento H.264/HEVC ou um mapa de taxa aprendido de um codec neural sem retreino. Depois, uma codificação rotativa 3D mantém as posições espaciotemporais coerentes ao longo da esparsidade. O orçamento de tokens é a quantidade que está a ser gerida.

O MiniCPM-V 4.7 reduz o estado. Suas camadas de atenção linear mantêm um estado recorrente de tamanho fixo em vez de um cache de chave-valor crescente, de modo que o custo de memória de uma conversa longa deixa de escalar linearmente com a contagem de tokens. Seu orçamento de sequência é a quantidade gerenciada, e o contexto de 256K é o ganho. Notavelmente, a configuração do MiniCPM-V 4.7 anuncia a subamostragem visual de 16x — ele também comprime a entrada —, mas não diz se mantém o modo 4x alternável que o MiniCPM-V 4.6 expôs.

Em termos simples: o truque do Mage-VL compensa em vídeo, onde a maioria dos quadros é quase idêntica aos seus vizinhos. O truque do MiniCPM-V 4.7 compensa em documentos longos e sessões longas de múltiplos turnos, onde os tokens se acumulam. Um pipeline que ingere um fluxo ao vivo e depois mantém uma longa conversa sobre ele se beneficiaria de ambos, e nenhum dos modelos ainda faz o trabalho do outro.

Servindo-os em um fluxo de trabalho real

O Mage-VL é prático de experimentar hoje: um checkpoint, uma arquitetura documentada, Apache-2.0 e um card que informa o que o repositório inclui. Ele está disponível desde julho e as ferramentas em torno dele já tiveram tempo de se estabilizar.

O MiniCPM-V 4.7 não é prático de testar hoje, por motivos entediantes. 70 GB em BF16 sem quantização significa memória de acelerador que você provavelmente não tem disponível, e uma licença ausente significa que a questão de saber se você pode sequer usá-lo permanece em aberto. Os caminhos de código personalizados exigem trust_remote_code, e se a combinação de MoE com atenção linear tem kernels na sua stack de serving não foi testado.

O que é verdade para ambos é que um modelo de visão auto-hospedado é um componente de um sistema que também precisa chamar modelos de fronteira. É o caso de colocar a metade hospedada atrás de um único roteador, em vez de um segundo contrato e um segundo SDK: O OrcaRouter alcança mais de 200 modelos com uma única chave, repassa o preço de tabela de cada provedor sem qualquer margem adicionada por nós e faz failover automaticamente quando um provedor degrada. Nem o Mage-VL nem o MiniCPM-V 4.7 é um modelo hospedado nesse serviço — ambos são pesos que você mesmo serve —, então encare isto como a infraestrutura do outro lado da transferência, e não como um canal de disponibilidade para qualquer um dos modelos.

Veredito

O Mage-VL é um modelo finalizado, licenciado e avaliado por benchmarks, com uma filosofia de design específica e bem fundamentada, e o argumento a seu favor assenta em streaming de vídeo e raciocínio espacial, onde o seu codificador nativo de codec faz algo estruturalmente diferente de todos os outros. O MiniCPM-V 4.7 é um checkpoint maior, não licenciado e não medido, cuja filosofia de design é inteligível, mas cujo comportamento é uma incógnita. Em tudo aquilo sobre o que um leitor pode agir hoje, o Mage-VL vence por predefinição — não porque seja melhor, mas porque é o único dos dois que pode sequer ser avaliado. Volte a esta comparação quando o README do MiniCPM-V 4.7 aparecer; se esse dia trouxer benchmarks e uma licença, a questão interessante será se um MoE de atenção linear com contexto de 256K supera um codificador de esparsidade nativo de codec em vídeo longo, e essa é uma disputa genuinamente em aberto.