
MiniCPM-V 4.7 vs. Microsoft Mage-VL: dos apuestas muy diferentes sobre cuánto debería costar por fotograma un modelo de visión
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
MiniCPM-V 4.7 y Microsoft Mage-VL son ambos modelos de visión-lenguaje que afirman ahorrarte tokens, y llegan ahí por rutas opuestas. Mage-VL, lanzado por Microsoft el 25 de julio de 2026, ataca el lado del vídeo: toma prestada la estructura de un códec de vídeo, conserva cada parche de fotograma ancla y solo los parches de fotogramas predichos que contienen movimiento real, y afirma una reducción de tokens visuales superior al 75 % con una aceleración de hasta 3,5× en tiempo de reloj frente al muestreo uniforme de fotogramas. MiniCPM-V 4.7, subido por OpenBMB el 6 de octubre de 2026, ataca el lado de la secuencia: un MoE disperso de 35,2 mil millones de parámetros con 30 de sus 40 capas en una ruta de atención lineal, lo que hace que la caché KV crezca lentamente a lo largo de un contexto de 256K. Un modelo comprime lo que mira. El otro comprime lo que recuerda. Y solo uno de ellos viene con algo que puedes evaluar.
Lo que es cada uno
Microsoft Mage-VL es un modelo fundacional multimodal nativo de códecs y de streaming proactivo, a escala de 4B, publicado bajo Apache-2.0 con un informe técnico y una sección de evaluación sustancial. Se construyó deliberadamente en contra de lo que sus autores llaman una paradoja de Moravec para los VLM: fuerte en razonamiento offline, lento en percepción en tiempo real. El codificador visual, Mage-ViT, se entrena por completo desde cero con aproximadamente 100 millones de imágenes y videos sin etiquetar, en lugar de inicializarse a partir de un ViT preentrenado en la web, y el único componente preentrenado de la pila es el backbone de lenguaje Qwen3-4B-Instruct-2507. El checkpoint completo es un solo modelo unificado que realiza comprensión de imágenes, razonamiento de video offline y comentarios en streaming con activación por eventos, sin variantes separadas, y un lanzamiento complementario microsoft/Mage-ViT proporciona el codificador por sí solo. Ha acumulado alrededor de 10.600 descargas y 420 me gusta desde su lanzamiento.
MiniCPM-V 4.7 es openbmb/MiniCPM-V-4.7-35B-A3B, un checkpoint BF16 de 35.212.875.824 parámetros en dieciséis fragmentos que totalizan 70,4 GB, escrito por Transformers 5.2.0 y subido el 6 de octubre de 2026 sin tarjeta de modelo.

Su configuración de texto está etiquetada como qwen3_5_moe_text con 256 expertos y 8 activos por token; su layer_types array ejecuta tres capas de atención lineal por cada capa de atención completa a lo largo de 40 capas; su torre de visión es la interna minicpmv4_7_vision con 27 capas, submuestreo de 16× y hasta nueve fragmentos de imagen. El contexto es de 256K. El repositorio tiene cero descargas, tres me gusta, ningún benchmark y ninguna licencia.
Las seis filas que un lector puede comprobar
Las mismas seis dimensiones, en ambos lados. Donde no existe un número, el hueco se deja visible.
• Parámetros — Mage-VL: 4,74B, denso, todos activos por token. MiniCPM-V 4.7: 35,2B en total, disperso, 8 de 256 expertos por token. El número de MiniCPM no es conmensurable con el de uno denso.
• Licencia — Mage-VL: Apache-2.0, indicado en la ficha y en las etiquetas del repositorio. MiniCPM-V 4.7: no se declara nada.
• De dónde vienen los ahorros de tokens — Mage-VL: dispersión de tokens visuales en el codificador, alineado con el códec, se afirma una reducción superior al 75 %. MiniCPM-V 4.7: atención lineal en el decodificador, que reduce el crecimiento de la caché KV en secuencias largas, pero no reduce los tokens que le proporcionas.
• Contexto — Mage-VL: entrenado mediante una etapa de contexto largo sobre 350K vídeos como ventanas de códec deslizantes de hasta 384 o 768 fotogramas. MiniCPM-V 4.7: max_position_embeddings: 262144.
• Procedencia del codificador de visión — Mage-VL: desde cero, entrenado con ~100M fotogramas sin etiquetar; la ficha reporta 85.69 % en ImageNet con 256 tokens y una mejora monótona con el presupuesto de tokens. MiniCPM-V 4.7: torre de linaje reutilizada del diseño de MiniCPM-V 4.6 con la misma forma de 1152 ocultos y 27 capas, con un submuestreo predeterminado de 16x.
• Evidencia — Mage-VL: una ficha completa con DocVQA 95.14, InfoVQA 80.33, OCRBench 81.80, ChartQAPro 32.57, MMStar 67.32, CV-Bench-3D 94.75 y una ventaja de +53.1 en CrossPoint sobre Qwen3-VL-4B, todo reportado por el proveedor frente a un backbone emparejado. MiniCPM-V 4.7: ninguna.
• Comportamiento en streaming — Mage-VL: una puerta cognitiva que puntúa cada ventana deslizante y permanece en silencio hasta que se completa un evento, entrenada con ~3,3 M de muestras de streaming. MiniCPM-V 4.7: no se describe en ningún sitio.

Lo que todo el mundo malinterpreta sobre las cifras de Mage-VL
Las tablas de benchmark de la ficha de Mage-VL son sólidas, y las más sólidas son también las más fáciles de malinterpretar. Las filas de comparación enfrentan a Mage-VL-4B con Qwen3-VL-4B, Phi-4-Multimodal-Instruct y Phi-4-Reasoning-Vision, y las mejoras más destacadas —+22,5 en QVHighlight, +24,5 en VideoEval-Pro, +53,1 en CrossPoint— son reales en el sentido de que aparecen en las tablas del proveedor. También son mediciones del propio proveedor, producidas por el equipo que entrenó el modelo, con el mismo entorno de evaluación. Ningún tercero independiente las ha reproducido. Eso es normal para un modelo de cuatro meses y no es un punto en su contra, pero sí significa que el verbo correcto es «reporta», no «puntúa».
Dos cosas merecen crédito más allá de las tablas. En primer lugar, el diseño de backbone emparejado —mantener fijo el decodificador Qwen3-4B y sustituir solo el ViT— es una evidencia más limpia que una posición en la tabla de clasificación, porque aísla la pila visual en lugar del sistema completo. En segundo lugar, el corpus de entrenamiento de Mage-ViT es de aproximadamente 100M de fotogramas sin etiquetar frente a los miles de millones de pares imagen-texto que usan los codificadores preentrenados en la web, por lo que igualar el comportamiento de SigLIP2-at-10B-class en discriminación de clústeres es una afirmación específica y comprobable sobre la eficiencia de datos en lugar de un alarde general.
MiniCPM-V 4.7 no tiene nada de esto. No una versión más débil: nada.

No hay ninguna tabla, ni de proveedor ni de ningún otro tipo, y el archivo de configuración que describe la arquitectura se excluye explícitamente de decir nada sobre la exactitud.
Arquitectura: dos respuestas a la misma pregunta
Ambos modelos intentan responder a «cómo se puede abaratar la inferencia multimodal», y el contraste es instructivo porque ambas respuestas se complementan en lugar de competir.
Mage-VL reduce la entrada. Su 16×16 rejilla de parches se comparte entre fotogramas ancla y predichos, y los fotogramas predichos solo aportan parches donde el códec gasta bits — que es donde están el movimiento y los detalles nuevos. El resultado son flujos de tokens de longitud variable por fotograma, y por eso la pila necesita un proyector que pueda entregar una secuencia variable a un decodificador causal, y por eso la misma interfaz puede aceptar vectores de movimiento H.264/HEVC o el mapa de tasas aprendido de un códec neuronal sin reentrenamiento. Luego, una codificación rotatoria 3D mantiene coherentes las posiciones espaciotemporales a través de la dispersión. El presupuesto de tokens es la cantidad que se gestiona.
MiniCPM-V 4.7 reduce el estado. Sus capas de atención lineal mantienen un estado recurrente de tamaño fijo en lugar de una caché de clave-valor en crecimiento, por lo que el coste de memoria de una conversación larga deja de escalar linealmente con el número de tokens. Su presupuesto de secuencia es la cantidad que se gestiona, y el contexto de 256K es la recompensa. En particular, la configuración de MiniCPM-V 4.7 anuncia el submuestreo visual 16x —también comprime la entrada—, pero no dice nada sobre si conserva el modo 4x conmutable que exponía MiniCPM-V 4.6.
En pocas palabras: el truco de Mage-VL da resultado en video, donde la mayoría de los fotogramas son casi idénticos a sus vecinos. El truco de MiniCPM-V 4.7 da resultado en documentos largos y sesiones largas de múltiples turnos donde los tokens se acumulan. Un pipeline que ingiere una transmisión en vivo y luego mantiene una conversación larga sobre ella se beneficiaría de ambos, y ninguno de los modelos hace todavía el trabajo del otro.
Integrándolos en un flujo de trabajo real
Mage-VL es práctico de probar hoy: un único checkpoint, una arquitectura documentada, Apache-2.0 y una tarjeta que te dice qué incluye el repositorio. Lleva disponible desde julio y las herramientas que lo rodean han tenido tiempo de asentarse.
MiniCPM-V 4.7 no es práctico de probar hoy, por razones aburridas. 70 GB en BF16 sin cuantización significa memoria de acelerador que probablemente no tengas libre, y la falta de licencia significa que la pregunta de si puedes usarlo siquiera está abierta. Las rutas de código personalizadas requieren trust_remote_code, y no está probado si la combinación de MoE más atención lineal tiene kernels en tu stack de servicio.
Lo que es cierto para ambos es que un modelo de visión autoalojado es un componente de un sistema que también tiene que llamar a modelos de frontera. Ese es el argumento para poner la mitad alojada detrás de un único router en lugar de un segundo contrato y un segundo SDK: OrcaRouter llega a más de 200 modelos con una sola clave, traslada el precio de lista de cada proveedor sin añadir ningún margen por nuestra parte y conmuta automáticamente cuando un proveedor se degrada. Ni Mage-VL ni MiniCPM-V 4.7 son un modelo alojado en ese servicio —ambos son pesos que sirves tú mismo—, así que considera esto como la fontanería del lado opuesto del traspaso, no como un canal de disponibilidad para ninguno de los dos modelos.
Veredicto
Mage-VL es un modelo terminado, con licencia y evaluado con benchmarks, con una filosofía de diseño específica y bien argumentada, y el argumento a su favor se basa en la transmisión de video y el razonamiento espacial, donde su codificador nativo de códecs hace algo estructuralmente distinto al resto. MiniCPM-V 4.7 es un checkpoint más grande, sin licencia y sin evaluar, cuya filosofía de diseño es legible, pero cuyo comportamiento es una incógnita. En todo aquello en lo que un lector puede basarse hoy, Mage-VL gana por defecto —no porque sea mejor, sino porque es el único de los dos que puede juzgarse siquiera. Vuelve a revisar esta comparación cuando aparezca el README de MiniCPM-V 4.7; si ese día trae benchmarks y una licencia, la pregunta interesante será si un MoE de atención lineal con contexto de 256K supera a un codificador de dispersión nativo de códecs en video largo, y esa es una contienda genuinamente abierta.
