
MiniCPM-V 4.7 vs. North Micro Vision Instruct: Cohere lanzó un modelo documentado de 2,4B; OpenBMB lanzó un vacío de 70 GB
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
MiniCPM-V 4.7 y North Micro Vision Instruct son ambas respuestas de laboratorios pequeños a la misma consigna —un modelo compacto de visión-lenguaje que puedes ajustar y desplegar por tu cuenta—, pero solo uno de ellos está terminado. North Micro Vision Instruct, de Cohere, llegó el 10 de agosto de 2026 como un modelo de resolución nativa de 2,4 mil millones de parámetros bajo Apache-2.0, con una entrada de blog técnico que explica la arquitectura y una ficha que indica para qué sirve. MiniCPM-V 4.7 llegó el 6 de octubre de 2026 como un checkpoint de mezcla de expertos dispersa de 35,2 mil millones de parámetros con dieciséis fragmentos, sin README, sin campo de licencia y sin ningún tipo de benchmark. La comparación interesante no es «cuál es más inteligente». Es que los dos lanzamientos representan posturas opuestas hacia la comunidad que tiene que usarlos.
Las dos versiones, y lo que se incluyó con cada una
North Micro Vision Instruct es un modelo visión-lenguaje de pesos abiertos de 2,4B de CohereLabs, publicado bajo Apache-2.0. Se posiciona explícitamente como una base compacta para la creación de prototipos, el ajuste fino específico de tareas y el trabajo multimodal especializado. Su característica definitoria es el procesamiento de imágenes a resolución nativa que conserva las relaciones de aspecto y el detalle visual fino en lugar de remuestrear a una cuadrícula fija, y la ficha afirma capacidad en VQA, generación de descripciones, grounding, OCR, gráficos y documentos. Admite varias imágenes por conversación y once idiomas: inglés, alemán, francés, español, italiano, portugués, hindi, japonés, coreano, chino y árabe. Los pesos del modelo son 2.484.847.856 parámetros en BF16, y desde su lanzamiento la comunidad de MLX ha producido conversiones de 4 bits, 5 bits, 6 bits, 8 bits, mxfp8, mxfp4, nvfp4 y bf16, que es el aspecto que tiene un lanzamiento saludable de un modelo pequeño después de un par de meses. Tiene alrededor de 166.500 descargas y 150 me gusta.
MiniCPM-V 4.7 es openbmb/MiniCPM-V-4.7-35B-A3B: 35.212.875.824 parámetros en BF16, 70,4 GB distribuidos en dieciséis fragmentos de safetensors, clase MiniCPMV4_7ForConditionalGeneration, guardado por Transformers 5.2.0 y subido el 6 de octubre de 2026.

Su arquitectura troncal de texto es un MoE disperso derivado de Qwen3.5 —256 expertos, 8 seleccionados por token— con 40 capas que ejecutan un patrón fijo de atención de tres lineales a una completa, contexto de 256K y una torre de visión interna de 27 capas con un submuestreo de 16×. No hay tarjeta del modelo. El repositorio tiene tres "me gusta" y ninguna descarga.
Lado a lado, en las seis cosas que importan
• Parámetros — North Micro Vision Instruct: 2.48B denso, cada parámetro activo por token. MiniCPM-V 4.7: 35.2B en total, 8 de 256 dispersos. No es una cifra comparable.
• Licencia — North Micro Vision Instruct: Apache-2.0, etiquetada y declarada. MiniCPM-V 4.7: ninguna declarada, lo que por defecto implica todos los derechos reservados.
• Superficie de ajuste fino — North Micro Vision Instruct: diseñado explícitamente como base para el ajuste fino específico de tareas, con cuantizaciones de la comunidad ya disponibles. MiniCPM-V 4.7: un checkpoint BF16 de 70 GB sin cuantizaciones y sin receta de entrenamiento declarada.
• Gestión de resolución — North Micro Vision Instruct: resolución nativa, preservando la relación de aspecto. MiniCPM-V 4.7: downsample_mode: "16x" con max_slice_nums: 9, una ruta de alta resolución basada en slicer.
• Cobertura de idiomas — North Micro Vision Instruct: once idiomas enumerados en la ficha. MiniCPM-V 4.7: no se indica en ninguna parte.
• Contexto — North Micro Vision Instruct: dimensionado para su clase de despliegue de 2.4B. MiniCPM-V 4.7: max_position_embeddings: 262144, 256K.
• Pruebas de calidad — North Micro Vision Instruct: una ficha publicada, una entrada de blog técnico, conversiones de la comunidad y una gran adopción. MiniCPM-V 4.7: nada que citar.

La asimetría que hace que esta comparación esté desequilibrada
Hay un tipo particular de artículo comparativo que sería fácil de escribir aquí: tomar las cifras del MiniCPM-V 4.6 del GitHub de OpenBMB, señalar que superan a la clase equivalente de modelos pequeños e insinuar que el 4.7 las hereda. Eso sería deshonesto, y la razón merece exponerse con precisión. MiniCPM-V 4.7 no es una versión más grande del 4.6. Abandona el backbone denso de 1.3B Qwen3.5-0.8B por un Qwen-MoE disperso de 35B, cambia el patrón de atención a 3:1 de lineal a completa y cambia el valor predeterminado de compresión de visión a 16x. Cada uno de esos cambios afecta a la parte del modelo que determina la precisión. El linaje familiar no es un benchmark.
La otra dirección de la deshonestidad es más sutil: tratar la ausencia de una tarjeta como evidencia de un problema. No lo es. OpenBMB ha lanzado nueve generaciones de MiniCPM-V desde 2024, varias de ellas genuinamente excelentes para su tamaño, y una ventana de doce minutos entre la creación del repositorio y el último commit es lo que parece un artefacto preparado y luego publicado, no lo que parece uno roto. La interpretación correcta de MiniCPM-V 4.7 es «desconocido», y lo desconocido es algo distinto de «malo».
El lado de Cohere tiene sus propios requisitos de honestidad.

Las afirmaciones de calidad de la tarjeta North Micro Vision son mediciones propias de Cohere, y el análisis técnico exhaustivo lo escribió el mismo equipo. Que la comunidad creara dieciséis cuantizaciones MLX en cuestión de días es evidencia de adopción, no de precisión: la gente convierte modelos que son fáciles de convertir, y un lanzamiento limpio de 2.4B Apache-2.0 es fácil de convertir. Ni el número de descargas ni la variedad de cuantizaciones deberían interpretarse como una puntuación.
Para qué sirve realmente cada uno
North Micro Vision Instruct está pensado para el ajuste fino. Ese es todo el brief de diseño, expresado con las palabras de la propia ficha: una base compacta para el prototipado y las aplicaciones especializadas. Si tienes una tarea acotada de análisis de documentos, extracción de gráficos o generación de descripciones multilingüe, y unos miles de ejemplos etiquetados, un modelo Apache-2.0 de 2.4B con entrada de resolución nativa y cuantizaciones de ocho bits o superior es un punto de partida sensato, y puedes trasladarlo a un dispositivo de borde o a una única GPU de gama media cuando funcione.
MiniCPM-V 4.7, si resulta que es utilizable, no es eso. Con 70 GB sin cuantizar, es un modelo de servidor, y sus características distintivas —una ventana de 256K y una atención lineal que mantiene plano el KV cache— apuntan a cargas de trabajo multimodales de contexto largo: transcripciones de vídeo de horas, grandes conjuntos de documentos, análisis multiturno extendido con imágenes en el historial. Esas son cargas de trabajo reales, y la arquitectura es una apuesta razonable por ellas. La apuesta simplemente aún no se ha evaluado.
Hay un matiz sobre las dos estrategias de compresión que vale la pena retener. La resolución nativa y el submuestreo de 16× no son simplemente mejores y peores. Un codificador de resolución nativa gasta tokens para preservar detalles finos, que es lo que necesitan el OCR y el grounding. Un submuestreo de 16× gasta menos tokens y corre el riesgo de perder justo ese detalle. Cuál es la correcta depende de si tu tarea consiste en leer un formulario denso o en describir una escena, y el modo conmutable 4x/16x de MiniCPM-V 4.6 existía precisamente porque la respuesta cambia según la tarea. Que 4.7 haya conservado ese conmutador es una de las cosas que la configuración no dice.
Dónde encaja un router y dónde no
Ambos modelos son pesos que usted mismo sirve. Ni North Micro Vision Instruct ni MiniCPM-V 4.7 son modelos alojados en OrcaRouter, y nada de lo que aquí se dice debe interpretarse como una afirmación de que lo son. La cuestión del enrutamiento entra en juego un paso después, cuando el modelo pequeño autoalojado está haciendo el trabajo rutinario y algo más grande tiene que encargarse de los casos en los que este falla. Ese traspaso es precisamente para lo que sirve un router de clave única — más de 200 modelos de distintos proveedores, cada uno a su precio de lista sin ningún margen añadido por nuestra parte, con conmutación por error automática cuando un proveedor se degrada — y vale la pena tener la interfaz resuelta antes de necesitarla, porque el día en que su evaluación de 4.7 tenga éxito es el día en que querrá un segundo endpoint sin un segundo contrato.
El veredicto, y qué lo cambiaría
Cohere publicó un modelo. OpenBMB publicó un checkpoint. En todos los ejes sobre los que un lector puede actuar —licencia, claridad de la licencia, comportamiento documentado, preparación para ajuste fino, cuantización, cobertura de idiomas— North Micro Vision Instruct es la respuesta hoy, y no está ni cerca. Eso no es una afirmación sobre capacidad, porque no es posible ninguna comparación de capacidad. MiniCPM-V 4.7 tiene aproximadamente diez veces el número de parámetros del modelo con el que se lo compara y no ha publicado nada que justifique o refute ese tamaño. La postura honesta es tratarlo como pendiente: un artefacto real de un laboratorio con una trayectoria real, que está en un repositorio al que le falta un solo archivo que lo cambiaría todo: el README.
