Una tarjeta de título principal generada para 'MiniCPM-V 4.7 vs North Micro Vision Instruct' con el subtítulo 'Un modelo documentado de 2.4B junto a un espacio en blanco de 70 GB', una tarjeta izquierda que dice 'North Micro Vision Instruct: 2.4B, Apache-2.0, resolución nativa', una tarjeta derecha que dice 'MiniCPM-V 4.7: 35.2B disperso, sin licencia, sin tarjeta' y una píldora que dice 'Uno es un objetivo de ajuste fino, uno está pendiente', con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

MiniCPM-V 4.7 vs. North Micro Vision Instruct: Cohere lanzó un modelo documentado de 2,4B; OpenBMB lanzó un vacío de 70 GB

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

MiniCPM-V 4.7 y North Micro Vision Instruct son ambas respuestas de laboratorios pequeños a la misma consigna —un modelo compacto de visión-lenguaje que puedes ajustar y desplegar por tu cuenta—, pero solo uno de ellos está terminado. North Micro Vision Instruct, de Cohere, llegó el 10 de agosto de 2026 como un modelo de resolución nativa de 2,4 mil millones de parámetros bajo Apache-2.0, con una entrada de blog técnico que explica la arquitectura y una ficha que indica para qué sirve. MiniCPM-V 4.7 llegó el 6 de octubre de 2026 como un checkpoint de mezcla de expertos dispersa de 35,2 mil millones de parámetros con dieciséis fragmentos, sin README, sin campo de licencia y sin ningún tipo de benchmark. La comparación interesante no es «cuál es más inteligente». Es que los dos lanzamientos representan posturas opuestas hacia la comunidad que tiene que usarlos.

Las dos versiones, y lo que se incluyó con cada una

North Micro Vision Instruct es un modelo visión-lenguaje de pesos abiertos de 2,4B de CohereLabs, publicado bajo Apache-2.0. Se posiciona explícitamente como una base compacta para la creación de prototipos, el ajuste fino específico de tareas y el trabajo multimodal especializado. Su característica definitoria es el procesamiento de imágenes a resolución nativa que conserva las relaciones de aspecto y el detalle visual fino en lugar de remuestrear a una cuadrícula fija, y la ficha afirma capacidad en VQA, generación de descripciones, grounding, OCR, gráficos y documentos. Admite varias imágenes por conversación y once idiomas: inglés, alemán, francés, español, italiano, portugués, hindi, japonés, coreano, chino y árabe. Los pesos del modelo son 2.484.847.856 parámetros en BF16, y desde su lanzamiento la comunidad de MLX ha producido conversiones de 4 bits, 5 bits, 6 bits, 8 bits, mxfp8, mxfp4, nvfp4 y bf16, que es el aspecto que tiene un lanzamiento saludable de un modelo pequeño después de un par de meses. Tiene alrededor de 166.500 descargas y 150 me gusta.

MiniCPM-V 4.7 es openbmb/MiniCPM-V-4.7-35B-A3B: 35.212.875.824 parámetros en BF16, 70,4 GB distribuidos en dieciséis fragmentos de safetensors, clase MiniCPMV4_7ForConditionalGeneration, guardado por Transformers 5.2.0 y subido el 6 de octubre de 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs North Micro Vision Instruct — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Fine-tuning no recipe, Resolution 16x downsample, Languages not stated, Context 256K. Right column 'North Micro Vision Instruct' lists Parameters 2.48B dense, Licence Apache-2.0, Fine-tuning the stated purpose, Resolution native aspect preserved, Languages eleven listed, Context 2.4B deployment class. The footer reads 'North Micro Vision figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Su arquitectura troncal de texto es un MoE disperso derivado de Qwen3.5 —256 expertos, 8 seleccionados por token— con 40 capas que ejecutan un patrón fijo de atención de tres lineales a una completa, contexto de 256K y una torre de visión interna de 27 capas con un submuestreo de 16×. No hay tarjeta del modelo. El repositorio tiene tres "me gusta" y ninguna descarga.

Lado a lado, en las seis cosas que importan

• Parámetros — North Micro Vision Instruct: 2.48B denso, cada parámetro activo por token. MiniCPM-V 4.7: 35.2B en total, 8 de 256 dispersos. No es una cifra comparable.

• Licencia — North Micro Vision Instruct: Apache-2.0, etiquetada y declarada. MiniCPM-V 4.7: ninguna declarada, lo que por defecto implica todos los derechos reservados.

• Superficie de ajuste fino — North Micro Vision Instruct: diseñado explícitamente como base para el ajuste fino específico de tareas, con cuantizaciones de la comunidad ya disponibles. MiniCPM-V 4.7: un checkpoint BF16 de 70 GB sin cuantizaciones y sin receta de entrenamiento declarada.

• Gestión de resolución — North Micro Vision Instruct: resolución nativa, preservando la relación de aspecto. MiniCPM-V 4.7: downsample_mode: "16x" con max_slice_nums: 9, una ruta de alta resolución basada en slicer.

• Cobertura de idiomas — North Micro Vision Instruct: once idiomas enumerados en la ficha. MiniCPM-V 4.7: no se indica en ninguna parte.

• Contexto — North Micro Vision Instruct: dimensionado para su clase de despliegue de 2.4B. MiniCPM-V 4.7: max_position_embeddings: 262144, 256K.

• Pruebas de calidad — North Micro Vision Instruct: una ficha publicada, una entrada de blog técnico, conversiones de la comunidad y una gran adopción. MiniCPM-V 4.7: nada que citar.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

La asimetría que hace que esta comparación esté desequilibrada

Hay un tipo particular de artículo comparativo que sería fácil de escribir aquí: tomar las cifras del MiniCPM-V 4.6 del GitHub de OpenBMB, señalar que superan a la clase equivalente de modelos pequeños e insinuar que el 4.7 las hereda. Eso sería deshonesto, y la razón merece exponerse con precisión. MiniCPM-V 4.7 no es una versión más grande del 4.6. Abandona el backbone denso de 1.3B Qwen3.5-0.8B por un Qwen-MoE disperso de 35B, cambia el patrón de atención a 3:1 de lineal a completa y cambia el valor predeterminado de compresión de visión a 16x. Cada uno de esos cambios afecta a la parte del modelo que determina la precisión. El linaje familiar no es un benchmark.

La otra dirección de la deshonestidad es más sutil: tratar la ausencia de una tarjeta como evidencia de un problema. No lo es. OpenBMB ha lanzado nueve generaciones de MiniCPM-V desde 2024, varias de ellas genuinamente excelentes para su tamaño, y una ventana de doce minutos entre la creación del repositorio y el último commit es lo que parece un artefacto preparado y luego publicado, no lo que parece uno roto. La interpretación correcta de MiniCPM-V 4.7 es «desconocido», y lo desconocido es algo distinto de «malo».

El lado de Cohere tiene sus propios requisitos de honestidad.

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured 7 October 2026) showing the model header, the cohere_compass and image-text-to-text tags, the Apache-2.0 licence badge, the eleven language tags, and the opening of the card describing a 2.4B-parameter open-weight vision-language model with native-resolution image support.

Las afirmaciones de calidad de la tarjeta North Micro Vision son mediciones propias de Cohere, y el análisis técnico exhaustivo lo escribió el mismo equipo. Que la comunidad creara dieciséis cuantizaciones MLX en cuestión de días es evidencia de adopción, no de precisión: la gente convierte modelos que son fáciles de convertir, y un lanzamiento limpio de 2.4B Apache-2.0 es fácil de convertir. Ni el número de descargas ni la variedad de cuantizaciones deberían interpretarse como una puntuación.

Para qué sirve realmente cada uno

North Micro Vision Instruct está pensado para el ajuste fino. Ese es todo el brief de diseño, expresado con las palabras de la propia ficha: una base compacta para el prototipado y las aplicaciones especializadas. Si tienes una tarea acotada de análisis de documentos, extracción de gráficos o generación de descripciones multilingüe, y unos miles de ejemplos etiquetados, un modelo Apache-2.0 de 2.4B con entrada de resolución nativa y cuantizaciones de ocho bits o superior es un punto de partida sensato, y puedes trasladarlo a un dispositivo de borde o a una única GPU de gama media cuando funcione.

MiniCPM-V 4.7, si resulta que es utilizable, no es eso. Con 70 GB sin cuantizar, es un modelo de servidor, y sus características distintivas —una ventana de 256K y una atención lineal que mantiene plano el KV cache— apuntan a cargas de trabajo multimodales de contexto largo: transcripciones de vídeo de horas, grandes conjuntos de documentos, análisis multiturno extendido con imágenes en el historial. Esas son cargas de trabajo reales, y la arquitectura es una apuesta razonable por ellas. La apuesta simplemente aún no se ha evaluado.

Hay un matiz sobre las dos estrategias de compresión que vale la pena retener. La resolución nativa y el submuestreo de 16× no son simplemente mejores y peores. Un codificador de resolución nativa gasta tokens para preservar detalles finos, que es lo que necesitan el OCR y el grounding. Un submuestreo de 16× gasta menos tokens y corre el riesgo de perder justo ese detalle. Cuál es la correcta depende de si tu tarea consiste en leer un formulario denso o en describir una escena, y el modo conmutable 4x/16x de MiniCPM-V 4.6 existía precisamente porque la respuesta cambia según la tarea. Que 4.7 haya conservado ese conmutador es una de las cosas que la configuración no dice.

Dónde encaja un router y dónde no

Ambos modelos son pesos que usted mismo sirve. Ni North Micro Vision Instruct ni MiniCPM-V 4.7 son modelos alojados en OrcaRouter, y nada de lo que aquí se dice debe interpretarse como una afirmación de que lo son. La cuestión del enrutamiento entra en juego un paso después, cuando el modelo pequeño autoalojado está haciendo el trabajo rutinario y algo más grande tiene que encargarse de los casos en los que este falla. Ese traspaso es precisamente para lo que sirve un router de clave única — más de 200 modelos de distintos proveedores, cada uno a su precio de lista sin ningún margen añadido por nuestra parte, con conmutación por error automática cuando un proveedor se degrada — y vale la pena tener la interfaz resuelta antes de necesitarla, porque el día en que su evaluación de 4.7 tenga éxito es el día en que querrá un segundo endpoint sin un segundo contrato.

El veredicto, y qué lo cambiaría

Cohere publicó un modelo. OpenBMB publicó un checkpoint. En todos los ejes sobre los que un lector puede actuar —licencia, claridad de la licencia, comportamiento documentado, preparación para ajuste fino, cuantización, cobertura de idiomas— North Micro Vision Instruct es la respuesta hoy, y no está ni cerca. Eso no es una afirmación sobre capacidad, porque no es posible ninguna comparación de capacidad. MiniCPM-V 4.7 tiene aproximadamente diez veces el número de parámetros del modelo con el que se lo compara y no ha publicado nada que justifique o refute ese tamaño. La postura honesta es tratarlo como pendiente: un artefacto real de un laboratorio con una trayectoria real, que está en un repositorio al que le falta un solo archivo que lo cambiaría todo: el README.