Una tarjeta de título para North Micro Vision Instruct que dice 'North Micro Vision Instruct' con el subtítulo 'Cohere's 2.4B Apache-2.0 document VLM' y un chip que indica que se lanzó el 12 de agosto de 2026, sobre tres iconos lineales para escaneo de documentos, lectura de gráficos y anclaje de cuadros delimitadores.
Guides & Insights

North Micro Vision Instruct: el discreto VLM de documentos de 2.4B de Cohere, explicado

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

CohereLabs/North-Micro-Vision-Instruct — «North Micro Vision», para abreviar — es un modelo de visión y lenguaje de 2.400 millones de parámetros que llegó discretamente: los pesos aparecieron en Hugging Face el 10 de agosto de 2026, el anuncio de Cohere siguió el 12 de agosto, y un día después todavía no hay API alojada, ni lista de precios, ni entrada en tablas de clasificación de terceros. North Micro Vision está diseñado para una sola tarea: leer documentos a resolución nativa, como una persona entrecierra los ojos ante una página A4 escaneada, y no como un modelo de subtítulos que echa un vistazo a una miniatura — y su ficha de modelo es inusualmente directa sobre lo que no es: sin llamadas a herramientas, sin bucle de razonamiento, con indicaciones de sistema activamente desaconsejadas. Este es un artículo de «lo que sabemos hasta ahora», por lo que cada cifra a continuación está etiquetada: lo que establece el propio repositorio, lo que Cohere afirma pero nadie ha reproducido, y lo que aporta la única revisión de terceros publicada hasta ahora.

Lo que Cohere realmente lanzó

Todo en esta sección se lee directamente del repositorio: config.json, el README y la ficha del modelo. Estas son las fuentes primarias de Cohere, y para la mayor parte de lo que se sabe sobre el modelo, son las únicas fuentes.

• Tamaño: 2.4 mil millones de parámetros en total: un codificador visual de ~400 millones más un modelo de lenguaje «North Micro LLM» de 2 mil millones, en bfloat16, aproximadamente 4.97 GB de pesos.

• Licencia — Apache 2.0, comercialmente permisiva, pesos y tokenizador abiertos

• Codificador de visión — entrenado a medida para resolución nativa, inicializado desde SigLIP 2 SO400M

• Modelo de lenguaje — el LLM North Micro 2B interno que sigue la arquitectura Command A+: tres capas de atención de ventana deslizante intercaladas con una capa de atención global, atención de consulta agrupada (16 cabezas de consulta sobre 8 cabezas KV), embeddings atados, vocabulario de 262 144 tokens

• Proyector — "DeepStack": los embeddings de parches de varias capas del codificador de visión se inyectan en las primeras capas de lenguaje en lugar de anteponerse una sola vez, lo que permite que el texto pequeño y la geometría de las tablas sobrevivan.

• Resolución: entrada de resolución nativa con la proporción de aspecto conservada, hasta aproximadamente 1654 × 2339 píxeles, lo que equivale a una página A4 a unos 200 DPI.

• Contexto — 128K de contexto de texto en la columna vertebral del lenguaje; 8K de contexto multimodal validado (detalles a continuación)

• Idiomas — 11 compatibles: inglés, chino, alemán, francés, español, italiano, portugués, hindi, japonés, coreano, árabe

El sufijo "Instruct" es importante. Este es el checkpoint ajustado por instrucciones — un modelo de chat y QA visual — y, al momento de escribir esto, es el único checkpoint. El árbol del modelo ya enumera once cuantizaciones de la comunidad y tres fine-tunes, pero no se ha publicado ninguna variante base separada bajo un nombre diferente.

Por qué la arquitectura merece un párrafo

La mayoría de los VLM de 2-3B reducen la escala de tu imagen a una cuadrícula fija y pierden la letra pequeña. La apuesta de North Micro Vision es la contraria: mantener la resolución, gastar los tokens. El codificador visual usa 2D RoPE más embeddings posicionales 1D aprendidos, y el proyector DeepStack alimenta los embeddings de parches en múltiples capas del lenguaje en lugar de un único prepend, que es como sobrevive una tabla densamente poblada o una nota al pie. La codificación posicional es mRoPE intercalado, por lo que el recuento de tokens visuales escala con la resolución de la imagen en lugar de estar limitado por un valor preestablecido.

Esa elección es el producto completo — y tiene un costo. El análisis de lanzamiento de RohitAI estima que una página A4 nativa a máxima resolución equivale a aproximadamente 3.800 posiciones visuales fusionadas. Lee esa cifra junto a la advertencia de contexto a continuación: 3.800 tokens visuales más un prompt pueden ocupar una gran parte de la ventana multimodal validada antes de que hayas formulado tu pregunta.

La ficha de benchmark, leída honestamente

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

Todas las cifras de esta sección son informadas por el proveedor. Ninguna ha sido reproducida por un laboratorio independiente, y el modelo no aparece aún en ningún leaderboard público. Sobre el papel, el récord es genuinamente sólido en los puntos que Cohere destaca:

• DocVQA — 0.921 (respuesta a preguntas visuales sobre documentos)

• ChartQA — 0.808 (lectura de gráficos)

• OCRBench — 0.792 (OCR en el mundo real)

• RefCOCO grounding — 0.732 P@1 promedio (señalando objetos)

• MMMU — 0.329 (conocimiento multimodal de nivel universitario — el punto débil, como era de esperar a este tamaño)

• IFEval — 0.749 (seguimiento de instrucciones)

El marco de lanzamiento de Cohere afirma que North Micro Vision supera a Gemma 4 E2B y a Ministral 3 3B "en una serie de puntos de referencia de comprensión visual", con la fortaleza concentrada en la comprensión de documentos y la pregunta-respuesta visual. Esa es la afirmación de Cohere sobre el modelo de Cohere: trátala como tal. Un matiz: la comparación de Cohere contra la familia de Liquid usó el checkpoint de 1.6B, no el de 3B, por lo que no hay una comparación válida North-vs-LFM2.5-VL-3B en la ficha, aunque los dos modelos competirán por el mismo presupuesto de documentos de borde.

La única prueba de terceros publicada hasta ahora — la ejecución de un solo bloguero, no un conjunto de pruebas de laboratorio — añade la imagen que la tarjeta omite. Informa de que North Micro Vision supera a Ministral 3 3B Instruct en cinco de siete líneas de documentos, gráficos y OCR, lo que coincide con el encuadre del proveedor. Pero también informa de que Qwen3.5-2B supera a North Micro Vision en seis de esas siete líneas y en todas las líneas divulgadas de VQA general, razonamiento, conteo, alucinación y conocimiento textual; la única victoria de North Micro Vision sobre Qwen3.5-2B en ese conjunto es AI2D. Y English OCRBench v2 se sitúa en 0.367 frente al OCRBench principal de 0.792 — un recordatorio de que las puntuaciones de OCR dependen en gran medida de qué partición y qué dificultad se utilicen. Una sola ejecución no es un veredicto, pero es la primera evidencia de que el verdadero competidor de North Micro Vision en este tamaño es la familia Qwen 3.5, no los modelos que Cohere eligió como punto de referencia.

Una ventana de contexto, dos números

La tarjeta enumera 128K de contexto de texto y 8K de contexto multimodal validado, y la brecha entre ambos está haciendo un trabajo real. La cifra de 128K pertenece únicamente al backbone de lenguaje; las indicaciones de imagen más texto que superan los 8K tokens nunca se entrenaron ni validaron, por lo que cualquier cosa más allá de esa línea es extrapolación. Con una página A4 densa que consume aproximadamente 3.800 posiciones visuales, puedes alcanzar esa ventana de 8K con un documento y una pregunta corta. La consecuencia práctica: planifica tu pipeline en torno a recortar páginas en regiones —la tabla, el bloque de firma, una sola factura— en lugar de alimentar páginas completas y esperar un largo ida y vuelta sobre ellas.

Lo que la tarjeta del modelo te dice que no hagas

North Micro Vision es una capa de percepción, no un agente, y Cohere es refrescantemente explícito al respecto. La ficha dice que el modelo no es un modelo de razonamiento, tiene capacidad limitada en matemáticas y código, no admite llamadas a herramientas ni flujos de trabajo agénticos y no debe reemplazar a un asistente general más grande. Va un paso más allá de la mayoría de las fichas: recomienda no usar prompts de sistema, porque el modelo no fue entrenado con ellos. Tampoco hay puntuaciones de confianza calibradas. El diseño que esto implica es una división: North Micro Vision lee y extrae, un esquema es dueño de la estructura, las reglas son dueñas de los invariantes, un modelo más potente maneja las peticiones ambiguas y un humano aprueba cualquier cosa de consecuencia. Trata el texto de la página como datos, nunca como política — una instrucción escaneada enterrada en un documento es exactamente el tipo de inyección visual de prompts contra la que esta división protege.

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

Cómo ejecutarlo hoy

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

El inicio rápido es honesto acerca de su propia fricción: la tarjeta del modelo requiere Transformers 5.16.0, que no era la versión estable más reciente en PyPI el día del lanzamiento, por lo que los primeros usuarios instalan desde el código fuente. El soporte público de vLLM aparece como «próximamente»; Cohere evaluó con una compilación interna de vLLM. Por lo demás, el soporte del ecosistema desde el primer día es bueno: recetas de NVIDIA NeMo AutoModel para implementación en el borde y en GPU, recetas de Axolotl QLoRA y de ajuste fino completo, y cuantizaciones MLX de la comunidad para Apple Silicon: la versión de 4 bits ocupa unos 2,17 GB. Una trampa de implementación que merece la pena mencionar: establece max_pixels explícitamente, porque sequence_len no limita los tokens de imagen y, sin ello, puedes exceder la ventana multimodal validada sin querer.

North Micro Vision no está en OrcaRouter, y según su propia ficha no está en ningún proveedor de inferencia — esta es una historia de autoalojamiento, y punto. Que es exactamente por lo que la capa de enrutamiento importa en la siguiente frase: en el momento en que cualquier proveedor levante un endpoint para ella, un router es lo que te permite poner un modelo Apache-2.0 de hace días junto a los que ya usas en producción — una API, sin contrato nuevo, precio de lista del proveedor transmitido con 0% de margen, y conmutación automática por error para que un modelo no probado pueda recibir tráfico real mientras uno probado atrapa las llamadas que falla. Hasta que ese endpoint exista, la comparación que realmente puedes ejecutar hoy es la que se hace entre este checkpoint y los modelos de documentos alojados que ya pagas, lado a lado en tus propias páginas.

Quién debería moverse, y quién debería esperar

Muévete si tienes un trabajo acotado de extracción de documentos — facturas, extractos bancarios, contratos, formularios estructurados — y requisitos de residencia de datos o auditoría que hacen que una API alojada sea poco atractiva. Apache 2.0, adaptación de dominio QLoRA barata y un codificador de resolución nativa son una combinación genuinamente inusual para esa carga de trabajo, y las limitaciones de la propia tarjeta son lo bastante claras como para que no te lleves sorpresas. Espera si necesitas un endpoint alojado, precios por token o comportamiento agéntico — nada de eso existe todavía. Y espera antes de tratar cualquier punto de referencia anterior como definitivo: cada cifra destacada es de Cohere, la única ejecución externa pinta un panorama más disputado en la cima de la clase de modelos pequeños, y el modelo lleva menos de una semana disponible. Lo que hay que observar es la historia del servicio: el día en que los Transformers estándar y un lanzamiento público de vLLM lo soporten, North Micro Vision deja de ser un repositorio con el que tienes que pelearte y se convierte en un modelo que simplemente puedes apuntar a tus documentos.