
InternLumina-U2 vs North Micro Vision Instruct: Un lector de documentos que puedes ejecutar hoy vs un modelo de 16B que aún no está listo
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Si esta semana necesitas un modelo que lea documentos, capturas de pantalla y gráficos, esta comparación tiene una respuesta práctica breve: North Micro Vision Instruct es un modelo de pesos abiertos de 2.400 millones de parámetros de Cohere, publicado bajo Apache-2.0, descargable desde el 10 de agosto de 2026, y suficientemente bueno en tareas de documentos como para que valga la pena apuntarlo a tus propios archivos hoy mismo. InternLumina-U2 es el modelo de difusión de 16.000 millones de parámetros del Shanghai AI Laboratory — un diseño mucho más ambicioso que también afirma comprender gráficos y documentos, entre otras media docena de tareas — pero sus pesos no son públicos, su repositorio en Hugging Face es un stub vacío, y nadie en ningún lugar puede ejecutarlo todavía. La respuesta más larga trata sobre lo que ocurre cuando dos modelos con licencia Apache-2.0 hacen afirmaciones superpuestas sobre lectura, pero solo uno de ellos es algo que puedas sostener en la mano.
Los 2.4B que realmente existen
North Micro Vision Instruct es el especialista en visión de la familia North de Cohere: aproximadamente 2.4B de parámetros en total, un modelo compacto diseñado para leer en resolución nativa. El concepto de diseño es que la mayoría de los modelos de visión reducen la escala de las imágenes a una cuadrícula fija y pierden el detalle fino del que dependen los documentos — por lo que North Micro Vision Instruct acepta imágenes en su resolución nativa hasta aproximadamente una página A4 a 200 dpi, preservando la relación de aspecto y el texto pequeño. Las cifras reportadas por Cohere son sólidas para su clase de tamaño: DocVQA en 0.921, ChartQA en 0.808, OCRBench en 0.792, todas reportadas por Cohere y no reproducidas, con un contexto multimodal validado de alrededor de 8K tokens y un punto débil documentado en MMMU (0.329) — un recordatorio de que es un especialista en lectura, no un generalista en razonamiento. No tiene una API alojada propia ni una vía de alojamiento estándar; la solución práctica es autoalojar un modelo de 2.4B, que es lo suficientemente pequeño como para ejecutarse en una GPU de estación de trabajo moderna. La adopción por parte de la comunidad ha sido constante: la tarjeta de Hugging Face mostraba decenas de miles de descargas al mes a finales de agosto.
El 16B que es una promesa
InternLumina-U2 es un tipo diferente de artefacto. Lo que el Laboratorio de IA de Shanghái publicó el 1 de septiembre de 2026 es código de inferencia y una arquitectura, no un modelo: un LLM de difusión disperso de mezcla de expertos, con 16B de parámetros totales y 1B activos, construido en torno a una representación visual completamente discreta de ocho libros de códigos. Entre las seis familias de tareas que cubre el script principal del repositorio — texto, comprensión de imágenes, texto a imagen, edición de imágenes, comprensión de video, comprensión 3D — la comprensión de imágenes incluye explícitamente gráficos densos y documentos. La tabla preliminar de la página del proyecto enumera cifras de gráficos y documentos que el laboratorio reporta en el mismo rango que afirma el especialista: ChartQA 86.52, CharXiv-DQ 83.65, junto con un HallusionBench 62.15 y un MathVision 33.22. La página califica los resultados de «preliminares, parciales», el informe técnico que contendría las tablas completas está marcado como «próximamente» y — el hecho decisivo — no hay pesos con los que nadie pueda comprobarlos.
El marcador
Todas las cifras a continuación son reportadas por el proveedor. Las cifras de North Micro Vision Instruct son evaluación propia de Cohere; las de InternLumina-U2 son la tabla parcial preliminar del laboratorio.
• Tamaño y forma — North Micro Vision Instruct: ~2.4B denso, lector de resolución nativa. InternLumina-U2: 16B en total / 1B activo, MoE disperso, modelo de difusión discreto con múltiples libros de códigos.
• Lo que hace — North Micro Vision Instruct: lee imágenes, documentos, gráficos y pantallas de interfaz de usuario; responde en texto, con fundamento en el contenido. InternLumina-U2: afirma ofrecer lectura y generación — comprende imágenes/video/3D, genera y edita imágenes.
• Pesos — North Micro Vision Instruct: público desde el 10 de agosto de 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: no público; stub de Hugging Face vacío, pesos marcados como «próximamente».
• Puntuaciones de lectura principales — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (informado por Cohere). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (informado por laboratorio, preliminar).
• Contexto del documento — North Micro Vision Instruct: resolución nativa de hasta ~A4 a 200 ppp, contexto multimodal validado de ~8K. InternLumina-U2: los gráficos densos y las imágenes naturales se procesan mediante el codificador multicodebook AToken; contexto aún no especificado.
• Debilidades conocidas — North Micro Vision Instruct: MMMU 0.329, sin llamada a herramientas — un lector, no un razonador ni un agente. InternLumina-U2: va por detrás de al menos un rival nombrado en GenEval (0.81 vs 0.89) en su propia tabla parcial; todo sin verificar.
• Cómo ejecutarlo — North Micro Vision Instruct: aloja tu propio modelo de 2.4B; el soporte para vLLM aún estaba en desarrollo cuando se escribió esto. InternLumina-U2: nadie puede ejecutarlo — no hay pesos, y el controlador publicado necesita un directorio de checkpoint y archivos de tokenizador que no están en el repositorio.

El mismo benchmark, dos epistemologías muy diferentes
ChartQA es la forma más limpia de ver la diferencia entre las dos afirmaciones. Ambos modelos reportan un número de ChartQA; North Micro Vision Instruct reporta 0.808 como fracción de precisión, e InternLumina-U2 reporta 86.52 como porcentaje — el mismo benchmark, esencialmente el mismo resultado en la banda de los 80 medios a los 80 altos en diferentes escalas, más o menos las distintas divisiones de evaluación y configuraciones de prompt que hacen que las comparaciones de ChartQA entre artículos sean traicioneras incluso cuando ambos modelos existen. La diferencia epistémica es lo que importa: el 0.808 de North Micro Vision Instruct está vinculado a un artefacto descargable, así que cualquier equipo con una GPU y un conjunto de gráficos puede reproducirlo o refutarlo esta semana. El 86.52 de InternLumina-U2 está vinculado a una hoja de ruta. Un número que no puedes verificar es un número sobre el que no deberías construir — que es exactamente la posición que el propio laboratorio reconoce al etiquetar su tabla como preliminar.

La tarjeta de Hugging Face de CohereLabs/North-Micro-Vision-Instruct, capturada el 27 de agosto de 2026: la descripción de visión-lenguaje de resolución nativa de 2.4B, la licencia Apache-2.0 y los puntos de referencia de lectura de documentos reportados por Cohere.
Leer, versus leer y dibujar.
La brecha en la filosofía arquitectónica vale más que la brecha en los benchmarks. North Micro Vision Instruct es un especialista acotado: lee, y desempeña esa única tarea a un coste lo bastante bajo como para ejecutarlo en cada página, cada captura de pantalla y cada factura de un pipeline sin tener que vigilar la factura de tu GPU. Esa baratura es la característica: la inteligencia documental a escala es tanto un problema de coste como de precisión. InternLumina-U2 es la apuesta contraria: un enorme modelo disperso que intenta fusionar la lectura con la generación de imágenes, la edición de imágenes, la comprensión de vídeo y la comprensión 3D en una interfaz compartida de tokens discretos, bajo la teoría de que la comprensión y la generación se refuerzan mutuamente. Si funciona, es una herramienta de otra clase — pero «si funciona» está haciendo mucho trabajo pesado, y un MoE de difusión de 16B-A1B con un tokenizador personalizado y un preprocesado 3D renderizado con Blender nunca será el lector barato y siempre activo que es un especialista de 2.4B. No son realmente sustitutos: son una herramienta que puedes desplegar hoy y una línea de investigación para la que puedes prepararte.

El repositorio de GitHub InternLM/InternLumina-U2, capturado el 2 de septiembre de 2026 — la página principal del repositorio con la descripción "Omni-Visual Understanding, Image Generation and Editing" y los scripts de inferencia por tarea; entre ellos, la ruta de comprensión de imágenes es la que se centra en imágenes naturales y gráficos densos.
Lo que esto significa si estás construyendo un pipeline de documentos
Ninguno de los dos modelos está alojado en OrcaRouter — North Micro Vision Instruct es un modelo autoalojado sin API alojada, e InternLumina-U2 no tiene pesos que nadie pueda alojar —, así que aquí el enfoque de enrutamiento no es «llamarlos a ambos con una sola clave hoy». Es el patrón que usarías el día en que cualquiera de los dos cambie: un pipeline de documentos casi siempre empareja un lector barato con un razonador más grande, y el valor de una capa de enrutamiento es expresar ese emparejamiento como una sola llamada y mantener honesto el traspaso con margen del 0 % en los modelos alojados que sí usas. Cuando un checkpoint Apache-2.0 como InternLumina-U2 finalmente aterrice, lo sensato no es arrancar de cuajo un stack de documentos que ya funciona, sino poner al recién llegado en una ruta de prueba detrás de una conmutación automática por error, para que se gane el tráfico de producción sobreviviéndolo y, en el momento en que falle ante un gráfico real, la llamada recaiga en el modelo que ya ha demostrado su valía. Una API para más de 200 modelos es el mecanismo; la conmutación por error es la red de seguridad; el especialista que puedes ejecutar hoy es lo que paga las facturas mientras la promesa de los 16B se sigue cumpliendo.
El veredicto
Para la lectura de documentos y gráficos en el aquí y el ahora, North Micro Vision Instruct es el único de los dos que existe en un sentido utilizable: pequeño, con licencia Apache-2.0, descargable y con puntuaciones reportadas por el proveedor que de verdad puedes ir a comprobar. InternLumina-U2 es el artefacto más interesante a largo plazo, porque está intentando hacer de la lectura una habilidad entre seis dentro de un único modelo unificado, y si eso funciona, cambia lo que significa «modelo de visión». Observa su repositorio vacío de Hugging Face como observarías la cuenta regresiva de un lanzamiento: el día en que aparezcan los archivos safetensors, la promesa se convierte en modelo y la comparación se vuelve real. Hasta entonces, no dejes que un 86,52 reportado por el proveedor en un benchmark de gráficos supere en tu toma de decisiones a un 0,808 descargable.
