
PixelUMM vs North Micro Vision Instruct: un modelo de investigación no comercial frente a un lector de 2.4B que puedes lanzar
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Pon North Micro Vision Instruct y PixelUMM uno al lado del otro y la diferencia de tamaño es casi una distracción: 2,4 mil millones de parámetros para el lector de resolución nativa de Cohere frente a 15,2 mil millones para el modelo unificado de NVIDIA. El eje interesante es el codificador. North Micro Vision Instruct está construido de la manera convencional —un codificador de visión de 400M inicializado desde SigLIP 2 SO400M, que alimenta a un modelo de lenguaje de 2B, envuelto en un vocabulario de 262.144 tokens y distribuido bajo Apache-2.0. PixelUMM se basa en el argumento de que esta misma disposición es el cuello de botella, y elimina el codificador: parches de píxeles en bruto de 16×16 entran en una columna vertebral Qwen3-8B mediante proyecciones lineales de una sola capa, y los mismos pesos generan video además de responder preguntas sobre él. Uno es un dispositivo de lectura especializado que puedes descargar y desplegar hoy. El otro es una tesis de investigación con un enlace de descarga y una licencia que lo mantiene fuera de los productos.
Los números de ambos modelos que aparecen a continuación son de sus propios laboratorios. Ninguno ha sido reproducido de forma independiente, y los dos publican suites de benchmarks diferentes, por lo que el solapamiento es más estrecho de lo que parece.
El caso de la arquitectura aburrida
North Micro Vision Instruct se publicó en Hugging Face el 10 de agosto de 2026, ha tenido ocho semanas para acumular usuarios y, a principios de octubre, mostraba aproximadamente 180.000 descargas y 150 me gusta: un orden de magnitud más de atención que el repositorio de PixelUMM, que apenas tenía unos días. Su propuesta es concreta y poco glamurosa: la mayoría de los modelos de visión reducen la escala de una imagen a una cuadrícula fija y pierden el detalle fino del que dependen los documentos, así que este procesa imágenes a resolución nativa, preservando la relación de aspecto y el texto pequeño.
• Parámetros — 2,4B en total: un modelo de lenguaje de 2B más un codificador visual de 400M entrenado a medida a partir de SigLIP 2 SO400M.
• Contexto — un backbone de lenguaje de 128K tokens, pero un rango operativo multimodal validado de unos 8K tokens. La ficha es explícita en que los contextos multimodales más largos dependen de la extrapolación y no cuentan con benchmarks.
• Entradas y salidas — texto e imágenes intercalados de entrada, texto de salida. Multilingüe en más de once idiomas. Sin generación de ningún tipo.
• Puntuaciones declaradas — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, todas declaradas por Cohere y sin reproducir. MMMU 0.329, algo que la ficha no oculta: este es un especialista en lectura, no un generalista en razonamiento.
• Despliegue — Transformers 5.16.0 y un acelerador, una única GPU moderna de 2.4B en bfloat16, con Flash Attention 2 opcional en lugar de obligatorio.
Nada de ese diseño es novedoso. También es la razón por la que se puede descargar, ajustar y poner delante de documentos reales esta semana.

El argumento en contra, presentado por la otra parte
El preprint de PixelUMM comienza nombrando el costo de esa arquitectura. Un transformer de visión congelado y preentrenado en web proporciona características semánticas para la comprensión; un VAE separado proporciona latentes orientados a la reconstrucción para la generación; cargar ambos aproximadamente duplica el contexto visual por imagen de condicionamiento y obliga a reconstruir los pipelines de preentrenamiento de visión-lenguaje en torno a un segundo flujo. North Micro Vision Instruct evita la duplicación solo al rechazar por completo la segunda tarea —no genera, así que necesita una interfaz, no dos.
PixelUMM lleva el argumento hasta su conclusión. Sin codificador, sin VAE, sin tokenizador: parches de píxeles de 16×16 para imágenes, tubelets espaciotemporales de 4 fotogramas para vídeo, ambos llegando a un Transformer de solo decodificador mediante proyecciones lineales de una sola capa, con comprensión mediante texto autorregresivo y generación mediante flow matching en el espacio de píxeles. Sus ocho secciones empíricas son estudios de decisiones de diseño más que victorias en tablas de clasificación —tamaño del parche, artefactos del parche, dinámicas de entrenamiento en espacio de píxeles frente a espacio VAE, escalado de cómputo—, que es un artículo que pregunta si el paradigma se sostiene, no uno que afirme que ya ha ganado.
• Ruta visual — North Micro Vision Instruct: codificador de visión preentrenado de 400M a resolución nativa. PixelUMM: sin codificador; parches sin procesar mediante una proyección lineal.
• Qué puede hacer — North Micro Vision Instruct: leer imágenes y documentos, responder en texto, fundamentar y subtitular. PixelUMM: leer imágenes y video, y generar imágenes y video de 4 segundos a partir de texto.
• Escala — 2.4B de parámetros densos frente a aproximadamente 15.2B en total sobre una base Qwen3-8B, que aparece como "8B MoT" en las propias tablas del artículo.
• Licencia — Apache-2.0 en el código y los pesos frente a Apache-2.0 en el código con la NVIDIA One-Way Noncommercial License en el checkpoint.

Leyendo honestamente los dos marcadores
Los dos modelos publican benchmarks diferentes, y donde coinciden las escalas difieren.
• DocVQA — North Micro Vision Instruct 0,921 como fracción de precisión. PixelUMM 90,42 como porcentaje. Mismo nombre de benchmark, distintas divisiones y configuraciones de prompt, y solo uno de los dos alega el manejo de resolución nativa como la razón.
• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. De nuevo, aproximadamente la misma banda una vez que dejas de comparar las cadenas sin procesar.
• OCRBench — North Micro Vision Instruct 0,792. PixelUMM 78,00.
• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Ambos son bajos para los estándares de los grandes modelos de visión y lenguaje, y ambos laboratorios los reportan sin adornos.
• solo PixelUMM — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 con un reescritor de prompts, calidad de VBench Parte 1 84.10.
• North Micro Vision Instruct-only — fundamentación (grounding), subtitulado y tareas con múltiples imágenes; una ausencia documentada de llamadas a herramientas y, explícitamente, ningún comportamiento agéntico.
Lo llamativo de la superposición es lo cerca que llega un especialista de 2.4B de un generalista de 15.2B en la lectura de documentos y gráficos. Eso no es evidencia de que el enfoque sin codificador fracase — es evidencia de que la lectura de documentos es una tarea en la que un codificador compacto de resolución nativa encaja muy bien, y la arquitectura de PixelUMM apunta a un argumento diferente. El propio artículo de PixelUMM concede el punto en una frase que vale la pena citar: dado que los datos de entrenamiento difieren entre modelos, sus resultados “no pueden establecer qué arquitectura es superior”.
Donde realmente recae la decisión
Si tienes documentos, gráficos, formularios o capturas de pantalla y necesitas respuestas este mes, North Micro Vision Instruct es la opción práctica, y no hay comparación: Apache-2.0, 2.4B, una ruta de carga estándar de Transformers, sin entorno de guardarraíles, sin índice de checkpoints distribuidos, sin una segunda pila de Python. Hazle un ajuste fino con tu propia distribución de documentos y tendrás un especialista. La advertencia es el alcance: dirígelo a una tarea de razonamiento y el número de MMMU te encontrará.
La propuesta de PixelUMM es amplitud y una pregunta de investigación. Lee y genera, imagen y vídeo, a partir de un único conjunto de pesos, y es, con diferencia, la lectura más interesante. Pero su checkpoint está bajo una licencia no comercial, sus pesos son 128 fragmentos de checkpoint distribuidos detrás de un índice de metadatos oculto que suma alrededor de 30 GB, requiere un kit de herramientas CUDA 13 con FlashAttention compilado desde el código fuente, y su ruta de texto a vídeo ejecuta las barreras de seguridad de Cosmos, que necesitan un repositorio con acceso restringido y un entorno separado. Eso es un banco de laboratorio, no un despliegue.
El aspecto del enrutamiento llega más tarde, si es que llega. Ninguno de los modelos está disponible a través de ninguna API alojada hoy — OrcaRouter no enruta ninguno — y ninguno lo estará hasta que su licencia lo permita. Cuando un modelo como North Micro Vision Instruct aparezca detrás de un endpoint compartido, la razón para preferirlo frente a una integración directa es la habitual: una clave para 200+ modelos, los precios de lista de los proveedores transferidos con un 0% de margen, conmutación por error que degrada a un modelo que rinde por debajo de su ficha, y ningún segundo contrato que negociar cuando quieras hacer una prueba A/B de un reemplazo. Eso es una descripción del flujo de trabajo, no una afirmación sobre la disponibilidad.
La única prueba que los separaría
Ejecuta ambos sobre el mismo conjunto de documentos a la misma resolución y puntúa los casos de texto pequeño; luego cambia una variable: elimina el codificador de visión de la comparación alimentando a PixelUMM con sus entradas en resolución nativa. Si el modelo sin codificador se mantiene a la altura con texto denso a una fracción del coste en parámetros, esa es la evidencia más sólida posible para la tesis, y es una prueba que cualquiera con una tarjeta de sobra puede ejecutar, porque ambos checkpoints se pueden descargar. Hasta que alguien lo haga, el resumen pragmático sigue en pie: un pequeño lector Apache-2.0 es el que despliegas, y un gran generalista no comercial es el que estudias.
