
PixelUMM vs North Micro Vision Instruct: Um modelo de pesquisa não comercial contra um leitor de 2,4 bilhões que você pode lançar
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Coloque North Micro Vision Instruct e PixelUMM lado a lado e a diferença de tamanho é quase uma distração: 2,4 bilhões de parâmetros para o leitor de resolução nativa da Cohere contra 15,2 bilhões para o modelo unificado da NVIDIA. O eixo interessante é o codificador. O North Micro Vision Instruct é construído da forma convencional — um codificador de visão de 400M inicializado a partir do SigLIP 2 SO400M, alimentando um modelo de linguagem de 2B, envolvido num vocabulário de 262.144 tokens e distribuído sob a Apache-2.0. O PixelUMM baseia-se no argumento de que exatamente este arranjo é o gargalo, e elimina o codificador: patches de pixels brutos de 16×16 entram num backbone Qwen3-8B através de projeções lineares de camada única, e os mesmos pesos geram vídeo, além de responder a perguntas sobre ele. Um é um dispositivo de leitura especializado que pode baixar e implantar hoje. O outro é uma tese de pesquisa com um link de download e uma licença que o mantém fora dos produtos.
Os números de ambos os modelos abaixo são dos próprios laboratórios. Nenhum foi reproduzido de forma independente, e os dois publicam conjuntos de benchmarks diferentes, pelo que a sobreposição é mais estreita do que parece.
Em defesa da arquitetura chata
North Micro Vision Instruct foi publicado no Hugging Face em 10 de agosto de 2026, teve oito semanas para acumular usuários e, no início de outubro, mostrava cerca de 180.000 downloads e 150 curtidas — uma ordem de magnitude a mais de atenção do que o repositório com poucos dias do PixelUMM. Sua proposta é específica e sem glamour: a maioria dos modelos de visão reduz a imagem para uma grade fixa e perde os detalhes finos dos quais os documentos dependem, então este processa imagens em resolução nativa, preservando a proporção e textos pequenos.
• Parâmetros — 2,4B no total: um modelo de linguagem de 2B mais um codificador de visão de 400M treinado sob medida a partir do SigLIP 2 SO400M.
• Contexto — um backbone de linguagem de 128K tokens, mas com uma faixa operacional multimodal validada de cerca de 8K tokens. O card é explícito ao afirmar que contextos multimodais mais longos dependem de extrapolação e não foram avaliados por benchmarks.
• Entradas e saídas — texto e imagens intercalados como entrada, texto como saída. Multilíngue em mais de onze idiomas. Nenhum tipo de geração.
• Pontuações reportadas — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, todas reportadas pela Cohere e não reproduzidas. MMMU 0.329, o que o cartão não esconde: este é um especialista em leitura, não um generalista em raciocínio.
• Implantação — Transformers 5.16.0 e um acelerador, uma única GPU moderna para 2,4B em bfloat16, Flash Attention 2 opcional em vez de obrigatório.
Nada nesse design é novidade. É também a razão pela qual ele pode ser baixado, passar por ajuste fino e ser colocado diante de documentos reais esta semana.

O argumento contra isso, apresentado pelo outro lado
O preprint da PixelUMM abre nomeando o custo dessa arquitetura. Um vision transformer congelado, pré-treinado na web, fornece características semânticas para a compreensão; um VAE separado fornece latentes orientados à reconstrução para a geração; carregar ambos praticamente dobra o contexto visual por imagem de condicionamento e força pipelines de pré-treinamento de visão-linguagem a serem reconstruídos em torno de um segundo fluxo. O North Micro Vision Instruct evita a duplicação apenas ao recusar completamente a segunda tarefa — ele não gera, então precisa de uma interface, não de duas.
O PixelUMM leva o argumento até suas últimas consequências. Sem encoder, sem VAE, sem tokenizer: patches de pixels 16×16 para imagens, tubelets espaçotemporais de 4 quadros para vídeo, ambos chegando a um Transformer somente decodificador por meio de projeções lineares de camada única, com compreensão por texto autorregressivo e geração por flow matching no espaço de pixels. Suas oito seções empíricas são estudos de escolhas de design, e não vitórias em rankings — tamanho do patch, artefatos de patch, dinâmica de treinamento no espaço de pixels versus no espaço do VAE, escalonamento de computação —, o que faz dele um artigo que pergunta se o paradigma se sustenta, não um que afirma que ele já venceu.
• Caminho visual — North Micro Vision Instruct: encoder de visão pré-treinado de 400M em resolução nativa. PixelUMM: sem encoder; patches brutos por meio de uma projeção linear.
• O que ele pode fazer — North Micro Vision Instruct: ler imagens e documentos, responder em texto, localizar e legendar. PixelUMM: ler imagens e vídeo, e gerar imagens e vídeo de 4 segundos a partir de texto.
• Escala — 2,4B densos versus cerca de 15,2B no total sobre um backbone Qwen3-8B, representado como "8B MoT" nas próprias tabelas do artigo.
• Licença — Apache-2.0 no código e nos pesos versus Apache-2.0 no código com a NVIDIA One-Way Noncommercial License no checkpoint.

Lendo os dois placares com honestidade
Os dois modelos publicam benchmarks diferentes e, onde eles se sobrepõem, as escalas diferem.
• DocVQA — North Micro Vision Instruct 0.921 como fração de acurácia. PixelUMM 90,42 como porcentagem. Mesmo nome de benchmark, divisões e configurações de prompt diferentes, e apenas um dos dois afirma o tratamento em resolução nativa como o motivo.
• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Novamente, aproximadamente a mesma faixa quando você para de comparar as strings brutas.
• OCRBench — North Micro Vision Instruct 0,792. PixelUMM 78,00.
• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Ambos baixos pelos padrões dos grandes modelos de visão e linguagem, e ambos os laboratórios os relatam sem embelezamento.
• PixelUMM-only — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 com um reescritor de prompt, VBench Parte 1 qualidade 84.10.
• North Micro Vision Instruct-only — grounding, legendagem e tarefas com várias imagens; ausência documentada de chamada de ferramentas e, explicitamente, nenhum comportamento agêntico.
O que chama a atenção nessa sobreposição é o quão perto um especialista de 2,4 bilhões chega de um generalista de 15,2 bilhões na leitura de documentos e gráficos. Isso não é evidência de que a abordagem sem encoder falha — é evidência de que a leitura de documentos é uma tarefa para a qual um encoder compacto de resolução nativa se adapta muito bem, e a arquitetura do PixelUMM visa a um argumento diferente. O próprio artigo do PixelUMM admite esse ponto numa frase que vale a pena citar: como os dados de treinamento diferem entre os modelos, seus resultados “não podem estabelecer qual arquitetura é superior”.
Onde a decisão realmente recai
Se você tem documentos, gráficos, formulários ou capturas de tela e precisa de respostas este mês, North Micro Vision Instruct é a escolha prática, e não há comparação: Apache-2.0, 2.4B, um caminho de carregamento padrão do Transformers, sem ambiente de guardrail, sem índice de checkpoint distribuído, sem uma segunda stack Python. Faça fine-tune nele na sua própria distribuição de documentos e você terá um especialista. A ressalva é o escopo — aponte-o para uma tarefa de raciocínio e o número do MMMU vai te encontrar.
A oferta do PixelUMM é amplitude e uma questão de pesquisa. Ele lê e gera, imagem e vídeo, a partir de um único conjunto de pesos, e é a leitura mais interessante por uma margem ampla. Mas seu checkpoint está sob uma licença não comercial, seus pesos são 128 fragmentos de checkpoint distribuídos atrás de um índice de metadados oculto totalizando cerca de 30 GB, ele exige um kit de ferramentas CUDA 13 com FlashAttention compilado a partir do código-fonte, e seu caminho de texto para vídeo executa salvaguardas Cosmos que precisam de um repositório com acesso restrito e um ambiente separado. Isso é uma bancada de laboratório, não uma implantação.
O aspecto do roteamento chega mais tarde, se é que chega. Nenhum dos dois modelos está disponível por meio de qualquer API hospedada hoje — OrcaRouter não roteia nenhum dos dois — e nenhum dos dois estará até que o licenciamento deles permita. Quando um modelo como o North Micro Vision Instruct de fato aparecer atrás de um endpoint compartilhado, o motivo para preferir isso a uma integração direta é o de sempre: uma única chave para mais de 200 modelos, preços de tabela dos provedores repassados com 0% de markup, failover que rebaixa um modelo que tem desempenho inferior ao indicado em sua ficha, e nenhum segundo contrato para negociar quando você quiser testar A/B um substituto. Isso é uma descrição do fluxo de trabalho, não uma afirmação sobre disponibilidade.
O único teste que os separaria
Execute ambos no mesmo conjunto de documentos, na mesma resolução, e pontue os casos de texto pequeno; depois, inverta uma variável: retire o codificador de visão da comparação, alimentando o PixelUMM com entradas em sua resolução nativa. Se o modelo sem codificador se mantiver em texto denso a uma fração do custo de parâmetros, essa será a evidência mais forte possível para a tese — e é um teste que qualquer pessoa com uma placa sobrando pode executar, porque ambos os checkpoints são baixáveis. Até que alguém faça isso, o resumo pragmático se mantém: um pequeno leitor Apache-2.0 é o que você implanta, e um generalista grande não comercial é o que você estuda.
