Uma cartela de título gerada no estilo institucional da OrcaRouter, com o texto “PixelUMM vs North Micro Vision Instruct”, com quatro blocos de estatísticas: “2.4B” (parâmetros totais do North Micro Vision Instruct), “~180k” (seus downloads no Hugging Face até o início de outubro), “0.921 / 90.42” (seu DocVQA como uma fração de acurácia em comparação com a porcentagem do PixelUMM) e “Apache-2.0” (sua licença de código e pesos, em comparação com o checkpoint não comercial do PixelUMM). Uma linha de rodapé diz “Números reportados pelo fornecedor; sem reexecução independente de qualquer um dos modelos.”. O logotipo da OrcaRouter é composto na faixa com preenchimento no canto inferior direito.
Guides & Insights

PixelUMM vs North Micro Vision Instruct: Um modelo de pesquisa não comercial contra um leitor de 2,4 bilhões que você pode lançar

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque North Micro Vision Instruct e PixelUMM lado a lado e a diferença de tamanho é quase uma distração: 2,4 bilhões de parâmetros para o leitor de resolução nativa da Cohere contra 15,2 bilhões para o modelo unificado da NVIDIA. O eixo interessante é o codificador. O North Micro Vision Instruct é construído da forma convencional — um codificador de visão de 400M inicializado a partir do SigLIP 2 SO400M, alimentando um modelo de linguagem de 2B, envolvido num vocabulário de 262.144 tokens e distribuído sob a Apache-2.0. O PixelUMM baseia-se no argumento de que exatamente este arranjo é o gargalo, e elimina o codificador: patches de pixels brutos de 16×16 entram num backbone Qwen3-8B através de projeções lineares de camada única, e os mesmos pesos geram vídeo, além de responder a perguntas sobre ele. Um é um dispositivo de leitura especializado que pode baixar e implantar hoje. O outro é uma tese de pesquisa com um link de download e uma licença que o mantém fora dos produtos.

Os números de ambos os modelos abaixo são dos próprios laboratórios. Nenhum foi reproduzido de forma independente, e os dois publicam conjuntos de benchmarks diferentes, pelo que a sobreposição é mais estreita do que parece.

Em defesa da arquitetura chata

North Micro Vision Instruct foi publicado no Hugging Face em 10 de agosto de 2026, teve oito semanas para acumular usuários e, no início de outubro, mostrava cerca de 180.000 downloads e 150 curtidas — uma ordem de magnitude a mais de atenção do que o repositório com poucos dias do PixelUMM. Sua proposta é específica e sem glamour: a maioria dos modelos de visão reduz a imagem para uma grade fixa e perde os detalhes finos dos quais os documentos dependem, então este processa imagens em resolução nativa, preservando a proporção e textos pequenos.

• Parâmetros — 2,4B no total: um modelo de linguagem de 2B mais um codificador de visão de 400M treinado sob medida a partir do SigLIP 2 SO400M.

• Contexto — um backbone de linguagem de 128K tokens, mas com uma faixa operacional multimodal validada de cerca de 8K tokens. O card é explícito ao afirmar que contextos multimodais mais longos dependem de extrapolação e não foram avaliados por benchmarks.

• Entradas e saídas — texto e imagens intercalados como entrada, texto como saída. Multilíngue em mais de onze idiomas. Nenhum tipo de geração.

• Pontuações reportadas — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, todas reportadas pela Cohere e não reproduzidas. MMMU 0.329, o que o cartão não esconde: este é um especialista em leitura, não um generalista em raciocínio.

• Implantação — Transformers 5.16.0 e um acelerador, uma única GPU moderna para 2,4B em bfloat16, Flash Attention 2 opcional em vez de obrigatório.

Nada nesse design é novidade. É também a razão pela qual ele pode ser baixado, passar por ajuste fino e ser colocado diante de documentos reais esta semana.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

O argumento contra isso, apresentado pelo outro lado

O preprint da PixelUMM abre nomeando o custo dessa arquitetura. Um vision transformer congelado, pré-treinado na web, fornece características semânticas para a compreensão; um VAE separado fornece latentes orientados à reconstrução para a geração; carregar ambos praticamente dobra o contexto visual por imagem de condicionamento e força pipelines de pré-treinamento de visão-linguagem a serem reconstruídos em torno de um segundo fluxo. O North Micro Vision Instruct evita a duplicação apenas ao recusar completamente a segunda tarefa — ele não gera, então precisa de uma interface, não de duas.

O PixelUMM leva o argumento até suas últimas consequências. Sem encoder, sem VAE, sem tokenizer: patches de pixels 16×16 para imagens, tubelets espaçotemporais de 4 quadros para vídeo, ambos chegando a um Transformer somente decodificador por meio de projeções lineares de camada única, com compreensão por texto autorregressivo e geração por flow matching no espaço de pixels. Suas oito seções empíricas são estudos de escolhas de design, e não vitórias em rankings — tamanho do patch, artefatos de patch, dinâmica de treinamento no espaço de pixels versus no espaço do VAE, escalonamento de computação —, o que faz dele um artigo que pergunta se o paradigma se sustenta, não um que afirma que ele já venceu.

• Caminho visual — North Micro Vision Instruct: encoder de visão pré-treinado de 400M em resolução nativa. PixelUMM: sem encoder; patches brutos por meio de uma projeção linear.

• O que ele pode fazer — North Micro Vision Instruct: ler imagens e documentos, responder em texto, localizar e legendar. PixelUMM: ler imagens e vídeo, e gerar imagens e vídeo de 4 segundos a partir de texto.

• Escala — 2,4B densos versus cerca de 15,2B no total sobre um backbone Qwen3-8B, representado como "8B MoT" nas próprias tabelas do artigo.

• Licença — Apache-2.0 no código e nos pesos versus Apache-2.0 no código com a NVIDIA One-Way Noncommercial License no checkpoint.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

Lendo os dois placares com honestidade

Os dois modelos publicam benchmarks diferentes e, onde eles se sobrepõem, as escalas diferem.

• DocVQA — North Micro Vision Instruct 0.921 como fração de acurácia. PixelUMM 90,42 como porcentagem. Mesmo nome de benchmark, divisões e configurações de prompt diferentes, e apenas um dos dois afirma o tratamento em resolução nativa como o motivo.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Novamente, aproximadamente a mesma faixa quando você para de comparar as strings brutas.

• OCRBench — North Micro Vision Instruct 0,792. PixelUMM 78,00.

• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Ambos baixos pelos padrões dos grandes modelos de visão e linguagem, e ambos os laboratórios os relatam sem embelezamento.

• PixelUMM-only — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 com um reescritor de prompt, VBench Parte 1 qualidade 84.10.

• North Micro Vision Instruct-only — grounding, legendagem e tarefas com várias imagens; ausência documentada de chamada de ferramentas e, explicitamente, nenhum comportamento agêntico.

O que chama a atenção nessa sobreposição é o quão perto um especialista de 2,4 bilhões chega de um generalista de 15,2 bilhões na leitura de documentos e gráficos. Isso não é evidência de que a abordagem sem encoder falha — é evidência de que a leitura de documentos é uma tarefa para a qual um encoder compacto de resolução nativa se adapta muito bem, e a arquitetura do PixelUMM visa a um argumento diferente. O próprio artigo do PixelUMM admite esse ponto numa frase que vale a pena citar: como os dados de treinamento diferem entre os modelos, seus resultados “não podem estabelecer qual arquitetura é superior”.

Onde a decisão realmente recai

Se você tem documentos, gráficos, formulários ou capturas de tela e precisa de respostas este mês, North Micro Vision Instruct é a escolha prática, e não há comparação: Apache-2.0, 2.4B, um caminho de carregamento padrão do Transformers, sem ambiente de guardrail, sem índice de checkpoint distribuído, sem uma segunda stack Python. Faça fine-tune nele na sua própria distribuição de documentos e você terá um especialista. A ressalva é o escopo — aponte-o para uma tarefa de raciocínio e o número do MMMU vai te encontrar.

A oferta do PixelUMM é amplitude e uma questão de pesquisa. Ele lê e gera, imagem e vídeo, a partir de um único conjunto de pesos, e é a leitura mais interessante por uma margem ampla. Mas seu checkpoint está sob uma licença não comercial, seus pesos são 128 fragmentos de checkpoint distribuídos atrás de um índice de metadados oculto totalizando cerca de 30 GB, ele exige um kit de ferramentas CUDA 13 com FlashAttention compilado a partir do código-fonte, e seu caminho de texto para vídeo executa salvaguardas Cosmos que precisam de um repositório com acesso restrito e um ambiente separado. Isso é uma bancada de laboratório, não uma implantação.

O aspecto do roteamento chega mais tarde, se é que chega. Nenhum dos dois modelos está disponível por meio de qualquer API hospedada hoje — OrcaRouter não roteia nenhum dos dois — e nenhum dos dois estará até que o licenciamento deles permita. Quando um modelo como o North Micro Vision Instruct de fato aparecer atrás de um endpoint compartilhado, o motivo para preferir isso a uma integração direta é o de sempre: uma única chave para mais de 200 modelos, preços de tabela dos provedores repassados com 0% de markup, failover que rebaixa um modelo que tem desempenho inferior ao indicado em sua ficha, e nenhum segundo contrato para negociar quando você quiser testar A/B um substituto. Isso é uma descrição do fluxo de trabalho, não uma afirmação sobre disponibilidade.

O único teste que os separaria

Execute ambos no mesmo conjunto de documentos, na mesma resolução, e pontue os casos de texto pequeno; depois, inverta uma variável: retire o codificador de visão da comparação, alimentando o PixelUMM com entradas em sua resolução nativa. Se o modelo sem codificador se mantiver em texto denso a uma fração do custo de parâmetros, essa será a evidência mais forte possível para a tese — e é um teste que qualquer pessoa com uma placa sobrando pode executar, porque ambos os checkpoints são baixáveis. Até que alguém faça isso, o resumo pragmático se mantém: um pequeno leitor Apache-2.0 é o que você implanta, e um generalista grande não comercial é o que você estuda.