
InternLumina-U2 vs North Micro Vision Instruct: Um leitor de documentos que você pode rodar hoje vs um modelo de 16B que ainda não chegou lá
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Se você precisa de um modelo que leia documentos, capturas de tela e gráficos esta semana, esta comparação tem uma resposta prática curta: o North Micro Vision Instruct é um modelo de pesos abertos de 2,4 bilhões de parâmetros da Cohere, lançado sob a licença Apache-2.0, disponível para download desde 10 de agosto de 2026 e bom o suficiente em tarefas de documentos para valer a pena apontá-lo para seus próprios arquivos hoje. O InternLumina-U2 é o modelo de difusão de 16 bilhões de parâmetros do Shanghai AI Laboratory — um design muito mais ambicioso que também afirma compreender gráficos e documentos, entre meia dúzia de outras tarefas — mas seus pesos não são públicos, seu repositório no Hugging Face é um stub vazio, e ninguém em lugar nenhum consegue executá-lo ainda. A resposta mais longa é sobre o que acontece quando dois modelos Apache-2.0 fazem afirmações sobrepostas sobre leitura, mas apenas um deles é algo que você pode segurar na mão.
O 2.4B que realmente existe
North Micro Vision Instruct é o especialista em visão da família North da Cohere: aproximadamente 2,4B de parâmetros no total, um modelo compacto projetado para ler em resolução nativa. O ponto de design é que a maioria dos modelos de visão reduz a escala das imagens para uma grade fixa e perde os detalhes finos em que os documentos se baseiam — por isso, o North Micro Vision Instruct aceita imagens em resolução nativa até cerca de uma página A4 a 200 dpi, preservando a proporção e o texto pequeno. Os números reportados pela Cohere são fortes para a classe de tamanho: DocVQA em 0,921, ChartQA em 0,808, OCRBench em 0,792, todos reportados pela Cohere e não reproduzidos, com um contexto multimodal validado em cerca de 8 mil tokens e um ponto fraco documentado no MMMU (0,329) — um lembrete de que é um especialista em leitura, não um generalista em raciocínio. Ele não tem API hospedada própria nem rota hospedada padrão; na prática, a questão é auto-hospedar um modelo de 2,4B, pequeno o suficiente para rodar em uma única GPU moderna de estação de trabalho. A adoção pela comunidade tem sido constante — a ficha do Hugging Face mostrava dezenas de milhares de downloads por mês no final de agosto.
O 16B que é uma promessa
InternLumina-U2 é um tipo diferente de artefato. O que o Shanghai AI Laboratory publicou em 1º de setembro de 2026 é código de inferência e uma arquitetura, não um modelo: um LLM de difusão com mistura esparsa de especialistas, 16B de parâmetros totais com 1B ativos, construído em torno de uma representação visual totalmente discreta de oito codebooks. Entre as seis famílias de tarefas cobertas pelo script principal do repositório — texto, compreensão de imagem, texto-para-imagem, edição de imagem, compreensão de vídeo, compreensão 3D — a compreensão de imagem inclui explicitamente gráficos densos e documentos. A tabela preliminar da página do projeto lista números de gráficos e documentos que o laboratório reporta na mesma faixa que o especialista afirma: ChartQA 86.52, CharXiv-DQ 83.65, juntamente com HallusionBench 62.15 e MathVision 33.22. A página chama os resultados de "preliminares, parciais"; o relatório técnico que traria as tabelas completas está marcado como em breve, e — o fato decisivo — não há pesos com os quais alguém possa verificar.
O placar
Cada figura abaixo é relatada pelo fornecedor. As do North Micro Vision Instruct são avaliação da própria Cohere; as do InternLumina-U2 são da tabela parcial preliminar do laboratório.
• Tamanho e formato — North Micro Vision Instruct: ~2.4B denso, leitor de resolução nativa. InternLumina-U2: 16B total / 1B ativo, MoE esparso, modelo de difusão discreto de múltiplos codebooks.
• O que ele faz — {{1}}North Micro Vision Instruct{{/1}}: lê imagens, documentos, gráficos e telas de UI; responde em texto, com fundamentação. {{2}}InternLumina-U2{{/2}}: afirma leitura plus geração — compreende imagens/vídeo/3D, gera e edita imagens.
• Pesos — North Micro Vision Instruct: públicos desde 10 de agosto de 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: não públicos; stub do Hugging Face vazio, pesos marcados como "em breve".
• Pontuações de leitura em destaque — North Micro Vision Instruct: DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 (relatado pela Cohere). InternLumina-U2: ChartQA 86,52, CharXiv-DQ 83,65, HallusionBench 62,15 (relatado pelo laboratório, preliminar).
• Contexto de documento — North Micro Vision Instruct: resolução nativa de até ~A4 a 200 dpi, ~8K de contexto multimodal validado. InternLumina-U2: gráficos densos e imagens naturais processados por meio do codificador multi-codebook AToken; contexto ainda não especificado.
• Fraquezas conhecidas — North Micro Vision Instruct: MMMU 0,329, sem chamada de ferramentas — um leitor, não um raciocinador ou um agente. InternLumina-U2: fica atrás de pelo menos um rival nomeado no GenEval (0,81 vs 0,89) em sua própria tabela parcial; tudo não verificado.
• Como executá-lo — North Micro Vision Instruct: auto-hospede um modelo de 2,4B; o suporte ao vLLM ainda estava sendo incorporado quando este texto foi escrito. InternLumina-U2: ninguém pode executá-lo — não há pesos, e o driver lançado requer um diretório de checkpoint e arquivos de tokenizador que não estão no repositório.

O mesmo benchmark, duas epistemologias muito diferentes
ChartQA é a maneira mais clara de ver a diferença entre as duas afirmações. Ambos os modelos reportam um número no ChartQA; North Micro Vision Instruct reporta 0,808 como uma fração de precisão, e InternLumina-U2 reporta 86,52 como uma porcentagem — o mesmo benchmark, essencialmente o mesmo resultado, em torno dos 80%, em escalas diferentes, ressalvadas as diferentes divisões de avaliação e configurações de prompt que tornam as comparações de ChartQA entre artigos enganosas mesmo quando ambos os modelos existem. A diferença epistêmica é o que importa: o 0,808 de North Micro Vision Instruct está vinculado a um artefato para download, de modo que qualquer equipe com uma GPU e um conjunto de gráficos pode reproduzi-lo ou refutá-lo esta semana. O 86,52 de InternLumina-U2 está vinculado a um roadmap. Um número que você não pode verificar é um número sobre o qual você não deve construir — que é exatamente a posição que o próprio laboratório reconhece ao rotular sua tabela como preliminar.

O cartão Hugging Face do CohereLabs/North-Micro-Vision-Instruct, capturado em 27 de agosto de 2026 — a descrição de visão-linguagem de resolução nativa de 2,4B, a licença Apache-2.0 e os benchmarks de leitura de documentos divulgados pela Cohere.
Ler, versus ler e desenhar
A diferença de filosofia arquitetural vale mais do que a diferença de benchmark. O North Micro Vision Instruct é um especialista restrito: ele lê, e faz esse único trabalho de forma barata o suficiente para que você possa executá-lo em toda página, todo screenshot, toda fatura de um pipeline, sem precisar ficar de olho na sua conta de GPU. Esse baixo custo é o recurso — inteligência documental em escala é tanto um problema de custo quanto de precisão. O InternLumina-U2 é a aposta oposta: um modelo esparso gigantesco que tenta fundir leitura com geração de imagens, edição de imagens, compreensão de vídeo e compreensão 3D em uma única interface compartilhada de tokens discretos, partindo da teoria de que compreensão e geração se reforçam mutuamente. Se funcionar, é uma classe diferente de ferramenta — mas esse "se funcionar" está carregando muito peso, e um MoE de difusão 16B-A1B com tokenizador personalizado e pré-processamento 3D renderizado no Blender nunca será o leitor barato e sempre ativo que um especialista de 2.4B é. Eles não são realmente substitutos. São uma ferramenta que você pode implantar hoje e uma direção de pesquisa para a qual você pode se preparar.

O repositório do GitHub InternLM/InternLumina-U2, capturado em 2 de setembro de 2026 — a página inicial do repositório com a descrição "Omni-Visual Understanding, Image Generation and Editing" e os scripts de inferência por tarefa; o caminho de compreensão de imagens entre eles é o que tem como alvo imagens naturais e gráficos densos.
O que isso significa se você está construindo um pipeline de documentos.
Nenhum dos dois modelos está hospedado no OrcaRouter — o North Micro Vision Instruct é um modelo auto-hospedado, sem API hospedada, e o InternLumina-U2 não tem pesos para que alguém o hospede — portanto, o ângulo de roteamento aqui não é "chamar os dois por meio de uma única chave hoje." É o padrão que você usaria no dia em que qualquer um deles mudar: um pipeline de documentos quase sempre emparelha um leitor barato com um raciocinador maior, e o valor de uma camada de roteamento está em expressar esse emparelhamento como uma única chamada e em manter a transparência do repasse com margem de 0% nos modelos hospedados que você usa. Quando um checkpoint Apache-2.0 como o InternLumina-U2 finalmente chega, a atitude sensata não é arrancar uma pilha de documentos que já funciona — é colocar o recém-chegado em um caminho de teste atrás de um failover automático, para que ele ganhe tráfego de produção ao sobreviver ao teste, e no momento em que falhar em um gráfico real, a chamada volta para o modelo que já se provou. Uma única API abrangendo mais de 200 modelos é o mecanismo; o failover é a rede de segurança; o especialista que você pode executar hoje é o que paga as contas enquanto a promessa de 16B ainda está sendo mantida.
O veredito
Para leitura de documentos e gráficos no aqui e agora, o North Micro Vision Instruct é o único dos dois que existe de modo utilizável — pequeno, Apache-2.0, baixável, com fortes pontuações relatadas pelo fornecedor, todas verificáveis por você mesmo. O InternLumina-U2 é o artefato mais interessante no longo prazo, porque está tentando fazer da leitura uma habilidade entre seis em um único modelo unificado e, se isso funcionar, muda o que “modelo de visão” significa. Acompanhe o repositório vazio dele no Hugging Face como acompanharia uma contagem regressiva de lançamento: no dia em que os arquivos safetensors aparecerem, a promessa se torna um modelo e a comparação se torna real. Até lá, ao tomar sua decisão, não deixe que um 86,52 relatado pelo fornecedor em um benchmark de gráficos tenha mais peso do que um 0,808 de um modelo baixável.
