
North Micro Vision Instruct: O VLM de Documentos Silencioso de 2,4B da Cohere, Explicado
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 144 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
CohereLabs/North-Micro-Vision-Instruct — "North Micro Vision", para encurtar — é um modelo de visão-linguagem de 2,4 bilhões de parâmetros que foi lançado discretamente: os pesos apareceram no Hugging Face em 10 de agosto de 2026, o anúncio da Cohere veio em 12 de agosto, e um dia depois ainda não há API hospedada, nem lista de preços, nem entrada em ranking de terceiros. O North Micro Vision é feito para uma única tarefa — ler documentos em resolução nativa, como uma pessoa aperta os olhos para uma página A4 escaneada em vez de como um modelo de legenda olha para uma miniatura — e sua ficha técnica é incomumente direta sobre o que ele não é: sem chamada de ferramentas, sem ciclo de raciocínio, prompts de sistema ativamente desencorajados. Este é um artigo do tipo "o que sabemos até agora", então cada número abaixo está rotulado: o que o próprio repositório estabelece, o que a Cohere afirma mas ninguém reproduziu, e o que a única análise de terceiros publicada até agora acrescenta.
O que a Cohere realmente lançou
Tudo nesta seção é lido diretamente do repositório: config.json, o README e o model card. Estas são as fontes primárias da Cohere e, para a maior parte do que se sabe sobre o modelo, são as únicas fontes.
• Tamanho — 2,4B parâmetros no total: um codificador de visão de ~400M mais um modelo de linguagem "North Micro LLM" de 2B, em bfloat16, cerca de 4.97 GB de pesos.
• Licença — Apache 2.0, comercialmente permissiva, pesos e tokenizador abertos
• Codificador de visão — treinado sob medida para resolução nativa, inicializado a partir do SigLIP 2 SO400M
• Modelo de linguagem — o LLM North Micro 2B interno, seguindo a arquitetura Command A+: três camadas de atenção com janela deslizante intercaladas com uma camada de atenção global, atenção por consulta agrupada (16 cabeças de consulta sobre 8 cabeças KV), embeddings compartilhados, vocabulário de 262.144 tokens
Projetor — "DeepStack": embeddings de patch de várias camadas do codificador de visão são injetados nas camadas iniciais de linguagem, em vez de serem antepostos uma única vez, e é isso que permite que texto pequeno e geometria de tabelas sejam preservados.
• Resolução — entrada em resolução nativa com proporção de aspecto preservada, até cerca de 1654 × 2339 pixels, o que corresponde a uma página A4 a aproximadamente 200 DPI
• Contexto — 128K de contexto de texto na espinha dorsal da linguagem; 8K de contexto multimodal validado (detalhes abaixo)
• Idiomas — 11 suportados: inglês, chinês, alemão, francês, espanhol, italiano, português, hindi, japonês, coreano, árabe
O sufixo "Instruct" é importante. Este é o checkpoint ajustado por instruções — um modelo de chat e QA visual — e, até o momento em que escrevo, é o único checkpoint. A árvore de modelos já lista onze quantizações da comunidade e três fine-tunes, mas nenhuma variante base separada foi publicada sob um nome diferente.
Por que a arquitetura merece um parágrafo
A maioria dos VLMs de 2-3B reduz sua imagem para uma grade fixa e perde as letras miúdas. A aposta da North Micro Vision é o oposto: manter a resolução, gastar os tokens. O codificador visual usa RoPE 2D além de embeddings posicionais 1D aprendidos, e o projetor DeepStack alimenta embeddings de patches em múltiplas camadas de linguagem em vez de um único prepend, que é como uma tabela densamente compactada ou uma nota de rodapé sobrevive. A codificação posicional é mRoPE intercalado, então a contagem de tokens visuais escala com a resolução da imagem em vez de ser limitada por um valor predefinido.
Essa escolha é o produto inteiro — e tem um custo. A análise de lançamento da RohitAI estima que uma página A4 nativa na resolução máxima equivale a aproximadamente 3,800 posições visuais mescladas. Leia esse número junto com a ressalva de contexto abaixo: 3,800 tokens visuais mais um prompt podem preencher uma grande parte da janela multimodal validada antes mesmo de você fazer sua pergunta.
O cartão de benchmark, lido honestamente.

Cada número nesta seção é relatado pelo fornecedor. Nenhum foi reproduzido por um laboratório independente, e o modelo ainda não aparece em nenhum ranking público. No papel, o desempenho é genuinamente forte onde a Cohere o aponta:
• DocVQA — 0.921 (resposta a perguntas visuais sobre documentos)
• ChartQA — 0.808 (leitura de gráficos)
• OCRBench — 0.792 (OCR no mundo real)
• Grounding do RefCOCO — 0,732 de média P@1 (apontando para objetos)
• MMMU — 0,329 (conhecimento multimodal de nível universitário — o ponto fraco, como esperado para este tamanho)
• IFEval — 0.749 (seguimento de instruções)
A narrativa de lançamento da Cohere afirma que o North Micro Vision supera o Gemma 4 E2B e o Ministral 3 3B "em uma série de benchmarks de compreensão visual", com a força concentrada em compreensão de documentos e QA visual. Essa é a afirmação da Cohere sobre o modelo da Cohere — trate-a como tal. Um detalhe: a comparação da Cohere contra a família da Liquid usou o checkpoint de 1.6B, não o de 3B, portanto não há uma comparação válida North-vs-LFM2.5-VL-3B na ficha do modelo, mesmo que os dois modelos estejam competindo pelo mesmo orçamento de documentos na borda.
A única avaliação de terceiros publicada até agora — um teste de um único blogueiro, não uma suíte de laboratório — acrescenta o quadro que a ficha omite. Ela informa que a North Micro Vision supera a Ministral 3 3B Instruct em cinco das sete linhas de documentos, gráficos e OCR, o que corresponde ao enquadramento do fornecedor. Mas também informa que a Qwen3.5-2B supera a North Micro Vision em seis dessas sete linhas e em todas as linhas divulgadas de VQA geral, raciocínio, contagem, alucinação e conhecimento de texto; a única vitória da North Micro Vision sobre a Qwen3.5-2B nesse conjunto é a AI2D. E o English OCRBench v2 fica em 0,367 contra o OCRBench de destaque de 0,792 — um lembrete de que as pontuações de OCR dependem muito de qual split e qual dificuldade você executa. Uma execução não é um veredito, mas é a primeira evidência de que o verdadeiro concorrente da North Micro Vision nesse tamanho é a família Qwen 3.5, não os modelos que a Cohere escolheu como base de comparação.
Uma janela de contexto, dois números
O cartão lista 128K de contexto de texto e 8K de contexto multimodal validado, e a lacuna entre os dois está fazendo um trabalho real. O número de 128K pertence apenas ao backbone de linguagem; prompts de imagem mais texto além de 8K tokens nunca foram treinados ou validados, então qualquer coisa além desse limite é extrapolação. Como uma página A4 densa consome aproximadamente 3.800 posições visuais, você pode atingir essa janela de 8K com um documento e uma pergunta curta. A consequência prática: planeje seu pipeline em torno do recorte de páginas em regiões — a tabela, o bloco de assinatura, uma única fatura — em vez de alimentar páginas inteiras e esperar uma longa ida e volta sobre elas.
O que o cartão do modelo diz para você não fazer
North Micro Vision é uma camada de percepção, não um agente, e a Cohere é refrescantemente explícita sobre isso. O card afirma que o modelo não é um modelo de raciocínio, tem capacidade limitada de matemática e código, não suporta chamada de ferramentas nem fluxos de trabalho agênticos, e não deve substituir um assistente geral maior. Ele vai além da maioria dos cards: recomenda não usar prompts de sistema, pois o modelo não foi treinado com eles. Também não há pontuações de confiança calibradas. O design que isso implica é uma divisão: a North Micro Vision lê e extrai, um esquema detém a estrutura, regras detêm os invariantes, um modelo mais forte lida com as chamadas ambíguas, e um humano aprova qualquer coisa de consequência. Trate o texto na página como dados, nunca como política — uma instrução escaneada enterrada em um documento é exatamente o tipo de injeção visual de prompt contra a qual essa divisão protege.

Como executá-lo hoje

O quickstart é honesto sobre seu próprio atrito: a ficha do modelo exige Transformers 5.16.0, que não era a versão estável mais recente no PyPI no dia do lançamento, então os primeiros usuários instalam a partir do código-fonte. O suporte público a vLLM é listado como "em breve"; a Cohere avaliou com uma build interna de vLLM. Fora isso, o suporte de ecossistema no primeiro dia é bom: receitas NVIDIA NeMo AutoModel para implantação em edge e GPU, receitas Axolotl para QLoRA e fine-tuning completo, e quantizações comunitárias de MLX para Apple Silicon — a versão de 4 bits tem cerca de 2,17 GB. Uma armadilha de implantação que vale mencionar: defina max_pixels explicitamente, porque sequence_len não limita os tokens de imagem e, sem isso, você pode estourar a janela multimodal validada sem querer.
A North Micro Vision não está no OrcaRouter e, segundo seu próprio model card, não está em nenhum provedor de inferência — esta é uma história de auto-hospedagem, ponto final. É exatamente por isso que a camada de roteamento importa na próxima frase: no momento em que qualquer provedor disponibilizar um endpoint para ela, um roteador é o que permite colocar um modelo Apache-2.0 de poucos dias ao lado daqueles que você já chama em produção — uma única API, sem novo contrato, preço de tabela do provedor repassado com margem de 0% e failover automático para que um modelo não comprovado possa receber tráfego real enquanto um comprovado assume as chamadas que ele não consegue processar. Até que esse endpoint exista, a comparação que você pode realmente executar hoje é entre este checkpoint e os modelos de documentos hospedados pelos quais você já paga, lado a lado em suas próprias páginas.
Quem deve se mover e quem deve esperar
Mova se você tiver um trabalho de extração de documentos com escopo definido — notas fiscais, extratos bancários, contratos, formulários estruturados — e requisitos de residência de dados ou auditoria que tornem uma API hospedada pouco atraente. Apache 2.0, adaptação de domínio QLoRA barata e um encoder de resolução nativa são uma combinação genuinamente incomum para essa carga de trabalho, e as limitações da própria placa são claras o suficiente para que você não seja pego de surpresa. Espere se você precisar de um endpoint hospedado, precificação por token ou comportamento agêntico — nada disso existe ainda. E espere antes de tratar qualquer benchmark acima como definitivo: cada número de destaque é da Cohere, a única execução externa pinta um quadro mais contestado no topo da classe de modelos pequenos, e o modelo está disponível há menos de uma semana. O que vale a pena observar é a história do serving — no dia em que o Transformers padrão e um lançamento público de vLLM ambos o suportarem, o North Micro Vision deixa de ser um repositório que você precisa domar e se torna um modelo que você pode simplesmente apontar para seus documentos.
