
Nemotron Parse 2.0 vs olmOCR: Dois Trabalhos, Ambos Chamados de Parsing
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Em 3 de agosto de 2026, a NVIDIA publicou um novo modelo de análise de documentos no Hugging Face e não contou a ninguém. O NVIDIA-Nemotron-Parse-2.0 é um vision-encoder-decoder de 0,9B cuja ficha do modelo afirma um salto multilíngue e com reconhecimento de gráficos em relação ao seu predecessor de fevereiro de 2026, e ele chegou ao mesmo canto do ecossistema que o olmOCR — mais precisamente o olmOCR-2-7B-1025, o linearizador de 7B do Allen Institute for AI que silenciosamente se tornou a forma padrão de transformar PDFs em dados de treinamento para LLMs. Chamar isso de duelo direto é a armadilha: ambos os modelos são descritos como "análise de documentos", mas retornam artefatos diferentes, alimentam pipelines diferentes e seus números de benchmark nunca realmente se confrontam. A verdadeira questão é qual dos dois trabalhos você está contratando um parser para fazer.
Os dois artefatos
Nemotron Parse 2.0 é um motor de semântica de layout. Dê a ele uma imagem de página e um prompt de tarefa, e ele retorna o texto mais uma camada semântica por cima: uma classe de layout para cada região (título, seção, legenda, tabela, gráfico, cabeçalho, rodapé, nota de rodapé, entrada bibliográfica), uma caixa delimitadora para cada uma e a ordem de leitura entre elas — com markdown como uma serialização opcional por cima. olmOCR 2 é um linearizador. Ele recebe a mesma página e retorna markdown limpo e linearizado com um breve frontmatter YAML registrando metadados no nível da página, como idioma principal, correção de rotação e se a página é uma tabela ou um diagrama. Sem caixas, sem classes, sem geometria: uma única passada, texto em ordem de documento.
O artefato determina o trabalho. Se o seu pipeline precisa remeter um fato de volta a uma região da página, destacar uma tabela em uma digitalização ou extrair semântica de layout para inteligência documental, você precisa de geometria — esse é o espaço de saída do Nemotron Parse 2.0. Se você está construindo dados de treinamento ou alimentando um LLM de texto que apenas consome tokens, geometria é ruído e markdown linearizado é exatamente o certo — esse é todo o design do olmOCR. Você pode acoplar a detecção de layout à saída do olmOCR com um detector separado, e pode descartar as caixas do Nemotron Parse 2.0 e manter apenas o markdown, mas cada modelo é construído para tornar nativa uma dessas tarefas.
O navio silencioso: o que o repositório mostra, o que não está confirmado
O NVIDIA-Nemotron-Parse-2.0 apareceu no Hugging Face em 3 de agosto de 2026, sem anúncio, sem post de blog e sem empacotamento NIM. O que se sabe é o repositório. É um vision-encoder-decoder de 0.9B: um codificador de imagem ViT-H construído sobre a espinha dorsal C-RADIO da NVIDIA, um adaptador leve de convolução 1D e um decodificador estilo mBART de dez camadas. O tokenizador cresceu em cerca de 20.000 entradas para aproximadamente 72.000 no total, explicitamente para um suporte multilíngue mais eficiente, e a ficha do modelo lista o parsing ciente de gráficos como recurso principal por meio de um novo token class_Chart, além de uma família de serializações de tabela (LaTeX, HTML, markdown, JSON, JSON hierárquico, CSV). Dois processadores de logits opcionais acompanham: um que interrompe saída estruturada repetitiva e outro que força uma estrutura de tabela em um recorte de tabela. A resolução de entrada recomendada varia de cerca de 1024×1280 até 1664×2048, a geração chega a um teto de 9.000 tokens, e a ficha do modelo lista Transformers, vLLM, SGLang e Docker Model Runner como runtimes em hardware Ampere, Hopper, Blackwell e Turing.
As alegações, porém, são todas da própria NVIDIA, e nenhuma foi reproduzida de forma independente. A ficha técnica indica ParseBench geral em 0,6391 (acima dos 0,5782 da v1.2), OCR multilíngue MOSCAR em 0,9102 de BoC-F1 (acima dos 0,4410), IndicVisionBench em 0,7203 de ANLS-character (acima dos 0,0612) e um subconjunto de escrita manual do OmniDocBench melhorando de 0,9739 para 0,3395 na distância de edição de texto. Esses são os maiores saltos e também os menos verificados: o ParseBench é a suíte da própria NVIDIA, e nenhum terceiro ainda executou o Parse 2.0 contra um corpus independente. O que não foi confirmado vai além das pontuações — não há inferência hospedada (a ficha afirma que o modelo não está implantado por nenhum provedor de inferência), não há preço nem cronograma anunciado para nenhum dos dois.

olmOCR 2: o padrão vigente que todos já usam como referência
olmOCR é o modelo que inventou o benchmark sobre o qual esta categoria agora debate. O olmOCR-2-7B-1025, lançado em 22 de outubro de 2025, é um modelo de visão-linguagem de 7B, ajustado a partir do Qwen2.5-VL-7B-Instruct no corpus olmOCR-mix-1025 de 270.000 páginas e depois refinado com aprendizado por reforço GRPO contra recompensas automatizadas de "teste de unidade" — verificações determinísticas de que uma tabela manteve sua estrutura, de que uma fórmula foi transcrita exatamente e de que a ordem de leitura foi preservada. Essa estruturação em testes de unidade deu origem ao olmOCR-Bench, com cerca de 1.400 PDFs e mais de 7.000 verificações, e ele se tornou o benchmark de facto do setor: Marker, MinerU e uma dúzia de modelos de OCR comerciais agora publicam resultados nele. O próprio olmOCR 2 obtém 82,4 no geral, cerca de quatro pontos acima da versão anterior e acima dos números da Marker (76,1) e da MinerU (75,8) que a AI2 cita na mesma página.
olmOCR também é a opção madura nesse par. É Apache-2.0, seus pesos foram baixados cerca de 218.000 vezes no último mês, e o kit de ferramentas olmOCR lida com renderização, rotação e novas tentativas em escala em um backend vLLM — a estimativa em lote da AI2 coloca o pipeline em torno de US$ 176–190 por milhão de páginas em GPUs alugadas, e a versão FP8 roda cerca de 3.400 tokens de saída por segundo em uma única H100, rápido o suficiente para que o post de lançamento cite "10.000 páginas por menos de US$ 2." A contrapartida é o idioma: olmOCR é construído e avaliado explicitamente para impressos digitalizados em inglês, e seu cartão de modelo o rotula como inglês. A proposta inteira do Nemotron Parse 2.0 é o oposto — os ganhos que ele alega se concentram em escritas CJK e índicas.

Seis linhas onde o tradeoff aparece
Ambos os modelos são open-weight, ambos rodam em Transformers, vLLM ou SGLang, e ambos são auto-hospedados hoje. Nas dimensões que importam para escolher entre eles:
• Tamanho — Nemotron Parse 2.0 tem 0,9B; olmOCR 2 tem 7B. Cerca de oito vezes os parâmetros, cerca de oito vezes o mínimo de VRAM.
• Saída — O Nemotron Parse 2.0 retorna texto, classes de layout, caixas delimitadoras, ordem de leitura e markdown; o olmOCR 2 retorna markdown linearizado com um bloco de metadados YAML.
• Multilíngue — o Nemotron Parse 2.0 afirma ter forte suporte a CJK e idiomas indianos (MOSCAR 0,9102, IndicVisionBench 0,7203, informado pelo fornecedor); o olmOCR 2 é voltado principalmente para o inglês.
• Pontuação principal — Nemotron Parse 2.0 relata ParseBench 0.6391 (da própria NVIDIA, não auditado); olmOCR 2 obtém 82.4 no olmOCR-Bench (da própria AI2, dez meses de reutilização pela comunidade).
• Licença — Nemotron Parse 2.0 é distribuído sob a Licença de Modelo Aberto da NVIDIA; olmOCR 2 é Apache-2.0.
• Enviado — Nemotron Parse 2.0 chegou em 3 de agosto de 2026, sem anúncio; olmOCR 2 foi lançado em 22 de outubro de 2025, com um post de lançamento.

Três lugares onde a decisão realmente pesa
Escala e latência. Um decoder de 0,9B é dramaticamente mais barato de servir do que um VLM de 7B: uma GPU menor, menos VRAM, mais páginas por segundo no mesmo hardware e um custo menor por página quando você está pagando pelo tempo de GPU. Se você já executa infraestrutura de GPU e seu corpus é grande, isso é uma diferença mensal real. Os próprios números da olmOCR mostram o quão rápido um modelo de 7B pode ser feito com quantização FP8 — mas ele ainda precisa de uma GPU classe H100 para atingi-los; o requisito mínimo de hardware do Nemotron Parse 2.0 é uma placa da era Ampere.
Multilíngue. Esta é a linha mais assimétrica. O Nemotron Parse 2.0 expandiu seu tokenizer em cerca de 20.000 entradas especificamente para OCR multilíngue, e os ganhos declarados em seu card estão concentrados em escritas índicas e CJK. O olmOCR 2 não faz tal afirmação — sua tag de idioma é inglês. Se o seu corpus é hindi, tâmil, bengali, japonês ou de escrita mista, os números do Nemotron Parse 2.0 são os que valem a pena testar, justamente por serem reportados pelo fornecedor e recentes.
A realidade do serving. O olmOCR 2 tem dez meses e sua toolchain é entediante no bom sentido. O Nemotron Parse 2.0 tem cinco dias e sua história de serving é visivelmente jovem: o vLLM precisa de um build com suporte a código remoto do Nemotron Parse, a cabeça de saída amarrada faz alguns builds do vLLM 0.20 tropeçarem (o repositório inclui um patch de runtime), e o tokenizer.json carrega padding serializado até 9.000 tokens — uma stack de serving encontrou um prompt de seis tokens que se expandia para 54.000 IDs de token antes do patch. Nada disso é fatal, mas é exatamente o tipo de atrito com que você conta ao adotar um modelo novo.
Escolha um para o seu pipeline.
Escolha o olmOCR 2 se você está construindo dados de treinamento para LLM ou um pipeline de extração de texto em alto volume sobre documentos em inglês. Você obtém um kit de ferramentas maduro, uma licença Apache-2.0, o benchmark pelo qual a indústria agora se mede e um caminho de lote bem trilhado. Seu modo de falha aceito é a cobertura de idiomas.
Escolha o Nemotron Parse 2.0 se o seu pipeline precisar de geometria — classes de layout, caixas delimitadoras e ordem de leitura para recuperação fundamentada ou inteligência documental — ou se o seu corpus tiver muitas páginas em idiomas índicos, CJK ou manuscritas, onde residem seus ganhos alegados. O tamanho de 0,9B torna um teste de fim de semana barato, mesmo se você estiver em dúvida. Seu modo de falha aceito é que cada número na ficha é da própria NVIDIA e pode mudar sob avaliação independente.
Se a sua entrada é composta principalmente por PDFs nativos digitais em inglês e tudo o que você precisa é de markdown limpo, o olmOCR 2 é o padrão de menor risco. {{1}}Se você já faz auto-hospedagem e o caso de uso multilíngue ou baseado em layout é real, o Nemotron Parse 2.0 é a aposta mais interessante{{/1}} — teste-o em suas próprias páginas antes de se comprometer.
Evite que a escolha do parser se torne um aprisionamento.
Um pipeline de documentos tem uma etapa de parser e depois uma etapa de LLM, e o parser geralmente é a etapa mais barata quando o volume é real — o LLM que transforma o markdown analisado em resumos, registros estruturados ou respostas é onde o custo escala. É essa etapa que uma camada de roteamento muda. O OrcaRouter coloca mais de 200 modelos atrás de uma única API pelo preço de tabela do provedor, sem nenhum acréscimo, de modo que uma redução de preço do fornecedor entra em vigor no mesmo dia, e o failover automático impede que um provedor degradado paralise um trabalho em lote. Nenhum dos parsers nesta comparação está em nosso catálogo — ambos os model cards afirmam que não são implantados por nenhum provedor de inferência, então esta é uma decisão de self-host — mas a razão para manter o parser desacoplado da sua stack de modelos é exatamente o que o roteamento compra no lado downstream: trocar o Nemotron Parse 2.0 pelo olmOCR 2, ou vice-versa, sem tocar em uma única integração, porque a camada de LLM permanece atrás da mesma API de chave única.
Perguntas Frequentes
Qual modelo vence nos benchmarks?
Nenhum dos dois — os números não se confrontam. O Nemotron Parse 2.0 relata ParseBench, MOSCAR, IndicVisionBench e um subconjunto de escrita manual do OmniDocBench, todos da própria NVIDIA e nenhum reproduzido de forma independente. O olmOCR 2 relata o olmOCR-Bench, benchmark próprio da AI2 no qual o restante da indústria agora publica seus resultados. Nenhum terceiro executou ambos os modelos no mesmo corpus, portanto qualquer alegação direta de "vencedor" é extrapolação. Direcionalmente: os números do olmOCR sobreviveram a dez meses de uso pela comunidade; os do Nemotron Parse 2.0 são novos e podem mudar.
O Nemotron Parse 2.0 é realmente melhor em documentos que não estão em inglês?
Essa é a alegação — uma expansão de vocabulário de aproximadamente 20.000 tokens, além de MOSCAR em 0,9102 e IndicVisionBench em 0,7203, ambos relatados pelo fornecedor e ambos com forte alta em relação à v1.2. O olmOCR 2 não faz nenhuma alegação multilíngue e é marcado como inglês. Mas até que uma execução independente surja, trate os ganhos multilíngues do Nemotron Parse 2.0 como promissores, porém não verificados, e teste em suas próprias páginas Indic ou CJK antes de confiar neles.
Preciso de uma GPU maior para uma delas?
Sim, e isso acompanha a diferença de tamanho. O modelo de 0,9B do Nemotron Parse 2.0 cabe em uma placa modesta da era Ampere e é a opção mais barata por página em hardware que você já possui. O VLM de 7B do olmOCR 2 exige uma GPU substancialmente maior; sua versão FP8 alcança cerca de 3.400 tokens de saída por segundo em um H100, de acordo com a AI2.
Qual é melhor para o pré-processamento de RAG?
Depende do que seu retriever precisa. Se você ancora as respostas em regiões da página, precisa de classes de layout ou quer indexar tabelas e gráficos como unidades próprias, as bounding boxes e classes do Nemotron Parse 2.0 oferecem isso nativamente. Se sua stack de RAG apenas consome texto limpo e seu corpus é em inglês, o markdown linearizado do olmOCR 2 é comprovado, mais simples e respaldado por um kit de ferramentas maduro.
Conclusão
A NVIDIA lançou um parser de verdade esta semana e não contou a ninguém; a AI2 lançou um há dez meses e estabeleceu a referência para a categoria. O Nemotron Parse 2.0 é a melhor opção quando você precisa de semântica de layout, cobertura multilíngue ou extração de manuscritos com pouco orçamento — e as áreas em que seus números são menos verificados são exatamente as áreas em que ele afirma vencer. O olmOCR 2 é a melhor opção quando você precisa de texto linearizado em escala sobre documentos em inglês e quer uma toolchain estável há dez meses. Nenhum dos dois está implantado em lugar nenhum, então esta é uma decisão de auto-hospedagem de qualquer forma; a maneira mais barata de fazer isso é rodar ambos nas suas próprias páginas mais difíceis e observar onde cada um quebra.
