Um cartão de título para 'Nemotron Parse 2.0 vs MinerU — o desafiador não anunciado vs o padrão de código aberto', com um ícone de página de documento à esquerda e um ícone de caixa de código aberto à direita.
Guides & Insights

Nemotron Parse 2.0 vs MinerU: O Desafiante Não Anunciado vs o Padrão de Código Aberto

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

NVIDIA-Nemotron-Parse-2.0 e MinerU resolvem o mesmo problema por direções opostas. Ambos pegam uma página escaneada ou renderizada e devolvem markdown limpo e estruturado, com tabelas, fórmulas e ordem de leitura preservadas. Mas o MinerU é o padrão de código aberto — dezenas de milhares de estrelas no GitHub, licença Apache-2.0 e uma API hospedada com cota diária gratuita, a primeira escolha segura que a maioria dos times de documentos procura. O Nemotron Parse 2.0 é o oposto de consolidado: apareceu no Hugging Face em 3 de agosto de 2026, a NVIDIA não fez nenhum anúncio sobre ele, e sua ficha do modelo traz um conjunto de alegações de benchmark que seria a maior novidade no parsing aberto de documentos deste ano, caso se confirmem. Esse emparelhamento é propositalmente desequilibrado — o líder estabelecido contra o desafiante não anunciado — e a questão central é quanto vale, de fato, a proposta de cada lado.

O que cada lado realmente é

MinerU é um sistema completo de análise de documentos da OpenDataLab, o grupo de dados por trás dos lançamentos abertos do Shanghai AI Laboratory. O carro-chefe atual é o MinerU 2.5-Pro, um modelo de visão-linguagem de 1,2B na linha de versões pontuais 2604/2605 (o modelo 2604 foi lançado em abril de 2026, com uma atualização 2605 posteriormente). Ele é construído sobre um mecanismo de dois estágios — análise grosseira do layout global, seguida de reconhecimento direcionado em recortes de resolução nativa — e o projeto integra o modelo em ingestão de PDF, DOCX, PPTX e XLSX, detecção de layout, reconhecimento de fórmulas e tabelas, e reconstrução da ordem de leitura. É o parser open-source de referência para pré-processamento de RAG, e tem a comunidade para comprovar isso.

Nemotron Parse 2.0 é um codificador-decodificador de visão de 0,9B da NVIDIA, da mesma família do NVIDIA-Nemotron-Parse-v1.2, lançado em fevereiro de 2026. Ele usa um codificador de visão ViT-H construído sobre a espinha dorsal C-RADIOv2 da NVIDIA e um decodificador estilo mBART de dez camadas. Páginas de entrada podem ter até 2048×1664, a geração chega a um teto de 9.000 tokens e emite as mesmas saídas estruturadas que o MinerU: markdown ou texto simples, além de tabelas em LaTeX, HTML, markdown, JSON, JSON hierárquico ou CSV, com classes de layout, caixas delimitadoras e ordem de leitura. O repositório está completo — configurações, um Dockerfile, uma suíte de testes com saídas douradas (golden outputs) — mas a NVIDIA não o promoveu, não há empacotamento NIM e nenhum provedor de inferência o hospeda. Auto-hospedagem é a única opção hoje.

Screenshot of the Hugging Face model card for NVIDIA-Nemotron-Parse-2.0, showing the nvidia-open-model-license, 0.9B model size, 2,156 downloads last month, and the note that the model isn't deployed by any inference provider.

A história do preço: "grátis" significa duas coisas diferentes

A maior divergência prática é que o MinerU é gratuito para chamadas de API e o Nemotron Parse 2.0 só é gratuito para execução local. A API oficial do MinerU em mineru.net tem um plano gratuito diário — cerca de 1.000 páginas de alta prioridade por dia, dependendo da promoção vigente — sem cobrança por chamada dentro desse limite, e arquivos de até 200 páginas cada. Além da cota, os trabalhos perdem prioridade em vez de serem cobrados, e hospedagens comerciais precificam o modelo auto-hospedado em cerca de um décimo de centavo por página. Se o seu pipeline precisa de milhares de páginas por dia e você não quer operar nada, o MinerU tem um caminho que custa quase nada.

Nemotron Parse 2.0 não tem esse caminho. Os pesos são gratuitos sob a Licença de Modelo Aberto da NVIDIA, mas a ficha do modelo afirma que ele não é implantado por nenhum provedor de inferência, e a NVIDIA não precificou nem anunciou uma opção hospedada. Usá-lo significa alugar ou possuir uma GPU, subir uma configuração do Transformers ou uma build do vLLM com suporte a código remoto do Nemotron Parse, e lidar com as peculiaridades de implantação abaixo. Para um projeto de baixo volume, isso é um custo real — uma GPU é dramaticamente mais cara do que uma camada gratuita de API com algumas centenas de páginas por mês. Para uma equipe que já opera infraestrutura de GPU, os pesos serem gratuitos é uma vantagem genuína; a questão é se a sobrecarga operacional vale o que o modelo afirma agregar.

A lacuna do benchmark: esses números não se comparam.

Esta é a seção onde a maioria das comparações falha silenciosamente, então vamos ser explícitos. O cartão do Nemotron Parse 2.0 relata quatro benchmarks: ParseBench geral em 0,6391 (acima dos 0,5782 do v1.2), MOSCAR OCR multilíngue em 0,9102 de F1 BoC (acima de 0,4410), IndicVisionBench em 0,7203 de ANLS-caractere (acima de 0,0612) e um subconjunto de escrita manual do OmniDocBench medido pela distância de edição de texto, que melhorou de 0,9739 para 0,3395. O MinerU 2.5-Pro relata uma suíte diferente: uma pontuação geral de 95,69 no OmniDocBench v1.6 — estado da arte, acima de modelos muito maiores — além de 97,29 em parsing de fórmulas densas e uma distância de edição de texto de 0,036 em suas próprias execuções do OmniDocBench.

Os dois modelos compartilham o nome {{1}}OmniDocBench{{/1}}, o que os faz parecer comparáveis, e, no entanto, as métricas não são. A NVIDIA relata a {{2}}distância de edição{{/2}} em um subconjunto apenas de escrita à mão; a OpenDataLab relata uma {{3}}pontuação composta geral{{/3}} em uma versão diferente do benchmark. {{4}}ParseBench{{/4}} é uma suíte da própria NVIDIA e não tem entrada da MinerU. {{5}}MOSCAR{{/5}} e {{6}}IndicVisionBench{{/6}} não têm entrada da MinerU. Todos os números de ambos os lados são relatados pelos fornecedores, e nenhum dos dois modelos tem uma execução independente de terceiros publicada na qual o outro apareça. Isso significa que não existe atualmente nenhum número que permita uma {{7}}comparação justa{{/7}} entre o Nemotron Parse 2.0 e a MinerU — qualquer pessoa que lhe diga que um modelo {{8}}"vence"{{/8}} a comparação de benchmarks está extrapolando a partir de testes diferentes. O que se pode dizer direcionalmente: as afirmações da MinerU são maduras e sobreviveram a um ano de uso pela comunidade, enquanto as afirmações do {{9}}Nemotron Parse 2.0{{/9}} são novas, não auditadas e — se os seus saltos no {{10}}MOSCAR{{/10}} e no {{11}}IndicVisionBench{{/11}} se replicarem — um grande avanço especificamente para o parsing multilíngue.

A comparison scoreboard for Nemotron Parse 2.0 and MinerU 2.5-Pro. Nemotron Parse 2.0: shipped Aug 3 2026 unannounced, 0.9B params, NVIDIA Open Model license, no hosted API, ParseBench 0.6391, MOSCAR 0.9102 F1. MinerU 2.5-Pro: shipped Apr 2026, 1.2B params, Apache 2.0, official API with free tier, OmniDocBench v1.6 95.69, 109 languages.

Onde eles divergem em cargas de trabalho reais

Screenshot of the Hugging Face model card for opendatalab/MinerU2.5-Pro-2604-1.2B, showing the Apache-2.0 license, the arXiv tech report 'MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale', and an 'unmatched SOTA Performance' banner.

Deixando os benchmarks de lado, as diferenças que aparecem em um pipeline dizem respeito a escopo, latência e cobertura multilíngue.

• Escopo de entrada — O MinerU ingere PDFs completos de até 200 páginas por arquivo por meio de sua API e mescla tabelas entre páginas; o Nemotron Parse 2.0 recebe uma imagem de página de até 2048×1664 por chamada, portanto um documento de 200 páginas equivale a 200 requisições. Se a sua entrada for um PDF, essa é uma diferença de fluxo de trabalho antes de qualquer questão de precisão.

• Maturidade de serviço — a MinerU oferece backends vLLM e SGLang com throughput publicado (cerca de 2 páginas por segundo em um único A100 via seu mecanismo assíncrono), um runner Docker e uma API hospedada. A trajetória de serving do Nemotron Parse 2.0 é curta e acidentada: o vLLM precisa de suporte a código remoto e, em hardware A100/A10, do backend de atenção Triton; o tokenizer acompanha um tokenizer.json serializado com padding fixo de 9.000 tokens, o que uma stack de serving viu como um prompt de seis tokens explodindo para 54.000 IDs de token; e o repositório carrega um patch de runtime para builds do vLLM que não suportam sua cabeça de saída compartilhada. Nada disso é intransponível, mas é um atrito real.

• Multilíngue — é aqui que o cartão do Nemotron Parse 2.0 fala mais alto. O lançamento 2.0 expandiu o vocabulário de cerca de 52.000 para 72.000 tokens especificamente para OCR multilíngue, e os ganhos declarados estão concentrados aí: MOSCAR subiu de 0,44 para 0,91, e o IndicVisionBench (bengali, hindi, tâmil e mais sete scripts indianos) subiu de 0,06 para 0,72. O MinerU suporta 109 idiomas como recurso principal, mas sua comprovação é o composto OmniDocBench, não um detalhamento por script. Se o seu corpus tem muitos scripts indianos ou de baixos recursos, os números do Nemotron Parse 2.0 são a afirmação mais interessante para testar — eles também são os menos verificados de forma independente.

• Escrita manual — a maior diferença individual no cartão da NVIDIA é a escrita manual: a distância de edição no subconjunto de notas do OmniDocBench caindo de 0,97 para 0,34. A distância de edição de texto de 0,036 do próprio MinerU é em suas execuções gerais do OmniDocBench, não no subconjunto de escrita manual, então novamente os números não se comparam diretamente. Mas notas manuscritas são um modo de falha clássico para ambos, e esta é a única área em que a melhoria declarada do Nemotron Parse 2.0 é grande o suficiente para justificar um teste direto em suas próprias páginas.

Quem deve escolher qual

Escolha o MinerU se você quer um parser que pode usar hoje: um nível gratuito diário, serviço maduro, entrada de PDF completo, uma licença Apache-2.0 sem revisão de conformidade e uma comunidade grande o suficiente para que respostas a perguntas de configuração já existam. É o padrão por um motivo e, para a maioria das cargas de trabalho de pré-processamento de RAG, é a opção de menor risco.

Opte pelo {{1}}Nemotron Parse 2.0{{/1}} se você já se sente confortável com {{2}}auto-hospedagem de modelos{{/2}} — particularmente se você está no universo {{3}}NVIDIA NIM ou NeMo{{/3}}, já que {{4}}a v1.2 é servida como NIM e a 2.0 parece ser sua sucessora{{/4}} — e se o processamento {{5}}multilíngue ou de manuscritos{{/5}} é exatamente o que o seu corpus precisa. Um {{6}}teste de fim de semana em suas próprias páginas em escrita índica ou com muitas anotações{{/6}} vai te dizer mais do que qualquer tabela de benchmarks, porque as afirmações ou vão se {{7}}confirmar ou desmoronar diante de dados independentes{{/7}}. Só não planeje um {{8}}caminho de produção em torno de um modelo ainda não anunciado{{/8}} até que você tenha executado esse teste e confirmado que as {{9}}peculiaridades do tokenizer e do serving{{/9}} estão tratadas na sua stack.

Por que o parser não é o único custo no pipeline

Seja qual for a sua escolha, o parser costuma ser a etapa mais barata de um pipeline de documentos quando o volume é real. A etapa cara é o LLM que transforma o markdown analisado em resumos, registros estruturados ou respostas — e é nessa etapa que uma camada de roteamento muda a equação econômica. O OrcaRouter coloca mais de 200 modelos atrás de uma única API pelo preço de tabela do provedor, sem nenhum acréscimo; assim, uma redução de preço do fornecedor entra em vigor no mesmo dia em que é anunciada, e o failover automático garante que um provedor degradado não paralise todo o trabalho de extração. Na prática: você pode testar as alegações de reconhecimento de escrita manual do Nemotron Parse 2.0 contra o MinerU no seu próprio corpus sem comprometer sua pilha de modelos downstream com nenhum dos dois parsers, pois a troca do parser e a camada de LLM são desacopladas. Não hospedamos nenhum dos dois parsers hoje — o Nemotron Parse 2.0 é um modelo auto-hospedado e o MinerU roda em seu próprio serviço —, mas uma camada de roteamento na etapa do LLM é exatamente o que impede que a decisão sobre o parser se transforme em uma decisão de lock-in.

Conclusão

MinerU é o padrão racional: maduro, gratuito para chamadas em pequena escala, com licença permissiva e comprovado em produção. Nemotron Parse 2.0 é a aposta interessante: um modelo NVIDIA de 0,9B lançado silenciosamente há cinco dias, cuja ficha técnica alega um salto dramático em multilinguismo e reconhecimento de escrita manual que ninguém verificou de forma independente. Se você processa principalmente documentos técnicos em inglês em grande volume, MinerU é a resposta e o risco do Nemotron Parse 2.0 não vale a pena. Se você processa escritas indianas (Indic) ou de poucos recursos, ou notas manuscritas, as alegações são grandes o suficiente — e os pesos são gratuitos o suficiente — para que executar o teste você mesmo seja barato. A NVIDIA lançando um novo parser aproximadamente a cada trimestre (v1.1 em novembro de 2025, v1.2 em fevereiro de 2026, 2.0 agora) sugere que um anúncio pode chegar em breve; até que isso aconteça, trate os números da versão 2.0 como indicativos e teste em seu próprio corpus.

Perguntas Frequentes

O Nemotron Parse 2.0 está disponível através de alguma API?

Não por um serviço hospedado. O cartão do Hugging Face afirma que o modelo não é implantado por nenhum provedor de inferência, e a NVIDIA não anunciou empacotamento NIM ou precificação para ele, até o início de agosto de 2026. A única forma de executá-lo é auto-hospedar os pesos via Hugging Face Transformers com trust_remote_code, ou por meio de uma compilação vLLM que inclua suporte a código remoto do Nemotron Parse. A MinerU, por outro lado, tem uma API oficial com uma cota gratuita diária de páginas.

Qual modelo é melhor para o pré-processamento de RAG?

Para pipelines de RAG típicos — documentos técnicos em inglês e CJK, tabelas e layouts mistos — o MinerU é a escolha mais segura e comprovada: ele aceita PDFs completos, mescla tabelas entre páginas, tem um serviço maduro e não custa nada em pequena escala por meio do seu nível gratuito. O Nemotron Parse 2.0 só se torna a escolha certa se o seu corpus for repleto de escritas índicas ou de baixos recursos, notas manuscritas ou páginas com muitos gráficos, onde se concentram os ganhos que ele alega — e mesmo assim, verifique em seus próprios documentos antes de se comprometer.

Os números de benchmark nos dois cartões de modelo se comparam diretamente?

Não. O Nemotron Parse 2.0 reporta ParseBench (suíte própria da NVIDIA), MOSCAR, IndicVisionBench e um subconjunto de manuscritos do OmniDocBench como distância de edição. O MinerU 2.5-Pro reporta um composto geral do OmniDocBench v1.6, além de métricas de fórmula e edição de texto. O nome do benchmark sobreposto não é a mesma métrica, nenhuma execução independente coloca ambos os modelos no mesmo teste, e todos os números em ambas as fichas são reportados pelo fornecedor. Trate-os como direcionais, não diretamente comparáveis.