
Nemotron Parse 2.0 vs MinerU: O Desafiante Não Anunciado vs o Padrão de Código Aberto
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA-Nemotron-Parse-2.0 e MinerU resolvem o mesmo problema por direções opostas. Ambos pegam uma página escaneada ou renderizada e devolvem markdown limpo e estruturado, com tabelas, fórmulas e ordem de leitura preservadas. Mas o MinerU é o padrão de código aberto — dezenas de milhares de estrelas no GitHub, licença Apache-2.0 e uma API hospedada com cota diária gratuita, a primeira escolha segura que a maioria dos times de documentos procura. O Nemotron Parse 2.0 é o oposto de consolidado: apareceu no Hugging Face em 3 de agosto de 2026, a NVIDIA não fez nenhum anúncio sobre ele, e sua ficha do modelo traz um conjunto de alegações de benchmark que seria a maior novidade no parsing aberto de documentos deste ano, caso se confirmem. Esse emparelhamento é propositalmente desequilibrado — o líder estabelecido contra o desafiante não anunciado — e a questão central é quanto vale, de fato, a proposta de cada lado.
O que cada lado realmente é
MinerU é um sistema completo de análise de documentos da OpenDataLab, o grupo de dados por trás dos lançamentos abertos do Shanghai AI Laboratory. O carro-chefe atual é o MinerU 2.5-Pro, um modelo de visão-linguagem de 1,2B na linha de versões pontuais 2604/2605 (o modelo 2604 foi lançado em abril de 2026, com uma atualização 2605 posteriormente). Ele é construído sobre um mecanismo de dois estágios — análise grosseira do layout global, seguida de reconhecimento direcionado em recortes de resolução nativa — e o projeto integra o modelo em ingestão de PDF, DOCX, PPTX e XLSX, detecção de layout, reconhecimento de fórmulas e tabelas, e reconstrução da ordem de leitura. É o parser open-source de referência para pré-processamento de RAG, e tem a comunidade para comprovar isso.
Nemotron Parse 2.0 é um codificador-decodificador de visão de 0,9B da NVIDIA, da mesma família do NVIDIA-Nemotron-Parse-v1.2, lançado em fevereiro de 2026. Ele usa um codificador de visão ViT-H construído sobre a espinha dorsal C-RADIOv2 da NVIDIA e um decodificador estilo mBART de dez camadas. Páginas de entrada podem ter até 2048×1664, a geração chega a um teto de 9.000 tokens e emite as mesmas saídas estruturadas que o MinerU: markdown ou texto simples, além de tabelas em LaTeX, HTML, markdown, JSON, JSON hierárquico ou CSV, com classes de layout, caixas delimitadoras e ordem de leitura. O repositório está completo — configurações, um Dockerfile, uma suíte de testes com saídas douradas (golden outputs) — mas a NVIDIA não o promoveu, não há empacotamento NIM e nenhum provedor de inferência o hospeda. Auto-hospedagem é a única opção hoje.

A história do preço: "grátis" significa duas coisas diferentes
A maior divergência prática é que o MinerU é gratuito para chamadas de API e o Nemotron Parse 2.0 só é gratuito para execução local. A API oficial do MinerU em mineru.net tem um plano gratuito diário — cerca de 1.000 páginas de alta prioridade por dia, dependendo da promoção vigente — sem cobrança por chamada dentro desse limite, e arquivos de até 200 páginas cada. Além da cota, os trabalhos perdem prioridade em vez de serem cobrados, e hospedagens comerciais precificam o modelo auto-hospedado em cerca de um décimo de centavo por página. Se o seu pipeline precisa de milhares de páginas por dia e você não quer operar nada, o MinerU tem um caminho que custa quase nada.
Nemotron Parse 2.0 não tem esse caminho. Os pesos são gratuitos sob a Licença de Modelo Aberto da NVIDIA, mas a ficha do modelo afirma que ele não é implantado por nenhum provedor de inferência, e a NVIDIA não precificou nem anunciou uma opção hospedada. Usá-lo significa alugar ou possuir uma GPU, subir uma configuração do Transformers ou uma build do vLLM com suporte a código remoto do Nemotron Parse, e lidar com as peculiaridades de implantação abaixo. Para um projeto de baixo volume, isso é um custo real — uma GPU é dramaticamente mais cara do que uma camada gratuita de API com algumas centenas de páginas por mês. Para uma equipe que já opera infraestrutura de GPU, os pesos serem gratuitos é uma vantagem genuína; a questão é se a sobrecarga operacional vale o que o modelo afirma agregar.
A lacuna do benchmark: esses números não se comparam.
Esta é a seção onde a maioria das comparações falha silenciosamente, então vamos ser explícitos. O cartão do Nemotron Parse 2.0 relata quatro benchmarks: ParseBench geral em 0,6391 (acima dos 0,5782 do v1.2), MOSCAR OCR multilíngue em 0,9102 de F1 BoC (acima de 0,4410), IndicVisionBench em 0,7203 de ANLS-caractere (acima de 0,0612) e um subconjunto de escrita manual do OmniDocBench medido pela distância de edição de texto, que melhorou de 0,9739 para 0,3395. O MinerU 2.5-Pro relata uma suíte diferente: uma pontuação geral de 95,69 no OmniDocBench v1.6 — estado da arte, acima de modelos muito maiores — além de 97,29 em parsing de fórmulas densas e uma distância de edição de texto de 0,036 em suas próprias execuções do OmniDocBench.
Os dois modelos compartilham o nome {{1}}OmniDocBench{{/1}}, o que os faz parecer comparáveis, e, no entanto, as métricas não são. A NVIDIA relata a {{2}}distância de edição{{/2}} em um subconjunto apenas de escrita à mão; a OpenDataLab relata uma {{3}}pontuação composta geral{{/3}} em uma versão diferente do benchmark. {{4}}ParseBench{{/4}} é uma suíte da própria NVIDIA e não tem entrada da MinerU. {{5}}MOSCAR{{/5}} e {{6}}IndicVisionBench{{/6}} não têm entrada da MinerU. Todos os números de ambos os lados são relatados pelos fornecedores, e nenhum dos dois modelos tem uma execução independente de terceiros publicada na qual o outro apareça. Isso significa que não existe atualmente nenhum número que permita uma {{7}}comparação justa{{/7}} entre o Nemotron Parse 2.0 e a MinerU — qualquer pessoa que lhe diga que um modelo {{8}}"vence"{{/8}} a comparação de benchmarks está extrapolando a partir de testes diferentes. O que se pode dizer direcionalmente: as afirmações da MinerU são maduras e sobreviveram a um ano de uso pela comunidade, enquanto as afirmações do {{9}}Nemotron Parse 2.0{{/9}} são novas, não auditadas e — se os seus saltos no {{10}}MOSCAR{{/10}} e no {{11}}IndicVisionBench{{/11}} se replicarem — um grande avanço especificamente para o parsing multilíngue.

Onde eles divergem em cargas de trabalho reais

Deixando os benchmarks de lado, as diferenças que aparecem em um pipeline dizem respeito a escopo, latência e cobertura multilíngue.
• Escopo de entrada — O MinerU ingere PDFs completos de até 200 páginas por arquivo por meio de sua API e mescla tabelas entre páginas; o Nemotron Parse 2.0 recebe uma imagem de página de até 2048×1664 por chamada, portanto um documento de 200 páginas equivale a 200 requisições. Se a sua entrada for um PDF, essa é uma diferença de fluxo de trabalho antes de qualquer questão de precisão.
• Maturidade de serviço — a MinerU oferece backends vLLM e SGLang com throughput publicado (cerca de 2 páginas por segundo em um único A100 via seu mecanismo assíncrono), um runner Docker e uma API hospedada. A trajetória de serving do Nemotron Parse 2.0 é curta e acidentada: o vLLM precisa de suporte a código remoto e, em hardware A100/A10, do backend de atenção Triton; o tokenizer acompanha um tokenizer.json serializado com padding fixo de 9.000 tokens, o que uma stack de serving viu como um prompt de seis tokens explodindo para 54.000 IDs de token; e o repositório carrega um patch de runtime para builds do vLLM que não suportam sua cabeça de saída compartilhada. Nada disso é intransponível, mas é um atrito real.
• Multilíngue — é aqui que o cartão do Nemotron Parse 2.0 fala mais alto. O lançamento 2.0 expandiu o vocabulário de cerca de 52.000 para 72.000 tokens especificamente para OCR multilíngue, e os ganhos declarados estão concentrados aí: MOSCAR subiu de 0,44 para 0,91, e o IndicVisionBench (bengali, hindi, tâmil e mais sete scripts indianos) subiu de 0,06 para 0,72. O MinerU suporta 109 idiomas como recurso principal, mas sua comprovação é o composto OmniDocBench, não um detalhamento por script. Se o seu corpus tem muitos scripts indianos ou de baixos recursos, os números do Nemotron Parse 2.0 são a afirmação mais interessante para testar — eles também são os menos verificados de forma independente.
• Escrita manual — a maior diferença individual no cartão da NVIDIA é a escrita manual: a distância de edição no subconjunto de notas do OmniDocBench caindo de 0,97 para 0,34. A distância de edição de texto de 0,036 do próprio MinerU é em suas execuções gerais do OmniDocBench, não no subconjunto de escrita manual, então novamente os números não se comparam diretamente. Mas notas manuscritas são um modo de falha clássico para ambos, e esta é a única área em que a melhoria declarada do Nemotron Parse 2.0 é grande o suficiente para justificar um teste direto em suas próprias páginas.
Quem deve escolher qual
Escolha o MinerU se você quer um parser que pode usar hoje: um nível gratuito diário, serviço maduro, entrada de PDF completo, uma licença Apache-2.0 sem revisão de conformidade e uma comunidade grande o suficiente para que respostas a perguntas de configuração já existam. É o padrão por um motivo e, para a maioria das cargas de trabalho de pré-processamento de RAG, é a opção de menor risco.
Opte pelo {{1}}Nemotron Parse 2.0{{/1}} se você já se sente confortável com {{2}}auto-hospedagem de modelos{{/2}} — particularmente se você está no universo {{3}}NVIDIA NIM ou NeMo{{/3}}, já que {{4}}a v1.2 é servida como NIM e a 2.0 parece ser sua sucessora{{/4}} — e se o processamento {{5}}multilíngue ou de manuscritos{{/5}} é exatamente o que o seu corpus precisa. Um {{6}}teste de fim de semana em suas próprias páginas em escrita índica ou com muitas anotações{{/6}} vai te dizer mais do que qualquer tabela de benchmarks, porque as afirmações ou vão se {{7}}confirmar ou desmoronar diante de dados independentes{{/7}}. Só não planeje um {{8}}caminho de produção em torno de um modelo ainda não anunciado{{/8}} até que você tenha executado esse teste e confirmado que as {{9}}peculiaridades do tokenizer e do serving{{/9}} estão tratadas na sua stack.
Por que o parser não é o único custo no pipeline
Seja qual for a sua escolha, o parser costuma ser a etapa mais barata de um pipeline de documentos quando o volume é real. A etapa cara é o LLM que transforma o markdown analisado em resumos, registros estruturados ou respostas — e é nessa etapa que uma camada de roteamento muda a equação econômica. O OrcaRouter coloca mais de 200 modelos atrás de uma única API pelo preço de tabela do provedor, sem nenhum acréscimo; assim, uma redução de preço do fornecedor entra em vigor no mesmo dia em que é anunciada, e o failover automático garante que um provedor degradado não paralise todo o trabalho de extração. Na prática: você pode testar as alegações de reconhecimento de escrita manual do Nemotron Parse 2.0 contra o MinerU no seu próprio corpus sem comprometer sua pilha de modelos downstream com nenhum dos dois parsers, pois a troca do parser e a camada de LLM são desacopladas. Não hospedamos nenhum dos dois parsers hoje — o Nemotron Parse 2.0 é um modelo auto-hospedado e o MinerU roda em seu próprio serviço —, mas uma camada de roteamento na etapa do LLM é exatamente o que impede que a decisão sobre o parser se transforme em uma decisão de lock-in.
Conclusão
MinerU é o padrão racional: maduro, gratuito para chamadas em pequena escala, com licença permissiva e comprovado em produção. Nemotron Parse 2.0 é a aposta interessante: um modelo NVIDIA de 0,9B lançado silenciosamente há cinco dias, cuja ficha técnica alega um salto dramático em multilinguismo e reconhecimento de escrita manual que ninguém verificou de forma independente. Se você processa principalmente documentos técnicos em inglês em grande volume, MinerU é a resposta e o risco do Nemotron Parse 2.0 não vale a pena. Se você processa escritas indianas (Indic) ou de poucos recursos, ou notas manuscritas, as alegações são grandes o suficiente — e os pesos são gratuitos o suficiente — para que executar o teste você mesmo seja barato. A NVIDIA lançando um novo parser aproximadamente a cada trimestre (v1.1 em novembro de 2025, v1.2 em fevereiro de 2026, 2.0 agora) sugere que um anúncio pode chegar em breve; até que isso aconteça, trate os números da versão 2.0 como indicativos e teste em seu próprio corpus.
Perguntas Frequentes
O Nemotron Parse 2.0 está disponível através de alguma API?
Não por um serviço hospedado. O cartão do Hugging Face afirma que o modelo não é implantado por nenhum provedor de inferência, e a NVIDIA não anunciou empacotamento NIM ou precificação para ele, até o início de agosto de 2026. A única forma de executá-lo é auto-hospedar os pesos via Hugging Face Transformers com trust_remote_code, ou por meio de uma compilação vLLM que inclua suporte a código remoto do Nemotron Parse. A MinerU, por outro lado, tem uma API oficial com uma cota gratuita diária de páginas.
Qual modelo é melhor para o pré-processamento de RAG?
Para pipelines de RAG típicos — documentos técnicos em inglês e CJK, tabelas e layouts mistos — o MinerU é a escolha mais segura e comprovada: ele aceita PDFs completos, mescla tabelas entre páginas, tem um serviço maduro e não custa nada em pequena escala por meio do seu nível gratuito. O Nemotron Parse 2.0 só se torna a escolha certa se o seu corpus for repleto de escritas índicas ou de baixos recursos, notas manuscritas ou páginas com muitos gráficos, onde se concentram os ganhos que ele alega — e mesmo assim, verifique em seus próprios documentos antes de se comprometer.
Os números de benchmark nos dois cartões de modelo se comparam diretamente?
Não. O Nemotron Parse 2.0 reporta ParseBench (suíte própria da NVIDIA), MOSCAR, IndicVisionBench e um subconjunto de manuscritos do OmniDocBench como distância de edição. O MinerU 2.5-Pro reporta um composto geral do OmniDocBench v1.6, além de métricas de fórmula e edição de texto. O nome do benchmark sobreposto não é a mesma métrica, nenhuma execução independente coloca ambos os modelos no mesmo teste, e todos os números em ambas as fichas são reportados pelo fornecedor. Trate-os como direcionais, não diretamente comparáveis.
