Una tarjeta de título para 'Nemotron Parse 2.0 vs MinerU — el retador no anunciado vs la opción predeterminada de código abierto', con un icono de página de documento a la izquierda y un icono de caja de código abierto a la derecha.
Guides & Insights

Nemotron Parse 2.0 vs MinerU: El desafiante no anunciado vs el estándar de código abierto

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

NVIDIA-Nemotron-Parse-2.0 y MinerU resuelven el mismo problema desde direcciones opuestas. Ambos toman una página escaneada o renderizada y devuelven markdown limpio y estructurado, con tablas, fórmulas y orden de lectura intactos. Pero MinerU es la opción por defecto del código abierto: decenas de miles de estrellas en GitHub, una licencia Apache-2.0 y una API alojada con cuota diaria gratuita, la primera opción segura a la que recurren la mayoría de los equipos de documentos. Nemotron Parse 2.0 es todo lo contrario de algo consolidado: apareció en Hugging Face el 3 de agosto de 2026, NVIDIA no ha emitido ningún anuncio al respecto, y su ficha de modelo incluye una serie de afirmaciones de benchmark que, si se sostienen, serían el mayor acontecimiento del análisis de documentos abierto este año. Este emparejamiento es deliberadamente desigual — el consolidado frente al desafiante no anunciado — y la cuestión es cuánto vale realmente la propuesta de cada lado.

Lo que cada lado realmente es

MinerU es un sistema completo de análisis de documentos de OpenDataLab, el grupo de datos detrás de los lanzamientos abiertos del Laboratorio de Inteligencia Artificial de Shanghái. El buque insignia actual es MinerU 2.5-Pro, un modelo de visión-lenguaje de 1.2B en la línea de versiones puntuales 2604/2605 (el modelo 2604 se lanzó en abril de 2026, con una actualización 2605 posterior). Se basa en un motor de dos etapas: análisis global aproximado del diseño y luego reconocimiento específico en recortes de resolución nativa; y el proyecto integra el modelo en la ingesta de PDF, DOCX, PPTX y XLSX, detección de diseño, reconocimiento de fórmulas y tablas, y reconstrucción del orden de lectura. Es el analizador de código abierto de referencia para el preprocesamiento de RAG, y tiene la comunidad que lo demuestra.

Nemotron Parse 2.0 es un codificador-decodificador de visión de 0.9B de NVIDIA, de la misma familia que NVIDIA-Nemotron-Parse-v1.2, que se lanzó en febrero de 2026. Utiliza un codificador de visión ViT-H basado en el backbone C-RADIOv2 de NVIDIA y un decodificador estilo mBART de diez capas. Las páginas de entrada llegan hasta 2048×1664, la generación alcanza un máximo de 9.000 tokens, y emite las mismas salidas estructuradas que MinerU: markdown o texto plano, además de tablas en LaTeX, HTML, markdown, JSON, JSON jerárquico o CSV, con clases de diseño, cuadros delimitadores y orden de lectura. El repositorio está completo: configuraciones, un Dockerfile, un conjunto de pruebas con salidas de referencia. Pero NVIDIA no lo ha promocionado, no hay empaquetado NIM y ningún proveedor de inferencia lo aloja. Hoy en día, el autoalojamiento es la única opción.

Screenshot of the Hugging Face model card for NVIDIA-Nemotron-Parse-2.0, showing the nvidia-open-model-license, 0.9B model size, 2,156 downloads last month, and the note that the model isn't deployed by any inference provider.

La historia del precio: "free" significa dos cosas diferentes.

La mayor divergencia práctica es que MinerU es gratuito para llamar y Nemotron Parse 2.0 solo es gratuito para ejecutar. La API oficial de MinerU en mineru.net incluye una capa gratuita diaria: aproximadamente 1,000 páginas de alta prioridad al día, según la promoción actual, sin cargo por llamada dentro de ella, y archivos de hasta 200 páginas cada uno. Más allá de la cuota, los trabajos se despriorizan en lugar de facturarse, y los hosts comerciales cobran el modelo autoalojado alrededor de una décima de centavo por página. Si tu pipeline necesita miles de páginas al día y no quieres operar nada, MinerU tiene un camino que cuesta casi nada.

Nemotron Parse 2.0 no tiene esa opción. Los pesos son gratuitos bajo la Licencia de Modelo Abierto de NVIDIA, pero la tarjeta del modelo indica que ningún proveedor de inferencia lo despliega, y NVIDIA no ha fijado precio ni anunciado una opción alojada. Usarlo implica alquilar o poseer una GPU, montar Transformers o una compilación de vLLM con soporte de código remoto de Nemotron Parse, y gestionar las particularidades de despliegue que se indican a continuación. Para un proyecto de bajo volumen, eso es un coste real: una GPU es drásticamente más cara que un nivel gratuito de API para unos cientos de páginas al mes. Para un equipo que ya cuenta con infraestructura de GPU, que los pesos sean gratuitos es una ventaja real; la cuestión es si la sobrecarga operativa merece la pena en comparación con lo que el modelo afirma aportar.

La brecha de referencia: estos números no se enfrentan entre sí.

Esta es la sección donde la mayoría de las comparaciones fallan silenciosamente, así que seamos explícitos. La ficha de Nemotron Parse 2.0 reporta cuatro puntos de referencia: ParseBench general en 0.6391 (frente a 0.5782 de v1.2), MOSCAR OCR multilingüe en 0.9102 F1 de BoC (frente a 0.4410), IndicVisionBench en 0.7203 ANLS-carácter (frente a 0.0612), y un subconjunto de escritura a mano de OmniDocBench medido como distancia de edición de texto que mejora de 0.9739 a 0.3395. MinerU 2.5-Pro reporta un conjunto diferente: una puntuación general de 95.69 en OmniDocBench v1.6 — estado del arte, por encima de modelos mucho más grandes — además de 97.29 en el parseo de fórmulas densas y una distancia de edición de texto de 0.036 en sus propias ejecuciones de OmniDocBench.

Los dos modelos comparten el nombre "OmniDocBench", lo que hace que parezcan comparables, y luego las métricas no lo son. NVIDIA reporta un subconjunto de solo escritura a mano como distancia de edición; OpenDataLab reporta un compuesto general en una versión diferente del benchmark. ParseBench es el conjunto propio de NVIDIA y no tiene entrada de MinerU. MOSCAR e IndicVisionBench no tienen entrada de MinerU. Cada número en ambos lados es reportado por el proveedor, y ningún modelo tiene una ejecución independiente de terceros publicada en la que aparezca el otro. Eso significa que actualmente no hay una cifra comparable que clasifique a Nemotron Parse 2.0 frente a MinerU: cualquiera que te diga que un modelo "gana" la comparación de benchmarks está extrapolando de pruebas diferentes. Lo que se puede decir de manera direccional: las afirmaciones de MinerU son maduras y han sobrevivido un año de uso comunitario, mientras que las de Nemotron Parse 2.0 son recientes, no auditadas y, si sus saltos en MOSCAR e IndicVision se replican, un gran avance específicamente para el parseo multilingüe.

A comparison scoreboard for Nemotron Parse 2.0 and MinerU 2.5-Pro. Nemotron Parse 2.0: shipped Aug 3 2026 unannounced, 0.9B params, NVIDIA Open Model license, no hosted API, ParseBench 0.6391, MOSCAR 0.9102 F1. MinerU 2.5-Pro: shipped Apr 2026, 1.2B params, Apache 2.0, official API with free tier, OmniDocBench v1.6 95.69, 109 languages.

Donde difieren en cargas de trabajo reales.

Screenshot of the Hugging Face model card for opendatalab/MinerU2.5-Pro-2604-1.2B, showing the Apache-2.0 license, the arXiv tech report 'MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale', and an 'unmatched SOTA Performance' banner.

Dejando de lado los benchmarks, las diferencias que aparecen en un pipeline tienen que ver con el alcance, la latencia y la cobertura multilingüe.

• Alcance de entrada — MinerU ingiere PDFs completos de hasta 200 páginas por archivo a través de su API y fusiona tablas de varias páginas; Nemotron Parse 2.0 toma una imagen de página de hasta 2048×1664 por llamada, por lo que un documento de 200 páginas son 200 solicitudes. Si tu entrada es un PDF, esa es una diferencia de flujo de trabajo antes de cualquier cuestión de precisión.

• Madurez de servicio — MinerU incluye backends vLLM y SGLang con rendimiento publicado (alrededor de 2 páginas por segundo en una sola A100 mediante su motor asíncrono), un ejecutor Docker y una API alojada. La historia de servicio de Nemotron Parse 2.0 es joven y accidentada: vLLM necesita soporte de código remoto y, en hardware A100/A10, el backend de atención Triton; el tokenizador incluye un tokenizer.json serializado con relleno incorporado de hasta 9000 tokens, lo que una pila de servicio encontró como una solicitud de seis tokens que explotaba a 54 000 IDs de token; y el repositorio incluye un parche en tiempo de ejecución para builds de vLLM que no admiten su cabeza de salida atada. Nada de esto es insuperable, pero es fricción real.

• Multilingüe: aquí es donde Nemotron Parse 2.0 muestra su carta más fuerte. La versión 2.0 amplió el vocabulario de unos 52 000 a 72 000 tokens específicamente para OCR multilingüe, y las mejoras reclamadas se concentran ahí: MOSCAR sube de 0,44 a 0,91, e IndicVisionBench (bengalí, hindi, tamil y otras siete escrituras índicas) sube de 0,06 a 0,72. MinerU admite 109 idiomas como característica principal, pero su prueba es el compuesto de OmniDocBench, no un desglose por escritura. Si su corpus abunda en escrituras índicas o de bajos recursos, las cifras de Nemotron Parse 2.0 son la afirmación más interesante de poner a prueba — también son las menos verificadas de forma independiente.

• Escritura a mano — la mayor diferencia en la ficha de NVIDIA es la escritura a mano: la distancia de edición en el subconjunto de notas de OmniDocBench baja de 0,97 a 0,34. La propia distancia de edición de texto de MinerU, de 0,036, corresponde a sus ejecuciones generales de OmniDocBench, no al subconjunto de escritura a mano, así que de nuevo los números no son directamente comparables. Pero las notas manuscritas son un modo de fallo clásico para ambos, y esta es la única área donde la mejora declarada de Nemotron Parse 2.0 es lo bastante grande como para justificar una prueba directa en tus propias páginas.

Quién debería elegir cuál

Elige MinerU si quieres un parser que puedas usar hoy: un nivel gratuito diario, servicio maduro, entrada de PDF completa, licencia Apache-2.0 sin revisión de cumplimiento, y una comunidad lo suficientemente grande como para que ya existan respuestas a las preguntas de configuración. Es el predeterminado por una razón, y para la mayoría de las cargas de trabajo de preprocesamiento RAG es la opción de menor riesgo.

Elija Nemotron Parse 2.0 si ya se siente cómodo autoalojando modelos — particularmente si está en el mundo de NVIDIA NIM o NeMo, ya que la v1.2 se sirve como NIM y 2.0 parece su sucesor — y si la parte multilingüe o de escritura a mano es lo específico que necesita su corpus. Una prueba de fin de semana en sus propias páginas índicas o cargadas de notas le dirá más que cualquier tabla de benchmarks, porque las afirmaciones o se replican o se derrumban bajo datos independientes. Solo no planifique una ruta de producción en torno a un modelo no anunciado hasta que haya ejecutado esa prueba y confirmado que las peculiaridades del tokenizador y del servicio están manejadas en su stack.

Por qué el parser no es el único costo en el pipeline

Sea cual sea tu elección, el parser suele ser la etapa más barata de un pipeline de documentos una vez que el volumen es real. La etapa cara es el LLM que convierte el markdown parseado en resúmenes, registros estructurados o respuestas, y es ahí donde una capa de enrutamiento cambia la economía. OrcaRouter pone más de 200 modelos detrás de una sola API al precio de lista del proveedor, sin margen adicional, de modo que un recorte de precio del proveedor se aplica el mismo día en que se anuncia, y la conmutación automática por error garantiza que un proveedor degradado no detenga todo el trabajo de extracción. En concreto: puedes probar las afirmaciones de Nemotron Parse 2.0 sobre escritura a mano contra MinerU en tu propio corpus sin comprometer tu pila de modelos de aguas abajo con ninguno de los dos parsers, porque el cambio de parser y la capa LLM están desacoplados. Hoy no alojamos ninguno de los dos parsers — Nemotron Parse 2.0 es un modelo autoalojado y MinerU se ejecuta en su propio servicio —, pero una capa de enrutamiento en la etapa LLM es precisamente lo que evita que la decisión del parser se convierta en una decisión de dependencia.

En resumen

MinerU es la opción racional por defecto: maduro, gratuito para llamadas a pequeña escala, con licencia permisiva y probado en producción. Nemotron Parse 2.0 es la apuesta interesante: un modelo de NVIDIA de 0,9B lanzado silenciosamente hace cinco días, cuya ficha técnica afirma un salto dramático en multilingüismo y escritura manual que nadie ha verificado de forma independiente. Si procesas principalmente documentos técnicos en inglés a gran volumen, MinerU es la respuesta y el riesgo de Nemotron Parse 2.0 no merece la pena. Si procesas escrituras índicas o de bajos recursos, o notas manuscritas, las afirmaciones son lo bastante grandes — y los pesos lo bastante libres — como para que ejecutar la prueba tú mismo resulte barato. El que NVIDIA lance un nuevo parseador aproximadamente cada trimestre (v1.1 en noviembre de 2025, v1.2 en febrero de 2026, 2.0 ahora) sugiere que pronto podría llegar un anuncio; hasta que llegue, trata las cifras de 2.0 como orientativas y prueba con tu propio corpus.

Preguntas frecuentes

¿Está disponible Nemotron Parse 2.0 a través de alguna API?

No a través de uno alojado. La ficha de Hugging Face indica que el modelo no está desplegado por ningún proveedor de inferencia, y NVIDIA no ha anunciado empaquetado ni precios de NIM para él, a principios de agosto de 2026. La única forma de ejecutarlo es autoalojar los pesos mediante Hugging Face Transformers con trust_remote_code, o mediante una compilación de vLLM que incluya soporte de código remoto de Nemotron Parse. MinerU, en cambio, tiene una API oficial con una cuota gratuita diaria de páginas.

¿Qué modelo es mejor para el preprocesamiento de RAG?

Para pipelines RAG típicos — documentos técnicos en inglés y CJK, tablas y diseños mixtos — MinerU es la opción más segura y más probada: acepta PDFs completos, fusiona tablas multipágina, tiene un servicio maduro y no cuesta nada a pequeña escala a través de su nivel gratuito. Nemotron Parse 2.0 solo es la opción correcta si tu corpus abunda en escrituras índicas o de bajos recursos, notas manuscritas o páginas cargadas de gráficos, donde se concentran sus ventajas declaradas — e incluso entonces, verifica con tus propios documentos antes de comprometerte.

¿Son directamente comparables los números de referencia de las dos tarjetas de modelo?

No. Nemotron Parse 2.0 reporta ParseBench (la suite propia de NVIDIA), MOSCAR, IndicVisionBench y un subconjunto de escritura a mano de OmniDocBench como distancia de edición. MinerU 2.5-Pro reporta un compuesto general de OmniDocBench v1.6, además de métricas de fórmula y de edición de texto. El nombre de benchmark que se superpone no es la misma métrica, ninguna ejecución independiente pone a ambos modelos en la misma prueba, y cada cifra en ambas tarjetas es reportada por el proveedor. Trátalos como direccionales, no directamente comparables.