Une carte de titre pour « Nemotron Parse 2.0 vs MinerU — le challenger non annoncé vs la solution open-source par défaut », avec une icône de page de document à gauche et une icône de boîte open-source à droite.
Guides & Insights

Nemotron Parse 2.0 vs MinerU : le challenger non annoncé face à la référence open source

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

NVIDIA-Nemotron-Parse-2.0 et MinerU résolvent le même problème dans des directions opposées. Tous deux prennent une page scannée ou rendue et renvoient un markdown propre et structuré, avec tableaux, formules et ordre de lecture intacts. Mais MinerU est le choix open-source par défaut — des dizaines de milliers d'étoiles GitHub, une licence Apache-2.0, et une API hébergée avec un quota quotidien gratuit, le premier choix sûr que la plupart des équipes documentaires adoptent. Nemotron Parse 2.0 est tout sauf établi : il est apparu sur Hugging Face le 3 août 2026, NVIDIA n'a publié aucune annonce à son sujet, et sa fiche du modèle contient un ensemble de résultats de benchmark qui constitueraient la plus grande avancée du parsing de documents open-source cette année s'ils se confirmaient. Ce face-à-face est volontairement déséquilibré — le titulaire contre un challenger non annoncé — et toute la question est de savoir ce que vaut réellement l'argumentaire de chaque camp.

Ce qu'est réellement chaque camp

MinerU est un système complet d’analyse documentaire développé par OpenDataLab, le groupe de données à l’origine des publications open source du laboratoire d’intelligence artificielle de Shanghai. Le produit phare actuel est MinerU 2.5-Pro, un modèle vision-langage de 1,2 milliard de paramètres appartenant à la gamme de versions ponctuelles 2604/2605 (la version 2604 est sortie en avril 2026, suivie d’une actualisation 2605). Il repose sur un moteur en deux étapes — une analyse globale grossière de la mise en page, puis une reconnaissance ciblée sur des recadrages en résolution native — et le projet intègre le modèle dans l’ingestion de PDF, DOCX, PPTX et XLSX, la détection de mise en page, la reconnaissance de formules et de tableaux, ainsi que la reconstruction de l’ordre de lecture. C’est l’analyseur open source de référence pour le prétraitement RAG, et sa communauté en témoigne.

Nemotron Parse 2.0 est un encodeur-décodeur de vision de 0,9B paramètres de NVIDIA, dans la même famille que NVIDIA-Nemotron-Parse-v1.2, sorti en février 2026. Il utilise un encodeur de vision ViT-H construit sur le backbone C-RADIOv2 de NVIDIA et un décodeur de type mBART à dix couches. Les pages en entrée peuvent atteindre 2048×1664, la génération va jusqu'à un plafond de 9 000 jetons, et il émet les mêmes sorties structurées que MinerU : markdown ou texte brut, plus des tableaux en LaTeX, HTML, markdown, JSON, JSON hiérarchique ou CSV, avec classes de mise en page, boîtes englobantes et ordre de lecture. Le dépôt est complet — configurations, Dockerfile, suite de tests avec sorties de référence — mais NVIDIA ne l'a pas promu, il n'y a pas de packaging NIM, et aucun fournisseur d'inférence ne l'héberge. L'auto-hébergement est la seule option aujourd'hui.

Screenshot of the Hugging Face model card for NVIDIA-Nemotron-Parse-2.0, showing the nvidia-open-model-license, 0.9B model size, 2,156 downloads last month, and the note that the model isn't deployed by any inference provider.

L'histoire du prix : « free » signifie deux choses différentes

La plus grande divergence pratique est que MinerU est gratuit à appeler, tandis que Nemotron Parse 2.0 est uniquement gratuit à exécuter. L'API officielle de MinerU sur mineru.net propose un quota gratuit quotidien — environ 1 000 pages haute priorité par jour selon la promotion en cours — sans frais par appel, et des fichiers pouvant atteindre 200 pages chacun. Au-delà du quota, les tâches sont déprioritisées plutôt que facturées, et les hébergeurs commerciaux tarifent le modèle auto-hébergé autour d'un dixième de centime par page. Si votre pipeline a besoin de milliers de pages par jour et que vous ne voulez rien opérer, MinerU offre une voie qui ne coûte presque rien.

Nemotron Parse 2.0 n'a pas cette option. Les poids sont gratuits sous la licence NVIDIA Open Model, mais la fiche du modèle indique qu'il n'est déployé par aucun fournisseur d'inférence, et NVIDIA n'a pas fixé de prix ni annoncé d'option hébergée. L'utiliser implique de louer ou de posséder un GPU, de monter une installation Transformers ou une build vLLM avec le support du code distant Nemotron Parse, et de gérer les particularités de déploiement décrites ci-dessous. Pour un projet à faible volume, c'est un coût réel — un GPU est nettement plus cher qu'une offre API gratuite pour quelques centaines de pages par mois. Pour une équipe qui exploite déjà une infrastructure GPU, la gratuité des poids est un véritable avantage ; la question est de savoir si la surcharge opérationnelle en vaut la peine par rapport à ce que le modèle prétend apporter.

L'écart de benchmark : ces chiffres ne se font pas face

C'est la section où la plupart des comparaisons échouent discrètement, alors soyons explicites. La fiche de Nemotron Parse 2.0 indique quatre benchmarks : ParseBench global à 0,6391 (en hausse par rapport à 0,5782 pour la v1.2), l'OCR multilingue MOSCAR avec un score BoC F1 de 0,9102 (en hausse par rapport à 0,4410), IndicVisionBench avec un score ANLS-character de 0,7203 (en hausse par rapport à 0,0612), et un sous-ensemble d'écriture manuscrite d'OmniDocBench mesuré par distance d'édition de texte, qui passe de 0,9739 à 0,3395. MinerU 2.5-Pro présente un ensemble différent : un score global OmniDocBench v1.6 de 95,69 — état de l'art, supérieur à des modèles beaucoup plus grands — plus 97,29 en analyse de formules denses et une distance d'édition de texte de 0,036 sur ses propres exécutions OmniDocBench.

Les deux modèles partagent le nom « OmniDocBench », ce qui les fait paraître comparables, alors que les métriques ne le sont pas. NVIDIA rapporte un sous-ensemble réservé à l'écriture manuscrite comme distance d'édition ; OpenDataLab rapporte un score composite global sur une version différente du benchmark. ParseBench est la suite propre à NVIDIA et ne contient aucune entrée MinerU. MOSCAR et IndicVisionBench n'ont pas non plus d'entrée MinerU. Tous les chiffres des deux côtés sont rapportés par les fournisseurs, et aucun des deux modèles ne dispose d'une exécution indépendante publiée par un tiers qui les inclurait tous les deux. Cela signifie qu'il n'existe actuellement aucune comparaison équivalente qui classe Nemotron Parse 2.0 par rapport à MinerU — quiconque vous affirme qu'un modèle « gagne » la comparaison de benchmarks extrapole à partir de tests différents. Ce que l'on peut dire en termes de tendance : les affirmations de MinerU sont matures et ont survécu à une année d'utilisation par la communauté, tandis que celles de Nemotron Parse 2.0 sont récentes, non vérifiées et — si ses avancées MOSCAR et IndicVision se confirment — une avancée majeure pour l'analyse multilingue en particulier.

A comparison scoreboard for Nemotron Parse 2.0 and MinerU 2.5-Pro. Nemotron Parse 2.0: shipped Aug 3 2026 unannounced, 0.9B params, NVIDIA Open Model license, no hosted API, ParseBench 0.6391, MOSCAR 0.9102 F1. MinerU 2.5-Pro: shipped Apr 2026, 1.2B params, Apache 2.0, official API with free tier, OmniDocBench v1.6 95.69, 109 languages.

Là où ils divergent sur les charges de travail réelles

Screenshot of the Hugging Face model card for opendatalab/MinerU2.5-Pro-2604-1.2B, showing the Apache-2.0 license, the arXiv tech report 'MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale', and an 'unmatched SOTA Performance' banner.

Mettez les benchmarks de côté et les différences qui apparaissent dans un pipeline concernent la portée, la latence et la couverture multilingue.

• Portée d’entrée — MinerU ingère des PDF complets jusqu’à 200 pages par fichier via son API et fusionne les tableaux inter-pages ; Nemotron Parse 2.0 prend une image de page jusqu’à 2048×1664 par appel, donc un document de 200 pages représente 200 requêtes. Si votre entrée est un PDF, c’est une différence de workflow avant toute question de précision.

• Maturité du service d’inférence — MinerU fournit des backends vLLM et SGLang avec un débit publié (environ 2 pages par seconde sur un seul A100 via son moteur asynchrone), un runner Docker et une API hébergée. L’offre de service de Nemotron Parse 2.0 est récente et semée d’embûches : vLLM nécessite le support du code distant et, sur les A100/A10, le backend d’attention Triton ; le tokenizer fournit un tokenizer.json sérialisé avec un padding intégré à 9 000 jetons, ce qui a transformé un prompt de six jetons en 54 000 identifiants de jetons dans une pile de service ; et le dépôt contient un correctif d’exécution pour les builds vLLM qui ne supportent pas sa tête de sortie liée. Rien de tout cela n’est insurmontable, mais c’est une friction réelle.

• Multilingue — c'est là que Nemotron Parse 2.0 abat sa meilleure carte. La version 2.0 a élargi le vocabulaire d'environ 52 000 à 72 000 tokens, spécifiquement pour l'OCR multilingue, et les gains annoncés y sont concentrés : MOSCAR passe de 0,44 à 0,91, et IndicVisionBench (bengali, hindi, tamoul et sept autres écritures indiennes) de 0,06 à 0,72. MinerU prend en charge 109 langues comme fonctionnalité phare, mais sa preuve réside dans le composite OmniDocBench, pas dans une ventilation par écriture. Si votre corpus est riche en écritures indiennes ou à faibles ressources, les chiffres de Nemotron Parse 2.0 sont la revendication la plus intéressante à tester — ce sont aussi les moins vérifiés de manière indépendante.

• Écriture manuscrite — le plus grand écart sur la carte de NVIDIA est l'écriture manuscrite : la distance d'édition sur le sous-ensemble de notes d'OmniDocBench passe de 0,97 à 0,34. La propre distance d'édition de texte de 0,036 de MinerU concerne ses exécutions globales d'OmniDocBench, pas le sous-ensemble d'écriture manuscrite, donc là encore les chiffres ne se correspondent pas. Mais les notes manuscrites sont un mode de défaillance classique pour les deux, et c'est le seul domaine où l'amélioration revendiquée par Nemotron Parse 2.0 est assez importante pour justifier un test direct sur vos propres pages.

Qui devrait choisir quoi

Choisissez MinerU si vous voulez un parseur que vous pouvez utiliser aujourd'hui : un palier gratuit quotidien, un service mature, une entrée PDF complète, une licence Apache-2.0 sans examen de conformité, et une communauté suffisamment large pour que des réponses aux questions de configuration existent déjà. C'est le choix par défaut pour une raison, et pour la plupart des charges de travail de prétraitement RAG, c'est le choix à moindre risque.

Choisissez Nemotron Parse 2.0 si vous êtes déjà à l'aise avec l'auto-hébergement de modèles — en particulier si vous évoluez dans l'écosystème NVIDIA NIM ou NeMo, puisque v1.2 est servi en tant que NIM et que 2.0 semble être son successeur — et si le multilinguisme ou l'écriture manuscrite est précisément ce dont votre corpus a besoin. Un test d'un week-end sur vos propres pages en écritures indiennes ou denses en notes vous en apprendra plus que n'importe quel tableau de référence, car les affirmations vont soit se confirmer, soit s'effondrer face à des données indépendantes. Ne planifiez simplement pas un chemin de production autour d'un modèle non annoncé tant que vous n'avez pas effectué ce test et confirmé que les particularités du tokenizer et du service sont gérées dans votre stack.

Pourquoi le parseur n'est pas le seul coût dans le pipeline

Quel que soit votre choix, le parseur est généralement l'étape la moins coûteuse d'un pipeline documentaire une fois que le volume est réel. L'étape coûteuse est le LLM qui transforme le markdown parsé en résumés, en enregistrements structurés ou en réponses — et c'est à cette étape qu'une couche de routage change la donne économique. OrcaRouter regroupe plus de 200 modèles derrière une seule API au prix catalogue du fournisseur, sans marge, de sorte qu'une baisse de prix d'un vendeur est effective le jour même de son annonce, et le basculement automatique fait qu'un fournisseur dégradé ne bloque pas tout le travail d'extraction. Concrètement : vous pouvez tester les affirmations de Nemotron Parse 2.0 en matière d'écriture manuscrite contre MinerU sur votre propre corpus sans engager votre pile de modèles en aval avec l'un ou l'autre parseur, car le changement de parseur et la couche LLM sont découplés. Nous n'hébergeons aujourd'hui aucun des deux parseurs — Nemotron Parse 2.0 est un modèle auto-hébergé et MinerU fonctionne sur son propre service — mais une couche de routage au niveau de l'étape LLM est précisément ce qui empêche la décision sur le parseur de devenir une décision d'enfermement.

En résumé

MinerU est le choix rationnel par défaut : mature, gratuit pour des appels à petite échelle, sous licence permissive et éprouvé en production. Nemotron Parse 2.0 est le pari intéressant : un modèle NVIDIA de 0.9B paramètres, sorti discrètement il y a cinq jours, dont la fiche technique annonce un bond spectaculaire dans le multilinguisme et la reconnaissance d'écriture manuscrite que personne n'a vérifié de manière indépendante. Si vous analysez de gros volumes de documents techniques en anglais, MinerU est la solution et le risque de Nemotron Parse 2.0 n'en vaut pas la peine. Si vous analysez des écritures indiennes ou à faibles ressources, ou des notes manuscrites, les promesses sont suffisamment ambitieuses — et les poids suffisamment libres — pour qu'il soit peu coûteux de faire le test vous-même. NVIDIA publie un nouveau parseur environ tous les trimestres (v1.1 en novembre 2025, v1.2 en février 2026, 2.0 maintenant), ce qui suggère qu'une annonce pourrait bientôt arriver ; en attendant, considérez les chiffres de la 2.0 comme indicatifs et testez sur votre propre corpus.

FAQ

Nemotron Parse 2.0 est-il disponible via une API ?

Pas via un service hébergé. La fiche Hugging Face indique que le modèle n'est déployé par aucun fournisseur d'inférence, et NVIDIA n'a pas annoncé de packaging NIM ni de tarification pour celui-ci, à la date de début août 2026. La seule façon de l'exécuter est d'héberger soi-même les poids via Hugging Face Transformers avec trust_remote_code, ou via une version de vLLM incluant la prise en charge du code distant Nemotron Parse. MinerU, en revanche, dispose d'une API officielle avec un quota gratuit de pages par jour.

Quel modèle est le meilleur pour le prétraitement RAG ?

Pour les pipelines RAG typiques — documents techniques en anglais et en CJK, tableaux et mises en page mixtes — MinerU est le choix le plus sûr et le plus éprouvé : il accepte des PDF complets, fusionne les tableaux sur plusieurs pages, dispose d'un service mature et ne coûte rien à petite échelle grâce à son offre gratuite. Nemotron Parse 2.0 ne devient le bon choix que si votre corpus est riche en écritures indiennes ou peu dotées, en notes manuscrites ou en pages à forte densité de graphiques, où ses gains annoncés sont concentrés — et même dans ce cas, vérifiez sur vos propres documents avant de vous engager.

Les chiffres de référence des deux fiches de modèle sont-ils directement comparables ?

Non. Nemotron Parse 2.0 rapporte ParseBench (la suite de NVIDIA), MOSCAR, IndicVisionBench et un sous-ensemble d’écriture manuscrite d’OmniDocBench comme distance d’édition. MinerU 2.5-Pro rapporte un composite global OmniDocBench v1.6 ainsi que des métriques de formule et d’édition de texte. Le nom de benchmark commun ne correspond pas à la même métrique, aucune exécution indépendante ne place les deux modèles sur le même test, et tous les chiffres des deux fiches sont rapportés par les fournisseurs. Traitez-les comme indicatifs, non directement comparables.