
Nemotron Parse 2.0 contre olmOCR : Deux tâches, toutes deux appelées parsing
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Le 3 août 2026, NVIDIA a publié un nouveau modèle d'analyse de documents sur Hugging Face sans en informer personne. NVIDIA-Nemotron-Parse-2.0 est un encodeur-décodeur vision de 0,9B dont la fiche modèle revendique un bond multilingue et conscient des graphiques par rapport à son prédécesseur de février 2026, et il a atterri dans le même coin de l'écosystème qu'olmOCR — plus précisément olmOCR-2-7B-1025, le linéariseur 7B de l'Allen Institute for AI qui est devenu discrètement la méthode par défaut pour transformer des PDF en données d'entraînement pour LLM. Qualifier cela de face-à-face est le piège : les deux modèles sont décrits comme « analyse de documents », mais ils renvoient des artefacts différents, alimentent des pipelines différents, et leurs chiffres de benchmark ne se confrontent jamais réellement. La vraie question est de savoir laquelle des deux tâches vous engagez un parseur à accomplir.
Les deux artefacts
{{1}}Nemotron Parse 2.0 est un moteur de sémantique de mise en page.{{/1}} {{2}}Donnez-lui une image de page et une invite de tâche et il renvoie le texte ainsi qu'une couche sémantique par-dessus : une classe de mise en page pour chaque région (titre, section, légende, tableau, graphique, en-tête, pied de page, note de bas de page, entrée bibliographique), une boîte englobante pour chacune, et l'ordre de lecture entre elles — avec le markdown comme sérialisation optionnelle par-dessus.{{/2}} {{3}}olmOCR 2 est un linéarisateur.{{/3}} {{4}}Il prend la même page et renvoie un markdown linéarisé et propre avec un court frontmatter YAML qui consigne les métadonnées au niveau de la page, telles que la langue principale, la correction de rotation et le fait que la page soit un tableau ou un diagramme.{{/4}} {{5}}Pas de boîtes, pas de classes, pas de géométrie : un seul passage, du texte dans l'ordre du document.{{/5}}
L'artefact détermine la tâche. Si votre pipeline doit citer un fait en référence à une région de la page, surligner un tableau sur un scan, ou extraire la sémantique de mise en page pour l'intelligence documentaire, vous avez besoin de géométrie — c'est l'espace de sortie de Nemotron Parse 2.0. Si vous construisez des données d'entraînement ou alimentez un LLM texte qui ne consomme que des jetons, la géométrie est du bruit et le markdown linéarisé est exactement ce qu'il faut — c'est tout le concept d'olmOCR. Vous pouvez greffer la détection de mise en page sur la sortie d'olmOCR avec un détecteur séparé, et vous pouvez jeter les cadres de Nemotron Parse 2.0 et ne garder que le markdown, mais chaque modèle est conçu pour rendre l'une de ces tâches native.
Le navire silencieux : ce que le repo montre, ce qui n'est pas confirmé
NVIDIA-Nemotron-Parse-2.0 est apparu sur Hugging Face le 3 août 2026, sans annonce, sans billet de blog, et sans packaging NIM. Ce qui est connaissable, c’est le dépôt. Il s’agit d’un encodeur-décodeur visuel de 0,9B : un encodeur d’image ViT-H construit sur le backbone C-RADIO de NVIDIA, un adaptateur léger par convolution 1D, et un décodeur de type mBART à dix couches. Le tokeniseur a gagné environ 20 000 entrées, pour atteindre environ 72 000 au total, explicitement pour un meilleur support multilingue, et la fiche du modèle présente l’analyse sensible aux graphiques comme fonctionnalité phare via un nouveau token class_Chart, ainsi qu’une famille de sérialisations de tableaux (LaTeX, HTML, markdown, JSON, JSON hiérarchique, CSV). Deux processeurs de logits facultatifs l’accompagnent : l’un qui arrête la sortie structurée répétitive, et l’autre qui impose une structure de tableau sur une zone de tableau recadrée. La résolution d’entrée recommandée s’étend d’environ 1024×1280 jusqu’à 1664×2048, la génération plafonne à 9 000 tokens, et la fiche du modèle liste Transformers, vLLM, SGLang et Docker Model Runner comme environnements d’exécution sur les architectures matérielles Ampere, Hopper, Blackwell et Turing.
Les affirmations, cependant, sont toutes propres à NVIDIA, et aucune n’a été reproduite de manière indépendante. La fiche technique indique un score global ParseBench de 0,6391 (contre 0,5782 pour la v1.2), un score MOSCAR en OCR multilingue de 0,9102 en BoC-F1 (contre 0,4410), un score IndicVisionBench de 0,7203 en ANLS-caractère (contre 0,0612), ainsi qu’un sous-ensemble d’écriture manuscrite OmniDocBench passant de 0,9739 à 0,3395 sur la distance d’édition de texte. Ce sont les plus fortes progressions, et aussi les moins vérifiées : ParseBench est la propre suite de NVIDIA, et aucun tiers n’a encore fait tourner Parse 2.0 sur un corpus indépendant. Ce qui n’est pas confirmé va au-delà des scores — il n’y a pas d’inférence hébergée (la fiche précise que le modèle n’est déployé par aucun fournisseur d’inférence), pas de tarification, et aucune feuille de route annoncée pour l’un ou l’autre.

olmOCR 2 : la référence à laquelle tout le monde se mesure déjà.
olmOCR est le modèle qui a inventé le benchmark que cette catégorie se dispute désormais. olmOCR-2-7B-1025, publié le 22 octobre 2025, est un modèle vision-langage de 7B affiné à partir de Qwen2.5-VL-7B-Instruct sur le corpus olmOCR-mix-1025 de 270 000 pages, puis affiné avec l'apprentissage par renforcement GRPO contre des récompenses automatisées de « tests unitaires » — des vérifications déterministes qu'un tableau a conservé sa structure, qu'une formule a été transcrite exactement, que l'ordre de lecture a été respecté. Ce cadre de tests unitaires est devenu olmOCR-Bench, environ 1 400 PDF et plus de 7 000 vérifications, et il est devenu le benchmark industriel de facto : Marker, MinerU et une douzaine de modèles OCR commerciaux publient désormais leurs résultats dessus. olmOCR 2 lui-même y obtient 82,4 au total, environ quatre points au-dessus de la version précédente et au-dessus des chiffres de Marker (76,1) et MinerU (75,8) qu'AI2 cite sur la même page.
olmOCR est aussi l'option la plus mature de ce duo. Il est sous licence Apache-2.0, ses poids ont été téléchargés environ 218 000 fois au cours du dernier mois, et la boîte à outils olmOCR gère à grande échelle le rendu, la rotation et les nouvelles tentatives sur un backend vLLM — l'estimation par lots d'AI2 situe le pipeline entre 176 et 190 dollars par million de pages sur des GPU loués, et la version FP8 génère environ 3 400 tokens par seconde sur un seul H100, assez rapide pour que l'article de lancement cite « 10 000 pages pour moins de 2 dollars ». Le compromis, c'est la langue : olmOCR est explicitement conçu et évalué pour les documents imprimés numérisés en anglais, et sa fiche de modèle l'étiquette comme étant en anglais. L'argumentaire de Nemotron Parse 2.0 est tout l'inverse — ses gains annoncés se concentrent sur les écritures CJK et indiennes.

Six lignes où le compromis se montre
Les deux modèles sont à poids ouverts, les deux fonctionnent avec Transformers, vLLM ou SGLang, et les deux sont auto-hébergés aujourd'hui. Sur les critères qui comptent pour choisir entre eux :
• Taille — Nemotron Parse 2.0 est 0,9B ; olmOCR 2 est 7B. Environ huit fois les paramètres, environ huit fois le minimum de VRAM.
• Sortie — Nemotron Parse 2.0 renvoie du texte, des classes de mise en page, des boîtes englobantes, l’ordre de lecture et du markdown ; olmOCR 2 renvoie du markdown linéarisé avec un bloc de métadonnées YAML.
• Multilingue — Nemotron Parse 2.0 revendique une solide prise en charge du CJK et des langues indiennes (MOSCAR 0,9102, IndicVisionBench 0,7203, rapporté par le fournisseur) ; olmOCR 2 privilégie l'anglais.
• Score phare — Nemotron Parse 2.0 annonce ParseBench 0.6391 (propre à NVIDIA, non audité) ; olmOCR 2 obtient 82.4 sur olmOCR-Bench (propre à AI2, dix mois de réutilisation par la communauté).
• Licence — Nemotron Parse 2.0 est distribué sous la licence NVIDIA Open Model ; olmOCR 2 est sous licence Apache-2.0.
• Expédié — Nemotron Parse 2.0 est arrivé le 3 août 2026, sans annonce préalable ; olmOCR 2 est sorti le 22 octobre 2025, avec un billet de lancement.

Trois domaines où la décision se fait vraiment sentir.
Échelle et latence. Un décodeur 0.9B est nettement moins coûteux à servir qu'un VLM 7B : un GPU plus petit, moins de VRAM, plus de pages par seconde sur le même matériel, et un coût par page plus faible dès que vous payez pour le temps GPU. Si vous exploitez déjà une infrastructure GPU et que votre corpus est volumineux, cela représente une vraie différence mensuelle. Les propres chiffres d'olmOCR montrent à quelle vitesse un modèle 7B peut être rendu avec la quantification FP8 — mais il nécessite quand même un GPU de classe H100 pour atteindre ces performances ; le minimum matériel de Nemotron Parse 2.0 est une carte de l'ère Ampere.
Multilingue. C'est la ligne la plus asymétrique. Nemotron Parse 2.0 a élargi son tokenizer d'environ 20 000 entrées spécifiquement pour l'OCR multilingue, et les gains revendiqués sur sa fiche sont concentrés dans les écritures indiennes et le CJK. olmOCR 2 ne fait pas une telle affirmation — son étiquette de langue est l'anglais. Si votre corpus est en hindi, tamoul, bengali, japonais ou en écriture mixte, les chiffres de Nemotron Parse 2.0 sont ceux qu'il vaut la peine de tester, précisément parce qu'ils sont rapportés par le fournisseur et récents.
{{1}}La réalité du déploiement.{{/1}} {{2}}olmOCR 2 a dix mois et sa chaîne d'outils est ennuyeuse dans le bon sens du terme.{{/2}} {{3}}Nemotron Parse 2.0 a cinq jours et son histoire de déploiement est visiblement jeune : vLLM nécessite une version compilée avec le support du code distant Nemotron Parse, la tête de sortie liée fait planter certaines versions de vLLM 0.20 (le dépôt fournit un correctif d'exécution), et le tokenizer.json contient un padding sérialisé jusqu'à 9 000 jetons — une pile de déploiement a vu une invite de six jetons s'étendre à 54 000 identifiants de jetons avant le correctif.{{/3}} {{4}}Rien de tout cela n'est fatal, mais c'est exactement le genre de friction que l'on prévoit avec un nouveau modèle.{{/4}}
Choisissez-en un pour votre pipeline
Choisissez olmOCR 2 si vous construisez des données d'entraînement pour LLM ou un pipeline d'extraction de texte à haut volume sur des documents en anglais. Vous obtenez une boîte à outils mature, une licence Apache-2.0, la référence que l'industrie mesure désormais, et une voie de traitement par lots bien établie. Son mode de défaillance accepté est la couverture linguistique.
Choisissez Nemotron Parse 2.0 si votre pipeline a besoin de géométrie — classes de mise en page, boîtes englobantes et ordre de lecture pour la récupération ancrée ou l’intelligence documentaire — ou si votre corpus contient beaucoup de pages en écritures indiennes, en CJK ou manuscrites, là où se situent ses gains annoncés. La taille de 0,9B rend un test de week-end peu coûteux même si vous n’êtes pas sûr. Son mode de défaillance accepté est que chaque chiffre sur la fiche est propre à NVIDIA et pourrait changer lors d’une évaluation indépendante.
Si vos entrées sont principalement des PDF nés numériques en anglais et que tout ce dont vous avez besoin est un markdown propre, olmOCR 2 est le choix par défaut le moins risqué. Si vous auto-hébergez déjà et que le cas d'usage multilingue ou basé sur la mise en page est réel, Nemotron Parse 2.0 est le pari le plus intéressant — testez-le sur vos propres pages avant de vous engager.
Évitez que le choix du parseur ne devienne un verrouillage.
Un pipeline documentaire comporte une étape d'analyse (parser) puis une étape LLM, et l'analyse est généralement l'étape la moins coûteuse une fois que le volume est réel — c'est le LLM qui transforme le markdown analysé en résumés, en enregistrements structurés ou en réponses qui fait grimper les coûts. C'est cette étape qu'une couche de routage modifie. OrcaRouter met plus de 200 modèles derrière une seule API au prix catalogue du fournisseur, sans majoration, de sorte qu'une baisse de prix d'un fournisseur est appliquée le jour même, et le basculement automatique empêche qu'un fournisseur dégradé ne bloque un travail par lots. Aucun des deux analyseurs comparés ici n'est dans notre catalogue — les deux fiches modèles indiquent qu'ils ne sont déployés par aucun fournisseur d'inférence, c'est donc une décision d'auto-hébergement — mais la raison de garder l'analyseur découplé de votre pile de modèles est exactement ce que le routage apporte côté aval : remplacer Nemotron Parse 2.0 par olmOCR 2, ou inversement, sans toucher à une seule intégration, car la couche LLM reste derrière la même API à une seule clé.
FAQ
Quel modèle gagne sur les benchmarks ?
Ni l'un ni l'autre — les chiffres ne se font pas face. Nemotron Parse 2.0 rapporte ParseBench, MOSCAR, IndicVisionBench et un sous-ensemble manuscrit d'OmniDocBench, tous propres à NVIDIA et aucun reproduit de manière indépendante. olmOCR 2 rapporte olmOCR-Bench, le benchmark maison d'AI2 sur lequel le reste de l'industrie publie désormais. Aucun tiers n'a fait tourner les deux modèles sur le même corpus, donc toute affirmation directe de « gagnant » relève de l'extrapolation. En tendance : les chiffres d'olmOCR ont survécu à dix mois d'utilisation par la communauté ; ceux de Nemotron Parse 2.0 sont récents et pourraient évoluer.
Est-ce que Nemotron Parse 2.0 est vraiment meilleur pour les documents non anglais ?
Voilà l'affirmation — une expansion du vocabulaire d'environ 20 000 jetons, plus MOSCAR à 0,9102 et IndicVisionBench à 0,7203, les deux rapportés par le fournisseur et en forte hausse par rapport à v1.2. olmOCR 2 ne fait aucune revendication multilingue et est marqué anglais. Mais jusqu'à ce qu'un test indépendant voie le jour, considérez les gains multilingues de Nemotron Parse 2.0 comme prometteurs mais non vérifiés, et testez-les sur vos propres pages indic ou CJK avant de vous y fier.
Est-ce que j'ai besoin d'un GPU plus puissant pour l'un d'entre eux ?
Oui, et il suit la différence de taille. Le modèle 0.9B de Nemotron Parse 2.0 tient sur une carte modeste de l'ère Ampere et constitue l'option la moins chère par page sur du matériel que vous possédez déjà. Le VLM 7B d'olmOCR 2 exige un GPU nettement plus grand ; sa version FP8 atteint environ 3 400 tokens de sortie par seconde sur un H100, selon AI2.
Lequel est le meilleur pour le prétraitement RAG ?
Cela dépend de ce dont votre récupérateur a besoin. Si vous ancrez les réponses à des régions de page, avez besoin de classes de mise en page, ou souhaitez indexer les tableaux et graphiques comme unités autonomes, les boîtes englobantes et les classes de Nemotron Parse 2.0 vous offrent cela nativement. Si votre pile RAG ne consomme que du texte propre et que votre corpus est en anglais, le markdown linéarisé d'olmOCR 2 est éprouvé, plus simple, et soutenu par une boîte à outils mature.
En résumé
NVIDIA a expédié un véritable parseur cette semaine sans en informer personne ; AI2 a expédié le sien il y a dix mois et a donné à la catégorie son benchmark. Nemotron Parse 2.0 est le meilleur choix lorsque vous avez besoin de sémantique de mise en page, de couverture multilingue ou d'extraction d'écriture manuscrite avec un petit budget — et les domaines où ses chiffres sont les moins vérifiés sont exactement ceux où il prétend gagner. olmOCR 2 est le meilleur choix lorsque vous avez besoin de texte linéarisé à grande échelle sur des documents en anglais et que vous voulez une chaîne d'outils stable depuis dix mois. Aucun des deux n'est déployé nulle part, c'est donc une décision d'auto-hébergement dans tous les cas ; le moyen le moins cher de trancher est d'exécuter les deux sur vos pages les plus difficiles et d'observer où chacun échoue.
