Tarjeta de título para 'Nemotron Parse 2.0 vs olmOCR': titular 'Nemotron Parse 2.0 vs olmOCR', subtítulo 'Dos trabajos, ambos llamados parseo', con una ilustración dividida: a la izquierda, una página de documento desglosada en cuadros delimitadores etiquetados bajo la leyenda 'semántica de maquetación'; a la derecha, líneas de texto en flujo con un símbolo de markdown bajo la leyenda 'markdown linealizado'. Logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

Nemotron Parse 2.0 vs olmOCR: Dos trabajos, ambos llamados parsing.

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 3 de agosto de 2026, {{1}}NVIDIA{{/1}} publicó un nuevo modelo de análisis de documentos en Hugging Face y no se lo contó a nadie. {{2}}NVIDIA-Nemotron-Parse-2.0{{/2}} es un codificador-decodificador de visión de 0.9B cuya ficha de modelo afirma un salto multilingüe y consciente de los gráficos frente a su predecesor de febrero de 2026, y aterrizó en el mismo rincón del ecosistema que {{3}}olmOCR{{/3}} — más precisamente {{4}}olmOCR-2-7B-1025{{/4}}, el linealizador de 7B del {{5}}Allen Institute for AI{{/5}} que se ha convertido silenciosamente en la forma predeterminada de convertir PDF en datos de entrenamiento para LLM. Llamar a esto un cara a cara es la trampa: ambos modelos se describen como "{{6}}análisis de documentos{{/6}}", pero devuelven artefactos distintos, alimentan canalizaciones distintas y sus cifras de referencia nunca se enfrentan de verdad. La verdadera pregunta es para cuál de los dos trabajos estás contratando a un analizador.

Los dos artefactos

Nemotron Parse 2.0 es un motor de semántica de diseño. Dale una imagen de página y un prompt de tarea y devuelve el texto más una capa semántica encima: una clase de diseño para cada región (título, sección, leyenda, tabla, gráfico, encabezado, pie de página, nota al pie, entrada de bibliografía), un cuadro delimitador para cada una, y el orden de lectura entre ellas — con markdown como una serialización opcional encima. olmOCR 2 es un linearizador. Toma la misma página y devuelve markdown limpio y linearizado con un frontmatter YAML corto que registra metadatos a nivel de página como el idioma principal, la corrección de rotación, y si la página es una tabla o un diagrama. Sin cuadros, sin clases, sin geometría: una pasada, texto en orden de documento.

El artefacto determina la tarea. Si tu pipeline necesita citar un hecho a una región de la página, resaltar una tabla en un escaneo o extraer semántica de diseño para inteligencia documental, necesitas geometría — ese es el espacio de salida de Nemotron Parse 2.0. Si estás construyendo datos de entrenamiento o alimentando un LLM de texto que solo consume tokens, la geometría es ruido y el markdown linealizado es exactamente lo correcto — ese es todo el diseño de olmOCR. Puedes acoplar detección de diseño a la salida de olmOCR con un detector separado, y puedes descartar los recuadros de Nemotron Parse 2.0 y conservar solo el markdown, pero cada modelo está construido para hacer nativa una de esas tareas.

El barco silencioso: lo que muestra el repositorio, lo que no está confirmado

NVIDIA-Nemotron-Parse-2.0 apareció en Hugging Face el 3 de agosto de 2026 sin anuncio, sin publicación de blog y sin empaquetado NIM. Lo que se puede saber es el repositorio. Es un codificador-decodificador visual de 0.9B: un codificador de imágenes ViT-H construido sobre el backbone C-RADIO de NVIDIA, un adaptador ligero de convolución 1D y un decodificador estilo mBART de diez capas. El tokenizador creció en aproximadamente 20 000 entradas hasta unas 72 000 en total, explícitamente para un soporte multilingüe más eficiente, y la tarjeta enumera el análisis de gráficos como una característica destacada mediante un nuevo token class_Chart, además de una familia de serializaciones de tablas (LaTeX, HTML, markdown, JSON, JSON jerárquico, CSV). Se incluyen dos procesadores de logits opcionales: uno que detiene la salida estructurada repetitiva y otro que fuerza una estructura de tabla en un recorte de tabla. La resolución de entrada recomendada abarca aproximadamente de 1024×1280 hasta 1664×2048, la generación alcanza un límite de 9000 tokens, y la tarjeta del modelo enumera Transformers, vLLM, SGLang y Docker Model Runner como entornos de ejecución en hardware Ampere, Hopper, Blackwell y Turing.

Las afirmaciones, sin embargo, son todas de NVIDIA, y ninguna ha sido reproducida de forma independiente. La ficha informa de una puntuación global de 0.6391 en ParseBench (frente al 0.5782 de la v1.2), de 0.9102 en BoC-F1 para el OCR multilingüe MOSCAR (frente al 0.4410), de 0.7203 en ANLS-character para IndicVisionBench (frente al 0.0612) y de una mejora en el subconjunto de escritura manual de OmniDocBench, de 0.9739 a 0.3395 en distancia de edición de texto. Esos son los mayores saltos, y también los menos verificados: ParseBench es un conjunto propio de NVIDIA, y ningún tercero ha ejecutado aún Parse 2.0 sobre un corpus independiente. Lo que no está confirmado va más allá de las puntuaciones: no hay inferencia alojada (la ficha indica que el modelo no está desplegado por ningún proveedor de inferencia), no hay precios y no hay un cronograma anunciado para ninguna de las dos cosas.

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that 2.0 adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

olmOCR 2: el referente con el que todos ya miden

olmOCR es el modelo que inventó el benchmark que esta categoría ahora discute. olmOCR-2-7B-1025, lanzado el 22 de octubre de 2025, es un modelo de visión-lenguaje de 7B ajustado a partir de Qwen2.5-VL-7B-Instruct sobre el corpus de 270.000 páginas olmOCR-mix-1025, y luego refinado con aprendizaje por refuerzo GRPO contra recompensas automatizadas de "pruebas unitarias": comprobaciones deterministas de que una tabla mantenía su estructura, de que una fórmula se transcribía exactamente, de que se respetaba el orden de lectura. Ese enfoque de pruebas unitarias se convirtió en olmOCR-Bench, aproximadamente 1.400 PDF y más de 7.000 comprobaciones, y se ha convertido en el benchmark de facto de la industria: Marker, MinerU y una docena de modelos OCR comerciales publican ahora sus resultados en él. El propio olmOCR 2 obtiene allí una puntuación global de 82,4, alrededor de cuatro puntos por encima de la versión anterior y por encima de las cifras de Marker (76,1) y MinerU (75,8) que AI2 cita en la misma página.

olmOCR es también la opción madura de este dúo. Es Apache-2.0, sus pesos se han descargado aproximadamente 218 000 veces en el último mes, y el kit de herramientas olmOCR gestiona el renderizado, la rotación y los reintentos a escala en un backend vLLM: la estimación por lotes de AI2 sitúa el pipeline en unos 176–190 dólares por millón de páginas en GPUs alquiladas, y la compilación FP8 procesa unas 3400 tokens de salida por segundo en una sola H100, lo bastante rápido como para que la publicación de lanzamiento cite «10 000 páginas por menos de 2 dólares». La contrapartida es el idioma: olmOCR está explícitamente construido y evaluado para impresos digitalizados en inglés, y su ficha de modelo lo etiqueta como inglés. La propuesta completa de Nemotron Parse 2.0 es lo contrario: sus supuestas mejoras se concentran en escrituras CJK e índicas.

Screenshot of the Hugging Face repository page for allenai/olmOCR-2-7B-1025, showing the Apache-2.0 license tag, the English language tag, 217,859 downloads last month, 8B params, the description that it is the BF16 release fine-tuned from Qwen2.5-VL-7B-Instruct on the olmOCR-mix-1025 dataset with additional GRPO RL training for math equations and tables, the note that the best way to use it is the olmOCR toolkit via vLLM, and the line 'This model isn't deployed by any Inference Provider.'

Seis filas donde se muestra la disyuntiva

Ambos modelos son de pesos abiertos, ambos se ejecutan en Transformers, vLLM o SGLang, y ambos están autoalojados hoy en día. En las dimensiones que importan para elegir entre ellos:

• Tamaño — Nemotron Parse 2.0 es de 0,9B; olmOCR 2 es de 7B. Aproximadamente ocho veces los parámetros, y aproximadamente ocho veces el mínimo de VRAM.

• Salida — Nemotron Parse 2.0 devuelve texto, clases de diseño, cuadros delimitadores, orden de lectura y markdown; olmOCR 2 devuelve markdown linealizado con un bloque de metadatos YAML.

• Multilingüe — Nemotron Parse 2.0 afirma un sólido soporte para CJK e índico (MOSCAR 0.9102, IndicVisionBench 0.7203, según el proveedor); olmOCR 2 prioriza el inglés.

{{1}}Puntuación insignia{{/1}} — {{2}}Nemotron Parse 2.0{{/2}} {{3}}reporta{{/3}} {{4}}{{KEEP}}ParseBench{{/KEEP}} 0.6391{{/4}} {{5}}(las propias cifras de NVIDIA, sin auditar){{/5}}; {{6}}olmOCR 2{{/6}} {{7}}obtiene 82.4 en{{/7}} {{8}}olmOCR-Bench{{/8}} {{9}}(lo propio de AI2, con diez meses de reutilización comunitaria){{/9}}.

• Licencia — Nemotron Parse 2.0 se distribuye bajo la NVIDIA Open Model License; olmOCR 2 es Apache-2.0.

• Lanzado — Nemotron Parse 2.0 llegó el 3 de agosto de 2026 sin previo aviso; olmOCR 2 se lanzó el 22 de octubre de 2025, con una publicación de lanzamiento.

Two-column comparison scoreboard titled 'Nemotron Parse 2.0 vs olmOCR — the scoreboard'. Left column 'Nemotron Parse 2.0': Size 0.9B vision-encoder-decoder, Output bboxes, classes, reading order + markdown, Multilingual CJK + Indic strong, Score ParseBench 0.6391 (vendor), License NVIDIA Open Model, Shipped Aug 3, 2026 unannounced. Right column 'olmOCR 2': Size 7B VLM (Qwen2.5-VL), Output linearized markdown + YAML metadata, Multilingual English-first, Score olmOCR-bench 82.4, License Apache 2.0, Shipped Oct 22, 2025. Footer: 'Nemotron scores vendor-reported (NVIDIA); olmOCR scores per AI2's olmOCR-bench.' OrcaRouter logo composited bottom-right.

Tres lugares donde la decisión realmente muerde

Escala y latencia. Un decodificador de 0.9B es muchísimo más barato de servir que un VLM de 7B: una GPU más pequeña, menos VRAM, más páginas por segundo en el mismo hardware y un menor costo por página una vez que se paga por tiempo de GPU. Si ya tienes infraestructura de GPU y tu corpus es grande, eso supone una diferencia mensual real. Las propias cifras de olmOCR demuestran lo rápido que puede llegar a ser un modelo de 7B con cuantización FP8 — pero aún necesita una GPU de clase H100 para alcanzarlas; el requisito mínimo de hardware de Nemotron Parse 2.0 es una tarjeta de la era Ampere.

Multilingüe. Esta es la fila más asimétrica. Nemotron Parse 2.0 amplió su tokenizador en unas 20 000 entradas específicamente para OCR multilingüe, y las ganancias reclamadas en su ficha se concentran en escrituras índicas y CJK. olmOCR 2 no hace tal afirmación: su etiqueta de idioma es inglés. Si tu corpus es hindi, tamil, bengalí, japonés o de escritura mixta, los números de Nemotron Parse 2.0 son los que vale la pena probar, precisamente porque son reportados por el proveedor y recientes.

La realidad del servicio. olmOCR 2 tiene diez meses y su cadena de herramientas es aburrida en el buen sentido. Nemotron Parse 2.0 tiene cinco días y su historia de servicio es visiblemente joven: vLLM necesita una compilación con soporte de código remoto de Nemotron Parse, la cabeza de salida atada hace fallar algunas compilaciones de vLLM 0.20 (el repositorio incluye un parche en tiempo de ejecución), y el tokenizer.json contiene un relleno serializado de hasta 9.000 tokens — una pila de servicio se topó con un prompt de seis tokens que se expandía a 54.000 IDs de tokens antes de aplicar el parche. Nada de eso es fatal, pero es exactamente el tipo de fricción para la que presupuestas con un modelo nuevo.

Elige uno para tu pipeline

Elige olmOCR 2 si estás construyendo datos de entrenamiento de LLM o un pipeline de extracción de texto de alto volumen sobre documentos en inglés. Obtienes un kit de herramientas maduro, una licencia Apache-2.0, el punto de referencia que la industria ahora emplea como medida y una ruta de procesamiento por lotes bien establecida. Su modo de fallo aceptado es la cobertura de idiomas.

Elija Nemotron Parse 2.0 {{1}}si su pipeline necesita geometría — clases de layout, cuadros delimitadores y orden de lectura para recuperación fundamentada o inteligencia documental{{/1}} — {{2}}o si su corpus es abundante en páginas índicas, CJK o manuscritas, donde residen sus ventajas declaradas.{{/2}} El tamaño de 0.9B hace que una prueba de fin de semana sea económica incluso si no está seguro. Su modo de fallo aceptado es que cada cifra de la ficha es de NVIDIA y podría variar bajo una evaluación independiente.

Si tu entrada consiste principalmente en PDFs nacidos digitales en inglés y todo lo que necesitas es markdown limpio, olmOCR 2 es la opción predeterminada de menor riesgo. Si ya tienes autoalojamiento y el caso de uso multilingüe o basado en el diseño es real, Nemotron Parse 2.0 es la apuesta más interesante: pruébalo en tus propias páginas antes de comprometerte.

Evitar que la elección del parser se convierta en un lock-in.

Un pipeline de documentos tiene una etapa de parser y luego una etapa de LLM, y el parser suele ser la etapa más barata una vez que el volumen es real: el LLM que convierte el markdown parseado en resúmenes, registros estructurados o respuestas es donde el costo escala. Esa es la etapa que cambia una capa de enrutamiento. OrcaRouter pone más de 200 modelos detrás de una sola API al precio de lista del proveedor sin margen, por lo que un recorte de precio del proveedor está vigente el mismo día, y la conmutación por error automática evita que un proveedor degradado detenga un trabajo por lotes. Ninguno de los parsers en esta comparación está en nuestro catálogo — ambas fichas de modelo indican que no están desplegados por ningún proveedor de inferencia, por lo que esta es una decisión de autoalojamiento — pero la razón para mantener el parser desacoplado de tu pila de modelos es exactamente lo que el enrutamiento aporta en el lado aguas abajo: cambiar Nemotron Parse 2.0 por olmOCR 2, o viceversa, sin tocar una sola integración, porque la capa de LLM permanece detrás de la misma API de una sola clave.

Preguntas frecuentes

¿Qué modelo gana en los benchmarks?

Ninguno de los dos: los números no se enfrentan entre sí. Nemotron Parse 2.0 reporta ParseBench, MOSCAR, IndicVisionBench y un subconjunto de escritura a mano de OmniDocBench, todos propios de NVIDIA y ninguno reproducido de forma independiente. olmOCR 2 reporta olmOCR-Bench, el benchmark propio de AI2 sobre el que ahora publica el resto de la industria. Ningún tercero ha ejecutado ambos modelos sobre el mismo corpus, así que cualquier afirmación directa de «ganador» es una extrapolación. En cuanto a la tendencia: las cifras de olmOCR han resistido diez meses de uso por parte de la comunidad; las de Nemotron Parse 2.0 son recientes y podrían cambiar.

¿Es Nemotron Parse 2.0 realmente mejor con documentos no ingleses?

Esa es la afirmación: una expansión del vocabulario de aproximadamente 20 000 tokens, más MOSCAR en 0,9102 e IndicVisionBench en 0,7203, ambos reportados por el proveedor y ambos muy por encima de v1.2. olmOCR 2 no hace ninguna afirmación multilingüe y está etiquetado como inglés. Pero hasta que no se publique una ejecución independiente, trate las mejoras multilingües de Nemotron Parse 2.0 como prometedoras pero sin verificar, y pruébelas en sus propias páginas en idiomas índicos o CJK antes de confiar en ellas.

¿Necesito una GPU más grande para uno de ellos?

Sí, y rastrea la diferencia de tamaño. El modelo de 0.9B de Nemotron Parse 2.0 cabe en una tarjeta modesta de la era Ampere y es la opción más económica por página en el hardware que ya tienes. El VLM de 7B de olmOCR 2 requiere una GPU considerablemente más grande; su versión FP8 alcanza unos 3.400 tokens de salida por segundo en una H100, según AI2.

¿Cuál es mejor para el preprocesamiento de RAG?

Depende de lo que necesite tu recuperador. Si anclas las respuestas a regiones de la página, necesitas clases de diseño o quieres indexar tablas y gráficos como unidades propias, los cuadros delimitadores y las clases de Nemotron Parse 2.0 te ofrecen eso de forma nativa. Si tu pila de RAG solo consume texto limpio y tu corpus está en inglés, el markdown linealizado de olmOCR 2 es probado, más simple y está respaldado por un kit de herramientas maduro.

En resumen

NVIDIA lanzó un parser real esta semana y no se lo contó a nadie; AI2 lanzó uno hace diez meses y le dio a la categoría su benchmark. Nemotron Parse 2.0 es la mejor opción cuando necesitas semántica de maquetación, cobertura multilingüe o extracción de escritura a mano con un presupuesto ajustado — y las áreas donde sus cifras están menos verificadas son exactamente las áreas donde afirma ganar. olmOCR 2 es la mejor opción cuando necesitas texto linealizado a escala sobre documentos en inglés y quieres una cadena de herramientas que haya sido estable durante diez meses. Ninguno está desplegado en ningún sitio, así que esta es una decisión de autoalojamiento en cualquier caso; la forma más barata de tomarla es ejecutar ambos en tus propias páginas más difíciles y observar dónde falla cada uno.