
NVIDIA-Nemotron-Parse-2.0: NVIDIA lanzó silenciosamente un analizador de documentos más inteligente
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenNUEVOQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 591 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1653Inteligencia69Código60Matemáticas
NVIDIA-Nemotron-Parse-2.0 apareció en Hugging Face el 3 de agosto de 2026 y, al momento de escribir esto, cinco días después, NVIDIA aún no lo ha anunciado — ni publicación en blog, ni comunicado de prensa, ni hilo en X. El repositorio está completo: un codificador-decodificador de visión de 0.9B, una tarjeta de modelo con una tabla completa de benchmarks frente a NVIDIA-Nemotron-Parse-v1.2, configuraciones, un Dockerfile, un conjunto de pruebas, e incluso una solicitud de extracción para vLLM que ya hace referencia al cabezal auxiliar del nuevo modelo. Un lanzamiento completo con cero alboroto es exactamente el tipo de señal que merece un análisis de qué sabemos hasta ahora, así que eso es lo que esto es: los hechos que establece el repositorio, las cifras que siguen siendo reportadas por el proveedor, y las preguntas abiertas que un anuncio normalmente respondería.
Qué es NVIDIA-Nemotron-Parse-2.0
Nemotron Parse es el modelo de análisis de documentos de NVIDIA: le introduces una página escaneada o renderizada y devuelve el texto en orden de lectura, el cuadro delimitador y la clase semántica de cada región, y markdown — tablas incluidas — en el formato que elijas: LaTeX, HTML, markdown, JSON, JSON jerárquico o CSV. No es un LLM de propósito general ni un motor de OCR simple. Se sitúa entre ambos: extracción consciente del diseño, concebida para alimentar pipelines de RAG, extracción e inteligencia documental.
La versión 2.0 mantiene la misma familia de arquitectura que la v1.2, según la configuración del repositorio. El codificador de visión es un ViT-H construido sobre la base de C-RADIOv2 de NVIDIA, el decodificador es un decodificador de diez capas estilo mBART, y todo el conjunto asciende a unos 0.9B de parámetros. Las páginas de entrada admiten hasta 2048×1664, la generación alcanza un límite de 9.000 tokens, y el modelo etiqueta las regiones con un conjunto de clases semánticas (texto, título, encabezado de sección, elemento de lista, tabla, fórmula, imagen, pie de ilustración, nota al pie, encabezado/pie de página, y el resto). Es un modelo lo suficientemente pequeño como para autoalojarlo en una sola GPU, lo cual importa porque esa es la única forma de ejecutarlo hoy en día.
Qué cambió desde v1.2
La parte interesante de la tarjeta no es el modelo — es el delta. NVIDIA-Nemotron-Parse-v1.2 se lanzó en Hugging Face en febrero de 2026 con un vocabulario de 52 329 tokens. La versión 2.0 lo amplía a 72 256 tokens, un salto de aproximadamente 20 000 tokens, y la tarjeta es explícita sobre el porqué: los tokens adicionales compran OCR multilingüe, con las mayores ganancias en escrituras CJK e índicas. La tarjeta del modelo también enumera otros tres cambios:
• Análisis con reconocimiento de gráficos — un nuevo token de clase class_Chart>, para que las regiones de gráficos obtengan su propia clase semántica en lugar de agruparse con imágenes o tablas.
• Extracción mejorada de texto manuscrito: la tarjeta informa que la distancia de edición de texto en el conjunto Notes de OmniDocBench cae de 0.9739 en v1.2 a 0.3395 (menor es mejor), un gran cambio para lo que históricamente es el caso más débil de estos modelos.
• Manejo de tablas mejorado, integrado en la ganancia general de ParseBench en lugar de reportarse como un número propio.
Un detalle de entrenamiento que vale la pena mencionar: la tarjeta indica que 2.0 es una sopa de checkpoints de igual peso de los checkpoints de entrenamiento de los pasos 58k a 66k, lo cual es una receta habitual para un lanzamiento de punto discreto — tiende a aportar robustez sin necesidad de un reentrenamiento completo.
Los números que reporta la tarjeta
Todas las cifras siguientes provienen de la propia ficha del modelo de NVIDIA, medidas frente a la v1.2, y ninguna de ellas cuenta aún con una ejecución independiente por parte de terceros. Trátelas como datos reportados por el proveedor y de carácter orientativo:
• Puntuación general de ParseBench — de 0,5782 en v1.2 a 0,6391 en 2.0. ParseBench es el benchmark propio de NVIDIA que cubre fidelidad del texto, formato semántico, tablas, gráficos y anclaje visual.
• MOSCAR multilingüe BoC F1 — de 0.4410 a 0.9102. Este es el mayor salto individual de la tarjeta, y coincide con la expansión del vocabulario; MOSCAR cubre latino, árabe, cirílico, chino, hangul, japonés, índico, hebreo, tailandés, griego y más.
• IndicVisionBench: ANLS-character general — de 0,0612 a 0,7203, en diez lenguas índicas (bengalí, guyaratí, hindi, canarés, malayalam, maratí, oriya, panyabí, tamil, telugú).
Distancia de edición de texto de escritura a mano de OmniDocBench Notes — 0.9739 a 0.3395 (menor es mejor).

La magnitud de estos deltas es la razón por la que esta versión importa incluso sin un anuncio. Un movimiento de 0.44→0.91 en una métrica F1 de OCR multilingüe no es una versión menor; parece el trabajo multilingüe que normalmente encabezaría un lanzamiento. Si las mejoras se sostienen bajo una evaluación independiente es exactamente la pregunta que deja abierta la falta de cobertura.
Lo que el repo no nos dice
Ser honesto acerca de los límites es el objetivo de una publicación quiet-ship. El repositorio no confirma:
• Si 2.0 está (o estará) disponible como microservicio NVIDIA NIM — la v1.2 se sirve a través de la propia API NIM de NVIDIA, la ficha de 2.0 no incluye ninguna etiqueta NIM ni endpoint de despliegue, y su página de repositorio señala que el modelo «no está desplegado por ningún proveedor de inferencia».
• Precios, si los hay: los pesos no conllevan tarifa de uso, pero una opción alojada no ha sido tarificada ni anunciada.
• Evaluaciones independientes: no existe ninguna entrada de Artificial Analysis, LMArena u OmniDocBench para 2.0 todavía, por lo que no hay nada con qué contrastar las cifras del proveedor.
• La hoja de ruta — si 2.0 es un trampolín o un destino, y si habrá un seguimiento al estilo 2.1, se desconoce.
Lo único que es seguro es la licencia: el modelo está bajo la Licencia de Modelo Abierto de NVIDIA, que permite uso comercial y no comercial, con el tokenizador bajo CC-BY-4.0. Si quieres usarlo en un producto, esa casilla está marcada.
Ejecutándolo hoy
El autoalojamiento es la única opción actual, y conlleva cierta fricción que conviene conocer antes de planificar en torno a ello. El modelo se carga en Hugging Face Transformers con trust_remote_code, y vLLM puede servirlo — pero solo con una compilación de vLLM que incluya soporte de código remoto para Nemotron Parse. En hardware de clase A100/A10, NVIDIA recomienda forzar el backend de atención Triton, y necesitas cuatro dependencias adicionales: albumentations, timm, open_clip_torch y einops. También hay una peculiaridad con la cabeza de salida atada: 2.0 mantiene la cabeza del LM atada a las incrustaciones del decodificador, mientras que algunas compilaciones de vLLM materializan una cabeza de salida separada a menos que añadas el parche de runtime incluido de NVIDIA al PYTHONPATH.
Dos detalles de implementación del ecosistema completan el panorama. Primero, una pull request de vLLM actualmente abierta (en revisión a principios de agosto) habilita la decodificación especulativa para NVIDIA-Nemotron-Parse-2.0 mediante el uso de la cabeza de predicción auxiliar almacenada en el sidecar auxiliary_prediction_heads.safetensors.extra del repositorio; la documentación de la tarjeta describe ese archivo como no utilizado en la inferencia estándar, por lo que esta PR es la primera en consumirlo realmente. En un H100 sobre el censo de ParseBench de 1,005 páginas, el autor reporta ganancias medianas de throughput de salida de aproximadamente 45 % con concurrencia 1, 41 % con concurrencia 8 y 40 % con concurrencia 32 en comparación con la decodificación de un solo token — todas las cifras provienen de la PR, que aún no se ha fusionado ni se ha reproducido de forma independiente. Segundo, un issue de Dynamo señala un problema real en el tokenizador de 2.0: incluye un tokenizer.json serializado con padding incorporado que rellena cada codificación hasta 9,000 tokens, por lo que una pila de servicio que cargue el tokenizador con padding puede convertir un prompt multimodal de seis tokens en 54,000 IDs de token. Si haces autoalojamiento, asegúrate de que tu ruta de servicio realice la tokenización en línea en lugar de cargar el artefacto con padding.

Dónde se sitúa en el mercado de parseo de 2026
Nemotron Parse 2.0 entra en un campo abarrotado y de rápido movimiento. Los líderes actuales en análisis de documentos de código abierto incluyen MinerU 2.5-Pro (un modelo de 1.2B del Shanghai AI Lab) y PaddleOCR-VL (variantes de 0.9B y 7B), ambos con puntuaciones compuestas en los bajos 90 en la tabla de clasificación de OmniDocBench, además de GOT-OCR 2.0 de StepFun como la opción ligera de 580M; en el lado de la API, Mistral OCR es la principal oferta comercial. Dos advertencias antes de intentar colocar el 2.0 en esa clasificación. La primera es que los números no son comparables: Parse 2.0 reporta ParseBench, el conjunto propio de NVIDIA, mientras que las puntuaciones del campo son compuestos de OmniDocBench: tareas diferentes, ponderaciones diferentes, todavía no existe una comparación directa. La segunda es que no debes confundir NVIDIA-Nemotron-Parse-2.0 con el modelo separado de NVIDIA, NVIDIA-Nemotron-OCR-v2, un modelo OCR denso a nivel de palabra construido para los pipelines de NeMo Curator. Parse 2.0 es el analizador consciente de diseño y clase; OCR v2 es un extractor palabra por palabra. Son herramientas complementarias, no el mismo modelo.
Si se plantea con honestidad, el discurso de Parse 2.0 no es «supera al resto en todas las métricas de análisis». Es un analizador de 0,9B, con licencia permisiva y sensible al diseño, cuya ficha técnica presume de un salto multilingüe muy grande respecto a su predecesor — y cuya trayectoria (v1.1 en noviembre de 2025, v1.2 en febrero de 2026, 2.0 en agosto de 2026) demuestra que NVIDIA lanza un nuevo analizador aproximadamente cada trimestre. Para los equipos que ya están estandarizados en la familia Nemotron Parse, la 2.0 es una actualización directa, con la misma forma de API y una propuesta multilingüe mucho más sólida. Para todos los demás, la cuestión es si las afirmaciones del modelo no anunciado resisten las pruebas independientes.
Dónde encaja una capa de enrutamiento en un pipeline de análisis
Un modelo de análisis de documentos suele ser una etapa de un pipeline más largo, y las etapas que lo rodean son donde el enrutamiento demuestra su valor. La forma habitual es: Parse 2.0 convierte una página en fragmentos estructurados, y luego un LLM resume, responde preguntas, extrae entidades o estructura el resultado para un almacén posterior. Esa etapa de LLM es donde una plataforma de enrutamiento cambia la economía. OrcaRouter pone más de 200 modelos detrás de una sola API al precio de lista del proveedor — 0% de margen, por lo que un recorte de precio del proveedor se refleja en nuestro lado el mismo día que se anuncia — con conmutación por error automática si un proveedor se degrada. En concreto, eso significa que el analizador puede permanecer fijo mientras que el modelo que interpreta su salida se puede cambiar, comparar o enrutar por conmutación por error sin un segundo contrato ni un cambio de código. Si la etapa de análisis es el cuello de botella, quieres un modelo que puedas ajustar y alojar tú mismo, lo que Parse 2.0 te ofrece; si la etapa de interpretación es el costo variable, esa es la etapa que un enrutador debería gestionar. Nosotros no alojamos Parse 2.0 — es un modelo autoalojado, no una API — pero un analizador que alimenta a un LLM es precisamente la configuración donde un solo endpoint para la capa LLM resulta rentable.

En resumen
NVIDIA-Nemotron-Parse-2.0 es una versión real, completa y no anunciada del 3 de agosto de 2026. El repositorio muestra un analizador consciente del diseño de 0.9B cuya ficha técnica afirma mejoras muy grandes en multilingüismo y escritura manual frente a v1.2, publicado bajo una licencia permisiva con una fricción real en torno al autoalojamiento. Ninguna de esas cifras está verificada de forma independiente todavía, y no hay opción alojada ni precios. La decisión correcta depende de tu tolerancia al riesgo: si hoy procesas documentos multilingües y la métrica multilingüe es la que te importa, el movimiento reclamado de 0.44→0.91 en MOSCAR es lo bastante grande como para justificar una prueba de fin de semana con tu propio corpus — los deltas son del tipo que o se replican o se desmoronan, y un lanzamiento discreto es la forma más barata de descubrir cuál de los dos ocurre. Si necesitas un punto de referencia que citar o una API con soporte sobre la cual apostar un camino de producción, espera a un anuncio o a una ejecución independiente. Mientras tanto, así es como se ve un lanzamiento discreto, y vale la pena seguirle la pista.
Preguntas frecuentes
¿Es NVIDIA-Nemotron-Parse-2.0 una filtración o un lanzamiento real?
Ninguna etiqueta encaja del todo. No es una filtración en el sentido de pesos sueltos o parciales: el repositorio está completamente ensamblado, con una tarjeta de modelo detallada, archivos de configuración, un Dockerfile, una suite de pruebas con salidas de referencia y scripts de inferencia tanto para Transformers como para vLLM. Pero tampoco es un lanzamiento en el sentido habitual: NVIDIA no ha publicado ningún anuncio, y el empaquetado NIM y el endpoint alojado que acompañaban a las versiones anteriores de Nemotron Parse están ausentes. La descripción correcta es la de un lanzamiento completo que el proveedor aún no ha decidido promocionar; por eso la etiqueta honesta aquí es «lanzamiento silencioso», y por eso las cuestiones que un anuncio normalmente resolvería (precios, hoja de ruta, disponibilidad alojada) siguen siendo preguntas abiertas.
¿Cómo se comparan los puntos de referencia del proveedor con los números de OmniDocBench que la gente cita para otros analizadores?
No, no directamente. Las cifras de {{1}}la ficha de NVIDIA-Nemotron-Parse-2.0{{/1}} provienen de ParseBench, el benchmark propio de NVIDIA que cubre fidelidad textual, formato semántico, tablas, gráficos y grounding visual, además de MOSCAR, IndicVisionBench y un subconjunto de escritura manuscrita de OmniDocBench; mientras que las puntuaciones más destacadas del mercado ({{2}}MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR{{/2}}) son puntuaciones compuestas de OmniDocBench. Tareas distintas, métricas distintas; todavía no existe ninguna comparación publicada en igualdad de condiciones. El único número que sí se solapa con el ecosistema — {{3}}la cifra de escritura manuscrita de OmniDocBench Notes{{/3}} — se reporta como una distancia de edición de texto frente a la v1.2, no como una puntuación compuesta, así que sigue sin poder clasificarse frente a las demás. Hasta que se realice una ejecución independiente, trate las afirmaciones de Parse 2.0 como orientativas y no verificadas.
¿Qué debería probar un equipo antes de ponerlo en producción?
Tres cosas. Primero, tu propio corpus multilingüe: todo el discurso de 2.0 es el salto multilingüe, y un lanzamiento silencioso es exactamente la situación en la que las ganancias afirmadas o se replican en tus datos o no lo hacen: ejecuta los idiomas que realmente procesas antes de creer en la ficha. Segundo, la pila de autoalojamiento: confirma que tu compilación de vLLM tiene soporte de código remoto de Nemotron Parse, aplica el parche de cabezas de salida atadas y verifica que tu ruta de servicio realice la tokenización en línea en lugar de cargar el tokenizer.json rellenado, lo que puede expandir un mensaje corto a 9,000 tokens. Tercero, la historia de licencia y servicio: los pesos son gratuitos bajo la Licencia de Modelo Abierto de NVIDIA, pero no hay NIM anunciado, ni precios, ni contrato de soporte, así que planifica en torno al autoalojamiento y enruta la etapa de LLM aguas abajo a través de una capa que te permita intercambiar modelos y realizar conmutación por error sin reingeniería, que es para lo que está hecha una plataforma de enrutamiento.
