
NVIDIA-Nemotron-Parse-2.0: NVIDIA тихо выпустила более умный парсер документов
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 591 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3055Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1653Интеллект69Кодинг60Математика
NVIDIA-Nemotron-Parse-2.0 появился на Hugging Face 3 августа 2026 года, и на момент написания этой статьи, пять дней спустя, NVIDIA до сих пор не объявила о нём — ни поста в блоге, ни пресс-релиза, ни треда в X. Репозиторий полный: 0.9B vision-encoder-decoder, карточка модели с полной таблицей бенчмарков в сравнении с NVIDIA-Nemotron-Parse-v1.2, конфиги, Dockerfile, тестовый набор и даже pull request в vLLM, который уже ссылается на дополнительную голову новой модели. Полный релиз без единой помпы — это именно тот сигнал, который стоит рассмотреть в формате «что нам известно на данный момент», поэтому вот что это такое: факты, которые устанавливает репозиторий, цифры, которые по-прежнему указаны вендором, и открытые вопросы, на которые обычно отвечает анонс.
Что такое NVIDIA-Nemotron-Parse-2.0?
Nemotron Parse — это модель NVIDIA для разбора документов: вы подаёте ей отсканированную или отрендеренную страницу, и она возвращает текст в порядке чтения, ограничивающие рамки и семантический класс каждой области, а также Markdown — включая таблицы, в выбранном вами формате: LaTeX, HTML, Markdown, JSON, иерархический JSON или CSV. Это не универсальная LLM и не простой OCR-движок. Она находится между ними: извлечение с учётом макета, предназначенное для питания конвейеров RAG, извлечения данных и интеллектуальной обработки документов.
Версия 2.0 сохраняет то же семейство архитектуры, что и v1.2, согласно конфигу репозитория. Энкодер изображений — ViT-H на основе магистрали NVIDIA C-RADIOv2, декодер — десятислойный декодер в стиле mBART, а весь объём составляет около 0,9 млрд параметров. Входные страницы поддерживаются до 2048×1664, генерация ограничена потолком в 9000 токенов, а модель размечает области набором семантических классов (текст, заголовок, заголовок раздела, элемент списка, таблица, формула, рисунок, подпись, сноска, верхний/нижний колонтитул и прочее). Это достаточно компактная модель, чтобы разместить её на одном GPU, что важно, поскольку сегодня это единственный способ её запуска.
Что изменилось по сравнению с v1.2
Интересная часть карточки модели — не сама модель, а дельта. NVIDIA-Nemotron-Parse-v1.2 вышла на Hugging Face в феврале 2026 года со словарём из 52 329 токенов. Версия 2.0 расширяет его до 72 256 токенов — скачок примерно на 20 тысяч токенов — и карточка прямо объясняет, зачем: дополнительные токены обеспечивают многоязычное OCR, причём наибольший прирост приходится на письменности CJK и индийские. В карточке модели также перечислены три других изменения:
• Разбор с учётом диаграмм — новый токен класса class_Chart>, поэтому области диаграмм получают собственный семантический класс, а не объединяются с изображениями или таблицами.
• Улучшено извлечение рукописного текста — в карточке сообщается, что расстояние редактирования текста на наборе OmniDocBench Notes снизилось с 0.9739 в v1.2 до 0.3395 (чем меньше, тем лучше), что является большим скачком для исторически самого слабого случая для этих моделей.
• Улучшение обработки таблиц учтено в общем приросте ParseBench, а не вынесено отдельным показателем.
Одна деталь обучения, которую стоит отметить: в карточке указано, что 2.0 — это смесь чекпоинтов с равными весами, полученных на шагах с 58k по 66k, что является типичным рецептом для спокойного точечного релиза: это обычно даёт дополнительную устойчивость без полного переобучения.
Числа, которые сообщает карта
Все следующие показатели взяты из собственной карточки модели NVIDIA, измерены относительно v1.2, и ни один из них ещё не был проверен независимой третьей стороной. Воспринимайте их как данные поставщика, носящие ориентировочный характер:
• Общий балл ParseBench — с 0.5782 на v1.2 до 0.6391 на 2.0. ParseBench — собственный бенчмарк NVIDIA, охватывающий точность передачи текста, семантическое форматирование, таблицы, диаграммы и визуальную привязку.
• MOSCAR многоязычный BoC F1 — от 0.4410 до 0.9102. Это самый большой скачок в таблице, и он согласуется с расширением словарного запаса; MOSCAR охватывает латиницу, арабское письмо, кириллицу, китайское письмо, хангыль, японское письмо, индийское письмо, иврит, тайское письмо, греческое письмо и другие.
• Общий ANLS-character для IndicVisionBench — от 0.0612 до 0.7203, для десяти индийских языков (бенгальский, гуджарати, хинди, каннада, малаялам, маратхи, ория, пенджаби, тамильский, телугу).
• Расстояние редактирования текста рукописных заметок OmniDocBench — с 0.9739 до 0.3395 (чем меньше, тем лучше).

Масштаб этих изменений — причина, по которой этот релиз важен даже без анонса. Переход с 0.44→0.91 по мультиязычной метрике F1 для OCR — это не мелкий точечный релиз; он выглядит как мультиязычная работа, которая обычно становится главной темой запуска. Сохранятся ли эти улучшения при независимой оценке — именно тот вопрос, который остаётся открытым из-за отсутствия освещения.
Что репозиторий нам не рассказывает
Честность в отношении границ — вот в чем смысл поста о тихом корабле. Репозиторий не подтверждает:
• Доступна ли версия 2.0 (или будет ли) в качестве микросервиса NVIDIA NIM — v1.2 обслуживается через собственный NIM API NVIDIA, в карточке 2.0 не указаны тег NIM и конечная точка развертывания, а на странице репозитория отмечается, что модель «не развернута ни одним провайдером инференса».
• Цены, если таковые имеются — за использование весов плата не взимается, но стоимость размещённого варианта не установлена и не объявлена.
• Независимые бенчмарки — для 2.0 пока нет записей в Artificial Analysis, LMArena или OmniDocBench, поэтому не с чем сверять цифры вендора.
• Дорожная карта — является ли 2.0 промежуточным этапом или конечной целью и появится ли продолжение вроде 2.1, неизвестно.
Единственное, что не вызывает сомнений, — это лицензия: модель распространяется под NVIDIA Open Model License, которая разрешает коммерческое и некоммерческое использование, а токенизатор — под CC-BY-4.0. Если вы хотите использовать её в продукте, этот пункт закрыт.
Запускаю сегодня
Самостоятельное размещение (self-hosting) — единственный доступный на данный момент вариант, и оно связано с некоторыми сложностями, о которых стоит знать, прежде чем строить планы. Модель загружается в Hugging Face Transformers с trust_remote_code, а vLLM может её обслуживать — но только в сборке vLLM, которая включает поддержку удалённого кода Nemotron Parse. На оборудовании класса A100/A10 компания NVIDIA рекомендует принудительно использовать бэкенд внимания Triton, а также вам понадобятся четыре дополнительные зависимости: albumentations, timm, open_clip_torch и einops. Есть ещё одна особенность с привязанным выходным слоем (tied output head): в версии 2.0 языковая голова (LM head) остаётся привязанной к эмбеддингам декодера, тогда как некоторые сборки vLLM создают отдельную выходную голову, если не добавить в PYTHONPATH входящий в комплект runtime-патч от NVIDIA.
Две детали развертывания из экосистемы дополняют картину. Во-первых, открытый pull request в vLLM (на рецензировании с начала августа) включает спекулятивное декодирование для NVIDIA-Nemotron-Parse-2.0, используя вспомогательную головку предсказаний, хранящуюся в дополнительном файле auxiliary_prediction_heads.safetensors.extra из репозитория — в собственной документации карточки указано, что этот файл не используется при стандартном инференсе, так что данный PR — первое, что реально его потребляет. На H100 на наборе ParseBench из 1 005 страниц автор сообщает о медианном приросте пропускной способности вывода примерно на 45% при параллелизме 1, 41% при параллелизме 8 и 40% при параллелизме 32 по сравнению с декодированием одного токена — все цифры из PR, ещё не слитого и независимо не воспроизведённого. Во-вторых, issue в Dynamo указывает на реальную ловушку в токенизаторе 2.0: он поставляется с сериализованным tokenizer.json со встроенным паддингом, который дополняет каждую кодировку до 9 000 токенов, поэтому серверный стек, загружающий такой дополненный токенизатор, может раздуть шеститокеновый мультимодальный промпт до 54 000 токен-айдишников. Если вы разворачиваете самостоятельно, убедитесь, что ваш серверный конвейер выполняет токенизацию онлайн, а не загружает дополненный артефакт.

Где он находится на рынке парсинга в 2026 году
Nemotron Parse 2.0 выходит на переполненное и быстро развивающееся поле. Текущие лидеры среди open-source парсеров документов — MinerU 2.5-Pro (модель 1.2B от Shanghai AI Lab) и PaddleOCR-VL (варианты 0.9B и 7B), обе набирают композитные баллы в низких 90-х на лидерборде OmniDocBench, плюс GOT-OCR 2.0 от StepFun как лёгкий вариант на 580M; на стороне API основное коммерческое предложение — Mistral OCR. Две оговорки, прежде чем пытаться вписать 2.0 в этот рейтинг. Первая: цифры несопоставимы — Parse 2.0 отчитывается по ParseBench, собственному набору NVIDIA, а баллы остальных — это композитные оценки OmniDocBench: разные задачи, разное взвешивание, и показателя, допускающего прямое сравнение, пока не существует. Вторая: не путайте NVIDIA-Nemotron-Parse-2.0 с отдельной моделью NVIDIA-Nemotron-OCR-v2 — плотной OCR-моделью уровня слов, созданной для пайплайнов NeMo Curator. Parse 2.0 — это парсер с учётом макета и классов; OCR v2 — пословный извлекатель. Это взаимодополняющие инструменты, а не одна и та же модель.
Если говорить честно, позиционирование Parse 2.0 — это не «обходит всех по каждой метрике парсинга». Это модель с 0,9 млрд параметров, пермиссивной лицензией и пониманием вёрстки, в карточке которой заявлен очень большой многоязычный скачок по сравнению с её собственной предшественницей — и чья родословная (v1.1 — ноябрь 2025, v1.2 — февраль 2026, 2.0 — август 2026) показывает, что NVIDIA выпускает новый парсер примерно каждый квартал. Для команд, уже стандартизировавшихся на семействе Nemotron Parse, 2.0 — это бесшовное обновление с тем же API и гораздо более сильной многоязычной историей. Для всех остальных вопрос в том, выдержат ли заявления неанонсированной модели независимое тестирование.
Где уровень маршрутизации вписывается в конвейер разбора
Модель разбора документов обычно является одним из этапов более длинного конвейера, и именно этапы вокруг неё определяют, где маршрутизация оправдывает своё существование. Обычная схема такова: Parse 2.0 превращает страницу в структурированные фрагменты, а затем LLM резюмирует, отвечает на вопросы, извлекает сущности или структурирует результат для последующего хранилища. Именно на этапе LLM платформа маршрутизации меняет экономику. OrcaRouter предоставляет более 200 моделей через один API по прейскурантной цене провайдера — с нулевой наценкой, поэтому снижение цены вендором отражается у нас в тот же день, когда оно объявлено, — с автоматическим переключением при ухудшении работы одного из провайдеров. Конкретно это означает, что парсер может оставаться неизменным, в то время как модель, интерпретирующая его вывод, может быть заменена, сравнена или переключена на резерв без второго контракта или изменения кода. Если узким местом является этап разбора, вам нужна модель, которую можно настраивать и размещать самостоятельно, — и её даёт Parse 2.0; если переменные затраты приходятся на этап интерпретации, то именно этим этапом должен управлять маршрутизатор. Мы сами не размещаем Parse 2.0 — это модель для самостоятельного размещения, а не API, — но связка «парсер, передающий результаты LLM» — это как раз тот случай, когда единая конечная точка для уровня LLM окупается.

Суть
NVIDIA-Nemotron-Parse-2.0 — это реальный, полноценный, неанонсированный релиз от 3 августа 2026 года. В репозитории — парсер 0.9B с учётом вёрстки, в карточке которого заявлены очень значительные улучшения многоязычности и рукописного ввода по сравнению с v1.2; он распространяется под разрешительной лицензией, при этом самостоятельный хостинг связан с реальными сложностями. Ни одна из этих цифр пока независимо не подтверждена, и нет ни облачного варианта, ни цен. Правильное решение зависит от вашей терпимости к риску: если вы уже сегодня обрабатываете многоязычные документы и именно многоязычная метрика для вас важна, заявленное движение 0.44→0.91 по MOSCAR достаточно велико, чтобы оправдать тест на выходных на собственном корпусе — такие дельты либо воспроизводятся, либо обрушиваются, а тихий релиз — самый дешёвый способ выяснить, какой именно. Если вам нужен бенчмарк, на который можно сослаться, или поддерживаемый API, на который можно сделать ставку в продакшене, дождитесь анонса или независимого прогона. А пока — вот так выглядит тихий релиз, и за ним стоит наблюдать.
Часто задаваемые вопросы
Является ли NVIDIA-Nemotron-Parse-2.0 утечкой или официальным релизом?
Ни один из ярлыков не подходит полностью. Это не утечка в смысле разрозненных или частичных весов — репозиторий полностью собран, с подробной карточкой модели, конфигурационными файлами, Dockerfile, тестовым набором с эталонными выходными данными и скриптами для инференса как для Transformers, так и для vLLM. Но это также и не запуск в обычном смысле: NVIDIA не сделала никакого анонса, а NIM-упаковка и хостинговая конечная точка, которые сопровождали предыдущие релизы Nemotron Parse, отсутствуют. Точное описание — это полный релиз, который вендор пока не решил продвигать, — поэтому честный ярлык здесь — «тихий релиз», и поэтому вопросы, которые обычно решаются анонсом (цены, дорожная карта, доступность в хостинге), остаются открытыми.
Как соотносятся бенчмарки вендора с числами OmniDocBench, которые люди приводят для других парсеров?
Напрямую — нет. Показатели на карточке NVIDIA-Nemotron-Parse-2.0 взяты из ParseBench — собственного бенчмарка NVIDIA, охватывающего точность воспроизведения текста, семантическое форматирование, таблицы, диаграммы и визуальную привязку, — а также из MOSCAR, IndicVisionBench и подмножества рукописных данных OmniDocBench; тогда как ключевые показатели рынка (MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR) являются составными оценками OmniDocBench. Задачи и метрики разные, поэтому опубликованного корректного сравнения пока не существует. Единственный показатель, который пересекается с экосистемой, — значение по рукописным заметкам OmniDocBench — приводится как расстояние редактирования текста относительно v1.2, а не как составная оценка, так что его по-прежнему нельзя поставить в один ряд с остальными. Пока не появится независимый прогон, относитесь к заявлениям Parse 2.0 как к ориентировочным и непроверенным.
Что команде следует протестировать перед выпуском в продакшн?
Три вещи. Во-первых, ваш собственный многоязычный корпус: весь смысл версии 2.0 — это многоязычный скачок, и тихий релиз — это как раз та ситуация, когда заявленные преимущества либо воспроизводятся на ваших данных, либо нет — прогоните языки, которые вы реально парсите, прежде чем верить карточке. Во-вторых, стек самостоятельного хостинга: убедитесь, что ваша сборка vLLM поддерживает удалённый код Nemotron Parse, примените патч tied-output-head и проверьте, что ваш путь обслуживания выполняет токенизацию онлайн, а не загружает дополненный tokenizer.json, который может раздуть короткий запрос до 9 000 токенов. В-третьих, лицензия и условия обслуживания: веса бесплатны по лицензии NVIDIA Open Model License, но не объявлено ни NIM, ни цен, ни контракта на поддержку — так что планируйте самостоятельный хостинг и направляйте этап LLM дальше по конвейеру через слой, который позволяет менять модели и выполнять переключение без переработки, — именно для этого и создаются платформы маршрутизации.
