Титульная карточка для «Nemotron Parse 2.0 vs MinerU — необъявленный претендент против стандартного решения с открытым исходным кодом»: слева значок страницы документа, справа значок коробки с открытым исходным кодом.
Guides & Insights

Nemotron Parse 2.0 против MinerU: Необъявленный претендент против открытого решения по умолчанию

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

NVIDIA-Nemotron-Parse-2.0 и MinerU решают одну и ту же задачу с противоположных сторон. Оба берут отсканированную или отрендеренную страницу и возвращают чистый структурированный markdown с таблицами, формулами и сохранённым порядком чтения. Но MinerU — это открытый стандарт по умолчанию: десятки тысяч звёзд на GitHub, лицензия Apache-2.0 и размещённый API с бесплатной ежедневной квотой, безопасный первый выбор, к которому обращается большинство команд, работающих с документами. Nemotron Parse 2.0 — полная противоположность устоявшемуся: он появился на Hugging Face 3 августа 2026 года, NVIDIA не выпускала о нём никаких анонсов, а его карточка модели содержит набор заявлений о бенчмарках, которые стали бы самым значительным событием в открытом разборе документов за этот год, если бы они подтвердились. Это сопоставление намеренно неравное — действующий игрок против неанонсированного претендента — и весь вопрос в том, чего на самом деле стоит аргументация каждой стороны.

Что на самом деле представляет собой каждая сторона

MinerU — это полноценная система разбора документов от OpenDataLab, группы данных, стоящей за открытыми релизами Шанхайской лаборатории искусственного интеллекта. Текущий флагман — MinerU 2.5-Pro, мультимодальная модель «зрение-язык» с 1,2 млрд параметров из линейки точечных релизов 2604/2605 (модель 2604 вышла в апреле 2026 года, а после неё последовало обновление 2605). Она работает поверх двухэтапного движка — сначала выполняется грубый глобальный анализ макета, затем целенаправленное распознавание фрагментов в исходном разрешении, — а в проекте модель дополнена функциями загрузки PDF, DOCX, PPTX и XLSX, определения макета, распознавания формул и таблиц и восстановления порядка чтения. Это эталонный парсер с открытым исходным кодом для RAG-предобработки, и его сообщество — тому подтверждение.

Nemotron Parse 2.0 — это модель «энкодер-декодер» для зрения с 0,9 млрд параметров от NVIDIA, относящаяся к тому же семейству, что и выпущенная в феврале 2026 года NVIDIA-Nemotron-Parse-v1.2. В ней используются зрительный энкодер ViT-H на базе магистрали C-RADIOv2 от NVIDIA и десятислойный декодер в стиле mBART. Входные страницы поддерживаются размером до 2048×1664, генерация ограничена потолком в 9 000 токенов, а выдаёт она те же структурированные результаты, что и MinerU: markdown или обычный текст, а также таблицы в форматах LaTeX, HTML, markdown, JSON, иерархическом JSON или CSV, с классами макета, ограничивающими рамками и порядком чтения. Репозиторий полный — конфиги, Dockerfile, набор тестов с эталонными результатами, — но NVIDIA его не продвигает, NIM-упаковки нет, и ни один инференс-провайдер его не размещает. Самостоятельное размещение — единственный доступный на сегодня вариант.

Screenshot of the Hugging Face model card for NVIDIA-Nemotron-Parse-2.0, showing the nvidia-open-model-license, 0.9B model size, 2,156 downloads last month, and the note that the model isn't deployed by any inference provider.

История о цене: «бесплатно» означает две разные вещи.

Самое большое практическое различие состоит в том, что {{1}}вызов MinerU бесплатен, а Nemotron Parse 2.0 можно только бесплатно запускать{{/1}}. Официальный API MinerU на сайте mineru.net предлагает ежедневный бесплатный тариф — примерно 1 000 страниц с высоким приоритетом в день в зависимости от текущей акции — без платы за каждый вызов и с файлами до 200 страниц каждый. При превышении квоты задания получают более низкий приоритет, а не выставляются в счет, а коммерческие хостинг-провайдеры оценивают самостоятельно размещенную модель примерно в одну десятую цента за страницу. Если вашему конвейеру нужны тысячи страниц в день и вы не хотите ничего эксплуатировать, {{2}}у MinerU есть путь, который почти ничего не стоит{{/2}}.

У Nemotron Parse 2.0 нет такого пути. Веса распространяются бесплатно по лицензии NVIDIA Open Model License, но в карточке модели указано, что она не развернута ни одним провайдером инференса, и NVIDIA не установила цену и не анонсировала хостинг-вариант. Использование модели означает аренду или владение GPU, развертывание Transformers или сборки vLLM с поддержкой удаленного кода Nemotron Parse, а также решение описанных ниже проблем развертывания. Для проекта с небольшим объемом это реальные затраты — GPU значительно дороже бесплатного тарифа API при нескольких сотнях страниц в месяц. Для команды, которая уже эксплуатирует GPU-инфраструктуру, бесплатные веса — настоящее преимущество; вопрос в том, оправдывают ли операционные издержки то, что, по заявлению модели, она добавляет.

Разрыв в бенчмарках: эти числа не сопоставимы.

Это раздел, где большинство сравнений тихо идут не туда, поэтому давайте будем явными. Карточка Nemotron Parse 2.0 сообщает о четырёх бенчмарках: ParseBench в целом — 0.6391 (вырос с 0.5782 у v1.2), многоязычный OCR MOSCAR — 0.9102 BoC F1 (вырос с 0.4410), IndicVisionBench — 0.7203 ANLS-символ (вырос с 0.0612), а также подмножество рукописных текстов OmniDocBench, измеряемое как расстояние редактирования текста, улучшившееся с 0.9739 до 0.3395. MinerU 2.5-Pro сообщает о другом наборе: общий балл OmniDocBench v1.6 — 95.69, что является самым высоким показателем, превосходящим гораздо более крупные модели, плюс 97.29 по плотному разбору формул и 0.036 расстояния редактирования текста на собственных прогонах OmniDocBench.

{{1}}Обе модели носят одно и то же название «OmniDocBench», из-за чего они выглядят сопоставимыми, однако метрики таковыми не являются.{{/1}} {{2}}NVIDIA указывает редакционное расстояние на подмножестве, содержащем только рукописный текст; OpenDataLab указывает общий совокупный показатель на другой версии бенчмарка.{{/2}} {{3}}ParseBench — собственный набор тестов NVIDIA, и в нём нет записи MinerU.{{/3}} {{4}}В MOSCAR и IndicVisionBench нет записи MinerU.{{/4}} {{5}}Все цифры с обеих сторон получены от вендоров, и ни для одной из моделей не опубликован независимый сторонний прогон, в котором участвовала бы другая модель.{{/5}} {{6}}Это означает, что на данный момент не существует сопоставимого показателя, который позволял бы напрямую сравнить Nemotron Parse 2.0 с MinerU, — любой, кто говорит вам, что одна модель «побеждает» в сравнении бенчмарков, экстраполирует данные разных тестов.{{/6}} {{7}}Если говорить о направлении: заявления MinerU зрелые и выдержали год использования сообществом, тогда как заявления Nemotron Parse 2.0 свежие, непроверенные и — если его скачки в MOSCAR и IndicVision воспроизведутся — имеют большое значение именно для многоязычного парсинга.{{/7}}

A comparison scoreboard for Nemotron Parse 2.0 and MinerU 2.5-Pro. Nemotron Parse 2.0: shipped Aug 3 2026 unannounced, 0.9B params, NVIDIA Open Model license, no hosted API, ParseBench 0.6391, MOSCAR 0.9102 F1. MinerU 2.5-Pro: shipped Apr 2026, 1.2B params, Apache 2.0, official API with free tier, OmniDocBench v1.6 95.69, 109 languages.

Где они расходятся на реальных рабочих нагрузках

Screenshot of the Hugging Face model card for opendatalab/MinerU2.5-Pro-2604-1.2B, showing the Apache-2.0 license, the arXiv tech report 'MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale', and an 'unmatched SOTA Performance' banner.

Отложите бенчмарки в сторону — и различия, которые проявляются в пайплайне, касаются охвата, задержки и многоязычного покрытия.

• Область ввода — MinerU обрабатывает полные PDF-файлы объёмом до 200 страниц на файл через свой API и объединяет таблицы, переходящие со страницы на страницу; Nemotron Parse 2.0 принимает изображение страницы размером до 2048×1664 за вызов, поэтому документ из 200 страниц — это 200 запросов. Если ваш входной формат — PDF, это различие в рабочем процессе ещё до вопроса о точности.

• Зрелость serving-части — MinerU поставляет бэкенды vLLM и SGLang с опубликованной пропускной способностью (примерно 2 страницы в секунду на одном A100 через свой асинхронный движок), Docker-раннер и размещённый API. История serving-части Nemotron Parse 2.0 ещё молодая и неровная: для vLLM требуется поддержка remote-кода, а на оборудовании A100/A10 — бэкенд внимания Triton; токенизатор поставляет сериализованный tokenizer.json со встроенным дополнением до 9 000 токенов, из-за чего один serving-стек получил из промпта на шесть токенов взрыв до 54 000 ID токенов; а в репозитории лежит runtime-патч для сборок vLLM, не поддерживающих его связанную выходную голову. Всё это не непреодолимо, но это реальное трение.

• Многоязычность — это сильнейшая сторона карты Nemotron Parse 2.0. Релиз 2.0 расширил словарь примерно с 52 000 до 72 000 токенов специально для многоязычного OCR, и заявленные улучшения сосредоточены именно здесь: MOSCAR вырос с 0,44 до 0,91, а IndicVisionBench (бенгальский, хинди, тамильский и ещё семь индийских письменностей) — с 0,06 до 0,72. MinerU заявляет поддержку 109 языков как ключевую функцию, но её подтверждение — это комплексный бенчмарк OmniDocBench, а не разбивка по отдельным письменностям. Если ваш корпус в основном состоит из индийских или низкоресурсных письменностей, цифры Nemotron Parse 2.0 — более интересное утверждение для проверки; к тому же они наименее независимо подтверждены.

• Рукописный текст — самое большое изменение на карточке NVIDIA: расстояние редактирования на подмножестве заметок OmniDocBench снижается с 0.97 до 0.34. Собственное расстояние редактирования текста MinerU в 0.036 получено на общих прогонах OmniDocBench, а не на подмножестве рукописных текстов, так что опять же эти цифры не сопоставимы напрямую. Но рукописные заметки — это классическое слабое место для обеих систем, и это та область, где заявленное улучшение Nemotron Parse 2.0 достаточно велико, чтобы оправдать прямое тестирование на ваших собственных страницах.

Кто должен выбирать

Выбирайте MinerU, если вам нужен парсер, который можно задействовать уже сегодня: бесплатный дневной тариф, зрелый сервис, полноценный ввод PDF, лицензия Apache-2.0 без проверки соответствия и достаточно большое сообщество, в котором уже есть ответы на вопросы по настройке. Он является решением по умолчанию не просто так, и для большинства задач предварительной обработки RAG это менее рискованный выбор.

Выбирайте Nemotron Parse 2.0, если вы уже комфортно развертываете модели самостоятельно — особенно если вы работаете с NVIDIA NIM или NeMo, поскольку v1.2 поставляется как NIM, а 2.0, судя по всему, будет его преемником, — и если мультиязычность или распознавание рукописного ввода — именно то, что нужно вашему корпусу. Тест на выходных на ваших собственных страницах на индийских языках или страницах с обилием рукописных заметок расскажет вам больше, чем любая таблица бенчмарков, потому что заявления либо подтвердятся, либо рухнут на независимых данных. Просто не планируйте производственный путь вокруг неанонсированной модели, пока не прогоните этот тест и не подтвердите, что токенизатор и особенности сервинга учтены в вашем стеке.

Почему парсер — не единственная затрата в конвейере

Что бы вы ни выбрали, парсер обычно оказывается самым дешёвым этапом в конвейере обработки документов, когда появляются реальные объёмы. Дорогостоящий этап — это LLM, который превращает распарсенный Markdown в сводки, структурированные записи или ответы. Именно на этом этапе маршрутизирующий слой меняет экономику. OrcaRouter предоставляет доступ к 200+ моделям через один API по цене из прайс-листа провайдера без наценки, поэтому снижение цены вендором вступает в силу в тот же день, когда оно объявлено, а автоматическое переключение означает, что один деградировавший провайдер не застопорит всю задачу извлечения. Конкретно: вы можете проверить заявления Nemotron Parse 2.0 о распознавании рукописного текста в сравнении с MinerU на собственном корпусе, не привязывая свой нижестоящий стек моделей ни к одному из парсеров, поскольку замена парсера и слой LLM не связаны между собой. Сегодня мы не размещаем ни один из парсеров: Nemotron Parse 2.0 — это модель для самостоятельного развёртывания, а MinerU работает в собственном сервисе. Но маршрутизирующий слой на этапе LLM как раз и не позволяет выбору парсера превратиться в привязку (lock-in).

Итог

MinerU — рациональный выбор по умолчанию: зрелый, бесплатный при небольших масштабах, с разрешительной лицензией и проверенный в продакшене. Nemotron Parse 2.0 — интересная ставка: модель NVIDIA на 0.9B, тихо выпущенная пять дней назад, в карточке которой заявлен значительный скачок в многоязычности и рукописном вводе, но никто это независимо не проверил. Если вы обрабатываете в основном англоязычные технические документы в больших объёмах, MinerU — ответ, и риск Nemotron Parse 2.0 того не стоит. Если вы обрабатываете индийские или низкоресурсные письменности либо рукописные заметки, заявления достаточно значительны, а веса достаточно бесплатны, чтобы самостоятельное тестирование вышло недорогим. NVIDIA выпускает новый парсер примерно каждый квартал (v1.1 в ноябре 2025, v1.2 в феврале 2026, 2.0 сейчас), что позволяет предположить, что анонс может появиться вскоре; пока этого не произошло, относитесь к показателям 2.0 как к ориентировочным и тестируйте на собственном корпусе.

Часто задаваемые вопросы

Доступен ли Nemotron Parse 2.0 через какой-либо API?

Не через хостинговый сервис. В карточке на Hugging Face указано, что модель не развёрнута ни одним провайдером инференса, и по состоянию на начало августа 2026 года NVIDIA не анонсировала ни упаковку NIM, ни цены на неё. Единственный способ запустить её — самостоятельно разместить веса через Hugging Face Transformers с параметром trust_remote_code или через сборку vLLM, включающую поддержку удалённого кода Nemotron Parse. MinerU, напротив, имеет официальный API с бесплатной дневной квотой по страницам.

Какая модель лучше подходит для предварительной обработки RAG?

Для типичных RAG-конвейеров — англоязычные и китайские (CJK) технические документы, таблицы и смешанные макеты — MinerU является более безопасным и проверенным выбором: он принимает полные PDF-файлы, объединяет таблицы, разнесённые по страницам, имеет зрелую серверную инфраструктуру и ничего не стоит при небольших объёмах благодаря бесплатному тарифу. Nemotron Parse 2.0 становится правильным выбором только в том случае, если ваш корпус в значительной степени состоит из индийских или малоресурсных письменностей, рукописных заметок или страниц с большим количеством диаграмм, где сосредоточены его заявленные преимущества — и даже тогда, прежде чем принимать решение, проверьте на своих собственных документах.

Сравнимы ли напрямую показатели бенчмарков на двух карточках моделей?

Нет. Nemotron Parse 2.0 сообщает ParseBench (собственный набор NVIDIA), MOSCAR, IndicVisionBench и подмножество рукописного ввода OmniDocBench как редакционное расстояние. MinerU 2.5-Pro сообщает общий композитный показатель OmniDocBench v1.6, а также метрики формул и редактирования текста. Совпадающее имя бенчмарка — не та же метрика, ни один независимый прогон не ставит обе модели на один и тот же тест, и все цифры на обеих карточках указаны самими вендорами. Относитесь к ним как к ориентировочным, а не напрямую сравнимым.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube