
Nemotron Parse 2.0 против olmOCR: две задачи, обе называемые парсингом
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
3 августа 2026 года NVIDIA опубликовала новую модель для разбора документов на Hugging Face и никому не сказала. NVIDIA-Nemotron-Parse-2.0 — это зрительно-декодирующая модель на 0,9 млрд параметров, чья карточка модели заявляет о многоязычном и учитывающем графики скачке по сравнению с предшественником от февраля 2026 года. Модель появилась в том же углу экосистемы, что и olmOCR — точнее, olmOCR-2-7B-1025, линеаризатор на 7 млрд параметров от Allen Institute for AI, который незаметно стал стандартным способом превращать PDF в данные для обучения LLM. Сама постановка вопроса о «лобовом сравнении» — ловушка: обе модели описывают как «разбор документов», но они возвращают разные артефакты, питают разные конвейеры, а их результаты бенчмарков никогда по-настоящему не встречаются лицом к лицу. Настоящий вопрос — какую из двух задач вы поручаете парсеру.
Два артефакта
Nemotron Parse 2.0 — это движок семантики макета. Дайте ему изображение страницы и текстовый промпт — и он вернёт текст плюс семантический слой поверх: класс макета для каждой области (заголовок, раздел, подпись, таблица, диаграмма, верхний колонтитул, нижний колонтитул, сноска, библиографическая запись), ограничивающую рамку для каждой и порядок чтения между ними — с Markdown как одной из опциональных сериализаций поверх. olmOCR 2 — линеаризатор. Он принимает ту же страницу и возвращает чистый линеаризованный Markdown с коротким YAML-frontmatter, фиксирующим метаданные уровня страницы, такие как основной язык, коррекция поворота и то, является ли страница таблицей или диаграммой. Никаких рамок, никаких классов, никакой геометрии: один проход, текст в порядке документа.
Артефакт определяет задачу. Если вашему пайплайну нужно сослаться на факт, привязав его к области страницы, выделить таблицу на скане или извлечь семантику макета для интеллектуальной обработки документов, вам нужна геометрия — это выходное пространство Nemotron Parse 2.0. Если вы создаете обучающие данные или подаете текст в LLM, которая потребляет только токены, геометрия — это шум, а линеаризованный Markdown — именно то, что нужно: это весь замысел olmOCR. Вы можете прикрутить определение макета к выходу olmOCR с помощью отдельного детектора, и вы можете отбросить боксы Nemotron Parse 2.0 и оставить только Markdown, но каждая модель создана так, чтобы одна из этих задач была для нее родной.
Тихий корабль: что показывает репозиторий, что не подтверждено
NVIDIA-Nemotron-Parse-2.0 появилась на Hugging Face 3 августа 2026 года без анонса, без записи в блоге и без пакета NIM. Что достоверно известно — так это репозиторий. Это визуальный энкодер-декодер размером 0.9B: энкодер изображений ViT-H на основе магистрали C-RADIO от NVIDIA, лёгкий адаптер с одномерной свёрткой и десятислойный декодер в стиле mBART. Токенизатор вырос примерно на 20 000 записей до примерно 72 000 всего, явно для более эффективной многоязычной поддержки, а в карточке модели указано, что ключевой функцией является анализ диаграмм с учётом их структуры через новый токен class_Chart, а также семейство сериализаций таблиц (LaTeX, HTML, markdown, JSON, иерархический JSON, CSV). Вместе с ней поставляются два опциональных процессора логитов: один для остановки повторяющегося структурированного вывода, а другой — для принудительного применения структуры таблицы к вырезке таблицы. Рекомендуемое разрешение входных данных составляет примерно от 1024×1280 до 1664×2048, генерация выполняется с максимальным лимитом в 9 000 токенов, а в карточке модели указаны Transformers, vLLM, SGLang и Docker Model Runner в качестве сред выполнения на оборудовании Ampere, Hopper, Blackwell и Turing.
Однако все эти заявления принадлежат самой NVIDIA, и ни одно из них не было независимо воспроизведено. Карта сообщает общий балл ParseBench 0.6391 (по сравнению с 0.5782 в v1.2), MOSCAR multilingual OCR 0.9102 BoC-F1 (по сравнению с 0.4410), IndicVisionBench 0.7203 ANLS-character (по сравнению с 0.0612), а также подмножество рукописного ввода OmniDocBench, улучшившееся с 0.9739 до 0.3395 по расстоянию редактирования текста. Это самые большие скачки, и они же наименее проверены: ParseBench — собственный набор NVIDIA, и ни одна третья сторона ещё не запускала Parse 2.0 на независимом корпусе. Не подтверждено не только оценки — нет размещённого вывода (в карте указано, что модель не развёрнута ни одним поставщиком выводов), нет цены и нет объявленных сроков ни для того, ни для другого.

olmOCR 2: признанный стандарт, с которым все уже сверяются
olmOCR — это модель, которая создала бенчмарк, из-за которого сейчас спорят в этой категории. olmOCR-2-7B-1025, выпущенная 22 октября 2025 года, — это vision-language модель на 7B параметров, дообученная на основе Qwen2.5-VL-7B-Instruct на корпусе olmOCR-mix-1025 объёмом 270 000 страниц, а затем дополнительно отшлифованная с помощью GRPO-обучения с подкреплением на основе автоматизированных «юнит-тест» наград — детерминированных проверок того, что таблица сохранила структуру, формула транскрибирована точно, а порядок чтения соблюдён. Эта схема юнит-тестов превратилась в olmOCR-Bench — примерно 1 400 PDF-файлов и более 7 000 проверок, — и стала фактическим отраслевым стандартом: Marker, MinerU и дюжина коммерческих OCR-моделей теперь публикуют свои результаты на нём. Сам olmOCR 2 набирает там 82,4 в целом — примерно на четыре пункта выше предыдущего релиза и выше показателей Marker (76,1) и MinerU (75,8), которые AI2 приводит на той же странице.
olmOCR также является зрелым вариантом в этой паре. Он распространяется под лицензией Apache-2.0, его веса за последний месяц были скачаны примерно 218 000 раз, а набор инструментов olmOCR обрабатывает рендеринг, поворот и повторные попытки в масштабе на бэкенде vLLM — по оценке AI2, пайплайн обходится примерно в 176–190 долларов за миллион страниц на арендованных GPU, а сборка FP8 выдаёт около 3 400 выходных токенов в секунду на одном H100, что достаточно быстро: в анонсе релиза цитируется «10 000 страниц менее чем за 2 доллара». Компромисс — язык: olmOCR явно создан и протестирован для англоязычных оцифрованных печатных материалов, и в его карточке модели указан английский. Предложение Nemotron Parse 2.0 полностью противоположно — его заявленные преимущества сосредоточены на письменностях CJK и индийских письменностях.

Шесть строк, где виден компромисс
Обе модели имеют открытые веса, обе работают на Transformers, vLLM или SGLang, и обе сегодня размещаются самостоятельно. По параметрам, которые имеют значение при выборе между ними:
• Размер — Nemotron Parse 2.0 — 0.9B; olmOCR 2 — 7B. Примерно в восемь раз больше параметров, примерно в восемь раз больше минимальный объём VRAM.
• Вывод — Nemotron Parse 2.0 возвращает текст, классы макета, ограничивающие рамки, порядок чтения и markdown; olmOCR 2 возвращает линеаризованный markdown с блоком метаданных YAML.
{{1}}Многоязычность{{/1}} — {{2}}Nemotron Parse 2.0{{/2}} заявляет о сильной поддержке CJK и индийских языков ({{3}}MOSCAR 0.9102, IndicVisionBench 0.7203, по данным производителя{{/3}}); {{4}}olmOCR 2{{/4}} ориентирован в первую очередь на английский язык.
• Флагманский показатель — Nemotron Parse 2.0 сообщает ParseBench 0.6391 (собственный показатель NVIDIA, не прошедший аудит); olmOCR 2 набирает 82.4 на olmOCR-Bench (собственный показатель AI2, десять месяцев использования сообществом).
• Лицензия — Nemotron Parse 2.0 поставляется под лицензией NVIDIA Open Model License; olmOCR 2 — под Apache-2.0.
• Выпущено — Nemotron Parse 2.0 вышел 3 августа 2026 года без анонса; olmOCR 2 вышел 22 октября 2025 года с постом о запуске.

Три места, где это решение действительно сказывается.
Масштаб и задержка. Декодер на 0,9B параметров значительно дешевле в обслуживании, чем VLM на 7B: менее мощный GPU, меньше видеопамяти, больше страниц в секунду на том же оборудовании и ниже стоимость страницы, когда вы платите за GPU-время. Если вы уже эксплуатируете GPU-инфраструктуру и ваш корпус документов велик, это реальная ежемесячная разница. Собственные показатели olmOCR показывают, насколько быстрой можно сделать модель на 7B с помощью FP8-квантизации, — но для их достижения всё равно нужен GPU класса H100; минимальное требование Nemotron Parse 2.0 к оборудованию — карта поколения Ampere.
Многоязычность. Это самая асимметричная строка. Nemotron Parse 2.0 расширил свой токенизатор примерно на 20 000 записей специально для многоязычного OCR, и заявленные в его карточке преимущества сосредоточены в индийских письменностях и CJK. olmOCR 2 не делает такого заявления — его языковой тег — английский. Если ваш корпус — хинди, тамильский, бенгальский, японский или со смешанной письменностью, цифры Nemotron Parse 2.0 — те, которые стоит проверить, именно потому, что они предоставлены вендором и свежие.
{{1}}Реальность инференса.{{/1}} {{2}}olmOCR 2 вышел десять месяцев назад, и его инструментарий скучен в хорошем смысле.{{/2}} {{3}}Nemotron Parse 2.0 вышел пять дней назад, и его инфраструктура инференса явно ещё незрелая:{{/3}} {{4}}для vLLM нужна сборка с поддержкой remote-кода Nemotron Parse,{{/4}} {{5}}связанная выходная головка роняет некоторые сборки vLLM 0.20 (в репозитории поставляется runtime-патч),{{/5}} {{6}}а tokenizer.json содержит сериализованный паддинг до 9 000 токенов —{{/6}} {{7}}один инференс-стек столкнулся с тем, что промпт из шести токенов до применения патча разросся до 54 000 токен-идентификаторов.{{/7}} {{8}}Ни одна из этих проблем не фатальна,{{/8}} {{9}}но это ровно то трение, на которое приходится закладываться при работе с новой моделью.{{/9}}
Выберите один для вашего пайплайна
Выбирайте olmOCR 2, если вы создаёте обучающие данные для LLM или высоконагруженный конвейер извлечения текста из англоязычных документов. Вы получаете зрелый инструментарий, лицензию Apache-2.0, бенчмарк, по которому теперь оценивается индустрия, и проверенный путь пакетной обработки. Его осознанный недостаток — ограниченное языковое покрытие.
Выбирайте Nemotron Parse 2.0, если вашему пайплайну нужна геометрия — классы макета, ограничивающие рамки и порядок чтения для обоснованного поиска или интеллектуальной обработки документов — или если в вашем корпусе много страниц на индийских языках, CJK или рукописных страниц, где и находятся его заявленные преимущества. Размер 0.9B делает тест за выходные недорогим, даже если вы не уверены. Его общепризнанный недостаток в том, что каждая цифра на карточке — собственная оценка NVIDIA и может измениться при независимой проверке.
Если ваш ввод — это в основном англоязычные PDF-файлы, созданные в цифровом виде, и всё, что вам нужно, — это чистый Markdown, то olmOCR 2 — более безопасный выбор по умолчанию. Если вы уже используете самохостинг и многоязычный сценарий или сценарий с привязкой к макету действительно актуален, то Nemotron Parse 2.0 — более интересная ставка: протестируйте его на своих страницах, прежде чем принимать решение.
Не допускайте, чтобы выбор парсера превратился в привязку.
Конвейер документов состоит из этапа парсинга и последующего этапа LLM, и парсер обычно оказывается самым дешёвым этапом, когда объёмы становятся реальными — именно LLM, превращающий распарсенный markdown в сводки, структурированные записи или ответы, является точкой роста затрат. Именно этот этап меняет уровень маршрутизации. OrcaRouter предоставляет более 200 моделей через один API по прейскурантной цене провайдера без наценки, поэтому снижение цены вендором вступает в силу в тот же день, а автоматическое переключение не даёт одному деградировавшему провайдеру заблокировать пакетное задание. Ни один из парсеров в этом сравнении не входит в наш каталог — обе карточки моделей указывают, что они не развёрнуты ни одним инференс-провайдером, так что это решение о самостоятельном хостинге — но причина держать парсер отдельно от вашего стека моделей заключается именно в том, что маршрутизация даёт на downstream-стороне: заменить Nemotron Parse 2.0 на olmOCR 2 или обратно, не затрагивая ни одной интеграции, потому что уровень LLM остаётся за тем же API с одним ключом.
Часто задаваемые вопросы
Какая модель побеждает в бенчмарках?
Ни то, ни другое — цифры не сопоставимы напрямую. Nemotron Parse 2.0 сообщает о ParseBench, MOSCAR, IndicVisionBench и подмножестве рукописных данных OmniDocBench — всё это собственные бенчмарки NVIDIA, и ни один из них независимо не воспроизведён. olmOCR 2 сообщает об olmOCR-Bench, собственном бенчмарке AI2, на котором теперь публикуются остальные участники индустрии. Ни одна третья сторона не запускала обе модели на одном и том же корпусе, так что любое прямое заявление о «победителе» — экстраполяция. С точки зрения тенденции: показатели olmOCR выдержали десять месяцев использования сообществом; показатели Nemotron Parse 2.0 свежие и могут измениться.
Действительно ли Nemotron Parse 2.0 лучше работает с неанглийскими документами?
Это утверждение — расширение словаря примерно на 20 000 токенов, плюс MOSCAR на уровне 0.9102 и IndicVisionBench на уровне 0.7203, оба показателя предоставлены вендором, и оба резко выросли по сравнению с v1.2. olmOCR 2 не заявляет о многоязычности и помечена как англоязычная. Но пока не появится независимый прогон, относитесь к многоязычным улучшениям Nemotron Parse 2.0 как к многообещающим, но непроверенным, и тестируйте их на своих страницах на индийских языках или CJK, прежде чем полагаться на них.
Нужна ли мне видеокарта побольше для одной из них?
Да, и он отслеживает разницу в размерах. Модель Nemotron Parse 2.0 с 0.9B параметров помещается на скромной видеокарте эпохи Ampere и является более дешёвым вариантом за страницу на оборудовании, которое у вас уже есть. olmOCR 2 с 7B VLM требует значительно более мощный GPU; его сборка FP8 достигает примерно 3400 выходных токенов в секунду на H100, по данным AI2.
Что лучше для предобработки RAG?
Это зависит от того, что нужно вашему ретриверу. Если вы привязываете ответы к областям страницы, нуждаетесь в классах макета или хотите индексировать таблицы и диаграммы как самостоятельные единицы, ограничивающие рамки и классы Nemotron Parse 2.0 дают вам такую возможность из коробки. Если ваш RAG-стек просто потребляет чистый текст, а ваш корпус — английский, линеаризованный Markdown от olmOCR 2 проверен, проще и опирается на зрелый инструментарий.
Итог
{{1}}NVIDIA на этой неделе выпустила настоящий парсер и никому не сказала; AI2 выпустила свой десять месяцев назад и задала для этой категории эталон.{{/1}} {{2}}Nemotron Parse 2.0 подходит лучше, когда вам нужна семантика макета, поддержка нескольких языков или распознавание рукописного текста при небольшом бюджете{{/2}} — {{3}}и области, где её показатели проверены меньше всего, — это как раз те области, где она, по её заявлениям, выигрывает.{{/3}} {{4}}olmOCR 2 подходит лучше, когда вам нужен линеаризованный текст в больших объёмах по англоязычным документам и вы хотите инструментарий, который остаётся стабильным уже десять месяцев.{{/4}} {{5}}Ни одна из них нигде не развёрнута, так что в любом случае это решение о самохостинге;{{/5}} {{6}}самый дешёвый способ сделать это — прогнать обе на своих самых сложных страницах и посмотреть, где каждая даёт сбой.{{/6}}
