כרטיס כותרת עבור 'Nemotron Parse 2.0 לעומת olmOCR': כותרת ראשית 'Nemotron Parse 2.0 לעומת olmOCR', כותרת משנה 'שתי משימות, שתיהן נקראות פרסור', עם איור מפוצל — בצד שמאל דף מסמך המפורסר לתיבות תוחמות מסומנות תחת הכיתוב 'סמנטיקת פריסה', ובצד ימין שורות טקסט זורמות עם סמל markdown תחת הכיתוב 'markdown ליניארי'. לוגו OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Nemotron Parse 2.0 לעומת olmOCR: שתי משימות, שתיהן נקראות פרסינג

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-3 באוגוסט 2026, NVIDIA פרסמה מודל חדש לניתוח מסמכים ב-Hugging Face ולא סיפרה לאף אחד. NVIDIA-Nemotron-Parse-2.0 הוא מקודד-מפענח חזותי בגודל 0.9B, שכרטיס המודל שלו טוען לקפיצה רב-לשונית ומודעת-תרשימים לעומת קודמו מפברואר 2026, והוא נחת באותה פינה במערכת האקולוגית כמו olmOCR — ליתר דיוק olmOCR-2-7B-1025, הליניאריזר בגודל 7B ממכון אלן לבינה מלאכותית (Allen Institute for AI) שהפך בשקט לדרך ברירת המחדל להפיכת קובצי PDF לנתוני אימון עבור מודלי שפה גדולים (LLM). לקרוא לזה בכלל תחרות ראש-בראש זו המלכודת: שני המודלים מתוארים כ״ניתוח מסמכים״, אבל הם מחזירים פלטים שונים, מזינים צינורות עבודה (pipelines) שונים, ומספרי ה-benchmark שלהם אף פעם לא מתמודדים זה מול זה בפועל. השאלה האמיתית היא לאיזו משתי המשימות אתה שוכר מנתח מסמכים.

שני החפצים

{{1}}Nemotron Parse 2.0{{/1}} הוא {{2}}מנוע סמנטיקת פריסה{{/2}}. תנו לו תמונת עמוד והנחיית משימה, והוא מחזיר את הטקסט עם שכבה סמנטית מעל: {{3}}מחלקת פריסה לכל אזור (כותרת, סעיף, כיתוב, טבלה, תרשים, כותרת עליונה, כותרת תחתונה, הערת שוליים, ערך ביבליוגרפי){{/3}}, תיבת תיחום לכל אחד, וסדר הקריאה ביניהם — כאשר {{4}}Markdown{{/4}} הוא סריאליזציה אופציונלית אחת נוספת. {{5}}olmOCR 2{{/5}} הוא {{6}}כלי ליניאריזציה{{/6}}. הוא מקבל את אותו עמוד ומחזיר {{7}}Markdown נקי ומסודר ליניארית{{/7}} עם {{8}}frontmatter YAML קצר{{/8}} שמתעד מטא-נתונים ברמת העמוד, כגון שפה ראשית, תיקון סיבוב, והאם העמוד הוא {{9}}טבלה או דיאגרמה{{/9}}. אין תיבות, אין מחלקות, אין גאומטריה: מעבר אחד, טקסט בסדר המסמך.

הארטיפקט קובע את העבודה. אם ה-pipeline שלך צריך לקשר עובדה לאזור בעמוד, להדגיש טבלה בסריקה, או לחלץ סמנטיקת פריסה עבור בינת מסמכים, אתה צריך גאומטריה — זה מרחב הפלט של Nemotron Parse 2.0. אם אתה בונה נתוני אימון או מזין LLM טקסטואלי שצורך רק טוקנים, גאומטריה היא רעש ו-markdown ליניארי הוא בדיוק מה שצריך — זה כל הקונספט של olmOCR. אפשר לחבר זיהוי פריסה לפלט של olmOCR עם גלאי נפרד, ואפשר לזרוק את התיבות של Nemotron Parse 2.0 ולשמור רק את ה-markdown, אבל כל מודל בנוי כדי להפוך את אחת המשימות האלה למובנית בו.

הספינה השקטה: מה שהריפו מראה, מה שלא אושר

NVIDIA-Nemotron-Parse-2.0 הופיע ב-Hugging Face ב-3 באוגוסט 2026 ללא הודעה, ללא פוסט בבלוג וללא אריזת NIM. מה שניתן לדעת הוא המאגר (repo). מדובר במקודד-מפענח חזותי (vision-encoder-decoder) בגודל 0.9B: מקודד תמונה ViT-H הבנוי על שלד C-RADIO של NVIDIA, מתאם קונבולוציה חד-ממדית קל משקל, ומפענח בסגנון mBART בעל עשר שכבות. הטוקנייזר גדל בכ-20,000 ערכים לסך של כ-72,000, במפורש כדי לתמוך ברב-לשוניות יעילה יותר, וכרטיס המודל מציג ניתוח מודע לתרשימים (chart-aware parsing) כתכונה מרכזית באמצעות טוקן חדש בשם class_Chart, וכן משפחה של סריאליזציות טבלאות (LaTeX, HTML, markdown, JSON, JSON היררכי, CSV). שני מעבדי לוגיטים אופציונליים מגיעים איתו: אחד שעוצר פלט מובנה חוזרני, ואחד שכופה מבנה טבלה על חיתוך טבלה. רזולוציית הקלט המומלצת נעה בין כ-1024×1280 ועד 1664×2048, היצירה פועלת עד תקרה של 9,000 טוקנים, וכרטיס המודל מפרט את Transformers, vLLM, SGLang ו-Docker Model Runner כסביבות ריצה על חומרה מסוג Ampere, Hopper, Blackwell ו-Turing.

הטענות, עם זאת, הן כולן של NVIDIA עצמה, ואף אחת מהן לא שוחזרה באופן בלתי תלוי. כרטיס המודל מדווח על ParseBench כולל של 0.6391 (לעומת 0.5782 ב-v1.2), MOSCAR ל-OCR רב-לשוני של 0.9102 BoC-F1 (לעומת 0.4410), IndicVisionBench של 0.7203 ANLS-character (לעומת 0.0612), ותת-קבוצת כתב יד של OmniDocBench המשתפרת מ-0.9739 ל-0.3395 במדד מרחק עריכת טקסט. אלה הקפיצות הגדולות ביותר, והן גם הפחות מאומתות: ParseBench היא חבילת הבדיקות של NVIDIA עצמה, ואף צד שלישי לא הריץ את Parse 2.0 על מאגר בלתי תלוי עדיין. מה שלא אושר חורג מעבר לציונים — אין הסקה מתארחת (כרטיס המודל מציין שהמודל אינו פרוס אצל ספק הסקה כלשהו), אין תמחור, ואין לוח זמנים מוכרז לאף אחד מאלה.

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that 2.0 adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

olmOCR 2: המוביל הנוכחי שכולם כבר מודדים לפיו

olmOCR הוא המודל שהמציא את המדד שהקטגוריה הזו מתדיינת עליו כעת. olmOCR-2-7B-1025, ששוחרר ב-22 באוקטובר 2025, הוא מודל ראייה-שפה בגודל 7B שכוונן מ-Qwen2.5-VL-7B-Instruct על קורפוס olmOCR-mix-1025 בן 270,000 העמודים, ולאחר מכן עודן עם למידת חיזוק GRPO כנגד תגמולים אוטומטיים של "בדיקות יחידה" — בדיקות דטרמיניסטיות לכך שטבלה שמרה על המבנה שלה, שנוסחה תומללה במדויק, ושסדר הקריאה נשמר. המסגרת הזו של בדיקות יחידה הפכה ל-olmOCR-Bench, הכולל כ-1,400 קובצי PDF ויותר מ-7,000 בדיקות, והיא הפכה למדד דה-פקטו של התעשייה: Marker, MinerU ותריסר מודלים מסחריים של OCR מפרסמים עליו כעת תוצאות. olmOCR 2 עצמו משיג שם 82.4 בסך הכול, כארבע נקודות מעל לגרסה הקודמת ומעל לנתונים של Marker (76.1) ושל MinerU (75.8) ש-AI2 מצטט באותו עמוד.

olmOCR היא גם האפשרות המבוססת יותר בין השתיים. היא תחת רישיון Apache-2.0, משקלי המודל שלה הורדו כ-218,000 פעמים בחודש האחרון, וערכת הכלים של olmOCR מטפלת ברינדור, סיבוב, וניסיונות חוזרים בקנה מידה גדול על גבי backend של vLLM — הערכת האצווה של AI2 מעמידה את עלות הצינור על כ-176–190 דולר למיליון עמודים על GPU שכורים, וגרסת ה-FP8 רצה בקצב של כ-3,400 אסימוני פלט בשנייה על H100 בודד, מהירה מספיק כדי שההודעה על השחרור תצטט: "10,000 עמודים בפחות מ-$2." הפשרה היא בשפה: olmOCR נבנתה במפורש והוערכה עבור מסמכים מודפסים דיגיטליים באנגלית, וכרטיס המודל שלה מתייג אותה כאנגלית. המסר השיווקי של Nemotron Parse 2.0 הוא ההיפך — השיפורים שהוא טוען להם מרוכזים בכתבי CJK ובכתבים אינדיים.

Screenshot of the Hugging Face repository page for allenai/olmOCR-2-7B-1025, showing the Apache-2.0 license tag, the English language tag, 217,859 downloads last month, 8B params, the description that it is the BF16 release fine-tuned from Qwen2.5-VL-7B-Instruct on the olmOCR-mix-1025 dataset with additional GRPO RL training for math equations and tables, the note that the best way to use it is the olmOCR toolkit via vLLM, and the line 'This model isn't deployed by any Inference Provider.'

שש שורות שבהן באה לידי ביטוי ההתפשרות

שני המודלים הם בעלי משקל פתוח, שניהם רצים על Transformers, vLLM או SGLang, ושניהם זמינים כיום באירוח עצמי. בממדים שחשובים כשצריך לבחור ביניהם:

• גודל — Nemotron Parse 2.0 הוא 0.9B; olmOCR 2 הוא 7B. בערך פי שמונה בפרמטרים, ובערך פי שמונה בדרישת ה-VRAM המינימלית.

• פלט — Nemotron Parse 2.0 מחזיר טקסט, מחלקות פריסה, תיבות תוחמות, סדר קריאה ו-markdown; olmOCR 2 מחזיר markdown ליניארי עם בלוק מטא-דאטה ב-YAML.

• רב-לשוני — Nemotron Parse 2.0 טוען לתמיכה חזקה ב-CJK ובשפות הודיות (MOSCAR 0.9102, IndicVisionBench 0.7203, לפי דיווח ספק); olmOCR 2 הוא באנגלית תחילה.

• ציון דגל — Nemotron Parse 2.0 מדווח ParseBench 0.6391 (של NVIDIA עצמה, ללא ביקורת); olmOCR 2 משיג 82.4 ב-olmOCR-Bench (של AI2 עצמה, עשרה חודשים של שימוש חוזר מצד הקהילה).

• רישיון — Nemotron Parse 2.0 מופץ תחת רישיון NVIDIA Open Model License; olmOCR 2 הוא Apache-2.0.

• שוחרר — Nemotron Parse 2.0 הגיע ב-3 באוגוסט 2026 ללא הכרזה; olmOCR 2 שוחרר ב-22 באוקטובר 2025, עם פוסט השקה.

Two-column comparison scoreboard titled 'Nemotron Parse 2.0 vs olmOCR — the scoreboard'. Left column 'Nemotron Parse 2.0': Size 0.9B vision-encoder-decoder, Output bboxes, classes, reading order + markdown, Multilingual CJK + Indic strong, Score ParseBench 0.6391 (vendor), License NVIDIA Open Model, Shipped Aug 3, 2026 unannounced. Right column 'olmOCR 2': Size 7B VLM (Qwen2.5-VL), Output linearized markdown + YAML metadata, Multilingual English-first, Score olmOCR-bench 82.4, License Apache 2.0, Shipped Oct 22, 2025. Footer: 'Nemotron scores vendor-reported (NVIDIA); olmOCR scores per AI2's olmOCR-bench.' OrcaRouter logo composited bottom-right.

שלושה מקומות שבהם ההחלטה באמת נושכת

קנה מידה וזמן השהיה. דקודר 0.9B זול בהרבה להגשה מאשר VLM 7B: GPU קטן יותר, פחות VRAM, יותר עמודים בשנייה על אותה חומרה, ועלות נמוכה יותר לעמוד כשמשלמים על זמן GPU. אם אתה כבר מריץ תשתית GPU והקורפוס שלך גדול, זה הבדל חודשי ממשי. הנתונים של olmOCR עצמו מראים כמה מהר אפשר להריץ מודל 7B עם קוונטיזציית FP8 — אבל הוא עדיין צריך GPU ברמת H100 כדי להגיע אליהם; רצפת החומרה של Nemotron Parse 2.0 היא כרטיס מתקופת Ampere.

רב-לשוני. זוהי השורה הא-סימטרית ביותר. Nemotron Parse 2.0 הרחיב את הטוקנייזר שלו בכ-20,000 ערכים במיוחד עבור OCR רב-לשוני, והרווחים שטוען הכרטיס שלו מרוכזים בכתבים אינדיים ו-CJK. olmOCR 2 אינו טוען זאת — תג השפה שלו הוא אנגלית. אם הקורפוס שלך הוא הינדי, טמילית, בנגלית, יפנית או מעורב-כתב, המספרים של Nemotron Parse 2.0 הם אלה שכדאי לבדוק, דווקא משום שהם דווחו על ידי הספק והם טריים.

מציאות הסרווינג. olmOCR 2 הוא בן עשרה חודשים ושרשרת הכלים שלו משעממת במובן החיובי. Nemotron Parse 2.0 הוא בן חמישה ימים וסיפור הסרווינג שלו צעיר בעליל: vLLM זקוק ל-build עם תמיכת remote-code של Nemotron Parse, ראש הפלט המחובר מכשיל כמה buildים של vLLM 0.20 (המאגר כולל תיקון זמן ריצה), ו-tokenizer.json נושא padding שמקודד ל-9,000 טוקנים — מחסנית סרווינג אחת נתקלה ב-prompt של שישה טוקנים שהתרחב ל-54,000 מזהי טוקן לפני החלת התיקון. שום דבר מזה אינו קטלני, אבל זה בדיוק סוג החיכוך שאתה צריך לתכנן עבורו עם מודל חדש.

בחר אחד לצינור שלך

בחרו ב-olmOCR 2 אם אתם בונים נתוני אימון ל-LLM או צינור חילוץ טקסט בנפח גבוה על מסמכים באנגלית. אתם מקבלים ערכת כלים בוגרת, רישיון Apache-2.0, מדד שהתעשייה מודדת על פיו כיום, ונתיב אצווה מבוסס היטב. מצב הכשל המקובל שלו הוא כיסוי שפות.

בחרו ב-Nemotron Parse 2.0 אם הפייפליין שלכם זקוק לגאומטריה — מחלקות layout, תיבות חוסמות וסדר קריאה לאחזור מוארק או לבינה מסמכית — או אם המאגר שלכם עשיר בדפים אינדיים, דפי CJK או דפים בכתב יד, שבהם טמונים הרווחים שהוא טוען להם. הגודל של 0.9B הופך בדיקת סוף שבוע לזולה גם אם אינכם בטוחים. מצב הכשל הידוע שלו הוא שכל מספר בכרטיס הוא של NVIDIA עצמה ועשוי להשתנות תחת הערכה בלתי תלויה.

אם הקלט שלך הוא בעיקר קבצי PDF דיגיטליים במקור באנגלית וכל מה שאתה צריך זה markdown נקי, olmOCR 2 הוא ברירת המחדל הפחות מסוכנת. אם אתה כבר מארח בעצמך ומקרה השימוש הרב-לשוני או מבוסס-הפריסה הוא אמיתי, Nemotron Parse 2.0 הוא ההימור המעניין יותר — בדוק אותו על הדפים שלך לפני שתתחייב.

למנוע מבחירת המפענח להפוך לנעילה.

לפייפליין מסמכים יש שלב פענוח ולאחריו שלב LLM, והמפענח הוא בדרך כלל השלב הזול ביותר ברגע שהנפח אמיתי — ה-LLM שהופך markdown מפוענח לסיכומים, רשומות מובנות או תשובות הוא המקום שבו העלות מתרחבת. זה השלב ששכבת ניתוב משנה. OrcaRouter מציבה 200+ מודלים מאחורי API אחד במחיר המחירון של הספק ללא תוספת מחיר, כך שהנחת מחיר של ספק נכנסת לתוקף באותו יום, ו-failover אוטומטי מונע מספק פגום אחד לתקוע עבודת אצווה. אף אחד מהמפענחים בהשוואה הזו לא נמצא בקטלוג שלנו — שני כרטיסי המודל מציינים שהם אינם פרוסים על ידי שום ספק inference, כך שמדובר בהחלטת self-host — אבל הסיבה לשמור על המפענח מנותק ממערך המודלים שלך היא בדיוק מה שהניתוב מקנה בצד ה-downstream: להחליף את Nemotron Parse 2.0 ב-olmOCR 2, או חזרה, בלי לגעת באף אינטגרציה אחת, כי שכבת ה-LLM נשארת מאחורי אותו API עם מפתח אחד.

שאלות נפוצות

איזה מודל מנצח במבחני הביצועים?

אף אחד מהם — המספרים אינם מתמודדים זה מול זה. Nemotron Parse 2.0 מדווח על ParseBench, MOSCAR, IndicVisionBench, וקבוצת משנה של כתב יד מ-OmniDocBench, כולם של NVIDIA ואף אחד לא שוחזר באופן בלתי תלוי. olmOCR 2 מדווח על olmOCR-Bench, מדד הייחוס של AI2 שעליו שאר התעשייה מפרסמת כעת. אף גורם שלישי לא הריץ את שני הדגמים על אותו קורפוס, ולכן כל טענה ישירה ל"מנצח" היא אקסטרפולציה. מבחינה כיוונית: הנתונים של olmOCR שרדו עשרה חודשים של שימוש קהילתי; אלה של Nemotron Parse 2.0 טריים ועשויים להשתנות.

האם Nemotron Parse 2.0 באמת טוב יותר במסמכים שאינם באנגלית?

{{1}}זו הטענה — הרחבת אוצר מילים של כ-20,000 טוקנים, בתוספת MOSCAR ב-0.9102 ו-IndicVisionBench ב-0.7203, שניהם לפי דיווח הספק ושניהם עלו בחדות לעומת v1.2.{{/1}} {{2}}olmOCR 2 אינו טוען ליכולת רב-לשונית ומתויג כאנגלית.{{/2}} {{3}}אבל עד שתתבצע הרצה עצמאית, התייחסו להישגים הרב-לשוניים של Nemotron Parse 2.0 כמבטיחים אך לא מאומתים, ובחנו אותם על דפי Indic או CJK משלכם לפני שתסתמכו עליהם.{{/3}}

האם אני צריך GPU גדול יותר עבור אחד מהם?

כן, והוא עוקב אחרי הפרש הגודל. Nemotron Parse 2.0 עם 0.9B מתאים לכרטיס צנוע מדור Ampere והוא האפשרות הזולה יותר לכל עמוד על חומרה שכבר יש לך. olmOCR 2 עם VLM בעל 7B דורש GPU גדול משמעותית; גרסת ה‑FP8 שלו מגיעה לכ‑3,400 טוקנים בשנייה על H100, לפי AI2.

מה עדיף לעיבוד מקדים של RAG?

זה תלוי במה שהמחזיר שלך צריך. אם אתה מבסס תשובות על אזורי עמוד, צריך מחלקות פריסה, או רוצה להוסיף לאינדקס טבלאות ותרשימים כיחידות עצמאיות, תיבות התחום והמחלקות של Nemotron Parse 2.0 נותנות לך את זה באופן טבעי. אם מחסן ה-RAG שלך פשוט צורך טקסט נקי והקורפוס שלך באנגלית, ה-markdown הליניארי של olmOCR 2 מוכח, פשוט יותר, ונתמך על ידי ערכת כלים בוגרת.

השורה התחתונה

NVIDIA שלחה השבוע מפענח אמיתי ולא סיפרה לאיש; AI2 שלחה אחד לפני עשרה חודשים וקבעה את אמת המידה לקטגוריה. Nemotron Parse 2.0 הוא ההתאמה הטובה יותר כשאתה צריך סמנטיקה של פריסה, כיסוי רב-לשוני, או חילוץ כתב יד בתקציב קטן — והתחומים שבהם המספרים שלו הכי פחות מאומתים הם בדיוק התחומים שהוא טוען לנצח בהם. olmOCR 2 הוא ההתאמה הטובה יותר כשאתה צריך טקסט ליניארי בקנה מידה על מסמכים באנגלית ורוצה שרשת כלים יציבה כבר עשרה חודשים. אף אחד מהם לא נפרס בשום מקום, כך שזו החלטה של אירוח עצמי בכל מקרה; הדרך הזולה ביותר לעשות זאת היא להריץ את שניהם על הדפים הקשים ביותר שלך ולראות היכן כל אחד נשבר.