כרטיס כותרת עבור 'NVIDIA-Nemotron-Parse-2.0': כותרת ראשית 'NVIDIA-Nemotron-Parse-2.0', כתובית 'עדכון שקט למפענח מסמכים', ותיאור '0.9B מקודד-מפענח ראייה · OCR רב-לשוני · מודע לתרשימים' לצד איור שטוח של דף מסמך המעובד עם תיבות תוחמות צבעוניות וסמל תרשים. הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

NVIDIA-Nemotron-Parse-2.0: NVIDIA שחררה בשקט מפענח מסמכים חכם יותר

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

NVIDIA-Nemotron-Parse-2.0 הופיע ב-Hugging Face ב-3 באוגוסט 2026, ובמועד כתיבת שורות אלה, חמישה ימים לאחר מכן, NVIDIA עדיין לא הכריזה עליו — אין פוסט בבלוג, אין הודעה לעיתונות, אין חוט ב-X. המאגר מלא: מקודד-מפענח חזותי של 0.9B, כרטיס מודל עם טבלת אמות מידה מלאה מול NVIDIA-Nemotron-Parse-v1.2, קבצי config, Dockerfile, ערכת בדיקות, ואפילו בקשת משיכה ל-vLLM שכבר מתייחסת לראש העזר של המודל החדש. שחרור מלא בלי שום חגיגות הוא בדיוק הסוג של אות ששווה מבט של "מה ידוע עד כה", ולכן זה מה שזה: העובדות שהמאגר מבסס, המספרים שעדיין מדווחים על ידי הספק, והשאלות הפתוחות שבדרך כלל הכרזה הייתה עונה עליהן.

מה זה NVIDIA-Nemotron-Parse-2.0

Nemotron Parse הוא מודל עיבוד המסמכים של NVIDIA: אתה מזין לו עמוד סרוק או מעובד, והוא מחזיר את הטקסט בסדר הקריאה, את תיבת הגבול ואת המחלקה הסמנטית של כל אזור, ו-markdown — כולל טבלאות, בבחירתך בין LaTeX, HTML, markdown, JSON, JSON היררכי או CSV. זה אינו מודל שפה כללי ואינו מנוע OCR פשוט. הוא ממוקם בין השניים: חילוץ מודע-פריסה שנועד להזין צינורות RAG, חילוץ ומודיעין מסמכים.

גרסה 2.0 שומרת על אותה משפחת ארכיטקטורה כמו v1.2, לפי הקונפיגורציה של המאגר. מקודד הראייה הוא ViT-H הבנוי על שלד ה-C-RADIOv2 של NVIDIA, המפענח הוא מפענח בסגנון mBART בעל עשר שכבות, והסך הכולל מגיע לכ-0.9 מיליארד פרמטרים. דפי קלט מגיעים עד 2048×1664, יצירת הפלט רצה עד תקרה של 9,000 טוקנים, והמודל מתייג אזורים עם קבוצה של מחלקות סמנטיות (טקסט, כותרת, כותרת מקטע, פריט רשימה, טבלה, נוסחה, תמונה, כיתוב, הערת שוליים, כותרת עליונה/תחתונה של עמוד, וכל השאר). זה מודל קטן מספיק כדי לארח בעצמך על GPU יחיד, וזה חשוב כי זו הדרך היחידה להריץ אותו כיום.

מה השתנה מ-v1.2

החלק המעניין בכרטיס אינו המודל — אלא ההפרש. NVIDIA-Nemotron-Parse-v1.2 שוחרר ב-Hugging Face בפברואר 2026 עם אוצר מילים של 52,329 טוקנים. גרסה 2.0 מרחיבה זאת ל-72,256 טוקנים, קפיצה של כ-20,000 טוקנים, והכרטיס מפורש לגבי הסיבה: הטוקנים הנוספים קונים OCR רב-לשוני, כשהרווחים הגדולים ביותר הם בכתבי CJK ובדרום אסיה. כרטיס המודל מציין גם שלושה שינויים נוספים:

• ניתוח מודע לתרשימים — אסימון מחלקה חדש מסוג class_Chart>, כך שאזורי תרשים מקבלים מחלקה סמנטית משלהם במקום להיות מקובצים יחד עם תמונות או טבלאות.

• שיפור בחילוץ טקסט בכתב יד — הכרטיס מדווח על מרחק עריכת הטקסט במערך OmniDocBench Notes שיורד מ-0.9739 בגרסה v1.2 ל-0.3395 (נמוך יותר טוב יותר), שינוי גדול עבור מה שהיסטורית היה המקרה החלש ביותר עבור מודלים אלה.

• שיפור בטיפול בטבלאות, קופל לתוך הרווח הכולל של ParseBench במקום לדווח עליו כמספר נפרד.

פרט אימון אחד שכדאי לשים לב אליו: הכרטיס אומר ש-2.0 הוא מרק צ'קפוינטים במשקל שווה של צ'קפוינטים מאימון משלבים 58k עד 66k, שהוא מתכון נפוץ למהדורת נקודה שקטה – היא נוטה להקנות חוסן ללא אימון מחדש מלא.

המספרים שהכרטיס מדווח

כל הנתונים הבאים מגיעים מכרטיס המודל של NVIDIA עצמה, נמדדו מול v1.2, ולאף אחד מהם אין עדיין הרצה עצמאית של גורם שלישי. התייחסו אליהם כאל דיווח ספק וכאינדיקטיביים:

• ציון כולל של ParseBench — 0.5782 ב-v1.2 ל-0.6391 ב-2.0. ParseBench הוא מדד הביצועים של NVIDIA עצמה, המכסה נאמנות טקסט, עיצוב סמנטי, טבלאות, תרשימים ועיגון חזותי.

MOSCAR רב-לשוני BoC F1 — מ-0.4410 ל-0.9102. זוהי הקפיצה הגדולה ביותר בטבלה, והיא מתיישבת עם הרחבת אוצר המילים; MOSCAR מכסה לטינית, ערבית, קירילית, סינית, האנגול, יפנית, הודית, עברית, תאית, יוונית ועוד.

• IndicVisionBench ANLS-character הכולל — מ־0.0612 עד 0.7203, בעשר שפות הודיות (בנגלית, גוג'ראטית, הינדי, קנאדה, מלאיאלאם, מראטהית, אודיה, פנג'אבית, טמילית, טלוגו).

מרחק עריכת טקסט בכתב יד של OmniDocBench Notes — 0.9739 עד 0.3395 (נמוך יותר עדיף).

Scoreboard for NVIDIA-Nemotron-Parse-2.0: six rows reading Params 0.9B vision-encoder-decoder, Max image 2048×1664, ParseBench 0.6391 (vendor-reported), MOSCAR BoC F1 0.9102 (vendor-reported), IndicVisionBench ANLS 0.7203 (vendor-reported), License NVIDIA Open Model. Footer: 'All figures vendor-reported; no independent scores yet.' OrcaRouter logo composited bottom-right.

ההיקף של הדלתות הללו הוא הסיבה שהמהדורה הזו חשובה גם ללא הכרזה. תזוזה של 0.44→0.91 במדד F1 רב-לשוני ל-OCR אינה מהדורת תיקונים מינורית; היא נראית כמו העבודה הרב-לשונית שבדרך כלל הייתה עומדת בראש השקה. האם השיפורים מחזיקים מעמד תחת הערכה בלתי תלויה היא בדיוק השאלה שחוסר הכיסוי משאיר פתוחה.

מה שהריפו לא מספר לנו

להיות כן לגבי הקצוות הוא הנקודה של פוסט "ספינה שקטה". ה-repo אינו מאשר:

• האם 2.0 זמין (או יהיה זמין) כמיקרוסרוויס NIM של NVIDIA — גרסה 1.2 מסופקת דרך ה-API של NIM של NVIDIA עצמה, כרטיס המודל של 2.0 אינו כולל תג NIM ואין לו נקודת פריסה, ודף המאגר שלו מציין שהמודל "אינו פרוס על ידי אף Inference Provider."

• תמחור, אם קיים — המשקלים אינם כרוכים בדמי שימוש, אך אפשרות hosted לא תומחרה ולא הוכרזה.

• אמות מידה עצמאיות — אין עדיין ערך עבור 2.0 ב־Artificial Analysis, LMArena או OmniDocBench, כך שאין מה לבדוק מולו את המספרים של הספק.

• מפת הדרכים — האם 2.0 היא אבן דרך או יעד, והאם המשך בסגנון 2.1 יגיע — אינה ידועה.

הדבר היחיד שבטוח הוא הרישיון: המודל מופץ תחת רישיון NVIDIA Open Model License, המתיר שימוש מסחרי ולא-מסחרי, ואילו הטוקנייזר מופץ תחת CC-BY-4.0. אם תרצו להשתמש בו במוצר, התיבה הזו מסומנת.

מריצים את זה היום

אירוח עצמי הוא האפשרות היחידה הקיימת כרגע, והוא כרוך בכמה חיכוכים שכדאי להכיר לפני שמתכננים סביבם. המודל נטען ב-Hugging Face Transformers עם trust_remote_code, ו-vLLM יכול לשרת אותו — אבל רק עם build של vLLM שכולל תמיכה בקוד מרוחק של Nemotron Parse. בחומרה מסוג A100/A10, NVIDIA ממליצה לאכוף את מנוע הקשב של Triton, וצריך ארבע תלויות נוספות: albumentations, timm, open_clip_torch ו-einops. יש גם מוזרות של tied-output-head: גרסה 2.0 שומרת על ראש ה-LM קשור ל-decoder embeddings, בעוד שחלק מ-builds של vLLM מייצרים ראש פלט נפרד, אלא אם מוסיפים את ה-runtime patch של NVIDIA ל-PYTHONPATH.

שני פרטים על הגשה מהאקוסיסטם משלימים את התמונה. ראשית, בקשת משיכה (pull request) של vLLM שפתוחה כעת (בבדיקה נכון לתחילת אוגוסט) מאפשרת פענוח ספקולטיבי עבור NVIDIA-Nemotron-Parse-2.0 באמצעות ראש חיזוי עזר (auxiliary prediction head) המאוחסן בקובץ הצדדי auxiliary_prediction_heads.safetensors.extra שבמאגר — התיעוד של הכרטיס עצמו מתאר את הקובץ הזה כלא בשימוש בהסקה רגילה, כך שה-PR הזה הוא הדבר הראשון שבאמת צורך אותו. על H100, מול מפקד ParseBench של 1,005 עמודים, המחבר מדווח על עליות חציון בתפוקת הפלט של כ-45% בקונקורנטיות 1, 41% בקונקורנטיות 8, ו-40% בקונקורנטיות 32 בהשוואה לפענוח של טוקן בודד — כל הנתונים הם מה-PR, שטרם מוזג, ואף לא שוחזרו באופן בלתי תלוי. שנית, תקלה (issue) ב-Dynamo מצביעה על מלכוד אמיתי בטוקנייזר של 2.0: הוא מגיע עם קובץ tokenizer.json מסריאלי שמכיל ריפוד מובנה המרפד כל קידוד ל-9,000 טוקנים, כך שערימת הגשה שטוענת את הטוקנייזר המרופד יכולה לנפח פרומפט מולטימודלי של שישה טוקנים ל-54,000 מזההי טוקן. אם אתם מארחים בעצמכם, ודאו שנתיב ההגשה שלכם מבצע טוקניזציה מקוונת במקום לטעון את הקובץ המרופד.

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that the model adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

היכן הוא עומד בשוק ה-parsing של 2026

Nemotron Parse 2.0 נכנס לתחום צפוף ומתפתח במהירות. המובילים הנוכחיים בתחום ניתוח מסמכים בקוד פתוח כוללים את MinerU 2.5-Pro (מודל 1.2B מ-Shanghai AI Lab) ואת PaddleOCR-VL (גרסאות 0.9B ו-7B), שניהם משיגים ציונים מורכבים בשנות ה-90 הנמוכות בטבלת הדירוג של OmniDocBench, בתוספת GOT-OCR 2.0 מ-StepFun כאופציה קלת המשקל של 580M; בצד ה-API, Mistral OCR הוא ההצעה המסחרית העיקרית. שתי אזהרות לפני שתנסה למקם את 2.0 בדירוג הזה. הראשונה היא שהמספרים אינם ניתנים להשוואה: Parse 2.0 מדווח על ParseBench, ערכת הבדיקות של NVIDIA עצמה, ואילו הציונים בתחום הם ציונים מורכבים של OmniDocBench — משימות שונות, משקלות שונים, ואין עדיין מספר שניתן להשוות בצורה ישירה. השנייה היא שלא כדאי לבלבל בין NVIDIA-Nemotron-Parse-2.0 לבין המודל הנפרד של NVIDIA, NVIDIA-Nemotron-OCR-v2, שהוא מודל OCR צפוף ברמת מילה שנבנה עבור צינורות עיבוד של NeMo Curator. Parse 2.0 הוא המנתח המודע לפריסה ולמחלקות; OCR v2 הוא מחלץ ברמת מילה. הם כלים משלימים, לא אותו מודל.

אם נמקם את זה ביושר, המסר של Parse 2.0 אינו "מנצח את כולם בכל מדד פרסור". מדובר בפרסור בגודל 0.9B, ברישיון מתירני, המודע לפריסת העמוד, ודף המודל שלו טוען לקפיצה רב-לשונית גדולה מאוד לעומת קודמו — והשושלת שלו (v1.1 בנובמבר 2025, v1.2 בפברואר 2026, 2.0 באוגוסט 2026) מראה ש-NVIDIA משחררת פרסור חדש בערך כל רבעון. לצוותים שכבר עברו לסטנדרטיזציה על משפחת Nemotron Parse, 2.0 הוא שדרוג החלפה ישיר עם אותו מבנה API וסיפור רב-לשוני חזק בהרבה. לגבי כל השאר, השאלה היא האם טענותיו של המודל שעדיין לא הוכרז ישרדו בדיקות עצמאיות.

היכן משתלבת שכבת הניתוב בצינור העיבוד

מודל לפרסור מסמכים הוא בדרך כלל שלב אחד בצינור ארוך יותר, והשלבים שמסביבו הם המקום שבו ניתוב (routing) מוכיח את עצמו. הצורה הנפוצה היא: Parse 2.0 הופך עמוד למקטעים מובנים, ולאחר מכן LLM מסכם, עונה על שאלות, מחלץ ישויות, או מבנה את התוצאה עבור מאגר נתונים בהמשך הזרם. שלב ה-LLM הזה הוא המקום שבו פלטפורמת ניתוב משנה את הכלכלה. OrcaRouter מציע 200+ מודלים מאחורי API אחד במחיר המחירון של הספק — תוספת של 0%, כך שהפחתת מחיר של ספק מופיעה אצלנו באותו היום שבו היא מוכרזת — עם מעבר אוטומטי למקרה שספק אחד מתדרדר. באופן קונקרטי, זה אומר שהפרסר יכול להישאר קבוע בעוד שהמודל שמפרש את הפלט שלו מוחלף, מושווה, או מנותב לגיבוי ללא חוזה נוסף או שינוי קוד. אם שלב הפרסור הוא צוואר הבקבוק, אתה רוצה מודל שאפשר לכוונן ולארח בעצמך, וזה מה ש-Parse 2.0 נותן לך; אם שלב הפירוש הוא העלות המשתנה, זה השלב שנתב (router) צריך לנהל. אנחנו לא מארחים את Parse 2.0 בעצמנו — זה מודל באחסון עצמי, לא API — אבל פרסר שמזין LLM הוא בדיוק המבנה שבו נקודת קצה אחת לשכבת ה-LLM משתלמת.

Pipeline diagram titled 'A parsing pipeline with a routing layer': four rounded cards in a flow — Parse 2.0 (page → text · bboxes · markdown), Chunks (structured regions in reading order), OrcaRouter (one API · 200+ models · 0% markup), LLM (summary · QA · extraction) — with a footer line 'The parsing stage is self-hosted; OrcaRouter routes the LLM stage at provider list price with automatic failover.' OrcaRouter logo composited bottom-right.

השורה התחתונה

NVIDIA-Nemotron-Parse-2.0 היא גרסה אמיתית, מלאה ובלתי מוכרזת מ-3 באוגוסט 2026. בריפו מוצג מנתח רגיש-פריסה (layout-aware) בגודל 0.9B, שהכרטיס שלו טוען לשיפורים גדולים מאוד בריבוי-שפות ובכתב-יד לעומת v1.2, ושהוא משווק תחת רישיון מתירני עם חיכוך אמיתי סביב אירוח עצמי (self-hosting). אף אחד מהמספרים האלה לא אומת באופן עצמאי עדיין, ואין אפשרות אירוח מנוהל ואין תמחור. הצעד הנכון תלוי בסובלנות הסיכון שלך: אם אתה מנתח מסמכים רב-לשוניים היום והמדד הרב-לשוני הוא זה שחשוב לך, המעבר הנטען מ-0.44 ל-0.91 ב-MOSCAR גדול מספיק כדי להצדיק בדיקה של סוף שבוע על הקורפוס שלך — הפערים הם מהסוג שמתרבים או קורסים, ושחרור שקט הוא הדרך הזולה ביותר לגלות איזה משניהם. אם אתה צריך אמת-מידה לצטט או API נתמך כדי להמר על נתיב ייצור, חכה להכרזה או לריצה עצמאית. בינתיים, ככה נראה שילוח שקט, וכדאי לעקוב אחריו.

שאלות נפוצות

האם NVIDIA-Nemotron-Parse-2.0 הוא הדלפה או שחרור אמיתי?

אף תווית לא מתאימה בדיוק. זה לא דליפה במובן של משקולות תועות או חלקיות — המאגר מורכב במלואו, עם כרטיס מודל מפורט, קבצי תצורה, Dockerfile, חבילת בדיקות עם פלטי זהב, וסקריפטי הסקה גם עבור Transformers וגם עבור vLLM. אבל זו גם לא השקה במובן הרגיל: NVIDIA לא פרסמה שום הודעה, והאריזה של NIM ונקודת הקצה המתארחת שליוו את המהדורות הקודמות של Nemotron Parse נעדרות. התיאור המדויק הוא מהדורה מלאה שהספק עוד לא בחר לקדם — וזו הסיבה שהתווית הכנה כאן היא "שחרור שקט", ומדוע הדברים שהודעה הייתה בדרך כלל מיישבת (תמחור, מפת דרכים, זמינות מתארחת) נותרים שאלות פתוחות.

כיצד מדדי הביצועים של הספק משתווים למספרי OmniDocBench שאנשים מצטטים עבור מפענחים אחרים?

הם לא, ישירות. המספרים בכרטיס של NVIDIA-Nemotron-Parse-2.0 מגיעים מ-ParseBench, אמת המידה הביתית של NVIDIA המכסה נאמנות טקסט, עיצוב סמנטי, טבלאות, תרשימים וביסוס חזותי, בתוספת MOSCAR, IndicVisionBench ותת-קבוצת כתב-יד של OmniDocBench — בעוד שציוני הכותרת של השוק (MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR) הם ציונים מורכבים של OmniDocBench. משימות שונות, מדדים שונים, ואין עדיין השוואה ישירה שפורסמה. המספר היחיד שאכן חופף למערכת האקולוגית — נתון כתב-היד של OmniDocBench Notes — מדווח כמרחק עריכת טקסט ביחס ל-v1.2, לא כציון מורכב, ולכן עדיין אי אפשר לדרג אותו מול האחרים. עד שתתבצע הרצה בלתי-תלויה, התייחסו לטענות של Parse 2.0 ככיווניות ולא מאומתות.

מה צוות צריך לבדוק לפני העלאתו לייצור?

שלושה דברים. ראשית, הקורפוס הרב־לשוני שלך: כל הרעיון המרכזי של 2.0 הוא הקפיצה הרב־לשונית, ושחרור שקט הוא בדיוק המצב שבו הרווחים המוצהרים או משתכפלים על הנתונים שלך או לא — הרץ את השפות שאתה באמת מנתח לפני שאתה מאמין לכרטיס. שנית, מחסנית האירוח העצמי: ודא שבבניית ה־vLLM שלך יש תמיכה בקוד מרוחק של Nemotron Parse, החל את התיקון של tied-output-head, ובדוק שנתיב ההגשה שלך מבצע טוקניזציה מקוונת במקום לטעון את קובץ ה־tokenizer.json המרופד, מה שיכול להרחיב הנחיה קצרה ל־9,000 טוקנים. שלישית, סיפור הרישיון והשירות: המשקולות חינמיות תחת רישיון NVIDIA Open Model License, אבל אין NIM מוכרז, אין תמחור, ואין חוזה תמיכה — אז תכננו סביב אירוח עצמי, ונתבו את שלב ה־LLM במורד הזרם דרך שכבה שמאפשרת להחליף מודלים ולבצע fail-over בלי הנדסה מחדש, וזה החלק שפלטפורמת ניתוב בנויה עבורו.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube