
Nemotron Parse 2.0 מול MinerU: המאתגר הלא-מוכרז מול ברירת המחדל בקוד הפתוח
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA-Nemotron-Parse-2.0 ו-MinerU פותרים את אותה בעיה מכיוונים מנוגדים. שניהם מקבלים דף סרוק או מעובד ומחזירים markdown נקי ומסודר עם טבלאות, נוסחאות וסדר קריאה שלם. אבל MinerU הוא ברירת המחדל של הקוד הפתוח — עשרות אלפי כוכבים ב-GitHub, רישיון Apache-2.0, ו-API מתארח עם מכסה יומית חינמית, הבחירה הראשונה הבטוחה שרוב צוותי המסמכים פונים אליה. Nemotron Parse 2.0 הוא ההפך ממוסכם: הוא הופיע ב-Hugging Face ב-3 באוגוסט 2026, NVIDIA לא פרסמה עליו שום הכרזה, וכרטיס המודל שלו נושא קבוצה של טענות benchmark שיהיו הדבר הגדול ביותר שקרה לניתוח מסמכים פתוח השנה אם הן יחזיקו מעמד. הציוות הזה הוא במכוון לא מאוזן — המכהן מול המתמודד הלא-מוכרז — וכל השאלה היא מה שווה הטיעון של כל צד בפועל.
מה כל צד הוא בעצם
MinerU היא מערכת מלאה לניתוח מסמכים מבית OpenDataLab, קבוצת הנתונים שמאחורי הפרסומים הפתוחים של המעבדה לבינה מלאכותית של שנגחאי. הדגל הנוכחי הוא MinerU 2.5-Pro, מודל ראייה-שפה עם 1.2 מיליארד פרמטרים בסדרת השחרורים הנקודתיים 2604/2605 (גרסת 2604 יצאה באפריל 2026, ואחריה רענון 2605). הוא יושב על גבי מנוע דו-שלבי — ניתוח גס של פריסה גלובלית, ולאחר מכן זיהוי ממוקד על גזירות ברזולוציה מקורית — והפרויקט עוטף את המודל בקליטת PDF, DOCX, PPTX ו-XLSX, זיהוי פריסה, זיהוי נוסחאות וטבלאות, ושחזור סדר קריאה. זהו מפענח קוד-הפתוח הייחוס לעיבוד מקדים של RAG, ויש לו קהילה שמוכיחה זאת.
Nemotron Parse 2.0 הוא מקודד-מפענח חזותי (0.9B) מבית NVIDIA, באותה משפחה של NVIDIA-Nemotron-Parse-v1.2, שהושק בפברואר 2026. הוא משתמש במקודד חזותי מסוג ViT-H המבוסס על תשתית C-RADIOv2 של NVIDIA, ובמפענח בסגנון mBART בעל עשר שכבות. דפי קלט נתמכים עד 2048×1664 פיקסלים, היצירה פועלת עד תקרה של 9,000 טוקנים, והוא מפיק את אותם פלטים מובנים כמו MinerU: Markdown או טקסט פשוט, וכן טבלאות ב-LaTeX, HTML, Markdown, JSON, JSON היררכי או CSV, כולל מחלקות פריסה, תיבות תוחמות וסדר קריאה. המאגר מלא — קובצי תצורה, Dockerfile, חבילת בדיקות עם פלטי זהב — אבל NVIDIA לא קידמה אותו, אין אריזת NIM, ואף ספק הסקה לא מארח אותו. נכון להיום, האפשרות היחידה היא אירוח עצמי.

סיפור המחיר: "free" פירושו שני דברים שונים
ההבדל המעשי הגדול ביותר הוא ש-MinerU חינמי לקריאה ואילו Nemotron Parse 2.0 חינמי רק להרצה. ה-API הרשמי של MinerU ב-mineru.net כולל מסלול חינמי יומי — כ-1,000 עמודים בעדיפות גבוהה ביום, תלוי במבצע הנוכחי — ללא חיוב לכל קריאה, וקבצים של עד 200 עמודים כל אחד. מעבר למכסה, משימות נדחות בעדיפות נמוכה ולא מחויבות, ומארחים מסחריים מתמחרים את המודל המארח את עצמו בערך בעשירית הסנט לעמוד. אם צינור העיבוד שלך צריך אלפי עמודים ביום ואינך רוצה להפעיל דבר בעצמך, ל-MinerU יש מסלול שעולה כמעט כלום.
ל-Nemotron Parse 2.0 אין נתיב כזה. המשקולות חינמיות תחת רישיון NVIDIA Open Model License, אך כרטיס המודל מציין שהוא אינו פרוס על ידי שום ספק הסקה, ו-NVIDIA לא תמחרה או הכריזה על אפשרות אירוח. השימוש בו פירושו לשכור או להחזיק GPU, להרים בניית Transformers או vLLM עם תמיכת remote-code של Nemotron Parse, ולטפל במוזרויות הפריסה שלהלן. עבור פרויקט בהיקף קטן זו עלות אמיתית — GPU יקר משמעותית משכבת API חינמית בכמה מאות עמודים בחודש. עבור צוות שכבר מריץ תשתית GPU, המשקולות החינמיות הן יתרון אמיתי; השאלה היא האם העלות התפעולית שווה את מה שהמודל טוען להוסיף.
פער המדדים: המספרים האלה אינם עומדים זה מול זה
זהו החלק שבו רוב ההשוואות נכשלות בשקט, אז בואו נהיה מפורשים. הכרטיס של Nemotron Parse 2.0 מדווח על ארבעה מדדים: ParseBench כולל על 0.6391 (לעומת 0.5782 בגרסת 1.2), MOSCAR ל-OCR רב-לשוני על 0.9102 BoC F1 (לעומת 0.4410), IndicVisionBench על 0.7203 ANLS-character (לעומת 0.0612), ותת-קבוצת כתב יד של OmniDocBench שנמדדה כמרחק עריכת טקסט שהשתפר מ-0.9739 ל-0.3395. MinerU 2.5-Pro מדווח על סט שונה: ציון OmniDocBench v1.6 כולל של 95.69 — מתקדם ביותר, מעל מודלים גדולים בהרבה — ועוד 97.29 בפענוח נוסחאות צפופות ומרחק עריכת טקסט של 0.036 בריצות OmniDocBench משלו.
שני המודלים חולקים את השם "OmniDocBench," מה שגורם להם להיראות דומים, אבל המדדים אינם דומים. NVIDIA מדווחת על תת-קבוצה של זיהוי כתב-יד בלבד כמדד עריכת מרחק; OpenDataLab מדווחת על מדד מורכב כולל בגרסת benchmark שונה. ParseBench היא חבילת בדיקות משלה של NVIDIA ואין בה ערך של MinerU. ל-MOSCAR ול-IndicVisionBench אין ערך של MinerU. כל מספר משני הצדדים מדווח על ידי הספקים עצמם, ולאף אחד מהמודלים אין ריצה עצמאית של צד שלישי שפורסמה ושניהם מופיעים בה. כלומר, נכון לעכשיו אין נתון השוואתי ישיר שמדרג את Nemotron Parse 2.0 מול MinerU — כל מי שאומר לכם שמודל אחד "מנצח" בהשוואת ה-benchmark משליך ממבחנים שונים. מה שאפשר לומר מבחינה כיוונית: הטענות של MinerU בשלות ושרדו שנה של שימוש בקהילה, בעוד הטענות של Nemotron Parse 2.0 טריות, לא מבוקרות, ואם הקפיצות שלו ב-MOSCAR וב-IndicVision אכן משתכפלות — מדובר בעניין גדול במיוחד עבור ניתוח מולטילינגואלי.

היכן הם מתפצלים בעומסי עבודה אמיתיים

שים את המדדים בצד, וההבדלים שמופיעים בפייפליין נוגעים להיקף, להשהיה ולכיסוי רב-לשוני.
• היקף הקלט — MinerU קולט קבצי PDF מלאים עד 200 עמודים לקובץ דרך ה-API שלו וממזג טבלאות שחוצות עמודים; Nemotron Parse 2.0 מקבל תמונת עמוד בגודל עד 2048×1664 לכל קריאה, כך שמסמך בן 200 עמודים דורש 200 בקשות. אם הקלט שלך הוא PDF, זהו הבדל בזרימת העבודה לפני כל שאלת דיוק.
• בשלות הסרבינג — MinerU מציעה קצוות אחוריים של vLLM ו-SGLang עם תפוקה שפורסמה (כ־2 עמודים בשנייה על A100 בודד באמצעות המנוע האסינכרוני שלה), ראנר Docker, ו-API מתארח. הסיפור של הסרבינג של Nemotron Parse 2.0 הוא חדש ומהמורות: vLLM דורש תמיכה בקוד מרוחק, ובחומרת A100/A10 את קצה הקשב של Triton; הטוקנייזר כולל tokenizer.json מסודר עם ריפוד מובנה ל־9,000 טוקנים, שסטאק שרת אחד חווה כפרומפט של שישה טוקנים שמתפוצץ ל־54,000 מזההי טוקן; והמאגר נושא תיקון זמן ריצה לבניות vLLM שאינן תומכות בראש הפלט המאוגד (tied output head). אף אחד מאלה אינו בלתי עביר, אבל זה חיכוך אמיתי.
• רב-לשוני — כאן הקלף של Nemotron Parse 2.0 הוא החזק ביותר. גרסת 2.0 הרחיבה את אוצר המילים מכ־52,000 ל־72,000 טוקנים, במיוחד עבור זיהוי תווים אופטי רב־לשוני, והשיפורים הנטענים מרוכזים שם: MOSCAR עלה מ־0.44 ל־0.91, ו־IndicVisionBench (בנגלית, הינדית, טמילית ועוד שבעה כתבים הודיים) עלה מ־0.06 ל־0.72. MinerU תומך ב־109 שפות כתכונת דגל, אבל ההוכחה שלו היא מדד OmniDocBench המשולב, לא פילוח לפי כתב. אם הקורפוס שלך כבד בכתבים הודיים או בכתבים דלי־משאבים, המספרים של Nemotron Parse 2.0 הם הטענה המעניינת יותר לבחון — והם גם הפחות מאומתים באופן בלתי תלוי.
• כתב יד — הפער הגדול ביותר בכרטיס של NVIDIA הוא כתב יד: מרחק העריכה בתת־קבוצת ההערות של OmniDocBench יורד מ־0.97 ל־0.34. מרחק עריכת הטקסט של MinerU עצמו, 0.036, הוא בריצות OmniDocBench הכוללות, לא בתת־קבוצת כתב היד, כך ששוב המספרים לא מושווים ישירות. אבל הערות בכתב יד הן מצב כשל קלאסי עבור שניהם, וזהו התחום היחיד שבו השיפור הנטען של Nemotron Parse 2.0 גדול מספיק כדי להצדיק בדיקה ישירה על הדפים שלך.
מי צריך לבחור מה
בחר ב-MinerU אם אתה רוצה מנתח שתוכל להפעיל היום: מסלול יומי חינמי, שירות בוגר, קלט PDF מלא, רישיון Apache-2.0 ללא בדיקת תאימות, וקהילה גדולה דיה כך שתשובות לשאלות הגדרה כבר קיימות. הוא ברירת המחדל מסיבה טובה, ועבור רוב עומסי העבודה של עיבוד מקדים של RAG, זו הבחירה בעלת הסיכון הנמוך יותר.
{{1}}בחרו ב־Nemotron Parse 2.0 אם אתם כבר מרגישים בנוח עם אירוח עצמי של מודלים — במיוחד אם אתם בעולם של NVIDIA NIM או NeMo, מאחר ש־v1.2 מוגש כ־NIM ו־2.0 נראה כיורשו — ואם הדבר שהקורפוס שלכם צריך ספציפית הוא תמיכה ברב־לשוניות או בכתב יד.{{/1}} {{2}}בדיקת סוף שבוע על עמודים משלכם, בשפות הודיות או עמוסי הערות, תגיד לכם יותר מכל טבלת בנצ'מרק, כי הטענות או שיאומתו או שיתמוטטו מול נתונים עצמאיים.{{/2}} {{3}}רק אל תתכננו מסלול פרודקשן סביב מודל שעדיין לא הוכרז עד שהרצתם את הבדיקה הזאת ואישרתם שהמוזרויות של ה־tokenizer ושל הסרווינג מטופלות בסטאק שלכם.{{/3}}
מדוע הפרסר אינו העלות היחידה בצנרת
בכל מה שתבחרו, הפארסר הוא בדרך כלל השלב הזול ביותר בצנרת מסמכים ברגע שיש נפח אמיתי. השלב היקר הוא ה-LLM שהופך Markdown מנותח לסיכומים, לרשומות מובנות או לתשובות — ובשלב הזה שכבת ניתוב (routing layer) משנה את הכלכלה. OrcaRouter מעמיד 200+ מודלים מאחורי API אחד במחיר המחירון של הספק בלי תוספת, כך שהנחת מחיר של ספק נכנסת לתוקף באותו יום שבו היא מוכרזת, ו-failover אוטומטי מבטיח שספק אחד שתפקודו ירד לא עוצר את כל עבודת החילוץ. באופן קונקרטי: אפשר לבדוק את טענות זיהוי כתב היד של Nemotron Parse 2.0 מול MinerU על הקורפוס שלכם בלי להתחייב למחסנית המודלים במורד הזרם לאף אחד מהפארסרים, כי החלפת הפארסר ושכבת ה-LLM מנותקות זו מזו. אנחנו לא מארחים אף אחד מהפארסרים כיום — Nemotron Parse 2.0 הוא מודל באירוח עצמי ו-MinerU פועל על שירות משלו — אבל שכבת ניתוב על שלב ה-LLM היא בדיוק מה שמונע מהחלטת הפארסר להפוך להחלטת נעילה (lock-in).
השורה התחתונה
MinerU הוא ברירת המחדל ההגיונית: בוגר, חינמי להפעלה בקנה מידה קטן, בעל רישיון מתירני, ומוכח בייצור. Nemotron Parse 2.0 הוא ההימור המעניין: מודל NVIDIA עם 0.9B פרמטרים ששוחרר בשקט לפני חמישה ימים, ושבכרטיס שלו נטען שיש קפיצה דרמטית בריבוי-לשוניות ובכתב יד שאיש לא אימת באופן עצמאי. אם אתה מנתח בעיקר מסמכים טכניים באנגלית בכמות גדולה, MinerU הוא התשובה והסיכון של Nemotron Parse 2.0 לא שווה את זה. אם אתה מנתח כתבים הודיים או כתבים דלי-משאבים, או הערות בכתב יד, הטענות גדולות מספיק — והמשקלים חופשיים מספיק — כך שהרצת הבדיקה בעצמך היא זולה. NVIDIA ששולחת מנתח חדש בערך כל רבעון (v1.1 בנובמבר 2025, v1.2 בפברואר 2026, 2.0 עכשיו) מרמזת שהכרזה עשויה להתפרסם בקרוב; עד שזה יקרה, התייחס למספרים של 2.0 ככיווניים ובדוק על הקורפוס שלך.
שאלות נפוצות
האם Nemotron Parse 2.0 זמין דרך API כלשהו?
לא דרך שירות מתארח. כרטיס המודל של Hugging Face מציין שהמודל אינו פרוס אצל ספק inference כלשהו, ו-NVIDIA לא הכריזה על אריזת NIM או תמחור עבורו, נכון לתחילת אוגוסט 2026. הדרך היחידה להריץ אותו היא לארח את המשקולות בעצמך באמצעות Hugging Face Transformers עם trust_remote_code, או באמצעות build של vLLM הכולל תמיכה ב-remote-code של Nemotron Parse. לעומת זאת, ל-MinerU יש API רשמי עם מכסת עמודים יומית חינמית.
איזה מודל עדיף לעיבוד מקדים של RAG?
עבור צינורות RAG טיפוסיים — מסמכים טכניים באנגלית וב-CJK, טבלאות ופריסות מעורבות — MinerU הוא הבחירה הבטוחה והמוכחת יותר: הוא מקבל קובצי PDF מלאים, ממזג טבלאות חוצות עמודים, כולל מערך שרת בוגר, ולא עולה דבר בקנה מידה קטן דרך השכבה החינמית שלו. Nemotron Parse 2.0 הופך לבחירה הנכונה רק אם הקורפוס שלך כבד בכתבים הודיים (Indic) או בכתבים דלי-משאבים, הערות בכתב יד, או עמודים עתירי תרשימים שבהם מרוכזים היתרונות הנטענים שלו — וגם אז, ודא זאת על המסמכים שלך לפני התחייבות.
האם ניתן להשוות ישירות את מספרי ה-benchmark בשני כרטיסי המודל?
לא. Nemotron Parse 2.0 מדווח על ParseBench (חבילת הבדיקות של NVIDIA עצמה), MOSCAR, IndicVisionBench, ותת-קבוצת כתב-יד של OmniDocBench כמרחק עריכה. MinerU 2.5-Pro מדווח על מדד משולב כולל של OmniDocBench v1.6, בתוספת מדדים לנוסחאות ולעריכת טקסט. שם ה-benchmark החופף אינו אותו מדד, אין ריצה עצמאית שמעמידה את שני המודלים על אותה בדיקה, וכל נתון בשני הכרטיסים מדווח על ידי הספק. יש להתייחס אליהם כאל כיווניים, לא כאל ניתנים להשוואה ישירה.
