כרטיס כותרת ראשי להשוואה 'InternLumina-U2 לעומת North Micro Vision Instruct' עם כותרת המשנה 'קורא מסמכים שאפשר להריץ היום, לעומת 16B שעדיין לא שם' ושלושה תגי נתונים — 'North Micro: 2.4B, ניתן להרצה היום', 'InternLumina-U2: 16B, עדיין אין משקלים', 'ChartQA 0.808 לעומת 86.52 (שניהם לפי הדיווח)' — עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

InternLumina-U2 לעומת North Micro Vision Instruct: קורא מסמכים שאפשר להריץ היום לעומת מודל 16B שעדיין לא שם

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אם השבוע אתם זקוקים למודל שיודע לקרוא מסמכים, צילומי מסך ותרשימים, להשוואה הזו יש תשובה מעשית קצרה: North Micro Vision Instruct הוא מודל בעל משקולות פתוחות עם 2.4 מיליארד פרמטרים מבית Cohere, ששוחרר תחת רישיון Apache-2.0, זמין להורדה מאז 10 באוגוסט 2026, וטוב מספיק במשימות מסמכים כדי שיהיה כדאי להפנות אותו אל הקבצים שלכם כבר היום. InternLumina-U2 הוא מודל דיפוזיה עם 16 מיליארד פרמטרים מבית המעבדה לבינה מלאכותית של שנגחאי — עיצוב שאפתני הרבה יותר, שטוען גם להבנת תרשימים ומסמכים, לצד כחצי תריסר משימות אחרות — אבל משקולותיו אינן ציבוריות, מאגר ה-Hugging Face שלו הוא שלד ריק, ואיש בשום מקום לא יכול עדיין להריץ אותו. התשובה הארוכה יותר עוסקת במה שקורה כששני מודלים ברישיון Apache-2.0 מציגים טענות חופפות בנוגע ליכולת קריאה, אבל רק אחד מהם הוא דבר שאפשר להחזיק ביד.

ה-2.4B שבאמת קיים

North Micro Vision Instruct הוא מומחה הראייה במשפחת North של Cohere: כ-2.4B פרמטרים בסך הכול, מודל קומפקטי שנועד לקרוא ברזולוציה מקורית. נקודת התכנון היא שרוב מודלי הראייה מקטינים תמונות לרשת קבועה ומאבדים את הפרטים העדינים שעליהם מתבססים מסמכים — לכן North Micro Vision Instruct מקבל תמונות ברזולוציה המקורית שלהן עד כגודל דף A4 ב-200 dpi, תוך שמירה על יחס הגובה-רוחב וטקסט קטן. המספרים שדווחו על ידי Cohere חזקים עבור מחלקת הגודל: DocVQA ב-0.921, ChartQA ב-0.808, OCRBench ב-0.792, כולם דיווחי Cohere שלא שוחזרו, עם הקשר מולטי-מודאלי מאומת של כ-8K טוקנים ונקודת חולשה מתועדת ב-MMMU (0.329) — תזכורת לכך שהוא מומחה קריאה, לא גנרליסט חשיבה. אין לו API מתארח משל עצמו ואין מסלול אירוח סטנדרטי; הסיפור המעשי הוא אירוח עצמי של מודל 2.4B, שהוא קטן מספיק כדי לרוץ על GPU של תחנת עבודה מודרנית אחת. אימוץ הקהילה היה יציב — כרטיס ה-Hugging Face הראה עשרות אלפי הורדות בחודש עד סוף אוגוסט.

ה-16B שהוא הבטחה

InternLumina-U2 הוא סוג אחר של ארטיפקט. מה שהמעבדה לבינה מלאכותית של שנחאי פרסמה ב-1 בספטמבר 2026 הוא קוד הסקה וארכיטקטורה, לא מודל: מודל שפה דיפוזי דליל עם מומחיות מעורבת (LLM), עם 16B פרמטרים בסך הכול ו-1B פעילים, הבנוי סביב ייצוג חזותי בדיד לחלוטין בעל שמונה ספרי-קוד. מבין שש משפחות המשימות שסקריפט ההרצה של המאגר מכסה — טקסט, הבנת תמונה, טקסט-לתמונה, עריכת תמונה, הבנת וידאו, והבנת תלת-ממד — הבנת התמונה כוללת במפורש תרשימים ומסמכים צפופים. הטבלה הראשונית בעמוד הפרויקט מציגה נתוני תרשימים ומסמכים שהמעבדה מדווחת בטווח שבו המומחה טוען: ChartQA 86.52, CharXiv-DQ 83.65, לצד HallusionBench 62.15 ו-MathVision 33.22. העמוד מכנה את התוצאות "מקדמיות, חלקיות", הדוח הטכני שיכיל את הטבלאות המלאות מסומן "בקרוב", והעובדה המכרעת היא שאין משקולות שמאפשרות בדיקה.

לוח התוצאות

כל נתון להלן מדווח על ידי הספק. אלה של North Micro Vision Instruct הם הערכה עצמית של Cohere; אלה של InternLumina-U2 הם טבלה חלקית ראשונית של המעבדה.

• גודל וצורה — North Micro Vision Instruct: ~2.4B dense, קורא ברזולוציה מקורית. InternLumina-U2: 16B סה"כ / 1B פעיל, sparse MoE, מודל דיפוזיה דיסקרטי עם ספרי קוד מרובים.

• מה הוא עושה — North Micro Vision Instruct: קורא תמונות, מסמכים, תרשימים ומסכי ממשק משתמש; עונה בטקסט, עם ביסוס. InternLumina-U2: טוען ליכולות קריאה ויצירה — מבין תמונות/וידאו/תלת-ממד, יוצר ועורך תמונות.

• משקלים — North Micro Vision Instruct: פומבי מאז 10 באוגוסט 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: לא פומבי; דף ה-Hugging Face ריק, משקלים מסומנים כ"בקרוב".

• ציוני קריאה בולטים — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (דיווח Cohere). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (דיווח מעבדה, ראשוני).

• הקשר מסמך — North Micro Vision Instruct: רזולוציה מקורית של עד ~A4 ב-200 dpi, והקשר רב-מודאלי מאומת של ~8K. InternLumina-U2: תרשימים צפופים ותמונות טבעיות מטופלים באמצעות מקודד AToken מרובה-ספרי-קוד; ההקשר טרם צוין.

• חולשות ידועות — North Micro Vision Instruct: MMMU 0.329, ללא קריאה לכלים — קורא, לא מנמק או סוכן. InternLumina-U2: מפגר אחרי לפחות יריב אחד שצוין בשמו במבחן GenEval (0.81 לעומת 0.89) בטבלה החלקית שלו; הכל לא מאומת.

• איך מריצים אותה — North Micro Vision Instruct: מארחים לבד (self-host) מודל 2.4B; התמיכה ב-vLLM עוד הייתה בתהליך השקה כשזה נכתב. InternLumina-U2: אף אחד לא יכול להריץ אותה — אין משקלים (weights), והדרייבר ששוחרר דורש תיקיית checkpoint וקובצי tokenizer שאינם נמצאים בריפו (repo).

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

אותו בנצ'מרק, שתי אפיסטמולוגיות שונות מאוד

ChartQA היא הדרך הנקייה ביותר להבחין בין שתי הטענות. שני המודלים מדווחים על ערך ChartQA: North Micro Vision Instruct מדווח על 0.808 כשבר דיוק, ואילו InternLumina-U2 מדווח על 86.52 כאחוזים — אותו מדד, ובעצם אותה תוצאה בטווח שנות ה-80 על סולמות שונים, פחות או יותר עם פיצולי ההערכה והגדרות הפרומפט השונות שהופכים השוואות ChartQA בין מאמרים למסוכנות גם כששני המודלים קיימים. ההבדל האפיסטמי הוא הקובע: הערך 0.808 של North Micro Vision Instruct צמוד לנכס בר‑הורדה, ולכן כל צוות עם GPU ומערכת תרשימים יכול לשחזר או להפריך אותו השבוע. הערך 86.52 של InternLumina-U2 צמוד למפת דרכים. מספר שאי אפשר לבדוק הוא מספר שאסור לבנות עליו — וזו בדיוק העמדה שהמעבדה עצמה מכירה בה, בכך שהיא מתייגת את הטבלה שלה כמקדימה.

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

כרטיס ה־Hugging Face של CohereLabs/North-Micro-Vision-Instruct, כפי שצולם ב־27 באוגוסט 2026 — תיאור מודל הראייה־שפה ברזולוציה מקורית בגודל 2.4B, רישיון Apache‑2.0, ומדדי קריאת המסמכים שדיווחה Cohere.

קריאה, לעומת קריאה וציור

הפער בפילוסופיה הארכיטקטונית שווה יותר מפער המדדים (benchmarks). North Micro Vision Instruct הוא מומחה צר: הוא קורא, והוא מבצע את התפקיד האחד הזה במחיר סביר מספיק כדי שתוכל להריץ אותו על כל עמוד, כל צילום מסך, כל חשבונית בצנרת בלי לצפות בחשבון ה-GPU שלך. הזול הזה הוא התכונה — אינטליגנציית מסמכים בקנה מידה גדול היא בעיית עלות לא פחות מבעיית דיוק. InternLumina-U2 הוא ההימור ההפוך: מודל ענק דליל שמנסה לקפל יחד קריאה עם יצירת תמונות, עריכת תמונות, הבנת וידאו והבנת תלת-ממד לתוך ממשק אחד משותף של אסימונים דיסקרטיים, על בסיס התאוריה שהבנה ויצירה מחזקות זו את זו. אם זה עובד, זה מחלקה אחרת של כלי — אבל "אם זה עובד" עושה כאן הרבה עבודה, ומודל MoE דיפוזיה של 16B-A1B עם טוקנייזר מותאם אישית ועיבוד מקדים תלת-ממדי המבוסס על Blender לעולם לא יהיה הקורא הזול והתמידי שמומחה של 2.4B הוא. אלה אינם באמת תחליפים. הם כלי שאתה יכול לפרוס היום וכיוון מחקר שאתה יכול להתכונן אליו.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

מאגר GitHub של InternLM/InternLumina-U2, כפי שנקלט ב-2 בספטמבר 2026 — עמוד הנחיתה של המאגר, ובו התיאור "הבנה חזותית כוללת, יצירת תמונות ועריכתן" וסקריפטי ההסקה לפי משימה; מביניהם, מסלול הבנת התמונות הוא זה שמתמקד בתמונות טבעיות ובתרשימים צפופים.

מה זה אומר אם אתה בונה צינור מסמכים

אף אחד משני המודלים אינו מתארח על OrcaRouter — North Micro Vision Instruct הוא מודל באירוח עצמי ללא API מתארח, ול-InternLumina-U2 אין משקלים שמישהו יכול לארח — לכן זווית הניתוב כאן אינה „להפעיל את שניהם דרך מפתח אחד היום". זהו הדפוס שבו תשתמש ביום שבו אחד משניהם ישתנה: צנרת מסמכים כמעט תמיד מזווגת קורא זול עם מנמק גדול יותר, וערכה של שכבת ניתוב הוא לבטא את הזיווג הזה כקריאה אחת ולשמור על כך שהמעבר הישיר יישאר כנה — ללא תוספת מחיר (0%) — במודלים המתארחים שבהם אתה משתמש בפועל. כשצ׳קפוינט תחת Apache-2.0 כמו InternLumina-U2 סוף סוף מגיע, המהלך ההגיוני אינו לפרק מחסנית מסמכים עובדת — אלא להציב את החדש על נתיב בדיקה שמאחוריו failover אוטומטי, כך שירוויח תעבורת ייצור כשישרוד אותה, וברגע שייכשל על תרשים אמיתי, הקריאה תחזור למודל שכבר הוכיח את עצמו. API אחד על פני 200+ מודלים הוא המנגנון; failover הוא רשת הביטחון; המודל המומחה שבו אתה יכול להריץ היום הוא מה שמשלם את החשבונות בעוד הבטחת ה-16B עודנה עומדת בעינה.

פסק הדין

לצורכי קריאת מסמכים ותרשימים כאן ועכשיו, North Micro Vision Instruct הוא היחיד מבין השניים שקיים במובן שמיש — קטן, ברישיון Apache-2.0, ניתן להורדה, עם ציונים גבוהים המדווחים על ידי הספק, שאפשר באמת לגשת ולבדוק אותם. InternLumina-U2 הוא הארטיפקט המעניין יותר לטווח הארוך, כי הוא מנסה להפוך את הקריאה למיומנות אחת מתוך שש בתוך מודל מאוחד אחד, ואם זה יעבוד — זה ישנה את משמעות הביטוי "מודל ראייה". צפו במאגר Hugging Face הריק שלו כמו שצופים בספירה לאחור לקראת שיגור: ביום שבו יופיעו קבצי safetensors, ההבטחה תהפוך למודל, וההשוואה תהפוך לאמיתית. עד אז, אל תיתנו בהחלטותיכם לציון 86.52 שמדווח הספק על מדד תרשימים לגבור על 0.808 בר-הורדה.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube