כרטיס כותרת שנוצר בסגנון הבית של OrcaRouter שעליו כתוב “PixelUMM vs North Micro Vision Instruct”, עם ארבעה אריחי סטטיסטיקה: “2.4B” (סך הפרמטרים של North Micro Vision Instruct), “~180k” (ההורדות שלו מ-Hugging Face עד תחילת אוקטובר), “0.921 / 90.42” (ה-DocVQA שלו כשבר דיוק לעומת האחוז של PixelUMM) ו-“Apache-2.0” (רישיון הקוד והמשקלים שלו, לעומת הצ'קפוינט הלא-מסחרי של PixelUMM). שורת כותרת תחתונה מציינת “נתונים מדווחים על ידי הספק; אין הרצה חוזרת עצמאית של אף אחד מהמודלים.”. הלוגו של OrcaRouter שולב לתוך הרצועה המרופדת בפינה הימנית התחתונה.
Guides & Insights

PixelUMM לעומת North Micro Vision Instruct: מודל מחקר לא-מסחרי מול קורא 2.4B שאפשר להפיץ

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הצב את North Micro Vision Instruct ואת PixelUMM זה לצד זה, וההבדל בגודל הוא כמעט הסחת דעת: 2.4 מיליארד פרמטרים עבור הקורא ברזולוציה מקורית של Cohere לעומת 15.2 מיליארד עבור המודל המאוחד של NVIDIA. הציר המעניין הוא המקודד. North Micro Vision Instruct בנוי בדרך המקובלת — מקודד חזותי בן 400M שאותחל מ-SigLIP 2 SO400M, שמזין מודל שפה בן 2B, עטוף באוצר מילים של 262,144 טוקנים ומופץ תחת Apache-2.0. PixelUMM בנוי על הטענה שההסדר המדויק הזה הוא צוואר הבקבוק, ומוחק את המקודד: טלאי פיקסלים גולמיים בגודל 16×16 נכנסים לשלד Qwen3-8B דרך הטלות ליניאריות חד-שכבתיות, ואותם משקלים גם מייצרים וידאו וגם עונים על שאלות לגביו. האחד הוא מכשיר קריאה ייעודי שאפשר להוריד ולפרוס כבר היום. האחר הוא תזה מחקרית עם קישור להורדה ורישיון שמונע את הכנסתה למוצרים.

המספרים של שני המודלים שלהלן מגיעים מהמעבדות שלהם עצמן. אף אחד מהם לא שוחזר באופן עצמאי, והשניים מפרסמים מערכי בנצ'מרק שונים, ולכן החפיפה צרה מכפי שהיא נראית.

הטיעון בעד הארכיטקטורה המשעממת

North Micro Vision Instruct פורסם ב-Hugging Face ב-10 באוגוסט 2026, היו לו שמונה שבועות לצבור משתמשים, ועד תחילת אוקטובר הוא הציג בערך 180,000 הורדות ו-150 לייקים — תשומת לב בסדר גודל גדולה יותר מאשר המאגר בן הימים הספורים של PixelUMM. המסר השיווקי שלו ספציפי ולא זוהר: רוב מודלי הראייה מקטינים תמונה לרשת קבועה ומאבדים את הפרטים הדקים שמסמכים נשענים עליהם, ולכן המודל הזה מעבד תמונות ברזולוציה מקורית, תוך שמירה על יחס גובה-רוחב וטקסט קטן.

• פרמטרים — 2.4B בסך הכול: מודל שפה של 2B בתוספת מקודד ראייה של 400M שאומן בהתאמה אישית מ-SigLIP 2 SO400M.

• הקשר — שלד לשוני של 128K טוקנים, אך טווח הפעלה מולטימודלי מאומת של כ-8K טוקנים. הכרטיס מציין במפורש שהקשרים מולטימודליים ארוכים יותר מסתמכים על אקסטרפולציה ולא עברו בנצ'מרק.

• קלטים ופלטים — קלט של טקסט ותמונות משולבים, פלט טקסט. רב-לשוני ביותר מאחת-עשרה שפות. ללא יצירה מכל סוג.

• ציונים מדווחים — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, כולם מדווחים על ידי Cohere ולא שוחזרו. MMMU 0.329, מה שכרטיס המודל אינו מסתיר: זהו מומחה קריאה, לא מומחה כללי בהסקה.

• פריסה — Transformers 5.16.0 ומאיץ, GPU מודרני בודד בגודל 2.4B ב-bfloat16, Flash Attention 2 אופציונלי ולא נדרש.

שום דבר בתכנון הזה אינו חדשני. זו גם הסיבה שאפשר להוריד אותו, לכוונן אותו ולהציב אותו מול מסמכים אמיתיים כבר השבוע.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

הטיעון נגד זה, כפי שהוצג על ידי הצד השני

הפרסום המוקדם של PixelUMM נפתח בתיאור המחיר של אותה ארכיטקטורה. טרנספורמר חזותי קפוא שאומן מראש על נתוני אינטרנט מספק תכונות סמנטיות להבנה; VAE נפרד מספק לטנטים מכווני שחזור עבור יצירה; נשיאת שניהם כמעט מכפילה את ההקשר החזותי לכל תמונת התניה ומאלצת לבנות מחדש צינורות אימון מקדים של חזון-שפה סביב זרם שני. North Micro Vision Instruct נמנע מהכפלה רק בכך שהוא מסרב לחלוטין למשימה השנייה — הוא אינו מייצר, ולכן הוא זקוק לממשק אחד, לא לשניים.

PixelUMM מוביל את הטיעון עד מסקנתו. בלי מקודד, בלי VAE, בלי טוקנייזר: טלאי פיקסלים בגודל 16×16 עבור תמונות, צינוריות מרחב-זמן בנות 4 פריימים עבור וידאו, כששניהם מגיעים ל-Transformer מבוסס-פענוח בלבד דרך היטלים ליניאריים בשכבה אחת, עם הבנה באמצעות טקסט אוטורגרסיבי ויצירה באמצעות התאמת זרימה במרחב הפיקסלים. שמונת המדורים האמפיריים שלו הם מחקרים של בחירות עיצוב ולא ניצחונות בטבלאות דירוג — גודל טלאי, ארטיפקטים של טלאים, דינמיקת אימון במרחב הפיקסלים לעומת מרחב VAE, סקיילינג חישובי — כלומר מאמר ששואל אם הפרדיגמה מחזיקה מעמד, ולא כזה שטוען שהיא כבר ניצחה.

• מסלול חזותי — North Micro Vision Instruct: מקודד ראייה מאומן מראש בגודל 400M ברזולוציה מקורית. PixelUMM: ללא מקודד; טלאים גולמיים דרך הקרנה לינארית.

• מה זה יכול לעשות — North Micro Vision Instruct: קורא תמונות ומסמכים, עונה בטקסט, מאתר ומתאר. PixelUMM: קורא תמונות ווידאו, ומייצר תמונות ווידאו באורך 4 שניות מטקסט.

• היקף — 2.4B צפוף לעומת כ-15.2B בסך הכול על שלד Qwen3-8B, המוצג כ-"8B MoT" בטבלאות של המאמר עצמו.

• רישיון — Apache-2.0 על הקוד והמשקלים לעומת Apache-2.0 על הקוד עם NVIDIA One-Way Noncommercial License על הצ׳קפוינט.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

קריאה כנה של שני לוחות התוצאות

שני המודלים מפרסמים בנצ'מרקים שונים, ובמקומות שבהם הם חופפים, סולמות המדידה שונים.

• DocVQA — North Micro Vision Instruct 0.921 כשבר דיוק. PixelUMM 90.42 באחוזים. אותו שם מבחן, פיצולים שונים והגדרות פרומפט שונות, ורק אחד מהשניים טוען לטיפול ברזולוציה מקורית כסיבה.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. שוב, בערך אותו טווח ברגע שמפסיקים להשוות את המחרוזות הגולמיות.

• OCRBench — North Micro Vision Instruct 0.792. PixelUMM 78.00.

• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. שניהם נמוכים לפי הסטנדרטים של מודלי ראייה ושפה גדולים, ושתי המעבדות מדווחות עליהם ללא קישוט.

• PixelUMM-only — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 עם משכתב פרומפטים, איכות VBench חלק 1 84.10.

• North Micro Vision Instruct-only — משימות עיגון, יצירת כיתובים וריבוי תמונות; היעדר מתועד של קריאה לכלים, ובאופן מפורש אין התנהגות סוכנית.

הדבר המפתיע בחפיפה הוא עד כמה מומחה עם 2.4B מתקרב לגנרליסט עם 15.2B בקריאת מסמכים ותרשימים. אין זו ראיה לכך שהגישה ללא מקודד נכשלת — זו ראיה לכך שקריאת מסמכים היא משימה שבה מקודד קומפקטי ברזולוציה מקורית מתאים מאוד, והארכיטקטורה של PixelUMM מכוונת לטיעון אחר. המאמר של PixelUMM עצמו מודה בנקודה זו במשפט שכדאי לצטט: מכיוון שנתוני האימון שונים בין המודלים, התוצאות שלו "אינן יכולות לקבוע איזו ארכיטקטורה עדיפה".

היכן שההחלטה למעשה נוחתת

אם יש לכם מסמכים, תרשימים, טפסים או צילומי מסך ואתם זקוקים לתשובות החודש, הבחירה המעשית היא North Micro Vision Instruct, וזה בכלל לא צמוד: Apache-2.0, 2.4B, מסלול טעינה סטנדרטי של Transformers, ללא סביבת guardrail, ללא אינדקס של נקודות ביקורת מבוזרות, וללא סטק Python שני. כווננו אותו על התפלגות המסמכים שלכם ויהיה לכם מומחה. ההסתייגות היא ההיקף — כוונו אותו למשימת הסקה ומספר ה-MMMU ימצא אתכם.

ההצעה של PixelUMM היא רוחב ושאלת מחקר. היא קוראת ומייצרת, תמונה ווידאו, מקבוצת משקולות אחת, והיא הקריאה המעניינת יותר בפער ניכר. אבל הצ'קפוינט שלה נמצא תחת רישיון לא מסחרי, המשקולות שלה הן 128 רסיסי צ'קפוינט מבוזרים מאחורי אינדקס מטא-נתונים נסתר בסך של כ-30 ג'יגה-בייט, היא דורשת ערכת כלים CUDA 13 עם FlashAttention מקומפל מהמקור, ונתיב הטקסט-לווידאו שלה מריץ מעקות בטיחות של Cosmos שדורשים מאגר מגודר וסביבה נפרדת. זהו ספסל מעבדה, לא פריסה.

זווית הניתוב מגיעה בשלב מאוחר יותר, אם בכלל. אף אחד מהמודלים אינו זמין דרך שום API מתארח כיום — OrcaRouter אינו מנתב אף אחד מהם — ואף אחד מהם לא יהיה זמין עד שהרישוי שלהם יאפשר זאת. כאשר מודל כמו North Micro Vision Instruct כן מופיע מאחורי נקודת קצה משותפת, הסיבה להעדיף זאת על פני אינטגרציה ישירה היא הרגילה: מפתח אחד על פני יותר מ-200 מודלים, מחירי המחירון של הספקים מועברים הלאה במרווח של 0%, מעבר כשל שמוריד בדרגה מודל שמתפקד מתחת לכרטיס שלו, ואין חוזה שני לנהל משא ומתן עליו כשרוצים לערוך השוואת A/B למחליף. זהו תיאור של זרימת העבודה, לא טענה לגבי זמינות.

המבחן האחד שיפריד ביניהם

הריצו את שניהם על אותו סט מסמכים ובאותה רזולוציה ותנו ציון למקרי הטקסט הקטן, ואז הפכו משתנה אחד: הסירו את מקודד הראייה מההשוואה על ידי הזנת קלטים ברזולוציה המקורית של PixelUMM. אם המודל נטול-המקודד מחזיק מעמד בטקסט צפוף בשבר מהעלות בפרמטרים, זו הראיה החזקה ביותר האפשרית לתזה — וזהו מבחן שכל מי שיש לו כרטיס פנוי יכול להריץ, כי שני הצ'קפוינטים ניתנים להורדה. עד שמישהו יעשה זאת, הסיכום הפרגמטי עומד בעינו: קורא קטן תחת Apache-2.0 הוא זה שפורסים, וג'נרליסט גדול לא-מסחרי הוא זה שלומדים.