
PixelUMM לעומת North Micro Vision Instruct: מודל מחקר לא-מסחרי מול קורא 2.4B שאפשר להפיץ
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 223 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הצב את North Micro Vision Instruct ואת PixelUMM זה לצד זה, וההבדל בגודל הוא כמעט הסחת דעת: 2.4 מיליארד פרמטרים עבור הקורא ברזולוציה מקורית של Cohere לעומת 15.2 מיליארד עבור המודל המאוחד של NVIDIA. הציר המעניין הוא המקודד. North Micro Vision Instruct בנוי בדרך המקובלת — מקודד חזותי בן 400M שאותחל מ-SigLIP 2 SO400M, שמזין מודל שפה בן 2B, עטוף באוצר מילים של 262,144 טוקנים ומופץ תחת Apache-2.0. PixelUMM בנוי על הטענה שההסדר המדויק הזה הוא צוואר הבקבוק, ומוחק את המקודד: טלאי פיקסלים גולמיים בגודל 16×16 נכנסים לשלד Qwen3-8B דרך הטלות ליניאריות חד-שכבתיות, ואותם משקלים גם מייצרים וידאו וגם עונים על שאלות לגביו. האחד הוא מכשיר קריאה ייעודי שאפשר להוריד ולפרוס כבר היום. האחר הוא תזה מחקרית עם קישור להורדה ורישיון שמונע את הכנסתה למוצרים.
המספרים של שני המודלים שלהלן מגיעים מהמעבדות שלהם עצמן. אף אחד מהם לא שוחזר באופן עצמאי, והשניים מפרסמים מערכי בנצ'מרק שונים, ולכן החפיפה צרה מכפי שהיא נראית.
הטיעון בעד הארכיטקטורה המשעממת
North Micro Vision Instruct פורסם ב-Hugging Face ב-10 באוגוסט 2026, היו לו שמונה שבועות לצבור משתמשים, ועד תחילת אוקטובר הוא הציג בערך 180,000 הורדות ו-150 לייקים — תשומת לב בסדר גודל גדולה יותר מאשר המאגר בן הימים הספורים של PixelUMM. המסר השיווקי שלו ספציפי ולא זוהר: רוב מודלי הראייה מקטינים תמונה לרשת קבועה ומאבדים את הפרטים הדקים שמסמכים נשענים עליהם, ולכן המודל הזה מעבד תמונות ברזולוציה מקורית, תוך שמירה על יחס גובה-רוחב וטקסט קטן.
• פרמטרים — 2.4B בסך הכול: מודל שפה של 2B בתוספת מקודד ראייה של 400M שאומן בהתאמה אישית מ-SigLIP 2 SO400M.
• הקשר — שלד לשוני של 128K טוקנים, אך טווח הפעלה מולטימודלי מאומת של כ-8K טוקנים. הכרטיס מציין במפורש שהקשרים מולטימודליים ארוכים יותר מסתמכים על אקסטרפולציה ולא עברו בנצ'מרק.
• קלטים ופלטים — קלט של טקסט ותמונות משולבים, פלט טקסט. רב-לשוני ביותר מאחת-עשרה שפות. ללא יצירה מכל סוג.
• ציונים מדווחים — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, כולם מדווחים על ידי Cohere ולא שוחזרו. MMMU 0.329, מה שכרטיס המודל אינו מסתיר: זהו מומחה קריאה, לא מומחה כללי בהסקה.
• פריסה — Transformers 5.16.0 ומאיץ, GPU מודרני בודד בגודל 2.4B ב-bfloat16, Flash Attention 2 אופציונלי ולא נדרש.
שום דבר בתכנון הזה אינו חדשני. זו גם הסיבה שאפשר להוריד אותו, לכוונן אותו ולהציב אותו מול מסמכים אמיתיים כבר השבוע.

הטיעון נגד זה, כפי שהוצג על ידי הצד השני
הפרסום המוקדם של PixelUMM נפתח בתיאור המחיר של אותה ארכיטקטורה. טרנספורמר חזותי קפוא שאומן מראש על נתוני אינטרנט מספק תכונות סמנטיות להבנה; VAE נפרד מספק לטנטים מכווני שחזור עבור יצירה; נשיאת שניהם כמעט מכפילה את ההקשר החזותי לכל תמונת התניה ומאלצת לבנות מחדש צינורות אימון מקדים של חזון-שפה סביב זרם שני. North Micro Vision Instruct נמנע מהכפלה רק בכך שהוא מסרב לחלוטין למשימה השנייה — הוא אינו מייצר, ולכן הוא זקוק לממשק אחד, לא לשניים.
PixelUMM מוביל את הטיעון עד מסקנתו. בלי מקודד, בלי VAE, בלי טוקנייזר: טלאי פיקסלים בגודל 16×16 עבור תמונות, צינוריות מרחב-זמן בנות 4 פריימים עבור וידאו, כששניהם מגיעים ל-Transformer מבוסס-פענוח בלבד דרך היטלים ליניאריים בשכבה אחת, עם הבנה באמצעות טקסט אוטורגרסיבי ויצירה באמצעות התאמת זרימה במרחב הפיקסלים. שמונת המדורים האמפיריים שלו הם מחקרים של בחירות עיצוב ולא ניצחונות בטבלאות דירוג — גודל טלאי, ארטיפקטים של טלאים, דינמיקת אימון במרחב הפיקסלים לעומת מרחב VAE, סקיילינג חישובי — כלומר מאמר ששואל אם הפרדיגמה מחזיקה מעמד, ולא כזה שטוען שהיא כבר ניצחה.
• מסלול חזותי — North Micro Vision Instruct: מקודד ראייה מאומן מראש בגודל 400M ברזולוציה מקורית. PixelUMM: ללא מקודד; טלאים גולמיים דרך הקרנה לינארית.
• מה זה יכול לעשות — North Micro Vision Instruct: קורא תמונות ומסמכים, עונה בטקסט, מאתר ומתאר. PixelUMM: קורא תמונות ווידאו, ומייצר תמונות ווידאו באורך 4 שניות מטקסט.
• היקף — 2.4B צפוף לעומת כ-15.2B בסך הכול על שלד Qwen3-8B, המוצג כ-"8B MoT" בטבלאות של המאמר עצמו.
• רישיון — Apache-2.0 על הקוד והמשקלים לעומת Apache-2.0 על הקוד עם NVIDIA One-Way Noncommercial License על הצ׳קפוינט.

קריאה כנה של שני לוחות התוצאות
שני המודלים מפרסמים בנצ'מרקים שונים, ובמקומות שבהם הם חופפים, סולמות המדידה שונים.
• DocVQA — North Micro Vision Instruct 0.921 כשבר דיוק. PixelUMM 90.42 באחוזים. אותו שם מבחן, פיצולים שונים והגדרות פרומפט שונות, ורק אחד מהשניים טוען לטיפול ברזולוציה מקורית כסיבה.
• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. שוב, בערך אותו טווח ברגע שמפסיקים להשוות את המחרוזות הגולמיות.
• OCRBench — North Micro Vision Instruct 0.792. PixelUMM 78.00.
• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. שניהם נמוכים לפי הסטנדרטים של מודלי ראייה ושפה גדולים, ושתי המעבדות מדווחות עליהם ללא קישוט.
• PixelUMM-only — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 עם משכתב פרומפטים, איכות VBench חלק 1 84.10.
• North Micro Vision Instruct-only — משימות עיגון, יצירת כיתובים וריבוי תמונות; היעדר מתועד של קריאה לכלים, ובאופן מפורש אין התנהגות סוכנית.
הדבר המפתיע בחפיפה הוא עד כמה מומחה עם 2.4B מתקרב לגנרליסט עם 15.2B בקריאת מסמכים ותרשימים. אין זו ראיה לכך שהגישה ללא מקודד נכשלת — זו ראיה לכך שקריאת מסמכים היא משימה שבה מקודד קומפקטי ברזולוציה מקורית מתאים מאוד, והארכיטקטורה של PixelUMM מכוונת לטיעון אחר. המאמר של PixelUMM עצמו מודה בנקודה זו במשפט שכדאי לצטט: מכיוון שנתוני האימון שונים בין המודלים, התוצאות שלו "אינן יכולות לקבוע איזו ארכיטקטורה עדיפה".
היכן שההחלטה למעשה נוחתת
אם יש לכם מסמכים, תרשימים, טפסים או צילומי מסך ואתם זקוקים לתשובות החודש, הבחירה המעשית היא North Micro Vision Instruct, וזה בכלל לא צמוד: Apache-2.0, 2.4B, מסלול טעינה סטנדרטי של Transformers, ללא סביבת guardrail, ללא אינדקס של נקודות ביקורת מבוזרות, וללא סטק Python שני. כווננו אותו על התפלגות המסמכים שלכם ויהיה לכם מומחה. ההסתייגות היא ההיקף — כוונו אותו למשימת הסקה ומספר ה-MMMU ימצא אתכם.
ההצעה של PixelUMM היא רוחב ושאלת מחקר. היא קוראת ומייצרת, תמונה ווידאו, מקבוצת משקולות אחת, והיא הקריאה המעניינת יותר בפער ניכר. אבל הצ'קפוינט שלה נמצא תחת רישיון לא מסחרי, המשקולות שלה הן 128 רסיסי צ'קפוינט מבוזרים מאחורי אינדקס מטא-נתונים נסתר בסך של כ-30 ג'יגה-בייט, היא דורשת ערכת כלים CUDA 13 עם FlashAttention מקומפל מהמקור, ונתיב הטקסט-לווידאו שלה מריץ מעקות בטיחות של Cosmos שדורשים מאגר מגודר וסביבה נפרדת. זהו ספסל מעבדה, לא פריסה.
זווית הניתוב מגיעה בשלב מאוחר יותר, אם בכלל. אף אחד מהמודלים אינו זמין דרך שום API מתארח כיום — OrcaRouter אינו מנתב אף אחד מהם — ואף אחד מהם לא יהיה זמין עד שהרישוי שלהם יאפשר זאת. כאשר מודל כמו North Micro Vision Instruct כן מופיע מאחורי נקודת קצה משותפת, הסיבה להעדיף זאת על פני אינטגרציה ישירה היא הרגילה: מפתח אחד על פני יותר מ-200 מודלים, מחירי המחירון של הספקים מועברים הלאה במרווח של 0%, מעבר כשל שמוריד בדרגה מודל שמתפקד מתחת לכרטיס שלו, ואין חוזה שני לנהל משא ומתן עליו כשרוצים לערוך השוואת A/B למחליף. זהו תיאור של זרימת העבודה, לא טענה לגבי זמינות.
המבחן האחד שיפריד ביניהם
הריצו את שניהם על אותו סט מסמכים ובאותה רזולוציה ותנו ציון למקרי הטקסט הקטן, ואז הפכו משתנה אחד: הסירו את מקודד הראייה מההשוואה על ידי הזנת קלטים ברזולוציה המקורית של PixelUMM. אם המודל נטול-המקודד מחזיק מעמד בטקסט צפוף בשבר מהעלות בפרמטרים, זו הראיה החזקה ביותר האפשרית לתזה — וזהו מבחן שכל מי שיש לו כרטיס פנוי יכול להריץ, כי שני הצ'קפוינטים ניתנים להורדה. עד שמישהו יעשה זאת, הסיכום הפרגמטי עומד בעינו: קורא קטן תחת Apache-2.0 הוא זה שפורסים, וג'נרליסט גדול לא-מסחרי הוא זה שלומדים.
