
תצוגה מקדימה של InternLumina-U2: מודל דיפוזיה אחד של 16B לתמונה, וידאו ו-3D — המשקלים עוד בדרך
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
בשעה 04:03 UTC ב-1 בספטמבר 2026, Shanghai AI Laboratory יצרה את מאגר GitHub בשם InternLumina-U2. כעבור שלוש עשרה דקות, אותו ארגון רשם מאגר בעל שם זהה ב-Hugging Face. לא היה פוסט השקה, לא כרטיס מודל ולא הודעה כלשהי — רק קוד ההסקה עבור InternLumina-U2, מודל mixture-of-experts בעל 16B פרמטרים (1B פעילים), שהמעבדה מציגה כמודל אחד המכסה הבנת תמונות, יצירת תמונה מטקסט, עריכת תמונות, הבנת וידאו והבנת תלת-ממד באמצעות ממשק יחיד של טוקנים בדידים. הקוד הוא אמיתי ופתוח לציבור; המודל עצמו אינו — עדיין. המשקולות מסומנות ב-"coming soon", מאגר ה-Hugging Face הוא מציין מקום ריק, והדוח הטכני שהובטח לא הופיע. מה שפורסם בשקט ב-1 בספטמבר הוא, בכל זאת, התמונה הציבורית המלאה ביותר של המודל הזה שקיימת בכל מקום.
אם זו הפעם הראשונה שאתם שומעים על InternLumina-U2, זו בדיוק הנקודה. לא הוכרז שום דבר על ההשקה, ולא נראה שעדיין קיים סיקור עצמאי כלשהו — כתבות איתות-מוקדם הן בדיוק המקום שבו מודל כזה צץ לראשונה, לפני פוסט ההשקה ולפעמים לפני המשקלים. כל מה שלהלן שאוב מהמאגר GitHub, מדף הפרויקט ומהדף הזמני ב-Hugging Face שהמעבדה עצמה פרסמה ב-1 בספטמבר, וכל דבר מעבר למקורות אלה מסומן במפורש כהסקה.
מה בעצם שוחרר ב-1 בספטמבר
המאגר ב-GitHubInternLM/InternLumina-U2נוצר ב-1 בספטמבר 2026, ובאותו יום בוצעו בו שלושה commits: commit האתחול, מעבר שסימן את קישור המודל כ"בקרוב" ואת תוצאות ה-benchmark כ"מקדמיות", ותיקון ניווט. הוא מופץ ברישיון Apache-2.0 וכולל קובץ README בשם "Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing", גרסה אנגלית וסינית, תשתית הסקה מלאה ומפת דרכים. מוזרות אחת שראויה לציון: הרשומה החדשותית של המאגר נושאת חותמת "[2026-08]", ואולם commit האתחול ושתי חותמות הזמן של המאגר מתוארכים ל-1 בספטמבר 2026 — יש להתייחס לתחילת ספטמבר כתאריך השחרור בפועל, ולא לאוגוסט. המאגר שלהלן הוא מלוא השחרור הציבורי: כל קובץ הנראה בעץ הוא חלק ממה ששוחרר, ושום דבר נוסף אינו קיים עדיין בשום מקום.

• GitHub — InternLM/InternLumina-U2, שנוצר ב-2026-09-01 תחת רישיון Apache-2.0, עם קוד הסקה לטקסט, המרת טקסט לתמונה, הבנת תמונה, עריכת תמונה, הבנת וידאו והבנה תלת-ממדית.
• Hugging Face — internlm/InternLumina-U2, שנוצר ב-2026-09-01, מכיל כרגע רק קובץ .gitattributes וקובץ README בן 28 בתים, שתוכנו כולו הוא כותרת רישיון Apache-2.0. אין משקלים, אין קובץ תצורה, אין קבצי טוקנייזר.
• דף הפרויקט — internlm.github.io/InternLumina-U2, עם דיאגרמות ארכיטקטורה, טבלת מדדי ביצוע ראשונית והדגמות זמניות; הדוח הטכני מסומן כ"בקרוב".
קוד ההסקה מאורגן כסקריפט מנהל אחד עם סעיף לכל משימה: יצירת טקסט פשוט, המרה מטקסט לתמונה ברזולוציה של עד 1024×1024 עם CFG ומספר צעדי זמן הניתנים להגדרה, הבנת תמונות על פני תמונות טבעיות ותרשימים עמוסי מידע, עריכת תמונה מבוססת הוראות עם מצב dual-CFG אופציונלי, הבנת וידאו על פני 64 פריימים שנדגמו, והבנת תלת-ממד על פני נכסי GLB/GLTF שמעובדים ל-64 תצוגות צבע ועומק דרך צינור עיבוד של Blender הכלול בחבילה, לפני הטוקניזציה. רוחב המשימות הזה הוא כל תזת העיצוב של המודל, וכדאי לעצור על כך לפני שצוללים לארכיטקטורה.
מודל אחד, שש משימות, אוצר מילים אחד של טוקנים
InternLumina-U2 שייך לקו מחקר מתפתח במהירות, שמהמר על כך ששפה וראייה צריכות לחלוק ממשק יחיד של אסימונים בדידים, במקום להתקיים בערימות נפרדות של הבנה ויצירה. העבודה המוקדמת יותר של המעבדה בכיוון זה — Lumina-DiMOO, מודל הדיפוזיה הבדיד המאוחד שהוצג ב-WAIC 2025 — מצוטטת לצד LLaDA2.0-Uni, Show-o2 ו-MMaDA כמערכות החלוציות שעליהן InternLumina-U2 מתבסס וטוען לעלות עליהן. ההימור הספציפי של InternLumina-U2 הוא שהצוואר בקבוק עבור המודלים המאוחדים הללו אינו הארכיטקטורה, אלא אוצר המילים החזותי: ספר קוד יחיד מגביל את כמות המידע שאסימון חזותי אחד יכול לשאת, בעוד שכלאיים בדידים-רציפים שמפצלים הבנה ויצירה בין ייצוגים שונים מאלצים את המודל לתחזק שתי ערימות בכל מקרה.
התשובה של InternLumina-U2 היא מידול בדיד לחלוטין עם ספרי קוד מרובים. הצד החזותי משתמש בטוקנייזר AToken של אפל, שמתאר כל עמדה חזותית באמצעות שמונה ספרי קוד משלימים — ניסיון לשמר מרקם מקומי, טקסט מוטבע, גאומטריה ופרטים בתדירות גבוהה מבלי לנפח את אורך הרצף. בצד הקלט, כל אחד משמונת ספרי הקוד שומר על אמבדינג משלו, ושמונת האמבדינגים לכל עמדה מאוחים ומוקרנים לטוקן שלד יחיד. בצד הפלט, החיזוי מקביל במרחב אך אוטורגרסיבי בעומק ספרי הקוד: שלד הדיפוזיה מנקה רעש מעמדות מרחביות מוסוות רבות במקביל, וראש אוטורגרסיבי רב-ספרי-קוד חוזה אז את שמונת הקודים של כל עמדה לפי הסדר.
• קנה מידה — 16B פרמטרים בסך הכול, 1B פעילים (16B-A1B), MoE דליל.
• שדרת שפה — מודל שפה דיפוזי LLaDA-2.0 MoE, שמטרת הבלוק-דיפוזיה שלו מורחבת למשימות חזותיות באמצעות אימון רב-משימתי משותף (תיאור ספק).
• ייצוג חזותי — טוקנים בדידים לחלוטין מ-8 ספרי-קוד מהטוקנייזר AToken של אפל.
• חומרה — מותאמת ל-GPUs של NVIDIA ול-NPUs של Huawei Ascend גם באימון, בהערכה ובהסקה, עם יישור מספרי ברמת האופרטור בין הקצוות האחוריים (backends).

מה שזה משיג בפועל, אם הטענות נכונות, הוא החלום הוותיק ביותר של התחום המולטי-מודאלי: קבוצת משקלים אחת שיכולה לקרוא תמונה, לערוך אותה, לצייר תמונה חדשה מטקסט, לענות על שאלות על וידאו, ולתאר נכס תלת-ממדי — כשההבנה והיצירה מחזקות זו את זו דרך אותו ממשק, במקום להיות תפורות יחד ממודלים מתמחים. זו גם הטענה שראויה ביותר לעין סקפטית, משום שהיא הקשה ביותר למימוש.
המספרים, כפי שהם
כל benchmark שיש ל-InternLumina-U2 הוא מדווח על ידי הספק, ראשוני וחלקי. ה-README ועמוד הפרויקט אומרים זאת בעצמם: "תוצאות ראשוניות וחלקיות. טבלאות השוואה מלאות יופיעו בדוח הטכני הקרוב." לא קיימת הערכה בלתי תלויה, משום שהמשקולות אינן ציבוריות. יש להתייחס למספרים שלהלן כאל טענות של המעבדה עצמה, ולא כאל ציונים מאומתים.
• הבנת תרשימים / מסמכים — ChartQA 86.52, CharXiv-DQ 83.65 (דיווח ספק).
• הנמקה מתמטית חזותית — MathVision 33.22, DynaMath 56.37; המעבדה אומרת שזה עולה על InternVL3-8B להבנה בלבד בשני המדדים.
• עמידות בפני הזיות — HallusionBench 62.15.
• הבנת וידאו — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (דף הפרויקט).
• הבנת תלת-ממד — 3D MM-Vet 41.8.
• טקסט לתמונה — DPG-Bench 87.10, TIIF-Bench Short/Long 84.60/85.95, GenEval 0.81 (דף הפרויקט).
• עריכת תמונות — ImgEdit 3.83.
סיפור ההשוואה הוא המקום שבו קורא ישר צריך לעצור. ה-README טוען ש-InternLumina-U2 עולה על מודלים מאוחדים כמו InternVL-U, LLaDA2.0-Uni, Show-o2 ו-Lumina-DiMOO במדדים עדינים של הבנה ויצירה — אבל הטבלה בדף הפרויקט עצמו מראה ש-InternLumina-U2 מקבל ציון 0.81 ב-GenEval לעומת 0.89 של LLaDA2.0-Uni, כך שהמודל נופל לפחות ממתחרה אחד לפחות במדד יצירה מרכזי אחד. בחירת כמה מספרים חיוביים מטבלה חלקית היא בדיוק מה שהערת השוליים "טבלאות השוואה מלאות בדוח הטכני" נועדה לרכך. המספרים הם אות כיווני מהמעבדה, לא יותר.
מה אמיתי לעומת מה שמובטח
היקף השחרור מפורש בצורה יוצאת דופן, וזה קריטי לכל מי שמחליט אם הוא יכול לנסות את זה היום. מה שנכלל בשחרור: קוד ההסקה. מה שלא נכלל: המשקלים, קוד האימון (שהובטח במאגר נפרד), מחסנית האימון וההסקה של Ascend, והדוח הטכני. מאגר Hugging Face שעתיד להכיל את המודל הוא שלד ריק — צילום המסך שלמטה הוא כל התוכן הנוכחי של העמוד שאליו מגיע הקורא כשהוא לוחץ על הקישור "מודל (בקרוב)" בקובץ README.

אפילו הקוד ששוחרר עדיין לא יכול להפיק פלט. דרייבר ההסקה מצפה לספריית checkpoint מפוצלת של Hugging Face ולמשקלי הטוקנייזר AToken בנתיב ספציפי — אף אחד מהם לא נמצא במאגר — כך שמה שזמין להורדה כיום הוא מפרט של אופן הרצת המודל, לא מודל רץ. וכשהמשקלים אכן יגיעו, אירוח עצמי לא יהיה עניין של pip-install שגרתי. המודל משתמש ב-API של block-diffusion generate במקום ממשק ה-generate הסטנדרטי של Transformers, הטוקנייזר AToken דורש FlashAttention, הקוד זקוק ל-GPU גלוי בזמן הייבוא, הדרייבר הראשי הוא חד-תהליכי, והצינור התלת-ממדי מצפה ל-Blender 4.5 עבור קידוד נכסים. זה פרויקט פריסה אמיתי, לא ניסוי של סוף שבוע — וזה בדיוק סוג החיכוך ששכבת ניתוב קיימת כדי לספוג עבור רוב הצוותים.
כשהמשקלים נוחתים, התייחס אליו כאל המודל הבלתי מוכח שהוא.
אף אחד לא יכול להריץ את InternLumina-U2 כיום, ואף ספק לא יכול לשרת אותו, כי המשקלים לא זמינים בפומבי. זה ישתנה בשלב מסוים — רישיון Apache-2.0 ודפוס הפעילות האגרסיבי של המעבדה ב-2026 בתחום הקוד הפתוח (המהלך של ArchSpace ל"פתיחת הכול", InternVL3.5, מודלי המדע של Intern-S2) הופכים את שחרור המשקלים מתרחיש היפותטי לתרחיש סביר. כשיקרה הדבר, הצעד הרציונלי הראשון הוא לא להמר את צינור הייצור על מודל דיפוזיה שראה אור זה עתה, עם דרישות שרת חריגות ואפס הערכות בלתי תלויות, אלא להריץ אותו זה לצד זה עם המודל שכבר סומכים עליו, במסלול בדיקה, ועם מעבר אוטומטי למודל המוכח ברגע שהמודל החדש יתנהג שלא כראוי. זהו מקרה השימוש ששכבת ניתוב נועדה לשרת: API אחד שמכסה יותר מ-200 מודלים, מחירי מחירון של ספקים שמועברים ב-0% תוספת, ומעבר אוטומטי שהופך את "לנסות את הדבר החדש" לכלל ניתוב, לא למהלך הגירה. OrcaRouter מוגדר כך — ולמען הסר ספק, אנחנו לא מנתבים את InternLumina-U2 וגם לא יכולים, כי המשקלים לא שוחררו. חלק זה עוסק בזרימת העבודה למקרה שהם ישוחררו, לא בטענה שהמודל זמין איפשהו כיום.
מה לצפות בהמשך
ארבעה אירועים יביאו את InternLumina-U2 מתצוגה מקדימה למציאות, לפי סדר סבירות משוער. ראשית, איכלוס מאגר Hugging Face: ברגע שקבצי safetensors, קובץ קונפיגורציה ומשקלי טוקנייזר AToken יופיעו בשלד המאגר, זה הרגע שבו המודל באמת קיים. שנית, הדוח הטכני, שאמור להכיל את טבלאות ההשוואה המלאות ולהפוך את הנתונים החלקיים של הספק שהוצגו לעיל למשהו שאפשר לאמת. שלישית, מאגר קוד האימון ומחסנית Ascend, שחשובים לכל מי שרוצה לבצע fine-tuning או להריץ את המודל על חומרה שאינה של NVIDIA. רביעית, הערכה עצמאית ראשונה — דירוג Elo בזירה, ריצה משוחזרת של ChartQA או GenEval — שתבחן את ההבטחה "מודל אחד, שש משימות" בלי הטיית הבחירה של המעבדה עצמה. הקוד פומבי מאז 1 בספטמבר, כך שהארכיטקטורה כבר ידועה; המשקלים חסרים, ולכן כל מה שנוגע לאיכות בפועל הוא עדיין בגדר טענה. עקבו אחר מאגר המודל, לא אחר פיד ההכרזות — החלקים המעניינים כבר פומביים, והמודל עצמו כנראה לא יאחר לבוא.
