
InternLumina-U2 מול Qwen2.5 Omni: מודל ה-Omni ש-Alibaba סיפקה לעומת זה ש-Shanghai AI Lab עדיין מבטיחה
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
InternLumina-U2 ו-Qwen2.5 Omni הן שתיהן תשובות לאותה שאיפה — מודל אחד שמטפל בכל מודאליות במקום גן חיות של מומחים — משני דורות שונים. Qwen2.5 Omni היא התשובה ששוחררה בפועל: מודל פתוח עם 7 מיליארד פרמטרים שפורסם במרץ 2025, בן שבעה-עשר חודשים בזמן כתיבת שורות אלה, שמקבל טקסט, תמונות, אודיו ווידאו כקלט ומשיב בטקסט או בדיבור רציף טבעי. InternLumina-U2 היא התשובה של מעבדת הבינה המלאכותית של שאנגחאי, שפורסמה כקוד הסקה ב-1 בספטמבר 2026: מודל דיפוזיה ספרסי עם 16 מיליארד פרמטרים שטוען שהוא קולט תמונות, וידאו ותלת-ממד ומייצר ועורך תמונות דרך ממשק אחד משותף של טוקנים בדידים. דור אחד של רעיון האומני נמצא בשימוש פעיל כבר שנה וחצי; השני בן יום אחד ואיש אינו יכול להריץ אותו, כי המשקלים שלו עדיין לא קיימים. הפער ביניהם הוא ההבדל בין הבטחה שקוימה להבטחה שניתנה.
ה-Omni שיצא: Qwen2.5 Omni
Qwen2.5 Omni ראוי להילקח ברצינות כקו בסיס, כי הוא המודל הפתוח הנדיר שבאמת סיפק את ההבטחה "לתפוס הכל, לענות בכל צורה". הארכיטקטורה Thinker-Talker שלו מזווגת חושב טקסט עם מדבר שמפיק דיבור, תוך שימוש בקידוד מיקום מולטימודלי מיושר לזמן, כך שהשמע והווידאו נשארים מסונכרנים; הקלט כולל טקסט, תמונות, שמע וווידאו, והפלט יכול להיות טקסט בתוספת קול באותו תור, עם ארבעה קולות מובנים. המגבלות מתועדות לא פחות מהיכולות: ההקשר הוא 32K טוקנים, אין קריאת פונקציות ואין פלט מובנה, והוא משוחח אומני ולא סוכן. מה שהוא לא עושה ראוי להדגשה בהשוואה הזו — הוא קולט תמונות, שמע וווידאו, אבל אינו יוצר אותם. ה"אומני" ב-Qwen2.5 Omni הוא תפיסה כוללת עם סינתזת דיבור בצד הפלט; הפיקסלים נכנסים, והמילים יוצאות.
הרקורד אמיתי. המודל הורד מאות אלפי פעמים, יש לו API מתארח דרך הפלטפורמה של המפתח עצמו ודרך כמה פלטפורמות צד-שלישי, ובמשך שבעה-עשר חודשים צבר קוונטיזציות, כלים קהילתיים ומחיר ידוע — רשימות אגרגטורים מציינות מחיר של כ-$0.09 למיליון טוקני קלט וכ-$0.34 למיליון טוקני פלט, כשהשמע מחויב בנפרד. שבעה-עשר חודשים הם מספיק זמן כדי שגם חוזקותיו וגם מגבלותיו יהיו ממופות היטב. זה מה שבגרות קונה: לא שלמות, אלא יכולת חיזוי.
האומני המובטח: InternLumina-U2
InternLumina-U2 מנסה לצעוד צעד אחד קדימה מעבר ל-Qwen2.5 Omni, והצעד הוא בדיוק המקום שבו שוכנת הקושי. תזה העיצובית שלו היא שתפיסה ויצירה צריכות לחלוק ממשק אסימונים דיסקרטי אחד: במקום מודל שפה שתופס וידאו ומודל דיפוזיה נפרד שמצייר, עמוד שדרה יחיד של דיפוזיה מבוססת MoE דלילה — 16B סה"כ, 1B פעיל — יקרא גם תמונה, תרשים, וידאו או נכס תלת-ממדי ויכתוב תמונה חדשה או עריכה, תוך שימוש באוצר מילים ויזואלי דיסקרטי לחלוטין עם שמונה ספרי קוד, כך שכל עמדה ויזואלית נושאת מספיק מידע כדי לתמוך בשני הכיוונים. זו טענה מהותית גדולה יותר מזו של Qwen2.5 Omni. דבר אחד הוא לנתב כל מצב-קלט לטקסט ודיבור; דבר אחר הוא לגרום לקבוצת משקלים אחת ליצור פיקסלים בשטף כמו שהיא חושבת עליהם.
זוהי גם, נכון לעכשיו, טענה שאי אפשר לבדוק. המעבדה פרסמה קוד הסקה, דף פרויקט עם טבלת אמות מידה "ראשונית, חלקית", ושלד ריק של Hugging Face; המשקלים, קוד האימון, הדוח הטכני ומחסנית ה-Ascend-NPU מסומנים כולם כ"בקרוב". אין הערכה בלתי תלויה, כי אין מה להעריך. הארכיטקטורה של Qwen2.5 Omni הייתה ניתנת לבדיקה בשבוע שבו שוחרר המודל, כי המשקלים שוחררו יחד איתו; הארכיטקטורה של InternLumina-U2 קריאה היום, והאיכות עדיין בגדר הבטחה של הספק.
לוח התוצאות
מכיוון שלאחד מהמודלים הללו יש שבעה עשר חודשים של היסטוריה ולאחר יש יום של קוד, השורות נושאות מידע על מקורן במקום להעמיד פנים שהעמודות סימטריות.
• גיל — Qwen2.5 Omni: שוחרר במרץ 2025, 17 חודשים בשטח, מאות אלפי הורדות. InternLumina-U2: קוד ההסקה פורסם ב-1 בספטמבר 2026, אפס הורדות, אפס הרצות עצמאיות.
• צורה — Qwen2.5 Omni: ~7B מקצה לקצה, Thinker-Talker עם קידוד מיקום מולטי-מודאלי מיושר לזמן. InternLumina-U2: סך הכל 16B / 1B פעיל, sparse MoE diffusion LLM עם מנתב טוקנים ויזואלי דיסקרטי עם שמונה ספרות קוד.
• קלט — שניהם מקבלים טקסט ותמונות; Qwen2.5 Omni מקבל בנוסף אודיו ווידאו לצ’אט אומני; InternLumina-U2 טוען בנוסף להבנת וידאו על פני 64 פריימים שנדגמו, ולהבנת תלת־ממד על פני תצוגות GLB/GLTF שעובדו ב־Blender.
• פלט — Qwen2.5 Omni: טקסט ודיבור בזרימה, ארבעה קולות. InternLumina-U2: טוען ליכולות טקסט, יצירת תמונה מטקסט עד 1024×1024, ועריכת תמונה לפי הוראות.
• חזית היצירה — Qwen2.5 Omni: יוצר מילים וקול, לא פיקסלים. InternLumina-U2: מנסה ליצור ולערוך פיקסלים בתוך אותו מודל טוקנים בדידים שקורא.
• משקלים ורישיון — שניהם משקלים פתוחים תחת Apache-2.0 בעיקרון; אלו של Qwen2.5 Omni זמינים להורדה היום, אלו של InternLumina-U2 עדיין לא פומביים.
• הגשה — Qwen2.5 Omni: API מתארח ואירוח עצמי (פריסה כבדה בדיוק מלא); ידוע חלון הקשר 32K, ללא קריאות פונקציות. InternLumina-U2: לא ניתן להגיש — הדרייבר ששוחרר מצפה לצ'קפוינטים שאינם קיימים.
• נתונים בולטים — Qwen2.5 Omni: ותיק בלוח המובילים של OmniBench (ציון בסביבות 0.561 בלוחות הנוכחיים); InternLumina-U2: ChartQA 86.52, MathVision 33.22, GenEval 0.81 — כולם דיווחי ספק, ראשוניים וחלקיים.

מדוע פער הדורות הוא הסיפור האמיתי
נניח בצד את עניין הגילים, וההבדל המהותי הוא קו הגבול שבו כל מודל עוצר. Qwen2.5 Omni בחר בגרסה מעשית של אומני: לתפוס בראייה רחבה, להשיב בשפה או בקול, ולהשאיר את סינתזת התמונות והווידאו למודלי יצירה ייעודיים במקום אחר בערימה. חלוקת עבודה כזו היא האופן שבו נבנית בעצם כל מערכת מולטי-מודאלית ייצורית ב-2026, וזו הסיבה ש-Qwen2.5 Omni יכול היה לצאת לשוק ב-2025 ולהישאר שימושי ב-2026 — הוא מבצע היטב את החלק שלו ומשתלב עם שאר הרכיבים. InternLumina-U2 הוא הימור שחלוקת העבודה היא הבעיה: שמודל שנאלץ לייצג הכול — תפיסה ויצירה — באוצר מילים בדיד משותף אחד יפתח הבנה עמוקה יותר של ראייה מאשר מודל שרק צריך לתאר אותה. ההימור הזה, אם ישתלם, הוא התוצאה החשובה יותר. אם לא, InternLumina-U2 יהיה בסופו של דבר Qwen2.5 Omni איטי ורעב יותר, עם מחולל תמונות שהוברג בצורה מגושמת לתוך אותם משקלים. כל התחרות — וזו תחרות בין עיצוב שכבר שוחרר לשוק לבין השערה, לא בין שני מודלים הניתנים להרצה — היא האם הארכיטקטורה הקשה יותר מצדיקה את עצמה.

כרטיס Qwen/Qwen2.5-Omni-7B ב-Hugging Face, שנלכד ב-27 באוגוסט 2026 — סקירת Thinker-Talker, רישיון Apache-2.0, ותגיות המודאליות של המודל: טקסט, תמונה, אודיו ווידאו.
מה שנה וחצי של הורדות באמת קונה
בגרות אינה "וייב"; היא רשימה של דברים שאתה יודע. עם Qwen2.5 Omni אתה יודע שהקונטקסט של 32K הוא אילוץ קשיח, ואתה יכול לתכנן סביבו. אתה יודע שאין נתיב לקריאות פונקציות, ולא תעמיד פנים שיש. אתה יודע בערך מה עולה פריסה, הן דרך API מתארח והן על ה-GPUs שלך, כי המודל כבר תומחר והופעל על ידי מספיק אנשים עד שהמספרים התייצבו. אתה יודע שהמיקום ב-OmniBench אמיתי, כי לוחות מובילים עצמאיים עוקבים אחריו כבר למעלה משנה. עם InternLumina-U2 אף אחד מהפעלים האלה אינו חל — אתה לא יודע, אתה לא יכול לדעת, כי אין ארטיפקט. כשמודל הוא בן יום וחסר משקל, כל טענה לגביו היא הצהרת כוונות. הא-סימטריה הזו אינה ביקורת על המדע; היא העמדה האפיסטמית הנכונה לכל מי שבוחר על מה לבנות.

מאגר ה-GitHub של InternLM/InternLumina-U2, שנלכד ב-2 בספטמבר 2026 — דף הבית של המאגר שחושף את הארכיטקטורה — התיאור, הרישיון וסקריפטי ההסקה — בעוד שמשקלי המודל עצמם נעדרים מעץ הקבצים.
החלטת הניתוב, מנוסחת בכנות
נצהיר בפשטות את מצב הזמינות: OrcaRouter לא מארח את InternLumina-U2, כי אין משקלים שמישהו יוכל לארח, ואנחנו לא מחזיקים כרגע גם ב-Qwen2.5 Omni — הוא רץ דרך ה-API של המפתח עצמו ופלטפורמות צד שלישי. לכן הלקח בניתוב כאן הוא על עמדה, לא על קריאה לשניים אלה דרך מפתח אחד היום. הדפוס העמיד הוא זה שכל החלטה בין מודל בוגר למודל חדש פוגשת בסופו של דבר: השאר את המודל המוכח על הנתיב הראשי, שבו API אחד על פני 200+ מודלים ומעבר עם 0% תוספת מחיר פירושם שאתה משלם את מחיר המחירון של הספק ותו לא; כוון את המודל החדש והלא מוכח אל נתיב בדיקה עם העברה אוטומטית, כך שבפעם הראשונה שהוא נתקע, סוטה או מחזיר שטויות, הקריאה נופלת אל המודל בעל הרקורד של שבעה-עשר חודשים. כך תוכל להעריך ארכיטקטורה שאפתנית וחדשה כמו InternLumina-U2 ביום שבו המשקלים שלו יופצו — בלי להמר על הנתיב היצרני שכבר תלוי בו.
פסק הדין
Qwen2.5 Omni הוא המודל האומני שאפשר לבנות עליו היום: זמין, ניתן להורדה, מתועד, עם מגבלות ידועות ומחיר קבוע. InternLumina-U2 הוא המודל האומני שכדאי לעקוב אחריו: צעד ארכיטקטוני אמיתי מעבר מתפיסה ליצירה, Apache-2.0, עם קוד ציבורי ומשקולות שממתינות לפרסום. אם ההימור של המעבדה על ריבוי ספרי קוד (multi-codebook) יחזיק מעמד בבדיקות עצמאיות, InternLumina-U2 לא יהיה יריב של Qwen2.5 Omni אלא הדור הבא של אותו רעיון. אם לא, המודל הגנרליסטי בן שבעה־עשר החודשים ששוחרר בפועל עדיין יהיה שם, ועושה את העבודה שעשה כל הזמן. עקבו אחר הדף הזמני של Hugging Face; פסק הדין ממתין לקבצי ה-safetensors, לא למאמר הזה.
