
Qwen3.8-Omni-Flash מול InternLumina U2: חושים בשכירות מול משקלים בבעלות
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
הדרך המועילה להשוות Qwen3.8-Omni-Flashלבין InternLumina U2 אינה לפי שורת מדדים, משום שהם אינם מופיעים באותן שורות. היא נעשית בשאלה מי רשאי להריץ אותם. המודל Qwen3.8-Omni-Flash של הספק, הפתוח ללקוחות API מאז 18 בספטמבר 2026, הוא מודל סגור על הפלטפורמות של הספק עצמו: חלון הקשר של מיליון טוקנים, עד שעה של אודיו ווידאו רציף בכל קריאה, פלט טקסט בלבד, וללא משקלות. הInternLumina U2 של Shanghai AI Laboratory הוא מודל דיפוזיה מסוג תערובת מומחים 16B-A1B תחת Apache 2.0, שנקודות הבדיקה (checkpoints) שלו ל-Ascend ניתנות להורדה מ-Hugging Face ממש עכשיו, בעוד שנקודות הבדיקה של NVIDIA והדוח הטכני עדיין רשומים כ"בקרוב". האחד הוא שירות שאתם שוכרים לפי הטוקן. האחר הוא קובץ שאתם יכולים להחזיק, עם הסתייגות בנוגע לחומרה שעליה הוא רץ כיום. ההבדל הזה מכריע יותר פריסות אמיתיות מכל ציון בטבלה של מי מהספקים.
מה זה בעצם InternLumina U2
הארכיטקטורה היא החלק המעניין והיא באמת יוצאת דופן. InternLumina U2 הוא MoE דליל עם 16 מיליארד פרמטרים בסך הכול ומיליארד פעילים, והוא מודל שפה דיפוזיוני ולא אוטורגרסיבי — הוא משכלל רצף שלם במקביל במקום לפלוט טוקנים משמאל לימין. הייצוג החזותי שלו הוא בדיד לחלוטין: שמונה ספרי קודים של טוקנים חזותיים שנבנו על AToken של אפל, וזה מה שמאפשר למודל אחד גם לקרוא תמונה וגם להפיק תמונה בלי מפענח נפרד שמחובר בקצה. מענה לשאלות טקסטואליות, יצירת תמונות מטקסט, הבנת תמונות, עריכת תמונות, הבנת וידאו והבנת תלת־ממד — כולם אותו מודל שעושה אותו סוג של עבודה על אותו אוצר מילים.
• גודל וצורה — InternLumina U2 הוא 16B בסך הכול, 1B פעילים, MoE דליל; מספר הפרמטרים של Qwen3.8-Omni-Flash אינו מפורסם.
• יצירה — InternLumina U2 מייצר ועורך תמונות ומטפל בהבנה תלת-ממדית; Qwen3.8-Omni-Flash אינו מייצר מדיה כלל ומחזיר טקסט.
• פענוח — InternLumina U2 הוא מודל LLM דיפוזי המפענח במקביל; Qwen3.8-Omni-Flash הוא אוטורגרסיבי.
• הקשר ומשך — Qwen3.8-Omni-Flash כולל חלון של 1M טוקנים ועד שעה של אודיו-וידאו רציף בקריאה אחת; החומרים שפורסמו של InternLumina U2 אינם מתארים דבר מכך, ואודיו ארוך-טווח אינו נמנה עם היכולות המפורטות שלו.
• משקלים — InternLumina U2 מופץ ברישיון Apache 2.0, כאשר נקודות הביקורת של Ascend פורסמו ואלה של NVIDIA ממתינות; ל-Qwen3.8-Omni-Flash אין משקלים ואין תוכנית מוצהרת לפרסום משקלים כלשהם.
• איך משיגים אותו — InternLumina U2 הוא הורדה מ-Hugging Face עם קוד הסקה ב-GitHub; Qwen3.8-Omni-Flash הוא קריאת API אל Alibaba Cloud Model Studio או לפלטפורמת Qianwen.
• ציונים בלתי־תלויים — אין כאלה לאף אחד מהשניים. הכרטיס של InternLumina U2 עצמו מכנה את טבלת הביצועים שלו "תוצאות ראשוניות, חלקיות"; אלה של Qwen כולם מול קודמו בלבד ולא שוחזרו.

שאלת המשקולות זזה מאז סיקור התצוגה המוקדמת
אם קראתם את הכתיבה המוקדמת שלנו על InternLumina U2 כשהקוד הופיע לראשונה, מצב הדברים השתנה בכיוון אחד ונותר בעינו בכיוון אחר, ושתי החצאים חשובים. מאגר ה-Hugging Face אינו עוד שלד ריק: תיקיית ascend/ מכילה כעת שבעה שברי safetensors בתוספת קובץ התצורה, הטוקנייזר וקוד המידול, מה שאומר שהמודל באמת ניתן להורדה ולהרצה על ידי כל מי שיש ברשותו את החומרה המתאימה. תיקיית nvidia/ עדיין מסומנת כ"בקרוב", הדוח הטכני עדיין עתיד להתפרסם, ומדור הבנצ'מרקים של המאגר עצמו עדיין אומר "תוצאות ראשוניות, חלקיות". לכן ההצהרה המדויקת היום אינה "המשקולות יצאו" או "המשקולות חסרות" — אלא שנקודות ביקורת (checkpoints) של ערימת חומרה אחת פורסמו ושל האחרת לא, וזהו אילוץ ממשי לכל מי שהאשכול שלו מבוסס NVIDIA.
שני דברים נוספים זזו בשקט. מאגר ה-GitHub המשיך לקבל קומיטים הרבה אחרי ההפצה הראשונית ב-1 בספטמבר, כך שהקוד ששוחרר מתוחזק ולא ננטש. ומונה ההורדות במאגר Hugging Face עדיין מראה אפס, מה שאומר פחות על המודל ויותר על הקהל: מודל דיפוזיה 16B-A1B עם צ'קפוינטים בעדיפות ל-Ascend מיועד למעבדה, ולא לצוות מוצר שמחפש נקודת קצה מתארחת ברבעון הזה.
היכן ששני אלה באמת חופפים, והיכן שלא
הבנת תמונות היא נקודת ההשקה, והיא צרה מכפי שהיא נראית. שני המודלים יכולים להסתכל על תמונה ולענות על שאלות לגביה, וזה כל תפקידו של Qwen3.8-Omni-Flash ואחד משישה תפקידים של InternLumina U2. כל מה שמעבר לכך מתפצל בחדות. InternLumina U2 יכול לאחר מכן לערוך את התמונה הזו או ליצור תמונה חדשה מתוך פרומפט, באותו מודל, תוך שימוש באותו אוצר מילים חזותי שבו השתמש כדי לקרוא אותה. Qwen3.8-Omni-Flash לא יכול להפיק אף פיקסל, אך הוא יקלוט שעה של אודיו ווידאו בקריאה אחת ויגיד לך מי דיבר, מתי, ומה הוחלט — מה שחומרי הפרסום של InternLumina U2 אינם טוענים לעשות כלל.
החפיפה שחשובה פחות ממה שאנשים מניחים היא הווידאו. שניהם מתוארים כעוסקים בווידאו, אבל הם עושים איתו דברים שונים: האחד מבין הקלטה ארוכה כמסמך, והאחר מתייחס לווידאו כמודאליות חזותית לצד תלת־ממד. צוות שזקוק לסיכום של שעה של צילומים לא יקבל מענה מהשני, וצוות שזקוק ליצירת פריים לא יקבל מענה מהראשון.

עלות, שליטה, ומה שאתם בעצם קונים
השוואת התמחור אינה דומה באופייה. Qwen3.8-Omni-Flashמחייבת לפי טוקן — 0.15 דולר למיליון טוקני קלט, 0.016 דולר לקלט במטמון, 0.47 דולר לפלט במחירון הבינלאומי, עם מחירון נפרד ליבשת סין שאינו בר-השוואה — והכותרות בהשקתה היו קיצוץ שדווח על ידי הספק של יותר מ-98% בעלות של שעת קלט אודיו, שחושב על ידי תמחור דגימה בת שתי דקות והכפלתה בשלושים, כאשר וידאו נדגם ב-720p ובקצב של פריים אחד לשנייה. InternLumina U2לא מחייבת דבר, כי אין על מה לחייב: העלות היא החומרה שלכם והזמן שלכם, וכרטיס המודל עצמו אינו מפרסם נתון תפוקה שיאפשר להמיר זאת למספר לפי טוקן.
זו הפשרה בשורה אחת. ה-API נותן לך יכולת שאין באפשרותך לארח ועלות שעתית שמשתנה בהתאם לשימוש; המשקלים הפתוחים נותנים לך עלות קבועה ושליטה מלאה בנתיב הנתונים, במחיר של תשתית הסקה שעליך לבנות ומערך צ'קפוינטים שכרגע משמעו חומרת Ascend. עבור עומסי עבודה מפוקחים שבהם המדיה אינה יכולה לצאת מהבניין, האפשרות השנייה אינה העדפה — היא האפשרות היחידה בעמוד הזה. עבור צוות שזקוק לניתוח אודיו ארוך החודש, האפשרות הראשונה היא האפשרות היחידה בעמוד הזה.
OrcaRouter לא מארח כיום אף אחד מהמודלים הללו, ואנו מעדיפים לומר זאת בפשטות מאשר לרמוז על נתיב ניתוב שאינו קיים: Qwen3.8-Omni-Flash פועל רק בפלטפורמות של אליבאבא עצמה, ו-InternLumina U2 הוא הורדה ולא נקודת קצה. מה שכן אנו מריצים הוא שאר סדרת Qwen3.8 — Qwen3.8-Flash ו-Qwen3.8-Max — דרך API אחד במחיר המחירון של הספק עם 0% תוספת, וזו הדרך המעשית להחזיק קו בסיס עובד עבור הצד של המודלים הסגורים בהשוואה הזו, בעוד שהצד של המשקולות הפתוחות עדיין מסדר את נקודות הבדיקה של NVIDIA שלו.

איזה מהם אתה באמת צריך לבחור?
בחר בInternLumina U2אם אתה צריך מודל אחד שקורא, מייצר ועורך תמונות, ואתה מוכן להחזיק בעצמך את מחסנית ההסקה — ואם המאיצים שלך הם Ascend, או שאתה יכול לחכות לנקודות הביקורת (checkpoints) של NVIDIA. זהו המודל היחיד מבין השניים שיכול ליצור תמונה, והיחיד שאתה יכול להריץ בלי לשלוח נתונים לספק. התייחס למספרי הבנצ'מרק שלו כלא מוכחים עד שיתפרסם הדוח הטכני, כי כרטיס המודל אומר בדיוק את זה.
בחר את Qwen3.8-Omni-Flash אם הבעיה שלך היא שעות של אודיו וווידאו ולא פיקסלים בפלט — מודיעין פגישות, ניתוח הקלטות ארוכות, עבודה סוכנת עתירת אודיו בסינית ובאנגלית — ואם אתה יכול לקבל תלות במקור יחיד ופלט טקסט בלבד. סיפור העלויות שלו חזק בשעות אודיו בקלט והרבה יותר חלש בחשבונית הכוללת, הבנצ'מרקים שלו מדווחים על ידי הספק ולא משוחזרים, וההרצות הראשונות של צד שלישי שמופיעות ממקמות אותו באחוזון ה-28 בהסקה, על מדגם קטן מספיק כדי שיעורר בדיקה ולא החלטה.
אם אתה זקוק לשניהם, הם משלימים זה את זה, לא חלופות: מודל תמונות במשקלים פתוחים שאתה מארח, ומודל סגור למדיה ארוכה שאתה קורא לו. אף אחד מהם אינו ניתן לניתוב דרכנו כיום. הדבר שכדאי לשים לב אליו מצד אחד הוא הצ'קפוינט של NVIDIA והדוח הטכני; ומצד שני, ההערכה הבלתי-תלויה הראשונה, שעדיין אינה קיימת ושהיא הפער הגדול ביותר בכל מה שנכתב על Qwen3.8-Omni-Flash עד כה.
