
InternLumina-U2 לעומת Gemini Omni 1.1 Flash: המודל שעוד לא ניתן להריץ לעומת זה שמשלמים עליו לפי שנייה
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
אם המועד שלך הוא השבוע, יש להשוואה הזאת תשובה בת משפט אחד. Gemini Omni 1.1 Flash הוא מודל יצירת הווידאו הזמין בדרך כלל של Google — קוראים לו דרך API, הוא מחזיר קליפ עם אודיו מסונכרן, ומשלמים על כל שניית פלט. InternLumina-U2 הוא מודל מחקר שפורסם בשקט על ידי Shanghai AI Laboratory תחת רישיון Apache-2.0 — אפשר להוריד את קוד ההסקה שלו, אבל לא את המשקלים, שהמעבדה עדיין מסמנת כ"בקרוב". האחד הוא מוצר שאפשר לקנות כבר עכשיו; השני הוא הימור בצורת מאמר שאי אפשר להריץ אותו כלל. השאלה המעניינת היא למה מישהו בכלל ישים אותם באותו משפט מלכתחילה, ומה כל אחד מהם אומר לך על הכיוון שבו עבודה מולטימודלית פתוחה הולכת בסוף 2026.
הכל להלן מסומן לפי מקור. הפרטים של InternLumina-U2 מגיעים ממאגר ה-GitHub ומדף הפרויקט שהמעבדה פרסמה ב-1 בספטמבר 2026 — באותו היום שבו הופיע ה-stub הריק של Hugging Face — וכל אחת מטבלאות הביצועים שלו היא דיווח של הספק, ראשונית ולא אומתה על ידי אחרים. הפרטים של Gemini Omni 1.1 Flash מגיעים מחומרי ההשקה של גוגל עצמה ומדף התמחור של המודל שהופץ לזמינות כללית ב-27 באוגוסט 2026.
שתי תשובות לאותה שאלה "רב-מודאלית"
שני המודלים נכללים תחת הכותרת הרופפת "מודל אחד, מודאליות רבות" — והתווית המשותפת הזו היא הסיבה היחידה שמשווים ביניהם. מתחת לתווית אין להם כמעט דבר במשותף. Gemini Omni 1.1 Flash הוא שירות יצירה סגור ומתארח, ששם את הווידאו בראש סדר העדיפויות: מאכילים אותו בטקסט, בתמונה, בקליפ ייחוס קצר או באודיו, והוא מפיק עד עשר שניות של וידאו ב-720p עם דיבור, מוזיקה ואפקטים קוליים מובנים, עם אפשרות הרחבה במרווחים של עשר שניות עד לכדי סצנה של ארבעים שניות. הוא מתבסס על הקליפ שכבר יש לכם — מעבר ההרחבה בודק כעת עד עשר שניות של הקשר קודם, במקום שנייה אחת כבעבר — ותומך בשליטה בפריים הראשון/האחרון, כך שתוכלו לנעול את תחילת השוט וסופו ולתת למודל למלא את האמצע. זהו כלי ליצירת תמונות נעות, שמתומחר לשנייה.
InternLumina-U2 הוא הימור בכיוון ההפוך: מודל sparse mixture-of-experts יחיד, עם סך של 16B פרמטרים מתוכם 1B פעילים, שטוען שהוא מבין תמונות, וידאו ונכסי תלת־ממד, ומייצר ועורך תמונות דרך ממשק אסימונים בדיד משותף אחד. הצד הוויזואלי שלו הוא בדיד לחלוטין — שמונה ספרי קוד משלימים מטוקנייזר שהמעבדה מכנה AToken, כך שכל מיקום ויזואלי מתואר באמצעות שמונה קודים במקום אחד — והצד הלשוני שלו הוא עמוד שדרה של דיפוזיה שהמעבדה מאריכה מ־LLaDA-2.0. הטענה היא שהבנה ויצירה צריכות לחזק זו את זו במערכת משקלים אחת, במקום להיות תפורות יחד ממודלים מתמחים. האם זה עובד — כרגע אין לכך תשובה: המודל אינו בר־הרצה בשום מקום, מכיוון שהמשקלים אינם קיימים בפומבי.
לוח התוצאות, כפי שהוא
לוח התוצאות ההוגן לזוג הזה חייב לשאת מידע על המקור בכל שורה, שכן עמודה אחת היא מוצר ששווק עם מחירים גלויים, ואילו השנייה היא טענת מחקר שלא פורסמה ואין לה מחיר כלל.
• מה זה — Gemini Omni 1.1 Flash: מודל מתארח ליצירה ועריכת וידאו (מזהה מודל: gemini-omni-1.1-flash), זמינות כללית ב־27 באוגוסט 2026. InternLumina-U2: מודל LLM מבוסס דיפוזיה במדע פתוח להבנה חזותית מקיפה, יצירת ועריכת תמונות, הקוד שוחרר ב־1 בספטמבר 2026.
• משקלים — Gemini Omni 1.1 Flash: אין, סגורים וזמינים רק לענן. InternLumina-U2: גם עדיין אין, אך ברישיון Apache-2.0 ומסומן במפורש כ"בקרוב".
• הפלט שתקבל — Gemini Omni 1.1 Flash: קליפים של 10 שניות ב-720p עם אודיו, הניתנים להארכה עד 40 שניות; הגדלת רזולוציה ל-1080p ו-4K; וטקסט לצד הקליפים. InternLumina-U2: עדיין כלום — קוד הסקה ומפת דרכים.
• מה הוא מקבל — Gemini Omni 1.1 Flash: טקסט, תמונה, וידאו (עד ~131K אסימוני קלט; שלושה קטעים בני 10 שניות לכל בקשה), שמע. InternLumina-U2: מתיימר לתמוך בטקסט, תמונות טבעיות, תרשימים צפופים, וידאו על פני 64 פריימים שנדגמו, ובנכסי תלת־ממד בפורמט GLB/GLTF המעובדים ל־64 תצוגות של צבע ועומק.
איך מריצים את זה — Gemini Omni 1.1 Flash: ממשק ה-Gemini API של Google דרך ה-Interactions API (stateful); גישת צרכנים דרך Google Flow למנויי AI Plus, Pro ו-Ultra. InternLumina-U2: אירוח עצמי בלבד, ורק לאחר שהמשקלים יורדים; הקוד מצפה לספריית checkpoint מפוצלת, למשקלי הטוקנייזר AToken, ל-FlashAttention, ול-Blender 4.5 עבור מסלול התלת-ממד.
• מה זה עולה — Gemini Omni 1.1 Flash: $0.03 לשנייה ב־360p draft, $0.10 לשנייה ב־720p, $0.15 לשנייה ב־1080p, $0.30 לשנייה ב־4K, עם תעריף אסימונים של $1.50 למיליון קלט ו־$9.00 למיליון פלט טקסט. InternLumina-U2: מה שה-GPUs שלך עולים, ברגע שזה קיים.

שתי העמודות אינן מודדות את אותו ציר. הצד של Gemini מתומחר, מוגש ושימושי מיידית; הצד של InternLumina הוא מפרט של מודל שעדיין אינו מודל.
החלק שהוא למעשה עדכני: ה-GA של Gemini Omni 1.1 Flash
Gemini Omni 1.1 Flash משמעותי השבוע בזכות עצמו, משום שזה הרגע שבו קו הווידאו האומני של גוגל הפסיק להיות תצוגה מקדימה. נקודת הקצה של התצוגה המקדימה הקודמת של Gemini Omni Flash מתוכננת להיכבות ב-30 בספטמבר 2026, ומודל ה-GA הזה הוא התחליף שאליו מעבירים את המפתחים. רשימת השדרוגים קונקרטית: הארכת סצנה לארבעים שניות מתוספות של עשר שניות; שליטה בפריימי מפתח שמאפשרת לציין פריים ראשון ואחרון ולגרום למודל לייצר את הקטע המקשר; קטעי ייחוס באורך עד שלוש שניות כדי לשמור על דמות או תפאורה עקבית; ושכבת טיוטה ב-360p במחיר של שליש מ-720p שפועלת עד 60% מהר יותר לצורך איטרציות על פרומפטים לפני העיבוד הסופי היקר. אם אתם בונים צינורות וידאו, טבלת המחירים – $0.10 לשנייה של 720p, $1.01 לקליפ בן עשר שניות, כ-$4 לסצנה של ארבעים שניות ב-720p הבנויה מארבע קריאות הרחבה – היא המספר שמשנה את מודל העלויות שלכם.
שום דבר מזה לא הופך אותה למתחרה של InternLumina-U2 בשום מובן תפעולי. Gemini Omni 1.1 Flash יוצר תנועה; InternLumina-U2, אם טענותיה ישרדו מגע עם המשקלים, תבין תנועה ותפיק סטילס. צוות שצריך וידאו מוצר ברבעון הזה לא בוחר בין השתיים — מודל Gemini הוא היחיד מבין השניים שאפשר בכלל לקרוא לו, והוא זמין דרך ה-API של גוגל עצמה וכמה פלטפורמות של צד שלישי.

תיעוד 'Models' של Gemini API באתר המפתחים של Google, שנלכד ב-2 בספטמבר 2026 — העמוד המפרט את משפחת Gemini הנוכחית, עם סדרת Gemini Omni בניווט הצדדי.
החלק שאינו עדכני כלל: InternLumina-U2
ההשקה של InternLumina-U2 ב-1 בספטמבר הייתה מהסוג השקט ביותר: שלושה קומיטים למאגר GitHub, דף פרויקט, קובץ stub בן 28 בתים ב-Hugging Face שכל תוכנו הוא כותרת רישיון Apache-2.0, וללא הכרזה. מה שבאמת ציבורי הוא תשתית ההסקה (inference harness) והארכיטקטורה, והם ראויים לקריאה מדוקדקת דווקא משום שאיש לא הצליח עד כה לבחון את המודל עצמו. המאגר מציג דרייבר עם נקודת כניסה אחת לכל משימה — טקסט, יצירת תמונה מטקסט ברזולוציה של עד 1024×1024, הבנת תמונות על פני תמונות טבעיות ותרשימים צפופים, עריכת תמונה מבוססת הוראות עם מצב dual-CFG אופציונלי, הבנת וידאו על פני 64 פריימים מדוגמים, והבנת תלת־ממד על פני תצוגות GLB/GLTF המעובדות ב-Blender. ההימור העיצובי הוא שאוצר מילים ויזואלי בדיד רב-קוד (multi-codebook) מאפשר לשלד יחיד (backbone) לבצע את כל זה מבלי לנפח את אורך הרצף — אותו אינסטינקט ש"טוקנים ויזואליים צריכים לשאת יותר מידע" שמניע מודלי וידאו ילידיים-קודק, שמיושם כאן לממשק אחיד של הבנה ויצירה.

מאגר ה-GitHub של InternLM/InternLumina-U2, שצולם ב-2 בספטמבר 2026 — דף הנחיתה של המאגר ברישיון Apache-2.0 עם התיאור "Multi-Codebook Diffusion Large Language Model", שלושה קומיטים, וסקריפטי ההסקה לפי משימה שהם כל הפרסום הציבורי עד כה.
טבלת אמות המידה בעמוד הפרויקט מתויגת על ידי המעבדה עצמה כ"תוצאות מקדמיות וחלקיות", והמספרים שמופיעים שם פועלים לשני הכיוונים: נתוני תרשימים ומסמכים חזקים (ChartQA 86.52, CharXiv-DQ 83.65, לפי דיווח הספק) יושבים לצד GenEval של 0.81, שנמצא בפיגור אחרי ה-0.89 של לפחות מודל אחד שהמעבדה טוענת שהיא עולה עליו. אין הערכה בלתי תלויה, כי אין מודל להערכה. כל מה שנוגע לאיכות בפועל נותר בגדר טענה עד שקבצי safetensors יופיעו באותו stub ריק של Hugging Face.
מה עושה שכבת ניתוב כאשר קיים רק צד אחד
זו אחת מאותן השוואות שבהן זווית הניתוב היא באמת עניין של זמן, לא של בחירה. לא נעמיד פנים ש-OrcaRouter משרת את InternLumina-U2 — איש לא יכול, המשקלים לא שוחררו — וגם Gemini Omni 1.1 Flash אינו בקטלוג שלנו; מגיעים אליו דרך ה-API של גוגל עצמה. מה ששכבת ניתוב נועדה לעשות בפער הזה הוא לשמור על האפשרויות שלך פתוחות בלי לבנות מחדש את הצינור פעמיים. מודל ה-pass-through הוא המנגנון: כשמודל מתארח של ספק אכן נכנס לקטלוג, מחיר המחירון של הספק מועבר במרווח 0%, כך שהתעריף לשנייה שהספק מפרסם הוא התעריף לשנייה שאתה משלם דרך מפתח אחד במקום חוזה מול כל ספק בנפרד. וכששחרור משקלים ברישיון Apache-2.0 כמו InternLumina-U2 סוף סוף מגיע, הצעד הרציונלי הוא לא לעקור את סטאק הווידאו העובד שלך — אלא להקים את המודל החדש על נתיב בדיקה מאחורי failover אוטומטי, כך שבפעם הראשונה שמודל הדיפוזיה הלא-מוכח מתנהג לא כראוי, הקריאה חוזרת למודל שכבר סומכים עליו בלי לשנות שורת קוד. נסה את הדבר החדש במקום שבו הוא לא יכול להזיק לך; נתב את הדבר שמשלם את החשבונות.
פסק הדין
אם אתם צריכים וידאו החודש, ההחלטה כבר התקבלה עבורכם: Gemini Omni 1.1 Flash הוא אמיתי, מתומחר וזמין לציבור הרחב, בעוד שאיש אינו יכול לקרוא ל-InternLumina-U2. אם אתם עוקבים אחר כיוון המחקר הפתוח במולטי־מודאליות, InternLumina-U2 הוא הארטיפקט המעניין יותר — הימור נדיר של מעבדה גדולה על גישה דיסקרטית לחלוטין עם codebooks מרובים, ברישיון Apache-2.0, כשהארכיטקטורה כבר פתוחה לציבור והמשקלים כנראה לא יאחרו לבוא. התייחסו למאגר כאל תצוגה מקדימה של כיוון מחקרי, התייחסו למודל הווידאו שהושק ב-GA כאל כלי שאפשר לבנות עליו כבר היום, ואל תתנו לתווית "המולטי־מודאלי" המשותפת לשכנע אתכם שהם מתחרים על אותה משימה.
