כרטיס כותרת ראשי להשוואה "InternLumina-U2 vs Gemini Omni 1.1 Flash" עם כותרת המשנה "המודל שעוד לא ניתן להריץ לעומת זה שמשלמים עליו לשנייה" ושלושה צ'יפים של נתונים — "InternLumina-U2: קוד בלבד, המשקלים יגיעו בקרוב", "Gemini Omni 1.1 Flash: GA, 27 באוגוסט 2026", "$0.03–$0.30 לשניית וידאו" — ועם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

InternLumina-U2 לעומת Gemini Omni 1.1 Flash: המודל שעוד לא ניתן להריץ לעומת זה שמשלמים עליו לפי שנייה

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אם המועד שלך הוא השבוע, יש להשוואה הזאת תשובה בת משפט אחד. Gemini Omni 1.1 Flash הוא מודל יצירת הווידאו הזמין בדרך כלל של Google — קוראים לו דרך API, הוא מחזיר קליפ עם אודיו מסונכרן, ומשלמים על כל שניית פלט. InternLumina-U2 הוא מודל מחקר שפורסם בשקט על ידי Shanghai AI Laboratory תחת רישיון Apache-2.0 — אפשר להוריד את קוד ההסקה שלו, אבל לא את המשקלים, שהמעבדה עדיין מסמנת כ"בקרוב". האחד הוא מוצר שאפשר לקנות כבר עכשיו; השני הוא הימור בצורת מאמר שאי אפשר להריץ אותו כלל. השאלה המעניינת היא למה מישהו בכלל ישים אותם באותו משפט מלכתחילה, ומה כל אחד מהם אומר לך על הכיוון שבו עבודה מולטימודלית פתוחה הולכת בסוף 2026.

הכל להלן מסומן לפי מקור. הפרטים של InternLumina-U2 מגיעים ממאגר ה-GitHub ומדף הפרויקט שהמעבדה פרסמה ב-1 בספטמבר 2026 — באותו היום שבו הופיע ה-stub הריק של Hugging Face — וכל אחת מטבלאות הביצועים שלו היא דיווח של הספק, ראשונית ולא אומתה על ידי אחרים. הפרטים של Gemini Omni 1.1 Flash מגיעים מחומרי ההשקה של גוגל עצמה ומדף התמחור של המודל שהופץ לזמינות כללית ב-27 באוגוסט 2026.

שתי תשובות לאותה שאלה "רב-מודאלית"

שני המודלים נכללים תחת הכותרת הרופפת "מודל אחד, מודאליות רבות" — והתווית המשותפת הזו היא הסיבה היחידה שמשווים ביניהם. מתחת לתווית אין להם כמעט דבר במשותף. Gemini Omni 1.1 Flash הוא שירות יצירה סגור ומתארח, ששם את הווידאו בראש סדר העדיפויות: מאכילים אותו בטקסט, בתמונה, בקליפ ייחוס קצר או באודיו, והוא מפיק עד עשר שניות של וידאו ב-720p עם דיבור, מוזיקה ואפקטים קוליים מובנים, עם אפשרות הרחבה במרווחים של עשר שניות עד לכדי סצנה של ארבעים שניות. הוא מתבסס על הקליפ שכבר יש לכם — מעבר ההרחבה בודק כעת עד עשר שניות של הקשר קודם, במקום שנייה אחת כבעבר — ותומך בשליטה בפריים הראשון/האחרון, כך שתוכלו לנעול את תחילת השוט וסופו ולתת למודל למלא את האמצע. זהו כלי ליצירת תמונות נעות, שמתומחר לשנייה.

InternLumina-U2 הוא הימור בכיוון ההפוך: מודל sparse mixture-of-experts יחיד, עם סך של 16B פרמטרים מתוכם 1B פעילים, שטוען שהוא מבין תמונות, וידאו ונכסי תלת־ממד, ומייצר ועורך תמונות דרך ממשק אסימונים בדיד משותף אחד. הצד הוויזואלי שלו הוא בדיד לחלוטין — שמונה ספרי קוד משלימים מטוקנייזר שהמעבדה מכנה AToken, כך שכל מיקום ויזואלי מתואר באמצעות שמונה קודים במקום אחד — והצד הלשוני שלו הוא עמוד שדרה של דיפוזיה שהמעבדה מאריכה מ־LLaDA-2.0. הטענה היא שהבנה ויצירה צריכות לחזק זו את זו במערכת משקלים אחת, במקום להיות תפורות יחד ממודלים מתמחים. האם זה עובד — כרגע אין לכך תשובה: המודל אינו בר־הרצה בשום מקום, מכיוון שהמשקלים אינם קיימים בפומבי.

לוח התוצאות, כפי שהוא

לוח התוצאות ההוגן לזוג הזה חייב לשאת מידע על המקור בכל שורה, שכן עמודה אחת היא מוצר ששווק עם מחירים גלויים, ואילו השנייה היא טענת מחקר שלא פורסמה ואין לה מחיר כלל.

• מה זה — Gemini Omni 1.1 Flash: מודל מתארח ליצירה ועריכת וידאו (מזהה מודל: gemini-omni-1.1-flash), זמינות כללית ב־27 באוגוסט 2026. InternLumina-U2: מודל LLM מבוסס דיפוזיה במדע פתוח להבנה חזותית מקיפה, יצירת ועריכת תמונות, הקוד שוחרר ב־1 בספטמבר 2026.

• משקלים — Gemini Omni 1.1 Flash: אין, סגורים וזמינים רק לענן. InternLumina-U2: גם עדיין אין, אך ברישיון Apache-2.0 ומסומן במפורש כ"בקרוב".

• הפלט שתקבל — Gemini Omni 1.1 Flash: קליפים של 10 שניות ב-720p עם אודיו, הניתנים להארכה עד 40 שניות; הגדלת רזולוציה ל-1080p ו-4K; וטקסט לצד הקליפים. InternLumina-U2: עדיין כלום — קוד הסקה ומפת דרכים.

• מה הוא מקבל — Gemini Omni 1.1 Flash: טקסט, תמונה, וידאו (עד ~131K אסימוני קלט; שלושה קטעים בני 10 שניות לכל בקשה), שמע. InternLumina-U2: מתיימר לתמוך בטקסט, תמונות טבעיות, תרשימים צפופים, וידאו על פני 64 פריימים שנדגמו, ובנכסי תלת־ממד בפורמט GLB/GLTF המעובדים ל־64 תצוגות של צבע ועומק.

איך מריצים את זה — Gemini Omni 1.1 Flash: ממשק ה-Gemini API של Google דרך ה-Interactions API (stateful); גישת צרכנים דרך Google Flow למנויי AI Plus, Pro ו-Ultra. InternLumina-U2: אירוח עצמי בלבד, ורק לאחר שהמשקלים יורדים; הקוד מצפה לספריית checkpoint מפוצלת, למשקלי הטוקנייזר AToken, ל-FlashAttention, ול-Blender 4.5 עבור מסלול התלת-ממד.

• מה זה עולה — Gemini Omni 1.1 Flash: $0.03 לשנייה ב־360p draft, $0.10 לשנייה ב־720p, $0.15 לשנייה ב־1080p, $0.30 לשנייה ב־4K, עם תעריף אסימונים של $1.50 למיליון קלט ו־$9.00 למיליון פלט טקסט. InternLumina-U2: מה שה-GPUs שלך עולים, ברגע שזה קיים.

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

שתי העמודות אינן מודדות את אותו ציר. הצד של Gemini מתומחר, מוגש ושימושי מיידית; הצד של InternLumina הוא מפרט של מודל שעדיין אינו מודל.

החלק שהוא למעשה עדכני: ה-GA של Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash משמעותי השבוע בזכות עצמו, משום שזה הרגע שבו קו הווידאו האומני של גוגל הפסיק להיות תצוגה מקדימה. נקודת הקצה של התצוגה המקדימה הקודמת של Gemini Omni Flash מתוכננת להיכבות ב-30 בספטמבר 2026, ומודל ה-GA הזה הוא התחליף שאליו מעבירים את המפתחים. רשימת השדרוגים קונקרטית: הארכת סצנה לארבעים שניות מתוספות של עשר שניות; שליטה בפריימי מפתח שמאפשרת לציין פריים ראשון ואחרון ולגרום למודל לייצר את הקטע המקשר; קטעי ייחוס באורך עד שלוש שניות כדי לשמור על דמות או תפאורה עקבית; ושכבת טיוטה ב-360p במחיר של שליש מ-720p שפועלת עד 60% מהר יותר לצורך איטרציות על פרומפטים לפני העיבוד הסופי היקר. אם אתם בונים צינורות וידאו, טבלת המחירים – $0.10 לשנייה של 720p, $1.01 לקליפ בן עשר שניות, כ-$4 לסצנה של ארבעים שניות ב-720p הבנויה מארבע קריאות הרחבה – היא המספר שמשנה את מודל העלויות שלכם.

שום דבר מזה לא הופך אותה למתחרה של InternLumina-U2 בשום מובן תפעולי. Gemini Omni 1.1 Flash יוצר תנועה; InternLumina-U2, אם טענותיה ישרדו מגע עם המשקלים, תבין תנועה ותפיק סטילס. צוות שצריך וידאו מוצר ברבעון הזה לא בוחר בין השתיים — מודל Gemini הוא היחיד מבין השניים שאפשר בכלל לקרוא לו, והוא זמין דרך ה-API של גוגל עצמה וכמה פלטפורמות של צד שלישי.

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

תיעוד 'Models' של Gemini API באתר המפתחים של Google, שנלכד ב-2 בספטמבר 2026 — העמוד המפרט את משפחת Gemini הנוכחית, עם סדרת Gemini Omni בניווט הצדדי.

החלק שאינו עדכני כלל: InternLumina-U2

ההשקה של InternLumina-U2 ב-1 בספטמבר הייתה מהסוג השקט ביותר: שלושה קומיטים למאגר GitHub, דף פרויקט, קובץ stub בן 28 בתים ב-Hugging Face שכל תוכנו הוא כותרת רישיון Apache-2.0, וללא הכרזה. מה שבאמת ציבורי הוא תשתית ההסקה (inference harness) והארכיטקטורה, והם ראויים לקריאה מדוקדקת דווקא משום שאיש לא הצליח עד כה לבחון את המודל עצמו. המאגר מציג דרייבר עם נקודת כניסה אחת לכל משימה — טקסט, יצירת תמונה מטקסט ברזולוציה של עד 1024×1024, הבנת תמונות על פני תמונות טבעיות ותרשימים צפופים, עריכת תמונה מבוססת הוראות עם מצב dual-CFG אופציונלי, הבנת וידאו על פני 64 פריימים מדוגמים, והבנת תלת־ממד על פני תצוגות GLB/GLTF המעובדות ב-Blender. ההימור העיצובי הוא שאוצר מילים ויזואלי בדיד רב-קוד (multi-codebook) מאפשר לשלד יחיד (backbone) לבצע את כל זה מבלי לנפח את אורך הרצף — אותו אינסטינקט ש"טוקנים ויזואליים צריכים לשאת יותר מידע" שמניע מודלי וידאו ילידיים-קודק, שמיושם כאן לממשק אחיד של הבנה ויצירה.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

מאגר ה-GitHub של InternLM/InternLumina-U2, שצולם ב-2 בספטמבר 2026 — דף הנחיתה של המאגר ברישיון Apache-2.0 עם התיאור "Multi-Codebook Diffusion Large Language Model", שלושה קומיטים, וסקריפטי ההסקה לפי משימה שהם כל הפרסום הציבורי עד כה.

טבלת אמות המידה בעמוד הפרויקט מתויגת על ידי המעבדה עצמה כ"תוצאות מקדמיות וחלקיות", והמספרים שמופיעים שם פועלים לשני הכיוונים: נתוני תרשימים ומסמכים חזקים (ChartQA 86.52, CharXiv-DQ 83.65, לפי דיווח הספק) יושבים לצד GenEval של 0.81, שנמצא בפיגור אחרי ה-0.89 של לפחות מודל אחד שהמעבדה טוענת שהיא עולה עליו. אין הערכה בלתי תלויה, כי אין מודל להערכה. כל מה שנוגע לאיכות בפועל נותר בגדר טענה עד שקבצי safetensors יופיעו באותו stub ריק של Hugging Face.

מה עושה שכבת ניתוב כאשר קיים רק צד אחד

זו אחת מאותן השוואות שבהן זווית הניתוב היא באמת עניין של זמן, לא של בחירה. לא נעמיד פנים ש-OrcaRouter משרת את InternLumina-U2 — איש לא יכול, המשקלים לא שוחררו — וגם Gemini Omni 1.1 Flash אינו בקטלוג שלנו; מגיעים אליו דרך ה-API של גוגל עצמה. מה ששכבת ניתוב נועדה לעשות בפער הזה הוא לשמור על האפשרויות שלך פתוחות בלי לבנות מחדש את הצינור פעמיים. מודל ה-pass-through הוא המנגנון: כשמודל מתארח של ספק אכן נכנס לקטלוג, מחיר המחירון של הספק מועבר במרווח 0%, כך שהתעריף לשנייה שהספק מפרסם הוא התעריף לשנייה שאתה משלם דרך מפתח אחד במקום חוזה מול כל ספק בנפרד. וכששחרור משקלים ברישיון Apache-2.0 כמו InternLumina-U2 סוף סוף מגיע, הצעד הרציונלי הוא לא לעקור את סטאק הווידאו העובד שלך — אלא להקים את המודל החדש על נתיב בדיקה מאחורי failover אוטומטי, כך שבפעם הראשונה שמודל הדיפוזיה הלא-מוכח מתנהג לא כראוי, הקריאה חוזרת למודל שכבר סומכים עליו בלי לשנות שורת קוד. נסה את הדבר החדש במקום שבו הוא לא יכול להזיק לך; נתב את הדבר שמשלם את החשבונות.

פסק הדין

אם אתם צריכים וידאו החודש, ההחלטה כבר התקבלה עבורכם: Gemini Omni 1.1 Flash הוא אמיתי, מתומחר וזמין לציבור הרחב, בעוד שאיש אינו יכול לקרוא ל-InternLumina-U2. אם אתם עוקבים אחר כיוון המחקר הפתוח במולטי־מודאליות, InternLumina-U2 הוא הארטיפקט המעניין יותר — הימור נדיר של מעבדה גדולה על גישה דיסקרטית לחלוטין עם codebooks מרובים, ברישיון Apache-2.0, כשהארכיטקטורה כבר פתוחה לציבור והמשקלים כנראה לא יאחרו לבוא. התייחסו למאגר כאל תצוגה מקדימה של כיוון מחקרי, התייחסו למודל הווידאו שהושק ב-GA כאל כלי שאפשר לבנות עליו כבר היום, ואל תתנו לתווית "המולטי־מודאלי" המשותפת לשכנע אתכם שהם מתחרים על אותה משימה.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube