כרטיס הירו שנוצר שכותרתו 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash' תחת הכיתוב העליון 'ראש בראש - שתי עבודות שונות', עם כתובית המשנה 'אחד קורא שעה של צילום. האחר מייצר ארבעים שניות ממנו.' וארבעה צ'יפים: 'חפיפה: הבנת וידאו', 'קלט: אודיו + וידאו לעומת פרומפט', 'פלט: טקסט לעומת וידאו', 'ניתן לנתב כאן: אף אחד מהם'. הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Qwen3.8-Omni-Flash לעומת Gemini Omni 1.1 Flash: האחד צופה בסרטון, האחר יוצר אותו

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

תשובה קצרה: השניים האלה אינם תחליפים זה לזה, וההשוואה ביניהם הופכת הגיונית רק כשמפסיקים להתייחס ל"אומני" כאל קטגוריה. Qwen3.8-Omni-Flash, שאותו פתח הספק ללקוחות API ב-18 בספטמבר 2026, קולט טקסט, תמונה, אודיו ווידאו ומחזיר טקסט — זהו מודל לקרוא שעה של פגישה או צילומים ולספר לך מה קרה. Gemini Omni 1.1 Flash, שהספק הוציא לאור ב-27 באוגוסט 2026, מקבל הנחיית טקסט או תמונה ומחזיר וידאו עם אודיו מסונכרן — זהו מודל ליצירת הצילומים. האחד צורך מדיה, האחר מייצר אותה. אם הצינור שלך צריך את שניהם, אתה צריך את שניהם, והשאלה הכנה היא לא מי מנצח אלא ממי בעצם חסר לך.

אף אחד מהמודלים אינו בעל משקולות פתוחות, אף אחד מהם אינו ניתן לניתוב דרך OrcaRouter, ושניהם מתומחרים על צירים שאינם ניתנים להמרה זה לזה — טוקנים בצד אחד, שניות של וידאו שנוצר בצד השני. המקום שבו הם באמת חופפים צר יותר מכפי שמרמז המסגור "omni vs omni", וכדאי לקבוע את החפיפה הזו לפני האריתמטיקה של המחיר, כי האריתמטיקה של המחיר היא המקום שבו השניים מושווים שלא כהלכה לרוב.

הטעות הקטגוריאלית שכדאי להבהיר קודם כל

חומרי ההשקה של אליבאבא משווים את Qwen3.8-Omni-Flash מול Gemini 3.8 Flash, ומידע רב מהסיקור שלאחר מכן כיווץ זאת ל"מנצח את Gemini". זהו דגם שונה של Google מ-Gemini Omni 1.1 Flash, והשניים אינם נקודות ייחוס הניתנות להחלפה: Gemini 3.8 Flash הוא הדגם הרב-מודלי למטרות כלליות, ו-Gemini Omni 1.1 Flash הוא דגם יצירת הווידאו עם מחירון נפרד ומשטח API נפרד. כל מספר של Qwen מול Gemini שמסתובב מההשקה — WildClawBench-MM 71.0 מול 58.9, SpotSoundBench 67.2 מול 39.7, AgenticVBench 36.8 מול 45.0 — הוא מול Gemini 3.8 Flash, לא מול דגם הווידאו Omni, ובכל מקרה, שום דבר מזה אינו בלתי תלוי. אם הגעתם לכאן עם לוח תוצאות שמציב את שני הדגמים במאמר הזה על אותו ציר, סביר להניח שזהו הדגם הלא נכון של Google בעמודה הימנית.

מה כל אחד מהם עושה בפועל

• מה הוא מקבל כקלט — Qwen3.8-Omni-Flash מקבל טקסט, תמונה, אודיו ווידאו, כולל אודיו סטריאו ואודיו מרחבי עם ארבעה ערוצים; Gemini Omni 1.1 Flash מקבל פרומפטים של טקסט ותמונה וכן עד שלוש שניות של וידאו ייחוס.

• מה זה מחזיר — Qwen3.8-Omni-Flash מחזיר טקסט בלבד; Gemini Omni 1.1 Flash מחזיר וידאו עם אודיו מסונכרן באופן מובנה, בסצנות הניתנות להארכה עד 40 שניות בצעדים של עשר שניות.

• משטח שליטה — Qwen3.8-Omni-Flash חושף הקשר, דגימה ומצב סוכני שמחליט בעצמו מה לבחון; Gemini Omni 1.1 Flash חושף שליטה בפריים הראשון ובפריים האחרון, מבט לאחור של עשר שניות לשם רציפות, ושכבת טיוטה ברזולוציית 360p שGoogle מתארת כעלות של כשליש בערך ומהירה בכ-60% בקירוב.

• רזולוציה וגימור — ל-Qwen3.8-Omni-Flash אין רזולוציית פלט מכיוון שהוא אינו מייצר מדיה; Gemini Omni 1.1 Flash מפיק פלט ב-720p, 1080p ו-4K.

• הקשר ומשך — Qwen3.8-Omni-Flash מכיל מיליון טוקנים ועד שעה של אודיו-וידאו רציף בקריאה אחת; Gemini Omni 1.1 Flash מוגבל על ידי הקליפ שהוא מייצר, לא על ידי חלון קלט.

• איך אתם משלמים — Qwen3.8-Omni-Flash מחויב לפי טוקן: $0.15 למיליון קלט, $0.016 שמור במטמון, $0.47 פלט במחירון הבינלאומי; Gemini Omni 1.1 Flash מחויב לפי שנייה של וידאו שנוצר, כשהתעריף המפורסם של Google הוא $0.10 לשנייה באיכות 720p.

• פתיחות — סגורה משני הצדדים. אין משקלים לאף אחד מהמודלים, ואף אחד מהם לא זמין לניתוב דרך ה-API שלנו היום.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Input: text, image, audio, video', 'Output: text only', 'Context: 1M tokens', 'Max media: 1 hour per call', 'Billing: per token', 'Price: $0.15 / $0.47 per M'; right column Gemini Omni 1.1 Flash: 'Input: text and image prompts', 'Output: video with audio', 'Context: clip-bound', 'Max media: 40s scenes', 'Billing: per second', 'Price: $0.10 per second at 720p'. The footer reads 'Qwen figures vendor-reported; Google rates per its published list.' The OrcaRouter logo is composited in the bottom-right corner.

החפיפה היא הבנת וידאו, והיא א-סימטרית

המקום היחיד שבו קונה יכול באופן סביר להעמיד אותם זה לצד זה הוא צינור עיבוד שחייב גם להבין חומרי וידאו וגם להפיק אותם — למשל, עוזר עריכה שקורא הקלטה ארוכה, מוצא את הרגעים שראויים להישמר, ומייצר קטע ערוך. בצד ההבנה, Qwen3.8-Omni-Flash נבנה בדיוק לשם כך: שעה של אודיו ווידאו רצופים בכל קריאה, הפרדת דוברים, ומצב סוכני שמעלה את הדיוק ב-OmniVideoBench של הספק מ-63.4 ל-67.8 תוך הקטנת מספר הטוקנים לשאילתה מ-145,736 ל-79,117. בצד ההפקה, Gemini Omni 1.1 Flash הוא זה שיכול להפיק את הקליפ המתקבל עם אודיו מסונכרן, והמודל של Qwen לא יכול להפיק אפילו פריים אחד של ווידאו.

חוסר הסימטריה פועל גם בכיוון ההפוך, וקל יותר להחמיץ אותו. האחיזה של מודל ליצירת וידאו בהבנה היא אינסטרומנטלית — הוא זקוק לדי מסצנה כדי לשמור על עקביות השוט לאורך הארכה של עשר שניות, וזו דרישה שונה ממענה לשאלה על מה שנאמר בשעה השלישית של פגישה. למודל של Google יש רקורד ארוך יותר באיכות היצירה וקצר יותר בניתוח תוכן ארוך; ולמודל של Alibaba יש ההפך. אם המשימה שלך היא "למצוא את שלוש הדקות החשובות בהקלטה הזאת", מודל היצירה אינו הכלי. אם המשימה שלך היא "להפיק סרטון של שלושים שניות שתואם את הבריף הזה", גם מודל ההבנה אינו הכלי.

למה השוואת המחירים כל הזמן משתבשת

תעריף לפי שנייה ותעריף לפי טוקן אינם ניתנים להמרה, והניסיון להמיר ביניהם מייצר את שתי הטעויות ששולטות בהשוואה הזאת. הראשונה היא להשוות קליפ שלם שנוצר מול תעריף קלט לפי טוקן ולהסיק שמודל הווידאו יקר פי מאות מונים — וזה נכון וחסר משמעות, מפני שהם לא מוכרים את אותו הדבר. השנייה היא להשוות רק מחירי קלט ולהחמיץ את העובדה שהקיצוץ של 98% באודיו של Alibaba חל על שעות אודיו בקלט, בעוד שהתעריף של Google חל על שניות וידאו בפלט, כך ששני ה"קיצוצים" אפילו לא נמצאים באותו צד של המונה.

מה שאפשר לומר בכנות הוא זה. לפי המתודולוגיה של עליבאבא עצמה — דגימה של שתי דקות מוכפלת בשלושים, וידאו באיכות 720p ופריים אחד לשנייה — שעה של קלט אודיו ווידאו משולב אל Qwen3.8-Omni-Flash מתומחרת בכ-0.20 דולר, לעומת 3.27 דולר בדור הקודם. יצירת ארבעים שניות של וידאו ב-720p עם Gemini Omni 1.1 Flash במחיר המפורסם של גוגל של 0.10 דולר לשנייה עולה 4.00 דולר, וטיוטה של אותן ארבעים שניות ב-360p מתקרבת ל-1.20 דולר לפי התמחור של גוגל של שליש מהעלות. שתי קבוצות המספרים מדווחות על ידי הספקים ואף אחת מהן לא שוחזרה באופן בלתי תלוי. המסקנה השימושית אינה איזה מספר קטן יותר, אלא שניתוח של שעה של צילום ויצירת ארבעים שניות ממנו נמצאים באותו סדר גודל — וזו הסיבה האמיתית לכך שצינור ייצור שעושה את שניהם זקוק למודל עלויות, לא למנצח.

זו גם הטענה בעד השארת השניים במפתח אחד ולא בשני חוזים. אף מודל Omni אינו ניתן לניתוב דרך OrcaRouter היום: Qwen3.8-Omni-Flash פועל רק בפלטפורמות הבלעדיות של Alibaba, ו-Google לא פתחה את ה-API של Omni video לניתוב צד שלישי, כך שאיננו מארחים אף אחד מהם ולא נעמיד פנים שכן. מה שזמין בקטלוג שלנו הוא האח של כל משפחה — Qwen3.8-Flash ו-Gemini 3.8 Flash — שניהם ניתנים לקריאה היום דרך נקודת קצה אחת במחיר המחירון של הספק עם 0% תוספת, מה שהופך השוואת A/B מול המספרים של כל אחד מהספקים עצמם לעניין של שינוי קונפיגורציה ולא של אינטגרציה שנייה.

A headless screenshot of the OrcaRouter model page for Gemini 3.8 Flash at www.orcarouter.ai/models/google/gemini-3.8-flash, showing the model header, the input-modality and capability row (text, image, video, audio, tools, JSON, reasoning), the published pricing and the p50 TTFT figure.

איפה כל אחד מנצח, בפשטות

Qwen3.8-Omni-Flash מנצח בכל דבר שנמדד בשעות של קלט: תמלול פגישות והפרדת דוברים, סיכום הקלטות ארוכות, שימוש עתיר-אודיו בכלי סוכן, ועלות לשעת מדיה מעובדת. תוצאות האודיו המדווחות על ידי הספק שלו חזקות, והחולשה שלו היא בתחום שאליו המודל מעולם לא כוון — לוחות עתירי ההיסק, שבהם ההרצות הראשונות של צד שלישי הציבו אותו באחוזון ה-28 בהיסק, עם נתון מהירות באחוזון ה-21, על מדגם קטן מספיק כדי שיש להתייחס למספרים כאל קריאה לבדיקה ולא כפסק דין.

Gemini Omni 1.1 Flash מנצח בפלט: יצירת שוטים עם אודיו מסונכרן, המשכיות לאורך סצנות ארוכות, שליטה ברמת הפריים, וגימור 4K שצינור אספקה עשוי פשוט לחייב. היתרון שלו אינו ציון בנצ'מרק — אלא שהמודל האחר פשוט אינו יכול לבצע את העבודה כלל. במקום שבו הוא חלש יותר נמצא כל דבר שמצריך להחזיק שעה של הקשר, מפני שהוא לא בנוי לכך.

ההחלטה, והדבר שכדאי לשים לב אליו

אם אתם בוחרים בין השניים, השאלה היא איזה חצי מהצינור אינו מכוסה. צוות שכבר מייצר וידאו וצריך להבין הקלטות ארוכות צריך לבדוק Qwen3.8-Omni-Flash על האודיו שלו השבוע; צוות שמנתח מדיה וצריך להפיק אותה צריך לבדוק Gemini Omni 1.1 Flash. צוות שצריך את שניהם מתמודד עם שני ספקים, שני מודלי חיוב ושתי אינטגרציות, וזה המצב שבו שכבת ניתוב אחת מפסיקה להיות נוחה והופכת להיות הדבר ששומר על מודל העלויות קריא.

שני דברים היו משנים את הקריאה הזו. הערכה עצמאית של Qwen3.8-Omni-Flash תחליף כל מספר ספק שלמעלה במספר בר-השוואה — עדיין אין כזה, והיעדרו הוא הפער הבודד הגדול ביותר בהשוואה הזו. ותעריף מפורסם עבור פלט 1080p ו-4K של Google יאפשר לבדוק את האריתמטיקה של הקצה הגבוה; כיום הנתונים האלה מסתובבים רק כהערכות שוק ולא כרשימה של Google עצמה.

A headless screenshot of Google's Gemini API documentation page for Gemini Omni Flash at ai.google.dev/gemini-api/docs/omni, showing the docs navigation, the model identifier gemini-omni-1.1-flash, and the description of its native multimodality and conversational editing.

הערת סיום אחת בנושא מסגור. "Omni" כבר לא אומר שום דבר מדויק — כיום הוא מכסה גם מודל שקורא שעה של אודיו מפגישה וגם מודל שמרנדר קליפ בן ארבעים שניות עם סאונד, וההתייחסות למילה כקטגוריה היא הדרך שבה רוכשים מגיעים להשוות תעריף לפי טוקן לתעריף לפי שנייה ולהסיק ממנה מסקנה. המודלים משלימים זה את זה עם חפיפה צרה, והעמדה הנכונה כלפי שניהם, חמישה ימים וארבעה שבועות לאחר ההשקות של כל אחד מהם בהתאמה, היא אותה עמדה: למדוד אותם על החומר שלכם, ולהשאיר נתיב שני פתוח.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית