כרטיס כותרת הירו שנוצר עבור Qwen3.8-Omni-Flash עם הכיתוב 'דלת אחת, ללא משקולות', עם כותרת המשנה 'למודל יש מארח יחיד, ללא משקולות פתוחות, וציוניו הראשונים שאינם מהספק דלים' וארבעה צ'יפים: 'פועל על: Alibaba בלבד', 'משקולות: לא שוחררו', 'ציונים בלתי תלויים: אין', 'הקשר: 1M אסימונים'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Qwen3.8-Omni-Flash חמישה ימים אחרי: דלת אחת, ללא משקולות, והציונים הראשונים שאינם של אליבאבא

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

חמישה ימים לאחר שהספק פתח את Qwen3.8-Omni-Flash ללקוחות API, למודל עדיין יש בית אחד בדיוק. הוא פועל בפלטפורמת Qianwen של הספק ובשירות הענן Bailian שלו; הרשומות של צד שלישי שהופיעו מאז ההשקה הן פרוקסי מול אותן נקודות קצה, לא מקום שני שבו המודל חי. לא שוחררו משקלות. נתוני יום ההשקה — קיצוץ של 98% בעלות של שעת אודיו, עלייה ממוצעת של 26% לעומת Qwen3.5-Omni-Plus, מיליון טוקנים של הקשר, פלט טקסט בלבד — נותרו של הספק עצמו ולא שוחזרו. מה שבאמת השתנה בחמישה ימים זה לא המודל אלא הקרקע סביבו: שכבה דקה של ציונים מצד שלישי הופיעה, תמיכת מסגרות נחתה ביום אפס, וההשוואה שכולם שואפים אליה היא מול Gemini 3.8 Flash ולא מול Qwen3.8-Flash שאיתו המודל הזה נבנה. כל אחד מאלה ראוי למבט מקרוב יותר ממה שסיקור ההשקה נתן לו.

הדלת היא דלת טובה, והיא היחידה

הזמינות התרחבה מבלי להפוך לריבוי. המודל עונה לבקשה בתצורת OpenAI כפי שהיא, מה שאומר שקוד לקוח קיים עובד ברובו; הדבר שנשבר הוא נקודת הקצה, מפני שהמארחים הבינלאומיים והסיניים היבשתיים הם שירותים נפרדים עם חיוב נפרד. קוד שמכוון לברירת המחדל ייכשל או שיחויב במטבע שגוי, וסיפור התמחור לפי שעה תקף רק בצד הבינלאומי. ספריות לקוח בקוד פתוח סיפקו תמיכת יום-אפס במודל, דבר שהוא שימושי באמת וגם אינו ספק שני: ספרייה שמדברת עם Bailian היא מעטפת נוחות סביב אותו מקור אספקה יחיד.

זהו הסיכון המבני שראוי לתת לו שם. למודל המבוסס על מקור יחיד אין נתיב גיבוי. אם נקודת הקצה מטילה מגבלת קצב, נחלשת, או שאזור שלם מפסיק להגיב, אין לאן לפנות, ושום מידת תמיכה בספריות לקוח לא תשנה זאת. זו גם הסיבה שאנו מצהירים על עמדתנו במפורש במקום לרמוז אחרת: Qwen3.8-Omni-Flash אינו בקטלוג שלנו. איננו מארחים אותו, וקורא שיירשם בציפייה לנתב אותו יקבל רושם מוטעה. מה שכן ניתן לנתב הוא שאר המשפחה — Qwen3.8-Flash וQwen3.8-Max שניהם זמינים ב-ה-API שלנו — וב-OrcaRouter מחיר המחירון של הספק מועבר הלאה בתוספת 0%, כך שכאשר התמחור של ה-omni של Alibaba משתנה, או ביום שבו מודל ה-omni יהפוך לזמין לניתוב, השינוי מגיע ללקוחות באותו היום במקום בחידוש החוזה הבא.

A generated single-model spec card for Qwen3.8-Omni-Flash with six rows reading 'Released: 18 Sep 2026', 'Context: 1M tokens', 'Media per call: up to 1 hour', 'Output: text only', 'Price: $0.15 in / $0.47 out per M', 'Independent score: none yet', and the footer 'Vendor-reported; no independent evaluation exists.' The OrcaRouter logo is composited in the bottom-right corner.

הציונים הראשונים שאינם של אליבאבא דלים, והם אינם מחמיאים

אין שום דבר ב-Artificial Analysis עבור המודל הזה, והיעדרות זו היא הכותרת הכנה ביום החמישי: ללוחות הדירוג שכולם מצטטים עבור מודלים סמוכים עדיין אין שורה עבור דגם ה-Omni. את הפער מילא משהו אחר. פלטפורמת הערכה של צד שלישי החלה לפרסם ריצות מול המודל, והתקציר שלה שווה קריאה בדיוק בגלל כמות הדברים שהוא אינו אומר. הוא מדווח על סיווג דואר אלקטרוני בדיוק של 99.0% (אחוזון 86), אתיקה ב-95.0% (אחוזון 23), והסקה ב-56.0%, שאותו הוא ממקם באחוזון ה-28 ומכנה חולשה בולטת; מהירות ממוקמת באחוזון ה-21, עלות באחוזון ה-58, עם שיעור הצלחה כולל של 89%.

התייחסו אליהם בזהירות אמיתית, ולא רק משום שהמדגם קטן. אותו עמוד מתארך את שחרור המודל ל-20 בספטמבר, יומיים אחרי שאליבאבא השיקה אותו, אינו נותן תאריכי הרצה לאף אחת מהתוצאות, ומציג טבלת בנצ׳מרק ריקה מתחת לתקציר שמתאר מספרים שהטבלה אינה מכילה. זהו הפרופיל של מערכת הרצה מוקדמת ובעלת פיקוח קליל ולא של הערכה מדודה, והקריאה הכנה היא שאלו נקודות הנתונים הראשונות שאינן של הספק, ולא הראשונות המהימנות. הן סיבה לבדוק את המודל בעצמכם, לא סיבה להסיק דבר. הכיוון, עם זאת, עולה בקנה אחד עם מה שחומרי הספק עצמו מרמזים באמצעות השמטה: זהו מודל תפיסה ומדיה ארוכה, ולוחות עתירי החשיבה אינם היעד שלו.

יש גם מלכודת בתוצאות החיפוש שתתפוס אנשים בשבועות הקרובים. Qwen 3.8, מודל הטקסט, נושא את Artificial Analysis Intelligence Index בטווח הארבעים, והמספר הזה צוטט ביותר מסיכום אחד כאילו תיאר את מודל ה-omni. זה לא נכון. אלה מודלים שונים עם תפקידים שונים, ולמודל ה-omni אין עדיין מדד כלל.

A headless screenshot of Alibaba's own Qwen site (qwen.ai) showing the Qwen3.8-Omni-Flash 'Conducting Deep Research with Audio and Video' demo page, with the model workflow panel, the timeline of a 40-minute video, and the English UI navigation.

טבלת הבנצ'מרק היא עדיין ספק אחד שמשווה את עצמו לעצמו

נתון ההשקה — שיפור ממוצע של יותר מ-26% על פני כשלושים הערכות — נמדד כולו ביחס לQwen3.5-Omni-Plus. זה אומר לכם שהמשפחה התקדמה. זה לא אומר לכם היכן המודל ניצב לצד כל דבר שאולי אתם כבר משלמים עליו, וגם לא אותן השוואות סלקטיביות שהופצו לצדו סוגרות את הפער. התמונה כפי שמדווחת על ידי הספק מול Gemini 3.8 Flash היא ניצחון אמיתי בלוחות האודיו והפסד באלה שמודדים עבודת וידאו אג'נטית: WildClawBench-MM 71.0 מול 58.9 ו-SpotSoundBench 67.2 מול 39.7 מצד אחד, ו-AgenticVBench 36.8 מול 45.0 ו-OmniGAIA 74.0 מול 78.6 מצד שני. לשון הסיכום של עליבאבא עצמה — ביצועי אודיו-וידאו ש"מתקרבים" ל-Gemini, וביצועי אודיו כוללים שעולים עליו — זהירה יותר מהכותרות שהיא הניבה, והגרסה הזהירה היא המדויקת.

• הקשר — 1M טוקנים, עם קלט מרבי של כ-991K (כ-983K במצב חשיבה) ופלט מרבי של 131K.

• מודאליות — טקסט, תמונה, אודיו ווידאו נכנסים; טקסט בלבד יוצא. אין יצירת דיבור במודל הבסיסי.

• משך — עד שעה של אודיו רציף או אודיו-וידאו לשיחה, וזה מה שמאפשר עבודה על פגישות ומדיה ארוכה בלי חלוקה למקטעים.

• כיסוי שפות — זיהוי ב-74 שפות ובנוסף 39 ניבים סיניים בחומרי ההשקה, כאשר נתונים רחבים יותר (113 שפות וניבים) מצוטטים במקום אחר עבור קלט אודיו.

• פירוט קלט — שמע סטריאו ושמע מרחבי בארבעה ערוצים מתקבלים, כאשר וריאנט ה-Realtime מתואר כמודל האומני-מודאלי הראשון המסוגל לאתר מטרה לפי הצליל שלה.

• מחיר — 0.15 דולר למיליון טוקני קלט, 0.016 דולר לקלט שמור במטמון, 0.47 דולר לפלט בצד הבינלאומי, ורשימת מחירים נפרדת ליבשת שאינה ניתנת להשוואה.

ה-98% הוא אמיתי, וזה לא החשבון שלך

לפי המתודולוגיה של Alibaba עצמה — דגימה של שתי דקות כפול שלושים, וידאו נדגם ב-720p ובקצב של פריים אחד לשנייה — שעה של קלט אודיו יורדת מ-$0.28 לפחות מ-$0.01, ושעה של אודיו ווידאו משולבים מ-$3.27 ל-$0.20. אלו הפחתות גדולות, ספציפיות, ומדווחות על ידי הספק, והן הפחתות על סעיף אחד בלבד. החישוב שמשנה הוא איזה חלק מעומס העבודה שלך מהווה אותו סעיף. צינור עיבוד שמוציא את רוב הטוקנים שלו על פלט, על הקשר שמור במטמון, או על פריימים של וידאו שנדגמים בצפיפות גבוהה יותר מפריים אחד לשנייה, יראה תזוזה באחוזים קטנה בהרבה בחשבונית ממה שהכותרת מבטיחה, והכותרת עוסקת בקלט אודיו, לא בסך הכול. הוסיפו את הפלט הטקסטואלי בלבד והפער מתרחב שוב: כל דבר שצריך להשיב בדיבור זקוק למודל שני, והמודל הזה מחויב בנפרד.

זה החלק בתמונה שבו ניתוב מצדיק את עצמו. הערך של נתב pass-through אינו הנחה — הוא בכך שמחירון הספק עצמו הוא מה שאתה משלם, ובכך שניתן לפזר עומס עבודה על פני כמה מודלים, כך שמודל ממקור יחיד הוא רכיב ולא תלות. מודל omni שהוא הדבר היחיד שאתה יכול לקרוא לו הוא נקודת כשל יחידה הן בשכבת הזמינות והן בשכבת התמחור.

A headless screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, showing the model grid and the 'one API key, one bill' framing over the English-language site navigation.

מה חמישה ימי ייצור היו למעשה אומרים לך

שלושה דברים יכריעו את השאלות הפתוחות. מדידה בלתי תלויה של תוצאת הדיאריזציה של AliMeeting — שיעור שגיאה שיורד מ-88.11 ל-3.35 ו-cpWER מ-89.61 ל-17.18 — תראה אם זה שייך למודל או לדיאריזציה ולהנדסת ה-front-end העוטפת אותו, שאליה לפחות ניתוח טכני סיני אחד מייחס את רוב השיפור. בחינה משוחזרת של הפחתת הטוקנים במצב הסוכני, שבה הדיוק עלה מ-63.4 ל-67.8 ב-OmniVideoBench בעוד שמספר הטוקנים לשאילתה ירד מ-145,736 ל-79,117, תאשר את הטענה השימושית ביותר בשחרור: שהמודל יכול להשתפר ולהוזל בו-זמנית. ושורה ב-Artificial Analysis או בארנה תהפוך כל מספר ספק שלעיל למשהו בר-השוואה, וזה התנאי המוקדם לכך שהמודל ייבחר ולא ייבחן.

עד אז, הגישה ההגיונית היא זו שחלה על כל מודל בן חמישה ימים עם מארח אחד וללא הערכה בלתי תלויה: כדאי למדוד אותו על האודיו והווידאו שלך, אבל לא כדאי להפוך אותו לנתיב היחיד בצינור העיבוד שלך. אם עומס העבודה שלך הוא ניתוח פגישות או מדיה בפורמט ארוך בסינית או באנגלית, והעלויות שלך נשלטות על ידי שעות קלט ולא על ידי טוקנים של פלט, הכלכלה כאן חזקה מספיק כדי להצדיק בדיקה השבוע. אם עומס העבודה שלך דורש לקבל דיבור בחזרה, או דורש חלופה כאשר ספק נחלש, המודל כפי שהוא כיום לא יכול להיות התשובה כולה — ושום כמות של תמיכת פריימוורק מיום-אפס לא תשנה זאת.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית