כרטיס כותרת ראשי עבור Qwen3.8-Omni-Flash עם כיתוב עליון 'Alibaba - Qwen - 18 בספטמבר 2026', כותרת משנה 'המודל האומני-מודלי המקורי של Qwen - טקסט, תמונה, אודיו ווידאו בקלט, מיליון טוקנים של הקשר, עד שעה של אודיו-וידאו רציף בכל קריאה', ושלושה תגי נתונים שקוראים 'מחיר למיליון טוקנים: $0.15 בקלט / $0.47 בפלט', 'עלות אודיו לעומת הדור הקודם: נמוכה ב-98%', ו'מודליות פלט: טקסט בלבד'.
Guides & Insights

Qwen3.8-Omni-Flash הגיע: הקשר של 1M טוקנים, אודיו זול ב-98%, פלט טקסט בלבד

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ההשקה פתחה את Qwen3.8-Omni-Flash בפני לקוחות API היום, 18 בספטמבר 2026, והמספר שאיתו היא הובילה הוא חשבון ולא ציון. לפי שעה של קלט אודיו, Qwen אומרת שהמודל החדש עולה 98% פחות מקודמו Qwen3.5-Omni-Plus; לפי שעה של אודיו ווידאו משולבים, 93% פחות. כל השאר בהכרזה נובע ממסגור זה. Qwen3.8-Omni-Flash הוא מודל אומני-מודאלי נייטיבי — טקסט, תמונה, אודיו ווידאו בקלט, מיליון טוקנים של הקשר, עד שעה שלמה של אודיו-וידאו רציף בקריאה אחת — ואליבאבא מוכרת אותו לא כמתאר טוב יותר של מדיה, אלא כמודל Qwen הראשון שנבנה כדי לפעול עליה. הסלוגן הוא "Omni Senses. Agentic Delivery." המלכוד, שנאמר בפשטות באותם חומרים עצמם, הוא שהמודל עונה בטקסט בלבד: הוא שומע וצופה, אך אינו מדבר.

שום דבר להלן לא שוחזר באופן עצמאי. המודל בן שעות ספורות, אין עדיין הערכת צד שלישי לגביו, וכל נתון בנצ'מרק ובמחיר בחומרי ההשקה הוא של אליבאבא עצמה. כאשר מספר מדווח על ידי הספק, כתבה זו אומרת זאת במשפט שנושא אותו; כאשר קריאה מגיעה ממבקר ולא מהספק, היא מיוחסת.הוא הדבר היחיד שניתן לאימות באופן עצמאי היום — שהמודל פעיל בפלטפורמות של אליבאבא ולא בקטלוג של אף אחד אחר — והוא הדבר שההשקה הכי פחות מעוניינת לדבר עליו.

מה שנשלח בפועל

דף המפרט נקי באופן יוצא דופן להשקה אומני-מודאלית, וזה עצמו הסיפור: הדור הקודם של מודלים אומני-מודאליים במשפחה הזו הורכב ממקודדי תפיסה נפרדים שהוצמדו ל-LLM טקסטואלי, והדגם הזה בנוי ישירות על Qwen3.8-Flash קו הארכיטקטורה, עם מודאליות המטופלות באופן נייטיבי ולא מושתלות.

• קלט — טקסט, תמונה, אודיו ווידאו, כאשר סטריאו ואודיו מרחבי בארבעה ערוצים מתקבלים; הפלט הוא טקסט בלבד.

• הקשר — מיליון טוקנים, עם קלט מקסימלי של בערך 991K (כ-983K במצב חשיבה), פלט מקסימלי של 131K, ותקציב הסקה שמגיע ל-262K.

• משך — עד שעה של אודיו או אודיו-וידאו רציף לכל שיחה, וזה המספר שמאפשר תרחישי שימוש של פגישות ווידאו ארוך ללא פיצול למקטעים.

• כיסוי דיבור — זיהוי ב־74 שפות והפקת דיבור ב־29 בכלי העבודה הנלווים; דיווח אחד בשפה הסינית על ההשקה מציין 113 שפות וניבים עבור קלט אודיו.

• זמינות — פלטפורמת Qianwen AI ו-Alibaba Cloud Model Studio (Bailian), תחת מזהה ה-API qwen3-8-omni-flash. המשקלים אינם משוחררים. גרסת Realtime מתוארת כמודל האומני-מודאלי הראשון עם לוקליזציה של מקור קול.

A single-model scoreboard for Qwen3.8-Omni-Flash with six rows: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Price $0.15 in / $0.47 out per M, Output text only, and Independent score none yet. A footer reads 'All figures vendor-reported from Alibaba's launch materials, 18 Sep 2026. No independent evaluation of this model exists at the time of writing.'

ה-98% הוא טענת עלות, וכדאי לראות את החשבון שמאחוריה

הפחתה של 98% בעלותה של שעת אודיו היא מספר גדול בהרבה מהפחתה של 98% במחירו של טוקן, והפער בין שני הדברים האלה הוא המקום שבו ההכרזה עושה את שלה. הנתון לשעה נגזר מתמחור של דגימה בת שתי דקות והכפלתה בשלושים, כאשר וידאו נדגם ב720p ובקצב של פריים אחד לשנייה. זו דרך לגיטימית לצטט עומס עבודה של הפקה, והיא גם תיאור של מה שהמודל מתבקש להסתכל עליו: פריים אחד לשנייה מספיק כדי לדעת מה נאמר ובערך מה קרה על המסך, ורחוק מאוד מלהספיק כדי לבחון פעולות ברמת הפריים, לשפוט את איכות העריכה, או לתפוס פגם של פריים בודד. שני שינויים מוכפלים זה בזה — קיצוץ אמיתי במחיר היחידה, ומדיניות דגימה אגרסיבית בהרבה — ורק הראשון הוא שיפור במודל.

מחירי היחידה עצמם קונקרטיים. התמחור הבינלאומי מצוין ב-0.15$ למיליון טוקני קלט, 0.016$ למיליון טוקני קלט במטמון, ו-0.47$ למיליון טוקני פלט. התמחור המקומי של Bailian מצוין ב-¥0.8 למיליון עבור קלט מולטימודלי, ירידה מכ-¥18. שימו לב שמערכות החיוב הבינלאומית והיבשתית נפרדות והנתונים אינם ניתנים להחלפה; כל מי שישווה ביניהם ישירות יקבל תשובה שגויה.

זה החלק של ההשקה שבו לניתוב יש חשיבות גדולה מהרגיל. OrcaRouter מעבירה את מחיר המחירון של הספק הלאה עם תוספת של 0%, כך שהורדת מחיר של ספק מסוג זה מגיעה ללקוחות שלנו ביום שבו היא נוחתת ולא בחידוש החוזה הבא. השוואה אחת שאפשר לאמת באמת נמצאת כבר בקטלוג שלנו: Qwen3.8-Flash, המודל הרב-מודלי שזה נבנה לצידו, ניתן לניתוב היום במחיר של $0.15 למיליון טוקני קלט ו-$0.47 למיליון טוקני פלט — אותו מחיר מחירון שמצטטת Alibaba עבור המודל האומני החדש — והוא העביר 2.47 מיליארד טוקנים של תעבורה דרך ה-API שלנו בשבעת הימים שלפני כתיבת השורות האלה, וזה מדד הוגן למידת התיאבון שכבר יש לשכבה הזו. המודל האומני עצמו אינו נמצא בתוך הקטלוג שלנו עדיין, ועד שזה יקרה, הוא פועל בפלטפורמות של Alibaba עצמה ולא בשום מקום אחר. אנחנו לא מתכוונים להעמיד פנים אחרת.

כל בנצ׳מרק בהשקה משווה דבר אחד

הכותרת היא שיפור ממוצע של יותר מ-26% על פני כ-30 הערכות — וכל אחת מההערכות האלה היא מול Qwen3.5-Omni-Plus. זהו קו הבסיס הנכון להשקה, וגם צר: הוא אומר לך שהמשפחה זזה, לא היכן היא נחתה ביחס למשהו שאולי אתה כבר משלם עליו.

הנתונים הבודדים, כולם כפי שדווחו על ידי הספק: WildClawBench-MM 71.0, עלייה של 36.5 נקודות והתנועה הגדולה ביותר בקבוצה; UniClawBench 69.6; AgenticVBench עלייה של 22.3 נקודות ל-36.8; LongAudioSpan 82.7, עלייה של 8.3; OmniVideoBench 63.4, עלייה של 9.6; OmniCap-IF 28.2. הזוג הבולט ביותר הוא הפרדת דוברים ב-AliMeeting, שבו שיעור השגיאה יורד מ-88.11 ל-3.35 ו-cpWER מ-89.61 ל-17.18 — קפיצה גדולה מספיק כדי שראוי לבחון אותה ביקורתית ולא למחוא לה כפיים. ניתוח טכני סיני של ההשקה טוען בדיוק זאת, ומייחס את השיפור במידה ניכרת להנדסת קצה קדמי ולהפרדת דוברים שנעטפו סביב המודל ולא ליכולת ההיסק של המודל עצמו, ומזהיר שהמערכת נתפסת כמתמחה בשמיעה עם היסק וידאו עמוק חלש יחסית. זהו פירוש של מבקר, לא שחזור מדוד, אך גודל הפער הוא הסיבה לשמור אותו בראש.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

המספר האחר שכדאי לזכור אינו ציון בכלל. במה שאליבאבא מכנה מצב Agentic Understanding, המודל מחליט בעצמו על מה להסתכל ולמה להקשיב במקום לעבד כל פריים, ולאסוף ראיות בסבבים מהגס אל העדין. ב-OmniVideoBench מצב זה מעלה את הדיוק מ-63.4 ל-67.8 תוך צמצום טוקנים לשאילתה מ-145,736 ל-79,117 — הפחתה של 45.7%. עלייה בדיוק וירידה בעלות בו-זמנית היא הטענה החזקה ביותר בהודעה, והיא זו שתומכת באופן הישיר ביותר במסר הסוכני.

השוואת Gemini צרה יותר מכפי שהסיקור מרמז

המיצוב של Alibaba הוא שיכולת האודיו-וידאו "מתקרבת" ל-Gemini 3.8 Flash בעוד שביצועי האודיו הכוללים עולים על אלה של Gemini 3.8 Flash. ללא המסגור, ההשוואות המדווחות על ידי הספק נראות כך. WildClawBench-MM: 71.0 מול 58.9. SpotSoundBench: 67.2 מול 39.7. MMAU: 81.8 מול 76.9. DailyOmni: 85.1 מול 84.0.אלה פערים אמיתיים באודיו ובשימוש בכלים ממוקדי אודיו. הם גם סלקטיביים. ב-AgenticVBench, לוח ההסקה הטהור לוידאו, הסדר מתהפך — Gemini ב-45.0 מול 36.8 של Qwen — והדיווח של Alibaba עצמה מודה ש-Gemini עדיין מוביל במספר מבחני הבנת וידאו. סיכום סביר הוא ש-Qwen השתלטה על חצי האודיו של ה-omni ועדיין מפגרת בחצי הווידאו, וזו טענה שונה מזו שהכותרות הציגו.

"המודל האומני־מודאלי הראשון של Qwen" זקוק למסייג

המסגור שQwen3.8-Omni-Flash הוא המודל האומני-מודאלי הראשון של Qwen הופץ היום באופן נרחב וכדאי לדייק בו, מפני שלמשפחה יש דגם קודם עם טענה הוגנת לתואר. Qwen2.5-Omni, מודל במשקלים פתוחים בגודל 7B שיצא במרץ 2025 בארכיטקטורת Thinker-Talker, קיבל גם טקסט, תמונה, אודיו ווידאו כקלט — והוא יצר דיבור כמו גם טקסט. מה שבאמת ראשון כאן הוא הנייטיביות של האומני-מודאליות: מודל אחד שנבנה על Qwen3.8-Flash כבסיס ולא LLM טקסטואלי עם מקודדי תפיסה מחוברים, בתוספת תדריך עיצוב שמציב סוכנים תחילה. שתי הקביעות נכונות; רק אחת מהן היא זו שחזרה על עצמה. אם אתם מעריכים את המודל מתוך הנחה שאף מודל אומני של Qwen לא היה קיים לפני השבוע, תתמחרו שלא נכון את מסלול השדרוג מ-Qwen2.5-Omni, וזו השוואה שכתבנו עליה בנפרד.

הכלים הם המקום שבו הטענה האייג'נטית באמת חיה.

שני דברים יצאו יחד עם המודל, והם חשובים יותר ממה שכרטיס המודל מרמז, כי הם מה שהופך תפיסה למסירה. Qwen-MM-Plugins היא חבילת תוספים רב-מודאלית עבור רתמות סוכנים המעניקה לסוכן חיצוני הבנה של תמונות, אודיו, וידאו ומסמכים, בתוספת זיכרון וידאו ארוך ועריכת וידאו; היא מצהירה על תמיכה ב-Codex, Claude Code, Qwen Code, Gemini CLI ועוד כמה אחרים, ומספקת כלים בעלי שם כולל Video2Note, שהופך שעות של וידאו להערות PDF מאוירות. Qwen-Live Harness היא סביבת הרצה בקוד פתוח לאינטראקציה רציפה בזמן אמת בכל המודאליות, המשמשת כשכבת תזמון שבה משתמש משוחח בשידור חי ומאציל עבודה כבדה יותר לסוכני רקע. הסתייגות אחת מהסיקור ביום ההשקה: דף ה-GitHub של Qwen-Live Harness החזיר 404 כאשר Gigazine בדקה אותו, כך שיש להתייחס לכלי כמוכרז ולא כמאומת עד שהמאגרים יסתדרו.

המשפט שההשקה קוברת: הוא אינו מדבר

עבור מודל שקודמו יצר דיבור, העובדה שQwen3.8-Omni-Flash הוא רב-מודאלי בקלט וטקסט בפלט היא השורה המשמעותית ביותר במפרט, והיא מופיעה בחומרים בעיקר כהערת שוליים. המשמעות היא שלא ניתן להציב את המודל לבדו בתוך מוצר של דיבור-לדיבור. כל דיבוב, סוכן קולי או שיחה בזמן אמת שנבנים עליו זקוקים לשלב חיצוני של טקסט-לדיבור, ולגבי וידאו — למרנדר חיצוני — וזו בדיוק הסיבה שקיימים חבילת התוספים וההרנס החי. התוצאה המעשית היא צינור עיבוד עם יותר חלקים נעים מאשר "מודל אומני אחד", ושהות שצריכה להיות מתוקצבת על פני כולם.

יש הדגמה אלגנטית של הפער, ושל מה שהמודל טוב בו, חבויה בהודעה על השחרור. בניסוי "מודל שמשפר מודל", Qwen3.8-Omni-Flash שיפר באופן אוטונומי את זיהוי הדיאלקט הסצ'ואני של Qwen2.5-Omni-3B, והוריד את שיעור שגיאות התווים מ-25.79% ל-15.30% בתוך שתים עשרה שעות ובנה 3,413 דגימות אימון בארבעה סבבים. מודל שמסוגל לאבחן ולתקן את הטיפול בדיאלקט של אחיו הקטן עושה משהו ש-API לתמלול לא יכול לעשות. זה, ולא טבלת הבנצ'מרק, הוא הטיעון הברור ביותר למה שהמונח "agentic" אמור לבטא כאן.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (captured 18 September 2026), headed '199 models - 15 providers - one API key, one bill', with modality tabs reading Text 164, Image 10, Embeddings 5, Video 10 and TTS 10, a 'How to call any model' panel showing the OpenAI-compatible endpoint, and model cards including Qwen3.8 Max (0902) and DeepSeek V4.1 Flash.

מה ישנה את הקריאה שלנו?

מצב הדברים הכנה הוא שזו השקה מוגדרת היטב עם סיפור תמחור משכנע, ללא הערכה עצמאית, ולפחות מגבלה מבנית אחת שההודעה מרככת. שלושה דברים יכריעו את זה. רשומה של Artificial Analysis או LMArena תהפוך את מספרי הספקים למספרים בני השוואה, ואף אחת לא קיימת עדיין. מבחן חיצוני של הפחתת הטוקנים ב-45.7% — הטענה שהדיוק עולה בעוד העלות יורדת — יאשר את התוצאה השימושית ביותר והפחות זוהרת בפרסום. ומדידה עצמאית של הדיאריזציה של AliMeeting תראה אם הירידה של 88 נקודות שייכת למודל או לצינור שסביבו.

עד אז, הגישה הסבירה היא זו שחלה על כל מודל ביום הראשון שלו: שווה לבדוק אותו, לא שווה להמר עליו כמסלול ייצור. אם אתם כבר מנתבים תעבורה דרך OrcaRouter, המהלך המעשי הוא להשאיר את עומס העבודה על המודלים שכבר מדדתם, ולהתייחס אלQwen3.8-Omni-Flash כאל מועמד שייבחן מולם על האודיו והווידאו שלכם, ולא על טבלת הבנצ'מרקים של מי מהספקים. אם מקרה השימוש שלכם הוא ניתוח פגישות ארוכות או מדיה ארוכת-טווח בסינית ובאנגלית, הכלכלה של הטוקנים כאן חזקה מספיק כדי להצדיק את הבדיקה כבר עכשיו.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית