כרטיס כותרת ראשי להשוואה 'Qwen3.8-Omni-Flash מול Qwen2.5-Omni' עם כיתוב העל 'במרווח של שמונה־עשרה חודשים – ממרץ 2025 עד ספטמבר 2026', כתובית המשנה 'הקשר גדול פי שלושים, שעה של מדיה במקום שניות – והדבר האחד שהמודל הישן יותר ידע לעשות והחדש אינו יכול', ושלושה תגי נתונים עם הכיתוב 'הקשר: 32K עד 1M', 'מדיה לכל קריאה: שניות עד שעה', ו'פלט דיבור: מודל 2025 בלבד'.
Guides & Insights

Qwen3.8-Omni-Flash לעומת Qwen2.5-Omni: כעבור 18 חודשים, השדרוג איבד את קולו

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הנה העובדה שהופכת את ההשוואה הזו למעניינת יותר משדרוג דור. המודל הישן יותר יכול לדבר, והחדש יותר לא.Qwen2.5-Omni, שיצא במרץ 2025, קיבל כקלט טקסט, תמונות, אודיו וווידאו והשיב בטקסט או בדיבור טבעי בזרימה, במודל מקצה-לקצה יחיד שניתן היה להוריד. Qwen3.8-Omni-Flash, שיצא ב-18 בספטמבר 2026, קולט את אותם ארבעה סוגי קלט בחלון הקשר גדול פי שלושים, מעכל שעה של אודיו-ווידאו רציף במקום שבו קודמו התמודד עם שניות, ומחזיר טקסט בלבד. שמונה עשר חודשים של עבודה קנו קליטה רחבה בהרבה וויתרו על ערוץ הפלט. אם זה התקדמות או עסקה — זה תלוי לחלוטין במה שהשתמשת במודל הישן, והתשובה מתפצלת בבירור לשניים.

הנתונים עבור Qwen2.5-Omni הם של היצרן, מחומרי ההשקה שלו ממרץ 2025, ושמונה־עשר חודשים של פריסה רחבה אימתו אותם באופן חלקי. הנתונים עבור Qwen3.8-Omni-Flash הם גם של עליבאבא, מחומרי השקה שפורסמו שעות לפני שנכתבו הדברים הללו, ושום דבר בהם לא שוחזר באופן בלתי תלוי. כאשר טענה מגיעה ממבקר ולא מהיצרן, היא מיוחסת ככזו. העובדה המבנית האחת שאינה מצריכה אימות היא גם המשמעותית ביותר: Qwen2.5-Omni הוא בעל משקלים פתוחים וניתן להורדה, ואילו Qwen3.8-Omni-Flash אינו כזה.

מה היה Qwen2.5-Omni, ומדוע זה היה חשוב

כאשר הוא שוחרר ב-26 במרץ 2025, Qwen2.5-Omni היה המודל האומני-מודאלי הראשון מקצה לקצה במשפחה — ההשקה הציגה אותו כתשובה לבעיית "גן החיות של המומחים", שבה תמלול, ראייה וקול דרשו כל אחד מודל נפרד ושכבת דבק נפרדת. המודל 7B טיפל בכל ארבעת מודאליות הקלט ובשני סוגי הפלט, טקסט ודיבור, הצהיר על תוצאות מתקדמות ביותר בבנצ'מרק המיזוג OmniBench, מעל Gemini-1.5-Pro, ודיווח על ציון של 4.51 לאיכות יצירת דיבור, שאליבאבא תיארה כברמה אנושית. גרסת 3B הלכה באותה ארכיטקטורה.

ההנדסה שגרמה לזה לעבוד ראויה לציון, מפני שהמודל החדש אינו משתמש בה. Thinker-Talkerפיצלו את העבודה לשניים: טרנספורמר Thinker מיזג את מקודדי האודיו והתמונה והפיק סמנטיקה וטקסט, בעוד ש-Talker הזרים טוקנים של דיבור מתוך המצבים החבויים של ה-Thinker, תוך שיתוף היסטוריית שיחה מלאה. RoPE רב-מודאלי המיושר בזמן (TMRoPE) שיבץ לסירוגין עמדות וידאו ואודיו כך ששני הזרמים נשארו מסונכרנים. זרימה בלוק-אחר-בלוק איפשרה למקודדים לבצע תפיסה בזמן שמודל השפה טיפל ברצפים ארוכים, וזה מה שאיפשר תגובות מדוברות בהשהיה נמוכה. שני קולות קבועים הופצו איתו, Chelsie ו-Ethan.

האילוצים היו ממשיים לא פחות. ההקשר היה 32,768 אסימונים. הזיכרון היה הגורם המגביל הרבה יותר מאשר החישוב: הטבלאות של Alibaba עצמה מציבות הסקה ב-BF16 עם FlashAttention-2 על כ-31GB של זיכרון GPU עבור וידאו באורך 15 שניות, 42GB עבור 30 שניות ו-60GB עבור דקה שלמה. דקה של וידאו, על מודל 7B, על אחד מכרטיסי ה-GPU הבודדים הגדולים ביותר שאפשר לשכור. המספר הזה הוא זה שצריך להחזיק לנגד העיניים, כי זה המספר שהמודל של 2026 נבנה כדי להרוס.

מהו Qwen3.8-Omni-Flash

המודל החדש הוא אומני-מודאלי מקורי ולא מורכב — בנוי ישירות על הQwen3.8-Flash קו הארכיטקטורה ולא כ-LLM טקסטואלי עם מקודדי תפיסה שהוצמדו לו, שזהו הבדל מבני ולא רק תווית דור. הוא מקבל טקסט, תמונה, אודיו ווידאו, כולל אודיו סטריאו ואודיו מרחבי בארבעה ערוצים, ומחזיר טקסט על פני הקשר של מיליון טוקנים עם קלט מקסימלי של כ-991K, פלט מקסימלי של 131K ותקציב חשיבה של 262K. הוא מתמודד עם עד שעה של אודיו-וידאו רציף בכל קריאה. זיהוי דיבור מכסה 74 שפות, כאשר יצירת דיבור ב-29 שפות מטופלת בכלים הנלווים ולא על ידי המודל. הוא זמין בפלטפורמת Qianwen AI וב-Alibaba Cloud Model Studio תחת המזהה qwen3-8-omni-flash, במחיר של $0.15 למיליון טוקני קלט ו-$0.47 למיליון טוקני פלט, כאשר קלט במטמון עולה $0.016.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni - the scoreboard'. Left column Qwen3.8-Omni-Flash: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Weights API only, Hardware hosted endpoint. Right column Qwen2.5-Omni: Released 26 Mar 2025, Context 32,768 tokens, Media per call seconds and GPU-bound, Output text + streaming speech, Weights open and downloadable, Hardware roughly 60GB GPU for 60s of video. The footer reads 'Qwen2.5-Omni figures per Alibaba's March 2025 release materials; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

שמונה עשר חודשים, ממד אחר ממד

• הקשר — Qwen2.5-Omni עם 32,768 טוקנים לעומת Qwen3.8-Omni-Flash במיליון, גידול של פי שלושים לערך.

• משך המדיה — שניות של וידאו, המוגבלות על ידי זיכרון GPU, לעומת שעה של אודיו-וידאו רציף בשיחה מתארחת אחת.

• פלט — טקסט בתוספת דיבור טבעי בזרימה במודל הישן; טקסט בלבד בחדש.

• פריסה — Qwen2.5-Omni הוא בעל משקלים פתוחים תחת Apache-2.0, ניתן להורדה מ-Hugging Face ומ-ModelScope; Qwen3.8-Omni-Flash הוא API בלבד ללא שחרור משקלים מוכרז.

• חומרה — פרמטרים של 7B שדורשים עד ~60GB של זיכרון GPU עבור דקת וידאו, לעומת נקודת קצה מתארחת שאותה אינך מקצה כלל.

• מחיר — המודל הישן עולה לך GPU; החדש עולה $0.15 למיליון טוקני קלט, ו-Alibaba טוענת שקלט אודיו לשעה זול ב-98% מהדור Qwen3.5-Omni-Plus שאותו הוא מחליף.

• יצירת דיבור — שני קולות קבועים ב-2025, לעומת 29 שפות של יצירת דיבור בכלי 2026, שאף אחד מהם לא מיוצר על ידי המודל עצמו.

המקצוע שאף אחד לא פרסם

קראו את שני דפי המפרט יחד, והצורה של שמונה עשר החודשים האחרונים מתבהרת. Alibaba בילתה את התקופה בפתרון קליטה — כמה מדיה מודל יכול לקלוט, כמה בזול, וכמה מההכרעה הוא יכול לעשות בעצמו. Qwen3.8-Omni-Flash הוא ניצחון בציר הזה. מצב ה-Agentic Understanding, שבו המודל בוחר מה לדגום במקום לעבד כל פריים, מקצץ את מספר הטוקנים לשאילתה מ-145,736 ל-79,117 תוך העלאת הדיוק של OmniVideoBench מ-63.4 ל-67.8, והספק מדווח ששגיאת הדיאריזציה של דוברים ב-AliMeeting צונחת מ-88.11 ל-3.35.

מה שהמרווח לא שם בעדיפות הוא פלט. הטריק המגדיר של מודל 2025 — מודל אחד ששומע אותך ועונה בקול, מקצה לקצה, בלי סינתיסייזר דיבור נפרד — אין לו יורש כאן. אם בנית סוכן קולי, צינור דיבוב או כלי נגישות על ה-Talker של Qwen2.5-Omni, מודל 2026 אינו שדרוג שלו; הוא רכיב שתצטרך להרכיב עליו שלב חדש של טקסט לדיבור, מה שמוסיף השהיה וספק לצינור שאף אחד מהשניים לא היה בו קודם. חומרי ההשקה כנים לגבי זה אם תקראו היטב את שורת המודאליות, אבל זו לא הכותרת, ומי שעובר מתוך הנחה ש"omni" משמעה אותו דבר בשני המהדורות יגלה את ההבדל בסביבת הייצור.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

למה למודל 2025 עדיין יש עבודה

שלוש סיבות, ואף אחת מהן אינה נוסטלגיה. הראשונה היא הקול, כמתואר לעיל. השנייה היא משקלים פתוחים: 32K של חלון הקשר וטביעת רגל של 7B ירוצו על חומרה שבשליטתך, באופן לא מקוון, בלי שנתונים יוצאים מהבניין ובלי מונה לפי טוקן — האפשרות היחידה אם האודיו שלך כפוף לכלל שהות נתונים או שתקציב ההשהיה שלך אוסר על סבב הלוך ושוב. השלישית היא עלות בנפח נמוך מאוד. ה-GPU שכבר בבעלותך הוא בעלות אפס בשוליים; 0.15 דולר למיליון טוקנים של המודל המתארח הוא זול אך לא אפס, והעלות הקבועה של הקצאת תשתית מולו היא ממשית עבור עומס עבודה שרץ פעמיים בשבוע.

הטיעון הנגדי הוא שאילוצי המודל הישן מכבידים יותר בכל שנה. דקה של וידאו, 32K של הקשר, ובלי קריאה לכלים או פלט מובנה בעולם שבו סוכנים הם צורת הפריסה המוגדרת כברירת מחדל — זה מעטפת צרה. עבור צינור עיבוד שחייב לקלוט פגישות מוקלטות, Qwen3.8-Omni-Flash אינו רק טוב יותר — הוא ההבדל בין אפשרי לבלתי אפשרי, משום שהמודל מ-2025 פשוט אינו יכול פיזית להכיל את הקלט.

כדאי להיות קונקרטיים לגבי כמה חיים עוד נותרו במשקלים הישנים, כי "מורשת" ממעיטה בערכם.Qwen2.5-Omni-7B המאגר רשם 343,676 הורדות בחודש האחרון כשבדקנו אותו ב-18 בספטמבר 2026, עם כמאה Spaces קהילתיים ועשרות כיוונונים עדינים, מתאמים וכימותים שנבנו על גביו. יהיה אשר יהיה מה שיעשה דגם הדגל, אוכלוסייה גדולה של אנשים עדיין משחררת על בסיס מודל 2025 — וראוי לציין ש-Hugging Face לא רשמה שום ספק הסקה שפורס אותו, מה שאומר שכמעט כל השימוש הזה הוא באירוח עצמי.

המודל החדש משפר את הישן

הפרט המוזר והמשכנע ביותר בהשקה קבור לקראת סוף החומרים. בניסוי שאליבאבא מתארת כמודל שמשפר מודל, Qwen3.8-Omni-Flash שיפר באופן אוטונומי את זיהוי הדיבור בניב סצ'ואני של Qwen2.5-Omni-3B — האח הקטן של המודל שהוא מחליף לכאורה — והוריד את שיעור שגיאת התווים מ-25.79% ל-15.30% בתוך שתים עשרה שעות ובנה 3,413 דגימות אימון בארבעה סבבים.

זהו טיעון טוב יותר עבור המודל החדש יותר מאשר כל בנצ'מרק במהדורה, והוא ממסגר מחדש את היחס בין השניים. מודל 2026 אינו רק תחליף לזה של 2025; הוא כלי שהופך את משקלי 2025 לטובים יותר. אם אתה מריץ את Qwen2.5-Omni בסביבת ייצור עבור שפה או ניב שהוא מתמודד איתם בצורה גרועה, הנתיב המעשי עשוי להיות לשמור על הפריסה ולהשתמש במודל החדש כדי לבנות את נתוני האימון, במקום להעביר את עומס העבודה. עם זאת, שים לב שזו הדגמה שדווחה על ידי ספק ללא מתודולוגיה מפורסמת, ויש להתייחס אליה כאנקדוטה מעודדת ולא כמתכון שניתן לשחזור.

A screenshot of the Hugging Face model card for Qwen/Qwen2.5-Omni-7B (captured 18 September 2026), showing the Apache-2.0 licence tag, a 'Downloads last month' figure of 343,676, a Safetensors model size of 11B params, 100 Spaces using the model, 57 adapters, 67 finetunes and 24 quantisations, a note that the model is not deployed by any Inference Provider, and the model card text describing the Thinker-Talker architecture and TMRoPE position embedding.

אם אתם מבצעים הגירה

לעיתים רחוקות ההחלטה מצטמצמת למודל אחד. צוות שנפרד ממודל omni באירוח עצמי בוחר בין שלוש צורות: להישאר על משקלים פתוחים ולהמשיך לספק תשתית, לעבור ל-API של ספק ולוותר על השליטה, או לפצל את עומס העבודה כך שרק החלק שזקוק לקלט של מיליון טוקנים יעבור למודל המתארח. האפשרות השלישית הזו היא בדרך כלל הנכונה, והיא גם זו שאנשים מדלגים עליה, כי היא נשמעת כמו יותר עבודה ממה שהיא באמת — אין צורך לזרוק את הכיוונון העדין לדיאלקט שהשקעתם בו חודש רק מפני ששלב סיכום הפגישות עבר.

היכן שהניתוב עוזר הוא בתפרים. OrcaRouter נותן לך מפתח אחד ביותר מ-200 מודלים עם 0% תוספת על מחיר המחירון של הספק ומעבר אוטומטי לגיבוי אם נקודת קצה מתדרדרת, מה שאומר שהחצי המתארח של צינור מפוצל לא צריך חוזה משלו, קוד לקוח משלו וניטור משלו לפני שאתה יודע אם עומס העבודה מצדיק בכלל את כל זה. כדי להבהיר מה אנחנו לא עושים: אף אחד משני מודלי ה-omni אינו נמצא בקטלוג שלנו — שניהם פועלים בפלטפורמות של עליבאבא או על החומרה שלך — אז זו החלטת ניתוב שאתה מקבל סביב המודלים, ולא דרכנו.

מי צריך לזוז, ומי לא

עברו אם עומס העבודה שלכם הוא אודיו או וידאו באורך מלא, אם 32K של הקשר הוא הדבר שמונע מצינור עיבוד להתקיים, אם אתם זקוקים להתנהגות סוכנית מעל מדיה, או אם דיאריזציה של דוברים בקנה מידה היא הבעיה שלכם. הישארו אם אתם צריכים שהמודל ידבר, אם האודיו שלכם לא יכול לצאת מהתשתית שלכם, אם אתם תלויים במשקלים הספציפיים של Qwen2.5-Omni שכבר כיוונתם, או אם נפח הקריאות שלכם נמוך מספיק כך ש-GPU שבבעלותכם עדיף על מונה.

הסיכום הלא נוח הוא שזה פחות החלפה ויותר פיצול בקו המוצרים. Alibaba הקדישה שמונה־עשר חודשים לבניית מודל הקלט הטוב ביותר שהיא יכולה, ולא בנתה יורש לחצי הפלט. אם העבודה שלך נמצאת בצד הקלט, השדרוג הוא כמעט חובה. אם היא נמצאת בצד הפלט, מודל 2025 הוא עדיין הדבר החדש ביותר שעושה את מה שאתה צריך — וכדאי לדעת זאת לפני שאתה מתכנן מיגרציה שתמחק בשקט יכולת שאתה תלוי בה.