
Boreal מול Qwen3.8 Max: השורה שכל ספק מקווה שתדלגו עליה
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
כל השקת מודל מפרסמת כרטיס של מספרים, ולכל כרטיס יש שורה שהיצרן היה מעדיף שלא תתעכבו עליה. עבור Qwen3.8 Max, שיצא לאור ב-3 באוגוסט 2026, השורות המשמיאות קלות למציאה: הוא תפס את המקום הראשון בלוח המובילים של CodeArena לפרונט-אנד עם 1,691 נקודות, הגיע למדד ה-Agentic של Artificial Analysis של 58 והשתווה ל-Claude Opus 5 במאמץ גבוה — הפעם הקרובה ביותר שבה הגיעה מעבדה סינית לראש הלוח הזה — וקיבל ציון GDPval-AA של 1,739 Elo, לפני GPT-5.6 Sol. השורה שמתחתן קשה יותר לקריאה. באותה חבילת הערכה של אותו מעריך, שיעור ההזיה הנמדד עלה מ-23% בדור הקודם ל-40%, וציון אחזור ההקשר הארוך של המודל ירד בשתי נקודות. Boreal, מודל הווידאו הפרסומי של Creatify, שיצא לאור ב-15 בספטמבר 2026 במחיר של סנט אחד לשנייה, מציג שורה מאותו סוג בכרטיס שלו — והיא ספציפית יותר, משום שהיצרן פרסם אותה.
אף אחת מהשורות אינה פוסלת. שתיהן מספקות מידע רב יותר מציוני הכותרת, ולכן כדאי להעמידן זו לצד זו במקום להשוות את הבאנרים.
במה Qwen3.8 Max הוא באמת הטוב ביותר
הניצחונות אמיתיים והם לא קטנים.
Qwen3.8 Max הוא מודל תערובת מומחים עם 2.4 טריליון פרמטרים, שבו כ-95 מיליארד פרמטרים פעילים לכל טוקן, והוא ה-Qwen הראשון בדרגת Max ש-Alibaba אמרה שישוחרר כמשקולות פתוחות — שחרור שהוכרז לשבוע של 10 באוגוסט 2026 בלי רישיון או תאריך סופי; פרט הראוי לציון, מפני שההכרזה אינה השחרור. יש לו חלון הקשר של 1M טוקנים עם תקרת פלט של 131,072 טוקנים, והוא מקבל טקסט, תמונות ווידאו כקלט. הנקודה האחרונה ראויה להדגשה בהשוואה המסוימת הזאת: מבין ארבעת מודלי הטקסט החזיתיים שהסדרה הזאת מציבה מול Boreal, Qwen3.8 Max הוא אחד משניים בלבד שאפשר למסור להם קליפ וידאו מוגמר ולשאול עליו שאלה.
התמחור אגרסיבי באופן שעיצב מחדש את הסגמנט. במחיר של 2.00 דולר למיליון טוקנים בקלט ו-6.00 דולר למיליון בפלט, עם קריאות מטמון ב-0.25 דולר, הוא זול מהדור הקודם בכ-20% תוך שהוא מכפיל את אורך הפלט המקסימלי. בלוח שלנו זה מסתכם ב-2.00 ו-6.00 דולר, חלון הקשר של מיליון טוקנים, זמן p50 עד לטוקן הראשון של 10.00 שניות — התקרה שהמדידה שלנו מדווחת עליה, אז יש לקרוא זאת כ"איטי" ולא כמדויק — ו-183.0 מיליון טוקנים של תעבורה בשבעת הימים האחרונים.
והשורה שמתחת
הנה החלק שלא נכנס לכותרת של פוסט ההשקה.
ההערכה העצמאית של Artificial Analysis רשמה שתי רגרסיות בין Qwen3.7-Max ל-Qwen3.8 Max. מדד אחזור ההקשר הארוך שלו ירד בשתי נקודות. מדד כל-הידיעה שלו ירד בעשר, ושיעור ההזיות שהמעריך מודד עלה מ-23% ל-40%. במקביל, עלות המודל למשימה במדד הבינה עלתה מ-$0.53 ל-$1.14 — זה לקח בערך 64 סבבים למשימה בעוד שקודמו לקח 14.
קראו את אלה יחד ותיווצר תמונה קוהרנטית. Qwen3.8 Max הוא מודל שהשתפר בדברים שמבחנים עם תשובה נכונה אחת יכולים למדוד — קוד, השלמת משימות אג'נטיות, פתרון בעיות מובנה — ונעשה גרוע יותר בדבר שהכי קשה לדרג: לדעת מתי הוא לא יודע. מודל שמהרהר יותר והוזה יותר אינו סותר את עצמו. עקבות חשיבה ארוכים יותר יוצרים יותר הזדמנויות להתחייב לתשובה שגויה אך בטוחה, ומבחן שמתגמל השלמת משימות אינו מוריד נקודות על כך עד שלמשימה יש אינווריאנטה מוסתרת שאפשר להפר.
עבור קונה, ההשלכה המעשית היא צרה וספציפית. אם השימוש שלך במודל הוא יצירת קוד או זרימת עבודה סוכנית שבה תשובה שגויה נכשלת בקול רם — בדיקה נכשלת, בנייה נשברת — הרגרסיות ברובן בלתי נראות והרווחים הם כל הסיפור. אם השימוש שלך הוא אחזור, סיכום, או כל דבר שבו תשובה שגויה ורהוטה מגיעה לאדם בלי בדיקה, המעבר מ-23 ל-40 הוא המספר שצריך להכריע את ההערכה שלך, ולא המיקום ב-CodeArena.
השורה הגרועה ביותר של Boreal עצמה, שפורסמה על ידי הספק
הניגוד שהופך את הציוות הזה לשימושי הוא ש-Creatify עשתה משהו שרוב הספקים לא עושים: היא הציבה את התוצאה החלשה ביותר שלה באותו פוסט עם התוצאה החזקה ביותר שלה.
Boreal נבדק באופן עיוור מול מודל הבסיס שלו עצמו שלא נגעו בו, כאשר הפרומפט, הרזולוציה, מספר הפריימים והזרע נשמרו קבועים, על פני 40 מקרי ייצור. Creatify מדווחת על העדפה של 81% ל-Boreal — 25 מול 6 עם 9 תיקו, מבחן הסימן p<0.001 — ולאחר מכן מפרקת את הממוצע הזה. פרסומות מוצר: 83%. סצנות יוצרים ו-UGC: 85%. קליפים של אדם אחד מדבר: 60%.
הנתון האחרון הוא השורה. ראשים מדברים הם מהפורמטים הנפוצים ביותר בפרסום תגובה ישירה, וזה הפורמט שבו היתרון של המודל לעומת מודל הבסיס שלו הוא הקטן ביותר — בקושי טוב יותר מהטלת מטבע מול מודל שאיש לא התכוון לשחרר. הרינדור מדווח ביחס של 1:1 לזמן אמת ברמת 720p, ושימור הפרטים העדינים השתפר ב-11.3% ב-p=0.004, כך שהתמונה הכוללת חיובית באמת. הפילוח פשוט אומר לך לאיזה חצי של הקטגוריה המודל הזה כוונן, וזה לא החצי שבו אדם מדבר למצלמה.
שימו לב גם לאיזה סוג של ראיות כל אחת מהשורות הללו מהווה. הנסיגה של Qwen3.8 Max התגלתה על ידי מעריך בלתי תלוי שהריץ הרנס משלו. השורה החלשה של Boreal נחשפה על ידי הספק, בבדיקה שהספק עיצב והריץ. השנייה אמינה יותר כהצהרת עובדה ופחות אינפורמטיבית כהשוואה, משום שאין מספר בלתי תלוי בשום מקום בקובץ של Boreal.

ניגוד המפרט
• פלט — Boreal: וידאו מרונדר, ברמת 720p, טקסט-לווידאו ותמונה-לווידאו. Qwen3.8 Max: טקסט בלבד, עד 131,072 טוקנים.
• קלט — Boreal: הנחיית טקסט או תמונה סטטית. Qwen3.8 Max: טקסט, תמונות ווידאו.
• מחיר — Boreal: $0.01 לשנייה של וידאו מוגמר. Qwen3.8 Max: $2.00 לכל 1M קלט / $6.00 לכל 1M פלט, קריאות מטמון ב-$0.25.
• הקשר — Boreal: לא פורסם. Qwen3.8 Max: 1M טוקנים בקלט, 131K בפלט.
• השהיה — Boreal: מצוטט ביחס 1:1 לזמן אמת. Qwen3.8 Max: p50 זמן עד לאסימון הראשון של 10.00 שניות בלוח שלנו.
• משקלים — Boreal: קנייני, בבעלות Creatify ומסופק על ידה. Qwen3.8 Max: קנייני בעת ההשקה; Alibaba הודיעה על שחרור משקלים פתוחים עבור ה-Qwen הראשון מדרגת Max, כאשר רישיון או תאריך טרם אושרו.
• ראיות — Boreal: מבחן עיוור בן 40 מקרים בהפעלת הספק, ללא הערכה בלתי־תלויה. Qwen3.8 Max: כיסוי בנצ'מרקים בלתי־תלוי הכולל שתי רגרסיות מדודות, לצד נתוני ספק של 86.1 ב-OSWorld-Verified ו-86.6 ב-Terminal-Bench 2.1.
מה שווה רגרסיה למי שקונה
נסיגות בלוחות דירוג נחשבות בדרך כלל לטריוויה. הן קרובות יותר לדבר הרלוונטי ביותר להחלטה שבנצ'מרק מפרסם, משום שהן השורות היחידות שאומרות לך מה ספק ויתר עליו.
המהלך המועיל אינו לקרוא אף אחד מהכרטיסים, אלא להריץ את שני המודלים על התעבורה שלכם — והמכשול המעשי הוא שבדרך כלל משמעות הדבר שני חוזים, שני SDK-ים ושתי מערכות חיוב, וזה מספיק חיכוך שרוב הצוותים מדלגים על הבדיקה וקונים לפי ציון הכותרת במקום.
החיכוך הזה הוא החלק ששכבת ניתוב מסירה. Qwen3.8 Max נמצא בקטלוג שלנו לצד הדור הקודם, כך שהשוואה ביניהם על מערך ההערכה שלכם היא שינוי של שורה אחת במחרוזת המודל ולא מחזור רכש, ואותו מפתח מגיע לשאר הקטלוג כשההשוואה מראה שאתם רוצים מודל אחר לשלב אחר בצינור. הוא עומד על תעריף המחירון של הספק עם 0% תוספת, וזה חשוב כאן מסיבה ספציפית: Qwen3.8 Max הגיע בכ-20% זול יותר מהדור שהוא החליף, ושינוי מחירים כזה מצד ספק הוא מסוג הדברים שאמורים להופיע בחשבון שלכם כשהם קורים ולא בחידוש הבא.
Boreal אינו נמצא בקטלוג שלנו. OrcaRouter לא מספק מודלים ליצירת וידאו, ואין לקרוא את האמור כאן כטענה אחרת. מה שאנחנו כן מספקים הוא השכבה שמעל זה — הקופי, הווריאציות, מעבר התאימות, והניתוח של מה שהניב תוצאות — וניתן למסור לשניים מהמודלים בסדרה הזו, Qwen3.8 Max ביניהם, את הקליפ המוגמר לסקירה.

איך לקרוא כל אחד מהכרטיסים
Qwen3.8 Max הוא הקנייה החזקה יותר אם העבודה שלך היא קוד, סוכנים או חשיבה מובנית במחיר שנמוך מזה של קודמו, ושתי הרגרסיות הבלתי תלויות הן הסיבה לבחון אותו על תעבורת האחזור והסיכום שלך לפני שאתה מנתב לשם ייצור. נתון ההזיות של 40% אינו סיבה להימנע מהמודל; הוא סיבה לדעת אילו מעומסי העבודה שלך יכולים לסבול אותו.
Boreal הוא היחיד מבין השניים שמייצר את התוצר שההשוואה הזו עוסקת בו לכאורה, והוא האפשרות האמינה הזולה ביותר לפי תעריפים מפורסמים עבור וידאו פרסומי קצר. המגבלה שלו ספציפית לפורמט ומצוינת על ידי הספק שלו עצמו: העדפה של 60% בקליפים של אדם יחיד מדבר. בדוק את הפורמט הזה לפני פרסומות המוצר, כי שם מרווח התמרון הוא הקטן ביותר.
שני דברים יזיזו את זה. אם אליבאבא תשחרר את המשקולות הפתוחות שהכריזה עליהן עבור Qwen3.8 Max, גם התמחור וגם העמידות של המודל ישתנו, והרישיון שבו הוא יגיע יהיה חשוב יותר מהתאריך. ולגבי Boreal, ההערכה העצמאית הראשונה — מכל סוג שהוא, בידי גורם כלשהו — תחליף בדיקת ספק בת 40 מקרים, שכיום נושאת לבדה את מלוא נטל הראיות עבור מודל שנמכר לתוך פורמט שבו מותגים רגישים באופן יוצא דופן לאופן שבו המוצר שלהם נראה.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
