
טנסנט HY4 Preview מול Qwen3.8-Max: תחרות המשקלים הפתוחים של אוגוסט
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
{{1}}Tencent HY4 Preview{{/1}} מול {{2}}Qwen3.8-Max{{/2}} היא ההתנגשות שהחודש הזה נבנה לקראתה. ה-{{4}}Qwen3.8-Max{{/4}} של {{3}}Alibaba{{/3}} הגיע לזמינות כללית ב-3 באוגוסט והפך ל-{{5}}Qwen{{/5}} הראשון בדרגת Max עם משקלים פתוחים ב-12 באוגוסט; ה-{{6}}Tencent HY4 Preview{{/6}} נחת הבוקר, 25 ימים לאחר מכן, עם כרטיס השקה שמצביע ישירות על {{7}}Qwen3.8-Max{{/7}} — Tencent מדווחת על ציון 74.1 ל-HY4 Preview ב-{{8}}Toolathlon-Verified{{/8}}, לפני {{9}}Qwen3.8-Max{{/9}} במדד הזה. שתיהן ספינות דגל סיניות במשקלים פתוחים, שתיהן מתומחרות כדי לנוע, ורק לאחת מהן יש ציונים עצמאיים.
שני המודלים מופרדים ביותר מאשר קנה מידה — Qwen3.8-Max הוא 2.4 טריליון פרמטרים לעומת 770 מיליארד של HY4 Preview — אבל במדדים הסוכנותיים (agentic) שחשובים לקונה, הם מכוונים לאותה מטרה: עבודה ארוכת-טווח שבה מודל קורא, מפעיל כלים ומבצע איטרציות ללא אדם במעגל. זה בדיוק התחום שבו דור המשקולות הפתוחות של אוגוסט מנסה להוכיח שהוא יכול להחליף מודלי קצה סגורים, והמהלך הראשון של Tencent היה לנסות לפגוע בשחרור הפתוח הגדול ביותר של החודש.
לוח התוצאות

• קנה מידה — HY4 Preview סה״כ 770B / 49B פעילים לעומת Qwen3.8-Max סה״כ 2.4T / ~95B פעילים
• הקשר — HY4 Preview יותר מ-1M טוקנים לעומת Qwen3.8-Max עם 1M טוקנים ב-API (262K מקוריים במשקלים פתוחים, ניתנים להרחבה לכ-1.01M)
• מחיר למיליון — HY4 Preview ¥6 קלט / ¥18 פלט (≈$0.85 / $2.50) לעומת Qwen3.8-Max $2.00 קלט / $6.00 פלט, קריאות מטמון $0.25
Terminal-Bench 2.1 — HY4 Preview 85.4 (מדווח על ידי הספק) לעומת Qwen3.8-Max 86.6
• מודאליות — שניהם טקסט בלבד בגרסאות המשקל הפתוח שלהם; Qwen3.8-Max API מוסיף קלט תמונה ווידאו, HY4 Preview preview אינו.
• ציון עצמאי — HY4 Preview אין לעומת Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58
שני הכרטיסים מספרים את אותו הסיפור מצדדים מנוגדים. ב-Terminal-Bench 2.1, הציונים 86.6 של Qwen3.8-Max ו-85.4 של HY4 Preview מופרדים בנקודה וחצי — נקודה אחת לטובת Qwen, והנתון של HY4 אינו מבוקר. במחיר, HY4 Preview זול יותר גם בקלט וגם בפלט לכל טוקן. באימות, ל-Qwen3.8-Max יש מדד אינטליגנציה עצמאי של 58 ומדד סוכני של 58; ל-HY4 Preview אין דבר מלבד הפרסום העצמי שלו. הפער הוא הדפוס הקלאסי של מתחרה שמגיע עם מחירים טובים יותר וטענות לא מוכחות נגד השחקן המבוסס והמאומת.
קריאת הטענה של Toolathlon
Toolathlon-Verified מודד אמינות שימוש בכלים סוכניים — עד כמה מודל מפעיל כלי באופן עקבי לאורך משימה מלאה, כולל שגיאות, התאוששות וקריאות מרובות-שלבים. הציון 74.1 של Tencent מכוון ישירות לחלק החזק ביותר בפרופיל של Qwen3.8-Max, משום שמדד הסוכנות (Agentic Index) של Qwen, שעומד על 58, וה-OSWorld-Verified שלה, שעומד על 86.1, הם המספרים שהפכו את הטיעון הסוכני של Alibaba לאמין. Qwen3.8-Max גם רושם 82.8 ב-IFBench (התאמה להוראות) ו-93.0 ב-PaperBench (עבודה סוכנית ברמת מחקר), ובשניהם הוא עוקף מודלים כמו GPT-5.6 Sol בטבלאות של היצרן עצמו. לכן Tencent בחרה את המדד היחיד שבו היא טוענת לניצחון ישיר על המודל הפתוח הגדול ביותר של החודש — והטענה כרגע ניתנת לאימות בדיוק כמו כל שורה אחרת של יצרן בודד: בכלל לא.
מאומת מול מדווח ספק
זהו הציר שבו ההתמודדות הכי פחות הוגנת, וכדאי להצהיר על האסימטריה במפורש. מדד האינטליגנציה (Intelligence Index) של Qwen3.8-Max הוא 58 לפי Artificial Analysis, ומדד הסוכנות (Agentic Index) שלו הוא 58 לפי Artificial Analysis, ואותן מערכות בדיקה עצמאיות שהעניקו לו את הציונים הללו מדדו גם את חולשותיו: שיעור הזיות של 40% ב-AA-Omniscience, לעומת 23% בדור הקודם, ולא פחות מ-64 סבבי סוכן לכל משימה — המודל עובד קשה, ואתה משלם על כל סבב. ל-Tencent HY4 Preview אין אף אחד מכלי המדידה הללו. החוזקות שלו הן טענות, ומודוסי הכשל שלו — שטנסנט עצמה מתייגת כחשיבה ארוכה ואימות-עצמי מופרז — הם הודאות, לא מדידות.
עבור צוות שבוחר בין השניים, פער האימות אינו מופשט. ההתנהגות של Qwen3.8-Max של 64 סיבובים למשימה היא גורם עלות אמיתי ונמדד: במחיר של $2/$6, הוא עדיין הסוכן היקר ביותר למשימה שהושלמה בחלק מההשוואות של צד שלישי, וצוותים דיווחו שמספר הסיבובים שוחק את יתרון המחיר שלו. ההתנהגות המקבילה של HY4 Preview אינה ידועה — היא יכולה להיות זולה יותר למשימה ממה שמרמז המחיר הנמוך ממילא לכל אסימון שלה, או שהרגל האימות העצמי שלה עלול לאכול את ההפרש. אף אחד לא יכול לומר לך עדיין איזה מהם, כי אף אחד מחוץ לטנסנט לא הריץ אותו.
מחיר וההיבטים המעשיים של המשקלים הפתוחים
לפי טוקן, HY4 Preview זול יותר בשני הצדדים של המאזן: ¥6/¥18 לעומת $2.00/$6.00 של Qwen3.8-Max, ופגיעות מטמון ב-¥0.3 לעומת $0.25. זה הופך את HY4 Preview לדגל בעל המשקל הפתוח הזול ביותר גם בקלט וגם בפלט, נקודה. אבל "משקלים פתוחים" מגיעים עם שני סטים שונים של אותיות קטנות. הגרסה עם המשקלים הפתוחים של Qwen3.8-Max — כלומר Qwen3.8-2.4T-A95B — היא טקסט-בלבד עם חשיבה כפויה, קונטקסט מקורי של 262K במקום ה-1M של ה-API, ורישיון מותאם אישית עם תנאים מדורגים לפי קנה מידה: דרישת הצגת שם המודל מעל 100M משתמשים חודשיים, ורישיון נפרד לעסקים גדולים של Model-as-a-Service. המשקלים של Tencent HY4 Preview נמצאים ב-HuggingFace, ModelScope ו-GitHub החל מהבוקר, אך תנאי הרישיון המדויקים שלו והאם המשקלים תואמים את ה-API המוגש לא צוינו בבהירות כזו. שני המודלים ניתנים להורדה; אף אחד מהם אינו טריוויאלי להתקנה כתחליף.
השורה התחתונה
Qwen3.8-Max הוא הבחירה הבטוחה יותר בכל מובן שבו אימות קונה בטיחות: ניקוד עצמאי באינטליגנציה ובעבודה סוכנתית, מצבי כשל ידועים, רישיון מוסדר, ושלושה שבועות של משוב ייצור. הוא גם הבחירה היקרה יותר לכל טוקן, וההתנהגות מרובת-הסבבים שנמדדה בו היא סיכון עלות ידוע. Tencent HY4 Preview הוא ההימור הערכי: זול יותר גם בקלט וגם בפלט, עם טענת Terminal-Bench דומה, וטענה ישירה של Toolathlon-Verified מול Qwen — וכל זה בלתי מאומת ביום הראשון. אם אתם מעלים מודל בעל משקלים פתוחים לייצור השבוע, Qwen3.8-Max הוא הבחירה הניתנת להגנה, והוא זמין ב-OrcaRouter במחיר המחירון של Alibaba — $2.00/$6.00, מועבר ישירות ללא תוספת מחיר. HY4 Preview הוא פרויקט ההערכה: הריצו אותו דרך ה-API של Tencent עצמה מול משימות משלכם בסגנון Toolathlon, שימרו את נתיב הייצור על המודל המאומת, וכשהציונים העצמאיים ינחתו — או כש-HY4 Preview יגיע לנתב ותעריף ¥6/¥18 שלו יהפוך להעברה באותו יום — ההחלפה היא כלל ניתוב, לא שכתוב מחדש.


מה לצפות
• הריצה העצמאית הראשונה של HY4 Preview על רתמת סוכנים. ה־74.1 המאומת של Toolathlon הוא המספר שטנסנט רוצה להשיג; מדד Agentic של צד שלישי יהיה האישור.
• מספר הסבבים שנמדד של HY4 Preview. 64 הסבבים למשימה של Qwen3.8-Max הם סיפור האזהרה; השאלה האם HY4 Preview זול יותר לכל משימה שהושלמה היא כל הטיעון הכלכלי.
• תנאי הרישיון על המשקולות. הם יקבעו אם "פתוח" פירושו "שמיש בקנה המידה שלך" עבור HY4 Preview, כפי שתנאי הרישיון של Qwen3.8-Max עשו עבור המודל של Alibaba.
• האם מי מהספקים יקצץ שוב את המחיר. בחודש שבו הושקו שתי דגמי דגל במשקל פתוח בתמחור אגרסיבי, גלגול ההנחה בנתב הופך כל קיצוץ נוסף לגלוי באותו היום.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
