כרטיס כותרת ראשי להשוואה 'Tencent HY4 Preview מול Qwen3.8-Max'. במרכז באנר עם הכיתוב 'קרב אוגוסט במשקל פתוח', ועליו ההערה 'שני דגמי דגל במשקל פתוח, בהפרש של 25 ימים'. הכרטיס השמאלי 'Tencent HY4 Preview' מפרט: 770B / 49B פעילים, הושק ב-28 באוגוסט, ¥6 / ¥18 למיליון, אין ציונים עצמאיים. הכרטיס הימני 'Qwen3.8-Max' מפרט: 2.4T / ~95B פעילים, הושק ב-3 באוגוסט, $2.00 / $6.00 למיליון, AA Index 58. בכותרת התחתית נכתב: 'נתוני HY4 Preview מדווחים על ידי הספק; ציוני Qwen3.8-Max לפי Artificial Analysis.' לוגו OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

טנסנט HY4 Preview מול Qwen3.8-Max: תחרות המשקלים הפתוחים של אוגוסט

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

{{1}}Tencent HY4 Preview{{/1}} מול {{2}}Qwen3.8-Max{{/2}} היא ההתנגשות שהחודש הזה נבנה לקראתה. ה-{{4}}Qwen3.8-Max{{/4}} של {{3}}Ali​baba{{/3}} הגיע לזמינות כללית ב-3 באוגוסט והפך ל-{{5}}Qw​en{{/5}} הראשון בדרגת Max עם משקלים פתוחים ב-12 באוגוסט; ה-{{6}}Tencent HY4 Preview{{/6}} נחת הבוקר, 25 ימים לאחר מכן, עם כרטיס השקה שמצביע ישירות על {{7}}Qwen3.8-Max{{/7}} — Tencent מדווחת על ציון 74.1 ל-HY4 Preview ב-{{8}}Toolathlon-Verified{{/8}}, לפני {{9}}Qwen3.8-Max{{/9}} במדד הזה. שתיהן ספינות דגל סיניות במשקלים פתוחים, שתיהן מתומחרות כדי לנוע, ורק לאחת מהן יש ציונים עצמאיים.

שני המודלים מופרדים ביותר מאשר קנה מידה — Qwen3.8-Max הוא 2.4 טריליון פרמטרים לעומת 770 מיליארד של HY4 Preview — אבל במדדים הסוכנותיים (agentic) שחשובים לקונה, הם מכוונים לאותה מטרה: עבודה ארוכת-טווח שבה מודל קורא, מפעיל כלים ומבצע איטרציות ללא אדם במעגל. זה בדיוק התחום שבו דור המשקולות הפתוחות של אוגוסט מנסה להוכיח שהוא יכול להחליף מודלי קצה סגורים, והמהלך הראשון של Tencent היה לנסות לפגוע בשחרור הפתוח הגדול ביותר של החודש.

לוח התוצאות

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• קנה מידה — HY4 Preview סה״כ 770B / 49B פעילים לעומת Qwen3.8-Max סה״כ 2.4T / ~95B פעילים

• הקשר — HY4 Preview יותר מ-1M טוקנים לעומת Qwen3.8-Max עם 1M טוקנים ב-API (262K מקוריים במשקלים פתוחים, ניתנים להרחבה לכ-1.01M)

• מחיר למיליון — HY4 Preview ¥6 קלט / ¥18 פלט (≈$0.85 / $2.50) לעומת Qwen3.8-Max $2.00 קלט / $6.00 פלט, קריאות מטמון $0.25

Terminal-Bench 2.1 — HY4 Preview 85.4 (מדווח על ידי הספק) לעומת Qwen3.8-Max 86.6

• מודאליות — שניהם טקסט בלבד בגרסאות המשקל הפתוח שלהם; Qwen3.8-Max API מוסיף קלט תמונה ווידאו, HY4 Preview preview אינו.

• ציון עצמאי — HY4 Preview אין לעומת Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58

שני הכרטיסים מספרים את אותו הסיפור מצדדים מנוגדים. ב-Terminal-Bench 2.1, הציונים 86.6 של Qwen3.8-Max ו-85.4 של HY4 Preview מופרדים בנקודה וחצי — נקודה אחת לטובת Qwen, והנתון של HY4 אינו מבוקר. במחיר, HY4 Preview זול יותר גם בקלט וגם בפלט לכל טוקן. באימות, ל-Qwen3.8-Max יש מדד אינטליגנציה עצמאי של 58 ומדד סוכני של 58; ל-HY4 Preview אין דבר מלבד הפרסום העצמי שלו. הפער הוא הדפוס הקלאסי של מתחרה שמגיע עם מחירים טובים יותר וטענות לא מוכחות נגד השחקן המבוסס והמאומת.

קריאת הטענה של Toolathlon

Toolathlon-Verified מודד אמינות שימוש בכלים סוכניים — עד כמה מודל מפעיל כלי באופן עקבי לאורך משימה מלאה, כולל שגיאות, התאוששות וקריאות מרובות-שלבים. הציון 74.1 של Tencent מכוון ישירות לחלק החזק ביותר בפרופיל של Qwen3.8-Max, משום שמדד הסוכנות (Agentic Index) של Qw​en, שעומד על 58, וה-OSWorld-Verified שלה, שעומד על 86.1, הם המספרים שהפכו את הטיעון הסוכני של Ali​baba לאמין. Qwen3.8-Max גם רושם 82.8 ב-IFBench (התאמה להוראות) ו-93.0 ב-PaperBench (עבודה סוכנית ברמת מחקר), ובשניהם הוא עוקף מודלים כמו GPT-5.6 Sol בטבלאות של היצרן עצמו. לכן Tencent בחרה את המדד היחיד שבו היא טוענת לניצחון ישיר על המודל הפתוח הגדול ביותר של החודש — והטענה כרגע ניתנת לאימות בדיוק כמו כל שורה אחרת של יצרן בודד: בכלל לא.

מאומת מול מדווח ספק

זהו הציר שבו ההתמודדות הכי פחות הוגנת, וכדאי להצהיר על האסימטריה במפורש. מדד האינטליגנציה (Intelligence Index) של Qwen3.8-Max הוא 58 לפי Artificial Analysis, ומדד הסוכנות (Agentic Index) שלו הוא 58 לפי Artificial Analysis, ואותן מערכות בדיקה עצמאיות שהעניקו לו את הציונים הללו מדדו גם את חולשותיו: שיעור הזיות של 40% ב-AA-Omniscience, לעומת 23% בדור הקודם, ולא פחות מ-64 סבבי סוכן לכל משימה — המודל עובד קשה, ואתה משלם על כל סבב. ל-Tencent HY4 Preview אין אף אחד מכלי המדידה הללו. החוזקות שלו הן טענות, ומודוסי הכשל שלו — שטנסנט עצמה מתייגת כחשיבה ארוכה ואימות-עצמי מופרז — הם הודאות, לא מדידות.

עבור צוות שבוחר בין השניים, פער האימות אינו מופשט. ההתנהגות של Qwen3.8-Max של 64 סיבובים למשימה היא גורם עלות אמיתי ונמדד: במחיר של $2/$6, הוא עדיין הסוכן היקר ביותר למשימה שהושלמה בחלק מההשוואות של צד שלישי, וצוותים דיווחו שמספר הסיבובים שוחק את יתרון המחיר שלו. ההתנהגות המקבילה של HY4 Preview אינה ידועה — היא יכולה להיות זולה יותר למשימה ממה שמרמז המחיר הנמוך ממילא לכל אסימון שלה, או שהרגל האימות העצמי שלה עלול לאכול את ההפרש. אף אחד לא יכול לומר לך עדיין איזה מהם, כי אף אחד מחוץ לטנסנט לא הריץ אותו.

מחיר וההיבטים המעשיים של המשקלים הפתוחים

לפי טוקן, HY4 Preview זול יותר בשני הצדדים של המאזן: ¥6/¥18 לעומת $2.00/$6.00 של Qwen3.8-Max, ופגיעות מטמון ב-¥0.3 לעומת $0.25. זה הופך את HY4 Preview לדגל בעל המשקל הפתוח הזול ביותר גם בקלט וגם בפלט, נקודה. אבל "משקלים פתוחים" מגיעים עם שני סטים שונים של אותיות קטנות. הגרסה עם המשקלים הפתוחים של Qwen3.8-Max — כלומר Qwen3.8-2.4T-A95B — היא טקסט-בלבד עם חשיבה כפויה, קונטקסט מקורי של 262K במקום ה-1M של ה-API, ורישיון מותאם אישית עם תנאים מדורגים לפי קנה מידה: דרישת הצגת שם המודל מעל 100M משתמשים חודשיים, ורישיון נפרד לעסקים גדולים של Model-as-a-Service. המשקלים של Tencent HY4 Preview נמצאים ב-HuggingFace, ModelScope ו-GitHub החל מהבוקר, אך תנאי הרישיון המדויקים שלו והאם המשקלים תואמים את ה-API המוגש לא צוינו בבהירות כזו. שני המודלים ניתנים להורדה; אף אחד מהם אינו טריוויאלי להתקנה כתחליף.

השורה התחתונה

Qwen3.8-Max הוא הבחירה הבטוחה יותר בכל מובן שבו אימות קונה בטיחות: ניקוד עצמאי באינטליגנציה ובעבודה סוכנתית, מצבי כשל ידועים, רישיון מוסדר, ושלושה שבועות של משוב ייצור. הוא גם הבחירה היקרה יותר לכל טוקן, וההתנהגות מרובת-הסבבים שנמדדה בו היא סיכון עלות ידוע. Tencent HY4 Preview הוא ההימור הערכי: זול יותר גם בקלט וגם בפלט, עם טענת Terminal-Bench דומה, וטענה ישירה של Toolathlon-Verified מול Qw​en — וכל זה בלתי מאומת ביום הראשון. אם אתם מעלים מודל בעל משקלים פתוחים לייצור השבוע, Qwen3.8-Max הוא הבחירה הניתנת להגנה, והוא זמין ב-OrcaRouter במחיר המחירון של Ali​baba — $2.00/$6.00, מועבר ישירות ללא תוספת מחיר. HY4 Preview הוא פרויקט ההערכה: הריצו אותו דרך ה-API של Tencent עצמה מול משימות משלכם בסגנון Toolathlon, שימרו את נתיב הייצור על המודל המאומת, וכשהציונים העצמאיים ינחתו — או כש-HY4 Preview יגיע לנתב ותעריף ¥6/¥18 שלו יהפוך להעברה באותו יום — ההחלפה היא כלל ניתוב, לא שכתוב מחדש.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

מה לצפות

• הריצה העצמאית הראשונה של HY4 Preview על רתמת סוכנים. ה־74.1 המאומת של Toolathlon הוא המספר שטנסנט רוצה להשיג; מדד Agentic של צד שלישי יהיה האישור.

• מספר הסבבים שנמדד של HY4 Preview. 64 הסבבים למשימה של Qwen3.8-Max הם סיפור האזהרה; השאלה האם HY4 Preview זול יותר לכל משימה שהושלמה היא כל הטיעון הכלכלי.

• תנאי הרישיון על המשקולות. הם יקבעו אם "פתוח" פירושו "שמיש בקנה המידה שלך" עבור HY4 Preview, כפי שתנאי הרישיון של Qwen3.8-Max עשו עבור המודל של Ali​baba.

• האם מי מהספקים יקצץ שוב את המחיר. בחודש שבו הושקו שתי דגמי דגל במשקל פתוח בתמחור אגרסיבי, גלגול ההנחה בנתב הופך כל קיצוץ נוסף לגלוי באותו היום.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube