
Tencent HY4 Preview לעומת tencent-hy3: פי שישה במחיר, ומה באמת מקבלים עבור הקפיצה
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0259אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0258אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0166אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
Tencent HY4 Preview הוא הדגם הראשון במשפחת Hunyuan שגורם לקודמו שלו להיראות זול במכוון: Tencent מתמחרת אותו פי שש ממחיר הקלט של tencent-hy3 ופי ארבעה וחצי ממחיר הפלט שלו, ומצגת ההשקה טוענת שהפרמיה מוצדקת. שוחרר ונפתח כקוד פתוח ב-28 באוגוסט 2026, Tencent HY4 Preview מדווח על ציון הנדסת תוכנה ב-DeepSWE שמכפיל ביותר מפי שניים את 28.0 של Hy3, על ציון 85.4 בהפעלת מסוף ב-Terminal-Bench 2.1, ועל חלון הקשר שקופץ מ-256K ליותר ממיליון טוקנים. tencent-hy3, שהפך לרשמי ב-6 ביולי, הוא סוס העבודה הבוגר של המשפחה — 295B פרמטרים בסך הכול, 21B פעילים, רבע מההקשר, ותג מחיר קרוב יותר לשגיאת עיגול. זו לא תחרות שגיליון המפרט משאיר צמודה. השאלה היא האם הפער שווה את הכסף עבור מה שבאמת מריצים, והתשובה מתפצלת לפי עומס העבודה.
לוח התוצאות: היכן שהשניים באמת מתפצלים
כל בנצ'מרק בחומרים של Tencent מדווח על ידי הספק — הופעל על מערכות ההערכה של Tencent עצמה בעת השקת כל מודל, לא שוחזר על ידי מעבדה עצמאית, ובמקרה של דגם הדגל, המודל פומבי פחות מיום. התייחס לציונים כאל התקרה שטנסנט מאמינה שהגיעה אליה, ותן משקל לתבנית יותר מאשר לכל ספרה בודדת. התבנית ברורה ללא עוררין, והיא מרוכזת בעבודה הנדסית אגנטית ולא בידע כללי:
• DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. זוהי הקפיצה הבודדת הגדולה ביותר בצמד הזה, יותר מהכפלה במדד הנדסת תוכנה בקנה מידה של מאגר קוד, וזה המספר שמפריד בין מודל צ’אט לבין מודל שמוסרים לו מאגר קוד שלם.
• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4, שלטענת Tencent משתווה ל-Claude Opus 5 ועוקף את DeepSeek V4 Pro. tencent-hy3: 71.7 כפי שדווח עם השקתו ביולי. הבאת מסוף אמיתי לידי השלמה במשימות מרובות-שלבים היא בדיוק סוג העבודה ארוכת-הטווח שבה Hy3 היה החלש ביותר.
• מאומת Toolathlon — תצוגה מקדימה של Tencent HY4: 74.1, שלפי Tencent עוקפת את Qwen 3.8 Max ואת GPT-5.6 Sol. לא פורסם נתון Hy3 מקביל.
• מבחן עיוור פנימי — 163 מומחים נתנו ציונים ל-203 משימות הנדסה בממוצע של 2.99/4.00 עבור Tencent HY4 Preview, שגבר בקושי על 2.92 של GLM-5.3 ועל 2.94 של Kimi K3. אלה המעריכים של Tencent על המשימות של Tencent; יש לראות בכך אינדיקציה בלבד.

הקו העקבי: הרווחים הם בהפעלת מסוף, קריאה לכלים, ומשימות בקנה מידה של מאגר קוד — מיצוב הפרודוקטיביות שטנסנט דוחפת מאז Hy3, עכשיו עם כוח החישוב כדי לגבות זאת.
פרמיית המחיר, שורה אחר שורה
כאן ההשוואה מפסיקה להיות עניין של התפארות. המחירים הרשמיים של Tencent, למיליון טוקנים:
• קלט — Tencent HY4 Preview: 6 יואן (~US$0.85). tencent-hy3: 1 יואן (~US$0.14). פי שש.
• פלט — Tencent HY4 Preview: 18 יואן (~2.50 דולר). tencent-hy3: 4 יואן (~0.56 דולר). פי ארבעה וחצי.
• פגיעת מטמון — Tencent HY4 Preview: 0.3 יואן. tencent-hy3: 0.25 יואן. כמעט אותו דבר, וזה חשוב יותר ממה שנדמה, כי לולאות סוכנים שולחות שוב ושוב את אותה הנחיית מערכת ואת אותו קידומת שיחה.
הרץ עומס עבודה ריאלי של קידוד סוכני דרך החישוב המשולב — נניח 20 מיליון טוקני קלט ו-4 מיליון טוקני פלט בחודש, תקציב סוכן למפתח יחיד עמוס. Tencent HY4 Preview: 120 יואן ועוד 72 יואן, כ-192 יואן (~US$27). tencent-hy3: 20 יואן ועוד 16 יואן, כ-36 יואן (~US$5). הדגם הדגל עולה פי חמישה ויותר להרצה באותו תמהיל טוקנים — והוא יבקש יותר טוקני פלט לכל משימה, כי הוא חושב זמן רב יותר.
זו אינה סיבה להימנע מ-Tencent HY4 Preview; זינוק DeepSWE הוא בדיוק סוג היכולת שבעבורה קיים פרמיום. זו סיבה לתמחר את עומס העבודה לפני שמנתבים אליו. וזה המקום שבו שכבת הניתוב מצדיקה את קיומה: tencent-hy3 כבר נמצא על OrcaRouter במחיר המחירון של הספק — 0% תוספת, כך שהמספר שאתה רואה הוא המחיר של הספק המשרת עצמו, לא גרסה שנמכרת מחדש עם תוספת — עם מעבר אוטומטי בין ספקים, ושינוי מחיר של ספק נכנס לתוקף אצלנו באותו היום.
פי ארבעה מההקשר, פי שניים מכוח החישוב הפעיל
• ארכיטקטורה — Tencent HY4 Preview: 770B סה"כ, 49B MoE פעיל. tencent-hy3: 295B סה"כ, 21B פעיל. דגל הדגל מעמיד בערך פי 2.3 יותר כוח חישוב על כל טוקן.
• חלון הקשר — Tencent HY4 Preview: יותר ממיליון טוקנים. tencent-hy3: 256K. מאגר מלא או אצווה של מסמכים פיננסיים נכנסים לתוך החלון של המודל הבכיר כבקשה יחידה; ב-Hy3 אותה משימה דורשת פיצול (chunking), שליפה (retrieval), או לולאת סוכן (agent loop).
• בקרת חשיבה — tencent-hy3 כולל הגדרת reasoning_effort לכל בקשה (no_think, low, high) בנוסף לשכבת פענוח ספקולטיבית ששומרת על מהירות. Tencent HY4 Preview, לפי הודאתה של Tencent עצמה, נוטה לחשיבה ארוכה לפני הפלט הראשון ומבצעת אימות יתר עצמי במשימות מורכבות — ושורפת טוקנים בבדיקה כפולה של עבודה שכבר נעשתה.
השורה האחרונה הזו היא ההבדל הסמוי לשימוש רגיש לשהות. אפשר לומר ל-Hy3 לענות ישירות; Tencent HY4 Preview, לפחות בגרסה המוקדמת הזו, לעתים קרובות לא יכול שלא לחשוב. עבור צ'אט בעל שהות נמוכה או צינור חילוץ עם תפוקה גבוהה, היכולת הנוספת של הדגל מתבזבזת והחשיבה הנוספת שלו היא מס. עבור עבודת הנדסה אצווה לא מקוונת, המס הוא בדיוק מה שקונה את התשובה הטובה יותר.
מס התצוגה המקדימה: מה שעדיין יש ל-Hy3
"Preview" נמצא בשם Tencent HY4 Preview וזה מתנהג בהתאם. אין קלט ויזואלי או מולטי-מודאלי — המודל הוא טקסט בלבד, כך שכל מה שקשור לתמונות או וידאו נשאר על המודל שבו אתה כבר משתמש לכך. תקופת הניסיון החינמית של שבועיים ב-WorkBuddy וב-CodeBuddy היא טעימה, לא תוכנית. Tencent הבהירה במפורש שזו איטרציה מוקדמת של Hy4, עם שיפורי pre-training ו-post-training שעוד יגיעו בקצב שהניב גרסה מרכזית בערך כל חודשיים מאז פברואר. אמות מידה עצמאיות לדגם הדגל: אין עדיין, בשום מקום.
tencent-hy3 הוא ההפך המוחלט מכל זה. היא גרסה רשמית ויציבה שנמצאת בייצור מאז יולי. המסלול החינמי שלה תקף עד 30 בספטמבר. רמות החשיבה שלה נותנות לך חוגה במקום מזג, ושכבת פענוח הספקולטיבי ו-21B הפרמטרים הפעילים הופכים אותה לחצי הזול, המהיר והצפוי של המשפחה הזו — המודל שאתה מכוון לנתיב ברירת המחדל ושוכח ממנו.

מי צריך לבחור איזה
בחרו ב-Tencent HY4 Preview כשהמשימה היא העיקר — משימת הנדסת תוכנה קשה, הקשר בקנה מידה של מאגר קוד, זרימת עבודה מבוססת סוכנים שבה תשובה טובה יותר מצדיקה חשבון טוקנים גבוה פי חמישה ואתם יכולים להרשות לעצמכם את זמן ההמתנה של מודל שחושב לפני שהוא מדבר. בחרו ב-tencent-hy3 כשהמגבלה היא העיקר — תפוקה גבוהה, אחזור נמוך, תקציב מוגבל, או כל משימה שבה אתם רוצים שהמודל יענה במקום לשקול.
התבנית המעשית לצימוד כזה היא אסקלציה: ניתוב המודל הזול והניתן לשליטה בנתיב ברירת המחדל, ואסקלציה לדגם הדגל רק כשהמשימה דורשת זאת. לשם כך נועדה שפת הניתוב (DSL) של OrcaRouter — הרכבת כמה מודלים לקריאה אחת כך שהמדיניות היא תצורה ולא קוד — ומעבר אוטומטי (failover) מבטיח שהנתיב של Hy3 ממשיך לשרת גם כשספק אחד מתדרדר. OrcaRouter עדיין לא מנתב את Tencent HY4 Preview; Tencent לא פתחה את המודל להסקה של צד שלישי, ולכן כרגע הוא רץ על נקודת הקצה של Tencent Cloud TokenHub של הספק עצמו ועל פריסות עצמיות של המשקלים הפתוחים. tencent-hy3, בינתיים, נמצא בקטלוג היום במחיר המחירון של הספק — וביום שבו דגם הדגל ייפתח, הוא ישתלב באותה שכבת ניתוב באותה דרך, מה שהופך את המעבר ממודל אחד לשני לשינוי בשורה אחת במקום לשכתוב.

המסקנה משעממת במובן הטוב ביותר: דגם הדגל שווה את הפרמיה בדיוק עבור העבודה שהוא מתומחר לבצע, וסוס העבודה עדיין הבחירה הנכונה לכל מה שרק צריך להתבצע. פער המחיר של פי שש הוא אמיתי, פער DeepSWE של 28 עד 64 הוא אמיתי, ואף אחד מהם לא מבטל את השני — אתה פשוט צריך לדעת איזה מהם אתה קונה.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
