כרטיס כותרת ראשי עבור 'Tencent HY4 Preview vs tencent-hy3'. כותרת ראשית: "פי שש מהמחיר — ומה הקפיצה באמת נותנת". פאנל שמאלי: 'Tencent HY4 Preview' (דגל חדש, 28 באוגוסט 2026) עם תוויות: '770B / 49B MoE', 'הקשר 1M', 'DeepSWE 64.3'. פאנל ימני: 'tencent-hy3' (סוס עבודה מוכח) עם תוויות: '295B / 21B MoE', 'הקשר 256K', 'DeepSWE 28.0'. כותרת תחתית: "מחיר ¥6/¥18 לעומת ¥1/¥4 למיליון טוקנים. נתוני ביצועים מדווחים על ידי הספק."
Guides & Insights

Tencent HY4 Preview לעומת tencent-hy3: פי שישה במחיר, ומה באמת מקבלים עבור הקפיצה

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Tencent HY4 Preview הוא הדגם הראשון במשפחת Hunyuan שגורם לקודמו שלו להיראות זול במכוון: Tencent מתמחרת אותו פי שש ממחיר הקלט של tencent-hy3 ופי ארבעה וחצי ממחיר הפלט שלו, ומצגת ההשקה טוענת שהפרמיה מוצדקת. שוחרר ונפתח כקוד פתוח ב-28 באוגוסט 2026, Tencent HY4 Preview מדווח על ציון הנדסת תוכנה ב-DeepSWE שמכפיל ביותר מפי שניים את 28.0 של Hy3, על ציון 85.4 בהפעלת מסוף ב-Terminal-Bench 2.1, ועל חלון הקשר שקופץ מ-256K ליותר ממיליון טוקנים. tencent-hy3, שהפך לרשמי ב-6 ביולי, הוא סוס העבודה הבוגר של המשפחה — 295B פרמטרים בסך הכול, 21B פעילים, רבע מההקשר, ותג מחיר קרוב יותר לשגיאת עיגול. זו לא תחרות שגיליון המפרט משאיר צמודה. השאלה היא האם הפער שווה את הכסף עבור מה שבאמת מריצים, והתשובה מתפצלת לפי עומס העבודה.

לוח התוצאות: היכן שהשניים באמת מתפצלים

כל בנצ'מרק בחומרים של Tencent מדווח על ידי הספק — הופעל על מערכות ההערכה של Tencent עצמה בעת השקת כל מודל, לא שוחזר על ידי מעבדה עצמאית, ובמקרה של דגם הדגל, המודל פומבי פחות מיום. התייחס לציונים כאל התקרה שטנסנט מאמינה שהגיעה אליה, ותן משקל לתבנית יותר מאשר לכל ספרה בודדת. התבנית ברורה ללא עוררין, והיא מרוכזת בעבודה הנדסית אגנטית ולא בידע כללי:

• DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. זוהי הקפיצה הבודדת הגדולה ביותר בצמד הזה, יותר מהכפלה במדד הנדסת תוכנה בקנה מידה של מאגר קוד, וזה המספר שמפריד בין מודל צ’אט לבין מודל שמוסרים לו מאגר קוד שלם.

• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4, שלטענת Tencent משתווה ל-Claude Opus 5 ועוקף את DeepSeek V4 Pro. tencent-hy3: 71.7 כפי שדווח עם השקתו ביולי. הבאת מסוף אמיתי לידי השלמה במשימות מרובות-שלבים היא בדיוק סוג העבודה ארוכת-הטווח שבה Hy3 היה החלש ביותר.

• מאומת Toolathlon — תצוגה מקדימה של Tencent HY4: 74.1, שלפי Tencent עוקפת את Qwen 3.8 Max ואת GPT-5.6 Sol. לא פורסם נתון Hy3 מקביל.

• מבחן עיוור פנימי — 163 מומחים נתנו ציונים ל-203 משימות הנדסה בממוצע של 2.99/4.00 עבור Tencent HY4 Preview, שגבר בקושי על 2.92 של GLM-5.3 ועל 2.94 של Kimi K3. אלה המעריכים של Tencent על המשימות של Tencent; יש לראות בכך אינדיקציה בלבד.

A two-column comparison scoreboard titled 'Tencent HY4 Preview vs tencent-hy3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active params: 770B / 49B', 'Context window: 1M', 'DeepSWE: 64.3', 'Terminal-Bench 2.1: 85.4', 'Input price per MTok: ¥6 (~$0.85)', 'Output price per MTok: ¥18 (~$2.50)'. Right column 'tencent-hy3': 'Total / active params: 295B / 21B', 'Context window: 256K', 'DeepSWE: 28.0', 'Terminal-Bench 2.1: 71.7', 'Input price per MTok: ¥1 (~$0.14)', 'Output price per MTok: ¥4 (~$0.56)'. A footer reads 'Benchmarks vendor-reported by Tencent at each model's launch.'

הקו העקבי: הרווחים הם בהפעלת מסוף, קריאה לכלים, ומשימות בקנה מידה של מאגר קוד — מיצוב הפרודוקטיביות שטנסנט דוחפת מאז Hy3, עכשיו עם כוח החישוב כדי לגבות זאת.

פרמיית המחיר, שורה אחר שורה

כאן ההשוואה מפסיקה להיות עניין של התפארות. המחירים הרשמיים של Tencent, למיליון טוקנים:

• קלט — Tencent HY4 Preview: 6 יואן (~US$0.85). tencent-hy3: 1 יואן (~US$0.14). פי שש.

• פלט — Tencent HY4 Preview: 18 יואן (~2.50 דולר). tencent-hy3: 4 יואן (~0.56 דולר). פי ארבעה וחצי.

• פגיעת מטמון — Tencent HY4 Preview: 0.3 יואן. tencent-hy3: 0.25 יואן. כמעט אותו דבר, וזה חשוב יותר ממה שנדמה, כי לולאות סוכנים שולחות שוב ושוב את אותה הנחיית מערכת ואת אותו קידומת שיחה.

הרץ עומס עבודה ריאלי של קידוד סוכני דרך החישוב המשולב — נניח 20 מיליון טוקני קלט ו-4 מיליון טוקני פלט בחודש, תקציב סוכן למפתח יחיד עמוס. Tencent HY4 Preview: 120 יואן ועוד 72 יואן, כ-192 יואן (~US$27). tencent-hy3: 20 יואן ועוד 16 יואן, כ-36 יואן (~US$5). הדגם הדגל עולה פי חמישה ויותר להרצה באותו תמהיל טוקנים — והוא יבקש יותר טוקני פלט לכל משימה, כי הוא חושב זמן רב יותר.

זו אינה סיבה להימנע מ-Tencent HY4 Preview; זינוק DeepSWE הוא בדיוק סוג היכולת שבעבורה קיים פרמיום. זו סיבה לתמחר את עומס העבודה לפני שמנתבים אליו. וזה המקום שבו שכבת הניתוב מצדיקה את קיומה: tencent-hy3 כבר נמצא על OrcaRouter במחיר המחירון של הספק — 0% תוספת, כך שהמספר שאתה רואה הוא המחיר של הספק המשרת עצמו, לא גרסה שנמכרת מחדש עם תוספת — עם מעבר אוטומטי בין ספקים, ושינוי מחיר של ספק נכנס לתוקף אצלנו באותו היום.

פי ארבעה מההקשר, פי שניים מכוח החישוב הפעיל

• ארכיטקטורה — Tencent HY4 Preview: 770B סה"כ, 49B MoE פעיל. tencent-hy3: 295B סה"כ, 21B פעיל. דגל הדגל מעמיד בערך פי 2.3 יותר כוח חישוב על כל טוקן.

• חלון הקשר — Tencent HY4 Preview: יותר ממיליון טוקנים. tencent-hy3: 256K. מאגר מלא או אצווה של מסמכים פיננסיים נכנסים לתוך החלון של המודל הבכיר כבקשה יחידה; ב-Hy3 אותה משימה דורשת פיצול (chunking), שליפה (retrieval), או לולאת סוכן (agent loop).

• בקרת חשיבה — tencent-hy3 כולל הגדרת reasoning_effort לכל בקשה (no_think, low, high) בנוסף לשכבת פענוח ספקולטיבית ששומרת על מהירות. Tencent HY4 Preview, לפי הודאתה של Tencent עצמה, נוטה לחשיבה ארוכה לפני הפלט הראשון ומבצעת אימות יתר עצמי במשימות מורכבות — ושורפת טוקנים בבדיקה כפולה של עבודה שכבר נעשתה.

השורה האחרונה הזו היא ההבדל הסמוי לשימוש רגיש לשהות. אפשר לומר ל-Hy3 לענות ישירות; Tencent HY4 Preview, לפחות בגרסה המוקדמת הזו, לעתים קרובות לא יכול שלא לחשוב. עבור צ'אט בעל שהות נמוכה או צינור חילוץ עם תפוקה גבוהה, היכולת הנוספת של הדגל מתבזבזת והחשיבה הנוספת שלו היא מס. עבור עבודת הנדסה אצווה לא מקוונת, המס הוא בדיוק מה שקונה את התשובה הטובה יותר.

מס התצוגה המקדימה: מה שעדיין יש ל-Hy3

"Preview" נמצא בשם Tencent HY4 Preview וזה מתנהג בהתאם. אין קלט ויזואלי או מולטי-מודאלי — המודל הוא טקסט בלבד, כך שכל מה שקשור לתמונות או וידאו נשאר על המודל שבו אתה כבר משתמש לכך. תקופת הניסיון החינמית של שבועיים ב-WorkBuddy וב-CodeBuddy היא טעימה, לא תוכנית. Tencent הבהירה במפורש שזו איטרציה מוקדמת של Hy4, עם שיפורי pre-training ו-post-training שעוד יגיעו בקצב שהניב גרסה מרכזית בערך כל חודשיים מאז פברואר. אמות מידה עצמאיות לדגם הדגל: אין עדיין, בשום מקום.

tencent-hy3 הוא ההפך המוחלט מכל זה. היא גרסה רשמית ויציבה שנמצאת בייצור מאז יולי. המסלול החינמי שלה תקף עד 30 בספטמבר. רמות החשיבה שלה נותנות לך חוגה במקום מזג, ושכבת פענוח הספקולטיבי ו-21B הפרמטרים הפעילים הופכים אותה לחצי הזול, המהיר והצפוי של המשפחה הזו — המודל שאתה מכוון לנתיב ברירת המחדל ושוכח ממנו.

Screenshot of Tencent's official Hugging Face model card for the Hy4 Preview release, showing the model's open-weights download options, the 770B-parameter mixture-of-experts specification, and the million-token context window.

מי צריך לבחור איזה

בחרו ב-Tencent HY4 Preview כשהמשימה היא העיקר — משימת הנדסת תוכנה קשה, הקשר בקנה מידה של מאגר קוד, זרימת עבודה מבוססת סוכנים שבה תשובה טובה יותר מצדיקה חשבון טוקנים גבוה פי חמישה ואתם יכולים להרשות לעצמכם את זמן ההמתנה של מודל שחושב לפני שהוא מדבר. בחרו ב-tencent-hy3 כשהמגבלה היא העיקר — תפוקה גבוהה, אחזור נמוך, תקציב מוגבל, או כל משימה שבה אתם רוצים שהמודל יענה במקום לשקול.

התבנית המעשית לצימוד כזה היא אסקלציה: ניתוב המודל הזול והניתן לשליטה בנתיב ברירת המחדל, ואסקלציה לדגם הדגל רק כשהמשימה דורשת זאת. לשם כך נועדה שפת הניתוב (DSL) של OrcaRouter — הרכבת כמה מודלים לקריאה אחת כך שהמדיניות היא תצורה ולא קוד — ומעבר אוטומטי (failover) מבטיח שהנתיב של Hy3 ממשיך לשרת גם כשספק אחד מתדרדר. OrcaRouter עדיין לא מנתב את Tencent HY4 Preview; Tencent לא פתחה את המודל להסקה של צד שלישי, ולכן כרגע הוא רץ על נקודת הקצה של Tencent Cloud TokenHub של הספק עצמו ועל פריסות עצמיות של המשקלים הפתוחים. tencent-hy3, בינתיים, נמצא בקטלוג היום במחיר המחירון של הספק — וביום שבו דגם הדגל ייפתח, הוא ישתלב באותה שכבת ניתוב באותה דרך, מה שהופך את המעבר ממודל אחד לשני לשינוי בשורה אחת במקום לשכתוב.

Screenshot of the OrcaRouter model page for tencent/hy3, showing its provider list price and availability through the one-API routing catalog — the half of this family that can be routed today.

המסקנה משעממת במובן הטוב ביותר: דגם הדגל שווה את הפרמיה בדיוק עבור העבודה שהוא מתומחר לבצע, וסוס העבודה עדיין הבחירה הנכונה לכל מה שרק צריך להתבצע. פער המחיר של פי שש הוא אמיתי, פער DeepSWE של 28 עד 64 הוא אמיתי, ואף אחד מהם לא מבטל את השני — אתה פשוט צריך לדעת איזה מהם אתה קונה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube