
Tencent HY4 Preview מול GPT-5.6 Sol: טענת קריאת הכלים שמעמידה משקלים פתוחים כנגד החזית
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
Tencent HY4 Preview הוא דגם המשקלים הפתוחים הראשון מזה חודשים שכרטיס ההשקה שלו טוען במפורש לניצחון על GPT-5.6 Sol. המספר המדובר הוא Toolathlon-Verified, מדד לקריאת כלים אוטונומית, שבו Tencent מדווחת על HY4 Preview ב-74.1 — לפני Qwen3.8-Max ולפי ההשוואה של Tencent עצמה, גם לפני GPT-5.6 Sol. בכל שאר הממדים, שני הדגמים אינם באמת שקולים: GPT-5.6 Sol הוא דגם החזית הסגור, הדגל והנמדד באופן עצמאי של OpenAI, ו-Tencent HY4 Preview הוא דגם תצוגה מקדימה עם משקלים פתוחים של 770 מיליארד פרמטרים, ששוחרר הבוקר עם כרטיס תוצאות שדווח על ידי היצרן וללא אימות של צד שלישי.
אז השאלה המעניינת היא לא "איזה מודל חכם יותר" — אלא האם מתחרה במשקל פתוח, בערך בששית ממחיר הקלט של Sol, יכול לתבוע בצורה אמינה נתח מהחזית, ומה צוות צריך לעשות עם טענה שכעת אינה ניתנת לאימות.
הטענה שהופכת את זה להתמודדות אמיתית
Toolathlon-Verified מודד באיזו מהימנות מודל מניע כלי לאורך משימת סוכן מלאה — קורא תוצאות, מחליט על הקריאה הבאה, מתאושש משגיאות — ולא עד כמה הוא כותב פונקציה בודדת. זה חשוב, כי החלק הגדול ביותר מההוצאה בפועל על API במודלים פורצי דרך הולך ללולאות סוכן, לא להשלמות חד-פעמיות. הציון 74.1 של Tencent במדד הזה הוא הטענה הספציפית שהכניסה את HY4 Preview לשיחה של GPT-5.6 Sol, וכדאי להתעכב עליה לרגע: זה סוג המספר שאם הוא מחזיק מעמד תחת שכפול בלתי תלוי, הופך את שיחת העלות בין מודלים פתוחי-משקל למודלים סגורים פורצי דרך לממשית. אם הוא לא מחזיק מעמד, הוא הופך לכרטיס ניקוד ספקי נוסף שמתנדף תחת מעטפת בדיקה של צד שלישי.
שתי דרכים לקנות אינטליגנציה

• פרמטרים — HY4 Preview 770B סה"כ / 49B פעילים, משקלים פתוחים לעומת GPT-5.6 Sol, מספר הפרמטרים לא פורסם, API סגור
• הקשר — HY4 Preview יותר ממיליון טוקנים לעומת GPT-5.6 Sol 1.05 מיליון טוקנים, מקסימום פלט 128K
• מחיר למיליון — HY4 Preview ¥6 קלט / ¥18 פלט (≈$0.85 / $2.50) לעומת GPT-5.6 Sol $4.00 / $20.00 בשכבה הבסיסית, עולה ל-$8.00 / $30.00 עבור בקשות עם הקשר גדול, קריאות מטמון $0.40
• מצבי קלט — HY4 Preview: טקסט בלבד בתצוגה מקדימה זו, לעומת GPT-5.6 Sol: קלט טקסט ותמונה
• מצבי חשיבה — ל-HY4 Preview אין מקבילה שפורסמה לעומת מצב ה-Ultra של GPT-5.6 Sol (עד 16 סוכני משנה במקביל) ומאמץ חשיבה מקסימלי
• אימות בלתי תלוי — ל-HY4 Preview אין עדיין, לעומת GPT-5.6 Sol שמופיע בכל לוח תוצאות מרכזי, עם דירוג הקשר של 1.05M בקבוצה העליונה של מבחנים משולבים להקשר ארוך.
עמודת המחיר היא המקום שבו כל ההתמודדות מתנהלת. בשכבה הבסיסית, GPT-5.6 Sol עולה 4.00$ עבור מיליון טוקוני קלט ו-20.00$ עבור מיליון טוקוני פלט. Tencent HY4 Preview עולה כ-0.85$ ו-2.50$ לפי שערי החליפין הנוכחיים. עבור עומס עבודה שמעביר הרבה טוקוני פלט — וקידוד אג'נטי הוא בדיוק מקרה כזה — המודל בעל המשקולות הפתוחות מתומחר בערך בשמינית ממחירו של המודל הסגור, והפער הזה נשמר גם בהתחשב בהסתייגות שלפיה המספרים של Sol מגובים בהרבה יותר אימות.
היכן ש-GPT-5.6 Sol עדיין מחזיק ביתרון
אימות הוא היתרון הראשון. GPT-5.6 Sol נמצא בזמינות כללית מאז 9 ביולי, ונמדד באופן עצמאי מאז: 88.8 ב-Terminal-Bench 2.1 ביכולת חשיבה בסיסית, 91.9 במצב Ultra, 53.6 ב-Agents' Last Exam (שיא בעת ההשקה), 94.6 ב-GPQA Diamond, ו-64.6 ב-SWE-bench Pro. OpenAI מדווחת גם על שיפור של 54% ביעילות טוקנים במשימות תכנות סוכניות (agentic programming) בהשוואה לדגם הדגל הקודם שלה. אלה מספרים שאפשר למצוא משוכפלים מחוץ לתיעוד הרשמי של OpenAI, וזהו בדיוק המאפיין שחסר כיום ל-Tencent HY4 Preview.
יכולת היא היתרון השני, והוא מבני ולא שולי. GPT-5.6 Sol מקבל קלט תמונה; HY4 Preview הוא טקסט-בלבד בתצוגה המקדימה הזו, כאשר Tencent מודה שראייה תצטרך לחכות לשחרור המלא. GPT-5.6 Sol כולל מצב Ultra — תצורה מרובת-סוכנים שמתאמת סוכני-משנה מקבילים בעלות אסימונים גבוהה פי שלושה עד ארבעה, שימושית בדיוק למשימות ההנדסה ארוכות-הטווח שבהן שני המודלים היו מתחרים בפועל. בנוסף, מסלולי השימוש במחשב ובקריאות הכלים הפרוגרמטיות של Sol מתועדים, מנוסים בקנה מידה ייצור, ונבדקים תחת עומס. הטענה של Tencent לגבי Toolathlon-Verified, אם היא משתכפלת, מצמצמת את הפער בשימוש בכלים; היא לא סוגרת את הפערים הרב-מודליים או מרובי-הסוכנים, ש-HY4 Preview אינו מנסה לסגור.
היכן ש-HY4 Preview באמת מעניין
{{1}}הניחו בצד את תיאטרון ה-benchmark, ונותרו שלושה דברים אמיתיים. ראשית, המחיר: ב-¥6/¥18 — בערך $0.85/$2.50 — Tencent גובה פחות מכל מודל frontier מערבי על טוקני פלט בפקטור של ארבע עד שמונה, ופחות מעמיתיה הסיניים בעלי המשקלים הפתוחים על קלט.{{/1}} {{2}}שנית, המשקלים הפתוחים: MoE עם 49B פרמטרים פעילים ניתן לפריסה על צומת יחיד, בדרך שהארכיטקטורה הלא-חשופה של Sol לעולם לא תהיה, והמשקלים כבר זמינים ב-HuggingFace, ModelScope ו-GitHub.{{/2}} {{3}}שלישית, ההקשר והמסלול ההנדסי: DeepSWE 64.3 וחלון הקשר של 1M+ מכוונים לאותן עומסי עבודה סוכניים ארוכי-טווח שמצב Ultra של Sol מטרגט, בשבריר מהעלות.{{/3}}
האזהרה הכנה היא שכל זה לא שרד מגע עם בנצ'מרק עצמאי. סיפור האופטימיזציה העצמית שטנסנט מספר — רווח של 31.8% בתפוקה מקצה לקצה מהמודל שחוזר על ערימת ההסקה שלו — נמדד באופן פנימי. הניצחון במבחן העיוור על GLM 5.3 ו-Kimi K3 נערך באופן פנימי. כל דבר מעניין בנוגע ל-HY4 Preview הוא, נכון להיום, טענה.
ההחלטה
אם אתה בונה מערכת פרודקשן היום, GPT-5.6 Sol היא הבחירה המוצדקת, והיא נגישה דרך OrcaRouter במחיר המחירון המדורג של OpenAI עצמה — $4.00/$20.00 בשכבה הבסיסית, $8.00/$30.00 מעליה, כשהוא מועבר בלי שום תוספת מחיר, כך שכל שינוי מחיר של הספק נכנס לתוקף אצלנו באותו היום. אם זרימת העבודה שלך מבוססת-סוכנים ועמוסת כלים, המבנה המדורג של התמחור אומר שאתה צריך לבדוק את גדלי הקלט בפועל מול סף ה-$272K-טוקנים במקום להניח תעריף אחיד.
אם אתה מוכן להריץ {{1}}הערכת צל{{/1}}, HY4 Preview זול מספיק כדי ששווה לבצע אחת אמיתית: נתב את {{2}}עומס הקריאות לכלים{{/2}} שלך דרך Sol היום, הרץ את אותן פרומפטים מול HY4 Preview דרך ה-API של Tencent עצמו, והשווה במשימות בסגנון Toolathlon משלך. ואם {{3}}הציונים העצמאיים{{/3}} ינחתו במקום שבו Tencent אומרת שהם ינחתו, נתיב המעבר קצר — המודל הפתוח נכנס ל{{4}}ראוטר{{/4}} וכלל ה-failover שלך מחליף נקודות קצה, עם התעריף של הספק ¥6/¥18 המועבר ללא שינוי. זהו המבנה הכנה של המפגש הזה: {{5}}מודל frontier מאומת{{/5}} שאתה יכול לבנות עליו היום, מול אתגר פתוח לא מאומת שזול מספיק לבדיקה וממוקם כדי להפוך את שיחת המחיר לכזו שעוסקת בכל מחלקת המודלים הפתוחים.


מה לצפות
• השכפול העצמאי הראשון של Toolathlon-Verified. אם מסגרת בדיקה של צד שלישי מאשרת את HY4 Preview בציונים בשנות ה-70, הטענה ש"משקלים פתוחים לא יכולים לבצע שימוש סוכני בכלים" קורסת.
• האם Tencent תשחרר יכולות ראייה לפני השחרור המלא של Hy4. מצב טקסט בלבד מגביל את HY4 Preview לתת-קבוצה מצומצמת של עומסי העבודה ש-GPT-5.6 Sol מטפל בהם.
• חשבונות הטוקנים בפועל מהנטייה לחשיבה ארוכה של HY4 Preview. במחיר של ¥18 למיליון פלט, אימות עצמי מפורט אוכל את יתרון המחיר מהר יותר מאשר בדגם של $20.
• האם התמחור המדורג של Sol יעבור קיצוץ נוסף לפני ההשקה המלאה של Hy4. מצב ההעברה בנתב פירושו שירידה נראית באותו היום.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
