
Tencent Hy4 Preview נפתח: 770B MoE עם חלון הקשר של מיליון טוקנים ב-¥6 למיליון טוקני קלט
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
Tencent Hy4 Preview, ששוחרר לציבור עם קוד פתוח ב-28 באוגוסט 2026, הוא דגם הדגל השלישי של Tencent בתוך שישה חודשים, וזה הדגם שמפסיק להיות אבן דרך מחקרית והופך לאירוע תמחור. זהו מודל mixture-of-experts עם 770 מיליארד פרמטרים — 49 מיליארד פעילים לכל טוקן — וחלון הקשר מובנה של מיליון טוקנים, ששוחרר תחת רישיון Apache License 2.0 בפורמטים BF16 ו-FP8, וזמין להורדה היום מ-Hugging Face, GitHub, ModelScope ו-GitCode. ו-Tencent מתמחרת אותו ב-6 יואן למיליון טוקני קלט ו-18 יואן למיליון טוקני פלט, בערך 0.83 ו-2.50 דולר אמריקאי, מה שמציב דגם פתוח ברמה הגבוהה ביותר מתחת כמעט לכל דגם frontier סגור בשוק. שחרור אחד, שלוש פנים: משקולות פתוחות שאפשר להריץ בעצמך, API ב-TokenHub של Tencent Cloud, ואותן משקולות שכבר פעילות בתוך המוצרים של Tencent עצמה — WorkBuddy, CodeBuddy, Yuanbao ו-ima. הנה מה שנשלח בפועל, מה Tencent טוענת שהוא משיג, ומה שאף אחד עוד לא אימת.
הסיפור ההנדסי חשוב יותר מספירת הפרמטרים, כי כל חלק הוא מנוף על העלות. המודל בעומק 78 שכבות: השכבה הראשונה היא רשת הזנה-קדימה צפופה רגילה, ו-77 השכבות הנותרות הן שכבות MoE עם 256 מומחים מנותבים ועוד מומחה משותף אחד בכל אחת, שמפעילות את 8 המומחים המנותבים המובילים לכל טוקן. יחס הדלילות של בערך 16:1 הוא מה שהופך מודל 770B לכדאי להגשה — רק פרוסה של 49B עובדת על כל טוקן נתון. שכבה ייעודית לניבוי רב-טוקני (10B פרמטרים, 0.7B פעילים) מאפשרת פענוח ספקולטיבי, וערימת הקשב משתמשת ב-gated DeepSeek Sparse Attention עם IndexCache כדי לרסן את השימוש בזיכרון להקשר ארוך. החשיבה ניתנת למיתוג בין מצב חשיבה ארוכה code>high/code> מצב, ומצב חוסך טוקנים code>no_think/code> מצב. הפרטים האלה הם שקובעים האם המחיר המוצהר שורד מגע עם עומס עבודה אמיתי, לא אם המודל יכול לכתוב הייקו.
גיליון המפרט המבואר
קרא את הערות השחרור שורה אחר שורה, כי כל שורה משנה בשקט את מה שמודל במשקלים פתוחים רשאי לעשות.
• פרמטרים — 770B סך הכול, 49B פעילים לכל טוקן, יחס דלילות של ~16:1 ששומר על עלות ההפעלה בטווח שצוות קטן באמת יכול להרשות לעצמו.
• הקשר — חלון מקורי של 1,048,576 טוקנים, פי ארבעה מה־256K של Hy3. מאגר קוד מלא, ריפקטורינג רב־קבצים, חבילה פיננסית של 72 מסמכים — בעיות הניתנות לפתרון בבקשה אחת.
• רישיון — Apache License 2.0 הן עבור הגרסה המקורית של BF16 והן עבור המהדורה המקוונטטת של FP8, כלומר אירוח עצמי, כוונון עדין ושימוש מסחרי ללא סעיף קנייני.
• סטאק ההסקה — טנסנט מפרטת את vLLM ו-SGLang כמסגרות הסרווינג הנתמכות, שתי המסגרות שהאקוסיסטם של המשקלים הפתוחים מאמץ בפועל כסטנדרט.
• API — נקודת הקצה TokenHub של Tencent Cloud במחיר של ¥6 למיליון אסימוני קלט, ¥18 למיליון אסימוני פלט, ¥0.3 למיליון על פגיעות מטמון.
• אינטגרציית מוצר — אותם משקלים שטנסנט משלחת ב-WorkBuddy, CodeBuddy (מקומי ובינלאומי), Yuanbao וב-ima הם אלה שאפשר לשלוף ולהריץ. CodeBuddy יזכה לניסיון חינם של שבועיים עם המודל בהשקה.
טנסנט מדווחת גם על נתון הנדסת הסקה שכמעט אף פעם לא מופיע בהודעת השקה: שיפור של 31.8% בתפוקה מקצה לקצה בזכות איחוד אופרטורים ואופטימיזציית תקשורת. זהו סוג הפרט שמבדיל בין מודל שמעבדה משחררת כפריט מחקרי לבין מודל שחברה מצפה שיעמוד בעומסי ייצור. ביום הראשון, זה גם בדיוק סוג הטענה שאיש מחוץ לטנסנט עוד לא מדד.
הציונים ששווה לצטט
כל מדד ביצועים שטנסנט פרסמה עבור Tencent Hy4 Preview הוא דיווח עצמי של הספק — הוא בוצע על סביבת ההערכה של טנסנט עצמה, לא שוכפל על ידי אף מעבדה עצמאית, והמודל פומבי פחות מיום. יש לקרוא אותם כגבול העליון שטנסנט מאמינה שהשיגה.

נתון הכותרת הוא Terminal Bench 2.1, מבחן הבודק עד כמה מודל מפעיל טרמינל אמיתי בזמן כתיבת קוד. Tencent מדווחת על 85.4, שלטענתה משווה ל-Claude Opus 5 ועוקפת את DeepSeek V4 Pro, וגוברת על קודמו שלה Hy3 ב-14.6 נקודות. המספר הבודד הזה עושה עבודה רבה — זוהי הטענה שמעמידה מודל בעל משקלים פתוחים בשוויון עם מודלי הקצה הסגורים היקרים ביותר במבחן קידוד-סוכני קשה — וזוהי הטענה שהכי זקוקה לאישור בלתי-תלוי. יתרת הטבלה הפנימית: DeepSWE קופץ מ-28.0 על Hy3 ל-64.3, ש-Tencent מתארת כ"צמצום הדרגתי של הפער" מול מודלים מהדרג הראשון; Toolathlon-Verified, מבחן קריאה לכלים, נוחת על 74.1; APEX-Agents pass@1 על 37.1, במרחק שיער מאחורי 37.2 של Kimi K3; SWE-bench Pro על 65.7 ו-SWE-bench Multilingual על 82.9. במבחן עיוור פנימי נפרד, 163 מומחים דירגו 203 משימות הנדסה ב-2.99 מתוך 4.00, כשהיא גוברת בשוליים על 2.92 של GLM-5.3 ועל 2.94 של Kimi K3.
שני דפוסים בולטים. ראשית, כל מספר חזק הוא על עבודת הנדסה סוכנותית — הפעלת טרמינל, קריאה לכלים, משימות בקנה מידה של מאגר קוד — ואף אחד מהם אינו על צ'אט כללי או ידע, בהתאם למיצוב של Tencent את המודל כ"בנוי לפרודוקטיביות" בתחומי הנדסת תוכנה, משרד וניתוח נתונים, פיתוח משחקים ומחקר מדעי. שנית, Tencent מקפידה לתאר את DeepSWE ואת השאר כמצמצמים את הפערים, לא כסוגרים אותם. טענת השוויון הנקייה והשיווקית היחידה היא השוויון ב-Terminal Bench 2.1, וזו הטענה שהכי כדאי לבדוק עם עומס העבודה שלך.
מה באמת אפשר לקנות תמורת 6 יואן למיליון
התמחור הוא המקום שבו ההשקה מפסיקה להיות מעניינת ומתחילה להיות משבשת. ב-18 יואן למיליון אסימוני פלט — כ-2.50 דולר — סשן קידוד אוטונומי ארוך ששורף מיליון אסימוני פלט עולה בערך עשירית מהעלות של אותו סשן במודל חזית סגורה מוביל, ותעריף פגיעת המטמון של 0.3 יואן הופך את הנחיות המערכת שנשלחות מחדש ואת קידומות השיחה בלולאה אוטונומית לזול בהרבה מהמטמון של רוב המתחרים. הדמו של Tencent עצמו מציג את המודל מעכל 72 מסמכים פיננסיים במעבר בודד; בתעריפים אלה, אצווה כזו היא משימה יומית משתלמת במקום סעיף תקציבי.
{{1}}כאן גם שכבת הניתוב משנה את החישוב, וכדאי לדייק בנקודה הזו.{{/1}} OrcaRouter אינו מנתב עדיין את Tencent Hy4 Preview — טנסנט לא פתחה את המודל הזה לפלטפורמות הסקה של צד שלישי, ולכן הוא פועל על נקודת הקצה TokenHub של Tencent Cloud ועל פריסות באירוח עצמי של המשקולות הפתוחות, ואיננו טוענים שאנו מגישים מה שאיננו מגישים. {{2}}אבל המשמעת שהופכת קיצוץ מחיר למשמעותי היא אותה משמעת שכל שאר הקטלוג פועל על פיה: OrcaRouter מעביר את מחירי המחירון של הספקים כפי שהם, ללא תוספת רווח, כך שכאשר ספק מתמחר אסימון ב-6 יואן, הסכום שאתם משלמים אצלנו הוא 6 יואן, לא גרסה שנמכרת מחדש עם תוספת מחיר — וביום שספק משנה מחיר, השינוי פעיל אצלנו באותו יום.{{/2}} {{3}}API אחד ל-200+ מודלים, מעבר אוטומטי בין ספקים כשאחד נתקע, ו-DSL לניתוב שמרכיב מודלים לקריאה אחת: זה המנגנון שיישא את Tencent Hy4 Preview ברגע שטנסנט תפתח אותו, וזה המנגנון שכבר אפשר להשתמש בו כדי להריץ מודל חדש ובלתי מוכח לצד מודל מוכח, בלי להמר על נתיב הייצור שלכם באף אחד מהם.{{/3}}

הטענות הראויות לקריאה שנייה
שני דברים בחומר ההשקה עוסקים באופן שבו נבנה המודל, לא במה שהוא קלע, והם ראויים לתשומת לב נפרדת.
הראשון הוא לולאת השיפור העצמי. טנסנט אומרת ש־Tencent Hy4 Preview השתתף במחקר ובפיתוח של עצמו — הוא שימש לייעול שיטות האימון, אסטרטגיית הנתונים, מערכות ההערכה והאופרטורים ברמה הנמוכה שהפיקו אותו. זהו מחזור ראשוני של שיפור עצמי רקורסיבי: מודל שעוזר לתכנן את הגרסה הבאה של עצמו, וטנסנט מפרסמת זאת כיכולת שנמסרה ללקוחות. זו טענה גדולה, והיא מבוססת כולה על דיווח עצמי.
התוצאה השנייה היא בתחום המתמטיקה. Tencent מדווחת שהמודל קידם את החסם התחתון הידוע של בעיית בלשקה–לבג — שאלה פתוחה ותיקה בגאומטריה קמורה על הגוף בעל הנפח המינימלי ברוחב קבוע — מ-0.380799 ל-0.41104, ובכך מקרב אותו למרחק של כ-2% מהשערת טטרהדרון מייסנר. Tencent מדווחת גם על האצה של פי 2.0 בסימולציה של דו-שכבה פוספוליפידית בת 32,512 אטומים, עם ירידה ל-54.9 מילישניות לצעד. תוצאות כאלה בדרך כלל מזכות את המודל במאמר משלו; כאן הן נקודות השקה, וכמו כל דבר אחר ביום הראשון, הן דיווח עצמי של Tencent.
הפערים הכנים
טנסנט מפרטת את המגבלות הידועות בגילוי לב. אין קלט חזותי או מולטי-מודאלי — Tencent Hy4 Preview הוא מודל טקסט, נקודה. כל מה שקשור לתמונות או וידאו שייך למודל אחר. טנסנט גם מציינת התנהגות התנעה איטית במשימות מורכבות — חשיבה ארוכה לפני הפלט הראשון — ונטייה לבדיקה עצמית מוגזמת, ששורפת טוקנים בבדיקה חוזרת של עבודה שכבר בוצעה. השילוב הזה שגוי לחלוטין עבור צ'אט רגיש לשהייה וסביר לחלוטין עבור עבודת הנדסה אצוותית לא מקוונת, מה שאומר לך היכן טנסנט מצפה שתפעיל אותו.
וההיעדר החשוב ביותר הוא אימות. אין עדיין ציונים בלתי תלויים ל-Tencent Hy4 Preview בשום מקום — לא בלוח תוצאות ציבורי, לא ממעבדת הערכה של צד שלישי. המודל חדש מדי. המבחן העיוור של מומחים פנימיים הוא אות שימושי לגבי האופן שבו הסוקרים של Tencent עצמם רואים אותו מול GLM-5.3 ו-Kimi K3, אבל אלה הם הסוקרים של Tencent על המשימות של Tencent. כל מה שמעל לגיליון המפרט הוא טענה הממתינה לבדיקה.

איך באמת לנסות את זה היום
הנתיב המעשי קצר. הורידו את המשקלים מ־Hugging Face, GitHub, ModelScope או GitCode ושרתו אותם עם vLLM או SGLang; קראו ל־API של TokenHub של Tencent Cloud אם אתם רוצים נקודת קצה מתארחת במחיר המחירון; או השתמשו בו בתוך CodeBuddy או WorkBuddy, שם Tencent מריץ ניסיון חינם של שבועיים. הגישה החינמית למודל Hy3 נמשכת עד 30 בספטמבר, והקצב של Tencent עצמו — בערך איטרציה מרכזית אחת בכל חודשיים — מצביע על כך שגרסת Hy4 מלאה תגיע זמן קצר אחרי התצוגה המקדימה.
הסיכום הכנה: מודל בעל משקלים פתוחים, 770B, עם הקשר של מיליון טוקנים, במחיר של ¥6 למיליון טוקני קלט, הוא דבר אמיתי שקיים נכון להיום, והמדד החזק ביותר שמצורף אליו הוא טענת ספק על שוויון עם מודל חזיתי סגור שאיש לא שחזר עדיין. הורידו אותו, הריצו את הבדיקה שבאמת חשובה לכם, ותנו לראיות להכריע האם המחיר נשאר הסיפור.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
