
Tencent Hy4 Preview פועל ב‑vLLM מהיום הראשון: ה‑MoE עם 770B משקלים פתוחים שבאמת אפשר לשרת
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
כאשר Tencent Hy4 Preview הושק ב־28 באוגוסט 2026, הוא עשה משהו שרוב דגמי הדגל ברמת frontier מדלגים עליו ביום הראשון: הוא הושק בר־הרצה. לצד המשקלים הפתוחים, Tencent וצוות vLLM פרסמו תמונת Docker מוכנה מראש, מתכון הגשה רשמי, ושילבו תמיכה בפריימוורק בתוך vLLM עצמו — כך שהדגם הפתוח הגדול ביותר שקו Hunyuan ייצר, עם 770 מיליארד פרמטרים בסך הכול ו־49 מיליארד פעילים לכל טוקן, עמד מאחורי נקודת קצה תואמת OpenAI על גבי ה־GPUs שלך תוך שעות מההכרזה. הסיפור של הרצה כבר ביום הראשון הוא החדשות שהפוסט הזה עוסק בהן, כי ”רץ ב־vLLM“ אינו הערת שוליים עבור דגם בגודל כזה. זה ההבדל בין הודעה לעיתונות לבין דבר שאפשר להעלות לייצור.
שאר ההשקה היא חבילה טיפוסית של תצוגה מקדימה, והאזהרות חשובות לא פחות מהמספרים. טנסנט מכנה את Tencent Hy4 Preview איטרציה מוקדמת, מסמנת חשיבה ארוכה מדי ואימות עצמי מופרז כהתנהגות ידועה, ומפרסמת טבלת בנצ'מרקים שמבוססת כולה על דיווח עצמי — אף מעבדה עצמאית לא דירגה אותו עדיין, והמודל בן יומיים נכון לכתיבת שורות אלה. שום דבר מזה לא משנה את השורה התחתונה המעשית: המשקולות הן ברישיון Apache 2.0, חלון ההקשר הוא מיליון טוקנים, ותמיכת vLLM מהיום הראשון פירושה שמסלול האירוח העצמי הוא אמיתי ולא רק שאיפה.
מה זה בעצם Tencent Hy4 Preview
טנסנט מציגה את Tencent Hy4 Preview כיורשת של Hy3 (295B סה"כ, הקשר של 256K), תוך הכפלה בערך של קיבולת פעילה והכפלה פי ארבעה של חלון ההקשר. הארכיטקטורה ראויה לקריאה שורה אחר שורה, כי כל שורה משנה מה מודל במשקלים פתוחים רשאי לעשות על החומרה שלך.
ארכיטקטורה — Mixture-of-Experts עם 770B פרמטרים בסך הכול ו-49B פעילים לכל טוקן, על פני 78 שכבות. השכבה הראשונה היא צפופה (dense); 77 השכבות האחרות מנתבות כל טוקן דרך 256 מומחים מנותבים (routed experts) בתוספת מומחה משותף אחד, ומפעילות את 8 המובילים. יחס הדלילות הזה, בערך 16:1, הוא מה ששומר על עלות ההסקה בטווח שצוות רציני יכול בפועל להריץ.
• חלון הקשר — 1,048,576 טוקנים באופן מקורי, אחד הרחבים ביותר מבין כל המודלים בעלי המשקלים הפתוחים. מאגר קוד מלא, רפקטורינג רב-קבצים, אצווה של מסמכים ארוכים: בעיות של בקשה אחת.
• קשב — Gated DeepSeek Sparse Attention (Gated DSA) עם IndexCache, עיצוב קשב דליל שמחשב אינדקס דליל חדש רק על 21 מתוך 78 השכבות ועושה בו שימוש חוזר על 57 האחרות. זו הסיבה ששרת אותו אינו רק "vLLM גדול יותר" — הוא דורש קצה אחורי שמבין קשב דליל.
• פענוח ספקולטיבי מובנה — שכבת MTP (חיזוי רב-טוקנים) של כ-10B סה"כ / 0.7B פרמטרים פעילים יושבת בתוך המודל, כך ש-vLLM ו-SGLang יכולות לנסח טוקנים מבלי שתצטרכו לארח מודל טיוטה נפרד.
• משקלים — Apache 2.0, בפורמטים BF16 ו-FP8, שפורסמו ב־Hugging Face, ModelScope, GitCode ו־CNB.
מה "day-zero vLLM" בעצם אומר
תמיכת המסגרת הממוזגת ביום ההשקה היא האירוע הקונקרטי שמאחורי האות — השינוי ב-vLLM שמוסיף את Tencent Hy4 Preview (PR #54160) נחת באותו חלון זמן של המהדורה, והמתכון הרשמי מיועד ל-vLLM 0.29.0 ואילך. בפועל, משמעות הדבר היא שנתיב ההגשה הוא פקודה אחת, לא שבוע של ניפוי באגים בקרנל.
docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview
הדגלים חשובים, וכל אחד מהם מתמפה למשהו במודל במקום להיות קוד תבניתי:
• --attention-backend FLASHMLA_SPARSE — חובה, לא אופציונלי. תשומת הלב הספarse מסוג Gated DSA של Tencent Hy4 Preview אינה פועלת כראוי על מנועי הצפיפות (dense) ברירת המחדל, ודגל זה הוא מה שהמתכון הרשמי קובע.
• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — מפעיל את שכבת ה-MTP המובנית של המודל לצורך פענוח ספקולטיבי, שלושה טוקני דראפט קדימה. אין צורך במודל דראפט נפרד לפריסה.
• --tool-call-parser hy_v4 ו--reasoning-parser hy_v4 — המפענחים המותאמים אישית שאומרים לשרת כיצד Tencent Hy4 Preview פולט קריאות לכלים ואת שרשרת החשיבה שלו, כאשר --enable-auto-tool-choice מאפשר למודל להחליט מתי לקרוא לכלים.
Tencent ממליצה על temperature 0.9 ו-top_p 1.0 לדגימה (sampling). החשיבה (reasoning) מוגדרת כברירת מחדל למאמץ "גבוה" של chain-of-thought המיועד למתמטיקה, קוד ומשימות מורכבות; אם רוצים תשובה ישירה ללא החשיבה הארוכה, מעבירים בבקשה reasoning effort מסוג no_think במקום להחליף משקלים.

תמיכה ביום האפס אינה בלעדית ל-vLLM, וזה כשלעצמו ראוי לציון עבור גרסה כה טרייה. SGLang שחררה תמונת ריבוי-ארכיטקטורות מובנית מראש (lmsysorg/sglang:hy4-preview) עם פענוח ספקולטיבי בסגנון NEXTN באותו יום, ומערכת האקוסיסטם של Ascend השיגה תמיכה ביום האפס באמצעות vLLM-Ascend עם משקלים מכוונטים בכמת W8A8 על פני 16 NPUs מסוג Atlas 800I A3. שחרורים עם משקלים פתוחים בדרך כלל דורשים שבועות עד שמערכת השרתים מדביקה את הפער; הפעם זה לקח שעות.
הציונים ששווה לצטט
כל benchmark שטנסנט פרסמה עבור Tencent Hy4 Preview מדווח על ידי הספק עצמו — הוא רץ על מערך ההערכה הפרטי של טנסנט, לא שוחזר על ידי שום מעבדה בלתי תלויה, והמודל נמצא ברשות הציבור כבר יומיים. יש לקרוא אותם כתקרה שטנסנט מאמינה שהשיגה, לא כעובדה מוכחת. אימות בלתי תלוי לא יתקיים עד שגורם שלישי יריץ את המודל; שום דבר בלוחות התוצאות הציבוריים אינו משקף את המודל הזה עדיין.

הנתון המרכזי הוא Terminal Bench 2.1, מבחן שבוחן עד כמה מודל מתפעל טרמינל אמיתי בזמן כתיבת קוד. טנסנט מדווחת על Tencent Hy4 Preview עם ציון 85.4, שלטענתה משיג תיקו עם Claude Opus 5 ועוקף את DeepSeek V4 Pro, וגם מנצח את קודמו Hy3 ב-14.6 נקודות. המספר הבודד הזה נושא את ההשקה — זוהי הטענה שמציבה מודל פתוח-משקולות בשוויון עם מודלי הקצה הסגורים היקרים ביותר במבחן קידוד-סוכן קשה — וזוהי הטענה שהכי זקוקה לאישור בלתי-תלוי.
שאר הטבלה הפנימית, כל המספרים של טנסנט עצמה: DeepSWE, מדד להנדסת תוכנה, קופץ מ-28.0 ב-Hy3 ל-64.3. SWE-bench Pro מגיע ל-65.7 ו-SWE-bench Multilingual ל-82.9. ב-Toolathlon-Verified, מבחן קריאה לכלים, טנסנט מדווחת על 74.1, שלדבריה עוקף את Qwen 3.8 Max ואת GPT-5.6 Sol ומתקרב ל-Kimi K3 ול-Claude Opus 5. ב-APEX-Agents pass@1 היא נוחתת על 37.1, במעט אחרי 37.2 של Kimi K3. ובהערכה עיוורת פנימית נפרדת, 163 מומחים שגויסו על ידי טנסנט דירגו 203 משימות הנדסה ב-2.99 מתוך 4.00, תוך עקיפת 2.92 של GLM-5.3 ו-2.94 של Kimi K3.
שני דפוסים ראויים לציון. כל מספר חזק הוא על עבודת הנדסה סוכנותית — נהיגה בטרמינל, קריאה לכלים, משימות בקנה מידה של מאגר קוד — ואף אחד מהם אינו על ידע או חשיבה גנריים, מה שמתאים למיצוב הפרודוקטיביות ולא למקריות. וטנסנט מתארת את DeepSWE ואת האחרות כמצמצמות פערים, לא כסוגרות אותם; טענת השוויון הנקייה והסחירה היחידה היא התיקו במבחן Terminal Bench 2.1, וזו הטענה שהכי כדאי לבחון עם עומס העבודה שלך.
כמה זה באמת עולה להפעיל
החשבון של אירוח עצמי הוא הדבר הראשון שצריך להיות כנים לגביו. זה לא מודל שרץ על GPU יחיד וזה לא מודל שולחני. ה-checkpoint בפורמט FP8 קרוב לטרה-בייט של משקלים, והמתכון הרשמי מניח מקביליות טנזורית של 8 — שמונה GPUs בעלי רוחב פס גבוה עם חיבורים מהירים (החומרה של Tencent להתייחסות ל-FP8 היא 8×B300, בעוד ש-BF16 מלא דורש 16×B200). אם אין לכם את היקף החומרה הזה, לא תוכלו לארח את המודל בעצמכם בזול, ומנגנון הקשב הדליל (sparse attention) אומר שאין קיצור דרך לזיכרון של מטמון ה-KV בהקשר של מיליון טוקנים.
תוספת אחת לשבוע ההשקה משנה חלק מהחישוב הזה עבור צוותים שרוצים את המשקלים הפתוחים בלי טביעת הרגל של דגם הדגל. צוות Hy של Tencent שחרר build GGUF דחוס של Tencent Hy4 Preview, שדחס את השחרור של כ-1.5 TB ב-BF16 לכ-200 GiB עם סכמת כימות מעורב לכל שכבה בשם MIX-STQ1_0 — רוב טנסורי המומחים יורדים לכ-1.3 סיביות, בעוד שכבות קריטיות לזרם השיורי שומרות על דיוק גבוה יותר. בהערכות של Tencent עצמה, תנועת הדיוק קטנה — SWE-bench Multilingual מ-82.9 ל-81.3, MCP Atlas מ-83.7 ל-83.2, IFBench מ-73.5 ל-72.5 — פשרה שהיצרן מכנה כמעט ללא אובדן. אלה המספרים של Tencent על התצורה של Tencent, שעדיין לא שוחזרו. דגם של 200 GiB הוא עדיין לא דגם של GPU יחיד, אבל הוא הימור קטן משמעותית מאשר checkpoint של כמעט טרה-בייט ב-FP8, והוא מביא את מסלול המשקלים הפתוחים להישג ידה של ערכת GPU מרובת-כרטיסים קטנה יותר מזו שהמתכון של שמונת B300 מניח.
{{1}}מסלול ה-API הוא המקום שבו המחיר נהיה מעניין.{{/1}} {{2}}ב-TokenHub של Tencent Cloud, Tencent Hy4 Preview מתומחר ב-{{/2}}{{3}}6 יואן (~0.83 דולר) למיליון אסימוני קלט{{/3}}, {{4}}18 יואן (~2.50 דולר) למיליון אסימוני פלט{{/4}}, {{5}}ו-0.3 יואן (~0.04 דולר) למיליון אסימונים לפגיעות מטמון{{/5}}. {{6}}פלט במחיר של כ-2.50 דולר למיליון נמוך בהרבה מ-{{/6}}{{7}}מחיר הפלט של 25 דולר למיליון של מודל חזית סגור מוביל{{/7}}, {{8}}ושיעור פגיעות המטמון הזול הופך לולאות סוכן ארוכות{{/8}} — {{9}}שבהן אותה הנחיית מערכת וקידומות שיחה נשלחות שוב ושוב{{/9}} — {{10}}למחירים נוחים במיוחד{{/10}}.
טנסנט מציעה גם גישה חינמית לשבועיים ל-Tencent Hy4 Preview בתוך WorkBuddy וב-CodeBuddy כל עוד המודל חדש, כך שהדרך הזולה ביותר לנסות אותו השבוע היא בחינם — ו-WorkBuddy היא המקום שבו המיצוב סביב פרודוקטיביות הופך לקונקרטי. בכל שיחה ב-WorkBuddy בורר המודלים עובר בין Hy3 ל-Hy4 preview, כך שההפרדה בין עבודת פרודוקטיביות משרדית וניתוח מצד אחד לבין כתיבת קוד מצד שני היא בחירה פרטנית לכל משימה, ולא החלטת פריסה. ההפרדה הזו תואמת את היעד שטנסנט כיוונה למודל, ובדיקות מעשיות ב-WorkBuddy מראות שהוא מייצר בניסיון אחד תוצרים מורכבים — אב-טיפוס משחק בר-משחק בסגנון low-poly מפרומפט בודד, סקירה עסקית רבעונית מלאה שהורכבה מעשרה קבצים מצורפים ללא כל התערבות ידנית, ובהדגמת הבודק שהופצה השבוע, סימולציית חור שחור. אלה תצפיות של הקהילה על האפליקציה של טנסנט עצמה, ולא אמות מידה של ספקים — אבל הן האותות המעשיים הראשונים למה שהמודל עושה במשימות אמיתיות מרובות-שלבים, ואפשר לשחזר אותן בחינם לפני שתוציאו כסף.
החלטת העלות היא בדיוק הנקודה שבה שכבת ניתוב משנה את המשוואה, ואנחנו נהיה כנים לגבי החלק שלנו בכך: OrcaRouter עדיין לא מנתב את Tencent Hy4 Preview, מכיוון ש-Tencent לא פתחה את המודל הזה לפלטפורמות הסקה של צד שלישי — הוא רץ על נקודת הקצה TokenHub של Tencent Cloud ועל פריסות באירוח עצמי של המשקולות הפתוחות, ואנחנו לא מתיימרים לשרת את מה שאיננו משרתים. מה ששכבת הניתוב מביאה הוא מסגרת ההחלטות סביב זה. אם אתם בוחרים בין צומת של 8 GPU לבין API, אותה משמעת העברה ישירה ששאר הקטלוג פועל על פיה תחול ביום שבו Tencent תפתח את זה: OrcaRouter מעביר את מחירי המחירון של הספק באפס תווך, כך שהורדת מחיר של ספק נכנסת לתוקף אצלנו באותו היום במקום להימכר מחדש עם תווך. ובשביל מודל בן יומיים שהראייה היחידה שלו היא אמות המידה של הספק שלו, מעבר גיבוי אוטומטי הוא הדרך הבטוחה לבדוק אותו — שימו את המודל המוכח על הנתיב הקריטי שלכם ואת Tencent Hy4 Preview לצידו, תוך מעבר אליו במשימות שבהן פרופיל העלות שלו מנצח וחזרה למודל המוכח ברגע שהוא לא מנצח, הכל דרך API אחד ומפתח אחד.

המגבלות שלא נכנסות בדף המפרט
Tencent מפרטת את המגבלות הידועות באופן ברור, והן אמורות לעצב כל החלטת פריסה. Tencent Hy4 Preview הוא מודל טקסט, ונקודה — ללא קלט חזותי או מולטי-מודאלי — כך שכל מה שקשור לתמונות או וידאו שייך למודל אחר. Tencent גם מצביעה על התנהגות התחלה איטית במשימות מורכבות (חשיבה ארוכה לפני הפלט הראשון) ועל נטייה לאימות-עצמי מוגזם, שורפת טוקנים בבדיקה כפולה של עבודה שכבר בוצעה. השילוב הזה שגוי לחלוטין עבור צ'אט רגיש להשהיה וסביל לחלוטין עבור עבודת הנדסה אצוותית לא מקוונת, וזה אומר לך היכן Tencent מצפה שתפעיל אותו.
שתי טענות בחומר ההשקה ראויות לתשומת לב נפרדת, משום שהן עוסקות באופן שבו נבנה המודל, ולא בתוצאות שהשיג. Tencent אומרת כי Tencent Hy4 Preview השתתף בפיתוח העצמי שלו — הוא סייע לייעל את שיטות האימון, אסטרטגיית הנתונים, מסגרות ההערכה והאופרטורים ברמה הנמוכה שייצרו אותו, לולאה מוקדמת של שיפור עצמי רקורסיבי — וכי הוא ייעל באופן אוטונומי את מערכת ההסקה שלו, עם שיפור של 31.8% בתפוקה מקצה לקצה לעומת קו הבסיס. בצד המדעי, Tencent מדווחת כי היא קידמה את החסם התחתון הידוע של בעיית Blaschke–Lebesgue בגאומטריה קמורה מ-0.380799 ל-0.41104, והשיגה תאוצה של פי 2.0 בסימולציה של דו-שכבה פוספוליפידית בת 32,512 אטומים, עד ל-54.9 מילישניות לשלב. כמו כל דבר אחר ביום הראשון, אלה הם הדיווחים העצמיים של Tencent.
והחסר החשוב ביותר הוא אימות. אין עדיין ציונים בלתי תלויים ל־Tencent Hy4 Preview בשום מקום — לא בלוח תוצאות ציבורי, לא ממעבדת הערכה של צד שלישי, ולא בערך של Artificial Analysis. המודל חדש מדי בשביל זה. המבחן העיוור הפנימי של המומחים הוא אות שימושי לגבי האופן שבו המעריכים של Tencent עצמה רואים אותו מול GLM-5.3 ו־Kimi K3, אבל אלה המעריכים של Tencent על משימות של Tencent. כל מה שמעל לגיליון המפרט הוא טענה שממתינה לבדיקה.
מי צריך להריץ את Tencent Hy4 Preview השבוע?
התשובה הכנה מתחלקת השבוע לשלוש קבוצות, ובאחת מהן אין צורך בחומרה כלל. אם אתה רק רוצה להרגיש מה Tencent Hy4 Preview עושה, הגישה החינמית ל-WorkBuddy היא הדרך המהירה ביותר — בלי GPU, בלי מפתח API, פותחים שיחה, מעבירים את בורר הדגם ל-Hy4 preview, ונותנים לו משימת Work או Coding. אם יש לך GPUs ואתה מריץ עומסי עבודה הנדסיים באצוות — משימות סוכן ארוכות-טווח, ניתוח בקנה מידה של מאגר קוד, הערכה אופליין — הדגם שווה בדיקה רצינית כבר עכשיו: המשקולות פתוחות, חלון ההקשר הוא בקנה מידה של מאגר קוד, מסלול ה-vLLM הוא פקודה אחת, וגרסת ה-GGUF של שבוע ההשקה מורידה את רף החומרה לניסוי. אם אתה מריץ צ'אט פרודקשן רגיש לשהייה, או משהו מולטי-מודאלי, או משהו שבו אתה לא יכול להרשות לעצמך דגם שההוכחה היחידה שלו היא אמות המידה של הספק עצמו — חכה: Tencent עשתה איטרציות בערך כל חודשיים מאז פברואר, וכבר אמרה שהאצווה הבאה של דגמי Hy4 בדרך, כך שהתצוגה המקדימה היא במפורש איטרציה מוקדמת.
{{1}}לכל השאר, הגישה השימושית היא תבנית ניתוב: הוכח אותו לצד מודל שאתה כבר סומך עליו, בעלות שאתה יכול להתרחק ממנה, והרחב אותו רק היכן שהמספרים שלו מחזיקים מעמד על עומס העבודה שלך.{{/1}} {{2}}לשם כך קיים ראוטר — ביום שטנסנט תפתח את המודל הזה להסקה של צד שלישי, הוא יצטרף לקטלוג של API אחד, יותר מ-200 מודלים, העברת מחירי רשימה כמו כל מודל אחר, וכלי ה-failover וההרכבה כבר יהיו במקום.{{/2}} {{3}}עד אז, המשקלים נמצאים ב-Hugging Face, ה-API נמצא ב-Tencent Cloud, והניסיון החינמי נמצא ב-WorkBuddy — והטענה שמודל במשקלים פתוחים הגיע לדרגה העליונה של קידוד סוכני קיבלה סוף סוף מספר ספציפי לצידה.{{/3}} {{4}}המספר הוא של טנסנט.{{/4}} {{5}}המבחן הוא שלך.{{/5}}
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
