
תצוגה מקדימה של Tencent HY4 לעומת Kimi K3: מבחן העיוור שטנסנט בחרה לפרסם
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
התמודדות Tencent HY4 Preview מול Kimi K3 היא ההתמודדות היחידה בהשקת המודל הזה שטנסנט עצמה בחרה להריץ. במבחן העיוור הפנימי שלה — 163 מהנדסים, 203 משימות הנדסה, ניקוד בסולם של ארבע נקודות — HY4 Preview קיבלה 2.99/4.00 לעומת 2.94 של Kimi K3, והכותרת של טנסנט כינתה זאת ניצחון. האותיות הקטנות של הניצחון הזה שוות קריאה איטית: HY4 Preview ניצחה את Kimi K3 ב-51.2% מהמשימות, השיגה תיקו ב-7.9%, והפסידה ב-40.9%. שיעור ניצחון נטו של 10 נקודות הוא אמיתי, אבל זה יתרון דק מול מודל עם שליש מכלל הפרמטרים ופחות ממחצית הפרמטרים הפעילים — וכל המבחן נוהל על ידי טנסנט.
קימי K3 הוא דגם הדגל הפתוח של Moonshot עם 2.8 טריליון פרמטרים, המודל הפתוח הגדול ביותר ששוחרר אי פעם, ונקודת ההתייחסות שכל מעבדה סינית מודדת את עצמה מולה מאז ה-16 ביולי. Tencent בחרה בו כיריב כי הוא הסטנדרט הפתוח — וזה הופך את העבודה של המאמר הזה לקונקרטית במיוחד: קוראים את המפגש הישיר היחיד שהמאתגר עצמו בחר להציע, ומחליטים מה הוא שווה.
המדד שטנסנט בחרה לפרסם
המבחן העיוור נוקד על ידי המהנדסים של Tencent עצמם במשימות ההנדסה של Tencent עצמם, וזה הדבר הראשון שצריך להפחית מערכו. מערכת משימות שנבחרה על ידי החברה היא בדיוק הסביבה שבה מודל חדש מציג את הביצועים הטובים ביותר שלו. גם אם מקבלים את זה, צורת התוצאה אינפורמטיבית: 51.2% ניצחונות מול 40.9% הפסדים הוא מרווח צנוע, ושיעור התיקו של 7.9% מראה שהמודלים קרובים מאוד ברוב המשימות. במשימות הקשות, אלה שבהן מודל מתקדם מבדיל את עצמו, הפער נמצא במקום שבו הוא תמיד נמצא — והכותרת של Tencent, "מעט לפני Kimi K3," מנוסחת בכנות, וזה לא מה שכל מעבדה מפרסמת.
גודל אינו גורל
השוואת הפרמטרים הופכת את התוצאה למרשימה או מחשידה, תלוי בהנחות המוקדמות שלך. Kimi K3 כולל 2.8 טריליון פרמטרים בסך הכול, עם 104 מיליארד פעילים — 896 מומחים, 16 פעילים לכל טוקן — והוא אומן לחשיבה תמידית עם שרשרת חשיבה חשופה. HY4 Preview כולל 770 מיליארד בסך הכול, עם 49 מיליארד פעילים — שליש מההיקף הכולל ופחות ממחצית הכוח החישובי הפעיל. מודל קטן יותר שמשיג ניצחון דחוק במבחן עיוור על פני מודל גדול יותר הוא כיוון ההתפתחות שכל תחום המשקלים הפתוחים נע אליו — Qwen3.8-Max, עם 2.4T, ו-GLM-5.2, עם 753B, מחליפים מכות במדדים סוכניים כבר חודשים — כך שהתוצאה סבירה ולא מופרכת. וזה קריטי, איש מחוץ לטנסנט לא אימת אותה.
לוח התוצאות

• קנה מידה — HY4 Preview 770B סה״כ / 49B פעילים לעומת Kimi K3 2.8T סה״כ / 104B פעילים
• הקשר — HY4 Preview >1M טוקנים לעומת Kimi K3 1M טוקנים
• מחיר ל-1M — HY4 Preview ¥6 קלט / ¥18 פלט (≈$0.85 / $2.50) לעומת Kimi K3 $3.00 קלט / $15.00 פלט, פגיעות מטמון $0.30
• מודאליות — HY4 Preview טקסט בלבד לעומת Kimi K3 קלט תמונה ווידאו מקורי
• חשיבה — HY4 Preview ללא מצב פורסם, לעומת Kimi K3 עם חשיבה פעילה תמידית ושרשרת חשיבה בזרימה
• ציון עצמאי — HY4 Preview: אין, לעומת Kimi K3: AA Intelligence Index 57, בין שלושת המובילים בעולם בעת ההשקה
בשורות שבהן שני הצדדים מדווחים על מספר, המודלים מתקבצים. טנסנט מדווחת על HY4 Preview עם 37.1 ב-APEX-Agents, בעצם באותה רמה של 37.2 של Kimi K3 — שוויון כמעט מושלם שלוח התוצאות של המבחן העיוור היה צופה. ל-HY4 Preview יש Toolathlon-Verified 74.1 ו-DeepSWE 64.3 שאין להם מקבילה ב-Kimi K3 בנתונים שבידי, ואילו ל-Kimi K3 יש FrontierSWE 81.2, ProgramBench 77.8 ו-BrowseComp 91.2 שאין להם מקבילה ב-HY4 Preview. לוח התוצאות כן לגבי העובדה ששני הכרטיסים כמעט לא חופפים, וזו בעצם אזהרה מפני התייחסות לשורות של כל ספק כאל תיאור מלא של המודל.
החזון הוא ההבדל האמיתי הגדול ביותר
עבור מפתח שבוחר בין השניים כיום, הפער המבני אינו אינטליגנציה — אלא צורת הקלט. Kimi K3 הוא מולטי-מודאלי מטבעו: הוא מקבל קלט תמונה ווידאו דרך המקודד MoonViT-V2 שלו, ונמנה עם המודלים הפתוחים הטובים ביותר במשימות ראייה, כשהוא מדורג שני בעולם ב-Vision Arena. Tencent HY4 Preview הוא טקסט-בלבד בתצוגה המקדימה הזו, וטנסנט אמרה שתמיכה בראייה תצטרך לחכות לגרסה המלאה. כל עומס עבודה שדורש צילומי מסך, הבנת ממשק משתמש או עיגון ויזואלי הוא של Kimi K3 כברירת מחדל, בלי קשר למה שהמבחן העיוור אומר על טקסט הנדסי. אם העבודה שלך היא אך ורק קוד, מסמכים ופלט טרמינל, הפער לא משנה; ברגע שמשימה כוללת הסתכלות על משהו, הוא מכריע את ההתמודדות.
שאלת העלות
לפי טוקן, HY4 Preview זול בהרבה: בערך $0.85/$2.50 לעומת $3.00/$15.00 של Kimi K3, עם פגיעות מטמון ב-¥0.3 (בערך ארבעה סנט) לעומת $0.30. אבל לשני הדגמים יש התנהגויות טוקן הפוכות שמצמצמות את הפער. Kimi K3 מנמק תמיד וזורם את שרשרת החשיבה שלו, מה שמנפח את טוקני הפלט בכל בקשה; המבקרים ציינו שהמודל איטי יותר — כ-62 טוקנים לשנייה — וכבד בטוקנים עבור לולאות סוכן. HY4 Preview, לפי הודעת השחרור של Tencent עצמה, "נוטה לחשיבה ארוכה מדי ולאימות עצמי מוגזם" במשימות מורכבות. שניהם שורפים טוקני פלט נוספים; HY4 Preview פשוט גובה פחות עליהם. השוואה הוגנת היא עלות לכל משימה שהושלמה, ואף אחד מחוץ ל-Tencent עדיין לא מדד את זו של HY4 Preview.
פסק הדין
Tencent HY4 Preview הוא המתחרה הזול יותר, הקטן יותר והלא-מאומת, שטוען ליתרון מצומצם במבחן עיוור על פני התקן בעל המשקלים הפתוחים; Kimi K3 הוא השחקן המכהן, הגדול יותר, המאומת ובעל יכולות הראייה, שעולה פי ארבעה עד חמישה יותר לטוקן ובעל מדד Intelligence Index עצמאי של 57. כרטיס הבנצ'מרק של אף אחד מהמודלים אינו עצמאי לחלוטין — גם ציוני הכותרת של Kimi K3 מדווחים על ידי Moonshot, אם כי מדד ה-57 שלה אינו כזה. אם עומס העבודה שלך הוא מולטי-מודאלי, Kimi K3 הוא הבחירה היחידה בהתמודדות הזו. אם מדובר בטקסט והנדסה, HY4 Preview הוא ההימור המשתלם, עם השוואה ראש-בראש אמיתית לזכותו — גם אם כזו שמבוצעת על ידי הספק — והנתיב הזול הוא לנתב את Kimi K3 על מפתח הייצור: הוא פעיל ב-OrcaRouter במחיר המחירון של Moonshot, $3.00/$15.00, מועבר ללא תוספת מחיר, בזמן שאתה מריץ את HY4 Preview דרך ה-API של Tencent על עומסי צל. כאשר HY4 Preview יגיע לראוטר, אותו מפתח ואותם כללי failover ישאו את שניהם, ותעריף ¥6/¥18 של Tencent יועבר ללא שינוי.


מה לצפות
• ריצה עצמאית חוזרת של משימות המבחן העיוור. שיעור הניצחון של 51.2% הוא הטענה הבודדת הכי ניתנת לבדיקה בהשקה הזו, וכלי בדיקה של צד שלישי היה פותר את זה תוך שבוע.
• האם HY4 Preview ישלח את ה-vision לפני השחרור המלא של Hy4. זה מה שיהפוך את זה מהשוואת ערך מבוססת טקסט בלבד לקרב ספינות דגל אמיתי.
• עלות-למשימה-שהושלמה על רתמות סוכנים סטנדרטיות. שני הדגמים כבדים בטוקנים; מי שזול יותר לכל משימה שהושלמה מנצח בטיעון הייצור.
• תגובתה של Kimi K3 ללחץ המחירים. אם Moonshot תוריד את תעריף הפלט של $15, המסגרת 'מתמודד זול לעומת תקן יקר' תתהפך.
