כרטיס כותרת ראשי להשוואה בין 'Tencent HY4 Preview' ל-'Kimi K3'. כרטיס מרכזי בסגנון לוח תוצאות מציג 'מבחן עיוור פנימי, סולם של 4 נקודות', עם 'Tencent HY4 Preview 2.99' משמאל ו-'Kimi K3 2.94' מימין. הכרטיס השמאלי 'Tencent HY4 Preview' מציג: '770B / 49B פעילים, משקלים פתוחים', '¥6 / ¥18 לכל 1M', 'תצוגה מקדימה לטקסט בלבד'. הכרטיס הימני 'Kimi K3' מציג: '2.8T / 104B פעילים, משקלים פתוחים', '$3.00 / $15.00 לכל 1M', 'ראייה מובנית, AA Index 57'. בכותרת התחתונה נכתב: 'מבחן עיוור שנערך על ידי Tencent עם 163 מהנדסים על פני 203 משימות; התוצאות מדווחות על ידי הספק.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

תצוגה מקדימה של Tencent HY4 לעומת Kimi K3: מבחן העיוור שטנסנט בחרה לפרסם

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

התמודדות Tencent HY4 Preview מול Kimi K3 היא ההתמודדות היחידה בהשקת המודל הזה שטנסנט עצמה בחרה להריץ. במבחן העיוור הפנימי שלה — 163 מהנדסים, 203 משימות הנדסה, ניקוד בסולם של ארבע נקודות — HY4 Preview קיבלה 2.99/4.00 לעומת 2.94 של Kimi K3, והכותרת של טנסנט כינתה זאת ניצחון. האותיות הקטנות של הניצחון הזה שוות קריאה איטית: HY4 Preview ניצחה את Kimi K3 ב-51.2% מהמשימות, השיגה תיקו ב-7.9%, והפסידה ב-40.9%. שיעור ניצחון נטו של 10 נקודות הוא אמיתי, אבל זה יתרון דק מול מודל עם שליש מכלל הפרמטרים ופחות ממחצית הפרמטרים הפעילים — וכל המבחן נוהל על ידי טנסנט.

קימי K3 הוא דגם הדגל הפתוח של Moonshot עם 2.8 טריליון פרמטרים, המודל הפתוח הגדול ביותר ששוחרר אי פעם, ונקודת ההתייחסות שכל מעבדה סינית מודדת את עצמה מולה מאז ה-16 ביולי. Tencent בחרה בו כיריב כי הוא הסטנדרט הפתוח — וזה הופך את העבודה של המאמר הזה לקונקרטית במיוחד: קוראים את המפגש הישיר היחיד שהמאתגר עצמו בחר להציע, ומחליטים מה הוא שווה.

המדד שטנסנט בחרה לפרסם

המבחן העיוור נוקד על ידי המהנדסים של Tencent עצמם במשימות ההנדסה של Tencent עצמם, וזה הדבר הראשון שצריך להפחית מערכו. מערכת משימות שנבחרה על ידי החברה היא בדיוק הסביבה שבה מודל חדש מציג את הביצועים הטובים ביותר שלו. גם אם מקבלים את זה, צורת התוצאה אינפורמטיבית: 51.2% ניצחונות מול 40.9% הפסדים הוא מרווח צנוע, ושיעור התיקו של 7.9% מראה שהמודלים קרובים מאוד ברוב המשימות. במשימות הקשות, אלה שבהן מודל מתקדם מבדיל את עצמו, הפער נמצא במקום שבו הוא תמיד נמצא — והכותרת של Tencent, "מעט לפני Kimi K3," מנוסחת בכנות, וזה לא מה שכל מעבדה מפרסמת.

גודל אינו גורל

השוואת הפרמטרים הופכת את התוצאה למרשימה או מחשידה, תלוי בהנחות המוקדמות שלך. Kimi K3 כולל 2.8 טריליון פרמטרים בסך הכול, עם 104 מיליארד פעילים — 896 מומחים, 16 פעילים לכל טוקן — והוא אומן לחשיבה תמידית עם שרשרת חשיבה חשופה. HY4 Preview כולל 770 מיליארד בסך הכול, עם 49 מיליארד פעילים — שליש מההיקף הכולל ופחות ממחצית הכוח החישובי הפעיל. מודל קטן יותר שמשיג ניצחון דחוק במבחן עיוור על פני מודל גדול יותר הוא כיוון ההתפתחות שכל תחום המשקלים הפתוחים נע אליו — Qwen3.8-Max, עם 2.4T, ו-GLM-5.2, עם 753B, מחליפים מכות במדדים סוכניים כבר חודשים — כך שהתוצאה סבירה ולא מופרכת. וזה קריטי, איש מחוץ לטנסנט לא אימת אותה.

לוח התוצאות

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• קנה מידה — HY4 Preview 770B סה״כ / 49B פעילים לעומת Kimi K3 2.8T סה״כ / 104B פעילים

• הקשר — HY4 Preview >1M טוקנים לעומת Kimi K3 1M טוקנים

• מחיר ל-1M — HY4 Preview ¥6 קלט / ¥18 פלט (≈$0.85 / $2.50) לעומת Kimi K3 $3.00 קלט / $15.00 פלט, פגיעות מטמון $0.30

• מודאליות — HY4 Preview טקסט בלבד לעומת Kimi K3 קלט תמונה ווידאו מקורי

• חשיבה — HY4 Preview ללא מצב פורסם, לעומת Kimi K3 עם חשיבה פעילה תמידית ושרשרת חשיבה בזרימה

• ציון עצמאי — HY4 Preview: אין, לעומת Kimi K3: AA Intelligence Index 57, בין שלושת המובילים בעולם בעת ההשקה

בשורות שבהן שני הצדדים מדווחים על מספר, המודלים מתקבצים. טנסנט מדווחת על HY4 Preview עם 37.1 ב-APEX-Agents, בעצם באותה רמה של 37.2 של Kimi K3 — שוויון כמעט מושלם שלוח התוצאות של המבחן העיוור היה צופה. ל-HY4 Preview יש Toolathlon-Verified 74.1 ו-DeepSWE 64.3 שאין להם מקבילה ב-Kimi K3 בנתונים שבידי, ואילו ל-Kimi K3 יש FrontierSWE 81.2, ProgramBench 77.8 ו-BrowseComp 91.2 שאין להם מקבילה ב-HY4 Preview. לוח התוצאות כן לגבי העובדה ששני הכרטיסים כמעט לא חופפים, וזו בעצם אזהרה מפני התייחסות לשורות של כל ספק כאל תיאור מלא של המודל.

החזון הוא ההבדל האמיתי הגדול ביותר

עבור מפתח שבוחר בין השניים כיום, הפער המבני אינו אינטליגנציה — אלא צורת הקלט. Kimi K3 הוא מולטי-מודאלי מטבעו: הוא מקבל קלט תמונה ווידאו דרך המקודד MoonViT-V2 שלו, ונמנה עם המודלים הפתוחים הטובים ביותר במשימות ראייה, כשהוא מדורג שני בעולם ב-Vision Arena. Tencent HY4 Preview הוא טקסט-בלבד בתצוגה המקדימה הזו, וטנסנט אמרה שתמיכה בראייה תצטרך לחכות לגרסה המלאה. כל עומס עבודה שדורש צילומי מסך, הבנת ממשק משתמש או עיגון ויזואלי הוא של Kimi K3 כברירת מחדל, בלי קשר למה שהמבחן העיוור אומר על טקסט הנדסי. אם העבודה שלך היא אך ורק קוד, מסמכים ופלט טרמינל, הפער לא משנה; ברגע שמשימה כוללת הסתכלות על משהו, הוא מכריע את ההתמודדות.

שאלת העלות

לפי טוקן, HY4 Preview זול בהרבה: בערך $0.85/$2.50 לעומת $3.00/$15.00 של Kimi K3, עם פגיעות מטמון ב-¥0.3 (בערך ארבעה סנט) לעומת $0.30. אבל לשני הדגמים יש התנהגויות טוקן הפוכות שמצמצמות את הפער. Kimi K3 מנמק תמיד וזורם את שרשרת החשיבה שלו, מה שמנפח את טוקני הפלט בכל בקשה; המבקרים ציינו שהמודל איטי יותר — כ-62 טוקנים לשנייה — וכבד בטוקנים עבור לולאות סוכן. HY4 Preview, לפי הודעת השחרור של Tencent עצמה, "נוטה לחשיבה ארוכה מדי ולאימות עצמי מוגזם" במשימות מורכבות. שניהם שורפים טוקני פלט נוספים; HY4 Preview פשוט גובה פחות עליהם. השוואה הוגנת היא עלות לכל משימה שהושלמה, ואף אחד מחוץ ל-Tencent עדיין לא מדד את זו של HY4 Preview.

פסק הדין

Tencent HY4 Preview הוא המתחרה הזול יותר, הקטן יותר והלא-מאומת, שטוען ליתרון מצומצם במבחן עיוור על פני התקן בעל המשקלים הפתוחים; Kimi K3 הוא השחקן המכהן, הגדול יותר, המאומת ובעל יכולות הראייה, שעולה פי ארבעה עד חמישה יותר לטוקן ובעל מדד Intelligence Index עצמאי של 57. כרטיס הבנצ'מרק של אף אחד מהמודלים אינו עצמאי לחלוטין — גם ציוני הכותרת של Kimi K3 מדווחים על ידי Moonshot, אם כי מדד ה-57 שלה אינו כזה. אם עומס העבודה שלך הוא מולטי-מודאלי, Kimi K3 הוא הבחירה היחידה בהתמודדות הזו. אם מדובר בטקסט והנדסה, HY4 Preview הוא ההימור המשתלם, עם השוואה ראש-בראש אמיתית לזכותו — גם אם כזו שמבוצעת על ידי הספק — והנתיב הזול הוא לנתב את Kimi K3 על מפתח הייצור: הוא פעיל ב-OrcaRouter במחיר המחירון של Moonshot, $3.00/$15.00, מועבר ללא תוספת מחיר, בזמן שאתה מריץ את HY4 Preview דרך ה-API של Tencent על עומסי צל. כאשר HY4 Preview יגיע לראוטר, אותו מפתח ואותם כללי failover ישאו את שניהם, ותעריף ¥6/¥18 של Tencent יועבר ללא שינוי.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

מה לצפות

• ריצה עצמאית חוזרת של משימות המבחן העיוור. שיעור הניצחון של 51.2% הוא הטענה הבודדת הכי ניתנת לבדיקה בהשקה הזו, וכלי בדיקה של צד שלישי היה פותר את זה תוך שבוע.

• האם HY4 Preview ישלח את ה-vision לפני השחרור המלא של Hy4. זה מה שיהפוך את זה מהשוואת ערך מבוססת טקסט בלבד לקרב ספינות דגל אמיתי.

• עלות-למשימה-שהושלמה על רתמות סוכנים סטנדרטיות. שני הדגמים כבדים בטוקנים; מי שזול יותר לכל משימה שהושלמה מנצח בטיעון הייצור.

• תגובתה של Kimi K3 ללחץ המחירים. אם Moonshot תוריד את תעריף הפלט של $15, המסגרת 'מתמודד זול לעומת תקן יקר' תתהפך.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube