כרטיס כותרת שנוצר עם הכיתוב "Kimi K4" וכתובית המשנה "מה אומרת ההדלפה, ומה היא לא", תג "הדלפה / לא מאומת", שלוש שורות זו מעל זו עם הכיתוב "אין כרטיס מודל", "אין משקולות" ו"אין מחיר או מסלול", ושורת פוטר "נכון ל-25 בספטמבר 2026", כאשר הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Kimi K4: מה שההדלפה למעשה טוענת, ולמה "פחות פרמטרים אקטיביים" יהיה הסיפור האמיתי

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

פוסט בודד הכניס ארבעה שמות של מודלים שטרם הוכרזו למחזור בבת אחת. הרשימה מתחילה ב-Kimi K4, הדור הבא לכאורה של Moonshot AI, שלצידו GLM-5.5 Flash ו-GLM-5.4 מבית Z.ai ו-DeepSeek V4.1P — וההדגש של המחבר עצמו אינו על אף אחד משמות הדגל, אלא על חשד לגבי החשבון שמתחת ל-K4: שהוא עשוי להפעיל פחות פרמטרים מהמודל שהוא מחליף. הטענה הזו אינה מאומתת. אין כרטיס מודל של Kimi K4, אין משקלים, אין מזהה API, אין מחיר ואין נתיב, וכך גם לגבי כל שם של Z.ai ברשימה. מה ששווה לעשות כעת הוא לברר אילו מהטענות הללו ניתנות לבדיקה, איך נראית נקודת הבסיס שנשלחת, ומה המשמעות האמיתית של K4 דליל יותר.

האות, והדרג שלו

זהו אות מוקדם, ויש לקרוא אותו ככזה. הפוסט שנושא אותו הוא קריאה של מוסכמות שמות של מודלים ולא דיווח על תצפית: הוא מסמן את "GLM-5.5 Flash, GLM-5.4" כמינוח מעניין ומכנה את K​imi K4 "מוזר מאוד", ואז מציע מנגנון ספקולטיבי — פחות מומחים מופעלים — בלי לטעון שראה קונפיגורציה, רשימת צ׳קפוינטים או נקודת קצה של staging.

שום דבר ברשומה הציבורית אינו סותר את השמות, וגם שום דבר אינו מאשש אותם. אי-התאמה זו אופיינית לשלב הזה של מחזור שחרור, וזו בדיוק הסיבה שהמהלך המועיל הוא לקבע את קו הבסיס ואת הבדיקות, ולא להעלות ספקולציות נוספות. שם שמופיע בפוסט הוא השערה לגבי מוצר, לא ראיה לקיומו.

קו הבסיס שמולו יימדד Kimi K4

Kimi K3 הוא אמיתי, שוחרר, ומתועד היטב באופן יוצא דופן, מה שהופך אותו לנקודת ייחוס מוצקה. כרטיס המודל של Moonshot עצמה מתאר מודל Mixture-of-Experts עם 2.8 טריליון פרמטרים, שמפעיל 104 מיליארד פרמטרים לכל טוקן, הפרוסים על פני 93 שכבות — שכבה צפופה אחת ו-92 שכבות דלילות. הדלילות אגרסיבית ונאמרת בגלוי: 16 מתוך 896 מומחים מופעלים לכל טוקן, בנוסף ל-2 מומחים משותפים, אשר Moonshot מייחסת להם שיפור של בערך פי 2.5 ביעילות הסקיילינג לעומת Kimi K2.

מערך הקשב הוא המקום שבו K3 מתנתק מהדור הקודם. מבין 92 השכבות הדלילות שלו, 69 משתמשות ב-Kimi Delta Attention — מנגנון קשב לינארי היברידי — ו-24 משתמשות ב-gated MLA, פיצול של 3:1 שמשאיר מיעוט של שכבות קשב מלא ודוחף את היתר למסלול הלינארי הזול יותר. שכבות נושאות שארית קשב בכל 12 בלוקים, פונקציית האקטיבציה היא SiTU-GLU, והמודל כולו מאומן עם משקולות MXFP4 ואקטיבציות MXFP8 תחת אימון מודע לכימות. אורך ההקשר הוא 1,048,576 טוקנים, אוצר המילים הוא 163,840, והראייה פועלת דרך מקודד MoonViT-V2 בעל 401M פרמטרים, מה שהופך את K3 לבעל יכולת עיבוד תמונות ילידית, ולא למודל מולטימודלי בתוספת חיצונית.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

אלה המספרים שמודל יורש חייב להזיז. שימו לב למה שהם מרמזים לגבי הרעיון של "פחות פרמטרים פעילים": K3 הוא כבר מודל דליל במיוחד. הוא מפעיל כ-3.7% מכלל מספר הפרמטרים שלו לכל טוקן. K4 שיפעיל פחות מ-104B לא יגזום שומן מעיצוב עתיר-משאבים מדי — הוא יסגת מיחס דלילות שמונשוט הציגה בפומבי כהישג, והוא יעשה זאת בדור שבו שאר התחום הולך בכיוון ההפוך.

מה המשמעות של "פחות פרמטרים פעילים" אם זה נכון

קיימות שתי פרשנויות, והן מצביעות לכיוונים מנוגדים. זו המיטיבה היא ארכיטקטונית: Moonshot עשויה להרחיב עוד את ההיברידיות של KDA, להחליף עוד שכבות של קשב מלא בשכבות לינאריות ולאזן מחדש את תקציב המומחים כך שמספר אקטיבציות נמוך יותר קונה הקשר ארוך יותר, טביעת רגל זולה יותר בהגשה, או יחס טוב יותר של איכות לפלופ. לפי פרשנות זו, פחות פרמטרים פעילים הוא חידוד של אותה תזה ש-K3 כבר מציג — שדלילות היא אסטרטגיית סקיילינג, ולא פשרה.

הקריאה האחרת היא ש-K4 אינו יורש אחיד כלל. הקו של Kimi כבר התפצל פעם אחת השנה, ודיווחים רמזו בדרכים שונות ל-K3.1, K3.2 ו-K4 כשלושה מוצרים שונים. K4 שמפעיל פחות מ-K3, במשפחה שמשווקת וריאנט קידוד נפרד, עולה בקנה אחד עם מיצוב מחדש לפחות כמו עם שדרוג ישיר. שתי הקריאות הן ספקולציה. אף אחת מהן לא מוכרעת על ידי פוסט.

יש גם מימד של רישיון שאיש לא התייחס אליו. המשקלים של K3 משוחררים תחת רישיון ה-Kimi K3 License, רישיון מותאם אישית מסוג "אחר" ולא רישיון קוד פתוח סטנדרטי, והוא המודל הפתוח הראשון בדרגת 3T. האם K4 דליל יותר יירש את הרישיון הזה, או יצמצם אותו, חשוב יותר לכל מי שבונה על המשקלים מאשר כמה נקודות בציון מדד.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

שמות שלושת האחרים באותו פוסט

GLM-5.5 Flash ו-GLM-5.4 הם הזוג המפתיע יותר, ולא בגלל המספרים. התקרה המפורסמת של Z.ai היא GLM-5.3, שיצא ב-14 באוגוסט 2026 עם 743B פרמטרים, כאשר GLM-5.3-Flash הגיע ב-26 באוגוסט ושחרורי המשקולות BF16 ו-Flash-BF16 נחתו ב-25 באוגוסט. התיעוד של Z.ai עצמה מפרט בדיוק שלושה מזהי מודלים נוכחיים: glm-5.3, glm-5.3-flash ו-glm-5.2. אין GLM-5.4, אין GLM-5.5 ואין GLM-5.5 Flash — וכיוון השמות הוא החלק המוזר, שכן דור 5.5 שקודם לדור 5.4 אינו האופן שבו Z.ai אי פעם מספרת משפחה. מספרי גרסה שמופיעים שלא לפי הסדר בהדלפה הם מצב כשל מוכר: הם נוטים להיות מוצרים סמוכים, שמות קוד פנימיים, או תווית של שכבת שירות ולא מודל בסיס חדש.

D​eepSeek V4.1Pהוא השם שמחבר האות אומר שהוא הכי מתעניין בו, והוא הקל ביותר מבין הארבעה לבדיקה. תיעוד ה-API של D​eepSeek מפרט בדיוק שתי מחרוזות מודל נוכחיות: deepseek-flash וdeepseek-v4-pro. לסיומת "P" אין מקבילה באף מזהה של D​eepSeek, והשחרור האחרון ביותר של משקלים בארגון של D​eepSeek עצמו הוא DeepSeek-V4.1-Flash, שפורסם ב-10 בספטמבר 2026. V4.1P יהיה באופן הסביר ביותר אח בדרג Pro של אותו מודל — אבל "באופן הסביר ביותר" הוא ניחוש לגבי מחרוזת, לא מוצר.

איך היית יודע שכל זה אמיתי

ארבעת השמות נכשלים באותו מבחן ובאותה צורה, מה שהופך את ההמתנה לפשוטה ולא מייסרת. מהדורה אמיתית משאירה אחריה ארטיפקטים, וכל אחד מהם קל לבדיקה:

• כרטיס מודל בארגון ה-Hugging Face של הספק עצמו. הערך החדש ביותר של Moonshot הוא Kimi-K3, שנוצר ב-13 ביוני 2026; החדשים ביותר של Z.ai הם משפחת GLM-5.3 מ-25 באוגוסט; החדש ביותר של DeepSeek הוא DeepSeek-V4.1-Flash מ-10 בספטמבר. דבר חדש יותר אינו קיים באף אחד מהשלושה.

• הגדרה שמכריעה את הוויכוח. עבור K4 במיוחד, השדות שיש לחפש הם num_experts וnum_experts_per_token — אצל K3 הם 896 ו-16. הגדרת K4 עם מספר נמוך יותר לכל טוקן היא הטענה בהדלפה הזו שמאומתת או מופרכת בקובץ אחד.

• מודל שניתן לנתב אליו. שם שמופיע בקטלוג הוא שם שיש מאחוריו מחיר, חלון הקשר וספק; שם שמופיע רק בפוסט אין לו דברים כאלה.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

מה ניתן לנתב היום

הגרסה המעשית של ההדלפה הזו היא שהדור שהיא מתארת אינו מה שאפשר לבנות עליו. מה שפעיל הוא הקודם, ותפקידו של הנתב הוא להפוך את הפער בין הדורות להחלטת ניתוב ולא לפרויקט מיגרציה. Kimi K3 זמין כעת עם הקשר מלא של 1M טוקנים וראייה מקורית, במחיר של $3.00 למיליון טוקני קלט ו-$15.00 למיליון טוקני פלט, עם קריאות מטמון ב-$0.30 — בחיוב לפי תעריף הספק וללא תוספת, וזו הסיבה ששינוי מחיר של הספק ב-K3 מגיע לחשבון שלך באותו יום ולא במחזור התמחור הבא. Kimi K3 ב-OrcaRouter מכיל את דף המפרט המלא ואת התעריף הנוכחי.

הדבר נכון גם לגבי שאר הלוח. GLM-5.3, ‏GLM-5.3-Flash ו-DeepSeek V4.1 Flash ניתנים כולם לניתוב לצד Kimi K3, דרך נקודת קצה אחת תואמת-OpenAI המכסה מעל 200 מודלים, עם מעבר אוטומטי בין ספקים (failover) כאשר ספק מתדרדר, ו-DSL לניתוב לצורך הבעת העדפות — תקרות עלות, רצפות איכות, תקציבי השהיה — כמדיניות ולא כלוגיקה לכל קריאה. כאשר K​imi K4, ‏GLM-5.5 Flash או D​eepSeek V4.1P אכן יופיעו, ההגירה היא שינוי מחרוזת במדיניות הניתוב ולא דבר אחר. מיזוג מודלים מאפשר לשלב פלטים מכמה מודלים באותה נקודת קצה כאשר משימה מפיקה מכך תועלת.

כדי להיות מפורשים לגבי מה שזה לא: אף אחד מארבעת השמות שהודלפו אינו נתיב ב-OrcaRouter היום. איננו מארחים אותם ואיננו יכולים לשרת אותם.

השורה התחתונה

הטענה המעניינת כאן אינה מספרי הגרסה. זה המנגנון — דגם דגל מהדור הבא שמפעיל פחות פרמטרים מאשר קודמו יהיה הצהרה ש-Moonshot מאמין שדלילות, ולא מספר הפעלות גולמי, היא הציר ששווה לדחוף, ופיצול המומחים 16 מתוך 896 של K3 הוא כבר טיעון בכיוון הזה. כל חלק בטענה אינו מאומת: ל-Kimi K4, ל-GLM-5.5 Flash, ל-GLM-5.4 ול-DeepSeek V4.1P אין כרטיסי מודל, אין משקולות, אין מזהי API ואין מחירים, והקטלוגים של הספקים עצמם עוצרים דור אחד מוקדם יותר בכל מקרה. התייחסו לשמות כתצוגה מקדימה של שאלה, לא כתשובה — ואם אתם צריכים משקולות פתוחות ברמת החזית עם חלון הקשר של 1M היום, Kimi K3 הוא המודל שכבר קיים.

כאשר K​imi K4 יגיע, מעבר אוטומטי הוא מה שמונע מהמיגרציה להפוך לתקרית