
Kimi K4: מה שההדלפה למעשה טוענת, ולמה "פחות פרמטרים אקטיביים" יהיה הסיפור האמיתי
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 506 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 183 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
פוסט בודד הכניס ארבעה שמות של מודלים שטרם הוכרזו למחזור בבת אחת. הרשימה מתחילה ב-Kimi K4, הדור הבא לכאורה של Moonshot AI, שלצידו GLM-5.5 Flash ו-GLM-5.4 מבית Z.ai ו-DeepSeek V4.1P — וההדגש של המחבר עצמו אינו על אף אחד משמות הדגל, אלא על חשד לגבי החשבון שמתחת ל-K4: שהוא עשוי להפעיל פחות פרמטרים מהמודל שהוא מחליף. הטענה הזו אינה מאומתת. אין כרטיס מודל של Kimi K4, אין משקלים, אין מזהה API, אין מחיר ואין נתיב, וכך גם לגבי כל שם של Z.ai ברשימה. מה ששווה לעשות כעת הוא לברר אילו מהטענות הללו ניתנות לבדיקה, איך נראית נקודת הבסיס שנשלחת, ומה המשמעות האמיתית של K4 דליל יותר.
האות, והדרג שלו
זהו אות מוקדם, ויש לקרוא אותו ככזה. הפוסט שנושא אותו הוא קריאה של מוסכמות שמות של מודלים ולא דיווח על תצפית: הוא מסמן את "GLM-5.5 Flash, GLM-5.4" כמינוח מעניין ומכנה את Kimi K4 "מוזר מאוד", ואז מציע מנגנון ספקולטיבי — פחות מומחים מופעלים — בלי לטעון שראה קונפיגורציה, רשימת צ׳קפוינטים או נקודת קצה של staging.
שום דבר ברשומה הציבורית אינו סותר את השמות, וגם שום דבר אינו מאשש אותם. אי-התאמה זו אופיינית לשלב הזה של מחזור שחרור, וזו בדיוק הסיבה שהמהלך המועיל הוא לקבע את קו הבסיס ואת הבדיקות, ולא להעלות ספקולציות נוספות. שם שמופיע בפוסט הוא השערה לגבי מוצר, לא ראיה לקיומו.
קו הבסיס שמולו יימדד Kimi K4
Kimi K3 הוא אמיתי, שוחרר, ומתועד היטב באופן יוצא דופן, מה שהופך אותו לנקודת ייחוס מוצקה. כרטיס המודל של Moonshot עצמה מתאר מודל Mixture-of-Experts עם 2.8 טריליון פרמטרים, שמפעיל 104 מיליארד פרמטרים לכל טוקן, הפרוסים על פני 93 שכבות — שכבה צפופה אחת ו-92 שכבות דלילות. הדלילות אגרסיבית ונאמרת בגלוי: 16 מתוך 896 מומחים מופעלים לכל טוקן, בנוסף ל-2 מומחים משותפים, אשר Moonshot מייחסת להם שיפור של בערך פי 2.5 ביעילות הסקיילינג לעומת Kimi K2.
מערך הקשב הוא המקום שבו K3 מתנתק מהדור הקודם. מבין 92 השכבות הדלילות שלו, 69 משתמשות ב-Kimi Delta Attention — מנגנון קשב לינארי היברידי — ו-24 משתמשות ב-gated MLA, פיצול של 3:1 שמשאיר מיעוט של שכבות קשב מלא ודוחף את היתר למסלול הלינארי הזול יותר. שכבות נושאות שארית קשב בכל 12 בלוקים, פונקציית האקטיבציה היא SiTU-GLU, והמודל כולו מאומן עם משקולות MXFP4 ואקטיבציות MXFP8 תחת אימון מודע לכימות. אורך ההקשר הוא 1,048,576 טוקנים, אוצר המילים הוא 163,840, והראייה פועלת דרך מקודד MoonViT-V2 בעל 401M פרמטרים, מה שהופך את K3 לבעל יכולת עיבוד תמונות ילידית, ולא למודל מולטימודלי בתוספת חיצונית.

אלה המספרים שמודל יורש חייב להזיז. שימו לב למה שהם מרמזים לגבי הרעיון של "פחות פרמטרים פעילים": K3 הוא כבר מודל דליל במיוחד. הוא מפעיל כ-3.7% מכלל מספר הפרמטרים שלו לכל טוקן. K4 שיפעיל פחות מ-104B לא יגזום שומן מעיצוב עתיר-משאבים מדי — הוא יסגת מיחס דלילות שמונשוט הציגה בפומבי כהישג, והוא יעשה זאת בדור שבו שאר התחום הולך בכיוון ההפוך.
מה המשמעות של "פחות פרמטרים פעילים" אם זה נכון
קיימות שתי פרשנויות, והן מצביעות לכיוונים מנוגדים. זו המיטיבה היא ארכיטקטונית: Moonshot עשויה להרחיב עוד את ההיברידיות של KDA, להחליף עוד שכבות של קשב מלא בשכבות לינאריות ולאזן מחדש את תקציב המומחים כך שמספר אקטיבציות נמוך יותר קונה הקשר ארוך יותר, טביעת רגל זולה יותר בהגשה, או יחס טוב יותר של איכות לפלופ. לפי פרשנות זו, פחות פרמטרים פעילים הוא חידוד של אותה תזה ש-K3 כבר מציג — שדלילות היא אסטרטגיית סקיילינג, ולא פשרה.
הקריאה האחרת היא ש-K4 אינו יורש אחיד כלל. הקו של Kimi כבר התפצל פעם אחת השנה, ודיווחים רמזו בדרכים שונות ל-K3.1, K3.2 ו-K4 כשלושה מוצרים שונים. K4 שמפעיל פחות מ-K3, במשפחה שמשווקת וריאנט קידוד נפרד, עולה בקנה אחד עם מיצוב מחדש לפחות כמו עם שדרוג ישיר. שתי הקריאות הן ספקולציה. אף אחת מהן לא מוכרעת על ידי פוסט.
יש גם מימד של רישיון שאיש לא התייחס אליו. המשקלים של K3 משוחררים תחת רישיון ה-Kimi K3 License, רישיון מותאם אישית מסוג "אחר" ולא רישיון קוד פתוח סטנדרטי, והוא המודל הפתוח הראשון בדרגת 3T. האם K4 דליל יותר יירש את הרישיון הזה, או יצמצם אותו, חשוב יותר לכל מי שבונה על המשקלים מאשר כמה נקודות בציון מדד.

שמות שלושת האחרים באותו פוסט
GLM-5.5 Flash ו-GLM-5.4 הם הזוג המפתיע יותר, ולא בגלל המספרים. התקרה המפורסמת של Z.ai היא GLM-5.3, שיצא ב-14 באוגוסט 2026 עם 743B פרמטרים, כאשר GLM-5.3-Flash הגיע ב-26 באוגוסט ושחרורי המשקולות BF16 ו-Flash-BF16 נחתו ב-25 באוגוסט. התיעוד של Z.ai עצמה מפרט בדיוק שלושה מזהי מודלים נוכחיים: glm-5.3, glm-5.3-flash ו-glm-5.2. אין GLM-5.4, אין GLM-5.5 ואין GLM-5.5 Flash — וכיוון השמות הוא החלק המוזר, שכן דור 5.5 שקודם לדור 5.4 אינו האופן שבו Z.ai אי פעם מספרת משפחה. מספרי גרסה שמופיעים שלא לפי הסדר בהדלפה הם מצב כשל מוכר: הם נוטים להיות מוצרים סמוכים, שמות קוד פנימיים, או תווית של שכבת שירות ולא מודל בסיס חדש.
DeepSeek V4.1Pהוא השם שמחבר האות אומר שהוא הכי מתעניין בו, והוא הקל ביותר מבין הארבעה לבדיקה. תיעוד ה-API של DeepSeek מפרט בדיוק שתי מחרוזות מודל נוכחיות: deepseek-flash וdeepseek-v4-pro. לסיומת "P" אין מקבילה באף מזהה של DeepSeek, והשחרור האחרון ביותר של משקלים בארגון של DeepSeek עצמו הוא DeepSeek-V4.1-Flash, שפורסם ב-10 בספטמבר 2026. V4.1P יהיה באופן הסביר ביותר אח בדרג Pro של אותו מודל — אבל "באופן הסביר ביותר" הוא ניחוש לגבי מחרוזת, לא מוצר.
איך היית יודע שכל זה אמיתי
ארבעת השמות נכשלים באותו מבחן ובאותה צורה, מה שהופך את ההמתנה לפשוטה ולא מייסרת. מהדורה אמיתית משאירה אחריה ארטיפקטים, וכל אחד מהם קל לבדיקה:
• כרטיס מודל בארגון ה-Hugging Face של הספק עצמו. הערך החדש ביותר של Moonshot הוא Kimi-K3, שנוצר ב-13 ביוני 2026; החדשים ביותר של Z.ai הם משפחת GLM-5.3 מ-25 באוגוסט; החדש ביותר של DeepSeek הוא DeepSeek-V4.1-Flash מ-10 בספטמבר. דבר חדש יותר אינו קיים באף אחד מהשלושה.
• הגדרה שמכריעה את הוויכוח. עבור K4 במיוחד, השדות שיש לחפש הם num_experts וnum_experts_per_token — אצל K3 הם 896 ו-16. הגדרת K4 עם מספר נמוך יותר לכל טוקן היא הטענה בהדלפה הזו שמאומתת או מופרכת בקובץ אחד.
• מודל שניתן לנתב אליו. שם שמופיע בקטלוג הוא שם שיש מאחוריו מחיר, חלון הקשר וספק; שם שמופיע רק בפוסט אין לו דברים כאלה.

מה ניתן לנתב היום
הגרסה המעשית של ההדלפה הזו היא שהדור שהיא מתארת אינו מה שאפשר לבנות עליו. מה שפעיל הוא הקודם, ותפקידו של הנתב הוא להפוך את הפער בין הדורות להחלטת ניתוב ולא לפרויקט מיגרציה. Kimi K3 זמין כעת עם הקשר מלא של 1M טוקנים וראייה מקורית, במחיר של $3.00 למיליון טוקני קלט ו-$15.00 למיליון טוקני פלט, עם קריאות מטמון ב-$0.30 — בחיוב לפי תעריף הספק וללא תוספת, וזו הסיבה ששינוי מחיר של הספק ב-K3 מגיע לחשבון שלך באותו יום ולא במחזור התמחור הבא. Kimi K3 ב-OrcaRouter מכיל את דף המפרט המלא ואת התעריף הנוכחי.
הדבר נכון גם לגבי שאר הלוח. GLM-5.3, GLM-5.3-Flash ו-DeepSeek V4.1 Flash ניתנים כולם לניתוב לצד Kimi K3, דרך נקודת קצה אחת תואמת-OpenAI המכסה מעל 200 מודלים, עם מעבר אוטומטי בין ספקים (failover) כאשר ספק מתדרדר, ו-DSL לניתוב לצורך הבעת העדפות — תקרות עלות, רצפות איכות, תקציבי השהיה — כמדיניות ולא כלוגיקה לכל קריאה. כאשר Kimi K4, GLM-5.5 Flash או DeepSeek V4.1P אכן יופיעו, ההגירה היא שינוי מחרוזת במדיניות הניתוב ולא דבר אחר. מיזוג מודלים מאפשר לשלב פלטים מכמה מודלים באותה נקודת קצה כאשר משימה מפיקה מכך תועלת.
כדי להיות מפורשים לגבי מה שזה לא: אף אחד מארבעת השמות שהודלפו אינו נתיב ב-OrcaRouter היום. איננו מארחים אותם ואיננו יכולים לשרת אותם.
השורה התחתונה
הטענה המעניינת כאן אינה מספרי הגרסה. זה המנגנון — דגם דגל מהדור הבא שמפעיל פחות פרמטרים מאשר קודמו יהיה הצהרה ש-Moonshot מאמין שדלילות, ולא מספר הפעלות גולמי, היא הציר ששווה לדחוף, ופיצול המומחים 16 מתוך 896 של K3 הוא כבר טיעון בכיוון הזה. כל חלק בטענה אינו מאומת: ל-Kimi K4, ל-GLM-5.5 Flash, ל-GLM-5.4 ול-DeepSeek V4.1P אין כרטיסי מודל, אין משקולות, אין מזהי API ואין מחירים, והקטלוגים של הספקים עצמם עוצרים דור אחד מוקדם יותר בכל מקרה. התייחסו לשמות כתצוגה מקדימה של שאלה, לא כתשובה — ואם אתם צריכים משקולות פתוחות ברמת החזית עם חלון הקשר של 1M היום, Kimi K3 הוא המודל שכבר קיים.
כאשר Kimi K4 יגיע, מעבר אוטומטי הוא מה שמונע מהמיגרציה להפוך לתקרית
