
Qwen 4 Max מול Kimi K3: ההבטחה למשקלים פתוחים פוגשת את אספקת המשקלים הפתוחים
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
Moonshot AI שחררה את Kimi K3 ב-16 ביולי 2026 ואז עשתה את הדבר שרוב המעבדות רק מדברות עליו: היא פרסמה את המשקולות. הצ'קפוינט בעל 2.8 טריליון הפרמטרים שוחרר ב-27 ביולי 2026 תחת רישיון MIT מתוקן, אחד עשר ימים לאחר ההשקה. בינתיים, ועידת Yunqi ב-22 בספטמבר 2026 שימשה להכרזה על Qwen 4 Max כספינת הדגל של משפחת Qwen 4 בת ארבע דרגות הכוללת Qwen 4 27B במשקולות פתוחות — דרגה שמובטחת ולא שוחררה. שתי העובדות האלה הן ההשוואה. כל השאר בנוגע ל-Qwen 4 Max אינו ידוע כעת, והפער בין דרגה פתוחה מובטחת לבין דרגה שסופקה בפועל הוא המקום שבו להתמודדות הזו באמת יש משהו לומר.
מה הניח Kimi K3 על השולחן ביולי
Kimi K3 הוא מודל mixture-of-experts עם 2.8 טריליון פרמטרים, שמפעיל 16 מתוך 896 מומחים לכל טוקן, מה שמעמיד כ-104 מיליארד פרמטרים לעבודה בכל צעד נתון. הוא כולל חלון הקשר של 1,048,576 טוקנים הן בצד הקלט והן בצד הפלט, ומקבל קלט של טקסט, תמונה ווידאו עם פלט טקסט. ה-API של הצד הראשון (first-party) שלו מתומחר ב-3.00 דולר למיליון טוקני קלט, 15.00 דולר למיליון טוקני פלט ו-0.30 דולר למיליון טוקני קלט שמורים במטמון, ותעריפי צד שלישי נמוכים מכך.
הארכיטקטורה היא החלק שאותו מהדהדת התצוגה המקדימה של Alibaba עצמה. Kimi K3 מבוסס על Kimi Delta Attention ו-Attention Residuals, ש-Moonshot טוענת שהם מספקים יעילות סקיילינג טובה פי כ-2.5 מזו של Kimi K2 ופענוח מהיר עד פי 6.3 בהקשרים של מיליון טוקנים. זו אותה הבעיה שאליה מכוון QSA של Qwen — להפוך את הקשב לנגיש באורכים קיצוניים — מה שאומר ששתי המשפחות לא מתחרות כל כך על סקאלה, אלא על של מי עיצוב הקשב הדליל מתיישן טוב יותר.
הציונים ש-Moonshot פרסמה בעת ההשקה, כפי שדווחו על ידי הספק ולא שוחזרו באותה עת:
• מדד הבינה של Artificial Analysis — 57, שלישי באותה עת אחרי Claude Fable 5 ו-GPT-5.6 Sol. נתון זה נרשם במהדורה מוקדמת יותר של המדד; מאז המדד נבנה מחדש פעמיים, כך שמדובר בקריאה היסטורית ולא עכשווית
• Frontend Code Arena — מקום ראשון עם 1,679 Elo, לפני שני המודלים שהשיגו ממנה ציון גבוה יותר במדד הכללי
• Terminal-Bench 2.1 — 88.3
• SWE-Marathon — 42, מקדים את Opus 4.8 ו-GPT-5.6 Sol
• DeepSearchQA — 0.95, מקום ראשון, ו-MATH-Vision 0.98, גם במקום הראשון
• GPQA-Diamond — 0.94
חומר ההשקה של Moonshot עצמו מודה ש-K3 עדיין מפגר אחרי Claude Fable 5 ו-GPT-5.6 Sol ביכולת הכללית, וזהו משפט שימושי יותר מכל טענות המקום הראשון שמעליו. הצורה המעניינת של המספרים היא שמודל שנמצא במקום השלישי במדד הכללי סיים ראשון בקוד פרונטאנד וראשון בחיפוש לטווח ארוך — פרופיל שאומר שהמדד המצרפי מסתיר כלי מיוחד ולא מתאר כלי כללי.

מה Alibaba הבטיחה, ומה שווה הבטחה
ההכרזה על Qwen 4 ציינה ארבע דרגות. Qwen 4 Max כדגם הדגל, Qwen 4 Flash לתפוקה, Qwen 4 Plus כדרגת הביניים המאוזנת, ו-Qwen 4 27B כדרגה המקומית עם משקולות פתוחות. ראש צוות Qwen LLM, ליו דה ייהנג, תיאר את המשפחה כמתאמנת על ארכיטקטורה מהדור החדש ואמר שהיא תגיע בקרוב. אין תאריך, אין כרטיס דגם, אין מזהה API, אין רישום בענן, אין מחיר ואין ציון מפורסם לאף אחד מהארבעה.
שני דברים ספציפיים בנוגע להודעה ההיא מדווחים באופן שגוי, ושניהם חשובים לכל מי שמנסה לתכנן בהתאם:
• הנתון של 5 עד 10 טריליון פרמטרים המיוחס לסיקור של Qwen 4 אינו מפרט של Qwen 4. הוא שייך למפת הדרכים של Qwen 4.5 ו-Qwen 5. לא פורסם מספר פרמטרים מכל סוג שהוא עבור Qwen 4 Max
• המשך שמות הרמות אינו מעביר את המפרטים הלאה. חלון ההקשר, המחיר והרישיון של Qwen 4 Max אינם ידועים; המספרים של Qwen3.8-Max המשוחרר — 1,000,000 טוקנים ב-$2.00 וב-$6.00 למיליון — מתארים מודל אחר
הסיבה שדרגת ה-27B היא המעניינת אינה קשורה לבנצ'מרקים. זוהי הדרגה היחידה בקו Qwen 4 שהופצה היסטורית במשקלים פתוחים, ודור Qwen 3.8 הראה מה זה מאפשר: בתוך ימים מנחיתת משקלי ה-27B, הקהילה כבר יצרה המרות MLX, קוונטיזציות NVFP4 וכיוונונים עדינים מכל סוג. הכרזה על 27B היא התחייבות לאקוסיסטם במורד הזרם, והיא המסירה הצפויה ביותר במפת הדרכים.
אבל את הצפוי לא מספקים. המשקלים של Kimi K3 הם קובץ שאפשר להוריד כבר היום. המשקלים של Qwen 4 27B הם שורה בהרצאת כנס.
משקלים פתוחים ומשקלים הניתנים להרצה הם טענות שונות
יש מלכודת בהתייחסות ל-Kimi K3 כתשובת המשקלים הפתוחים, וכדאי לומר זאת בבירור משום שזו הצהרת היתר הנפוצה ביותר בסיקור של מודלי חזית סיניים. תערובת מומחים עם 2.8 טריליון פרמטרים היא ארטיפקט בקנה מידה של מרכז נתונים. משקלים מפורסמים פירושם שמותר לך להריץ אותו, לבדוק אותו, לכוונן אותו בכוונון עדין ולכמת אותו. הם אינם פירושם שאתה יכול להריץ אותו בתחנת עבודה. הגשה יעילה של נקודת ביקורת בגודל כזה דורשת עשרות מאיצים, ועבודת הכימות שבאה בעקבות שחרור פתוח — הווריאנטים בסגנון NVFP4 ו-REAP שמסתובבים בתוך שבועות — עוסקת לא פחות בהפיכת המודל לניתן להגשה מאשר בהקטנתו.
אז הקריאה הכנה של הרישיון של Kimi K3 צרה יותר ועדיין משמעותית: זהו מודל חזית הניתן לביקורת, לשינוי ולאירוח עצמי, תחת רישיון MIT מותאם, עבור ארגונים שיש ברשותם החומרה להריץ אותו. זהו נכס אסטרטגי אמיתי והתאמה גרועה לכל מי שקרא "משקלים פתוחים" בתור "פועל על המחשב הנייד שלי".
אותה הסתייגות תחול על Qwen 4 27B אם ומתי שישוחרר — והיא חלה בחריפות פחותה, מפני ששכבת משקולות פתוחות של 27B היא באמת בקנה מידה מקומי, באופן שמודל דגל של 2.8T אינו. זו בדיוק הסיבה לכך ששכבת Qwen 4 27B ראויה ליותר תשומת לב מאשר שכבת Max בהשוואה הזו, אף על פי ששכבת Max היא זו שההכרזה הובילה איתה.

השאלה המסחרית שמתחת לשאלת הרישיון
התעריף של Kimi K3 מצד ראשון של $3.00 לקלט ו-$15.00 לפלט למיליון טוקנים הוא עמדת פרימיום, ו-Moonshot הייתה מפורשת שהוא מתומחר במכוון מעל הקצה הזול של השוק הסיני. לעומת Qwen3.8-Max ב-$2.00 ו-$6.00, מדובר בפי אחד וחצי מתעריף הקלט ובפי שניים וחצי מתעריף הפלט — פער גדול מספיק כדי שעומס עבודה יצטרך להתחשב בחוזקות הספציפיות של Kimi K3, ביניהן קוד פרונטאנד וחיפוש בטווח ארוך, כדי שהפרמיה תשתלם.
OrcaRouter מנתב את kimi/kimi-k3 לצד משפחת Qwen 3.8 בנקודת קצה אחת תואמת OpenAI במרווח של 0%, מה שאומר שאתם מחויבים לפי מחיר המחירון של הספק ולא לפי מקבילה עם תוספת. בהשוואה שבה פער המחירים הוא פי 2.5 בפלט, היעדר מרווח פלטפורמה אינו פרט שולי — תוספת של עשרה אחוזים על תעריף פלט של $15.00 היא $1.50 למיליון טוקנים, וזה יותר מכל עלות הקלט של המודל הזול יותר בהשוואה הזו. אותה נקודת קצה כוללת מעבר אוטומטי בעת כשל ו-DSL לניתוב להבעת מדיניות באופן מפורש, וכך אתם מנסים מודל עם הפרופיל של Kimi K3 על פרוסה מתעבורת הייצור בלי להמר את כל הנתיב על ספק שלא הרצתם בעבר.
מה ש-OrcaRouter לא מציע הוא Qwen 4 Max או כל רמת Qwen 4, מכיוון שאף אחד מהם עדיין לא קיים כמוצר.

למה לשים לב, וממה להתעלם
שלושה אותות היו משנים את ההשוואה הזו, והם ספציפיים מספיק כדי לשים לב אליהם:
• המשקולות של Qwen 4 27B. לא טבלת הביצועים של דרגת Max — הצ'קפוינט של 27B, הרישיון והגודל שלו. זה השחרור שיגיד לך אם המחויבות של Alibaba למשקולות פתוחות בדור הזה אמיתית כמו בקודם
• הרישיון של Qwen 4 Max, אם בכלל. אם Alibaba תפרסם משקלים עבור דגם הדגל שלה כפי שעשתה עם Qwen3.8-Max, הטיעון של משקלים פתוחים בהתמודדות הזו מפסיק להיות היתרון של Kimi והופך לתיקו
• קריאה עצמאית חדשה על Kimi K3. ציוני ההשקה של Moonshot התבססו על דיווח עצמי, ומדד Artificial Analysis נבנה מחדש פעמיים מאז, לכן ה-57 וה-Frontend Code Arena Elo צריכים שניהם לעבור עדכון בסיס לפני שמשווים אותם למשהו עדכני.
מה שיש להתעלם ממנו הוא כל טבלת מפרטים של Qwen 4 Max שמופיעה לפני שאליבאבא מפרסמת כרטיס דגם, וכל טענה שלפיה המשקולות הפתוחות של Kimi K3 הופכות אותו להרצה מקומית. שתי השגיאות כבר מסתובבות. בינתיים, ההשוואה שאפשר לפעול לפיה היא בין שני דגמים שקיימים: Kimi K3 בתעריף פרימיום עם משקולות שסופקו ופרופיל קידוד מובחן באמת, ו-Qwen3.8-Max בפחות ממחצית מתעריף הפלט עם חלון אחיד של מיליון טוקנים ומשקולות משל עצמו. זו בחירה אמיתית, מתומחרת משני הצדדים, והיא אינה מחייבת להמתין לכך ששקופית כנס תהפוך למוצר.
השוואות במאמר הזה3
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
