
GLM-5.3 מול Kimi K3: לסחוט בסיס של 743B או לבנות אחד של 2.8T — איזו הימור משתלם?
- openaiחדשOpenAI: GPT-6 Astra2026-09-0455אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0247אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0247אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0157אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2646אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1849אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1541אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1251אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0547אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0347אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2140אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128אינטליגנציה49כתיבת קוד
המירוץ הסיני של מודלי המשקלים הפתוחים התפצל זה עתה לשתי תשובות לאותה שאלה. Moonshot AI בנתה את Kimi K3 מאפס — בסיס תערובת מומחים עם 2.8 טריליון פרמטרים, מודל המשקלים הפתוחים הגדול ביותר ששוחרר אי פעם, שהוכרז ב-16 ביולי 2026 והמשקלים שלו פורסמו ב-27 ביולי. GLM-5.3 הוא ההימור ההפוך: Z.ai שמר על אותו בסיס מדויק של 743 מיליארד פרמטרים שהניע את GLM-5.2, והשקיע את כל מחזור השחרור בפוסט-אימון, בטענה שתקרת האינטליגנציה של מודל הבסיס מעולם לא הייתה הבעיה. שניהם דגמי דגל עם חלון הקשר של 1M, ממוקדים בקידוד ובסוכנים, ושניהם טוענים להיות מודל הקידוד הפתוח הטוב ביותר בשוק. הם לא יכולים שניהם להיות הדרך הטובה ביותר לנצל את אותו תקציב, והבנצ'מרקים אכן מתפצלים בדיוק באמצע — מה שהופך את זה לפחות להשוואה ויותר למשאל עם על איך לבנות את מודל הפרונטיר הבא.
שני הימורים על איך לבנות מודל מתקדם
Z.ai מכנה את GLM-5.3 "חפירה עמוקה" במקום שדרוג דורי. הבסיס הוא בדיוק אותו דגם של 743B כמו GLM-5.2; ההבדל הוא כולו בפוסט-טריינינג, המבוצע דרך מסגרת ה-slime בקוד פתוח על משימות שמשתרעות על פני סשנים הנדסיים שלמים — אבחון, תיקון, אימות ושחרור על פני קלאסטרים אמיתיים, מערכות אחסון ובסיסי קוד, שחלקן אורכות כמה ימי עבודה של מהנדס בכיר. השיפורים המדווחים של הספק הם גדולים: קפיצה של 50% ב-Code Bench שלו, Terminal-Bench 3.0 מ-4.6 ל-28.3, DeepSWE v1.1 מ-46.2 ל-66.9, ויכולת סייבר שאילצה בחינת בטיחות לפני משלוח המשקלים. Moonshot הלכה לכיוון ההפוך. Kimi K3 הוא בסיס חדש לגמרי — 2.8T פרמטרים בסך הכול, עם כ-104B פעילים לכל טוקן (16 מתוך 896 מומחים), ארכיטקטורת Kimi Delta Attention, קלט תמונה ווידאו מובנה, חשיבה תמידית שלא ניתנת לכיבוי, וחלון הקשר של 1M גם בקלט וגם בפלט. בעוד Z.ai מהמרת שיותר מאותו הדגם מספיק, Moonshot מהמרת שהבסיס עצמו הוא התקרה.

ראש בראש, עם מקור מצורף
המקום היחיד שבו שני הדגמים מופיעים באותו עמוד הוא טבלת ההשקה של Z.ai עצמה, אז משם מגיעים המספרים זה לצד זה — מסומנים כמדווחים על ידי הספק, לא נבדקו באופן בלתי תלוי. הנתונים העצמאיים של Kimi K3 תואמים את מה שמונשוט פרסמה ביולי ואת מה ש-Artificial Analysis מודדת, אך אף מעבדה נייטרלית לא הריצה את שניהם עדיין.
• Terminal-Bench 3.0 — GLM-5.3 עם 28.3 לעומת Kimi K3 עם 17.4 (הטבלה של Z.ai). זהו פער הקוד הגדול ביותר בהתמודדות, בגרסה החדשה והקשה ביותר.
• Terminal-Bench 2.1 — GLM-5.3 עם 88.2 מול Kimi K3 עם 88.3. תיקו מושלם.
• DeepSWE v1.1 — GLM-5.3 עם 66.9 לעומת Kimi K3 עם 67.5. Kimi בהפרש זעיר.
• SWE-Marathon v1.1 — GLM-5.3 עם 42.5 לעומת Kimi K3 עם 48.1. הניצחון הטוב ביותר של Kimi בקידוד.
• ExploitGym — GLM-5.3 עם 105/130 לעומת Kimi K3 עם 36/70. כמעט ניצחון מוחלט ל-GLM.
• GDPval-AA v2 (עבודת ידע) — GLM-5.3 ב-1,769 לעומת Kimi K3 ב-1,682.
• גישה — GLM-5.3: מנוי ל-Coding Plan, משקלי המודל חסומים עד בערך 28 באוגוסט. Kimi K3: ה-API פעיל ב-$3 / $15, המשקלים זמינים להורדה מאז 27 ביולי.

החפיר הביטחוני הוא ההפרדה האמיתית
הורידו את מדדי התכנות מהמשוואה, וההבדל המכריע הוא אבטחת סייבר. GLM-5.3 מדווח 84.5 ב-CyberGym לעומת 80.0 של Kimi K3, וציון ה-ExploitBench שלו, 54.4, הוא כמעט כפול מ-32.2 של Kimi K3. ב-ExploitGym הפער הוא לא הבדל, אלא קטגוריה אחרת — 105 ו-130 לעומת 36 ו-70 בריצות של שעתיים ושש שעות. זו הסיבה ששתי ההשקות מרגישות כל כך שונות בפועל: המשקלים של Kimi K3 חשופים לציבור תחת רישיון Modified MIT, בעוד המשקלים של GLM-5.3 מוחזקים לצורך חיזוק בטיחות, משום ש-Z.ai אומרת שהמודל טוב מספיק במציאת וניצול פרצות, כך ששחרור המשקלים מיד הרגיש חסר אחריות. אם העבודה שלך כוללת ביקורת על קוד של מישהו אחר, או הגנה על הקוד שלך מפני ציד חולשות אוטומטי, זו הנקודה הרלוונטית ביותר בכל ההשוואה — והיא גם הפחות מאומתת באופן בלתי תלוי.
איפה קימי K3 נלחם בחזרה
הניצחונות של Kimi K3 מתרכזים במקום שבו GLM-5.3 הוא החלש ביותר: עבודת רפוזיטורי ארוכת טווח. הוא שומר על היתרון ב־DeepSWE וב־SWE-Marathon, מוביל ב־Toolathlon Verified, וחלון הפלט שלו של מיליון טוקנים אומר שהוא יכול לכתוב קודבס שלם או trace סוכן ארוך במעבר אחד. ה־reasoning התמידי שלו מזרים את ה־trace המלא ל־API, שמפתחים הגדירו כשימושי הרבה יותר לניפוי באגים בסוכנים מאשר הסברי סיכום אטומים — כשהמלכוד התפעולי הוא שחובה להעביר את שדות ה־reasoning בחזרה מילה במילה בין קריאות לכלים, ושאין prefill של עוזר. במדד האינטליגנציה של Artificial Analysis, Kimi K3 עומד על 57, רביעי בסך הכול, עם עלות של כ־$0.94 למשימה שנמדדה על הסט הסטנדרטי שלו. זה גם המודל היקר ביותר שמעבדה סינית הוציאה לשוק: $3 למיליון טוקני קלט ו־$15 למיליון טוקני פלט, תמחור ברמת Sonnet, בעוד ש־GLM-5.3 עדיין לא ניתן לתמחור לטוקן בכלל, מכיוון שהוא קיים רק בתוכנית מנוי.
מציאות הגישה והעלות
Kimi K3 נמצא כרגע ב־OrcaRouter במחיר הרישמי של Moonshot — 3$ / 15$ למיליון טוקנים, 0.30$ לקריאות ממטמון, ללא תוספת מחיר — כך שעבודה עם סוכן בעל הקשר של 1M ניתנת לקריאה עם אותו מפתח כמו שאר הערימה שלך, והמשקולות הפתוחות הן אפשרות היציאה אם ברצונך לאחסן לבד. GLM-5.3 הוא זה שקשה להשיג: מנוי חודשי של 18–168 דולר עם מערכת נקודות שמנצלת קרדיטים פי 6.9 על קלט ופי 24 על פלט, תמחור שפל שמפחית בחצי את שריפת הקרדיטים מחוץ לשעות 14:00–18:00 שעון סין, ואין API לפי טוקן עד שבדיקת הבטיחות מאושרת. שכבת הניתוב למעשה משטחת את האסימטריה הזו לחלון של שבועיים: כשהאפי של GLM-5.3 נוחת על אותו מפתח, קריאת פאנל יכולה להריץ את שתי דגמי הדגל הפתוחים מול המשימות שלך ולתת לשופט ליישב ביניהם — ואם אינך יכול לחכות, המשקולות שכבר שוגרו של Kimi K3 הופכות אותו ליחיד מבין השניים שתוכל להפעיל כולו בסביבה מקומית (on-premises) כיום.

איזה הימור משלם?
המסקנה הכנה לאחר שבוע אחד היא ששתי ההימורים משתלמים, אבל בעומסי עבודה שונים. אם העבודה שלך עתירת טרמינל, קרובה לתחום האבטחה, ומתוזמרת על ידי סוכנים, GLM-5.3 הוא הכיוון החזק יותר על פי הראיות שפרסמה Z.ai — ופער אבטחת הסייבר גדול מספיק כדי שכדאי לחכות שבועיים עד פרסום המשקלים ולבדוק אותם בעצמך. אם העבודה שלך כוללת סשנים ארוכים במאגרי קוד, קלט מולטי-מודאלי, או כל דבר שבו אתה צריך את המשקלים בידיים כבר היום, Kimi K3 הוא היחיד מבין השניים שזמין בפועל — וההישגים שלו ב-deep-repo הם אלה שאתה יכול לאמת כבר עכשיו מה-API החי שלו. הדבר היחיד שחשוב לזכור: כל מספר בהשוואה הישירה הזו מגיע מהטבלה של Z.ai עצמה, אז התייחס לפערים בקידוד ככיווניים בלבד עד שמעבדה עצמאית תריץ את שניהם. וזו בדיוק סוג האימות ששבועיים של המתנה יביאו.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
