כרטיס כותרת להשוואה בין GLM-5.3 ל-Kimi K3: קובייה קטנה יותר בצד שמאל המסומנת GLM-5.3, עם התווית 'בסיס 743B שעבר post-training', וקובייה גדולה יותר בצד ימין המסומנת Kimi K3, עם התווית 'בסיס 2.8T שנבנה מאפס'.
Guides & Insights

GLM-5.3 מול Kimi K3: לסחוט בסיס של 743B או לבנות אחד של 2.8T — איזו הימור משתלם?

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המירוץ הסיני של מודלי המשקלים הפתוחים התפצל זה עתה לשתי תשובות לאותה שאלה. Moonshot AI בנתה את Kimi K3 מאפס — בסיס תערובת מומחים עם 2.8 טריליון פרמטרים, מודל המשקלים הפתוחים הגדול ביותר ששוחרר אי פעם, שהוכרז ב-16 ביולי 2026 והמשקלים שלו פורסמו ב-27 ביולי. G​LM-5.3 הוא ההימור ההפוך: Z.ai שמר על אותו בסיס מדויק של 743 מיליארד פרמטרים שהניע את GLM-5.2, והשקיע את כל מחזור השחרור בפוסט-אימון, בטענה שתקרת האינטליגנציה של מודל הבסיס מעולם לא הייתה הבעיה. שניהם דגמי דגל עם חלון הקשר של 1M, ממוקדים בקידוד ובסוכנים, ושניהם טוענים להיות מודל הקידוד הפתוח הטוב ביותר בשוק. הם לא יכולים שניהם להיות הדרך הטובה ביותר לנצל את אותו תקציב, והבנצ'מרקים אכן מתפצלים בדיוק באמצע — מה שהופך את זה לפחות להשוואה ויותר למשאל עם על איך לבנות את מודל הפרונטיר הבא.

שני הימורים על איך לבנות מודל מתקדם

Z.ai מכנה את G​LM-5.3 "חפירה עמוקה" במקום שדרוג דורי. הבסיס הוא בדיוק אותו דגם של 743B כמו GLM-5.2; ההבדל הוא כולו בפוסט-טריינינג, המבוצע דרך מסגרת ה-slime בקוד פתוח על משימות שמשתרעות על פני סשנים הנדסיים שלמים — אבחון, תיקון, אימות ושחרור על פני קלאסטרים אמיתיים, מערכות אחסון ובסיסי קוד, שחלקן אורכות כמה ימי עבודה של מהנדס בכיר. השיפורים המדווחים של הספק הם גדולים: קפיצה של 50% ב-Code Bench שלו, Terminal-Bench 3.0 מ-4.6 ל-28.3, DeepSWE v1.1 מ-46.2 ל-66.9, ויכולת סייבר שאילצה בחינת בטיחות לפני משלוח המשקלים. Moonshot הלכה לכיוון ההפוך. Kimi K3 הוא בסיס חדש לגמרי — 2.8T פרמטרים בסך הכול, עם כ-104B פעילים לכל טוקן (16 מתוך 896 מומחים), ארכיטקטורת Kimi Delta Attention, קלט תמונה ווידאו מובנה, חשיבה תמידית שלא ניתנת לכיבוי, וחלון הקשר של 1M גם בקלט וגם בפלט. בעוד Z.ai מהמרת שיותר מאותו הדגם מספיק, Moonshot מהמרת שהבסיס עצמו הוא התקרה.

The Z.ai research blog post announcing GLM-5.3, dated August 14 2026, titled GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, with a Coding Plan / Code with ZCode call to action and a HuggingFace (Coming Soon) button.

ראש בראש, עם מקור מצורף

המקום היחיד שבו שני הדגמים מופיעים באותו עמוד הוא טבלת ההשקה של Z.ai עצמה, אז משם מגיעים המספרים זה לצד זה — מסומנים כמדווחים על ידי הספק, לא נבדקו באופן בלתי תלוי. הנתונים העצמאיים של Kimi K3 תואמים את מה שמונשוט פרסמה ביולי ואת מה ש-Artificial Analysis מודדת, אך אף מעבדה נייטרלית לא הריצה את שניהם עדיין.

Terminal-Bench 3.0 — G​LM-5.3 עם 28.3 לעומת Kimi K3 עם 17.4 (הטבלה של Z.ai). זהו פער הקוד הגדול ביותר בהתמודדות, בגרסה החדשה והקשה ביותר.

Terminal-Bench 2.1 — G​LM-5.3 עם 88.2 מול Kimi K3 עם 88.3. תיקו מושלם.

DeepSWE v1.1 — G​LM-5.3 עם 66.9 לעומת Kimi K3 עם 67.5. Kimi בהפרש זעיר.

SWE-Marathon v1.1 — G​LM-5.3 עם 42.5 לעומת Kimi K3 עם 48.1. הניצחון הטוב ביותר של Kimi בקידוד.

ExploitGym — G​LM-5.3 עם 105/130 לעומת Kimi K3 עם 36/70. כמעט ניצחון מוחלט ל-G​LM.

GDPval-AA v2 (עבודת ידע) — G​LM-5.3 ב-1,769 לעומת Kimi K3 ב-1,682.

גישה — G​LM-5.3: מנוי ל-Coding Plan, משקלי המודל חסומים עד בערך 28 באוגוסט. Kimi K3: ה-API פעיל ב-$3 / $15, המשקלים זמינים להורדה מאז 27 ביולי.

A comparison scoreboard for GLM-5.3 and Kimi K3: GLM-5.3 shows Terminal-Bench 3.0 of 28.3, Terminal-Bench 2.1 of 88.2, DeepSWE v1.1 of 66.9, ExploitGym of 105/130, GDPval-AA v2 of 1,769 and weights around August 28, versus Kimi K3s 17.4, 88.3, 67.5, 36/70, 1,682, weights live since July 27 and $3/$15 API pricing.

החפיר הביטחוני הוא ההפרדה האמיתית

הורידו את מדדי התכנות מהמשוואה, וההבדל המכריע הוא אבטחת סייבר. G​LM-5.3 מדווח 84.5 ב-CyberGym לעומת 80.0 של Kimi K3, וציון ה-ExploitBench שלו, 54.4, הוא כמעט כפול מ-32.2 של Kimi K3. ב-ExploitGym הפער הוא לא הבדל, אלא קטגוריה אחרת — 105 ו-130 לעומת 36 ו-70 בריצות של שעתיים ושש שעות. זו הסיבה ששתי ההשקות מרגישות כל כך שונות בפועל: המשקלים של Kimi K3 חשופים לציבור תחת רישיון Modified MIT, בעוד המשקלים של G​LM-5.3 מוחזקים לצורך חיזוק בטיחות, משום ש-Z.ai אומרת שהמודל טוב מספיק במציאת וניצול פרצות, כך ששחרור המשקלים מיד הרגיש חסר אחריות. אם העבודה שלך כוללת ביקורת על קוד של מישהו אחר, או הגנה על הקוד שלך מפני ציד חולשות אוטומטי, זו הנקודה הרלוונטית ביותר בכל ההשוואה — והיא גם הפחות מאומתת באופן בלתי תלוי.

איפה קימי K3 נלחם בחזרה

הניצחונות של Kimi K3 מתרכזים במקום שבו G​LM-5.3 הוא החלש ביותר: עבודת רפוזיטורי ארוכת טווח. הוא שומר על היתרון ב־DeepSWE וב־SWE-Marathon, מוביל ב־Toolathlon Verified, וחלון הפלט שלו של מיליון טוקנים אומר שהוא יכול לכתוב קודבס שלם או trace סוכן ארוך במעבר אחד. ה־reasoning התמידי שלו מזרים את ה־trace המלא ל־API, שמפתחים הגדירו כשימושי הרבה יותר לניפוי באגים בסוכנים מאשר הסברי סיכום אטומים — כשהמלכוד התפעולי הוא שחובה להעביר את שדות ה־reasoning בחזרה מילה במילה בין קריאות לכלים, ושאין prefill של עוזר. במדד האינטליגנציה של Artificial Analysis, Kimi K3 עומד על 57, רביעי בסך הכול, עם עלות של כ־$0.94 למשימה שנמדדה על הסט הסטנדרטי שלו. זה גם המודל היקר ביותר שמעבדה סינית הוציאה לשוק: $3 למיליון טוקני קלט ו־$15 למיליון טוקני פלט, תמחור ברמת Sonnet, בעוד ש־G​LM-5.3 עדיין לא ניתן לתמחור לטוקן בכלל, מכיוון שהוא קיים רק בתוכנית מנוי.

מציאות הגישה והעלות

Kimi K3 נמצא כרגע ב־OrcaRouter במחיר הרישמי של Moonshot — 3$ / 15$ למיליון טוקנים, 0.30$ לקריאות ממטמון, ללא תוספת מחיר — כך שעבודה עם סוכן בעל הקשר של 1M ניתנת לקריאה עם אותו מפתח כמו שאר הערימה שלך, והמשקולות הפתוחות הן אפשרות היציאה אם ברצונך לאחסן לבד. GLM-5.3 הוא זה שקשה להשיג: מנוי חודשי של 18–168 דולר עם מערכת נקודות שמנצלת קרדיטים פי 6.9 על קלט ופי 24 על פלט, תמחור שפל שמפחית בחצי את שריפת הקרדיטים מחוץ לשעות 14:00–18:00 שעון סין, ואין API לפי טוקן עד שבדיקת הבטיחות מאושרת. שכבת הניתוב למעשה משטחת את האסימטריה הזו לחלון של שבועיים: כשהאפי של GLM-5.3 נוחת על אותו מפתח, קריאת פאנל יכולה להריץ את שתי דגמי הדגל הפתוחים מול המשימות שלך ולתת לשופט ליישב ביניהם — ואם אינך יכול לחכות, המשקולות שכבר שוגרו של Kimi K3 הופכות אותו ליחיד מבין השניים שתוכל להפעיל כולו בסביבה מקומית (on-premises) כיום.

The OrcaRouter model page for MoonshotAI Kimi K3, showing the New and Featured badges, the kimi/kimi-k3 slug, $3.00 per million input and $15.00 per million output pricing, and text plus image input.

איזה הימור משלם?

המסקנה הכנה לאחר שבוע אחד היא ששתי ההימורים משתלמים, אבל בעומסי עבודה שונים. אם העבודה שלך עתירת טרמינל, קרובה לתחום האבטחה, ומתוזמרת על ידי סוכנים, GLM-5.3 הוא הכיוון החזק יותר על פי הראיות שפרסמה Z.ai — ופער אבטחת הסייבר גדול מספיק כדי שכדאי לחכות שבועיים עד פרסום המשקלים ולבדוק אותם בעצמך. אם העבודה שלך כוללת סשנים ארוכים במאגרי קוד, קלט מולטי-מודאלי, או כל דבר שבו אתה צריך את המשקלים בידיים כבר היום, Kimi K3 הוא היחיד מבין השניים שזמין בפועל — וההישגים שלו ב-deep-repo הם אלה שאתה יכול לאמת כבר עכשיו מה-API החי שלו. הדבר היחיד שחשוב לזכור: כל מספר בהשוואה הישירה הזו מגיע מהטבלה של Z.ai עצמה, אז התייחס לפערים בקידוד ככיווניים בלבד עד שמעבדה עצמאית תריץ את שניהם. וזו בדיוק סוג האימות ששבועיים של המתנה יביאו.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube