כרטיס כותרת ראשי להשוואה בין GLM-5.3 ו-GLM-5.2, עם כותרת משנה 'אותו מוח, מדדים מוכפלים', עם שני כרטיסי מודל החולקים בלוק בסיס מחובר יחיד מסוג 743B MoE וחץ שדרוג מעוגל המסומן 'לאחר אימון בלבד' המצביע מ-GLM-5.2 ל-GLM-5.3.
Guides & Insights

GLM-5.3 לעומת GLM-5.2: אותו מוח, מדדים מוכפלים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המסגור של Zhipu AI עצמו לשדרוג מ-GLM-5.2 ל-G​LM-5.3 הוא הכנה: ספר הלימוד לא השתנה, רק האימון של התלמיד השתנה. G​LM-5.3, ששוחרר ב-14 באוגוסט 2026, בנוי על אותו בסיס MoE מדויק של 743 מיליארד פרמטרים כמו GLM-5.2, שהוכתר כמוביל תחום המשקולות הפתוחות במדד Artificial Analysis Intelligence Index ביוני. הארכיטקטורה לא השתנתה, טביעת הרגל לא השתנתה, התמחור של $1.40 / $4.40 למיליון לא השתנה — ובכל זאת Z.ai מדווחת שהמודל שאומן מחדש מכפיל או יותר את ביצועי קודמו בכמה ממדדי הקידוד והאבטחה ששתי הגרסאות מפרסמות. האם זה הופך את G​LM-5.3 לשדרוג חובה או לעניין של חכה ונראה תלוי בכמה אתה סומך על מודל שהשתפר כל כך הרבה בלי לשנות את הארכיטקטורה שלו, ובשאלה אם יכולת הסייבר החדשה שצצה בו היא תכונה שאתה רוצה שתהיה גישה אליה רק אחרי חלון בטיחות של שבועיים.

אותו מוח, שאומן מחדש

כל מה שהפך את GLM-5.2 לשרת מעשי ממשיך בתוקף: ה-MoE בגודל 743B עם כ-40B פרמטרים פעילים, תשומת הלב הדלילה של IndexShare שהפחיתה את ה-FLOPs בהקשר של 1M, רישיון ה-MIT, חלון ההקשר של 1M, ותפוקת הטוקנים החסכונית שנמדדה בכ-145–168 טוקנים לשנייה בתצפית בלתי תלויה. GLM-5.3 שונה בממד אחד בלבד — הפוסט-אימון. Z.ai הגדילה את שלב הלמידה מחיזוקים עם המסגרות IndexShare, SAO ו-Slime, הוסיפה עשרות מונים יותר סביבות משימה עם אופק ארוך, והרחיבה אותן מניפוי באגים בקוד לגילוי פרצות אבטחה והנדסת מערכות. התוצאה היא מודל שמתנהג אחרת על אותה חומרה, וזו בדיוק הסיבה ששאלת השדרוג אינה "האם אני צריך GPUs חדשים" אלא "האם אני צריך התנהגות חדשה."

דלתא של המדד, בשני הכיוונים.

כשקוראים את הנתונים שפרסמה Z.ai כהשוואת לפני-אחרי, הקפיצה היא הגדולה ביותר בהיסטוריה של משקלים פתוחים. Terminal-Bench 3.0 — הגרסה הקשה יותר, שבה שניהם נמדדו — עולה מ-4.6 ל-28.3, קפיצה של פי שישה. DeepSWE v1.1 עולה מ-46.2 ל-66.9, וזה ההבדל בין "מודל פתוח טוב" ל"תחרותי מול המובילים הסגורים". תת-קבוצת ה-CLI של The Agents' Last Exam עוברת מ-23.8 ל-28.5. גילוי הפגיעויות של CyberGym עולה מ-77.2 ל-84.5. התוצאות של ExploitBench מוכפלות ביותר מפי שניים, מ-24.4 ל-54.4, ותפוקת ExploitGym עוברת מ-29 ו-39 משימות שהושלמו (בשעתיים ובשש שעות) ל-105 ו-130. Z.ai מסכמת את זה כשיפור קידוד של כ-50%, וצורת ההשתפרויות — מרוכזת בקידוד ארוך-אופק, אוטומציית טרמינל ואבטחה — עקבית עם מודל של פוסט-אימון בלבד: הידע הגולמי זהה, אבל היכולת לבצע בפועל עבודה רב-שלבית היא מה שהתחזקה.

• Terminal-Bench 3.0 — GLM-5.2 4.6 לעומת GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 לעומת G​LM-5.3 66.9

• מבחן הסוכנים האחרון (CLI) — GLM-5.2 23.8 לעומת G​LM-5.3 28.5

• CyberGym גילוי פגיעות — GLM-5.2 77.2 לעומת G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 לעומת G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

היכולת שאף אחד לא תזמן

ההישגים בתחום האבטחה ראויים לפסקה משלהם, כי ב-Z.ai אומרים שהם לא היו חלק מהתוכנית. צוות הפוסט-אימון הוסיף סביבות גילוי פגיעויות בציפייה לשיפור מתון; המודל, במקום זאת, החל לשרשר ניצולים מלאים – התנהגות מתהווה שאילצה את Z.ai לעכב את המשקלים בשבועיים בערך לצורך חיזוק בטיחות. בבדיקות בעולם האמיתי עם צוותי אבטחה, G​LM-5.3 תרם למציאת 2,436 פגיעויות ב-269 פרויקטים, מתוכן 1,097 בסיכון בינוני או גבוה, כולל ליקויים שנותרו בלתי מזוהים במשך עשורים בתוכנה פרוסה נרחבת. ל-GLM-5.2 הייתה יכולת אבטחה במובן הרגיל – הוא יכול היה לקרוא קוד לאיתור באגים. ל-G​LM-5.3 יש אותה במובן שונה: הוא הדבר שחלון הבטיחות מדבר עליו. זהו שינוי בסוג, לא במידה, וזו הסיבה החזקה ביותר להתייחס לשני המודלים כאל מוצרים שונים למרות הבסיס המשותף.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

אזהרת העקביות

משקל הנגד לכל מספר לעיל הוא שבדיקות צד-שלישי מוקדמות מתארות את G​LM-5.3 כבלתי עקבי באופן ש-GLM-5.2 לא היה. מבקרים בלתי תלויים מדווחים על אותו דגם שמתפקד לעתים כמו מהנדס חיצוני שבקושי עובר את המשימה ולעתים מספק תוצאות ברמה מקצועית, כשההבדל מתואם למידת הבהירות שבה הוגדרו הדרישות. זה בדיוק פרופיל הכישלון שהיית צופה לו מדגם שהרווחים שלו הגיעו כולו מפוסט-אימון כבד על סביבה: הוא מכליל מצורות המשימות שאומן עליהן, והנחיות שהוגדרו בצורה גרועה נופלות מחוץ לטווח הזה. אף אחת מהתוצאות הבלתי תלויות אינה נקייה כמו הטבלאות שפורסמו על ידי Z.ai, ואף אחד מהמספרים של Z.ai לא שוחזר עדיין באופן בלתי תלוי. מבחינת הפקה, זה מצדיק הערכה מפורשת על עומס העבודה שלך לפני ההעברה — אותו הסייג שהיה מוצדק לגבי GLM-5.2, עכשיו עם פער רחב יותר בין המקרה הטוב ביותר לגרוע ביותר.

מחיר, גישה, ושאלת ההמתנה

התמחור זהה, מה שמסיר את החיכוך הרגיל של שדרוג: שני הדגמים עולים $1.40 / $4.40 למיליון טוקנים, כאשר G​LM-5.3 דורש הפעלת חשיבה. הגישה היא ההבדל האמיתי. GLM-5.2 זמין להורדה היום תחת רישיון MIT, ניתן לאירוח עצמי על טביעת FP8 של מתחת ל-terabyte, וניתן לקרוא לו דרך OrcaRouter במחיר המחירון ללא תווך — המודל שאפשר לנתב אליו כבר עכשיו, יציב ומדורג באופן עצמאי. G​LM-5.3 שמיש כעת דרך ZCode / AutoClaw של Z.ai ותוכנית G​LM Coding, אך ה-API הציבורי והמשקולות שניהם חסומים לחלון הבטיחות, ונתוני האבני-בחן שלו כולם מדווחים על ידי הספק וממתינים לריצות חוזרות של צד שלישי. אז התשובה הכנה ל"האם כדאי לי לחכות" כוללת שני חלקים: עבור תעבורת ייצור שאסור לה לסגת, GLM-5.2 נשאר ההימור הבטוח עם משקולות פתוחות כיום, והרגע שה-API של G​LM-5.3 ייפתח והריצות העצמאיות יאומתו, המעבר הוא שינוי ניתוב, לא שכתוב — אתה שומר על אותה הגדרת מפתח יחיד ומחליף נתיב. לעבודות חקר והערכת אבטחה, G​LM-5.3 שווה ניסיון עכשיו דרך הכלים של Z.ai, מתוך הבנה שההובלה שפורסמה אינה מאומתת וההתנהגות שלו משתנה יותר מאשר המודל שהוא מחליף.

המשפט הכנה

G​LM-5.3 הוא המודל הטוב יותר לפי הנתונים של Z.ai עצמו — טוב בהרבה בקוד לטווח ארוך ושונה מהותית באבטחה — והוא לא עולה לזרימת העבודה שלך כי הבסיס, טביעת הרגל והמחיר לא השתנו. אבל „טוב יותר בהערכות הספק” ו„טוב יותר בצינור שלך” מופרדים על ידי שני דברים שלג​LM-5.2 כבר יש ולג​LM-5.3 עדיין אין: שכפול עצמאי ומשקלי הפצה. אם אתה כבר מריץ את GLM-5.2, מסלול השדרוג הוא הזול ביותר בהיסטוריה של משקלים פתוחים — אותו חומרה, אותו מחיר, אותו ממשק API, והמתנה של שבועיים למשקלים. ההחלטה פחות קשורה לשאלה אם G​LM-5.3 טוב יותר מ־GLM-5.2 ויותר לשאלה אם אתה מוכן להמר על ייצור על מודל שהשיפורים שלו, והיכולת האבטחתית החדשה שצצה, טרם אושרו על ידי אף אחד מחוץ ל־Z.ai.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube