
Nex-N2.5 Pro לעומת GLM-5.2: אותו 82.7 ב-Terminal-Bench, שני מוצאים שונים מאוד
- openaiחדשOpenAI: GPT-6 Astra2026-09-0455אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0247אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0247אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0157אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2646אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1849אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1541אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1251אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0547אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0347אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2140אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128אינטליגנציה49כתיבת קוד
שני מודלים סוכניים בעלי משקלים פתוחים, צירוף מקרים מחשיד אחד: Nex-N2.5 Pro ו-GLM-5.2 מופיעים שניהם עם 82.7 ב-Terminal-Bench 2.1. Nex-AGI מציגה 82.7 עבור Nex-N2.5 Pro בכרטיס המודל שלה, שנמדד עם כלי הבדיקה NexCUA של הברית עצמה, שהציבור לא ראה. הנתון המדווח הגבוה ביותר של Z.ai עבור GLM-5.2 באותה סוויטה הוא גם 82.7 — וכאשר כלי בדיקה בלתי תלוי הריץ את המודל מחדש, הוא הגיע ל-77.9, כחמש נקודות מתחת לנתון של הספקית. שוויון מושלם בין נתון שאיש אינו יכול לבדוק לבין נתון שכבר התכווץ ברגע שנבדק אינו שוויון כלל. זוהי ההדגמה הברורה ביותר לכך שההבדל בין "משקלים פתוחים" ל"משקלים שיהיו קיימים בסופו של דבר" מכריע את ההתמודדות הזו עוד לפני קריאת שורת מדד אחת.
שני המודלים יושבים באותה שכונה מסחרית, ובמהותם לא יכולים להיות שונים יותר. Nex-N2.5 Pro, שהוכרז ב-8 בספטמבר 2026, הוא מודל מולטימודלי להפעלת מחשב — 397 מיליארד פרמטרים בסך הכול, עם כ-17 מיליארד פעילים, שמגיע משושלת Qwen3.5, ונועד לקרוא מסך ולנווט סשן דפדפן או סשן שולחן עבודה עם לולאת משוב חזותית. GLM-5.2 הוא מודל הדגל של Z.ai (Zhipu AI) ברישיון MIT, לחשיבה ותכנות לטווח ארוך — כ-743 מיליארד פרמטרים בסך הכול, כ-40 מיליארד מתוכם פעילים, טקסט בלבד, זמין כללית (GA) מאז 16 ביוני 2026, והוא המודל שעיגן במשך חודשים את הציונים העצמאיים של שכבת המודלים בעלי המשקלים הפתוחים. האחד מביט בעולם דרך פיקסלים ופועל בו; השני חושב בטקסט ומפיץ קוד. הרישיון של שני המודלים אומר שאפשר לבנות עליהם עסק; ההבדל הוא שבאחד מהם, הרישיון הזה הוא כרגע בגדר הבטחה.
אותו מספר, שני מקורות שונים
התחל עם השוויון, כי הוא מלמד את כל מערך ההתמודדות. כרטיס המידע של Nex-AGI מצטט את Terminal-Bench 2.1 על 82.7 עבור Nex-N2.5 Pro, לצד OSWorld-2 על 56.4, SWE-Bench Pro על 61.2 ו-BrowseComp על 89.7 — כל אחד מהם הופק באמצעות מערך ה-NexCUA, ואף אחד מהם לא שוחזר באופן עצמאי בימים הראשונים לחיי המודל, מהסיבה הפשוטה שהמשקלים אינם זמינים להורדה. הנתון של Z.ai, 82.7 עבור GLM-5.2 על Terminal-Bench 2.1, הוא המספר הטוב ביותר שדווח על ידי הספק עצמו, אך הוא מבוסס על מודל שכל אחד יכול למשוך מ-Hugging Face ולהריץ מחדש עוד היום; מדידת ה-harness העצמאית של 77.9 כבר קיימת, והיא נמוכה בכ-5 נקודות מהטענה של Z.ai. כאשר מספר של ספק מתכווץ תחת בדיקה עצמאית, זו אינה שערורייה — זה המס הרגיל על מדידה עצמית. כאשר מספר של ספק מתחרה אינו ניתן כלל לבדיקה, היעדר המס הוא הבעיה, לא סימן לכך שהמספר נקי מכל פגם.

קרא את השורות שמסביב באותו אופן. GLM-5.2 מחזיק בקריאת המדד העצמאי הגבוהה ביותר שהדרגה הפתוחה ייצרה — שנות ה-50 הנמוכות במדד האינטליגנציה הנוכחי של Artificial Analysis — וזו הסיבה שהוא מודל הייחוס הפתוח כבר חודשים, למרות שאינו הגרסה החדשה הנוצצת ביותר. ל-Nex-N2.5 Pro אין ערך מדד עצמאי כלל. בשורות שבהן שני הספקים מצהירים על מספרים, המספר הניתן לאימות הוא של הספק הקיים; בשורות שבהן רק Nex-AGI פרסם, המספרים לא שוחזרו. זו אינה פסיקה בשאלה איזה מודל חכם יותר. זו פסיקה בשאלה איזה מודל מותר לך לאמת.
גיליונות המפרט מסכימים יותר ממה שהייתם מצפים.
אם נסיר את הבנצ'מרקים, שני הדגמים קרובים מאוד במאפיינים הבסיסיים:
• שוחרר — Nex-N2.5 Pro: 8 בספטמבר 2026 (נקודות קצה מתארחות פעילות, משקלים בהמתנה). GLM-5.2: GA ב-16 ביוני 2026, משקלים פעילים.
• רישיון — Nex-N2.5 Pro: Apache-2.0, המשקלים יגיעו בקרוב. GLM-5.2: MIT, ניתן להורדה כעת.
• גודל — Nex-N2.5 Pro: 397 מיליארד פרמטרים בסך הכול / ~17 מיליארד פעילים. GLM-5.2: ~743 מיליארד פרמטרים בסך הכול / ~40 מיליארד פעילים.
• מודאליות — Nex-N2.5 Pro: קלט טקסט ותמונה, פלט טקסט, לולאת ראייה לשימוש במחשב. GLM-5.2: מודל חשיבה מבוסס טקסט בלבד.
• הקשר / פלט — Nex-N2.5 Pro: הקשר של 262,144 טוקנים. GLM-5.2: הקשר של 1M טוקנים, תקרת פלט של 128K.
• בקרת חשיבהNex-N2.5 Pro: ללא / בינוני (אדפטיבי, ברירת מחדל) / גבוה. GLM-5.2: בקרות מאמץ החשיבה על אותה מחרוזת מודל.
• מחיר למיליון טוקנים — Nex-N2.5 Pro: שכבה מתארחת בחינם, ללא מחירון. GLM-5.2: $1.40 לקלט / $4.40 לפלט, $0.26 לקלט במטמון.
המעטפות נבדלות בדרכים שבהן עבודות שני המודלים שונות: GLM-5.2 מביא מיליון טוקנים מלאים של הקשר טקסט ותקרת פלט של 128K למפגשי הנדסה ארוכים, בעוד ש-Nex-N2.5 Pro מחליף את גודל ההקשר בערוץ ראייה ובחלון קטן יותר של 262K המיועד לעומסי עבודה בגודל מסך. אף מפרט אינו שגוי; הם מותאמים למשימות שונות.
משקלים פתוחים, שתי משמעויות שונות

כאן ההשוואה מפסיקה להיות עניין של מספרים לחלוטין. GLM-5.2 פתוח בדרך שמשווקים מוצר שאפשר לבנות עליו עסק: רישיון MIT, משקלים ב-Hugging Face, ללא הגבלה על שימוש מסחרי, ללא סעיף שיתוף נתונים, ללא ספק שמשגיח עליך. אתה יכול להוריד אותו, לכוונן אותו, להפעיל אותו מאחורי גבולות הציות שלך, או לקחת אותו לכל מארח שתרצה — ובגלל שהמשקלים פורסמו, למחיר שלו יש רצפה שאף ספק יחיד לא יכול להעלות. Nex-N2.5 Pro מובטח תחת Apache-2.0, רישיון מתירני במידה שווה, אבל הבאנר בכרטיס ה-Hugging Face שלו אומר שהמשקלים יגיעו בקרוב, וללא תאריך מחויב. עבור צוות הכפוף לכללי ממשל נתונים, או כזה שרוצה להימלט לחלוטין מתמחור לפי אסימון בקנה מידה, ההבדל הזה הוא כל ההחלטה: GLM-5.2 הוא מודל שאתה יכול להחזיק היום, ו-Nex-N2.5 Pro הוא מודל שהבטיחו לך. החשבון של אירוח עצמי גם מטה את הכף לטובת החדש כשהמשקלים סוף סוף יגיעו — 17B פרמטרים פעילים על צומת של שמונה H100 הוא טביעת רגל נגישה הרבה יותר מהמכונה של GLM-5.2 עם ~40B פרמטרים פעילים — אבל הביטוי "כשהמשקלים יגיעו" עושה הרבה עבודה במשפט הזה.
המשפחות נעות בכיוונים מנוגדים
שני הדגמים יושבים בתוך משפחות שנעות במהירות, והמסלולים מושכים לכיוונים שונים. השושלת של GLM-5.2 שקופה ואינקרמנטלית: Z.ai שלחה את GLM-5.3 באוגוסט כרענון פוסט-אימון של אותו בסיס 5.2, ואת GLM-5.3 Flash בתחילת ספטמבר. לכן, משקלי ה-5.2 שעליהם אתה בונה כיום הם הבסיס שהמשפחה ממשיכה לשפר — הידע הארכיטקטוני שלך והכיוונונים העדינים שלך ממשיכים הלאה. המשפחה של Nex-AGI היא הימור על דור חדש לגמרי: Nex-N2.5 Mini עם 35B פרמטרים, Nex-N2.5 Pro עם 397B פרמטרים, ו-Nex-N2.5 Max טקסט-בלבד עם 1.6T פרמטרים, whose own base is DeepSeek-V4-Pro-Base, כשמשקלי ה-Pro, שהיו מאפשרים לכל אחד לאמת את טענות המשפחה, עדיין לא פורסמו. צוות שבוחר פלטפורמה לבנות עליה בוחר בין שושלת עם מפת דרכים מפורסמת של רענונים לבין מהדורה ראשונה שהמערכה השנייה שלה עדיין לא הגיעה.
איזה אחד זוכה במקום בבילד שלך?
אם הדרישה שלך היא ש"המודל חייב להיות שלנו" — לצורכי ממשל נתונים, לצורכי ביקורת, או עבור מוצר שאינך רוצה שספק יחיד ישלוט בו — אז GLM-5.2 אינו הבחירה הטובה יותר בהשוואה הזאת; הוא הבחירה היחידה, כי הוא המודל היחיד שאפשר להוריד. הוא גם היחיד עם ציון עצמאי, והוא מתומחר לפי רשימת Z.ai ב-1.40 דולר למיליון טוקני קלט וב-4.40 דולר למיליון טוקני פלט. אם הדרישה שלך היא סוכן רב-מודאלי לשימוש במחשב שעשוי בסופו של דבר לחתור תחת המובילים הסגורים, הרי שהתזה ארוכת-הטווח המעניינת יותר היא Nex-N2.5 Pro — אופרטור ראייה עם 17B פרמטרים אקטיביים מברית שברור שהיא יודעת מה היא רוצה לבנות — אבל תזה איננה תלות, ונקודת קצה מתארחת בחינם איננה בסיס.

הדרך המעשית לפעול על כל זה היא לבנות על מה שקיים ולמדוד את ההבטחה כשהיא מתממשת. GLM-5.2 זמין ב-OrcaRouter במחיר הרשימה של Z.ai — אותו $1.40 / $4.40, מועבר ללא תוספת מחיר — ומכיוון שהוא בעל משקלים פתוחים, הוא גם ניתן לאירוח עצמי אם ברצונך שהמדידה תכלול את סטאק השרתים שלך. הוא מהווה את נקודת הייחוס להרצת עומס העבודה האג'נטי שלך בפועל מולו כיום, כשה-DSL לניתוב מייצג את היום שבו Nex-N2.5 Pro יופיע אצל ספק במחיר רשימה: כשזה יקרה, החלפת ההשוואה תהיה כלל ניתוב, לא הגירה. עד שהתוצאות המלאות יתפרסמו ומסגרת בדיקה בלתי תלויה תאשר — או תתקן — את הציון 82.7, Nex-N2.5 Pro מול GLM-5.2 הוא קרב בין מודל בר-אימות לבין מספר שאינו ניתן לאימות.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
