GLM-5.3-Flash נחשף — ה"אוקס אלפא" האנונימי היה מודל החזית הרב-מודאלי הפתוח של Zhipu לאורך כל הדרך. איור מחודש.
Guides & Insights

GLM-5.3-Flash, חמישה שבועות לאחר מכן: 42 בלתי-תלוי, ריצת ניצול ברמת Mythos, וסוכן ה-GLM שבנה מחדש את מחסנית ההגשה של עצמו

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

GLM-5.3-Flash משרת תעבורת פרודקשן כבר חמישה שבועות, וב-17 בספטמבר 2026 Zhipu AI אמרה משהו על היכן: החברה חשפה שכל בקשת פרודקשן ל-GLM-5.3-Flash רצה כעת על צי של יותר מ-100,000 מאיצי AI מתוצרת סינית מקומית, שהיא עברה מהאתחול הראשון על החומרה הזו לנשיאת כל עומס העבודה החי שלה בפחות משבועיים, ושהתפוקה מקצה לקצה עלתה פי 3.2 לאורך אותה תקופה. החלק שהגיע הכי רחוק הוא מי שעשה את העבודה. חלק גדול ממנה נעשה לא בידי צוות התשתיות אלא בידי סוכן המונע על ידי GLM-5.3 עצמו, שקרא צווארי בקבוק, הציע תיקונים וכתב קוד של מערכות אינפרנס, כשהמהנדסים מגדירים מטרות, בונים את סביבת המשוב ובודקים כל דבר שנגע בסמנטיקה נומרית, ב-concurrency או בסיכון פרודקשן. GLM-5.3-Flash הוא המודל המולטימודלי בעל 320 מיליארד פרמטרים בסך הכול ו-18 מיליארד פעילים (320B-A18B) ש-Zhipu השיקה ופתחה בקוד פתוח ב-26 באוגוסט 2026 — ה-"Ox Alpha" האנונימי שהחברה חשפה באותו יום — ואחיו הגדול GLM-5.3 הוא דגל ה-743B שמולו תומחר. אף אחד משלושת המספרים בגילוי של היום לא הגיע מאיתנו או ממישהו אחר: הם של Zhipu עצמה. גם הדגל אינו עוד ההשוואה היחידה שחשובה: ב-ExploitBench, הערכה בלתי תלויה של עד כמה מודל מטפס בסולם ניצול פרצות אמיתי של Chrome, GLM-5.3-Flash נמדד כעת בשווה ל-Claude Mythos Preview, מודל החזית הסגור שמפתחיו שחררו רק למגנים שעברו בדיקה, בשבריר מהעלות לכל ניסיון.

זו הבשורה הטובה, והיא אמיתית אך נמסרה מפי הספק. שלושה דברים אחרים השתנו מאז שהפוסט הזה פורסם לראשונה ביום ההשקה, ושניים מהם פועלים בכיוון ההפוך. Artificial Analysis פרסמה כעת מדידה משלה של המודל, והנתון שלה אינו הנתון של Zhipu. הנחת ההשקה שהפכה אותו למודל בעל היכולות הזול ביותר בשוק פגה כמתוכנן ב-9 בספטמבר ולא הוארכה. וגוף הערכה חיצוני, Generality Labs, פרסם ריצת ExploitBench משלו, שבה GLM-5.3-Flash קיבל ציון מעל הממוצע של שלוש ריצות של Claude Mythos Preview באותו סולם — בעלות של בערך שישה סנטים לדולר. עבור כל מי שסימן את המודל הזה בסוף אוגוסט כ"הזול", החשבון היום שונה ממה שהיה, והכותרת הכנה היא מעורבת: כלכלת ההגשה באמת השתפרה, המחיר עלה כי מבצע הסתיים, נתון האינטליגנציה המצוטט בהרחבה לא שרד את המגע הראשון עם מערכת בדיקה עצמאית, והשוואת היכולות שכן נטתה לטובת המודל היא ריצה אחת ללא ביקורת עמיתים, שמחבריה עצמם אומרים שאין להסיק ממנה יותר מדי.

Zhipu הוא המקור היחיד לגודל האשכול, ללוח הזמנים של שבועיים ולפי 3.2 — אין ביקורת בלתי תלויה על אף אחד מהם, והחברה עצמה אומרת שהיא לא השיגה שיפור עצמי רקורסיבי, ומתארת את התוצאה כלולאה בקנה מידה מינימלי ולא כדבר האמיתי. את מה שאפשר לבדוק, בדקנו: התוצר המוחשי היחיד בדיווח שנמצא מחוץ לכותלי Zhipu — תיקון דיוק בקרנל Flash Linear Attention — אכן מוזג במעלה הזרם, ואישרנו זאת. כאשר נתון בהמשך מגיע מ-Zhipu, זה מצוין. כאשר הוא מגיע מ-Artificial Analysis, זה מה שמצוין במקום. כאשר הוא מגיע מ-Generality Labs — הגוף להערכת בטיחות שעומד מאחורי נתוני האקספלויטים בפוסט הזה — זה מצוין, יחד עם ההסתייגויות שמחבריו צירפו בעצמם: ריצה אחת, 41 באגים, שיטה שפורסמה בעצמם, ללא שחזור על ידי צד שלישי, ושאלת זיהום שהם מעלים ביוזמתם. כאשר מספר הוא של Anthropic — הנתונים היחידים כאן שמגיעים ממעבדה עם אינטרס תחרותי בתשובה — הטקסט אומר איזה מודל הוא למעשה מדד, כי לא כולם מתייחסים למודל הזה.

מה שנשלח בפועל

GLM-5.3-Flash הוא מודל תערובת-מומחים (MoE) עם 320B פרמטרים בסך הכול / 18B פעילים, בעל 45 שכבות, מה שמעמיד את טביעת הרגל הפעילה שלו על מעט יותר ממחצית מכ-32B של GLM-5.2. היכולת המובילה היא מודאליות: הוא מקבל באופן מובנה קלט של טקסט, תמונה וווידאו — המודל הראשון של GLM-5 שעושה זאת — במקום לנתב ראייה דרך מתאם נפרד. ההקשר מגיע למיליון טוקנים, ו-Zhipu טוענת שעלות ההגשה בהקשר ארוך מגיעה לכשליש מזו של GLM-5.3.

בכל הנוגע לארכיטקטורה, Zhipu מתארת אותו כמודל החזית הראשון בקוד פתוח שמשלב קשב היברידי דליל-בתוספת-לינארי עם Manifold-Constrained Hyper-Connections (mHC) לצורך סקיילינג, וכן מנגנון IndexPool שמכווץ ארבעה וקטורי מפתח של אינדקסר למאגר משוקלל אחד כדי לקצר השהיה בהקשר ארוך. האימון המקדים התבצע על קורפוס מולטימודלי בן 30 טריליון טוקנים. שום דבר מזה לא עבר ביקורת בלתי תלויה — זה Zhipu שמתארת את המודל של עצמה — אבל טענות היעילות בהגשה ספציפיות מספיק כדי לבדוק אותן עכשיו, כשהמשקולות יושבות מול סטאק ההסקה בקוד פתוח, והדיווח מ-17 בספטמבר מוסיף את התמונה המפורטת הראשונה של איך צד ההגשה נבנה בפועל.

מפרט ההשקה, במבט חטוף:

• פרמטרים — 320B סה״כ / 18B פעילים, 45 שכבות, MoE.

• מודאליות — קלט נייטיבי של טקסט, תמונה ווידאו; פלט טקסט.

חלון הקשר — עד 1,000,000 טוקנים.

• רישיון — MIT, משקולות פתוחות ב-Hugging Face מאז יום ההשקה.

• מחיר — $0.15 / $0.50 למיליון טוקנים (קלט / פלט), $0.03 למיליון קלט במטמון.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

הכרטיס הזה הוא תמונת מצב מיום ההשקה, ושתיים מהשורות שלו השתנו מאז 26 באוגוסט. נתון מדד ה-AA הוא עדיין טענה עצמית של Zhipu וכעת הוא נסתר על ידי מדידה בלתי תלויה — עוד על כך בהמשך. המחיר המוזל שהוא מציג נעלם; המבצע הסתיים ב-9 בספטמבר. מספרי הפרמטרים, חלון ההקשר, הרישיון והמודאליות הם עובדה עדכנית ללא שינוי, והם מה שהתמונה נועדה בעיקר בשבילם.

שבוע Ox Alpha, ומה שהמתנה החינמית באמת בחנה

החשיפה חתמה שבוע של השערות. ב-20 באוגוסט הופיע מודל אנונימי בפלטפורמת API של צד שלישי לבינה מלאכותית עם חלון הקשר של מיליון טוקנים, קלט טקסט/תמונה/וידאו ומחיר של אפס, והוא הפך במהירות למודל שקיבל את מספר הקריאות הרב ביותר בדירוגים השבועיים של אותה פלטפורמה. הקהילה עקבה בעזרת טביעת אצבע אחר מקורו עד למשפחת GLM של Zhipu בתוך 48 שעות — אותו דפוס של מודל אנונימי שאחר כך מיוחס למפתח, דפוס שזיהה בעבר מודלים ממעבדות סיניות אחרות — ואנליסטים שיערו באופן נרחב שמדובר בגרסת Flash של GLM-5.3. ההכרזה ב-26 באוגוסט אישרה את ההשערה: השבוע החינמי היה מבחן מכוון, והחברה אומרת שההרצה האנונימית העבירה יותר מ-62 טריליון טוקנים בשישה ימים בפלטפורמות הקידוד שבהן הוצע, כשהיא כולה הוגשה משבבים סיניים מתוצרת מקומית.

הסעיף האחרון הזה נראה בזמנו כמו הערת שוליים. התברר שזה היה העיקר. השבוע החינמי לא היה בעיקרו גימיק שיווקי, ואפילו לא מבחן עומס של המודל; הוא היה מבחן עומס של צי המאיצים שמתחתיו, שנערך בהיקף שבו כשל היה הופך לפומבי וללא עלות. שלושה שבועות לאחר מכן Zhipu מתארת את אותו צי כנושא 100% מתעבורת הייצור של המודל.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

לוגיקת התמחור של אותו שבוע עדיין תקפה, עם תיקון אחד. דגם שניתן במתנה במחיר 0 דולר לשבוע ואז הושק בעשירית מהמחיר של דגם הדגל עם הנחה נוספת של 50% היה מהלך מכוון ליצירת שוק בשכבת התקציב, וההסתייגות "לזמן מוגבל" הייתה תמיד החלק שכדאי לשים לב אליו. סימנו אותו כדבר שאפשר לחזור בו. חזרו בו לפי לוח הזמנים — מה ששווה לומר בבירור, כי תפוגת ההנחה היא השינוי היחיד בסיפור הזה שמופיע בחשבון.

סטאק ההגשה שסוכן בנה מחדש

התיאור הטכני של Zhipu מ-17 בספטמבר הוא התיאור המפורט הראשון של האופן שבו GLM-5.3-Flash מוגש על שבבים סיניים, והטענה המרכזית שלו היא שמודל עזר לייעל את המערכת שמפעילה אותו. החברה מכנה את המנגנון משוב צפוף: בדיקות נכונות, יומני הרצה, עקבות, מיקרובנצ'מרקים ומדדים מקצה לקצה חוברו כך שסוכן יוכל לאמת השערה באופן מקומי במקום להמתין לפריסה מלאה ולבדיקת עומס לאחר כל שינוי. כדי שזה יעבוד, Zhipu אומרת שהמשוב היה צריך להיות מקומי, זול וניתן לבדיקה אובייקטיבית — כבול ל-kernel או לנתיב קוד ספציפי, מהיר מספיק כדי לבצע איטרציות, ונכון או שקרי ללא אדם בלופ.

כאשר הלולאה הזו הייתה במקום, הסוכן מצא ותיקן שלושה דברים שהחברה תיארה בפירוט:

• נתיב context-parallel בקרנל KDA איבד דיוק ככל שהרצפים גדלו, מכיוון ש-tl.dot השתמש כברירת מחדל ב-TF32 למרות קלטי FP32, מה שהעצים את שגיאת העיגול עם אורך ההקשר. התיקון מקבע את דיוק הקלט ל-tf32x3, עם נפילה חזרה ל-ieee בפלטפורמות ללא תמיכה ב-TF32. זהו המעניין ביותר מבין השלושה, מכיוון שזו הטענה היחידה בדיווח שיוצאת אל מחוץ לתשתית של Zhipu עצמה: השינוי מוזג במעלה הזרם ב-Flash Linear Attention כ-PR #1180, שבדקנו ואישרנו שמוזג ב-27 באוגוסט 2026.

• העברת KV לא חפפה לתזמון של DeepEP. לא intranode dispatch ולא intranode combine שחררו את ה-GIL של Python בגרסת DeepEP שבה נעשה שימוש, מה שתקע את תהליכון ההעברה מאחוריהם; תיאורים באנגלית ובסינית של אותה כתיבה הציבו את התקורה הנובעת מכך מעל 20% ומעל 30% בהתאמה. לאחר התיקון, Zhipu אומרת שהפער לעומת קו הבסיס שלה במצב prefill בלבד ירד מתחת ל-1%.

• קרנל פענוח חישב מחדש את אותו נרמול FP32 ו-gating ארבע פעמים, פעם אחת לכל אריח במימד V. פיצול עבודת החלוקה קיצר את זמן הקרנל ב־9.6%, ומיזוג האריחים לבלוק תהליכונים יחיד — כך שהנרמול רץ פעם אחת — הניב האצה של פי 1.71.

סביב התיקונים האלה נמצאים השינויים המבניים: ReplaySSM, אשר מחליף חישוב בזיכרון על-שבב כי למאיצים יש פחות מהאחרון מאשר ל-GPUs שעבורם נכתבה במקור ערימת התוכנה; מקביליות טנזורית תוך-צומתית כדי להקל על אותו לחץ; מטמון משולב של INT8, FP8 ו-BF16 כדי להרחיב קיבולת; וארכיטקטורה מפורקת של Encode-Prefill-Decode שמתזמנת את שלושת שלבי ההסקה בנפרד ולא כצינור אחד. Zhipu גם מפרטת את המגבלות בכנות — זיכרון על-שבב מוגבל ורוחב פס חיבוריות, תוכנה לא בשלה, כיסוי קרנלים חלקי ותיעוד דל — ואומרת שהיא לא השיגה שיפור עצמי רקורסיבי, ומתארת את התוצאה כלולאה בקנה מידה מינימלי.

קראו את הדיווח בספקנות, כי התמריצים ברורים. Zhipu לא תאמר כמה מהעבודה ביצע הסוכן לעומת כמה ביצעו המהנדסים, ואין ביקורת חיצונית על נתון התפוקה, לוח הזמנים של השבועיים או גודל האשכול. המסגור של משוב צפוף הוא גם אינטרסנטי באופן ספציפי: הוא הופך את הטענה הנשמעת המרשימה ביותר ("המודל שלנו שיפר את עצמו") להישען על הראיות שהכי קשה לבדוק (לולאה פנימית שאיש אינו יכול לבדוק). מה שמונע מהסיפור להיות שיווק טהור הוא שהטענה הקונקרטית ביותר שלו ניתנת להפרכה ומתבררת כנכונה — תיקון הקרנל tf32x3 אכן נמצא במאגר ה-upstream, מתוארך ל-27 באוגוסט, שלושה שבועות לפני מחזור הפרסום סביבו.

כמה זה עולה, בדולרים בפועל

מחירון התעריפים הוא של Zhipu, והוא פשוט: $0.15 למיליון טוקני קלט, $0.50 למיליון טוקני פלט ו-$0.03 למיליון טוקני קלט במטמון. זהו מחיר המחירון נכון להיום. מבצע ההשקה של 50% הנחה נמשך עד 9 בספטמבר 2026 ולא הוארך, כך שהמספרים $0.075 / $0.25 / $0.015 שהסתובבו בהרחבה בסוף אוגוסט אינם זמינים עוד ב-API של הספק עצמו. לעומת $1.40 / $4.40 המפורסמים של GLM-5.3, ה-Flash עדיין מגיע לכעשירית במחיר מחירון — ההנחה הייתה בונוס על גבי מחיר שכבר היה העיקר, לא המחיר עצמו. Artificial Analysis מחשבת תעריף משוקלל של כ-$0.10 למיליון טוקנים על בסיס תמהיל של 7:2:1 של פגיעות מטמון/קלט/פלט, ומציינת מהירות פלט של כ-117 טוקנים לשנייה, שאותה היא מתארת כמהירה במיוחד, אם כי AA מציינת שנתוני המהירות מתארים את ה-API של המפתח עצמו של המודל ולא בדיקה שהריצה AA.

סיפור העלויות הרחב יותר של Zhipu הוא הסיבה לכך שהמחיר יכול להישאר שם. בתוצאות החצי-שנתיות שלה, שפורסמו ב-31 באוגוסט, מסרה החברה כי עלות ההסקה ליחידת טוקן בצי המקומי שלה בן 100,000 מאיצים ירדה ב-80% מאז תחילת 2026, וכי שולי הרווח הגולמי של ה-API עברו ממינוס 0.4% ל-24.6% כתוצאה מקנה מידה, תמחור והגשה זולה יותר. אלה נתוני חברה מחברה שמדווחת לבעלי מניות, והם אינם מבוקרים על ידינו; התייחסו אליהם כאל מצביעים בבירור על כיוון ולא כאל מדויקים. תיאור ההגשה שלעיל הוא המנגנון שמאחורי הטענה — פחות מעברי קרנל מיותרים, פחות לחץ על הזיכרון, חפיפה טובה יותר — וזה סיפור אמין יותר מאחוז יבש, גם אם האחוז הוא זה שיצוטט.

הטענות ליעילות לעומת דגם הדגל לא השתנו: חישוב ה-Attention נמוך פי 3.0 ומטמון ה-KV נמוך פי 4.4 לעומת GLM-5.3, לפי דיווח הספק, כשז'יפו מודה שמטמון ה-KV שלה נותר מעט גדול מזה של DeepSeek V4 Flash ושל Kimi K3. הטענה מלעת ההשקה בדבר שיפור מקצה לקצה של פי 3 בהגשה על שבבים מקומיים מנוסחת כעת כפי 3.2, כפי שנמדד מאתחול ראשון ועד תעבורה מלאה בייצור. שני המספרים הם של ז'יפו, ושתי הידיעות שנושאות אותם מרוחקות זו מזו בשלושה שבועות — שום דבר כאן לא שוחזר מחוץ לחברה.

למה החשיפה חשובה — ולאן נעלם הנתון הראשי

התיקון החשוב ביותר לכל מי שקרא את סיקור ההשקה ושמר את המספר. החומרים של Zhipu מציבים את GLM-5.3-Flash ב-57 ב-Artificial Analysis Intelligence Index, בהתאמה ל-Claude Opus 4.8. מאז פרסמה Artificial Analysis מדידה משלה של המודל ב-Intelligence Index v4.3, והיא עומדת על 42 — לעומת 47 ל-GPT-5.6 Sol (max) באותה גרסה. המספר 57 מעולם לא היה נתון בלתי־תלוי; הוא היה של Zhipu, ומדידה בלתי־תלויה ממקמת את המודל כחמש נקודות מתחת לטווח הסמוך לחזית, והרבה מתחת לנתון הכותרת של היצרן. באותו אינדקס עדכני, GLM-5.3 עצמו נמדד ב-45, ולכן הנתון 60 עבור דגם הדגל שהופיע בסיקור ההשקה שלנו כבר אינו תואם את מה ש-Artificial Analysis מפרסמת היום. הפער של 15 נקודות בין הטענה למדידה אינו הפרש עיגול, והוא הדבר השימושי ביותר שקורא יכול לקחת מהעדכון הזה — עם הסתייגות אחת שהקטע שלהלן מוסיף, מפני שהמדידה הבלתי־תלויה השנייה בסיפור הזה מצביעה בכיוון ההפוך.

מה ששורד את התיקון הזה צר יותר אך עדיין אמיתי. GLM-5.3-Flash הוא מודל מולטימודלי במשקולות פתוחות עם חלון הקשר של 1M וקלט תמונות ווידאו נייטיבי, במחיר שקרוב לעשירית ממחיר המחירון של המודל האח הדגל — שילוב שאין לו מקבילה ישירה במעבדות החזית בארה״ב, שהמודלים המולטימודליים הדומים שלהן עולים משמעותית יותר ומשוחררים כסגורים. הניסוח של Zhipu עצמה, "אינטליגנציה בחזית, בעלות פלאש", הוא החלק שספג את המכה: בציון מדוד של 42 הוא מודל תקציבי חזק, לא מודל חזית בהנחה. מדידה בלתי תלויה גם ממקמת אותו בנוחות מעל החציון של מודלים במשקולות פתוחות בגודל דומה, וזהו הישג אמיתי עבור מודל עם 18B פעילים ועם עשירית מעלות ההסקה — זה פשוט הישג שונה ממה שסיקור ההשקה רמז.

המספר הבלתי־תלוי האחר — והוא הלך לכיוונו של המודל

אם תוצאת Artificial Analysis הורידה את GLM-5.3-Flash בדרגה, הרי שהתוצאה הזו הולכת בכיוון ההפוך, וזו העובדה המוזרה ביותר בסיפור. ExploitBench, שנבנה בקרנגי מלון, אינו שואל אם מודל מסוגל להפיל מטרה. הוא מדרג את הטיפוס: להגיע לקוד הפגיע, להפעיל את הבאג, לבנות פרימיטיבים לשימוש חוזר, ולבסוף השתלטות מלאה על זרימת הבקרה עם הרצת קוד שרירותית, בדירוג מכני מול V8 בייצור כשהארגז החול האבטחתי מופעל. Generality Labs הריצה את GLM-5.3-Flash על פני 41 באגים עם תקציב של מיליארד טוקנים לכל באג במקום תקרת 300 התורות הרגילה של הבנצ'מרק, בטיעון שתורות הם מדד גרוע למה שקונה מוציא בפועל, ושדולרים הם האילוץ הכנה. GLM-5.3-Flash הגיע להרצת קוד שרירותית מלאה ב-13 מתוך 41, ולציון יכולת ממוצע של 64.8% מהמקסימום של הסולם. שלוש ההרצות המפורסמות של Claude Mythos Preview קיבלו 9, 10 ו-11 על אותו סולם — ממוצע של 10, או 62.2%. הניסוח של Generality עצמה, שמודפס מתחת לתרשים, הוא ש-GLM-5.3-Flash "עשוי להיות ברמת Mythos בסייבר" במדידה הזו. ההרצה של Anthropic עצמה ב-ExploitBench, שפורסמה ב-29 בספטמבר, מדווחת על אותו סדר בשיעורים מוחלטים נמוכים בהרבה — אם כי על GLM-5.3 הדגם המוביל, ולא על ה-Flash: היא סופרת ניצולי חולשות מקצה לקצה לכל ניסיון ולא התקדמות בסולם, ומעמידה את GLM-5.3 על 50 מתוך 410 לעומת 56 מתוך 410 של Mythos Preview. כלל ספירה שונה, סדר דומה — וזו בדיוק הסיבה לכך שאסור לצטט נתון של ExploitBench בלי לצרף את הכלל.

הסיבה שמשנה היא המכנה שמתחת לכך. הריצה תימחרה את טוקני הפלט של GLM-5.3-Flash ב-0.25 דולר למיליון — מחיר ההשקה שלו בהנחה של 50%, שכבר פג תוקפו — לעומת 125 דולר למיליון ההיסטוריים של Claude Mythos Preview, פער של פי 500. בשוויון עלויות, הריצה הוציאה 16.81 דולר לפגיעוּת לעומת 297.17 דולר של Mythos, ומכאן מגיע הנתון של כ-6%. קראו את הטענה בקפידה, כי הגרסה שמסתובבת היא השגויה. זה לא ש-GLM-5.3-Flash הוא מפתח אקספלויטים טוב יותר מ-Claude Mythos Preview. זה שדולר של טוקנים של GLM-5.3-Flash קונה בערך את מה שדולר של טוקנים של Mythos קונה במשימה הספציפית הזו, ושאפשר להרשות לעצמך הרבה יותר דולרים של הראשון.

ההסתייגויות של Generality עצמה שוות יותר מהכותרת. הם אומרים בפשטות שהרצה אחת אינה מבססת שוויון ברחבי הסייבר בכללותו, שזיהום הוא שאלה פתוחה — ייתכן שאומן כנגד ExploitBench בדרך כלשהי — ושארבע מתוך 41 הדגימות החזירו שגיאה וקיבלו ניקוד על ידי נשיאת התוצאה האחרונה שנצפתה קדימה, מה שאם כבר ממעיט במודל. הם גם פרסמו פרסום המשך ב-28 בספטמבר שמסבך את כל ההשוואה. כשהריצו את GLM-5.3-Flash דרך שבע רתמות סוכנים שונות בתקציב של 250 מיליון טוקנים, על עשר דגימות שנבחרו לכסות את טווח הקושי, אותם משקלים קיבלו 10.6 תחת רתמת Codex — מעל נקודת הייחוס 10.02 של Claude Mythos Preview — ו-6.2 תחת רתמת Claude Code, אפילו מתחת לתצורה המקורית של המבדק, המוגבלת בתורות, שעומדת על 6.4. הרתמה הזיזה את הניקוד יותר מאשר השוואת המודלים, והמחברים אומרים שתת-קבוצת עשר הדגימות כנראה אינה מייצגת. העובדה שהתרשים הופץ בהרחבה ב-2 באוקטובר עם הטענה שסקיילינג של מחשוב בזמן בדיקה מוחק את הפערים בין דרגות המודלים היא טענה על התעשייה, לא ממצא של ההערכה: מה שההערכה מצאה הוא שמודל פתוח וזול, כשהוא מקבל תקציב במקום הגבלת תורות, יכול להדביק את מומחה האקספלוטים של מעבדת חזית בסולם אחד.

זה כבר לא הסיפור של מעבדה אחת. הערכת ה-Frontier Red Team של אנתרופיק עצמה, שפורסמה ב-29 בספטמבר, הרצה את GLM-5.3-Flash — האח הקטן — בסשן שבו אדם נמצא בתוך הלולאה: כשנמסרו לו פרטים פומביים על חולשה ב-Chrome שתוקנה ועוד אחת אחרת, ללא הכוונה משמעותית, המודל שרשר אותם לניצול ARM64 אמין שעקף את הקשחת אימות המצביעים, בתוך 20 דקות של תשומת לב אנושית ושמונה שעות של עבודת מודל — 20.40 דולר בתעריפי ה-API של Zhipu. אותה הערכה היא המקור לנתון 50 מתוך 410 של ExploitBench שלמעלה, והחלק הזה שלה מדד את GLM-5.3, דגם הדגל עם 743B, ולא את ה-Flash — הבחנה שהסיקור של הדוח טשטש ברובו. שני גורמים בלתי תלויים, הרנסים שונים, תקציבים שונים, אותו כיוון. שניהם גם ריצות מעבדה בודדות ואף אחד מהם אינו תוצאה משוחזרת, ורק ריצת Generality מדווחת על סכום דולרי עבור ה-Flash ולא עבור דגם הדגל. הקריאה המעשית היא זו שאנתרופיק מציינת במפורש: המשקלים ניתנים להורדה, אבליטרציה של GLM-5.3-Flash ארכה בערך 600 שעות GPU, ומודל שעלות הפעלתו נמוכה מדולר לשעה הוא סוג אחר של בעיית זמינות ממודל שנמצא מאחורי תוכנית סינון.

נסה זאת, וכיצד שכבת הניתוב משתלבת.

הגישה פשוטה. ה-API של Zhipu עצמו מספק אותו בתעריף המחירון שלמעלה, המשקולות ברישיון MIT נמצאות ב-Hugging Face בכתובת zai-org/GLM-5.3-Flash ב-FP8 וב-BF16, ומוצרי הקידוד של Zhipu — ZCode ותוכנית GLM Coding — כוללים אותו. להתארחות עצמית, גם vLLM וגם SGLang תומכים בו. שתי הערות מעשיות אם תלכו בדרך הזו: ספר המתכונים של SGLang נושא אזהרת שינוי פתוחה שקלט חזותי עלול להיזרק בשקט בגרסאות transformers שלפני 5.13, מה שלא יעורר שגיאה ופשוט ייתן קריאה טקסטואלית בלבד של בקשת תמונה; ומסלול AMD עדיין אינו מתכון. בקשת המשיכה המקורית לאפשור gfx950 ביום ההשקה (sgl-project/sglang #37653) נסגרה ללא מיזוג ב-6 בספטמבר והוחלפה בסט רחב יותר של בקשות משיכה ל-gfx950 מהיום הראשון — mHC דרך AITER, אינדקסר k-pool DSA, הגשת FP8 ו-MXFP4 — שרבים מהן עדיין היו פתוחות ב-17 בספטמבר. אפשור על חומרה בדרגת MI350X נמצא בעיצומו, טרם שוחרר, ועדיין אין נתון תפוקה עצמאי ל-AMD.

בצד הניתוב המצב השתנה מאז ההשקה: GLM-5.3-Flash נמצא כעת ברשימה של OrcaRouter, לצד שאר סדרת GLM. אנחנו מעבירים הלאה את מחיר המחירון של הספק עם תוספת של 0% וללא תוספת של הראוטר, וזה בדיוק המנגנון שחשוב למודל שמחירו זה עתה זז — ההנחה שפגה בצד של Zhipu היא המחיר שאתם משלמים כאן, באותו יום, בלי צורך לנהל משא ומתן מחדש על חוזה שני ובלי שינוי בקוד. ההעברה הלאה הזו פועלת לשני הכיוונים, וכדאי לומר זאת במפורש: מבצע שפג תוקפו הוא העלאת מחיר אמיתית בחשבונית שלכם, והיא קורית כאן באותו רגע שבו היא קורית במעלה הזרם. אם אתם שוקלים את Flash מול GLM-5.3 או מודל תקציבי אחר, שניהם יושבים מאחורי מפתח אחד עם מעבר אוטומטי בין ספקים, וזו הדרך הזולה לנסות מודל שהציונים הבלתי־תלויים שלו עדיין מתגבשים בלי להמר עליו כמסלול ייצור. זו גם הצורה הנכונה לתוצאה שלמעלה, ומסיבה ישירה יותר מאשר נוחות: אותם משקלים קיבלו 10.6 או 6.2 באותו מבחן בהתאם לשאלה איזו רתמת סוכנים הפעילה אותם, כך שמה שקונה בפועל בודק הוא שילוב של שלד ומודל, והחלפת המודל מאחורי שלד קבוע תחת מפתח אחד זולה יותר מלהתחייב לאחד מהם.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

מה לצפות בהמשך

ארבעה דברים יכריעו את המשך הסיפור הזה. ראשית, האם ה-42 זז: המודל נמצא בשימוש ציבורי נרחב מאז אוגוסט, כך שאם ההערכה הפנימית של Zhipu וההרנס של AA חלוקים מסיבה מבנית — ספירת אסימוני חשיבה, אריכות, הערכה שהספק העניק לה משקל רב — זה אמור להופיע כשהמדד מתעדכן ולא כפער חד-פעמי. שנית, האם תוצאת הניצול משוחזרת. Generality Labs הריצה 41 באגים פעם אחת, על ההרנס שלה, ואומרת זאת; המשך הבדיקה עם ההרנס מראה שאותם משקלים נעים ארבע נקודות רק בגלל בחירת ההרנס, לכן המספר שיכריע הוא צוות שני שמריץ מחדש את 41 הבאגים עם תקציב קבוע בדולרים וההרנס קבוע. שלישית, האם הגרסה בדבר הסיליקון המקומי זוכה למקור שני. Zhipu היא הגורם היחיד שמסוגל לציין את גודל האשכול, את לוח הזמנים של שבועיים ואת ה-3.2x, והטענה היחידה הניתנת לאימות בלתי תלוי בה — תיקון הקרנל שמוזג — היא טענה קטנה. רביעית, המחיר: ההנחה נעלמה, והשאלה המעניינת היא אם היא תחזור כמבצע כאשר Zhipu זקוקה לנפח, או אם מחיר המחירון הוא כעת רצפת המחיר.

החוט המקשר הוא ש-GLM-5.3-Flash מתבקש להוכיח שני דברים שונים בעת ובעונה אחת — שמודל זול יכול להיות טוב מספיק, ושמאיצים סיניים יכולים לשרת אותו בקנה מידה — והחשיפה ב-17 בספטמבר היא תשובתה של Zhipu לשאלה השנייה, שנמסרה על ידי מודל שעזר לכתוב אותה. לשאלה הראשונה מצורפים כעת שני מספרים בלתי תלויים והם מצביעים בכיוונים מנוגדים: 42 במדד האינטליגנציה, הרבה מתחת לנתון המוביל של הספק, וריצת ניצול שמגיעה לרמה של מומחה של מעבדת חזית בעלות של 1/20 מהעלות. שניהם יכולים להיות נכונים בו-זמנית, והפער ביניהם — לא אף אחד מהמספרים — הוא המקום שבו ההחלטות באמת מתקבלות.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית