כרטיס ראשי למאמר הנושא את הכותרת 'GLM 5.5 או GLM 5.3-Vision?' עם כותרת המשנה 'מודל אנונימי שתואם את טביעת האצבע של Z.ai צץ זה עתה' ותגית 'הדלפה — לא מאומת', על רקע מעבר צבע עדין בלבן וכחול עם מוטיב רשת נוירונים עדין ואלמנט של סימן שאלה.
Guides & Insights

GLM 5.5 או GLM 5.3-Vision? מודל אנונימי התואם את טביעת האצבע של Z.ai צץ זה עתה

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

מודל לא מזוהה שפרופיל ההגשה שלו — מהירות, זמן עד לטוקן ראשון, שיעור פגיעות מטמון — תואם את מחסנית ה-G​LM של Z.ai, החל למשוך תשומת לב מאנליסטי קיבולת, והניחוש המקובל הוא שייתכן שייקרא GLM 5.3-Vision או GLM 5.5. ב-20 באוגוסט, אנליסט המחשוב והקיבולת teortaxesTex פרסם שמודל אנונימי שהוא עוקב אחריו "בבירור לא Dee​pSeek, לפחות", ש"אין שום דבר שפוסל את G​LM עד כה", וש"המהירות, ה-ttft ושיעור פגיעות המטמון תואמים גם את G​LM". הקריאה שלו: לצפות שייקרא GLM 5.3-Vision או 5.5, עם ציון משוער של 61 במדד האינטליגנציה של Artificial Analysis — נקודה אחת מעל המקום שבו GLM-5.3 המשווק יושב היום. שום דבר כאן לא אושר. אין כרטיס מודל, אין הכרזה של Z.ai, ואין API, והדף הזה מתייחס לתצפית כפי שהיא: אות הדלפה מוקדם ולא משוכפל, שכדאי לעקוב אחריו דווקא משום ש-GLM-5.5 היה הדגל הצפוי של Z.ai כל החודש ולא הופיע. חמישה ימים אחרי הפוסט הזה, הגיעה נקודת נתונים שנייה, והפעם ניתנת לבדיקה מלאה: ב-25 באוגוסט, vLLM — זמן הריצה של ההסקה שמאחורי רוב שרתי ההגשה בקנה מידה גדול — פתח בקשת משיכה מסוג Do-Not-Merge שמאפשרת תמיכת ליבת masked-MHA עבור ממדי הראש של G​LM-5. היא אינה מזכירה אף וריאנט ואינה מוכיחה השקה; היא הכנת תשתית לשכבת ההגשה, הסוג של פעילות רקע שמודל חדש מותיר אחריו.

מה שהאות אומרת בפועל

המקור הוא פוסט X יחיד מ-teortaxesTex, מיום 20 באוגוסט — אותו חשבון שאות התזמון שלו על "בערך שבוע" לגבי השקת GLM-5.3 התקיים ביום עצמו באוגוסט. המסגור ברור לגבי רמת הראיות: "עדויות חזקות (לא שוכפלו)." האנליסט פוסל את Dee​pSeek, לא מוצא שום דבר שסותר את G​LM, ומצטט שלוש מדידות ברמת שרת — תפוקה, זמן עד לטוקן ראשון, ושיעור פגיעות מטמון — כתואמות למחסנית של Z.ai. אחר כך שני שמות המועמדים, וניקוד משוער: "כרגע אני מצפה שזה ייקרא GLM 5.3-Vision או 5.5, ויקבל בערך 61 ב-AA."

קח כל חלק בנפרד. טענות הזהות (לא Dee​pSeek, תואם G​LM) הן הסקת טביעת אצבע מאופן הגשת המודל, לא כרטיס מודל. הציון הוא ציפייה, לא מדידה. השמות הם ניחושים. מה שהופך את האות לראוי יותר מרעש הוא שהוא עקבי בכיוון עם כל מה שאנו יודעים על מפת הדרכים של Z.ai החודש: GLM-5.3 שוחרר בטקסט בלבד, הבקשה הרועשת ביותר של הקהילה הייתה ראייה, ו-GLM-5.5 דווח על ידי כלי תקשורת מרובים (באמצעות JPMorgan, Reuters, CGTN, ופתק של Goldman מ-18 באוגוסט) כמי שיגיע "במהלך אוגוסט" — הגמר של החודש הוא עכשיו.

מדוע חשובה טביעת האצבע של ההגשה

זמן עד לטוקן הראשון ושיעור פגיעות המטמון הם חתימות ברמת התשתית. הם נקבעים על ידי אופן בניית ערמת ההסקה של הספק — המתזמן, מבנה המטמון, מדיניות האצווה — ולא לפי שם המודל שהפרומפט מזמן. כשאנליסט אומר שה-TTFT ושיעור פגיעות המטמון של מודל אנונימי תואמים ל-G​LM, הוא אומר שערמת השרתות שמאחוריו מתנהגת כמו זו של Z.ai, וזה הדבר הקרוב ביותר לטביעת אצבע שאפשר להשיג בלי משקלים או כרטיס מודל. זו אינה הוכחה. ספק אחר יכול לשכפל את אותה ערמה, או ש-Z.ai עשויה לשרת מודל עבור שותף. אבל זו טענה ספציפית וניתנת לבדיקה, וההסתייגות 'לא שוכפל' אומרת לך שהאנליסט אינו מציג אותה כעובדה מוגמרת.

ההחרגה של Dee​pSeek חשובה גם כן. DeepSeek V4 Pro הגיע לזמינות כללית ב-13 באוגוסט, וגרסת ה-Flash שלו הייתה השחרור הסיני המהיר האחר עם משקלים פתוחים החודש. מודל אנונימי שפוסל את Dee​pSeek אבל מצביע על G​LM מצמצם את השדה לצינור של Z.ai — ולצינור של Z.ai יש שני מועמדים סבירים, וזה בדיוק הפיצול שהאות מזהה.

אות שני: מחסנית ההגשה נבנית עבור תשומת הלב של GLM-5

ב-25 באוגוסט, הגיעה נקודת נתונים שנייה — הפעם ניתנת לבדיקה מלאה. vLLM, מנוע הריצה (runtime) העומד מאחורי רוב מערכות הגשת המודלים בקנה מידה גדול, קיבל בקשות משיכה (pull request) #53785, בשם "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." לאחר אימות מול המאגר, הוא מאפשר נתיב prefill של masked-MHA עבור הגאומטריה של G​LM-5: 64 ראשים, דרגת KV של 512, ממד ראש QK של 192+64, וממד ראש V של 256 — פריסת QK/V של 256/256, לפי תיאור ה-PR. הדבר תלוי בשינוי ב-FlashAttention לשם תמיכה במיסוך ראש מממד 256, מצמיד זמנית את FlashAttention ל-commit של fork (וזהו ייעודו של סמן ה-Do Not Merge), ומוסיף ספי ניתוב מבוססי בנצ'מרק לנתיב החדש: מגבלות prefill טהור של FlashMLA של 8K / 20K / 48K / 112K טוקנים ב-TP 1/2/4/8, ומגבלה מעוגלת של 64K עבור FlashInfer ב-TP8. המחבר מציין שאף PR פתוח אחר לא כיסה תמיכה ב-masked-MHA עבור G​LM-5.

קראו את זה כמו שזה: עבודת תשתית לסטאק ה-serving, לא הכרזה. ה-PR לא מזכיר את GLM 5.5 או GLM 5.3-Vision — הוא אומר "GLM-5" — והפעלת נתיב prefill מסוג masked-MHA עבור ממדי הראש של G​LM-5 היא עבודת תשתית על משפחה שאקוסיסטם ה-vLLM כבר רץ על נתיב ה-sparse-MLA (השושלת של GLM-5.3 עצמו מוגשת שם היום). זה גם לא מבודד: PRs נלווים החודש כיסו בדיקות ממדי MLA של FlashInfer עבור GLM-5, fallback של Triton ל-sparse-MLA עבור מודלים מסוג GLM-5, ותמיכת הממדים המדווחת של FlashAttention. שני פרטים שומרים את זה על הרדאר של מעקב ההדלפות. ראשית, הגיאומטריה שה-PR מכוון אליה — 64 ראשים, KV rank 512, 256/256 QK/V — שונה מה-192/128 של Dee​pSeek, שהיא אותה הפרדה של "לא Dee​pSeek, תואם G​LM" שטביעת האצבע של המודל האנונימי מציירת, כעת נראית ברמת ה-attention kernel. שנית, התזמון: ה-PR נפתח ב-25 באוגוסט, בתוך אותו חלון של אוגוסט שבו GLM-5.5 היה צפוי כל החודש. אף אחד מאלה לא מוכיח שהמודל האנונימי הוא G​LM מהדור הבא — זה יכול באותה מידה להיות הנדסה על המודל שכבר שוחרר — אבל זה סוג הפעילות ברקע שאקוסיסטם ה-serving עושה לקראת השקת מודל, וזה ניתן לאימות בדרך שאף פוסט ב-X לא יכול.

שני שמות, פיצול אחד: GLM 5.3-Vision מול GLM 5.5

שתי הזהויות המועמדות הן מוצרים שונים באמת, וההדלפה אינה מכריעה איזו מהן נמצאת על הלוח.

GLM 5.3-Vision יהיה גרסה בעלת יכולות ראייה של המודל ששוחרר ב-14 באוגוסט. GLM-5.3 מקבל רק קלט טקסט — Artificial Analysis מפרטת אותו כטקסט פנימה, טקסט החוצה, ללא תמיכה בתמונות — והפער הזה הוא התלונה הכי רועשת של הקהילה. כשטאנג ג'יי מ-Z.ai ניהל קמפיין משוב גלובלי, התגובות חזרו בעצם פה אחד בעד ראייה, ול-Z.ai כבר יש את אבני הבניין (המודל הרב-מודאלי GLM-5V-Turbo ומקודד CogVLM) שעדיין לא מוזגו לקו הדגל. גרסת 5.3-Vision תהיה הדרך המהירה ביותר לסגור את הפער הזה.

• GLM 5.5 הוא הדגל עצמו. המפרטים המדווחים אך לא מאושרים מצביעים על בסיס של מעל טריליון פרמטרים (לעומת 743B של GLM-5.3), קונטקסט של 1M טוקנים שהועבר מהדגם הקודם, משקלים פתוחים, ומיקוד מוגבר ביכולות סוכן ובקידוד. כל הערת אנליסט החודש מתייחסת ל-5.5 כאל הגדול — הכלי שטנג ג'י, מייסד-שותף של Z.ai, רמז שיסגור את הפער מול המודלים הסגורים בדרגת Fable. הוא צפוי במהלך אוגוסט ועדיין לא שוחרר נכון לכתיבת שורות אלה.

אותה טביעת אצבע לא יכולה לומר לך איזה מהשניים זה — גרסת 5.3 מכוונת-ראייה ומכשיר דגל חדש יכולים שניהם לרכוב על אותה תשתית הגשה. העמימות הזו היא המצב הכנה של האות, ושני השמות בפוסט של האנליסט משקפים אותה במקום לפתור אותה.

<img src="2.png" alt="לוח תוצאות השוואה דו-טורי בכותרת 'GLM 5.5 vs GLM-5.3 — לוח התוצאות'. עמודה שמאלית GLM 5.5 (הודלף): 'AA Index ~61 (מוערך, לא מאומת)', 'סטטוס: לא שוחרר', 'גודל: >1T פרמטרים (לפי שמועה)', 'ראייה: צפויה', 'הקשר: 1M (צפוי)', 'מחיר: טרם נקבע'. עמודה ימנית GLM-5.3 (שוחרר): 'AA Index 60', 'סטטוס: API פעיל ב-19 באוגוסט', 'גודל: 743B MoE / 40B פעילים', 'ראייה: טקסט בלבד', 'הקשר: 1M', 'מחיר: $1.40 / $4.40'. בכותרת התחתונה: 'הנתונים של GLM 5.5 הם תחזיות לא מאומתות; GLM-5.3 לפי Artificial Analysis.'" />

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

מה המשמעות של ציון ~61 במדד האינטליגנציה של AA

הציון החזוי הוא החלק החד ביותר של ההדלפה. מדד ה-Artificial Analysis Intelligence Index (גרסה 4.1.1) מעמיד כעת את GLM-5.3 על 60 — בשוויון עם Kimi K3 בציון הגבוה ביותר למשקלים פתוחים, ו-7 נקודות מעל ה-53 של GLM-5.2. נקודה אחת מעל זה, ב-61, נמצא הטריטוריה של GPT-5.6 Sol, עם Claude Fable 5 ב-62 ו-Claude Opus 5 ב-63. במילים פשוטות: מודל ממשפחת G​LM שמשיג 61 יהיה הציון הבודד הגבוה ביותר למשקלים פתוחים במדד, לבדו מעל Kimi K3 ו-GLM-5.3, ולמעשה בקו הגבול של החזית הסגורה.

{{1}}כדאי להדגיש מה 61 אינו.{{/1}} {{2}}זוהי הציפייה של teortaxesTex למה שהערכה עצמאית תחזיר, לא ציון Artificial Analysis שפורסם ולא מספר ספק.{{/2}} {{3}}תחזית יכולה לטעות לשני הכיוונים — וריאנט ראייה עלול לוותר על נקודה או שתיים במדד העתיר-טקסט, ודגם דגל >1T עלול לנחות גבוה או נמוך יותר, בהתאם לאופן שבו הפוסט-אימון שלו משפיע.{{/3}} {{4}}ערכו של המספר הוא הטענה שהוא מגלם: מי שלא יהיה המודל האנונימי הזה, הוא צפוי לגבור על מוביל המשקלים הפתוחים הנוכחי, לא רק להשתוות אליו.{{/4}}

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

מה מאומת, ומה לא

שמור על הפנקס נקי, כי פיסת הדליפה חיה או מתה על זה.

• מאושר: GLM-5.3 אמיתי, שוחרר ב-14 באוגוסט, ה-API פעיל ב-18/19 באוגוסט, קיבל ציון 60 במדד האינטליגנציה של AA (נמדד באופן עצמאי על ידי Artificial Analysis), מחירו $1.40 / $4.40 למיליון טוקנים, קלט טקסט בלבד, עם משקלים פתוחים שאושרו ליום שישי, 28 באוגוסט. עובדות אלו אינן תלויות בהדלפה.

• מאושר: GLM-5.5 עדיין לא שוחרר. נכון לכתיבת שורות אלה אין כרטיס מודל, אין תמחור ואין זמינות; חלון אוגוסט ונתון הפרמטרים של >1T הם דיווחי אנליסטים, לא התחייבויות של Z.ai.

• לא מאושר: שהמודל האנונימי קיים כמוצר נפרד, שהוא G​LM, ששמו יהיה GLM 5.3-Vision או 5.5, ושהוא משיג ציון 61. כל ארבע הטענות מבוססות על פוסט אחד של אנליסט שלא שוכפל.

• גם לא אושר: האם המודל האנונימי הזה אכן שונה מ-GLM-5.3 עצמו. נקודת קצה חיה של GLM-5.3 תחת כינוי לא מסומן תייצר את אותה טביעת אצבע של שרת. עד ששם, כרטיס מודל או שחרור משקולות יפתרו את העניין, הקריאה כ"מודל חדש" היא ההנחה החזקה אך לא עובדה.

מה לצפות בהמשך

• יום שישי, 28 באוגוסט — משקלי GLM-5.3. אם המודל האנונימי הוא למעשה 5.3 ששונה שמו או 5.3-Vision, שחרור המשקלים וכרטיס המודל יוכיחו זאת במהירות.

• תצפית מאשרת שנייה. טביעת האצבע של אנליסט אחד היא השערה; קריאה שנייה ובלתי תלויה באותו רישום אנונימי, או רישום ב-Artificial Analysis שמציין את שמו, מעלה אותה לדרגת ראיה.

• כל הצהרה של Z.ai. דווח ש-GLM-5.5 מיועד לחלון של אוגוסט, והחודש כמעט נגמר. מתן שם רשמי, דף תמחור או רישום שינוי ב-API הוא האירוע שהופך את ההדלפה הזו לסיפור השקה.

• האם ציון ה-AA יתממש ב-61. אם המודל האנונימי אמיתי ומשפחת G​LM, ציון מדד עצמאי קרוב ל-61 יהיה המספר הראשון עם משקלים פתוחים שעובר את 60.

• האם עבודת הקשב (attention) של vLLM מקבלת שם דגם מצורף. PR #53785 מכוון לממדים של ראש (head) של "GLM-5" בלי לנקוב בשם 5.3-Vision או 5.5; מיזוג (merge), רשומת דגמים נתמכים, או כרטיס דגם שמצמיד את הגיאומטריה הזו לשם מסוים יהוו את האות החזק ביותר עד כה.

איך לפעול בנוגע לדליפה כזו

דליפה היא סיבה להתכונן, לא להעביר פלטפורמה. אם הדגם הבא ממשפחת G​LM ינחת בראש או בסמוך לראש טבלת המודלים הפתוחים (open-weights), השאלה המעשית היא האם לנתב אליו תנועה אמיתית — ודגם לא מוכח עם טענות ספק והערכה של אנליסט אחד הוא בדיוק המקרה בו רוצים רשת ביטחון מאשר הימור. ה-GLM-5.3 שנשלח בשבוע שעבר כבר חי על OrcaRouter — עמוד הדגם מציג אותו ב-$1.26 / $3.96 למיליון טוקנים, הנחת השקה של 10% ממחיר הספק הרשמי $1.40 / $4.40, עם מעבר ללא כל תוספת — ותצורת הניתוב היא מה שדגם 5.5 או 5.3-Vision יירש ביום השקתו. נתב חלק מהתנועה לדגם החדש דרך הראוטר, עם מעבר אוטומטי לדגם מוכח — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — ותקבל אות איכות על עומס העבודה שלך במקום מצגת. אם התחזית מהדליפה נכונה, גילית ראשון; אם היא שגויה, המעבר האוטומטי סופג אותה ושום דבר לא נשלח שבור. אותו מפתח, ללא חוזה שני, וללא צורך לבחור בין שני המועמדים עד ש-Z.ai תעשה זאת.

ה-G​LM הבא מגיע — השאלה הפתוחה היחידה היא איזה שם הוא יישא. GLM 5.3-Vision תהיה Z.ai שסוגרת את הפער שהכי מתלוננים עליו בדגם שזה עתה שיחררה; GLM 5.5 תהיה ספינת הדגל בעלת טריליון הפרמטרים שהחודש כולו הצביע אליה. הערך האנונימי teortaxesTex, שטביעת האצבע שלו נלכדה ב-20 באוגוסט, הוא הדבר הקונקרטי הראשון שנראה כמו אחד מהשניים, והציון החזוי שלו 61 במדד AA Intelligence Index היה מציב אותו לפני כל דגם בעל משקלים פתוחים שנמצא כרגע בטבלה. חמישה ימים אחרי טביעת האצבע, גם סטאק ההגשה השתנה: עבודת הקשב G​LM-5 של vLLM היא בדיוק סוג התשתית שדגם חדש משאיר מאחוריו, אף שהיא אינה מציינת גרסה. שום דבר מזה לא אושר, והעמוד הזה יתעדכן ברגע שהשם, הכרטיס או המשקלים יפתרו את העניין. עד אז, המהלך בסיכון נמוך הוא להכין את הניתוב — לא להמר על הסטאק על סמך טביעת אצבע.

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית