כרטיס כותרת שנוצר המציג 'GLM-5.3-Flash Revealed' עם כתובית 'המודל החזיתי הפתוח והרב-מודאלי של Zhipu היה ה-Ox Alpha האנונימי — כעת בעשירית ממחירו של GLM-5.3', עם אייקונים בקו שטוח של שבב ברק, תג MIT, ואייקון תמונה-וידאו.
Guides & Insights

GLM-5.3-Flash נחשף: ה-"Ox Alpha" האנונימי היה המודל החזיתי הרב-מודאלי הפתוח של Zhipu לאורך כל הדרך

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המודל ששהה שבוע בראש טבלאות השימוש בפלטפורמות קוד של צד שלישי קיבל סוף סוף שם ומחיר. ב-26 באוגוסט 2026, Zhipu AI אישרה שהמודל החינמי 'Ox Alpha' שמפתחים עשו בו שימוש אינטנסיבי מאז 20 באוגוסט הוא GLM-5.3-Flash – מודל mixture-of-experts עם 320 מיליארד פרמטרים בסך הכול ו-18 מיליארד פעילים (320B-A18B), הגרסה המולטי-מודאלית הראשונה בסדרת GLM-5, ואחד מהמודלים הזולים ביותר ברמת frontier בכל טבלת תמחור בזמן ההשקה. Zhipu מתמחרת את GLM-5.3-Flash בעשירית מתעריף ה-API של דגל הדגם שלה GLM-5.3, או באחד חלקי עשרים ממנו במסגרת הנחה לזמן מוגבל, והמשקולות הפתוחות – ברישיון MIT – הועלו ל-Hugging Face באותו היום. בניגוד ל-GLM-5.3, שמשקולותיו טרם פורסמו וצפויות בסוף החודש, את המודל הזה אפשר לארח בעצמך השבוע, לא בשבוע הבא.

הנה הגרסה הקצרה: Zhipu פרסמה בקוד פתוח את מודל השפה הגדול הזול ביותר שלה עד כה, הוא מביס את GLM-5.2 שלה עצמה בכל מדדי הביצועים למרות שמפעיל רק חלק קטן מהפרמטרים הפעילים, והספקית מציבה את הציון שלו במדד Artificial Analysis Intelligence Index על 57 — תואם ל-Claude Opus 4.8, לפי חומרי ההשקה של Zhipu. כל נתון ביצועים המצורף להשקה זו הוא דיווח עצמי של הספקית ולא שוכפל על ידי גורם חיצוני נכון למועד כתיבת שורות אלה; המחירים ומספרי הפרמטרים הם עובדות עדכניות.

מה שנשלח בפועל

GLM-5.3-Flash הוא MoE עם סך של 320B פרמטרים (מתוכם 18B פעילים) וב-45 שכבות, כך שטביעת הרגל הפעילה שלו גדולה בקצת יותר מחצי מזו של GLM-5.2, שיש לה כ-32B פרמטרים פעילים. היכולת המרכזית היא מודאליות: הוא מקבל באופן טבעי קלט טקסט, תמונה ווידאו — דגם GLM-5 הראשון שעושה זאת — במקום להעביר ראייה דרך מתאם נפרד. ההקשר מגיע למיליון טוקנים, וצ'יפה (Zhipu) טוענת שעלות ההגשה להקשר ארוך היא כשליש מזו של GLM-5.3.

בצד הארכיטקטורה, Zhipu מתארת אותו כמודל החזית הראשון בקוד פתוח שמשתמש בעיצוב היברידי של קשב דליל בשילוב קשב לינארי, יחד עם Manifold-Constrained Hyper-Connections (mHC) לצורך סקיילינג, ומנגנון IndexPool שדוחס ארבעה וקטורי מפתח של אינדקסר למאגר משוקלל אחד כדי לקצר את זמן האחזור בהקשר ארוך. האימון המקדים רץ על קורפוס מולטימודלי של 30 טריליון טוקנים. שום דבר מזה לא עבר ביקורת עצמאית עדיין — זה התיאור של Zhipu למודל שלה עצמה — אבל הטענות לגבי יעילות השרת ספציפיות מספיק כדי לבדוק אותן ברגע שהמשקולות יהיו מול ערימת ההסקה בקוד פתוח.

מפרט ההשקה, במבט חטוף:

• פרמטרים — 320B סה״כ / 18B פעילים, 45 שכבות, MoE.

• מודאליות — קלט טקסט, תמונה ווידאו מקורי; פלט טקסט.

חלון הקשר — עד 1,000,000 טוקנים.

• רישיון — MIT, משקולות פתוחות יהיו זמינות ב-Hugging Face עם ההשקה.

• מחיר — 0.15$ / 0.50$ למיליון טוקנים (קלט / פלט), 0.03$ למיליון קלט במטמון; מבצע של 50% הנחה עד 9 בספטמבר 2026 מוריד את המחיר ל-0.075$ / 0.25$ / 0.015$. במחיר מלא, מדובר בערך בעשירית מה-1.40$ / 4.40$ של GLM-5.3.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

שבוע ה-Ox Alpha

החשיפה סוגרת שבוע של ספקולציות. ב-20 באוגוסט, מודל אנונימי הופיע בפלטפורמת API של בינה מלאכותית מצד שלישי, עם חלון הקשר של מיליון טוקנים, קלט של טקסט/תמונה/וידאו, ומחיר אפס, והוא הפך במהירות למודל המבוקש ביותר במצעדים השבועיים של הפלטפורמה. הקהילה זיהתה אותו באמצעות טביעת אצבע כמשתייך למשפחת GLM של Zhipu תוך 48 שעות — אותה תבנית של אנונימיות ולאחר מכן תביעה, שזיהתה בעבר מודלים ממעבדות סיניות אחרות — ואנליסטים שיערו ברבים כי מדובר ב-GLM-5.3 בגרסת Flash. ההכרזה ב-26 באוגוסט אישרה את ההשערה והוסיפה את הפרט שהשבוע החינמי היה מבחן מכוון: Zhipu אומרת שהריצה האנונימית קבעה שיאי נפח קריאות בפלטפורמות הקוד שבהן הוצע, וכל התעבורה סופקה משבבים סיניים מקומיים.

ההקשר של שבוע החינם משמעותי לגבי ציפיות התמחור. מודל שניתן בחינם במחיר $0 למשך שבוע, ואז הושק בתעריף של עשירית מזה של דגם הדגל, עם הנחה לזמן מוגבל למחיר של אחד-מעשרים, הוא מהלך מכוון של עשיית שוק בשכבת התקציב — והחלק של "לזמן מוגבל" הוא זה שחשוב לעקוב אחריו. ההנחה היא החלטת תמחור שאפשר לחזור ממנה; המשקלים הפתוחים של MIT — אי אפשר.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

כמה זה עולה, בדולרים בפועל

מחירון Zhipu פורסם בדולרים אמיתיים, לא רק ביחסים: $0.15 למיליון אסימוני קלט, $0.50 למיליון אסימוני פלט, ו-$0.03 למיליון אסימוני קלט במטמון. בהשוואה למחיר שפורסם ל-GLM-5.3 שעומד על $1.40 / $4.40, זה מגיע לכעשירית מהמחיר הרשמי, ומבצע השקה בהנחה של 50% שנמשך עד 9 בספטמבר 2026 מוריד את המחיר ל-$0.075 / $0.25 / $0.015 — בערך עשריםית. Zhipu מציינת גם שהעלות של המודל לכל משימה במדד AA Intelligence Index עומדת על כ-$0.045, לפי דיווח ספק, וזה המספר שמאחורי הניסוח "1/40 מ-Opus 4.8". עבור מודל שמשיג תוצאות באותו טווח כמו מודלים שמתומחרים פי 10–40 יותר, הכלכלה שבכותרת היא אמיתית; האותיות הקטנות הן שהנחת ההשקה זמנית, והעלות לכל משימה תלויה במידת הפולשנות (verbosity) של המודל בפועל בייצור.

סיפור היעילות הוא המקום שבו ז'יפו טוענת שמגיע יתרון העלות. מול GLM-5.3, הספקית מדווחת על ירידה של פי 3.0 במחשוב הקשב ופי 4.4 במטמון KV, וטוענת למחשוב הקשב הנמוך ביותר מבין הדגמים בהשוואה בתקציב — GLM-5.3, DeepSeek V4 Flash ו-Kimi K3 — תוך שהיא מודה שמטמון ה-KV שלה עדיין גדול מעט משל DeepSeek V4 Flash ושל Kimi K3. בצד השרת, ז'יפו מדווחת על שיפור של פי 3 בביצועי השרת מקצה לקצה לעומת קו הבסיס על שבבים סיניים מקומיים, ומגיעה לעלות לכל טוקן שהיא מכנה דומה לזו של GPUs מיינסטרים של NVIDIA. כל אלה הם דיווחי ספק ועדיין לא שוכפלו באופן עצמאי; אלה המספרים הנכונים לבדוק מול המשקולות הפתוחות.

למה החשיפה חשובה

הסר את מדדי הביצועים מהמשוואה, וההשקה עדיין משנה את נוף המודלים הפתוחים בשתי דרכים. ראשית, מדובר במודל מולטי-מודאלי עם משקלים פתוחים בקטגוריית החזית במחיר תקציבי — לשילוב של רישיון MIT, חלון הקשר של מיליון טוקנים, קלט תמונה/וידאו מקורי, ועלות של סנטים בודדים לכל משימה אין מקבילה ישירה במעבדות החזית האמריקאיות, שמודליהן המולטי-מודאליים המקבילים עולים בסדר גודל יותר ומושקים כסגורים. שנית, הוא חותך תחת מודל הדגל של Zhipu עצמה: GLM-5.3 הוא מודל ה-743 מיליארד פרמטרים שזכה החודש לציון 60 שנמדד באופן בלתי תלוי במדד AA Intelligence Index, ו-GLM-5.3-Flash ממוצב כ"אינטליגנציית חזית, במחיר בזק" מול אותה משפחה. הסיפור של Zhipu הוא שמודל קטן וזול יותר יכול להשיג את רוב היכולת של מודל הדגל — ואם הטענות של הספק בתחומי הקידוד והסוכנים יעמדו במבחן, זהו אותו טיעון של כלכלת פוסט-אימון שהתעשייה חגה סביבו כל השנה.

הסתייגות אחת שומרת על זה בפרופורציה. ציון ה-AA Index של GLM-5.3-Flash, 57, מגיע מחומרי ההשקה של Zhipu עצמה, ולא מלוח התוצאות של Artificial Analysis, והשוואת הקוד מול Claude Opus 4.8 היא הערכה פנימית של Zhipu במסגרת Z.ai Code Bench. יש להתייחס ל-57 ולשוויון בקוד כאל טענות עד שתגיע מדידה עצמאית — המודל נבדק בהרחבה בעילום שם, כך שמספרים של צד שלישי אמורים להגיע במהרה.

נסה זאת, וכיצד שכבת הניתוב משתלבת.

הגישה מיום הראשון היא דרך ה-API של Zhipu עצמו, {{1}}המשקלים הפתוחים ב-Hugging Face (zai-org/GLM-5.3-Flash, MIT){{/1}}, {{2}}ומוצרי הקידוד של Zhipu — ZCode ו-GLM Coding Plan{{/2}}, {{3}}הכולל קבוצת כרטיסי ניסיון יומיים{{/3}}. {{4}}לאחסון עצמי, רישיון ה-MIT יחד עם התמיכה ב-vLLM וב-SGLang משמעות הדבר היא שטענות יעילות השירות שלעיל ניתנות לבדיקה ישירה{{/4}}.

בצד הניתוב, GLM-5.3-Flash עצמו עדיין לא נמצא ברשימת OrcaRouter נכון לעדכון זה. שאר משפחת GLM כן: GLM-5.3 עלה לאוויר בצד שלנו באותו יום שבו נפתחה ה-API של Zhipu, במחיר המחירון של Zhipu, עם 0% תוספת שמועברת הלאה. העברה זו היא בדיוק המנגנון שחשוב בהשקה כמו זו — שינוי מחיר של ספק, בין אם ההנחה נשארת או שתעריף המחירים משתנה מאוחר יותר, מופיע אצלנו באותו יום, ללא משא ומתן מחדש. אם אתה רוצה להריץ את Flash מול שאר קו GLM על מפתח אחד ברגע שהוא יגיע, זו ההגדרה; עד אז, המשקלים ב-Hugging Face הם הדרך המהירה ביותר לבדוק את זה בעצמך.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

מה לצפות בהמשך

שלושה דברים יקבעו את הסיפור האמיתי בשבועות הקרובים. ראשית, מדידה עצמאית של Artificial Analysis של ה-57 — הדגם כבר רץ בפועל בשם Ox Alpha, כך שלוח התוצאות אמור להתעדכן במהירות. שנית, האם המבצע של 50% הנחה — שמוגדר כרגע להסתיים ב-9 בספטמבר 2026 — יוארך מעבר לתאריך זה, משום שזה קובע את העלות הקבועה של ה-Flash. שלישית, משקלי GLM-5.3, שעדיין מובטחים לסביבות 28 באוגוסט — באותו שבוע שבו משקלי MIT של ה-Flash שוחררו, מה שייתן לקהילת המשקלים הפתוחים שתי רמות של אותה משפחה להשוואה בבת אחת.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube