
GLM-5.3-Flash נחשף: ה-"Ox Alpha" האנונימי היה המודל החזיתי הרב-מודאלי הפתוח של Zhipu לאורך כל הדרך
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
המודל ששהה שבוע בראש טבלאות השימוש בפלטפורמות קוד של צד שלישי קיבל סוף סוף שם ומחיר. ב-26 באוגוסט 2026, Zhipu AI אישרה שהמודל החינמי 'Ox Alpha' שמפתחים עשו בו שימוש אינטנסיבי מאז 20 באוגוסט הוא GLM-5.3-Flash – מודל mixture-of-experts עם 320 מיליארד פרמטרים בסך הכול ו-18 מיליארד פעילים (320B-A18B), הגרסה המולטי-מודאלית הראשונה בסדרת GLM-5, ואחד מהמודלים הזולים ביותר ברמת frontier בכל טבלת תמחור בזמן ההשקה. Zhipu מתמחרת את GLM-5.3-Flash בעשירית מתעריף ה-API של דגל הדגם שלה GLM-5.3, או באחד חלקי עשרים ממנו במסגרת הנחה לזמן מוגבל, והמשקולות הפתוחות – ברישיון MIT – הועלו ל-Hugging Face באותו היום. בניגוד ל-GLM-5.3, שמשקולותיו טרם פורסמו וצפויות בסוף החודש, את המודל הזה אפשר לארח בעצמך השבוע, לא בשבוע הבא.
הנה הגרסה הקצרה: Zhipu פרסמה בקוד פתוח את מודל השפה הגדול הזול ביותר שלה עד כה, הוא מביס את GLM-5.2 שלה עצמה בכל מדדי הביצועים למרות שמפעיל רק חלק קטן מהפרמטרים הפעילים, והספקית מציבה את הציון שלו במדד Artificial Analysis Intelligence Index על 57 — תואם ל-Claude Opus 4.8, לפי חומרי ההשקה של Zhipu. כל נתון ביצועים המצורף להשקה זו הוא דיווח עצמי של הספקית ולא שוכפל על ידי גורם חיצוני נכון למועד כתיבת שורות אלה; המחירים ומספרי הפרמטרים הם עובדות עדכניות.
מה שנשלח בפועל
GLM-5.3-Flash הוא MoE עם סך של 320B פרמטרים (מתוכם 18B פעילים) וב-45 שכבות, כך שטביעת הרגל הפעילה שלו גדולה בקצת יותר מחצי מזו של GLM-5.2, שיש לה כ-32B פרמטרים פעילים. היכולת המרכזית היא מודאליות: הוא מקבל באופן טבעי קלט טקסט, תמונה ווידאו — דגם GLM-5 הראשון שעושה זאת — במקום להעביר ראייה דרך מתאם נפרד. ההקשר מגיע למיליון טוקנים, וצ'יפה (Zhipu) טוענת שעלות ההגשה להקשר ארוך היא כשליש מזו של GLM-5.3.
בצד הארכיטקטורה, Zhipu מתארת אותו כמודל החזית הראשון בקוד פתוח שמשתמש בעיצוב היברידי של קשב דליל בשילוב קשב לינארי, יחד עם Manifold-Constrained Hyper-Connections (mHC) לצורך סקיילינג, ומנגנון IndexPool שדוחס ארבעה וקטורי מפתח של אינדקסר למאגר משוקלל אחד כדי לקצר את זמן האחזור בהקשר ארוך. האימון המקדים רץ על קורפוס מולטימודלי של 30 טריליון טוקנים. שום דבר מזה לא עבר ביקורת עצמאית עדיין — זה התיאור של Zhipu למודל שלה עצמה — אבל הטענות לגבי יעילות השרת ספציפיות מספיק כדי לבדוק אותן ברגע שהמשקולות יהיו מול ערימת ההסקה בקוד פתוח.
מפרט ההשקה, במבט חטוף:
• פרמטרים — 320B סה״כ / 18B פעילים, 45 שכבות, MoE.
• מודאליות — קלט טקסט, תמונה ווידאו מקורי; פלט טקסט.
חלון הקשר — עד 1,000,000 טוקנים.
• רישיון — MIT, משקולות פתוחות יהיו זמינות ב-Hugging Face עם ההשקה.
• מחיר — 0.15$ / 0.50$ למיליון טוקנים (קלט / פלט), 0.03$ למיליון קלט במטמון; מבצע של 50% הנחה עד 9 בספטמבר 2026 מוריד את המחיר ל-0.075$ / 0.25$ / 0.015$. במחיר מלא, מדובר בערך בעשירית מה-1.40$ / 4.40$ של GLM-5.3.

שבוע ה-Ox Alpha
החשיפה סוגרת שבוע של ספקולציות. ב-20 באוגוסט, מודל אנונימי הופיע בפלטפורמת API של בינה מלאכותית מצד שלישי, עם חלון הקשר של מיליון טוקנים, קלט של טקסט/תמונה/וידאו, ומחיר אפס, והוא הפך במהירות למודל המבוקש ביותר במצעדים השבועיים של הפלטפורמה. הקהילה זיהתה אותו באמצעות טביעת אצבע כמשתייך למשפחת GLM של Zhipu תוך 48 שעות — אותה תבנית של אנונימיות ולאחר מכן תביעה, שזיהתה בעבר מודלים ממעבדות סיניות אחרות — ואנליסטים שיערו ברבים כי מדובר ב-GLM-5.3 בגרסת Flash. ההכרזה ב-26 באוגוסט אישרה את ההשערה והוסיפה את הפרט שהשבוע החינמי היה מבחן מכוון: Zhipu אומרת שהריצה האנונימית קבעה שיאי נפח קריאות בפלטפורמות הקוד שבהן הוצע, וכל התעבורה סופקה משבבים סיניים מקומיים.
ההקשר של שבוע החינם משמעותי לגבי ציפיות התמחור. מודל שניתן בחינם במחיר $0 למשך שבוע, ואז הושק בתעריף של עשירית מזה של דגם הדגל, עם הנחה לזמן מוגבל למחיר של אחד-מעשרים, הוא מהלך מכוון של עשיית שוק בשכבת התקציב — והחלק של "לזמן מוגבל" הוא זה שחשוב לעקוב אחריו. ההנחה היא החלטת תמחור שאפשר לחזור ממנה; המשקלים הפתוחים של MIT — אי אפשר.

כמה זה עולה, בדולרים בפועל
מחירון Zhipu פורסם בדולרים אמיתיים, לא רק ביחסים: $0.15 למיליון אסימוני קלט, $0.50 למיליון אסימוני פלט, ו-$0.03 למיליון אסימוני קלט במטמון. בהשוואה למחיר שפורסם ל-GLM-5.3 שעומד על $1.40 / $4.40, זה מגיע לכעשירית מהמחיר הרשמי, ומבצע השקה בהנחה של 50% שנמשך עד 9 בספטמבר 2026 מוריד את המחיר ל-$0.075 / $0.25 / $0.015 — בערך עשריםית. Zhipu מציינת גם שהעלות של המודל לכל משימה במדד AA Intelligence Index עומדת על כ-$0.045, לפי דיווח ספק, וזה המספר שמאחורי הניסוח "1/40 מ-Opus 4.8". עבור מודל שמשיג תוצאות באותו טווח כמו מודלים שמתומחרים פי 10–40 יותר, הכלכלה שבכותרת היא אמיתית; האותיות הקטנות הן שהנחת ההשקה זמנית, והעלות לכל משימה תלויה במידת הפולשנות (verbosity) של המודל בפועל בייצור.
סיפור היעילות הוא המקום שבו ז'יפו טוענת שמגיע יתרון העלות. מול GLM-5.3, הספקית מדווחת על ירידה של פי 3.0 במחשוב הקשב ופי 4.4 במטמון KV, וטוענת למחשוב הקשב הנמוך ביותר מבין הדגמים בהשוואה בתקציב — GLM-5.3, DeepSeek V4 Flash ו-Kimi K3 — תוך שהיא מודה שמטמון ה-KV שלה עדיין גדול מעט משל DeepSeek V4 Flash ושל Kimi K3. בצד השרת, ז'יפו מדווחת על שיפור של פי 3 בביצועי השרת מקצה לקצה לעומת קו הבסיס על שבבים סיניים מקומיים, ומגיעה לעלות לכל טוקן שהיא מכנה דומה לזו של GPUs מיינסטרים של NVIDIA. כל אלה הם דיווחי ספק ועדיין לא שוכפלו באופן עצמאי; אלה המספרים הנכונים לבדוק מול המשקולות הפתוחות.
למה החשיפה חשובה
הסר את מדדי הביצועים מהמשוואה, וההשקה עדיין משנה את נוף המודלים הפתוחים בשתי דרכים. ראשית, מדובר במודל מולטי-מודאלי עם משקלים פתוחים בקטגוריית החזית במחיר תקציבי — לשילוב של רישיון MIT, חלון הקשר של מיליון טוקנים, קלט תמונה/וידאו מקורי, ועלות של סנטים בודדים לכל משימה אין מקבילה ישירה במעבדות החזית האמריקאיות, שמודליהן המולטי-מודאליים המקבילים עולים בסדר גודל יותר ומושקים כסגורים. שנית, הוא חותך תחת מודל הדגל של Zhipu עצמה: GLM-5.3 הוא מודל ה-743 מיליארד פרמטרים שזכה החודש לציון 60 שנמדד באופן בלתי תלוי במדד AA Intelligence Index, ו-GLM-5.3-Flash ממוצב כ"אינטליגנציית חזית, במחיר בזק" מול אותה משפחה. הסיפור של Zhipu הוא שמודל קטן וזול יותר יכול להשיג את רוב היכולת של מודל הדגל — ואם הטענות של הספק בתחומי הקידוד והסוכנים יעמדו במבחן, זהו אותו טיעון של כלכלת פוסט-אימון שהתעשייה חגה סביבו כל השנה.
הסתייגות אחת שומרת על זה בפרופורציה. ציון ה-AA Index של GLM-5.3-Flash, 57, מגיע מחומרי ההשקה של Zhipu עצמה, ולא מלוח התוצאות של Artificial Analysis, והשוואת הקוד מול Claude Opus 4.8 היא הערכה פנימית של Zhipu במסגרת Z.ai Code Bench. יש להתייחס ל-57 ולשוויון בקוד כאל טענות עד שתגיע מדידה עצמאית — המודל נבדק בהרחבה בעילום שם, כך שמספרים של צד שלישי אמורים להגיע במהרה.
נסה זאת, וכיצד שכבת הניתוב משתלבת.
הגישה מיום הראשון היא דרך ה-API של Zhipu עצמו, {{1}}המשקלים הפתוחים ב-Hugging Face (zai-org/GLM-5.3-Flash, MIT){{/1}}, {{2}}ומוצרי הקידוד של Zhipu — ZCode ו-GLM Coding Plan{{/2}}, {{3}}הכולל קבוצת כרטיסי ניסיון יומיים{{/3}}. {{4}}לאחסון עצמי, רישיון ה-MIT יחד עם התמיכה ב-vLLM וב-SGLang משמעות הדבר היא שטענות יעילות השירות שלעיל ניתנות לבדיקה ישירה{{/4}}.
בצד הניתוב, GLM-5.3-Flash עצמו עדיין לא נמצא ברשימת OrcaRouter נכון לעדכון זה. שאר משפחת GLM כן: GLM-5.3 עלה לאוויר בצד שלנו באותו יום שבו נפתחה ה-API של Zhipu, במחיר המחירון של Zhipu, עם 0% תוספת שמועברת הלאה. העברה זו היא בדיוק המנגנון שחשוב בהשקה כמו זו — שינוי מחיר של ספק, בין אם ההנחה נשארת או שתעריף המחירים משתנה מאוחר יותר, מופיע אצלנו באותו יום, ללא משא ומתן מחדש. אם אתה רוצה להריץ את Flash מול שאר קו GLM על מפתח אחד ברגע שהוא יגיע, זו ההגדרה; עד אז, המשקלים ב-Hugging Face הם הדרך המהירה ביותר לבדוק את זה בעצמך.

מה לצפות בהמשך
שלושה דברים יקבעו את הסיפור האמיתי בשבועות הקרובים. ראשית, מדידה עצמאית של Artificial Analysis של ה-57 — הדגם כבר רץ בפועל בשם Ox Alpha, כך שלוח התוצאות אמור להתעדכן במהירות. שנית, האם המבצע של 50% הנחה — שמוגדר כרגע להסתיים ב-9 בספטמבר 2026 — יוארך מעבר לתאריך זה, משום שזה קובע את העלות הקבועה של ה-Flash. שלישית, משקלי GLM-5.3, שעדיין מובטחים לסביבות 28 באוגוסט — באותו שבוע שבו משקלי MIT של ה-Flash שוחררו, מה שייתן לקהילת המשקלים הפתוחים שתי רמות של אותה משפחה להשוואה בבת אחת.
השוואות במאמר הזה3
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
