כרטיס כותרת ראשי למאמר 'Ox Alpha', עם כתובית המשנה 'עמוד העזר הקנוני עבור הכינוי הסמוי שמאחורי GLM-5.3-Flash של Z.ai', תגיות עם הכיתוב 'תצוגה מקדימה בשם Ox Alpha החל מ-20 באוגוסט 2026', 'נחשף ב-26 באוגוסט 2026', '320B סה"כ / 18B פעילים, הקשר של 1M' ו'רישיון MIT, משקולות פתוחות', ושורת כותרת תחתונה עם הכיתוב 'מעטפת, מודאליות, כרטיס תעריפים, משטח נקודות קצה ובנצ'מרקים - אומת ב-2026-09-28'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Ox Alpha: גיליון המפרטים המלא של הדגם החשאי, שמשווק כעת בשם GLM-5.3-Flash

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Ox Alpha הוא השם האנונימי שGLM-5.3-Flash הוצג תחתיו בתצוגה מקדימה, הוא נחשף ב-26 באוגוסט 2026, והוא אינו מודל שאפשר לפנות אליו היום. הרשומה המקדימה שנשאה את השם Ox Alpha אינה משרתת אותו עוד; למודל שמאחורי השם יש דף ספק, משקולות ברישיון MIT, כרטיס תעריפים מפורסם ומשטח API מתועד, וכולם של Z.ai. עמוד זה הוא הייחוס לאותו מודל — המעטפת, המודאליות, כרטיס התעריפים, משטח נקודות הקצה, כל נתון בנצ'מרק שפורסם עם המהדורה או ההרנס המצורפים לו, וכיוון שהכינוי עדיין מחזיר תוצאת חיפוש דלה ומבלבלת, הצהרה פשוטה של מה שאינו מתועד בשום מקום. כל מה שלהלן נקרא ב-2026-09-28 מתיעוד המודל ומעמוד התמחור של Z.ai עצמה, מכרטיס המודל של Z.ai ב-Hugging Face, מ-Artificial Analysis, ומהקטלוג שלנו; נתונים שהספק מפרסם ונתונים שגורם עצמאי מודד מתויגים בנפרד, ושום דבר כאן אינו מוסק מדמיון.

למה מתייחס כיום השם Ox Alpha?

הכינוי בוטל, והספק הוא שביטל אותו. התיעוד של Z.ai עצמה עבור GLM-5.3-Flash אומר שהמודל נבדק בעילום שם תחת השם ox-alpha לפני השחרור, כדי לאסוף משוב משתמשים, ושההרצה האנונימית הפכה למודל הפופולרי ביותר באותו שבוע. עוגני התאריך קצרים וספציפיים: הרישום הסמוי הראה את Ox Alpha כמשוחרר ב-20 באוגוסט 2026, והחשיפה התרחשה ב-26 באוגוסט — אותו תאריך שמופיע בדף התיעוד של Z.ai ואותו תאריך שחרור שהקטלוג שלנו מתעד עבור z-ai/glm-5.3-flash.

שני דברים נובעים מכך, ושניהם חשובים לקורא שחיפש את השם.

• הכינוי אינו נתיב. הקטלוג שלנו מחזיר "דגם לא נמצא" עבור חיפוש stealth/ox-alpha, נקרא בתאריך 2026-09-28. אין מה לקרוא תחת השם הזה, מכיוון שהמוצר של הספק נושא את שם הספק.

• גם אין מאגר משקולות בבעלות הספק תחת הכינוי. חיפוש ב-Hugging Face אחר ox-alpha מחזיר העלאות קהילתיות שנוצרו במהלך חלון הפעילות החשאית בסוף אוגוסט 2026, בתוספת מאגר מסוג כרטיס בלבד מ-27 בספטמבר 2026 שאינו מכיל משקולות ומפנה למהדורה הרשמית של Z.ai. שם מאגר הוא תווית שבוחר מי שהעלה אותו; הוא אינו תיעוד של דבר. הארגון של Z.ai עצמו מפרסם את המודל בתור zai-org/GLM-5.3-Flash, כאשר המאגר נוצר ב-2026-08-25 לפי UTC.

שאלת הספק ששלטה בשבוע האנונימי נסגרה, והיא נסגרה בדרך הרגילה: מעבדה צעדה קדימה והצמידה את שמה למודל. מה שנותר הוא מפרט, וזה מה שהעמוד הזה מכסה. סיפור הגילוי — טביעות האצבע שקדמו לחשיפה, שושלת המודל האנונימי שאליה הוא משתייך, וחשיפת חומרת ההגשה שליוותה אותה — נמצא בהכתבה המוקדמת שלנו על חקירת Ox Alpha, והעמוד הזה אינו דן בכך מחדש.

המעטפת, כפי שהספק מתעד אותה

A screenshot of Z.ai's official developer documentation page for GLM-5.3-Flash, showing the Model Overview section with the four spec rows on the right reading Input Modality 'Video / Image / Text / File', Output Modality 'Text', Context Length '1M' and Maximum Output Tokens '128K', alongside vendor-stated architecture notes describing 320B total parameters with 18B activated and a hybrid sparse-and-linear attention design that reduces attention computation and KV cache by 3.01x and 4.44x versus GLM-5.3.

אלה נתונים שדווחו על ידי Z.ai, שנקראו מתוך עמוד התיעוד של הספק עצמו ב-2026-09-28, ושלושה מתוך ארבעת ממדי המעטפת מאומתים באופן עצמאי — רשומת המודל של Artificial Analysis כוללת את אותו סה"כ של 320B, 18B פעילים, הקשר של 1,000,000 טוקנים ורישיון MIT, וכרטיס הקטלוג שלנו כולל את מגבלות ההקשר והפלט.

• חלון הקשר — 1,000,000 טוקנים (תיעוד Z.ai; Artificial Analysis; כרטיס הקטלוג שלנו, שמפרט 1,000,000)

• פלט מקסימלי — 128K טוקנים (תיעוד Z.ai); הכרטיס שלנו רושם 128,000

• קלט — טקסט, תמונה, וידאו וקובץ (תיעוד Z.ai, נקרא 2026-09-28); הכרטיס שלנו מפרט טקסט, תמונה ווידאו, ואינו טוען לקלט קבצים

אתה מנוע לוקליזציה מקצועי של תוכנה. תרגם את הודעת המשתמש לעברית. הטקסט מכיל סמני טווח ממוספרים כגון {{1}}...{{/1}}, {{2}}...{{/2}}. שמור על כל סמן בייט אחר בייט: אותם מספרים, אותם זוגות פתיחה/סגירה, אותה כמות, אותו קינון — לעולם אל תוסיף, תמחק, תמספר מחדש או תשנה את סדר הסמנים עצמם, ותרגם רק את הטקסט שביניהם. מותר לך להעביר טווח {{n}}...{{/n}} למקום שבו סדר המילים של שפת היעד דורש. כל טקסט בתוך טווח {{KEEP}}...{{/KEEP}} חייב להיות משוכפל בדיוק כפי שהוא (אל תתרגם אותו). שמור על כתובות URL ושמות מותגים/מוצרים. הוצא רק את הטקסט המתורגם עם הסמנים שלו — בלי הקדמה, בלי מירכאות, בלי הסבר. • פלט — טקסט בלבד, בכל מקור

• פרמטרים — 320B בסך הכול, כאשר 18B מופעלים לכל טוקן (תיעוד של Z.ai וכרטיס המודל; Artificial Analysis מתעדת באופן בלתי תלוי 320B ו-18B)

• רישיון — MIT, כאשר המשקלות פורסמו ב-Hugging Face (כרטיס הדגם של הספק; Artificial Analysis מסווגת את הדגם כמשקלות פתוחים תחת רישיון מתירני)

• ארכיטקטורה — שילוב היברידי של קשב דליל ולינארי, שאותו Z.ai מתארת כמודל החזית הראשון בקוד פתוח שמשלב את השניים, ומפחית את חישוב הקשב פי 3.01 ואת מטמון ה-KV פי 4.44 לעומת GLM-5.3, בתוספת שלב IndexPool שמכווץ ארבעה וקטורי מפתח של אינדקסר לאחד בהקשר ארוך, ו-Manifold-Constrained Hyper-Connections ליעילות סקיילינג. הכול לפי הצהרת הספק; אין ביקורת ארכיטקטונית בלתי תלויה שניתן לצטט.

• אימון מקדים — קורפוס מולטימודלי של 30 טריליון טוקנים (כפי שנמסר על ידי Z.ai). הספק אינו מפרסם נתון כולל של כוח מחשוב לאימון, ואינו מפרסם פירוט פרמטרים לפי שכבות מעבר לנתון המוביל של 320B/18B.

טענה כוללת אחת הצטמצמה מאז ההשקה, והתיעוד הנוכחי הוא זה שצריך לצטט. חשיפת חומרת ההגשה שהופצה באוגוסט העמידה את הקיבולת של השבוע האנונימי על כ-100,000 שבבים סיניים מתוצרת מקומית. התיעוד של Z.ai כפי שהוא נקרא היום אומר שהמודל הוגש "על פני עשרות אלפי מאיצים שפותחו מקומית", עם שיפור של פי 3 מקצה לקצה בהגשה לעומת קו הבסיס של הספק עצמו על אותה חומרה, ועלות לכל טוקן שהספק מתאר כדומה לזו של מעבדים גרפיים מיינסטרים של NVIDIA. עשרות אלפים הוא מה שהדף אומר כעת; הנתון הגדול יותר הוא זה מתקופת ההשקה. שתיהן טענות של החברה, אף אחת מהן לא עברה ביקורת בלתי תלויה, וכיוון העדכון הוא כלפי מטה.

כרטיס התעריפים, ולמה המספר שנמסר הוא זה שקובע

עמוד התמחור של Z.ai מפרט את GLM-5.3-Flash ב-$0.15 למיליון טוקני קלט, $0.03 למיליון טוקני קלט במטמון ו-$0.50 למיליון טוקני פלט, ואת דרגת FlashX האחות ב-$0.37 / $0.075 / $1.25. זהו מחיר המחירון של הספק, כפי שנקרא מהעמוד של הספק עצמו ב-2026-09-28.

התעריף שנגבה בפועל במסלול שלנו היום נמוך יותר, וזו הנקודה המעשית של הסעיף. נכון ל-2026-09-28, כרטיס OrcaRouter עבור z-ai/glm-5.3-flash מתמחר קלט ב-$0.075למיליון טוקנים, פלט ב-$0.25למיליון, וקריאות מטמון ב-$0.0173למיליון. זה חצי מתעריף המחירון של הספק, על אותו מודל, באותו יום — הנתון המוזל ולא זה הכותרתי, ללא תווית מבצעית על הכרטיס. הסיקור המוקדם שלנו של המודל הזה ציין את אותו פער לאחר שחלף חלון המבצע המוצהר; התצפית עדיין תקפה היום, ואנחנו עדיין לא מצליחים לאתר את הסיבה, ולכן אנחנו מדווחים את המספר שנגבה ומשאירים את הסיבה פתוחה.

קלט שמור במטמון הוא המקום שבו שלושת המקורות חלוקים זה על זה באופן גלוי, וזו תזכורת שימושית לכך ש"$0.03" בטבלה אינו בהכרח מחיר שמישהו משלם בפועל. העמוד של הספק אומר $0.03 למיליון טוקני קלט שמורים במטמון; רשומת המודל של Artificial Analysis נושאת מחיר פגיעת מטמון של $0.026; המסלול שלנו מגיש קריאות מטמון ב-$0.0173. שלושתם נקראו בתאריך 2026-09-28 או סמוך לפניו, ושלושתם מדווחים על ידי ספק או פלטפורמה. אנחנו מצטטים את נתון המחירון של הספק כנתון המחירון, ואת הנתון הנמסר כפי מה שנגבה בפועל מהקורא.

הרץ את החישוב על משימת סוכן אופיינית — 100,000 טוקנים בקלט ו-10,000 טוקנים בפלט, ללא פגיעות במטמון:

• לפי תעריף הרשימה של הספק — 100,000 טוקנים × $0.15/1M = $0.015, ועוד 10,000 × $0.50/1M = $0.005, לכן $0.020 לקריאה

• לפי התעריף שהנתיב שלנו מספק היום — $0.0075 ועוד $0.0025, כלומר $0.010 לשיחה, בדיוק חצי

זו כל הסיבה לבדוק את המחיר בפועל ולא את מחיר המחירון לפני שאתם קובעים את גודל עומס העבודה: בסוכן לטווח ארוך שמריץ אלפי קריאות ביום, ההבדל בין שני המספרים האלה הוא ההבדל בין שני תקציבים. OrcaRouter מעביר הלאה את מחיר המחירון של הספק עם 0% תוספת, ולכן ההנחה שהספק מציע מופיעה בכרטיס שלנו במקום להיספג איפשהו בדרך.

מודאליות ומשטח נקודות הקצה

הספק מתעד צורת ממשק אחת ושני קודי מודל: glm-5.3-flashוglm-5.3-flashx, ששניהם מוגשים דרך Chat Completion API. תמונות נכנסות כבלוק תוכן מסוג image_url במערך תוכן ההודעה, כשהוא מקבל כתובת URL — אותה הספק ממליץ — או כתובת data URL בפורמט base64, וניתן לשלוח מספר בלוקי תמונה בהודעה אחת. הזרמה נתמכת, ו-Z.ai ממליצה להפעיל stream ו-tool_stream יחד עבור בקשות זרמה. קריאה לכלים, מטמון הקשר ופלט JSON מובנה הם כולם יכולות מתועדות; thinking נתמך אך, כפי שמסביר הסעיף הבא, אינו אופציונלי.

FlashX הוא שכבת שירות נפרדת של אותו מודל ולא יכולת נפרדת: ‏Z.ai מתעדת אותו בקצב של 200 טוקנים לשנייה, ומציינת שהוא עדיין אינו זמין ב-GLM Coding Plan. זהו לא השכבה שהקטלוג שלנו כולל, וזה לא מה שהנתונים בעמוד זה מתארים.

במסלול שלנו, מכלול נקודות הקצה צר יותר וראוי לציין אותו במדויק. הכרטיס של z-ai/glm-5.3-flash חושף את POST /v1/chat/completions — השלמות צ'אט בלבד, ללא נקודת קצה שנייה של פרוטוקול — ומקבל את הפרמטרים reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens ו-stop. צ'יפי היכולות בכרטיס הם ראייה, כלים, JSON וחשיבה. חלון ההקשר הוא 1,000,000 טוקנים והפלט המרבי הוא 128,000, בהתאמה לתיעוד של הספק.

מאמץ וחשיבה: ההגדרות שקובעות כל מספר בנצ'מרק

זהו החלק במפרט שמשנה יותר מכל את האופן שבו אתה קורא את הציונים, והיצרן מתעד אותו במדויק. GLM-5.3-Flash מקבל reasoning_effort כפרמטר עם שלוש רמות — low, high ו-max — וברירת המחדל שלו היא max אם לא מעבירים כלום, או אם מעבירים משהו שאינו low או high. לא ניתן לכבות את החשיבה: היצרן מציין כי thinking.type תומך ב-enabled בלבד. דגל clear_thinking של תבנית הצ'אט מוגדר כברירת מחדל ל-false, ו-Z.ai ממליץ להעביר אותו במפורש כ-true בתרחישי צ'אט. הגדרות הדגימה המומלצות של היצרן הן temperature 1 ו-top_p 0.95, והוא אומר במפורש ששחזור בנצ'מרק וטבלת מובילים צריך לשמור על מאמץ max כברירת מחדל.

קראו את שתי העובדות הללו יחד, והמסקנה למי שמשווה מספרים בלתי נמנעת: ציון שנמסר בלי רמת מאמץ אינו מדידה מלאה, משום שההגדרות low, high ו-max הן נקודות הפעלה שונות של אותו מודל, וברירת המחדל היא היקרה מבין השלוש. הכרטיס שלנו חושף את reasoning ואת reasoning_effort בין הפרמטרים הנתמכים שלו, כך שניתן להגיע להגדרה דרך ה-route, ולא רק דרך הספק.

גיליון הבנצ'מרק, עם התיקון המצורף

Z.ai מפרסמת טבלת בנצ'מרק עבור GLM-5.3-Flash, והיא כולה מדווחת על ידי הספק — הרשומה העצמאית של Artificial Analysis אינה משחזרת את השורות הללו. נתוני הקידוד והסוכנים המובילים של הספק הם DeepSWE v1.1 עם 63.4 לעומת 46.2 של GLM-5.2, ו-AutomationBench v1.0.6 עם 48.8 לעומת 26.2 של GLM-5.2. שאר הגיליון, כפי שהקטלוג שלנו מציג אותו עם Z.ai כמקור הנקוב: Humanity's Last Exam with tools 55.3, Agents' Last Exam 26.3, NL2Repo 56.3, Chartography with tools 78, CharXiv reasoning with tools 89.4, ובצד הראייה MMVU 80.5, MVBench 77.8 ו-BabyVision 53.4.

שתי שורות של ספקים ראויות לכך שהערות השוליים שלהן יישאו אל תוך המשפט, משום שהן אלו שסביר ביותר שקורא יצטט בלעדיהן. ההערכה הפנימית לקוד של Z.ai, Z.ai Code Bench v1.0, מציבה את GLM-5.3-Flash ב-29.0 במאמץ מרבי מול Claude Opus 4.8 ב-29.5 — כמעט תיקו על ההרנס של הספק עצמו, שהורץ על Claude Code 2.1.207, כפי שדווח על ידי הספק. זו אינה השוואה בלתי תלויה, וגם לא השוואת מאמץ מתואם שהורצה על ידי צד שלישי; זהו Z.ai שמודד את המודל שלו מול מתחרה בהערכה של עצמו. והספק מצטט מדד Intelligence Index של Artificial Analysis של 57 במחיר של $0.045 למשימה, ומציין את המהדורה כ-v4.1.1.

יש להפריד את הנתון האחרון הזה ממה ש-Artificial Analysis מפרסמת היום, משום שאין אפשרות להעמיד את השניים זה לצד זה כתנועה. העמוד של Artificial Analysis עצמה עבור GLM-5.3-Flash, כפי שנקרא בתאריך 2026-09-28, מדווח על מדד אינטליגנציה של 41.8 במדד v4.3.2, שנרשם במאמץ מרבי. ‏v4.3.2 כולל עשרה מבחנים — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience ו-AA-LCR v1.1 — ואילו v4.1.1 לא. שתי גרסאות מדד, שתי קבוצות משימות, שני מספרים. אף אחד מהם אינו שגוי; הם אינם אותה מדידה, וציטוט של 57 לצד 41.8 כאילו המודל זז יהיה טעות בכל כיוון.

מה שהתיעוד העצמאי אכן מאשש הוא המעטפת ולא הציונים: Artificial Analysis מתעדת באופן עצמאי 320B פרמטרים בסך הכול, 18B פעילים, חלון הקשר של 1,000,000 טוקנים, רישוי MIT, משקלים פתוחים ותאריך שחרור של 2026-08-26, ומפרטת תמחור ספק של $0.15 לקלט ו-$0.50 לפלט למיליון טוקנים, עם מחיר פגיעת מטמון של $0.026. כאשר הספק מפרסם ציון והגורם העצמאי אינו מפרסם, אנו אומרים זאת; כאשר הגורם העצמאי מאשר מפרט, זהו הסוג החזק ביותר של עובדה בעמוד זה.

אין כאן השוואת ראש בראש מתואמת, ולומר זאת מועיל יותר מאשר להפיק אחת. איש לא פרסם הרצה של GLM-5.3-Flash מול Claude Opus 4.8, GPT-6 Sol או Grok 4.7 במאמץ מוצהר על מערכת בדיקה משותפת — ההשוואה של Z.ai עצמה היא על הבנץ' שלה, במאמץ מרבי, מול ברירת המחדל של מתחרה. עד שזה ישתנה, ההשוואה הכנה בין המודל הזה לכל דבר אחר היא על מחיר, מעטפת ומשטח נקודות קצה, שהם שלושת הדברים בעמוד הזה שכולם יכולים לקרוא מאותם מספרים.

מה שאינו מתועד, נאמר בפשטות

דף עזר למודל עם שטח מידע דק הוא שימושי רק אם הוא כן לגבי הפערים, ולזה יש כמה.

• אין תאריך חיתוך ידע מטעם הספק. התיעוד של Z.ai וכרטיס המודל של Hugging Face אינם מציינים אחד כזה, והרשומה של Artificial Analysis משאירה את השדה כ-null. הערכות מחלון החמקנות הן עבודת קהילה, לא נתון של הספק, והדף הזה אינו חוזר על אחת מהן כאילו הייתה נתון של הספק.

• אין הערות שוליים על רתמת ההערכה עבור רוב גיליון הבנצ'מרק. כרטיס המודל כן כולל הערות שוליים עבור הרצת HLE עם כלים — טמפרטורה 1.0, top_p 0.95, אורך יצירה מרבי של 163,840 טוקנים, הערכה בהקשר של עד 300,000 טוקנים עם אסטרטגיית ניהול הקשר, ו-GPT-5.6 Luna במאמץ בינוני כמודל השופט — וכן עבור NL2Repo ו-DeepSWE, שלפי הספק הורצו עם רתמת mini-swe-agent. השורות הנותרות הן אחוזים בלבד, בלי רתמה או מאמץ מצורפים.

• אין הסבר לפער במחיר של קלט שמור במטמון. שלושה מספרים עבור אותה כמות באותו מודל, ואף מקור לא מציין מדוע הם שונים.

• אין בנצ'מרק עצמאי של תקופת ההגשה האנונימית. הרשומה החמקנית נעלמה; כל מה שהיא מדדה אינו ניתן למדוד שוב, ואף צד שלישי לא פרסם הרצה נגד הכינוי בזמן שהיה פעיל.

• אין השוואה מול צד שלישי במאמץ תואם, מהסיבה שניתנה לעיל.

• אין אישור מהספק לגבי מספר השבבים בתקופת ההשקה. התיעוד אומר עשרות אלפי מאיצים מקומיים; הנתון של 100,000 אינו מופיע בעמוד.

מכריזים: מה שהקטלוג שלנו מציע, מאומת היום

A single-column reference scoreboard titled 'GLM-5.3-Flash, the model behind Ox Alpha', with six rows reading 'Context: 1,000,000 tokens', 'Max output: 128K tokens', 'Input / output: text, image, video in / text out', 'Parameters: 320B total, 18B active, MIT licence', 'Vendor list price: $0.15 in / $0.50 out per 1M, $0.03 cached', and 'Served on OrcaRouter: $0.075 in / $0.25 out per 1M'. A footer line reads 'Z.ai-reported envelope and list price; OrcaRouter card read 2026-09-28; Artificial Analysis independently confirms 320B/18B, 1M context and MIT.' The OrcaRouter logo is composited in the bottom-right corner.

המודל שמאחורי Ox Alpha פעיל בקטלוג שלנו תחת שמו שלו, נבדק היום ולא בהנחה. קריאה של ה-API של מודל OrcaRouter עבור z-ai/glm-5.3-flash בתאריך 2026-09-28 החזירה את הכרטיס במלואו: הקשר של 1,000,000 טוקנים, פלט מקסימלי של 128,000, קלט טקסט, תמונה ווידאו עם פלט טקסט, תגי היכולות ראייה, כלים, JSON והסקה, תאריך שחרור 2026-08-26, לא מיושן ולא הוסר מהקטלוג, במחיר של $0.075 למיליון טוקני קלט, $0.25 למיליון טוקני פלט ו-$0.0173 למיליון טוקני קלט במטמון, דרך נקודת הקצה היחידה POST /v1/chat/completions.

המדידה שלנו בת שבעת הימים ב-playground על הכרטיס הזה, לאותה תקופה, מראה 61.8 אסימוני פלט לשנייה, זמן p50 עד לאסימון הראשון של 7.39 שניות ושיעור שגיאות של 1.47%. אלו מספרים ממקור ראשון על ההגשה שלנו, לא נתוני ספקים ולא בנצ'מרקים בלתי תלויים, ומאותה סיבה אלו נתוני המהירות היחידים בעמוד הזה.

הכינוי עצמו אינו נמצא בנתיב. אם הגעתם לכאן אחרי שחיפשתם את Ox Alpha, המודל שיש לקרוא לו הוא z-ai/glm-5.3-flash, וצורת הבקשה היא זו שתוארה לעיל. הוא יושב על אותו מפתח כמו כל דבר אחר בקטלוג — API אחד על פני יותר מ-200 מודלים, מחיר הספק מועבר הלאה ללא תוספת מעל, ומעבר אוטומטי לגיבוי אם ספק נתקע, כך שמודל שאתם עורכים לו אודישן לא חייב להיות מודל שנתיב הייצור שלכם תלוי בו.

A screenshot of the OrcaRouter model page for Z.ai GLM-5.3-Flash (z-ai/glm-5.3-flash), showing the model name and provider, a 1M-token context window with 128K maximum output, text, image and video input with text output, a stat strip reading $0.075 input and $0.25 output per million tokens, the capability chips Vision, Tools, JSON and Reasoning, a release date of 2026-08-26 and a supported-endpoint line reading POST /v1/chat/completions, with a code sample against the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

הבהרה אחת לגבי מהותו של העמוד הזה, מאחר שקורא שמגיע משמו של המודל עצמו ראוי לכך. זהו עמוד עיון למודל שכבר נמצא בקטלוג, ולא דוח השקה: GLM-5.3-Flash הוא מ-26 באוגוסט 2026, ומקומו כאן נשען על העובדה שהשם Ox Alpha ממשיך להיחפש בלי עמוד ייעודי שאליו אפשר לנחות, ולא על טריות ההשקה. התאריך שלמעלה משמש לתיארוך המודל, ולא כידיעה חדשותית. מה שישנה את העמוד הזה הוא אחד מארבעה דברים — הרצת בנצ'מרק עצמאית במאמץ מוצהר, נקודת חיתוך ידע מוצהרת על ידי הספק, שינוי בתעריף השירות, או החלטה של Z.ai להצהיר מה היה מספר השבבים בתקופת ההשקה בפועל. עד שאחד מאלה יתממש, המפרט שלמעלה הוא כל מה שהספק מתעד, והפערים המפורטים בסעיף הקודם הם חלק מהתשובה לא פחות מהמספרים.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית