
GLM-5.3-FlashX משווק במחיר גבוה פי 2.5 מהמודל שעליו הוא פועל
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
המספר הראוי לתשומת לב אינו 200. הוא 2.5. ב-18 בספטמבר 2026, Z.ai העלתה את GLM-5.3-FlashX ל-API שלה בקצב של עד 200 אסימוני פלט לשנייה — ותמחרה אותו פי 2.5 ממה שהיא גובה עבור GLM-5.3-Flash, מודל המשקולות הפתוחות שממנו הוא נבנה. שום דבר במודל עצמו לא השתנה. אותן משקולות, אותו עמוד שדרה של תערובת מומחים 320B-A18B, אותו חלון הקשר של מיליון אסימונים, אותו טיפול מקורי בטקסט, בתמונות, בווידאו ובקבצים. מה שהשתנה הוא מחסנית ההגשה שמתחתיו, ומה ש-Z.ai גובה כעת עבור הזכות לשבת קרוב יותר לחזית התור.
זה הופך את FlashX לדבר נדיר בשוק המודלים: השקה בלי שום בנצ׳מרק מצורף. Z.ai לא פרסמה הערכה ספציפית ל-FlashX, כי אין מודל חדש להעריך. כל נתון יכולת שחל על GLM-5.3-Flash חל גם כאן, כולל אלה שפחות מחמיאים ממה שסיקור ההשקה רמז.
כל הדלתא, במעבר אחד
• מהירות — GLM-5.3-FlashX עד 200 tok/s (שיא לפי דיווח הספק) לעומת GLM-5.3-Flash ב-98 tok/s כפי שנמדד על ידי Artificial Analysis ב-API של Z.ai עצמהbr> • מחיר — $0.37 לכל 1M קלט / $1.25 לכל 1M פלט לעומת $0.15 / $0.50 במחירוןbr> • קלט במטמון — $0.075 לכל 1M לעומת $0.03 לכל 1Mbr> • בינה — זהה; FlashX יורש את הציונים של מודל הבסיסbr> • הקשר — 1M טוקנים בשניהםbr> • משקולות — GLM-5.3-Flash הוא משקולות פתוחות ברישיון MIT; FlashX הוא שכבת אירוח ואין לו משקולות משלו
ה-200 וה-98 אינם אותו סוג של מספר, וכדאי לומר זאת בגלוי. האחד הוא תקרה שהספק אומר שהשירות יכול להגיע אליה. האחר הוא מה שמעבדה עצמאית מדדה על פני בקשות אמיתיות. משתמש שמחליט אם לשלם פי 2.5 צריך להתייחס ל-200 כאל פרסומת וללכת למדוד את עומס העבודה שלו עצמו.

מה ש-Z.ai אומר הוא זה שעושה את העבודה
ההאצה היא תשתיתית, לא מתמטית. Z.ai מתארת את FlashX כפועל על אשכול של כ־100,000 מאיצים סיניים מקומיים עם מחסנית שירות ייעודית: מנוע הסקה מבוסס SGLang, קוונטיזציה W8A8, קוונטיזציית מטמון משולבת INT8/FP8/BF16, וארכיטקטורה מפורקת של encode–prefill–decode שמפרידה בין שלב הקידוד המולטימודלי לשלבי יצירת הטוקנים כך שאף אחד מהם לא חוסם את האחר. החברה מדווחת על תפוקת שירות מקצה לקצה של פי 3 בקירוב לעומת קו הבסיס ההתחלתי שלה על אותה חומרה, ואומרת שסוכן תשתיתי המופעל על ידי GLM-5.3 סייע בכיוונון המחסנית.
כל זה מדווח על ידי הספק, ועד כה לא שוחזר על ידי אף אחד מחוץ ל-Z.ai. זה גם החלק הסביר ביותר בסיפור: השקות של שכבת שירות כמו זו הן בדרך כלל הישגים הנדסיים, ובחירות הארכיטקטורה המתוארות הן ערכת הכלים הסטנדרטית בדיוק עבור רווח מסוג זה. מה שהן לא מהוות הוא ערובה. נתון של 200 tok/s הוא שיא, ושיאים מושגים בפלטים קצרים, במטמונים חמים ובאשכול לא עמוס. בקשות מולטימודליות עם הקשר ארוך — עומס העבודה ש-FlashX מיועד אליו במפורש — הן אלו שהסיכוי שלהן להשיג אותו הוא הנמוך ביותר.
המחיר הוא החלטת המוצר האמיתית
במחיר מחירון, GLM-5.3-FlashX עולה $0.37 למיליון טוקני קלט ו-$1.25 למיליון טוקני פלט, כאשר קלט במטמון עולה $0.075 ואחסון מטמון בחינם לזמן מוגבל. בתמחור המקומי של Z.ai זה ¥2 בקלט ו-¥7 בפלט, לעומת ¥0.8 ו-¥2.8 עבור Flash הבסיסי — אותו יחס של פי 2.5, כפי שמצוין במטבע שבו Z.ai מוכרת בשוק הביתי.

החשבון נעשה לא נוח במהירות בכיוון שאנשים כמעט אף פעם לא בודקים. אסימוני פלט הם המקום שבו המכפיל מכה הכי חזק, מפני שהפלט הוא הצד היקר בכל מודל במשפחה הזו: הפלט של FlashX הוא פי 2.5 מהפלט של Flash, והפלט כבר עולה פי ~3.4 ממחיר הקלט בשניהם. משימת אצווה שמייצרת מיליון אסימוני פלט ביום עוברת מ-$0.50 ל-$1.25 — פער של $274 בשנה עבור עומס עבודה שאף אחד, מעצם הגדרתו, לא ממתין לו.
הנקודה שבה זה משתלם היא השהיה שאפשר לפרוס. לולאת סוכן שמבצעת עשר קריאות רצופות חוסכת את ההפרש לכל קריאה עשר פעמים, ואם ההפרש הזה הוא שתיים או שלוש שניות, החזרתם לעצמכם חצי דקה של זמן שעון לכל משימה. עבור השלמת קוד אינטראקטיבית, דיאלוג בזמן אמת, או כל צינור שבו אדם או שירות במעלה הזרם חסום על הטוקן הבא, החלופה הזו בדרך כלל נכונה. Z.ai גם מציינת במפורש שהמודל אינו חלק מתוכנית ה-GLM Coding Plan שלה כרגע, כך שמשתמשי מנוי אינם מקבלים את FlashX כחלק מהחבילה — הם משלמים עבורו לפי טוקן.
אם הסטאק שלכם כבר מדבר עם יותר מספק אחד, המעבר הוא שינוי במחרוזת המודל ותו לא. זו הסיבה המעשית לכך שניתוב קיים כשכבה: ב-OrcaRouter מחיר המחירון של הספק מועבר הלאה עם 0% תוספת, כך ששינוי מחיר של Z.ai או הנחה מבצעית מגיעים באותו יום שבו הם קורים במעלה הזרם, ונקודת קצה אחת מול 200+ מודלים אומרת שבחינת FlashX מול Flash היא עריכת קונפיגורציה ולא פרויקט אינטגרציה. גם מעבר אוטומטי לגיבוי חשוב כאן — שכבת הגשה חדשה לגמרי על אשכול חדש לגמרי היא בדיוק סוג התלות שכדאי שיהיה מאחוריה גיבוי.
מה לא השתנה, ולמה זה חשוב יותר
FlashX יורש את פרופיל היכולות של GLM-5.3-Flash במלואו, ופרופיל זה צר יותר מכפי שהשתמע מסיקור ההשקה. החומרים של Z.ai מציבים את מודל הבסיס באותה רמה כמו Claude Opus 4.8 במדד הבינה של Artificial Analysis. Artificial Analysis עצמו מפרט כיום את GLM-5.3-Flash בציון 42 במדד הזה, כפי שנמדד ב-API של Z.ai עצמה — ציון מוצק, גבוה בהרבה מהחציון של מודלים עם משקולות פתוחות מסוגו, ורחוק מאוד מדרג החזית שהשוואת הספק מציעה. שתי הטענות נכונות; הן פשוט לא אותה טענה, והפער ביניהן הוא הסיבה שהבלוג הזה מתייג מספרי ספקים כמספרי ספקים.
מודל הבסיס הוא בעל יכולות אמיתיות ופתוח באמת. GLM-5.3-Flash הושק ב-26 באוגוסט 2026 תחת רישיון MIT, עם משקולות ב-Hugging Face, והעיצוב ההיברידי שלו של קשב ליניארי בתוספת דליל — דחיסת IndexPool, hyper-connections עם אילוץ יריעה — מקצץ את חישוב הקשב בערך פי 3 ואת מטמון ה-KV בערך פי 4.4 לעומת GLM-5.3, וזה מה שהופך מודל של 320B עם 18B פרמטרים פעילים לזול מספיק כדי שניתן יהיה לשרת אותו בכלל. הפלט מוגבל ל-131,072 טוקנים. הוא מהיר ביחס למחירו, לא מהיר ביחס למעמדו: Artificial Analysis מדד 98 טוקנים בשנייה, לעומת חציון של עמיתים מעל 70 אך מתחת למודלים המהירים ביותר בלוח.
FlashX לא משנה שום דבר מזה. הוא משנה כמה זמן אתה ממתין לזה.
הקריאה הכנה
קנה את FlashX אם עומס העבודה שלך מוגבל בהשהיה וכבר החלטת ש-GLM-5.3-Flash הוא המודל הנכון — סוכן שמשרשר קריאות, עורך שמשלים בתוך השורה, ממשק קולי או צ'אט שבו ההשהיה היא המוצר. הישאר עם GLM-5.3-Flash, או עם המשקולות הפתוחות שתוכל לארח בעצמך, אם העבודה שלך נעשית במנות, לא מקוונת, או מוגבלת בתפוקה ולא בהשהיה. האינטליגנציה שאתה משלם עליה פי 2.5 היא האינטליגנציה שכבר הייתה לך.
השאלה הפתוחה היא מה אומרת מדידה עצמאית על ה-200. איש מחוץ ל-Z.ai עדיין לא פרסם נתוני תפוקה של FlashX, ועד שמישהו יעשה זאת, העמדה הכנה היא ש-FlashX היא שכבת הגשה מבטיחה שנמכרת על סמך נתון שיא. היא גם, באופן ראוי לציון, מבחן מסחרי: מעבדה שבילתה שנה בהצעת מודל הקרוב לחזית במחיר של עשירית ממחיר הדגל שלה, שואלת כעת אם מפתחים ישלמו עבור מהירות כשלעצמה. התשובה תעצב כיצד תתומחר השכבה הבאה.

השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
