
GLM 5.3 Prime: אותם משקלים של GLM-5.3, בדיוק פי שניים מהמחירון
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 177 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1323 tok/s
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
GLM 5.3 Prime עולה 2.80 דולר למיליון טוקני קלט ו-8.80 דולר למיליון טוקני פלט. GLM-5.3, המודל שעליו הוא רץ, עולה 1.40 דולר ו-4.40 דולר. זה אינו הבדל של עיגול מספרים ולא פער מבצעי — זה בדיוק פי 2.0 בשני הסעיפים, וזה הדבר היחיד ששני המוצרים חלוקים עליו. GLM 5.3 Prime אינו מודל חדש. הוא נושא את המשקלים של GLM-5.3 עצמו, אלה ש-Z.ai חשפה ב-25 באוגוסט 2026, מאחורי מחסנית הגשה מהירה יותר. GLM-5.3 עצמו הוכרז ב-14 באוגוסט 2026 והגיע ל-API ב-18 באוגוסט. שום דבר במודל הבסיסי לא השתנה כאשר מזהה ה-Prime הופיע בסוף ספטמבר. מה שכן השתנה הוא שמישהו הוסיף לו תג מחיר שני.
אם אתם קוראים זאת מפני שרשימת מודלים הראתה לכם שם לא מוכר לצד שם מוכר, התשובה הקצרה היא: אתם מסתכלים על דרגת הגשה, לא על מהדורה. התשובה הארוכה שווה שתי דקות, מפני שהאריתמטיקה נקייה במיוחד והמקור עכור במיוחד.
מהי דרגת "Prime", בפסקה אחת
דרגת הגשה היא מזהה מוצר שני שמצביע על אותם משקלים, ומכוון לתפוקה במקום לעלות. אינך מקבל מודל גדול יותר, הקשר ארוך יותר, מצב הסקה טוב יותר או משטח כלים רחב יותר. אתה מוציא טוקנים החוצה מהר יותר, ואתה משלם על הפריבילגיה בכל טוקן ולא על זמן שעון הקיר שחסכת. העסקה הזו אמיתית ולפעמים נכונה — לולאת סוכן רב-שלבית שמבצעת עשר קריאות עוקבות אכן מפיקה תועלת מכך שכל קריאה מחזירה תשובה מוקדם יותר — אבל זו רכישה של השהיה, לא רכישה של יכולת, ויש לתמחר אותה בהתאם.
תיאור הספק של GLM 5.3 Prime אומר את החלק השקט ישירות: הוא "הווריאנט המהיר של GLM-5.3 של Z.ai, שיורש את מלוא יכולותיו תוך אספקת תפוקת פלט של פי 1.5–2 באמצעות האצת הסקה". מלוא היכולות. אותו חלון הקשר של 1,000,000 טוקנים. אותה תקרת פלט של 131,072 טוקנים. טקסט נכנס, טקסט יוצא. הסקה חובה, עםlow, high ו-max ברמות מאמץ, ו-max כברירת מחדל — זהה למודל הבסיס.
כרטיס התעריפים, זה לצד זה
• קלט — GLM 5.3 Prime $2.80 ל-1M לעומת GLM-5.3 $1.40 ל-1M
• פלט — GLM 5.3 Prime $8.80 ל-1M לעומת GLM-5.3 $4.40 ל-1M
• קלט במטמון — GLM 5.3 Prime $0.56 ל-1M לעומת GLM-5.3 $0.26 ל-1M
• מכפיל — 2.0× בכל שלוש השורות, בשני הכיוונים
• חלון הקשר — 1,000,000 טוקנים בשניהם
• פלט מרבי — 131,072 טוקנים בשניהם
• חשיבה — חובה בשניהם, אותן שלוש רמות מאמץ, אותה ברירת מחדל
שורת המטמון היא זו שאנשים מפספסים. קריאה מהמטמון היא הטוקן הזול ביותר שתקנו אי-פעם ממודל חזיתי, ושם עומסי העבודה של סוכנים באמת מוציאים את התקציב שלהם — פרומפט המערכת, הגדרות הכלים והתמליל ההולך וגדל נקראים מחדש בכל תור. הכפלת תעריף המטמון מכפילה את סעיף ההוצאה הגדול ביותר בסשן סוכן ארוך, מה שאומר שהפרמיה האפקטיבית בעומס עבודה אמיתי היא קרובה יותר לפי 2 מכפי שהפער הכותרתי בטוקני קלט טריים מרמז. אם קיוויתם שהמסלול המהיר יהיה זול יותר בפועל מפני שאתם משתמשים במטמון באגרסיביות, זה לא כך.
מי בעצם מוכר את זה?
כאן הרשומה הופכת למעניינת, וכאן קורא זהיר צריך להאט. התיעוד של Z.ai עצמה, סקירת המודלים שלה ועמוד התמחור שפרסמה אינם כוללים שום SKU בשם Prime. חפשו במזהי המודלים של הספק את glm-5.3-primeולא תמצאו דבר. שכבת המהירות של Z.ai עצמה היא מוצר אחר לגמרי, בקו אחר לחלוטין — GLM-5.3-FlashX, שנמצא במשפחת Flash הזולה יותר, הושק ב-18 בספטמבר 2026, ומחירו $0.37 ו-$1.25 למיליון טוקנים.
אז Prime הוא מוצר בצד הפלטפורמה, הבנוי על המשקלים של Z.ai. שני פרטים מצביעים על הפלטפורמה של מי מדובר. הראשון הוא הניסוח "תפוקת פלט של פי 1.5–2", שהוא אותו ניסוח שבו משתמש ספק ענן גדול עבור מצב ההגשה המואץ שלו — מצב שמפעילים על ידי החלפת מזהה המודל, כאשר היכולות ומגבלות השימוש נותרות במפורש ללא שינוי. השני הוא שהרשומה מציינת בדיוק ספק במעלה הזרם אחד מאחורי נקודת הקצה. ספק יחיד מאחורי SKU בדרג המהיר אינו האופן שבו מוגש מודל במשקלים פתוחים; כך נראית פריסה מואצת של הפלטפורמה עצמה מבחוץ.
שום דבר מזה לא הופך את GLM 5.3 Prime למוצר גרוע. זה הופך אותו למוצר עם ספק יחיד, וזו שאלת חוסן שעליך לשאול לפני שאתה מנתב דרכו תעבורת ייצור.
מה שווה טענת המהירות

הנתון של פי 1.5–2 הוא טענת תפוקה הנמדדת בתנאים של הספק עצמו, ותפוקה היא המדד הרגיש ביותר לתנאים האלה. טוקנים פלט לשנייה במטמון חם עם הנחיה קצרה ואשכול סרק אינו המספר שסוכן עם הקשר ארוך רואה. מדידה בלתי תלויה של מודל הבסיס מעמידה את GLM-5.3 על כ-61 טוקני פלט לשנייה ואת GLM-5.3-Flash על כ-46, בקבוצה שבה הממוצע של המחלקה הוא 67 — כך שהמסלול הזול יותר הוא גם האיטי יותר, וזה ההיפך ממה שהשמות מרמזים. אלה חציונים על פני מערכת הערכה מתוקננת, לא שיאים.
יש גם עלות עדינה יותר. ברירת המחדל של מאמץ החשיבה בשני המזהים היא max, שהיא ההגדרה שמייצרת את שרשראות החשיבה הארוכות ביותר. מהירות ופירוט מושכים כאן לכיוונים מנוגדים: שכבה מהירה שמנמקת גם באורך מקסימלי עדיין עלולה להיות איטית מקצה לקצה בבעיה קשה, כי צוואר הבקבוק הוא מספר הטוקנים שהמודל מחליט לייצר, ולא הקצב שבו הוא מייצר אותם. אם עומס העבודה שלך עתיר נימוקים, רד ל-high או low לפני שאתה משלם 2× עבור האצה — רמת המאמץ תשפיע על זמן התגובה שלך יותר מאשר שכבת השירות.
שלוש דרכים לקנות את אותו דגם

GLM-5.3 קיים כעת בשלוש צורות שניתן לרכוש, והן אינן שלושה מודלים:
• GLM-5.3 במחיר $1.40 / $4.40 — כרטיס התעריפים הבסיסי, מלוא היכולת, הגרסה עם משקולות פתוחות שפורסמו ושאותה תוכלו לארח בעצמכם
• GLM 5.3 Prime במחיר $2.80 / $8.80 — אותן משקולות דרך סטאק מואץ, ספק במעלה הזרם אחד, וללא משקולות כלל
• GLM-5.3-FlashX במחיר $0.37 / $1.25 — בכלל לא GLM-5.3, אלא שכבת המהירות במשפחת Flash הזולה יותר, והדרך הזולה ביותר בפער ניכר לקנות השהיה
השורה השלישית היא זו ששווה להסתכל עליה. אם מה שאתם באמת רוצים זה טוקנים מהירים יותר ואתם גמישים לגבי מאיזה GLM תקבלו אותם, FlashX מספק האצה על מודל שכבר עולה בערך עשירית מדגם הדגל, בפחות ממחצית מעלותו של דגם הדגל ללא האצה. Prime מוצדק רק אם יש לכם צורך ספציפי באיכות ההסקה של GLM-5.3 ובקבלתה מוקדם יותר.
איפה זה יושב אצלנו

עלינו להיות ברורים לגבי דבר אחד: OrcaRouter לא מארח את GLM 5.3 Prime, וגם אנחנו לא מארחים את GLM-5.3-FlashX. שני דפי המודלים מחזירים 404 באתר שלנו. אם אתם רוצים את הדרגה המואצת, תצטרכו לקנות אותה מהפלטפורמה שמוכרת אותה, או מה-API של הספק עצמו עבור מודל הבסיס.
מה שאנחנו כן מארחים הוא GLM-5.3 ו-GLM-5.3-Flash, במחיר המחירון של הספק ללא כל תוספת מאיתנו — אותם $1.40 ו-$4.40 שאתם רואים במחירון של Z.ai עצמה, מועברים כמו שהם ולא מתומחרים מחדש. זה חשוב יותר ממה שזה נשמע עבור מודל שהתמחור שלו זז פעמיים בשישה שבועות. מכיוון שאנחנו לא מוסיפים מרווח, שינוי מחיר של ספק נכנס לתוקף אצלנו באותו יום שבו הוא נכנס לתוקף אצלו, בלי מיגרציה או פנייה לתמיכה. שני המזהים יושבים מאחורי מפתח API אחד לצד יותר מ-200 מודלים אחרים, כך ש-A/B בין GLM-5.3 ל-GLM-5.3-Flash הוא שינוי של שורת שם מודל אחת ולא חוזה נוסף, ומעבר אוטומטי לגיבוי מכסה אתכם אם ספק בודד במעלה הזרם נחלש — וזה הסיכון הספציפי שנושא עמו מסלול מהיר של ספק יחיד.
האם עליך לשלם את ה-2×
שלם על זה אם אדם או שירות במעלה הזרם חסום על התגובה, עומס העבודה מוגבל על ידי השהיה ולא על ידי תפוקה, וכבר אישרת שמאמץ החשיבה הוא הגורם האמיתי לשהיה שלך. אל תשלם על זה אם אתה מריץ יצירת אצווה במהלך הלילה, אם נפח העבודה שלך גבוה מספיק כך שפרמיית אסימונים כפולה עולה על זמן השעון שאתה חוסך, או אם קיווית שהדרגה תהיה בשקט מודל טוב יותר. היא לא. זה GLM-5.3 עם שעון עצר פועל, ושעון העצר מחייב לפי האסימון.
המסגור הכנה עבור כל משפחת GLM-5.3 כרגע הוא ש-Z.ai שחררה מודל אחד באוגוסט, והשוק בילה את ספטמבר באריזה מחדש שלו בארבעה מחירים שונים. GLM 5.3 Prime הוא היקר מבין החבילות הללו. הוא גם זה עם שובל התיעוד הדק ביותר, מכיוון שהחברה ששמה מופיע על המשקולות אינה מפרסמת אותו. זו לא סיבה להימנע ממנו. זו סיבה לדעת בדיוק מה אתה קונה לפני שאתה מכניס אותו למסלול ייצור.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
