Zhipu (Z.ai) דגל קוד פתוח MoE: 355B סה"כ / 32B פעיל. חשיבה היברידית (מצבי חשיבה / אי-חשיבה), קריאה מקורית לכלים ומשטח סוכנותי, 128K קונטקסט.
GLM-4.5 היא מודל שפה מבוסס טקסט בלבד של Z.ai, הנגיש דרך ממשק תואם OpenAI של OrcaRouter. הוא מציע חלון הקשר של 128,000 טוקנים ויכול להפיק עד 96,000 טוקנים לבקשה. המודל חזק במיוחד בהיגיון מתמטי, כפי…
GLM-4.5 מצטיין במשימות הכוללות חשיבה מתמטית, הסקה לוגית, ופתרון בעיות שלב אחר שלב. הוא משיג ציון של 97.9 במבחן MATH-500, מה שמעיד על דיוק גבוה במגוון בעיות מתמטיות. מקרי שימוש חזקים נוספים כוללים יצירת קוד והסבר שלו, במיוחד עבור אלגוריתמים וחישובים מתמטיים. חלון ההקשר הגדול (128K טוקנים) הופך אותו למתאים לעיבוד מסמכים ארוכים, כגון מאמרי מחקר, טקסטים משפטיים או מדריכים טכניים. בנוסף, הוא יכול לטפל בשיחות מרובות-סיבוב הכוללות הפניה לחלקים קודמים של השיחה, בתנאי שההיסטוריה כולה נכנסת בגבול 128K.
למשימות פשוטות כמו סיווג ישיר, סיכום טקסטים קצרים או מענה לשאלות בסיסיות, מודל קטן יותר עשוי להיות חסכוני יותר. GLM-4.5 מתומחר ב‑$0.60 למיליון טוקני קלט וב‑$2.20 למיליון טוקני פלט. אם היישום שלך אינו דורש את מלוא ההקשר של 128K או את היכולת המתמטית החזקה, ייתכן שתוכל לחסוך בעלויות על ידי בחירת מודל עם תמחור נמוך יותר לטוקן. כמו כן, עבור יישומים מולטי‑מודאליים (לדוגמה, תיאור תמונות או ניתוח וידאו), GLM-4.5 אינו מתאים מכיוון שהוא מעבד טקסט בלבד. במקרים כאלה, שקול מודלים התומכים בקלט חזותי או אודיו.
כן, GLM-4.5 יכול ליצור קוד, במיוחד לבעיות הכרוכות בחישובים מתמטיים או לוגיקה אלגוריתמית. הציון הגבוה שלו במבחן MATH-500 (97.9) מצביע על מיומנות בהסקת מסקנות על מבנים מספריים והגיוניים, מה שמתבטא בפלט קוד מדויק בשפות כמו Python, Java, או C++. חלון ההקשר הגדול מאפשר למודל לשקול מאגרי קוד מלאים או תיעוד ארוך תוך כדי יצירת קוד. עם זאת, עוצמתו העיקרית היא בהסקת מסקנות ולא במשימות כבדות תחביר. עבור משימות הדורשות ידע מעמיק במסגרות או ספריות ספציפיות, מודל קוד ייעודי עשוי להתאים יותר.
חלון הקשר של 128K אומר ש-GLM-4.5 יכול לעבד עד כ-96,000 מילים (או 128,000 תתי‑מילים) בבקשה אחת. זה מועיל למשימות הכוללות מסמכים ארוכים, שיחות ממושכות, או ניתוח נתונים בהיקף נרחב בתוך הנחיה אחת. המודל יכול לשמור על קוהרנטיות לאורך ההקשר הארוך הזה, דבר שחשוב לסיכום, מענה על שאלות על טקסטים ארוכים, וחשיבה רב‑שלבית. עם זאת, אורך ההקשר האפקטיבי בפועל עשוי להשתנות בהתאם למורכבות התוכן. משתמשים צריכים לבדוק עם מקרי השימוש הספציפיים שלהם כדי להבטיח ביצועים עקביים בקצה העליון של החלון.
MATH-500 הוא מדד השוואתי המורכב מ-500 בעיות מתמטיות המכסות רמות קושי שונות, מחשבון בסיסי ועד שאלות ברמת תחרות מתקדמת. ציון של 97.9 משמעותו ש-GLM-4.5 ענה נכון על 97.9% מהבעיות הללו. זה מצביע על יכולת חשיבה מתמטית חזקה מאוד. המודל ככל הנראה משתמש בחשיבה קפדנית שלב אחר שלב כדי להגיע לתשובות. המשתמשים צריכים לשים לב שהמדד הזה בודק יכולת מתמטית טהורה ואולי לא משקף ביצועים במשימות אחרות כגון כתיבה יצירתית או דיאלוג פתוח. זהו מדד שימושי להערכת מודלים המיועדים ליישומי STEM.
נתוני מהירות ואחזור מדויקים עבור GLM-4.5 אינם מסופקים באופן ציבורי על ידי Z.ai. הביצועים תלויים בגורמים כגון גודל הבקשה, אורך הפלט, תנאי הרשת ועומס השרת. באמצעות OrcaRouter, משתמשים יכולים לצפות לאחזור אופייני עבור מודל בגודל זה. כמודל מבוסס טקסט בלבד עם הקשר של 128K, האחזור עשוי לעלות באופן יחסי לאורך הקלט. זרימה (Streaming) זמינה כדי להפחית את הזמן הנתפס עד לטוקן הראשון. עבור יישומים בזמן אמת, אנו ממליצים לבצע בדיקות עומס עם עומס העבודה האופייני שלכם. התשתית של OrcaRouter מיועדת לגישה אמינה ל-API, אך מדדי מהירות ספציפיים יש למדוד בסביבה שלכם.
החוזק העיקרי של GLM-4.5 הוא חשיבה מתמטית, כפי שהודגם בציון 97.9 ב-MATH-500. הוא גם מטפל ביעילות בהקשרים ארוכים (128K טוקנים), מה שהופך אותו מתאים למשימות ברמת המסמך. המודל יכול ליצור עד 96K טוקנים לפלט, דבר שימושי לתשובות ארוכות או לשרשראות חשיבה רב-שלביות. הוא מתומחר בתחרותיות ביחס לרמת הביצועים שלו. בנוסף, הוא נגיש דרך ה-API התואם ל-OpenAI של OrcaRouter, מה שהופך את האינטגרציה לפשוטה עבור מפתחים שכבר מכירים את האקוסיסטם הזה. המודל הוא טקסט בלבד, מה שמפשט את הפריסה כאשר אין צורך בראייה או שמע.
GLM-4.5 אינו תומך באף אופני קלט מלבד טקסט. הוא אינו יכול לעבד תמונות, אודיו או וידאו. נתוני האימון והעיצוב שלו מתמקדים בהיגיון ובמתמטיקה; הוא עשוי להפגין ביצועים נמוכים במשימות יצירתיות או סובייקטיביות בהשוואה למודלים רב-תכליתיים. מדד MATH-500, על אף שהוא מרשים, הוא הערכה מצומצמת: ביצועי המודל במדדים אחרים (למשל, קידוד, לוגיקה, עובדתיות) אינם מסופקים. בנוסף, כמו כל מודלי השפה הגדולים, הוא עלול להפיק שגיאות או הזיות, במיוחד בקלטים עמומים או חריגים. משתמשים צריכים לאמת פלטים עבור יישומים קריטיים. חלון ההקשר הגדול עלול להגדיל את השהייה והעלות עבור הנחיות ארוכות מאוד.
GLM-4.5 מתומחר ב-$0.60 למיליון טוקנים בקלט ו-$2.20 למיליון טוקנים בפלט. זהו תעריף הספק מ-Z.ai, ו-OrcaRouter אינה מוסיפה שום תוספת תמחור. החיוב מבוסס על שימוש: משלמים רק על הטוקנים שנצרכו. טוקני קלט כוללים את ההנחיה (prompt) וכל הודעות מערכת; טוקני פלט נוצרים על ידי המודל. טוקן הוא בערך 0.75 מילים באנגלית. עבור בקשה טיפוסית עם 10,000 טוקני קלט ו-5,000 טוקני פלט, העלות תהיה (0.60 * 0.01) + (2.20 * 0.005) = $0.006 + $0.011 = $0.017. תמחור שקוף זה מאפשר הערכת עלות קלה.
בהתחשב במבנה התמחור שלו, GLM-4.5 הוא החסכוני ביותר עבור יישומים שנהנים מהיכולות הגבוהות שלו בהיגיון מתמטי ומהקשר הארוך. עבור משימות פשוטות, דגמים זולים יותר עשויים להספיק, ובכך להפחית עלויות תפעול. חלון ההקשר של 128K מגדיל את השימוש בטוקנים לכל בקשה, מה שיכול להעלות עלויות אם לא מיועל. לניהול הוצאות, שקלו לקצר פרומפטים לאורך הנדרש ולהשתמש במגבלות אורך פלט. כמו כן, מכיוון ש-OrcaRouter אינו גובה תוספת מחיר, העלות משקפת באופן קרוב את תמחור הספק. שימוש במטמון יכול להפחית עוד יותר עלויות אם אתם עושים שימוש חוזר בקטעי פרומפט נפוצים, אך מדיניות המטמון הספציפית תלויה בהטמעה שלכם עם OrcaRouter.
אורקה-ראוטר (OrcaRouter) אינו מציע באופן טבעי שמירה במטמון (caching) עבור בקשות GLM-4.5. שמירה במטמון מיושמת בדרך כלל בצד הלקוח. לדוגמה, תוכל לאחסן תגובות להנחיות זהות כדי להימנע מחיוב חוזר. לחלופין, תוכל לתכנן את היישום שלך כך שיעשה שימוש חוזר בהקשר במידת האפשר. מכיוון ש-GLM-4.5 מחויב לפי אסימון (per token), שמירה במטמון יכולה להפחית משמעותית עלויות עבור יישומים עם נפח בקשות גבוה, במיוחד אם בקשות רבות חולקות תחיליות דומות (למשל, הוראות מערכת). אם אתה זקוק לשמירה במטמון בצד השרת, שקול להשתמש בתכונות האצווה (batch) או שמירה במטמון של הנחיות (prompt caching) של OrcaRouter, אם קיימות — בדוק את התיעוד שלהם לפרטים.
GLM-4.5 תומכת בעד 96,000 אסימוני פלט לבקשה. זה גבוה באופן חריג ועלול להוביל לעלויות גבוהות יותר לבקשה אם תיצרו תשובות ארוכות. לדוגמה, יצירת 96,000 אסימוני פלט תעלה 96,000/1,000,000 * $2.20 = $0.2112 לבקשה. למרות שהדבר מאפשר יצירה ארוכה מאוד, עשוי להיות חסכוני יותר להגביל את אורך הפלט באמצעות הפרמטר 'max_tokens' אלא אם המשימה דורשת פלטים ארוכים באמת. משתמשים המודעים לתקציב צריכים להגדיר מגבלות מתאימות. ספירת אסימוני הקלט והפלט מסוכמת ומחויבת בנפרד לפי התעריפים המתאימים להם.
אתה ניגש ל-GLM-4.5 דרך ה-API התואם ל-OpenAI של OrcaRouter. הגדר את ה-URL הבסיסי ל-https://api.orcarouter.ai/v1. השתמש במזהה המודל "z-ai/glm-4.5" בבקשות שלך. ה-API מקבל פרמטרים סטנדרטיים של OpenAI כגון 'prompt', 'max_tokens', 'temperature' וכו'. לדוגמה, קריאת השלמת צ'אט תשתמש בנקודת הקצה /v1/chat/completions. אימות דורש מפתח API מ-OrcaRouter. ה-API מתנהג כמו ה-API של OpenAI, כך שניתן להעביר קוד קיים בקלות על ידי שינוי ה-URL הבסיסי ושם המודל. עיין בתיעוד של OrcaRouter לפרטי אימות.
פרמטרים נפוצים כוללים: 'model' (מוגדר ל-"z-ai/glm-4.5"), 'messages' (רשימת מילונים עם role ו-content), 'max_tokens' (עד 96000), 'temperature' (שולט באקראיות, ברירת מחדל לא מוגדרת), 'top_p' (דגימה גרעינית), 'stream' (בוליאני), ו-'stop' (רצפים שבהם הפקודה נעצרת). GLM-4.5 תומך בפורמט התקשורת של OpenAI ל-chat completion. לא כל הפרמטרים המתקדמים (כמו logprobs או tool calls) נתמכים; בדקו את השימוש שלכם. אם עליכם להגדיר קנסות תדירות או נוכחות, עיינו בתיעוד של OrcaRouter לבדיקת תאימות. המודל מקבל הודעות מערכת לקביעת התנהגות.
המעבר הוא פשוט. עדכן את כתובת ה-URL הבסיסית בקוד שלך ל-https://api.orcarouter.ai/v1 והחלף את שם המודל ב-"z-ai/glm-4.5". ודא שיש לך מפתח API תקף של OrcaRouter. פורמטי הבקשה והתגובה זהים לאלו של OpenAI. אין צורך בשינויים במבנה ה-prompt או הפרמטרים, אלא אם השתמשת בתכונות ייחודיות למודל שאינן נתמכות על ידי OrcaRouter. בדוק עם קבוצה קטנה כדי לאשר את ההתנהגות. אם השתמשת ב-streaming, אותו endpoint streaming עובד. התיעוד של OrcaRouter מספק שלבי פתרון בעיות לבעיות נפוצות.
מגבלות קצב ומכסות שימוש עבור GLM-4.5 נקבעות על‑ידי OrcaRouter לפי רמת החשבון שלך. מגבלות קצב אופייניות נמדדות בבקשות לדקה (RPM) ובטוקנים לדקה (TPM). לשימוש בנפח גבוה, ייתכן שתצטרך לבקש מגבלה גבוהה יותר. ה‑API של OrcaRouter מחזיר קודי מצב HTTP סטנדרטיים (למשל, 429 לקצב מוגבל). מומלץ ליישם המתנה אקספוננציאלית (exponential backoff) בלקוח שלך. אין מידע על מכסות קפדניות במידע שסופק; צור קשר עם תמיכת OrcaRouter לקבלת מגבלות ספציפיות. חלון ההקשר (context window) ואורך הפלט (output length) של המודל הם מגבלות לבקשה בודדת, ולא נאכפות מעת לעת.
GLM-4.5 השיג ציון של 97.9 ב-MATH-500, מה שמציב אותו בין המובילים בתחום ההיגיון המתמטי. מודלים רבים מקבלים ציונים בשנות ה-80 או בתחילת שנות ה-90 במדד זה, כך ש-97.9 הוא גבוה במיוחד. עם זאת, השוואה זו מוגבלת למדד יחיד בלבד. במדדים אחרים (כגון הבנת שפה כללית, תכנות) הביצועים עשויים להיות שונים. GLM-4.5 הוא מודל טקסט בלבד, בעוד שחלק מהמתחרים תומכים בראייה. חלון ההקשר שלו (128K) גדול יותר ממודלים רבים המציעים 32K או 64K. התמחור תחרותי עבור הרמה שלו. משתמשים המתמקדים במתמטיקה עשויים להעדיף את GLM-4.5, אך כדאי להעריך אותו במשימות הספציפיות שלהם.
למודלים זולים יותר עשויים להיות חלונות הקשר קטנים יותר (למשל, 4K-8K) וציוני מדד נמוכים יותר. אם המשימות שלך פשוטות ודורשות השהייה נמוכה, מודל זול יותר יכול להיות חסכוני יותר. לדוגמה, מודל במחיר של $0.15/$0.60 לכל 1M אסימונים עשוי להספיק לתקצור בסיסי. היתרון של GLM-4.5 טמון בחשיבה המתמטית החזקה שלו ובהקשר הארוך. הפשרה היא עלות גבוהה יותר לכל אסימון. עליך לחשב את העלות הכוללת עבור דפוס השימוש האופייני שלך. אם היישום שלך דורש חשיבה מתמטית מדויקת או מסמכים ארוכים, העלות הגבוהה יותר עשויה להיות מוצדקת.
מספר ספקים מציעים מודלים עם חלונות הקשר דומים. התמחור של GLM-4.5 ($0.60/$2.20) נמצא בטווח הבינוני-מתון. ייתכן שחלק מהמודלים עם הקשר של 128K יהיו זולים יותר לטוקן אך בעלי ציוני מתמטיקה נמוכים יותר. אחרים עשויים להיות יקרים יותר. ציון MATH-500 של GLM-4.5, שהוא 97.9, גבוה במיוחד. אף אחת מהעובדות שסופקו אינה מזכירה ציוני ביצועים אחרים, כך שלא ניתן לבצע השוואה מלאה. עבור משתמשים הזקוקים לביצועי מתמטיקה גבוהים והקשר ארוך, GLM-4.5 הוא מועמד חזק. עם זאת, עבור כתיבה יצירתית או גיוון, מודלים אחרים עשויים להיות עדיפים. תמיד מומלץ לבדוק עם הנתונים הספציפיים שלכם.
OrcaRouter מספק API אחיד תואם-OpenAI לגישה ל-GLM-4.5 ללא ניהול תשתית. התמחור שקוף, ללא תוספת על תעריפי הספק. אתה מקבל את אותו המודל המאוחסן על ידי Z.ai, אך דרך השער של OrcaRouter שעשוי להציע תכונות נוספות כמו איזון עומסים, שמירה במטמון או אפשרויות גיבוי (בדוק את התיעוד של OrcaRouter). ה-API סטנדרטי, כך שהעברה לדגמים אחרים בקטלוג היא קלה. OrcaRouter מטפל באימות ובמגבלות קצב. אם אתה כבר משתמש בדגמים אחרים ב-OrcaRouter, הוספת GLM-4.5 היא רק שינוי של שם הדגם.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-4.5",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)do_sampleinclude_reasoningmax_tokensreasoningrequest_idresponse_formatstopstreamtemperaturethinkingtool_choicetool_streamtoolstop_puser_id| קלט / 1M טוקנים | $0.600 |
| פלט / 1M tokens | $2.20 |
| קריאת מטמון / 1M | $0.110 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
על מה מפתחים מדברים השבוע
@misc{orcarouter_glm_4_5,
title = {GLM 4.5 API},
author = {Z.ai},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-4.5}
}Z.ai. (2025). GLM 4.5 API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-4.5