דגל Zhipu מהדור הבא עם מצבי חשיבה מרובים וקריאת כלים חזקה. 200K הקשר / 128K פלט מקסימלי.
GLM 5 הוא מודל טקסט שפותח על ידי Z.ai, וניתן לגישה דרך ממשק ה-API התואם ל-OpenAI של OrcaRouter. הוא מקבל תשומות טקסט ומציע חלון הקשר של 200,000 טוקנים עם פלט מקסימלי של 128,000 טוקנים. המודל מתומחר…
GLM 5 תומך בקלט טקסט בלבד. לפי המפרט שסופק, הוא אינו מקבל תמונות, אודיו או וידאו. זה הופך אותו למודל שפה טהור המותאם לעיבוד תוכן כתוב. כל התקשורת עם המודל מתבצעת באמצעות טוקנים טקסטואליים, והפלט הוא גם טקסט. אם היישום שלך דורש קלט רב-מודאלי, תצטרך להשתמש במודל אחר המטפל בתמונות או במצבים אחרים. עבור משימות כמו תמצות אודיו מתומלל או חילוץ טקסט מתמונות, תצטרך להמיר את הקלטים הללו לטקסט לפני העברתם ל-GLM 5.
GLM 5 מצטיינת במשימות שנהנות מחלון ההקשר הרחב שלה ומגבלת הפלט הגבוהה. מקרי שימוש נפוצים כוללים: ניתוח מעמיק של חוזים משפטיים ארוכים או מסמכי רגולציה; הפקת סיכומים מפורטים של מאמרי מחקר שלמים או ספרים; שמירה על היסטוריית שיחה קוהרנטית בצ'אטבוטים לתמיכת לקוחות לאורך עשרות תורות; וביצוע חשיבה מורכבת שבה המודל צריך להתייחס למספר קטעים של פרומפט ארוך. הציון τ²-Bench של 98.2 מרמז שהוא חזק במיוחד בביצוע משימות מרובות-שלבים בסביבות מדומות, כגון ניווט באתרי אינטרנט או ביצוע הזנת נתונים.
אם המשימה שלך אינה דורשת את מלוא ה-200K קונטקסט או פלט של 128K, ייתכן שמודל קטן או זול יותר יהיה חסכוני יותר. לדוגמה, שאלות ותשובות פשוטות, סיווג טקסט קצר, או יצירת פסקה בודדת יכולים להיות מטופלים על ידי מודלים שעולים פחות לכל טוקן. התמחור של GLM 5 הוא $1.00 למיליון טוקני קלט ו-$3.20 למיליון טוקני פלט, שהוא גבוה יותר ממודלים קומפקטיים רבים. בנוסף, אם זרימת העבודה שלך כוללת הנחיות ותגובות קצרות מאוד, ייתכן שהשהות והעלות של הקמת מודל עם קונטקסט רחב אינן מוצדקות. הערך את השימוש האופייני שלך בטוקנים: אם אתה משתמש באופן עקבי בפחות מ-32K טוקנים, ככל הנראה מודל קטן יותר יספיק.
GLM 5 נגיש דרך ה-API התואם ל-OpenAI של OrcaRouter, התומך בתגובות סטרימינג ובקריאה לפונקציות. בעת שימוש ב-API, ניתן להגדיר את פרמטר stream כ-true כדי לקבל טוקנים באופן מצטבר, מה שמפחית את זמן ההמתנה הנתפס עבור פלטים ארוכים. קריאה לפונקציות מאפשרת למודל לבקש הפעלות של כלים או פלט נתונים מובנה. יכולות אלה הן סטנדרטיות עבור ה-API אך תלויות בתמיכה של המודל הספציפי. על סמך המידע שסופק, ניתן להשתמש ב-GLM 5 עם תכונות אלה. לפרטי יישום, עיין בתיעוד ה-API של OrcaRouter.
τ²-Bench הוא מדד שבוחן את יכולתו של סוכן AI להשלים משימות רב-שלביות בסביבה מדומה. הציונים מייצגים את שיעור ההצלחה במגוון רחב של משימות, כגון ניווט באינטרנט, מילוי טפסים ואחזור מידע. ציון של 98.2 פירושו ש-GLM 5 השלים 98.2% ממשימות המדד בהצלחה. זהו ביצועים גבוהים מאוד, המצביעים על כך שהמודל יכול לעקוב אחר הוראות מורכבות ולבצע רצפי פעולות באופן אמין. זה לא מבטיח ביצועים מושלמים בעולם האמיתי, אבל זה מצביע על יכולות סוכן חזקות עבור סוגים דומים של משימות מובנות.
הזמן השהייה עבור GLM 5 תלוי באורך הקלט והפלט, כמו גם בתשתית הבסיסית המסופקת על ידי Z.ai. OrcaRouter מנתב אל הקצה האחורי של הספק ואינו מוסיף השהייה נוספת מעבר לתקורה של הרשת. עבור קלטים ופלטים קצרים (לדוגמה, 1,000 טוקנים בקלט, 500 טוקנים בפלט), זמני התגובה עשויים להיות בטווח של מספר שניות. עבור יצירות ארוכות קרוב למקסימום 128K, ההשהייה יכולה להיות גבוהה משמעותית—לעיתים עשרות שניות או יותר—מכיוון שהמודל חייב לעבד וליצור טוקנים רבים. סטרימינג יכול להקל על זמני ההמתנה הנתפסים. אין נתוני השהייה ספציפיים שסופקו, ולכן יש לבדוק את הביצועים בפועל עם עומסי עבודה מייצגים.
היתרון העיקרי שהבולט במדד הכותרת הוא שיעור ההצלחה הגבוה של GLM 5 במשימות סוכן. ציון τ²-Bench של 98.2 מצביע על כך שהוא יכול להתמודד ביעילות עם נימוקים מרובי-שלבים ושימוש בכלים. בנוסף, חלון ההקשר הגדול שלו (200K טוקנים) ותפוקת המקסימום (128K טוקנים) משמעם שהוא יכול לשמור על קוהרנטיות במשך טקסטים ארוכים מאוד, וזהו שיפור משמעותי לעומת דגמים עם חלונות קטנים יותר. לא מסופקים ציוני מדד נוספים, כך שהשוואות ישירות במשימות כמו הבנת שפה או מתמטיקה אינן זמינות מנתונים אלו. סביר להניח שהמודל נהנה ממתודולוגיית האימון של Z.ai ומהגדלה בקנה מידה.
GLM 5 הוא מודל מבוסס טקסט בלבד, ולכן אינו יכול לעבד תמונות או מודאליטויות אחרות. ביצועיו במשימות הדורשות הבנה רב-מודאלית הם אפס. ציון ה-τ²-Bench, אף שהוא גבוה, נמדד בסביבה מדומה; ביצועי סוכן בעולם האמיתי עשויים להשתנות. העלות של המודל לטוקן היא גבוהה יחסית ($1.00 קלט / $3.20 פלט למיליון טוקנים), כך שעבור הקשרים ארוכים העלות הכוללת יכולה להצטבר במהירות. לא מסופק מידע על אחזור תחת עומס, ולכן עליך לבצע בקרת ביצועים עם מקרה השימוש הספציפי שלך. כמו כן, כמו כל מודלי השפה, GLM 5 עלול לייצר תוכן שגוי או הזוי, במיוחד בתרחישי נימוק מורכבים מחוץ להתפלגות האימון שלו.
GLM 5 מתומחר ב-$1.00 לכל מיליון אסימוני קלט ו-$3.20 לכל מיליון אסימוני פלט. אלו הם תעריפי הספק שנקבעו על ידי Z.ai. OrcaRouter מעביר תעריפים אלה ללא תוספת מחיר, כך שאתה משלם בדיוק את מחיר הספק. אסימונים נספרים בשיטת הטוקניזציה הסטנדרטית (כ-0.75 מילים לאסימון עבור אנגלית). אסימוני קלט כוללים את ההנחיה וכל הודעות מערכת; אסימוני פלט הם התגובה שנוצרה על ידי המודל. אין חיובים נפרדים עבור קריאות API או תכונות מיוחדות אלא אם כן צוין על ידי הספק. התמחור הוא לפי אסימון, כך שהעלות גדלה באופן ליניארי עם השימוש.
מכיוון ש-GLM 5 גובה תשלום לפי אסימון (טוקן), העלות הכוללת תלויה באורך ההנחיה (פרומפט) ובאורך הפלט. באינטראקציה טיפוסית עם 10,000 אסימוני קלט ו-5,000 אסימוני פלט, העלות תהיה (10,000/1,000,000)*$1.00 + (5,000/1,000,000)*$3.20 = $0.01 + $0.016 = $0.026 לקריאה. עבור משימות שמשתמשות בהקשר המלא, כמו 200,000 אסימוני קלט ו-128,000 אסימוני פלט, העלות תהיה $0.20 + $0.4096 = $0.6096 לקריאה. אם מקרה השימוש שלך אינו דורש קיצוניות כזו, מודל זול יותר עם הקשר קטן יותר עשוי להיות חסכוני יותר. OrcaRouter מאפשר לך להשוות עלויות בין מודלים לפני הפריסה.
המידע שסופק אינו מזכיר מטמון או הנחות כמות עבור GLM 5 דרך OrcaRouter. התמחור מחויב לפי אסימון בשיעור הספק הסטנדרטי. אם אתה זקוק לחיסכון בעלויות עבור שימוש בנפח גבוה, שקול אם מודל אחר או פריסה ייעודית עשויים להיות מועילים. מדיניות אפס תוספת המחיר של OrcaRouter פירושה שאתה משלם את אותו המחיר כאילו התקשרת ישירות ל-Z.ai, ללא דמי פלטפורמה. להסדרי הנחה ספציפיים, תצטרך לנהל משא ומתן עם Z.ai או לבדוק אם יש מבצעים. כברירת מחדל, מטמון אינו מתואר, לכן הנח שכל הסקה מחויבת בנפרד.
כדי להשתמש ב-GLM 5, שלח בקשות לנקודת הקצה של OrcaRouter התואמת ל-API של OpenAI. הגדר את כתובת ה-base URL ל- https://api.orcarouter.ai/v1. בגוף הבקשה שלך, ציין את מזהה המודל כ-"z-ai/glm-5". ניתן להשתמש בכל SDK של OpenAI או בכל לקוח HTTP התומך בנקודת הקצה של chat completions. דוגמה באמצעות Python: import openai; client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your_key"); client.chat.completions.create(model="z-ai/glm-5", messages=[{"role":"user","content":"Hello"}]). התמיכה ב-streaming, function calling ובפרמטרים אחרים תואמת לסכימת OpenAI.
GLM 5 תומך בכל הפרמטרים הסטנדרטיים של פורמט ה-chat completions של OpenAI. ניתן להגדיר temperature (0-2), top_p, max_tokens (עד 128,000), stop sequences, frequency_penalty, presence_penalty, stream (בוליאני), ו-tools/functions עבור קריאות לפונקציות. מגבלת חלון ההקשר היא 200,000 אסימונים בסך הכל, הכוללת הן הודעות והן כל prompt מערכת. אם הקלט חורג מכך, עליך לקצר או לפצל את ההקשר. OrcaRouter אינו מקצר אוטומטית; הבקשה תיכשל אם מספר האסימונים יעלה על המגבלה. השתמש בספירה של הטוקנייזר כדי להבטיח עמידה בדרישות.
המעבר ל-OrcaRouter כרוך בשינוי כתובת ה-URL הבסיסית ומזהה המודל. אם בעבר השתמשת בנקודת קצה של OpenAI עם המודל "gpt-4o", תחליף את כתובת ה-URL הבסיסית ל-https://api.orcarouter.ai/v1 ותקבע את המודל ל-"z-ai/glm-5". אין צורך בשינויים נוספים בקוד אם אתה כבר משתמש בתבנית השלמות הצ'אט של OpenAI. ודא שמפתח ה-API שלך תקף עבור OrcaRouter. בדוק עם בקשה קטנה כדי לאמת את הקישוריות ושהמודל מגיב כמצופה. שים לב שספירת האסימונים עשויה להיות שונה במקצת בשל טוקנייזרים ספציפיים למודל, אך ה-API מטפל בכך באופן שקוף.
אם ספירת ה-tokens המשולבת של הקלט שלך (הודעות מערכת, היסטוריית שיחה, הנחיית משתמש) עולה על 200,000 tokens, ה-API יחזיר שגיאה המציינת שאורך ההקשר חרג. עליך להקטין את גודל הקלט. באופן דומה, אם תגדיר max_tokens מעל 128,000, הבקשה תוגבל לתפוקה המקסימלית של המודל; ה-API ידחה את הפרמטר או יקצץ אותו לגבול. עדיף לבדוק את ספירת ה-tokens באופן פרוגרמטי לפני שליחת מטענים גדולים. OrcaRouter אינו מקצץ אוטומטית הנחיות, לכן עליך לנהל את אורך ההקשר בעצמך.
חלון ההקשר של GLM 5 הכולל 200,000 טוקנים ותפוקה מקסימלית של 128,000 טוקנים הוא מהגדולים הזמינים. נתון זה מציב אותו בטובה לעומת מודלים סגורים רבים המציעים הקשרים של 128K או 32K. הציון שלו במדד τ²-Bench העומד על 98.2 הוא גבוה, מה שמעיד על ביצועים אג'נטיים חזקים. עם זאת, התמחור גבוה יותר מזה של ספקים חלופיים מסוימים; לדוגמה, מודל בעל קיבולת טוקנים דומה אך עלות נמוכה יותר לטוקן עשוי להיות חסכוני יותר לשימוש כבד. GLM 5 הוא מבוסס טקסט בלבד, בעוד שחלק מהמתחרים תומכים בקלטים רב-מודליים. ללא נתוני מדד נוספים מהעובדות שסופקו, לא ניתן לבצע השוואות איכות ישירות במשימות NLP.
ייתכן שתבחר ב-GLM 5 אם אתה זקוק לחלון הקשר גדול יותר מאשר המודלים הסטנדרטיים של OpenAI (שבדרך כלל הם 128K טוקנים). GLM 5 מציע הקשר של 200K ופלט של 128K, מה שיכול להכיל קלטים ארוכים יותר ללא קיצוץ. בנוסף, ציון ה-τ²-Bench של 98.2 עשוי להיות גבוה יותר מכמה מודלים של OpenAI במבחני סוכנות, אם כי השוואות מדויקות תלויות בתנאי ההערכה. אם עלות היא דאגה עיקרית, השווה מחירים לטוקן; GLM 5 ב-$1.00/$3.20 למיליון טוקנים עשוי להיות תחרותי בהתאם לחלופה. כמו כן, אם אתה מעדיף להשתמש במודל של Z.ai עבור מאפייני ביצועים ספציפיים, GLM 5 הוא בחירה.
בהשוואה לדגמי GLM קודמים (כמו GLM 4), GLM 5 מגדיל את חלון ההקשר מ-128K ל-200K טוקנים ואת התפוקה המקסימלית מ-64K ל-128K טוקנים. ציון ה-τ²-Bench של 98.2 הוא ככל הנראה שיפור, אם כי ציוני הדגמים הישנים יותר לא סופקו. ייתכן שהתמחור השתנה; דגמים ישנים יותר עשויים להיות זולים יותר לטוקן. אם המשימות שלכם מתאימות להקשר הקטן יותר של דגם ישן, שימוש בדגם בעלות נמוכה יותר עשוי להיות כלכלי יותר. עם זאת, עבור משימות הדורשות את מלוא ההקשר של 200K או תפוקה גבוהה יותר, GLM 5 היא האפשרות היחידה בסדרה. שדרוג עשוי גם להביא לשיפורי איכות בחשיבה ובביצוע הוראות.
בהתבסס על המידע שנמסר, GLM 5 משיג ציון של 98.2 ב-τ²-Bench, שהוא כמעט מושלם במדד זה. זה מצביע על כך שהוא חזק מאוד עבור משימות סוכנות הדומות לאלו שבמדד. עם זאת, ציוני מדד אינם מבטיחים ביצועים בעולם האמיתי, ומודלים אחרים עשויים לפעול בצורה שונה בסביבה הספציפית שלך. אם המשימות הסוכנות שלך תואמות באופן הדוק לתרחיש של τ²-Bench, GLM 5 הוא מועמד מצוין. אבל אם המשימות שלך כוללות כלים, שפות או אילוצים שונים, עליך לבדוק מספר מודלים. OrcaRouter מאפשרת לך לעבור בקלות בין מודלים כדי להשוות תוצאות.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-5",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)do_sampleinclude_reasoningmax_tokensreasoningrequest_idresponse_formatstopstreamtemperaturethinkingtool_choicetool_streamtoolstop_puser_id| קלט / 1M טוקנים | $1.00 |
| פלט / 1M tokens | $3.20 |
| קריאת מטמון / 1M | $0.260 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
על מה מפתחים מדברים השבוע
@misc{orcarouter_glm_5,
title = {GLM 5 API},
author = {Z.ai},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-5}
}Z.ai. (2026). GLM 5 API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-5