כרטיס כותרת ראשי שנוצר עם הכיתוב 'LongCat-2.5-Preview vs GLM-5.2', עם שורת הכותרת העליונה 'אותו חלון של 1M, רק שאחד מהם נמדד', ושתי פאנלים: 'LongCat-2.5-Preview: חלון הקשר של 1M, $0.30 / $1.20 לכל 1M, לא פורסם בנצ'מרק' ו-'GLM-5.2: חלון הקשר של 1M, AA Long-Context Recall 78.33'. לוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

LongCat-2.5-Preview מול GLM-5.2: שני חלונות של 1M טוקנים, אחד מהם נמדד

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

LongCat-2.5-Preview ו-GLM-5.2נושאים את אותו מספר כותרת: חלון הקשר של מיליון טוקנים. צירוף המקרים היחיד הזה עושה את כל העבודה ברוב ההשוואות שנכתבות השבוע, וזה לא מספיק כדי להשוות שני מודלים. GLM-5.2 מתועד מאז 16 ביוני 2026 עם פרופיל בנצ'מרק ציבורי, מחירון מפורסם וציון ריקול להקשר ארוך ממעריך בלתי תלוי. LongCat-2.5-Preview הופיע בפלטפורמת LongCat API של Meituan ב-25 בספטמבר 2026 עם מחירון מוזל, מספר פרמטרים שדווח בסיקור מסחרי סיני, וללא בנצ'מרק מפורסם מכל סוג. חלון אחד נמדד. האחר מוצהר. כל מה שלהלן מפריד בין שתי הקטגוריות האלה, מפני שגיליון מפרט ותוצאת בדיקה אינם אותו סוג של עובדה.

זו הגרסה הכנה של המאצ'אפ, והיא שימושית יותר מזו המחמיאה.

מה שכל צד פרסם בפועל

יומן השינויים של Meituan מכיל רשומה מתוארכת — "גרסה: 2026-09-25, LongCat-2.5-Preview זמין כעת" — המפרטת שלוש יכולות נטענות: הבנת תמונות, קידוד, ותאימות עם "Claude Code וסביבות פיתוח מיינסטרים אחרות", תוך ציון Hermes, OpenClaw, OpenCode ו-Kilo Code. דף התמחור של הספק מציין תעריף תשלום לפי שימוש של $0.30 למיליון טוקני קלט ללא מטמון, $0.006 למיליון טוקני קלט עם מטמון ו-$1.20 למיליון טוקני פלט, כשהוא מסומן בדף עצמו כהנחה לזמן מוגבל. חלון ההקשר הוא מיליון טוקנים והפלט המקסימלי הוא 131,072. בערך 1.6 טריליון פרמטרים בסך הכל, עם כ-48 מיליארד פעילים לכל טוקן, על בסיס mixture-of-experts, מגיעים ממטא-נתונים של האתר של Meituan עצמה ומסיקור סחר סיני של הרישום — לא מתיעוד ה-API. שום דוח טכני, כרטיס מודל או טבלת בנצ'מרק לא ליוו את זה. אין מאגר LongCat-2.5-Preview ב-HuggingFace ואין מאגר בשם זה בארגון ה-GitHub של Meituan; המטא-נתונים של קטלוג המודלים שמגיעים עם OpenCode רושמים open weights כ-false.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

GLM-5.2 של Z.ai נמצא בעמדה ההפוכה. זוהי מהדורה מיוני עם מחירון שאנו מציעים במחיר המחירון: $1.40 למיליון טוקני קלט, $0.26 למיליון טוקני קלט במטמון ו-$4.40 למיליון טוקני פלט בקטלוג שלנו, עם חלון הקשר של 1,000,000 טוקנים ו-128,000 טוקנים של פלט מקסימלי. הציונים שפורסמו עבורו מגיעים משני מקומות שונים, וההבחנה הזו חשובה: המספרים של Z.ai עצמה עבור AIME 2026, HMMT פברואר 2026, GPQA-Diamond וחבילת FrontierSWE הם דיווחי ספק; נתוני Coding Index ו-Intelligence Index שהקטלוג שלנו מציג מקורם ב-Artificial Analysis, שמפעילה הערכות משלה.

המימד היחיד שבו הם באמת שווים

שני המודלים טוענים בדיוק ל-1,000,000 טוקנים של הקשר. רק לאחד מהם יש ציון מפורסם שבוחן אם מודל עדיין יכול להשתמש במה שיש שם. Artificial Analysis רושמת נתון ריקול הקשר ארוך של 78.33 עבור GLM-5.2. ל-LongCat-2.5-Preview אין מספר מקביל, מאף אחד. האסימטריה הזו היא כל ההתמודדות בשורה אחת: חלון של מיליון טוקנים הוא הצהרה על הקיבולת של הארכיטקטורה, לא על האם המודל שולף נכון בטוקן 900,000. קיבולת היא זולה להדפיס ויקרה לאמת, ולכן כל ספק מדפיס אותה וכמעט אף אחד מהם לא מפרסם את מבחן הריקול.

אז אם עבודה עם הקשר ארוך היא מה שאתם בוחרים בין שני אלה בשבילו, אתם בוחרים בין אפשרות אחת עם ציון recall מפורסם ואחת בלי — וזו שבלי היא גם זו עם פרופיל הבנצ'מרק שלא נמדד. זו לא טענה נגדה. זו טענה נגד ההתייחסות לשניים כאל ניתנים להחלפה על סמך מספר שלם תואם.

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

איך נראה פער המחירים בעבודה אמיתית

כרטיסי התעריפים אינם קרובים זה לזה, והכיוון אינו זה שאנשים מצפים לו ממתחרה סיני עם משקולות פתוחות מול מעבדת חזית מערבית. LongCat-2.5-Preview זול בערך פי 4.7 בקלט ללא מטמון ובפי 3.7 בפלט מ-GLM-5.2 — יחס שהוא אריתמטיקה על שני הכרטיסים שפורסמו, לא מדידה. בהרצת עיבוד מסמך של 500,000 טוקנים שמחזירה 20,000 טוקנים, מדובר בכ-17 סנט לעומת כ-79 סנט. שני המודלים צריכים לקרוא את אותו מסמך. רק לאחד מהם יש ציון מפורסם לשאלה אם הוא עדיין יקדיש תשומת לב בסופו.

ישנה הסתייגות שנייה ששייכת לאותה נשימה: Meituan מכנה את מחירון התעריפים שלה הנחה לזמן מוגבל. הסכום של $0.30 הוא המספר הפרומוציוני, והספק אינו אומר מה בא אחריו. מודל עלויות שנבנה על מחיר פרומוציוני נושא תאריך תפוגה שאי אפשר לקרוא. זו סיבה לשמור על מעבר בין ספקים בזול, ולא סיבה להימנע מהמודל.

ב-OrcaRouter, הנתיבים שאנו מגישים נמצאים מאחורי מפתח אחד במחיר המחירון של הספק עם אפס תוספת, כך ששינוי מחיר מצד ספק מגיע לחשבון שלכם באותו יום ולא בחידוש הבא, ומעבר אוטומטי בין ספקים מעביר בקשה שנפגעה לספק בריא בלי שהאפליקציה שלכם תדע. GLM-5.2 הוא אחד הנתיבים שלנו. LongCat-2.5-Preview אינו כזה — איננו מספקים אותו, ואין לקרוא דבר כאן כטענה אחרת. Z.ai גם התקדמה מאז יוני: GLM-5.3 פעיל בקטלוג שלנו נכון ל-18 באוגוסט 2026, כך שהשוואה שמנוסחת כ"מודל חדש מול המודל הנוכחי" כבר מציגה את GLM-5.2 כמודל המכהן ולא כחוד החנית.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

מה יפתור את זה, ומה לא

• ציון Long-Context Recall עבור LongCat-2.5-Preview, מ-Meituan או מגורם מעריך עצמאי. עד שדבר כזה יהיה קיים, חלון ה-1M שלו הוא טענה בלי בדיקה מצורפת, וה-78.33 של GLM-5.2 הוא המספר היחיד בהשוואה שמתייחס לאותה שאלה.

• כרטיס תעריפים של ספק ללא סימון של זמן מוגבל. המחיר המוזל אומר לך מה עולה המודל במהלך מבצע, לא מה הוא עולה.

• טבלת בנצ'מרק מכל סוג. לא מיקום בלוח מובילים — אלא פשוט ריצת הערכה שפורסמה, כך שההשוואה תפסיק להיות גיליון מפרט מול דף תוצאות.

• אישור קלט תמונה. ה-changelog מציג את הבנת התמונות כתוספת עיקרית, אך תגובת הדוגמה בתיעוד "Retrieve Model" של Meituan עצמה עדיין מציגה את input_modalities כ-["text"] עם מחרוזת מודאליות text->text. ייתכן שדוגמה זו פשוט מיושנת. עם זאת, זהו החוזה המפורסם של הספק, ולכן יש להתייחס לקלט תמונה כאל טענה ולא כאל זמין. לעומת זאת, GLM-5.2 הוא טקסט-נכנס וטקסט-יוצא בקטלוג שלנו, ללא מודאליות תמונה כלל — כך שבמימד הזה אף אחד מהמודלים לא נותן לך תשובה מאומתת, ואחד מהם נותן לך טענה.

• המספרים שלכם. הפער בין מה שמפורסם לבין מה שאתם צריכים נסגר על ידי הרצת שני המודלים על המשימות שלכם, וחלון החינם ב-LongCat-2.5-Preview הופך את זה לזול כרגע. עקבות חשיבה שמגיעים בשדה reasoning_content משולב הם פרט ההרנס שיש לבדוק קודם, כי כלי עבודה שמשמיטים אותו בשקט יאבדו את רוב התועלת של המודל בלי לפלוט שגיאה.

מה זה אומר לגבי ההשוואה

אם אתה צריך החלטה היום והיא כרוכה בהקשר ארוך, GLM-5.2 הוא זה שאתה יכול למעשה להעריך: יש לו recall שפורסם, ציון קידוד בלתי תלוי של 68.8 ומדד אינטליגנציה של 33.7 מ-Artificial Analysis, ומחיר שאתה יכול לתקצב לפיו. הנתונים האלה מתארים מודל שהוא כשיר ולא בחזית — היורש של Z.ai עצמה, GLM-5.3, משיג ציון גבוה ממנו — אבל הם מתארים משהו. LongCat-2.5-Preview הוא הצעה זולה יותר, עם חלון הקשר גדול יותר, ושאינה נמדדת כלל, שתכונתה המושכת ביותר, המחיר שלה, היא זמנית במפורש. העמדה הנכונה כלפיו אינה ספקנות. היא הערכה של שבועיים עם רתמת הניקוד שלך מחוברת, שתתבצע לפני שתעריף המבצע ייעלם.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית