
LongCat-2.5-Preview מול GLM-5.2: שני חלונות של 1M טוקנים, אחד מהם נמדד
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 610 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 189 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
LongCat-2.5-Preview ו-GLM-5.2נושאים את אותו מספר כותרת: חלון הקשר של מיליון טוקנים. צירוף המקרים היחיד הזה עושה את כל העבודה ברוב ההשוואות שנכתבות השבוע, וזה לא מספיק כדי להשוות שני מודלים. GLM-5.2 מתועד מאז 16 ביוני 2026 עם פרופיל בנצ'מרק ציבורי, מחירון מפורסם וציון ריקול להקשר ארוך ממעריך בלתי תלוי. LongCat-2.5-Preview הופיע בפלטפורמת LongCat API של Meituan ב-25 בספטמבר 2026 עם מחירון מוזל, מספר פרמטרים שדווח בסיקור מסחרי סיני, וללא בנצ'מרק מפורסם מכל סוג. חלון אחד נמדד. האחר מוצהר. כל מה שלהלן מפריד בין שתי הקטגוריות האלה, מפני שגיליון מפרט ותוצאת בדיקה אינם אותו סוג של עובדה.
זו הגרסה הכנה של המאצ'אפ, והיא שימושית יותר מזו המחמיאה.
מה שכל צד פרסם בפועל
יומן השינויים של Meituan מכיל רשומה מתוארכת — "גרסה: 2026-09-25, LongCat-2.5-Preview זמין כעת" — המפרטת שלוש יכולות נטענות: הבנת תמונות, קידוד, ותאימות עם "Claude Code וסביבות פיתוח מיינסטרים אחרות", תוך ציון Hermes, OpenClaw, OpenCode ו-Kilo Code. דף התמחור של הספק מציין תעריף תשלום לפי שימוש של $0.30 למיליון טוקני קלט ללא מטמון, $0.006 למיליון טוקני קלט עם מטמון ו-$1.20 למיליון טוקני פלט, כשהוא מסומן בדף עצמו כהנחה לזמן מוגבל. חלון ההקשר הוא מיליון טוקנים והפלט המקסימלי הוא 131,072. בערך 1.6 טריליון פרמטרים בסך הכל, עם כ-48 מיליארד פעילים לכל טוקן, על בסיס mixture-of-experts, מגיעים ממטא-נתונים של האתר של Meituan עצמה ומסיקור סחר סיני של הרישום — לא מתיעוד ה-API. שום דוח טכני, כרטיס מודל או טבלת בנצ'מרק לא ליוו את זה. אין מאגר LongCat-2.5-Preview ב-HuggingFace ואין מאגר בשם זה בארגון ה-GitHub של Meituan; המטא-נתונים של קטלוג המודלים שמגיעים עם OpenCode רושמים open weights כ-false.

GLM-5.2 של Z.ai נמצא בעמדה ההפוכה. זוהי מהדורה מיוני עם מחירון שאנו מציעים במחיר המחירון: $1.40 למיליון טוקני קלט, $0.26 למיליון טוקני קלט במטמון ו-$4.40 למיליון טוקני פלט בקטלוג שלנו, עם חלון הקשר של 1,000,000 טוקנים ו-128,000 טוקנים של פלט מקסימלי. הציונים שפורסמו עבורו מגיעים משני מקומות שונים, וההבחנה הזו חשובה: המספרים של Z.ai עצמה עבור AIME 2026, HMMT פברואר 2026, GPQA-Diamond וחבילת FrontierSWE הם דיווחי ספק; נתוני Coding Index ו-Intelligence Index שהקטלוג שלנו מציג מקורם ב-Artificial Analysis, שמפעילה הערכות משלה.
המימד היחיד שבו הם באמת שווים
שני המודלים טוענים בדיוק ל-1,000,000 טוקנים של הקשר. רק לאחד מהם יש ציון מפורסם שבוחן אם מודל עדיין יכול להשתמש במה שיש שם. Artificial Analysis רושמת נתון ריקול הקשר ארוך של 78.33 עבור GLM-5.2. ל-LongCat-2.5-Preview אין מספר מקביל, מאף אחד. האסימטריה הזו היא כל ההתמודדות בשורה אחת: חלון של מיליון טוקנים הוא הצהרה על הקיבולת של הארכיטקטורה, לא על האם המודל שולף נכון בטוקן 900,000. קיבולת היא זולה להדפיס ויקרה לאמת, ולכן כל ספק מדפיס אותה וכמעט אף אחד מהם לא מפרסם את מבחן הריקול.
אז אם עבודה עם הקשר ארוך היא מה שאתם בוחרים בין שני אלה בשבילו, אתם בוחרים בין אפשרות אחת עם ציון recall מפורסם ואחת בלי — וזו שבלי היא גם זו עם פרופיל הבנצ'מרק שלא נמדד. זו לא טענה נגדה. זו טענה נגד ההתייחסות לשניים כאל ניתנים להחלפה על סמך מספר שלם תואם.

איך נראה פער המחירים בעבודה אמיתית
כרטיסי התעריפים אינם קרובים זה לזה, והכיוון אינו זה שאנשים מצפים לו ממתחרה סיני עם משקולות פתוחות מול מעבדת חזית מערבית. LongCat-2.5-Preview זול בערך פי 4.7 בקלט ללא מטמון ובפי 3.7 בפלט מ-GLM-5.2 — יחס שהוא אריתמטיקה על שני הכרטיסים שפורסמו, לא מדידה. בהרצת עיבוד מסמך של 500,000 טוקנים שמחזירה 20,000 טוקנים, מדובר בכ-17 סנט לעומת כ-79 סנט. שני המודלים צריכים לקרוא את אותו מסמך. רק לאחד מהם יש ציון מפורסם לשאלה אם הוא עדיין יקדיש תשומת לב בסופו.
ישנה הסתייגות שנייה ששייכת לאותה נשימה: Meituan מכנה את מחירון התעריפים שלה הנחה לזמן מוגבל. הסכום של $0.30 הוא המספר הפרומוציוני, והספק אינו אומר מה בא אחריו. מודל עלויות שנבנה על מחיר פרומוציוני נושא תאריך תפוגה שאי אפשר לקרוא. זו סיבה לשמור על מעבר בין ספקים בזול, ולא סיבה להימנע מהמודל.
ב-OrcaRouter, הנתיבים שאנו מגישים נמצאים מאחורי מפתח אחד במחיר המחירון של הספק עם אפס תוספת, כך ששינוי מחיר מצד ספק מגיע לחשבון שלכם באותו יום ולא בחידוש הבא, ומעבר אוטומטי בין ספקים מעביר בקשה שנפגעה לספק בריא בלי שהאפליקציה שלכם תדע. GLM-5.2 הוא אחד הנתיבים שלנו. LongCat-2.5-Preview אינו כזה — איננו מספקים אותו, ואין לקרוא דבר כאן כטענה אחרת. Z.ai גם התקדמה מאז יוני: GLM-5.3 פעיל בקטלוג שלנו נכון ל-18 באוגוסט 2026, כך שהשוואה שמנוסחת כ"מודל חדש מול המודל הנוכחי" כבר מציגה את GLM-5.2 כמודל המכהן ולא כחוד החנית.

מה יפתור את זה, ומה לא
• ציון Long-Context Recall עבור LongCat-2.5-Preview, מ-Meituan או מגורם מעריך עצמאי. עד שדבר כזה יהיה קיים, חלון ה-1M שלו הוא טענה בלי בדיקה מצורפת, וה-78.33 של GLM-5.2 הוא המספר היחיד בהשוואה שמתייחס לאותה שאלה.
• כרטיס תעריפים של ספק ללא סימון של זמן מוגבל. המחיר המוזל אומר לך מה עולה המודל במהלך מבצע, לא מה הוא עולה.
• טבלת בנצ'מרק מכל סוג. לא מיקום בלוח מובילים — אלא פשוט ריצת הערכה שפורסמה, כך שההשוואה תפסיק להיות גיליון מפרט מול דף תוצאות.
• אישור קלט תמונה. ה-changelog מציג את הבנת התמונות כתוספת עיקרית, אך תגובת הדוגמה בתיעוד "Retrieve Model" של Meituan עצמה עדיין מציגה את input_modalities כ-["text"] עם מחרוזת מודאליות text->text. ייתכן שדוגמה זו פשוט מיושנת. עם זאת, זהו החוזה המפורסם של הספק, ולכן יש להתייחס לקלט תמונה כאל טענה ולא כאל זמין. לעומת זאת, GLM-5.2 הוא טקסט-נכנס וטקסט-יוצא בקטלוג שלנו, ללא מודאליות תמונה כלל — כך שבמימד הזה אף אחד מהמודלים לא נותן לך תשובה מאומתת, ואחד מהם נותן לך טענה.
• המספרים שלכם. הפער בין מה שמפורסם לבין מה שאתם צריכים נסגר על ידי הרצת שני המודלים על המשימות שלכם, וחלון החינם ב-LongCat-2.5-Preview הופך את זה לזול כרגע. עקבות חשיבה שמגיעים בשדה reasoning_content משולב הם פרט ההרנס שיש לבדוק קודם, כי כלי עבודה שמשמיטים אותו בשקט יאבדו את רוב התועלת של המודל בלי לפלוט שגיאה.
מה זה אומר לגבי ההשוואה
אם אתה צריך החלטה היום והיא כרוכה בהקשר ארוך, GLM-5.2 הוא זה שאתה יכול למעשה להעריך: יש לו recall שפורסם, ציון קידוד בלתי תלוי של 68.8 ומדד אינטליגנציה של 33.7 מ-Artificial Analysis, ומחיר שאתה יכול לתקצב לפיו. הנתונים האלה מתארים מודל שהוא כשיר ולא בחזית — היורש של Z.ai עצמה, GLM-5.3, משיג ציון גבוה ממנו — אבל הם מתארים משהו. LongCat-2.5-Preview הוא הצעה זולה יותר, עם חלון הקשר גדול יותר, ושאינה נמדדת כלל, שתכונתה המושכת ביותר, המחיר שלה, היא זמנית במפורש. העמדה הנכונה כלפיו אינה ספקנות. היא הערכה של שבועיים עם רתמת הניקוד שלך מחוברת, שתתבצע לפני שתעריף המבצע ייעלם.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
