
LongCat-2.5-Preview מול Grok 4.6: לאחד יש כרטיס בנצ'מרק, ולשני יש יורש
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 610 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 189 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
השוואה בין LongCat-2.5-Preview ל-Grok 4.6 היא מביכה מסיבה שאין לה שום קשר לאיכות של אף אחד מהמודלים: לשאלה יש חיי מדף. Grok 4.6 שוחרר ב-12 באוגוסט 2026 ו-Grok 4.7 שוחרר ב-21 בספטמבר 2026 — שישה ימים לפני כתיבת שורות אלו — באותם תעריפים של $2.00 / $6.00 למיליון אסימונים ובאותה חלון הקשר של 500,000 אסימונים. LongCat-2.5-Preview, לעומת זאת, הושק בפלטפורמת ה-API של LongCat של Meituan ב-25 בספטמבר 2026 ללא יורש מוכרז באופק וללא בנצ'מרק מפורסם כלל. אז הבחירה האמיתית היא לא "איזה מודל טוב יותר". היא אם אתה רוצה יכולת מדודה עם יורש מדוד שכבר עומד מאחוריה, או כזו שאינה מדודה שלפחות היא הדבר הנוכחי.
המסגור הזה פחות מרגש מלוח תוצאות והרבה יותר שימושי.
תתחיל עם מה שלגרוק 4.6 באמת יש בתיק.
Grok 4.6 הוא מודל מתועד היטב. בקטלוג שלנו הוא כולל חלון הקשר של 500,000 טוקנים, קלט טקסט, תמונה וקבצים, ומחירון של $2.00 למיליון טוקני קלט, $6.00 למיליון טוקני פלט ו-$0.50 למיליון טוקני קלט במטמון, שעולה ל-$4.00 ו-$12.00 מעל 200,000 טוקני קלט. הפרופיל העצמאי שלו מ-Artificial Analysis כולל Coding Index של 76.8 — חמישי מבין המודלים שאותו מדד עוקב אחריהם — Intelligence Index של 44.3 במקום ה-18, GPQA Diamond ב-94.9%, Humanity's Last Exam ב-42.9%, SciCode ב-56.5%, Terminal-Bench v2.1 ב-88.4 ו-τ²-Bench לבנקאות ב-50.7. Long-Context Recall שלו הוא 80.3.

ל-LongCat-2.5-Preview אין שום דבר מכל זה. רשומת ה-changelog של Meituan ל-25 בספטמבר 2026 היא הודעת זמינות מתוארכת המפרטת שלוש יכולות נטענות — הבנת תמונות, קידוד, ותאימות עם "Claude Code וסביבות פיתוח מיינסטרימיות אחרות", כולל Hermes, OpenClaw, OpenCode ו-Kilo Code — ושום דבר שמזכיר תוצאה. עמוד התמחור של הספק מציין $0.30 למיליון טוקנים של קלט לא-מקושש, $0.006 למיליון קלט מקושש ו-$1.20 למיליון פלט, כשהוא מסומן במפורש כהנחה לזמן מוגבל. חלון ההקשר הוא 1,000,000 טוקנים; הפלט המקסימלי הוא 131,072. ספירת הפרמטרים של כ-1.6 טריליון סה"כ / 48 מיליארד פעילים מגיעה ממטא-דאטה של האתר של Meituan ומסיקור תעשייתי סיני ולא מתיעוד. אין מאגר עבורו ב-HuggingFace או בארגון ה-GitHub של Meituan, והמטא-דאטה של הקטלוג ש-OpenCode מפיצה רושמת משקולות פתוחות כ-false.
המימד שאותו לוח תוצאות יפספס לחלוטין
שני המודלים האלה נבדלים זה מזה במשהו שאף בנצ'מרק לא מודד, ועבור צוותים רבים זה מכריע את השאלה בעצמו: מה קורה לפרומפטים שאתם שולחים.
התיעוד של OpenCode עצמו קובע כי LongCat 2.5 Preview Free מוגש על ידי ספק שנוקט במדיניות של אפס שמירה ואינו משתמש בנתונים שלך לאימון; טבלת הפרטיות של Zen נותנת לכך מספרים — אימון מודל "לא בשימוש", שמירת נתונים "0 ימים". אותה טבלת פרטיות מפרטת שלושים ימי שמירה עבור Grok 4.6 ו-Grok 4.7. שתי ההצהרות האלה הן של OpenCode, מפורסמות בעמודים של OpenCode, והן מתארות באופן ספציפי את הרשומה החינמית ואת רשומת ההשוואה. אבל אם אתה מפנה סוכן למאגר פרטי, זה ההבדל בין שיחה שאתה לא צריך לנהל עם המחלקה המשפטית לבין שיחה שכן — ואין לזה שום קשר לשאלה איזה מודל מקבל ציון טוב יותר ב-SciCode.

מה "מדוד" קונה לך ומה הוא לא קונה לך
המספרים של Grok 4.6 טובים מאלה של LongCat-2.5-Preview במובן היחיד שחשוב כאן: הם קיימים. זה לא זהה לאמירה ש-Grok 4.6 הוא המודל הטוב יותר. ה-Coding Index שלו, 76.8, נמוך מזה של הדור של Grok 4.7, והמודל שכנגדו נמדד כבר אינו בחזית של המשפחה שלו עצמה. ליורש שלו שפורסם יש Intelligence Index של 46.4 לעומת 44.3 של Grok 4.6, ו-Long-Context Recall של 76.67 לעומת 80.33 של Grok 4.6 — כך שהיורש אינו טוב יותר בכל ציר, וזה בדיוק סוג הפרט שמספר דור מסתיר.
יש גם הסתייגות של הגשה חיה שראויה להיאמר בפשטות, משום שהיא פועלת נגד הקריאה המחמיאה של שני המודלים. במדגם ה-playground שלנו בן שבעת הימים, Grok 4.6 לא רשם תפוקה מדודה ולא תעבורת טוקנים, וזה מה שנראה כמו היעדר נתונים בעמודה הזו ולא כפסק דין על ביצועים. ל-LongCat-2.5-Preview אין כלל מדגם הגשה משלנו, כי אנחנו לא מנתבים אותו. לכן כל השוואת השהיה בין השניים היא חד-צדדית באופן שפרוזה בדרך כלל מטשטשת: אי אפשר לבצע בנצ'מרק למודל שאליו אתה לא שולח תעבורה.
היכן שכבת הניתוב באמת עוזרת כאן
שלוש מהעובדות שלעיל הן מהסוג שראוטר נבנה עבורן ולא רק תואם להן. כרטיס התעריפים של Grok 4.6 עולה מדרגה מעל 200,000 טוקני קלט, כך שאותה משימה לוגית יכולה להיות מחויבת בשני תעריפים שונים בהתאם למספר שהאפליקציה שלך כבר יודעת לפני שהיא שולחת משהו. ל-Grok 4.6 יש ממשיך שפורסם בתעריפים זהים, מה שאומר שהמעבר מאחד לשני אמור להיות שינוי של שורה אחת ולעולם לא אינטגרציה מחדש. והתכונה המושכת ביותר של LongCat-2.5-Preview — המחיר שלה — מסומנת במפורש כזמנית על ידי הספק.
ב-OrcaRouter אנו מספקים את Grok 4.6 לפי מחיר המחירון של xAI, עם אפס תוספת, כך ששינוי תעריפים של ספק מגיע לחשבון שלך באותו היום ולא בחידוש הבא, ומעבר אוטומטי בין ספקים מעביר בקשה מדורדרת לספק תקין בלי שהקוד שלך יידע מי ענה. DSL לניתוב מכסה את מקרה התמחור המדורג ישירות, ומיזוג מודלים מכסה את המקרה שבו המודל שאתה רוצה לקריאה הארוכה אינו המודל שאתה רוצה לסינתזה הסופית. LongCat-2.5-Preview אינו אחד מהנתיבים שלנו — אנחנו לא מספקים אותו, ושום דבר כאן לא טוען אחרת. הנקודה באזכור שלו אינה להפנות אותך למקום אחר; היא שמודל שאתה מעריך ולא מריץ שייך מאחורי אותו מפתח כמו המודלים שאתה מריץ, כך שהערכתו עולה רשומת קונפיגורציה אחת במקום פרויקט שלם.

איך להחליט
• בחרו ב-Grok 4.6 אם אתם זקוקים לתשובה שתוכלו לעמוד מאחוריה. יש לו כרטיס עצמאי, פרופיל קלט מתועד, ומחיר שאינו פג תוקף. הסיכון העיקרי שלו אינו האיכות אלא הרלוונטיות: Grok 4.7 קיים באותם מחירים, והעלות של הישארות על 4.6 מתוך אינרציה היא הפער בין ציון מדד אינטליגנציה של 44.3 ל-46.4 שלא הייתם צריכים לשלם עליו.
• בחרו ב-LongCat-2.5-Preview אם הגורם המכריע הוא שימור או טווח. גישה ללא שימור דרך OpenCode, חלון של מיליון טוקנים, תקרת פלט של 131,072 טוקנים ומחירון שהוא בערך שביעית מהמחירון של Grok 4.6 הם יתרונות אמיתיים — הראשון שבהם מאומת על ידי מדיניות פרטיות של צד שלישי, והשאר נטענים על ידי הספק בלבד.
• אל תבחרו ביניהם על בסיס טבלת בנצ׳מרק, כי רק אחת כזו קיימת. ציון הקידוד 76.8 וזכירת ההקשר הארוך 80.3 של Grok 4.6 מתארים את Grok 4.6. שום דבר עדיין לא מתאר את LongCat-2.5-Preview. כל מי שמפרסם השבוע ציון של LongCat-2.5-Preview לצד ציון של Grok 4.6 — או שהוא מצטט דגם LongCat אחר, או שהוא ממציא את המספר.
• אמת את צד הקלט לפני שאתה בונה עליו. ה-changelog של Meituan מוביל עם הבנת תמונות, אבל תגובת הדוגמה בתיעוד "Retrieve Model" שלה עדיין מציגה input_modalities בתור ["text"] עם text->text מחרוזת מודאליות — טענת ספק מול חוזה מפורסם שאומר אחרת. Grok 4.6 מקבל טקסט, תמונות וקבצים בלי עמימות כזו. ובדוק שסביבת הבדיקה שלך חושפת reasoning_content שדה משולב לפני שאתה מסיק משהו על איכות החשיבה של LongCat-2.5-Preview; לקוח שמשמיט את השדה הזה ייכשל בשקט.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
