כרטיס כותרת ראשי שנוצר, שעליו כתוב 'LongCat-2.5-Preview נגד Grok 4.6', עם הכותרת העליונה 'לאחד יש כרטיס בנצ'מרק, ולשני יש יורש', ושני פאנלים: 'LongCat-2.5-Preview: הקשר של 1M, אפס שמירה דרך OpenCode' ו-'Grok 4.6: AA Coding 76.8, Grok 4.7 כבר שוחרר'. לוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

LongCat-2.5-Preview מול Grok 4.6: לאחד יש כרטיס בנצ'מרק, ולשני יש יורש

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

השוואה בין LongCat-2.5-Preview ל-Grok 4.6 היא מביכה מסיבה שאין לה שום קשר לאיכות של אף אחד מהמודלים: לשאלה יש חיי מדף. Grok 4.6 שוחרר ב-12 באוגוסט 2026 ו-Grok 4.7 שוחרר ב-21 בספטמבר 2026 — שישה ימים לפני כתיבת שורות אלו — באותם תעריפים של $2.00 / $6.00 למיליון אסימונים ובאותה חלון הקשר של 500,000 אסימונים. LongCat-2.5-Preview, לעומת זאת, הושק בפלטפורמת ה-API של LongCat של Meituan ב-25 בספטמבר 2026 ללא יורש מוכרז באופק וללא בנצ'מרק מפורסם כלל. אז הבחירה האמיתית היא לא "איזה מודל טוב יותר". היא אם אתה רוצה יכולת מדודה עם יורש מדוד שכבר עומד מאחוריה, או כזו שאינה מדודה שלפחות היא הדבר הנוכחי.

המסגור הזה פחות מרגש מלוח תוצאות והרבה יותר שימושי.

תתחיל עם מה שלגרוק 4.6 באמת יש בתיק.

Grok 4.6 הוא מודל מתועד היטב. בקטלוג שלנו הוא כולל חלון הקשר של 500,000 טוקנים, קלט טקסט, תמונה וקבצים, ומחירון של $2.00 למיליון טוקני קלט, $6.00 למיליון טוקני פלט ו-$0.50 למיליון טוקני קלט במטמון, שעולה ל-$4.00 ו-$12.00 מעל 200,000 טוקני קלט. הפרופיל העצמאי שלו מ-Artificial Analysis כולל Coding Index של 76.8 — חמישי מבין המודלים שאותו מדד עוקב אחריהם — Intelligence Index של 44.3 במקום ה-18, GPQA Diamond ב-94.9%, Humanity's Last Exam ב-42.9%, SciCode ב-56.5%, Terminal-Bench v2.1 ב-88.4 ו-τ²-Bench לבנקאות ב-50.7. Long-Context Recall שלו הוא 80.3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

ל-LongCat-2.5-Preview אין שום דבר מכל זה. רשומת ה-changelog של Meituan ל-25 בספטמבר 2026 היא הודעת זמינות מתוארכת המפרטת שלוש יכולות נטענות — הבנת תמונות, קידוד, ותאימות עם "Claude Code וסביבות פיתוח מיינסטרימיות אחרות", כולל Hermes, OpenClaw, OpenCode ו-Kilo Code — ושום דבר שמזכיר תוצאה. עמוד התמחור של הספק מציין $0.30 למיליון טוקנים של קלט לא-מקושש, $0.006 למיליון קלט מקושש ו-$1.20 למיליון פלט, כשהוא מסומן במפורש כהנחה לזמן מוגבל. חלון ההקשר הוא 1,000,000 טוקנים; הפלט המקסימלי הוא 131,072. ספירת הפרמטרים של כ-1.6 טריליון סה"כ / 48 מיליארד פעילים מגיעה ממטא-דאטה של האתר של Meituan ומסיקור תעשייתי סיני ולא מתיעוד. אין מאגר עבורו ב-HuggingFace או בארגון ה-GitHub של Meituan, והמטא-דאטה של הקטלוג ש-OpenCode מפיצה רושמת משקולות פתוחות כ-false.

המימד שאותו לוח תוצאות יפספס לחלוטין

שני המודלים האלה נבדלים זה מזה במשהו שאף בנצ'מרק לא מודד, ועבור צוותים רבים זה מכריע את השאלה בעצמו: מה קורה לפרומפטים שאתם שולחים.

התיעוד של OpenCode עצמו קובע כי LongCat 2.5 Preview Free מוגש על ידי ספק שנוקט במדיניות של אפס שמירה ואינו משתמש בנתונים שלך לאימון; טבלת הפרטיות של Zen נותנת לכך מספרים — אימון מודל "לא בשימוש", שמירת נתונים "0 ימים". אותה טבלת פרטיות מפרטת שלושים ימי שמירה עבור Grok 4.6 ו-Grok 4.7. שתי ההצהרות האלה הן של OpenCode, מפורסמות בעמודים של OpenCode, והן מתארות באופן ספציפי את הרשומה החינמית ואת רשומת ההשוואה. אבל אם אתה מפנה סוכן למאגר פרטי, זה ההבדל בין שיחה שאתה לא צריך לנהל עם המחלקה המשפטית לבין שיחה שכן — ואין לזה שום קשר לשאלה איזה מודל מקבל ציון טוב יותר ב-SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

מה "מדוד" קונה לך ומה הוא לא קונה לך

המספרים של Grok 4.6 טובים מאלה של LongCat-2.5-Preview במובן היחיד שחשוב כאן: הם קיימים. זה לא זהה לאמירה ש-Grok 4.6 הוא המודל הטוב יותר. ה-Coding Index שלו, 76.8, נמוך מזה של הדור של Grok 4.7, והמודל שכנגדו נמדד כבר אינו בחזית של המשפחה שלו עצמה. ליורש שלו שפורסם יש Intelligence Index של 46.4 לעומת 44.3 של Grok 4.6, ו-Long-Context Recall של 76.67 לעומת 80.33 של Grok 4.6 — כך שהיורש אינו טוב יותר בכל ציר, וזה בדיוק סוג הפרט שמספר דור מסתיר.

יש גם הסתייגות של הגשה חיה שראויה להיאמר בפשטות, משום שהיא פועלת נגד הקריאה המחמיאה של שני המודלים. במדגם ה-playground שלנו בן שבעת הימים, Grok 4.6 לא רשם תפוקה מדודה ולא תעבורת טוקנים, וזה מה שנראה כמו היעדר נתונים בעמודה הזו ולא כפסק דין על ביצועים. ל-LongCat-2.5-Preview אין כלל מדגם הגשה משלנו, כי אנחנו לא מנתבים אותו. לכן כל השוואת השהיה בין השניים היא חד-צדדית באופן שפרוזה בדרך כלל מטשטשת: אי אפשר לבצע בנצ'מרק למודל שאליו אתה לא שולח תעבורה.

היכן שכבת הניתוב באמת עוזרת כאן

שלוש מהעובדות שלעיל הן מהסוג שראוטר נבנה עבורן ולא רק תואם להן. כרטיס התעריפים של Grok 4.6 עולה מדרגה מעל 200,000 טוקני קלט, כך שאותה משימה לוגית יכולה להיות מחויבת בשני תעריפים שונים בהתאם למספר שהאפליקציה שלך כבר יודעת לפני שהיא שולחת משהו. ל-Grok 4.6 יש ממשיך שפורסם בתעריפים זהים, מה שאומר שהמעבר מאחד לשני אמור להיות שינוי של שורה אחת ולעולם לא אינטגרציה מחדש. והתכונה המושכת ביותר של LongCat-2.5-Preview — המחיר שלה — מסומנת במפורש כזמנית על ידי הספק.

ב-OrcaRouter אנו מספקים את Grok 4.6 לפי מחיר המחירון של xAI, עם אפס תוספת, כך ששינוי תעריפים של ספק מגיע לחשבון שלך באותו היום ולא בחידוש הבא, ומעבר אוטומטי בין ספקים מעביר בקשה מדורדרת לספק תקין בלי שהקוד שלך יידע מי ענה. DSL לניתוב מכסה את מקרה התמחור המדורג ישירות, ומיזוג מודלים מכסה את המקרה שבו המודל שאתה רוצה לקריאה הארוכה אינו המודל שאתה רוצה לסינתזה הסופית. LongCat-2.5-Preview אינו אחד מהנתיבים שלנו — אנחנו לא מספקים אותו, ושום דבר כאן לא טוען אחרת. הנקודה באזכור שלו אינה להפנות אותך למקום אחר; היא שמודל שאתה מעריך ולא מריץ שייך מאחורי אותו מפתח כמו המודלים שאתה מריץ, כך שהערכתו עולה רשומת קונפיגורציה אחת במקום פרויקט שלם.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

איך להחליט

• בחרו ב-Grok 4.6 אם אתם זקוקים לתשובה שתוכלו לעמוד מאחוריה. יש לו כרטיס עצמאי, פרופיל קלט מתועד, ומחיר שאינו פג תוקף. הסיכון העיקרי שלו אינו האיכות אלא הרלוונטיות: Grok 4.7 קיים באותם מחירים, והעלות של הישארות על 4.6 מתוך אינרציה היא הפער בין ציון מדד אינטליגנציה של 44.3 ל-46.4 שלא הייתם צריכים לשלם עליו.

• בחרו ב-LongCat-2.5-Preview אם הגורם המכריע הוא שימור או טווח. גישה ללא שימור דרך OpenCode, חלון של מיליון טוקנים, תקרת פלט של 131,072 טוקנים ומחירון שהוא בערך שביעית מהמחירון של Grok 4.6 הם יתרונות אמיתיים — הראשון שבהם מאומת על ידי מדיניות פרטיות של צד שלישי, והשאר נטענים על ידי הספק בלבד.

• אל תבחרו ביניהם על בסיס טבלת בנצ׳מרק, כי רק אחת כזו קיימת. ציון הקידוד 76.8 וזכירת ההקשר הארוך 80.3 של Grok 4.6 מתארים את Grok 4.6. שום דבר עדיין לא מתאר את LongCat-2.5-Preview. כל מי שמפרסם השבוע ציון של LongCat-2.5-Preview לצד ציון של Grok 4.6 — או שהוא מצטט דגם LongCat אחר, או שהוא ממציא את המספר.

• אמת את צד הקלט לפני שאתה בונה עליו. ה-changelog של Meituan מוביל עם הבנת תמונות, אבל תגובת הדוגמה בתיעוד "Retrieve Model" שלה עדיין מציגה input_modalities בתור ["text"] עם text->text מחרוזת מודאליות — טענת ספק מול חוזה מפורסם שאומר אחרת. Grok 4.6 מקבל טקסט, תמונות וקבצים בלי עמימות כזו. ובדוק שסביבת הבדיקה שלך חושפת reasoning_content שדה משולב לפני שאתה מסיק משהו על איכות החשיבה של LongCat-2.5-Preview; לקוח שמשמיט את השדה הזה ייכשל בשקט.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית