כרטיס כותרת ראשי מופק שעליו כתוב 'LongCat-2.5-Preview vs Kimi K3', עם הכיתוב העליון 'שאלת השליפה בהקשר ארוך', ושתי לוחות: 'LongCat-2.5-Preview: הקשר של 1M, ציון שליפה לא פורסם' ו-'Kimi K3: AA Long-Context Recall 88.67, הגבוה ביותר שאנחנו מציעים'. לוגו OrcaRouter בפינה הימנית התחתונה.
Engineering & Research

LongCat-2.5-Preview לעומת Kimi K3: שאלת השליפה בהקשר הארוך שאיש עדיין לא יכול לענות עליה

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Kimi K3 מקבל ציון 88.67 ב-Long-Context Recall. זהו הנתון הגבוה ביותר מכל מודל בקטלוג שלנו לשאלה הספציפית אם מודל עדיין עושה שימוש במידע הקבור עמוק בתוך קלט ארוך. LongCat-2.5-Preview אין לו ציון Long-Context Recall כלל — לא מ-Artificial Analysis, לא מ-Meituan, לא מאף אחד. ו-LongCat-2.5-Preview הוא זה שמפרסם חלון של מיליון טוקנים כתכונה הראשית שלו. אי-ההתאמה הזו, מודל שהטענה המרכזית שלו היא הקשר ארוך ושאין עבורו שום מדידה של הקשר ארוך, היא כל מלוא מהותה של ההשוואה הזו. כל השאר משני.

כדאי לדייק לגבי מה שהמספר החסר כן אומר ומה הוא אינו אומר, משום שקל לגלוש מ"לא נמדד" אל "כנראה רע", ואף אחד מהכיוונים אינו נתמך.

מה שכל אחד משני המודלים העלה לפרוטוקול

Kimi K3 של MoonshotAI הושק ב-15 ביולי 2026. הקטלוג שלנו כולל אותו עם חלון הקשר של 1,048,576 טוקנים, קלט טקסט ותמונה, ומחירון של 3.00 דולר למיליון טוקני קלט, 0.30 דולר למיליון טוקני קלט במטמון ו-15.00 דולר למיליון טוקני פלט. הפרופיל העצמאי שלו מ-Artificial Analysis מציג: Coding Index 76.2, מקום תשיעי; Intelligence Index 43.6, מקום תשעה עשר; GPQA Diamond 93.5%; Humanity's Last Exam 46.9%; SciCode 59.5%; Terminal-Bench v2.1 85.0; τ²-Bench banking 46.0. ו-Long-Context Recall 88.67, הטוב ביותר שאנחנו מציעים.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview של Meituan הופיע ב-LongCat API Platform ב-25 בספטמבר 2026. רשומת יומן השינויים שלו מפרטת שלוש יכולות מוצהרות — הבנת תמונות, קידוד, ותאימות עם "Claude Code וסביבות פיתוח נפוצות אחרות" — ומציינת את Hermes, OpenClaw, OpenCode ו-Kilo Code. עמוד התמחור מציין $0.30 למיליון קלט ללא מטמון, $0.006 למיליון קלט במטמון ו-$1.20 למיליון פלט, כשהוא מסומן כהנחה לזמן מוגבל. חלון הקשר 1,000,000; פלט מקסימלי 131,072. הנתון של כ־1.6T פרמטרים בסך הכול / כ־48B פרמטרים פעילים מגיע ממטא־נתונים של האתר של Meituan ומסיקור בתקשורת המקצועית הסינית, ולא מתיעוד. אין טבלת בנצ'מרקים, אין כרטיס מודל, אין דוח טכני, אין מאגר ב-HuggingFace או בארגון GitHub של Meituan, ומטא־נתוני קטלוג מתעדים משקלים פתוחים כ-false.

למה המספר החסר חשוב יותר כאן מאשר בכל מפגש אחר

Recall בהקשר ארוך אינו ציון אחד מבין רבים עבור שני המודלים האלה. זהו הציון שבוחן את הדבר ששניהם מוכרים. חלון של מיליון טוקנים הוא הצהרה על קיבולת ארכיטקטונית; Recall מודד אם המודל עדיין יכול לשלוף ולהשתמש בעובדה שהוצבה בטוקן 900,000 במקום בטוקן 900. ספקים מפרסמים את הראשון מפני שזהו מפרט. מעריכים בלתי תלויים מפרסמים את השני מפני שזהו מבחן, ורוב המודלים אינם מצליחים בו כפי שגודל החלון שלהם מרמז.

אז העמדה הכנה צרה יותר ממה שזה נשמע. ה-88.67 של Kimi K3 לא אומר ש-Kimi K3 הוא המודל הטוב יותר להקשר ארוך מ-LongCat-2.5-Preview. פירושו ש-Kimi K3 הוא זה שלגביו השאלה נשאלה ונענתה. LongCat-2.5-Preview עשוי להיות טוב יותר. הוא עשוי להיות גרוע בהרבה. הנקודה היא שאף אחד מחוץ ל-Meituan לא יודע כרגע, וחלון של 1M שמודפס בעמוד תמחור אינו ראיה לכאן או לכאן.

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

תמונת העלויות, עם אותה אזהרה אריתמטית

לפי תעריפים מפורסמים, LongCat-2.5-Preview זול פי 10 בקלט שאינו במטמון ופי 12.5 בפלט מאשר Kimi K3. קריאה של 500,000 טוקנים שכותבת בחזרה 20,000 טוקנים מסתכמת בבערך 1.80 דולר ב-Kimi K3 ובבערך 17 סנט ב-LongCat-2.5-Preview. שניהם חישובים אריתמטיים על מחירי תעריפים ולא מדידות, ולנתון של LongCat יש הסתייגות נוספת שאין לנתון של Kimi: Meituan מתייגת את התעריף שלה כהנחה לזמן מוגבל, כך שהמספר שישרוד את המבצע אינו ידוע.

העמידו זאת מול שאלת הכיסוי. אם אתם מעבדים קלט של 500,000 טוקנים, ויכולת השחזור של המודל שלכם בעומק הזה אינה נמדדת, הפרש העלויות אינו חיסכון — הוא המחיר של שיעור כשלים לא ידוע. בקשה בעלות 17 סנט שמפספסת בשקט את הקטע הרלוונטי יקרה יותר מבקשה בעלות 1.80 דולר שמוצאת אותו, כי כך או כך אתם משלמים על ההרצה החוזרת ועל ניפוי הבאגים. זו הצורה הספציפית של הסיכון, ולכן הבנצ'מרק החסר הוא בעיית עלות ולא רק בעיה שיווקית.

מה לעשות כשהמספר אינו קיים

צור משלך. זה המקרה הנדיר שבו החלון החינמי מתאים באמת לפער: LongCat-2.5-Preview לא עולה דבר לקרוא לו דרך OpenCode לתקופה באורך לא מצוין, עם מדיניות אפס שימור ש-OpenCode מתעדת — אימון מודל "Not used", שימור נתונים "0 days" — מה שאומר שאתה יכול להצביע עליו למאגר פרטי בלי שיחת עיבוד נתונים מראש. בנה מבחן מחט בערמת שחת בעומק שבו אתה באמת משתמש, הרץ אותו על שני המודלים, ויהיה לך המספר שאף ספק לא פרסם. שני דברים לבדוק לפני שתסמוך על התוצאה: שמסגרת הבדיקה שלך חושפת את שדה ה-reasoning_content המשולב שהמודל מחזיר, ושקלט תמונות עובד בכלל, מכיוון שה-changelog של Meituan טוען זאת בעוד שהדוגמה שלה ל-"Retrieve Model" עדיין מציגה input_modalities בתור ["text"] עם מחרוזת text->text.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

החלק של OrcaRouter בזה

אנו מגישים את Kimi K3 במחיר המחירון של MoonshotAI עם אפס תוספת. ‏LongCat-2.5-Preview אינו אחד מהמסלולים שלנו — איננו מגישים אותו, ואין לקרוא דבר בטקסט הזה כטענה שאנו כן מגישים.

בהשוואה הספציפית הזו, החלק השימושי בנתב אינו המחיר. הוא זה שהמודל שאתה בוחן והמודל שאתה מסתמך עליו יכולים לשבת מאחורי אותו מפתח. הרקול של 88.67 של Kimi K3 הופך אותו למודל שדרכו היית מנתב מעבר בהקשר ארוך היום; LongCat-2.5-Preview הוא המודל שתרצה לבחון מולו, כי אם הרקול שלו מחזיק מעמד במחיר שהוא חלק שנים-עשר ממחיר הפלט, כלכלת העבודה עם מסמכים ארוכים משתנה. מיזוג מודלים הוא המנגנון שהופך את זה לקונקרטי ולא לתיאורטי: מעבר אחזור בהקשר ארוך ושלב סינתזה סופי יכולים להיות שני מודלים שונים בבקשה אחת, כך שהמודל הזול שאינו נמדד והמודל היקר הנמדד לא חייבים להיות בחירה של או-או. מעבר אוטומטי בעת כשל מכסה את המקרה שבו אחד מהם מדרדר, וזה חשוב יותר מהרגיל כאשר לאחד משני המועמדים שלך אין היסטוריית הגשה שתוכל לבחון.

פסק הדין, כשהוא נאמר עם אי־הוודאות שלו עצמו מצורפת

אם אתם זקוקים לכך שעבודה בהקשר ארוך תהיה אמינה השבוע, Kimi K3 הוא הבחירה המוצדקת: ‏88.67 recall הוא המספר הטוב ביותר הזמין עבור היכולת המדויקת המדוברת, והפרופיל הרחב יותר שלו — Coding 76.2, Intelligence 43.6, GPQA Diamond 93.5% — מוצק ולא מרהיב, וכולו מבוסס על מקורות בלתי תלויים. אם אתם מוכנים להקדיש אחר צהריים ליצירת הערכה משלכם, LongCat-2.5-Preview הוא ההימור המעניין יותר: חלון של מיליון טוקנים, תקרת פלט של 131,072 טוקנים, גישה ללא שמירת נתונים ולוח מחירים בסדר גודל אחד מתחת לזה של Kimi K3, כשהכול נשען על הצהרות ספק שאף אחד עדיין לא בחן בפומבי.

מה שאינו ניתן להגנה הוא ההתייחסות אליהם כאל שקולים משום ששניהם מפרטים מיליון טוקנים. לאחד מהם יש מספר שמצורף לחלון הזה, ולאחר יש מחיר. אלה סוגים שונים של ראיות, והפער ביניהם הוא הדבר היחיד שההשוואה הזו באמת עוסקת בו.