
LongCat-2.5-Preview לעומת Kimi K3: שאלת השליפה בהקשר הארוך שאיש עדיין לא יכול לענות עליה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 610 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 189 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
Kimi K3 מקבל ציון 88.67 ב-Long-Context Recall. זהו הנתון הגבוה ביותר מכל מודל בקטלוג שלנו לשאלה הספציפית אם מודל עדיין עושה שימוש במידע הקבור עמוק בתוך קלט ארוך. LongCat-2.5-Preview אין לו ציון Long-Context Recall כלל — לא מ-Artificial Analysis, לא מ-Meituan, לא מאף אחד. ו-LongCat-2.5-Preview הוא זה שמפרסם חלון של מיליון טוקנים כתכונה הראשית שלו. אי-ההתאמה הזו, מודל שהטענה המרכזית שלו היא הקשר ארוך ושאין עבורו שום מדידה של הקשר ארוך, היא כל מלוא מהותה של ההשוואה הזו. כל השאר משני.
כדאי לדייק לגבי מה שהמספר החסר כן אומר ומה הוא אינו אומר, משום שקל לגלוש מ"לא נמדד" אל "כנראה רע", ואף אחד מהכיוונים אינו נתמך.
מה שכל אחד משני המודלים העלה לפרוטוקול
Kimi K3 של MoonshotAI הושק ב-15 ביולי 2026. הקטלוג שלנו כולל אותו עם חלון הקשר של 1,048,576 טוקנים, קלט טקסט ותמונה, ומחירון של 3.00 דולר למיליון טוקני קלט, 0.30 דולר למיליון טוקני קלט במטמון ו-15.00 דולר למיליון טוקני פלט. הפרופיל העצמאי שלו מ-Artificial Analysis מציג: Coding Index 76.2, מקום תשיעי; Intelligence Index 43.6, מקום תשעה עשר; GPQA Diamond 93.5%; Humanity's Last Exam 46.9%; SciCode 59.5%; Terminal-Bench v2.1 85.0; τ²-Bench banking 46.0. ו-Long-Context Recall 88.67, הטוב ביותר שאנחנו מציעים.

LongCat-2.5-Preview של Meituan הופיע ב-LongCat API Platform ב-25 בספטמבר 2026. רשומת יומן השינויים שלו מפרטת שלוש יכולות מוצהרות — הבנת תמונות, קידוד, ותאימות עם "Claude Code וסביבות פיתוח נפוצות אחרות" — ומציינת את Hermes, OpenClaw, OpenCode ו-Kilo Code. עמוד התמחור מציין $0.30 למיליון קלט ללא מטמון, $0.006 למיליון קלט במטמון ו-$1.20 למיליון פלט, כשהוא מסומן כהנחה לזמן מוגבל. חלון הקשר 1,000,000; פלט מקסימלי 131,072. הנתון של כ־1.6T פרמטרים בסך הכול / כ־48B פרמטרים פעילים מגיע ממטא־נתונים של האתר של Meituan ומסיקור בתקשורת המקצועית הסינית, ולא מתיעוד. אין טבלת בנצ'מרקים, אין כרטיס מודל, אין דוח טכני, אין מאגר ב-HuggingFace או בארגון GitHub של Meituan, ומטא־נתוני קטלוג מתעדים משקלים פתוחים כ-false.
למה המספר החסר חשוב יותר כאן מאשר בכל מפגש אחר
Recall בהקשר ארוך אינו ציון אחד מבין רבים עבור שני המודלים האלה. זהו הציון שבוחן את הדבר ששניהם מוכרים. חלון של מיליון טוקנים הוא הצהרה על קיבולת ארכיטקטונית; Recall מודד אם המודל עדיין יכול לשלוף ולהשתמש בעובדה שהוצבה בטוקן 900,000 במקום בטוקן 900. ספקים מפרסמים את הראשון מפני שזהו מפרט. מעריכים בלתי תלויים מפרסמים את השני מפני שזהו מבחן, ורוב המודלים אינם מצליחים בו כפי שגודל החלון שלהם מרמז.
אז העמדה הכנה צרה יותר ממה שזה נשמע. ה-88.67 של Kimi K3 לא אומר ש-Kimi K3 הוא המודל הטוב יותר להקשר ארוך מ-LongCat-2.5-Preview. פירושו ש-Kimi K3 הוא זה שלגביו השאלה נשאלה ונענתה. LongCat-2.5-Preview עשוי להיות טוב יותר. הוא עשוי להיות גרוע בהרבה. הנקודה היא שאף אחד מחוץ ל-Meituan לא יודע כרגע, וחלון של 1M שמודפס בעמוד תמחור אינו ראיה לכאן או לכאן.

תמונת העלויות, עם אותה אזהרה אריתמטית
לפי תעריפים מפורסמים, LongCat-2.5-Preview זול פי 10 בקלט שאינו במטמון ופי 12.5 בפלט מאשר Kimi K3. קריאה של 500,000 טוקנים שכותבת בחזרה 20,000 טוקנים מסתכמת בבערך 1.80 דולר ב-Kimi K3 ובבערך 17 סנט ב-LongCat-2.5-Preview. שניהם חישובים אריתמטיים על מחירי תעריפים ולא מדידות, ולנתון של LongCat יש הסתייגות נוספת שאין לנתון של Kimi: Meituan מתייגת את התעריף שלה כהנחה לזמן מוגבל, כך שהמספר שישרוד את המבצע אינו ידוע.
העמידו זאת מול שאלת הכיסוי. אם אתם מעבדים קלט של 500,000 טוקנים, ויכולת השחזור של המודל שלכם בעומק הזה אינה נמדדת, הפרש העלויות אינו חיסכון — הוא המחיר של שיעור כשלים לא ידוע. בקשה בעלות 17 סנט שמפספסת בשקט את הקטע הרלוונטי יקרה יותר מבקשה בעלות 1.80 דולר שמוצאת אותו, כי כך או כך אתם משלמים על ההרצה החוזרת ועל ניפוי הבאגים. זו הצורה הספציפית של הסיכון, ולכן הבנצ'מרק החסר הוא בעיית עלות ולא רק בעיה שיווקית.
מה לעשות כשהמספר אינו קיים
צור משלך. זה המקרה הנדיר שבו החלון החינמי מתאים באמת לפער: LongCat-2.5-Preview לא עולה דבר לקרוא לו דרך OpenCode לתקופה באורך לא מצוין, עם מדיניות אפס שימור ש-OpenCode מתעדת — אימון מודל "Not used", שימור נתונים "0 days" — מה שאומר שאתה יכול להצביע עליו למאגר פרטי בלי שיחת עיבוד נתונים מראש. בנה מבחן מחט בערמת שחת בעומק שבו אתה באמת משתמש, הרץ אותו על שני המודלים, ויהיה לך המספר שאף ספק לא פרסם. שני דברים לבדוק לפני שתסמוך על התוצאה: שמסגרת הבדיקה שלך חושפת את שדה ה-reasoning_content המשולב שהמודל מחזיר, ושקלט תמונות עובד בכלל, מכיוון שה-changelog של Meituan טוען זאת בעוד שהדוגמה שלה ל-"Retrieve Model" עדיין מציגה input_modalities בתור ["text"] עם מחרוזת text->text.

החלק של OrcaRouter בזה
אנו מגישים את Kimi K3 במחיר המחירון של MoonshotAI עם אפס תוספת. LongCat-2.5-Preview אינו אחד מהמסלולים שלנו — איננו מגישים אותו, ואין לקרוא דבר בטקסט הזה כטענה שאנו כן מגישים.
בהשוואה הספציפית הזו, החלק השימושי בנתב אינו המחיר. הוא זה שהמודל שאתה בוחן והמודל שאתה מסתמך עליו יכולים לשבת מאחורי אותו מפתח. הרקול של 88.67 של Kimi K3 הופך אותו למודל שדרכו היית מנתב מעבר בהקשר ארוך היום; LongCat-2.5-Preview הוא המודל שתרצה לבחון מולו, כי אם הרקול שלו מחזיק מעמד במחיר שהוא חלק שנים-עשר ממחיר הפלט, כלכלת העבודה עם מסמכים ארוכים משתנה. מיזוג מודלים הוא המנגנון שהופך את זה לקונקרטי ולא לתיאורטי: מעבר אחזור בהקשר ארוך ושלב סינתזה סופי יכולים להיות שני מודלים שונים בבקשה אחת, כך שהמודל הזול שאינו נמדד והמודל היקר הנמדד לא חייבים להיות בחירה של או-או. מעבר אוטומטי בעת כשל מכסה את המקרה שבו אחד מהם מדרדר, וזה חשוב יותר מהרגיל כאשר לאחד משני המועמדים שלך אין היסטוריית הגשה שתוכל לבחון.
פסק הדין, כשהוא נאמר עם אי־הוודאות שלו עצמו מצורפת
אם אתם זקוקים לכך שעבודה בהקשר ארוך תהיה אמינה השבוע, Kimi K3 הוא הבחירה המוצדקת: 88.67 recall הוא המספר הטוב ביותר הזמין עבור היכולת המדויקת המדוברת, והפרופיל הרחב יותר שלו — Coding 76.2, Intelligence 43.6, GPQA Diamond 93.5% — מוצק ולא מרהיב, וכולו מבוסס על מקורות בלתי תלויים. אם אתם מוכנים להקדיש אחר צהריים ליצירת הערכה משלכם, LongCat-2.5-Preview הוא ההימור המעניין יותר: חלון של מיליון טוקנים, תקרת פלט של 131,072 טוקנים, גישה ללא שמירת נתונים ולוח מחירים בסדר גודל אחד מתחת לזה של Kimi K3, כשהכול נשען על הצהרות ספק שאף אחד עדיין לא בחן בפומבי.
מה שאינו ניתן להגנה הוא ההתייחסות אליהם כאל שקולים משום ששניהם מפרטים מיליון טוקנים. לאחד מהם יש מספר שמצורף לחלון הזה, ולאחר יש מחיר. אלה סוגים שונים של ראיות, והפער ביניהם הוא הדבר היחיד שההשוואה הזו באמת עוסקת בו.
