بطاقة عنوان رئيسية مُولّدة تحمل نصّ «LongCat-2.5-Preview مقابل Kimi K3» مع سطر علوي «مسألة استرجاع السياق الطويل»، ولوحتان: «LongCat-2.5-Preview: سياق 1M، درجة الاسترجاع غير منشورة» و«Kimi K3: AA Long-Context Recall 88.67، الأعلى الذي نوفّره». شعار OrcaRouter في أسفل اليمين.
Engineering & Research

LongCat-2.5-Preview مقابل Kimi K3: مسألة استرجاع السياق الطويل التي لا يستطيع أحد الإجابة عنها بعد

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Kimi K3 يسجل 88.67 في استدعاء السياق الطويل. هذا هو أعلى رقم لأي نموذج في كتالوجنا بالنسبة للسؤال المحدد عمّا إذا كان النموذج لا يزال يستخدم معلومات مدفونة عميقًا داخل مدخل طويل. LongCat-2.5-Preview ليس لديه أي نتيجة في استدعاء السياق الطويل على الإطلاق — لا من Artificial Analysis، ولا من Meituan، ولا من أي جهة. وLongCat-2.5-Preview هو النموذج الذي يعلن عن نافذة بمليون توكن كميزته الرئيسية. هذا التناقض، نموذج يكون ادعاؤه المحوري هو السياق الطويل ولا يوجد له أي قياس للسياق الطويل، هو جوهر هذه المقارنة بأكملها. كل ما عدا ذلك ثانوي.

من الجدير أن نكون دقيقين بشأن ما يعنيه الرقم المفقود وما لا يعنيه، لأن من السهل الانزلاق من «غير مُقاس» إلى «سيئ على الأرجح»، ولا يوجد ما يدعم أيًّا من الاتجاهين.

ما وضعه كلٌّ من النموذجين على السجل

صدر Kimi K3 من MoonshotAI في 15 يوليو 2026. يوفره كتالوجنا بنافذة سياق تبلغ 1,048,576 رمزًا، وإدخال نص وصورة، وبطاقة أسعار بقيمة 3.00 دولارات لكل مليون رمز إدخال، و0.30 دولار لكل مليون إدخال مخزّن مؤقتًا، و15.00 دولارًا لكل مليون إخراج. ويأتي ملفه المستقل من Artificial Analysis على النحو التالي: مؤشر البرمجة 76.2، التاسع؛ مؤشر الذكاء 43.6، التاسع عشر؛ GPQA Diamond 93.5%؛ Humanity's Last Exam 46.9%؛ SciCode 59.5%؛ Terminal-Bench v2.1 85.0؛ τ²-Bench banking 46.0. واستدعاء السياق الطويل 88.67، وهو الأفضل في كتالوجنا.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

ظهر LongCat-2.5-Preview من Meituan على منصة LongCat API Platform في 25 سبتمبر 2026. يذكر إدخاله في سجل التغييرات ثلاث قدرات مُدّعاة — فهم الصور، والبرمجة، والتوافق مع "Claude Code وغيرها من بيئات التطوير السائدة"، مع إدراج Hermes وOpenClaw وOpenCode وKilo Code. وتعرض صفحة الأسعار 0.30 دولار لكل مليون رمز إدخال غير مخزّن مؤقتًا، و0.006 دولار لكل مليون رمز إدخال مخزّن مؤقتًا، و1.20 دولار لكل مليون رمز إخراج، مع الإشارة إلى أنها خصم لفترة محدودة. نافذة السياق 1,000,000؛ الحد الأقصى للإخراج 131,072. أما رقم المعاملات البالغ نحو 1.6 تريليون إجمالًا / نحو 48 مليارًا نشطة فيأتي من البيانات الوصفية لموقع Meituan والتغطية التجارية الصينية، وليس من الوثائق. لا يوجد جدول معايير أداء، ولا بطاقة نموذج، ولا تقرير تقني، ولا مستودع على HuggingFace أو في تنظيم Meituan على GitHub، كما تسجّل البيانات الوصفية للفهرس أن الأوزان المفتوحة خاطئة/غير صحيحة (false).

لماذا يهم الرقم الغائب هنا أكثر من أي مواجهة أخرى

لا يُعد استرجاع السياق الطويل مجرد نتيجة واحدة بين نتائج كثيرة لهذين النموذجين. إنه النتيجة التي تختبر الشيء الذي يبيعه كلاهما. نافذة بمليون توكن هي تصريح حول سعة البنية المعمارية؛ أما الاسترجاع فيقيس ما إذا كان النموذج لا يزال قادرًا على استرداد حقيقة موضوعة عند التوكن 900,000 واستخدامها بدلًا من التوكن 900. ينشر المورّدون الأول لأنه مواصفة. وينشر المقيّمون المستقلون الثاني لأنه اختبار، ومعظم النماذج لا تحقق فيه أداءً جيدًا كما يوحي حجم نافذتها.

إذن الموقف الصادق أضيق مما يبدو. لا تعني نتيجة Kimi K3 البالغة 88.67 أن Kimi K3 هو نموذج السياق الطويل الأفضل من LongCat-2.5-Preview. إنها تعني أن Kimi K3 هو النموذج الذي طُرح بشأنه السؤال وأُجيب عنه. قد يكون LongCat-2.5-Preview أفضل. وقد يكون أسوأ بكثير. النقطة هي أن لا أحد خارج Meituan يعرف حاليًا، ونافذة 1M المطبوعة على صفحة تسعير ليست دليلًا في أي من الاتجاهين.

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

صورة التكلفة، مع نفس التحذير الحسابي

بناءً على الأسعار المنشورة، يُعد LongCat-2.5-Preview أرخص بعشر مرات على المدخلات غير المخزّنة مؤقتًا، وأرخص بـ12.5 مرة على المخرجات، من Kimi K3. وقراءة بحجم 500,000 رمز تُعيد كتابة 20,000 رمز تبلغ نحو 1.80 دولار على Kimi K3 ونحو 17 سنتًا على LongCat-2.5-Preview. وكلا الرقمين مجرد عمليات حسابية على أسعار البطاقات وليس قياسات فعلية، كما يحمل رقم LongCat تحفظًا إضافيًا لا يحمله رقم Kimi: إذ تصنّف Meituan سعرها الخاص على أنه خصم لفترة محدودة، لذا فإن الرقم الذي يبقى بعد انتهاء العرض الترويجي غير معروف.

ضع ذلك في مقابل مسألة التغطية. إذا كنت تعالج مدخلًا يبلغ 500,000 رمز، وكان استدعاء نموذجك عند هذا العمق غير مُقاس، فإن فرق التكلفة ليس توفيرًا — بل هو ثمن معدل فشل مجهول. طلب بتكلفة 17 سنتًا يفوّت القسم ذا الصلة بصمت أكثر تكلفة من طلب بتكلفة 1.80 دولار يعثر عليه، لأنك تدفع ثمن إعادة التشغيل والتنقيح في كلتا الحالتين. هذا هو الشكل المحدد للمخاطرة، ولهذا فإن غياب المعيار المرجعي مشكلة تكلفة وليست مجرد مشكلة تسويقية.

ماذا تفعل بينما الرقم غير موجود

أنشئ اختبارك الخاص. هذه هي الحالة النادرة التي تناسب فيها النافذة المجانية الفجوة حقًا: LongCat-2.5-Preview لا يكلف شيئًا عند استدعائه عبر OpenCode لفترة غير معلومة المدة، مع سياسة عدم الاحتفاظ التي توثقها OpenCode — تدريب النموذج "غير مستخدم"، والاحتفاظ بالبيانات "0 أيام" — مما يعني أنه يمكنك توجيهه إلى مستودع خاص دون إجراء محادثة حول معالجة البيانات أولًا. أنشئ اختبار "إبرة في كومة قش" على العمق الذي تستخدمه فعليًا، وشغّله على كلا النموذجين، وسيكون لديك الرقم الذي لم ينشره أي من المورّدين. هناك أمران يجب التحقق منهما قبل أن تثق بالنتيجة: أن تُظهر أداة الاختبار لديك الحقل reasoning_content المتشابك الذي يعيده النموذج، وأن إدخال الصور يعمل أصلًا، لأن سجل تغييرات Meituan يزعم ذلك بينما لا يزال مثالها "Retrieve Model" يعرض input_modalities على هيئة ["text"] مع text->text كسلسلة نصية.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

دور OrcaRouter في هذا الأمر

نقدّم Kimi K3 بسعر MoonshotAI المعلن مع هامش ربح صفري. LongCat-2.5-Preview ليس أحد مساراتنا — نحن لا نقدّمه، ولا ينبغي قراءة أي شيء في هذا المقال على أنه ادعاء بأننا نقدّمه.

في هذه المقارنة تحديدًا، الجزء المفيد في الموجِّه ليس السعر. بل أن النموذج الذي تُقيّمه والنموذج الذي تعتمد عليه يمكن أن يقفا خلف المفتاح نفسه. إن معدل استدعاء Kimi K3 البالغ 88.67 يجعله النموذج الذي قد توجّه عبره تمريرة سياق طويل اليوم؛ أما LongCat-2.5-Preview فهو النموذج الذي تريد اختباره في مواجهته، لأنه إذا صمد معدل استدعائه عند عُشر سعر المخرجات، فإن اقتصاديات العمل على المستندات الطويلة تتغيّر. دمج النماذج هو الآلية التي تجعل ذلك واقعًا ملموسًا لا نظريًا: فتمريرة استدعاء السياق الطويل وخطوة التركيب النهائية يمكن أن يكونا نموذجين مختلفين في الطلب الواحد، بحيث لا يضطر النموذج الرخيص غير المقيس والنموذج المكلف المقيس إلى أن يكونا خيارًا أحدهما دون الآخر. ثم يأتي التحويل التلقائي عند الفشل ليغطي حالة تدهور أحدهما، وهو أمر يكتسب أهمية أكبر من المعتاد حين لا يكون لأحد مرشّحيك سجل خدمة يمكنك فحصه.

الحكم، مصحوبًا بشكّه الخاص

إذا كنت بحاجة إلى أن يكون العمل بالسياق الطويل موثوقًا هذا الأسبوع، فإن Kimi K3 هو الخيار الذي يمكن الدفاع عنه: استدعاء 88.67 هو أفضل رقم متاح للقدرة الدقيقة المعنية، كما أن ملفه الأوسع — Coding 76.2، Intelligence 43.6، GPQA Diamond 93.5% — متين لا مبهر، وكله من مصادر مستقلة. وإذا كنت مستعدًا لقضاء فترة بعد الظهر في توليد تقييمك الخاص، فإن LongCat-2.5-Preview هو الرهان الأكثر إثارة للاهتمام: نافذة بمليون رمز، وسقف إخراج قدره 131,072 رمزًا، ووصول بعدم الاحتفاظ بالبيانات، وبطاقة أسعار تقل بمرتبة مقدار عن أسعار Kimi K3، وكل ذلك قائم على مزاعم البائع التي لم يختبرها أحد علنًا بعد.

ما لا يمكن الدفاع عنه هو التعامل معهما على أنهما متكافئان لأن كليهما يذكر مليون رمز. أحدُهما له رقم مرتبط بتلك النافذة، والآخر له سعر. هذان نوعان مختلفان من الأدلة، والفجوة بينهما هي الشيء الوحيد الذي تدور حوله هذه المقارنة فعلاً.