
LongCat-2.5-Preview مقابل Kimi K3: مسألة استرجاع السياق الطويل التي لا يستطيع أحد الإجابة عنها بعد
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 610 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 189 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
Kimi K3 يسجل 88.67 في استدعاء السياق الطويل. هذا هو أعلى رقم لأي نموذج في كتالوجنا بالنسبة للسؤال المحدد عمّا إذا كان النموذج لا يزال يستخدم معلومات مدفونة عميقًا داخل مدخل طويل. LongCat-2.5-Preview ليس لديه أي نتيجة في استدعاء السياق الطويل على الإطلاق — لا من Artificial Analysis، ولا من Meituan، ولا من أي جهة. وLongCat-2.5-Preview هو النموذج الذي يعلن عن نافذة بمليون توكن كميزته الرئيسية. هذا التناقض، نموذج يكون ادعاؤه المحوري هو السياق الطويل ولا يوجد له أي قياس للسياق الطويل، هو جوهر هذه المقارنة بأكملها. كل ما عدا ذلك ثانوي.
من الجدير أن نكون دقيقين بشأن ما يعنيه الرقم المفقود وما لا يعنيه، لأن من السهل الانزلاق من «غير مُقاس» إلى «سيئ على الأرجح»، ولا يوجد ما يدعم أيًّا من الاتجاهين.
ما وضعه كلٌّ من النموذجين على السجل
صدر Kimi K3 من MoonshotAI في 15 يوليو 2026. يوفره كتالوجنا بنافذة سياق تبلغ 1,048,576 رمزًا، وإدخال نص وصورة، وبطاقة أسعار بقيمة 3.00 دولارات لكل مليون رمز إدخال، و0.30 دولار لكل مليون إدخال مخزّن مؤقتًا، و15.00 دولارًا لكل مليون إخراج. ويأتي ملفه المستقل من Artificial Analysis على النحو التالي: مؤشر البرمجة 76.2، التاسع؛ مؤشر الذكاء 43.6، التاسع عشر؛ GPQA Diamond 93.5%؛ Humanity's Last Exam 46.9%؛ SciCode 59.5%؛ Terminal-Bench v2.1 85.0؛ τ²-Bench banking 46.0. واستدعاء السياق الطويل 88.67، وهو الأفضل في كتالوجنا.

ظهر LongCat-2.5-Preview من Meituan على منصة LongCat API Platform في 25 سبتمبر 2026. يذكر إدخاله في سجل التغييرات ثلاث قدرات مُدّعاة — فهم الصور، والبرمجة، والتوافق مع "Claude Code وغيرها من بيئات التطوير السائدة"، مع إدراج Hermes وOpenClaw وOpenCode وKilo Code. وتعرض صفحة الأسعار 0.30 دولار لكل مليون رمز إدخال غير مخزّن مؤقتًا، و0.006 دولار لكل مليون رمز إدخال مخزّن مؤقتًا، و1.20 دولار لكل مليون رمز إخراج، مع الإشارة إلى أنها خصم لفترة محدودة. نافذة السياق 1,000,000؛ الحد الأقصى للإخراج 131,072. أما رقم المعاملات البالغ نحو 1.6 تريليون إجمالًا / نحو 48 مليارًا نشطة فيأتي من البيانات الوصفية لموقع Meituan والتغطية التجارية الصينية، وليس من الوثائق. لا يوجد جدول معايير أداء، ولا بطاقة نموذج، ولا تقرير تقني، ولا مستودع على HuggingFace أو في تنظيم Meituan على GitHub، كما تسجّل البيانات الوصفية للفهرس أن الأوزان المفتوحة خاطئة/غير صحيحة (false).
لماذا يهم الرقم الغائب هنا أكثر من أي مواجهة أخرى
لا يُعد استرجاع السياق الطويل مجرد نتيجة واحدة بين نتائج كثيرة لهذين النموذجين. إنه النتيجة التي تختبر الشيء الذي يبيعه كلاهما. نافذة بمليون توكن هي تصريح حول سعة البنية المعمارية؛ أما الاسترجاع فيقيس ما إذا كان النموذج لا يزال قادرًا على استرداد حقيقة موضوعة عند التوكن 900,000 واستخدامها بدلًا من التوكن 900. ينشر المورّدون الأول لأنه مواصفة. وينشر المقيّمون المستقلون الثاني لأنه اختبار، ومعظم النماذج لا تحقق فيه أداءً جيدًا كما يوحي حجم نافذتها.
إذن الموقف الصادق أضيق مما يبدو. لا تعني نتيجة Kimi K3 البالغة 88.67 أن Kimi K3 هو نموذج السياق الطويل الأفضل من LongCat-2.5-Preview. إنها تعني أن Kimi K3 هو النموذج الذي طُرح بشأنه السؤال وأُجيب عنه. قد يكون LongCat-2.5-Preview أفضل. وقد يكون أسوأ بكثير. النقطة هي أن لا أحد خارج Meituan يعرف حاليًا، ونافذة 1M المطبوعة على صفحة تسعير ليست دليلًا في أي من الاتجاهين.

صورة التكلفة، مع نفس التحذير الحسابي
بناءً على الأسعار المنشورة، يُعد LongCat-2.5-Preview أرخص بعشر مرات على المدخلات غير المخزّنة مؤقتًا، وأرخص بـ12.5 مرة على المخرجات، من Kimi K3. وقراءة بحجم 500,000 رمز تُعيد كتابة 20,000 رمز تبلغ نحو 1.80 دولار على Kimi K3 ونحو 17 سنتًا على LongCat-2.5-Preview. وكلا الرقمين مجرد عمليات حسابية على أسعار البطاقات وليس قياسات فعلية، كما يحمل رقم LongCat تحفظًا إضافيًا لا يحمله رقم Kimi: إذ تصنّف Meituan سعرها الخاص على أنه خصم لفترة محدودة، لذا فإن الرقم الذي يبقى بعد انتهاء العرض الترويجي غير معروف.
ضع ذلك في مقابل مسألة التغطية. إذا كنت تعالج مدخلًا يبلغ 500,000 رمز، وكان استدعاء نموذجك عند هذا العمق غير مُقاس، فإن فرق التكلفة ليس توفيرًا — بل هو ثمن معدل فشل مجهول. طلب بتكلفة 17 سنتًا يفوّت القسم ذا الصلة بصمت أكثر تكلفة من طلب بتكلفة 1.80 دولار يعثر عليه، لأنك تدفع ثمن إعادة التشغيل والتنقيح في كلتا الحالتين. هذا هو الشكل المحدد للمخاطرة، ولهذا فإن غياب المعيار المرجعي مشكلة تكلفة وليست مجرد مشكلة تسويقية.
ماذا تفعل بينما الرقم غير موجود
أنشئ اختبارك الخاص. هذه هي الحالة النادرة التي تناسب فيها النافذة المجانية الفجوة حقًا: LongCat-2.5-Preview لا يكلف شيئًا عند استدعائه عبر OpenCode لفترة غير معلومة المدة، مع سياسة عدم الاحتفاظ التي توثقها OpenCode — تدريب النموذج "غير مستخدم"، والاحتفاظ بالبيانات "0 أيام" — مما يعني أنه يمكنك توجيهه إلى مستودع خاص دون إجراء محادثة حول معالجة البيانات أولًا. أنشئ اختبار "إبرة في كومة قش" على العمق الذي تستخدمه فعليًا، وشغّله على كلا النموذجين، وسيكون لديك الرقم الذي لم ينشره أي من المورّدين. هناك أمران يجب التحقق منهما قبل أن تثق بالنتيجة: أن تُظهر أداة الاختبار لديك الحقل reasoning_content المتشابك الذي يعيده النموذج، وأن إدخال الصور يعمل أصلًا، لأن سجل تغييرات Meituan يزعم ذلك بينما لا يزال مثالها "Retrieve Model" يعرض input_modalities على هيئة ["text"] مع text->text كسلسلة نصية.

دور OrcaRouter في هذا الأمر
نقدّم Kimi K3 بسعر MoonshotAI المعلن مع هامش ربح صفري. LongCat-2.5-Preview ليس أحد مساراتنا — نحن لا نقدّمه، ولا ينبغي قراءة أي شيء في هذا المقال على أنه ادعاء بأننا نقدّمه.
في هذه المقارنة تحديدًا، الجزء المفيد في الموجِّه ليس السعر. بل أن النموذج الذي تُقيّمه والنموذج الذي تعتمد عليه يمكن أن يقفا خلف المفتاح نفسه. إن معدل استدعاء Kimi K3 البالغ 88.67 يجعله النموذج الذي قد توجّه عبره تمريرة سياق طويل اليوم؛ أما LongCat-2.5-Preview فهو النموذج الذي تريد اختباره في مواجهته، لأنه إذا صمد معدل استدعائه عند عُشر سعر المخرجات، فإن اقتصاديات العمل على المستندات الطويلة تتغيّر. دمج النماذج هو الآلية التي تجعل ذلك واقعًا ملموسًا لا نظريًا: فتمريرة استدعاء السياق الطويل وخطوة التركيب النهائية يمكن أن يكونا نموذجين مختلفين في الطلب الواحد، بحيث لا يضطر النموذج الرخيص غير المقيس والنموذج المكلف المقيس إلى أن يكونا خيارًا أحدهما دون الآخر. ثم يأتي التحويل التلقائي عند الفشل ليغطي حالة تدهور أحدهما، وهو أمر يكتسب أهمية أكبر من المعتاد حين لا يكون لأحد مرشّحيك سجل خدمة يمكنك فحصه.
الحكم، مصحوبًا بشكّه الخاص
إذا كنت بحاجة إلى أن يكون العمل بالسياق الطويل موثوقًا هذا الأسبوع، فإن Kimi K3 هو الخيار الذي يمكن الدفاع عنه: استدعاء 88.67 هو أفضل رقم متاح للقدرة الدقيقة المعنية، كما أن ملفه الأوسع — Coding 76.2، Intelligence 43.6، GPQA Diamond 93.5% — متين لا مبهر، وكله من مصادر مستقلة. وإذا كنت مستعدًا لقضاء فترة بعد الظهر في توليد تقييمك الخاص، فإن LongCat-2.5-Preview هو الرهان الأكثر إثارة للاهتمام: نافذة بمليون رمز، وسقف إخراج قدره 131,072 رمزًا، ووصول بعدم الاحتفاظ بالبيانات، وبطاقة أسعار تقل بمرتبة مقدار عن أسعار Kimi K3، وكل ذلك قائم على مزاعم البائع التي لم يختبرها أحد علنًا بعد.
ما لا يمكن الدفاع عنه هو التعامل معهما على أنهما متكافئان لأن كليهما يذكر مليون رمز. أحدُهما له رقم مرتبط بتلك النافذة، والآخر له سعر. هذان نوعان مختلفان من الأدلة، والفجوة بينهما هي الشيء الوحيد الذي تدور حوله هذه المقارنة فعلاً.
