
LongCat-2.5-Preview مقابل Grok 4.6: أحدهما لديه بطاقة اختبار معياري، والآخر لديه خليفة
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 610 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 189 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
مقارنة LongCat-2.5-Previewمع Grok 4.6 محرجة لسبب لا علاقة له بجودة أي من النموذجين: فالسؤال له تاريخ صلاحية. أُطلِق Grok 4.6 في 12 أغسطس 2026، وأُطلِق Grok 4.7 في 21 سبتمبر 2026 — قبل ستة أيام من كتابة هذا — بالسعر نفسه البالغ 2.00 دولار / 6.00 دولارات لكل مليون، ونافذة السياق نفسها البالغة 500,000 رمز. أما LongCat-2.5-Preview فقد ظهر على منصة LongCat API الخاصة بـ Meituan في 25 سبتمبر 2026، دون أي خليفة معلن في الأفق ودون أي معيار منشور على الإطلاق. لذا فالخيار الحقيقي ليس "أي النموذجين أفضل". بل هو ما إذا كنت تريد قدرة مقيسة يقف خلفها بالفعل خليفة مقيس، أم قدرة غير مقيسة هي على الأقل الشيء الحالي.
هذا التأطير أقل إثارةً من لوحة النتائج وأكثر فائدةً بكثير.
ابدأ بما هو موجود فعلاً في سجلات Grok 4.6
Grok 4.6 هو نموذج موثّق جيدًا. في كتالوجنا، يوفّر نافذة سياق تبلغ 500,000 توكن، وإدخالًا نصيًا وصوريًا وملفات، وبطاقة أسعار قدرها 2.00 دولار لكل مليون توكن إدخال، و6.00 دولار لكل مليون توكن إخراج، و0.50 دولار لكل مليون توكن إدخال مخزّن مؤقتًا، لترتفع إلى 4.00 و12.00 دولارًا لما يزيد عن 200,000 توكن إدخال. ويتضمن ملفه التعريفي المستقل من Artificial Analysis مؤشر Coding Index عند 76.8 — الخامس بين النماذج التي يتتبعها ذلك المؤشر — ومؤشر Intelligence Index عند 44.3 في المرتبة الثامنة عشرة، وGPQA Diamond عند 94.9%، وHumanity's Last Exam عند 42.9%، وSciCode عند 56.5%، وTerminal-Bench v2.1 عند 88.4، وτ²-Bench للخدمات المصرفية عند 50.7. وLong-Context Recall الخاص به 80.3.

لا يملك LongCat-2.5-Preview أيًا من ذلك. إن مدخل سجل التغييرات الخاص بـ Meituan بتاريخ 25 سبتمبر 2026 هو إشعار توافر مؤرّخ يسرد ثلاث قدرات مزعومة — فهم الصور، والبرمجة، والتوافق مع «Claude Code وبيئات التطوير السائدة الأخرى» بما في ذلك Hermes وOpenClaw وOpenCode وKilo Code — ولا شيء يشبه نتيجة. وتعطي صفحة أسعار المورّد 0.30 دولار لكل مليون رمز إدخال غير مخزّن مؤقتًا، و0.006 دولار لكل مليون رمز إدخال مخزّن مؤقتًا، و1.20 دولار لكل مليون رمز إخراج، مع الإشارة صراحةً إلى أنها خصم لفترة محدودة. نافذة السياق هي 1,000,000 رمز؛ والحد الأقصى للإخراج هو 131,072. ويأتي عدد المعاملات الإجمالي البالغ نحو 1.6 تريليون / 48 مليارًا نشطًا من البيانات الوصفية لموقع Meituan ومن التغطية التجارية الصينية، لا من التوثيق. لا يوجد له مستودع على HuggingFace أو في منظمة Meituan على GitHub، كما تسجّل البيانات الوصفية للكتالوج التي يشحنها OpenCode أن خاصية الأوزان المفتوحة هي false.
البُعد الذي قد تغفله لوحة النتائج تمامًا
يختلف هذان النموذجان في أمرٍ لا يقيسه أي معيار، وبالنسبة لكثير من الفرق يحسم هذا الأمر المسألة من تلقاء نفسه: ما الذي يحدث للمطالبات التي ترسلها.
تقول وثائق OpenCode الخاصة إن LongCat 2.5 Preview Free تُقدَّم من مزوّد يتبع سياسة عدم الاحتفاظ بالبيانات مطلقًا ولا يستخدم بياناتك للتدريب؛ ويضع جدول الخصوصية Zen أرقامًا على ذلك — تدريب النموذج "Not used"، والاحتفاظ بالبيانات "0 days". ويسرد جدول الخصوصية نفسه ثلاثين يومًا من الاحتفاظ بالنسبة إلى Grok 4.6 وGrok 4.7. كلا هذين البيانين صادران عن OpenCode، ومنشوران على صفحات OpenCode، وهما يصفان تحديدًا القائمة المجانية وقائمة المقارنة. ولكن إذا كنت توجّه وكيلًا نحو مستودع خاص، فهذا هو الفرق بين محادثة لا يتعين عليك إجراؤها مع الفريق القانوني وأخرى يتعين عليك إجراؤها — ولا علاقة لهذا بأي نموذج يسجّل نتيجة أفضل في SciCode.

ما الذي يمنحك إياه "measured" وما الذي لا يمنحك إياه
أرقام Grok 4.6 أفضل من أرقام LongCat-2.5-Preview في المعنى الوحيد المهم هنا: أنها موجودة. هذا لا يعني أن Grok 4.6 هو النموذج الأفضل. مؤشر البرمجة الخاص به البالغ 76.8 أقل من جيل Grok 4.7، والنموذج الذي قُورن به لم يعد في طليعة عائلته. خليفته المنشور لديه مؤشر ذكاء يبلغ 46.4 مقابل 44.3 لـ Grok 4.6، واستدعاء سياق طويل يبلغ 76.67 مقابل 80.33 لـ Grok 4.6 — لذا فخليفته ليس أفضل في كل محور، وهو بالضبط نوع التفصيل الذي يخفيه رقم الجيل.
هناك أيضًا تحفّظ يتعلق بالخدمة الحية يستحق التصريح به بوضوح، لأنه يتعارض مع القراءة المُطْرِية لكلا النموذجين. في عيّنتنا الخاصة من منصة التجريب لمدة سبعة أيام، لم يسجّل Grok 4.6 أي إنتاجية مقيسة ولا أي حركة توكنات، وهذا ما يبدو عليه غياب البيانات في ذلك العمود بدلًا من أن يكون حكمًا على الأداء. أما LongCat-2.5-Preview فلا توجد لدينا أي عيّنة خدمة خاصة به على الإطلاق، لأننا لا نوجّه إليه أي حركة. لذا فإن أي مقارنة زمن استجابة بين هذين النموذجين هي مقارنة أحادية الجانب بطريقة اعتاد الكلام أن يطمسها: فلا يمكنك أن تقيس أداء نموذج لا ترسل إليه أي حركة.
حيث تساعد طبقة التوجيه فعلاً هنا
ثلاث من الحقائق أعلاه من النوع الذي بُني من أجله الموجّه بدلًا من كونه متوافقًا معه فحسب. ترتفع بطاقة أسعار Grok 4.6 عند تجاوز 200,000 رمز إدخال، لذا يمكن محاسبة المهمة المنطقية نفسها بمعدّلين مختلفين تبعًا لرقم يعرفه تطبيقك مسبقًا قبل أن يرسل أي شيء. ولدى Grok 4.6 خلف معلن بأسعار متطابقة، ما يعني أن الانتقال من أحدهما إلى الآخر ينبغي أن يكون تغييرًا من سطر واحد، لا إعادة تكامل. وأكثر ما يجذب في LongCat-2.5-Preview — وهو سعره — صنّفه المورّد صراحةً بأنه مؤقت.
على OrcaRouter نقدّم Grok 4.6 بـسعر قائمة xAI مع دون أي هامش ربح، لذا يصل تغيير سعر المورّد إلى فاتورتك في اليوم نفسه بدلًا من التجديد التالي، والتبديل التلقائي عند الفشل ينقل طلبًا متدهورًا إلى مزوّد سليم دون أن يعرف كودك أيّهما استجاب. تغطّي لغة توجيه DSL حالة التسعير المتدرّج مباشرةً، ويغطّي دمج النماذج الحالة التي يكون فيها النموذج الذي تريده للقراءة الطويلة ليس النموذج الذي تريده للتركيب النهائي. LongCat-2.5-Preview ليس أحد مساراتنا — نحن لا نقدّمه، ولا شيء هنا يدّعي خلاف ذلك. الغرض من ذكره ليس توجيهك إلى مكان آخر؛ بل إن النموذج الذي تقيّمه بدلًا من تشغيله ينتمي خلف المفتاح نفسه الذي تنتمي إليه النماذج التي تشغّلها، بحيث تكلّفك عملية تقييمه إدخال إعداد بدلًا من مشروع كامل.

كيف تقرر
• اختر Grok 4.6 إذا كنت بحاجة إلى إجابة يمكنك الدفاع عنها. فهو يمتلك بطاقة مستقلة، وملف مدخلات موثّق، وسعر لا ينتهي. الخطر الرئيسي ليس الجودة بل الصلة: Grok 4.7 موجود بنفس الأسعار، وتكلفة البقاء على 4.6 بدافع الجمود هي الفرق بين Intelligence Index بقيمة 44.3 و46.4 لم يكن عليك دفعه.
• اختر LongCat-2.5-Preview إذا كان العامل الحاسم هو الاحتفاظ أو الانتشار. إن الوصول دون احتفاظ عبر OpenCode، ونافذة بمليون توكن، وسقف إخراج يبلغ 131,072 توكنًا، وبطاقة أسعار تعادل نحو سُبع أسعار Grok 4.6 هي مزايا حقيقية — أولها موثّق في سياسة خصوصية طرف ثالث، والباقي يؤكده المورّد وحده.
• لا تختر بينهما بناءً على جدول مقاييس، لأنه لا يوجد سوى جدول واحد. فدرجة 76.8 في البرمجة و80.3 في استرجاع السياق الطويل لدى Grok 4.6 تصف Grok 4.6. ولا شيء يصف LongCat-2.5-Preview بعد. وأي شخص ينشر درجة LongCat-2.5-Preview إلى جانب درجة Grok 4.6 هذا الأسبوع فهو إما يقتبس نموذج LongCat مختلفًا أو يختلق الرقم.
• تحقق من جانب الإدخال قبل أن تبني عليه. يبدأ سجل تغييرات Meituan بفهم الصور، لكن الاستجابة النموذجية في وثائق "Retrieve Model" الخاصة به لا تزال تُظهر input_modalities كـ ["text"] مع text->text كسلسلة نمط — مُدّعى من المورّد مقابل عقد منشور ينص على خلاف ذلك. يتعامل Grok 4.6 مع النصوص والصور والملفات دون هذا الغموض. وتحقق من أن أداة الاختبار الخاصة بك تُظهر بشكل متداخلreasoning_content حقلًا قبل أن تستنتج أي شيء عن جودة استدلال LongCat-2.5-Preview؛ فالعميل الذي يُسقط ذلك الحقل سيفشل بصمت.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
