بطاقة عنوان رئيسية مُولَّدة تحمل نص 'LongCat-2.5-Preview vs Grok 4.6' مع سطر علوي يقول 'أحدهما لديه بطاقة معايير، والآخر لديه خليفة'، ولوحتان: 'LongCat-2.5-Preview: سياق 1M، صفر احتفاظ عبر OpenCode' و'Grok 4.6: AA Coding 76.8، وGrok 4.7 صدر بالفعل'. شعار OrcaRouter في أسفل اليمين.
Guides & Insights

LongCat-2.5-Preview مقابل Grok 4.6: أحدهما لديه بطاقة اختبار معياري، والآخر لديه خليفة

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

مقارنة LongCat-2.5-Previewمع Grok 4.6 محرجة لسبب لا علاقة له بجودة أي من النموذجين: فالسؤال له تاريخ صلاحية. أُطلِق Grok 4.6 في 12 أغسطس 2026، وأُطلِق Grok 4.7 في 21 سبتمبر 2026 — قبل ستة أيام من كتابة هذا — بالسعر نفسه البالغ 2.00 دولار / 6.00 دولارات لكل مليون، ونافذة السياق نفسها البالغة 500,000 رمز. أما LongCat-2.5-Preview فقد ظهر على منصة LongCat API الخاصة بـ Meituan في 25 سبتمبر 2026، دون أي خليفة معلن في الأفق ودون أي معيار منشور على الإطلاق. لذا فالخيار الحقيقي ليس "أي النموذجين أفضل". بل هو ما إذا كنت تريد قدرة مقيسة يقف خلفها بالفعل خليفة مقيس، أم قدرة غير مقيسة هي على الأقل الشيء الحالي.

هذا التأطير أقل إثارةً من لوحة النتائج وأكثر فائدةً بكثير.

ابدأ بما هو موجود فعلاً في سجلات Grok 4.6

Grok 4.6 هو نموذج موثّق جيدًا. في كتالوجنا، يوفّر نافذة سياق تبلغ 500,000 توكن، وإدخالًا نصيًا وصوريًا وملفات، وبطاقة أسعار قدرها 2.00 دولار لكل مليون توكن إدخال، و6.00 دولار لكل مليون توكن إخراج، و0.50 دولار لكل مليون توكن إدخال مخزّن مؤقتًا، لترتفع إلى 4.00 و12.00 دولارًا لما يزيد عن 200,000 توكن إدخال. ويتضمن ملفه التعريفي المستقل من Artificial Analysis مؤشر Coding Index عند 76.8 — الخامس بين النماذج التي يتتبعها ذلك المؤشر — ومؤشر Intelligence Index عند 44.3 في المرتبة الثامنة عشرة، وGPQA Diamond عند 94.9%، وHumanity's Last Exam عند 42.9%، وSciCode عند 56.5%، وTerminal-Bench v2.1 عند 88.4، وτ²-Bench للخدمات المصرفية عند 50.7. وLong-Context Recall الخاص به 80.3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

لا يملك LongCat-2.5-Preview أيًا من ذلك. إن مدخل سجل التغييرات الخاص بـ Meituan بتاريخ 25 سبتمبر 2026 هو إشعار توافر مؤرّخ يسرد ثلاث قدرات مزعومة — فهم الصور، والبرمجة، والتوافق مع «Claude Code وبيئات التطوير السائدة الأخرى» بما في ذلك Hermes وOpenClaw وOpenCode وKilo Code — ولا شيء يشبه نتيجة. وتعطي صفحة أسعار المورّد 0.30 دولار لكل مليون رمز إدخال غير مخزّن مؤقتًا، و0.006 دولار لكل مليون رمز إدخال مخزّن مؤقتًا، و1.20 دولار لكل مليون رمز إخراج، مع الإشارة صراحةً إلى أنها خصم لفترة محدودة. نافذة السياق هي 1,000,000 رمز؛ والحد الأقصى للإخراج هو 131,072. ويأتي عدد المعاملات الإجمالي البالغ نحو 1.6 تريليون / 48 مليارًا نشطًا من البيانات الوصفية لموقع Meituan ومن التغطية التجارية الصينية، لا من التوثيق. لا يوجد له مستودع على HuggingFace أو في منظمة Meituan على GitHub، كما تسجّل البيانات الوصفية للكتالوج التي يشحنها OpenCode أن خاصية الأوزان المفتوحة هي false.

البُعد الذي قد تغفله لوحة النتائج تمامًا

يختلف هذان النموذجان في أمرٍ لا يقيسه أي معيار، وبالنسبة لكثير من الفرق يحسم هذا الأمر المسألة من تلقاء نفسه: ما الذي يحدث للمطالبات التي ترسلها.

تقول وثائق OpenCode الخاصة إن LongCat 2.5 Preview Free تُقدَّم من مزوّد يتبع سياسة عدم الاحتفاظ بالبيانات مطلقًا ولا يستخدم بياناتك للتدريب؛ ويضع جدول الخصوصية Zen أرقامًا على ذلك — تدريب النموذج "Not used"، والاحتفاظ بالبيانات "0 days". ويسرد جدول الخصوصية نفسه ثلاثين يومًا من الاحتفاظ بالنسبة إلى Grok 4.6 وGrok 4.7. كلا هذين البيانين صادران عن OpenCode، ومنشوران على صفحات OpenCode، وهما يصفان تحديدًا القائمة المجانية وقائمة المقارنة. ولكن إذا كنت توجّه وكيلًا نحو مستودع خاص، فهذا هو الفرق بين محادثة لا يتعين عليك إجراؤها مع الفريق القانوني وأخرى يتعين عليك إجراؤها — ولا علاقة لهذا بأي نموذج يسجّل نتيجة أفضل في SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

ما الذي يمنحك إياه "measured" وما الذي لا يمنحك إياه

أرقام Grok 4.6 أفضل من أرقام LongCat-2.5-Preview في المعنى الوحيد المهم هنا: أنها موجودة. هذا لا يعني أن Grok 4.6 هو النموذج الأفضل. مؤشر البرمجة الخاص به البالغ 76.8 أقل من جيل Grok 4.7، والنموذج الذي قُورن به لم يعد في طليعة عائلته. خليفته المنشور لديه مؤشر ذكاء يبلغ 46.4 مقابل 44.3 لـ Grok 4.6، واستدعاء سياق طويل يبلغ 76.67 مقابل 80.33 لـ Grok 4.6 — لذا فخليفته ليس أفضل في كل محور، وهو بالضبط نوع التفصيل الذي يخفيه رقم الجيل.

هناك أيضًا تحفّظ يتعلق بالخدمة الحية يستحق التصريح به بوضوح، لأنه يتعارض مع القراءة المُطْرِية لكلا النموذجين. في عيّنتنا الخاصة من منصة التجريب لمدة سبعة أيام، لم يسجّل Grok 4.6 أي إنتاجية مقيسة ولا أي حركة توكنات، وهذا ما يبدو عليه غياب البيانات في ذلك العمود بدلًا من أن يكون حكمًا على الأداء. أما LongCat-2.5-Preview فلا توجد لدينا أي عيّنة خدمة خاصة به على الإطلاق، لأننا لا نوجّه إليه أي حركة. لذا فإن أي مقارنة زمن استجابة بين هذين النموذجين هي مقارنة أحادية الجانب بطريقة اعتاد الكلام أن يطمسها: فلا يمكنك أن تقيس أداء نموذج لا ترسل إليه أي حركة.

حيث تساعد طبقة التوجيه فعلاً هنا

ثلاث من الحقائق أعلاه من النوع الذي بُني من أجله الموجّه بدلًا من كونه متوافقًا معه فحسب. ترتفع بطاقة أسعار Grok 4.6 عند تجاوز 200,000 رمز إدخال، لذا يمكن محاسبة المهمة المنطقية نفسها بمعدّلين مختلفين تبعًا لرقم يعرفه تطبيقك مسبقًا قبل أن يرسل أي شيء. ولدى Grok 4.6 خلف معلن بأسعار متطابقة، ما يعني أن الانتقال من أحدهما إلى الآخر ينبغي أن يكون تغييرًا من سطر واحد، لا إعادة تكامل. وأكثر ما يجذب في LongCat-2.5-Preview — وهو سعره — صنّفه المورّد صراحةً بأنه مؤقت.

على OrcaRouter نقدّم Grok 4.6 بـسعر قائمة xAI مع دون أي هامش ربح، لذا يصل تغيير سعر المورّد إلى فاتورتك في اليوم نفسه بدلًا من التجديد التالي، والتبديل التلقائي عند الفشل ينقل طلبًا متدهورًا إلى مزوّد سليم دون أن يعرف كودك أيّهما استجاب. تغطّي لغة توجيه DSL حالة التسعير المتدرّج مباشرةً، ويغطّي دمج النماذج الحالة التي يكون فيها النموذج الذي تريده للقراءة الطويلة ليس النموذج الذي تريده للتركيب النهائي. LongCat-2.5-Preview ليس أحد مساراتنا — نحن لا نقدّمه، ولا شيء هنا يدّعي خلاف ذلك. الغرض من ذكره ليس توجيهك إلى مكان آخر؛ بل إن النموذج الذي تقيّمه بدلًا من تشغيله ينتمي خلف المفتاح نفسه الذي تنتمي إليه النماذج التي تشغّلها، بحيث تكلّفك عملية تقييمه إدخال إعداد بدلًا من مشروع كامل.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

كيف تقرر

• اختر Grok 4.6 إذا كنت بحاجة إلى إجابة يمكنك الدفاع عنها. فهو يمتلك بطاقة مستقلة، وملف مدخلات موثّق، وسعر لا ينتهي. الخطر الرئيسي ليس الجودة بل الصلة: Grok 4.7 موجود بنفس الأسعار، وتكلفة البقاء على 4.6 بدافع الجمود هي الفرق بين Intelligence Index بقيمة 44.3 و46.4 لم يكن عليك دفعه.

• اختر LongCat-2.5-Preview إذا كان العامل الحاسم هو الاحتفاظ أو الانتشار. إن الوصول دون احتفاظ عبر OpenCode، ونافذة بمليون توكن، وسقف إخراج يبلغ 131,072 توكنًا، وبطاقة أسعار تعادل نحو سُبع أسعار Grok 4.6 هي مزايا حقيقية — أولها موثّق في سياسة خصوصية طرف ثالث، والباقي يؤكده المورّد وحده.

• لا تختر بينهما بناءً على جدول مقاييس، لأنه لا يوجد سوى جدول واحد. فدرجة 76.8 في البرمجة و80.3 في استرجاع السياق الطويل لدى Grok 4.6 تصف Grok 4.6. ولا شيء يصف LongCat-2.5-Preview بعد. وأي شخص ينشر درجة LongCat-2.5-Preview إلى جانب درجة Grok 4.6 هذا الأسبوع فهو إما يقتبس نموذج LongCat مختلفًا أو يختلق الرقم.

• تحقق من جانب الإدخال قبل أن تبني عليه. يبدأ سجل تغييرات Meituan بفهم الصور، لكن الاستجابة النموذجية في وثائق "Retrieve Model" الخاصة به لا تزال تُظهر input_modalities كـ ["text"] مع text->text كسلسلة نمط — مُدّعى من المورّد مقابل عقد منشور ينص على خلاف ذلك. يتعامل Grok 4.6 مع النصوص والصور والملفات دون هذا الغموض. وتحقق من أن أداة الاختبار الخاصة بك تُظهر بشكل متداخلreasoning_content حقلًا قبل أن تستنتج أي شيء عن جودة استدلال LongCat-2.5-Preview؛ فالعميل الذي يُسقط ذلك الحقل سيفشل بصمت.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا