
كلود فيبل 5.1 ضد جروك 4.6: تسع نقاط مؤشر وسعر مخرجات بثمانية أضعاف — ما الذي يشتريه الفارق فعليًا؟
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123الذكاء49البرمجة
كلود فابل 5.1 وGrok 4.6 هما النموذجان الحدوديان المغلقان اللذان يحددان نطاق أسعار الجيل الحالي. أحدث طراز رائد من Anthropic، الذي صدر في 1 سبتمبر 2026، يتقاضى 10.00 دولارًا لكل مليون رمز إدخال و50.00 دولارًا لكل مليون رمز إخراج، وفي النسخة الحالية من Intelligence Index الخاص بـ Artificial Analysis يحتل المرتبة 53 — الأولى بين 201 نموذج يتتبعها هذا المؤشر. أما Grok 4.6 من SpaceXAI، المتاح منذ 12 أغسطس، فيتقاضى 2.00 دولارًا و6.00 دولارات لنفس الوحدات، ويحقق 44 نقطة، في المرتبة العشرين من 201. تفصل بينهما تسع نقاط في المؤشر. وتفصل بينهما ثمانية أضعاف سعر الإخراج. أيٌّ من هذين الرقمين ينبغي لحمولة عمل معيّنة أن تهتم به هو السؤال برمّته؛ إذ يشيران إلى اتجاهين مختلفين بحسب ما تطلب من النموذج إنجازه.
المصادر، مُعلنة مقدمًا: أعادت Artificial Analysis تسجيل مؤشر الذكاء الخاص بها في سبتمبر، لذا فإن الأرقام هنا مأخوذة من النسخة الحالية، التي التُقطت في 10 سبتمبر 2026، وليس من المقياس الأقدم الذي لا يزال مُستشهدًا به في الكثير من تغطية أغسطس. درجات المؤشر من نسخ مختلفة غير قابلة للمقارنة، ولهذا قد تبدو الأرقام أدناه أقل مما قرأته عن أي من النموذجين عند الإطلاق. كل ما يُصنف بأنه مُبلَّغ من البائع يأتي من ورقة التقييم الخاصة بالمختبر المُطلق ولم يتم التحقق منه من قبل طرف محايد. هذا التحفظ يزن بشكل غير متساوٍ هنا — فقد خضع Grok 4.6 لشهر من التدقيق الخارجي، بينما يبلغ عمر Claude Fable 5.1 تسعة أيام ومعظم ما هو معروف علنًا عن أرقامه الرئيسية لا يزال كلام Anthropic.
مختبران، شيئان مختلفان معروضان للبيع
إصدار سبتمبر من أنثروبيك هو استعراض قدرات مع قصة أمان ملحقة به. Claude Fable 5.1 هو التوأم المتاح عمومًا لـ Claude Mythos 5.1، الشقيق المقيّد بإجراءات السلامة الذي لا يصل إلا إلى مؤسسات الأمن السيبراني وعلوم الحياة الموثوقة — نفس النموذج الأساسي، وضوابط مختلفة. ما تبيعه أنثروبيك هو صدارة المؤشر المستقل، ونافذة سياق تبلغ مليون رمز، وما يصل إلى 128 ألف رمز إخراج في استجابة واحدة، ونظام بيئي للوكلاء مبني حول Claude Code وتطبيقات Claude. الرسالة مباشرة: هذا هو النموذج الذي تستدعيه عندما يكون العمل صعبًا بما يكفي بحيث تكلف الإجابة الخاطئة أكثر من تكلفة الرموز.
تبيع SpaceXAI شيئًا أضيق، ومع مرور الوقت أكثر عدوانية — أرخص نموذج لا يزال في فئة الحدود التقنية، بسعر منخفض بما يكفي ليجعل بناء الوكلاء على أي شيء آخر يبدو باهظًا. Grok 4.6 ليس توسيعًا: إنه نفس الأساس الذي يعتمد عليه Grok 4.5 مع تشغيل تدريب تكميلي أطول وتعلم تعزيزي أثقل، وهو ما يقول البائع إنه يشتري "ذكاءً مشابهًا لـ GPT-5.6 Sol وClaude Fable 5." بسعر 2/6 دولارات، وما زال ضمن العشرين الأوائل في المؤشر، هذه هي الحجة كلها. إنها أيضًا استراتيجية، وليست مجرد سعر. تمتلك SpaceXAI تطبيق Cursor، وأطلقت وكيل المتصفح Grok Bot في اليوم السابق للنموذج، وتدير تطبيقات الدردشة الاستهلاكية الخاصة بها؛ نموذج حدودي بأسعار السلع الأساسية هو وقود لجميع هذه الأشياء. إن الحسابات العامة لإيلون ماسك — إيرادات الذكاء الاصطناعي تتجاوز كل قطاعات الشركة الأخرى، 10 جيجاواط من الحوسبة — تشير إلى الاتجاه نفسه. هذا النموذج ليس مسعّرًا لتعظيم هامش واجهة برمجة التطبيقات.
ورقة المواصفات، بُعدًا بعد بُعد.
• السعر لكل مليون توكن — Claude Fable 5.1: 10.00 دولارًا للإدخال / 50.00 دولارًا للإخراج مقابل Grok 4.6: 2.00 دولارًا للإدخال / 6.00 دولارًا للإخراج.
• المدخلات المخزنة مؤقتًا — Claude Fable 5.1 بسعر 0.25 دولار لكل مليون مقابل Grok 4.6 بسعر 0.50 دولار، وتُدرج Artificial Analysis خصمًا فعالًا للتخزين المؤقت بنسبة 98% مقابل 75%.
تسعير السياق الطويل — يوفّر Claude Fable 5.1 سعرًا ثابتًا لنافذته حتى 1M رمز؛ بينما يعيد Grok 4.6 تسعير الطلب بالكامل إلى 4.00 دولار / 12.00 دولار / 1.00 دولار بمجرد تجاوزه 200K رمز إدخال، لذا يتراجع خصمه تحديدًا في المكان الذي تعمل فيه عمليات الوكلاء الطويلة.
• السياق والإخراج — تحمل Claude Fable 5.1 نافذة سياق تبلغ 1M رمزًا وما يصل إلى 128K رمزًا للإخراج، مقابل نافذة سياق Grok 4.6 البالغة 500K رمزًا، ومقبض جهد تفكير يمتد من منخفض إلى xhigh، ونسخة أسرع بضعف المعدل.
النتيجة المستقلة والسرعة والتكلفة — تُظهر Artificial Analysis أن Claude Fable 5.1 حصل على 53 في مؤشر الذكاء الحالي (#1 من 201)، و67.2 رمز إخراج في الثانية، و7.63 دولارًا لكل مهمة مؤشر؛ بينما يحل Grok 4.6 عند 44 (#20 من 201)، و52.8 رمزًا في الثانية، و1.86 دولارًا لكل مهمة. ويُصنف النموذجان على أنهما «مطيلان جدًا» أو «مطيلان إلى حد ما» وفقًا لهذا القياس — 190 مليون رمز إخراج لنموذج Claude مقابل 94 مليون لنموذج Grok.
• ادعاءات معايير البائعين — أفادت أنثروبيك بنسبة 52.6% على Terminal-Bench-Science 0.1 (أكثر من ضعف نسبة 24.7% التي حققها Claude Fable 5)، و55.8% على Terminal-Bench 4.0 و1,853 على GDPval-AA v2 لصالح Claude Fable 5.1. وأفادت SpaceXAI بنسبة 65.9% على DeepSWE v1.1 و69.9% على CursorBench v3.2 لصالح Grok 4.6، إلى جانب نسبة 26% أبلغت عنها ذاتيًا على Terminal-Bench v3.0 — وهو السطر الوحيد في جدول البائع الذي يُعتبر ضعيفًا بشكل ملحوظ.
• أين يعمل كل منها — واجهة برمجة تطبيقات Anthropic، وتطبيقات Claude، وClaude Code، وAmazon Bedrock، وGoogle Cloud، وMicrosoft Foundry مقابل واجهة برمجة تطبيقات SpaceXAI، وCursor، وGrok Build، ووكيل Grok Bot، وتطبيقات Grok للمستهلكين، وAmazon Bedrock GovCloud.
• تم الإصدار — Claude Fable 5.1 في 1 سبتمبر 2026؛ Grok 4.6 في 12 أغسطس 2026.

ماذا تمثل تسع نقاط مؤشر فعليًا؟
في المؤشر المستقل الحالي، ترتيب سبتمبر لا لبس فيه: Claude Fable 5.1 عند 53 والأول من 201، وGrok 4.6 عند 44 والعشرون. يحتاج المؤشر المعاد تسجيله إلى توضيح واحد، لأنه من الأشياء التي تجعل أرقام أسبوع الإطلاق تبدو خاطئة بأثر رجعي: أعادت Artificial Analysis صياغة مؤشر Intelligence Index في سبتمبر، وانخفضت النتائج المنشورة لكلا النموذجين عندما فعلت ذلك. فارق التسع نقاط حقيقي، لكن المؤشر مركب موزون — يميل بشدة نحو الأعمال الوكيلية، مع البرمجة والاستدلال العلمي والقدرة العامة خلفه — لذا فهو يضغط صورة مختلطة حسب الأبعاد في سطر واحد.
الأدلة على مستوى الأبعاد أكثر ضجيجًا وأكثر فائدة. رقم Anthropic الخاص في Terminal-Bench-Science 0.1 — البالغ 52.6%، أي أكثر من ضعف نسبة 24.7% في الجيل السابق — يستهدف تحديدًا سير العمل العلمي والبحثي طويل الأمد التي تهم المشترين الوكلاء، ولا يقترب منه أي نموذج حالي على هذا المعيار المحدد. جدول البائع الخاص بـ SpaceXAI هو الأقوى في هندسة البرمجيات (65.9% في DeepSWE v1.1، و69.9% في CursorBench v3.2) والأضعف في حلقات الوكلاء كثيفة استخدام الطرفية، حيث تأتي نسبة Grok 4.6 البالغة 26% على Terminal-Bench v3.0 أدنى من نسبة GPT-5.6 Sol Max البالغة 34.6% ونسبة Claude Fable 5 Max البالغة 34.1%. كلا الجدولين مُعلن من قبل البائعين وغير مُعاد إنتاجه؛ فهما يصفان حيث تعتقد كل مختبر أنها قوية، وليس من يفوز.

التفاصيل الدقيقة للرموز الرخيصة
ميزة السعر في Grok 4.6 حقيقية، وفي السياق القصير والمتوسط تكون هائلة: عبء عمل كثيف المخرجات يدفع حوالي 83% أقل لكل رمز مولّد مقارنةً بـ Claude Fable 5.1. لكن بطاقة الأسعار لها ثلاث حواف تتجاهلها عادةً المقارنات الحدودية.
الأول هو حد 200K. عبور 200,000 توكن إدخال يعيد تسعير الطلب بالكامل إلى $4/$12، وليس فقط التوكنات فوق الخط. بالنسبة لتشغيل وكيل طويل يراكم السياق — وهو بالضبط عبء العمل الذي تُباع به كلا النموذجين — يتضاعف المعدل الفعلي دون سابق إنذار ويتوقف عن كونه خُمس سعر كلود. الثاني هو النسخة الأسرع، التي تكلف ضعف المعدل الأساسي وهي الطريقة الوحيدة المعلنة لإصلاح سرعة إخراج النموذج الأقل من المتوسط. الثالث هو استدعاءات الأدوات من جانب الخادم، تُفوتر بشكل منفصل لكل ألف استدعاء.
Claude Fable 5.1 تسعيرة سبتمبر تغيّر الاتجاه المعاكس. السعر الاسمي $10/$50 لم يتحرك، لكن سعر القراءة من الكاش انخفض بنسبة 75% إلى $0.25 لكل مليون رمز، وهو المجال الذي تنفق فيه الجلسات الوكيلة الطويلة أموالها فعليًا: إعادة قراءة مخرجات الأدوات، ومحتويات الملفات، والجولات السابقة مرارًا وتكرارًا. يُظهر تحليل Artificial Analysis أن الخصم الفعلي الناتج للكاش يبلغ 98%، مقابل 75% لدى Grok. دفع ربع دولار لكل مليون رمز معاد قراءته يغيّر حسابات وكيل يعمل لساعات طويلة بطريقة لا يُظهرها السعر الرئيسي أبدًا.
الثقل المضاد الصادق هو الإسهاب، وهو السبب في أن فجوة التكلفة الحقيقية ليست ثمانية أضعاف. لأن نموذج Claude يصدر ضعف عدد الرموز تقريبًا لإنجاز نفس مهمة الفهرسة — 190 مليونًا مقابل 94 مليونًا لدى Grok — فإن مقياس التكلفة لكل مهمة في Artificial Analysis يصل إلى 7.63 دولارًا لـ Claude Fable 5.1 مقابل 1.86 دولارًا لـ Grok 4.6. هذا عامل يقارب أربعة، وليس ثمانية، وهو الرقم الذي يجب التخطيط للميزانية على أساسه.
الفرق الذي لا يظهر في الجدول أبدًا
زمن الاستجابة (الكمون) هو المجال الذي يتباين فيه النموذجان بالنسبة للمنتجات التفاعلية، والنتيجة هي عكس ما يوحي به السعر. تقيس Artificial Analysis نموذج Claude Fable 5.1 عند 67.2 رمزًا مخرجًا في الثانية — فوق متوسط فئته — مقابل 52.8 لنموذج Grok 4.6، والذي يصنّفه هذا القياس دون المتوسط؛ وقد وصف ملخص المؤشر لنموذج Grok بأنه أبطأ من نظرائه بشكل صريح، وهذا هو بالضبط السبب الذي يجعل SpaceXAI تبيع نسخة أسرع بضعف السعر. كما أن نموذج Anthropic، وفقًا لنفس الملاحظة المستقلة، هو الأكثر إسهابًا بين النموذجين. إذن، النموذج الرخيص هو الأبطأ، والنموذج الغالي يكتب أكثر من اللازم: تكلفتان تتجهان في اتجاهين متعاكسين، ولا تظهر أيٌّ منهما في بطاقة الأسعار.
مناداة كليهما دون الالتزام بأي منهما اليوم
النتيجة العملية لفجوة تسع نقاط، وفارق أربعة أضعاف في التكلفة لكل مهمة، وبطاقة أسعار مليئة بالطبقات، هي أن معظم الفرق يجب أن تشغّل كليهما، والسؤال المثير للاهتمام هو أين يقع موضع التبديل. وهذا أرخص مما يبدو: Claude Fable 5.1 وGrok 4.6 كلاهما متاحان على OrcaRouter بأسعار القائمة الخاصة بمزوديهما دون أي هامش ربح — فالمبالغ $2/$6 و$10/$50 أعلاه هي الأرقام التي تظهر في الفاتورة، وأي تغيير في أسعار البائع ينتقل في نفس اليوم بدلاً من أن يُمتص في هامش إعادة البيع. نقطة نهاية واحدة تغطي كليهما، لذا فإن نمط التصعيد هو قاعدة توجيه بدلاً من عقدٍ ثانٍ: أرسل الأعمال عالية الحجم والواضحة النطاق إلى Grok 4.6، وصعّد إلى Claude Fable 5.1 عندما تتطلب المهمة سقف التفكير، ودع التبديل التلقائي يغطي الحالة التي تكون فيها إنتاجية النموذج الأرخص بطيئة جدًا لموعد تسليم. لغة التوجيه (DSL) تعبّر عن هذه السلسلة في مكان واحد، واندماج النماذج يتيح للوحة من النماذج الإجابة معًا عندما تكون المهمة مهمة بما يكفي للحصول على أكثر من رأي واحد. عندها تتوقف فجوة السعر عن كونها قرارًا تتخذه مرة واحدة وتصبح خطًا تضبطه مع تغيّر مزيج عبء العمل لديك.

من الذي يجب أن يختار ماذا
اختر Claude Fable 5.1 عندما تكون تكلفة الإجابة الخاطئة أو المهجورة أكبر من تكلفة الرموز: الأبحاث الوكيلة طويلة الأمد، والاستدلال الصعب، والعمل الخاضع للتنظيم حيث تكون حدود الأمان لدى Anthropic وضوابط الاحتفاظ بالبيانات الصفرية المرحلية مهمة، وأي شيء يعمل داخل Claude Code. اختر Grok 4.6 عندما يكون العمل كبير الحجم، ومحدد النطاق جيدًا، ويتحمل الإنتاجية العالية — البرمجة الدفعية، والاستخراج، والتوليد، وحلقات الوكيل التي تكون دوراتها قصيرة بما يكفي لتبقى تحت خط إعادة التسعير 200K — وعندما تبني وكيلًا حيث يكون النموذج مكوّنًا وتكون تكلفة المهمة هي قضية العمل بأكملها.
يستحق الأمر مراقبة حلقتين مفتوحتين قبل أن يتبلور أي من الخيارين. لقد ألمحت SpaceXAI بالفعل مجددًا إلى Grok 4.7 للمدى القريب، وإذا ورثت نفس شريحة السعر مع قدرة أعلى، فإن صفقة اليوم تصبح من الطبقة المتوسطة خلال أسابيع. في هذه الأثناء، أظهرت Anthropic إيقاعًا شهريًا تقريبيًا واستعدادًا لخفض تسعير الكاش دون المساس بالأسعار الرئيسية، مما يشير إلى أن الخطوة التالية في هذه المواجهة قد تكون في جانب التكلفة وليس في المؤشر. لا تغيّر أي من الحلقتين ما تفعله النماذج اليوم، لكن كلتاهما سبب للإبقاء على معرّف النموذج كقيمة إعدادات. على نقطة نهاية واحدة مع تسعير التمرير وتجاوز الفشل، يكون ذلك هو الافتراضي وليس مشروعًا.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
