
Gemini 4 Argon مقابل Claude Opus 5.5: انقسام المعايير الذي لم يتوقعه أحد
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 223 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
Gemini 4 Argon وClaude Opus 5.5 يختلفان حول أيهما أفضل، والخلاف ليس ضجيجًا. على Intelligence Index التابع لـ Artificial Analysis، يفصل بينهما خمس نقاط لصالح Opus 5.5. أما على Vals Index — لوحة الأثر الاقتصادي المرجّحة بالناتج المحلي الإجمالي — فيحل Gemini 4 Argon في المرتبة الأولى ويحل Claude Opus 5.5 في المرتبة الثالثة، خلف كل من Argon وClaude Sonnet 5.5. وقد قاست كلتا اللوحتين النموذجين نفسهما في الأسبوع نفسه. هذه هي المقالة كلها: أيّهما ينبغي أن تختار يعتمد على ما إذا كان عملك أشبه بسؤال في امتحان أم بثلاثاء في مكتب محاماة، وعلى ما إذا كان لديك وصول API إلى Argon أصلًا، وهو ما لا يملكه اليوم أحد تقريبًا.
أعلنت Google عن Gemini 4 Argon في 2026-09-30 في منشور على DeepMind منسوب إلى Koray Kavukcuoglu، نائب الرئيس الأول لـ Google DeepMind وكبير المعماريين في الذكاء الاصطناعي. أصدرت Anthropic Claude Opus 5.5 قبل ذلك بثمانية أيام، في 2026-09-22. أحد هذين إصدار GA يمكنك استدعاؤه بعد ظهر اليوم. أما الآخر فهو طرح تدريجي لمجموعة محددة بالاسم من مدافعي الأمن السيبراني إضافة إلى مهندسي Google أنفسهم، مع نية معلنة للوصول إلى "عملاء API المدفوعين ومشتركي Google AI Ultra" بمجرد أن تصبح الضوابط جاهزة، دون تحديد موعد لذلك.
الجواب في سطر واحد، قبل التفصيل
إذا كنت تحتاج اليوم إلى أفضل استدلال عام مُقاس وتحتاجه على مفتاح إنتاجي، فإن Claude Opus 5.5 متاح على OrcaRouter الآن، أما Gemini 4 Argon فليس متاحًا على أي واجهة برمجة تطبيقات عامة. وإذا كنت تبني وكلاء للتمويل أو القانون أو الضرائب أو البرمجة يُقيَّمون على الناتج الاقتصادي لكل دولار، فأرقام Argon أفضل، وسعره خُمس سعر Opus 5.5 لكل مهمة على اللوحة الوحيدة التي تقيس ذلك بالضبط. وإذا كنت تعمل في الدفاع السيبراني للبنية التحتية الحيوية، فلدى Argon برنامج يمكنك التقديم إليه وقد تكون الإجابة نعم.
من أين يأتي كل رقم فعليًا
لوحتا مؤشرات، ومنهجيتان، ومن الجدير أن نكون دقيقين في تمييز أيّهما أيّ، لأن المعسكرين سيتبادلان الاقتباسات متجاوزين بعضهما بعضاً لأشهر.
• مؤشر الذكاء Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 عند 57.6 وGemini 4 Argon عند 52.6، وكلاهما مأخوذ من Artificial Analysis بتاريخ 2026-09-30. هذا مؤشر مركّب من عشرة تقييمات، وهو عام الأغراض عمدًا، وهو التصنيف الذي يستشهد به معظم الناس باعتباره التصنيف "المرجعي".
• مؤشر Vals، محدَّث في 2026-09-29 — Gemini 4 Argon أولاً عند 68.90% (±0.97)، وClaude Sonnet 5.5 ثانياً عند 67.04% (±0.92)، وClaude Opus 5.5 ثالثاً عند 66.97% (±0.89). يمنح Vals أوزاناً لمهام التمويل والبرمجة والقانون والضرائب وفق حصة كل قطاع من الناتج المحلي الإجمالي الأمريكي، لذا فإن نموذجاً متوسطاً في الألغاز لكنه ممتاز في مراجعة العقود والعمل على جداول البيانات يحقق نتيجة جيدة هنا.
فجوة خمس نقاط في AA حقيقية، وهي ليست صغيرة. وفجوة نقطتين في Vals حقيقية أيضًا، ومع فترات الثقة المطبوعة على لوحة الصدارة، فإن 68.90 ±0.97 لـ Argon مقابل 66.97 ±0.89 لـ Opus 5.5 يمثل فارقًا يقارب 1.5 خطأ معياري — أفضل من رمية عملة معدنية، لكنه أقل من أن يكون ساحقًا. لا واحدة من اللوحتين مخطئة. إنهما تقيسان مهمتين مختلفتين.

هناك تحفظ واحد يتعلق بالتهيئة، وهو يطعن في قراءة فجوة AA باعتبارها مقارنة نماذج خالصة. يُدرج Artificial Analysis نموذج Gemini 4 Argon عند إعداد الجهد المرتفع الخاص به، ويُدرج Claude Opus 5.5 عند "الاستدلال التكيفي، أقصى جهد، الوضع الافتراضي الاحتياطي". وهما ليسا النقطة نفسها على سلّمي الجهد، لذا فإن الرقم الرئيسي 57.6 مقابل 52.6 ليس مقارنة متماثلة عند ميزانيات استدلال متطابقة. إنه الرقم الذي تنشره كلتا الصفحتين، وهو الرقم الذي ينبغي الاقتباس به إذا كنت منصفًا مع Anthropic، لكنه ليس تجربة مضبوطة.
التكلفة لكل مهمة هي حيث تصبح الفجوة غير مريحة
تنشر Artificial Analysis أيضًا بيانًا محاسبيًا عن تكلفة تشغيل مجموعة مؤشراتها، وهنا لا يتقارب النموذجان.
• تكلفة كل مهمة فهرسة — Gemini 4 Argon 1.99$ مقابل Claude Opus 5.5 5.98$.
• تكلفة تشغيل مجموعة المؤشرات بالكامل — Gemini 4 Argon بقيمة $2,407 مقابل Claude Opus 5.5 بقيمة $8,708.
• سعر القائمة لكل مليون رمز — Gemini 4 Argon: 2 دولارات للإدخال / 10 دولارات للإخراج (السعر التمهيدي المعلن من Google، مع خصم 95% على الإدخال المخزَّن مؤقتًا، أي 0.10 دولار) مقابل Claude Opus 5.5: 4 دولارات للإدخال / 20 دولارًا للإخراج.
• معدل الإنتاجية — Gemini 4 Argon: 48.9 رمز إخراج في الثانية، وأول رمز بعد 2.79 ثانية؛ أما Claude Opus 5.5 فـ 92.2 رمز إخراج في الثانية، لكن زمن استجابة أول رمز يبلغ 702 ثانية على منصة الاختبار نفسها، وهي ضريبة التفكير الموسّع تظهر على المكشوف.
• تكلفة Vals لكل تشغيل — Gemini 4 Argon بسعر 15.68 دولارًا مقابل Claude Opus 5.5 بسعر 32.14 دولارًا على نفس مجموعة المهام المرجّحة حسب الناتج المحلي الإجمالي.
هناك مشكلة صغيرة تستحق الإشارة إليها بدلًا من التغاضي عنها: تُدرج لوحة صدارة Vals أسعار Argon على أنها 4 دولارات للإدخال / 20 دولارًا للإخراج، بينما يذكر إعلان Google 2 دولار للإدخال / 10 دولارات للإخراج خلال الفترة التمهيدية. التفسير الأرجح هو أن Vals تعرض سعر القائمة القياسي وأن Google تعرض سعرًا ترويجيًا، لكن هذا استنتاج وليس تصريحًا منشورًا من أي من الطرفين. إذا كانت ميزانيتك تعتمد على الرقم، فاسأل Google.
ما يدّعيه Argon وما تم التحقق منه

منشور Google مكتظ بالأرقام، وكل واحد منها مُبلَّغ عنه من المورّد. لم أعثر على أيٍّ منها أُعيد إنتاجه بشكل مستقل، كما أن اللوحات المستقلة الواردة أعلاه تقيس أشياء مختلفة عن تلك التي اختار Google إبرازها كعناوين رئيسية. وبصيغة ادعاءات Google نفسها:
• DeepSWE v1.1 — 77.9%، ويُوصف بأنه أحدث ما توصلت إليه هندسة البرمجيات الواقعية طويلة المدى.
• فهم الفيديو الطويل في LVBench — 91.7%، يوصف بأنه الأكثر تطوراً.
• AutomationBench (معيار Zapier لمهام الأعمال الشاملة من البداية إلى النهاية) — المرتبة الأولى بنسبة 51.3%.
• معالجة الثغرات الأمنية في CWE-bench v1 — المركز الأول مناصفةً بنسبة 68%، استنادًا إلى نتيجة Gemini 3.8 Flash Cyber في لوحة v0.
• Gray Swan Indirect Prompt Injection — وُصِف بأنه المتصدر، دون نشر أي رقم في المنشور.
• وكيل Vals المالي v2 وHarvey's Legal Agent Benchmark — وُصِفا بأنهما رائدان، وبالمثل دون رقم مطبوع في الإعلان.
عائلتا الادعاءات اللتان تحظيان حقًا بدعم مستقل هما الأجدر بالثقة: يؤكد Vals موضع المؤشر برقم ونطاق، ويؤكد Artificial Analysis مؤشرًا عند 52.6 والسعر. أما حكايات الإنتاجية الداخلية — تحسين بنسبة 40% عن خط أساس منشور في روتين فرعي كمي، وتحرير أكثر من 300 TiB من الذاكرة عبر أسطول Google بواسطة وكلاء Argon — فهي نتائج داخلية للشركة بلا اختبار خارجي، وينبغي قراءتها على هذا الأساس.
ما هو Opus 5.5، إذا كنت تعيش تحت صخرة
Claude Opus 5.5 هو النموذج الرائد من Anthropic: سياق يبلغ مليون توكن، وحد أقصى للإخراج يبلغ 128 ألفًا، وإدخال متعدد الوسائط يشمل النص والصورة والملف، وتفكير موسّع، واستخدام الأدوات والمخرجات المهيكلة. وقد خلف Claude Opus 5 في 22 سبتمبر 2026، ويرجّح كثيرون أن العنوان الأبرز لإطلاقه كان السعر المخفّض — فقد انخفضت الفئة بدلًا من أن ترتفع، إلى $4/$20 مع قراءات مخزّنة بسعر $0.20. وهو اليوم قابل للتوجيه على OrcaRouter بهذا السعر نفسه بالضبط، مع تمرير سعر قائمة المزوّد دون أي هامش ربح، وأي تغيير في سعر المورّد يُطبَّق لدينا في اليوم نفسه الذي يُطبَّق فيه لديهم.
بالنسبة إلى الدرجات على مستوى المهمة التي يمتلكها كلا النموذجين، فإن الصورة هي أرجوحة حقيقية وليست اكتساحًا:
• تيرمينال-بنش 4.0 — Claude Opus 5.5 بنسبة 59.6% مقابل Gemini 4 Argon بنسبة 57.1%.
• SciCode — Claude Opus 5.5 بنسبة 66.9% مقابل Gemini 4 Argon بنسبة 61.8%.
• امتحان البشرية الأخير — Claude Opus 5.5 بنسبة 61.4% مقابل Gemini 4 Argon بنسبة 57.1%.
• الاستدلال بالسياق الطويل — Claude Opus 5.5 بنسبة 84.7% مقابل Gemini 4 Argon بنسبة 79.7%.
• CritPt — Claude Opus 5.5 بنسبة 31.7% مقابل Gemini 4 Argon 27.1%.
• المعرفة الكلية — Claude Opus 5.5 بنتيجة 46.4 مقابل Gemini 4 Argon بنتيجة 42.4.
• GDPval — Claude Opus 5.5: 1,846 مقابل Gemini 4 Argon: 1,611.
• AutomationBench-AA — Gemini 4 Argon بنسبة 77.5% مقابل Claude Opus 5.5 بنسبة 69.5%. هذه هي النتيجة الوحيدة في المواجهات المباشرة على المهام التي يفوز فيها Argon بوضوح، وهي أيضًا عائلة المهام الأقرب إلى ما تكافئه Vals Index.
إذن النمط متّسق: يتقدّم Opus 5.5 في سلّم الاستدلال ذي الطابع الأكاديمي، ويتقدّم Argon في تنفيذ المهام من البداية إلى النهاية. لم يعد ذلك تناقضًا بين اللوحتين. إنه النتيجة نفسها معبَّرًا عنها مرتين.
القدرة التي لا يقارن أحد على أساسها
سقف الإخراج لدى Gemini 4 Argon هو 1,000,000 رمز في مسار واحد، ارتفاعًا من 64K في الجيل السابق. ويحدّ Claude Opus 5.5 الإخراج عند 128K. يمتلك كلاهما نافذة سياق بسعة مليون رمز، لكن السياق والإخراج ميزانيتان مختلفتان، وهذه أكبر قفزة في مواصفة واحدة في الإعلان.
ما إذا كان ذلك مهمًا يعتمد كليًا على ما تشغّله. سقف الإخراج البالغ 128K سخيّ بالنسبة للدردشة، ومراجعة الشيفرة، والاستخراج المُهيكل، وخطوات الوكيل. لكنه جدار صلب عند توليد مجموعة كاملة من تصحيحات الترحيل، أو تقرير تدقيق شامل، أو مستند طويل في تمريرة واحدة — وهي سير العمل التي اختارت Google توضيح الإطلاق بها. إذا كانت خط أنابيبك تُسلسل عشرين استدعاءً للبقاء تحت السقف، فإن سقف Argon سيوفر عليك زمن الاستجابة وكود التنسيق. وإذا لم تكن كذلك، فأنت تدفع مقابل هامش إضافي لن تستخدمه.
التوافر هو المتغير الحاسم، وليس الجودة
هذا هو الجزء من المقارنة الذي لا يرتبط بأي معيار، وهو يهم أكثر من جميعها.
Gemini 4 Argon ليس متاحًا على نطاق عام. يقول منشور Google إنه يُطرح للمدافعين السيبرانيين الموثوقين عبر Fairwind Program، وإن الشركة منخرطة في عملية الوصول الطوعي إلى النماذج قبل إصدارها الخاصة بالحكومة الأمريكية، وإن الوصول الأوسع للمطورين والشركات والمستهلكين سيأتي "في أقرب وقت ممكن"، بدءًا من عملاء API المدفوعين ومشتركي Google AI Ultra. لا يوجد معرّف للنموذج، ولا نقطة نهاية، ولا حصة معلنة، ولا موعد. وهو ليس في كتالوجنا، وليس في أي واجهة API عامة أخرى أيضًا، لذا لا توجد بعد صفحة تسعير خاصة بـ Argon.
يصدر Claude Opus 5.5 اليوم. وهو متاح على OrcaRouter باسم anthropic/claude-opus-5.5، ويُمكن الوصول إليه عبر نفس نقطة النهاية المتوافقة مع OpenAI التي تستخدمها أكثر من 200 نموذج آخر في الكتالوج، مع تجاوز تلقائي للفشل بين المزوّدين عند تدهور أحد المسارات، ولغة توجيه DSL للحالات التي تريد فيها إرسال جزء من حركة المرور إلى Opus 5.5 والباقي إلى مكان آخر على المفتاح نفسه. لا عقد ثانٍ، ولا SDK ثانٍ.

التوصية العملية للشهر القادم غير مبهرة: ابنِ على Opus 5.5، واحتفظ باسم الطراز في قيمة إعداد بدلًا من سلسلة نصية حرفية، وضع طرازًا رخيصًا خلف مسار إعادة المحاولة لديك حتى لا تؤدي قفزة في زمن الاستجابة في تشغيل أول رمز يبلغ 702 ثانية إلى إسقاط منتجك معها. تلك النقطة الأخيرة ليست نظرية — فزمن استجابة أول رمز لدى Opus 5.5 على أداة اختبار AA هو إحدى عشرة دقيقة، وسواء كان ذلك أحد آثار أداة الاختبار أو كان النموذج يفكر فعلًا لمدة أطول من أي شيء قبله، ينبغي ضبط ميزانية المهلة الزمنية لديك بناءً على الرقم، لا على التسويق.
ما الذي قد يغيّر هذا الحكم؟
ثلاثة أمور، بترتيب الاحتمالية. الإتاحة العامة لـ Argon مع سعر معلن، وهو ما سيجعل حجة التكلفة قابلة للتنفيذ فورًا وسيختبر ما إذا كان $2/$10 يصمد عند التلامس مع حركة الاستخدام الحقيقية. تشغيل مستقل وقابل لإعادة الإنتاج لـ DeepSWE v1.1 وCWE-bench v1 خارج Google، وهو ما سيؤكد إما مزاعم المورّد أو يفنّدها. أو إعداد Argon لدى Artificial Analysis عند أعلى إعداد جهد له، وهو ما سيحسم ما إذا كانت الفجوة البالغة خمس نقاط في المؤشر تمثل اختلافًا في القدرات أم أثرًا ناتجًا عن إعدادات الجهد.
حتى يتحقق أحد هذين الأمرين، فإن الخلاصة الصادقة هي أن Opus 5.5 هو النموذج الأفضل توثيقاً، وArgon هو الادعاء الأفضل سعراً. وأيّهما يمكنك استخدامه فعلاً اليوم ليس قراراً متقارباً.
أصبح Claude Opus 5.5 متاحًا الآن على OrcaRouter بسعر القائمة الخاص بالمورّد دون أي هامش ربح، إلى جانب بقية الكتالوج — إذا كنت تريد اختباره مقابل عبء العمل الخاص بك بدلًا من لوحة الصدارة، anthropic/claude-opus-5.5فهذا هو المعرّف الذي تستدعيه، واستبدال نموذج آخر لاحقًا ليس سوى تغيير في سطر واحد على المفتاح نفسه.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
