بطاقة عنوان رئيسية نصها Gemini 4 Argon على FrontierSWE: إنه يصرخ «يوريكا»، ثم يصحح واجبه بنفسه، مع شريحة نصها FrontierSWE v2 55.0 بالمئة متوسط عند 5، وشريحة نصها الثالث من بين عشرة نماذج، وشريحة نصها 129 دولارًا و36 سنتًا لكل تجربة، وسطر تذييل نصه أرقام FrontierSWE وفقًا للوحة المتصدرين العامة لدى Proximal Labs، 2026-09-30.
Guides & Insights

Gemini 4 Argon على FrontierSWE: يصرخ «يوريكا!»، ثم يصحّح واجبه بنفسه

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يعاني Gemini 4 Argon من مشكلة في الشخصية، وهو أكثر شيء مثير للاهتمام قاله أي شخص عن النموذج منذ أن أعلنت Go​ogle عنه في 2026-09-30. في معيار FrontierSWE فائق الطول الزمني، النموذج الذي حلّ ثالثًا — خلف GPT-6 Astra وClaude Opus 5.5 — ترك لدى مقيّميه انطباعًا لا يُنسى: كلمته المفضلة هي «يوريكا!»، ويقضي قدرًا كبيرًا من ميزانية المهمة البالغة عشرين ساعة وهو قاسٍ للغاية على نفسه. تلك ملاحظة قريبة من التسريب، من مصدر واحد، صادرة عن مشغّل معيار، وليست ادعاءً من مورّد ولا ملاحظة إصدار، ويستحق الأمر أن نكون دقيقين بشأن ما تخبرك به وما لا تخبرك به. لا يوجد أي من النماذج الثلاثة أعلاه لديه تاريخ إتاحة عامة (GA) لـ Argon مرتبط به؛ فالملاحظة تتعلق بالسلوك داخل بيئة اختبار، والأرقام التي تأتي معها هي أول قياس مستقل لـ Argon على معيار لا تديره Go​ogle بنفسها.

ما هي عبارة «يوريكا!» في الواقع

المصدر هو منشور من @nrehiew_، وهو مهندس يعمل على تقييم النماذج، نُشِر في 2026-09-30، ويقتبس إعلان سوندار بيتشاي عن Gemini 4 Argon. ومضمونه ثلاث دعاوى: أن Argon هو أكثر نموذج ممتع قيّموه على FrontierSWE؛ وأن كلمته المفضلة هي "Eureka!"؛ وأنه ناقد لذاته للغاية. ويصفه الناشر بأنه تحسّن كبير عن نماذج Gemini السابقة مع الحفاظ على تلك الشخصية، ويعتبره مثيرًا للإعجاب.

اقرأ ذلك بعناية، لأنه من السهل المبالغة في تأويله. إنه انطباع أحد المقيّمين من مشاهدة تتبعات الوكيل، وليس نتيجة مُقيَّمة، ولا مقياسًا منشورًا، ولا شيئًا تبنّته Proximal Labs — التي تبني FrontierSWE وتديره — كاستنتاج. لا يوجد عمود "نقد ذاتي" في لوحة الصدارة. ما يجعل هذه الملاحظة جديرة بالكتابة عنها ليس كونها ذات حجية؛ بل كونها القراءة النوعية الوحيدة التي قدّمها أي شخص خارج Google عن Argon، ولأن النموذج غير متاح عمومًا، فإن تتبعات كهذه هي حاليًا السبيل الوحيد لمشاهدة سلوك الشيء.

وهو أيضًا يطرح سؤالًا حقيقيًا على أي شخص يخطط لتشغيل Argon كوكيل. عمليات البرمجة طويلة الأفق هي في الأساس مشكلة إدارة ميزانية: النموذج الذي يقاطع نفسه ليعيد النظر، ويقيّم عمله الوسيط بنفسه، ويعلن عن اختراقات، هو نموذج ينفق الرموز على العملية. وكون ذلك ميزة أو عبئًا يتوقف كليًا على ما إذا كان النقد الذاتي يتقارب أم يدور في حلقات. مقيّم واحد يقول "مبهر" هو نقطة بيانات، وليس إجابة.

FrontierSWE v2، ولماذا تُعدّ نتيجة المركز الثالث القصة الحقيقية

FrontierSWE ليس من نوع المعايير التي يمكنك قراءة رقم رئيسي منها. إنه مبني بواسطة Proximal Labs وموصوف في مستودعهم بأنه معيار لتقييم وكلاء البرمجة ذوي الأفق الزمني الطويل للغاية، يختبر التنفيذ وهندسة الأداء وأبحاث تعلّم الآلة. صدر الإصدار 2 في سبتمبر 2026 مع 21 مهمة جديدة فوق المجموعة الأصلية، ليصبح المجموع 34، ويتوقع من الوكيل أن يواصل العمل لمدة تصل إلى عشرين ساعة. يتم تشغيل كل شيء عبر منصة الاختبار الخاصة بـ Proximal، proximus، وهي مبنية على mini-swe-agent وتضيف ضغط السياق والرؤية وأداة إرسال صريحة. التقييم هو mean@5 — متوسط خمس محاولات لكل مهمة — مع نطاق عدم اليقين المُبلَّغ عنه الذي يمتد من متوسط أسوأ تشغيل لكل مهمة إلى متوسط أفضل تشغيل لها.

تلك المنهجية مهمة لقراءة صف Argon بأمانة:

• النتيجة — Gemini 4 Argon 55.0% mean@5، ±9.9، مقابل GPT-6 Astra 65.5% وClaude Opus 5.5 62.3%

• المدى — يمتد نطاق تشغيلات Argon من 44.5% (الأسوأ@5) إلى 64.3% (الأفضل@5)، وهو نطاق يتقاطع مع نطاق Opus 5.5 البالغ 52.0%–71.5% عند الحد الأعلى، ولا يتقاطع مع نطاق Astra البالغ 55.1%–73.0% إطلاقًا

• تكلفة كل تجربة — Argon ‏$129.36، Opus 5.5 ‏$98.87، Astra ‏$1,029.65

• الزمن الفعلي لكل تجربة — Argon 10.6 ساعة، Opus 5.5 ‏14.2 ساعة، Astra 12.1 ساعة

أول ما تلاحظه هو أن Argon في المركز الثالث، وهو ليس قريبًا من المركز الثاني في النتيجة. الأمر الثاني — ذاك الذي ينبغي أن يحدد ما إذا كنت تهتم — هو أن Argon في هذا المعيار مُهيمَن عليه بشكل صارم من قِبَل Claude Opus 5.5. سجّل Opus 5.5 نتيجة أعلى (62.3% مقابل 55.0%) وكلّف أقل لكل تجربة ($98.87 مقابل $129.36). لا يوجد هنا أي محور يفوز فيه Argon. ميزته الوحيدة هي الوقت: 10.6 ساعات مقابل 14.2 ساعة لـ Opus 5.5، وهو أمر حقيقي إذا كنت تدفع مقابل الوقت الفعلي وليس مقابل الرموز، ولا أهمية له إذا كنت تدفع مقابل ميزانية لكل تجربة.

تحمل لوحة المتصدرين الخاصة بـ Proximal حاشية مقابل صف Argon ينبغي لكل من يقتبس هذا الرقم أن يكرّرها: "Gemini 4 Argon: معدل إصابة الذاكرة المؤقتة أقل بكثير بسبب إعداد غير إنتاجي." وهذا يعني أن المقيّمين يشيرون إلى أنهم شغّلوا Argon خارج التكوين الذي قد يستخدمه نشر إنتاجي، ما يضخّم تكلفته ويرجّح أيضًا زمن استجابته. وهو تحفّظ على رقم التكلفة تحديدًا، وهو السبب في أن $129.36 ينبغي قراءته كحدّ أعلى لا كبطاقة أسعار.

الرقم الذي لا يُظهره مخطط Google نفسه

هنا يصبح توثيق المصادر مثيرًا للاهتمام حقًا، وهنا سترتكب معظم الكتابات عن هذه النتيجة خطأً. يتضمّن منشور إعلان Google مخططًا لاختبارات الأداء فيه صف FrontierSWE v2. يعرض ذلك الصف: GPT-6 Astra ‏65.5%، وClaude Fable 5.1 ‏56.3%، وClaude Opus 5.5 ‏62.3%. وGemini 4 Argon ليس فيه. أما لوحة الصدارة الحية الخاصة بـ Proximal فتضع Astra عند 65.5% وOpus 5.5 عند 62.3% — وهي الأرقام نفسها — لكنها تضع Claude Fable 5.1 عند 56.5%، وليس 56.3%، وتُدرج Gemini 4 Argon عند 55.0%.

سبب هذا الإغفال ليس غامضًا، وGoogle تقول ذلك بنفسها: تشير ملاحظات المنهجية المرفقة بمجموعة التقييم الخاصة بها إلى أن نتائج FrontierSWE يُبلَّغ عنها من لوحة الصدارة العامة الرسمية الخاصة بـ Proximal. لم تحسب Google هذا المعيار بنفسها. إنها تستشهد بنفس الطرف الثالث الذي نستشهد به، والرقم الوحيد الخاص بـ Argon الذي ينشره ذلك الطرف الثالث هو 55.0%. لذا فإن القراءة الصادقة هي أن نتيجة Argon في FrontierSWE قياس مستقل حقًا — فقد أجراه Proximal، على أدواتهم، على مهامهم — وأنه يضع Argon خلف منافسين اثنين.

كل شيء آخر في مخطط Google مُبلَّغ عنه من المورّد، وينبغي أن تضع له هذا التصنيف في ذهنك: Argon بنسبة 63.1% على Vals Index مقابل 67.0% لـ Opus 5.5، و41.4% على AutomationBench مقابل 42.5% لـ Opus 5.5، و89.6% على Vibe Code Bench مقابل 90.3% لكلٍّ من Astra وOpus 5.5، و87.5% على LVBench مقابل 83.7%، و68.0% على CWE-bench v1 مقابل 67.0% لـ Opus 5.5. تلك هي تشغيلات Google للتقييمات التي اختارتها Google. صف FrontierSWE هو الوحيد في تلك الصورة الذي يمكن للقارئ التحقق منه بشكل مستقل، وهذا هو بالضبط سبب أن نتيجة المركز الثالث تحمل وزنًا أكبر من نمط التعادل أو الفوز الطفيف المحيط بها.

ما تقوله Artificial Analysis، بشكل مستقل

FrontierSWE هو أحد المنظورين. وArtificial Analysis هو المنظور الآخر، وهو يتفق مع شكل القصة. على مؤشر الذكاء Intelligence Index v4.3.2 الخاص بهم، يسجّل Gemini 4 Argon في إعداد الاستدلال العالي الخاص به 52.56 — مقيسًا بشكل مستقل على أجهزتهم الخاصة، وليس مُبلَّغًا به من Google — بسعر قائمة يبلغ 2.00 دولار لكل مليون رمز إدخال و10.00 دولارات لكل مليون رمز إخراج، مع خصم 95% على الإدخال المخزَّن مؤقتًا. وتقدّر أدوات القياس الخاصة بهم تكلفة مهمة مؤشر واحدة عند 1.99 دولار.

المقارنة المهمة هي نفسها التي أنتجتها FrontierSWE. يسجل Claude Opus 5.5 في إعداده العالي نتيجة أعلى على المؤشر، 53.58، بتكلفة أقل لكل مهمة، 1.82 دولار. وقد وضع مقيّمان مستقلان، باستخدام مهام مختلفة وأدوات اختبار مختلفة، Argon خلف Opus 5.5 في الجودة والتكلفة معًا. هذه إشارة متسقة وليست مجرد نتيجة عارضة من قياس أداء واحد، وهي أقوى ما يمكنك قوله حاليًا عن اقتصاديات Gemini 4 Argon.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: FrontierSWE v2 mean at 5 55.0 percent, FrontierSWE spread 44.5 to 64.3 percent, FrontierSWE cost per trial 129 dollars 36, FrontierSWE wall clock 10.6 hours, AA Intelligence Index 52.6, AA cost per index task 1 dollar 99. Claude Opus 5.5 reads: FrontierSWE v2 mean at 5 62.3 percent, FrontierSWE spread 52.0 to 71.5 percent, FrontierSWE cost per trial 98 dollars 87, FrontierSWE wall clock 14.2 hours, AA Intelligence Index 53.6, AA cost per index task 1 dollar 82. A footer line reads that FrontierSWE v2 figures are per Proximal Labs' public leaderboard as of 2026-09-30 with Argon's cost marked as a non-production cache setting, and that AA figures are per Artificial Analysis Intelligence Index v4.3.2.

أُعلن عنه، ولم يُطلَق — ولماذا لا يُعدّ هذا التأطير تنطعًا

لا يوجد معرّف نموذج Gemini 4 Argon. يجري طرح الوصول عبر Fairwind Program إلى مدافعين سيبرانيين تم التحقق منهم، إلى جانب فتح تدريجي لعملاء API المدفوعين ومشتركي Google AI Ultra، دون نشر تاريخ للإتاحة العامة. إن منشور Google إعلان عن نموذج ومجموعة من التقييمات، وليس إطلاقًا لنقطة نهاية يمكنك استدعاؤها. إذا كنت قد قرأت تغطية وصفت هذا بأنه إصدار، فإن تلك التغطية تسبق الحقائق.

هذا التمييز له تبعات عملية على أي شخص يقرأ رقم FrontierSWE. أُجري التقييم على نموذج كان لدى Proximal إمكانية الوصول إليه بموجب ترتيب ما؛ وهو يخبرك بما يستطيع النموذج فعله، لا بما يمكنك الحصول عليه. وهو يعني أيضًا أن أرقام الأداء لها نصف عمر أقصر من المعتاد. النموذج الذي ليس GA بعد يمكن أن يتغير — فإعدادات فك الترميز، ومطالبات النظام، والإعدادات الافتراضية لاستخدام الأدوات، وهياكل الأمان لا تزال جميعها قيد الضبط، والسبب المذكور لضعف معدل إصابة ذاكرة Argon المؤقتة هو بالتحديد أن المقيّمين لم يكونوا يشغّلون تهيئة إنتاجية. توقّع أن تتحرك نسبة 55.0% ومبلغ $129.36.

ما الذي قد يغيّر هذه الصورة: مُعرّف نموذج منشور مع بطاقة أسعار، وتاريخ إتاحة عامة (GA)، وإعادة تشغيل FrontierSWE في إعدادات الإنتاج، ومقيّم مستقل ثانٍ يعيد إنتاج نتيجة المركز الثالث. وإلى أن يتوفر أول اثنان على الأقل من هذه العناصر، اعتبر كل رقم من أرقام Argon — بما في ذلك الأرقام الجيدة في مخطط Google نفسه — مؤقتًا.

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated 2026-09-30, credited to Koray Kavukcuoglu, with a standfirst describing frontier performance in complex workflows, cyber defense and software engineering and a benchmark chart whose FrontierSWE v2 row lists GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5 but omits Gemini 4 Argon.

قراءة الشخصية هي الجزء الذي سيصمد أمام الزمن على أفضل وجه.

درجات المعايير المرجعية لنموذج في مرحلة pre-GA لها عمر افتراضي يُقاس بالأسابيع. أما الملاحظة السلوكية فليست كذلك. العمل الوكيلي بعيد المدى هو حيث يتجلّى طابع النموذج فعليًا، لأن ميزانية عشرين ساعة مع 34 مهمة توفر حبلًا كافيًا كي تتراكم نزعات النموذج: كيف يتعافى من نهج فاشل، وما إذا كان يتوقف لإعادة التخطيط، وما إذا كان يستطيع التمييز بين مشكلة صعبة ومنعطف خاطئ. المقيّم الذي يشاهد الكثير من سجلات التتبع هذه ويصف نموذجًا بأنه ناقد لذاته ويميل إلى التعجب عندما ينجح شيء ما، إنما يصف نموذجًا يُظهر تفكيره بشأن تقدمه الخاص. هذه فرضية حول سبب توزّع تشغيلات Argon بين 44.5% و64.3% — وهو نطاق أوسع من نطاق Opus 5.5 — وهي قابلة للاختبار بمجرد أن يصبح النموذج قابلًا للاستدعاء.

النصف الآخر من الملاحظة هو ما ينبغي التشكيك فيه. إن عبارة "تحسّن كبير عن نماذج Gemini السابقة" تُقارن بنماذج لم تُقيَّم قط على هذا المقياس ضمن إطار الاختبار هذا، لذا لا يمكن التحقق منها مقابل لوحة الصدارة على الإطلاق. إنه انطباع، وينبغي التعامل معه بوصفه كذلك، مهما بلغت مصداقية الشخص الذي يقدمه.

A capture of the FrontierSWE public leaderboard showing ten models ranked by mean at 5. GPT-6 Astra leads at 65.5 percent, Claude Opus 5.5 second at 62.3 percent, Gemini 4 Argon third at 55.0 percent with a spread of 9.9, followed by GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 and Inkling, with per-trial average cost and time columns and a footnote that Gemini 4 Argon's cache hit rate is much lower due to a non-production setting.

إلى أين يضعك هذا إذا كنت تحتاج فعلاً إلى وكيل طويل الأفق اليوم

لا يمكنك تسمية Gemini 4 بـ Argon، لذا فالسؤال العملي ليس Argon في مقابل أي شيء آخر — بل أي نموذج ينبغي أن تشغّله من أجل العمل الذي خُضع Argon للتقييم عليه. ترتيب FrontierSWE نفسه يجيب عن ذلك: يتصدر GPT-6 Astra القائمة بنسبة 65.5%، لكن بتكلفة 1,029.65 دولارًا لكل تجربة، أي نحو عشرة أضعاف تكلفة النموذجين الأدنى منه، بينما يقدم Claude Opus 5.5 نسبة 62.3% مقابل 98.87 دولارًا. الخيار الأفضل من حيث القيمة في هذا المعيار هو Opus 5.5، وهو أيضًا النموذج الذي تفوق على Argon في Artificial Analysis بتكلفة أقل لكل مهمة.

كلا هذين النموذجين، ومعظم أفضل عشرة في لوحة الصدارة — ومن بينها GLM-5.3 وGrok 4.7 وKimi K3 وQwen3.8-Max وDeepSeek V4 Flash Vision Exp وMuse Spark 1.2 — يمكن توجيهها عبر واجهة API الواحدة الخاصة بـ OrcaRouterإلى جانب أكثر من 200 نموذج آخر — مفتاح واحد، بهامش 0%، فما تدفعه هو سعر القائمة لدى المزوّد، وأي تخفيض سعري من المورّد ينعكس لدينا في اليوم نفسه. هذه الخصلة الأخيرة ذات قيمة أكبر من المعتاد في نموذج ما قبل GA: إذا تغيّر تسعير Argon بين الآن وGA، وهو ما تشير إليه الحاشية المتعلقة بذاكرة التخزين المؤقت غير الإنتاجية، فلن يتغير أي شيء في تكاملك عندما يحدث ذلك. التحويل التلقائي عند الفشل هو الجزء الآخر الذي يناسب هذه الحالة تحديدًا — فالنموذج غير المألوف الذي لم يحدد أحد أنماط فشله بعد هو بالضبط ما لا تريده على مسار إنتاجي وحيد ومثبّت في الشيفرة.

لأكون صريحًا بشأن أمر واحد: Gemini 4 Argon ليس ضمن كتالوجنا. إن الاستعلام عبر واجهة برمجة تطبيقات النماذج العامة لدينا عن google/gemini-4-argon يعيد "model not found"، ولا يستضيفه أي طرف آخر أيضًا — فهو محجوب خلف Fairwind Program من Google دون نشر أي معرّف طراز. عندما يصبح قابلًا للاستدعاء سنوجّهه، وأرقام FrontierSWE أعلاه هي السبب في ترقّب ذلك اليوم بدلًا من انتظاره. النماذج التي خسر أمامها موجودة بالفعل.

ماذا تشاهد

الإشارات التي من شأنها أن تحوّل هذا من "ما نعرفه حتى الآن" إلى قرار هي محددة. معرّف نموذج منشور وبطاقة أسعاره. تاريخ توفّر عام. إعادة تشغيل FrontierSWE في إعدادات الإنتاج، مما سيحل ما إذا كانت تكلفة 129.36 دولارًا لكل تجربة سعرًا حقيقيًا أم نتيجة ثانوية لإعدادات التخزين المؤقت التي أشار إليها Proximal. ومثاليًا، مُقيّم ثانٍ ينشر آثار Argon بحيث يتوقف ملاحظة "يوريكا!" عن كونها عينة من واحد.

حتى ذلك الحين، فإن الخلاصة الصادقة ضيقة وتستحق التمسك بها: أُعلن عن Gemini 4 Argon، وهو تعبيري على نحو غير معتاد في تتبعات الوكلاء طويلة الأفق وفقًا لأحد المقيّمين، وعلى المعيار المستقل الوحيد الذي يمكننا التحقق منه حلّ في المركز الثالث خلف نموذجين — أحدهما تفوق عليه في النتيجة والتكلفة في الوقت نفسه.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا