
Gemini 4 Argon مقابل GPT-6 Sol: خُمس السعر، أربعة أضعاف الفاتورة
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 219 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
شغّل مجموعة مؤشرات Artificial Analysis على Gemini 4 Argon وستُحتسب التكلفة 2,407 دولارًا. شغّل نفس المجموعة على GPT-6 Sol وستُحتسب التكلفة 1,546 دولارًا. نفس المؤشر، نفس المهام، نفس الأسبوع. النموذجان لهما نفس أسعار القائمة — 2.00 دولار لكل مليون رمز إدخال و10.00 دولار لكل مليون رمز إخراج، Argon كسعر تمهيدي معلن من Google وSol كسعر ثابت من OpenAI — ومع ذلك تختلف التكلفة النهائية للقيام بعمل مماثل بنسبة 56%، لصالح النموذج الذي يسجل خمس نقاط أقل. هذه الفجوة هي السبب الكامل وراء استحقاق هذه المقارنة للكتابة، ولا علاقة لها ببطاقة الأسعار.
أعلنت Google عن Gemini 4 Argon في 30 سبتمبر 2026، واصفةً إياه بأنه الحقبة التالية من الذكاء المتقدم، بسعر 2 دولار للإدخال و10 دولارات للإخراج، مع الإدخال المخزّن مؤقتًا بخصم 95%، ويتوسّع ليشمل المدافعين السيبرانيين الموثوقين عبر برنامج Fairwind. أما GPT-6 Sol فهو متاح عمومًا منذ 22 سبتمبر 2026، عندما أطلقت OpenAI الطبقة المتوسطة من سلسلة GPT-6 بسعر 2 دولار للإدخال و10 دولارات للإخراج مع خصم 90% على التخزين المؤقت. أحدهما قابل للشراء اليوم عبر نقطة نهاية متوافقة مع OpenAI، والآخر غير قابل للشراء من قبل أي شخص خارج فئة محددة بالاسم، وهذا هو المفترق العملي في هذه المقالة. لكن انعكاس التكلفة أعلاه يظل قائمًا حتى لو وضعت مسألة التوفّر جانبًا تمامًا، وفهم السبب هو الجزء المفيد.
الانقلاب، بعبارة واضحة
تنشر Artificial Analysis كلاً من مؤشر Intelligence Index وبيان محاسبي لما كلف تشغيل ذلك المؤشر. وعند قراءتهما معًا، يقولان هذا:
• مؤشر الذكاء — Gemini 4 Argon بنتيجة 52.6 مقابل GPT-6 Sol بنتيجة 47.5. فارق خمس نقاط، مقيسًا مع تسجيل Argon عند الجهد المرتفع الخاص به وSol عند الحد الأقصى، لذا فإن المقارنة تحابي Sol لا Argon.
• سعر القائمة لكل مليون رمز — متطابق. 2.00 دولار للإدخال / 10.00 دولار للإخراج في كليهما. قراءات ذاكرة التخزين المؤقت هي الفرق الوحيد: 0.10 دولار على Argon، و0.20 دولار على Sol.
• تكلفة كل مهمة فهرسة — Gemini 4 Argon بسعر $1.99 مقابل GPT-6 Sol بسعر $1.05. تبلغ تكلفة Argon نحو ضعف التكلفة لكل مهمة على الرغم من تساوي تكلفتها لكل توكن.
• تكلفة تشغيل المجموعة الكاملة — Gemini 4 Argon 2,407 دولار مقابل GPT-6 Sol 1,546 دولارًا.
• سرعة الإخراج المقيسة — GPT-6 Sol عند 77.0 توكن في الثانية مقابل Gemini 4 Argon عند 48.9، فرق يبلغ 1.6× يظهر في زمن الاستجابة وكذلك في الإنفاق.
هناك سطر واحد في تلك القائمة يفسّر جميع الأسطر الأخرى، وهو ليس السعر. إنه عدد التوكنات. في مهام المؤشر نفسها، أنتج Gemini 4 Argon نحو 561,000 توكن إخراج لكل مهمة؛ بينما أنتج GPT-6 Sol نحو 282,000. يفكّر Argon لضعف المدة للإجابة عن السؤال نفسه، وعند معدل متطابق لكل توكن تكون الفاتورة ضعف ذلك بالضبط.

لماذا تُعدّ الرموز هي الثمن
هذا هو التصحيح الذي يستحق الاستيعاب قبل أن يضع أي شخص ميزانية لأي ترحيل، لأن الحدس يسير في الاتجاه الخاطئ. عندما يُسعَّر نموذج ما بالسعر نفسه الذي يُسعَّر به منافسه، ويستهلك ضعف رموز الإخراج لإنهاء المهمة، فإن سعر الرمز الواحد ليس هو السعر. السعر هو سعر الرمز الواحد مضروبًا في عدد الرموز التي يقرر النموذج إنفاقها، وهذا العامل الثاني خاصية من خصائص النموذج، وليس من بطاقة الأسعار.
يتفاوت الهامش حسب المهمة تفاوتًا هائلًا، مما يزيد الأمر سوءًا — فلا يمكنك تطبيق مُضاعِف ثابت ثم المضي قدمًا:
• Terminal-Bench 4.0 — ينتج Argon 165,330 توكن إخراج لكل مهمة مقابل 97,372 لدى Sol. تبلغ تكلفة Argon 6.78 دولار للمهمة هنا مقابل 4.00 دولارات لدى Sol، على الرغم من أن Argon يحقق نتيجة 57.1% مقابل 43.9% لدى Sol.
• CritPt — 109,533 رمزًا لـ Argon مقابل 31,848 لـ Sol. نسبة رموز تبلغ 3.4× في مهمة يحصل فيها Sol فعليًا على نتيجة أعلى، 30.9% مقابل 27.1%.
• GDPval — Argon: 74,571 توكنًا مقابل 41,567 توكنًا لـ Sol، بتكلفة 1.82 دولار للمهمة مقابل 1.32 دولار.
• كلي المعرفة — نسبة رموز تبلغ 938 مقابل 2,662 لصالح Argon، بتكلفة $0.010 للمهمة مقابل $0.027 لدى Sol. عائلة المهام الوحيدة التي ينقلب فيها الاتجاه.
• الاستدلال بالسياق الطويل — Argon 2,197 توكنًا مقابل 954 لـ Sol، وهي المهمة الوحيدة في المجموعة التي يفوز فيها Sol بوضوح من حيث النتيجة، بنسبة 83.7% مقابل 79.7%.
إن CritPt هو الأكثر دلالة. النموذج الذي يحرق ثلاثة أضعاف ونصف من الرموز ليقدّم إجابة أسوأ قليلاً عن السؤال نفسه ليس قصة قدرة؛ بل قصة عادة إنفاق. إن استدلال Argon يطول، وفي بعض أشكال المهام يتحول هذا الطول إلى نقاط، وفي أخرى يتحول ببساطة إلى دولارات. الرقمان 52.6 الخاص بالمؤشر و47.5 الخاص بـ Sol هما الإجمالي، والإجماليات تخفي هذا بالضبط.
من أين تأتي النقاط الخمس فعليًا
بما أن فجوة المؤشر وفجوة التكلفة تشيران في اتجاهين متعاكسين، فمن المفيد معرفة المهام التي تحرّك كلًا منهما.
• Terminal-Bench 4.0 — Gemini 4 Argon 57.1% مقابل GPT-6 Sol 43.9%. أكبر فوز منفرد لـ Argon، وعائلة المهام الأقرب إلى البرمجة الوكيلية طويلة الأفق.
• الإحاطة المعرفية — Gemini 4 Argon 42.4 مقابل GPT-6 Sol 27.1. فارق مقداره خمس عشرة نقطة في التغطية الوقائعية، وهو أكبر فجوة نسبية في المجموعة.
• AutomationBench-AA — Gemini 4 Argon 77.5% مقابل GPT-6 Sol 61.6%.
• SciCode — Gemini 4 Argon 61.8% مقابل GPT-6 Sol 57.6%.
• اختبار البشرية الأخير — Gemini 4 Argon 57.1% مقابل GPT-6 Sol 47.9%.
• GDPval — Gemini 4 Argon 1,611 مقابل GPT-6 Sol 1,487.
• ApexAgents / AA-Briefcase — GPT-6 Sol 1,482.78 Elo مقابل 1,493.84 الخاص بـ Argon، وهو فارق 11 نقطة يقع داخل فترات الثقة المنشورة وينبغي اعتباره تعادلًا.
• الاستدلال بالسياق الطويل — GPT-6 Sol بنسبة 83.7% مقابل Gemini 4 Argon بنسبة 79.7%. الفوز الوحيد الواضح لـ Sol.
• CritPt — GPT-6 Sol 30.9% مقابل Gemini 4 Argon 27.1%. يفوز Sol مرة أخرى، بفارق ضيّق.
إذن الصورة ليست أن "Argon أفضل". بل إن Argon أفضل في الأمرين اللذين تصدّرت بهما مواد إطلاقه — تنفيذ المهام التجارية من البداية إلى النهاية والهندسة البرمجية طويلة الأمد — بينما Sol متساوٍ أو متقدّم في سلّم الاستدلال ذي الطابع الأكاديمي وفي الحفاظ على التماسك عبر سياق طويل. وبالنسبة لقارئ يتمثل عبء عمله في خط أنابيب استرجاع بمُدخل نصي يبلغ 400 ألف رمز، فإن Sol هو في الوقت نفسه النموذج الأفضل والأرخص، وهو موقف غير معتاد ومريح.
الاختلافات في المواصفات التي تبقى بعد مناقشة المعيار المرجعي
• الحد الأقصى للإخراج — Gemini 4 Argon 1,000,000 توكن في مسار واحد، وهو ما تصفه Google بأنه الأكبر في المجال، وزيادة عن سقف الجيل السابق البالغ 64K. GPT-6 Sol 128,000 توكن.
• نافذة السياق — تشير بطاقة مورّد GPT-6 Sol إلى نحو 1,050,000 رمز؛ بينما بطاقة Argon تشير إلى 1,000,000. وقد قاس Artificial Analysis أداء Sol عند 872,000 رمز عبر أداة الاختبار الخاصة به، وهذا قياس أداة اختبار وليس رقمًا واردًا في البطاقة — تعامل مع البطاقة باعتبارها المواصفة، ومع رقم أداة الاختبار باعتباره ما شغّله المُقيِّم فعليًا.
• أنماط الإدخال — كلاهما يستقبل النصوص والصور والملفات. كما ترتكز مواد إطلاق Argon أيضاً على فهم الفيديو الطويل، حيث تدّعي Google تحقيق نسبة 91.7% على LVBench وتصفه بأنه الأكثر تقدماً في المجال؛ وهذا رقم مُبلَّغ عنه من الجهة المورّدة ولم تُعِد إنتاجه أي جهة تقييم مستقلة بعد.
• إدخال الفيديو — ضعيف. تُظهر مخططات Artificial Analysis أن Argon مع إدخال الفيديو معطّل، وتذكر الفيديو صراحةً عند الإطلاق، بينما لا تُدرِج بطاقة Sol الفيديو على الإطلاق. إذا كان الفيديو عنصرًا أساسيًا في خط أنابيبك، فلا تحسم أي من البطاقتين الأمر، وعليك أن تختبر قبل أن تصمم البنية.
• جهد الاستدلال — يوفّر Sol جهدًا قابلًا للتهيئة (من none حتى max، والافتراضي medium) على مستوى واجهة API، وتم تصنيفه عند max. أما Argon فقد صُنّف عند high؛ ولم ينشر أحد المجموعة الاختبارية نفسها عند أعلى إعداد له.
سقف الإخراج البالغ مليون رمز هو الذي يمكن أن يغيّر معمارية فعلاً وليس ميزانية. أي شيء تقوم بتقسيمه حالياً إلى دستة نداءات متسلسلة لتبقى تحت حد 128K — مجموعة رقع متعددة الملفات، أو تقرير تدقيق كامل، أو مستند طويل في تمريرة واحدة — يصبح نداءً واحداً مع أماكن أقلّ لتفقد حلقة الوكيل حالتها فيها. وما إذا كان ذلك يستحق ضعف التكلفة لكل مهمة يعتمد كلياً على ما إذا كانت لديك عبء العمل هذا. إذا كانت لديك، فمن المحتمل أن يستحق ذلك. وإذا كانت نداءاتك من نوع صنّف وأعِد، فهو مال يُنفق على سعة احتياطية لن يشغلها أحد.
إعداد الجهد الذي لم يطابقه أحد، ولماذا يهم
ملاحظة واحدة تستحق فقرة خاصة بها لأنها تتعارض مع تفسير فجوة المؤشر البالغة خمس نقاط على أنها فرق قدرات خالص. يرسم Artificial Analysis مخطط Gemini 4 Argon عند إعداده المرتفع للجهد الاستدلالي و GPT-6 Sol عند الحد الأقصى. هذه ليست الدرجة نفسها على السلمين، واتجاه عدم التطابق مثير للاهتمام: تم تشغيل Sol عند إعداده الأكثر تكلفة و Argon عند إعداد متوسط.
في ما يلي قراءتان، والبيانات لا تستطيع الفصل بينهما. فإما أن يسجّل Argon عند الحد الأقصى نتيجة أعلى من 52.6 — لكنه سيستهلك أيضًا أكثر من 561,000 رمز لكل مهمة ويكلف أكثر من 1.99 دولار — وإما أن يسجّل النتيجة نفسها تقريبًا، ما يعني أن مقبض الجهد لا يفعل الكثير في مجموعة الاختبارات هذه. لا يوجد تشغيل منشور يحسم ذلك. وأي شخص يقتبس 52.6 كسقف لـ Argon إنما يقتبس تهيئة، لا نموذجًا، والتهيئة هي التي اختار مورّدها نشرها أولًا.
ينطبق المنطق نفسه على نتيجة Sol البالغة 47.5، لكن في الاتجاه المعاكس: max هو قمة سلّمه، لذا فإن الرقم أقرب إلى سقف منه إلى أرضية. ويمكن لمعركة عادلة عند جهد متكافئ أن تضيّق الفجوة، ويمكنها أيضًا أن تقلب مقارنة التكلفة، لأن الرموز التي max يحرقها هي الرموز التي تكلّف 10 دولارات لكل مليون.
مفترق الإتاحة، الذي يحدد الإجابة الفعلية
Gemini 4 Argon ليس متاحًا بشكل عام. يقول إعلان Google إنه يتم طرحه لمجموعة من المدافعين الموثوقين عن الأمن السيبراني من خلال Fairwind Program، وإن الشركة منخرطة في عملية الوصول الطوعي إلى النموذج قبل الإصدار التابعة للحكومة الأمريكية، وإن الوصول العام للمطورين والمؤسسات والمستهلكين يأتي "في أقرب وقت ممكن"، بدءًا من عملاء API المدفوعين ومشتركي Google AI Ultra. لا يوجد مُعرّف للنموذج، ولا نقطة نهاية، ولا حصة، ولا تاريخ. إنه ليس على أي API عام، بما في ذلك واجهتنا — تحقق من الكتالوج وستحصل على خطأ 404، لأنه غير موجود هناك بعد.
GPT-6 Sol منتج قابل للاستدعاء. على OrcaRouter هو openai/gpt-6-sol، على نفس نقطة النهاية المتوافقة مع OpenAI التي توجد عليها النماذج الأخرى البالغ عددها أكثر من 200 نموذج في الكتالوج، بسعر OpenAI المدرج نفسه، مُمرَّرًا إليك مع هامش ربح صفري، لذا فإن السعرين 2$/10$ المذكورين أعلاه وخطوة السياق الطويل البالغة 272,000 رمز إلى 4$/15$ هما ما تدفعه فعلًا وليس ما تدّعيه بطاقة الأسعار. يغطي التبديل التلقائي عند الفشل عبر المزوّدين حالة تدهور المسار أثناء التشغيل، وتتيح لغة توصيف التوجيه DSL لتطبيق واحد إرسال حركة التصنيف الرخيصة الخاصة به إلى نموذج أصغر وحركة الاستدلال الصعبة الخاصة به إلى Sol دون SDK ثانٍ.

ذلك الترتيب الأخير هو الإجابة الصادقة عن هذه المقارنة بالنسبة لمعظم الفرق. حجة التكلفة لصالح Argon حقيقية، لكنها مشروطة بحالة عمل يهيمن عليها عمل الوكيل طويل الأفق؛ وحجة التكلفة ضدّه حقيقية في كل حالة عمل أخرى؛ ولا يمكنك شراؤه هذا الشهر على أي حال. الخطوة منخفضة التكلفة هي بناء منظومة التقييم الآن — مطالباتك الخاصة، وتقييمك الخاص، تُشغَّل مقابل Sol عند بضع إعدادات جهد — حتى إذا وصل Argon إلى عملاء API المدفوعين تكون لديك إجابة مقيسة عن سؤال سيجيب عنه الجميع من لوحة الصدارة.
ما الذي سيحسم الأمر؟
ثلاثة أمور، مرتّبة بحسب مقدار ما قد تغيّر به الحكم. الإتاحة العامة لـ Argon بسعر حقيقي غير تمهيدي — وكلمة "تمهيدي" تعني أن سعرَي 2 دولار/10 دولارات قابلان للتغيّر، كما أن تسلسل Google نفسه يضع عملاء API المدفوعين أولاً، لذا فإن أول سعر منشور بعد الإطلاق هو الذي ينبغي مراقبته. تشغيل منشور من Artificial Analysis لـ Argon عند إعداد الجهد الأقصى الخاص به، وهو ما سيبين ما إذا كان 52.6 سقفًا أم على بعد شعرة منه. وإعادة إنتاج مستقلة واحدة لرقم DeepSWE v1.1 — تدّعي Google نسبة 77.9% وتسميها أحدث ما توصلت إليه التقنية؛ وهي مُبلّغ عنها من المورّد وغير مُعاد إنتاجها خارج Google حتى اليوم.
حتى ذلك الحين، يظل الانقسام واضحاً ومشوباً بقليل من السخرية. GPT-6 Sol هو النموذج الأفضل توثيقاً، والأسرع، والأرخص لكل مهمة منجزة، وذاك الذي يمكنك استدعاؤه بعد ظهر هذا اليوم. أما Gemini 4 Argon فهو النموذج الأعلى تسجيلاً على اللوحة التي اختار بائعه نشرها، وأغلى بنحو الضعف عند الاستخدام الفعلي، وليس معروضاً للبيع بعد. الاختيار بينهما ليس حكماً على القدرات. بل هو حكم على أي من هاتين الجملتين يصف شهرك.

مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
