
صدرت أول نتيجة مستقلة لـ GPT-6.1 Sol: بفارق 0.84 نقطة خلف Astra، وبتكلفة أقل من ربع تكلفة المهمة
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 397 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 195 tok/s
- OrcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- xAISpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
كل مقال عن GPT-6.1 Sol نُشر في الأيام التي تلت إطلاق OpenAI في DevDay بتاريخ 29 سبتمبر 2026 — بما في ذلك هذه المدونة — حمل التحفظ نفسه: كانت أرقام القدرات صادرة عن المورّد ولم يكن أي طرف ثالث قد قيّم النموذج. لم يعد هذا التحفظ قائمًا. لدى Artificial Analysis صفّ لـ GPT-6.1 Sol على Intelligence Index، أُجري بأقصى جهد استدلالي، وهو أول رقم في حياة هذا النموذج القصيرة لم تنتجه OpenAI. وسجّل 51.8 مقابل 52.7 لـ GPT-6 Astra و47.5 لـ GPT-6 Sol — فارق أقل من نقطة واحدة عن الطراز الرائد بتسعير $10/$50، وقفزة بمقدار 4.3 نقاط عن النموذج الذي يحل GPT-6.1 Sol محله. الرقم الذي يجعل الصف مثيرًا للاهتمام هو الرقم المجاور له: تُسعّر اللوحة عملية التقييم الكامنة وراء كل نتيجة، وبلغت تكلفة تشغيل GPT-6.1 Sol على المؤشر $0.72 لكل مهمة، بينما بلغت تكلفة Astra $3.26. دفع أربعة أمثال ونصف المبلغ مقابل 0.84 نقطة هو المقارنة كلها في سطر واحد، وهو الآن سطر مقيس فعليًا لا صياغة مورّد له.
الصف نفسه، وما تم تشغيله عليه

تنشر Artificial Analysis مؤشر Intelligence Index الخاص بها كتركيب من عشرة تقييمات، وكانت النسخة قيد التشغيل في 30 سبتمبر 2026 هي v4.3.2 — AA-Briefcase v1.1، وGDPval-AA v2.1، وAutomationBench-AA، وTerminal-Bench 4.0، وSciCode، وHumanity's Last Exam، وGDP.pdf، وCritPt، وAA-Omniscience، وAA-LCR v1.1. جميع نماذج OpenAI الثلاثة في هذا المقال تستند إلى النسخة نفسها، لذا فإن المقارنة أدناه متماثلة على نحو لا يكون عليه جدول الإطلاق الخاص بأي بائع أبدًا. وتسجّل اللوحة أيضًا تاريخ الإصدار الذي لديها للنموذج — 2026-09-29، تاريخ DevDay — وتقيّمه في إعداد أقصى جهد، وهو الإعداد الذي يسمّيه الصفحة في عنوانها.
• مؤشر الذكاء — 51.8 لـ GPT-6.1 Sol (الأقصى)، و52.7 لـ GPT-6 Astra (الأقصى)، و47.5 لـ GPT-6 Sol (الأقصى).
• التكلفة لكل مهمة في المؤشر — 0.72 دولار لـ GPT-6.1 Sol، و3.26 دولار لـ Astra، و1.05 دولار لـ GPT-6 Sol. هذا رقم اللوحة نفسه لما كلفه تشغيل تقييم مؤشر كامل، وليس قائمة أسعار.
• رموز الإخراج المستهلكة في التشغيل — 67.2 مليون لـ GPT-6.1 Sol، و60.0 مليون لـ Astra، و76.8 مليون لـ GPT-6 Sol. ويصف تعليق AA نفسه 67 مليونًا بأنها "موجزة إلى حد ما" مقابل وسيط للوحة يبلغ 82 مليونًا، وهو فوز ثانٍ أهدأ على النموذج الذي يحل محله.
• سرعة الإخراج — 66.8 رمزًا في الثانية لـ GPT-6.1 Sol، و57.0 لـ Astra، و76.2 لـ GPT-6 Sol.
• الأسعار كما تُدرجها اللوحة — 2.00 دولار للإدخال و10.00 دولارات للإخراج لكل مليون رمز لـ GPT-6.1 Sol، مع إدخال مخزّن مؤقتًا بـ 0.10 دولار وكتابات ذاكرة مؤقتة بـ 2.50 دولار. تطابق هذه الأرقام الأربعة صفحة أسعار المورّد تمامًا، وهذا أقل ما في السطر إثارةً وأكثره فائدة: قائمة مستقلة بالأسعار التي سبق أن ذكرناها.
ملاحظة تأطيرية قبل أن تُستخدم الأرقام كذخيرة. مؤشر AA يتألف من عشر تقييمات، والتقييمات التي استهلّت بها OpenAI إعلانها الخاص — DeepSWE v1.1 وOSWorld 2.0 وTerminal-Bench Science 0.1 — ليست من بينها. تشغّل AA نسختها الخاصة من AutomationBench، وهي ليست الإطار نفسه الذي تمثله نسخة AutomationBench التي استشهد بها المورّد. لذا فإن السجل المستقل لا يؤكد ولا ينفي المزاعم الرئيسية الأربعة الواردة في منشور الإطلاق؛ فهو يقيس مجموعة مختلفة إلى حد كبير من المهام، ويستحق أن يُقرأ كرأي ثانٍ حول طبيعة النموذج لا كحكم على تلك الجمل بعينها.
لا تزال أسترا تفوز، بفارق أقل من نقطة، مقابل أربعة أضعاف السعر ونصفه

يكشف كلا النموذجين عن سلّم للجهد، وقد نشرت اللوحة الآن نتيجة وتكلفة تشغيل لكل درجة من درجات كليهما. وعند صفّهما جنبًا إلى جنب، تقول السلالم شيئًا لا تستطيع المقارنة الرئيسية الواحدة قوله: إن أفضل إعداد لدى GPT-6.1 Sol لا ينافس أفضل إعداد لدى Astra، بل ينافس ثاني أفضل إعداد لدى Astra.
• GPT-6.1 Sol، max — 51.8، 0.72 دولار لكل مهمة فهرسة. GPT-6 Astra، max — 52.7، 3.26 دولار.
• GPT-6.1 Sol، xhigh — 51.0، 0.39 دولار. GPT-6 Astra، xhigh — 52.4، 2.31 دولار.
• GPT-6.1 Sol، high — 50.2، 0.32 دولار. GPT-6 Astra، high — 50.9، 1.73 دولار.
• GPT-6.1 Sol، medium — 47.8، 0.21 دولار. GPT-6 Astra، medium — 49.6، 1.54 دولار.
• GPT-6.1 Sol، low — 42.1، 0.13 دولار. GPT-6 Astra، low — 45.8، 0.82 دولار.
تتقدّم Astra في كل مستوى، وهذا هو الملخص الصادق للمواجهة، وهو أيضًا الجزء الأقل إثارة للاهتمام فيها. الجزء المثير للاهتمام هو سعر الصرف. إذا أردت أرخص إعداد لـ Astra يتغلب على أفضل ما لدى GPT-6.1 Sol، فهو Astra عند xhigh: 52.4 مقابل 51.8، بتكلفة 2.31 دولار مقابل 0.72 دولار. هذا يعني 0.56 نقطة مؤشر مقابل 1.59 دولار إضافية لكل تشغيل تقييم — أي نحو 3.2 أضعاف التكلفة مقابل أقل من واحد بالمئة من النتيجة. وإذا تحركت في الاتجاه المعاكس وأنزلت GPT-6.1 Sol إلى xhigh، فإنك تتخلى عن 0.8 نقطة بينما تنخفض الفاتورة إلى 0.39 دولار، وهو أرخص بـ5.9 مرات من xhigh لدى Astra وواحد من تسعة من تشغيل Astra بأقصى جهد.
ثمة قراءة ثانية للسلم نفسه تحتجّ ضد شراء Astra بأقصى جهد. درجات Astra الأربع الأدنى كلها أرخص من أقصاها، وxhigh الخاص به أدنى من أقصاه بمقدار 0.29 نقطة — أي أكثر قليلًا من نصف بالمئة من النتيجة مقابل خفض بنسبة 29% في تكلفة التشغيل. أي محادثة مشتريات حول هذا الثنائي تبدأ من "Astra عند الحد الأقصى" وتنتهي عند "Astra يكلّف 4.5 أضعاف" إنما تترك درجات Astra الأرخص نفسها خارج المقارنة.
ستة تقييمات لصالح Astra، واثنان لصالح GPT-6.1 Sol، واثنان متعادلان.
النتيجة المركّبة تخفي انقسامًا. عند تقييمه تقييمًا تلو الآخر بأقصى جهد، ليس GPT-6.1 Sol أضعف من Astra قليلًا وبشكل موحّد — إنه أفضل في أمرين وأسوأ في ستة.
• GDPval-AA — إيلو 1575.1 لـ GPT-6.1 Sol مقابل 1541.9 لـ Astra، بفارق 33 نقطة في مهام العمل الاحترافي. وهذا هو أكبر فوز منفرد مستقل للنموذج الأرخص.
• AA-LCR v1.1، الاستدلال بالسياق الطويل — 0.830 مقابل 0.807. GPT-6.1 Sol يتقدم.
• AA-Briefcase v1.1 — إيلو 1564.2 مقابل 1568.9. Astra بفارق 4.7.
• AutomationBench-AA — 0.649 مقابل 0.685. Astra بفارق 3.6 نقاط.
• Terminal-Bench 4.0 — 0.561 مقابل 0.591. Astra بفارق 3.0 نقاط.
• SciCode — 0.542 مقابل 0.565. Astra بفارق 2.3 نقاط.
• Humanity's Last Exam — 0.529 مقابل 0.547. Astra بفارق 1.8 نقاط.
• AA-Omniscience — 41.5 مقابل 43.4. Astra بفارق 1.9 نقاط.
• GDP.pdf وCritPt — تعادل تام عند 0.310 و0.317 على التوالي، على كلا النموذجين.
صفّان من تلك الصفوف لهما قيمة تتجاوز موضعهما في القائمة. هامش GDPval-AA هو المكان الوحيد الذي تكون فيه ميزة النموذج الأرخص كبيرة بما يكفي لتصمد أمام تغيير إطار التقييم، وهو يقع تحديدًا على عبء العمل الذي يدّعيه خط التموضع التسويقي للمورّد — عمل مهني كثيف المستندات. أما التعادلان التامان فيقعان على التقييمات ذات أضيق الفروق، وهو تذكير بأن فجوة مركّبة قدرها 0.84 نقطة تُجمَّع من صفوف تتراوح كلٌّ منها على حدة من فوز بـ33 نقطة إلى خسارة بـ3.6 نقاط.
مقارنةً بالنموذج الذي يحلّ محلّه، فإنّ التحسّن حقيقي لكنه غير موحّد.
المقارنة التي تهم أي شخص يشغّل بالفعل GPT-6 Sol على مسار إنتاجي هي المقارنة التي يجريها 6.1 Sol مقابل سابقه، والسجل المستقل أكثر وضوحًا في ذلك مما كان عليه منشور المورّد. ثمانية من عشرة تقييمات تتحسّن. اثنان يتراجعان.
• SciCode — يسجل GPT-6.1 Sol 0.542 حيث سجل GPT-6 Sol 0.576. النموذج الأحدث أسوأ في الشيفرة العلمية بمقدار 3.5 نقطة.
• AA-LCR v1.1 — 0.830 لـ 6.1 Sol مقابل 0.837 لـ GPT-6 Sol. فارق ضئيل جدًا، لكن في الاتجاه الخاطئ، في تقييم السياق الطويل.
• AA-Omniscience — 41.5 مقابل 27.1. هذا أكبر تغيّر في الصف: قفزة 14.4 نقطة في تقييم المعرفة، والدقة على تلك المجموعة ترتفع من 0.545 إلى 0.621.
• معدل الهلوسة على المجموعة نفسها — 0.543 لـ GPT-6.1 Sol، انخفاضًا من 0.601 لـ GPT-6 Sol وما زال أعلى من 0.513 لـ GPT-6 Astra. يقسّم AA-Omniscience نتيجته إلى "أصاب في الجواب" و"مخطئ بثقة"، وفي هذا التقسيم يثبت تحديث 6.1 جدارته: إنه نموذج أقل خداعًا بدرجة معتبرة من Sol، وما زال الأكثر خداعًا بين الثلاثة.
• Terminal-Bench 4.0 — 0.561 مقابل 0.439، مكسب 12.2 نقطة. AA-Briefcase — من 1482.8 إلى 1564.2 Elo. GDP.pdf — من 0.248 إلى 0.310.
القراءة هي أن هذا كان تحديثًا للمعرفة والأدوات أكثر من كونه تحديثًا للاستدلال. التقييمات التي تحركت أكثر هي تلك التي تكافئ معرفة الأشياء وعدم اختراعها؛ أما التقييم الذي تراجع فهو تقييم ضيق وتقني. أي شخص انتقل إلى 6.1 Sol من أجل توفير ذاكرة التخزين المؤقت يحصل على المكسب المعرفي كمكافأة إضافية، ولا ينبغي أن يفترض أنه يمتد إلى كل بيئة اختبار يشغّلها.
حيث تصنّفه اللوحة، وما يقع فوقه

في ترتيب Intelligence Index الافتراضي للوحة الصدارة، يحتل GPT-6 Astra بأقصى جهد المرتبة السابعة، ويحتل GPT-6.1 Sol بأقصى جهد المرتبة العاشرة، بينما يحتل GPT-6 Sol بأقصى جهد المرتبة العشرين. الصفوف التسعة فوق GPT-6.1 Sol هي تهيئتان من Astra، وثلاث تهيئات من Claude Opus 5.5، وتهيئة واحدة من Claude Sonnet 5.5، وتهيئتان من Claude Fable 5.1 — لذا فإن النموذج الأقرب إلى GPT-6.1 Sol هو الطراز الرائد في عائلته نفسها، والنموذج الذي أزاحه فعليًا في ذلك الترتيب هو سلفه نفسه، على بعد ثلاثة عشر مركزًا أدنى.
أسقط إعداد الجهد، وسينضغط الترتيب على نحو مهم لتخطيط التكلفة: GPT-6.1 Sol عند xhigh يحتل المرتبة 13، وعند high المرتبة 15، وعند medium المرتبة 19، وعند low المرتبة 26، بينما تقع Astra في المرتبة 14 عند high، و16 عند medium، و26 عند low. بعبارة أخرى، GPT-6.1 Sol عند xhigh يتقدّم على Astra عند high في لوحة الترتيب، وGPT-6.1 Sol عند medium يتقدّم على Astra عند low. الجهد هنا رافعة أكبر من اختيار الطراز، على الأقل بين هذين الاثنين.
ماذا نفعل بالرقم، بصراحة
كان ادعاء المورّد الذي اختبره هذا الصف هو أن GPT-6.1 Sol يكاد يضاهي النموذج الرائد بسعر يقارب خُمس السعر. أما الصيغة المستقلة لتلك الجملة فهي: أنه لا يبتعد عن النموذج الرائد بأكثر من 0.84 نقطة مؤشر، وأن جولة التقييم التي أدت إلى نتيجته كلفت 22% من تكلفة جولة تقييم النموذج الرائد. وهذا قريب بما يكفي من الادعاء بحيث لا ينبغي لأحد أن يشعر بأنه ضُلّل به، وهو تصريح أقوى من "غير مُتحقق منه" في كل ناحية تهم المشتري.
ما لا يفعله الصف هو تسعير عبء العمل الخاص بك. تشغيلة المؤشر هي مزيج محدد من المهام، والرقم الذي يحدد فاتورة حقيقية هو بطاقة الأسعار مقابل ملف التوكنات الخاص بك — ولهذا يبقى سطر التخزين المؤقت هو السطر الذي يجب نمذجته: مدخل GPT-6.1 Sol المخزّن مؤقتًا بسعر 0.10 دولار مقابل 1.00 دولار لدى Astra هو فرق عشرة أضعاف لا تمسّه أي درجة مؤشر. من جانبنا، ينطبق التمرير نفسه: يقدّم OrcaRouter نماذج GPT-6 Astra وGPT-6 Sol وGPT-6 Luna بأسعار OpenAI المعلنة نفسها دون إضافة أي هامش، لذا في اليوم الذي يتحرك فيه سعر مورّد، يتحرك السعر من جانبنا معه بدلًا من انتظار عقد ثانٍ. GPT-6.1 Sol ليس ضمن مساراتنا — الكتالوج العام يعيد "model not found" لـ openai/gpt-6.1-sol اليوم، ولا توجد طريقة صادقة لوصف نموذج لا نستطيع تقديمه. ما يمنحك إياه مفتاح API واحد الآن فعلًا هو الثنائي الذي يجادل بشأنه المعيار فعليًا — Astra للعمل الأصعب، وSol للحجم — مع تمرير أسعار المزوّدين المعلنة دون أي هامش مضاف، وتحويل تلقائي عند الفشل بين المزوّدين عندما يخطئ أحدهم.
شيئان من شأنهما أن يزيدا هذا وضوحًا. إنّ أداة اختبار ثانية مستقلة على النموذج نفسه ستخبرنا ما إذا كانت ريادة GDPval-AA خاصيةً للنموذج أم خاصيةً لذلك التقييم، وهي نقطة البيانات المفقودة الأكثر فائدة في الصف. وسيكون القياس المستقل لطبقة السياق الطويل البالغة 272,000 رمزًا أكثر أهمية من نقطة مركبة أخرى، لأن هذا هو المكان الذي يتوقف فيه تسعير هذه العائلة عن أن يكون رخيصًا.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
