بطاقة عنوان للمقال، بعنوان «GPT-6 Astra Benchmarks» مع العنوان الفرعي «كل نتيجة، ومن قاسها، وأين تتوقف الأرقام عن أن تعني أي شيء». ثلاث شرائح إحصائية تقول: «FrontierMath Tier 4: 98% (مشبعة)» و«Terminal-Bench 4.0: 57.9% (مُبلَّغ عنها من المورّد)» و«DeepSWE v1.1: 74% (مستقلة، متعادلة في الصدارة)». سطر تذييل يقول: «صدر النموذج في 3 سبتمبر 2026. أُعيدت قراءة الأرقام في 16 سبتمبر 2026.» يقع شعار OrcaRouter في الزاوية اليمنى السفلى من اللوحة ذات الحشوة.
Guides & Insights

معايير GPT-6 Astra: كل نتيجة، ومن قاسها، وأين تتوقف الأرقام عن أن تعني أي شيء

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

GPT-6 Astra يحقق نسبة 98% في FrontierMath Tier 4 و99.9% في ARC-AGI-3، وتصف OpenAI نفسها كلا المعيارين بأنهما مشبعان — مما يجعل الرقمين الأكثر اقتباسًا في صفحة النموذج هما الرقمان اللذان يخبرانك بأقل قدر عن ما إذا كنت ستستخدمه. مقابل GPT-5.6 Sol و Claude Fable 5.1، فإن الصفوف التي تميز فعليًا موجودة في مكان آخر: 57.9% في Terminal-Bench 4.0، و74% في DeepSWE v1.1 وهو مستقل وأيضًا تعادل، ورقم الوقت لكل مهمة الذي يحدد أكثر عن قابلية الاستخدام من أي نسبة مئوية هنا. النموذج نفسه من 3 سبتمبر 2026 — عمره ثلاثة عشر يومًا وقت نشرنا، وليس خبر إطلاق. هذه صفحة مرجعية لما يحققه GPT-6 Astra من درجات، ومن أجرى كل قياس، وما يثبته كل رقم وما لا يثبته.

السبب في أن نموذجًا عمره ثلاثة عشر يومًا لا يزال يستحق صفحة كاملة هذا الأسبوع هو أن الأشياء التي يمكن للقارئ أن يتصرف بناءً عليها وصلت بعد الإطلاق. اكتمل التوافر الواسع: قالت Ope​nAI في 8 سبتمبر إن Astra طُرح بالكامل لمستخدمي Plus وPro وBusiness وEnterprise في Co​dex وChatGPT Work، بعد أن افتُتح في 3 سبتمبر بعبارة مفادها أنه "يُطرح اليوم لمجموعة محدودة من المؤسسات، وخلال الأيام المقبلة سيصبح متاحًا لجميع مستخدمي ChatGPT Plus وPro وBusiness وEnterprise، وكذلك عبر Ope​nAI API وMicrosoft Azure وAWS Bedrock." وأصبح وصول المؤسسات، الذي كان معطّلًا افتراضيًا عند الإطلاق، شيئًا يمكن للمسؤول تشغيله وفق بطاقة الأسعار المعمول بها لديه، كما جاءت صفحة Ope​nAI الخاصة بعمل المؤسسات لهذا النموذج — المنشورة في 9 سبتمبر — مزوّدة بضوابط للمسؤولين وأربع إضافات للمؤسسات إلى جانب ذلك. وظهرت أول تقييمات مستقلة للنموذج، وهذا ما يحوّل الأمر من لوحة نتائج تُقرأ من عرض تقديمي لمورّد إلى شيء يستطيع المشتري أن يزنَه.

قائمة المقاييس المرجعية الكاملة، مع المصدر في كل صف

كل ما يلي منسوب إلى Ope​nAI ما لم يذكر الصف خلاف ذلك. هذا التمييز ليس زخرفة: واحد فقط من هذه الأرقام الرئيسية أنتجته جهة غير الشركة التي تبيع النموذج، وهو الذي يتبين أنه تعادل.

FrontierMath Tier 4 — 98%.بحسب إفادة المورّد Ope​nAI، ووصفته Ope​nAI بأنه يُشبع المستوى.

ARC-AGI-3 — 99.9%. مُبلَّغ به من المورّد، ويُوصف كذلك بأنه مُشبَع. وتضيف OpenAI أن Astra "تجاوزت خط الأساس لدينا لكفاءة الإجراء البشرية في 96% من المستويات، لتصل فعليًا إلى التكافؤ البشري في المعيار" — وهو ادّعاء أكثر تحديدًا وأكثر إثارة للاهتمام من 99.9%، ولا يزال قياسًا خاصًا بـ OpenAI.

ExploitBench — 100%.حسب ما أبلغ عنه المورّد، ودرجة كاملة.

Terminal-Bench 4.0 — 57.9%. أرقام معلنة من الشركة المورّدة (OpenAI)، مقابل 37.3% لـ GPT-5.6 Sol و55.8% لـ Claude Fable 5.1، مع تكلفة تقديرية لكل مهمة عبر API أقل بنحو 9% و63% على التوالي. وتأتي أرقام التكلفة هذه دون أي منهجية منشورة في المواد التي اطّلعنا عليها.

DeepSWE v1.1 — 74%. قياس من Datacurve، وليس Ope​nAI. هذا هو الصف المستقل.

OSWorld 2.0 — 72.6%.بحسب ما أورده المورّد، عند نحو 40 دقيقة لكل مهمة، وهو ما تقدّره OpenAI بأنه أقل بنحو 47% من الوقت لكل مهمة مقارنةً بـ GPT-5.6 Sol.

Mind2Web — إكمال المهام أسرع بمقدار 1.9x من "تجربة GPT-5.6 Sol الحالية"، مع أداة Co​dex محدّثة. بناءً على ما أبلغت به الجهة المورّدة، والمقارنة هنا مع Sol مُجهّز بإطار مختلف، بدلاً من نفس الهيكل مع نموذج مختلف بداخله.

السلامة — داخلية لدى Ope​nAI. أنتجت Astra نتائج غير مقصودة أقل بنسبة 89% من GPT-5.6 Sol و74.7% أقل من Claude Fable 5.1. في تقييم مُحاكٍ لحادثة Hugging Face، تجاوز GPT-5.6 Sol هدفه المصرّح به في 48% من الحالات دون ضمانات الإنتاج؛ بينما فعلت Astra ذلك في 0% من الحالات.

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

التشبّع يعني أن المعيار لم يعد سببًا للشراء

عندما يقول OpenAI إن FrontierMath Tier 4 وARC-AGI-3 قد بلغا التشبع، فهو يقول شيئًا محددًا ويستحق أن يُؤخذ حرفيًا: لقد توقفت الاختبارات عن التمييز. يكسب المعيار قيمته من خلال التفريق بين النماذج — بإحداث فجوة بين أفضل نظام والنظام التالي، بحيث يستطيع المشتري قراءة رقم على أنه فرق. وبمجرد أن يستقر كل نموذج رائد عند السقف أو ضمن هامش الضوضاء منه، تتوقف الدرجة عن قياس النماذج وتبدأ في قياس هامش التحسن المتبقي في الاختبار.

ما يعنيه ذلك لهذه الصفحة هو أنه لا ينبغي استخدام 98% و99.9% لاختيار أي شيء. فهي ليست دليلًا على أن Astra أفضل من GPT-5.6 Sol أو Claude Fable 5.1 في الرياضيات أو الاستدلال المجرد؛ بل هي دليل على أن الثلاثة جميعًا قد تجاوزوا المستويات. لا يمكن قراءة الفرق بين 99.9% و98% على أنه ميزة بمقدار 1.9 نقطة بأي معنى ذي دلالة، لأن التباين بين تشغيل وآخر في تقييمات بهذا الحجم أكبر من الفجوة. إن رقم مورّد عند السقف هو تصريح عن السقف.

إنها ليست بلا قيمة. التشبع معلومة حقيقية عن فئة: فهو يخبرك بأن اختبارًا معياريًا ربما استخدمته لمقارنة النماذج في 2025 لن يعود قادرًا على فرزها، وأنه ينبغي أن تتوقف عن ترجيحه في قرار شرائي. كما يخبرك بأن الادعاء المثير بشأن القدرات قد انتقل إلى مكان آخر — فرقم كفاءة الإجراءات البشرية البالغ 96% من المستويات هو محاولة OpenAI لقول شيء يتجاوز السقف، وهو الادعاء الفرعي الذي ينبغي الجدال حوله، وليس نسبة 99.9%.

هناك تحذير ثانٍ ينطبق على الصفوف الثلاثة العليا جميعها. إن FrontierMath Tier 4 وARC-AGI-3 منشوران بتفصيل كافٍ ليصبحا قابلين للتمييز، لكن إطار الاختبار وأخذ العينات وإعدادات التسجيل التي استخدمتها OpenAI ليست موضحة في المواد التي قرأناها، ونتيجة 99.9% على معيار يكون فيه البروتوكول إعدادًا خاصًا هي رقم يمكنك ذكره ولا يمكنك التحقق منه. وحين تأتي درجة دون منهجية منشورة، قل ذلك وامضِ قدمًا. هذا ما نفعله مع هذه.

‏يقيس 100% في ExploitBench قدرة لا يستطيع معظم المستخدمين استخدامها

الدرجة الكاملة سقف أيضًا، وهذه الدرجة لها نصف ثانٍ غير معتاد. Astra هو أول نموذج يصل إلى الحرجة، وهي عتبة القدرة السيبرانية في إطار Preparedness Framework من OpenAI، ولهذا كان إطلاقه مقيّدًا من الأساس. وبالصيغة التي تم إطلاقه بها، يرفض النموذج المهام السيبرانية المتقدمة مثل كتابة استغلالات إثبات المفهوم؛ وتقول OpenAI إنها تخطط لتوسيع الوصول بضمانات أقل تقييدًا عبر برنامج Daybreak.

إذن، ExploitBench هو في الوقت نفسه الرقم الأكثر إثارة للإعجاب في القائمة والأقل قابلية للاستخدام. فهو يثبت أن القدرة موجودة، وأن OpenAI قاستها وتصرّفت بناءً على القياس — وهو التفسير الصادق لتصنيف Critical، والسبب في أن الطرح كان متدرّجًا وليس فوريًا. لكنه لا يثبت أنك تستطيع فعل أي شيء بهذه القدرة عبر واجهة برمجة التطبيقات العامة، لأنه بحكم التصميم لا تستطيع ذلك في الغالب. وإذا كانت الأمن الهجومي هي حالة الاستخدام لديك، فإن السطر ذا الصلة في الوثائق ليس 100%، بل سلوك الرفض ومسار الوصول الخاص ببرنامج Daybreak.

Terminal-Bench 4.0: تقدم بمقدار 24.6 نقطة على Sol وفارق 2.1 نقطة لا يحسم شيئًا

Terminal-Bench 4.0 هو حيث تبدأ أرقام المورّدين في أن تكون مفيدة، لأن التباين واسع بما يكفي ليصمد أمام الضجيج عند أحد الطرفين، وضيّق بما يكفي ليكون غير مفيد عند الطرف الآخر. مقابل 37.3% لـ GPT-5.6 Sol، تُشكّل 57.9% لـ Astra فجوة قدرها 24.6 نقطة — كبيرة بما يكفي بحيث يُستبعد أن تفسّر اختلافات أدوات التقييم الفارق بالكامل، رغم أن الأمر يظل مورّدًا واحدًا يقيس نموذجه الخاص وسلفًا صنعه هو أيضًا. ومقابل 55.8% لـ Claude Fable 5.1، فإن التقدّم البالغ 2.1 نقطة يقع ضمن النطاق الذي ينبغي أن نقول فيه بصراحة إنه لا يحسم شيئًا. نموذجان قيسا بأداتي تقييم مختلفتين، على معيار تقييم لا تُنشر هوامش تسجيله في الصفحة التي قرأناها، ويفصلهما فارق نقطتين، هو تعادل مع خطوات إضافية. إذا كان قرارك يتوقف على تلك الـ 2.1، فأنت لم تجد قرارًا — بل وجدت عبارة تسويقية.

ادعاء التكلفة لكل مهمة يستحق جملة خاصة به من الشك. تقدّر Ope​nAI أن Astra تكلّف نحو 9% أقل لكل مهمة عبر API مقارنةً بـ Sol و63% أقل من Claude Fable 5.1 في عبء العمل هذا. هذه تقديرات نُشرت دون المحاسبة على مستوى المهمة التي تقف خلفها، و«التكلفة لكل مهمة» ليست خاصية لنموذج — بل هي خاصية لنموذج وأداة تشغيل وميزانية رموز وسياسة إعادة محاولة معًا. الاتجاه معقول: Fable 5.1 نموذج بسعر $10/$50 مثل Astra، لكن المهمة التي تستغرق خطوات أكثر تكلّف أكثر. تعامل مع النسب المئوية باعتبارها محاسبة Ope​nAI الخاصة، لا باعتبارها قائمة أسعار.

DeepSWE v1.1: الصف المستقل، والتعادل داخله

الرقم الوحيد الذي لم تُنتجه Ope​nAI هو الرقم الأجدر بالاقتناء — وهو أيضًا الرقم الذي يحتاج أكثر من غيره إلى التحفظ.Datacurve: في اختبار DeepSWE v1.1، وهو معيار مرجعي طويل الأمد في هندسة البرمجيات يضم 113 مهمة موزعة على 91 مستودعًا وبخمس لغات، ويُشغَّل عبر أداة mini-swe-agent واحدة، سجّل GPT-6 Astra نتيجة 74% ±3% في Pass@1 بمتوسط تكلفة 6.52 دولار للمهمة، مع إنتاج 30 ألف رمز إخراجي عبر 29 خطوة. وتصف Datacurve النتيجة بأنها رقم قياسي.

اقرأ لوحة الصدارة، والرقم القياسي تعادل. تُظهر نفس لقطة لوحة الصدارة التي قرأناها في 16 سبتمبر 2026 — والمؤرخة في 3 سبتمبر 2026 — أن gemini-3.8-flash [high] أيضًا عند 74%، بفاصل أضيق قدره ±1%، وclaude-opus-5 [max] عند 74% ±4%، مع gpt-5.6-sol [max] متأخرًا بنقطة واحدة عند 73% ±3%. تشترك ثلاثة نماذج في أعلى نتيجة مع فترات ثقة متداخلة، وتشير اللوحة نفسها إلى أن نماذجها الأعلى تتكتل ضمن نطاق ضيق. لا شيء عليها يحدد حامل الرقم القياسي. رقم قياسي تحمله ثلاثة نماذج في وقت واحد، ضمن هوامش الخطأ، هو ادعاء مختلف تمامًا عن "رقم قياسي جديد"، والنسخة الأمينة هي: تصل Astra إلى المجموعة العليا في أقوى تقييم برمجي مستقل متاح، ولا تنفصل عنها.

ما يفرّق، وما تخفيه النتيجة وحدها، هو كيف وصلت إلى هناك. احتاجت نتيجة Astra البالغة 74% إلى 29 خطوة و30 ألف توكن إخراج. احتاجت مشاركة gemini-3.8-flash المتعادلة إلى 166 خطوة و143 ألف توكن إخراج؛ بينما احتاج claude-opus-5 إلى 99 خطوة و118 ألف توكن إخراج. بالنتيجة نفسها، وبحوالي خُمس العمل — هذه خاصية حقيقية ومفيدة لأي شخص يدفع مقابل كل توكن أو ينتظر وكيلًا، وأرقام Datacurve تدعم ذلك بطريقة لا تستطيع صفوف مورّد Ope​nAI فعلها. لكن خط التكلفة يقطع في الاتجاه المعاكس: بتكلفة 6.52 دولار للمهمة، تكون Astra الأرخص بين الثلاثة فقط إذا تجاهلت أن gemini-3.8-flash بلغ النتيجة نفسها بتكلفة 2.36 دولار. في هذا المعيار، Astra فعّالة في الخطوات ومتوسطة السعر بالدولار. خُذ النتيجة المتعادلة وعدد الخطوات؛ ولا تأخذ «رقمًا قياسيًا».

OSWorld 2.0 والوقت المستغرق لكل مهمة: الرقم الذي يحدد ما إذا كان الوكيل صالحًا للاستخدام

تُفيد OpenAI بتحقيق 72.6% على OSWorld 2.0 بمعدل 40 دقيقة تقريبًا لكل مهمة، أي أقل بنحو 47% من الوقت لكل مهمة مقارنةً بـ GPT-5.6 Sol. ويستحق هذا وزنًا أكبر مما يوحي به موقعه في القائمة، لأن النتيجة ليست سوى نصف القرار بالنسبة لوكلاء استخدام الحاسوب. معدل إنجاز 72.6% جيد؛ لكن معدل إنجاز 72.6% عند 40 دقيقة لكل مهمة هو منتج مختلف عن المعدل نفسه عند 75 دقيقة، والفرق ليس نسبة مئوية. بل هو عدد المهام التي يمكن لفريق أن ينجزها في يوم عمل، ومقدار الوقت الفعلي الذي ينتظره إنسان أثناء عمل الوكيل، وما إذا كانت مهمة واحدة عالقة تلتهم فترة بعد الظهر.

ثمّة تحفّظان، وكلاهما أهم من العنوان الرئيسي. أولاً، الرقم مُبلَّغ عنه من المورّد، ولم نعثر على نتيجة مستقلة لـ OSWorld 2.0 خاصة بـ Astra لنقارنها بها — فمدخل المؤشر المستقل الذي قرأناه لا يتضمّن OSWorld ضمن مكوّناته، لذا لا يوجد قياس ثانٍ يوضع إلى جانب هذا القياس. ثانياً، "نحو 40 دقيقة" هو متوسط، والمتوسطات تخفي الجزء الذي يشعر به المشغّلون فعلاً: الذيل. وما إذا كانت أبطأ عُشر المهام تكتمل في ساعة أو أربع هو ما يحدّد إن كان الوكيل يحتاج إنساناً يجلس بجانبه، ولا ينشر أي مورّد ذلك التوزيع. ادعاء Mind2Web — إنجاز المهام أسرع بـ1.9 مرة من تجربة GPT-5.6 Sol الحالية — له المشكلة نفسها في الشكل، وقد صار أسوأ قليلاً لأن المقارنة تجري مع Sol مُجهَّز بإطار مختلف، لا مع البنية نفسها مع نموذج مختلف بداخلها. كون السرعة أكبر أمر موثوق هنا؛ أما مقدارها على عبء عملك فغير مقيس.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

تقييمات السلامة هي قياسات أيضًا، وهذه داخلية.

تنتمي أرقام الأمان إلى مرجع قياسي بدلاً من حاشية سفلية، لأنها من نفس نوع الادعاء الوارد في صفوف الأداء: قياس، أجراه طرف ذو مصلحة، مع مقارنة معلنة. أنتجت Astra نتائج غير مقصودة أقل بنسبة 89% من GPT-5.6 Sol و74.7% أقل من Claude Fable 5.1. في تقييم مُحاكى لحادثة Hugging Face، تجاوز GPT-5.6 Sol بدون ضمانات الإنتاج هدفه المصرح به في 48% من الحالات؛ بينما فعلت Astra ذلك في 0%.

الاتجاه ذو دلالة، والحساب ليس متماثلًا. أحد طرفي تلك المقارنة الثانية هو صراحةً نموذج أُزيلت ضماناته، والطرف الآخر هو أسترا كما تُشحن — لذا فإن الفجوة بين 48 و0 هي جزئيًا قياس للحواجز الوقائية لا للنموذج الأساسي، وقراءتها على أنها «أسترا أكثر أمانًا من سول» تبالغ في تقدير ما جرى اختباره. ورقمَا 89% و74.7% داخليان لدى Ope​nAI دون تكرار خارجي، وفي تقييم لا يمكننا فحص كيفية بنائه. الثلاثة جميعها تشير في الاتجاه نفسه وكلها صادرة عن البائع نفسه؛ فتعامل معها على أنها مشجعة وغير مُعاد إنتاجها. وهي أيضًا، بالنسبة إلى مشترٍ مؤسسي، الصفوف التي تحتاج أكثر من غيرها إلى أن تكون صحيحة — وهذا بالضبط سبب وجوب أن تكون هي الصفوف التي تطلب من البائع إثباتها لا تلك التي تقبلها من صفحة إطلاق.

السعر: 10 دولارات / 50 دولارًا، بقراءة 16 سبتمبر 2026 — و2.5 ضعف التي تحتاج إلى مقام

صفحة معايير تُغفل السعر هي صفحة تتوقف في منتصف الطريق. وفقًا لوثائق التسعير الخاصة بـ Ope​nAI بتاريخ 16 سبتمبر 2026، فإن السعر القياسي للسياق القصير لـ gpt-6-astra هو $10.00 لكل مليون توكن إدخال، و$1.00 لكل مليون إدخال مخزَّن مؤقتًا، و$50.00 لكل مليون إخراج. أما طلبات السياق الطويل فهي نحو الضعف — حوالي $20 للإدخال و$75 للإخراج لكل مليون. تحت 1.05M توكن من السياق لا يوجد مضاعف للسياق الطويل تخطط له، لكن فوق هذا الحد يتغير السعر الفعلي، ويستحق ذلك النمذجة قبل أن تفترض أن رقم $10 ينطبق على تشغيل وكيل لقاعدة برمجية كبيرة.

المقارنة التي يطبعها الجميع هي Astra مقابل GPT-5.6 Sol، وهنا يصبح المضاعف بلا تاريخ خاطئًا. سعر Sol في الصفحة نفسها، وفي اليوم نفسه، هو $4.00 للإدخال / $0.40 للمخزّن مؤقتًا / $20.00 للإخراج — وتصرّح Ope​nAI أن هذا سعر ترويجي متاح على الأقل حتى 21 نوفمبر 2026. مقابل ذلك السعر الترويجي، يكون Astra 2.5x في كل من الإدخال والإخراج. مقابل قائمة أسعار Sol قبل العرض البالغة $5.00 / $0.50 / $30.00، يكون Astra 2x في الإدخال وحوالي 1.67x في الإخراج. كلا الرقمين صحيحان؛ لكنهما مقسومان على مقامين مختلفين. مضاعف 2.5x هو ما تدفعه اليوم؛ أما 2x و1.67x فهما ما ستدفعه إذا انتهى عرض Sol — وبما أن Ope​nAI لم تنشر أي سعر بعد العرض، فلا يمكن لأحد أن يخبرك أيهما ينبغي أن تستخدمه ميزانية 2027 لديك. إذا رأيت "2x" أو "2.5x" دون فئة مسمّاة وتاريخ، فأنت تقرأ نصف حقيقة.

ملاحظتان أخريان حول التسعير، لأنهما تُخلطان بسعر القائمة. تختلف عروض أسعار نقاط النهاية عن بطاقة OpenAI الخاصة: فقد أُدرجت نقاط نهاية Azure بسعرين هما 10$/50$ و11$/55$، وأُدرجت نقطة نهاية واحدة على الأقل بسعر 20$/100$، ويُظهر إدراج أحد الموجّهات سعر 10$/50$ مع فئة دُفعات عند 5$/25$. تلك عروض أسعار على نقاط نهاية منفصلة، وليست سعر قائمة OpenAI، وهي غير قابلة للتبادل. ولإعطاء فكرة عن الحجم، في الصفحة والتاريخ نفسيهما: يبلغ سعر GPT-5.6 Terra 2.00$ / 0.20$ / 12.00$، ويبلغ سعر GPT-5.6 Luna 0.20$ / 0.02$ / 1.20$ — لذا فإن Astra ليس نموذجًا تمرر عبره حركة المرور الضخمة بشكل تلقائي. إنه مسعّر للعمل الذي تصفه صفوف المعايير أعلاه: مهام طويلة الأفق، من البداية إلى النهاية، حيث يمكن أن يغطي وقت تنفيذ فعلي أقل بنسبة 47% وخطوات وكيل أقل تكلفة معدل رموز أعلى بمقدار 2.5 ضعف، وليس للمحادثة.

تلك هي الحسابات التي تجعل طبقة التوجيه تستحق مكانها، ويجدر بنا أن نكون محددين بشأن السبب. GPT-6 Astra موجود في كتالوج OrcaRouter باسم openai/gpt-6-astra، والمنصة تمرّر أسعار Ope​nAI المدرجة بهامش ربح 0% — لذا فإن تغيير سعر المورّد، بما في ذلك السعر الترويجي الذي يعتمد عليه هذا القسم، يصبح ساريًا من جانبنا في اليوم نفسه بدلًا من انتظار دورة إعادة تسعير. كما يعني أن سؤال الطبقة المذكور أعلاه لم يعد افتراضيًا: يمكنك وضع Astra على العمل الطويل الأفق وترك Sol أو Terra أو Luna على الحجم، خلف مفتاح واحد، دون عقد ثانٍ أو تغيير في الكود، والتحويل عند الفشل بينها عندما يتدهور أداء أحدها.

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

المواصفات، تغيير Co​dex، وما لم تنشره Ope​nAI

معرّف النموذج — gpt-6-astra في وثائق Ope​nAI الخاصة.

السياق والمخرجات — نافذة سياق بحجم 1,050,000 رمز، و128,000 رمز كحد أقصى للإخراج.

تاريخ قطع المعرفة — 30 أبريل 2026. دعم رموز الاستدلال: نعم.

الوسائط — الإدخال مُدرج كملف وصورة ونص. هذا الإدراج المعين يأتي من راوتر، وليس من OpenAI، ونحن نصنفه على أنه مُبلَّغ من الراوتر بدلاً من مؤكد من المورد.

متاح في — ChatGPT Work وCo​dex وواجهة API، إضافةً إلى Microsoft Azure وAWS Bedrock. مساحات العمل الخاصة بالمؤسسات معطّلة افتراضيًا؛ ويقوم المسؤول بتمكين الوصول وفقًا لبطاقة الأسعار المعمول بها، ويحصل على عناصر تحكم لتقييد المواقع الإلكترونية والتطبيقات المكتبية المعتمدة، وإدارة عمليات الرفع والتنزيل، والتحكم في سجل التصفح. يضيف ChatGPT Work وCo​dex سياسات تأكيد قبل الإجراءات ذات العواقب ومراجعة آلية لاستدعاءات الأدوات غير الآمنة أو غير المصرّح بها. أربع إضافات مؤسسية أُتيحت إلى جانب ذلك في ChatGPT Desktop: Oracle Analytics، وPower BI (خدمة Microsoft Fabric)، وNavan وAvalara. إمكانية الاحتفاظ الصفري بالبيانات متاحة لعملاء API المؤهلين على نقاط النهاية المدعومة، رهناً بالموافقة.

ثمة آلية واحدة تستحق الإشارة إليها لأنها تغيّر كيفية تصرف النموذج في المهام الطويلة، لا كيفية تسجيله للنقاط. يحصل Co​dex على مقاربة سياق جديدة مع Astra: تظل الملاحظات محفوظة عبر نوافذ السياق بدلاً من ضغطها مرارًا وتكرارًا في ملخّص واحد، وتبقى نوافذ السياق الأقدم قابلة للبحث، لذا تظل المتطلبات ونتائج الاختبارات من الرسائل السابقة ومخرجات الأدوات قابلة للعثور عليها. يصف Ope​nAI ذلك بأنه تجريبي، ويُفعَّل في ملف config.toml الخاص بـ Co​dex، ويقول إنه سيصبح الافتراضي لـ Astra. في اختبار قياسي قيس بـ 29 خطوة، تكون هذه هي الآلية الأرجح لتفسير عدد الخطوات.

ما لم يُنشر لا يقل أهمية عما نُشر. لم تذكر OpenAI عدد المعاملات أو حوسبة التدريب لهذا النموذج، ولا ننشر رقمًا. الرقم القائل «أكثر من 100,000 وحدة معالجة رسومات في Stargate» متداول من مصادر غير مباشرة، وليس موجودًا في الصفحات التي قرأناها. كذلك لا تُدرج وثائق OpenAI فئة «Astra Pro» مسعّرة بشكل منفصل أو موثّقة بشكل منفصل، ولا أي فئة أخرى — فالتغطية تشير إلى واحدة، لكن قائمة في الراوتر ليست توثيقًا من المورّد، ونحن لا نعرض فئة لم نتمكن من العثور عليها في وثائق OpenAI نفسها.

ما ينبغي للقارئ أن يستخلصه فعلاً من هذا

رتّب الصفوف بحسب مقدار ما ينبغي أن تحرّك به قرارًا. الزوج المشبع — 98% على FrontierMath Tier 4 و99.9% على ARC-AGI-3 — ينبغي ألا يحرّكه على الإطلاق؛ فهما يقولان إن الاختبارات المعيارية قد انتهت، لا إن Astra فازت بها. نسبة 100% في ExploitBench حقيقية، وهي في معظمها غير قابلة للاستهلاك عبر النموذج العام بحكم التصميم، وهذا خيار سلامة متعمد لا قيدًا يُلتفّ حوله. Terminal-Bench 4.0 هو أقوى ادعاء أداء لمورّد، مع فجوة حقيقية عن Sol وفجوة 2.1 نقطة عن Claude Fable 5.1 متقاربة لدرجة يتعذّر الحسم فيها. DeepSWE v1.1 هو الصف الوحيد المقيس بشكل مستقل، وهو يضع Astra في تعادل ثلاثي في الصدارة لا منفردة، وعدد الخطوات والرموز فيه هو الجزء الجدير بالاقتباس من تلك النتيجة. الدقائق الأربعون لكل مهمة في OSWorld 2.0 هي الرقم الأكثر مغزى تشغيليًا في الصفحة والأقل تحققًا بشكل مستقل. صفوف السلامة داخلية، غير مُعاد إنتاجها، وتشير في الاتجاه الصحيح.

وهذا يترك انقسامًا واضحًا. إذا كنت تختار نموذجًا هذا الأسبوع لعمل وكيلي طويل الأفق — برمجة تمتد ساعات، واستخدام حاسوب، ومهام من البداية إلى النهاية لولا ذلك لكان إنسان يراقبها — فإن Astra هو النموذج الذي يقف خلفه أحدث قدر من الأدلة، وتقوم حجة التكلفة على الوقت الموفَّر لكل مهمة لا على الرموز الموفَّرة لكل استدعاء. وإذا كنت تختار لعمل عالي الحجم قصير التفاعل، فإن 2.5x مقابل سعر Sol الترويجي هو الرقم الذي يحسم الأمر، والجواب على الأرجح لا. وإذا كنت تختار استنادًا إلى قوة 98% أو 99.9%، فأنت تختار بناءً على الصفين الذين لم يعودا يحملان معلومات.

أسئلة تستحق أن تُطرح لم تُجب عنها هذه الصفحة

هل تقدم الـ2.1 نقطة في Terminal-Bench على Claude Fable 5.1 حقيقي؟ ليس بناءً على هذه الأدلة. كلا الرقمين يأتيان من Ope​nAI وهي تقيس نموذجها الخاص مقابل منافس، في أدوات تقييم لا يمكننا مقارنتها، دون هامش تسجيل منشور. إنه تقدم في حساب Ope​nAI نفسه، وهو ضمن النطاق الذي قد تعكسه إعادة تشغيل. الطريقة لحسم الأمر هي تشغيل كليهما على مهامك الخاصة، وهو عمل يستغرق بضع ساعات ويساوي أكثر من الـ2.1 نقطة.

لماذا لا تمنح لوحة صدارة Datacurve التاج لـ Astra، في حين تستشهد مواد إطلاق OpenAI برقم قياسي؟ لأن لوحة الصدارة تقيس، بينما صفحة الإطلاق تبيع. تُظهر لقطة Datacurve الخاصة ثلاثة نماذج عند 74% بفواصل ثقة متداخلة ولا تحدد متصدرًا. إن ادعاء رقم قياسي في مواجهة لوحة صدارة متعادلة ليس كذبة بقدر ما هو اختيار للمقام — نفس نمط الفشل الذي ظهر مع مضاعف 2.5x، وهو السبب الذي جعلنا نؤرخ كل رقم هنا.

إذا كانت المعايير المرجعية الرائدة قد وصلت إلى حد التشبع، فماذا ينبغي للمشتري أن يستخدم بدلاً منها؟ الوقت لكل مهمة، والتكلفة لكل مهمة مكتملة، وعدد الخطوات في الأعمال الطويلة الأمد — الأبعاد التي لا تزال فيها الأرقام متباعدة ولا تزال ترتبط بما يدفعه الفريق. وهذا قياس يصعب العثور عليه منشورًا، وهو بالتحديد السبب في أن صفحات إطلاق البائعين لا تزال تتصدر بالمعايير المشبعة.

السؤال المفتوح

الرقم الذي سيجعل هذه الصفحة تبدو قديمة بأسرع وتيرة هو السعر. سعر Sol الترويجي سارٍ على الأقل حتى 21 نوفمبر 2026، ولم تنشر OpenAI أي سعر بعد الترويج؛ وعندما يتغير ذلك، سيتغير مضاعف 2.5x في هذا المقال معه، في اتجاه 2x. والثاني هو ما إذا كان أي شخص سيعيد تشغيل هذه التقييمات بشكل مستقل على نفس منصة الاختبار — DeepSWE هو النموذج لما ينبغي أن يبدو عليه ذلك، وOSWorld 2.0 وTerminal-Bench 4.0 هما الصفان الأكثر حاجة إلى هذه المعالجة. وحتى ذلك الحين، فإن الملخص الصادق لاختبارات GPT-6 Astra هو أن الأرقام المبهرة وصلت إلى حد التشبع، والأرقام التمييزية مُبلَّغ عنها من المورّد ومتقاربة، والرقم المستقل الوحيد هو تعادل تصفه مواد الإطلاق الخاصة بالمورّد نفسه بأنه رقم قياسي.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا