
معايير GPT-6 Astra: كل نتيجة، ومن قاسها، وأين تتوقف الأرقام عن أن تعني أي شيء
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
GPT-6 Astra يحقق نسبة 98% في FrontierMath Tier 4 و99.9% في ARC-AGI-3، وتصف OpenAI نفسها كلا المعيارين بأنهما مشبعان — مما يجعل الرقمين الأكثر اقتباسًا في صفحة النموذج هما الرقمان اللذان يخبرانك بأقل قدر عن ما إذا كنت ستستخدمه. مقابل GPT-5.6 Sol و Claude Fable 5.1، فإن الصفوف التي تميز فعليًا موجودة في مكان آخر: 57.9% في Terminal-Bench 4.0، و74% في DeepSWE v1.1 وهو مستقل وأيضًا تعادل، ورقم الوقت لكل مهمة الذي يحدد أكثر عن قابلية الاستخدام من أي نسبة مئوية هنا. النموذج نفسه من 3 سبتمبر 2026 — عمره ثلاثة عشر يومًا وقت نشرنا، وليس خبر إطلاق. هذه صفحة مرجعية لما يحققه GPT-6 Astra من درجات، ومن أجرى كل قياس، وما يثبته كل رقم وما لا يثبته.
السبب في أن نموذجًا عمره ثلاثة عشر يومًا لا يزال يستحق صفحة كاملة هذا الأسبوع هو أن الأشياء التي يمكن للقارئ أن يتصرف بناءً عليها وصلت بعد الإطلاق. اكتمل التوافر الواسع: قالت OpenAI في 8 سبتمبر إن Astra طُرح بالكامل لمستخدمي Plus وPro وBusiness وEnterprise في Codex وChatGPT Work، بعد أن افتُتح في 3 سبتمبر بعبارة مفادها أنه "يُطرح اليوم لمجموعة محدودة من المؤسسات، وخلال الأيام المقبلة سيصبح متاحًا لجميع مستخدمي ChatGPT Plus وPro وBusiness وEnterprise، وكذلك عبر OpenAI API وMicrosoft Azure وAWS Bedrock." وأصبح وصول المؤسسات، الذي كان معطّلًا افتراضيًا عند الإطلاق، شيئًا يمكن للمسؤول تشغيله وفق بطاقة الأسعار المعمول بها لديه، كما جاءت صفحة OpenAI الخاصة بعمل المؤسسات لهذا النموذج — المنشورة في 9 سبتمبر — مزوّدة بضوابط للمسؤولين وأربع إضافات للمؤسسات إلى جانب ذلك. وظهرت أول تقييمات مستقلة للنموذج، وهذا ما يحوّل الأمر من لوحة نتائج تُقرأ من عرض تقديمي لمورّد إلى شيء يستطيع المشتري أن يزنَه.
قائمة المقاييس المرجعية الكاملة، مع المصدر في كل صف
كل ما يلي منسوب إلى OpenAI ما لم يذكر الصف خلاف ذلك. هذا التمييز ليس زخرفة: واحد فقط من هذه الأرقام الرئيسية أنتجته جهة غير الشركة التي تبيع النموذج، وهو الذي يتبين أنه تعادل.
• FrontierMath Tier 4 — 98%.بحسب إفادة المورّد OpenAI، ووصفته OpenAI بأنه يُشبع المستوى.
• ARC-AGI-3 — 99.9%. مُبلَّغ به من المورّد، ويُوصف كذلك بأنه مُشبَع. وتضيف OpenAI أن Astra "تجاوزت خط الأساس لدينا لكفاءة الإجراء البشرية في 96% من المستويات، لتصل فعليًا إلى التكافؤ البشري في المعيار" — وهو ادّعاء أكثر تحديدًا وأكثر إثارة للاهتمام من 99.9%، ولا يزال قياسًا خاصًا بـ OpenAI.
• ExploitBench — 100%.حسب ما أبلغ عنه المورّد، ودرجة كاملة.
• Terminal-Bench 4.0 — 57.9%. أرقام معلنة من الشركة المورّدة (OpenAI)، مقابل 37.3% لـ GPT-5.6 Sol و55.8% لـ Claude Fable 5.1، مع تكلفة تقديرية لكل مهمة عبر API أقل بنحو 9% و63% على التوالي. وتأتي أرقام التكلفة هذه دون أي منهجية منشورة في المواد التي اطّلعنا عليها.
• DeepSWE v1.1 — 74%. قياس من Datacurve، وليس OpenAI. هذا هو الصف المستقل.
• OSWorld 2.0 — 72.6%.بحسب ما أورده المورّد، عند نحو 40 دقيقة لكل مهمة، وهو ما تقدّره OpenAI بأنه أقل بنحو 47% من الوقت لكل مهمة مقارنةً بـ GPT-5.6 Sol.
• Mind2Web — إكمال المهام أسرع بمقدار 1.9x من "تجربة GPT-5.6 Sol الحالية"، مع أداة Codex محدّثة. بناءً على ما أبلغت به الجهة المورّدة، والمقارنة هنا مع Sol مُجهّز بإطار مختلف، بدلاً من نفس الهيكل مع نموذج مختلف بداخله.
• السلامة — داخلية لدى OpenAI. أنتجت Astra نتائج غير مقصودة أقل بنسبة 89% من GPT-5.6 Sol و74.7% أقل من Claude Fable 5.1. في تقييم مُحاكٍ لحادثة Hugging Face، تجاوز GPT-5.6 Sol هدفه المصرّح به في 48% من الحالات دون ضمانات الإنتاج؛ بينما فعلت Astra ذلك في 0% من الحالات.

التشبّع يعني أن المعيار لم يعد سببًا للشراء
عندما يقول OpenAI إن FrontierMath Tier 4 وARC-AGI-3 قد بلغا التشبع، فهو يقول شيئًا محددًا ويستحق أن يُؤخذ حرفيًا: لقد توقفت الاختبارات عن التمييز. يكسب المعيار قيمته من خلال التفريق بين النماذج — بإحداث فجوة بين أفضل نظام والنظام التالي، بحيث يستطيع المشتري قراءة رقم على أنه فرق. وبمجرد أن يستقر كل نموذج رائد عند السقف أو ضمن هامش الضوضاء منه، تتوقف الدرجة عن قياس النماذج وتبدأ في قياس هامش التحسن المتبقي في الاختبار.
ما يعنيه ذلك لهذه الصفحة هو أنه لا ينبغي استخدام 98% و99.9% لاختيار أي شيء. فهي ليست دليلًا على أن Astra أفضل من GPT-5.6 Sol أو Claude Fable 5.1 في الرياضيات أو الاستدلال المجرد؛ بل هي دليل على أن الثلاثة جميعًا قد تجاوزوا المستويات. لا يمكن قراءة الفرق بين 99.9% و98% على أنه ميزة بمقدار 1.9 نقطة بأي معنى ذي دلالة، لأن التباين بين تشغيل وآخر في تقييمات بهذا الحجم أكبر من الفجوة. إن رقم مورّد عند السقف هو تصريح عن السقف.
إنها ليست بلا قيمة. التشبع معلومة حقيقية عن فئة: فهو يخبرك بأن اختبارًا معياريًا ربما استخدمته لمقارنة النماذج في 2025 لن يعود قادرًا على فرزها، وأنه ينبغي أن تتوقف عن ترجيحه في قرار شرائي. كما يخبرك بأن الادعاء المثير بشأن القدرات قد انتقل إلى مكان آخر — فرقم كفاءة الإجراءات البشرية البالغ 96% من المستويات هو محاولة OpenAI لقول شيء يتجاوز السقف، وهو الادعاء الفرعي الذي ينبغي الجدال حوله، وليس نسبة 99.9%.
هناك تحذير ثانٍ ينطبق على الصفوف الثلاثة العليا جميعها. إن FrontierMath Tier 4 وARC-AGI-3 منشوران بتفصيل كافٍ ليصبحا قابلين للتمييز، لكن إطار الاختبار وأخذ العينات وإعدادات التسجيل التي استخدمتها OpenAI ليست موضحة في المواد التي قرأناها، ونتيجة 99.9% على معيار يكون فيه البروتوكول إعدادًا خاصًا هي رقم يمكنك ذكره ولا يمكنك التحقق منه. وحين تأتي درجة دون منهجية منشورة، قل ذلك وامضِ قدمًا. هذا ما نفعله مع هذه.
يقيس 100% في ExploitBench قدرة لا يستطيع معظم المستخدمين استخدامها
الدرجة الكاملة سقف أيضًا، وهذه الدرجة لها نصف ثانٍ غير معتاد. Astra هو أول نموذج يصل إلى الحرجة، وهي عتبة القدرة السيبرانية في إطار Preparedness Framework من OpenAI، ولهذا كان إطلاقه مقيّدًا من الأساس. وبالصيغة التي تم إطلاقه بها، يرفض النموذج المهام السيبرانية المتقدمة مثل كتابة استغلالات إثبات المفهوم؛ وتقول OpenAI إنها تخطط لتوسيع الوصول بضمانات أقل تقييدًا عبر برنامج Daybreak.
إذن، ExploitBench هو في الوقت نفسه الرقم الأكثر إثارة للإعجاب في القائمة والأقل قابلية للاستخدام. فهو يثبت أن القدرة موجودة، وأن OpenAI قاستها وتصرّفت بناءً على القياس — وهو التفسير الصادق لتصنيف Critical، والسبب في أن الطرح كان متدرّجًا وليس فوريًا. لكنه لا يثبت أنك تستطيع فعل أي شيء بهذه القدرة عبر واجهة برمجة التطبيقات العامة، لأنه بحكم التصميم لا تستطيع ذلك في الغالب. وإذا كانت الأمن الهجومي هي حالة الاستخدام لديك، فإن السطر ذا الصلة في الوثائق ليس 100%، بل سلوك الرفض ومسار الوصول الخاص ببرنامج Daybreak.
Terminal-Bench 4.0: تقدم بمقدار 24.6 نقطة على Sol وفارق 2.1 نقطة لا يحسم شيئًا
Terminal-Bench 4.0 هو حيث تبدأ أرقام المورّدين في أن تكون مفيدة، لأن التباين واسع بما يكفي ليصمد أمام الضجيج عند أحد الطرفين، وضيّق بما يكفي ليكون غير مفيد عند الطرف الآخر. مقابل 37.3% لـ GPT-5.6 Sol، تُشكّل 57.9% لـ Astra فجوة قدرها 24.6 نقطة — كبيرة بما يكفي بحيث يُستبعد أن تفسّر اختلافات أدوات التقييم الفارق بالكامل، رغم أن الأمر يظل مورّدًا واحدًا يقيس نموذجه الخاص وسلفًا صنعه هو أيضًا. ومقابل 55.8% لـ Claude Fable 5.1، فإن التقدّم البالغ 2.1 نقطة يقع ضمن النطاق الذي ينبغي أن نقول فيه بصراحة إنه لا يحسم شيئًا. نموذجان قيسا بأداتي تقييم مختلفتين، على معيار تقييم لا تُنشر هوامش تسجيله في الصفحة التي قرأناها، ويفصلهما فارق نقطتين، هو تعادل مع خطوات إضافية. إذا كان قرارك يتوقف على تلك الـ 2.1، فأنت لم تجد قرارًا — بل وجدت عبارة تسويقية.
ادعاء التكلفة لكل مهمة يستحق جملة خاصة به من الشك. تقدّر OpenAI أن Astra تكلّف نحو 9% أقل لكل مهمة عبر API مقارنةً بـ Sol و63% أقل من Claude Fable 5.1 في عبء العمل هذا. هذه تقديرات نُشرت دون المحاسبة على مستوى المهمة التي تقف خلفها، و«التكلفة لكل مهمة» ليست خاصية لنموذج — بل هي خاصية لنموذج وأداة تشغيل وميزانية رموز وسياسة إعادة محاولة معًا. الاتجاه معقول: Fable 5.1 نموذج بسعر $10/$50 مثل Astra، لكن المهمة التي تستغرق خطوات أكثر تكلّف أكثر. تعامل مع النسب المئوية باعتبارها محاسبة OpenAI الخاصة، لا باعتبارها قائمة أسعار.
DeepSWE v1.1: الصف المستقل، والتعادل داخله
الرقم الوحيد الذي لم تُنتجه OpenAI هو الرقم الأجدر بالاقتناء — وهو أيضًا الرقم الذي يحتاج أكثر من غيره إلى التحفظ.Datacurve: في اختبار DeepSWE v1.1، وهو معيار مرجعي طويل الأمد في هندسة البرمجيات يضم 113 مهمة موزعة على 91 مستودعًا وبخمس لغات، ويُشغَّل عبر أداة mini-swe-agent واحدة، سجّل GPT-6 Astra نتيجة 74% ±3% في Pass@1 بمتوسط تكلفة 6.52 دولار للمهمة، مع إنتاج 30 ألف رمز إخراجي عبر 29 خطوة. وتصف Datacurve النتيجة بأنها رقم قياسي.
اقرأ لوحة الصدارة، والرقم القياسي تعادل. تُظهر نفس لقطة لوحة الصدارة التي قرأناها في 16 سبتمبر 2026 — والمؤرخة في 3 سبتمبر 2026 — أن gemini-3.8-flash [high] أيضًا عند 74%، بفاصل أضيق قدره ±1%، وclaude-opus-5 [max] عند 74% ±4%، مع gpt-5.6-sol [max] متأخرًا بنقطة واحدة عند 73% ±3%. تشترك ثلاثة نماذج في أعلى نتيجة مع فترات ثقة متداخلة، وتشير اللوحة نفسها إلى أن نماذجها الأعلى تتكتل ضمن نطاق ضيق. لا شيء عليها يحدد حامل الرقم القياسي. رقم قياسي تحمله ثلاثة نماذج في وقت واحد، ضمن هوامش الخطأ، هو ادعاء مختلف تمامًا عن "رقم قياسي جديد"، والنسخة الأمينة هي: تصل Astra إلى المجموعة العليا في أقوى تقييم برمجي مستقل متاح، ولا تنفصل عنها.
ما يفرّق، وما تخفيه النتيجة وحدها، هو كيف وصلت إلى هناك. احتاجت نتيجة Astra البالغة 74% إلى 29 خطوة و30 ألف توكن إخراج. احتاجت مشاركة gemini-3.8-flash المتعادلة إلى 166 خطوة و143 ألف توكن إخراج؛ بينما احتاج claude-opus-5 إلى 99 خطوة و118 ألف توكن إخراج. بالنتيجة نفسها، وبحوالي خُمس العمل — هذه خاصية حقيقية ومفيدة لأي شخص يدفع مقابل كل توكن أو ينتظر وكيلًا، وأرقام Datacurve تدعم ذلك بطريقة لا تستطيع صفوف مورّد OpenAI فعلها. لكن خط التكلفة يقطع في الاتجاه المعاكس: بتكلفة 6.52 دولار للمهمة، تكون Astra الأرخص بين الثلاثة فقط إذا تجاهلت أن gemini-3.8-flash بلغ النتيجة نفسها بتكلفة 2.36 دولار. في هذا المعيار، Astra فعّالة في الخطوات ومتوسطة السعر بالدولار. خُذ النتيجة المتعادلة وعدد الخطوات؛ ولا تأخذ «رقمًا قياسيًا».
OSWorld 2.0 والوقت المستغرق لكل مهمة: الرقم الذي يحدد ما إذا كان الوكيل صالحًا للاستخدام
تُفيد OpenAI بتحقيق 72.6% على OSWorld 2.0 بمعدل 40 دقيقة تقريبًا لكل مهمة، أي أقل بنحو 47% من الوقت لكل مهمة مقارنةً بـ GPT-5.6 Sol. ويستحق هذا وزنًا أكبر مما يوحي به موقعه في القائمة، لأن النتيجة ليست سوى نصف القرار بالنسبة لوكلاء استخدام الحاسوب. معدل إنجاز 72.6% جيد؛ لكن معدل إنجاز 72.6% عند 40 دقيقة لكل مهمة هو منتج مختلف عن المعدل نفسه عند 75 دقيقة، والفرق ليس نسبة مئوية. بل هو عدد المهام التي يمكن لفريق أن ينجزها في يوم عمل، ومقدار الوقت الفعلي الذي ينتظره إنسان أثناء عمل الوكيل، وما إذا كانت مهمة واحدة عالقة تلتهم فترة بعد الظهر.
ثمّة تحفّظان، وكلاهما أهم من العنوان الرئيسي. أولاً، الرقم مُبلَّغ عنه من المورّد، ولم نعثر على نتيجة مستقلة لـ OSWorld 2.0 خاصة بـ Astra لنقارنها بها — فمدخل المؤشر المستقل الذي قرأناه لا يتضمّن OSWorld ضمن مكوّناته، لذا لا يوجد قياس ثانٍ يوضع إلى جانب هذا القياس. ثانياً، "نحو 40 دقيقة" هو متوسط، والمتوسطات تخفي الجزء الذي يشعر به المشغّلون فعلاً: الذيل. وما إذا كانت أبطأ عُشر المهام تكتمل في ساعة أو أربع هو ما يحدّد إن كان الوكيل يحتاج إنساناً يجلس بجانبه، ولا ينشر أي مورّد ذلك التوزيع. ادعاء Mind2Web — إنجاز المهام أسرع بـ1.9 مرة من تجربة GPT-5.6 Sol الحالية — له المشكلة نفسها في الشكل، وقد صار أسوأ قليلاً لأن المقارنة تجري مع Sol مُجهَّز بإطار مختلف، لا مع البنية نفسها مع نموذج مختلف بداخلها. كون السرعة أكبر أمر موثوق هنا؛ أما مقدارها على عبء عملك فغير مقيس.

تقييمات السلامة هي قياسات أيضًا، وهذه داخلية.
تنتمي أرقام الأمان إلى مرجع قياسي بدلاً من حاشية سفلية، لأنها من نفس نوع الادعاء الوارد في صفوف الأداء: قياس، أجراه طرف ذو مصلحة، مع مقارنة معلنة. أنتجت Astra نتائج غير مقصودة أقل بنسبة 89% من GPT-5.6 Sol و74.7% أقل من Claude Fable 5.1. في تقييم مُحاكى لحادثة Hugging Face، تجاوز GPT-5.6 Sol بدون ضمانات الإنتاج هدفه المصرح به في 48% من الحالات؛ بينما فعلت Astra ذلك في 0%.
الاتجاه ذو دلالة، والحساب ليس متماثلًا. أحد طرفي تلك المقارنة الثانية هو صراحةً نموذج أُزيلت ضماناته، والطرف الآخر هو أسترا كما تُشحن — لذا فإن الفجوة بين 48 و0 هي جزئيًا قياس للحواجز الوقائية لا للنموذج الأساسي، وقراءتها على أنها «أسترا أكثر أمانًا من سول» تبالغ في تقدير ما جرى اختباره. ورقمَا 89% و74.7% داخليان لدى OpenAI دون تكرار خارجي، وفي تقييم لا يمكننا فحص كيفية بنائه. الثلاثة جميعها تشير في الاتجاه نفسه وكلها صادرة عن البائع نفسه؛ فتعامل معها على أنها مشجعة وغير مُعاد إنتاجها. وهي أيضًا، بالنسبة إلى مشترٍ مؤسسي، الصفوف التي تحتاج أكثر من غيرها إلى أن تكون صحيحة — وهذا بالضبط سبب وجوب أن تكون هي الصفوف التي تطلب من البائع إثباتها لا تلك التي تقبلها من صفحة إطلاق.
السعر: 10 دولارات / 50 دولارًا، بقراءة 16 سبتمبر 2026 — و2.5 ضعف التي تحتاج إلى مقام
صفحة معايير تُغفل السعر هي صفحة تتوقف في منتصف الطريق. وفقًا لوثائق التسعير الخاصة بـ OpenAI بتاريخ 16 سبتمبر 2026، فإن السعر القياسي للسياق القصير لـ gpt-6-astra هو $10.00 لكل مليون توكن إدخال، و$1.00 لكل مليون إدخال مخزَّن مؤقتًا، و$50.00 لكل مليون إخراج. أما طلبات السياق الطويل فهي نحو الضعف — حوالي $20 للإدخال و$75 للإخراج لكل مليون. تحت 1.05M توكن من السياق لا يوجد مضاعف للسياق الطويل تخطط له، لكن فوق هذا الحد يتغير السعر الفعلي، ويستحق ذلك النمذجة قبل أن تفترض أن رقم $10 ينطبق على تشغيل وكيل لقاعدة برمجية كبيرة.
المقارنة التي يطبعها الجميع هي Astra مقابل GPT-5.6 Sol، وهنا يصبح المضاعف بلا تاريخ خاطئًا. سعر Sol في الصفحة نفسها، وفي اليوم نفسه، هو $4.00 للإدخال / $0.40 للمخزّن مؤقتًا / $20.00 للإخراج — وتصرّح OpenAI أن هذا سعر ترويجي متاح على الأقل حتى 21 نوفمبر 2026. مقابل ذلك السعر الترويجي، يكون Astra 2.5x في كل من الإدخال والإخراج. مقابل قائمة أسعار Sol قبل العرض البالغة $5.00 / $0.50 / $30.00، يكون Astra 2x في الإدخال وحوالي 1.67x في الإخراج. كلا الرقمين صحيحان؛ لكنهما مقسومان على مقامين مختلفين. مضاعف 2.5x هو ما تدفعه اليوم؛ أما 2x و1.67x فهما ما ستدفعه إذا انتهى عرض Sol — وبما أن OpenAI لم تنشر أي سعر بعد العرض، فلا يمكن لأحد أن يخبرك أيهما ينبغي أن تستخدمه ميزانية 2027 لديك. إذا رأيت "2x" أو "2.5x" دون فئة مسمّاة وتاريخ، فأنت تقرأ نصف حقيقة.
ملاحظتان أخريان حول التسعير، لأنهما تُخلطان بسعر القائمة. تختلف عروض أسعار نقاط النهاية عن بطاقة OpenAI الخاصة: فقد أُدرجت نقاط نهاية Azure بسعرين هما 10$/50$ و11$/55$، وأُدرجت نقطة نهاية واحدة على الأقل بسعر 20$/100$، ويُظهر إدراج أحد الموجّهات سعر 10$/50$ مع فئة دُفعات عند 5$/25$. تلك عروض أسعار على نقاط نهاية منفصلة، وليست سعر قائمة OpenAI، وهي غير قابلة للتبادل. ولإعطاء فكرة عن الحجم، في الصفحة والتاريخ نفسيهما: يبلغ سعر GPT-5.6 Terra 2.00$ / 0.20$ / 12.00$، ويبلغ سعر GPT-5.6 Luna 0.20$ / 0.02$ / 1.20$ — لذا فإن Astra ليس نموذجًا تمرر عبره حركة المرور الضخمة بشكل تلقائي. إنه مسعّر للعمل الذي تصفه صفوف المعايير أعلاه: مهام طويلة الأفق، من البداية إلى النهاية، حيث يمكن أن يغطي وقت تنفيذ فعلي أقل بنسبة 47% وخطوات وكيل أقل تكلفة معدل رموز أعلى بمقدار 2.5 ضعف، وليس للمحادثة.
تلك هي الحسابات التي تجعل طبقة التوجيه تستحق مكانها، ويجدر بنا أن نكون محددين بشأن السبب. GPT-6 Astra موجود في كتالوج OrcaRouter باسم openai/gpt-6-astra، والمنصة تمرّر أسعار OpenAI المدرجة بهامش ربح 0% — لذا فإن تغيير سعر المورّد، بما في ذلك السعر الترويجي الذي يعتمد عليه هذا القسم، يصبح ساريًا من جانبنا في اليوم نفسه بدلًا من انتظار دورة إعادة تسعير. كما يعني أن سؤال الطبقة المذكور أعلاه لم يعد افتراضيًا: يمكنك وضع Astra على العمل الطويل الأفق وترك Sol أو Terra أو Luna على الحجم، خلف مفتاح واحد، دون عقد ثانٍ أو تغيير في الكود، والتحويل عند الفشل بينها عندما يتدهور أداء أحدها.

المواصفات، تغيير Codex، وما لم تنشره OpenAI
• معرّف النموذج — gpt-6-astra في وثائق OpenAI الخاصة.
• السياق والمخرجات — نافذة سياق بحجم 1,050,000 رمز، و128,000 رمز كحد أقصى للإخراج.
• تاريخ قطع المعرفة — 30 أبريل 2026. دعم رموز الاستدلال: نعم.
• الوسائط — الإدخال مُدرج كملف وصورة ونص. هذا الإدراج المعين يأتي من راوتر، وليس من OpenAI، ونحن نصنفه على أنه مُبلَّغ من الراوتر بدلاً من مؤكد من المورد.
• متاح في — ChatGPT Work وCodex وواجهة API، إضافةً إلى Microsoft Azure وAWS Bedrock. مساحات العمل الخاصة بالمؤسسات معطّلة افتراضيًا؛ ويقوم المسؤول بتمكين الوصول وفقًا لبطاقة الأسعار المعمول بها، ويحصل على عناصر تحكم لتقييد المواقع الإلكترونية والتطبيقات المكتبية المعتمدة، وإدارة عمليات الرفع والتنزيل، والتحكم في سجل التصفح. يضيف ChatGPT Work وCodex سياسات تأكيد قبل الإجراءات ذات العواقب ومراجعة آلية لاستدعاءات الأدوات غير الآمنة أو غير المصرّح بها. أربع إضافات مؤسسية أُتيحت إلى جانب ذلك في ChatGPT Desktop: Oracle Analytics، وPower BI (خدمة Microsoft Fabric)، وNavan وAvalara. إمكانية الاحتفاظ الصفري بالبيانات متاحة لعملاء API المؤهلين على نقاط النهاية المدعومة، رهناً بالموافقة.
ثمة آلية واحدة تستحق الإشارة إليها لأنها تغيّر كيفية تصرف النموذج في المهام الطويلة، لا كيفية تسجيله للنقاط. يحصل Codex على مقاربة سياق جديدة مع Astra: تظل الملاحظات محفوظة عبر نوافذ السياق بدلاً من ضغطها مرارًا وتكرارًا في ملخّص واحد، وتبقى نوافذ السياق الأقدم قابلة للبحث، لذا تظل المتطلبات ونتائج الاختبارات من الرسائل السابقة ومخرجات الأدوات قابلة للعثور عليها. يصف OpenAI ذلك بأنه تجريبي، ويُفعَّل في ملف config.toml الخاص بـ Codex، ويقول إنه سيصبح الافتراضي لـ Astra. في اختبار قياسي قيس بـ 29 خطوة، تكون هذه هي الآلية الأرجح لتفسير عدد الخطوات.
ما لم يُنشر لا يقل أهمية عما نُشر. لم تذكر OpenAI عدد المعاملات أو حوسبة التدريب لهذا النموذج، ولا ننشر رقمًا. الرقم القائل «أكثر من 100,000 وحدة معالجة رسومات في Stargate» متداول من مصادر غير مباشرة، وليس موجودًا في الصفحات التي قرأناها. كذلك لا تُدرج وثائق OpenAI فئة «Astra Pro» مسعّرة بشكل منفصل أو موثّقة بشكل منفصل، ولا أي فئة أخرى — فالتغطية تشير إلى واحدة، لكن قائمة في الراوتر ليست توثيقًا من المورّد، ونحن لا نعرض فئة لم نتمكن من العثور عليها في وثائق OpenAI نفسها.
ما ينبغي للقارئ أن يستخلصه فعلاً من هذا
رتّب الصفوف بحسب مقدار ما ينبغي أن تحرّك به قرارًا. الزوج المشبع — 98% على FrontierMath Tier 4 و99.9% على ARC-AGI-3 — ينبغي ألا يحرّكه على الإطلاق؛ فهما يقولان إن الاختبارات المعيارية قد انتهت، لا إن Astra فازت بها. نسبة 100% في ExploitBench حقيقية، وهي في معظمها غير قابلة للاستهلاك عبر النموذج العام بحكم التصميم، وهذا خيار سلامة متعمد لا قيدًا يُلتفّ حوله. Terminal-Bench 4.0 هو أقوى ادعاء أداء لمورّد، مع فجوة حقيقية عن Sol وفجوة 2.1 نقطة عن Claude Fable 5.1 متقاربة لدرجة يتعذّر الحسم فيها. DeepSWE v1.1 هو الصف الوحيد المقيس بشكل مستقل، وهو يضع Astra في تعادل ثلاثي في الصدارة لا منفردة، وعدد الخطوات والرموز فيه هو الجزء الجدير بالاقتباس من تلك النتيجة. الدقائق الأربعون لكل مهمة في OSWorld 2.0 هي الرقم الأكثر مغزى تشغيليًا في الصفحة والأقل تحققًا بشكل مستقل. صفوف السلامة داخلية، غير مُعاد إنتاجها، وتشير في الاتجاه الصحيح.
وهذا يترك انقسامًا واضحًا. إذا كنت تختار نموذجًا هذا الأسبوع لعمل وكيلي طويل الأفق — برمجة تمتد ساعات، واستخدام حاسوب، ومهام من البداية إلى النهاية لولا ذلك لكان إنسان يراقبها — فإن Astra هو النموذج الذي يقف خلفه أحدث قدر من الأدلة، وتقوم حجة التكلفة على الوقت الموفَّر لكل مهمة لا على الرموز الموفَّرة لكل استدعاء. وإذا كنت تختار لعمل عالي الحجم قصير التفاعل، فإن 2.5x مقابل سعر Sol الترويجي هو الرقم الذي يحسم الأمر، والجواب على الأرجح لا. وإذا كنت تختار استنادًا إلى قوة 98% أو 99.9%، فأنت تختار بناءً على الصفين الذين لم يعودا يحملان معلومات.
أسئلة تستحق أن تُطرح لم تُجب عنها هذه الصفحة
هل تقدم الـ2.1 نقطة في Terminal-Bench على Claude Fable 5.1 حقيقي؟ ليس بناءً على هذه الأدلة. كلا الرقمين يأتيان من OpenAI وهي تقيس نموذجها الخاص مقابل منافس، في أدوات تقييم لا يمكننا مقارنتها، دون هامش تسجيل منشور. إنه تقدم في حساب OpenAI نفسه، وهو ضمن النطاق الذي قد تعكسه إعادة تشغيل. الطريقة لحسم الأمر هي تشغيل كليهما على مهامك الخاصة، وهو عمل يستغرق بضع ساعات ويساوي أكثر من الـ2.1 نقطة.
لماذا لا تمنح لوحة صدارة Datacurve التاج لـ Astra، في حين تستشهد مواد إطلاق OpenAI برقم قياسي؟ لأن لوحة الصدارة تقيس، بينما صفحة الإطلاق تبيع. تُظهر لقطة Datacurve الخاصة ثلاثة نماذج عند 74% بفواصل ثقة متداخلة ولا تحدد متصدرًا. إن ادعاء رقم قياسي في مواجهة لوحة صدارة متعادلة ليس كذبة بقدر ما هو اختيار للمقام — نفس نمط الفشل الذي ظهر مع مضاعف 2.5x، وهو السبب الذي جعلنا نؤرخ كل رقم هنا.
إذا كانت المعايير المرجعية الرائدة قد وصلت إلى حد التشبع، فماذا ينبغي للمشتري أن يستخدم بدلاً منها؟ الوقت لكل مهمة، والتكلفة لكل مهمة مكتملة، وعدد الخطوات في الأعمال الطويلة الأمد — الأبعاد التي لا تزال فيها الأرقام متباعدة ولا تزال ترتبط بما يدفعه الفريق. وهذا قياس يصعب العثور عليه منشورًا، وهو بالتحديد السبب في أن صفحات إطلاق البائعين لا تزال تتصدر بالمعايير المشبعة.
السؤال المفتوح
الرقم الذي سيجعل هذه الصفحة تبدو قديمة بأسرع وتيرة هو السعر. سعر Sol الترويجي سارٍ على الأقل حتى 21 نوفمبر 2026، ولم تنشر OpenAI أي سعر بعد الترويج؛ وعندما يتغير ذلك، سيتغير مضاعف 2.5x في هذا المقال معه، في اتجاه 2x. والثاني هو ما إذا كان أي شخص سيعيد تشغيل هذه التقييمات بشكل مستقل على نفس منصة الاختبار — DeepSWE هو النموذج لما ينبغي أن يبدو عليه ذلك، وOSWorld 2.0 وTerminal-Bench 4.0 هما الصفان الأكثر حاجة إلى هذه المعالجة. وحتى ذلك الحين، فإن الملخص الصادق لاختبارات GPT-6 Astra هو أن الأرقام المبهرة وصلت إلى حد التشبع، والأرقام التمييزية مُبلَّغ عنها من المورّد ومتقاربة، والرقم المستقل الوحيد هو تعادل تصفه مواد الإطلاق الخاصة بالمورّد نفسه بأنه رقم قياسي.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
