
Agora-2 مقابل Grok 4.6: مسألة سياسة الوكيل — 1,200 وكيل LLM، والمحاكي الذي لا يستخدم أياً منهما
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 36 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 181 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
إليك رقم يكلف المال. أحصى تحقيق METR في حادثة Hugging Face في يوليو 2026 نحو 1,200 وكيل منسّق داخل تشغيل تقييم واحد. وبالنسبة إلى Grok 4.6، فبطاقة أسعاره — 2.00 دولار لكل مليون رمز إدخال، و6.00 دولار لكل مليون رمز إخراج — فإن أسطولًا بهذا الحجم، يستهلك نصوصًا طويلة على مدى ستة أيام، يشكّل فاتورة يمكن لفريق ممول جيدًا أن يستوعبها فعلًا. أما بسعر النموذج الذي كنت ستلجأ إليه لولا ذلك، فهي ليست كذلك. هذا هو ادعاء المنتج الحقيقي لـGrok 4.6، وهو الادعاء نفسه Agora-2 يناقضه بهدوء: فعندما Odyssey قدّمت نموذجها العالمي متعدد الوكلاء في 21 سبتمبر 2026 — معاينة قابلة للعب تولّد عوالم مشتركة لما يصل إلى 20 من البشر ووكلاء الذكاء الاصطناعي — لم يكن الوكلاء بداخله نماذج لغوية على الإطلاق. درّبت Odyssey سياسات تعلّم معزّز صغيرة بدلًا من ذلك. السؤال المثير الذي يطرحه هذا الاقتران ليس أيهما أفضل. بل لماذا تخطّى المختبر النموذج اللغوي الكبير.
بطاقة الأسعار، بالوحدة التي تهم الأساطيل.
صدر Grok 4.6 في 12 أغسطس 2026 كفئة xAI الرائدة: نافذة سياق تبلغ 500,000 توكن، وإدخال نص وصورة وملف، وجهد استدلال قابل للضبط، واستدعاء أدوات أصلي، ومخرجات منظمة، ومؤشر ذكاء Artificial Analysis بقيمة 44 على index v4.3.2 — المؤشر نفسه الذي يضع GPT-5.6 Sol عند 47 وKimi K3 عند 44. ويمنحه Artificial Analysis درجة 94.9 على GPQA Diamond، وهو النموذج الذي تُدرجه xAI باسم "Latest" في وثائق المطورين الخاصة بها. ويُقدَّم كنموذج OpenAI Responses من الدرجة الأولى، وهذه هي النقطة العملية: تعتمده أطر عمل الوكلاء بتغيير عنوان URL الأساسي، لا بكتابة محوّل.
لكن الرقم المثير للاهتمام هو اقتران $2/$6 بنافذة السياق. حلقات الوكلاء طويلة الأفق أعباء عمل قبيحة — عشرات الآلاف من الرموز المتراكمة من مخرجات الأدوات لكل وكيل في الساعة، معظمها زائد عن الحاجة. معدل قراءة ذاكرة التخزين المؤقت في Grok 4.6 هو $0.50 لكل مليون، أي ربع سعر مدخلاته، وهذا ما يجعل تشغيل ألف وكيل معقولًا حسابيًا وليس ممكنًا فحسب. لاحظ حد الطبقة: تُحتسب المطالبات التي تتجاوز 200 ألف رمز بضعف السعر الأساسي، لذا فإن الوكيل الذي ينمّي سجلًا طويلًا يضاعف تكلفته بصمت.
• السعر — Agora-2 لا يوجد سعر منشور، معاينة المتصفح فقط مقابل Grok 4.6 $2.00/$6.00 لكل مليون، $0.50 للقراءة المخزنة مؤقتًا، يتضاعف فوق 200 ألف إدخال
• السياق — حالة مشتركة من Agora-2 بالإضافة إلى سجل محدود لكل عرض مقابل 500,000 توكن لدى Grok 4.6
• نتيجة مستقلة — Agora-2: لم يُنشر أي منها مقابل Grok 4.6 AA Intelligence Index 44 (v4.3.2)
• الاستدلال — Ago-2 ليس، وليس نموذجًا لغويًا، قادر على الجهد، واستدعاء الأدوات الأصلي
• الوصول — معاينة قابلة للعب من Agora-2، بلا API وبلا أوزان، مقابل واجهة API مملوكة من Grok 4.6
• العتاد — Agora-2 بأربع وحدات RTX PRO 4500 GPU لأربعة عروض متزامنة مقابل Grok 4.6 نقطة نهاية مستضافة

لماذا لم يضع Odyssey نموذج LLM في الساحة
الطريق المختصر البديهي، إذا كنت تبني عالماً يتصارع فيه ستة عشر وكيلاً من وكلاء الذكاء الاصطناعي ضد أربعة بشر، هو ربط نموذج نصي قادر بعناصر التحكم وتركه يلعب. لم تفعل Odyssey ذلك، ويوضّح تقريرها التقني السبب في جدول الإعدادات. سياسة الوكيل في Agora-2 هي سياسة قياسية ومكانية تَكرارية تستهلك سجلاً من ستة عشر ملاحظة، وتُصدر إجراءً واحداً كل أربع نبضات محاكاة عبر أربعة عشر فرعاً منفصلاً من فروع الحركة. أما المحاكاة نفسها فتتقدّم على قاعدة زمنية للنَبْض بمعدل 30 هرتز. النموذج الذي يُطلب منه اتخاذ قرار ثلاثين مرة في الثانية، انطلاقاً من رؤية مرصودة جزئياً، وبمفردات ثابتة منخفضة المستوى للإجراءات، ليس مسألة استدلال — بل مسألة تحكّم، ومسائل التحكّم تُحَل بتدريب سياسة صغيرة، لا بتوجيه نموذج رائد بسياق 500 ألف.
يستحق هذا التوضيح الصريح لأنه أكثر المفاهيم الخاطئة شيوعًا بشأن فئة نماذج العالم. لا تنافس Agora-2 نموذج Grok 4.6 على الخانة نفسها في النظام. بل تشغل الخانة الواقعة تحتها: البيئة التي تُدرَّب فيها السياسة وتُقيَّم. وتُبيّن معمارية التقرير هذا التقسيم بوضوح — إذ يتنبأ نموذج محاكاة بكيفية تغيير الإجراءات المجمّعة للحالة المشتركة، ويطبّقها خادم عالم، ثم يولّد نموذج عرض لكل منظور المنظور الخاص بكل مشارك بدقة 640×480 انطلاقًا من تلك الحالة. ولا يظهر أي نموذج نصي في أي مكان ضمن حلقة التفاعل.

إنما يظهر نموذج مثل Grok 4.6 على مستوى أعلى: بصفته الكيان الذي يكتب السقالات التقييمية، أو يحلّل النصوص المسجلة، أو يقود الوكيل الذي يستخدم الأدوات والذي تحاول دراسة سلوكه. وهذا بالتحديد هو الدور الذي لعبه GPT-5.6 Sol في تحقيق METR — نحو 5% من الأسطول، والمحلّل الذي يقرأ السجلات — وهو الدور الذي يجعله سعر Grok 4.6 ونافذة سياقه رخيصًا.
فجوة الأدلة هنا أوسع مما هي عليه في معظم هذه المواجهات.
درجة مؤشر Grok 4.6 مقيسة بشكل مستقل، وبطاقة أسعاره منشورة، ونافذة سياقه موثّقة. أرقام Agora-2 تأتي من تقرير من تأليف Team Odyssey ولم يعِد إنتاجه أحد. على ثلاثين مقطعًا من مقاطع المراقبة، يبلغ مُصيِّر البادئة المهيكلة الخاص به 30.11 dB من PSNR مقابل 20.67 dB لخط أساس VAE — وهي مقارنة يحذّر التقرير نفسه من أنها بين أنظمة كاملة ذات ميزانيات تدريب غير متكافئة، لا اختبار معماري معزول. أما معيار التكييف الخاص به، الذي يُظهر تقليلًا بنسبة 45.8% في زمن مزيل الضوضاء مقابل الانتباه المتقاطع، فيستخدم مزيلات ضوضاء مهيّأة عشوائيًا على مدخلات اصطناعية ويقيس تكلفة التنفيذ، لا جودة الصورة.
ثم قسم القيود، وهو مباشر على نحو غير معتاد. إنّ 15 تحديثًا كامنًا و30 إطارًا معروضًا في الثانية المذكورة هي أهداف. لم يُقيَّم معدل الإطارات المستمر وزمن الاستجابة من الإدخال إلى العرض أثناء التفاعل الحي متعدد الوكلاء تقييمًا كميًا. الجودة البصرية على المدى الطويل، والتوافق بين المشاهد، والالتزام بالإجراءات من طرف إلى طرف، كلها مُدرجة باعتبارها غير مُقيَّمة. تتطلب البيئة محرك لعبة مزوّدًا بأدوات قياس مع هندسة صريحة ومفردات مظهر ثابتة، كما أن النقل إلى أصول أو قواعد أو بيئات جديدة لم يُختبر. اقرأ تلك القائمة قبل أن تقرأ أي رقم رئيسي عن Agora-2.
أيٌّ منها يناسب مجموعتك التقنية
إذا كنت تدير أو تدرس أنظمة متعددة الوكلاء اليوم، فإن Grok 4.6 هو المكوّن الذي يمكنك نشره فعليًا — نموذج نصي من الطراز الأول بسعر يجعل أساطيل الوكلاء الكبيرة ميسورة التكلفة، مع نتيجة منشورة وواجهة API موثقة.على OrcaRouter، يتم تقديمه بسعر القائمة الخاص بـ xAI نفسه دون أي هامش ربح، لذا فإن سعر $2/$6 المذكور أعلاه وأي تغيير مستقبلي في السعر يصلان إلى فاتورتك في اليوم الذي يحدثان فيه، مع التحويل التلقائي في حال تدهور نقطة النهاية الأساسية. وكلتا الحقيقتين تهمان أحمال عمل الأسطول تحديدًا: ألف وكيل تعني ألف فرصة للاصطدام بمزوّد متدهور، وأي هامش ربح فوق ناتج $6 هو هامش ربح مضروب في كامل تشغيلك.

أغورا-2 ليست بنية تحتية قابلة للنشر، ونحن لا نستضيفها — فلا توجد واجهة برمجية، ولا أوزان، ولا سعر، بل فقط معاينة تفاعلية خاصة بأوديسي. وما تقدّمه هو نوع مختلف من القيمة: بيئة مضبوطة لبحوث التفاعل التي يُظهر تقرير METR أنها باتت ملحّة الآن، بتكلفة أربع وحدات RTX PRO 4500 لأربع مشاهدات متزامنة بدلاً من فاتورة واجهة برمجية. والحكم الصريح هو أن هذين لا يتنافسان. فـGrok 4.6 هو العقل السياساتي الذي يمكنك شراؤه بالرمز اليوم؛ أما أغورا-2 فهي اقتراح بشأن أين تُختبر ما يحدث عندما تلتقي آلاف من تلك العقول. والثاني بحث أكثر إثارة للاهتمام ومنتج أقل اكتمالاً، وتقرير أوديسي نفسه واضح بشكل منعش بشأن أي أجزاء منه لا تزال أهدافاً.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
