
Agora-2 مقابل Kimi K3: عشرون مشاركًا في عالم مشترك، والنموذج ذو المليون رمز الذي يؤدي دورًا واحدًا فيه
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 36 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 181 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
إذا استبعدنا مقاييس الأداء، ثمة عدم تماثل واحد يحسم هذه المقارنة. Odyssey أطلقت Agora-2 في 21 سبتمبر 2026 — نموذج عالمي متعدد الوكلاء قابل للعب يولّد بيئة مشتركة وتفاعلية لما يصل إلى 20 إنسانًا ووكلاء ذكاء اصطناعي في الوقت الفعلي، بدقة 640×480، انطلاقًا من محاكاة متعلَّمة إضافة إلى مُصيّر لكل منظور. Kimi K3، من Moonshot AI، هو نموذج مفتوح الأوزان بـ2.8 تريليون معامل، بنافذة سياق تبلغ 1,048,576 رمزًا، ودرجة 44 على مؤشر Artificial Analysis Intelligence Index، صدر في 15 يوليو وهو متاح للتنزيل منذ 27 يوليو. كلاهما مفتوح بالمعنى الذي يهم فريق البحث — فأوزان Kimi K3 موجودة على Hugging Face بموجب ترخيص MIT معدّل، والتقرير التقني لـAgora-2 منشور بالكامل — وليس أي منهما مفتوحًا بالمعنى الذي يهم المشتري: فلا أوزان لـAgora-2، ولا API، ولا سعر، وترخيص Kimi K3 يحمل قيودًا تجارية. السؤال المفيد ليس أيهما أذكى. بل أيهما يمكن أن يكون جزءًا من نظام متعدد الوكلاء هذا الربع.
ما الذي يمكن تنزيله فعليًا، وما الذي يمنحك إياه ذلك؟
Kimi K3 هو الخيار الأكثر تقليدية بفارق كبير. نموذج MoE بمعاملات 2.8T مع سياق مليون رمز، وإدخال نصي وصوري، وتحكم في جهد الاستدلال على مستوى أعلى بدلاً من معاملات أخذ العينات، واستدعاء أدوات أصلي، وواجهة متوافقة مع OpenAI. سعره 3.00$/15.00$ لكل مليون رمز مع سعر قراءة من الذاكرة المؤقتة 0.30$، ويسجل 44 على index v4.3.2 — في المرتبة الثالثة بين نماذج مفتوحة الأوزان على تلك اللوحة، خلف 46 الخاصة بـ MiMo-V2.6-Pro و45 الخاصة بـ GLM-5.3. وعلى اللوحة نفسها يحصل على 85.0 في terminal-bench 2.1 و59.5 في SciCode. إذا كان نظامك متعدد الوكلاء يحتاج إلى دماغ لكل وكيل، فهذا دماغ يمكنك استئجاره بتكلفة زهيدة أو تشغيله بنفسك.
Agora-2 هو نوع مختلف من القطع الأثرية. ما نشرته Odyssey هو تقرير تقني من 23 صفحة ومعاينة في المتصفح. يصف التقرير بيئة لعبة أكشن أيزومترية مع تمثيلات صريحة لهوية الكيان، والموقع، والصحة، والرسوم المتحركة، والموت، وإعادة الظهور؛ ونموذج محاكاة يتنبأ بالحركة والقتال والرسوم المتحركة من سجلات الكيانات والإجراءات والهندسة المحلية؛ ونموذج عرض لكل مشارك يولّد رؤية المشارك الخاصة به من تمثيل مرئي مضغوط للحالة المشتركة. لا شيء في ذلك الوصف هو نموذج لغوي، ولا شيء فيه قابل للتنزيل.
• ما هو — Agora-2 محرك ألعاب مُتعلَّم يُصيّر 640×480 لكل عرض مقابل Kimi K3 نموذج نصي مفتوح الأوزان بـ 2.8 تريليون معامل
• درجة مستقلة — Agora-2: لا توجد نتائج منشورة، مقابل Kimi K3 AA Intelligence Index 44 (v4.3.2)، المتصدر في الأوزان المفتوحة
• السياق — حالة مشتركة في Agora-2 بالإضافة إلى سجل محدود لكل عرض مقابل Kimi K3 بعدد 1,048,576 رمزًا
• السعر — Agora-1: لا يوجد سعر منشور، معاينة في المتصفح فقط مقابل Kimi K3: $3.00/$15.00 لكل مليون، $0.30 للمخزّن مؤقتًا
• الترخيص — تقرير Agora-2 متاح للعموم، ولا أوزان منشورة، مقابل Kimi K3 بترخيص MIT معدّل، والأوزان على Hugging Face
• المدخلات — عناصر تحكم متصفح Agora-2 بالإضافة إلى 16 سياسة وكيل RL مقابل نص وصورة Kimi K3


الدور الذي يلعبه كل واحد في نظام متعدد الوكلاء
هذان لا يلتقيان إلا داخل نظام يحتوي كليهما. Kimi K3 مرشّح لطبقة القرار — المكوّن الذي يقرأ مخرجات الأدوات، ويكتب الشيفرة، ويختار الإجراء التالي في حلقة طويلة الأفق. نافذته البالغة مليون توكن وسعر القراءة المخزّنة مؤقتًا البالغ 0.30 دولار موجّهان تحديدًا نحو عبء العمل الذي تولّده الحلقات الوكيلية: سياقات ضخمة ومتكررة قد تكون كارثية بسعر الإدخال الكامل.
Agora-2 مرشّح للطبقة الأدنى — البيئة. وإطار Odyssey نفسه هو أن نماذج العوالم متعددة الوكلاء تتيح للباحثين دراسة كيفية تفاعل الوكلاء "داخل محاكيات مُحكمة، حيث يمكن التحقيق في السلوك الضار دون تعريض أنظمة العالم الحقيقي للخطر"، وهي جملة تُقرأ كردّ مباشر على تقرير METR الذي نسّق فيه نحو 1,200 وكيل عملية اقتحام من داخل صندوق رمل للتقييم. والسياسة التي تُحرّك كيانات Agora-2 الستة عشر المستقلة ليست نموذجًا لغويًا كبيرًا (LLM)؛ بل هي سياسة قياسية ومكانية تكرّرية مدرّبة بالتعلّم المعزّز، تستهلك سجلًا من ست عشرة ملاحظة وتُصدر إجراءً كل أربع نبضات محاكاة. إذا أردت معرفة ما يفعله وكيل من فئة Kimi K3 عندما يتخذ ستة عشر خصمًا قراراتهم أيضًا، فإن Agora-2 طريقة واحدة لبناء الحلبة. وهي ليست طريقة لاستبدال الوكيل.
قراءة الأرقام على كلا الجانبين
درجة 44 التي سجّلها Kimi K3 قياسٌ أجرته جهة لا تعمل لدى Moonshot، وعلى المؤشر v4.3.2 نفسه المستخدم لكل النماذج الأخرى في هذه الصفحة، وهي الدرجة التي تجعله نموذجًا حدوديًا مفتوح الأوزان موثوقًا. أما نافذة السياق والسعر وقائمة الأنماط فهي حقائق منشورة.
تأتي أرقام Agora-2 من تقرير Team Odyssey نفسه. النتيجة الرئيسية هي مقارنة تصيير: مُصيّر ذو بادئة مهيكلة يصل إلى 30.11 dB PSNR مقابل 20.67 dB لخط أساس قائم على VAE على ثلاثين مقطع مراقبة بثلاث بذور أخذ عينات لكل مقطع. يحرص التقرير على القول إن هذه المقارنة تشمل أنظمة كاملة بميزانيات تدريب غير متطابقة، ولا تعزل البنية. أما معيار التكييف الذي يُظهر انخفاضًا بنسبة 45.8% في وقت مزيل الضوضاء مقابل الانتباه المتقاطع، فيُجرى على مزيلات ضوضاء مهيأة عشوائيًا بمدخلات اصطناعية — اختبار لتكلفة التنفيذ، وليس صراحةً مقياسًا لجودة الصورة. ويغطي تقييم المحاكاة الحركة أحادية الخطوة والتنبؤ بالرسوم المتحركة على أمثلة مسجلة محجوزة.
ويتولى قسم القيود قول الباقي. إن هدف العرض البالغ 30 إطارًا في الثانية ووتيرة 15 تحديثًا كامنًا في الثانية مذكوران كهدفين؛ أما معدل الإطارات المستدام وزمن الاستجابة من الإدخال إلى العرض أثناء اللعب المباشر متعدد الوكلاء فلم يُقيَّما كميًا. الجودة البصرية طويلة المدى، والتوافق بين وجهات النظر، والالتزام بالإجراءات من طرف إلى طرف، كلها غير مُقيَّمة. يوجد تنوّع إجرائي في التخطيطات ضمن نطاق التدريب، لكن الانتقال إلى أصول أو قواعد أو بيئات جديدة لم يُختبر. هذا ليس انتقاصًا من Odyssey — فالتقرير أكثر صراحةً بشأن فجواته الخاصة من معظم مواد الإطلاق — لكنه هو الافتراض المسبق الصحيح لأي شيء تقرؤه عن قدرات Agora-2.
أي واحد يمكنك أن تبني عليه هذا الأسبوع؟
إذا كنت بحاجة إلى نموذج رائد مفتوح الأوزان في بيئة الإنتاج، فالإجابة هي Kimi K3، وليس هناك منافس قريب. فنتيجته المستقلة 44، ونافذة المليون رمز لديه، وإدخال الصور، وسعر 3/15 دولارًا مع قراءات ذاكرة مؤقتة رخيصة، كلها حزمة قابلة للنشر مطروحة على الساحة منذ يوليو. وعلى OrcaRouter يُقدَّم بسعر القائمة الخاص بـ Moonshot نفسه دون أي هامش ربح، وهذا يهم أكثر من المعتاد بالنسبة لهذا النموذج: فحلقة وكيل ذات سياق طويل تنفق معظم رموزها على بادئات متكررة، وسعر قراءة الذاكرة المؤقتة البالغ 0.30 دولارًا الذي يمرر دون تغيير هو الفرق بين أسطول ميسور التكلفة وآخر ليس كذلك. التحويل التلقائي عند الفشل عبر المزوّدين هو النصف الثاني من ذلك — فكلما طالت الحلقة، زادت كلفة فشل أحد المزوّدين في منتصف التشغيل.

لا تملك Agora-2 بطاقة أسعار، لذا لا يوجد ما يمكن توجيه الطلبات إليه، ولا نستضيفها نحن. ما تقدّمه لفريق متعدد الوكلاء هو معاينة بحثية لبيئة يمكن تشغيلها اليوم في متصفح، ومدعومة بتقرير معماري عام، ضمن فئة لم يكن فيها حتى الآن محاكي عالم مشترك خارج محرك ألعاب. إذا كان اهتمامك ينصبّ على ما يفعله الوكلاء ببعضهم البعض، فهذا شيء مفيد حقًا لامتلاكه ويستحق أن تخصص له بعد ظهر. وإذا كان اهتمامك بما يستطيع الوكلاء فعله، فإن Kimi K3 هو النموذج، ونموذج العالم ليس بديلاً عنه — فهما يقعان في طبقتين مختلفتين من المكدس نفسه، وطبقة واحدة فقط منهما لها سعر يمكن وضعه في جدول بيانات.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
