بطاقة عنوان رئيسية لـ Apodex 1.1 بعنوان 'Apodex 1.1' مع عنوان فرعي '44 on the Intelligence Index - agentic strength, heavy verbosity, and a knowledge catch'، وشارات صغيرة تحمل 'AA Index 44' و'#11 of 177' و'256K context'، وسطر تذييل 'Released Aug 24, 2026 - first Apodex model on Artificial Analysis'، مع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

أبودكس 1.1، شرح: 44 في مؤشر الذكاء، قوة وكيلية حقيقية — ومأخذ على موثوقية المعرفة

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Apodex 1.1 نموذج عمره أسبوع واحد فقط، وهو نموذج احتكاري، وحتى هذا الأسبوع كان في الغالب مجرد فضول مخبري. ثم نشرت Artificial Analysis أول تقييم مستقل للنموذج — وهو الأول لـ Apodex على المنصة — وقد أتت لوحة النتائج بشيء غير معتاد: حقق Apodex 1.1 درجة 44 على مؤشر Artificial Analysis Intelligence Index، محتلًا المرتبة 11 من 177، بينما سجّل نتائج في الأعمال الوكيلية (agentic-work) تتفوق على كل نموذج ضمن مستواه الذكي، بما في ذلك DeepSeek V4 Pro وQwen3.7 Max وKimi K2.6. وكشف التقرير نفسه عن رقم ثانٍ أكثر قبحًا: سجل موثوقية معرفة ضعيف لدرجة تكفي لتغيير قرار تشغيل أعمال حقيقية عليه. أما شقيقه مفتوح الأوزان، Apodex 1.1 Mini، فهو النموذج الذي يمكن لمعظم الناس تشغيله فعليًا. إليكم ما يقوله التقييم، وما لا يقوله، ومن ينبغي أن يهتم به.

Apodex، شركة الذكاء الاصطناعي التي أسسها Chen Tianqiao، أطلقت العائلة في 24 أغسطس 2026، إلى جانب ورقة بحثية على arXiv بمشاركة 70 مؤلفًا، بعنوان "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). النموذج الرئيسي مملوك — بنحو 397 مليار معامل، وفقًا لتقرير البائع — مبني على فرضية أن العائق الحقيقي للوكلاء ليس الذكاء الخام بل البيئة التي يعملون فيها. لذلك تم تدريب Apodex 1.1 للعمل مباشرةً مع الملفات والبحث والبرمجة عبر آفاق زمنية طويلة، مع بيئة تنفيذ مشتركة ("AgentOS") تنسّق ما يصل إلى 150 وكيلًا فرعيًا متوازيًا وتحتفظ بسجل تتبع لكل خطوة. أما الجزء المفتوح فهو النسخة الشقيقة: Apodex 1.1 Mini، وهو نموذج MoE من فئة 35B، مضبوط بدقة من نموذج أليبابا المُسمىQwen3.5-35B-A3B، المُصدَر بموجب رخصة Apache-2.0 مع بيئة وكلاء مصاحبة تُسمى FrontierAgent. ولا يمكن الوصول إلى النموذج الكامل إلا عبر واجهة برمجة التطبيقات الخاصة بشركة Apodex ومنصة العمل عبر الإنترنت؛ أما نسخة Mini فهي ذاتية الاستضافة أو لا شيء.

ما معنى درجة 44 في مؤشر الذكاء

مؤشر الذكاء الاصطناعي من Artificial Analysis هو إجمالي مرجّح لمجموعة معايير المنصة — بما في ذلك تقييمات العوامل مثل GDPval-AA v2 وTerminal-Bench، بالإضافة إلى مكونات التفكير والرياضيات والمعرفة. درجة 44 تضع نموذج Apodex 1.1 في المرتبة 11 من بين 177 نموذجًا، أي أعلى بكثير من الوسيط البالغ 18. كما يضع هذا النموذج في فئة مزدحمة ومثيرة للاهتمام: فـKimi K2.6 (45) وMiniMax-M3 (45) وInkling (42) جميعها تقع ضمن ثلاث نقاط، وApodex 1.1 هو الوحيد ضمن هذه المجموعة الذي كان اسمه غير معروف لمعظم مستخدمي الذكاء الاصطناعي قبل أسبوع. وتشير Artificial Analysis إلى أن الصفحة تغطي نسخة التفكير من النموذج، وأنه قد توجد أيضًا نسخة غير معتمدة على التفكير.

A single-column scoreboard for Apodex 1.1 titled 'Apodex 1.1 - the scoreboard' listing AA Intelligence Index 44 (#11 of 177), GDPval-AA v2 Elo 1348, TerminalBench v2.1 70%, Output tokens per task ~17,000, Full Index evaluation cost 18.41, and AA-Omniscience -21.9 (78% hallucination), with a footer 'All figures per Artificial Analysis, August 2026.' and the OrcaRouter logo in the bottom-right corner.

ليست درجة مؤشر العنوان الرئيسي هي ما يجعل هذا النموذج مثيرًا للاهتمام. إنه مثير للاهتمام لأن مواطن قوته وضعفه تقع بالنسبة إلى تلك الدرجة — وهذا ما تجسده مقارنة المستويات.

حيث يتفوق على مستواه: تقييمات الأعمال الوكيلية والمعرفية

في مكوّني Index اللذين يقيسان العمل الوكيلي الواقعي، يتفوق {{1}}Apodex 1.1{{/1}} على جيرانه ضمن نطاق 44 نقطة. في GDPval-AA v2 — وهو معيار يقيّم قدرة الوكيل على إكمال مهام مكتبية واقعية من البداية إلى النهاية — يسجّل {{2}}Apodex 1.1{{/2}} إيلو 1348، متقدمًا على DeepSeek V4 Pro (1333) وQwen3.7 Max (1308) وKimi K2.6 (1202). في TerminalBench v2.1، الذي يختبر وكيلًا يعمل على طرفية، يسجّل 70%، متقدمًا على Kimi K2.6 (66%) وخلف Qwen3.7 Max (75%) بقليل. هذه أرقام مستقلة من إعداد Artificial Analysis، وهي أقوى دليل في التقرير على أن التدريب القائم على البيئة أولًا يعمل.

تتجاوز ادعاءات البائع الخاصة بمعايير الأداء ذلك، ويجب قراءتها كبيانات مقدَّمة من البائع حتى يقوم شخص ما بتكرارها: APEX-Agents 38.5، وGDPVal 78.8، وSWE-bench Verified 77.7%، وTerminal-Bench 2.1 70.8%، وHumanity's Last Exam 56.1% مع الأدوات، وDeepSearchQA 92.4%، وFrontierFinance 54.3، وFrontierScience-Research 63.3. ما يجعل الطابع الوكيلي (agentic) ذا مصداقية بدلاً من كونه مجرد ضجيج هو البنية التي تقف خلفه: توسيع نطاق البيئة (زيادة تنوع بيئات الملفات القابلة للتنفيذ والبحث والبرمجة المستخدمة في التدريب) وتوسيع نطاق التنسيق الوكيل (تدريب النموذج على تفكيك المهام طويلة المدى، وتفويض العمل المتوازي، ودمج النتائج غير المتزامنة، وإعادة التخطيط). يطلق وضع "Agent Team" ما يصل إلى 150 وكيلًا فرعيًا في مهام الاسترجاع والتوليف، ويتضمن خطوة تحقق مدمجة ("Statement Review") تفحص الاستنتاجات قبل تسليمها. بمعنى آخر: هذا نموذج صُمم ليكون مخطئًا، ويراجع نفسه، ويصحح الأمور — وليس لترديد الحقائق من الذاكرة.

التكلفة الخفية لكل تلك الفاعلية: الإسهاب

يظهر هذا التصميم في جدول كفاءة التكلفة الخاص بـ Artificial Analysis على أنه أضعف نقطة في النموذج بعد المعرفة: فهو مطول للغاية. استهلك تشغيل مؤشر الذكاء الكامل 180 مليون رمز إخراج — مقارنة بمتوسط 67 مليونًا — ونحو 17,000 رمز إخراج لكل مهمة معيارية، مقابل حوالي 9,400 لـ Qwen3.7 Max و8,100 لـ MiniMax-M3. في المجمل، بلغت تكلفة التقييم الكامل 618.41 دولارًا من الإنفاق على واجهة برمجة التطبيقات، وفقًا لـ Artificial Analysis.

A screenshot of the Artificial Analysis model page for Apodex 1.1 (captured August 31, 2026), showing 'Apodex 1.1 scores 44 on the Artificial Analysis Intelligence Index' with a median of 18, the note that it generated 180M tokens versus a 67M median, pricing of $0.30 per 1M input and $3.00 per 1M output tokens, and the $618.41 total cost to evaluate the model on the Intelligence Index.

التسعير الذي ينتج هذه الفاتورة: 0.30 دولار لكل مليون رمز إدخال و3.00 دولارات لكل مليون رمز إخراج — سعر 0.03 دولار للإصابة بالذاكرة المؤقتة عند استخدام المدخلات المخزنة، بخصم 90% — وهو ما يبلغ حوالي 0.38 دولار لكل مليون على مزيج نموذجي بنسبة 7:2:1 (ذاكرة مؤقتة/إدخال/إخراج). كلا السعرين لكل رمز أعلى من متوسطات المنصة (0.25 دولار للإدخال، 0.90 دولار للإخراج). ومع ذلك، فإن تقدير التكلفة لكل مهمة من Artificial Analysis لا يزال يضع Apodex 1.1 عند حوالي 0.05 دولار لكل مهمة معيارية، وهو أرخص من Qwen3.7 Max (حوالي 0.07 دولار) وKimi K2.6 (حوالي 0.06 دولار). هذا التوفيق مهم للميزانية: رموزه رخيصة بما يكفي حتى أن الإسهاب الكبير يظل تنافسيًا لكل مهمة — خطر التكلفة هو الحجم، وليس المعدل. إذا وضعت وكيلًا طويل التشغيل عليه، فإن الفاتورة تتحدد بكمية كلامه، وهو يتحدث كثيرًا.

ملاحظة حول التسعير قبل أن تضع ميزانيتك: إن $0.30/$3.00 هو سعر القائمة الخاص بالبائع. أي منصة توجيه تمرّر أسعار المزودين كما هي دون أي زيادة (بهامش ربح 0%) ستفرض هذا الرقم بالضبط، وأي تخفيض مستقبلي لأسعار Apodex سيظهر في نفس اليوم الذي يُعلن عنه.

العائق: سجل ضعيف في موثوقية المعرفة.

هذا هو الرقم الذي يغفله معظم التغطية الإعلامية للإطلاق. في اختبار AA-Omniscience، وهو مقياس موثوقية المعرفة من Artificial Analysis، يحصل Apodex 1.1 على -21.9. يحاول الإجابة عن 87% من الأسئلة بدلاً من الاعتذار، لكنه يصيب 32% فقط، ومعدل الهلوسة لديه 78.4%. بالنسبة لنموذج يُقدَّم كحلّال مهام ثقيل، هذا انقسام شخصية خطير: قوي في التنفيذ الوكيل، ضعيف في المعرفة المؤسَّسة.

الحقيقتان مترابطتان، وليستا متناقضتين. معايير الوكلاء تكافئ العمل في بيئة — إصدار استدعاءات الأدوات، والتكرار، والتعافي — لذا يمكن للنموذج أن يسجل نتائج جيدة هناك بينما يكون استرجاعه ضعيفًا، لأن البيئة هي التي تتولى التذكر. التصميم نفسه يفترض ذلك: {{1}}مراجعة العبارات{{/1}} موجودة لفحص المخرجات، و{{2}}منضدة العمل{{/2}} مبنية حول التحقق، وليس حول أن يكون النموذج مصيبًا من الذاكرة. القراءة العملية صريحة: لا توجّه {{3}}Apodex 1.1{{/3}} إلى مهام تعتمد على استرجاعه للمعلومات من أوزانه الذاتية. وجّهه إلى مهام بعيدة المدى حيث يمكن التحقق من عمله مقابل الملفات والكود والمصادر — وتحقّق من التسليم.

النظير المفتوح: Apodex 1.1 Mini وFrontierAgent

إذا كانت البوابة المغلقة للرائد تمثل مشكلة، فإن النصف المفتوح من العائلة هو الثقل الموازن. Apodex 1.1 Mini هو نموذج MoE بحوالي 35 مليار معلمة إجمالاً / 3 مليارات معلمة نشطة، مُعالَج بدقة من Qwen3.5-35B-A3B (نموذج أساسي من Alibaba صدر مفتوح المصدر في فبراير 2026)، ومُطلق بموجب رخصة Apache-2.0 مع نافذة سياق تبلغ 262 ألف رمز، وإصدارات FP8 وFP4 وGPTQ-Int4 على Hugging Face. النتيجة الرئيسية المعلنة من المورّد هي 50.2 على FrontierFinance (الأولى في مقارنة Apodex الخاصة) و27.7 على APEX-Agents مع تفعيل بيئة Agent Team. أما FrontierAgent — بيئة التشغيل مفتوحة المصدر المرافقة له — فهي القطعة المثيرة للاهتمام فعلاً: بيئة قائمة على الطرفية مع وضعَي ReAct وAgent Team، وعمل ملفات داخل بيئة معزولة، وبوابات موافقة، ونقاط توقف، وسجلات تتبّع، وكل ذلك يتواصل مع أي نقطة نهاية متوافقة مع OpenAI.

شيئان يجدر بك معرفتهما قبل أن تستضيف النموذج بنفسك. أولاً، Mini نموذج مضبوط بدقة، وليس نموذجًا من نماذج الحدود — اقرأ أرقام معاييره بالطريقة نفسها التي تقرأ بها جدول البائع للنموذج الرائد: مقارنات غير مستنسخة، تتضمن أدوات القياس، ويختارها البائع. ثانيًا، سلوكه موروث من النموذج الأساسي: إذا أردت اختبار ما إذا كان Qwen3.5-35B-A3B الأساسي يؤدي مهمتك بالفعل، فلست بحاجة إلى GPU ومكدس خدمة لمعرفة ذلك — فالنموذج الأساسي على بُعد استدعاء API واحد.

من يجب أن يستخدم Apodex 1.1 اليوم

النموذج الرائد مبكر ومغلق، ومتاح حاليًا فقط عبر API الخاص بالبائع ومنصة العمل عبر الإنترنت؛ وتقول Apodex إن توفرًا أوسع لـ API قادم عبر المنصات الرئيسية، لكن الأوزان غير مفتوحة. وهذا يقيّد من يستطيع الاستفادة من لوحة النتائج هذا الأسبوع: الفرق الموجودة بالفعل على منصة عمل Apodex، أو المستعدة للتسجيل للحصول على مفتاح API من الطرف الأول. أما Mini فهو المسار الأكثر سهولة، ولكنه يتطلب استضافة ذاتية.

A screenshot of the Apodex online workbench homepage (captured August 31, 2026), showing the deep-research interface with the prompt field 'Ask the question that matters', feature points for a step-level reasoning trace, citations in every report, branching off any report, and full-text search across threads, and a sign-in prompt for saving inquiries.

حيث يكسب النموذج مكانه بجدارة: خطوط أنابيب وكيلة طويلة الأفق تُتحقق مخرجاتها في مراحل لاحقة — منصات عمل بحثية، ومهام متعددة الخطوات تتضمن ملفات وأدوات، وأعمالًا في الطرفية — وحيث يظل ملف التكلفة البالغ نحو 0.05 دولار لكل مهمة قابلاً للاستمرار رغم الإسهاب. أما حيث لا يليق به بعد: أي شيء يعتمد على موثوقية معرفة النموذج نفسه، أو مسار إنتاجي لا يمكنه تحمل سوء تصرف نموذج عمره سبعة أيام وغير مُثبت. وفي هذه الحالة تحديدًا، تعتبر طبقة التوجيه الغلاف المناسب.واجهة برمجة واحدة لأكثر من 200 نموذج تعني أن نموذج Qwen3.5-35B-A3B الأساسي يمكن استدعاؤه بالفعل بسعر القائمة، ويمكن لنسخة Mini المستضافة ذاتيًا أن تقف خلف نفس الراوتر مع تجاوز تلقائي عند الفشل، ولا يمكن لنموذج جديد غير مستقر أن يُسقط مسارًا إنتاجيًا — فعندما يتراجع أداؤه، يتم تحويل الطلب إلى مزود سليم بدلاً منه.

ماذا تشاهد بعد ذلك

هذا التقييم قراءة أولية، وليس حكمًا نهائيًا. ثلاثة أمور ستحدد ما إذا كان Apodex 1.1 سيظل ذا أهمية بعد شهر: {{1}}إعادة إنتاج مستقلة لادعاءات البائع حول القدرات الوكيلية ({{2}}أرقام GDPval وTerminalBench التي يديرها Artificial Analysis هي الوحيدة التي لم ينتجها Apodex نفسه{{/2}}){{/1}}؛ {{3}}ما إذا كانت فجوة موثوقية المعرفة ستضيق في نسخة غير استدلالية أو إصدار لاحق{{/3}}؛ و{{4}}ما إذا كان النموذج سيظهر على المزيد من واجهات البرمجة والمزيد من لوحات النتائج المستقلة{{/4}}، وعندها {{5}}سيصبح الرقمان 44 و-21.9 مشكلةً على شخص آخر التغلب عليها{{/5}}. بالنسبة لنموذج عمره سبعة أيام وبهذا الملف المتباين، فهذا تقريبًا كل ما يمكن أن تطلبه: {{6}}ميزة وكيلية حقيقية، وسعر صادق، ونقطة ضعف واحدة تعرفها قبل أن تشترك{{/6}}.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا