
Ornith-1.5: عائلة النماذج مفتوحة الأوزان التي تكتب منهج تدريبها بنفسها — وتدّعي التفوق على Claude Opus 4.8
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 218 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 123 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 931 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 101 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
Ornith-1.5، عائلة الأوزان المفتوحة من Ornith AI التي تدّعي التفوق على Claude Opus 4.8 في أربعة معايير، أُطلقت في 19 أغسطس 2026 — والشيء الذي يستحق التوقف عنده هو حلقة التدريب، وليس عدد المعاملات. تضم العائلة ثلاثة نماذج: Ornith-1.5-397B، النموذج الرائد من نوع خليط الخبراء (MoE) الذي يضم 397 مليار معامل؛ وOrnith-1.5-35B-A3B، نموذج خليط خبراء يفعّل 3 مليارات معامل لكل توكين؛ وOrnith-1.5-9B، نموذج كثيف بحجم 9 مليارات معامل مع إصدار محمول مكمم. كل نتيجة بارزة هنا مُبلَّغة من المورد: الأرقام جاءت من تشغيلات التقييم الخاصة بـ Ornith AI، بمتوسط خمس تشغيلات، والمتعقب الخارجي الوحيد الذي يملك ملفًا — BenchLM — يضع علامة "مُبلَّغ من المورد" على جميع صفوف المعايير الـ18 ويُبقي العائلة دون ترتيب حتى تتوفر تغطية مستقلة. إليك ما أُطلق فعلًا، وما يعنيه حقًا "تحسين الذات"، وما يمكنك تشغيله اليوم.
ما تم إطلاقه: ثلاثة سلالم، ترخيص MIT، بدون واجهة برمجة تطبيقات
أورنيث للذكاء الاصطناعي — المجموعة التي تقف خلف نموذج Ornith-1.0 مفتوح الأوزان، والمرتبطة بعمل DeepReinforce في أنظمة تعدد الوكلاء للبرمجة التنافسية (GrandCode) وتحسين نواة معالجات الرسوميات (CUDA-L2) — أصدرت العائلة على Hugging Face بموجب رخصة MIT، مع توفير تكميم FP8 وGGUF وMLX وNVFP4 إلى جانب نقاط التحقق الخام. نافذة سياق 256K (262,144 رمزًا) تنطبق على جميع أفراد العائلة. لا توجد واجهة برمجية مستضافة من الطرف الأول ولا سعر للرموز؛ هذا إصدار للاستضافة الذاتية أو التشغيل المحلي، وتقرير الإطلاق يوضح ذلك بوضوح.
المقاييس الثلاثة تستهدف ثلاثة حقائق مختلفة:
• Ornith-1.5-397B — «رهان الحدود المفتوحة»: نموذج MoE بحجم 397B يستهدف المنافسة على الحدود المغلقة في مهام الوكلاء والبرمجة.
• Ornith-1.5-35B-A3B — نموذج MoE بحجم 35B لا يُفعّل سوى 3B من المعاملات لكل رمز، ليمنحك الحل الوسط: قدرة تقترب من النماذج الرائدة بتكلفة استدلال لكل رمز أقل بكثير من نموذج كثيف بحجم 35B.
• Ornith-1.5-9B — نموذج كثيف بـ9 مليارات معلمة للاستخدام المحلي وعلى الجهاز نفسه، مع إصدار Ornith-1.5-9B-Mobile المكمّم الذي يؤكد البائع جاهزيته للنشر على iPhone وAndroid.

صفحة الإطلاق أعلاه هي الإعلان بأكمله: تقرير تقني بدلاً من منشور تسويقي، وهو ما يتماشى مع طابع المختبر.
ادعاء تحسين الذات، مُفكَّك الشفرة
Ornith-1.0، الذي صدر في يونيو 2026، علّم النموذج توليد الهيكل الداعم حول مهام البرمجة — الحزام، والتقسيم، والتنسيق. أما Ornith-1.5 فيوسّع هذه الحلقة لتشمل توليد المهام نفسها. في التدريب، يقوم النموذج الآن بثلاثة أشياء:
• اقترح مهام تدريب جديدة وأكثر صعوبة.
• قم بتوليد السقالة الخاصة بالمهمة المستخدمة لحل وتقييم تلك المهام.
• إنتاج مخرجات الحلول التي تصبح جولته التالية من بيانات التدريب.
تتدفق المكافأة عبر جميع المراحل الثلاث، مُحسَّنة بشكل مشترك مع GRPO. تُقيَّم كل مهمة مقترحة على أساس الصلاحية (يجب أن تكون قابلة للتنفيذ والتحقق)، والصعوبة الحدودية (معدل نجاح الحل المستهدف محدد عند 0.2 — أي مهام يفشل النموذج عادةً في أدائها لكن يمكنه التعلم منها)، والجدة (التنوع عن كل ما سبق رؤيته). تحصل السقالة على مكافأتها الخاصة مقابل التوافق، ودقة المكافأة، ومقاومة اختراق المكافأة، وتتضمن خطوط المعالجة ضمانات ضد الاختراق: قيود على لمس بيئة الاختبار، ومراقبة الوصول إلى المسارات المقيدة، ونموذج تحكيم مجمّد يتجاوز النتائج الشاذة.
التحذير المهم يكمن في كلمة «تحسين الذات»: فهي تصف إجراءات التدريب، وليس الناتج النهائي. النموذج المُنزَّل لا يعيد تدريب نفسه على جهازك. ما تحصل عليه هو نموذج كانت بيانات تدريبه، بشكل غير معتاد، قد تولّدت بواسطة إصدارات سابقة من نفسه — وهذا هو بالضبط نوع الادعاء الذي يستحق الاختبار قبل أن يتحول إلى عقيدة.
ادعاءات المعيار، موسومة بصدق
جميع الأرقام في هذا القسم هي أرقام Ornith AI الخاصة، من تقرير الإطلاق، بمتوسط خمس عمليات تشغيل، ولم يتم إعادة إنتاجها بشكل مستقل. الانتصارات الأربعة التي يدّعي الرائد تحقيقها على Claude Opus 4.8:
• Terminal-Bench 2.1 (منصة Terminus-2): Ornith-1.5-397B 86.1 مقابل Claude Opus 4.8 85.0
• SWE-bench Verified: 86.0 مقابل 85.8
• WideSearch: 80.8 مقابل 72.9
• BrowseComp: 86.6 مقابل 84.3
اقرأها كادعاءات من البائع، وليست حقائق. المعيار الرئيسي الوحيد الذي لا تدّعي فيه Ornith AI الفوز هو DeepSWE، حيث حققت 56.0 مقابل 59.0 لكلود أوبس 4.8 — ويصفه التقرير بأنه "متعادل"، وهي الطريقة الصادقة لقراءة الخسارة. أرقام رئيسية أخرى من التقرير نفسه: HLE 44.6 بدون أدوات و56.1 معها، وGPQA Diamond 92.8، وSWE-bench Pro 65.1.
الطرازان الأصغر حجمًا قويان أيضًا على الورق: Ornith-1.5-35B-A3B يسجّل 79.0 في SWE-bench Verified و68.5 في Terminal-Bench 2.1 (بإطار Claude Code)، بينما يسجّل Ornith-1.5-9B 70.6 في SWE-bench Verified و47.0 في Terminal-Bench 2.1. وبالمقارنة مع النماذج الأخرى مفتوحة الأوزان في التقرير نفسه، تقارن Ornith AI نتائج طراز 397B (86.1 في Terminal-Bench / 56.0 في DeepSWE) بنتائج DeepSeek-V4-Flash-0731 (82.7 / 54.4) ونتائج GLM-5.2 (81.0 / 46.2).

لوحة النتائج المستقلة الوحيدة — ولماذا لا تزال مؤقتة
ملف BenchLM لطراز Ornith-1.5-397B هو حاليًا الصفحة الخارجية الوحيدة الخاصة بالطراز. عنوانه الرئيسي: درجة عامة تبلغ 68.5 من 100، ليحتل المرتبة 20 من أصل 221، مع فئة Agentic الأقوى في المرتبة 13. لكن اقرأ التفاصيل الدقيقة، لأنها تعمل عملًا حقيقيًا — جميع صفوف المقاييس البالغ عددها 18 مُعلَّمة كمُقدَّمة من المزوّد، ويذكر الملف أن الطراز "لا يمتلك بعد تغطية موثّقة كافية لمركز مُتحقَّق منه." المركز غير المُصنَّف في القائمة المُتحقَّقة ليس حكمًا ضد الطراز؛ بل هو بيان بأن لا أحد قام بتشغيله بشكل مستقل بعد، وهو بالضبط ما تتوقعه لإصدار لا يتجاوز عمره أيامًا.

هذه هي الفجوة بين الرقمين في هذا المقال: نتيجة 86.1 من بائع Terminal-Bench هي مجرد ادعاء، ونتيجة BenchLM البالغة 68.5 مبنية بالكامل على صفوف أبلغ عنها البائع. لا تُعدّ أي منهما قياسًا مستقلًا. أول مختبر يشغّل Ornith-1.5-397B عبر منصة اختبار عامة — SWE-bench Verified على مجموعة محددة، وTerminal-Bench على نسخة ثابتة من المنصة — سينتج أول رقم يُعتمد عليه.
ما يمكنك تشغيله فعليًا اليوم
هذا إصدار بأوزان مفتوحة، لذا فإن "تشغيله" يعني سحب الأوزان. كتالوج Ollama يدرج بالفعل ornith-1.5:9b (بناء بحجم ~6.6 غيغابايت) وornith-1.5:35b (بناء بحجم ~23 غيغابايت)، وكلاهما بسياق 256K؛ كما أن بناء 9B يتضمن أيضًا دعم إدخال الصور في قائمة الكتالوج. أما 397B فهو فئة مختلفة من المشكلة: نموذج MoE بمعاملات 397B ليس نموذجًا للحواسيب المحمولة، وأي نشر جاد يتطلب وحدات معالجة رسومية متعددة وتنسيقًا حقيقيًا.
النقطة المثالية العملية لمعظم الفرق هي Ornith-1.5-35B-A3B: المعاملات النشطة البالغة 3B لكل رمز (token) تمنح قدرة نموذج MoE بتكلفة جزء بسيط من تكلفة النموذج الكثيف 35B لكل رمز، كما أن إصدار Ollama البالغ 23 جيجابايت يعمل على بطاقة واحدة ذات ذاكرة VRAM عالية أو على مجموعة صغيرة من الخوادم. أما نسخة 9B فهي التي تضعها على الهاتف.
تلك الخاصية "3B active" هي أيضًا حيث تصبح اقتصاديات التوجيه مثيرة للاهتمام. نماذج الخبراء المتعددين (MoE) ذات المعاملات النشطة تُسعّر بأسعار تقل كثيرًا عن حجمها الكلي، وعندما يتبنى المزودون نموذجًا كهذا، فإن سعر الرمز (token) يميل إلى الانخفاض بسرعة — وهذا هو الحال عند الشراء عبر موجّه يمرّر أسعار المزودين كما هي دون أي زيادة، بدلًا من التعامل مع بائع واحد تتفاوض معه مرة واحدة. يقوم OrcaRouter بذلك بالضبط عبر أكثر من 200 نموذج، لذا فإن أي تخفيض من مزود على نموذج جديد مفتوح الأوزان يصبح ساريًا على جانبنا في نفس اليوم. وبالنسبة لنموذج صدر دون أي شيء سوى معايير المزود، تكون حجة التبديل الاحتياطي هي الأهم: طبقة التوجيه تتيح لك توجيه مسار اختبار إلى نموذج جديد تمامًا، ثم الرجوع إلى نموذج مثبت بمجرد أن يتعثر — أي تجربة إصدار غير مثبت دون المراهنة عليه في مسار إنتاجي.
ما الذي لا يزال مفقودًا؟
• لا توجد واجهة برمجة تطبيقات مستضافة. إذا كنت تريد Ornith-1.5 كخدمة، فهي غير موجودة بعد؛ كل الخيارات هي استضافة ذاتية أو محلية.
• لا يوجد تقييم مستقل. تُبقي BenchLM العائلة دون تصنيف؛ لا مختبر قد نشر تشغيلًا مُتحكمًا به.
• لا توجد تسعيرة للتفكير فيها. لا يوجد سعر للتوكن، لذا فإن حالة "الحدود المفتوحة الرخيصة" تتعلق بالكامل باقتصاديات وحدة معالجة الرسومات الخاصة بك.
• منصات التقييم متباينة. يحتوي Terminal-Bench على عدة نسخ، وأرقام التقرير نفسها موزّعة عبرها: نتيجة 86.1 للموديل 397B على منصة Terminus-2، ونتيجة 68.5 للموديل 35B على منصة Claude Code. المنصات المختلفة تُشكّل ألعابًا مختلفة تمامًا، الأمر الذي يجعل المقارنة العادلة أصعب مما يوحي به الجدول الرئيسي.
ماذا تشاهد بعد ذلك
القصة الجوهرية ليست "نموذجًا مفتوحًا يتفوق على Claude Opus 4.8" — فهذا ادعاء غير مدقَّق عمره يوم واحد. الجوهر هو أن مختبرًا أغلق الحلقة على بيانات تدريب مُولَّدة ذاتيًا ونشر الأوزان للتدقيق، وهذا هو الجزء الجدير بالمتابعة. الأمور التي من شأنها أن تحوّل هذا الإصدار من واعد إلى موثوق: أول تشغيل مستقل لنموذج 397B على SWE-bench Verified ومنصة Terminal-Bench مُصحَّحة؛ وشحن كود التقييم فعليًا؛ وظهور مسار مستضاف يتيح قياس ملف تكلفة 35B-A3B مقابل ادعاءاته. إذا صمدت الأرقام، فإن Ornith-1.5-35B-A3B هو قصة السعر/الأداء لهذا الربع في عالم الأوزان المفتوحة. وإن لم تصمد، فإن الجزء الصادق — طريقة التحسين الذاتي وأوزان MIT — يبقى في كلتا الحالتين.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
