بطاقة عنوان مُولَّدة عنوانها 'التحسين الذاتي التكراري، مشروحًا' مع عنوان فرعي 'الحلقة المغلقة حلقة مُقيَّمة، والتقييم هو السؤال بأكمله'، فوق صف من ثلاث بطاقات مستديرة مكتوب عليها 'تنبؤات مُسجَّلة قبل التشغيل'، و'حدود دنيا صفرية مقيسة، لا مفترضة' و'الإخفاقات تُشحن، بما في ذلك إخفاق البطل'؛ ويقول تذييل 'مثال عملي: RSI-Jev v6.0-VL، نُشر في 2026-10-06؛ سجل المشروع نفسه، قُرئ في 2026-10-08.'، مع أيقونات خطية مسطحة بسيطة وشعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Guides & Insights

التحسين الذاتي التكراري، مشروحًا عبر مشروع يفعله فعليًا

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

«التحسين الذاتي التكراري» من تلك العبارات التي تُستخدَم في الغالب للتعبير عن شعور. عند تعريفها دون غموض، فهي أضيق من ذلك وأكثر إثارة للاهتمام: نظامٌ يقترح تجربته التالية بنفسه، ويشغّلها، ويُبقي على النتيجة أو يستغني عنها وفق قاعدة محدّدة سلفًا، مع تغذية النتائج للجولة التالية. التكرار ليس سحرًا وليس بلا حدود — إنه حلقة ذات دالة تقييم، وتُحدَّد جودتها بالكامل بمدى أمانة تطبيق دالة التقييم تلك. RSI-Jev، المشروع المفتوح التابع لطرف ثالث الذي يبني نماذج قرارات System One على غرار Jev، هو حالة نادرة يمكنك فيها قراءة الحلقة بدلًا من الجدال حولها: كل فرضية، وكل ذراع فاشل، وكل إصدار يُنشر مع أرقامه، والمستودع مؤرَّخ يومًا بيوم. النموذج الذي تستخدمه هذه الصفحة كمثال عملي هو RSI-Jev v6.0-VL، وهو نموذج قرارات مُنمَّط بحجم 4B نُشر في 2026-10-06، أي خلال الأسبوع الأخير. إنه ليس Jev الخاص بـ TypeSafe وليس تابعًا لـ TypeSafe AI — وينص سطر ترخيص المشروع نفسه على ذلك بالضبط، وما نقدمه في OrcaRouter هو الآخر، typesafe/jev-1.13، على نقطة نهاية systemone الخاصة بنا.

توضيح واحد قبل أن تؤدي كلمة "التحسّن الذاتي" أي عمل، يتبعه تاريخ واحد. هذا ليس نموذجًا يعيد كتابة نفسه بلا حدود، ولا ينبغي قراءة أي شيء في هذه الصفحة بهذه الطريقة. الحلقة المعنية تعيد كتابة وصفة: فهي تقترح تغييرًا في التدريب، وتسجّل ما تتوقع أن يفعله ذلك التغيير، وتستهلك وقت GPU، ثم إما تُبقي التغيير أو تسجّل سبب خسارته. النموذج برج Qwen3.5-4B-Base مزوّد برؤوس قرار مدرَّبة — بنية ثابتة يدرّبها نص برمجي تدريبي ثابت، مع جريان البحث على البيانات والأهداف والمراحل. الحلقة تُجري تجاربها الخاصة وتُحيل أبطالها إلى التقاعد. والناس يقررون ما يستحق القياس. وأما التاريخ: فقد نُشر v6.0-VL في 2026-10-06، ونشر المشروع إصدارًا آخر منذ ذلك الحين — فالمسار يتحرك يوميًا تقريبًا، وأرقام هذه الصفحة هي المرتبطة بالإصدار المذكور هنا، مؤرخة حيث قُرئت. وهذا جدير بالقول في المقدمة على صفحة موضوعها حلقة لا تتوقف عن العمل.

ما يعنيه المصطلح، بصيغة مباشرة

إذا جرّدنا العبارة من التفاصيل، تبقى ثلاثة أجزاء، وكلها عادية. أولًا، فضاء بحث: مجموعة الأشياء التي يمكن تغييرها. ثانيًا، مقيّم: شيء يقول ما إذا كان التغيير قد ساعد. ثالثًا، سجل: ما جُرِّب، وما حدث، وما استُغني عنه. يكون النظام بصدد تحسين ذاتي تكراري عندما يكون ناتج الجولة N هو مدخل الجولة N+1 في هذه الأجزاء الثلاثة كلها، من دون أن يعيد الإنسان اشتقاق فضاء البحث أو إعادة تحديد العتبة في كل مرة.

ما تتخطاه معظم الكتابات حول الموضوع هو الجزء الثاني، وهناك يكمن السؤال بأكمله. الحلقة ذات المُقيِّم الضعيف تُحسِّن المُقيِّم. ستُنتج خطًا صاعدًا بصورة رتيبة ونظامًا تعلَّم شكل اختباره الخاص. لا يتطلب هذا الفشل سوء نية أو خطأً برمجيًا — فهو ما يحدث افتراضيًا عندما يختار الرقم نفسه ويُبلِغ في آنٍ واحد. لذا عندما تقرأ ادعاءً بأن نظامًا ما يحسّن نفسه، فالسؤال المفيد ليس أبدًا: "كم أصبح أفضل؟". بل: "من وضع المعيار، ومتى، وهل كان يمكن أن يتحرك بعد رؤية النتيجة؟"

النسخ الشائعة من هذا المفهوم — تلك التي تتصدر نتائج البحث عن المصطلح اليوم — هي في معظمها استشرافية: يصف مدخل ويكيبيديا نظاماً يعيد كتابة شفرته الخاصة نحو «انفجار ذكاء»، وتميل التغطية الأوسع إلى التركيز على ما إذا كان ذلك الجدول الزمني أقرب أم أبعد مما هو متوقع. تلك حجة مشروعة، ولا يمكن الإجابة عليها بالأدلة المتوفرة لأي شخص حالياً. ما يمكن الإجابة عليه هو السؤال الأصغر، وهو ما إذا كان يمكن الآن بناء حلقة مغلقة من النوع الموصوف أعلاه وإلزامها بقواعدها الخاصة. ولهذا، فإن مشروعاً واحداً له مخرجات منشورة علناً يتفوق على عقد من التخمين، وهذا ما تتناوله بقية هذه الصفحة.

مغلق، وليس تكرارياً فحسب: خمس آليات

الحلقة ليست مغلقة لأنها تتكرر. كثير من خطوط الأنابيب المؤتمتة يتكرر دون أن يُغلق أبدًا، لأن خط الأنابيب القادر على تعديل عتبته بعد رؤية النتيجة يفعل شيئًا مختلفًا نوعيًا عن ذاك الذي لا يستطيع. وقواعد RSI-Jev نفسها صريحة بشكل غير معتاد بشأن هذا الفرق، ويمكن قراءتها كتعريفات لا كبيان. خمس منها تؤدي معظم العمل.

تُسجَّل التوقعات قبل التشغيل. تُكتب الفرضية مع الرقم الذي تتوقع تحريكه وبأي مقدار، قبل إنفاق وقت GPU. الإصدار الذي يخفق في بلوغ معياره الخاص يُطلق كفشل بدلًا من إعادة قطعه بهدوء. هذه هي الآلية التي تمنع الحلقة من أن تصبح آلة لكتابة تفسيرات لاحقة، وهي تكلّف شيئًا حقيقيًا: يحتوي السجل على مدخلات لا يكون مضمونها الوحيد سوى أن شخصًا ما كان مخطئًا على السجل.

حدود الصفر تُقاس، ولا تُفترض. يشغّل الفريق أذرعًا يمكن إثبات أنها مطابقة للمجموعة الضابطة — ويُتحقق من ذلك عبر هوية الكائنات قبل أي وقت GPU — والتباين بين تلك الأذرع هو حد الضوضاء. أي فرق أصغر من ذلك الحد ليس نتيجة، مهما بدا شكله. يعكس معيار المشروع هذا: في مجموعة اختباراته الداخلية تكون العتبة +0.006، مع انحراف معياري لكل بذرة في اختبار قياسي واحد يبلغ 0.011–0.016، لذا فإن فروق الاختبار القياسي الواحد التي تقل عن ذلك ليست نتائج. معظم الضوضاء في هذا المجال مقيسة، وليست إحصائية.

تُستهلك المجموعة المحتجزة بمجرد قراءتها. كل إصدار يقرأ المجموعة المحتجزة مرة واحدة، لذا يظل بالإمكان مقارنة إصدارين على قدم المساواة — ولأن قراءتها تستهلكها، فإن كل إصدار يجمّد مقارنة الإصدار التالي. ويجدر الإبقاء على صياغة المشروع نفسه كما هي: المجموعة المحتجزة "محتجزة عن التدريب، لا مختومة عن البحث". وهي فحص للحفظ، لا ضمان للجدة. وفي رقم حزمة الاختبارات نفسه ثغرة نشرها المشروع: مهمة داخلية تداخلت مع عدة مئات من صفوف التدريب، لذا ابتداءً من v6.0-VL فصاعدًا تُبلَّغ حزمة الاختبارات بدونها — 0.770 — وأُعيد ذكر الرقم 0.764 الأسبق الخاص بـ v5.0-VL بوصفه 0.763 بدونها. إعادة الصياغة هذه هي المغزى. كان رقم يتضخم، ووُجد السبب، وصُحِّحت بطاقة الإصدار الأقدم بدلًا من تركها على حالها.

تُشحن الإخفاقات، بما في ذلك تلك التي قضت على أكبر داعم للمشروع نفسه. الأرقام الرئيسية للمستودع، كما قُرئت في 2026-10-08، منسجمة: ثمانية إصدارات في ثلاثة عشر يومًا، ومئات التجارب الموثقة مع تضمين الإخفاقات. تُعامَل النتيجة السلبية على أنها المنتج. دليل المساهمة صريح بشأن السبب — الجزء المكلف من البحث ليس تشغيل الفائز، بل تشغيل الخاسرين؛ لذا فإن نتيجة سلبية مقيسة جيدًا من الخارج تزيل فرعًا وقيمتها أعلى من نتيجة إيجابية صغيرة.

سلسلة الإصدارات هي المشروع. بطاقة واحدة لكل إصدار، جميعها، على الفرع الرئيسي بشكل دائم. تحمل كل بطاقة أرقام إصدارها الخاص، بحيث لا تطمس سرعة إصدارٍ ومعايرته سرعة إصدارٍ آخر ومعايرته. يذكر المشروع السبب مباشرةً: تلك السلسلة هي السبيل الوحيد لمعرفة ما إذا كانت حلقة التحسين الذاتي تتحسن. كل ما عدا ذلك — الوصفة، والسكربتات، والمكدّس المثبَّت — لا يحمل سوى الإصدار الحالي، لأن القاعدة المعاكسة ستجعل من المستحيل تحديد ما هو الحالي. تحمل نقطة تحقق منشورة شيفرتها الخاصة كي تظل الإصدارات القديمة قابلة للتشغيل دون فروع قديمة.

A screenshot of the subject project's own GitHub repository page, Shanghua-Gao / RSI-Jev, showing the repository description 'Typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents - checkpoints, the code that produced them, and every version that failed', the sidebar counters 80 stars, 5 forks and 1 watching, 198 commits and 8 releases, the newest release headed 'RSI-Jev v6.1-VL 4B', an MIT license line, the topic tags ai-agents, autonomous-research, decision-model, jev, recursive-self-improvement, system-one and typed-decisions, and the merge commit 'Merge pull request #33 from Shanghua-Gao/release-v6.1-vl' at the top of the commit list.

ثمن الانضباط وعائده

قصّتان من السجل هما الثقل الموازن الصادق لكلمة «التحسين الذاتي»، لأن كلتيهما حالتان جعلت فيهما قواعد الحلقة نفسها العمل أبطأ وأفضل في الوقت نفسه.

الأول هو الخلل الكامن وراء v1.0. استغرق العثور عليه سبع نتائج سلبية مسجّلة. كان كل واحد من السبعة إصلاحًا من جانب المُحسِّن قلّل عدم استقرار التدريب دون أن يزيله، لأن السبب كان خطأً في الدقة بعيدًا تمامًا عن المُحسِّن — وكان الإصلاح النهائي سطرًا واحدًا. لم يكن أيّ من السبعة جديرًا بالنشر بمفرده. مجتمعةً، هي ما جعل السبب قابلًا للاكتشاف من الأساس، وهذه هي الحجة كاملة على تسجيل النتائج السلبية والاحتفاظ بها: قيمتها مشتركة، لا فردية.

الثانية أقل إطراءً، ومع ذلك ينشرها المشروع، في حاشية. فشل فرع مبكر في ضابط حماية واحد بالضبط — إذ جاء MMLU-Pro أدنى من العتبة بمقدار 0.026 مقابل حدّ قدره 0.020 — وسُجّل كمرفوض. ثم وسّع مسؤول التشغيل الحد إلى 0.030، بحجة أن MMLU-Pro ضابط حماية ضد النسيان لا هدف، وتأكّد الفرع على أربع بذور جديدة وأصبح الإصدار التالي. وتُرك الرفض الأصلي في السجل، مع تعليق المشروع نفسه على أن عتبة حُرِّكت بعد رؤية النتيجة هي من النوع الذي ينبغي أن يستطيع القارئ أن يضبط المشروع متلبسًا به.

تلك الحاشية هي أكثر فقرة مفيدة في المستودع لأي شخص يحاول تقييم هذا النوع من الادعاءات في الواقع العملي. المعيار الذي تغيّر ليس دليلًا على سوء نية — فالتبرير المقدَّم قابل للدفاع، ثم كان على المعيار الموسّع أن يصمد أمام أربع بذور جديدة. لكن المعيار الذي تغيّر بصمت حلقة لم تعد مغلقة، والفرق بين الحالتين يتوقف كليًا على ما إذا كان ذلك قد دُوّن. القاعدة العامة التي استقرّ عليها المشروع بعد ذلك هي الجديرة بنقلها إلى أنظمة أخرى: الحادثة التي كادت تقع ولا تخفق إلا في شرط حماية واحد بالضبط تحصل على تشخيص وإصلاح موجّه بدلًا من استبعادها — وإذا فشل الإصلاح، فإنها تصبح طريقًا مسدودًا مع سجل.

كم مرة تكون الحلقة خاطئة: أربعة عشر إعدادًا، اثنان محتفظ بهما

إليك الرقم الذي يجب التمسك به. عبر الإصدار الذي يقرأ الصور، يحصي المشروع أربعة عشر إعدادًا للتعلم المعزز و63 ذراعًا مدرَّبة بالمكافأة. تم الاحتفاظ باثنين.

حُكِم على كل إعداد مقابل ضابط خاضع للإشراف دُرِّب على العناصر نفسها ولعدد الخطوات نفسه، وهذه هي المقارنة التي تجعل العدد ذا معنى — فذراع تعلّم معزّز يهزم خط أساس لم يكن مضطرًا يومًا إلى مجاراته لا يثبت شيئًا. الخسائر المفيدة، بكلمات المشروع نفسه:

• التعلم المعزز (RL) للصواب الثنائي — انهار الناتج الاحتمالي إلى 0 و1. إن مكافأة فعل الاختيار الصحيح بدلًا من صدق الاحتمالات المُبلَّغ عنها تدفع التوزيع نحو الأطراف، ونموذج قرار تكون ثقته مطلقة دائمًا عديم الفائدة للغرض الذي تُوجد من أجله نماذج القرار.

• التعلم المعزز القائم على Proper-score، إعادة بناء الهدف على طراز Laya — جيد عند 300 خطوة، انحرف عند 1,500. مستقرّ بينما كان لا يفعل الكثير، وغير مستقرّ بالضبط عندما بدأ يهم.

• RLCR — متعادل في الدقة، وأسوأ في المعايرة الخام. لم يكسب أي قدرة ودفع ثمنها في الخاصية الوحيدة التي وُجد النموذج لتقديمها.

• Bandit RLCD، حيث لا تُكشف سوى نتيجة الخيار المُختار — لا أفضل من التدريب الخاضع للإشراف على التغذية الراجعة نفسها. وقد أوقف المشروع اختباره المُسجَّل مسبقًا هنا: كان على الذراع أن يتفوق على التدريب الخاضع للإشراف في اثنتين على الأقل من أربع مقاييس للمعايرة، لكنه فاز بواحدة فقط.

الفائز، وسبب فوزه، هو النتيجة الأكثر قابلية للنقل في الصفحة. إنها مكافأة على مستوى القائمة — جودة الترتيب مقيسة على ترتيب العديد من المرشحين المُقيَّمين كلٌّ على حدة، بدلًا من معالجة كل واحد منهم بمعزل عن الآخر. ارتفع استدعاء إعادة الترتيب عند الموضع الأول من 0.192 للمُشرف الأبوي إلى 0.308، مع حالات فوز وخسارة في اختبار مقترن. تفسير المشروع ليس قصة ضبط: هدف تدريبي لكل عنصر يقيّم كل مرشح بمفرده، ولا يوجد وسم واحد يشفّر جودة ترتيب عبر المرشحين. وحيث قالت المكافأة شيئًا لا تستطيع الوسوم التعبير عنه، تغلّب التعلم المعزز على التدريب المُشرف على الصفوف نفسها. وحيث لم تفعل، جاراه التدريب المُشرف.

هذا يعمّم إلى قاعدة حول متى يمكن لهذا النوع من الحلقات أن يجد أي شيء على الإطلاق. مع وجود تصنيف ذهبي في اليد، فإن تحديث تدرج السياسة المتوقع يساوي تدرج خسارة خاضعة للإشراف — الصياغة الخاصة بالمشروع — لذا فإن "ذراع التعلم المعزز" الذي يتم تقييمه مقابل قرارات مصنفة هو في الحقيقة ذراع لتصميم الخسارة. وقد حرّكت التغييرات على مستوى الخسارة المجموعة الداخلية بنسبة 0.002 على الأكثر، بينما حرّكتها البيانات الجديدة بنسبة 0.13. عند قراءتهما معًا: لم تكن قوة الحلقة أبدًا في الهدف. بل كانت في ما تم قياسه وما تم إدخاله.

وهو الجواب الصادق على سؤال يحق للقارئ أن يطرحه. تُستشهد بإعدادات التعلّم المعزّز (RL) في مواضع أخرى كدليل على التحسّن الذاتي بشكل عام؛ أما هنا فهي دليل على حلقة واحدة في مهام القرار. ونتيجة القائمة (listwise) هي بذرة واحدة، والمشروع يقول ذلك: فقد أُجريت المقارنة المزدوجة بين التعلّم المعزّز والتعلّم المُشرَف على نموذج أصل مختلف عن النموذج الذي طبّقها عليه الإصدار، وذلك الإصدار «ليس لديه ضابط مُشرَف مطابق». إن نتيجةً مرفقةً بهذا التحذير تساوي أكثر من نتيجة بدونه، ولهذا السبب لا تعمّمها الصفحة التي تقرأها.

حيث يجلس الإنسان

المشروع صريح، والصراحة هي الجزء المثير للاهتمام: الحلقة تُجري تجاربها الخاصة وتُحيل أبطالها إلى التقاعد، لكنها لا تقرر ما يستحق القياس، ولا تلاحظ من تلقاء نفسها عندما يكون رقمٌ ما صحيحًا تقنيًا ومضلّلًا عمليًا. البشر يفعلون ذلك.

توجد قاعدتان من قواعد المشروع نفسه لأن أحدهم اعترض. وُسِّع حاجز MMLU-Pro بدلًا من ترك حالة كادت تفشل تُستبعد. وأصبح متطلب البذور يتناسب مع حجم الأثر بدلًا من إنفاق أربع بذور على كل فرق — لأن بذرة التأكيد، الرقم الوحيد الذي لم يُنتقَ الذراع بناءً عليه، هي الركيزة الحاملة، وإنفاق الموارد الحسابية على فروق يمكنك رؤيتها بالفعل لا يعود بشيء. بدأ أحد الإصدارات في السلسلة كرفض لإسقاط ذراع كان قد فشل في أحد الحواجز. ويعزو المشروع الفضل بالاسم إلى الأشخاص الذين أرسلوا تلك الملاحظات، في قسم الشكر والتقدير.

إذن، يصف «التحسّن الذاتي» هنا منتصف الحلقة، لا الحلقة كلها. الحلقة بحث يعمل دون أن يدير إنسان العجلة. لا يزال الإنسان في أعلى الحلقة يختار الهدف، وفي قاعها يقرأ النتيجة قراءةً نقدية — وهذا تحديدًا هو الترتيب الذي يمنع الحلقة من أن تصير آلة لتأكيد تفضيلاتها الخاصة. وأي سرد للتحسّن الذاتي العودي يُغفل ذلك المقعد فإنه يصف نظامًا مختلفًا عن هذا النظام، وربما نظامًا افتراضيًا.

ما لا تُظهره أرقام المشروع نفسها

لا يستحق الانضباط المذكور أعلاه أن يُوصف إلا إذا ذُكرت حدوده في الوقت نفسه، وسجل RSI-Jev ينص عليها بنفسه.

• إنه مشروع واحد، وحجم نموذج واحد في كل مرة، وبذرة واحدة. نقطة التحقق المنشورة تخص بذرة واحدة، حُدِّدت مسبقًا كأساسية بدلًا من اختيارها لتسجيل أفضل نتيجة. دليل التعلم المعزز هو بذرة واحدة.

• إنها مهام قرار، لا توليد: سؤال بنعم/لا، أو اختيار واحد من k، أو تقييم وفق معيار، على مستند أو محادثة أو صورة، يُجاب عنه في تمريرة أمامية واحدة باحتمال معايَر لكل خيار. لا شيء يُولَّد، لذا لا توجد رموز استدلال تُنفق. وما توضحه الحلقة هنا هو أنها قادرة على تحسين مُقيِّم من هذا الشكل.

• بعضه ليس قابلاً لإعادة الإنتاج من المستودع وحده. فمجموعات بيانات التدريب ومجموعات تطوير السياسات ليست عامة، ويقول المشروع ذلك بوضوح في بطاقة الإصدار: "لا يمكن إعادة تشغيل المراحل من هذا المستودع وحده." يحتاج أحد بُناة المجموعات إلى نحو 96 غيغابايت من الذاكرة، ولم يُعَد تشغيله من البداية إلى النهاية.

• ليس كل شيء قابلًا للتحقق على الإطلاق. لم تكن المجموعة الداخلية مستبعدة بالكامل قط. من بين المعايير الخمسة عشر، تسهم عشرة منها في بيانات التدريب بشكل أو بآخر، لذا لا يمثل أي من تلك الأرقام نتيجةً بلا أمثلة — فالمجموعة المستبعدة هي المقارنة المستبعدة، وهي الوحيدة.

وللأجزاء الخارجية نسيجها الندبي الخاص. فقد وجد تدقيق بعد أحد الإصدارات نحو ألف عنصر من صفوف اختبار مجموعة المعيار العامة في مجموعات بيانات التدريب — أي نحو 0.3% من صفوف المجموعة، وكان أكبر إسهام منفرد بضع مئات من الصفوف من مصدر واحد. وعند إعادة التقييم بدونها، لا يتغير المؤشر إلا بمقدار 0.04 على الأكثر. وقد نُشر ذلك التصحيح في بطاقة الإصدار التالي بدلًا من تطبيقه بصمت، وفقًا للقاعدة التي يعلنها المشروع: «لا تلوث، يُتحقق منه بدلًا من ادعائه». إنها قاعدة تكلفهم رقمًا، وهو النوع الوحيد من القواعد الذي يستحق التمسك به.

أين يمكنك تشغيله فعليًا — وأين لا يمكنك

لا شيء هنا يُقدَّم من OrcaRouter. كتالوجنا لا يحمل أي معرّف RSI-Jev ولا بطاقة نموذج له، ولن يكون هناك واحد حتى يقدّمه أحد. يُثبَّت RSI-Jev من مستودعه الخاص ويشغّل خادمه الخاص، الذي يتحدث Jev API: توجّه عميل Jev موجودًا نحوه وتغيّر عنوان URL الأساسي. يعمل على Linux وWindows وmacOS، وعلى CUDA GPU أو Apple Silicon أو وحدة معالجة مركزية عادية.

النموذج الوحيد الذي نستضيفه فعلاً هو الطرف الآخر من ذلك الاتفاق. إن Jev 1.13 من TypeSafe، الذي نقدّمه باسم typesafe/jev-1.13، هو نموذج القرار التجاري الذي يعيد RSI-Jev إنتاج أشكال طلباته وإجاباته، ويُ reached عبر نقطة نهاية systemone المخصصة لدينا بدلاً من شكل chat-completions. هذه هي العلاقة كاملة، وهي علاقة بنيوية لا ادعاء بجودة: أحدهما نموذج تجاري مستضاف على نقطة نهاية مورّد، والآخر نقطة تحقق تُنزّلها وتشغّلها بنفسك. لم يُجرِ أحد مقارنة مباشرة مستقلة بينهما، ولن تعلن هذه الصفحة فائزاً بناءً على أداتَي اختبار مختلفتين.

A generated single-column scoreboard headed 'RSI-Jev - the loop's own ledger', with six rows reading 'Predictions: registered before the run', 'Null floors: measured from identical arms', 'Held-out set: read once, then spent', 'Failures: published, including the champion's', 'Release chain: one card per release, on main forever' and 'RL setups kept: 2 of 14, each judged against a matched control'; a footer reads 'All figures from the project's own record, read 2026-10-08.'

إذا كان ما تريده هو وضع نموذج قرار كهذا خلف تطبيق، فإن مسألة التوجيه منفصلة عن مسألة النموذج، وهي الجزء الذي يحدد ما إذا كانت التجربة تستحق التشغيل من الأساس. OrcaRouter هو واجهة API واحدة لأكثر من 200 نموذج بهامش ربح 0% — يُمرَّر سعر القائمة الخاص بالمزوّد كما هو، لذا يصبح تغيير سعر المورّد هو سعرك في اليوم نفسه — إضافة إلى التحويل التلقائي عند الفشل ولغة DSL للتوجيه لتكوين عدة نماذج في استدعاء واحد. وبالنسبة لنموذج loop لا يمكنك بعد استدعاؤه عبر API عام، فإن ذلك يهم بطريقة محددة: فهو يعني أن المرشحين البدلاء الذين ستقارن أداءه بهم موجودون بالفعل خلف مفتاح واحد، وأن المقارنة تصبح تغييرًا في الإعدادات بدلاً من تكامل ثانٍ.

A screenshot of OrcaRouter's own model page for typesafe/jev-1.13 showing the left navigation, a PERFORMANCE panel with prefill and decode lines, the heading 'Jev 1.13' with the provider line 'typesafe', the price fields $0.11 prefill and $0.36 decode per million tokens, a benchmark box with MED 0.3, Response Trust 0.784, Structured Output 0.964, Refusal Correctness 1.0 and Consistency 0.59, an accuracy-versus-cost scatter with a 'Jev 1.13' marker, an 'Individual Runs' table, API and Agent curl snippets pointing at the systemone endpoint, the OrcaRouter logo and a sign-up button.

الجزء الذي يستحق الاحتفاظ به

سبب الكتابة عن التحسين الذاتي التكراري عبر مشروع كهذا، بدلًا من الكتابة عبر الجدال حول ما إذا كان يقود إلى مكان ما دراماتيكي، هو أن قواعد الحلقة هي الجزء القابل للنقل، أما التخمين فليس كذلك. تنبؤات مسجلة، وحدود صفرية مقيسة، ومجموعات محجوزة استُنفدت، وإخفاقات منشورة، وسلسلة إصدار غير قابلة للتغيير: لا شيء من ذلك خاصية للذكاء الفائق. إنها خصائص مختبر قرر أن يكون قابلًا للتحقق، وهي متاحة لأي فريق يشغّل بحثًا آليًا اليوم، وعلى أي نطاق، وعلى أي نموذج.

بهذه القراءة، فإن الادّعاء المثير للاهتمام في سجل RSI-Jev ليس النتيجة. بل إن دفتر حسابات الحلقة نفسه يقول إنها كانت مخطئة أكثر بكثير مما كانت مصيبة — وصفتان محفوظتان من أصل أربعة عشر إعدادًا، وسبع نتائج سلبية للعثور على خطأ من سطر واحد، وشريط تحرّك وتم تدوينه — وأن المشروع نشر دفتر الحسابات. ارتفاع من 38.38 إلى 46.24 على مؤشر عام في إصدار واحد هو مجرد غرابة بدون الإخفاقات بجانبه. الإخفاقات هي التي تجعل الرقم يعني شيئًا.

وهذا هو الموقف الصادق من المصطلح نفسه. السؤال ليس ما إذا كان نظام ما قادرًا على تحسين نفسه، بل ما إذا كان التحسين يقاس بشيء كان بإمكانه أن يقول لا. وحيث يكون ذلك الفصل حقيقيًا ومكتوبًا، فإن الحلقة تستحق القراءة. وحيث لا يكون كذلك، فإن الخط الصاعد وصف لمُسجِّل نقاط، لا وصف لنظام يتحسّن — ولا يصلح ذلك أي قدر من العودية.