
ما هو RSI-Jev؟ حلقة ذاتية التحسين تبني نماذج قرار على نمط Jev
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 145 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 296 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
RSI-Jev مشروع بحثي مفتوح من طرف ثالث يبني نماذج قرارات System One على غرار Jev، والنموذج الذي تتناوله هذه الصفحة هو إصداره 4B، RSI-Jev v6.0-VL، بتاريخ 2026-10-06. وهو من تأليف شانغهوا غاو (@gasvn)، مع إدراج سفيان (@SufianTA) في شكر وتقدير المستودع، وهو ليس Jev الخاص بـ TypeSafe وليس تابعًا لـ TypeSafe AI — سطر الترخيص الخاص بالمشروع يقول ذلك بالضبط. الفكرة الكامنة وراءه ضيقة بما يكفي لقولها في جملة واحدة: اطرح سؤالًا محدد النوع عن مستند أو محادثة أو صورة — نعم/لا، اختيار واحد من k، تقييم وفق معيار — فتعيد تمريرة أمامية واحدة احتمالًا معايرًا لكل خيار. لا يُولَّد أي شيء، لذا لا توجد رموز استدلال لإنفاقها، ولا يُنفق أي منها. v6.0-VL ليس أول إصدار للمشروع؛ بل هو السابع له خلال اثني عشر يومًا، وهذا هو أهم شيء على الإطلاق ينبغي فهمه بشأنه، لأن المعلومات المفيدة هنا تكمن في شكل الخط وليس في أي نقطة تحقق بعينها.
يجب قول شيء واحد قبل أي من الأرقام، لأنه يؤرّخها جميعًا. كان v6.0-VL على رأس القائمة ليوم واحد بالضبط. في 2026-10-07 عند 07:56 UTC — هذا الصباح — نشر المشروع RSI-Jev v6.1-VL، وهو متوسط v6.0-VL، بوزن 0.5 لكل منهما، مع ضبط دقيق ثانٍ لنفس Qwen3.5-4B-Base مُدرَّب على بيانات أخرى، ويحصل على 50.98 في مجموعة Decision Index 0.3 الخاصة بالمشروع مقابل 46.23 لـ v6.0-VL في المجموعة نفسها. لم يُدرَّب أي شيء بعد المتوسط. معايرته أسوأ من معايرة v6.0-VL، وبطاقته الخاصة تقول ذلك. ذلك الإصدار حقيقي وسارٍ؛ هذه الصفحة ليست عنه. كل رقم أدناه مأخوذ من سجل إصدار v6.0-VL، المؤرخ 2026-10-06، وحيثما تغيّر عدّ ما منذ ذلك الحين — حصيلة الإصدارات، حصيلة التجارب — تعطي هذه الصفحة كلاً من الرقم كما كان عليه بالنسبة إلى v6.0-VL والرقم كما يُقرأ اليوم.
ما ليس عليه RSI-Jev يستحق أيضًا ذكره مبكرًا، لأن اثنين من الافتراضات الثلاثة الواضحة خاطئان. فهو ليس منتجًا مستضافًا يمكنك الاتصال به اليوم عبر واجهة برمجة تطبيقات عامة، ولا يقدّمه OrcaRouter — فكتالوجنا لا يحمل معرّف rsi-jev ولا معرّف shgao ولا بطاقة نموذج له. الشيء الوحيد الذي لدينا هو النموذج الذي ينسخ هذا المشروع عقد HTTP الخاص به: Jev التجاري من TypeSafe، والذي نقدّمه باسم typesafe/jev-1.13 على نقطة النهاية systemone. أحد هذين تتصل به، والآخر تقوم بتنزيله وتقديمه بنفسك. كل ما يلي مأخوذ من مستودع المشروع نفسه، وبطاقات الإصدار ووثائق التقديم، مقروءًا بتاريخ 2026-10-07، وحيثما كان الرقم خاصًا بالمشروع وليس قياسًا خارجيًا، توضح هذه الصفحة لمن يعود.

ما الذي يفعله الشيء فعليًا
يصف المشروع نفسه في سطر واحد بأنه «نظام بحثي ذاتي التحسين بشكل تكراري يبني نماذج System One على نمط Jev»، والمخرجات التي ينتجها هي مُقرِّرات لا مُولِّدات. أنت تُسلِّمه حالة — مستندًا، أو نص محادثة، أو معاملة، وفي إصدارات الرؤية ما يصل إلى أربع صور — وسؤالًا واحدًا أو أكثر من الأسئلة محددة النوع بمعايير مسمّاة. ويُرجع، لكل سؤال، احتمالًا لكل خيار. تغطي ثلاثة أنواع من الأسئلة هذا النطاق، وهي الأنواع التي تُعرّفها واجهة برمجة التطبيقات الخاصة بـ TypeSafe:
• الجديد — حكم صواب/خطأ، يُعاد كاحتمال واحد، بلا توزيع وبلا قيمة ثقة، مطابقًا لشكل إجابة المرجع تمامًا.
• اختيار — اختر واحدًا من مجموعة من الخيارات المُوسَّمة، يُعاد مع التوزيع الاحتمالي الكامل وإحصائية ثقة.
• الدرجة — قيّم وفق معيار ترتيبي، ويُعاد كمؤشر مرجّح بالاحتمال قائم على الصفر ضمن المستويات، إلى جانب المفتاح والتوزيع.
لأنه لا توجد خطوة توليد، فلا يوجد استدعاء ثانٍ للنموذج ولا أخذ عينات. إن اتخاذ قرار بشأن مستند سبق أن قرأه النموذج عملية رخيصة بحكم التصميم، والعبارة التي يوردها المشروع نفسه عن هذه الكلفة — «حوالي 10 ms» — تنتمي إلى حقبته 2B، لا إلى الإصدار الحالي؛ أما الأرقام المقيسة الخاصة بـ v6.0-VL فترد أدناه.
هناك حقيقتان تتعلقان بالملكية تهمان أكثر من أي شيء آخر في هذه الصفحة. RSI-Jev ليس من عمل TypeSafe ولم تؤيده TypeSafe. سطر الترخيص، منقولًا بالكامل: "Code: MIT. Weights: Apache-2.0, following the base model; some image training sources are non-commercial, listed on each model card. Not affiliated with TypeSafe AI." والعلاقة تسير في اتجاه واحد: ينسخ المشروع صيغة Jev السلكية عمدًا، ويقول ذلك، لأن الخادم المتوافق هو الهدف. "Jev-style" هي عبارة المشروع نفسه للنوع من النماذج الذي يبنيه. Jev الخاص بـ TypeSafe هو نموذج مختلف، مغلق، تجاري، والاثنان ليسا الشيء نفسه تحت اسم أقصر.
داخل النموذج الحالي: برج Qwen بحجم 4B بثلاثة مخارج
RSI-Jev v6.0-VL هو برج Qwen3.5-4B-Base مع ضبط دقيق للبرج ورأس قرار مُدرَّب فوقه. هذه هي البنية كاملة — لا يوجد مزيج من الخبراء، ولا موجّه، ولا نموذج ثانٍ. إنه يشغّل النموذج الأساسي بالكامل، ولهذا يبلغ عدد معاملاته 4.69B وليس أقل من ذلك: 3.57B تقع في طبقات فك التشفير الـ32، و0.64B في تضمينات الرموز، و0.33B في برج الرؤية، و0.05B في رأس القرار الرئيسي و0.10B في رأسي الخروج المبكر. نقطة التحقق الصادرة مكتفية ذاتيًا وتبلغ 9.7 GB بصيغة bf16.
تُثبَّت ثلاثة رؤوس قرار عند الطبقات 16 و20 و32 من النموذج الأساسي، وهي الآلية الكامنة وراء كل ما يُعرف به الإصدار الحالي. بُني مخرج رابع عند الطبقة 12، وقيس، ثم استُبعد — «خسر مخرج الطبقة 12 أمام التتابع القادم من 16 في كل مقارنة، وليس ضمن الحزمة» — لذا تُشحن ثلاثة ولا تُشحن أربعة. تقرأ المخارج نسخة منفصلة من طبقتها، وهو تفصيل اكتشفه المشروع بالطريقة الصعبة: إن إعادة ضبط الرؤوس على جذع كانت مخارجه قد رُبطت أثناء التدريب لم تستعد دقة الطبقات العميقة، لذا فإن فصلها هو ما استعاد العمق.
ثمة رقم واحد هنا يمثل أسهل طريقة لسوء قراءة المشروع. كان كل شيء حتى v3.0 وما يشملها نموذجًا بحجم 2B مبنيًا على Qwen3.5-2B-Base، وتلك هي سلالة النسب، لا النموذج الحالي. كان v4.0-VL بحجم 2B، وقلّص v5.0-VL نموذجًا إلى 3B، وv6.0-VL بحجم 4B. أي صفحة تسمّي نموذج RSI-Jev الحالي 2B متأخرة بثلاثة إصدارات.
الحلقة هي المشروع الحقيقي
النماذج هي المُخرَج؛ أما الشيء الذي يُبنى فهو العملية. يذكر المشروع أن «الحلقة التي تدير البحث هي النسخة التالية من AutoScientists»، وهو نظام فريق الوكلاء ذاتي التنظيم الذي نشرته مختبرات Zitnik في هارفارد، وهو يعمل بالطريقة التي توحي بها تلك الجملة. يقترح وكلاء الذكاء الاصطناعي فرضيات، ويسجّلون تنبؤاتهم قبل إنفاق وقت GPU، ويجرون التجارب، ويُحيلون نماذجهم الرائدة إلى التقاعد عندما تقتضي الأدلة ذلك. هناك رقمان يجعلان ذلك ملموسًا. عند قراءته في 2026-10-07، كان العنوان الرئيسي للمستودع: ثمانية إصدارات في ثلاثة عشر يومًا، من v1.0 إلى v6.1-VL؛ وبالنسبة لإصدار v6.0-VL نفسه في 2026-10-06، كان يقرأ سبعة إصدارات في اثني عشر يومًا، كل واحد منها دُرِّب وقُيِّم ووُثِّق بواسطة الحلقة. وعدد التجارب، الذي كان 471 عند إطلاق إصدار هذه الصفحة، يبلغ 496 اليوم — وقد وُثّقت كل واحدة منها، بما في ذلك الإخفاقات. كلا الرقمين من المشروع نفسه، وكلاهما يتغيّر.
الانضباط هو ما يجعل تلك الأرقام ذات معنى، والمشروع يدرجه بوضوح. تُقاس الحدود الدنيا الصفرية بدلًا من افتراضها — أذرع مطابقة بشكل قابل للإثبات لمجموعة التحكم، يُتحقق منها عبر هوية الكائن قبل أي وقت على وحدة معالجة الرسوميات، بحيث أن الفارق بينها يكون حدّ الضوضاء، وأي فرق أصغر من ذلك الفارق ليس نتيجة. تُسجَّل التنبؤات قبل التشغيل، لذا فإن نسخة تفشل في بلوغ معيارها الخاص تُصدَر كفشل بدلًا من إعادة قصّها بهدوء. تُحقَّق المخرجات: تُحمَّل نقطة تحقق من القرص من جديد وتُعاد تقييمها، ولا تُنشر إلا إذا أعادت إنتاج تنبؤات تشغيلها التدريبي لكل سؤال، وهو ما تفعله كلتا نقطتي التحقق في الإصدار 1.0 بمعدل 1.0000. التلوث "يُفحص بدلًا من ادعائه". وتُصدَر حالات الفشل، بما في ذلك تلك التي قضت على بطل المشروع نفسه.
ما هي المساهمة، بكلمات المشروع نفسه من دليل المساهمة الخاص به: «المساهمة هنا عادةً قياس، وليست رقعة». يُحتفظ بالسجل المنشور كسلسلة بدلًا من كونه لقطة — «يحتفظ versions/ ببطاقة واحدة لكل إصدار، كلها، على main إلى الأبد… تلك السلسلة هي المشروع» — ولهذا يمكن التحقق من أرقام إصدار قديم مقابل ما يقوله المشروع عنها لاحقًا، ولهذا يكون التصحيح الواحد المطروح أدناه ظاهرًا بدلًا من أن يكون صامتًا.
ما الذي غيّره v6.0-VL: إنه يستهلك العمق بدلًا من الرموز
آلية الإصدار الحالي هي إعداد يُسمى الجهد، وهي تتحكم في شيء غير معتاد: عدد طبقات النموذج التي يُسمح للطلب باستخدامها. لأن الرؤوس تقع على ثلاثة أعماق، يمكن الإجابة على سؤال سهل عند الطبقة 16، ويمكن للسؤال الصعب أن يمر عبر الطبقات الـ32 كلها. منخفض يتوقف عند الطبقة 16، متوسط عند 20، عالي عند 32، وتلقائي يجيب عند أول مخرج تتجاوز احتماليته المعايرة عتبة ذلك المخرج. زمن الاستجابة الوسيط لكل طلب على عينة Decision Index، مقاسًا على H200 واحدة في bf16: 23 مللي ثانية مع منخفض، 27 مللي ثانية مع متوسط، 40 مللي ثانية مع عالي، و40 مللي ثانية للافتراضي غير المضبوط. هذه قياسات المشروع نفسه على عتاده الخاص، ولا ينبغي خلطها بأرقام GB10 الواردة في وثائق الخدمة، التي تخص جهازًا مختلفًا.
السلوك المقيس لـauto هو الجزء المثير للاهتمام: على مجموعة المعايير الخمسة عشر للمشروع، تتوقف 20% من الأسئلة عند الطبقة 16، و46% عند الطبقة 20، و34% تمتد إلى 32، مما يعطي متوسط 23.3 من 32 طبقة. عتبة ثابتة واحدة تعطي متوسط 20.9، والإفراط في التوقف هو ما تحصل عليه من عتبة واحدة.auto ليس تنازلاً عن الجودة، ويجدر ذكر ذلك لأن هذا عادةً ما تكون عليه الإعدادات التكيفية: فهو يسجل أفضل صف في المجموعة بين أي إعداد (0.771 مقابل 0.770 للافتراضي)، وأفضل صف في MMLU-Pro (0.444 مقابل 0.440)، وأفضل معايرة نهائية (ECE 0.024 مقابل 0.036).high يفوز فيه هو المجموعة المحجوزة، 0.702 مقابل auto البالغ 0.696. بعض المهام تصبح أسوأ بشكل قابل للقياس مع العمق — BANKING77 بمقدار 0.035، ومطابقة تعليقات New Yorker بمقدار 0.060 — ولهذا فإن مستوى الجهد خيار يتخذه المستدعي بدلاً من قاعدة يفرضها الخادم.
النتيجة التي جعلت من هذا إصدارًا لا مجرد تجربة موجودة على Decision Index 0.2.1 العام للمشروع، حيث ارتفعت الدرجة من 38.38 في v5.0-VL إلى 46.24 في v6.0-VL خلال إصدار واحد. على اللوحة العامة المؤرخة 2026-09-28، هذه أعلى درجة بين نماذج 4B وكل ما هو أصغر منها، والمرتبة 14 من 71 إجمالًا؛ والمدخل التالي بهذا الحجم هو JPT-4B بدرجة 43.04. الإصدارات السابقة على هذا الخط تُعد سلالة وليست النموذج الحالي: v5.0-VL (2026-10-02) قلّص النموذج إلى أول 20 من أصل 32 طبقة وجعله يقول "غير معروف" عندما لا يكون للسؤال جواب؛ وكان v4.0-VL (2026-10-01) أول إصدار يقرأ الصور؛ أما v3.0 (2026-09-28) فهو الإصدار الذي ساعد فيه التعلم المعزز (RL) لأول مرة، عبر مكافأة ترتيب على مستوى القائمة — NDCG@5 على 16 مرشحًا — رفعت إعادة الترتيب R@1 من 0.192 إلى 0.308 مقابل الأصل الخاضع للإشراف بتكلفة 0.0028 على مجموعة الاختبارات. هنا تبدأ قصة التعلم المعزز للمشروع، وهي الآن متأخرة بثلاثة إصدارات.

الأرقام، مع التحفظات التي ترافقها
الرقم الرئيسي لـ The Decision Index 0.2.1 الخاص بـ v6.0-VL هو 46.24، في تشغيل كامل تمت فيه الإجابة على جميع الطلبات البالغة 150,759 في المجموعة: المعرفة 28.8، اللغة 46.2، الاسترجاع 55.5، الأدوات 65.8، الفنون 37.1. تسجل مجموعة المعايير الخمسة عشر 0.770، والمجموعة المحتجزة 0.698، وMMLU-Pro 0.440، وECE النهائي 0.024 مع تلقائي. يجب أن تُذكر ملاحظتان تحذيريتان في السياق نفسه مع تلك الأرقام، لأن الأرقام بدونها مضللة.
الأول هو استبعاد في المجموعة. إن مهمة المجموعة الداخلية open_jev_ood تقاطعت مع 579 صفًا تدريبيًا، لذا تضخم رقمها بمقدار غير معروف؛ واعتبارًا من v6.0-VL فصاعدًا، يقدم المشروع المجموعة بدونها، عند 0.770. وكان رقم v5.0-VL البالغ 0.764 معها، وتعيد بطاقة v6.0-VL صياغة ذلك الإصدار على أنه 0.763 بدونها. لا يمكن المقارنة بين الرقمين، وإذا قارنتهما فعليًا فيجب أن تستخدم الرقم المعاد صياغته 0.763 وأن تقول إن هذا ما تفعله. المجموعة المحجوزة وMMLU-Pro وBBH ليس بينها أي تداخل وهي غير متأثرة. وجد تدقيق ذو صلة نحو 1,000 عنصر من صفوف اختبار طقم Decision Index في المدونات التدريبية — ANLI 274، وRouterBench-GSM8K 90، وARC 5، ونص استعلام BRIGHT/ToolRet بدون تسميات، أي نحو 0.3% من صفوف الطقم — وإعادة التقييم بدونها تغيّر المؤشر بمقدار 0.04 كحد أقصى في عينة المشروع. هذا تصحيح لسجل v5.0-VL، منشور في بطاقة v6.0-VL، وهو قاعدة التلوث الخاصة بالمشروع التي تكلفه رقمًا.
الثاني هو تحديد الجهة التي يخصّها هذا المعيار. إن Decision Index هو لوحة RSI-Jev العامة الخاصة به، وليس حكماً من طرف ثالث، و46.24 هي درجة على تلك اللوحة. وهي غير قابلة للمقارنة بأي شيء نشرته TypeSafe، لأن الرقمين لا يأتيان من نفس إطار الاختبار، ولم يُجرِ أحد مقارنة مباشرة مستقلة بين RSI-Jev وJev 1.13. وما يمكن قوله هو بنيوي وليس رقمياً: أحدهما نموذج تجاري مستضاف على نقطة نهاية تابعة لمورّد، والآخر نقطة تحقق تقوم بتنزيلها وتشغيلها بنفسك.
هناك قطعتا سياق إضافيتان تنتميان إلى المجموعة. ويصرّح المشروع صراحةً بأن "عشرة من المعايير الخمسة عشر تسهم ببيانات تدريب بشكل ما، لذا لا يُعد أي من هذه الأرقام تقييمًا بلا أمثلة"؛ والمجموعة المحجوزة هي المقارنة المحجوزة، وحتى هي "محجوزة عن التدريب، وليست معزولة عن البحث". وقد شغّلت v6.0-VL 97 ذراعًا على خطها الخاص — أو 93 إذا استُبعدت عمليات تدقيق البيانات الأربع — وهو حجم البحث الذي أنتج قفزة مقدارها 7.86 نقطة في ذلك المؤشر.
إنه يستخدم تنسيق الإرسال الخاص بـ Jev، مع أربعة اختلافات ينبغي للمستدعي معرفتها.
سطح التوافق هو سبب وجود هذا المشروع على الشكل الذي هو عليه. نفس شكل الطلب ({state, model, questions})، وأنواع الأسئلة الثلاثة نفسها بأشكال المعايير نفسها، وأشكال الإجابات نفسها، ونفس عدد الأسئلة من 1 إلى 64 في كل طلب، ونفس مغلفات الأخطاء، ونفس إحصاءة الثقة — القمة، (K · p_max − 1) / (K − 1)، محصورة في 0..1. وادعاء المشروع نفسه بشأن ذلك السطح هو أن "أي شيء مكتوب لـ Jev يعمل مع هذا دون تغييرات"، ويوثّق الخادم ما هو منسوخ وما ليس منسوخًا، وهو أنفع من الادعاء.
• الموجّه والقراءة خاصّان به. RSI-Jev نموذج أساسي مزوَّد برأس قراءة مدرَّب، ويُقدَّم مع المُشفِّر الذي دُرِّب معه، لأن استخدام موجّه المرجع "سيُخرج النموذج عن توزيع تدريبه". عقد الاتصال هو سطح التوافق؛ أما الموجّه فليس كذلك.
• مفاتيح الخيارات مرئية للنموذج. يخفيها المرجع، لذا فإن إعادة تسمية مفتاح لا يمكنها بشكل مُثبت أن تغيّر إجابة هناك. هنا يمكنها ذلك، ويُبلّغ الخادم عن هذا بصدق باسم option_keys_visible_to_model: true.
• يجب أن تكون المعايير سلاسل نصية أو null. المعيار المهيكل — أي كائن — يُرفض برمز 422، لأنه لم يُدرَّب أي إصدار على واحد. هذا هو الموضع الوحيد الذي لا يعمل فيه هنا طلب يقبله المرجع.
• لا يُقطع أي شيء.تستوعب الخدمة حتى 32,768 رمزًا نصيًا بالإضافة إلى ميزانية الصور، ويُرفض الطلب الأطول برمز 422 يوضح ذلك بدلًا من قطعه بصمت. الرقم 2,048 رمزًا الذي يظهر في البطاقات الأقدم هو الطول الذي كانت النماذج مدرَّبة عليه، وليس سقفًا للخدمة، ووصف القطع الصامت عند 2,048 بأنه السلوك الحالي خطأ.
تختلف أعداد الخيارات بفارق كبير لصالح الخدمة: حتى 5,120 خيارًا لكل سؤال (RSIJEV_MAX_ANSWERS)، مقابل 160 في التدريب و64 تسمح بها المرجعية. لا تذكر 160 كسقف للخدمة. هناك شيء جديد في ردود v6.0-VL وليس موروثًا: كل إجابة تبلغ عن الطبقة التي أجابت، في usage.depth، إلى جانب الثقة المعايرة، بحيث يمكن تدقيق القرار التكيفي بعد وقوعه. الصور امتداد لا تملكه المرجعية — من واحدة إلى أربع لكل طلب، كعناوين URL لبيانات base64، مع إشارة الحالة إلى كل منها بعلامة حرفية.
حيث يمكن للقارئ تشغيله فعليًا، وحيث لا يمكنه ذلك
RSI-Jev متاح للتنزيل. يشحن المشروع خادمه الخاص، الذي يتحدث واجهة برمجة تطبيقات متوافقة مع Jev، والمسار الموثق هو pip install من المستودع متبوعًا بأمر serve الخاص به مع الاسم المستعار لنقطة التفتيش وإعداد الجهد. توجد الأوزان على Hugging Face تحت منظمة shgao، وصدرت تحت Apache-2.0 تبعًا للنموذج الأساسي، مع سؤال مفتوح واحد يطرحه المشروع بنفسه: خمسة من مصادر تدريب الصور غير تجارية أو مخصصة للبحث فقط، و"مسألة ما إذا كانت الأوزان المدربة على بيانات غير تجارية ترث تلك الشروط لم تُحسم بعد". الشيفرة تحت MIT.
العتاد ليس القيد. يُطوَّر المشروع على HP ZGX Nano، وهو جهاز NVIDIA GB10 ينسب المشروع الفضل فيه إلى HP وNVIDIA، ويعمل الخادم على أي وحدة معالجة رسومات CUDA، أو على Apple Silicon، أو على وحدة معالجة مركزية عادية — وتقدّر الوثائق أن الأخيرة تستغرق 733 ms لسؤال واحد على وحدة المعالجة المركزية Arm الخاصة بـGB10، فهي قابلة للاستخدام لا سريعة.
ما لا يفعله هو الظهور في كتالوج نماذج عام، وهنا يجب أن نكون دقيقين بشأن موقفنا. RSI-Jev ليس على OrcaRouter ولا توجد بطاقة نموذج يمكن توجيهه إليها. ما نقدّمه هو Jev التجاري من TypeSafe، typesafe/jev-1.13، على نقطة النهاية المخصّصة systemone، ويُوصَل إليها عبر POST إلى /v1/systemone بدلاً من شكل chat-completions الخاص بـ OpenAI — أي نفس شكلي الطلب والاستجابة اللذين ينفّذهما هذا المشروع، من النموذج الذي ينسخ عقده. هذه هي العلاقة بأكملها: كلاهما يتحدث البروتوكول نفسه، ونحن نقدّم أحدهما، وأنت تشغّل الآخر بنفسك. إذا كان لديك بالفعل مفتاح معنا، فإن شكل استدعاء Jev 1.13 هو مسار من الدرجة الأولى على واجهة API واحدة لأكثر من 200 نموذج بهامش 0% (سعر قائمة المزوّد يُمرَّر كما هو، لذا تخفيضات أسعار البائعين سارية هنا في اليوم نفسه) — وهذا يهم المقارنة بطريقة محددة. صفحة كهذه رخيصة التنفيذ إذا أمكنك تجربة العقد التجاري أولاً ثم تقرّر عندئذٍ فقط ما إذا كان تشغيل نقطة تحقق مفتوحة بحجم 4B بنفسك يستحق الجهد التشغيلي.

كيف تقرأ RSI-Jev في 2026-10-07
نقاط الضعف التي ينشرها المشروع محددة بقدر ما هي نتائجه، والتواريخ مهمة. وجد الاختبار الخارجي للإصدار v2.1 أن النموذج يميل إلى الخيار الأكثر خطورة أو تكلفة في الاختيارات المرتبة ودرجات التقييم المعياري، ونادرًا ما يختار "unknown" عندما لا تستطيع الوثيقة الإجابة، ويجيب عن سؤال ونفيه بشكل غير متسق. استهدفت الإصدارات اللاحقة البيانات لحالة "unknown" — فقد بلغ KoBBQ unknown-when-ambiguous 0.891 في v4.0-VL، و0.932 في v5.0-VL، و0.918 / 0.939 في v6.0-VL — وبطاقة v6.0-VL صريحة في أن المكاسب جاءت من البيانات لا من العمق، وأن الـ10% من الأسئلة التي كانت ستذهب إلى الطبقة 32 وتتوقف عند 16 أو 20 هي حيث لا تزال سياسة العمق تخمّن. لا يزال أمام إعادة الترتيب شوط آخر: ترتيب الاسترجاع الخاص بـ hippo-memory يسجل 0.484 R@1 ويظل متقدمًا على 0.308 الذي بلغه النموذج في v3.0، وهو رقم لم يدّعِ المشروع إغلاقه منذ ذلك الحين. دليل التعلم المعزز (RL) هو بذرة واحدة، وv3.0 "نفسه لا يملك ضابط SFT مطابقًا." مجموعات بيانات التدريب ومجموعات تطوير السياسة ليست عامة، لذا لا يمكن إعادة تشغيل المراحل من المستودع وحده، ولم يُعَد تشغيل مُنشئ مجموعة بيانات إعادة الترتيب — نحو 96 GB من الذاكرة — من البداية إلى النهاية.
الزخم، كما قُرئ في اليوم نفسه: 73 نجمة، و5 تفريعات، و0 مشكلات مفتوحة، و7 إصدارات على GitHub. هذه الأرقام تتغير يوميًا، ومستودع عمره ثلاثة أسابيع ليس مشروعًا راسخًا، مهما كانت وتيرة إصداراته. الخلاصة الصادقة هي أن RSI-Jev واحد من أكثر المساعي البحثية وضوحًا في هذه الزاوية من المجال — سلسلة من الإصدارات المؤرخة، والمقيسة، والتي تخسر أحيانًا، مع نشر البحث إلى جانب الدرجات — وهو أيضًا واحد من أقلها تحققًا مستقلًا، إذ إن كل رقم تقريبًا في هذه الصفحة صادر عنه، ولم يخضع لقياس مرجعي من أي طرف خارجي مقابل النموذج التجاري الذي يتوافق معه.
ما ينبغي مراقبته ليس الإصدار التالي، لأنه سيكون هناك واحد خلال أيام بهذا الإيقاع؛ بل ما إذا كان أي شيء خارج المشروع يبدأ بالقياس. الأمران اللذان سيغيّران الصورة هما تشغيل معيار مستقل على نقاط التحقق المنشورة، ومقارنة نموذج قرار تُخضع كلاً من النموذج المفتوح 4B ونموذج TypeSafe المستضاف لحزمة اختبار واحدة. لا وجود لأي منهما اليوم. وإلى أن يوجد أحدهما، فإن الطريقة المفيدة لقراءة نتيجة مثل 46.24 هي باعتبارها ادعاءً موثقاً جيداً من مشروع يسجّل تنبؤاته مسبقاً ويشحن الأذرع التي فشلت — وهو مسار أدلة أقوى من معظم ما سواه، ومع ذلك ليس نتيجة طرف ثالث.
