بطاقة عنوان مُولَّدة تحمل "RLCD، مشروح" فوق عنوان فرعي نصه "التعلّم المعزَّز للقرارات المعايَرة — طريقة التدريب التي تُسمّيها TypeSafe لـ Jev 1.13."، وفوق ثلاث بطاقات مُسمّاة: "RLHF — تُحسِّن من أجل الإجابة التي يفضّلها الشخص."، "RLVR — تُحسِّن من أجل المخرجات التي يمكن لبرنامج التحقق منها." و"RLCD — تُحسِّن من أجل أن يكون الاحتمال المذكور صادقًا."، مع سطر يقول "RLHF وRLVR هما الطريقتان الأقدم. RLCD هي الثالثة لدى TypeSafe." وتذييل يقول "تسمية RLCD وتأطيرها وفقًا لمنشور الإطلاق الخاص بـ TypeSafe ومقدمة الذكاء الاصطناعي، قُرئ في 2026-09-30." شعار OrcaRouter مُدمَج في الزاوية اليمنى السفلى.
Guides & Insights

شرح RLCD: لماذا يدرّب TypeSafe Jev على أن يكون صادقًا بشأن الثقة بدلاً من أن يكون محبوبًا

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Jev 1.13 (typesafe/jev-1.13) يُدرَّب باستخدام طريقة يسميها صانعه التعلم المعزز للقرارات المعايرة — RLCD — وهذا الاختصار من نحت TypeSafe نفسه لا مصطلح صناعي يُفترض أنك تعرفه مسبقًا. ويقول منشور الإطلاق ذلك بالحرف: إن الشركة بنت "معمارية نموذج جديدة، وأداة أخذ عينات متوازية لأقصى كفاءة، وطريقة تدريب نسميها التعلم المعزز للقرارات المعايرة (RLCD)". إنه جواب ثالث لسؤال كان له جوابان من قبل، والسبب في وجوده هو عدم تطابق تصطدم به معظم الفرق في أول مرة تحاول فيها إدخال نموذج لغوي داخل قرار. وقبل الوصول إلى ذلك، ثمة تاريخان يهمان، لأن هذه الصفحة ليست منشور إطلاق. أطلقت TypeSafe النموذج نفسه في 2026-09-15، وهو تاريخ يقع خارج نافذة الأيام السبعة التي تكتب ضمنها هذه المدونة، ولا ينبغي أن يُقرأ أي شيء هنا على أنه تقديم لـ Jev كجديد. أما الحدث المؤرخ فهو 2026-09-24، حين أضافت OrcaRouter typesafe/jev-1.13 إلى كتالوجها وفتحت بطاقة النموذج الخاصة به — وهي أول مرة يصبح فيها Jev قابلًا للاستدعاء عبر بوابة طرف ثالث بدلًا من الاقتصار على نقطة النهاية الخاصة بـ TypeSafe. هذا هو التغيير الذي تقوم عليه هذه الصفحة، والنتيجة العملية هي أن التقنية الواردة أدناه أصبحت شيئًا يمكنك تجربته في الكود باستخدام مفتاح قد يكون لديك بالفعل، بدلًا من فكرة بحثية تقرأ عنها.

ما يلي هو المفهوم، لا النموذج. يتناول الثلث الأول من هذه الصفحة طريقتي التدريب اللتين صُمّم RLCD في مقابلتهما، لأن RLCD لا يُفهم إلا بوصفه إصلاحًا لما تفعله هاتان الطريقتان عندما تتوقف المهمة عن كونها محادثة وتصبح حكمًا. إذا كنت تعرف بالفعل ما الذي يحسّن من أجله RLHF وRLVR، فالقسم الذي تريده هو الثالث، حيث يقوم جدول TypeSafe الثلاثي الخاص به بالمهمة.

يُحسّن RLHF من أجل الإجابة التي يفضّلها الشخص.

التعلّم المعزّز من التغذية الراجعة البشرية هو الطريقة التي حوّلت نماذج اللغة المُدرَّبة مسبقًا إلى مساعدين. يذكر الدليل التمهيدي الخاص بـ TypeSafe الهدف بصراحة، في بطاقة عنوانها RLHF: إنها "حوّلت النماذج المُدرَّبة مسبقًا إلى روبوتات محادثة. وهي تدرّب النماذج على إنتاج ردود يفضّلها الناس." دُرّب InstructGPT وChatGPT بها، ويضيف الدليل تفصيلًا وثيق الصلة هنا لسبب مختلف — فقد شارك في ابتكار هذا النهج Diogo Almeida، وهو شريك مؤسس في TypeSafe ومؤلف منشور إطلاق Jev. الشركة لا ترفض الطريقة؛ فقد أسّسها شخص ساعد في بنائها. إنها تجادل بأن الهدف خاطئ لمهمة معينة.

إن الطريقة الواضحة لرؤية عدم التطابق هي أن تسأل عمّا تقيسه إشارة المكافأة فعليًا. في إطار التعلم من التغذية الراجعة البشرية (RLHF)، هي تقيس تفضيل مُقيّم بين استجابتين مرشحتين. وهذا بديل ممتاز عندما يكون المنتج محادثة، لأن معيار نجاح المحادثة هو فعلًا ما إذا كان الشخص يجد الرد جيدًا. لكنه بديل معطوب عندما يكون المنتج قرارًا، لأن معيار النجاح هناك هو ما إذا كانت الثقة المعلنة تطابق الواقع، ولا سبيل لمُقيّم يقارن فقرتين معقولتين ليرى الفرق بين 0.6 جيدة المعايرة و0.95 تبدو واثقة. يمكن أن تحظى إجابتان بالتفضيل نفسه ومع ذلك تختلفان اختلافًا هائلًا في مقدار ما ينبغي لقطعة برمجية أن تثق بهما.

أنماط الفشل التي يسمّيها TypeSafe في الدليل التمهيدي تنبع مباشرةً من ذلك:

• التملّق — يتعلّم النموذج إنتاج ما يريد المُقيِّم سماعه، وهو هدف مختلف عمّا هو صحيح.

• هلوسة تبدو واثقة — فالطلاقة واليقين يُكافأان من خلال التفضيل حتى عندما لا يستندان إلى أي شيء.

• إسقاط الأنماط — يؤدي تحسين التفضيلات إلى تضييق توزيع المخرجات، "مُفضِّلًا نمطًا معينًا، مثل اتباع التعليمات، مع تقليل احتمال المخرجات المحتملة الأخرى." إسقاط الأنماط هو النسخة الخفيفة من فشل انهيار الأنماط الكلاسيكي الذي يبتلي الشبكات التوليدية التنافسية، حيث يتقارب المُولِّد على مخرج واحد يواصل خداع المُميِّز.

فقرة التحذير الواردة في الكتاب التمهيدي نفسه هي الجملة الجديرة بالحفظ: "قد يكون المُخرَج مُقنِعًا لشخص ما دون أن يكون موثوقًا بما يكفي لأتمتة تعمل دون إشراف. التفضيل البشري والموثوقية الآلية هدفان مختلفان للتحسين." هذا ليس انتقادًا لـ RLHF كطريقة. إنها ملاحظة مفادها أن النموذج المدرَّب على التفضيلات لم تُطرح عليه قط المسألة التي تحتاج الأتمتة إلى إجابة عنها — أي بكم نسبة، بالتحديد، يكون هذا الشيء على صواب عندما يقول إنه واثق.

يُحسّن RLVR من أجل مخرجات يمكن لبرنامج التحقق منها — ونادرًا ما يكون للقرارات مخرج من هذا القبيل.

التعلّم المعزّز بالمكافآت القابلة للتحقق هو التكيّف الثاني، وهو الذي يقف خلف نماذج الاستدلال. يصف المنشور التمهيدي لـ TypeSafe ما أنتجه: نماذج «قوية في مهام مثل الرياضيات، لكنها أبطأ وأكثر تكلفة». الآلية هي مُدقّق. إذا كانت للمهمة إجابة يمكن لبرنامج اختبارها — اختبار وحدة، أو مُدقّق براهين، أو إجابة رقمية — فيمكن حساب مكافأة دون سؤال أي إنسان عن أي شيء، ويمكن تدريب النموذج مقابل تلك الإشارة على نطاق واسع. إنها تنجح، ولهذا أصبحت نماذج الاستدلال جيدة تحديدًا في المجالات التي يوجد فيها تحقق آلي رخيص.

القيد يكمن في شكل تلك الكلمة: «قابلة للتحقق». فالمكافأة القابلة للتحقق تتطلب مُتحقِّقًا، والمُتحقِّق يتطلب أن تكون للمهمة إجابة صحيحة يستطيع شخص ما حسابها. فكِّر في الأسئلة التي يطرحها نظام إنتاجي فعليًا. هل ينبغي أن تذهب تذكرة الدعم هذه إلى الفوترة أم إلى القسم التقني؟ هل طلب الاسترداد هذا متوافق مع السياسة؟ هل تبدو هذه المعاملة كعملية احتيال؟ لكل منها إجابة يمكن الدفاع عنها في معظم الأوقات، ولا تملك أي منها إجابة يستطيع برنامج التحقق منها، والحالات الأكثر أهمية هي بالتحديد تلك التي يختلف فيها البشر ذوو الخبرة. لا توجد دالة يمكن تشغيلها. لا يملك RLVR شيئًا يكافئه، لذا فهو لا يقدم شيئًا.

الحل الالتفافي المُغري هو تصنيع مُدقِّق عبر وسم مجموعة بيانات والتدريب مقابل الوسوم. يمنح ذلك الطريقة شيئًا تمضغه، لكنه يغيّر الهدف بطريقة مهمة. الوسوم تُرمِّز قرارًا، لا عدم اليقين المحيط به. النموذج المدرَّب على إعادة إنتاج أحكام فريق واحد في الحالات الصعبة يتعلّم أن يكون واثقًا بقدر ما كانت تلك الوسوم واثقة — أي مفرط الثقة تمامًا بقدر البشر الذين كتبوها. وحتى حيث يوجد مُدقِّق حقيقي، توجد فجوة ثانية. المُدقِّق يقيّم الإجابة. ولا يقيّم الثقة المُعلَنة. النموذج الذي يصيب في 95% من الحالات ويُبلِغ عن اليقين في جميعها يحصل على مكافأة كاملة، وهو، كمكوّن في خط أنابيب آلي، عديم الفائدة — لأن الـ 5% هي الجزء الوحيد الذي كان خط الأنابيب بحاجة إلى أن يُخبَر عنه. مواد إطلاق TypeSafe تقول الشيء نفسه من الاتجاه المعاكس: "إذا كان النموذج قادرًا على أداء مهمة 95% من الوقت لكنه لا يقول متى يقع ضمن الـ 5%، فلا يستطيع أتمتة تلك المهمة."

ما الذي يفعله RLCD، وفق صياغة TypeSafe نفسها

يغيّر RLCD عقد المخرجات بدلًا من جودة الإجابة. تنص بطاقة الدليل التمهيدي على: «التعلم المعزز للقرارات المعايرة يدرّب TypeSafe على إرجاع قرارات واحتمالات معايرة بدلًا من نص مولّد». والنسخة الموجزة في منشور الإطلاق هي «قرارات معايرة: إجابات باحتمالات صادقة معرفيًا في مهام System One». وكلاهما يصف حركة واحدة: تدريب النموذج على أساس ما إذا كانت احتماليته المعلنة قد طابقت تكرار كون تلك الإجابة صحيحة، بدلًا من أن يقوم ذلك على ما إذا كان شخص أو مدقق قد أحب الإجابة.

منشور الإطلاق يضع الطرق الثلاث جنبًا إلى جنب، والتباين هو أوضح بيان للفكرة موجود. اقرأه كمجموعة من التباينات بدلًا من جدول:

• ما الذي يُحسّنه من أجله — يُحسّن RLHF التفضيل البشري: "كتابات وردود دردشة يفضّلها المقيّمون البشر"؛ ويُحسّن RLVR "المخرجات التي يمكن التحقق منها"؛ ويُحسّن RLCD المعايرة، "إجابات ذات احتمالات صادقة معرفيًا على System One".

• ما الذي يدخل — يأخذ الاثنان الأقدمان بيانات غير مهيكلة "مع التركيز على رسائل متسلسلة"؛ ويأخذ نموذج قرار مُعاير بيانات غير مهيكلة "مع التركيز على حالة برنامج مهيكلة."

• ما يخرج — سلاسل مُولَّدة "تحتاج إلى تحليل + تحقق،" مع "وجود دائمًا بعض الخطر في أن يخرج الذكاء الاصطناعي عن المسار،" مقابل قيم مُهيكلة آمنة الأنواع حيث "تُحدَّد المخرجات الممكنة والبنية مسبقًا،" النموذج "لا يرتكب أخطاء نوعية أبدًا،" و"تُرفق جميع الإجابات باحتمالات مُعايَرة ودرجات ثقة."

• كيف تُؤخذ العينات — رمز واحد في كل مرة، وكل رمز مشروط بالسابق، مقابل جميع المخرجات المولّدة في استعلام واحد. هذا هو السبب الميكانيكي وراء كون الطريقة الثالثة رخيصة: فلا توجد حلقة فك ترميز يُدفع مقابلها.

• التكلفة — رموز الإدخال من 0.20 دولار إلى 10 دولارات لكل مليون في نماذج المقارنة، مع إخراج يبلغ نحو خمسة أضعاف سعر الإدخال، مقابل 0.042 دولار لكل مليون رمز إدخال مع احتساب الإخراج بصفر في Jev.

• مدى سرعة الإجابة — من 3 إلى 329 ثانية من طرف إلى طرف للنماذج الرائدة مقابل 70 مللي ثانية إلى 500 مللي ثانية، وهو ما تصفه الشركة المورّدة بأنه أسرع بمقدار 40 إلى 200 مرة على الاستعلامات المُشكّلة على غرار System One.

• ما يقوله عن ثقته بنفسه — النموذجان الأقدمان "يميلان إلى الثقة المفرطة وعدم الاتساق" حتى عند مطالبتهم بتقدير للثقة؛ بينما RLCD "يعبّر دائمًا عن الثقة وعدم اليقين مع كل مُخرَج"، حيث "تعني الثقة الأعلى دقة أعلى".

السطر الأخير هو ادعاء المنتج الفعلي، وهو قابل للتكذيب على نحو لا تكون عليه الأسطر الأخرى. «ثقة أعلى تعني دقة أعلى» عبارة عن قول عن منحنى: ضع إجابات النموذج في مجموعات حسب الاحتمال الذي أسنده إليها، وينبغي أن تكون هذه المجموعات صحيحة بالمعدل الذي تقاربه الاحتمالات المدّعاة. وتوضّح وثائق الثقة لدى TypeSafe هذا العقد بأرقام ملموسة على نحو غير معتاد:

• النتائج التي تُسنَد إليها احتمالية 0.2 ينبغي أن تحدث في نحو 20% من الحالات.

• النتائج التي تُسنَد إليها احتمالية مقدارها 0.8 ينبغي أن تحدث نحو 80% من الوقت.

• النتائج المُسنَدة إلى احتمال 1.0 يجب أن تحدث بنسبة 100% من الوقت.

وهناك الجملة التي تُبقي الادعاء صادقًا، بكلمات المورّد نفسه: "تصف هذه المعدلات مجموعات من التنبؤات، وليست ضمانًا بشأن أي إجابة منفردة." هذا ليس تحوّطًا مُلحقًا لأسباب قانونية. إنه المعنى الكامل للمعايرة. النموذج جيد المعايرة الذي يقول 0.8 لا يَعِد بأن يكون صائبًا هذه المرة؛ بل يَعِد بأنه من بين كل إجابة وسمها بـ0.8، كان نحو أربع من كل خمس صحيحة. إجابة واحدة لا تخبرك بشيء. ألف إجابة على مدار أسبوع تخبرك ما إذا كان المنحنى حقيقيًا.

A generated two-column scoreboard headed "RLHF / RLVR vs RLCD — the scoreboard", subtitle "RLCD (Jev 1.13)" on the right column, with six matching rows on each side: Optimises for (human preference, or a program's check, versus the stated probability being honest); Input (messages, in sequence, versus structured program state); Output (generated strings, parsed after the fact, versus typed values with probabilities); Confidence (overconfident and inconsistent, versus reported with every answer); Sampling (one token at a time, versus all outputs in a single query); and Cost (USD 0.20 to 10 per million input tokens, versus USD 0.042 per million input tokens, output free). A footer reads "Left column and RLCD framing are TypeSafe's own comparison, from its launch post and AI primer, read 2026-09-30." The OrcaRouter logo is composited in the bottom-right corner.

يظهر التباين نفسه ثلاثي البطاقات في وثائق TypeSafe الخاصة، وهي مصدر المقارنة أعلاه وأوضح مكانٍ للتحقق من الصياغة بدلًا من الأخذ بكلام ملخّص. واللقطة أدناه هي تلك الصفحة كما هي عليه اليوم: ثلاث بطاقات للمقاربات الثلاث بعد التدريب، وتسمّي الثالثة RLCD بالكامل.

A screenshot of the "Three post-training approaches" section of TypeSafe's AI primer documentation page, captured 2026-09-30. Beneath the intro line "Pretrained language models have been adapted in two major ways. TypeSafe adds a third. RLHF and RLVR are shown here for context; TypeSafe's training path is RLCD." sit three labelled cards: "RLHF — Reinforcement learning from human feedback turned pretrained models into chatbots. It trains models to produce responses people prefer."; "RLVR — Reinforcement learning with verifiable rewards created reasoning models that are strong at tasks such as mathematics, but slower and more expensive."; and "RLCD — Reinforcement learning for calibrated decisions trains TypeSafe to return decisions and calibrated probabilities instead of generated text."

يكشف تفصيلان إضافيان في وثائق المورّد إلى أي مدى يتوغل هذا الأسلوب في المنتج. الأول أن الثقة مشتقة لا مولّدة: يعيد النموذج توزيعًا احتماليًا كاملًا على الخيارات أو المستويات التي زوّدتها، وقيمة الثقة إحصائية تُحسب من شكل ذلك التوزيع. ولهذا يمكن للوثائق أن تخبرك بأن التعريف ليس هو ما يحمل العبء — فأنت تحصل على التوزيع الخام في كلتا الحالتين، ويمكنك حساب إحصائية خاصة بك إذا كانت تناسبك على نحو أفضل. والثاني أن RLCD هو الشيء الوحيد الذي يشكّل الأوزان. تنص صفحة النماذج لدى TypeSafe على: «لا يُضبط Jev ضبطًا دقيقًا ولا يُكيَّف عبر LoRA باستخدام بيانات العملاء. بل يُدرَّب باستخدام RLCD ليعيد قرارات معايَرة، والأوزان نفسها تخدم كل حساب.» يحدث تكييف المجال في الطلب — حالتك، معاييرك — لا في نقطة تحقق خاصة بكل عميل. وأي معايرة أنتجها الأسلوب هي المعايرة التي يحصل عليها كل عميل.

لماذا تُعد المعايرة هي ما يجعل نموذج قرار منخفض التكلفة قابلاً للاستخدام

الاحتمال المعاير ليس مثيرًا للاهتمام بحد ذاته. إنه يصبح هو البنية في اللحظة التي يتفرع فيها الكود الخاص بك بناءً عليه، وتوثيق الثقة لدى TypeSafe يصف هذا النمط تحديدًا بوصفه ثلاثة نطاقات، كل منها يُنتج سلوكًا مختلفًا للنظام.

• ثقة عالية — تصرّف تلقائيًا. النموذج لديه قراءة واضحة ويمكنك المضي قدمًا دون تدخل بشري.

• ثقة متوسطة — تابع بحذر. لدى النموذج إجابة معقولة لكنه غير متأكد، لذا تحقّق مع المستخدم، أو ضع علامة للمراجعة، أو اجمع مزيدًا من المعلومات قبل التصرف.

• ثقة منخفضة — لا تتخذ أي إجراء. وجّه الحالة إلى إنسان، أو اطلب توضيحًا، أو ارجع إلى نظام مختلف، لأن النموذج يخبرك بأنه لا يملك معلومات كافية للبناء عليها.

توضح الوثائق صراحةً أن الحدود متروكة لك لتضعها، وأنها ينبغي أن تختلف باختلاف العواقب: «عتبة الثقة ليست رقمًا واحدًا. ينبغي تقييد الإجراءات المختلفة داخل النظام نفسه عند مستويات مختلفة تبعًا لعواقب الخطأ فيها». ويضع مثالهم العملي حدًّا أدنى صارمًا عند 0.5 — فأي قيمة يُبلّغ عنها النموذج دون ذلك تُحوَّل إلى إنسان دون مزيد من الفحص — ثم يطبّق معيارًا أعلى لإجراء تدميري مما يطبّقه لإجراء للقراءة فقط. شفرتك هي التي تُرمّز مدى تحمّل المخاطر؛ والنموذج يوفّر المدخل الصادق لها.

هذا النمط هو الحجة بأكملها لصالح سير عمل مكوّن من نموذجين، ويستحق أن يُصاغ كحجة لا كقائمة ميزات. افترض أنك تريد خط أنابيب آليًا يتعامل مع الأغلبية الواثقة من الحالات ويصعّد ما تبقى إلى نموذج أكبر أو إلى إنسان. لا بد أن يأتي قرار التصعيد من مكان ما. إذا أبلغ النموذج الرخيص عن 0.98 في كل شيء، بما في ذلك الحالات التي يخمّن فيها، فلن يكون لدى الفرع ما يختبره، وعندئذ إما أن تؤتمت كل شيء — بما في ذلك الحالات التي كان ينبغي أن يصعّدها — أو لا تؤتمت شيئًا. النموذج الذي تكون ثقته مفيدة هو النوع الوحيد الذي يتيح لك أتمتة مجموعة فرعية بأمان، لأنه النوع الوحيد القادر على إخبارك بالمَجموعة الفرعية التي يكون غير آمن عليها. تضع الوثائق النقطة نفسها في سطر واحد يستحق الاقتباس لصراحته: "إذا لم يستطع نظام ذكي، سواء أكان بشرًا أم آلة، التعبير عن عدم يقين صادق، فلا يمكن الوثوق بالنظام."

هناك سبب ثانٍ يجعل هذا الأمر أكثر أهمية لنموذج رخيص مما هو لنموذج باهظ الثمن، وهو السبب الذي يجعل قصة التوجيه وقصة RLCD القصة نفسها. النموذج المسعّر بـ 0.042 دولار لكل مليون رمز إدخال دون أي رسوم على الإخراج رخيص بما يكفي للاستشارة باستمرار — في كل دور من حلقة الوكيل، وعلى كل سجل في دفعة، وعلى كل تذكرة عند وصولها. والاستشارة باستمرار هي بالضبط الحالة التي تتراكم فيها أخطاء النموذج، لأن لا أحد يقرأ مخرجاته قبل التصرف بناءً عليها. الثقة هي ما يجعل ذلك آمنًا. ورخص الثمن هو ما يجعل فرع التصعيد ميسور التكلفة، لأن المسار الباهظ لا يُشغَّل إلا على الجزء من الحالات التي رفضها النموذج الرخيص. لا يعمل أي من الشقين دون الآخر، وقرار التوجيه الذي يجمعهما هو عتبة على رقمٍ، وRLCD هو سبب الإيمان به.

الحد الصادق: أن تكون معايَرًا لا يعني أن تكون صحيحًا

أهم ما يجب إدراكه بشكل صحيح بشأن RLCD هو ما لا يدّعيه. فالمعايرة خاصية تتعلق بدرجات الثقة، وليست ضمانًا بشأن الإجابات، وتقول الجهة البائعة ذلك في وثائقها الخاصة بدلًا من ترك الأمر للنقاد. صفحة System One: "نماذج System One مدرّبة لاتخاذ قرارات معايَرة: تُحسّن احتمالاتها مقابل النتائج لتعكس عدم اليقين. تُقاس المعايرة عبر مجموعات من التنبؤات؛ وهي لا تضمن أن إجابة فردية صحيحة." يمكن أن يكون النموذج معايَرًا تمامًا ومع ذلك يتخذ قرارًا خاطئًا بشأن تذكرتك، لأن 0.9 تعني تسعة من عشرة، وقد تكون هذه هي العاشرة.

أرقام الخدمة الخاصة بنا هي الثقل الموازن المفيد هنا، تحديدًا لأنها قياسات للنموذج في الإنتاج وليست ادعاءات حول ما تحققه المنهجية. خلال الأيام السبعة المنتهية في 2026-09-30، على حركة المرور عبر الساحة التجريبية لـ OrcaRouter منذ إضافة النموذج إلى الكتالوج، تفيد بطاقة Jev 1.13 بمعدل خطأ قدره 0.49% عبر 76.2 مليون توكن، إلى جانب زمن أول توكن عند p50 قدره 151 مللي ثانية، وp95 قدره 247 مللي ثانية، ونحو 349 توكن إخراج في الثانية. هناك أمران بشأن ذلك الرقم يستحقان أن يُقالا بوضوح. إنه رقمنا، وليس رقم المزوّد، وهو نافذة متحركة وليس مجموعة اختبار ثابتة — سجّل الحقل نفسه 0.57% في وقت أبكر ضمن النافذة، لأنه يُعاد حسابه على مدى الأيام السبعة الأخيرة من حركة المرور الحية، وتتقادم استدعاءات الأمس فتخرج. وهو أيضًا ليس قياس معايرة. يخبرك معدل الخطأ بمدى تكرار حدوث خطأ ما في حركة المرور لدينا؛ لكنه لا يخبرك بما إذا كانت قيم الثقة صادقة، وهذا سؤال مختلف ويحتاج إلى بيانات موسومة للإجابة عنه.

وهي أيضًا التعليمة العملية التي يقدّمها المورّد، في ملاحظة مرفقة بإرشاده بشأن العتبة: «تعتمد قيم العتبة الصحيحة على مجالك وعلى أداء النموذج في حالة استخدامك. ابدأ بعتبات متحفظة، واختبر باستخدام بياناتك الخاصة، وعدّل حسب ما تلاحظه من نتائج.» RLCD ادعاء حول كيفية تدريب النموذج. وما إذا كان الادعاء يصح على مدخلاتك فهو مسألة تجريبية، وهو إحدى الخصائص القليلة للنموذج التي يمكنك اختبارها دون أي بنية تحتية للتعلم الآلي — خُذ بضع مئات من الحالات التي تملك تسمياتها بالفعل، وصنّف الإجابات في مجموعات حسب الثقة التي أبلغ عنها النموذج، وتحقّق مما إذا كانت هذه المجموعات صحيحة بالمعدل الذي تدّعيه. إذا كانت مجموعة 0.9 صحيحة نحو 90% من الوقت على البيانات الواردة لديك، فالعتبة حقيقية ويمكنك الأتمتة فوقها. وإذا تجمّع كل شيء فوق 0.9 ولم تتبع الدقة ذلك، فقد تعلّمت شيئًا أنفع من أي رقم رئيسي.

ثمة حدّان إضافيان يجب ذكرهما في السياق نفسه. الأول أنه لا توجد بطاقة قياس معيارية عامة لهذا النموذج يمكن التحقق من أي من ذلك مقابلها؛ فالمورّد لم ينشر واحدة، ولا تُدرج أي لوحة صدارة تابعة لطرف ثالث هذا النموذج؛ كما أن صفحة النموذج على Artificial Analysis تعيد 404 اعتبارًا من 2026-09-30. لذا فإن حجة المعايرة تستند إلى وصف التدريب، والعقد الموثّق، وأي شيء تقيسه بنفسك، لا إلى منحنى منشور. والثاني أن ادعاءات المورّد بشأن الأداء هي ادعاءاته الخاصة: فتدوينة الإطلاق تشير صراحةً إلى أن تقييمات سير العمل التي تقف وراء العنوان البارز للسرعة والتكلفة قد بناها فريق قدرات النماذج التابع لها، وأن الإجابات المرجعية التي تُقاس مقابلها هي متوسط نموذجين خارجيين، وأن الأرقام تقع «في الطرف الأعلى من المكاسب في العالم الواقعي». وتقول أيضًا إنه لا يمكن إثبات أن التسعير غير مدعوم. لا شيء من ذلك يقوّض طريقة التدريب، وهي ادعاء منفصل عن ادعاء السرعة، لكنه يعني أن الحجة المؤيدة لـ RLCD هي حجة حول تصميم الهدف وليست نتيجة تجريبية محسومة. تعامل معها كفرضية يمكن اختبارها بتكلفة زهيدة، وهو موقف أفضل مما تتركك فيه معظم ادعاءات طرق التدريب.

ما يمكنك فعله بهذا اليوم

يلتقي طرفا الحجة في موضع واحد. RLCD هو السبب وراء كون ثقة نموذج القرار جديرة بالتفرّع عليها؛ والعتبة في شفرتك هي المكان الذي يعيش فيه ذلك التفرع؛ والتصعيد لا يكون ميسور الكلفة إلا إذا كان المسار الشائع رخيصًا بما يكفي لتشغيله في كل مكان. يمكن استدعاء Jev 1.13 باسم typesafe/jev-1.13 على OrcaRouter — واجهة API واحدة لأكثر من 200 نموذج، بهامش 0%، وسعر قائمة المزوّد يُمرَّر كما هو، لذا يصبح تخفيض سعر المورّد ساريًا هنا في اليوم نفسه — مما يعني أن مسار الأغلبية الواثقة ومسار التصعيد التوليدي يُحتسبان على المفتاح نفسه بدلًا من عقدين مع مورّدين. ما زلت تستدعيه بشكله الخاص، POST /v1/systemone، غير متدفق، مقابل سياق من 65,536 رمزًا، لأنه ليس مسار OpenAI chat-completions وليس مطويًا داخل نقطة نهاية المحادثة. هناك ملاحظتان مؤرختان من إصدارات SDK الخاصة بالمورّد تجدر معرفتهما إذا كنت تقوم بتوصيله: الإصدار 0.7.1، الصادر في 2026-09-21، أضاف أمثلة للاستخدام مع بوابات الذكاء الاصطناعي، والإصدار 0.7.2، الصادر في 2026-09-26، أضاف إضافة http2 إلى حزمة Python. الثانية من نوع التفاصيل التي لا تظهر إلا في ملاحظات الإصدار — عميل HTTP/2 يستحق أن يكون لديك لنموذج تكون فيه قيمة عرضه كاملة هي رحلات ذهاب وإياب دون 200 مللي ثانية.

إن أخذت شيئًا واحدًا من الصفحة، فخذه من شكل السؤال الذي يجيب عنه RLCD. إنه ليس «هل يمكن أن يكون النموذج أذكى». إنه «هل يمكن أن يخبرني النموذج عندما لا يكون ذكيًا بما يكفي، وبوتيرة كافية ودقة كافية تتيح لي أتمتة الباقي». هذا هدف بحثي مختلف عن الهدفين اللذين كرّس لهما المجال السنوات القليلة الماضية، وهو الوحيد الذي ينتج رقمًا يستطيع كودك التصرف بناءً عليه. قيمة الثقة هي ذلك الرقم. اختبرها على تسمياتك الخاصة قبل أن تثق بها، وابدأ بعتبة قد تشعر بالحرج إن كنت مخطئًا بشأنها بدلًا من عتبة تتمنى أن تكون محقًا بشأنها.

قطعة أخيرة من الصورة يجدر حملها إلى جانب كل ما سبق، لأنه الرقم الذي تستهدفه الحجة بأكملها، وهو مقيس لا مزعوم. البطاقة أدناه هي سجل الخدمة الخاص بنا على مدى سبعة أيام لـ typesafe/jev-1.13 — النموذج على الشبكة، وليس طريقة التدريب، وليس معيارًا مرجعيًا. اقرأها بوصفها النصف الثاني من سؤال المعايرة: تخبرك درجات الثقة بأي الاستدعاءات ينبغي التصرف بناءً عليها، ويخبرك هذا بمدى قرب بقية قرار التوجيه من نظام كنت ستتركه دون إشراف.

A screenshot of the PERFORMANCE panel on the OrcaRouter model card for typesafe/jev-1.13, captured 2026-09-30, showing four tiles — P50 TTFT 151 ms, P95 TTFT 247 ms, OUTPUT SPEED 349 tok/s and ERROR RATE 0.49% — above a chart headed "Last 7-day latency trend" with a vertical axis running 0 to 2500 ms and daily points labelled 09-24 through 09-30, and a legend reading "p50 TTFT" and "p95 TTFT".