بطاقة عنوان مُولَّدة تحمل نص «Clef»، بعنوان فرعي «نماذج قرارات Cloudflare التي لا تكتب رمزًا أبدًا»، مع شارتين تحملان «الأوزان 30 Sept 2026» و«مدونة 1 Oct 2026». شعار OrcaRouter مُركَّب في الزاوية السفلية اليمنى.
Engineering & Research

Clef تنسخ Jev's API عن قصد — وهذا هو الجزء المثير للاهتمام

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Clef هو نموذج متعدد الوسائط بـ 27 مليار معلمة من Cloudflare، لا يجيب إلا عن الأسئلة المكتوبة ولا شيء آخر. تُسلِّمه حالة — نصاً، JSON، صورة، إطار فيديو — بالإضافة إلى مخطط يضم ما يصل إلى 64 سؤالاً مُسمّى، فيعيد احتمالاً لكل خيار مسموح به في تمريرة أمامية واحدة. لا نص مُولَّد، ولا محلل، ولا حلقة فك ترميز. وما يجعل Cloudflare/clef يستحق القراءة عنه ليس ذلك التصميم، الذي استعاره، بل تنسيق الإرسال الذي اختاره: أنشأت Cloudflare Clef ليتحدث بجسم الطلب والاستجابة الخاص بـ Jev System One، نموذج القرار الذي أطلقته TypeSafe أولاً، والمُقدَّم على المسار نفسه POST /v1/systemone. إن قابلية التشغيل البيني هنا هي الحجة التجارية بأكملها. إذا كان خط أنابيبك يطرح بالفعل على نموذج قرار أسئلة بهذا الشكل، فإن Clef ليس سوى تغيير في عنوان URL وسلسلة النموذج، وليس ترحيلاً.

هذا شيء غير معتاد أن يُدفَن في منشور إصدار، وCloudflare لا تدفنه — فبطاقة النموذج تذكر بصراحة أن واجهة API «متوافقة تمامًا مع Jev وSystemOne»، وتُفتتح المدونة بإسناد الفضل إلى TypeSafe في وضع هذه الفئة على الخريطة قبل أن تُقدّم Clef بوصفها نسخة الجيل الثاني لتجربة داخلية. لذا فإن القراءة الصادقة لهذا الإصدار تتكوّن من ثلاثة أجزاء: ما الذي يمنحك إياه قرار التوافق، وما تقوله أرقام Cloudflare نفسها حول مواضع فوز Clef وخسارتها، وما يبقى غير مُتحقَّق منه لأن كل رقم في ذلك الجدول أنتجه المورّد الذي يطرح النموذج.

جاءت الفئة من مكان آخر

منشور Cloudflare صريح بشأن النسب. تُنسب فكرة نموذج يُرجع مخرجات مُهيكلة محدودة بدلاً من النثر إلى Jev System One من TypeSafe. أما مسار Cloudflare الخاص إلى ذلك فقد كان عرضًا توضيحيًا سابقًا حَوَّل نموذج انتشار إلى إخراج احتمالات حتمية عبر كشف logprobs، إضافة إلى عمل مجتمعي قام به Matt Mastracci على جعل محرك الاستدلال يتعامل مع هذا النمط. يبني Clef على هذا المفهوم بعمود فقري مختلف، ورأس تسجيل مُصمم لغرض محدد، و—الجزء المهم تجاريًا—جسم طلب يطابق جسم الطرف المهيمن.

عندما ينسخ مورّد تنسيق الاتصال الخاص بمنافس ويقيس أداءه مقابل مؤشر ذلك المنافس، فلا يكون التوافق حاشية على النموذج، بل استراتيجية المنتج. إن استبدال نموذج قرار خلف نقطة نهاية قائمة هو أرخص طريقة ممكنة لتجربة وافد جديد، وأرخص تجربة ممكنة لفريق لديه بالفعل واحد منها موصول.

ما الذي شُحن فعليًا، وما هي تكلفته

• المعاملات — 27B، بُني عبر تجميد Qwen3.8-27B مع مُرمِّز الرؤية الخاص به، وتدريب رأس مخطط مشترك إضافةً إلى مُكيِّفات منخفضة الرتبة بمرتبة 256 فوقه.

• نظير — Clef-Flash، الوصفة نفسها بحجم 9B من Qwen3.5-9B. مقال منفصل، ومقايضات منفصلة.

• السياق — 65,536 رمزًا (token)، وفقًا لصفحة نموذج Workers AI ومنشور المدونة. أداة الترميز المساعدة المضمّنة تعيّن افتراضيًا max_length=16,384، وهي قيمة افتراضية وليست حدًا أقصى، لكنها القيمة الافتراضية التي تحصل عليها إذا استخدمت المُحمِّل كما هو مُرفَق.

• أنواع الأسئلة — noul (صواب/خطأ، مع إرجاع احتمال الصواب)، اختيار (من 2 إلى 26 خيارًا مُسمّى)، تقييم (من 2 إلى 26 مستوى مرتبًا). من سؤال واحد إلى 64 سؤالًا لكل طلب.

• السعر — 0.24 دولار لكل مليون رمز إدخال على Workers AI من Cloudflare، أو استضافة ذاتية من أوزان Apache-2.0 التي تبلغ حوالي 55 GB موزعة على اثني عشر جزءًا.

• الترخيص — Apache 2.0، وفقًا لنقطة التحقق الأساسية Qwen3.8-27B.

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

أين يفوز، وأين لا يفوز

تشغيل Decision Index من Cloudflare هو المصدر لكل ما في هذا القسم، ولوحة الصدارة التي تستضيفه هي لوحة Cloudflare نفسها. لم يُعَد إنتاج أي شيء أدناه بشكل مستقل. اقرأه على أنه أفضل سيناريو من منظور مورّد، ولاحظ مدى تفاوته.

تتجمع الانتصارات حيث يُفترض أن يفوز مُصنِّف مُدرَّب داخليًا. يحقق Clef مقياس F1 الكلي لتصنيف النوايا في BANKING77 عند 94.2 مقابل 79.7 لـ Jev، و CLINC150 مع معالجة خارج النطاق عند 97.4 مقابل 89.3 — فجوة قدرها ثلاثون نقطة وهي الخلية الأكثر أهمية لاتخاذ القرار في الجدول، لأن رفض التصنيف هو النصف الصعب من التوجيه. كما يحقق CRUXEval عند 86.7، و CLadder عند 94.0، ومحاكي الأجهزة المنزلية عند 83.0.

الخسائر حقيقية بالقدر نفسه، وينبغي أن تُدرَج في الفقرة ذاتها. في المعرفة العامة والاستدلال الصعب، يفوز Jev الأقدم بشكل قاطع: GPQA Diamond من 78.3 إلى 48.0، وMMLU-Pro من 82.7 إلى 65.9، وBBH من 92.9 إلى 73.7. هذه هي الفجوات الثلاث الأكبر في الجدول، وكلها تشير في الاتجاه نفسه. كما أن Clef ليس أفضل نموذج في مقارنته الخاصة على مجموعة PhishNChips الخاصة بمجال الأمن، حيث يسجل 79.6 وتحصل مشاركة منافسة على نتيجة أعلى.

في تقييمات سير العمل الأربعة الشاملة من طرف إلى طرف، المستمدة من مجموعة التقييمات العامة الخاصة بـ TypeSafe والمُقيَّمة مقابل تسميات توافقية، فإن الاثنين متقاربان بما يكفي ليكون الفارق رمية عملة. يتفوق Clef في معالجة الفواتير على الإجراءات الدقيقة بنسبة 64.7 مقابل 61.8، وفي مجموعة الحوادث الأمنية بنسبة 62.9 مقابل 61.7؛ ويتفوق Jev في قابلية مراقبة تتبعات الوكيل بنسبة 71.6 مقابل 68.5؛ أما خدمة العملاء فهي تعادل 76.3 مقابل 76.0 ولا يعني شيئًا عند هذا الهامش.

زمن الاستجابة هو حيث تكون الفجوة بنيوية لا هامشية. تُبلغ Cloudflare عن وسيط يبلغ 209.3 مللي ثانية و238.6 مللي ثانية عند p95 لـ Clef، مقابل 524.1 و536.0 لـ Jev. هذا الترتيب ناتج عن التصميم غير الانحداري الذاتي وليس عن غرائب أحد معايير الأداء، ولهذا فهو الرقم الأرجح أن يصمد عند التطبيق الفعلي. قِيست القيم المطلقة بالمللي ثانية على عتاد Cloudflare نفسه، ولا تعني الكثير بمفردها.

أكثر نقطة بيانات مقنعة في الإصدار ليست صفًا في اختبار قياسي. تقول Cloudflare إن فريقها لاستخبارات التهديدات سلّم نطاقًا إلى Clef إلى جانب خدمتها لتصيير المتصفح، وحصل على حكم فئة في 2.2 ثانية، مقابل 4.7 ثانية لأسرع نموذج LLM عام لديها في سير العمل نفسه، مع إرجاع تصنيفات أكثر. حكاية داخلية، وليست دراسة — لكنها نوع القصة التي تشرح لماذا قد يبني أي شخص هذا بدلًا من توجيه مطالبة إلى نموذج عام.

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

شيئان يخبرك بهما مرجع API، وواحد لا يخبرك به

الفخاخ الموثقة صغيرة وتستحق القراءة قبل نقل أي شيء. الثقة حقل يقيس مدى تركز الاحتمالات، وليس احتمال أن تكون الإجابة صحيحة — يمكن لنموذج جيد المعايرة أن يعيد إجابة صحيحة منخفضة الثقة وإجابة خاطئة عالية الثقة. وعندما يتعادل خياران، تتبع الإجابة ترتيب خيارات النموذج، لذا ضع خيارك المفضل أولاً. أي شخص ينقل مصنفًا قائمًا على المطالبات دون قراءة هاتين الجملتين سوف يسيء قراءة سجلاته الخاصة.

القيد الأكبر غير موثّق في أي مكان لأنه بنيوي. لا يملك Clef أي مسار لتوليد النصوص على الإطلاق، ما يعني أنه لا يستطيع صياغة رد، أو تلخيص سلسلة رسائل، أو استدعاء أداة، أو إجراء محادثة، ولن يبتكر فئة لم تعلنها. يفترض التصميم بأكمله أنك تستطيع تعداد الإجابات المسموح بها مسبقًا. وهذا يستبعد بصمت فئة كبيرة من المشكلات، ولا يغيّر ذلك أي مقدار من أداء الاختبارات المعيارية.

ما قيمة حجة التوافق

هنا يتوقف الإصدار عن كونه مراجعة نموذج ويصبح سؤالاً معماريًا. إذا كان Clef يتحدث بنفس شكل طلب Jev، فإن النموذج خلف نقطة نهاية القرار الخاصة بك هو قيمة إعدادات، والطريقة المعقولة لتبنيه هي جنبًا إلى جنب بدلاً من أن يكون بديلاً — شغّل كليهما على حركة المرور الخاصة بك، واحتفظ بالذي يُظهر قياسًا أفضل على بياناتك، ودع التبديل يظل غير مكلف.

Clef نفسه ليس على قائمة مساراتنا؛ فهرس OrcaRouter يعيد 404 له، ولا ينبغي قراءة أي شيء هنا على أنه ادعاء توافر من جانبنا. ما نقدمه فعلاً هو النموذج القائم الذي بُني ليحل محله. Jev 1.13 من TypeSafe مسار مُدرج بسعر 0.042 دولار لكل مليون رمز إدخال على سياق من 65,536 رمزاً، ويُقدَّم عبر نفس POST /v1/systemone body، بحيث تكون المقارنة A/B بين الاثنين مجرد سلسلة نصية لنموذج لا إعادة كتابة. وجود كلاهما خلف مفتاح واحد — أكثر من 200 نموذج، سعر قائمة المزوّد يُمرَّر دون أي هامش ربح لكل رمز، تحويل تلقائي عند الفشل بين المزوّدين — هو ما يُبقي تلك التجربة مستمرة بعد الأسبوع الذي يقرر فيه أحدهم الاهتمام بها، بدلاً من أن تتلاشى إلى تعليق قديم في ملف إعدادات. النموذج العام الذي تُبقيه في متناول اليد للتصرف بناءً على ما يخلص إليه نموذج القرار يمكن الوصول إليه من المفتاح نفسه بدلاً من عقد ثانٍ.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

ما الذي قد يغير هذه القراءة؟

يحتاج شخص من خارج Cloudflare إلى إعادة تشغيل Decision Index. المجموعة متاحة للعموم، والتقييمات موصوفة بأنها قابلة لإعادة الإنتاج، لذا فإن تشغيلًا من طرف ثالث هو الفرق بين جدول مورّد وحقيقة — والخلايا الأكثر أهمية هي تلك التي تشير في اتجاهين متعاكسين. إن نتيجة 97.4 في كشف النوايا خارج النطاق إلى جانب 48.0 في GPQA Diamond ليست منحنى قدرات سلسًا؛ بل تصف نموذجًا بارعًا جدًا في أشكال التصنيف ضمن توزيع تدريبه وأضعف بكثير في الاستدلال الذي لم يره. إذا صمد ذلك في اختبار مستقل، فهو أهم حقيقة تشغيلية عن Clef، وهي ليست ضمن أبرز النقاط.

حركة مرور الإنتاج أيضًا يجب أن تشبه جدول زمن الاستجابة. الوسيط البالغ 209 مللي ثانية المقيس على وحدة H200 واحدة لا يقول شيئًا عن p95 تحت التزامن، كما أن نقطة الجذب الرئيسية في هذا التصميم هي أنه يقع في مسار حرج.

ومَنصة الضبط الدقيق بحاجة إلى أن تُنتج شيئًا ملموسًا. يصف منشور Cloudflare حلقة تعلّم معزّز — AI Gateway لالتقاط مجموعة بيانات من حركة المرور الخاصة بك، وWorkers AI لتوليد مسارات التنفيذ، وContainers كبيئة اختبار معزولة للتقييم، وTrainer لتحديث الأوزان، ثم إعادة النشر على Workers AI — في المنشور نفسه الذي يعلن عن النماذج، دون إرفاق نتيجة عميل. إن وجود Clef مضبوط بدقة يتفوق على النموذج الأساسي في مهمة لم يُدرَّب عليها الأساس قط سيكون دليلًا أقوى بكثير على هذه الفئة من أي صف في الجدول.

حتى ذلك الحين، فإن الملخص المنصف هو هذا: أطلقت Cloudflare نموذج قرار حقيقيًا، بترخيص متساهل، وسريعًا حقًا، وجعلت استبداله بالنموذج الذي جاء أولًا أمرًا بالغ السهولة. هذه قصة أفضل مما تقدمه معظم الإصدارات المفتوحة، وهي مع ذلك، حتى الآن، لا تزال بالكامل رواية البائع عن نفسه.