بطاقة عنوان مُولَّدة تحمل عبارة "Jev vs Kev" فوق عنوان فرعي نصه "ضبط دقيق بتكلفة 95 دولارًا يتفوق على Jev في تذاكر الدعم"، تقارن بين Jev (مغلق، مستضاف، بنية غير مُعلَنة، 0.042 دولار لكل مليون رمز مُدخَل، والمخرجات مجانية) وKev (Apache 2.0، قاعدة Qwen3.5، من 0.8B إلى 9B، بنحو 95 دولارًا من وقت H100).
Engineering & Research

Jev مقابل Kev: ضبط دقيق بتكلفة 95 دولارًا يتفوق على Jev في تذاكر الدعم

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أصدر Jared Palmer نموذج Kev في 20 سبتمبر 2026، بعد خمسة أيام من إطلاق TypeSafe AI لنموذج Jev، والرقم المهم ليس في جدول المعايير. إنه في README: كلف الأمر كله نحو $95 من وقت H100 على Modal، بالإضافة إلى ثلاثة سنتات من استدعاءات Jev API المستخدمة لتوليد بيانات التقييم. Kev برخصة Apache-2.0، وقابل للاستضافة الذاتية، ويأتي بثلاثة أحجام مبنية على أوزان Qwen3.5 الأساسية — نحو 0.8B و4B و9B — مع محول LoRA برتبة 16 ورأس مؤشر مثبتين على قاعدة مجمدة بدلاً من نموذج قرار مبني من الصفر. وهو يحاكي واجهة Jev للقرارات محددة النوع بدقة: Choice وScore وNoul، قريبة بما يكفي لتكون متوافقة مع Python SDK الخاص بـ TypeSafe. أما Jev، فقد أُطلق في 15 سبتمبر 2026 بصفته نموذج System One المغلق والمستضاف الخاص بـ TypeSafe AI، ويعيد إجابات محددة النوع بثقة معايرة ولا نص على الإطلاق، ولم ينشر قط هندسته أو عدد معاملاته أو حوسبة تدريبه أو أوزانه. لذا فالمقارنة ليست في الحقيقة مقارنة بين نموذجين. إنها اختبار لمقدار ما تبقى من قيمة Jev عند إعادة إنتاجها في غضون بعد ظهر واحد مقابل ثمن حاسوب محمول مستعمل.

ما تقوله معايير القياس فعلاً

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability returned with every answer, free output, and the roughly 32,000-token request budget with a 255-option Choice cap.

الخبر الرئيسي هو أن Kev يقترب كثيرًا، ويتفوق في مهمة ضيقة واحدة. على مجموعة اختبار Kev المقفلة ذات المصدر الجديد، سجّل Kev-9B نتيجة 0.837 مقابل 0.857 لـ Jev. وفي توجيه تذاكر الدعم عبر 900 تذكرة — مجموعة scienthoon — سجّل Kev-9B نتيجة 0.952 مقابل 0.897 لـ Jev، وهي النتيجة المنشورة الوحيدة التي يتفوق فيها الاستنساخ المفتوح على النموذج الذي يستنسخه. كما يتقدم Kev قليلًا في بعض مهام التعرف المنطقي. وفي مجموعات قرار SemiF، وهي مجموعة منظمة من 144 سؤالًا، يفوز Jev بنتيجة 0.965 مقابل 0.917 لـ Kev-9B.

حين يخسر Kev، يخسر خسارة فادحة. الدقة خارج النطاق: Kev-8B عند 79.6% مقابل 85.7% لدى Jev. MMLU: 70% مقابل 90%. MMLU-Pro: 0.515 مقابل 0.840. حساب التواريخ بدقة اليوم: 60% مقابل 93%. النمط ثابت — Kev منافس في التوجيه والتصنيف الضيقين حيث تكون مجموعة التسميات صغيرة والنطاق ثابتًا، لكنه ينهار في أي شيء يحتاج إلى معرفة بالعالم أو حسابات متعددة الخطوات، لأن مهايئًا برتبة 16 على نموذج أساسي صغير مجمّد ليس المكان الذي تسكن فيه المعرفة بالعالم.

كل واحد من تلك الأرقام يأتي من أداة القياس الخاصة بـ Kev أو من متتبعات طرف ثالث، ويقول README الخاص بـ Palmer صراحةً إنها ليست مقارنة مضبوطة — فبيانات تدريب Jev غير معلَنة، لذا لا توجد طريقة لبناء واحدة. يذكر README أيضًا أنه لم تُستخدم أي مخرجات من Jev في التدريب. كلا إخلاءَي المسؤولية من النوع الذي يجعل الأرقام أكثر موثوقية، لا أقل: فالشخص الذي ينشر المقارنة هو من يخبرك بما لا يمكنها إثباته.

ما تحصل عليه مقابل 95 دولارًا ولا يمكنك الحصول عليه من Jev بأي ثمن

A screenshot of the Kev repository page for jaredpalmer/kev, showing the Apache-2.0 licence, the Qwen3.5 base weights, the rank-16 LoRA and pointer-head recipe, the about-$95 H100 training cost, and the README statement that no Jev outputs were used for training.

مقارنة التكلفة هي النقطة التي يتوقف عندها المنتجان عن كونهما قابلين للمقارنة تمامًا. يكلّف Jev ‏0.042 دولار لكل مليون رمز إدخال مع إتاحة الإخراج مجانًا، وهو رخيص بطريقة يصعب حقًا التغلب عليها على أساس التكلفة لكل استدعاء — لكنه واجهة برمجة تطبيقات مستضافة في مرحلة الوصول المبكر مع قائمة انتظار، وقد صرّحت TypeSafe بأن حدود المعدل قد تتغير دون إشعار. أما Kev فهو أوزان تقوم بتنزيلها. التكلفة الحدية للتصنيف رقم عشرة ملايين هي كهرباؤك أنت.

يترتب على ذلك أربعة أمور، ولا يتعلق أي منها بدرجات الاختبارات المعيارية.

• لا تخرج أي بيانات من بنيتك التحتية. Jev هو نقطة نهاية مستضافة؛ كل حالة ترسلها إليه — تذكرة الدعم، سطر السجل، السجل الطبي — تذهب إلى TypeSafe. يعمل Kev على GPU الخاصة بك، وهو ما يمثل، بالنسبة لأحمال العمل الخاضعة للتنظيم، ليس تفضيلاً بل العامل الحاسم.

• لا حدود للمعدل، ولا قائمة انتظار، ولا خطر إيقاف الدعم. تشير وثائق TypeSafe نفسها إلى أن حدود المعدل قد تتغير دون إشعار. ولا تحتوي نقطة تحقق محلية على بند كهذا.

• يمكنك ضبطه الدقيق. Kev أساس يمكن التخصص انطلاقًا منه، ووصفة LoRA التي أنتجته متاحة للعموم. إذا كان تصنيف التوجيه لديك يضم 40 فئة لا يتعامل معها أي نموذج عام جيدًا، يمكنك التدريب على تسمياتك الخاصة — وهو بالضبط ما فعله Palmer، بتكلفة تقاس بعشرات الدولارات لا بفريق تعلّم آلة.

• سقف السياق متروك لك لتغييره. ميزانية الطلبات الموثّقة لدى Jev تبلغ نحو 32,000 رمز، وحقول Choice يصل حدّها الأقصى إلى 255 خيارًا. أما Kev فيرث نافذة Qwen3.5، وهي أكبر بكثير، كما أن سقف الخيارات ليس سوى تفصيل تنفيذي في مكدّس الخدمة الخاص بك وليس حدًّا من المورّد.

ما الذي لا يزال يمتلكه Jev ولا يمتلكه Kev؟

ادعاء المعايرة هو الذي لا ينتقل بسلاسة، وهو قلب عرض TypeSafe. يتم تدريب Jev بطريقة تسميها TypeSafe RLCD — التعلم المعزز للقرارات المعايرة — والتي تُحسِّن من أجل أن تكون قيمة الثقة صادقة بدلاً من تفضيل الإجابة. كل إجابة من Jev تأتي مع توزيع احتمالي على الخيارات، بحيث يمكن للكود الخاص بك تعيين عتبات: يتصرف تلقائيًا عند النطاق الأعلى، ويضع علامة في المنتصف، ويُصعِّد عند النطاق الأدنى.

ينتج Kev نفس البنية المُنمّطة ونفس مخرجات الاحتمالات، لأن واجهة البرمجة متوافقة عمدًا. أما ما إذا كانت تلك الاحتمالات معايَرة فهو سؤال مختلف، والجواب الصادق هو أنه لم ينشر أحد مخطط موثوقية لأي من النموذجين. أبلغ تدقيق معايرة منفصل عن حصول Jev على دقة 44.7% مع خطأ معايرة متوقع قدره 0.325 في مهمة أولوية ذات سياسة مخفية، مما يشير إلى أن المعايرة على Jev تتفاوت بشكل حاد حسب المهمة بدلًا من كونها خاصية عالمية — وTypeSafe نفسها تطلب من المستخدمين اختبار حدود الثقة مقابل أمثلتهم المُصنّفة الخاصة بدلًا من الوثوق بالسلوك المنشور.

الشيء الآخر الذي يمتلكه Jev هو أنه لم يتم تدريبه على Qwen3.5. نموذج بحجم 9B مع مهايئ برتبة 16 لديه سقف معرفي، والفجوة في MMLU-Pro بين 0.515 و0.840 هي ذلك السقف ظاهرًا. إذا كان قرار التوجيه الخاص بك يتطلب أحيانًا معرفة ما هو الشيء، فإن بنية Jev الأكبر غير المعلنة تقوم بعمل لا يستطيع مهايئ Kev القيام به.

زمن الاستجابة وشكل النشر

زمن الاستجابة من البداية إلى النهاية الموثّق لدى Jev هو 70–500 مللي ثانية مقابل 3–329 ثانية لاستدعاءات نماذج LLM المتطورة في مقارنة TypeSafe الخاصة، وإضافة أسئلة إلى الاستدعاء بالكاد تغيّر ذلك لأن كل سؤال يتم تقييمه بالتوازي مقابل قراءة مشتركة واحدة للحالة. سيكون Kev-9B على H100 في نفس رتبة الحجم لتمريرة أمامية واحدة، لكن المقارنة ليست بين شيئين متكافئين في أي من الاتجاهين: نموذج 9B مستضاف ذاتيًا على GPU مشترك تحت الحمل ليس بنفس زمن استجابة نقطة نهاية مستضافة، ونقطة النهاية المستضافة ليست مثل صندوق في رفك الخاص. ما يمكن قوله دون تحفظ هو أن كليهما سريعان بما يكفي للاستخدام في كل دور ضمن حلقة وكيل، وأن زمن استجابة Kev هو دالة للعتاد الذي تتحكم به وليس لمستوى الخدمة الموعود به.

القراءة الصادقة بشأن إعادة الإنتاج

كون Kev موجودًا أصلًا هو في حد ذاته دليل يتعلق بـ Jev، ويستحق أن يُذكر بالاسم. نموذج مغلق يمكن تقريب سلوكه في خمسة أيام مقابل 95 دولارًا، بواسطة شخص واحد، على أوزان أساسية عامة، يخبرك بشيء عن مقدار ما يعود من مزاياه إلى البنية ومقدار ما يعود إلى بيانات التدريب وخدمة النموذج. لا يترتب على ذلك أن بناء Jev سهل — فسطح API سهل النسخ، أما المعايرة فليست كذلك. لكنه يعني أن الخندق التنافسي ليس الواجهة، وأن أي شخص يقيّم Jev لمسار إنتاجي ينبغي أن يضع في اعتباره احتمال أن يبلغ به الضبط الدقيق لنموذج أساس مفتوح معظم الطريق مقابل جزء ضئيل من الالتزام.

وهو أيضًا الحجة لعدم المراهنة على مسار إنتاجي على أي منهما بعد. إذا كنت تقيّم Jev، فالموقف الحكيم هو تجربته دون الالتزام به — وOrcaRouter لا يقدم Jev، لأن نموذج TypeSafe في مرحلة الوصول المبكر وله بنية طلب خاصة به. ما نغطيه هو النصف التوليدي من سير العمل الذي تندرج ضمنه نماذج القرار هذه: أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI بسعر قائمة المزوّد الممرر مع هامش ربح 0%، مع تجاوز الفشل التلقائي. بنية من نموذجين، حيث تقوم طبقة قرار منخفضة التكلفة بفرز حركة المرور ويتولى نموذج توليدي الباقي، قابلة للاختبار من جانبنا دون عقد مورد ثانٍ، وإذا تبين أن مكوّن القرار سيئ المعايرة على بياناتك، فإن مسار تجاوز الفشل هو ما يمنع ذلك من أن يصبح حادثًا.

الحكم

إذا كانت مهمة قرارك ضيقة النطاق، وثابتة المجال، وذات حجم كبير، وحساسة للخصوصية، فإن Kev هو الخيار الأكثر قابلية للدفاع اليوم، والفرق ليس طفيفًا — فأنت تملك الأوزان، وتتحكم في مسار البيانات، ويمكنك الضبط الدقيق على ملصقاتك الخاصة، وفي توجيه تذاكر الدعم، فإن نقطة تفتيش 9B تتفوق بالفعل على Jev وفق أرقامه المنشورة. وإذا كانت مهمة قرارك تحتاج إلى معرفة بالعالم، أو حساب متعدد الخطوات، أو قيمة ثقة تنوي الأتمتة بناءً عليها، فإن نموذج Jev الأكبر غير المُفصح عنه وتدريبه بـ RLCD يقومان بعمل حقيقي، ومحول Kev ليس بديلاً عن أي منهما.

الشيء الوحيد الذي لا تحسمه أيٌّ من المقارنتين هو المعايرة، إذ لم ينشر أحدٌ مخطط موثوقية لأيٍّ من النموذجين. اختبر ذلك على حالاتك الموسومة بنفسك قبل أن تبني الأتمتة على أيٍّ منهما — فقيمة الثقة هي الجزء الذي يجب اكتسابه في كل عملية نشر لدى كلا المنتجين، أما السرعة فهي الجزء الذي بات سلعة متاحة للجميع بالفعل.

A generated two-column scoreboard comparing Jev and Kev across the same six labelled dimensions, with a footer reading "Kev figures per its own README and harness; not a controlled comparison."