بطاقة عنوان مُنشأة تقول «حيث ينكسر Jev 1.13» تحت العنوان العلوي الصغير «TypeSafe System One» والعنوان الفرعي «قائمة المورّد نفسه لما لا يستطيع النموذج فعله»، مع ثلاث بطاقات مكدسة تقول «لا عدّ، ولا حساب تواريخ، ولا توليد»، و«تقتصر أسئلة الاختيار على 255 خيارًا»، و«ميزانية طلب 64K - منها 32K للحالة»، وتذييل يقول «قابل للاستدعاء باسم typesafe/jev-1.13».
Engineering & Research

أين تتعطل Jev 1.13: قائمة حدود TypeSafe الخاصة

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Jev 1.13 (typesafe/jev-1.13) صدر في 2026-09-15، ما يضعه خارج آخر سبعة أيام بأسبوعين، لذا فإن إطلاقه ليس الخبر. الحدث المؤرخ هو 2026-09-24: ذلك هو اليوم الذي أضاف فيه OrcaRouter typesafe/jev-1.13 إلى كتالوجه وفتح بطاقة نموذج له — أول دعم تشغيل لـ Jev في بوابة طرف ثالث، بعد أسبوعين كان فيه السبيل الوحيد لاستدعائه هو نقطة نهاية TypeSafe الخاصة. وهذا مهم هنا لسبب واحد محدد. Jev غير معتاد من حيث إن مورّده ينشر قائمة بالطرق التي يفشل بها، وقائمة يمكنك قراءتها فقط أسهل بكثير في تخطيها من نموذج يمكنك استدعاؤه فعلاً.

هذه الصفحة هي تلك القائمة، مقصورة على ما تقوله TypeSafe نفسها، بالإضافة إلى الحدود التشغيلية والفاتورة.

تنشر TypeSafe قائمة التعرّج الخاصة بها.

A screenshot of the TypeSafe documentation index at docs.typesafe.ai showing the Reference section with the page "Model jaggedness" and the entry "Jev 1.13", beside the Models, API reference, Agent skill, Legal, Client SDKs and Cookbooks sections.

تحمل docs.typesafe.ai صفحة بعنوان Jev 1.13 jaggedness وهي تنطبق صراحةً على jev-1.13، وتحمل تاريخ مراجعة 2026-09-17، وتبدأ بصياغة البائع نفسه: "Jev ليس مثاليًا. إليك بعض النتوءات التي ندركها في jev-1.13. سيتم إصلاح العديد منها في الإصدارات اللاحقة." تتبع تسعة أنماط مسماة، كل منها مع حالة ملموسة وعلاج "بدلاً من ذلك:". لا شيء أدناه مُستنتَج، ولا شيء مُلطَّف — فالصياغة صياغة TypeSafe، وحيثما تقدم الشركة مثالها الخاص، فإن الأرقام الواردة فيه أرقامها.

قراءة حرفية: إنه يجيب عن السؤال الذي كتبته

تُقرأ كلمات تحديد النطاق وأدوات النفي والشروط الضمنية على ظاهرها. ويُجاب عن السؤال بناءً على الكلمات الواردة في التعليمة، "بينما قد يقرأ الشخص القصد الكامن وراء التعليمات".

تشخيص المورّد هو الجزء المفيد: فعندما تنظر إلى إجابة خاطئة وتجد نفسك تشرح ما قصدته حقًا، يكون ذلك الشرح هو النصف المفقود من التعليمة. وتتمثل العلاجات في ذكر الشرط الدقيق في التعليمات، ووضع الحالات الحدّية ضمن المعايير، وحيث يكون التأويل لا مفر منه حقًا، قسّم السؤال إلى سؤالين حرفيين وادمجهما في الشيفرة.

الرياضيات والأرقام: ليست آلة حاسبة

يقول TypeSafe بصراحة إنه يجب تنفيذ المنطق الرياضي في الشيفرة. وتكمن تحت ذلك ثلاثة إخفاقات محددة:

• العدّ غير موثوق. يشمل ذلك عدّ الأحرف في كلمة، ومرات ورود مصطلح في نص، والعناصر في قائمة طويلة. "يتعرّف النموذج على شكل الإجابة بدلًا من العدّ الدقيق، ويزداد الخطأ مع كِبَر حجم الشيء الذي يُعدّ." اختبار المزوّد نفسه لتحديد ما إذا كان ينبغي السؤال أصلًا: إذا كان بإمكان تعبير نمطي أو محلل العثور على الوحدة، فالعدّ مكانه الكود، ولا يضيف النموذج شيئًا.

• التمثيلات الرقمية تؤدي أداءً أضعف من التمثيلات الدلالية. الأسئلة عن الألوان باستخدام قيم سداسية عشرية أسوأ من الأسئلة نفسها باستخدام أسماء الألوان الإنجليزية؛ فعند إعطاء ثلاثيات RGB أو قيم سداسية عشرية، لا يستطيع Jev أن يحكم بشكل موثوق ما إذا كانت قيمتان متقاربتان. وتظهر الفجوة نفسها في الشيفرة منخفضة المستوى — لغة التجميع، أو التعليمات المرمزة ثنائيًا — مقابل اللغات عالية المستوى. حوّل أو صنّف إلى فئات في الشيفرة، وأبقِ النموذج للجزء الذي يُعد حكمًا حقيقيًا.

• مخرجات الدرجات لا تحمل مقادير عددية دقيقة. وتذكر الجهة الموردة أن مستويات درجات Jev ضعيفة في المعايرة الرقمية. يمكن استخدام قيمة متوقعة لاختبار ما إذا كان شيء ما يتجاوز عتبة؛ لكن لا يمكن استخدامها لإعادة بناء الرقم بالاستيفاء بين أقرب مستويين. وهذا رفض قاطع لفئة كاملة من سوء الاستخدام — قراءة الدرجة على أنها قياس.

التاريخ والوقت: تُقرأ التواريخ كنص، لا ككميات

يُعد ترتيب تاريخين، أو قياس المسافة بينهما، أو تحديد ما إذا كان أحدهما يقع داخل نافذة زمنية أمرًا غير موثوق، ويزداد سوءًا مع الصيغ المختلطة، والمراجع النسبية، وحدود النطاق مثل الأرباع، ونوافذ التسوية، وفترات الاستحقاق.

التقسيم الموصى به نظيف. الاستخراج حكم تقديري، لذا أسنده إلى النموذج. كل مكوّن من مكوّنات التاريخ هو مجموعة مغلقة صغيرة — اثنا عشر شهرًا، وواحد وثلاثون يومًا ممكنًا، ونطاق محدود من السنوات — مما يحوّل الاستخراج إلى اختيار من بين خيارات معدودة بدلًا من تحليل حر، ويمنحك مكانًا لوضع عبارة صريحة "غير مذكور" بحيث يتم الإبلاغ عن الجزء المفقود بدلًا من تخمينه. يجمع الكود الأجزاء ويملك كل شيء بعد ذلك، بما في ذلك الترتيب والمدة والإزاحة ويوم الأسبوع.

الإحالة غير المباشرة: النفي المزدوج والخطوات الإضافية يأتيان على حساب الدقة.

تكون الإجابات عن التعليمات التي تتضمن نفيًا مزدوجًا أو إحالة غير مباشرة متعددة الطبقات أقل موثوقية. والسؤال عن خاصيةٍ تخص خاصيةً أخرى، أو السؤال الذي يتطلب عدة قفزات استدلالية، يأتي على حساب الدقة. والعلاج هو كتابة التعليمات بأكبر قدر ممكن من المباشرة، وتسمية الأجزاء ذات الصلة من الحالة بدلًا من وصفها.

الحالة الكبيرة المليئة بالتفاصيل غير ذات الصلة تضر بالدقة.

تنخفض الدقة كلما نمت الحالة بمحتوى غير مرتبط بالقرار. تعمل التفاصيل غير ذات الصلة كعامل تشتيت، وتجعل الحالة الكبيرة من الصعب تحديد أي جزء من المدخلات أنتج إجابة خاطئة. التذكير الخاص بـ TypeSafe في الملاحظة الختامية صريح: "يعاني Jev من تعفّن السياق، لذا فإن المواد غير ذات الصلة في الحالة تكلّفك الدقة."

استرجع وصفِّ في الكود أولًا، وأرسل فقط الحقول التي يحتاجها السؤال. وحيث لا يمكن التصفية قبل الطلب، يقترح المورّد استخدام noul للتصفية حسب الصلة، ثم الحكم على العناصر المتبقية.

المحتوى الخصومي في الحالة يحرّك الإجابة

الحالة بيانات، وjev-1.13 لا يتعامل معها كعدائية افتراضيًا. يمكن لتعليمة مُدسّة، أو تأطير مضلل عن قصد، أو نص يجادل من أجل تصنيفه الخاص أن تغيّر النتيجة. هذا هو الوضع الوحيد الذي يصف فيه المورّد الإصلاح صراحةً بأنه عمل مستقبلي — "نتوقع تحسين هذا في المستقبل" — والنصيحة المؤقتة هي أن تكون صريحًا في المعايير وأن تختبر التكامل بدقة قبل طرحه أمام العديد من المستخدمين.

التعليمات والمعايير المتضاربة تُربكه.

عندما تطلب التعليمات والمعايير أشياء مختلفة، قد يرتبك النموذج. مثال TypeSafe هو noul حيث تُسند true إلى no و false إلى yes، وهو يقدم أداءً أسوأ من السؤال نفسه إذا صيغ باتساق. التعليمة هي أن تُعامل المعايير كامتداد للتعليمة، وأن يُوفَّق بينهما بلغة يستطيع شخص عادي قراءتها وفهمها.

الثوابت البنيوية التي لا يضمنها

هذا هو النمط الأرجح أن يُعطِّل نظامًا بُني على افتراض لم يكتبه أحد. Jev متسق للغاية بالمعنى العادي — فالمدخلات المتشابهة دلاليًا تُنتج مخرجات متشابهة كميًا — لكن المطابقات البنيوية التي قد تتوقع بقاءها ليست مضمونة. ينشر المورّد حالتين عمليتين.

سؤال واحد، ونوعان من الأسئلة. "هل يطلب العميل استرداد الأموال؟" عند طرحه بوصفه noul وعند طرحه كخيار نعم/لا، في التذكرة "لست راضيًا عن الملاءمة. ما خياراتي هنا؟" يعيد noul بقيمة 0.22، وخيارًا بنعم 0.01، ولا 0.99، وثقة 0.97. تلك إجابات للسؤال نفسه.

• سؤال ونفيه. "هل يطلب العميل استردادًا؟" و"هل يطلب العميل شيئًا غير الاسترداد؟"، يُطرحان باعتبارهما اثنين من nouls على التذكرة "تم تحصيل رسوم مني مرتين مقابل الطلب نفسه. هل يمكن لشخص ما التحقق من هذا؟"، فيُعيدان 0.72 و0.47. ويبلغ مجموعهما 1.19.

العلاجات عملية لا خطابية: لا تعتمد على الثبات البنيوي المتوقّع، ولا تنقل عتبةً مضبوطةً على noul إلى اختيار، ولا تُلزِم النموذج بمتطابقات حسابية بين أسئلة منفصلة. السبب هو أن الاختيار نسبيّ — فهو يحسم أي خيار — بينما كل noul مطلق ويمكن أن يعود منخفضًا لجميعها.

التوليد: لم يتم تدريبه على الكتابة.

jev-1.13 غير مدرّب على توليد النص. يمكنك فرض الإخراج عبر تسلسل الخيارات، ويقول TypeSafe صراحةً إن هذا "لن يعمل جيدًا وسيكون بطيئًا جدًا". أما بالنسبة للاستخراج، فالإرشاد هو استخلاص القيم المرشحة باستخدام تعبير نمطي أو نموذج توليدي وترك Jev يختار القيمة الصحيحة، أو — عندما تكون مساحة الإجابة محدودة — تحويل الاستخراج إلى اختيار من بين الخيارات بدلًا من طلب القيمة نفسها.

الحد الأقصى البالغ 255 خيارًا في أسئلة الاختيار

A generated scoreboard titled "Jev 1.13 - seven days on OrcaRouter" listing six cards: "Median latency: 151 ms", "p95 latency: 247 ms", "Output throughput: 348 tokens/second", "Error rate over the window: 0.49%", "Tokens served over the window: 76.2 million" and "Daily median, last seven days: 175, 170, 163, 161, 170, 147, 143 ms", with a footer reading "Serving figures measured by OrcaRouter, seven days ending 2026-09-30. Limits per docs.typesafe.ai/models.md."

سؤال اختيار: تكامل Jev ليس حافةً مسننة، بل هو شكل المنتج. يجدر فصل هذه الأمور لأن أي قدر من العمل على التوجيهات لا يغيّرها:

• لا توليد للنص. إنه يعيد قرارًا، لا نثرًا. هذا هو التصميم، وليس عيبًا.

• لا محادثة. Jev نموذج قرار منظّم وليس نموذج دردشة. أنت ترسل حالة ومجموعة من الأسئلة المسماة؛ فيعيد إجابة منظّمة واحدة لكل سؤال. لا يوجد تناوب في الأدوار يلزم تصميم التجربة حوله.

• لا يوجد إدخال متعدد الوسائط. الإدخال نصي فقط — سلسلة نصية، أو كائن JSON، أو مصفوفة من القيم النصية، بدون صورة أو صوت أو فيديو. يجب معالجة المواد غير النصية مسبقًا إلى نص أو حقول منظمة قبل أن تصبح جزءًا من الحالة.

• استجابات غير متدفقة. هناك استجابة مُهيكلة واحدة ولا يوجد وضع تدفق. السبب في أن هذا لا يهم هو السبب نفسه الذي يجعله جديرًا بالذكر: لا يوجد شيء يمكن تدفقه. القرار ذو النوع المحدّد — قيمة منطقية مع احتمال، أو تصنيف واحد من مجموعة، أو مستوى على مقياس — ليس له شكل جزئي يستحق الكشف عنه رمزًا تلو الآخر.

• الإنجليزية هي اللغة الأساسية. تُعالَج اللغات الأخرى، بما فيها كتابات CJK، لكن ليس بالقدر نفسه من الجودة. نصيحة TypeSafe هي أن تختبر على المحتوى الخاص بك قبل الاعتماد على Jev لعبء عمل غير إنجليزي، وأن تعتمد على الثقة عند التوجيه.

الحد الأقصى البالغ 255 خيارًا في أسئلة الاختيار

سؤال الاختيار ينتقي واحدًا من عدد يصل إلى 255 خيارًا مُعنونًا، وهذا الحد الأعلى حد صارم. ويوضح TypeSafe أيضًا سبب كون مجموعات الاختيار الكبيرة أبطأ، بكلمات المورّد نفسه: "بالنسبة للاختيارات ذات العدد الأعلى، نتبع نظامًا من مرحلتين: التقييم بشكل مستقل ثم اتخاذ اختيار صريح، ومن هنا يأتي التباطؤ العرضي." لذا فإن تكلفة زمن الاستجابة لمجموعة خيارات كبيرة تكلفة بنيوية وليست عارضة، والمورّد هو من يخبرك من أين تأتي.

نافذة الخدمة الخاصة بنا لـ typesafe/jev-1.13، كما هي مقروءة من بطاقة النموذج بتاريخ 2026-09-30، تُظهر كيف يبدو ذلك عمليًا على مدى سبعة أيام من حركة المرور الخاصة بنا: وسيط قدره 151 مللي ثانية وقيمة p95 قدرها 247 مللي ثانية، و348 رمزًا مُخرَجًا في الثانية، ومعدل خطأ 0.49% عبر 76.2 مليون رمز تم تقديمها. تتحرك الوسائط اليومية في نطاق ضيق — 175 و170 و163 و161 و170 و147 و143 مللي ثانية من 2026-09-24 حتى 2026-09-30 — لكن قيمة p95 اليومية ليوم 2026-09-28 تبلغ 2,448 مللي ثانية، أي نحو عشرة أضعاف اليومين المجاورين له. لا يمكننا أن نعزو هذه القيمة الشاذة في ذلك اليوم الواحد إلى تعدد الخيارات، ولن نفعل ذلك؛ فالقراءة الصادقة هي أن الذيل موجود، وينبغي تصميم أي سير عمل حساس لزمن الاستجابة على أساس الذيل لا الوسيط.

الفاتورة المُدخلة هي الفاتورة كاملة

يُحتسب الإخراج بصفر على Jev، وهو ما يُقرأ أحيانًا على أنه «Jev مجاني». وهو ليس كذلك، لأن الإدخال مُقاس، ولا تكون حالة كبيرة مجانية لمجرد أنه لا يوجد شيء في جانب الإخراج. سعر المورّد هو 0.042 دولار لكل مليون رمز إدخال — وهو الرقم نفسه الذي تذكره TypeSafe على أنه 42 دولارًا لكل مليار — ويمرّر OrcaRouter سعر قائمة المزوّد كما هو بهامش 0%، لذا يصل تخفيض سعر المورّد هنا في اليوم نفسه.

إليك ما يفعله ذلك بشكل واقعي، باستخدام معدل البائع نفسه:

• طلب صغير. تذكرة دعم من 1,200 رمز، بالإضافة إلى نحو 300 رمز من معايير التقييم والأسئلة، تمثل 1,500 رمز إدخال، أي 0.000063 دولار لكل استدعاء.

• طلب كبير. عقد من 55,000 رمز بالإضافة إلى أسئلة ترفع الطلب إلى 60,000 رمز هو 40 ضعف عدد الرموز، لذا 0.0025 دولار لكل استدعاء — لا يزال صغيرًا لكل استدعاء وأكبر 40 مرة من الحالة الأولى لنفس الاستدعاء الواحد.

• عند الأحجام الكبيرة. 60,000 توكن لكل استدعاء و10,000 استدعاء يوميًا يساوي 600 مليون توكن إدخال يوميًا، أي 0.6 مليار، إذًا 25.20 دولارًا يوميًا وحوالي 756 دولارًا خلال شهر من 30 يومًا. العدد نفسه من الاستدعاءات مقابل الطلب البالغ 1,500 توكن يساوي 15 مليون توكن يوميًا: 0.63 دولارًا يوميًا، وحوالي 18.90 دولارًا شهريًا.

الفجوة بين هذين السطرين الأخيرين ليست حيلة تسعير، بل هي الحالة المقيسة بالعداد. ولهذا فإن نصيحة التصفية في قسم تعفّن السياق ليست مجرد إجراء لقياس الدقة — فتقليم الحالة هو أيضًا الرافعة الوحيدة التي تحرّك الفاتورة.

حدود التشغيل المنشورة، حتى لا يضطر أحد إلى التخمين

A screenshot of the OrcaRouter model page for TypeSafe Jev 1.13 showing the title "Jev 1.13" with the 65k context badge, the id typesafe/jev-1.13, the release date 2026-09-24, input text, a p50 latency of 151 ms, and the description "Served via POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out."

تنشر صفحة الطُرز الخاصة بـ TypeSafe أرقامًا ملموسة، فلا يضطر المخطِّط إلى استنتاجها:

• الإنتاجية والمعدل. 100 ألف رمز في الثانية و40 طلبًا في الثانية، وفقًا لـ docs.typesafe.ai/models.md. أي طلب يتجاوز أيًّا من الحدّين يُرجع 429 Too Many Requests؛ تعيد مجموعات SDK الخاصة بعميل المورّد المحاولة مع تراجع زمني افتراضيًا، وتلتزم بترويسة retry-after عندما تتضمنها الاستجابة.

• الحدود تتغيّر. يذكر المزوّد أن حدود المعدل تُعدَّل ديناميكيًا و"قد تتغير دون إشعار" مع دخول السعة حيز التشغيل، مع توفر حدود أعلى في الخطط المخصصة وخطط المؤسسات. اعتبر 100K/40 الرقم المعمول به اليوم وليس عقدًا.

• ميزانية السياق. تبلغ ميزانية الطلب نحو 64,000 توكن عبر الحالة المجمعة وجميع الأسئلة — إذ تنشر بطاقة الطراز 65,536 — كما تحدّ صفحة الطرازات الخاصة بالمورّد، بشكل منفصل، مجموع الحالة مع أطول سؤال واحد عند 32,000 توكن. هذا الرقم الثاني هو ميزانية الحالة، وليس نسخة أصغر من الأول؛ فكلاهما حقيقي ولا يتناقض أحدهما مع الآخر.

• تتغيّر الأسماء المستعارة من تحتك. يشير كل من jev-latest وjev-preview إلى jev-1.13.0 اليوم، ويشير المورّد إلى أنه لا يتوفر إصدار معاينة الآن. يتغيّر الاسم المستعار عند صدور إصدار جديد، لذا إذا كنت قد ضبطت عتبات الثقة وفق إصدار معيّن، فثبّت المعرّف المرتبط بالإصدار وانتقل وفق جدولك الخاص.

كيف ينبغي أن تبدو حالة الاستخدام الخاصة بك

عند قراءتها من البداية إلى النهاية، تصف قائمة المورّد نفسه أداة محدودة النطاق ومفيدة. Jev مناسب عندما يكون الحكم محدودًا والحساب ليس مهمة النموذج: هل هذا السجل متوافق مع السياسة، أي من هذه الأربعين تسمية ينطبق، كيف يُقرأ هذا على مقياس من خمسة مستويات — تُطرح على حالة قمت بتصفيتها بنفسك، مع تعليمة حرفية ومعايير تتفق معها، ومع إجراء كل عد ومقارنة وقياس تاريخ في الكود حوله.

لا يكون مناسبًا عندما تحتاج المهمة إلى العدّ أو الترتيب أو حساب التواريخ، أو عندما تحتاج إلى عدة قفزات استدلالية، أو عندما لا تكون المادة المُدخَلة نصًا، أو عندما تكون الحالة كومة قش والسؤال إبرة، أو عندما يكون أي شيء يتعلق بالمصدر عدائيًا. ليست هذه ثغرات في موجّه؛ بل هي مواضع لا يعمل فيها النموذج، وTypeSafe هي الجهة التي تقول ذلك.

أمر آخر يجدر معرفته قبل أن تُوصّله: الفرق الصادق في كيفية استدعاء Jev. على OrcaRouter، يصل الكتالوج إلى Jev عبر نقطة نهاية systemone المخصصة، POST /v1/systemone، وليس عبر بنية chat-completions الخاصة بـ OpenAI. هذا فرق حقيقي في الطلب الذي تكتبه، وهو النسخة الصحيحة من الادعاء الأقدم بأن Jev «يتحدث شكل طلبه الخاص». كل ما عدا ذلك مماثل لأي نموذج آخر على الحساب — مفتاح واحد لأكثر من 200 نموذج، بلا رسوم لكل رمز من جانبنا، وتجاوز تلقائي عند الفشل إذا تعطل مسار. أزالت TypeSafe قائمة الانتظار في 2026-09-21؛ ولا تزال الصفحة الرئيسية للبائع تصف Jev بأنه وصول مبكر، ولا تزال صفحة القياس المرجعي الخاصة به معلَّمة كقيد الانتظار، لذا فإن أرقام الأداء الوحيدة في هذه الصفحة هي أرقام الخدمة التي قسناها بأنفسنا وادعاءات البائع نفسه، موسومة بأنها له.