
Jev נגד Kev: כיוונון עדין ב-$95 שמנצח את Jev בכרטיסי תמיכה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 578 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 182 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
ג'ארד פאלמר שחרר את Kev ב-20 בספטמבר 2026, חמישה ימים אחרי ש-TypeSafe AI השיקה את Jev, והמספר החשוב אינו בטבלת הבנצ'מרקים. הוא נמצא ב-README: כל העניין עלה כ-95 דולר עבור זמן H100 על Modal, בתוספת שלושה סנט של קריאות API ל-Jev ששימשו ליצירת נתוני הערכה. Kev הוא Apache-2.0, ניתן לאירוח עצמי, ומגיע בשלושה גדלים המבוססים על משקולות הבסיס Qwen3.5 — בערך 0.8B, 4B ו-9B — עם מתאם LoRA בדרגה 16 וראש מצביע שהולחם על בסיס קפוא, ולא מודל החלטות מאפס. הוא משקף בדיוק את ה-API להחלטות מטופּסות של Jev: Choice, Score ו-Noul, קרוב מספיק כדי להיות תואם ל-SDK הפייתון של TypeSafe עצמה. Jev, מצדו, הושק ב-15 בספטמבר 2026 כמודל System One הסגור והמתארח של TypeSafe AI, מחזיר תשובות מטופּסות עם ביטחון מכוייל ובלי טקסט בכלל, ומעולם לא פרסם את הארכיטקטורה, מספר הפרמטרים, מחשוב האימון או המשקולות שלו. ההשוואה, אם כן, אינה באמת השוואת מודלים. זהו מבחן לשאלה כמה מערכו של Jev שורד כאשר משכפלים אותו באחר צהריים אחד במחיר של מחשב נייד משומש.
מה שהבנצ'מרקים בעצם אומרים

הכותרת היא ש-Kev מתקרב, ובמשימה צרה אחת הוא מנצח. במערך הבדיקות הנעול של Kev למקורות חדשים, Kev-9B קיבל ציון 0.837 לעומת 0.857 של Jev. בניתוב כרטיסי תמיכה על פני 900 כרטיסים — מערך scienthoon — Kev-9B קיבל ציון 0.952 לעומת 0.897 של Jev, וזו התוצאה המפורסמת היחידה שבה השחזור הפתוח מנצח את המודל שאותו הוא משחזר. Kev גם מוביל במעט במשימות מסוימות של זיהוי לוגיקה. במערכי החלטה של SemiF, מערך מובנה בן 144 שאלות, Jev לוקח את זה 0.965 מול 0.917 של Kev-9B.
היכן ש-Kev מפסיד, הוא מפסיד קשות. דיוק מחוץ לתחום: Kev-8B ב-79.6% לעומת 85.7% של Jev. MMLU: 70% לעומת 90%. MMLU-Pro: 0.515 לעומת 0.840. חשבון תאריכים ברמת דיוק של יום: 60% לעומת 93%. הדפוס עקבי — Kev תחרותי בניתוב ובסיווג צרים שבהם סט התוויות קטן והתחום קבוע, והוא מתפרק בכל דבר שדורש ידע עולם או חשבון רב-שלבי, כי מתאם בדרגה 16 על מודל בסיס קטן קפוא הוא לא המקום שבו שוכן ידע עולם.
כל אחד מהנתונים האלה מגיע מהארנס של Kev עצמו או מכלי מעקב של צד שלישי, וה-README של Palmer אומר במפורש שזו אינה השוואה מבוקרת — נתוני האימון של Jev אינם גלויים, ולכן אין דרך לבנות השוואה כזו. ה-README גם מציין ששום פלטים של Jev לא שימשו לאימון. שתי ההסתייגויות הן מהסוג שהופך את המספרים לאמינים יותר, לא פחות: מי שמפרסם את ההשוואה הוא זה שאומר לך מה היא אינה יכולה להוכיח.
מה שאתה מקבל תמורת 95$ שלא תוכל לקבל מ-Jev בשום מחיר

השוואת העלויות היא הנקודה שבה שני המוצרים מפסיקים להיות ברי־השוואה בכלל. Jev עולה $0.042 למיליון אסימוני קלט, כשהפלט בחינם, מה שזול באופן שבאמת קשה לנצח על בסיס מחיר לקריאה — אבל זהו API מתארח, בגישה מוקדמת, עם רשימת המתנה, ו-TypeSafe אמרה שמגבלות הקצב עשויות להשתנות בלי הודעה. Kev הוא משקולות שאתם מורידים. העלות השולית של הסיווג העשרה־מיליון היא החשמל שלכם.
ארבעה דברים נובעים מכך, ואף אחד מהם לא קשור לציוני בנצ׳מרק.
• שום נתון לא יוצא מהתשתית שלך. Jev הוא נקודת קצה מתארחת; כל מצב שאתה שולח לו — כרטיס התמיכה, שורת הלוג, הרשומה הרפואית — עובר ל-TypeSafe. Kev רץ על ה-GPU שלך — ובעבור עומסי עבודה בפיקוח רגולטורי זה לא העדפה אלא הגורם המכריע.
• בלי הגבלות קצב, בלי רשימת המתנה, בלי סיכון להתיישנות. התיעוד של TypeSafe עצמו מציין שהגבלות הקצב עשויות להשתנות ללא הודעה מראש. לנקודת ביקורת מקומית אין סעיף כזה.
• אתה יכול לכוונן אותו. Kev הוא בסיס להתמחות, והמתכון של LoRA שהפיק אותו הוא ציבורי. אם לטקסונומיית הניתוב שלך יש 40 מחלקות שאף מודל כללי לא מתמודד איתן היטב, אתה יכול לאמן על התוויות שלך — וזה בדיוק מה שפאלמר עשה, בעלות שנמדדת בעשרות דולרים ולא בצוות ML.
• את תקרת ההקשר תוכל לשנות בעצמך. תקציב הבקשות המתועד של Jev הוא כ-32,000 טוקנים, ושדות Choice מוגבלים ל-255 אפשרויות. Kev יורש את חלון ההקשר של Qwen3.5, שגדול בהרבה, ותקרת האפשרויות היא פרט מימוש במערך ההגשה שלך ולא מגבלה של ספק.
מה שעדיין יש ל-Jev ושאין ל-Kev
טענת הכיול היא זו שלא עוברת בצורה נקייה, והיא לב הפיץ׳ של TypeSafe. Jev מאומן בשיטה ש-TypeSafe מכנה RLCD — Reinforcement Learning for Calibrated Decisions — אשר מבצעת אופטימיזציה לכך שערך הביטחון יהיה כן, ולא לכך שהתשובה תהיה מועדפת. כל תשובה של Jev מגיעה עם התפלגות הסתברות על פני האפשרויות, כך שהקוד שלך יכול להגדיר ספים: לפעול אוטומטית ברצועה העליונה, לסמן ברצועה האמצעית, ולהסלים ברצועה התחתונה.
Kev מפיק את אותה צורת טיפוס ואת אותן פלטי הסתברות, מכיוון שה-API תואם במכוון. האם ההסתברויות האלה מכוילות היא שאלה אחרת, והתשובה הכנה היא שאיש לא פרסם תרשים מהימנות עבור אף אחד מהמודלים. ביקורת כיול נפרדת דיווחה ש-Jev השיג דיוק של 44.7% עם שגיאת כיול צפויה של 0.325 במשימת עדיפות במדיניות נסתרת, מה שמרמז שהכיול ב-Jev משתנה בחדות ממשימה למשימה במקום להיות תכונה אוניברסלית — ו-TypeSafe עצמה מורה למשתמשים לבדוק ספי ביטחון מול הדוגמאות המתויגות שלהם במקום לסמוך על ההתנהגות המפורסמת.
הדבר הנוסף שיש ל-Jev הוא שהוא לא אומן על Qwen3.5. למודל 9B עם אדפטר ב-rank-16 יש תקרת ידע, והפער ב-MMLU-Pro של 0.515 מול 0.840 הוא אותה תקרה שהפכה גלויה. אם החלטת הניתוב שלך דורשת מדי פעם לדעת מהו דבר כלשהו, הארכיטקטורה הגדולה והלא-גלויה של Jev עושה עבודה שהאדפטר של Kev אינו יכול.
השהיה וצורת הפריסה
ההשהיה המתועדת מקצה לקצה של Jev היא 70–500 מילישניות לעומת 3–329 שניות בקריאות של מודלי LLM חזיתיים בהשוואה של TypeSafe עצמה, והוספת שאלות לקריאה כמעט אינה משנה אותה מכיוון שכל שאלה מוערכת במקביל מול קריאה משותפת אחת של המצב. Kev-9B על H100 יהיה באותו סדר גודל למעבר קדימה בודד, אבל ההשוואה אינה תפוחים לתפוחים באף אחד מהכיוונים: 9B באירוח עצמי על GPU משותף תחת עומס אינו בעל אותה השהיה כמו נקודת קצה מתארחת, ונקודת קצה מתארחת אינה אותו דבר כמו מכונה בארון שלך. מה שאפשר לומר בלי הסתייגויות הוא ששניהם מהירים מספיק לשימוש בכל תור בלולאת סוכן, ושזמן ההשהיה של Kev הוא פונקציה של חומרה שבשליטתך ולא של רמת שירות שמובטחת לך.
הקריאה הכנה על השעתוק
העובדה ש-Kev קיים בכלל היא עדות על Jev, ושווה להזכיר זאת. מודל סגור שאת התנהגותו אפשר לקרב בחמישה ימים תמורת 95 דולר, בידי אדם אחד, על משקולות בסיס ציבוריות, אומר לך משהו על כמה מהיתרון שלו הוא ארכיטקטורה וכמה ממנו הוא נתוני אימון והגשה. מכאן לא נובע שקל לבנות את Jev — שטח ה-API קל להעתקה, אבל הכיול לא. עם זאת, זה כן אומר שהחפיר אינו הממשק, וכל מי שמעריך את Jev למסלול ייצור צריך לתמחר את האפשרות שכיוונון עדין של בסיס פתוח יביא אותו רוב הדרך בשבריר מהמחויבות.
וזה גם הטיעון שבעד אי-הימור על נתיב ייצור על מי מהם עדיין. אם אתה בוחן את Jev, העמדה ההגיונית היא לנסות אותו בלי להתחייב לו — ו-OrcaRouter אינו מגיש את Jev, משום שהמודל של TypeSafe הוא בגישה מוקדמת ומדבר במבנה בקשה משלו. מה שכן אנחנו מכסים הוא החצי הגנרטיבי של זרימת העבודה שמודלי ההחלטה האלה יושבים בתוכה: יותר מ-200 מודלים מאחורי מפתח אחד תואם OpenAI במחיר המחירון של הספק, מועבר הלאה עם 0% תוספת, עם מעבר כשל אוטומטי. ארכיטקטורה דו-מודלית שבה שכבת החלטה זולה ממיינת את התעבורה ומודל גנרטיבי מטפל בשאר ניתנת לבדיקה בצד שלנו בלי חוזה עם ספק שני, ואם מתברר שרכיב ההחלטה מכוייל היטב על הנתונים שלך — או לא — נתיב מעבר הכשל הוא מה שמונע מכך להפוך לתקרית.
פסק הדין
אם משימת ההחלטה שלך צרה, בתחום קבוע, בנפח גבוה ורגישה לפרטיות, Kev הוא הבחירה שקל יותר להצדיק היום — וזה לא צמוד: המשקלים הם שלך, אתה שולט בנתיב הנתונים, אתה יכול לבצע כיוונון עדין על התוויות שלך, ובניתוב פניות תמיכה נקודת הביקורת 9B כבר מנצחת את Jev לפי המספרים ש-Jev עצמו פרסם. אם משימת ההחלטה שלך זקוקה לידע על העולם, לאריתמטיקה רב-שלבית, או לערך ביטחון שאתה מתכוון להסתמך עליו באוטומציה, המודל הגדול יותר שאינו גלוי של Jev והאימון RLCD שלו עושים עבודה אמיתית, והמתאם של Kev אינו מהווה תחליף לאף אחד מהשניים.
הדבר היחיד שאף אחת מההשוואות לא מכריעה הוא כיול, מכיוון שאיש לא פרסם תרשים מהימנות לאף אחד מהמודלים. בדוק זאת על המקרים המתויגים שלך לפני שתבצע אוטומציה מול מי מהם — ערך הביטחון הוא החלק בשני המוצרים שצריך לזכות בו בכל פריסה, והמהירות היא החלק שכבר הפך לקומודיטי.

