כרטיס הירו מיוצר עבור המאמר 'Jev 1.13 מוסבר', כותרת־על 'TYPESAFE SYSTEM ONE', כותרת משנה 'מדוע המודל עונה בתוויות במקום במשפטים', עם שלושה כרטיסים מימין שעליהם כתוב 'תשובות עם טיפוסים בלבד - ללא טקסט מיוצר', 'אין טוקני פלט, כך שאין מה לחייב' ו'$0.042 למיליון טוקני קלט', ושורת פוטר שעליה כתוב 'ניתן להפעיל כ-typesafe/jev-1.13'.
Guides & Insights

Jev 1.13 מוסבר: מדוע המודל עונה בתוויות במקום במשפטים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Jev 1.13 (typesafe/jev-1.13) אינו מודל צ'אט, והדרך המהירה ביותר להבין אותו היא להפסיק לקרוא את דף המפרט שלו כפי שאתה קורא כל אחד אחר. TypeSafe שחררה אותו ב-2026-09-15 כחבר הראשון במחלקה שהחברה מכנה ״מודלים System One״: אתה מעביר לו פיסת מצב וקבוצה של שאלות בעלות שמות, והוא מחזיר תשובה אחת בעלת טיפוס לכל שאלה — תווית מתוך רשימה שסיפקת, דרגה בסולם שהגדרת, או true/false עם הסתברות מצורפת. בלי פרוזה, בלי קוד, בלי הסבר. זה לא מאמר השקה. המודל עצמו הוא מ-2026-09-15, בן חמישה עשר ימים ומחוץ לחלון של שבעת הימים שהבלוג הזה כותב עליו, ולכן הוא לא זוכה לעמוד על ההשקה שלו עצמו. מה שקרה בתוך החלון הוא ש-OrcaRouter הוסיפה את typesafe/jev-1.13 לקטלוג שלה ב-2026-09-24 ופתחה את כרטיס המודל של Jev 1.13 בכתובת https://www.orcarouter.ai/models/typesafe/jev-1.13 — הפעם הראשונה שניתן לקרוא ל-Jev דרך שער של צד שלישי ולא רק דרך נקודת הקצה של TypeSafe עצמה, והנתונים החיים הראשונים של הגשה שמישהו מחוץ ל-TypeSafe פרסם עליו. זה השינוי ששווה לקרוא עליו: המודל הפך לניתן להרצה במקום שבו לא היה ניתן להריץ אותו.

הצורה המעשית של השינוי הזה קטנה וספציפית. לפני 2026-09-24, אימוץ Jev פירושו היה קשר עם ספק שני — חשבון TypeSafe, מפתח TypeSafe, חשבונית TypeSafe, וצורת בקשה ייעודית לכתוב מולה. אחריו, Jev יושב על אותו מפתח כמו שאר הסטאק: API אחד עבור 200+ מודלים, תוספת מחיר של 0% (מחיר המחירון של הספק מועבר הלאה, כך שהורדות מחירים מצד ספקים פעילות כאן באותו היום), והמודל נגיש בכתובת typesafe/jev-1.13 ב-POST /v1/systemone. אתה עדיין קורא לו במבנה שלו — נקודת הקצה אינה נתיב chat-completions של OpenAI, ולהעמיד פנים אחרת יפיק 404 ולא החלטה — אבל החוזה שאתה חותם עליו והמפתח שאתה מבצע עליו רוטציה הם אותם אלה שכבר יש לך.

איזה סוג של מודל הוא ג'ב?

פוסט ההשקה של TypeSafe מנסח זאת במשפט אחד: "המודל הציבורי הראשון שלנו הוא Jev, זמין היום בגישה מוקדמת." הפוסט מציג לאחר מכן את המודל כ"קריאת פונקציה של בינה חזיתית: מצב לא מובנה נכנס, החלטות הסתברותיות בעלות טיפוסים יוצאות." זהו תיאור הוגן של הממשק ותיאור חשוב, משום שכמעט כל ציפייה שגויה לגבי Jev נובעת מהערכתו כמודל שפה קטן. הוא אינו מודל שפה קטן. זהו מודל החלטות עם דקדוק פלט קבוע, והדקדוק הוא המוצר.

לממשק יש בדיוק שני קלטים. המצב הוא החומר שיש לשפוט: דואר אלקטרוני, פנייה לתמיכה, שורת לוג, רשומת JSON, מערך של קואורדינטות משחק. השאלות הן מפה של פריטים בעלי שמות, שכל אחד מהם נושא סוג והוראות משלו, ולכל אחד משני הסוגים המובנים יש גם קריטריונים משלו. כל שאלה מוערכת מול אותו מצב, והתשובות חוזרות כמטען JSON מובנה אחד. התיעוד של TypeSafe מתאר את השאלות כפועלות במקביל ובאופן בלתי תלוי, ומעלה שתי טענות הנובעות מהעיצוב הזה ולא מכיול: הוספת שאלות בקושי משנה את זמן התגובה, והוספת שאלות אינה יוצרת ריקבון הקשר, מפני שכל שאלה נשפטת בבידוד ולא במורד הזרימה מהשאלות הקודמות.

הנחיות העיצוב של TypeSafe עצמה ראויות לחזרה, מכיוון שהן ההצהרה הבהירה ביותר למה שהמודל נועד. שמור על כל שאלה אטומית ובעלת היקף מוגדר היטב — "סוג שיקול הדעת שאדם בעל ידע רב יכול להפעיל תוך שניות ספורות." אם החלטה דורשת הנמקה מורחבת או משלבת באמת מספר גורמים בלתי תלויים, פצל אותה לשאלות נפרדות ושלב אותן מחדש בקוד שלך. הדוגמה שלהם: במקום הנחיה אחת של "דרג את המצגת של הסטארטאפ הזה", שאל בנפרד על גודל השוק, היתכנות טכנית ובידול, ואז החל את השקלול שלך. הסיבה שזה חשוב היא שהשקלול נמצא אז במקדם שאתה יכול לשנות, במקום בהנחיה שאתה צריך לשכתב.

המודל סגור בכל מובן שחשוב למהנדס המנמק על סיכון. הארכיטקטורה של Jev, מספר הפרמטרים, משאבי החישוב של האימון והמשקלים אינם מפורסמים. אין מאגר משקלים בארגון TypeSafe GitHub — אחד-עשר המאגרים הציבוריים שם הם כלי עבודה, SDKs, זרימות עבודה ושלושה פורקים לא קשורים, ואף אחד מהם אינו המודל.

"Typed" הוא המוצר כולו

כרטיס המודל של OrcaRouter מפרסם את שלושת הפרימיטיבים, וחשוב מכך, את המגבלות של כל אחד מהם. כל שאלה שאתה שואל את Jev היא אחת משלוש צורות בדיוק:

• noul — שיפוט אמת/שקר, המוחזר עם הסתברות מכוילת ולא כבוליאני גרידא, כך ש"כנראה נכון" ו"בהחלט נכון" הם ערכים ניתנים להבחנה.

• choice — בחר אחת מתוך עד 255 אפשרויות מתויגות, כאשר כל אפשרות נושאת טקסט קריטריונים משלה כך שהמודל יודע מה מבדיל בין התוויות שלך.

• ניקוד — דרג לפי סולם סדור של 2–10 רמות, כאשר הגדרות הרמות מסופקות כקריטריונים.

התוצאה של ההגבלה הזו היא שאין מה לפרסר מתוך טקסט חופשי, ואין סכימה שקיווית שהמודל מילא אחריה כדי לאמת מולה. פוסט ההשקה של TypeSafe ישיר באופן יוצא דופן לגבי הערובה: נתון אי-התאמת הסכימה של "0%" בגרפים שלו "אינו אמפירי. התאמת סכימה מובטחת, ולכן אנו יכולים להוסיף בביטחון 0% לגרפים." כאשר מרחב התשובות שלך הוא קבוצה סגורה שסיפקת, ערך מוחזר הוא או שנמצא בקבוצה, או שהוא לא הגיע מהמודל — אין תוצאה שלישית שבה המודל כתב משהו סביר בצורה הלא נכונה, וה-regex שלך קיבל אותו בשקט.

שלושת הסוגים הם גם הסיבה לכך שסוקר לא יכול להעריך את Jev כמו שהוא מעריך מודל צ'אט. אין ציון MMLU-Pro להשוות אליו, אין דוגמת כתיבה לקרוא, אין עקבות חשיבה לבחון. השאלה היחידה שיש לה משמעות היא אם התשובה המסווגת נכונה, ואם ההסתברות שמצורפת לה כנה. את שניהם אפשר למדוד, אבל רק מול הנתונים והתוויות שלך.

הבדל מתועד אחד ראוי לסמן ולא ליישב: התיעוד של TypeSafe עצמו מציג דוגמת Score שהאינדקס שלה מתחיל מאפס, בעוד שהכרטיס של OrcaRouter מפרסם את הסקאלה כ-2–10 רמות. הספק מתעד רמות; הכרטיס שלנו מפרסם 2–10. אם אתם בונים רובריקה על גבי Score, קראו את הגדרות הרמות בתגובה שלכם במקום להניח אינדקס.

מדוע אין אסימוני פלט לחיוב

התמחור הוא הביטוי הנקי ביותר של הארכיטקטורה. Jev עולה $0.042 למיליון טוקני קלט ב-OrcaRouter, ותעריף הפלט הוא $0.000000 למיליון — לא הנחה, לא מבצע השקה, אלא היעדרה של כמות ניתנת למדידה. מודל גנרטיבי מחויב על הטקסט שהוא כותב; Jev לא כותב טקסט. הוא מחזיר תווית, רמה והסתברות. אין מה לספור בצד הפלט, ולכן אין חיוב שם.

TypeSafe מציינת את אותו מספר מהכיוון ההפוך בעמוד הבית שלה — "$42 למיליארד טוקני קלט" — ומצרפת לו טענת השוואה: "מחיר קלט נמוך פי 238 מאשר Claude Fable 5.1". ההשוואה הזו, כמו כל דבר אחר בעמוד הבית, היא של הספק עצמו, ולא שוחזרה על ידי איש. אבל החשבון שהיא נשענת עליו קל לקורא לבדוק מול החשבונית שלו, וזה החלק המועיל. נפח של עומס החלטות נקבע כמעט כולו לפי כמה מצב אתה דוחף פנימה, ומצב זול באופן שטוקנים מיוצרים אינם.

נתוני הכותרת של הספק גדולים משורת המחיר וראויים לאותו תיוג. TypeSafe מפרסמת "מהיר פי 193.6, זול פי 444.6" עם הערת שוליים המגבילה אותו ל"תהליכי עבודה למשימות System One", ומפרסמת דוגמה מחושבת מתחתיו: TypeSafe AI ב-$0.000081 הושלם תוך 0.114 שניות לעומת LLMs ב-$0.013880 שהושלמו תוך 8.566 שניות. פוסט ההשקה עצמו מודה בסיכון שבהצגה — ה-193.6x וה-444.6x מתוארים כנמצאים ככל הנראה "בקצה הגבוה של השיפורים בעולם האמיתי" — ומציין שהדגמה זה לצד זה השתמשה בשאילתה "מפושטת מאוד" עם מפתחות קריאים לאדם שנבחרו על ידי הספק כדי "להציג את המודל שלנו באור חיובי". אף אחד מהמספרים הללו לא שוחזר באופן בלתי תלוי, וכרטיס הביצועים של הספק עצמו עדיין מסומן כממתין.

מה המשמעות של "מכויל", ומהו RLCD

TypeSafe מכנה בעצמה את שיטת האימון שלה: "Reinforcement Learning for Calibrated Decisions (RLCD)". RLCD הוא מונח של TypeSafe עצמה, לא ראשי תיבות כלליים של למידת מכונה שקדמו לחברה, ויעד האופטימיזציה שלו מנוסח בטבלת ההשוואה של פוסט ההשקה כ"החלטות מכוילות: תשובות עם הסתברויות כנות מבחינה אפיסטמית במשימות System One". הניגוד שאותה טבלה יוצרת הוא עם RLHF, שמבצע אופטימיזציה להעדפת אדם — טקסטים ותגובות צ'אט שמדרגים אוהבים — ועם RLVR, שמבצע אופטימיזציה לפלטים שניתנים לאימות פרוגרמטית. RLCD מבצע אופטימיזציה לדבר שלישי: ההסתברות המוצמדת לכך שתשובה היא הצהרה מדויקת של אי-הוודאות של המודל עצמו.

באופן מעשי, "מכויל" הוא טענה על רמות הביטחון, לא ערובה שהתשובות נכונות. מודל מכויל שאומר 0.8 על קבוצת שאלות אמור להיות צודק בערך ב-80% מהמקרים באותה קבוצה; הוא עדיין יכול לטעות בכל אחת מהן בנפרד. ההבחנה הזו היא הדרך הכנה לקרוא את השורה בעמוד הבית של TypeSafe: "אפס הזיות — כל החלטה של Jev מגיעה עם הערכת ביטחון, כך שהתוכנה שלך יכולה לפעול כשהביטחון גבוה ולהסלים כשהוא אינו גבוה." זו טענת הערכת ביטחון, לא הוכחה לאפס שגיאות, והמשקל שכנגד הוא הנתונים שלנו: על פני שבעת הימים שהסתיימו ב-2026-09-30, הכרטיס שלנו מודד שיעור שגיאות של 0.49% בתעבורת Jev דרך OrcaRouter — נתון שעמד על 0.57% מוקדם יותר באותו חלון, משום שהוא מחושב על פני שבעה ימים מתגלגלים של תעבורת playground חיה ולא על מערך בדיקה קבוע. שתי העובדות שייכות לאותה פסקה: הערכות הביטחון הן לב העניין של המודל, והמודל עדיין נכשל בערך בקריאה אחת מתוך מאתיים בתעבורה שלנו.

סיפור הכיול גם מסביר התנהגות השהיה שאחרת הייתה נראית כמו באג. בפוסט ההשקה של TypeSafe נאמר: "עבור בחירות עם קרדינליות גבוהה יותר, אנו מבצעים מערכת דו-שלבית של ניקוד בנפרד ואז מקבלים בחירה מפורשת, ומכאן ההאטה המזדמנת." בחירה עם 255 אפשרויות אינה השוואה קדימה אחת; הספק נותן ניקוד ואז בוחר. אם אתם רואים שבקשה מול קבוצת תוויות גדולה לוקחת זמן ארוך באופן ניכר מ-noul, זה המנגנון המתועד, לא עומס.

איך קוראים לזה היום

A screenshot of the OrcaRouter model card for TypeSafe: Jev 1.13 at orcarouter.ai/models/typesafe/jev-1.13, showing the slug typesafe/jev-1.13, the byline 'by TypeSafe · 2026-09-24', the list price of $0.042 per million input tokens with output at $0.000000, a 65,536-token context and the single supported endpoint type systemone.

ב-OrcaRouter, המודל הוא typesafe/jev-1.13, בשם "TypeSafe: Jev 1.13" בקטלוג, עם context_length של 65,536 טוקנים ובדיוק סוג endpoint נתמך אחד: systemone. קוראים לו באמצעות POST /v1/systemone עם מפתח OrcaRouter שלך, תוך שליחת שדה model, שדה state (מחרוזת, אובייקט או מערך), ומפת questions שבה כל רשומה נושאת type (noul, choice או score), instructions ו-criteria שלה. התגובות הן מטען JSON מובנה יחיד ואינן נשלחות בזרימה — אין מצב זרימה שאפשר לבחור בו.

הניסוח של הכרטיס עצמו עבור החוזה הוא "טקסט נכנס, JSON מובנה יוצא", והמגבלות המפורסמות הן אלה שלפיהן יש לתכנן: ללא סטרימינג, עד בערך 64K אסימוני קלט על פני המצב והשאלות המשולבים יחד, כאשר בקשות שחורגות מהמגבלה הזו נדחות לפני שהן מגיעות למודל. רשומת הקטלוג מציינת את מחיר המחירון כ-$0.042 למיליון אסימוני קלט ומציגה את תעריף ההשלמה כאפס. אלה המספרים של הספק כפי שהם, ללא שינוי — הצורה היחסית של התמחור שלנו: 0% תוספת על תעריפי המחירון של הספק.

שני תקציבי טוקנים מסתובבים עבור המודל הזה והם אינם מתנגשים, לכן החזק אותם בנפרד. הנתון 65,536 הוא ה-context_length של הכרטיס ומתועד כבערך 64K של קלט הכוללים מצב בתוספת שאלות יחד. "בערך 32,000 טוקנים" שמאמרים קודמים של OrcaRouter מצטטים הוא תקציב המצב בלבד — המקום שהחומר שלך מקבל לפני שהשאלות לוקחות את חלקן. אם אתה מתקצב בקשה, תקציב המצב הוא המספר שמגביל את המטען שאתה בונה; הנתון המשולב הוא התקרה על הקריאה כולה.

מה שׁג'ב אינו יכול לעשות, בלשון פשוטה

הוא אינו יכול לכתוב פרוזה, לסכם, לתרגם או לנהל שיחה. זהו התכנון, ולא מגבלה שיש להתנצל עליה: בפוסט ההשקה נאמר ש-Jev "מוותר על יצירת מחרוזות", ובדף ה-jaggedness של TypeSafe עצמה מופיע "Generation" כדפוס כשל מכונה בשמו, ולצדו ההוראה "Use a generative model". יצירה כפויה היא איטית וגרועה. אם הצינור שלך זקוק לסיכום כתוב, Jev הוא הרכיב הלא נכון, ושום כמות של מלאכת פרומפטים לא תשנה זאת.

זה אינו תחליף למודל גנרטיבי. בתהליך העבודה שאליו שייך Jev יש שני מודלים: מודל גנרטיבי שקורא, כותב ומנמק בטקסט, ו-Jev שיושב לצידו ומבצע את הקריאות המוקלדות במילישניות. זו ההצגה הכנה של כל השוואת עלויות בדף הבית של הספק — העמודה "LLMs" אינה מתחרה שנדחקת הצידה, היא החצי השני של אותה מערכת, והסיבה שהשילוב מעניין היא שהחצי של קבלת ההחלטות נמצא כעת על אותו מפתח כמו החצי הגנרטיבי, ולא מאחורי חוזה משלו.

ו"מכוייל" אינו אומר נכון. פירושו שהמספר שמצורף לתשובה אמור להיות קריא כהסתברות. 0.62 על noul הוא המודל שאומר לך שהוא אינו בטוח, וזהו מידע שימושי שכן/לא חשוף היה הורס — וזו אינה הבטחה שה"כן" נכון. לוגיקת הסלמה שנבנתה על הביטחון היא התבנית המיועדת; התייחסות לתשובה כאמת מוחלטת אינה כן.

לקרוא את המספרים בכנות

A generated figures card titled 'Jev 1.13 - the numbers we measured' with six rows: median time to first token 151 ms; p95 time to first token 247 ms; output throughput about 349 tokens/second; error rate over the window 0.49%; tokens served over the window 76.2 million; daily median 175, 170, 163, 161, 170, 147, 143 ms. The footer reads 'OrcaRouter Playground, seven days ending 2026-09-30. TypeSafe's own multipliers are vendor-reported and unreplicated.'

כל נתון שירות בכרטיס שלנו מגיע מהתעבורה שלנו דרך ה-playground של OrcaRouter בחלון מתגלגל של שבעה ימים, ולא מהבנצ'מרק של הספק, והחלון זז בזמן שהמאמר הזה נכתב — התייחסו לזה כקריאה, לא כמפרט. עבור שבעת הימים המסתיימים ב-2026-09-30: חציון הזמן עד לאסימון הראשון 151 מ״ש, p95 247 מ״ש, תפוקת פלט בסביבות 349 אסימונים לשנייה, שיעור שגיאות 0.49%, ו-76.2 מיליון אסימונים שסופקו. ה-p50 היומי לאורך החלון עומד על 175, 170, 163, 161, 170, 147 ו-143 מ״ש — קו שמשתפר בעדינות. ה-p95 של 2,448 מ״ש בתאריך 09-28 הוא חריג חד-יומי אמיתי שיושב בתוך הסדרה הזו, ולצטט אותו כנורמה יהיה שגוי באותה מידה שהשמטתו לחלוטין תהיה לא ישרה.

הסתייגות נוספת לגבי נתון התעבורה: 349 אסימוני פלט בשנייה נשמע כמו תפוקה של מודל גנרטיבי, עד שנזכרים ש-Jev אינו מייצר טקסט מחולל. המדד מודד את מה שהסביבה הניסיונית שלנו סופרת בצד התגובה עבור מטען מובנה, והוא שימושי לזיהוי הידרדרות בין ימים ולא להשוואה בין Jev למודל צ'אט.

אלה המספרים שלנו. המספרים של הספק הם ה-193.6x, ה-444.6x, דוגמת החישוב של $0.000081 וההשוואה של 238x מול Claude Fable 5.1 — כולם של TypeSafe עצמה, אף אחד מהם לא שוחזר באופן בלתי תלוי, וכולם מוגבלים לפי הערות השוליים שלהם עצמם לזרימות עבודה של משימות ב-System One בלבד. טענת הביצועים האחת ש-TypeSafe מציגה, שאינה מבחן ביצועים כלל, ושהיא שווה יותר מהמכפילים, היא טענה מבנית: מכיוון שלתשובות יש טיפוסים, באינטגרציה אין שלב פרסינג ואין שלב אימות סכמה, וזו עלות שאינה מופיעה באף טבלת השהיה.

מה פתוח, ומה לא

נבדק בתאריך 2026-09-30, ארגון TypeSafe ב-GitHub פרסם אחד-עשר מאגרי קוד. אף אחד מהם אינו מכיל את Jev. אלה שחשובים למפתח שמשלב את המודל הם כולם תחת MIT או Apache-2.0: skills (MIT), system-one-adapter-python (MIT, מתואר כ"תחליף Drop-in ל-TypeSafeClient המגובה ב-API של LLM"), typesafe-sdk-js (MIT), typesafe-sdk-python (MIT), daggerverse (Apache-2.0), WorkflowEvals (Apache-2.0, עם קוד workflow שפורסם ב-evals.typesafe.ai), n8n-nodes-typesafe-ai (MIT), typesafe-ai.github.io ו-pulumi-clickhouse. מספרי הכוכבים ותאריכי ה-push משתנים, לכן אם אתם קוראים את זה מאוחר יותר, בדקו מחדש במקום לסמוך על הרשימה.

שלושה מהאחד עשר הם פורקים של פרויקטים לא קשורים ואינם מוכיחים דבר על האופן שבו Jev פועל: פורק של vLLM שהדחיפה האחרונה אליו בוצעה במאי 2025, פורק של LLaDA מיוני 2025 — LLaDA הוא שחרור של מודל שפה דיפוזיוני לא קשור — וספק Pulumi עבור ClickHouse Cloud. מפתה לקרוא ארכיטקטורה מתוך רשימת פורקים. אל תעשו זאת: שום דבר בתכנון של Jev לא נובע מאותם שלושה, ובפרט Jev אינו מודל דיפוזיה, עד כמה שנוכחותו של פורק LLaDA עשויה לרמוז על כך.

התשובה הכנה בת שורה אחת לשאלה "האם Jev הוא קוד פתוח" היא שהכלים פתוחים והמודל לא. זהו סידור רגיל עבור מודל חזית מתארח, וזהו הסידור שכדאי להניח כשאתה מתכנן סביב Jev: API עם מחיר מפורסם, חוזה מתועד ומספר פרמטרים שלא פורסם.

כאשר הספק אומר ש-Jev אינו אמין

TypeSafe מפרסמת עמוד jaggedness משלה עבור jev-1.13, שנבדק לאחרונה ב-2026-09-17, ומציינת היכן המודל נשבר. הוא גלוי לב באופן יוצא דופן וזה המקום הנכון להתחיל בו סעיף מגבלות, משום שזו רשימתו של הספק עצמו ולא של מתחרה:

• קריאה מילולית — היא לוקחת את הניסוח כפשוטו. מילות היקף, שלילות ותנאים משתמעים אינם מוסקים; היא "עונה על השאלה שכתבת, לא על זו שהתכוונת." התיקון של הספק הוא לכתוב את התנאי המדויק ואת הקריטריונים לכל אפשרות.

• מתמטיקה ומספרים — זה לא מחשבון, וזה לא סופר באופן מהימן. השאר חישובים בקוד.

• השוואת תאריכים ושעות — תאריכים נקראים כטקסט, ולא ככמויות מסודרות, ולכן סדר, פערים וחלונות זמן אינם אמינים, וחמור יותר עם פורמטים מעורבים.

• עקיפות — שלילות כפולות והסקה רב-שלבית מפחיתות את הדיוק. צמצמו שלבים והצביעו על המצב הרלוונטי.

• מצב גדול ומלא בפרטים לא רלוונטיים — תוכן לא קשור משמש כמסיח דעת והדיוק יורד ככל שהמצב גדל. סננו תחילה.

• תוכן עוין — המצב אינו מטופל כעוין, ולכן הוראות מוזרקות או מסגור מטעה עלולים להטות תשובות.

• הוראות וקריטריונים סותרים — כאשר השניים מבקשים דברים שונים, המודל "עלול להתבלבל."

• אינווריאנטים מבניים של הגיון בריא — P(noul) ו-1 − P(not noul) לא מובטחים להיות עקביים. שאל כל החלטה בכיוון אחד ואכוף זהויות בקוד.

• יצירה — כבר כוסתה, ועצתו של הספק עצמו היא להשתמש במודל גנרטיבי.

שניים מאלה ראויים להדגשה. זה העוין חשוב מפני שהצעת הערך כולה של Jev היא לשפוט חומר שאינו מהימן, ומצב שמכיל הוראות יכול להזיז תשובה; אם המצב שלך מגיע ממשתמשים, זהו משטח להזרקת פרומפטים באותה צורה כמו כל משטח אחר. זה של האינווריאנטים המבניים חשוב מפני שמודל "מכויל" מזמין אותך לעשות חשבון על ההסתברויות שלו, והספק אומר לך לא להניח שהחשבון נסגר.

למה מתחייב פוסט ההשקה, ולמה הוא לא מתחייב

A screenshot of TypeSafe's own launch post, headed 'Introducing System One Models & Jev' and dated Sep 15, bylined 'Diogo Almeida, founder, TypeSafe', showing the opening paragraphs that frame the model as a frontier-intelligence function call taking unstructured state in and returning typed probabilistic decisions out.

כמעט כל טענה של ספק המצוטטת בכתבה הזו מובילה בחזרה לעמוד אחד: ההודעה של TypeSafe עצמה, שמופיעה תחת "חדשות החברה" ומתוארכת ל-2026-09-15, חתומה בידי המייסד דיוגו אלמיידה. קריאה ישירה בו שווה את שתי הדקות, מפני שהניסוח של שורה אחת קובע את התנאים לכל מה שבא מאז. "המודל הציבורי הראשון שלנו הוא Jev, זמין היום בגישה מוקדמת." "גישה מוקדמת" היא תיאורו של הספק עצמו לזמינות בפלטפורמה של הספק עצמו, והיא הצהרה צרה יותר מכפי שהיא נראית — היא מחייבת את TypeSafe לספק את המודל למשתמשים מאושרים, ואינה אומרת דבר על מי עוד רשאי לספק אותו. זה בדיוק הפער שסגרה התוספת לקטלוג מ-2026-09-24, והסיבה שכרטיס המודל חשוב יותר מהפוסט לכל מי שמעריך את Jev היום.

אותו עמוד גם ברור באותה מידה בנוגע לגבולותיו שלו, ולכן הוא מצוטט ולא מנוסח מחדש לעיל. הוא אינו מפרסם מספר פרמטרים, אין בו תיאור ארכיטקטורה מעבר ל"ארכיטקטורת מודל חדשה", אין חישוב אימון ואין מאגר משקולות, והוא אינו נותן תאריך או תנאים לזמינות כללית. ההיעדרויות האלה הן אילוצי התכנון: API עם מחיר מפורסם מצד אחד, וסטאק שאין לך אפשרות לבחון את פנימיותיו מצד אחר. הפוסט גם מציג את המודל בכנות מספקת כדי שיהיה שימושי כמפרט — "קריאת פונקציה של בינה חזיתית: מצב לא מובנה נכנס, החלטות הסתברותיות עם טיפוסים יוצאות" — וזהו המשפט היחיד בו שמתאר את הממשק ולא את השאיפה.

שאלות שממשק זה מעורר

מה קורה כאשר סט האפשרויות גדול מ-255 אפשרויות? זה מוגבל — 255 אפשרויות מתויגות הן התקרה בשאלת בחירה, והגישה הדו-שלבית של הספק — ניקוד ואז בחירה — היא מה שנעשה ככל שהקרדינליות עולה, וזה גם המקור המתועד להאטות מדי פעם בסטים גדולים של תוויות. אם הטקסונומיה שלך גדולה מכך, התשובה העיצובית היא לפרק אותה לכמה שאלות ולחבר מחדש בקוד, וזו אותה עצה ש-TypeSafe נותנת לשיפוטים מורכבים.

האם ההקשר של 65,536 טוקנים משמעו 65,536 טוקנים של מצב? לא. התקציב המפורסם הוא כ-64K טוקנים בסך הכול עבור המצב וכל השאלות יחד, והנתון "כ-32,000 טוקנים" שמופיע בסיקורים ישנים יותר הוא תקציב המצב בלבד. תכננו את המטען שלכם לפי נתון המצב, ולא לפי הנתון המשולב, וזכרו שבקשות החורגות מהמגבלה נדחות לפני שהן מגיעות למודל.

מה לעשות עם זה

Jev 1.13 שווה להסתכל מסיבה אחת ספציפית ולא מסיבה כללית. אם יש לך שלב בצינור שלך שכרגע הוא מודל צ'אט שמתבקש להחזיר תווית וסומכים עליו שיחזיר אותה בצורה הנכונה — ראוטר, מדרג, בדיקת מדיניות, ציון רובריקה המיושם על אלפי רשומות — השלב הזה הוא מה שהמודל הזה מחליף, במחיר של $0.042 למיליון טוקנים בקלט, כששום דבר לא נמדד בצד הפלט. אם יש לך שלב שזקוק לתשובה כתובה, Jev אינו הכלי, והספק שלו עצמו אומר זאת.

הדבר שהשתנה בשבוע האחרון הוא לא המודל. אלא העובדה שלנסות אותו חדלה לדרוש קשר עם ספק נוסף. לפני שמונה ימים הערכה של Jev חייבה חשבון נפרד ואינטגרציה נפרדת; היום זה מזהה מודל אחד על מפתח שכבר מגיע ל-200+ מודלים, כשמחיר המחירון של הספק מועבר ללא שינוי והתשובות המוקלדות חוזרות מאותו מקום כמו כל השאר. עבור מודל יוצא דופן כל כך, היכולת לבדוק אותו מול התוויות שלך בלי להתחייב לחוזה חדש היא עיקר ההחלטה.