
"System One" כקטגוריית מודל: היכן Jev 1.13 נמצא בה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 349 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 208 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
"System" הוא המונח הקטגוריה ש-TypeSafe משתמשת בו לתיאור מודל שמחליט ומודל שכותב, ו-Jev 1.13 (typesafe/jev-1.13) הוא אחד מחבריה — מודל שמחזיר תשובות עם טיפוסים במקום משפטים. זה לא מודל חדש. TypeSafe שחררה את Jev ב-2026-09-24, והעמוד הזה אינו מאמר השקה: המודל בן חמישה עשר ימים, ומחוץ לחלון שבעת הימים שהבלוג הזה כותב עליו. מה שקרה בתוך אותו חלון הוא ש-Orca הוסיפה את המודל לקטלוג שלה ב-2026-10-01 ופתחה את כרטיס המודל של Jev 1.13 בכתובת https://www.orcarouter.ai/models/typesafe/jev-1.13 — הפעם הראשונה שניתן לקרוא לו דרך שער של צד שלישי ולא רק דרך נקודת הקצה של TypeSafe. רעיון הקטגוריה הוא הסיבה שהעמוד הזה קיים; השינוי בזמינות הוא הסיבה שהוא נושא תאריך.
הגרסה הפשוטה של הקטגוריה: שואלים שאלה ל-LLM והוא כותב תשובה שאדם יקרא. שואלים שאלה למודל System One והוא מחזיר ערך שתוכנית תסתעף לפיו. הניסוח של TypeSafe עצמה הוא ש"LLMs מייצרים מילים עבור אנשים" בעוד "Jev מייצר החלטות עם טיפוסים והוא דומה יותר לקוד: אמין, מהיר, עקבי עם עצמו ובטוח מבחינת טיפוסים." המשפט הזה הוא כל הקטגוריה דחוסה לסעיף אחד, וכדאי לפרק אותו לאט, כי ארבעת שמות התואר עושים כמויות שונות של עבודה ואחד מהם עושה יותר מהאחרים.
מה ש"יותר כמו קוד" בעצם טוען
קח את ארבע הטענות לפי הסדר, כי הן אינן ארבע אמירות חוזרות של ״זה טוב יותר״.
• Reliable — the output shape is fixed in advance. You declare the question; the answer can only come back as one of the values you allowed. TypeSafe states plainly that "the model never makes type errors," and notes this is the one claim of theirs that is "mathematically impossible" to falsify with a counter-example, because a value that is not in your declared set is not a value the model can emit.
• מהיר — כל התשובות מופקות במעבר אחד ולא טוקן אחר טוקן. בפוסט ההשקה של TypeSafe זה מנוסח כך: ״Jev פולט את כל ההסתברויות במקביל במקום לייצר באופן אוטורגרסיבי טוקן אחר טוקן.״ בחלון השירות שלנו בן שבעת הימים המסתיים ב-2026-09-30, החציון של הזמן לטוקן הראשון ב-typesafe/jev-1.13 הוא 151 מילישניות וה-p95 הוא 247 מילישניות.
• עקבי עם עצמו — אותו מצב עם אותן שאלות נוטה להפיק את אותן תשובות. אנלוגיה מתחום התכנות היא מה שהופך את זה למובן, אבל זה גם המקום שבו האנלוגיה מפסיקה להיות הוכחה: הדטרמיניזם של מהדר הוא תכונה של הבנייה שלו, ואילו כאן מדובר בטענה על התנהגות. המדידות שלנו עצמנו הן הקריאה הכנה בנושא — שיעור השגיאות בתעבורת ה-playground שלנו באותו חלון של שבעה ימים הוא 0.49%, כך שזה עקבי עם עצמו כמו שפונקציה טובה עקבית עם עצמה, ולא כמו שחשבון הוא עקבי.
• בטוח-טיפוסית — וזה הפריט שנושא את המשקל הרב ביותר. "בטוח-טיפוסית" אינו תואר איכות כאן; זוהי הצהרה על מקומו של המודל ביחס לבודק טיפוסים. בצינור גנרטיבי רגיל מערכת הטיפוסים מתחילה אחרי שהמודל מסיים: המודל כותב טקסט, מפרסר מנחש את הצורה, מאמת בודק אותה, ומסלול כשל מטפל במקרים שבהם הניחוש היה שגוי. מודל System One מעביר את הצהרת הטיפוסים לשלב שלפני הקריאה. שלושת הפרימיטיבים שהכרטיס שלנו מתעד הם מערכת הטיפוסים: noul, הכרעת אמת/שקר המוחזרת עם הסתברות מכוילת; choice, תווית אחת הנבחרת מתוך עד 255 אפשרויות מתויגות; וscore, דירוג על סולם סדור של 2 עד 10 רמות. אתה בוחר את הפרימיטיב, אתה מספק את התוויות או את הקריטריונים, והערך שמוחזר נשאב מתוך אותה קבוצה.
TypeSafe אכן מפרסמת הבדל אחד בין התיעוד שלה לבין שלנו שראוי להצהיר עליו במקום ליישב אותו: התיעוד של הספק מציג דוגמה ל-Score באינדוקס מאפס, בעוד שהכרטיס שלנו מתעד את הסולם כבעל 2 עד 10 רמות. שניהם מתארים את אותו פרימיטיב. אם אתה בונה סף, קרא את העמוד של הספק כדי לדעת את האינדוקס המדויק שבו נמצא ה-SDK שלך.
שני מצבי הכשל שמפסיקים להתקיים
ההשלכה המעניינת של "ללא פרוזה" אינה אסתטית. היא בכך ששני הכשלים השולטים בצינורות ייצור גנרטיביים נעדרים מהעיצוב הזה, במקום להיות ממותנים על ידו.
סחיפת פורמט היא הראשונה. מודל LLM שמקבל הוראה להחזיר JSON מחזיר JSON ברוב הפעמים, ובשאר הפעמים משהו שסמוך ל-JSON — הערה בסוף, גדר Markdown, שדה ששמו הוחלף במילה נרדפת, אובייקט מקונן במקום שבו הסכימה דרשה מחרוזת. התיקונים ברמת הפרומפט (הוראות חזקות יותר, דוגמאות few-shot, סכימה בהודעת המערכת) הם כולם ניסיונות להחזיק צורה שהמודל חופשי לזנוח, מפני שהצורה היא בקשה, לא אילוץ. המסגור של TypeSafe מבהיר את הניגוד: עם מחרוזות, "פלטים אפשריים ומבנה" מתבקשים והתגובות "צריכות לעבור פרסור + ולידציה", עם "סיכון תמידי שה-AI יורד מהפסים". כאשר הפלטים האפשריים מוצהרים מראש, לסחיפה אין לאן ללכת.
פלט שאינו ניתן לניתוח הוא השני, והוא בעצם אותו כשל ברגע גרוע יותר — לא שדה שחזר שגוי במקצת, אלא תגובה שהמנתח אינו יכול לקרוא כלל, שמגיעה בנקודה הפחות נוחה בתהליך עבודה. למודל שמפיק ערך בעל טיפוס אין מצב כזה.
זהו טיעון מבני, ויש להציגו ככזה. הוא אינו אומר דבר בשאלה אם תשובה בודדת נכונה — שאלת בחירה יכולה לבחור בתווית הלא נכונה, ו-noul יכול להחזיר אמת בביטחון גבוה כשהתשובה הכנה היא שקרית. מה שנעלם הוא קטגוריית הכשל שמפרסר היה תופס. זהו צמצום ממשי ושימושי, והוא אינו אותה טענה כמו "התשובות נכונות".
למה המחיר הוא צורה, לא הנחה
המודל מתומחר ב-$0.042 למיליון טוקנים בקלט, כשהפלט מחויב באפס — והאפס הזה אינו תעריף מבצעי, אלא תוצר של העיצוב. למודל שמפיק שלושה טוקנים של תשובה מובנית אין נפח פלט למדוד, ולכן לתמחור לפי טוקן פלט אין למה להתחבר. צורת החיוב היא חיוב לפי טוקן קלט והחלטה. הקטלוג שלנו מעביר את מחיר המחירון של הספק הלאה בתוספת של 0%, כך ש-$0.042 הוא המספר של TypeSafe ולא מספר שאנחנו קבענו, ושינוי מחיר מצד ספק היה נכנס לתוקף באותו יום.
הצב את שתי הצורות זו לצד זו וההבדל אינו באחוזים. העלות של צינור גנרטיבי משתנה בהתאם לכמה שהמודל אומר: תשובה מפורטת עולה יותר מתשובה תמציתית עבור אותה החלטה, ומודל חשיבה מסוג chain-of-thought מחייב בעבור הטוקנים שהוא מוציא על חשיבה לפני שהוא עונה, בין אם התשובה משתפרת ובין אם לא. העלות של קריאה ל-System One משתנה בהתאם לכמה שאתה מראה לו — המצב והשאלות. שאל שאלה אחת מול מסמך ארוך ואתה משלם עבור המסמך. ארוז ארבעים שאלות מול אותו מצב (תקציב הקלט בכרטיס שלנו הוא 65,536 טוקנים בסך המצב והשאלות המשולבים, בערך 64K; אם ראית נתון של "בערך 32,000 טוקנים" במאמרים קודמים של OrcaRouter, זהו תקציב המצב בלבד, לא סך מתחרה) ואתה משלם עבור המסמך פעם אחת ומקבל ארבעים החלטות בחזרה.
זו הסיבה לכך שעלות-לכל-החלטה, ולא עלות-לכל-טוקן, היא היחידה הנכונה עבור סוג זה — ובגללה המונה רץ בכיוון ההפוך ממה שרוב הצוותים מצפים. המהלך הטיפוסי להפחתת עלויות גנרטיביות הוא "לגרום למודל לומר פחות". כאן אין מה לומר פחות.

המספרים של TypeSafe עצמה, אשר מדווחים על ידי הספק ולא שוחזרו באופן בלתי תלוי, מכוונים ישירות להשוואה הזו: "מהיר פי 193.6, זול פי 444.6," עם הערת שוליים "מבוסס על תהליכי עבודה עבור משימות System One (הוכחה)," עם דוגמה מחושבת: "TypeSafe AI עלות $0.000081 הושלם ב-0.114 שניות / LLMs עלות $0.013880 הושלם ב-8.566 שניות." דף הבית גם מפרט "$42 למיליארד אסימוני קלט" לעומת "מחיר קלט נמוך פי 238 מאשר Claude Fable 5.1." התייחסו לכל זה כאל הטיעון של הספק, לא כתוצאה מדודה: פוסט ההשקה מודה ש"ההערכות המפורסמות שלנו בדרך כלל מורצות מהמחשבים הניידים שלנו בחוף המערבי", ומודה ש"אנחנו לא יכולים להוכיח שזה לא מסובסד; נצטרך את הטווח הארוך כדי להוכיח את הקיימות של התמחור שלנו (שאנו מצפים שירד, לא יעלה)." שתי הוויתורים האלה הם של הספק עצמו, והם המסגרת הנכונה לכל מכפיל בדף.
כיול הוא המחצית השנייה של הרעיון.
אם הקטגוריה הייתה רק "פלט מובנה", היא הייתה מתארת קריאה לפונקציה עם שלבים נוספים. החלק שהופך אותה לדבר בפני עצמו הוא שכל תשובה מגיעה עם הסתברות, וההסתברויות הן יעד האימון. TypeSafe מכנה את השיטה Reinforcement Learning for Calibrated Decisions (RLCD) — מונח שלהם, לא ראשי תיבות גנריים — וטבלת ההשוואה בפוסט ההשקה מציבה אותה לצד RLHF ו-RLVR: RLHF ממטב את מה שמדרגים אנושיים מעדיפים, RLVR עבור פלטים הניתנים לבדיקה פרוגרמטית, ו-RLCD עבור "תשובות עם הסתברויות כנות מבחינה אפיסטמית במשימות System One".
ההבדל המעשי הוא לשם מה נועדה ההסתברות. בצינור גנרטיבי, אומדן הביטחון הוא יצירה שנייה: אתה שואל את המודל עד כמה הוא בטוח, והוא כותב מספר, שהוא עצמו פרוזה עם אותן נקודות כשל. כאן ההסתברות חוזרת יחד עם ההחלטה, באותה מעבר, והיא הדבר שלפיו אתה מסתעף. המסגור של TypeSafe עצמה לגבי התמורה הוא שמודל שמסוגל לבצע משימה ב-95% מהמקרים אבל "לא אומר מתי הוא נמצא ב-5%" לא יכול לשמש כדי לאוטומט את המשימה; הביטחון נותן לך מקום לשים בו את ההסלמה, לאדם או למודל הסקה.
בדף הבית של TypeSafe זה מתואר כ"אפס הזיות", עם הסבר שכל החלטה נושאת אומדן ביטחון כך שתוכנה יכולה "לפעול כשהביטחון גבוה ולהסלים כשהוא אינו כזה". קראו זאת בתשומת לב: זוהי טענה לגבי אומדני ביטחון, לא טענה שאף תשובה לעולם אינה שגויה. הכרטיס שלנו הוא משקל הנגד — שיעור שגיאה של 0.49% על פני שבעת הימים שהסתיימו ב-2026-09-30, בתעבורה שלנו, כפי שנמדד על ידינו. הנתון הזה הוא חלון מתגלגל, לא סט בדיקות קבוע: הוא הצביע על 0.57% כמה ימים קודם לכן באותו חלון, והוא יזוז שוב.
במקום שבו System One יושב לצד System Two
אוצר המילים "מהיר/איטי" קדום בהרבה ל-TypeSafe. הוא מגיע מלחשוב, מהר ולאט של קהנמן, והוא הושאל בידי חוקרי בינה מלאכותית במשך שנים לפני כן — התווית "מערכת 2" הוצמדה למודלים של שרשרת מחשבה והסקה מכוונת הרבה לפני ש-TypeSafe היה קיים, ו-TypeSafe אינה טוענת שטבעה אף אחד משני המונחים. מה שהם כן עשו הוא להחיל את ההבחנה על גבול של מוצר ולא על מצב של פרומפט.
• מודל הסקה מסוג System Two משקיע יותר מחשוב לפני שהוא עונה, ומשתפר בבעיות שזקוקות לכך. הפלט שלו הוא עדיין פרוזה, והמחשוב הנוסף מחויב כטוקני פלט.
• מודל System One במובן של TypeSafe אינו חושב זמן רב יותר כדי להשיב טוב יותר. הוא משיב במעבר אחד, ומה שהוא מוותר עליו לשם המהירות הוא היכולת להפיק דבר מלבד ערך מטופס.
• השניים משלימים זה את זה בתהליך עבודה, ולא יריבים בהשוואה. קריאה של System One מטפלת בהחלטות שחייבות להיות מהירות, זולות וברורות; מודל החשיבה מקבל את המקרים שציון הביטחון סימן כלא-ודאיים. הפלט עם טיפוסים הוא מה שהופך את ההעברה לחלקה — אתה מעביר ערך והסתברות לשלב הבא, ולא משפט שצריך לפרסר מחדש.
המקום שבו אוצר המילים נעשה חלקלק הוא ביחס ל„דגם System One” כאל קטגוריה מבוססת שספקים אחרים אימצו. אין לכך שום ראיה, ואין לקרוא את העמוד הזה כטוען זאת. TypeSafe משתמשת במונח עבור סוג הדגמים שלה עצמה; כתב הוויתור בכרטיס שלנו אומר את אותו הדבר מעצם השמטתו, כשהוא מפרט סוג נקודת קצה אחת עבור דגם אחד. אם מעבדה אחרת תתחיל להשתמש בביטוי עבור אותה ארכיטקטורה, זו תהיה עובדה שראויה לדיווח, והיא תזדקק למילים שלה עצמה כדי לדווח עליה.

הכרטיס שלנו מפרט גם את המשוננות כחלק מגבול הכנות ולא כהפתעה: תשעה מצבי כשל מכונים. פריטי הקריאה המילולית וההפניה העקיפה הם אלה שנובעים ישירות מאנלוגיית "יותר כמו קוד" — מודל שעונה על השאלה שכתבת ולא על זו שהתכוונת אליה מתנהג כמו פונקציה שעשתה בדיוק את מה שהקוד אמר. פריט הספירה אינו כזה. מודל ש"מזהה את הצורה של תשובה במקום לספור" אינו דומה לקוד כלל, ולכן ההמלצה של TypeSafe עצמה היא לספור בקוד, ובמקום שבו באמת נדרש שיקול דעת, לשאול שאלה אחת לכל פריט ולחבר את התשובות בעצמך.
שתי מגבלות שמעצבות את העיצוב, לא את הציון
שניהם מגיעים מאותו מקום: אין מחרוזות משמעו שאין מה להזרים ושאין מה לשלוח בחתיכות.
• ללא סטרימינג — הפלט הראשון הוא התשובה המוגמרת, ולכן קריאה של System One היא תגובה בודדת, לא זרם. השאלה אינה אם הוא יכול לבצע סטרימינג, אלא מה היה זורם.
• צורת בקשה אחת — המודל מוגש דרך POST /v1/systemone בקטלוג שלנו ולא בצורת chat-completions, וזו הגרסה הכנה של טענה ישנה יותר שהוא "מדבר בצורת בקשה משלו". זהו הבדל אמיתי באופן שבו קוראים לו: אובייקט מצב ומפה של שאלות בעלות שם נכנסים; תשובה מובנית לכל שאלה יוצאת. תכתוב ממפה עבורו, ומכיוון שהפלט טיפוסי, הממפה הוא כל האינטגרציה — אין מתחתיו שכבת פרסור הגנתית.
כדאי לדעת לפני שמבצעים בדיקת עומס: השהיה אינה אחידה בין סוגי שאלות. TypeSafe מסבירה מדוע, במילותיה שלה — "עבור בחירות בעלות קרדינליות גבוהה יותר, אנו מבצעים מערכת דו-שלבית של ניקוד בנפרד ואז קבלת בחירה מפורשת, ומכאן ההאטה המזדמנת." החלטת ניתוב עם 4 אפשרויות וסיווג עם 200 אפשרויות הם אותו פרימיטיב על הנייר אך כמויות עבודה שונות בפועל. החציונים היומיים שלנו על פני שבעת הימים המסתיימים ב-2026-09-30 הם 175, 170, 163, 161, 170, 147, 143 ms. יום אחד בסדרה הזו, 2026-09-28, היה עם p95 של 2,448 ms — חריג אמיתי של יום בודד שנמצא בסדרה ביושר, אך אינו הצורה של השירות.

הדבר האחר שצריך לדעת לפני אינטגרציה ראשונה הוא למה אתם מתחברים. הכלים סביב Jev הם בקוד פתוח תחת רישיונות MIT ו-Apache-2.0 — ערכות ה-SDK של Python ו-JavaScript, מתאם שמציג את אותו לקוח כשמאחוריו ממשקי API רגילים של LLM, הקוד של workflow-evals, ואוסף של כישורי סוכנים, הכול במאגרים הציבוריים של TypeSafe, עם מספרי כוכבים ותאריכי דחיפה שהתעדכנו לאחרונה כבר ב-2026-09-26 וב-2026-09-29. המודל לא. אין מאגר משקלות: הארכיטקטורה של Jev, מספר הפרמטרים, מחשוב האימון והמשקלות שלו לא פורסמו, וקורא שבודק זאת לא צריך שיטעו אותו שלושת המאגרים בארגון הזה, שהם פורקים של פרויקטים לא קשורים — פורק של vLLM, מהדורה של מודל שפה דיפוזיוני מ-2025, וספק Pulumi. אף אחד מהם לא אומר דבר על האופן שבו Jev בנוי. התשובה בשורה אחת היא שהכלים פתוחים והמודל לא.
מריצים אותו היום, ומה משתנה עבור הקורא
Jev 1.13 נמצא ב-OrcaRouter בתור typesafe/jev-1.13, נגיש באותו מפתח כמו יותר מ-200 מודלים אחרים, כאשר מחיר המחירון של הספק מועבר הלאה במרווח של 0%. הערך המעשי של זה בעמוד העוסק בקטגוריה הוא מצומצם וראוי להציגו במדויק: ניסיון של מודל System One כבר לא מצריך חשבון נפרד, מפתח נפרד וחשבונית נפרדת עבור מודל שאולי עדיין אינך יודע שברצונך בו. הוא יושב לצד החצי הגנרטיבי של אותו תהליך עבודה — המסווג והכותב על אישור אחד, במקום אחד, עם הספירות של מה שקראת לו בפועל.
שום דבר כאן לא משנה מהו המודל. הוא הושק ב-15 בספטמבר 2026 ו-TypeSafe עדיין מתארת אותו כגישה מוקדמת; מהותו לא השתנתה מאז. מה שהשתנה ב-24 בספטמבר 2026 הוא שהקורא יכול כעת לגלות מה זה עולה לו בפועל בלי להתחייב תחילה לקשר עם ספק שני. אם חיכיתם לראות אם הקטגוריה שווה אב-טיפוס, זה הדבר שהשתנה.
