כרטיס גיבור שנוצר בכותרת 'מה זה TypeSafe AI?' עם כתובית המשנה 'המעבדה שמאחורי Jev 1.13 - החלטות טיפוסיות, לא פרוזה', מעל שלוש שורות מסומנות: 'חברה: TypeSafe AI, סן פרנסיסקו', 'מודל: Jev 1.13 (typesafe/jev-1.13), הושק ב-2026-09-15' ו'מנותב ב-OrcaRouter מאז 2026-09-24'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

מהי TypeSafe AI? המעבדה שמאחורי Jev 1.13 מקבלת החלטות, לא משפטים

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

TypeSafe AI הוא מעבדה קטנה בסן פרנסיסקו שמוכרת מודל שלא יכול לכתוב משפט, ו-Jev 1.13 (typesafe/jev-1.13) הוא המודל המדובר. הוא מקבל פיסת מצב — הודעת דוא"ל, שורת לוג, פנייה לתמיכה, בלוב JSON — יחד עם קבוצה של שאלות בעלות שמות, ומחזיר תשובה אחת עם טיפוס לכל שאלה, כל אחת עם ערך ביטחון משלה. אין פרוזה, אין קוד, אין הסבר, ואין תיבת צ'אט. המודל עצמו הושק ב-2026-09-15, כך שהוא אינו חדש ואין כאן סיפור השקה: הדף הזה קיים בגלל שינוי קטן יותר שניתן לתארך. ב-2026-09-24, OrcaRouter הוסיפה את typesafe/jev-1.13 לקטלוג שלה ופתחה את כרטיס המודל בכתובת משל עצמה, וזו הייתה הפעם הראשונה שאפשר היה לקרוא ל-Jev דרך שער צד שלישי ולא רק דרך נקודת הקצה של TypeSafe עצמה. זה האירוע, הוא בן שישה ימים נכון ל-2026-09-30, וזו הסיבה לכך שקורא שאין לו כבר חוזה עם TypeSafe יכול כעת לשים מודל של System One על אותו מפתח כמו המודלים הגנרטיביים שאיתם הוא אמור לשבת זה לצד זה. כל השאר בדף הזה הוא רקע על החברה שיצרה אותו.

ההצגה הכנה של התזמון, כי היא חשובה לשאלה כמה מזה מאומת: Jev הושק לפני יותר משבועיים וזמין באופן כללי מאז 2026-09-21, כאשר TypeSafe הסירה את רשימת ההמתנה שלה. מה שנמצא בתוך חלון שבעת הימים הוא שינוי הניתוב, לא המודל. אם הגעתם לכאן בציפייה לסקירת השקה, ההשקה כבר התרחשה, וכמה כתבות אחרות סיקרו אותה.

עמוד חברה עם מניפסט וללא תרשים ארכיטקטורה

TypeSafe מתארת את עצמה, בתיאור המטא שלה, כ"מעבדת AI שבונה תשתית אינטליגנציה ילידת-מכונה לאוטומציה", עם מערכות "שמתוכננות לקבל החלטות בתוך תוכנה". בדף הבית שלה מוטבע Version 0.01 ובתחתיתו נכתב "Made in SF". יש מניפסט הטוען שהנתיב הקצר ביותר לשינוי כלכלי בצורת AI עובר דרך הפיכת האינטליגנציה לקומפוזבילית, כך שתוכנה תוכל להפעיל שיפוט סמנטי כפי שהיא מפעילה פונקציה; התמצית של החברה עצמה לגבי תוכניתה היא לשחרר את הצורה של AI קומפוזבילי יליד-מכונה, ואז להפוך אותו למהימן מספיק לאוטומציה אמיתית, ואז להציע אבסטרקציות ברמה גבוהה יותר, יציבות מספיק כדי לבנות עליהן שכבות. הסלוגן שלה הוא "אנחנו בונים פרודקשן, לא אלוהים." דף הצוות מציין שלושה מייסדים — דיוגו אלמיידה כ-CEO, סשה שנג כ-COO ואריק גפני כ-CTO. זה כל מה שהחברה אומרת על עצמה: עמדה, מוצר, שלושה שמות, ובלי מספרים על החברה עצמה.

מה שהאתר אינו כולל הוא הדבר הראשון שמהנדס המעריך תלות חדשה יחפש. אין דף ארכיטקטורה, אין מספר פרמטרים, אין גילוי על מחשוב האימון, ואין כרטיס מודל במובן האקדמי. לוח הבנצ'מרקים של TypeSafe עצמה עדיין מסומן כממתין. עבור חברה שהמסר שלה נשען על אמינות, היקף הגילוי דל, וזו עובדה על מה שפורסם ולא האשמה על מה שמוסתר.

A headless-browser capture of the TypeSafe AI homepage as it stood on 2026-09-30. A navigation bar reads 'TypeSafe AI | Manifesto | Our Team | Docs | Sign In'. Under it a banner announces 'NO MORE WAITLIST / TypeSafe is now open to everyone' above a 'Create your account' button, next to a blog teaser reading 'TypeSafe announces System One models and Jev' with a 'Read more' link. Lower down, a section headed 'Introducing Jev - the First Public System One Model: Jev Gives AI The Properties Of Code' appears beside a 'Join Discord' button and the tagline fragment 'Intelligence beyond chat'.

System One: הקטגוריה, ומדוע השם שאול

Jev הוא הראשון מבין מה ש-TypeSafe מכנה מודלים של System One. השם מגיע מהחלוקה של דניאל כהנמן בין חשיבה מהירה ואינטואיטיבית של System 1 לבין חשיבה איטית ומכוונת של System 2, ופוסט ההשקה של החברה אומר זאת ישירות — הוא גם מודה של"חשיבת System 1" נשאה נימה של נטייה לטעויות, וטוען שניתן להפוך את המודלים האלה לאמינים יותר מהחלופות. TypeSafe לא טבעה את המונח ולא מחזיקה בו.

התוכן המעשי של הקטגוריה הוא חלוקת עבודה מכוונת: מודל שמחליט ומודל שכותב. את החשבון, סידור התאריכים, הספירה והשוואת המחרוזות יש להשאיר בקוד רגיל, שבו הם מדויקים, ואת השיקול הסמנטי להעביר ל-Jev. שלושה סוגי שאלות שהוא יכול להשיב עליהן:

noul — הכרעת אמת/שקר, המוחזרת עם הסתברות מכוילת.

• בחירה — בחר אחת מתוך עד 255 אפשרויות מתויגות

• ציון — דרג בסולם סדור; הכרטיס שלנו מפרסם 2-10 רמות, והתיעוד של TypeSafe עצמו מציג דוגמה עם אינדקס התחלתי 0, לכן התייחס לרמות של הספק כהגדרה ול-2-10 כאל מה שהכרטיס מפרסם

לכל שאלה יש הוראות משלה, ולגבי בחירה וניקוד — קריטריונים משלה. בקשות מעל כ-64K אסימוני קלט נדחות לפני שהן מגיעות למודל, והתגובות אינן מוזרמות. הספק מתעד בנפרד את תקציב המצב — המצב בתוספת השאלה הארוכה ביותר — ב-32K אסימונים, שהוא נתון צר יותר מההקשר של 65,536 אסימונים המופיע בכרטיס, ואינו מהווה סתירה לו.

התזה שלהם, במילים שלהם

TypeSafe מנסחת את התזה טוב יותר מכל סיכום, אז הנה היא מילה במילה: "LLMs מייצרים מילים עבור אנשים. Jev מייצר החלטות עם טיפוסים ודומה יותר לקוד: אמין, מהיר, עקבי עם עצמו ובטוח מבחינת טיפוסים." שיטת האימון שמאחורי זה היא גם שלהם, וזהו מונח שראוי לייחס להם, בדיוק משום שהוא אומץ במקומות אחרים כאילו היה מונח גנרי. TypeSafe מכנה אותו Reinforcement Learning for Calibrated Decisions, או RLCD, ומעמידה אותו בניגוד ל-RLHF ול-RLVR: בעוד שאלה מייעלים העדפה אנושית או תגמולים הניתנים לאימות באופן פרוגרמטי, RLCD מכוון, בלשון החברה, ל"תשובות עם הסתברויות כנות מבחינה אפיסטמית במשימות System One". התייחסו ל-RLCD כמונח שטבעה TypeSafe בעצמה, ולא כראשי תיבות מבוססים בספרות.

המספרים שהם פותחים איתם, ומי בחר את עומס העבודה

דף הבית מוביל עם "מהיר פי 193.6, זול פי 444.6", עם הערת שוליים לתהליכי עבודה עבור משימות System One. מתחת לכך מוצגת דוגמה מעובדת: TypeSafe AI ב-$0.000081 וב-0.114 שניות לעומת LLMs ב-$0.013880 וב-8.566 שניות. בהמשך, "$42 למיליארד טוקני קלט. מחיר קלט נמוך פי 238 מזה של Claude Fable 5.1." ופרק שכותרתו "אפס הזיות", שלאחר בחינה מתגלה כטענה על אומדני ביטחון ולא כהוכחה לאפס שגיאות: כל החלטת Jev נושאת הערכת ביטחון, כך שתוכנה יכולה לפעול כשהביטחון גבוה ולהסלים כשהביטחון אינו גבוה. כל ארבעת הנתונים הם נתונים של TypeSafe, על עומסי עבודה ש-TypeSafe בחרה, ואף אחד מהם לא שוחזר באופן בלתי תלוי. פוסט ההשקה עצמו אומר שהצוות מצפה שה-193.6x וה-444.6x שלו ימוקמו בקצה הגבוה של השיפורים בעולם האמיתי, ומציין שתהליכי העבודה נבנו על ידי צוות היכולות שלה, עם תשובות ייחוס שהופקו על ידי מודלים מתחרים. נתוני השירות שלנו בני שבעה ימים על אותו מודל מציבים את שיעור השגיאה על 0.49%, וזהו מדד אחר על עומס עבודה אחר ומהווה את משקל הנגד הכנה לקרוא "אפס" כמוחלט.

מה שהם לא פרסמו

הארכיטקטורה של Jev, מספר הפרמטרים, משאבי החישוב לאימון והמשקלים לא פורסמו, ואין מאגר משקלים בארגון ה-GitHub של החברה. נבדק בתאריך 2026-09-30; לאותו ארגון יש אחד עשר מאגרים ציבוריים; המשמעותיים שבהם הם כלי עבודה, כולם ברישיון MIT או Apache-2.0 — מאגר agent-skills, SDK של Python, SDK של TypeScript, מתאם לקוח drop-in המגובה בממשקי API של LLM אחרים, אוסף מודולי Dagger, קוד workflow-eval שפורסם, צומת n8n, והאתר של הארגון עצמו. מספרי הכוכבים ותאריכי ה-push משתנים, אז יש לקרוא אותם ביום עצמו ולא מהדף הזה.

שלושה מתוך האחד-עשר הם פורקים של פרויקטים לא קשורים: vLLM, LLaDA, וספק Pulumi ל-ClickHouse Cloud. הם פורקים של העבודה של מישהו אחר ואומרים דבר לא על האופן שבו Jev בנוי — בפרט, דבר לא על היות Jev מבוסס דיפוזיה. התשובה בשורה אחת לשאלה אם Jev הוא קוד פתוח היא שהכלים פתוחים והמודל לא.

מה שהם מעניקים לעצמם

שתי הודאות מהפוסט של ההשקה שוות יותר מרוב ההסתייגויות של ספקים, מכיוון שהן מציינות את המקומות המדויקים שבהם הראיות חלשות. לגבי מחיר: "אנחנו לא יכולים להוכיח שזה לא מסובסד; נצטרך את הטווח הארוך כדי להוכיח את הקיימות של התמחור שלנו (שאנחנו מצפים שירד, לא יעלה)." לגבי מהירות: "ההערכות המפורסמות שלנו מבוצעות בדרך כלל מהמחשבים הניידים שלנו בחוף המערבי (שם השירות שלנו מבוסס כיום)." יש עוד הודאה שלישית, שימושית יותר למי שבונה על זה: עבור קבוצות בחירה בעלות קרדינליות גבוהה, Jev מפעילה מערכת דו-שלבית שנותנת ציון באופן עצמאי ואז מבצעת בחירה מפורשת, "ומכאן ההאטה המזדמנת." זה הספק שמסביר מדוע ההשהיה אינה אחידה בין סוגי שאלות, וזה מסוג הדברים שאתה בדרך כלל לומד משרשור תמיכה.

איפה שאפשר בפועל להתקשר לזה, נכון להיום

דרך ה-API של TypeSafe עצמו, שבו המודל זמין באופן כללי, ודף הבית עדיין משתמש בביטוי של הספק עצמו "early access" — הניסוח הזה עדכני וכדאי לשמור עליו, ואילו "waitlisted" הוצא משימוש: התיעוד מפרסם מגבלות תפעוליות קונקרטיות (100K טוקנים לשנייה, 40 בקשות לשנייה, 429 עם backoff ב-SDK לאחר חריגה מאחד מהשניים) ואינו מכיל כל שפה של רשימת המתנה. וכן, מאז 2026-09-24, דרך OrcaRouter.

כדאי לנסח במדויק מה אנחנו מגישים, מפני שצורת הקריאה היא החלק שנבדל. רשומת הקטלוג היא typesafe/jev-1.13, בשם TypeSafe: Jev 1.13, עם סוג נקודת קצה נתמך "systemone" — כך שניגשים אליו דרך POST /v1/systemone ולא בצורת chat-completions של OpenAI, ללא זרימה, טקסט נכנס ו-JSON מובנה יוצא, עד כ-64K טוקני קלט עבור מצב ושאלות גם יחד. הקלט הוא $0.042 למיליון טוקנים והפלט מחויב באפס, מפני שאין טוקני פלט למדוד: החלטה מטופסת אינה פרוזה. זהו מחיר המחירון של הספק כפי שהוא, בתוספת של 0%, על אותו מפתח כמו יותר מ-200 המודלים האחרים בקטלוג — API אחד ליותר מ-200 מודלים, 0% תוספת (מחיר המחירון של הספק מועבר כמו שהוא, כך שהורדות מחירים של ספקים נכנסות לתוקף כאן באותו יום). אם הסיבה שאתה קורא על TypeSafe AI היא שברצונך לגלות אם הכיול של Jev מחזיק מעמד על הנתונים שלך לפני שאתה מקצה מסלול ייצור אליו, הרצה שלו לצד מודל גנרטיבי שאתה כבר סומך עליו היא הדרך הזולה לגלות; מעבר למודל הזה כאשר הביטחון של Jev חוזר נמוך הוא הדרך הזולה להשיק אותו.

נתוני ההגשה שלנו על פני שבעה ימים עבור החלון המסתיים ב-2026-09-30, שהם המספרים שלנו מהתעבורה שלנו ולא מהבנצ'מרק של הספק: p50 151 ms, p95 247 ms, כ-349 אסימוני פלט בשנייה, שיעור שגיאות של 0.49%, ו-76.2M אסימונים שהוגשו. ה-p50 היומי לאורך החלון הזה עמד על 175, 170, 163, 161, 170, 147, 143 ms, כך שהחציון נע מטה במתינות. יום אחד בסדרה, 09-28, מציג p95 של 2,448 ms — חריג אמיתי בנתונים, לא הנורמה, ולא מספר שלפיו כדאי לתכנן תקציב השהיה. אלה מתגלגלים מדי יום; הכרטיס הוא המקור.

A generated two-column figure card titled 'Jev 1.13 - the scoreboard', with the OrcaRouter logo composited in the bottom-right corner. The left column, headed 'LATENCY & RELIABILITY', lists 'p50 151 ms', 'p95 247 ms' and 'Error rate (7d) 0.49%'. The right column, headed 'PRICE & CONTEXT', lists 'Price $42 per billion input tokens', 'Context 65,536 tokens (32K state budget)' and 'Architecture & weights Unpublished'. A footer line reads 'Vendor figures unaudited; latency and error rate are OrcaRouter serving data, 7 days to 2026-09-30.'

היכן שהמודל חלש, לפי TypeSafe

הספק מפרסם עמוד משוננות עבור Jev 1.13, שנבדק לאחרונה ב-2026-09-17, שמציין את מצבי הכשל בכנות רבה יותר מרוב חומרי ההשקה. זהו העמוד הנכון לקרוא לפני בנייה על המודל, והרשימה שלו עצמו נראית כך. Jev עונה לשאלה שכתבת ולא לזו שהתכוונת אליה, ולכן יש לפרט במפורש מילות תיחום, שלילות ותנאים משתמעים. הוא אינו מחשבון: ביצועיו גרועים יותר בשאלות מתמטיות מאשר סמנטיות. הוא קורא תאריכים כטקסט ולא כמויות סדורות, ולכן סדר, פערים והשתייכות לחלון אינם אמינים, וגרוע יותר עם פורמטים מעורבים. שלילות כפולות ועקיפות מרובות-קפיצות פוגעות בדיוק. הדיוק יורד ככל שהמצב גדל בפרטים לא רלוונטיים — העמוד אומר שהוא "סובל מריקבון הקשר" — ולכן סינון בקוד תחילה הוא התיקון. המצב מטופל כנתונים, ולא כעוין כברירת מחדל, ולכן הוראות מוזרקות יכולות להסיט תשובות. הוראות וקריטריונים שאינם תואמים מבלבלים אותו. אינווריאנטים מבניים אינם מובטחים: פלט noul ופלט בחירה לא חייבים להתאים זה לזה, ושאלה בתוספת שלילתה אינה חייבת להסתכם באחת, ולכן אין להעביר ספים בין השניים. והוא אינו מאומן ליצור טקסט — כפייתו דרך בחירות משורשרות "לא תעבוד היטב ותהיה איטית מאוד".

A headless-browser capture of the TypeSafe model-jaggedness page for Jev 1.13, headed '# Jev 1.13 jaggedness' with the line 'Jev isn't perfect. Here are some jagged edges we are aware of with jev-1.13. Many of these will be fixed in later versions.' and the note 'Applies to jev-1.13 - Last reviewed 2026-09-17'. Below sits a table of nine documented failure modes - literal reading, math and numbers, date and time comparison, indirection, large state full of irrelevant detail, adversarial content, contradictory instructions and criteria, common-sense structural invariants, and generation - followed by explanatory body text on literal reading, counting and math.

כיצד לפרש את TypeSafe AI שישה ימים לתוך שינוי הניתוב

החברה מציגה טענה חזקה, ספציפית וניתנת להפרכה: שמודל החלטה צר יכול להיות מהיר יותר, זול יותר ואמין יותר ממודל כללי בתת-קבוצה של עבודה שבה צריך שיקול דעת ולא פסקה. הטענה סבירה ומגובה חלקית בראיות עצמיות — אומדני הביטחון הם הבדל תכנוני אמיתי, המחיר אמיתי, והשהיה שאנו מודדים בתעבורה שלנו היא באותו סדר גודל כמו זו של הספק. מה שחסר הוא החלק שיאפשר לגורם חיצוני לבדוק את השאר: אין ארכיטקטורה, אין פרמטרים, אין משקלים, אין בנצ'מרק בלתי תלוי, ומחיר שהחברה עצמה אומרת שאינה יכולה להוכיח שהוא בר-קיימא. מצבי הכשל מתועדים, וזה יותר ממה שרוב המעבדות עושות וזו הסיבה הטובה ביותר היחידה להתייחס למודל ברצינות.

אם אתם מתלבטים אם להקדיש לכך תשומת לב: הריצו את Jev על קלט שכבר תייגתם, כשהתוויות מוסתרות, ובדקו אם ציוני הביטחון שלו מבדילים בין המקרים שבהם הוא צודק לאלה שבהם הוא טועה. הבדיקה הזו כמעט לא עולה דבר — 0.042 דולר למיליון טוקני קלט — והיא היחידה שעונה על השאלה שבאמת יש לכם. אם אתם מתלבטים אם לתת אמון בחברה: החשיפות הן מה שהן, והתשובה הכנה היא שהראיות הן כרגע המילה של הספק בתוספת כל מה שאתם מייצרים בעצמכם.