
ג'ב מסרב לכתוב מילה אחת: מה מודל ההחלטות של TypeSafe AI עושה, ומה שאף אחד עדיין לא אימת
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
Jev הוא המודל הראשון של TypeSafe AI שסביר שקורא יפגוש דרך טבלת עלויות ולא דרך תיבת צ'אט, כי אין תיבת צ'אט. הושק ב-15 בספטמבר 2026 על ידי Diogo Almeida — שותף לכתיבת מאמר InstructGPT, העבודה שגרמה ל-ChatGPT להתנהג כמו עוזר — Jev אינו מייצר טקסט כלל. הוא מקבל פיסת מצב (דואר אלקטרוני, שורת לוג, כרטיס תמיכה, בלוב JSON של קואורדינטות משחק) בתוספת רשימה של שאלות מטופסות, ומחזיר תשובות מטופסות: בחירה מתוך קבוצה שסיפקת, ציון לפי רובריקה, או הסתברות כן/לא, כשכל אחת נושאת ערך ביטחון משלה. לא פרוזה, לא קוד, לא הסבר. המסר של TypeSafe הוא שהמוגבלות הזו היא המוצר, כי היא קונה מהירות ומחיר שמודל גנרטיבי לא יכול להשתוות אליהם — מהיר פי 20 עד 200 וזול פי 40 עד 400 מ"LLMs דומים" בחומרי ההשקה של החברה עצמה, במחיר של $0.042 למיליון טוקני קלט כשהפלט מחויב באפס.
המספר השימושי ביותר שפורסם ב-48 השעות הראשונות אינו אחד מאלה. הוא מגיע מ-Every, ששם ראש מחלקת ההערכות שלה הריץ את Jev על פני 27 מאמרים שפורסמו ב-Every בתוספת 10 מקבילות בסגנון AI, ושאל 21 שאלות על כל 37 המסמכים בבת אחת: 777 שיפוטים בפחות מ-0.7 שניות, תמורת כרבע סנט. מבחן שני, שהורץ על ידי מנכ"ל Every, הציב 12 קטעים סינתטיים — שישה נקיים, שישה עם פגמים שנשתלו בכוונה — מול ארבע בדיקות כתיבה. Jev חזר עם חציון של 0.35 שניות לקטע לעומת 8.83 שניות עבור Claude Fable 5.1 במאמץ גבוה: בערך פי 25 מהיר יותר בעלות של בערך 1/580. הוא תפס שישה משבעת הפגמים שנשתלו. Claude Fable 5.1 תפס את כולם. פסק הדין של Every היה "טוב אבל לא מושלם", וזו הקריאה הכנה בשורה אחת של Jev מהמבחן הבלתי תלוי היחיד שמישהו פרסם עד כה — טענות המהירות והעלות שורדות מגע עם צד שלישי, טענת הדיוק נמצאת מדרגה אחת מתחת לחזית, והמדגם קטן מספיק כדי שאף אחד לא יסיק ממנו מסקנת ייצור.
הערה על סוג הראיות שאיתן המאמר הזה עובד, משום שהרמות רחוקות זו מזו באופן חריג עבור מודל כה חדש. Jev הוא אמיתי וניתן להפעלה: יש נקודת קצה מתועדת, SDK של Python, כינוי מודל ומחיר מפורסם. ההשקה הוכרזה על ידי הספק, לא הודלפה, ואיש אינו מנחש אם הוא קיים. אבל כל טענת ביצועים ש-TypeSafe מציבה בחזית היא של TypeSafe עצמה, הארכיטקטורה אינה מפורסמת, המשקולות לא שוחררו, ולוח המחוונים של מבחני הביצועים שמאחורי הכותרת 20-200x הוא אוסף של הערכות זרימת עבודה פנימיות ולא לוח דירוג ציבורי. גורם חיצוני אחד בדק אותו. מאמר זה שומר בהפרדה גלויה על מספרי הספק, מספרים בלתי תלויים ושאלות פתוחות, במקום למצע אותם לכדי קונצנזוס שאינו קיים.
מה TypeSafe למעשה שחררה
Jev הוא הראשון ממה ש-TypeSafe מכנה מודלי System One — השם שאוב מהחצי המהיר והאינטואיטיבי של הקוגניציה לפי דניאל כהנמן, בניגוד למצב המהורהר והאיטי יותר שצ'אטבוטים מחקים. הניגוד ש-TypeSafe משרטט הוא לדפוס הסטנדרטי של לאלץ מחולל טקסט להפיק פלט מובנה ואז לפרסר את הטקסט הזה בחזרה למשהו שקוד יכול לסמוך עליו. Jev מדלג על הטקסט לחלוטין. התיעוד של TypeSafe עצמה מציג את העניין בצורה חד-משמעית: "מודלים לשוניים גדולים (LLMs) נועדו להפיק טקסט שבני אדם יקראו. כשאתם צריכים שמודל יקבל החלטה שהקוד שלכם יצרוך, נוצרת אי-התאמה."
משטח הפלט הוא שלושה פרימיטיבים, ואין דבר אחר. כל שאלה שתשאל חייבת להיות אחת מהם:
• בחירה — בחר אפשרות אחת מתוך רשימה שאתה מספק, תוך החזרת האפשרות הנבחרת בתוספת הסתברות לכל מועמד ורמת ביטחון. האפשרויות מוגבלות ל-255 לכל שדה; מעבר לכך, TypeSafe מתעדת תבנית דו-שלבית של ניקוד מועמדים בנפרד ואז בחירה.
• ניקוד — מקם את המצב על מחוון סדור, והחזר את הרמה, הסתברות לכל רמה ורמת ביטחון. סיכון נטישה בסולם 0-1 הוא הדוגמה בתיעוד.
• Noul — הלחם של "no" ו-"null" — טענת כן/לא בודדת, המחזירה את ההסתברות המכוילת לכך שהיא נכונה.

התכונה המעניינת אינה אף פרימיטיב בודד, אלא האופן שבו הם מורכבים יחד. כל השלושה יכולים להיות משולבים בקריאת API אחת, וכל שאלה מוערכת במקביל כנגד קריאה משותפת אחת של אותו מצב. התיעוד של TypeSafe אומר שהוספת שאלות "כמעט ואינה משנה את זמן התגובה", והמבחן הבלתי־תלוי מאשש זאת בפועל — 21 שאלות על פני 37 מסמכים נכנסו לאותן 0.7 שניות. זה מה שגורם למחיר לכל שיפוט להתמוטט: אינכם משלמים עבור יצירה ארוכה יותר, אלא עבור מעבר אחד.
המעטפת המעשית, כפי שתועדה וכפי שדווחה על ידי משתמשים מוקדמים: תקציב בקשה של כ-32,000 טוקנים, המתואר בתיעוד של TypeSafe ככ-150,000 תווים באנגלית; ללא קלט תמונה או אודיו בהשקה; ומבנה בקשה ותגובה שאינו מוסכמת ה-chat-completions של OpenAI, כך שקריאה אליו דורשת לקוח ייעודי ולא החלפת base-URL. הגישה היא רשימת המתנה לגישה מוקדמת יחד עם מגרש משחקים בדפדפן, עם code>jev-latest/code> ככינוי המודל.
RLCD פירושו מכויל, לא מועדף.
TypeSafe מאמנת את Jev בשיטה שהיא מכנה RLCD — Reinforcement Learning for Calibrated Decisions, לפי התיעוד של החברה עצמה. ראשי התיבות חדשים מספיק כדי שסיקור מוקדם הרחיב אותם באופן לא עקבי, ולכן כדאי לדייק מה הם באמת מסמנים, משום שההבחנה היא כל טענת המחקר.
RLHF מייעל פלט מועדף על ידי בני אדם. RLVR מייעל נכונות ניתנת לאימות, מהסוג שמקרי הבדיקה עוברים. RLCD מייעל כיול: מודל שאומר שהוא בטוח ב-70% אמור להיות צודק בכ-70% מהמקרים. זהו יעד שונה מלהיות צודק, וזו הסיבה שכל תשובת Jev מגיעה עם התפלגות הסתברות מצורפת ולא רק עם תשובה. מצב הכשל המיועד הוא מודל שיודע מתי הוא לא יודע, כך שהקוד שלך יכול להחליט מה לעשות בנוגע לכך.
מה שזה נותן לך בפועל הוא משטח שליטה. התבנית המתועדת היא שלוש רצועות ביטחון — לפעול אוטומטית ברצועה העליונה, לסמן או לאשר ברצועה האמצעית, לנתב לאדם ברצועה התחתונה — כשהספים נמצאים בקוד שלך ולא במודל. האם הרצועות כנות היא שאלה אמפירית בנוגע לנתונים שלך, וזהו דבר ש-TypeSafe אומרת לך במפורש לענות עליו בעצמך, בציינה שספי ביטחון הם ספציפיים למקרה השימוש ויש לבחון אותם מול הדוגמאות המתויגות שלך. ההוראה הזו היא המשפט החשוב ביותר בתיעוד, והסיבה לכך שהקטע הבא קיים.
המספרים, ממוינים לפי מי שהפיק אותם
כאן רוב הסיקור של Jev נעשה מרוכך, ולכן כדאי להבהיר את מקור המידע. הנה מה שמגיע מהספק, מה שהגיע מבודק עצמאי, ומה שפשוט אינו ידוע.
• דווח על ידי הספק, לא שוחזר — טענות המהירות והעלות המרכזיות. השהיה מקצה לקצה של 70-500 מ"ש לעומת 3-329 שניות עבור קריאות למודלי LLM מתקדמים; מהיר פי 20-200 וזול פי 40-400; תוצאת תהליך עבודה אחת במקרה הטוב ביותר שפורסמה כמהירה פי 193.6 וזולה פי 444.6. TypeSafe מודה שאלה נתוני המקרה הטוב ביותר ולא נתונים אוניברסליים.
• מדווח על ידי הספק, וניתן לבדיקה בגיליון המחירים — 0.042 דולר למיליון אסימוני קלט, שהם 42 דולר למיליארד, כאשר הפלט בחינם. הסיבה שהפלט בחינם היא מכנית ולא שיווקית: אין פענוח אוטורגרסיבי למדידה, ולכן אין אסימוני פלט לחייב עליהם. לשם קנה מידה, אותם חומרי השקה מציבים את מחיר הקלט האופייני בחזית על 0.20 עד 10 דולר למיליון, כאשר הפלט הוא לעיתים קרובות בערך פי חמישה ממחיר הקלט.
• לפי דיווח הספק, מבנצ'מרק פנימי — לוח המחוונים של זרימת העבודה של TypeSafe עצמה, 711 מקרים בארבע משימות, כשתשובות הייחוס נגזרו מהשיפוט הממוצע של GPT-6 Astra ו-Claude Fable 5.1 ולא מאמת מוחלטת. בלוח המחוונים הזה Jev מגיע לציון מצטבר של 67.8% לעומת 74.1% של המשווה הטוב ביותר. בפילוח: אירועי אבטחה 61.7% לעומת 66.2% של Opus 5; נראות עקבות סוכנים 71.6% לעומת 76.6%; עיבוד חשבוניות 61.8% לעומת 79.1%; שירות לקוחות 76.0% לעומת 78.3%. Jev מנצח בעמודות העלות וההשהיה בתרשים הזה ומפסיד בעמודת הדיוק. לוח המחוונים עצמו מציין הטיית מערך בדיקה אפשרית, ו-TypeSafe מסרה שהיא דילגה במכוון על לוחות דירוג ציבוריים לטובת הערכות חד-פעמיות הקשורות לעדכוני מוצר.
• נמדד באופן עצמאי, מדגם קטן — מבחני Every שתוארו לעיל: 777 שיפוטים בפחות מ־0.7 שניות תמורת כרבע סנט בערך; 1,709 שיפוטים ב־11 ניסויים תמורת פחות מסנט בסך הכול; בערך פי 25 מהיר יותר וב־1/580 מהעלות של Claude Fable 5.1 במשימת סיווג של 12 קטעים, בעודו מחמיץ אחד משבעה פגמים מושתלים שהמשווה תפס. המסקנה של Every עצמה הייתה שהיא תרצה בדיקת דיוק יסודית בהרבה לפני הכנסתו לייצור.
• לא ידוע — הארכיטקטורה. אין מאמר בעת ההשקה, אין מספר פרמטרים, אין גילוי של עוצמת החישוב לאימון, אין משקולות. TypeSafe אמרה שהפרטים נשמרים "צמוד לחזה לעת עתה", עם מאמר שאולי יפורסם בהמשך.

הדפוס לאורך השכבות האלה עקבי, והוא אינו הדפוס שכותרת ה-200x מרמזת עליו. כל נתון עצמאי וכל נתון של ספק מסכימים ש-Jev זול באופן דרמטי ומהיר באופן דרמטי. שום נתון בשום מקום, כולל זה של TypeSafe עצמה, לא מראה שהוא מדויק יותר ממודלי החזית שמולם הוא מתומחר. בלוח המחוונים של הספק עצמו הוא ממוקם בסביבות הרמה של מודל טוב בדרג הביניים. ההשוואה שמחזיקה מעמד היא לא "חכם כמו מודל חזית במאית מהמחיר" — אלא "קרוב לשיקול הדעת של מודל מדרג הביניים בשבריר סנט לקריאה, מהיר מספיק כדי לרוץ בכל תור בודד."
מה "אפס הזיות" כן ולא אומר
חומרי ההשקה של TypeSafe כוללים תרשים המציג שיעור שגיאות של 0% בקריאות לכלים עבור Jev לעומת שיעור שאינו אפס במודלים להשוואה, והביטוי "עמיד להזיות" מלווה את המודל. שניהם נכונים ושניהם צרים יותר מכפי שהם נקראים.
ההבטחה היא מבנית. כל תשובה אפשרית נמנית מראש לפני שהמודל רץ — אתה סיפקת את רשימת האפשרויות, את מחוון הניקוד, או את טענת האמת/שקר — ולכן אין מרחב שבו ניתן לפלוט ערך מחוץ לטיפוס המוצהר. קריאה פגומה לכלי אינה משהו ש-Jev יכול להפיק. זו תכונה הנדסית אמיתית, ולכל מי שבילה שבוע בכתיבת לוגיקת ניסיונות חוזרים סביב כשלי פענוח JSON, היא שווה כסף אמיתי.
זו אינה טענה לגבי נכונות. תשובה תקפה מבחינת סכימה עדיין יכולה להיות שגויה: Jev יכול לנתב בביטחון תלונת חיוב אל התור הטכני, והפלט יהיה תקין לחלוטין ובמקביל חסר תועלת. Almeida אמר זאת בעצמו, כשהוא מכיר בכך שאפשר להיות טועה בביטחון. הדרך המועילה להחזיק את שתי העובדות היא ש-Jev מבטל את סוג השגיאה שמקורו בעיצוב הפלט, ואינו עושה דבר כלל לגבי הסוג שמקורו בשיקול דעת. מה שאומר ששאלת הדיוק היא כולה שאלת כיול, וכיול הוא בדיוק הדבר שעליך למדוד בעצמך.
איך לבדוק את טענת הכיול על הנתונים שלך
כיול הוא אחד מתכונות המודל הבודדות שאפשר לבדוק כראוי עם כמה מאות דוגמאות ובלי תשתית ML, והוא המבחן היחיד שחשוב לפני ש-Jev נוגע בנתיב ייצור. ההליך קצר.
קח כמה מאות מקרים שכבר יש לך עבורם תוויות. שאל את Jev את השאלה שחשובה — החלטת הניתוב, ציון הסיכון, בדיקת הפגם — וסווג את התשובות לפי רמת הביטחון שהיא דיווחה. ואז בדוק אם קבוצת הביטחון 0.9 צודקת בערך 90% מהזמן, קבוצת 0.7 בערך 70%, וכן הלאה. מודל מכויל היטב משרטט קו אלכסוני. מודל שהוא רק בטוח מקבץ הכול מעל 0.9 וצודק 70% מהזמן, וזו הצורה שבשקט שוברת צינור עיבוד אוטומטי.
אותו מבחן אומר לך באילו ספים להשתמש. אם דלי ה-0.9 באמת מדויק ב-90% על הנתונים שלך, אתה יכול להאוטמט אותו. אם רצועת הביניים שלך היא דייסה, אתה מנתב אותה לאדם או מוסר אותה למודל גנרטיבי ונותן למסלול היקר להתמודד עם העמימות. הפיצול הזה — מודל זול על הרוב הבטוח, מודל יקר על השארית הלא-בטוחה — הוא הארכיטקטורה ש-Jev בעצם מצדד בה, וזו הסיבה שהדרך הטובה ביותר להבין את המודל היא כרכיב ולא כתחליף.
מה זה עולה, בפרוטרוט
התמחור פשוט מספיק כדי לחשוב עליו בהיגיון, וזה נדיר. הקלט הוא $0.042 למיליון טוקנים. הפלט בחינם. בתקציב הבקשה המתועד של כ-150,000 תווים, קריאה אחת בגודל מקסימלי עולה הרבה פחות מסנט.
שני נתונים שדווחו נותנים תחושה של סדר גודל. משתמש מוקדם ביצע כ-5,000 בקשות בעלות של כ-2 דולר. ההדגמה של Doom — Jev מנווט בוט באמצעות תיאור טקסטואלי של מצב המשחק ולא פיקסלים גולמיים — פעלה בקצב של כ-10 קריאות בשנייה בעלות של כ-7 דולר לשעה. ו-777 השיפוטים של Every על פני 37 מסמכים הסתכמו בכרבע סנט בקירוב, וזה המספר שהופך את מקרה השימוש המעניין למובן: במחיר הזה, בדיקת כל סבב בודד בלולאת סוכן מפסיקה להיות החלטת עלות והופכת לברירת מחדל.
זו הטענה האמיתית בעד Jev. מעבר אימות בכל תור — האם קריאת הכלי הזו סתרה את הקודמת, האם הפלט הזה תואם את הכוונה שהמשתמש הצהיר עליה, האם זה צריך להעלות דגל — תמיד היה אפשרי מבחינה טכנית עם מודל חזית, ואבסורדי מבחינה כלכלית בקנה מידה. בתעריף של 0.042 דולר למיליון טוקנים, ללא חיוב על פלט, אותו מעבר נעשה בר-השגה בכל תור. הערך כאן אינו בכך ש-Jev חושב טוב יותר ממודל חזית, כי הוא לא. הערך הוא בכך שהוא חושב בזול ובמהירות מספיק כדי שיתייעצו בו ללא הרף.
כדאי לומר זאת בבירור, כי זו השאלה הבאה המתבקשת: OrcaRouter לא מספק את Jev. המודל של TypeSafe הוא בגישה מוקדמת, ברשימת המתנה, ומדבר בצורת בקשה משלו, כך שכל מי שבוחן אותו עובר ישירות דרך TypeSafe. המקום שבו שכבת ניתוב כן משתלבת הוא החצי השני של תהליך העבודה. התבנית שעבורה Jev תוכנן היא שני מודלים, לא אחד — Jev מקבל את ההחלטה הטיפוסית, ומודל גנרטיבי מטפל בחלק שזקוק לפרוזה, לקוד או להסבר. החצי הגנרטיבי הזה הוא החלק ש-OrcaRouter מכסה: 197 מודלים על פני 15 ספקים מאחורי מפתח אחד תואם OpenAI, במחיר המחירון של הספק כפי שהוא, עם 0% תוספת, כך שהורדת מחיר של ספק מגיעה לצד שלנו באותו יום שבו היא יוצאת. שני החצאים של תהליך עבודה בצורת Jev ניתנים לבדיקה בלי חוזה נוסף, וכאשר רכיב ההחלטה אינו מוכח, נתיב ה-failover הוא מה שמונע מתוצאת כיול גרועה להפוך לתקרית ייצור.

היכן שג'ב אינו מתאים
המגבלות מוצהרות בבהירות יוצאת דופן על ידי הספק, מה שהופך את הקטע הזה לקל לכתיבה בכנות. Jev אינו יכול לייצר טקסט חופשי. הוא אינו יכול לכתוב קוד. הוא אינו יכול לנהל שיחה. אין לו ממשק צ'אט, אין קלט תמונות, ותקציב הקשר שלו הוא כ-32,000 טוקנים — סדר גודל מתחת למודלים בעלי הקשר ארוך שאיתם הוא מושווה מבחינת מחיר. שדות בחירה מוגבלים ל-255 אפשרויות. ותכונת "אי-הזיה", כפי שצוין לעיל, נוגעת לפורמט הפלט ולא לאמת.
הרשת היא התאמה צרה למדי. טוב: סיווג וניתוב בנפח גבוה, מעברי בקרת בטיחות ואימות, החלטות קריטיות לשהיה, ניקוד של מערכי מסמכים גדולים במקביל, בכל מקום שבו התשובה הנכונה היא באמת בחירה, מספר על סקאלה או ערך בוליאני. גרוע: יצירה פתוחה מכל סוג, חשיבה בהקשר ארוך, דיאלוג רב-תורי, או כל משימה שהתשובה הנכונה שלה היא משפט. אם הבעיה שלך לא מצטמצמת לשאלה בעלת טיפוס, Jev אינו דרך זולה יותר לפתור אותה — הוא כלל אינו דרך לפתור אותה.
יש גם ביקורת הוגנת על המסגור ששווה לשאת הלאה. לקרוא ל-Jev מודל חזית לווה אמינות שהמודל לא הרוויח: הוא לא יודע לכתוב קוד, לשוחח או לכתוב משפט, ותרשימי ההשוואה נשענים על מודלי חזית כקו הבסיס בעוד שעמודת הדיוק מספרת סיפור אחר. הטענה המוגנת יותר, וזו שהראיות בעצם תומכות בה, היא ש-TypeSafe דחפה הרחק קדימה את חזית המהירות והעלות עבור החלטות מובנות. זה דבר משמעותי לעשות. זה דבר שונה מלבנות מודל שמתחרה ב-GPT-6 Astra או ב-Claude Fable 5.1.
מה היה משנה את התמונה הזו
שלושה דברים, לפי סדר גס של מידת חשיבותם.
• מאמר ארכיטקטורה שפורסם או משקולות פתוחות. כל מה שקשור לאופן שבו Jev משיגה את מהירותה הוא כיום קופסה שחורה, והטענה שהערכה מקבילה היא המנגנון — האנלוגיה שאלמיידה מצייר היא החלפת חישוב סדרתי באופן שבו טרנספורמרים החליפו רשתות רקורנטיות — היא טענה ולא תוצאה מוכחת. עד שהעיצוב יפורסם, המהירות היא עובדה וההסבר הוא שיווק.
• הערכה עצמאית שנייה עם מדגם גדול יותר. המבחנים של Every הם הראיות החזקות ביותר הזמינות, והם מכסים 12 קטעים בשאלת הדיוק המכרעת. הרצה עצמאית נוספת אחת, על כמה מאות מקרים מתויגים, תכריע אם החמצת פגם אחד מתוך שבעה הייתה רעש או שיעור השגיאה האמיתי.
• ביקורת כיול על קלט מציאותי ומבולגן. כל מה שפורסם עד כה משתמש ברתמות בדיקה נקיות. השאלה הפתוחה עבור מודל שכל הצעת הערך שלו נשענת על ציוני ביטחון מהימנים היא מה ציונים אלה עושים במקרים הדו־משמעיים באמת — אלה שבהם גם סוקר אנושי היה מהסס. זה המספר שקובע אם Jev בטוח לאוטומציה שמופעלת מולו, ואיש לא פרסם אותו.
עד אז העמדה הסבירה היא ספציפית ולא כללית. Jev הוא מודל אמיתי, שנשלח, זול באופן יוצא דופן, עם יתרון מבני אמיתי באמינות הפלט, פרופיל דיוק שנמצא בערך בדרג הבינוני, וטענת כיול שהיא סבירה, מומלצת במפורש לבדיקה עצמית על ידי הספק שלה, ומאומתת באופן עצמאי רק על מדגם קטן. אם זרימת העבודה שלך כוללת שלב שמצטמצם לשאלה מוקלדת שנשאלת לעתים קרובות מספיק שמודל חזיתי יהיה בזבזני, זו אחת הדרכים הזולות ביותר לשאול אותה — וערך הביטחון שהוא מחזיר הוא החלק שיש לבדוק לפני שאתה סומך עליו, לא המהירות.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
