
RSI-Jev לעומת Jev 1.13: אחד שאתה מוריד, אחד שאתה קורא לו
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הצב את RSI-Jev v6.1-VL 4B ואת Jev 1.13 זה לצד זה, והדבר הראשון שמבחין בו מי שמבצע את הקריאה הוא שמדובר באותה בקשה. תן לאחד מהם מצב וקבוצה של שאלות עם טיפוסים — כן/לא, בחירה של אחת מתוך k, דירוג לפי מחוון — ושניהם מחזירים הסתברות מכוילת לכל אפשרות, במעבר קדימה אחד, בלי טקסט מחולל שצריך לפרסר. זה לא צירוף מקרים: RSI-Jev נבנה בכוונה לדבר בפורמט החוטים של Jev, כך שלקוח שנכתב מול ה-API של TypeSafe פועל מולו על ידי שינוי כתובת URL בסיסית. מה שלא זהה הוא כל מה שסביב לקריאה. Jev 1.13 הוא המודל המסחרי הסגור של TypeSafe, המוגש מנקודת קצה מדודה; RSI-Jev v6.1-VL הוא צ׳קפוינט בן 4.69B פרמטרים עם משקולות ברישיון Apache-2.0 שאתה מוריד ומגיש על החומרה שלך. אף אחד מהם אינו מיתוג מחדש של האחר, אף ספק לא מאשר את האחר, וכמעט כל נתון בהשוואה הזו מגיע מהצד שהפיק אותו.
התאריך בשורת הנושא חשוב, כי הפרויקט הזה מוציא גרסה בערך כל יום. RSI-Jev v6.1-VL 4B פורסם ב-2026-10-07 על ידי הפרויקט Shanghua-Gao/RSI-Jev של צד שלישי — לולאת מחקר שמשתפרת בעצמה, שמאמנת מודלי החלטה בסגנון Jev ומפרסמת כל זרוע שנכשלה יחד עם אלו שניצחו. זו הגרסה השמינית בשלושה עשר ימים באותו קו, והיא ממוצע משוקלל של הגרסה הקודמת עם כיוונון עדין שני של אותו Qwen3.5-4B-Base. Jev 1.13 הוא מודל של TypeSafe AI, שהושק ב-2026-09-15 ונכלל בקטלוג שלנו מאז 2026-09-24. שני התאריכים חשובים בהמשך, כי להשוואה מול פרויקט שזז מדי יום יש חיי מדף הנמדדים בימים.
מה הם השניים באמת, כל אחד בשורה אחת
Jev 1.13 הוא מודל החלטות מתארח מאחורי נקודת קצה ייעודית — POST /v1/systemone, ללא זרימה, תקציב קלט של בערך 64,000 אסימונים על פני המצב וכל השאלות שלך יחד, במחיר של $0.042 למיליון אסימוני קלט, כאשר הפלט מחויב באפס כי אין אסימוני פלט. הארכיטקטורה, מספר הפרמטרים וחישוב האימון שלו אינם גלויים; TypeSafe אמרה שהפרטים נשמרים בסוד ומאמר עשוי לבוא בעקבות זאת. אתה לא מריץ אותו. אתה קורא לו, וכל קריאה היא בקשת רשת במדידה.
RSI-Jev v6.1-VL הוא המערך האחר במלואו. זהו מגדל Qwen3.5-4B-Base שעבר כוונון עדין מקצה לקצה, עם ראשי החלטה בשכבות 16, 20 ו-32, המוגש מצ'קפוינט שהוא עצמאי לחלוטין וגודלו 9.7 GB ב-bf16. מספר הפרמטרים הוא 4.69B וכדאי לדעת לאן הם הולכים: 3.57B ב-32 שכבות הפענוח, 0.64B בהטבעות הטוקנים, 0.33B במגדל הראייה, 0.05B בראש ההחלטה הראשי ו-0.10B בשני ראשי היציאה המוקדמת. אין תערובת של מומחים ואין מודל שני. אתה מתקין אותו עם פקודת pip מהמאגר, מריץ את השרת שלו, ומאותה נקודה ההחלטה לעולם לא יוצאת מהתשתית שלך.
• מי מריץ אותה — נקודת קצה מתארחת בחיוב לפי שימוש שאינה בשליטתך, לעומת צ'קפוינט בנפח 9.7 GB על ה-GPU, ה-Apple Silicon או ה-CPU שלך.
• צורת התמחור — 0.042$ למיליון טוקני קלט, פלט בחינם, תשלום לפי קריאה לעומת אפס בשוליים בתוספת עלות המכונה והתפעול.
• תקציב קלט — כ-64,000 טוקנים לבקשה במודל המתארח לעומת 32,768 טוקני טקסט בתוספת תקציב תמונות בצ'קפוינט, כאשר כל דבר ארוך יותר נדחה במקום להיחתך.
• משקלים ורישיון — סגור, גודל לא ידוע לעומת משקלים ברישיון Apache-2.0, קוד MIT, 4.69B פרמטרים.
• מודאליות — טקסט עבור החוזה של Jev לעומת טקסט בתוספת עד ארבע תמונות לכל בקשה בגרסאות הראייה של RSI-Jev.
• בעלות — המודל המסחרי של TypeSafe AI לעומת פרויקט מחקר של צד שלישי שמציין בשורת הרישיון של עצמו שהוא "לא קשור ל-TypeSafe AI."
הניקוד בלוח של RSI-Jev עצמו, ומדוע זהו רק חצי מהשוואה
המספר שהפרויקט מוביל איתו הוא ציון מדד ההחלטה 0.3 שלו: 50.98 עבור v6.1-VL 4B, לעומת 46.23 בגרסה שקדמה לו. מדובר בהרצה מלאה של תצורת ברירת המחדל — 140,178 בקשות, כיסוי 1.0 — ובלוח הציבורי של הפרויקט עצמו, מתאריך 2026-10-06, הוא משתווה למודל ה-4B הטוב ביותר בלוח הזה (50.98 מול 50.82 של ezjev 4B s2, שאותו הערכה מתייחסת אליו כאל שוויון ב-0.25) וממוקם במקום ה-27 מתוך 113 בסך הכול. במדד ההחלטה הוותיק יותר 0.2.1 הוא מציג 50.74 לעומת 46.24 של v6.0-VL. מערך חמישה-עשר המבחנים שלו, המדווח ללא משימתopen_jev_ood שהתגלתה כחופפת לשורות אימון, הוא 0.793, וקבוצת ה-held-out שלו היא 0.729.
כל אחד מהמספרים האלה הוא של RSI-Jev עצמו, כפי שנמדד בהרנס של RSI-Jev. ה-Decision Index הוא לוח בנצ'מרק ציבורי, אבל אין בו מדידה של Jev 1.13, משום שחבילת הבדיקות של הפרויקט נבנתה כדי לתת ציון לנקודות ביקורת החלטה פתוחות, ו-Jev הוא נקודת קצה סגורה. לכן הפיתוי להעמיד 50.98 מול 0.727 של Jev בבנצ'מרק typed-decisions ולהכריז על מנצח הוא בדיוק הטעות שיש להימנע ממנה: שני המספרים האלה מגיעים מהרנסים שונים, מגדלי מדגם שונים ומנתונים שונים, ואף אחד לא הריץ הרנס אחד על שני המודלים.

ההתמודדות ראש בראש היחידה שקיימת היא של לאיה, לא של RSI-Jev.
יש השוואה מפורסמת אחת שכן מציבה מספר Jev לצד צ'קפוינט פתוח, והיא לא הורצה על ידי אף אחד מהצדדים כאן. Convai Innovations, יוצרי מודל ההחלטות Laya, ערכו טבלה של נתוני Jev 1.13.0 המפורסמים של TypeSafe מול אלו שלהם, והצביעו בעצמם על המגבלות: מספרי ה-Jev מפורסמים על ידי צד שלישי ומעולם לא נמדדו על ידי Convai, גדלי המדגם והפרומפטים שונים, והספק אינו מפרט את הבנצ'מרקים שלו עבור המודל. הטבלה הזו שווה קריאה לשם כיול, לא לשם הכרעה — והיא אינה כוללת את RSI-Jev כלל, מכיוון ש-RSI-Jev לא היה קיים כשפורסמה.
מה שזה כן מראה הוא הצורה של שאלת ה-hosted מול ה-open שקורא באמת שוקל. המודל ה-hosted מוביל במקום שבו מרחב האפשרויות גדול והמודל צריך להחזיק סט תשובות רחב ביציבות; המודלים הפתוחים מנצחים בהשהיה גולמית לכל קריאה כי אין רשת בנתיב. שום דבר בתבנית הזו לא אומר לך איזה משני המודלים הספציפיים האלה טוב יותר במשימה שלך, והעמדה הכנה היא שהתשובה עדיין לא קיימת בפומבי.
מה שנקודת הביקורת נותנת שנקודת הקצה לא יכולה לתת
הטיעון החזק ביותר בעד RSI-Jev אינו ציון. הוא שהמשקלות יושבות על הדיסק שלך. עבור החלטת ניתוב המתקבלת על בסיס רשומה רפואית, מסמך משפטי או היסטוריית חשבון של לקוח, "הנתונים לעולם לא יוצאים מהבניין" אינו העדפה שאתה סוחר בה מול נקודת בנצ'מרק — מדובר בדרישת חובה, ואף נקודת קצה מתארחת לא עונה עליה בשום מחיר. אותה תכונה מסירה את מגבלת הקצב: התיעוד של הספק עצמו עבור המודל המתארח מציין שהמגבלות שלו מותאמות באופן דינמי ויכולות להשתנות ללא הודעה מוקדמת, ולנקודת ביקורת באירוח עצמי אין תקרה כזו מלבד החומרה שלך.
הדבר השני שהצ'קפוינט נותן הוא שליטה בעומק, והיא יוצאת דופן. מכיוון שראשי ההחלטה יושבים בשלושה עומקים, הגדרת effort קובעת כמה שכבות בקשה רשאית להשתמש בהן: low נעצר בשכבה 16 בחציון של כ-23 מ״ש, medium בשכבה 20 ב-27 מ״ש, high בשכבה 32 בכ-40 מ״ש, וכן auto עונה ביציאה הראשונה שבטוחה מספיק, בממוצע 19.5 מתוך 32 שכבות בחבילת הבדיקות של הפרויקט. זמני השהיה אלה הם המספרים של הפרויקט עצמו, שנמדדו על H200 אחד ב-bf16, ואין לערבב אותם עם שום נתון של שירות מתארח — מעבר קדימה מקומי וקריאת API מחויבת אינם אותה מדידה, והתיעוד של RSI-Jev עצמו מבהיר במפורש שההשוואה המוקדמת שלו לזמן השהיה שפורסם של Jev העמידה עבודת GPU מקומית מול סבב הלוך-חזור ברשת.
הדבר השלישי הוא התמונות. החוזה של Jev הוא טקסט נכנס, JSON מובנה יוצא. מהדורות הראייה של RSI-Jev מקבלות אחת עד ארבע תמונות לבקשה בתור כתובות נתונים base64, כאשר המצב מתייחס לכל אחת באמצעות סמן, ו-v6.1-VL משיג 0.834 בקבוצת התמונות שהוחזקה בצד של הפרויקט. אם ההחלטה שלך היא "האם התמונה מציגה נזק נראה לעין," זו יכולת שהחוזה המתארח לא מציע כלל.
גם מה שאתה מוותר עליו הוא אמיתי, והפרויקט מפרסם את זה. הכיול החמיר במהדורה הזו, ולא השתפר: שגיאת הכיול הצפויה הסופית היא 0.048 בשכבה 32 ו-0.055 עם אוטומטי, לעומת 0.036 ו-0.024 במהדורה הקודמת. סף ברירת המחדל הבודד של 0.95 נשלח במפורש כלא מאושר — הוא הגיבוי של כלל בחירה שהבחירה שלו עצמו, 0.85, החמיצה את תקרת העומק של הפרויקט במחצית מנתוני הפיתוח שלו. היציאות המוקדמות קוראות טקסט בלבד, לכן כל שאלה עם תמונה מריצה את כל 32 השכבות ללא קשר למאמץ. וחמישה ממקורות האימון של התמונות הם לא מסחריים או למחקר בלבד, כשהפרויקט מציין במפורש שהשאלה אם משקלים שאומנו על נתונים לא מסחריים יורשים את התנאים הללו טרם הוכרעה.
איפה לקרוא למאוחסן, ואיפה לא
זהו החלק בהשוואה שיש לנו בו עניין, ולכן כדאי להיות מדויקים. אנו מגישים את המודל המסחרי של TypeSafe כ-typesafe/jev-1.13 בנקודת הקצה הייעודית systemone — POST אל /v1/systemone ולא במבנה chat-completions של OpenAI, ללא זרימה, מול הקשר של 65,536 טוקנים שהקטלוג שלנו מפרט. זהו אותו מבנה בקשה ותשובה ש-RSI-Jev מיישם, מהמודל שהפרויקט מעתיק את החוזה שלו. את RSI-Jev עצמו אנחנו לא מארחים; אין מזהה rsi-jev ואין מזהה shgao בקטלוג שלנו, וקורא שרוצה את המודל הזה מוריד אותו.
הסיבה שהבחנה הזו חשובה כאן היא צרה וקונקרטית. שכבת החלטה היא לעיתים רחוקות כל תהליך עבודה — היא בדרך כלל יושבת לצד מודל גנרטיבי שכותב את התגובה, הסיכום או הקוד. מבחינה היסטורית המשמעות הייתה שני חוזים. זה כבר לא חייב להיות כך עבור החצי המתארח: Jev 1.13 יושב על אותו מפתח כמו יותר מ-200 מודלים אחרים מחיר המחירון של הספק מועבר הלאה עם 0% תוספת, כך שאם TypeSafe משנה תעריף, השינוי פעיל אצלנו באותו יום ולא במחזור החיוב הבא. לחצי באירוח עצמי מעולם לא הייתה הבעיה הזו, כי אתה הספק. הדרך הנקייה להחליט ביניהם היא לנסות תחילה את החוזה המסחרי על קומץ מקרים מתויגים משלך, לראות אם התנהגות ברירת המחדל טובה מספיק כדי לבצע מולה אוטומציה, ורק אז להבין אם הרצה של צ'קפוינט 4.69B בעצמך שווה את התפעול.

איזה מהם אתה באמת צריך לבחור?
בחר ב-RSI-Jev v6.1-VL 4B אם ההחלטה צריכה להישאר בתוך ההיקף שלך, אם אתה צריך החלטה גם על תמונה וגם על טקסט, אם מערכי האפשרויות שלך מגיעים למאות (הצ'קפוינט מאפשר עד 5,120 אפשרויות לשאלה), או אם אתה רוצה לכוונן עומק ושהיה לכל בקשה. היכנס לזה בידיעה שאתה מאמץ פרויקט שזז שמונה פעמים בשלושה עשר ימים, שהמהדורה האחרונה שלו החליפה כיול בדיוק, ושהכרטיס שלו עצמו מציין את חלקי מדיניות היציאה שהוא לא הצליח לאשר.
בחר ב-Jev 1.13 אם אתה רוצה שההחלטה תעבוד בלי סטאק הגשה, אם אתה מעריך נקודת קצה שמישהו אחר מתחזק, ואם המחיר של $0.042 למיליון קלט — בלי טוקני פלט למדידה — זול ביחס להיקף הקריאות שלך. היכנס לזה בידיעה שאתה קורא למודל סגור שגודלו לא נחשף, שמגבלות הקצב שלו יכולות להשתנות ללא הודעה מראש, ושהבנצ'מרקים המפורסמים שלו אינם משהו שתוכל להריץ מחדש.
הדבר המשותף לשניהם שימושי יותר ממה שמפריד ביניהם, והוא הסיבה לכך שהשוואה כזאת בכלל שווה לכתוב. אף אחד מהמודלים לא מייצר טקסט, ולכן אף אחד מהם לא מכניס את סוג הכשל שנובע ממודל ששוכח לסגור סוגר מסולסל או ממציא שדה. שניהם מחזירים הסתברויות, ובשני המקרים ההסתברות היא החלק שעליך לאמת על הנתונים המתויגים שלך לפני שאתה מבצע אוטומציה על פיה — ההשהיה כבר הפכה לסחורה, וערך הביטחון הוא זה שצריך להרוויח בכל פריסה. בכל צד של קו ההורדה־מול־קריאה שתבחר, בדוק קודם את הכיול.

