
מהו RSI-Jev? לולאת שיפור עצמי שבונה מודלי החלטות בסגנון Jev
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 145 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 296 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
RSI-Jev הוא פרויקט מחקר פתוח ושל צד שלישי, שבונה מודלי החלטה מסוג System One בסגנון Jev, והמודל שהעמוד הזה עוסק בו הוא מהדורת ה-4B שלו, RSI-Jev v6.0-VL, מתאריך 2026-10-06. הוא נכתב על ידי Shanghua Gao (@gasvn), כאשר Sufian (@SufianTA) מקבל קרדיט בתודות של המאגר, והוא אינו Jev של TypeSafe ואינו קשור ל-TypeSafe AI — שורת הרישיון של הפרויקט עצמו אומרת בדיוק זאת. הרעיון שמאחוריו צר מספיק כדי לומר אותו במשפט: שאל שאלה מסוג מוגדר על מסמך, צ'אט או תמונה — כן/לא, בחר-אחד-מתוך-k, דירוג-לפי-רובריקה — ומעבר קדימה אחד מחזיר הסתברות מכוילת עבור כל אפשרות. שום דבר לא נוצר, ולכן אין אסימוני הסקה לבזבז, ואף אחד מהם לא מבוזבז. המהדורה v6.0-VL אינה המהדורה הראשונה של הפרויקט; היא המהדורה השביעית שלו בתוך שנים-עשר יום, וזה הדבר החשוב ביותר להבין לגביו, משום שהמידע המועיל כאן נמצא בצורת הקו ולא בנקודת ביקורת בודדת כלשהי.
דבר אחד חייב להיאמר לפני כל המספרים, כי הוא מתארך את כולם. v6.0-VL היה בראש התור בדיוק יום אחד. ב-2026-10-07 בשעה 07:56 UTC — הבוקר — הפרויקט פרסם RSI-Jev v6.1-VL, שהוא v6.0-VL בממוצע, במשקל 0.5 לכל אחד, עם כיוונון עדין שני של אותו Qwen3.5-4B-Base שאומן על נתונים אחרים, ושמקבל ציון 50.98 בערכת Decision Index 0.3 של הפרויקט, לעומת 46.23 של v6.0-VL באותה ערכה. שום דבר לא אומן אחרי הממוצע. הכיול שלו גרוע מזה של v6.0-VL, והכרטיס שלו עצמו אומר זאת. השחרור הזה אמיתי ועדכני; העמוד הזה אינו עוסק בו. כל נתון להלן נקרא מרשומת השחרור של v6.0-VL, מתאריך 2026-10-06, וכאשר מניין השתנה מאז — מניין השחרורים, מניין הניסויים — העמוד הזה מביא גם את הנתון כפי שעמד עבור v6.0-VL וגם את הנתון כפי שהוא נקרא היום.
גם שווה להציב מוקדם את מה ש-RSI-Jev אינו, מפני ששתיים משלוש ההנחות הברורות שגויות. הוא אינו מוצר מתארח שאליו אפשר לפנות היום דרך API כללי, והוא אינו מוגש על ידי OrcaRouter — בקטלוג שלנו אין rsi-jev id, אין shgao id ואין כרטיס מודל עבורו. הדבר היחיד שכן יש לנו הוא המודל שהפרויקט הזה מעתיק את חוזה ה-HTTP שלו: Jev המסחרי של TypeSafe, שאותו אנו מגישים בתור typesafe/jev-1.13 בנקודת הקצה systemone. אל אחד משני אלה אתה פונה, ואת האחר אתה מוריד ומגיש בעצמך. כל מה שלהלן מגיע ממאגר הפרויקט עצמו, מכרטיסי המהדורה ומתיעוד ההגשה שלו, כפי שנקראו ב-2026-10-07, וכאשר מספר הוא של הפרויקט עצמו ולא מדידה חיצונית, העמוד הזה אומר של מי הוא.

מה הדבר בעצם עושה
הפרויקט מתאר את עצמו בשורה אחת כ"מערכת מחקר המשתפרת את עצמה באופן רקורסיבי, הבונה מודלים בסגנון Jev-style System One", והתוצרים שהוא מפיק הם מכריעים ולא מחוללים. אתה מוסר לו מצב — מסמך, תמלול צ'אט, עסקה, ובגרסאות הוויז'ן עד ארבעה תמונות — ושאלה אחת או יותר עם טיפוסים וקריטריונים בעלי שמות. הוא מחזיר, עבור כל שאלה, הסתברות לכל אפשרות. שלושה סוגי שאלות מכסים את המרחב, והם אלה שה-API של TypeSafe מגדיר:
• noul — שיפוט אמת/שקר, המוחזר כהסתברות בודדת, ללא התפלגות וללא ערך ביטחון, בהתאמה מדויקת לצורת התשובה של הייחוס.
• בחירה — בחר אפשרות אחת מתוך קבוצה של אפשרויות מתויגות, המוחזרת עם התפלגות ההסתברות המלאה וסטטיסטיקת ביטחון.
• ציון — דירוג לפי רובריקה סדורה, המוחזר כאינדקס מבוסס-אפס המשוקלל לפי הסתברות אל תוך הרמות, בתוספת המקרא וההתפלגות.
מכיוון שאין שלב יצירה, אין קריאה שנייה למודל ואין דגימה. החלטה לגבי מסמך שהמודל כבר קרא היא פעולה זולה מעצם טבעה, והשורה של הפרויקט עצמו לגבי עלות זו — "כ-10 מ״ש" — שייכת לעידן ה-2B שלו, ולא למהדורה הנוכחית; הנתונים הנמדדים עבור v6.0-VL מופיעים בהמשך.
שתי עובדות בנוגע לבעלות חשובות יותר מכל דבר אחר בעמוד הזה. RSI-Jev אינו עבודה של TypeSafe ו-TypeSafe לא העניקה לו חסות. שורת הרישיון, בציטוט מלא: "קוד: MIT. משקלים: Apache-2.0, בהתאם למודל הבסיס; חלק ממקורות אימון התמונות אינם מסחריים, ומפורטים בכל כרטיס מודל. אינו קשור ל-TypeSafe AI." והקשר הוא חד-כיווני: הפרויקט מעתיק במכוון את פורמט ה-wire של Jev, ואומר זאת בגלוי, משום ששרת תואם הוא כל העניין. "Jev-style" הוא הביטוי של הפרויקט עצמו לסוג המודל שהוא בונה. ה-Jev של TypeSafe הוא מודל שונה, סגור ומסחרי, והשניים אינם אותו דבר תחת שם קצר יותר.
בתוך המודל הנוכחי: מגדל Qwen בגודל 4B עם שלוש יציאות
RSI-Jev v6.0-VL הוא מגדל Qwen3.5-4B-Base שעבר כיוונון עדין, ועל גביו ראש החלטה מאומן. זו כל הארכיטקטורה — אין תערובת מומחים, אין נתב, ואין מודל שני. הוא מריץ את כל מודל הבסיס, ולכן מספר הפרמטרים שלו הוא 4.69B ולא משהו קטן יותר: 3.57B נמצאים ב-32 שכבות המפענח, 0.64B בהטמעות הטוקנים, 0.33B במגדל החזותי, 0.05B בראש ההחלטה הראשי ו-0.10B בשני ראשי היציאה המוקדמת. נקודת הביקורת ששוחררה היא עצמאית לחלוטין וגודלה 9.7 GB ב-bf16.
שלושה ראשי החלטה מחוברים, בשכבות 16, 20 ו-32 של הבסיס, והם המנגנון שעומד מאחורי כל מה שהגרסה הנוכחית ידועה בזכותו. יציאה רביעית בשכבה 12 נבנתה, נמדדה והוסרה — "היציאה בשכבה 12 הפסידה למפל מהשכבה 16 בכל השוואה ואינה בחבילה" — כך ששלושה משוחררים וארבעה לא. היציאות קוראות עותק מנותק של השכבה שלהן, פרט שהפרויקט גילה בדרך הקשה: כיוונון מחדש של ראשים על גזע שהיציאות שלו היו מחוברות במהלך האימון לא החזיר את הדיוק של השכבות העמוקות, כך שהניתוק שלהן הוא מה שהחזיר את העומק.
מספר אחד כאן הוא הדרך הקלה ביותר להבין לא נכון את הפרויקט. כל דבר עד ל-v3.0 כולל היה מודל 2B על Qwen3.5-2B-Base, וזו השושלת, לא המודל הנוכחי. v4.0-VL היה 2B, v5.0-VL צמצם מודל ל-3B, ו-v6.0-VL הוא 4. עמוד שמכנה את מודל RSI-Jev הנוכחי 2B מפגר בשלוש מהדורות.
הלולאה היא הפרויקט האמיתי
המודלים הם הפלט; הדבר שנבנה הוא התהליך. הפרויקט מציין ש"הלולאה שמריצה את המחקר היא הגרסה הבאה של AutoScientists", מערכת צוותי הסוכנים המארגנת את עצמה שפורסמה על ידי מעבדת Zitnik בהרווארד, והיא פועלת כפי שמשתמע מאותו משפט. סוכני AI מציעים השערות, רושמים את התחזיות שלהם לפני שהם מוציאים זמן GPU, מריצים את הניסויים, ומוציאים משימוש את האלופים שלהם כאשר הראיות אומרות לעשות זאת. שני מונים ממחישים זאת. נכון ל-2026-10-07, הכותרת של המאגר היא שמונה מהדורות בשלושה עשר ימים, מ-v1.0 עד v6.1-VL; עבור המהדורה של v6.0-VL עצמה ב-2026-10-06 היא הציגה שבע מהדורות בשנים עשר ימים, כל אחת אומנה, הוערכה ותועדה על ידי הלולאה. ומונה הניסויים, שעמד על 471 כשהמהדורה של העמוד הזה יצאה, מציג 496 היום — כל אחד מהם נכתב, כולל כשלונות. שני המונים הם של הפרויקט עצמו, ושניהם זזים.
המשמעת היא מה שנותן למספרים האלה משמעות, והפרויקט מפרט אותה בפשטות. רצפות אפס נמדדות ולא מניחות מראש — זרועות שזהות לבקרה באופן מוכח, מאומתות לפי זהות אובייקט לפני כל שימוש בזמן GPU, כך שהפער ביניהן הוא רצפת הרעש, והפרש קטן מהפער הזה אינו תוצאה. תחזיות נרשמות לפני ההרצה, כך שגרסה שמפספסת את הרף של עצמה משוחררת ככישלון במקום להיחתך מחדש בשקט. ארטיפקטים מאומתים: נקודת ביקורת נטענת מחדש מהדיסק ומקבלת ציון מחדש, ומפורסמת רק אם היא משחזרת את התחזיות לכל שאלה של הרצת האימון שלה, וכך עושות שתי נקודות הביקורת של v1.0 ב-1.0000. זיהום "נבדק ולא מוצהר". וכישלונות משוחררים, כולל אלה שהרגו את האלוף של הפרויקט עצמו.
מהי תרומה, במילותיו של הפרויקט עצמו ממדריך התרומה שלו: "תרומה כאן היא בדרך כלל מדידה, לא תיקון." הרשומה שפורסמה נשמרת כשרשרת ולא כתמונת מצב — "versions/ שומר כרטיס אחד לכל מהדורה, את כולם, על main לנצח… השרשרת הזו היא הפרויקט" — וזו הסיבה שאפשר לבדוק את המספרים של מהדורה ישנה מול מה שהפרויקט אומר עליהם מאוחר יותר, וזו הסיבה שהתיקון האחד שנדון להלן גלוי ולא שקט.
מה השתנה ב-v6.0-VL: הוא מוציא עומק במקום טוקנים
המנגנון של המהדורה הנוכחית הוא הגדרה בשם effort, והוא שולט במשהו יוצא דופן: בכמה שכבות של המודל מותר לבקשה להשתמש. מכיוון שהראשים יושבים בשלושה עומקים, שאלה קלה יכולה להיענות בשכבה 16 ושאלה קשה יכולה לרוץ בכל 32 השכבות. low עוצר בשכבה 16, medium בשכבה 20, high בשכבה 32, ו-auto עונה ביציאה הראשונה שההסתברות המכוילת שלה עוברת את הסף של אותה יציאה. חציון זמן השהיה לבקשה במדגם Decision Index, כפי שנמדד על H200 אחד ב-bf16: 23 ms ב-low, 27 ms ב-medium, 40 ms ב-high, ו-40 ms עבור ברירת המחדל שאינה מוגדרת. אלו המדידות של הפרויקט עצמו על החומרה שלו עצמו, ואין לערבב אותן עם מספרי ה-GB10 שבתיעוד ההגשה, שהם מכונה אחרת.
ההתנהגות הנמדדת של auto היא החלק המעניין: במערך של חמישה-עשר מבחנים של הפרויקט, 20% מהשאלות עוצרות בשכבה 16, 46% בשכבה 20 ו-34% ממשיכות עד 32, מה שנותן ממוצע של 23.3 מתוך 32 שכבות. סף קבוע יחיד ממוצע 20.9, ועצירה-יתר היא מה שסף יחיד קונה לך. auto אינה פשרה על איכות, וכדאי לציין זאת משום שבדרך כלל זה מה שהגדרה אדפטיבית היא: היא מציגה את שורת המערך הטובה ביותר מכל הגדרה (0.771 לעומת 0.770 בברירת המחדל), את שורת MMLU-Pro הטובה ביותר (0.444 לעומת 0.440) ואת הכיול הסופי הטוב ביותר (ECE 0.024 לעומת 0.036). המקום היחיד שבו high מנצח הוא בקבוצה המוחזקת בצד, 0.702 לעומת auto עם 0.696. חלק מהמשימות נעשות גרועות יותר באופן מדיד עם העומק — BANKING77 ב-0.035, התאמת כיתובים ב-New Yorker ב-0.060 — ולכן רמת המאמץ היא בחירה שהצד הקורא עושה ולא כלל שהשרת כופה.
התוצאה שהפכה את זה לגרסה משוחררת ולא לניסוי נמצאת ב-Decision Index 0.2.1 הציבורי של הפרויקט, שבו הציון עלה מ-38.38 עבור v5.0-VL ל-46.24 עבור v6.0-VL בגרסה אחת. בלוח הציבורי שמתוארך ל-2026-09-28 זהו הציון הגבוה ביותר מבין מודלים של 4B וכל דבר קטן יותר, והמקום ה-14 מתוך 71 בסך הכל; הערך הבא בגודל הזה הוא JPT-4B עם 43.04. הגרסאות המוקדמות יותר בקו הזה הן שושלת ולא המודל הנוכחי: v5.0-VL (2026-10-02) קיצרה את המודל ל-20 השכבות הראשונות מתוך 32 וגרמה לו לומר "unknown" כשלשאלה אין תשובה; v4.0-VL (2026-10-01) הייתה הראשונה שקוראת תמונות; ו-v3.0 (2026-09-28) היא הגרסה שבה למידת חיזוק עזרה לראשונה, באמצעות תגמול דירוג listwise — NDCG@5 על 16 מועמדים — שהעלה את R@1 של הדירוג מחדש מ-0.192 ל-0.308 לעומת מודל האב המפוקח שלה במחיר של 0.0028 בערכת ההערכה. שם מתחיל סיפור ה-RL של הפרויקט, וזה כבר שלוש גרסאות אחורה.

המספרים, עם ההסתייגויות שמתלוות אליהם
הכותרת של The Decision Index 0.2.1 עבור v6.0-VL היא 46.24, בהרצה מלאה שבה נענו כל 150,759 הבקשות של הסוויטה: ידע 28.8, שפה 46.2, אחזור 55.5, כלים 65.8, אמנויות 37.1. סוויטת חמישה עשר המדדים מראה 0.770, הסט המוחזק 0.698, MMLU-Pro 0.440, ו-ECE סופי 0.024 עם אוטומטי. שתי הסתייגויות צריכות להיאמר באותה נשימה עם המספרים האלה, כי בלעדיהן המספרים מטעים.
הראשון הוא קיצוץ בסוללה. משימת הסוללה הפנימית open_jev_ood חפפה 579 שורות אימון, כך שמספרה נופח בכמות לא ידועה; מגרסה v6.0-VL ואילך הפרויקט מדווח על הסוללה בלעדיה, ב-0.770. ה-0.764 של v5.0-VL היה איתה, והכרטיס של v6.0-VL מנסח מחדש את אותה מהדורה כ-0.763 בלעדיה. שני המספרים אינם בני השוואה, ואם בכל זאת תשוו אותם, עליכם להשתמש ב-0.763 המנוסח מחדש ולומר שזה מה שאתם עושים. לקבוצת ה-held-out, ל-MMLU-Pro ול-BBH אין חפיפה והם אינם מושפעים. ביקורת קשורה מצאה כ-1,000 פריטים משורות המבחן של ערכת Decision Index בתאגידי האימון — ANLI 274, RouterBench-GSM8K 90, ARC 5, וטקסט שאילתות של BRIGHT/ToolRet בלי תוויות, בערך 0.3% משורות הערכה — וניקוד מחדש בלעדיהם מזיז את האינדקס לכל היותר ב-0.04 במדגם של הפרויקט. זהו תיקון לתיעוד של v5.0-VL, שפורסם בכרטיס של v6.0-VL, וזהו כלל הזיהום של הפרויקט עצמו שעולה לו במספר.
הנקודה השנייה היא למי שייך הבנצ'מרק הזה. Decision Index הוא לוח פומבי של RSI-Jev עצמו, ולא קביעה של צד שלישי, ו-46.24 הוא ציון באותו לוח. הוא אינו בר-השוואה לשום דבר שפורסם על ידי TypeSafe, משום ששני המספרים אינם מגיעים מאותה מערכת בדיקה, ואף אחד לא ערך השוואה ישירה ובלתי תלויה בין RSI-Jev ל-Jev 1.13. מה שאפשר לומר הוא מבני ולא מספרי: האחד הוא מודל מסחרי מתארח בנקודת קצה של ספק, והאחר הוא צ'קפוינט שאתה מוריד ומריץ בעצמך.
שתי פיסות הקשר נוספות שייכות לסט. הפרויקט מציין במפורש ש"עשרה מתוך חמישה־עשר הבנצ'מרקים תורמים נתוני אימון בצורה כלשהי, כך שאף אחד מהמספרים האלה אינו זירו־שוט"; קבוצת ה־held-out היא ההשוואה שמוחזקת בנפרד, ואפילו היא "מוחזקת מחוץ לאימון, לא אטומה לחיפוש". ו-v6.0-VL הריץ 97 זרועות בקו משלו — 93 אם משמיטים את ארבעת ביקורות הנתונים — וזה היקף החיפוש שהפיק זינוק של 7.86 נקודות באותו מדד.
הוא מדבר בפורמט ה־wire של Jev, עם ארבעה הבדלים שקורא צריך לדעת
משטח התאימות הוא הסיבה שהפרויקט הזה קיים בצורה שבה הוא קיים. אותו מבנה בקשה ({state, model, questions}), אותם שלושה סוגי שאלות עם אותם מבני קריטריונים, אותם מבני תשובות, אותם 1 עד 64 שאלות לבקשה, אותן מעטפות שגיאה, ואותה סטטיסטיקת ביטחון — השיא, (K · p_max − 1) / (K − 1), חסום ל-0..1. הטענה של הפרויקט עצמו לגבי משטח הזה היא ש"כל מה שנכתב מול Jev עובד מול זה ללא שינויים", והשרת מתעד מה מועתק ומה לא, וזה שימושי יותר מהטענה.
• הפרומפט והקריאה הם משלו. RSI-Jev הוא מודל בסיס עם ראש קריאה מאומן, המוגש עם המקודד שאיתו אומן, מכיוון ששימוש בפרומפט של הייחוס "יוציא את המודל מחוץ להתפלגות האימון שלו". חוזה התקשורת הוא משטח התאימות; הפרומפט אינו.
• מפתחות האפשרויות גלויים למודל. הייחוס מסתיר אותם, כך ששינוי שם של מפתח לא יכול, באופן מוכח, לשנות תשובה שם. כאן זה כן יכול, והשרת מדווח על כך בכנות כ-option_keys_visible_to_model: true.
• הקריטריונים חייבים להיות מחרוזות או null. קריטריון מובנה — אובייקט — נדחה עם 422, מכיוון שאף מהדורה לא אומנה על אחד כזה. זה המקום היחיד שבו בקשה שמערכת הייחוס מקבלת לא תרוץ כאן.
• שום דבר לא נחתך. ההגשה מאפשרת עד 32,768 טוקנים של טקסט בתוספת תקציב התמונות, ובקשה ארוכה יותר נדחית עם 422 שמציין זאת במקום להיחתך בשקט. נתון 2,048 הטוקנים שמופיע בכרטיסים הישנים הוא האורך שעליו אומנו המודלים, ולא תקרת הגשה, ותיאור חיתוך שקט ל-2,048 כהתנהגות נוכחית הוא שגוי.
מספרי האפשרויות נבדלים בפער עצום לטובת ה-serving: עד 5,120 אפשרויות לשאלה (RSIJEV_MAX_ANSWERS), לעומת 160 באימון ו-64 שהרפרנס מאפשר. אין לצטט 160 כתקרת ה-serving. דבר אחד בתשובות של v6.0-VL הוא חדש ולא ירשוּתי: כל תשובה מדווחת איזו שכבה ענתה, ב-usage.depth, לצד הביטחון המכויל, כך שניתן לבחון בדיעבד החלטה אדפטיבית. תמונות הן הרחבה שאין לרפרנס — אחת עד ארבע לבקשה, כ-base64 data URLs, כשהמצב מפנה לכל אחת באמצעות סמן מילולי.
היכן שקורא יכול למעשה להריץ אותו, והיכן שאינו יכול.
RSI-Jev הוא הורדה. הפרויקט מספק שרת משלו, שמדבר API תואם Jev, והמסלול המתועד הוא התקנת pip מהמאגר ואחריה פקודת serve עם כינוי ה-checkpoint והגדרת effort. המשקולות נמצאות ב-Hugging Face תחת ארגון shgao, משוחררות תחת Apache-2.0 בהתאם למודל הבסיס, עם שאלה פתוחה אחת שהפרויקט מצהיר עליה בעצמו: חמישה ממקורות אימון התמונות הם לא מסחריים או למחקר בלבד, ו"האם משקולות שאומנו על נתונים לא מסחריים יורשות את התנאים הללו לא הוכרע". הקוד הוא MIT.
החומרה אינה המגבלה. הפרויקט מפותח על HP ZGX Nano, מכונת NVIDIA GB10 שאותה הוא מזכה את HP ואת NVIDIA, והשרת פועל על כל GPU CUDA, על Apple Silicon, או על CPU רגיל — שהתיעוד מתמחר את האחרון שבהם ב-733 מ״ש עבור שאלה בודדת על ה-CPU מסוג Arm של ה-GB10 עצמו, כך ששמיש ולא מהיר.
מה שהוא לא עושה הוא להופיע בקטלוג מודלים כללי, וכאן אנחנו צריכים להיות מדויקים לגבי העמדה שלנו. RSI-Jev לא נמצא ב-OrcaRouter ואין כרטיס מודל שהוא יכול לנתב אליו. מה שאנחנו מספקים הוא Jev המסחרי של TypeSafe, typesafe/jev-1.13, בנקודת הקצה הייעודית systemone, שאליה מגיעים ב-POST אל /v1/systemone ולא בצורת chat-completions של OpenAI — אותם מבני בקשה ותשובה שהפרויקט הזה מיישם, מהמודל שהוא מעתיק את החוזה שלו. זה כל הקשר: השניים מדברים באותו פרוטוקול, אנחנו מספקים אחד מהם, ואתה מריץ את האחר בעצמך. אם כבר יש לך מפתח אצלנו, צורת הקריאה של Jev 1.13 היא נתיב מהשורה הראשונה ב-one API for 200+ models with 0% markup (מחיר המחירון של הספק מועבר הלאה, כך שהנחות המחיר של הספק פעילות כאן באותו יום) — וזה חשוב להשוואה בדרך אחת ספציפית. עמוד כמו זה זול לפעולה אם אתה יכול לנסות קודם את החוזה המסחרי ורק אחר כך להחליט אם להריץ בעצמך צ'קפוינט פתוח של 4B שווה את העבודה התפעולית.

איך לקרוא את RSI-Jev ב-2026-10-07
החולשות שהפרויקט מפרסם ספציפיות כמו התוצאות שלו, והתאריכים חשובים. בדיקה חיצונית של v2.1 מצאה שהמודל נוטה לאפשרות החמורה או היקרה יותר בבחירות מסודרות ובציוני רובריקה, לעתים רחוקות בוחר "unknown" כאשר המסמך אינו יכול להשיב, ועונה על שאלה ועל שלילתה באופן לא עקבי. מהדורות מאוחרות יותר כיוונו נתונים למקרה ה"unknown" — KoBBQ unknown-when-ambiguous הגיע ל-0.891 ב-v4.0-VL, ל-0.932 ב-v5.0-VL, ול-0.918 / 0.939 ב-v6.0-VL — וכרטיס v6.0-VL גלוי לב שהרווחים באו מנתונים ולא מעומק, ושה-10% מהשאלות שהיו הולכות לשכבה 32 ועוצרות ב-16 או 20 הן המקום שבו מדיניות העומק עדיין מנחשת. לדירוג מחדש יש עוד דרך לעבור: סדר האחזור של hippo-memory עצמו מדורג 0.484 R@1 ונשאר לפני ה-0.308 שאליו המודל הגיע ב-v3.0, נתון שהפרויקט לא טען לסגור מאז. הראיות של RL הן זרע אחד, ול-v3.0 "בעצמו אין בקרת SFT מותאמת." קורפוסי האימון וקבוצות פיתוח המדיניות אינם פומביים, כך שלא ניתן להריץ מחדש את השלבים מהמאגר בלבד, ובונה קורפוס הדירוג מחדש — כ-96 GB של זיכרון — לא הורץ מחדש מקצה לקצה.
תנופה, כפי שנקראה באותו היום: 73 כוכבים, 5 פורקים, 0 issues פתוחים, 7 מהדורות ב-GitHub. אלה משתנים מדי יום, ומאגר בן שלושה שבועות אינו פרויקט מבוסס, ולא משנה מה קצב המהדורות שלו. הסיכום הכנה הוא ש-RSI-Jev הוא אחד ממאמצי המחקר הקריאים יותר בפינה הזו של התחום — שרשרת של מהדורות מתוארכות, מדודות, שלעיתים מפסידות, כשהחיפוש מתפרסם לצד הציונים — ואחד הפחות מאומתים באופן בלתי תלוי, מכיוון שכמעט כל מספר בעמוד הזה מקורו בעצמו, ואף גורם חיצוני לא ערך לו בנצ'מרק מול המודל המסחרי שאיתו הוא תואם.
מה שכדאי לשים לב אליו אינו הגרסה הבאה, כי בקצב הזה תהיה אחת בתוך ימים; אלא האם משהו מחוץ לפרויקט מתחיל למדוד. שני הדברים שישנו את התמונה הם הרצת בנצ'מרק עצמאית על הצ'קפוינטים שפורסמו, והשוואת מודלי החלטה שמעבירה גם את ה-4B הפתוח וגם את המודל המתארח של TypeSafe דרך רתמת בדיקה אחת. אף אחד מהשניים אינו קיים היום. עד שאחד מהם יהיה קיים, הדרך המועילה לקרוא ציון כמו 46.24 היא כטענה מתועדת היטב מפרויקט שרושם את התחזיות שלו מראש ומפרסם גם את הזרועות שנכשלו — וזהו שובל ראיות חזק יותר מרוב האחרים, ועדיין אינו תוצאה של צד שלישי.
