כרטיס כותרת שנוצר, שכותרתו 'שיפור עצמי רקורסיבי, מוסבר', עם כותרת המשנה 'לולאה סגורה היא לולאה מנוקדת, והניקוד הוא כל השאלה', מעל שורה של שלושה כרטיסים מעוגלים שעליהם כתוב 'תחזיות נרשמו לפני הריצה', 'רצפות null נמדדו, לא הונחו' ו'כשלים נשלחים, כולל זה של האלוף'; כותרת תחתונה אומרת 'דוגמה פתורה: RSI-Jev v6.0-VL, פורסם 2026-10-06; הרשומה של הפרויקט עצמו, נקראה 2026-10-08.', עם אייקונים מינימליים בקו שטוח ולוגו OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

שיפור עצמי רקורסיבי, מוסבר דרך פרויקט שבאמת עושה זאת

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

"שיפור עצמי רקורסיבי" הוא אחד מאותם מונחים שמשמשים בעיקר כדי לציין תחושה. כשהוא מוגדר בלי מיסטיקה, הוא צר מזה ומעניין יותר: מערכת שמציעה את הניסוי הבא של עצמה, מריצה אותו, ומשאירה או פורשת את התוצאה לפי כלל שנקבע מראש, כשהתוצאות מזינות את הסבב הבא. הרקורסיה אינה קסם והיא אינה חסומה — זהו לולאה עם פונקציית ניקוד, ואיכותה נקבעת כולה בכמה בכנות מיושמת פונקציית הניקוד הזו. RSI-Jev, הפרויקט הפתוח של צד שלישי שבונה מודלים להחלטה מסוג System One בסגנון Jev, הוא מקרה נדיר שבו אפשר לקרוא את הלולאה במקום להתווכח עליה: כל השערה, כל זרוע שנכשלה וכל מהדורה מתפרסמות עם המספרים שלהן, והמאגר מתוארך יום אחר יום. המודל שהעמוד הזה משתמש בו כדוגמה מעובדת הוא RSI-Jev v6.0-VL, מודל החלטה עם טיפוסים בגודל 4B שפורסם ב-2026-10-06, שנמצא בתוך השבוע האחרון. הוא אינו Jev של TypeSafe ואינו קשור ל-TypeSafe AI — שורת הרישיון של הפרויקט עצמו אומרת בדיוק זאת, ומה שאנחנו מספקים ב-OrcaRouter הוא האחר, typesafe/jev-1.13, בנקודת הקצה systemone שלנו.

הבהרה אחת לפני שהמילה "משתפר-עצמית" עושה עבודה כלשהי, ואחריה תאריך אחד. זה לא מודל שמשכתב את עצמו ללא גבול, ושום דבר בעמוד הזה לא אמור להתפרש כך. הלולאה המדוברת משכתבת מתכון: היא מציעה שינוי באימון, רושמת מה היא מצפה שהשינוי הזה יעשה, משקיעה זמן GPU, ואז או שהיא משאירה את השינוי או מתעדת למה הוא הפסיד. המודל הוא מגדל Qwen3.5-4B-Base עם ראשי החלטה מאומנים — ארכיטקטורה קבועה שאומנה על ידי סקריפט אימון קבוע, כשהחיפוש מתרחש על פני נתונים, מטרות ושלבים. הלולאה מריצה ניסויים משלה ומפרישה את האלופים שלה. אנשים מחליטים מה שווה למדוד. והתאריך: v6.0-VL פורסם ב-2026-10-06, והפרויקט פרסם מאז מהדורה נוספת — הקו נע בערך מדי יום, והנתונים בעמוד זה הם אלו שמצורפים למהדורה הנקובה כאן, מתוארכים למקום שבו נקראו. כדאי לומר זאת מראש בעמוד שעניינו לולאה שממשיכה לרוץ.

מה המשמעות של המונח, בניסוח יבש

אם מפשיטים את הביטוי, יש בו שלושה חלקים, וכולם שגרתיים. ראשית, מרחב חיפוש: קבוצת הדברים שאפשר לשנות. שנית, מעריך: משהו שאומר אם שינוי עזר. שלישית, תיעוד: מה נוסה, מה קרה, ומה נזרק. מערכת מבצעת שיפור עצמי רקורסיבי כאשר הפלט של סבב N הוא הקלט של סבב N+1 בכל שלושת החלקים האלה, בלי שאדם יגזור מחדש את מרחב החיפוש או יחליט מחדש על הסף בכל פעם.

מה שרוב הכתיבה על הנושא מפספסת הוא החלק השני, ושם חי כל העניין. לופ עם מדרג חלש מייעל את המדרג. הוא יפיק קו עולה באופן מונוטוני ומערכת שלמדה את הצורה של המבחן של עצמה. הכשל הזה לא דורש זדון או באג — זה מה שקורה כברירת מחדל כשאתה משתמש באותו מספר גם כדי לבחור וגם כדי לדווח. לכן כשאתה קורא טענה שמערכת כלשהי משתפרת את עצמה, השאלה המועילה היא אף פעם לא "בכמה היא השתפרה". היא "מי קבע את הרף, מתי, והאם הוא יכול לזוז אחרי שהתוצאה נראתה".

הגרסאות הפופולריות של המושג הזה — אלה שמדורגות עבור המונח כיום — הן ברובן צופות פני עתיד: הערך בוויקיפדיה מתאר מערכת שמשכתבת את הקוד של עצמה לעבר "פיצוץ אינטליגנציה", והסיקור הרחב יותר נוטה לעסוק בשאלה אם לוח הזמנים הזה קרוב יותר או רחוק יותר מהתחזית. זהו טיעון לגיטימי, ואין עליו תשובה עם הראיות שיש למישהו כיום. מה שכן ניתן לענות עליו הוא השאלה הקטנה יותר, והיא אם לולאה סגורה מהסוג שתואר לעיל יכולה להיבנות ולהיות מחויבת לכללים של עצמה ממש עכשיו. לשם כך, פרויקט אחד עם ארטיפקטים פומביים עדיף על עשור של ספקולציות, ועל זה עוסק שאר הדף.

סגור, לא רק איטרטיבי: חמישה מנגנונים

לולאה אינה סגורה מפני שהיא חוזרת על עצמה. הרבה צינורות אוטומטיים חוזרים על עצמם בלי להיסגר לעולם, מפני שצינור שמסוגל לכוונן את הסף שלו לאחר שראה את התוצאה עושה משהו שונה מהותית מכזה שאינו יכול. הכללים של RSI-Jev עצמו מפורשים באופן יוצא דופן בנוגע להבדל, וניתן לקרוא אותם כהגדרות ולא כמניפסט. חמישה מהם עושים את רוב העבודה.

תחזיות נרשמות לפני ההרצה. השערה נכתבת יחד עם המספר שהיא מצפה שיזוז ובכמה, לפני שמושקע זמן GPU. גרסה שמפספסת את הרף שקבעה לעצמה יוצאת ככישלון במקום שתיחתך מחדש בשקט. זהו המנגנון שמונע מהלולאה להפוך למכונה לכתיבת הסברים בדיעבד, ויש לכך מחיר ממשי: התיעוד מכיל פריטים שכל תוכנם הוא שמישהו טעה בתיעוד.

רצפות אפס נמדדות, ולא מניחים אותן. הצוות מריץ זרועות שהן זהות באופן מוכח לביקורת — מאומתות לפי זהות אובייקט לפני כל זמן GPU — והפיזור בין אותן זרועות הוא רצפת הרעש. הפרש קטן יותר מאותה רצפה אינו תוצאה, יהא אשר יהא מראהו. הרף של הפרויקט עצמו משקף זאת: בסוויטה הפנימית שלו הסף הוא +0.006, עם סטיית תקן לפי זרע במדד בודד של 0.011–0.016, כך שהפרשים במדד בודד מתחת לכך אינם ממצאים. רוב הרעש בתחום הזה נמדד, ולא סטטיסטי.

קבוצה מוחזקת מתכלה ברגע שנקראת. כל מהדורה קוראת את הקבוצה המוחזקת פעם אחת, כך שעדיין אפשר להשוות שתי מהדורות בתנאים שווים — ומכיוון שקריאה בה מכלה אותה, כל מהדורה מקפיאה את ההשוואה של המהדורה הבאה. הניסוח של הפרויקט עצמו ראוי להישמר כפי שהוא: הקבוצה המוחזקת "מוחזקת מחוץ לאימון, ולא אטומה בפני החיפוש". היא בדיקה של שינון, לא ערובה לחדשנות. ובנתון של הסוויטה עצמו יש חור שהפרויקט פרסם: משימה פנימית חפפה כמה מאות שורות אימון, לכן החל מ-v6.0-VL ואילך הסוויטה מדווחת בלעדיה — 0.770 — וה-0.764 המוקדם יותר של v5.0-VL הוצג מחדש כ-0.763 בלעדיה. ההצגה מחדש הזו היא העיקר. מספר הלך ותפח, הסיבה נמצאה, וכרטיס המהדורה הישנה תוקן במקום להישאר בעינו.

כישלונות יוצאים לאור, כולל אלה שהרגו את האלוף של הפרויקט עצמו. המספרים הכותרתיים של המאגר, כפי שנקראו ב-2026-10-08, עקביים: שמונה מהדורות בשלושה עשר ימים, ומאות ניסויים שתועדו בכתב, כולל הכישלונות. מתייחסים לתוצאה שלילית כאל המוצר. המדריך לתורמים ישיר באשר לסיבה — החלק היקר בחיפוש אינו הרצת המנצח, אלא הרצת המפסידים, ולכן שלילי מדוד היטב מבחוץ מסיר ענף ושווה יותר מתוצאה חיובית קטנה.

שרשרת השחרורים היא הפרויקט. כרטיס אחד לכל שחרור, כולם, על ענף main באופן קבוע. כל כרטיס נושא את המספרים של השחרור שלו, כך שהמהירות והכיול של גרסה אחת לעולם לא דורסים את אלה של אחרת. הפרויקט מציין את הסיבה ישירות: השרשרת הזו היא הדרך היחידה לראות אם לולאה שמשפרת את עצמה אכן משתפרת. כל השאר — המתכון, הסקריפטים, המחסנית המקובעת — נושא רק את השחרור הנוכחי, כי הכלל ההפוך יהפוך את זה לבלתי אפשרי לדעת מה נוכחי. נקודת ביקורת שפורסמה נושאת את הקוד של עצמה כך ששחרורים ישנים נשארים ניתנים להרצה בלי ענפים ישנים.

A screenshot of the subject project's own GitHub repository page, Shanghua-Gao / RSI-Jev, showing the repository description 'Typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents - checkpoints, the code that produced them, and every version that failed', the sidebar counters 80 stars, 5 forks and 1 watching, 198 commits and 8 releases, the newest release headed 'RSI-Jev v6.1-VL 4B', an MIT license line, the topic tags ai-agents, autonomous-research, decision-model, jev, recursive-self-improvement, system-one and typed-decisions, and the merge commit 'Merge pull request #33 from Shanghua-Gao/release-v6.1-vl' at the top of the commit list.

מה עולה המשמעת, ומה היא קונה

שני סיפורים מהתיעוד הם משקל הנגד הכן למילה ״self-improving״, משום ששניהם מקרים שבהם הכללים של הלולאה עצמה הפכו את העבודה לאיטית יותר וטובה יותר בו-זמנית.

הראשון הוא הבאג שעומד מאחורי v1.0. מציאתו דרשה רישום של שבע תוצאות שליליות. כל אחת משבע אלה הייתה תיקון בצד האופטימיזר שהפחית חוסר יציבות באימון בלי להסיר אותו, מפני שהגורם היה טעות דיוק שלא הייתה בשום מקום קרוב לאופטימיזר — והתיקון בסופו של דבר היה שורה אחת. אף אחת מהשבע לא הייתה שווה פרסום בפני עצמה. יחד הן מה שאיפשר בכלל למצוא את הגורם, וזה כל הטיעון בעד רישום ושמירה של תוצאות שליליות: הערך שלהן הוא משותף, לא פרטני.

הדבר השני פחות מחמיא, והפרויקט מפרסם אותו בכל זאת, בהערת שוליים. זרוע מוקדמת נכשלה בדיוק במגן אחד — MMLU-Pro עמד על 0.026 מתחת לרף, אל מול מגבלה של 0.020 — ותועדה כנדחית. בעל הריצה הרחיב אז את המגבלה ל-0.030, בנימוק ש-MMLU-Pro הוא מגן מפני שכחה ולא יעד, והזרוע אושרה על ארבעה זרעים חדשים והפכה לשחרור הבא. הדחייה המקורית הושארה ביומן, עם הערת הפרויקט עצמו, שהזזת רף לאחר ראיית התוצאה היא מסוג הדברים שקריא אמור להיות מסוגל לתפוס את הפרויקט כשהוא עושה זאת.

הערת השוליים הזו היא הפסקה השימושית ביותר במאגר לכל מי שמנסה להעריך טענה מסוג זה בשטח. רף שזז אינו הוכחה לחוסר תום לב — הנימוק שניתן הוא בר-הגנה, והרף שהורחב נאלץ אז לשרוד ארבעה זרעים חדשים. אבל רף שזז בשקט הוא לולאה שכבר אינה סגורה, וההבדל בין השניים הוא כולו בשאלה אם הדבר נרשם. הכלל הכללי שהפרויקט אימץ לאחר מכן הוא זה שראוי להעביר למערכות אחרות: כמעט-כשל שנכשל בדיוק בשומר אחד זוכה לאבחון ותיקון ממוקד במקום להיזרק — ואם התיקון נכשל, הוא הופך למבוי סתום עם תיעוד.

באיזו תדירות הלולאה שגויה: ארבעה עשר סידורים, שניים נשמרו

הנה המספר שיש להחזיק בו. דרך הגרסה שקוראת תמונות, הפרויקט סופר ארבעה עשר מערכי למידת חיזוק ו-63 זרועות שאומנו באמצעות תגמול. שתיים נשמרו.

כל תצורה נבחנה מול ביקורת מונחית שאומנה על אותם פריטים במשך אותו מספר צעדים, וזו ההשוואה שהופכת את הספירה למשמעותית — זרוע RL שמנצחת קו בסיס שהיא מעולם לא נדרשה להשתוות אליו לא מוכיחה דבר. ההפסדים המלמדים, במילותיו של הפרויקט:

• למידת חיזוק (RL) של נכונות בינארית — פלט ההסתברות קרס ל-0 ול-1. תגמול על עצם הבחירה הנכונה במקום על היושר של הסיכויים המדווחים דוחף התפלגות אל הפינות, ומודל החלטה שהביטחון שלו תמיד מוחלט הוא חסר תועלת למטרה שלשמה נועדו מודלים של החלטה.

• RL עם Proper-score, השחזור של פונקציית המטרה בסגנון Laya — בסדר ב-300 צעדים, התבדר ב-1,500. יציב כשלא עשה כמעט כלום, ולא יציב בדיוק כשהתחיל להיות חשוב.

• RLCR — השתווה בדיוק, אך עם כיול גולמי גרוע יותר. הוא לא קנה שום יכולת, ושילם על כך בתכונה היחידה שלשמה המודל קיים.

• Bandit RLCD, שבו נחשפת רק התוצאה של האפשרות הנבחרת — לא טוב יותר מאימון מונחה על אותו משוב. הפרויקט חיסל כאן את המבחן הרשום מראש של עצמו: הזרוע הייתה צריכה לגבור על אימון מונחה בלפחות שניים מתוך ארבעה מדדי כיול, וניצחה באחד.

המנצח, והסיבה לכך שניצח, הוא הממצא הניתן להעברה ביותר בעמוד. זהו תגמול ברמת רשימה — איכות דירוג הנמדדת על פני הסדר של מועמדים רבים שנמדדו בנפרד, במקום התייחסות לכל אחד מהם בנפרד. Recall של דירוג מחדש במקום הראשון עלה מ-0.192 עבור האב המפוקח ל-0.308, עם ניצחונות והפסדים במבחן מזווג. ההסבר של הפרויקט אינו סיפור של כיוונון: מטרת אימון פר-פריט נותנת ציון לכל מועמד בנפרד, ואין תווית בודדת שמקודדת את האיכות של סדר בין מועמדים. במקום שבו התגמול אמר משהו שהתוויות לא יכולות לבטא, RL ניצח את האימון המפוקח על אותן שורות. במקום שבו הוא לא עשה זאת, האימון המפוקח השווה לו.

זה מכליל לכלל לגבי מתי סוג כזה של לולאה יכול למצוא משהו בכלל. כאשר יש ביד תווית זהב, עדכון הגרדיאנט-המדיניות הצפוי שווה לגרדיאנט של הפסד מפוקח — הניסוח של הפרויקט עצמו — ולכן "זרוע RL" המדורגת מול החלטות מתויגות היא למעשה זרוע לעיצוב הפסד. ושינויים ברמת ההפסד הזיזו את החבילה הפנימית לכל היותר ב-0.002, בעוד שנתונים חדשים הזיזו אותה ב-0.13. בקריאה משותפת: כוח ההשפעה של הלולאה מעולם לא היה במטרה. הוא היה במה שנמדד ובמה שהוזן פנימה.

זו התשובה הכנה לשאלה שקורא צודק לשאול. מערכי RL מצוטטים במקומות אחרים כראיה על שיפור עצמי באופן כללי; כאן הם ראיה על לולאה אחת במשימות החלטה. תוצאת ה-listwise היא זרע אחד, והפרויקט אומר זאת: ההשוואה המזווגת בין RL ללמידה מונחית הורצה על אב שונה מזה שאליו יישמה המהדורה אותו, ומהדורה זו "אין לה בקרת למידה מונחית מותאמת". ממצא שמצורפת לו ההסתייגות הזו שווה יותר מממצא בלעדיה, וזו הסיבה שהעמוד שאתה קורא לא מכליל אותו.

היכן שהאדם יושב

הפרויקט מפורש, והמפורשות היא החלק המעניין: הלולאה מריצה ניסויים משלה ומפרישה את האלופים שלה, אבל היא לא מחליטה מה שווה למדוד, והיא לא שמה לב בעצמה מתי מספר נכון מבחינה טכנית אך מטעה מבחינה מעשית. אנשים עושים זאת.

שניים מהכללים של הפרויקט עצמו קיימים כי מישהו התנגד. המגן של MMLU-Pro הורחב במקום לתת לכמעט-כשל להיזרק. דרישת הזרע כעת משתנה בהתאם לגודל האפקט במקום לבזבז ארבעה זרעים על כל הבדל — כי זרע האישור, המספר היחיד שזרוע לא נבחרה על פיו, הוא הנושא את המשקל, ולבזבז כוח מחשוב על הבדלים שאתה כבר רואה לא מועיל בכלום. אחת הגרסאות בשרשרת התחילה כסירוב לזרוק זרוע שנכשלה במגן אחד. הפרויקט נותן קרדיט בשמם לאנשים ששלחו את המשוב הזה, בתודות.

אז "השתפרות עצמית" כאן מתארת את אמצע הלולאה, לא את כולה. הלולאה היא חיפוש שרץ בלי שאדם מסובב את הידית. האדם עדיין נמצא בראש הלולאה ובוחר את המטרה, ובתחתיתה קורא את התוצאה בביקורתיות — וזה בדיוק הסידור שמונע מהלולאה להפוך למכונה לאישור העדפותיה שלה. כל תיאור של השתפרות עצמית רקורסיבית שמשמיט את המושב הזה מתאר מערכת שונה מזו, וכנראה מערכת היפותטית.

מה שהמספרים של הפרויקט עצמו לא מראים

הדיסציפלינה שלעיל ראויה לתיאור רק אם גבולותיה נאמרים באותה נשימה, והרשומה של RSI-Jev מצהירה עליהם מעצמה.

• זהו פרויקט אחד, גודל מודל אחד בכל פעם, זרע אחד. הצ'קפוינט שפורסם הוא של זרע בודד, שנקבע מראש כעיקרי ולא נבחר כדי להשיג את הניקוד הטוב ביותר. הראיות מ-RL הן מזרע אחד.

אלו משימות החלטה, לא יצירה: שאלה מסוג כן/לא, בחירה באחד מתוך k או דירוג לפי מחוון על מסמך, צ'אט או תמונה, שנענית במעבר קדימה אחד עם הסתברות מכוילת לכל אפשרות. שום דבר לא נוצר, כך שאין אסימוני חשיבה לבזבז. מה שהלולאה מדגימה כאן הוא שהיא יכולה לשפר מנקד מהצורה הזו.

• חלק ממנו אינו ניתן לשחזור מהמאגר בלבד. קורפוסי האימון וסטים לפיתוח מדיניות אינם ציבוריים, והפרויקט אומר זאת במפורש בכרטיס השחרור: "לא ניתן להריץ מחדש את השלבים מהמאגר הזה בלבד." בונה קורפוס אחד זקוק לכ-96 ג'יגה-בייט של זיכרון ולא הורץ מחדש מקצה לקצה.

• לא הכול ניתן לבדיקה בכלל. חבילת הבדיקות הפנימית מעולם לא הוחזקה במלואה מחוץ לאימון. מבין חמישה־עשר הבנצ'מרקים, עשרה תורמים נתוני אימון בצורה כלשהי, כך שאף אחד מהמספרים האלה אינו זירו-שוט — הסט המוחזק מחוץ לאימון הוא ההשוואה שמוחזקת מחוץ לאימון, והוא היחיד.

ולחלקים החיצוניים יש רקמת צלקת משלהם. ביקורת שנערכה לאחר מהדורה אחת מצאה כאלף פריטים משורות המבחן של ערכת הבנצ'מרק הציבורית במאגרי האימון — כ-0.3% משורות הערכה, כאשר התרומה הבודדת הגדולה ביותר היא כמה מאות שורות ממקור אחד. לאחר ניקוד מחדש בלעדיהם, המדד משתנה לכל היותר ב-0.04. תיקון זה פורסם בכרטיס המהדורה הבאה במקום להיות מיושם בשקט, לפי הכלל שהפרויקט מצהיר עליו: "אין זיהום — בודקים, לא מצהירים." זהו כלל שעולה להם מספר, וזה הסוג היחיד של כלל ששווה להחזיק בו.

היכן ניתן להריץ אותו בפועל — והיכן לא

אין כאן דבר שמוגש על ידי OrcaRouter. הקטלוג שלנו אינו כולל מזהה RSI-Jev ואין עבורו כרטיס מודל, ולא יהיה כזה עד שמישהו יגיש אותו. RSI-Jev מותקן מהמאגר שלו ומריץ שרת משלו, שמדבר את Jev API: מפנים אליו לקוח Jev קיים ומשנים את כתובת ה-URL הבסיסית. הוא פועל על Linux, Windows ו-macOS, על CUDA GPU, Apple Silicon או CPU רגיל.

The one model we do host is the other side of that contract. TypeSafe's Jev 1.13, which we serve as typesafe/jev-1.13, is the commercial decision model whose request and answer shapes RSI-Jev reproduces, and it is reached on our dedicated systemone endpoint rather than through the chat-completions shape. That is the whole relationship, and it is a structural one rather than a quality claim: one is a hosted commercial model on a vendor's endpoint, the other is a checkpoint you download and serve yourself. Nobody has run an independent head-to-head between them, and this page is not going to declare a winner from two different harnesses.

A generated single-column scoreboard headed 'RSI-Jev - the loop's own ledger', with six rows reading 'Predictions: registered before the run', 'Null floors: measured from identical arms', 'Held-out set: read once, then spent', 'Failures: published, including the champion's', 'Release chain: one card per release, on main forever' and 'RL setups kept: 2 of 14, each judged against a matched control'; a footer reads 'All figures from the project's own record, read 2026-10-08.'

אם מה שאתם רוצים הוא להעמיד מודל החלטות כמו זה מאחורי אפליקציה, שאלת הניתוב נפרדת משאלת המודל, והיא החלק שקובע אם בכלל שווה להריץ את הניסוי. OrcaRouter הוא API אחד ל‑200+ מודלים עם 0% תוספת מחיר — מחיר המחירון של הספק מועבר הלאה כמו שהוא, כך ששינוי מחיר של ספק הוא המחיר שלכם באותו יום — ובנוסף מעבר אוטומטי בין ספקים (failover) ו‑DSL לניתוב להרכבת כמה מודלים לקריאה אחת. עבור מודל לופ שעדיין אינכם יכולים לקרוא לו דרך API כללי, זה משנה באופן ספציפי: זה אומר שהמועמדים החלופיים שאיתם הייתם משווים אותו כבר נמצאים מאחורי מפתח אחד, וההשוואה היא שינוי בקונפיגורציה ולא אינטגרציה שנייה.

A screenshot of OrcaRouter's own model page for typesafe/jev-1.13 showing the left navigation, a PERFORMANCE panel with prefill and decode lines, the heading 'Jev 1.13' with the provider line 'typesafe', the price fields $0.11 prefill and $0.36 decode per million tokens, a benchmark box with MED 0.3, Response Trust 0.784, Structured Output 0.964, Refusal Correctness 1.0 and Consistency 0.59, an accuracy-versus-cost scatter with a 'Jev 1.13' marker, an 'Individual Runs' table, API and Agent curl snippets pointing at the systemone endpoint, the OrcaRouter logo and a sign-up button.

החלק ששווה לשמור

הסיבה לכתוב על שיפור עצמי רקורסיבי דרך פרויקט כמו זה, ולא דרך הטיעון האם הוא מוביל למשהו דרמטי, היא שכללי הלולאה הם החלק הניתן להעברה והספקולציה לא. תחזיות רשומות, רצפות אפס מדודות, ערכות מוחזקות שנוצלו, כישלונות שפורסמו, שרשרת שחרורים בלתי ניתנת לשינוי: אף אחד מאלה אינו תכונה של תבונה על-אנושית. הן תכונות של מעבדה שהחליטה להיות ניתנת לבדיקה, והן זמינות לכל צוות שמריץ חיפוש אוטומטי היום, בכל קנה מידה, על כל מודל.

בקריאה כזו, הטענה המעניינת ברשומה של RSI-Jev היא לא הציון. אלא שספר החשבונות של הלולאה עצמה אומר שהיא טעתה הרבה יותר פעמים משצדקה — שני מתכונים שנשמרו מתוך ארבעה־עשר מערכים, שבעה שליליים כדי למצוא באג של שורה אחת, רף שזז ונרשם — ושהמיזם פרסם את ספר החשבונות. עלייה מ-38.38 ל-46.24 במדד ציבורי במהדורה אחת היא קוריוז בלי הכשלים שלצידה. הכשלים הם מה שנותן למספר משמעות.

וזו העמדה הכנה לגבי המונח עצמו. השאלה אינה אם מערכת יכולה לשפר את עצמה. אלא אם השיפור נמדד על ידי משהו שיכול היה לומר לא. במקום שבו ההפרדה הזו אמיתית וכתובה, הלולאה שווה קריאה. במקום שבו היא אינה כזו, קו עולה הוא תיאור של נותן ציון, לא של מערכת שמשתפרת — ושום כמות של רקורסיה לא מתקנת זאת.