
再帰的自己改善 ― 実際にそれを実践するプロジェクトを通して解説
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
「再帰的自己改善」は、たいていはある種の感触を意味するために使われる言い回しのひとつだ。神秘性を排して定義すれば、それはそれより狭く、そしてもっと面白いものになる。すなわち、自ら次の実験を提案し、それを実行し、あらかじめ定められた規則によってその結果を採用するか廃棄するかを決め、その結果が次のラウンドに引き継がれるシステムである。再帰は魔法ではなく、無限でもない——スコアリング関数を伴うループであり、その質は、そのスコアリング関数がどれだけ誠実に適用されるかによって完全に決まる。Jev流のSystem One意思決定モデルを構築する第三者のオープンプロジェクト、RSI-Jevは、あれこれ論じる代わりにそのループを読むことができる稀な事例だ。すべての仮説、すべての失敗したアーム、すべてのリリースがその数値とともに公開され、リポジトリには日ごとに日付が付されている。このページが実例として用いるモデルはRSI-Jev v6.0-VLで、2026-10-06に公開された4Bの型付き意思決定モデルであり、これは直近の一週間以内に含まれる。それはTypeSafeのJevではなく、TypeSafe AIとも提携していない——プロジェクト自身のライセンス表記がまさにそう述べており、OrcaRouterで私たちが提供しているのはもう一方の、typesafe/jev-1.13であり、私たちのsystemoneエンドポイント上にある。
「自己改善」という言葉が何か意味を持ち始める前に、まず一点だけ明確にし、続いて日付を一つ示す。これは無制限に自己を書き換えるモデルではなく、このページの何物もそのようには読まれるべきではない。問題のループが書き換えるのはレシピである。すなわち、学習上の変更を提案し、その変更が何をもたらすと期待するかを登録し、GPU 時間を消費し、その後その変更を採用するか、さもなければそれがなぜ敗れたのかを記録する。モデルは、訓練済みの意思決定ヘッドを備えた Qwen3.5-4B-Base のタワーであり——固定されたアーキテクチャを固定された学習スクリプトで訓練したもので、探索はデータ、目的、段階に対して行われる。ループは自ら実験を回し、自らのチャンピオンを引退させる。何を測定する価値があるかを決めるのは人間である。そして日付:v6.0-VL は 2026-10-06 に公開され、その後プロジェクトはさらに新たなリリースを出している——この系列はほぼ毎日進んでおり、このページの数値はここに記されたリリースに付随するもので、読み取られた時点の日付による。走り続けるループを主題とするページでは、これは最初に述べておく価値がある。
その用語が意味するもの、淡々と述べたもの
このフレーズを削ぎ落とすと、3つの部分があり、どれもありふれている。第一に探索空間、つまり変更されうるものの集合。第二にスコアラー、つまりある変更が役立ったかどうかを示すもの。第三に記録、つまり何が試され、何が起こり、何が捨てられたか。システムが再帰的自己改善を行っていると言えるのは、それら3つすべてにおいて、N回目の出力がN+1回目の入力になるときだ。しかも、人間が毎回探索空間を再導出したり閾値を再決定したりすることなく。
この話題について書かれたものの大半が飛ばしてしまうのは二番目の部分であり、そこにこそ問いの全体が宿っている。弱い採点器を備えたループは、採点器を最適化してしまう。それは単調に上昇する線と、自分自身の試験の形を学習してしまったシステムを生み出す。その失敗に悪意もバグも要らない——同じ数値が選別と報告の両方を担うとき、デフォルトで起こることだ。だから、何らかのシステムが自己改善しているという主張を読むとき、役に立つ問いは決して「どれだけ良くなったか」ではない。「誰が、いつ基準を設定したのか、そして結果を見た後でそれが動き得るのか」である。
この概念の一般的な説明——今日その用語で上位表示されているもの——は、ほとんどが未来志向だ。ウィキペディアの項目では、システムが自らのコードを書き換えて「知能爆発」へと向かう様子が描かれ、より広範な報道は、そのタイムラインが予測より近いか遠いかについてのものが多い。それは正当な議論であり、現在誰もが持っている証拠では答えを出せない。答えを出せるのは、より小さな問い、つまり上記のような閉ループを今すぐ構築し、それ自身のルールに従わせることができるかどうかである。そのためには、公開された成果物を持つ一つのプロジェクトが、十年分の憶測に勝る。そしてこのページの残りは、まさにそのことについて述べている。
閉じている、単なる反復ではない:5つのメカニズム
ループは、反復するから閉じているのではない。自動化されたパイプラインの多くは、決して閉じられることなく反復している。なぜなら、結果を見た後にしきい値を調整できるパイプラインは、それができないパイプラインとは根本的に異なることをしているからだ。RSI-Jev 自身のルールは、その違いについて異例なほど明示的であり、マニフェストとしてではなく定義として読むことができる。そのうちの五つが仕事の大半を担っている。
予測は実行前に登録される。 仮説は、GPU時間を費やす前に、期待する数値とその変動幅とともに書き留められる。自ら設定した基準を外したバージョンは、こっそり切り直されるのではなく、失敗として出荷される。これが、このループが後付けの説明を書くための機械になるのを防ぐ仕組みであり、それには実際の代償が伴う。記録には、内容が「誰かが記録上で間違っていた」だけの項目が含まれることになる。
ヌルフロアは仮定するものではなく、測定するものである。チームは、対照群と証明可能なほど同一のアーム(GPU時間を消費する前にオブジェクト同一性によって検証済み)を実行し、それらのアーム間のばらつきはノイズフロアである。そのフロアより小さい差は、どんなに見えようと結果ではない。プロジェクト自身の基準もこれを反映している。内部スイートでは閾値が+0.006で、単一ベンチマークにおけるシードごとの標準偏差が0.011–0.016であるため、それ未満の単一ベンチマークの差は知見とはみなされない。この分野のノイズの大半は、統計的なものではなく測定されたものである。
ホールドアウトセットは、一度読まれた時点で使い切られる。各リリースはホールドアウトセットを一度だけ読むので、二つのリリースはなお同等の条件で比較できる——そして、それを読むことがそれを使い切ることになるため、各リリースは次のリリースの比較を凍結する。プロジェクト自身の言い回しはそのまま保つ価値がある。ホールドアウトセットは「訓練からホールドアウトされているのであって、探索から封じられているのではない」。それは記憶に対するチェックであり、新規性の保証ではない。そしてスイートの数値自体にも、プロジェクトが公表した穴がある。ある内部タスクが数百行の訓練データと重複していたため、v6.0-VL以降スイートはそれを除いて報告されており——0.770——、v5.0-VLの以前の0.764は、それを除いた0.763として書き直された。この書き直しこそが要点だ。ある数値が水増しされており、原因が突き止められ、古いリリースのカードは放置されるのではなく訂正された。
失敗は出荷される。プロジェクト自身の擁護者を殺したものも含めて。リポジトリの見出しの集計値は、2026-10-08に読んだもので、一貫している。13日間で8件のリリース、そして失敗も含めて書き上げられた数百件の実験。否定的な結果は成果物として扱われる。コントリビューティングガイドはその理由を率直に述べている — 探索で高くつくのは、勝者を実行することではなく、敗者を実行することだ。だから、外部からの十分に測定された否定的結果は枝を一つ取り除き、小さな肯定的結果よりも価値がある。
リリースチェーンがこのプロジェクトだ。 リリースごとに1枚のカード、それらすべてが、mainブランチ上に恒久的に置かれる。各カードは自身のリリースの数値を保持するので、あるバージョンの速度やキャリブレーションが別のバージョンのものを上書きすることはない。プロジェクトはその理由を直接述べている。そのチェーンだけが、自己改善ループが改善しているかどうかを確認する唯一の方法だと。その他すべて——レシピ、スクリプト、固定したスタック——は現在のリリースのみを保持する。逆のルールでは、何が現在なのかを判別できなくなるからだ。公開されたチェックポイントは自身のコードを保持するので、古いリリースは古いブランチなしでも実行可能なままになる。

その鍛錬が犠牲にするもの、そしてそれによって得られるもの
記録に残る2つの話は、「自己改善」という言葉に対する正直な重しとなっている。どちらも、ループ自身のルールが作業をより遅く、同時により良くした事例だからだ。
最初のものは v1.0 の背後にあるバグだ。それを見つけるには、7件の登録された否定的結果を要した。その7件はいずれもオプティマイザ側の修正で、学習の不安定性を減らしたが取り除けなかった。原因がオプティマイザとは程遠い精度の誤りだったからだ。そして最終的な修正は1行だった。7件のうち単独で公表する価値があったものは1つもなかった。それらが揃っていたからこそ、原因をそもそも見つけられるようになった。そして、それこそが否定的結果を登録し保管しておくべきだという主張のすべてだ。それらの価値は個別ではなく、組み合わせにある。
2つ目はあまり格好のよいものではないが、プロジェクトはそれでも脚注で公表している。初期のアームはちょうど1つのガードに失敗した——MMLU-Proは0.020の限度に対して基準を0.026下回り——却下として記録された。実行責任者はその後、MMLU-Proは目標ではなく忘却に対するガードだからという理由で限度を0.030に広げ、そのアームは4つの新しいシードで確認され、次のリリースになった。元の却下はログに残され、結果を見てから基準を動かすのは、読者がプロジェクトのそうした行為を捕まえられるようにすべき類のものだ、というプロジェクト自身のコメントが添えられていた。
その脚注は、この種の主張に実際の場で出くわしたときに評価しようとする人にとって、このリポジトリで最も有用な段落だ。動かされた基準は悪意の証拠ではない——示された理由づけは擁護できるものであり、広げられた基準はその後、4つの新しいシードを生き延びなければならなかった。しかし、黙って動かされた基準はもはや閉じていないループであり、両者の違いは、それが書き留められていたかどうかだけにある。その後プロジェクトが落ち着いた一般則は、他のシステムにも持ち込む価値がある。ちょうど1つのガードにだけ失敗するニアミスは、破棄される代わりに診断と的を絞った修復を受ける——そして、その修復が失敗すれば、記録を伴う行き止まりになる。
ループが誤っている頻度:14件のセットアップ、2件を保持
ここに覚えておくべき数字がある。画像を読み取るリリースを通じて、プロジェクトは14の強化学習セットアップと63の報酬学習済みアームを数えている。保持されたのは2つだけだ。
各設定は、同じ項目で同じステップ数だけ訓練された教師あり対照と比較して評価された。この比較があってこそ、その回数は意味を持つ——一度も合わせる必要がなかったベースラインにRLアームが勝っても何も証明しない。プロジェクト自身の言葉で言えば、教訓的な損失は次のとおり:
• 二値正解のRL — 確率出力が0と1に崩壊した。申告されたオッズの誠実さではなく、正しく選ぶという行為そのものに報酬を与えると、分布は両極端へと押しやられ、自信が常に満点である決定モデルは、決定モデルが本来果たすべき役割にとって無用である。
• プロパー・スコアRL、Laya流目的関数の再構築 — 300ステップでは問題なし、1,500で発散。大して何もしていない間は安定していて、重要になり始めたまさにその時に不安定。
• RLCR — 精度では同等だが、生のキャリブレーションは悪化。能力は何も得られず、その代償を、モデルが存在する理由である唯一の特性で払った。
• Bandit RLCDでは、選ばれた選択肢の結果だけが明かされる——同じフィードバックでの教師あり学習と比べて優れない。プロジェクトはここで自らの事前登録テストを打ち切った。アームは4つのキャリブレーション指標のうち少なくとも2つで教師あり学習を上回らなければならなかったが、勝てたのは1つだけだった。
勝者、そしてそれが勝った理由こそ、このページで最も応用の利く発見である。それはリストワイズ報酬――多数の個別に採点された候補の順序に対して測定されるランキング品質であり、各候補を独立に扱うものではない。第一位での再ランキング再現率は、教師ありの親モデルの0.192から0.308へと上昇し、ペア検定では勝ちと負けの両方が見られた。このプロジェクトの説明はチューニングの話ではない。項目ごとの訓練ターゲットは各候補を単独で採点するものであり、単一のラベルでは候補全体にわたる順序の質を表現できない。報酬がラベルでは表現できない何かを語った場面では、RLは同じ行において教師あり訓練を上回った。そうでなかった場面では、教師あり訓練は同等の性能を示した。
そこから、この種のループがそもそも何かを見つけられるのはどういうときなのかというルールが一般化される。ゴールドラベルが手元にあれば、期待される方策勾配更新は教師あり損失の勾配に等しい——プロジェクト自身の言い回しだ——ので、ラベル付きの決定に対して採点される「RLアーム」は、実際には損失設計のアームである。そして、損失レベルの変更は内部スイートをせいぜい0.002しか動かさなかった一方、新しいデータは0.13動かした。まとめて読むと、このループの効き目は決して目的関数にあったのではなく、何が測定され、何が投入されたかにあったのだ。
それは、読者が当然尋ねる問いに対する誠実な答えである。強化学習(RL)の設定は、他の場所では自己改善一般に関する証拠として引用されているが、ここでは意思決定タスクにおける一つのループに関する証拠である。リストワイズ結果は単一のシードであり、プロジェクトもそう述べている。すなわち、対応のあるRL対教師あり比較は、リリースがそれを適用した親とは異なる親で実行されており、そのリリースには「条件を揃えた教師あり対照がない」。その但し書きが付いた知見は、付いていない知見より価値がある。そしてそれが、あなたが読んでいるこのページがそれを一般化しない理由である。
人間が座る場所
そのプロジェクトは明示的で、その明示性こそが面白いところだ。ループは自ら実験を走らせ、自らのチャンピオンを引退させるが、何を測定する価値があるかは決めないし、ある数字が技術的には正しくても実用的には誤解を招くものだと自分で気づくこともない。それは人間がやることだ。
プロジェクト自身のルールのうち2つは、誰かが反論したから存在している。MMLU-Pro ガードは、惜しい外れを破棄するのではなく、広げられた。シード要件は今では、すべての差に4つのシードを費やすのではなく、効果量に応じて変動する。なぜなら確認用シード、つまりアームの選択に使われなかった唯一の数値こそが要となるものであり、すでに見えている差に計算資源を費やしても何も得られないからだ。一連のリリースのうち1つは、1つのガードで失敗したアームを落とすことへの拒否から始まった。プロジェクトは、そのフィードバックを送った人々を、謝辞で名前を挙げてクレジットしている。
ここで言う「自己改善」は、ループの途中を指しており、ループ全体を指しているわけではない。ループは、人間がクランクを回すことなく走る探索である。人間は依然としてループの上端で目的を選び、下端で結果を批判的に読んでいる——まさにこの配置が、ループが自らの選好を確認するための機械になるのを防いでいる。その席を欠いた再帰的自己改善のどのような説明も、これとは別のシステムを記述しており、おそらくは仮説上のシステムを記述している。
プロジェクト自身の数字が示さないもの
以上の規律は、その限界が同時に示されてこそ語る価値があるものであり、RSI-Jevの記録はそれを自ら示している。
• それは1つのプロジェクトであり、一度に1つのモデルサイズ、1つのシードに限られる。公開されたチェックポイントは単一のシードのものであり、最高スコアを得るために選ばれたのではなく、あらかじめ主たるものとして固定されている。RLの根拠は1つのシードである。
• これは生成ではなく意思決定タスクである。文書、チャット、画像を対象にした、はい/いいえ、k 個から 1 つ選ぶ、またはルーブリックに沿って評価する質問であり、選択肢ごとに較正された確率を伴って 1 回のフォワードパスで答える。何も生成されないので、費やす推論トークンはない。ここでループが示しているのは、その形のスコアラーを改善できるということだ。
• その一部は、リポジトリだけから再現できるものではない。訓練コーパスとポリシー開発セットは公開されておらず、プロジェクトはリリースカードで率直にこう述べている。「このリポジトリだけから各段階を再実行することはできない」。あるコーパスビルダーは約96 GBのメモリを必要とし、エンドツーエンドで再実行されなかった。
• すべてが検証可能というわけではまったくない。内部スイートが完全にホールドアウトされていたことは一度もない。15 個のベンチマークのうち 10 個は、何らかの形で訓練データを提供している。したがって、これらの数値はどれもゼロショットではない — ホールドアウトされているのは、ホールドアウトされた比較であり、それが唯一のものである。
そして外部の部分には、それぞれ固有の瘢痕組織がある。あるリリース後の監査では、公開ベンチマークキットのテスト行のうち約1,000項目が学習コーパス中に見つかった——キットの行の約0.3%にあたり、最大の単一寄与は1つのソースからの数百行だった。それらを除いて再スコアすると、指標の変動は最大0.04にとどまる。その修正は、こっそり適用されるのではなく、次のリリースのカードで公表された。プロジェクトが「汚染なし、主張ではなく検証」と述べているルールの下で。それは彼らに数字を1つ犠牲にさせるルールであり、それこそが持つ価値のある唯一の種類のルールだ。
実際に実行できる場所 — そしてできない場所
ここでは OrcaRouter によって提供されているものは何もありません。当社のカタログには RSI-Jev の ID も、そのモデルカードもありません。誰かが提供するまで、追加されることもありません。RSI-Jev は自身のリポジトリからインストールされ、独自のサーバーを実行します。そのサーバーは Jev API を話すため、既存の Jev クライアントをそこに向け、ベース URL を変更します。Linux、Windows、macOS で動作し、CUDA GPU、Apple Silicon、または通常の CPU 上で実行できます。
The one model we do host is the other side of that contract. TypeSafe's Jev 1.13, which we serve as typesafe/jev-1.13, is the commercial decision model whose request and answer shapes RSI-Jev reproduces, and it is reached on our dedicated systemone endpoint rather than through the chat-completions shape. That is the whole relationship, and it is a structural one rather than a quality claim: one is a hosted commercial model on a vendor's endpoint, the other is a checkpoint you download and serve yourself. Nobody has run an independent head-to-head between them, and this page is not going to declare a winner from two different harnesses.

もしあなたが望んでいるのが、このような意思決定モデルをアプリケーションの背後に置くことなら、ルーティングの問いはモデルの問いとは別であり、実験をそもそも実行する価値があるかどうかを決めるのはこの部分です。OrcaRouter は200以上のモデルに対応するマークアップ0%の単一API——プロバイダーの定価がそのまま反映されるため、ベンダーの価格変更が当日にあなたの価格になります——さらに自動フェイルオーバーと、複数のモデルを1回の呼び出しにまとめるためのルーティングDSLを備えています。まだ一般的なAPIを通じて呼び出せないループモデルにとって、これは特別な意味を持ちます。つまり、ベンチマーク比較の対象となる代替候補はすでに1つのキーの背後にあり、比較は2つ目の統合ではなく設定変更で済むということです。

残す価値のある部分
このようなプロジェクトを通して再帰的自己改善について書く理由は、それが劇的な何かに至るかどうかという議論を通してではなく、ループの規則こそが転用可能な部分であり、憶測はそうではないからだ。登録された予測、測定されたヌルフロア、使い切ったホールドアウト集合、公表された失敗、不変のリリースチェーン——これらのいずれも超知能の特性ではない。それらは、検証可能であることを選んだラボの特性であり、今日、あらゆる規模で、あらゆるモデル上で自動探索を実行しているあらゆるチームが利用できるものである。
そう読めば、RSI-Jevの記録で興味深い主張はスコアではない。それは、ループ自身の台帳が、正しかったよりもはるかに頻繁に間違っていたと述べていること — 14件のセットアップのうち残ったレシピは2件、1行のバグを見つけるまでに7つのネガティブ、動いて書き留められたバー — そしてプロジェクトがその台帳を公開したことだ。公開インデックス上で1回のリリースで38.38から46.24への上昇は、隣に失敗がなければ物珍しいだけだ。その数字に意味を持たせているのは失敗のほうだ。
用語そのものについての正直な立場はどちらか。問題は、システムが自己改善できるかどうかではない。その改善が、ノーと言い得た何かによって測られているかどうかだ。その分離が現実に存在し、明文化されているなら、そのループは読む価値がある。そうでなければ、上昇する線は、システムが良くなっていることの記述ではなく、スコアラーの記述である——そして、どれだけ再帰を重ねてもそれは直らない。
