
재귀적 자기 개선, 실제로 이를 수행하는 프로젝트를 통해 알아보기
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
"재귀적 자기 개선"은 주로 어떤 느낌을 뜻하는 데 쓰이는 그런 표현 중 하나다. 신비주의 없이 정의하면, 그것은 그보다 더 좁고 더 흥미롭다: 스스로 다음 실험을 제안하고, 그것을 실행하고, 미리 정해진 규칙에 따라 결과를 유지하거나 폐기하며, 그 결과가 다음 라운드로 이어지는 시스템이다. 재귀는 마법이 아니고 무한하지도 않다 — 그것은 점수 함수가 있는 루프이며, 그 품질은 그 점수 함수가 얼마나 정직하게 적용되는지에 전적으로 달려 있다. Jev 스타일 System One 의사결정 모델을 만드는 제3자 오픈 프로젝트인 RSI-Jev는, 그것에 대해 논쟁하는 대신 루프를 읽을 수 있는 드문 사례다: 모든 가설, 모든 실패한 실험군, 모든 릴리스가 숫자와 함께 공개되고, 저장소는 날짜별로 기록된다. 이 페이지가 작업 예시로 사용하는 모델은 2026-10-06에 공개된 4B 타입 지정 의사결정 모델 RSI-Jev v6.0-VL이며, 이는 지난주 안에 있다. 그것은 TypeSafe의 Jev가 아니고 TypeSafe AI와 제휴하지도 않는다 — 프로젝트 자체의 라이선스 문구가 정확히 그렇게 말하며, OrcaRouter에서 우리가 제공하는 것은 다른 하나, typesafe/jev-1.13이며, 우리의 systemone 엔드포인트에서 제공됩니다.
'자기 개선'이라는 말이 어떤 역할을 하기 전에, 한 가지 clarification에 이어 날짜 하나를 말씀드립니다. 이것은 모델이 스스로를 무한정 다시 작성하는 것이 아니며, 이 페이지의 어떤 내용도 그렇게 읽혀서는 안 됩니다. 문제의 루프가 다시 작성하는 대상은 레시피입니다: 훈련 변경을 제안하고, 그 변경이 무엇을 할 것으로 기대하는지 등록하고, GPU 시간을 쓰고, 그런 다음 그 변경을 유지하거나 왜 실패했는지 기록합니다. 모델은 훈련된 결정 헤드가 달린 Qwen3.5-4B-Base 타워입니다 — 고정된 아키텍처를 고정된 훈련 스크립트로 훈련한 것이며, 탐색은 데이터, 목표, 단계에 걸쳐 이루어집니다. 루프는 자체 실험을 실행하고 자체 챔피언을 은퇴시킵니다. 무엇을 측정할 가치가 있는지는 사람이 결정합니다. 그리고 날짜: v6.0-VL은 2026-10-06에 공개되었고, 그 이후 프로젝트는 추가 릴리스를 하나 더 공개했습니다 — 이 계보는 대략 매일 움직이며, 이 페이지의 수치는 여기 명시된 릴리스에 붙은 것이고, 읽은 시점의 날짜를 따릅니다. 계속 실행되는 루프를 주제로 한 페이지에서는 이를 먼저 밝히는 것이 좋습니다.
그 용어가 의미하는 바를, 평이하게 서술한 것
이 표현을 간추려 보면 세 부분이 있고, 모두 평범하다. 첫째, 탐색 공간: 바뀔 수 있는 것들의 집합. 둘째, 채점자: 어떤 변화가 도움이 되었는지 말해 주는 무언가. 셋째, 기록: 무엇을 시도했고, 무슨 일이 일어났으며, 무엇을 버렸는지. 시스템이 재귀적 자기 개선을 한다는 것은, 인간이 매번 탐색 공간을 다시 도출하거나 임계값을 다시 결정하지 않고도 이 세 가지 모두에서 라운드 N의 출력이 라운드 N+1의 입력이 될 때이다.
이 주제에 관한 대부분의 글에서 빠뜨리는 것은 두 번째 부분이며, 바로 거기에 질문 전체가 달려 있다. 약한 채점자를 가진 루프는 채점자를 최적화한다. 그것은 단조롭게 상승하는 선과, 자기 시험의 형태를 학습해 버린 시스템을 낳을 것이다. 그 실패에는 악의나 버그가 필요하지 않다 — 같은 숫자가 선택과 보고를 모두 할 때 기본적으로 벌어지는 일이다. 그래서 어떤 시스템이 스스로 개선되고 있다는 주장을 읽을 때, 유용한 질문은 결코 "얼마나 더 나아졌는가"가 아니다. 그것은 "누가, 언제 기준을 세웠으며, 그 기준은 결과를 본 뒤에 움직일 수 있었는가"이다.
이 개념의 대중적인 버전들 — 오늘날 이 용어로 검색 상위에 오르는 것들 — 은 대체로 미래지향적입니다: Wikipedia의 항목은 스스로의 코드를 "지능 폭발"을 향해 다시 작성하는 시스템을 설명하고, 더 폭넓은 보도는 그 일정이 예측보다 가까운지 먼지에 관한 경우가 많습니다. 그것은 타당한 논쟁이며, 현재 누구에게 있는 증거로도 답할 수 없습니다. 답할 수 있는 것은 더 작은 질문, 즉 위에서 설명한 종류의 폐쇄 루프가 지금 구축될 수 있고 자체 규칙을 지키게 유지될 수 있는지 여부입니다. 그 점에서는 공개 산출물이 있는 프로젝트 하나가 10년의 추측을 능가하며, 이 페이지의 나머지 내용은 바로 이것을 다룹니다.
단순히 반복적인 것이 아니라 닫힌: 다섯 가지 메커니즘
루프는 반복한다고 해서 닫힌 것이 아니다. 수많은 자동화 파이프라인은 결코 닫히지 않은 채로 반복된다. 결과를 본 뒤 임계값을 조정할 수 있는 파이프라인은 그럴 수 없는 파이프라인과 범주적으로 다른 일을 하기 때문이다. RSI-Jev 자체의 규칙들은 그 차이에 대해 이례적으로 명시적이며, 선언문이라기보다 정의로 읽힐 수 있다. 그중 다섯 가지가 대부분의 일을 해낸다.
예측은 실행 전에 등록된다. 가설은 GPU 시간을 쓰기 전에, 움직일 것으로 예상하는 수치와 그 폭을 함께 적어 둔다. 자신의 기준을 못 넘긴 버전은 조용히 다시 손질되는 대신 실패로 내보내진다. 이것은 그 루프가 사후 설명을 작성하는 기계가 되는 것을 막는 메커니즘이며, 여기에는 실질적인 비용이 따른다: 기록에는 누군가가 기록상 틀렸다는 것만이 내용인 항목들이 들어 있다.
널 플로어는 가정하는 것이 아니라 측정하는 것이다. 팀은 대조군과 증명 가능하게 동일한 실험군들을 실행한다 — GPU 시간을 쓰기 전에 객체 동일성으로 검증된 — 그리고 그 실험군들 사이의 편차가 노이즈 플로어다. 그 하한보다 작은 차이는 그것이 어떻게 보이든 결과가 아니다. 프로젝트 자체의 기준도 이를 반영한다. 내부 스위트에서 임계값은 +0.006이고, 단일 벤치마크에서 시드별 표준편차는 0.011~0.016이므로, 그보다 작은 단일 벤치마크 차이는 발견이 아니다. 이 업계의 잡음 대부분은 통계적인 것이 아니라 측정된 것이다.
홀드아웃 세트는 읽는 순간 소모된다. 각 릴리스는 홀드아웃 세트를 한 번 읽으므로, 두 릴리스는 여전히 동등한 조건에서 비교될 수 있다 — 그리고 그것을 읽으면 소모되기에, 각 릴리스는 다음 릴리스의 비교를 고정한다. 프로젝트 자체의 표현은 그대로 유지할 가치가 있다: 홀드아웃 세트는 "훈련에서 제외된 것이지, 탐색에서 봉인된 것은 아니다." 그것은 암기에 대한 점검이지, 신규성에 대한 보장이 아니다. 그리고 스위트 수치 자체에는 프로젝트가 공개한 허점이 하나 있다: 내부 태스크 하나가 수백 개의 훈련 행과 겹쳤기 때문에, v6.0-VL부터 스위트는 그것을 제외하고 보고된다 — 0.770 — 그리고 v5.0-VL의 이전 0.764는 그것을 제외하고 0.763으로 다시 표기되었다. 바로 그 재표기가 핵심이다. 숫자가 부풀려지고 있었고, 원인이 밝혀졌으며, 이전 릴리스의 카드는 그대로 방치되지 않고 수정되었다.
실패도 공개된다, 프로젝트 자체의 챔피언을 죽게 만든 실패까지 포함해서. 2026-10-08에 확인한 저장소의 대표 수치들은 일관된다: 13일 동안 여덟 번의 릴리스, 그리고 실패까지 포함해 기록된 수백 건의 실험. 부정적 결과는 제품으로 취급된다. 기여 가이드는 그 이유를 직설적으로 말한다 — 탐색에서 비용이 많이 드는 부분은 승자를 실행하는 것이 아니라 패자를 실행하는 것이므로, 외부에서 잘 측정된 부정적 결과는 한 갈래를 제거하며 작은 긍정적 결과보다 더 가치가 있다.
릴리스 체인이 곧 프로젝트다. 릴리스마다 카드 하나씩, 그것도 전부를 메인 브랜치에 영구적으로 둔다. 각 카드는 해당 릴리스의 수치를 담으므로, 한 버전의 속도와 캘리브레이션이 다른 버전의 것을 절대 덮어쓰지 않는다. 프로젝트는 그 이유를 직접 밝힌다: 그 체인만이 자기 개선 루프가 개선되고 있는지 확인할 수 있는 유일한 방법이다. 그 밖의 모든 것 — 레시피, 스크립트, 고정된 스택 — 은 현재 릴리스만 담는다, 반대 규칙을 따르면 무엇이 현재인지 구분하는 것이 불가능해지기 때문이다. 게시된 체크포인트는 자체 코드를 담고 있어, 오래된 릴리스가 오래된 브랜치 없이도 실행 가능한 상태로 남는다.

규율이 치르게 하는 대가, 그리고 그것이 얻어 주는 것
기록에 남은 두 이야기는 '스스로 개선하는'이라는 말에 대한 정직한 균형추다. 둘 다 루프 자체의 규칙이 작업을 더 느리게 만들면서 동시에 더 낫게 만든 사례들이기 때문이다.
첫 번째는 v1.0 뒤에 있던 버그다. 그것을 찾는 데 등록된 네거티브가 일곱 개 필요했다. 그 일곱 개는 각각 학습 불안정성을 완전히 제거하지는 못한 채 줄여 준 옵티마이저 측 수정이었다. 원인은 옵티마이저와는 전혀 무관한 곳에 있는 정밀도 오류였고, 최종 수정은 한 줄이었다. 그 일곱 개 중 어느 것도 단독으로 출판할 가치는 없었다. 그것들이 함께였기에 원인을 찾을 수 있었고, 이것이 네거티브를 등록하고 보관해야 하는 전체 논거다. 그 가치는 개별적이지 않고 결합적이다.
두 번째는 그리 자랑스럽지 않지만, 프로젝트는 그럼에도 이를 각주를 통해 공개한다. 초기 실험군은 가드 하나만 실패했다. MMLU-Pro가 0.020 한도 대비 기준선보다 0.026 낮게 나온 것이다. 그래서 거부된 것으로 기록되었다. 그러자 실행 담당자는 MMLU-Pro가 목표라기보다 망각 방지 가드라는 이유로 한도를 0.030으로 넓혔고, 그 실험군은 네 개의 새 시드에서 확인되어 다음 릴리스가 되었다. 원래의 거부 기록은 로그에 남겨졌고, 결과를 본 뒤 기준선을 옮기는 일은 독자가 프로젝트가 그러고 있음을 잡아낼 수 있어야 하는 종류의 일이라는 프로젝트 자체의 코멘트가 함께 있었다.
그 각주는 이런 종류의 주장을 평가하려고 할 때 저장소에서 가장 유용한 단락이다. 움직인 기준은 악의의 증거가 아니다 — 그것은 움직였고, 네 개의 새로운 시드를 견뎌냈다. 그러나 조용히 움직인 기준은 더 이상 닫히지 않은 루프이며, 둘 사이의 차이는 전적으로 그것이 기록되었는지 여부에 달려 있다. 프로젝트가 이후에 정한 일반 규칙은 다른 시스템으로 가져갈 가치가 있는 것이다: 정확히 하나의 가드를 실패한 니어미스는 버려지는 대신 진단과 표적 수리를 받는다 — 그리고 수리가 실패하면, 그것은 기록과 함께 막다른 길이 된다.
루프가 얼마나 자주 잘못되는가: 열네 개의 설정, 두 개 유지
기억해 둘 숫자가 있습니다. 이미지를 읽는 릴리스를 통해, 프로젝트는 14개의 강화학습 구성과 63개의 보상 훈련된 암을 집계합니다. 두 개가 남았습니다.
각 설정은 동일한 항목으로 동일한 단계 수 동안 훈련된 지도 학습 대조군과 비교하여 평가되었는데, 이는 그 횟수를 의미 있게 만드는 비교이다 — 자신이 맞설 필요가 없었던 기준선을 능가하는 RL arm은 아무것도 증명하지 못한다. 프로젝트 자체의 표현에 따르면, 교훈적인 손실들은:
• 이진 정답성 RL — 확률 출력이 0과 1로 붕괴했다. 보고된 승산의 정직성보다 정답을 고르는 행위에 보상을 주는 것은 분포를 양 극단으로 밀어붙이며, 신뢰도가 언제나 전부인 결정 모델은 결정 모델이 존재하는 목적에 쓸모없다.
• Proper-score RL, Laya 스타일 목적함수의 재구성 — 300스텝에서는 괜찮았고, 1,500스텝에서는 발산했다. 별로 하는 일이 없을 때는 안정적이었고, 정확히 중요해지기 시작했을 때 불안정했다.
• RLCR — 정확도에서는 동률이었지만 원시 보정은 더 나빴다. 아무런 성능도 얻지 못했고, 그 대가로 모델이 존재하는 이유인 단 하나의 속성을 치렀다.
• Bandit RLCD: 선택된 옵션의 결과만 공개되는 방식으로, 동일한 피드백에 대한 지도 학습보다 낫지 않았다. 프로젝트는 여기서 자체 사전 등록 테스트를 무산시켰다. 해당 실험군은 네 가지 캘리브레이션 지표 중 최소 두 가지에서 지도 학습을 앞서야 했지만, 한 가지에서만 이겼다.
승자, 그리고 그것이 승리한 이유는 이 페이지에서 가장 전이 가능한 발견이다. 그것은 리스트와이즈 보상이다 — 각 후보를 개별적으로 다루기보다 여러 개별 점수가 매겨진 후보들의 순서 전반에 걸쳐 측정된 순위 품질이다. 첫 번째 위치에서의 리랭킹 재현율은 지도 학습 부모 모델의 0.192에서 0.308로 이동했으며, 짝지은 테스트에서 승패가 있었다. 이 프로젝트의 설명은 튜닝 이야기가 아니다: 항목별 훈련 목표는 각 후보를 개별적으로 점수화하며, 어떤 단일 레이블도 품질을 인코딩하지 않는다: 순서(후보자들에 걸친). 보상이 레이블이 표현할 수 없는 것을 말한 곳에서는, RL이 동일한 행에서 지도 학습을 이겼다. 그렇지 않은 곳에서는 지도 학습이 그에 필적했다.
이는 이런 종류의 루프가 언제 무엇이든 찾아낼 수 있는지에 관한 규칙으로 일반화된다. 골드 레이블이 있을 때, 기대되는 정책 그래디언트 업데이트는 지도 학습 손실의 그래디언트와 같다 — 프로젝트 자체의 표현이다 — 따라서 레이블된 결정에 대해 점수가 매겨진 "RL 암"은 사실상 손실 설계 암이다. 그리고 손실 수준의 변경은 내부 스위트를 최대 0.002만큼 움직였고, 새 데이터는 0.13만큼 움직였다. 함께 읽으면: 이 루프의 지렛대는 결코 목적 함수에 있지 않았다. 그것은 무엇이 측정되고 무엇이 투입되는가에 있었다.
이는 독자가 당연히 물을 수 있는 질문에 대한 정직한 답이다. RL 설정은 다른 곳에서는 일반적인 자기 개선에 관한 증거로 인용되지만, 여기서는 의사결정 과제에서의 하나의 루프에 관한 증거다. 리스트와이즈 결과는 하나의 시드이며, 프로젝트도 그렇게 밝힌다: 짝지은 RL 대 지도학습 비교는 릴리스가 그것을 적용한 부모와 다른 부모에서 실행되었고, 그 릴리스는 "일치하는 지도학습 대조군이 없다." 그런 단서가 붙은 발견은 그렇지 않은 발견보다 더 가치가 있으며, 이것이 바로 당신이 읽고 있는 페이지가 그것을 일반화하지 않는 이유다.
인간이 앉는 곳
프로젝트는 명시적이며, 흥미로운 부분은 바로 그 명시성이다: 루프는 자체 실험을 돌리고 자체 챔피언을 퇴역시키지만, 무엇을 측정할 가치가 있는지는 결정하지 않으며, 어떤 수치가 기술적으로는 사실이지만 실제로는 오해를 부릴 때 그것을 스스로 알아차리지도 못한다. 그건 사람이 하는 일이다.
프로젝트 자체 규칙 두 가지는 누군가 이의를 제기했기 때문에 존재한다. MMLU-Pro 가드는 아슬아슬하게 빗나간 사례를 버리지 않도록 오히려 넓혔다. 시드 요구 사항은 이제 모든 차이에 시드 네 개를 쓰는 대신 효과 크기에 따라 조정된다. 왜냐하면 확증 시드, 즉 어떤 실험군을 선택할 때 쓰이지 않은 단 하나의 숫자가 핵심을 떠받치는 값이며, 이미 눈에 보이는 차이에 연산을 쓰는 것은 아무것도 얻지 못하기 때문이다. 체인에 있는 릴리스 중 하나는 가드 하나를 통과하지 못한 실험군을 버리기를 거부한 데서 시작되었다. 프로젝트는 그 피드백을 보낸 사람들을 감사의 글에서 이름을 밝혀 공로를 인정한다.
그러니까 여기서 '자기 개선'은 루프의 중간을 설명하는 말이지, 루프 전체를 설명하는 말이 아니다. 이 루프는 인간이 크랭크를 돌리지 않고도 돌아가는 탐색이다. 인간은 여전히 루프의 맨 위에서 목표를 고르고, 맨 아래에서 결과를 비판적으로 읽는다 — 바로 이 배치가 루프가 자기 선호를 확인하는 기계가 되는 것을 막아 준다. 그 자리를 빼놓은 재귀적 자기 개선에 관한 어떤 설명도 이 시스템과는 다른 시스템, 아마도 가상의 시스템을 설명하는 셈이다.
프로젝트 자체 수치가 보여주지 않는 것
위의 규율은 그 한계가 동시에 명시될 때에만 서술할 가치가 있으며, RSI-Jev의 기록은 그 한계를 스스로 명시한다.
• 이는 하나의 프로젝트이며, 한 번에 하나의 모델 크기, 하나의 시드입니다. 공개된 체크포인트는 단일 시드의 것이며, 최고 점수를 얻기 위해 선택된 것이 아니라 사전에 주(primary)로 고정된 것입니다. RL 증거는 하나의 시드입니다.
• 그것은 생성이 아니라 의사 결정 과제입니다: 문서, 채팅 또는 이미지에 대한 예/아니요, k개 중 하나 고르기, 또는 루브릭에 따라 평가하기 질문으로, 각 선택지에 대해 보정된 확률로 한 번의 순전파에서 답합니다. 아무것도 생성되지 않으므로 소비할 추론 토큰이 없습니다. 여기서 루프가 보여주는 것은 그러한 형태의 채점기를 개선할 수 있다는 점입니다.
• 그중 일부는 저장소만으로는 재현할 수 없다. 학습 코퍼스와 정책 개발 세트는 공개되어 있지 않으며, 프로젝트는 릴리스 카드에서 이를 분명히 밝힌다: "이 단계들은 이 저장소만으로는 다시 실행할 수 없다." 한 코퍼스 빌더는 약 96GB의 메모리가 필요하며, 처음부터 끝까지 다시 실행되지는 않았다.
• 모든 것이 검증 가능한 것은 결코 아니다. 내부 스위트는 완전히 홀드아웃된 적이 결코 없었다. 열다섯 개 벤치마크 중 열 개는 어떤 형태로든 학습 데이터를 제공하므로, 그 수치들 중 어느 것도 제로샷이 아니다 — 홀드아웃 세트는 홀드아웃된 비교이며, 그것이 유일하다.
그리고 외부 부분들에도 저마다의 흉터 조직이 있다. 한 릴리스 이후의 감사에서 학습 코퍼스 안에 공개 벤치마크 키트의 테스트 행 항목이 대략 1,000개 있는 것이 발견되었다 — 이는 키트 행의 약 0.3%였고, 가장 큰 단일 기여는 한 출처에서 온 수백 행이었다. 그것들을 빼고 다시 채점하면 지수는 많아야 0.04만큼 변한다. 그 수정은 조용히 적용되지 않고 다음 릴리스의 카드에 공개되었는데, 이는 프로젝트가 "오염 없음, 주장이 아니라 검증"이라고 명시한 규칙에 따른 것이었다. 그것은 그들에게 숫자 하나를 포기하게 만드는 규칙이며, 바로 그런 종류의 규칙만이 가질 가치가 있다.
실제로 실행할 수 있는 곳 — 그리고 할 수 없는 곳
여기에는 OrcaRouter가 제공하는 것이 없습니다. 우리 카탈로그에는 RSI-Jev ID도, 그에 대한 모델 카드도 없으며, 누군가 그것을 제공하기 전까지는 앞으로도 없을 것입니다. RSI-Jev는 자체 저장소에서 설치되고 자체 서버를 실행하는데, 이 서버는 Jev API를 사용합니다. 기존 Jev 클라이언트를 이 서버로 지정하고 기본 URL을 변경하면 됩니다. Linux, Windows, macOS에서 실행되며, CUDA GPU, Apple Silicon 또는 일반 CPU에서 동작합니다.
The one model we do host is the other side of that contract. TypeSafe's Jev 1.13, which we serve as typesafe/jev-1.13, is the commercial decision model whose request and answer shapes RSI-Jev reproduces, and it is reached on our dedicated systemone endpoint rather than through the chat-completions shape. That is the whole relationship, and it is a structural one rather than a quality claim: one is a hosted commercial model on a vendor's endpoint, the other is a checkpoint you download and serve yourself. Nobody has run an independent head-to-head between them, and this page is not going to declare a winner from two different harnesses.

이런 결정 모델을 애플리케이션 뒤에 두고 싶다면, 라우팅 문제는 모델 문제와 별개이며, 실험을 실행할 가치가 있는지를 좌우하는 부분입니다. OrcaRouter는 0% 마크업으로 200개 이상의 모델을 이용할 수 있는 단일 API — 제공업체 정가가 그대로 전달되므로 벤더가 가격을 바꾸면 같은 날 바로 여러분의 가격이 되고, 여기에 자동 페일오버와 여러 모델을 하나의 호출로 조합하기 위한 라우팅 DSL이 더해집니다. 아직 일반 API로는 호출할 수 없는 루프 모델의 경우, 이 점은 특정한 방식으로 중요합니다. 즉, 비교 벤치마크 대상이 될 대안 후보들이 이미 하나의 키 뒤에 있다는 뜻이므로, 비교는 두 번째 통합이 아니라 설정 변경에 불과합니다.

간직할 가치가 있는 부분
이와 같은 프로젝트를 통해 재귀적 자기 개선에 대해 쓰는 이유는, 그것이 극적인 지점으로 이어지는지에 관한 논증을 통해서가 아니라, 루프의 규칙이 전이 가능한 부분이고 추측은 그렇지 않다는 점이다. 등록된 예측, 측정된 널 하한값, 소진된 홀드아웃 세트, 공개된 실패, 불변 릴리스 체인: 그중 어느 것도 초지능의 속성이 아니다. 그것들은 검증 가능하기로 결정한 연구소의 속성이며, 오늘날 자동화된 탐색을 돌리는 모든 팀이 어떤 규모에서든 어떤 모델에서든 이용할 수 있다.
그렇게 읽으면, RSI-Jev의 기록에서 흥미로운 주장은 점수가 아니다. 그것은 루프 자체의 장부가 스스로가 맞았던 것보다 훨씬 더 자주 틀렸다고 말한다는 점이다 — 열네 개의 셋업 중 두 개의 유지된 레시피, 한 줄짜리 버그를 찾기 위한 일곱 개의 부정 결과, 움직여서 기록된 막대 — 그리고 프로젝트가 그 장부를 공개했다는 점이다. 한 번의 릴리스에서 공개 지수가 38.38에서 46.24로 상승한 것은 옆에 실패들이 없으면 흥미거리에 불과하다. 실패들이 바로 그 숫자에 의미를 부여한다.
그 용어 자체에 대한 정직한 입장은 어느 쪽인가. 문제는 한 시스템이 스스로를 개선할 수 있는지가 아니다. 문제는 그 개선이 ‘아니오’라고 말할 수 있었던 무언가에 의해 측정되는지다. 그 분리가 실제로 존재하고 문서로 남아 있는 곳에서는, 그 루프는 읽을 가치가 있다. 그렇지 않은 곳에서는, 상승하는 선은 채점자에 대한 설명이지 더 나아지고 있는 시스템에 대한 설명이 아니다 — 그리고 아무리 많은 재귀도 그것을 고치지 못한다.
