Một thẻ tiêu đề được tạo có đầu đề 'Tự cải thiện đệ quy, giải thích' với phụ đề 'Một vòng lặp kín là một vòng lặp được chấm điểm, và việc chấm điểm là toàn bộ câu hỏi', bên trên một hàng ba thẻ bo tròn ghi 'Các dự đoán được đăng ký trước khi chạy', 'Các mức sàn null được đo, không giả định' và 'Các thất bại được công bố, kể cả của nhà vô địch'; phần chân trang ghi 'Ví dụ minh họa: RSI-Jev v6.0-VL, xuất bản 2026-10-06; hồ sơ của chính dự án, đọc ngày 2026-10-08.', với các biểu tượng đường nét phẳng tối giản và logo OrcaRouter được ghép vào góc dưới bên phải.
Guides & Insights

Tự cải thiện đệ quy, được giải thích qua một dự án thực sự làm được điều đó

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

"Tự cải thiện đệ quy" là một trong những cụm từ chủ yếu được dùng để chỉ một cảm giác. Khi được định nghĩa mà không có chút huyền bí nào, nó hẹp hơn thế và thú vị hơn: một hệ thống tự đề xuất thí nghiệm tiếp theo của chính mình, chạy nó, rồi giữ lại hoặc loại bỏ kết quả theo một quy tắc được cố định trước, với các kết quả dẫn dắt vòng tiếp theo. Tính đệ quy không phải là phép màu và nó không phải là vô hạn — nó là một vòng lặp với một hàm tính điểm, và chất lượng của nó hoàn toàn được quyết định bởi mức độ trung thực mà hàm tính điểm đó được áp dụng. RSI-Jev, dự án mở của bên thứ ba xây dựng các mô hình ra quyết định System One theo phong cách Jev, là một trường hợp hiếm hoi mà bạn có thể đọc vòng lặp thay vì tranh cãi về nó: mọi giả thuyết, mọi nhánh thất bại và mọi bản phát hành đều được công bố kèm số liệu, và kho lưu trữ được ghi ngày theo từng ngày. Mô hình mà trang này dùng làm ví dụ minh họa là RSI-Jev v6.0-VL, một mô hình ra quyết định có kiểu 4B được công bố vào 2026-10-06, tức là nằm trong tuần vừa qua. Nó không phải là Jev của TypeSafe và không liên kết với TypeSafe AI — dòng giấy phép của chính dự án nói chính xác điều đó, và thứ chúng tôi cung cấp tại OrcaRouter là cái còn lại, typesafe/jev-1.13, trên endpoint systemone của chúng tôi.

Một lời làm rõ trước khi từ "tự cải thiện" kịp làm gì, theo sau là một mốc ngày. Đây không phải là một mô hình tự viết lại chính nó không giới hạn, và không có gì trên trang này nên được đọc theo cách đó. Vòng lặp đang được nói tới viết lại một công thức: nó đề xuất một thay đổi huấn luyện, ghi nhận điều nó kỳ vọng thay đổi đó sẽ làm, tiêu tốn thời gian GPU, rồi sau đó hoặc giữ lại thay đổi hoặc ghi lại lý do nó thất bại. Mô hình là một tháp Qwen3.5-4B-Base với các đầu quyết định đã được huấn luyện — một kiến trúc cố định được huấn luyện bằng một tập lệnh huấn luyện cố định, với việc tìm kiếm diễn ra trên dữ liệu, mục tiêu và các giai đoạn. Vòng lặp tự chạy các thí nghiệm của riêng nó và cho các mô hình vô địch của riêng nó nghỉ hưu. Con người quyết định điều gì đáng để đo lường. Và mốc ngày: v6.0-VL được công bố vào 2026-10-06, và dự án đã công bố thêm một bản phát hành kể từ đó — dòng phát hành này thay đổi gần như hằng ngày, và các số liệu trên trang này là những số gắn với bản phát hành được nêu ở đây, được ghi ngày theo nơi chúng được đọc. Điều đó đáng nói ngay từ đầu trên một trang mà chủ đề của nó là một vòng lặp không ngừng chạy.

Ý nghĩa của thuật ngữ, được nói thẳng thừng.

Bóc tách cụm từ này ra thì có ba phần, tất cả đều bình thường. Thứ nhất, một không gian tìm kiếm: tập hợp những thứ có thể bị thay đổi. Thứ hai, một bộ chấm điểm: thứ nói cho biết một thay đổi có giúp ích hay không. Thứ ba, một bản ghi: những gì đã được thử, điều gì đã xảy ra, và những gì đã bị loại bỏ. Một hệ thống đang tự cải thiện đệ quy khi đầu ra của vòng N là đầu vào của vòng N+1 ở cả ba phần đó, mà không cần con người suy diễn lại không gian tìm kiếm hay quyết định lại ngưỡng mỗi lần.

Điều mà hầu hết các bài viết về chủ đề này bỏ qua là phần thứ hai, và đó chính là nơi toàn bộ câu hỏi nằm. Một vòng lặp với bộ chấm điểm yếu sẽ tối ưu hóa bộ chấm điểm. Nó sẽ tạo ra một đường tăng đơn điệu và một hệ thống đã học được hình dạng bài kiểm tra của chính nó. Thất bại đó không đòi hỏi ác ý hay lỗi — đó là điều xảy ra theo mặc định khi cùng một con số vừa dùng để lựa chọn vừa dùng để báo cáo. Vì vậy, khi bạn đọc một tuyên bố rằng một hệ thống nào đó đang tự cải thiện, câu hỏi hữu ích không bao giờ là "nó đã tốt lên bao nhiêu". Mà là "ai đã đặt ra mức chuẩn, khi nào, và liệu nó có thể thay đổi sau khi kết quả đã được nhìn thấy hay không."

Những phiên bản phổ biến của khái niệm này — những phiên bản đang xếp hạng cho thuật ngữ này hiện nay — phần lớn đều hướng về tương lai: mục từ của Wikipedia mô tả một hệ thống tự viết lại mã của chính nó theo hướng "bùng nổ trí tuệ", và các bài viết rộng hơn thường xoay quanh việc liệu mốc thời gian đó gần hơn hay xa hơn so với dự báo. Đó là một lập luận chính đáng, và không thể trả lời bằng chứng cứ mà bất kỳ ai hiện có. Điều có thể trả lời là câu hỏi nhỏ hơn, đó là liệu một vòng lặp kín kiểu như mô tả ở trên có thể được xây dựng và tuân theo các quy tắc của chính nó ngay bây giờ hay không. Để trả lời điều đó, một dự án có các sản phẩm công khai đánh bại cả một thập kỷ suy đoán, và đó là nội dung của phần còn lại của trang này.

Khép kín, không chỉ đơn thuần lặp lại: năm cơ chế

Một vòng lặp không phải là vòng kín chỉ vì nó lặp lại. Rất nhiều pipeline tự động lặp lại mà không bao giờ được khép kín, bởi vì một pipeline có thể điều chỉnh ngưỡng của nó sau khi thấy kết quả đang làm một việc khác biệt về bản chất so với một pipeline không thể làm vậy. Các quy tắc của chính RSI-Jev đặc biệt rõ ràng về sự khác biệt này, và chúng có thể được đọc như những định nghĩa hơn là như một tuyên ngôn. Năm trong số đó đảm nhiệm phần lớn công việc.

Các dự đoán được đăng ký trước khi chạy. Một giả thuyết được ghi lại kèm theo con số mà nó kỳ vọng sẽ thay đổi và mức thay đổi là bao nhiêu, trước khi tốn thời gian GPU. Một phiên bản không đạt được chính mức chuẩn của nó sẽ được phát hành như một thất bại thay vì bị âm thầm cắt lại. Đây chính là cơ chế ngăn vòng lặp biến thành một cỗ máy viết ra những lời giải thích sau khi sự việc đã xảy ra, và nó phải trả một cái giá thực sự: hồ sơ chứa những mục mà nội dung duy nhất của chúng là việc ai đó đã sai, và điều đó được ghi lại trong hồ sơ.

Sàn nhiễu được đo, chứ không được giả định. Nhóm chạy những nhánh có thể chứng minh là giống hệt nhánh đối chứng — được xác minh bằng định danh đối tượng trước khi tiêu tốn bất kỳ thời gian GPU nào — và độ chênh lệch giữa các nhánh đó chính là sàn nhiễu. Một khác biệt nhỏ hơn sàn đó thì không phải là kết quả, bất kể nó trông ra sao. Chuẩn của chính dự án cũng phản ánh điều này: trên bộ kiểm thử nội bộ của mình, ngưỡng là +0,006, với độ lệch chuẩn theo từng seed trên một benchmark đơn lẻ là 0,011–0,016, nên những khác biệt trên một benchmark đơn lẻ dưới mức đó không phải là phát hiện. Phần lớn nhiễu trong công việc này được đo, chứ không phải là thống kê.

Một tập giữ riêng sẽ bị tiêu hao ngay khi được đọc.Mỗi bản phát hành chỉ đọc tập giữ riêng một lần, nên hai bản phát hành vẫn có thể được so sánh trên cùng một cơ sở — và vì việc đọc nó sẽ tiêu hao nó, mỗi bản phát hành lại chốt cứng phép so sánh của bản kế tiếp. Cách diễn đạt của chính dự án đáng được giữ nguyên vẹn: tập giữ riêng "được giữ tách khỏi quá trình huấn luyện, chứ không bị niêm phong khỏi quá trình tìm kiếm." Đây là một phép kiểm tra việc ghi nhớ, chứ không phải một bảo đảm về tính mới. Và bản thân con số của bộ kiểm thử cũng có một lỗ hổng mà dự án đã công bố: một tác vụ nội bộ trùng lặp với vài trăm dòng huấn luyện, nên từ v6.0-VL trở đi bộ kiểm thử được báo cáo mà không tính nó — 0.770 — và con số 0.764 trước đó của v5.0-VL đã được nêu lại thành 0.763 khi không tính nó. Việc nêu lại đó chính là điểm mấu chốt. Một con số đang bị thổi phồng, nguyên nhân đã được tìm ra, và thẻ của bản phát hành cũ đã được chỉnh sửa thay vì để nguyên.

Những thất bại cũng được công bố, kể cả những thất bại đã hạ gục chính nhà vô địch của dự án. Những con số nổi bật của kho lưu trữ, đọc vào ngày 2026-10-08, đều nhất quán: tám bản phát hành trong mười ba ngày, và hàng trăm thí nghiệm được ghi chép lại, bao gồm cả các thất bại. Một kết quả phủ định được coi là sản phẩm. Hướng dẫn đóng góp nói thẳng lý do — phần tốn kém của một cuộc tìm kiếm không phải là chạy người thắng cuộc, mà là chạy những kẻ thua cuộc, nên một kết quả phủ định được đo lường kỹ lưỡng từ bên ngoài sẽ loại bỏ một nhánh và có giá trị hơn một kết quả dương tính nhỏ.

Chuỗi phát hành chính là dự án. Mỗi bản phát hành một thẻ, tất cả đều nằm thường trực trên nhánh chính. Mỗi thẻ mang các con số của chính bản phát hành đó, nên tốc độ và hiệu chuẩn của phiên bản này không bao giờ ghi đè lên phiên bản khác. Dự án nêu thẳng lý do: chuỗi đó là cách duy nhất để thấy liệu một vòng lặp tự cải thiện có đang cải thiện hay không. Mọi thứ khác — công thức, các tập lệnh, ngăn xếp được ghim — chỉ mang bản phát hành hiện tại, vì quy tắc ngược lại sẽ khiến không thể biết đâu là hiện tại. Một checkpoint đã được phát hành mang mã của chính nó để các bản phát hành cũ vẫn chạy được mà không cần các nhánh cũ.

A screenshot of the subject project's own GitHub repository page, Shanghua-Gao / RSI-Jev, showing the repository description 'Typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents - checkpoints, the code that produced them, and every version that failed', the sidebar counters 80 stars, 5 forks and 1 watching, 198 commits and 8 releases, the newest release headed 'RSI-Jev v6.1-VL 4B', an MIT license line, the topic tags ai-agents, autonomous-research, decision-model, jev, recursive-self-improvement, system-one and typed-decisions, and the merge commit 'Merge pull request #33 from Shanghua-Gao/release-v6.1-vl' at the top of the commit list.

Điều mà kỷ luật phải đánh đổi, và điều mà nó mang lại

Hai câu chuyện từ hồ sơ chính là đối trọng trung thực cho cụm từ "tự cải thiện", bởi cả hai đều là những trường hợp mà chính các quy tắc của vòng lặp đã khiến công việc vừa chậm hơn lại vừa tốt hơn cùng một lúc.

Đầu tiên là lỗi đằng sau v1.0. Việc tìm ra nó cần đến bảy kết quả âm đã được đăng ký. Mỗi cái trong số bảy là một bản sửa ở phía bộ tối ưu, giúp giảm một tình trạng bất ổn khi huấn luyện mà không loại bỏ được nó, bởi nguyên nhân là một sai lầm về độ chính xác không hề nằm gần bộ tối ưu — và bản sửa cuối cùng chỉ có một dòng. Không cái nào trong số bảy đáng để công bố riêng lẻ. Khi gộp lại, chúng chính là thứ khiến nguyên nhân có thể được tìm ra, và đó là toàn bộ lý lẽ cho việc đăng ký và lưu giữ các kết quả âm: giá trị của chúng là chung, không phải riêng lẻ.

Cái thứ hai kém đẹp đẽ hơn, và dự án vẫn công bố nó, trong một chú thích cuối trang. Một nhánh ban đầu đã trượt đúng một chốt bảo vệ — MMLU-Pro thấp hơn mức chuẩn 0,026 so với giới hạn 0,020 — và bị ghi nhận là đã bị loại. Người phụ trách lượt chạy sau đó đã nới giới hạn lên 0,030, với lý do rằng MMLU-Pro là một chốt bảo vệ chống lại sự quên lãng chứ không phải một mục tiêu, và nhánh này đã được xác nhận trên bốn hạt giống mới rồi trở thành bản phát hành tiếp theo. Việc loại bỏ ban đầu vẫn được giữ nguyên trong nhật ký, kèm theo bình luận của chính dự án rằng một mức chuẩn bị dịch chuyển sau khi đã nhìn thấy kết quả là kiểu điều mà người đọc phải có khả năng phát hiện ra là dự án đang làm.

Chú thích đó là đoạn hữu ích nhất trong kho mã đối với bất kỳ ai đang cố đánh giá kiểu tuyên bố này trong thực tế. Một ngưỡng bị dịch chuyển không phải là bằng chứng của sự thiếu thiện chí — lý lẽ được đưa ra là có thể biện minh được, và ngưỡng được nới rộng sau đó vẫn phải trụ qua bốn seed mới. Nhưng một ngưỡng bị dịch chuyển âm thầm là một vòng lặp không còn khép kín, và sự khác biệt giữa hai trường hợp hoàn toàn nằm ở việc nó có được ghi lại hay không. Quy tắc chung mà dự án thống nhất sau đó là quy tắc đáng mang sang các hệ thống khác: một ca suýt lỗi chỉ hỏng đúng một chốt chặn sẽ nhận được chẩn đoán và một sửa chữa có mục tiêu thay vì bị loại bỏ — và nếu việc sửa chữa thất bại, nó trở thành một ngõ cụt kèm ghi chép.

Tần suất vòng lặp bị sai là bao nhiêu: mười bốn thiết lập, hai được giữ lại

Đây là con số cần ghi nhớ. Tính đến bản phát hành đọc được hình ảnh, dự án đếm được mười bốn thiết lập học tăng cường và 63 nhánh được huấn luyện bằng phần thưởng. Hai đã được giữ lại.

Mỗi thiết lập đều được đánh giá dựa trên một đối chứng có giám sát được huấn luyện trên cùng các mục trong cùng số bước, và đây chính là phép so sánh khiến con số trở nên có ý nghĩa — một nhánh RL đánh bại một đường cơ sở mà nó chưa từng phải sánh ngang thì chẳng chứng minh được gì. Những thất bại mang tính chỉ dẫn, theo cách nói của chính dự án:

• RL đúng/sai nhị phân — đầu ra xác suất sụp đổ về 0 và 1. Việc thưởng cho hành vi chọn đúng thay vì tính trung thực của tỷ lệ được báo cáo sẽ đẩy một phân phối về các góc, và một mô hình quyết định mà độ tin cậy luôn ở mức tuyệt đối thì vô dụng cho chính việc mà các mô hình quyết định sinh ra để làm.

• RL dùng proper score, việc tái dựng mục tiêu kiểu Laya — ổn ở 300 bước, phân kỳ ở 1.500. Ổn định khi nó chẳng làm gì đáng kể, và bất ổn đúng lúc nó bắt đầu trở nên quan trọng.

• RLCR — ngang bằng về độ chính xác, hiệu chuẩn thô kém hơn. Nó không đạt thêm năng lực nào và phải trả giá bằng chính thuộc tính mà mô hình tồn tại để cung cấp.

• Bandit RLCD, trong đó chỉ kết quả của lựa chọn được chọn mới được tiết lộ — không tốt hơn huấn luyện có giám sát trên cùng phản hồi. Dự án đã tự phá bỏ bài kiểm tra được đăng ký trước của chính mình ở đây: nhánh này phải đánh bại huấn luyện có giám sát trên ít nhất hai trong bốn chỉ số hiệu chuẩn và chỉ thắng được một.

Người thắng cuộc, và lý do nó thắng, là phát hiện có thể chuyển giao nhất trên trang này. Đó là một phần thưởng theo danh sách — chất lượng xếp hạng được đo trên thứ tự của nhiều ứng viên được chấm điểm riêng rẽ, thay vì xử lý từng ứng viên một cách tách biệt. Recall xếp hạng lại ở vị trí đầu tiên đã tăng từ 0,192 đối với mô hình cha có giám sát lên 0,308, với các thắng và thua trong một kiểm định cặp đôi. Lời giải thích của dự án không phải là một câu chuyện tinh chỉnh: một mục tiêu huấn luyện theo từng mục chấm điểm từng ứng viên riêng lẻ, và không có nhãn đơn lẻ nào mã hóa được chất lượng của một thứ tựxuyên suốt các ứng viên. Ở nơi phần thưởng nói được điều mà các nhãn không thể diễn đạt, RL đã đánh bại huấn luyện có giám sát trên cùng các hàng dữ liệu. Ở nơi nó không làm được, huấn luyện có giám sát ngang bằng với nó.

Điều đó khái quát hóa thành một quy tắc về việc khi nào loại vòng lặp này có thể tìm được bất cứ thứ gì. Khi có sẵn nhãn vàng, cập nhật policy-gradient kỳ vọng bằng gradient của một mất mát có giám sát — cách diễn đạt của chính dự án — nên một “nhánh RL” được chấm điểm dựa trên các quyết định đã được gán nhãn thực chất là một nhánh thiết kế mất mát. Và những thay đổi ở cấp độ mất mát làm bộ kiểm thử nội bộ dịch chuyển nhiều nhất là 0,002, trong khi dữ liệu mới làm nó dịch chuyển 0,13. Đọc gộp lại: đòn bẩy của vòng lặp chưa bao giờ nằm ở mục tiêu. Nó nằm ở thứ được đo lường và thứ được đưa vào.

Đó là câu trả lời trung thực cho một câu hỏi mà người đọc có lý để đặt ra. Các thiết lập RL được trích dẫn ở nơi khác như bằng chứng về khả năng tự cải thiện nói chung; ở đây chúng là bằng chứng về một vòng lặp trên các tác vụ ra quyết định. Kết quả listwise chỉ là một seed, và dự án cũng nói rõ như vậy: so sánh ghép cặp RL với học có giám sát được chạy trên một mô hình cha khác với mô hình mà bản phát hành đã áp dụng nó, và bản phát hành đó "không có đối chứng học có giám sát khớp cặp." Một phát hiện đi kèm với lưu ý đó đáng giá hơn một phát hiện không có nó, và đó là lý do trang bạn đang đọc không khái quát hóa nó.

Nơi con người ngồi

Dự án rất tường minh, và chính sự tường minh ấy mới là phần thú vị: vòng lặp tự chạy các thí nghiệm của nó và tự loại bỏ những quán quân của nó, nhưng nó không quyết định điều gì đáng để đo lường, và nó không tự nhận ra khi một con số đúng về mặt kỹ thuật nhưng lại gây hiểu lầm trên thực tế. Con người mới làm điều đó.

Hai trong số các quy tắc của chính dự án tồn tại vì có người đã phản đối. Chốt kiểm tra MMLU-Pro đã được nới rộng thay vì để một trường hợp suýt đạt bị loại bỏ. Yêu cầu về seed giờ đây tỉ lệ với kích thước hiệu ứng, thay vì dùng bốn seed cho mọi khác biệt — bởi vì seed xác nhận, con số mà việc chọn một nhánh không dựa vào, mới là cái chịu lực, và tiêu tốn compute cho những khác biệt mà bạn đã có thể thấy thì chẳng đem lại gì. Một trong các bản phát hành trong chuỗi khởi đầu bằng việc từ chối loại bỏ một nhánh đã trượt một chốt kiểm tra. Dự án ghi công những người đã gửi phản hồi đó bằng tên, trong phần lời cảm ơn.

Vậy “tự cải thiện” ở đây mô tả phần giữa của vòng lặp, chứ không phải toàn bộ vòng lặp. Vòng lặp là một quá trình tìm kiếm chạy mà không cần con người quay tay quay. Con người vẫn ở đỉnh vòng lặp để chọn mục tiêu và ở đáy để đọc kết quả một cách phê phán — và chính cách sắp đặt đó giữ cho vòng lặp không trở thành một cỗ máy để xác nhận các sở thích của chính nó. Bất kỳ cách trình bày nào về tự cải thiện đệ quy mà bỏ qua vị trí đó đều đang mô tả một hệ thống khác với hệ thống này, và có lẽ là một hệ thống giả định.

Những điều mà các con số của chính dự án không cho thấy

Kỷ luật ở trên chỉ đáng được mô tả nếu những giới hạn của nó cũng được nêu ra cùng lúc, và thành tích của RSI-Jev tự nó nói lên những giới hạn ấy.

• Đây là một dự án, mỗi lần chỉ một kích thước mô hình, một seed. Checkpoint được công bố thuộc về một seed duy nhất, được cố định trước với vai trò chính thay vì được chọn để đạt điểm tốt nhất. Bằng chứng RL là một seed.

• Đây là các tác vụ quyết định, không phải sinh: một câu hỏi dạng có/không, chọn một trong k, hoặc chấm điểm theo rubric trên một tài liệu, một đoạn chat hay một hình ảnh, được trả lời trong một lượt forward pass với xác suất đã hiệu chỉnh cho mỗi phương án. Không có gì được sinh ra, nên không có token suy luận nào để tiêu tốn. Điều mà vòng lặp minh họa ở đây là nó có thể cải thiện một bộ chấm điểm có dạng như vậy.

• Một phần trong đó không thể tái tạo chỉ từ kho lưu trữ. Các kho ngữ liệu huấn luyện và các tập phát triển chính sách không được công khai, và dự án nói rõ như vậy trong thẻ phát hành: "các giai đoạn không thể được chạy lại chỉ từ kho lưu trữ này." Một trình xây dựng kho ngữ liệu cần khoảng 96 GB bộ nhớ và đã không được chạy lại từ đầu đến cuối.

Không phải mọi thứ đều có thể kiểm chứng được. Bộ kiểm thử nội bộ chưa bao giờ được giữ hoàn toàn tách biệt. Trong số mười lăm bộ đánh giá, mười bộ đóng góp dữ liệu huấn luyện dưới một hình thức nào đó, nên không con số nào trong số đó là zero-shot — tập được giữ tách biệt mới là phép so sánh được giữ tách biệt, và nó là phép so sánh duy nhất.

Và những phần bên ngoài cũng có mô sẹo của riêng mình. Một cuộc kiểm toán sau một bản phát hành đã tìm thấy khoảng một nghìn mục thuộc các hàng kiểm thử của bộ công cụ đánh giá chuẩn công khai nằm trong các kho ngữ liệu huấn luyện — chiếm khoảng 0,1% số hàng của bộ công cụ, với đóng góp đơn lẻ lớn nhất là vài trăm hàng đến từ một nguồn. Khi chấm điểm lại mà không có chúng, chỉ số thay đổi nhiều nhất là 0,04. Bản chỉnh sửa đó đã được công bố trong thẻ của bản phát hành tiếp theo thay vì được lặng lẽ áp dụng, theo quy tắc mà dự án nêu là “không ô nhiễm, được kiểm tra chứ không chỉ được khẳng định”. Đó là một quy tắc khiến họ phải mất đi một con số, và đó là kiểu quy tắc duy nhất đáng để có.

Nơi bạn thực sự có thể chạy nó — và nơi bạn không thể

Ở đây, OrcaRouter không phục vụ bất cứ thứ gì. Danh mục của chúng tôi không có id RSI-Jev và cũng không có model card nào cho nó, và sẽ không có cho tới khi có ai đó phục vụ nó. RSI-Jev được cài đặt từ kho riêng của nó và chạy máy chủ riêng, hoạt động theo Jev API: bạn chỉ cần trỏ một Jev client hiện có vào đó và đổi base URL. Nó chạy trên Linux, Windows và macOS, trên GPU CUDA, Apple Silicon hoặc CPU thường.

Mô hình duy nhất mà chúng tôi thực sự vận hành là phía bên kia của thỏa thuận đó. Jev 1.13 của TypeSafe, mà chúng tôi cung cấp dưới tên typesafe/jev-1.13, là mô hình quyết định thương mại mà các dạng yêu cầu và trả lời của RSI-Jev tái tạo, và nó được truy cập trên endpoint systemone chuyên dụng của chúng tôi chứ không phải thông qua dạng chat-completions. Đó là toàn bộ mối quan hệ, và đó là một quan hệ mang tính cấu trúc chứ không phải một tuyên bố về chất lượng: một cái là mô hình thương mại được lưu trữ trên endpoint của nhà cung cấp, cái kia là checkpoint bạn tự tải về và tự phục vụ. Chưa ai chạy so sánh đối đầu độc lập giữa chúng, và trang này sẽ không tuyên bố người thắng từ hai harness khác nhau.

A generated single-column scoreboard headed 'RSI-Jev - the loop's own ledger', with six rows reading 'Predictions: registered before the run', 'Null floors: measured from identical arms', 'Held-out set: read once, then spent', 'Failures: published, including the champion's', 'Release chain: one card per release, on main forever' and 'RL setups kept: 2 of 14, each judged against a matched control'; a footer reads 'All figures from the project's own record, read 2026-10-08.'

Nếu điều bạn muốn là đặt một mô hình quyết định như thế này phía sau một ứng dụng, thì câu hỏi định tuyến tách biệt khỏi câu hỏi về mô hình, và nó chính là phần quyết định liệu thí nghiệm có đáng để chạy hay không. OrcaRouter là một API duy nhất cho hơn 200 mô hình với 0% phụ phí — giá niêm yết của nhà cung cấp được chuyển nguyên vẹn, nên khi nhà cung cấp đổi giá thì đó cũng là giá của bạn ngay trong cùng ngày — cộng thêm tự động chuyển đổi dự phòng và một DSL định tuyến để kết hợp nhiều mô hình vào một lệnh gọi. Với một mô hình vòng lặp mà bạn chưa thể gọi qua một API thông dụng, điều đó có ý nghĩa theo một cách cụ thể: nó nghĩa là các ứng viên thay thế mà bạn sẽ đem ra đối chuẩn đều đã nằm sau một khóa duy nhất, và việc so sánh chỉ là một thay đổi cấu hình chứ không phải là tích hợp thêm lần nữa.

A screenshot of OrcaRouter's own model page for typesafe/jev-1.13 showing the left navigation, a PERFORMANCE panel with prefill and decode lines, the heading 'Jev 1.13' with the provider line 'typesafe', the price fields $0.11 prefill and $0.36 decode per million tokens, a benchmark box with MED 0.3, Response Trust 0.784, Structured Output 0.964, Refusal Correctness 1.0 and Consistency 0.59, an accuracy-versus-cost scatter with a 'Jev 1.13' marker, an 'Individual Runs' table, API and Agent curl snippets pointing at the systemone endpoint, the OrcaRouter logo and a sign-up button.

Phần đáng giữ lại

Lý do để viết về tự cải thiện đệ quy thông qua một dự án như thế này, thay vì thông qua lập luận về việc liệu nó có dẫn đến kịch tính hay không, là các quy tắc của vòng lặp mới là phần có thể chuyển giao còn suy đoán thì không. Các dự đoán đã đăng ký, các mức sàn null đã đo lường, các tập held-out đã dùng, các thất bại đã công bố, một chuỗi phát hành bất biến: không cái nào trong số đó là thuộc tính của một siêu trí tuệ. Chúng là thuộc tính của một phòng thí nghiệm đã quyết định trở nên có thể kiểm chứng, và chúng sẵn có cho bất kỳ nhóm nào đang vận hành tìm kiếm tự động ngày nay, ở bất kỳ quy mô nào, trên bất kỳ mô hình nào.

Hiểu theo cách đó, điều đáng chú ý trong hồ sơ của RSI-Jev không phải là điểm số. Mà là việc sổ cái của chính vòng lặp nói rằng nó đã sai thường xuyên hơn nhiều so với lúc đúng — hai công thức được giữ lại trong mười bốn thiết lập, bảy kết quả âm để tìm ra một lỗi một dòng, một cột đã thay đổi và được ghi lại — và việc dự án đã công bố sổ cái đó. Một mức tăng từ 38,38 lên 46,24 trên một chỉ số công khai trong một bản phát hành chỉ là điều tò mò nếu không có những thất bại bên cạnh. Chính những thất bại là thứ khiến con số có ý nghĩa.

Đó là lập trường trung thực về chính thuật ngữ này. Câu hỏi không phải là liệu một hệ thống có thể tự cải thiện hay không. Mà là liệu sự cải thiện đó có được đo bằng một thứ lẽ ra có thể nói không. Ở đâu sự tách biệt đó là thật và được ghi chép lại, thì vòng lặp ấy đáng để đọc. Ở đâu không có, thì một đường đang đi lên chỉ là mô tả về một bộ chấm điểm, chứ không phải về một hệ thống đang trở nên tốt hơn — và không lượng đệ quy nào sửa được điều đó.