Thẻ tiêu đề được tạo tự động có tiêu đề 'RSI-Jev là gì?' cùng phụ đề 'Một vòng lặp nghiên cứu tự cải thiện, xây dựng các mô hình quyết định kiểu Jev', phía trên một hàng gồm ba thẻ cột mốc bo tròn ghi '4,69B tham số - tháp Qwen3.5-4B-Base', 'Ba lối thoát - các lớp 16 / 20 / 32' và 'Tiêu tốn độ sâu, chứ không tiêu tốn token'; phần chân trang ghi 'Mọi số liệu trên trang đều là của chính dự án, đọc ngày 2026-10-07.', với các biểu tượng đường nét phẳng tối giản và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

RSI-Jev là gì? Một vòng lặp tự cải thiện để xây dựng các mô hình quyết định theo phong cách Jev

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

RSI-Jev là một dự án nghiên cứu mở của bên thứ ba, chuyên xây dựng các mô hình ra quyết định System One kiểu Jev, và mô hình mà trang này nói đến là bản phát hành 4B của nó, RSI-Jev v6.0-VL, đề ngày 2026-10-06. Nó được viết bởi Shanghua Gao (@gasvn), với Sufian (@SufianTA) được ghi công trong phần acknowledgements của kho lưu trữ, và nó không phải Jev của TypeSafe cũng như không liên kết với TypeSafe AI — dòng giấy phép của chính dự án nói chính xác như vậy. Ý tưởng đằng sau nó đủ hẹp để diễn đạt trong một câu: hãy đặt một câu hỏi có kiểu về một tài liệu, một cuộc trò chuyện hoặc một hình ảnh — có/không, chọn-một-trong-k, đánh giá-theo-rubric — và một lượt truyền xuôi trả về xác suất đã hiệu chỉnh cho mọi lựa chọn. Không có gì được sinh ra, nên không có token suy luận nào để tiêu tốn, và không có token nào bị tiêu tốn. v6.0-VL không phải bản phát hành đầu tiên của dự án; nó là bản thứ bảy trong mười hai ngày, và đó là điều quan trọng nhất cần hiểu về nó, bởi vì thông tin hữu ích ở đây nằm ở hình dạng của đường hơn là ở bất kỳ một checkpoint nào.

Có một điều phải nói trước mọi con số, vì nó định ngày cho tất cả chúng. v6.0-VL chỉ giữ vị trí dẫn đầu đúng một ngày. Vào 2026-10-07 lúc 07:56 UTC — sáng nay — dự án đã công bố RSI-Jev v6.1-VL, là v6.0-VL được trung bình hóa, trọng số 0,5 cho mỗi bên, với lần tinh chỉnh thứ hai của cùng Qwen3.5-4B-Base được huấn luyện trên dữ liệu khác, và đạt 50,98 trên bộ Decision Index 0.3 của dự án, so với 46,23 của v6.0-VL trên cùng bộ đó. Không có gì được huấn luyện sau phép trung bình đó. Độ hiệu chuẩn của nó kém hơn của v6.0-VL, và thẻ của chính nó cũng nói vậy. Bản phát hành đó là thật và hiện hành; trang này không nói về nó. Mọi số liệu bên dưới đều được đọc từ hồ sơ phát hành của v6.0-VL, đề ngày 2026-10-06, và khi một con số thống kê đã thay đổi kể từ đó — số lượng bản phát hành, số lượng thí nghiệm — trang này đưa ra cả con số như nó từng đúng với v6.0-VL và con số như nó được ghi hôm nay.

RSI-Jev không phải là gì cũng đáng được nêu sớm, bởi vì hai trong ba giả định hiển nhiên là sai. Nó không phải là một sản phẩm hosted mà bạn có thể gọi ngay hôm nay qua một API tổng quát, và nó không được OrcaRouter phục vụ — danh mục của chúng tôi không có id rsi-jev, không có id shgao và cũng không có model card nào cho nó. Thứ duy nhất chúng tôi có là mô hình mà hợp đồng HTTP của dự án này sao chép theo: Jev thương mại của TypeSafe, mà chúng tôi phục vụ dưới tên typesafe/jev-1.13 trên endpoint systemone. Một trong hai cái đó thì bạn gọi, còn cái kia thì bạn tự tải về và tự phục vụ. Mọi thứ dưới đây đều đến từ chính kho lưu trữ của dự án, các release card và tài liệu phục vụ, được đọc vào ngày 2026-10-07, và ở chỗ nào một con số là của chính dự án chứ không phải do bên ngoài đo đạc, trang này sẽ nói rõ đó là số của ai.

A screenshot of the subject project's own GitHub repository page, Shanghua-Gao / RSI-Jev, showing the repository description 'Typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents - checkpoints, the code that produced them, and every version that failed', the sidebar counters 73 stars, 5 forks and 1 watching, 198 commits and 8 releases, the newest release headed 'RSI-Jev v6.1-VL 4B' dated 14 minutes before the capture, an MIT license line, the topic tags ai-agents, autonomous-research, decision-model, jev, recursive-self-improvement, system-one and typed-decisions, and the merge commit 'Merge pull request #33 from Shanghua-Gao/release-v6.1-vl' at the top of the commit list.

Thứ đó thực sự làm gì

Dự án tự mô tả mình trong một dòng là “một hệ thống nghiên cứu tự cải thiện đệ quy, chuyên xây dựng các mô hình System One kiểu Jev”, và những tạo tác mà nó tạo ra là các bộ quyết định chứ không phải các bộ sinh. Bạn đưa cho nó một trạng thái — một tài liệu, một bản ghi hội thoại, một giao dịch, và trong các bản phát hành thị giác thì tối đa bốn hình ảnh — cùng một hoặc nhiều câu hỏi có kiểu với các tiêu chí được đặt tên. Nó trả về, cho mỗi câu hỏi, một xác suất cho mọi lựa chọn. Ba loại câu hỏi bao phủ toàn bộ không gian này, và chúng chính là những loại mà API của TypeSafe định nghĩa:

• mới — một đánh giá đúng/sai, được trả về dưới dạng một xác suất duy nhất, không có phân phối và không có giá trị độ tin cậy, khớp chính xác với dạng câu trả lời của tham chiếu.

• lựa chọn — chọn một trong một tập hợp các tùy chọn được gắn nhãn, được trả về cùng với toàn bộ phân phối xác suất và một thống kê độ tin cậy.

• điểm số — đánh giá theo một thang đánh giá có thứ tự, được trả về dưới dạng chỉ số bắt đầu từ 0, có trọng số theo xác suất, tương ứng với các mức, kèm theo chú giải và phân bố.

Vì không có bước tạo sinh, nên không có lần gọi mô hình thứ hai và cũng không có việc lấy mẫu. Một quyết định về một tài liệu mà mô hình đã đọc rồi vốn dĩ là một thao tác rẻ, và con số của chính dự án cho chi phí đó — “khoảng 10 ms” — thuộc về thời kỳ 2B của nó, chứ không phải bản phát hành hiện tại; các số liệu đo được cho v6.0-VL được đưa ra ở phần dưới.

Hai sự thật về quyền sở hữu quan trọng hơn bất cứ điều gì khác trên trang này. RSI-Jev không phải là công trình của TypeSafe và TypeSafe chưa hề chứng thực nó. Dòng giấy phép, được trích dẫn nguyên văn: "Code: MIT. Weights: Apache-2.0, theo mô hình cơ sở; một số nguồn huấn luyện hình ảnh là phi thương mại, được liệt kê trên từng thẻ mô hình. Không liên kết với TypeSafe AI." Và mối quan hệ chỉ diễn ra một chiều: dự án cố ý sao chép định dạng truyền tải của Jev, và nói rõ như vậy, bởi vì một máy chủ tương thích chính là mục đích. "Jev-style" là cụm từ của chính dự án để chỉ loại mô hình mà nó xây dựng. Jev của TypeSafe là một mô hình khác, đóng, thương mại, và hai thứ đó không phải là cùng một thứ dưới một cái tên ngắn hơn.

Bên trong mô hình hiện tại: một tháp Qwen 4B với ba điểm thoát

RSI-Jev v6.0-VL là một tower Qwen3.5-4B-Base với tower được tinh chỉnh và một decision head đã được huấn luyện ở trên. Đó là toàn bộ kiến trúc — không có mixture of experts, không có router và không có mô hình thứ hai. Nó chạy toàn bộ mô hình base, đó là lý do số lượng tham số của nó là 4,69B chứ không phải một con số nhỏ hơn: 3,57B nằm trong 32 lớp decoder, 0,64B trong token embeddings, 0,33B trong vision tower, 0,05B trong main decision head và 0,10B trong hai early-exit heads. Checkpoint được phát hành là khép kín và có dung lượng 9,7 GB ở định dạng bf16.

Ba đầu quyết định được gắn vào, tại các lớp 16, 20 và 32 của mô hình nền, và chúng là cơ chế đằng sau mọi thứ mà bản phát hành hiện tại được biết đến. Một lối ra thứ tư ở lớp 12 đã được xây dựng, đo lường và bị loại bỏ — "Lối ra ở lớp 12 đã thua dòng thác từ 16 trong mọi so sánh và không nằm trong gói" — vậy nên ba cái được đưa vào bản phát hành còn bốn cái thì không. Các lối ra đọc một bản sao tách rời của lớp tương ứng, một chi tiết mà dự án đã phát hiện theo cách khó nhọc: việc tinh chỉnh lại các đầu trên một thân mà các lối ra đã được gắn vào trong lúc huấn luyện đã không khôi phục được độ chính xác của các lớp sâu, nên việc tách rời chúng chính là điều đã khôi phục lại độ sâu.

Một con số ở đây là cách dễ nhất để hiểu sai dự án. Mọi thứ tính đến và bao gồm cả v3.0 đều là mô hình 2B trên Qwen3.5-2B-Base, và đó là dòng phát triển, không phải mô hình hiện tại. v4.0-VL là 2B, v5.0-VL đã cắt giảm một mô hình xuống 3B, và v6.0-VL là 4B. Một trang gọi mô hình RSI-Jev hiện tại là 2B thì đã lỗi thời ba bản phát hành.

Vòng lặp chính là dự án thực sự.

Các mô hình là sản phẩm đầu ra; thứ đang được xây dựng là quy trình. Dự án tuyên bố rằng "vòng lặp điều hành nghiên cứu chính là phiên bản tiếp theo của AutoScientists", hệ thống nhóm tác nhân tự tổ chức do phòng thí nghiệm Zitnik tại Harvard công bố, và nó vận hành đúng như câu nói đó hàm ý. Các tác nhân AI đề xuất giả thuyết, đăng ký dự đoán của chúng trước khi tiêu tốn thời gian GPU, chạy các thí nghiệm, và tự loại bỏ những mô hình vô địch của chính mình khi bằng chứng cho thấy cần phải làm vậy. Hai con số khiến điều đó trở nên cụ thể. Đọc vào ngày 2026-10-07, tiêu đề của kho lưu trữ là tám bản phát hành trong mười ba ngày, từ v1.0 đến v6.1-VL; đối với bản phát hành v6.0-VL vào ngày 2026-10-06, nó ghi bảy bản phát hành trong mười hai ngày, mỗi bản đều được vòng lặp huấn luyện, đánh giá và ghi chép tài liệu. Và số lượng thí nghiệm, vốn đứng ở 471 khi bản phát hành của trang này ra mắt, hôm nay là 496 — mỗi thí nghiệm đều được viết thành báo cáo, kể cả các thất bại. Cả hai con số đều là của chính dự án, và cả hai đều thay đổi.

Chính kỷ luật là thứ khiến những con số đó có ý nghĩa, và dự án liệt kê điều đó một cách thẳng thắn. Mức sàn null được đo lường thay vì giả định — các nhánh có thể chứng minh là giống hệt đối chứng, được xác minh bằng định danh đối tượng trước khi tốn bất kỳ thời gian GPU nào, sao cho độ phân tán giữa chúng là mức nền nhiễu và một khác biệt nhỏ hơn độ phân tán đó không phải là kết quả. Các dự đoán được đăng ký trước khi chạy, nên một phiên bản không đạt chính mức chuẩn của nó sẽ được phát hành như một thất bại thay vì bị âm thầm cắt lại. Các artifact được xác minh: một checkpoint được tải lại từ đĩa và chấm điểm lại, và chỉ được công bố nếu nó tái tạo được các dự đoán cho từng câu hỏi của lần chạy huấn luyện của nó, điều mà cả hai checkpoint v1.0 đều làm được ở mức 1.0000. Nhiễm dữ liệu được "kiểm tra thay vì khẳng định." Và những thất bại được phát hành, kể cả những thất bại đã hạ gục nhà vô địch của chính dự án.

Đóng góp là gì, theo chính lời của dự án từ hướng dẫn đóng góp của nó: "Ở đây, một đóng góp thường là một phép đo, không phải một bản vá." Hồ sơ các bản phát hành được lưu dưới dạng một chuỗi chứ không phải một ảnh chụp nhanh — "versions/ giữ một thẻ cho mỗi bản phát hành, tất cả chúng, trên main mãi mãi… Chuỗi đó CHÍNH LÀ dự án" — đó là lý do vì sao các con số của một bản phát hành cũ có thể được đối chiếu với những gì dự án nói về chúng sau này, và vì sao bản chỉnh sửa duy nhất được bàn tới dưới đây lại hiện rõ thay vì im lặng.

Điều v6.0-VL đã thay đổi: nó dùng độ sâu thay vì token

Cơ chế của bản phát hành hiện tại là một cài đặt gọi là effort, và nó điều khiển một thứ khá lạ: một yêu cầu được phép dùng bao nhiêu lớp của mô hình. Vì các head nằm ở ba độ sâu, một câu hỏi dễ có thể được trả lời ở lớp 16 và một câu hỏi khó có thể chạy hết cả 32 lớp. low dừng ở lớp 16, medium ở 20, high ở 32, và auto trả lời tại điểm thoát đầu tiên mà xác suất đã hiệu chỉnh vượt ngưỡng của điểm thoát đó. Độ trễ trung vị mỗi yêu cầu trên mẫu Decision Index, đo trên một H200 ở bf16: 23 ms ở low, 27 ms ở medium, 40 ms ở high, và 40 ms cho mặc định khi chưa đặt. Đây là các phép đo của chính dự án trên phần cứng của chính nó và không nên trộn lẫn với các con số GB10 trong tài liệu serving, vốn là một máy khác.

Hành vi đo được của auto mới là phần thú vị: trên bộ mười lăm benchmark của dự án, 20% câu hỏi dừng ở lớp 16, 46% dừng ở lớp 20 và 34% chạy tới tận 32, trung bình là 23,3 trên 32 lớp. Một ngưỡng cố định duy nhất đạt trung bình 20,9, và dừng muộn hơn mức cần thiết chính là thứ mà một ngưỡng duy nhất mang lại. auto không phải là một sự thỏa hiệp về chất lượng, và điều này đáng nói ra bởi vì đó thường chính là bản chất của một thiết lập thích ứng: nó đạt hàng kết quả suite tốt nhất trong số mọi thiết lập (0,771 so với 0,770 của thiết lập mặc định), hàng MMLU-Pro tốt nhất (0,444 so với 0,440) và kết quả hiệu chuẩn cuối cùng tốt nhất (ECE 0,024 so với 0,036). Nơi duy nhất highthắng là tập held-out, 0,702 so với auto đạt 0,696. Một số tác vụ trở nên tệ hơn một cách đo lường được khi tăng độ sâu — BANKING77 kém hơn 0,035, khớp chú thích New Yorker kém hơn 0,060 — đó là lý do mức nỗ lực là lựa chọn mà bên gọi đưa ra chứ không phải quy tắc mà máy chủ áp đặt.

Kết quả khiến đây trở thành một bản phát hành chứ không phải một thử nghiệm nằm trên Decision Index 0.2.1 công khai của dự án, nơi điểm số đã tăng từ 38.38 cho v5.0-VL lên 46.24 cho v6.0-VL chỉ trong một bản phát hành. Trên bảng công khai ngày 2026-09-28, đó là điểm cao nhất trong số các mô hình 4B và mọi thứ nhỏ hơn, và đứng thứ 14 trong tổng số 71; mục tiếp theo ở kích thước đó là JPT-4B với 43.04. Các bản phát hành trước đó trên dòng này là dòng dõi và không phải mô hình hiện tại: v5.0-VL (2026-10-02) đã cắt mô hình xuống còn 20 lớp đầu tiên trong số 32 lớp và khiến nó trả lời "unknown" khi một câu hỏi không có câu trả lời; v4.0-VL (2026-10-01) là bản đầu tiên đọc được hình ảnh; và v3.0 (2026-09-28) là bản phát hành mà học tăng cường lần đầu tiên giúp ích, thông qua phần thưởng xếp hạng theo danh sách — NDCG@5 trên 16 ứng viên — đã nâng R@1 của việc xếp hạng lại từ 0.192 lên 0.308 so với mô hình cha được giám sát, với chi phí 0.0028 trên bộ kiểm thử. Đó là nơi câu chuyện RL của dự án bắt đầu, và hiện tại nó đã lùi lại ba bản phát hành.

A generated single-column scoreboard headed 'RSI-Jev v6.0-VL - the scoreboard', with six rows reading 'Decision Index: 46.24 on its own public board', '15-benchmark suite: 0.770 without open_jev_ood', 'Held-out set: 0.698', 'MMLU-Pro: 0.440', 'Final ECE: 0.024 with effort auto' and 'Depth: layers 16 / 20 / 32 at 23 / 27 / 40 ms'; a footer reads 'All figures RSI-Jev's own release record, 2026-10-06; the Decision Index is its own public board, not a third-party result.'

Những con số, cùng với những lưu ý đi kèm với chúng

Điểm headline của Decision Index 0.2.1 cho v6.0-VL là 46,24, trong một lần chạy đầy đủ mà tất cả 150.759 yêu cầu của bộ đều được trả lời: kiến thức 28,8, ngôn ngữ 46,2, truy xuất 55,5, công cụ 65,8, nghệ thuật 37,1. Bộ mười lăm benchmark đạt 0,770, tập held-out đạt 0,698, MMLU-Pro đạt 0,440, và ECE cuối cùng đạt 0,024 với chế độ tự động. Hai lưu ý phải đi kèm với những con số đó, vì nếu thiếu chúng thì các con số sẽ gây hiểu nhầm.

Đầu tiên là một mục bị cắt khỏi bộ kiểm thử. Tác vụ nội bộ của bộ kiểm thử open_jev_ood đã trùng với 579 dòng huấn luyện, nên con số của nó bị thổi phồng thêm một lượng không xác định; từ v6.0-VL trở đi, dự án báo cáo bộ kiểm thử mà không có nó, ở mức 0,770. Con số 0,764 của v5.0-VL là khi có nó, và thẻ của v6.0-VL ghi lại bản phát hành đó là 0,763 khi không có nó. Hai con số này không thể so sánh với nhau, và nếu bạn có so sánh chúng thì bạn phải dùng con số 0,763 đã được ghi lại và nói rõ rằng đó là điều bạn đang làm. Tập held-out, MMLU-Pro và BBH không có trùng lặp và không bị ảnh hưởng. Một cuộc kiểm toán liên quan đã phát hiện khoảng 1.000 mục thuộc các dòng kiểm thử của bộ Decision Index nằm trong kho ngữ liệu huấn luyện — ANLI 274, RouterBench-GSM8K 90, ARC 5, và văn bản truy vấn BRIGHT/ToolRet không có nhãn, chiếm khoảng 0,3% số dòng của bộ này — và việc chấm điểm lại mà không có chúng làm chỉ số dịch chuyển nhiều nhất là 0,04 trên mẫu của dự án. Đó là một đính chính cho hồ sơ của v5.0-VL, được công bố trong thẻ của v6.0-VL, và đó chính là quy tắc nhiễm bẩn của chính dự án khiến nó mất đi một con số.

Điều thứ hai là chuyện benchmark này thuộc về ai. Decision Index là bảng công khai của chính RSI-Jev, không phải phán quyết của bên thứ ba, và 46.24 là điểm trên bảng đó. Nó không thể so sánh với bất cứ thứ gì TypeSafe đã công bố, vì hai con số không đến từ cùng một harness, và chưa ai chạy so sánh đối đầu độc lập giữa RSI-Jev và Jev 1.13. Điều có thể nói là mang tính cấu trúc hơn là con số: một bên là mô hình thương mại được host trên endpoint của nhà cung cấp, còn bên kia là checkpoint bạn tự tải về và tự vận hành.

Hai mẩu ngữ cảnh bổ sung nữa đi kèm với bộ này. Dự án nói rõ rằng "mười trong số mười lăm benchmark đóng góp dữ liệu huấn luyện dưới một hình thức nào đó, nên không có con số nào trong số này là zero-shot"; tập held-out là phép so sánh được giữ riêng, và ngay cả nó cũng "được giữ riêng khỏi huấn luyện, chứ không bị niêm phong khỏi quá trình tìm kiếm". Và v6.0-VL đã chạy 97 nhánh trên dòng riêng của nó — 93 nếu bỏ bốn đợt kiểm tra dữ liệu — đây là quy mô tìm kiếm đã tạo ra bước nhảy 7,86 điểm trên chỉ số đó.

Nó dùng định dạng truyền tải của Jev, với bốn điểm khác biệt mà người gọi cần biết.

Bề mặt tương thích là lý do dự án này tồn tại với hình dạng như hiện tại. Cùng dạng yêu cầu ({state, model, questions}), cùng ba loại câu hỏi với cùng dạng tiêu chí, cùng dạng câu trả lời, cùng số lượng từ 1 đến 64 câu hỏi mỗi yêu cầu, cùng các phong bì lỗi, và cùng thống kê độ tin cậy — giá trị đỉnh, (K · p_max − 1) / (K − 1), được kẹp trong khoảng 0..1. Tuyên bố của chính dự án về bề mặt đó là "mọi thứ được viết cho Jev đều hoạt động với cái này mà không cần thay đổi", và máy chủ ghi rõ những gì được sao chép và những gì không, điều này hữu ích hơn cả tuyên bố đó.

• Prompt và readout là của riêng nó. RSI-Jev là một mô hình cơ sở với một đầu readout đã được huấn luyện, được phục vụ cùng với encoder mà nó đã được huấn luyện, bởi vì việc dùng prompt của tham chiếu "sẽ đưa mô hình ra khỏi phân phối huấn luyện của nó." Hợp đồng truyền thông là bề mặt tương thích; prompt thì không.

• Các khóa lựa chọn hiển thị với mô hình. Bản tham chiếu ẩn chúng đi, nên việc đổi tên một khóa chắc chắn không thể làm thay đổi câu trả lời ở đó. Ở đây thì có thể, và máy chủ báo cáo điều này một cách trung thực là option_keys_visible_to_model: true.

• Tiêu chí phải là chuỗi hoặc null. Một tiêu chí có cấu trúc — một đối tượng — bị từ chối với lỗi 422, vì không có bản phát hành nào được huấn luyện trên một đối tượng như vậy. Đây là điểm duy nhất mà một yêu cầu được tham chiếu chấp nhận sẽ không chạy ở đây.

• Không có gì bị cắt. Việc phục vụ tiếp nhận tối đa 32.768 token văn bản cộng với hạn mức hình ảnh, và một yêu cầu dài hơn sẽ bị từ chối bằng mã lỗi 422 nói rõ điều đó thay vì bị cắt ngầm. Con số 2.048 token xuất hiện trong các thẻ cũ hơn là độ dài mà các mô hình đã được huấn luyện, chứ không phải giới hạn phục vụ, và việc mô tả một sự cắt ngầm xuống 2.048 như hành vi hiện tại là sai.

Số lượng tùy chọn chênh lệch rất lớn theo hướng có lợi cho serving: tối đa 5.120 tùy chọn mỗi câu hỏi (RSIJEV_MAX_ANSWERS), so với 160 khi huấn luyện và 64 mà reference chấp nhận. Đừng trích dẫn 160 như mức trần của serving. Có một điểm mới trong các phản hồi của v6.0-VL chứ không phải được kế thừa: mỗi câu trả lời báo cáo lớp nào đã trả lời, trong usage.depth, cùng với độ tin cậy đã hiệu chỉnh, để có thể kiểm toán lại một quyết định thích ứng sau đó. Hình ảnh là một phần mở rộng mà reference không có — từ một đến bốn ảnh mỗi yêu cầu, dưới dạng URL dữ liệu base64, với state tham chiếu đến từng ảnh bằng một marker nguyên văn.

Nơi người đọc thực sự có thể chạy nó, và nơi họ không thể

RSI-Jev là một bản tải xuống. Dự án đi kèm máy chủ riêng của nó, vốn dùng API tương thích Jev đó, và lộ trình được tài liệu hóa là pip install từ kho lưu trữ, sau đó là lệnh serve của nó với bí danh checkpoint và một thiết lập effort. Các trọng số nằm trên Hugging Face dưới tổ chức shgao, được phát hành theo Apache-2.0, tiếp nối mô hình cơ sở, cùng một câu hỏi mở mà chính dự án nêu ra: năm trong số các nguồn dữ liệu huấn luyện hình ảnh là phi thương mại hoặc chỉ dành cho nghiên cứu, và "liệu các trọng số được huấn luyện trên dữ liệu phi thương mại có thừa hưởng các điều khoản đó hay không vẫn chưa được giải quyết." Mã nguồn là MIT.

Phần cứng không phải là ràng buộc. Dự án phát triển trên một HP ZGX Nano, một cỗ máy NVIDIA GB10 mà dự án ghi công cho HP và NVIDIA, và máy chủ chạy trên bất kỳ GPU CUDA nào, trên Apple Silicon, hoặc trên CPU thông thường — tài liệu ghi phương án cuối cùng ở mức 733 ms cho một câu hỏi duy nhất trên chính CPU Arm của GB10, tức là dùng được chứ không nhanh.

Điều nó không làm là xuất hiện trong một danh mục mô hình tổng quát, và đây là chỗ chúng ta phải chính xác về vị thế của chính mình. RSI-Jev không có trên OrcaRouter và không có model card nào để nó định tuyến tới. Thứ chúng tôi phục vụ là Jev thương mại của TypeSafe, typesafe/jev-1.13, trên endpoint systemone chuyên dụng, truy cập bằng một POST tới /v1/systemone thay vì dạng chat-completions của OpenAI — cùng những hình dạng yêu cầu và phản hồi mà dự án này triển khai, từ chính mô hình mà nó sao chép hợp đồng. Đó là toàn bộ mối quan hệ: cả hai nói cùng một giao thức, chúng tôi phục vụ một trong hai, còn bạn tự chạy cái kia. Nếu bạn đã có khóa với chúng tôi, dạng gọi Jev 1.13 là một route hạng nhất trên một API cho 200+ mô hình với 0% markup (giá niêm yết của nhà cung cấp được truyền thẳng, nên các đợt giảm giá của nhà cung cấp có hiệu lực ở đây ngay trong cùng ngày) — điều này quan trọng cho việc so sánh theo một cách cụ thể. Một trang như trang này thì chi phí để hành động theo rất thấp nếu bạn có thể thử hợp đồng thương mại trước và chỉ sau đó mới quyết định liệu tự chạy một checkpoint 4B mở có đáng với công vận hành hay không.

A screenshot of OrcaRouter's own model page for Jev 1.13 showing the breadcrumb 'Home / Models / TypeSafe', the title 'Jev 1.13', the slug typesafe/jev-1.13, 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions, the line 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the price $0.04, our p50 TTFT of 149 ms, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Cách đọc RSI-Jev vào ngày 2026-10-07

Những điểm yếu mà dự án công bố cũng cụ thể như các kết quả của nó, và ngày tháng rất quan trọng. Thử nghiệm bên ngoài đối với v2.1 phát hiện rằng mô hình có xu hướng nghiêng về lựa chọn nghiêm trọng hơn hoặc tốn kém hơn trong các lựa chọn có thứ tự và điểm rubric, hiếm khi chọn "không xác định" khi tài liệu không thể trả lời, và trả lời một câu hỏi cùng phủ định của nó một cách không nhất quán. Các bản phát hành sau đó hướng dữ liệu vào trường hợp "không xác định" — KoBBQ unknown-when-ambiguous đạt 0.891 ở v4.0-VL, 0.932 ở v5.0-VL, và 0.918 / 0.939 ở v6.0-VL — và thẻ v6.0-VL thẳng thắn rằng những cải thiện đến từ dữ liệu chứ không phải từ độ sâu, và rằng 10% câu hỏi sẽ đi đến lớp 32 và dừng ở 16 hoặc 20 là nơi chính sách độ sâu vẫn còn đang đoán. Xếp hạng lại còn phải đi xa hơn: thứ tự truy xuất của chính hippo-memory đạt 0.484 R@1 và vẫn dẫn trước 0.308 mà mô hình đạt được ở v3.0, một con số mà dự án chưa từng tuyên bố thu hẹp kể từ đó. Bằng chứng RL chỉ là một seed, và v3.0 "bản thân không có đối chứng SFT tương ứng." Các tập dữ liệu huấn luyện và tập phát triển chính sách không công khai, vì vậy các giai đoạn không thể được chạy lại chỉ từ kho lưu trữ, và trình tạo tập dữ liệu xếp hạng lại — khoảng 96 GB bộ nhớ — đã không được chạy lại từ đầu đến cuối.

Độ lan tỏa, đọc cùng ngày: 73 sao, 5 lượt fork, 0 issue đang mở, 7 bản phát hành GitHub. Những con số đó thay đổi hằng ngày, và một repository mới ba tuần tuổi thì không phải là một dự án đã có chỗ đứng, bất kể nhịp phát hành của nó ra sao. Tóm tắt trung thực là RSI-Jev là một trong những nỗ lực nghiên cứu dễ hiểu hơn ở góc này của lĩnh vực — một chuỗi các bản phát hành có ghi ngày tháng, được đo lường, đôi khi thua lỗ, với phần tìm kiếm được công bố song song với các điểm số — và là một trong những nỗ lực ít được kiểm chứng độc lập nhất, vì gần như mọi con số trên trang này đều là của chính nó và chưa có bên ngoài nào chạy benchmark nó so với mô hình thương mại mà nó tương thích.

Điều đáng để theo dõi không phải là bản phát hành tiếp theo, vì với nhịp độ này sẽ có một bản trong vài ngày tới; mà là liệu có thứ gì đó bên ngoài dự án bắt đầu đo lường hay không. Hai điều có thể thay đổi cục diện là một đợt đánh giá độc lập chạy trên các checkpoint đã công bố, và một so sánh mô hình ra quyết định đưa cả mô hình 4B mở lẫn mô hình được host của TypeSafe qua cùng một harness. Cả hai hiện nay đều chưa tồn tại. Cho đến khi có một trong hai, cách hữu ích để đọc một điểm số như 46.24 là coi nó như một tuyên bố được ghi chép đầy đủ từ một dự án đăng ký trước các dự đoán của mình và công bố cả những nhánh đã thất bại — đó là một dấu vết bằng chứng mạnh hơn hầu hết, và vẫn không phải là kết quả từ bên thứ ba.