為 RSI-Jev 對 Laya 生成的標題卡,寫著「兩個開放決策模型。相反的押注。」,左側卡片標示為「RSI-Jev v6.1-VL」,帶有腦齒輪圖示與文字行「4.69B 參數,零樣本」,右側卡片標示為「Laya」,帶有羽毛圖示與文字行「421M 參數,微調它」,兩張卡片之間有一條細的垂直分隔線,以及圖說「兩者皆為 Apache-2.0。兩者都沒有為你託管。」OrcaRouter 標誌合成於右下角。
Guides & Insights

RSI-Jev vs Laya:兩種開放決策模型,截然不同的押注

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.

第一個賭注是關於規模。Laya 的英文檢查點是 ModernBERT-large,有 4.21 億個參數、512 個 token 的上下文;它的多語言檢查點是 mmBERT-base,有 3.22 億個參數、1,024 個 token 的視窗,在編碼器設為寬模式時可達 8,192。RSI-Jev v6.1-VL 跑的是完整的 Qwen3.5-4B-Base 塔——46.9 億個參數,其中 35.7 億在 32 個解碼器層中,外加一個視覺塔和三個決策頭,分別位於第 16、20 和 32 層。Laya 是一種你可以在幾 GB 內預載三個的模型;RSI-Jev 則是 9.7 GB 的 bf16 檢查點。第二個賭注源自第一個:Laya 每次呼叫幾乎不耗費成本,並期望你教它你的領域;而 RSI-Jev 則耗費四十五億個參數,試圖在完全沒有訓練的情況下回答你的問題。

每個實際上是用來做什麼的

Laya 自己的模型卡中有一句話,比任何評論者都更能為這個比較定調:「Laya 是一個能快速特化的基礎模型,而非零樣本決策引擎。」在型別化決策基準上——涵蓋四種工作流程的 2,000 項決策——基礎英文檢查點得分為 0.362,而隨機猜測為 0.318,總是選擇多數類別則為 0.461。在同一批決策上,Convai 在該基準自身訓練集劃分上微調的檢查點得分為 0.766,突破了 0.735 的教師一致性上限。這個差距就是產品本身:Laya 是一個 421M 的編碼器,讓你針對狹窄的分類體系進行微調;而 Convai 提供一個 Kaggle notebook,能在兩張免費 T4 上跑完整個流程——建立資料集、訓練、擬合校準溫度、評估。

RSI-Jev 則是另一個取捨。其 v6.1-VL 版本在自家公開的 Decision Index 0.3 上得分 50.98,這是一次以預設組態執行 140,178 次請求的結果;在該專案日期為 2026-10-06 的排行榜上,與榜上最佳的 4B 模型並列,並在 113 個模型中總排名第 27。其十五項基準測試套件為 0.793,留出集為 0.729。這些都是零樣本數據——不過該專案也謹慎指出,十五項基準中有十項以某種形式貢獻了訓練資料,因此「零樣本」適用於該版本的搜尋,而非頁面上的每一個數字。這些數字真正帶來的,是一個能回答關於你從未展示給它的文件之問題、且不需要先跑訓練的模型。

• 規模 — Laya 421M 英語 / 322M 多語言,對比 RSI-Jev 4.69B,運行整個 Qwen3.5-4B-Base 塔。

• 零樣本準確率—— Laya 在 typed-decisions 上為 0.362,低於 0.461 的多數基準;而 RSI-Jev 在其自家的 Decision Index 0.3 上為 50.98,與該處最佳的 4B 項目並列。

• 微調準確度 — Laya 0.766,其檢查點是在基準自身分割上訓練的,相較之下 RSI-Jev 的數字屬於發布層級,而非各領域。

• 語言 — Laya 在 51 種語言中有 45 種可用;隨機伺服器端路由相較於 RSI-Jev 以英文為中心的文字高出三倍以上。

• 模態 — 僅限 Laya 文字,對比 RSI-Jev 文字加上每次請求最多四張圖片。

• 上下文 — Laya 英文為 512 個 token,多語言為 1,024 個,長文件最高可達 8,192 個;RSI-Jev 則為 32,768 個 token,超出時會拒絕處理而非截斷。

• 延遲 — Laya 在 T4 上 p50 為 32.8 毫秒,批次十時每題 7.2 毫秒,相較之下 RSI-Jev 為 22.5 毫秒(在強度 低 時),而在 H200 上全深度時約為 40 毫秒。

選項數量斷崖是最顯著的差異

兩個模型都在請求時定義答案空間,因此新的結構定義不需要重新訓練——這是整個系列共有的結構性優勢。但它們分配答案空間的方式不同,而這個差異正好顯現在企業路由最常遇到的任務上。Laya 會在每個選項各自的遮罩 token 上評分,而這些選項共用固定的 head 預算:英文檢查點為 192 個 token,多語言版本則為 256 個。在 Banking77 上,共 77 種意圖,換算下來每個標籤大約只剩三到四個 token,準確率因此掉到 0.425。Convai 自家的說明文件記錄了這道斷崖,並提出解法——把 head_max_len 提高到 512,並將上下文提高到 1,024 以上,讓每個標籤都有足夠空間;或是把龐大的選項集拆成由粗到細的兩步驟選擇。

RSI-Jev 的服務路徑每個問題最多可容納 5,120 個選項。這並非與 Laya 的 0.425 進行同基準的比較——兩者是在不同的測試框架上測得,而選項上限是一項配置限制,不是分數。它要說明的是:當你的分類體系有一百個項目時,哪一個模型不會崩潰。如果你的選擇題是「帳務/技術/業務/其他」,兩者都可行。如果它們是一百多個意圖標籤,那麼這兩者中有一個需要調校後才能使用,另一個則不需要。

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

延遲、語言問題,以及圖像

Laya 的延遲宣稱是它最響亮的說法,而且確有其事:在 Tesla T4 上,單一問題的 p50 為 32.8 毫秒,一批十個為 72.3 毫秒,五十個為 337 毫秒——在一張普通的 GPU 上每秒可處理 103 到 332 個問題。RSI-Jev 自己在 H200 上測得的數字,22.5 毫秒是在低投入程度下,26.8 毫秒是在中等投入程度下,預設為 39.9 毫秒,完整深度為 40.4 毫秒。這些屬於同一數量級,而且兩者都是本機前向傳遞,而非網路呼叫,這才是把託管端點排除在外後真正重要的比較。注意兩者如何運用時間:RSI-Jev 可以刻意停在第 16 層,以換取那 22.5 毫秒,並在問題困難時跑完所有 32 層;Laya 則沒有這種調節鈕——它總是跑完其整個(小型)編碼器。

語言方面的情況則恰恰相反,對任何非英語使用者而言都是決定性的。Laya 搭載了一個路由器,能在遠低於一毫秒內偵測書寫系統,並派送至多語言檢查點;其公布的表格顯示,51 種語言中有 45 種可在高於隨機三倍以上的水準使用,而單靠英語檢查點則只有 23 種。其模型卡也誠實說明這為何重要:英語檢查點在非拉丁書寫系統上會崩潰——高棉語在 0.952 的信心水準下準確率為 0.000——因此信心閘控無法挽救錯誤的路由。RSI-Jev 沒有這類語言方面的設計;它是一個以英語為中心的文字模型,只是恰好能讀取圖像。

圖像則是相反的一面。RSI-Jev 每次請求可接收一到四張,並以 base64 資料 URL 的形式傳入,且在本次發行中於其留出的圖像集上獲得 0.834 分;Laya 已發布的檢查點是文字分類器,而雖然 Hub 上有像 laya-vision 這樣的社群移植版,它們並不是原廠產品。如果你的決策是關於一張照片、一張圖表或一張螢幕截圖,那是其中一個模型的欄位,而不是另一個的。

兩者都尚未與對方進行基準測試。

這是逐項規格比較悄悄掩蓋的部分:這兩個模型之間並沒有正面對決。真正存在的是它們各自與同一個閉源模型——TypeSafe 的 Jev 1.13——之間的正面對決,而兩者無法被並列在一起。

Convai 發表了一個:在 typed-decisions 上,Jev 1.13.0 為 0.727,對上 Laya 路由後的 0.766;在 Banking77 上,Jev 為 0.870,對上 Laya 的 0.425;在校準上,Jev 為 0.246,對上 Laya 溫度修正後的 0.081。Convai 在同一張表中標明自身的限制——Jev 的數字是第三方發佈的,他們從未有 API 存取權可加以測量,而且樣本數與提示詞各不相同。RSI-Jev 的比較對象是 Decision Index,那是 RSI-Jev 自家的公開排行榜,且完全沒有 Jev 條目。因此,唯一同時觸及這兩個模型的外部數字,來自販售這些模型的各方所打造的評測框架,而對上述任何單一數字,合理的解讀都是「這是製造者在其自身任務上測到的結果」。

這兩個專案都做得好、且罕見的一點,是會公開自身的弱點。RSI-Jev 點名其視覺發布版本背後的五個非商業影像來源,並直言以這些來源訓練出的權重是否會承繼那些條款,仍未定案;它回報最新版本中的校準退步,並稱其預設退出閾值未經確認。Laya 則記錄了其基礎檢查點低於多數基線,其序數分數問題是其最弱的基礎元件,且其 noul 可能跟隨自身的選項標籤,而非狀態,且其回應欄位中有一個不帶任何可用訊號。這種誠實是從這兩個專案中最值得承繼的一件事:在你以它們進行自動化之前,先檢查你自己已標註案例上的信心值。

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

他們複製的合約實際上在哪裡

這兩個模型之所以存在,是因為有一套線路格式值得被複製。TypeSafe 的 Jev 定義了請求的形狀——state、questions、三個具型別的原始元素——以及回應的形狀,而 Laya 與 RSI-Jev 都實作了它,好讓既有的用戶端只要更改基礎 URL 就能運作。那個參考模型,typesafe/jev-1.13,是三者當中我們所提供的那一個:它收錄在我們目錄中專用的 systemone 端點上,以 POST 送往 /v1/systemone,非串流,對上 65,536 個 token 的上下文,每百萬輸入 token 收費 $0.042,輸出則計費為零。Laya 和 RSI-Jev 都不在我們的目錄中——兩者都是可下載的,而這正是它們存在的意義所在。

那件事的實務版本比比較本身更重要。決策層幾乎不會獨自存在於一個技術堆疊中;它們會緊鄰著負責撰寫回覆、摘要或程式碼的生成式模型。讓參考契約與 200 多個其他模型共用同一把金鑰,並以供應商牌價原樣傳遞、0% 加成,意味著供應商費率變動當天就會反映到你身上,而自動容錯移轉則意味著在你釐清那個便宜的決策半邊是否夠好時,這對組合中的生成半邊不會是單一故障點。如果你決定採用自架的 421M 編碼器或 4.69B 檢查點,你仍會希望它所遵循的契約能從同一個地方觸及;而如果你寧願兩者都不執行,它們兩者所複製的那個模型只差一個請求之遙。

哪一個要下載

如果你有標註資料、變動不大的分類體系,以及並非僅限英語的語言組合,就選擇 Laya。它小到可以同時運行多個,快到可以放在每個請求前面,而且從一開始就是為了微調而設計——微調後 0.766 分對上零樣本 0.362 分,就是全部的論據。為訓練執行、標註,以及逐問題類型的溫度重新擬合編列預算,這會把其校準誤差從 0.466 降到 0.081;並將選項集保持在約二十個標籤以下,否則在你信任大規模分類之前,先提高 head 預算。

如果你希望決策無需任何訓練就能先運作,如果你的問題有時與圖像有關,如果你的選項集很大,或者如果你想以延遲換取每次請求的深度,就選擇 RSI-Jev v6.1-VL。預期要執行的是 9.7 GB 的檢查點,而不是 400M 的檢查點;預期這是一個在十三天內發布了八個版本的專案,而且可能在你評估這個版本時又發布另一個版本;並且預期你得自行檢查它的校準——這個版本自己的模型卡就說它變差了,而不是變好。

無論你選哪一個,同樣的兩件事都成立。這兩個模型都不生成文字,因此兩者都不會因為輸出格式錯誤的欄位而失敗;兩者都回傳機率,而機率正是必須依每次部署各自驗證、而不能直接從規格卡上照抄的部分。而且兩者都把決策層這個有意思的問題,從「誰的 API」轉移到「誰的權重」——這是更值得問的問題,而這一對模型給出的答案也大不相同。

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL vs Laya - the scoreboard', six rows across both columns: size, '4.69B parameters' against '421M English / 322M multilingual'; zero-shot, '50.98 Decision Index' against '0.362 typed-decisions'; fine-tuned, 'Not per-domain' against '0.766 on its own split'; languages, 'English-centric' against '45 of 51 usable'; modality, 'Text + up to 4 images' against 'Text only'; and latency, '~23-40 ms on an H200' against '32.8 ms p50 on a T4'. A footer reads 'Both vendor-reported; neither has been benchmarked against the other.'