一張為 Laya 與 Decider 比較所生成的標題卡,帶有本文自身的副標題,以及一行頁尾文字,標明哪一方的數據是由供應商提供,哪一方是第三方。
Engineering & Research

Laya 對決 Decider:421M 編碼器對上 35B 混合模型

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Laya 與 Decider 都是開放權重的非自迴歸式決策模型,能在單次前向傳遞中回答具型別的問題——從提供的清單中做出選擇、依有序評分規準給出分數、給出是/否機率——而兩者分別位居規模光譜的兩端。Convai Innovations 於 2026 年 9 月 18 日以 Apache 2.0 釋出 Laya:一款 421M 的 ModernBERT-large 英文編碼器,視窗為 512 個 token;一款 322M 的 mmBERT-base 多語言檢查點,視窗為 1,024 個 token,涵蓋 100 多種語言;以及一個能偵測書寫系統並分派至正確模型的路由器。Mapika 的 Decider 系列,從建構於小型生成式基礎模型上的 decider-0.8b 與 decider-2b,一路延伸到 decider-35b-a3b——一個擁有約 3B 活躍參數的 35B 混合專家模型。兩者皆可免費下載,且回傳的都是機率而非文字。它們之所以不能互換,原因並不在於大多數報導開頭所強調的那個準確率數字。

兩個家族,一個架構上的賭注

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

共同的賭注是:做決策並不需要解碼迴圈。當生成式模型被問到「這張工單是不是退款請求?」時,它必須逐個輸出詞元,而一旦它開始輸出詞元,你就得自行處理解析、結構描述驗證,以及那兩百次裡會出現一次、它忘了某個大括號時的重試路徑。Laya 和 Decider 都跳過了這一步,改為直接從單一次前向傳遞中讀出答案——Laya 取自雙向編碼器,Decider 則取自提示中專用答案位置上帶字母選項詞元的 logits。

相似之處到此為止。Laya 是語言路由器後方的兩個小型編碼器,這讓它在 421M 與 322M 的參數量下,換得一個 512-token 英文視窗和一個 1,024-token 多語言視窗。Decider 保留生成式主幹,並在其上加上一個讀出層:decider-2b 是對 Qwen3.5-2B-Base 進行監督式微調,接著在即時瀏覽器任務與精確遊戲上進行校準感知的強化學習階段;而 decider-35b-a3b 則凍結路由專家,並使用 Muon 訓練區塊矩陣。實際後果是,Decider 繼承了語言模型的世界知識,而 Laya 沒有。另一個後果是,Decider 也繼承了語言模型的資源足跡。

A screenshot of the decider-2b model card on Hugging Face, showing the Qwen3.5-2B base, the text-classification pipeline tag, the English-language tag, and the decision-model and calibrated tags for the Mapika Decider family.

Mapika 自家文件指出,decider-2b 在 B300 上以 bf16、批次大小為一、未使用 CUDA graphs 或編譯的情況下,每次決策的中位數為 18 毫秒;而 decider-35b-a3b 在相同設定下為 41 毫秒。在 GH200 上,支援工單情境約為 230 個 token,且包含三到五個輸入問題時,同一專案回報:eager 模式為 49 毫秒,使用 CUDA graphs 與 torch.compile 時為 4.0 毫秒,批次 32 時每秒約 1,370 次決策。這些是廠商公布的數字,出自該專案自己的說明文件,並非獨立測量。Laya 的主要數字同樣是廠商公布:在 Tesla T4 上,每次決策的 p50 為 32.8 毫秒,批次大小為 10 時,每個問題為 7.2 毫秒。

校準問題,兩個專案以不同的尺度回答。

校準是決策模型最重要的數字,因為回傳機率的整體意義就在於,下游會有人對它設定閾值。這也正是直接比較 Laya 與 Decider 會誤導你的地方。

Laya 在其自家的模型卡上列出期望校準誤差為 0.466,而卡片也直白指出,針對每種題型重新擬合一個溫度參數,可將其降到 0.081。那是罕見誠實的揭露,也意味著隨附的檢查點並不是那個已校準的成品。你開箱即用得到的數字就是 0.466。

Decider 回報的完全是另一套衡量工具。Decision Index——一個公開排行榜,在 132,422 筆請求上跑過 Jev 的每一次公開重現——將 decider-35b-a3b 排在總體第四,分數為 54.3,落後 Jev 的 59.5,並回報它是 32 個項目中校準最佳的,校準誤差為 3.1 分,且在聲明信心達 95%+ 時有 0.4% 的錯誤答案。decider-2b 回報 8.8 分與 0.9%。那些是排行榜公布的數字,而 Index 的十個分箱 ECE 上的 3.1 分,與 Laya 在自己評測上的 0.466 並不是同一種量測。將它們並列在同一張表中,會是披著嚴謹外衣的錯誤,本質上是拿蘋果比橘子。你能說的是,Decider 的作者選擇在第三方排行榜上受測,而 Laya 的作者選擇自行公布它最弱的校準數字;兩者都沒有被對方的測試框架稽核過。

各自的優勢所在,逐一維度

• 骨幹 — Laya:ModernBERT-large 421M 編碼器,雙向。決策器:Qwen3.5 生成式基礎模型,0.8B 至 35B-A3B。

• 語言 — Laya:透過置於路由器後方的 322M 多語言檢查點,支援 100 多種語言。Decider:僅支援英文,並明確標示為一項限制。

• 上下文視窗 — Laya:英文 512 tokens,多語言 1,024。Decider:可接受最高 32k 的輸入,在 v6 世代訓練至 16k,並探測至 30k。

• 選項集上限——Laya:超過約 20 個選項後急劇劣化,在 Banking77 上為 0.425,相較於 Jev 的 0.870。Decider:Choice 涵蓋 2 到 255 個具名選項,Score 涵蓋 2 到 10 個具描述層級。

• 零樣本準確率 — Laya:在 typed-decisions 基準測試上為 0.362,低於 0.461 的多數類別基線。Decider:未以零樣本數值發表;該專案改為報告特定任務的結果。

• 校準 — Laya:出廠時 ECE 為 0.466,依題型分別重新擬合溫度後降至 0.081。Decider:35B 在決策指數上獲得 3.1 分,為 32 個項目中最佳。

• 推理 — Laya:無,依設計即如此。Decider:無,已明確說明——它是模式比對的讀出結果,不是推理器。

• 授權條款 — 兩者皆採用 Apache 2.0。

在選用 Decider 之前,還有一個值得了解的細節:這個專案提醒,從冗長的 JSON 陣列中依位置挑出單一記錄是薄弱的做法,並建議以鍵來定位記錄。這種限制,只有實際跑過才會知道。

執行其中任何一個對你來說要付出多少成本

Laya 的成本特性是一項微調專案。這個模型小到可以在筆電 CPU 上執行低吞吐量的工作,但隨附的英文檢查點其零樣本分數低於平凡基準,這意味著採用 Laya 就等於接下建立標註資料集、微調,以及針對每種題型重新擬合溫度的工作。回報是,一旦你完成了,成品就是 4.21 億個參數,並且在 T4 上能在數十毫秒內給出答案。Convai 自家微調的laya-typed-decisions檢查點在該基準的訓練分割上達到 0.766——這個數字更能說明微調的影響,而非基礎模型本身,而模型卡也這麼說。

Decider 的成本概況是一項服務決策。你正在選擇要租用多少 GPU,而這個系列給你一個真正的調節旋鈕:在 2B 上為 18ms,對比在 35B-A3B 上為 41ms,較大的模型能在 GPQA、GSM8K、CRUXEval 和 MMLU 上換取小型模型所沒有的知識與推理餘裕。如果你的任務狹窄且標籤固定,decider-2b 是較便宜的機器。如果你的任務需要模型知道事情,你就要為混合模型付費。

OrcaRouter 適合的地方——以及不適合的地方

Laya 與 Decider 都不是 OrcaRouter 上的託管模型。權重由你自己下載、自行執行,這一點不會因為這裡的任何東西而改變。會改變的是這個模式的另一半。一個具型別的決策模型幾乎從來不是整個應用程式:總得有什麼去讀取工單、摘要討論串,或草擬由決策把關的那封回覆。那一半是生成式呼叫,而這正是 OrcaRouter 所為而生的那一半——超過 200 個模型,全都藏在一把 OpenAI 相容的金鑰之後,以供應商標價原樣轉嫁、0% 加成,因此供應商降價當天就會反映在你的帳單上,而不是等到下一次合約續約。如果你正用前沿模型的輸出微調 Laya 檢查點,或在負責分流的 decider-2b 與處理困難 4% 的大型模型之間做路由,把生成端留在同一個端點上,就意味著決策端與生成端不需要兩份合約和兩套 SDK。自動容錯移轉則涵蓋了出問題的正是大型模型那一部分的情況。

該選哪一個

如果你的輸入是多語、標籤很少、在一般硬體上你的延遲預算只有數十毫秒,而且你準備好要微調——因為你勢必得這麼做——就選 Laya。如果你的輸入是英文、你需要模型把一些世界知識帶進決策,而且你寧願挑選模型大小,也不願跑訓練流程,就選 Decider。如果你的選項集超過二十個標籤,在投入之前先讀一下 Laya 的 Banking77 數據;如果你的輸入是你按位置定位的長 JSON 文件,在投入之前先讀一下 Decider 明述的限制。

真正能解決這個問題的比較——兩個模型在逐位元組完全相同的輸入上、相同的提示、相同的選項排序、相同的閾值掃描——目前還不存在。在它出現之前,誠實的立場是:Laya 有更好的成本曲線,而 Decider 有更好的校準證據;而且兩者都還處於早期階段,因此你自己資料上建立的評估,會比這兩個專案各自公布的數字更有價值。

A generated two-column scoreboard comparing Laya and Decider across backbone, languages, context, zero-shot accuracy, calibration and serving, with a footer reading "Laya figures per its own model card; Decider per Mapika and the Decision Index."