一張為 Laya 對 von 比較生成的標題卡,帶有本文自身的副標題,以及一行頁尾文字,標明哪一方的數字為供應商自行提報,哪一方為第三方。
Engineering & Research

Laya 對 von:當供應商基準無法移轉時

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

一個具有六種可能標籤的提交類型分類任務,隨機亂猜可得到 8.3%,而 von 得分 26.7%。一個檔案路由任務,同一模型得分 8.8%,僅略高於隨機猜測。一個 AUC 為 0.513 的二元變更廣度任務,這等同於擲硬幣。這些數字來自第三方對 von 的評估——wfzyx 的開源 System One 模型,一個在 2026 年 9 月 18 日以 Apache 2.0 授權發布的 395M ModernBERT-Large 編碼器,與 Convai Innovations 的 Laya 同日發布。在 von 自家的 jabr v2 基準測試中,情況恰恰相反:橫跨 49 項任務與 869 個案例的 71.5% 巨觀準確率、選擇路由為 83.4%,以及在低於 18 毫秒下平均 9.38 次擊殺的 ViZDoom 結果,相較之下,TypeSafe AI 的 Jev 為 5.62 次擊殺與約 115 毫秒。這兩組數字都是真的。兩者之間的差距,是任何人針對這個模型類別所發表過最有用的資訊,而這也同樣適用於 Laya。

兩個模型,兩個主幹,一個共通的失效模式

von 與 Laya 在架構上非常相近,這正是為何遷移問題是比較兩者的合適切入角度。兩者都是以 ModernBERT 為基礎的非自迴歸編碼器:von 有 395M 個參數,Laya 的英文檢查點則有 421M 個。兩者都提供相同的三種基本操作——choice:從提供的清單中選擇,score:依有序評分規準評分,noul:作為經校準的「是」機率——而且兩者都實作 /v1/systemone 連線格式,讓為 TypeSafe 的 Jev 撰寫的客戶端可以改指向本機伺服器。兩者都是 Apache 2.0。兩者回傳的是機率而非文字,而且都沒有可用來產生幻覺的解碼迴圈。

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

差異在於訓練歷程。von 先以 2 兆個 token 的一般網頁文字、技術文獻與程式碼進行預訓練,接著在約 290,000 個範例的平衡多領域語料庫上微調,涵蓋營運與企業工作流程、安全性與 DevOps、安全與政策審核、語言學、分流,以及對抗式推理。後訓練使用帶校準分佈的強化學習,最小化交叉熵與 Brier 分數的複合目標,其中 lambda 為 0.5,而溫度縮放收斂於 T=1.1692。Laya 的英文檢查點是針對具型別決策形態微調的 ModernBERT-large,具備 512 個 token 的視窗;另外還有一個 322M 的 mmBERT-base 多語言檢查點,位於路由器之後、涵蓋 100 多種語言,以及在 Tesla T4 上每項決策已公布的 32.8 毫秒 p50。

共同的失效模式在於,兩者都是被訓練來產生讀出結果的編碼器,而非推理器。von 自己的 README 明確指出,它的目標是延遲敏感的管線,而自迴歸模型會在其中引入 500–2,000 毫秒的延遲與非確定性的結構描述解析錯誤。這樣的定位說明了它的用途:快速、確定性、經過統計校準的分類。它並沒有告訴你它在你的分類任務上會有效,而獨立基準測試就是有人去驗證時所得到的結果。

誠實解讀 von 自己的基準測試

jabr v2 的結果由擁有者自行發布,且未經獨立稽核,而基準測試的組成方式與分數同樣重要。49 項任務與 869 個案例,對決策模型評估而言是合理的廣度,而 71.5% 的巨觀準確率對 395M 編碼器來說是很強的數字。各領域的細分結果才真正提供資訊:症狀分診為 100.0%,居家服務為 95.7%,城市路由為 94.7%,choice routing 整體為 83.4%。這些正是訓練語料所圍繞的任務——README 將微調資料描述為營運與企業工作流程、資訊安全與 DevOps、安全與政策審核、語言學、分診與對抗推理。在症狀分診上獲得高分,代表的是模型學會了分診領域,而不是學會了分類。

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

ViZDoom 的結果是最常被引用的那個,值得仔細閱讀。在「Defend the Center」中平均擊殺 9.38,八個隨機種子,從結構化場景文字零樣本,延遲低於 18 毫秒,對比 Jev 在約 115 毫秒下的 5.62 次擊殺——提升 +66.9%。這是一項驚人的結果,而且它也是一個由結構化文字驅動的遊戲環境,在這種環境中,快速反射式策略正是最合適的形態。該專案對 System One 範式的框架——反射式、平行、確定性、經統計校準——是對該任務所獎勵內容的貼切描述。

然後,第三方評估讓 von 在提交類型分類、檔案路由、特徵偵測與變更廣度評分上接受測試,而它在其中一些項目上輸給了關鍵字與正規表達式基準。二元任務上 0.513 的 AUC 是最鮮明的數字:無異於擲硬幣,而這來自一個其校準被調整為 T=1.1692、且其 README 宣稱期望校準誤差接近理想的模型。這兩件事可以同時成立。一個模型可以在它受訓時所處的分佈上校準良好,卻在從未見過的分佈上毫無用處——而且事實上,在錯誤分佈上良好的校準,比明顯糟糕的校準更糟,因為那些信心數值看起來值得信賴。

相同的測試應用於 Laya

Laya 也經歷過某種版本的這類處理,結果與 von 的一致。在 TypeSafe 的 typed-decisions 基準測試中,Laya 的零樣本得分為 0.362,隨機為 0.318,多數類基線為 0.461——更接近隨機猜測,而非那個理所當然的答案。它自家的模型卡便寫明了結論:「Laya 是易於特化的快速基礎模型,不是零樣本決策引擎。」一旦選項超過大約二十個,它的表現便急遽下滑,在 Banking77 上得分 0.425,而 Jev 為 0.870。在一項第三方測試的 100 則 Mars-base 緊急訊息中,Jev 得分 100/100,Laya 為 53/100。在一項瀏覽器代理基準測試中,它完成了 50 項任務中的 0 項,並在 33 次嘗試中過早宣告完成,其中 17 次甚至還沒採取任何行動——不過基準測試作者指出,它是為了支援工單、發票這類判斷型工作而訓練,並非為了瀏覽導航,這屬於範圍的陳述,而非評判。

Laya 與 von 的不同之處,在於它為自己宣稱了什麼。Convai 在模型卡上公布了不怎麼好看的零樣本數字,以及 0.466 的期望校準誤差,就緊鄰著逐題型溫度重擬合所產生的 0.081。von 的 README 則公布了討喜的 jabr v2 數字和 ViZDoom 勝績。兩個專案都對自己做了什麼保持誠實;但只有其中一個會以模型表現糟糕的基準測試作為開頭。這是一項對來源的觀察,不是指控——但如果你要根據已公布的證據在兩者之間做選擇,請注意,你是在拿一個向你展示自身弱點數字的專案,和另一個其弱點數字你得去別處才找得到的專案相比。

規格對比,逐個維度

• 骨幹 — Laya:ModernBERT-large 421M 英文、mmBERT-base 322M 多語言。von: ModernBERT-Large 395M。

• 語言 — Laya:透過多語言檢查點與路由器支援 100 多種語言。von:英文,且未發布多語言檢查點。

• 上下文視窗 — Laya:英文 512 個詞元,多語言 1,024 個詞元。von:未以相同條件公布;jabr v2 案例是簡短且結構化的決策。

• 延遲 — Laya:在 T4 上 p50 為 32.8ms,批次 10 時每題 7.2ms。von:聲稱 15ms 以下至 25ms 以下,ViZDoom 執行中為 18ms 以下。

• 報告準確率 — Laya:零樣本 0.362、在該基準測試自身的資料切分上微調後 0.766、在 Banking77 上 0.425。von:在 jabr v2 的 49 項任務中巨集平均為 71.5%,選擇路由為 83.4%,以及在獨立測試中的提交類型為 26.7%。

• 校準 — Laya:出貨時 ECE 為 0.466,依題型分別重新擬合溫度後降至 0.081。von:在 RLCD 後訓練期間將溫度縮放至 T=1.1692,聲稱在自身分布上達到近乎理想的 ECE。

• 推論服務 — Laya:pip install laya,以及 ONNX、Go 與 Apple MLX 的社群移植版本。von:Python 與 TypeScript SDK、可透過 von serve 啟動的 HTTP 伺服器,還有針對工單分類、電子郵件安全、內容審核與安全事件分類的預先打包預設集。

• 硬體 — Laya:CPU、CUDA 與 Apple MPS。來自:NVIDIA CUDA、AMD ROCm、Apple Silicon MPS 與多執行緒 CPU。

• 授權條款 — 兩者皆採用 Apache 2.0。

von 真正獨特的部分

von 的可組合模式是其儲存庫中最未被充分討論的事物。置信度閘控、路由分派、複合評分與兩階段路由,都作為具名模式與預設集一同提供——票證分流、電子郵件安全、內容審核、安全事件分流——而它們編碼了決策模型在生產環境中實際所需的架構。單一的選擇呼叫很少是整個系統;有用的形態是一個低成本的第一階段路由器,分派到專門化的第二階段,並帶有一個置信度閘門,可將不確定的案例升級。von 將其作為有文件記載的模式提供,而不是留給你自己處理。

這正好對應到 OrcaRouter 在生成端所做的事,而這點值得直說,因為這個模式的兩半通常是由不同團隊打造的。von 和 Laya 都不是託管在 OrcaRouter 上——兩者都是你自己下載並執行的權重——本文的任何內容都不應被解讀為我們有提供它們的服務。我們清單上的是另一半:200 多個生成式模型,透過單一組 OpenAI 相容金鑰存取,以供應商定價表價格原價透傳,零加成,因此供應商降價當天就會反映到你的帳單,而不是等到續約時。如果 von 的信心閘門判定有 4% 的請求需要前沿模型,路由 DSL 就是把這項決策組合進單一呼叫的機制,而不必簽兩份合約、用兩套 SDK;自動容錯移轉則能避免那條昂貴的分支成為單點故障。

該如何處理兩個在訓練分布之外都失效的模型

從 von 評估得出的實際結論並不是 von 是個不好的模型。而是:一個決策模型所公布的準確率,是關於其訓練分布的一項宣稱,而要知道你的問題是否落在該分布內,唯一的方法就是實際測試它。von 自己的 README 基準測試表,在規模、準確率、延遲與託管方面,將自身與 GLiNER2、一個微調過的 Qwen3.5 4B、Laya,以及 TypeSafe 的 Jev 相比——這是一張有用的表,同時也是一張除了其中一項以外,每一項準確率數據都來自作者自家測試框架的表。

在兩者之間做選擇:如果你想要更廣泛的已發布領域、稍小的資源佔用、針對分流與審核的預建服務模式,以及 ViZDoom 的證據顯示它能妥善處理快速的結構化文字決策,那就選 von。如果你需要多語言輸入——von 沒有多語言檢查點,而 Laya 的 322M mmBERT 變體涵蓋 100 多種語言——或者 32.8ms 的 T4 數據與 512 個 token 的英文視窗符合你的工作負載,那就選 Laya。若沒有先花一個下午從你自己的流量中標註數百個範例,並讓兩者都對這些範例跑過一遍,兩者都不要選。兩個專案自己的文件都指向那個實驗,而 von 的第三方結果,正是沒有人實際跑那個實驗時會得到的東西。

唯一能改變這項比較的,是在相同輸入上進行配對評估,並為每個模型提供可靠度圖。這種東西並不存在。在它出現之前,誠實的排名應依據證據品質,而不是分數:Laya 公布了它最差的數字,von 公布了它最好的數字,而 von 的獨立測試是兩者之中最接近外部檢核的東西。

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."