
Laya 對 von:當供應商基準無法移轉時
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
一個具有六種可能標籤的提交類型分類任務,隨機亂猜可得到 8.3%,而 von 得分 26.7%。一個檔案路由任務,同一模型得分 8.8%,僅略高於隨機猜測。一個 AUC 為 0.513 的二元變更廣度任務,這等同於擲硬幣。這些數字來自第三方對 von 的評估——wfzyx 的開源 System One 模型,一個在 2026 年 9 月 18 日以 Apache 2.0 授權發布的 395M ModernBERT-Large 編碼器,與 Convai Innovations 的 Laya 同日發布。在 von 自家的 jabr v2 基準測試中,情況恰恰相反:橫跨 49 項任務與 869 個案例的 71.5% 巨觀準確率、選擇路由為 83.4%,以及在低於 18 毫秒下平均 9.38 次擊殺的 ViZDoom 結果,相較之下,TypeSafe AI 的 Jev 為 5.62 次擊殺與約 115 毫秒。這兩組數字都是真的。兩者之間的差距,是任何人針對這個模型類別所發表過最有用的資訊,而這也同樣適用於 Laya。
兩個模型,兩個主幹,一個共通的失效模式
von 與 Laya 在架構上非常相近,這正是為何遷移問題是比較兩者的合適切入角度。兩者都是以 ModernBERT 為基礎的非自迴歸編碼器:von 有 395M 個參數,Laya 的英文檢查點則有 421M 個。兩者都提供相同的三種基本操作——choice:從提供的清單中選擇,score:依有序評分規準評分,noul:作為經校準的「是」機率——而且兩者都實作 /v1/systemone 連線格式,讓為 TypeSafe 的 Jev 撰寫的客戶端可以改指向本機伺服器。兩者都是 Apache 2.0。兩者回傳的是機率而非文字,而且都沒有可用來產生幻覺的解碼迴圈。

差異在於訓練歷程。von 先以 2 兆個 token 的一般網頁文字、技術文獻與程式碼進行預訓練,接著在約 290,000 個範例的平衡多領域語料庫上微調,涵蓋營運與企業工作流程、安全性與 DevOps、安全與政策審核、語言學、分流,以及對抗式推理。後訓練使用帶校準分佈的強化學習,最小化交叉熵與 Brier 分數的複合目標,其中 lambda 為 0.5,而溫度縮放收斂於 T=1.1692。Laya 的英文檢查點是針對具型別決策形態微調的 ModernBERT-large,具備 512 個 token 的視窗;另外還有一個 322M 的 mmBERT-base 多語言檢查點,位於路由器之後、涵蓋 100 多種語言,以及在 Tesla T4 上每項決策已公布的 32.8 毫秒 p50。
共同的失效模式在於,兩者都是被訓練來產生讀出結果的編碼器,而非推理器。von 自己的 README 明確指出,它的目標是延遲敏感的管線,而自迴歸模型會在其中引入 500–2,000 毫秒的延遲與非確定性的結構描述解析錯誤。這樣的定位說明了它的用途:快速、確定性、經過統計校準的分類。它並沒有告訴你它在你的分類任務上會有效,而獨立基準測試就是有人去驗證時所得到的結果。
誠實解讀 von 自己的基準測試
jabr v2 的結果由擁有者自行發布,且未經獨立稽核,而基準測試的組成方式與分數同樣重要。49 項任務與 869 個案例,對決策模型評估而言是合理的廣度,而 71.5% 的巨觀準確率對 395M 編碼器來說是很強的數字。各領域的細分結果才真正提供資訊:症狀分診為 100.0%,居家服務為 95.7%,城市路由為 94.7%,choice routing 整體為 83.4%。這些正是訓練語料所圍繞的任務——README 將微調資料描述為營運與企業工作流程、資訊安全與 DevOps、安全與政策審核、語言學、分診與對抗推理。在症狀分診上獲得高分,代表的是模型學會了分診領域,而不是學會了分類。

ViZDoom 的結果是最常被引用的那個,值得仔細閱讀。在「Defend the Center」中平均擊殺 9.38,八個隨機種子,從結構化場景文字零樣本,延遲低於 18 毫秒,對比 Jev 在約 115 毫秒下的 5.62 次擊殺——提升 +66.9%。這是一項驚人的結果,而且它也是一個由結構化文字驅動的遊戲環境,在這種環境中,快速反射式策略正是最合適的形態。該專案對 System One 範式的框架——反射式、平行、確定性、經統計校準——是對該任務所獎勵內容的貼切描述。
然後,第三方評估讓 von 在提交類型分類、檔案路由、特徵偵測與變更廣度評分上接受測試,而它在其中一些項目上輸給了關鍵字與正規表達式基準。二元任務上 0.513 的 AUC 是最鮮明的數字:無異於擲硬幣,而這來自一個其校準被調整為 T=1.1692、且其 README 宣稱期望校準誤差接近理想的模型。這兩件事可以同時成立。一個模型可以在它受訓時所處的分佈上校準良好,卻在從未見過的分佈上毫無用處——而且事實上,在錯誤分佈上良好的校準,比明顯糟糕的校準更糟,因為那些信心數值看起來值得信賴。
相同的測試應用於 Laya
Laya 也經歷過某種版本的這類處理,結果與 von 的一致。在 TypeSafe 的 typed-decisions 基準測試中,Laya 的零樣本得分為 0.362,隨機為 0.318,多數類基線為 0.461——更接近隨機猜測,而非那個理所當然的答案。它自家的模型卡便寫明了結論:「Laya 是易於特化的快速基礎模型,不是零樣本決策引擎。」一旦選項超過大約二十個,它的表現便急遽下滑,在 Banking77 上得分 0.425,而 Jev 為 0.870。在一項第三方測試的 100 則 Mars-base 緊急訊息中,Jev 得分 100/100,Laya 為 53/100。在一項瀏覽器代理基準測試中,它完成了 50 項任務中的 0 項,並在 33 次嘗試中過早宣告完成,其中 17 次甚至還沒採取任何行動——不過基準測試作者指出,它是為了支援工單、發票這類判斷型工作而訓練,並非為了瀏覽導航,這屬於範圍的陳述,而非評判。
Laya 與 von 的不同之處,在於它為自己宣稱了什麼。Convai 在模型卡上公布了不怎麼好看的零樣本數字,以及 0.466 的期望校準誤差,就緊鄰著逐題型溫度重擬合所產生的 0.081。von 的 README 則公布了討喜的 jabr v2 數字和 ViZDoom 勝績。兩個專案都對自己做了什麼保持誠實;但只有其中一個會以模型表現糟糕的基準測試作為開頭。這是一項對來源的觀察,不是指控——但如果你要根據已公布的證據在兩者之間做選擇,請注意,你是在拿一個向你展示自身弱點數字的專案,和另一個其弱點數字你得去別處才找得到的專案相比。
規格對比,逐個維度
• 骨幹 — Laya:ModernBERT-large 421M 英文、mmBERT-base 322M 多語言。von: ModernBERT-Large 395M。
• 語言 — Laya:透過多語言檢查點與路由器支援 100 多種語言。von:英文,且未發布多語言檢查點。
• 上下文視窗 — Laya:英文 512 個詞元,多語言 1,024 個詞元。von:未以相同條件公布;jabr v2 案例是簡短且結構化的決策。
• 延遲 — Laya:在 T4 上 p50 為 32.8ms,批次 10 時每題 7.2ms。von:聲稱 15ms 以下至 25ms 以下,ViZDoom 執行中為 18ms 以下。
• 報告準確率 — Laya:零樣本 0.362、在該基準測試自身的資料切分上微調後 0.766、在 Banking77 上 0.425。von:在 jabr v2 的 49 項任務中巨集平均為 71.5%,選擇路由為 83.4%,以及在獨立測試中的提交類型為 26.7%。
• 校準 — Laya:出貨時 ECE 為 0.466,依題型分別重新擬合溫度後降至 0.081。von:在 RLCD 後訓練期間將溫度縮放至 T=1.1692,聲稱在自身分布上達到近乎理想的 ECE。
• 推論服務 — Laya:pip install laya,以及 ONNX、Go 與 Apple MLX 的社群移植版本。von:Python 與 TypeScript SDK、可透過 von serve 啟動的 HTTP 伺服器,還有針對工單分類、電子郵件安全、內容審核與安全事件分類的預先打包預設集。
• 硬體 — Laya:CPU、CUDA 與 Apple MPS。來自:NVIDIA CUDA、AMD ROCm、Apple Silicon MPS 與多執行緒 CPU。
• 授權條款 — 兩者皆採用 Apache 2.0。
von 真正獨特的部分
von 的可組合模式是其儲存庫中最未被充分討論的事物。置信度閘控、路由分派、複合評分與兩階段路由,都作為具名模式與預設集一同提供——票證分流、電子郵件安全、內容審核、安全事件分流——而它們編碼了決策模型在生產環境中實際所需的架構。單一的選擇呼叫很少是整個系統;有用的形態是一個低成本的第一階段路由器,分派到專門化的第二階段,並帶有一個置信度閘門,可將不確定的案例升級。von 將其作為有文件記載的模式提供,而不是留給你自己處理。
這正好對應到 OrcaRouter 在生成端所做的事,而這點值得直說,因為這個模式的兩半通常是由不同團隊打造的。von 和 Laya 都不是託管在 OrcaRouter 上——兩者都是你自己下載並執行的權重——本文的任何內容都不應被解讀為我們有提供它們的服務。我們清單上的是另一半:200 多個生成式模型,透過單一組 OpenAI 相容金鑰存取,以供應商定價表價格原價透傳,零加成,因此供應商降價當天就會反映到你的帳單,而不是等到續約時。如果 von 的信心閘門判定有 4% 的請求需要前沿模型,路由 DSL 就是把這項決策組合進單一呼叫的機制,而不必簽兩份合約、用兩套 SDK;自動容錯移轉則能避免那條昂貴的分支成為單點故障。
該如何處理兩個在訓練分布之外都失效的模型
從 von 評估得出的實際結論並不是 von 是個不好的模型。而是:一個決策模型所公布的準確率,是關於其訓練分布的一項宣稱,而要知道你的問題是否落在該分布內,唯一的方法就是實際測試它。von 自己的 README 基準測試表,在規模、準確率、延遲與託管方面,將自身與 GLiNER2、一個微調過的 Qwen3.5 4B、Laya,以及 TypeSafe 的 Jev 相比——這是一張有用的表,同時也是一張除了其中一項以外,每一項準確率數據都來自作者自家測試框架的表。
在兩者之間做選擇:如果你想要更廣泛的已發布領域、稍小的資源佔用、針對分流與審核的預建服務模式,以及 ViZDoom 的證據顯示它能妥善處理快速的結構化文字決策,那就選 von。如果你需要多語言輸入——von 沒有多語言檢查點,而 Laya 的 322M mmBERT 變體涵蓋 100 多種語言——或者 32.8ms 的 T4 數據與 512 個 token 的英文視窗符合你的工作負載,那就選 Laya。若沒有先花一個下午從你自己的流量中標註數百個範例,並讓兩者都對這些範例跑過一遍,兩者都不要選。兩個專案自己的文件都指向那個實驗,而 von 的第三方結果,正是沒有人實際跑那個實驗時會得到的東西。
唯一能改變這項比較的,是在相同輸入上進行配對評估,並為每個模型提供可靠度圖。這種東西並不存在。在它出現之前,誠實的排名應依據證據品質,而不是分數:Laya 公布了它最差的數字,von 公布了它最好的數字,而 von 的獨立測試是兩者之中最接近外部檢核的東西。

