
Jev 對 Laya:T4 上的 33 毫秒,以及一個隨機基線
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Laya 的模型卡裡有句話決定了這場比較,而這句話是由打造 Laya 的人所寫的。「Laya 是一個能快速特化的基礎,而不是零樣本決策引擎。」Convai Innovations 於 2026 年 9 月 18 日發布 Laya,時間點是 TypeSafe AI 推出 Jev 的三天後;Laya 採用 Apache 2.0 授權,權重發布於 Hugging Face,並提供pip install laya 這個安裝入口。它會以單次前向傳遞回答具型別的問題,不需要逐詞元解碼,而這與 Jev 所做的架構賭注相同。最受矚目的宣稱是:在 Tesla T4 上,每次決策的 p50 延遲為 32.8 毫秒,並被描述為比 Jev 透過其託管 API 所公布的 236–276 毫秒 p50 快約 7.8 倍。這項宣稱是真的,但它同時也在衡量兩件不同的事——本機 GPU 對上網路呼叫——而它底下的準確率概況,才是應該決定你是否下載它的部分。在零樣本設定下,Laya 在 TypeSafe 的 typed-decisions 基準上得分 0.362。隨機猜測得分 0.318。多數類別基線得分 0.461。開箱即用的 Laya,更接近隨機,而不是這個最簡單的基準。
Laya 實際上究竟是什麼

Laya 是以兩個檢查點的形式提供,背後由一個內建路由器將每個輸入分派到正確的那一個。英文檢查點是 ModernBERT-large,具有 4.21 億個參數與 512 個 token 的上下文。多語言變體則是 mmBERT-base,具有 3.22 億個參數,以及涵蓋 100 多種語言的 1,024 個 token 視窗。兩者都是非自迴歸式:單次前向傳遞就會回傳答案,因此沒有解碼迴圈、沒有需要解析的 JSON,也沒有任何空間可以輸出宣告型別以外的文字。最後這項特性正是 Jev 所提供的同一種結構性保證,只是從不同方向達成;對於任何曾為偶爾忘記閉合大括號的模型撰寫重試邏輯的人來說,這確實非常有價值。
Jev 是封閉式的對應產品:TypeSafe AI 首個 System One 模型,於 2026 年 9 月 15 日推出,以託管形式提供並處於早期存取階段,具備三種型別化原語——Choice:從你提供的清單中選擇、Score:依有序評分規準評分,以及 Noul:附有校準機率的是/否主張。所有問題都會對照同一份共享的狀態讀取結果並行評估,輸出免費,因為沒有輸出 token,而輸入為每百萬 token 0.042 美元。其架構、參數數量與訓練算力皆未公開,且 TypeSafe 表示這些細節目前仍保密,之後可能會有論文。
延遲主張,經妥善測量
Laya 在 T4 上的 32.8ms p50 是真實的數字,而且表現優異。與 Jev 的 236–276ms 相比的 7.8 倍比較,是需要謹慎的地方,而 Laya 自家的模型卡對原因異常誠實:Jev 的數字是第三方公佈的數據,Convai 從未自行測量過,而且這項比較是將本地 GPU 前向傳遞,與包含網路來回傳輸與排隊的託管 API 呼叫進行對比。若剔除網路因素,架構上的比較其實是兩個單次傳遞模型之間的對比:一個有 421M 參數,另一個則是 TypeSafe 從未公佈的未公開規模。
還有一個值得知道的批次處理數字:當批次大小為十時,Laya 回報每題 7.2 毫秒。這就是這個產品的形態。Laya 是為了在本機大規模運行而打造,而像 laya-mlx 這類裝置端社群移植版本則將此延伸到 Apple Silicon。關於「比 Jev 快 50 倍」的瘋傳說法,並未獲得該專案自己公布的基準測試支持;誠實的說法是:本機與雲端之間存在巨大落差,其中一部分是架構性的,另一部分則只是你的 GPU 和別人的 API 之間的差異。
準確率數字依序所說明的內容
這裡就是比較不再討喜的轉折點,值得按順序一一鋪陳,因為次序本身就有影響。
• 在 TypeSafe 的 typed-decisions 基準測試上的零樣本 —— Laya 0.362,隨機 0.318,多數類別 0.461,Jev 0.727。Laya 高於隨機水準,但低於平凡基線。
• 在該基準測試本身的訓練分割上進行微調——Laya 0.766 對上 Jev 的 0.727。Laya 勝出,而這場勝利來自一個看過該基準測試訓練資料的檢查點,這使它成為一項關於微調的陳述,而非關於基礎模型的陳述。
• Banking77 意圖分類,其中選項集龐大——Laya 為 0.425,對比 Jev 的 0.870。Laya 在超過約 20 個選項後急遽劣化,而根據文件,Jev 的 Choice 欄位可處理多達 255 個,之後才需要兩階段評分模式。
• 校準 — Laya 的平均預期校準誤差為 0.466,只有在按問題類型進行溫度重新擬合後才改善至 0.081。Jev 使用一種 TypeSafe 稱為 RLCD 的方法進行訓練,即 Reinforcement Learning for Calibrated Decisions,並且每個答案都附帶機率分佈——儘管 TypeSafe 也告訴使用者要在自己的標記資料上驗證閾值,而一項獨立審計發現 Jev 的校準因任務而異,變化很大。
這個模式毫不含糊。Laya 是強大的微調基礎,卻是薄弱的零樣本決策引擎,而且它自己也這麼說。Jev 是強大的零樣本決策引擎,但其校準仍須依每次部署檢查。這些是不同產品,有不同的價格結構,而要在兩者之間選擇,主要取決於你是否有標註資料和訓練迴圈。
成本計算的形態跟 Jev 的不一樣。
Jev 每百萬個輸入 token 收費 $0.042,輸出免費,相當於每十億 $42;而在文件所載約 32,000 個 token 的請求預算下,最大規模的呼叫成本遠低於一美分。Every 的獨立測試在 37 份文件上進行了 777 次判斷,成本約為四分之一美分。
Laya 的每次呼叫成本在邊際上為零,總量上卻不是零,而這個總量並不小。在 T4 上執行一個 4.21 億參數的模型很便宜,但仍然得佔用你一張 GPU;而真正花錢的地方,是讓 Laya 具備競爭力的微調步驟——資料標註、訓練執行、評估框架,以及針對各題型重新擬合溫度參數,讓校準誤差從 0.466 降到 0.081。對於一個永不改變的固定分類體系,那是一筆一次性的成本,只要量夠大就能回本。對於會漂移的分類體系,那便是經常性的成本,而 Jev 的零樣本基線 0.727 就划算得多了。
還有第三項成本很容易被忽略:Laya 的英文檢查點只有 512 個 token 的上下文視窗。那不是一個上下文預算很小的決策模型——而是一個大小只夠容納一個段落的決策模型。Jev 約 32,000 個 token 的請求預算大了六十倍,但即便如此,仍比兩者定價時所對標的生成式模型低了一個數量級。如果你的狀態是一整串支援討論,而不是單一支援訊息,那麼這兩個模型的視窗都不是你該用來最佳化的限制。
部署問題才是真正的差異

Laya 最強而有力的論點並非延遲,而在於 Hugging Face 上的 Apache 2.0 權重意味著決策永遠不會離開你的基礎架構,且端點永遠不會有速率限制。對於根據醫療紀錄、法律文件或客戶帳戶歷史所做的路由決策而言,那並非偏好——而是決定性因素,且任何價格的託管端點都無法在這論點上勝出。TypeSafe 的 Jev 處於早期存取階段且需排隊等候,其自家文件也註明速率限制可能隨時變更,恕不另行通知。
反駁論點在於你放棄了什麼。Jev 未公開的更大架構正在做 Laya 的 4.21 億參數做不到的事:0.727 對上 0.362 的零樣本差距,以及 0.870 對上 0.425 的 Banking77 差距,兩者都是在衡量在你開始訓練之前,模型內部究竟蘊含了多少知識。Laya 的答覆是:那些知識由你自己透過微調來提供,而在一個狹窄的固定領域上,這個答覆確實行得通——0.766 的微調結果就是證明。
決策層在實際技術堆疊中的位置
這兩款模型都不會生成文字,因此兩者都無法構成任何工作流程的全部。兩者共同設計來對應的模式是兩個模型:一個負責發出型別化呼叫的決策層,以及一個負責處理需要散文、程式碼或說明那部分的生成式模型。OrcaRouter 並不提供 Jev 或 Laya——Jev 是 TypeSafe 的搶先體驗端點,Laya 則是你自行執行的權重——但那個模式中的生成式那一半,正是我們所涵蓋的:200+ 款模型透過單一相容於 OpenAI 的金鑰,以供應商定價以 0% 加價直接轉嫁提供,因此供應商調價當天,我們這邊就會同步生效。這套雙模型架構無須再簽第二份供應商合約即可測試,而且有了自動容錯移轉,在你判斷這個便宜的決策層是否已校準到足以據以自動化的期間,生成式路徑也不會成為單一故障點。
裁決
如果你有固定且狹窄的分類體系、有標註範例,而且隱私或延遲要求排除了託管 API,那麼 Laya 是更站得住腳的選擇,微調後的數字也支持這一點。如果你需要這個決策開箱即用、如果你的選項集超過二十個類別,或者狀態長度超過一個段落,Laya 自家的模型卡就告訴你它不是適合那份工作的產品——而當有人拿 7.8 倍延遲這個數字來跟你說嘴時,0.362 的零樣本分數對比 0.461 的多數類別基線,才是你該放在心上的數字。
這兩者的共同點比它們的差異更有用。兩者都能消除源自輸出格式的那一類錯誤,卻對源自判斷的那一類錯誤毫無作為。兩者都會附上機率,而兩者也都沒有已發表的可靠性圖表,讓你不必自行查核就能信任。在以任一方進行自動化之前,先用自己的標註案例測試其校準——延遲早已商品化,而信心值才是必須在每次部署中逐一掙得的部分。

