一張生成的標題卡寫著「Intern-Decision-4B vs Laya」,副標題為「兩個不需生成 token 就能回答的模型」,並有三個標籤寫著「4.54B vs 421M」、「兩者皆只需一次前向傳遞」以及「兩者皆為 Apache-2.0」。OrcaRouter 的標誌合成於右下角。
Engineering & Research

Intern-Decision-4B 對上 Laya:兩個拒絕寫出答案的模型,規模相差十倍

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Intern-Decision-4B 模型卡中有一行寫著「Laya — 57.77」。任何讀過 Laya 自家文件的人都能認出這個數字的含義:convaiinnovations/laya 是一個擁有 4.21 億參數的非自迴歸決策模型,而 57.77 是它在別人的基準測試上以零樣本方式使用時所獲得的平均分數。它自己的模型卡更直白地說了同一件事——基礎檢查點在 typed-decisions 基準測試上低於多數類別基線,為 0.362 對 0.461。與此同時,internlm/Intern-Decision-4B 是一個 45.4 億參數的模型,專為完全相同的工作而打造:接收一個狀態和一組具型別的問題,執行一次前向傳遞,回傳經校準的機率,絕不生成任何詞元。相同的架構押注、相同的輸出形狀、相同的 Apache-2.0 授權條款,參數量卻是十倍——而且其中一個是可供微調的基礎模型,另一個則宣稱自己是完成品級的零樣本引擎。

他們對前提達成共識,而這正是罕見之處

兩張卡片論證的是同一件事,而這值得說清楚,因為業界大多數人主張的正好相反。如果你的問題是在一組已知的答案中做選擇,那麼生成散文就是錯誤的操作:你得為被你丟棄的詞元付費、你需要一個解析器,而且你得到的是一個你沒要求的解釋,而不是一個你能設定閾值的機率。Laya 的卡片如此表述:「它從不生成文字,所以沒有東西需要解析,也沒有東西會產生幻覺。」Intern-Decision-4B 的卡片則說,它的 API「執行結構化的候選項評分。它不會呼叫 generate() 或取樣自由形式的文字。」

這些機制之間的差異頗具啟發性。Laya 將型別化的問題餵給分類頭,並在單次前向傳遞中回傳附有校準機率的型別化答案;還有一個路由層,會在該次傳遞前以不到半毫秒的時間偵測書寫系統與語言。Intern-Decision-4B 將每個問題的選項對應到單一詞元符號,渲染出一個助理 JSON 骨架,每個欄位各有一個佔位符,讀取每個佔位符緊接之前的 logits,並且只對該欄位允許的符號進行 softmax。Laya 的是分類問題;InternLM 的則是下一個詞元問題,而它拒絕讓這個問題變成生成問題。

A screenshot of the convaiinnovations/laya model card on Hugging Face, showing the title 'Laya', the description of it as a multilingual non-autoregressive System 1 decision model returning typed answers with calibrated probabilities in a single forward pass across 100+ languages, the pip install laya line, and the long-documents note about laya-multilingual reading up to 8,192 tokens with max_len=8192.

尺寸差距,以及它換來什麼

讓兩個參數規模分別為 421M 和 4.54B 的模型執行同一項任務,得出的結果如你所料,接著卻出現意想不到的發展。

預測的部分是應對難題的能力。Intern-Decision-4B 在七個評估集上平均為 90.02,在 InternLM 自家量測中 Brier 分數為 0.347、期望校準誤差為 0.065,並且在單張 RTX 4090 上每次查詢平均執行時間為 44.16 毫秒。Laya 的基礎英文檢查點在 2,000 項決策的 typed-decisions 基準上準確率為 0.362,其自家模型卡標示這低於 0.461 的多數類別基準線,且僅略高於 0.318 的隨機基線。當同一個檢查點在該基準自身的訓練切分上進行微調後,數字躍升至 0.766。Laya 的模型卡自身得出結論:「Laya 是適合特化的快速基礎,而非零樣本決策引擎。」

令人意外的是,較小的模型在兩個維度上直接勝出。速度:在單張 T4 上進行批次處理時,Laya 每秒可回答 103 到 332 個問題,而其模型卡聲稱,根據它引用的獨立測量 236–276 毫秒 p50 數值,它比 TypeSafe Jev 快約六到八倍。參數多十倍,並不能在另一個方向上換來十倍的吞吐量——Intern-Decision-4B 的 44.16 毫秒是在 4090 上每筆查詢的表現,且未公布任何批次處理的說明。語言方面:Laya 回報 51 個受測語言中有 45 個可用,且表現超過隨機基準三倍以上;在十三種非英語語言上,其在 MASSIVE 意圖任務上經路由後達到 0.451,而其僅英語檢查點為 0.306。Intern-Decision-4B 則完全沒有提出多語言方面的宣稱。

計分板

• 參數 — Intern-Decision-4B 為 4.54B BF16,包含文字塔、視覺塔與投影器;Laya 則為 421M,單一緊湊的編碼器級堆疊。

• 輸入上限 — 兩者皆為 8,192 個 token,且兩者都會直接拒絕而非截斷;請注意,Laya 的 8,192 適用於多語言檢查點,而其出廠預設值為 1,024。

• 多重性 — Intern-Decision-4B 可接受 1 至 16 個問題,每個問題最多 62 個選項,而 62 並非隨意選定的數字:它正好是其推理合約所能定址的單一詞元符號數量。Laya 同樣接受多個具類型的問題,但其模型卡記載,在超過約 50 個選項後會出現急劇崩塌,此時一個 77 個標籤的問題每個標籤僅獲得三或四個詞元的預算,準確率降至 0.425。

• 影像 — Intern-Decision-4B 最多八張,計入 8,192 個詞元的預算;Laya 則沒有多模態路徑。

• 校準 — Intern-Decision-4B 隨附一個經擬合的溫度 1.99241824,該值是在 1,728 個案例上透過 NLL 最小化所選出,並在其自家測試套件上回報 ECE 0.065;Laya 出廠時過度自信,而其模型卡指出,針對每種題型與選項數量重新擬合單一溫度,可將平均 ECE 從 0.466 降至 0.081。

• 零樣本宣稱 — 一個已完成的檢查點聲稱平均達 90.02,對照的卻是一份有紀錄、得分低於多數類別基準線的基準。

• 延遲 — 在一張 RTX 4090 上,平均值為 44.16 ms、中位數為 44.03 ms,相較於在一張 T4 上批次處理的每秒 103 到 332 個問題。

• 語言 — 對於 51 種語言中有 45 種在路由時可使用,並無已發表的主張反對。

• 授權條款 — Apache-2.0,保留上游 Qwen 授權,並明確標示 Apache-2.0 可供商業使用。

A two-column comparison scoreboard titled 'Intern-Decision-4B vs Laya'. The left column reads: Parameters: 4.54B BF16; Output: probabilities, no text; Options per question: up to 62; Latency: 44.16 ms mean on one RTX 4090; Zero-shot: 90.02 average reported; Images: up to eight; License: Apache-2.0. The right column reads: Parameters: 421M; Output: typed answers, no text; Options per question: degrades past ~50; Latency: 103-332 q/s batched on one T4; Zero-shot: below majority class, 0.362; Images: none; License: Apache-2.0, commercial use tagged. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.

兩張卡,兩種截然不同的揭露理念

這裡正是比較不再只是規格表、而變成主觀判斷的地方,因為這兩家供應商以截然相反的風格來記載他們的機型。

Laya 的模型卡詳細公開自身的失敗。它回報英文檢查點在高棉語上以 0.952 的信心度得到 0.000 的準確率——自信卻錯誤,這使得信心閘控在該處毫無用處。它回報action.act_probability 不帶有可用訊號,在 396 個已標記決策上 AUROC 為 0.30,幾乎每個輸入都讀到 1.0,並建議你改以信心作為閘控依據,它在相同項目上達到 0.77。它將序數評分問題列為「最弱的基礎元件」,並引用 SST-5 上的 0.372 為證。一張會告訴你應該忽略自身哪些輸出的模型卡,正在做大多數供應商不做的事。

Intern-Decision-4B 的卡片發布了一張乾淨的表格,且沒有失敗案例。它的注意事項是真實且關鍵的——校準部分異常明確地指出,其試點中的「before」欄並非任何使用者會看到的內容,且測試套件的標籤並未被用來選擇溫度——但評估部分卻是七勝,且沒有任何承認失敗。它還包含了五個競爭系統的列,這些系統是 InternLM 在 InternLM 的測試框架上運行的,包括本文開頭的 Laya 列。那些不是那些專案自己的數字,將它們解讀為如此會是個錯誤。

所以,這場對戰組合的來源依據並不對稱,而且其方式有利於較小的模型:Laya 的證據包含它自己記錄下來的缺陷,而 Intern-Decision-4B 的證據從未遇過不是由它的作者挑選的測試集。

每一個分別適合哪一種問題形態

在英文短結構化狀態、封閉答案集,且需要可信機率的情況下,Intern-Decision-4B 在紙面上是能力更強的物件,實務上卻也更昂貴——四個 safetensors 分片、Python 3.12 下的 PyTorch 2.9.1 與 Transformers 5.14.1、常駐引擎,以及若你想要 HTTP 端點就得自行撰寫的包裝器。在數十種語言中進行高流量路由或護欄決策,且吞吐量是主要限制時,Laya 是更好的形態:pip install laya、一個 421M 模型,以及一張已經告訴你在信任機率之前要先微調的模型卡。

兩份模型卡唯一有共識的一點是:不先用自己的資料檢查校準,就不該零樣本信任任何一個模型——Laya 是因為其基礎檢查點在不熟悉的決策類型上接近隨機水準,Intern-Decision-4B 則是因為其 0.065 的 ECE 來自自家作者彙整的測試套件。

路由器在此會改變與不會改變的事

這兩個模型都不在 OrcaRouter 的目錄中,而且這件事值得直說,而不是暗示並非如此:我們的模型頁面對 Intern-Decision-4B 與 Laya 都回傳 404,而且兩者都不是你今天能呼叫的路由。這對這兩個專案所代表的意義並不相同。Laya 的 Apache-2.0 授權帶有商業使用標籤,意味著障礙純粹在於封裝——它是一個佔用空間很小的本地 Python 套件,這種東西是有可能提供服務的。Intern-Decision-4B 的障礙同樣在於封裝,但其 4.54B 的 BF16 權重與 8,192 個 token 的拒答上限,使它成為一個元件,而不是一項服務。

OrcaRouter 真正幫得上忙的地方,在於決策的另一端。如果你的結構化決策問題到頭來終究還是需要一個推理步驟,有能力做到的通用模型就在一把金鑰即可取用 200 多個模型,供應商定價以 0% 加成原價透傳,並具備供應商之間的自動容錯移轉——所以,你要與評分器搭配的模型只差一個端點,而不是另一份合約。

簡短版本

這兩個專案對決策該如何做出得出了相同結論,但在幾乎其他所有事情上都不一樣。Laya 押注 421M 參數、嚴密的語言路由,以及對自身缺陷毫不諱言的坦誠,能構成一個供你特化的快速基礎。Intern-Decision-4B 則押注十倍參數,加上精心設計的單一 token 評分契約,能構成一個完成的零樣本引擎。決定性實驗是兩者都未公開做過的:拿一組有可計算答案的決策,兩者都跑,並檢查那些機率是否有任何意義。Laya 已半公開那個實驗,並向你展示它在哪裡失敗。Intern-Decision-4B 則完全沒有發表。

A generated comparison card titled 'Same bet, ten times the parameters'. The left side, 'Intern-Decision-4B', lists: 4.54B BF16; a finished zero-shot checkpoint claiming a 90.02 average across seven sets; fitted temperature 1.99241824; 44.16 ms mean per query on one RTX 4090; Apache-2.0 with the upstream Qwen license preserved. The right side, 'Laya', lists: 421M; a documented base below the majority-class line at 0.362, rising to 0.766 once fine-tuned on the benchmark's own training split; refitting one temperature per question type moves mean ECE from 0.466 to 0.081; 103 to 332 questions per second batched on one T4; Apache-2.0 tagged for commercial use. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.