
Intern-Decision-2B 對決 Laya:22 億個參數對上 4.21 億,兩者都拒絕寫出答案
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 584 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
internlm/Intern-Decision-2B與convaiinnovations/laya是小型決策模型利基中最相似的兩個模型,而這項比較最有用的事實是,它們是以相反路徑達到這個定位。InternLM 的 2,213,241,664 參數檢查點會在佔位符前的固定位置讀取 logit,且從不呼叫 generate()。Convai 的 4.21 億參數檢查點則將具型別的問題饋入 ModernBERT-large 主幹之上的決策頭,並在單次前向傳遞中回傳校準後的機率。兩者都不寫出任何 token,兩者都承諾提供機率,兩者的輸入上限都在八千個 token 左右,而較小者規模只有對方的五分之一,人氣卻大約高出一千倍。區隔兩者的與其說是能力,不如說是包裝,而包裝落差決定了大多數讀者的選購。
Intern-Decision-2B 於 2026 年 9 月 26 日 05:36 UTC 出現在 Hugging Face 上,是 InternLM 在四十秒內上傳的三種尺寸當中的中間款,完全沒有發布公告,並以 Apache-2.0 授權從 Qwen/Qwen3.5-2B 微調而來。Laya 則於 2026 年 9 月 18 日首次推送,此後已累積 3,700 多個讚、一個 pip 套件、一個相容於 Jev 的 HTTP 伺服器、ONNX 與 LangChain 整合,以及一本微調 notebook。成熟度的對比正是這篇文章的重點。
它們共有的前提,以及彼此不同的機制
兩張卡片都主張,如果你的問題是在已知答案中做選擇,生成散文就是錯誤的操作。Laya 的說法是「它從不生成文字,因此沒有東西要解析,也沒有東西會產生幻覺。」Intern-Decision-2B 的說法則是,其 API「執行結構化候選評分。它不會呼叫 generate() 或取樣自由形式的文字。」
機制正是它們分歧之處。
Laya 是一個分類器。一個 ModernBERT-large 編碼器(395M,雙向,完整微調)饋入一個從零開始訓練的決策頭——兩層 transformer 層、一個選項標記評分器,以及一個行動/升級頭——總計 421M。選項共用固定的 token 預算(head_max_len,英文檢查點為 192 個 token,多語言為 256 個),而路由器會在該次傳遞前半毫秒內偵測書寫系統與語言。
Intern-Decision-2B 是一個下一符元模型,被禁止成為生成器。它會將每個問題的選項對應到單一符元符號 A–Z、a–z、0–9;渲染出完整的助理 JSON 骨架,每個欄位都有一個 <decision> 佔位符;執行一次因果前向傳遞;讀取每個佔位符緊接在前位置的 logits;對該欄位的合法符號進行 softmax;並套用擬合溫度 2.100509348278。底層是標準的 Qwen3_5ForConditionalGeneration——24 層、每三個線性注意力層搭配一個全注意力層、一個保留的多符元預測層、262,144 位置的嵌入上限——外加一座視覺塔與投影器。
這項差異的實際後果是選項容量。Laya 為每個選項配置的固定預算,在寬廣的標籤空間上會崩潰;它自家的模型卡記載了一個 77 個標籤的問題得分為 0.425,而 TypeSafe Jev 在同一任務上得分為 0.870,因為 77 個選項各自只分到約三或四個 token。Intern-Decision-2B 每個問題最多接受 62 個選項,最多十六個問題,而 62 並非偏好設定,而是其契約所能處理的單一 token 符號的確切數量。兩者一旦超過數十個選項都不從容;只是失敗的樣態不同。

計分板

• 參數 — Intern-Decision-2B 為 BF16 格式的 2,213,241,664 個參數,外加視覺塔與投影器,磁碟上約 4.46 GB;Laya 421M,單一 842 MB 的 safetensors 檔案,另有獨立的 644 MB 多語言檢查點。
• 輸入上限 — 兩者皆為 8,192 個 token,且兩者都會拒絕而非截斷;請注意,Laya 的 8,192 適用於 laya-multilingual,並需要 max_len=8192,因為出廠預設值為 1,024。
• 圖像 — Intern-Decision-2B 最多八張,計入相同的 token 預算;Laya 沒有多模態路徑。
• 速度 — 在單張 RTX 4090 上,Intern-Decision-2B 每筆請求平均 33.28 毫秒、P50 為 33.15 毫秒、P95 為 33.55 毫秒;Laya 回報每筆請求約 33 毫秒,且在單張 T4 上批次處理時每秒可處理 103–332 個問題。
• 語言 — Intern-Decision-2B 完全未宣稱支援多語言;Laya 則在 100 多種語言之間進行路由,回報 51 種受測語言中有 45 種可用、表現達隨機水準的三倍以上,並在十三種非英語語言的 MASSIVE 意圖任務上達到 0.451,相較之下,其僅英語檢查點為 0.306。
• 零樣本準確率 — Intern-Decision-2B 在七個廠商套件上平均得到 84.68,Brier 為 0.437、ECE 為 0,全部未經重現;Laya 的基礎英文檢查點在 2,000 項決策的 typed-decisions 基準上得分 0.362,而其自家模型卡標示此分數低於 0.461 的多數類別基準線。
• 打包 —— 一個檢查點、一個 inference.py,以及一個新公開的 GitHub 儲存庫(內含訓練與評估程式碼),對比 pip install laya、一個 Jev 相容的 HTTP 伺服器、ONNX Runtime 與 TileLang 快速路徑、MCP 與 LangChain 整合,還有一份能在免費層級 GPU 上執行的微調筆記本。
最公平的比較,並不是規格表所設定的那種。
把84.68與0.362並列,幾乎可說是不誠實的;值得說明原因,而不是任憑這些數字就這樣擺著。
Laya 的 0.362 是基礎檢查點在一個它並非為其調校的基準測試上以零樣本方式測得的結果。它自己的模型卡明確得出結論:「Laya 是一個能快速特化的基礎模型,而不是零樣本決策引擎。」在該基準測試自己的訓練分割上微調後,它達到 0.766,突破 0.735 的教師上限,並在相同決策上擊敗 TypeSafe Jev 已發表的 0.727。另一方面,Intern-Decision-2B 的 84.68 是七套件的廠商平均值,其測試集並非 Laya 引用的那些,且由打造該模型的實驗室產出,沒有任何第三方跑過——該檢查點顯示一個讚和零次下載。拿微調結果與零樣本結果相比,或拿廠商平均值與獨立評測榜相比,都不是比較。那只是共用同一種字型的兩種不同量測。
真正可比的是什麼:兩者都很小,兩者執行成本都低,而且兩者都無法微調進你的領域。InternLM 今早發布的儲存庫讓最後這一點比昨天實質上容易得多,因為它隨附了訓練啟動器、masked-next-token 目標、一份經雜湊驗證且內含橫跨七個套件的 10,751 列測試資料的組合包,以及溫度擬合與重播腳本。一個隨附確定性校準產生器,並斷言重播不會改變任何決策的實驗室,正是在引來 Laya 的卡片所建議的那種調適。
你實際上會如何稱呼其中任一個
這兩個模型都不在 OrcaRouter 上。OrcaRouter 上 Intern-Decision-2B 的模型頁面會回傳 404,也沒有 Laya 的路由;這裡沒有任何內容是在宣稱可用性。Intern-Decision-2B 指的是下載檢查點,並在你自己的 GPU 上執行其隨附的引擎。Laya 指的是 pip install laya,而如果你想要 Jev 相容的介面,則是在 POST /v1/systemone 上使用 laya-serve。
底下那個 Orchestrator 形態的問題是:你是否想為評分器再開一個營運介面。Laya 的設計就是要被嵌入——請求和回應結構與 TypeSafe Jev 完全相同,所以既有的用戶端只要改一個 base URL,其他什麼都不用動。Intern-Decision-2B 的設計則是要能被複製重現,而現今大約得先花上一整天的環境設定工作,才會拿到第一個決策結果。如果你正在做的封閉集決策在形態上接近這兩者之一,那麼這兩張卡都以之為基準的託管替代方案,就是TypeSafe Jev 1.13,它確實有路徑可用:每百萬輸入 token 收費 0.042 美元、65K 上下文,以及 178 毫秒的 P50 首次 token 時間,可透過與其他 200 多個模型相同的金鑰存取,供應商定價以 0% 加價原樣轉嫁。

各自勝出之處
Laya 在所有營運層面都勝出。一個 pip 套件對上一個檢查點下載。一個橫跨一百多種語言的路由器,對上毫無多語言相關宣稱。批次吞吐量以每秒數百個問題計,對上一個每次請求的數字,且完全沒有批次處理的著墨。兩年累積的生態系實力——ONNX、TileLang、LangChain、MCP——對上一個才公開兩小時的儲存庫。
Intern-Decision-2B 在三件狹義的事情上勝出。它能處理圖像,Laya 不行。它不背負微調債:它的 84.68 是零樣本的廠商宣稱,而 Laya 掛在頭條的 0.766 則屬於在該基準自身訓練切分上微調過的檢查點。而且它附有可重現套件作為文件——一份可驗證的評估套件與公開的訓練堆疊——對任何必須向他人說明這款模型正當性的人而言,這比排行榜上的一行更有價值。
平手是前提。兩者都拒絕生成,都提供你可以設定閾值的機率,而且兩者的輸入長度都低於大多數真實文件所處的長度。如果你的狀態是一張工單、一封電子郵件或一份表單,兩者都行,而 Laya 會讓你更快達成。如果你的狀態附有螢幕截圖,或你的組織需要重現過程可供稽核,那麼 InternLM 的中間檢查點正是能回應這項特定質疑的選擇——而且根據 InternLM 自己的數字,它是三個同系列模型中校準最差的,ECE 為 0.100,相較於 0.066 和 0.065,所以在信任它回報的信心之前,先擬合你自己的溫度參數。
