
Intern-Decision-2B vs Qwen 3.8:同一個骨幹,兩種截然不同的任務
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 584 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
打開設定:internlm/Intern-Decision-2B,以及設定:Qwen/Qwen3.5-2B,將兩者並排比較,幾乎沒什麼不同。相同 24 層,相同 2,048 隱藏維度,相同 8 個查詢頭對上 2 個鍵值頭,相同 256 的頭維度,相同 262,144 位置嵌入上限,相同 248,320 個詞元的詞彙量,相同三個線性注意力層對一個全注意力層的重複模式。Intern-Decision-2B 不是新架構。它是那個主幹,移除了生成文字的能力並校準了其置信度——而正是這一項減法,使得與 Qwen3.8-Max 的比較,也就是整個「Qwen 3.8」系列名稱在最頂端所指的 2.4 兆參數旗艦,比參數倒數更有價值。
這兩者並非競爭對手,這場對決也不是一場較量。Intern-Decision-2B 是 Qwen3.5-2B 的 2,213,241,664 參數微調版本,於 2026 年 9 月 26 日 05:36 UTC 上傳至 Hugging Face,同時還有三個未公開的姊妹模型,而它不產生任何 token:它接收一個狀態與帶型別的提問,執行一次因果前向傳遞,在固定的佔位符位置讀取 logits,並針對每個欄位回傳一組經過校準的分布。Qwen3.8-Max 是阿里巴巴的託管旗艦模型,一個稀疏混合專家模型,每個 token 約有 950 億個活躍參數,具備 100 萬 token 的多模態上下文視窗,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元。一個是元件,另一個是服務。真正有用的問題是:在一個你已經在付費的管線中,兩者之間的接縫該落在哪裡。
減法,精確地
決策調校改變了什麼,這點本身就說明了一切,因為它釐清了基礎模型原本已承載的內容。
此任務在儲存庫中名為自迴歸遮罩語言建模。助理輸入包含完整的 JSON 骨架,每個欄位有一個 <decision> 詞元;真實答案符號只會出現在標籤中,絕不會出現在輸入中。訓練採用一般的因果式下一詞元對齊,其中緊接在標記之前的 logit 會預測該欄位的答案,且所有欄位共用一次前向傳遞。在推論時,logits 會被限制在合法的單一詞元答案符號——A–Z、a–z、0–9,這正是 62 個選項上限的由來——接著經過 softmax 並映射回你的標籤。
基礎模型的下一個符記機制完好無損且未經修改。被訓練進去的是:偏好佔據少數幾個答案位置之一,而不是延續句子;外加一個檢查點專屬的溫度值 2.100509348278,該值是以負對數概似在 1,728 個指定校準案例上擬合,並有 1,693 個案例保留未用。這份模型卡明確表示生成已被排除:API「執行結構化候選評分。它不會呼叫 generate() 或取樣自由格式文字。」
該儲存庫也記錄了微調並未觸及的部分:它「微調 Qwen3.5 的語言主幹,同時凍結視覺塔與投影器」。2B 上那個 612,517,440 位元組的視覺分片,與 4B 決策檢查點上的位元組數相同,這符合元件是繼承而來、而非訓練而成的情況。影像路徑運作正常;只是它並不是決策階段花費預算的對象。

22 億參數做不到的事,以及 2.4 兆參數取而代之能做到的事
一切的分野都取決於同一個軸線:你的答案是否已經以清單的形式存在。
Intern-Decision-2B 回答一個封閉集合。一到十六個問題,每個問題最多 62 個選項,最多八張圖片,全部都在 8,192-token 的預算內,引擎會拒絕而非截斷。以機率形式回傳。在單一 RTX 4090 上,每次請求平均 33.28 ms,P95 為 33.55 ms,且每次呼叫都不計費,因為沒有輸出可供計費。
Qwen3.8-Max 能寫作。100 萬 token 的上下文,文字、圖像與影片輸入,具備思考模式的推理能力,原生工具呼叫,結構化輸出,在日期標記為 0902 的版本上輸出 token 最多可達 131,000。它也能做出與 Intern-Dec-2B 相同的路由決策——你可以提示它從選項中選擇並回傳 JSON。當你這麼做時,會有三件事出錯。你要為它用來決定的 token 付費。你會得到一個字串,解析可能成功,也可能失敗。而那個字串裡的數字,是取樣器產出的值,不是你能以 0.8 為閾值並據以行動的 softmax。
兩種說法都為真,且彼此並不互相抵消。2.4 兆參數的旗艦模型之所以存在,是因為大多數問題並非封閉集合。22 億參數的評分器之所以存在,是因為其中確實屬於封閉集合的那個子集,值得使用更便宜的工具。
計分板

• 參數 — Intern-Decision-2B 為 2,213,241,664(BF16),加上視覺塔與投影器,磁碟上約 4.46 GB;Qwen3.8-Max 總量約 2.4 兆,每個 token 約 950 億活躍,以服務方式提供而非下載。
• 上下文 — 8,192 個 token,超過即被拒絕;在 0902 版本上為 1,000,000 個 token,最大輸出 131,000。
• 輸出 — 經校準的機率與一個 argmax,不產生生成文字;生成文字則包含推理軌跡。
• 輸入模態 — 文字加上最多八張圖片;文字、圖片與影片。
• 成本 — 不按次收費,而且你擁有 GPU;每百萬個輸入詞元 $2.00,每百萬個輸出詞元 $6.00,快取讀取為 $0.25,快取寫入為 $2.50。
• 已發表的證據 — 一份涵蓋七個套件的廠商表格,平均為 84.68、Brier 0.437 與 ECE 0.100,橫跨 10,751 列測試資料,未經 InternLM 以外任何人重現,且該檢查點只有 1 個讚與 0 次下載;Artificial Analysis Intelligence Index 為 45.4,在 145 中排名第 15,而 AA Coding index 為 76.2,在 138 中排名第 9,兩者皆為獨立測量。
• 延遲 — 在單張 RTX 4090 上,每個請求平均為 33.28 ms,並隨著加入批次處理而下降;如型錄所述,首個 token 的 P50 為 2.655 秒,且會隨負載上升。
這些證據列並不等價,不該被當成同等的來並列印出。阿里巴巴的旗艦模型背後有獨立的指數評分撐著。InternLM 的檢查點則只有一份由它自家作者製作的表格,尤其是那個校準數值,在遇上別人的資料之前,應被讀成一份記錄詳盡的意圖——在這裡更是如此,因為這個特定規模的模型,在 InternLM 所發布的三個模型中錄得最差的期望校準誤差,0.100,對比其一半大小的模型的 0.066,以及幾乎兩倍大小的那個的 0.065。
接縫,以及如何執行它
合理的管線不是在兩者之間做選擇,而是一種拆分:評分器處理可列舉的決策,前沿模型則處理所有答案不是清單的事項。一個支援服務分流若要把案件分派到六個團隊之一,並以三級量表評定急迫程度,不需要 950 億個活躍參數;它需要的是一個機率與一個閾值。而最終會替客戶寫出回覆的升級路徑則需要。
這種分工在營運上也有具體形式。Intern-Decision-2B 並不在 OrcaRouter 上——我們為它設的模型頁面會回傳 404,而且我們到處都找不到任何託管路由——所以它是在你自己的硬體上執行,這意味著它是一個由你操作與監控的元件。Qwen3.8-Max 則是一條路由:一組金鑰就能通行 200 多款模型,供應商的定價清單原價直通、不加任何加成,這意味著旗艦模型一旦出現廠商價格變動,當天就會反映到你的帳單上。把這條管線中託管的那一段放在這單一介面之後,正是讓較便宜那一段維持低廉的關鍵:評分器壓低了呼叫量,而前沿模型只會在真正需要它的情況下才會被觸及。

如果你還在評估哪個評分器該放在那個位置——這個評分器沒有獨立評估,而且它的校準在同家族中是最弱的——自動容錯移轉(跨供應商)是在一條後面已有可用替代方案支撐的路徑上試用它的方式,而不是直接取代那個替代方案。
誠實的裁決
如果你的問題是針對一組你可以列舉的答案做出決策,而且狀態能放進八千個 token 之內,Intern-Decision-2B 會在三十三毫秒內完成,每次呼叫零成本;無論你租用多少參數,都沒有任何前沿模型能在那個軸線上勝過它。在你依賴它回報的信心之前,先把你自己的校準套用到它身上。
如果你的問題是其他任何類型——推理、長上下文、工具使用、影片、百萬符元文件,或單純是尚未寫出的答案——Qwen3.8-Max 不只是更好。它是兩者中唯一真能完成這項工作的。
假如你至今還無法斷定自己手上的究竟是這兩者中的哪一種,那麼答案很可能是:你兩者都有,而且就在同一條管線裡——而這正是那些參數量一直默默在告訴你的架構。
