一張生成的標題卡,寫著「Intern-Decision-2B vs Qwen 3.8」,副標題為「一個主幹,兩種截然不同的任務」,並帶有「2.2B 評分器,33 ms」和「2.4T 旗艦,1M 上下文」徽章,角落合成 OrcaRouter 標誌。
Guides & Insights

Intern-Decision-2B vs Qwen 3.8:同一個骨幹,兩種截然不同的任務

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

打開設定:internlm/Intern-Decision-2B,以及設定:Qwen/Qwen3.5-2B,將兩者並排比較,幾乎沒什麼不同。相同 24 層,相同 2,048 隱藏維度,相同 8 個查詢頭對上 2 個鍵值頭,相同 256 的頭維度,相同 262,144 位置嵌入上限,相同 248,320 個詞元的詞彙量,相同三個線性注意力層對一個全注意力層的重複模式。Intern-Decision-2B 不是新架構。它是那個主幹,移除了生成文字的能力並校準了其置信度——而正是這一項減法,使得與 Qwen3.8-Max 的比較,也就是整個「Qwe​n 3.8」系列名稱在最頂端所指的 2.4 兆參數旗艦,比參數倒數更有價值。

這兩者並非競爭對手,這場對決也不是一場較量。Intern-Decision-2B 是 Qwen3.5-2B 的 2,213,241,664 參數微調版本,於 2026 年 9 月 26 日 05:36 UTC 上傳至 Hugging Face,同時還有三個未公開的姊妹模型,而它不產生任何 token:它接收一個狀態與帶型別的提問,執行一次因果前向傳遞,在固定的佔位符位置讀取 logits,並針對每個欄位回傳一組經過校準的分布。Qwen3.8-Max 是阿里巴巴的託管旗艦模型,一個稀疏混合專家模型,每個 token 約有 950 億個活躍參數,具備 100 萬 token 的多模態上下文視窗,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元。一個是元件,另一個是服務。真正有用的問題是:在一個你已經在付費的管線中,兩者之間的接縫該落在哪裡。

減法,精確地

決策調校改變了什麼,這點本身就說明了一切,因為它釐清了基礎模型原本已承載的內容。

此任務在儲存庫中名為自迴歸遮罩語言建模。助理輸入包含完整的 JSON 骨架,每個欄位有一個 <decision> 詞元;真實答案符號只會出現在標籤中,絕不會出現在輸入中。訓練採用一般的因果式下一詞元對齊,其中緊接在標記之前的 logit 會預測該欄位的答案,且所有欄位共用一次前向傳遞。在推論時,logits 會被限制在合法的單一詞元答案符號——A–Z、a–z、0–9,這正是 62 個選項上限的由來——接著經過 softmax 並映射回你的標籤。

基礎模型的下一個符記機制完好無損且未經修改。被訓練進去的是:偏好佔據少數幾個答案位置之一,而不是延續句子;外加一個檢查點專屬的溫度值 2.100509348278,該值是以負對數概似在 1,728 個指定校準案例上擬合,並有 1,693 個案例保留未用。這份模型卡明確表示生成已被排除:API「執行結構化候選評分。它不會呼叫 generate() 或取樣自由格式文字。」

該儲存庫也記錄了微調並未觸及的部分:它「微調 Qwen3.5 的語言主幹,同時凍結視覺塔與投影器」。2B 上那個 612,517,440 位元組的視覺分片,與 4B 決策檢查點上的位元組數相同,這符合元件是繼承而來、而非訓練而成的情況。影像路徑運作正常;只是它並不是決策階段花費預算的對象。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

22 億參數做不到的事,以及 2.4 兆參數取而代之能做到的事

一切的分野都取決於同一個軸線:你的答案是否已經以清單的形式存在。

Intern-Decision-2B 回答一個封閉集合。一到十六個問題,每個問題最多 62 個選項,最多八張圖片,全部都在 8,192-token 的預算內,引擎會拒絕而非截斷。以機率形式回傳。在單一 RTX 4090 上,每次請求平均 33.28 ms,P95 為 33.55 ms,且每次呼叫都不計費,因為沒有輸出可供計費。

Qwen3.8-Max 能寫作。100 萬 token 的上下文,文字、圖像與影片輸入,具備思考模式的推理能力,原生工具呼叫,結構化輸出,在日期標記為 0902 的版本上輸出 token 最多可達 131,000。它也能做出與 Intern-Dec-2B 相同的路由決策——你可以提示它從選項中選擇並回傳 JSON。當你這麼做時,會有三件事出錯。你要為它用來決定的 token 付費。你會得到一個字串,解析可能成功,也可能失敗。而那個字串裡的數字,是取樣器產出的值,不是你能以 0.8 為閾值並據以行動的 softmax。

兩種說法都為真,且彼此並不互相抵消。2.4 兆參數的旗艦模型之所以存在,是因為大多數問題並非封閉集合。22 億參數的評分器之所以存在,是因為其中確實屬於封閉集合的那個子集,值得使用更便宜的工具。

計分板

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• 參數 — Intern-Decision-2B 為 2,213,241,664(BF16),加上視覺塔與投影器,磁碟上約 4.46 GB;Qwen3.8-Max 總量約 2.4 兆,每個 token 約 950 億活躍,以服務方式提供而非下載。

• 上下文 — 8,192 個 token,超過即被拒絕;在 0902 版本上為 1,000,000 個 token,最大輸出 131,000。

• 輸出 — 經校準的機率與一個 argmax,不產生生成文字;生成文字則包含推理軌跡。

• 輸入模態 — 文字加上最多八張圖片;文字、圖片與影片。

• 成本 — 不按次收費,而且你擁有 GPU;每百萬個輸入詞元 $2.00,每百萬個輸出詞元 $6.00,快取讀取為 $0.25,快取寫入為 $2.50。

• 已發表的證據 — 一份涵蓋七個套件的廠商表格,平均為 84.68、Brier 0.437 與 ECE 0.100,橫跨 10,751 列測試資料,未經 InternLM 以外任何人重現,且該檢查點只有 1 個讚與 0 次下載;Artificial Analysis Intelligence Index 為 45.4,在 145 中排名第 15,而 AA Coding index 為 76.2,在 138 中排名第 9,兩者皆為獨立測量。

• 延遲 — 在單張 RTX 4090 上,每個請求平均為 33.28 ms,並隨著加入批次處理而下降;如型錄所述,首個 token 的 P50 為 2.655 秒,且會隨負載上升。

這些證據列並不等價,不該被當成同等的來並列印出。阿里巴巴的旗艦模型背後有獨立的指數評分撐著。InternLM 的檢查點則只有一份由它自家作者製作的表格,尤其是那個校準數值,在遇上別人的資料之前,應被讀成一份記錄詳盡的意圖——在這裡更是如此,因為這個特定規模的模型,在 InternLM 所發布的三個模型中錄得最差的期望校準誤差,0.100,對比其一半大小的模型的 0.066,以及幾乎兩倍大小的那個的 0.065。

接縫,以及如何執行它

合理的管線不是在兩者之間做選擇,而是一種拆分:評分器處理可列舉的決策,前沿模型則處理所有答案不是清單的事項。一個支援服務分流若要把案件分派到六個團隊之一,並以三級量表評定急迫程度,不需要 950 億個活躍參數;它需要的是一個機率與一個閾值。而最終會替客戶寫出回覆的升級路徑則需要。

這種分工在營運上也有具體形式。Intern-Decision-2B 並不在 OrcaRouter 上——我們為它設的模型頁面會回傳 404,而且我們到處都找不到任何託管路由——所以它是在你自己的硬體上執行,這意味著它是一個由你操作與監控的元件。Qwen3.8-Max 則是一條路由:一組金鑰就能通行 200 多款模型,供應商的定價清單原價直通、不加任何加成,這意味著旗艦模型一旦出現廠商價格變動,當天就會反映到你的帳單上。把這條管線中託管的那一段放在這單一介面之後,正是讓較便宜那一段維持低廉的關鍵:評分器壓低了呼叫量,而前沿模型只會在真正需要它的情況下才會被觸及。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

如果你還在評估哪個評分器該放在那個位置——這個評分器沒有獨立評估,而且它的校準在同家族中是最弱的——自動容錯移轉(跨供應商)是在一條後面已有可用替代方案支撐的路徑上試用它的方式,而不是直接取代那個替代方案。

誠實的裁決

如果你的問題是針對一組你可以列舉的答案做出決策,而且狀態能放進八千個 token 之內,Intern-Decision-2B 會在三十三毫秒內完成,每次呼叫零成本;無論你租用多少參數,都沒有任何前沿模型能在那個軸線上勝過它。在你依賴它回報的信心之前,先把你自己的校準套用到它身上。

如果你的問題是其他任何類型——推理、長上下文、工具使用、影片、百萬符元文件,或單純是尚未寫出的答案——Qwen3.8-Max 不只是更好。它是兩者中唯一真能完成這項工作的。

假如你至今還無法斷定自己手上的究竟是這兩者中的哪一種,那麼答案很可能是:你兩者都有,而且就在同一條管線裡——而這正是那些參數量一直默默在告訴你的架構。