一篇比較文章的標題卡,寫著 Intern-Decision-0.8B vs Qwen 3.8,副標題為 8.53 億個參數、1.71 GB,以及一組封閉式答案;另有三張扁平單行卡片,分別寫著 主體:Intern-Decision-0.8B 於 2026 年 9 月 26 日推出,沒有任何公告;對手:Qwen 3.8,一個 2.4T 稀疏核心,Qwen3.8-Max 定價為 $2.00 與 $6.00;以及 關鍵發現:2B 的兄弟版本更快且更準確,而僅有資源佔用一項對 0.8B 有利。
Engineering & Research

Intern-Decision-0.8B 對比 Qwen 3.8:8.53 億參數與封閉式答案集

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Intern-Decision-0.8B 是 InternLM 於 2026 年 9 月 26 日上午推上 Hugging Face 的三個決策模型中最小的一個,而且也不是其中最快的。這是首先值得知道的事。根據該實驗室自身的量測,2B 的兄弟模型跑得略微更快——33.28 毫秒對上 33.98 毫秒——並在同一個七項套件平均值上高出六分,因此,通常想找十億參數以下檢查點的理由——原始速度——在這裡並不適用。適用的是規模:852,985,920 個參數、1.71 GB 的 bf16 權重,小到足以永久待在還有其他任務要做的機器的餘裕空間裡。把這點對照 Qwen3.8-Max——該廠商八月發布的 2.4 兆參數稀疏混合專家核心的託管服務版本,定價為每百萬個 token 2.00 美元與 6.00 美元——兩者並不是在爭奪同一份工作。一個會對你事先提供的選項回傳機率分布。另一個則負責寫作。

簡短答案:如果你需要的是一項能在你已擁有的硬體上評分的封閉集決策,而且 1.71 GB 而非 4.43 GB 正是能否出貨的關鍵差異,那麼 Intern-Decision-0.8B 就值得入手。但如果你想要的是 InternLM 本週推出最準確的小型評分器——也就是 4B——那它就不值得;或者如果你的答案並未事先列舉在你的提示中,那麼這兩者都不是正確的工具,而 Qwen 3.8 是這兩者中唯一還做得了這件事的。

儲存庫所說的,以及別無他物所能做的

從證據開始,因為證據少之又少。InternLM 並未為這個模型發布任何公告。沒有發布貼文,沒有論文,沒有儲存庫說明。Hugging Face 卡片連結了一個示範 Space 和一個 GitHub 儲存庫,而截至本文撰寫時,該 Space 傳回 401,GitHub 連結傳回 404——卡片指引你取得更多資訊的兩個地方都關閉了。三個檢查點在 9 月 26 日約 05:36 UTC 的四十秒內相繼出現:Intern-Decision-0.8B、Intern-Decision-2B 和 Intern-Decision-4B,全都帶有相同標籤——決策制定、多模態、結構化預測——而且全都是 Qwen 檢查點的微調版本,在此例中為 Qwen3.5-0.8B。

從這個儲存庫能得知的資訊,對於一個尚未發布的版本而言精確得異常,因為該實驗室隨權重一同發布了自己的推論模組。0.8B 透過模型目錄中一個 16 KB 的 inference.py 載入,需要 Python 3.12 或更新版本,以及 torch 2.9.1 搭配 transformers 5.14.1,並公開一個 DecisionEngine 類別,只要實例化一次便可重複使用。輸入一個 Python dict,輸出一個回應 dict。無法得知的是:這是已完成的發布還是提早推送、是否會有託管端點,以及它所處的兩個檢查點之間,究竟是同一產品在不同規模下的版本,還是三個剛好同名卻不同的產品。InternLM 以外沒有人實際執行過其中任何一個。

The Hugging Face model card for InternLM's Intern-Decision-0.8B, showing the internlm organisation, a 0.9B params label, tags for image-text-to-text, transformers, safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational, an opening line stating the model is a multimodal structured decision model fine-tuned from Qwen3.5-0.8B, and a Checkpoint and docs section that also reports 0.9B params.

兄弟問題:2B 更快也更好

這是 InternLM 自家公布表格中,讓 0.8B 難以定位的部分。沿著相同的七個測試套件,閱讀這三種規模:

• 速度 — 0.8B:平均 33.98 毫秒,中位數 33.44 毫秒,p95 為 37.50 毫秒。2B:33.28 毫秒、33.15 毫秒、33.55 毫秒。4B:44.16 毫秒、44.03 毫秒、44.60 毫秒。所有數據均於單張 RTX 4090 上,透過本機 Hugging Face 路徑,以每次查詢為單位測得。

• 七項套件平均值 — 0.8B:79.38。2B:84.68。4B:90.02。

• 校準 — 0.8B:Brier 0.530,ECE 0.066。2B:Brier 0.437,ECE 0.100。4B:Brier 0.347,ECE 0.065。

• bf16 格式下的磁碟佔用空間 — 0.8B:1.71 GB。2B:4.43 GB。4B:9.08 GB。

2B 在平均值上更快,在尾端明顯更收斂,而且同時還更準確。因此,「較小就代表較快」在這個系列中並不成立——而且是雙重不成立,因為 4B 比兩者都慢。0.8B 唯一徹底勝出的面向,是沒有人會拿來做基準測試的那一項:1.71 GB,對比 2B 的 4.43 GB 與 4B 的 9.08 GB。如果你要在固定記憶體預算中放置一個評分器——一台小型常開機器、一張與他人共用的 GPU、一個邊緣節點,而語言模型已佔用該卡大部分記憶體——那就是全部理由,而且這理由很現實。

表格其餘部分,則展示了小型模型在哪些地方會出現不平均的崩落。0.8B 的 Typed Decision 分數是 77.35,而 4B 是 80.55——在參數量只有五分之一的情況下,兩者相差三分。但 Jevbench-Original 從 98.61 掉到 80.56,WildJailBreak 則從 89.86 崩跌至 64.48。無論這兩個測試套件正在衡量什麼——模型卡沒有說明,而且模型卡完全沒有提供任何套件定義——它們正是對小型檢查點懲罰最重的那些。一個模型若在某個軸向上撐住了,卻在另外兩個軸向上跌落懸崖,那並不是一個全面性較弱的模型。它是一個具有特定能力邊界的模型,而在把整個機群投入之前,你會想知道你的工作負載落在哪裡。

關於校準那一列,還有一點要提醒。0.8B 的 ECE 為 0.066,是它最好的數字——優於 Jev 在同一套測試上的 0.095——而它的 Brier 分數 0.530 則比 Jev 的 0.358 差。校準誤差與機率均方誤差不是同一種量測,而一張表若顯示前者強、後者弱,其實是在告訴你:這個分布在信心峰值附近形狀良好,但在兩者之間比應有的更胖。如果你的系統以信心值設閾值,這個區別比平均值更重要。

1.71 GB 實際上能換來什麼

此模型中的推論路徑是評分器,而非生成器,其成本差異是結構性的,而非漸進式的。你交給它一個共享狀態、一份具名問題的結構描述,以及可選的最多八張影像。每個問題屬於三種類型之一:choice(一組有序選項中的其中一個)、score(有序尺度,以機率加權期望值回傳),或noul(二元否/是)。狀態、結構描述與一份完整的 assistant JSON 骨架會以每個欄位一個預留位置的方式呈現,模型執行單次因果前向傳遞,並在每個預留位置緊接之前的位置讀取 logits。僅針對該欄位允許的候選符號進行 softmax,套用檢查點擬合後的校準,再將符號映射回你的選項值。

由此產生三個結果。沒有輸出 token,因此也沒有輸出價格——一百萬個決策不會耗費任何 token。沒有解碼迴圈,也沒有會忘記的大括號,因此格式錯誤的 JSON 不是一種失效模式。而且因為每個欄位的答案空間是隨每次請求組裝的,你今天下午發明的結構描述不需要重新訓練:新增一個問題,其選項就會成為該欄位的候選符號。

這些限制也說得同樣直白。一到十六個問題,每題最多 62 個選項,最多八張圖片,以及預設 8,192 個符元的上限——超過上限的輸入會被拒絕,而不是截斷。最後那一條但書是值得細想的設計決定,因為無聲的截斷正是分類器悄悄開始回答另一個問題的方式,而不是你原本問的那個。InternLM 反而會大聲失敗,這是正確的做法,同時也是個維運上的陷阱:一長串工單討論加上結構描述再加上圖片,會比你想像中更快衝破 8,192,而一旦發生,就沒有優雅的處理路徑。

而 1.71 GB 換來的是你可以乘算出來的執行期經濟效益。在每次決策 33.98 毫秒的情況下,一百萬次決策相當於一張 RTX 4090 運行 9.44 小時。4B 要完成同樣的一百萬次則需要 12.3 小時,並且為了換取你原本沒有的 7.37 GB,犧牲了十點五個百分點的準確率。這兩個數字都不包含主機成本,也都不包含人們常忘記的那部分:你是在營運一項服務,而儲存庫裡卻沒有伺服器。

The OrcaRouter model page for Qwen3.8 Max, showing the model name, family and tier badges, a 1,000,000-token context window, pricing of $2.00 per million input tokens and $6.00 per million output tokens, an output speed of 63.71 tokens per second, an error rate of 0.69 percent, an Artificial Analysis index of 45.4 at rank 15 of 145, and a side panel listing Qwen 3.8 27B at an Artificial Analysis intelligence index of 33.65 with $0.33 and $2.40 per million tokens.

Qwen 3.8 不是單一模型,而值得留意的是低價的那一端。

Qwen 3.8 若當作獨立名稱來看,指的是 Qwen3.8-2.4T-A95B:這是阿里巴巴於 2026 年 8 月 12 日以開放權重形式發布的 2.4 兆參數稀疏專家混合核心,每個 token 約有 950 億個參數處於啟用狀態,並採用自訂授權而非 Apache 2.0。同一個核心的託管交付版本則是 Qwen3.8-Max,自 8 月 3 日起透過計價 API 正式提供,並更新為 9 月 2 日的日期快照版本。它們是同一個大腦以兩種方式販售,而第二種交付形式才是大多數人實際上會稱呼的那一個。

根據獨立數據,Artificial Analysis 測得 Qwen3.8-Max 九月快照的 Intelligence Index 為 45.4——在 145 個受索引模型中排名第十五——AA Coding 分數為 76.2,在 138 個中排名第九,GPQA Diamond 為 92.8,Humanity's Last Exam 為 43.1,長上下文召回分數為 80.3。開放檢查點以 39.9 落後於其蒸餾來源的 API。在我們自家的七日 playground 視窗中,Qwen3.8-Max 的 p50 為 2,578 毫秒、p95 為 9,539 毫秒,輸出速度為每秒 55.5 個 token,錯誤率為 1.57%。Qwen3.8-Max 可在 OrcaRouter 上以 供應商定價、加收 0% 加價 呼叫,因此阿里巴巴的價格變更會在當天於我們這邊生效,而非等到下一個帳單週期。

稠密型同系列成員才是應該拿來與 1.71 GB 本機檢查點權衡的選項,因為它是在這個系列中買到通用能力最便宜的方式。Qwen3.8-27B 採用 Apache 2.0,原生支援 262,144 個詞元的上下文,而在我們的目錄中,Qwen3.8-27B 的價格為每百萬詞元 $0.33 與 $2.40。其 Artificial Analysis Intelligence Index 為 33.7。它的參數量約為 Intern-Decision-0.8B 的三十二倍,仍是生成式模型,也仍然不是在高流量下進行封閉集決策的正確工具——但它是誠實的中間選項,也是這場比較中唯一同時真正便宜又真正通用的成員。

評分器對上生成器,說得直白一點

• 上下文 — Qwen3.8-Max 搭載 1,000,000 個 token 的視窗。Intern-Decision-0.8B 則會拒絕任何超過 8,192 的內容。兩者相差 122 倍,而且是強制執行,而非截斷。

• 輸入 — Qwen3.8-Max 接受文字、圖像和影片。Intern-Decision-0.8B 接受文字以及最多八張圖片,而圖片 token 也計入相同的 8,192 預算。

• 輸出——Qwen3.8-Max 會撰寫、推理、呼叫工具,並在收到要求時輸出 JSON。Intern-Decision-0.8B 寫不出一段文字、一段理由或一份計畫。它只能為你早就想到要列出的選項評分。

• 每次呼叫成本——一次實際的分診呼叫為 800 個輸入 token 和 150 個輸出 token,在 Qwen3.8-Max 上約花費 $0.0025,且尚未計入任何推理 token;而由於它是推理模型,其輸出端的估計偏小且過於樂觀。一百萬次這類呼叫大約是 $2,500。Intern-Decision-0.8B 則完全沒有 token 價格:一百萬次決策相當於你擁有或租用的 4090 運行 9.44 小時。

• 延遲 — 過去七天,Qwen3.8-Max 的中位數為 2,578 毫秒,其中包含網路與排隊時間。Intern-Decision-0.8B 的 33.98 毫秒只是在本機顯示卡上執行的單純前向傳遞,兩者並非同一種量測;誠實的比較是一個數量級的差距,而非八十倍。

• 證據——這裡每一個 Intern-Decision-0.8B 的數字都是供應商在 InternLM 自家測試框架上自行回報的,包括延遲在內,沒有任何其他人重現過。每一個 Qwen 3.8 的數字則不是阿里巴巴自家提供的,就是 Artificial Analysis 的測量結果,而上方已將兩者分開標示。

• 獨立評分 — Qwen3.8-Max 有一個。Intern-Decision-0.8B 任何一種都沒有,而且沒有任何推論供應商部署它。

A two-column scoreboard comparing Intern-Decision-0.8B and Qwen 3.8. The Intern-Decision-0.8B column reads Parameters 853M, Seven-suite average 79.38, Context 8,192 tokens, Output scores only no text, Cost no token price 1.71 GB local, Latency 33.98 ms local pass. The Qwen 3.8 Max column reads Parameters 2.4T sparse, AA Intelligence Index 45.4, Context 1,000,000 tokens, Output text image video tools, Cost $2.00 and $6.00 per million, Latency 2,578 ms p50 hosted. A footer reads Intern-Decision-0.8B figures are vendor-reported and unreproduced; Qwen3.8-Max figures per Artificial Analysis and our own seven-day window.

執行此管線的兩種方式

營運層面的分岔比基準測試層面的分岔更為銳利。Intern-Decision-0.8B 是一個模組,不是一項服務。它沒有 OpenAI 相容的端點,沒有批次處理伺服器,沒有健康檢查,沒有重試策略,除非你自己建一個,否則也沒有第二個副本。它在單一流程中載入,一次只回應一個 dict,而如果你需要容錯移轉,你自己就是那個容錯移轉機制。這如實描述了這樣一個情況:一個 8.53 億參數的研究用檢查點,在沒有發布說明的情況下被公開發布,而這一點理應相應地反映在決策定價中。

同一條管線中負責生成的那一半,是一次網路呼叫,而網路呼叫正是路由器存在的理由。Qwen3.8-Max 與 Qwen3.8-27B 都可透過單一 OpenAI 相容金鑰存取,而自動容錯移轉意味著上游降級不會變成你的事故——這裡值得點名,因為在我們這邊,Qwen3.8-Max 的即時七日錯誤率是 1.57%,這個數字很低,直到它落在你的請求上為止。說得通的模式,正是這對組合一直默默描述的那個:在本機執行便宜的封閉集評分器,因為它速度快,而且每次呼叫零成本;並把推理步驟路由出去,因為降價、模型汰換和服務中斷實際上都在那裡發生。

有兩件事我們不會宣稱。Intern-Decision-0.8B 不是我們的路由之一,而且在 InternLM 於某處託管它之前也不會是——我們不會暗示相反的情況。而我們目前完全沒有託管任何 InternLM 模型,所以本文沒有任何內容是在推銷讓這個主體透過我們來運行。

什麼會改變答案?

三個未解的問題,全都能在幾天內得到解答。InternLM 是否會公開其自家卡片所連結的 GitHub 儲存庫,並隨附這些權重如何調校的說明?是否會有發布貼文緊接在檢查點之後,將一次低調的推送轉化為有文件記載、並附上明確部署故事的發布?而是否有任何獨立第三方能在非 InternLM 的硬體上重現 79.38 的平均值或 0.066 的校準誤差?

在那些之中有任何一項成真之前,對 Intern-Decision-0.8B 的誠實解讀是狹窄而具體的:它是三款模型家族中最便宜的封閉集評分器,佔用的資源規模讓它得以進駐自家更快、更準確的同系列兄弟進不去的地方,而且發布時沒有公告,也沒有那項能告訴你它當初是為何以調校的產物。如果你的決策是封閉集、你的答案可在提示中列舉,而且 1.71 GB 正是你的部署實際取決的數字,那它就是正確選擇,在那個大小下沒有其他類似的東西。如果你的答案無法事先列舉,或者你的狀態超過 8,192 個 token,或者你需要一個能向人展示的理由,那麼這場比較從來就不接近——而你想要的那個模型,從來就不是那個 8.53 億參數的模型。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新