
Intern-Decision-0.8B 對比 Qwen 3.8:8.53 億參數與封閉式答案集
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
Intern-Decision-0.8B 是 InternLM 於 2026 年 9 月 26 日上午推上 Hugging Face 的三個決策模型中最小的一個,而且也不是其中最快的。這是首先值得知道的事。根據該實驗室自身的量測,2B 的兄弟模型跑得略微更快——33.28 毫秒對上 33.98 毫秒——並在同一個七項套件平均值上高出六分,因此,通常想找十億參數以下檢查點的理由——原始速度——在這裡並不適用。適用的是規模:852,985,920 個參數、1.71 GB 的 bf16 權重,小到足以永久待在還有其他任務要做的機器的餘裕空間裡。把這點對照 Qwen3.8-Max——該廠商八月發布的 2.4 兆參數稀疏混合專家核心的託管服務版本,定價為每百萬個 token 2.00 美元與 6.00 美元——兩者並不是在爭奪同一份工作。一個會對你事先提供的選項回傳機率分布。另一個則負責寫作。
簡短答案:如果你需要的是一項能在你已擁有的硬體上評分的封閉集決策,而且 1.71 GB 而非 4.43 GB 正是能否出貨的關鍵差異,那麼 Intern-Decision-0.8B 就值得入手。但如果你想要的是 InternLM 本週推出最準確的小型評分器——也就是 4B——那它就不值得;或者如果你的答案並未事先列舉在你的提示中,那麼這兩者都不是正確的工具,而 Qwen 3.8 是這兩者中唯一還做得了這件事的。
儲存庫所說的,以及別無他物所能做的
從證據開始,因為證據少之又少。InternLM 並未為這個模型發布任何公告。沒有發布貼文,沒有論文,沒有儲存庫說明。Hugging Face 卡片連結了一個示範 Space 和一個 GitHub 儲存庫,而截至本文撰寫時,該 Space 傳回 401,GitHub 連結傳回 404——卡片指引你取得更多資訊的兩個地方都關閉了。三個檢查點在 9 月 26 日約 05:36 UTC 的四十秒內相繼出現:Intern-Decision-0.8B、Intern-Decision-2B 和 Intern-Decision-4B,全都帶有相同標籤——決策制定、多模態、結構化預測——而且全都是 Qwen 檢查點的微調版本,在此例中為 Qwen3.5-0.8B。
從這個儲存庫能得知的資訊,對於一個尚未發布的版本而言精確得異常,因為該實驗室隨權重一同發布了自己的推論模組。0.8B 透過模型目錄中一個 16 KB 的 inference.py 載入,需要 Python 3.12 或更新版本,以及 torch 2.9.1 搭配 transformers 5.14.1,並公開一個 DecisionEngine 類別,只要實例化一次便可重複使用。輸入一個 Python dict,輸出一個回應 dict。無法得知的是:這是已完成的發布還是提早推送、是否會有託管端點,以及它所處的兩個檢查點之間,究竟是同一產品在不同規模下的版本,還是三個剛好同名卻不同的產品。InternLM 以外沒有人實際執行過其中任何一個。

兄弟問題:2B 更快也更好
這是 InternLM 自家公布表格中,讓 0.8B 難以定位的部分。沿著相同的七個測試套件,閱讀這三種規模:
• 速度 — 0.8B:平均 33.98 毫秒,中位數 33.44 毫秒,p95 為 37.50 毫秒。2B:33.28 毫秒、33.15 毫秒、33.55 毫秒。4B:44.16 毫秒、44.03 毫秒、44.60 毫秒。所有數據均於單張 RTX 4090 上,透過本機 Hugging Face 路徑,以每次查詢為單位測得。
• 七項套件平均值 — 0.8B:79.38。2B:84.68。4B:90.02。
• 校準 — 0.8B:Brier 0.530,ECE 0.066。2B:Brier 0.437,ECE 0.100。4B:Brier 0.347,ECE 0.065。
• bf16 格式下的磁碟佔用空間 — 0.8B:1.71 GB。2B:4.43 GB。4B:9.08 GB。
2B 在平均值上更快,在尾端明顯更收斂,而且同時還更準確。因此,「較小就代表較快」在這個系列中並不成立——而且是雙重不成立,因為 4B 比兩者都慢。0.8B 唯一徹底勝出的面向,是沒有人會拿來做基準測試的那一項:1.71 GB,對比 2B 的 4.43 GB 與 4B 的 9.08 GB。如果你要在固定記憶體預算中放置一個評分器——一台小型常開機器、一張與他人共用的 GPU、一個邊緣節點,而語言模型已佔用該卡大部分記憶體——那就是全部理由,而且這理由很現實。
表格其餘部分,則展示了小型模型在哪些地方會出現不平均的崩落。0.8B 的 Typed Decision 分數是 77.35,而 4B 是 80.55——在參數量只有五分之一的情況下,兩者相差三分。但 Jevbench-Original 從 98.61 掉到 80.56,WildJailBreak 則從 89.86 崩跌至 64.48。無論這兩個測試套件正在衡量什麼——模型卡沒有說明,而且模型卡完全沒有提供任何套件定義——它們正是對小型檢查點懲罰最重的那些。一個模型若在某個軸向上撐住了,卻在另外兩個軸向上跌落懸崖,那並不是一個全面性較弱的模型。它是一個具有特定能力邊界的模型,而在把整個機群投入之前,你會想知道你的工作負載落在哪裡。
關於校準那一列,還有一點要提醒。0.8B 的 ECE 為 0.066,是它最好的數字——優於 Jev 在同一套測試上的 0.095——而它的 Brier 分數 0.530 則比 Jev 的 0.358 差。校準誤差與機率均方誤差不是同一種量測,而一張表若顯示前者強、後者弱,其實是在告訴你:這個分布在信心峰值附近形狀良好,但在兩者之間比應有的更胖。如果你的系統以信心值設閾值,這個區別比平均值更重要。
1.71 GB 實際上能換來什麼
此模型中的推論路徑是評分器,而非生成器,其成本差異是結構性的,而非漸進式的。你交給它一個共享狀態、一份具名問題的結構描述,以及可選的最多八張影像。每個問題屬於三種類型之一:choice(一組有序選項中的其中一個)、score(有序尺度,以機率加權期望值回傳),或noul(二元否/是)。狀態、結構描述與一份完整的 assistant JSON 骨架會以每個欄位一個預留位置的方式呈現,模型執行單次因果前向傳遞,並在每個預留位置緊接之前的位置讀取 logits。僅針對該欄位允許的候選符號進行 softmax,套用檢查點擬合後的校準,再將符號映射回你的選項值。
由此產生三個結果。沒有輸出 token,因此也沒有輸出價格——一百萬個決策不會耗費任何 token。沒有解碼迴圈,也沒有會忘記的大括號,因此格式錯誤的 JSON 不是一種失效模式。而且因為每個欄位的答案空間是隨每次請求組裝的,你今天下午發明的結構描述不需要重新訓練:新增一個問題,其選項就會成為該欄位的候選符號。
這些限制也說得同樣直白。一到十六個問題,每題最多 62 個選項,最多八張圖片,以及預設 8,192 個符元的上限——超過上限的輸入會被拒絕,而不是截斷。最後那一條但書是值得細想的設計決定,因為無聲的截斷正是分類器悄悄開始回答另一個問題的方式,而不是你原本問的那個。InternLM 反而會大聲失敗,這是正確的做法,同時也是個維運上的陷阱:一長串工單討論加上結構描述再加上圖片,會比你想像中更快衝破 8,192,而一旦發生,就沒有優雅的處理路徑。
而 1.71 GB 換來的是你可以乘算出來的執行期經濟效益。在每次決策 33.98 毫秒的情況下,一百萬次決策相當於一張 RTX 4090 運行 9.44 小時。4B 要完成同樣的一百萬次則需要 12.3 小時,並且為了換取你原本沒有的 7.37 GB,犧牲了十點五個百分點的準確率。這兩個數字都不包含主機成本,也都不包含人們常忘記的那部分:你是在營運一項服務,而儲存庫裡卻沒有伺服器。

Qwen 3.8 不是單一模型,而值得留意的是低價的那一端。
Qwen 3.8 若當作獨立名稱來看,指的是 Qwen3.8-2.4T-A95B:這是阿里巴巴於 2026 年 8 月 12 日以開放權重形式發布的 2.4 兆參數稀疏專家混合核心,每個 token 約有 950 億個參數處於啟用狀態,並採用自訂授權而非 Apache 2.0。同一個核心的託管交付版本則是 Qwen3.8-Max,自 8 月 3 日起透過計價 API 正式提供,並更新為 9 月 2 日的日期快照版本。它們是同一個大腦以兩種方式販售,而第二種交付形式才是大多數人實際上會稱呼的那一個。
根據獨立數據,Artificial Analysis 測得 Qwen3.8-Max 九月快照的 Intelligence Index 為 45.4——在 145 個受索引模型中排名第十五——AA Coding 分數為 76.2,在 138 個中排名第九,GPQA Diamond 為 92.8,Humanity's Last Exam 為 43.1,長上下文召回分數為 80.3。開放檢查點以 39.9 落後於其蒸餾來源的 API。在我們自家的七日 playground 視窗中,Qwen3.8-Max 的 p50 為 2,578 毫秒、p95 為 9,539 毫秒,輸出速度為每秒 55.5 個 token,錯誤率為 1.57%。Qwen3.8-Max 可在 OrcaRouter 上以 供應商定價、加收 0% 加價 呼叫,因此阿里巴巴的價格變更會在當天於我們這邊生效,而非等到下一個帳單週期。
稠密型同系列成員才是應該拿來與 1.71 GB 本機檢查點權衡的選項,因為它是在這個系列中買到通用能力最便宜的方式。Qwen3.8-27B 採用 Apache 2.0,原生支援 262,144 個詞元的上下文,而在我們的目錄中,Qwen3.8-27B 的價格為每百萬詞元 $0.33 與 $2.40。其 Artificial Analysis Intelligence Index 為 33.7。它的參數量約為 Intern-Decision-0.8B 的三十二倍,仍是生成式模型,也仍然不是在高流量下進行封閉集決策的正確工具——但它是誠實的中間選項,也是這場比較中唯一同時真正便宜又真正通用的成員。
評分器對上生成器,說得直白一點
• 上下文 — Qwen3.8-Max 搭載 1,000,000 個 token 的視窗。Intern-Decision-0.8B 則會拒絕任何超過 8,192 的內容。兩者相差 122 倍,而且是強制執行,而非截斷。
• 輸入 — Qwen3.8-Max 接受文字、圖像和影片。Intern-Decision-0.8B 接受文字以及最多八張圖片,而圖片 token 也計入相同的 8,192 預算。
• 輸出——Qwen3.8-Max 會撰寫、推理、呼叫工具,並在收到要求時輸出 JSON。Intern-Decision-0.8B 寫不出一段文字、一段理由或一份計畫。它只能為你早就想到要列出的選項評分。
• 每次呼叫成本——一次實際的分診呼叫為 800 個輸入 token 和 150 個輸出 token,在 Qwen3.8-Max 上約花費 $0.0025,且尚未計入任何推理 token;而由於它是推理模型,其輸出端的估計偏小且過於樂觀。一百萬次這類呼叫大約是 $2,500。Intern-Decision-0.8B 則完全沒有 token 價格:一百萬次決策相當於你擁有或租用的 4090 運行 9.44 小時。
• 延遲 — 過去七天,Qwen3.8-Max 的中位數為 2,578 毫秒,其中包含網路與排隊時間。Intern-Decision-0.8B 的 33.98 毫秒只是在本機顯示卡上執行的單純前向傳遞,兩者並非同一種量測;誠實的比較是一個數量級的差距,而非八十倍。
• 證據——這裡每一個 Intern-Decision-0.8B 的數字都是供應商在 InternLM 自家測試框架上自行回報的,包括延遲在內,沒有任何其他人重現過。每一個 Qwen 3.8 的數字則不是阿里巴巴自家提供的,就是 Artificial Analysis 的測量結果,而上方已將兩者分開標示。
• 獨立評分 — Qwen3.8-Max 有一個。Intern-Decision-0.8B 任何一種都沒有,而且沒有任何推論供應商部署它。

執行此管線的兩種方式
營運層面的分岔比基準測試層面的分岔更為銳利。Intern-Decision-0.8B 是一個模組,不是一項服務。它沒有 OpenAI 相容的端點,沒有批次處理伺服器,沒有健康檢查,沒有重試策略,除非你自己建一個,否則也沒有第二個副本。它在單一流程中載入,一次只回應一個 dict,而如果你需要容錯移轉,你自己就是那個容錯移轉機制。這如實描述了這樣一個情況:一個 8.53 億參數的研究用檢查點,在沒有發布說明的情況下被公開發布,而這一點理應相應地反映在決策定價中。
同一條管線中負責生成的那一半,是一次網路呼叫,而網路呼叫正是路由器存在的理由。Qwen3.8-Max 與 Qwen3.8-27B 都可透過單一 OpenAI 相容金鑰存取,而自動容錯移轉意味著上游降級不會變成你的事故——這裡值得點名,因為在我們這邊,Qwen3.8-Max 的即時七日錯誤率是 1.57%,這個數字很低,直到它落在你的請求上為止。說得通的模式,正是這對組合一直默默描述的那個:在本機執行便宜的封閉集評分器,因為它速度快,而且每次呼叫零成本;並把推理步驟路由出去,因為降價、模型汰換和服務中斷實際上都在那裡發生。
有兩件事我們不會宣稱。Intern-Decision-0.8B 不是我們的路由之一,而且在 InternLM 於某處託管它之前也不會是——我們不會暗示相反的情況。而我們目前完全沒有託管任何 InternLM 模型,所以本文沒有任何內容是在推銷讓這個主體透過我們來運行。
什麼會改變答案?
三個未解的問題,全都能在幾天內得到解答。InternLM 是否會公開其自家卡片所連結的 GitHub 儲存庫,並隨附這些權重如何調校的說明?是否會有發布貼文緊接在檢查點之後,將一次低調的推送轉化為有文件記載、並附上明確部署故事的發布?而是否有任何獨立第三方能在非 InternLM 的硬體上重現 79.38 的平均值或 0.066 的校準誤差?
在那些之中有任何一項成真之前,對 Intern-Decision-0.8B 的誠實解讀是狹窄而具體的:它是三款模型家族中最便宜的封閉集評分器,佔用的資源規模讓它得以進駐自家更快、更準確的同系列兄弟進不去的地方,而且發布時沒有公告,也沒有那項能告訴你它當初是為何以調校的產物。如果你的決策是封閉集、你的答案可在提示中列舉,而且 1.71 GB 正是你的部署實際取決的數字,那它就是正確選擇,在那個大小下沒有其他類似的東西。如果你的答案無法事先列舉,或者你的狀態超過 8,192 個 token,或者你需要一個能向人展示的理由,那麼這場比較從來就不接近——而你想要的那個模型,從來就不是那個 8.53 億參數的模型。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
