
Intern-Decision-4B 對決 Qwen 3.8:44 毫秒的前向傳遞,迎戰 2.4 兆個參數
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
InternLM 於 2026 年 9 月 26 日上午在 Hugging Face 上發布了 Intern-Decision-4B——沒有發布貼文、沒有部落格文章,自家模型卡上的一個 GitHub 連結回傳 404,而一個示範 Space 則回傳 401。權重是真實且可下載的;公告卻不在那裡。而其底層的模型是 Qwen3.5-4B 的微調版本,這正是為什麼與託管旗艦模型的比較比規格表更有價值。這兩者不是競爭對手。它們是同一條管線的兩端,而整個問題在於它們之間的分界線落在哪裡。底層核心是該廠商在 8 月發布、現以 Qwen3.8-Max 提供服務的 2.4 兆參數模型,計費為每百萬個 token 2.00 美元與 6.00 美元;Intern-Decision-4B 是那個七個月大基礎模型的 45.4 億參數重建版本,它完全不輸出 token,在單次前向傳遞中最多回答十六個具型別的問題,且每次呼叫零成本,因為沒有輸出可供計費。
一行話的答案:如果你的任務是答案選項封閉的決策,Intern-Decision-4B 大約快上五十倍(以每次決策計),而且結構上更便宜,在那個狹窄的軸線上沒有任何前沿模型能贏過它。如果你的任務是其他任何東西——推理、長上下文、工具使用,任何答案尚未在你的提示中列舉出來的任務——Qwen 3.8 就不只是更好,而是這兩者中唯一真的能完成工作的那一個。以下所有內容,都是在精確找出那條界線。
什麼是實際上已確認的,而什麼不是
先從證據開始,因為定調很重要。Intern-Decision-4B 沒有廠商公告。沒有新聞稿,沒有論文,也沒有可讀的儲存庫描述。今天存在的,是一個今早發布在internlm 組織下的 Hugging Face 儲存庫——Intern Large Models,上海人工智慧實驗室團隊——採用 Apache 2.0 授權條款,並將上游 Qwen 授權條款以 LICENSE-QWEN 之名保留在旁。兩個同系列檢查點相隔不到四十秒先後出現:Intern-Decision-0.8B 有 8.53 億個參數,Intern-Decision-2B 有 22.1 億個。三者都帶有相同標籤——決策, 多模態, 結構化預測——而且三者都隸屬於同一個尚未能公開解析的模型集合。
尚未確認的是:這究竟是最終正式發布,還是提早推送。該儲存庫建立於 05:36 UTC,並在同日 08:00 UTC 前再次被修改,而同系列檢查點上進一步的公開活動持續到 09:00 之後。InternLM 尚未說明其預期的部署方案為何,尚未發布它所連結的儲存庫,也未說明是否會推出託管端點。請將本文中的每一項基準測試數字都視為由廠商自行回報且未經重現——因為截至本文撰寫時,真的沒有任何其他地方寫過關於這個模型的任何內容。三條各自獨立的搜尋途徑,對這個名稱都查無結果。

架構上的賭注:是評分器,而非生成器
Intern-Decision-4B 自身文件中最重要的一句話是一個否定:推論路徑「不會呼叫 generate() 或取樣自由形式的文字。」這不是實作細節,而是整個設計,也正是它與搭配 JSON schema 呼叫 Qwen3.8-Max 並祈禱大括號會閉合這種做法之間的區別。
以下是這張卡所描述的機制。你交給模型一個共享狀態、一份具名問題的結構描述,以及可選的最多八張圖像。每個問題都屬於三種類型之一:choice(從一組有序選項中挑選一個)、score(在順序尺度上評分,並以機率加權的期望值回傳),或noul(二元的否/是)。系統提示、狀態、結構描述,以及一份完整的助理 JSON 骨架都會被渲染,每個欄位各有一個預留位置。接著——這正是關鍵——模型執行一次因果前向傳遞,並在每個預留位置緊接之前的位置讀取 logits。僅針對該欄位允許的候選符號進行 softmax,套用檢查點的校準,然後將這些符號對映回你原本的選項值。
後果十分具體。因為每個欄位的答案空間是依每次請求即時組裝,而不是預先烘焙進詞彙頭中,所以你今天下午才發明的結構描述不需要重新訓練——新增一個問題,選項就會成為該欄位的候選符號。因為沒有解碼迴圈,所以沒有輸出符記、沒有會忘記的大括號,也沒有針對格式錯誤 JSON 的重試邏輯。而且因為所有問題都是根據對狀態的同一讀取來評分,十六個問題只需一次前向傳遞,而不是十六次。
這些限制同樣具體,而卡片也直截了當地寫明,沒有含糊其辭。問題數量為一至十六題,每題最多 62 個選項,最多八張圖片。預設上限為 8,192 個 token——而超過此上限的輸入會遭到拒絕,不會被截斷。最後那項條款是值得細想的設計決策:無聲截斷正是分類器悄悄開始回答不同於你所提問題的緣故,而 InternLM 選擇了改為大聲失敗。這是正確的做法,同時也是個營運陷阱,因為冗長的工單討論串加上結構定義,再加上圖片,會比你想像中更快衝破 8,192,而且沒有優雅的處理路徑——你只會得到一個錯誤。
在 Intern-Decision-4B 勝出的地方,而且差距並不小
兩個軸線,而兩者都是結構性的,而非漸進式的。
• 每次決策的延遲 — 平均 44.16 毫秒,中位數 44.03 毫秒,p95 為 44.60 毫秒,是在單張 RTX 4090 上透過本機 Hugging Face 路徑測得。相較之下,Qwen3.8-Max 在我們自家 playground 上的即時七日視窗顯示,p50 為 2,474 毫秒、p95 為 9,789 毫秒,輸出速度為每秒 55.4 個 token。以中位數而言約為 56 倍,而這項比較與其說不公平,不如說是兩種不同作業之間的比較:一款模型進行分類,另一款則先推理再撰寫。差距確實存在,其原因也確實存在。
• 每項決策成本——而這是算術問題,不是看法問題。以一個實際的支援分流呼叫為例:800 個輸入 token 的狀態與結構定義,以及 150 個輸出 token 的結構化 JSON。在 Qwen3.8-Max 上,這會是 800 × $2.00/M 加上 150 × $6.00/M,也就是每項決策約 $0.0025,而且還沒算進任何一個推理 token——而 Qwen3.8-Max 是推理模型,所以輸出端這樣估已經很樂觀了。一百萬項決策大約要花 $2,500。同樣的一百萬項決策在 Intern-Decision-4B 上,token 成本為零,大約需要 12.3 小時的 RTX 4090 時間。Intern-Decision-4B 沒有輸出價格,因為它沒有輸出。
這項取捨坦率而明顯:4B 需要一個你擁有或租用的 GPU,它會佔用那個 GPU,而且它永遠只能做一件事。但如果那件事正是你的產品每天要做數百萬次的事,上述的算術就是整個商業論證,而再多的前沿模型能力也改變不了這一點。
Qwen 3.8 未公布的數字:校準
這是那個不易察覺的關鍵差異,也是大多數比較都會忽略的一點,因為它看起來並不像基準測試。
Intern-Decision-4B 會回傳一個分布,涵蓋你的選項值,而不只是一個標籤——還會附帶一個信心分數;而對於 noul 問題,則是校準後的「是」機率。InternLM 在其自家測試套件上回報 Brier 分數為 0.347、期望校準誤差為 0.065,並在檢查點中附上擬合後的溫度參數:1.99241824,此數值是針對此規模,以 1,728 個指定校準案例與 1,693 個留出驗證案例,透過最小化負對數概似函數另行擬合而得。測試套件標籤並未用於挑選它。卡片中還有第二項獨立的 96 案例診斷,使用精確參考分布而非取樣標籤;它顯示整體 Brier/ECE 從校準前的 0.628 / 0.213 變為校準後的 0.550 / 0.089——校準步驟將期望誤差削減了遠超過一半。
現在看看 Qwen 3.8 那一邊有沒有同樣的數字。並沒有。阿里巴巴發佈了 Artificial Analysis Index 分數、GPQA Diamond、terminal-bench、SciCode、tau-banking 和長上下文召回——全都是能力指標。它沒有為任何 Qwen 3.8 系列成員發佈校準指標,因為生成式模型的信心並不是供應商會提供的量。如果你的系統需要的是一個可以用來設閾值或路由的機率,而不是一個它必須信任的答案,那麼這個差別就不是程度上的差別。其中一個模型給你一個數字,並附有明文記載的錯誤率;另一個給你文字,而你得圍繞它建立自己的信心估計。
Qwen 3.8 勝出之處,而且差距還不小
把兩者就其能被要求做什麼並列對照,界線就不再微妙了。
• 背景說明 — Qwen3.8-Max 具備 1,000,000 個 token 的視窗。Intern-Decision-4B 只要超過 8,192 就一律拒收。兩者相差 122 倍,而且毫無變通餘地,因為輸入上限是強制執行,而非予以截斷。
• 輸入模態 — Qwen3.8-Max 接受文字、圖像與影片。Intern-Decision-4B 接受文字與圖像,最多八張,而圖像 token 也計入相同的 8,192 預算。
• 推理與工具 — Qwen3.8-Max 在其宣稱的能力中包含工具使用、JSON 模式與推理,並在 Artificial Analysis 智慧指數中獲得 45.4 分,於 145 個受評模型中排名第十五,其 AA Coding 分數為 76.2,於 138 個模型中排名第九。這些是 Artificial Analysis 發表的獨立數據,並非廠商自稱。Intern-Decision-4B 沒有 Artificial Analysis 的評測紀錄,沒有任何形式的獨立評分,也不具備推理、規劃或呼叫任何工具的能力。
• 開放式輸出 — Qwen3.8-Max 會撰寫。Intern-Decision-4B 無法產出段落、理由或計畫。它只能為你已經想到要列出的選項評分。
同樣值得在開放權重這一側記上一筆:如果你要的是 Qwen 3.8 核心本身,而不是代管服務那條路線,那麼 Qwen3.8-27B 就是稠密版本的那個手足——278 億個參數、Apache 2.0、262,144 個 token 的上下文,以及在提供服務之處約每百萬個 token 0.33 美元 / 2.40 美元。它在 AA 智慧指數上拿下 33.7 分。它仍然比 Intern-Decision-4B 大上一個數量級,仍然是生成式的,而且在大量規模下的封閉集合決策中仍然是錯誤的工具——但它是誠實的中間選項,也是三者之中唯一同時真正做到便宜又真正有能力的。

誠實地解讀 InternLM 自家的基準測試表
Intern-Decision-4B 的模型卡上有一張比較表,而其中缺少的部分,比表中所列的內容更具資訊量。表格的列為 Jev、Laya、SemIf、Kev、JevK5,以及 InternLM 自家的 0.8B 和 2B。其中每一個都是另一款 System One 或決策模型項目——Jev 來自 TypeSafe AI,Laya 來自 Convai Innovations,另外還有三個。每一項數字都是廠商在 InternLM 自家測試框架上自行回報的。表中完全沒有前沿模型。
那不是疏漏。那是這項宣稱誠實的範疇。Intern-Decision-4B 在七個測試套件上、最受矚目的平均 90.02——Jevbench-Easy 100.00、Jevbench-Original 98.61、Jevbench-Hard 73.87、Typed Decision 80.55、ToolACE 96.45、AG News 90.82、WildJailBreak 89.86——是宣稱要領先決策模型這個類別,而在這張表上它確實做到了,勝過 Jev 的 88.74 與 Laya 的 57.77。這不是宣稱要與 Qwen 3.8 競爭,而 InternLM 也沒有在任何地方做出那樣的宣稱。模型卡片的範圍僅限於它自身的類別,而把類別勝利解讀為能力勝利,正是本節存在的目的所要防止的錯誤。
還有兩點提醒。延遲數據——在 4090 上平均 44 毫秒——是廠商自行測量的,會隨工作負載與硬體而異,而單一 GPU 的前向傳遞,與包含網路往返及排隊的託管 API 呼叫,並不是同一種測量。至於校準先導測試只有 96 個案例:那是一項診斷,不是基準測試,卡片上也這麼註明。
部署問題,這才是真正的分叉點
暫時別管基準測試,先問問每一項在實務運作上要求你什麼。
Intern-Decision-4B 在磁碟上以 bf16 儲存時大約是 9.1 GB——兩個語言分片分別為 4.26 GB 和 4.15 GB、一個 612 MB 的視覺塔,以及一個 54 MB 的投影器。它透過一個 16 KB 的 inference.py載入;該檔案隨附於儲存庫本身,並帶有一個 DecisionEngine 類別,你只要實例化一次即可重複使用。輸入是一個 Python dict,輸出是一個回應 dict,且需要 Python 3.12+。它在 4090 上執行只需 44 ms,而 0.8B 的兄弟版本小到足以在遠少得多的資源上進行推論。但這個模組本身就是介面——沒有伺服器、沒有 OpenAI 相容端點,也沒有代管 API。你得自己在它周圍打造服務,而如果你需要兩份來做容錯移轉,那也得你自己打造。
同一條管線的生成端則完全是另一項決策,而這正是路由器真正存在的目的。Qwen3.8-Max 與 Qwen3.8-27B 都能在 OrcaRouter 上以同一組相容 OpenAI 的金鑰呼叫,價格為供應商定價、0% 加成原樣提供——因此當阿里巴巴調整 Qwen 價格時,我們這邊當天就同步生效,而不是等到下一個計費週期。Intern-Decision-4B 不在我們的路由之中,除非 InternLM 在某處託管它,否則也不會納入;我們不會假裝不是這樣。我們涵蓋的是這條管線中屬於網路呼叫的那一半:一組金鑰即可使用 200 多個模型、Qwen3.8-Max 效能下降時自動容錯移轉——其即時七日錯誤率為 1.78%——以及能在同一請求路徑中,先讓兩個 Qwen 3.8 層級互相比較 A/B 測試,再決定採用哪一個。
這正是值得帶走的模式。在本機執行評分器,因為它便宜、快速,而且擅長做好一件範圍狹窄的事。把推理步驟路由出去,因為供應商更迭、降價和服務中斷實際上就是發生在那裡。

你實際上應該選哪一個?
若你的決策是封閉集合、答案可在提示中列舉、你會大量執行相同決策,而且你在意機率不下於標籤,就選 Intern-Decision-4B。工單路由、依固定分類法進行的內容審核、擷取成你可控制的結構描述的結構化抽取、評分規準、二元閘門——任何可讓人預先寫好選項清單的情境皆然。這 45.4 億個參數對上限很誠實:模型卡本身顯示 4B 在 Jevbench-Hard 上為 73.87,而在 Easy 上為 100.00,因此決策形態越難,小型模型讓步越多。
選擇 Qwen 3.8 —— 亦即:想要託管核心就選 Qwen3.8-Max,想要能實際持有的權重就選 Qwen3.8-27B —— 如果答案無法事先列舉、如果輸入超過 8,192 個 token、如果你需要能展示給人看的推理依據、如果你需要工具呼叫,或如果你需要影片。如果你單純不想操作 GPU,也選它:每百萬次決策要花 12.3 小時的 4090 時間,只有在你已經有 4090,而且其他 363 天還有別的事可拿它來做時,才稱得上便宜。
如果您的管線正是大多數管線實際上的樣貌——前端是便宜的封閉集分類器,後端則是用來處理分類器不確定案例的前沿模型——那就兩者都選。這正是 Intern-Decision-4B 的校準置信度所為之打造的配置,也是上方 ECE 數值比整體平均數字更重要的原因。
看什麼
三個懸而未決的問題,全都能在幾天內得到答案。InternLM 是否會發布它自家模型卡所連結的 GitHub 儲存庫——目前是 404——並隨附訓練說明?是否會在權重之後發布公告,讓一次低調推送變成有文件記載的發布?而是否有任何獨立第三方能在並非 InternLM 的硬體上,重現 90.02 的平均值,或 0.347 Brier?
在你等待的同時,有一點小地方不一致,值得記上一筆,因為這正是你在評估部署規模時會在意的那種事。這個模型名叫 4B。參數量是 4,539,265,536 —— 也就是 45.4 億。0.8B 的兄弟版本是 8.53 億,2B 的兄弟版本是 22.1 億,兩者都只是差之毫釐地向上或向下取整。只有 4B 向下取整的幅度超過五億。這不是問題。這只是提醒你,在未經公告的發布中,文件是你唯一有的規格,而且就連文件也還在編輯中。
