為 Intern-Decision-4B 生成的標題卡,副標題為「一個結構化決策模型,不必寫出任何 token 就能回答」,帶有三個標籤,分別寫著「沒有公告」、「40 秒內三個檢查點」和「沒有獨立評估」,頁腳寫著「數據依 InternLM 模型卡;此處內容均未經獨立重現」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Intern-Decision-4B:InternLM 推出了一款無需寫下任何 token 就能回答的決策模型

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026 年 9 月 26 日,三個模型儲存庫在四十秒內出現在 InternLM 的 Hugging Face 頁面上:Intern-Decision-0.8B 於 05:35:57 UTC,Intern-Decision-2B 於 05:36:19,以及 internlm/Intern-Decision-4B 於 05:36:37。4B 是其中有趣的那個。它是 Qwen3.5-4B 的微調版本,接受共享狀態、具名問題的 schema,以及可選圖片,並在單次前向傳遞中為每個問題回傳校準後的答案分佈。它從不生成文字。它自己的發布說明直接寫道:「這個 API 執行結構化候選評分。它不會呼叫 generate() 或取樣自由形式文字。」四十秒的上傳,卻沒有任何一處發布公告——沒有部落格文章、沒有推文、沒有變更紀錄、沒有發布頁面。存在的只有一張模型卡、一個 inference.py,以及四個 safetensors 分片。

A screenshot of the internlm organisation page on Hugging Face, showing the organisation's Recent Activity feed with the Intern-Decision-2B repository listed as published about an hour before the capture, above the organisation's model list and its 18 collections.

已推出的內容,以及未推出的內容

這個系列是首先要弄對的東西,因為 4B 的模型卡悄悄地承載了它。它的基準測試表在自身資料列旁,也刊出了 Intern-Decision-0.8B 與 Intern-Decision-2B 的資料列,而這三個檢查點全都在同一分鐘內上架到 hub。2B 儲存庫從未從 4B 的模型卡連結出去——你必須透過該組織的上傳動態才找得到它。

這次未出貨的,幾乎是每次發行通常會帶來的所有東西:

• 沒有任何公告——網路上一片空白,我們也找不到任何語言版本的供應商聲明。

• 沒有示範 — 該卡片連結到位於 huggingface.co/spaces/internlm/intern-decision 的 Space;該端點回應 HTTP 401,代表它並非公開,而不是它壞了。

• 無集合 — 所宣傳的模型集合位於 huggingface.co/collections/internlm/intern-decision 同樣回傳 401。

• 沒有程式碼儲存庫——該模型卡的 GitHub 連結,github.com/internlm/Intern-Decision,是 404,而 InternLM 組織的儲存庫清單中並沒有這個專案。

• 無人採用——截至撰稿時,4B 顯示一個讚和零次下載。

這就是全部可知的範圍。把下面每個數字都當成廠商自己報的,因為目前還沒有其他人跑過這套東西。

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face, showing the model title, the Demo, Model Weights and GitHub links, the description naming Qwen3.5-4B as the base model, and the five-step 'How inference works' list describing single-token symbol mapping, the assistant JSON skeleton, one causal forward pass, a softmax over candidate-symbol logits, and probability calibration.

推論契約就是產品

這張卡片大部分內容都花在一個五步驟程序上,這說明了工程設計的重點放在哪裡。問題和選項維持原本的順序。每個問題的選項會對應到單一 token 符號——A 到 Z,然後 a 到 z,然後 0 到 9。也就是 62 個符號,而這正是卡片將每個問題限制在 62 個選項的原因。提示會從原始系統提示、狀態、決策結構描述,以及一份完整的 assistant JSON 骨架渲染而成,其中有一個 <decision> 佔位符,每個欄位一個,並保留檢查點的聊天模板與一個空的 thinking 區塊。接著進行一次因果前向傳遞。Logits 會在每個佔位符正前方的位置讀取,softmax 僅在該欄位允許的候選符號 logits 上執行,接著套用校準,最後將符號映射回你的選項值。

結果就是固定的形態:沒有解碼迴圈、沒有取樣、沒有解析器、沒有產生幻覺的表面,而且每輪每題最多只能做一個決策。支援三種題型——choice,搭配有序的準則對應表;score,搭配清單或以數字為鍵的對應表;以及noul,一種二元的否/是。

規格表中最重要的細節

模型卡明確指出,超過以下上限的輸入會「未經截斷即遭拒絕」:DecisionEngine(max_length=8192)。將這點與設定並讀,就會浮現一個怪異之處:底層文字塔宣告 max_position_embeddings 為 262,144。主幹可定址 25 萬個 token;釋出的包裝器拒絕超過 8,192 的任何內容。這不是一款帶有保守預設值的長上下文模型,而是一個決策評分模型,其自身的測試框架限制了你所能交給它的證據量。如果你的路由問題取決於超過大約八千個 token 的狀態,這個出貨版本的檢查點不會回答它,而且它會拒絕,而不是把你的輸入裁短。

最多允許八張圖片,而卡片指出圖片權杖會計入同一個 8,192 上限。

A generated timeline card titled 'Three checkpoints, forty seconds', listing Intern-Decision-0.8B at 05:35:57 UTC, Intern-Decision-2B at 05:36:19 UTC and Intern-Decision-4B at 05:36:37 UTC on 26 September 2026, with a footer reading 'Upload timestamps from the InternLM organisation feed on Hugging Face. No announcement accompanied any of the three.' The OrcaRouter logo is composited in the bottom-right corner.

權重內部

四個分片、45.4 億個 BF16 參數,以及一份說明了尺寸名稱由來的設定檔:其中有一座文字塔、一座約二十多層、patch 大小為 16 像素的視覺塔,以及介於兩者之間的投影器。文字端為 32 層、hidden size 2,560,16 個注意力頭對上 4 個 key/value 頭,詞彙表為 248,320 個 token,並採用綁定嵌入。層類型以固定間隔交替——三層線性注意力,接著一層全注意力,如此重複。只有全注意力層帶有全域注意力,而旋轉嵌入是部分式的,係數為 0.25。載入它需要 Python 3.12 或更新版本、PyTorch 2.9.1 與 Transformers 5.14.1,而且檔案清單仍包含 tokenizer、merges 與 vocabulary 檔案,而非依賴 hub 端的 tokenizer。

這些數字,以及是誰產出它們的

本節中的所有內容均由 InternLM 量測,並刊載於模型卡上。其中沒有任何一項經過第三方重現,而且這個模型在任何地方都沒有 Artificial Analysis 條目、沒有競技場評分,也沒有任何排行榜上的資料列。

在七個評估集上,4B 平均為 90.02,Brier 分數為 0.347,期望校準誤差為 0.065。同一張表列出 Intern-Decision-0.8B 為 79.38、Intern-Decision-2B 為 84.68,因此該系列隨規模呈上升曲線——從 0.8B 到 2B 增加 4.7 分,再到 4B 又增加 5.3 分。表中還包含五列廠商未訓練的資料:Jev 為 88.74、JevK5 為 85.16、SemIf 為 84.23、Kev 為 79.56,以及 Laya 為 57.77。那些是 InternLM 用 InternLM 的測試框架、對 InternLM 的檢查點執行所得的。它們不是那些專案自己的數字,而把它們當作如此解讀,是這裡最容易犯的錯誤。

延遲是在單張 RTX 4090 上、透過本機 Hugging Face 路徑測得的,而該顯卡也標註這些數值會隨工作負載與硬體而異。4B 的平均值為 44.16 毫秒、中位數 44.03 毫秒、P95 為 44.60 毫秒——中位數與尾端之間的差距遠不到一毫秒,這正是固定形狀前向傳遞該有的樣貌。兩個較小的檢查點都在 33 毫秒左右,其中 2B 在平均值與中位數上都微幅領先 0.8B;這點值得留意,而不是把它抹平帶過:這兩者差距之小,已落在彼此的測量雜訊範圍內。

校準,以及其中坦誠的注意事項

此檢查點隨附的預設溫度為 1.99241824,這是針對此模型另行以負對數似然最小化,在 1,728 個指定校準案例上擬合,並保留 1,693 個案例作為驗證。模型卡指出,並未使用測試套件標籤來選定此溫度。其實作方式是候選機率校準,而非取樣溫度:它會調整信心、二元機率與期望分數,同時不影響 argmax 決策。

另一項 96 個案例的診斷接著回報了效果。在 InternLM 自家提供的前後對照欄位中,4B 的整體 Brier 與 ECE 從 0.628 / 0.213 變為 0.550 / 0.089,而 Jev 則是 0.595 / 0.130。對那張表有兩種誠實的解讀:校準顯然有效,而且「之前」欄位並不是任何使用者會看到的結果,因為出廠預設值就是擬合後的溫度。也值得指出——六個診斷類別中有兩個,4B 的表現比 Jev 差,而其中最差的「日常證據與觀察偏差」改善到 0.575 / 0.210,但仍落後 Jev 的 0.603 / 0.114。在那個切面上,校準縮小了差距,但並未完全消除。

路由器適用之處,以及尚未適用之處

使用這個模型的實際障礙不在於準確度,而在於封裝形式。這次發布提供的是得先下載四個分片、再匯入的 Python 類別,而不是可直接呼叫的 HTTP 端點。這正是路由層存在的意義所在,要填補的就是這個落差——一組金鑰就能通行 200 多個模型,供應商定價原樣傳遞、0% 加價,以及 供應商不穩時自動容錯移轉——但我們必須直言,OrcaRouter 目前並未提供 Intern-Decision-4B 或任何同類模型。我們的目錄並未列出它,此處任何內容都不應被解讀為可用性的宣稱。我們能提供的是成本更低的決定:如果你想在正式環境路徑前試用一個 45 億參數的決策評分器,可以把它建進路由器,並設定回退到通用模型,這樣一來,校準失準的日子只會讓你付出一次重試的代價,而不是一次服務中斷。

什麼會改變局面?

三件事,依重要性排序。需要由 InternLM 以外的人重現 90.02 的平均值與 0.065 的期望校準誤差——從未接觸過外部測試集的校準宣稱,是機器學習中最不具可轉移性的數字。該模型卡自身的足跡也必須出現:Space、collection、GitHub 儲存庫。而廠商必須說明這究竟是產品還是論文產物,因為僅限研究用的授權與 Apache-2.0 授權不是同一種承諾,而 4B 選擇了 Apache-2.0,並一併保留 Qwen 授權。在那之前,正確的定調就是這次上傳本身所暗示的:這是一個真實的檢查點,具有真實的推論契約,以及一份完全未經驗證的計分卡,而且在未告知任何人的情況下發布。

目前為止,誠實的總結是狹隘但有用。如果你的問題是「從五個路由標籤中挑一個,並告訴我你有多確定」,那麼一個只輸出 62 個 logits、不生成任何文字的 4.5B 模型,是可以合理評估的形態。如果你的問題涉及長文件、超過八張圖片,或有任何需要用文字解釋答案的需求,那麼這個依原樣交付的檢查點就是錯誤的工具,而供應商在基準測試上再怎麼打磨粉飾,也改變不了這一點。