
Intern-Decision-2B 悄悄在 Hugging Face 上發布。其卡片上的 GitHub 連結剛剛不再回傳 404。
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
今天稍早,internlm/Intern-Decision-2B 的模型卡指向了三個可取得更多資訊的地方,而其中兩個已經失效:demo Space 回傳 HTTP 401,而github.com/internlm/Intern-Decision 對任何點擊的人回傳 404。截至 UTC 08:58,第二個連結背後的儲存庫已經存在——公開、已有三次提交,內含訓練程式碼、兩套推論後端、一份帶有 10,751 筆測試列的評估套件、一個 96 個案例的校準基準,以及重現指南。這是這個模型自 2026 年 9 月 26 日 UTC 05:36 出現在 Hugging Face 以來唯一改變的地方,而這樣就足以讓 Intern-Decision-2B 從「一個 README 無法存取的檢查點」變成「一個你可以實際檢視、據以重現,並且與之爭辯的檢查點」。
權重本身並未變動,也毫無模糊之處。Intern-Decision-2B 是一個 2,213,241,664 參數的多模態結構化決策模型,微調自 Qwen/Qwen3.5-2B —— 這個 2026 年 2 月 28 日的阿里巴巴基礎模型 —— 以 Apache-2.0 發布,並在其旁保留了上游 Qwen 授權條款作為 LICENSE-QWEN。它是 InternLM 在四十秒內推送的三種規模中的中間型號:Intern-Decision-0.8B 於 05:35:57,這一個於 05:36:19,而 Intern-Decision-4B 於 05:36:37。它們背後仍然沒有任何形式的公告。
中間這個尺寸之所以值得單獨一篇來談,是因為家族正是在這裡開始不再按牌理出牌。就 InternLM 自家公布的數字來看,它是三者中最快的,也是三者中校準得最差的,而在你下載任何四點五 GB 的東西之前,這兩件事都值得先弄明白。
哪些是已確認的,哪些又只是廠商在說?
兩個類別,而它們需要保持區隔。
已確認,因為這是一份檔案清單或 HTTP 回應:參數數量(2,592 個 F32 加上 2,213,239,072 個 BF16 權重);分片配置(一個 3.76 GB 的語言分片、一個 612.5 MB 的視覺塔、一個 50.3 MB 的投影器、約 4.43 GB 的張量,以及大約 4.46 GB 的儲存庫);授權條款組合;基礎模型;底層架構(一個 Qwen3_5ForConditionalGeneration,具備 24 層、隱藏層大小 2,048、8 個查詢頭對上 2 個鍵值頭、頭維度 256、三層線性注意力對一層全注意力的重複模式、一層保留的多詞元預測層,以及 262,144 個位置的嵌入上限);儲存庫的存在;以及 huggingface.co/collections/internlm/intern-decision 上的模型集合現在能解析並列出全部三個檢查點這件事實。
廠商自行報告且未經重現:每一項準確度數字、每一項延遲數據,以及校準溫度。沒有論文、沒有 arXiv 條目、沒有發布貼文、沒有更新日誌,也沒有獨立評估——搜尋字串「Intern-Decision」找不到任何與這個模型相關的內容。這個示範 Space 仍然回應 401,這表示它並非公開,而不是它故障了。2B 檢查點有一個讚、零次下載。InternLM 以外沒有人運行過它。

推論合約,依其發生順序
儲存庫中資訊最豐富的檔案並不是模型卡。而是 src/inference/engine.py,以及隨附的 inference.py(在 Hub 上),因為這兩者共同記載的是一份契約,而不是提示詞。
• 您提供狀態——被評判的素材——一個問題綱要,以及可選的最多八張圖片。一至十六個問題,每個最多 62 個選項。
• 每個問題的選項都會對應到單一詞元符號:A–Z,接著是 a–z,然後是 0–9。62 個選項的上限並非出於設計偏好,而正好是該合約所能定址的單一詞元符號數量。
• 系統提示、狀態、結構描述,以及完整的助理 JSON 骨架,每個欄位都會以一個 <decision> 佔位符渲染。檢查點的對話範本與空的思考區塊會保持原樣。
• 執行一次因果前向傳遞。Logits 是在每個佔位符緊接之前的位置讀取——不是在之後,也不是在生成的 token 上。
• 僅對該欄位的合法候選符號執行 softmax,套用檢查點的校準,然後將這些符號映射回你原本的選項值。
這張卡直言不諱地說明這是什麼:「這個 API 執行結構化候選評分。它不會呼叫 generate() 或取樣自由形式的文字。」一個 DecisionEngine(max_length=8192) 會拒絕過大的輸入,而不是將它截斷,因此無法容納的請求會大聲失敗,而不是悄悄遺失最後一段。後端清單也很誠實——backend="hf" 是預設值,也是 Hugging Face 儲存庫中唯一實作的後端;這點值得知道,因為 GitHub 發行版也隨附 XTuner 後端,而兩者在數值上並不相同。InternLM 自家的評估指南也這麼說:「Kernel 與 BF16 的差異可能會改變機率,偶爾也會改變標籤。」
中間的異常
把這三個檢查點並排放在 InternLM 自家的表格上,其形狀之怪異,本身就足以構成整篇報導。
• 七個測試套件的平均 — Intern-Decision-0.8B 79.38、Intern-Decision-2B 84.68、Intern-Decision-4B 90.02。依序排列,正如權重增長時所預期。
• 在單張 RTX 4090 上的延遲——0.8B 的平均延遲為 33.98 ms,2B 為 33.28 ms,4B 為 44.16 ms。中間尺寸是三者中最快的,差距小到在單一 GPU 上可能只是雜訊,但在平均值、中位數(33.15 ms)與 P95(33.55 ms)上均一致。
• Brier 分數,越低越好——0.530、0.437、0.347。隨大小呈單調變化,正如適當的評分規則通常如此。
• 期望校準誤差,越低越好——0.8B 為 0.066,這個 2B 為 0.100,4B 為 0.065。中間尺寸的最差,而且比大小只有它一半的模型還差。
最後一行才是有意思的地方,而擬合出的溫度只是佐證了它,而非解釋了它。每個檢查點都有自己的 NLL 擬合溫度:0.8B 為 2.747760550703,2B 為 2.100509348278,4B 為 1.992418。每一個都是在 1,728 個指定校準案例上擬合、並留出 1,693 個案例,透過在 [0.01, 100] 範圍內搜尋逆溫度、最小化負對數似然而來,且測試套件標籤被刻意排除在擬合之外。2B 的溫度介於它的兩個同系列模型之間,如果這個異常是擬合假象,這正是你預期的結果。但並非如此:擬合值隨規模單調變化,而校準後誤差卻不是。根據 InternLM 自己的量測,這個 22 億參數檢查點在告訴你它有多有信心時,是三者中最不可信的。
在把這當成結論之前,有兩點要注意。採用十個等寬分箱與最大機率信賴度的 ECE,在這張表所用的小型測試套件上是個雜訊很大的統計量——Jevbench-Hard 只有 111 題,所以整個 ECE 欄位全靠一百多道題目和一個分箱選擇。而且internlm/Intern-Decision-2B是三張卡中唯一沒有附上 4B 卡所具備的額外校準章節的那一張,所以這裡的文件是更少,而不是更多。請把 0.100 解讀為「該自行擬合溫度參數」的理由,而不是對權重下的定論。

這個儲存庫新增了什麼,以及它仍不揭露什麼
GitHub 發佈版本比模型卡更完整,而模型卡本身也已相當有資訊量——一個原本只打算產出論文附帶成品的實驗室,通常不會在訓練啟動器之外,還一併附上確定性校準產生器與雜湊驗證評估套件。
現在公開的內容包括:訓練程式碼與遮罩式下一詞元目標(真實答案符號只出現在標籤中,從不出現在輸入中;每個欄位的答案是由緊接其標記之前的 logit 預測,且所有欄位共享一次前向傳遞);七個準確度測試套件,附有經 SHA-256 驗證的雜湊值與列數;評分程式碼;溫度擬合與重放腳本,其中重放被斷言會改變零個決策;96 個案例的分布校準基準,包含其產生器與離線評分器;以及一個在回送位址上提供服務的瀏覽器示範,使用POST /v1/decisions(別名 /v1/jev)。
什麼被明確排除,用儲存庫自己的話來說:「訓練資料、私人校準/驗證紀錄、影像、準備管線,以及模型權重均未包含。」儲存庫完全沒有授權檔案,因此即使權重採用 Apache-2.0,程式碼的條款仍未載明。而校準分割的組成——是哪 1,728 個案例、來自何處——仍未揭露,這是唯一一項會限制 ECE 數值能被查核到什麼程度的遺漏。
我們實際會配送的尺碼,以及我們不配送的那一個尺碼
Intern-Decision-2B 並未上架 OrcaRouter。我們為它設立的模型頁面會回傳 404,我們也找不到任何為它提供的託管端點,因此這裡的任何內容都不應被解讀為可用性聲明。目前唯一能呼叫它的方式,就是下載檢查點,然後inference.py 與權重檔放在一起執行。
這對本文真正要談的決策很重要,因為一個無人代為服務的評分器,就是必須由你自行維運的評分器。如果你試圖做出的封閉集決策,在形態上與這個家族所做的工作相近——一個狀態、具型別的問題、經過校準的機率——那麼可比較的託管選項就是 TypeSafe's Jev 1.13,這正是 InternLM 刻意拿來做基準測試的模型,而且它在 OrcaRouter 上每百萬輸入 token 收費 0.042 美元,具備 65K 上下文,首個 token 時間的 P50 為 178 毫秒。

在本機執行一個 22 億參數的檢查點,跟呼叫一個代管的分類器,並不是同一筆採購,但它們是同一個問題;而能用同一把金鑰同時取用兩者,且供應商的定價以 0% 加成原樣轉嫁,這正是應該讓比較保持開放、而不是把架構押注在其中之一上的理由。
什麼會改變這幅景象?
三件事,依序。
InternLM 以外的人必須能夠重現 84.68 的平均分與 0.100 的 ECE,而現在讓這件事成為可能的正是那個儲存庫——這才是這裡真正的新聞。這項考試是公開的,而且經過雜湊驗證;唯一缺的是答案卷,而答案卷就是現在任何人都能下載的檢查點。
廠商需要說明這是做什麼用的。一個擁有可用訓練堆疊、已發布評估套件,卻沒有公告、程式碼沒有授權、也沒有託管端點的模型,讀起來就像是尚未拍板成為產品的研究發布。Apache-2.0 權重指向一種解讀;缺少的程式碼授權與 401 Space 則指向另一種。
而中間尺寸需要一個存在的理由。如果 2B 相對於 0.8B 的速度優勢確實存在但幅度有限,而且它的校準在 InternLM 公布的每一項指標上都是三者中最弱的,那麼對大多數讀者最誠實的建議,就是付出 2.6 倍的磁碟空間換取 4B,或者接受較小模型較弱的準確度。支持 2B 的理由,在於它剛好是「快之中的最快」——而這個理由比這個系列那種行銷式的框架所暗示的還要薄弱。
