一張主視覺標題卡,寫著「Intern-Decision-0.8B」,副標題為「悄悄發布,未經公告」,並帶有徽章「無論文、無儲存庫、無發布貼文」與「852,985,920 個參數,磁碟佔用 1.73 GB」,角落合成 OrcaRouter 標誌。
Guides & Insights

Intern-Decision-0.8B 無預警登場:InternLM 悄悄在 Hugging Face 上架了什麼

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

模型卡上的 GitHub 連結回傳 404。示範 Space 回傳 401。沒有任何收藏集、部落格文章、技術報告,也找不到任何搜尋結果——只要搜尋字串「Intern-Decision」,出現的全是實習職缺——然而 Intern-Decision-0.8B 現在就放在 Hugging Face 上,是一個完整、可下載、Apache-2.0 的檢查點,微調自 Qwen3.5-0.8B,於 2026 年 9 月 26 日凌晨上傳,同一個三分鐘內還出現了兩個更大的同系列模型:Intern-Decision-2B 和 Intern-Decision-4B。InternLM 以前就用這種方式發布過,這也是為什麼以下所有內容都是從儲存庫本身整理而來,而非來自發布貼文。這個區別在這裡比平常更重要:儲存庫告訴你存在什麼,只有廠商能告訴你它的用途是什麼。

這個儲存庫確切說明的內容,詳細來看,奇特到值得一讀。這些不是聊天模型,也不是通常意義上的小型語言模型。Intern-Decision-0.8B 接收一份狀態、一份你事先寫好的具名問題結構描述,以及可選的最多八張圖片,並在一次前向傳遞中回傳每個問題的答案分布。它從不呼叫 generate()。它從不取樣。沒有需要解析的文字輸出,沒有需要修復的 JSON,也沒有圍繞著一個從未閉合的大括號打轉的重試迴圈。這種狹隘性就是整個架構,而這讓此模型與 TypeSafe 的 Jev 1.13 和 Convai 的 Laya 同屬一個小眾類別——InternLM 顯然刻意以這個類別作為基準比較,因為 Jevbench 是 TypeSafe 自家的基準測試,而且它是表格中的第一欄。

以下是可從檢查點得知的內容、僅由檢查點宣稱的內容,以及目前 InternLM 外部任何人都完全無法斷言的內容。

儲存庫裡實際上有什麼?

這張模型卡簡短,且對其來源血統相當坦誠。Intern-Decision-0.8B 被描述為「一個以 Qwen3.5-0.8B 微調而成的多模態結構化決策模型」——Qwen 基礎模型於 2026 年 2 月 28 日發布——而該儲存庫在 Apache-2.0 條款之外還附帶了第二份授權檔案 LICENSE-QWEN,這正是衍生模型應該做的事,本身也是一個微小的誠實訊號。Hugging Face 的索引指出,該模型共有 852,985,920 個參數,分散於三個分片:一個 1.50 GB 的語言分片、一個 176 MB 的視覺分片,以及一個 25 MB 的投影器。若計入分詞器檔案,儲存庫總儲存容量約為 1.73 GB,這使得整個模型能輕鬆放進單一張消費級 GPU 或規格充足的筆電中。

這份設定檔揭露的架構,是 Qwen 在 3.5 世代中持續採用的設計,而非針對特定需求打造的決策網路。它是一個 Qwen3_5ForConditionalGeneration,以 24 層構成,並以三層線性注意力對上一層全注意力的模式反覆排列;隱藏層大小為 1,024,8 個注意力頭對上 2 個鍵值頭,頭維度為 256,最大位置嵌入為 262,144 個詞元。其中保留了一層多詞元預測層。視覺路徑並非虛設:模型卡的文字說明了影像處理能力,處理器可接收影像,而檢查點也附帶了視覺塔與投影器來支援這項功能——因此該倉庫上的多模態標籤是有權重作為後盾,而不只是標籤而已。

這個家族全貌值得注意,因為它會影響我們如何解讀其他一切。InternLM 在 40 秒內上傳了三種規模:0.8B、接著 2B、然後 4B。參數量分別是 852,985,920、2,213,241,664 和 4,539,265,536。4B 模型的模型卡多了一個區段——一項包含 96 個案例、附有校正前後分數的已知分佈校準先導測試——而 0.8B 的模型卡沒有。這種不對稱並非小型模型有缺陷的證據;而是證據顯示,小型模型的文件是在較短的預算下寫成的,而這正是安靜發布會呈現的樣子。

推論路徑的實際運作方式

隨附的 inference.py 是 repo 裡最具資訊價值的檔案,因為它記錄的是一份契約,而不是一段提示詞。流程運作如下:

• 您提供一項請求,其中包含 state(被評判的事物)、questions(結構描述),以及選填的圖片。

• 每個問題的選項都會對應到單一詞元符號——從 A 到 Z,接著是小寫字母,然後是數字,每個問題最多可有 62 個選項。

• 系統提示、狀態、綱要與完整的助理 JSON 骨架,會為每個欄位各渲染一個 <decision> 佔位符。

• 執行一次因果前向傳遞。Logits 會在每個佔位符緊鄰前的位置讀取。

• 僅對該欄位允許的候選符號取 softmax,套用檢查點的校準,並將符號映射回你原本的選項值。

引擎提供三種問題類型。choice 接受一個有序物件,將選項值映射到描述。score 接受一個列表——它會變成字串值 "0"、"1"、"2" 等等——或一個具有有限數值字串鍵的有序物件,讓模型能回傳機率加權的期望值,而不只是一個類別。noul 是一種二元決策,其中「否」排在「是」之前。回應會針對每個欄位回傳經校準的機率分布、等於最大候選機率的信心值、採用字典序打破平手後的 argmax 決策,而對於 score 問題,還會回傳期望數值與圖例。限制是明確的:每個請求一到十六個問題,每個問題最多 62 個選項,預設輸入上限為 8,192 個 token,超過時會被拒絕而非截斷,且最多八張圖片,其 token 會計入該上限。

那份清單中有兩個細節值得注意,因為它們決定了你是否能信任輸出結果。第一個是提示中不會插入任何標準答案——模型是在為自己尚未看過答案的候選項目評分。第二個是 usage.output_tokens 不是文字 token 的計數;它計算的是已評分的欄位。任何把這接進現有 token 預算計算的人,都會對這點感到意外,而說明卡上明白寫了出來,而不是留待使用者自行發現。

A single-column scoreboard headed 'Intern-Decision-0.8B — the scoreboard' listing parameters of 852,985,920 across three shards, a repository of about 1.73 GB under Apache 2.0 plus LICENSE-QWEN, an inference path of one causal forward pass with no generate() and no sampling, RTX 4090 latency of 33.98 ms mean and 37.50 ms p95, calibration at Brier 0.530 and ECE 0.066 with a fitted temperature of 2.747760550703, a suite average of 79.38 across seven benchmarks, and WildJailBreak at 64.48 against Jev's 96.29, with a footer noting every figure is vendor-reported and unreproduced.

基準測試表,以及該相信它多少

讀者請留意本節:以下每個數字都是廠商自行提報且未經重現的。InternLM 挑選了基準測試、選定了比較模型、執行了評估,並公布了這張表。在任何公開排行榜上,都沒有 Intern-Decision-0.8B 的獨立執行結果,而在 Artificial Analysis 上搜尋該模型也完全查無資料。這並不代表這張表是假的,而是代表它未經稽核,也意味著這些欄位最適合用來解讀結果的樣貌,而非其水準。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

• Jevbench,三個切分——Intern-Decision-0.8B 在 Easy 上拿下 97.92,在 Original 上拿下 80.56,在 Hard 上拿下 52.25。TypeSafe 的 Jev 在相同切分上則為 100.00、98.61 和 72.07。

• Typed Decision — 0.8B 獲得 77.35 分,Jev 則是 73.35 分。這是唯一一欄,由此領域中最小的模型擊敗該基準測試以其命名的模型。

• ToolACE — 0.8B 為 94.52,Jev 則為 91.29。ToolACE 是函式呼叫基準測試,而一個在工具選擇上勝過 Jev 的決策頭,是表中最具實質意義的主張。

• AG News — 88.61,相較於 Jev 的 89.57。在四類主題分類上,實際上已與這個類別的前沿水準持平。

• WildJailBreak — 64.48,相較於 Jev 的 96.29。這就是崩潰。可以說,對於你會拿來處理不受信任輸入的模型而言,這是最重要的一欄,也是 0.8B 距離參考值最遠的一欄。

• 平均值 — 0.8B 為 79.38,自家的 2B 同系列為 84.68,4B 為 90.02。這個系列攀升得很陡,而這正是你會預期的結果,本身也是個溫和的論據,說明這張表並非為了吹捧旗艦型號而逆向推導出來的。

• 校準 — 0.8B 的 Brier 分數為 0.530,期望校準誤差(ECE)為 0.066。Jev 回報的是 0.358 與 0.095。把這兩個數字放在一起解讀,會比單看任何一個數字浮現出更清晰的圖像:就 ECE 的意義而言,0.8B 的校準比 Jev 更好——它自陳的信心更貼近其實際準確率——但整體準確度明顯較低。這對一個刻意擬合過溫度的小型模型來說,是合理可能的樣貌,而且這不是一組適合在無意間發表出來的體面組合。

這組比較有一個顯眼的特點:它由決策模型主導。Jev、Laya、SemIf、Kev 和 JevK5 全都出現;這張表本身的基準測試是 TypeSafe 的。InternLM 選擇在競爭對手的地盤上接受衡量,使用競爭對手的測試框架,然後公布了它最小的模型落敗的那些欄位。這是團隊在沒有圍繞這次發布規劃行銷活動時會做出的那種決定——這與這次發布方式的其餘一切相符。

校正溫度是最有趣的數字

Intern-Decision-0.8B 所擬合的預設溫度為 2.747760550703,其方式是對 1,728 個指定校準案例進行 NLL 最小化,並使用 1,693 個獨立驗證案例。該卡片明確指出,並未使用測試套件標籤來選定此數值。所套用的轉換為 p = softmax(candidate_logits.float()),其後為 calibrated_p = softmax(log(p) / T)。

那是候選機率校準,不是取樣溫度,而這個區別並非吹毛求疵。因為該轉換是在 softmax 之後套用,且會保留排序,所以它完全無法改變 argmax 決策。它會改變信心、noul yes 機率,以及分數問題的期望值——並讓主要決策保持不變。如果你的工作流程讀取的是標籤,溫度就毫無作用。如果你的工作流程讀取的是機率——對它設閾值、依它排名,或將它饋入下游的期望值計算——那麼溫度就是一個有意義的數字和一個沒有意義的數字之間的差別。傳入 temperature=1 會傳回未校準的分布,對任何想在其上套用自己校準的人來說,這是一個有用的逃生口。

溫度是依每個檢查點個別擬合,而非共用。4B 模型使用不同的值 1.99241824,而模型卡指示你使用隨所下載尺寸一併提供的推論模組,以使其預設校準相符。任何人若把某個同系列模型的推論封裝器複製到另一個模型,都會在不知不覺中套用錯誤的溫度。

三十四毫秒,以及一個本不該出現的結果

InternLM 使用本機 Hugging Face 路徑,在單張 RTX 4090 上測量了每次查詢的端到端延遲——這是真實測量,但同時也是可能最慢的服務配置,因為正式部署會採用編譯或批次處理的執行環境。Jev 列出的數據為平均值 109.70 毫秒、中位數 106.30 毫秒,p95 為 146.70 毫秒。Intern-Decision-0.8B 則測得 33.98 / 33.44 / 37.50 毫秒。

值得停下來細看的數字是 2B 版本:平均 33.28 毫秒,中位數 33.15 毫秒。2B 更快,相較於 0.8B,其差距小到可能只是雜訊,但方向卻不是參數量所預測的那樣。這不是表格中的錯誤,而且實際上也不是關於模型本身的問題。決策模型對提示恰好進行一次前向傳遞,而提示長度是由狀態、結構描述與選項描述所決定——不是由模型寫出的任何內容所決定,因為模型什麼都不寫。對於處於這種情況的提示,提示處理佔主導地位,而參數量只是二階成本。實際影響是,通常會想選用最小檢查點的理由——你是在按 token 付費——在這裡並不適用。選擇 0.8B 而非 2B 的真正原因是記憶體佔用量,以及它的整個儲存庫僅佔 1.73 GB,而不是吞吐量。

目前尚無法確定的是什麼

這就是發布貼文本來會回答、而儲存庫無法回答的部分。

目前沒有公布發布日期,沒有公告,InternLM 的公開頻道上也沒有任何描述這個系列家族的內容。模型卡上印的 GitHub 網址無法開啟。卡片中提到的示範 Space 並非公開可讀取。沒有任何 collection 收錄這三個 checkpoint,這意味著要找到 2B 或 4B 的唯一方法,就是去看該組織的模型清單。沒有論文,因此訓練資料、微調配方、訓練步數,以及「決策微調」(decision tuning)在權重中修改了什麼,全都未加說明。沒有獨立評估,沒有第三方延遲重現,也沒有任何證據顯示 InternLM 以外的人曾執行過該 checkpoint。

這份模型卡還提出兩個未經回答的問題。第一個是 WildJailBreak 差距在實務上代表什麼:如此規模的拒答穩健性缺口是微調本身的特性,而它究竟反映的是基礎模型、決策調校目標,還是參數量偏小,這並不是儲存庫會告訴你的事。第二個是達到輸入上限時會發生什麼。超過 8,192 個詞元的請求會被拒絕,而非截斷,這對評分模型而言是正確的行為,但這也意味著實際的上下文視窗並不是設定所宣稱的 262,144 —— 而是能在 8,192 個詞元內塞進多少狀態、結構描述、選項與影像區塊。對於結構描述豐富的長文件,這個上限會比架構圖所暗示的更早到來。

它的定位,以及如何在不押注於它的情況下試用它

誠實的說法是,Intern-Decision-0.8B 是一個已發布的檢查點,其宣稱未經審核,且沒有佐證文件。這樣的組合並不是忽視它的理由——一份以 Apache-2.0 授權發布的權重,讓你可以在一個下午內下載並實測,這比排隊等候的 API 情況更好——但這確實意味著驗證的重擔落在你身上。該引擎從本機目錄載入,可在 4090 等級或更小的 GPU 上運行,而模型卡提供了一個可直接貼上的現成請求範例。用你自己標註的案例評估一天,會比供應商的表格更能讓你了解 WildJailBreak 那一欄。

如果你要評估的是決策層,那麼有用的比較對象會是代管式的服務。 TypeSafe 的 Jev 1.13 正是 InternLM 用來作為基準比較的模型,而且它現在就能透過單一 OpenAI 相容端點呼叫,每百萬個輸入權杖收費 0.042 美元,輸出則完全不計費——這與供應商公布的價格相同,因為 OrcaRouter 以不加價的方式直接轉嫁供應商的定價,而不是在其上額外加收利潤。把自行架設的 0.8B 決策頭與代管式決策 API 放在同一把金鑰上、在同一個下午完成,會是比為了回答同一個問題而串接兩份各自獨立的合約便宜得多的實驗。

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

能改變這個情況的不是基準測試,而是 GitHub 儲存庫出現、InternLM 公布調校配方,或該檢查點的第一個獨立執行結果登上排行榜。在上述任何一件事發生之前,對 Intern-Decision-0.8B 最準確的描述既狹隘又不討喜,卻完全對它有利:權重是真的,推論合約的文件記錄得比大多數已發布模型所能做到的更好,而且行銷還沒開始。