一張生成的標題卡,寫著「Intern-Decision-2B vs Gemma 4 12B」,副標題為「8,192 個 token 對上 256,000」,並帶有「一個會拒絕的評分器」與「一個會寫作的通用模型」兩個徽章,角落還合成了 OrcaRouter 的標誌。
Guides & Insights

Intern-Decision-2B 對比 Gemma 4 12B:8,192 個 Token 的上限,對上 256K 視窗

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

假設你需要判讀的東西是一份四十頁的保險理賠檔案。internlm/Intern-Decision-2B會直接拒收。不是截斷,也不是摘要——而是拒收,因為隨附的推論引擎宣告 DecisionEngine(max_length=8192),而模型卡明白寫著過大的輸入會「未經截斷即遭拒絕」。google/gemma-4-12B-it——Gemma 4 12B Unified——會收下同一份文件,外加釘在上面的掃描照片,外加電話錄音,然後替你寫出答案。這個對比就是整個比較的重點,而它幾乎與參數量——2,213,241,664 對上 11,959,730,224——毫無關係,那些是單看規格表會最先注意到的數字。

Intern-Decision-2B 是 InternLM 於 2026 年 9 月 26 日在未發布公告的情況下上傳至 Hugging Face 的三個決策檢查點中,位居中間的那一個;它是從 Qwen/Qwen3.5-2B 微調而來,以 Apache-2.0 授權,並同時保留 Qwen 條款。Gemma 4 12B Unified 則是 Google DeepMind 於 2026 年 5 月推出的無編碼器多模態模型,這是一個任意對任意系統,可接收文字、圖像、音訊與影片,並在 256,000 個 token 的視窗內以超過 140 種語言生成文字。其中一個是評分器。另一個是通用型模型,只要你仔細地提示它,它恰好也能把評分做得很差。在兩者之間做選擇,與其說是基準測試問題,不如說是一個關於你的答案本身已經是什麼形狀的問題。

在兩者實際上無法相比的情況下

在攤開數字之前,這件事值得把話說白,因為這個對戰組合容易引來一種虛假的對稱。

Intern-Decision-2B 不會產生任何符元。它接收一個狀態、一到十六個具名問題(每個問題最多可有 62 個選項),以及可選的最多八張影像;渲染出一個助理 JSON 骨架,其中每個欄位各有一個 <decision> 佔位符;執行單次因果前向傳播;讀取每個佔位符緊接在前之位置的 logits;僅對該欄位的合法符號進行 softmax;並套用擬合溫度 2.100509348278。輸出是校準後的分布,以及每個欄位的 argmax。模型卡直接寫明了否定事項:「此 API 執行結構化候選評分。它不會呼叫 generate() 或取樣自由形式的文字。」

Gemma 4 12B 會生成。它所做的一切——以可設定的思考進行推理、函式呼叫、OCR、圖表理解、語音辨識、涵蓋 140 種語言——都是透過在一個有 262,144 個條目的詞彙表上執行解碼迴圈來完成。要求它做出帶有機率的路由決策時,你得到的會是一段包含數字的文字,而那個數字將是取樣器所產生的任何結果,而不是對你的選項集合做 softmax 的結果。

所以,實務上的問題不是「哪個更準確」,而是「我的答案是否已經是一個封閉集合?」如果是,12B 就是一種從清單中挑選的浪費做法。如果不是,Intern-Decision-2B 無論準確率是多少都完全幫不上你。

輸入上限是兩者之間最銳利的分界線。

這個面向必須優先於所有其他面向來權衡,因為它造成的是硬性失效,而不是降級後的失效。

• {{1}}輸入長度{{/1}} — Intern-Decision-2B 可接受 8,192 個詞元,超過則拒絕;Gemma 4 12B 可接受 256,000 個詞元,且在 Google {{2}}自家的模型卡{{/2}}上,於 128k 脈絡下的 MRCR v2 八針測試中得分為 43.4%。

• 圖像 — Intern-Decision-2B 最多八張,且它們計入相同的 8,192 個 token 預算;Gemma 4 12B 則支援可變長寬比和解析度,並能以任意順序交錯輸入文字和圖像。

• 輸入模態 — 其一為文字與圖像;另一則為文字、圖像、音訊與視訊。

• 語言 — Intern-Decision 的文件中並未提出任何多語言相關的主張;Gemma 4 涵蓋超過 140 種預訓練語言,其 12B 版本在 MMMLU 上取得 83.4 的多語言評測分數。

• 輸出 — 一個是具型別的 JSON 答案分佈;另一個是生成的文字。

8,192 這個上限並非任意訂定的,而這正是它難以繞過的原因。決策目標會針對每個欄位在固定位置讀取一個 logit,因此提示必須一次包含狀態、結構定義與完整骨架;沒有任何分塊策略能保有這份契約。一張工單、一封電子郵件、一段簡短的 JSON 狀態、一兩張螢幕截圖——那才是設計核心。需要檢索的文件,就是這個模型不適用的文件。

每一項讓你付出的代價,誠實計算

Intern-Decision-2B 沒有代管端點,也沒有供應商。OrcaRouter 為它設立的模型頁面會回傳 404,而本文任何內容都不構成可用性聲明。要呼叫它,就意味著得下載約 4.46 GB 的儲存庫——一個 3.76 GB 的語言分片、一座 612.5 MB 的視覺塔、一個 50.3 MB 的投影器——並在權重旁邊執行 inference.py,環境為 Python 3.12,搭配 torch 2.9.1 與 transformers 5.14.1,且得用上你無論它是否正在評估決策都照樣付費的 GPU。

這並非在所有情況下都是缺點,而且值得實際算一算,而不是憑假設。根據 InternLM 自身的量測,在單張 RTX 4090 上,每次請求平均 33.28 毫秒,而本機託管的 Intern-Decision-2B 每次決策不產生任何費用。託管的通用型模型則按 token 計費,包括它在回答前思考所花費的 token。在大規模使用時,你已經擁有的評分器是更便宜的工具——成本在於 GPU 與工程,而不是呼叫本身。

Gemma 4 12B Unified 同樣不在我們的型錄中;如果你想要它,就得自行取得 11.96 億個 BF16 參數並自行部署。我們的型錄真正提供 Gemma 4 路由的地方,是另外兩個尺寸,而且價格便宜:Gemma 4 26B A4B 每百萬輸入 token 為 $0.06、每百萬輸出為 $0.33,Gemma 4 31B 則為 $0.13 與 $0.38,兩者都列出 262,144 token 的上下文,而型錄顯示的 P50 首 token 時間為 1.73 秒。如果你的問題到頭來屬於一般推理,而非封閉集合式的決策,那麼這就是該拿來與本機端執行的評分器相比較的東西——同一把金鑰上再多兩個模型,供應商定價原價轉嫁、不加價,以及自動容錯移轉,如此一來,你還在評估的模型就永遠不會成為生產路徑中的單點故障。

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

計分板,附帶但書

• 參數 — Intern-Decision-2B 2,213,241,664(BF16),加上一個視覺塔和投影器;Gemma 4 12B Unified 11,959,730,224(BF16)。

• 上下文 — 8,192 個 token,上方已遭拒,對比 256,000 個 token。

• 輸出 — 校準後的機率與一個 argmax,不含文字;生成的文字,一次一個詞元。

• 模態 — 文字加上最多八張圖像,相對於文字、圖像、音訊與視訊輸入、文字輸出。

• 已發表的證據——一份七套件的廠商表格,平均為 84.68,Brier 分數為 0.437、ECE 為 0.100,實驗室外無人重現;一張 Google 評估卡,MMLU Pro 77.2%、GPQA Diamond 78.8%、AIME 2026 不使用工具時 77.5%,以及 LiveCodeBench v6 72.0,另有一份獨立列示顯示 Artificial Analysis Intelligence Index 為 14.2。

• 採用情況——2B checkpoint 只獲得一個讚和零次下載,相較之下,該家族自五月以來便已流通,其量化、微調與衍生版本數量達數百。

以不對稱的方式閱讀這些證據列,因為它們本來就是如此。Google 的數字已由第三方獨立索引並重現;InternLM 的數字則從未由實驗室以外的任何人跑過,尤其是那個校準數字,在它遇上外部測試集之前,都應被視為一項有充分記錄的意圖。誠實的總結並不是說廠商表格錯了,而是這兩欄並不具備同等的證據份量,而一份把 84.68 印在 77.2 旁邊卻不說明這一點的比較,是在誤導讀者。

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

這該怎麼處理?

當決策已真正塵埃落定、狀態能輕鬆塞進八千個 token 之內、你要的是一個可以設閾值的機率而不是一段還得自行解析的文字,而且你有硬體、也有意願去操作一個還沒有人支援的檢查點時,就選 Intern-Decision-2B。中間這個尺寸尤其是 InternLM 所推出三款中已公布校準最弱的一個——ECE 0.100,相較於尺寸只有它一半那款的 0.066,以及尺寸幾乎是它兩倍那款的 0.065——所以如果你要在這個系列裡挑選,2B 是那個該讓你自行擬合溫度參數的,而不是能開箱就信任的那個。

選擇 Gemma 4 12B——或者更實際地說,選擇我們實際路由的兩個 Gemma 4 尺寸之一——當輸入長度超過一頁時、當涉及音訊、視訊或非英語語言時、當答案必須被解釋而非僅僅被選出時,或者當你不想自己擁有推論堆疊時。12B 是具備原生音訊的 Gemma 4 模型中最小的;26B A4B 每個權杖啟動約四十億個參數,並且是進入該家族最便宜的方式。

而如果你實際上遇到的是一個附帶長文件的評分問題,這兩者都不是正確的工具:那是一個披著比較文章外衣的檢索問題。

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.