
Intern-Decision-0.8B 對比 LFM2.5 2.6B Base:自己動手打造的兩種方式
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
把 Intern-Decision-0.8B 和 LFM2.5 2.6B Base 放在一起看,第一個誠實的觀察是:兩者都不是買家通常所謂的那種產品。Intern-Decision-0.8B 是 InternLM 在 2026 年 9 月 26 日上傳到 Hugging Face 的檢查點,完全沒有發布公告——它是 Qwen3.5-0.8B 的 852,985,920 參數微調版本,會回答鍵入的問題,但不產生任何文字,以 Apache 2.0 授權釋出,附上的 GitHub 連結卻是 404。LFM2.5 2.6B Base 是 Liquid AI 的 26.9 億參數預訓練文字檢查點,於 2026 年 8 月 1 日發布,作為 LFM2.5 系列的基礎,而它自己的模型卡寫道,它「只建議用於需要大量微調的任務」。一個是完成品且範圍狹窄。另一個尚未完成且用途通用。兩者都假設做苦工的人是你——而這兩種苦工並不是同一種苦工。
那個區別就是這整場比較的核心,也正是單純的規格對照表會誤導人的原因。讀者真正心中的問題是「這幾個我該下載哪一個」,而答案取決於你需要打造的東西是決策層還是語言能力。那是兩個不同的專案,時程也各不相同。
每個模型交到你手上的內容
Intern-Decision-0.8B 以可運作系統的形式登場。此儲存庫隨附inference.py/、一個DecisionEngine/ 類別、一份有文件記載的請求結構描述與回應結構描述,以及一個只要安裝四個固定版本的 Python 相依套件後即可執行的實作範例。你提供一個狀態、一到十六個具名問題(每個最多 62 個選項),並可選擇性提供最多八張圖片,就會取回每個欄位經過校準的分布,以及 argmax 標籤。此引擎會在預先渲染好的骨架中固定位置讀取 logits,而不是生成任何內容,因此沒有解碼步驟、沒有輸出 token,也沒有需要修復的 JSON。它執行所需的檔案約為 1.73 GB。
LFM2.5 2.6B Base 帶給你的恰好相反:原始能力,卻沒有任何介面。它是一個純文字因果語言模型,具有 30 層,配置為 22 個雙閘控短卷積區塊與 8 個分組查詢注意力層,並在橫跨 16 種語言、約 34 兆個 token 上預訓練,詞彙量為 128,000 個 token,上下文視窗為 131,072 個 token。它本身沒有經過指令微調,模型卡上也沒有任務基準,因為基礎檢查點不會被評分——你用它所訓練出的模型才會。Liquid 自家的後訓練流程,正是把它變成具代理能力的 LFM2.5-2.6B 的關鍵,而那個流程,就是你被要求為自己的領域部分或完整重現的目標。
所以,軸線不是規模,而是取決於缺失的那一塊究竟是決策契約,還是訓練執行。
計分板,附帶但書
• 首次取得結果所需時間 — Intern-Decision-0.8B:一個下午,載入檢查點並呼叫 predict()/. LFM2.5 2.6B Base:則視你的持續預訓練或 SFT 訓練需要多久,再加上前置的資料準備工作而定。
• 參數量 — Intern-Decision-0.8B:852,985,920,分散於 1.50 GB 的語言分片、176 MB 的視覺分片與 25 MB 的投影器。LFM2.5 2.6B Base:2.69B,權重約 2.5 GB。
• 輸入模態 — Intern-Decision-0.8B:文字加上最多八張圖片,且儲存庫中帶有視覺權重。LFM2.5 2.6B Base:依設計僅限文字——LFM2.5 系列的多模態相關工作都在 VL 變體中。
• 實際情境 — Intern-Decision-0.8B:8,192 個 token,遭到拒絕而非截斷,儘管設定中的最大位置嵌入為 262,144。LFM2.5 2.6B Base:原生 131,072 個 token。
輸出 — Intern-Decision-0.8B:每個欄位各有一個校準過的機率分布與 argmax 標籤,具確定性。LFM2.5 2.6B Base:續寫文字,取樣。
• 基準測試 — Intern-Decision-0.8B:一份涵蓋七項基準測試的完整廠商表格,無人能重現。LFM2.5 2.6B Base:就基礎模型本身而言,基於設計考量,未發布任何結果。
• 授權條款 — Intern-Decision-0.8B:Apache 2.0,並保留LICENSE-QWEN/ 以供上游權重使用。LFM2.5 2.6B Base:LFM Open License v1.0。

授權列值得有自己的區段
兩張卡片都寫著「open」,但這兩個詞的實際含義大不相同。Intern-Decision-0.8B 採用 Apache 2.0——沒有營收條件、沒有限制使用領域,也沒有需要另行協商的商業授權。儲存庫中的第二個授權條款檔案是沿用下來的 Qwen 授權條款,因為該模型是 Qwen3.5-0.8B 的衍生作品,這是正確的處理方式,而非一項限制。
LFM2.5 2.6B Base 係依據 LFM Open License v1.0 發佈,而該授權條款第 5 條值得在任何商業計畫倚賴它之前完整閱讀。針對 Commercial Use 所授予的權利,以你或你的法律實體未超過該授權條款所定義之門檻為條件;該門檻為年營收達 1,000 萬美元或以上。超過該界線時,本作品或其衍生作品的商業使用即不依本協議獲得授權。非營利與研究用途則另獲豁免。這是一道真實且可執行的界線,而且由於它也附隨於衍生作品,因此會延伸到任何你從該基礎模型微調而成的成果——而這正是此檢查點的全部預期用途。
這裡有一個直截了當的解讀:如果你正在進行商業開發,而你的實體年營收突破 1,000 萬美元,那麼無論 LFM2.5 2.6B Base 和 Intern-Decision-0.8B 的表現如何,前者都不是與後者同類的資產。如果你未達門檻、正在進行研究,或為了非商業目的進行微調,這項區別就不會造成影響。無論如何,這都是要在訓練開始之前、而非之後回答的問題。
其中每一個實際上才是正確的下載項目
當你需要的能力在現成模型中尚不存在時,LFM2.5 2.6B Base 就是正確的選擇。Liquid 的模型卡明確列出了預期的使用情境:例如日語等特定語言的助理、例如醫療等特定領域的助理、在你無法傳送到 API 的專有資料上進行訓練,或實驗新穎的後訓練方法。這份清單背後的道理是:34 兆個 token 的多語言預訓練成果,重現起來所費不貲,繼承下來卻幾乎不花成本——你買到的是一個已經精通 16 種語言與 128K 上下文的起點,並把自己運算資源花在專屬於你的部分上。
對這麼新的模型來說,該計畫的生態系支援異常完整。Liquid 記載了透過 Unsloth 與 TRL 進行的持續預訓練、SFT、DPO 與 GRPO,並為每一項提供 notebook;而該檢查點也獲得 Transformers、vLLM、SGLang、llama.cpp、MLX 與 LM Studio 支援。那不是行銷文案——而是本週就能微調的基礎模型,與得花兩週把它黏進訓練器裡的模型之間的差別。
Intern-Decision-0.8B 是正確的選擇,當你所需的能力已然存在,而問題在於它的形態。如果你的任務是答案集封閉的有限決策——將這張工單路由、為這筆理賠評分、依評分標準將這筆紀錄分類——那麼生成式模型是取得標籤的笨拙方式,而基礎模型根本無法取得標籤。你要的是能回傳分布、告訴你其信心水準,且每次都在同樣 34 毫秒內完成的東西。InternLM 在單張 RTX 4090 上測得的延遲為平均 33.98 毫秒、p95 為 37.50 毫秒,而這張卡本身的數據顯示 2B 同系列模型平均為 33.28 毫秒——提醒我們在這樣的提示長度下,成本在於讀取結構描述,而非執行權重。
你正在做的取捨,是用彈性換取一份合約。基礎模型最終可以變成任何東西,只要你有資料和運算資源。決策頭已經就是那個東西,而且永遠不會變成其他任何東西。如果你的結構描述每個月都改變形狀,那是實實在在的成本。如果不會,那根本不是成本。
關於 Intern-Decision 表格,沒有人能告訴你的事
Intern-Decision-0.8B 的每一項效能數字都是廠商自行提報的,而這裡的警語比平常更重,因為這個版本發布才一週,且完全沒有文件記錄。沒有論文,沒有彙整三種規模的合集,沒有可運作的 GitHub 儲存庫,也沒有獨立評估。在 Artificial Analysis 上搜尋,也找不到這個模型的任何資料。
InternLM 選定了基準測試,也選定了比較模型——這批模型以決策模型為大宗,包括 TypeSafe 的 Jev、Convai 的 Laya 與 Kev——然後在沒有發布貼文的情況下公布了這張表格。

帶上這個標籤之後,這個形狀仍然值得一讀。Intern-Decision-0.8B 在三個 Jevbench 切分上分別拿下 97.92 / 80.56 / 52.25,在 Typed Decision 上為 77.35,在 ToolACE 上為 94.52,平均 79.38。它的校準概況是最有意思的一筆:Brier 為 0.530、期望校準誤差為 0.066,儘管 Brier 較差,ECE 卻優於 Jev 的 0.095。用白話說,它比較不準,但對自己有多準更誠實,而對一套以閾值為基礎的工作流程來說,這個排序比平均值更重要。真正該讓部署喊停的那一欄,是 WildJailBreak 的 64.48,對比 Jev 的 96.29。如此巨大的拒答穩健性缺口,是這次微調本身的性質,而它究竟屬於 Qwen3.5-0.8B 基礎模型、決策調校目標,還是參數量,卡上任何地方都沒有記載。
在這條軸線上,與 LFM2.5 2.6B Base 的比較並不是「誰的分數更高」,因為這個 base 根本沒有分數。而是:其中一個模型的數字未經審核,另一個模型的數字則根本不存在,而讀者在兩者之間做選擇,其實是在選擇要面對哪一種未知。
大多數人實際上最終會建構的管線
有一種同時運用兩者的組態,而且值得為它命名,因為多數生產系統最終都落在這裡。決策層負責處理封閉式呼叫——分流、路由、評分規則評分——在這些情境中,答案集合是已知的,延遲會在百萬筆記錄間不斷累積,而輸出 token 純屬額外負擔。語言層則處理所有需要成文表述、綜合歸納或長脈絡的事項:升級摘要、附在標籤上的說明、由人工編輯的草稿。LFM2.5 2.6B Base 是後半部分的合理基底,前提是你有值得用來訓練的領域資料;而決策頭則是前半部分的自然形態。
把兩者組合起來是最繁瑣的部分,而這也正是值得不必親手打造的部分。OrcaRouter 的路由 DSL 將路由表達為程式碼——帶有 CEL 條件的 YAML,無需重新部署即可上線——因此,把某一類請求送往決策端點、另一類送往語言模型的管線,就只是一條路由規則,而不是你得自行維運的負載平衡器。這個閘道以單一 OpenAI 相容金鑰涵蓋 200+ 個模型,並以零加成直接透傳供應商的定價,而且不會在你所選的模型上加收任何加成。把界線說清楚:Intern-Decision-0.8B 和 LFM2.5 2.6B Base 都不是我們的——兩者都是你自行下載並在本機執行的檢查點,而這兩種情況下重點正在於此,因為選擇 2 GB 模型的理由,就是它能跑在你的資料原本所在的地方。閘道的用途,則是處理那半邊你原本得向外呼叫的技術堆疊。
如果決策層是你想測試的部分,又不想為此投入一次訓練運行,那麼託管的決策模型是更省錢的實驗方式,而TypeSafe 的 Jev 1.13 正是 InternLM 用來做基準測試的那一款 —— 如今可透過單一 OpenAI 相容端點呼叫,每百萬輸入 token 收費 $0.042,輸出則計費為零。

那麼,是哪一個呢?
如果該能力尚不存在,而且你同時擁有領域資料與進行微調的意願,就選擇 LFM2.5 2.6B Base;在你將其商用之前,先確認 LFM Open License 中的 $10M 營收門檻。如果該能力已存在、答案已經可以在你的提示中逐一列舉,而且你需要的是快速、確定性、授權乾淨的方式來取得標籤,就選擇 Intern-Decision-0.8B——同時要接受它的文件從缺、基準測試未經審核,而且它在對抗性輸入下的拒絕行為尚未被調校它的實驗室以外的任何人測試過。第二個是較短的路徑,也是較大的未知。第一個是較長的路徑,也是文件較完整的那個,而這兩項事實都不等同於更好。
