
Intern-Decision-4B 對決 ContextPilot-8B:一個縮減上下文的模型,對上一個管理上下文的模型
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 584 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
選擇你的毒藥: internlm/Intern-Decision-4B拒絕讀取超過 8,192 個 token,而 tencent/ContextPilot-8B存在的目的正是為了在無界限增長的上下文中存活。它們屬於同一個大小級別,兩者都是 Qwen 基礎模型的微調版本,也都登上 Hub,沒有廠商公告,也沒有任何形式的獨立評估——ContextPilot-8B 於 2026 年 8 月 27 日,Intern-Decision-4B 於 2026 年 9 月 26 日——而且它們解決的是相反的問題。Intern-Decision-4B 是一個 45 億參數的結構化決策模型,會執行一次前向傳遞、讀取 logits,並針對你提出的每個問題回傳一個經過校準的機率;它從不寫出任何 token。ContextPilot-8B 是一個 81.9 億參數的文字生成器,經過訓練,能在長時間代理執行期間規劃、記住並卸載自身的工作上下文。比較它們其實不是基準測試問題。而是關於你寧願讓模型吞下你問題的哪一半的問題。
首先,他們真正共有的共同點
這兩個模型都沒有任何一個數字是自身實驗室以外的人驗證過的。這件事很不尋常,值得先說在前頭,因為這個部落格上的大多數比較,至少還能倚賴獨立排行榜來支持其中一方。
Intern-Decision-4B 在其模型卡上公布了一整份評估表——七個資料集平均達 90.02、Brier 分數為 0.347、期望校準誤差為 0.065——而這一切全都是 InternLM 用自家測試框架測出來的。ContextPilot-8B 則完全沒有公布任何表格。它的模型卡只說該框架「在各式基礎模型與基準上皆持續優於現有基線」,並指向一篇論文和一套評估流程以了解細節。所以針對這組對比,誠實的來源交代其實很短:一方是廠商自行報告且未經重現,另一方是廠商自行宣稱且未公開發表,而本頁沒有任何內容是獨立驗證的。

這兩個賭注,直白地說
Intern-Decision-4B 的賭注是,決策的難處不在於推理,而在於做出承諾。給它一個狀態、一份具名問題的結構描述,以及最多八張圖片,它就會回傳一個分布,涵蓋你自己定義的選項字串。推論程序是確定性的,且形狀固定:把選項對映到單一詞元的符號,渲染出一個助手 JSON 骨架,每個欄位各有一個佔位符,執行一次因果前向傳遞,在每個佔位符正前方讀取 logits,只對該欄位的候選項做 softmax,再套用擬合後的溫度。沒有解碼迴圈,所以沒有解析器,也沒有自由文字幻覺的介面。這個賭注的代價是硬性輸入上限——規格卡上寫著,輸入若超過 DecisionEngine(max_length=8192)就會被「未經截斷即逕行拒絕」。
ContextPilot-8B 的賭注則是鏡像的另一面:讓代理繼續產生 token,但教它編輯自己正在攜帶的內容。它把規劃、結構化長期記憶、檢索與軟性上下文卸載加入代理的工具集,接著用一套 RL 配方訓練該檢查點,這套配方會針對真正重要的上下文編輯決策取樣分支,並在動作層級而非軌跡層級分配信用。這張模型卡坦率說明了封裝上的後果:載入檢查點並不會讓你獲得上下文管理能力。工具定義、代理執行環境與評估流程都存在於別處,必須一併帶上。
計分板,逐一維度
• 輸出 — Intern-Decision-4B 完全不輸出任何文字,只會針對你的選項值提供機率;ContextPilot-8B 則正常生成,其回答是散文與你必須解析的工具呼叫。
• 輸入上限 —— Intern-Decision-4B 拒絕超過 8,192 個 token 的任何內容;ContextPilot-8B 繼承 Qwen3-8B 的 40,960 token 位置限制,並設計成在有效上下文增長時仍能持續運作。
• 參數 — Intern-Decision-4B 為 4.54B BF16,涵蓋文字塔、視覺塔與投影器;ContextPilot-8B 為 8.19B BF16,是一個純密集的 Qwen3 因果語言模型。
• 延遲 — 根據 Intern-Decision-4B 自身的模型卡,它在單張 RTX 4090 上平均執行時間為 44.16 毫秒,P95 為 44.60 毫秒;ContextPilot-8B 未公布任何延遲數據,而且其成本在本質上不同,因為它是在生成 token,而不是對 token 進行評分。
• 圖像 — Intern-Decision-4B 最多可接受八張,而圖像 token 會計入 8,192 的上限;ContextPilot-8B 的模型卡描述的是文字生成檢查點,沒有多模態路徑。
• 授權條款 — Intern-Decision-4B 採用 Apache-2.0,並在其旁保留上游 Qwen 授權條款;ContextPilot-8B 的授權條款以第 0 節開頭:「僅為科學研究與發展之目的提供。您不得將其用於任何其他目的。」
• 已發表的證據 — 一側是附有校準診斷的七組表格;另一側是論文摘要,以及指向評估儲存庫的指標。
• 往績——兩者都靜悄悄。Intern-Decision-4B 自 2026 年 9 月 26 日以來顯示一個讚和零次下載;ContextPilot-8B 自 2026 年 8 月 27 日以來有 11 個讚和約一千次下載,這雖然獲得較多關注,但仍無第三方評估。

每一個實際上在哪裡出問題
Intern-Decision-4B 的失效模式是結構性的,值得具體說明這一點。如果一項決策的證據放不進 8,192 個 token,模型不會優雅降級——它會拒絕請求。這是站得住腳的工程選擇,卻極不適合 ContextPilot-8B 正是為之打造的那類工作負載。這張模型卡自身的設定讓這種張力更加尖銳:wrapper 之下的文字塔宣告了 262,144 個 token 的位置上限。主幹能定址二十五萬個 token,而已發布的 wrapper 不會接受超過八千個。
ContextPilot-8B 的失效模式在於,它不是任何東西的即插即用替代品。它是某個框架內的一個檢查點,而行為存在於該框架之中。若只拉取權重,卻沒有工具定義與代理執行環境,你得到的就只是一個 Qwen3-8B 微調模型,其與眾不同的能力根本無法發揮。再加上授權條款第 0 節,對商業部署來說,實際答案就是:照原樣根本完全不能用——這也意味著,無論現在或不久後,它都不是我們可考慮的候選路線。
部署每一個,如果你原本打算這麼做的話
Intern-Decision-4B 想要一張小型 GPU,而且不需要什麼像樣的服務堆疊:在 Python 3.12 下安裝 PyTorch 2.9.1 和 Transformers 5.14.1,將那四個分片載入一次,讓引擎常駐記憶體,然後進行評分。由於前向傳遞是固定形狀,P50 和 P95 彼此相差不到十分之六毫秒,因此容量規劃著重的是並行量,而不是尾端延遲。麻煩的地方在於,它是以可匯入的 Python 類別形式提供,而非 HTTP 服務,所以若要讓它直接面對正式環境的呼叫端,就得自己包一層。
ContextPilot-8B 需要相反的處理方式:真正的 serving 路徑、工具執行器、記憶儲存,以及具備分支能力的 rollout 環境,如果你有意按原設計重新訓練或評估它的話。這不是那種你花一個下午試用的模型;這是一套你會採用的研究框架。
路由器在這裡有幫助嗎?
部分正確,而誠實的版本比一般說法狹隘得多。OrcaRouter 並未在其型錄中列出 Intern-Decision-4B、ContextPilot-8B,或任何同類的決策評分檢查點——我們的模型頁面兩者皆回傳 404,本文任何內容都不應被解讀為可用性聲明。統一端點確實能為你帶來的,是讓你把失敗的實驗放到備援機制後面的能力:一組金鑰橫跨 200 多個模型、供應商定價原樣傳遞且 0% 加成,以及自動容錯移轉,讓你仍在評估的評分器永遠不會成為單點故障。對這項比較中的 Intern-Decision 這一側而言,這是實實在在的好處,因為該模型實際上能以低成本在本機執行。對 ContextPilot-8B 來說則無關緊要,因為僅限研發用途的授權排除了商業化途徑,無論任何路由器支援什麼都一樣。
那麼,是哪一個呢?
如果你的問題有一組封閉的答案、會連同證據一起送達,而且需要的是機率而非解釋,那麼 Intern-Decision-4B 是更有意思的物件——便宜、形狀固定、在建構上即已校準,並且對它不會接受的輸入坦誠以對。如果你的問題是證據永遠不會停止到來,那麼沒有任何決策評分器能幫你,而 ContextPilot-8B 正瞄準正確的目標,但要注意:你採用的是框架與研究授權,而不是一個模型。
能為這件事定論的,是一項兩家廠商都還沒做過的測試:把同一個簡短、結構化的決策交給雙方,而該決策的答案是可由狀態推算出來的,再看那個評分器的 90.02 平均值能否在自己的測試框架之外依然成立。在有人這麼做之前,對這場對決的正確解讀是:這兩個模型根本不是在競爭同一個位置。

