
Intern-S2-397B 對決 Grok 4.6:誰能掌控調節權
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Intern-S2-397B 與 Grok 4.6 相隔約一個月推出,並以相反的方式回答同一個根本問題:誰能控制推理。Grok 4.6 是 xAI 的旗艦模型,於 2026 年 8 月 12 日上線,它賣給你一個旋鈕——在封閉 API 上可設定的推理努力控制,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元,具有 500,000 token 的上下文窗口,且 xAI 的伺服器端工具另行計費。Intern-S2-397B 是 4030 億參數的科學多模態模型,由上海人工智慧實驗室的 InternLM 團隊於 9 月 13 日以 Apache-2.0 授權釋出,它把整台機器交給你——權重、思考開關、視覺路徑、時間序列頭——並期望你自己運行它。一個是租來的,附帶旋鈕;另一個則是徹底擁有。這裡真正重要的比較不是哪個在基準測試表上得分更高;而是你的工作負載實際上需要哪種控制,以及每種控制的成本是多少。
兩個不同的錶盤
要分辨這兩者,最乾淨俐落的方式,就是看推理控制項位於何處。Grok 4.6 透過 xAI 的 API 提供推理投入程度的設定,而圍繞在它周遭的是一整套伺服器端工具——函式呼叫、網頁搜尋、X 搜尋、程式碼執行——由 xAI 負責運作並另行計費。你調整投入程度,串接它給你的工具,而且永遠不必碰觸任何權重。模型的行為是 xAI 的財產,也是 xAI 的問題;你的槓桿只是請求中的一個參數。
Intern-S2-397B 為你提供另一組槓桿,而且它們位於堆疊中更底層的位置。思考功能預設為開啟,你可以透過enable_thinking=False針對每個請求將其關閉。由於該模型採用 Apache-2.0 授權,你也可以取得權重,並以自己的資料微調推理行為本身,然後將結果部署在 LMDeploy、vLLM 或 SGLang 上。它的輸入介面比文字與影像 API 更寬廣:它接受時間序列訊號並產生預測,這項能力目前僅透過 LMDeploy 串接,而且它是為在沙箱環境中進行長時程代理工作而訓練的。取捨同樣清楚——唯有你準備好操作隨之而來的硬體與服務堆疊,這種程度的掌控才有意義。
• 推理控制 — Grok 4.6:封閉 API 上的推理強度調節鈕,對比 Intern-S2-397B:enable_thinking 切換開關,外加 Apache-2.0 授權下完整的權重層級控制。
• 工具 — Grok 4.6:xAI 的伺服器端網頁搜尋、X 搜尋及程式碼執行,需分別計費;而 Intern-S2-397B:工具呼叫需自行串接,另有一條透過 LMDeploy 的時間序列預測路徑。
• 輸入 — Grok 4.6:文字、圖像、檔案,對比 Intern-S2-397B:文字、圖像、時間序列。
• 上下文 — Grok 4.6:500,000 個 token,對比 Intern-S2-397B:256K 文字推理、64K 多模態,兩項數字皆出自模型卡。
• 價格 — Grok 4.6:每 1M 個 tokens 為 $2.00 / $6.00,超過 200K 個 tokens 後分層為 $4.00 / $12.00;相較於 Intern-S2-397B:沒有費率表;可自行託管或使用官方 Intern API。
數字實際上涵蓋的範圍
以下每一個 Intern-S2-397B 的數字都是 InternLM 自家提供的,透過 OpenCompass、VLMEvalKit 與 AgentCompass 跑出來,並與權重一同發布,未經獨立重現。Grok 4.6 的數字則是另一回事:它們是在模型上線後,透過公開競技場與 Artificial Analysis 累積而來,因此帶有第三方標籤。
在獨立實測這邊,Grok 4.6 在當前 Artificial Analysis Intelligence Index 上為 44,GPQA Diamond 為 94.9、Humanity's Last Exam 為 61.0、編碼分數為 76.8,而 Artificial Analysis 將其 TerminalBench 2.1 的數字放在接近 80.3。在廠商這邊,Intern-S2-397B 的卡上回報 MMLU Pro 為 89.77、HMMT-2026 為 93.56、MMMU Pro 為 81.68、SWE-bench-Pro 為 68.54,再加上幾列科學相關數據,讓它看起來像另一個物種:Biology-Instructions 為 55.71、SciReasoner 1.5 為 63.28、Mol-Instructions 為 53.95、MolecularIQ 為 62.35。廠商表格中最該讓 agent 開發者心裡一驚的那個數字,是 TerminalBench 2.1 的 64.04——這個數字是模型自家製造者所回報,且大幅輸給較舊的封閉世代,而且正好落在像是 Grok 4.6 這類租用前沿模型最強的那條終端工作賽道上。
把那組差異解讀成一幅側寫,而不是一份排名。Intern-S2-397B 是科學領域的專家,同時也是稱職的通用模型;Grok 4.6 則是對科學抱持些許興趣的泛用型模型。科學類別出現一面倒的情況是預料之中的——沒有任何通用型旗艦模型是在同時包含圖表、版面配置與符號標記的科學文獻原始頁面上預先訓練的,而這正是 Intern-S2-397B 所建構的範式。兩份證據基礎中都沒有任何內容支持「Intern-S2-397B 在任意推理上與 Grok 4.6 一樣好」,而 Grok 4.6 的證據也沒有任何跡象顯示它曾針對多體學序列分析進行調校。
控制的代價
Grok 4.6 的價格可以直接填進試算表:每百萬個輸入 token 2.00 美元、每百萬個輸出 token 6.00 美元,一旦提示超過 200,000 個 token,費率就會攀升至 4.00 / 12.00 美元,另外還有可選的優先級方案,可獲得更快的回應速度。你可以透過 OrcaRouter 以 xAI 的定價取得,0% 加成原價轉售,因此 xAI 一旦調整價格,這裡當天就會同步跟進,沒有中間商價差——你租用的那個旋鈕,始終依照供應商的定價方式計價。
Intern-S2-397B 完全沒有公布任何按 token 計價的費率。模型卡上提到了官方的 Intern API,但人們真正想比較的經濟成本,其實是自行託管(self-host)的方案:一個 403B 參數的檢查點,BF16 格式下約 807 GB 的權重、分散在 188 個分片(shard)中,因此需要一台夠份量的多 GPU 節點,而 FP8 版本則大約能把占用空間減半。如果你已經擁有那樣的算力,下一次科學查詢的邊際成本就趨近於電費,而這正是 Apache-2.0 立場的全部重點。如果你沒有那樣的算力,這個「免費」模型就是一項資本支出的試點計畫,而不是一筆可列在預算表上的經常性支出。
在這組特定搭配中,路由器換來的是接縫,而不是價格。Grok 4.6 使用你既有、用於一般生產流量的金鑰;Intern-S2-397B 並未在 OrcaRouter 上路由——它是全新的檢查點,而通往它的途徑是廠商自家的 API 或自架部署。把一般、對延遲敏感的推理導向按用量計費的模型,將科學批次工作留在你自己執行的模型上,並在任一邊的端點狀態不良時,讓自動容錯移轉為你提供後援。它們之間的邊界會變成一條路由規則,而不是第二套整合。

該選哪一個
當工作是通用性質、推理必須快速且正確地回傳,而你又不想自己維運產出這一切的技術堆疊時,就選 Grok 4.6。它的 500K 上下文視窗、實測 GPQA Diamond 達 94.9,以及它的工具套件,都是正式上線可用功能,而 $2/$6 的計費標準,就是你為了不必自行操作任何東西所付的代價。
當輸入屬於科學性質時——例如圖表密集的論文、分子圖、時間序列訊號——就選用 Intern-S2-397B;當推理必須在無法離開你環境的資料上進行,或針對你想自行微調的行為時,也是如此。Apache-2.0 讓這件事成為可能;沒有任何租用式 API 辦得到。要為硬體編列預算,預期一段時間內不會有獨立的評分榜,並且把其規格卡上的每個數字都當成宣稱,直到 InternLM 以外有人能重現其中任何一項為止。


