
Intern-S2-397B 對決 Kimi K3:397B 科學模型與 2.8T 推理巨人
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Intern-S2-397B 和 Kimi K3 站在開放權重分界線的兩側,而這條界線將定義 2026 年剩下的時間:可下載的科學專才,對上經獨立驗證的長上下文通才。Intern-S2-397B 是 InternLM 於 2026 年 9 月 13 日以 Apache-2.0 釋出的 4030 億參數科學多模態模型——沒有價目表、沒有獨立評分,還有一條以科學文獻原始頁面訓練而成的視覺路徑。Kimi K3 是 Moonshot AI 的 2.8 兆參數混合專家旗艦模型,於 2026 年 7 月推出,每百萬輸入詞元 3.00 美元、每百萬輸出詞元 15.00 美元,並於 7 月 27 日在修改版 MIT 授權條款下開放權重,且已經過六週的獨立評估。這場對決的不尋常之處在於,兩個模型都有同樣的長時程野心——持續處理龐大而混亂的任務——卻以相反的方向解決它。
兩者皆雄心勃勃,機制卻相反
這份雄心是共通的:每個模型都想成為當任務漫長時仍能持續下去的那個存在。它們以不同方式達成,而差異在於架構。
Kimi K3 的答案就是上下文。輸入與輸出皆具備 1,048,576 個 token 的視窗,意味著整個程式碼儲存庫、整個資料室,或五十步的代理迴圈都能存在於同一段對話中。據稱 Moonshot 的 Mooncake 推論堆疊在程式設計工作負載上維持超過 90% 的快取命中率,這正是每百萬輸出 token 15 美元的價格在實務上得以存續的方式。Kimi K3 提供頂層的 reasoning_effort 控制項,且不接受任何取樣參數,預設以最大深度進行推理,並預期你在多輪工具迴圈中逐字重放先前的 reasoning_content 與 tool_calls,否則品質會下降。
Intern-S2-397B 的答案是專業化加上權重層級控制。它的上下文——256K 文字推理與 64K 多模態,這兩個數字都來自模型卡——屬於不同類別的視窗,足以應付一篇份量十足的論文或一場長時間的研究工作階段,但不足以處理百萬 token 的工作集。它改而提供的是一條能原生讀取科學文獻的視覺路徑——將圖表、版面、符號標記與文字內容一併理解——以及可產生預測的時間序列輸入,同時還具備預設開啟、可依每次請求切換的思考功能。如果你的長期任務是科學性質,這個模型正是為此訓練;如果你的長期任務是程式碼庫,這不是擁有百萬 token 視窗的模型。
• 上下文 — Kimi K3:輸入與輸出皆為 1,048,576 個 token,對比 Intern-S2-397B:256K 文字 / 64K 多模態。
• 規模 — Kimi K3:總計 2.8T,每 token 約 104B 啟用,對比 Intern-S2-397B:總計 403B,512 個專家 / 10 個啟用。
• 控制介面 — Kimi K3:reasoning_effort 旋鈕,無取樣參數;對比 Intern-S2-397B:enable_thinking 開關,加上 Apache-2.0 授權下的完整權重層級控制。
• 輸入 — Kimi K3:文字、圖像,對比 Intern-S2-397B:文字、圖像、時間序列。
• 權重 — Kimi K3:以修改版 MIT 授權開放(7月27日),對比 Intern-S2-397B:以 Apache-2.0 授權開放(9月13日)。
• 獨立證據 — Kimi K3:六週的第三方評分;相較之下 Intern-S2-397B:尚無。
證據不對稱才是真正的差異。
Kimi K3 已歷經獨立機構的嚴格檢驗,並交出足以作為依據的成績。Artificial Analysis 在其現行 Intelligence Index 上將它排在 40 多分的中段,GPQA Diamond 為低 90 幾分,HLE 為中段 40 幾分,獨立測得的長上下文召回率為 88.7,程式編寫分數則落在 70 多分的中段。它在 Frontend Code Arena 上位居榜首(Elo 在 1670 多分),並在 BrowseComp 上取得 91.2,是該長時程檢索基準上的最高數字——不過 Moonshot 自己也提醒,K3「仍落後於最強大的專有模型」,而且其發布當日公布的若干項目仍屬廠商自行回報。
Intern-S2-397B 的證據是它自己的發布表格,經由 OpenCompass、VLMEvalKit 和 AgentCompass 跑過,在你讀到這段文字的幾個小時前才公布。每一個數字都是廠商自家的,且未經重現:MMLU Pro 89.77、MMMU Pro 81.68、HMMT-2026 93.56、SWE-bench-Pro 68.54,以及 TerminalBench 2.1 的 64.04——這個數字在卡上顯示以大幅差距輸給一個較舊的閉源世代。它的科學類列是能讓專家論點站得住腳的數字:Biology-Instructions 55.71、SciReasoner 1.5 63.28、Mol-Instructions 53.95、MolecularIQ 62.35。這兩個證據基礎並不相交,因此對這場對決最誠實的框架不是「誰贏」,而是「你的工作負載需要哪一種證據」。

開放權重版本:各自的成本
這兩款模型都是開放權重,這讓成本問題從常見的「按量計費 vs. 免費」敘事,轉變為兩種託管方案的比較。Kimi K3 有公開的 API 價格——Moonshot 定價表為每百萬 tokens 3.00 美元 / 15.00 美元,在 OrcaRouter 上以 0% 加成原價轉售,另外還加上快取讀取(cache-read)定價——而且它同時可供下載:這是一個 96 分片的開放權重發行版,需要超級節點(supernode)等級的硬體、64 個以上的加速器才能提供服務。自架 K3 的實際目標客群,是擁有資料中心預算的團隊。Intern-S2-397B 則完全沒有公開的 API 價格;其模型卡指向官方 Intern API,而真正的經濟效益在於自架:BF16 格式下約 807 GB 的權重、分散於 188 個分片,需要一台夠力的多 GPU 節點,而 FP8 版本則可將占用空間削減約一半。
只要你進行路由,這兩個模型就能透過同一個接縫呼叫:Kimi K3 在 OrcaRouter 上以 Moonshot 的定價提供,零加成,而 Intern-S2-397B 則未經路由——它是全新的 Apache-2.0 檢查點,你要使用它,途徑是供應商自家的 API 或自架部署。在這場搭配中,路由的價值在於把長脈絡通用型流量留在你已有的金鑰上,並把科學批次工作交給你自己執行的模型,兩者之間還能自動容錯移轉。DSL 讓這道界線成為一項設定,而不是第二套整合。

裁決
當工作屬於長上下文通才型任務時——整個儲存庫的程式編寫、持續運作的代理迴圈、需要一百萬個 token 工作記憶的知識工作——而且你想要背後有個獨立的計分板,就選擇 Kimi K3。無論從哪個角度看,它都是證據更紮實的模型,其開放權重確有其事(Modified MIT,7 月 27 日),而如果你已經在運作 supernode 等級的基礎設施,搭配快取後的每 token 經濟效益也相當有利。
當任務屬於科學性質時,就選 Intern-S2-397B:圖表密集的論文、分子結構圖、掃描文獻、時間序列訊號,以及必須留在你防線內的資料,或是你想用專有成果微調的權重。Apache-2.0 讓這一切可行,沒有任何租用的 API 做得到,而規格表上的科學類項目,與通用模型當初被調校的對象根本是不同物種。為硬體編列預算,自己跑評估,並把每一個關於它的已發表數字都當成主張,直到 InternLM 以外的人重現出任何一個為止。

