
Intern-S2-397B 對決 Qwen3.8-Max:兩款中國旗艦,截然相反的經濟豪賭
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Intern-S2-397B 與 Qwen3.8-Max 是 2026 年 9 月初最具影響力的兩款中國旗艦發布,而且它們做出了相反的經濟賭注。Intern-S2-397B 是上海人工智慧實驗室 InternLM 團隊於 9 月 13 日以 Apache-2.0 釋出的 4,030 億參數科學多模態模型,它押注開放權重是贏得科學與代理式工作負載的方式:沒有每 Token 價格、權重在 Hugging Face 上,並以你自己的硬體作為計量器。Qwen3.8-Max 是阿里巴巴的 2.4 兆參數旗艦,於 8 月 3 日正式推出,並在 9 月 2 日更新,它押注的是定價 API:每百萬輸入 Token 2.00 美元、每百萬輸出 Token 6.00 美元,涵蓋 100 萬 Token 上下文,而開放權重在正式推出後一週到來,且獨立的 Artificial Analysis 分數已經在榜上。它們之間的對決,與其說關乎誰的基準測試勝出,不如說關乎哪一種賭注——擁有權或計量端點——符合你的工作負載形態。
兩個旗艦,兩場豪賭
Qwen3.8-Max 是阿里巴巴 Qwen 系列中能力最強的層級,是一款稀疏混合專家模型,總參數量達 2.4 兆,每個詞元約啟動 950 億個參數,橫跨 512 位專家,其中 10 位處於啟動狀態,另加一位共享專家。它具備 100 萬詞元的上下文視窗(在代管 API 中啟用思考模式時為 983,616 個詞元)、131,072 詞元的輸出上限,支援文字、圖像與影片輸入,並透過與 OpenAI 相容的端點提供服務。其最具代表性的定價策略是均一費率:無論你的提示是 5,000 個詞元還是 900,000 個詞元,價格都是相同的 $2.00 / $6.00,而快取輸入的價格更低——沒有長上下文附加費,而這正是大多數競爭對手至今仍會收取的槓桿。阿里巴巴在自己的遷移指南中,直接將其定位為與 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro 正面對決。
Intern-S2-397B 是一種不同形態的旗艦。它是一個混合專家模型,具有 60 層和 512 個專家(每個 token 有 10 個活躍),256K 的文字推理上下文和 64K 的多模態,輸入介面包含文字、圖像和時間序列,以及一種預訓練範式,該範式直接讀取科學文獻的原始頁面——圖表、版面、符號標記和散文——而不是先解析出文字。它的強化學習涵蓋二十多個科學領域,並且是在沙箱環境中為長期代理工作而訓練的。它的定價不是一張價目表,而是沒有價目表:自行託管 Apache-2.0 權重,或申請使用官方 Intern API。
• 價格 — Intern-S2-397B:無價目表;自行託管或 Intern API 對比 Qwen3.8-Max:每 1M 均一價 $2.00 / $6.00,快取輸入較低。
• 規模 — Intern-S2-397B:總計 403B,512 個專家/10 個啟用 vs Qwen3.8-Max:總計 2.4T,95B 啟用,512 個專家/10 + 1 共享。
• 上下文 — Intern-S2-397B:256K 文字 / 64K 多模態,對比 Qwen3.8-Max:1M tokens、均一費率。
• 輸入 — Intern-S2-397B:文字、圖像、時間序列 vs Qwen3.8-Max:文字、圖像、影片。
• 權重 — Intern-S2-397B:Apache-2.0,於發布當日即開放,對比 Qwen3.8-Max:自訂 Qwen3.8-Max 授權條款,於 GA 後 8 月 12 日開放。
• 獨立評分 — Intern-S2-397B:尚無 vs Qwen3.8-Max:AA Intelligence Index 40、GPQA Diamond 92.7。
兩張表格都是廠商表格,而且只有其中一張有裁判。
兩款模型發布時都附上廠商自行製作的基準測試表,這使得資料來源的規範一致,但過往紀錄卻不同。Qwen3.8-Max 的獨立數據此後陸續累積:Artificial Analysis 在其現行 Intelligence Index 上給它 40 分,GPQA Diamond 為 92.7,HLE 為 43.0,獨立程式編寫分數為 71.8,而在現行量表下,每項指數任務的成本約為 2.67 美元。這些都是來自第三方追蹤機構的實測數字——是這兩款旗艦機型首次擁有的真正裁判。
Intern-S2-397B 的證據是它自己的模型卡,透過 OpenCompass、VLMEvalKit 與 AgentCompass 跑出來的,並與權重一同發布:MMLU Pro 89.77、MMMU Pro 81.68、HMMT-2026 93.56、SWE-bench-Pro 68.54,以及 TerminalBench 2.1 的 64.04——這個數字在模型卡本身顯示輸給較舊的封閉世代。它的科學類項目正是專業化論點成立的緣由:Biology-Instructions 55.71、SciReasoner 1.5 63.28、Mol-Instructions 53.95、MolecularIQ 62.35。這些每一項都是 InternLM 自家的、未經重現。並列來看,這兩組證據基礎從相反方向講述同一個故事:一個模型是專才,通用項目表現體面,卻沒有外部量測;另一個是通才,有獨立分數,卻沒有科學調校。

金錢形態實際上買到了什麼
均一價 $2 / $6 的計費方式是 Qwen3.8-Max 的招牌策略,值得詳細說明它帶來什麼。一個在單次呼叫中推送 20 萬個輸入 token 程式碼脈絡的 repo 分析代理,所支付的每 token 費率與簡短聊天相同——沒有長提示附加費——而且透過快取,穩定的程式碼脈絡在重複流量下會讓實際輸入價格大幅下降。該模型也可以依阿里巴巴的自訂授權以開放權重形式呼叫,該授權允許在標註來源的情況下進行商業使用,並設有以規模為基礎的門檻:月活躍用戶超過 1 億或月營收超過 2,000 萬美元;而大型模型即服務(model-as-a-service)業務則需另行簽訂協議。
Intern-S2-397B 的經濟邏輯恰好相反:完全不按用量計費,而是資本支出。權重以 BF16 表示約為 807 GB,分散在 188 個分片——這是一台高階多 GPU 節點——而 FP8 版本則把占用空間削減約一半。如果你已經擁有那樣的算力,下一次科學查詢的邊際成本就趨近於電費,而這就是這場賭注:擁有權讓專用模型在邊際上變得便宜。如果你不擁有硬體,這個「免費」模型只是試點,而官方 Intern API 是唯一按用量計費的替代方案。
只要做好路由,這兩個旗艦模型就能共用同一道接縫。Qwen3.8-Max 已上架 OrcaRouter,以阿里巴巴的定價原價直通、零加成,因此每百萬 $2 / $6 的固定費率以及未來任何降價,都會在同一天反映在這裡。Intern-S2-397B 並未納入路由——它是全新的檢查點,要取用它,只能走供應商自家的 API 或自行部署。把一般性、支援影片、長上下文的流量,交給用你手上既有金鑰計費的模型;把科學批次運算留在你自己跑的模型上;當任一邊的端點不健康時,就讓自動故障轉移來接手。這道界線是一條路由規則,而不是第二套整合。

裁決
選擇 Qwen3.8-Max 來進行一般推理與可支援影片的生產工作,在這些用途中,每百萬個 token 的固定費率勝過競爭對手的任何收費,而獨立評分榜也能降低在其之上建構的風險。其權重夠開放,在大多數團隊都符合資格的授權條款下具有意義,而其 $2 / $6 的計費在頂尖旗艦模型中,是市場上最積極的價格。
選擇 Intern-S2-397B 來處理科學工作負載——圖表密集的論文、分子圖、時序訊號——這類輸入的多模態特性,是通用型模型從未被調校過的;而在這類場景中,資料落地或針對專有成果進行微調的需求,讓 Apache-2.0 成為決定性的條件。為硬體編列預算,自行執行評估,並在其數字出現獨立裁判之前,把它們當成宣稱來看待。
誠實的總結是:這兩款旗艦產品其實並非真正的替代品。一款是自有的科學儀器,具備相當不錯的通用能力;另一款則是租用型、由獨立評分的通用模型,採固定費率,且對科學只有泛泛的興趣。同時需要兩者的團隊,應把這條分界線視為一項路由決策——而且在相信任何一家廠商簡報上的任何數字之前,應該先對 Intern-S2-397B 重新執行自家的評估。

