
Intern-S2 對決 Gemini 3.1 Pro:InternLM 實際測量的多模態對決
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
這個系列中的多數對決,都得把兩家廠商的說法拼湊起來。這一場不必。Intern-S2,InternLM 今天發布的 3970 億參數 Apache-2.0 多模態模型,以及 Gemini 3.1 Pro,Google 的旗艦推理模型,兩者都以實測欄位之姿出現在同一張基準測試表上——這使本場成為整組中最公平的正面對決,而且並非巧合地,也是開源模型最需要交代的一場。Gemini 3.1 Pro 能讀取文字、圖像、音訊與影片,具備 100 萬詞元的上下文,自 2026 年 2 月 19 日進入預覽階段以來,已被獨立實驗室與實際生產流量徹底拆解檢視。Intern-S2 能讀取文字、圖像與時間序列,今早才上傳到 Hugging Face,而且完全沒有任何第三方評分。在兩者皆有實測的那些列中,Google 的模型贏的比輸的多。
兩者都能讀取影像。相似之處僅止於此。
「多模態」這個詞讓這些模型聽起來像是同類。它們並非同類,而差異在於每個模型當初是為了看什麼而打造的。
Intern-S2 的視覺路徑經過訓練,能將科學文獻的原始頁面——圖表、方程式、結構圖、版面配置——作為單一共享表徵來吸收,而非先解析出文字。它的多模態基準測試屬於科學領域:生物顯微鏡 VQA、遙測、科學圖表問答。它也接受時間序列資料並能產生預測,而這是一種幾乎沒有通用旗艦模型會處理的輸入類型。
Gemini 3.1 Pro 的多模態能力屬於通用型,且在種類上更廣泛:在單一模型中整合文字、圖像、音訊與影片,鎖定全範圍的生產環境任務——讓你直接將模型指向某個檔案並提出問題。會議錄音、UI 截圖、PDF 中的圖表、影片片段——全都適用,且背後都有六個月的公開評估。
如果你的輸入是科學圖表,Intern-S2 就是專為此打造的,而且握有足以佐證的廠商數據。如果你的輸入是其他任何東西,Gemini 3.1 Pro 支援音訊與視訊,而 Intern-S2 兩者皆不支援。這在價格或基準測試進入考量之前,就解決了很大一部分「我該用哪一個」的問題,而任何告訴你這兩者可以互換的人,都沒讀過輸入清單。
共用表格所顯示的,誠實地解讀
因為 InternLM 對兩者都進行了基準測試,這是少數幾個直接比較具正當性、而非拼湊而成的地方之一。但注意事項不變,且值得說明一次:每一個 Intern-S2 的數字都是廠商自行報告的,由 InternLM 在其自家的測試框架上,透過 OpenCompass、VLMEvalKit 與 AgentCompass 執行,並未經獨立重現。該表中 Gemini 的數字同樣來自 InternLM 進行的這項比較,儘管 Gemini 在此之外擁有大量獨立的評測紀錄。
• 多模態知識 — Gemini 3.1 Pro 在 MMMU Pro 上達 83.99,對比 Intern-S2 的 81.68。
• 科學圖表問答 — Gemini 3.1 Pro 在 ChartQAPro 上獲得 71.18,對比 Intern-S2 的 71.12。小數點後兩位打成平手。
• 遙測 — Gemini 3.1 Pro 在 XLRS-Bench 上取得 54.27,相較於 Intern-S2 的 51.38。
• 顯微鏡 VQA — Gemini 3.1 Pro 在 MicroVQA 上 71.02 對比 Intern-S2 69.67。
• 科學多模態任務 — Intern-S2 在 SFE 上達 60.74,對比 Gemini 3.1 Pro 的 59.57。這是 Intern-S2 唯一的一項多模態勝績。
• 一般知識 — Gemini 3.1 Pro 在 MMLU Pro 上為 91.00,對比 Intern-S2 的 89.77。
• 高中數學 — Gemini 3.1 Pro 在 HMMT-2026 上取得 94.70,對比 Intern-S2 的 93.56。
• 科學文獻推理 —— Intern-S2 在 Biology-Instructions 上為 55.71,對比 Gemini 3.1 Pro 的 13.87;而在 Mol-Instructions 上則為 53.95 對 38.84。
• 科學奧林匹亞問題 — Intern-S2 在 FrontierScience-Olympiad 上取得 87.00,對比 Gemini 3.1 Pro 的 79.00。
• 終端機操作精通度 — Gemini 3.1 Pro 在 TerminalBench 2.1 上獲 73.80,Intern-S2 則為 64.04。
誠實地解讀:Gemini 3.1 Pro 在廣泛多模態項目中以些微差距勝出,Intern-S2 則在深度科學文獻項目中以極大差距勝出;考量到兩者各自的訓練內容,這兩個結果都不令人意外。多模態落敗的差距之小,可說是更有趣的發現——一個同日發布的開放檢查點,在 MMMU Pro 和 ChartQAPro 上與六個月前的封閉旗艦模型差距不到兩分,對 InternLM 來說,這比它任何大勝的科學數字都是更強勁的成果。
上下文、輸出與預覽問題
長輸入的態勢界線分明。Gemini 3.1 Pro 擁有 100 萬個 token 的脈絡視窗,輸出上限為 64K——足以處理一整套長篇文件並給出分量十足的回答。Intern-S2 在文字推理方面最高以 256K 個 token 進行評估,多模態則為 64K,且未公布輸出上限;在有人獨立測量之前,請將其可用視窗視為小於 Gemini 的。
在 Google 那一側有一個營運上的但書,任何誠實的比較都不該略過。Gemini 3.1 Pro 至今仍是預覽版模型,而非正式發行(GA)版本。預覽版模型的可靠性預期較低,而模型頁面上那個七天錯誤率面板,則時時提醒人們要繞開不穩定的部分,而不是把關鍵路徑架在它上面。Intern-S2 則是完整的 Apache-2.0 發行版,權重可以自行鎖定——這反直覺地讓這個全新的開源模型,成為兩者之中營運上更穩定的一方,而這正是最要緊的意義所在:沒有人能背著你把它換掉。
• 背景 — Intern-S2 256K 文字 / 64K 多模態,與 Gemini 3.1 Pro 1M tokens 進行評測比較。
• 輸入 — Intern-S2 文字、圖像、時間序列 vs Gemini 3.1 Pro 文字、圖像、音訊、視訊。
• 權重 — Intern-S2 Apache-2.0,可下載,對比 Gemini 3.1 Pro 閉源。
• 成熟度 — Intern-S2 才推出數小時,自 2026 年 2 月以來就沒有與 Gemini 3.1 Pro preview 對比的獨立評分,且經過大量且獨立的測試。
• 價格 — Intern-S2 沒有公開的費率表;可自行託管,或使用官方 Intern API;相較之下,Gemini 3.1 Pro 每百萬 token 輸入為 $2.00/輸出為 $12.00,當輸入超過 200K token 時,將調升至 $4.00/$18.00。

價格,以及每一個所在的位置
Gemini 3.1 Pro 在標準方案的計價是每百萬輸入 token 2.00 美元、每百萬輸出 token 12.00 美元,一旦單次請求的輸入突破 200K token,就會跳到 4.00/18.00 美元——這筆長脈絡附加費,偏偏就在你動用那個讓它值得被選中的 1M 視窗時咬你一口。 它在 OrcaRouter 上可用同樣的表定價格路由,以 0% 加價原價直通,而且同一把金鑰還掛載了 200 多個其他模型;這裡的直通之所以重要,是因為 Google 一調整價格,當天就會反映在我們這邊,而不是等過一輪重新定價之後。路由 DSL 是這個特定組合真正有用的地方:你可以把圖像與影片工作交給 Gemini 3.1 Pro,把科學文獻批次交給自架的 Intern-S2,同時讓兩者共用同一個端點,不必再簽第二份合約,也不用改動程式碼。
Intern-S2 沒有公開的 API 價格。自行架設 Apache-2.0 權重是多數團隊實際上會走的途徑,而以 403B 參數來說,這是一項貨真價實的硬體投入。官方 Intern API 是為那些寧可不要自己跑 GPU 的團隊而存在,但在沒有公開價目表的情況下,與 Gemini 的 $2/$12 之間的成本比較並不是能紙上談兵算出來的——你得先申請配額,然後自己動手算。

那通電話
如果你需要一個可接收音訊與視訊、具備百萬詞元、歷經數月獨立驗證,且今日即可按詞元租用的通用多模態模型,就選擇 Gemini 3.1 Pro。它是證據更充分、能力更廣泛的模型,而預覽徽章是可靠性上的但書,而非能力上的但書。
如果你的多模態輸入屬於科學性質,且你的資料無法離開你的基礎架構,就選擇 Intern-S2。在兩者之中,它是唯一能原生讀取原始文獻頁面、根據時間序列訊號進行預測,並且能在寬鬆授權條款下以專有實驗資料進行微調的模型。你要接受自己是第一個執行它的人,而且那張為它辯護的基準測試表,是由打造它的人所撰寫的。

兩者都沒有徹底勝出,而表格比任何評斷都更能證明這一點。一個是恰好擅長科學的通用型模型;另一個則是恰好能在一般多模態工作上具競爭力的科學儀器——而在同日開放發布的情況下,「有競爭力」才是更令人意外的結果。
無需第二份合約,就能同時掌握這項比較的兩邊:一組涵蓋 200 多個模型的 API 金鑰將封閉式多模態旗艦模型與所有替代選項置於同一個端點之後,因此你可以把圖像與影片工作導向一邊,並將文件批次導向另一邊。
