一張生成的 hero card,比較 Intern-S2 與 Gemini 3.1 Pro,左側展示一頁科學圖表與一張圖表饋入多模態模型,右側則有四個分別代表圖像、音訊、影片與文字的輸入圖示圍繞著一張封閉 API 卡片,並標示出 Apache-2.0 科學多模態與封閉的 1M 上下文通用多模態旗艦模型之間的對比,右下角有 OrcaRouter 標誌。
Guides & Insights

Intern-S2 對決 Gemini 3.1 Pro:InternLM 實際測量的多模態對決

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這個系列中的多數對決,都得把兩家廠商的說法拼湊起來。這一場不必。Intern-S2,InternLM 今天發布的 3970 億參數 Apache-2.0 多模態模型,以及 Gemini 3.1 Pro,Goog​le 的旗艦推理模型,兩者都以實測欄位之姿出現在同一張基準測試表上——這使本場成為整組中最公平的正面對決,而且並非巧合地,也是開源模型最需要交代的一場。Gemini 3.1 Pro 能讀取文字、圖像、音訊與影片,具備 100 萬詞元的上下文,自 2026 年 2 月 19 日進入預覽階段以來,已被獨立實驗室與實際生產流量徹底拆解檢視。Intern-S2 能讀取文字、圖像與時間序列,今早才上傳到 Hugging Face,而且完全沒有任何第三方評分。在兩者皆有實測的那些列中,Goog​le 的模型贏的比輸的多。

兩者都能讀取影像。相似之處僅止於此。

「多模態」這個詞讓這些模型聽起來像是同類。它們並非同類,而差異在於每個模型當初是為了看什麼而打造的。

Intern-S2 的視覺路徑經過訓練,能將科學文獻的原始頁面——圖表、方程式、結構圖、版面配置——作為單一共享表徵來吸收,而非先解析出文字。它的多模態基準測試屬於科學領域:生物顯微鏡 VQA、遙測、科學圖表問答。它也接受時間序列資料並能產生預測,而這是一種幾乎沒有通用旗艦模型會處理的輸入類型。

Gemini 3.1 Pro 的多模態能力屬於通用型,且在種類上更廣泛:在單一模型中整合文字、圖像、音訊與影片,鎖定全範圍的生產環境任務——讓你直接將模型指向某個檔案並提出問題。會議錄音、UI 截圖、PDF 中的圖表、影片片段——全都適用,且背後都有六個月的公開評估。

如果你的輸入是科學圖表,Intern-S2 就是專為此打造的,而且握有足以佐證的廠商數據。如果你的輸入是其他任何東西,Gemini 3.1 Pro 支援音訊與視訊,而 Intern-S2 兩者皆不支援。這在價格或基準測試進入考量之前,就解決了很大一部分「我該用哪一個」的問題,而任何告訴你這兩者可以互換的人,都沒讀過輸入清單。

共用表格所顯示的,誠實地解讀

因為 InternLM 對兩者都進行了基準測試,這是少數幾個直接比較具正當性、而非拼湊而成的地方之一。但注意事項不變,且值得說明一次:每一個 Intern-S2 的數字都是廠商自行報告的,由 InternLM 在其自家的測試框架上,透過 OpenCompass、VLMEvalKit 與 AgentCompass 執行,並未經獨立重現。該表中 Gemin​i 的數字同樣來自 InternLM 進行的這項比較,儘管 Gemin​i 在此之外擁有大量獨立的評測紀錄。

• 多模態知識 — Gemini 3.1 Pro 在 MMMU Pro 上達 83.99,對比 Intern-S2 的 81.68。

• 科學圖表問答 — Gemini 3.1 Pro 在 ChartQAPro 上獲得 71.18,對比 Intern-S2 的 71.12。小數點後兩位打成平手。

• 遙測 — Gemini 3.1 Pro 在 XLRS-Bench 上取得 54.27,相較於 Intern-S2 的 51.38。

• 顯微鏡 VQA — Gemini 3.1 Pro 在 MicroVQA 上 71.02 對比 Intern-S2 69.67。

• 科學多模態任務 — Intern-S2 在 SFE 上達 60.74,對比 Gemini 3.1 Pro 的 59.57。這是 Intern-S2 唯一的一項多模態勝績。

• 一般知識 — Gemini 3.1 Pro 在 MMLU Pro 上為 91.00,對比 Intern-S2 的 89.77。

• 高中數學 — Gemini 3.1 Pro 在 HMMT-2026 上取得 94.70,對比 Intern-S2 的 93.56。

• 科學文獻推理 —— Intern-S2 在 Biology-Instructions 上為 55.71,對比 Gemini 3.1 Pro 的 13.87;而在 Mol-Instructions 上則為 53.95 對 38.84。

• 科學奧林匹亞問題 — Intern-S2 在 FrontierScience-Olympiad 上取得 87.00,對比 Gemini 3.1 Pro 的 79.00。

• 終端機操作精通度 — Gemini 3.1 Pro 在 TerminalBench 2.1 上獲 73.80,Intern-S2 則為 64.04。

誠實地解讀:Gemini 3.1 Pro 在廣泛多模態項目中以些微差距勝出,Intern-S2 則在深度科學文獻項目中以極大差距勝出;考量到兩者各自的訓練內容,這兩個結果都不令人意外。多模態落敗的差距之小,可說是更有趣的發現——一個同日發布的開放檢查點,在 MMMU Pro 和 ChartQAPro 上與六個月前的封閉旗艦模型差距不到兩分,對 InternLM 來說,這比它任何大勝的科學數字都是更強勁的成果。

上下文、輸出與預覽問題

長輸入的態勢界線分明。Gemini 3.1 Pro 擁有 100 萬個 token 的脈絡視窗,輸出上限為 64K——足以處理一整套長篇文件並給出分量十足的回答。Intern-S2 在文字推理方面最高以 256K 個 token 進行評估,多模態則為 64K,且未公布輸出上限;在有人獨立測量之前,請將其可用視窗視為小於 Gemini 的。

Google 那一側有一個營運上的但書,任何誠實的比較都不該略過。Gemini 3.1 Pro 至今仍是預覽版模型,而非正式發行(GA)版本。預覽版模型的可靠性預期較低,而模型頁面上那個七天錯誤率面板,則時時提醒人們要繞開不穩定的部分,而不是把關鍵路徑架在它上面。Intern-S2 則是完整的 Apache-2.0 發行版,權重可以自行鎖定——這反直覺地讓這個全新的開源模型,成為兩者之中營運上更穩定的一方,而這正是最要緊的意義所在:沒有人能背著你把它換掉。

• 背景 — Intern-S2 256K 文字 / 64K 多模態,與 Gemini 3.1 Pro 1M tokens 進行評測比較。

• 輸入 — Intern-S2 文字、圖像、時間序列 vs Gemini 3.1 Pro 文字、圖像、音訊、視訊。

• 權重 — Intern-S2 Apache-2.0,可下載,對比 Gemini 3.1 Pro 閉源。

• 成熟度 — Intern-S2 才推出數小時,自 2026 年 2 月以來就沒有與 Gemini 3.1 Pro preview 對比的獨立評分,且經過大量且獨立的測試。

• 價格 — Intern-S2 沒有公開的費率表;可自行託管,或使用官方 Intern API;相較之下,Gemini 3.1 Pro 每百萬 token 輸入為 $2.00/輸出為 $12.00,當輸入超過 200K token 時,將調升至 $4.00/$18.00。

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

價格,以及每一個所在的位置

Gemini 3.1 Pro 在標準方案的計價是每百萬輸入 token 2.00 美元、每百萬輸出 token 12.00 美元,一旦單次請求的輸入突破 200K token,就會跳到 4.00/18.00 美元——這筆長脈絡附加費,偏偏就在你動用那個讓它值得被選中的 1M 視窗時咬你一口。 它在 OrcaRouter 上可用同樣的表定價格路由,以 0% 加價原價直通,而且同一把金鑰還掛載了 200 多個其他模型;這裡的直通之所以重要,是因為 Google 一調整價格,當天就會反映在我們這邊,而不是等過一輪重新定價之後。路由 DSL 是這個特定組合真正有用的地方:你可以把圖像與影片工作交給 Gemini 3.1 Pro,把科學文獻批次交給自架的 Intern-S2,同時讓兩者共用同一個端點,不必再簽第二份合約,也不用改動程式碼。

Intern-S2 沒有公開的 API 價格。自行架設 Apache-2.0 權重是多數團隊實際上會走的途徑,而以 403B 參數來說,這是一項貨真價實的硬體投入。官方 Intern API 是為那些寧可不要自己跑 GPU 的團隊而存在,但在沒有公開價目表的情況下,與 Gemini 的 $2/$12 之間的成本比較並不是能紙上談兵算出來的——你得先申請配額,然後自己動手算。

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

那通電話

如果你需要一個可接收音訊與視訊、具備百萬詞元、歷經數月獨立驗證,且今日即可按詞元租用的通用多模態模型,就選擇 Gemini 3.1 Pro。它是證據更充分、能力更廣泛的模型,而預覽徽章是可靠性上的但書,而非能力上的但書。

如果你的多模態輸入屬於科學性質,且你的資料無法離開你的基礎架構,就選擇 Intern-S2。在兩者之中,它是唯一能原生讀取原始文獻頁面、根據時間序列訊號進行預測,並且能在寬鬆授權條款下以專有實驗資料進行微調的模型。你要接受自己是第一個執行它的人,而且那張為它辯護的基準測試表,是由打造它的人所撰寫的。

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

兩者都沒有徹底勝出,而表格比任何評斷都更能證明這一點。一個是恰好擅長科學的通用型模型;另一個則是恰好能在一般多模態工作上具競爭力的科學儀器——而在同日開放發布的情況下,「有競爭力」才是更令人意外的結果。

無需第二份合約,就能同時掌握這項比較的兩邊:一組涵蓋 200 多個模型的 API 金鑰將封閉式多模態旗艦模型與所有替代選項置於同一個端點之後,因此你可以把圖像與影片工作導向一邊,並將文件批次導向另一邊。