
Intern-S2 對決 GPT-5.6 Sol:免費檢查點與 30 美元旗艦
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
乍看之下,這場對決的價格列顯得荒謬。Intern-S2 是 InternLM 今日以 Apache-2.0 釋出的 3,970 億參數多模態模型,下載免費,只要你擁有跑得動它的硬體,每次查詢也免費。GPT-5.6 Sol 是 OpenAI 的旗艦推理層級,在 OpenAI 的基本方案上標價為每百萬輸入 token 5.00 美元、每百萬輸出 token 30.00 美元——不過 OpenAI 自七月底以來一直在跑的促銷價(我們自家的模型頁面目前顯示的就是這個價格)是輸入 4.00 美元、輸出 20.00 美元。這是真實的價差,也是所有人第一眼就會注意到的事——而它同時是這項比較中最沒有用的一項事實,因為這個 30 美元的模型和那個免費的模型,並不是在爭奪同一種工作。GPT-5.6 Sol 是當你的應用程式所嘗試過最艱難的推理必須正確無誤地回傳時,OpenAI 會指向的那個層級。Intern-S2 則是一件科學儀器,具備以原始文獻頁面訓練而成的視覺路徑,以及用於時序訊號的預測頭。問題不在於哪個比較便宜,而在於你的工作負載真正需要的是哪一個,以及那個「免費」的選項是否真的免費。
廠商表格能告訴你什麼、不能告訴你什麼
InternLM 將 Intern-S2 與 GPT-5.5 進行基準測試,而非 GPT-5.6 Sol。這一點值得先說明,因為流傳中的每一個「Intern-S2 勝過 GPT」的說法,都是與前一代 OpenAI 的比較,而任何將其呈現為 Sol 結果的頁面,都是在推測。GPT-5.6 系列也涵蓋三個層級——Sol 用於最艱難的工作、Terra 用於均衡的生產、Luna 用於高流量——而 OpenAI 一直在積極重新定價,因此從九月文章引用的 Sol 數字可能已經過時。
廠商的比較確實能證明的是,且始終附帶一項但書:每一個 Intern-S2 的數字都是 InternLM 自家的,且未經重現:
• 分子結構推理 — Intern-S2 在 MolecularIQ 上為 62.35,相較於 GPT-5.5 的 76.41。Intern-S2 落後。
• 科學工具使用 —— Intern-S2 在 TOMG-Bench 上為 66.76,GPT-5.5 則為 69.89。微幅落後。
• 生物分子指令 — Intern-S2 53.95 對 40.49。Intern-S2 明顯勝出。
• 高中數學 — Intern-S2 在 HMMT-2026 上取得 93.56,對比 GPT-5.5 的 97.06。Intern-S2 落敗。
• 一般知識 — Intern-S2 在 MMLU Pro 上為 89.77,相較之下為 88.20。Intern-S2 以些微差距勝出。
• 多模態知識 — 在 MMMU Pro 上達到 81.68 的水準。
• 終端機掌握度 — GPT-5.5 在 TerminalBench 2.1 上取得 79.40,而 Intern-S2 為 64.04。差距達十五點。
即使面對一個比自身舊一代的 OpenAI 模型,Intern-S2 在通用列目上仍是輸多贏少,並在科學類列目上勝出。面對 Sol——一個明確定位在 GPT-5.5 之上、用於最難推理的層級——通用能力差距幾乎肯定會擴大。證據中沒有任何內容支持「免費檢查點能在通用能力上與付費旗艦競爭」這個想法;而誠實的表述是,Intern-S2 是一個在總體上表現尚可、在其專長領域表現卓越的專家模型。
{{1}}免費{{/1}}是資本支出,不是{{2}}折扣{{/2}}
Intern-S2 的零授權成本是真的,但這並不等同於免費推論,而這正是這項比較開始變得實際的地方。一個 4030 億參數的檢查點需要一套夠份量的多 GPU 節點才能提供服務。如果你已經擁有那樣的算力,而且它還沒被充分利用,那麼下一次科學查詢的邊際成本就接近電費——這是一個真正強大的經濟位置,也是開放權重之所以存在的理由。如果你不擁有那樣的算力,「免費」就意味著得購買或租用硬體,而這筆帳算起來就完全不同了。
GPT-5.6 Sol 的經濟模式恰恰相反。沒有硬體要買,也沒有模型要自行運作。你支付的是按用量計費的費率——基礎方案為每百萬輸入 token 5.00 美元、每百萬輸出 token 30.00 美元,或目前於我們模型頁面上線的 4.00/20.00 美元促銷費率——而模型隨附 1.05M token 上下文窗口、128K 輸出上限、視覺、工具,以及自 2026 年 7 月 9 日 API 推出以來持續在生產環境運作的旗艦模型所累積的可靠性。Ultrafast 預覽版在晶圓級硬體上運行 Sol,輸出速度最高達每秒 750 個 token,將同一模型推向延遲關鍵型工作,不過它僅限於少數客戶使用,且未公布價格。你用這 30 美元買到的不只是能力——更是免去一支維運團隊。
• 權重 — Intern-S2 為 Apache-2.0 授權、可下載,對比 GPT-5.6 Sol 為封閉、僅提供 API。
• 成本結構 — Intern-S2 在 403B 檢查點上的資本支出,或按用量計費的官方 Intern API,對比 GPT-5.6 Sol 每百萬定價 $5.00 / $30.00、促銷價 $4.00 / $20.00。
• 上下文/輸出 — Intern-S2 最高 256K 文字、64K 多模態已評估;輸出未公開,相較 GPT-5.6 Sol 約 1.05M 上下文、128K 輸出。
• 輸入 — Intern-S2 文字、圖像、時間序列 vs GPT-5.6 Sol 文字與圖像。
• 獨立評分 — Intern-S2 尚無,相較於擁有長期公開評測紀錄的頂級旗艦 GPT-5.6 Sol。
• 速度層級 — Intern-S2 受限於硬體,對比 GPT-5.6 Sol Ultrafast preview 最高每秒 750 個輸出 token,依廠商所述。

免費檢查點真正勝出之處
有三種情況,Intern-S2 在沒有基準測試參與的情況下勝過 Sol。
第一項是資料存放地點。GPT-5.6 Sol 是封閉式 API——每個請求都會離開你的基礎架構,並在 OpenAI 的內容政策下,途經 OpenAI 的系統。採用 Apache-2.0 的 Intern-S2 則可在受監管環境內以氣隙(air-gapped)方式運行,處理在法律上無法傳送至第三方端點的資料。對製藥實驗室、醫院體系或國防承包商而言,這項特性不是一項功能,而是整個採購決策的關鍵,Sol 再強的能力都無法取代它。
第二個是模態。Intern-S2 接受時間序列輸入並產生預測;它也能以原生視覺表徵的方式讀取原始科學文獻頁面,而不是讀取擷取出來的文字。Sol 則接受文字與圖像。如果你的資料是地震儀紀錄、負載曲線,或掃描的圖表密集論文,Intern-S2 有一條 Sol 沒有的路徑,而該廠商的 Biology-Instructions 那一列(55.71,對比 GPT-5.5 的 10.52)正是反映這一點的數字。
第三點是微調。你可以取用 Intern-S2 的權重,用自己的專有實驗資料進行訓練,然後永久保留那個模型。無論出多少錢,你都無法用 Sol 做到這一點。對於競爭優勢在於專門資料集的團隊來說,一個可調整的開放檢查點,可能比一個更強大的凍結模型更有價值。

不選擇而同時執行兩者
能從這個組合中獲得最大效益的團隊,並不把它當成一道非此即彼的分岔。他們把一般性、對延遲敏感、成敗攸關的推理導向 GPT-5.6 Sol——它架在 OrcaRouter 上,以 OpenAI 的定價、0% 加價提供,並與其他 200 多個模型共用同一把金鑰,因此 Sol 的價格一有變動當天就會反映,而供應商狀況不佳的時段則由自動容錯移轉接手——同時,無論他們在哪裡執行,都把科學批次工作留在 Intern-S2 上。路由 DSL 讓這條界線清楚成形:困難的一般推理走一邊,文件與訊號分析走另一邊,而這種分工是一項設定,而不是第二套整合。
Intern-S2 不在 OrcaRouter 上;它是同日發布的 Apache-2.0 checkpoint,而你要取用它的途徑是供應商自家的 API 或自架部署。Sol 在 key 上。在這兩者之間,對於科學應用為重的應用程式,實務上的架構是:一個端點用於前沿呼叫,一個部署用於專門模型——並保留日後移動任一邊的選項。

裁決
如果你需要應用程式所能嘗試的最艱難推理,希望它能在一次 API 呼叫中完成,並且願意為此支付計量制的旗艦費率,那麼 GPT-5.6 Sol 就是答案,而同日發布的開放檢查點並不會改變這一點。InternLM 自家的表格中,沒有任何內容顯示 Intern-S2 在一般能力上能與當前的 OpenAI 旗艦模型匹敵;該比較是針對前一代進行的,而這個開放模型仍在大多數一般能力列上落敗。
如果你的工作負載屬於科學性質、你的資料不能離開自家基礎設施,或者你需要以專有實驗結果進行微調,Intern-S2 就是真正能做到這些事的模型——而它的 Apache-2.0 授權意味著,你驗證過的版本就是你保留的版本。為硬體編列預算,預期要自行執行評估,並把它每一個已發布的數字都當成宣稱,直到 InternLM 以外有人能重現其中任何一個為止。
至於與你自行託管的模型並行的前沿模型呼叫:另外 200 多款模型讓封閉式旗艦模型以供應商定價、透過單一金鑰即可取用,因此專用部署與按量計費的模型可依路由規則互相替換。
