一張生成的英雄卡片,比較 Intern-S2 與 GPT-5.6 Sol,左側顯示一頁科學圖表與訊號波形饋入一個開放權重模型,右側則是一個封閉的前沿 API 端點,附有速度儀表,標示為 Apache-2.0 可免費下載並在自己的 GPU 上自行託管,對比每 100 萬個 token 收費 $5.00 / $30.00,以及 1.05M 上下文 / 128K 輸出,右下角有 OrcaRouter 標誌。
Guides & Insights

Intern-S2 對決 GPT-5.6 Sol:免費檢查點與 30 美元旗艦

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

乍看之下,這場對決的價格列顯得荒謬。Intern-S2 是 InternLM 今日以 Apache-2.0 釋出的 3,970 億參數多模態模型,下載免費,只要你擁有跑得動它的硬體,每次查詢也免費。GPT-5.6 SolOpenAI 的旗艦推理層級,在 OpenAI 的基本方案上標價為每百萬輸入 token 5.00 美元、每百萬輸出 token 30.00 美元——不過 OpenAI 自七月底以來一直在跑的促銷價(我們自家的模型頁面目前顯示的就是這個價格)是輸入 4.00 美元、輸出 20.00 美元。這是真實的價差,也是所有人第一眼就會注意到的事——而它同時是這項比較中最沒有用的一項事實,因為這個 30 美元的模型和那個免費的模型,並不是在爭奪同一種工作。GPT-5.6 Sol 是當你的應用程式所嘗試過最艱難的推理必須正確無誤地回傳時,OpenAI 會指向的那個層級。Intern-S2 則是一件科學儀器,具備以原始文獻頁面訓練而成的視覺路徑,以及用於時序訊號的預測頭。問題不在於哪個比較便宜,而在於你的工作負載真正需要的是哪一個,以及那個「免費」的選項是否真的免費。

廠商表格能告訴你什麼、不能告訴你什麼

InternLM 將 Intern-S2 與 GPT-5.5 進行基準測試,而非 GPT-5.6 Sol。這一點值得先說明,因為流傳中的每一個「Intern-S2 勝過 GPT」的說法,都是與前一代 OpenAI 的比較,而任何將其呈現為 Sol 結果的頁面,都是在推測。GPT-5.6 系列也涵蓋三個層級——Sol 用於最艱難的工作、Terra 用於均衡的生產、Luna 用於高流量——而 OpenAI 一直在積極重新定價,因此從九月文章引用的 Sol 數字可能已經過時。

廠商的比較確實能證明的是,且始終附帶一項但書:每一個 Intern-S2 的數字都是 InternLM 自家的,且未經重現:

• 分子結構推理 — Intern-S2 在 MolecularIQ 上為 62.35,相較於 GPT-5.5 的 76.41。Intern-S2 落後。

• 科學工具使用 —— Intern-S2 在 TOMG-Bench 上為 66.76,GPT-5.5 則為 69.89。微幅落後。

• 生物分子指令 — Intern-S2 53.95 對 40.49。Intern-S2 明顯勝出。

• 高中數學 — Intern-S2 在 HMMT-2026 上取得 93.56,對比 GPT-5.5 的 97.06。Intern-S2 落敗。

• 一般知識 — Intern-S2 在 MMLU Pro 上為 89.77,相較之下為 88.20。Intern-S2 以些微差距勝出。

• 多模態知識 — 在 MMMU Pro 上達到 81.68 的水準。

• 終端機掌握度 — GPT-5.5 在 TerminalBench 2.1 上取得 79.40,而 Intern-S2 為 64.04。差距達十五點。

即使面對一個比自身舊一代的 OpenAI 模型,Intern-S2 在通用列目上仍是輸多贏少,並在科學類列目上勝出。面對 Sol——一個明確定位在 GPT-5.5 之上、用於最難推理的層級——通用能力差距幾乎肯定會擴大。證據中沒有任何內容支持「免費檢查點能在通用能力上與付費旗艦競爭」這個想法;而誠實的表述是,Intern-S2 是一個在總體上表現尚可、在其專長領域表現卓越的專家模型。

{{1}}免費{{/1}}是資本支出,不是{{2}}折扣{{/2}}

Intern-S2 的零授權成本是真的,但這並不等同於免費推論,而這正是這項比較開始變得實際的地方。一個 4030 億參數的檢查點需要一套夠份量的多 GPU 節點才能提供服務。如果你已經擁有那樣的算力,而且它還沒被充分利用,那麼下一次科學查詢的邊際成本就接近電費——這是一個真正強大的經濟位置,也是開放權重之所以存在的理由。如果你不擁有那樣的算力,「免費」就意味著得購買或租用硬體,而這筆帳算起來就完全不同了。

GPT-5.6 Sol 的經濟模式恰恰相反。沒有硬體要買,也沒有模型要自行運作。你支付的是按用量計費的費率——基礎方案為每百萬輸入 token 5.00 美元、每百萬輸出 token 30.00 美元,或目前於我們模型頁面上線的 4.00/20.00 美元促銷費率——而模型隨附 1.05M token 上下文窗口、128K 輸出上限、視覺、工具,以及自 2026 年 7 月 9 日 API 推出以來持續在生產環境運作的旗艦模型所累積的可靠性。Ultrafast 預覽版在晶圓級硬體上運行 Sol,輸出速度最高達每秒 750 個 token,將同一模型推向延遲關鍵型工作,不過它僅限於少數客戶使用,且未公布價格。你用這 30 美元買到的不只是能力——更是免去一支維運團隊。

• 權重 — Intern-S2 為 Apache-2.0 授權、可下載,對比 GPT-5.6 Sol 為封閉、僅提供 API。

• 成本結構 — Intern-S2 在 403B 檢查點上的資本支出,或按用量計費的官方 Intern API,對比 GPT-5.6 Sol 每百萬定價 $5.00 / $30.00、促銷價 $4.00 / $20.00。

• 上下文/輸出 — Intern-S2 最高 256K 文字、64K 多模態已評估;輸出未公開,相較 GPT-5.6 Sol 約 1.05M 上下文、128K 輸出。

• 輸入 — Intern-S2 文字、圖像、時間序列 vs GPT-5.6 Sol 文字與圖像。

• 獨立評分 — Intern-S2 尚無,相較於擁有長期公開評測紀錄的頂級旗艦 GPT-5.6 Sol。

• 速度層級 — Intern-S2 受限於硬體,對比 GPT-5.6 Sol Ultrafast preview 最高每秒 750 個輸出 token,依廠商所述。

A generated two-column scoreboard titled 'Intern-S2 vs GPT-5.6 Sol — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Cost self-host capex or Intern API, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, TerminalBench 2.1 64.04. Right column GPT-5.6 Sol lists Weights closed API only, Cost $5.00 / $30.00 list and $4.00 / $20.00 promo, Context 1.05M in / 128K out, Inputs text and image, Independent score flagship tier widely tested, TerminalBench 2.1 79.40. Footer reads 'Intern-S2 figures are InternLM's own and were measured against GPT-5.5, unreproduced; the TerminalBench row uses GPT-5.5 as the OpenAI reference. GPT-5.6 Sol pricing per OpenAI.'

免費檢查點真正勝出之處

有三種情況,Intern-S2 在沒有基準測試參與的情況下勝過 Sol。

第一項是資料存放地點。GPT-5.6 Sol 是封閉式 API——每個請求都會離開你的基礎架構,並在 Open​AI 的內容政策下,途經 Open​AI 的系統。採用 Apache-2.0 的 Intern-S2 則可在受監管環境內以氣隙(air-gapped)方式運行,處理在法律上無法傳送至第三方端點的資料。對製藥實驗室、醫院體系或國防承包商而言,這項特性不是一項功能,而是整個採購決策的關鍵,Sol 再強的能力都無法取代它。

第二個是模態。Intern-S2 接受時間序列輸入並產生預測;它也能以原生視覺表徵的方式讀取原始科學文獻頁面,而不是讀取擷取出來的文字。Sol 則接受文字與圖像。如果你的資料是地震儀紀錄、負載曲線,或掃描的圖表密集論文,Intern-S2 有一條 Sol 沒有的路徑,而該廠商的 Biology-Instructions 那一列(55.71,對比 GPT-5.5 的 10.52)正是反映這一點的數字。

第三點是微調。你可以取用 Intern-S2 的權重,用自己的專有實驗資料進行訓練,然後永久保留那個模型。無論出多少錢,你都無法用 Sol 做到這一點。對於競爭優勢在於專門資料集的團隊來說,一個可調整的開放檢查點,可能比一個更強大的凍結模型更有價值。

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

不選擇而同時執行兩者

能從這個組合中獲得最大效益的團隊,並不把它當成一道非此即彼的分岔。他們把一般性、對延遲敏感、成敗攸關的推理導向 GPT-5.6 Sol——它架在 OrcaRouter 上,以 Open​AI 的定價、0% 加價提供,並與其他 200 多個模型共用同一把金鑰,因此 Sol 的價格一有變動當天就會反映,而供應商狀況不佳的時段則由自動容錯移轉接手——同時,無論他們在哪裡執行,都把科學批次工作留在 Intern-S2 上。路由 DSL 讓這條界線清楚成形:困難的一般推理走一邊,文件與訊號分析走另一邊,而這種分工是一項設定,而不是第二套整合。

Intern-S2 不在 OrcaRouter 上;它是同日發布的 Apache-2.0 checkpoint,而你要取用它的途徑是供應商自家的 API 或自架部署。Sol 在 key 上。在這兩者之間,對於科學應用為重的應用程式,實務上的架構是:一個端點用於前沿呼叫,一個部署用於專門模型——並保留日後移動任一邊的選項。

A screenshot of the OrcaRouter model page for GPT-5.6 Sol at orcarouter.ai/models/openai/gpt-5.6-sol, captured September 13, 2026, showing the model tagged FEATURED by OpenAI dated 2026-07-09 with Vision, Tools, JSON and Reasoning tags, a 1M-token context window and 128K max output, and pricing tiles reading input $4.00 and output $20.00 per 1M tokens with 202.3 million tokens of traffic in seven days.

裁決

如果你需要應用程式所能嘗試的最艱難推理,希望它能在一次 API 呼叫中完成,並且願意為此支付計量制的旗艦費率,那麼 GPT-5.6 Sol 就是答案,而同日發布的開放檢查點並不會改變這一點。InternLM 自家的表格中,沒有任何內容顯示 Intern-S2 在一般能力上能與當前的 OpenAI 旗艦模型匹敵;該比較是針對前一代進行的,而這個開放模型仍在大多數一般能力列上落敗。

如果你的工作負載屬於科學性質、你的資料不能離開自家基礎設施,或者你需要以專有實驗結果進行微調,Intern-S2 就是真正能做到這些事的模型——而它的 Apache-2.0 授權意味著,你驗證過的版本就是你保留的版本。為硬體編列預算,預期要自行執行評估,並把它每一個已發布的數字都當成宣稱,直到 InternLM 以外有人能重現其中任何一個為止。

至於與你自行託管的模型並行的前沿模型呼叫:另外 200 多款模型讓封閉式旗艦模型以供應商定價、透過單一金鑰即可取用,因此專用部署與按量計費的模型可依路由規則互相替換。