一张生成的 hero 卡片,对比 Intern-S2 与 GPT-5.6 Sol:左侧展示一个科学图表页面和信号波形输入到一个开放权重模型,右侧是一个闭源前沿 API 端点并配有速度计,标注为 Apache-2.0 可免费下载并自行托管在你的 GPU 上,对比 $5.00 / $30.00 每 100 万 tokens 以及 1.05M 上下文 / 128K 输出,右下角带有 OrcaRouter 标识。
Guides & Insights

Intern-S2 对比 GPT-5.6 Sol:免费检查点与 30 美元旗舰

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这场对比里的价格乍看之下简直离谱。Intern-S2 是 InternLM 今天以 Apache-2.0 许可发布的一款 3970 亿参数多模态模型,下载不花钱,只要你自己有硬件来跑它,每次查询也不花钱。GPT-5.6 SolOpenAI 的旗舰推理档位,在 OpenAI 基础档位上的标价是每百万输入 token 5.00 美元、每百万输出 token 30.00 美元——不过 OpenAI 自 7 月底以来一直在推的促销价(我们自己的模型页面目前显示的也是这个)是输入 4.00 美元、输出 20.00 美元。这是一个实实在在的差距,也是任何人第一眼就会注意到的东西——但它同时也是这场对比中最没用的一个事实,因为 30 美元的模型和免费的那个模型并不是在争同一类活儿。当你的应用将要尝试的最难推理必须返回正确结果时,OpenAI 指向的就是 GPT-5.6 Sol 这一档。Intern-S2 则是一台科学仪器,带有一条在原始文献页面上训练出来的视觉通路,还有一个用于时间序列信号的预测头。问题不在于哪个更便宜,而在于你的工作负载真正需要的是哪一个,以及那个“免费”的到底是不是免费。

供应商表能告诉你什么,不能告诉你什么

InternLM 是将 Intern-S2 与 GPT-5.5 进行基准对比的,而不是 GPT-5.6 Sol。这一点值得放在最前面说明,因为目前流传的每一个“Intern-S2 击败 GPT”的说法,对比的都是 OpenAI 的上一代模型,任何把它当作 Sol 结果呈现的页面都是在做外推。GPT-5.6 系列还横跨三个层级——Sol 面向最难的工作,Terra 面向均衡的生产场景,Luna 面向高并发量——而 OpenAI 一直在积极调整它们的定价,所以从九月文章中引用的 Sol 数据可能已经过时了。

厂商的对比确实能确立的是这一点,但始终附带一个前提:每个 Intern-S2 数字都是 InternLM 自家提供的,且未经复现:

• 分子结构推理 — Intern-S2 在 MolecularIQ 上得 62.35,而 GPT-5.5 得 76.41。Intern-S2 落败。

• 科学工具使用——Intern-S2 在 TOMG-Bench 上取得 66.76 分,而 GPT-5.5 为 69.89 分。小幅落后。

• 生物分子指令 — Intern-S2 53.95 对 40.49。Intern-S2 明显胜出。

• 高中数学 —— 在 HMMT-2026 上,Intern-S2 得 93.56,而 GPT-5.5 得 97.06。Intern-S2 落败。

• 通用知识 — Intern-S2 在 MMLU Pro 上取得 89.77 分,对比 88.20 分。Intern-S2 以微弱优势胜出。

• 多模态知识 — 在 MMMU Pro 上达到 81.68。

• 终端掌控力 — GPT-5.5 在 TerminalBench 2.1 上取得 79.40,Intern-S2 为 64.04。相差十五个百分点。

即便面对早一代的 OpenAI 模型,Intern-S2 在通用任务项上也是输多赢少,而在科学任务项上则取得胜利。面对 Sol——一个被明确置于 GPT-5.5 之上、专攻最难推理的档位——通用能力上的差距几乎肯定会进一步扩大。证据中没有任何内容支持免费检查点能在通用能力上与付费旗舰相抗衡这一看法;诚实的表述是,Intern-S2 是一个专长型模型:通用能力尚可,在自己的赛道上则非常出色。

“免费”是资本支出,不是折扣

Intern-S2 的零授权成本确实不假,但这并不等同于免费推理,而正是在这里,比较才变得具有实际意义。一个 4030 亿参数的检查点需要一台强大的多 GPU 节点才能提供服务。如果你已经拥有这样的算力且其未被充分利用,那么下一次科学查询的边际成本就接近电费——这确实是一种极具优势的经济处境,也是开放权重之所以存在的原因。如果你不拥有这样的算力,“免费”就意味着购买或租用硬件,而成本账就完全不同了。

GPT-5.6 Sol 的经济账正好相反。没有需要购买的硬件,也没有需要运营的模型。你按计量费率付费——基础层级为每百万输入 token 5.00 美元、每百万输出 token 30.00 美元,或者按我们模型页面上当前生效的 4.00 美元/20.00 美元促销价——而该模型自带 105 万 token 上下文窗口、128K 输出上限、视觉、工具,以及一个自 2026 年 7 月 9 日 API 发布以来就投入生产的旗舰模型所积累的可靠性。Ultrafast 预览版在晶圆级硬件上运行 Sol,输出速度最高可达每秒 750 个 token,将这同一模型推向延迟关键型工作,不过它仅限一小部分客户使用,且未公布价格。你用这 30 美元买到的不仅是能力——更是无需运营团队。

• 权重 — Intern-S2 采用 Apache-2.0 许可,可下载;而 GPT-5.6 Sol 为闭源,仅提供 API。

• 成本结构——针对 403B 检查点的 Intern-S2 资本支出,或按量计费的官方 Intern API,对比 GPT-5.6 Sol 每百万 $5.00 / $30.00 的目录价、$4.00 / $20.00 的促销价。

• 上下文 / 输出——Intern-S2 经评估支持最高 256K 文本、64K 多模态;输出未公布,对比 GPT-5.6 Sol 约 1.05M 上下文、128K 输出。

• 输入 — Intern-S2 文本、图像、时间序列 对比 GPT-5.6 Sol 文本和图像。

• 独立评分 — Intern-S2 暂无 vs GPT-5.6 Sol 顶级旗舰,拥有长期的公开评测记录。

• 速度层级 —— Intern-S2 受硬件制约,对比 GPT-5.6 Sol Ultrafast 预览版,最高可达每秒 750 个输出 token,据厂商称。

A generated two-column scoreboard titled 'Intern-S2 vs GPT-5.6 Sol — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Cost self-host capex or Intern API, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, TerminalBench 2.1 64.04. Right column GPT-5.6 Sol lists Weights closed API only, Cost $5.00 / $30.00 list and $4.00 / $20.00 promo, Context 1.05M in / 128K out, Inputs text and image, Independent score flagship tier widely tested, TerminalBench 2.1 79.40. Footer reads 'Intern-S2 figures are InternLM's own and were measured against GPT-5.5, unreproduced; the TerminalBench row uses GPT-5.5 as the OpenAI reference. GPT-5.6 Sol pricing per OpenAI.'

免费检查点真正胜出的地方

有三种情况,Intern-S2 能在没有基准测试参与的情况下胜过 Sol。

第一个是数据驻留。GPT-5.6 Sol 是一个封闭 API——每个请求都会离开你的基础设施,并按照 Open​AI 的内容政策,经由 Open​AI 的系统传输。在 Apache-2.0 许可下的 Intern-S2 可以在受监管环境中以气隙方式运行,处理法律上不能发送到第三方端点的数据。对于制药实验室、医院系统或国防承包商而言,这种属性不是一项功能;它就是整个采购决策,而再多的 Sol 能力也无法替代它。

第二点是模态。Intern-S2 接受时间序列输入并生成预测;它还能以原生视觉表示,而非提取后的文本,读取原始科学文献页面。Sol 接受文本和图像。如果你的数据是地震仪记录、负荷曲线,或扫描的图密集论文,Intern-S2 有一条 Sol 不具备的路径,而厂商的 Biology-Instructions 一行(55.71 对 GPT-5.5 的 10.52)正是反映这一点的数字。

第三点是微调。你可以取用 Intern-S2 的权重,用自己专有的实验数据来训练,然后永久保留那个模型。而对 Sol 来说,无论出多少钱都做不到这一点。对于竞争优势来自专门数据集的团队来说,一个可适配的开放检查点可能比一个更强的冻结模型更有价值。

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

同时运行两者而不做选择

那些从这种搭配中获得最大收益的团队并不把它当作一次分叉。他们把通用的、对延迟敏感、高风险的推理交给 GPT-5.6 Sol——而它运行在 OrcaRouter 上,按 OpenAI 的标价、0% 加价,与 200 多个其他模型共用同一个密钥,因此 Sol 的价格一旦变动,当天就会同步体现,供应商某个时段出故障也有自动故障转移兜底——同时他们把科学批处理工作留在 Intern-S2 上,无论在哪里运行。路由 DSL 让这条边界变得明确:高难度的通用推理走一边,文档与信号分析走另一边,而这种拆分是一项配置,而不是第二次集成。

Intern-S2 不在 OrcaRouter 上;它是一个同日发布的 Apache-2.0 检查点,而你接入它的途径是厂商自己的 API 或自托管部署。Sol 已在此密钥上可用。在两者之间,对于科学密集型应用,实用的架构是一个端点用于前沿调用,一个部署用于专用模型——并保留日后迁移任意一侧的选项。

A screenshot of the OrcaRouter model page for GPT-5.6 Sol at orcarouter.ai/models/openai/gpt-5.6-sol, captured September 13, 2026, showing the model tagged FEATURED by OpenAI dated 2026-07-09 with Vision, Tools, JSON and Reasoning tags, a 1M-token context window and 128K max output, and pricing tiles reading input $4.00 and output $20.00 per 1M tokens with 202.3 million tokens of traffic in seven days.

裁决

如果你需要你的应用将要尝试的最难推理,希望在一次 API 调用中完成,并且愿意为此支付按量计费的旗舰费率,那么 GPT-5.6 Sol 就是答案,同日发布的开源检查点也不会改变这一点。InternLM 自己的表格中没有任何内容表明 Intern-S2 在通用能力上能匹配当前的 Open​AI 旗舰;该比较是针对上一代进行的,而这个开源模型仍然在大多数通用项目上落败。

如果你的工作负载属于科学计算,你的数据不能离开自己的基础设施,或者你需要基于专有实验结果进行微调,那么 Intern-S2 正是能真正做到这些事情的模型——而且其 Apache-2.0 许可证意味着,你验证过的版本就是你能保留的版本。要为硬件做好预算,要预期得自行开展评估,并且要把关于它的每一个已发布数字都视为一种声称,直到 InternLM 之外的某个人复现出其中一个。

对于前沿模型调用,以及你自行托管的任何模型:另有 200 多款模型让闭源旗舰模型仍可凭单个密钥按供应商标价调用,因此专用部署与按量计费模型可通过路由规则相互替换。