一张生成的主视觉卡片,对比 Intern-S2-397B 与 Grok 4.6:左侧是一个开放权重的科学模型,带有一个标注为 enable_thinking 的推理开关和一条时间序列波形;右侧是一个封闭的云端端点,带有一个推理强度旋钮和服务器端工具图标,并标注了 Apache-2.0 自托管控制与 $2 / $6 按量计费 API 之间的对比,右下角为 OrcaRouter 标志。
Guides & Insights

Intern-S2-397B 对比 Grok 4.6:谁有权转动旋钮

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Intern-S2-397B 与 Grok 4.6 的发布相隔约一个月,却对同一个根本问题给出了截然相反的答案:推理的控制权该归谁。Grok 4.6 是 x​AI 的旗舰模型,于 2026 年 8 月 12 日上线,它卖给你的只是一个旋钮——一个封闭 API 上可配置的推理强度控制,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,窗口为 500,000 token,x​AI 的服务端工具另行计费。Intern-S2-397B 则是上海人工智能实验室 InternLM 团队于 9 月 13 日以 Apache-2.0 协议发布的 4030 亿参数科学多模态模型,它把整台机器都交到你手上——权重、思考开关、视觉通路、时间序列头——并指望你自己把它跑起来。一个是带着旋钮租来的;另一个则是彻底归你所有。这里真正重要的比较,不在于谁在基准测试榜单上得分更高,而在于你的工作负载究竟需要哪种控制权,以及每种控制权的代价是什么。

两个不同的表盘

区分这两者最清晰的方法,就是看推理控制位于何处。Grok 4.6 通过 xAI 的 API 暴露了一个推理努力程度设置,而围绕它还有一整套服务器端工具——函数调用、网络搜索、X 搜索、代码执行——这些由 xAI 运营并单独计费。你调整努力程度,串联它提供的工具,却从不触碰任何权重。模型的行为是 xAI 的财产,也是 xAI 的问题;你的杠杆是请求中的一个参数。

Intern-S2-397B 给你的则是另一组控制杆,而且它们位于技术栈的更底层。思维模式默认开启,你可以按请求通过 enable_thinking=False 将其关闭。由于该模型采用 Apache-2.0 许可,你还可以获取权重,用自己的数据微调推理行为本身,然后将结果部署在 LMDeploy、vLLM 或 SGLang 上。它的输入面比文本加图像的 API 更宽:它能接收时间序列信号并生成预测——这一能力目前仅通过 LMDeploy 接入——并且它针对沙箱环境中的长周期智能体任务进行了训练。代价同样清楚——只有当你有能力运维随之而来的硬件和部署栈时,这种程度的控制才有意义。

• 推理控制 — Grok 4.6:闭源 API 上的推理强度调节旋钮,对比 Intern-S2-397B:enable_thinking 开关,外加 Apache-2.0 许可下的完整权重级控制。

• 工具 — Grok 4.6:xAI 的服务器端网页搜索、X 搜索和代码执行,与 Intern-S2-397B 相比单独计费:工具调用需由你自行接入,外加通过 LMDeploy 的时间序列预测路径。

• 输入 — Grok 4.6:文本、图像、文件 vs Intern-S2-397B:文本、图像、时间序列。

• 上下文——Grok 4.6:500,000 个 token,对比 Intern-S2-397B:256K 文本推理、64K 多模态,这两个数字均来自模型卡。

• 价格 — Grok 4.6:每 100 万 token $2.00 / $6.00,超过 20 万 token 后升至 $4.00 / $12.00;而 Intern-S2-397B:无价目表;可自行托管或使用官方 Intern API。

这些数字实际涵盖的内容

下文中每一个 Intern-S2-397B 的数值都来自 InternLM 自己,经由 OpenCompass、VLMEvalKit 和 AgentCompass 运行得出,并与权重一同发布,没有经过独立复现。Grok 4.6 的数字则是另一回事:它们是模型上线后通过公开竞技场和 Artificial Analysis 逐步积累起来的,因此带有第三方标签。

在独立评测这边,Grok 4.6 在当前 Artificial Analysis 智能指数上为 44,GPQA Diamond 为 94.9,Humanity's Last Exam 为 61.0,编码得分为 76.8,而 Artificial Analysis 给出的 TerminalBench 2.1 数字接近 80.3。在厂商这边,Intern-S2-397B 的模型卡报告 MMLU Pro 为 89.77,HMMT-2026 为 93.56,MMMU Pro 为 81.68,SWE-bench-Pro 为 68.54,同时还有几项科学类成绩,让它看起来像是另一个物种:Biology-Instructions 为 55.71,SciReasoner 1.5 为 63.28,Mol-Instructions 为 53.95,MolecularIQ 为 62.35。厂商表格中最该让智能体构建者心里一紧的数字,是 TerminalBench 2.1 的 64.04——模型自己的制造者报告称,这一数字大幅落后于更早的闭源一代,而且恰恰是在像 Grok 4.6 这样的租用前沿模型最强的终端任务赛道上。

把这种分化看作一幅画像,而不是一份排名。Intern-S2-397B 是一个科学领域的专才,同时也是一名合格的通用模型;Grok 4.6 则是一个对科学略有兴趣的通用型模型。科学类目表现悬殊是意料之中的——没有任何通用旗舰模型是在同时包含图表、版式和符号记法的科学文献原始页面上完成预训练的,而这恰恰是 Intern-S2-397B 所围绕构建的范式。两个证据基础中都没有任何内容支持“Intern-S2-397B 在任意推理上与 Grok 4.6 一样好”,Grok 4.6 的证据也没有任何地方表明它针对多组学序列分析做过调优。

控制的代价

Grok 4.6 有一个可以直接填进电子表格的价格:每百万输入 token 2.00 美元,每百万输出 token 6.00 美元;一旦提示词超过 200,000 token,费率就会升至 4.00 美元 / 12.00 美元,此外还有可选的优先层级,可获得更快的响应。它可通过 OrcaRouter 获取,按 x​AI 的标价以 0% 加价原样转售,因此 x​AI 一调价,当天就会同步到这里,没有中间商差价——你租用的那个旋钮,始终按厂商给它的定价来计价。

Intern-S2-397B 完全没有公布按 token 计费的费率。模型卡提到官方的 Intern API,但人们真正想比较的经济账是自托管方案:一个 403B 参数的检查点,BF16 精度下约 807 GB 权重、分布在 188 个分片中,因此需要一台够格的多 GPU 节点,而 FP8 版本大致能把占用减半。如果你已经拥有这样的算力,那么下一次科学查询的边际成本就接近于电费——而这正是 Apache-2.0 立场的全部意义所在。如果你没有这样的算力,那么这个“免费”模型就是一笔资本支出试点,而不是一项日常开支。

在这种特定搭配中,路由器换来的不是价格优势,而是接缝。Grok 4.6 依托你已有的密钥来处理一般生产流量;Intern-S2-397B 并不通过 OrcaRouter 路由——它是一个全新的检查点,而通往它的路径是供应商自己的 API 或自托管部署。把一般的、对延迟敏感的推理交给按量计费的模型,把科学批处理工作留在你自行运行的模型上,并让自动故障转移在任一方的端点不健康时为你兜底。两者之间的边界变成一条路由规则,而不是第二次集成。

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

该选哪一个

当任务属于通用型、推理必须快速且正确地返回、而你又不想自己拥有支撑这一切的技术栈时,就选 Grok 4.6。它 500K 的上下文窗口、实测 94.9 的 GPQA Diamond 成绩以及工具套件都是生产级特性,而 $2/$6 的计价表就是你为“无需运维任何东西”所付的费用。

当输入是科学性的——图表密集的论文、分子结构图、时间序列信号——并且推理必须发生在无法离开你的环境的数据上,或者发生在你想自己微调的行为上时,就选 Intern-S2-397B。Apache-2.0 让这成为可能;任何租用的 API 都做不到。要为硬件做好预算,短期内别指望有独立的评测榜单,并且把它的模型卡上的每一个数字都当作一种宣称,直到 InternLM 之外有人复现出其中一个为止。

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.