
Intern-S2-397B 对比 Grok 4.6:谁有权转动旋钮
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Intern-S2-397B 与 Grok 4.6 的发布相隔约一个月,却对同一个根本问题给出了截然相反的答案:推理的控制权该归谁。Grok 4.6 是 xAI 的旗舰模型,于 2026 年 8 月 12 日上线,它卖给你的只是一个旋钮——一个封闭 API 上可配置的推理强度控制,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,窗口为 500,000 token,xAI 的服务端工具另行计费。Intern-S2-397B 则是上海人工智能实验室 InternLM 团队于 9 月 13 日以 Apache-2.0 协议发布的 4030 亿参数科学多模态模型,它把整台机器都交到你手上——权重、思考开关、视觉通路、时间序列头——并指望你自己把它跑起来。一个是带着旋钮租来的;另一个则是彻底归你所有。这里真正重要的比较,不在于谁在基准测试榜单上得分更高,而在于你的工作负载究竟需要哪种控制权,以及每种控制权的代价是什么。
两个不同的表盘
区分这两者最清晰的方法,就是看推理控制位于何处。Grok 4.6 通过 xAI 的 API 暴露了一个推理努力程度设置,而围绕它还有一整套服务器端工具——函数调用、网络搜索、X 搜索、代码执行——这些由 xAI 运营并单独计费。你调整努力程度,串联它提供的工具,却从不触碰任何权重。模型的行为是 xAI 的财产,也是 xAI 的问题;你的杠杆是请求中的一个参数。
Intern-S2-397B 给你的则是另一组控制杆,而且它们位于技术栈的更底层。思维模式默认开启,你可以按请求通过 enable_thinking=False 将其关闭。由于该模型采用 Apache-2.0 许可,你还可以获取权重,用自己的数据微调推理行为本身,然后将结果部署在 LMDeploy、vLLM 或 SGLang 上。它的输入面比文本加图像的 API 更宽:它能接收时间序列信号并生成预测——这一能力目前仅通过 LMDeploy 接入——并且它针对沙箱环境中的长周期智能体任务进行了训练。代价同样清楚——只有当你有能力运维随之而来的硬件和部署栈时,这种程度的控制才有意义。
• 推理控制 — Grok 4.6:闭源 API 上的推理强度调节旋钮,对比 Intern-S2-397B:enable_thinking 开关,外加 Apache-2.0 许可下的完整权重级控制。
• 工具 — Grok 4.6:xAI 的服务器端网页搜索、X 搜索和代码执行,与 Intern-S2-397B 相比单独计费:工具调用需由你自行接入,外加通过 LMDeploy 的时间序列预测路径。
• 输入 — Grok 4.6:文本、图像、文件 vs Intern-S2-397B:文本、图像、时间序列。
• 上下文——Grok 4.6:500,000 个 token,对比 Intern-S2-397B:256K 文本推理、64K 多模态,这两个数字均来自模型卡。
• 价格 — Grok 4.6:每 100 万 token $2.00 / $6.00,超过 20 万 token 后升至 $4.00 / $12.00;而 Intern-S2-397B:无价目表;可自行托管或使用官方 Intern API。
这些数字实际涵盖的内容
下文中每一个 Intern-S2-397B 的数值都来自 InternLM 自己,经由 OpenCompass、VLMEvalKit 和 AgentCompass 运行得出,并与权重一同发布,没有经过独立复现。Grok 4.6 的数字则是另一回事:它们是模型上线后通过公开竞技场和 Artificial Analysis 逐步积累起来的,因此带有第三方标签。
在独立评测这边,Grok 4.6 在当前 Artificial Analysis 智能指数上为 44,GPQA Diamond 为 94.9,Humanity's Last Exam 为 61.0,编码得分为 76.8,而 Artificial Analysis 给出的 TerminalBench 2.1 数字接近 80.3。在厂商这边,Intern-S2-397B 的模型卡报告 MMLU Pro 为 89.77,HMMT-2026 为 93.56,MMMU Pro 为 81.68,SWE-bench-Pro 为 68.54,同时还有几项科学类成绩,让它看起来像是另一个物种:Biology-Instructions 为 55.71,SciReasoner 1.5 为 63.28,Mol-Instructions 为 53.95,MolecularIQ 为 62.35。厂商表格中最该让智能体构建者心里一紧的数字,是 TerminalBench 2.1 的 64.04——模型自己的制造者报告称,这一数字大幅落后于更早的闭源一代,而且恰恰是在像 Grok 4.6 这样的租用前沿模型最强的终端任务赛道上。
把这种分化看作一幅画像,而不是一份排名。Intern-S2-397B 是一个科学领域的专才,同时也是一名合格的通用模型;Grok 4.6 则是一个对科学略有兴趣的通用型模型。科学类目表现悬殊是意料之中的——没有任何通用旗舰模型是在同时包含图表、版式和符号记法的科学文献原始页面上完成预训练的,而这恰恰是 Intern-S2-397B 所围绕构建的范式。两个证据基础中都没有任何内容支持“Intern-S2-397B 在任意推理上与 Grok 4.6 一样好”,Grok 4.6 的证据也没有任何地方表明它针对多组学序列分析做过调优。
控制的代价
Grok 4.6 有一个可以直接填进电子表格的价格:每百万输入 token 2.00 美元,每百万输出 token 6.00 美元;一旦提示词超过 200,000 token,费率就会升至 4.00 美元 / 12.00 美元,此外还有可选的优先层级,可获得更快的响应。它可通过 OrcaRouter 获取,按 xAI 的标价以 0% 加价原样转售,因此 xAI 一调价,当天就会同步到这里,没有中间商差价——你租用的那个旋钮,始终按厂商给它的定价来计价。
Intern-S2-397B 完全没有公布按 token 计费的费率。模型卡提到官方的 Intern API,但人们真正想比较的经济账是自托管方案:一个 403B 参数的检查点,BF16 精度下约 807 GB 权重、分布在 188 个分片中,因此需要一台够格的多 GPU 节点,而 FP8 版本大致能把占用减半。如果你已经拥有这样的算力,那么下一次科学查询的边际成本就接近于电费——而这正是 Apache-2.0 立场的全部意义所在。如果你没有这样的算力,那么这个“免费”模型就是一笔资本支出试点,而不是一项日常开支。
在这种特定搭配中,路由器换来的不是价格优势,而是接缝。Grok 4.6 依托你已有的密钥来处理一般生产流量;Intern-S2-397B 并不通过 OrcaRouter 路由——它是一个全新的检查点,而通往它的路径是供应商自己的 API 或自托管部署。把一般的、对延迟敏感的推理交给按量计费的模型,把科学批处理工作留在你自行运行的模型上,并让自动故障转移在任一方的端点不健康时为你兜底。两者之间的边界变成一条路由规则,而不是第二次集成。

该选哪一个
当任务属于通用型、推理必须快速且正确地返回、而你又不想自己拥有支撑这一切的技术栈时,就选 Grok 4.6。它 500K 的上下文窗口、实测 94.9 的 GPQA Diamond 成绩以及工具套件都是生产级特性,而 $2/$6 的计价表就是你为“无需运维任何东西”所付的费用。
当输入是科学性的——图表密集的论文、分子结构图、时间序列信号——并且推理必须发生在无法离开你的环境的数据上,或者发生在你想自己微调的行为上时,就选 Intern-S2-397B。Apache-2.0 让这成为可能;任何租用的 API 都做不到。要为硬件做好预算,短期内别指望有独立的评测榜单,并且把它的模型卡上的每一个数字都当作一种宣称,直到 InternLM 之外有人复现出其中一个为止。


