一张生成的 hero 卡片对比 Intern-S2-397B 与 Kimi K3:左侧是一页科学文献,其中的分子结构图接入一张 4030 亿参数的开放权重卡片;右侧是一条长文档飘带,接入一个 2.8 万亿参数的旗舰模型,并配有 1M 上下文计量条;OrcaRouter 标志位于右下角。
Guides & Insights

Intern-S2-397B 与 Kimi K3:397B 科学模型与 2.8T 推理巨头

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Intern-S2-397B 和 Kimi K3 分别站在那条将定义 2026 年余下时间的开放权重分界线两侧:一边是可下载的科学专家模型,另一边是经过独立验证的长上下文通用模型。Intern-S2-397B 是 InternLM 于 2026 年 9 月 13 日以 Apache-2.0 许可发布的 4030 亿参数科学多模态模型——没有价目表,没有独立评分,其视觉路径是在科学文献的原始页面上训练的。Kimi K3 是 Moonshot AI 的 2.8 万亿参数混合专家旗舰模型,于 2026 年 7 月推出,定价为每百万输入 token 3.00 美元、每百万输出 token 15.00 美元,并于 7 月 27 日以 Modified MIT 许可证开放权重,且已历经六周的独立评估。这场对决的不寻常之处在于,两个模型都怀有同样的长时程雄心——持续处理一项庞大而混乱的任务——却以相反的方向加以解决。

都雄心勃勃,机制却截然相反

这份雄心是共通的:每个模型都想成为在任务漫长时仍能持续下去的那一个。它们实现这一点的方式各不相同,而差异是架构性的。

Kimi K3 的回答就是上下文。输入和输出两端各 1,048,576 token 的窗口,意味着整个代码仓库、整个数据室,或一个五十步的智能体循环,都能装进同一段对话里。据报道,Moonshot 的 Mooncake 推理栈在编程类工作负载上能将缓存命中率维持在 90% 以上,这正是每百万输出 15 美元的价格在实践中得以维系的原因。Kimi K3 暴露了一个顶层的 reasoning_effort 控制项,不接受任何采样参数,默认以最大深度推理,并且要求你在多轮工具循环中逐字回放此前的 reasoning_content 和 tool_calls,否则质量会下降。

Intern-S2-397B 的答案是特化加上权重级控制。它的上下文——256K 文本推理和 64K 多模态,这两个数字均来自模型卡——属于另一类窗口,足以应对一篇有分量的论文或一次长时间的研究会话,但不足以承载百万 token 的工作集。它转而提供的是能够原生阅读科学文献的视觉路径——将图表、版面、符号记法与文字表述一并理解——以及能生成预测的时间序列输入,同时还有默认开启、可按请求切换的思考能力。如果你的长任务是科学性的,这个模型正是为此而训练的;如果你的长任务是代码库,那它就不是拥有百万 token 窗口来应对这一任务的那个模型。

• 上下文长度 — Kimi K3:输入与输出均为 1,048,576 tokens,相比之下 Intern-S2-397B 为 256K 文本 / 64K 多模态。

• 规模 — Kimi K3:总计 2.8T,每个 token 激活约 104B;相较 Intern-S2-397B:总计 403B,512 个专家 / 激活 10 个。

• 控制面 —— Kimi K3:reasoning_effort 旋钮,无采样参数 vs Intern-S2-397B:enable_thinking 开关,外加 Apache-2.0 下的完整权重级控制。

• 输入 — Kimi K3:文本、图像 vs Intern-S2-397B:文本、图像、时间序列。

• 权重 — Kimi K3:以 Modified MIT 开源(7月27日)对比 Intern-S2-397B:以 Apache-2.0 开源(9月13日)。

• 独立证据——Kimi K3:六周的第三方评分;对比 Intern-S2-397B:暂无。

证据不对称才是真正的区别所在

Kimi K3 经历了独立测评的严苛检验,最终交出了足以让人信服的成绩。Artificial Analysis 在其当前的 Intelligence Index 上给出了四十多分的中段成绩,GPQA Diamond 在 90 分出头,HLE 在四十几分的中段,独立测得的长上下文召回率为 88.7,编程得分在七十几分的中段。它在 Frontend Code Arena 上位居榜首(Elo 在 1670 分段),并在 BrowseComp 上取得 91.2 分,是该长时程检索基准上的最高分——不过 Moonshot 自身也提醒,K3“仍落后于最强大的专有模型”,且其发布日的若干项数据仍属厂商自行报告。

Intern-S2-397B 的证据是它自己的发布表格,经由 OpenCompass、VLMEvalKit 和 AgentCompass 跑出,在你读到本文的数小时前刚刚公布。每一个数字都出自厂商自己且未被复现:MMLU Pro 89.77、MMMU Pro 81.68、HMMT-2026 93.56、SWE-bench-Pro 68.54,以及 TerminalBench 2.1 的 64.04——卡片显示这一数字大幅落后于更早一代的闭源模型。它的科学类行目才是支撑专家论点的那些数字:Biology-Instructions 上 55.71、SciReasoner 1.5 上 63.28、Mol-Instructions 上 53.95、MolecularIQ 上 62.35。这两套证据基础彼此并不相交,正因如此,对这场对决最诚实的表述不是“谁会赢”,而是“你的工作负载需要哪一种证据”。

A generated two-column scoreboard titled 'Intern-S2-397B vs Kimi K3 — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Biology-Instructions 55.71 vendor-reported. Right column 'Kimi K3': Weights Modified MIT open; Scale 2.8T total, ~104B active; Context 1M tokens in and out; Inputs text, image; Independent score AA Index mid-40s, long-context recall 88.7; Price .00 / 5.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Kimi K3 figures per Artificial Analysis and Moonshot AI.'

各项成本:开放权重版

两个模型均为开放权重,这使成本问题从常见的“按量计费还是免费”叙事,转变为对两种托管方案的比较。Kimi K3 有已公布的 API 价格——按 Moonshot 的标价,每百万 token 为 $3.00 / $15.00,在 OrcaRouter 上以 0% 加价透传,此外还有缓存读取定价——同时它也可下载:一个 96 分片的开放权重版本,需要超节点级硬件、64 个或更多加速器才能提供服务。自托管 K3 的实际受众是拥有数据中心预算的团队。Intern-S2-397B 则完全没有公布 API 价格;模型卡指向官方 Intern API,而真正的经济账在于自托管:BF16 下约 807 GB 权重、分布在 188 个分片中,一台重量级多 GPU 节点,而 FP8 版本可将占用削减约一半。

只要你做好路由,两个模型都能通过同一道接缝调用:Kimi K3 已上架 OrcaRouter,按 Moonshot 的标价、0% 加价,而 Intern-S2-397B 并未接入路由——它是一个全新的 Apache-2.0 检查点,要使用它,路径只能是厂商自家的 API,或自行托管部署。这一组合中,路由的价值在于:把长上下文通用模型的流量留在你已有的密钥上,把科学批量任务交给你自己运行的模型,并在两者之间自动故障转移。DSL 让这条边界变成一项配置,而不是第二次集成。

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.

裁决

当任务属于长上下文通用型工作时——全仓库编程、持续运行的智能体循环、需要一百万 token 工作记忆的知识工作——并且你希望其背后有独立评分榜支持时,选择 Kimi K3。从各个意义上说,它都是证据更充分的模型,其开放权重是真实存在的(Modified MIT,7 月 27 日),而如果你已经在运营超级节点级基础设施,那么借助缓存,其每 token 的经济性也很有优势。

当任务属于科学领域时,选择 Intern-S2-397B:图表密集的论文、分子图示、扫描文献、时间序列信号,以及必须留在你边界内的数据,或你想基于专有结果进行微调的权重。Apache-2.0 让这成为可能,任何租用的 API 都做不到,而且模型卡中的科学类条目与通用模型当初被调优所针对的东西完全不是同一类。为硬件做好预算,运行你自己的评估,并把关于它的每一个已发布数字都当作一种声称,直到 InternLM 之外的某个人复现出其中任何一个。

A screenshot of the OrcaRouter model page for Kimi K3 at orcarouter.ai/models/kimi/kimi-k3, captured September 13, 2026, showing the model listing with its provider MoonshotAI, 1,048,576-token context window, and .00 / 5.00 per-million-token pricing displayed alongside the surrounding catalogue.