一张生成的主视觉卡片,对比 Intern-S2-397B 与 Qwen3.8-Max:左侧展示一个开放的科研检查点,带有图表页输入和 Apache-2.0 徽章;右侧展示一个按量计费的旗舰端点,带有显示 $2 / $6 的费率卡磁贴和 1M token 上下文计量条,右下角带有 OrcaRouter 标志。
Guides & Insights

Intern-S2-397B vs Qwen3.8-Max:两款中国旗舰,截然相反的经济赌注

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Intern-S2-397B 和 Qwen3.8-Max 是 2026 年 9 月初中国最具影响力的两款旗舰发布,而它们押下了截然相反的经济赌注。Intern-S2-397B 是上海人工智能实验室 InternLM 团队于 9 月 13 日以 Apache-2.0 许可发布的 4030 亿参数科学多模态模型,它押注开放权重才是赢得科学和智能体工作负载的路径:没有按 token 计费的价格,权重放在 Hugging Face 上,用你自己的硬件来计量。Qwen3.8-Max 是阿里巴巴的 2.4 万亿参数旗舰,于 8 月 3 日正式发布(GA),并在 9 月 2 日更新,它押注的是定价 API:在 100 万 token 上下文下,每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,开放权重在 GA 一周后推出,而且独立的 Artificial Analysis 评分已经上榜。两者之间的对决,与其说是谁的基准测试胜出,不如说是哪一种押注——拥有权,还是按量计费的端点——更契合你工作负载的形态。

两款旗舰,两场豪赌

Qwen3.8-Max 是阿里巴巴 Qwen 系列中能力最强的层级,是一款稀疏混合专家模型,总参数量达 2.4 万亿,每个 token 激活约 950 亿参数,由 512 个专家组成,其中 10 个激活,外加一个共享专家。它具备 1M token 上下文窗口(在托管 API 中启用思考时为 983,616 token)、131,072 token 输出上限,支持文本、图像和视频输入,并通过 OpenAI 兼容端点提供服务。其标志性定价举措是统一费率:无论你的提示是 5,000 token 还是 900,000 token,价格都是相同的 $2.00 / $6.00,缓存输入定价更低——没有长上下文附加费,而这正是大多数竞争对手仍在收费的杠杆。阿里巴巴在其自己的迁移指南中将其直接对标 GPT-5.5Claude Opus 4.7 和 Gemini 3.1 Pro。

Intern-S2-397B 是一种形态不同的旗舰模型。它是一个专家混合模型,拥有 60 层和 512 个专家(每个 token 激活 10 个),具备 256K 文本推理上下文和 64K 多模态上下文,输入面涵盖文本、图像和时间序列,并采用一种预训练范式:直接读取科学文献的原始页面——图表、版面、符号记法和行文——而不是先解析出文本。其强化学习横跨二十多个科学领域,并且它是在沙盒环境中为长时程智能体工作而训练的。它的定价不是一张价目表,而是价目表的缺席:自行托管 Apache-2.0 权重,或申请获取官方 Intern API 的访问权限。

• 价格 — Intern-S2-397B:无价目表;自托管或 Intern API,对比 Qwen3.8-Max:每 1M 统一 $2.00 / $6.00,缓存输入更低。

• 规模 — Intern-S2-397B:总参数量 403B,512 个专家 / 10 个激活,对比 Qwen3.8-Max:总参数量 2.4T,激活 95B,512 个专家 / 10 个 + 1 个共享。

• 上下文 — Intern-S2-397B:256K 文本 / 64K 多模态,对比 Qwen3.8-Max:100 万 tokens,固定费率。

• 输入 — Intern-S2-397B:文本、图像、时间序列 vs Qwen3.8-Max:文本、图像、视频。

• 权重 — Intern-S2-397B:Apache-2.0,发布当天即开放;而 Qwen3.8-Max:自定义 Qwen3.8-Max 许可证,在 GA 后于 8 月 12 日开放。

• 独立评分 — Intern-S2-397B:暂无 vs Qwen3.8-Max:AA Intelligence Index 40,GPQA Diamond 92.7。

两个表都是供应商表,其中只有一个有裁判。

两款模型发布时都附带了厂商自行制作的基准测试表,这使得二者的数据来源规范如出一辙,而实测战绩却各有不同。此后,Qwen3.8-Max 的独立数据不断累积:Artificial Analysis 在其当前版本的 Intelligence Index 上给它打出 40 分,其中 GPQA Diamond 为 92.7、HLE 为 43.0、独立编程得分为 71.8,而在当前计分标准下,每个索引任务的成本约为 2.67 美元。这些数字来自第三方追踪机构实测所得——这是这两款旗舰模型中任何一款所迎来的首位真正意义上的裁判。

Intern-S2-397B 的证据是它自己的模型卡,通过 OpenCompass、VLMEvalKit 和 AgentCompass 跑出来,并与权重一同发布:MMLU Pro 89.77、MMMU Pro 81.68、HMMT-2026 93.56、SWE-bench-Pro 68.54,以及 TerminalBench 2.1 的 64.04——这个数字在模型卡本身中就显示输给了更早的闭源一代。它的科学类条目正是专用模型论据成立的原因:Biology-Instructions 55.71、SciReasoner 1.5 63.28、Mol-Instructions 53.95、MolecularIQ 62.35。其中每一项都是 InternLM 自己的,未获复现。把这两个证据基础并排来看,它们从相反方向讲述了同一个故事:一个模型是专用模型,通用条目表现尚可,却没有外部测量;另一个是通用模型,拥有独立评分,却没有科学调优。

A generated two-column scoreboard titled 'Intern-S2-397B vs Qwen3.8-Max — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Price self-host or Intern API. Right column 'Qwen3.8-Max': Weights custom Qwen3.8-Max licence, opened Aug 12; Scale 2.4T total, 95B active; Context 1M flat-rate tokens; Inputs text, image, video; Independent score AA Index 40, GPQA 92.7; Price $2.00 / $6.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Qwen3.8-Max figures per Artificial Analysis and Alibaba.'

金钱形态究竟能买到什么

统一的 $2 / $6 计费标准是 Qwen3.8-Max 的标志性举措,值得详细说明它究竟带来了什么。一个仓库分析智能体若在单次调用中推入 20 万个输入 token 的代码上下文,其支付的每 token 费率与一次简短聊天相同——没有长提示词附加费;而借助缓存,稳定的代码上下文在重复流量下会大幅拉低有效输入价格。该模型还可以依据阿里​巴巴的定制许可证以开放权重形式调用,该许可证允许在注明出处的前提下商用,并设有基于规模的门槛:月活跃用户超过 1 亿或月收入超过 2000 万美元时需另作约定,而大型模型即服务业务则需签订单独协议。

Intern-S2-397B 的经济账正好相反:完全没有按量计费,但需要一笔资本支出。其权重在 BF16 下约为 807 GB,分布在 188 个分片上——是一台不折不扣的多 GPU 节点——而 FP8 版本可将占用空间缩减约一半。如果你已经拥有这样的算力,下一次科学查询的边际成本就接近电费,而这正是这场赌注:自有硬件让专用模型在边际上变得便宜。如果你没有自己的硬件,这个“免费”模型只是一个试点,而官方 Intern API 是唯一按量计费的替代方案。

只要做好路由,两个旗舰模型就能共用同一条接缝。 Qwen3.8-Max 已上线 OrcaRouter,按 Ali​baba 的目录价透传,0% 加价,因此 $2 / $6 的统一费率以及未来任何降价都会在同一天落到这里。Intern-S2-397B 没有接入路由——它是一个全新的检查点,你访问它的路径是厂商自己的 API 或自托管部署。把通用的、支持视频的、长上下文的流量发到你已有密钥的按量计费模型上;把科学批处理工作留给你自己运行的模型;当任何一侧的端点不健康时,让自动故障转移为你兜底。这条边界是一条路由规则,而不是第二套集成。

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the feature blocks covering scientific-literature pre-training and multi-domain scientific reinforcement learning.

裁决

选择 Qwen3.8-Max,用于通用推理和具备视频能力的生产级工作:在这里,跨越百万 token 的统一费率胜过其竞争对手的任何收费,而独立评分榜也降低了基于它进行构建的风险。它的权重足够开放,在大多数团队都处于门槛之内的许可证下意义重大;其 $2 / $6 的计价,是前沿旗舰中榜上最激进的价格。

为科学工作负载选择 Intern-S2-397B——图表密集的论文、分子图、时间序列信号——在这些场景中,输入的多模态方式从未被通用模型专门调优过,而且数据驻留或基于专有结果进行微调使 Apache-2.0 成为决定性属性。为硬件预留预算,运行你自己的评估,并在独立裁判出现之前,将其给出的数字视为声明。

诚实的总结是:这两款旗舰并不是真正的替代品。一个是自有的科学仪器,具备相当不错的通用能力;另一个是租来的、经过独立评分的通才型模型,采用统一费率,对科学只是略有关注。同时需要两者的团队应把这条边界视为一项路由决策——并且在相信任何一家厂商幻灯片上的任何数字之前,都应在 Intern-S2-397B 上重新运行自己的评估。

A screenshot of the OrcaRouter model page for Qwen3.8-Max at orcarouter.ai/models/qwen/qwen3.8-max, captured September 13, 2026, showing the model listing with its provider Qwen, 1M-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.