
Intern-S2-397B vs Qwen3.8-Max:两款中国旗舰,截然相反的经济赌注
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Intern-S2-397B 和 Qwen3.8-Max 是 2026 年 9 月初中国最具影响力的两款旗舰发布,而它们押下了截然相反的经济赌注。Intern-S2-397B 是上海人工智能实验室 InternLM 团队于 9 月 13 日以 Apache-2.0 许可发布的 4030 亿参数科学多模态模型,它押注开放权重才是赢得科学和智能体工作负载的路径:没有按 token 计费的价格,权重放在 Hugging Face 上,用你自己的硬件来计量。Qwen3.8-Max 是阿里巴巴的 2.4 万亿参数旗舰,于 8 月 3 日正式发布(GA),并在 9 月 2 日更新,它押注的是定价 API:在 100 万 token 上下文下,每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,开放权重在 GA 一周后推出,而且独立的 Artificial Analysis 评分已经上榜。两者之间的对决,与其说是谁的基准测试胜出,不如说是哪一种押注——拥有权,还是按量计费的端点——更契合你工作负载的形态。
两款旗舰,两场豪赌
Qwen3.8-Max 是阿里巴巴 Qwen 系列中能力最强的层级,是一款稀疏混合专家模型,总参数量达 2.4 万亿,每个 token 激活约 950 亿参数,由 512 个专家组成,其中 10 个激活,外加一个共享专家。它具备 1M token 上下文窗口(在托管 API 中启用思考时为 983,616 token)、131,072 token 输出上限,支持文本、图像和视频输入,并通过 OpenAI 兼容端点提供服务。其标志性定价举措是统一费率:无论你的提示是 5,000 token 还是 900,000 token,价格都是相同的 $2.00 / $6.00,缓存输入定价更低——没有长上下文附加费,而这正是大多数竞争对手仍在收费的杠杆。阿里巴巴在其自己的迁移指南中将其直接对标 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro。
Intern-S2-397B 是一种形态不同的旗舰模型。它是一个专家混合模型,拥有 60 层和 512 个专家(每个 token 激活 10 个),具备 256K 文本推理上下文和 64K 多模态上下文,输入面涵盖文本、图像和时间序列,并采用一种预训练范式:直接读取科学文献的原始页面——图表、版面、符号记法和行文——而不是先解析出文本。其强化学习横跨二十多个科学领域,并且它是在沙盒环境中为长时程智能体工作而训练的。它的定价不是一张价目表,而是价目表的缺席:自行托管 Apache-2.0 权重,或申请获取官方 Intern API 的访问权限。
• 价格 — Intern-S2-397B:无价目表;自托管或 Intern API,对比 Qwen3.8-Max:每 1M 统一 $2.00 / $6.00,缓存输入更低。
• 规模 — Intern-S2-397B:总参数量 403B,512 个专家 / 10 个激活,对比 Qwen3.8-Max:总参数量 2.4T,激活 95B,512 个专家 / 10 个 + 1 个共享。
• 上下文 — Intern-S2-397B:256K 文本 / 64K 多模态,对比 Qwen3.8-Max:100 万 tokens,固定费率。
• 输入 — Intern-S2-397B:文本、图像、时间序列 vs Qwen3.8-Max:文本、图像、视频。
• 权重 — Intern-S2-397B:Apache-2.0,发布当天即开放;而 Qwen3.8-Max:自定义 Qwen3.8-Max 许可证,在 GA 后于 8 月 12 日开放。
• 独立评分 — Intern-S2-397B:暂无 vs Qwen3.8-Max:AA Intelligence Index 40,GPQA Diamond 92.7。
两个表都是供应商表,其中只有一个有裁判。
两款模型发布时都附带了厂商自行制作的基准测试表,这使得二者的数据来源规范如出一辙,而实测战绩却各有不同。此后,Qwen3.8-Max 的独立数据不断累积:Artificial Analysis 在其当前版本的 Intelligence Index 上给它打出 40 分,其中 GPQA Diamond 为 92.7、HLE 为 43.0、独立编程得分为 71.8,而在当前计分标准下,每个索引任务的成本约为 2.67 美元。这些数字来自第三方追踪机构实测所得——这是这两款旗舰模型中任何一款所迎来的首位真正意义上的裁判。
Intern-S2-397B 的证据是它自己的模型卡,通过 OpenCompass、VLMEvalKit 和 AgentCompass 跑出来,并与权重一同发布:MMLU Pro 89.77、MMMU Pro 81.68、HMMT-2026 93.56、SWE-bench-Pro 68.54,以及 TerminalBench 2.1 的 64.04——这个数字在模型卡本身中就显示输给了更早的闭源一代。它的科学类条目正是专用模型论据成立的原因:Biology-Instructions 55.71、SciReasoner 1.5 63.28、Mol-Instructions 53.95、MolecularIQ 62.35。其中每一项都是 InternLM 自己的,未获复现。把这两个证据基础并排来看,它们从相反方向讲述了同一个故事:一个模型是专用模型,通用条目表现尚可,却没有外部测量;另一个是通用模型,拥有独立评分,却没有科学调优。

金钱形态究竟能买到什么
统一的 $2 / $6 计费标准是 Qwen3.8-Max 的标志性举措,值得详细说明它究竟带来了什么。一个仓库分析智能体若在单次调用中推入 20 万个输入 token 的代码上下文,其支付的每 token 费率与一次简短聊天相同——没有长提示词附加费;而借助缓存,稳定的代码上下文在重复流量下会大幅拉低有效输入价格。该模型还可以依据阿里巴巴的定制许可证以开放权重形式调用,该许可证允许在注明出处的前提下商用,并设有基于规模的门槛:月活跃用户超过 1 亿或月收入超过 2000 万美元时需另作约定,而大型模型即服务业务则需签订单独协议。
Intern-S2-397B 的经济账正好相反:完全没有按量计费,但需要一笔资本支出。其权重在 BF16 下约为 807 GB,分布在 188 个分片上——是一台不折不扣的多 GPU 节点——而 FP8 版本可将占用空间缩减约一半。如果你已经拥有这样的算力,下一次科学查询的边际成本就接近电费,而这正是这场赌注:自有硬件让专用模型在边际上变得便宜。如果你没有自己的硬件,这个“免费”模型只是一个试点,而官方 Intern API 是唯一按量计费的替代方案。
只要做好路由,两个旗舰模型就能共用同一条接缝。 Qwen3.8-Max 已上线 OrcaRouter,按 Alibaba 的目录价透传,0% 加价,因此 $2 / $6 的统一费率以及未来任何降价都会在同一天落到这里。Intern-S2-397B 没有接入路由——它是一个全新的检查点,你访问它的路径是厂商自己的 API 或自托管部署。把通用的、支持视频的、长上下文的流量发到你已有密钥的按量计费模型上;把科学批处理工作留给你自己运行的模型;当任何一侧的端点不健康时,让自动故障转移为你兜底。这条边界是一条路由规则,而不是第二套集成。

裁决
选择 Qwen3.8-Max,用于通用推理和具备视频能力的生产级工作:在这里,跨越百万 token 的统一费率胜过其竞争对手的任何收费,而独立评分榜也降低了基于它进行构建的风险。它的权重足够开放,在大多数团队都处于门槛之内的许可证下意义重大;其 $2 / $6 的计价,是前沿旗舰中榜上最激进的价格。
为科学工作负载选择 Intern-S2-397B——图表密集的论文、分子图、时间序列信号——在这些场景中,输入的多模态方式从未被通用模型专门调优过,而且数据驻留或基于专有结果进行微调使 Apache-2.0 成为决定性属性。为硬件预留预算,运行你自己的评估,并在独立裁判出现之前,将其给出的数字视为声明。
诚实的总结是:这两款旗舰并不是真正的替代品。一个是自有的科学仪器,具备相当不错的通用能力;另一个是租来的、经过独立评分的通才型模型,采用统一费率,对科学只是略有关注。同时需要两者的团队应把这条边界视为一项路由决策——并且在相信任何一家厂商幻灯片上的任何数字之前,都应在 Intern-S2-397B 上重新运行自己的评估。

