
Intern-S2 对比 Gemini 3.1 Pro:InternLM 实际测量的多模态对决
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
本系列中的大多数对比都需要把两家厂商的说法拼凑起来。这一次则不然。Intern-S2——InternLM 今天发布的 3970 亿参数、Apache-2.0 许可的多模态模型——以及 Google 的旗舰推理模型 Gemini 3.1 Pro,都以实测列的形式出现在同一张基准测试表中——这使其成为这一组中最公平的正面对决,也并非巧合地成为开源模型最需要给出交代的一场。Gemini 3.1 Pro 可读取文本、图像、音频和视频,拥有 100 万 token 上下文,并且自 2026 年 2 月 19 日进入预览以来,一直被独立实验室和生产流量反复审视。Intern-S2 可读取文本、图像和时间序列,今天早上被上传到 Hugging Face,并且没有任何形式的第三方评分。在两者都有实测的行中,Google 的模型胜出的行数占多数。
两者都能读取图像。相似之处仅此而已。
“多模态”这个词让这些模型听起来像是同类。它们并非同类,区别在于每个模型被造出来是为了“看”什么。
Intern-S2 的视觉路径经过训练,可以直接摄入科学文献的原始页面——图表、公式、结构图、版面——并将其作为单一共享表示,而不是先解析出文本。它的多模态基准测试都是科学领域的:生物显微 VQA、遥感、科学图表问答。它还接受时间序列数据,并能生成预测,而这是一种几乎没有任何通用旗舰模型会处理的输入类型。
Gemini 3.1 Pro 的多模态能力是通用型的,且涵盖的种类更为广泛:文本、图像、音频和视频,全都集成于一个模型之中,面向的是各类生产任务——你把一个文件交给模型,然后提出问题。会议录音、UI 截图、PDF 中的图表、视频片段——全都在其能力范围之内,而且背后都有六个月的公开评测作为支撑。
如果你的输入是科学图表,Intern-S2 就是为此专门打造的,并且有厂商提供的数据来支撑这一说法。如果你的输入是其他任何东西,Gemini 3.1 Pro 支持音频和视频,而 Intern-S2 两者都不支持。这就解决了"我该用哪个"这类问题中的很大一部分,甚至还没轮到价格或基准测试登场,而任何告诉你这两者可以互换的人,都没有认真看过输入支持列表。
共用表格所显示的,以诚实的态度解读
因为 InternLM 对两者都进行了基准测试,所以这是少数几个可以直接比较而非拼凑对比的场合之一。这一前提说明没有变化,且值得重申一次:所有 Intern-S2 的数据均为厂商报告,由 InternLM 通过 OpenCompass、VLMEvalKit 和 AgentCompass 在其自有测试框架上运行,未经独立复现。该表中 Gemini 的数据同样来自 InternLM 进行的此次对比测试,不过 Gemini 在此之外拥有大量独立记录。
• 多模态知识 — Gemini 3.1 Pro 在 MMMU Pro 上取得 83.99 分,而 Intern-S2 为 81.68 分。
• 科学图表问答——Gemini 3.1 Pro 在 ChartQAPro 上取得 71.18,Intern-S2 为 71.12。精确到小数点后两位,不相上下。
• 遥感 —— Gemini 3.1 Pro 在 XLRS-Bench 上为 54.27,对比 Intern-S2 的 51.38。
• 显微图像 VQA — Gemini 3.1 Pro 在 MicroVQA 上取得 71.02 分,而 Intern-S2 为 69.67。
• 科学多模态任务——Intern-S2 在 SFE 上得分 60.74,而 Gemini 3.1 Pro 为 59.57。这是 Intern-S2 唯一胜出的多模态项目。
• 通用知识 — Gemini 3.1 Pro 在 MMLU Pro 上得分 91.00,而 Intern-S2 为 89.77。
• 高中数学 — Gemini 3.1 Pro 在 HMMT-2026 上得分 94.70,Intern-S2 则为 93.56。
• 科学文献推理 — 在 Biology-Instructions 上,Intern-S2 得分 55.71,Gemini 3.1 Pro 为 13.87;在 Mol-Instructions 上,二者分别为 53.95 与 38.84。
• 科学奥林匹克竞赛题目——Intern-S2 在 FrontierScience-Olympiad 上获得 87.00 分,而 Gemini 3.1 Pro 为 79.00 分。
• 终端操作精通度 — 在 TerminalBench 2.1 上,Gemini 3.1 Pro 取得 73.80 分,对比 Intern-S2 的 64.04 分。
诚实的解读是:Gemini 3.1 Pro 在广泛的多模态项目上以微弱优势取胜,Intern-S2 则在深度科学文献项目上以巨大优势取胜;考虑到两者各自的训练内容,这两个结果都不令人意外。多模态方面的差距之小,可以说才是更有趣的发现——一个同日发布的开放检查点能在 MMMU Pro 和 ChartQAPro 上把与六个月前的闭源旗舰模型的差距缩小到两个百分点,这对 InternLM 来说,比它那些碾压式的科学成绩中的任何一项都更有分量。
上下文、输出和预览问题
长输入方面的格局泾渭分明。Gemini 3.1 Pro 拥有 100 万 token 的上下文窗口和 64K 的输出上限——足以容纳一整套长文档并给出内容充实的回答。Intern-S2 在文本推理上最高按 256K token 评估,多模态为 64K,且未公布输出上限;在有人独立实测之前,应将其可用窗口视为小于 Gemini。
关于 Google 这方面有一个运维层面的注意事项,任何诚实的对比都应当把它写进去。Gemini 3.1 Pro 仍然是预览版模型,而非 GA 正式发布版。预览版模型的可靠性预期更低,而模型页面上那个为期 7 天的错误率面板,也是一个持续存在的提醒:应当绕开不稳定之处,而不是在其之上构建关键路径。Intern-S2 则是完整的 Apache-2.0 发布版,权重可以固定版本——这反直觉地使得这个全新的开源模型成为两者中在运维上更稳定的那个,而这恰恰是在最重要的意义上:没有人能在你脚下把它改掉。
• 上下文 — Intern-S2 256K 文本 / 64K 多模态,与 Gemini 3.1 Pro 1M tokens 进行对比评估。
• 输入 — Intern-S2:文本、图像、时间序列 对比 Gemini 3.1 Pro:文本、图像、音频、视频。
• 权重 — Intern-S2 采用 Apache-2.0 许可,可下载,而 Gemini 3.1 Pro 则为闭源。
• 成熟度 — Intern-S2 才发布数小时,自2026年2月以来尚无与 Gemini 3.1 Pro preview 对比的独立评分,已经过大量独立测试。
• 价格 — Intern-S2 没有公开的价目表;可选择自托管或使用官方 Intern API,对比 Gemini 3.1 Pro 每百万 token 输入 $2.00 / 输出 $12.00,当输入 token 超过 200K 时涨至 $4.00/$18.00。

价格以及每一个所在的位置
Gemini 3.1 Pro 在标准层级上的计费为每百万输入 token 2.00 美元、每百万输出 token 12.00 美元;一旦单次请求的输入超过 20 万 token,价格便升至 4.00 美元/18.00 美元——这项长上下文溢价恰好在你要用到那个足以证明选择它合理的 100 万 token 窗口时开始咬人。在 OrcaRouter 上可按同一标价路由,零加价透传,所用密钥同时还可调用 200 多个其他模型;这里的透传之所以重要,是因为 Google 一旦调价,当天就会落到我们这边,而不必等一个重新定价周期。路由 DSL 对这一特定组合尤为实用:你可以把图像与视频类任务发往 Gemini 3.1 Pro,把科学文献批处理发往自托管的 Intern-S2,并让两者共处同一端点之后,无需第二份合同,也无需改动代码。
Intern-S2 没有公开的 API 定价。自行托管这份 Apache-2.0 权重,是大多数团队实际会选择的路径,而在 403B 参数规模下,这是一笔实打实的硬件投入。官方 Intern API 是为那些不愿自己跑 GPU 的团队准备的,但既然没有公开的价目表,就无法在纸面上把它与 Gemini 的 $2/$12 做成本对比——你得去申请配额,自己算这笔账。

呼叫
如果你需要一款通用多模态模型,能处理音频和视频、支持一百万个 token、已历经数月独立验证,并且如今就能按 token 租用,那就选择 Gemini 3.1 Pro。它是有更充分证据支持、能力也更广泛的模型,而预览标签是可靠性方面的注意事项,而非能力方面的注意事项。
如果你的多模态输入是科学性的,且数据不能离开你的基础设施,那就选择 Intern-S2。在这两者中,只有它能够原生读取原始文献页面、基于时间序列信号进行预测,并且可以在宽松许可证下基于专有实验数据进行微调。接受这一点:你是第一个运行它的人,而为它背书的基准测试表是由制造它的人撰写的。

两款模型都没有在此彻底胜出,而表格比任何裁决都更能证明这一点。一个是恰好擅长科学的通用模型;另一个是恰好能在通用多模态任务上具备竞争力的科学仪器——而在同日开源发布的情况下,“具备竞争力”才是更令人意外的结果。
要在不额外签一份合同的情况下兼顾这个对比的两面:一个 API 密钥覆盖 200 多个模型把闭源多模态旗舰模型以及所有替代方案都放到同一个端点之后,这样你就可以让图像和视频任务走一条路,让文档批处理走另一条路。
