
DeepSeek V4.1 Flash 与 Gemini 3.1 Pro:其中一款仍是预览版
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
对比时最值得了解的一点DeepSeek V4.1 Flash与Gemini 3.1 Pro并不印在任何一份规格表上。DeepSeek V4.1 Flash 是一款正式可用的模型,于 2026 年 9 月 10 日发布,权重采用 MIT 许可,可供下载。Gemini 3.1 Pro 自 2026 年 2 月 19 日起一直处于预览阶段,大约七个月后仍以预览构建名称提供服务。这种不对称性并不能决定哪个模型更好,但它决定了当你基于其中之一进行构建时,你做出的是何种承诺,而这也是下文一切的框架。
两者都拥有百万 token 的上下文。两者都接受图像。真正区分它们的不同之处在于超过 200,000 个输入 token 后的价格曲线、输入模态、输出上限,以及这样一个事实:这两者中一个是你可以拥有的文件,另一个是 API。
两者实际所处的位置
• 每 100 万 token 的价格,最高 200K 上下文 —— DeepSeek V4.1 Flash 输入 $0.15 / 输出 $0.60,而 Gemini 3.1 Pro 为输入 $2.00 / 输出 $12.00。也就是说,输入价格是其 13 倍,输出价格是其 20 倍。
• 每 100 万个 tokens 的价格,在上下文超过 200K 时 — V4.1 Flash 保持不变,为 $0.15 / $0.60,而 Gemini 3.1 Pro 为输入 $4.00 / 输出 $18.00。输入价格倍数恰好在长上下文工作所在的场景中扩大至 27×。
缓存输入 —— V4.1 Flash 非高峰时段每 1M 仅 $0.003,而 Gemini 3.1 Pro 每 1M 要 $0.40。整整两个数量级的差距,就落在决定重新读取上下文是否划算的那一行成本上。
• 上下文窗口——1M tokens 对 1M tokens。平手。
• 最大输出 — V4.1 Flash 384K tokens,Gemini 3.1 Pro 仅 65K tokens。上限是后者的六倍。
• 输入模态——V4.1 Flash 接受文本和图像,而 Gemini 3.1 Pro 接受文本、图像、音频、视频和文件上传。
• 权重 — V4.1 Flash 采用 MIT 许可,可下载,对比 Gemini 3.1 Pro 闭源,仅提供 API。
• 发布状态 —— V4.1 Flash 自 2026 年 9 月 10 日起全面可用,而 Gemini 3.1 Pro 自 2026 年 2 月 19 日起处于预览阶段。
• 观测到的首个 token 延迟——基于 OrcaRouter 自己 7 天的遥测数据,V4.1 Flash 在 p50 为 2.63 秒、在 p95 为 9.05 秒,而 Gemini 3.1 Pro 在 p50 为 10.00 秒、在 p95 为 10.00 秒。这个昂贵模型的中位等待时间正处在遥测上限,其尾部也并未偏离该上限。
不看价格来读这份清单,这种格局在每一次开源权重与前沿模型的对比中都很熟悉:可下载模型在输出上限上胜出,在上下文上打平,在实测延迟上领先。闭源模型在模态上胜出,而且在这些方面是完胜。这里没有任何一项能单独解释13倍的输入倍数。

20 万这道断崖才是定价的关键所在
Gemini 3.1 Pro 的标称价格并非单一费率。输入 token 不超过 200,000 的提示词,按每百万输入 $2.00、输出 $12.00 计费;超过该阈值的提示词则按 $4.00 和 $18.00 计费。DeepSeek V4.1 Flash 没有分级——无论请求是 2,000 个 token 还是 900,000 个,都按 $0.15 和 $0.60 计费,但有一点需要注意:DeepSeek 在高峰时段费率翻倍,而在周末则完全按非高峰时段运行。
这一层级边界落在对长上下文工作来说再糟糕不过的位置,因为长上下文工作顾名思义就是会跨越这条边界的工作。一个具体的对比能让这一点变得直观。假设有一条流水线,每月发起 20,000 次调用,每次平均包含 250,000 个输入 token 和 4,000 个输出 token——这是一项针对大型文件的文档分析任务。
• DeepSeek V4.1 Flash 按非高峰时段费率计算:20,000 × 250,000 等于 5,000M 输入 token,按每百万 $0.15 计算,为 $750.00。输出为 20,000 × 4,000,即 80M token,按每百万 $0.60 计算,为 $48.00。总计 $798.00。
• Gemini 3.1 Pro 在超过 200K 的档位下:同样的 5,000M 输入 token,按每百万 $4.00 计算,为 $20,000.00;80M 输出 token,按每百万 $18.00 计算,为 $1,440.00。总计 $21,440.00。
这意味着在相同流量下,每月支出相差 27 倍,而这并不是你从标题数字中会猜到的倍数。标题上的倍数是 13 倍。而为长上下文工作实际支付的倍数是 27 倍,因为分层边界恰好就落在你的提示所处的位置。
预览标签实际让你付出了什么代价
在整个行业中,预览版就是预览版:它不附带任何已公布的稳定性保证。供应商并未承诺让该端点一直维持那种行为、那个价格或那个名称。这并不是在批评 Gemini 3.1 Pro——这就是这个标签的含义,也正是“预览”后缀能延续七个月、而不是只做两周形式的原因。
对于原型来说,这不算什么。但对于生产路径而言,这是一个具体且可量化的风险:你在赌你所针对调优的那个构建会保持不变。与这一对比的另一方相比,差异是结构性的,而非修辞上的。DeepSeek V4.1 Flash 已正式发布(GA),其权重以 MIT 许可证授权并可下载,这意味着即便托管 API 明天更改条款,模型本身仍在你手中。闭源预览模型既不会给你 GA 承诺,也不会给你这条退路。如果你的工作负载在两者上都能运行,这一差异的价值胜过基准测试中的一个分数点。
Gemini 3.1 Pro 在何处是更合适的工具
模态差距不是舍入误差,而且它是这份清单上唯一一个无论出什么价都无法用廉价模型替代的维度。Gemini 3.1 Pro 将音频和视频作为一等输入,外加文件上传。DeepSeek V4.1 Flash 接受文本和图像。如果你的流水线要摄取通话录音、屏幕截图或视频评审,DeepSeek V4.1 Flash 就不是更便宜的选择——它根本不是一个可选项。13× 的倍数与一项一个模型能做、另一个不能做的任务无关。
还有第二种更低调的论据。Gemini 3.1 Pro 自二月起就已以某种形式公开可用,而且它是拥有更长生产历史的模型——更多人触及过它的边界,它在真实流量下的行为,也比一个发布仅十二天的版本得到了更完善的记录。对于输出密集型的交互式工作,如果任务在后台运行,十秒的中位等待时间可以接受,那么这份过往记录就是论据,而且是一个实实在在的论据。这并不是一个关于延迟的论据:从上面的遥测数据来看,较便宜的模型在中位数和尾部上都是两者中更快的那个。
还有一个问题:preview 这个标签对那段过往究竟意味着什么。以一个预览版构建之名存在了七个月,比大多数模型能获得的窗口都长,而这也意味着七个月里始终没有 GA 承诺。截至本文写作时,DeepSeek V4.1 Flash 才问世十二天,其独立记录还很单薄:它唯一现身的一次近期第三方横评——即 2026 年 9 月 21 日发布的 Agents on Rails 智能体编程榜单——在最高强度档位下给它打出 17%,位居中游。十二天的时间,不足以让一个模型的口碑说明任何问题,无论好坏——而这正是买家在此处更青睐较老那款模型的诚实理由,与速度毫无关系。
根据上下文长度进行路由,因为这才是真正起决定作用的
这个对比所暗示的决策并不是“二选一”。它是一条包含两个条款的规则:长上下文、高吞吐量的工作交给 DeepSeek V4.1 Flash,而任何涉及音频或视频的内容则交给 Gemini 3.1 Pro。棘手的地方在于,这条规则说起来容易,实现起来却很麻烦,因为这两个条款通常分属不同的供应商,有着不同的密钥、不同的 SDK 和不同的速率限制。
只需一个 OrcaRouter 密钥即可访问这两个模型,这让该规则变成了一条路由规则,而不是应用程序里的分支代码——你可以直接依据请求上下文长度来做决策,而上下文长度正是这里真正造成成本差异的维度。OrcaRouter 以 0% 加价率透传提供商目录价,因此上述阶梯价格就是 Google 自己的定价,DeepSeek 的高峰时段费率表也是 DeepSeek 自己的,一旦供应商调价,我们这边当天就会同步生效。而且,由于这一组合中的一方是预览版构建,为其配上自动故障转移是值得的:如果该构建在你使用期间被更新,请求会落到另一个模型上,而不是落到错误页面上。
最后那一点,是上文所有内容的实操版本。长上下文工作负载上27倍的差距,正是应当做路由而不是做二选一的原因;而两个模型中有一个带着预览版标签,也正是需要有个去处、让请求在构建版本变化时有地方可发的原因。

看什么
• Gemini 3.1 Pro 是否会结束预览阶段。正式发布将消除稳定性方面的附加说明,并且比任何价格变动都更能改变这一对比的格局。
• 20万以上这一档是否会变化。在成本核算中,档位分界线所起的作用比名义费率更大。
• DeepSeek V4.1 Flash 是否会累积出一份独立的成绩记录。一款采用 MIT 许可权重、输出上限为 384K、上下文长度达 1M、每百万输入仅需 $0.15 的模型,是一套不同寻常的组合;而它是否真具备相应的能力,仍是尚无任何公开基准测试能够回答的问题。
在其中第一个落地之前,准确的总结如下:DeepSeek V4.1 Flash 的输入成本约为 Gemini 3.1 Pro 的十三分之一,长上下文输入成本约为 Gemini 3.1 Pro 的二十七分之一;它是这两者中唯一可以下载的一个,也是唯一背后有 GA 承诺的一个。Gemini 3.1 Pro 是生产历史更长的模型,也是这两者中唯一能读取音频和视频的一个。据此路由。

