Qwen3.7 Flash

qwen/qwen3.7-flash
精选
视觉工具JSON推理
来自 Qwen · 2026-07-27

Qwen3.7 Flash是阿里巴巴旗下Qwen3.7系列中快速、极具成本效益的模型,定位在Qwen3.7-Plus和Qwen3.7-Max之下,属于高吞吐量层级。它在输入端原生支持多模态——接受文本、图像和视频输入并生成文本输出——提供100万token的上下文窗口,最高支持6.4万输出token,因此即使在Flash级别的定价下,长文档、截图和视频帧也尽在掌握。 基础层每百万输入token约0.03美元的成本,使其成为最便宜的百万级上下文多模态模型之一,自然适用于分类、提取、路由、摘要、轻量级智能体以及任何高并发流水线。它支持推理模式、原生工具调用、通过response_format的结构化输出,以及常规的采样控制参数(temperature / top_p / seed / logprobs)。 请注意,定价按提示长度分级:输入token超过3.2万后费用上升,超过25.6万后再次上升,因此将短请求批量处理比填充长请求要便宜得多。将Flash作为高容量主力模型使用,当任务真正需要更强能力时再升级到Qwen3.7-Plus或Max。

上下文1M tokens
最大输出65K
输入模态text + image + video
输出模态text
p50 首字节2.83 s
输入$0.03/ 百万 tokens
输出$0.13/ 百万 tokens
p50 首字节2.83 s7 天
p95 首字节9.64 s7 天
流量13.5Mtokens / 7 天

Qwen3.7 Flash是由Qwen团队开发、通过OrcaRouter提供的多模态大语言模型。它能够处理文本、图像和视频输入,支持100万个token的上下文窗口,最大输出为65,536个token。“Flash”这一名称表明,与Qwen系列中更大的模型相比,它经过优化,延迟更低、吞吐量更高,适合在生产环境中使用,特别适合对响应速度和成本有较高要求的场景。 目标用户包括需要处理大量混合媒体内容…

什么是Qwen3.7 Flash,谁应该使用它?

Qwen3.7 Flash支持哪些输入模态?

Qwen3.7 Flash 的上下文窗口大小为 128K tokens。

如何通过OrcaRouter访问Qwen3.7 Flash?

代码示例

用任意 SDK 调用

兼容 OpenAI——沿用你现有的 SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3.7-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

支持的参数

  • include_reasoning
  • logprobs
  • max_tokens
  • presence_penalty
  • reasoning
  • response_format
  • seed
  • temperature
  • tool_choice
  • tools
  • top_logprobs
  • top_p

价格

阶梯输入 / 1M tokens输出 / 1M tokens缓存读取 / 1M缓存写入 / 1M
32K$0.030$0.130$0.0060$0.038
256K$0.100$0.400$0.020$0.125
$0.200$0.800$0.040$0.250
阶梯按每次请求的输入 token 数确定

费用计算器

每月 token 数10MM
输入占比70%%
预计每月 $0.600 · 启用提示缓存后 $0.516

基于标价的估算

阶梯定价——此估算使用基础档位费率。

Token 与费用估算器

输入 Token: 6每次请求费用: $0.000065

仅为估算——实际 Token 数取决于提供商的分词器。

性能

p50 首字节
2.83 s
输出速度
333 tok/s
p95 首字节
9.64 s
错误率
0%

公共基准测试

来源: Design Arena

社区热度

本周开发者的讨论

Hacker News0 次提及 · 近 7 天

对比一览

Qwen3.7 Flashqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
输入 $/百万$0.03$0.86$0.17$0.12
输出 $/百万$0.13$3.44$1.03$0.69
上下文1.0M262K33K1.0M
质量7/108/108/108/10
并排对比并排对比并排对比并排对比

常见问题

Qwen3.7 Flash在OrcaRouter上的费用是多少?
现有资料中未提供Qwen3.7 Flash的具体定价。OrcaRouter通常按输入和输出的token数收费。作为Flash模型,其价格很可能低于旗舰模型。请访问OrcaRouter定价页面或联系技术支持获取当前费率。
Qwen3.7 Flash 的上下文窗口大小为 128K tokens。
上下文窗口为1,000,000个token。这使得模型能够在一个提示中处理非常长的文档、扩展的对话或大量图像/视频。
Qwen3.7 Flash 的优势包括更快的推理速度、更低的延迟、优化的资源消耗,以及在某些任务上保持与更大模型接近的性能。它适合对实时性要求较高的应用场景,同时兼顾了准确性和效率。
其优势包括1M-token上下文窗口、多模态输入支持(文本、图像、视频)、65k最大输出token,以及优化后的“Flash”架构,在速度与成本之间取得平衡。该模型非常适用于长文档分析和多模态理解。
Qwen3.7 Flash 与 GPT-4o-mini 相比如何?
Qwen3.7 Flash 提供了更大的上下文窗口(1M vs. 128k)和更高的最大输出(65k vs. 16k)。GPT-4o-mini 可能拥有更广泛的生态系统支持。两者均未提供定价或基准测试用于直接比较。
OrcaRouter 是否通过缓存提示来降低成本?
OrcaRouter 可能提供提示缓存,但其针对 Qwen3.7 Flash 的具体策略在已知信息中并未详述。请查阅 OrcaRouter 的文档,了解缓存命中指示器和折扣信息。
如何使用与OpenAI兼容的API调用Qwen3.7 Flash?
设置基础 URL 为 https://api.orcarouter.ai/v1,并使用模型 ID "qwen/qwen3.7-flash"。包含你的 OrcaRouter API 密钥。聊天补全端点使用标准的 OpenAI 参数。对于多模态输入,在消息内容数组中添加图像或视频对象。
Qwen3.7 Flash支持哪些输入模态?
它支持文本、图像和视频输入。这使得诸如分析图像与文本、总结视频以及在同一提示中组合多种媒体类型等任务成为可能。
我可以在自己的数据上微调Qwen3.7 Flash吗?
现有事实未提及微调能力。作为通过OrcaRouter访问的API模型,可能不支持微调。如需自定义微调,请考虑开源替代方案。
Qwen3.7 Flash 的最大输出长度是多少?
最大输出为65,536个令牌。这允许在单个API调用中生成非常长的回复、报告或代码。
如何使用 Qwen3.7 Flash 处理视频输入?
未提供具体的视频处理细节。通常,视频输入会作为帧序列进行处理。您可能需要将视频预处理为一系列图像,并以图像URL或base64数据的形式传递。有关确切格式,请参阅OrcaRouter的文档。

嵌入此徽章

Qwen: Qwen3.7 Flash$0.03/M in2828ms p50通过 OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3.7-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg" alt="Qwen: Qwen3.7 Flash 在 OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3.7 Flash](https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg)](https://www.orcarouter.ai/models/qwen/qwen3.7-flash)

以数据形式获取模型卡

GET /api/public/models/qwen/qwen3.7-flash打开