Qwen 3.7 Flash:阿里巴巴的极廉价视觉模型,专为真正查看屏幕的智能体设计
Guides & Insights

Qwen 3.7 Flash:阿里巴巴的极廉价视觉模型,专为真正查看屏幕的智能体设计

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

阿里巴巴的 Qwen 团队在过去两年里推出了密集的模型阵容,覆盖了几乎所有能想到的价格与能力层级;2026 年 7 月 27 日,又一款模型以商业 API 列表的形式悄然上线:qwen/qwen3.7-flash。它没有伴随旗舰发布那样的高调宣传,阿里巴巴也没有为其发布技术报告、基准测试套件或架构图。但它的到来带来了一段对开发者而言远比又一个排行榜分数更重要的描述:这是一个视觉语言推理模型,拥有 100 万 token 的上下文窗口,定价低到几乎不足以单独列为一项开支。

这种组合——廉价、超大上下文、原生“看懂”图像——让 Qwen 3.7 Flash 精准定位到了整个模型市场中竞争最为激烈、也最为实用的类别:低成本多模态主力模型。这些模型并非在基准排行榜上拔得头筹的选手,而是那些在智能体循环、浏览器自动化流水线和客服工具中每天被调用上千万次的存在——因为每百万个令牌的输入成本仅为 0.03 美元、输出成本仅为 0.13 美元时,成本基本上就不再是设计时的约束条件了。

这篇文章是一篇抢先解析:Qwen 3.7 Flash 究竟是什么、阿里巴巴已经披露了什么(以及同样重要的是,还没披露什么)、用实际的 token 计算来看经济性如何体现、以及它在整个 Qwen 家族中的位置——包括体型大得多的 Qwen 3.8 和 Qwen 3.7 Max——同时对比 Gemini 3.5 Flash-Lite 这类廉价多模态竞品。我们还会探讨像 OrcaRouter 这样的路由层如何对待这种模型:它不是主角模型,而是一个默认层级,悄悄承接大部分多模态流量。

太长不看

Qwen 3.7 Flash 是阿里巴巴 Qwen 团队推出的视觉语言模型,列于模型 ID qwen/qwen3.7-flash,自 2026 年 7 月 27 日起提供。它专为多模态智能体、视觉编码、搜索以及计算机/UI 交互而构建,据称在物体识别和空间理解方面具有优势。它支持 100 万 token 的上下文窗口,并且定价为 每 100 万输入 token 0.03 美元,每 100 万输出 token 0.13 美元——是市面上最便宜的视觉能力模型之一。最大输出长度、确切参数数量和架构均未正式公开;社区猜测它采用小型专家混合(MoE)设计,并可能是开源权重 Qwen 3.7 版本的前身,但这一说法尚未得到证实。它与 Qwen 3.8(阿里巴巴单独发布的 2.4T 参数开源权重旗舰模型)和 Qwen 3.7 Max(同代更大的旗舰模型)都是不同的、更小、更便宜的模型。目前尚无任何独立基准测试套件(包括 Artificial Analysis)对其进行评分,因此在第三方数据出现之前,请将质量声明视为早期且未经证实的内容。

关键要点

• Qwen 3.7 Flash 是视觉语言模型,而不仅是文本模型——它定位用于多模态代理、视觉编码、搜索和计算机使用任务,而非通用聊天。

定价为每100万个输入token 0.03美元,每100万个输出token 0.13美元,大致与当前市场上最便宜档次的接近前沿的多模态模型价格持平。

• 上下文窗口为1M tokens,这对于图像密集和多轮代理会话来说,比听起来更重要,因为图像和截图会快速消耗token。

• 该列表的定价说明指出,在重复上下文中使用提示缓存后,实际成本可比标价低60-80%——对于反复使用相同系统提示或截图历史的智能体循环来说,这是一个重要的杠杆。

• 阿里巴巴尚未公布最大输出令牌数、参数数量或架构细节;你在其他地方读到的任何更具体的信息都是社区推测,而非供应商披露。

• 它不是 Qwen 3.8(2.4T 开放权重旗舰),也不是 Qwen 3.7 Max(同一发布批次中更大的封闭旗舰)——除了命名相似外,这是三个不同的模型,各自承担不同的任务。

• 截至撰写本文时,包括Artificial Analysis在内,没有任何独立基准测试组织发布过Qwen 3.7 Flash的评分——该模型的质量除了供应商的描述外,确实未经证实。

Qwen 3.7 Flash 的真实身份

抛开命名惯例,Qwen 3.7 Flash 是阿里巴巴对每个主要实验室现在都问过的问题的回答:当一个模型的整个设计要点是“尽可能廉价地处理视觉、代理、高流量流量而不至于无用”时,它看起来像什么?谷歌用 Gemini Flash 和 Flash-Lite 层级回答了这个问题。OpenAI 用其 mini 和 nano 产品线回答了这个问题。阿里巴巴这一代的答案是 Qwen 3.7 Flash。

官方描述围绕四个用例展开:多模态智能体、视觉编码、搜索以及计算机或UI交互。这是一份经过深思熟虑的清单。它不是“擅长创意写作”或“在数学奥赛题上推理能力很强”——而是列出需要模型查看截图、网页、UI界面或视觉化渲染的代码差异,然后据此执行操作的任务。阿里巴巴还特别指出目标识别和空间理解是其优势,这与计算机使用和UI交互的设定相契合:一个要点击按钮、读取布局或浏览屏幕的智能体需要知道物体在何处,而不仅仅是它们说了什么。

明确说明“推理”在此语境中的含义是值得的。Qwen 3.7 Flash 被描述为视觉语言推理模型,这意味着它旨在处理多步骤的视觉任务,而不仅仅是给图像添加说明或回答单个查询问题。这就是“描述这个屏幕截图”与“这里有一个包含三个验证错误的表单截图——找出问题并告诉我应该先修复哪个字段”之间的区别。

规格与多模态代理焦点

以下是实际已确认内容的完整列表,以及尚未确认的内容。

已确认:开发者是阿里巴巴的Qwen团队。该模型以ID qwen/qwen3.7-flash列出,自2026年7月27日起上线。它支持多模态输入(视觉和语言)。上下文窗口为1,000,000个token。定价为每100万输入token 0.03美元,每100万输出token 0.13美元。列表自身的定价说明指出,对于跨调用重复使用相同系统指令或参考图片的工作负载,重复上下文上的提示缓存可将实际成本较标价降低60-80%——这个细节对每一轮都重新发送相同截图历史或工具架构的代理循环来说非常重要。

未公开:最大输出令牌限制。确切参数数量。架构(密集 vs. 混合专家)。训练数据组成。任何第一方基准测试分数。

社区猜测(需要明确这只是猜测): 考虑到“Flash”的命名方式、激进定价策略以及阿里巴巴在之前Qwen系列中的一贯做法,部分观察者推测Qwen 3.7 Flash可能采用了小型混合专家架构,旨在降低单token计算成本;同时,它或许是在最终开放权重的Qwen 3.7发布之前的预览或蒸馏版本,类似早期Qwen的“flash”或“turbo”变体有时会早于更广泛的开放版本发布。以上内容均未得到阿里巴巴确认。在官方技术报告或模型卡片另有说明之前,请将其视为有依据的推测,而非事实。

未公布最大输出数值这一情况,值得所有基于此模型进行开发的人员注意:如果你的用例会产生长结构化输出(大型JSON数据负载、多文件代码生成、长转录文本),请在生产环境中正式采用之前,通过实测来测试实际输出上限——因为你无法在文档中查到一个不存在的数字。

定价实例:实际成本是多少

这样小的数字很容易被忽略,所以我们还是认真算一算吧。

按每100万输入令牌$0.03和每100万输出令牌$0.13计算,一次调用使用2000个输入令牌(一张大小合适的截图加一条简短指令)和300个输出令牌(一个结构化答案)的成本为:输入 2000/1000000 × $0.03 = $0.00006,加上输出 300/1000000 × $0.13 = $0.000039。总计:大约每次调用$0.0001 — 一百分之一美分。

按量扩展。运行100万次这类调用——对于一个做截图分析或UI状态检查的中型代理型产品来说,这是常见的每日负载——你会得到:1,000,000 × 2,000 = 20亿输入tokens × $0.03/1M = $60,加上1,000,000 × 300 = 3亿输出tokens × $0.13/1M = $39。总计:约99美元即可完成100万次视觉代理调用。甚至在加入提示缓存(列表说明中提到,对于重复上下文的工作负载,这可将成本降低60-80%)之前,这个数字就已经能让大多数团队无需召开预算会议就批准了。

现在比较一个更重的场景:一个计算机使用代理,它保持一个持续运行的5万个令牌的上下文(截图、操作历史、工具结果),每步生成500个令牌的动作,每天运行10万次。输入成本:10万 × 5万 = 50亿令牌 × $0.03/百万 = $150/天。输出成本:10万 × 500 = 5千万令牌 × $0.13/百万 = $6.50/天。这大约是$156/天,或约$4,700/月,对于一个相当激进的长期上下文代理工作负载——而且这还没有考虑对那5万上下文中重复部分的任何缓存折扣,而在计算机使用循环中(相同的系统提示、相同的工具定义、重叠的屏幕状态)正是提示缓存为之设计的那种工作负载。

真实场景演练

高容量视觉任务

想象一个产品目录流水线,需要每天对数万张产品图像进行分类、打标签和提取属性——正是这种工作负载下,每个token的成本会迅速累积,足以在中端视觉模型上突破预算,但在Qwen 3.7 Flash的定价下却能保持舒适的可负担性。阿里巴巴明确指出的两个能力——物体识别和空间理解——直接对应着“这张图像里有什么、物体在哪里、以及它的状态如何”。

可视化编程

"Visual coding"作为一个命名的用例,暗示了这样的工作流程:向模型输入一张渲染后的UI截图以及底层组件代码,要求它找出不匹配之处,或者接收一个Figma导出文件,然后返回一个初版实现。这是一个特别惩罚纯文本代码模型的任务类别——你可以用语言描述一个布局错误,但一个能够实际看到破损的内边距或未对齐的按钮的模型,将更快、更可靠地诊断问题。

代理式/计算机使用

这是头条用例。一个计算机使用代理必须查看屏幕,理解哪些元素可点击,决定操作,然后重复——通常每个任务需要几十步。这里的经济性对于昂贵模型来说是残酷的:一个30步的浏览器或桌面自动化任务,每一步都带有新截图,可能在任务完成前消耗数十万个 token。按照前沿模型的价格,每个任务都是真金白银;按照 Qwen 3.7 Flash 的价格,每天运行数千个这样的会话仍然在小团队的预算范围内。

视觉搜索——将图像与语料库进行匹配,验证检索结果是否与参考照片实际匹配,或将搜索查询基于用户正在查看的屏幕截图——得益于大上下文(以容纳多个候选图像或长检索文档集)和低每次调用成本(因为搜索和验证循环通常意味着每个用户查询需要多次模型调用,而不是一次)的相同组合。

如何访问和使用 Qwen 3.7 Flash

Qwen 3.7 Flash 的调用使用模型标识符 qwen/qwen3.7-flash,并且可与任何 OpenAI 兼容工具配合使用——这意味着现有的 chat-completions 或 responses 风格集成只需更改模型名称即可接入,无需重写客户端代码。这也是像 OrcaRouter 这样的路由层变得切实可用的关键:与其在每个服务中硬编码单一模型,不如通过统一的 OpenAI 兼容端点,将一款廉价且能力不俗的多模态模型设为视觉与智能体流量的默认层,把更昂贵的推理模型保留给确实需要的请求子集。对于一个全部价值主张就是“非常便宜、相当能干、尚未在前沿得到验证”的模型来说,这种分层路由——默认廉价、按需升级——可以说是生产环境中的正确部署方式,而不是把整个流水线押注在单一未经验证的模型上。

标准的多模态请求格式设置适用:图像输入与文本在同一消息中,多图像或多轮会话的大上下文窗口,以及清楚显示在使用量仪表板中的按 token 计费。在依赖之前,请针对您的工作负载测试实际输出长度上限,因为该最大值并未公布。

坦诚的局限与未证实之事

要直言不讳地说明这里真正未知的部分:截至目前,关于Qwen 3.7 Flash,没有任何来自Artificial Analysis或任何可比评估方的独立基准数据。它的质量——在实际视觉推理中的表现、在智能体多步骤任务中的可靠性、在长上下文场景中对抗干扰项的能力——目前仅靠阿里巴巴自身的定位表述来支撑,而不是由第三方通过标准化测试套件运行后给出的结果。供应商的描述与独立验证并非同一回事,读者在验证出现之前,应对该模型的能力保持相应的审慎态度。

除了基准测试,阿里巴巴并未公布模型架构、参数量或最大输出长度。社区中流传的“小型 MoE,可能是开源权重 Qwen 3.7 的前身”这一理论,是基于命名规律和定价的合理猜测,但终究只是推测,并未得到阿里巴巴证实。如果你的用例对模型透明度有要求(如已公开的架构、开放权重、技术报告),那么 Qwen 3.7 Flash 目前并不达标——它是一个封闭的、仅限 API 的模型,除 API 列表外几乎没有公开文档。

对比分析:Qwen 3.8、Qwen 3.7 Max 与廉价对手

这里命名的说法容易让人混淆,所以有必要精确说明。Qwen 3.8是阿里巴巴单独公布的开源重量级旗舰模型,据说基于2.4万亿参数设计——这是一款根本不同的模型,用途也不同:它是一个大型、开放、通用型前沿模型,旨在与前沿竞争,而不是一个廉价的多模态实用工具层。Qwen 3.7 Max是同一"3.7"发布浪潮中更大、推测能力更强的闭源旗舰——当你需要任务质量最大化且不计成本时,你应当选用的模型。Qwen 3.7 Flash,本文的主题,是该系列中第三款也是最便宜的型号:更小、更快、价格显著更低,并且专门针对多模态代理工作负载,而非追求通用型卓越性能。不要仅仅因为其中两个型号共享一个版本号就认为它们的能力或行为可以互通——它们是用途不同的不同模型。

与外部竞争相比,最接近的对比是谷歌的Gemini 3.5 Flash-Lite,它占据了一个类似的利基市场:一个低成本、多模态、高吞吐量的层级,专门用于上述那种大规模工作负载。这两个模型主要在相同的维度上竞争——每token价格、上下文长度和多模态处理——而不是在原始推理基准上,因为两者都不是被定位为前沿推理模型。由于缺乏Qwen 3.7 Flash的独立基准数据,本文无法负责任地对Gemini 3.5 Flash-Lite进行直接的质量比较;可以说的是,Qwen 3.7 Flash的定价在这个层级中具有竞争力或更低,并且其100万token的上下文窗口对于这个成本区间的模型来说是慷慨的,而这正是那种差距,使得廉价的多模态层级值得根据你自己的工作负载进行实际测试,而不是仅根据价格选择。

常见问题

什么是Qwen 3.7 Flash?

这是阿里巴巴Qwen团队开发的视觉语言推理模型,专为多模态智能体、视觉编码、搜索以及计算机/UI交互而构建,自2026年7月27日起以模型ID qwen/qwen3.7-flash 列出。

Qwen 3.7 Flash 的价格是多少?

每100万个输入token收费0.03美元,每100万个输出token收费0.13美元——在当前可用的视觉模型中属于最便宜的之一,且列表中还注明,通过提示缓存处理重复上下文时,还可享受60%-80%的进一步折扣。

什么是上下文窗口?

100万个tokens。

Qwen 3.7 Flash 和 Qwen 3.8 是一样的吗?

不,Qwen 3.8是阿里巴巴单独宣布的2.4万亿参数开源权重旗舰模型。Qwen 3.7 Flash是一个规模小得多、成本更低、封闭的多模态模型,用途不同。尽管两者都来自阿里巴巴的Qwen系列,但不应混淆。

Qwen 3.7 Flash 和 Qwen 3.7 Max 是一样的吗?

不。Qwen 3.7 Max 是同一“3.7”发布浪潮中较大的旗舰模型。Qwen 3.7 Flash 是较小、更快、便宜得多的层级,面向高容量多模态和智能体任务,而非最高质量输出。

Qwen 3.7 Flash 是否支持图像?

是的,这是一个视觉语言模型——它接受多模态(图像和文本)输入,并专门定位于视觉任务,如物体识别、空间理解、视觉编码以及计算机/用户界面交互。

最大输出长度是多少?

未由阿里巴巴官方披露。任何构建生产工作负载的人都应直接测试实际输出上限,而不是假设一个数字。

Qwen 3.7 Flash 是混合专家模型吗?

{{1}}未经确认。社区部分人士根据其定价和命名模式猜测它采用了小型专家混合(MoE)架构{{/1}},但阿里巴巴尚未公布架构细节,因此这仅是猜测,并非事实。{{2}}

它与 Gemini 3.5 Flash-Lite 相比如何?

两者均占据相似的低成本、高吞吐量多模态层级,主要是在价格和上下文长度上竞争,而非原始的推理基准。目前尚无独立的基准数据来对Qwen 3.7 Flash进行明确的质量比较。

我可以在哪里访问Qwen 3.7 Flash?

使用模型 ID qwen/qwen3.7-flash,通过任意 OpenAI 兼容客户端,或通过像 OrcaRouter 这样的路由层,将其设置为默认的廉价多模态层级,与其他模型一起使用。

Qwen 3.7 Flash 好吗?

截至撰写本文时,尚未经过独立验证——包括Artificial Analysis在内的任何第三方基准测试机构均未发布其评分。其价值主张在于价格和上下文长度,而非经过证实的质量领先优势,因此在投入之前,值得针对您的具体工作负载进行实证测试。

底线

Qwen 3.7 Flash 的目标不是登顶排行榜,阿里巴巴也没有提供相关文档供人验证——即便它想这么做。它的真正意图是:让视觉与智能体工作负载(屏幕截图分析、可视化代码检查、计算机使用循环、视觉搜索)变得足够廉价,以至于成本不再是阻碍你实现这些功能的理由。按每百万token 0.03/0.13美元的价格和100万token的上下文窗口,这种经济性确实能支撑大规模、常开的多模态智能体流量,这在任何质量层级中都鲜有模型能够匹敌。但需要坦诚面对其短板:没有独立基准测试,未公开架构或最大输出长度,在与Gemini 3.5 Flash-Lite等已确立地位的平价竞品对比时也存在真正的不确定性。不妨将其视为一个有前景且极其经济的默认选项,适合当下就测试多模态智能体工作负载——同时务必在脑海中将其与Qwen 3.8和Qwen 3.7 Max清晰区分开,后两者是解决完全不同问题的独立模型。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新