Qwen3.5 Flash — 多模态聊天(文本/图像/视频),成本优化,1M上下文。
Qwen3.5 Flash 是 Qwen 系列中的多模态语言模型,专为快速推理和低成本而设计。它接受文本、图像和视频输入,并生成文本响应。其上下文窗口为 1,048,576 个 token,可单次处理超长文档或多段视频帧。模型每次生成最多输出 65,536 个 token。可通过 OrcaRouter 的 API 以模型 ID "qwen/qwen3.5-flash" 访问。OrcaRouter…
Qwen3.5 Flash 支持文本、图片(包括每请求多张图片)和视频输入。对于视频,模型可以处理帧或完整的视频文件,直至达到上下文限制。它通过单个 API 调用同时处理这些模态,从而支持描述视频场景、回答关于图片的问题,或将文本指令与视觉内容结合等任务。支持的具体视频长度取决于帧提取和 100 万上下文窗口内的令牌预算。
该模型在处理需要大上下文和多模态输入的任务时表现出色。例如:总结长视频转录文本、从带图像的扫描文档中提取结构化数据,以及构建引用视觉上下文的对话式智能体。此外,它还能高效进行高吞吐量批处理——较低的每Token成本(尤其是输入Token)使其在经济上适合处理数百万次查询。对于纯文本任务,更便宜的纯文本模型可能更具成本效益。
对于纯文本且不需要多模态能力的任务,使用价格更低的小型或纯文本模型可能更具成本效益。Qwen3.5 Flash的优势在于其多模态和长上下文能力;如果您的应用仅需短文本补全,text-davinci或更小的Qwen变体等模型可能更省钱。同样,若不需要完整的1M上下文,使用窗口较小的模型可降低延迟和成本。
"Flash" 标识表示该模型为了更快的推理速度和更低的计算成本,牺牲了一定的基准准确性。与千问的更大模型(如 Qwen3.5-72B)相比,它采用了参数更少、效率更高的架构。基准测试分数由千问发布,但未在此目录条目中提供。在实际应用中,它在多模态理解任务上表现具有竞争力,同时每个请求的延迟更低,适合实时应用场景。
延迟取决于输入大小、输出长度和服务器负载。由于 Qwen3.5 Flash 专为速度而设计,在相同 token 数量下,它通常比 Qwen3.5-72B 等更大的模型返回响应更快。目录中未提供确切的每秒 token 数。用户可以通过 OrcaRouter 的端点测试性能,以衡量其特定用例的实际延迟。1M 上下文窗口可能会为很长的输入带来处理开销。
优势包括多模态输入、超长上下文、65K输出tokens,以及每个token的低成本。该模型在处理长文档和视频方面表现良好。局限性:与更大的前沿模型相比,在复杂推理或数学任务方面并非最准确,也可能难以应对细微的多步骤指令。对于需要顶尖输出质量的任务,考虑使用更大的Qwen或GPT-4o类模型。'Flash'架构优先考虑吞吐量和成本,而非峰值准确性。
定价为每100万输入代币(文本、图像或视频代币)0.10美元,每100万输出代币0.40美元。这些费率按提供商的价格计费,OrcaRouter不收取任何加价。API网关不收取额外费用。此定价直接传递,意味着最终用户支付的费用与直接调用提供商自有API相同,无需任何OrcaRouter附加费。代币计数遵循每种模态的标准分词方式。
输入Token价格(0.10美元/百万Token)在多模态模型中非常有竞争力。例如,许多大型多模态模型每百万输入Token收费2-10美元。输出价格(0.40美元/百万Token)也很低。然而,由于模型拥有100万Token的上下文窗口,即使每条Token费率较低,处理超长输入也可能导致总体成本较高。用户应平衡上下文长度与请求数量。对于短输入,较小的模型可能提供更低的绝对成本。
目录条目未指定Qwen3.5 Flash在OrcaRouter上是否支持缓存。用户应查阅OrcaRouter的文档,了解提示缓存或响应缓存功能的详细信息。如果不支持缓存,重复的相同输入将每次产生完整的token费用。对于批量处理,考虑对输入去重或使用本地缓存以减少API调用。无论缓存状态如何,定价均按提供商费率执行,不加价。
使用 OrcaRouter 提供的 OpenAI 兼容端点 https://api.orcarouter.ai/v1。在请求中将模型参数设置为 "qwen/qwen3.5-flash"。提供一个 OrcaRouter 的 API 密钥。请求格式与 OpenAI 的聊天补全 API 一致,支持角色(system、user、assistant)以及使用包含 "type": "image_url" 或 "type": "text" 的 "content" 数组的多模态内容。对于视频,你可能需要提取帧并将其作为图像传递。有关确切的视频处理指南,请参考 OrcaRouter 文档。
标准的 OpenAI 兼容参数:temperature、top_p、max_tokens(最高 65536)、stop sequences、presence_penalty、frequency_penalty 和 seed。max_tokens 参数上限为 65536,以匹配模型的最大输出。模型支持通过 stream: true 进行流式传输。您还可以设置用户 ID 用于跟踪。对于多模态请求,请在用户消息中包含图像或视频内容。模型在所有轮次中最多接受总计 1,048,576 个 token 的上下文窗口。
如果您已经在使用OpenAI的Python SDK,请将base_url更改为https://api.orcarouter.ai/v1,并将模型名称更新为"qwen/qwen3.5-flash"。身份验证使用OrcaRouter API密钥,而不是OpenAI密钥。请求和响应结构完全相同。从其他提供商迁移时,请使用聊天补全格式。确保系统提示和多模态内容按照OpenAI约定进行格式化。除了端点和模型名称外,无需更改代码。
是的,OrcaRouter API 支持多轮对话中的系统消息、用户消息和助手消息。完整的对话历史会占用 1,048,576 个 token 的上下文窗口。模型处理用户消息中的多模态内容。对于视频,您可以在单条用户消息中以图像形式发送多个帧。模型会在轮次间保持上下文,因此只要总 token 数不超过限制,您就可以进行包含长历史记录的扩展交互。
Qwen3.5 Flash 是相比 Qwen3.5-72B 或 Qwen3.5-32B 等更大 Qwen 模型更小、更快、更便宜的替代方案。它在基准测试精度上有所牺牲,以换取更低的延迟和成本。它与其更大的兄弟模型共享相同的多模态输入支持和较大的上下文窗口(1M)。对于需要最先进推理能力的任务,更大的模型是首选。对于速度和成本更重要的高流量或实时应用,Flash 是更好的选择。
GPT-4o 在许多推理和多模态基准测试中提供了更高的准确性,但价格也显著更高(通常 GPT-4o 每百万输入令牌收费 $2.50,GPT-4o mini 收费 $0.15)。Qwen3.5 Flash 更便宜(输入每百万收费 $0.10),且拥有更大的上下文窗口(1M,而 GPT-4o 为 128K)。其输出令牌限制(65K)也超过了 GPT-4o mini(16K)。对于输入极长且对成本敏感的应用,Qwen3.5 Flash 在保持良好多模态理解能力的同时,可能更具经济性。
Claude 3 Haiku 和 Gemini 1.5 Flash 是相似的"闪速"模型。Claude 3 Haiku 仅支持文本,定价为每百万输入 tokens 0.25 美元。Gemini 1.5 Flash 支持多模态输入,具有 1M 上下文窗口,定价为每百万输入 tokens 0.075 美元。Qwen3.5 Flash 的多模态支持和 1M 上下文使其处于类似层级,其输出定价($0.40/1M)高于 Gemini Flash($0.30/1M),但低于 Haiku($1.25/1M)。基准测试表现因任务而异。
OrcaRouter托管像Llama 3.1 8B和Mistral 7B这样的开源模型。Qwen3.5 Flash是一个专有模型,但在成本和能力上有竞争力。开源模型通常每个token成本较低或为零(你只需支付计算费用),但可能需要更多工程工作来部署。Qwen3.5 Flash提供零加价的管理API、100万上下文窗口以及大多数开源模型缺乏的多模态支持。它是开源灵活性和专有质量之间的良好折中方案。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| 输入 / 1M tokens | $0.100 |
| 输出 / 1M tokens | $0.400 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
本周开发者的讨论
@misc{orcarouter_qwen3_5_flash,
title = {qwen/qwen3.5-flash API},
author = {qwen},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-flash}
}qwen. (n.d.). qwen/qwen3.5-flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-flash