qwen/qwen3.5-flash

qwen/qwen3.5-flash
视觉工具JSON推理
来自 qwen

Qwen3.5 Flash — 多模态聊天(文本/图像/视频),成本优化,1M上下文。

上下文1M tokens
最大输出65K
输入模态text + image + video
输出模态text
p50 首字节2.71 s
输入$0.10/ 百万 tokens
输出$0.40/ 百万 tokens
p50 首字节2.71 s7 天
p95 首字节10.00 s7 天
流量1.3Mtokens / 7 天

Qwen3.5 Flash 是 Qwen 系列中的多模态语言模型,专为快速推理和低成本而设计。它接受文本、图像和视频输入,并生成文本响应。其上下文窗口为 1,048,576 个 token,可单次处理超长文档或多段视频帧。模型每次生成最多输出 65,536 个 token。可通过 OrcaRouter 的 API 以模型 ID "qwen/qwen3.5-flash" 访问。OrcaRouter…

什么是Qwen3.5 Flash?

这个模型是为谁设计的?

关键规格一览

代码示例

用任意 SDK 调用

兼容 OpenAI——沿用你现有的 SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3.5-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

支持的参数

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

价格

输入 / 1M tokens$0.100
输出 / 1M tokens$0.400
货币USD

费用计算器

每月 token 数10MM
输入占比70%%
预计每月 $1.90

基于标价的估算

Token 与费用估算器

输入 Token: 6每次请求费用: $0.000201

仅为估算——实际 Token 数取决于提供商的分词器。

性能

p50 首字节
2.71 s
输出速度
206 tok/s
p95 首字节
10.00 s
错误率
7.3%

公共基准测试

来源: Design Arena

社区热度

本周开发者的讨论

Hacker News0 次提及 · 近 7 天

对比一览

qwen/qwen3.5-flashQwen3.8 Maxqwen/qwen3-max-previewQwen3.5 397B A17B
输入 $/百万$0.10$2.00$0.86$0.17
输出 $/百万$0.40$6.00$3.44$1.03
上下文1.0M1.0M262K33K
质量6/109/108/108/10
并排对比并排对比并排对比并排对比

常见问题

在OrcaRouter上使用Qwen3.5 Flash的费用是多少?
成本为每100万输入token 0.10美元,每100万输出token 0.40美元。这是提供商费率,OrcaRouter不加价。您只需支付提供商收取的准确费用,无任何附加费用。
上下文窗口大小是多少?
上下文窗口为1,048,576个令牌(约100万个令牌)。这包括整个对话历史中的输入和输出令牌。每次生成的最大输出为65,536个令牌。
Qwen3.5 Flash 的优势是什么?
优势包括多模态输入(文本、图像、视频)、高达100万的上下文窗口、6.5万token的长输出、每token成本低,并且相较于更大的Qwen模型推理速度更快。它非常适合高吞吐或实时的多模态任务。
与更大的Qwen模型相比如何?
较大的Qwen模型(如Qwen3.5-72B)在复杂推理任务上精度更高,但速度较慢且成本更高。Qwen3.5 Flash在速度和成本效率上有所取舍,牺牲部分精度,同时保留相同的多模态和长上下文能力。
OrcaRouter是否对供应商定价进行加价?
不。价格按提供商费率直接传递,零加价。通过OrcaRouter使用Qwen3.5 Flash,你支付恰好每100万输入token 0.10美元,每100万输出token 0.40美元。
我能否使用兼容OpenAI的API调用Qwen3.5 Flash?
是的。OrcaRouter 在 https://api.orcarouter.ai/v1 提供了一个兼容 OpenAI 的端点。使用模型 ID "qwen/qwen3.5-flash" 和你的 OrcaRouter API 密钥。请求和响应格式与 OpenAI 的聊天补全 API 一致。
OrcaRouter 如何处理数据?
数据处理政策由OrcaRouter和Qwen确定。目录条目未提供具体细节。用户在发送敏感数据前应审阅OrcaRouter的隐私政策和Qwen的数据使用条款。
该模型支持哪些模态?
它支持文本、图像和视频输入。图像可以作为用户消息中的URL或base64数据提供。视频输入通常以帧(图像)序列的形式发送。该模型仅生成文本输出。
是否有最小或最大令牌数量要求?
没有最低 token 数量限制。最大输入 token 数(包括对话历史)为 1,048,576 个 token。每次响应的最大输出 token 数为 65,536 个。使用 max_tokens 参数控制输出长度。
我如何开始通过OrcaRouter调用这个模型?
注册OrcaRouter以获取API密钥。在代码中将base URL设置为https://api.orcarouter.ai/v1。使用模型ID "qwen/qwen3.5-flash" 并发送一个包含多模态内容的标准聊天补全请求。请参阅OrcaRouter文档获取示例。

嵌入此徽章

qwen/qwen3.5-flash$0.10/M in2705ms p50通过 OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3.5-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3.5-flash.svg" alt="qwen/qwen3.5-flash 在 OrcaRouter" /> </a>
Markdown [![qwen/qwen3.5-flash](https://www.orcarouter.ai/embed/qwen/qwen3.5-flash.svg)](https://www.orcarouter.ai/models/qwen/qwen3.5-flash)

以数据形式获取模型卡

GET /api/public/models/qwen/qwen3.5-flash打开