Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
视觉工具JSON推理
来自 Qwen · 2025-10-14

Qwen3-VL 8B Thinking — 开源轻量级视觉语言推理模型,80亿参数,支持128K上下文长度。

上下文131.1K tokens
最大输出41K
输入模态text + image + video
输出模态text
p50 首字节5.00 s
输入$0.18/ 百万 tokens
输出$2.10/ 百万 tokens
p50 首字节5.00 s7 天
p95 首字节8.55 s7 天
流量108.8Ktokens / 7 天

Qwen3 VL 8B Thinking 是阿里云 Qwen 团队开发的一款 80 亿参数多模态语言模型,托管于 OrcaRouter 平台,提供商为 qwen。它属于 Qwen3 系列视觉语言模型,其中“Thinking”后缀表示针对视觉和文本输入增强的推理能力。该模型支持文本、图像和视频输入,并生成文本输出。上下文窗口大小为 131,072 个 token,单次响应最多可生成 40,960…

什么是Qwen3 VL 8B Thinking?

谁应该使用这个模型?

它支持哪些模态?

Thinking 变体与标准版 Qwen3 VL 有何不同?

代码示例

用任意 SDK 调用

兼容 OpenAI——沿用你现有的 SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

支持的参数

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

价格

输入 / 1M tokens$0.180
输出 / 1M tokens$2.10
货币USD

费用计算器

每月 token 数10MM
输入占比70%%
预计每月 $7.56

基于标价的估算

Token 与费用估算器

输入 Token: 6每次请求费用: $0.001051

仅为估算——实际 Token 数取决于提供商的分词器。

性能

p50 首字节
5.00 s
输出速度
64.6 tok/s
p95 首字节
8.55 s
错误率
0%

公共基准测试

来源: Design Arena

对比一览

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
输入 $/百万$0.18$0.86$0.17$0.12
输出 $/百万$2.10$3.44$1.03$0.69
上下文131K262K33K1.0M
质量4/108/108/108/10
并排对比并排对比并排对比并排对比

常见问题

在OrcaRouter上,Qwen3 VL 8B Thinking每百万token的成本是多少?
输入令牌:每100万令牌0.18美元。输出令牌:每100万令牌2.10美元。这是提供商的费率,零加价直接传递。
上下文窗口和最大输出令牌数是什么?
上下文窗口为131,072个令牌。最大输出令牌为40,960个令牌。
这个模型的主要优势是什么?
它支持三种输入模态(文本、图像、视频),提供大的上下文和输出长度,并包含思考(chain-of-thought)能力,可提高复杂推理任务的性能。
这个模型与Qwen2 VL 7B相比如何?
它拥有更大的上下文(131K对比32K),更大的最大输出(40K对比2K),并增加了思考能力。定价略高,但提供了改进的推理和多模态理解。
OrcaRouter 在使用此模型时会缓存任何用户数据吗?
OrcaRouter 未报告任何存储提示或图像的缓存机制;数据处理遵循标准 API 实践。有关详细信息,请参阅 OrcaRouter 的隐私政策。
如何通过兼容OpenAI的API调用此模型?
向 https://api.orcarouter.ai/v1/chat/completions 发送一个POST请求,模型参数为"qwen/qwen3-vl-8b-thinking",并带上您的API密钥。使用包含text和image_url条目的content数组进行多模态输入。
该模型可以处理视频输入吗?
是的,通过将提取的帧作为单独的 image_url 条目发送,可以接受视频。该模型没有原生视频编解码器支持;它只处理静态帧集。
每次请求的图片数量是否有任何限制?
不,但总 token 数量(包括文本和图像 token)必须在 131,072 上下文限制内。没有单独的图像限制。
有哪些编程语言或库可以通过OrcaRouter访问这个模型?
任何支持HTTP请求和OpenAI API格式的语言都可以。例如,Python使用openai库,JavaScript使用fetch等。只需设置基础URL和模型ID。
不一定。虽然思考型变体(如DeepSeek-R1)在内部会生成详细推理过程,但最终回复通常只输出经过优化的结果。我仅在需要解释复杂逻辑、提供逐步分析或用户明确要求时,才会展示完整的链式推理。默认情况下,我会优先输出简洁直接的答案。
模型在生成最终答案之前会在内部逐步推理,但你看到的输出是完整的响应。中间思考的标记无法单独提取。

嵌入此徽章

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50通过 OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking 在 OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

以数据形式获取模型卡

GET /api/public/models/qwen/qwen3-vl-8b-thinking打开