Qwen3-VL 8B Thinking — 开源轻量级视觉语言推理模型,80亿参数,支持128K上下文长度。
Qwen3 VL 8B Thinking 是阿里云 Qwen 团队开发的一款 80 亿参数多模态语言模型,托管于 OrcaRouter 平台,提供商为 qwen。它属于 Qwen3 系列视觉语言模型,其中“Thinking”后缀表示针对视觉和文本输入增强的推理能力。该模型支持文本、图像和视频输入,并生成文本输出。上下文窗口大小为 131,072 个 token,单次响应最多可生成 40,960…
Qwen3 VL 8B Thinking 擅长视觉问答,尤其是当问题涉及多个物体、空间关系或图像中嵌入的文本(例如路标、收据)时。它还能处理视频理解任务,如总结短视频片段、识别行为或回答关于特定时间戳的问题。文档分析是其强项:从包含文本和图表的PDF或扫描表格中提取信息。其长上下文窗口使其适合处理带有偶尔插入图像的大文档(例如100页以上的PDF),只要总标记化输入保持在131K以下即可。
如果您的使用场景纯粹基于文本,且不涉及图像或视频,那么专用的纯文本模型(例如Qwen3-8B或类似规模的Llama变体)可能更具成本效益。多模态模型会因编码视觉输入而产生额外开销,且Qwen3 VL 8B Thinking的每token定价(每百万token输入0.18美元,输出2.10美元)可能高于许多纯文本替代方案。此外,如果您的任务是对非常短的图像进行简单分类或信息提取,那么一个延迟更低、成本更小的视觉语言模型(例如Qwen2 VL 2B)可能在兼顾性能的同时足矣。
是的,该模型可以在单次API调用中接受与文本交错的多个图像,只要总令牌数(图像令牌加文本令牌)不超过131,072的上下文窗口。每个图像根据其分辨率和复杂度被编码为可变数量的令牌。OrcaRouter的兼容OpenAI的API允许您在内容数组中发送多个图像URL或base64编码的图像。除了上下文限制外,对图像数量没有硬性限制。对于视频,您通常需要提取关键帧并将其作为单独图像连同文本提示一起发送。
如同所有多模态模型,Qwen3 VL 8B Thinking 在图像或视频中可能产生细节幻觉,尤其是在低分辨率或内容模糊的情况下。它并非为实时视频流设计,而是处理静态帧序列。8B 参数规模意味着它在高度专业化领域(如医学影像、卫星图像)的准确度可能不如更大规模模型(如 70B–100B+ 的视觉语言模型)。它不支持音频输入。思考过程会增加输出长度,因此需相应规划输出 token 的预算。最后,该模型针对英语进行了优化,但也能处理其他语言,效果因语言而异。
关于Qwen3 VL 8B Thinking在标准多模态评测(如MMMU、MathVista、VideoMME)中的具体基准分数,现有资料中尚未提供。用户应参考官方Qwen模型卡或研究论文以获取最终公布的结果。总体而言,Qwen3 VL系列在视觉语言任务上相较其他7B-8B参数模型展现出了有竞争力的表现。“Thinking”变体预计将提升推理密集型基准(如视觉思维链)的性能。在缺乏公开分数的情况下,建议在您自己的代表性数据集上测试该模型,以评估其适配性。
OrcaRouter 基础设施上该特定模型的延迟数据尚未公开。一般而言,8B 参数多模态模型的延迟会高于同等规模的纯文本模型,因为视觉编码需要额外处理。视频输入因需处理更多帧会导致延迟进一步增加。在高性能 GPU 集群(如 A100、H100)上,8B 模型的首 token 生成时间通常在几百毫秒到几秒之间,具体取决于输入长度和批处理大小。输出 token 生成速度通常为每秒几十个 token。这些数值为定性参考;实际性能取决于 OrcaRouter 当前的资源配置和负载情况。
优点:该模型能够处理长多模态上下文(131K令牌),允许大量输出(最多40K令牌),并支持三种输入类型。其思考能力提升了需要逐步推理的任务的推理表现。对于一款8B多模态模型而言,定价具有竞争力。 局限性:该模型尚未在许多公开排行榜上与最新前沿模型进行基准测试。其最大输出吞吐量可能低于较小模型。它未针对创意图像生成进行优化(仅输出文本)。用户不应假设在视觉任务中零幻觉。视频处理仅限于基于帧的提取,而非连续分析。
Qwen3 VL 8B 按 token 计费,采用供应商费率,无任何加价。输入 token 价格为每百万 token 0.18 美元,输出 token 价格为每百万 token 2.10 美元。无额外基础设施费、无每次请求基本费用、无月度订阅。该定价适用于所有输入模态(文本、图像、视频);每种模态均会被分词处理并按输入费率收费。OrcaRouter 不会在所述费率基础上收取任何额外费用。例如,处理一个分词后为 2,000 输入 token 的图像,其输入成本为 2,000 × (0.18 美元 / 100万) = 0.00036 美元。输出成本计算方式相同。
每张图像根据其尺寸和压缩级别编码为可变数量的令牌。高分辨率图像可能消耗数千个令牌。视频处理通过提取帧(通常每几秒一帧)并将每帧编码为图像来实现;因此令牌成本随视频时长和帧率线性增长。用户可通过调整图像尺寸或减少帧数来控制成本。编码媒体除令牌成本外不收取额外费用。输出成本仅取决于生成的文本令牌数量。对于长视频,输入令牌可能迅速接近131K限制,从而提高每次请求的成本。
根据提供的信息,目前没有针对批量使用或预付承诺的折扣。OrcaRouter目前不提供能降低重复提示或图像成本的令牌缓存服务。所有请求均按标准费率实时按令牌计费。如果提供商(qwen)未来推出分级定价,OrcaRouter将以零加价的方式传递这些优惠。建议用户关注OrcaRouter定价页面以获取最新更新。对于高用量场景,建议直接联系OrcaRouter讨论可能的批量定价方案。
与较大的多模态模型(例如 GPT-4V、Gemini 1.5 Pro)相比,Qwen3 VL 8B Thinking 的每 token 成本显著更低:那些模型每百万输入 token 通常花费 2–10 美元以上。在 7B-8B 参数的视觉语言模型中,其价格符合典型定价(Qwen2 VL 7B 的输入成本约为 0.10–0.20 美元,输出成本为 1–2 美元)。输出 token 成本(每百万 2.10 美元)高于一些纯文本 8B 模型(例如每百万输出 0.20 美元),这反映了额外的推理开销。如果可以使用更小的模型(例如 2B–4B 参数),成本可以降低 50–90%,但能力也会下降。
您可以通过向OrcaRouter的OpenAI兼容端点(https://api.orcarouter.ai/v1/chat/completions)发送POST请求来调用Qwen3 VL 8B Thinking。将模型参数设为"qwen/qwen3-vl-8b-thinking"。在Authorization头部以"Bearer <key>"格式包含您的API密钥。请求体遵循OpenAI聊天补全的schema。对于多模态输入,请将消息内容构造为一个对象数组:一个type为"text"的对象用于文本提示,每个图片对应一个type为"image_url"的对象(可使用URL或base64数据)。视频可通过多个image_url条目以帧的形式发送。响应遵循标准的OpenAI结构,所有生成的文本位于choices数组中。
支持所有标准的 OpenAI 聊天完成参数:temperature (0–2,默认 1.0),top_p (0–1,默认 1.0),max_tokens(最多 40960),停止序列,frequency_penalty,presence_penalty,logprobs 和 n(完成数量)。该模型不支持流式传输?当设置 streaming=true 时,OrcaRouter 可能支持流式传输;请查看提供商的文档。如果底层提供商启用,则可能支持工具(函数调用)参数;目前不保证。允许系统提示。可以传递用户 ID 用于监控。请确保在发送前监控 token 数量,以保持在 131072 token 的上下文窗口内。
如果您当前正使用来自其他API提供商(例如直接来自阿里云)的相同模型,迁移到OrcaRouter非常简单:将基础URL改为https://api.orcarouter.ai/v1,将模型字符串更新为"qwen/qwen3-vl-8b-thinking",并将API密钥替换为OrcaRouter的API密钥。无需进行其他代码更改,因为OrcaRouter使用完全相同的OpenAI兼容接口。请注意,Token使用量和定价将基于OrcaRouter的费率(直通无加价)。您可能需要调整成本监控工具以反映新定价。
流式传输可通过OrcaRouter的API实现。在请求中将stream参数设为true。响应将是一个服务器推送事件(SSE)流,包含生成令牌的增量信息。这对于实时显示非常有用。请注意,对于"Thinking"变体,思考过程可能导致首个令牌出现前有较长延迟,但流式传输仍会在生成过程中发送增量令牌。流格式遵循OpenAI的流式规范,事件类型为"chat.completion.chunk"。每个块包含一个delta,其中包含令牌的内容或角色。
Qwen3 VL 8B Thinking 是 Qwen2 VL 7B 的继任者,参数规模大致相同(8B vs 7B),但采用改进的架构以支持更长的上下文(Qwen3 VL 8B Thinking 为 131K,Qwen2 VL 7B 为 32K)。它还新增了“Thinking”能力,支持逐步推理,这是 Qwen2 VL 所没有的。最大输出长度从 2048 tokens(Qwen2 VL 7B)提升至 40960 tokens。Qwen3 VL 8B Thinking 的每 token 定价略高于 Qwen2 VL 7B(后者每百万 tokens 输入约 $0.15,输出约 $1.80),这反映了新增的功能和更大的上下文。升级用户应预期在复杂推理任务上获得更好的性能。
GPT-4o mini 是 OpenAI 推出的一款旗舰多模态模型,拥有 128K 上下文窗口。其参数量远超以往(具体未知,但预估超过 70B),在标准基准测试中通常能取得更高的准确率。然而,Qwen3 VL 8B Thinking 在成本上更具优势:GPT-4o mini 每百万输入 token 收费 0.15 美元,每百万输出 token 收费 0.60 美元,这实际上比 Qwen3 的输入 0.18 美元和输出 2.10 美元更低?等等,再确认一下:GPT-4o mini 输入 0.15 美元、输出 0.60 美元——比 Qwen3 VL 8B Thinking 更便宜?实际上输出便宜得多。因此并非所有场景下成本都更低。但 Qwen3 支持视频和更长的输出(40960 token,而 GPT-4o mini 为 16384 token)。上下文窗口相近。选择取决于所需的准确率和预算;Qwen3 适用于极长输出和开源部署的特定场景。
Llama 3.2 11B Vision 是一个拥有 110 亿参数的多模态模型,具备 128K 上下文窗口和最大 8000 个输出令牌。Qwen3 VL 8B Thinking 的参数数量较小,但最大输出令牌数大得多(40960 对比 8000),并且包含思考能力。两者都支持文本和图像输入,但 Llama 3.2 11B 原生不支持视频。Llama 通过提供商提供的定价类似,输入每百万令牌约 $0.15–$0.20,输出约 $0.60–$1.00,这使得 Qwen3 在输出方面更昂贵。对于需要非常长生成文本的任务(例如根据视频撰写报告),Qwen3 更为适合。对于较短且对成本敏感的任务,Llama 3.2 11B 可能更可取。
Gemini 1.5 Flash 是一款快速、高性价比的多模态模型,拥有 1M 上下文窗口(最高可达 2M),支持图像、视频和音频。它比 Qwen3 VL 8B Thinking 更便宜(Gemini Flash 每百万 token 输入成本 $0.075,输出成本 $0.30)且速度更快。然而,Qwen3 VL 8B Thinking 提供了思考过程,可提升在挑战性视觉任务上的推理能力,且其最大输出长度大得多(40K vs Gemini Flash 的 8K)。如果您的应用需要逐步推理和长输出,Qwen3 是更好的选择。对于高吞吐量和低延迟,Gemini Flash 通常更具优势。此外,当数据主权要求自托管或与供应商无关的部署时,Qwen3 可能是更优之选。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| 输入 / 1M tokens | $0.180 |
| 输出 / 1M tokens | $2.10 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking