Qwen3-VL 235B-A22B Instruct——开源权重视觉语言模型,2350亿总参数量 / 220亿激活参数量,256k上下文长度,无思考模式。
Qwen3 VL 235B A22B Instruct 是 Qwen3 模型系列的视觉-语言变体,由阿里云构建。它采用混合专家架构,总参数量为 2350 亿,其中每次前向传播大约有 220 亿参数被激活。这种 MoE 结构使模型在保持高容量的同时,推理成本低于同等总参数量的稠密模型。该模型接受文本和图像两种输入,并生成文本输出。它经过指令微调,能够在多模态场景下可靠地遵循提示。OrcaRouter…
该模型在图像与文本交互的任务中表现出色。它能回答关于图像内容的问题,详细描述场景,读取文档或标志中的文字,并推理图像中物体之间的关系。它还能在单次对话中处理多张图像,支持对比分析或顺序推理。指令微调使模型能够遵循复杂的多模态提示,例如“解释为什么这张图表显示某种趋势”或“从这个表格中提取所有数值”。这些能力源于庞大的MoE骨干网络和专门的视觉-语言训练。
作为Instruct变体,该模型经过微调,能够高度遵循用户指令,无论是纯文本提示还是多模态提示均可胜任。它可处理逐步引入图像的多轮对话,能在多个交互回合中保持上下文一致性,并遵循格式化指令(例如输出为JSON、项目符号或逐步说明)。在需要遵守约束条件(如"仅当图像包含狗时回答")的任务中表现良好。这使得它适用于需要一致性和规则遵循行为的应用场景。
对于纯文本任务(无视觉组件),235B MoE模型可能大材小用;较小的密集模型或其他纯文本Qwen变体更具成本效益。类似地,如果你的图像很简单(例如基础标志、单一物体),或者你需要在预算内实现极高的吞吐量,像Qwen2-VL 7B这样较小的视觉模型可能就足够了。当你需要处理复杂、高分辨率的图像,包含密集文本的文档,或者需要深度多模态推理的任务时,这个模型最合适。在OrcaRouter上,你可以轻松比较定价并切换模型ID。
不。Qwen3 VL 235B A22B Instruct 是一个仅接受图像作为输入的文本生成模型。它不会生成图像、音频或任何其他模态。输出始终是文本字符串。如果你需要图像生成,则应使用单独的模型。该模型的优势在于理解和推理视觉输入。例如,它可以描述图像的外观或回答有关图像的问题,但它本身无法创建、编辑或转换图像。
该模型的MMLU-Pro得分为82.3。MMLU-Pro是Massive Multitask Language Understanding基准测试的增强版本,涵盖STEM、人文和社会科学领域的57个学科。82.3的分值表明模型在广泛主题上具备较强的通用知识和推理能力。这是一个单一数字的汇总;不同学科的表现可能有所差异。该得分使该模型在其尺寸类别中位居前列,尤其是考虑到其MoE架构每次查询仅激活总参数的一小部分。
优势包括在多模态推理基准测试上具有高准确率、强大的指令遵循能力,以及与类似总参数量的密集模型相比具有成本效益。MoE设计使其能够在无需按比例增加计算成本的情况下扩展容量。局限性包括与较小模型相比绝对成本较高,以及由于总参数量大(尽管仅有220亿参数被激活,但完整模型必须加载到内存中)可能导致延迟增加。它还可能在图像细节上偶尔产生幻觉,或在高度模糊的视觉输入上失败。特定领域任务(如医学影像)的性能无法保证。
推理速度取决于OrcaRouter所用的硬件后端和当前负载。作为总参数量达2350亿的MoE模型,尽管每个token仅激活220亿参数,但仍需大量GPU内存。相较于较小的密集模型(如7B-70B参数),这通常会导致单次请求的延迟更高。吞吐量也受批处理大小和序列长度影响。对于延迟敏感型应用,建议使用较小的模型或优化提示词长度。OrcaRouter不提供具体的延迟保障,但致力于达到生产级的响应能力。
OrcaRouter 严格按照提供商所列的费率收费:每百万输入代币 0.40 美元,每百万输出代币 1.60 美元。不收取任何额外加价。输入和输出代币均按照 OpenAI 的标记化规则计算,该规则可能与模型内部标记化器略有差异。图像也根据其尺寸和细节级别按代币计费,遵循提供商的策略。您可以通过将预期的代币用量乘以这些费率来估算成本。
每个token的成本高于较小或稠密模型,但MoE架构比同等活跃参数规模的稠密模型提供了每个活跃参数更多的容量。对于复杂的多模态任务,该模型可能以更少的token数或更高的准确率完成任务,从而可能降低总开销。然而,对于简单任务,使用更便宜的模型可以降低成本。在OrcaRouter上,您可以即时切换模型,从而仅在需要时使用此模型。没有月度最低消费或隐藏费用。
OrcaRouter目前未公开此模型的具体缓存策略。底层提供商可能会应用令牌级缓存,但并不保证。未提及批量折扣或阶梯定价;费率按令牌统一收取。对于高用量用户,建议联系OrcaRouter支持以获取可能的定制方案。总体而言,定价透明且基于使用量。
图像会根据其分辨率和细节设置转换为 token 数量。具体公式由提供商(Qwen)定义,可能有所不同。通常,更高分辨率的图像会消耗更多 token。OrcaRouter 会直接传递提供商的 token 化结果,不做任何修改。您可以通过调整图像大小或使用低细节模式(如果模型支持)来控制成本。请始终参考提供商的文档以获取精确的图像 token 计算方式。图像的输入 token 将按每百万个 $0.40 的费率计费。
你向 https://api.orcarouter.ai/v1/chat/completions 发送一个 POST 请求,请求体为兼容 OpenAI 的 JSON 格式。将 model 字段设置为 "qwen/qwen3-vl-235b-a22b-instruct"。在 messages 数组中,每条消息可包含文本和/或图片内容。图片使用标准的 OpenAI 图片内容格式(URL 或 base64)。认证方式采用 Bearer token(你的 API 密钥)。示例参数:temperature、max_tokens、top_p 以及 stop 序列的使用方式与 OpenAI API 完全相同。OrcaRouter 的文档提供了完整细节。
所有标准聊天补全参数均受支持:temperature(0-2,默认1)、top_p(0-1,默认1)、max_tokens(输出token数量)、stop(字符串列表)、presence_penalty、frequency_penalty以及用于结果可复现的seed。模型还会遵循系统消息以设置行为。对于多模态请求,需在用户消息的内容中包含图像部分。未暴露模型专用参数;API保持通用以兼容。若需控制MoE路由,则由内部处理。
是的。因为OrcaRouter使用的是OpenAI API格式,迁移过程非常简单。只需将您现有的基础URL和模型ID替换为OrcaRouter的端点以及“qwen/qwen3-vl-235b-a22b-instruct”。确保您的API密钥有效且账户有足够的积分。图片的消息格式与OpenAI完全相同(使用'image_url'内容类型)。由于分词方式不同,您可能需要调整令牌数的估算。除了端点和模型名称外,无需对应用程序逻辑进行任何更改。
Qwen3 VL 235B A22B Instruct 和 GPT-4V 都支持多模态输入。主要区别在于:Qwen3 VL 采用 MoE 架构,拥有 220 亿活跃参数,而 GPT-4V 是未公开规模的专有密集模型。通过 OrcaRouter,Qwen3 VL 的定价为每百万 token 0.40 美元/1.60 美元,显著低于典型的 GPT-4V 费率。由于 MMLU-Pro 等测试使用了不同的子集,基准分数无法直接比较。GPT-4V 拥有更广泛的生态系统支持,但在 OrcaRouter 上处理大量多模态工作负载时,Qwen3 VL 的成本优势更为明显。
Claude 3.5 Sonnet 是 Anthropic 推出的一款稠密模型,具备强大的文本和视觉能力。它未使用 MoE 架构,因此总参数量少于 Qwen3 VL,但每次推理的活跃参数量高于 22B。Claude 3.5 Sonnet 的定价通常更高(每百万 token 约 $3.00/$15.00)。Qwen3 VL 在多模态任务上成本更低。不过,Claude 模型拥有更大的上下文窗口(20 万 token)。选择取决于预算、上下文长度需求以及偏好的服务提供商。
OrcaRouter likely offers other Qwen models such as Qwen2.5 7B, Qwen2.5 72B, or Qwen2-VL variants. The Qwen3 VL 235B A22B Instruct 是Qwen系列中最大的多模态MoE模型。与Qwen2-VL 72B相比,它的总参数量更大并采用MoE架构,可在保持合理推理成本的同时,在复杂任务上实现更好的性能。其每个token的成本高于较小的Qwen模型,但如果能减少多次调用或高token消耗的需求,则可能具有成本效益。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| 输入 / 1M tokens | $0.400 |
| 输出 / 1M tokens | $1.60 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct