Qwen3.5 122B-A10B — 开放权重的 MoE 多模态(文本/图像/视频),总计 122B / 10B 激活参数,32k 上下文(视觉模式)
Qwen3.5-122B-A10B是阿里云Qwen系列的一个大语言模型。它采用混合专家(MoE)架构,每次前向传播仅激活100亿参数,而总参数量为1220亿。这种设计旨在兼顾高容量与高效推理。该模型在包含文本、图像和视频数据的语料库上训练,使其能够理解并基于多种模态生成回复。其上下文窗口为32768个token,单次生成最多可达65536个token。该模型在τ²-Bench上获得了93.6分,该…
根据其架构和基准测试得分,Qwen3.5-122B-A10B在多步推理、工具使用和指令遵循等任务上表现出色。τ²-Bench 得分为93.6,表明该模型在需要规划并使用工具(如计算器、搜索引擎、代码解释器)执行一系列操作的基准测试中展现出强大性能。这使得它非常适合构建需要与外部系统交互的自主智能体。该模型还支持多模态输入,因此视觉推理、嵌入图像的文档分析或视频摘要等任务均在其能力范围内。此外,其较大的输出限制使其能够单次响应生成详尽的解释、代码补全或结构化数据。从事复杂聊天机器人、编程助手或研究分析工具开发的开发者可能会发现该模型效果出众。
虽然 Qwen3.5-122B-A10B 功能强大,但它并非所有场景下最具成本效益的选择。如果你的任务只是简单的分类、短文本生成,或者不需要多步推理或多模态理解的直白问答,使用 Qwen-7B 等较小模型或非多模态模型可能就能获得令人满意的结果。这些模型在每 token 成本上更便宜,速度也更快。此外,如果你的上下文需求非常小(例如不足 1,000 个 token),那么使用 122B 参数模型带来的相对开销可能并不划算。OrcaRouter 提供了一系列定价和性能特性各异的模型。你可以先试用较小的模型,仅在质量不足时再升级。另外,如果你不需要 65K 的输出长度限制,输出长度较短的模型可能就足够了。
该模型拥有32,768个token的上下文窗口和最多65,536个token的输出能力,使其能够处理长链条推理和复杂指令。较高的τ²-Bench得分表明,它能在多步骤中保持连贯性,并正确遵循涉及条件逻辑、工具调用和分支的复杂指令。实际使用中,用户反馈Qwen3.5系列模型在数学问题求解、代码生成和逻辑谜题等任务上与其他先进模型具有竞争力。不过,与所有大模型一样,如果上下文中充斥着无关信息或指令模糊不清,其性能可能会下降。建议采用提示工程来有效引导模型。此外,当处理接近上下文限制的超长文档时,模型可能需要从开头回忆细节,这可能会带来困难。
多模态输入(文本+图像/视频)可实现多种实际应用。在文档分析中,模型能够读取PDF或图像中的文字以及嵌入的图表、示意图或签名。例如,它可以从扫描的表格中提取数据,或解读图形。在视觉问答中,模型可以回答关于照片或插图的问题。在视频分析中,它可以逐帧处理以描述场景或跟踪随时间的变化。开发者可以构建无障碍工具(例如为视障用户描述图像)或自动化工具(例如分析UI截图)。由于模型通过OrcaRouter进行访问,这些能力可以通过与纯文本提示相同的API调用集成到现有应用中,只需在消息内容中包含image_url或video_url即可。
该模型唯一公布的基准测试是τ²-Bench,得分为93.6。τ²-Bench旨在评估模型在模拟环境中使用工具和完成多步骤任务的能力。93.6分表明该模型能够正确完成较高比例的任务。作为参考,该分数在同一基准测试中与其他先进模型相比具有竞争力。然而,基准测试分数并不总能转化为实际性能,因为任务难度各异,且基准测试可能无法覆盖所有领域。用户应针对自己的具体任务自行评估。可用信息中未提供其他基准测试分数(如MMLU、HumanEval或多模态基准),因此无法在更广泛的标准指标上比较该模型。
优势:该模型在工具使用基准测试中取得了高分,表明其具备强大的推理和指令遵循能力。其多模态能力和大输出限制使其用途广泛。MoE架构可能在性能与效率之间提供良好平衡(至少与总参数相近的密集模型相比如此)。局限性:该模型的上下文窗口仅为32,768个token,与一些提供100K或更大窗口的模型相比属于中等水平。其激活参数(10B)对于该规模的总参数相对较低,可能限制其处理极复杂任务的性能上限。目前尚无关于延迟、吞吐量或硬件需求的信息。此外,由于该模型较新,社区生态(如微调脚本、量化工具)可能不如已成熟的模型完善。用户应充分测试该模型。
目前OrcaRouter上尚无该模型的具体延迟或吞吐量数据。推理速度取决于输入长度、输出长度、批次大小以及OrcaRouter分配的底层硬件等因素。MoE模型的速度可能因路由机制对不同令牌激活不同专家而有所变化。通常,具有10B激活参数的模型可在现代GPU上以中等速度生成,但内存中总共有122B参数,可能导致更高的内存使用和更长的预填充时间。如果对低延迟要求严格,建议使用您的典型提示词测试该模型。OrcaRouter的API会在响应头中返回时间戳和性能指标,帮助您衡量速度。对于延迟敏感的应用程序,如果任务允许,可考虑使用更小的模型。
目前可获取的事实仅包含单一基准测试:τ²-Bench。常见的基准测试,如MMLU(知识)、HumanEval(代码)、GSM8K(数学)或多模态基准测试(如MMBench)并未提供。这使得难以评估模型在与工具无关的任务上的表现。例如,如果您的应用需要事实准确性,您会希望了解其在MMLU上的表现。同样,对于多模态任务,视觉推理基准的得分会很有用。这些得分的缺失并不代表性能不佳,而是意味着用户必须自行评估。OrcaRouter可能应在请求时或文档中提供其他基准测试结果。在更多数据可用之前,建议在您的特定领域内将该模型与其他模型进行定性比较。
在现有资料中,OrcaRouter 上 Qwen3.5-122B-A10B 的定价详情并未明确列出。通常,OrcaRouter 按输入和输出的 token 数量收费,提示 token 和生成 token 采用不同费率。多模态输入(图片/视频)会根据处理的图像块或视频帧数折算为 token 计费。部分服务商还会对重复使用相同提示的用户提供缓存命中折扣。要获取确切价格,用户应查阅 OrcaRouter 的定价页面或联系其销售团队。由于该模型拥有 122B 总参数且支持多模态,其每 token 价格可能高于较小或纯文本模型。在估算任务总成本时,需将图片/视频的 token 费用纳入考虑。
使用像Qwen3.5-122B-A10B这样更大的模型,通常每个token的成本比小模型更高。然而,如果模型凭借其能力能够用更少的步骤或更少的token完成任务,总成本可能仍然具有竞争力。巨大的输出限制(65,536个token)既是优势也是成本风险:生成长输出会迅速累积token成本。此外,多模态输入每个提示消耗的token比纯文本提示更多。例如,一张高分辨率图像可能花费数百个token。如果你的任务不需要模型的全部能力,选择较小的模型可以节省成本。OrcaRouter可能提供使用仪表板和成本控制功能,例如设置最大输出token数或预算提醒,这有助于管理开销。
现有事实中并未提及OrcaRouter上该模型有任何缓存折扣。许多推理提供商提供提示缓存,即将系统提示或用户消息中重复的文本临时存储并以较低费率计费。如果OrcaRouter支持缓存,则可降低使用长静态提示(例如系统指令、角色描述)的应用的成本。然而,若无具体文档,不应假设其支持。用户可以检查API响应头中是否有缓存命中指示器(若已实现缓存)。为降低成本,可通过将静态指令与动态内容分离来避免重复相同的前缀。此外,可考虑使用较短的上下文窗口,或在可能时省略不必要的图像。
要使用Qwen3.5-122B-A10B,请向OrcaRouter API端点 https://api.orcarouter.ai/v1/chat/completions 发送POST请求。将模型参数设置为 "qwen/qwen3.5-122b-a10b"。该API与OpenAI的聊天补全格式完全兼容,因此您只需更改基础URL和API密钥,即可使用相同的客户端库(例如openai Python库)。请求的正文包含消息(每条消息包含角色和内容),以及可选的参数,如temperature、max_tokens、top_p等。对于多模态输入,使用包含type: "image_url"的内容块处理图像,或使用模型特定的视频处理方式(可能通过base64编码的帧或URL)。API将返回一个JSON响应,其中包含生成的文本和使用情况元数据(token计数)。OrcaRouter文档提供了有关支持参数的更多详细信息。
该模型支持标准的聊天参数:temperature(默认通常为0.7)、top_p(默认0.9)、max_tokens(最大可达模型的65536输出上限)、presence_penalty、frequency_penalty和stop sequences。上下文窗口限制为32,768个令牌,包括所有消息、图像和视频帧。如果总令牌数超过此限制,API将返回错误或截断输入(取决于设置)。max_tokens参数不能超过65,536。对于多模态请求,请注意图像和视频会增加令牌数;未提供确切的转换率,但高分辨率或长视频可能快速消耗上下文窗口。OrcaRouter还可能支持流模式,在此模式下响应会逐令牌流式传输,这对于实时应用程序很有用。请查看API参考以了解logprobs或tools等其他选项。
迁移非常简单:将您的基准 URL 替换为 https://api.orcarouter.ai/v1,使用模型 ID "qwen/qwen3.5-122b-a10b",并提供您的 OrcaRouter API 密钥。请求格式与 OpenAI 聊天补全 API 完全相同。例如,在 Python 中使用 openai 库时,您可以设置 client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key')。然后调用 client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...)。如果您的应用程序使用了函数调用或工具,请注意该模型支持这些功能,因为它是在涉及工具使用的 τ²-Bench 上训练的。然而,具体的工具调用语法可能与 OpenAI 有所不同;OrcaRouter 很可能支持 OpenAI 格式,但请进行测试以确认。对于多模态输入,您现有的在消息中发送 image_url 的代码可能可以工作,只要模型支持该格式。
在Qwen系列中,该模型介于较小的密集模型(如Qwen-7B、Qwen-14B)和最大的MoE模型(如Qwen3.5-235B)之间。与密集模型相比,该MoE模型可以访问更大的总参数量,但每个token仅激活其中一部分,这可能使专家更加专业化。这有助于在多种任务上获得更好的性能,尤其是需要多样化知识的任务。然而,较小的密集模型在狭窄任务上可能更快、成本更低。与更大的Qwen3.5-235B相比,该模型性能可能较低,但效率更高。多模态支持是Qwen3.5代的常见特性;早期版本(Qwen2、Qwen1)仅支持文本。用户应比较各自任务上的基准测试结果,以决定哪种模型最适合。
没有全面的基准测试,直接比较很困难。Qwen3.5-122B-A10B 在 τ²-Bench 上获得了 93.6 分,这对工具使用任务来说是一个强劲的结果。作为参考,其他模型在该基准上的类似分数并未提供,但这被认为是一项高水平的能力。在架构方面,Llama 模型是密集且更简单的,而 Claude 模型则有不同的专有架构。Qwen3.5 提供多模态输入(图像/视频),Claude 支持此功能,但 Llama 3.2 和 3.1 仅为文本(除某些视觉变体)。32K 的上下文窗口小于 Claude 的 100K 或 200K,但与 Llama 3.1 的 128K 相当?不完全是;我们不能编造数字。在代码和推理方面,许多模型具有竞争力。该模型的优势可能在于其针对工具使用(τ²-Bench 高分)和多模态 MoE 效率的特定调优。然而,Claude 和 Llama 拥有更大的生态系统和更多的社区支持。
很少有模型能在单个模型中同时结合多模态输入、大上下文窗口、大输出限制和高τ²-Bench得分。Qwen3.5系列被设计为能力强大的通用模型,具备强大的推理和工具使用技能。其采用MoE架构,总参数量122B,激活参数量10B,使得模型能够容纳大量知识,同时推理成本低于同规模密集模型(122B)。不过,其他MoE模型如Mixtral 8x7B(总参数量47B,激活参数量13B)则有不同的权衡。Qwen3.5-122B-A10B的总参数量大得多,但每个token的激活参数更少(10B vs. 13B)。多模态支持是其差异化优势;Mixtral仅支持文本。在多模态MoE领域,存在诸如Qwen-VL等模型,但它们的上下文窗口通常较小。该模型定位为在OrcaRouter上需要单一模型处理多样化、多模态及工具密集型任务的开发者的强有力选择。
如果您的应用需要同时具备多模态理解和复杂多步推理能力,并且需要较大的输出限制来生成较长响应,请选择Qwen3.5-122B-A10B。如果您正在构建使用工具的系统(因其具有较高的τ²-Bench评分),这也是一个不错的选择。如果您的任务仅涉及文本且不需要额外的容量,像Llama 3.1 70B或Qwen-14B这样更便宜的模型可能就足够了。如果您需要更大的上下文窗口(例如,超过10万个token),请考虑专为长上下文设计的模型。如果您需要更低的延迟,较小或密集的模型可能更适合。由于OrcaRouter提供了多种模型,您可以通过同一API评估多个模型,以找到最适合您成本和质量目标的模型。模型ID为qwen/qwen3.5-122b-a10b。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| 阶梯 | 输入 / 1M tokens | 输出 / 1M tokens |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| 阶梯按每次请求的输入 token 数确定 | ||
基于标价的估算
阶梯定价——此估算使用基础档位费率。
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b