日期为2026年9月2日的Qwen3.8 Max快照,这是阿里巴巴的旗舰多模态推理模型:输入文本+图像+视频,输出文本,支持100万token上下文。功能与定价与基础模型保持一致;将其固定下来以获得可复现的行为。
Qwen3.8 Max (0902) 是 OrcaRouter 上由提供商 qwen 提供的一个模型条目,以模型 ID qwen/qwen3.8-max-0902 发布。列表中标有 0902,但所提供的事实并未说明它代表发布日期、检查点还是修订标签。这是一个长上下文多模态模型:它接受文本、图像和视频作为输入,具有 1,000,000 个 token 的上下文窗口,最多可生成 131,072…
该模型支持1,000,000个token的上下文窗口。这是模型在一次请求中可以关注的输入总量,包括提示中的文本、图像和视频内容。已知信息中未提供更多限制,因此实际限制取决于OrcaRouter和服务提供方如何执行分词(tokenization)以及处理请求超时。对于长文本,1,000,000个token允许在单个提示中包含大量篇幅较长的文档,从而减少在调用模型前进行分块或摘要的需要。对于视频,已知信息并未说明每秒、每帧或每个视频文件消耗多少token,因此您应通过元数据或测试调用来估算。同样需要注意的是,上下文窗口大小并不能说明模型在包含1,000,000个token的提示上的准确度;没有提供任何基准测试数据。如果您的应用需要确切的长上下文质量,请先用自己的文档样本进行评估,然后再投入生产。
该模型接受文本、图像和视频作为输入,可在同一请求中结合这些类型对源材料进行推理。示例场景包括:阅读文本中的指令、检查图像,以及生成答案时参考视频。提供商概况说明中未列出 OCR、物体检测或时间维度视频推理等任务特定能力,因此不应假设这些行为存在。该模型可预期达到的效果主要取决于其训练出的能力,而所提供的事实中并未对此加以说明。稳妥的设计方式是将其用于需要从混合模态提示中生成文本输出,且能够承受将图像和视频存储为输入令牌的成本的任务。如果工作负载仅为文本,使用不带图像和视频输入的另一种模型可能更为简单。如果任务需要精确到时间戳级别的视频操作,模型卡中没有任何证据表明此类行为是否可靠。
在任务不需要此列表所定义的功能时,选择更便宜的模型是合理的。简短文本问题不需要1,000,000个token的上下文,也不需要131,072个token的输出上限。纯文本工作流不需要图像或视频输入。OrcaRouter对此模型的计费为每1,000,000个输入token $2.00,每1,000,000个输出token $6.00。如果更便宜的替代方案具有更低的每token价格,并且上下文和模态支持足够,那么它会降低成本。所提供的事实中没有质量或速度基准,因此选择此模型而非其他模型无法通过测量准确率来证明合理性;而应通过明确的产品需求来证明:大上下文、混合文本/图像/视频输入,或单次生成中的长输出。由于输入价格适用于上下文中的每个token,即使提问很短,非常大的上下文调用也可能比较小的调用花费更多,因此应避免填充提示词。
Qwen3.8 Max (0902) 所提供的模型事实中不包含基准测试分数、评估集或准确率数字。因此,任何关于模型质量的表述都只是推测,OrcaRouter 也不会发布推断出的分数。如果你需要一个数字来比较候选模型,请在具有代表性的输入上运行你自己的测试,包括你预期会发送的图像和视频用例。像公共知识测试这样的基准测试,并不能告诉你模型在处理特定的 100 万 token 视频提示时表现如何。请记住,像 Max 这样的模型名称只是一个标签,而不是质量证明。此列表中可以测量的属性包括上下文窗口、最大输出长度、输入模态和价格。这些属性会影响工作负载是否契合,但它们并不能描述准确性、推理深度、指令遵循能力或安全行为。除非你进行了评估,否则应将这些领域的能力视为未经验证。
模型事实中并未提供每秒令牌数、首令牌时间、请求超时指导或任何其他性能测量数据。OrcaRouter并未对该提供商模型声称任何延迟数据。速度将取决于提供商的服务器基础设施、输入大小以及请求的输出量。1,000,000个令牌的输入和131,072个令牌的输出可能比短请求耗时更长,但列表并未给出确切的关系。视频输入也可能使延迟变得更糟,因为它必须先被处理为令牌,模型才能对其进行处理;事实中并未量化该步骤。审阅者不应认为较低的每令牌定价就意味着更快的解码速度。事实所支持的唯一与速度相关的决策是,在预期负载下测试具有代表性的请求大小。请勿根据上下文窗口大小或模型名称推断实时适用性。
所宣称的优势在于结构层面。该模型拥有1,000,000个令牌的上下文窗口、高达131,072个令牌的最大输出长度,并支持文本、图像和视频输入。这对于需要单次模型调用在撰写长回复前观察大量或混合内容的应用场景非常有用。相比优势,局限性的表述也更容易基于事实得出。目前没有发布任何质量基准,因此准确性、推理能力和安全性均无据可查。0902标签背后没有单独列出的训练数据、发布说明或更新方法。图像和视频输入并不保证对视觉细节或时间顺序的精确理解。上下文和输出限制是上限值,而非推荐用量;非常大的输出可能成本高昂,每1,000,000个输出令牌需花费6.00美元。一个填满1,000,000个令牌上下文窗口的请求,在生成任何输出之前就会消耗2.00美元的输入令牌费用,这是一笔可观的操作成本。
所列单价为:每 1,000,000 个输入 token 收费 $2.00,每 1,000,000 个输出 token 收费 $6.00。OrcaRouter 按提供商费率对模型计费,零加价,因此所列价格即为提供商费率的透传价格。输入 token 包括提示(prompt)中发送的文本、图像和视频 token;输出 token 为模型生成的响应 token。按此价格计算,1,000,000 个输入 token 的费用为 $2.00,1,000,000 个输出 token 的费用为 $6.00。更小的请求按比例相应降低费用:100,000 个输入 token 的费用为 $0.20,100,000 个输出 token 的费用为 $0.60,前提是相关用量由提供商如实计量。模型卡片未包含缓存输入、批量请求或交互式档位的单独定价,因此不应假设存在此类价格。每次调用实际计费的 token 数量,应以 OrcaRouter 返回的使用量响应或调用日志为准。
当OrcaRouter表示某个模型按提供商费率计费且零加价时,这意味着OrcaRouter不会在此列表的提供商费率之上额外收取自己的每令牌费用。因此,令牌使用的最终金额应基于所述的每1,000,000个令牌2.00美元输入和6.00美元输出的价格。这并不一定意味着最终账单上没有其他费用;根据您的协议,可能会产生税费或账户级费用,但这些事实中并未记录此类费用。这也不意味着该模型可以免费服务,因为每令牌费率仍然适用。在比较提供商时,OrcaRouter为此模型显示的价格应与本列表使用相同的单位。如果其他网关报价不同,差异在于计费结构,而非模型上下文窗口发生变化。
成本管理应从提示长度入手。由于输入费用为每1,000,000个token $2.00,每增加一个token都会增加输入费用,并且请求中发送的每张图像或视频都会根据本列表未提供的规则转换为token。删减无关的源材料可以降低成本。输出的单价是输入的三倍,因此限制请求的输出长度也能控制成本。一个输出上限为131,072个token的模型可以生成需要付费的响应;按每1,000,000个token $6.00计算,131,072个输出token仅输出费用就约为$0.79。生成这么多token并非自动进行,因为提示词控制响应大小。该模型没有公布缓存价格,因此不要假设重复上下文会获得折扣。事实中未包含缓存或批量定价,并不能证明这些选项不存在;只是表示它们不属于本列表的一部分。
Qwen3.8 Max (0902) 通过 OrcaRouter 的 OpenAI 兼容 API 公开。将客户端基础 URL 设置为 https://api.orcarouter.ai/v1,并使用确切的模型 ID qwen/qwen3.8-max-0902。使用 OpenAI 兼容 SDK 时,请求结构与任何 chat-completions 调用基本相同:为 OrcaRouter 传递 API 密钥、上述基础 URL 以及请求体中的模型 ID。不要使用通用名称,如 Qwen3.8 Max 或 qwen3.8;列表要求使用 qwen/qwen3.8-max-0902。在直接向基础 URL 发起 HTTP 请求时,应使用相同的模型 ID,其中路径和负载遵循 OrcaRouter 公开的 OpenAI 兼容契约。由于它兼容 OpenAI,为 OpenAI chat completions 编写的现有代码通常可以通过更改 base_url 和 model 参数来迁移,但身份验证细节必须符合 OrcaRouter 的要求。
对于兼容OpenAI的聊天补全,模型、消息和输出token限制等参数的处理方式与其他兼容模型相同。资料给出的最大输出为131,072个token,因此如果你设置输出限制,不应高于131,072;默认输出限制在资料中未说明。Temperature、top-p、stop和其他采样参数未在所供模型资料中记录,因此请遵循OrcaRouter的API文档和标准OpenAI参数语义。对于图像和视频输入,请使用OrcaRouter API所期望的多模态内容格式;资料未提供示例。如果API返回有关不支持的参数名称的错误,请检查你的SDK是否发送了旧版参数。上下文窗口为1,000,000个token,因此提示必须将所有输入token(包括图像和视频token)保持在该限制以下。响应单独计入131,072个token的上限。
因为OrcaRouter在https://api.orcarouter.ai/v1提供了兼容OpenAI的API,所以迁移主要是配置变更。将基础URL替换为https://api.orcarouter.ai/v1,将API密钥字段替换为OrcaRouter密钥,并将模型设置为qwen/qwen3.8-max-0902。如果你的代码使用兼容OpenAI的客户端库,请更新客户端的base_url和api_key,并保持大多数消息结构不变,前提是多模态格式与此模型匹配。事实并未说明此模型是否支持所有OpenAI特定的参数,因此在迁移前,请检查你的应用发送的参数。此外,由于上下文限制为1,000,000,最大输出为131,072,请将请求截断逻辑调整为这些限制。任何硬编码了不同最大上下文长度的现有代码可能都需要更新。最后,请确认你的应用数据处理预期与OrcaRouter的条款一致,因为模型事实本身并未讨论数据保留问题。
比较的主要依据是输入约定。Qwen3.8 Max (0902) 接受文本、图像和视频,因此纯文本替代方案会去掉这些模态。如果你的实际工作负载只包含文本,那么上下文足够大的纯文本模型可能更直接匹配,并且定价可能不同。模型事实不包含与任何其他模型的准确性或速度对比,因此你无法根据公开质量分数来选择。你可以比较结构属性:纯文本替代方案可能具有较小的上下文、较短的输出限制或较低的输入价格。OrcaRouter 对此模型的计费为每 1,000,000 个 token 输入 $2.00、输出 $6.00。它支持图像和视频输入这一事实只有在这些输入被使用时才有用。如果这些输入未被使用,你可能在为与任务无关的多模态能力付费。
当任务特征与所列功能匹配时,选择 Qwen3.8 Max (0902)。首先,你需要 1,000,000 个 token 的上下文,因为源材料无法缩短以适应更小的窗口。其次,你需要在同一个提示词中输入图片和视频,或者你预计未来的请求会包含这些模态。第三,你希望输出最多不超过 131,072 个 token。如果你的工作负载不满足以上任何要求,那么此列表中的许多优势就用不上。不要因为“Max”这个名字听起来很强就选择它;该列表中没有基准测试证据。由于 OrcaRouter 通过相同的 OpenAI 兼容 API 公开模型,因此切换模型 ID 很容易,你可以在自己的任务上将这个模型与另一个候选模型进行对比测试。只需记住输入和输出的价格不同,并且该模型没有指定缓存定价。
在比较成本时,首先要归一化到相同的 token 基础上。该模型的输入 token 价格为每 1,000,000 个 $2.00,输出 token 价格为每 1,000,000 个 $6.00,这些价格来自供应商,零加价。一个输入 token 单价较低的竞品模型,在处理完整上下文请求时可能确实更便宜,但还必须考虑上下文窗口和最大输出。例如,一个 1,000,000 token 的请求可以在一次调用中使用该模型的完整上下文;而上下文为 200,000 token 的模型则需要多次调用,额外的输出或摘要传递可能会改变总价。所提供的事实并未给出客观的准确率或延迟数值,因此任何关于每次正确回答的成本比较都必须来自你自己的测试。同时还要检查竞品模型是否对图像或视频 token 单独收费,因为这些在此处并未说明。如有疑问,请在 OrcaRouter 上运行典型工作负载,比较实测的 token 用量和响应质量,而不是仅依赖标价。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 输入 / 1M tokens | $2.00 |
| 输出 / 1M tokens | $6.00 |
| 缓存读取 / 1M | $0.250 |
| 缓存写入 / 1M | $2.50 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
本周开发者的讨论
@misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902