Qwen3.6 35B A3B 的无损无审查版本,保留了原始模型的能力,同时移除了拒绝行为。专为开发者、AI研究人员以及需要不受限制的模型输出且不牺牲推理、编码、多语言性能或工具使用的高级智能体工作流程而构建。 激进变体完全解锁,旨在为广泛的提示提供直接、完整的响应。虽然模型可能偶尔附加从基础模型训练中继承的简短信息性免责声明,但这些并非拒绝,且所请求的内容仍会完整生成。 非常适合AI研究、安全测试、红队演练、智能体开发、编码助手以及其他受益于最大输出灵活性的高级AI应用。 该模型的访问受到限制,仅供安全研究人员、红队、AI安全研究人员以及其他进行合法研究、评估和测试的合格专业人士使用。
该模型是Qwen3.6系列的一个混合专家变体,最初由阿里云开发,并由提供商Obsidian托管在OrcaRouter上。它拥有350亿总参数,每个token仅激活30亿参数,从而降低计算成本同时保持高容量。上下文窗口为262,144个token,支持处理超长文档或多轮对话。它接受文本、图像和视频输入。"uncensored"标签表示该模型的安全过滤器少于标准版本,允许更原始、无限制的输出。通过Or…
该模型在处理需要大上下文窗口和多模态理解的任务时表现出色。对于文本,它可以对长达262,144个token的文档(如整本书籍或长篇报告)进行总结或回答问题。对于图像和视频,它可以提取详细信息并将其与文本上下文结合。其未审查的特性使其能够在没有典型安全限制的情况下生成创意内容,适用于故事创作、角色扮演或其他不希望受到限制性过滤器干扰的场景。其MoE(混合专家模型)设计使其推理速度相较于类似总参数量规模的密集模型更快,因此在高效部署时适用于实时应用。多语言能力继承自Qwen3.6系列,支持多种语言。
“无审查”标签意味着该模型与标准Qwen3.6检查点相比,减少了对齐训练。这可能导致输出内容中对有害、冒犯或争议性内容的过滤程度降低。用户应在其特定使用场景中充分测试模型,以确保输出符合其标准。缺乏审查对于创意写作、无审查角色扮演或需要中性生成结果的敏感话题研究等任务可能有益。然而,这也意味着模型可能产生违反常规内容政策的内容。OrcaRouter 不声称提供任何额外的安全过滤;模型的基础行为即是所得。
如果你的任务涉及短输入(例如几百个token)、简单分类或只需要基本的语言理解能力,则使用更小、更便宜的模型(如Qwen2.5-7B或GPT-4o-mini)可能更具成本效益。该模型在处理极长上下文(超过10K token)或多模态输入时,其优势最为明显。对于8K token以内且无需图像/视频能力的纯文本任务,使用专用小模型可节省开支。此外,如果你的应用需要严格的内容过滤,该模型未经审查的特性可能迫使你添加外部审核层,从而增加成本。
该模型除了文本之外,还接受图像和视频输入。对于图像,您可以提供 base64 编码的图像数据或 URL(通过 API 的 content 数组,类型为 "image_url")。对于视频,API 可能接受视频帧序列或视频文件 URL;具体格式应查阅 OrcaRouter 的文档。模型将这些视觉输入与文本一起处理以生成响应。262,144 个 token 的上下文窗口适用于所有输入模态的 token 总数。请注意,处理图像和视频所消耗的 token 与视觉分辨率和时长成正比,因此较大的输入会减少可用的文本容量。
提供方未提供该模型的具体基准评分。Qwen3.6系列通常在L-Eval和RULER等长上下文基准测试中,以及在MMMU和MathVista等多模态任务上表现具有竞争力,但该35B A3B无审查变体的具体数据尚未公布。对实证性能感兴趣的用户应在代表性数据集上自行评估。具有3B激活参数的MoE架构往往能产生与类似活跃尺寸的密集模型相当的结果,但由于完整的35B参数,总存储和内存成本更高。
速度和延迟取决于多个因素:输入长度、输出长度、服务器负载及硬件配置。由于该模型每个词元仅激活30亿参数,其预期速度将快于稠密350亿参数模型,生成速率接近GPT-3.5等模型(虽未提供具体数值)。OrcaRouter通过Obsidian提供的基础设施可能导致延迟变化,用户可使用自身工作负载进行测试。对于长上下文场景(如超过10万词元),预填充时间与输入长度呈线性增长。输出词元生成通常是延迟的主要来源。未声明速度相关的服务等级协议(SLA)。
该模型的优势包括其262K的大上下文窗口,可一次性处理整本书或多小时视频转录文本。MoE架构在容量和推理速度之间实现了良好平衡。多模态输入支持文本与视觉数据结合的推理任务。未经审查的特性使其能够生成其他模型可能拒绝的内容。多语言支持覆盖数十种语言。对于此级别的模型,定价具有竞争力:输入$0.31/M,输出$4.21/M,零加价。
局限性包括缺乏已发布的基准测试数据,使得衡量相对性能更加困难。未经审查的特性可能在没有额外审核的情况下产生不良输出。3B激活参数数量意味着它在复杂逻辑任务上的原始推理能力可能无法与更大的密集模型(例如GPT-4)相比。多模态能力可能不如专门的视觉语言模型精细。视频分词等输入方式可能会减少文本的有效上下文。无法保证支持流式或工具使用能力。最后,依赖第三方提供商Obsidian意味着可用性和运行时间不受OrcaRouter控制。
定价透明:每百万输入代币0.31美元,每百万输出代币4.21美元。这些是Obsidian的精确提供商费率,OrcaRouter未加价。输入代币包括所有文本代币和视觉代币(针对图像和视频)。输出代币为生成的文本。无需按请求付费或订阅。您只需为消耗的代币付费。定价基于每百万代币,因此小规模请求仅需几分钱。未提供免费层或试用版。
此模型未公布任何折扣、缓存优惠或批量定价。所列费率均为每 token 统一价格。与某些提供商对缓存输入 token 提供折扣不同,OrcaRouter 无论重复与否均采用相同的输入费率。若使用量极高,您可以联系 OrcaRouter 商讨可能的定制方案,但未记载任何标准折扣。零加价政策确保您支付的金额与 Obsidian 收取的费用完全一致,无任何隐藏费用。
其他提供商的长上下文多模态模型往往成本更高:例如,OpenAI的GPT-4 Turbo输入价格$10/1M,输出价格$30/1M;Claude 3.5 Sonnet输入$3/1M,输出$15/1M。本模型则明显更便宜,为$0.31/$4.21。然而,那些模型提供不同的能力(例如工具调用、更高的推理基准)。较低的价格反映了MoE架构以及它是一个未经审查的第三方托管模型。如果您需要保证可靠性、更高安全性或函数调用等高级功能,额外的成本可能是合理的。
要使用该模型,请向 https://api.orcarouter.ai/v1/chat/completions(或 OrcaRouter 兼容 OpenAI 的 API 对应的端点)发送 POST 请求。在请求头中包含 "Authorization: Bearer YOUR_API_KEY"。在请求体中,设置 "model": "obsidian/Qwen3.6-35B-A3B"。按照标准 OpenAI 格式传递消息:一个对象数组,每个对象包含 "role" 和 "content"。对于多模态内容,使用包含类型 "text" 和 "image_url"(或视频等效)的 content 数组。cURL 示例:curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'。
您可以使用典型的OpenAI兼容参数:temperature(默认1.0)、top_p(0.9)、max_tokens(默认值各异,建议显式设置)、停止序列、frequency_penalty、presence_penalty以及用于可复现性的seed。该模型支持通过"stream": true进行流式传输,以逐token接收响应。对于多模态输入,API期望包含类型为"image_url"以及可选的"video_url"的内容数组(关于精确的视频格式,请查阅OrcaRouter文档)。上下文窗口限制为262,144个token,适用于消息中的token总数加上响应。如果超出限制,您将收到上下文长度错误;您可以调整"max_tokens"或截断消息。
为了充分利用262K的上下文,请将提示词设置为包含完整文档或对话历史。请注意,输入中的每个标记都会计入成本和限制。对于非常长的输入,考虑在发送前进行分块或摘要处理,不过该模型设计为能够处理完整上下文。使用"max_tokens"参数控制输出长度。如果遇到超时错误,启用流式处理以更快获得部分结果。OrcaRouter可能有自己的超时设置,如有需要请联系支持。该模型不支持特殊的系统消息;请将其视为角色为"system"的用户或助手消息(标准OpenAI格式)。
从OpenAI或Anthropic等提供商迁移只需将基础URL改为https://api.orcarouter.ai/v1并更新模型ID。若代码使用OpenAI Python客户端,设置client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1"),然后使用client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...)。消息格式和参数名称完全相同,无需修改提示逻辑。注意响应对象结构也兼容,现有解析代码应能正常运行。先用小请求测试以确保认证和计费正常。
与Qwen3.6-72B(密集模型)相比,该模型采用MoE架构,因此每次token的推理成本更低,但原始容量可能略低。262K的上下文长度大于Qwen2.5的128K。与Qwen3.6-32B(可能是密集模型)相比,该模型提供多模态输入,而早期版本可能不具备此功能。"uncensored"变体是独特的;标准Qwen版本具有对齐机制。如果您需要严格的安全保障,请选择常规的Qwen3.6。在价格方面,该模型比其他平台上的许多密集Qwen模型更便宜。
GPT-4o 和 Claude 3.5 Sonnet 是专有模型,具有广泛的安全训练,在推理和编码方面有更高的基准分数,并支持工具使用、视觉和大上下文(Claude 为200K)。该模型提供了更大的上下文(262K)和多模态输入,价格显著更低。然而,它缺乏那些模型的高级功能、可靠性和性能一致性。对于成本是主要考虑因素且可以接受一定质量折衷的应用,该模型是一个不错的选择。如果您需要顶级推理或函数调用,高级模型值得额外成本。
该模型最适合以下需求:(1) 超长上下文(262K tokens)且成本低廉;(2) 多模态输入(图片/视频)无需支付溢价;(3) 未经审查的文本生成,内容过滤器不会干扰;(4) 由于MoE激活机制,相对于总参数量实现快速推理。它是研究、数据提取、创意写作以及任何受益于高上下文和低每token成本任务的强劲选择。若需工具调用、结构化输出或高可靠性等高级功能,请考虑其他模型。
| 输入 / 1M tokens | $0.310 |
| 输出 / 1M tokens | $4.21 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B