一個無損且未經審查的 Qwen3.6 35B A3B 版本,在保留原始模型能力的同時移除了拒絕行為。專為開發者、AI 研究人員及需要不受限制模型輸出的進階代理工作流程而設計,且不影響推理、程式碼撰寫、多語言表現或工具使用能力。 Aggressive 變體已完全解鎖,旨在針對各種提示提供直接且完整的回應。雖然模型偶爾可能會附加來自基礎模型訓練的簡短資訊免責聲明,但這些並非拒絕行為,所請求的內容仍會完整生成。 適合 AI 研究、安全測試、紅隊演練、代理開發、程式碼輔助,以及其他能從最大輸出靈活性中獲益的先進 AI 應用。 此模型的存取受到限制,僅供安全研究人員、紅隊成員、AI 安全研究人員及其他從事合法研究、評估與測試的合格專業人士使用。
此模型是 Qwen3.6 系列中的混合專家變體,最初由阿里雲開發,並由供應商 Obsidian 於 OrcaRouter 上託管。它擁有 350 億總參數,但每次 token 僅啟動 30 億參數,藉此降低運算成本同時維持高容量。上下文窗口為 262,144 個…
此模型在需要大型上下文視窗與多模態理解的任務上表現出色。對於文字,它能對長達262,144個token的文件(例如整本書籍或長篇報告)進行摘要或回答問題。對於圖片與影片,它能提取詳細資訊並與文字脈絡結合。未經審查的特性讓它能生成不受典型安全限制的創意內容,適用於故事創作、角色扮演或其他不希望有過多限制篩選器的場景。其MoE設計提供相對於同總參數規模的密集模型更快的推論速度,若有效部署,對即時應用相當實用。多語言能力繼承自Qwen3.6系列,支援多種語言。
「uncensored」標籤代表該模型相較於標準的 Qwen3.6 檢查點,經歷了較少的對齊訓練。這可能導致輸出中對有害、冒犯或爭議性內容的篩選較少。使用者應在具體使用場景中全面測試模型,以確保輸出符合自身標準。缺乏審查機制對某些任務可能有益,例如創意寫作、無審查的角色扮演,或針對敏感主題的中立生成研究。然而,這也表示模型可能產生違反一般內容政策的內容。OrcaRouter 不主張任何額外的安全過濾功能;模型的基本行為即為你所得。
如果您的任務涉及短輸入(例如幾百個token)、簡單分類,或僅需要基本語言理解,更小、更便宜的模型如Qwen2.5-7B或GPT-4o-mini可能更具成本效益。此模型的優勢在處理極長上下文(超過10K token)或多模態輸入時最為明顯。對於少於8K token且不需要影像/影片能力的純文字任務,使用專門的小型模型可以省錢。此外,如果您的應用需要嚴格的內容過濾,未經審查的特性可能會迫使您添加外部審核層,增加成本。
該模型除了文字之外,也接受圖像和影片輸入。對於圖像,您可以提供 base64 編碼的圖像數據或 URL(透過 API 的 content 陣列,類型設為 "image_url")。對於影片,API 可能接受影片幀作為圖像序列或影片檔案 URL;確切格式應查閱 OrcaRouter 的文件。該模型將這些視覺輸入與文字一起處理以生成回應。262,144 個 token 的上下文視窗適用於所有輸入模態的合計 token 數。請注意,處理圖像和影片會消耗與視覺解析度和長度成比例的 token,因此較大的輸入將減少可用的文字容量。
供應商未提供此模型的具體基準測試分數。Qwen3.6系列在長語境基準(如L-Eval和RULER)以及多模態任務(如MMMU和MathVista)上通常表現出色,但此35B A3B未審查版本的確切數據尚未公布。對實證效能感興趣的使用者應在代表性資料集上自行執行評估。採用3B激活參數的MoE架構通常能達到與類似激活大小的密集模型相當的結果,但由於總共有35B參數,儲存和記憶體成本較高。
速度和延遲取決於多個因素:輸入長度、輸出長度、伺服器負載以及硬體配置。由於該模型每次令牌僅激活 3B 參數,預計其速度會比密集的 35B 模型更快,生成速率可與 GPT-3.5 等模型媲美(儘管未提供確切數據)。OrcaRouter 透過 Obsidian 提供的基礎設施可能導致延遲有所變化;使用者可用自己的負載進行測試。在長上下文場景(例如 100K+ 令牌)中,預填充時間會隨輸入長度線性增加。輸出令牌生成通常是延遲的主要來源。文中未聲明速度方面的服務等級協議(SLA)。
該模型的優勢包括其高達262K的上下文窗口,可一次處理整本書籍或長達數小時的影片逐字稿。MoE架構在容量與推論速度之間取得了良好的平衡。多模態輸入能夠處理結合文字與視覺資料的任務。無審查的特性使其能生成其他模型可能拒絕的內容。多語言支援涵蓋數十種語言。以同級模型而言,其定價極具競爭力:輸入每百萬字元0.31美元,輸出每百萬字元4.21美元,零加成。
限制包括缺乏公開的基準測試數據,導致難以評估相對效能。未經審查的特性可能在缺乏額外監管下產生不理想的輸出。由於僅啟用30億個參數,在處理複雜邏輯任務時,其原始推理能力可能不及更大的密集模型(例如GPT-4)。多模態能力可能不如專門的視覺語言模型精細。輸入模態(如影片標記化)可能減少用於文字的有效上下文。無法保證支援串流或工具使用功能。最後,依賴第三方供應商Obsidian意味著可用性與正常運行時間不受OrcaRouter控制。
定價透明:每百萬個輸入令牌 $0.31,每百萬個輸出令牌 $4.21。這些是 Obsidian 提供的精確供應商費率,OrcaRouter 未加任何加成。輸入令牌包含所有文字和視覺令牌(適用於圖片和影片)。輸出令牌是生成的文字。無需每請求費用或訂閱。您只需為消耗的令牌付費。定價以每百萬令牌為單位,因此小額請求僅需花費不到一分錢。未提供免費方案或試用版。
此模型未披露任何折扣、快取優惠或批量定價。所列費率為每 token 固定價格。與某些提供快取輸入 token 折扣的供應商不同,OrcaRouter 無論重複與否均收取相同輸入費率。若使用量極高,您可以聯絡 OrcaRouter 商討可能的客製化方案,但並無記錄在案的標準折扣。零加價政策確保您支付的正是 Obsidian 的收費,無任何隱藏費用。
其他供應商提供的類似長上下文多模態模型通常成本更高:例如,OpenAI 的 GPT-4 Turbo 是每百萬輸入 $10、每百萬輸出 $30,而 Claude 3.5 Sonnet 是每百萬輸入 $3、每百萬輸出 $15。此模型明顯更便宜,為 $0.31/$4.21。不過,那些模型提供不同的能力(例如工具使用、更高的推理基準)。較低的價格反映了 MoE 架構以及它是一個未經審查的第三方託管模型。如果您需要保證的可靠性、更高的安全性或進階功能(如函數調用),額外的成本可能是合理的。
要使用此模型,請發送 POST 請求至 https://api.orcarouter.ai/v1/chat/completions(或依 OrcaRouter 相容 OpenAI API 的對應端點)。在標頭中包含「Authorization: Bearer YOUR_API_KEY」。在請求主體中設定「"model": "obsidian/Qwen3.6-35B-A3B"」。以標準 OpenAI 格式傳遞訊息:包含「role」與「content」的物件陣列。對於多模態內容,請使用包含類型「text」與「image_url」(或影片對應)的內容陣列。cURL 範例:curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
您可以使用典型的 OpenAI 相容參數:temperature(預設 1.0)、top_p(0.9)、max_tokens(預設值因情況而異,建議明確設定)、停止序列、frequency_penalty、presence_penalty 以及用於再現性的 seed。該模型支援透過 "stream": true 進行串流輸出,以逐個 token 接收回應。對於多模態輸入,API 預期內容陣列包含類型為 "image_url" 及可選的 "video_url"(關於確切的影片格式,請查閱 OrcaRouter 文件)。上下文視窗限制為 262,144 個 token,適用於 messages 加上回應的總 token 數。若超出限制,您會收到上下文長度錯誤;您可以調整 "max_tokens" 或截斷 messages。
為了充分利用 262K 的上下文,請將提示詞結構化,包含完整文件或對話歷史。請注意,輸入中的每個 token 都會計入成本和限制。對於非常長的輸入,建議在發送前進行分段或摘要,儘管此模型設計為能處理完整上下文。使用 "max_tokens" 參數控制輸出長度。若遇到超時錯誤,請啟用串流以更快獲取部分結果。OrcaRouter 可能有自己的超時設定;如有需要請聯繫支援。此模型並不特別支援系統訊息;請將其視為角色為 "system" 的使用者或助理訊息(標準 OpenAI 格式)。
從 OpenAI 或 Anthropic 等供應商遷移時,需要將基礎 URL 更改為 https://api.orcarouter.ai/v1 並更新模型 ID。如果您的程式碼使用 OpenAI Python 用戶端,請設置 client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1"),然後使用 client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...)。訊息格式和參數名稱完全相同。無需更改提示邏輯。請注意,回應物件形狀也相容,因此現有的解析程式碼應該可以運作。先使用小型請求進行測試,以確保正確的身份驗證和計費。
相較於Qwen3.6-72B(密集模型),此模型採用MoE,因此每個Token的推理成本較低,但原始容量可能略低。262K的上下文比Qwen2.5的128K更大。與Qwen3.6-32B(可能為密集模型)相比,此模型提供多模態輸入,而早期版本可能沒有此功能。未審查版本是獨特的;標準的Qwen發布版本具有對齊機制。如果您需要嚴格的安全性,請選擇常規的Qwen3.6。在價格方面,此模型比其他平台上許多密集Qwen模型更便宜。
GPT-4o 和 Claude 3.5 Sonnet 是專有模型,具有廣泛的安全訓練,在推理和編碼方面的基準測試分數更高,並支援工具使用、視覺和大型上下文(Claude 為 200K)。此模型提供更大的上下文長度(262K)和多模態輸入,價格顯著較低。然而,它缺乏這些模型的進階功能、可靠性和性能一致性。對於成本是主要考量且可以接受一定品質妥協的應用場景,此模型是不錯的替代選擇。如果您需要頂尖的推理或函式呼叫功能,則高階模型值得額外費用。
若您的需求包含以下情況,此模型將是最佳選擇:(1) 需極長上下文(262K tokens)且成本低廉;(2) 處理多模態輸入(圖像/影片)但無需支付高額費用;(3) 進行未經審查的文字生成,且內容過濾器可能造成干擾;(4) 透過混合專家(MoE)活化機制,以較少參數量實現快速推論。此模型在研究、資料萃取、創意寫作,以及任何依賴高上下文與低單位成本的任務中表現出色。若您需要進階功能如工具呼叫、結構化輸出或高可靠性,建議參考其他模型。
| 輸入 / 1M tokens | $0.310 |
| 輸出 / 1M tokens | $4.21 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B