Qwen3.5 122B-A10B — 開放權重 MoE 多模態(文字/圖片/影片),122B 總參數 / 10B 活躍參數,32k 上下文(視覺模式)。
Qwen3.5-122B-A10B 是阿里巴巴雲端 Qwen 系列中的一個大型語言模型。它採用混合專家(MoE)架構,每次前向傳遞僅啟動 100 億個參數,而總參數數為 1220 億。此設計旨在結合高容量與高效推論。該模型在包含文字、影像和影片資料的語料庫上進行訓練,使其能夠基於多種模態理解並生成回應。其上下文視窗為 32,768 個 token,單次生成最多可產出 65,536 個…
根據其架構與基準評分,Qwen3.5-122B-A10B 在多步驟推理、工具使用及指令遵循等任務中表現優異。τ²-Bench 分數達 93.6,顯示該模型在需要規劃並使用工具(例如計算機、搜尋引擎、程式碼直譯器)執行行動序列的基準測試中具有強大效能,因此適用於建構需與外部系統互動的自主代理。該模型亦支援多模態輸入,因此視覺推理、含嵌入式圖片的文件分析或影片摘要等任務均在其實力範圍內。此外,其較大的輸出限制使其能在單一回應中生成詳盡的解釋、程式碼補全或結構化資料。開發複雜聊天機器人、程式碼助手或研究分析工具的人員,可能會發現此模型相當有效。
雖然 Qwen3.5-122B-A10B 功能強大,但並非每個使用情境下都最具成本效益。如果你的任務是簡單的分類、短文本生成或不需要多步驟推理或多模態理解的直接問答,使用較小的模型(如 Qwen-7B)或非多模態模型可能就能獲得滿意的結果。這類模型在每個 token 上可以更快、更便宜。此外,若你的上下文需求非常小(例如少於 1,000 個 token),使用 122B 參數模型的相對開銷可能不划算。OrcaRouter 提供一系列定價與性能各異的模型。你可以先嘗試較小的模型,只有在品質不足時再升級。另外,如果你不需要 65K 的輸出限制,輸出長度較短的模型可能就已足夠。
該模型具有 32,768 個令牌的上下文窗口和最大 65,536 個令牌的輸出,使其能夠處理擴展推理鏈和長指令。高的 τ²-Bench 分數表明它可以在多個步驟中保持連貫性,並正確遵循涉及條件邏輯、工具調用和分支的複雜指令。在實踐中,用戶報告 Qwen3.5 系列模型在數學問題解決、代碼生成和邏輯謎題等任務上與其他最先進模型競爭。然而,與所有大型模型一樣,如果上下文充滿無關信息或指令模糊,性能可能下降。建議進行提示工程以有效引導模型。該模型在處理非常長的文件(接近上下文限制)時也可能遇到困難,因為它需要回憶開頭的細節。
多模態輸入(文字 + 圖片 / 影片)支援多種實際應用。在文件分析中,模型可以讀取 PDF 或圖片中的文字與嵌入的圖表、圖示或簽名。例如,它能從掃描的表格中提取資料或解讀圖形。在視覺問答中,模型可以回答關於照片或插圖的問題。在影片分析中,它可以處理影格來描述場景或隨時間追蹤變化。開發者可以建立無障礙工具(例如為視障使用者描述圖片)或自動化工具(例如分析 UI 截圖)。由於模型透過 OrcaRouter 存取,這些功能可以整合到現有應用程式中,使用與純文字提示相同的 API 呼叫,只需在訊息內容中包含 `image_url` 或 `video_url` 即可。
此模型唯一公開的基準測試是 τ²-Bench,其得分為 93.6。τ²-Bench 旨在評估模型在模擬環境中使用工具並完成多步驟任務的能力。93.6 的分數表示該模型能正確完成這些任務中的較高比例。對比來看,此分數在相同基準測試中與其他先進模型具有競爭力。然而,基準測試分數不一定能反映真實世界表現,因為任務難度各異,且基準測試可能未涵蓋所有領域。使用者應針對自身特定任務進行評估。現有事實中未提供其他基準測試分數(例如 MMLU、HumanEval 或多模態基準測試),因此無法在更廣泛的標準指標上比較此模型。
優勢:該模型在工具使用基準測試中獲得高分,顯示出強大的推理與指令遵循能力。其多模態功能與大輸出限制使其用途廣泛。MoE架構可能提供效能與效率之間的良好平衡(至少與參數總數相近的密集模型相比)。限制:模型的上下文視窗僅有32,768個令牌,相較於部分提供100K或以上令牌的模型而言較為普通。其激活參數(10B)相對於總參數規模偏低,可能限制其處理極複雜任務的表現。目前尚無延遲、吞吐量或硬體需求的相關資訊。此外,由於該模型較新,社群生態系統(例如微調腳本、量化工具)可能不如成熟模型完善。使用者應對模型進行全面測試。
此模型在OrcaRouter上沒有具體的延遲或吞吐量數據。推理速度取決於輸入長度、輸出長度、批次大小以及OrcaRouter分配的底層硬體等因素。MoE模型的速度可能會有變化,因為路由機制可能針對不同的token啟動不同的專家。一般來說,擁有100億活化參數的模型可以在現代GPU上以中等速度生成,但記憶體中總共1220億參數可能導致更高的記憶體使用量和更長的預填充時間。如果低延遲至關重要,建議使用您的典型提示來測試該模型。OrcaRouter的API會在響應標頭中返回時間戳和性能指標,幫助您測量速度。對於延遲敏感的應用,如果任務允許,可以考慮使用較小的模型。
現有的資料僅包含一個基準測試:τ²-Bench。常見的基準測試如MMLU(知識)、HumanEval(程式碼)、GSM8K(數學),或像是MMBench這種多模態基準測試並未提供。這使得難以評估模型在與工具無關的任務上的表現。例如,若你的應用要求事實準確性,你會想知道它在MMLU上的表現。同樣地,對於多模態任務,視覺推理基準測試的分數會很有幫助。缺乏這些分數並不表示表現不佳,但意味著使用者必須自行進行評估。OrcaRouter或許會在請求後或文件中提供額外的基準測試結果。在更多資料可用之前,建議在特定領域中與其他模型進行定性比較。
關於 Qwen3.5-122B-A10B 在 OrcaRouter 上的定價細節,現有資訊中並未明確提供。通常情況下,OrcaRouter 會針對輸入與輸出分別按令牌計費,提示令牌與生成令牌各有不同費率。多模態輸入(圖像/影片)則依據處理的影像區塊或影片幀數,換算為相應的令牌數量計費。部分服務商亦會針對重複使用相同提示的用戶,提供快取命中的折扣費率。欲取得精確定價,用戶應參考 OrcaRouter 的定價頁面或聯繫其銷售團隊。由於此模型擁有 122B 總參數且支援多模態,其每令牌價格可能高於較小或純文字模型。在估算任務總成本時,務必將圖像/影片的令牌費用納入考量。
使用較大的模型(如Qwen3.5-122B-A10B)通常會比小型模型產生更高的每token成本。然而,如果該模型能憑藉其能力以更少的步驟或更少的token完成任務,總成本仍可能具有競爭力。大型輸出限制(65,536個token)既是優勢也是成本風險:生成長篇輸出會迅速累積token費用。此外,多模態輸入每次提示消耗的token多於純文字提示。例如,一張高解析度影像可能耗費數百個token。如果您的任務不需要模型的所有功能,選擇較小的模型可以節省成本。OrcaRouter可能提供使用儀表板和成本控制功能,例如設定最大輸出token數量或預算提醒,以協助管理支出。
現有資料並未提及 OrcaRouter 對此模型提供任何快取折扣。許多推理供應商提供提示快取(prompt caching),將系統提示或用戶訊息中重複的文字暫時儲存,並以較低費率計費。若 OrcaRouter 支援快取,則對於使用大量靜態提示(例如系統指令、角色描述)的應用程式,可降低費用。然而,在缺乏具體文件說明的情況下,不應假設其存在。若已實作快取機制,使用者可檢查 API 回應標頭中的快取命中指示器。為降低費用,可將靜態指令與動態內容分離,避免重複相同的長前綴。此外,可考慮使用較短的上下文視窗,或在可能的情況下省略不必要的圖片。
要使用 Qwen3.5-122B-A10B,請向 OrcaRouter API 端點 https://api.orcarouter.ai/v1/chat/completions 發送一個 POST 請求。將模型參數設為 "qwen/qwen3.5-122b-a10b"。此 API 與 OpenAI 的聊天補全格式完全相容,因此您可以透過更改 base URL 和 API key 來使用相同的客戶端函式庫(例如 openai Python 函式庫)。請求的主體包含 messages(每個都有 role 和 content),以及可選參數,如 temperature、max_tokens、top_p 等。對於多模態輸入,請使用內容區塊,圖片的 type 為 "image_url",或使用模型特定的影片處理方式(可能通過 base64 編碼的畫格或 URL)。API 將返回一個 JSON 回應,其中包含生成的文字和使用量元數據(token 計數)。OrcaRouter 文件提供了關於支援參數的更多詳細資訊。
該模型支援標準聊天參數:溫度(預設通常為0.7)、top_p(預設0.9)、最大令牌數(最高可達模型最大輸出65,536)、存在懲罰、頻率懲罰與停止序列。上下文窗口限制為32,768個令牌,包含所有訊息、圖片與影片畫面。若總令牌數超過此限制,API會回傳錯誤或截斷輸入(取決於設定)。max_tokens參數不得超過65,536。對於多模態請求,請注意圖片與影片會增加令牌數;未提供確切轉換比例,但高解析度或長片段的影片會快速耗盡上下文窗口。OrcaRouter也可能支援串流模式,回應會逐個令牌串流輸出,適用於即時應用。請查閱API參考文件以瞭解其他選項,如logprobs或工具。
遷移很簡單:將你的基礎 URL 改為 https://api.orcarouter.ai/v1,使用模型 ID "qwen/qwen3.5-122b-a10b",並提供你的 OrcaRouter API 金鑰。請求格式與 OpenAI 聊天補全 API 完全相同。例如,在 Python 中使用 openai 函式庫時,你可以設定 client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key'),然後呼叫 client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...)。如果你的應用程式使用函式呼叫或工具,請注意該模型支援這些功能,因為它是在涉及工具使用的 τ²-Bench 上訓練的。不過,具體的工具呼叫語法可能與 OpenAI 不同;OrcaRouter 很可能支援 OpenAI 格式,但請進行測試以確認。對於多模態輸入,你現有用於在 messages 中發送 image_url 的程式碼可能有效,只要該模型支援該格式。
在Qwen系列中,此模型介於較小型的密集模型(如Qwen-7B、Qwen-14B)與最大的MoE模型(如Qwen3.5-235B)之間。相較於密集模型,此MoE模型可存取更大的總參數集,但每個token僅啟用其中一部分,從而有助於實現更專業化的專家。這可能在多種任務上帶來更佳表現,尤其是需要多樣知識的任務。然而,較小型的密集模型在狹窄任務上可能更快、更經濟。與更大的Qwen3.5-235B相比,此模型表現可能較低,但效率更高。多模態支援是Qwen3.5代的常見功能;較早版本(Qwen2、Qwen1)僅支援文字。使用者應比較自家任務的基準測試結果,來決定最適合的模型。
在缺乏全面基準測試的情況下,直接比較並不容易。Qwen3.5-122B-A10B 在 τ²-Bench 上達到了 93.6 分,這在工具使用任務上是很強的成績。作為參考,該基準測試中其他模型的類似分數並未提供,但這被視為高階能力。在架構方面,Llama 模型是密集且較為簡單的,而 Claude 模型則採用不同的專有架構。Qwen3.5 支援多模態輸入(圖片/影片),Claude 也支援此功能,但 Llama 3.2 和 3.1 僅支援文字(某些視覺變體除外)。32K 的上下文視窗小於 Claude 的 100K 或 200K,但與 Llama 3.1 的 128K 相比如何?並不完全相同;我們不能隨意編造數字。在程式碼和推理方面,許多模型都具有競爭力。此模型的優勢可能在於其針對工具使用的特定調校(τ²-Bench 高分)以及多模態 MoE 的效率。然而,Claude 和 Llama 擁有更大的生態系統和更多的社群支援。
很少有模型能將多模態輸入、大型上下文窗口、高輸出限制以及高 τ²-Bench 分數整合在單一套件中。Qwen3.5 系列專為設計成能力全面的通用模型,具備強大的推理與工具使用技能。採用總參數 122B、活躍參數 10B 的 MoE 架構,可在容納大量知識的同時,將推論成本維持在低於密集 122B 模型的水準。不過,其他 MoE 模型如 Mixtral 8x7B(總參數 47B,活躍參數 13B)則有不同的取捨。Qwen3.5-122B-A10B 的總參數量大得多,但每個 token 的活躍參數較少(10B vs. 13B)。多模態支援是其中一項差異化特點;Mixtral 僅支援純文字。在多模態 MoE 領域中,雖有 Qwen-VL 等模型存在,但它們通常具有較小的上下文窗口。此模型定位為開發者在 OrcaRouter 上需要單一模型處理多樣化、多模態及工具密集型任務時的強力選擇。
如果您的應用需要同時具備多模態理解與複雜的多步驟推理,且需要較大的輸出限制來生成較長的回應,請選擇 Qwen3.5-122B-A10B。如果您正在建構使用工具的主體系統(agentic systems),考慮到其較高的 τ²-Bench 分數,這也是一個很好的選擇。如果您的任務僅限文字且不需要額外容量,較便宜的模型如 Llama 3.1 70B 或 Qwen-14B 可能就已足夠。如果您需要更大的上下文窗口(例如 >100K tokens),請考慮專為長上下文設計的模型。如果您需要更低的延遲,較小或稠密模型可能更適合。由於 OrcaRouter 提供多種模型,您可以透過相同的 API 評估多種模型,以找到最符合您成本與品質目標的模型。模型 ID 為 qwen/qwen3.5-122b-a10b。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| 階梯 | 輸入 / 1M tokens | 輸出 / 1M tokens |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| 階梯依每次請求的輸入 token 數確定 | ||
基於標價的估算
階梯定價——此估算使用基礎級距費率。
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b