Qwen3.8-Max 是阿里巴巴 Qwen 系列中最新旗艦模型,也是迄今為止能力等級最高的產品。阿里巴巴在其官方遷移指南中,將它直接定位為 GPT-5.5、Claude Opus 4.7 與 Gemini 3.1 Pro 的競爭對手,並建議在任務需要最強推理能力時採用——例如複雜的多步驟分析、深度邏輯推導,以及高要求的代理型(agentic)工作。 它原生支援多模態,阿里巴巴同時將它列入文字生成與影像/影片理解類別:可接受文字、圖片與影片輸入,並回傳文字,配備 1M-token 的上下文視窗。官方能力矩陣確認它完整支援思考模式、函式呼叫、內建工具與結構化輸出,可直接無縫嵌入代理框架與工具呼叫管線。 Qwen3.8-Max 透過三種線路格式提供服務——OpenAI 相容、Anthropic 相容,以及原生 DashScope——部署於北京、新加坡、東京、法蘭克福與維吉尼亞。思考模式可透過 enable_thinking 參數切換(或在 Responses API 上使用 reasoning.effort)。它是該系列的高階等級:當困難問題的正確性重於成本時使用它,日常處理大量工作時則可降級至 Qwen3.7-Plus 或 Qwen3.7-Flash。
Qwen3.8 Max 是 Qwen 系列中的多模態大型語言模型,可透過 OrcaRouter 使用,模型 ID 為「qwen/qwen3.8-max」。提供方為 qwen。它的上下文視窗為 1,000,000 個 token,因此單一請求最多可包含一百萬個 token…
根據目錄事實,Qwen3.8 Max 是一個多模態語言模型,可接受文字、圖片和影片輸入。因此,它適合執行諸如摘要長篇文件、回答圖片相關問題或分析影片內容等任務。此模型預期能處理一般文字生成與推理,因為它屬於 Qwen 大型語言模型系列。然而,OrcaRouter 的列表中並未包含具體的任務清單或基準分數。你應使用自己的提示詞來測試此模型,以確認它是否能產生你所需的風格與準確度。由於 API 與 OpenAI 相容,你可以透過 OrcaRouter 發送一個小型請求,而無需變更現有程式碼。此模型的輸出 token 計費為每 1M token 6.00 美元,因此請一併規劃輸入與輸出的成本。為獲得最佳結果,請提供清楚的提示詞,並僅包含相關的上下文。
若要將影像和影片輸入與 Qwen3.8 Max 搭配使用,請將它們作為聊天訊息中的內容部分傳送至 OrcaRouter 的 OpenAI 相容 API。標準的 OpenAI 聊天格式允許包含文字部分和 image_url 部分的內容陣列。影片輸入可能需要特定格式,目錄條目中並未詳細說明;提供者 qwen 將影片列為可接受的模態。常見的做法是將影片幀作為一系列影像傳遞,或者如果 OrcaRouter 支援,則使用提供者特定的影片編碼。然後,模型會將視覺資訊與文字提示一起處理。請記住,所有視覺輸入都會計為 token,而 token 的計費方式為每 1M 輸入 token 收取 $2.00。如果您的影片很長,token 計數可能會很高,因此請先使用小樣本進行測試。在建立正式環境程式碼之前,請先確認 OrcaRouter 文件中的確切訊息結構。
Qwen3.8 Max 的定價為每 1M 個輸入 token 需 $2.00,每 1M 個輸出 token 需 $6.00。如果你的提示詞很短、你的資料僅包含文字,或者你不需要 1,000,000 個 token 的上下文,那麼較便宜的模型很可能會以較低的成本為你帶來類似的結果。OrcaRouter 上有許多僅處理文字的模型,其每個 token 的費率較低,而且在分類、擷取、摘要和一般聊天等任務上的回應速度也更快。當任務確實受益於大型上下文,或需要結合文字與圖片或影片時,你應該選擇 Qwen3.8 Max。你也應該針對自己的具體工作負載比較輸出品質,因為價格並非唯一考量因素。對於高用量應用程式,品質可接受且價格便宜的模型通常是更明智的商業決策。估算每個要求的平均輸入大小,再乘以費率,就能看出損益平衡點落在何處。
Qwen3.8 Max 的最佳使用情境,取決於其列出的能力:100 萬個 token 的上下文視窗,以及文字、圖片和影片輸入。這包括長篇文件問答、整本書摘要、合約分析、程式碼庫審查,以及需要理解截圖、圖表或影片畫面的多模態任務。它也適合在單次呼叫中處理整份影片逐字稿,而不是將它分段處理。由於輸出成本為每 100 萬個 token 6.00 美元,即使輸入很長,你仍應以簡潔的回答為目標。如果你只需要從一小段文字回答一個簡短問題,這個模型就太小題大做且昂貴了。當輸入量大、屬於多模態,或兩者兼具,且答案取決於所有這些內容時,此模型非常合適。對於高量生成任務,請使用較小的模型。
OrcaRouter 上 Qwen3.8 Max 的目錄條目並未列出任何基準測試分數。我們不會提供外部評估的數字,因為沒有任何數字是基於既有事實的。一般而言,基準測試分數衡量模型在特定任務上的表現,例如一般知識、推理、程式設計及多模態理解,具體取決於基準測試的類型。既然 Qwen3.8 Max 沒有官方分數,你不能依賴單一指標。評估此模型的適當方式,是透過 OrcaRouter 的 OpenAI 相容 API,在你自己的驗證集上執行測試。比較多個提示詞的輸出,並檢查一致性。如果日後看到供應商發布基準測試分數,請將其視為眾多訊號之一,而不是證明你的使用案例一定有效的依據。一個在廣泛基準測試中得分高的模型,仍可能在特定領域的輸入上失敗,因此直接測試至關重要。
OrcaRouter 的目錄清單中並未提供 Qwen3.8 Max 的延遲或吞吐量數據。響應速度取決於 qwen 供應商的基礎設施、您的輸入大小,以及 OrcaRouter 目前的負載。包含 1,000,000 個輸入 token 的請求會比簡短提示耗時更長,因為模型必須先處理整個上下文,才能生成輸出。輸出長度同樣會影響總耗時;生成大量 token 需要時間。如果速度至關重要,請盡可能縮小輸入和輸出的規模。您可以透過 OrcaRouter 的 API 串流接收回應,來測量首個 token 的響應時間 (time-to-first-token)。由於沒有官方速度數據,請勿預設任何特定的響應時間。請使用符合實際規模的提示詞自行測試並進行測量。延遲也可能因地區和時段而異。供應商可能會對大型請求進行限流。
Qwen3.8 Max 的優勢在於其目錄條目:1,000,000 個 token 的上下文視窗,以及支援文字、圖片和影片輸入。這種組合對於需要一次讀取大量多樣化內容的任務很有用。誠實而言,其限制在於未列出任何基準測試分數或速度數據,因此你無法僅從目錄驗證品質。每 1M 個 token 2.00 美元的輸入價格高於許多較小的模型,而每 1M 個 token 6.00 美元的輸出價格則意味著長回應並不便宜。該模型可能不是簡短、純文字或延遲敏感應用的最佳選擇。你應該在使其成為生產依賴之前,透過 OrcaRouter 在你自己的資料上評估 Qwen3.8 Max。依賴直接觀察,而非行銷宣稱。對於適合小上下文視窗的任務,較便宜的模型更為可取。
Qwen3.8 Max 按供應商費率計費,即每 1M 輸入 tokens 收費 $2.00,每 1M 輸出 tokens 收費 $6.00。OrcaRouter 不收取任何加價,因此您看到的 token 價格就是您實際支付的價格。目錄條目中沒有提及固定的每次請求費用。請求成本的計算方式是統計每個輸入 token,包括文字、圖片和影片 tokens,再乘以每 1M tokens $2.00。輸出 tokens 則單獨計算,乘以每 1M tokens $6.00。例如,一個包含 250,000 個輸入 tokens 和 5,000 個輸出 tokens 的請求,輸入成本為 $0.50,輸出成本為 $0.03。實際費用將顯示在您的 OrcaRouter 帳單上。如果您使用完整的 1M 上下文,僅輸入成本即為 $2.00。沒有其他列出的費用。
Qwen3.8 Max 的完整上下文視窗為 1,000,000 個 token。以每 1M 輸入 token 2.00 美元的價格計算,一個使用整個視窗的請求,在產生任何輸出之前,輸入部分的成本即為 2.00 美元。若輸出量可觀,您還需支付每 1M 輸出 token 6.00 美元的費用。視覺輸入很快就會消耗大量 token,因此包含影片影格或大量圖片,會使輸入 token 數遠高於您僅以文字推估的數量。這種定價模式意味著每次呼叫沒有固定成本;您只需為使用的 token 付費。這也表示一個 100,000 token 的提示詞成本為 0.20 美元,而一個 1,000,000 token 的提示詞成本則為 2.00 美元。如果您的任務只需要幾千個 token 的上下文,Qwen3.8 Max 的價值就較難合理化。這類情況請考量使用較小的模型。
Qwen3.8 Max 的目錄條目並未提及快取功能。OrcaRouter 的 OpenAI 相容 API 可能支援標準的供應商回報快取命中,但模型規格並未確認這一點。在沒有確認快取的情況下,你應假設每個輸入 token 都以標準費率計費,即每 1M tokens 為 $2.00。有些供應商會自動快取 prompt 的前綴,並對重複的 token 收取較低費用,但此模型並未說明這項功能。你可以檢查 OrcaRouter API 回應中的 usage 物件是否有 cached_token 欄位;如果供應商有回報,你就會看到折扣。如果沒有,請按每次請求的完整輸入成本來編列預算。最安全的做法是使用重複的相同 prompt 進行測試,並檢查回應中的 token 使用量。如果沒有快取,帳單金額就不會降低。
若要呼叫 Qwen3.8 Max,請使用 OrcaRouter 的 OpenAI 相容 API,基礎 URL 為 https://api.orcarouter.ai/v1。在請求主體中將模型 ID 設為 'qwen/qwen3.8-max'。端點為 https://api.orcarouter.ai/v1/chat/completions。您需要傳送一個 JSON 物件,內含 messages 陣列,其中每個訊息都有 role 和 content。對於純文字輸入,content 是純字串。對於圖片或影片輸入,content 可以是 parts 陣列,遵循 OpenAI vision 格式。使用您的 OrcaRouter API 金鑰在 Authorization 標頭中進行身分驗證。OrcaRouter 會將請求路由到 qwen 提供者。不需要單獨的提供者特定基礎 URL。使用標準的 OpenAI SDK 並將 base_url 設定為 OrcaRouter 的 URL,即可快速上手。回應格式與您熟悉的 chat completions 格式相同。
透過 OrcaRouter 的 OpenAI 相容 API,您可以設定 temperature、top_p、max_tokens 與 stop sequences 等參數。支援的參數可能取決於 qwen 提供者的後端。Qwen3.8 Max 的上下文視窗為 1,000,000 個 tokens,因此輸入與輸出 tokens 的總和必須維持在此限制內。最大輸出長度並未列在目錄條目中;請查閱模型文件或錯誤訊息以取得該限制。您可以使用 stream 參數,在 token 產生時即時接收,以改善感知延遲。對於多模態輸入,訊息內容陣列需包含正確的 part types。若某個參數不受支援,OrcaRouter 將回傳錯誤,您可以調整請求。建議先以小型 payload 進行測試,以確認參數行為。這是整合任何新模型時的標準做法。
如果您的應用程式已經使用 OpenAI 的聊天完成 API,遷移到 OrcaRouter 上的 Qwen3.8 Max 就很簡單。將 base URL 改為 https://api.orcarouter.ai/v1,並將 API 金鑰設定為您的 OrcaRouter 金鑰。將 model 欄位設為 'qwen/qwen3.8-max'。訊息結構保持不變,包括 system、user 和 assistant 訊息。對於多模態請求,請使用與 OpenAI 的 vision API 相同的 content parts 格式。您可能需要更新提示詞,因為 Qwen3.8 Max 是不同的模型,回應可能有所不同。在更改正式環境流量之前,先用幾個範例請求進行測試。另請注意,model id 包含 'qwen/' 前綴,這正是 OrcaRouter 識別供應商的方式。如果您的 SDK 允許自訂 base URL,則無需重寫程式碼。這能減少遷移工作量。您可以保留相同的重試和錯誤處理邏輯。
Qwen3.8 Max 的特點在於其 1,000,000-token 的上下文視窗,以及支援文字、圖片和影片輸入。較小的 Qwen 模型通常具有較短的上下文視窗,且可能無法接受全部三種模態。由於 OrcaRouter 上沒有提供 Qwen3.8 Max 的基準測試分數,因此無法僅從目錄資訊與較小模型進行直接的品質比較。價格差異很明顯:Qwen3.8 Max 每 1M 輸入 token 收費 $2.00,每 1M 輸出 token 收費 $6.00。較小的模型通常每個 token 的費用較低,速度也可能更快,但其限制可能會迫使您對輸入進行分塊或捨棄視覺資料。如果您的專案適用於較小的上下文且不需要影片輸入,那麼較小的模型可能更經濟實惠。如果您需要在長篇文件或影片中進行推理,Qwen3.8 Max 就是為此設計的選項。
OrcaRouter 託管來自不同提供者的多個模型,而 Qwen3.8 Max 是多模態選項之一。其定義性功能是 1,000,000-token 的上下文視窗,以及文字、圖像和影片輸入能力。其他多模態模型的上下文視窗可能較小,或具有不同的 token 定價。Qwen3.8 Max 的目錄條目列出每 1M 輸入 tokens 2.00 美元,每 1M 輸出 tokens 6.00 美元,在 OrcaRouter 上零加成。沒有基準測試分數,你無法斷定哪個模型更強大。你可以直接將相同的提示詞(prompts)發送給每個模型,透過 OrcaRouter 的 OpenAI 相容 API,並比較輸出品質、回應時間和成本。選擇取決於你的具體工作負載,以及你實際需要多少上下文。影片支援並非普遍存在,因此那是一項關鍵的區別因素。如果你的提示詞很小,價格較低的模型可能仍然更好。
當任務需要高達 1,000,000 個 token 的大型上下文視窗,或需要支援文字、圖像和影片的多模態輸入時,請選擇 Qwen3.8 Max。對於長文件分析、整部影片理解和圖像加文字推理,它是合理的選擇。當你的提示詞很短、僅限文字或對延遲敏感,且較小的模型以較低的 token 價格即可提供可接受的品質時,請選擇替代方案。此外,如果你需要已發佈的基準測試分數或有保證的吞吐量,也請考慮其他選項,因為 Qwen3.8 Max 並未列出這些數據。正確的決定取決於你預期的 token 使用量、成本容忍度和品質要求。在投入生產環境之前,請先在 OrcaRouter 上用這兩個模型進行小型評估,並計算每次成功回答的總成本。沒有一種模型能完美適用於所有任務。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 輸入 / 1M tokens | $2.00 |
| 輸出 / 1M tokens | $6.00 |
| 快取讀取 / 1M | $0.250 |
| 快取寫入 / 1M | $2.50 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
本週開發者的討論
@misc{orcarouter_qwen3_8_max,
title = {Qwen3.8 Max API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max}
}Qwen. (2026). Qwen3.8 Max API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max