2026年9月2日的Qwen3.8 Max快照,Alibaba的旗艦多模態推理模型:支援文字+圖片+影片輸入,文字輸出,100萬token上下文。功能與定價與基礎模型相同;將其固定以確保可重現的行為。
Qwen3.8 Max (0902) 是 OrcaRouter 上來自供應商 qwen 的模型條目,以模型 ID qwen/qwen3.8-max-0902 發布。清單中顯示了 0902 這個標記,但提供的資料並未說明它代表發布日期、檢查點或修訂標籤。這是一個長上下文多模態模型:它接受文字、圖片和影片作為輸入,具有 1,000,000 個 token 的上下文窗口,最多可生成 131,072…
模型支援 1,000,000 個 token 的上下文視窗。這是指模型在單一請求中能處理的總輸入量,包括提示中的文字、圖片和影片內容。事實中未提供進一步限制,因此實際限制取決於 OrcaRouter 與供應商如何執行 token 化及請求逾時。對於長文字而言,1,000,000 個 token 可在單一提示中納入大量文件,減少在呼叫模型前進行分段或摘要的需求。對於影片,事實中未說明每秒、每影格或每個影片檔案會消耗多少 token,因此你應根據中繼資料或測試呼叫來估算。此外請務必記住,上下文視窗大小並不能告訴你模型在 1,000,000 個 token 的提示上有多準確;事實中未提供任何基準資料。若你的應用需要精確的長上下文品質,請在投入正式環境前,先以你自己的文件樣本進行評估。
由於模型可接受文字、圖片與影片作為輸入,因此可在同一請求中,要求模型對結合上述多種型態的來源素材進行推理。舉例來說,閱讀文字中的指示、檢查圖片,並在產生答案時參考影片。供應商資料表中並未列出 OCR、物件偵測或時序影片推理等任務特定能力,因此不應假定這些行為存在。模型可預期的表現,主要取決於其訓練出的能力,而這些能力並未記載於所提供的資料中。較安全的設計是將其用於需要從混合模態提示中產生文字輸出,且能容忍將圖片與影片儲存為輸入 Token 成本的任務。若工作負載僅包含文字,使用另一個不具圖片與影片輸入的模型可能更簡單。若任務需要精確到時間戳等級的影片操作,模型卡並未提供任何證據顯示此類行為是否可靠。
當任務不需要此列表所定義的功能時,選擇較便宜的模型是合理的。短文本問題不需要 1,000,000 個 token 的上下文或 131,072 個 token 的輸出上限。純文字工作流程不需要影像或影片輸入。OrcaRouter 對這個模型的計費為每 1,000,000 個輸入 token 2.00 美元,每 1,000,000 個輸出 token 6.00 美元。如果有更便宜的替代方案具有較低的每個 token 價格,並有足夠的上下文與模態支援,就能降低成本。所提供的資料中沒有品質或速度基準,因此選擇此模型而非其他模型不能以量測的準確度來證明;應以明確的產品需求來證明:大上下文、混合文字/影像/影片輸入,或一次性生成中的長輸出。由於輸入價格適用於上下文中的每個 token,即使使用者問題很短,非常大的上下文呼叫也可能比小型呼叫花費更多,因此請避免填充提示。
提供的有關 Qwen3.8 Max (0902) 的模型資料並未包含基準測試分數、評估集或準確度數字。因此,任何關於模型品質的陳述都只是推測,OrcaRouter 不會發布推斷的分數。如果您需要一個數字來比較候選模型,請在具代表性的輸入上執行您自己的測試,包括您預期會傳送的圖片和影片案例。像公開知識測試這類基準,無法告訴您模型處理特定 1,000,000-token 影片提示的效果如何。請記住,像 Max 這樣的模型名稱只是標籤,並非品質的證據。此清單中可衡量的項目是上下文視窗、最大輸出長度、輸入模態和價格。這些屬性會影響工作負載是否合適,但它們無法描述準確度、推理深度、指令遵循或安全行為。除非您執行評估,否則請將這些領域的能力視為未經驗證。
模型事實並未提供每秒 token 速率、首個 token 回應時間、請求逾時建議或任何其他效能衡量數據。OrcaRouter 並未針對此供應商模型宣稱任何延遲數據。速度將取決於供應商的伺服基礎設施、輸入大小,以及要求的輸出量。1,000,000 個 token 的輸入與 131,072 個 token 的輸出,很可能會比簡短請求花費更長時間,但清單中並未給出確切的關係。影片輸入也可能使延遲惡化,因為它必須先被處理成 token,模型才能處理;事實並未量化該步驟。審查者不應假設較低的每 token 定價即代表較快的解碼速度。事實所支援的唯一與速度相關的決策,是在您預期的負載下測試具代表性的請求大小。請勿從上下文視窗大小或模型名稱推斷即時適用性。
所陳述的優勢是結構性的。該模型擁有 1,000,000 個 token 的上下文視窗、高達 131,072 個 token 的最大輸出,並接受文字、圖像和影片輸入。這些特性對於需要在一次模型呼叫中先觀察大量或混合內容,再撰寫長篇回應的應用程式很有用。從事實層面來看,限制也比優勢更容易陳述。沒有發布任何品質基準,因此準確性、推理能力和安全性均未經文件記錄。0902 標籤背後並未單獨列出訓練資料、版本說明或更新方法。圖像和影片輸入不保證能精確理解視覺或時間資訊。上下文和輸出限制是上限,並非建議使用量;非常大的輸出可能很昂貴,每 1,000,000 個輸出 token 需花費 $6.00。一個填滿 1,000,000 個 token 上下文的請求,在產生任何輸出之前就會消耗 $2.00 的輸入 token,這是一筆相當可觀的營運成本。
列出的單價為每1,000,000個輸入token收費2.00美元,每1,000,000個輸出token收費6.00美元。OrcaRouter以供應商費率計費模型,且不加成,因此所列價格即為供應商的直通費率。輸入token包含提示中所傳送的文字、影像和影片token。輸出token為產生的回應token。按照這些費率,1,000,000個輸入token花費2.00美元;1,000,000個輸出token花費6.00美元。較小的請求按比例花費較少:100,000個輸入token為0.20美元,100,000個輸出token為0.60美元,前提是這些數量由供應商計量。模型卡並未包含快取輸入、批次請求或互動層級的單獨定價,因此不應假定存在此類價格。每次呼叫的實際計費token數量應從OrcaRouter的使用回應或日誌中檢查。
當 OrcaRouter 表示某個模型以提供者費率計費且不另加價時,代表 OrcaRouter 並未在此列表的提供者費率之上,額外加入自己的每 token 費用。因此,token 使用量的最終金額應以所列出的每 1,000,000 個 token 輸入 $2.00、輸出 $6.00 價格為準。這並不一定表示最終帳單沒有其他費用;視你的約定而定,可能會有稅金或帳戶層級費用產生,但在這些事實中並未記載此類費用。這也不代表該模型可免費提供服務,因為每 token 費率仍然適用。在比較不同提供者時,OrcaRouter 對此模型顯示的價格,應與此列表使用相同的單位。如果其他閘道報出不同價格,差異在於計費結構,而非模型上下文視窗的變更。
成本管理應從提示長度開始。由於輸入每 1,000,000 個 token 費用為 $2.00,每個額外的 token 都會增加輸入費用,而請求中傳送的每張圖片或影片會根據此清單未提供的規則轉換為 token。刪減不相關的來源材料可以降低成本。輸出的單價是輸入的三倍,因此限制請求的輸出長度也能控制成本。具有 131,072 個 token 輸出限制的模型,其生成的回應會產生費用;以每 1,000,000 個 token $6.00 計算,131,072 個輸出 token 僅輸出 token 一項就約需 $0.79。生成那麼多 token 並非自動發生,因為回應大小由提示控制。此模型沒有公布的快取價格,因此請勿假設重複的上下文會獲得折扣。在事實中缺少快取或批次價格,並不證明此類選項不存在;只是表示它們不屬於此清單的一部分。
Qwen3.8 Max (0902) 通過 OrcaRouter 的 OpenAI 相容 API 公開。將客戶端基礎 URL 設定為 https://api.orcarouter.ai/v1,並在本文中使用確切的模型 ID qwen/qwen3.8-max-0902。使用 OpenAI 相容 SDK 時,請求結構基本上與任何聊天補全呼叫相同:傳遞 OrcaRouter 的 API 金鑰、上述基礎 URL,以及本文中的模型 ID。請勿使用類似 Qwen3.8 Max 或 qwen3.8 的通用名稱;清單要求使用 qwen/qwen3.8-max-0902。在對基礎 URL 的直接 HTTP 請求中也應使用相同的模型 ID,其中路徑和請求負載遵循 OrcaRouter 公開的 OpenAI 相容契約。由於它是 OpenAI 相容的,為 OpenAI 聊天補全編寫的現有程式碼通常可以透過變更 base_url 和 model 參數來遷移,不過身份驗證細節必須符合 OrcaRouter 的要求。
對於 OpenAI 相容的聊天補全(chat completion),model、messages 與輸出 token 上限等參數的處理方式與其他相容模型相同。事實資料顯示最大輸出為 131,072 個 token,因此如果你設定輸出上限,不應高於 131,072;事實資料中並未說明預設的輸出上限。Temperature、top-p、stop 及其他取樣參數在所提供的模型事實資料中並未記載,因此請遵循 OrcaRouter 的 API 文件與標準 OpenAI 參數語義。對於圖片與影片輸入,請使用 OrcaRouter API 預期的多模態內容格式;事實資料未提供範例。如果 API 回報不支援的參數名稱錯誤,請檢查你的 SDK 是否正在傳送舊版參數。上下文視窗為 1,000,000 個 token,因此提示詞必須將所有輸入 token(包括圖片與影片 token)保持在該限制以下。回覆則另外計入 131,072 個 token 的上限。
由於 OrcaRouter 在 https://api.orcarouter.ai/v1 提供 OpenAI 相容的 API,遷移大多只是設定變更。將 base URL 換成 https://api.orcarouter.ai/v1,將 API key 欄位換成 OrcaRouter key,並將 model 設為 qwen/qwen3.8-max-0902。如果你的程式碼使用 OpenAI 相容的用戶端函式庫,請更新用戶端的 base_url 與 api_key,並保留大部分訊息結構不變,前提是該多模態格式符合此模型。事實中並未說明此模型是否支援所有 OpenAI 專屬參數,因此在遷移前,請檢視你的應用程式會傳送的參數。此外,由於上下文限制為 1,000,000,最大輸出為 131,072,請將請求截斷邏輯調整為這些限制。任何現有程式碼若寫死了不同的最大上下文長度,可能需要更新。最後,請確認你的應用程式資料處理預期符合 OrcaRouter 的條款,因為模型事實本身並未討論資料保留。
比較的主要依據是輸入合約。Qwen3.8 Max (0902) 接受文字、圖片與影片輸入,因此純文字替代方案將排除這些模態。如果您的實際工作負載僅包含文字,具備足夠大上下文的純文字模型可能更直接契合需求,且定價也可能不同。模型規格中並未包含與任何其他模型之間的準確性或速度比較,因此您無法依據公開的品質分數來選擇。您可以比較結構屬性:純文字替代方案可能具有較小的上下文、較短的輸出上限或較低的輸入價格。OrcaRouter 對該模型的收費為每 100 萬個 token 輸入 $2.00、輸出 $6.00。它具備圖片與影片輸入能力的這項事實,僅在這些輸入確實被使用時才有意義。若這些輸入未被使用,您可能是在為與任務無關的多模態能力付費。
選擇 Qwen3.8 Max (0902) 當任務配置符合所列功能時。首先,您需要 1,000,000 個 token 的上下文,因為來源材料無法縮短以符合較小的視窗。其次,您需要在同一個提示中輸入圖片和影片,或者您預期未來請求會包含這些模態。第三,您希望輸出最多可達 131,072 個 token。如果您的工作負載沒有這些需求中的任何一項,此列表的許多優點都未被使用。請不要因為名稱「Max」看起來很強大就選擇它;該列表不包含基準測試證據。由於 OrcaRouter 透過相同的 OpenAI 相容 API 公開模型,交換模型 ID 很容易,因此您可以自行針對任務測試此模型與另一個候選模型。只要記住輸入和輸出價格不同,且此模型未指定快取價格。
比較成本時,先標準化到相同的 token 基準。此模型每 1,000,000 個輸入 token 收費 $2.00,每 1,000,000 個輸出 token 收費 $6.00,由供應商以零加成轉傳。輸入每 token 價格較低的競爭模型,對於完整內容的請求可能確實較便宜,但也必須考量上下文視窗與最大輸出長度。例如,一個 1,000,000 token 的請求可以一次呼叫就使用此模型的完整上下文;而上下文僅 200,000 token 的模型則需要多次呼叫,額外的輸出或摘要處理次數可能改變總價格。所提供的資料並未包含客觀的準確度或延遲數值,因此任何「每次正確答案成本」的比較都必須來自您自己的測試。另外,請檢查競爭模型是否對圖片或影片 token 另行收費,因為此處並未說明這些內容。如有疑慮,請在 OrcaRouter 上執行典型工作負載,並比較實際量測的 token 使用量與回應品質,而非僅依賴表定價格。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 輸入 / 1M tokens | $2.00 |
| 輸出 / 1M tokens | $6.00 |
| 快取讀取 / 1M | $0.250 |
| 快取寫入 / 1M | $2.50 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
本週開發者的討論
@misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902