Qwen3.5 Flash — 多模態聊天(文字/圖片/影片)針對成本進行最佳化,1M上下文。
Qwen3.5 Flash 是 Qwen 系列中的多模態語言模型,專為快速推論與低成本設計。它可接受文字、圖片與影片輸入,並產生文字回覆。其內容視窗為 1,048,576 個詞元,能在單次請求中處理極長文件或多個影片幀。該模型每次生成最多可輸出 65,536 個詞元。可透過 OrcaRouter 的 API 以模型 ID「qwen/qwen3.5-flash」存取。OrcaRouter…
Qwen3.5 Flash 可接受文字、圖片(包括每項請求中的多張圖片)與影片輸入。針對影片,模型能處理影格或完整影片檔案,最多可達上下文限制。它能在單一 API 呼叫中共同處理這些模態,支援描述影片場景、回答圖片相關問題,或將文字指令與視覺內容結合。實際支援的影片長度取決於影格提取與在 100 萬上下文視窗中的 Token 配額。
該模型在需要大量上下文與多模態輸入的任務中表現出色,例如:摘要長篇影片字幕、從含有圖片的掃描文件中提取結構化資料,以及建立能參考視覺情境的對話代理。對於高吞吐量的批次處理,由於每token成本(尤其是輸入)低廉,使其在處理數百萬個查詢時極具經濟效益。針對單純的文字任務,使用更便宜的文字專用模型可能更具成本效益。
對於純文字且不需要多模態能力的任務,價格較低的較小型或純文字模型可能更具成本效益。Qwen3.5 Flash 的優勢在於其多模態與長上下文能力;若您的應用僅需短文本補全,像是 text-davinci 或較小的 Qwen 變體這類模型可能更能節省成本。同樣地,如果您不需要完整的 1M 上下文,採用較小窗口的模型可能會降低延遲與成本。
"Flash" 這個名稱表示該模型在某些基準準確度上有所取捨,以換取更快的推論速度和較低的運算成本。與 Qwen 的較大型模型(例如 Qwen3.5-72B)相比,它採用了更高效的架構,參數數量更少。基準測試分數由 Qwen 發布,但此目錄條目中未提供。在實際應用中,它在多模態理解任務上表現具有競爭力,同時維持每個請求的較低延遲,因此適合用於即時應用程式。
延遲取決於輸入大小、輸出長度和伺服器負載。由於 Qwen3.5 Flash 是專為速度設計的,因此在相同的 token 數量下,它通常比 Qwen3.5-72B 等較大型模型更快返回回應。目錄中未提供確切的每秒 token 數值。使用者可以透過 OrcaRouter 的端點測試效能,以測量其特定使用案例的實際延遲。100 萬個 token 的上下文視窗可能會為非常長的輸入帶來處理開銷。
優勢包括多模態輸入、極大的上下文、65K輸出token,以及每個token的低成本。該模型能良好處理長文檔和影片。限制:與較大的前沿模型相比,在複雜推理或數學任務上並非最準確。也可能在處理細微的多步驟指令時遇到困難。對於輸出品質至關重要的任務,請考慮使用更大的Qwen或GPT-4o等級模型。'Flash'架構優先考慮吞吐量和成本,而非峰值準確度。
價格為每100萬輸入代幣(文字、圖像或影片代幣)0.10美元,每100萬輸出代幣0.40美元。這些費率按供應商費率計算,OrcaRouter不加價。API網關不收取額外費用。此價格直接傳遞,意味著最終用戶支付的價格與直接調用供應商API相同,無任何OrcaRouter附加費。代幣計數遵循每種模態的標準分詞方式。
輸入令牌價格($0.10/1M)在多模態模型中極具競爭力。例如,許多大型多模態模型每百萬輸入令牌收費2-10美元。輸出價格($0.40/1M)也較低。然而,由於模型擁有100萬令牌的上下文窗口,處理非常長的輸入可能導致總成本高昂,儘管每令牌費率較低。用戶應平衡上下文長度與請求數量。對於短輸入,較小的模型可能提供更低的絕對成本。
目錄條目並未指定Qwen3.5 Flash在OrcaRouter上是否支援快取。用戶應查閱OrcaRouter的文件以了解提示快取或回應快取功能的詳細資訊。如果不支援快取,重複的相同輸入每次將產生完整的token費用。對於批次處理,考慮對輸入進行去重或使用本地快取以減少API呼叫。無論快取狀態如何,定價仍維持供應商費率,不加價。
使用位於 https://api.orcarouter.ai/v1 的 OpenAI 相容端點。在請求中將模型參數設為 "qwen/qwen3.5-flash"。從 OrcaRouter 取得 API 金鑰。請求格式與 OpenAI 的聊天補全 API 相同,支援角色(system、user、assistant)以及使用包含 "type": "image_url" 或 "type": "text" 的 "content" 陣列來進行多模態內容。對於影片,您可能需要提取幀並將其作為圖片傳遞。有關影片處理的具體指南,請參閱 OrcaRouter 文件。
標準的 OpenAI 相容參數:temperature、top_p、max_tokens(最多 65536)、stop sequences、presence_penalty、frequency_penalty 和 seed。max_tokens 參數上限為 65536,以符合模型的最大輸出。該模型支援透過 stream: true 進行串流。您也可以設定使用者 ID 以進行追蹤。對於多模態請求,請在使用者訊息中包含圖片或影片內容。該模型在所有輪次中總共接受最多 1,048,576 個 token 的上下文視窗。
如果你已經在使用 OpenAI 的 Python SDK,請將 base_url 改為 https://api.orcarouter.ai/v1,並將模型名稱更新為「qwen/qwen3.5-flash」。認證時使用 OrcaRouter API 金鑰,而非 OpenAI 金鑰。請求和回應的結構完全相同。若要從其他供應商遷移,請使用 chat completions 格式。請確保你的 system prompts 與 multimodal content 根據 OpenAI 慣例進行格式設定。除了端點與模型名稱之外,不需要任何程式碼修改。
是的,OrcaRouter API 支援系統訊息、使用者訊息與助理訊息的多輪對話。完整的對話歷史會計入 1,048,576 個 token 的上下文視窗。該模型能處理使用者訊息中的多模態內容。針對影片,您可以在單一使用者訊息中以多張圖片的形式傳送影格。模型會跨輪次維持上下文,因此您可以進行包含長歷史記錄的擴展互動,前提是總 token 數保持在限制之內。
Qwen3.5 Flash 是比 Qwen3.5-72B 或 Qwen3.5-32B 等較大型 Qwen 模型更小、更快且更便宜的替代方案。它犧牲了一些基準測試準確度,以換取更低的延遲和成本。它與較大型的同系列模型共享相同的多模態輸入支援和大型上下文視窗(1M)。對於需要最先進推理能力的任務,較大型模型是首選。對於速度和成本更為重要的大流量或即時應用,Flash 是更好的選擇。
GPT-4o 在許多推理與多模態基準測試上提供更高準確度,但價格也顯著較高(GPT-4o 每百萬輸入 tokens 通常為 $2.50,GPT-4o mini 則為 $0.15)。Qwen3.5 Flash 更便宜(輸入 $0.10),且擁有更大的上下文窗口(1M 對比 GPT-4o 的 128K)。其輸出 token 限制(65K)也超過 GPT-4o mini(16K)。對於需要處理極長輸入、對成本敏感的應用,Qwen3.5 Flash 在提供良好多模態理解的同時,可能更具經濟效益。
Claude 3 Haiku 和 Gemini 1.5 Flash 是類似的 'flash' 模型。Claude 3 Haiku 僅支援文字,定價為每百萬輸入 tokens 0.25 美元。Gemini 1.5 Flash 支援多模態輸入,並擁有 1M 上下文視窗,定價為每百萬輸入 tokens 0.075 美元。Qwen3.5 Flash 的多模態支援和 1M 上下文使其處於類似等級,輸出定價($0.40/百萬 tokens)高於 Gemini Flash($0.30/百萬 tokens),但低於 Haiku($1.25/百萬 tokens)。基準測試表現因任務而異。
OrcaRouter 託管了 Llama 3.1 8B 和 Mistral 7B 等開源模型。Qwen3.5 Flash 是專有模型,但在成本與性能上具有競爭力。開源模型通常每 Token 成本較低甚至免費(只需支付計算費用),但可能需要更多工程設定。Qwen3.5 Flash 則提供零加價的託管 API、100 萬 Token 的上下文窗口,以及大多數開源模型缺乏的多模態支援。它在開源的靈活性與專有的品質之間取得了良好的平衡。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| 輸入 / 1M tokens | $0.100 |
| 輸出 / 1M tokens | $0.400 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
本週開發者的討論
@misc{orcarouter_qwen3_5_flash,
title = {qwen/qwen3.5-flash API},
author = {qwen},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-flash}
}qwen. (n.d.). qwen/qwen3.5-flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-flash