Qwen3-VL 8B Thinking — 開源權重的小型視覺語言推理模型,80億參數,128k上下文。
Qwen3 VL 8B Thinking 是阿里雲 Qwen 團隊開發的一項 80 億參數多模態語言模型,託管於 OrcaRouter 平台,供應商為 qwen。它屬於 Qwen3 系列視覺語言模型,其「Thinking」後綴表示針對視覺與文字輸入具備增強的推理能力。該模型支援文字、圖片及影片輸入,並產生文字輸出。其上下文視窗涵蓋 131,072 個 token,單次回應最多可生成 40,960…
Qwen3 VL 8B Thinking 在視覺問答方面表現優異,特別是在問題涉及多個物件、空間關係或圖像中嵌入的文字(例如路標、收據)時。它還能處理影片理解任務,例如摘要短片、識別動作,或回答關於特定時間戳的問題。文件分析是另一個強項:從包含文字與圖表的 PDF,或是掃描表單中提取資訊。其長上下文視窗使其適合處理大型文件(例如超過100頁的PDF),並可偶爾插入圖像,只要總 Token 化輸入保持低於 131K 即可。
如果你的使用場景純屬文字類型,不涉及圖像或影片,那麼專用純文字模型(例如 Qwen3-8B 或同等規模的 Llama 變體)可能更具成本效益。多模態模型會因編碼視覺輸入而產生額外開銷,而 Qwen3 VL 8B Thinking 的每個 token 定價(輸入 $0.18、輸出 $2.10 每百萬 tokens)可能高於許多純文字替代方案。此外,如果你的任務是從非常簡短的圖像中進行簡單的分類或提取,那麼延遲和成本較低的較小視覺語言模型(例如 Qwen2 VL 2B)可能就足夠使用,且不犧牲性能。
是的,模型可以在單一API呼叫中接受多張圖片與文字交錯輸入,前提是總Token數量(圖片Token加上文字Token)不超過131,072的上下文視窗。每張圖片會根據其解析度與複雜度,編碼成可變數量的Token。OrcaRouter的OpenAI相容API允許您在內容陣列中傳送多個圖片URL或base64編碼的圖片。除了上下文限制外,並無對圖片數量的硬性限制。針對影片,您通常會擷取關鍵幀,並將其作為單獨圖片連同文字提示一起傳送。
與所有多模態模型一樣,Qwen3 VL 8B Thinking 可能會在圖片或影片中產生幻覺細節,特別是在解析度較低或內容模糊的情況下。它並非設計用於即時影片串流,而是處理靜態的幀序列。8B參數量意味著在高度專業化的領域(例如醫學影像、衛星影像)上,其準確度可能不如大型模型(例如70B-100B+的視覺語言模型)。它不支援音訊輸入。思考過程可能會增加輸出長度,因此請相應地預算輸出Token。最後,它針對英文進行了最佳化,但可以處理其他語言,效果因情況而異。
Qwen3 VL 8B Thinking在標準多模態評測(例如MMMU、MathVista、VideoMME)上的具體基準分數,目前現有資料中尚未提供。使用者應查閱官方Qwen模型卡或研究論文以取得最終發表的結果。總體而言,Qwen3 VL系列在視覺語言任務上相較於其他7B-8B參數模型展現出具有競爭力的表現。「Thinking」變體預計將改善依賴推理能力的評測項目,例如視覺思維鏈。在沒有公開分數的情況下,建議在使用者自身的代表性資料集上測試該模型,以評估其適用性。
OrcaRouter 基礎設施上此特定模型的延遲數據尚未公開。一般而言,由於視覺編碼,一個 8B 參數的多模態模型的延遲會高於相同參數規模的純文字模型。影片輸入因額外的幀處理而進一步增加延遲。在高效能 GPU 集群(如 A100、H100)上,8B 模型的首個 token 生成時間通常在幾百毫秒到幾秒之間,具體取決於輸入長度和批次大小。輸出 token 生成速度通常以每秒數十個 token 為單位衡量。這些數值為定性參考;實際表現取決於 OrcaRouter 當前的配置與負載。
優點:該模型可處理長篇多模態上下文(13.1萬個token),支援大量輸出(最多4萬個token),並能處理三種輸入類型。其推理能力可提升需要逐步推導的任務表現。以8B多模態模型而言,定價極具競爭力。 限制:尚未在多數公開排行榜上與最新尖端模型進行評比。其最大輸出吞吐量可能低於較小模型。未針對創意圖像生成進行最佳化(僅輸出文字)。使用者不應假設視覺任務中完全不會產生幻覺。影片處理僅限於基於幀的提取,而非連續性分析。
Qwen3 VL 8B Thinking 按 token 計費,費率依照提供商報價,無任何加價。輸入 token 每 100 萬個收費 0.18 美元,輸出 token 每 100 萬個收費 2.10 美元。無額外基礎設施費用、無每次請求基本費用、也無每月訂閱費。定價適用於所有輸入模態(文字、圖片、影片);每個模態都會被標記化並按輸入費率收費。OrcaRouter 不會在此報價費率之上收取任何溢價。舉例來說,處理一張 token 化為 2,000 個輸入 token 的圖片,其輸入成本為 2,000 * (0.18 美元 / 100 萬) = 0.00036 美元。輸出成本的計算方式類似。
每張影像會根據其尺寸與壓縮等級,編碼成可變數量的Token。高解析度影像可能消耗數千個Token。影片則透過擷取畫面(通常每秒數幀)並將每幀編碼為影像來處理;因此Token成本會隨影片長度與幀率線性增加。使用者可透過縮小影像尺寸或減少幀數來控制成本。除Token成本外,媒體編碼無額外費用。輸出成本僅取決於生成的文字Token數量。對於長影片,輸入Token可能快速逼近131K限制,使每次請求的成本增加。
根據所提供的資訊,目前並無針對批量使用或預付費承諾的折扣。OrcaRouter 目前不提供能降低重複提示或圖片成本的令牌快取功能。所有請求均按即時標準費率以每個令牌計費。若供應商(qwen)未來推出分層折扣定價,OrcaRouter 將以零加價方式傳遞這些優惠。建議用戶持續關注 OrcaRouter 定價頁面以獲取最新更新。對於高用量使用情境,可考慮直接與 OrcaRouter 討論潛在的批量定價方案。
相較於更大的多模態模型(例如 GPT-4V、Gemini 1.5 Pro),Qwen3 VL 8B Thinking 的每個 token 成本明顯更便宜:那些模型通常每百萬輸入 token 收費 $2–$10 以上。在 7B–8B 參數的視覺語言模型中,其定價與同級產品相當(Qwen2 VL 7B 輸入約 $0.10–$0.20,輸出約 $1–$2)。輸出 token 成本(每百萬 $2.10)高於某些純文字 8B 模型(例如每百萬輸出 $0.20),反映了額外的推理開銷。如果使用較小模型(例如 2B–4B 參數),成本可降低 50–90%,但能力也會下降。
您可以通過向 OrcaRouter 的 OpenAI 相容端點 https://api.orcarouter.ai/v1/chat/completions 發送 POST 請求來呼叫 Qwen3 VL 8B Thinking。將 model 參數設為 "qwen/qwen3-vl-8b-thinking"。在 Authorization 標頭中將您的 API 金鑰設為 "Bearer <key>"。請求主體遵循 OpenAI 的 chat completions 架構。對於多模態輸入,將訊息內容結構化為物件陣列:一個 type 為 "text" 的物件用於文字提示,每個影像使用一個 type 為 "image_url" 的物件(使用 URL 或 base64 資料)。影片可以作為多個代表影格的 image_url 條目發送。回應遵循標準的 OpenAI 結構,所有生成的文字都在 choices 陣列中。
所有標準的 OpenAI 聊天完成參數皆受支援:temperature(0–2,預設 1.0)、top_p(0–1,預設 1.0)、max_tokens(最高 40960)、stop sequences、frequency_penalty、presence_penalty、logprobs 以及 n(完成次數)。此模型不支援串流?OrcaRouter 在設定 streaming=true 時可能支援串流;請查閱提供者的文件。tools(函式呼叫)參數若底層提供者啟用則可能受支援;目前不保證。允許系統提示。可傳入使用者 ID 以進行監控。確保在發送前透過監控 token 數量,保持在 131072 token 的上下文視窗內。
如果你目前正在使用其他 API 服務商(例如,直接使用阿里雲)提供的相同模型,遷移至 OrcaRouter 非常簡單:將基礎 URL 改為 https://api.orcarouter.ai/v1,將模型字串更新為 "qwen/qwen3-vl-8b-thinking",並將 API 金鑰替換為 OrcaRouter API 金鑰。由於 OrcaRouter 使用完全相同的 OpenAI 相容介面,因此不需要修改其他程式碼。請注意,Token 用量和計價將基於 OrcaRouter 的費率(不加價直接傳遞)。你可能需要調整成本監控工具以反映新的定價。
Streaming is available through OrcaRouter's API. Set the stream parameter to true in your request. The response will be a Server-Sent Events (SSE) stream with deltas of the generated tokens. This is useful for real-time display. Note that for the "Thinking" variant, the thinking process may introduce longer delays before the first token, but streaming will still send incremental tokens as they are produced. The stream format follows OpenAI's streaming specification, with events of type "chat.completion.chunk". Each chunk contains a delta with the token's content or role.
Qwen3 VL 8B Thinking 是 Qwen2 VL 7B 的後繼版本,參數數量大致相同(80億 vs 70億),但架構改進,支援更長的上下文(131K vs Qwen2 VL 7B 的32K)。它還新增了「思考」能力以進行逐步推理,這是 Qwen2 VL 所沒有的。最大輸出長度從 2048 tokens(Qwen2 VL 7B)增加到 40960 tokens。Qwen3 VL 8B Thinking 的定價每 token 略高於 Qwen2 VL 7B(後者每百萬 token 約為輸入 $0.15、輸出 $1.80),反映了其增強的功能和更大的上下文。升級的使用者應預期在複雜推理任務上獲得更好的表現。
GPT-4o mini 是 OpenAI 推出的旗艦多模態模型,支援 128K 上下文視窗。其參數數量顯著更多(未知,但估計超過 70B),在標準基準測試中通常能達到更高準確度。然而,Qwen3 VL 8B Thinking 的價格明顯更低:GPT-4o mini 每百萬輸入 token 成本為 $0.15,每百萬輸出 token 成本為 $0.60,實際上比 Qwen3 的每百萬輸入 $0.18 與輸出 $2.10 還低?等等,核對一下:GPT-4o mini 輸入 $0.15,輸出 $0.60 —— 比 Qwen3 VL 8B Thinking 更便宜?實際上輸出便宜很多。所以並非各項成本都更低。但 Qwen3 支援影片及更長的輸出(40960 對比 GPT-4o mini 的 16384)。上下文視窗相近。選擇取決於所需的精確度與預算;Qwen3 適合超長輸出與開源部署的特定場景。
Llama 3.2 11B Vision 是一個 11B 參數的多模態模型,具備 128K 上下文視窗與 8K 最大輸出詞元。Qwen3 VL 8B Thinking 參數量較小,但最大輸出詞元數大得多(40960 vs 8000),並包含推理能力。兩者皆支援文字與圖片輸入,但 Llama 3.2 11B 不原生支援影片。Llama 透過供應商的定價相近,輸入約每百萬詞元 $0.15–$0.20,輸出約 $0.60–$1.00,使得 Qwen3 在輸出上較昂貴。對於需要極長生成文字的任務(例如從影片撰寫報告),Qwen3 更為適合。對於較短且成本敏感的任務,Llama 3.2 11B 可能是更好的選擇。
Gemini 1.5 Flash 是一款快速、成本效益高的多模態模型,具備 100 萬(可達 200 萬)Token 的上下文視窗,支援圖片、影片和音訊。它比 Qwen3 VL 8B Thinking 更便宜(Gemini Flash 每百萬 Token 輸入成本為 0.075 美元,輸出為 0.30 美元),速度也更快。然而,Qwen3 VL 8B Thinking 提供了思考過程,可提升在挑戰性視覺任務上的推理能力,且其最大輸出長度更大(Gemini Flash 為 8K,Qwen3 為 40K)。若您的應用需要逐步推理與長輸出,Qwen3 是更佳選擇。針對高吞吐量與低延遲,Gemini Flash 通常表現更優。此外,當資料主權要求自行託管或不受供應商限制的部署時,Qwen3 可能更受青睞。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| 輸入 / 1M tokens | $0.180 |
| 輸出 / 1M tokens | $2.10 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking