Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
視覺工具JSON推理
來自 Qwen · 2025-10-14

Qwen3-VL 8B Thinking — 開源權重的小型視覺語言推理模型,80億參數,128k上下文。

上下文131.1K tokens
最大輸出41K
輸入模態text + image + video
輸出模態text
p50 首字節5.00 s
輸入$0.18/ 百萬 tokens
輸出$2.10/ 百萬 tokens
p50 首字節5.00 s7 天
p95 首字節8.55 s7 天
流量108.8Ktokens / 7 天

Qwen3 VL 8B Thinking 是阿里雲 Qwen 團隊開發的一項 80 億參數多模態語言模型,託管於 OrcaRouter 平台,供應商為 qwen。它屬於 Qwen3 系列視覺語言模型,其「Thinking」後綴表示針對視覺與文字輸入具備增強的推理能力。該模型支援文字、圖片及影片輸入,並產生文字輸出。其上下文視窗涵蓋 131,072 個 token,單次回應最多可生成 40,960…

什麼是Qwen3 VL 8B Thinking?

誰應該使用這個模型?

它支援哪些模式?

'Thinking' 變體與標準的 Qwen3 VL 有何不同?

程式碼範例

用任意 SDK 呼叫

相容 OpenAI——沿用你現有的 SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

支援的參數

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

價格

輸入 / 1M tokens$0.180
輸出 / 1M tokens$2.10
貨幣USD

費用計算器

每月 token 數10MM
輸入占比70%%
預計每月 $7.56

基於標價的估算

Token 與費用估算器

輸入 Token: 6每次請求費用: $0.001051

僅為估算——實際 Token 數取決於供應商的分詞器。

效能

p50 首字節
5.00 s
輸出速度
64.6 tok/s
p95 首字節
8.55 s
錯誤率
0%

公開基準測試

來源: Design Arena

比較一覽

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
輸入 $/百萬$0.18$0.86$0.17$0.12
輸出 $/百萬$2.10$3.44$1.03$0.69
上下文131K262K33K1.0M
品質4/108/108/108/10
並排比較並排比較並排比較並排比較

常見問題

在 OrcaRouter 上,Qwen3 VL 8B Thinking 的每百萬 Token 成本是多少?
輸入令牌:每100萬個令牌$0.18。輸出令牌:每100萬個令牌$2.10。這些是供應商的費率,以零加價傳遞。
什麼是上下文窗口和最大輸出 Token 數?
上下文窗口為131,072個token。最大輸出token數為40,960個token。
這個模型的主要優勢是什麼?
它支援三種輸入模式(文字、圖片、影片),提供長上下文和長輸出長度,並包含一項思考(chain-of-thought)能力,可提升複雜推理任務的表現。
這個模型與Qwen2 VL 7B相比如何?
它擁有更大的上下文長度(131K vs 32K)、更大的最大輸出(40K vs 2K),並增加了思考能力。定價略高,但提供了改進的推理和多模態理解能力。
使用此模型時,OrcaRouter 是否會緩存任何用戶資料?
OrcaRouter 未報告任何儲存提示或圖片的快取機制;資料處理遵循標準 API 做法。詳情請參閱 OrcaRouter 的隱私權政策。
我如何透過OpenAI相容的API呼叫此模型?
向 https://api.orcarouter.ai/v1/chat/completions 發送一個 POST 請求,使用模型 "qwen/qwen3-vl-8b-thinking" 和您的 API 金鑰。使用包含 text 與 image_url 項目的 content 陣列進行多模態輸入。
模型無法直接處理影片輸入,但可以分析轉換為圖像的影片幀。
確認可以接受影片,方法是將提取的幀作為獨立的 image_url 條目發送。該模型沒有原生影片編解碼器支援,它基於靜態影格集合進行處理。
每次請求的圖片數量是否有任何限制?
不,除了總 token 數(包含文字和圖像 token)必須在 131,072 的上下文限制之內,沒有單獨的圖像限制。
我可以使用哪些程式語言或函式庫透過 OrcaRouter 存取此模型?
任何支援HTTP請求和OpenAI API格式的語言。例如使用openai庫的Python、使用fetch的JavaScript等。只需設定基本URL和模型ID。
Does the thinking variant always return chain-of-thought reasoning?
模型內部在生成最終答案前會逐步進行推理,但您所看到的輸出即為完整回應。您無法單獨提取中間的思考標記。

嵌入此徽章

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50透過 OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking 於 OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

以資料形式取得模型卡

GET /api/public/models/qwen/qwen3-vl-8b-thinking開啟