Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
ビジョンツールJSON推論
提供 Qwen · 2025-10-14

Qwen3-VL 8B Thinking — オープンウェイトの小型視覚言語推論モデル、8Bパラメータ、128kコンテキスト

エンドポイント:/v1/chat/completions
コンテキスト131.1K トークン
最大出力41K
入力text + image + video
出力text
p50 TTFT7.50 s
入力$0.18/ 100万 tokens
出力$2.10/ 100万 tokens
p50 TTFT7.50 s7日
p95 TTFT10.00 s7日
トラフィック14.3Ktokens / 7日

Qwen3 VL 8B Thinkingは、Alibaba CloudのQwenチームによって開発された80億パラメータのマルチモーダル言語モデルであり、プロバイダーqwenのもとOrcaRouter上でホストされています。これはQwen3ファミリーのビジョン言語モデルに属し、「Thinking」のサフィックスは視覚的およびテキスト入力に対する強化された推論能力を示しています。このモデルはテキスト…

Qwen3 VL 8B Thinkingとは何ですか?

このモデルは誰が使用すべきですか?

どのようなモダリティをサポートしていますか?

'Thinking' バリアントは標準の Qwen3 VL とどのように異なりますか?

コードサンプル

あらゆる SDK から呼び出し

OpenAI 互換——今お使いの SDK のまま

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

対応パラメータ

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

料金

入力 / 1M tokens$0.180
出力 / 1M tokens$2.10
通貨USD

料金計算ツール

月間トークン数10MM
入力の割合70%%
月額見積もり $7.56

表示価格に基づく概算

トークン・コスト見積もり

入力トークン: 8リクエストあたりのコスト: $0.001051

見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。

パフォーマンス

p50 TTFT
7.50 s
出力速度
916 tok/s
p95 TTFT
10.00 s
エラー率
0%

公開ベンチマーク

ソース: Design Arena

比較

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
入力 $/100万$0.18$0.86$0.17$0.12
出力 $/100万$2.10$3.44$1.03$0.69
コンテキスト131K262K33K1.0M
品質4/108/108/108/10
並べて比較並べて比較並べて比較並べて比較

よくある質問

Qwen3 VL 8B ThinkingのOrcaRouterにおける百万トークンあたりのコストはいくらですか?
入力トークン: $0.18 / 100万トークン。出力トークン: $2.10 / 100万トークン。これらはプロバイダーのレートであり、マークアップなしでそのまま適用されています。
コンテキストウィンドウと最大出力トークン数は何ですか?
コンテキストウィンドウは131,072トークンです。最大出力トークンは40,960トークンです。
このモデルの主な強みは何ですか?
これは3つの入力モダリティ(テキスト、画像、ビデオ)を扱い、大きなコンテキストと出力長を提供し、複雑な推論タスクのパフォーマンスを向上させる思考(チェーン・オブ・ソート)機能を含んでいます。
このモデルはQwen2 VL 7Bと比較してどうですか?
これにはより大きなコンテキスト(131K vs 32K)、より大きな最大出力(40K vs 2K)があり、思考能力を追加します。価格はわずかに高いですが、推論とマルチモーダル理解が向上しています。
OrcaRouter はこのモデルを使用する際にユーザーデータをキャッシュしますか?
OrcaRouterは、プロンプトや画像を保存するキャッシングメカニズムを報告しません。データ処理は標準的なAPIプラクティスに従います。詳細はOrcaRouterのプライバシーポリシーをご確認ください。
このモデルをOpenAI互換のAPI経由で呼び出すにはどうすればよいですか?
POSTリクエストを https://api.orcarouter.ai/v1/chat/completions に送信してください。モデルは "qwen/qwen3-vl-8b-thinking" を指定し、APIキーを使用します。マルチモーダル入力のために、テキストとimage_urlエントリを含むcontent配列を使用してください。
モデルはビデオ入力を処理できますか?
はい、動画は抽出されたフレームを個別のimage_urlエントリとして送信することで受け付けられます。モデルはネイティブなビデオコーデックをサポートしておらず、静的なフレームセットで動作します。
リクエストごとの画像数に制限はありますか?
いいえ、ただしトークンの総数(テキストトークンと画像トークンを含む)は131,072のコンテキスト制限内にある必要があります。画像に対する個別の制限はありません。
OrcaRouterを介してこのモデルにアクセスするには、どのプログラミング言語やライブラリを使用できますか?
HTTPリクエストとOpenAI APIフォーマットをサポートする任意の言語。Pythonとopenaiライブラリ、JavaScriptとfetchなど。ベースURLとモデルIDを設定するだけ。
Does the thinking variant always return chain-of-thought reasoning?
モデルは内部で段階的な推論を行ってから最終的な回答を生成しますが、表示される出力は完全な応答です。中間の思考トークンを個別に抽出することはできません。

このバッジを埋め込む

Qwen: Qwen3 VL 8B Thinking$0.18/M in7500ms p50OrcaRouter 経由
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="OrcaRouter の Qwen: Qwen3 VL 8B Thinking" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

モデルカードをデータで取得

GET /api/public/models/qwen/qwen3-vl-8b-thinking開く