Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
VisionToolsJSONReasoning
von Qwen · 2025-10-14

Qwen3-VL 8B Thinking – Open-Weight, kleines Vision-Language-Reasoning-Modell, 8B Parameter, 128k Kontext.

Ktx131.1K Tokens
Max. Ausgabe41K
Eingabetext + image + video
Ausgabetext
p50 TTFT5.00 s
EINGABE$0.18/ 1M Tokens
AUSGABE$2.10/ 1M Tokens
p50 TTFT5.00 s7 T
p95 TTFT8.55 s7 T
DATENVERKEHR108.8KTokens / 7 T

Qwen3 VL 8B Thinking ist ein multimodales Sprachmodell mit 8 Milliarden Parametern, entwickelt vom Qwen-Team bei Alibaba Cloud, gehostet auf OrcaRouter unter dem Anbieter qwen. Es gehört zur…

Was ist Qwen3 VL 8B Thinking?

Wer sollte dieses Modell verwenden?

Welche Modalitäten unterstützt es?

Wie unterscheidet sich die 'Thinking'-Variante vom Standard-Qwen3 VL?

Code-Beispiele

Aus jedem SDK aufrufen

OpenAI-kompatibel — behalte dein bisheriges SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Unterstützte Parameter

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Preise

Eingabe / 1M Tokens$0.180
Ausgabe / 1M Tokens$2.10
WährungUSD

Kostenrechner

Tokens / Monat10MM
Eingabeanteil70%%
Geschätzt / Monat $7.56

Schätzung auf Basis des Listenpreises

Token- und Kostenschätzer

Eingabe-Tokens: 27Kosten pro Anfrage: $0.001055

Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.

Leistung

p50 TTFT
5.00 s
Ausgabegeschwindigkeit
64.6 tok/s
p95 TTFT
8.55 s
Fehlerquote
0%

Öffentliche Benchmarks

Quelle: Design Arena

Im Vergleich

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Eingabe $/M$0.18$0.86$0.17$0.12
Ausgabe $/M$2.10$3.44$1.03$0.69
Kontext131K262K33K1.0M
Qualität4/108/108/108/10
Nebeneinander vergleichenNebeneinander vergleichenNebeneinander vergleichenNebeneinander vergleichen

FAQ

Was sind die Kosten pro Million Tokens für Qwen3 VL 8B Thinking auf OrcaRouter?
Input-Token: 0,18 $ pro 1 Million Token. Output-Token: 2,10 $ pro 1 Million Token. Dies sind die Tarife des Anbieters, die ohne Aufschlag weitergegeben werden.
Was ist das Kontextfenster und die maximale Anzahl von Ausgabe-Token?
Das Kontextfenster umfasst 131.072 Tokens. Die maximale Anzahl von Ausgabetokens beträgt 40.960 Tokens.
Was sind die Hauptstärken dieses Modells?
Es verarbeitet drei Eingabemodalitäten (Text, Bild, Video), bietet eine große Kontext- und Ausgabelänge und beinhaltet eine Denkfähigkeit (Chain-of-Thought), die die Leistung bei komplexen Denkaufgaben verbessert.
Wie schneidet dieses Modell im Vergleich zu Qwen2 VL 7B ab?
Es hat einen größeren Kontextbereich (131K vs 32K), eine größere maximale Ausgabe (40K vs 2K) und fügt Denkfähigkeiten hinzu. Die Preise sind etwas höher, bieten aber verbessertes logisches Denken und multimodales Verständnis.
Zwischenspeichert OrcaRouter Benutzerdaten bei der Nutzung dieses Modells?
OrcaRouter meldet keinen Caching-Mechanismus, der Prompts oder Bilder speichert; die Datenverarbeitung folgt den Standard-API-Praktiken. Konsultieren Sie die Datenschutzrichtlinie von OrcaRouter für Details.
Wie rufe ich dieses Modell über eine OpenAI-kompatible API auf?
Senden Sie eine POST-Anfrage an https://api.orcarouter.ai/v1/chat/completions mit dem Modell "qwen/qwen3-vl-8b-thinking" und Ihrem API-Schlüssel. Verwenden Sie ein Content-Array mit text- und image_url-Einträgen für multimodale Eingabe.
Kann das Modell Videoeingaben verarbeiten?
Ja, Video wird akzeptiert, indem extrahierte Frames als separate image_url-Einträge gesendet werden. Das Modell hat keine native Unterstützung für Video-Codecs; es arbeitet mit statischen Framesets.
Gibt es eine Begrenzung der Anzahl der Bilder pro Anfrage?
Nein, außer dass die Gesamtzahl der Token (einschließlich Text- und Bild-Token) innerhalb des 131,072 Kontextlimits liegen muss. Es gibt kein separates Bildlimit.
Welche Programmiersprachen oder Bibliotheken kann ich verwenden, um über OrcaRouter auf dieses Modell zuzugreifen?
Jede Sprache, die HTTP-Anfragen und das OpenAI-API-Format unterstützt. Python mit der openai-Bibliothek, JavaScript mit fetch usw. Legen Sie einfach die Basis-URL und die Modell-ID fest.
Liefert die Denkvariante immer eine Schritt-für-Schritt-Begründung?
Das Modell verwendet intern eine schrittweise Argumentation, bevor es die endgültige Antwort generiert, aber die Ausgabe, die Sie sehen, ist die vollständige Antwort. Sie können die Zwischen-Denk-Tokens nicht separat extrahieren.

Dieses Abzeichen einbetten

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking auf OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Modellkarte als Daten

GET /api/public/models/qwen/qwen3-vl-8b-thinkingÖffnen
Maschinenlesbar:/llms.txt/llms-full.txt