Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
VisioneStrumentiJSONRagionamento
di Qwen · 2025-10-14

Qwen3-VL 8B Thinking — modello di ragionamento visione-linguaggio piccolo con pesi aperti, 8B parametri, contesto 128k.

ctx131.1K token
Output max41K
Inputtext + image + video
Outputtext
p50 TTFT7.50 s
INGRESSO$0.18/ 1M token
USCITA$2.10/ 1M token
p50 TTFT7.50 s7 g
p95 TTFT10.00 s7 g
TRAFFICO14.3Ktoken / 7 g

Qwen3 VL 8B Thinking è un modello linguistico multimodale da 8 miliardi di parametri sviluppato dal team Qwen di Alibaba Cloud, ospitato su OrcaRouter sotto il fornitore qwen. Appartiene alla…

Cos'è Qwen3 VL 8B Thinking?

Chi dovrebbe usare questo modello?

Quali modalità supporta?

In che modo la variante 'Thinking' differisce dalla Qwen3 VL standard?

Esempi di codice

Chiama da qualsiasi SDK

Compatibile con OpenAI: mantieni il tuo SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parametri supportati

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Prezzi

Input / 1M token$0.180
Output / 1M token$2.10
ValutaUSD

Calcolatore dei costi

Token / mese10MM
Quota di input70%%
Stimato / mese $7.56

Stima basata sul prezzo di listino

Stima di token e costo

Token di input: 17Costo per richiesta: $0.001053

Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.

Prestazioni

p50 TTFT
7.50 s
Velocità di output
916 tok/s
p95 TTFT
10.00 s
Tasso di errore
0%

Benchmark pubblici

Fonte: Design Arena

A confronto

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Input $/M$0.18$0.86$0.17$0.12
Output $/M$2.10$3.44$1.03$0.69
Contesto131K262K33K1.0M
Qualità4/108/108/108/10
Confronta affiancatiConfronta affiancatiConfronta affiancatiConfronta affiancati

FAQ

Qual è il costo per milione di token per Qwen3 VL 8B Thinking su OrcaRouter?
Token di input: $0,18 per 1 milione di token. Token di output: $2,10 per 1 milione di token. Queste sono le tariffe del fornitore applicate senza alcun ricarico.
Qual è la finestra di contesto e il numero massimo di token di output?
La finestra di contesto è di 131,072 token. Il massimo output di token è di 40,960 token.
Quali sono i principali punti di forza di questo modello?
Gestisce tre modalità di input (testo, immagine, video), offre un contesto ampio e una lunghezza di output elevata, e include una capacità di pensiero (chain-of-thought) che migliora le prestazioni in compiti di ragionamento complessi.
Come si confronta questo modello con Qwen2 VL 7B?
Ha un contesto più ampio (131K vs 32K), un output massimo più grande (40K vs 2K) e aggiunge capacità di pensiero. Il prezzo è leggermente più alto, ma offre un ragionamento migliorato e una comprensione multimodale.
OrcaRouter memorizza nella cache dati utente quando si utilizza questo modello?
OrcaRouter non segnala alcun meccanismo di caching che memorizzi prompt o immagini; la gestione dei dati segue le pratiche API standard. Consulta l'informativa sulla privacy di OrcaRouter per i dettagli.
Come posso chiamare questo modello tramite un'API compatibile con OpenAI?
Invia una POST a https://api.orcarouter.ai/v1/chat/completions con il modello "qwen/qwen3-vl-8b-thinking" e la tua chiave API. Utilizza un array di contenuti con voci text e image_url per input multimodale.
Il modello può elaborare input video?
Sì, il video è accettato inviando fotogrammi estratti come voci image_url separate. Il modello non ha supporto nativo per i codec video; funziona su set di fotogrammi statici.
C'è qualche restrizione sul numero di immagini per richiesta?
No, tranne per il fatto che il conteggio totale dei token (inclusi i token di testo e immagine) deve essere entro il limite di contesto di 131.072. Non esiste un limite separato per le immagini.
Quali linguaggi di programmazione o librerie posso usare per accedere a questo modello tramite OrcaRouter?
Qualsiasi linguaggio che supporti le richieste HTTP e il formato API di OpenAI. Python con la libreria openai, JavaScript con fetch, ecc. Basta impostare l'URL di base e l'ID del modello.
La variante di pensiero restituisce sempre un ragionamento a catena di pensiero?
Il modello utilizza internamente un ragionamento passo-passo prima di generare la risposta finale, ma l'output che vedi è la risposta completa. Non è possibile estrarre separatamente i token di pensiero intermedi.

Incorpora questo badge

Qwen: Qwen3 VL 8B Thinking$0.18/M in7500ms p50tramite OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking su OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Scheda del modello come dati

GET /api/public/models/qwen/qwen3-vl-8b-thinkingApri
Leggibile dalle macchine:/llms.txt/llms-full.txt