Qwen3-VL 8B Thinking — modello di ragionamento visione-linguaggio piccolo con pesi aperti, 8B parametri, contesto 128k.
Qwen3 VL 8B Thinking è un modello linguistico multimodale da 8 miliardi di parametri sviluppato dal team Qwen di Alibaba Cloud, ospitato su OrcaRouter sotto il fornitore qwen. Appartiene alla…
Qwen3 VL 8B Thinking eccelle nel rispondere a domande visive, specialmente quando la domanda coinvolge più oggetti, relazioni spaziali o testo incorporato nelle immagini (es. cartelli stradali, ricevute). Può anche gestire attività di comprensione video, come riassumere un breve clip, identificare azioni o rispondere a domande su timestamp specifici. L'analisi dei documenti è un caso d'uso forte: estrarre informazioni da PDF che contengono sia testo che grafici, o da moduli scansionati. La sua lunga finestra di contesto lo rende adatto per elaborare documenti di grandi dimensioni (es. PDF con oltre 100 pagine) con occasionali inserimenti di immagini, purché l'input tokenizzato totale rimanga sotto 131K.
Se il tuo caso d'uso è puramente testuale e non coinvolge immagini o video, un modello dedicato solo al testo (ad esempio, Qwen3-8B o una variante Llama di dimensioni simili) sarà probabilmente più economico. I modelli multimodali comportano un overhead aggiuntivo per la codifica degli input visivi, e il prezzo per token di Qwen3 VL 8B Thinking ($0,18 input, $2,10 output per milione di token) può essere più alto rispetto a molte alternative solo testo. Inoltre, se il tuo compito è una semplice classificazione o estrazione da immagini molto brevi, un modello visione-linguaggio più piccolo con latenza e costo inferiori (ad esempio, Qwen2 VL 2B) potrebbe essere sufficiente senza sacrificare le prestazioni.
Sì, il modello può accettare più immagini alternate a testo in una singola chiamata API, purché il numero totale di token (token delle immagini più token di testo) rimanga entro la finestra di contesto di 131.072 token. Ogni immagine viene codificata in un numero variabile di token in base alla sua risoluzione e complessità. L'API compatibile con OpenAI di OrcaRouter ti consente di inviare più URL di immagini o immagini codificate in base64 nell'array dei contenuti. Non esiste un limite rigoroso al numero di immagini oltre al vincolo di contesto. Per i video, in genere si estraggono i fotogrammi chiave e li si inviano come immagini separate insieme a un prompt di testo.
Come tutti i modelli multimodali, Qwen3 VL 8B Thinking può allucinare dettagli in immagini o video, specialmente con bassa risoluzione o contenuti ambigui. Non è progettato per lo streaming video in tempo reale; elabora set statici di fotogrammi. La dimensione di 8B parametri significa che potrebbe essere meno accurato in domini altamente specializzati (ad es., imaging medico, immagini satellitari) rispetto a modelli più grandi (ad es., modelli visione-linguaggio da 70B-100B+). Non supporta l'input audio. Il processo di pensiero può gonfiare la lunghezza dell'output, quindi pianifica i token di output di conseguenza. Infine, è ottimizzato per l'inglese ma può gestire altre lingue con efficacia variabile.
I punteggi benchmark specifici per Qwen3 VL 8B Thinking nelle valutazioni multimodali standard (es. MMMU, MathVista, VideoMME) non sono stati forniti nei fatti disponibili. Gli utenti dovrebbero consultare la scheda ufficiale del modello Qwen o il documento di ricerca per eventuali risultati pubblicati. In generale, la serie Qwen3 VL ha mostrato prestazioni competitive nei compiti di visione-linguaggio rispetto ad altri modelli con parametri 7B-8B. La variante "Thinking" dovrebbe migliorare i benchmark ad alto carico di ragionamento come visual chain-of-thought. In assenza di punteggi pubblici, è consigliabile testare il modello sul proprio set di dati rappresentativo per valutarne l'idoneità.
I dati di latenza per questo modello specifico sull'infrastruttura di OrcaRouter non sono stati divulgati. Come regola generale, un modello multimodale con 8B parametri avrà una latenza maggiore rispetto a un modello di solo testo della stessa dimensione a causa della codifica visiva. L'input video aumenta ulteriormente la latenza a causa dell'elaborazione aggiuntiva dei fotogrammi. Su cluster GPU ad alte prestazioni (ad es., A100, H100), il tempo tipico per il primo token per un modello 8B è nell'ordine di qualche centinaio di millisecondi fino a pochi secondi, a seconda della lunghezza dell'input e della dimensione del batch. La velocità di generazione dei token di output è solitamente misurata in decine di token al secondo. Questi valori sono qualitativi; le prestazioni effettive dipendono dal provisioning e dal carico attuali di OrcaRouter.
Punti di forza: Il modello gestisce contesti multimodali lunghi (131K token), permette output grandi (fino a 40K token) e processa tre tipi di input. La sua capacità di ragionamento migliora il ragionamento in compiti che richiedono deduzione passo dopo passo. È prezzato in modo competitivo per un modello multimodale da 8B. Limitazioni: Non è stato confrontato con i modelli frontier più recenti su molte classifiche pubbliche. Il suo throughput massimo di output potrebbe essere inferiore rispetto a modelli più piccoli. Non è ottimizzato per la generazione creativa di immagini (produce solo testo). Gli utenti non dovrebbero presupporre l'assenza di allucinazioni nei compiti visivi. L'elaborazione video è limitata all'estrazione basata su fotogrammi anziché all'analisi continua.
Qwen3 VL 8B Thinking viene fatturato per token secondo la tariffa del provider senza markup. I token di input costano $0,18 per 1 milione di token. I token di output costano $2,10 per 1 milione di token. Non ci sono costi aggiuntivi per infrastruttura, nessun costo base per richiesta e nessun abbonamento mensile. La tariffa si applica ugualmente a tutte le modalità di input (testo, immagine, video); ogni modalità viene tokenizzata e addebitata alla tariffa di input. OrcaRouter non applica alcun sovrapprezzo rispetto alla tariffa indicata. Ad esempio, elaborare un'immagine che si tokenizza in 2.000 token di input costerebbe 2.000 * ($0,18 / 1M) = $0,00036 in costo di input. Il costo di output viene calcolato allo stesso modo.
Ogni immagine viene codificata in un numero variabile di token in base alle sue dimensioni e al livello di compressione. Le immagini ad alta risoluzione possono consumare migliaia di token. I video vengono gestiti estraendo fotogrammi (tipicamente un fotogramma ogni pochi secondi) e codificando ciascun fotogramma come un'immagine; quindi il costo in token scala linearmente con la durata del video e la frequenza dei fotogrammi. Gli utenti possono controllare il costo ridimensionando le immagini o riducendo il numero di fotogrammi. Non esiste una tariffa separata per la codifica dei media oltre al costo dei token. Il costo di output dipende solo dal numero di token di testo generati. Per video lunghi, i token di input possono avvicinarsi rapidamente al limite di 131K, aumentando il costo per richiesta.
In base alle informazioni fornite, non sono previsti sconti per l'uso batch o impegni prepagati. Al momento OrcaRouter non offre memorizzazione nella cache dei token che ridurrebbe i costi per prompt o immagini ripetuti. Tutte le richieste vengono fatturate per token in tempo reale alla tariffa standard. Se il provider (qwen) introdurrà in futuro una tariffazione a livelli scontati, OrcaRouter trasferirà tali risparmi senza alcun ricarico. Si consiglia agli utenti di monitorare la pagina dei prezzi di OrcaRouter per eventuali aggiornamenti. Per casi d'uso ad alto volume, si consiglia di contattare direttamente OrcaRouter per discutere potenziali prezzi basati sul volume.
Rispetto ai modelli multimodali più grandi (e.g., GPT-4V, Gemini 1.5 Pro), Qwen3 VL 8B Thinking è significativamente più economico per token: quei modelli spesso costano $2–$10+ per milione di token in input. Tra i modelli visione-linguaggio con parametri da 7B-8B, è in linea con i prezzi tipici (Qwen2 VL 7B costa circa $0.10–$0.20 in input, $1–$2 in output). Il costo per token in output ($2.10 per milione) è superiore a quello di alcuni modelli puramente testuali da 8B (e.g., $0.20 per milione in output), riflettendo il sovraccarico di ragionamento aggiunto. Se si può utilizzare un modello più piccolo (e.g., parametri 2B–4B), i costi possono essere inferiori del 50–90%, ma con capacità ridotta.
Chiami Qwen3 VL 8B Thinking inviando una richiesta POST all'endpoint compatibile con OpenAI di OrcaRouter all'indirizzo https://api.orcarouter.ai/v1/chat/completions. Imposta il parametro model su "qwen/qwen3-vl-8b-thinking". Includi la tua chiave API nell'intestazione Authorization come "Bearer <key>". Il corpo della richiesta segue lo schema delle chat completions di OpenAI. Per input multimodali, struttura il contenuto del messaggio come un array di oggetti: uno con type "text" per il prompt testuale e uno con type "image_url" per ogni immagine (con un URL o dati in base64). I video possono essere inviati come più voci image_url che rappresentano fotogrammi. La risposta segue la struttura standard di OpenAI con tutto il testo generato nell'array choices.
Tutti i parametri standard di completamento chat OpenAI sono supportati: temperature (0–2, default 1.0), top_p (0–1, default 1.0), max_tokens (fino a 40960), sequenze di stop, frequency_penalty, presence_penalty, logprobs e n (numero di completamenti). Il modello non supporta lo streaming? OrcaRouter probabilmente supporta lo streaming quando streaming=true è impostato; consultare la documentazione del provider. Il parametro tools (chiamata di funzione) potrebbe essere supportato se il provider sottostante lo attiva; al momento non è garantito. Il prompt di sistema è consentito. Gli ID utente possono essere passati per il monitoraggio. Assicurati di rimanere entro la finestra di contesto di 131072 token monitorando il conteggio dei token prima dell'invio.
Se stai attualmente utilizzando lo stesso modello da un diverso provider API (ad esempio, direttamente da Alibaba Cloud), la migrazione a OrcaRouter è semplice: cambia l'URL di base in https://api.orcarouter.ai/v1, aggiorna la stringa del modello a "qwen/qwen3-vl-8b-thinking", e sostituisci la chiave API con una chiave API di OrcaRouter. Non sono necessarie altre modifiche al codice perché OrcaRouter utilizza la stessa identica interfaccia compatibile con OpenAI. Tieni presente che l'utilizzo dei token e i prezzi saranno basati sulle tariffe di OrcaRouter (che vengono trasmesse senza alcun ricarico). Potrebbe essere necessario regolare i tuoi strumenti di monitoraggio dei costi per riflettere i nuovi prezzi.
Lo streaming è disponibile tramite l'API di OrcaRouter. Imposta il parametro stream su true nella tua richiesta. La risposta sarà un flusso Server-Sent Events (SSE) con i delta dei token generati. Questo è utile per la visualizzazione in tempo reale. Nota che per la variante "Thinking", il processo di pensiero può introdurre ritardi più lunghi prima del primo token, ma lo streaming invierà comunque i token incrementali man mano che vengono prodotti. Il formato del flusso segue le specifiche di streaming di OpenAI, con eventi di tipo "chat.completion.chunk". Ogni chunk contiene un delta con il contenuto o il ruolo del token.
Qwen3 VL 8B Thinking è il successore di Qwen2 VL 7B, con all'incirca lo stesso numero di parametri (8B vs 7B) ma un'architettura migliorata per un contesto più lungo (131K vs 32K per Qwen2 VL 7B). Aggiunge anche la capacità "Thinking" per il ragionamento passo-passo, che non era presente in Qwen2 VL. La lunghezza massima dell'output è aumentata da 2048 token (Qwen2 VL 7B) a 40960 token. Il prezzo per Qwen3 VL 8B Thinking è leggermente più alto per token rispetto a Qwen2 VL 7B (che costa circa $0.15 per input, $1.80 per output per milione di token), riflettendo le capacità aggiunte e il contesto più ampio. Gli utenti che effettuano l'upgrade dovrebbero aspettarsi prestazioni migliori su compiti di ragionamento complessi.
GPT-4o mini è un modello multimodale di punta di OpenAI con una finestra di contesto di 128K. Ha significativamente più parametri (sconosciuti, ma stimati >70B) e generalmente raggiunge una maggiore precisione nei benchmark standard. Tuttavia, Qwen3 VL 8B Thinking è sostanzialmente più economico: GPT-4o mini costa $0,15 per milione di token in input e $0,60 per milione di token in output, che in realtà è inferiore rispetto a $0,18 in input e $2,10 in output di Qwen3? Aspetta, controlla: l'input di GPT-4o mini è $0,15, l'output $0,60 — più economico di Qwen3 VL 8B Thinking? In realtà l'output è molto più economico. Quindi il costo non è inferiore su tutti i fronti. Ma Qwen3 supporta video e output più lunghi (40960 contro 16384 per GPT-4o mini). Le finestre di contesto sono simili. La scelta dipende dalla precisione richiesta e dal budget; Qwen3 è di nicchia per output molto lunghi e distribuzione open-source.
Llama 3.2 11B Vision è un modello multimodale da 11B parametri con una finestra di contesto di 128K e un massimo di 8K token di output. Qwen3 VL 8B Thinking ha un numero di parametri inferiore ma un output massimo molto più grande (40960 vs 8000) e include capacità di pensiero. Entrambi supportano input di testo e immagini, ma Llama 3.2 11B non supporta nativamente il video. Il prezzo di Llama tramite provider è simile, circa $0.15–$0.20 per input, $0.60–$1.00 per output per milione di token, rendendo Qwen3 più costoso in output. Per attività che richiedono testo generato molto lungo (ad esempio, scrittura di report da video), Qwen3 è più adatto. Per attività più brevi e sensibili ai costi, Llama 3.2 11B potrebbe essere preferibile.
Gemini 1.5 Flash è un modello multimodale veloce ed economico con una finestra di contesto di 1M (fino a 2M), che supporta immagini, video e audio. È più economico di Qwen3 VL 8B Thinking (Gemini Flash costa $0.075 per input, $0.30 per output per milione di token) e più veloce. Tuttavia, Qwen3 VL 8B Thinking offre un processo di pensiero che può migliorare il ragionamento su compiti visivi impegnativi, e il suo output massimo è molto più grande (40K vs 8K per Gemini Flash). Se la tua applicazione richiede un ragionamento passo-passo e output lunghi, Qwen3 è una scelta migliore. Per alta produttività e bassa latenza, Gemini Flash è tipicamente superiore. Inoltre, Qwen3 potrebbe essere preferito quando la sovranità dei dati richiede un'installazione self-hosted o indipendente dal fornitore.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Input / 1M token | $0.180 |
| Output / 1M token | $2.10 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/qwen/qwen3-vl-8b-thinkingApri @misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking