Qwen3-VL 235B-A22B Instruct — modello visione-linguaggio a pesi aperti, 235B totali / 22B parametri attivi, contesto di 256k, nessuna modalità di pensiero.
Qwen3 VL 235B A22B Instruct è una variante vision-language della serie di modelli Qwen3, sviluppata da Alibaba Cloud. Utilizza un'architettura mixture-of-experts con 235 miliardi di parametri totali,…
Il modello eccelle in compiti in cui immagini e testo interagiscono. Può rispondere a domande sul contenuto di un'immagine, descrivere scene in dettaglio, leggere testo da documenti o cartelli e ragionare sulle relazioni tra oggetti in un'immagine. Gestisce anche più immagini in una singola conversazione, consentendo analisi comparative o ragionamento sequenziale. Il tuning delle istruzioni permette al modello di seguire prompt multimodali complessi, come 'Spiega perché questo grafico mostra un trend' o 'Estrai tutti i valori numerici da questa tabella'. Queste capacità derivano dal grande backbone MoE e dall'addestramento specializzato visione-linguaggio.
Essendo una variante Instruct, il modello è stato ottimizzato per seguire le istruzioni degli utenti con alta fedeltà sia in prompt solo testuali che multimodali. Può gestire dialoghi multi-turn in cui le immagini vengono introdotte incrementalmente, mantenere il contesto attraverso diversi scambi e seguire istruzioni di formattazione (ad esempio, output come JSON, elenchi puntati o step-by-step). Si comporta bene in compiti che richiedono aderenza a vincoli, come 'Rispondi solo se l'immagine contiene un cane.' Questo lo rende adatto per applicazioni dove un comportamento coerente e basato su regole è importante.
Per attività solo testuali senza componenti visive, il modello 235B MoE potrebbe essere eccessivo; modelli densi più piccoli o altre varianti Qwen solo testo sarebbero più convenienti. Allo stesso modo, se le tue immagini sono semplici (ad esempio loghi di base, singoli oggetti) o hai bisogno di una produttività estremamente elevata con un budget limitato, un modello di visione più piccolo come Qwen2-VL 7B potrebbe essere sufficiente. Questo modello è più giustificato quando devi gestire immagini complesse e ad alta risoluzione, documenti con testo denso o attività che richiedono un ragionamento multimodale profondo. Su OrcaRouter, puoi confrontare i prezzi e cambiare facilmente gli ID dei modelli.
No. Qwen3 VL 235B A22B Instruct è un modello di generazione di testo che accetta solo immagini come input. Non genera immagini, audio o qualsiasi altra modalità. L'output è sempre una stringa di testo. Se hai bisogno di generazione di immagini, dovresti usare un modello separato. Il punto di forza di questo modello risiede nella comprensione e nel ragionamento sull'input visivo. Può, ad esempio, descrivere l'aspetto di un'immagine o rispondere a domande su di essa, ma non può creare, modificare o trasformare immagini da sé.
Il punteggio MMLU-Pro riportato per questo modello è 82.3. MMLU-Pro è una versione migliorata del benchmark Massive Multitask Language Understanding, che copre 57 materie tra STEM, scienze umane e sociali. Un punteggio di 82.3 indica una solida conoscenza generale e capacità di ragionamento su argomenti diversificati. Si tratta di un'aggregazione in un unico numero; le prestazioni possono variare per singola materia. Questo punteggio colloca il modello tra i migliori nella sua classe dimensionale, specialmente considerando l'architettura MoE che attiva solo una frazione dei suoi parametri totali per ogni richiesta.
I punti di forza includono un'elevata accuratezza nei benchmark di ragionamento multimodale, un forte seguimento delle istruzioni e un'efficienza in termini di costi rispetto ai modelli densi con un numero totale di parametri simile. Il design MoE consente di scalare la capacità senza un costo computazionale proporzionale. Le limitazioni includono un costo assoluto più elevato rispetto ai modelli più piccoli, un potenziale aumento della latenza dovuto al grande numero totale di parametri (anche se solo 22B sono attivi, l'intero modello deve essere caricato in memoria). Può anche occasionalmente allucinare dettagli fini nelle immagini o fallire su input visivi altamente ambigui. Le prestazioni su compiti di dominio specifici (ad esempio, imaging medico) non sono garantite.
La velocità di inferenza dipende dal backend hardware utilizzato da OrcaRouter e dal carico attuale. Essendo un modello MoE con 235 miliardi di parametri totali, richiede memoria GPU significativa anche se solo 22 miliardi di parametri vengono attivati per token. Ciò in genere comporta una latenza per richiesta più elevata rispetto a modelli densi più piccoli (ad esempio, 7B-70B parametri). La capacità di throughput è influenzata anche dalla dimensione del batch e dalla lunghezza della sequenza. Per applicazioni sensibili alla latenza, si consiglia di utilizzare un modello più piccolo o di ottimizzare per prompt più brevi. OrcaRouter non fornisce garanzie di latenza specifiche, ma mira a una reattività di livello produttivo.
OrcaRouter applica esattamente la tariffa indicata dal fornitore: $0.40 per 1 milione di token di input e $1.60 per 1 milione di token di output. Non ci sono margini aggiuntivi. Sia i token di input che quelli di output vengono conteggiati secondo le regole di tokenizzazione di OpenAI, che possono differire leggermente dal tokenizer interno del modello. Anche le immagini vengono fatturate come token in base alle loro dimensioni e al livello di dettaglio, seguendo la politica del fornitore. Puoi stimare i costi moltiplicando il tuo utilizzo previsto di token per queste tariffe.
Il costo per token è più alto rispetto a modelli più piccoli o densi, ma l'architettura MoE offre maggiore capacità per parametro attivo rispetto a un modello denso di dimensioni attive equivalenti. Per attività multimodali complesse, questo modello potrebbe completare l'attività in meno token o con maggiore accuratezza, riducendo potenzialmente la spesa totale. Tuttavia, per attività semplici, un modello più economico ridurrebbe i costi. Su OrcaRouter puoi cambiare modello al volo, consentendoti di usare questo modello solo quando necessario. Non ci sono impegni mensili minimi né costi nascosti.
OrcaRouter non divulga attualmente politiche di caching specifiche per questo modello. Il caching a livello di token può essere applicato dal provider sottostante ma non è garantito. Non vengono menzionati sconti per grandi volumi o prezzi scaglionati; le tariffe sono fisse per token. Per gli utenti con volumi elevati, potrebbe valere la pena contattare il supporto di OrcaRouter per potenziali accordi personalizzati. In generale, i prezzi sono trasparenti e basati sull'utilizzo.
Le immagini vengono convertite in un conteggio di token basato sulla loro risoluzione e impostazione dei dettagli. La formula esatta è definita dal provider (Qwen) e può variare. Tipicamente, immagini a risoluzione più alta consumano più token. OrcaRouter passa attraverso la tokenizzazione del provider senza alterazioni. Puoi controllare i costi ridimensionando le immagini o utilizzando la modalità a bassi dettagli se il modello lo supporta. Fai sempre riferimento alla documentazione del provider per il calcolo preciso dei token delle immagini. I token di input per le immagini vengono conteggiati secondo la tariffa di $0.40 per milione.
Invii una richiesta POST a https://api.orcarouter.ai/v1/chat/completions con un payload JSON compatibile con OpenAI. Imposta il campo model su "qwen/qwen3-vl-235b-a22b-instruct". Includi un array messages in cui ogni messaggio può contenere testo e/o immagini. Per le immagini, utilizza il formato standard dei contenuti immagine di OpenAI (URL o base64). L'autenticazione avviene tramite un token Bearer (la tua chiave API). Parametri esempi: temperature, max_tokens, top_p e sequenze di stop funzionano in modo identico all'API di OpenAI. La documentazione di OrcaRouter fornisce tutti i dettagli.
Tutti i parametri standard dei completamenti chat sono supportati: temperature (0-2, default 1), top_p (0-1, default 1), max_tokens (numero di token di output), stop (lista di stringhe), presence_penalty, frequency_penalty e seed per la riproducibilità. Il modello rispetta anche i messaggi di sistema per impostare il comportamento. Per le richieste multimodali, includi una parte immagine nel contenuto di un messaggio utente. Non sono esposti parametri specifici del modello; l'API è mantenuta generica per la compatibilità. Se hai bisogno di controllare il routing MoE, questo viene gestito internamente.
Sì. Poiché OrcaRouter utilizza il formato API di OpenAI, la migrazione è semplice. Sostituisci il tuo attuale URL di base e l'ID del modello con l'endpoint di OrcaRouter e "qwen/qwen3-vl-235b-a22b-instruct". Assicurati che la tua chiave API sia valida e che tu disponga di crediti sufficienti. Il formato del messaggio per le immagini è identico a quello di OpenAI (utilizzando il tipo di contenuto 'image_url'). Potrebbe essere necessario modificare le stime del conteggio dei token a causa di una tokenizzazione diversa. Non sono richieste modifiche alla logica della tua applicazione oltre all'endpoint e al nome del modello.
Qwen3 VL 235B A22B Instruct e GPT-4V gestiscono entrambi input multimodali. Differenze principali: Qwen3 VL utilizza MoE con 22B parametri attivi, mentre GPT-4V è un modello denso proprietario di dimensioni non divulgate. Il prezzo di Qwen3 VL tramite OrcaRouter è di $0,40/$1,60 per milione di token, significativamente inferiore rispetto alle tariffe tipiche di GPT-4V. I punteggi benchmark non sono direttamente confrontabili perché MMLU-Pro e altri test usano subset diversi. GPT-4V ha un supporto ecosistemico più ampio, ma Qwen3 VL offre un vantaggio in termini di costi per carichi di lavoro multimodali ad alto volume su OrcaRouter.
Claude 3.5 Sonnet è un modello denso di Anthropic con forti capacità testuali e visive. Non utilizza MoE, quindi la sua capacità totale è inferiore ai parametri totali di Qwen3 VL, ma la sua capacità attiva per inferenza è superiore a 22B. Il prezzo per Claude 3.5 Sonnet è generalmente più alto per token (circa $3.00/$15.00 per milione di token). Qwen3 VL offre un costo molto più basso per attività multimodali. Tuttavia, i modelli Claude hanno una finestra di contesto più ampia (200K token). La scelta dipende dal budget, dalle esigenze di lunghezza del contesto e dal provider preferito.
OrcaRouter probabilmente offre altri modelli Qwen come Qwen2.5 7B, Qwen2.5 72B o varianti Qwen2-VL. Il Qwen3 VL 235B A22B Instruct è il più grande modello multimodale MoE della gamma Qwen. Rispetto a Qwen2-VL 72B, ha più parametri totali e un'architettura MoE, che può offrire prestazioni migliori in compiti complessi mantenendo un costo di inferenza ragionevole. È più costoso per token rispetto ai modelli Qwen più piccoli, ma potrebbe essere conveniente se riduce la necessità di chiamate multiple o di un elevato consumo di token.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Input / 1M token | $0.400 |
| Output / 1M token | $1.60 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructApri @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct