Qwen3.5 Flash — chat multimodale (testo/immagine/video) ottimizzata per i costi, contesto da 1M.
Qwen3.5 Flash è un modello linguistico multimodale della famiglia Qwen, progettato per inferenza veloce e basso costo. Accetta input di testo, immagini e video e genera risposte testuali. La sua…
Qwen3.5 Flash accetta input di testo, immagini (incluse più immagini per richiesta) e video. Per il video, il modello può elaborare fotogrammi o interi file video fino al limite del contesto. Elabora queste modalità insieme in una singola chiamata API, consentendo attività come descrivere una scena video, rispondere a domande su un'immagine o combinare istruzioni testuali con contenuti visivi. La durata esatta del video supportata dipende dall'estrazione dei fotogrammi e dal budget di token all'interno della finestra di contesto di 1M.
Il modello eccelle in compiti che richiedono un ampio contesto e input multimodale. Esempi includono la sintesi di lunghi trascritti video, l'estrazione di dati strutturati da documenti scansionati con immagini e la creazione di agenti conversazionali che fanno riferimento al contesto visivo. È anche efficace per l'elaborazione batch ad alto throughput, dove il basso costo per token (specialmente in input) lo rende economico per milioni di query. Per compiti semplici di solo testo, un modello più economico solo testo potrebbe essere ancora più conveniente.
Per attività puramente testuali che non richiedono capacità multimodali, un modello più piccolo o solo testuale con un prezzo inferiore potrebbe essere più conveniente. Il punto di forza di Qwen3.5 Flash risiede nelle sue abilità multimodali e di contesto lungo; se la tua applicazione necessita solo di brevi completamenti di testo, modelli come text-davinci o varianti più piccole di Qwen potrebbero far risparmiare denaro. Allo stesso modo, se non hai bisogno dell'intero contesto da 1M, un modello con una finestra più piccola potrebbe ridurre latenza e costi.
La designazione 'Flash' indica che questo modello sacrifica una certa precisione nei benchmark a favore di inferenza più rapida e minor costo computazionale. Rispetto ai modelli più grandi di Qwen (ad esempio, Qwen3.5-72B), utilizza un'architettura più efficiente con meno parametri. I punteggi dei benchmark sono pubblicati da Qwen ma non sono forniti in questa voce del catalogo. In pratica, si comporta in modo competitivo nei compiti di comprensione multimodale, mantenendo una latenza inferiore per richiesta, rendendolo adatto per applicazioni in tempo reale.
La latenza dipende dalla dimensione dell'input, dalla lunghezza dell'output e dal carico del server. Poiché Qwen3.5 Flash è progettato per la velocità, generalmente restituisce risposte più velocemente rispetto a modelli più grandi come Qwen3.5-72B per conteggi di token equivalenti. I valori esatti di token al secondo non sono forniti nel catalogo. Gli utenti possono testare le prestazioni tramite l'endpoint di OrcaRouter per misurare la latenza reale per il loro caso d'uso specifico. La finestra di contesto da 1M potrebbe introdurre un sovraccarico di elaborazione per input molto lunghi.
I punti di forza includono input multimodale, contesto molto ampio, 65K token di output e basso costo per token. Il modello gestisce bene documenti lunghi e video. Limitazioni: non è il più accurato in compiti di ragionamento complesso o matematica rispetto a modelli frontier più grandi. Potrebbe anche avere difficoltà con istruzioni sfumate a più passaggi. Per attività in cui la qualità dell'output all'avanguardia è fondamentale, considera un modello più grande della classe Qwen o GPT-4o. L'architettura 'Flash' dà priorità a throughput e costo rispetto alla precisione di punta.
Il prezzo è di $0.10 per 1 milione di token di input (token di testo, immagini o video) e $0.40 per 1 milione di token di output. Queste tariffe vengono addebitate al costo del fornitore senza alcun margine da parte di OrcaRouter. Non ci sono costi aggiuntivi per il gateway API. Questo prezzo viene trasferito direttamente, il che significa che l'utente finale paga lo stesso prezzo che pagherebbe chiamando l'API del fornitore stesso, senza alcun sovrapprezzo di OrcaRouter. Il conteggio dei token segue la tokenizzazione standard per ciascuna modalità.
Il prezzo per token di input ($0.10/1M) è molto competitivo tra i modelli multimodali. Ad esempio, molti grandi modelli multimodali addebitano $2-10 per milione di token di input. Anche il prezzo di output ($0.40/1M) è basso. Tuttavia, poiché il modello ha una finestra di contesto di 1M, l'elaborazione di input molto lunghi può comportare un costo totale elevato nonostante il basso tasso per token. Gli utenti dovrebbero bilanciare la lunghezza del contesto con il numero di richieste. Per input brevi, modelli più piccoli possono offrire un costo assoluto ancora più basso.
La voce del catalogo non specifica se la memorizzazione nella cache è disponibile per Qwen3.5 Flash su OrcaRouter. Gli utenti dovrebbero consultare la documentazione di OrcaRouter per i dettagli sulle funzionalità di caching delle richieste o delle risposte. Se la cache non è supportata, input identici ripetuti comporteranno il costo completo dei token ogni volta. Per l'elaborazione batch, si consiglia di deduplicare gli input o utilizzare una cache locale per ridurre le chiamate API. Il prezzo rimane alle tariffe del fornitore senza markup, indipendentemente dallo stato della cache.
Utilizza l'endpoint compatibile con OpenAI all'indirizzo https://api.orcarouter.ai/v1. Imposta il parametro model su "qwen/qwen3.5-flash" nella tua richiesta. Fornisci una chiave API da OrcaRouter. Il formato della richiesta corrisponde all'API di chat completions di OpenAI, supportando i ruoli (system, user, assistant) e contenuti multimodali tramite l'array "content" con "type": "image_url" o "type": "text". Per il video, potrebbe essere necessario estrarre i fotogrammi e passarli come immagini. Fai riferimento alla documentazione di OrcaRouter per le linee guida esatte sulla gestione dei video.
Parametri standard compatibili con OpenAI: temperature, top_p, max_tokens (fino a 65536), stop sequences, presence_penalty, frequency_penalty e seed. Il parametro max_tokens è limitato a 65536 per corrispondere all'output massimo del modello. Il modello supporta lo streaming tramite stream: true. È anche possibile impostare ID utente per il tracciamento. Per richieste multimodali, includere il contenuto immagine o video all'interno del messaggio utente. Il modello accetta fino alla finestra di contesto di 1.048.576 token in totale tra tutti i turni.
Se già utilizzi l'SDK Python di OpenAI, cambia l'URL di base in https://api.orcarouter.ai/v1 e aggiorna il nome del modello in "qwen/qwen3.5-flash". L'autenticazione utilizza una chiave API di OrcaRouter invece di una chiave OpenAI. Le strutture delle richieste e delle risposte sono identiche. Per la migrazione da altri provider, usa il formato chat completions. Assicurati che i tuoi system prompt e i contenuti multimodali siano formattati secondo le convenzioni di OpenAI. Non sono necessarie modifiche al codice oltre all'endpoint e al nome del modello.
Sì, l'API OrcaRouter supporta messaggi di sistema, messaggi utente e messaggi assistente in conversazioni a più turni. La cronologia completa della conversazione viene conteggiata nella finestra di contesto di 1,048,576 token. Il modello elabora contenuti multimodali nei messaggi utente. Per i video, puoi inviare più fotogrammi come immagini in un singolo messaggio utente. Il modello mantiene il contesto tra i turni, consentendo interazioni estese con lunghe cronologie, purché il totale dei token rimanga al di sotto del limite.
Qwen3.5 Flash è un'alternativa più piccola, più veloce e più economica rispetto ai modelli Qwen più grandi come Qwen3.5-72B o Qwen3.5-32B. Sacrifica una certa accuratezza nei benchmark per una latenza e un costo inferiori. Condivide lo stesso supporto per input multimodali e l'ampio contesto (1M) dei suoi fratelli più grandi. Per compiti che richiedono un ragionamento all'avanguardia, si preferiscono i modelli più grandi. Per applicazioni ad alto volume o in tempo reale dove velocità e costo sono più importanti, Flash è la scelta migliore.
GPT-4o offre una maggiore accuratezza in molti benchmark di ragionamento e multimodali, ma a un prezzo significativamente più alto (tipicamente $2.50 per milione di token di input per GPT-4o e $0.15 per GPT-4o mini). Qwen3.5 Flash è più economico ($0.10 input) e ha una finestra di contesto più grande (1M vs 128K per GPT-4o). Il suo limite di token di output (65K) supera anche GPT-4o mini (16K). Per applicazioni sensibili ai costi con input molto lunghi, Qwen3.5 Flash potrebbe essere più economico pur offrendo una buona comprensione multimodale.
Claude 3 Haiku e Gemini 1.5 Flash sono modelli 'flash' simili. Claude 3 Haiku è solo testo e ha un prezzo di $0,25 per milione di token in input. Gemini 1.5 Flash supporta input multimodale e ha una finestra di contesto di 1M, con un prezzo di $0,075 per milione di token in input. Il supporto multimodale di Qwen3.5 Flash e la finestra di contesto di 1M lo collocano in una fascia simile, con un prezzo di output ($0,40/1M) superiore a Gemini Flash ($0,30/1M) ma inferiore a Haiku ($1,25/1M). Le prestazioni nei benchmark variano a seconda del compito.
OrcaRouter ospita modelli open-source come Llama 3.1 8B e Mistral 7B. Qwen3.5 Flash è un modello proprietario, ma compete in termini di costo e capacità. I modelli open-source hanno spesso un costo per token inferiore o nullo (si paga solo per il calcolo), ma potrebbero richiedere più ingegnerizzazione per essere configurati. Qwen3.5 Flash offre un'API gestita con margine zero, una finestra di contesto di 1M e supporto multimodale che la maggior parte dei modelli open-source non ha. È un buon compromesso tra flessibilità open-source e qualità proprietaria.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Input / 1M token | $0.100 |
| Output / 1M token | $0.400 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
Di cosa parlano gli sviluppatori questa settimana
GET /api/public/models/qwen/qwen3.5-flashApri @misc{orcarouter_qwen3_5_flash,
title = {qwen/qwen3.5-flash API},
author = {qwen},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-flash}
}qwen. (n.d.). qwen/qwen3.5-flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-flash