Qwen3.5 122B-A10B — modello MoE open-weight multimodale (testo/immagine/video), 122B totali / 10B parametri attivi, contesto 32k (modalità visione).
Qwen3.5-122B-A10B è un modello linguistico di grandi dimensioni della serie Qwen di Alibaba Cloud. Utilizza un’architettura mixture-of-experts (MoE) in cui solo 10 miliardi di parametri vengono…
Basandosi sulle sue architetture e sul punteggio del benchmark, Qwen3.5-122B-A10B eccelle in attività che coinvolgono ragionamento multi-passaggio, uso di strumenti e seguimento delle istruzioni. Il punteggio τ²-Bench di 93,6 indica una forte performance in un benchmark che richiede al modello di pianificare ed eseguire sequenze di azioni utilizzando strumenti (ad es. calcolatrici, motori di ricerca, interpreti di codice). Ciò lo rende adatto alla creazione di agenti autonomi che devono interagire con sistemi esterni. Il modello gestisce anche input multimodali, quindi attività come ragionamento visivo, analisi di documenti con immagini incorporate o riepilogo di video rientrano nei suoi punti di forza. Inoltre, il suo ampio limite di output gli consente di generare spiegazioni approfondite, completamenti di codice o dati strutturati in un'unica risposta. Gli sviluppatori che lavorano su chatbot complessi, assistenti di codifica o strumenti di analisi della ricerca potrebbero trovare efficace questo modello.
Sebbene Qwen3.5-122B-A10B sia potente, non è la scelta più efficiente in termini di costi per ogni caso d'uso. Se il tuo compito è una semplice classificazione, generazione di testo breve o una Q&A diretta che non richiede ragionamenti multi-step o comprensione multimodale, potresti ottenere risultati soddisfacenti con un modello più piccolo come Qwen-7B o un modello non multimodale. Quei modelli possono essere più veloci ed economici per token. Inoltre, se le tue esigenze di contesto sono molto ridotte (ad esempio, meno di 1.000 token), il sovraccarico relativo dell'utilizzo di un modello con 122B parametri potrebbe non valere la pena. OrcaRouter offre una gamma di modelli con diverse caratteristiche di prezzo e prestazioni. Puoi sperimentare prima con modelli più piccoli e passare a versioni superiori solo se la qualità è insufficiente. Inoltre, se non hai bisogno del limite di output di 65K, un modello con un output più breve potrebbe essere sufficiente.
Il modello ha una finestra di contesto di 32,768 token e un output massimo di 65,536 token, che gli consente di gestire catene di ragionamento estese e istruzioni lunghe. L'alto punteggio τ²-Bench suggerisce che può mantenere la coerenza su più passaggi e seguire correttamente istruzioni complesse che coinvolgono logica condizionale, chiamate a strumenti e ramificazioni. In pratica, gli utenti hanno riferito che i modelli della serie Qwen3.5 sono competitivi con altri modelli all'avanguardia in compiti come la risoluzione di problemi matematici, la generazione di codice e i puzzle logici. Tuttavia, come tutti i modelli di grandi dimensioni, le prestazioni possono degradarsi se il contesto è riempito con informazioni irrilevanti o se le istruzioni sono ambigue. Si consiglia l'ingegneria dei prompt per guidare efficacemente il modello. Il modello potrebbe anche avere difficoltà con documenti molto lunghi (vicini al limite di contesto) in cui deve ricordare dettagli dall'inizio.
L'input multimodale (testo + immagine/video) consente diverse applicazioni pratiche. Nell'analisi dei documenti, il modello può leggere sia il testo che i grafici, diagrammi o firme incorporati in un PDF o in un'immagine. Ad esempio, può estrarre dati da una tabella scansionata o interpretare un grafico. Nella risposta a domande visive, il modello può rispondere a domande su una fotografia o un'illustrazione. Nell'analisi video, può elaborare fotogrammi per descrivere scene o tracciare i cambiamenti nel tempo. Gli sviluppatori possono creare strumenti per l'accessibilità (ad esempio, descrivendo immagini per utenti ipovedenti) o per l'automazione (ad esempio, analizzando screenshot dell'interfaccia utente). Poiché il modello viene accesso tramite OrcaRouter, queste capacità possono essere integrate in applicazioni esistenti con le stesse chiamate API usate per prompt solo testo, semplicemente includendo image_url o video_url nel contenuto del messaggio.
L'unico benchmark pubblicizzato per questo modello è il τ²-Bench, dove ha ottenuto un punteggio di 93,6. τ²-Bench è progettato per valutare la capacità di un modello di utilizzare strumenti e completare attività multi-step in un ambiente simulato. Un punteggio di 93,6 indica che il modello è in grado di completare correttamente un'alta percentuale di queste attività. Per contesto, questo punteggio è competitivo con altri modelli all'avanguardia sullo stesso benchmark. Tuttavia, i punteggi dei benchmark non sempre si traducono in prestazioni nel mondo reale, poiché le attività possono variare in difficoltà e il benchmark potrebbe non coprire tutti i domini. Gli utenti dovrebbero condurre le proprie valutazioni sui loro compiti specifici. Non vengono forniti altri punteggi di benchmark (ad esempio, MMLU, HumanEval o benchmark multimodali) nei fatti disponibili, quindi non è possibile confrontare questo modello su un insieme più ampio di metriche standard.
Punti di forza: Il modello ottiene un punteggio elevato in un benchmark di utilizzo di strumenti, suggerendo un forte ragionamento e capacità di seguire le istruzioni. La sua capacità multimodale e il grande limite di output lo rendono versatile. L'architettura MoE può fornire un buon equilibrio tra prestazioni ed efficienza (almeno rispetto a un modello denso di parametri totali simili). Limitazioni: Il modello ha una finestra di contesto di soli 32.768 token, che è moderata rispetto ad alcuni modelli che offrono 100K o più. I parametri attivati (10B) sono relativamente bassi per un modello delle sue dimensioni totali, il che potrebbe limitare le prestazioni su compiti molto complessi. Non sono disponibili informazioni sulla latenza, la velocità effettiva o i requisiti hardware. Inoltre, essendo il modello nuovo, l'ecosistema della community (ad esempio script di fine-tuning, strumenti di quantizzazione) potrebbe essere meno sviluppato rispetto a modelli più consolidati. Gli utenti dovrebbero testare approfonditamente il modello.
Non sono disponibili cifre specifiche di latenza o throughput per questo modello su OrcaRouter. La velocità di inferenza dipende da fattori come la lunghezza dell'input, la lunghezza dell'output, la dimensione del batch e l'hardware sottostante che OrcaRouter alloca. I modelli MoE possono avere velocità variabile perché il meccanismo di routing può attivare diversi esperti per token diversi. In generale, i modelli con 10B parametri attivati possono generare a velocità moderate su GPU moderne, ma il totale di 122B parametri in memoria può portare a un utilizzo di memoria più elevato e tempi di prefill più lunghi. Se una bassa latenza è critica, potresti voler testare il modello con i tuoi prompt tipici. L'API di OrcaRouter restituisce timestamp e metriche di performance negli header di risposta che possono aiutarti a misurare la velocità. Per applicazioni sensibili alla latenza, considera l'utilizzo di un modello più piccolo se l'attività lo consente.
I fatti disponibili includono solo un singolo benchmark: τ²-Bench. Benchmark comuni come MMLU (conoscenza), HumanEval (codice), GSM8K (matematica), o benchmark multimodali come MMBench non sono forniti. Ciò rende difficile valutare le prestazioni del modello su compiti che non sono correlati agli strumenti. Ad esempio, se la tua applicazione richiede accuratezza fattuale, vorresti conoscere le sue prestazioni su MMLU. Allo stesso modo, per compiti multimodali, sarebbero utili punteggi su un benchmark di ragionamento visivo. L'assenza di questi punteggi non implica prestazioni scarse, ma significa che gli utenti devono condurre le proprie valutazioni. OrcaRouter potrebbe fornire ulteriori risultati di benchmark su richiesta o nella documentazione. Fino a quando non saranno disponibili più dati, è consigliabile confrontare qualitativamente il modello con altri nel tuo dominio specifico.
I dettagli sui prezzi per Qwen3.5-122B-A10B su OrcaRouter non sono esplicitamente forniti nei dati disponibili. Tipicamente, OrcaRouter addebita per token sia per input che per output, con tariffe separate per token di prompt e token generati. Gli input multimodali (immagini/video) vengono fatturati come equivalenti di token in base al numero di blocchi immagine o fotogrammi video elaborati. Alcuni provider offrono anche tariffe scontate per cache hit se l'utente ripete lo stesso prompt. Per ottenere prezzi esatti, gli utenti dovrebbero fare riferimento alla pagina dei prezzi di OrcaRouter o contattare il loro team di vendita. Poiché questo modello ha 122B parametri totali ed è multimodale, il suo prezzo per token potrebbe essere più alto rispetto a modelli più piccoli o solo testo. È importante considerare il costo dei token per immagini/video quando si stimano le spese totali per un'attività.
L'utilizzo di un modello più grande come Qwen3.5-122B-A10B comporta generalmente costi per token più elevati rispetto ai modelli più piccoli. Tuttavia, se il modello è in grado di risolvere un compito in meno passaggi o con meno token grazie alle sue capacità, il costo totale potrebbe comunque essere competitivo. Il grande limite di output (65.536 token) può essere sia un vantaggio che un rischio di costo: generare output lunghi può accumulare rapidamente costi di token. Inoltre, gli input multimodali consumano più token per prompt rispetto ai prompt di solo testo. Ad esempio, una singola immagine ad alta risoluzione può costare centinaia di token. Se il tuo compito non richiede tutte le capacità del modello, puoi risparmiare denaro scegliendo un modello più piccolo. OrcaRouter probabilmente fornisce dashboard di utilizzo e controlli dei costi, come l'impostazione di un numero massimo di token di output o avvisi di budget, che possono aiutare a gestire le spese.
I fatti disponibili non menzionano sconti di caching per questo modello su OrcaRouter. Molti fornitori di inferenza offrono il caching dei prompt, in cui il testo ripetuto nei prompt di sistema o nei messaggi utente viene archiviato temporaneamente e fatturato a una tariffa inferiore. Se OrcaRouter supporta il caching, potrebbe ridurre i costi per le applicazioni che utilizzano prompt statici lunghi (ad esempio, istruzioni di sistema, descrizioni dei personaggi). Tuttavia, in assenza di documentazione specifica, non dovrebbe essere dato per scontato. Gli utenti possono verificare le intestazioni delle risposte API per gli indicatori di cache hit se il caching è implementato. Per minimizzare i costi, puoi progettare i prompt evitando di ripetere gli stessi prefissi lunghi separando le istruzioni statiche dal contenuto dinamico. Inoltre, considera l'utilizzo di finestre di contesto più brevi o l'omissione di immagini non necessarie quando possibile.
Per utilizzare Qwen3.5-122B-A10B, invia una richiesta POST all'endpoint API di OrcaRouter all'indirizzo https://api.orcarouter.ai/v1/chat/completions. Imposta il parametro model su "qwen/qwen3.5-122b-a10b". L'API è completamente compatibile con il formato di completamento chat di OpenAI, quindi puoi utilizzare le stesse librerie client (ad es. la libreria Python openai) modificando l'URL di base e la chiave API. Il corpo della richiesta include messaggi (ciascuno con un ruolo e un contenuto) e opzionalmente parametri come temperature, max_tokens, top_p, ecc. Per input multimodali, utilizza un blocco di contenuto con type: "image_url" per le immagini o la gestione video specifica del modello (probabilmente tramite frame codificati in base64 o un URL). L'API restituirà una risposta JSON con il testo generato e metadati di utilizzo (conteggi di token). La documentazione di OrcaRouter fornisce maggiori dettagli sui parametri supportati.
Il modello supporta i parametri standard di chat: temperature (default tipicamente 0.7), top_p (default 0.9), max_tokens (fino all'output massimo del modello di 65,536), presence_penalty, frequency_penalty e stop sequences. Il limite della finestra di contesto è di 32,768 token, che include tutti i messaggi, le immagini e i fotogrammi video. Se il conteggio totale dei token supera questo limite, l'API restituirà un errore o troncherà l'input (a seconda delle impostazioni). Il parametro max_tokens non può superare 65,536. Per le richieste multimodali, notare che le immagini e i video aggiungono token; il tasso di conversione esatto non è fornito, ma video ad alta risoluzione o lunghi possono consumare rapidamente la finestra di contesto. OrcaRouter può anche supportare la modalità stream, in cui le risposte vengono trasmesse token per token, utile per applicazioni in tempo reale. Consultare il riferimento API per opzioni aggiuntive come logprobs o tools.
La migrazione è semplice: sostituisci l'URL base con https://api.orcarouter.ai/v1, utilizza l'ID del modello "qwen/qwen3.5-122b-a10b" e fornisci la tua chiave API OrcaRouter. Il formato della richiesta è identico a quello dell'API chat completions di OpenAI. Ad esempio, in Python con la libreria openai, puoi impostare client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key'). Quindi chiamare client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...). Se la tua applicazione utilizza function calling o strumenti, nota che il modello li supporta poiché è addestrato su τ²-Bench che prevede l'uso di strumenti. Tuttavia, la sintassi esatta delle chiamate agli strumenti potrebbe differire da quella di OpenAI; OrcaRouter probabilmente supporta il formato OpenAI, ma è bene testare per confermare. Per input multimodali, il codice esistente che invia image_url nei messaggi potrebbe funzionare, purché il modello supporti quel formato.
All'interno della famiglia Qwen, questo modello si colloca tra i modelli densi più piccoli (ad es., Qwen-7B, Qwen-14B) e i modelli MoE più grandi (ad es., Qwen3.5-235B). Rispetto ai modelli densi, questo modello MoE può accedere a un set di parametri totali più ampio, ma ne attiva solo una frazione per token, il che può consentire esperti più specializzati. Ciò può portare a prestazioni migliori su una varietà di compiti, specialmente quelli che richiedono conoscenze diversificate. Tuttavia, i modelli densi più piccoli possono essere più veloci ed economici per compiti ristretti. Rispetto al più grande Qwen3.5-235B, questo modello ha probabilmente prestazioni inferiori ma è più efficiente. Il supporto multimodale è una caratteristica comune della generazione Qwen3.5; le versioni precedenti (Qwen2, Qwen1) erano solo testuali. Gli utenti dovrebbero confrontare i risultati dei benchmark sui loro compiti specifici per decidere quale modello si adatta meglio.
I confronti diretti sono difficili senza benchmark completi. Qwen3.5-122B-A10B raggiunge 93.6 su τ²-Bench, che è un risultato significativo per compiti di utilizzo di strumenti. Per riferimento, punteggi simili su quel benchmark per altri modelli non vengono forniti, ma è considerata una capacità di alto livello. In termini di architettura, i modelli Llama sono densi e più semplici, mentre i modelli Claude hanno architetture proprietarie diverse. Qwen3.5 offre input multimodale (immagine/video) che Claude supporta, ma Llama 3.2 e 3.1 sono solo testo (tranne alcune varianti visive). La finestra di contesto di 32K è più piccola dei 100K o 200K di Claude ma paragonabile ai 128K di Llama 3.1? Non esattamente; non dobbiamo inventare numeri. Per codice e ragionamento, molti modelli sono competitivi. Il vantaggio di questo modello potrebbe essere la sua messa a punto specifica per l'uso di strumenti (punteggio alto su τ²-Bench) e l'efficienza multimodale MoE. Tuttavia, Claude e Llama hanno ecosistemi più grandi e un maggiore supporto della comunità.
Pochi modelli combinano input multimodale, un'ampia finestra di contesto, un grande limite di output e un punteggio τ²-Bench elevato in un unico pacchetto. La serie Qwen3.5 è progettata per essere un modello generico capace con forti capacità di ragionamento e utilizzo di strumenti. L'architettura MoE con 122B totali e 10B attivi le consente di contenere molte conoscenze mantenendo i costi di inferenza inferiori rispetto a un modello denso da 122B. Ciò detto, altri modelli MoE come Mixtral 8x7B (totale 47B, attivi 13B) hanno diversi compromessi. Qwen3.5-122B-A10B ha un numero totale di parametri molto più grande ma meno parametri attivi per token (10B contro 13B). Il supporto multimodale è un elemento distintivo; Mixtral è solo testo. Nello spazio MoE multimodale, esistono modelli come Qwen-VL o altri ma spesso hanno finestre di contesto più piccole. Questo modello è posizionato come una solida opzione per sviluppatori che necessitano di un singolo modello per compiti diversificati, multimodali e ad alto utilizzo di strumenti su OrcaRouter.
Scegli Qwen3.5-122B-A10B se la tua applicazione richiede sia comprensione multimodale che ragionamento complesso multi-step, e hai bisogno del limite di output elevato per generare risposte lunghe. È anche una buona scelta se stai costruendo sistemi agentici che utilizzano strumenti, grazie al suo alto punteggio τ²-Bench. Se il tuo compito è solo testuale e non necessita della capacità extra, un modello più economico come Llama 3.1 70B o Qwen-14B potrebbe essere sufficiente. Se hai bisogno di una finestra di contesto più grande (es. >100K token), considera modelli progettati specificamente per contesti lunghi. Se hai bisogno di latenza inferiore, un modello più piccolo o denso potrebbe essere migliore. Poiché OrcaRouter offre molti modelli, puoi valutarne diversi tramite la stessa API per trovare la soluzione migliore per i tuoi obiettivi di costo e qualità. L'ID del modello è qwen/qwen3.5-122b-a10b.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Livello | Input / 1M token | Output / 1M token |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| Livello selezionato in base al numero di token di input di ogni richiesta | ||
Stima basata sul prezzo di listino
Prezzi a livelli — questa stima usa le tariffe del livello base.
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/qwen/qwen3.5-122b-a10bApri @misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b