Snapshot datato 2 settembre 2026 di Qwen3.8 Max, il modello di ragionamento multimodale di punta di Alibaba: testo + immagine + video in ingresso, testo in uscita, contesto da 1M token. Stesse capacità e prezzi del modello base; fissalo per un comportamento riproducibile.
Qwen3.8 Max (0902) è un modello elencato su OrcaRouter dal provider qwen, pubblicato con l'ID modello qwen/qwen3.8-max-0902. La notazione 0902 compare nell'elenco, ma le informazioni fornite non…
Il modello supporta una finestra di contesto di 1.000.000 di token. Questa è la quantità totale di input a cui il modello può prestare attenzione in una singola richiesta, inclusi testo, immagini e contenuti video nel prompt. Non viene fornito alcun limite aggiuntivo nei dati disponibili, quindi i limiti pratici dipendono da come OrcaRouter e il provider applicano la tokenizzazione e i timeout delle richieste. Per testi lunghi, 1.000.000 di token consente di includere molti documenti corposi in un singolo prompt, riducendo la necessità di dividere o riassumere prima di chiamare il modello. Per i video, i dati non specificano quanti token vengono consumati al secondo, per fotogramma o per file video, quindi dovresti stimare in base ai metadati o a chiamate di test. È inoltre importante ricordare che la dimensione della finestra di contesto non indica quanto sia accurato il modello su un prompt da 1.000.000 di token; non vengono forniti dati di benchmark. Se la tua applicazione richiede una qualità precisa su contesti lunghi, valuta il modello su un campione dei tuoi documenti prima di passare alla produzione.
Con testo, immagini e video accettati come input, al modello può essere chiesto di ragionare su materiale sorgente che combina questi tipi nella stessa richiesta. Gli esempi includono la lettura di istruzioni nel testo, l'esame di un'immagine e il riferimento a un video quando si produce una risposta. La scheda informativa del fornitore non elenca capacità specifiche per attività come OCR, rilevamento di oggetti o ragionamento video temporale, quindi tali comportamenti non dovrebbero essere dati per scontati. Ciò che ci si può aspettare dal modello dipende principalmente dalle sue capacità addestrate, che non sono documentate nelle informazioni fornite. La progettazione sicura è usarlo per attività che richiedono un output di testo da un prompt a modalità mista e che possono tollerare il costo di memorizzare immagini e video come token di input. Se un carico di lavoro è solo testo, un altro modello senza input di immagini e video potrebbe essere più semplice. Se un'attività richiede operazioni video esatte a livello di timestamp, la scheda del modello non fornisce alcuna prova che tale comportamento sia affidabile.
Scegliere un modello più economico ha senso quando l'attività non richiede le funzionalità che caratterizzano questa inserzione. Una domanda testuale breve non necessita di un contesto da 1.000.000 di token né di un tetto di output da 131.072 token. Un flusso di lavoro solo testuale non necessita di input di immagini o video. OrcaRouter addebita questo modello a $2,00 per 1.000.000 di token di input e $6,00 per 1.000.000 di token di output. Se un'alternativa più economica ha prezzi per token inferiori e un supporto adeguato di contesto e modalità, ridurrà i costi. Non ci sono benchmark di qualità o velocità nei fatti forniti, quindi la scelta di questo modello rispetto ad altri non può essere giustificata da un'accuratezza misurata; dovrebbe essere giustificata da requisiti di prodotto espliciti: contesto ampio, input misti testo/immagine/video o output lunghi in un'unica generazione. Poiché il prezzo di input si applica a ogni token nel contesto, chiamate con contesto molto ampio possono costare più di chiamate più piccole anche quando la domanda dell'utente è breve, quindi evita di gonfiare i prompt.
I fatti del modello forniti per Qwen3.8 Max (0902) non includono punteggi di benchmark, set di valutazione o numeri di accuratezza. Per questo motivo, qualsiasi affermazione sulla qualità del modello sarebbe speculazione e OrcaRouter non pubblica punteggi inferiti. Se hai bisogno di un numero per confrontare i candidati, esegui i tuoi test su input rappresentativi, inclusi i casi di immagine e video che prevedi di inviare. Un benchmark come un test di conoscenza pubblica non ti direbbe quanto bene il modello gestisce un prompt video specifico da 1.000.000 di token. Tieni presente che un nome di modello come Max è un'etichetta, non una prova di qualità. Le cose misurabili in questo elenco sono la finestra di contesto, la lunghezza massima di output, le modalità di input e il prezzo. Questi attributi influenzano se un carico di lavoro è adatto, ma non descrivono accuratezza, profondità di ragionamento, capacità di seguire le istruzioni o comportamento di sicurezza. Tratta le capacità in queste aree come non verificate a meno che non effettui una valutazione.
I model facts non forniscono tassi di token al secondo, cifre relative al tempo di primo token, indicazioni sui timeout delle richieste o altre misurazioni delle prestazioni. OrcaRouter non dichiara un valore di latenza per questo modello del provider. La velocità dipenderà dall'infrastruttura di servizio del provider, dalla dimensione dell'input e dalla quantità di output richiesta. Un input di 1.000.000 di token e un output di 131.072 token richiederanno probabilmente più tempo di una richiesta breve, ma l'elenco non fornisce una relazione esatta. L'input video può anche peggiorare la latenza perché deve essere trasformato in token prima che il modello possa prestarvi attenzione; i fatti non quantificano questa fase. I revisori non dovrebbero presumere che un prezzo basso per token implichi una decodifica rapida. L'unica decisione relativa alla velocità supportata dai fatti è testare dimensioni di richiesta rappresentative sotto il carico previsto. Non dedurre l'idoneità in tempo reale dalla dimensione della finestra di contesto o dal nome del modello.
I punti di forza dichiarati sono strutturali. Il modello ha una finestra di contesto di 1.000.000 di token, un output massimo di 131.072 token e accetta input di testo, immagini e video. Queste caratteristiche sono utili per applicazioni che richiedono una singola chiamata al modello per osservare un volume ampio o misto di materiale prima di scrivere una risposta lunga. Anche i limiti sono più facili da enunciare dai fatti rispetto ai punti di forza. Non ci sono benchmark di qualità pubblicati, quindi accuratezza, ragionamento e sicurezza non sono documentati. Non esiste un elenco separato per i dati di addestramento, le note di rilascio o la metodologia di aggiornamento dietro l'etichetta 0902. L'input di immagini e video non garantisce una comprensione visiva o temporale esatta. I limiti di contesto e output sono valori massimi, non un utilizzo raccomandato; output molto grandi possono risultare costosi a $6,00 per 1.000.000 di token di output. Una richiesta che riempie il contesto di 1.000.000 di token consumerebbe $2,00 di token di input prima che venga generato qualsiasi output, il che rappresenta un costo operativo significativo.
I prezzi unitari indicati sono di $2,00 per ogni 1.000.000 di token di input e $6,00 per ogni 1.000.000 di token di output. OrcaRouter fattura il modello alla tariffa del provider senza alcun ricarico, quindi il prezzo indicato è la tariffa del provider applicata direttamente. I token di input includono i token di testo, immagini e video inviati nel prompt. I token di output sono i token della risposta generata. A queste tariffe, 1.000.000 di token di input costano $2,00; 1.000.000 di token di output costano $6,00. Una richiesta più piccola costa proporzionalmente meno: 100.000 token di input costerebbero $0,20 e 100.000 token di output costerebbero $0,60, a condizione che tali importi siano misurati dal provider. La scheda del modello non include prezzi separati per input in cache, richieste in batch o livelli interattivi, quindi non vanno presupposti tali prezzi. I conteggi esatti dei token fatturati vanno verificati nella risposta di utilizzo di OrcaRouter o nei log per ogni chiamata.
Quando OrcaRouter afferma che un modello viene fatturato alla tariffa del fornitore con margine zero, significa che OrcaRouter non aggiunge una propria commissione per token alla tariffa del fornitore per questo annuncio. L'importo finale per l'utilizzo dei token dovrebbe quindi basarsi sui prezzi indicati di $2.00 per input e $6.00 per output ogni 1.000.000 di token. Ciò non significa necessariamente che la fattura finale non contenga altri addebiti; potrebbero applicarsi imposte o commissioni a livello di account a seconda del tuo accordo, ma nessuna di queste commissioni è documentata in questi dati. Inoltre, non significa che il modello sia gratuito da servire, poiché la tariffa per token si applica comunque. Quando si confrontano i fornitori, il prezzo mostrato da OrcaRouter per questo modello dovrebbe rappresentare le stesse unità di questo annuncio. Se un gateway diverso quota un altro prezzo, la differenza riguarda la struttura di fatturazione, non una modifica alla finestra di contesto del modello.
La gestione dei costi dovrebbe iniziare dalla lunghezza del prompt. Poiché l'input costa $2,00 per 1.000.000 di token, ogni token aggiuntivo aumenta il costo di input, e ogni immagine o video inviato in una richiesta viene convertito in token secondo regole non fornite in questo elenco. Ridurre il materiale di origine irrilevante può ridurre il costo. L'output costa tre volte il prezzo unitario dell'input, quindi limitare la lunghezza dell'output richiesto controlla anche il costo. Un modello con un limite di output di 131.072 token può generare risposte che costano denaro; a $6,00 per 1.000.000 di token, 131.072 token di output costerebbero circa $0,79 solo in token di output. Generare così tanti token non è automatico, perché il prompt controlla la dimensione della risposta. Non è stato pubblicato alcun prezzo di cache per questo modello, quindi non dare per scontato che il contesto ripetuto venga scontato. L'assenza di prezzi di cache o batch nei dati non è una prova che tali opzioni non esistano; significa semplicemente che non fanno parte di questo elenco.
Qwen3.8 Max (0902) è esposto tramite l'API compatibile con OpenAI di OrcaRouter. Imposta l'URL di base del client su https://api.orcarouter.ai/v1 e usa l'ID modello esatto qwen/qwen3.8-max-0902. Con un SDK compatibile con OpenAI, la struttura della richiesta è sostanzialmente la stessa di qualsiasi chiamata chat-completions: passa una chiave API per OrcaRouter, l'URL di base indicato sopra e l'ID del modello nel body. Non usare un nome generico come Qwen3.8 Max o qwen3.8; l'elenco richiede qwen/qwen3.8-max-0902. Lo stesso ID del modello deve essere usato nelle richieste HTTP dirette all'URL di base, dove percorso e payload seguono il contratto compatibile con OpenAI esposto da OrcaRouter. Poiché è compatibile con OpenAI, il codice esistente scritto per le chat completions OpenAI può di solito essere migrato modificando i parametri base_url e model, anche se i dettagli di autenticazione devono corrispondere ai requisiti di OrcaRouter.
Per un completamento chat compatibile con OpenAI, parametri come model, messages e limite di token di output vengono gestiti come per altri modelli compatibili. I dati indicano un output massimo di 131.072 token, quindi se imposti un limite di output, non dovrebbe essere superiore a 131.072; il limite di output predefinito non è indicato nei dati. Temperature, top-p, stop e altri parametri di campionamento non sono documentati nelle specifiche del modello fornite, quindi segui la documentazione dell'API di OrcaRouter e la semantica standard dei parametri di OpenAI. Per l'input di immagini e video, usa il formato di contenuto multimodale previsto dall'API di OrcaRouter; i dati non forniscono un esempio. Se l'API restituisce un errore su nomi di parametri non supportati, verifica se il tuo SDK sta inviando parametri legacy. La finestra di contesto è di 1.000.000 di token, quindi il prompt deve mantenere tutti i token di input, inclusi i token di immagini e video, al di sotto di quel limite. Le risposte vengono conteggiate separatamente ai fini del massimo di 131.072 token.
Poiché OrcaRouter offre un'API compatibile con OpenAI all'indirizzo https://api.orcarouter.ai/v1, la migrazione è per lo più una modifica di configurazione. Sostituisci l'URL di base con https://api.orcarouter.ai/v1, sostituisci il campo della chiave API con una chiave OrcaRouter e imposta il modello su qwen/qwen3.8-max-0902. Se il tuo codice utilizza una libreria client compatibile con OpenAI, aggiorna base_url e api_key del client e lascia intatta la maggior parte delle strutture dei messaggi, presupponendo che il formato multimodale corrisponda a questo modello. Le informazioni disponibili non dicono se questo modello supporti ogni parametro specifico di OpenAI, quindi prima di migrare, rivedi i parametri inviati dalla tua applicazione. Inoltre, poiché il limite di contesto è 1.000.000 e l'output massimo è 131.072, adatta la logica di troncamento delle richieste a questi limiti. Eventuali parti di codice che prevedono un valore fisso diverso per la lunghezza massima del contesto potrebbero dover essere aggiornate. Infine, verifica che le aspettative di gestione dei dati della tua applicazione siano allineate ai termini di OrcaRouter, poiché le informazioni sul modello non trattano la conservazione dei dati.
La base principale di confronto è il contratto di input. Qwen3.8 Max (0902) accetta testo, immagini e video, quindi un'alternativa solo testo eliminerebbe queste modalità. Se il tuo carico di lavoro effettivo contiene solo testo, un modello solo testo con un contesto sufficientemente ampio è probabilmente una scelta più diretta e potrebbe avere prezzi diversi. I dati sul modello non includono confronti di accuratezza o velocità rispetto ad altri modelli, quindi non puoi scegliere in base a punteggi di qualità pubblici. Puoi confrontare attributi strutturali: un'alternativa solo testo potrebbe avere un contesto più ridotto, un limite di output più breve o un prezzo di input inferiore. OrcaRouter fattura questo modello a $2.00 per input e $6.00 per output ogni 1.000.000 di token. Il fatto che supporti input di immagini e video è utile solo se tali input vengono effettivamente utilizzati. Se questi input non vengono utilizzati, potresti pagare per una capacità multimodale irrilevante per il compito.
Scegli Qwen3.8 Max (0902) quando il profilo dell'attività corrisponde alle caratteristiche elencate. In primo luogo, hai bisogno di un contesto di 1.000.000 di token perché il materiale sorgente non può essere ridotto per adattarsi a una finestra più piccola. In secondo luogo, hai bisogno di input di immagini e video nello stesso prompt, o prevedi queste modalità in richieste future. In terzo luogo, desideri un massimo di output fino a 131.072 token. Se il tuo carico di lavoro non soddisfa nessuno di questi requisiti, molti dei vantaggi di questa scheda non vengono utilizzati. Non sceglierlo perché il nome Max sembra forte; la scheda non contiene alcuna prova di benchmark. Poiché OrcaRouter espone i modelli tramite la stessa API compatibile con OpenAI, scambiare gli ID dei modelli è facile, quindi puoi testare questo modello contro un altro candidato sulla tua attività. Ricorda solo che i prezzi di input e output differiscono e per questo modello non è specificato alcun prezzo di cache.
Quando si confrontano i costi, normalizzare innanzitutto sulla stessa base di token. Questo modello utilizza $2,00 per 1.000.000 di token di input e $6,00 per 1.000.000 di token di output, trasmessi dal fornitore senza alcun ricarico. Un modello concorrente con un prezzo per token di input inferiore potrebbe in realtà essere più conveniente per una richiesta con contesto completo, ma occorre considerare anche la finestra di contesto e l'output massimo. Ad esempio, una richiesta da 1.000.000 di token può utilizzare l'intero contesto di questo modello in una sola chiamata; un modello con un contesto di 200.000 token richiederebbe più chiamate, e i passaggi aggiuntivi di output o riepilogo possono modificare il prezzo totale. I fatti forniti non includono valori oggettivi di accuratezza o latenza, quindi qualsiasi confronto sul costo per risposta corretta deve basarsi su test propri. Verificare anche se un modello concorrente applica costi separati per token di immagini o video, poiché qui non sono descritti. In caso di dubbio, eseguire un carico di lavoro tipico su OrcaRouter e confrontare l'utilizzo misurato dei token e la qualità delle risposte, anziché affidarsi solo ai prezzi di listino.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Input / 1M token | $2.00 |
| Output / 1M token | $6.00 |
| Lettura cache / 1M | $0.250 |
| Scrittura cache / 1M | $2.50 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
Di cosa parlano gli sviluppatori questa settimana
GET /api/public/models/qwen/qwen3.8-max-0902Apri @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902