
Qwen3.8-LiveTranslate vs Qwen 3.8: una collisione di nomi, non una sfida ad armi pari
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Cerca uno di questi modelli e ti verrà mostrato l'altro. Qwen3.8-LiveTranslate, rilasciato il 19 settembre 2026, e Qwen3.8-Max — il modello che la maggior parte delle persone intende quando scrive "Qwen 3.8" senza suffisso, disponibile in generale dal 3 agosto 2026 e aggiornato come Qwen3.8-Max-0902 il 2 settembre — condividono un prefisso di generazione e quasi nient'altro. Uno è un sistema di interpretazione simultanea che riceve audio in ingresso e restituisce in uscita audio tradotto e testo, fatturato tramite WebSocket con l'ID qwen3.8-livetranslate-flash-realtime. L'altro è un generalista sparse mixture-of-experts da 2,4 trilioni di parametri con una finestra di contesto di 1M token che non è in grado di sentire assolutamente nulla. Metterli a confronto diretto è un errore di categoria, e il fatto che così tante persone arrivino a quell'errore è la vera storia qui: il fornitore ora distribuisce almeno quattro cose distinte sotto il nome Qwen 3.8, e lo schema di denominazione non ti dice quale sia quella che vuoi.
Cosa sia in realtà ognuno
La generazione Qwen 3.8 è stata distribuita a livelli nel corso della seconda metà del 2026, e i livelli non sono intercambiabili.
Qwen3.8-Max è il modello di punta ospitato: un modello MoE sparso con circa 2,4 trilioni di parametri totali e circa 95 miliardi attivi per ogni passaggio in avanti, una finestra di contesto di 1 milione di token e input testuale, immagini e video con output solo testuale. Il prezzo è di 2,00 $ per milione di token in input e 6,00 $ per milione di token in output, con letture dalla cache a 0,250 $ per milione. I punteggi dichiarati dal fornitore lo collocano a 86,6 su Terminal-Bench 2.1, 92,6 su GPQA Diamond, 67,7 su SWE-bench Pro e 43,6 su Humanity's Last Exam.
Qwen3.8-2.4T-A95Bè il rilascio open-weight della stessa generazione, pubblicato il 12 agosto 2026: 512 esperti instradati su 92 layer, 69 di questi layer che utilizzano l'attenzione lineare, e circa 4,89 TB di pesi. È il modello che la maggior parte delle persone intende con "Qwen 3.8" quando parla di eseguire qualcosa in proprio anziché chiamare un'API.
Qwen3.8-27B è il piccolo checkpoint open della stessa famiglia, e Qwen3.8-LiveTranslate è lo specialista — un interprete con architettura Interleave, basato su un design Hybrid MoE Thinker–Talker, con 60 lingue di partenza riconosciute e 29 disponibili per l'output vocale.
L'asse che li separa non è la dimensione. È la modalità. Qwen3.8-Max non ha alcun canale di input audio né alcun output audio. Chiedergli di interpretare una conversazione dal vivo non è una questione di formulare prompt migliori; la capacità non è nel modello.
Il contrasto delle specifiche
Messi fianco a fianco, i due modelli si sovrappongono a malapena su qualsiasi dimensione che interessi a un acquirente:
• Attività principale — Qwen3.8-LiveTranslate: interpretazione simultanea da voce a voce. Qwen3.8-Max: ragionamento generale, coding, lavoro testuale agentico e multimodale.
• Modalità di input — Qwen3.8-LiveTranslate: audio e immagine. Qwen3.8-Max: testo, immagine e video.
• Modalità di output — Qwen3.8-LiveTranslate: testo e audio sintetizzato. Qwen3.8-Max: solo testo.
• Finestra di contesto — Qwen3.8-LiveTranslate: 53,248 token (49,152 in ingresso / 4,096 in uscita). Qwen3.8-Max: 1,000,000 token.
• Pesi — Qwen3.8-LiveTranslate: chiuso, solo API. Qwen3.8-Max: ospitato, con il gemello aperto Qwen3.8-2.4T-A95B pubblicato nella stessa generazione.
• Limiti di frequenza — Qwen3.8-LiveTranslate: 10 richieste e 100.000 token al minuto. Qwen3.8-Max: throughput ospitato standard, nessun limite in tempo reale per singola richiesta.
La disparità di contesto è quella che sorprende le persone. Qwen3.8-Max contiene un milione di token; l'interprete ne contiene circa il cinque percento. Ma un interprete in tempo reale non ha bisogno di un contesto lungo — ha bisogno di una memoria breve e molto veloce. Il suo limite di input di 49.152 token è dimensionato per portare avanti gli ultimi minuti di una conversazione al fine di mantenere coerenti i nomi e la terminologia, che è esattamente il compito che svolge la "disambiguazione a lungo contesto". Giudicare l'interprete dal suo numero di contesto è come giudicare un motore da corsa dal suo serbatoio del carburante.

Perché il confronto dei prezzi è una trappola
Su base per milione di token, l'interprete sembra dramaticamente più costoso del modello di punta: 7,50 $ per milione di token di input audio contro 2,00 $ per milione di token di input testuale, e 30,00 $ per milione di output audio contro 6,00 $ per milione di output testuale.
Quel confronto è privo di senso, ed è l'errore più comune in assoluto che si commetta riguardo a questa classe di modelli. I token audio e quelli di testo non sono la stessa unità. Il parlato viene codificato in token audio con una densità che non ha alcun rapporto con lo stesso contenuto scritto — un minuto di conversazione consuma moltissimi più token audio di quanti ne consumi la sua trascrizione in token di testo, e l'audio in output aggiunge un secondo flusso. Mettere i due tassi uno accanto all'altro implica un rapporto di costo che in pratica non esiste.
La differenza strutturale conta più della differenza di prezzo. Qwen fattura l'interprete per token, mentre gran parte del mercato del parlato in tempo reale fattura per minuto di sessione. Questi due modelli di prezzo si comportano in modo completamente diverso quando il tuo audio diventa più silenzioso, le tue sessioni si accorciano o i tuoi parlanti fanno pause: un contatore al minuto addebita il silenzio, mentre uno per token no. Se stai costruendo un modello di costo, la domanda non è quale tariffa sia più bassa; è quale contatore penalizza la forma del tuo utilizzo. E nota la suddivisione regionale: i prezzi di Pechino sono ¥40 / ¥3,3 / ¥100 / ¥160 per milione rispettivamente per input audio, input immagini, output di testo e output audio, sostanzialmente inferiori alle tariffe di Singapore, che è il tipo di differenza che diventa visibile solo quando confronti le due riga per riga.
Un ulteriore punto a favore dell'interprete sul fronte dei costi: Qwen ha mantenuto queste tariffe sostanzialmente invariate rispetto a Qwen3.5-LiveTranslate, con Pechino invariata e Singapore leggermente più economica. Una nuova generazione che arriva senza un aumento di prezzo non è la norma in questo mercato.
La vera linea di demarcazione è tra pesi aperti e solo API.
Se stai scegliendo tra questi due in base al principio anziché alla capacità, il fatto decisivo è la licenza.
Qwen3.8-Max è disponibile in versione hosted, e i pesi di classe Max di questa generazione sono stati resi open source come Qwen3.8-2.4T-A95B ad agosto. Questa strada esiste, ma non è da percorrere alla leggera: 4,89 TB di pesi richiedono hardware da datacentre, e la licenza open-weight impone alle organizzazioni che guadagnano più di 50 milioni di dollari in un periodo di dodici mesi di ottenere una licenza commerciale da Alibaba Cloud.
Qwen3.8-LiveTranslate non offre una via del genere. È a pesi chiusi e disponibile solo via API, raggiungibile tramite una WebSocket Realtime API che richiede target_languageda impostare in un evento session.updateprima che qualsiasi audio venga trasmesso; non supporta il function calling, né l'output strutturato, né la cache del contesto, né l'inferenza in batch, né il fine-tuning. Se il tuo requisito è eseguire l'interprete sul tuo hardware, questo modello non lo soddisfa e nessun lavoro di ingegneria potrà cambiarlo.
Questo conta per un tipo specifico di acquirente: quello che non può inviare l'audio a terzi — un ospedale, uno studio legale, un appaltatore governativo. Per tutti gli altri, la domanda pratica è se l'interprete sia abbastanza buono da giustificare la dipendenza, e la risposta a ciò è una misurazione che Qwen non ha ancora permesso a nessuno di fare.

Scegliere in base al lavoro, non al nome
La risposta corretta a "Qwen3.8-LiveTranslate o Qwen 3.8" è che probabilmente ti serve la risposta a una domanda diversa.
• Se il lavoro è interpretazione in tempo reale — una riunione, una chiamata, una trasmissione — solo uno di questi può farlo, e non è il modello di punta.
• Se il compito è riassumere quanto detto, estrarre punti d'azione, rispondere a domande sulla trascrizione o scrivere il seguito — solo il modello di punta può farlo, e non è l'interprete.
• Se il lavoro è entrambe le cose, stai costruendo una pipeline e finirai per pagare due fornitori con due contratti e due set di credenziali, a meno che tu non consolati deliberatamente.
Quel terzo caso è quello comune, ed è qui che eseguire entrambe le metà dietro un unico endpoint smette di essere una comodità e inizia a essere architettura. Qwen3.8-Max è su OrcaRouter al prezzo di listino del provider di $2,00 per milione di input e $6,00 per milione di output con zero markup trasferito, così un taglio di prezzo di Qwen arriva sulla tua fattura lo stesso giorno anziché al rinnovo contrattuale successivo, e il failover automatico significa che la metà riassuntiva della pipeline non si spegne quando un provider attraversa un'ora difficile.
Per essere espliciti sull'altra metà, perché la distinzione conta: Qwen3.8-LiveTranslate non è nel nostro catalogo. È disponibile tramite l'API Model Studio di Alibaba e l'endpoint di prova del fornitore su omni.qwen.ai/live-translate, e non intendiamo lasciar intendere che instradiamo un modello che non instradiamo. Quello che oggi puoi mettere dietro una singola chiave è lo stack a valle — i modelli che consumano ciò che produce l'interprete.

Il problema della denominazione è il vero risultato
Quattro modelli, un prefisso, nessuna convenzione di suffisso su cui un lettore possa fare affidamento. "Qwen 3.8" si riferisce al flagship ospitato, al checkpoint aperto da 2,4T, al modello piccolo da 27B o all'interprete, a seconda di chi sta digitando e di ciò che ha letto per ultimo. Le tabelle di benchmark pubblicate non aiutano, perché il flagship le ha e l'interprete per lo più no: Qwen3.8-Max può essere collocato su Terminal-Bench o GPQA Diamond, mentre le prove relative a Qwen3.8-LiveTranslate sono un average lagging di 2,3 secondi, un valore di 85,7 xCOMET-XXL su FLEURS dichiarato dal fornitore e un tasso di errore di diarizzazione del 9,7% auto-dichiarato, senza alcuna replica indipendente.
Quindi il confronto a cui questa pagina esiste per rispondere è in realtà un avvertimento. Prima di confrontare Qwen 3.8 con qualsiasi cosa, stabilisci a quale Qwen 3.8 ti riferisci. Se accetta audio, è l'interprete, ed è uno specialista che acquisti per un solo compito. Se accetta video, è il flagship, ed è un generalista che acquisti per gli altri venti. Qualsiasi valutazione che li mescoli produrrà una conclusione su nessuno dei due.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
