
Tencent HY4 Preview vs Qwen3.8-Max: Il confronto open-weight di agosto
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Tencent HY4 Preview vs Qwen3.8-Max è lo scontro verso cui questo mese si stava dirigendo. Il modello Qwen3.8-Max di Alibaba ha raggiunto la disponibilità generale il 3 agosto ed è diventato il 12 agosto il primo Qwen di classe Max con pesi aperti; Tencent HY4 Preview è arrivata questa mattina, 25 giorni dopo, con una scheda di lancio che nomina direttamente Qwen3.8-Max — Tencent riporta HY4 Preview a 74.1 su Toolathlon-Verified, davanti a Qwen3.8-Max su quel benchmark. Entrambi sono modelli di punta cinesi con pesi aperti, entrambi hanno un prezzo pensato per vendere, e solo uno dei due ha punteggi indipendenti.
I due modelli non sono separati solo dalla scala — Qwen3.8-Max ha 2,4 trilioni di parametri contro i 770 miliardi di HY4 Preview — ma sui benchmark agentici che contano per un acquirente puntano allo stesso bersaglio: lavoro a lungo orizzonte in cui un modello legge, chiama strumenti e itera senza un umano nel ciclo. È esattamente il territorio in cui la generazione open-weight di agosto cerca di dimostrare di poter sostituire i modelli di frontiera chiusi, e la prima mossa di Tencent è stata quella di mirare alla più grande release open del mese.
Il tabellone

• Scala — HY4 Preview 770B totali / 49B attivi vs Qwen3.8-Max 2.4T totali / ~95B attivi
• Contesto — HY4 Preview >1M tokens vs Qwen3.8-Max 1M tokens sull'API (262K nativi nei pesi aperti, estendibile a ~1.01M)
• Prezzo per 1M — HY4 Preview ¥6 in ingresso / ¥18 in uscita (≈$0.85 / $2.50) rispetto a Qwen3.8-Max $2.00 in ingresso / $6.00 in uscita, letture cache $0.25
Terminal-Bench 2.1 — HY4 Preview 85.4 (dichiarato dal fornitore) vs Qwen3.8-Max 86.6
• Modalità — entrambi solo testo nelle loro forme open-weight; l'API Qwen3.8-Max aggiunge input di immagini e video, mentre HY4 Preview non lo fa.
• Punteggio indipendente — HY4 Preview nessuno vs Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58
Le due carte raccontano la stessa storia da lati opposti. Su Terminal-Bench 2.1, l'86,6 di Qwen3.8-Max e l'85,4 di HY4 Preview sono separati da un punto e mezzo — un punto a favore di Qwen, e il dato di HY4 non è certificato. Sul prezzo, HY4 Preview è più economica sia sull'input sia sull'output per token. Sulla verifica, Qwen3.8-Max ha un Intelligence Index indipendente di 58 e un Agentic Index di 58; HY4 Preview non ha nulla se non i propri comunicati stampa. Il divario è il classico schema di uno sfidante che arriva con prezzi migliori e affermazioni non comprovate contro un incumbent verificato.
Leggendo l'affermazione di Toolathlon
Toolathlon-Verified misura l'affidabilità dell'uso agentico degli strumenti — con quanta costanza un modello guida uno strumento attraverso un compito completo, con errori, recupero e chiamate multi-step. Il 74.1 di Tencent è mirato direttamente al punto più forte del profilo di Qwen3.8-Max, perché l'Agentic Index di 58 di Qwen e il suo 86.1 su OSWorld-Verified sono i numeri che hanno reso credibile la proposta agentica di Alibaba. Qwen3.8-Max ottiene anche 82.8 su IFBench (seguire le istruzioni) e 93.0 su PaperBench (lavoro agentico di livello ricerca), superando in entrambi i casi modelli come GPT-5.6 Sol nelle tabelle del fornitore. Quindi Tencent ha scelto l'unico benchmark in cui dichiara una vittoria diretta sul più grande modello open del mese — e la dichiarazione è attualmente verificabile quanto qualsiasi altra riga di un singolo fornitore: per niente.
Verificato vs riportato dal fornitore
Questo è l'asse su cui il confronto è meno equilibrato, e l'asimmetria merita di essere esplicitata. L'Intelligence Index di 58 di Qwen3.8-Max proviene da Artificial Analysis, il suo Agentic Index di 58 proviene da Artificial Analysis, e gli stessi harness indipendenti che gli hanno assegnato quei punteggi ne hanno anche misurato i punti deboli: un tasso di allucinazioni del 40% su AA-Omniscience, in aumento rispetto al 23% della generazione precedente, e un enorme numero di 64 turni agentici per attività — il modello lavora sodo, e ogni turno lo paghi. Tencent HY4 Preview non ha nulla di questa strumentazione. I suoi punti di forza sono dichiarazioni, e le sue modalità di fallimento — che Tencent stessa segnala come ragionamento prolungato e auto-verifica eccessiva — sono ammissioni, non misurazioni.
Per un team che sceglie tra i due, il divario di verifica non è astratto. Il comportamento di Qwen3.8-Max di 64 turni per attività è un reale e misurato fattore di costo: a $2/$6 è ancora l'agente più costoso per attività completata in alcuni confronti di terze parti, e i team hanno riferito che il numero di turni sta erodendo il suo vantaggio di prezzo. Il comportamento equivalente di HY4 Preview è sconosciuto — potrebbe essere più economico per attività di quanto il suo prezzo già basso per token suggerisca, oppure la sua abitudine all'auto-verifica potrebbe mangiarsi la differenza. Nessuno può dirtelo ancora, perché nessuno al di fuori di Tencent lo ha eseguito.
Prezzo e aspetti pratici dei pesi aperti
Per token, HY4 Preview è più economico su entrambi i lati del registro: ¥6/¥18 contro i $2,00/$6,00 di Qwen3.8-Max, e i cache hit a ¥0,3 contro $0,25. Ciò rende HY4 Preview il modello open-weight di punta più economico sia in input che in output, punto e basta. Ma "open weights" comporta due diversi set di clausole scritte in piccolo. Il rilascio open-weight di Qwen3.8-Max — il Qwen3.8-2.4T-A95B — è solo testo con il thinking forzato, contesto nativo di 262K invece di 1M dell'API, e una licenza personalizzata con condizioni a livelli di scala: requisiti di visualizzazione del nome del modello sopra i 100M di utenti mensili, e una licenza separata per grandi aziende Model-as-a-Service. I pesi di Tencent HY4 Preview sono su HuggingFace, ModelScope e GitHub da stamattina, ma i suoi termini di licenza esatti e se i pesi corrispondano all'API servita non sono stati dichiarati con lo stesso livello di chiarezza. Entrambi i modelli sono scaricabili; nessuno dei due è banale da integrare.
La conclusione
Qwen3.8-Max è la scelta più sicura in ogni modo in cui la verifica garantisce sicurezza: valutato indipendentemente per intelligenza e lavoro agentico, modalità di errore note, una licenza consolidata e tre settimane di feedback di produzione. È anche la scelta più costosa per token, e il suo comportamento misurato ad alta intensità di turni è un noto rischio di costo. Tencent HY4 Preview è la scommessa di valore: più economico sia su input che su output, un'affermazione comparabile su Terminal-Bench e un'affermazione diretta di Toolathlon-Verified contro Qwen — tutto non verificato dal primo giorno. Se stai mettendo un modello open-weight in produzione questa settimana, Qwen3.8-Max è la scelta difendibile ed è live su OrcaRouter al prezzo di listino di Alibaba — $2.00/$6.00, trasferito senza alcun ricarico. HY4 Preview è il progetto di valutazione: eseguilo tramite l'API di Tencent sui tuoi compiti in stile Toolathlon, mantieni il percorso di produzione sul modello verificato e, quando i punteggi indipendenti arrivano — o quando HY4 Preview raggiunge un router e la sua tariffa ¥6/¥18 diventa un pass-through in giornata — lo scambio è una regola di routing, non una riscrittura.


Cosa guardare
• La prima esecuzione indipendente di HY4 Preview su un harness agentico. Il 74.1 verificato da Toolathlon è il numero che Tencent vuole raggiungere; un Agentic Index di terze parti sarebbe la conferma.
• Il numero di turni misurato di HY4 Preview. I 64 turni per attività di Qwen3.8-Max rappresentano il monito; se HY4 Preview sia più economico per attività completata è l'intera questione economica.
I termini di licenza sui pesi. Determineranno se "aperto" significa "utilizzabile alla tua scala" per HY4 Preview, come hanno fatto le condizioni della licenza Qwen3.8-Max per il modello di Alibaba.
• Se uno dei due vendor taglia di nuovo il prezzo. In un mese in cui due flagship open-weight sono stati lanciati con prezzi aggressivi, il pass-through su un router rende qualsiasi ulteriore taglio visibile lo stesso giorno.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
