Una scheda titolo per il confronto 'Tencent HY4 Preview vs Qwen3.8-Max'. Un banner centrale recita 'La sfida open-weight di agosto', con l'annotazione 'Due flagship open-weight, a 25 giorni di distanza'. La scheda di sinistra 'Tencent HY4 Preview' elenca '770B / 49B attivi, lanciato il 28 agosto', '¥6 / ¥18 per 1M', 'Nessun punteggio indipendente'. La scheda di destra 'Qwen3.8-Max' elenca '2.4T / ~95B attivi, lanciato il 3 agosto', '$2.00 / $6.00 per 1M', 'Indice AA 58'. Un piè di pagina recita 'I dati di HY4 Preview sono dichiarati dal fornitore; i punteggi di Qwen3.8-Max secondo Artificial Analysis.' Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Tencent HY4 Preview vs Qwen3.8-Max: Il confronto open-weight di agosto

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Tencent HY4 Preview vs Qwen3.8-Max è lo scontro verso cui questo mese si stava dirigendo. Il modello Qwen3.8-Max di Alibaba ha raggiunto la disponibilità generale il 3 agosto ed è diventato il 12 agosto il primo Qwen di classe Max con pesi aperti; Tencent HY4 Preview è arrivata questa mattina, 25 giorni dopo, con una scheda di lancio che nomina direttamente Qwen3.8-Max — Tencent riporta HY4 Preview a 74.1 su Toolathlon-Verified, davanti a Qwen3.8-Max su quel benchmark. Entrambi sono modelli di punta cinesi con pesi aperti, entrambi hanno un prezzo pensato per vendere, e solo uno dei due ha punteggi indipendenti.

I due modelli non sono separati solo dalla scala — Qwen3.8-Max ha 2,4 trilioni di parametri contro i 770 miliardi di HY4 Preview — ma sui benchmark agentici che contano per un acquirente puntano allo stesso bersaglio: lavoro a lungo orizzonte in cui un modello legge, chiama strumenti e itera senza un umano nel ciclo. È esattamente il territorio in cui la generazione open-weight di agosto cerca di dimostrare di poter sostituire i modelli di frontiera chiusi, e la prima mossa di Tencent è stata quella di mirare alla più grande release open del mese.

Il tabellone

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Scala — HY4 Preview 770B totali / 49B attivi vs Qwen3.8-Max 2.4T totali / ~95B attivi

• Contesto — HY4 Preview >1M tokens vs Qwen3.8-Max 1M tokens sull'API (262K nativi nei pesi aperti, estendibile a ~1.01M)

• Prezzo per 1M — HY4 Preview ¥6 in ingresso / ¥18 in uscita (≈$0.85 / $2.50) rispetto a Qwen3.8-Max $2.00 in ingresso / $6.00 in uscita, letture cache $0.25

Terminal-Bench 2.1 — HY4 Preview 85.4 (dichiarato dal fornitore) vs Qwen3.8-Max 86.6

• Modalità — entrambi solo testo nelle loro forme open-weight; l'API Qwen3.8-Max aggiunge input di immagini e video, mentre HY4 Preview non lo fa.

• Punteggio indipendente — HY4 Preview nessuno vs Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58

Le due carte raccontano la stessa storia da lati opposti. Su Terminal-Bench 2.1, l'86,6 di Qwen3.8-Max e l'85,4 di HY4 Preview sono separati da un punto e mezzo — un punto a favore di Qwen, e il dato di HY4 non è certificato. Sul prezzo, HY4 Preview è più economica sia sull'input sia sull'output per token. Sulla verifica, Qwen3.8-Max ha un Intelligence Index indipendente di 58 e un Agentic Index di 58; HY4 Preview non ha nulla se non i propri comunicati stampa. Il divario è il classico schema di uno sfidante che arriva con prezzi migliori e affermazioni non comprovate contro un incumbent verificato.

Leggendo l'affermazione di Toolathlon

Toolathlon-Verified misura l'affidabilità dell'uso agentico degli strumenti — con quanta costanza un modello guida uno strumento attraverso un compito completo, con errori, recupero e chiamate multi-step. Il 74.1 di Tencent è mirato direttamente al punto più forte del profilo di Qwen3.8-Max, perché l'Agentic Index di 58 di Qw​en e il suo 86.1 su OSWorld-Verified sono i numeri che hanno reso credibile la proposta agentica di Ali​baba. Qwen3.8-Max ottiene anche 82.8 su IFBench (seguire le istruzioni) e 93.0 su PaperBench (lavoro agentico di livello ricerca), superando in entrambi i casi modelli come GPT-5.6 Sol nelle tabelle del fornitore. Quindi Tencent ha scelto l'unico benchmark in cui dichiara una vittoria diretta sul più grande modello open del mese — e la dichiarazione è attualmente verificabile quanto qualsiasi altra riga di un singolo fornitore: per niente.

Verificato vs riportato dal fornitore

Questo è l'asse su cui il confronto è meno equilibrato, e l'asimmetria merita di essere esplicitata. L'Intelligence Index di 58 di Qwen3.8-Max proviene da Artificial Analysis, il suo Agentic Index di 58 proviene da Artificial Analysis, e gli stessi harness indipendenti che gli hanno assegnato quei punteggi ne hanno anche misurato i punti deboli: un tasso di allucinazioni del 40% su AA-Omniscience, in aumento rispetto al 23% della generazione precedente, e un enorme numero di 64 turni agentici per attività — il modello lavora sodo, e ogni turno lo paghi. Tencent HY4 Preview non ha nulla di questa strumentazione. I suoi punti di forza sono dichiarazioni, e le sue modalità di fallimento — che Tencent stessa segnala come ragionamento prolungato e auto-verifica eccessiva — sono ammissioni, non misurazioni.

Per un team che sceglie tra i due, il divario di verifica non è astratto. Il comportamento di Qwen3.8-Max di 64 turni per attività è un reale e misurato fattore di costo: a $2/$6 è ancora l'agente più costoso per attività completata in alcuni confronti di terze parti, e i team hanno riferito che il numero di turni sta erodendo il suo vantaggio di prezzo. Il comportamento equivalente di HY4 Preview è sconosciuto — potrebbe essere più economico per attività di quanto il suo prezzo già basso per token suggerisca, oppure la sua abitudine all'auto-verifica potrebbe mangiarsi la differenza. Nessuno può dirtelo ancora, perché nessuno al di fuori di Tencent lo ha eseguito.

Prezzo e aspetti pratici dei pesi aperti

Per token, HY4 Preview è più economico su entrambi i lati del registro: ¥6/¥18 contro i $2,00/$6,00 di Qwen3.8-Max, e i cache hit a ¥0,3 contro $0,25. Ciò rende HY4 Preview il modello open-weight di punta più economico sia in input che in output, punto e basta. Ma "open weights" comporta due diversi set di clausole scritte in piccolo. Il rilascio open-weight di Qwen3.8-Max — il Qwen3.8-2.4T-A95B — è solo testo con il thinking forzato, contesto nativo di 262K invece di 1M dell'API, e una licenza personalizzata con condizioni a livelli di scala: requisiti di visualizzazione del nome del modello sopra i 100M di utenti mensili, e una licenza separata per grandi aziende Model-as-a-Service. I pesi di Tencent HY4 Preview sono su HuggingFace, ModelScope e GitHub da stamattina, ma i suoi termini di licenza esatti e se i pesi corrispondano all'API servita non sono stati dichiarati con lo stesso livello di chiarezza. Entrambi i modelli sono scaricabili; nessuno dei due è banale da integrare.

La conclusione

Qwen3.8-Max è la scelta più sicura in ogni modo in cui la verifica garantisce sicurezza: valutato indipendentemente per intelligenza e lavoro agentico, modalità di errore note, una licenza consolidata e tre settimane di feedback di produzione. È anche la scelta più costosa per token, e il suo comportamento misurato ad alta intensità di turni è un noto rischio di costo. Tencent HY4 Preview è la scommessa di valore: più economico sia su input che su output, un'affermazione comparabile su Terminal-Bench e un'affermazione diretta di Toolathlon-Verified contro Qw​en — tutto non verificato dal primo giorno. Se stai mettendo un modello open-weight in produzione questa settimana, Qwen3.8-Max è la scelta difendibile ed è live su OrcaRouter al prezzo di listino di Ali​baba — $2.00/$6.00, trasferito senza alcun ricarico. HY4 Preview è il progetto di valutazione: eseguilo tramite l'API di Tencent sui tuoi compiti in stile Toolathlon, mantieni il percorso di produzione sul modello verificato e, quando i punteggi indipendenti arrivano — o quando HY4 Preview raggiunge un router e la sua tariffa ¥6/¥18 diventa un pass-through in giornata — lo scambio è una regola di routing, non una riscrittura.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

Cosa guardare

• La prima esecuzione indipendente di HY4 Preview su un harness agentico. Il 74.1 verificato da Toolathlon è il numero che Tencent vuole raggiungere; un Agentic Index di terze parti sarebbe la conferma.

• Il numero di turni misurato di HY4 Preview. I 64 turni per attività di Qwen3.8-Max rappresentano il monito; se HY4 Preview sia più economico per attività completata è l'intera questione economica.

I termini di licenza sui pesi. Determineranno se "aperto" significa "utilizzabile alla tua scala" per HY4 Preview, come hanno fatto le condizioni della licenza Qwen3.8-Max per il modello di Ali​baba.

• Se uno dei due vendor taglia di nuovo il prezzo. In un mese in cui due flagship open-weight sono stati lanciati con prezzi aggressivi, il pass-through su un router rende qualsiasi ulteriore taglio visibile lo stesso giorno.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube