
Tencent HY4 Preview vs tencent-hy3: Sei volte il prezzo, e cosa si ottiene davvero con il salto
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0259Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0258Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0166Intelligenza82Codice
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
Tencent HY4 Preview è il primo modello della famiglia Hunyuan a far sembrare volutamente economico il proprio predecessore: Tencent lo prezza a sei volte il prezzo di input di tencent-hy3 e a quattro volte e mezzo il prezzo di output, e la presentazione di lancio sostiene che il premio sia meritato. Rilasciato e reso open-source il 28 agosto 2026, Tencent HY4 Preview riporta un punteggio di ingegneria del software su DeepSWE che più che raddoppia il 28,0 di Hy3, un 85,4 su Terminal-Bench 2.1 per la guida di terminale, e una finestra di contesto che passa da 256K a oltre un milione di token. tencent-hy3, diventato ufficiale il 6 luglio, è il cavallo di battaglia maturo della famiglia: 295B di parametri totali, 21B attivi, un quarto del contesto e un prezzo più simile a un errore di arrotondamento. Non è una gara che la scheda tecnica lascia in equilibrio. La domanda è se il divario valga i soldi per ciò che si esegue davvero, e la risposta cambia a seconda del carico di lavoro.
Il tabellone: dove i due effettivamente divergono
Ogni benchmark nei materiali di Tencent è riportato dal fornitore — eseguito sulle configurazioni di valutazione di Tencent stessa al lancio di ciascun modello, non riprodotto da un laboratorio indipendente, e per il modello di punta è pubblico da meno di un giorno. Considera i punteggi come il massimo che Tencent ritiene di aver raggiunto, e dai più peso al trend che a qualsiasi singolo numero. Il trend è inconfondibile, ed è concentrato sul lavoro di ingegneria agentica piuttosto che sulla conoscenza generale:
• DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. Questo è il più grande salto singolo nella coppia, un più che raddoppio su un benchmark di ingegneria del software su scala di repository, ed è il numero che separa un modello di chat da un modello a cui affidi un intero codebase.
• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4, che Tencent afferma pareggia con Claude Opus 5 e supera DeepSeek V4 Pro. tencent-hy3: 71.7 come riportato al suo lancio di luglio. Guidare un terminale reale fino al completamento di attività multi-step è esattamente il tipo di lavoro a lungo orizzonte in cui Hy3 era più debole.
• Toolathlon-Verified — Tencent HY4 Preview: 74.1, che, secondo Tencent, supera Qwen 3.8 Max e GPT-5.6 Sol. Nessuna cifra comparabile per Hy3 è stata pubblicata.
• Test cieco interno — 163 esperti hanno valutato 203 attività di ingegneria con 2.99/4.00 per Tencent HY4 Preview, superando di poco GLM-5.3 (2.92) e Kimi K3 (2.94). Questi sono i revisori di Tencent sui compiti di Tencent; consideralo come indicativo.

Il filo conduttore: i guadagni riguardano la guida del terminale, le chiamate agli strumenti e le attività su scala di repository — il posizionamento sulla produttività che Tencent ha spinto fin da Hy3, ora con la potenza di calcolo a sostenerlo.
Il sovrapprezzo, riga per riga
Ecco dove il confronto smette di essere una questione di vanto. I prezzi di listino di Tencent, per milione di token:
• Input — Tencent HY4 Preview: 6 yuan (~US$0,85). tencent-hy3: 1 yuan (~US$0,14). Sei volte.
• Output — Tencent HY4 Preview: 18 yuan (~US$2.50). tencent-hy3: 4 yuan (~US$0.56). Quattro volte e mezza.
• Cache hit — Tencent HY4 Preview: 0,3 yuan. tencent-hy3: 0,25 yuan. Quasi uguali, il che conta più di quanto sembri, perché i loop agentici re-inviano costantemente lo stesso prompt di sistema e lo stesso prefisso di conversazione.
Esegui un carico di lavoro realistico di codifica agentica attraverso il numero combinato — ad esempio 20 milioni di token in input e 4 milioni di token in output al mese, un budget tipico per un agente di un singolo sviluppatore impegnato. Tencent HY4 Preview: 120 yuan più 72 yuan, circa 192 yuan (~27 USD). tencent-hy3: 20 yuan più 16 yuan, circa 36 yuan (~5 USD). Il modello di punta costa più di cinque volte tanto per essere eseguito con la stessa combinazione di token — e richiederà più token di output per attività, perché pensa più a lungo.
Non è un motivo per evitare Tencent HY4 Preview; il salto DeepSWE è esattamente il tipo di capacità per cui si paga un premio. È un motivo per calcolare il prezzo del carico di lavoro prima di instradarlo. Ed è qui che il livello di routing dimostra il suo valore: tencent-hy3 è già su OrcaRouter al prezzo di listino del fornitore — ricarico 0%, quindi il numero che vedi è il prezzo del fornitore stesso, non una versione rivenduta e maggiorata — con failover automatico tra i fornitori, e un cambio di prezzo del venditore diventa attivo dal nostro lato lo stesso giorno.
Quattro volte il contesto, il doppio del calcolo attivo
• Architettura — Tencent HY4 Preview: 770B totali, 49B attivi MoE. tencent-hy3: 295B totali, 21B attivi. Il modello di punta impiega circa 2,3 volte più potenza di calcolo per ogni token.
• Finestra di contesto — Tencent HY4 Preview: oltre 1M token. tencent-hy3: 256K. Un intero repository o un lotto di documenti finanziari rientra nella finestra del modello di punta in un'unica richiesta; su Hy3 lo stesso lavoro richiede chunking, retrieval o un loop di agenti.
• Controllo del ragionamento — tencent-hy3 include un'impostazione reasoning_effort per richiesta (no_think, low, high) più un livello di decodifica speculativa che lo mantiene veloce. Tencent HY4 Preview, per stessa ammissione di Tencent, tende a pensare a lungo prima del primo output e a sovra-verificare su compiti complessi — bruciando token per ricontrollare lavoro già svolto.
Quell'ultima riga è la differenza nascosta per gli usi sensibili alla latenza. Hy3 può ricevere l'istruzione di rispondere direttamente; Tencent HY4 Preview, almeno in questa forma iniziale, spesso non può fare a meno di pensare. Per una chat a bassa latenza o una pipeline di estrazione ad alto throughput, la capacità extra del modello di punta è sprecata e il suo pensiero extra è una tassa. Per un lavoro di elaborazione batch offline, la tassa è esattamente ciò che compra la risposta migliore.
La tassa di anteprima: ciò che Hy3 ha ancora
"Preview" è nel nome di Tencent HY4 Preview e si comporta come tale. Non c'è input visivo o multimodale — il modello è solo testo, quindi qualsiasi cosa legata a immagini o video resta sul modello che già usi per quello. La prova gratuita di due settimane su WorkBuddy e CodeBuddy è un assaggio, non un piano. Tencent è stato esplicito sul fatto che questa è un'iterazione iniziale di Hy4, con miglioramenti di pre-training e post-training ancora in arrivo con una cadenza che ha prodotto una versione principale circa ogni due mesi da febbraio. Benchmark indipendenti per il modello di punta: nessuno ancora, da nessuna parte.
tencent-hy3 è l'opposto di tutto questo. È una versione ufficiale e stabile, in produzione da luglio. Il suo livello gratuito è disponibile fino al 30 settembre. I suoi livelli di ragionamento ti offrono una manopola di regolazione piuttosto che un temperamento, e il suo strato di decodifica speculativa con 21B parametri attivi lo rendono la metà economica, veloce e prevedibile di questa famiglia — il modello che punti sul percorso predefinito e di cui ti dimentichi.

Chi dovrebbe scegliere cosa
Scegli {{1}}Tencent HY4 Preview{{/1}} quando al centro c'è il lavoro — un compito difficile di ingegneria del software, un contesto su scala di repository, un flusso di lavoro agentico in cui una risposta migliore giustifica un costo in token cinque volte superiore e puoi permetterti la latenza di un modello che pensa prima di parlare. Scegli {{2}}tencent-hy3{{/2}} quando al centro c'è il vincolo — throughput elevato, bassa latenza, un budget limitato, o qualsiasi attività in cui vuoi che il modello risponda piuttosto che riflettere.
Il pattern pratico per un abbinamento come questo è l'escalation: instradare il modello economico e controllabile sul percorso predefinito e passare al modello di punta solo quando il compito lo richiede. È a questo che serve il DSL di routing di OrcaRouter — comporre più modelli in una singola chiamata così che la policy sia configurazione anziché codice — e il failover automatico significa che il percorso di Hy3 continua a servire anche quando un provider degrada. OrcaRouter non instrada ancora Tencent HY4 Preview; Tencent non ha aperto il modello all'inferenza di terze parti, quindi per ora gira sul proprio endpoint Tencent Cloud TokenHub del vendor e su deployment self-hosted dei pesi open. tencent-hy3, nel frattempo, è già nel catalogo oggi al prezzo di listino del provider — e il giorno in cui il modello di punta verrà aperto, si inserirà nello stesso livello di routing allo stesso modo, trasformando il passaggio da un modello all'altro in una modifica di una riga invece che in una riscrittura.

Il verdetto è noioso nel senso migliore: il modello di punta vale il premio di prezzo esattamente per il lavoro per cui è prezzato, e il cavallo di battaglia è ancora la scelta giusta per tutto ciò che deve solo essere portato a termine. Il divario di prezzo di sei volte è reale, il divario DeepSWE da 28 a 64 è reale, e nessuno dei due annulla l'altro — devi solo sapere quale stai comprando.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
