Scheda hero per il titolo di Tencent Hy4 Preview. Un titolo centrato recita 'Tencent Hy4 Preview — open weights, vLLM day-zero'. Una riga di sottotitolo recita '770B MoE · 49B attivi · contesto 1M'. Quattro chip delle specifiche recitano 'Open weights (Apache 2.0)', 'vLLM + SGLang day zero', 'Servizio su 8x GPU (FP8)', '¥6 / ¥18 per MTok'. Una riga a piè di pagina recita 'Rilasciato il 28 agosto 2026 · Funziona con vLLM'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Tencent Hy4 Preview gira su vLLM sin dal primo giorno: il MoE open-weight da 770B che puoi davvero servire.

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Quando Tencent Hy4 Preview è stato lanciato il 28 agosto 2026, ha fatto qualcosa che la maggior parte dei flagship di classe frontier salta il primo giorno: è arrivato subito eseguibile. Oltre ai pesi open, Tencent e il team di vLLM hanno pubblicato un'immagine Docker precompilata, una ricetta di serving ufficiale e integrato il supporto direttamente in vLLM, così il più grande modello open-weight mai prodotto dalla linea Hunyuan — 770 miliardi di parametri totali, 49 miliardi attivi per token — era dietro un endpoint compatibile con OpenAI sulle tue GPU entro poche ore dall'annuncio. Questa storia del runtime al giorno zero è la notizia di cui parla questo post, perché "gira in vLLM" non è una nota a margine per un modello di queste dimensioni. È la differenza tra un comunicato stampa e qualcosa che puoi mettere in produzione.

Il resto del lancio è il solito pacchetto in stile anteprima, e le avvertenze contano tanto quanto i numeri. Tencent definisce Tencent Hy4 Preview un'iterazione iniziale, segnala il ragionamento eccessivamente lungo e l'eccessiva auto-verifica come comportamenti noti, e pubblica una tabella di benchmark interamente autodichiarata — nessun laboratorio indipendente l'ha ancora valutata, e il modello ha due giorni al momento in cui scriviamo. Nulla di tutto ciò cambia la conclusione pratica: i pesi sono Apache 2.0, la finestra di contesto è di 1 milione di token, e il supporto vLLM dal primo giorno rende il percorso di self-hosting concreto, non solo aspirazionale.

Cos'è realmente Tencent Hy4 Preview

Tencent posiziona Tencent Hy4 Preview come successore di Hy3 (295B in totale, contesto di 256K), raddoppiando approssimativamente la capacità attiva e quadruplicando la finestra di contesto. L'architettura merita di essere letta riga per riga, perché ogni riga cambia ciò che un modello a pesi aperti può fare sul tuo hardware.

• Architettura — Mixture-of-Experts con 770B parametri totali e 49B attivi per token su 78 layer. Il primo layer è denso; gli altri 77 instradano ogni token attraverso 256 esperti instradati più un esperto condiviso, attivando i primi 8. Questo rapporto di sparsità di circa 16:1 è ciò che mantiene il costo di inferenza in un intervallo che un team serio può effettivamente gestire.

Finestra di contesto — 1.048.576 token nativi, una delle più ampie tra qualsiasi modello open-weight. Un repository completo, un refactoring multi-file, un batch di documenti lunghi: problemi risolvibili con una singola richiesta.

• Attenzione — Gated DeepSeek Sparse Attention (Gated DSA) con IndexCache, un design di attenzione sparsa che calcola un nuovo indice sparso solo su 21 dei 78 layer e lo riutilizza sugli altri 57. Ecco perché servirlo non è solo "un vLLM più grande" — ha bisogno di un backend che comprenda l'attenzione sparsa.

Decodifica speculativa integrata — un layer MTP (multi-token prediction) di circa 10B di parametri totali / 0,7B attivi risiede all'interno del modello, così vLLM e SGLang possono generare token in bozza senza che tu debba ospitare un modello di draft separato.

• Pesi — Apache 2.0, in checkpoint sia BF16 che FP8, pubblicati su Hugging Face, ModelScope, GitCode e CNB.

Cosa significa realmente "day-zero vLLM"

Il supporto framework integrato al lancio è l'evento concreto dietro il segnale — la modifica a vLLM che aggiunge Tencent Hy4 Preview (PR #54160) è arrivata nella stessa finestra della release, e la ricetta ufficiale richiede vLLM 0.29.0 o successivo. In pratica, ciò significa che il percorso di serving è un solo comando, non una settimana di debug del kernel.

docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview

Le flag sono importanti, e ognuna corrisponde a qualcosa nel modello, non sono solo boilerplate:

• --attention-backend FLASHMLA_SPARSE — obbligatorio, non opzionale. L'attention sparsa Gated DSA di Tencent Hy4 Preview non funziona correttamente sui backend densi predefiniti, e questo flag è ciò che imposta la ricetta ufficiale.

• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — attiva il livello MTP integrato del modello per la decodifica speculativa, tre token di previsione in anticipo. Nessun modello di draft separato da distribuire.

• --tool-call-parser hy_v4 e --reasoning-parser hy_v4 — i parser personalizzati che comunicano al server come Tencent Hy4 Preview emette le chiamate agli strumenti e la sua catena di pensiero, con --enable-auto-tool-choice che consente al modello di decidere quando chiamare gli strumenti.

Tencent consiglia temperatura 0.9 e top_p 1.0 per il campionamento. Il ragionamento è predefinito su una catena di pensiero a sforzo "alto", pensata per matematica, codice e compiti complessi; se vuoi una risposta diretta senza il lungo pensiero, puoi passare uno sforzo di ragionamento no_think nella richiesta anziché sostituire i pesi.

A screenshot of the official vLLM recipe page for tencent/Hy4-preview (recipes.vllm.ai/tencent/Hy4-preview, captured August 30, 2026). It shows the model spec chips '770B | 49B | 1,048,576 ctx | vLLM 0.29.0+', a note describing the built-in 10B MTP layer for speculative decoding and the hy_v4 tool/reasoning parsers, and the prebuilt docker run command with --tensor-parallel-size 8, --attention-backend FLASHMLA_SPARSE, and the hy_v4 parsers.

Il supporto day-zero non è solo di vLLM, il che è di per sé notevole per una release così recente. SGLang ha pubblicato lo stesso giorno un'immagine precompilata multi-architettura (lmsysorg/sglang:hy4-preview) con decodifica speculativa in stile NEXTN, e l'ecosistema Ascend ha ottenuto supporto 0-day tramite vLLM-Ascend, utilizzando pesi quantizzati W8A8 su 16 NPU Atlas 800I A3. Le release open-weight spesso richiedono settimane perché l'ecosistema di serving si adegui; questa ha richiesto ore.

I punteggi che vale la pena citare

Ogni benchmark che Tencent ha pubblicato per Tencent Hy4 Preview è riportato dal vendor — eseguito sulla configurazione di valutazione di Tencent, non riprodotto da alcun laboratorio indipendente, e il modello è pubblico da due giorni. Leggeteli come il tetto che Tencent ritiene di aver raggiunto, non come un dato consolidato. La verifica indipendente non esisterà finché una terza parte non lo esegue; nulla sulle classifiche pubbliche riflette ancora questo modello.

A single-model scoreboard titled 'Tencent Hy4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (Apache 2.0)', 'Price: ¥6 / ¥18 per MTok (¥0.3 cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 30, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Il dato principale è Terminal Bench 2.1, un test che valuta quanto bene un modello gestisce un terminale reale mentre programma. Tencent riporta Tencent Hy4 Preview a 85,4, sostenendo che pareggia con Claude Opus 5 e supera DeepSeek V4 Pro, e che batte il suo predecessore Hy3 di 14,6 punti. Questo singolo numero è il cuore del rilascio: è l'affermazione che mette un modello open-weight alla pari con i modelli closed frontier più costosi in un difficile test di coding agentico, ed è anche l'affermazione che ha più bisogno di una conferma indipendente.

Il resto della tabella interna, tutti numeri di Tencent: DeepSWE, un benchmark di ingegneria del software, passa da 28.0 su Hy3 a 64.3. SWE-bench Pro arriva a 65.7 e SWE-bench Multilingual a 82.9. Su Toolathlon-Verified, un test di chiamata di strumenti, Tencent riporta 74.1, che secondo l'azienda supera Qwen 3.8 Max e GPT-5.6 Sol e si avvicina a Kimi K3 e Claude Opus 5. Su APEX-Agents pass@1 si attesta a 37.1, appena dietro al 37.2 di Kimi K3. E in un'altra valutazione interna in cieco, 163 esperti reclutati da Tencent hanno assegnato a 203 compiti di ingegneria un punteggio di 2.99 su 4.00, superando di poco il 2.92 di GLM-5.3 e il 2.94 di Kimi K3.

Due tendenze meritano attenzione. Ogni punteggio elevato riguarda il lavoro di ingegneria agentica — guida del terminale, chiamata di strumenti, attività su scala di repository — mentre nessuno riguarda conoscenza o ragionamento generici; il che si adatta al posizionamento sulla produttività, più che essere una coincidenza. E Tencent descrive DeepSWE e gli altri come strumenti che riducono, non colmano, i divari; l'unica affermazione di parità netta e commerciabile è il pareggio su Terminal Bench 2.1, ed è l'affermazione che vale più la pena testare con il proprio carico di lavoro.

Quanto costa davvero farlo funzionare

I conti del self-hosting sono la prima cosa di cui essere onesti. Questo non è un modello per singola GPU e non è un modello desktop. Il checkpoint FP8 è vicino a un terabyte di pesi, e la ricetta ufficiale presuppone un parallelismo tensoriale di 8 — otto GPU ad alta larghezza di banda con interconnessioni veloci (l'hardware di riferimento di Tencent per FP8 è 8×B300, mentre il BF16 completo richiede 16×B200). Se non hai quella configurazione, non riuscirai a self-hostarlo a basso costo, e il backend a attenzione sparsa significa che non c'è scorciatoia per la memoria della cache KV in un contesto da 1 milione di token.

Un componente aggiuntivo della settimana di lancio modifica parte di quei calcoli per i team che vogliono i pesi aperti senza l'ingombro del modello di punta. Il team Hy di Tencent ha pubblicato una build GGUF compressa di Tencent Hy4 Preview, comprimendo il rilascio BF16 da ~1,5 TB a circa 200 GiB con uno schema di quantizzazione mista per livello che chiama MIX-STQ1_0 — i tensori esperti in massa scendono a circa 1,3 bit, mentre i livelli critici per il flusso residuale mantengono una precisione più alta. Nelle valutazioni di Tencent la variazione di accuratezza è contenuta — SWE-bench Multilingual 82,9 a 81,3, MCP Atlas 83,7 a 83,2, IFBench 73,5 a 72,5 — un compromesso che il fornitore definisce quasi senza perdite. Questi sono i numeri di Tencent sull'ambiente di Tencent, finora non riprodotti. Un modello da 200 GiB non è ancora un modello per singola GPU, ma è una scommessa significativamente più piccola di un checkpoint FP8 da quasi un terabyte, e rende il percorso a pesi aperti accessibile a un nodo multi-GPU più piccolo rispetto alla ricetta che prevede otto B300.

È sul percorso API che il prezzo diventa interessante. Su TokenHub di Tencent Cloud, Tencent Hy4 Preview costa 6 yuan (~US$0,83) per milione di token in input, 18 yuan (~US$2,50) per milione di token in output e 0,3 yuan (~US$0,04) per milione di token per i cache hit. Un output di circa 2,50 USD per milione è di gran lunga inferiore ai 25 USD per milione richiesti da un modello chiuso di frontiera di alto livello, e il basso costo dei cache hit rende i lunghi loop agentici — in cui lo stesso system prompt e i prefissi di conversazione vengono reinviati di continuo — insolitamente convenienti.

Tencent offre anche accesso gratuito per due settimane a Tencent Hy4 Preview all'interno di WorkBuddy e CodeBuddy mentre il modello è nuovo, quindi il modo più economico per provarlo questa settimana è gratuito — ed è in WorkBuddy che il posizionamento legato alla produttività diventa concreto. In qualsiasi conversazione di WorkBuddy, il selettore del modello passa da Hy3 a Hy4 Preview, quindi la suddivisione tra lavoro di produttività d'ufficio e analisi da un lato e coding dall'altro è una scelta per singolo compito, non una decisione di deployment. Questa suddivisione corrisponde a dove Tencent ha puntato il modello, e i test pratici in WorkBuddy lo mostrano mentre crea al primo colpo artefatti complessi — un prototipo di gioco low-poly giocabile da un singolo prompt, una revisione trimestrale completa assemblata da dieci allegati con zero interventi manuali e, nella demo per tester circolata questa settimana, una simulazione di buco nero. Queste sono osservazioni della community sull'app di Tencent, non benchmark del vendor — ma sono i primi segnali pratici di ciò che il modello fa su compiti reali multi-step, e sono riproducibili gratuitamente prima di spendere qualsiasi cosa.

La decisione sui costi è esattamente il punto in cui un layer di routing cambia la matematica, e saremo onesti sul nostro ruolo in tutto questo: OrcaRouter non instrada ancora Tencent Hy4 Preview, perché Tencent non ha aperto questo modello a piattaforme di inferenza di terze parti — gira sull'endpoint TokenHub proprietario di Tencent Cloud e su deployment self-hosted dei pesi aperti, e non pretendiamo di servire ciò che non serviamo. Ciò che il layer di routing porta è il framework decisionale che lo circonda. Se stai scegliendo tra un nodo a 8 GPU e un'API, la stessa disciplina di pass-through su cui si basa il resto del catalogo si applica dal giorno in cui Tencent lo apre: OrcaRouter trasferisce i prezzi di listino dei provider a margine zero, quindi un taglio di prezzo del fornitore è live dal nostro lato lo stesso giorno, invece di essere rivenduto e maggiorato. E per un modello vecchio di due giorni la cui unica evidenza sono i benchmark del suo fornitore, il failover automatico è il modo sicuro per testarlo — metti il modello collaudato sul tuo percorso critico e Tencent Hy4 Preview al suo fianco, attivandolo su attività in cui il suo profilo di costo vince e tornando indietro nel momento in cui non vince più, tutto tramite una sola API e una sola chiave.

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent Hy4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

I limiti che non trovano spazio su una scheda tecnica

Tencent elenca chiaramente le limitazioni note, e queste dovrebbero guidare qualsiasi decisione di deployment. Tencent Hy4 Preview è un modello testuale, punto e basta — nessun input visivo o multimodale — quindi qualsiasi cosa riguardi immagini o video appartiene a un modello diverso. Tencent segnala anche un comportamento di avvio lento su compiti complessi (lunga elaborazione prima del primo output) e una tendenza a un'eccessiva autoverifica, bruciando token per ricontrollare lavoro già svolto. Questa combinazione è esattamente la scelta sbagliata per la chat sensibile alla latenza ed esattamente tollerabile per il lavoro di ingegneria batch offline, il che indica dove Tencent si aspetta che tu la esegua.

Due affermazioni nel materiale di lancio meritano un'attenzione separata perché riguardano come è stato costruito il modello, non i suoi punteggi. Tencent afferma che Tencent Hy4 Preview ha partecipato al proprio sviluppo — ha contribuito a ottimizzare i metodi di addestramento, la strategia dei dati, i framework di valutazione e gli operatori di basso livello che l'hanno prodotto, un primo ciclo di auto-miglioramento ricorsivo — e che ha ottimizzato autonomamente il proprio sistema di inferenza per un guadagno di throughput end-to-end del 31,8% rispetto alla baseline. Sul fronte scientifico, Tencent riporta di aver fatto avanzare il limite inferiore noto del problema di Blaschke–Lebesgue in geometria convessa da 0,380799 a 0,41104, e un'accelerazione di 2,0x su una simulazione di doppio strato fosfolipidico da 32.512 atomi, fino a 54,9 millisecondi per passaggio. Come tutto il resto del primo giorno, si tratta del resoconto di Tencent stessa.

E l'assenza più importante è la verifica. Non ci sono ancora punteggi indipendenti per Tencent Hy4 Preview da nessuna parte — non in una classifica pubblica, non da un laboratorio di valutazione di terze parti, non una voce su Artificial Analysis. Il modello è troppo nuovo per questo. Il test alla cieca di esperti interni è un segnale utile su come i recensori stessi di Tencent lo vedano in confronto a GLM-5.3 e Kimi K3, ma sono i recensori di Tencent sui compiti di Tencent. Tutto ciò che va oltre la scheda tecnica è un'affermazione in attesa di verifica.

Chi dovrebbe eseguire Tencent Hy4 Preview questa settimana?

La risposta onesta si divide in tre gruppi questa settimana, e uno di essi non richiede alcun hardware. Se vuoi solo provare cosa fa Tencent Hy4 Preview, l'accesso gratuito a WorkBuddy è il percorso più rapido — niente GPU, niente chiave API, apri una conversazione, imposta il selettore del modello su Hy4 preview e affidagli un compito Work o Coding. Se hai GPU ed esegui carichi di lavoro di ingegneria in batch — attività agentiche a lungo orizzonte, analisi su scala di repository, valutazione offline — il modello merita un test serio adesso: i pesi sono aperti, la finestra di contesto è su scala di repository, il percorso vLLM è un singolo comando, e la build GGUF della settimana di lancio abbassa la soglia hardware per una prova. Se stai eseguendo chat di produzione sensibili alla latenza, o qualsiasi cosa multimodale, o qualsiasi cosa in cui non puoi permetterti un modello la cui unica evidenza sono i benchmark del suo stesso venditore, aspetta — Tencent ha rilasciato aggiornamenti all'incirca ogni due mesi da febbraio, e ha già detto che il prossimo lotto di modelli Hy4 sta arrivando, quindi la preview è esplicitamente un'iterazione iniziale.

Per tutti gli altri, l'approccio utile è uno schema di routing: provalo accanto a un modello di cui già ti fidi, a un costo da cui puoi tirarti indietro, e scalalo solo dove i suoi numeri reggono sul tuo carico di lavoro. È a questo che serve un router — il giorno in cui Tencent aprirà questo modello all'inferenza di terze parti, si unirà al catalogo — un'unica API, oltre 200 modelli, pass-through a prezzo di listino — come qualsiasi altro, e gli strumenti di failover e composizione saranno già pronti. Fino ad allora, i pesi sono su Hugging Face, l'API è su Tencent Cloud e la prova gratuita è disponibile in WorkBuddy — e l'affermazione che un modello open-weight abbia raggiunto il livello più alto della codifica agentica ha finalmente un numero specifico associato. Il numero è di Tencent. Il test è tuo.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube