
Tencent HY4 Preview vs Kimi K3: Il test alla cieca che Tencent ha scelto di pubblicare
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Tencent HY4 Preview vs Kimi K3 è il confronto che Tencent stessa ha scelto di eseguire nel lancio di questo modello. Nel suo test interno alla cieca — 163 ingegneri, 203 compiti di ingegneria, valutati su una scala a quattro punti — HY4 Preview ha ottenuto 2,99/4,00 contro i 2,94 di Kimi K3, e il titolo di Tencent lo ha definito una vittoria. Le scritte in piccolo di questa vittoria meritano una lettura attenta: HY4 Preview ha superato Kimi K3 nel 51,2% dei compiti, ha pareggiato nel 7,9% e ha perso nel 40,9%. Un margine netto di vittoria di 10 punti è reale, ma è un margine sottile contro un modello che ha un terzo dei parametri totali e meno della metà dei parametri attivi — e l'intero test è stato condotto da Tencent.
Kimi K3 è l'ammiraglia open-weight da 2,8 trilioni di parametri di Moonshot, il più grande modello open mai rilasciato, e il punto di riferimento rispetto a cui ogni laboratorio cinese si sta misurando dal 16 luglio. Tencent lo ha scelto come avversario perché è lo standard open-weight — il che rende il compito di questo articolo insolitamente concreto: leggete l'unico testa a testa che lo sfidante ha accettato volontariamente, e decidete quanto vale.
Il benchmark che Tencent ha scelto di pubblicare
Il test alla cieca è stato valutato dagli stessi ingegneri di Tencent su compiti di ingegneria di Tencent, che è la prima cosa di cui diffidare. Un set di compiti curato dall'azienda è esattamente l'ambiente in cui un nuovo modello dà il meglio di sé. Anche ammettendo questo, la forma del risultato è rivelatrice: il 51,2% di vittorie contro il 40,9% di sconfitte è un margine modesto, e il tasso di pareggi del 7,9% indica che i modelli sono molto vicini sulla maggior parte dei compiti. Nei compiti difficili, quelli in cui un modello di frontiera si distingue, il divario sta dove è sempre stato — e il titolo di Tencent, "leggermente avanti a Kimi K3", è formulato onestamente, cosa che non tutti i laboratori pubblicano.
La scala non è il destino
Il confronto dei parametri rende il risultato impressionante o sospetto, a seconda delle tue convinzioni a priori. Kimi K3 ha 2,8 trilioni di parametri totali con 104 miliardi attivi — 896 esperti, 16 attivi per token — ed è stato addestrato a ragionare in modalità sempre attiva con la catena di pensiero esposta. HY4 Preview ha 770 miliardi totali con 49 miliardi attivi, un terzo delle dimensioni totali e meno della metà della potenza di calcolo attiva. Un modello più piccolo che ottiene una vittoria di misura in un test alla cieca su uno più grande è la direzione verso cui l'intero campo degli open-weight si sta muovendo — Qwen3.8-Max, con 2,4T, e GLM-5.2, con 753B, battagliano sui benchmark agentici da mesi — quindi il risultato è plausibile, non stravagante. È anche, cosa cruciale, non verificato da nessuno al di fuori di Tencent.
Il tabellone

• Scala — HY4 Preview 770B totali / 49B attivi vs Kimi K3 2.8T totali / 104B attivi
• Contesto — HY4 Preview >1M token vs Kimi K3 1M token
• Prezzo per 1M — HY4 Preview ¥6 in / ¥18 out (≈$0.85 / $2.50) vs Kimi K3 $3.00 in / $15.00 out, cache hits $0.30
• Modalità — HY4 Preview solo testo vs input nativo di immagini e video di Kimi K3
• Ragionamento — HY4 Preview: nessuna modalità pubblicata vs Kimi K3: ragionamento sempre attivo con chain-of-thought in streaming
• Punteggio indipendente — HY4 Preview nessuno vs Kimi K3 AA Intelligence Index 57, tra i primi tre a livello globale al momento del lancio
Nelle righe in cui entrambe le parti riportano un numero, i modelli si raggruppano. Tencent riporta HY4 Preview a 37.1 su APEX-Agents, essenzialmente in linea con il 37.2 di Kimi K3 — un pareggio ravvicinato che la classifica del test alla cieca prevederebbe. I punteggi di HY4 Preview in Toolathlon-Verified (74.1) e DeepSWE (64.3) non hanno equivalenti in Kimi K3 nei dati in mio possesso; e i punteggi di Kimi K3 in FrontierSWE (81.2), ProgramBench (77.8) e BrowseComp (91.2) non hanno equivalenti in HY4 Preview. La classifica è onesta: le due schede si sovrappongono appena, il che è di per sé un avvertimento a non considerare le righe di nessuno dei due fornitori come una descrizione completa del modello.
La visione è la più grande vera differenza.
Per uno sviluppatore che oggi sceglie tra i due, il divario strutturale non è l'intelligenza — è la modalità di input. Kimi K3 è nativamente multimodale: accetta input di immagini e video tramite il suo encoder MoonViT-V2 ed è tra i migliori modelli open nelle attività di visione, classificandosi secondo a livello globale nella vision arena. Tencent HY4 Preview è solo testuale in questa anteprima, e Tencent ha dichiarato che la visione dovrà attendere la versione completa. Qualsiasi carico di lavoro che richieda screenshot, comprensione dell'interfaccia utente o grounding visivo è di default appannaggio di Kimi K3, indipendentemente da ciò che il test alla cieca dice sull'ingegneria del testo. Se il tuo lavoro è puramente codice, documenti e output di terminale, il divario non ha importanza; nel momento in cui un'attività implica guardare qualcosa, decide l'esito del confronto.
La questione dei costi
Per token, HY4 Preview è drammaticamente più economico: circa $0.85/$2.50 contro i $3.00/$15.00 di Kimi K3, con cache hit a ¥0.3 (circa quattro centesimi) contro $0.30. Ma i due modelli hanno comportamenti token opposti che riducono il divario. Kimi K3 ragiona sempre attivo e trasmette il suo chain-of-thought, il che gonfia i token di output in ogni richiesta; i recensori hanno notato che il modello è più lento — circa 62 token al secondo — e pesante in termini di token per i cicli agente. HY4 Preview, secondo la nota di rilascio di Tencent, "tende a ragionamenti eccessivamente lunghi e a un'eccessiva auto-verifica" su compiti complessi. Entrambi consumano token di output extra; HY4 Preview semplicemente li fa pagare meno. Un confronto equo è il costo per attività completata, e nessuno al di fuori di Tencent ha ancora misurato quello di HY4 Preview.
Il verdetto
Tencent HY4 Preview {{1}}è il rivale più economico, più piccolo e non verificato{{/1}} che rivendica un sottile vantaggio in un test alla cieca rispetto allo standard open-weight; Kimi K3 {{2}}è il modello affermato, più grande, verificato e capace di gestire la visione{{/2}}, che costa da quattro a cinque volte tanto per token e ha un Intelligence Index indipendente di 57. Nessuna scheda benchmark dei due modelli è completamente indipendente — anche i punteggi principali di Kimi K3 sono {{3}}riportati da Moonshot{{/3}}, sebbene il suo Index 57 non lo sia. Se il carico di lavoro è multimodale, Kimi K3 è l'unica scelta in questo confronto. Se invece è testo e ingegneria, HY4 Preview è l'opzione più conveniente, con un confronto diretto reale, seppur gestito dal vendor, e la via economica è instradare Kimi K3 sulla chiave di produzione — è attivo su {{4}}OrcaRouter{{/4}} al prezzo di listino di Moonshot di $3,00/$15,00, trasferito senza markup — mentre si esegue HY4 Preview tramite {{5}}l'API proprietaria di Tencent{{/5}} su carichi di lavoro shadow. Quando HY4 Preview raggiunge un router, la stessa chiave e le stesse regole di failover gestiranno entrambi, e la tariffa di Tencent di ¥6/¥18 sarà trasferita invariata.


Cosa guardare
• Una ripetizione indipendente dei compiti del test alla cieca. La percentuale di vittoria del 51,2% è la singola affermazione più testabile di questo lancio, e un'infrastruttura di test di terze parti la risolverebbe in una settimana.
• Se HY4 Preview includerà la visione prima del rilascio completo di Hy4. È questo che trasformerebbe questo confronto da una sfida di valore sulla carta in una vera battaglia tra ammiraglie.
• Costo per attività completata su framework agentici standard. Entrambi i modelli consumano molti token; chi è più economico per attività finita vince l'argomento della produzione.
La risposta di Kimi K3 alla pressione sui prezzi. Se Moonshot taglia la tariffa di output di $15, il quadro "sfidante economico vs standard costoso" si ribalta.
