Una card titolo hero per il confronto 'Tencent HY4 Preview vs Kimi K3'. Una card centrale in stile tabellone segnapunti riporta 'Test cieco interno, scala a 4 punti' con 'Tencent HY4 Preview 2.99' a sinistra e 'Kimi K3 2.94' a destra. La card di sinistra 'Tencent HY4 Preview' elenca '770B / 49B attivi, pesi aperti', '¥6 / ¥18 per 1M', 'Anteprima solo testo'. La card di destra 'Kimi K3' elenca '2.8T / 104B attivi, pesi aperti', '$3.00 / $15.00 per 1M', 'Visione nativa, AA Index 57'. Un piè di pagina riporta 'Test cieco condotto da Tencent con 163 ingegneri su 203 attività; risultati dichiarati dal fornitore.' Il logo OrcaRouter è inserito nell'angolo in basso a destra.
Guides & Insights

Tencent HY4 Preview vs Kimi K3: Il test alla cieca che Tencent ha scelto di pubblicare

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Tencent HY4 Preview vs Kimi K3 è il confronto che Tencent stessa ha scelto di eseguire nel lancio di questo modello. Nel suo test interno alla cieca — 163 ingegneri, 203 compiti di ingegneria, valutati su una scala a quattro punti — HY4 Preview ha ottenuto 2,99/4,00 contro i 2,94 di Kimi K3, e il titolo di Tencent lo ha definito una vittoria. Le scritte in piccolo di questa vittoria meritano una lettura attenta: HY4 Preview ha superato Kimi K3 nel 51,2% dei compiti, ha pareggiato nel 7,9% e ha perso nel 40,9%. Un margine netto di vittoria di 10 punti è reale, ma è un margine sottile contro un modello che ha un terzo dei parametri totali e meno della metà dei parametri attivi — e l'intero test è stato condotto da Tencent.

Kimi K3 è l'ammiraglia open-weight da 2,8 trilioni di parametri di Moonshot, il più grande modello open mai rilasciato, e il punto di riferimento rispetto a cui ogni laboratorio cinese si sta misurando dal 16 luglio. Tencent lo ha scelto come avversario perché è lo standard open-weight — il che rende il compito di questo articolo insolitamente concreto: leggete l'unico testa a testa che lo sfidante ha accettato volontariamente, e decidete quanto vale.

Il benchmark che Tencent ha scelto di pubblicare

Il test alla cieca è stato valutato dagli stessi ingegneri di Tencent su compiti di ingegneria di Tencent, che è la prima cosa di cui diffidare. Un set di compiti curato dall'azienda è esattamente l'ambiente in cui un nuovo modello dà il meglio di sé. Anche ammettendo questo, la forma del risultato è rivelatrice: il 51,2% di vittorie contro il 40,9% di sconfitte è un margine modesto, e il tasso di pareggi del 7,9% indica che i modelli sono molto vicini sulla maggior parte dei compiti. Nei compiti difficili, quelli in cui un modello di frontiera si distingue, il divario sta dove è sempre stato — e il titolo di Tencent, "leggermente avanti a Kimi K3", è formulato onestamente, cosa che non tutti i laboratori pubblicano.

La scala non è il destino

Il confronto dei parametri rende il risultato impressionante o sospetto, a seconda delle tue convinzioni a priori. Kimi K3 ha 2,8 trilioni di parametri totali con 104 miliardi attivi — 896 esperti, 16 attivi per token — ed è stato addestrato a ragionare in modalità sempre attiva con la catena di pensiero esposta. HY4 Preview ha 770 miliardi totali con 49 miliardi attivi, un terzo delle dimensioni totali e meno della metà della potenza di calcolo attiva. Un modello più piccolo che ottiene una vittoria di misura in un test alla cieca su uno più grande è la direzione verso cui l'intero campo degli open-weight si sta muovendo — Qwen3.8-Max, con 2,4T, e GLM-5.2, con 753B, battagliano sui benchmark agentici da mesi — quindi il risultato è plausibile, non stravagante. È anche, cosa cruciale, non verificato da nessuno al di fuori di Tencent.

Il tabellone

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Scala — HY4 Preview 770B totali / 49B attivi vs Kimi K3 2.8T totali / 104B attivi

• Contesto — HY4 Preview >1M token vs Kimi K3 1M token

• Prezzo per 1M — HY4 Preview ¥6 in / ¥18 out (≈$0.85 / $2.50) vs Kimi K3 $3.00 in / $15.00 out, cache hits $0.30

• Modalità — HY4 Preview solo testo vs input nativo di immagini e video di Kimi K3

• Ragionamento — HY4 Preview: nessuna modalità pubblicata vs Kimi K3: ragionamento sempre attivo con chain-of-thought in streaming

• Punteggio indipendente — HY4 Preview nessuno vs Kimi K3 AA Intelligence Index 57, tra i primi tre a livello globale al momento del lancio

Nelle righe in cui entrambe le parti riportano un numero, i modelli si raggruppano. Tencent riporta HY4 Preview a 37.1 su APEX-Agents, essenzialmente in linea con il 37.2 di Kimi K3 — un pareggio ravvicinato che la classifica del test alla cieca prevederebbe. I punteggi di HY4 Preview in Toolathlon-Verified (74.1) e DeepSWE (64.3) non hanno equivalenti in Kimi K3 nei dati in mio possesso; e i punteggi di Kimi K3 in FrontierSWE (81.2), ProgramBench (77.8) e BrowseComp (91.2) non hanno equivalenti in HY4 Preview. La classifica è onesta: le due schede si sovrappongono appena, il che è di per sé un avvertimento a non considerare le righe di nessuno dei due fornitori come una descrizione completa del modello.

La visione è la più grande vera differenza.

Per uno sviluppatore che oggi sceglie tra i due, il divario strutturale non è l'intelligenza — è la modalità di input. Kimi K3 è nativamente multimodale: accetta input di immagini e video tramite il suo encoder MoonViT-V2 ed è tra i migliori modelli open nelle attività di visione, classificandosi secondo a livello globale nella vision arena. Tencent HY4 Preview è solo testuale in questa anteprima, e Tencent ha dichiarato che la visione dovrà attendere la versione completa. Qualsiasi carico di lavoro che richieda screenshot, comprensione dell'interfaccia utente o grounding visivo è di default appannaggio di Kimi K3, indipendentemente da ciò che il test alla cieca dice sull'ingegneria del testo. Se il tuo lavoro è puramente codice, documenti e output di terminale, il divario non ha importanza; nel momento in cui un'attività implica guardare qualcosa, decide l'esito del confronto.

La questione dei costi

Per token, HY4 Preview è drammaticamente più economico: circa $0.85/$2.50 contro i $3.00/$15.00 di Kimi K3, con cache hit a ¥0.3 (circa quattro centesimi) contro $0.30. Ma i due modelli hanno comportamenti token opposti che riducono il divario. Kimi K3 ragiona sempre attivo e trasmette il suo chain-of-thought, il che gonfia i token di output in ogni richiesta; i recensori hanno notato che il modello è più lento — circa 62 token al secondo — e pesante in termini di token per i cicli agente. HY4 Preview, secondo la nota di rilascio di Tencent, "tende a ragionamenti eccessivamente lunghi e a un'eccessiva auto-verifica" su compiti complessi. Entrambi consumano token di output extra; HY4 Preview semplicemente li fa pagare meno. Un confronto equo è il costo per attività completata, e nessuno al di fuori di Tencent ha ancora misurato quello di HY4 Preview.

Il verdetto

Tencent HY4 Preview {{1}}è il rivale più economico, più piccolo e non verificato{{/1}} che rivendica un sottile vantaggio in un test alla cieca rispetto allo standard open-weight; Kimi K3 {{2}}è il modello affermato, più grande, verificato e capace di gestire la visione{{/2}}, che costa da quattro a cinque volte tanto per token e ha un Intelligence Index indipendente di 57. Nessuna scheda benchmark dei due modelli è completamente indipendente — anche i punteggi principali di Kimi K3 sono {{3}}riportati da Moonshot{{/3}}, sebbene il suo Index 57 non lo sia. Se il carico di lavoro è multimodale, Kimi K3 è l'unica scelta in questo confronto. Se invece è testo e ingegneria, HY4 Preview è l'opzione più conveniente, con un confronto diretto reale, seppur gestito dal vendor, e la via economica è instradare Kimi K3 sulla chiave di produzione — è attivo su {{4}}OrcaRouter{{/4}} al prezzo di listino di Moonshot di $3,00/$15,00, trasferito senza markup — mentre si esegue HY4 Preview tramite {{5}}l'API proprietaria di Tencent{{/5}} su carichi di lavoro shadow. Quando HY4 Preview raggiunge un router, la stessa chiave e le stesse regole di failover gestiranno entrambi, e la tariffa di Tencent di ¥6/¥18 sarà trasferita invariata.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

Cosa guardare

• Una ripetizione indipendente dei compiti del test alla cieca. La percentuale di vittoria del 51,2% è la singola affermazione più testabile di questo lancio, e un'infrastruttura di test di terze parti la risolverebbe in una settimana.

• Se HY4 Preview includerà la visione prima del rilascio completo di Hy4. È questo che trasformerebbe questo confronto da una sfida di valore sulla carta in una vera battaglia tra ammiraglie.

• Costo per attività completata su framework agentici standard. Entrambi i modelli consumano molti token; chi è più economico per attività finita vince l'argomento della produzione.

La risposta di Kimi K3 alla pressione sui prezzi. Se Moonshot taglia la tariffa di output di $15, il quadro "sfidante economico vs standard costoso" si ribalta.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube