Scheda hero generata intitolata Claude Sonnet 5.5 vs Tencent HY4 Preview, con sottotitolo entrambi i laboratori vendono la bolletta dei token, con tre schede statistiche: prezzo di output per 1M 10,00 $ vs 2,50 $, pesi chiusi vs Apache 2.0, e velocità di output misurata 138,7 vs 22,3 token al secondo, con un footer che recita prezzo e velocità di Tencent HY4 Preview secondo il catalogo di OrcaRouter, listino fornitori 6 / 18 yuan per milione; Claude Sonnet 5.5 secondo Anthropic.
Guides & Insights

Claude Sonnet 5.5 vs Tencent HY4 Preview: entrambi i laboratori vendono il conto dei token

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due lanci, a sei settimane di distanza, che fanno la stessa promessa con parole diverse. L'affermazione del fornitore è che Claude Sonnet 5.5, rilasciato il 28 settembre 2026, costa "fino al 30% in meno per attività" rispetto a Claude Sonnet 5 a tariffe per token invariate. La seconda affermazione è che l'ottimizzazione del 7 settembre alla build ospitata di Tencent HY4 Preview, pubblicata per la prima volta e resa open source il 28 agosto 2026, riduce i turni di ragionamento e il consumo di token per attività a parità di qualità del compito. Nessuno dei due fornitori ha aumentato o diminuito un prezzo per fare tale affermazione. Entrambi ti stanno dicendo che i token sono il prodotto ora, e la parte interessante di questo confronto è che solo una delle due affermazioni può essere verificata rispetto a una cifra pubblicata per attività — perché solo uno di questi due modelli ha una misurazione indipendente con cui verificarla.

Quell'asimmetria non è una critica a T​encent. HY4 Preview non ha una pagina modello su Artificial Analysis, nessun punteggio indipendente dell'Intelligence Index e nessun dato di costo per attività da parte di terzi. Quello che ha è una tabella di benchmark del fornitore — Terminal-Bench 2.1 a 85,4, DeepSWE 64,3, una valutazione interna in cieco su 203 attività di ingegneria in cui ha ottenuto una media di 2,99 contro GLM-5.3 a 2,92 e Kimi K3 a 2,94 — e un debutto pubblico votato dalla comunità nella classifica di WebDev Arena, dove T​encent riferisce che si è piazzato intorno al quinto posto complessivo e terzo tra i modelli open-weight. Tutti questi sono segnali reali. Nessuno di essi è un costo per attività, il che significa che il numero esatto sul quale entrambi i fornitori competono è, per HY4 Preview, non disponibile.

Cosa ha effettivamente consegnato ciascuna parte

Tencent HY4 Preview è un mixture of experts da 770 miliardi di parametri con 49 miliardi attivi per token, 78 layer, 256 esperti instradati più un esperto condiviso, un layer MTP nativo per la decodifica speculativa e una finestra di contesto che supera il milione di token. È solo testo per scelta progettuale — T​encent l'ha creato per agenti di coding, uso complesso di strumenti e lavoro di produttività, non per le immagini — e per impostazione predefinita attiva il ragionamento intenso, con tre livelli configurabili (alto, basso, nessuno) e un'impostazione di campionamento consigliata dal fornitore con temperatura 0.9 e top_p 1.0. I pesi sono Apache 2.0 e scaricabili da Hugging Face, GitHub, ModelScope e GitCode. Tencent aveva originariamente segnalato due difetti nell'anteprima, impiegare più tempo del necessario per pensare e verificare eccessivamente il proprio lavoro, e l'aggiornamento del 7 settembre mira esattamente a questi.

Claude Sonnet 5.5 è il secondo modello della generazione 5.5 di Anthropic e quello che l'azienda posiziona come la migliore combinazione di velocità e intelligenza della gamma. Un milione di token di contesto, 128.000 token di output in modo sincrono e 300.000 sull'API Message Batches, input di testo, immagini e file, pensiero adattivo con livello di sforzo selezionabile, una data limite delle conoscenze fissata a giugno 2026, conservazione zero dei dati disponibile dal lancio e una data minima di dismissione del 28 settembre 2027. Il listino prezzi non è cambiato rispetto a Claude Sonnet 5: 2,00 $ per milione di token di input, 10,00 $ per milione di token di output, 0,20 $ per le letture dalla cache e 2,50 $ per le scritture in cache. Pesi chiusi, Anthropic API oltre a Bedrock, Google Cloud e Microsoft Foundry.

Metti a confronto i due e le posizioni sono quasi simmetriche:

• Prezzo — Claude Sonnet 5.5 $2,00 in input / $10,00 in output per milione vs Tencent HY4 Preview $0,83 in input / $2,50 in output sul nostro catalogo, da un listino fornitori di ¥6 / ¥18

• Letture dalla cache — Claude Sonnet 5.5 $0,20 per milione rispetto a Tencent HY4 Preview $0,042 per milione sul nostro catalogo

• Pesi — Claude Sonnet 5.5 closed vs Tencent HY4 Preview Apache 2.0, downloadable

• Contesto — Claude Sonnet 5.5 1.000.000 di token contro Tencent HY4 Preview 1.048.576 token, praticamente identici

• Output massimo — Claude Sonnet 5.5 128.000 in modalità sincrona, 300.000 su Batches rispetto a Tencent HY4 Preview 64.000 nel nostro catalogo

• Modalità di input — Claude Sonnet 5.5 testo, immagine e file vs Tencent HY4 Preview solo testo

• Punteggi indipendenti — Claude Sonnet 5.5 Intelligence Index 56 a 7,60 $ per attività, revisione v4.3.2 vs Tencent HY4 Preview nessuno pubblicato

• Velocità di output misurata — Claude Sonnet 5.5 138,7 token/sec contro Tencent HY4 Preview 22,3 token/sec sul nostro traffico

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

L'affermazione che entrambi i laboratori stanno facendo, e perché una di esse è verificabile

Il "30% in meno per attività" di Anthropic e il "meno turni di ragionamento, minor consumo di token" di Tencent sono lo stesso progetto di ingegneria descritto da due prospettive: far sì che il modello consumi meno token per arrivare alla stessa risposta. Anthropic dichiara esplicitamente che le tariffe non sono cambiate, il che significa che qualsiasi risparmio per attività deve provenire dal conteggio dei token — e la classifica indipendente ti permette di vedere la forma del problema anziché la dimensione della soluzione. Claude Sonnet 5.5 genera 410 milioni di token di output in tutta la valutazione Intelligence Index, contro 117 milioni per MiniMax M3 e 77 milioni per Grok 4.5. È un modello prolisso, misurato, su una classifica che pubblica il numero. Qualunque sia l'entità del miglioramento del 30% rispetto a Claude Sonnet 5, esso viene applicato a una base molto ampia.

Per HY4 Preview il dato equivalente non esiste pubblicamente. La nota di ottimizzazione di Tencent è l'unica testimonianza in merito, e afferma il risultato senza un numero: meno turni, meno token di input e output, stessa qualità, convalidato da metriche di benchmark e valutazione umana in un doppio passaggio. Questa è un'affermazione del fornitore in senso stretto — dichiarata, plausibile, non riprodotta — ed è etichettata come tale qui. Adottare un modello in anteprima sulla base dell'affermazione di un fornitore sull'economia dei token, quando l'economia dei token è proprio ciò che non puoi misurare dall'esterno, è esattamente la scommessa che una versione in anteprima ti chiede di fare.

Un ulteriore dettaglio è utile da conoscere prima che qualcuno pianifichi un deployment self-hosted attorno a quell'ottimizzazione. La modifica di Tencent del 7 settembre si applica alla build che Tencent distribuisce sui propri endpoint ospitati. Lo snapshot open-weight non è stato aggiornato — la data dell'ultima modifica del repository Hugging Face è ancora il 28 agosto — quindi una copia self-hosted dei pesi esegue il comportamento originale, con ragionamento più lungo, segnalato nelle note dell'anteprima. La versione ottimizzata e la versione scaricabile non sono lo stesso artefatto.

Dove i pesi aperti danno i loro frutti è nello stesso posto in cui li danno sempre: un deployment che non può chiamare un'API. Un modello con 770 miliardi di parametri e 49 miliardi attivi è una decisione da datacenter più che da workstation, quindi non è la storia da laptop che racconta un modello da 30 miliardi — ma per un acquirente che ha bisogno del modello all'interno del proprio perimetro, Apache 2.0 a quella scala è un'opzione che Claude Sonnet 5.5 non offre a nessun prezzo.

Provare un'anteprima senza puntare su di essa un percorso di produzione

I modelli di anteprima sono il caso in cui il routing smette di essere un'ottimizzazione dei costi e diventa un controllo del rischio. La ragione per mettere una build di anteprima dietro un router anziché chiamarla direttamente è che un'anteprima è definita dalla possibilità che cambi sotto di te, e le due cose che vuoi dallo strato che la precede sono una ripartizione percentuale e qualcosa in grado di intercettare i guasti.

Questa è la struttura che OrcaRouter offre: un unico endpoint compatibile con OpenAI che copre oltre 200 modelli, con il prezzo di listino del provider passato senza alcun ricarico, failover automatico tra provider upstream, e un DSL di routing per comporre chiamate a partire da più modelli. Tencent HY4 Preview è instradabile qui già da oggi come tencent/hy4-preview a $0,83 in input e $2,50 in output per milione di token, con letture dalla cache a $0,042 sulla sua finestra di 1.048.576 token — la stessa build, alla tariffa del provider, raggiungibile con la chiave che già usi per tutto il resto del catalogo. Anche Claude Sonnet 5 è instradabile qui, ai $2,00 e $10,00 di Anthropic, e lo è dal 30 giugno; rappresenta un ovvio partner di failover mentre un modello vecchio di un giorno accumula evidenze in produzione.

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5 di per sé non è nel nostro catalogo. È stato rilasciato ieri, la via per arrivarci è l'API di Anthropic stessa, e questa pagina non suggerirà il contrario: il senso del consiglio di routing è che il modo sicuro di eseguire un livello nuovissimo in produzione è dargli una fetta di traffico con qualcosa di collaudato alle spalle, e questo funziona solo quando entrambe le estremità dell'accordo si trovano in un posto raggiungibile da un unico punto. HY4 Preview qui sta sostenendo 372mila token di traffico a settimana, che è l'aspetto di una preview di due giorni prima che qualcuno si sia impegnato ad adottarla; Claude Sonnet 5 sostiene 7,9 milioni a settimana dal 30 giugno, e questa è la differenza tra un candidato e una base.

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

Dove vanno effettivamente i soldi

Sulle sole tariffe, HY4 Preview costa quattro volte meno in output rispetto a Claude Sonnet 5.5 e quasi cinque volte meno sulle letture della cache, e corrisponde sulla finestra. Sul versante misurato, Claude Sonnet 5.5 genera output sei volte più velocemente sul nostro traffico — 138,7 token al secondo contro 22,3 — un divario che trasforma un vantaggio tariffario di quattro volte in un vantaggio in tempo reale molto più contenuto, e talvolta in una perdita, una volta tenuto conto dell'accodamento.

Tra questi due fatti, la decisione poggia su quattro domande a cui solo il lettore può rispondere. Il lavoro richiede un'immagine o un file nel prompt? HY4 Preview è solo testo e questo chiude la questione. Deve portare a termine un'attività software in più passaggi, dove il punteggio di 85.4 di HY4 Preview su Terminal-Bench 2.1 è un dato di T​encent stesso e non riprodotto? Allora lo stato di anteprima è il rischio che stai accettando, e l'ottimizzazione del 7 settembre vale la pena di essere ritestata anziché data per buona. Il carico di lavoro deve girare all'interno del tuo perimetro? Allora i pesi Apache 2.0 sono il fattore decisivo. E il livello di capacità composita conta più della tariffa? Allora il 56 misurato in modo indipendente di Claude Sonnet 5.5 è il numero da soppesare, a $7.60 per attività dell'Index, con l'avvertenza che non esiste una cifra equivalente dal lato T​encent con cui confrontarlo.

Ciò che entrambi i lanci dimostrano davvero è che la frontiera è andata oltre i listini prezzi. Due laboratori, a sei settimane di distanza, hanno rilasciato modelli e hanno puntato sul consumo di token per attività anziché sul prezzo per milione, e la conseguenza pratica per un acquirente è che il numero utile non è più sulla pagina dei prezzi di nessuno dei due fornitori. È il conteggio dei token che il tuo carico di lavoro produce, misurato su entrambi i modelli, ed è l'unico dato in questo articolo che nessuno dei due fornitori può darti.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno