Titolo che recita GPT-6 Astra vs Tencent HY4 Preview, con il sottotitolo "I numeri di un modello sono stati verificati da qualcun altro. Quelli dell'altro no - e 64.000 token di output è il punto in cui il lato economico si ferma", su un'illustrazione generata di un cubo certificato sigillato accanto a un cubo aperto con strati visibili
Guides & Insights

GPT-6 Astra vs Tencent HY4 Preview: un modello ha una traccia di controllo e l'altro ha una tabella di benchmark

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Tencent HY4 Preview e GPT-6 Astra sono le due vie più economiche verso il coding agentico quasi-frontier disponibile oggi, se si leggono i numeri dei fornitori stessi, e sono i due modelli meno confrontabili di quella fascia, se si leggono i numeri di chiunque altro. Tencent HY4 Preview è stato rilasciato e reso open source il 28 agosto 2026 con licenza Apache 2.0, a 0,834 $ per milione di token in input e 2,501 $ per milione di token in output, con un'architettura mixture-of-experts da 770 miliardi di parametri, una finestra di contesto che supera il milione di token e un tetto di output di 64.000 token. GPT-6 Astra è disponibile a livello generale dal 3 settembre 2026 a 10,00 $ e 50,00 $, con una finestra di 1.050.000 token e un output massimo di 128.000. I punti di forza di Astra sono supportati da otto valutazioni pubblicate di terze parti; quelli di HY4 Preview sono supportati dalle esecuzioni di terminale, tool-calling e valutazione cieca di Tencent, e da nient'altro. Questa asimmetria non significa che il modello più economico sia più debole. Significa che uno di questi due confronti può essere verificato e l'altro deve essere creduto, e le decisioni pratiche differiscono di conseguenza.

Cosa ti offre concretamente la versione Apache 2.0

La licenza è la parte di questo confronto che una tabella di prezzi non può esprimere. Tencent HY4 Preview non è un teaser ospitato con branding open-weight — i pesi sono scaricabili da Hugging Face, GitHub, ModelScope e GitCode, il che significa che il modello sopravvive a qualsiasi decisione Tencent prenda sui propri prezzi, sul proprio endpoint o sul proprio interesse continuato a servirlo.

• Architettura — 770B parametri totali, 49B attivi per token, 78 livelli, 256 esperti instradati più un esperto condiviso, e un livello nativo di predizione multi-token per la decodifica speculativabr /> • Caratteristiche di servizio — 54,6 token di output al secondo e un tempo mediano al primo token di 6,26 secondi, misurati attraverso le route di OrcaRouter su una finestra mobile di sette giornibr /> • Contesto e limite — una finestra di 1.048.576 token rispetto a un output massimo di 64.000 tokenbr /> • Superficie di input — solo testo; nessuna immagine, nessun file, nessun audiobr /> • Controllo del ragionamento — tre livelli, alto, basso e nessuno, con alto come predefinito, più una raccomandazione di campionamento documentata di temperatura 0,9 e top_p 1,0br /> • Affidabilità — un tasso di errore del 2,8% sulla stessa finestra di sette giorni, rispetto al 10,3% sulla route Astra

Quell'ultima coppia di numeri è la cosa su cui si può agire più concretamente in questa pagina, ed è il tipo di dato che nessun fornitore pubblica sul proprio modello. I punteggi di benchmark indipendenti di Astra sono più alti e la sua rotta ha fallito circa una richiesta su dieci nell'ultima settimana, mentre un modello senza alcun punteggio indipendente ha fallito una su trentacinque. Nessuno dei due dati è un'affermazione sui modelli stessi — i tassi di errore misurano la rotta, i limiti di frequenza e l'upstream, non i pesi — ma sono i numeri che un sistema in produzione sperimenta davvero.

Comparison card with two columns. GPT-6 Astra: $10.00/$50.00 per 1M, cached input $1.00, $20.00/$75.00 whole-request reprice above 272K input, 1,050,000 context / 128,000 max output, 54.7 index and 88.4 Terminal-Bench 2.1 third-party, 10.3% error and 70.6 tok/s over a rolling seven-day OrcaRouter route window. Tencent HY4 Preview: $0.834/$2.501 per 1M, cached input $0.042, 770B MoE with 49B active and Apache 2.0 weights, 1,048,576 context / 64,000 max output, 85.4 Terminal-Bench 2.1 and 74.1 Toolathlon vendor-reported with no independent index, 2.8% error and 54.6 tok/s over the same window

Dove i numeri di Tencent possono essere verificati rispetto a quelli di qualcun altro

Questa è, stando alle evidenze pubblicate, un'opportunità davvero insolita: sia Astra sia HY4 Preview hanno un dato di Terminal-Bench 2.1, e solo uno dei due è riportato dal fornitore.

• Terminal-Bench 2.1, guida di un terminale reale — GPT-6 Astra 88.4, valutato in modo indipendente; Tencent HY4 Preview 85.4, riportato dal fornitorebr /> • Chiamata di strumenti — Astra 41.4 su τ²-Banking, valutato in modo indipendente; HY4 Preview 74.1 su Toolathlon-Verified, riportato dal fornitore, su un test diversobr /> • Ingegneria del software — HY4 Preview 64.3 su DeepSWE, in aumento da 28.0 sul suo predecessore Hy3, riportato dal fornitorebr /> • Compiti per agenti — HY4 Preview 37.1 pass@1 su APEX-Agents, riportato dal fornitorebr /> • Preferenza umana — una media di 2.99 su 4.00 su 203 attività di ingegneria valutate da 163 esperti, condotto dal fornitore, rispetto a GLM-5.3 a 2.92 e Kimi K3 a 2.94br /> • Indice indipendente — GPT-6 Astra 54.7 Intelligence Index e 96.1 GPQA Diamond, di terze parti; non esiste un indice equivalente per HY4 Preview

La riga di Terminal-Bench è quella su cui vale la pena soffermarsi. Un divario di 3 punti tra un 88,4 indipendente e un 85,4 dichiarato dal fornitore rientra ampiamente nell'intervallo che un harness diverso, uno scaffold diverso o una diversa temperatura di campionamento possono produrre, il che significa che la lettura onesta non è «Astra è superiore di tre punti», ma «il modello open-weight più economico di questa fascia rivendica la parità, e la rivendicazione è quantomeno plausibile». La stessa impostazione di Tencent è cauta su questo punto: descrive DeepSWE come un modello che «riduce gradualmente il divario» anziché chiuderlo, e la sua unica, netta rivendicazione di parità — il pareggio su Terminal-Bench con un modello chiuso di primo livello di un altro fornitore — è esattamente la rivendicazione che più di ogni altra necessita di una seconda misurazione.

C'è anche un cambiamento che vale la pena conoscere, perché sposta l'economia anziché i punteggi. Il 7 settembre 2026 Tencent ha introdotto un'ottimizzazione nella build di anteprima live che, a suo dire, riduce i passaggi di ragionamento e il consumo di token per attività nei lavori complessi. Poiché il modello fattura per token, meno token per attività completata abbassano il costo dell'attività anche se la tariffa per token non è cambiata. L'entità di quel risparmio è una misurazione di Tencent e nessuno al di fuori di Tencent l'ha riprodotta — ma il meccanismo è reale ed è il motivo per cui un'anteprima rilasciata ad agosto può essere sostanzialmente più economica da gestire a ottobre di quanto suggerisse il suo documento di lancio.

Il limite di 64.000 token è la specifica che le distribuzioni

A metà della scheda tecnica c'è il vincolo che morde per primo, e non è la qualità. L'output massimo di HY4 Preview è di 64.000 token contro i 128.000 di Astra, su un modello la cui finalità dichiarata sono gli agenti di codifica e le lunghe catene di utilizzo degli strumenti. Un file generato, una patch multi-file, un lungo report strutturato — questi sono gli output che raggiungono un tetto massimo, e durante un'esecuzione di un agente il fallimento non è una risposta leggermente peggiore, ma una risposta troncata che la pipeline circostante deve rilevare e gestire.

Entrambi i modelli accettano circa un milione di token di input, quindi il caso della lettura di documenti è davvero un pareggio. La differenza è interamente sul lato della generazione, ed è un fattore due, non un errore di arrotondamento. Aggiungiamo la differenza nella superficie di input — Astra accetta immagini e file, HY4 Preview è solo testo — e il quadro che emerge è una netta divisione del lavoro più che una classifica: il modello open-weight per i cicli agente testo-in, testo-out in cui il risultato è una chiamata a uno strumento o un diff, e il modello closed per qualsiasi cosa che debba guardare qualcosa o scrivere qualcosa di lungo.

Cosa ti dà un tasso di output 20×, riga per riga

• Prezzo di input — Tencent HY4 Preview 0,834 $ per 1M vs GPT-6 Astra 10,00 $, circa 12×br /> • Prezzo di output — HY4 Preview 2,501 $ per 1M vs Astra 50,00 $, circa 20×br /> • Input in cache — HY4 Preview 0,042 $ per 1M vs Astra 1,00 $, circa 24×br /> • Scaglione per richieste lunghe — Astra applica una nuova tariffa all'intera richiesta oltre i 272.000 token di input, portandola a 20,00 $ e 75,00 $; la scheda di HY4 Preview non prevede uno scaglione equivalentebr /> • Tariffa di input effettiva su un prompt da 400.000 token — HY4 Preview invariata a 0,834 $ vs Astra 20,00 $, circa 24×br /> • Costo per milione di token di un normale ciclo di agente, con rapporto input/output di 4:1 — HY4 Preview circa 1,17 $ vs Astra circa 18,00 $br /> • Costo di un mese da 100 milioni di token allo stesso rapporto — HY4 Preview circa 117 $ vs Astra circa 1.800 $

La voce dell'input in cache è quella che scala peggio per il lato costoso, perché i loop degli agenti reinviano lo stesso system prompt e lo stesso prefisso di conversazione a ogni turno. A 0,042 $ contro 1,00 $, i token più economici di un loop lungo costano 24 volte meno sul modello Tencent, che è esattamente il carico di lavoro in cui una piccola differenza per token si accumula più rapidamente. Il costo per attività, la metrica che risolverebbe la questione in modo pulito, non è affatto pubblicata da Tencent — quindi l'unico modo per ottenere il numero che conta è far passare entrambi i modelli attraverso il tuo set di attività e leggere l'oggetto usage.

Text card headed 'The 64,000-token ceiling decides more deployments than quality does' with rows: max output 128,000 on GPT-6 Astra vs 64,000 on Tencent HY4 Preview; context 1,050,000 vs 1,048,576; input surface text image file vs text only; what breaks first is a generated file or multi-file patch; failure mode is silent truncation

Ciò che un router aggiunge qui, con i tassi di errore in mano

Entrambi i modelli sono nel catalogo OrcaRouter — tencent/hy4-preview e openai/gpt-6-astra — dietro un unico endpoint compatibile con OpenAI, ciascuno al prezzo di listino del proprio provider, passato senza alcun ricarico (markup 0%). Quest'ultimo dettaglio conta più su questa coppia che sulla maggior parte delle altre, perché il prezzo di listino del modello Tencent è pubblicato in yuan: le cifre in dollari sopra riportate sono il tasso convertito che vedi effettivamente, non un margine da rivenditore, e se Tencent modifica il prezzo, la modifica è attiva qui lo stesso giorno anziché al rinnovo contrattuale successivo.

Il DSL di routing è il punto in cui i due modelli smettono di essere alternative. La regola naturale per questa coppia è l'escalation sull'output: mandare il loop al modello economico e, quando una risposta torna troncata rispetto al tetto di 64.000 token o non supera il controllo dello schema, ritentare quel passaggio su openai/gpt-6-astra, che ha il doppio dello spazio di output. Il failover automatico è l'altra metà della questione, e non è teorico quando una delle due route ha restituito errori su una richiesta su dieci nell'ultima settimana — una lunga esecuzione di un agente ancorata a un singolo modello muore insieme al suo contesto accumulato, e nessuno di questi due modelli è abbastanza economico da poter essere rieseguito dall'inizio per errore.

Text card headed 'Checked by somebody else, or checked by the vendor' with rows: GPT-6 Astra 54.7 Intelligence Index against none published for HY4 Preview; Terminal-Bench 2.1 88.4 independently evaluated vs 85.4 Tencent-reported; Tencent's 7 September reasoning-turn optimisation, unreproduced outside the vendor; and route error 10.3% on the Astra route vs 2.8% on the HY4 route over a rolling seven-day window

Cosa cambierebbe questo confronto

Tre cose, in ordine di quanto sposterebbero l'ago della bilancia. Una valutazione indipendente di HY4 Preview — il modello è pubblico da sei settimane, non ha un indice di terze parti, nessun numero riprodotto di Terminal-Bench e nessuna cifra di costo per attività, e l'unica valutazione in cieco condotta dal fornitore è l'unico dato esistente sulle preferenze umane. Un costo pubblicato per attività completata per entrambi i modelli, che sostituirebbe ogni rapporto in questo articolo con un unico numero. E una decisione di Tencent sull'inferenza di terze parti, perché i pesi Apache 2.0 possono essere serviti da chiunque, e nel momento in cui host concorrenti mettono in piedi HY4 Preview, il prezzo dal lato economico di questo confronto diventa un mercato anziché un listino.

Fino a quel momento, il riepilogo utilizzabile è più limitato di quello del post di lancio di entrambi i fornitori e più onesto di un tabellone: GPT-6 Astra è il modello le cui dichiarazioni sulle capacità sono state verificate, con il doppio del tetto di output e un percorso che ha fallito una richiesta su dieci. Tencent HY4 Preview è il modello le cui dichiarazioni sulle capacità non sono state verificate, con un'architettura pubblicata, una licenza aperta, un prezzo pari a un terzo e un tasso di errore molto più basso nello stesso periodo. Se il tuo lavoro è testo in input, testo in output e rientra entro 64.000 token generati, il modello più economico non è un compromesso — è la risposta giusta, e l'unica cosa a cui rinunci è la traccia di controllo.

La regola naturale per questa coppia è l'escalation sull'output: invia il loop al modello economico e, quando una risposta torna troncata rispetto al limite di 64.000 token o non supera il controllo dello schema, riprova quel passaggio con openai/gpt-6-astra, che ha il doppio dello spazio di output.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno