
GPT-6 Astra vs Tencent HY4 Preview: un modello ha una traccia di controllo e l'altro ha una tabella di benchmark
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Tencent HY4 Preview e GPT-6 Astra sono le due vie più economiche verso il coding agentico quasi-frontier disponibile oggi, se si leggono i numeri dei fornitori stessi, e sono i due modelli meno confrontabili di quella fascia, se si leggono i numeri di chiunque altro. Tencent HY4 Preview è stato rilasciato e reso open source il 28 agosto 2026 con licenza Apache 2.0, a 0,834 $ per milione di token in input e 2,501 $ per milione di token in output, con un'architettura mixture-of-experts da 770 miliardi di parametri, una finestra di contesto che supera il milione di token e un tetto di output di 64.000 token. GPT-6 Astra è disponibile a livello generale dal 3 settembre 2026 a 10,00 $ e 50,00 $, con una finestra di 1.050.000 token e un output massimo di 128.000. I punti di forza di Astra sono supportati da otto valutazioni pubblicate di terze parti; quelli di HY4 Preview sono supportati dalle esecuzioni di terminale, tool-calling e valutazione cieca di Tencent, e da nient'altro. Questa asimmetria non significa che il modello più economico sia più debole. Significa che uno di questi due confronti può essere verificato e l'altro deve essere creduto, e le decisioni pratiche differiscono di conseguenza.
Cosa ti offre concretamente la versione Apache 2.0
La licenza è la parte di questo confronto che una tabella di prezzi non può esprimere. Tencent HY4 Preview non è un teaser ospitato con branding open-weight — i pesi sono scaricabili da Hugging Face, GitHub, ModelScope e GitCode, il che significa che il modello sopravvive a qualsiasi decisione Tencent prenda sui propri prezzi, sul proprio endpoint o sul proprio interesse continuato a servirlo.
• Architettura — 770B parametri totali, 49B attivi per token, 78 livelli, 256 esperti instradati più un esperto condiviso, e un livello nativo di predizione multi-token per la decodifica speculativabr /> • Caratteristiche di servizio — 54,6 token di output al secondo e un tempo mediano al primo token di 6,26 secondi, misurati attraverso le route di OrcaRouter su una finestra mobile di sette giornibr /> • Contesto e limite — una finestra di 1.048.576 token rispetto a un output massimo di 64.000 tokenbr /> • Superficie di input — solo testo; nessuna immagine, nessun file, nessun audiobr /> • Controllo del ragionamento — tre livelli, alto, basso e nessuno, con alto come predefinito, più una raccomandazione di campionamento documentata di temperatura 0,9 e top_p 1,0br /> • Affidabilità — un tasso di errore del 2,8% sulla stessa finestra di sette giorni, rispetto al 10,3% sulla route Astra
Quell'ultima coppia di numeri è la cosa su cui si può agire più concretamente in questa pagina, ed è il tipo di dato che nessun fornitore pubblica sul proprio modello. I punteggi di benchmark indipendenti di Astra sono più alti e la sua rotta ha fallito circa una richiesta su dieci nell'ultima settimana, mentre un modello senza alcun punteggio indipendente ha fallito una su trentacinque. Nessuno dei due dati è un'affermazione sui modelli stessi — i tassi di errore misurano la rotta, i limiti di frequenza e l'upstream, non i pesi — ma sono i numeri che un sistema in produzione sperimenta davvero.

Dove i numeri di Tencent possono essere verificati rispetto a quelli di qualcun altro
Questa è, stando alle evidenze pubblicate, un'opportunità davvero insolita: sia Astra sia HY4 Preview hanno un dato di Terminal-Bench 2.1, e solo uno dei due è riportato dal fornitore.
• Terminal-Bench 2.1, guida di un terminale reale — GPT-6 Astra 88.4, valutato in modo indipendente; Tencent HY4 Preview 85.4, riportato dal fornitorebr /> • Chiamata di strumenti — Astra 41.4 su τ²-Banking, valutato in modo indipendente; HY4 Preview 74.1 su Toolathlon-Verified, riportato dal fornitore, su un test diversobr /> • Ingegneria del software — HY4 Preview 64.3 su DeepSWE, in aumento da 28.0 sul suo predecessore Hy3, riportato dal fornitorebr /> • Compiti per agenti — HY4 Preview 37.1 pass@1 su APEX-Agents, riportato dal fornitorebr /> • Preferenza umana — una media di 2.99 su 4.00 su 203 attività di ingegneria valutate da 163 esperti, condotto dal fornitore, rispetto a GLM-5.3 a 2.92 e Kimi K3 a 2.94br /> • Indice indipendente — GPT-6 Astra 54.7 Intelligence Index e 96.1 GPQA Diamond, di terze parti; non esiste un indice equivalente per HY4 Preview
La riga di Terminal-Bench è quella su cui vale la pena soffermarsi. Un divario di 3 punti tra un 88,4 indipendente e un 85,4 dichiarato dal fornitore rientra ampiamente nell'intervallo che un harness diverso, uno scaffold diverso o una diversa temperatura di campionamento possono produrre, il che significa che la lettura onesta non è «Astra è superiore di tre punti», ma «il modello open-weight più economico di questa fascia rivendica la parità, e la rivendicazione è quantomeno plausibile». La stessa impostazione di Tencent è cauta su questo punto: descrive DeepSWE come un modello che «riduce gradualmente il divario» anziché chiuderlo, e la sua unica, netta rivendicazione di parità — il pareggio su Terminal-Bench con un modello chiuso di primo livello di un altro fornitore — è esattamente la rivendicazione che più di ogni altra necessita di una seconda misurazione.
C'è anche un cambiamento che vale la pena conoscere, perché sposta l'economia anziché i punteggi. Il 7 settembre 2026 Tencent ha introdotto un'ottimizzazione nella build di anteprima live che, a suo dire, riduce i passaggi di ragionamento e il consumo di token per attività nei lavori complessi. Poiché il modello fattura per token, meno token per attività completata abbassano il costo dell'attività anche se la tariffa per token non è cambiata. L'entità di quel risparmio è una misurazione di Tencent e nessuno al di fuori di Tencent l'ha riprodotta — ma il meccanismo è reale ed è il motivo per cui un'anteprima rilasciata ad agosto può essere sostanzialmente più economica da gestire a ottobre di quanto suggerisse il suo documento di lancio.
Il limite di 64.000 token è la specifica che le distribuzioni
A metà della scheda tecnica c'è il vincolo che morde per primo, e non è la qualità. L'output massimo di HY4 Preview è di 64.000 token contro i 128.000 di Astra, su un modello la cui finalità dichiarata sono gli agenti di codifica e le lunghe catene di utilizzo degli strumenti. Un file generato, una patch multi-file, un lungo report strutturato — questi sono gli output che raggiungono un tetto massimo, e durante un'esecuzione di un agente il fallimento non è una risposta leggermente peggiore, ma una risposta troncata che la pipeline circostante deve rilevare e gestire.
Entrambi i modelli accettano circa un milione di token di input, quindi il caso della lettura di documenti è davvero un pareggio. La differenza è interamente sul lato della generazione, ed è un fattore due, non un errore di arrotondamento. Aggiungiamo la differenza nella superficie di input — Astra accetta immagini e file, HY4 Preview è solo testo — e il quadro che emerge è una netta divisione del lavoro più che una classifica: il modello open-weight per i cicli agente testo-in, testo-out in cui il risultato è una chiamata a uno strumento o un diff, e il modello closed per qualsiasi cosa che debba guardare qualcosa o scrivere qualcosa di lungo.
Cosa ti dà un tasso di output 20×, riga per riga
• Prezzo di input — Tencent HY4 Preview 0,834 $ per 1M vs GPT-6 Astra 10,00 $, circa 12×br /> • Prezzo di output — HY4 Preview 2,501 $ per 1M vs Astra 50,00 $, circa 20×br /> • Input in cache — HY4 Preview 0,042 $ per 1M vs Astra 1,00 $, circa 24×br /> • Scaglione per richieste lunghe — Astra applica una nuova tariffa all'intera richiesta oltre i 272.000 token di input, portandola a 20,00 $ e 75,00 $; la scheda di HY4 Preview non prevede uno scaglione equivalentebr /> • Tariffa di input effettiva su un prompt da 400.000 token — HY4 Preview invariata a 0,834 $ vs Astra 20,00 $, circa 24×br /> • Costo per milione di token di un normale ciclo di agente, con rapporto input/output di 4:1 — HY4 Preview circa 1,17 $ vs Astra circa 18,00 $br /> • Costo di un mese da 100 milioni di token allo stesso rapporto — HY4 Preview circa 117 $ vs Astra circa 1.800 $
La voce dell'input in cache è quella che scala peggio per il lato costoso, perché i loop degli agenti reinviano lo stesso system prompt e lo stesso prefisso di conversazione a ogni turno. A 0,042 $ contro 1,00 $, i token più economici di un loop lungo costano 24 volte meno sul modello Tencent, che è esattamente il carico di lavoro in cui una piccola differenza per token si accumula più rapidamente. Il costo per attività, la metrica che risolverebbe la questione in modo pulito, non è affatto pubblicata da Tencent — quindi l'unico modo per ottenere il numero che conta è far passare entrambi i modelli attraverso il tuo set di attività e leggere l'oggetto usage.

Ciò che un router aggiunge qui, con i tassi di errore in mano
Entrambi i modelli sono nel catalogo OrcaRouter — tencent/hy4-preview e openai/gpt-6-astra — dietro un unico endpoint compatibile con OpenAI, ciascuno al prezzo di listino del proprio provider, passato senza alcun ricarico (markup 0%). Quest'ultimo dettaglio conta più su questa coppia che sulla maggior parte delle altre, perché il prezzo di listino del modello Tencent è pubblicato in yuan: le cifre in dollari sopra riportate sono il tasso convertito che vedi effettivamente, non un margine da rivenditore, e se Tencent modifica il prezzo, la modifica è attiva qui lo stesso giorno anziché al rinnovo contrattuale successivo.
Il DSL di routing è il punto in cui i due modelli smettono di essere alternative. La regola naturale per questa coppia è l'escalation sull'output: mandare il loop al modello economico e, quando una risposta torna troncata rispetto al tetto di 64.000 token o non supera il controllo dello schema, ritentare quel passaggio su openai/gpt-6-astra, che ha il doppio dello spazio di output. Il failover automatico è l'altra metà della questione, e non è teorico quando una delle due route ha restituito errori su una richiesta su dieci nell'ultima settimana — una lunga esecuzione di un agente ancorata a un singolo modello muore insieme al suo contesto accumulato, e nessuno di questi due modelli è abbastanza economico da poter essere rieseguito dall'inizio per errore.

Cosa cambierebbe questo confronto
Tre cose, in ordine di quanto sposterebbero l'ago della bilancia. Una valutazione indipendente di HY4 Preview — il modello è pubblico da sei settimane, non ha un indice di terze parti, nessun numero riprodotto di Terminal-Bench e nessuna cifra di costo per attività, e l'unica valutazione in cieco condotta dal fornitore è l'unico dato esistente sulle preferenze umane. Un costo pubblicato per attività completata per entrambi i modelli, che sostituirebbe ogni rapporto in questo articolo con un unico numero. E una decisione di Tencent sull'inferenza di terze parti, perché i pesi Apache 2.0 possono essere serviti da chiunque, e nel momento in cui host concorrenti mettono in piedi HY4 Preview, il prezzo dal lato economico di questo confronto diventa un mercato anziché un listino.
Fino a quel momento, il riepilogo utilizzabile è più limitato di quello del post di lancio di entrambi i fornitori e più onesto di un tabellone: GPT-6 Astra è il modello le cui dichiarazioni sulle capacità sono state verificate, con il doppio del tetto di output e un percorso che ha fallito una richiesta su dieci. Tencent HY4 Preview è il modello le cui dichiarazioni sulle capacità non sono state verificate, con un'architettura pubblicata, una licenza aperta, un prezzo pari a un terzo e un tasso di errore molto più basso nello stesso periodo. Se il tuo lavoro è testo in input, testo in output e rientra entro 64.000 token generati, il modello più economico non è un compromesso — è la risposta giusta, e l'unica cosa a cui rinunci è la traccia di controllo.
La regola naturale per questa coppia è l'escalation sull'output: invia il loop al modello economico e, quando una risposta torna troncata rispetto al limite di 64.000 token o non supera il controllo dello schema, riprova quel passaggio con openai/gpt-6-astra, che ha il doppio dello spazio di output.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
