
GPT-6 Sol vs Tencent HY4 Preview: il modello più economico sostiene un traffico seicento volte superiore
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
I confronti tra un modello di frontiera e uno economico di solito finiscono alla tabella dei prezzi, e questo ha un finale migliore a disposizione. Tencent HY4 Preview e GPT-6 Sol sono entrambi instradati da OrcaRouter, il che significa che la stessa telemetria copre entrambi, e nello stesso intervallo mobile di sette giorni il modello HY4 Preview ha mosso circa 2,4 miliardi di token contro i circa 3,9 milioni di GPT-6 Sol. Non è un benchmark e non è un verdetto; è una finestra mobile sul traffico di una piattaforma e la settimana prossima si leggerà diversamente. Ma è un segnale reale su ciò a cui ricorrono davvero le persone che costruiscono cose quando un forte modello open-weight costa un quarto di quello closed, ed è il tipo di numero che una scheda tecnica non può produrre.
I due modelli sono anche un caso di studio su ciò che un benchmark può e non può dirti. GPT-6 Sol, rilasciato il 22 settembre 2026 come fascia intermedia della generazione GPT-6 di OpenAI, ha un punteggio indipendente nell'Intelligence Index. HY4 Preview, rilasciato e reso open source da Tencent il 28 agosto 2026, non ha alcuna pagina del modello su Artificial Analysis, nessun indice di terze parti e nessun dato di costo indipendente per singola attività. Tutto ciò che è stato pubblicato su quanto bene funzioni proviene dalle misurazioni di Tencent stessa. Questa asimmetria non rende HY4 Preview il modello più debole. Lo rende quello meno verificato, e queste sono affermazioni diverse.
Le specifiche, comprese le due che determinano la maggior parte dei deployment
• Prezzo di output — GPT-6 Sol 10,00 $ per milione vs Tencent HY4 Preview 2,50 $ per milione
• Prezzo di input — GPT-6 Sol 2,00 $ per milione vs Tencent HY4 Preview 0,83 $ per milione
• Input in cache — GPT-6 Sol 0,20 $ per milione vs Tencent HY4 Preview 0,04 $ per milione
• Pesi — GPT-6 Sol chiusi, solo API vs HY4 Preview open source con licenza Apache 2.0
• Modalità di input — GPT-6 Sol testo, immagini e file vs HY4 Preview solo testo
• Finestra di contesto — GPT-6 Sol 1.050.000 token vs HY4 Preview 1.048.576 token
• Output massimo — GPT-6 Sol 128.000 token vs HY4 Preview 64.000 token
• Scaglione per richieste lunghe — GPT-6 Sol applica all'intera richiesta, oltre 272.000 token di input, una tariffa di 4,00 $ / 15,00 $ vs HY4 Preview nessuno scaglione nella sua scheda
• Architettura — GPT-6 Sol non divulgata vs HY4 Preview 770 miliardi di parametri totali, 49 miliardi attivi, 78 livelli, 256 esperti instradati più uno condiviso, livello nativo di previsione multi-token
• Punteggio indipendente — GPT-6 Sol 47,6 Intelligence Index vs HY4 Preview nessuno pubblicato
• Velocità di output misurata — GPT-6 Sol circa 244 token al secondo vs HY4 Preview circa 54, entrambi valori mobili su sette giorni
Le due righe che decidono la maggior parte delle implementazioni reali sono quelle più in fondo. La prima è che HY4 Preview non accetta input di immagini o file, il che lo esclude da qualsiasi pipeline che debba guardare qualcosa. La seconda è il tetto di output: 64.000 token sono la metà dei 128.000 di GPT-6 Sol e, su un modello la cui finalità dichiarata sono gli agenti di programmazione e le lunghe catene di utilizzo degli strumenti, è il vincolo che un team incontra per primo — non la qualità, ma il punto in cui un file generato non entra più in una singola risposta.
Rispetto a quelli, un quarto del prezzo di output e un quinto del prezzo dell'input in cache consentono moltissimi tentativi. E l'architettura di HY4 Preview è documentata in un modo in cui quella di GPT-6 Sol non lo è: Tencent ha pubblicato il numero di parametri, il numero di layer, la disposizione degli esperti e il layer di decodifica speculativa, il che significa che le caratteristiche di serving sono almeno in parte prevedibili dal paper piuttosto che osservabili solo attraverso l'API.

Che cos'è realmente la tabella di benchmark di HY4 Preview
I numeri pubblicati da Tencent sono solidi e sono tutti gestiti dal fornitore. Su Terminal-Bench 2.1 il modello registra 85,4; su DeepSWE, 64,3; e in una valutazione interna in cieco su 203 attività di ingegneria ha ottenuto una media di 2,99 contro GLM-5.3 a 2,92 e Kimi K3 a 2,94 — un vantaggio di sette centesimi di punto su una scala di dieci punti in uno studio progettato da Tencent. Ha anche esordito nella classifica di WebDev Arena, dove Tencent riferisce che si è posizionato intorno al quinto posto assoluto e al terzo tra i modelli open-weight. Il risultato dell'arena è votato dal pubblico anziché valutato dal fornitore ed è la prova più indipendente del gruppo; il resto è un'affermazione, e un'affermazione vale comunque la pena di essere letta purché sia etichettata come tale.
Il divario che conta non è che questi numeri possano essere generosi — gli harness dei vendor di solito lo sono, in entrambe le direzioni. È che non c'è una seconda misurazione con cui confrontarli. Un modello con una pagina su Artificial Analysis può essere verificato; uno senza non può esserlo, e la differenza emerge mesi dopo, quando qualcuno scopre che un numero di punta è stato misurato su un harness che nessun altro può riprodurre. Nulla qui suggerisce che sia successo a HY4 Preview. Significa solo che una decisione di adozione basata sull'85,4 poggia su un'unica fonte.
La traduzione pratica è che HY4 Preview dovrebbe essere valutato sul tuo traffico anziché sulla tabella, e la struttura dei costi rende economico farlo — a un quarto della tariffa di output di GPT-6 Sol, una settimana di traffico shadow sui tuoi prompt reali costa meno di una singola revisione del livello API. Questa è la forma corretta di due diligence per un modello poco misurato, ed è la forma che quasi nessuno mette davvero in pratica.
La questione dei pesi aperti, che è la vera linea di demarcazione
HY4 Preview è open source sotto Apache 2.0 con una build FP8 con licenza permissiva accanto al checkpoint base. GPT-6 Sol è closed e non ha un file di licenza perché non c'è nulla da licenziare. Tutto il resto in questo confronto è un compromesso; questo è una differenza di categoria.
Ciò che questo ti offre non è principalmente una bolletta più bassa — a 2,50 $ per milione di output, l'API ospitata è già al di sotto del costo che la maggior parte dei team sostiene per eseguire un modello da 770 miliardi di parametri, e se il costo fosse tutta la questione, la licenza permissiva sarebbe irrilevante. Ciò che ti offre è un deployment che non dipende dall'endpoint di terzi: pesi che non possono essere soggetti a rate limiting, un checkpoint che può essere quantizzato per adattarsi all'hardware che hai, un modello che può essere sottoposto a fine-tuning e traffico che può restare all'interno di un perimetro di rete. La risposta di GPT-6 Sol a tutti e quattro è che non dovresti aver bisogno di nessuno di essi, il che è un argomento valido per un insieme concreto di team e irrilevante per i team che invece ne hanno bisogno.
La separazione per modalità e la dicitura della licenza puntano nella stessa direzione, e vale la pena notarlo. Un modello che legge solo testo ed è distribuito con licenza Apache 2.0 è costruito per essere un componente — qualcosa che inserisci in una pipeline che controlli, alimentandolo con testo che hai già riconciliato. Un modello che legge testo, immagini e file ed è raggiungibile solo tramite un'API è costruito per essere il punto di ingresso, che accoglie direttamente l'input disordinato. Sono lavori diversi, e un confronto che li classifica su un unico indice risponde a una domanda che nessuno dei due fornitori ha posto.

Servirli insieme, e ciò che implica il numero di traffico
Entrambi i modelli sono dietro un'unica chiave OrcaRouter insieme ad altri 200+, e la forma di routing che questo abbinamento suggerisce è l'inverso di quella ovvia. Metti HY4 Preview al primo posto — è il modello più economico di un fattore quattro sull'output, è quello con l'architettura documentata, e sulle nostre rotte è quello che sopporta il carico — e tieni GPT-6 Sol dietro di esso per le richieste che richiedono la lettura di un'immagine, o che devono emettere più di 64.000 token, o che non superano un controllo di qualità. La composizione è espressa nel DSL di routing anziché nel codice dell'applicazione, quindi il confine tra i due è una regola che puoi modificare senza un deploy.
I dati sulla velocità meritano una precisazione e poi una conclusione. HY4 Preview viene misurato a circa 54 token di output al secondo nella nostra finestra mobile, contro i circa 244 di GPT-6 Sol, ed entrambi sono osservazioni su infrastruttura condivisa, non un benchmark controllato — il dato di Tencent in particolare riflette un modello con un numero di parametri attivi molto elevato, e 49 miliardi di attivi per token sono un bel po' di aritmetica per ogni token di output. Quindi il modello più economico è quello più lento di gran lunga, ed è esattamente il compromesso che una pipeline batch è felice di accettare e una interattiva no. La build ospitata di Tencent ha anche ricevuto un'ottimizzazione delle prestazioni il 7 settembre 2026 che, secondo il fornitore, riduce i turni di ragionamento e il consumo di token per attività a parità di qualità — un'altra cifra dichiarata dal fornitore, ma che predice una bolletta più bassa anziché un flusso più veloce.
Il failover è ciò che rende sicuro l'abbinamento in un ordine o nell'altro. Un modello open-weight da 770 miliardi di parametri è servito da più di un provider di infrastruttura, e una route in grado di fare fallback significa che un host degradato è un nuovo tentativo anziché un'interruzione. Il nostro catalogo trasmette i prezzi di listino dei provider senza alcun ricarico, il che significa anche che la tariffa del fornitore quotata in valuta non è qualcosa per cui devi attendere: Tencent elenca HY4 Preview a 6 yuan per l'input e 18 yuan per l'output per milione, e la cifra in dollari mostrata nella nostra pagina è quella tariffa convertita, non il margine di un rivenditore.

A cosa serve davvero questo paio
Scegli Tencent HY4 Preview per il volume, per le pipeline di solo testo che controlli, per qualsiasi cosa debba girare sul tuo hardware e per qualsiasi carico di lavoro in cui una risposta errata possa essere individuata e ritentata — il prezzo fa sì che ritentare sia la leva di qualità più economica a tua disposizione. Scegli GPT-6 Sol quando l'input è un'immagine o un file, quando una singola risposta deve contenere più di 64.000 token o quando la risposta è destinata a una persona che agirà senza verificarla. Scegli entrambi se il tuo traffico contiene un po' dell'uno e un po' dell'altro, cosa che quasi certamente accade.
Due verifiche finali. HY4 Preview è ancora etichettato come anteprima e rimane il modello Tencent più recente nel nostro catalogo, quindi il nome è accurato anziché obsoleto — ma un'anteprima può cambiare da un momento all'altro, e un checkpoint con licenza permissiva può essere superato dalla sua stessa versione finale senza preavviso. E GPT-6 Sol è già stato sostituito da GPT-6.1 Sol a tariffe identiche per contesto breve, con l'input in cache dimezzato da $0,20 a $0,10, e la pagina del modello di OpenAI stessa ora indirizza lì i lettori. Se il motivo per cui stai valutando Sol anziché il modello Tencent è l'integrazione vecchia di otto giorni, questo resta valido. Se è la capacità, il successore è quello che vuoi prezzare.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
