
Tencent HY4 Preview vs GPT-5.6 Sol: l'affermazione sul tool calling che mette gli open weights contro la frontiera
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Tencent HY4 Preview è il primo modello open-weight da mesi la cui scheda di lancio rivendica esplicitamente una vittoria su GPT-5.6 Sol. Il numero in questione è {{1}}Toolathlon-Verified{{/1}}, un benchmark per il tool-calling agentico, in cui Tencent riporta HY4 Preview a 74,1 — davanti a Qwen3.8-Max e, secondo {{2}}il confronto di Tencent{{/2}}, davanti a GPT-5.6 Sol. Sotto ogni altro aspetto, i due modelli non sono realmente alla pari: GPT-5.6 Sol è il modello di frontiera di OpenAI, chiuso, di punta e misurato in modo indipendente, mentre Tencent HY4 Preview è un'anteprima open-weight da 770 miliardi di parametri pubblicata questa mattina con una scheda di valutazione riportata dal fornitore e nessuna verifica di terze parti.
Quindi la domanda interessante non è "quale modello è più intelligente" — ma se uno sfidante open-weight, a circa un sesto del prezzo di input di Sol, possa credibilmente rivendicare una fetta della frontiera, e cosa dovrebbe fare un team con una rivendicazione attualmente non verificabile.
L'affermazione che rende questo un vero confronto
Toolathlon-Verified misura quanto affidabilmente un modello pilota uno strumento attraverso un intero compito agentico — leggendo i risultati, decidendo la chiamata successiva, recuperando dagli errori — piuttosto che quanto bene scrive una singola funzione. È importante perché la quota maggiore della spesa API reale sui modelli di frontiera va ai cicli agente, non ai completamenti one-shot. Il 74.1 di Tencent su quel benchmark è l'affermazione specifica che ha inserito HY4 Preview nella conversazione di GPT-5.6 Sol, e vale la pena soffermarcisi per un momento: è il tipo di numero che, se regge a una replica indipendente, rende reale la discussione sui costi tra open-weight e frontiera chiusa. Se non regge, diventa un'altra scheda del fornitore che evapora sotto un harness di terze parti.
Due modi per comprare l'intelligenza

• Parametri — HY4 Preview 770B totali / 49B attivi, pesi aperti vs GPT-5.6 Sol, numero di parametri non divulgato, API chiusa
• Contesto — HY4 Preview >1M token vs GPT-5.6 Sol 1,05M token, output massimo 128K
• Prezzo per 1M — HY4 Preview ¥6 in / ¥18 out (≈$0.85 / $2.50) vs GPT-5.6 Sol $4.00 / $20.00 al livello base, che sale a $8.00 / $30.00 per richieste con contesto ampio, letture cache $0.40
• Modalità di input — HY4 Preview solo testo in questa anteprima vs GPT-5.6 Sol input di testo e immagini
• Modalità di ragionamento — HY4 Preview: nessun equivalente pubblicato rispetto a GPT-5.6 Sol's Ultra mode (fino a 16 sottoagenti paralleli) e Max reasoning effort
• Verifica indipendente — HY4 Preview nessuna ancora vs GPT-5.6 Sol presente su ogni principale classifica, con un ranking di contesto da 1,05M nella fascia alta dei test compositi di lungo contesto.
La colonna dei prezzi è dove vive l'intero confronto. Al livello base, GPT-5.6 Sol costa $4.00 per un milione di token di input e $20.00 per un milione di token di output. Tencent HY4 Preview costa circa $0.85 e $2.50 ai tassi di cambio attuali. Per un carico di lavoro che sposta molti token di output — come fa la codifica agentica — il modello open-weight è prezzato a circa un ottavo di quello chiuso, e questo divario sopravvive anche alla precisazione che i numeri di Sol sono supportati da molte più verifiche.
Dove GPT-5.6 Sol mantiene ancora il vantaggio
La verifica è il primo vantaggio. GPT-5.6 Sol è disponibile in disponibilità generale dal 9 luglio e misurato in modo indipendente da allora: 88.8 su Terminal-Bench 2.1 con ragionamento di base, 91.9 in modalità Ultra, 53.6 su Agents' Last Exam (un record al momento del rilascio), 94.6 su GPQA Diamond e 64.6 su SWE-bench Pro. OpenAI riporta anche un miglioramento dell'efficienza dei token del 54% su attività di programmazione agentica rispetto al suo precedente modello di punta. Questi sono numeri che puoi trovare riprodotti al di fuori della documentazione di OpenAI stessa, che è esattamente la proprietà che a oggi manca a Tencent HY4 Preview.
La capacità è il secondo vantaggio, ed è strutturale piuttosto che marginale. GPT-5.6 Sol accetta input di immagini; HY4 Preview è solo testo in questa anteprima, con Tencent che riconosce che la visione dovrà attendere la versione completa. GPT-5.6 Sol include la modalità Ultra — una configurazione multi-agente che coordina subagenti paralleli a un costo di token da tre a quattro volte superiore, utile proprio per quei compiti di ingegneria a lungo orizzonte in cui i due modelli competerebbero realmente. E i percorsi di computer-use e di chiamata programmatica degli strumenti di Sol sono documentati, esercitati su scala di produzione e testati sotto carico. L'affermazione Toolathlon-Verified di Tencent, se viene replicata, riduce il divario nell'uso degli strumenti; non colma però i divari multimodale o multi-agente, che HY4 Preview non tenta di affrontare.
Dove HY4 Preview è davvero interessante
Mettiamo da parte il teatro dei benchmark: restano tre cose concrete. Primo, il prezzo: a ¥6/¥18 — circa $0.85/$2.50 — Tencent sta sottocostando ogni modello occidentale di frontiera sui token di output di un fattore tra quattro e otto, e sottocostando i suoi stessi concorrenti cinesi open-weight sull'input. Secondo, i pesi aperti: un MoE attivo da 49B è distribuibile su un singolo nodo in un modo in cui l'architettura non divulgata di Sol non lo sarà mai, e i pesi sono già su HuggingFace, ModelScope e GitHub. Terzo, il contesto e la traiettoria ingegneristica: DeepSWE 64.3 e una finestra di contesto da oltre 1M sono rivolti agli stessi carichi di lavoro agentici a lungo orizzonte che la modalità Ultra di Sol prende di mira, a una frazione del costo.
L'avvertenza onesta è che nulla di tutto questo ha superato il confronto con un benchmark indipendente. La storia dell'auto-ottimizzazione raccontata da Tencent — un miglioramento del 31,8% del throughput end-to-end derivante dal modello che itera sul proprio stack di inferenza — è misurata internamente. La vittoria nel test alla cieca su GLM 5.3 e Kimi K3 è condotta internamente. Ogni aspetto interessante di HY4 Preview, oggi, è solo un'affermazione.
La decisione
Se oggi stai costruendo un sistema di produzione, GPT-5.6 Sol è la scelta difendibile, ed è raggiungibile tramite OrcaRouter al prezzo di listino a livelli di OpenAI — $4,00/$20,00 al livello base, $8,00/$30,00 sopra, applicato senza alcun margine, quindi qualsiasi variazione di prezzo del fornitore è attiva dal nostro lato lo stesso giorno. Se il tuo flusso di lavoro è agentico e fortemente basato su strumenti, la struttura a livelli significa che dovresti verificare le dimensioni effettive dei tuoi input rispetto alla soglia di $272K token piuttosto che assumere una tariffa fissa.
Se sei disposto a eseguire una valutazione in ombra, HY4 Preview è abbastanza economico da meritare una vera: instrada oggi il tuo carico di lavoro di tool calling attraverso Sol, esegui gli stessi prompt contro HY4 Preview tramite l'API di Tencent e confronta i modelli sui tuoi compiti in stile Toolathlon. E se i punteggi indipendenti si collocano dove Tencent dice che saranno, il percorso di passaggio è breve — il modello open-weight si inserisce in un router e la tua regola di failover scambia gli endpoint, con la tariffa del fornitore di ¥6/¥18 mantenuta invariata. Questa è la struttura onesta di questo confronto: un modello frontier verificato su cui puoi costruire oggi, che affronta uno sfidante open non verificato abbastanza economico da testare e posizionato per spostare la conversazione sul prezzo sull'intera classe open-weight.


Cosa guardare
• La prima replica indipendente di Toolathlon-Verified. Se un harness di terze parti conferma HY4 Preview sui 70, l'argomento secondo cui "i pesi aperti non possono usare strumenti in modo agentico" crolla.
• Se Tencent distribuirà la visione prima del rilascio completo di Hy4. La modalità solo testo limita HY4 Preview a un sottoinsieme ristretto dei carichi di lavoro che GPT-5.6 Sol gestisce.
• I costi token effettivi della tendenza di HY4 Preview al pensiero prolungato. A ¥18 per milione di output, l'autoverifica prolissa mangia il vantaggio di prezzo più velocemente che su un modello da $20.
• Se la tariffazione a livelli di Sol subirà un altro taglio prima del lancio completo di Hy4. Il pass-through su un router significa che un calo è visibile lo stesso giorno.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
