Una hero card per il titolo del confronto 'Tencent HY4 Preview vs GPT-5.6 Sol'. Un testo in evidenza al centro riporta 'Toolathlon-Verified 74.1 - la rivendicazione open-weight contro i modelli di frontiera', annotato 'Tencent dichiara che il suo modello supera GPT-5.6 Sol nel tool-calling agentico'. La card di sinistra 'Tencent HY4 Preview' elenca 'Pesi aperti, 770B / 49B attivi', '¥6 / ¥18 per 1M', 'Nessun punteggio indipendente'. La card di destra 'GPT-5.6 Sol' elenca 'API chiusa, ammiraglia OpenAI', '$4 / $20 base per 1M', 'Terminal-Bench 2.1: 88.8'. Un footer riporta 'Dati HY4 Preview dichiarati dal fornitore; dati Sol ampiamente riprodotti.' Il logo OrcaRouter è posizionato nell'angolo in basso a destra.
Guides & Insights

Tencent HY4 Preview vs GPT-5.6 Sol: l'affermazione sul tool calling che mette gli open weights contro la frontiera

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Tencent HY4 Preview è il primo modello open-weight da mesi la cui scheda di lancio rivendica esplicitamente una vittoria su GPT-5.6 Sol. Il numero in questione è {{1}}Toolathlon-Verified{{/1}}, un benchmark per il tool-calling agentico, in cui Tencent riporta HY4 Preview a 74,1 — davanti a Qwen3.8-Max e, secondo {{2}}il confronto di Tencent{{/2}}, davanti a GPT-5.6 Sol. Sotto ogni altro aspetto, i due modelli non sono realmente alla pari: GPT-5.6 Sol è il modello di frontiera di OpenAI, chiuso, di punta e misurato in modo indipendente, mentre Tencent HY4 Preview è un'anteprima open-weight da 770 miliardi di parametri pubblicata questa mattina con una scheda di valutazione riportata dal fornitore e nessuna verifica di terze parti.

Quindi la domanda interessante non è "quale modello è più intelligente" — ma se uno sfidante open-weight, a circa un sesto del prezzo di input di Sol, possa credibilmente rivendicare una fetta della frontiera, e cosa dovrebbe fare un team con una rivendicazione attualmente non verificabile.

L'affermazione che rende questo un vero confronto

Toolathlon-Verified misura quanto affidabilmente un modello pilota uno strumento attraverso un intero compito agentico — leggendo i risultati, decidendo la chiamata successiva, recuperando dagli errori — piuttosto che quanto bene scrive una singola funzione. È importante perché la quota maggiore della spesa API reale sui modelli di frontiera va ai cicli agente, non ai completamenti one-shot. Il 74.1 di Tencent su quel benchmark è l'affermazione specifica che ha inserito HY4 Preview nella conversazione di GPT-5.6 Sol, e vale la pena soffermarcisi per un momento: è il tipo di numero che, se regge a una replica indipendente, rende reale la discussione sui costi tra open-weight e frontiera chiusa. Se non regge, diventa un'altra scheda del fornitore che evapora sotto un harness di terze parti.

Due modi per comprare l'intelligenza

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• Parametri — HY4 Preview 770B totali / 49B attivi, pesi aperti vs GPT-5.6 Sol, numero di parametri non divulgato, API chiusa

• Contesto — HY4 Preview >1M token vs GPT-5.6 Sol 1,05M token, output massimo 128K

• Prezzo per 1M — HY4 Preview ¥6 in / ¥18 out (≈$0.85 / $2.50) vs GPT-5.6 Sol $4.00 / $20.00 al livello base, che sale a $8.00 / $30.00 per richieste con contesto ampio, letture cache $0.40

• Modalità di input — HY4 Preview solo testo in questa anteprima vs GPT-5.6 Sol input di testo e immagini

• Modalità di ragionamento — HY4 Preview: nessun equivalente pubblicato rispetto a GPT-5.6 Sol's Ultra mode (fino a 16 sottoagenti paralleli) e Max reasoning effort

• Verifica indipendente — HY4 Preview nessuna ancora vs GPT-5.6 Sol presente su ogni principale classifica, con un ranking di contesto da 1,05M nella fascia alta dei test compositi di lungo contesto.

La colonna dei prezzi è dove vive l'intero confronto. Al livello base, GPT-5.6 Sol costa $4.00 per un milione di token di input e $20.00 per un milione di token di output. Tencent HY4 Preview costa circa $0.85 e $2.50 ai tassi di cambio attuali. Per un carico di lavoro che sposta molti token di output — come fa la codifica agentica — il modello open-weight è prezzato a circa un ottavo di quello chiuso, e questo divario sopravvive anche alla precisazione che i numeri di Sol sono supportati da molte più verifiche.

Dove GPT-5.6 Sol mantiene ancora il vantaggio

La verifica è il primo vantaggio. GPT-5.6 Sol è disponibile in disponibilità generale dal 9 luglio e misurato in modo indipendente da allora: 88.8 su Terminal-Bench 2.1 con ragionamento di base, 91.9 in modalità Ultra, 53.6 su Agents' Last Exam (un record al momento del rilascio), 94.6 su GPQA Diamond e 64.6 su SWE-bench Pro. OpenAI riporta anche un miglioramento dell'efficienza dei token del 54% su attività di programmazione agentica rispetto al suo precedente modello di punta. Questi sono numeri che puoi trovare riprodotti al di fuori della documentazione di OpenAI stessa, che è esattamente la proprietà che a oggi manca a Tencent HY4 Preview.

La capacità è il secondo vantaggio, ed è strutturale piuttosto che marginale. GPT-5.6 Sol accetta input di immagini; HY4 Preview è solo testo in questa anteprima, con Tencent che riconosce che la visione dovrà attendere la versione completa. GPT-5.6 Sol include la modalità Ultra — una configurazione multi-agente che coordina subagenti paralleli a un costo di token da tre a quattro volte superiore, utile proprio per quei compiti di ingegneria a lungo orizzonte in cui i due modelli competerebbero realmente. E i percorsi di computer-use e di chiamata programmatica degli strumenti di Sol sono documentati, esercitati su scala di produzione e testati sotto carico. L'affermazione Toolathlon-Verified di Tencent, se viene replicata, riduce il divario nell'uso degli strumenti; non colma però i divari multimodale o multi-agente, che HY4 Preview non tenta di affrontare.

Dove HY4 Preview è davvero interessante

Mettiamo da parte il teatro dei benchmark: restano tre cose concrete. Primo, il prezzo: a ¥6/¥18 — circa $0.85/$2.50 — Tencent sta sottocostando ogni modello occidentale di frontiera sui token di output di un fattore tra quattro e otto, e sottocostando i suoi stessi concorrenti cinesi open-weight sull'input. Secondo, i pesi aperti: un MoE attivo da 49B è distribuibile su un singolo nodo in un modo in cui l'architettura non divulgata di Sol non lo sarà mai, e i pesi sono già su HuggingFace, ModelScope e GitHub. Terzo, il contesto e la traiettoria ingegneristica: DeepSWE 64.3 e una finestra di contesto da oltre 1M sono rivolti agli stessi carichi di lavoro agentici a lungo orizzonte che la modalità Ultra di Sol prende di mira, a una frazione del costo.

L'avvertenza onesta è che nulla di tutto questo ha superato il confronto con un benchmark indipendente. La storia dell'auto-ottimizzazione raccontata da Tencent — un miglioramento del 31,8% del throughput end-to-end derivante dal modello che itera sul proprio stack di inferenza — è misurata internamente. La vittoria nel test alla cieca su GLM 5.3 e Kimi K3 è condotta internamente. Ogni aspetto interessante di HY4 Preview, oggi, è solo un'affermazione.

La decisione

Se oggi stai costruendo un sistema di produzione, GPT-5.6 Sol è la scelta difendibile, ed è raggiungibile tramite OrcaRouter al prezzo di listino a livelli di OpenAI — $4,00/$20,00 al livello base, $8,00/$30,00 sopra, applicato senza alcun margine, quindi qualsiasi variazione di prezzo del fornitore è attiva dal nostro lato lo stesso giorno. Se il tuo flusso di lavoro è agentico e fortemente basato su strumenti, la struttura a livelli significa che dovresti verificare le dimensioni effettive dei tuoi input rispetto alla soglia di $272K token piuttosto che assumere una tariffa fissa.

Se sei disposto a eseguire una valutazione in ombra, HY4 Preview è abbastanza economico da meritare una vera: instrada oggi il tuo carico di lavoro di tool calling attraverso Sol, esegui gli stessi prompt contro HY4 Preview tramite l'API di Tencent e confronta i modelli sui tuoi compiti in stile Toolathlon. E se i punteggi indipendenti si collocano dove Tencent dice che saranno, il percorso di passaggio è breve — il modello open-weight si inserisce in un router e la tua regola di failover scambia gli endpoint, con la tariffa del fornitore di ¥6/¥18 mantenuta invariata. Questa è la struttura onesta di questo confronto: un modello frontier verificato su cui puoi costruire oggi, che affronta uno sfidante open non verificato abbastanza economico da testare e posizionato per spostare la conversazione sul prezzo sull'intera classe open-weight.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

Cosa guardare

• La prima replica indipendente di Toolathlon-Verified. Se un harness di terze parti conferma HY4 Preview sui 70, l'argomento secondo cui "i pesi aperti non possono usare strumenti in modo agentico" crolla.

• Se Tencent distribuirà la visione prima del rilascio completo di Hy4. La modalità solo testo limita HY4 Preview a un sottoinsieme ristretto dei carichi di lavoro che GPT-5.6 Sol gestisce.

• I costi token effettivi della tendenza di HY4 Preview al pensiero prolungato. A ¥18 per milione di output, l'autoverifica prolissa mangia il vantaggio di prezzo più velocemente che su un modello da $20.

• Se la tariffazione a livelli di Sol subirà un altro taglio prima del lancio completo di Hy4. Il pass-through su un router significa che un calo è visibile lo stesso giorno.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube