Eine Hero-Titelkarte für den Vergleich 'Tencent HY4 Preview vs. GPT-5.6 Sol'. Ein zentrales Highlight lautet 'Toolathlon-Verified 74.1 – der Open-Weight-Anspruch gegen die Spitze', mit der Anmerkung 'Tencent meldet, dass sein Modell GPT-5.6 Sol beim agentischen Tool-Calling übertrifft'. Linke Karte 'Tencent HY4 Preview' listet 'Offene Gewichte, 770B / 49B aktiv', '¥6 / ¥18 pro 1M', 'Keine unabhängigen Ergebnisse'. Rechte Karte 'GPT-5.6 Sol' listet 'Geschlossene API, OpenAI-Flaggschiff', '$4 / $20 Basis pro 1M', 'Terminal-Bench 2.1: 88.8'. Eine Fußzeile lautet 'HY4-Preview-Zahlen vom Anbieter gemeldet; Sol-Zahlen weitgehend reproduziert'. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Tencent HY4 Preview vs. GPT-5.6 Sol: Die Tool-Calling-Behauptung, die Open Weights gegen die Frontier antreten lässt

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Tencent HY4 Preview ist das erste Open-Weight-Modell seit Monaten, dessen Launch-Karte explizit einen Sieg über GPT-5.6 Sol beansprucht. Bei der fraglichen Zahl handelt es sich um Toolathlon-Verified, einen Benchmark für agentisches Tool-Calling, bei dem Tencent für HY4 Preview 74,1 angibt – vor Qwen3.8-Max und, laut Tencents eigenem Vergleich, auch vor GPT-5.6 Sol. In jeder anderen Hinsicht sind sich die beiden Modelle nicht wirklich ebenbürtig: GPT-5.6 Sol ist Ope​nAIs geschlossenes, unabhängig gemessenes Flaggschiff-Frontier-Modell, während Tencent HY4 Preview ein Open-Weight-Preview mit 770 Milliarden Parametern ist, das heute Morgen mit einer vom Anbieter gemeldeten Scorecard und ohne Verifizierung durch Dritte veröffentlicht wurde.

Die interessante Frage ist also nicht „welches Modell intelligenter ist“ – sondern ob ein Herausforderer mit offenen Gewichten zu etwa einem Sechstel des Eingabepreises von Sol glaubwürdig einen Anteil am Spitzenfeld beanspruchen kann, und was ein Team mit einer Behauptung tun sollte, die derzeit nicht verifizierbar ist.

Die Behauptung, die dies zu einem echten Duell macht.

Toolathlon-Verified misst, wie zuverlässig ein Modell ein Tool über eine vollständige agentische Aufgabe hinweg steuert — Ergebnisse liest, den nächsten Aufruf entscheidet, aus Fehlern zurückfindet — und nicht, wie gut es eine einzelne Funktion schreibt. Das ist wichtig, weil der größte Teil der realen API-Ausgaben für Spitzenmodelle in Agentenschleifen fließt, nicht in einmalige Vervollständigungen. Tencents 74,1 bei diesem Benchmark ist die konkrete Behauptung, die HY4 Preview in GPT-5.6 Sols Konversation gebracht hat, und es lohnt sich, einen Moment dabei zu verweilen: Es ist die Art von Zahl, die — falls sie sich unter unabhängiger Replikation bestätigt — das Kostengespräch zwischen Open-Weight- und Closed-Frontier-Modellen real werden lässt. Falls sie sich nicht bestätigt, wird sie zu einer weiteren Anbieter-Bewertung, die unter einem Testrahmen eines Drittanbieters zerfällt.

Zwei Wege, Intelligenz zu kaufen

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• Parameter — HY4 Preview 770B gesamt / 49B aktiv, offene Gewichte vs. GPT-5.6 Sol, Parameteranzahl nicht offengelegt, geschlossene API

• Kontext — HY4 Preview >1M Token vs. GPT-5.6 Sol 1,05M Token, max. Ausgabe 128K

• Preis pro 1M — HY4 Preview ¥6 in / ¥18 out (≈$0,85 / $2,50) vs. GPT-5.6 Sol $4,00 / $20,00 im Basistarif, steigend auf $8,00 / $30,00 für Anfragen mit großem Kontext, Cache-Lesezugriffe $0,40

• Eingabemodalitäten — HY4 Preview in dieser Vorschau nur Text vs. GPT-5.6 Sol Text- und Bildeingabe

• Reasoning-Modi — HY4 Preview ohne veröffentlichtes Äquivalent im Vergleich zu GPT-5.6 Sol's Ultra mode (bis zu 16 parallele Subagenten) und Max-Reasoning-Aufwand

• Unabhängige Verifizierung — HY4 Preview noch keine vs. GPT-5.6 Sol auf jeder wichtigen Bestenliste vertreten, mit einem 1,05M-Kontext-Ranking in der Spitzengruppe der Composite-Tests für lange Kontexte.

Die Preisspalte ist der Ort, an dem der gesamte Vergleich stattfindet. Auf der Basisebene kostet GPT-5.6 Sol 4,00 $ pro Million Input-Tokens und 20,00 $ pro Million Output-Tokens. Tencent HY4 Preview kostet bei aktuellen Wechselkursen etwa 0,85 $ und 2,50 $. Für eine Arbeitslast, die viele Output-Tokens bewegt – wie es agentisches Codieren tut – liegt das Open-Weight-Modell preislich bei etwa einem Achtel des geschlossenen Modells, und diese Kluft bleibt selbst angesichts des Vorbehalts bestehen, dass hinter Sols Zahlen deutlich mehr Verifikation steckt.

Wo GPT-5.6 Sol immer noch die Nase vorn hat

Verifizierung ist der erste Vorsprung. GPT-5.6 Sol ist seit dem 9. Juli allgemein verfügbar und wird seitdem unabhängig gemessen: 88,8 beim Terminal-Bench 2.1 im Base-Reasoning-Modus, 91,9 im Ultra-Modus, 53,6 bei Agents' Last Exam (ein Rekord bei der Veröffentlichung), 94,6 bei GPQA Diamond und 64,6 beim SWE-bench Pro. OpenAI berichtet außerdem von einer 54-prozentigen Verbesserung der Token-Effizienz bei agentischen Programmieraufgaben gegenüber seinem eigenen bisherigen Flaggschiff. Das sind Zahlen, die man auch außerhalb von OpenAIs eigener Dokumentation reproduziert findet – genau die Eigenschaft, die Tencent HY4 Preview heute fehlt.

Fähigkeit ist der zweite Vorteil, und sie ist struktureller Natur, nicht marginal. GPT-5.6 Sol akzeptiert Bildeingaben; HY4 Preview ist in dieser Vorschau rein textbasiert, wobei Tencent einräumt, dass die Bilderkennung auf die vollständige Veröffentlichung warten muss. GPT-5.6 Sol wird mit dem Ultra-Modus ausgeliefert – einer Multi-Agenten-Konfiguration, die parallele Unteragenten zum drei- bis vierfachen Token-Preis koordiniert und genau für die langfristigen Engineering-Aufgaben nützlich ist, bei denen die beiden Modelle tatsächlich konkurrieren würden. Und Sols Pfade für Computer-Use und programmatische Tool-Aufrufe sind dokumentiert, im Produktionsmaßstab erprobt und lastgetestet. Tencents Toolathlon-Verified-Behauptung verringert, falls sie sich replizieren lässt, die Tool-Nutzungslücke; sie schließt jedoch nicht die multimodalen oder Multi-Agenten-Lücken, was HY4 Preview nicht versucht.

Wo HY4 Preview wirklich interessant ist

Legen wir das Benchmark-Theater beiseite, und es bleiben drei reale Dinge. Erstens der Preis: Bei ¥6/¥18 – etwa $0,85/$2,50 – unterbietet Tencent jedes westliche Frontier-Modell bei den Ausgabe-Tokens um den Faktor vier bis acht und unterbietet seine eigenen chinesischen Open-Weight-Konkurrenten beim Input. Zweitens die Open Weights: Ein 49B-aktives MoE ist auf einem einzelnen Knoten bereitstellbar, was Sols nicht offengelegte Architektur nie sein wird, und die Gewichte sind bereits auf HuggingFace, ModelScope und GitHub verfügbar. Drittens der Kontext und die technologische Entwicklung: DeepSWE 64.3 und ein Kontextfenster von über 1M zielen auf dieselben langfristigen agentischen Workloads ab, die Sols Ultra-Modus anvisiert, zu einem Bruchteil der Kosten.

Die ehrliche Einschränkung ist, dass nichts davon den Kontakt mit einem unabhängigen Benchmark überstanden hat. Die Selbstoptimierungsgeschichte, die Tencent erzählt – eine End-to-End-Durchsatzsteigerung von 31,8 %, die das Modell durch Iterationen an seinem eigenen Inferenz-Stack erzielt hat – stammt aus internen Messungen. Der Blindtest-Sieg über GLM 5.3 und Kimi K3 basiert auf internen Testläufen. Alles Interessante an HY4 Preview ist heute eine Behauptung.

Die Entscheidung

Wenn Sie heute ein Produktionssystem aufbauen, ist GPT-5.6 Sol die vertretbare Wahl, und es ist über OrcaRouter zu OpenAIs eigenem gestaffelten Listenpreis erreichbar — 4,00 $/20,00 $ in der Basisstufe, 8,00 $/30,00 $ darüber, ohne Aufschlag durchgereicht, sodass jede Preisänderung des Anbieters bei uns noch am selben Tag live ist. Wenn Ihr Workflow agentisch und werkzeugintensiv ist, bedeutet die gestaffelte Struktur, dass Sie Ihre tatsächlichen Eingabegrößen mit der 272.000-Token-Schwelle abgleichen sollten, anstatt einen Pauschalpreis anzunehmen.

Wenn Sie bereit sind, eine Schattenevaluierung durchzuführen, ist HY4 Preview günstig genug, dass sich eine echte lohnt: Leiten Sie Ihren Tool-Calling-Workload noch heute über Sol, führen Sie dieselben Prompts über Tencents eigene API gegen HY4 Preview aus und vergleichen Sie die Ergebnisse mit Ihren eigenen Aufgaben im Toolathlon-Stil. Und falls die unabhängigen Bewertungen dort landen, wo Tencent es vorhersagt, ist der Umstieg kurz: Das Open-Weight-Modell wird in einen Router eingebunden, und Ihre Failover-Regel tauscht die Endpunkte aus, wobei der Preistarif des Anbieters von ¥6/¥18 unangetastet durchgereicht wird. Das ist die ehrliche Struktur dieses Vergleichs: ein verifiziertes Frontier-Modell, auf das Sie heute aufbauen können, steht einem unverifizierten Open-Weight-Herausforderer gegenüber, der günstig genug zum Testen ist und darauf ausgelegt ist, die Preisfrage auf die gesamte Klasse der Open-Weight-Modelle zu lenken.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

Was zu sehen

• Die erste unabhängige Replikation von Toolathlon-Verified. Wenn ein Drittanbieter-Harness HY4 Preview in den 70ern bestätigt, bricht das Argument zusammen, dass „Open Weights keine agentische Tool-Nutzung können“.

• Ob Tencent Vision vor der vollständigen Hy4-Veröffentlichung ausliefert. Die reine Textausrichtung beschränkt HY4 Preview auf eine strikte Teilmenge der Arbeitslasten, die GPT-5.6 Sol bewältigt.

• Die tatsächlichen Token-Rechnungen aus der langen Denkneigung von HY4 Preview. Bei ¥18 pro Million Output frisst die wortreiche Selbstverifikation den Preisvorteil schneller auf als bei einem 20-Dollar-Modell.

• Ob Sols gestaffelte Preisgestaltung vor dem vollständigen Start von Hy4 eine weitere Senkung erfährt. Die Durchreichung über einen Router bedeutet, dass eine Senkung am selben Tag sichtbar ist.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube