
Tencent HY4 Preview vs. GPT-5.6 Sol: Die Tool-Calling-Behauptung, die Open Weights gegen die Frontier antreten lässt
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Tencent HY4 Preview ist das erste Open-Weight-Modell seit Monaten, dessen Launch-Karte explizit einen Sieg über GPT-5.6 Sol beansprucht. Bei der fraglichen Zahl handelt es sich um Toolathlon-Verified, einen Benchmark für agentisches Tool-Calling, bei dem Tencent für HY4 Preview 74,1 angibt – vor Qwen3.8-Max und, laut Tencents eigenem Vergleich, auch vor GPT-5.6 Sol. In jeder anderen Hinsicht sind sich die beiden Modelle nicht wirklich ebenbürtig: GPT-5.6 Sol ist OpenAIs geschlossenes, unabhängig gemessenes Flaggschiff-Frontier-Modell, während Tencent HY4 Preview ein Open-Weight-Preview mit 770 Milliarden Parametern ist, das heute Morgen mit einer vom Anbieter gemeldeten Scorecard und ohne Verifizierung durch Dritte veröffentlicht wurde.
Die interessante Frage ist also nicht „welches Modell intelligenter ist“ – sondern ob ein Herausforderer mit offenen Gewichten zu etwa einem Sechstel des Eingabepreises von Sol glaubwürdig einen Anteil am Spitzenfeld beanspruchen kann, und was ein Team mit einer Behauptung tun sollte, die derzeit nicht verifizierbar ist.
Die Behauptung, die dies zu einem echten Duell macht.
Toolathlon-Verified misst, wie zuverlässig ein Modell ein Tool über eine vollständige agentische Aufgabe hinweg steuert — Ergebnisse liest, den nächsten Aufruf entscheidet, aus Fehlern zurückfindet — und nicht, wie gut es eine einzelne Funktion schreibt. Das ist wichtig, weil der größte Teil der realen API-Ausgaben für Spitzenmodelle in Agentenschleifen fließt, nicht in einmalige Vervollständigungen. Tencents 74,1 bei diesem Benchmark ist die konkrete Behauptung, die HY4 Preview in GPT-5.6 Sols Konversation gebracht hat, und es lohnt sich, einen Moment dabei zu verweilen: Es ist die Art von Zahl, die — falls sie sich unter unabhängiger Replikation bestätigt — das Kostengespräch zwischen Open-Weight- und Closed-Frontier-Modellen real werden lässt. Falls sie sich nicht bestätigt, wird sie zu einer weiteren Anbieter-Bewertung, die unter einem Testrahmen eines Drittanbieters zerfällt.
Zwei Wege, Intelligenz zu kaufen

• Parameter — HY4 Preview 770B gesamt / 49B aktiv, offene Gewichte vs. GPT-5.6 Sol, Parameteranzahl nicht offengelegt, geschlossene API
• Kontext — HY4 Preview >1M Token vs. GPT-5.6 Sol 1,05M Token, max. Ausgabe 128K
• Preis pro 1M — HY4 Preview ¥6 in / ¥18 out (≈$0,85 / $2,50) vs. GPT-5.6 Sol $4,00 / $20,00 im Basistarif, steigend auf $8,00 / $30,00 für Anfragen mit großem Kontext, Cache-Lesezugriffe $0,40
• Eingabemodalitäten — HY4 Preview in dieser Vorschau nur Text vs. GPT-5.6 Sol Text- und Bildeingabe
• Reasoning-Modi — HY4 Preview ohne veröffentlichtes Äquivalent im Vergleich zu GPT-5.6 Sol's Ultra mode (bis zu 16 parallele Subagenten) und Max-Reasoning-Aufwand
• Unabhängige Verifizierung — HY4 Preview noch keine vs. GPT-5.6 Sol auf jeder wichtigen Bestenliste vertreten, mit einem 1,05M-Kontext-Ranking in der Spitzengruppe der Composite-Tests für lange Kontexte.
Die Preisspalte ist der Ort, an dem der gesamte Vergleich stattfindet. Auf der Basisebene kostet GPT-5.6 Sol 4,00 $ pro Million Input-Tokens und 20,00 $ pro Million Output-Tokens. Tencent HY4 Preview kostet bei aktuellen Wechselkursen etwa 0,85 $ und 2,50 $. Für eine Arbeitslast, die viele Output-Tokens bewegt – wie es agentisches Codieren tut – liegt das Open-Weight-Modell preislich bei etwa einem Achtel des geschlossenen Modells, und diese Kluft bleibt selbst angesichts des Vorbehalts bestehen, dass hinter Sols Zahlen deutlich mehr Verifikation steckt.
Wo GPT-5.6 Sol immer noch die Nase vorn hat
Verifizierung ist der erste Vorsprung. GPT-5.6 Sol ist seit dem 9. Juli allgemein verfügbar und wird seitdem unabhängig gemessen: 88,8 beim Terminal-Bench 2.1 im Base-Reasoning-Modus, 91,9 im Ultra-Modus, 53,6 bei Agents' Last Exam (ein Rekord bei der Veröffentlichung), 94,6 bei GPQA Diamond und 64,6 beim SWE-bench Pro. OpenAI berichtet außerdem von einer 54-prozentigen Verbesserung der Token-Effizienz bei agentischen Programmieraufgaben gegenüber seinem eigenen bisherigen Flaggschiff. Das sind Zahlen, die man auch außerhalb von OpenAIs eigener Dokumentation reproduziert findet – genau die Eigenschaft, die Tencent HY4 Preview heute fehlt.
Fähigkeit ist der zweite Vorteil, und sie ist struktureller Natur, nicht marginal. GPT-5.6 Sol akzeptiert Bildeingaben; HY4 Preview ist in dieser Vorschau rein textbasiert, wobei Tencent einräumt, dass die Bilderkennung auf die vollständige Veröffentlichung warten muss. GPT-5.6 Sol wird mit dem Ultra-Modus ausgeliefert – einer Multi-Agenten-Konfiguration, die parallele Unteragenten zum drei- bis vierfachen Token-Preis koordiniert und genau für die langfristigen Engineering-Aufgaben nützlich ist, bei denen die beiden Modelle tatsächlich konkurrieren würden. Und Sols Pfade für Computer-Use und programmatische Tool-Aufrufe sind dokumentiert, im Produktionsmaßstab erprobt und lastgetestet. Tencents Toolathlon-Verified-Behauptung verringert, falls sie sich replizieren lässt, die Tool-Nutzungslücke; sie schließt jedoch nicht die multimodalen oder Multi-Agenten-Lücken, was HY4 Preview nicht versucht.
Wo HY4 Preview wirklich interessant ist
Legen wir das Benchmark-Theater beiseite, und es bleiben drei reale Dinge. Erstens der Preis: Bei ¥6/¥18 – etwa $0,85/$2,50 – unterbietet Tencent jedes westliche Frontier-Modell bei den Ausgabe-Tokens um den Faktor vier bis acht und unterbietet seine eigenen chinesischen Open-Weight-Konkurrenten beim Input. Zweitens die Open Weights: Ein 49B-aktives MoE ist auf einem einzelnen Knoten bereitstellbar, was Sols nicht offengelegte Architektur nie sein wird, und die Gewichte sind bereits auf HuggingFace, ModelScope und GitHub verfügbar. Drittens der Kontext und die technologische Entwicklung: DeepSWE 64.3 und ein Kontextfenster von über 1M zielen auf dieselben langfristigen agentischen Workloads ab, die Sols Ultra-Modus anvisiert, zu einem Bruchteil der Kosten.
Die ehrliche Einschränkung ist, dass nichts davon den Kontakt mit einem unabhängigen Benchmark überstanden hat. Die Selbstoptimierungsgeschichte, die Tencent erzählt – eine End-to-End-Durchsatzsteigerung von 31,8 %, die das Modell durch Iterationen an seinem eigenen Inferenz-Stack erzielt hat – stammt aus internen Messungen. Der Blindtest-Sieg über GLM 5.3 und Kimi K3 basiert auf internen Testläufen. Alles Interessante an HY4 Preview ist heute eine Behauptung.
Die Entscheidung
Wenn Sie heute ein Produktionssystem aufbauen, ist GPT-5.6 Sol die vertretbare Wahl, und es ist über OrcaRouter zu OpenAIs eigenem gestaffelten Listenpreis erreichbar — 4,00 $/20,00 $ in der Basisstufe, 8,00 $/30,00 $ darüber, ohne Aufschlag durchgereicht, sodass jede Preisänderung des Anbieters bei uns noch am selben Tag live ist. Wenn Ihr Workflow agentisch und werkzeugintensiv ist, bedeutet die gestaffelte Struktur, dass Sie Ihre tatsächlichen Eingabegrößen mit der 272.000-Token-Schwelle abgleichen sollten, anstatt einen Pauschalpreis anzunehmen.
Wenn Sie bereit sind, eine Schattenevaluierung durchzuführen, ist HY4 Preview günstig genug, dass sich eine echte lohnt: Leiten Sie Ihren Tool-Calling-Workload noch heute über Sol, führen Sie dieselben Prompts über Tencents eigene API gegen HY4 Preview aus und vergleichen Sie die Ergebnisse mit Ihren eigenen Aufgaben im Toolathlon-Stil. Und falls die unabhängigen Bewertungen dort landen, wo Tencent es vorhersagt, ist der Umstieg kurz: Das Open-Weight-Modell wird in einen Router eingebunden, und Ihre Failover-Regel tauscht die Endpunkte aus, wobei der Preistarif des Anbieters von ¥6/¥18 unangetastet durchgereicht wird. Das ist die ehrliche Struktur dieses Vergleichs: ein verifiziertes Frontier-Modell, auf das Sie heute aufbauen können, steht einem unverifizierten Open-Weight-Herausforderer gegenüber, der günstig genug zum Testen ist und darauf ausgelegt ist, die Preisfrage auf die gesamte Klasse der Open-Weight-Modelle zu lenken.


Was zu sehen
• Die erste unabhängige Replikation von Toolathlon-Verified. Wenn ein Drittanbieter-Harness HY4 Preview in den 70ern bestätigt, bricht das Argument zusammen, dass „Open Weights keine agentische Tool-Nutzung können“.
• Ob Tencent Vision vor der vollständigen Hy4-Veröffentlichung ausliefert. Die reine Textausrichtung beschränkt HY4 Preview auf eine strikte Teilmenge der Arbeitslasten, die GPT-5.6 Sol bewältigt.
• Die tatsächlichen Token-Rechnungen aus der langen Denkneigung von HY4 Preview. Bei ¥18 pro Million Output frisst die wortreiche Selbstverifikation den Preisvorteil schneller auf als bei einem 20-Dollar-Modell.
• Ob Sols gestaffelte Preisgestaltung vor dem vollständigen Start von Hy4 eine weitere Senkung erfährt. Die Durchreichung über einen Router bedeutet, dass eine Senkung am selben Tag sichtbar ist.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
