
GPT-6 Sol vs. Tencent HY4 Preview: Das günstigere Modell trägt sechshundertmal so viel Traffic
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Vergleiche zwischen einem Frontier-Modell und einem günstigen enden normalerweise bei der Preistabelle, und dieser hier hat ein besseres Ende zu bieten. Tencent HY4 Preview und GPT-6 Sol werden beide von OrcaRouter geroutet, was bedeutet, dass dieselbe Telemetrie beide abdeckt, und im selben rollierenden Sieben-Tage-Fenster verarbeitete das Modell HY4 Preview etwa 2,4 Milliarden Token gegenüber etwa 3,9 Millionen bei GPT-6 Sol. Das ist kein Benchmark und kein Urteil; es ist ein rollierendes Fenster auf den Traffic einer einzigen Plattform und wird nächste Woche anders aussehen. Aber es ist ein echtes Signal dafür, wonach Menschen, die Dinge bauen, tatsächlich greifen, wenn ein starkes Open-Weight-Modell ein Viertel des geschlossenen kostet, und es ist die Art von Zahl, die ein Datenblatt nicht liefern kann.
Die beiden Modelle sind zugleich eine Studie darüber, was ein Benchmark aussagen kann und was nicht. GPT-6 Sol, am 22. September 2026 als mittlere Stufe der GPT-6-Generation von OpenAI veröffentlicht, hat einen unabhängigen Intelligence-Index-Wert. HY4 Preview, am 28. August 2026 von Tencent veröffentlicht und als Open Source freigegeben, hat keine Modellseite bei Artificial Analysis, keinen Drittanbieter-Index und überhaupt keine unabhängige Kostenangabe pro Aufgabe. Alles, was darüber veröffentlicht wurde, wie gut es funktioniert, ist eine eigene Messung von Tencent. Diese Asymmetrie macht HY4 Preview nicht zum schwächeren Modell. Sie macht es zum weniger geprüften, und das sind unterschiedliche Aussagen.
Die Spezifikationen, einschließlich der beiden, die über die meisten Deployments entscheiden
• Ausgabepreis — GPT-6 Sol 10,00 $ pro Million vs. Tencent HY4 Preview 2,50 $ pro Million
• Eingabepreis — GPT-6 Sol 2,00 $ pro Million vs. Tencent HY4 Preview 0,83 $ pro Million
• Zwischengespeicherte Eingabe — GPT-6 Sol 0,20 $ pro Million vs. Tencent HY4 Preview 0,04 $ pro Million
• Gewichte — GPT-6 Sol geschlossen, nur API vs. HY4 Preview als Open Source unter Apache 2.0
• Eingabemodalitäten — GPT-6 Sol Text, Bild und Datei vs. HY4 Preview nur Text
• Kontextfenster — GPT-6 Sol 1.050.000 Token vs. HY4 Preview 1.048.576 Token
• Maximale Ausgabe — GPT-6 Sol 128.000 Token vs. HY4 Preview 64.000 Token
• Schritt für lange Anfragen — GPT-6 Sol berechnet die gesamte Anfrage oberhalb von 272.000 Eingabe-Token neu auf 4,00 $ / 15,00 $ vs. HY4 Preview kein solcher Schritt auf seinem Preisblatt
• Architektur — GPT-6 Sol nicht bekanntgegeben vs. HY4 Preview 770 Mrd. Gesamtparameter, 49 Mrd. aktive, 78 Schichten, 256 geroutete Experten plus einen gemeinsam genutzten, native Multi-Token-Vorhersageschicht
• Unabhängige Bewertung — GPT-6 Sol 47,6 Intelligence Index vs. HY4 Preview keine veröffentlicht
• Gemessene Ausgabegeschwindigkeit — GPT-6 Sol etwa 244 Token pro Sekunde vs. HY4 Preview etwa 54, beides gleitende Sieben-Tage-Werte
Die beiden Zeilen, die die meisten realen Deployments entscheiden, sind die am weitesten unten. Die erste ist, dass HY4 Preview weder Bild- noch Dateieingaben akzeptiert, was es aus jeder Pipeline ausschließt, die sich etwas ansehen muss. Die zweite ist die Ausgabegrenze: 64.000 Token sind die Hälfte von GPT-6 Sols 128.000, und bei einem Modell, dessen erklärter Zweck Coding-Agents und lange Tool-Use-Ketten sind, ist das die Einschränkung, auf die ein Team zuerst stößt – nicht die Qualität, sondern der Punkt, an dem eine generierte Datei nicht mehr in eine einzige Antwort passt.
Dagegen bekommt man für ein Viertel des Output-Preises und ein Fünftel des Preises für gecachte Eingaben sehr viele Wiederholungsversuche. Und die Architektur von HY4 Preview ist auf eine Weise dokumentiert, wie es die von GPT-6 Sol nicht ist: Tencent hat die Parameteranzahl, die Layer-Anzahl, das Experten-Layout und die Speculative-Decoding-Schicht veröffentlicht, was bedeutet, dass die Serving-Eigenschaften zumindest teilweise aus dem Paper vorhersagbar sind, statt nur über die API beobachtbar zu sein.

Was die Benchmark-Tabelle von HY4 Preview wirklich ist
Die von Tencent veröffentlichten Zahlen sind stark, und sie wurden alle vom Anbieter selbst ermittelt. Auf Terminal-Bench 2.1 erreicht das Modell 85,4; auf DeepSWE 64,3; und in einer internen Blindbewertung über 203 Engineering-Aufgaben erreichte es im Durchschnitt 2,99 gegenüber GLM-5.3 mit 2,92 und Kimi K3 mit 2,94 — ein Vorsprung von sieben Hundertsteln eines Punktes auf einer Zehn-Punkte-Skala in einer von Tencent konzipierten Studie. Außerdem debütierte es auf dem Leaderboard von WebDev Arena, wo es laut Tencent insgesamt etwa auf dem fünften Platz und unter den Open-Weight-Modellen auf dem dritten landet. Das Ergebnis der Arena wird durch Crowd-Voting und nicht vom Anbieter bewertet und ist der unabhängigste Beleg in der Sammlung; der Rest ist eine Behauptung, und eine Behauptung ist immer noch lesenswert, solange sie als solche gekennzeichnet ist.
Die entscheidende Lücke ist nicht, dass diese Zahlen großzügig ausfallen könnten – Anbieter-Harnesses sind das üblicherweise, in beide Richtungen. Sie besteht darin, dass es keine zweite Messung gibt, mit der man sie vergleichen könnte. Ein Modell mit einer Artificial-Analysis-Seite lässt sich überprüfen; ein Modell ohne eine solche nicht, und der Unterschied zeigt sich Monate später, wenn jemand entdeckt, dass eine Schlagzeilenzahl auf einem Harness gemessen wurde, den sonst niemand reproduzieren kann. Nichts hier deutet darauf hin, dass dies bei HY4 Preview passiert ist. Es bedeutet nur, dass eine Adoptionsentscheidung, die auf der 85,4 fußt, auf einer einzigen Quelle fußt.
Praktisch bedeutet das, dass HY4 Preview anhand Ihres eigenen Traffics bewertet werden sollte und nicht anhand von Tabellenwerten, und die Kostenstruktur macht das günstig — bei einem Viertel der Ausgaberate von GPT-6 Sol kostet eine Woche Schatten-Traffic mit Ihren echten Prompts weniger als eine einzelne API-Tarifüberprüfung. Das ist die richtige Form der Due Diligence für ein unzureichend vermessenes Modell, und es ist die Form, die fast niemand tatsächlich praktiziert.
Die Open-Weight-Frage, die die eigentliche Trennlinie ist
HY4 Preview ist unter Apache 2.0 quelloffen verfügbar, mit einem permissiv lizenzierten FP8-Build neben dem Basis-Checkpoint. GPT-6 Sol ist geschlossen und hat keine Lizenzdatei, weil es nichts zu lizenzieren gibt. Alles andere in diesem Vergleich ist ein Kompromiss; dieses hier ist ein kategorialer Unterschied.
Was man damit bekommt, ist nicht in erster Linie eine günstigere Rechnung – bei 2,50 US-Dollar pro Million Output liegt die gehostete API bereits unter den Kosten der meisten Teams für den Betrieb eines Modells mit 770 Milliarden Parametern, und wäre der Preis das ganze Argument, wäre die permissive Lizenz nebensächlich. Was man damit bekommt, ist ein Deployment, das nicht von irgendeinem Endpunkt abhängt: Gewichte, die sich nicht per Rate Limit begrenzen lassen, ein Checkpoint, der quantisiert werden kann, um auf die vorhandene Hardware zu passen, ein Modell, das feinabgestimmt werden kann, und Traffic, der innerhalb einer Netzwerkgrenze bleiben kann. GPT-6 Sols Antwort auf alle vier lautet, dass man keines davon brauchen sollte, was für eine echte Gruppe von Teams ein echtes Argument ist und für die Teams, die sie brauchen, ein irrelevantes.
Die Aufteilung der Modalitäten und die Lizenzzeile weisen in dieselbe Richtung, was bemerkenswert ist. Ein Modell, das nur Text liest und unter Apache 2.0 ausgeliefert wird, ist darauf ausgelegt, eine Komponente zu sein – etwas, das man in eine Pipeline einsetzt, die man kontrolliert, und dem man Text zuführt, den man bereits abgeglichen hat. Ein Modell, das Text, Bilder und Dateien liest und nur über eine API erreichbar ist, ist darauf ausgelegt, der Einstiegspunkt zu sein, der die unbereinigte Eingabe direkt entgegennimmt. Das sind unterschiedliche Aufgaben, und ein Vergleich, der sie auf einem einzigen Index einordnet, beantwortet eine Frage, die keiner der Anbieter gestellt hat.

Sie gemeinsam auszuliefern und was die Traffic-Zahl impliziert
Beide Modelle stehen hinter einem OrcaRouter-Schlüssel, zusammen mit über 200 anderen, und die Routing-Form, die diese Paarung nahelegt, ist die Umkehrung des Naheliegenden. Setze HY4 Preview an die erste Stelle – es ist das bei der Ausgabe um den Faktor vier günstigere Modell, es ist das mit der dokumentierten Architektur, und auf unseren Routen ist es dasjenige, das die Last trägt – und halte GPT-6 Sol dahinter für Anfragen, bei denen ein Bild gelesen werden muss, oder die mehr als 64.000 Token ausgeben müssen, oder die eine Qualitätsprüfung nicht bestehen. Die Zusammensetzung wird in der Routing-DSL ausgedrückt statt im Anwendungscode, sodass die Grenze zwischen den beiden eine Regel ist, die man ohne Deployment ändern kann.
Die Geschwindigkeitszahlen verdienen eine Einschränkung und dann eine Schlussfolgerung. HY4 Preview wird in unserem gleitenden Fenster mit ungefähr 54 Ausgabe-Token pro Sekunde gemessen, gegenüber ungefähr 244 bei GPT-6 Sol, und beide sind Beobachtungen auf gemeinsam genutzter Infrastruktur statt eines kontrollierten Benchmarks — die Tencent-Zahl insbesondere spiegelt ein Modell mit einer sehr großen Anzahl aktiver Parameter wider, und 49 Milliarden aktive Parameter pro Token sind eine Menge Rechenarbeit pro Ausgabe-Token. Das günstigere Modell ist also mit großem Abstand das langsamere, was genau der Trade-off ist, den eine Batch-Pipeline gern eingeht und eine interaktive nicht. Der gehostete Build von Tencent erhielt außerdem am 7. September 2026 eine Leistungsoptimierung, die laut Anbieter die Reasoning-Turns und den Token-Verbrauch pro Aufgabe bei gleicher Aufgabenqualität reduziert — eine weitere vom Anbieter angegebene Zahl, aber eine, die eher eine niedrigere Rechnung als einen schnelleren Stream vorhersagt.
Failover ist das, was die Paarung in jeder Reihenfolge sicher macht. Ein Open-Weight-Modell mit 770 Milliarden Parametern wird von mehr als einem Infrastrukturanbieter bereitgestellt, und eine Route, die ausweichen kann, bedeutet, dass ein beeinträchtigter Host einen erneuten Versuch statt eines Ausfalls darstellt. Unser Katalog gibt die Listenpreise der Anbieter ohne Aufschlag weiter, was auch bedeutet, dass der in einer Währung angegebene Anbietertarif nicht etwas ist, auf das Sie warten müssen: Tencent listet HY4 Preview mit 6 Yuan für Input und 18 Yuan für Output pro Million, und der Dollar-Betrag, den unsere Seite anzeigt, ist dieser Tarif umgerechnet, nicht die Marge eines Wiederverkäufers.

Wofür dieses Paar eigentlich gedacht ist
Nehmen Sie Tencent HY4 Preview für Volumen, für reine Text-Pipelines, die Sie kontrollieren, für alles, was auf Ihrer eigenen Hardware laufen muss, und für jede Workload, bei der eine falsche Antwort abgefangen und erneut versucht werden kann – der Preis macht das Wiederholen zum günstigsten Qualitätshebel, den Sie haben. Nehmen Sie GPT-6 Sol, wenn die Eingabe ein Bild oder eine Datei ist, wenn eine Antwort mehr als 64.000 Tokens umfassen muss oder wenn die Antwort an eine Person geht, die danach handelt, ohne sie zu prüfen. Nehmen Sie beides, wenn Ihr Verkehr von beidem etwas enthält, was mit ziemlicher Sicherheit der Fall ist.
Zwei abschließende Kontrollen. HY4 Preview ist weiterhin als Preview gekennzeichnet und bleibt das neueste Tencent-Modell in unserem Katalog, der Name ist also korrekt und nicht veraltet – doch eine Preview kann sich unter Ihnen ändern, und ein permissiv lizenzierter Checkpoint kann ohne Vorwarnung durch seine eigene finale Veröffentlichung abgelöst werden. Und GPT-6 Sol wurde bereits durch GPT-6.1 Sol bei identischen Kurzkontext-Preisen ersetzt, wobei der Preis für zwischengespeicherte Eingaben von 0,20 $ auf 0,10 $ halbiert wurde und OpenAIs eigene Modellseite Leser jetzt dorthin verweist. Wenn der Grund, aus dem Sie Sol statt des Tencent-Modells abwägen, die acht Tage alte Integration ist, dann hat das Bestand. Wenn es um die Leistungsfähigkeit geht, ist der Nachfolger das, was Sie bepreisen sollten.
In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
