
GPT-6 Astra vs. Tencent HY4 Preview: Das eine Modell hat einen Audit-Trail, das andere eine Benchmark-Tabelle
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Tencent HY4 Preview und GPT-6 Astra sind die beiden günstigsten Wege zum nahezu frontier-tauglichen agentischen Coding, die es heute gibt, wenn man die Zahlen der Anbieter selbst heranzieht – und sie sind die beiden am wenigsten vergleichbaren Modelle dieser Klasse, wenn man die Zahlen von irgendjemand anderem heranzieht. Tencent HY4 Preview wurde am 28. August 2026 veröffentlicht und unter Apache 2.0 als Open Source freigegeben, zu 0,834 US-Dollar pro Million Input-Tokens und 2,501 US-Dollar pro Million Output-Tokens, mit einer Mixture-of-Experts-Architektur mit 770 Milliarden Parametern, einem Kontextfenster von über einer Million Tokens und einer Obergrenze von 64.000 Tokens für die Ausgabe. GPT-6 Astra ist seit dem 3. September 2026 allgemein verfügbar, zu 10,00 und 50,00 US-Dollar, mit einem Fenster von 1.050.000 Tokens und maximal 128.000 Tokens Ausgabe. Die Stärken von Astra stützen sich auf acht veröffentlichte Evaluierungen durch Dritte; die von HY4 Preview stützen sich auf Tencent-eigene Terminal-, Tool-Calling- und Blindtest-Läufe und auf sonst nichts. Diese Asymmetrie bedeutet nicht, dass das günstigere Modell schwächer ist. Sie bedeutet, dass einer dieser beiden Vergleiche überprüft werden kann und der andere geglaubt werden muss, und die praktischen Entscheidungen fallen entsprechend unterschiedlich aus.
Was das Apache 2.0-Release tatsächlich bietet
Die Lizenz ist der Teil dieses Vergleichs, den eine Preistabelle nicht ausdrücken kann. Tencent HY4 Preview ist kein gehosteter Teaser mit Open-Weight-Branding – die Gewichte sind von Hugging Face, GitHub, ModelScope und GitCode herunterladbar, was bedeutet, dass das Modell jede Entscheidung von Tencent über seine eigene Preisgestaltung, seinen eigenen Endpunkt oder sein fortgesetztes Interesse daran, es bereitzustellen, überdauert.
• Architektur — 770 Mrd. Gesamtparameter, 49 Mrd. aktive pro Token, 78 Schichten, 256 geroutete Experten plus ein geteilter Experte und eine native Multi-Token-Prediction-Schicht für spekulatives Decodingbr /> • Serving-Eigenschaften — 54,6 Ausgabe-Token pro Sekunde und eine mediane Zeit bis zum ersten Token von 6,26 Sekunden, gemessen über die Routen von OrcaRouter in einem rollierenden Sieben-Tage-Fensterbr /> • Kontext und Obergrenze — ein 1.048.576-Token-Fenster gegenüber einer maximalen Ausgabe von 64.000 Tokenbr /> • Eingabeoberfläche — nur Text; kein Bild, keine Datei, kein Audiobr /> • Reasoning-Steuerung — drei Stufen: hoch, niedrig und keine, wobei hoch die Standardeinstellung ist, plus eine dokumentierte Sampling-Empfehlung von Temperatur 0,9 und top_p 1,0br /> • Zuverlässigkeit — eine Fehlerrate von 2,8 % im selben Sieben-Tage-Fenster, gegenüber 10,3 % auf der Astra-Route
Dieses letzte Zahlenpaar ist die handlungsrelevanteste Information auf dieser Seite, und es ist die Art von Zahl, die kein Anbieter über sein eigenes Modell veröffentlicht. Astras unabhängige Benchmark-Ergebnisse sind höher, und seine Route hat in der vergangenen Woche bei ungefähr einer von zehn Anfragen versagt, während ein Modell ganz ohne unabhängige Bewertungen bei einer von fünfunddreißig versagt hat. Keine der beiden Zahlen ist eine Aussage über die Modelle selbst – Fehlerraten messen die Route, die Rate Limits und das Upstream, nicht die Gewichte –, aber es sind die Zahlen, die ein Produktionssystem tatsächlich erlebt.

Wo sich die Zahlen von Tencent mit denen eines anderen abgleichen lassen
Soweit veröffentlichte Belege reichen, ist dies eine wirklich ungewöhnliche Gelegenheit: Astra und HY4 Preview verfügen beide über einen Terminal-Bench-2.1-Wert, und nur bei einem davon handelt es sich um eine Anbieterangabe.
• Terminal-Bench 2.1, Steuerung eines echten Terminals — GPT-6 Astra 88,4, unabhängig evaluiert; Tencent HY4 Preview 85,4, vom Anbieter gemeldetbr /> • Tool-Aufruf — Astra 41,4 bei τ²-Banking, unabhängig evaluiert; HY4 Preview 74,1 bei Toolathlon-Verified, vom Anbieter gemeldet, in einem anderen Testbr /> • Software-Engineering — HY4 Preview 64,3 bei DeepSWE, ein Anstieg von 28,0 beim Vorgänger Hy3, vom Anbieter gemeldetbr /> • Agenten-Aufgaben — HY4 Preview 37,1 pass@1 bei APEX-Agents, vom Anbieter gemeldetbr /> • Menschliche Präferenz — ein Durchschnitt von 2,99 von 4,00 über 203 Engineering-Aufgaben, die von 163 Experten bewertet wurden, vom Anbieter durchgeführt, gegenüber GLM-5.3 mit 2,92 und Kimi K3 mit 2,94br /> • Unabhängiger Index — GPT-6 Astra 54,7 Intelligence Index und 96,1 GPQA Diamond, von Drittanbietern; für HY4 Preview existiert kein vergleichbarer Index
Die Terminal-Bench-Zeile ist die, bei der es sich lohnt zu verweilen. Eine 3-Punkte-Lücke zwischen einer unabhängigen 88,4 und einer vom Anbieter gemeldeten 85,4 liegt deutlich innerhalb der Bandbreite, die ein anderes Harness, ein anderes Scaffold oder eine andere Sampling-Temperatur erzeugen kann, was bedeutet, dass die ehrliche Lesart nicht „Astra ist drei Punkte besser“ lautet, sondern „das günstigste Open-Weight-Modell in dieser Stufe beansprucht Parität, und der Anspruch ist zumindest plausibel.“ Tencents eigene Darstellung ist an diesem Punkt vorsichtig: Sie beschreibt DeepSWE als „allmählich die Lücke verkleinernd“ statt sie zu schließen, und ihr einziger sauberer Paritätsanspruch – der Gleichstand bei Terminal-Bench mit einem führenden geschlossenen Modell eines anderen Anbieters – ist genau der Anspruch, der am meisten eine zweite Messung benötigt.
Es gibt außerdem eine Änderung, die man kennen sollte, weil sie die Wirtschaftlichkeit verschiebt und nicht die Punktzahlen. Am 7. September 2026 hat Tencent eine Optimierung in den Live-Preview-Build eingespielt, die laut Tencent Reasoning-Turns und den Tokenverbrauch pro Aufgabe bei komplexen Arbeiten reduziert. Da das Modell pro Token abgerechnet wird, senken weniger Token pro abgeschlossener Aufgabe die Kosten der Aufgabe, auch wenn der Preis pro Token unverändert bleibt. Die Höhe dieser Einsparung ist Tencents eigene Messung, und niemand außerhalb von Tencent hat sie reproduziert – aber der Mechanismus ist real, und er ist der Grund, warum eine im August veröffentlichte Preview im Oktober deutlich günstiger zu betreiben sein kann, als ihr Ankündigungstext zum Start nahelegte.
Die Obergrenze von 64.000 Token ist die Spezifikation, die über Deployments entscheidet
Mitten im Datenblatt steht die Einschränkung, die zuerst zuschlägt, und es ist nicht die Qualität. Die maximale Ausgabe von HY4 Preview beträgt 64.000 Tokens gegenüber 128.000 bei Astra – und das bei einem Modell, dessen angegebener Zweck Coding-Agenten und lange Tool-Use-Ketten sind. Eine generierte Datei, ein Multi-File-Patch, ein langer strukturierter Bericht – das sind die Ausgaben, die an eine Obergrenze stoßen, und bei einem Agentenlauf ist der Fehler nicht eine etwas schlechtere Antwort, sondern eine abgeschnittene, die die umgebende Pipeline erkennen und behandeln muss.
Beide Modelle verarbeiten ungefähr eine Million Tokens Eingabe, der Fall des Dokumentenlesens ist also wirklich ein Patt. Der Unterschied liegt vollständig auf der Generierungsseite, und er beträgt den Faktor zwei statt eines Rundungsfehlers. Nimmt man den Unterschied bei der Eingabeoberfläche hinzu – Astra akzeptiert Bilder und Dateien, HY4 Preview arbeitet nur mit Text –, ergibt sich das Bild einer sauberen Arbeitsteilung statt einer Rangfolge: das Open-Weight-Modell für Agentenschleifen mit Text als Ein- und Ausgabe, bei denen das Ergebnis ein Tool-Aufruf oder ein Diff ist, und das geschlossene Modell für alles, das etwas ansehen oder etwas Langes schreiben muss.
Was 20× die Ausgaberate bringt, Zeile für Zeile
• Eingabepreis — Tencent HY4 Preview $0,834 pro 1 Mio. vs. GPT-6 Astra $10,00, etwa 12×br /> • Ausgabepreis — HY4 Preview $2,501 pro 1 Mio. vs. Astra $50,00, etwa 20×br /> • Zwischengespeicherte Eingabe — HY4 Preview $0,042 pro 1 Mio. vs. Astra $1,00, etwa 24×br /> • Stufe für lange Anfragen — Astra bepreist die gesamte Anfrage oberhalb von 272.000 Eingabe-Tokens neu auf $20,00 und $75,00; die Preisübersicht von HY4 Preview hat keine entsprechende Stufebr /> • Effektiver Eingabepreis bei einem Prompt mit 400.000 Tokens — HY4 Preview unverändert bei $0,834 vs. Astra $20,00, etwa 24×br /> • Kosten pro Million Tokens eines gewöhnlichen Agent-Loops, 4:1 Eingabe zu Ausgabe — HY4 Preview ungefähr $1,17 vs. Astra ungefähr $18,00br /> • Kosten eines Monats mit 100 Millionen Tokens bei demselben Verhältnis — HY4 Preview ungefähr $117 vs. Astra ungefähr $1.800
Die Cached-Input-Zeile ist diejenige, die sich für die teure Seite am schlechtesten skaliert, weil Agenten-Loops denselben System-Prompt und Konversationspräfix in jeder Runde erneut senden. Bei $0,042 gegenüber $1,00 sind die günstigsten Tokens eines langen Loops auf dem Tencent-Modell 24-mal billiger, und genau das ist die Workload, bei der sich eine kleine Differenz pro Token am schnellsten summiert. Die Kosten pro Aufgabe – die Kennzahl, die dies sauber entscheiden würde – werden von Tencent überhaupt nicht veröffentlicht; die einzige Möglichkeit, die Zahl zu erhalten, auf die es ankommt, besteht also darin, beide Modelle durch Ihr eigenes Aufgabenset laufen zu lassen und das Usage-Objekt auszulesen.

Was ein Router hier hinzufügt, mit den Fehlerraten zur Hand
Beide Modelle sind im OrcaRouter-Katalog — tencent/hy4-preview und openai/gpt-6-astra — hinter einem OpenAI-kompatiblen Endpunkt, jeweils zum eigenen Listenpreis des Anbieters, mit 0 % Aufschlag weitergegeben. Dieses letzte Detail ist bei diesem Paar wichtiger als bei den meisten, weil der Listenpreis des Tencent-Modells in Yuan veröffentlicht wird: Die oben genannten Dollar-Beträge sind der umgerechnete Preis, den Sie tatsächlich sehen, keine Wiederverkäufer-Marge, und wenn Tencent den Preis ändert, ist die Änderung hier noch am selben Tag live, statt erst zur nächsten Vertragsverlängerung.
Das Routing-DSL ist der Punkt, an dem die beiden Modelle aufhören, Alternativen zu sein. Die naheliegende Regel für dieses Paar ist die Eskalation bei der Ausgabe: Schicke die Schleife zum günstigen Modell, und wenn eine Antwort abgeschnitten an der Obergrenze von 64.000 Token zurückkommt oder deine Schema-Prüfung nicht besteht, wiederhole diesen Schritt mit openai/gpt-6-astra, das doppelt so viel Ausgaberaum bietet. Der automatische Failover ist die andere Hälfte des Arguments, und er ist nicht theoretisch, wenn eine der beiden Routen in der vergangenen Woche bei einer von zehn Anfragen Fehler geworfen hat — ein langer Agentenlauf, der an ein einziges Modell gebunden ist, stirbt mitsamt seinem angesammelten Kontext, und keines dieser Modelle ist günstig genug, um versehentlich von vorn neu gestartet zu werden.

Was würde diesen Vergleich ändern?
Drei Dinge, in der Reihenfolge, wie stark sie etwas bewegen würden. Eine unabhängige Evaluierung von HY4 Preview – das Modell ist seit sechs Wochen öffentlich, hat keinen Drittanbieter-Index, keine reproduzierte Terminal-Bench-Zahl und keine Kostenangabe pro Aufgabe, und die einzige vom Anbieter durchgeführte Blindbewertung ist die einzige Quelle für menschliche Präferenzdaten, die es gibt. Veröffentlichte Kosten pro abgeschlossener Aufgabe für beide Modelle, was jedes Verhältnis in diesem Artikel durch eine einzige Zahl ersetzen würde. Und eine Entscheidung von Tencent zur Inferenz durch Dritte, denn Apache-2.0-Gewichte können von jedem bereitgestellt werden, und sobald konkurrierende Anbieter HY4 Preview bereitstellen, wird der Preis auf der günstigen Seite dieses Vergleichs ein Markt statt einer Liste.
Bis dahin ist die brauchbare Zusammenfassung enger gefasst als die Launch-Posts beider Anbieter und ehrlicher als eine Anzeigetafel: GPT-6 Astra ist das Modell, dessen Leistungsversprechen überprüft wurden, mit doppelt so hoher Ausgabegrenze und einer Route, die bei einer von zehn Anfragen fehlgeschlagen ist. Tencent HY4 Preview ist das Modell, dessen Leistungsversprechen nicht überprüft wurden, mit veröffentlichter Architektur, offener Lizenz, einem Drittel des Preises und einer viel niedrigeren Fehlerquote im selben Zeitfenster. Wenn Ihre Arbeit Text-in, Text-out ist und in 64.000 generierte Token passt, ist das günstigere Modell kein Kompromiss – es ist die richtige Antwort, und der Audit-Trail ist das Einzige, was Sie aufgeben.
Die naheliegende Regel für dieses Paar ist Eskalation auf der Ausgabeseite: Schicken Sie die Schleife zum günstigen Modell, und wenn eine Antwort abgeschnitten an der Obergrenze von 64.000 Tokens zurückkommt oder Ihre Schema-Prüfung nicht besteht, wiederholen Sie diesen Schritt mit openai/gpt-6-astra, das doppelt so viel Platz für Ausgaben bietet.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
