
Tencent HY4 Preview vs Qwen3.8-Max: Das August-Open-Weight-Duell
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Tencent HY4 Preview vs Qwen3.8-Max ist der Zusammenstoß, {{1}}auf den dieser Monat zusteuerte{{/1}}. Alibabas Qwen3.8-Max wurde am 3. August allgemein verfügbar und war am 12. August das erste Max-Klasse-Qwen mit offenen Gewichten; Tencent HY4 Preview kam heute Morgen, 25 Tage später, mit einer Launch-Karte, die Qwen3.8-Max direkt nennt – Tencent gibt HY4 Preview mit 74,1 bei Toolathlon-Verified an, vor Qwen3.8-Max in diesem Benchmark. Beide sind chinesische Flaggschiffe mit offenen Gewichten, beide sind preislich auf schnellen Absatz ausgelegt, und nur eines von ihnen hat unabhängige Scores.
Die beiden Modelle trennt mehr als nur die Größe: Qwen3.8-Max kommt auf 2,4 Billionen Parameter, HY4 Preview auf 770 Milliarden. Doch bei den agentischen Benchmarks, die für Käufer zählen, zielen sie auf dasselbe Ziel: langfristige Aufgaben, bei denen ein Modell liest, Tools aufruft und iteriert – ohne dass ein Mensch eingreift. Genau das ist das Terrain, auf dem die im August erschienene Open-Weight-Generation beweisen will, dass sie geschlossene Frontier-Modelle ersetzen kann. Tencents erster Schachzug war es, die größte Open-Release des Monats ins Visier zu nehmen.
Die Anzeigetafel

• Größe — HY4 Preview 770B gesamt / 49B aktiv vs. Qwen3.8-Max 2.4T gesamt / ~95B aktiv
• Kontext — HY4 Preview mit >1M Tokens vs. Qwen3.8-Max mit 1M Tokens über die API (262K nativ in Open Weights, erweiterbar auf ~1.01M)
• Preis pro 1M — HY4 Preview ¥6 Eingabe / ¥18 Ausgabe (≈$0,85 / $2,50) vs. Qwen3.8-Max $2,00 Eingabe / $6,00 Ausgabe, Cache-Lesezugriffe $0,25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (Herstellerangabe) vs. Qwen3.8-Max 86.6
• Modalität — beide in ihren Open-Weight-Formen nur Text; die Qwen3.8-Max-API fügt Bild- und Videoeingabe hinzu, die HY4 Preview hingegen nicht.
• Unabhängiger Score — HY4 Preview: keiner vs Qwen3.8-Max AA: Intelligence Index 58, Agentic Index 58
Die beiden Karten erzählen dieselbe Geschichte von gegenüberliegenden Seiten. Auf Terminal-Bench 2.1 trennen Qwen3.8-Max' 86.6 und HY4 Previews 85.4 eineinhalb Punkte – ein Punkt zugunsten von Qwen, und die HY4-Zahl ist ungeprüft. Beim Preis ist HY4 Preview sowohl beim Input als auch beim Output pro Token günstiger. Bei der Verifizierung hat Qwen3.8-Max einen unabhängigen Intelligence Index von 58 und einen Agentic Index von 58; HY4 Preview hat nichts außer seiner eigenen Presse. Der Abstand ist das klassische Muster eines Herausforderers, der mit besseren Preisen und unbewiesenen Behauptungen gegen einen verifizierten Platzhirsch antritt.
Toolathlon-Anspruch lesen
Toolathlon-Verified misst die Zuverlässigkeit des agentischen Tool-Einsatzes – wie konsistent ein Modell ein Tool durch eine vollständige Aufgabe mit Fehlern, Wiederherstellung und mehrstufigen Aufrufen steuert. Tencents 74,1 zielt direkt auf den stärksten Teil des Profils von Qwen3.8-Max ab, denn Qwens Agentic Index von 58 und sein OSWorld-Verified-Wert von 86,1 sind die Zahlen, die Alibabas agentisches Angebot glaubwürdig machten. Qwen3.8-Max erreicht außerdem 82,8 bei IFBench (Anweisungsbefolgung) und 93,0 bei PaperBench (agentische Arbeit auf Forschungsebene) und übertrifft damit in beiden Fällen Modelle wie GPT-5.6 Sol in den eigenen Tabellen des Anbieters. Also hat Tencent genau den einen Benchmark gewählt, bei dem es einen direkten Sieg über das größte offene Modell des Monats beansprucht – und dieser Anspruch ist derzeit so verifizierbar wie jede andere einzelne Anbieterzeile: überhaupt nicht.
Verifiziert vs. anbietergemeldet
Dies ist die Achse, auf der das Duell am wenigsten fair ist, und die Asymmetrie sollte explizit benannt werden. Qwen3.8-Max' Intelligence Index von 58 stammt von Artificial Analysis, sein Agentic Index von 58 stammt von Artificial Analysis, und dieselben unabhängigen Testumgebungen, die ihm diese Werte bescheinigten, haben auch seine Schwächen gemessen: eine Halluzinationsrate von 40 % bei AA-Omniscience, gestiegen von 23 % bei der vorherigen Generation, und enorm hohe 64 agentic turns pro Aufgabe – das Modell arbeitet hart, und man zahlt für jeden Turn. Tencent HY4 Preview verfügt über keinerlei derartige Instrumentierung. Seine Stärken sind Behauptungen, und seine Fehlerbilder – Tencent selbst weist auf langes Denken und übermäßige Selbstverifikation hin – sind Eingeständnisse, keine Messwerte.
Für ein Team, das zwischen den beiden wählt, ist die Verifikationslücke nicht abstrakt. Das 64-Turns-pro-Aufgabe-Verhalten von Qwen3.8-Max ist ein realer, gemessener Kostentreiber: Bei $2/$6 ist es in einigen Drittanbieter-Vergleichen immer noch der teuerste Agent pro abgeschlossener Aufgabe, und Teams haben berichtet, dass die Turn-Anzahl seinen Preisvorteil aufzehrt. Das äquivalente Verhalten von HY4 Preview ist unbekannt – es könnte pro Aufgabe günstiger sein, als sein ohnehin schon niedriger Preis pro Token vermuten lässt, oder seine Selbstverifikations-Gewohnheit könnte die Differenz auffressen. Das kann Ihnen derzeit niemand sagen, weil es außerhalb von Tencent niemand ausgeführt hat.
Preis und die praktischen Aspekte von Open-Weights
Pro Token ist HY4 Preview auf beiden Seiten der Rechnung günstiger: ¥6/¥18 gegenüber den $2,00/$6,00 von Qwen3.8-Max, und Cache-Treffer bei ¥0,3 gegenüber $0,25. Damit ist HY4 Preview das günstigste Open-Weight-Flaggschiff bei Eingabe oder Ausgabe – Punkt. Aber „Open Weights“ bringt zwei verschiedene Arten von Kleingedrucktem mit sich. Die Open-Weights-Veröffentlichung von Qwen3.8-Max – das Qwen3.8-2.4T-A95B – ist rein textbasiert, mit erzwungenem Denkmodus, nativem Kontext von 262K statt der 1M der API, und einer eigenen Lizenz mit größenabhängigen Bedingungen: Anforderungen zur Anzeige des Modellnamens bei über 100M monatlichen Nutzern sowie eine separate Lizenz für große Model-as-a-Service-Unternehmen. Die Gewichte von Tencent HY4 Preview sind seit heute Morgen auf HuggingFace, ModelScope und GitHub verfügbar, aber die genauen Lizenzbedingungen und ob die Gewichte mit der bereitgestellten API übereinstimmen, wurden nicht mit dieser Klarheit dargelegt. Beide Modelle sind herunterladbar; keines ist ein trivialer Drop-in-Ersatz.
Das Fazit
Qwen3.8-Max ist in jeder Hinsicht, in der Verifikation Sicherheit schafft, die sicherere Wahl: unabhängig bewertet bei Intelligenz und agentischer Arbeit, bekannte Fehlermodi, eine geklärte Lizenz und drei Wochen Produktionsfeedback. Es ist auch die teurere Wahl pro Token, und sein gemessenes turn-lastiges Verhalten ist ein bekanntes Kostenrisiko. Tencent HY4 Preview ist die Value-Wette: günstiger bei Input und Output, ein vergleichbarer Terminal-Bench-Anspruch und ein direkter Anspruch auf Toolathlon-Verified gegenüber {{1}}Qwen{{/1}} — all das am ersten Tag unverifiziert. Wenn Sie diese Woche ein Open-Weight-Modell in Produktion nehmen, ist Qwen3.8-Max die vertretbare Wahl, und es ist live auf OrcaRouter zum Listenpreis von {{2}}Alibaba{{/2}} — $2.00/$6.00, ohne Aufschlag weitergegeben. HY4 Preview ist das Evaluierungsprojekt: Führen Sie es über Tencents eigene API gegen Ihre eigenen Aufgaben im Toolathlon-Stil aus, behalten Sie den Produktionspfad auf dem verifizierten Modell, und wenn die unabhängigen Ergebnisse eintreffen — oder wenn HY4 Preview einen Router erreicht und sein ¥6/¥18-Satz zu einer taggleichen Durchreichung wird — ist der Wechsel eine Routing-Regel, keine Neuschreibung.


Was zu sehen
• Der erste unabhängige Lauf von HY4 Preview auf einem agentischen Testumfeld. Die Toolathlon-verifizierte 74.1 ist die Zahl, die Tencent gewinnen will; ein Agentic Index eines Drittanbieters wäre die Bestätigung.
• Die gemessene Turn-Anzahl von HY4 Preview. Die 64 Turns pro Aufgabe bei Qwen3.8-Max sind das warnende Beispiel; ob HY4 Preview pro abgeschlossene Aufgabe günstiger ist, ist das gesamte wirtschaftliche Argument.
• Die Lizenzbedingungen für die Gewichte. Sie werden bestimmen, ob „offen“ für HY4 Preview „in Ihrem Maßstab nutzbar“ bedeutet, so wie die Qwen3.8-Max-Lizenzbedingungen es für {{1}}Alibaba{{/1}}s Modell taten.
• Ob einer der beiden Anbieter den Preis erneut senkt. In einem Monat, in dem zwei Open-Weight-Flaggschiffe mit aggressiver Preisgestaltung auf den Markt kamen, macht die Durchreichung über einen Router jede weitere Senkung noch am selben Tag sichtbar.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
