Eine Hero-Titelkarte für den Vergleich 'Tencent HY4 Preview vs Qwen3.8-Max'. Ein zentrales Banner zeigt „Das Open-Weight-Duell im August', mit der Anmerkung „Zwei Open-Weight-Flaggschiffe, 25 Tage auseinander'. Linke Karte 'Tencent HY4 Preview' listet '770B / 49B aktiv, veröffentlicht am 28. August', '¥6 / ¥18 pro 1M', 'Keine unabhängigen Bewertungen'. Rechte Karte 'Qwen3.8-Max' listet '2.4T / ~95B aktiv, veröffentlicht am 3. August', '$2.00 / $6.00 pro 1M', 'AA-Index 58'. Eine Fußzeile lautet 'HY4 Preview-Zahlen vom Anbieter gemeldet; Qwen3.8-Max-Ergebnisse laut Artificial Analysis.' Das OrcaRouter-Logo ist in der unteren rechten Ecke platziert.
Guides & Insights

Tencent HY4 Preview vs Qwen3.8-Max: Das August-Open-Weight-Duell

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Tencent HY4 Preview vs Qwen3.8-Max ist der Zusammenstoß, {{1}}auf den dieser Monat zusteuerte{{/1}}. Ali​babas Qwen3.8-Max wurde am 3. August allgemein verfügbar und war am 12. August das erste Max-Klasse-Qw​en mit offenen Gewichten; Tencent HY4 Preview kam heute Morgen, 25 Tage später, mit einer Launch-Karte, die Qwen3.8-Max direkt nennt – Tencent gibt HY4 Preview mit 74,1 bei Toolathlon-Verified an, vor Qwen3.8-Max in diesem Benchmark. Beide sind chinesische Flaggschiffe mit offenen Gewichten, beide sind preislich auf schnellen Absatz ausgelegt, und nur eines von ihnen hat unabhängige Scores.

Die beiden Modelle trennt mehr als nur die Größe: Qwen3.8-Max kommt auf 2,4 Billionen Parameter, HY4 Preview auf 770 Milliarden. Doch bei den agentischen Benchmarks, die für Käufer zählen, zielen sie auf dasselbe Ziel: langfristige Aufgaben, bei denen ein Modell liest, Tools aufruft und iteriert – ohne dass ein Mensch eingreift. Genau das ist das Terrain, auf dem die im August erschienene Open-Weight-Generation beweisen will, dass sie geschlossene Frontier-Modelle ersetzen kann. Tencents erster Schachzug war es, die größte Open-Release des Monats ins Visier zu nehmen.

Die Anzeigetafel

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Größe — HY4 Preview 770B gesamt / 49B aktiv vs. Qwen3.8-Max 2.4T gesamt / ~95B aktiv

• Kontext — HY4 Preview mit >1M Tokens vs. Qwen3.8-Max mit 1M Tokens über die API (262K nativ in Open Weights, erweiterbar auf ~1.01M)

• Preis pro 1M — HY4 Preview ¥6 Eingabe / ¥18 Ausgabe (≈$0,85 / $2,50) vs. Qwen3.8-Max $2,00 Eingabe / $6,00 Ausgabe, Cache-Lesezugriffe $0,25

• Terminal-Bench 2.1 — HY4 Preview 85.4 (Herstellerangabe) vs. Qwen3.8-Max 86.6

• Modalität — beide in ihren Open-Weight-Formen nur Text; die Qwen3.8-Max-API fügt Bild- und Videoeingabe hinzu, die HY4 Preview hingegen nicht.

• Unabhängiger Score — HY4 Preview: keiner vs Qwen3.8-Max AA: Intelligence Index 58, Agentic Index 58

Die beiden Karten erzählen dieselbe Geschichte von gegenüberliegenden Seiten. Auf Terminal-Bench 2.1 trennen Qwen3.8-Max' 86.6 und HY4 Previews 85.4 eineinhalb Punkte – ein Punkt zugunsten von Qwen, und die HY4-Zahl ist ungeprüft. Beim Preis ist HY4 Preview sowohl beim Input als auch beim Output pro Token günstiger. Bei der Verifizierung hat Qwen3.8-Max einen unabhängigen Intelligence Index von 58 und einen Agentic Index von 58; HY4 Preview hat nichts außer seiner eigenen Presse. Der Abstand ist das klassische Muster eines Herausforderers, der mit besseren Preisen und unbewiesenen Behauptungen gegen einen verifizierten Platzhirsch antritt.

Toolathlon-Anspruch lesen

Toolathlon-Verified misst die Zuverlässigkeit des agentischen Tool-Einsatzes – wie konsistent ein Modell ein Tool durch eine vollständige Aufgabe mit Fehlern, Wiederherstellung und mehrstufigen Aufrufen steuert. Tencents 74,1 zielt direkt auf den stärksten Teil des Profils von Qwen3.8-Max ab, denn Qw​ens Agentic Index von 58 und sein OSWorld-Verified-Wert von 86,1 sind die Zahlen, die Ali​babas agentisches Angebot glaubwürdig machten. Qwen3.8-Max erreicht außerdem 82,8 bei IFBench (Anweisungsbefolgung) und 93,0 bei PaperBench (agentische Arbeit auf Forschungsebene) und übertrifft damit in beiden Fällen Modelle wie GPT-5.6 Sol in den eigenen Tabellen des Anbieters. Also hat Tencent genau den einen Benchmark gewählt, bei dem es einen direkten Sieg über das größte offene Modell des Monats beansprucht – und dieser Anspruch ist derzeit so verifizierbar wie jede andere einzelne Anbieterzeile: überhaupt nicht.

Verifiziert vs. anbietergemeldet

Dies ist die Achse, auf der das Duell am wenigsten fair ist, und die Asymmetrie sollte explizit benannt werden. Qwen3.8-Max' Intelligence Index von 58 stammt von Artificial Analysis, sein Agentic Index von 58 stammt von Artificial Analysis, und dieselben unabhängigen Testumgebungen, die ihm diese Werte bescheinigten, haben auch seine Schwächen gemessen: eine Halluzinationsrate von 40 % bei AA-Omniscience, gestiegen von 23 % bei der vorherigen Generation, und enorm hohe 64 agentic turns pro Aufgabe – das Modell arbeitet hart, und man zahlt für jeden Turn. Tencent HY4 Preview verfügt über keinerlei derartige Instrumentierung. Seine Stärken sind Behauptungen, und seine Fehlerbilder – Tencent selbst weist auf langes Denken und übermäßige Selbstverifikation hin – sind Eingeständnisse, keine Messwerte.

Für ein Team, das zwischen den beiden wählt, ist die Verifikationslücke nicht abstrakt. Das 64-Turns-pro-Aufgabe-Verhalten von Qwen3.8-Max ist ein realer, gemessener Kostentreiber: Bei $2/$6 ist es in einigen Drittanbieter-Vergleichen immer noch der teuerste Agent pro abgeschlossener Aufgabe, und Teams haben berichtet, dass die Turn-Anzahl seinen Preisvorteil aufzehrt. Das äquivalente Verhalten von HY4 Preview ist unbekannt – es könnte pro Aufgabe günstiger sein, als sein ohnehin schon niedriger Preis pro Token vermuten lässt, oder seine Selbstverifikations-Gewohnheit könnte die Differenz auffressen. Das kann Ihnen derzeit niemand sagen, weil es außerhalb von Tencent niemand ausgeführt hat.

Preis und die praktischen Aspekte von Open-Weights

Pro Token ist HY4 Preview auf beiden Seiten der Rechnung günstiger: ¥6/¥18 gegenüber den $2,00/$6,00 von Qwen3.8-Max, und Cache-Treffer bei ¥0,3 gegenüber $0,25. Damit ist HY4 Preview das günstigste Open-Weight-Flaggschiff bei Eingabe oder Ausgabe – Punkt. Aber „Open Weights“ bringt zwei verschiedene Arten von Kleingedrucktem mit sich. Die Open-Weights-Veröffentlichung von Qwen3.8-Max – das Qwen3.8-2.4T-A95B – ist rein textbasiert, mit erzwungenem Denkmodus, nativem Kontext von 262K statt der 1M der API, und einer eigenen Lizenz mit größenabhängigen Bedingungen: Anforderungen zur Anzeige des Modellnamens bei über 100M monatlichen Nutzern sowie eine separate Lizenz für große Model-as-a-Service-Unternehmen. Die Gewichte von Tencent HY4 Preview sind seit heute Morgen auf HuggingFace, ModelScope und GitHub verfügbar, aber die genauen Lizenzbedingungen und ob die Gewichte mit der bereitgestellten API übereinstimmen, wurden nicht mit dieser Klarheit dargelegt. Beide Modelle sind herunterladbar; keines ist ein trivialer Drop-in-Ersatz.

Das Fazit

Qwen3.8-Max ist in jeder Hinsicht, in der Verifikation Sicherheit schafft, die sicherere Wahl: unabhängig bewertet bei Intelligenz und agentischer Arbeit, bekannte Fehlermodi, eine geklärte Lizenz und drei Wochen Produktionsfeedback. Es ist auch die teurere Wahl pro Token, und sein gemessenes turn-lastiges Verhalten ist ein bekanntes Kostenrisiko. Tencent HY4 Preview ist die Value-Wette: günstiger bei Input und Output, ein vergleichbarer Terminal-Bench-Anspruch und ein direkter Anspruch auf Toolathlon-Verified gegenüber {{1}}Qw​en{{/1}} — all das am ersten Tag unverifiziert. Wenn Sie diese Woche ein Open-Weight-Modell in Produktion nehmen, ist Qwen3.8-Max die vertretbare Wahl, und es ist live auf OrcaRouter zum Listenpreis von {{2}}Ali​baba{{/2}} — $2.00/$6.00, ohne Aufschlag weitergegeben. HY4 Preview ist das Evaluierungsprojekt: Führen Sie es über Tencents eigene API gegen Ihre eigenen Aufgaben im Toolathlon-Stil aus, behalten Sie den Produktionspfad auf dem verifizierten Modell, und wenn die unabhängigen Ergebnisse eintreffen — oder wenn HY4 Preview einen Router erreicht und sein ¥6/¥18-Satz zu einer taggleichen Durchreichung wird — ist der Wechsel eine Routing-Regel, keine Neuschreibung.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

Was zu sehen

• Der erste unabhängige Lauf von HY4 Preview auf einem agentischen Testumfeld. Die Toolathlon-verifizierte 74.1 ist die Zahl, die Tencent gewinnen will; ein Agentic Index eines Drittanbieters wäre die Bestätigung.

• Die gemessene Turn-Anzahl von HY4 Preview. Die 64 Turns pro Aufgabe bei Qwen3.8-Max sind das warnende Beispiel; ob HY4 Preview pro abgeschlossene Aufgabe günstiger ist, ist das gesamte wirtschaftliche Argument.

• Die Lizenzbedingungen für die Gewichte. Sie werden bestimmen, ob „offen“ für HY4 Preview „in Ihrem Maßstab nutzbar“ bedeutet, so wie die Qwen3.8-Max-Lizenzbedingungen es für {{1}}Alibaba{{/1}}s Modell taten.

• Ob einer der beiden Anbieter den Preis erneut senkt. In einem Monat, in dem zwei Open-Weight-Flaggschiffe mit aggressiver Preisgestaltung auf den Markt kamen, macht die Durchreichung über einen Router jede weitere Senkung noch am selben Tag sichtbar.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube