Eine Hero-Titelkarte für den Start der Tencent HY4 Preview. Ein zentrierter Titel lautet 'Tencent HY4 Preview — Open-Source-Grenze, niedriger Preis'. Wichtige Spec-Chips darunter: '770B gesamt / 49B aktiv (MoE)', '1M Kontext', 'Offene Gewichte: 28. Aug. 2026', '6 / 18 Yuan pro MTok'. Eine Fußzeile lautet 'Softwareentwicklung · Büro · Spieleentwicklung · wissenschaftliche Forschung'. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Tencent HY4 Preview ist Open Source: 770B MoE, 1M Kontext und ein Preis, der die Frontier-Modelle unterbietet.

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Tencent HY4 Preview, am 28. August 2026 veröffentlicht und als Open Source bereitgestellt, ist das erste wirklich konkurrenzfähige Open-Weight-Flaggschiff eines chinesischen Labors seit Monaten, und seine überraschendste Zahl ist der Preis. Tencent listet ihn mit 6 Yuan (~0,85 US-Dollar) pro Million Eingabe-Tokens und 18 Yuan (~2,50 US-Dollar) pro Million Ausgabe-Tokens – etwa ein Zehntel dessen, was ein erstklassiges geschlossenes Frontier-Modell für die Ausgabe verlangt – und veröffentlicht dabei ein Mixture-of-Experts-Modell mit 770 Milliarden Parametern, von denen 49 Milliarden pro Token aktiv sind, mit einem Kontextfenster, das eine Million Tokens übersteigt. Es ist der Nachfolger des Hy3 aus der Hunyuan-Familie (295B gesamt, 256K Kontext) und vervierfacht diesen Kontext, während es die aktive Kapazität mehr als verdoppelt. Die Gewichte sind ab heute von Hugging Face, GitHub, ModelScope und GitCode herunterladbar, und dasselbe Modell ist bereits in Tencent-eigenen Produkten live: WorkBuddy, CodeBuddy in nationalen und internationalen Builds, der Assistent Yuanbao und die Workspace-App ima. Für alle, die beobachtet haben, wie Open-Weight-Modelle bei Software-Engineering-Aufgaben hinter dem Spitzenstandard zurückbleiben, ist dies die Veröffentlichung, die die Lücke endlich argumentierbar macht – und die Einschränkungen sind genauso wichtig wie die Zahlen.

Die Positionierung ist bewusst. Tencent positioniert Tencent HY4 Preview als Produktivitätsmodell für vier Bereiche: Softwareentwicklung, Büro- und Datenanalyse, Spieleentwicklung und wissenschaftliche Forschung. Der technische Schwerpunkt unterscheidet es von der breiten Masse der Generalisten – die Versionshinweise beginnen mit langfristigem Aufgabenverständnis, Planung und Debugging, nicht mit Chat-Qualität. Dieser Fokus zeigt sich in der Integrationsliste ebenso wie in der Benchmark-Tabelle: CodeBuddy erhält das Modell in seiner IDE, WorkBuddy in Büro-Workflows (Tencent demonstriert, wie es in einem Durchgang 72 Finanzdokumente verarbeitet), und Spieleentwickler erhalten MCP-Hooks in Unreal Engine 5 und Unity, die einen einzelnen Satz in eine spielbare Demo verwandeln.

Was tatsächlich ausgeliefert wurde

Das Datenblatt ist es wert, Zeile für Zeile gelesen zu werden, denn jede Zeile ändert, was ein Open-Weight-Modell tun darf.

• Architektur — Mixture-of-Experts mit 770B Gesamtparametern und 49B aktiven pro Token, ein Sparsity-Verhältnis von etwa 16:1, das die Inferenzkosten in einem Bereich hält, den sich ein kleines Team tatsächlich leisten kann.

• Kontextfenster – über 1 Million Tokens, viermal so viel wie Hy3s 256K. Langfristige Engineering-Aufgaben – ein vollständiges Repository im Fenster, ein Multi-Datei-Refactoring, ein großes Dokumentenpaket – werden zu Problemen, die mit einer einzigen Anfrage gelöst werden.

• Gewichte — Open Release im MIT-Stil über Hugging Face, GitHub, ModelScope und GitCode. Dies ist ein herunterladbares, selbst hostbares Modell, kein gehosteter Teaser.

• API – verfügbar auf TokenHub von Tencent Cloud, dem eigenen gehosteten Endpunkt des Anbieters, zum Preis von 6 Yuan pro Million Eingabe-Tokens, 18 Yuan pro Million Ausgabe-Tokens und 0,3 Yuan pro Million Tokens bei Cache-Treffern.

• Produktintegration — WorkBuddy, CodeBuddy (inländisch und international), Yuanbao und ima, was bedeutet, dass dieselben Gewichte, die Tencent in seinen eigenen Apps ausliefert, auch diejenigen sind, die man abrufen und ausführen kann.

Tencent berichtet zudem von einer Inferenz-Engineering-Kennzahl, die selten Eingang in eine Produktankündigung findet: eine Steigerung des End-to-End-Durchsatzes um 31,8 % durch Operator-Fusion und Kommunikationsoptimierung. Was sie mehr als eine Fußnote im Datenblatt macht, ist die Tatsache, dass Tencent angibt, Tencent HY4 Preview habe die Engpässe selbst gefunden — das Modell analysierte seinen eigenen Inferenz-Stack, und die Optimierungen sollen über verschiedene Kontextlängen und Parallelitätsstufen hinweg stabil sein. Das ist die Art von Detail, die ein Modell, das ein Labor als Forschungsartefakt veröffentlicht, von einem Modell unterscheidet, von dem ein Unternehmen erwartet, dass es Produktionsverkehr aushält. Bei einer Vorschau, die erst seit wenigen Tagen öffentlich ist, handelt es sich zugleich genau um die Art von Behauptung, die bislang noch niemand außerhalb von Tencent verifiziert hat.

Die zitierwürdigen Ergebnisse

Alle Benchmarks, die Tencent für Tencent HY4 Preview veröffentlicht hat, sind vom Anbieter selbst gemeldet – durchgeführt in Tencents eigener Evaluationsumgebung, von keinem unabhängigen Labor reproduziert – und das Modell ist erst seit wenigen Tagen öffentlich. Betrachten Sie sie als die Obergrenze, von der Tencent glaubt, sie erreicht zu haben, nicht als gesicherte Tatsache.

A single-model scoreboard titled 'Tencent HY4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (HF / GitHub / ModelScope / GitCode)', 'Price: 6 / 18 yuan per MTok (0.3 yuan cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 28, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Die wichtigste Kennzahl ist Terminal Bench 2.1, ein Test dafür, wie gut ein Modell ein echtes Terminal beim Programmieren bedient. Tencent meldet für Tencent HY4 Preview 85,4 Punkte, was laut Tencent Gleichstand mit Claude Opus 5 bedeutet und DeepSeek V4 Pro übertrifft, und das den eigenen Vorgänger Hy3 um 14,6 Punkte schlägt. Diese einzelne Zahl hat großes Gewicht – sie ist die Behauptung, die ein Open-Weight-Modell auf Augenhöhe mit den teuersten geschlossenen Frontier-Modellen bei einem anspruchsvollen Agentic-Coding-Test bringt – und sie ist die Behauptung, die am meisten einer unabhängigen Bestätigung bedarf.

Der Rest der internen Tabelle: DeepSWE, ein Software-Engineering-Benchmark, springt von 28,0 bei Hy3 auf 64,3, was Tencent als „allmähliche Verringerung des Abstands“ zu Top-Modellen beschreibt. Beim Toolathlon-Verified, einem Tool-Calling-Test, erzielt es 74,1, was laut Tencent Qwen 3.8 Max und GPT-5.6 Sol übertrifft und sich Kimi K3 und Claude Opus 5 nähert. Bei APEX-Agents pass@1 landet es bei 37,1, nur einen Hauch hinter Kimi K3 (37,2). Und in einem separaten internen Blindtest bewerteten 163 Experten 203 Engineering-Aufgaben mit 2,99 von 4,00 Punkten und lagen damit knapp vor GLM-5.3 (2,92) und Kimi K3 (2,94).

Zwei Muster stechen hervor. Erstens betrifft jede starke Kennzahl agentische Engineering-Arbeit — Terminalbedienung, Tool-Aufrufe, Aufgaben auf Repository-Ebene — und keine betrifft allgemeines Wissen oder Denken, was im Einklang mit der Produktivitätspositionierung steht und kein Zufall ist. Zweitens beschreibt Tencent DeepSWE und die anderen bewusst als Verringerung, nicht Schließung, von Lücken. Die eine klare, vermarktbare Paritätsaussage ist das Unentschieden bei Terminal Bench 2.1, und genau diese Aussage sollte man am ehesten mit dem eigenen Workload testen.

Was man für den Preis tatsächlich bekommt

Bei der Preisgestaltung hört die Veröffentlichung auf, interessant zu sein, und wird disruptiv. Zum Listenpreis von Tencent kostet eine Million Eingabe-Tokens ungefähr so viel wie ein einzelner API-Aufruf der mittleren Preisklasse auf manchen Plattformen. Der Preis von 18 Yuan pro Million Ausgabe-Tokens (etwa 2,50 US-Dollar) liegt weit unter den 25 US-Dollar pro Million, die ein führendes geschlossenes Frontier-Modell für die Ausgabe verlangt, und die Cache-Trefferrate von 0,3 Yuan macht lange agentische Loops – bei denen dasselbe System-Prompt und Gesprächspräfixe ständig erneut gesendet werden – ungewöhnlich günstig im Betrieb.

Dies ist auch die einzige Stelle, an der die Routing-Ebene die Rechnung ändert. OrcaRouter routet Tencent HY4 Preview noch nicht – Tencent hat dieses Modell nicht für Inferenzplattformen von Drittanbietern geöffnet, daher läuft es auf Tencent Clouds eigenem TokenHub-Endpunkt und auf selbst gehosteten Bereitstellungen der offenen Gewichte, und wir behaupten nicht, etwas bereitzustellen, was wir nicht bereitstellen. Aber das Prinzip, das eine Preissenkung relevant macht, ist dasselbe, auf dem der Rest des Katalogs basiert: OrcaRouter gibt die Listenpreise der Anbieter ohne Aufschlag weiter. Wenn also ein Anbieter wie Tencent einen Token mit 6 Yuan bepreist, ist der Betrag, den Sie auf unserer Seite zahlen, 6 Yuan – keine weiterverkaufte und mit Aufschlag versehene Version davon. Und an dem Tag, an dem ein Anbieter einen Preis ändert, ist die Änderung am selben Tag auf unserer Seite live. Eine API für über 200 Modelle, automatisches Failover zwischen Anbietern, wenn einer aussetzt, und eine Routing-DSL zum Kombinieren von Modellen – das ist der Mechanismus, der Tencent HY4 Preview in dem Moment tragen wird, in dem es routerbar wird, neben den anderen offenen und geschlossenen Modellen, die bereits im Katalog sind.

A screenshot of the OrcaRouter model catalog page (www.orcarouter.ai/models, captured August 28, 2026) showing a browsable grid of AI models with pricing and provider information. It illustrates the one-API, 200+ models catalog through which vendor list-price pass-through and failover operate.

Das, was nicht auf ein Datenblatt passt

Zwei Behauptungen im Startmaterial verdienen gesonderte Beachtung, weil sie sich darauf beziehen, wie das Modell gebaut wurde, nicht darauf, was es erzielt hat.

Das erste ist die Selbstverbesserungsschleife. Tencent sagt, dass Tencent HY4 Preview an seiner eigenen Forschung und Entwicklung beteiligt war – es wurde genutzt, um die Trainingsmethoden, die Datenstrategie, die Bewertungssysteme und die zugrunde liegenden Operatoren zu optimieren, die es hervorgebracht haben. Der Durchsatzgewinn von 31,8 % ist das konkreteste öffentliche Ergebnis dieser Schleife: Tencent führt ihn auf Engpässe zurück, die das Modell in seinem eigenen Serving-Stack identifiziert hat. Das ist ein anfänglicher rekursiver Selbstverbesserungszyklus: ein Modell, das bei der Entwicklung der nächsten Version seiner selbst hilft. Es ist nicht ungewöhnlich, dass ein führendes Labor Teile davon berichtet, aber ein chinesisches Open-Weight-Modell, das die Schleife öffentlich als ausgelieferte Fähigkeit beschreibt, ist eine grundlegende Veränderung in der Art, wie diese Veröffentlichungen über sich selbst sprechen.

Das zweite ist das Mathematik-Ergebnis. Tencent berichtet, dass das Modell die bekannte untere Volumenschranke des Blaschke-Lebesgue-Problems – einer seit Langem offenen Frage der konvexen Geometrie nach dem Körper konstanter Breite mit minimalem Volumen – von 0,380799 auf 0,41104 angehoben hat und damit nur noch etwa 2 % von der Schranke der Meissner-Tetraeder-Vermutung entfernt ist. Tencent meldet außerdem eine 2,0-fache Beschleunigung in der Rubrik wissenschaftliche Forschung: Eine Simulation einer Phospholipid-Doppelschicht mit 32.512 Atomen benötigt nun nur noch 54,9 Millisekunden pro Schritt. Das sind Ergebnisse, die einem Modell normalerweise ein eigenes Paper einbringen; hier sind sie lediglich Launch-Stichpunkte, und wie das übrige Launch-Material stammen sie aus Tencents eigener Darstellung.

Was fehlt, ehrlich gesagt?

Tencent nennt die bekannten Einschränkungen unverblümt, und sie sind wichtig für alle, die entscheiden, was sie auf diesem Modell aufbauen möchten. Es gibt keine Bild- oder Multimodal-Eingabe – Tencent HY4 Preview ist ein reines Textmodell, Punkt. Daher gehört alles, was mit Bildern oder Videos zu tun hat, auf ein anderes Modell. Tencent weist außerdem darauf hin, dass das Modell bei komplexen Aufgaben ein langsames Startverhalten zeigt – langes Nachdenken vor der ersten Ausgabe – und eine Neigung zur übermäßigen Selbstkontrolle, bei der Token verbrannt werden, um bereits erledigte Arbeit zu überprüfen. Diese Kombination ist für latenzsensitive Chats genau falsch und für Offline-Batch-Engineering-Arbeiten genau erträglich, was zeigt, wo Tencent erwartet, dass Sie es ausführen.

Und die wichtigste Abwesenheit ist die Verifikation. Es gibt noch keinerlei unabhängige Bewertungen für Tencent HY4 Preview — nicht auf einem öffentlichen Leaderboard, nicht von einem Drittanbieter-Evaluierungslabor, nicht einmal ein Artificial Analysis-Eintrag. Das Modell ist dafür noch zu neu. Der interne Blindtest mit Experten ist ein nützliches Signal dafür, wie Tencents eigene Prüfer es im Vergleich zu GLM-5.3 und Kimi K3 sehen, aber es sind Tencents Prüfer mit Tencents Aufgaben. Alles, was über das technische Datenblatt hinausgeht, ist eine Behauptung, die auf ihre Überprüfung wartet.

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent HY4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

Wer sollte heute die Gewichte ziehen?

Die ehrliche Antwort ist, dass dieses Release klar in zwei Zielgruppen zerfällt. Wenn Sie Engineering-Workloads auf Ihrer eigenen Infrastruktur betreiben und die Kostenmodelle geschlossener APIs der Grund sind, der Sie bisher zurückgehalten hat, dann ist Tencent HY4 Preview ein ernsthafter Wochenendtest wert: Die Gewichte sind offen, das Kontextfenster hat Repository-Größe, und der Listenpreis macht eine lange agentische Schleife erschwinglich, wie es ein Modell mit 25 Dollar pro Million Output-Token nie sein wird. Wenn Sie jedoch latenzsensitive Produktions-Chats betreiben, oder irgendetwas Multimodales, oder irgendetwas, bei dem Sie sich kein Modell leisten können, dessen einziger Beleg die eigenen Benchmarks des Anbieters sind, dann warten Sie – die zweimonatige Iterationskadenz, die Tencent seit Februar beibehält, deutet darauf hin, dass eine vollständige Hy4-Veröffentlichung nicht mehr fern ist, und die Preview ist ausdrücklich eine frühe Iteration mit bekannten Schwachstellen.

Der praktische Mittelweg ist ein Routing-Muster: Führen Sie das bewährte Modell auf Ihrem kritischen Pfad aus und das neue parallel daneben; tauschen Sie bei Aufgaben, bei denen das Kostenprofil von Tencent HY4 Preview die Nase vorn hat, auf dieses Modell um, und fallen Sie automatisch zurück, wenn das nicht der Fall ist. Genau für dieses Muster gibt es einen Router – derselbe OrcaRouter, der Claude Opus 5, DeepSeek V4 Pro und Gemini 3.1 Pro zu den Listenpreisen ihrer Anbieter führt, wird auch dieses Modell führen, sobald Tencent es freigibt. Bis dahin liegen die Gewichte auf GitHub, die API in der Tencent Cloud, und die Behauptung, ein Open-Weight-Modell habe die Spitzenklasse des agentischen Kodierens erreicht, hat endlich eine konkrete Zahl. Die Zahl stammt von Tencent. Der Test liegt bei Ihnen.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube