
Tencent Hy4 Preview ist verfügbar: Ein 770B-MoE mit einem Million-Token-Kontext bei ¥6 pro Million Input-Tokens.
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Tencent Hy4 Preview, veröffentlicht und als Open Source verfügbar gemacht am 28. August 2026, ist das dritte Tencent-Flaggschiffmodell innerhalb von sechs Monaten – und es ist dasjenige, das aufhört, ein Forschungsmeilenstein zu sein, und beginnt, ein Preis-Event zu sein. Es ist ein Mixture-of-Experts-Modell mit 770 Milliarden Parametern – 49 Milliarden aktive Parameter pro Token – und einem nativen Kontextfenster von einer Million Token, veröffentlicht unter der Apache-Lizenz 2.0 sowohl in BF16 als auch FP8, ab heute herunterladbar von Hugging Face, GitHub, ModelScope und GitCode. Und Tencent bepreist es mit 6 Yuan pro Million Input-Token und 18 Yuan pro Million Output-Token – etwa 0,83 US-Dollar und 2,50 US-Dollar –, was ein erstklassiges Open-Weight-Modell unter fast jedes geschlossene Frontier-Modell auf dem Markt stellt. Eine Veröffentlichung, drei Gesichter: Open Weights, die man selbst ausführen kann, eine API auf Tencent Clouds TokenHub und dieselben Gewichte bereits live in Tencents eigenen Produkten: WorkBuddy, CodeBuddy, Yuanbao und ima. Hier ist, was tatsächlich ausgeliefert wurde, was Tencent als Ergebnisse beansprucht und was noch niemand verifiziert hat.
Der technische Aufbau ist wichtiger als die Parameteranzahl, denn jedes Bauteil ist ein Kostenhebel. Das Modell ist 78 Ebenen tief: Die erste Ebene ist ein standardmäßiges dichtes Feed-Forward-Netzwerk, und die restlichen 77 sind MoE-Ebenen mit je 256 weitergeleiteten Experten plus einem gemeinsamen Experten, wobei pro Token die Top-8 weitergeleiteten Experten aktiviert werden. Dieses ungefähre Sparsity-Verhältnis von 16:1 macht ein 770B-Modell kostengünstig zu betreiben – nur ein 49B-Ausschnitt arbeitet bei einem bestimmten Token. Eine spezielle Multi-Token-Vorhersageschicht (10B Parameter, 0,7B aktiv) ermöglicht spekulatives Dekodieren, und der Aufmerksamkeitsstack verwendet gated DeepSeek Sparse Attention mit einem IndexCache, um den Speicherverbrauch für lange Kontexte im Zaum zu halten. Das Reasoning kann zwischen einem langdenkenden code>high/code> Modus und einem tokensparenden code>no_think/code> Modus umgeschaltet werden. Diese Details bestimmen, ob der Listenpreis den Kontakt mit einer realen Arbeitslast überlebt, nicht ob das Modell ein Haiku schreiben kann.
Das Spezifikationsblatt, kommentiert
Lies die Versionshinweise Zeile für Zeile, denn jede Zeile ändert leise, was einem Open-Weight-Modell erlaubt ist.
• Parameter — 770B insgesamt, 49B aktiv pro Token, ein ~16:1-Sparsity-Verhältnis, das die Serving-Kosten in einem Bereich hält, den sich ein kleines Team tatsächlich leisten kann.
• Kontext — ein natives Fenster mit 1.048.576 Token, viermal so groß wie Hy3s 256K. Ein vollständiges Repository, ein Refactoring über mehrere Dateien, ein Finanzpaket mit 72 Dokumenten — Probleme, die mit einer einzigen Anfrage gelöst werden können.
• Lizenz — Apache License 2.0 sowohl für das BF16-Original als auch für die FP8-quantisierte Version, was Selbst-Hosting, Fine-Tuning und kommerzielle Nutzung ohne proprietäre Klausel bedeutet.
• Inferenz-Stack — Tencent führt vLLM und SGLang als die unterstützten Serving-Frameworks auf, die beiden, auf die sich das Open-Weight-Ökosystem tatsächlich standardisiert.
• API — TokenHub-Endpunkt von Tencent Cloud: ¥6 pro Million Eingabe-Token, ¥18 pro Million Ausgabe-Token, ¥0,3 pro Million bei Cache-Treffern.
• Produktintegration — Dieselben Gewichte, die Tencent in WorkBuddy, CodeBuddy (inländisch und international), Yuanbao und ima ausliefert, sind die, die Sie abrufen und ausführen können. CodeBuddy erhält beim Start eine zweiwöchige kostenlose Testversion des Modells.
Tencent berichtet zudem über eine Kennzahl aus dem Inference-Engineering, die selten in einer Launch-Notiz auftaucht: eine 31,8-prozentige Verbesserung des End-to-End-Durchsatzes durch Operator-Fusion und Kommunikationsoptimierung. Das ist die Art von Detail, die ein Modell, das ein Labor als Forschungsartefakt veröffentlicht, von einem Modell unterscheidet, von dem ein Unternehmen erwartet, dass es Produktionsverkehr bewältigt. Am ersten Tag ist es außerdem genau die Art von Behauptung, die noch niemand außerhalb von Tencent gemessen hat.
Die zitierwürdigen Ergebnisse
Jeder Benchmark, den Tencent für Tencent Hy4 Preview veröffentlicht hat, stammt vom Anbieter selbst – ausgeführt in Tencents eigener Evaluierungsumgebung, von keinem unabhängigen Labor reproduziert, und das Modell ist erst seit weniger als einem Tag öffentlich. Betrachten Sie sie als die Obergrenze, von der Tencent glaubt, sie erreicht zu haben.

Die wichtigste Kennzahl ist Terminal Bench 2.1, ein Test dafür, wie gut ein Modell beim Programmieren ein echtes Terminal steuert. Tencent meldet 85,4. Damit holt das Unternehmen eigenen Angaben zufolge Claude Opus 5 ein, übertrifft DeepSeek V4 Pro und schlägt seinen eigenen Vorgänger Hy3 um 14,6 Punkte. An dieser einen Zahl hängt viel – sie ist die Behauptung, die ein Open-Weight-Modell bei einem anspruchsvollen agentischen Codiertest auf Augenhöhe mit den teuersten geschlossenen Frontier-Modellen bringt – und sie ist die Behauptung, die am meisten einer unabhängigen Bestätigung bedarf. Der Rest der internen Tabelle: DeepSWE springt von 28,0 (Hy3) auf 64,3, was Tencent als „allmähliche Verringerung der Lücke“ zu den Top-Modellen beschreibt; Toolathlon-Verified, ein Tool-Calling-Test, landet bei 74,1; APEX-Agents pass@1 bei 37,1, ein Haar hinter den 37,2 Punkten von Kimi K3; SWE-bench Pro bei 65,7 und SWE-bench Multilingual bei 82,9. In einem separaten internen Blindtest bewerteten 163 Experten 203 Engineering-Aufgaben mit 2,99 von 4,00 Punkten und lagen damit knapp vor GLM-5.3 (2,92) und Kimi K3 (2,94).
Zwei Muster fallen auf. Erstens beziehen sich alle starken Zahlen auf agentische Engineering-Arbeit – Terminalsteuerung, Tool-Aufrufe, Aufgaben auf Repository-Ebene – und keine auf allgemeinen Chat oder Wissen, was mit Tencents Positionierung des Modells als „für Produktivität gebaut“ in den Bereichen Softwareentwicklung, Büro- und Datenanalyse, Spieleentwicklung und wissenschaftlicher Forschung übereinstimmt. Zweitens legt Tencent Wert darauf, DeepSWE und die übrigen Modelle als Verkleinerung, nicht Schließung, von Lücken zu beschreiben. Die eine klare, vermarktbare Paritätsaussage ist der Gleichstand bei Terminal Bench 2.1, und genau diese Aussage ist es wert, mit der eigenen Arbeitslast getestet zu werden.
Was ¥6 pro Million wirklich kauft
Die Preisgestaltung ist der Punkt, an dem das Release aufhört, interessant zu sein, und anfängt, disruptiv zu wirken. Bei 18 Yuan pro Million Ausgabetokens – etwa 2,50 US-Dollar – kostet eine lange agentische Codierungssitzung, die eine Million Ausgabetokens verbraucht, ungefähr ein Zehntel dessen, was dieselbe Sitzung bei einem der führenden geschlossenen Frontier-Modelle kosten würde. Die Cache-Trefferrate von 0,3 Yuan macht die erneut gesendeten System-Prompts und Konversationspräfixe einer agentischen Schleife zudem erheblich günstiger als das Caching der meisten Wettbewerber. Tencents eigene Demo zeigt, wie das Modell 72 Finanzdokumente in einem einzigen Durchgang verarbeitet; bei diesen Preisen ist eine solche Charge ein erschwinglicher täglicher Arbeitsgang und keine Budgetposition.
Auch hier verändert die Routing-Ebene die Rechnung, und es lohnt sich, präzise zu sein. OrcaRouter routet Tencent Hy4 Preview noch nicht — Tencent hat dieses Modell für Drittanbieter-Inferenzplattformen noch nicht geöffnet, also läuft es auf dem TokenHub-Endpunkt von Tencent Cloud und auf selbst gehosteten Bereitstellungen der offenen Gewichte, und wir behaupten nicht, etwas zu bedienen, was wir nicht bedienen. Aber die Disziplin, die eine Preissenkung bedeutsam macht, ist dieselbe, auf der der gesamte Katalog beruht: OrcaRouter reicht die Listenpreise der Anbieter ohne Aufschlag weiter. Wenn ein Anbieter also ein Token mit 6 Yuan bepreist, ist der Betrag, den Sie bei uns zahlen, 6 Yuan — keine weiterverkaufte und mit einem Aufschlag versehene Version davon. Ändert ein Anbieter einen Preis, ist die Änderung bei uns am selben Tag live. Eine API für über 200 Modelle, automatisches Failover zwischen den Anbietern, wenn einer einen Aussetzer hat, und eine Routing-DSL, um Modelle zu einem einzigen Aufruf zu kombinieren: Das ist der Mechanismus, der Tencent Hy4 Preview in dem Moment tragen wird, in dem Tencent es freigibt, und es ist der Mechanismus, mit dem Sie bereits jetzt ein neues, unerprobtes Modell neben einem bewährten ausführen können, ohne Ihren Produktionspfad auf eines von beiden zu setzen.

Die Behauptungen, die eine zweite Lektüre verdienen.
Zwei Dinge im Launch-Material befassen sich damit, wie das Modell gebaut wurde, nicht damit, was es erzielte, und sie verdienen gesonderte Aufmerksamkeit.
Das erste ist die Selbstverbesserungsschleife. Tencent sagt, dass Tencent Hy4 Preview an seiner eigenen Forschung und Entwicklung beteiligt war – es wurde verwendet, um die Trainingsmethoden, Datenstrategie, Bewertungssysteme und Low-Level-Operatoren zu optimieren, die es hervorgebracht haben. Das ist ein erster rekursiver Selbstverbesserungszyklus: ein Modell, das dabei hilft, die nächste Version seiner selbst zu entwerfen, und Tencent veröffentlicht dies als ausgelieferte Fähigkeit. Das ist eine große Behauptung, und sie beruht vollständig auf eigenen Angaben.
Das zweite ist ein mathematisches Ergebnis. Tencent berichtet, dass das Modell die bekannte untere Schranke des Blaschke–Lebesgue-Problems – einer seit Langem offenen Frage in der konvexen Geometrie nach dem Körper konstanter Breite mit minimalem Volumen – von 0,380799 auf 0,41104 verbessert hat und damit auf etwa 2 % an die Meissner-Tetraeder-Vermutung herankommt. Tencent berichtet außerdem von einer 2,0-fachen Beschleunigung bei einer Simulation einer Phospholipid-Doppelschicht mit 32.512 Atomen, die auf 54,9 Millisekunden pro Schritt gesenkt wurde. Ergebnisse wie diese bringen einem Modell normalerweise ein eigenes Paper ein; hier sind sie Aufzählungspunkte zum Start, und wie alles andere am ersten Tag sind sie Tencents eigene Angaben.
Die ehrlichen Lücken
Tencent listet die bekannten Einschränkungen unumwunden auf. Es gibt keine Bild- oder Multimodaleingabe – Tencent Hy4 Preview ist ein reines Textmodell, Punkt. Alles, was mit Bildern oder Videos zu tun hat, gehört in ein anderes Modell. Tencent weist außerdem auf ein langsames Anlaufverhalten bei komplexen Aufgaben hin – langes Nachdenken vor der ersten Ausgabe – sowie auf eine Tendenz zur übermäßigen Selbstverifikation, die Token verbrennt, um bereits erledigte Arbeit erneut zu prüfen. Diese Kombination ist für latenzempfindliche Chats genau das Falsche und für Offline-Batch-Engineering-Arbeiten gerade noch tolerierbar – was dir verrät, wo Tencent den Einsatz erwartet.
Und das Wichtigste, was fehlt, ist die Verifizierung. Es gibt noch nirgendwo unabhängige Bewertungen für Tencent Hy4 Preview — weder auf einer öffentlichen Bestenliste noch von einem externen Evaluierungslabor. Das Modell ist zu neu. Der interne Experten-Blindtest ist ein nützliches Signal dafür, wie Tencents eigene Prüfer es im Vergleich zu GLM-5.3 und Kimi K3 sehen, aber es sind Tencents Prüfer, die Tencents Aufgaben bewerten. Alles, was über das Datenblatt hinausgeht, ist eine Behauptung, die auf eine Prüfung wartet.

Wie man es heute tatsächlich ausprobieren kann
Der praktische Weg ist kurz. Laden Sie die Gewichte von Hugging Face, GitHub, ModelScope oder GitCode herunter und stellen Sie sie mit vLLM oder SGLang bereit; rufen Sie die TokenHub-API von Tencent Cloud auf, wenn Sie einen gehosteten Endpunkt zum Listenpreis wünschen; oder nutzen Sie es in CodeBuddy oder WorkBuddy, wo Tencent eine zweiwöchige kostenlose Testphase anbietet. Der kostenlose Zugriff auf das Hy3-Modell läuft bis zum 30. September, und Tencents eigene Kadenz – etwa eine große Iteration alle zwei Monate – deutet darauf hin, dass eine vollständige Hy4-Veröffentlichung der Vorschau nicht weit folgen wird.
Die ehrliche Zusammenfassung: Ein Open-Weight-Modell mit 770B Parametern und Millionen-Kontext für ¥6 pro Million Input-Tokens ist real und existiert seit heute, und der stärkste daran geknüpfte Benchmark ist die Behauptung eines Anbieters über ein Unentschieden mit einem geschlossenen Frontier-Modell, das bislang niemand reproduziert hat. Zieh es dir, führe den Test durch, der dir wirklich wichtig ist, und lass die Beweise entscheiden, ob der Preis die Story bleibt.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
