Hero-Titelkarte für Tencent Hy4 Preview. Ein zentrierter Titel lautet „Tencent Hy4 Preview — offene Gewichte, vLLM ab Tag null“. Eine Untertitelzeile lautet „770B MoE · 49B aktiv · 1M Kontext“. Vier Spezifikations-Chips lauten „Offene Gewichte (Apache 2.0)“, „vLLM + SGLang ab Tag null“, „8x GPU-Serving (FP8)“, „¥6 / ¥18 pro MTok“. Eine Fußzeile lautet „Veröffentlicht am 28. Aug. 2026 · Läuft in vLLM“. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Tencent Hy4 Preview läuft von Anfang an in vLLM: Das 770B-Open-Weight-MoE, das Sie tatsächlich bereitstellen können

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Als Tencent Hy4 Preview am 28. August 2026 auf den Markt kam, tat es etwas, das die meisten Flaggschiffe der Spitzenklasse am ersten Tag auslassen: Es war sofort lauffähig. Neben den offenen Gewichten veröffentlichten Tencent und das vLLM-Team ein vorgefertigtes Docker-Image, ein offizielles Serving-Rezept und integrierten Framework-Unterstützung direkt in vLLM, sodass das größte Open-Weight-Modell, das die Hunyuan-Linie hervorgebracht hat – 770 Milliarden Gesamtparameter, 49 Milliarden aktive pro Token – innerhalb weniger Stunden nach der Ankündigung hinter einem OpenAI-kompatiblen Endpunkt auf den eigenen GPUs lief. Diese Day-Zero-Runtime-Geschichte ist die Neuigkeit, um die es in diesem Beitrag geht, denn „läuft in vLLM“ ist für ein Modell dieser Größe keine Fußnote. Es ist der Unterschied zwischen einer Pressemitteilung und etwas, das man in Produktion bringen kann.

Der Rest des Launches ist das übliche Paket in Preview-Form, und die Einschränkungen sind genauso wichtig wie die Zahlen. Tencent bezeichnet Tencent Hy4 Preview als frühe Iteration, führt übermäßig langes Reasoning und übermäßige Selbstverifikation als bekanntes Verhalten an und veröffentlicht eine Benchmark-Tabelle, die ausschließlich auf eigenen Angaben basiert — kein unabhängiges Labor hat das Modell bisher bewertet, und es ist zum Zeitpunkt dieses Artikels zwei Tage alt. All das ändert nichts an der praktischen Schlagzeile: Die Gewichte sind Apache 2.0, das Kontextfenster umfasst 1 Million Token, und die vLLM-Unterstützung ab Tag eins bedeutet, dass der Weg zum Selbsthosting real und nicht nur eine Vision ist.

Was Tencent Hy4 Preview eigentlich ist

Tencent positioniert Tencent Hy4 Preview als Nachfolger von Hy3 (295B gesamt, 256K Kontext), was die aktive Kapazität ungefähr verdoppelt und das Kontextfenster vervierfacht. Die Architektur ist es wert, Zeile für Zeile gelesen zu werden, denn jede Zeile ändert, was ein Open-Weight-Modell auf Ihrer Hardware tun darf.

• Architektur — Mixture-of-Experts mit insgesamt 770B Parametern und 49B aktiven pro Token über 78 Ebenen. Die erste Schicht ist dicht; die anderen 77 leiten jedes Token durch 256 geroutete Experten plus einen gemeinsamen Experten und aktivieren die Top 8. Dieses grobe Sparsity-Verhältnis von 16:1 hält die Inferenzkosten in einem Bereich, den ein ernsthaftes Team tatsächlich betreiben kann.

• Kontextfenster — 1.048.576 Token nativ, eines der breitesten aller Open-Weight-Modelle. Ein vollständiges Repository, ein Multi-Datei-Refactoring, ein langer Dokumentenstapel: Einzelanfrage-Probleme.

• Attention — Gated Deep​Seek Sparse Attention (Gated DSA) mit IndexCache, ein Sparse-Attention-Design, das einen frischen Sparse-Index nur auf 21 der 78 Schichten berechnet und ihn auf den anderen 57 wiederverwendet. Deshalb ist das Serving nicht einfach nur „größeres vLLM“ — es braucht ein Backend, das Sparse Attention versteht.

{{1}}• Integrierte spekulative Dekodierung — eine MTP-Schicht (Multi-Token-Prädiktion) mit insgesamt etwa 10B / 0,7B aktiven Parametern sitzt im Modell, sodass vLLM und SGLang Token vorschlagen können, ohne dass Sie ein separates Draft-Modell hosten müssen.{{/1}}

• Gewichte — Apache 2.0, sowohl in BF16- als auch in FP8-Checkpoints, veröffentlicht auf Hugging Face, ModelScope, GitCode und CNB.

Was „day-zero vLLM“ tatsächlich bedeutet

Zusammengeführter Framework-Support am Veröffentlichungstag ist das konkrete Ereignis hinter dem Signal — die vLLM-Änderung, die Tencent Hy4 Preview ergänzt (PR #54160), ging im selben Zeitfenster wie das Release ein, und das offizielle Rezept zielt auf vLLM 0.29.0 oder neuer ab. In der Praxis bedeutet das, dass der Serving-Pfad ein einziger Befehl ist, keine Woche Kernel-Debugging.

docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview

Die Flags sind wichtig, und jede einzelne bildet etwas im Modell ab, anstatt bloß Standardtext zu sein:

• --attention-backend FLASHMLA_SPARSE — erforderlich, nicht optional. Die Gated-DSA-Sparse-Attention von Tencent Hy4 Preview läuft auf den standardmäßigen dichten Backends nicht korrekt, und dieses Flag wird im offiziellen Rezept gesetzt.

• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — aktiviert die integrierte MTP-Schicht des Modells für spekulative Dekodierung, drei Draft-Tokens im Voraus. Kein separates Draft-Modell erforderlich.

• --tool-call-parser hy_v4 und --reasoning-parser hy_v4 — die benutzerdefinierten Parser, die dem Server mitteilen, wie Tencent Hy4 Preview Tool-Aufrufe und seine Chain-of-Thought ausgibt, wobei --enable-auto-tool-choice dem Modell die Entscheidung überlässt, wann es Tools aufruft.

Tencent empfiehlt eine Temperatur von 0,9 und top_p 1,0 für das Sampling. Das Reasoning verwendet standardmäßig eine Chain-of-Thought mit hohem Aufwand, die auf Mathematik, Programmierung und komplexe Aufgaben ausgerichtet ist; wenn Sie eine direkte Antwort ohne langes Nachdenken wünschen, übergeben Sie im Request eine no_think-Reasoning-Effort, anstatt die Gewichte auszutauschen.

A screenshot of the official vLLM recipe page for tencent/Hy4-preview (recipes.vllm.ai/tencent/Hy4-preview, captured August 30, 2026). It shows the model spec chips '770B | 49B | 1,048,576 ctx | vLLM 0.29.0+', a note describing the built-in 10B MTP layer for speculative decoding and the hy_v4 tool/reasoning parsers, and the prebuilt docker run command with --tensor-parallel-size 8, --attention-backend FLASHMLA_SPARSE, and the hy_v4 parsers.

Der Day-zero-Support ist nicht nur auf vLLM beschränkt, was für ein derart neues Release bemerkenswert ist. SGLang veröffentlichte am selben Tag ein vorgefertigtes Multi-Architektur-Image (lmsysorg/sglang:hy4-preview) mit NEXTN-artigem spekulativem Decoding, und das Ascend-Ökosystem erhielt 0-Day-Support über vLLM-Ascend mit W8A8-quantisierten Gewichten auf 16 Atlas 800I A3 NPUs. Open-Weight-Releases brauchen oft Wochen, bis das Serving-Ökosystem nachzieht; dieses Mal dauerte es nur Stunden.

Die zitierwürdigen Ergebnisse

Jeder Benchmark, den Tencent für Tencent Hy4 Preview veröffentlicht hat, ist vom Anbieter selbst gemeldet – durchgeführt in Tencents eigener Evaluierungsumgebung, von keinem unabhängigen Labor reproduziert, und das Modell ist seit zwei Tagen öffentlich. Betrachten Sie sie als die Obergrenze, von der Tencent glaubt, sie erreicht zu haben, nicht als gesicherte Tatsache. Eine unabhängige Verifizierung wird es erst geben, wenn ein Dritter die Tests durchführt; nichts auf den öffentlichen Leaderboards spiegelt dieses Modell bisher wider.

A single-model scoreboard titled 'Tencent Hy4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (Apache 2.0)', 'Price: ¥6 / ¥18 per MTok (¥0.3 cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 30, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Die Schlagzeilen-Kennzahl ist Terminal Bench 2.1, ein Test dafür, wie gut ein Modell ein echtes Terminal beim Programmieren bedient. Tencent meldet für Tencent Hy4 Preview 85,4 Punkte und behauptet damit, mit Claude Opus 5 gleichzuziehen und DeepSeek V4 Pro zu übertreffen – sowie den eigenen Vorgänger Hy3 um 14,6 Punkte zu schlagen. Diese eine Zahl trägt die Veröffentlichung – sie ist die Behauptung, die ein Open-Weight-Modell auf Augenhöhe mit den teuersten geschlossenen Frontier-Modellen bei einem anspruchsvollen agentischen Codiertest stellt – und sie ist die Behauptung, die am dringendsten einer unabhängigen Bestätigung bedarf.

Der Rest der internen Tabelle, alles Tencents eigene Zahlen: DeepSWE, ein Software-Engineering-Benchmark, springt von 28,0 auf Hy3 auf 64,3. SWE-bench Pro erreicht 65,7 und SWE-bench Multilingual 82,9. Beim Toolathlon-Verified, einem Test zur Werkzeugnutzung, meldet Tencent 74,1, womit es laut Tencent Qwen 3.8 Max und GPT-5.6 Sol übertrifft und an Kimi K3 und Claude Opus 5 herankommt. Bei APEX-Agents pass@1 landet es bei 37,1, ein Haar hinter Kimi K3s 37,2. Und in einer separaten internen Blindbewertung bewerteten 163 von Tencent rekrutierte Experten 203 Engineering-Aufgaben mit 2,99 von 4,00 Punkten und übertrafen damit knapp GLM-5.3s 2,92 und Kimi K3s 2,94.

Zwei Muster sind beachtenswert. Jede starke Kennzahl betrifft agentische Engineering-Arbeit — Terminalsteuerung, Tool-Aufrufe, Aufgaben im Repository-Maßstab — und keine betrifft allgemeines Wissen oder Reasoning, was zur Produktivitätspositionierung passt und kein Zufall ist. Und Tencent beschreibt DeepSWE und die anderen als Verringerung, nicht Schließung von Lücken; die eine klare, vermarktbare Paritätsaussage ist das Unentschieden bei Terminal Bench 2.1, und genau diese Aussage sollte man am ehesten mit der eigenen Arbeitslast testen.

Was es tatsächlich kostet, es zu betreiben

Die Mathematik des Selbsthostings ist das Erste, worüber man ehrlich sein muss. Dies ist kein Einzel-GPU-Modell und auch kein Desktop-Modell. Der FP8-Checkpoint umfasst nahezu ein Terabyte an Gewichten, und das offizielle Rezept setzt Tensor-Parallelismus der Stufe 8 voraus — acht GPUs mit hoher Bandbreite und schnellen Interconnects (Tencents Referenzhardware für FP8 ist 8×B300, während volles BF16 16×B200 erfordert). Wenn Sie diese Größenordnung nicht haben, werden Sie es nicht günstig selbst hosten können, und das Sparse-Attention-Backend bedeutet, dass es am Speicher für den KV-Cache bei einem 1M-Token-Kontext keine Abkürzung gibt.

Ein Startwochen-Zusatz ändert einen Teil dieser Rechnung für Teams, die die offenen Gewichte ohne den Flaggschiff-Fußabdruck wollen. Das Hy-Team von Tencent hat einen komprimierten GGUF-Build von Tencent Hy4 Preview veröffentlicht und die ~1,5 TB große BF16-Fassung auf etwa 200 GiB reduziert, mit einem pro Schicht gemischten Quantisierungsschema namens MIX-STQ1_0 – Bulk-Expert-Tensoren fallen auf etwa 1,3 Bit, während residualstromkritische Schichten eine höhere Präzision beibehalten. In den eigenen Auswertungen von Tencent ist die Genauigkeitsverschiebung gering – SWE-bench Multilingual von 82,9 auf 81,3, MCP Atlas von 83,7 auf 83,2, IFBench von 73,5 auf 72,5 – ein Kompromiss, den der Anbieter als nahezu verlustfrei bezeichnet. Das sind Tencents Zahlen auf Tencents Setup, bislang nicht unabhängig reproduziert. Ein 200-GiB-Modell ist immer noch kein Single-GPU-Modell, aber es ist eine deutlich kleinere Wette als ein nahezu Terabyte großer FP8-Checkpoint, und es bringt den Open-Weights-Weg in die Reichweite eines kleineren Multi-GPU-Knotens, als es das Acht-B300-Rezept vorsieht.

Der API-Pfad ist der Punkt, an dem der Preis interessant wird. Auf dem TokenHub von Tencent Cloud listet Tencent Hy4 Preview: 6 Yuan (ca. 0,83 US$) pro Million Eingabe-Tokens, 18 Yuan (ca. 2,50 US$) pro Million Ausgabe-Tokens und 0,3 Yuan (ca. 0,04 US$) pro Million Tokens bei Cache-Treffern. Der Ausgabepreis von etwa 2,50 US$ pro Million liegt weit unter den 25 US$ pro Million, die ein führendes geschlossenes Frontier-Modell für die Ausgabe verlangt, und die günstige Cache-Trefferrate macht lange agentische Schleifen – bei denen dasselbe System-Prompt und Konversations-Präfixe ständig erneut gesendet werden – ungewöhnlich erschwinglich.

Tencent bietet außerdem für zwei Wochen kostenlosen Zugang zu Tencent Hy4 Preview in WorkBuddy und CodeBuddy an, solange das Modell neu ist – der günstigste Weg, es diese Woche auszuprobieren, ist also kostenlos, und WorkBuddy ist der Ort, an dem die Produktivitätspositionierung konkret wird. In jeder WorkBuddy-Konversation wechselt der Modellauswähler zwischen Hy3 und Hy4 Preview, sodass die Aufteilung zwischen Büroproduktivität und Analysearbeit auf der einen Seite und Codierung auf der anderen eine Wahl pro Aufgabe ist und keine Bereitstellungsentscheidung. Diese Aufteilung entspricht dem Ziel, das Tencent mit dem Modell verfolgt, und praktische Tests in WorkBuddy zeigen, dass es komplexe Artefakte auf einen Schlag erzeugt – einen spielbaren Low-Poly-Spielprototyp aus einem einzigen Prompt, einen vollständigen Quartalsbericht, der aus zehn Anhängen ohne manuelle Eingriffe zusammengestellt wurde, und, in der diese Woche kursierenden Tester-Demo, eine Simulation eines Schwarzen Lochs. Dabei handelt es sich um Beobachtungen aus der Community zur eigenen App von Tencent und nicht um Hersteller-Benchmarks – aber sie sind die ersten praktischen Signale dafür, was das Modell bei realen mehrstufigen Aufgaben leistet, und sie sind kostenlos reproduzierbar, bevor man etwas ausgibt.

Die Kostenentscheidung ist genau der Punkt, an dem eine Routing-Ebene die Rechnung verändert, und wir werden ehrlich zu unserem eigenen Anteil daran sein: OrcaRouter routet Tencent Hy4 Preview noch nicht, weil Tencent dieses Modell nicht für Inferenzplattformen von Drittanbietern geöffnet hat — es läuft auf Tencents eigenem TokenHub-Endpunkt und in selbst gehosteten Bereitstellungen der offenen Gewichte, und wir behaupten nicht, etwas anzubieten, das wir nicht anbieten. Was die Routing-Ebene einbringt, ist der Entscheidungsrahmen darum herum. Wenn Sie sich zwischen einem 8-GPU-Knoten und einer API entscheiden, gilt an dem Tag, an dem Tencent dies öffnet, dieselbe Durchreich-Disziplin, auf der der Rest des Katalogs läuft: OrcaRouter reicht die Listenpreise der Anbieter ohne Aufschlag durch, sodass eine Preissenkung des Anbieters noch am selben Tag bei uns live ist, anstatt weiterverkauft und mit Aufschlag versehen zu werden. Und bei einem zwei Tage alten Modell, dessen einziger Beleg die Benchmarks des Anbieters sind, ist automatisches Failover der sichere Weg, es zu testen — setzen Sie das bewährte Modell auf Ihren kritischen Pfad und Tencent Hy4 Preview daneben, wechseln Sie bei Aufgaben, bei denen sein Kostenprofil gewinnt, darauf und fallen Sie in dem Moment, in dem es das nicht tut, zurück — alles über eine API und einen Schlüssel.

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent Hy4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

Die Grenzen, die nicht auf ein Datenblatt passen

Tencent listet die bekannten Einschränkungen deutlich auf, und sie sollten jede Entscheidung über den Einsatz prägen. Tencent Hy4 Preview ist ein reines Textmodell, Punkt. Keine Bild- oder Multimodaleingabe – alles, was mit Bildern oder Videos zu tun hat, gehört auf ein anderes Modell. Tencent weist außerdem auf ein langsames Anlaufverhalten bei komplexen Aufgaben hin (langes Nachdenken vor der ersten Ausgabe) sowie auf eine Tendenz zur übermäßigen Selbstverifikation, die Token verbrennt, um bereits geleistete Arbeit nochmals zu prüfen. Diese Kombination ist für latenzsensitive Chats genau falsch und für Offline-Batch-Engineering-Arbeiten gerade noch akzeptabel – das zeigt, wo Tencent den Einsatz vorsieht.

Zwei Behauptungen im Launch-Material verdienen gesonderte Aufmerksamkeit, weil sie sich darauf beziehen, wie das Modell gebaut wurde, nicht darauf, was es erzielte. Tencent sagt, Tencent Hy4 Preview habe an seiner eigenen Entwicklung teilgenommen – es half, die Trainingsmethoden, Datenstrategie, Bewertungsrahmen und Low-Level-Operatoren zu optimieren, die es hervorbrachten, eine frühe rekursive Selbstverbesserungsschleife – und dass es sein eigenes Inferenzsystem autonom optimierte, um einen End-to-End-Durchsatzgewinn von 31,8 % gegenüber der Baseline zu erzielen. Auf wissenschaftlicher Seite berichtet Tencent, dass es die bekannte Untergrenze des Blaschke-Lebesgue-Problems in der konvexen Geometrie von 0,380799 auf 0,41104 verbessert hat, sowie eine 2,0-fache Beschleunigung bei einer Simulation einer Phospholipid-Doppelschicht mit 32.512 Atomen auf 54,9 Millisekunden pro Schritt. Wie alles andere am ersten Tag sind dies Tencents eigene Angaben.

Und das Wichtigste, was fehlt, ist die Verifikation. Es gibt noch keine unabhängigen Bewertungen für Tencent Hy4 Preview — weder auf einem öffentlichen Leaderboard, noch von einem externen Evaluierungslabor, noch einen Artificial-Analysis-Eintrag. Dafür ist das Modell zu neu. Der interne Experten-Blindtest ist ein nützliches Signal dafür, wie Tencents eigene Prüfer es im Vergleich zu GLM-5.3 und Kimi K3 sehen, aber es sind Tencents Prüfer bei Tencents Aufgaben. Alles, was über das Datenblatt hinausgeht, ist eine Behauptung, die auf ihre Überprüfung wartet.

Wer sollte diese Woche die Tencent Hy4 Preview durchführen?

Die ehrliche Antwort teilt sich diese Woche in drei Gruppen auf, und eine davon benötigt überhaupt keine Hardware. Wenn Sie nur einen Eindruck davon bekommen möchten, was Tencent Hy4 Preview leistet, ist der kostenlose WorkBuddy-Zugang der schnellste Weg — keine GPU, kein API-Schlüssel, öffnen Sie ein Gespräch, stellen Sie den Modellwähler auf Hy4 preview um und geben Sie ihm eine Work- oder Coding-Aufgabe. Wenn Sie GPUs besitzen und Engineering-Workloads im Batch ausführen — langfristige agentische Aufgaben, Analysen auf Repository-Ebene, Offline-Auswertung — ist das Modell jetzt einen ernsthaften Test wert: Die Gewichte sind offen, das Kontextfenster ist auf Repository-Ebene ausgelegt, der vLLM-Pfad ist ein einziger Befehl, und der GGUF-Build der Startwoche senkt die Hardware-Hürde für einen Testlauf. Wenn Sie latenzempfindlichen Produktions-Chat betreiben, etwas Multimodales, oder etwas, bei dem Sie sich kein Modell leisten können, dessen einziger Beleg die eigenen Benchmarks des Anbieters sind, warten Sie — Tencent hat seit Februar etwa alle zwei Monate neue Versionen veröffentlicht und bereits angekündigt, dass die nächste Charge von Hy4-Modellen kommt. Die Vorschau ist also ausdrücklich eine frühe Iteration.

Für alle anderen ist die richtige Haltung ein Routing-Muster: Erproben Sie es neben einem Modell, dem Sie bereits vertrauen, zu Kosten, die Sie verschmerzen können, und skalieren Sie es nur dort, wo seine Zahlen unter Ihrer eigenen Arbeitslast Bestand haben. Genau dafür gibt es einen Router — sobald Tencent dieses Modell für Drittanbieter-Inferenz öffnet, wird es wie jedes andere in den Katalog aufgenommen, der eine API, über 200 Modelle und die Durchleitung zum Listenpreis umfasst, und die Failover- und Kompositions-Tools sind bereits vorhanden. Bis dahin liegen die Gewichte auf Hugging Face, die API läuft auf Tencent Cloud und die kostenlose Testversion ist in WorkBuddy — und die Behauptung, ein Open-Weight-Modell habe die Spitzenklasse des agentischen Codierens erreicht, hat endlich eine konkrete Zahl. Die Zahl stammt von Tencent. Der Test liegt bei Ihnen.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube