
Tencent HY4 Vorschau vs tencent-hy3: Sechsmal so teuer – und was der Sprung tatsächlich bringt
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0259Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0258Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0166Intelligenz82Coding
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
Tencent HY4 Preview ist das erste Modell der Hunyuan-Familie, das seinen eigenen Vorgänger absichtlich billig aussehen lässt: Tencent listet es zum sechsfachen Eingabepreis von tencent-hy3 und zum viereinhalbfachen Ausgabepreis, und das Launch-Deck argumentiert, dass der Aufpreis verdient ist. Tencent HY4 Preview wurde am 28. August 2026 veröffentlicht und als Open Source bereitgestellt und meldet einen Software-Engineering-Score bei DeepSWE, der die 28.0 von Hy3 mehr als verdoppelt, eine 85.4 für Terminalsteuerung bei Terminal-Bench 2.1 sowie ein Kontextfenster, das von 256K auf über eine Million Token springt. tencent-hy3, das am 6. Juli offiziell wurde, ist das ausgereifte Arbeitspferd der Familie – 295B Gesamtparameter, 21B aktiv, ein Viertel des Kontexts und ein Preis, der eher einem Rundungsfehler nahekommt. Das ist kein Wettbewerb, den das Datenblatt knapp lässt. Die Frage ist, ob die Lücke das Geld für das wert ist, was man tatsächlich ausführt, und die Antwort hängt vom Workload ab.
Die Anzeigetafel: wo die beiden tatsächlich auseinandergehen
Jeder Benchmark in den Materialien von Tencent ist vom Anbieter selbst gemeldet — durchgeführt in Tencents eigenen Bewertungsumgebungen zum jeweiligen Modell-Launch, nicht von einem unabhängigen Labor reproduziert, und beim Flaggschiff-Modell ist die Veröffentlichung weniger als einen Tag her. Behandelt die Werte als die Obergrenze, von der Tencent glaubt, sie erreicht zu haben, und gewichtet das Muster stärker als jede einzelne Zahl. Das Muster ist unverkennbar und konzentriert sich auf agentische Engineering-Arbeit statt auf Allgemeinwissen:
DeepSWE — Tencent HY4 Preview: 64,3. tencent-hy3: 28,0. Dies ist der größte Einzelsprung in dieser Paarung, eine Steigerung auf mehr als das Doppelte bei einem Software-Engineering-Benchmark auf Repository-Ebene, und es ist die Zahl, die ein Chat-Modell von einem Modell trennt, dem man eine ganze Codebasis übergibt.
• Terminal-Bench 2.1 — Tencent HY4 Preview: 85,4, was Tencent als Gleichstand mit Claude Opus 5 angibt und DeepSeek V4 Pro übertrifft. tencent-hy3: 71,7, wie beim Launch im Juli berichtet. Ein echtes Terminal bei mehrstufigen Aufgaben bis zum Abschluss zu steuern, ist genau die Art von langfristiger Arbeit, bei der Hy3 am schwächsten war.
• Toolathlon-verifiziert — Tencent HY4 Preview: 74,1, der laut Tencent Qwen 3.8 Max und GPT-5.6 Sol übertrifft. Es wurde kein vergleichbarer Hy3-Wert veröffentlicht.
Interner Blindtest — 163 Experten bewerteten 203 Engineering-Aufgaben mit 2,99/4,00 für Tencent HY4 Preview, knapp vor GLM-5.3 (2,92) und Kimi K3 (2,94). Das sind Tencent-Reviewer bei Tencent-Aufgaben; betrachten Sie es als Richtwert.

Der rote Faden: Die Zugewinne liegen bei Terminal-Steuerung, Tool-Aufrufen und Aufgaben auf Repository-Ebene — die Produktivitätspositionierung, die Tencent seit Hy3 vorantreibt, nun mit der Rechenleistung im Rücken.
Der Preisaufschlag, Zeile für Zeile
Hier endet der Vergleich, was Prahlerei betrifft. Tencents Listenpreise pro Million Tokens:
• Eingabe — Tencent HY4 Preview: 6 Yuan (~0,85 US$). tencent-hy3: 1 Yuan (~0,14 US$). Das Sechsfache.
• Ausgabe — Tencent HY4 Preview: 18 Yuan (~2,50 US-Dollar). tencent-hy3: 4 Yuan (~0,56 US-Dollar). Viereinhalbmal so viel.
• Cache-Treffer — Tencent HY4 Preview: 0,3 Yuan. tencent-hy3: 0,25 Yuan. Fast gleich, was wichtiger ist, als es den Anschein hat, denn Agentenschleifen senden denselben System-Prompt und denselben Gesprächspräfix ständig erneut.
Führen Sie eine realistische Agentic-Coding-Arbeitslast mit der gemischten Token-Zahl durch – sagen wir 20 Millionen Eingabe- und 4 Millionen Ausgabe-Token pro Monat, das Budget eines vielbeschäftigten Einzelentwickler-Agenten. Tencent HY4 Preview: 120 Yuan plus 72 Yuan, etwa 192 Yuan (~US$27). tencent-hy3: 20 Yuan plus 16 Yuan, etwa 36 Yuan (~US$5). Das Flaggschiff kostet beim gleichen Token-Mix mehr als das Fünffache – und es wird pro Aufgabe mehr Ausgabe-Token verlangen, weil es länger denkt.
Das ist kein Grund, Tencent HY4 Preview zu meiden; der DeepSWE-Sprung ist genau die Art von Fähigkeit, für die ein Premium-Angebot gedacht ist. Es ist ein Grund, die Arbeitslast zu bepreisen, bevor man sie dorthin leitet. Und genau hier verdient die Routing-Ebene ihren Lohn: tencent-hy3 ist bereits auf OrcaRouter zum Listenpreis des Anbieters verfügbar — 0% Aufschlag, die Zahl, die Sie sehen, ist also der Preis des bereitstellenden Anbieters selbst, keine weiterverkaufte und mit Aufschlag versehene Version — mit automatischem Failover über Anbieter hinweg, und eine Preisänderung des Anbieters wird bei uns am selben Tag wirksam.
Viermal so viel Kontext, doppelte aktive Rechenleistung.
• Architektur — Tencent HY4 Preview: 770B gesamt, 49B aktive MoE. tencent-hy3: 295B gesamt, 21B aktive. Das Flaggschiff wendet auf jedes Token etwa 2,3-mal so viel Rechenleistung an.
• Kontextfenster — Tencent HY4 Preview: über 1M Token. tencent-hy3: 256K. Ein vollständiges Repository oder ein Batch von Finanzdokumenten passt als einzelne Anfrage in das Fenster des Flaggschiffs; bei Hy3 erfordert dieselbe Aufgabe Chunking, Retrieval oder eine Agentenschleife.
Reasoning-Steuerung – tencent-hy3 verfügt über eine pro Anfrage einstellbare reasoning_effort-Option (no_think, low, high) sowie eine spekulative Dekodierungsschicht, die es schnell hält. Tencent HY4 Preview neigt nach eigener Aussage von Tencent dazu, vor der ersten Ausgabe lange zu denken und bei komplexen Aufgaben übermäßig selbst zu verifizieren – und verbrennt dabei Tokens, um bereits erledigte Arbeit doppelt zu prüfen.
Dieser letzte Satz ist der unterschätzte Unterschied bei latenzempfindlichen Anwendungen. Hy3 kann angewiesen werden, direkt zu antworten; Tencent HY4 Preview kann, zumindest in dieser frühen Form, oft nicht anders, als zu denken. Für einen Low-Latency-Chat oder eine Hochdurchsatz-Extraktionspipeline sind die zusätzlichen Fähigkeiten des Flaggschiffs verschwendet und sein zusätzliches Denken ist ein Preis. Für einen Offline-Batch-Engineering-Job ist der Preis genau das, was die bessere Antwort erkauft.
Die Vorschau-Steuer: was Hy3 noch hat
"Preview" steht im Namen von Tencent HY4 Preview, und es verhält sich auch so. Es gibt keine Bild- oder Multimodaleingabe – das Modell ist rein textbasiert, sodass alles, was mit Bildern oder Videos zu tun hat, bei dem Modell bleibt, das du dafür bereits verwendest. Die zweiwöchige kostenlose Testphase bei WorkBuddy und CodeBuddy ist ein Vorgeschmack, kein Plan. Tencent hat klar gemacht, dass dies eine frühe Iteration von Hy4 ist, mit Verbesserungen beim Pre-Training und Post-Training, die noch kommen werden – in einem Rhythmus, der seit Februar etwa alle zwei Monate eine große Version hervorgebracht hat. Unabhängige Benchmarks für das Flaggschiff: noch keine, nirgendwo.
tencent-hy3 ist das Gegenteil von alledem. Es ist ein offizielles, stabiles Release, das seit Juli in Produktion ist. Die kostenlose Stufe läuft bis zum 30. September. Seine Reasoning-Stufen geben Ihnen einen Regler an die Hand statt eines Temperaments, und seine spekulative Dekodierungsschicht und 21B aktive Parameter machen es zur günstigen, schnellen, vorhersehbaren Hälfte dieser Familie — das Modell, das Sie auf den Standardpfad ausrichten und dann vergessen.

Wer sollte welche auswählen?
Wählen Sie Tencent HY4 Preview, wenn die Aufgabe im Vordergrund steht – eine schwierige Software-Engineering-Aufgabe, ein Kontext in Repository-Größe, ein agentischer Workflow, bei dem eine bessere Antwort das Fünffache der Token-Rechnung rechtfertigt und Sie sich die Latenz eines Modells leisten können, das nachdenkt, bevor es spricht. Wählen Sie tencent-hy3, wenn die Einschränkung im Vordergrund steht – hoher Durchsatz, geringe Latenz, ein knappes Budget oder jede Aufgabe, bei der Sie möchten, dass das Modell antwortet, statt zu überlegen.
Das praktische Muster für eine solche Paarung ist Eskalation: Das günstige, steuerbare Modell läuft auf dem Standardpfad, und nur wenn die Aufgabe es erfordert, wird auf das Flaggschiff eskaliert. Genau dafür ist die Routing-DSL von OrcaRouter gedacht – mehrere Modelle zu einem einzigen Aufruf zu kombinieren, sodass die Policy Konfiguration statt Code ist – und automatisches Failover bedeutet, dass der Hy3-Pfad weiterhin bedient wird, selbst wenn ein Anbieter nachlässt. OrcaRouter routet Tencent HY4 Preview noch nicht; Tencent hat das Modell nicht für Drittanbieter-Inferenz geöffnet, daher läuft es vorerst auf dem eigenen Tencent Cloud TokenHub-Endpunkt des Anbieters und auf selbst gehosteten Bereitstellungen der offenen Gewichte. tencent-hy3 dagegen ist heute im Katalog zum Listenpreis des Anbieters – und an dem Tag, an dem das Flaggschiff geöffnet wird, fügt es sich auf dieselbe Weise in dieselbe Routing-Ebene ein, sodass der Wechsel von einem Modell zum anderen eine Ein-Zeilen-Änderung statt einer Neufassung ist.

Das Urteil ist auf die beste Art langweilig: Das Flaggschiff ist den Aufpreis genau für die Arbeit wert, für die es bepreist ist, und das Arbeitstier ist nach wie vor die richtige Wahl für alles, was einfach erledigt werden muss. Die sechsfache Preisdifferenz ist real, die 28-zu-64-DeepSWE-Lücke ist real, und keine hebt die andere auf – man muss nur wissen, welches man kauft.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
