Eine Helden-Titelkarte für den Vergleich „Tencent HY4 Preview vs. Kimi K3“. Eine zentrale Karte im Anzeigetafel-Stil zeigt „Interner Blindtest, 4-Punkte-Skala“, mit „Tencent HY4 Preview 2,99“ auf der linken und „Kimi K3 2,94“ auf der rechten Seite. Die linke Karte „Tencent HY4 Preview“ listet „770B / 49B aktiv, offene Gewichte“, „¥6 / ¥18 pro 1M“, „Nur-Text-Vorschau“. Die rechte Karte „Kimi K3“ listet „2,8T / 104B aktiv, offene Gewichte“, „$3,00 / $15,00 pro 1M“, „Native Vision, AA Index 57“. Eine Fußzeile lautet: „Blindtest durchgeführt von Tencent mit 163 Ingenieuren über 203 Aufgaben; Ergebnisse vom Anbieter gemeldet.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Tencent HY4 Preview vs. Kimi K3: Der Blindtest, den Tencent veröffentlicht hat

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Tencent HY4 Preview gegen Kimi K3 ist das eine Duell beim Launch dieses Modells, das Tencent selbst zur Durchführung ausgewählt hat. In seinem internen Blindtest – 163 Ingenieure, 203 technische Aufgaben, bewertet auf einer Vier-Punkte-Skala – erzielte HY4 Preview 2,99/4,00 gegenüber 2,94 von Kimi K3, und Tencent nannte es einen Sieg. Das Kleingedruckte dieses Sieges lohnt das langsame Lesen: HY4 Preview besiegte Kimi K3 bei 51,2 % der Aufgaben, war bei 7,9 % gleichauf und verlor bei 40,9 %. Eine Netto-Siegesquote von 10 Prozentpunkten ist real, aber es ist ein knapper Vorsprung gegenüber einem Modell mit einem Drittel der Gesamtparameterzahl und weniger als der Hälfte der aktiven Parameter – und der gesamte Test wurde von Tencent durchgeführt.

Kimi K3 ist Moonshots Flaggschiff mit 2,8 Billionen Parametern und offenen Gewichten – das größte je veröffentlichte Open-Weight-Modell und der Referenzpunkt, an dem jedes chinesische Labor seit dem 16. Juli gemessen wird. Tencent wählte es als Gegner, weil es der Open-Weight-Standard ist – was die Aufgabe dieses Artikels ungewöhnlich konkret macht: Sieh dir den einen direkten Vergleich an, zu dem sich der Herausforderer freiwillig bereit erklärt hat, und entscheide, was er wert ist.

Der Benchmark, den Tencent veröffentlicht hat

Der Blindtest wurde von Tencents eigenen Ingenieuren an Tencents eigenen Engineering-Aufgaben bewertet, was der erste Punkt ist, den man abziehen muss. Eine vom Unternehmen kuratierte Aufgabensammlung ist genau die Umgebung, in der ein neues Modell seine bestmögliche Leistung zeigt. Selbst wenn man das zugesteht, ist die Form des Ergebnisses aufschlussreich: 51,2 % Siege gegen 40,9 % Niederlagen sind eine bescheidene Marge, und die 7,9 % Unentschieden-Rate bedeutet, dass die Modelle bei den meisten Aufgaben nahe beieinander liegen. Bei den schwierigen Aufgaben, denjenigen, bei denen sich ein Spitzenmodell abhebt, ist die Lücke genau dort, wo sie immer ist – und Tencents Schlagzeile „leicht vor Kimi K3“ ist ehrlich formuliert, was nicht jedes Labor veröffentlicht.

Größe ist nicht Schicksal.

Der Parametervergleich macht das Ergebnis entweder beeindruckend oder verdächtig, je nach den eigenen Vorannahmen. Kimi K3 hat 2,8 Billionen Gesamtparameter mit 104 Milliarden aktiven Parametern — 896 Experten, 16 pro Token aktiv — und wurde darauf trainiert, dauerhaft zu denken, mit offengelegtem Chain-of-Thought. HY4 Preview hat 770 Milliarden gesamt mit 49 Milliarden aktiven, ein Drittel des Gesamtumfangs und weniger als die Hälfte der aktiven Rechenleistung. Dass ein kleineres Modell in einem Blindtest einen knappen Sieg über ein größeres erringt, ist die Richtung, in die sich das gesamte Open-Weight-Feld bewegt — Qwen3.8-Max mit 2,4 Billionen und GLM-5.2 mit 753 Milliarden liefern sich seit Monaten Schlagabtausche bei agentischen Benchmarks — das Ergebnis ist also plausibel statt abwegig. Es ist außerdem, und das ist entscheidend, von niemandem außerhalb von Tencent verifiziert.

Die Anzeigetafel

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Skalierung — HY4 Preview 770B gesamt / 49B aktiv vs. Kimi K3 2.8T gesamt / 104B aktiv

• Kontext — HY4 Preview >1M Tokens vs. Kimi K3 1M Tokens

• Preis pro 1M — HY4 Preview ¥6 Input / ¥18 Output (≈$0.85 / $2.50) vs. Kimi K3 $3.00 Input / $15.00 Output, Cache-Treffer $0.30

Modalität — HY4 Preview nur Text vs. Kimi K3 native Bild- und Videoeingabe

• Reasoning — HY4 Preview ohne veröffentlichten Modus vs. Kimi K3 mit immer aktivem Reasoning und gestreamter Gedankenkette

• Unabhängige Bewertung — HY4 Preview keins vs. Kimi K3 AA Intelligenz-Index 57, weltweit unter den Top drei zum Zeitpunkt der Veröffentlichung

In den Zeilen, in denen beide Seiten eine Zahl angeben, gruppieren sich die Modelle. Tencent berichtet für HY4 Preview 37,1 bei APEX-Agents, praktisch gleichauf mit den 37,2 von Kimi K3 – ein Fast-Gleichstand, den das Blindtest-Scoreboard vorhersagen würde. HY4 Preview erzielt bei Toolathlon-Verified 74,1 und bei DeepSWE 64,3, wofür mir bei Kimi K3 keine Entsprechung vorliegt; Kimi K3 erzielt bei FrontierSWE 81,2, bei ProgramBench 77,8 und bei BrowseComp 91,2, wofür es bei HY4 Preview keine Entsprechung gibt. Das Scoreboard gibt ehrlich zu, dass sich die beiden Karten kaum überschneiden, was selbst eine Warnung davor ist, die Zeilen eines Anbieters als vollständige Beschreibung des Modells zu betrachten.

Vision ist der größte echte Unterschied.

Für einen Entwickler, der sich heute zwischen den beiden entscheidet, ist die strukturelle Lücke nicht Intelligenz – sondern die Eingabemodalität. Kimi K3 ist nativ multimodal: Es nimmt Bild- und Videoeingaben über seinen MoonViT-V2-Encoder auf und gehört bei Sehaufgaben zu den besten offenen Modellen – weltweit auf Platz zwei in der Vision Arena. Tencent HY4 Preview ist in dieser Vorschau rein textbasiert, und Tencent hat angekündigt, dass die Bildverarbeitung auf die Vollversion warten muss. Jede Arbeitslast, die Screenshots, UI-Verständnis oder visuelles Grounding erfordert, geht standardmäßig an Kimi K3 – unabhängig davon, was der Blindtest über technische Texte sagt. Wenn Ihre Arbeit rein aus Code, Dokumenten und Terminalausgaben besteht, spielt die Lücke keine Rolle; sobald eine Aufgabe das Anschauen von etwas beinhaltet, entscheidet sie das Duell.

Die Kostenfrage

Pro Token ist HY4 Preview dramatisch günstiger: etwa 0,85 $/2,50 $ gegenüber den 3,00 $/15,00 $ von Kimi K3, mit Cache-Treffern bei 0,3 ¥ (etwa vier Cent) gegenüber 0,30 $. Doch die beiden Modelle haben gegensätzliche Token-Verhaltensweisen, die die Lücke verkleinern. Kimi K3 denkt ständig und streamt seine Gedankenkette, was bei jeder Anfrage die Ausgabe-Token aufbläht; Rezensenten haben angemerkt, dass das Modell langsamer ist – etwa 62 Token pro Sekunde – und für Agenten-Schleifen token-intensiv ist. HY4 Preview neigt laut Tencents eigener Release-Notiz bei komplexen Aufgaben zu „übermäßig langem Denken und übermäßiger Selbstverifikation“. Beide verbrauchen zusätzliche Ausgabe-Token; HY4 Preview verlangt nur weniger dafür. Ein fairer Vergleich sind die Kosten pro abgeschlossener Aufgabe, und niemand außerhalb von Tencent hat die von HY4 Preview bisher gemessen.

Das Urteil

Tencent HY4 Preview ist der günstigere, kleinere und unverifizierte Herausforderer, der einen knappen Blindtest-Vorsprung gegenüber dem Open-Weight-Standard beansprucht; Kimi K3 ist der größere, verifizierte Platzhirsch mit Computer-Vision, der pro Token vier- bis fünfmal so viel kostet und einen unabhängigen Intelligenzindex von 57 hat. Keines der Modelle hat eine vollständig unabhängige Benchmark-Karte – auch die Top-Werte von Kimi K3 werden von Moonshot gemeldet, sein Index 57 allerdings nicht. Wenn Ihre Arbeitslast multimodal ist, ist Kimi K3 in diesem Duell die einzige Wahl. Wenn es um Text und Engineering geht, ist HY4 Preview das Preis-Leistungs-Angebot mit einem echten, wenn auch anbieterbetriebenen, direkten Vergleich, und der günstige Weg besteht darin, Kimi K3 über den Produktionsschlüssel zu routen – es ist auf OrcaRouter zu Moonshots Listenpreis von 3,00 $/15,00 $ verfügbar und wird ohne Aufschlag weitergegeben – während Sie HY4 Preview über Tencents eigene API für Shadow-Workloads betreiben. Sobald HY4 Preview einen Router erreicht, werden derselbe Schlüssel und dieselben Failover-Regeln für beide gelten, und Tencents Tarif von ¥6/¥18 wird unverändert weitergegeben.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

Was zu sehen

• Eine unabhängige Wiederholung der Blindtest-Aufgaben. Die Gewinnrate von 51,2 % ist die am besten testbare Behauptung in diesem Launch, und ein Drittanbieter-Testrahmen würde das in einer Woche klären.

• Ob HY4 Preview Vision vor der vollständigen Hy4-Veröffentlichung ausliefert. Genau das würde diesen von einem reinen Textwertvergleich in einen echten Flaggschiffkampf verwandeln.

• Kosten pro abgeschlossene Aufgabe auf standardmäßigen agentischen Harnesses. Beide Modelle sind token-intensiv; wer pro erledigte Aufgabe günstiger ist, gewinnt das Produktionsargument.

• Kimi K3s Reaktion auf den Preisdruck. Wenn Moonshot den Output-Preis von 15 $ senkt, kippt der Rahmen „günstiger Herausforderer vs. teurer Standard“.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube