Generierte Hero-Karte mit dem Titel Claude Sonnet 5.5 vs. Tencent HY4 Preview, mit dem Untertitel Beide Labs verkaufen die Token-Rechnung, mit drei Statistik-Karten: Ausgabepreis pro 1 Mio. $10,00 vs. $2,50, Gewichte geschlossen vs. Apache 2.0 und gemessene Ausgabegeschwindigkeit 138,7 vs. 22,3 Tokens pro Sekunde, mit einer Fußzeile: Tencent HY4 Preview Preis und Geschwindigkeit laut OrcaRouter-Katalog, Anbieterliste 6 / 18 Yuan pro Million; Claude Sonnet 5.5 laut Anthropic.
Guides & Insights

Claude Sonnet 5.5 vs. Tencent HY4 Preview: Beide Labs verkaufen die Token-Rechnung

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Markteinführungen, sechs Wochen auseinander, mit demselben Versprechen in anderen Worten. Die Behauptung des Anbieters ist, dass Claude Sonnet 5.5, ausgeliefert am 28. September 2026, „bis zu 30 % weniger pro Aufgabe“ kostet als Claude Sonnet 5 bei unveränderten Preisen pro Token. Die zweite Behauptung ist, dass die Optimierung vom 7. September am gehosteten Build von Tencent HY4 Preview, erstmals veröffentlicht und als Open Source freigegeben am 28. August 2026, die Reasoning-Runden und den Tokenverbrauch pro Aufgabe bei gleicher Aufgabenqualität senkt. Keiner der Anbieter hat einen Preis erhöht oder gesenkt, um diese Behauptung aufzustellen. Beide sagen Ihnen, dass die Tokens jetzt das Produkt sind, und das Interessante an diesem Duell ist, dass nur eine der beiden Behauptungen gegen eine veröffentlichte Pro-Aufgabe-Zahl geprüft werden kann — weil nur eines dieser beiden Modelle eine unabhängige Messung hat, gegen die man sie prüfen kann.

Diese Asymmetrie ist kein Seitenhieb gegen T​encent. HY4 Preview hat keine Modellseite bei Artificial Analysis, keinen unabhängigen Intelligence-Index-Score und keine Kosten-pro-Aufgabe-Zahl von Drittanbietern. Was es hat, ist eine Anbieter-Benchmark-Tabelle – Terminal-Bench 2.1 bei 85,4, DeepSWE 64,3, eine interne Blindbewertung über 203 Engineering-Aufgaben, bei der es durchschnittlich 2,99 erreichte – gegenüber GLM-5.3 mit 2,92 und Kimi K3 mit 2,94 – und ein öffentliches, per Crowd-Voting gekürtes Debüt auf dem WebDev Arena Leaderboard, wo T​encent berichtet, dass es insgesamt etwa auf Platz fünf und unter den Open-Weight-Modellen auf Platz drei landete. All das sind echte Signale. Keines davon ist ein Kosten-pro-Aufgabe-Wert, was bedeutet, dass die genaue Zahl, um die beide Anbieter konkurrieren, für HY4 Preview nicht verfügbar ist.

Was jede Seite tatsächlich geliefert hat

Tencent HY4 Preview ist ein Mixture-of-Experts-Modell mit 770 Milliarden Parametern und 49 Milliarden aktiven Parametern pro Token, 78 Schichten, 256 gerouteten Experten plus einem geteilten Experten, einer nativen MTP-Schicht für spekulative Dekodierung und einem Kontextfenster, das eine Million Token überschreitet. Es ist von Grund auf textbasiert – Tencent hat es für Coding-Agenten, komplexe Tool-Nutzung und Produktivitätsarbeit entwickelt, nicht für Bilder – und standardmäßig auf starkes Reasoning eingestellt, mit drei konfigurierbaren Stufen (hoch, niedrig, keine) und einer vom Anbieter empfohlenen Sampling-Einstellung von Temperatur 0,9 und top_p 1,0. Die Gewichte stehen unter Apache 2.0 und sind von Hugging Face, GitHub, ModelScope und GitCode herunterladbar. Tencent hat ursprünglich zwei Schwachstellen in der Preview benannt – dass es länger als nötig mit Nachdenken verbringt und seine eigene Arbeit übermäßig verifiziert –, und das Update vom 7. September zielt genau auf diese ab.

Claude Sonnet 5.5 ist A​nthropics zweites Modell der 5.5-Generation und dasjenige, das A​nthropic als die beste Kombination aus Geschwindigkeit und Intelligenz in der Produktpalette positioniert. Eine Million Tokens Kontext, 128.000 Ausgabe-Tokens synchron und 300.000 über die Message Batches API, Text-, Bild- und Dateieingabe, adaptives Denken bei wählbarem Aufwand, ein Wissensstand-Stichtag im Juni 2026, Zero Data Retention ab Markteinführung verfügbar sowie ein garantierter Mindest-Supportzeitraum bis zum 28. September 2027. Die Preisliste blieb gegenüber Claude Sonnet 5 unverändert: 2,00 $ pro Million Input-Tokens, 10,00 $ pro Million Output-Tokens, 0,20 $ für Cache-Lesevorgänge und 2,50 $ für Cache-Schreibvorgänge. Geschlossene Gewichte, A​nthropic API plus Bedrock, Goo​gle Cloud und Microsoft Foundry.

Stellt man die beiden einander gegenüber, sind die Positionen nahezu symmetrisch:

• Preis — Claude Sonnet 5.5 $2,00 in / $10,00 out pro Million vs. Tencent HY4 Preview $0,83 in / $2,50 out in unserem Katalog, aus einer Anbieterliste von ¥6 / ¥18

• Cache-Lesevorgänge — Claude Sonnet 5.5 0,20 $ pro Million vs. Tencent HY4 Preview 0,042 $ pro Million in unserem Katalog

• Gewichte — Claude Sonnet 5.5 Closed vs. Tencent HY4 Preview Apache 2.0, herunterladbar

• Kontext — Claude Sonnet 5.5 1.000.000 Tokens vs. Tencent HY4 Preview 1.048.576 Tokens, praktisch identisch

• Maximale Ausgabe — Claude Sonnet 5.5 128.000 synchron, 300.000 bei Batches vs. Tencent HY4 Preview 64.000 in unserem Katalog

• Eingabemodalität — Claude Sonnet 5.5 Text, Bild und Datei vs. Tencent HY4 Preview nur Text

• Unabhängige Bewertungen — Claude Sonnet 5.5 Intelligence Index 56 bei 7,60 $ pro Aufgabe, Revision v4.3.2 vs. Tencent HY4 Preview: keine veröffentlicht

• Gemessene Ausgabegeschwindigkeit — Claude Sonnet 5.5 138,7 Tokens/Sek. vs. Tencent HY4 Preview 22,3 Tokens/Sek. in unserem eigenen Traffic

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

Die Behauptung, die beide Labore aufstellen, und warum eines von ihnen überprüfbar ist

A​nthropics „30 % weniger pro Aufgabe“ und T​encents „weniger Reasoning-Runden, geringerer Token-Verbrauch“ sind dasselbe Engineering-Projekt, beschrieben aus zwei Richtungen: dafür sorgen, dass das Modell weniger Tokens aufwendet, um zur selben Antwort zu gelangen. A​nthropic sagt ausdrücklich, dass sich die Preise nicht geändert haben, was bedeutet, dass jede Einsparung pro Aufgabe aus den Token-Zahlen kommen muss – und das unabhängige Board lässt einen eher die Form des Problems erkennen als die Größe der Lösung. Claude Sonnet 5.5 erzeugt im Rahmen der Intelligence-Index-Bewertung 410 Millionen Output-Tokens, gegenüber 117 Millionen bei MiniMax M3 und 77 Millionen bei Grok 4.5. Es ist ein wortreiches Modell, gemessen auf einem Board, das die Zahl veröffentlicht. Was auch immer die 30-prozentige Verbesserung gegenüber Claude Sonnet 5 ausmacht, sie wird auf eine sehr große Basis angewendet.

Für HY4 Preview ist die entsprechende Zahl öffentlich nicht verfügbar. Tencents eigene Optimierungsnotiz ist die einzige Darstellung davon, und sie nennt das Ergebnis ohne Zahl: weniger Turns, geringere Input- und Output-Token, gleiche Qualität, validiert durch Benchmark-Metriken und menschliche Bewertung in einem zweifachen Durchlauf. Das ist eine Anbieterbehauptung im strengen Sinne – behauptet, plausibel, nicht reproduziert – und sie wird hier auch so gekennzeichnet. Ein Preview-Modell aufgrund der Behauptung eines Anbieters zur Token-Ökonomie zu übernehmen, obwohl die Token-Ökonomie genau das ist, was man von außen nicht messen kann, ist genau die Wette, zu der eine Preview-Veröffentlichung einen auffordert.

Ein weiterer Haken sollte bekannt sein, bevor jemand eine selbst gehostete Bereitstellung rund um diese Optimierung plant. Die Änderung, die Tencent am 7. September vorgenommen hat, betrifft den Build, den Tencent über seine eigenen gehosteten Endpunkte ausliefert. Der Open-Weight-Snapshot wurde nicht aktualisiert – das Datum der letzten Änderung im Hugging-Face-Repository ist nach wie vor der 28. August –, eine selbst gehostete Kopie der Gewichte zeigt also weiterhin das ursprüngliche Verhalten mit längeren Denkketten, auf das die Hinweise zur Vorschauversion aufmerksam gemacht haben. Die optimierte Version und die herunterladbare Version sind nicht dasselbe Artefakt.

Wo sich offene Gewichte auszahlen, ist genau dort, wo sie es immer tun: bei einem Deployment, das keine API aufrufen kann. Ein Modell mit 770B Parametern und 49B aktiven ist eine Entscheidung fürs Rechenzentrum und nicht für die Workstation, also ist das nicht die Geschichte der Laptop-Klasse, die ein 30B-Modell erzählt – aber für einen Käufer, der das Modell innerhalb seines eigenen Perimeters braucht, ist Apache 2.0 in dieser Größenordnung eine Option, die Claude Sonnet 5.5 zu keinem Preis bietet.

Eine Vorschau ausprobieren, ohne dabei einen Produktionspfad darauf zu setzen.

Preview-Modelle sind der Fall, in dem Routing nicht mehr nur eine Kostenoptimierung ist, sondern zu einer Risikokontrolle wird. Der Grund, einen Preview-Build hinter einen Router zu setzen, statt ihn direkt aufzurufen, ist, dass ein Preview durch die Möglichkeit definiert wird, sich unter Ihnen zu ändern, und die beiden Dinge, die Sie von der Schicht davor wollen, sind eine prozentuale Aufteilung und etwas, das die Fehler abfängt.

Das ist die Form, die OrcaRouter bietet: ein OpenAI-kompatibler Endpunkt, der über 200 Modelle abdeckt, mit durchgereichten Listpreisen der Anbieter ohne Aufschlag, automatischem Failover zwischen Upstream-Anbietern, und einer Routing-DSL, mit der sich Aufrufe aus mehreren Modellen zusammensetzen lassen. Tencent HY4 Preview ist hier heute routbar als tencent/hy4-preview – zu 0,83 $ für Input und 2,50 $ für Output pro Million Tokens, mit 0,042 $ für Cache-Reads über sein Fenster von 1.048.576 Tokens – derselbe Build, zum Tarif des Anbieters, erreichbar mit dem Schlüssel, den Sie bereits für alles andere im Katalog verwenden. Claude Sonnet 5 ist hier ebenfalls routbar, zu Anthropics 2,00 $ und 10,00 $, und das seit dem 30. Juni; es ist ein naheliegender Failover-Partner, während ein erst einen Tag altes Modell Produktionsbelege sammelt.

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5 selbst ist nicht in unserem Katalog. Es ist gestern erschienen, der Weg dorthin führt über Anthropics eigene API, und diese Seite wird nichts anderes nahelegen — der Sinn der Routing-Empfehlung ist, dass die sichere Methode, eine brandneue Stufe im Produktivbetrieb laufen zu lassen, darin besteht, ihr einen Teil des Traffics zuzuweisen, mit etwas Bewährtem dahinter, und das funktioniert nur, wenn beide Enden der Konstellation an einem Ort liegen, den man von einer Stelle aus erreichen kann. HY4 Preview trägt hier 372.000 Tokens Traffic pro Woche, was so aussieht wie ein zwei Tage alter Preview, bevor sich jemand darauf festgelegt hat; Claude Sonnet 5 trägt seit dem 30. Juni 7,9 Millionen pro Woche, und das ist der Unterschied zwischen einem Kandidaten und einer Basis.

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

Wohin das Geld tatsächlich fließt

Rein preislich ist HY4 Preview bei der Ausgabe viermal günstiger als Claude Sonnet 5.5 und bei Cache-Lesevorgängen nahezu fünfmal günstiger, und es entspricht dem Fenster. Bei den Messwerten erzeugt Claude Sonnet 5.5 in unserem eigenen Traffic sechsmal schneller Ausgaben – 138,7 Token pro Sekunde gegenüber 22,3 –, eine Kluft, die einen vierfachen Preisvorteil in einen viel kleineren Wall-Clock-Vorteil und – sobald Warteschlangen berücksichtigt werden – gelegentlich in einen Verlust verwandelt.

Zwischen diesen beiden Fakten beruht die Entscheidung auf vier Fragen, die nur der Leser beantworten kann. Braucht die Arbeit ein Bild oder eine Datei im Prompt? HY4 Preview ist rein textbasiert, und damit ist die Diskussion beendet. Muss sie eine mehrstufige Software-Aufgabe abschließen, wobei der Wert von 85,4 bei Terminal-Bench 2.1 für HY4 Preview eine eigene Angabe von T​encent und nicht reproduziert ist? Dann ist der Preview-Status das Risiko, das Sie eingehen, und die Optimierung vom 7. September sollten Sie eher erneut testen, anstatt ihr zu vertrauen. Muss die Workload innerhalb Ihres eigenen Perimeters laufen? Dann sind die Apache 2.0-Gewichte die entscheidende Tatsache. Und zählt das zusammengesetzte Fähigkeitsniveau mehr als die Rate? Dann ist der unabhängig gemessene Wert 56 von Claude Sonnet 5.5 die Zahl, die es abzuwägen gilt, bei 7,60 $ pro Index-Aufgabe, mit dem Vorbehalt, dass auf der T​encent-Seite keine entsprechende Zahl existiert, mit der man ihn vergleichen könnte.

Was beide Markteinführungen wirklich zeigen, ist, dass sich die Frontier von Preistabellen entfernt hat. Zwei Labore brachten im Abstand von sechs Wochen Modelle auf den Markt und stellten den Tokenverbrauch pro Aufgabe statt den Preis pro Million in den Vordergrund, und die praktische Konsequenz für Käufer ist, dass die nützliche Zahl nicht mehr auf den Preislisten beider Anbieter steht. Es ist die Tokenzahl, die Ihre eigene Arbeitslast erzeugt, gemessen bei beiden Modellen, und es ist die einzige Zahl in diesem Artikel, die Ihnen kein Anbieter nennen kann.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert