
Claude Sonnet 5.5 vs. Tencent HY4 Preview: Beide Labs verkaufen die Token-Rechnung
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 931 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 192 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Zwei Markteinführungen, sechs Wochen auseinander, mit demselben Versprechen in anderen Worten. Die Behauptung des Anbieters ist, dass Claude Sonnet 5.5, ausgeliefert am 28. September 2026, „bis zu 30 % weniger pro Aufgabe“ kostet als Claude Sonnet 5 bei unveränderten Preisen pro Token. Die zweite Behauptung ist, dass die Optimierung vom 7. September am gehosteten Build von Tencent HY4 Preview, erstmals veröffentlicht und als Open Source freigegeben am 28. August 2026, die Reasoning-Runden und den Tokenverbrauch pro Aufgabe bei gleicher Aufgabenqualität senkt. Keiner der Anbieter hat einen Preis erhöht oder gesenkt, um diese Behauptung aufzustellen. Beide sagen Ihnen, dass die Tokens jetzt das Produkt sind, und das Interessante an diesem Duell ist, dass nur eine der beiden Behauptungen gegen eine veröffentlichte Pro-Aufgabe-Zahl geprüft werden kann — weil nur eines dieser beiden Modelle eine unabhängige Messung hat, gegen die man sie prüfen kann.
Diese Asymmetrie ist kein Seitenhieb gegen Tencent. HY4 Preview hat keine Modellseite bei Artificial Analysis, keinen unabhängigen Intelligence-Index-Score und keine Kosten-pro-Aufgabe-Zahl von Drittanbietern. Was es hat, ist eine Anbieter-Benchmark-Tabelle – Terminal-Bench 2.1 bei 85,4, DeepSWE 64,3, eine interne Blindbewertung über 203 Engineering-Aufgaben, bei der es durchschnittlich 2,99 erreichte – gegenüber GLM-5.3 mit 2,92 und Kimi K3 mit 2,94 – und ein öffentliches, per Crowd-Voting gekürtes Debüt auf dem WebDev Arena Leaderboard, wo Tencent berichtet, dass es insgesamt etwa auf Platz fünf und unter den Open-Weight-Modellen auf Platz drei landete. All das sind echte Signale. Keines davon ist ein Kosten-pro-Aufgabe-Wert, was bedeutet, dass die genaue Zahl, um die beide Anbieter konkurrieren, für HY4 Preview nicht verfügbar ist.
Was jede Seite tatsächlich geliefert hat
Tencent HY4 Preview ist ein Mixture-of-Experts-Modell mit 770 Milliarden Parametern und 49 Milliarden aktiven Parametern pro Token, 78 Schichten, 256 gerouteten Experten plus einem geteilten Experten, einer nativen MTP-Schicht für spekulative Dekodierung und einem Kontextfenster, das eine Million Token überschreitet. Es ist von Grund auf textbasiert – Tencent hat es für Coding-Agenten, komplexe Tool-Nutzung und Produktivitätsarbeit entwickelt, nicht für Bilder – und standardmäßig auf starkes Reasoning eingestellt, mit drei konfigurierbaren Stufen (hoch, niedrig, keine) und einer vom Anbieter empfohlenen Sampling-Einstellung von Temperatur 0,9 und top_p 1,0. Die Gewichte stehen unter Apache 2.0 und sind von Hugging Face, GitHub, ModelScope und GitCode herunterladbar. Tencent hat ursprünglich zwei Schwachstellen in der Preview benannt – dass es länger als nötig mit Nachdenken verbringt und seine eigene Arbeit übermäßig verifiziert –, und das Update vom 7. September zielt genau auf diese ab.
Claude Sonnet 5.5 ist Anthropics zweites Modell der 5.5-Generation und dasjenige, das Anthropic als die beste Kombination aus Geschwindigkeit und Intelligenz in der Produktpalette positioniert. Eine Million Tokens Kontext, 128.000 Ausgabe-Tokens synchron und 300.000 über die Message Batches API, Text-, Bild- und Dateieingabe, adaptives Denken bei wählbarem Aufwand, ein Wissensstand-Stichtag im Juni 2026, Zero Data Retention ab Markteinführung verfügbar sowie ein garantierter Mindest-Supportzeitraum bis zum 28. September 2027. Die Preisliste blieb gegenüber Claude Sonnet 5 unverändert: 2,00 $ pro Million Input-Tokens, 10,00 $ pro Million Output-Tokens, 0,20 $ für Cache-Lesevorgänge und 2,50 $ für Cache-Schreibvorgänge. Geschlossene Gewichte, Anthropic API plus Bedrock, Google Cloud und Microsoft Foundry.
Stellt man die beiden einander gegenüber, sind die Positionen nahezu symmetrisch:
• Preis — Claude Sonnet 5.5 $2,00 in / $10,00 out pro Million vs. Tencent HY4 Preview $0,83 in / $2,50 out in unserem Katalog, aus einer Anbieterliste von ¥6 / ¥18
• Cache-Lesevorgänge — Claude Sonnet 5.5 0,20 $ pro Million vs. Tencent HY4 Preview 0,042 $ pro Million in unserem Katalog
• Gewichte — Claude Sonnet 5.5 Closed vs. Tencent HY4 Preview Apache 2.0, herunterladbar
• Kontext — Claude Sonnet 5.5 1.000.000 Tokens vs. Tencent HY4 Preview 1.048.576 Tokens, praktisch identisch
• Maximale Ausgabe — Claude Sonnet 5.5 128.000 synchron, 300.000 bei Batches vs. Tencent HY4 Preview 64.000 in unserem Katalog
• Eingabemodalität — Claude Sonnet 5.5 Text, Bild und Datei vs. Tencent HY4 Preview nur Text
• Unabhängige Bewertungen — Claude Sonnet 5.5 Intelligence Index 56 bei 7,60 $ pro Aufgabe, Revision v4.3.2 vs. Tencent HY4 Preview: keine veröffentlicht
• Gemessene Ausgabegeschwindigkeit — Claude Sonnet 5.5 138,7 Tokens/Sek. vs. Tencent HY4 Preview 22,3 Tokens/Sek. in unserem eigenen Traffic

Die Behauptung, die beide Labore aufstellen, und warum eines von ihnen überprüfbar ist
Anthropics „30 % weniger pro Aufgabe“ und Tencents „weniger Reasoning-Runden, geringerer Token-Verbrauch“ sind dasselbe Engineering-Projekt, beschrieben aus zwei Richtungen: dafür sorgen, dass das Modell weniger Tokens aufwendet, um zur selben Antwort zu gelangen. Anthropic sagt ausdrücklich, dass sich die Preise nicht geändert haben, was bedeutet, dass jede Einsparung pro Aufgabe aus den Token-Zahlen kommen muss – und das unabhängige Board lässt einen eher die Form des Problems erkennen als die Größe der Lösung. Claude Sonnet 5.5 erzeugt im Rahmen der Intelligence-Index-Bewertung 410 Millionen Output-Tokens, gegenüber 117 Millionen bei MiniMax M3 und 77 Millionen bei Grok 4.5. Es ist ein wortreiches Modell, gemessen auf einem Board, das die Zahl veröffentlicht. Was auch immer die 30-prozentige Verbesserung gegenüber Claude Sonnet 5 ausmacht, sie wird auf eine sehr große Basis angewendet.
Für HY4 Preview ist die entsprechende Zahl öffentlich nicht verfügbar. Tencents eigene Optimierungsnotiz ist die einzige Darstellung davon, und sie nennt das Ergebnis ohne Zahl: weniger Turns, geringere Input- und Output-Token, gleiche Qualität, validiert durch Benchmark-Metriken und menschliche Bewertung in einem zweifachen Durchlauf. Das ist eine Anbieterbehauptung im strengen Sinne – behauptet, plausibel, nicht reproduziert – und sie wird hier auch so gekennzeichnet. Ein Preview-Modell aufgrund der Behauptung eines Anbieters zur Token-Ökonomie zu übernehmen, obwohl die Token-Ökonomie genau das ist, was man von außen nicht messen kann, ist genau die Wette, zu der eine Preview-Veröffentlichung einen auffordert.
Ein weiterer Haken sollte bekannt sein, bevor jemand eine selbst gehostete Bereitstellung rund um diese Optimierung plant. Die Änderung, die Tencent am 7. September vorgenommen hat, betrifft den Build, den Tencent über seine eigenen gehosteten Endpunkte ausliefert. Der Open-Weight-Snapshot wurde nicht aktualisiert – das Datum der letzten Änderung im Hugging-Face-Repository ist nach wie vor der 28. August –, eine selbst gehostete Kopie der Gewichte zeigt also weiterhin das ursprüngliche Verhalten mit längeren Denkketten, auf das die Hinweise zur Vorschauversion aufmerksam gemacht haben. Die optimierte Version und die herunterladbare Version sind nicht dasselbe Artefakt.
Wo sich offene Gewichte auszahlen, ist genau dort, wo sie es immer tun: bei einem Deployment, das keine API aufrufen kann. Ein Modell mit 770B Parametern und 49B aktiven ist eine Entscheidung fürs Rechenzentrum und nicht für die Workstation, also ist das nicht die Geschichte der Laptop-Klasse, die ein 30B-Modell erzählt – aber für einen Käufer, der das Modell innerhalb seines eigenen Perimeters braucht, ist Apache 2.0 in dieser Größenordnung eine Option, die Claude Sonnet 5.5 zu keinem Preis bietet.
Eine Vorschau ausprobieren, ohne dabei einen Produktionspfad darauf zu setzen.
Preview-Modelle sind der Fall, in dem Routing nicht mehr nur eine Kostenoptimierung ist, sondern zu einer Risikokontrolle wird. Der Grund, einen Preview-Build hinter einen Router zu setzen, statt ihn direkt aufzurufen, ist, dass ein Preview durch die Möglichkeit definiert wird, sich unter Ihnen zu ändern, und die beiden Dinge, die Sie von der Schicht davor wollen, sind eine prozentuale Aufteilung und etwas, das die Fehler abfängt.
Das ist die Form, die OrcaRouter bietet: ein OpenAI-kompatibler Endpunkt, der über 200 Modelle abdeckt, mit durchgereichten Listpreisen der Anbieter ohne Aufschlag, automatischem Failover zwischen Upstream-Anbietern, und einer Routing-DSL, mit der sich Aufrufe aus mehreren Modellen zusammensetzen lassen. Tencent HY4 Preview ist hier heute routbar als tencent/hy4-preview – zu 0,83 $ für Input und 2,50 $ für Output pro Million Tokens, mit 0,042 $ für Cache-Reads über sein Fenster von 1.048.576 Tokens – derselbe Build, zum Tarif des Anbieters, erreichbar mit dem Schlüssel, den Sie bereits für alles andere im Katalog verwenden. Claude Sonnet 5 ist hier ebenfalls routbar, zu Anthropics 2,00 $ und 10,00 $, und das seit dem 30. Juni; es ist ein naheliegender Failover-Partner, während ein erst einen Tag altes Modell Produktionsbelege sammelt.

Claude Sonnet 5.5 selbst ist nicht in unserem Katalog. Es ist gestern erschienen, der Weg dorthin führt über Anthropics eigene API, und diese Seite wird nichts anderes nahelegen — der Sinn der Routing-Empfehlung ist, dass die sichere Methode, eine brandneue Stufe im Produktivbetrieb laufen zu lassen, darin besteht, ihr einen Teil des Traffics zuzuweisen, mit etwas Bewährtem dahinter, und das funktioniert nur, wenn beide Enden der Konstellation an einem Ort liegen, den man von einer Stelle aus erreichen kann. HY4 Preview trägt hier 372.000 Tokens Traffic pro Woche, was so aussieht wie ein zwei Tage alter Preview, bevor sich jemand darauf festgelegt hat; Claude Sonnet 5 trägt seit dem 30. Juni 7,9 Millionen pro Woche, und das ist der Unterschied zwischen einem Kandidaten und einer Basis.

Wohin das Geld tatsächlich fließt
Rein preislich ist HY4 Preview bei der Ausgabe viermal günstiger als Claude Sonnet 5.5 und bei Cache-Lesevorgängen nahezu fünfmal günstiger, und es entspricht dem Fenster. Bei den Messwerten erzeugt Claude Sonnet 5.5 in unserem eigenen Traffic sechsmal schneller Ausgaben – 138,7 Token pro Sekunde gegenüber 22,3 –, eine Kluft, die einen vierfachen Preisvorteil in einen viel kleineren Wall-Clock-Vorteil und – sobald Warteschlangen berücksichtigt werden – gelegentlich in einen Verlust verwandelt.
Zwischen diesen beiden Fakten beruht die Entscheidung auf vier Fragen, die nur der Leser beantworten kann. Braucht die Arbeit ein Bild oder eine Datei im Prompt? HY4 Preview ist rein textbasiert, und damit ist die Diskussion beendet. Muss sie eine mehrstufige Software-Aufgabe abschließen, wobei der Wert von 85,4 bei Terminal-Bench 2.1 für HY4 Preview eine eigene Angabe von Tencent und nicht reproduziert ist? Dann ist der Preview-Status das Risiko, das Sie eingehen, und die Optimierung vom 7. September sollten Sie eher erneut testen, anstatt ihr zu vertrauen. Muss die Workload innerhalb Ihres eigenen Perimeters laufen? Dann sind die Apache 2.0-Gewichte die entscheidende Tatsache. Und zählt das zusammengesetzte Fähigkeitsniveau mehr als die Rate? Dann ist der unabhängig gemessene Wert 56 von Claude Sonnet 5.5 die Zahl, die es abzuwägen gilt, bei 7,60 $ pro Index-Aufgabe, mit dem Vorbehalt, dass auf der Tencent-Seite keine entsprechende Zahl existiert, mit der man ihn vergleichen könnte.
Was beide Markteinführungen wirklich zeigen, ist, dass sich die Frontier von Preistabellen entfernt hat. Zwei Labore brachten im Abstand von sechs Wochen Modelle auf den Markt und stellten den Tokenverbrauch pro Aufgabe statt den Preis pro Million in den Vordergrund, und die praktische Konsequenz für Käufer ist, dass die nützliche Zahl nicht mehr auf den Preislisten beider Anbieter steht. Es ist die Tokenzahl, die Ihre eigene Arbeitslast erzeugt, gemessen bei beiden Modellen, und es ist die einzige Zahl in diesem Artikel, die Ihnen kein Anbieter nennen kann.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
