
Claude Sonnet 5.5 kontra Tencent HY4 Preview: Oba laboratoria sprzedają rachunek za tokeny
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 931 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 192 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Dwie premiery w odstępie sześciu tygodni, składające tę samą obietnicę innymi słowami. Dostawca twierdzi, że Claude Sonnet 5.5, udostępniony 28 września 2026 r., kosztuje „do 30% mniej na zadanie” niż Claude Sonnet 5 przy niezmienionych stawkach za token. Drugie twierdzenie głosi, że optymalizacja z 7 września dotycząca hostowanej kompilacji Tencent HY4 Preview, po raz pierwszy wydanego i udostępnionego jako open source 28 sierpnia 2026 r., zmniejsza liczbę tur rozumowania i zużycie tokenów na zadanie przy tej samej jakości zadania. Żaden z dostawców nie podniósł ani nie obniżył ceny, by wysunąć to twierdzenie. Obaj mówią ci, że tokeny są teraz produktem, a najciekawsze w tym starciu jest to, że tylko jedno z tych dwóch twierdzeń można zweryfikować na podstawie opublikowanej wartości na zadanie — ponieważ tylko jeden z tych dwóch modeli ma niezależny pomiar, z którym można je porównać.
Ta asymetria nie jest zarzutem wobec Tencentu. HY4 Preview nie ma strony modelu w Artificial Analysis, niezależnego wyniku Intelligence Index ani wskaźnika kosztu na zadanie od żadnej strony trzeciej. Ma natomiast tabelę benchmarków dostawcy — Terminal-Bench 2.1 na poziomie 85,4, DeepSWE 64,3, wewnętrzną ślepą ewaluację na 203 zadaniach inżynieryjnych, w której uzyskał średnio 2,99 wobec GLM-5.3 z 2,92 i Kimi K3 z 2,94 — oraz publiczny debiut wyłoniony w głosowaniu w rankingu WebDev Arena, gdzie Tencent podaje, że uplasował się około piątego miejsca ogółem i trzeciego wśród modeli open-weight. Wszystkie te sygnały są prawdziwe. Żaden z nich nie jest kosztem na zadanie, co oznacza, że dokładna liczba, na której konkurują obaj dostawcy, jest w przypadku HY4 Preview niedostępna.
Co każda ze stron faktycznie dostarczyła
Tencent HY4 Preview to mieszanka ekspertów o 770 miliardach parametrów, z 49 miliardami aktywnymi na token, 78 warstwami, 256 ekspertami rutowanymi plus jednym wspólnym ekspertem, natywną warstwą MTP do dekodowania spekulatywnego oraz oknem kontekstu przekraczającym milion tokenów. Jest wyłącznie tekstowy z założenia — Tencent zbudował go dla agentów kodujących, złożonego korzystania z narzędzi i pracy produktywnościowej, a nie dla obrazów — i domyślnie stosuje intensywne rozumowanie, z trzema konfigurowalnymi poziomami (wysokim, niskim, brakiem) oraz zalecanym przez dostawcę ustawieniem próbkowania: temperatura 0,9 i top_p 1,0. Wagi są objęte licencją Apache 2.0 i można je pobrać z Hugging Face, GitHub, ModelScope oraz GitCode. Tencent początkowo wskazał dwie szorstkie krawędzie w wersji zapoznawczej: poświęcanie więcej czasu na myślenie niż to konieczne oraz nadmierne weryfikowanie własnej pracy, a aktualizacja z 7 września celuje dokładnie w te kwestie.
Claude Sonnet 5.5 to drugi model Anthropic z generacji 5.5 i ten, który firma pozycjonuje jako najlepsze połączenie szybkości i inteligencji w ofercie. Milion tokenów kontekstu, 128 000 tokenów wyjściowych synchronicznie i 300 000 w Message Batches API, wejście tekstowe, obrazowe i plikowe, adaptacyjne myślenie z wybieralnym poziomem wysiłku, data odcięcia wiedzy na czerwiec 2026 r., zerowe przechowywanie danych dostępne od premiery oraz najwcześniejsza data wycofania 28 września 2027 r. Cennik nie zmienił się względem Claude Sonnet 5: 2,00 USD za milion tokenów wejściowych, 10,00 USD za milion tokenów wyjściowych, 0,20 USD za odczyty z pamięci podręcznej i 2,50 USD za zapisy do pamięci podręcznej. Zamknięte wagi, API Anthropic oraz Bedrock, Google Cloud i Microsoft Foundry.
Ustaw te dwa naprzeciwko siebie, a pozycje są niemal symetryczne:
• Cena — Claude Sonnet 5.5 2,00 USD za wejście / 10,00 USD za wyjście za milion vs Tencent HY4 Preview 0,83 USD za wejście / 2,50 USD za wyjście w naszym katalogu, z cennika dostawcy: ¥6 / ¥18
• Odczyty z pamięci podręcznej — Claude Sonnet 5.5 $0,20 za milion vs Tencent HY4 Preview $0,042 za milion w naszym katalogu
• Wagi — {{1}}Claude Sonnet 5.5 zamknięte{{/1}} vs {{2}}Tencent HY4 Preview Apache 2.0, do pobrania{{/2}}
• Kontekst — Claude Sonnet 5.5 1 000 000 tokenów vs Tencent HY4 Preview 1 048 576 tokenów, praktycznie identyczne
• Maksymalna długość wyjścia — Claude Sonnet 5.5 128 000 synchronicznie, 300 000 w trybie Batches w porównaniu z Tencent HY4 Preview 64 000 w naszym katalogu
• Modalność wejściowa — Claude Sonnet 5.5: tekst, obraz i plik vs Tencent HY4 Preview: tylko tekst
• Niezależne wyniki — Claude Sonnet 5.5 Intelligence Index 56 po 7,60 USD za zadanie, wersja v4.3.2 w porównaniu z Tencent HY4 Preview — nie opublikowano
• Zmierzona szybkość generowania — Claude Sonnet 5.5 138,7 tokenów/s vs Tencent HY4 Preview 22,3 tokenów/s na naszym własnym ruchu

Twierdzenie, które głoszą oba laboratoria, i dlaczego jedno z nich jest sprawdzalne
„30% mniej na zadanie” firmy Anthropic i „mniej kroków rozumowania, niższe zużycie tokenów” firmy Tencent to ten sam projekt inżynieryjny opisany z dwóch kierunków: sprawić, by model zużywał mniej tokenów, dochodząc do tej samej odpowiedzi. Anthropic wyraźnie zaznacza, że stawki się nie zmieniły, co oznacza, że wszelkie oszczędności na zadanie muszą wynikać z liczby tokenów — a niezależny ranking pozwala zobaczyć kształt problemu, a nie rozmiar poprawki. Claude Sonnet 5.5 generuje 410 milionów tokenów wyjściowych w całej ewaluacji Intelligence Index, w porównaniu ze 117 milionami dla MiniMax M3 i 77 milionami dla Grok 4.5. To gadatliwy model, co zostało zmierzone w rankingu, który publikuje tę liczbę. Cokolwiek oznacza 30% poprawy względem Claude Sonnet 5, jest ona stosowana do bardzo dużej bazy.
W przypadku HY4 Preview odpowiednik tej liczby nie istnieje publicznie. Własna notatka Tencenta na temat optymalizacji to jedyne źródło informacji o niej i podaje wynik bez liczby: mniej tur, mniej tokenów wejściowych i wyjściowych, ta sama jakość, zweryfikowana przez metryki benchmarków i ocenę ludzką w podwójnym przebiegu. To twierdzenie dostawcy w ścisłym tego słowa znaczeniu — zadeklarowane, wiarygodne, nieodtworzone — i tak jest tu oznaczone. Przyjęcie modelu preview w oparciu o twierdzenie dostawcy o ekonomii tokenów, gdy ekonomia tokenów jest tym, czego nie można zmierzyć z zewnątrz, to dokładnie ten zakład, do którego skłania cię wydanie preview.
Jeszcze jedna komplikacja jest warta uwagi, zanim ktokolwiek zaplanuje samodzielnie hostowane wdrożenie w oparciu o tę optymalizację. Zmiana Tencenta z 7 września dotyczy wersji, którą Tencent udostępnia na własnych hostowanych punktach końcowych. Wersja open-weight nie została odświeżona — data ostatniej modyfikacji repozytorium Hugging Face to wciąż 28 sierpnia — więc samodzielnie hostowana kopia wag działa z pierwotnym, dłuższym zachowaniem rozumowania, na które wskazywały notatki z wersji zapoznawczej. Zoptymalizowana wersja i wersja do pobrania to nie ten sam artefakt.
Tam, gdzie otwarte wagi faktycznie się opłacają, to to samo miejsce co zawsze: wdrożenie, które nie może wywołać API. Model z 770 mld parametrów i 49 mld aktywnych to decyzja dotycząca centrum danych, a nie stacji roboczej, więc to nie jest historia z klasy laptopów, jaką opowiada model 30B — ale dla nabywcy, który potrzebuje modelu we własnym perymetrze, Apache 2.0 w tej skali jest opcją, której Claude Sonnet 5.5 nie oferuje za żadną cenę.
Testowanie podglądu bez stawiania na nim ścieżki produkcyjnej
Modele w wersji zapoznawczej to przypadek, w którym routing przestaje być optymalizacją kosztów, a staje się kontrolą ryzyka. Powód, dla którego kompilację zapoznawczą umieszcza się za routerem, zamiast wywoływać ją bezpośrednio, jest taki, że wersję zapoznawczą definiuje możliwość zmiany pod tobą, a dwie rzeczy, których chcesz od warstwy przed nią, to podział procentowy i coś, co wychwyci awarie.
To jest właśnie to, co oferuje OrcaRouter: jeden endpoint zgodny z OpenAI obejmujący ponad 200 modeli, ceny listowe dostawców przekazywane dalej bez doliczania marży, automatyczne przełączanie awaryjne między dostawcami upstream oraz DSL routingu do komponowania wywołań z kilku modeli. Tencent HY4 Preview jest tu dziś dostępny w routingu jako tencent/hy4-preview w cenie 0,83 USD za wejście i 2,50 USD za wyjście za milion tokenów oraz 0,042 USD za odczyt z pamięci podręcznej, w oknie 1 048 576 tokenów — ten sam build, w cenie dostawcy, dostępny za pomocą klucza, którego już używasz do wszystkiego innego w katalogu. Claude Sonnet 5 również jest tu dostępny w routingu, w cenie Anthropic 2,00 i 10,00 USD, i jest tak od 30 czerwca; to oczywisty partner do przełączania awaryjnego, gdy jednodniowy model zbiera dowody z produkcji.

Sam Claude Sonnet 5.5 nie znajduje się w naszym katalogu. Został wydany wczoraj, droga do niego prowadzi przez własne API Anthropic, a ta strona nie będzie sugerować niczego innego — sens porady dotyczącej routingu polega na tym, że bezpieczny sposób uruchomienia zupełnie nowej warstwy na produkcji to przydzielenie jej części ruchu z czymś sprawdzonym za nią, a to działa tylko wtedy, gdy oba końce tego rozwiązania znajdują się w miejscu, do którego można dotrzeć z jednego miejsca. HY4 Preview obsługuje tutaj 372 tysiące tokenów ruchu tygodniowo, co jest tym, jak wygląda dwudniowa wersja zapoznawcza, zanim ktokolwiek się na nią zdecyduje; Claude Sonnet 5 obsługuje 7,9 miliona tygodniowo od 30 czerwca, a to różnica między kandydatem a bazą.

Gdzie faktycznie trafiają pieniądze
Już samo porównanie stawek pokazuje, że HY4 Preview jest czterokrotnie tańszy pod względem wyjścia niż Claude Sonnet 5.5 i niemal pięciokrotnie tańszy przy odczytach z pamięci podręcznej, a przy tym dorównuje rozmiarem okna. Jeśli natomiast chodzi o zmierzone wyniki, Claude Sonnet 5.5 generuje wyjście sześć razy szybciej w naszym własnym ruchu — 138,7 tokena na sekundę wobec 22,3 — co jest różnicą, która zamienia czterokrotną przewagę w stawce na znacznie mniejszą przewagę w czasie zegarowym, a czasami nawet w stratę, gdy uwzględni się kolejkowanie.
Między tymi dwoma faktami decyzja opiera się na czterech pytaniach, na które tylko czytelnik może odpowiedzieć. Czy zadanie wymaga obrazu lub pliku w prompcie? HY4 Preview jest wyłącznie tekstowy i to kończy dyskusję. Czy musi wykonać wieloetapowe zadanie programistyczne, w którym wynik HY4 Preview w Terminal-Bench 2.1 wynoszący 85,4 to własna liczba Tencenta i niezreprodukowana? Wtedy status wersji zapoznawczej jest ryzykiem, które akceptujesz, a optymalizację z 7 września warto ponownie przetestować, zamiast jej ufać. Czy obciążenie musi działać wewnątrz własnego perymetru? Wtedy wagi Apache 2.0 są rozstrzygającym faktem. A czy kompozytowy poziom możliwości ma większe znaczenie niż stawka? Wtedy niezależnie zmierzony wynik 56 Claude Sonnet 5.5 jest liczbą, którą należy rozważyć, przy 7,60 USD za zadanie Index, z zastrzeżeniem, że po stronie Tencenta nie istnieje równoważna wartość, z którą można by ją porównać.
To, co tak naprawdę pokazują obie premiery, to fakt, że granica przesunęła się poza cenniki stawek. Dwa laboratoria, w odstępie sześciu tygodni, wypuściły modele i wysunęły na pierwszy plan zużycie tokenów na zadanie, a nie cenę za milion, a praktyczną konsekwencją dla nabywcy jest to, że użyteczna liczba nie znajduje się już na stronie cennika żadnego z dostawców. Jest to liczba tokenów, którą generuje Twoje własne obciążenie, zmierzona na obu modelach, i jest to jedyna liczba w tym artykule, której żaden z dostawców nie może Ci podać.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
