Karta tytułowa hero dla „Tencent HY4 Preview vs tencent-hy3”. Nagłówek brzmi: „Sześć razy wyższa cena — i co ten przeskok faktycznie daje”. Lewy panel „Tencent HY4 Preview” (NOWY FLAGOWIEC, 28 sie 2026) ze znacznikami „770B / 49B MoE”, „1M kontekstu”, „DeepSWE 64.3”. Prawy panel „tencent-hy3” (SPRAWDZONY KOŃ ROBOCZY) ze znacznikami „295B / 21B MoE”, „256K kontekstu”, „DeepSWE 28.0”. Stopka brzmi: „Cena ¥6/¥18 vs ¥1/¥4 za MTok. Benchmarki raportowane przez producenta.”
Guides & Insights

Tencent HY4 Preview vs tencent-hy3: Sześć razy wyższa cena i co ten skok faktycznie daje

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tencent HY4 Preview to pierwszy model z rodziny Hunyuan, który celowo sprawia, że jego poprzednik wygląda tanio: Tencent wycenia go na sześciokrotność ceny wejściowej (input) tencent-hy3 i 4,5-krotność ceny wyjściowej (output), a materiały premierowe argumentują, że wyższa cena jest w pełni uzasadniona. Wydany i udostępniony jako open-source 28 sierpnia 2026 roku, Tencent HY4 Preview raportuje wynik w testach inżynierii oprogramowania DeepSWE, który ponad dwukrotnie przewyższa 28,0 Hy3, wynik 85,4 w obsłudze terminala w Terminal-Bench 2.1 oraz okno kontekstowe, które skacze z 256K do ponad miliona tokenów. tencent-hy3, który oficjalnie zadebiutował 6 lipca, to dojrzały koń roboczy rodziny — 295B parametrów łącznie, 21B aktywnych, ćwierć kontekstu i cena bliższa błędom zaokrągleń. To nie jest rywalizacja, którą specyfikacja pozostawia nierozstrzygniętą. Pytanie brzmi, czy ta różnica jest warta pieniędzy za to, co faktycznie uruchamiasz, a odpowiedź dzieli się w zależności od obciążenia pracą.

Tablica wyników: gdzie te dwa faktycznie się różnią

Każdy benchmark w materiałach Tencenta pochodzi od dostawcy — przeprowadzono go na własnych środowiskach ewaluacyjnych Tencenta przy premierze każdego modelu, nie został odtworzony przez niezależne laboratorium, a w przypadku modelu flagowego jest on publiczny od niespełna jednego dnia. Traktuj wyniki jako górny pułap, który według Tencenta został osiągnięty, i przywiązuj większą wagę do wzorca niż do jakiejkolwiek pojedynczej liczby. Ten wzorzec jest niezaprzeczalny i koncentruje się na pracy inżynierskiej dotyczącej agentów, a nie na ogólnej wiedzy:

• DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. To największy pojedynczy skok w tym zestawieniu, ponad dwukrotny wzrost w benchmarku inżynierii oprogramowania na skalę repozytorium, i to właśnie liczba, która oddziela model czatu od modelu, któremu powierzasz cały kod.

• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4, co według Tencent dorównuje Claude Opus 5 i przewyższa DeepSeek V4 Pro. tencent-hy3: 71.7, jak podano przy lipcowej premierze. Doprowadzenie prawdziwego terminala do końca w zadaniach wieloetapowych to dokładnie ten rodzaj pracy długoterminowej, w której Hy3 wypadał najsłabiej.

• Zweryfikowane przez Toolathlon — Tencent HY4 Preview: 74,1, co według Tencent przewyższa Qwen 3.8 Max i GPT-5.6 Sol. Nie opublikowano porównywalnego wyniku dla Hy3.

Wewnętrzny test ślepy — 163 ekspertów oceniło 203 zadania inżynieryjne na 2,99/4,00 dla Tencent HY4 Preview, minimalnie wyprzedzając wynik GLM-5.3 (2,92) i Kimi K3 (2,94). To recenzenci Tencenta oceniający zadania Tencenta; traktuj to jako orientacyjne.

A two-column comparison scoreboard titled 'Tencent HY4 Preview vs tencent-hy3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active params: 770B / 49B', 'Context window: 1M', 'DeepSWE: 64.3', 'Terminal-Bench 2.1: 85.4', 'Input price per MTok: ¥6 (~$0.85)', 'Output price per MTok: ¥18 (~$2.50)'. Right column 'tencent-hy3': 'Total / active params: 295B / 21B', 'Context window: 256K', 'DeepSWE: 28.0', 'Terminal-Bench 2.1: 71.7', 'Input price per MTok: ¥1 (~$0.14)', 'Output price per MTok: ¥4 (~$0.56)'. A footer reads 'Benchmarks vendor-reported by Tencent at each model's launch.'

Wspólny mianownik: korzyści dotyczą sterowania terminalem, wywoływania narzędzi i zadań na skalę repozytorium — pozycjonowanie produktywności, które Tencent promuje od Hy3, teraz z mocą obliczeniową, która to potwierdza.

Premia cenowa, linia po linii

Tu porównanie przestaje dotyczyć przechwałek. Ceny katalogowe Tencenta za milion tokenów:

• Wejście — Tencent HY4 Preview: 6 juanów (~0,85 USD). tencent-hy3: 1 juan (~0,14 USD). Sześć razy.

• Wynik — Tencent HY4 Preview: 18 juanów (~2,50 USD). tencent-hy3: 4 juany (~0,56 USD). Cztery i pół raza więcej.

Cache hit — Tencent HY4 Preview: 0,3 juana. tencent-hy3: 0,25 juana. Prawie tyle samo, co ma większe znaczenie, niż się wydaje, ponieważ pętle agentowe nieustannie wysyłają ten sam system prompt i prefiks konwersacji.

Przepuśćmy realistyczne obciążenie kodowania agentowego przez tę mieszaną liczbę — powiedzmy 20 milionów tokenów wejściowych i 4 miliony tokenów wyjściowych miesięcznie, czyli budżet aktywnego pojedynczego dewelopera-agenta. Tencent HY4 Preview: 120 juanów plus 72 juanów, około 192 juanów (~27 USD). tencent-hy3: 20 juanów plus 16 juanów, około 36 juanów (~5 USD). Flagowy model kosztuje pięć i więcej razy tyle przy tym samym miksie tokenów — a do tego będzie wymagał więcej tokenów wyjściowych na zadanie, bo myśli dłużej.

To nie jest powód, aby unikać Tencent HY4 Preview; skok DeepSWE to dokładnie ten rodzaj możliwości, dla której kupuje się wersję premium. To powód, aby wycenić obciążenie, zanim je tam skierujesz. I to jest miejsce, w którym warstwa routingu udowadnia swoją przydatność: tencent-hy3 jest już na OrcaRouter po cenie katalogowej dostawcy — 0% marży, więc kwota, którą widzisz, to cena samego dostawcy świadczącego usługę, a nie odsprzedana i zawyżona wersja tej ceny — z automatycznym przełączaniem awaryjnym między dostawcami, a zmiana ceny u dostawcy wchodzi po naszej stronie w życie tego samego dnia.

Czterokrotnie większy kontekst, podwójna aktywna moc obliczeniowa

• Architektura — Tencent HY4 Preview: 770 mld łącznie, 49 mld aktywnych w MoE. tencent-hy3: 295 mld łącznie, 21 mld aktywnych. Flagowy model zużywa około 2,3 razy więcej mocy obliczeniowej na każdy token.

• Okno kontekstowe — Tencent HY4 Preview: ponad 1M tokenów. tencent-hy3: 256K. Całe repozytorium lub partia dokumentów finansowych mieści się w oknie flagowego modelu jako pojedyncze żądanie; na Hy3 to samo zadanie wymaga dzielenia na części, wyszukiwania lub pętli agenta.

• Kontrola rozumowania — tencent-hy3 dostarcza ustawienie reasoning_effort dla każdego żądania (no_think, low, high) oraz warstwę spekulatywnego dekodowania, która zapewnia szybkość działania. Tencent HY4 Preview, jak przyznaje sam Tencent, ma tendencję do długiego myślenia przed pierwszą odpowiedzią i nadmiernej samoweryfikacji przy złożonych zadaniach — spalając tokeny na podwójne sprawdzanie pracy, którą już wykonał.

Ta ostatnia linijka to niepozorna różnica dla zastosowań wrażliwych na opóźnienia. Hy3 można nakazać, aby odpowiadał bezpośrednio; Tencent HY4 Preview, przynajmniej w tej wczesnej formie, często nie może powstrzymać się od myślenia. W przypadku czatu o niskim opóźnieniu lub potoku ekstrakcji o wysokiej przepustowości dodatkowa zdolność flagowca jest marnowana, a jego dodatkowe myślenie jest podatkiem. W przypadku offline'owego zadania inżynieryjnego przetwarzanego wsadowo ten podatek jest dokładnie tym, co kupuje lepszą odpowiedź.

Opłata za podgląd: co wciąż ma Hy3

„Preview" jest w nazwie Tencent HY4 Preview i tak też się zachowuje. Nie ma tu wejścia wizyjnego ani multimodalnego — model jest wyłącznie tekstowy, więc wszystko, co dotyczy obrazu lub wideo, pozostaje na modelu, którego już używasz do tego celu. Dwutygodniowy bezpłatny okres próbny w WorkBuddy i CodeBuddy to przedsmak, a nie plan. Tencent wyraźnie zaznaczył, że to wczesna iteracja Hy4, a ulepszenia pre-treningu i post-treningu dopiero nadejdą, w tempie, które od lutego co mniej więcej dwa miesiące przynosi kolejną główną wersję. Niezależne benchmarki dla flagowego modelu: na razie nie ma ich nigdzie.

tencent-hy3 jest przeciwieństwem tego wszystkiego. To oficjalne, stabilne wydanie, które działa w produkcji od lipca. Jego darmowy poziom obowiązuje do 30 września. Poziomy rozumowania dają pokrętło zamiast temperamentu, a warstwa spekulatywnego dekodowania i 21B aktywnych parametrów czynią z niego tanią, szybką i przewidywalną połowę tej rodziny — model, który kierujesz na domyślną ścieżkę i o którym zapominasz.

Screenshot of Tencent's official Hugging Face model card for the Hy4 Preview release, showing the model's open-weights download options, the 770B-parameter mixture-of-experts specification, and the million-token context window.

Kto powinien wybrać, które

Wybierz Tencent HY4 Preview, gdy liczy się zadanie — trudne zadanie z inżynierii oprogramowania, kontekst na skalę repozytorium, przepływ pracy agentowej, w którym lepsza odpowiedź uzasadnia pięciokrotny rachunek za tokeny, a stać cię na opóźnienie modelu, który myśli, zanim odpowie. Wybierz tencent-hy3, gdy liczą się ograniczenia — wysoka przepustowość, niskie opóźnienia, napięty budżet lub każde zadanie, w którym chcesz, aby model odpowiadał, a nie deliberował.

Praktyczny wzorzec dla takiej pary to eskalacja: kierować tani, sterowalny model na ścieżkę domyślną i eskalować do flagowego tylko wtedy, gdy wymaga tego zadanie. Właśnie do tego służy DSL routingu OrcaRouter — do komponowania kilku modeli w jedno wywołanie, tak aby polityka była konfiguracją, a nie kodem — a automatyczne przełączanie awaryjne oznacza, że ścieżka Hy3 działa dalej, nawet gdy jeden z dostawców ulegnie degradacji. OrcaRouter nie obsługuje jeszcze Tencent HY4 Preview; Tencent nie udostępnił modelu do wnioskowania przez podmioty trzecie, więc na razie działa on na własnym punkcie końcowym Tencent Cloud TokenHub dostawcy oraz na samodzielnie hostowanych wdrożeniach otwartych wag. Tymczasem tencent-hy3 jest już dziś w katalogu po cenie katalogowej dostawcy — a gdy flagowy model zostanie udostępniony, w ten sam sposób wpasuje się w tę samą warstwę routingu, zamieniając przełączenie z jednego modelu na drugi w zmianę jednej linii zamiast przepisywania.

Screenshot of the OrcaRouter model page for tencent/hy3, showing its provider list price and availability through the one-API routing catalog — the half of this family that can be routed today.

Werdykt jest nudny w najlepszym znaczeniu: flagowiec jest wart dopłaty dokładnie za pracę, do której jest wyceniony, a koń roboczy wciąż jest właściwym wyborem dla wszystkiego, co po prostu musi zostać zrobione. Sześciokrotna różnica w cenie jest realna, różnica DeepSWE 28–64 jest realna i żadna nie znosi drugiej — wystarczy wiedzieć, który z nich kupujesz.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube