Karta tytułowa bohatera dla podglądu Tencent Hy4. Wyśrodkowany tytuł brzmi „Tencent Hy4 Preview — otwarte wagi, vLLM od dnia zero". Linia podtytułu brzmi „770B MoE · 49B aktywnych · kontekst 1M". Cztery chipy specyfikacji brzmią: „Otwarte wagi (Apache 2.0)", „vLLM + SGLang od dnia zero", „Serwowanie na 8 GPU (FP8)", „¥6 / ¥18 za MTok". Linia stopki brzmi „Wydano 28 sierpnia 2026 · Działa w vLLM". Logo OrcaRouter jest skompozytowane w prawym dolnym rogu.
Guides & Insights

Tencent Hy4 Preview działa w vLLM od pierwszego dnia: 770B MoE o otwartych wagach, który możesz faktycznie serwować

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Kiedy Tencent Hy4 Preview zadebiutował 28 sierpnia 2026 roku, zrobił coś, czego większość flagowców klasy frontier unika pierwszego dnia: trafił na rynek w stanie gotowym do uruchomienia. Oprócz otwartych wag, Tencent i zespół vLLM opublikowali gotowy obraz Dockera, oficjalny przepis na serwowanie modelu oraz zintegrowali wsparcie w samym frameworku vLLM, dzięki czemu największy model open-weight, jaki dotąd powstał w linii Hunyuan — 770 miliardów parametrów łącznie, 49 miliardów aktywnych na token — działał za kompatybilnym z OpenAI endpointem na twoich własnych GPU w ciągu kilku godzin od ogłoszenia. Ta historia o dostępności środowiska uruchomieniowego od pierwszego dnia jest tematem tego wpisu, ponieważ „działa w vLLM” nie jest przypisem dla modelu tej wielkości. To różnica między komunikatem prasowym a rzeczą, którą można wdrożyć do produkcji.

Reszta premiery to typowy pakiet w wersji preview, a zastrzeżenia są równie ważne co liczby. Tencent nazywa Tencent Hy4 Preview wczesną iteracją, wskazuje nadmiernie długie rozumowanie i nadmierną samo-weryfikację jako znane zachowania, i publikuje tabelę benchmarków w całości opartą na własnych raportach — żadne niezależne laboratorium jeszcze go nie oceniło, a model ma dwa dni w chwili pisania tego tekstu. Nic z tego nie zmienia praktycznego nagłówka: wagi są na licencji Apache 2.0, okno kontekstu wynosi 1 milion tokenów, a wsparcie vLLM od pierwszego dnia oznacza, że ścieżka samodzielnego hostowania jest realna, a nie tylko aspiracyjna.

Czym tak naprawdę jest Tencent Hy4 Preview

Tencent pozycjonuje Tencent Hy4 Preview jako następcę Hy3 (295B łącznie, kontekst 256K), mniej więcej podwajając aktywną pojemność i zwiększając czterokrotnie okno kontekstu. Architekturę warto przeczytać linijka po linijce, ponieważ każda linia zmienia to, co model o otwartych wagach może robić na Twoim sprzęcie.

• Architektura — Mixture-of-Experts z łączną liczbą 770B parametrów i 49B aktywnych na token w 78 warstwach. Pierwsza warstwa jest gęsta; pozostałe 77 kieruje każdy token przez 256 wyspecjalizowanych ekspertów plus jednego wspólnego eksperta, aktywując 8 najlepszych. Ten współczynnik rzadkości wynoszący mniej więcej 16:1 sprawia, że koszt interferencji pozostaje w zakresie, który poważny zespół jest w stanie faktycznie obsłużyć.

Okno kontekstowe — natywnie 1 048 576 tokenów, jedno z najszerszych spośród wszystkich modeli open-weight. Całe repozytorium, refaktoryzacja wielu plików, partia długich dokumentów: problemy rozwiązywane w pojedynczym żądaniu.

• {{1}}Uwaga — Gated DeepSeek Sparse Attention (Gated DSA) z IndexCache{{/1}}, {{2}}czyli rozwiązanie rzadkiej uwagi, które oblicza nowy rzadki indeks tylko w 21 z 78 warstw i wykorzystuje go ponownie w pozostałych 57{{/2}}. Dlatego serwowanie go to nie tylko {{3}}„większy vLLM" — potrzebuje backendu, który rozumie rzadką uwagę{{/3}}.

• Wbudowane dekodowanie spekulatywne — warstwa MTP (multi-token prediction) o łącznie ok. 10B / 0,7B aktywnych parametrów {{1}}znajduje się wewnątrz modelu{{/1}}, dzięki czemu {{2}}vLLM i SGLang mogą draftować tokeny bez konieczności hostowania osobnego modelu draftującego{{/2}}.

• Wagi — Apache 2.0, w checkpointach zarówno BF16, jak i FP8, opublikowane na Hugging Face, ModelScope, GitCode i CNB.

Co "day-zero vLLM" właściwie oznacza

Wsparcie frameworka scalone w dniu premiery jest konkretnym wydarzeniem stojącym za tym sygnałem — zmiana w vLLM, która dodaje Tencent Hy4 Preview (PR #54160), pojawiła się w tym samym oknie czasowym co wydanie, a oficjalny przepis celuje w vLLM 0.29.0 lub nowszy. W praktyce oznacza to, że ścieżka serwowania to jedna komenda, a nie tydzień debugowania jądra.

docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview

Flagi mają znaczenie, a każda z nich odwzorowuje coś w modelu, zamiast być jedynie ozdobnikiem:

• --attention-backend FLASHMLA_SPARSE — wymagany, nie opcjonalny. Sparse attention Gated DSA w Tencent Hy4 Preview nie działa poprawnie na domyślnych backendach dense, a oficjalny przepis ustawia właśnie ten flag.

• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — włącza wbudowaną warstwę MTP modelu do spekulatywnego dekodowania, z wyprzedzeniem o trzy tokeny. Nie wymaga wdrażania osobnego modelu szkicującego.

• --tool-call-parser hy_v4 i --reasoning-parser hy_v4 — niestandardowe parsery, które informują serwer, w jaki sposób Tencent Hy4 Preview emituje wywołania narzędzi i swój łańcuch myślowy, a --enable-auto-tool-choice pozwala modelowi decydować, kiedy wywoływać narzędzia.

Tencent zaleca temperaturę 0.9 i top_p 1.0 do próbkowania. Rozumowanie domyślnie korzysta z łańcucha myśli o „wysokim” wysiłku, ukierunkowanego na matematykę, kodowanie i złożone zadania; jeśli chcesz uzyskać bezpośrednią odpowiedź bez długiego myślenia, przekaż w żądaniu no_think jako wysiłek rozumowania, zamiast podmieniać wagi.

A screenshot of the official vLLM recipe page for tencent/Hy4-preview (recipes.vllm.ai/tencent/Hy4-preview, captured August 30, 2026). It shows the model spec chips '770B | 49B | 1,048,576 ctx | vLLM 0.29.0+', a note describing the built-in 10B MTP layer for speculative decoding and the hy_v4 tool/reasoning parsers, and the prebuilt docker run command with --tensor-parallel-size 8, --attention-backend FLASHMLA_SPARSE, and the hy_v4 parsers.

Wsparcie dnia zerowego nie ogranicza się tylko do vLLM, co samo w sobie jest godne uwagi w przypadku tak świeżego wydania. SGLang tego samego dnia wypuściło wstępnie zbudowany obraz wieloarchitekturowy (lmsysorg/sglang:hy4-preview) ze spekulatywnym dekodowaniem w stylu NEXTN, a ekosystem Ascend uzyskał wsparcie zerowego dnia dzięki vLLM-Ascend wykorzystującemu skwantowane wagi W8A8 na 16 procesorach NPU Atlas 800I A3. Wydania otwartych wag często zajmują tygodnie, zanim ekosystem serwujący je obsłuży; tym razem zajęło to godziny.

Wyniki warte zacytowania

Każdy benchmark opublikowany przez Tencent dla Tencent Hy4 Preview jest raportowany przez dostawcę — przeprowadzony na własnym środowisku ewaluacyjnym Tencent, nieodtworzony przez żadne niezależne laboratorium, a model jest publiczny od dwóch dni. Traktuj je jako pułap, który według Tencentu osiągnięto, a nie jako ustalony fakt. Niezależna weryfikacja nie nastąpi, dopóki nie uruchomi modelu strona trzecia; nic na publicznych listach rankingowych nie odzwierciedla jeszcze tego modelu.

A single-model scoreboard titled 'Tencent Hy4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (Apache 2.0)', 'Price: ¥6 / ¥18 per MTok (¥0.3 cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 30, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Najważniejszą liczbą jest Terminal Bench 2.1, test sprawdzający, jak dobrze model obsługuje prawdziwy terminal podczas kodowania. Tencent podaje wynik Tencent Hy4 Preview na poziomie 85,4, który — jak twierdzi — dorównuje Claude Opus 5 i przewyższa DeepSeek V4 Pro, a także bije własnego poprzednika Hy3 o 14,6 punktu. Ta jedna liczba dźwiga całą premierę — to twierdzenie stawiające model o otwartych wagach na równi z najdroższymi zamkniętymi modelami granicznymi w trudnym teście agentowego kodowania — i to właśnie ono najbardziej potrzebuje niezależnego potwierdzenia.

Reszta wewnętrznej tabeli, wszystkie własne liczby Tencenta: DeepSWE, benchmark inżynierii oprogramowania, skacze z 28,0 na Hy3 do 64,3. SWE-bench Pro osiąga 65,7, a SWE-bench Multilingual 82,9. W teście wywoływania narzędzi Toolathlon-Verified Tencent podaje 74,1, co według firmy przewyższa Qwen 3.8 Max i GPT-5.6 Sol oraz zbliża się do Kimi K3 i Claude Opus 5. W APEX-Agents pass@1 osiąga 37,1, o włos za Kimi K3, które ma 37,2. A w osobnym wewnętrznym badaniu ślepym 163 ekspertów rekrutowanych przez Tencent oceniło 203 zadania inżynieryjne na 2,99 w skali 4,00, nieznacznie wyprzedzając GLM-5.3 z 2,92 i Kimi K3 z 2,94.

Warto zwrócić uwagę na dwa wzorce. Każdy mocny wynik dotyczy pracy inżynieryjnej agentów – sterowania terminalem, wywoływania narzędzi, zadań na skalę repozytorium – a żaden nie dotyczy ogólnej wiedzy czy rozumowania, co pasuje do pozycjonowania produktywności, a nie jest przypadkiem. A Tencent opisuje DeepSWE i pozostałe jako zawężanie, a nie zamykanie luk; jedynym czystym, nadającym się do marketingu twierdzeniem o parytecie jest remis w Terminal Bench 2.1 i to właśnie to twierdzenie warto przetestować na własnych zadaniach.

Ile to faktycznie kosztuje

Uczciwie rzecz biorąc, matematyka self-hostingu jest pierwszą rzeczą, którą trzeba sobie powiedzieć. To nie jest model na pojedynczym GPU ani model desktopowy. Punkt kontrolny FP8 to blisko terabajt wag, a oficjalny przepis zakłada równoległość tensorową na poziomie 8 — osiem GPU o wysokim pasmie przepustowości z szybkimi połączeniami międzyprocesorowymi (referencyjny sprzęt Tencent dla FP8 to 8×B300, a pełny BF16 wymaga 16×B200). Jeśli nie dysponujesz taką infrastrukturą, nie będziesz go hostować tanio, a backend z rzadką uwagą oznacza, że nie ma żadnego skrótu omijającego pamięć na pamięć podręczną KV przy kontekście 1 miliona tokenów.

Jeden dodatek z tygodnia premiery zmienia część tych wyliczeń dla zespołów, które chcą otwartych wag bez flagowego rozmiaru. Zespół Hy z Tencent wypuścił skompresowaną kompilację GGUF modelu Tencent Hy4 Preview, zmniejszając wydanie BF16 o rozmiarze ~1,5 TB do około 200 GiB dzięki per-warstwowemu schematowi mieszanej kwantyzacji, który nazywa MIX-STQ1_0 — masowe tensory eksperckie spadają do około 1,3 bita, podczas gdy warstwy krytyczne dla strumienia rezydualnego zachowują wyższą precyzję. We własnych ewaluacjach Tencent zmiany dokładności są niewielkie — SWE-bench Multilingual 82.9 do 81.3, MCP Atlas 83.7 do 83.2, IFBench 73.5 do 72.5 — kompromis, który producent określa jako niemal bezstratny. To liczby Tencenta na konfiguracji Tencenta, jak dotąd nieodtworzone. Model o rozmiarze 200 GiB wciąż nie jest modelem na pojedynczy GPU, ale to znacznie mniejszy zakład niż checkpoint FP8 o rozmiarze blisko terabajta i sprawia, że ścieżka otwartych wag staje się osiągalna dla mniejszego węzła z wieloma GPU, niż zakłada przepis z ośmioma B300.

Ścieżka API to miejsce, w którym cena staje się naprawdę interesująca. W TokenHub Tencent Cloud, Tencent Hy4 Preview kosztuje 6 juanów (~0,83 USD) za milion tokenów wejściowych, 18 juanów (~2,50 USD) za milion tokenów wyjściowych i 0,3 juana (~0,04 USD) za milion tokenów przy trafieniach w pamięć podręczną. Cena wyjścia wynosząca około 2,50 USD za milion jest znacznie niższa niż 25 USD za milion, jakie pobiera czołowy zamknięty model graniczny, a niska stawka za trafienia w pamięć podręczną sprawia, że długie pętle agentowe — w których ten sam prompt systemowy i prefiksy rozmów są stale wysyłane ponownie — są niezwykle przystępne cenowo.

Tencent oferuje również dwutygodniowy darmowy dostęp do Tencent Hy4 Preview w WorkBuddy i CodeBuddy, dopóki model jest nowy, więc najtańszy sposób, by wypróbować go w tym tygodniu, to darmowy — a właśnie w WorkBuddy pozycjonowanie pod kątem produktywności nabiera konkretów. W każdej rozmowie w WorkBuddy selektor modelu przełącza się między Hy3 a Hy4 Preview, więc podział na pracę biurowo-produktywną i analityczną z jednej strony oraz kodowanie z drugiej to wybór na poziomie zadania, a nie decyzja wdrożeniowa. Ten podział jest zgodny z zamysłem Tencenta co do tego modelu, a praktyczne testy w WorkBuddy pokazują, że tworzy on złożone artefakty za jednym podejściem — grywalny prototyp gry low-poly z pojedynczego promptu, pełny kwartalny przegląd biznesowy złożony z dziesięciu załączników bez żadnych ręcznych interwencji oraz, w testerowym demo, które krążyło w tym tygodniu, symulację czarnej dziury. To obserwacje społeczności na temat własnej aplikacji Tencenta, a nie benchmarki dostawcy — ale to pierwsze praktyczne sygnały tego, co model robi w realnych, wieloetapowych zadaniach, i można je za darmo odtworzyć, zanim cokolwiek wydasz.

Decyzja kosztowa to dokładnie ten moment, w którym warstwa routingu zmienia rachunek ekonomiczny, i będziemy uczciwi, jeśli chodzi o naszą w tym rolę: OrcaRouter nie kieruje jeszcze ruchu do Tencent Hy4 Preview, ponieważ Tencent nie udostępnił tego modelu platformom inferencji stron trzecich — działa on na własnym punkcie końcowym TokenHub w Tencent Cloud oraz w samodzielnie hostowanych wdrożeniach otwartych wag, a my nie twierdzimy, że udostępniamy to, czego nie udostępniamy. To, co wnosi warstwa routingu, to ramy decyzyjne wokół tego. Jeśli wybierasz między węzłem 8-GPU a API, ta sama zasada przekazywania cen bez narzutów, na której opiera się reszta katalogu, zacznie obowiązywać w dniu, w którym Tencent to otworzy: OrcaRouter przekazuje ceny katalogowe dostawcy z zerową marżą, więc obniżka cen od dostawcy jest u nas aktywna tego samego dnia, zamiast być odsprzedawana z narzutem. A dla modelu, który ma zaledwie dwa dni i którego jedynym dowodem są benchmarki dostawcy, automatyczne przełączanie awaryjne to bezpieczny sposób na jego przetestowanie — umieść sprawdzony model na swojej ścieżce krytycznej, a Tencent Hy4 Preview obok niego, włączając go w zadaniach, w których jego profil kosztowy wygrywa, i przełączając się z powrotem, gdy tylko przestaje wygrywać, wszystko przez jedno API i jeden klucz.

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent Hy4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

Granice, które nie mieszczą się na karcie specyfikacji

Tencent wprost wymienia znane ograniczenia i powinny one kształtować każdą decyzję o wdrożeniu. Tencent Hy4 Preview to model tekstowy i koniec kropka — bez obsługi obrazu ani wejścia multimodalnego — więc wszystko, co dotyczy obrazów czy wideo, należy kierować do innego modelu. Tencent wskazuje również wolny start przy złożonych zadaniach (długie myślenie przed pierwszą odpowiedzią) oraz skłonność do nadmiernej samoweryfikacji, spalając tokeny na wielokrotne sprawdzanie pracy, którą już wykonał. To połączenie jest dokładnie niewłaściwe dla czatów wrażliwych na opóźnienia i dokładnie do zaakceptowania dla offline'owej pracy inżynierskiej w trybie wsadowym, co mówi wprost, gdzie Tencent spodziewa się, że go uruchomisz.

Dwa stwierdzenia w materiale premierowym zasługują na odrębną uwagę, ponieważ dotyczą sposobu, w jaki model został zbudowany, a nie jego wyników. Tencent twierdzi, że Tencent Hy4 Preview uczestniczył we własnym rozwoju — pomagał optymalizować metody treningu, strategię danych, frameworki ewaluacyjne i operatory niskiego poziomu, które go stworzyły, tworząc wczesną pętlę samodoskonalenia rekurencyjnego — oraz że autonomicznie zoptymalizował swój system inferencji, uzyskując 31,8% wzrostu przepustowości end-to-end w porównaniu z bazą. Po stronie naukowej Tencent informuje, że przesunął znaną dolną granicę problemu Blaschkego–Lebesgue’a w geometrii wypukłej z 0,380799 na 0,41104, oraz osiągnął 2,0-krotne przyspieszenie symulacji dwuwarstwy fosfolipidowej złożonej z 32 512 atomów, skracając czas do 54,9 milisekundy na krok. Jak wszystko inne pierwszego dnia, są to wyłącznie własne doniesienia Tencenta.

A najważniejszym brakiem jest weryfikacja. Dla Tencent Hy4 Preview nie ma jeszcze żadnych niezależnych wyników — ani na publicznej liście rankingowej, ani z zewnętrznego laboratorium ewaluacyjnego, ani wpisu w Artificial Analysis. Model jest na to zbyt nowy. Wewnętrzny ślepy test ekspertów to użyteczny sygnał, jak recenzenci samego Tencent postrzegają go na tle GLM-5.3 i Kimi K3, ale to recenzenci Tencent i zadania Tencent. Wszystko, co wykracza poza kartę specyfikacji, to twierdzenie czekające na sprawdzenie.

Kto powinien uruchomić Tencent Hy4 Preview w tym tygodniu

Szczera odpowiedź w tym tygodniu dzieli się na trzy grupy, a jedna z nich nie potrzebuje żadnego sprzętu. Jeśli chcesz po prostu poczuć, co potrafi Tencent Hy4 Preview, darmowy dostęp do WorkBuddy to najszybsza ścieżka — bez GPU, bez klucza API, otwórz rozmowę, przełącz selektor modelu na Hy4 preview i przekaż mu zadanie Work lub Coding. Jeśli masz GPU i uruchamiasz obciążenia inżynieryjne wsadowo — długookresowe zadania agentowe, analizę na skalę repozytorium, ewaluację offline — model jest wart poważnego przetestowania już teraz: wagi są otwarte, okno kontekstowe ma skalę repozytorium, ścieżka vLLM to pojedyncze polecenie, a wersja GGUF z tygodnia premiery obniża próg sprzętowy dla próbnego uruchomienia. Jeśli prowadzisz czat produkcyjny wrażliwy na opóźnienia, cokolwiek multimodalnego lub cokolwiek, gdzie nie możesz sobie pozwolić na model, którego jedynym dowodem są własne benchmarki dostawcy — poczekaj: Tencent wprowadzał iteracje mniej więcej co dwa miesiące od lutego i już zapowiedział, że nadchodzi kolejna partia modeli Hy4, więc preview jest wyraźnie wczesną iteracją.

Dla wszystkich pozostałych użyteczne podejście to wzorzec routingu: sprawdź go obok modelu, któremu już ufasz, przy koszcie, od którego możesz odejść, i skaluj go tylko tam, gdzie jego wyniki trzymają się przy twoim własnym obciążeniu. Właśnie do tego służy router — w dniu, w którym Tencent udostępni ten model do inferencji stronom trzecim, dołączy on do katalogu z jednym API, ponad 200 modeli i cenami wprost z cennika, jak każdy inny, a narzędzia do failoveru i kompozycji będą już gotowe. Do tego czasu wagi są na Hugging Face, API na Tencent Cloud, a bezpłatny okres próbny w WorkBuddy — a twierdzenie, że model o otwartych wagach osiągnął najwyższy poziom w kodowaniu agentowym, w końcu ma przypisaną konkretną liczbę. Liczba należy do Tencenta. Test należy do ciebie.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube