
Tencent HY4 Preview jest open-source: 770B MoE, 1M kontekstu i cena, która przebija czołówkę
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0259Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0166Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
Tencent HY4 Preview, wydany i udostępniony jako open-source 28 sierpnia 2026 roku, to pierwszy od miesięcy naprawdę konkurencyjny flagowy model open-weight z chińskiego laboratorium, a jego najbardziej zaskakującą liczbą jest cena. Tencent wycenia go na 6 juanów (~0,85 USD) za milion tokenów wejściowych i 18 juanów (~2,50 USD) za milion tokenów wyjściowych — czyli mniej więcej jedną dziesiątą tego, co za wyjście pobiera najlepszy zamknięty model frontier — publikując jednocześnie model mixture-of-experts o 770 miliardach parametrów, z których 49 miliardów jest aktywnych na token, z oknem kontekstowym przekraczającym milion tokenów. To następca Hy3 z rodziny Hunyuan (295B łącznie, kontekst 256K), który czterokrotnie zwiększa ten kontekst, jednocześnie ponad dwukrotnie zwiększając aktywną pojemność. Wagi można dziś pobrać z Hugging Face, GitHub, ModelScope i GitCode, a ten sam model działa już w produktach Tencent: WorkBuddy, CodeBuddy w wersjach krajowych i międzynarodowych, asystencie Yuanbao oraz aplikacji ima workspace. Dla każdego, kto przyglądał się, jak modele open-weight nie dorównują modelom frontier w zadaniach z inżynierii oprogramowania, to wydanie wreszcie sprawia, że ta luka jest dyskusyjna — a zastrzeżenia są równie ważne jak liczby.
To pozycjonowanie jest zamierzone. Tencent przedstawia Tencent HY4 Preview jako model produktywności dla czterech obszarów: inżynierii oprogramowania, pracy biurowej i analizy danych, tworzenia gier oraz badań naukowych. Nacisk na inżynierię odróżnia go od ogólnych modeli — notatki z wydania na pierwszym planie stawiają rozumienie długoterminowych zadań, planowanie i debugowanie, a nie jakość czatu. To skupienie widać zarówno na liście integracji, jak i w tabeli benchmarków: CodeBuddy otrzymuje model w swoim IDE, WorkBuddy wdraża go w przepływach pracy biurowej (Tencent pokazuje, jak model przetwarza 72 dokumenty finansowe za jednym razem), a deweloperzy gier dostają hooki MCP do Unreal Engine 5 i Unity, które zamieniają pojedyncze zdanie w grywalne demo.
Co faktycznie zostało wydane
Specyfikacja jest warta przeczytania linijka po linijce, bo każda linia zmienia to, co wolno robić modelowi o otwartych wagach.
• Architektura — Mixture-of-Experts z łączną liczbą 770B parametrów i 49B aktywnych na token, współczynnik rzadkości około 16:1, który utrzymuje koszt wnioskowania w zakresie, na który naprawdę może sobie pozwolić mały zespół.
• Okno kontekstu — ponad milion tokenów, czterokrotnie więcej niż 256K Hy3. Długoterminowe zadania inżynieryjne — całe repozytorium w oknie, refaktoryzacja wielu plików, duża partia dokumentów — stają się problemami, które można rozwiązać w jednym zapytaniu.
• Wagi — otwarte udostępnienie na licencji MIT na Hugging Face, GitHub, ModelScope i GitCode. To model do pobrania i samodzielnego hostowania, a nie hostowana zapowiedź.
• API — dostępne w usłudze TokenHub chmury Tencent Cloud, czyli we własnym hostowanym punkcie końcowym dostawcy, w cenie 6 juanów za milion tokenów wejściowych, 18 juanów za milion tokenów wyjściowych i 0,3 juana za milion tokenów przy trafieniach w pamięć podręczną.
• Integracja produktu — WorkBuddy, CodeBuddy (wersje krajowa i międzynarodowa), Yuanbao i ima, co oznacza, że możesz pobrać i uruchomić te same wagi, które Tencent udostępnia we własnych aplikacjach.
Tencent podaje również wskaźnik inżynierii wnioskowania, który rzadko pojawia się w notatkach premierowych: 31,8% poprawę przepustowości end-to-end dzięki fuzji operatorów i optymalizacji komunikacji. To, co czyni to czymś więcej niż przypisem w specyfikacji, to fakt, że Tencent twierdzi, iż Tencent HY4 Preview sam znalazł wąskie gardła — model przeanalizował własny stos wnioskowania, a optymalizacje są podobno stabilne w różnych długościach kontekstu i poziomach współbieżności. To szczegół, który odróżnia model wysyłany przez laboratorium jako artefakt badawczy od modelu, na który firma liczy, że spadnie na niego ruch produkcyjny. W przypadku wersji zapoznawczej, która jest publiczna zaledwie od kilku dni, jest to też dokładnie tego rodzaju twierdzenie, którego nikt poza Tencentem jeszcze nie zweryfikował.
Wyniki warte zacytowania
Każdy benchmark opublikowany przez Tencent dla Tencent HY4 Preview pochodzi od samego dostawcy — przeprowadzono go we własnym środowisku ewaluacyjnym Tencent, nie został powtórzony przez żadne niezależne laboratorium, a model jest publiczny dopiero od kilku dni. Należy traktować je jako sufit, który według Tencent udało się osiągnąć, a nie jako potwierdzony fakt.

Główna liczba to Terminal Bench 2.1, test sprawdzający, jak dobrze model obsługuje prawdziwy terminal podczas kodowania. Tencent podaje, że Tencent HY4 Preview osiąga 85,4, co według firmy dorównuje Claude Opus 5 i przewyższa DeepSeek V4 Pro, a także bije własnego poprzednika Hy3 o 14,6 punktu. Ta pojedyncza liczba robi dużo pracy — to twierdzenie, które stawia model o otwartych wagach na równi z najdroższymi zamkniętymi modelami granicznymi w trudnym teście agentowego kodowania — i to twierdzenie najbardziej potrzebuje niezależnego potwierdzenia.
Reszta wewnętrznej tabeli: DeepSWE, benchmark inżynierii oprogramowania, skacze z 28,0 na Hy3 do 64,3, co Tencent określa jako „stopniowe zawężanie luki” w stosunku do modeli pierwszej ligi. W teście Toolathlon-Verified, teście wywoływania narzędzi, uzyskuje 74,1, co według Tencent przewyższa Qwen 3.8 Max i GPT-5.6 Sol oraz zbliża się do Kimi K3 i Claude Opus 5. W APEX-Agents pass@1 osiąga 37,1, o włos za Kimi K3 (37,2). A w osobnym wewnętrznym teście ślepym 163 ekspertów oceniło 203 zadania inżynieryjne, przyznając im średnio 2,99 na 4,00, minimalnie wyprzedzając GLM-5.3 (2,92) i Kimi K3 (2,94).
Widać dwa wzorce. Po pierwsze, każda mocna liczba dotyczy pracy inżynierskiej opartej na agentach — sterowania terminalem, wywoływania narzędzi, zadań na skalę repozytorium — a żadna nie dotyczy ogólnej wiedzy czy rozumowania, co jest spójne z pozycjonowaniem pod kątem produktywności, a nie przypadkiem. Po drugie, Tencent ostrożnie opisuje DeepSWE i inne jako zawężanie, a nie zamykanie luk. Jedynym czystym, nadającym się do marketingu stwierdzeniem parytetu jest remis w Terminal Bench 2.1 i to właśnie to stwierdzenie warto sprawdzić na własnym obciążeniu.
Co tak naprawdę kupujesz za tę cenę
Ceny to miejsce, w którym wydanie przestaje być interesujące, a zaczyna być przełomowe. Przy cenniku Tencent, milion tokenów wejściowych kosztuje mniej więcej tyle, ile pojedyncze wywołanie API średniej klasy na niektórych platformach. Kwota 18 juanów za milion tokenów wyjściowych (około 2,50 USD) plasuje się znacznie poniżej ceny 25 dolarów za milion tokenów wyjściowych w czołowym zamkniętym modelu granicznym, a stawka 0,3 juana za trafienie w pamięci podręcznej sprawia, że długie pętle agentowe — w których ten sam prompt systemowy i prefiksy konwersacji są stale wysyłane ponownie — są wyjątkowo tanie w uruchomieniu.
To także jedyne miejsce, w którym warstwa routingu zmienia rachunek. OrcaRouter nie kieruje jeszcze ruchu do Tencent HY4 Preview — Tencent nie udostępnił tego modelu zewnętrznym platformom wnioskowania, więc działa on na własnym endpoincie TokenHub w Tencent Cloud oraz na samodzielnie hostowanych wdrożeniach otwartych wag, a my nie twierdzimy, że obsługujemy coś, czego nie obsługujemy. Ale dyscyplina, która sprawia, że obniżka ceny ma znaczenie, jest tą samą, na której opiera się reszta katalogu: OrcaRouter przekazuje ceny katalogowe dostawców z zerowym narzutem, więc gdy dostawca taki jak Tencent wycenia token na 6 juanów, po naszej stronie płacisz 6 juanów, a nie odsprzedaną wersję tej ceny z narzutem. A gdy dostawca zmieni cenę, zmiana po naszej stronie obowiązuje tego samego dnia. Jedno API dla ponad 200 modeli, automatyczne przełączanie awaryjne między dostawcami, gdy któryś szwankuje, oraz DSL routingu do komponowania modeli — to mechanizm, który obsłuży Tencent HY4 Preview w momencie, gdy będzie można go trasować, obok innych otwartych i zamkniętych modeli już obecnych w katalogu.

Części, które nie mieszczą się na karcie specyfikacji.
Dwa twierdzenia w materiałach premierowych zasługują na osobną uwagę, ponieważ dotyczą one tego, jak zbudowano model, a nie tego, jakie uzyskał wyniki.
Pierwsza to pętla samodoskonalenia. Tencent twierdzi, że Tencent HY4 Preview brał udział we własnych pracach badawczo-rozwojowych – wykorzystano go do optymalizacji metod treningowych, strategii danych, systemów ewaluacji oraz operatorów bazowych, które go wyprodukowały. 31,8% wzrostu przepustowości to najbardziej konkretny publiczny efekt tej pętli: Tencent przypisuje go wąskim gardłom, które model sam zidentyfikował w swoim stosie serwującym. To początkowy rekurencyjny cykl samowzmacniania: model pomagający zaprojektować kolejną wersję siebie. Nie jest niczym niezwykłym, że laboratorium z czołówki raportuje fragmenty takiego procesu, ale chiński model o otwartych wagach, który publicznie opisuje tę pętlę jako wdrożoną funkcję, stanowi zmianę jakościową w sposobie, w jaki takie premiery mówią o sobie.
Drugi to wynik matematyczny. Tencent podaje, że model przesunął znaną dolną granicę objętości w zagadnieniu Blaschkego–Lebesgue'a — od dawna otwartym problemie geometrii wypukłej dotyczącym bryły o stałej szerokości i minimalnej objętości — z 0,380799 do 0,41104, co sytuuje ją w odległości około 2% od granicy przewidywanej przez hipotezę czworościanu Meissnera. Tencent raportuje także 2,0-krotne przyspieszenie symulacji dwuwarstwy fosfolipidowej złożonej z 32 512 atomów, do 54,9 milisekundy na krok, w ścieżce badań naukowych. To wyniki, które zwykle zapewniają modelowi osobną publikację; tutaj są punktami w materiałach z premiery i, jak cała reszta tych materiałów, stanowią wyłącznie deklarację Tencenta.
Czego brakuje, szczerze mówiąc
Tencent wprost wymienia znane ograniczenia i mają one znaczenie dla każdego, kto decyduje, co zbudować na tym modelu. Nie ma tu wejścia wizyjnego ani multimodalnego — Tencent HY4 Preview to model tekstowy, kropka, więc wszystko, co dotyczy obrazów lub wideo, należy do innego modelu. Tencent zaznacza też, że model wykazuje powolny start przy złożonych zadaniach — długie myślenie przed pierwszym wynikiem — oraz skłonność do nadmiernej samoweryfikacji, spalając tokeny na ponowne sprawdzanie pracy, którą już wykonał. To połączenie jest dokładnie tym, czego nie potrzeba do czatu wrażliwego na opóźnienia, a dokładnie do zniesienia w offline'owych wsadowych pracach inżynieryjnych, co pokazuje, gdzie Tencent spodziewa się, że będziesz go uruchamiać.
A najważniejszym brakiem jest weryfikacja. Nie ma jeszcze żadnych niezależnych wyników dla Tencent HY4 Preview — ani na publicznej liście liderów, ani z zewnętrznego laboratorium ewaluacyjnego, ani nawet wpisu w Artificial Analysis. Model jest na to zbyt nowy. Wewnętrzny test ślepy przeprowadzony przez ekspertów to użyteczny sygnał tego, jak recenzenci Tencent postrzegają model na tle GLM-5.3 i Kimi K3, ale to recenzenci Tencent oceniający zadania Tencent. Wszystko, co wykracza poza arkusz specyfikacji, jest twierdzeniem oczekującym na sprawdzenie.

Kto powinien dziś podnosić ciężary
Uczciwa odpowiedź brzmi: to wydanie wyraźnie dzieli odbiorców na dwie grupy. Jeśli uruchamiasz obciążenia inżynierskie na własnej infrastrukturze i to ekonomika zamkniętych API cię powstrzymywała, Tencent HY4 Preview jest wart poważnego przetestowania już w ten weekend: wagi są otwarte, okno kontekstowe ma skalę repozytorium, a cena katalogowa sprawia, że długa pętla agentowa jest przystępna w sposób, w jaki nigdy nie będzie model kosztujący 25 dolarów za milion tokenów wyjściowych. Jeśli natomiast prowadzisz czat produkcyjny wrażliwy na opóźnienia, coś multimodalnego albo coś, gdzie nie możesz sobie pozwolić na model, którego jedynym dowodem są benchmarki własnego dostawcy — poczekaj: dwumiesięczny cykl iteracji, który Tencent utrzymuje od lutego, sugeruje, że pełne wydanie Hy4 jest niedaleko, a preview jest wprost wczesną iteracją ze znanymi mankamentami.
Praktyczny złoty środek to wzorzec routingu: {{1}}uruchom sprawdzony model na swojej krytycznej ścieżce, a nowy obok niego, podmieniając na Tencent HY4 Preview w zadaniach, w których jego profil kosztowy wygrywa, i automatycznie wracając do sprawdzonego, gdy nie wygrywa{{/1}}. {{2}}To jest wzorzec, do którego służy router — ten sam OrcaRouter, który obsługuje Claude Opus 5, DeepSeek V4 Pro i Gemini 3.1 Pro w cenach katalogowych ich dostawców, będzie obsługiwał ten model z chwilą, gdy Tencent go udostępni{{/2}}. Do tego czasu wagi są na GitHubie, API na Tencent Cloud, a twierdzenie, że model o otwartych wagach osiągnął najwyższą półkę w kodowaniu agentowym, wreszcie ma przypisaną konkretną liczbę. Ta liczba należy do Tencent. Test należy do Ciebie.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
