
Preview Tencent Hy4 jest otwarty: model MoE 770B z kontekstem miliona tokenów w cenie ¥6 za milion tokenów wejściowych.
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Tencent Hy4 Preview, wydany i udostępniony jako open source 28 sierpnia 2026 roku, to trzeci flagowy model Tencenta w ciągu sześciu miesięcy — i ten, który przestaje być kamieniem milowym w badaniach, a zaczyna być wydarzeniem cenowym. To model mixture-of-experts z 770 miliardami parametrów — 49 miliardów aktywnych na token — i natywnym oknem kontekstowym miliona tokenów, udostępniony na licencji Apache License 2.0 w formatach BF16 i FP8, do pobrania od dziś z Hugging Face, GitHub, ModelScope i GitCode. Tencent wycenia go na 6 juanów za milion tokenów wejściowych i 18 juanów za milion tokenów wyjściowych, czyli około 0,83 USD i 2,50 USD, co sytuuje topowy model z otwartymi wagami poniżej niemal każdego zamkniętego modelu granicznego na rynku. Jedno wydanie, trzy oblicza: otwarte wagi, które możesz uruchomić samodzielnie, API na TokenHub w Tencent Cloud i te same wagi już działające wewnątrz produktów Tencenta: WorkBuddy, CodeBuddy, Yuanbao i ima. Oto, co faktycznie zostało wydane, co według Tencenta osiąga ten model i czego nikt jeszcze nie zweryfikował.
Historia inżynierii ma większe znaczenie niż liczba parametrów, ponieważ każdy element jest dźwignią kosztów. Model ma 78 warstw: pierwsza to standardowa gęsta sieć feed-forward, a pozostałe 77 to warstwy MoE z 256 routerowanymi ekspertami plus jednym wspólnym ekspertem każda, aktywujące 8 najlepszych routerowanych ekspertów na token. To właśnie mniej więcej 16:1 współczynnik rzadkości sprawia, że serwowanie modelu 770B jest przystępne cenowo — tylko wycinek 49B wykonuje pracę dla danego tokena. Dedykowana warstwa przewidywania wielu tokenów (10B parametrów, 0,7B aktywnych) umożliwia spekulatywne dekodowanie, a moduł uwagi wykorzystuje bramkowaną rzadką uwagę DeepSeek z IndexCache, aby utrzymać w ryzach zużycie pamięci przy długich kontekstach. Rozumowanie można przełączać między trybem długiego myślenia code>high/code> a trybem oszczędzającym tokeny code>no_think/code>. To są szczegóły, które decydują, czy cena z nagłówka przetrwa kontakt z realnym obciążeniem, a nie czy model potrafi napisać haiku.
Arkusz specyfikacji z adnotacjami
Przeczytaj notatki o wydaniu linia po linii, ponieważ każda linia po cichu zmienia to, co wolno robić modelowi o otwartych wagach.
• Parametry — 770B łącznie, 49B aktywnych na token, współczynnik rozrzedzenia ~16:1, który utrzymuje koszt serwowania w zakresie, na który realnie stać mały zespół.
Kontekst — natywne okno 1,048,576 tokenów, czterokrotnie większe niż 256K Hy3. Całe repozytorium, wieloplikowy refaktor, 72-dokumentowy pakiet finansowy — problemy rozwiązywane w pojedynczym żądaniu.
• Licencja — Apache License 2.0 zarówno dla oryginału BF16, jak i wydania skwantyzowanego FP8, co oznacza samodzielne hostowanie, dostrajanie i wykorzystanie komercyjne bez zastrzeżeń własnościowych.
• Stos wnioskowania — Tencent wymienia vLLM i SGLang jako obsługiwane frameworki serwujące, czyli te dwa, na których faktycznie standaryzuje się ekosystem otwartych wag.
• API — endpoint TokenHub Tencent Cloud w cenie 6 ¥ za milion tokenów wejściowych, 18 ¥ za milion tokenów wyjściowych i 0,3 ¥ za milion w przypadku trafień w pamięć podręczną.
• Integracja produktu — te same wagi, które Tencent udostępnia w WorkBuddy, CodeBuddy (wersji krajowej i międzynarodowej), Yuanbao i ima, to te, które możesz pobrać i uruchomić. CodeBuddy otrzymuje dwutygodniowy bezpłatny okres próbny modelu przy premierze.
Tencent podaje również liczbę dotyczącą inżynierii wnioskowania, która rzadko trafia do notatek z premiery: 31,8% poprawę przepustowości end-to-end dzięki fuzji operatorów i optymalizacji komunikacji. To szczegół, który odróżnia model wypuszczany przez laboratorium jako artefakt badawczy od modelu, na który firma spodziewa się ruchu produkcyjnego. Od pierwszego dnia jest to też dokładnie takie twierdzenie, którego nikt poza Tencentem jeszcze nie zmierzył.
Wyniki warte zacytowania
Każdy benchmark opublikowany przez Tencent dla Tencent Hy4 Preview jest raportowany przez dostawcę — przeprowadzony na własnym środowisku oceny Tencent, nieodtworzony przez żadne niezależne laboratorium, a model jest publiczny od niespełna dnia. Traktuj je jako pułap, który według Tencent model osiągnął.

Główną liczbą jest Terminal Bench 2.1, test sprawdzający, jak dobrze model obsługuje prawdziwy terminal podczas kodowania. Tencent raportuje 85,4, co — jak twierdzi — dorównuje Claude Opus 5 i wyprzedza DeepSeek V4 Pro, a także bije własnego poprzednika Hy3 o 14,6 punktu. Ta pojedyncza liczba robi bardzo dużo — to twierdzenie, które stawia model o otwartych wagach na równi z najdroższymi zamkniętymi modelami granicznymi w trudnym teście agentowego kodowania — i to twierdzenie najbardziej potrzebuje niezależnego potwierdzenia. Reszta wewnętrznej tabeli: DeepSWE skacze z 28,0 na Hy3 do 64,3, co Tencent opisuje jako „stopniowe zmniejszanie dystansu” do modeli pierwszej ligi; Toolathlon-Verified, test wywoływania narzędzi, osiąga 74,1; APEX-Agents pass@1 na poziomie 37,1, tuż za Kimi K3 z 37,2; SWE-bench Pro na poziomie 65,7 i SWE-bench Multilingual na poziomie 82,9. W osobnym wewnętrznym teście ślepym 163 ekspertów oceniło 203 zadania inżynieryjne na 2,99 na 4,00, minimalnie wyprzedzając GLM-5.3 z 2,92 i Kimi K3 z 2,94.
Rzucają się w oczy dwa wzorce. Po pierwsze, każdy mocny wynik dotyczy pracy agentowej inżynierii — sterowania terminalem, wywoływania narzędzi, zadań na skalę repozytorium — a żaden nie dotyczy ogólnego czatu czy wiedzy, co jest zgodne z pozycjonowaniem modelu przez Tencent jako „stworzonego do produktywności” w inżynierii oprogramowania, pracy biurowej i analizie danych, tworzeniu gier oraz badaniach naukowych. Po drugie, Tencent ostrożnie opisuje DeepSWE i resztę jako zawężanie, a nie zamykanie luk. Jedynym czystym, nadającym się do sprzedaży twierdzeniem o parytecie jest remis w Terminal Bench 2.1 i to właśnie to twierdzenie warto przetestować na własnym obciążeniu.
Co tak naprawdę kupuje 6 jenów za milion
Ceny to aspekt, w którym premiera przestaje być interesująca, a zaczyna być przełomowa. Przy 18 juanach za milion tokenów wyjściowych — czyli około 2,50 USD — długa sesja agentowego kodowania, która zużywa milion tokenów wyjściowych, kosztuje mniej więcej jedną dziesiątą tego, co ta sama sesja w najlepszym zamkniętym modelu granicznym, a stawka 0,3 juana za trafienie w pamięć podręczną sprawia, że ponownie wysyłane prompty systemowe i prefiksy konwersacji w pętli agentowej są dramatycznie tańsze niż buforowanie u większości konkurentów. Własne demo Tencenta pokazuje, jak model przetwarza 72 dokumenty finansowe w jednym przebiegu; przy takich cenach tego rodzaju paczka to przystępne codzienne zadanie, a nie pozycja w budżecie.
To również miejsce, w którym warstwa routingu zmienia rachunek, i warto być tu precyzyjnym. OrcaRouter nie kieruje jeszcze ruchu do Tencent Hy4 Preview — Tencent nie otworzył jeszcze tego modelu dla zewnętrznych platform inferencyjnych, więc działa on na punkcie końcowym TokenHub w Tencent Cloud oraz na samodzielnie hostowanych wdrożeniach otwartych wag, i nie deklarujemy, że serwujemy coś, czego nie serwujemy. Ale dyscyplina, która sprawia, że obniżka ceny ma znaczenie, jest tą samą, na której opiera się reszta katalogu: OrcaRouter przekazuje ceny katalogowe dostawców dalej bez narzutu, więc gdy dostawca wycenia token na 6 juanów, po naszej stronie płacisz 6 juanów, a nie odsprzedaną i zawyżoną wersję tej ceny — a gdy dostawca zmienia cenę, zmiana pojawia się po naszej stronie tego samego dnia. Jedno API dla ponad 200 modeli, automatyczne przełączanie awaryjne między dostawcami, gdy któryś się zacina, oraz DSL routingu do komponowania modeli w jedno wywołanie: to mechanizm, który obsłuży Tencent Hy4 Preview w momencie, gdy Tencent go otworzy, i to mechanizm, z którego już teraz możesz skorzystać, aby uruchomić nowy, niesprawdzony model obok sprawdzonego, nie stawiając swojej ścieżki produkcyjnej na żadnym z nich.

Twierdzenia, które zasługują na ponowne przeczytanie.
Dwie rzeczy w materiale premierowym dotyczą tego, jak zbudowano model, a nie tego, jaki wynik osiągnął, i zasługują na osobną uwagę.
Pierwszy to pętla samodoskonalenia. Tencent twierdzi, że Tencent Hy4 Preview uczestniczył we własnych badaniach i rozwoju — użyto go do optymalizacji metod treningowych, strategii danych, systemów ewaluacji i niskopoziomowych operatorów, które go wyprodukowały. To początkowy cykl rekurencyjnego samodoskonalenia: model pomagający zaprojektować następną wersję siebie, a Tencent publikujący to jako wdrożoną możliwość. To duże twierdzenie, w całości oparte na własnych doniesieniach.
Drugi to wynik matematyczny. Tencent podaje, że model poprawił znane dolne ograniczenie problemu Blaschkego–Lebesgue’a — od dawna otwartego pytania w geometrii wypukłej dotyczącego ciała o stałej szerokości i minimalnej objętości — z 0,380799 do 0,41104, co sprawia, że brakuje mu około 2% do hipotezy czworościanu Meissnera. Tencent informuje również o 2,0-krotnym przyspieszeniu symulacji dwuwarstwy fosfolipidowej złożonej z 32 512 atomów, do 54,9 milisekundy na krok. Tego rodzaju wyniki zwykle zapewniają modelowi własną publikację; tutaj są one punktami w ogłoszeniu o premierze i, jak wszystko inne pierwszego dnia, są wyłącznie własną relacją Tencenta.
Uczciwe luki
Tencent wymienia znane ograniczenia wprost. Nie ma tu obsługi obrazu ani wejścia multimodalnego — Tencent Hy4 Preview to model tekstowy, i kropka, więc wszystko, co związane z obrazem czy wideo, należy do innego modelu. Tencent wskazuje również na powolny start w złożonych zadaniach — długie myślenie przed pierwszą odpowiedzią — oraz skłonność do nadmiernej samoweryfikacji, spalanie tokenów na podwójne sprawdzanie pracy, którą już wykonał. To połączenie jest dokładnie niewłaściwe do czatu wrażliwego na opóźnienia, a dokładnie do przyjęcia w offline'owych pracach inżynieryjnych w trybie wsadowym, co pokazuje, gdzie według Tencenta należy go uruchamiać.
A najważniejszym brakiem jest weryfikacja. Nie ma jeszcze żadnych niezależnych wyników dla Tencent Hy4 Preview — ani na publicznej liście rankingowej, ani z zewnętrznego laboratorium ewaluacyjnego. Model jest zbyt nowy. Wewnętrzny ślepy test ekspercki jest użytecznym sygnałem na temat tego, jak recenzenci Tencent postrzegają go na tle GLM-5.3 i Kimi K3, ale to recenzenci Tencent oceniający zadania Tencent. Wszystko, co wykracza poza kartę specyfikacji, to twierdzenie czekające na weryfikację.

Jak faktycznie wypróbować to dzisiaj
Praktyczna ścieżka jest krótka. Pobierz wagi z Hugging Face, GitHub, ModelScope lub GitCode i serwuj je za pomocą vLLM lub SGLang; wywołaj API TokenHub od Tencent Cloud, jeśli chcesz mieć hostowany endpoint w cenie katalogowej; albo użyj go w CodeBuddy lub WorkBuddy, gdzie Tencent prowadzi dwutygodniowy bezpłatny okres próbny. Bezpłatny dostęp do modelu Hy3 potrwa do 30 września, a tempo prac Tencenta — mniej więcej jedna główna iteracja co dwa miesiące — wskazuje, że pełne wydanie Hy4 pojawi się wkrótce po wersji zapoznawczej.
Uczciwe podsumowanie: model o otwartych wagach, 770B, z milionowym kontekstem za ¥6 za milion tokenów wejściowych to realna rzecz, która istnieje od dziś, a najsilniejszy benchmark do niego dołączony to twierdzenie dostawcy o remisie z zamkniętym modelem granicznym, którego nikt jeszcze nie potwierdził. Pobierz go, uruchom test, na którym naprawdę ci zależy, i pozwól dowodom rozstrzygnąć, czy cena pozostanie główną historią.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
