
Tencent HY4 Preview vs Qwen3.8-Max: Sierpniowy pojedynek modeli open-weight
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Tencent HY4 Preview kontra Qwen3.8-Max to starcie, ku któremu zmierzał ten miesiąc. Qwen3.8-Max od Alibaby wszedł w powszechną dostępność 3 sierpnia, a 12 sierpnia stał się pierwszym Qwenem klasy Max z otwartymi wagami; Tencent HY4 Preview zadebiutował dziś rano, 25 dni później, z kartą premiery, która bezpośrednio wskazuje Qwen3.8-Max — Tencent podaje wynik 74,1 dla HY4 Preview w Toolathlon-Verified, wyprzedzając Qwen3.8-Max w tym benchmarku. Oba to chińskie flagowce z otwartymi wagami, oba atrakcyjnie wycenione, a tylko jeden z nich ma niezależne wyniki.
Te dwa modele dzieli coś więcej niż skala — Qwen3.8-Max ma 2,4 biliona parametrów wobec 770 miliardów HY4 Preview — ale w benchmarkach agentowych, które liczą się dla kupującego, celują w ten sam punkt: pracę o długim horyzoncie, w której model czyta, wywołuje narzędzia i iteruje bez udziału człowieka w pętli. To dokładnie ten obszar, w którym sierpniowa generacja modeli open-weight próbuje udowodnić, że może zastąpić zamknięte modele graniczne, a pierwszym ruchem Tencenta był strzał w największą otwartą premierę tego miesiąca.
Tablica wyników

• Skala — HY4 Preview 770B łącznie / 49B aktywnych vs Qwen3.8-Max 2.4T łącznie / ~95B aktywnych
• Kontekst — HY4 Preview >1M tokenów vs Qwen3.8-Max 1M tokenów w API (262K natywnie w otwartych wagach, rozszerzalne do ~1.01M)
• Cena za 1M — HY4 Preview ¥6 za wejście / ¥18 za wyjście (ok. $0,85 / $2,50) vs Qwen3.8-Max $2,00 za wejście / $6,00 za wyjście, odczyty z cache $0,25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (raportowane przez producenta) vs Qwen3.8-Max 86.6
• Modalność — obie wersje open-weight są wyłącznie tekstowe; API Qwen3.8-Max dodaje obsługę obrazu i wideo, podczas gdy wersja podglądowa HY4 Preview nie.
{{1}}Niezależny wynik{{/1}} — {{2}}HY4 Preview brak vs Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58{{/2}}
{{1}}Te dwie karty opowiadają tę samą historię z przeciwnych stron. W Terminal-Bench 2.1 wyniki Qwen3.8-Max (86.6) i HY4 Preview (85.4) dzieli półtora punktu — jeden punkt na korzyść Qwen, a wynik HY4 nie jest audytowany.{{/1}} {{2}}Jeśli chodzi o cenę, HY4 Preview jest tańszy zarówno pod względem ceny za token wejściowy, jak i wyjściowy. Jeśli chodzi o weryfikację, Qwen3.8-Max ma niezależny Intelligence Index na poziomie 58 i Agentic Index na poziomie 58; HY4 Preview nie ma nic poza własnymi materiałami prasowymi.{{/2}} Ta rozpiętość to klasyczny wzorzec pretendenta, który pojawia się z lepszymi cenami i niepotwierdzonymi twierdzeniami przeciwko zweryfikowanemu liderowi.
Czytanie oświadczenia Toolathlon
{{1}}Toolathlon-Verified{{/1}} mierzy {{2}}niezawodność agentowego korzystania z narzędzi{{/2}} — {{3}}jak konsekwentnie model prowadzi narzędzie przez całe zadanie z błędami, odzyskiwaniem i wywołaniami wieloetapowymi{{/3}}. {{4}}Wynik 74.1 firmy Tencent{{/4}} {{5}}celuje bezpośrednio w najmocniejszą część{{/5}} {{6}}profilu Qwen3.8-Max{{/6}}, {{7}}ponieważ Agentic Index Qwen wynoszący 58{{/7}} oraz {{8}}jej OSWorld-Verified 86.1{{/8}} {{9}}to liczby, które uczyniły agentową narrację Alibaby wiarygodną{{/9}}. {{10}}Qwen3.8-Max notuje również 82.8 w IFBench (podążanie za instrukcjami) i 93.0 w PaperBench (badawcza praca agentowa){{/10}}, {{11}}przewyższając modele takie jak GPT-5.6 Sol{{/11}} {{12}}na własnych tabelach sprzedawcy{{/12}}. {{13}}Tencent wybrał więc jedyny benchmark{{/13}}, {{14}}w którym twierdzi, że ma bezpośrednią przewagę{{/14}} {{15}}nad największym otwartym modelem miesiąca{{/15}} — {{16}}a twierdzenie to jest obecnie tak samo weryfikowalne, jak każdy inny pojedynczy wiersz sprzedawcy: wcale.{{/16}}
Zweryfikowane vs zgłoszone przez dostawcę
To jest oś, na której to zestawienie jest najmniej uczciwe, a o tej asymetrii warto mówić wprost. Wskaźnik inteligencji Qwen3.8-Max wynoszący 58 pochodzi z Artificial Analysis, podobnie jak jego wskaźnik agentowy 58, a te same niezależne procedury testowe, które przyznały mu te oceny, zmierzyły też jego słabości: 40% wskaźnik halucynacji w AA-Omniscience, w porównaniu z 23% w poprzedniej generacji, oraz ogromne 64 kroki agentowe na zadanie — model ciężko pracuje, a za każdy krok płacisz. Tencent HY4 Preview nie ma żadnego z tych narzędzi pomiarowych. Jego mocne strony to deklaracje, a jego tryby awarii — sam Tencent wskazuje na długie myślenie i nadmierną samoweryfikację — są przyznaniem się, a nie pomiarem.
Dla zespołu wybierającego między tymi dwoma rozwiązaniami luka weryfikacyjna nie jest abstrakcją. Zachowanie Qwen3.8-Max — 64 tury na zadanie — to realny, zmierzony czynnik kosztów: przy $2/$6 wciąż jest najdroższym agentem na ukończone zadanie w niektórych porównaniach zewnętrznych, a zespoły donoszą, że liczba tur niweluje jego przewagę cenową. Analogiczne zachowanie HY4 Preview jest nieznane — może być tańszy na zadanie, niż sugerowałaby jego już niska cena za token, albo jego nawyk samoweryfikacji może pochłonąć tę różnicę. Nikt jeszcze nie może powiedzieć, który z tych scenariuszy jest prawdziwy, ponieważ nikt poza Tencentem go nie uruchomił.
Cena i kwestie praktyczne otwartych wag
W przeliczeniu na token HY4 Preview jest tańszy po obu stronach rozliczenia: ¥6/¥18 wobec $2,00/$6,00 w Qwen3.8-Max i ¥0,3 za trafienia w cache wobec $0,25. To czyni HY4 Preview najtańszym flagowym modelem o otwartych wagach zarówno na wejściu, jak i wyjściu — kropka. Ale określenie „open weights” niesie ze sobą dwa różne zestawy drobnego druku. Wydanie Qwen3.8-Max z otwartymi wagami — Qwen3.8-2.4T-A95B — jest wyłącznie tekstowe, z wymuszonym trybem myślenia, natywnym kontekstem 262K zamiast 1M oferowanego przez API, a także z niestandardową licencją z warunkami zależnymi od skali: wymogiem wyświetlania nazwy modelu powyżej 100 mln użytkowników miesięcznie i osobną licencją dla dużych firm Model-as-a-Service. Wagi Tencent HY4 Preview są dostępne na HuggingFace, ModelScope i GitHub od dziś rana, ale dokładne warunki licencji oraz to, czy wagi są zgodne z wersją udostępnianą przez API, nie zostały określone z podobną jasnością. Oba modele są do pobrania; żaden nie jest jednak trywialnym wdrożeniem typu drop-in.
Najważniejsze
Qwen3.8-Max to bezpieczniejszy wybór pod każdym względem, w jakim weryfikacja zapewnia bezpieczeństwo: niezależnie oceniany pod kątem inteligencji i pracy agentowej, znane tryby awarii, ustalona licencja i trzy tygodnie informacji zwrotnych z produkcji. Jest to również droższy wybór w przeliczeniu na token, a jego zmierzone zachowanie, cechujące się dużą liczbą tur, stanowi znane ryzyko kosztowe. Tencent HY4 Preview to opłacalny zakład: tańszy zarówno na wejściu, jak i na wyjściu, z porównywalną deklaracją Terminal-Bench i bezpośrednią deklaracją Toolathlon-Verified względem Qwen — wszystko to niezweryfikowane od pierwszego dnia. Jeśli w tym tygodniu wdrażasz model o otwartych wagach do produkcji, Qwen3.8-Max to wybór, który można obronić, i jest dostępny na OrcaRouter po cenie katalogowej Alibaby — $2.00/$6.00, przekazywanej dalej bez narzutu. HY4 Preview to projekt ewaluacyjny: uruchom go przez własne API Tencent na własnych zadaniach w stylu Toolathlon, utrzymaj ścieżkę produkcyjną na zweryfikowanym modelu, a gdy pojawią się niezależne wyniki — lub gdy HY4 Preview trafi do rutera, a jego stawka ¥6/¥18 będzie tego samego dnia przekazywana dalej bez narzutu — ta zamiana to reguła routingu, a nie przepisanie.


Co obejrzeć
• Pierwsze niezależne uruchomienie HY4 Preview na uprzęży agentowej. Toolathlon-Verified 74.1 to wynik, który Tencent chce osiągnąć; niezależny Agentic Index byłby potwierdzeniem.
• Zmierzona liczba tur HY4 Preview. 64 tury na zadanie w przypadku Qwen3.8-Max to przestroga; to, czy HY4 Preview jest tańszy za ukończone zadanie, stanowi cały argument ekonomiczny.
• Warunki licencji dotyczące wag. To one zdecydują, czy „open” oznacza „nadające się do użycia w twojej skali” dla HY4 Preview, tak jak warunki licencji Qwen3.8-Max zrobiły to dla modelu Alibaby.
• Czy którykolwiek z dostawców ponownie obniży cenę. W miesiącu, w którym dwa open-weight flagowce trafiły na rynek z agresywnymi cenami, pass-through w routerze sprawia, że każda dalsza obniżka jest widoczna tego samego dnia.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
