Tytułowy pasek porównania „Tencent HY4 Preview vs Qwen3.8-Max”. Centralny baner głosi: „Sierpniowe starcie modeli open-weight”, z adnotacją: „Dwa flagowce open-weight, 25 dni różnicy”. Lewa karta „Tencent HY4 Preview” zawiera: „770B / 49B aktywnych, premiera 28 sierpnia”, „¥6 / ¥18 za 1M”, „Brak niezależnych wyników”. Prawa karta „Qwen3.8-Max” zawiera: „2.4T / ~95B aktywnych, premiera 3 sierpnia”, „$2.00 / $6.00 za 1M”, „AA Index 58”. Stopka głosi: „Dane HY4 Preview pochodzą od producenta; wyniki Qwen3.8-Max według Artificial Analysis.” Logo OrcaRouter jest umieszczone w prawym dolnym rogu.
Guides & Insights

Tencent HY4 Preview vs Qwen3.8-Max: Sierpniowy pojedynek modeli open-weight

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tencent HY4 Preview kontra Qwen3.8-Max to starcie, ku któremu zmierzał ten miesiąc. Qwen3.8-Max od Alibaby wszedł w powszechną dostępność 3 sierpnia, a 12 sierpnia stał się pierwszym Qwenem klasy Max z otwartymi wagami; Tencent HY4 Preview zadebiutował dziś rano, 25 dni później, z kartą premiery, która bezpośrednio wskazuje Qwen3.8-Max — Tencent podaje wynik 74,1 dla HY4 Preview w Toolathlon-Verified, wyprzedzając Qwen3.8-Max w tym benchmarku. Oba to chińskie flagowce z otwartymi wagami, oba atrakcyjnie wycenione, a tylko jeden z nich ma niezależne wyniki.

Te dwa modele dzieli coś więcej niż skala — Qwen3.8-Max ma 2,4 biliona parametrów wobec 770 miliardów HY4 Preview — ale w benchmarkach agentowych, które liczą się dla kupującego, celują w ten sam punkt: pracę o długim horyzoncie, w której model czyta, wywołuje narzędzia i iteruje bez udziału człowieka w pętli. To dokładnie ten obszar, w którym sierpniowa generacja modeli open-weight próbuje udowodnić, że może zastąpić zamknięte modele graniczne, a pierwszym ruchem Tencenta był strzał w największą otwartą premierę tego miesiąca.

Tablica wyników

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Skala — HY4 Preview 770B łącznie / 49B aktywnych vs Qwen3.8-Max 2.4T łącznie / ~95B aktywnych

• Kontekst — HY4 Preview >1M tokenów vs Qwen3.8-Max 1M tokenów w API (262K natywnie w otwartych wagach, rozszerzalne do ~1.01M)

• Cena za 1M — HY4 Preview ¥6 za wejście / ¥18 za wyjście (ok. $0,85 / $2,50) vs Qwen3.8-Max $2,00 za wejście / $6,00 za wyjście, odczyty z cache $0,25

• Terminal-Bench 2.1 — HY4 Preview 85.4 (raportowane przez producenta) vs Qwen3.8-Max 86.6

• Modalność — obie wersje open-weight są wyłącznie tekstowe; API Qwen3.8-Max dodaje obsługę obrazu i wideo, podczas gdy wersja podglądowa HY4 Preview nie.

{{1}}Niezależny wynik{{/1}} — {{2}}HY4 Preview brak vs Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58{{/2}}

{{1}}Te dwie karty opowiadają tę samą historię z przeciwnych stron. W Terminal-Bench 2.1 wyniki Qwen3.8-Max (86.6) i HY4 Preview (85.4) dzieli półtora punktu — jeden punkt na korzyść Qwen, a wynik HY4 nie jest audytowany.{{/1}} {{2}}Jeśli chodzi o cenę, HY4 Preview jest tańszy zarówno pod względem ceny za token wejściowy, jak i wyjściowy. Jeśli chodzi o weryfikację, Qwen3.8-Max ma niezależny Intelligence Index na poziomie 58 i Agentic Index na poziomie 58; HY4 Preview nie ma nic poza własnymi materiałami prasowymi.{{/2}} Ta rozpiętość to klasyczny wzorzec pretendenta, który pojawia się z lepszymi cenami i niepotwierdzonymi twierdzeniami przeciwko zweryfikowanemu liderowi.

Czytanie oświadczenia Toolathlon

{{1}}Toolathlon-Verified{{/1}} mierzy {{2}}niezawodność agentowego korzystania z narzędzi{{/2}} — {{3}}jak konsekwentnie model prowadzi narzędzie przez całe zadanie z błędami, odzyskiwaniem i wywołaniami wieloetapowymi{{/3}}. {{4}}Wynik 74.1 firmy Tencent{{/4}} {{5}}celuje bezpośrednio w najmocniejszą część{{/5}} {{6}}profilu Qwen3.8-Max{{/6}}, {{7}}ponieważ Agentic Index Qw​en wynoszący 58{{/7}} oraz {{8}}jej OSWorld-Verified 86.1{{/8}} {{9}}to liczby, które uczyniły agentową narrację Ali​baby wiarygodną{{/9}}. {{10}}Qwen3.8-Max notuje również 82.8 w IFBench (podążanie za instrukcjami) i 93.0 w PaperBench (badawcza praca agentowa){{/10}}, {{11}}przewyższając modele takie jak GPT-5.6 Sol{{/11}} {{12}}na własnych tabelach sprzedawcy{{/12}}. {{13}}Tencent wybrał więc jedyny benchmark{{/13}}, {{14}}w którym twierdzi, że ma bezpośrednią przewagę{{/14}} {{15}}nad największym otwartym modelem miesiąca{{/15}} — {{16}}a twierdzenie to jest obecnie tak samo weryfikowalne, jak każdy inny pojedynczy wiersz sprzedawcy: wcale.{{/16}}

Zweryfikowane vs zgłoszone przez dostawcę

To jest oś, na której to zestawienie jest najmniej uczciwe, a o tej asymetrii warto mówić wprost. Wskaźnik inteligencji Qwen3.8-Max wynoszący 58 pochodzi z Artificial Analysis, podobnie jak jego wskaźnik agentowy 58, a te same niezależne procedury testowe, które przyznały mu te oceny, zmierzyły też jego słabości: 40% wskaźnik halucynacji w AA-Omniscience, w porównaniu z 23% w poprzedniej generacji, oraz ogromne 64 kroki agentowe na zadanie — model ciężko pracuje, a za każdy krok płacisz. Tencent HY4 Preview nie ma żadnego z tych narzędzi pomiarowych. Jego mocne strony to deklaracje, a jego tryby awarii — sam Tencent wskazuje na długie myślenie i nadmierną samoweryfikację — są przyznaniem się, a nie pomiarem.

Dla zespołu wybierającego między tymi dwoma rozwiązaniami luka weryfikacyjna nie jest abstrakcją. Zachowanie Qwen3.8-Max — 64 tury na zadanie — to realny, zmierzony czynnik kosztów: przy $2/$6 wciąż jest najdroższym agentem na ukończone zadanie w niektórych porównaniach zewnętrznych, a zespoły donoszą, że liczba tur niweluje jego przewagę cenową. Analogiczne zachowanie HY4 Preview jest nieznane — może być tańszy na zadanie, niż sugerowałaby jego już niska cena za token, albo jego nawyk samoweryfikacji może pochłonąć tę różnicę. Nikt jeszcze nie może powiedzieć, który z tych scenariuszy jest prawdziwy, ponieważ nikt poza Tencentem go nie uruchomił.

Cena i kwestie praktyczne otwartych wag

W przeliczeniu na token HY4 Preview jest tańszy po obu stronach rozliczenia: ¥6/¥18 wobec $2,00/$6,00 w Qwen3.8-Max i ¥0,3 za trafienia w cache wobec $0,25. To czyni HY4 Preview najtańszym flagowym modelem o otwartych wagach zarówno na wejściu, jak i wyjściu — kropka. Ale określenie „open weights” niesie ze sobą dwa różne zestawy drobnego druku. Wydanie Qwen3.8-Max z otwartymi wagami — Qwen3.8-2.4T-A95B — jest wyłącznie tekstowe, z wymuszonym trybem myślenia, natywnym kontekstem 262K zamiast 1M oferowanego przez API, a także z niestandardową licencją z warunkami zależnymi od skali: wymogiem wyświetlania nazwy modelu powyżej 100 mln użytkowników miesięcznie i osobną licencją dla dużych firm Model-as-a-Service. Wagi Tencent HY4 Preview są dostępne na HuggingFace, ModelScope i GitHub od dziś rana, ale dokładne warunki licencji oraz to, czy wagi są zgodne z wersją udostępnianą przez API, nie zostały określone z podobną jasnością. Oba modele są do pobrania; żaden nie jest jednak trywialnym wdrożeniem typu drop-in.

Najważniejsze

Qwen3.8-Max to bezpieczniejszy wybór pod każdym względem, w jakim weryfikacja zapewnia bezpieczeństwo: niezależnie oceniany pod kątem inteligencji i pracy agentowej, znane tryby awarii, ustalona licencja i trzy tygodnie informacji zwrotnych z produkcji. Jest to również droższy wybór w przeliczeniu na token, a jego zmierzone zachowanie, cechujące się dużą liczbą tur, stanowi znane ryzyko kosztowe. Tencent HY4 Preview to opłacalny zakład: tańszy zarówno na wejściu, jak i na wyjściu, z porównywalną deklaracją Terminal-Bench i bezpośrednią deklaracją Toolathlon-Verified względem Qw​en — wszystko to niezweryfikowane od pierwszego dnia. Jeśli w tym tygodniu wdrażasz model o otwartych wagach do produkcji, Qwen3.8-Max to wybór, który można obronić, i jest dostępny na OrcaRouter po cenie katalogowej Ali​baby — $2.00/$6.00, przekazywanej dalej bez narzutu. HY4 Preview to projekt ewaluacyjny: uruchom go przez własne API Tencent na własnych zadaniach w stylu Toolathlon, utrzymaj ścieżkę produkcyjną na zweryfikowanym modelu, a gdy pojawią się niezależne wyniki — lub gdy HY4 Preview trafi do rutera, a jego stawka ¥6/¥18 będzie tego samego dnia przekazywana dalej bez narzutu — ta zamiana to reguła routingu, a nie przepisanie.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

Co obejrzeć

• Pierwsze niezależne uruchomienie HY4 Preview na uprzęży agentowej. Toolathlon-Verified 74.1 to wynik, który Tencent chce osiągnąć; niezależny Agentic Index byłby potwierdzeniem.

• Zmierzona liczba tur HY4 Preview. 64 tury na zadanie w przypadku Qwen3.8-Max to przestroga; to, czy HY4 Preview jest tańszy za ukończone zadanie, stanowi cały argument ekonomiczny.

• Warunki licencji dotyczące wag. To one zdecydują, czy „open” oznacza „nadające się do użycia w twojej skali” dla HY4 Preview, tak jak warunki licencji Qwen3.8-Max zrobiły to dla modelu Alibaby.

• Czy którykolwiek z dostawców ponownie obniży cenę. W miesiącu, w którym dwa open-weight flagowce trafiły na rynek z agresywnymi cenami, pass-through w routerze sprawia, że każda dalsza obniżka jest widoczna tego samego dnia.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube