
GPT-6 Astra vs Tencent HY4 Preview: Jeden model ma ścieżkę audytu, a drugi tabelę benchmarków
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Tencent HY4 Preview i GPT-6 Astra to dwie najtańsze drogi do kodowania agentowego na niemal najwyższym poziomie, jakie są dziś dostępne, jeśli wierzyć liczbom samych dostawców, a zarazem dwa najmniej porównywalne modele w tej klasie, jeśli wierzyć liczbom kogokolwiek innego. Tencent HY4 Preview został wydany i udostępniony jako open source 28 sierpnia 2026 r. na licencji Apache 2.0, w cenie 0,834 USD za milion tokenów wejściowych i 2,501 USD za milion tokenów wyjściowych, z architekturą mieszanki ekspertów liczącą 770 miliardów parametrów, oknem kontekstu przekraczającym milion tokenów oraz limitem wyjścia wynoszącym 64 000 tokenów. GPT-6 Astra jest ogólnie dostępny od 3 września 2026 r. w cenie 10,00 i 50,00 USD, z oknem 1 050 000 tokenów i maksymalnym wyjściem 128 000. Atuty Astry potwierdza osiem opublikowanych ewaluacji zewnętrznych; atuty HY4 Preview potwierdzają wyłącznie własne testy Tencent dotyczące terminala, wywoływania narzędzi i ślepej oceny — i nic poza tym. Ta asymetria nie oznacza, że tańszy model jest słabszy. Oznacza, że jedno z tych dwóch porównań można sprawdzić, a drugie trzeba przyjąć na wiarę, przez co praktyczne decyzje wyglądają odpowiednio różnie.
Co wydanie Apache 2.0 właściwie ci daje
Licencja to ta część tego starcia, której tabela cen nie jest w stanie wyrazić. Tencent HY4 Preview nie jest hostowaną zapowiedzią z brandingiem open-weight — wagi można pobrać z Hugging Face, GitHub, ModelScope i GitCode, co oznacza, że model przetrwa każdą decyzję Tencentu dotyczącą własnych cen, własnego endpointu czy własnego dalszego zainteresowania jego udostępnianiem.
• Architektura — 770 mld parametrów łącznie, 49 mld aktywnych na token, 78 warstw, 256 ekspertów kierowanych plus jeden ekspert współdzielony oraz natywna warstwa wielotokenowego przewidywania na potrzeby dekodowania spekulatywnegobr /> • Charakterystyka obsługi — 54,6 tokenu wyjściowego na sekundę i mediana 6,26 sekundy do pierwszego tokenu, mierzone na trasach OrcaRouter w ruchomym siedmiodniowym okniebr /> • Kontekst i górny limit — okno 1 048 576 tokenów przy maksymalnym wyjściu 64 000 tokenówbr /> • Obsługiwane dane wejściowe — wyłącznie tekst; bez obrazu, bez plików, bez dźwiękubr /> • Sterowanie rozumowaniem — trzy poziomy: wysoki, niski i brak, przy czym domyślny jest wysoki, a dodatkowo udokumentowana zalecana konfiguracja próbkowania: temperatura 0,9 i top_p 1,0br /> • Niezawodność — wskaźnik błędów 2,8% w tym samym siedmiodniowym oknie, wobec 10,3% na trasie Astra
Ta ostatnia para liczb jest najbardziej użyteczną informacją na tej stronie i jest to taki wskaźnik, jakiego żaden dostawca nie publikuje na temat własnego modelu. Niezależne wyniki benchmarków Astry są wyższe, a jej trasa zawodziła w przybliżeniu na jednym żądaniu na dziesięć w ciągu ostatniego tygodnia, podczas gdy model bez jakichkolwiek niezależnych wyników zawodził na jednym na trzydzieści pięć. Żadna z tych liczb nie mówi nic o samych modelach — wskaźniki błędów mierzą trasę, limity szybkości i warstwę nadrzędną, a nie wagi — ale to są liczby, których faktycznie doświadcza system produkcyjny.

Gdzie liczby Tencentu można porównać z liczbami kogoś innego
To, na ile pozwalają opublikowane dowody, naprawdę nietypowa okazja: Astra i HY4 Preview mają zarówno wynik Terminal-Bench 2.1, a tylko jeden z nich został podany przez dostawcę.
• Terminal-Bench 2.1, sterowanie prawdziwym terminalem — GPT-6 Astra 88,4, niezależnie oceniany; Tencent HY4 Preview 85,4, zgłoszone przez dostawcębr /> • Wywoływanie narzędzi — Astra 41,4 w τ²-Banking, niezależnie oceniany; HY4 Preview 74,1 w Toolathlon-Verified, zgłoszone przez dostawcę, w innym teściebr /> • Inżynieria oprogramowania — HY4 Preview 64,3 w DeepSWE, wzrost z 28,0 w poprzedniku Hy3, zgłoszone przez dostawcębr /> • Zadania agentowe — HY4 Preview 37,1 pass@1 w APEX-Agents, zgłoszone przez dostawcębr /> • Preferencje ludzkie — średnia 2,99 z 4,00 w 203 zadaniach inżynieryjnych ocenionych przez 163 ekspertów, przeprowadzone przez dostawcę, w porównaniu z GLM-5.3 przy 2,92 i Kimi K3 przy 2,94br /> • Niezależny indeks — GPT-6 Astra 54,7 Intelligence Index i 96,1 GPQA Diamond, strony trzeciej; nie istnieje odpowiednik indeksu dla HY4 Preview
Wiersz Terminal-Bench jest tym, nad którym warto się zatrzymać. Trzypunktowa różnica między niezależnym wynikiem 88,4 a raportowanym przez dostawcę 85,4 mieści się spokojnie w zakresie, jaki może wygenerować inny harness, inny scaffold lub inna temperatura próbkowania, co oznacza, że uczciwa interpretacja nie brzmi „Astra jest o trzy punkty lepsza”, lecz „najtańszy model o otwartych wagach w tym segmencie ogłasza parytet, a to twierdzenie jest co najmniej wiarygodne”. Sposób, w jaki ujmuje to sam Tencent, jest w tym punkcie ostrożny: opisuje DeepSWE jako „stopniowo zmniejszający lukę”, a nie zamykający ją, a jego jedno jednoznaczne twierdzenie o parytecie — remis w Terminal-Bench z czołowym zamkniętym modelem innego dostawcy — jest dokładnie tym twierdzeniem, które najbardziej wymaga drugiego pomiaru.
Jest też zmiana, o której warto wiedzieć, bo zmienia ekonomikę, a nie wyniki. 7 września 2026 r. Tencent wprowadził do aktywnej kompilacji podglądowej optymalizację, która – jak twierdzi – skraca liczbę tur rozumowania i zużycie tokenów na zadanie w złożonej pracy. Ponieważ model rozlicza się za token, mniejsza liczba tokenów na ukończone zadanie obniża koszt zadania, mimo że stawka za token się nie zmieniła. Skala tych oszczędności to własny pomiar Tencenta i nikt spoza Tencenta go nie odtworzył – ale mechanizm jest prawdziwy i to dlatego eksploatacja wersji zapoznawczej wydanej w sierpniu może być w październiku istotnie tańsza, niż sugerował jej tekst premierowy.
Limit 64 000 tokenów to specyfikacja, która decyduje o wdrożeniach.
W połowie karty specyfikacji znajduje się ograniczenie, które daje o sobie znać najwcześniej — i nie jest to jakość. Maksymalna wielkość wyjścia HY4 Preview to 64 000 tokenów wobec 128 000 w przypadku Astra, w modelu, którego deklarowanym przeznaczeniem są agenci kodujący i długotrwałe korzystanie z narzędzi. Wygenerowany plik, łatka obejmująca wiele plików, długi ustrukturyzowany raport — to właśnie takie dane wyjściowe trafiają na sufit, a podczas przebiegu agenta awaria nie polega na nieco gorszej odpowiedzi, lecz na odpowiedzi uciętej, którą otaczający potok musi wykryć i obsłużyć.
Oba modele przyjmują około miliona tokenów danych wejściowych, więc w przypadku czytania dokumentów mamy prawdziwy remis. Różnica leży całkowicie po stronie generowania i wynosi dwukrotność, a nie błąd zaokrąglenia. Dodaj do tego różnicę w zakresie obsługiwanych danych wejściowych — Astra przyjmuje obrazy i pliki, HY4 Preview obsługuje wyłącznie tekst — a wyłaniający się obraz to klarowny podział pracy, a nie ranking: model o otwartych wagach do pętli agentowych typu tekst na wejściu, tekst na wyjściu, w których wynikiem jest wywołanie narzędzia lub diff, oraz model zamknięty do wszystkiego, co musi na coś spojrzeć albo napisać coś długiego.
Co daje 20× większa wydajność, linijka po linijce
• Cena wejściowa — Tencent HY4 Preview 0,834 USD za 1 mln vs GPT-6 Astra 10,00 USD, około 12×br /> • Cena wyjściowa — HY4 Preview 2,501 USD za 1 mln vs Astra 50,00 USD, około 20×br /> • Wejście z pamięci podręcznej — HY4 Preview 0,042 USD za 1 mln vs Astra 1,00 USD, około 24×br /> • Próg długiego żądania — Astra przelicza całe żądanie powyżej 272 000 tokenów wejściowych na 20,00 USD i 75,00 USD; karta HY4 Preview nie ma odpowiedniego progubr /> • Efektywna stawka wejściowa przy prompcie o długości 400 000 tokenów — HY4 Preview bez zmian na 0,834 USD vs Astra 20,00 USD, około 24×br /> • Koszt na milion tokenów zwykłej pętli agenta, przy stosunku wejścia do wyjścia 4:1 — HY4 Preview około 1,17 USD vs Astra około 18,00 USDbr /> • Koszt miesiąca o 100 milionach tokenów przy tym samym stosunku — HY4 Preview około 117 USD vs Astra około 1800 USD
Pozycja buforowanego wejścia jest tą, która skaluje się najgorzej po stronie kosztów, ponieważ pętle agenta ponownie wysyłają ten sam prompt systemowy i prefiks rozmowy w każdej turze. Przy $0.042 wobec $1.00 najtańsze tokeny długiej pętli są 24 razy tańsze w modelu Tencent, a to dokładnie takie obciążenie, w którym niewielka różnica w cenie za token kumuluje się najszybciej. Koszt na zadanie — metryka, która rozstrzygnęłaby to jednoznacznie — nie jest w ogóle publikowany przez Tencent, więc jedynym sposobem na uzyskanie liczby, która ma znaczenie, jest przepuszczenie obu modeli przez własny zestaw zadań i odczytanie obiektu użycia.

Co wnosi tutaj router, mając pod ręką wskaźniki błędów
Oba modele znajdują się w katalogu OrcaRouter — tencent/hy4-preview i openai/gpt-6-astra — za jednym punktem końcowym zgodnym z OpenAI, każdy w cenie katalogowej samego dostawcy, przekazanej bez żadnej marży. Ten ostatni szczegół ma w tym przypadku większe znaczenie niż w większości, ponieważ cena katalogowa modelu Tencent jest podawana w juanach: podane powyżej kwoty w dolarach to przeliczona stawka, którą faktycznie widzisz, a nie narzut pośrednika, a jeśli Tencent zmieni cenę, zmiana obowiązuje tu tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy.
DSL routingu to miejsce, w którym te dwa modele przestają być alternatywami. Naturalną regułą dla tej pary jest eskalacja na wyjściu: kieruj pętlę do taniego modelu, a gdy odpowiedź wróci obcięta względem limitu 64 000 tokenów lub nie przejdzie sprawdzenia schematu, ponów ten krok wobec openai/gpt-6-astra, który ma dwukrotnie większą przestrzeń wyjściową. Automatyczne przełączanie awaryjne to druga połowa argumentu i nie jest teoretyczne, gdy jedna z dwóch tras zwracała błędy przy jednym żądaniu na dziesięć przez ostatni tydzień — długi przebieg agenta przypięty do jednego modelu ginie wraz ze swoim zgromadzonym kontekstem, a żaden z tych modeli nie jest wystarczająco tani, by przypadkiem uruchamiać go od początku.

Co zmieniłoby to porównanie
Trzy rzeczy, w kolejności od tego, jak bardzo by na to wpłynęły. Niezależna ocena HY4 Preview — model jest publicznie dostępny od sześciu tygodni, nie ma indeksu podmiotów trzecich, odtworzonego wyniku Terminal-Bench ani kosztu na zadanie, a jedyna ślepa ocena przeprowadzona przez dostawcę to jedyne istniejące dane o preferencjach ludzi. Opublikowany koszt na ukończone zadanie dla obu modeli, który zastąpiłby każdy współczynnik w tym artykule jedną liczbą. I decyzja Tencent w sprawie wnioskowania przez podmioty trzecie, ponieważ wagi na licencji Apache 2.0 mogą być hostowane przez każdego, a gdy tylko konkurencyjni dostawcy uruchomią HY4 Preview, cena po tańszej stronie tego porównania stanie się rynkowa, a nie cennikowa.
Do tego czasu użyteczne podsumowanie jest węższe niż wpis o premierze któregokolwiek z dostawców i uczciwsze niż tablica wyników: GPT-6 Astra to model, którego twierdzenia o możliwościach zostały zweryfikowane, z dwukrotnie wyższym limitem wyjściowym i trasą, która zawodziła w jednym żądaniu na dziesięć. Tencent HY4 Preview to model, którego twierdzenia o możliwościach nie zostały zweryfikowane, z opublikowaną architekturą, otwartą licencją, jedną trzecią ceny i znacznie niższym wskaźnikiem błędów w tym samym okresie. Jeśli twoja praca polega na tekście na wejściu i na wyjściu i mieści się w 64 000 generowanych tokenów, tańszy model nie jest kompromisem — to właściwa odpowiedź, a jedyne, z czego rezygnujesz, to ścieżka audytu.
Naturalną regułą dla tej pary jest eskalacja na wyjściu: wyślij pętlę do taniego modelu, a gdy odpowiedź wróci obcięta względem limitu 64 000 tokenów lub nie przejdzie sprawdzania schematu, ponów próbę dla tego kroku zopenai/gpt-6-astra, który oferuje dwukrotnie więcej miejsca na wyjście.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
