
Tencent HY4 Preview vs GPT-5.6 Sol: Teza o wywoływaniu narzędzi, która stawia otwarte wagi przeciwko czołówce
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Tencent HY4 Preview to pierwszy od miesięcy model o otwartych wagach, którego karta premiery wprost deklaruje zwycięstwo nad GPT-5.6 Sol. Liczba, o którą chodzi, to Toolathlon-Verified, benchmark agentowego wywoływania narzędzi, w którym Tencent raportuje HY4 Preview na poziomie 74,1 — przed Qwen3.8-Max i, według porównania samego Tencent, przed GPT-5.6 Sol. Pod każdym innym względem te dwa modele nie są sobie równi: GPT-5.6 Sol to zamknięty, flagowy, niezależnie mierzony model graniczny OpenAI, a Tencent HY4 Preview to otwarty model z 770 miliardami parametrów, wydany dziś rano z tabelą wyników od producenta i bez weryfikacji zewnętrznej.
Zatem interesujące pytanie nie brzmi {{1}}"który model jest mądrzejszy"{{/1}} — lecz czy pretendent o otwartych wagach, przy cenie wejściowej równej mniej więcej jednej szóstej ceny Sola, może wiarygodnie ubiegać się o miejsce w czołówce, i co zespół powinien zrobić z twierdzeniem, którego obecnie nie można zweryfikować.
Twierdzenie, które czyni to prawdziwym starciem
Toolathlon-Verified mierzy, jak niezawodnie model prowadzi narzędzie przez całe zadanie agentowe — odczytywanie wyników, decydowanie o kolejnym wywołaniu, wychodzenie z błędów — a nie jak dobrze pisze pojedynczą funkcję. To ważne, ponieważ największa część realnych wydatków na API w modelach frontierowych przypada na pętle agentowe, a nie na jednorazowe uzupełnienia. Wynik Tencent, 74,1 w tym benchmarku, to konkretne twierdzenie, które umieściło HY4 Preview w rozmowie GPT-5.6 Sol, i warto się nad nim na chwilę zatrzymać: to liczba, która — jeśli utrzyma się w niezależnej replikacji — sprawia, że rozmowa o kosztach modeli open-weight i zamkniętych frontierów staje się realna. Jeśli się nie utrzyma, staje się kolejną tabelą wyników dostawcy, która wyparowuje pod zewnętrznym harnessem.
Dwa sposoby na zakup inteligencji

• Parametry — HY4 Preview 770B łącznie / 49B aktywnych, otwarte wagi vs GPT-5.6 Sol, nieujawniona liczba parametrów, zamknięte API
• Kontekst — HY4 Preview >1M tokenów vs GPT-5.6 Sol 1.05M tokenów, 128K maksymalne wyjście
• Cena za 1M — HY4 Preview ¥6 wejście / ¥18 wyjście (≈$0.85 / $2.50) vs GPT-5.6 Sol $4.00 / $20.00 na podstawowym poziomie, wzrastając do $8.00 / $30.00 dla żądań o dużym kontekście, odczyty z pamięci podręcznej $0.40
• Modalności wejściowe — HY4 Preview: tylko tekst w tej wersji zapoznawczej vs GPT-5.6 Sol: wejście tekstowe i obrazowe
• Tryby rozumowania — HY4 Preview: brak opublikowanego odpowiednika dla trybu Ultra GPT-5.6 Sol (do 16 równoległych podagentów) i Max reasoning effort.
• Niezależna weryfikacja — HY4 Preview brak jak dotąd, GPT-5.6 Sol obecny na każdym głównym rankingu, z rankingiem 1,05M kontekstu w czołówce złożonych testów długiego kontekstu
Kolumna ceny to miejsce, w którym rozstrzyga się całe starcie. Na poziomie podstawowym GPT-5.6 Sol kosztuje 4,00 USD za milion tokenów wejściowych i 20,00 USD za milion tokenów wyjściowych. Tencent HY4 Preview kosztuje około 0,85 USD i 2,50 USD przy obecnych kursach wymiany. W przypadku obciążenia, które generuje wiele tokenów wyjściowych — a tak działa kodowanie agentowe — model o otwartych wagach jest wyceniony na mniej więcej jedną ósmą zamkniętego, a ta różnica utrzymuje się nawet przy zastrzeżeniu, że liczby Sola są poparte znacznie większą liczbą weryfikacji.
Gdzie GPT-5.6 Sol wciąż ma przewagę
Weryfikacja to pierwsza przewaga. GPT-5.6 Sol jest ogólnie dostępny od 9 lipca i od tego czasu niezależnie mierzony: 88.8 w Terminal-Bench 2.1 przy podstawowym rozumowaniu, 91.9 w trybie Ultra, 53.6 w Agents' Last Exam (rekord w momencie premiery), 94.6 w GPQA Diamond i 64.6 w SWE-bench Pro. OpenAI podaje również 54% poprawę efektywności tokenów w zadaniach programowania agentowego w porównaniu z poprzednim flagowym modelem. To liczby, które można znaleźć odtworzone poza dokumentacją samego OpenAI, co jest dokładnie tą właściwością, której dziś brakuje Tencent HY4 Preview.
Capability to druga przewaga i ma charakter strukturalny, a nie marginalny. GPT-5.6 Sol przyjmuje obrazy na wejściu; HY4 Preview w tej wersji zapoznawczej obsługuje wyłącznie tekst, a Tencent przyznaje, że obsługa obrazu będzie musiała poczekać do pełnej wersji. GPT-5.6 Sol oferuje tryb Ultra — konfigurację wieloagentową koordynującą równoległych podagentów przy trzy- do czterokrotnie wyższym koszcie tokenów, przydatną właśnie w długoterminowych zadaniach inżynieryjnych, w których oba modele faktycznie rywalizowałyby. Co więcej, ścieżki korzystania z komputera oraz programowego wywoływania narzędzi w Sol są udokumentowane, testowane na skalę produkcyjną i poddane testom obciążeniowym. {{1}}Twierdzenie Tencenta o Toolathlon-Verified, jeśli się potwierdzi, zmniejsza różnicę w korzystaniu z narzędzi; nie zamyka jednak luk w obsłudze multimodaliów ani w konfiguracji wieloagentowej, których HY4 Preview w ogóle nie próbuje zaadresować{{/1}}.{{2}} To kluczowa różnica: Sol konkuruje w obszarach, w których HY4 Preview celowo nie bierze udziału{{/2}}.
Gdzie podgląd HY4 jest naprawdę interesujący
Odłóżmy na bok teatr benchmarków, a pozostaną trzy realne rzeczy. Po pierwsze, cena: przy ¥6/¥18 — mniej więcej $0.85/$2.50 — Tencent jest od czterech do ośmiu razy tańszy od wszystkich zachodnich modeli granicznych w zakresie tokenów wyjściowych, a w zakresie wejściowych podcina także własnych chińskich konkurentów z otwartymi wagami. Po drugie, otwarte wagi: MoE z 49B aktywnymi parametrami można wdrożyć na pojedynczym węźle — czego nie da się powiedzieć o nieujawnionej architekturze Sol — a wagi są już na HuggingFace, ModelScope i GitHub. Po trzecie, kontekst i trajektoria inżynieryjna: DeepSWE 64.3 i okno kontekstowe 1M+ są wymierzone w te same długohoryzontowe obciążenia agentowe, na które celuje tryb Ultra Sola, ale za ułamek kosztów.
Uczciwe zastrzeżenie jest takie, że żadne z tego nie przetrwało kontaktu z niezależnym benchmarkiem. Opowieść Tencenta o samooptymalizacji — 31,8% wzrostu przepustowości end-to-end dzięki modelowi iterującemu po własnym stosie wnioskowania — jest mierzona wewnętrznie. Zwycięstwo w ślepym teście nad GLM 5.3 i Kimi K3 przeprowadzono wewnętrznie. Wszystko, co interesujące w HY4 Preview, jest dziś jedynie deklaracją.
Decyzja
Jeśli budujesz dziś system produkcyjny, GPT-5.6 Sol to uzasadniony wybór i jest dostępny przez OrcaRouter po progowej cenie listowej samego OpenAI — $4.00/$20.00 na podstawowym poziomie, $8.00/$30.00 powyżej, bez żadnej marży, dzięki czemu każda zmiana ceny dostawcy jest u nas aktualna tego samego dnia. Jeśli Twój przepływ pracy jest agentowy i mocno oparty na narzędziach, struktura progowa oznacza, że powinieneś sprawdzać rzeczywiste rozmiary danych wejściowych względem progu $272K-token, zamiast zakładać stałą stawkę.
Jeśli chcesz przeprowadzić ocenę w trybie cienia, HY4 Preview jest na tyle niedrogi, że warto zrobić ją naprawdę: przepuść swoje obciążenie tool-calling przez Sol już dziś, uruchom te same prompty na HY4 Preview przez własne API Tencenta i porównaj je na własnych zadaniach w stylu Toolathlon. A jeśli niezależne wyniki będą takie, jak zapowiada Tencent, ścieżka przełączenia jest krótka — model o otwartych wagach wpina się do rutera, a reguła failover zamienia endpointy, ze stawką dostawcy ¥6/¥18 przekazaną bez zmian. Oto uczciwa struktura tego starcia: zweryfikowany model z najwyższej półki, na którym możesz budować już dziś, naprzeciw niezweryfikowanego otwartego pretendenta, który jest na tyle tani, że warto go przetestować, i który ma sprawić, by rozmowa o cenie dotyczyła całej klasy modeli o otwartych wagach.


Co obejrzeć
• Pierwsza niezależna replikacja Toolathlon-Verified. Jeśli zewnętrzny harness potwierdzi HY4 Preview w okolicach 70, argument, że „open weights nie potrafią agentowo używać narzędzi”, upada.
• Czy Tencent udostępni wersję wizyjną przed pełną premierą Hy4. Ograniczenie do samego tekstu sprawia, że HY4 Preview obsługuje jedynie ścisły podzbiór zadań, które realizuje GPT-5.6 Sol.
• Rzeczywiste rachunki za tokeny wynikające ze skłonności HY4 Preview do długiego myślenia. Przy 18 ¥ za milion tokenów na wyjściu, szczegółowa samoweryfikacja zjada przewagę cenową szybciej niż w przypadku modelu za 20 $.
• Czy warstwowe ceny Sol doczekają się kolejnej obniżki przed pełną premierą Hy4. Przeniesienie na routerze oznacza, że spadek jest widoczny tego samego dnia.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
