Główna karta tytułowa porównania 'Tencent HY4 Preview vs GPT-5.6 Sol'. Główne wyróżnienie brzmi 'Toolathlon-Verified 74.1 – otwarte wagi przeciw granicy możliwości', z adnotacją 'Tencent raportuje, że jego model wyprzedza GPT-5.6 Sol w agentowym wywoływaniu narzędzi'. Lewa karta 'Tencent HY4 Preview' zawiera 'Otwarte wagi, 770B / 49B aktywnych parametrów', '¥6 / ¥18 za 1M', 'Brak niezależnych wyników'. Prawa karta 'GPT-5.6 Sol' zawiera 'Zamknięte API, flagowy model OpenAI', '$4 / $20 bazowo za 1M', 'Terminal-Bench 2.1: 88.8'. Stopka brzmi 'Dane HY4 Preview pochodzą od producenta; dane Sol są szeroko odtwarzane.' Logo OrcaRouter jest umieszczone w prawym dolnym rogu.
Guides & Insights

Tencent HY4 Preview vs GPT-5.6 Sol: Teza o wywoływaniu narzędzi, która stawia otwarte wagi przeciwko czołówce

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tencent HY4 Preview to pierwszy od miesięcy model o otwartych wagach, którego karta premiery wprost deklaruje zwycięstwo nad GPT-5.6 Sol. Liczba, o którą chodzi, to Toolathlon-Verified, benchmark agentowego wywoływania narzędzi, w którym Tencent raportuje HY4 Preview na poziomie 74,1 — przed Qwen3.8-Max i, według porównania samego Tencent, przed GPT-5.6 Sol. Pod każdym innym względem te dwa modele nie są sobie równi: GPT-5.6 Sol to zamknięty, flagowy, niezależnie mierzony model graniczny Ope​nAI, a Tencent HY4 Preview to otwarty model z 770 miliardami parametrów, wydany dziś rano z tabelą wyników od producenta i bez weryfikacji zewnętrznej.

Zatem interesujące pytanie nie brzmi {{1}}"który model jest mądrzejszy"{{/1}} — lecz czy pretendent o otwartych wagach, przy cenie wejściowej równej mniej więcej jednej szóstej ceny Sola, może wiarygodnie ubiegać się o miejsce w czołówce, i co zespół powinien zrobić z twierdzeniem, którego obecnie nie można zweryfikować.

Twierdzenie, które czyni to prawdziwym starciem

Toolathlon-Verified mierzy, jak niezawodnie model prowadzi narzędzie przez całe zadanie agentowe — odczytywanie wyników, decydowanie o kolejnym wywołaniu, wychodzenie z błędów — a nie jak dobrze pisze pojedynczą funkcję. To ważne, ponieważ największa część realnych wydatków na API w modelach frontierowych przypada na pętle agentowe, a nie na jednorazowe uzupełnienia. Wynik Tencent, 74,1 w tym benchmarku, to konkretne twierdzenie, które umieściło HY4 Preview w rozmowie GPT-5.6 Sol, i warto się nad nim na chwilę zatrzymać: to liczba, która — jeśli utrzyma się w niezależnej replikacji — sprawia, że rozmowa o kosztach modeli open-weight i zamkniętych frontierów staje się realna. Jeśli się nie utrzyma, staje się kolejną tabelą wyników dostawcy, która wyparowuje pod zewnętrznym harnessem.

Dwa sposoby na zakup inteligencji

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• Parametry — HY4 Preview 770B łącznie / 49B aktywnych, otwarte wagi vs GPT-5.6 Sol, nieujawniona liczba parametrów, zamknięte API

• Kontekst — HY4 Preview >1M tokenów vs GPT-5.6 Sol 1.05M tokenów, 128K maksymalne wyjście

• Cena za 1M — HY4 Preview ¥6 wejście / ¥18 wyjście (≈$0.85 / $2.50) vs GPT-5.6 Sol $4.00 / $20.00 na podstawowym poziomie, wzrastając do $8.00 / $30.00 dla żądań o dużym kontekście, odczyty z pamięci podręcznej $0.40

• Modalności wejściowe — HY4 Preview: tylko tekst w tej wersji zapoznawczej vs GPT-5.6 Sol: wejście tekstowe i obrazowe

• Tryby rozumowania — HY4 Preview: brak opublikowanego odpowiednika dla trybu Ultra GPT-5.6 Sol (do 16 równoległych podagentów) i Max reasoning effort.

• Niezależna weryfikacja — HY4 Preview brak jak dotąd, GPT-5.6 Sol obecny na każdym głównym rankingu, z rankingiem 1,05M kontekstu w czołówce złożonych testów długiego kontekstu

Kolumna ceny to miejsce, w którym rozstrzyga się całe starcie. Na poziomie podstawowym GPT-5.6 Sol kosztuje 4,00 USD za milion tokenów wejściowych i 20,00 USD za milion tokenów wyjściowych. Tencent HY4 Preview kosztuje około 0,85 USD i 2,50 USD przy obecnych kursach wymiany. W przypadku obciążenia, które generuje wiele tokenów wyjściowych — a tak działa kodowanie agentowe — model o otwartych wagach jest wyceniony na mniej więcej jedną ósmą zamkniętego, a ta różnica utrzymuje się nawet przy zastrzeżeniu, że liczby Sola są poparte znacznie większą liczbą weryfikacji.

Gdzie GPT-5.6 Sol wciąż ma przewagę

Weryfikacja to pierwsza przewaga. GPT-5.6 Sol jest ogólnie dostępny od 9 lipca i od tego czasu niezależnie mierzony: 88.8 w Terminal-Bench 2.1 przy podstawowym rozumowaniu, 91.9 w trybie Ultra, 53.6 w Agents' Last Exam (rekord w momencie premiery), 94.6 w GPQA Diamond i 64.6 w SWE-bench Pro. Ope​nAI podaje również 54% poprawę efektywności tokenów w zadaniach programowania agentowego w porównaniu z poprzednim flagowym modelem. To liczby, które można znaleźć odtworzone poza dokumentacją samego Ope​nAI, co jest dokładnie tą właściwością, której dziś brakuje Tencent HY4 Preview.

Capability to druga przewaga i ma charakter strukturalny, a nie marginalny. GPT-5.6 Sol przyjmuje obrazy na wejściu; HY4 Preview w tej wersji zapoznawczej obsługuje wyłącznie tekst, a Tencent przyznaje, że obsługa obrazu będzie musiała poczekać do pełnej wersji. GPT-5.6 Sol oferuje tryb Ultra — konfigurację wieloagentową koordynującą równoległych podagentów przy trzy- do czterokrotnie wyższym koszcie tokenów, przydatną właśnie w długoterminowych zadaniach inżynieryjnych, w których oba modele faktycznie rywalizowałyby. Co więcej, ścieżki korzystania z komputera oraz programowego wywoływania narzędzi w Sol są udokumentowane, testowane na skalę produkcyjną i poddane testom obciążeniowym. {{1}}Twierdzenie Tencenta o Toolathlon-Verified, jeśli się potwierdzi, zmniejsza różnicę w korzystaniu z narzędzi; nie zamyka jednak luk w obsłudze multimodaliów ani w konfiguracji wieloagentowej, których HY4 Preview w ogóle nie próbuje zaadresować{{/1}}.{{2}} To kluczowa różnica: Sol konkuruje w obszarach, w których HY4 Preview celowo nie bierze udziału{{/2}}.

Gdzie podgląd HY4 jest naprawdę interesujący

Odłóżmy na bok teatr benchmarków, a pozostaną trzy realne rzeczy. Po pierwsze, cena: przy ¥6/¥18 — mniej więcej $0.85/$2.50 — Tencent jest od czterech do ośmiu razy tańszy od wszystkich zachodnich modeli granicznych w zakresie tokenów wyjściowych, a w zakresie wejściowych podcina także własnych chińskich konkurentów z otwartymi wagami. Po drugie, otwarte wagi: MoE z 49B aktywnymi parametrami można wdrożyć na pojedynczym węźle — czego nie da się powiedzieć o nieujawnionej architekturze Sol — a wagi są już na HuggingFace, ModelScope i GitHub. Po trzecie, kontekst i trajektoria inżynieryjna: DeepSWE 64.3 i okno kontekstowe 1M+ są wymierzone w te same długohoryzontowe obciążenia agentowe, na które celuje tryb Ultra Sola, ale za ułamek kosztów.

Uczciwe zastrzeżenie jest takie, że żadne z tego nie przetrwało kontaktu z niezależnym benchmarkiem. Opowieść Tencenta o samooptymalizacji — 31,8% wzrostu przepustowości end-to-end dzięki modelowi iterującemu po własnym stosie wnioskowania — jest mierzona wewnętrznie. Zwycięstwo w ślepym teście nad GLM 5.3 i Kimi K3 przeprowadzono wewnętrznie. Wszystko, co interesujące w HY4 Preview, jest dziś jedynie deklaracją.

Decyzja

Jeśli budujesz dziś system produkcyjny, GPT-5.6 Sol to uzasadniony wybór i jest dostępny przez OrcaRouter po progowej cenie listowej samego Ope​nAI — $4.00/$20.00 na podstawowym poziomie, $8.00/$30.00 powyżej, bez żadnej marży, dzięki czemu każda zmiana ceny dostawcy jest u nas aktualna tego samego dnia. Jeśli Twój przepływ pracy jest agentowy i mocno oparty na narzędziach, struktura progowa oznacza, że powinieneś sprawdzać rzeczywiste rozmiary danych wejściowych względem progu $272K-token, zamiast zakładać stałą stawkę.

Jeśli chcesz przeprowadzić ocenę w trybie cienia, HY4 Preview jest na tyle niedrogi, że warto zrobić ją naprawdę: przepuść swoje obciążenie tool-calling przez Sol już dziś, uruchom te same prompty na HY4 Preview przez własne API Tencenta i porównaj je na własnych zadaniach w stylu Toolathlon. A jeśli niezależne wyniki będą takie, jak zapowiada Tencent, ścieżka przełączenia jest krótka — model o otwartych wagach wpina się do rutera, a reguła failover zamienia endpointy, ze stawką dostawcy ¥6/¥18 przekazaną bez zmian. Oto uczciwa struktura tego starcia: zweryfikowany model z najwyższej półki, na którym możesz budować już dziś, naprzeciw niezweryfikowanego otwartego pretendenta, który jest na tyle tani, że warto go przetestować, i który ma sprawić, by rozmowa o cenie dotyczyła całej klasy modeli o otwartych wagach.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

Co obejrzeć

• Pierwsza niezależna replikacja Toolathlon-Verified. Jeśli zewnętrzny harness potwierdzi HY4 Preview w okolicach 70, argument, że „open weights nie potrafią agentowo używać narzędzi”, upada.

• Czy Tencent udostępni wersję wizyjną przed pełną premierą Hy4. Ograniczenie do samego tekstu sprawia, że HY4 Preview obsługuje jedynie ścisły podzbiór zadań, które realizuje GPT-5.6 Sol.

• Rzeczywiste rachunki za tokeny wynikające ze skłonności HY4 Preview do długiego myślenia. Przy 18 ¥ za milion tokenów na wyjściu, szczegółowa samoweryfikacja zjada przewagę cenową szybciej niż w przypadku modelu za 20 $.

• Czy warstwowe ceny Sol doczekają się kolejnej obniżki przed pełną premierą Hy4. Przeniesienie na routerze oznacza, że spadek jest widoczny tego samego dnia.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube