Karta tytułowa hero do porównania 'Tencent HY4 Preview vs Kimi K3'. Centralna karta w stylu tablicy wyników zawiera napis 'Wewnętrzny test ślepy, skala 4-punktowa' z 'Tencent HY4 Preview 2.99' po lewej i 'Kimi K3 2.94' po prawej. Lewa karta 'Tencent HY4 Preview' wymienia '770B / 49B aktywnych, otwarte wagi', '¥6 / ¥18 za 1M', 'Podgląd tylko tekstowy'. Prawa karta 'Kimi K3' wymienia '2.8T / 104B aktywnych, otwarte wagi', '$3.00 / $15.00 za 1M', 'Natywna wizja, AA Index 57'. Stopka brzmi 'Test ślepy przeprowadzony przez Tencent z 163 inżynierami w 203 zadaniach; wyniki raportowane przez dostawcę.' Logo OrcaRouter jest umieszczone w prawym dolnym rogu.
Guides & Insights

Tencent HY4 Preview vs Kimi K3: Ślepy test, który Tencent postanowił opublikować

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tencent HY4 Preview kontra Kimi K3 to jedyne zestawienie podczas premiery tego modelu, które sam Tencent postanowił przeprowadzić. W jego wewnętrznym teście ślepym — 163 inżynierów, 203 zadania inżynieryjne, oceniane w czteropunktowej skali — HY4 Preview uzyskało 2.99/4.00 wobec 2.94 Kimi K3, a nagłówek Tencenta ogłosił to zwycięstwem. Drobny druk tego zwycięstwa warto przeczytać powoli: HY4 Preview pokonało Kimi K3 w 51.2% zadań, zremisowało w 7.9%, a przegrało w 40.9%. 10-punktowa przewaga netto jest realna, ale to niewielka przewaga nad modelem, który ma jedną trzecią całkowitej liczby parametrów i mniej niż połowę parametrów aktywnych — a cały test przeprowadził Tencent.

Kimi K3 to flagowy model Moonshota o otwartych wagach i 2,8 biliona parametrów, największy otwarty model, jaki kiedykolwiek wydano, oraz punkt odniesienia, z którym mierzy się każde chińskie laboratorium od 16 lipca. Tencent wybrał go na przeciwnika, ponieważ jest standardem otwartych wag — co sprawia, że zadanie tego artykułu jest wyjątkowo konkretne: przeczytaj jedyne porównanie bezpośrednie, na które zdecydował się pretendent, i oceń, ile jest warte.

Benchmark, który Tencent zdecydował się opublikować

Ślepy test został oceniony przez inżynierów Tencenta na własnych zadaniach inżynieryjnych Tencenta, co jest pierwszą rzeczą, którą należy zdyskontować. Zestaw zadań przygotowany przez firmę to dokładnie środowisko, w którym nowy model może wypaść jak najlepiej. Nawet jeśli to przyjmiemy, kształt wyniku jest pouczający: 51,2% wygranych wobec 40,9% przegranych to skromna przewaga, a 7,9% remisów oznacza, że modele są zbliżone w większości zadań. W trudnych zadaniach, tych, w których model z czołówki się wyróżnia, różnica jest tam, gdzie zawsze — a nagłówek Tencenta „nieznacznie lepszy od Kimi K3” jest sformułowany uczciwie, co nie jest tym, co publikuje każde laboratorium.

Skala nie jest przeznaczeniem

Porównanie parametrów sprawia, że wynik jest albo imponujący, albo podejrzany — w zależności od przyjętych założeń. Kimi K3 ma 2,8 biliona parametrów łącznie, z czego 104 miliardy aktywne — 896 ekspertów, 16 aktywnych na token — i został wytrenowany do ciągłego rozumowania z odsłoniętym łańcuchem myśli. HY4 Preview ma 770 miliardów parametrów łącznie, z czego 49 miliardów aktywnych — czyli jedną trzecią całkowitej skali i mniej niż połowę aktywnej mocy obliczeniowej. Mniejszy model, który osiąga nieznaczną przewagę w teście ślepym nad większym, to kierunek, w którym zmierza całe środowisko modeli open-weight — Qwen3.8-Max (2,4 bln) i GLM-5.2 (753 mld) od miesięcy wymieniają ciosy w benchmarkach agentowych — więc wynik jest wiarygodny, a nie niedorzeczny. Co istotne, nie został również zweryfikowany przez nikogo spoza Tencent.

Tablica wyników

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Skala — HY4 Preview 770B łącznie / 49B aktywnych vs Kimi K3 2.8T łącznie / 104B aktywnych

• Kontekst — HY4 Preview >1M tokenów vs Kimi K3 1M tokenów

• Cena za 1M — HY4 Preview ¥6 wejście / ¥18 wyjście (≈$0.85 / $2.50) vs Kimi K3 $3.00 wejście / $15.00 wyjście, trafienia w pamięci podręcznej $0.30

• Modalność — HY4 Preview: tylko tekst vs Kimi K3: natywne wejście obrazu i wideo

• Rozumowanie — HY4 Preview bez opublikowanego trybu vs Kimi K3 z zawsze włączonym rozumowaniem i strumieniowym łańcuchem myśli

• Niezależny wynik — HY4 Preview: brak vs Kimi K3: AA Intelligence Index 57, w pierwszej trójce globalnie w momencie premiery

W wierszach, w których obie strony podają liczbę, modele grupują się. Tencent podaje HY4 Preview na poziomie 37.1 w APEX-Agents, praktycznie na równi z 37.2 Kimi K3 — niemal remis, który przewidziałaby tablica wyników testów ślepych. Wyniki HY4 Preview — Toolathlon-Verified 74.1 i DeepSWE 64.3 — nie mają odpowiednika u Kimi K3 w moim zestawieniu, a wyniki Kimi K3 — FrontierSWE 81.2, ProgramBench 77.8 i BrowseComp 91.2 — nie mają odpowiednika w HY4 Preview. Tablica wyników uczciwie pokazuje, że te dwie karty w niewielkim stopniu się nakładają, co samo w sobie jest ostrzeżeniem przed traktowaniem wierszy któregokolwiek z producentów jako pełnego opisu modelu.

Wizja to największa prawdziwa różnica.

Dla programisty wybierającego dziś między tymi dwoma, różnica strukturalna to nie inteligencja — to modalność wejścia. Kimi K3 jest natywnie multimodalny: przyjmuje obrazy i wideo przez swój enkoder MoonViT-V2 i należy do najlepszych otwartych modeli w zadaniach wizyjnych, zajmując drugie miejsce na światowej arenie wizyjnej. Tencent HY4 Preview w tej wersji zapoznawczej obsługuje wyłącznie tekst, a Tencent zapowiedział, że obsługa obrazu musi poczekać na pełne wydanie. Każde zadanie wymagające zrzutów ekranu, rozumienia interfejsu użytkownika lub ugruntowania wizualnego należy domyślnie do Kimi K3, niezależnie od tego, co ślepy test mówi o tekście inżynieryjnym. Jeśli twoja praca to wyłącznie kod, dokumenty i wyjście terminala, ta różnica nie ma znaczenia; w chwili, gdy zadanie wymaga spojrzenia na coś, decyduje o wyniku starcia.

Kwestia kosztów

W przeliczeniu na token, HY4 Preview jest dramatycznie tańszy: mniej więcej $0.85/$2.50 wobec $3.00/$15.00 dla Kimi K3, z trafieniami w pamięci podręcznej po ¥0.3 (około czterech centów) wobec $0.30. Jednak oba modele mają przeciwstawne zachowania tokenowe, które zmniejszają tę różnicę. Kimi K3 rozumuje nieprzerwanie i strumieniowo przesyła swój łańcuch myślowy, co zawyża liczbę tokenów wyjściowych przy każdym żądaniu; recenzenci zauważyli, że model jest wolniejszy — około 62 tokenów na sekundę — i generuje duże obciążenie tokenowe w pętlach agentowych. HY4 Preview, według notatki wydawniczej samego Tencenta, „skłania się ku nadmiernie długiemu myśleniu i nadmiernej samoweryfikacji” przy złożonych zadaniach. Oba spalają dodatkowe tokeny wyjściowe; HY4 Preview po prostu pobiera za nie niższą opłatę. Uczciwe porównanie to koszt za ukończone zadanie, a nikt poza Tencentem jeszcze go dla HY4 Preview nie zmierzył.

Werdykt

{{1}}Tencent HY4 Preview to tańszy, mniejszy i niezweryfikowany pretendent, który twierdzi, że ma wąską przewagę w teście ślepym nad standardem open-weight; Kimi K3 to większy, zweryfikowany i obsługujący wizję lider, który kosztuje od czterech do pięciu razy więcej za token i ma niezależny Intelligence Index wynoszący 57.{{/1}} Karta benchmarkowa żadnego z tych modeli nie jest w pełni niezależna — główne wyniki Kimi K3 również są raportowane przez Moonshot, choć jego Index 57 już nie. {{2}}Jeśli twoje obciążenia są multimodalne, Kimi K3 jest jedynym wyborem w tym zestawieniu.{{/2}} {{3}}W przypadku zadań tekstowych i inżynieryjnych HY4 Preview to opłacalny wybór z prawdziwym, choć prowadzonym przez producenta, pojedynkiem na koncie, a tania ścieżka to skierowanie Kimi K3 na klucz produkcyjny — jest on dostępny na OrcaRouter po cenie katalogowej Moonshot wynoszącej $3.00/$15.00, przekazywanej bez narzutu — podczas gdy HY4 Preview uruchamiasz przez własne API Tencent na obciążeniach shadow.{{/3}} {{4}}Gdy HY4 Preview trafi do routera, ten sam klucz i te same reguły failover obsłużą oba modele, a stawka Tencent wynosząca ¥6/¥18 będzie przekazywana bez zmian.{{/4}}

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

Co obejrzeć

• Niezależne powtórzenie zadań testu ślepego. Wskaźnik wygranych 51.2% to najbardziej testowalne twierdzenie w tej premierze, a zewnętrzny harness rozstrzygnąłby to w tydzień.

• To, czy HY4 Preview dostarczy wizję przed pełną premierą Hy4. To właśnie uczyniłoby z tego prawdziwą walkę flagowców, a nie tylko porównanie specyfikacji na papierze.

• Koszt za ukończone zadanie w standardowych środowiskach agentowych. Oba modele są tokenochłonne; ten, kto jest tańszy w przeliczeniu na ukończone zadanie, wygrywa debatę o wdrożeniu produkcyjnym.

• Odpowiedź Kimi K3 na presję cenową. Jeśli Moonshot obniży stawkę wyjściową wynoszącą 15 dolarów, układ „tani pretendent kontra drogi standard” ulegnie odwróceniu.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube