
Nex-N2.5 Pro vs Kimi K3: starcie, w którym sędzią jest własna karta benchmarkowa nowicjusza
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0455Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0247Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0157Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2646Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1541Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0547Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencja49Kod
Sprawdźcie, jakie liczby mają wspólne Nex-N2.5 Pro i Kimi K3, a zauważycie, kto je dostarczył. Nex-AGI's Nex-N2.5 Pro — agent multimodalny o 397 miliardach parametrów i ~17 miliardach aktywnych, zaprezentowany 8 września 2026 roku, z wagami wciąż oznaczonymi jako „coming soon” — publikuje tabelę benchmarków, w której w tych samych kolumnach bezpośrednio umieszcza Kimi K3 od Moonshot AI. Kimi K3 to flagowy model open-weight o 2,8 biliona parametrów, który Moonshot wydał 16 lipca 2026 roku, z kontekstem miliona tokenów, pełnymi wagami na licencji Modified MIT jedenaście dni później i wynikiem 57 w Artificial Analysis Intelligence Index, który czyni go najlepszym modelem open-weight na tablicy. I w wierszu za wierszem tej tabeli Nex-N2.5 Pro ustępuje Kimi K3: Terminal-Bench 2.1 na poziomie 82,7 wobec 88,3 K3, BrowseComp 89,7 wobec 91,2, SWE-Bench Pro 61,2 wobec 63,3, AutomationBench 44,2 wobec 46,7. Gdy dostawca drukuje wyniki własnego modelu obok aktualnego lidera open-weights i jego własny model przegrywa większość wierszy, najciekawsze w tym zestawieniu jest to, że tabela prawdopodobnie mówi prawdę.
To niezwykły kształt tego porównania. Zwykle karta nowicjusza to miejsce, w którym należy szukać spinów. Tutaj karta jest tym, co w przypadku obu modeli najbardziej przypomina uczciwego arbitra, bo Nex-AGI nie miało powodu publikować tabeli, która degradowałaby jej własny poziom Pro — a wiersze, w których Pro faktycznie pokonuje K3, to dokładnie te wiersze, w których mały, stworzony do konkretnego zadania model do obsługi komputera powinien bić znacznie większego generalistę. Prawdziwe pytanie, na które odpowiada ta strona, jest więc węższe i bardziej użyteczne niż „który jest lepszy”: czy zadeklarowana nisza Nex-N2.5 Pro — wydajność agentowa zbliżona do K3 przy mniej więcej jednej szóstej aktywnych parametrów — przetrwa zderzenie z faktem, że Kimi K3 już istnieje, ma już opublikowane wagi i już jest modelem do pobicia?
Przeciwnik, w całości
Kimi K3 nie jest modelem niszowym i właśnie dlatego stanowi właściwy punkt odniesienia. To flagowy model Moonshota: 2,8 T parametrów łącznie, z czego 104 B aktywnych w architekturze Stable LatentMoE, kontekst 1 M tokenów z odpowiednim budżetem wyjściowym, natywne rozumienie tekstu, obrazu i wideo, zawsze włączone rozumowanie oraz otwarte wagi, które każdy dysponujący wystarczającą mocą obliczeniową może faktycznie uruchomić. Jego pozycja w niezależnych rankingach jest mocna — wskaźnik inteligencji 57 (Artificial Analysis) przewyższa wszystkie inne modele o otwartych wagach, a w Frontend Code Arena uzyskał 1679 pkt Elo, wyprzedzając Claude Fable 5 i GPT-5.6 Sol — natomiast cena, 3,00 USD za milion tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych oraz 0,30 USD za buforowane wejście, plasuje go w górnej półce segmentu otwartych wag. Kimi K3 to przykład tego, jak wygląda „przełomowość i otwartość”, gdy dostawca nie idzie na kompromis w kwestii skali: kosztuje więcej za token niż zamknięci rywale, tacy jak GPT-5.6 Sol, jeśli chodzi o tokeny wyjściowe, jest kosztowny w serwowaniu i bardzo trudno podważyć jego wyniki na listach liderów.
Arytmetyka pretendenta
Nex-N2.5 Pro nie próbuje prześcignąć Kimi K3 pod względem skali. Próbuje je prześcignąć w serwowaniu. Nex-AGI dotrenowało wariant Pro z bazy modelu z linii Qwen3.5 do postaci natywnie wizyjnego agenta do obsługi komputerów i przeglądarek, a jego głównym atutem jest efektywność: 397B parametrów łącznie / ~17B aktywnych, kontekst 262K oraz przepis na wdrożenie na pojedynczym węźle 8×H100, wobec 2.8T / 104B aktywnych parametrów K3 i floty serwerów, jakiej wymaga model tej wielkości. Kryjący się za tym argument jest taki, że specjalista z 17B aktywnymi parametrami, trenowany specjalnie pod kątem pętli agentowej z wizualnym sprzężeniem zwrotnym, może zapewnić większość osiągów agencyjnych generalisty z 104B aktywnymi parametrami przy ułamku kosztów serwowania. Na własnej karcie wynikowej Nex-AGI twierdzenie to jest prawdopodobne, ale niepełne: Pro pokonuje K3 lub dorównuje mu w OSWorld-G (87,4 wobec 79,6) i OmniDoc (92,2 wobec 91,1), a w pozostałych wspólnych kategoriach przegrywa jednocyfrowo – model 397B przegrywający z modelem 2.8T o 3–6 punktów w kodowaniu i przeglądaniu internetu to, jeśli to prawda, dokładnie ta historia o efektywności, którą Nex chce opowiedzieć.
Jeśli to prawda. Każda z tych liczb to własny wynik Nex-AGI, uzyskany przynajmniej częściowo za pomocą wewnętrznego harnessu NexCUA, a Nex-N2.5 Pro nie może dziś zostać niezależnie zweryfikowany, ponieważ jego wagi nie są dostępne do pobrania — repozytorium na Hugging Face zawiera README, folder z rysunkami i baner „weights are coming soon” i nic więcej. To samo zastrzeżenie dotyczy danych po stronie K3 podawanych na karcie, które Nex w większości zaczerpnął z opublikowanych raportów Moonshot, a nie zmierzył samodzielnie. Tabela Nex-AGI nie ustala, kto wygrywa; pokazuje natomiast, że inżynierowie Nex-AGI, wybierając benchmarki i harness, nie zdołali sprawić, by ich wariant Pro pokonał Kimi K3 na większości wspólnych pól. To bardziej użyteczny punkt danych niż jakikolwiek pojedynczy wynik, ponieważ wyznacza górną granicę tego, jak bardzo marketing może przesadzać.

Wiersze, które mają znaczenie, obok siebie
• Skala — Nex-N2.5 Pro: 397B łącznie / ~17B aktywnych, multimodalny z linii Qwen3.5. Kimi K3: 2.8T łącznie / 104B aktywnych, Stable LatentMoE, multimodalny.
• Wagi — Nex-N2.5 Pro: obiecane, nieudostępnione („wkrótce” na karcie). Kimi K3: opublikowane 27 lipca na licencji Modified MIT — do pobrania już dziś.
• Kontekst — Nex-N2.5 Pro: 262K. Kimi K3: 1M tokenów w stałej cenie.
• Cena — Nex-N2.5 Pro: brak jeszcze cennika; darmowy hostowany podgląd. Kimi K3: $3.00 / $15.00 za milion, input z pamięci podręcznej $0.30.
• Pozycja w niezależnym zestawieniu — Nex-N2.5 Pro: na razie żadna. Kimi K3: AA Intelligence Index 57, najlepszy model o otwartych wagach w tym zestawieniu.
• Kodowanie (karty dostawców) — Nex-N2.5 Pro: Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2. Kimi K3: 88.3 i 63.3 w tych samych wierszach.
• GUI / obsługa komputera — Nex-N2.5 Pro: OSWorld-G 87,4 (pokonuje K3 na jego własnej karcie), OSWorld-2 56,4. Kimi K3: OSWorld-G 79,6, OSWorld-2 58,3 (skompilowane przez Nex).
• Wymagania self-hostingu — Nex-N2.5 Pro: gdy tylko pojawią się wagi, wystarczy pojedynczy węzeł z 8×H100. Kimi K3: 2.8T — to flota serwerowa, a nie pojedynczy węzeł.
Co „open” oznacza inaczej w każdej kolumnie
Słowo „open" pełni po obu stronach bardzo różną funkcję i to ono rozstrzyga to starcie bardziej niż jakikolwiek benchmark. Kimi K3 jest otwarty w sensie, który liczy się operacyjnie: wagi są na hubie pod dość permisywną licencją Modified MIT, ślady rozumowania są odsłonięte w API strumieniowym, a firma z ograniczeniami dotyczącymi zarządzania danymi może uruchomić go na sprzęcie, który kontroluje, i sprawdzić, co model sobie myślał. Jest otwarty w sposób, który kosztuje — model 2.8T wymaga poważnej infrastruktury — ale ta opcja istnieje już dziś. Nex-N2.5 Pro jest otwarty w sensie intencji: Nex-AGI zapowiada, że wagi całej rodziny zostaną wydane jako open source, a mniejszy pobratymiec Nex-N2.5 Mini faktycznie wypuścił w dniu premiery wagi na licencji Apache-2.0. Wagi Pro nie są jeszcze dostępne, licencja jest ogłoszona na karcie, ale nie wiąże jeszcze niczego, co można pobrać, a dopóki nie istnieje checkpoint, „open" to element mapy drogowej, a nie właściwość modelu. Dla zespołu wybierającego między tymi dwoma to nie drobiazg — to różnica między modelem, który można mieć na własność już w tym miesiącu, a modelem, który obiecuje się, że będzie można mieć na własność.
Ocenianie bez czekania na przycisk pobierania
Nie musisz wstrzymywać się z tą decyzją do czasu publikacji wag Nex-N2.5 Pro, a warstwa routingu to miejsce, w którym ten eksperyment przeprowadzisz tanio. Kimi K3 jest dostępny na OrcaRouter po cenie katalogowej Moonshot — $3.00 / $15.00, 0% narzutu; cena ta jest przekazywana dalej i aktualizowana w dniu, w którym Moonshot ją zmienia — więc lider wśród modeli z otwartymi wagami jest o jedno kliknięcie od pozostałych ponad 200 modeli w katalogu. Nex-N2.5 Pro nie jest oferowany przez nas, więc przetestowanie go dziś oznacza hostowany podgląd Nex-AGI, a później własny zestaw ośmiu H100. Schemat, który tu pasuje: prace wymagające długiego kontekstu i intensywnych audytów wykonuj na Kimi K3 przez jeden endpoint, którego już używasz; skieruj gałąź testową na podgląd Nex-N2.5 Pro i pozwól, aby automatyczny failover omijał ten z nich, który ulega degradacji — dokładnie w ten sposób porównujesz wydany model graniczny z pretendentem, którego wagi dopiero nadejdą, nie stawiając swojej ścieżki produkcyjnej na żadnym z nich. Gdy wagi Pro w końcu trafią do publicznej wiadomości, weryfikacja jest prosta: uruchom współdzielone wiersze testowe, które niezależne laboratorium może odtworzyć, i sprawdź, czy opowieść o efektywności 17B aktywnych parametrów przetrwa poza własnym środowiskiem testowym Nex-AGI.


Gdzie kończy się to starcie
W starciu z największym jak dotąd wydanym modelem o otwartych wagach Nex-N2.5 Pro nie musi wygrać wojny generalistów, by zasługiwać na uwagę — musi wygrać spór o koszty serwowania, a jego własna karta produktowa sugeruje, że ten argument jest realny, ale nieudowodniony. Kimi K3 to dziś bezpieczny i naprawdę mocny wybór: otwarte wagi, czołówka indeksu modeli o otwartych wagach, kontekst miliona tokenów i cena, którą można zmieścić w budżecie — za cenę infrastruktury, która robi się tylko trudniejsza w miarę wzrostu modelu. Nex-N2.5 Pro to zakład na wydajność: wyniki w zadaniach agentowych niemal na poziomie K3 przy jednej szóstej aktywnych parametrów na pojedynczym węźle — według tabeli dostawcy, opisującej model, który jeszcze nie trafił na rynek. Wybierz Kimi K3, jeśli chcesz model z czołówki, który możesz faktycznie posiadać i audytować już teraz. Obserwuj Nex-N2.5 Pro i czekaj na dzień, w którym jego wagi trafią do publicznej dystrybucji, a ktoś niezależny uruchomi te same testy porównawcze — bo jeśli agent z 17B aktywnymi parametrami naprawdę utrzyma się w granicach kilku punktów od flagowca ze 104B aktywnymi parametrami w obsłudze komputera, to będzie wynik, który zmienia rachunek kosztów serwowania dla każdego otwartego agenta, który pojawi się po nim.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
