Wygenerowana karta tytułowa hero dla 'Nex-N2.5 Pro vs Kimi K3' z podtytułem 'Pojedynek, w którym sędziuje własna karta benchmarkowa nowicjusza', duży zaokrąglony dokument z etykietą 'KARTA BENCHMARKOWA DOSTAWCY' z dwiema kolumnami modeli i linią 'Pro ustępuje K3 na większości wspólnych wierszy' nad nim, z logo OrcaRouter wkomponowanym w prawym dolnym rogu.
Guides & Insights

Nex-N2.5 Pro vs Kimi K3: starcie, w którym sędzią jest własna karta benchmarkowa nowicjusza

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Sprawdźcie, jakie liczby mają wspólne Nex-N2.5 Pro i Kimi K3, a zauważycie, kto je dostarczył. Nex-AGI's Nex-N2.5 Pro — agent multimodalny o 397 miliardach parametrów i ~17 miliardach aktywnych, zaprezentowany 8 września 2026 roku, z wagami wciąż oznaczonymi jako „coming soon” — publikuje tabelę benchmarków, w której w tych samych kolumnach bezpośrednio umieszcza Kimi K3 od Moonshot AI. Kimi K3 to flagowy model open-weight o 2,8 biliona parametrów, który Moonshot wydał 16 lipca 2026 roku, z kontekstem miliona tokenów, pełnymi wagami na licencji Modified MIT jedenaście dni później i wynikiem 57 w Artificial Analysis Intelligence Index, który czyni go najlepszym modelem open-weight na tablicy. I w wierszu za wierszem tej tabeli Nex-N2.5 Pro ustępuje Kimi K3: Terminal-Bench 2.1 na poziomie 82,7 wobec 88,3 K3, BrowseComp 89,7 wobec 91,2, SWE-Bench Pro 61,2 wobec 63,3, AutomationBench 44,2 wobec 46,7. Gdy dostawca drukuje wyniki własnego modelu obok aktualnego lidera open-weights i jego własny model przegrywa większość wierszy, najciekawsze w tym zestawieniu jest to, że tabela prawdopodobnie mówi prawdę.

To niezwykły kształt tego porównania. Zwykle karta nowicjusza to miejsce, w którym należy szukać spinów. Tutaj karta jest tym, co w przypadku obu modeli najbardziej przypomina uczciwego arbitra, bo Nex-AGI nie miało powodu publikować tabeli, która degradowałaby jej własny poziom Pro — a wiersze, w których Pro faktycznie pokonuje K3, to dokładnie te wiersze, w których mały, stworzony do konkretnego zadania model do obsługi komputera powinien bić znacznie większego generalistę. Prawdziwe pytanie, na które odpowiada ta strona, jest więc węższe i bardziej użyteczne niż „który jest lepszy”: czy zadeklarowana nisza Nex-N2.5 Pro — wydajność agentowa zbliżona do K3 przy mniej więcej jednej szóstej aktywnych parametrów — przetrwa zderzenie z faktem, że Kimi K3 już istnieje, ma już opublikowane wagi i już jest modelem do pobicia?

Przeciwnik, w całości

Kimi K3 nie jest modelem niszowym i właśnie dlatego stanowi właściwy punkt odniesienia. To flagowy model Moonshota: 2,8 T parametrów łącznie, z czego 104 B aktywnych w architekturze Stable LatentMoE, kontekst 1 M tokenów z odpowiednim budżetem wyjściowym, natywne rozumienie tekstu, obrazu i wideo, zawsze włączone rozumowanie oraz otwarte wagi, które każdy dysponujący wystarczającą mocą obliczeniową może faktycznie uruchomić. Jego pozycja w niezależnych rankingach jest mocna — wskaźnik inteligencji 57 (Artificial Analysis) przewyższa wszystkie inne modele o otwartych wagach, a w Frontend Code Arena uzyskał 1679 pkt Elo, wyprzedzając Claude Fable 5 i GPT-5.6 Sol — natomiast cena, 3,00 USD za milion tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych oraz 0,30 USD za buforowane wejście, plasuje go w górnej półce segmentu otwartych wag. Kimi K3 to przykład tego, jak wygląda „przełomowość i otwartość”, gdy dostawca nie idzie na kompromis w kwestii skali: kosztuje więcej za token niż zamknięci rywale, tacy jak GPT-5.6 Sol, jeśli chodzi o tokeny wyjściowe, jest kosztowny w serwowaniu i bardzo trudno podważyć jego wyniki na listach liderów.

Arytmetyka pretendenta

Nex-N2.5 Pro nie próbuje prześcignąć Kimi K3 pod względem skali. Próbuje je prześcignąć w serwowaniu. Nex-AGI dotrenowało wariant Pro z bazy modelu z linii Qwen3.5 do postaci natywnie wizyjnego agenta do obsługi komputerów i przeglądarek, a jego głównym atutem jest efektywność: 397B parametrów łącznie / ~17B aktywnych, kontekst 262K oraz przepis na wdrożenie na pojedynczym węźle 8×H100, wobec 2.8T / 104B aktywnych parametrów K3 i floty serwerów, jakiej wymaga model tej wielkości. Kryjący się za tym argument jest taki, że specjalista z 17B aktywnymi parametrami, trenowany specjalnie pod kątem pętli agentowej z wizualnym sprzężeniem zwrotnym, może zapewnić większość osiągów agencyjnych generalisty z 104B aktywnymi parametrami przy ułamku kosztów serwowania. Na własnej karcie wynikowej Nex-AGI twierdzenie to jest prawdopodobne, ale niepełne: Pro pokonuje K3 lub dorównuje mu w OSWorld-G (87,4 wobec 79,6) i OmniDoc (92,2 wobec 91,1), a w pozostałych wspólnych kategoriach przegrywa jednocyfrowo – model 397B przegrywający z modelem 2.8T o 3–6 punktów w kodowaniu i przeglądaniu internetu to, jeśli to prawda, dokładnie ta historia o efektywności, którą Nex chce opowiedzieć.

Jeśli to prawda. Każda z tych liczb to własny wynik Nex-AGI, uzyskany przynajmniej częściowo za pomocą wewnętrznego harnessu NexCUA, a Nex-N2.5 Pro nie może dziś zostać niezależnie zweryfikowany, ponieważ jego wagi nie są dostępne do pobrania — repozytorium na Hugging Face zawiera README, folder z rysunkami i baner „weights are coming soon” i nic więcej. To samo zastrzeżenie dotyczy danych po stronie K3 podawanych na karcie, które Nex w większości zaczerpnął z opublikowanych raportów Moonshot, a nie zmierzył samodzielnie. Tabela Nex-AGI nie ustala, kto wygrywa; pokazuje natomiast, że inżynierowie Nex-AGI, wybierając benchmarki i harness, nie zdołali sprawić, by ich wariant Pro pokonał Kimi K3 na większości wspólnych pól. To bardziej użyteczny punkt danych niż jakikolwiek pojedynczy wynik, ponieważ wyznacza górną granicę tego, jak bardzo marketing może przesadzać.

A comparison scoreboard for Nex-N2.5 Pro and Kimi K3: Nex-N2.5 Pro rows 'Total / active: 397B / ~17B', 'Weights: coming soon', 'Context: 262K', 'Price: no rate card (free preview)', 'Terminal-Bench 2.1: 82.7 (Nex-reported)', 'OSWorld-2: 56.4 (Nex-reported)'; Kimi K3 rows 'Total / active: 2.8T / 104B', 'Weights: open, Modified MIT', 'Context: 1M', 'Price: $3 / $15, cache $0.30', 'Terminal-Bench 2.1: 88.3 (Moonshot)', 'OSWorld-2: 58.3 (Nex-compiled)'; footer 'All figures vendor-reported; Kimi K3 AA Index 57 per Artificial Analysis.'

Wiersze, które mają znaczenie, obok siebie

Skala — Nex-N2.5 Pro: 397B łącznie / ~17B aktywnych, multimodalny z linii Qwen3.5. Kimi K3: 2.8T łącznie / 104B aktywnych, Stable LatentMoE, multimodalny.

Wagi — Nex-N2.5 Pro: obiecane, nieudostępnione („wkrótce” na karcie). Kimi K3: opublikowane 27 lipca na licencji Modified MIT — do pobrania już dziś.

Kontekst — Nex-N2.5 Pro: 262K. Kimi K3: 1M tokenów w stałej cenie.

Cena — Nex-N2.5 Pro: brak jeszcze cennika; darmowy hostowany podgląd. Kimi K3: $3.00 / $15.00 za milion, input z pamięci podręcznej $0.30.

Pozycja w niezależnym zestawieniu — Nex-N2.5 Pro: na razie żadna. Kimi K3: AA Intelligence Index 57, najlepszy model o otwartych wagach w tym zestawieniu.

Kodowanie (karty dostawców) — Nex-N2.5 Pro: Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2. Kimi K3: 88.3 i 63.3 w tych samych wierszach.

GUI / obsługa komputera — Nex-N2.5 Pro: OSWorld-G 87,4 (pokonuje K3 na jego własnej karcie), OSWorld-2 56,4. Kimi K3: OSWorld-G 79,6, OSWorld-2 58,3 (skompilowane przez Nex).

Wymagania self-hostingu — Nex-N2.5 Pro: gdy tylko pojawią się wagi, wystarczy pojedynczy węzeł z 8×H100. Kimi K3: 2.8T — to flota serwerowa, a nie pojedynczy węzeł.

Co „open” oznacza inaczej w każdej kolumnie

Słowo „open" pełni po obu stronach bardzo różną funkcję i to ono rozstrzyga to starcie bardziej niż jakikolwiek benchmark. Kimi K3 jest otwarty w sensie, który liczy się operacyjnie: wagi są na hubie pod dość permisywną licencją Modified MIT, ślady rozumowania są odsłonięte w API strumieniowym, a firma z ograniczeniami dotyczącymi zarządzania danymi może uruchomić go na sprzęcie, który kontroluje, i sprawdzić, co model sobie myślał. Jest otwarty w sposób, który kosztuje — model 2.8T wymaga poważnej infrastruktury — ale ta opcja istnieje już dziś. Nex-N2.5 Pro jest otwarty w sensie intencji: Nex-AGI zapowiada, że wagi całej rodziny zostaną wydane jako open source, a mniejszy pobratymiec Nex-N2.5 Mini faktycznie wypuścił w dniu premiery wagi na licencji Apache-2.0. Wagi Pro nie są jeszcze dostępne, licencja jest ogłoszona na karcie, ale nie wiąże jeszcze niczego, co można pobrać, a dopóki nie istnieje checkpoint, „open" to element mapy drogowej, a nie właściwość modelu. Dla zespołu wybierającego między tymi dwoma to nie drobiazg — to różnica między modelem, który można mieć na własność już w tym miesiącu, a modelem, który obiecuje się, że będzie można mieć na własność.

Ocenianie bez czekania na przycisk pobierania

Nie musisz wstrzymywać się z tą decyzją do czasu publikacji wag Nex-N2.5 Pro, a warstwa routingu to miejsce, w którym ten eksperyment przeprowadzisz tanio. Kimi K3 jest dostępny na OrcaRouter po cenie katalogowej Moonshot — $3.00 / $15.00, 0% narzutu; cena ta jest przekazywana dalej i aktualizowana w dniu, w którym Moonshot ją zmienia — więc lider wśród modeli z otwartymi wagami jest o jedno kliknięcie od pozostałych ponad 200 modeli w katalogu. Nex-N2.5 Pro nie jest oferowany przez nas, więc przetestowanie go dziś oznacza hostowany podgląd Nex-AGI, a później własny zestaw ośmiu H100. Schemat, który tu pasuje: prace wymagające długiego kontekstu i intensywnych audytów wykonuj na Kimi K3 przez jeden endpoint, którego już używasz; skieruj gałąź testową na podgląd Nex-N2.5 Pro i pozwól, aby automatyczny failover omijał ten z nich, który ulega degradacji — dokładnie w ten sposób porównujesz wydany model graniczny z pretendentem, którego wagi dopiero nadejdą, nie stawiając swojej ścieżki produkcyjnej na żadnym z nich. Gdy wagi Pro w końcu trafią do publicznej wiadomości, weryfikacja jest prosta: uruchom współdzielone wiersze testowe, które niezależne laboratorium może odtworzyć, i sprawdź, czy opowieść o efektywności 17B aktywnych parametrów przetrwa poza własnym środowiskiem testowym Nex-AGI.

A screenshot of the Hugging Face 'Files and versions' tab for nex-agi/Nex-N2.5-Pro (captured September 9, 2026), showing the model header with Text Generation and Transformers tags, 'License: apache-2.0', and a file tree listing only figures, .gitattributes and README.md - no model weight shards, confirming the Pro checkpoint is not yet published.A screenshot of the OrcaRouter model page for kimi/kimi-k3 (captured September 9, 2026), showing the Kimi K3 card under vendor MoonshotAI with model id kimi/kimi-k3, a 1M-token context, text + image input and text output, vision/tools/reasoning chips, and a 'Public benchmarks by MoonshotAI' note dated 2026-07-15.

Gdzie kończy się to starcie

W starciu z największym jak dotąd wydanym modelem o otwartych wagach Nex-N2.5 Pro nie musi wygrać wojny generalistów, by zasługiwać na uwagę — musi wygrać spór o koszty serwowania, a jego własna karta produktowa sugeruje, że ten argument jest realny, ale nieudowodniony. Kimi K3 to dziś bezpieczny i naprawdę mocny wybór: otwarte wagi, czołówka indeksu modeli o otwartych wagach, kontekst miliona tokenów i cena, którą można zmieścić w budżecie — za cenę infrastruktury, która robi się tylko trudniejsza w miarę wzrostu modelu. Nex-N2.5 Pro to zakład na wydajność: wyniki w zadaniach agentowych niemal na poziomie K3 przy jednej szóstej aktywnych parametrów na pojedynczym węźle — według tabeli dostawcy, opisującej model, który jeszcze nie trafił na rynek. Wybierz Kimi K3, jeśli chcesz model z czołówki, który możesz faktycznie posiadać i audytować już teraz. Obserwuj Nex-N2.5 Pro i czekaj na dzień, w którym jego wagi trafią do publicznej dystrybucji, a ktoś niezależny uruchomi te same testy porównawcze — bo jeśli agent z 17B aktywnymi parametrami naprawdę utrzyma się w granicach kilku punktów od flagowca ze 104B aktywnymi parametrami w obsłudze komputera, to będzie wynik, który zmienia rachunek kosztów serwowania dla każdego otwartego agenta, który pojawi się po nim.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie