
Nex-N2.5 Pro kontra Claude Opus 5: Nex-AGI wybrało standard, i standard zwyciężył
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0455Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0247Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0157Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2646Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1541Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0547Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencja49Kod
Nex-AGI wybrało miarę i to miara zwyciężyła. Gdy działający w Szanghaju sojusz otwartych modeli wprowadzał Nex-N2.5 Pro 8 września 2026 r., tabela obsługi komputera na karcie modelu umieściła Claude Opus 5 w kolumnie porównawczej, a Nex-N2.5 Pro w roli pretendenta: 68,3 dla Claude Opus 5 wobec 56,4 dla Nex-N2.5 Pro w OSWorld-2 — obie wartości dokładnie takie, jakie Nex-AGI podało na własnej karcie. Niezależne rankingi od tego czasu poszerzają, a nie zawężają przepaść — snapshot OSWorld 2.0 z 29 sierpnia w BenchLM plasuje Claude Opus 5 na pierwszym miejscu wśród piętnastu wymienionych modeli, z wynikiem 70,6. Oddanie dwunastu punktów liderowi stawki w teście, który samemu wybrało się do publikacji, nie jest typową choreografią premiery. Dlatego najciekawsze w zestawieniu Nex-N2.5 Pro vs Claude Opus 5 nie jest punktacja. Najciekawsze jest to, czym naprawdę są obie strony tego wyniku: otwarty model obsługi komputera o 397 miliardach parametrów, którego nikt poza sojuszem nie zdołał jeszcze uruchomić ani zweryfikować, oraz zamknięty flagowy model Anthropica, który prowadzi w benchmarku i od końca lipca obsługuje ruch produkcyjny.
Uczciwe podsumowanie na wstępie: to nie jest rywalizacja między dwiema zmierzonymi wielkościami, ponieważ tylko jedną z nich zmierzył ktokolwiek inny niż jej twórca. Nex-N2.5 Pro to rzadki model mieszanki ekspertów, mający około 17 miliardów aktywnych parametrów w ramach łącznych 397B, dotrenowany na bazie linii Qwen3.5, wymierzony wprost w długoterminową obsługę komputera i przeglądarki z pętlą wizualnego sprzężenia zwrotnego. Jest dziś udostępniany przez bezpłatne hostowane punkty końcowe — linki Nex-AGI z jego karty modelu — podczas gdy wagi Apache-2.0, na których opiera się rodzina, pozostają oznaczone jako „wkrótce” bez podanej daty. Claude Opus 5 to flagowy model produkcyjny Anthropica do wymagającego rozumowania, kodowania i pracy agencyjnej — zamknięty model z kontekstem 1M tokenów, regulatorem adaptacyjnego myślenia, jawną ceną oraz tygodniami obecności na publicznych listach liderów i produkcyjnym ruchem za sobą. Każda przewaga w tym starciu sprowadza się do jednego z tych dwóch faktów: jeden model jest uruchamialny i weryfikowalny, a drugi nie jest ani jednym, ani drugim.
Benchmark, na który obie strony się zgadzają.
Benchmarki obsługi komputera nagradzają to samo zachowanie, które te modele mają sprzedawać: agenta, który patrzy na ekran, podejmuje decyzję o działaniu, wykonuje je i odczytuje zmieniony ekran, aby sprawdzić, czy przyniosło skutek. Nex-N2.5 Pro został zaprojektowany wokół dokładnie tej pętli — wizja nie jest do niego doczepioną modalnością wejściową, lecz kanałem sprzężenia zwrotnego, na podstawie którego agent weryfikuje swoje działania. Claude Opus 5 traktuje tę samą pętlę jako jedno z wielu obciążeń roboczych, ale akurat jest w niej bardzo dobry, dlatego Nex-AGI od początku użył właśnie jego jako punktu odniesienia.
Te dwie liczby nie pochodzą, ściśle rzecz biorąc, z tego samego środowiska testowego. Nex-AGI uzyskało swoje wyniki OSWorld-2 za pomocą własnego środowiska ewaluacyjnego NexCUA, które — jak twierdzi — udostępni jako open source, ale jeszcze go nie opublikowało, a wynik 56,4 dla Nex-N2.5 Pro to wynik producenta, który nie został niezależnie odtworzony. Wynik 70,6 Claude Opus 5 na BenchLM to zewnętrzny pomiar OSWorld 2.0 z 29 sierpnia 2026 roku, spójny z wynikiem 68,3, który Nex-AGI sam podaje w źródłach z leaderboardu. Różne środowiska testowe i nieco inne wersje benchmarków sprawiają, że dokładną różnicę — dwanaście punktów według danych samego Nex-AGI, bliżej czternastu na BenchLM — należy traktować jako orientacyjną. Nie ulega jednak wątpliwości, że Nex-N2.5 Pro, według najlepszych dostępnych danych po obu stronach, plasuje się poniżej obecnego czołowego agenta computer-use.

Dwie odpowiedzi na "czy mogę to uruchomić dzisiaj"

To jest ten punkt zwrotny, który naprawdę decyduje o pojedynku dla działającego zespołu i nie faworyzuje nowicjusza. Karta modelu Nex-N2.5 Pro na Hugging Face wciąż wyświetla baner z informacją, że wagi wkrótce zostaną udostępnione na licencji Apache-2.0, bez podanej daty premiery. Jedyne działające wersje to bezpłatne hostowane punkty końcowe, do których prowadzą linki Nex-AGI z karty — można je wywoływać, ale należą do kogoś innego, nie mają cennika ani warunków korzystania, na których zespół mógłby planować, i nie ma sposobu, by odtworzyć choćby jeden wynik benchmarku na własnym sprzęcie. Kiedy wagi w końcu się pojawią, opisana recepta serwowania to pojedynczy węzeł z ośmioma układami H100 na niestandardowym obrazie SGLang — realny, choć rutynowy footprint dla modelu MoE o 397 mld parametrów, i właśnie dlatego konstrukcja z 17 mld aktywnych parametrów jest interesująca. Dopóki to nie nastąpi, Nex-N2.5 Pro jest podglądem, który można odpytywać, a nie modelem, na którym można budować.
Claude Opus 5 jest przeciwieństwem w każdym z tych wierszy. Jest udostępniany przez API Anthropica i na platformach routowanych od 24 lipca, jego cena jest publiczna i stabilna, jego wagi są zamknięte i pozostaną zamknięte, a każdą z podawanych dla niego liczb można dziś sprawdzić, uruchamiając go. Otaczający ekosystem — Claude Code, narzędzia MCP i rój produkcyjnych agentów, które obciążały go przez sześć tygodni — to dokładnie ten skumulowany dorobek, jakim nie może wykazać się model mający zaledwie jeden dzień. Dla zespołu, którego wymogiem jest „model musi działać w przyszłym kwartale”, ten dorobek to wszystko.
Specyfikacja, taka jaka jest.
Połóż dwie koperty obok siebie:
• Wydano — Nex-N2.5 Pro: 8 września 2026 r. (hostowane punkty końcowe działają, wagi w przygotowaniu). Claude Opus 5: 24 lipca 2026 r., ogólnie dostępny.
• Skala — Nex-N2.5 Pro: 397B łącznie / ~17B aktywnych (MoE). Claude Opus 5: liczba parametrów nieujawniona.
• Modalność — Nex-N2.5 Pro: tekst i obraz na wejściu, tekst na wyjściu, a wizja jest centralna dla jego pętli korzystania z komputera. Claude Opus 5: tekst i obraz na wejściu, tekst na wyjściu, z silną analizą wizualną.
• Kontekst / wyjście — Nex-N2.5 Pro: kontekst 262 144 tokenów (udokumentowana długość serwowania). Claude Opus 5: kontekst 1 mln tokenów, limit wyjścia 128 tys. tokenów.
• Sterowanie rozumowaniem — Nex-N2.5 Pro: przełącznik reasoning_effort z ustawieniami none / medium (adaptacyjne, domyślne) / high. Claude Opus 5: myślenie adaptacyjne domyślnie, z jawnym suwakiem poziomu wysiłku od niskiego do maksymalnego.
• Wagi — Nex-N2.5 Pro: Apache-2.0, wkrótce, brak daty. Claude Opus 5: zamknięte.
• Cena za 1 mln tokenów — Nex-N2.5 Pro: bezpłatna warstwa hostowana, brak opublikowanej ceny katalogowej. Claude Opus 5: 5,00 USD za tokeny wejściowe / 25,00 USD za tokeny wyjściowe, 0,50 USD za odczyty z pamięci podręcznej, 6,25 USD za zapisy do pamięci podręcznej.
Zakresy różnią się na tyle, że specyfikacja naprawdę robi tu robotę: Opus 5 zapewnia okno miliona tokenów i górny limit 128 tys. tokenów wyjściowych dla długich sesji agenta, podczas gdy kontekst 262 tys. tokenów i darmowy poziom Nex-N2.5 Pro lepiej pasują do automatyzacji o mniejszym zakresie, sterowanej ekranem. Żadna specyfikacja nie czyni drugiej zbędną; modele mają odmienne zdanie co do tego, na co agent wydaje swój kontekst.
Uczciwie czytając własną tablicę wyników Nex-AGI.
Resztę karty warto przeczytać z tym samym filtrem. Pozostałe wiersze Nex-N2.5 Pro dotyczące obsługi komputera — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — oraz wiersze dotyczące kodowania — Terminal-Bench 2.1 przy 82.7, SWE-Bench Pro przy 61.2, BrowseComp przy 89.7 — to wszystko pomiary producenta wykonane przez własny harness sojuszu, których nikt nie powtórzył w ciągu pierwszych 48 godzin. Jedyny wniosek, jaki neutralny czytelnik może wyciągnąć z karty, jest taki, że Nex-AGI uważa Nex-N2.5 Pro za mocny model średniej półki do obsługi komputera, który ustępuje czołowemu agentowi w najważniejszym wierszu. To spójne, wręcz konserwatywne pozycjonowanie jak na otwarty model 397B. To także twierdzenie, które czeka na drugie laboratorium.
Pieniądze, kiedy jedna strona nie ma ceny.
Nie da się tu przeprowadzić uczciwego porównania cen, bo tylko jedna strona ma jakąkolwiek cenę. Darmowa warstwa hostingowa Nex-N2.5 Pro nic nie mówi o tym, ile model jest wart — darmowe endpointy podglądowe to sposób, w jaki dostawcy zbierają ruch i opinie, a Nex-AGI nie opublikowało żadnej płatnej stawki za token dla tej rodziny. Claude Opus 5 kosztuje 5,00 USD za milion tokenów wejściowych i 25,00 USD za milion tokenów wyjściowych według cennika Anthropica, z odczytami z cache po 0,50 USD — i to tę liczbę musi uwzględnić każdy budżet. Jeśli dziś płacisz ten rachunek za agentów obsługujących komputer i chcesz wiedzieć, czy otwarty model z 17B aktywnych parametrów mógłby wykonać tę samą pracę taniej, odpowiedź brzmi: być może, ale nie dowiesz się, dopóki wagi nie zostaną opublikowane i ktoś niezależny ich nie uruchomi. Porównanie cen jest odroczone, a nie rozstrzygnięte, a traktowanie darmowego endpointu jako dowodu taniości byłoby błędem kategorialnym.

To, co możesz zrobić już dziś, to przygotować test A/B na dzień, w którym to stanie się możliwe. Claude Opus 5 jest na OrcaRouter po cenie listowej Anthropica — te same $5.00 / $25.00, przekazywane dalej bez marży — więc rachunek tutaj pokrywa się z rachunkiem Anthropica i zmienia się w dniu, w którym Anthropic zmieni cenę. Dzięki jednemu kluczowi API trafia on za ten sam endpoint, za którym kryje się 200+ innych modeli, z automatycznym przełączaniem awaryjnym, gdy dostawca ma problemy, oraz z DSL routingu, jeśli chcesz, aby Opus obsługiwał trudne wywołania, a tańszy model — rutynowe. Nex-N2.5 Pro nie ma na OrcaRouter — przed napisaniem tego tekstu sprawdziliśmy nasz katalog modeli i nie ma w nim jeszcze żadnego modelu nex-agi. W chwili, gdy dostawca udostępni go w cenie listowej, pojawi się tutaj tego samego dnia, a uczciwe porównanie, którego ten artykuł nie może jeszcze przeprowadzić, stanie się regułą routingu zamiast migracji.
Kto powinien działać, a kto powinien czekać?
Jeśli Twój zespół ma dziś w produkcji obciążenia typu computer-use lub agentic-coding i potrzebuje modelu o znanej cenie, znanym profilu błędów i niezależnie potwierdzonych wynikach, Claude Opus 5 jest racjonalnym wyborem w tym zestawieniu — i nic, co wydarzyło się w pierwszych 48 godzinach od premiery Nex-N2.5 Pro, tego nie zmienia. Jeśli Twój zespół ocenia otwarte modele computer-use pod kątem przyszłego projektu, Nex-N2.5 Pro powinien trafić na listę obserwacyjną: multimodalny MoE z 397B parametrów o rozsądnych wymaganiach sprzętowych dla samodzielnego hostingu i przekonujących wynikach benchmarków ze średniej półki to dokładnie ten rodzaj otwartego modelu, który potrafi zmienić kształt krzywej kosztów — pod warunkiem że wagi faktycznie się pojawią, a wyniki z karty modelu przetrwają niezależne testy. Racjonalne podejście to jedno i drugie naraz: utrzymać sprawdzonego lidera na ścieżce krytycznej i pozwolić, by dzień publikacji wag zdecydował, czy nowicjusz zasłuży na wypróbowanie. To jedyne porównanie w tym zestawieniu, które jeszcze nie miało miejsca — i właśnie ono będzie się naprawdę liczyć.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
