Nex-N2.5 Pro vs GPT-5.6 Sol hero — wygenerowana karta tytułowa z napisem „Nex-N2.5 Pro vs GPT-5.6 Sol", podtytułem „Jednodniowy otwarty model kontra najgłębszy rekord produkcyjny w branży" oraz nadtytułem „OpenAI vs Nex-AGI — wrzesień 2026".
Guides & Insights

Nex-N2.5 Pro vs GPT-5.6 Sol: Numer producenta nowicjusza odstaje od niezależnego numeru dotychczasowego lidera.

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Weźmy ten jedyny benchmark, na którym obie strony mają wyniki obok siebie — kolejność działań jest w nim niewłaściwa z punktu widzenia premiery. Karta Nex-AGI podaje dla Nex-N2.5 Pro wynik 56,4 punktu w OSWorld-2, uzyskany na własnej platformie pomiarowej sojuszu, NexCUA, której opinia publiczna nie widziała. Tablica liderów OSWorld 2.0 przygotowana przez BenchLM, zaktualizowana 29 sierpnia, sytuuje GPT-5.6 Sol na 62,6 — to niezależny wynik, który bezapelacyjnie bije liczbę podaną przez producenta nowicjusza. Na rodzimym terenie modelu, który ma zaledwie jeden dzień — czyli w obsłudze komputera na podstawie czytania ekranu, jedynej rzeczy, do której został zaprojektowany — dojrzały generalista, z którym jest porównywany, nie potrzebuje nawet gwiazdki, by wyjść na prowadzenie. Nex-N2.5 Pro vs GPT-5.6 Sol nie jest wyrównanym pojedynkiem w żadnym wymiarze, który zmierzył ktoś inny niż producent nowicjusza. To studium przypadku pokazujące, ile naprawdę wart jest wynik opublikowany przez producenta; warto je przeczytać już choćby z tego powodu.

Te dwa modele ledwie można uznać za rywali pod względem zamysłu. Nex-N2.5 Pro, ogłoszony 8 września 2026 roku, to rzadki model typu mixture-of-experts o 397 miliardach parametrów, z których aktywnie wykorzystywanych jest około 17 miliardów; multimodalny (na wejściu tekst i obraz, na wyjściu tekst), dotrenowany na bazie linii Qwen3.5 i zbudowany do obsługi komputerów oraz przeglądarek dzięki wizualnej pętli sprzężenia zwrotnego. Jego wagi na licencji Apache-2.0 w serwisie Hugging Face wciąż oznaczone są jako „coming soon”, a jedyne działające wersje to bezpłatne hostowane punkty końcowe Nex-AGI, do których prowadzą linki z karty modelu. GPT-5.6 Sol to flagowy model OpenAI do „najtrudniejszych zadań” — głębokiego rozumowania wieloetapowego, inżynierii oprogramowania na dużą skalę i długofalowych przepływów pracy agentów — dostępny w API od 9 lipca, o zamkniętych wagach, który obecnie dźwiga ciężar bycia punktem odniesienia na granicy możliwości aż do czasu, gdy OpenAI wypuściło 3 września GPT-6 Astra. O ile Nex-N2.5 Pro jest specjalistą, który nie wypuścił jeszcze własnych wag, o tyle GPT-5.6 Sol to sprawdzony generalista, który od dwóch miesięcy obsługuje najbardziej wymagający ruch produkcyjny w branży.

GPT-5.6 Sol to model z plikiem

Zacznijmy od tego, co ma Sol, a czego nie ma Nex-N2.5 Pro: od wyników. Od 9 lipca GPT-5.6 Sol był przepuszczany przez niezależne harnessy, poddawany intensywnym testom przez badaczy bezpieczeństwa i włączany do frameworków agentowych oraz przepływów pracy Codex. Jego niezależne pomiary są dogłębne i publiczne: 61 w Artificial Analysis Intelligence Index przy maksymalnym rozumowaniu, 88,0 w Terminal-Bench 2.1 i 73,0 w DeepSWE zmierzone przez ten sam niezależny harness, a także zmierzona prędkość generowania wynosząca około 71 tokenów na sekundę przy koszcie mniej więcej 0,95 dolara za zadanie w Intelligence Index. Nic z tych rzeczy nie czyni go niepokonanym — OpenAI umieściło już nad nim GPT-6 Astra — ale każda z tych liczb to pomiar wykonany przez kogoś innego niż OpenAI. Nex-N2.5 Pro nie ma żadnego niezależnego wpisu nigdzie z przyczyn strukturalnych: nikt spoza sojuszu nie może go uruchomić.

Jedyny benchmark, w którym oba mają liczbę.

Porównanie OSWorld to najczystszy dostępny odczyt, więc zanim zostanie użyte, należy przedstawić związane z nim zastrzeżenia. Wynik Nex-N2.5 Pro wynoszący 56.4 to własny pomiar Nex-AGI na OSWorld-2 przez harness NexCUA. Wynik GPT-5.6 Sol wynoszący 62.6 pochodzi z listy liderów OSWorld 2.0 prowadzonej przez BenchLM – zewnętrznego zestawienia z 29 sierpnia 2026 roku, które wymienia piętnaście modeli i stawia Claude Opus 5 na pierwszym miejscu z wynikiem 70.6, GPT-5.6 Sol na drugim z 62.6, a GPT-5.6 Terra na trzecim z 50.2. „OSWorld-2” i „OSWorld 2.0” to bliscy krewni, ale nie udowodniono, że są identyczne, więc dokładną cztero- lub sześciopunktową różnicę należy traktować jako kierunkową, a nie precyzyjną. To, co przetrwa zastrzeżenia, to porządek: według najlepszej liczby, jaką każda strona może przedstawić, niezależny wynik Sol bije wynik Nex od dostawcy w benchmarku, który Nex wybrał do publikacji. Nowicjusz, którego własny wynik jest niższy niż niezależny wynik obecnego lidera, nie przedstawił przekonującego argumentu za zmianą.

A two-column scoreboard titled 'Nex-N2.5 Pro vs GPT-5.6 Sol — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Weights Apache-2.0 pending; OSWorld 2.0 56.4 vendor-reported; AA Index no score yet; Context 262,144; Price free hosted / no list. Right column GPT-5.6 Sol: Released Jul 9 2026; Weights closed; OSWorld 2.0 62.6 independent; AA Index 61 (max); Context ~1.05M; Price $4.00 / $20.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Sol OSWorld per BenchLM Aug 29 and Index per Artificial Analysis.'

Koperty specyfikacji

Pozostała część arkusza specyfikacji podąża w tym samym kierunku:

Wydano — Nex-N2.5 Pro: 8 września 2026 (hostowane punkty końcowe działają, wagi w przygotowaniu). GPT-5.6 Sol: 9 lipca 2026, ogólnie dostępny.

Skala — Nex-N2.5 Pro: 397B łącznie / ~17B aktywnych MoE. GPT-5.6 Sol: liczba parametrów nieujawniona.

Modalność — Nex-N2.5 Pro: tekst i obraz na wejściu, tekst na wyjściu, pętla wizyjna do obsługi komputera. GPT-5.6 Sol: tekst, obraz i pliki na wejściu, tekst na wyjściu, z wywoływaniem narzędzi i trybem JSON.

Kontekst / wyjście — Nex-N2.5 Pro: kontekst 262 144 tokenów. GPT-5.6 Sol: kontekst ~1,05 mln tokenów, górny limit wyjścia 128 tys.

Kontrola rozumowania — Nex-N2.5 Pro: brak / średnie (adaptacyjne, domyślne) / wysokie. GPT-5.6 Sol: wysiłek rozumowania do maksimum, plus osobny szybki poziom przetwarzania.

Wagi — Nex-N2.5 Pro: Apache-2.0, wkrótce. GPT-5.6 Sol: zamknięte.

Cena za 1 mln tokenów — Nex-N2.5 Pro: bezpłatny poziom hostowany, brak ceny katalogowej. GPT-5.6 Sol: $4.00 / $20.00 — promocyjna cena katalogowa obowiązująca od 21 sierpnia, $0.40 za tokeny wejściowe z pamięci podręcznej, przejście na stawkę $8.00 / $30.00 powyżej 272 tys. tokenów wejściowych.

Kontekst ~1,05 mln tokenów i górny limit wyjścia 128K w Sol przyćmiewają okno 262K w Nex-N2.5 Pro w pracy długoterminowej, a cena Sol – choć daleka od taniej – jest ustaloną liczbą, którą można uwzględnić w budżecie. Darmowy poziom Nex-N2.5 Pro to jedyna liczba po jego stronie, i nie jest to cena.

Ile warty jest wczorajszy wynik

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Każde twierdzenie benchmarkowe dotyczące Nex-N2.5 Pro — OSWorld-2 z wynikiem 56,4, Terminal-Bench 2.1 z wynikiem 82,7, SWE-Bench Pro z wynikiem 61,2, BrowseComp z wynikiem 89,7 — ma jedną wspólną cechę: stworzył je Nex-AGI za pomocą środowiska testowego, które sojusz obiecuje udostępnić jako open source, ale jak dotąd tego nie zrobił. Żadna z tych wartości nie została niezależnie odtworzona — i nie mogła zostać: wagi modelu nie są dostępne do pobrania, a baner „coming soon” nie ma przypisanej daty. W tym zestawieniu ma to większe znaczenie niż w większości innych, ponieważ model, z którym porównywany jest Nex-N2.5 Pro, ma najdłuższą w branży historię niezależnych testów. Gdy cała baza dowodowa pretendenta opiera się na jego własnych deklaracjach, a lidera — nie, ciężar dowodu spoczywa w całości na pretendencie, a darmowy endpoint nie zwalnia go z tego obowiązku. Gdy tylko pojawią się shardy i niezależne laboratorium uruchomi Nex-N2.5 Pro, liczby z tego artykułu będzie można zweryfikować, a porównanie stanie się realne. Do tego czasu właściwym określeniem jest „wczorajszy wynik” — wynik, którego nie można sprawdzić na modelu, którego nie można uruchomić.

Cena, trasa i kształt decyzji

Koszt to obszar, w którym obie strony są najmniej porównywalne, bo tylko jedna strona ma koszt. Stawka GPT-5.6 Sol w wysokości $4.00 / $20.00 to promocyjna cena katalogowa OpenAI obowiązująca od 21 sierpnia i według zapowiedzi mająca się utrzymać co najmniej do 21 listopada, obniżona z $5.00 / $30.00 — cięcie, które sprawiło, że flagowy model stał się znacznie bardziej przystępny cenowo przy pracy agentowej o dużej skali, i które router typu pass-through odzwierciedla tego samego dnia, w którym wprowadza je OpenAI. Sol jest na OrcaRouter po tej cenie katalogowej, bez narzutu, z warstwą wsadową i szybką dostępnymi za tym samym kluczem API co 200+ innych modeli, więc zespół może kierować zapytania wymagające głębi OpenAI do Sol, a pozostałe do tańszych modeli. Nex-N2.5 Pro nie ma ceny katalogowej, tylko darmowe hostowane punkty końcowe — to dobry sposób na ewaluację modelu, ale słaba podstawa do budżetu produkcyjnego. Nie można zaplanować wydatków wokół liczby, która nie istnieje, ani architektury wokół wag, które nie zostały udostępnione.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), marked FEATURED, showing the header stats $4.00 input and $20.00 output per million tokens and the byline 'by OpenAI - 2026-07-09'.

Decyzja, do której faktycznie zmusza to zestawienie, dotyczy ryzyka, a nie możliwości. Jeśli potrzebujesz modelu, który nadal będzie dostępny w przyszłym kwartale, ma znaną cenę, znany profil awarii i za sobą miesiące testów kontradyktoryjnych, GPT-5.6 Sol jest racjonalnym wyborem — a fakt, że OpenAI wypuściło ponad nim model GPT-6 Astra, tylko wzmacnia tę argumentację, ponieważ Sol jest teraz sprawdzonym koniem roboczym z obniżką ceny wycelowaną dokładnie w wolumen produkcyjny. Jeśli budujesz agentów obsługi komputera na otwartych wagach i możesz sobie pozwolić na czekanie na coś weryfikowalnego, Nex-N2.5 Pro jest wart uwagi — multimodalny specjalista z 17B aktywnych parametrów to dokładnie ten typ modelu, który wielokrotnie podcinał koszty zamkniętej granicy. Ale słowem kluczowym jest właśnie „obserwowanie”. Pod każdym względem mierzonym przez kogokolwiek innego niż jego twórca Nex-N2.5 Pro ustępuje modelowi z plikiem i dopóki wagi nie zostaną upublicznione, na tym porównanie się kończy.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie