
Nex-N2.5 Mini: Otwarte wagi dostępne od premiery — najmniejszy agent obsługi komputera Nex-AGI to punkt wejścia.
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligencja49Kod
Sposobem na sprawdzenie, czy otwarte agenty do obsługi komputera są już gotowe, jest obecnie model, który można pobrać tego samego dnia, w którym go ogłoszono. Nex-AGI wprowadziło swoją rodzinę Nex-N2.5 8 września 2026 roku — trzy warianty agentowe: Nex-N2.5 Mini, Nex-N2.5 Pro i Nex-N2.5 Max — a wariant, który można pobrać i od razu uruchomić, to ten najmniejszy. Nex-N2.5 Mini ma swoje wagi na licencji Apache-2.0 dostępne na Hugging Face w szesnastu fragmentach BF16 — około 35 miliardów parametrów, przy czym przy każdym tokenie aktywowanych jest podobno ~3 miliardy — oraz referencyjne wdrożenie na dwóch kartach H100. Jego większy multimodalny brat, Nex-N2.5 Pro, w chwili pisania tego tekstu nadal ma status „coming soon”, z kolei czysto tekstowy Nex-N2.5 Max o 1,6 biliona parametrów również jest już dostępny, ale zanim da się go uruchomić, wymaga szesnastu H200 na dwóch węzłach. Dla każdego, kto testuje tezę stojącą za tą rodziną — że otwarte modele agentowe potrafią sprawdzić się w długoterminowej obsłudze komputera, a nie tylko odpowiadać na pytania — Mini jest punktem wejścia.
Kim jest Nex-AGI? To nowa nazwa, a premiera nosi znamiona pierwszego publicznego wydania. Relacje z ogłoszenia opisują to przedsięwzięcie jako współpracę kilku szanghajskich organizacji – Shanghai Innovation Institute, Shanghai Qiji Zhifeng, Mosi Intelligence i Kuafu Technology – przy czym rodzina modeli jest pozycjonowana jako open-source, a zespół działa pod pseudonimem @NexEcosystem. Karta modelu przypisuje Nex-N2.5-mini i Nex-N2.5-Pro kontynuację „multimodalnych fundamentów Nex-N2”, wcześniejszego wydania Nex, którego wagi są już otwarte. Co jest tu naprawdę nowe, to sposób przedstawienia: Nex-AGI twierdzi, że zbudował te modele do zadań o długim horyzoncie czasowym w rzeczywistych środowiskach – obsługi komputera, prowadzenia przeglądarki, wykonywania i testowania kodu oraz korygowania kursu na podstawie tego, co widzi na ekranie – i opublikował wagi, aby to twierdzenie można było sprawdzić.
Trzy poziomy, jedno ogłoszenie
Rodzina dzieli się według skali i modalności, a różnice znaczą więcej niż wspólna nazwa:
• Nex-N2.5 Mini — ok. 35 mld parametrów łącznie / ~3 mld aktywnych, model multimodalny przyjmujący na wejściu obrazy i tekst, przeznaczony do wizualnej obsługi komputera, przeglądania internetu oraz zadań wymagających informacji zwrotnej z interfejsu. Referencyjne wdrożenie to pojedynczy węzeł z dwoma układami H100.
• Nex-N2.5 Pro — deklarowane 397B parametrów łącznie / ~17B aktywnych, również multimodalny, do bardziej wymagających obciążeń związanych z obsługą komputera. Referencyjne wdrożenie to osiem układów H100. Jego wagi nie były dostępne do pobrania w momencie premiery.
• Nex-N2.5 Max — 1.6T łącznie / ~49B aktywnych, tylko tekst, i według Nex-AGI to „pierwszy kompletny wysiłek po treningu w skali biliona parametrów”. Karta mówi, że jest zbudowany na fundamencie DeepSeek-V4-Pro-Base. Referencyjne wdrożenie to 16×H200 w dwóch węzłach.
Wszystkie trzy to mixture-of-experts. Mini i Pro należą do rodziny modeli Qwen3.5 — materiały premierowe Nex-AGI opisują oba jako post-trenowane z wariantów Qwen3.5, a konfiguracja samego Mini nosi tag architektury qwen3_5_moe — podczas gdy Max jest odstającym modelem opartym na DeepSeek. Tak więc rodzina to nie jeden przepis w trzech rozmiarach; to dwa przepisy, przy czym multimodalne poziomy „działające na ekranie” mają wspólną linię, a gigant rozumowania tekstowego – inną.
Czym tak naprawdę jest Nex-N2.5 Mini, który został wysłany.
Repozytorium Hugging Face dla nex-agi/Nex-N2.5-mini to prawdziwy, możliwy do pobrania checkpoint, a nie placeholder — 16 shardów safetensors o łącznej wadze około 70 GB, BF16, licencja Apache-2.0, utworzone po raz pierwszy 8 września. Plik konfiguracyjny jest na tyle szczegółowy, że można na jego podstawie projektować:
Architektura — Qwen3_5MoeForConditionalGeneration, rodzina qwen3_5_moe, ze stosem wizyjnym: karta oznacza go jako image-text-to-text, a repozytorium zawiera preprocessor_config.json obok konfiguracji tekstowej.
• Kształt — 40 warstw, ukryty rozmiar 2048, grouped-query attention z 16 głowami zapytań i 2 głowami KV, słownik o rozmiarze 248 320.
• MoE — 256 routowanych ekspertów, z których 8 jest aktywnych na token, plus wspólny ekspert, rozmiar pośredni 512 — profil o rzadkiej aktywacji, dzięki któremu model klasy „35B” z ~3B aktywnych parametrów może działać na dwóch układach H100.
• Kontekst — max_position_embeddings wynoszące 262 144 tokenów w wydanej konfiguracji, ta sama wartość 262K, która pojawia się w przepisach wdrożeniowych całej rodziny.
• Wagi i licencja — BF16, Apache-2.0, bez ograniczeń; repozytorium wskazuje także na mirror ModelScope oraz na organizację GitHub (nex-agi), która zawiera przepisy wdrożeniowe dla tej rodziny.
Dokumentacja wdrożeniowa Nex-AGI to część, w której większość otwartych wydań popełnia błędy, a to akurat wypada wyjątkowo dobrze. Model Mini jest serwowany przez niestandardowy obraz Dockera SGLang (nexagi/sglang:v0.5.18-nex-patch) na pojedynczym węźle z dwoma układami H100 przy użyciu tensor parallelism 2. Zalecane parametry próbkowania to temperatura 0.7, top_p 0.95, top_k 40. Wywoływanie narzędzi odbywa się przez parser qwen3_coder SGLang, a model udostępnia trzy tryby rozumowania za pośrednictwem pola reasoning_effort: „none" oznaczający tryb bez myślenia, „medium" (adaptacyjny domyślny) oraz „high" oznaczający myślenie zawsze włączone. W przypadku małego modelu agentowego kontrola trybu myślenia stanowi różnicę między użyteczną pętlą agenta a wolną, a przy tym jest wbudowana w przepis serwowania, a nie pozostawiona użytkownikowi.

Wagi: co faktycznie można pobrać
Dokładne określenie statusu trzech wariantów w dniu premiery jest istotne, ponieważ ogłoszenie i repozytoria nie do końca się ze sobą zgadzają. W chwili pisania tego tekstu model Mini jest w pełni dostępny do pobrania na licencji Apache-2.0 — na tym opiera się ten artykuł. Nex-N2.5 Max również jest dostępny, a jego repozytorium na Hugging Face zawiera 644 shardy safetensors, choć odtworzenie jego biliona parametrów to projekt wymagający 16×H200. Nex-N2.5 Pro pozostaje wstrzymany: jego repozytorium na Hugging Face istnieje, ale zawiera tylko plik README i ilustracje, bez shardów modelu, a karta nadal informuje, że wagi mają się pojawić. Jeśli interesuje Cię duży wariant multimodalny, to właśnie tę lukę warto obserwować — materiały premierowe opisują Pro jako najmocniejszy model rodziny do obsługi komputera, a jednocześnie to ten, którego nie można jeszcze uruchomić lokalnie.

Liczby, które podał Nex-AGI — i zastrzeżenie, które im towarzyszy
Karta modelu Nex-AGI zawiera pełną tabelę benchmarków dla modelu Mini, a każda podana w niej wartość pochodzi z raportów samego dostawcy. Do chwili powstania tego tekstu nie opublikowano żadnego niezależnego uruchomienia testów, a karta wprost stwierdza, że wyniki pochodzą z oficjalnych rankingów benchmarkowych i najnowszych raportów ewaluacyjnych tam, gdzie są dostępne, oraz z własnych ewaluacji Nex-AGI w pozostałych przypadkach. Wyniki dotyczące kodowania uzyskano za pomocą środowiska testowego NexAU zespołu; wyniki dotyczące korzystania z komputera i przeglądarki uzyskano przy użyciu środowiska NexCUA, które — według karty — ma zostać udostępnione jako open source. Traktuj wiersze nagłówkowe jako scenariusz optymistyczny dostawcy, dopóki neutralna strona nie odtworzy tych wyników.
W tym ujęciu raportowane wyniki Mini to: w zadaniach tekstowych i programistycznych Terminal-Bench 2.1 – 73,4, SWE-Bench Pro – 43,8, DeepSWE v1.1 – 36,1, AutomationBench v1.0.6 – 32,3, Toolathlon Verified – 54,6, BrowseComp – 83,4, a GDPval-AA v2 osiąga 1446. Po stronie multimodalnej / obsługi komputera najbardziej rzucają się w oczy OSWorld-Verified – 71,2, WebArena-Verified – 63,4, WebTest – 48,6 (uruchomiony w trybie oracle względem list kontrolnych opartych na prawdzie podstawowej), OSWorld-G – 82,9 oraz OmniDoc – 89,7, a obok nich skromniejsze wyniki OSWorld-2 (30,5) i Vision2Web (52,9).
Na wstępie dwie uwagi. Po pierwsze, OSWorld-Verified i OSWorld-2 to różne zestawy testów — jeden to zweryfikowany podzbiór oceniany na podstawie stanu środowiska po wykonaniu zadania, drugi to nowszy i generalnie ostrzejszy przebieg — więc 71,2 na jednym i 30,5 na drugim nie są sprzeczne; to różne testy i tabela Nexa umieszcza je w osobnych kolumnach. Po drugie, w każdym wierszu tabeli rodziny Mini wypada niżej niż Pro i Max, a szczyt każdej kolumny należy do obecnego modelu granicznego, takiego jak Claude Opus 5 czy GPT-5.6 Sol. Historia Mini nie polega na tym, że pokonuje modele graniczne, lecz na tym, że otwarty model z ok. 3 mld aktywnych parametrów osiąga konkurencyjne wyniki w benchmarkach obsługi komputera przy dwóch układach H100. Czy to się obroni, to właśnie pytanie, na które otwarte wagi pozwalają ci odpowiedzieć samodzielnie.
Dziś uruchamiam Nex-N2.5 Mini
{{1}}Przepis na dwa H100 sprawia, że Mini jest najtańszym sposobem, by w praktyce sprawdzić główną tezę rodziny. Ponieważ architektura to standardowy Qwen3.5-MoE z parserem wywołań narzędzi qwen3_coder, model działa w forku Nex-AGI SGLang bez dedykowanego kodu inferencyjnego, a zalecane ustawienia są publikowane, a nie pozostawione inżynierii wstecznej.{{/1}} {{2}}Przed startem nastaw się uczciwie na to, że jednodniowy checkpoint z nowiutkim harnessem to eksperyment, a nie zależność.{{/2}} {{3}}Liczba pobrań z repozytorium Mini wciąż jest jednocyfrowa i w chwili, gdy to pisano, nikt z zewnątrz nie zdążył opublikować niezależnej ewaluacji — co jest normalne w przypadku modelu wydanego wczoraj i właśnie dlatego dwa H100 mają znaczenie: możesz samodzielnie przeprowadzić ten eksperyment w tym tygodniu, zamiast czekać, aż zrobi to ktoś inny.{{/3}}

Jeśli wolisz porównać Mini z czołowymi agentami w jego własnej tabeli benchmarków, niż ręcznie dostrajać pojedyncze wdrożenie, to właśnie tam warstwa routingu pokazuje swoją wartość. Gdy hostowany dostawca udostępnia Nex-N2.5 Mini — a modele, z którymi jest porównywany, są już dostępne przez routery — jedno API obejmujące 200+ modeli, z cenami dostawcy przekazywanymi bez narzutu (0% marży) i automatycznym failover, to tani sposób na uruchomienie tego samego zadania na kilku z nich bez potrzeby drugiej integracji. W OrcaRouter to standardowa konfiguracja dla każdego modelu, który rutujemy: ten sam klucz, ten sam format wywołania, cena dostawcy bez niczego dodanego. To ma największe znaczenie w przypadku tak niesprawdzonego modelu, jak ten, bo to właśnie failover pozwala wypróbować go na prawdziwej ścieżce bez stawiania tej ścieżki na szali.
Kto powinien ciągnąć te ciężary?
Pobierz je, jeśli pracujesz z agentami obsługującymi komputer, automatyzacją przeglądarek lub korzystaniem z narzędzi na podstawie danych wizualnych i chcesz mieć model na licencji permisywnej, nadający się do samodzielnego hostowania, który możesz porównywać w benchmarkach z hostowanymi liderami. Licencja Apache-2.0 usuwa typowe tarcia przy wydaniu z chińskiego laboratorium, wdrożenie na dwóch układach H100 jest w zasięgu poważnego zespołu pracującego nad agentami, a kontrola nakładu rozumowania oraz prawdziwy parser wywołań narzędzi czynią z niego wiarygodny poligon testowy, a nie zabawkę. Wstrzymaj się, jeśli potrzebujesz najmocniejszego modelu do obsługi komputera w tej rodzinie — to rola Pro, a wagi Pro są właśnie tymi, których jeszcze nie opublikowano. I pozostaw etykietę producenta w każdym wierszu wyników benchmarku, dopóki nie potwierdzi ich niezależne uruchomienie; wynik 71.2 w OSWorld-Verified osiągnięty przez otwarty model o ~3B aktywnych parametrach to uderzające twierdzenie, czyli dokładnie takie, które warto zweryfikować we własnym środowisku testowym, zanim na nim cokolwiek zbudujesz.
Na co zwrócić uwagę dalej. Publikacja wag modelu Pro to pojedynczy największy sygnał — przekształca rodzinę z „Mini plus gigant o bilionie parametrów” w pełną linię produktów opisaną w materiałach premierowych. Po drugie, otwarcie kodu źródłowego środowiska NexCUA, bez którego wyników dotyczących obsługi komputera nie da się niezależnie odtworzyć w ramach tego samego protokołu. Po trzecie, pierwszy neutralny przebieg — od Artificial Analysis, laboratorium uniwersyteckiego lub praktyka, którzy opublikują reprodukcję oznaczoną jako OSWorld-Verified. Gdy którykolwiek z tych trzech elementów się pojawi, pytanie, jakie stawia ta premiera — czy otwarte modele agentowe naprawdę domknęły lukę do hostowanych stosów obsługi komputera — przestaje być kwestią tabel sprzedawców.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
