
Apodex 1.1, wyjaśniony: 44 punkty w Indeksie Inteligencji, prawdziwa siła agentowa — i haczyk dotyczący wiarygodności wiedzy
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 177 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1323 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Apodex 1.1 ma tydzień, jest własnościowy i do tego tygodnia był głównie laboratoryjną ciekawostką. Potem Artificial Analysis opublikowało pierwszą niezależną ocenę modelu — pierwszą dla Apodexa na platformie — a tablica wyników zrobiła coś niezwykłego: Apodex 1.1 zdobył 44 punkty w Artificial Analysis Intelligence Index, sklasyfikowany na 11. miejscu spośród 177, jednocześnie notując wyniki w pracy agentowej, które pobiły każdy model w swojej klasie inteligencji, w tym DeepSeek V4 Pro, Qwen3.7 Max i Kimi K2.6. Ten sam raport ujawnił drugą, brzydszą liczbę: wynik wiarygodności wiedzy na tyle słaby, że może zmienić decyzję o wykonywaniu na nim prawdziwej pracy. Jego siostrzany model z otwartymi wagami, Apodex 1.1 Mini, to model, który większość ludzi może faktycznie uruchomić. Oto, co mówi ta ocena, czego nie mówi i kogo to powinno obchodzić.
Apodex, firma AI założona przez Chen Tianqiao, wydała rodzinę modeli 24 sierpnia 2026 roku, wraz z opublikowaną na arXiv pracą podpisaną przez 70 autorów, zatytułowaną „Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). Flagowy model jest zamknięty — według raportu producenta ma około 397 mld parametrów — i powstał wokół tezy, że prawdziwym wąskim gardłem dla agentów nie jest surowa inteligencja, lecz środowisko, w którym działają. Dlatego Apodex 1.1 został wytrenowany do pracy bezpośrednio z plikami, wyszukiwaniem i kodem w długich horyzontach czasowych, ze wspólnym środowiskiem wykonawczym („AgentOS"), które koordynuje do 150 równoległych sub-agentów i prowadzi rejestr pochodzenia każdego kroku. Otwartą częścią jest model siostrzany: Apodex 1.1 Mini, model MoE klasy 35B, dostrojony na bazie modelu Alibaba Qwen3.5-35B-A3B, udostępniony na licencji Apache-2.0 wraz z towarzyszącym środowiskiem dla agentów o nazwie FrontierAgent. Pełny model jest dostępny wyłącznie przez własne API Apodex i internetowe stanowisko robocze; Mini można hostować samodzielnie albo wcale.
Co oznacza 44 w Indeksie Inteligencji
Indeks Artificial Analysis Intelligence to ważona agregacja zestawów testów porównawczych platformy — w tym ewaluacji agentowych, takich jak GDPval-AA v2 i Terminal-Bench, a także komponentów dotyczących rozumowania, matematyki i wiedzy. Wynik 44 plasuje Apodex 1.1 na 11. miejscu wśród 177 modeli, znacznie powyżej mediany wynoszącej 18. Umieszcza to również model w zatłoczonej, interesującej kategorii: Kimi K2.6 (45), MiniMax-M3 (45) i Inkling (42) mieszczą się w granicach trzech punktów, a Apodex 1.1 jest jedynym z tej grupy, którego nazwa była nieznana większości użytkowników AI tydzień temu. Artificial Analysis zaznacza, że strona obejmuje wersję modelu z rozumowaniem, a wariant bez rozumowania również może istnieć.

Główny wynik indeksu nie jest tym, co czyni ten model interesującym. Interesujący jest ze względu na to, gdzie jego mocne i słabe strony sytuują się względem tego wyniku — i to właśnie porównanie poziomów czyni konkretnym.
Gdzie bije powyżej swojej kategorii: ewaluacje agentowe i pracy opartej na wiedzy
W dwóch komponentach indeksu mierzących rzeczywistą pracę agentową, Apodex 1.1 wypada lepiej niż jego sąsiedzi w odległości 44 punktów. W GDPval-AA v2 — benchmarku oceniającym zdolność agenta do wykonywania realistycznych zadań biurowych od początku do końca — Apodex 1.1 osiąga Elo 1348, wyprzedzając DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) i Kimi K2.6 (1202). W TerminalBench v2.1, który testuje agenta pracującego w terminalu, zdobywa 70%, wyprzedzając Kimi K2.6 (66%) i tuż za Qwen3.7 Max (75%). Są to niezależne liczby opracowane przez Artificial Analysis i są najmocniejszym dowodem w raporcie, że trening zorientowany na środowisko działa.
Własne deklaracje producenta dotyczące benchmarków idą jeszcze dalej i należy je traktować jako dane raportowane przez producenta, dopóki ktoś ich nie odtworzy: APEX-Agents 38,5, GDPVal 78,8, SWE-bench Verified 77,7%, Terminal-Bench 2.1 70,8%, Humanity's Last Exam 56,1% z narzędziami, DeepSearchQA 92,4%, FrontierFinance 54,3 oraz FrontierScience-Research 63,3. To, co sprawia, że profil agentowy jest wiarygodny, a nie jest jedynie marketingowym szumem, to architektura, która za nim stoi: skalowanie środowiska (poszerzanie różnorodności środowisk plików wykonywalnych, wyszukiwania i kodu używanych podczas treningu) oraz skalowanie koordynacji agentowej (uczenie modelu rozkładania zadań o długim horyzoncie czasowym na części, delegowania równoległej pracy, integrowania wyników asynchronicznych i ponownego planowania). Tryb „Agent Team" uruchamia do 150 subagentów przy zadaniach wyszukiwania i syntezy, a wbudowany krok weryfikacji („Statement Review") sprawdza wnioski, zanim zostaną dostarczone. Innymi słowy: to model zaprojektowany tak, by się mylić, sprawdzać samego siebie i naprawiać błędy — a nie recytować fakty z pamięci.
Ukryty koszt całej tej sprawczości: rozwlekłość
Ten projekt pojawia się w tabeli efektywności kosztowej Artificial Analysis jako najwyraźniejsza słabość modelu po wiedzy: jest bardzo rozwlekły. Uruchomienie pełnego Indeksu Inteligencji zużyło 180 mln tokenów wyjściowych — wobec mediany 67 mln — oraz około 17 000 tokenów wyjściowych na zadanie benchmarkowe, w porównaniu z około 9 400 dla Qwen3.7 Max i 8 100 dla MiniMax-M3. Łącznie pełna ocena kosztowała 618,41 USD wydatków na API, według Artificial Analysis.

Cena, która generuje ten rachunek: 0,30 USD za milion tokenów wejściowych i 3,00 USD za milion wyjściowych — 0,03 USD za trafienie w pamięci podręcznej dla buforowanych danych wejściowych, czyli 90% zniżki — co daje około 0,38 USD za milion przy typowym miksie 7:2:1 cache/wejście/wyjście. Obie ceny za token przewyższają mediany platformy (0,25 USD za wejście, 0,90 USD za wyjście). Mimo to szacunkowy koszt zadania w Artificial Analysis nadal plasuje Apodex 1.1 na poziomie około 0,05 USD za zadanie benchmarkowe, taniej niż Qwen3.7 Max (~0,07 USD) i Kimi K2.6 (~0,06 USD). To uzgodnienie ma znaczenie dla budżetowania: jego tokeny są na tyle tanie, że nawet duża gadatliwość pozostaje konkurencyjna w przeliczeniu na zadanie — ryzykiem kosztowym jest wolumen, a nie stawka. Jeśli postawisz na nim długotrwałego agenta, rachunek zależy od tego, ile ten agent mówi, a mówi dużo.
Jedna uwaga cenowa przed zaplanowaniem budżetu: 0,30 USD / 3,00 USD to cennik własny dostawcy. Platforma routingu, która przekazuje ceny katalogowe dostawcy z zerową marżą, pobiera dokładnie tę kwotę, a każda przyszła obniżka cen Apodex pojawia się tego samego dnia, w którym zostanie ogłoszona.
Haczyk: słaba wiarygodność wiedzy.
Oto liczba, którą relacje z premiery w większości pomijają. W teście AA-Omniscience, sondzie niezawodności wiedzy od Artificial Analysis, Apodex 1.1 uzyskuje -21.9. Próbuje odpowiedzieć na 87% pytań zamiast odmawiać, ale tylko 32% z nich rozwiązuje poprawnie, a wskaźnik halucynacji wynosi 78.4%. Dla modelu pozycjonowanego jako rozwiązanie do ciężkich zadań to poważne rozdwojenie osobowości: mocny w wykonywaniu agentowym, słaby w ugruntowanej wiedzy.
Te dwa fakty są ze sobą powiązane, a nie sprzeczne. Benchmarki agentowe nagradzają działanie w środowisku — wydawanie wywołań do narzędzi, iterowanie, odzyskiwanie stabilności — więc model może osiągać tam dobre wyniki, mimo słabej zdolności przywoływania, ponieważ środowisko to zapamiętuje. Sam projekt to zakłada: Statement Review służy do sprawdzania wyników, a warsztat opiera się na weryfikacji, a nie na tym, by model miał rację z pamięci. Praktyczny wniosek brzmi wprost: nie kieruj Apodex 1.1 do zadań, które wymagają od niego wydobywania faktów z własnych wag. Kieruj go do zadań długoterminowych, w których jego pracę można zweryfikować na podstawie plików, kodu i źródeł — i weryfikuj efekty.
Otwarty odpowiednik: Apodex 1.1 Mini i FrontierAgent
Jeśli problemem są zamknięte drzwi flagowca, to przeciwwagą jest otwarta połowa rodziny. Apodex 1.1 Mini to model MoE o ~35B parametrów łącznie / ~3B aktywnych, dostrojony z Qwen3.5-35B-A3B (bazowego modelu Alibaba opublikowanego jako open source w lutym 2026), wydany na licencji Apache-2.0 z oknem kontekstowym 262K oraz wariantami FP8, FP4 i GPTQ-Int4 na Hugging Face. Jego najważniejszy wynik deklarowany przez producenta to 50.2 w FrontierFinance (pierwsze miejsce w rankingu Apodex) i 27.7 w APEX-Agents z włączonym harnessem Agent Team. A FrontierAgent — open-source'owe środowisko uruchomieniowe dołączone do niego — jest naprawdę interesującym artefaktem: harness oparty na terminalu z trybami ReAct i Agent Team, pracą na plikach w piaskownicy, bramkami zatwierdzania, punktami kontrolnymi i śladami, wszystko komunikujące się z dowolnym punktem końcowym zgodnym z OpenAI.
Dwie rzeczy warto wiedzieć, zanim zdecydujesz się na self-hosting. Po pierwsze, Mini to model po fine-tuningu, a nie model z najwyższej półki — jego wyniki benchmarków czytaj tak samo, jak tabelę wyników dostawcy flagowego modelu: niezreprodukowane, z wliczonym harnessem, wybrane przez dostawcę. Po drugie, jego zachowanie dziedziczy po modelu bazowym: jeśli chcesz sprawdzić, czy bazowy Qwen3.5-35B-A3B już wykonuje twoje zadanie, nie potrzebujesz do tego GPU ani stosu serwującego — model bazowy jest na wyciągnięcie jednego wywołania API.
Kto powinien dziś korzystać z Apodex 1.1?
Flagowy model jest wczesny, zamknięty i na razie dostępny wyłącznie przez API i internetowe środowisko pracy samego dostawcy; Apodex twierdzi, że szersza dostępność API nadejdzie za pośrednictwem głównych platform, ale wagi nie są otwarte. To ogranicza, kto może zadziałać na podstawie wyników z tego tygodnia: zespoły już korzystające ze środowiska Apodex lub gotowe zapisać się na klucz API pierwszej strony. Mini jest bardziej dostępną ścieżką, ale oznacza samodzielne hostowanie.

Tam, gdzie model naprawdę zasługuje na swoje miejsce: potoki agentowe o długim horyzoncie, w których wyniki są weryfikowane na dalszym etapie — stanowiska badawcze, wieloetapowe zadania z plikami i narzędziami, praca w terminalu — oraz tam, gdzie profil kosztów ~0,05 USD za zadanie pozostaje opłacalny mimo rozwlekłości. Tam, gdzie jeszcze nie pasuje: wszystko, co zależy od wiarygodności wiedzy samego modelu, lub ścieżka produkcyjna, która nie może tolerować nieprzetestowanego, siedmiodniowego modelu, który zawodzi. Właśnie w takiej sytuacji warstwa routingu jest właściwym rozwiązaniem.Jedno API dla 200+ modeli oznacza, że bazowy Qwen3.5-35B-A3B jest już dostępny w cenie katalogowej, samodzielnie hostowany Mini może działać za tym samym routerem z automatycznym przełączaniem awaryjnym, a zawodny nowicjusz nie może wyłączyć ścieżki produkcyjnej — gdy osiąga gorsze wyniki, żądanie jest zamiast tego kierowane do sprawnego dostawcy.
Co obejrzeć dalej
Ta ocena jest wstępnym odczytem, a nie werdyktem. O tym, czy Apodex 1.1 będzie się liczyć za miesiąc, zadecydują trzy rzeczy: niezależne odtworzenie deklaracji producenta o możliwościach agentycznych (wyniki GDPval i TerminalBench prowadzone przez Artificial Analysis to jedyne, które nie zostały wygenerowane przez samo Apodex); czy luka w rzetelności wiedzy zmniejszy się w wariancie bez rozumowania lub w kolejnej wersji; oraz czy model pojawi się na większej liczbie API i bardziej niezależnych tablicach wyników, w którym to momencie 44 i -21,9 staną się problemem kogoś innego do pobicia. Jak na model, który ma siedem dni i taki rozdwojony profil, to mniej więcej tyle, ile można wymagać: prawdziwa przewaga agentyczna, uczciwa cena i jedna słabość, o której wiesz, zanim się zapiszesz.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
