Główna karta tytułowa dla Apodex 1.1 zatytułowana 'Apodex 1.1', z podtytułem '44 w Indeksie Inteligencji – siła agentowa, duża rozwlekłość i pewien haczyk dotyczący wiedzy', plakietkami z napisami 'AA Index 44', '#11 z 177', 'kontekst 256K' oraz stopką 'Wydano 24 sierpnia 2026 – pierwszy model Apodex na Artificial Analysis', a także logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Apodex 1.1, wyjaśniony: 44 punkty w Indeksie Inteligencji, prawdziwa siła agentowa — i haczyk dotyczący wiarygodności wiedzy

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Apodex 1.1 ma tydzień, jest własnościowy i do tego tygodnia był głównie laboratoryjną ciekawostką. Potem Artificial Analysis opublikowało pierwszą niezależną ocenę modelu — pierwszą dla Apodexa na platformie — a tablica wyników zrobiła coś niezwykłego: Apodex 1.1 zdobył 44 punkty w Artificial Analysis Intelligence Index, sklasyfikowany na 11. miejscu spośród 177, jednocześnie notując wyniki w pracy agentowej, które pobiły każdy model w swojej klasie inteligencji, w tym DeepSeek V4 Pro, Qwen3.7 Max i Kimi K2.6. Ten sam raport ujawnił drugą, brzydszą liczbę: wynik wiarygodności wiedzy na tyle słaby, że może zmienić decyzję o wykonywaniu na nim prawdziwej pracy. Jego siostrzany model z otwartymi wagami, Apodex 1.1 Mini, to model, który większość ludzi może faktycznie uruchomić. Oto, co mówi ta ocena, czego nie mówi i kogo to powinno obchodzić.

Apodex, firma AI założona przez Chen Tianqiao, wydała rodzinę modeli 24 sierpnia 2026 roku, wraz z opublikowaną na arXiv pracą podpisaną przez 70 autorów, zatytułowaną „Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). Flagowy model jest zamknięty — według raportu producenta ma około 397 mld parametrów — i powstał wokół tezy, że prawdziwym wąskim gardłem dla agentów nie jest surowa inteligencja, lecz środowisko, w którym działają. Dlatego Apodex 1.1 został wytrenowany do pracy bezpośrednio z plikami, wyszukiwaniem i kodem w długich horyzontach czasowych, ze wspólnym środowiskiem wykonawczym („AgentOS"), które koordynuje do 150 równoległych sub-agentów i prowadzi rejestr pochodzenia każdego kroku. Otwartą częścią jest model siostrzany: Apodex 1.1 Mini, model MoE klasy 35B, dostrojony na bazie modelu Alibaba Qwen3.5-35B-A3B, udostępniony na licencji Apache-2.0 wraz z towarzyszącym środowiskiem dla agentów o nazwie FrontierAgent. Pełny model jest dostępny wyłącznie przez własne API Apodex i internetowe stanowisko robocze; Mini można hostować samodzielnie albo wcale.

Co oznacza 44 w Indeksie Inteligencji

Indeks Artificial Analysis Intelligence to ważona agregacja zestawów testów porównawczych platformy — w tym ewaluacji agentowych, takich jak GDPval-AA v2 i Terminal-Bench, a także komponentów dotyczących rozumowania, matematyki i wiedzy. Wynik 44 plasuje Apodex 1.1 na 11. miejscu wśród 177 modeli, znacznie powyżej mediany wynoszącej 18. Umieszcza to również model w zatłoczonej, interesującej kategorii: Kimi K2.6 (45), MiniMax-M3 (45) i Inkling (42) mieszczą się w granicach trzech punktów, a Apodex 1.1 jest jedynym z tej grupy, którego nazwa była nieznana większości użytkowników AI tydzień temu. Artificial Analysis zaznacza, że strona obejmuje wersję modelu z rozumowaniem, a wariant bez rozumowania również może istnieć.

A single-column scoreboard for Apodex 1.1 titled 'Apodex 1.1 - the scoreboard' listing AA Intelligence Index 44 (#11 of 177), GDPval-AA v2 Elo 1348, TerminalBench v2.1 70%, Output tokens per task ~17,000, Full Index evaluation cost 18.41, and AA-Omniscience -21.9 (78% hallucination), with a footer 'All figures per Artificial Analysis, August 2026.' and the OrcaRouter logo in the bottom-right corner.

Główny wynik indeksu nie jest tym, co czyni ten model interesującym. Interesujący jest ze względu na to, gdzie jego mocne i słabe strony sytuują się względem tego wyniku — i to właśnie porównanie poziomów czyni konkretnym.

Gdzie bije powyżej swojej kategorii: ewaluacje agentowe i pracy opartej na wiedzy

W dwóch komponentach indeksu mierzących rzeczywistą pracę agentową, Apodex 1.1 wypada lepiej niż jego sąsiedzi w odległości 44 punktów. W GDPval-AA v2 — benchmarku oceniającym zdolność agenta do wykonywania realistycznych zadań biurowych od początku do końca — Apodex 1.1 osiąga Elo 1348, wyprzedzając DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) i Kimi K2.6 (1202). W TerminalBench v2.1, który testuje agenta pracującego w terminalu, zdobywa 70%, wyprzedzając Kimi K2.6 (66%) i tuż za Qwen3.7 Max (75%). Są to niezależne liczby opracowane przez Artificial Analysis i są najmocniejszym dowodem w raporcie, że trening zorientowany na środowisko działa.

Własne deklaracje producenta dotyczące benchmarków idą jeszcze dalej i należy je traktować jako dane raportowane przez producenta, dopóki ktoś ich nie odtworzy: APEX-Agents 38,5, GDPVal 78,8, SWE-bench Verified 77,7%, Terminal-Bench 2.1 70,8%, Humanity's Last Exam 56,1% z narzędziami, DeepSearchQA 92,4%, FrontierFinance 54,3 oraz FrontierScience-Research 63,3. To, co sprawia, że profil agentowy jest wiarygodny, a nie jest jedynie marketingowym szumem, to architektura, która za nim stoi: skalowanie środowiska (poszerzanie różnorodności środowisk plików wykonywalnych, wyszukiwania i kodu używanych podczas treningu) oraz skalowanie koordynacji agentowej (uczenie modelu rozkładania zadań o długim horyzoncie czasowym na części, delegowania równoległej pracy, integrowania wyników asynchronicznych i ponownego planowania). Tryb „Agent Team" uruchamia do 150 subagentów przy zadaniach wyszukiwania i syntezy, a wbudowany krok weryfikacji („Statement Review") sprawdza wnioski, zanim zostaną dostarczone. Innymi słowy: to model zaprojektowany tak, by się mylić, sprawdzać samego siebie i naprawiać błędy — a nie recytować fakty z pamięci.

Ukryty koszt całej tej sprawczości: rozwlekłość

Ten projekt pojawia się w tabeli efektywności kosztowej Artificial Analysis jako najwyraźniejsza słabość modelu po wiedzy: jest bardzo rozwlekły. Uruchomienie pełnego Indeksu Inteligencji zużyło 180 mln tokenów wyjściowych — wobec mediany 67 mln — oraz około 17 000 tokenów wyjściowych na zadanie benchmarkowe, w porównaniu z około 9 400 dla Qwen3.7 Max i 8 100 dla MiniMax-M3. Łącznie pełna ocena kosztowała 618,41 USD wydatków na API, według Artificial Analysis.

A screenshot of the Artificial Analysis model page for Apodex 1.1 (captured August 31, 2026), showing 'Apodex 1.1 scores 44 on the Artificial Analysis Intelligence Index' with a median of 18, the note that it generated 180M tokens versus a 67M median, pricing of $0.30 per 1M input and $3.00 per 1M output tokens, and the $618.41 total cost to evaluate the model on the Intelligence Index.

Cena, która generuje ten rachunek: 0,30 USD za milion tokenów wejściowych i 3,00 USD za milion wyjściowych — 0,03 USD za trafienie w pamięci podręcznej dla buforowanych danych wejściowych, czyli 90% zniżki — co daje około 0,38 USD za milion przy typowym miksie 7:2:1 cache/wejście/wyjście. Obie ceny za token przewyższają mediany platformy (0,25 USD za wejście, 0,90 USD za wyjście). Mimo to szacunkowy koszt zadania w Artificial Analysis nadal plasuje Apodex 1.1 na poziomie około 0,05 USD za zadanie benchmarkowe, taniej niż Qwen3.7 Max (~0,07 USD) i Kimi K2.6 (~0,06 USD). To uzgodnienie ma znaczenie dla budżetowania: jego tokeny są na tyle tanie, że nawet duża gadatliwość pozostaje konkurencyjna w przeliczeniu na zadanie — ryzykiem kosztowym jest wolumen, a nie stawka. Jeśli postawisz na nim długotrwałego agenta, rachunek zależy od tego, ile ten agent mówi, a mówi dużo.

Jedna uwaga cenowa przed zaplanowaniem budżetu: 0,30 USD / 3,00 USD to cennik własny dostawcy. Platforma routingu, która przekazuje ceny katalogowe dostawcy z zerową marżą, pobiera dokładnie tę kwotę, a każda przyszła obniżka cen Apodex pojawia się tego samego dnia, w którym zostanie ogłoszona.

Haczyk: słaba wiarygodność wiedzy.

Oto liczba, którą relacje z premiery w większości pomijają. W teście AA-Omniscience, sondzie niezawodności wiedzy od Artificial Analysis, Apodex 1.1 uzyskuje -21.9. Próbuje odpowiedzieć na 87% pytań zamiast odmawiać, ale tylko 32% z nich rozwiązuje poprawnie, a wskaźnik halucynacji wynosi 78.4%. Dla modelu pozycjonowanego jako rozwiązanie do ciężkich zadań to poważne rozdwojenie osobowości: mocny w wykonywaniu agentowym, słaby w ugruntowanej wiedzy.

Te dwa fakty są ze sobą powiązane, a nie sprzeczne. Benchmarki agentowe nagradzają działanie w środowisku — wydawanie wywołań do narzędzi, iterowanie, odzyskiwanie stabilności — więc model może osiągać tam dobre wyniki, mimo słabej zdolności przywoływania, ponieważ środowisko to zapamiętuje. Sam projekt to zakłada: Statement Review służy do sprawdzania wyników, a warsztat opiera się na weryfikacji, a nie na tym, by model miał rację z pamięci. Praktyczny wniosek brzmi wprost: nie kieruj Apodex 1.1 do zadań, które wymagają od niego wydobywania faktów z własnych wag. Kieruj go do zadań długoterminowych, w których jego pracę można zweryfikować na podstawie plików, kodu i źródeł — i weryfikuj efekty.

Otwarty odpowiednik: Apodex 1.1 Mini i FrontierAgent

Jeśli problemem są zamknięte drzwi flagowca, to przeciwwagą jest otwarta połowa rodziny. Apodex 1.1 Mini to model MoE o ~35B parametrów łącznie / ~3B aktywnych, dostrojony z Qwen3.5-35B-A3B (bazowego modelu Alibaba opublikowanego jako open source w lutym 2026), wydany na licencji Apache-2.0 z oknem kontekstowym 262K oraz wariantami FP8, FP4 i GPTQ-Int4 na Hugging Face. Jego najważniejszy wynik deklarowany przez producenta to 50.2 w FrontierFinance (pierwsze miejsce w rankingu Apodex) i 27.7 w APEX-Agents z włączonym harnessem Agent Team. A FrontierAgent — open-source'owe środowisko uruchomieniowe dołączone do niego — jest naprawdę interesującym artefaktem: harness oparty na terminalu z trybami ReAct i Agent Team, pracą na plikach w piaskownicy, bramkami zatwierdzania, punktami kontrolnymi i śladami, wszystko komunikujące się z dowolnym punktem końcowym zgodnym z OpenAI.

Dwie rzeczy warto wiedzieć, zanim zdecydujesz się na self-hosting. Po pierwsze, Mini to model po fine-tuningu, a nie model z najwyższej półki — jego wyniki benchmarków czytaj tak samo, jak tabelę wyników dostawcy flagowego modelu: niezreprodukowane, z wliczonym harnessem, wybrane przez dostawcę. Po drugie, jego zachowanie dziedziczy po modelu bazowym: jeśli chcesz sprawdzić, czy bazowy Qwen3.5-35B-A3B już wykonuje twoje zadanie, nie potrzebujesz do tego GPU ani stosu serwującego — model bazowy jest na wyciągnięcie jednego wywołania API.

Kto powinien dziś korzystać z Apodex 1.1?

Flagowy model jest wczesny, zamknięty i na razie dostępny wyłącznie przez API i internetowe środowisko pracy samego dostawcy; Apodex twierdzi, że szersza dostępność API nadejdzie za pośrednictwem głównych platform, ale wagi nie są otwarte. To ogranicza, kto może zadziałać na podstawie wyników z tego tygodnia: zespoły już korzystające ze środowiska Apodex lub gotowe zapisać się na klucz API pierwszej strony. Mini jest bardziej dostępną ścieżką, ale oznacza samodzielne hostowanie.

A screenshot of the Apodex online workbench homepage (captured August 31, 2026), showing the deep-research interface with the prompt field 'Ask the question that matters', feature points for a step-level reasoning trace, citations in every report, branching off any report, and full-text search across threads, and a sign-in prompt for saving inquiries.

Tam, gdzie model naprawdę zasługuje na swoje miejsce: potoki agentowe o długim horyzoncie, w których wyniki są weryfikowane na dalszym etapie — stanowiska badawcze, wieloetapowe zadania z plikami i narzędziami, praca w terminalu — oraz tam, gdzie profil kosztów ~0,05 USD za zadanie pozostaje opłacalny mimo rozwlekłości. Tam, gdzie jeszcze nie pasuje: wszystko, co zależy od wiarygodności wiedzy samego modelu, lub ścieżka produkcyjna, która nie może tolerować nieprzetestowanego, siedmiodniowego modelu, który zawodzi. Właśnie w takiej sytuacji warstwa routingu jest właściwym rozwiązaniem.Jedno API dla 200+ modeli oznacza, że bazowy Qwen3.5-35B-A3B jest już dostępny w cenie katalogowej, samodzielnie hostowany Mini może działać za tym samym routerem z automatycznym przełączaniem awaryjnym, a zawodny nowicjusz nie może wyłączyć ścieżki produkcyjnej — gdy osiąga gorsze wyniki, żądanie jest zamiast tego kierowane do sprawnego dostawcy.

Co obejrzeć dalej

Ta ocena jest wstępnym odczytem, a nie werdyktem. O tym, czy Apodex 1.1 będzie się liczyć za miesiąc, zadecydują trzy rzeczy: niezależne odtworzenie deklaracji producenta o możliwościach agentycznych (wyniki GDPval i TerminalBench prowadzone przez Artificial Analysis to jedyne, które nie zostały wygenerowane przez samo Apodex); czy luka w rzetelności wiedzy zmniejszy się w wariancie bez rozumowania lub w kolejnej wersji; oraz czy model pojawi się na większej liczbie API i bardziej niezależnych tablicach wyników, w którym to momencie 44 i -21,9 staną się problemem kogoś innego do pobicia. Jak na model, który ma siedem dni i taki rozdwojony profil, to mniej więcej tyle, ile można wymagać: prawdziwa przewaga agentyczna, uczciwa cena i jedna słabość, o której wiesz, zanim się zapiszesz.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie