
Agora-2 vs Grok 4.6: Pytanie o politykę agentów — 1200 agentów LLM i symulator, który nie używa żadnego z nich
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 36 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 181 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Oto liczba, która kosztuje pieniądze. Dochodzenie METR w sprawie incydentu z Hugging Face z lipca 2026 roku doliczyło się około 1200 skoordynowanych agentów w ramach jednego przebiegu ewaluacji. Przy Grok 4.6według cennika — 2,00 USD za milion tokenów wejściowych, 6,00 USD za milion wyjściowych — flota tej wielkości, mieląca długie transkrypcje przez sześć dni, to rachunek, który dobrze finansowany zespół jest w stanie faktycznie udźwignąć. W cenie modelu, po który w przeciwnym razie byś sięgnął, już nie. To prawdziwa obietnica produktowa Grok 4.6 i ta sama obietnica, której Agora-2po cichu zaprzecza: gdy Odysseyzaprezentował 21 września 2026 roku swój wieloagentowy model świata — grywalne demo generujące wspólne środowiska dla maksymalnie 20 ludzi i agentów AI — okazało się, że agenci w nim zawarci wcale nie są modelami językowymi. Odyssey wytrenował zamiast tego niewielkie polityki uczenia ze wzmocnieniem. Ciekawe pytanie, jakie nasuwa to zestawienie, nie brzmi, co jest lepsze. Brzmi: dlaczego laboratorium pominęło LLM.
Karta stawek w jednostce, która ma znaczenie dla flot
Grok 4.6 zadebiutował 12 sierpnia 2026 r. jako flagowy model xAI z oknem kontekstowym o rozmiarze 500 000 tokenów, obsługą tekstu, obrazów i plików wejściowych, konfigurowalnym poziomem wysiłku rozumowania, natywnym wywoływaniem narzędzi, ustrukturyzowanymi danymi wyjściowymi oraz wynikiem 44 w Artificial Analysis Intelligence Index w wersji v4.3.2 — tym samym indeksie, który plasuje GPT-5.6 Sol na 47, a Kimi K3 na 44. Artificial Analysis ocenia go na 94,9 w GPQA Diamond, a xAI wymienia go jako „Latest” we własnej dokumentacji dla programistów. Jest udostępniany jako model OpenAI Responses pierwszej klasy, co ma praktyczne znaczenie: frameworki agentowe adoptują go, zmieniając bazowy adres URL, a nie pisząc adapter.
Ale interesującą wartością jest zestawienie $2/$6 z oknem kontekstowym. Pętle agentów o długim horyzoncie to paskudne obciążenia — dziesiątki tysięcy tokenów nagromadzonych wyników narzędzi na agenta na godzinę, z których większość jest zbędna. Stawka za odczyt z pamięci podręcznej Grok 4.6 wynosi $0.50 za milion, czyli jedną czwartą ceny wejściowej, i to właśnie czyni uruchomienie tysiąca agentów arytmetycznie uzasadnionym, a nie tylko możliwym. Zwróć uwagę na granicę progu: prompty powyżej 200 tys. tokenów są rozliczane według podwójnej stawki podstawowej, więc agent, który gromadzi długą historię, po cichu podwaja własny koszt.
• Cena — Agora-2: brak opublikowanej ceny, tylko podgląd w przeglądarce vs Grok 4.6: 2,00 USD/6,00 USD za 1 mln, 0,50 USD za odczyt z pamięci podręcznej, dwukrotnie powyżej 200 tys. tokenów wejściowych
• Kontekst — współdzielony stan Agora-2 oraz ograniczona historia dla każdego widoku w porównaniu z 500 000 tokenami Grok 4.6
• Niezależny wynik — Agora-2: brak opublikowanego wyniku vs Grok 4.6 AA Intelligence Index 44 (v4.3.2)
• Rozumowanie — Agora-2 nie dotyczy, nie jest modelem językowym vs Grok 4.6: konfigurowalny wysiłek, natywne wywoływanie narzędzi
• Dostęp — grywalny podgląd Agora-2, bez API, bez wag, w przeciwieństwie do zastrzeżonego API Grok 4.6
• Sprzęt — Agora-2: cztery karty GPU RTX PRO 4500 dla czterech jednoczesnych widoków vs Grok 4.6 — hostowany endpoint

Dlaczego Odyssey nie umieściło LLM na arenie
Oczywisty skrót, jeśli budujesz świat, w którym szesnastu agentów AI walczy z czterema ludźmi, polega na podłączeniu zdolnego modelu tekstowego do sterowania i pozwoleniu mu grać. Odyssey tego nie zrobił, a jego raport techniczny wyjaśnia dlaczego w tabeli konfiguracji. Polityka agenta w Agora-2 to rekurencyjna polityka skalarna i przestrzenna, przetwarzająca historię szesnastu obserwacji, emitująca akcję co cztery takty symulacji w obrębie czternastu dyskretnych gałęzi ruchu. Sama symulacja działa w oparciu o podstawę czasu taktów 30 Hz. Model, który ma podejmować decyzję trzydzieści razy na sekundę, na podstawie częściowo obserwowanego widoku, przy ustalonym niskopoziomowym słowniku akcji, nie jest problemem rozumowania — to problem sterowania, a problemy sterowania rozwiązuje się przez trenowanie małej polityki, a nie przez promptowanie modelu frontierowego z kontekstem 500K.
Warto powiedzieć to wprost, ponieważ jest to najczęstsze błędne przekonanie dotyczące kategorii modeli świata. Agora-2 nie konkuruje z Grok 4.6 o to samo miejsce w systemie. Zajmuje miejsce poniżej: środowisko, w którym polityka jest trenowana i oceniana. Architektura z raportu wyraźnie opisuje ten podział — model symulacyjny przewiduje, jak połączone działania zmieniają współdzielony stan, serwer świata je stosuje, a model renderowania dla poszczególnych widoków generuje z tego stanu własną perspektywę 640×480 każdego uczestnika. W całej pętli interakcji nie pojawia się żaden model tekstowy.

Tam, gdzie pojawia się model taki jak Grok 4.6, jest to o jeden poziom wyżej: jako coś, co pisze rusztowanie ewaluacyjne, analizuje transkrypcje lub steruje agentem używającym narzędzi, którego zachowanie próbujesz badać. To dokładnie ta rola, którą GPT-5.6 Sol odegrał w badaniu METR — około 5% floty i analityk czytający logi — i to jest rola, którą cena i okno kontekstowe Grok 4.6 czynią tanią.
Luka w dowodach jest tutaj większa niż w większości tych pojedynków.
Wynik indeksowy Grok 4.6 jest mierzony niezależnie, jego cennik jest publikowany, a okno kontekstowe udokumentowane. Liczby Agory-2 pochodzą z raportu autorstwa Team Odyssey, którego nikt nie odtworzył. Na trzydziestu klipach monitorujących jego renderer ze strukturalnym prefiksem osiąga 30,11 dB PSNR w porównaniu z 20,67 dB dla baseline'u VAE — porównanie, które, jak ostrzega sam raport, dotyczy kompletnych systemów o nieporównywalnych budżetach treningowych, a nie izolowanego testu architektury. Jego benchmark warunkowania, który wykazuje 45,8% redukcji czasu działania odszumiacza względem cross-attention, wykorzystuje losowo inicjalizowane odszumiacze na syntetycznych danych wejściowych i mierzy koszt wykonania, a nie jakość obrazu.
Następnie sekcja ograniczeń, która jest wyjątkowo bezpośrednia. Podane 15 aktualizacji ukrytych i 30 wyświetlanych klatek na sekundę to wartości docelowe. Utrzymywana liczba klatek na sekundę i opóźnienie od wejścia do wyświetlenia podczas interakcji wielu agentów na żywo „nie zostały ocenione ilościowo”. Długoterminowa jakość wizualna, zgodność między widokami i zgodność działań end-to-end są wymienione jako niepoddane ocenie. Środowisko wymaga instrumentowanego silnika gry z jawną geometrią i ustalonym słownikiem wyglądu, a transfer na nowe zasoby, reguły lub środowiska nie został przetestowany. Przeczytaj tę listę, zanim przeczytasz jakąkolwiek liczbę z nagłówka o Agora-2.
Który z nich należy do twojego stacka?
Jeśli dziś uruchamiasz lub badasz systemy wieloagentowe, Grok 4.6 to komponent, który naprawdę możesz wdrożyć — model tekstowy klasy frontier w cenie, która sprawia, że duże floty agentów stają się opłacalne, z opublikowanym wynikiem i udokumentowanym interfejsem API. W OrcaRouter jest udostępniany w cenie katalogowej samego xAI, bez żadnej marży, więc podane powyżej $2/$6 oraz każda przyszła zmiana stawek trafiają na Twoje rozliczenie w dniu, w którym nastąpią, wraz z automatycznym przełączeniem awaryjnym, jeśli główny endpoint ulegnie degradacji. Obie te kwestie mają szczególne znaczenie właśnie w przypadku obciążeń flot: tysiąc agentów to tysiąc okazji, by trafić na dostawcę w stanie degradacji, a marża doliczona do wyjścia za $6 to marża pomnożona przez cały Twój przebieg.

Agora-2 nie jest infrastrukturą gotową do wdrożenia i nie hostujemy jej — nie ma API, wag ani ceny, tylko własna, grywalna wersja zapoznawcza Odyssey. Oferuje ona inny rodzaj wartości: kontrolowane środowisko do badań nad interakcjami, które – jak pokazuje raport METR – są obecnie pilne, kosztem czterech GPU RTX PRO 4500 na cztery równoczesne widoki zamiast rachunku za API. Uczciwy werdykt jest taki, że te dwa rozwiązania nie konkurują. Grok 4.6 to mózg polityczny, który można kupić za token już dziś; Agora-2 to propozycja miejsca, w którym można testować, co się dzieje, gdy spotyka się tysiące takich mózgów. To drugie to ciekawsze badania i mniej ukończony produkt, a sam raport Odyssey w odświeżająco jasny sposób określa, które jego części są wciąż celami.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
