Wygenerowana plansza tytułowa dla Agora-2 vs MiniMax M3, z podtytułem „Jeden GPU na uczestnika albo trzynaście centów za milion tokenów”. Trzy karty: „MiniMax M3: $0.30/$1.20 za 1 mln, $0.06 z cache”; „MiniMax M3: wskaźnik AA 29, kontekst 1 mln, otwarte wagi”; „Agora-2: jeden RTX PRO 4500 na widok, brak opublikowanej ceny”. Stopka: „MiniMax M3 według Artificial Analysis; Agora-2 zgłoszone przez dostawcę i nieodtworzone”.
Guides & Insights

Agora-2 kontra MiniMax M3: Jeden GPU na uczestnika czy trzynaście centów za milion tokenów

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa sposoby na uruchomienie tłumu agentów, wycenione w dwóch różnych walutach. MiniMax M3kosztuje 0,30 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych — stawka, która sprawia, że eksperyment z tysiącem agentów staje się pozycją w budżecie, a nie rundą finansowania. Agora-2, wieloagentowy model świata Odyssey, zapowiedziany 21 września 2026 r., kosztuje jeden NVIDIA RTX PRO 4500 na widok uczestnika: sesja czterech graczy działa na czterech GPU, przy czym jeden model renderujący na kartę generuje perspektywę tego gracza w rozdzielczości 640×480, a jedna z tych czterech kart obsługuje również wspólną symulację i szesnaście polityk autonomicznych agentów. Liczba dla MiniMax M3 jest naliczana za token i skaluje się z tym, jak dużo myślą twoi agenci. Liczba dla Agora-2 jest naliczana za parę oczu i skaluje się z tym, ilu jednoczesnych uczestników umieścisz w świecie. Porównywanie ich to porównywanie budżetu na rozumowanie z budżetem na rendering, a dla każdego, kto planuje wieloagentowe badanie w 2026 roku, okazuje się to właśnie tym, co warto zrobić.

Strona tokenów w księdze

MiniMax M3 to flagowy model o otwartych wagach firmy MiniMax, wydany 31 maja 2026 r.: rzadka mieszanina ekspertów o 428 miliardach parametrów, z około 23 miliardami parametrów aktywnych na token, okno kontekstowe o rozmiarze 1 048 576 tokenów, z czego MiniMax gwarantuje 512 tys. użytecznych, wejście tekstowe, obrazowe i wideo oraz wynik 29 w Artificial Analysis Intelligence Index v4.3.2. Według danych producenta osiąga 83,5 w BrowseComp i 76,1 w BankerToolBench — to liczby samego MiniMax, nieodtworzone tutaj — a Artificial Analysis mierzy go na 145 tokenów wyjściowych na sekundę, co czyni go dziesiątym najszybszym modelem w tym zestawieniu.

Istotną liczbą dla flot agentów jest jednak stawka za odczyt z pamięci podręcznej: 0,06 USD za milion tokenów z pamięci podręcznej, czyli jedna piąta ceny wejściowej. Pętle agentów są zdominowane przez prefiks — ten sam prompt systemowy, te same schematy narzędzi, ta sama narastająca historia, wysyłane ponownie w każdej turze — więc efektywny koszt pętli jest znacznie bliższy 0,06 USD niż 0,30 USD w przypadku większości jej tokenów. To właśnie ta arytmetyka sprawia, że przebieg z 1200 agentami, takiego rodzaju, jaki METR udokumentował w ewaluacji ExploitGym OpenAI z lipca 2026 roku, jest czymś, co grupa badawcza może faktycznie odtworzyć, a nie tylko o tym przeczytać.

Strona GPU w bilansie

Struktura kosztów Agory-2 została ujawniona w jej własnym dodatku implementacyjnym i jest zaskakująco konkretna. Jeden RTX PRO 4500 Blackwell Server Edition na widok. Cztery na sesję czteroosobową. Te karty generują widok każdego uczestnika przy docelowych piętnastu aktualizacjach latentnych i trzydziestu wyświetlanych klatkach na sekundę przy 640×, a symulacja posuwa się naprzód w taktach 30 Hz. Raport podaje również skalę treningu dla prac towarzyszących: efektywny globalny batch wynoszący 128 na 32 GPU B200.

Przeliczone na tę samą jednostkę co MiniMax M3 oznacza to jedno GPU w centrum danych na każdego jednoczesnego uczestnika, plus wspólna symulacja działająca przy okazji na jednym z nich. To koszt stały, który nie dba o to, jak długo twoi agenci deliberują, i nie spada, gdy milkną. Wynikają z tego dwie konsekwencje i wskazują w przeciwnych kierunkach. Przy małej liczbie uczestników i intensywnym rozumowaniu na agenta model tokenowy jest oczywiście tańszy — płacisz centy za myślenie i nic za drugiego agenta w pokoju. Przy dużej liczbie uczestników i gęstej interakcji arytmetyka się odwraca: dwudziestu jednoczesnych uczestników we wspólnym świecie to dwadzieścia GPU, liczba, która nie rośnie wraz z liczbą tokenów wydawanych przez każdego z nich.

• Jednostka kosztu — Agora-2 jeden RTX 4500 na widok uczestnika vs MiniMax M3 $0.30/$1.20 za 1 mln tokenów

• Odczyty z pamięci podręcznej — Agora-2 nie dotyczy, brak rozliczania tokenów w porównaniu z MiniMax M3 0,06 USD za 1 mln z pamięci podręcznej

• Niezależny wynik — Agora-2: nie opublikowano vs MiniMax M3 AA Intelligence Index 29 (v4.3.2)

• Kontekst — współdzielony stan Agora plus ograniczona historia dla każdego widoku vs MiniMax M3, 1,048,576 tokenów, 512K gwarantowane

• Wyjście — wideo Agora-2 640×480 przy docelowych 30 fps vs tekst MiniMax M3

• Dostęp — podgląd Agora-2 w przeglądarce, brak API, brak wag vs otwarte wagi MiniMax M3, licencja społecznościowa, API

Generated two-column scoreboard for Agora-2 and MiniMax M3 on unit of cost, cache reads, independent score, context, output and access: Agora-2 one RTX PRO 4500 per view, cache reads not applicable, none published, shared state plus bounded history, 640x480 video at a 30 fps target, browser preview with no API or weights; MiniMax M3 $0.30/$1.20 per 1M tokens, $0.06 per 1M cached, AA Index 29, 1,048,576 tokens with 512K guaranteed, text output, open weights under a community licence with an API. Footer reads 'MiniMax M3 per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Dlaczego te dwa koszty nie są substytutami

Kuszące jest czytanie tego jako wyboru „albo-albo”, ale nim nie jest. MiniMax M3 to mózg polityki: odczytuje częściowo obserwowaną sytuację, rozumuje, wywołuje narzędzia i emituje akcję. Agora-2 to środowisko, w którym akcje mają konsekwencje widoczne dla innych uczestników — model symulacyjny, który przewiduje, jak połączone akcje zmieniają wspólny stan, serwer świata, który je stosuje, oraz renderery dla poszczególnych widoków, dzięki którym każdy uczestnik widzi ten sam świat z własnej perspektywy. Szesnaście autonomicznych bytów Odyssey nie jest napędzanych przez żaden model językowy; to rekurencyjne polityki skalarne i przestrzenne wytrenowane za pomocą uczenia ze wzmocnieniem, przyjmujące historię szesnastu obserwacji i działające co cztery takty symulacji. Ten wybór projektowy jest tu wymownym sygnałem. Przy trzydziestu taktach na sekundę podejmowanie decyzji, co zrobić, jest problemem sterowania, a problemy sterowania rozwiązuje się poprzez trenowanie małej polityki, a nie poprzez wywoływanie API.

Zatem uczciwym ujęciem dla zespołu planującego pracę wieloagentową jest to, że te elementy znajdują się na różnych warstwach i na każdą z nich potrzebujesz budżetu. Warstwa rozumowania jest tania i elastyczna, a ty możesz porównywać oferty. Warstwa środowiska, jeśli chcesz coś innego niż silnik gry, jest obecnie badawczą wersją zapoznawczą z zapotrzebowaniem na zasoby GPU i bez opublikowanego API. Oba fakty są na tyle nowe — M3 od maja, Agora-2 od września — że prawie nikt nie ma jeszcze modelu kosztów dla tego połączenia.

Co jest zweryfikowane, a co jest celem

Niezależny wynik, okno kontekstowe, modalności i cena MiniMax M3 to opublikowane fakty, możliwe do sprawdzenia dzisiaj. Jego dane dotyczące BrowseComp i BankerToolBench są raportowane przez dostawcę i należy je tak oznaczać za każdym razem, gdy je przytaczasz.

Liczby modelu Agora-2 pochodzą w całości z raportu technicznego Team Odyssey i nikt spoza firmy ich nie odtworzył. Wynik renderowania Agora-2 — 30,11 dB PSNR dla renderera z prefiksem strukturalnym wobec 20,67 dB dla baseline'u VAE na trzydziestu klipach monitoringu — jest porównaniem kompletnych systemów o niedopasowanych budżetach treningowych, jak zauważa sam raport. Redukcja czasu działania denoisera o 45,8% w porównaniu z cross-attention wynika z losowo inicjalizowanych denoiserów na syntetycznych danych wejściowych i mierzy koszt wykonania, a nie jakość obrazu. A sekcja ograniczeń stwierdza wprost, że szybkości piętnastu aktualizacji na sekundę i trzydziestu klatek na sekundę są celami; że utrzymywana liczba klatek na sekundę i opóźnienie od wejścia do wyświetlenia podczas interakcji wielu agentów na żywo „nie zostały ocenione ilościowo”; że jakość wizualna w długim horyzoncie, spójność między widokami i zgodność działań end-to-end pozostają nieocenione; że środowisko wymaga silnika z instrumentacją, z jawną geometrią i stałym słownikiem wyglądu; oraz że transfer poza domenę treningową nie został przetestowany. Każdy, kto buduje model kosztów przy jednym GPU na widok, powinien najpierw przeczytać tę sekcję, ponieważ przepustowość na GPU to dokładnie to, co nie zostało zmierzone.

Połączenie

Jeśli budujesz floty agentów — wiele modeli, długie pętle, wywołania narzędzi, brak renderowania — MiniMax M3 to najtańszy wiarygodny sposób, by robić to na skalę, a stawka za odczyt z pamięci podręcznej to liczba, która decyduje o Twoim rachunku. Jest kierowany przez OrcaRouter po własnej cenie katalogowej MiniMax, bez żadnej marży, więc płacisz stawkę $0.06 za tokeny z pamięci podręcznej, z przełączaniem awaryjnym między dostawcami, jeśli endpoint pogorszy się w trakcie działania. W przypadku flot ma to szczególne znaczenie: marża pośrednika na tokenach z pamięci podręcznej to marża pomnożona przez każdą turę każdego agenta.

Screenshot of the OrcaRouter model page for MiniMax M3 (model ID minimax/minimax-m3), showing a 1,048,576-token context window, 512K maximum output, text, image and video input, and pricing of $0.30 input and $1.20 output per million tokens.

Agora-2 nie jest czymś, do czego można kierować ruch — nie ma API, ceny ani wag, jest tylko przeglądarkowy podgląd Odyssey — a my go nie hostujemy. Jest natomiast pierwszym symulatorem wspólnego świata, zbudowanym specjalnie po to, by można było obserwować, jak wielu uczestników, ludzkich i syntetycznych, wchodzi ze sobą w interakcje w kontrolowanych warunkach, a raport leżący u jego podstaw jest niezwykle szczery co do tego, jak daleko mu obecnie do produktu. Jeśli Twoim problemem jest wnioskowanie na dużą skalę, MiniMax M3 jest już dostępny i tani. Jeśli Twoim problemem jest to, co się dzieje, gdy tysiąc takich systemów wnioskujących dzieli jeden świat, Odyssey zbudowało arenę i pozostawiło trudne pomiary komuś innemu do przeprowadzenia.