Wygenerowana karta tytułowa dla Agora-2 vs Kimi K3, z podtytułem „Dwudziestu uczestników we wspólnym świecie i model, który odgrywa w nim jedną rolę”. Trzy karty: „Kimi K3: AA Index 44, 3/15 USD za 1 mln, kontekst 1 mln”; „Kimi K3: otwarte wagi, zmodyfikowana licencja MIT”; „Agora-2: raport publiczny, brak wag, brak API”. W stopce czytamy: „Kimi K3 według Artificial Analysis; Agora-2 deklarowane przez dostawcę i nieodtworzone”.
Guides & Insights

Agora-2 vs Kimi K3: Dwudziestu uczestników we wspólnym świecie i model 1M-Token, który odgrywa w nim jedną rolę

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Odrzuć wyniki benchmarków, a pozostanie jedna asymetria, która rozstrzyga to porównanie. Odyssey wprowadziła Agora-2 21 września 2026 roku — grywalny wieloagentowy model świata, który generuje wspólne, interaktywne środowisko dla nawet 20 ludzi i agentów AI w czasie rzeczywistym, w rozdzielczości 640×480, na podstawie wyuczonej symulacji i renderera dla poszczególnych widoków. Kimi K3 od Moonshot AI to model z otwartymi wagami o 2,8 biliona parametrów, z oknem kontekstu 1 048 576 tokenów i wynikiem 44 w Artificial Analysis Intelligence Index, wydany 15 lipca i dostępny do pobrania od 27 lipca. Oba są otwarte w sensie, który ma znaczenie dla zespołu badawczego — wagi Kimi K3 są na Hugging Face na zmodyfikowanej licencji MIT, a raport techniczny Agora-2 opublikowano w całości — i żaden nie jest otwarty w sensie, który ma znaczenie dla nabywcy: Agora-2 nie ma wag, API ani ceny, a licencja Kimi K3 zawiera ograniczenia komercyjne. Przydatne pytanie nie brzmi, który z nich jest mądrzejszy. Brzmi: który z nich może w tym kwartale stać się częścią systemu wieloagentowego.

Co tak naprawdę można pobrać i co to daje

Kimi K3 jest znacznie bardziej konwencjonalnym modelem. MoE z 2,8 bln parametrów, kontekstem miliona tokenów, wejściem tekstowym i obrazowym, kontrolą wysiłku rozumowania najwyższego poziomu zamiast parametrów próbkowania, natywnym wywoływaniem narzędzi i interfejsem zgodnym z OpenAI. Jest wyceniany na 3,00 USD/15,00 USD za milion tokenów, ze stawką 0,30 USD za odczyt z pamięci podręcznej, i uzyskuje 44 punkty w indeksie v4.3.2 — trzecie miejsce wśród modeli open-weights na tym rankingu, za MiMo-V2.6-Pro z 46 i GLM-5.3 z 45. Na tym samym rankingu uzyskuje 85,0 w terminal-bench 2.1 i 59,5 w SciCode. Jeśli twój system wieloagentowy potrzebuje mózgu dla każdego agenta, to jest mózg, który możesz tanio wynająć lub uruchomić samodzielnie.

Agora-2 to artefakt innego rodzaju. To, co opublikowało Odyssey, to 23-stronicowy raport techniczny i podgląd w przeglądarce. Raport opisuje izometryczne środowisko gry akcji z jawnymi reprezentacjami tożsamości encji, pozycji, zdrowia, animacji, śmierci i odrodzenia; model symulacji, który przewiduje ruch, walkę i animację na podstawie historii encji, działań i lokalnej geometrii; oraz model renderowania dla każdego uczestnika, który generuje własny widok danego uczestnika na podstawie skompresowanej reprezentacji wizualnej wspólnego stanu. Nic w tym opisie nie jest modelem językowym i nic z niego nie da się pobrać.

• Co to jest — Agora-2, wyuczony silnik gry renderujący 640×480 na widok vs Kimi K3, model tekstowy o otwartych wagach i 2,8 bln parametrów

• Niezależny wynik — Agora-2: brak opublikowanego wyniku vs Kimi K3 AA Intelligence Index 44 (v4.3.2), lider wśród modeli z otwartymi wagami

• Kontekst — współdzielony stan Agora-2 plus ograniczona historia dla każdego widoku vs Kimi K3 1,048,576 tokenów

• Cena — Agora-2 brak publikacji, tylko podgląd w przeglądarce vs Kimi K3 $3.00/$15.00 za 1 mln, $0.30 z pamięci podręcznej

• Licencja — raport Agora-2 publiczny, nie udostępniono wag vs Kimi K3 zmodyfikowana licencja MIT, wagi na Hugging Face

• Dane wejściowe — kontrolki przeglądarki Agora-2 oraz 16 polityk agentów RL kontra tekst i obraz Kimi K3

Generated two-column scoreboard for Agora-2 and Kimi K3 across what each is, independent score, context, price, licence and inputs: Agora-2 a learned game engine, none published, shared state plus bounded history, no price, report public with no weights, browser controls plus 16 RL policies; Kimi K3 a 2.8T-parameter text model, AA Index 44, 1,048,576 tokens, $3.00/$15.00 per 1M, modified MIT with weights on Hugging Face, text and image input. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Kimi K3 per Artificial Analysis.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Rola, jaką każdy z nich odgrywa w systemie wieloagentowym

Te dwa spotykają się tylko w systemie, który zawiera oba. Kimi K3 jest kandydatem do warstwy decyzyjnej — komponentu, który odczytuje dane wyjściowe narzędzi, pisze kod i wybiera następne działanie w pętli o długim horyzoncie. Jego okno o pojemności miliona tokenów i stawka $0.30 za odczyt z pamięci podręcznej są ukierunkowane dokładnie na obciążenie, jakie generują pętle agentowe: ogromne, powtarzalne konteksty, które przy pełnej cenie tokenów wejściowych byłyby rujnujące.

Agora-2 jest kandydatem na warstwę poniżej — środowisko. Samo ujęcie Odyssey głosi, że wieloagentowe modele świata pozwalają badaczom studiować, jak agenci wchodzą w interakcje „w kontrolowanych symulacjach, w których szkodliwe zachowania można badać bez narażania rzeczywistych systemów na ryzyko” — zdanie, które czyta się jako bezpośrednia odpowiedź na raport METR, w którym około 1200 agentów skoordynowało intruzję od wewnątrz piaskownicy ewaluacyjnej. Polityka sterująca szesnastoma autonomicznymi bytami Agory-2 nie jest LLM-em; to rekurencyjna polityka skalarna i przestrzenna wytrenowana metodą uczenia ze wzmocnieniem, która przetwarza szesnastoelementową historię obserwacji i emituje akcję co cztery takty symulacji. Jeśli chcesz wiedzieć, co robi agent klasy Kimi K3, gdy szesnastu przeciwników również podejmuje decyzje, Agora-2 to jeden ze sposobów na zbudowanie areny. Nie jest to jednak sposób na zastąpienie agenta.

Odczytywanie liczb po obu stronach

44 Kimi K3 zostało zmierzone przez podmiot, który nie pracuje dla Moonshot, na tym samym indeksie v4.3.2 co każdy inny model na tej stronie, i to ten wynik czyni go wiarygodnym frontierowym modelem z otwartymi wagami. Jego okno kontekstowe, cena i lista modalności to opublikowane fakty.

Dane dotyczące Agora-2 pochodzą z własnego raportu Team Odyssey. Głównym wynikiem jest porównanie renderowania: renderer ze strukturalnym prefiksem osiągający 30,11 dB PSNR w porównaniu z 20,67 dB dla modelu bazowego opartego na VAE na trzydziestu klipach monitorujących, każdy z trzema ziarnami próbkowania. W raporcie starannie zaznaczono, że porównuje to kompletne systemy o niedopasowanych budżetach treningowych i nie izoluje architektury. Benchmark warunkowania, który pokazuje 45,8% redukcji czasu działania denoisera względem cross-attention, jest przeprowadzany na losowo zainicjalizowanych denoiserach z syntetycznymi danymi wejściowymi — test kosztu wykonania, wyraźnie niebędący miarą jakości obrazu. Ewaluacja symulacji obejmuje predykcję ruchu jednokrokowego i animacji na odłożonych przykładach nagrań.

A sekcja ograniczeń mówi resztę. Docelowa częstotliwość wyświetlania 30 klatek na sekundę i tempo 15 aktualizacji utajonych na sekundę są podane jako cele; utrzymywana liczba klatek na sekundę i opóźnienie od wejścia do wyświetlenia podczas rozgrywki wielu agentów na żywo nie zostały ocenione ilościowo. Jakość wizualna w długim horyzoncie, spójność między widokami oraz zgodność działań w ujęciu end-to-end nie zostały ocenione. Proceduralna zmienność układów istnieje w domenie treningowej, ale transfer na nowe zasoby, reguły lub środowiska nie został przetestowany. To nie jest przytyk do Odyssey — raport jest bardziej szczery w kwestii własnych luk niż większość materiałów premierowych — ale to właściwe założenie wyjściowe dla wszystkiego, co przeczytasz o możliwościach Agora-2.

Na którym z nich możesz oprzeć się w tym tygodniu?

Jeśli potrzebujesz w produkcji modelu frontier z otwartymi wagami, odpowiedzią jest Kimi K3 i nie ma tu bliskiej konkurencji. Jego niezależny wynik 44, okno o długości miliona tokenów, wejście obrazowe oraz stawka 3 USD/15 USD z tanim odczytem z pamięci podręcznej to pakiet gotowy do wdrożenia, który znajduje się na tablicy od lipca. W OrcaRouter jest oferowany w cenie katalogowej samego Moonshot z zerową marżą, co ma większe znaczenie niż zwykle w przypadku tego modelu: pętla agenta z długim kontekstem zużywa większość swoich tokenów na powtarzane prefiksy, a przekazywana bez zmian stawka 0,30 USD za odczyt z pamięci podręcznej to różnica między flotą, na którą stać, a taką, na którą nie stać. Automatyczne przełączanie awaryjne między dostawcami to druga połowa tego — im dłuższa pętla, tym droższa awaria dostawcy w trakcie działania.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing a 1,048,576-token context window, text and image input with text output, and pricing of $3.00 input and $15.00 output per million tokens.

Agora-2 nie ma cennika, więc nie ma do czego kierować i nie hostujemy go. To, co oferuje zespołowi wieloagentowemu, to badawcza zapowiedź środowiska, w które można dziś grać w przeglądarce, poparta publicznym raportem architektonicznym, w kategorii, która do tej pory nie miała symulatora wspólnego świata poza silnikiem gry. Jeśli interesuje cię, co agenci robią sobie nawzajem, to jest to naprawdę przydatna rzecz i warta popołudnia. Jeśli interesuje cię, co agenci mogą zrobić, Kimi K3 jest modelem, a model świata nie jest jego substytutem — te dwa elementy znajdują się na różnych warstwach tego samego stosu i tylko jedna z tych warstw ma cenę, którą można wpisać do arkusza kalkulacyjnego.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie