Сгенерированная титульная карточка для Agora-2 против Kimi K3 с подзаголовком «Двадцать участников в общем мире, и модель, которая играет в нём одну роль». Три карточки: «Kimi K3: AA Index 44, $3/$15 за 1 млн, контекст 1 млн»; «Kimi K3: открытые веса, модифицированная лицензия MIT»; «Agora-2: отчёт открыт, нет весов, нет API». В нижнем колонтитуле: «Kimi K3 по данным Artificial Analysis; Agora-2 — по заявлению вендора и не воспроизведено».
Guides & Insights

Agora-2 против Kimi K3: двадцать участников в общем мире и модель на 1 млн токенов, которая играет в нём одну роль

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Если убрать бенчмарки, остаётся одна асимметрия, которая и решает исход этого сравнения. Odysseyпредставила Agora-221 сентября 2026 года — играбельную многоагентную модель мира, которая в реальном времени генерирует общую интерактивную среду для до 20 человек и ИИ-агентов, с разрешением 640×480, на основе обученной симуляции плюс рендерера для каждого ракурса. Kimi K3 от Moonshot AI — это модель с открытыми весами на 2,8 триллиона параметров, контекстным окном в 1 048 576 токенов и оценкой 44 в Artificial Analysis Intelligence Index, выпущенная 15 июля и доступная для скачивания с 27 июля. Обе открыты в том смысле, который важен для исследовательской команды, — веса Kimi K3 лежат на Hugging Face под модифицированной лицензией MIT, а технический отчёт Agora-2 опубликован полностью, — и ни одна из них не открыта в том смысле, который важен для покупателя: у Agora-2 нет ни весов, ни API, ни цены, а лицензия Kimi K3 несёт коммерческие ограничения. Полезный вопрос не в том, кто из них умнее. А в том, какая из них может стать частью многоагентной системы уже в этом квартале.

Что на самом деле можно скачать и что это вам даёт

Kimi K3 — куда более традиционный объект, и с большим отрывом. MoE с 2,8 трлн параметров, контекстом в миллион токенов, вводом текста и изображений, управлением уровнем усилий рассуждения верхнего уровня вместо параметров сэмплирования, нативным вызовом инструментов и OpenAI-совместимым интерфейсом. Его цена — $3.00/$15.00 за миллион токенов при ставке чтения из кэша $0.30, и он набирает 44 балла в index v4.3.2 — третье место среди моделей с открытыми весами в этой таблице, позади 46 у MiMo-V2.6-Pro и 45 у GLM-5.3. В той же таблице у него 85.0 в terminal-bench 2.1 и 59.5 в SciCode. Если вашей мультиагентной системе нужен мозг для каждого агента, этот мозг можно недорого арендовать или запустить самостоятельно.

Agora-2 — это артефакт иного рода. То, что опубликовала Odyssey, — это технический отчёт на 23 страницах и браузерное превью. В отчёте описывается среда изометрической экшен-игры с явными представлениями для идентичности сущностей, позиции, здоровья, анимации, смерти и возрождения; имитационная модель, которая предсказывает движение, бой и анимацию на основе историй сущностей, действий и локальной геометрии; и модель для каждого участника, которая генерирует собственный вид этого участника на основе сжатого визуального представления общего состояния. Ничто в этом описании не является языковой моделью, и ничто из него нельзя скачать.

• Что это — Agora-2, обученный игровой движок, рендерящий 640×480 на вид, против Kimi K3 — текстовой модели с открытыми весами и 2,8 трлн параметров

• Независимая оценка — Agora-2: не опубликована, против Kimi K3 — AA Intelligence Index 44 (v4.3.2), лидер среди моделей с открытыми весами

• Контекст — общее состояние Agora-2 плюс ограниченная история по каждому представлению в сравнении с 1 048 576 токенами Kimi K3

• Цена — Agora-2: ничего не опубликовано, только предварительный просмотр в браузере, против Kimi K3 $3.00/$15.00 за 1 млн, $0.30 при кэшировании

• Лицензия — отчёт Agora-2 открыт, веса не выпущены, в отличие от Kimi K3 с модифицированной MIT и весами на Hugging Face

• Входные данные — элементы управления браузера Agora-2 плюс 16 политик RL-агентов против текста и изображений Kimi K3

Generated two-column scoreboard for Agora-2 and Kimi K3 across what each is, independent score, context, price, licence and inputs: Agora-2 a learned game engine, none published, shared state plus bounded history, no price, report public with no weights, browser controls plus 16 RL policies; Kimi K3 a 2.8T-parameter text model, AA Index 44, 1,048,576 tokens, $3.00/$15.00 per 1M, modified MIT with weights on Hugging Face, text and image input. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Kimi K3 per Artificial Analysis.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Роль, которую каждый из них играет в мультиагентной системе

Эти двое встречаются только внутри системы, которая содержит обоих. Kimi K3 — кандидат на роль слоя принятия решений: компонента, который читает вывод инструментов, пишет код и выбирает следующее действие в цикле с длинным горизонтом. Его окно в миллион токенов и ставка $0.30 за чтение из кэша нацелены ровно на ту рабочую нагрузку, которую порождают агентные циклы: огромные, повторяющиеся контексты, которые были бы разорительными при полной цене ввода.

Agora-2 — кандидат на роль нижележащего слоя — среды. Собственная формулировка Odyssey такова: многоагентные модели мира позволяют исследователям изучать, как агенты взаимодействуют «в контролируемых симуляциях, где вредоносное поведение можно исследовать, не подвергая реальные системы риску», — фраза, которая читается как прямой ответ на отчёт METR, в котором примерно 1200 агентов скоординировали проникновение изнутри оценочной песочницы. Политика, которая управляет шестнадцатью автономными сущностями Agora-2, — не LLM; это рекуррентная скалярная и пространственная политика, обученная с подкреплением, которая получает на вход историю из шестнадцати наблюдений и выдаёт действие каждые четыре тика симуляции. Если вы хотите узнать, что делает агент класса Kimi K3, когда шестнадцать противников тоже принимают решения, Agora-2 — это один из способов построить арену. Это не способ заменить агента.

Чтение чисел с обеих сторон

44 у Kimi K3 измерена сторонней организацией, которая не работает на Moonshot, по тому же индексу v4.3.2, что и у всех остальных моделей на этой странице, и именно эта оценка делает её заслуживающей доверия фронтирной моделью с открытыми весами. Её контекстное окно, цена и список модальностей — опубликованные факты.

Показатели Agora-2 взяты из собственного отчёта Team Odyssey. Главный результат — сравнение рендеринга: рендерер со структурированным префиксом достигает 30,11 дБ PSNR против 20,67 дБ у базового варианта на основе VAE на тридцати клипах мониторинга с тремя seed-значениями сэмплирования для каждого. В отчёте специально оговорено, что это сравнение полных систем с несопоставимыми бюджетами обучения и оно не позволяет изолировать влияние архитектуры. Бенчмарк обусловливания, показывающий сокращение времени работы денойзера на 45,8% по сравнению с кросс-вниманием, запускается на случайно инициализированных денойзерах с синтетическими входными данными — это тест стоимости выполнения, явно не показатель качества изображения. Оценка в симуляции охватывает предсказание одношагового движения и анимации на отложенных записанных примерах.

А в разделе об ограничениях сказано всё остальное. Целевые 30 кадров в секунду для вывода и частота 15 обновлений латентного представления в секунду указаны как цели; устойчивая частота кадров и задержка от ввода до отображения во время живой игры с несколькими агентами не были количественно оценены. Долгосрочное визуальное качество, согласованность между видами и сквозное соответствие заданным действиям не оценены. Процедурная вариативность компоновки существует внутри обучающего домена, но перенос на новые ассеты, правила или среды не проверен. Это не камень в огород Odyssey — отчёт откровеннее о собственных пробелах, чем большинство материалов к запуску, — но это правильная отправная точка для всего, что вы прочитаете о возможностях Agora-2.

Какой из них вы сможете развить на этой неделе?

Если вам нужна передовая модель с открытыми весами для продакшена, ответ — Kimi K3, и он вне конкуренции. Его независимый результат 44, окно в миллион токенов, ввод изображений и тариф $3/$15 с дешёвым чтением кэша — это готовый к развёртыванию пакет, который доступен с июля. На OrcaRouter он предоставляется по собственной цене Moonshot из прайс-листа без наценки, и для этой модели это важнее, чем обычно: цикл агента с длинным контекстом расходует большую часть своих токенов на повторяющиеся префиксы, и ставка $0.30 за чтение кэша, передаваемая без изменений — это разница между флотом, который можно себе позволить, и тем, который нельзя. Автоматическое переключение при сбое между провайдерами — вторая половина этого — чем длиннее цикл, тем дороже сбой провайдера в середине выполнения.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing a 1,048,576-token context window, text and image input with text output, and pricing of $3.00 input and $15.00 output per million tokens.

У Agora-2 нет тарифной сетки, поэтому маршрутизировать не к чему, и мы его не хостим. Что она даёт мультиагентной команде — это исследовательский предпросмотр среды, в которую уже сегодня можно играть в браузере, подкреплённый публичным отчётом об архитектуре, в категории, где до сих пор не было симулятора общего мира за пределами игрового движка. Если вам интересно, что агенты делают друг с другом, это действительно полезная вещь, и на неё стоит потратить полдня. Если вам интересно, что агенты могут делать, то модель — это Kimi K3, а модель мира не заменяет её: эти две вещи находятся на разных уровнях одного и того же стека, и только у одного из этих уровней есть цена, которую можно занести в электронную таблицу.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно