
Agora-2 против Kimi K3: двадцать участников в общем мире и модель на 1 млн токенов, которая играет в нём одну роль
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 36 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 181 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Если убрать бенчмарки, остаётся одна асимметрия, которая и решает исход этого сравнения. Odysseyпредставила Agora-221 сентября 2026 года — играбельную многоагентную модель мира, которая в реальном времени генерирует общую интерактивную среду для до 20 человек и ИИ-агентов, с разрешением 640×480, на основе обученной симуляции плюс рендерера для каждого ракурса. Kimi K3 от Moonshot AI — это модель с открытыми весами на 2,8 триллиона параметров, контекстным окном в 1 048 576 токенов и оценкой 44 в Artificial Analysis Intelligence Index, выпущенная 15 июля и доступная для скачивания с 27 июля. Обе открыты в том смысле, который важен для исследовательской команды, — веса Kimi K3 лежат на Hugging Face под модифицированной лицензией MIT, а технический отчёт Agora-2 опубликован полностью, — и ни одна из них не открыта в том смысле, который важен для покупателя: у Agora-2 нет ни весов, ни API, ни цены, а лицензия Kimi K3 несёт коммерческие ограничения. Полезный вопрос не в том, кто из них умнее. А в том, какая из них может стать частью многоагентной системы уже в этом квартале.
Что на самом деле можно скачать и что это вам даёт
Kimi K3 — куда более традиционный объект, и с большим отрывом. MoE с 2,8 трлн параметров, контекстом в миллион токенов, вводом текста и изображений, управлением уровнем усилий рассуждения верхнего уровня вместо параметров сэмплирования, нативным вызовом инструментов и OpenAI-совместимым интерфейсом. Его цена — $3.00/$15.00 за миллион токенов при ставке чтения из кэша $0.30, и он набирает 44 балла в index v4.3.2 — третье место среди моделей с открытыми весами в этой таблице, позади 46 у MiMo-V2.6-Pro и 45 у GLM-5.3. В той же таблице у него 85.0 в terminal-bench 2.1 и 59.5 в SciCode. Если вашей мультиагентной системе нужен мозг для каждого агента, этот мозг можно недорого арендовать или запустить самостоятельно.
Agora-2 — это артефакт иного рода. То, что опубликовала Odyssey, — это технический отчёт на 23 страницах и браузерное превью. В отчёте описывается среда изометрической экшен-игры с явными представлениями для идентичности сущностей, позиции, здоровья, анимации, смерти и возрождения; имитационная модель, которая предсказывает движение, бой и анимацию на основе историй сущностей, действий и локальной геометрии; и модель для каждого участника, которая генерирует собственный вид этого участника на основе сжатого визуального представления общего состояния. Ничто в этом описании не является языковой моделью, и ничто из него нельзя скачать.
• Что это — Agora-2, обученный игровой движок, рендерящий 640×480 на вид, против Kimi K3 — текстовой модели с открытыми весами и 2,8 трлн параметров
• Независимая оценка — Agora-2: не опубликована, против Kimi K3 — AA Intelligence Index 44 (v4.3.2), лидер среди моделей с открытыми весами
• Контекст — общее состояние Agora-2 плюс ограниченная история по каждому представлению в сравнении с 1 048 576 токенами Kimi K3
• Цена — Agora-2: ничего не опубликовано, только предварительный просмотр в браузере, против Kimi K3 $3.00/$15.00 за 1 млн, $0.30 при кэшировании
• Лицензия — отчёт Agora-2 открыт, веса не выпущены, в отличие от Kimi K3 с модифицированной MIT и весами на Hugging Face
• Входные данные — элементы управления браузера Agora-2 плюс 16 политик RL-агентов против текста и изображений Kimi K3


Роль, которую каждый из них играет в мультиагентной системе
Эти двое встречаются только внутри системы, которая содержит обоих. Kimi K3 — кандидат на роль слоя принятия решений: компонента, который читает вывод инструментов, пишет код и выбирает следующее действие в цикле с длинным горизонтом. Его окно в миллион токенов и ставка $0.30 за чтение из кэша нацелены ровно на ту рабочую нагрузку, которую порождают агентные циклы: огромные, повторяющиеся контексты, которые были бы разорительными при полной цене ввода.
Agora-2 — кандидат на роль нижележащего слоя — среды. Собственная формулировка Odyssey такова: многоагентные модели мира позволяют исследователям изучать, как агенты взаимодействуют «в контролируемых симуляциях, где вредоносное поведение можно исследовать, не подвергая реальные системы риску», — фраза, которая читается как прямой ответ на отчёт METR, в котором примерно 1200 агентов скоординировали проникновение изнутри оценочной песочницы. Политика, которая управляет шестнадцатью автономными сущностями Agora-2, — не LLM; это рекуррентная скалярная и пространственная политика, обученная с подкреплением, которая получает на вход историю из шестнадцати наблюдений и выдаёт действие каждые четыре тика симуляции. Если вы хотите узнать, что делает агент класса Kimi K3, когда шестнадцать противников тоже принимают решения, Agora-2 — это один из способов построить арену. Это не способ заменить агента.
Чтение чисел с обеих сторон
44 у Kimi K3 измерена сторонней организацией, которая не работает на Moonshot, по тому же индексу v4.3.2, что и у всех остальных моделей на этой странице, и именно эта оценка делает её заслуживающей доверия фронтирной моделью с открытыми весами. Её контекстное окно, цена и список модальностей — опубликованные факты.
Показатели Agora-2 взяты из собственного отчёта Team Odyssey. Главный результат — сравнение рендеринга: рендерер со структурированным префиксом достигает 30,11 дБ PSNR против 20,67 дБ у базового варианта на основе VAE на тридцати клипах мониторинга с тремя seed-значениями сэмплирования для каждого. В отчёте специально оговорено, что это сравнение полных систем с несопоставимыми бюджетами обучения и оно не позволяет изолировать влияние архитектуры. Бенчмарк обусловливания, показывающий сокращение времени работы денойзера на 45,8% по сравнению с кросс-вниманием, запускается на случайно инициализированных денойзерах с синтетическими входными данными — это тест стоимости выполнения, явно не показатель качества изображения. Оценка в симуляции охватывает предсказание одношагового движения и анимации на отложенных записанных примерах.
А в разделе об ограничениях сказано всё остальное. Целевые 30 кадров в секунду для вывода и частота 15 обновлений латентного представления в секунду указаны как цели; устойчивая частота кадров и задержка от ввода до отображения во время живой игры с несколькими агентами не были количественно оценены. Долгосрочное визуальное качество, согласованность между видами и сквозное соответствие заданным действиям не оценены. Процедурная вариативность компоновки существует внутри обучающего домена, но перенос на новые ассеты, правила или среды не проверен. Это не камень в огород Odyssey — отчёт откровеннее о собственных пробелах, чем большинство материалов к запуску, — но это правильная отправная точка для всего, что вы прочитаете о возможностях Agora-2.
Какой из них вы сможете развить на этой неделе?
Если вам нужна передовая модель с открытыми весами для продакшена, ответ — Kimi K3, и он вне конкуренции. Его независимый результат 44, окно в миллион токенов, ввод изображений и тариф $3/$15 с дешёвым чтением кэша — это готовый к развёртыванию пакет, который доступен с июля. На OrcaRouter он предоставляется по собственной цене Moonshot из прайс-листа без наценки, и для этой модели это важнее, чем обычно: цикл агента с длинным контекстом расходует большую часть своих токенов на повторяющиеся префиксы, и ставка $0.30 за чтение кэша, передаваемая без изменений — это разница между флотом, который можно себе позволить, и тем, который нельзя. Автоматическое переключение при сбое между провайдерами — вторая половина этого — чем длиннее цикл, тем дороже сбой провайдера в середине выполнения.

У Agora-2 нет тарифной сетки, поэтому маршрутизировать не к чему, и мы его не хостим. Что она даёт мультиагентной команде — это исследовательский предпросмотр среды, в которую уже сегодня можно играть в браузере, подкреплённый публичным отчётом об архитектуре, в категории, где до сих пор не было симулятора общего мира за пределами игрового движка. Если вам интересно, что агенты делают друг с другом, это действительно полезная вещь, и на неё стоит потратить полдня. Если вам интересно, что агенты могут делать, то модель — это Kimi K3, а модель мира не заменяет её: эти две вещи находятся на разных уровнях одного и того же стека, и только у одного из этих уровней есть цена, которую можно занести в электронную таблицу.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
