Сгенерированная титульная карточка для Agora-2 против Grok 4.6 с подзаголовком «1 200 LLM-агентов и симулятор, который не использует ни то, ни другое». Три карточки: «Grok 4.6: индекс AA 44, $2/$6 за 1 млн, $0,50 за кэшированные»; «Agora-2: 16 политик RL-агентов, ни одной LLM в цикле»; «Agora-2: тик 30 Гц, 4 GPU RTX PRO 4500 на сессию». В нижнем колонтитуле: «Показатели Agora-2 — из собственного отчёта Odyssey, не воспроизведены; Grok 4.6 — по данным Artificial Analysis».
Guides & Insights

Agora-2 против Grok 4.6: вопрос агентной политики — 1 200 LLM-агентов и симулятор, который не использует ни один из них

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Вот число, которое стоит денег. Расследование METR об июльском инциденте 2026 года с Hugging Face насчитало примерно 1 200 скоординированных агентов в рамках одного прогона оценки. По Grok 4.6 — $2,00 за миллион входных токенов, $6,00 за миллион выходных — флот такого размера, шесть дней перемалывающий длинные транскрипты, выставляет счёт, который хорошо финансируемая команда действительно способна потянуть. По цене модели, к которой вы бы обратились в ином случае, — нет. Это и есть настоящее продуктовое заявление Grok 4.6, и это то же самое заявление, которому Agora-2 тихо противоречит: когда Odyssey 21 сентября 2026 года представила свою мультиагентную модель мира — играбельный превью-вариант, генерирующий общие среды для максимум 20 человек и ИИ-агентов, — агенты внутри неё оказались вовсе не языковыми моделями. Вместо этого Odyssey обучила небольшие политики обучения с подкреплением. Интересный вопрос, который поднимает это сопоставление, — не в том, что лучше. А в том, почему лаборатория отказалась от LLM.

Тарифная карта — в тех единицах, которые важны для автопарков

Grok 4.6 вышел 12 августа 2026 года как фронтирный уровень xAI: окно контекста на 500 000 токенов, ввод текста, изображений и файлов, настраиваемый объём рассуждений, нативный вызов инструментов, структурированные выходные данные и индекс интеллекта Artificial Analysis, равный 44 по версии индекса v4.3.2 — того же индекса, в котором GPT-5.6 Sol занимает 47, а Kimi K3 — 44. Artificial Analysis оценивает его в 94,9 балла по GPQA Diamond, и именно эту модель xAI указывает как «Latest» в своей собственной документации для разработчиков. Она предоставляется как полноценная модель OpenAI Responses, и в этом заключается практическая суть: агентные фреймворки внедряют её, меняя базовый URL, а не написав адаптер.

Но интересная цифра — это сочетание $2/$6 с контекстным окном. Долгосрочные циклы агентов — это тяжёлые рабочие нагрузки: десятки тысяч токенов накопленного вывода инструментов на агента в час, большая часть которых избыточна. Ставка чтения из кэша у Grok 4.6 составляет $0.50 за миллион — четверть цены его входных данных, и именно это делает запуск с тысячей агентов арифметически правдоподобным, а не просто возможным. Обратите внимание на границу уровня: запросы объёмом выше 200K токенов тарифицируются по двойному базовому тарифу, поэтому агент, отращивающий длинную историю, незаметно удваивает собственную стоимость.

• Цена — Agora-2: нет опубликованной цены, только предварительный просмотр в браузере, против Grok 4.6 — $2.00/$6.00 за 1 млн, $0.50 за кэшированное чтение, удваивается при объеме входных данных свыше 200K

• Контекст — общее состояние Agora-2 плюс ограниченная история по представлениям против 500 000 токенов Grok 4.6

• Независимая оценка — у Agora-2 не опубликована, против Grok 4.6 — AA Intelligence Index 44 (v4.3.2)

• Рассуждение — Agora-2: неприменимо, не языковая модель; в сравнении с Grok 4.6 — настраиваемое усилие, нативный вызов инструментов

• Доступ — игровое превью Agora-2, без API, без весов, против проприетарного API Grok 4.6

• Аппаратное обеспечение — Agora-2: четыре GPU RTX PRO 4500 для четырёх одновременных представлений против Grok 4.6 — хостируемого эндпоинта

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

Почему Odyssey не выставила LLM на арену

Очевидный короткий путь, если вы создаёте мир, где шестнадцать ИИ-агентов сражаются против четырёх человек, — подключить мощную текстовую модель к управлению и позволить ей играть. Odyssey так не поступила, а её технический отчёт объясняет причину в таблице конфигурации. Политика агента в Agora-2 — это рекуррентная скалярная и пространственная политика, потребляющая историю из шестнадцати наблюдений и выдающая действие каждые четыре тика симуляции по четырнадцати дискретным ветвям движения. Сама симуляция продвигается с частотой тиков 30 Гц. Модель, которую просят принимать решение тридцать раз в секунду, на основе частично наблюдаемого представления, с фиксированным низкоуровневым словарём действий, — это не задача рассуждения, а задача управления, и задачи управления решаются обучением небольшой политики, а не промптингом фронтирной модели с контекстом 500K.

Об этом стоит сказать прямо, потому что это самое распространённое заблуждение о категории моделей мира. Agora-2 не конкурирует с Grok 4.6 за один и тот же слот в системе. Она занимает слот уровнем ниже: среду, в которой обучается и оценивается политика. Архитектура отчёта явно описывает это разделение — модель симуляции предсказывает, как совместные действия изменяют общее состояние, сервер мира применяет их, а модель рендеринга для каждого ракурса генерирует собственную перспективу 640×480 каждого участника на основе этого состояния. В цикле взаимодействия нигде не участвует текстовая модель.

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Там, где появляется такая модель, как Grok 4.6, — это на уровень выше: как то, что пишет каркас оценки, анализирует транскрипты или управляет агентом, использующим инструменты, чьё поведение вы пытаетесь изучить. Именно эту роль играл GPT-5.6 Sol в исследовании METR — около 5% парка, а также аналитик, читающий логи, — и именно эту роль цена и контекстное окно Grok 4.6 делают дешёвой.

Здесь разрыв в доказательствах шире, чем в большинстве таких сопоставлений.

Показатель Grok 4.6 в индексе измерен независимо, его тарифная сетка опубликована, а контекстное окно задокументировано. Числа Agora-2 взяты из отчёта, автором которого является Team Odyssey, и никем не воспроизведены. На тридцати клипах мониторинга его рендерер со структурированным префиксом достигает 30,11 дБ PSNR против 20,67 дБ у базового VAE — сравнение, о котором сам отчёт предупреждает, что оно проводится между полными системами с несопоставимыми бюджетами обучения, а не является изолированным тестом архитектуры. Его бенчмарк обусловливания, демонстрирующий сокращение времени денойзера на 45,8% по сравнению с кросс-вниманием, использует случайно инициализированные денойзеры на синтетических входных данных и измеряет затраты на выполнение, а не качество изображения.

Затем идёт раздел ограничений, который необычно прямолинеен. Указанные 15 латентных обновлений и 30 отображаемых кадров в секунду — это целевые показатели. Устойчивая частота кадров и задержка от ввода до отображения во время живого мультиагентного взаимодействия «не были количественно оценены». Долгосрочное визуальное качество, согласованность между видами и сквозное соответствие действий — все перечислены как неоценённые. Среда требует инструментированного игрового движка с явной геометрией и фиксированным словарём внешнего вида, а перенос на новые ассеты, правила или среды не проверен. Прочитайте этот список, прежде чем читать какие-либо ключевые цифры об Agora-2.

Какой из них должен быть в вашем стеке

Если вы сегодня запускаете или изучаете многоагентные системы, Grok 4.6 — это тот компонент, который вы действительно можете развернуть: текстовая модель уровня фронтира по цене, которая делает большие флоты агентов доступными, с опубликованной оценкой и документированной поверхностью API. В OrcaRouter она предоставляется по собственной прайс-листовой цене xAI без какой-либо наценки, так что указанные выше $2/$6 и любые будущие изменения тарифов попадут в ваш счёт в тот же день, когда произойдут, с автоматическим переключением при отказе, если основной эндпоинт деградирует. Оба факта особенно важны именно для сценариев с флотами агентов: тысяча агентов — это тысяча шансов столкнуться с деградировавшим провайдером, а наценка поверх $6 за вывод — это наценка, умноженная на весь ваш прогон.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 — это не инфраструктура, готовая к развёртыванию, и мы её не размещаем у себя: нет ни API, ни весов, ни цены — только собственное доступное для игры превью Odyssey. Она предлагает ценность иного рода: контролируемую среду для исследований взаимодействия, которые, как показывает отчёт METR, сейчас стали насущными, ценой четырёх GPU RTX PRO 4500 для четырёх одновременных просмотров, а не счёта за API. Честный вердикт: эти двое не конкурируют. Grok 4.6 — это мозг для политики, который можно купить по токенам уже сегодня; Agora-2 — это предложение о том, где тестировать, что произойдёт, когда встретятся тысячи таких мозгов. Второе — более интересное исследование и менее готовый продукт, и собственный отчёт Odyssey освежающе ясно говорит о том, какие его части всё ещё остаются целями.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно