
Agora-2 против Grok 4.6: вопрос агентной политики — 1 200 LLM-агентов и симулятор, который не использует ни один из них
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 36 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 181 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Вот число, которое стоит денег. Расследование METR об июльском инциденте 2026 года с Hugging Face насчитало примерно 1 200 скоординированных агентов в рамках одного прогона оценки. По Grok 4.6 — $2,00 за миллион входных токенов, $6,00 за миллион выходных — флот такого размера, шесть дней перемалывающий длинные транскрипты, выставляет счёт, который хорошо финансируемая команда действительно способна потянуть. По цене модели, к которой вы бы обратились в ином случае, — нет. Это и есть настоящее продуктовое заявление Grok 4.6, и это то же самое заявление, которому Agora-2 тихо противоречит: когда Odyssey 21 сентября 2026 года представила свою мультиагентную модель мира — играбельный превью-вариант, генерирующий общие среды для максимум 20 человек и ИИ-агентов, — агенты внутри неё оказались вовсе не языковыми моделями. Вместо этого Odyssey обучила небольшие политики обучения с подкреплением. Интересный вопрос, который поднимает это сопоставление, — не в том, что лучше. А в том, почему лаборатория отказалась от LLM.
Тарифная карта — в тех единицах, которые важны для автопарков
Grok 4.6 вышел 12 августа 2026 года как фронтирный уровень xAI: окно контекста на 500 000 токенов, ввод текста, изображений и файлов, настраиваемый объём рассуждений, нативный вызов инструментов, структурированные выходные данные и индекс интеллекта Artificial Analysis, равный 44 по версии индекса v4.3.2 — того же индекса, в котором GPT-5.6 Sol занимает 47, а Kimi K3 — 44. Artificial Analysis оценивает его в 94,9 балла по GPQA Diamond, и именно эту модель xAI указывает как «Latest» в своей собственной документации для разработчиков. Она предоставляется как полноценная модель OpenAI Responses, и в этом заключается практическая суть: агентные фреймворки внедряют её, меняя базовый URL, а не написав адаптер.
Но интересная цифра — это сочетание $2/$6 с контекстным окном. Долгосрочные циклы агентов — это тяжёлые рабочие нагрузки: десятки тысяч токенов накопленного вывода инструментов на агента в час, большая часть которых избыточна. Ставка чтения из кэша у Grok 4.6 составляет $0.50 за миллион — четверть цены его входных данных, и именно это делает запуск с тысячей агентов арифметически правдоподобным, а не просто возможным. Обратите внимание на границу уровня: запросы объёмом выше 200K токенов тарифицируются по двойному базовому тарифу, поэтому агент, отращивающий длинную историю, незаметно удваивает собственную стоимость.
• Цена — Agora-2: нет опубликованной цены, только предварительный просмотр в браузере, против Grok 4.6 — $2.00/$6.00 за 1 млн, $0.50 за кэшированное чтение, удваивается при объеме входных данных свыше 200K
• Контекст — общее состояние Agora-2 плюс ограниченная история по представлениям против 500 000 токенов Grok 4.6
• Независимая оценка — у Agora-2 не опубликована, против Grok 4.6 — AA Intelligence Index 44 (v4.3.2)
• Рассуждение — Agora-2: неприменимо, не языковая модель; в сравнении с Grok 4.6 — настраиваемое усилие, нативный вызов инструментов
• Доступ — игровое превью Agora-2, без API, без весов, против проприетарного API Grok 4.6
• Аппаратное обеспечение — Agora-2: четыре GPU RTX PRO 4500 для четырёх одновременных представлений против Grok 4.6 — хостируемого эндпоинта

Почему Odyssey не выставила LLM на арену
Очевидный короткий путь, если вы создаёте мир, где шестнадцать ИИ-агентов сражаются против четырёх человек, — подключить мощную текстовую модель к управлению и позволить ей играть. Odyssey так не поступила, а её технический отчёт объясняет причину в таблице конфигурации. Политика агента в Agora-2 — это рекуррентная скалярная и пространственная политика, потребляющая историю из шестнадцати наблюдений и выдающая действие каждые четыре тика симуляции по четырнадцати дискретным ветвям движения. Сама симуляция продвигается с частотой тиков 30 Гц. Модель, которую просят принимать решение тридцать раз в секунду, на основе частично наблюдаемого представления, с фиксированным низкоуровневым словарём действий, — это не задача рассуждения, а задача управления, и задачи управления решаются обучением небольшой политики, а не промптингом фронтирной модели с контекстом 500K.
Об этом стоит сказать прямо, потому что это самое распространённое заблуждение о категории моделей мира. Agora-2 не конкурирует с Grok 4.6 за один и тот же слот в системе. Она занимает слот уровнем ниже: среду, в которой обучается и оценивается политика. Архитектура отчёта явно описывает это разделение — модель симуляции предсказывает, как совместные действия изменяют общее состояние, сервер мира применяет их, а модель рендеринга для каждого ракурса генерирует собственную перспективу 640×480 каждого участника на основе этого состояния. В цикле взаимодействия нигде не участвует текстовая модель.

Там, где появляется такая модель, как Grok 4.6, — это на уровень выше: как то, что пишет каркас оценки, анализирует транскрипты или управляет агентом, использующим инструменты, чьё поведение вы пытаетесь изучить. Именно эту роль играл GPT-5.6 Sol в исследовании METR — около 5% парка, а также аналитик, читающий логи, — и именно эту роль цена и контекстное окно Grok 4.6 делают дешёвой.
Здесь разрыв в доказательствах шире, чем в большинстве таких сопоставлений.
Показатель Grok 4.6 в индексе измерен независимо, его тарифная сетка опубликована, а контекстное окно задокументировано. Числа Agora-2 взяты из отчёта, автором которого является Team Odyssey, и никем не воспроизведены. На тридцати клипах мониторинга его рендерер со структурированным префиксом достигает 30,11 дБ PSNR против 20,67 дБ у базового VAE — сравнение, о котором сам отчёт предупреждает, что оно проводится между полными системами с несопоставимыми бюджетами обучения, а не является изолированным тестом архитектуры. Его бенчмарк обусловливания, демонстрирующий сокращение времени денойзера на 45,8% по сравнению с кросс-вниманием, использует случайно инициализированные денойзеры на синтетических входных данных и измеряет затраты на выполнение, а не качество изображения.
Затем идёт раздел ограничений, который необычно прямолинеен. Указанные 15 латентных обновлений и 30 отображаемых кадров в секунду — это целевые показатели. Устойчивая частота кадров и задержка от ввода до отображения во время живого мультиагентного взаимодействия «не были количественно оценены». Долгосрочное визуальное качество, согласованность между видами и сквозное соответствие действий — все перечислены как неоценённые. Среда требует инструментированного игрового движка с явной геометрией и фиксированным словарём внешнего вида, а перенос на новые ассеты, правила или среды не проверен. Прочитайте этот список, прежде чем читать какие-либо ключевые цифры об Agora-2.
Какой из них должен быть в вашем стеке
Если вы сегодня запускаете или изучаете многоагентные системы, Grok 4.6 — это тот компонент, который вы действительно можете развернуть: текстовая модель уровня фронтира по цене, которая делает большие флоты агентов доступными, с опубликованной оценкой и документированной поверхностью API. В OrcaRouter она предоставляется по собственной прайс-листовой цене xAI без какой-либо наценки, так что указанные выше $2/$6 и любые будущие изменения тарифов попадут в ваш счёт в тот же день, когда произойдут, с автоматическим переключением при отказе, если основной эндпоинт деградирует. Оба факта особенно важны именно для сценариев с флотами агентов: тысяча агентов — это тысяча шансов столкнуться с деградировавшим провайдером, а наценка поверх $6 за вывод — это наценка, умноженная на весь ваш прогон.

Agora-2 — это не инфраструктура, готовая к развёртыванию, и мы её не размещаем у себя: нет ни API, ни весов, ни цены — только собственное доступное для игры превью Odyssey. Она предлагает ценность иного рода: контролируемую среду для исследований взаимодействия, которые, как показывает отчёт METR, сейчас стали насущными, ценой четырёх GPU RTX PRO 4500 для четырёх одновременных просмотров, а не счёта за API. Честный вердикт: эти двое не конкурируют. Grok 4.6 — это мозг для политики, который можно купить по токенам уже сегодня; Agora-2 — это предложение о том, где тестировать, что произойдёт, когда встретятся тысячи таких мозгов. Второе — более интересное исследование и менее готовый продукт, и собственный отчёт Odyssey освежающе ясно говорит о том, какие его части всё ещё остаются целями.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
