Сгенерированная титульная карточка для Agora-2 против MiniMax M3, с подзаголовком «Одна GPU на участника, или тринадцать центов за миллион токенов». Три карточки: «MiniMax M3: $0.30/$1.20 за 1M, $0.06 за кэшированные»; «MiniMax M3: индекс AA 29, контекст 1M, открытые веса»; «Agora-2: одна RTX PRO 4500 на вид, цена не опубликована». В нижнем колонтитуле: «MiniMax M3 по данным Artificial Analysis; Agora-2 — по данным производителя, не воспроизведено».
Guides & Insights

Agora-2 против MiniMax M3: одна GPU на участника или тринадцать центов за миллион токенов

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Два способа запустить толпу агентов — с ценой в двух разных валютах. MiniMax M3 стоит $0,30 за миллион входных токенов и $1,20 за миллион выходных токенов — тариф, который превращает эксперимент с тысячей агентов в статью расходов, а не в раунд финансирования. Agora-2, мультиагентная мировая модель Odyssey, представленная 21 сентября 2026 года, обходится в одну NVIDIA RTX PRO 4500 за вид каждого участника: сессия на четырёх игроков работает на четырёх GPU, на каждой карте — по одной модели рендеринга, генерирующей перспективу этого игрока 640×480, а на одной из этих четырёх карт также лежат общая симуляция и шестнадцать политик автономных агентов. Показатель MiniMax M3 рассчитывается за токен и масштабируется в зависимости от того, сколько думают ваши агенты. Показатель Agora-2 рассчитывается на каждого смотрящего и масштабируется в зависимости от того, сколько одновременных участников вы помещаете в мир. Сравнивать их — значит сравнивать бюджет на рассуждения с бюджетом на рендеринг, и для любого, кто планирует мультиагентное исследование в 2026 году, это, как выясняется, и есть то полезное, что стоит делать.

Сторона токенов в леджере

MiniMax M3 — флагманская модель MiniMax с открытыми весами, выпущенная 31 мая 2026 года: разреженная смесь экспертов на 428 миллиардов параметров, из которых примерно 23 миллиарда активны на каждый токен, контекстное окно на 1 048 576 токенов, из которых MiniMax гарантирует 512 тыс. доступных, ввод текста, изображений и видео и оценка 29 в индексе Artificial Analysis Intelligence Index v4.3.2. По данным производителя, она показывает 83,5 в BrowseComp и 76,1 в BankerToolBench — это собственные цифры MiniMax, здесь не воспроизведённые, — а Artificial Analysis измеряет её производительность в 145 выходных токенов в секунду, что делает её десятой самой быстрой моделью в этом рейтинге.

Однако для флотов агентов значимая цифра — это ставка за чтение из кэша: $0,06 за миллион кэшированных токенов, одна пятая цены ввода. В агентных циклах преобладает префикс — один и тот же системный промпт, одни и те же схемы инструментов, одна и та же накапливающаяся история, которые заново отправляются на каждом шаге, — поэтому эффективная стоимость цикла для основной массы его токенов гораздо ближе к $0,06, чем к $0,30. Именно эта арифметика делает запуск с 1200 агентами, подобный тому, который METR задокументировала в рамках оценки ExploitGym, проведённой OpenAI в июле 2026 года, тем, что исследовательская группа может действительно воспроизвести, а не просто прочитать об этом.

Сторона бухгалтерской книги, связанная с GPU

Структура затрат Agora-2 раскрыта в её собственном приложении по реализации, и она на удивление конкретна. Одна RTX PRO 4500 Blackwell Server Edition на вид. Четыре для сессии на четырёх игроков. Эти карты генерируют вид каждого участника с целевыми показателями: пятнадцать латентных обновлений и тридцать отображаемых кадров в секунду при 640×480, а симуляция продвигается с тактом 30 Гц. В отчёте также указан масштаб обучения для сопутствующей работы: эффективный глобальный батч размером 128 на 32 GPU B200.

В пересчёте на ту же единицу, что и MiniMax M3, это один GPU дата-центра на каждого одновременного участника плюс общая симуляция, которая работает на одном из них. Это фиксированная стоимость, которой безразлично, как долго ваши агенты размышляют, и которая не падает, когда они умолкают. Отсюда следуют два вывода, и они ведут в противоположные стороны. При малом числе участников и интенсивном рассуждении на агента токенная модель, очевидно, дешевле — вы платите центы за размышления и ничего за второго агента в общем мире. При большом числе участников и плотном взаимодействии арифметика переворачивается: двадцать одновременных участников в общем мире — это двадцать GPU, число, которое не растёт с количеством токенов, которое тратит каждый из них.

• Единица стоимости — Agora-2: один RTX PRO 4500 за просмотр участника против MiniMax M3: $0.30/$1.20 за 1 млн токенов

• Чтение из кэша — Agora-2 не применимо, нет тарификации токенов в отличие от MiniMax M3, где $0,06 за 1 млн кэшированных

• Независимая оценка — Agora-2: не опубликовано, против MiniMax M3: AA Intelligence Index 29 (v4.3.2)

• Контекст — общее состояние Agora-2 плюс ограниченная история для каждого представления против MiniMax M3 1,048,576 токенов, 512K гарантированно

• Выход — видео Agora-2 640×480 с целевой частотой 30 кадр/с в сравнении с текстом MiniMax M3

• Доступ — браузерный предпросмотр Agora-2, без API, без весов против открытых весов MiniMax M3, лицензия сообщества, API

Generated two-column scoreboard for Agora-2 and MiniMax M3 on unit of cost, cache reads, independent score, context, output and access: Agora-2 one RTX PRO 4500 per view, cache reads not applicable, none published, shared state plus bounded history, 640x480 video at a 30 fps target, browser preview with no API or weights; MiniMax M3 $0.30/$1.20 per 1M tokens, $0.06 per 1M cached, AA Index 29, 1,048,576 tokens with 512K guaranteed, text output, open weights under a community licence with an API. Footer reads 'MiniMax M3 per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Почему эти две затраты не являются взаимозаменяемыми

Соблазнительно прочитать это как выбор «или — или», но это не так. MiniMax M3 — это мозг, отвечающий за политику: он воспринимает частично наблюдаемую ситуацию, рассуждает, вызывает инструменты и выдаёт действие. Agora-2 — это среда, в которой действия имеют последствия, видимые другим участникам: модель симуляции, предсказывающая, как совокупные действия меняют общее состояние, мировой сервер, который применяет их, и средства рендеринга для каждого представления, чтобы каждый участник видел один и тот же мир со своей собственной точки зрения. Шестнадцать автономных сущностей Odyssey не управляются какой-либо языковой моделью; это рекуррентные скалярные и пространственные политики, обученные с помощью обучения с подкреплением, которые используют историю из шестнадцати наблюдений и действуют каждые четыре такта симуляции. Именно этот выбор дизайна и является ключом. При тридцати тактах в секунду решение о том, что делать, — это задача управления, а задачи управления решаются обучением небольшой политики, а не вызовом API.

Итак, честная формулировка для команды, планирующей мультиагентную работу, такова: они находятся на разных уровнях, и для каждого нужен свой бюджет. Уровень рассуждений дёшев и эластичен, и его можно выбирать. Уровень среды, если вам нужно что-то помимо игрового движка, сейчас представляет собой исследовательский предпросмотр с GPU-зависимым ресурсным следом и без опубликованного API. Оба эти факта настолько новы — M3 с мая, Agora-2 с сентября, — что почти ни у кого ещё нет модели затрат для их сочетания.

Что проверено, а что является целью?

Независимая оценка MiniMax M3, размер контекстного окна, модальности и цена — это опубликованные факты, которые можно проверить уже сегодня. Его показатели в BrowseComp и BankerToolBench сообщены производителем, и при любом их цитировании это следует указывать.

Цифры Agora-2 полностью взяты из технического отчёта Team Odyssey, и никто за пределами компании их не воспроизвёл. Её результат рендеринга — 30,11 дБ PSNR для рендерера со структурированным префиксом против 20,67 дБ для базового варианта VAE на тридцати клипах мониторинга — представляет собой сравнение целостных систем с несопоставимыми бюджетами обучения, как отмечает сам отчёт. Её сокращение времени работы денойзера на 45,8% по сравнению с cross-attention получено на случайно инициализированных денойзерах на синтетических входных данных и измеряет затраты на выполнение, а не качество изображения. А в разделе об ограничениях прямо указано, что показатели в пятнадцать обновлений в секунду и тридцать кадров в секунду являются целевыми показателями; что стабильная частота кадров и задержка от ввода до отображения во время живого взаимодействия нескольких агентов «не были количественно оценены»; что долгосрочное визуальное качество, согласованность между ракурсами и сквозное соответствие действий остаются неоценёнными; что среде нужен инструментированный движок с явно заданной геометрией и фиксированным словарём внешнего вида; и что перенос за пределы обучающего домена не проверялся. Всем, кто строит модель затрат из расчёта одной GPU на вид, следует сначала прочитать этот раздел, потому что пропускная способность на одну GPU — это именно то, что не было измерено.

Звонок

Если вы создаёте флоты агентов — множество моделей, длинные циклы, вызовы инструментов, без рендеринга — MiniMax M3 — это самый дешёвый надёжный способ делать это в масштабе, и именно тариф за чтение из кэша определяет ваш счёт. Он маршрутизируется через OrcaRouter по собственной каталожной цене MiniMax с нулевой наценкой, так что $0.06 за кэшированные токены — это то, что вы платите, с переключением между провайдерами при отказе эндпоинта во время выполнения. Именно для флотов сквозная передача цены важна как никогда: наценка перекупщика на кэшированные токены — это наценка, умноженная на каждый ход каждого агента.

Screenshot of the OrcaRouter model page for MiniMax M3 (model ID minimax/minimax-m3), showing a 1,048,576-token context window, 512K maximum output, text, image and video input, and pricing of $0.30 input and $1.20 output per million tokens.

Agora-2 — это не то, к чему можно маршрутизировать запросы: нет API, нет цены и нет весов, только браузерный предпросмотр Odyssey, и мы его у себя не размещаем. Это первый симулятор общего мира, созданный специально для того, чтобы можно было наблюдать, как множество участников — людей и синтетических — взаимодействуют в контролируемых условиях, а отчёт под ним на удивление откровенно говорит о том, насколько он сейчас далёк от готового продукта. Если ваша задача — масштабные рассуждения, MiniMax M3 доступен уже сейчас и недорог. Если ваша задача — что произойдёт, когда тысяча таких систем рассуждения разделит один мир, Odyssey построила арену и оставила сложные измерения кому-то другому.