Agora-2 vs MiniMax M3용으로 생성된 타이틀 카드, 부제 ‘참여자당 GPU 1개, 또는 100만 토큰당 13센트’. 세 장의 카드: ‘MiniMax M3: 1M당 $0.30/$1.20, 캐시 시 $0.06’; ‘MiniMax M3: AA Index 29, 1M 컨텍스트, 오픈 웨이트’; ‘Agora-2: 뷰당 RTX PRO 4500 1개, 공개된 가격 없음’. 하단 문구: ‘MiniMax M3는 Artificial Analysis 기준; Agora-2는 벤더 보고 수치이며 재현되지 않음.’
Guides & Insights

Agora-2 vs MiniMax M3: 참가자당 GPU 1개, 아니면 백만 토큰당 13센트

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

에이전트 무리를 운영하는 두 가지 방법, 서로 다른 두 화폐로 값을 매긴 것. MiniMax M3는 백만 입력 토큰당 $0.30, 백만 출력 토큰당 $1.20이다 — 이 요율이면 천 개 에이전트 실험이 펀딩 라운드가 아니라 비용 항목 한 줄이 된다. Agora-2는 멀티 에이전트 월드 모델인데, Odyssey가 2026년 9월 21일에 미리 공개했고, 참가자 뷰 하나당 NVIDIA RTX PRO 4500 한 장이 든다. 4인 세션은 GPU 네 장에서 돌아가며, 카드 한 장마다 렌더링 모델 하나가 해당 플레이어의 640×480 시점을 생성하고, 그 네 장 중 한 장은 공유 시뮬레이션과 열여섯 개의 자율 에이전트 정책까지 함께 맡는다. MiniMax M3의 숫자는 토큰당이고, 여러분의 에이전트가 얼마나 생각하는지에 따라 커진다. Agora-2의 숫자는 눈알당이고, 세계에 동시에 넣는 참가자가 몇 명인지에 따라 커진다. 이 둘을 비교하는 것은 추론 예산과 렌더링 예산을 비교하는 일이며, 2026년에 멀티 에이전트 연구를 계획하는 사람이라면 바로 그것이야말로 해볼 만한 유용한 일이다.

원장의 토큰 측면

MiniMax M3는 2026년 5월 31일에 출시된 MiniMax의 오픈 웨이트 플래그십으로, 약 4,280억 개의 파라미터를 지닌 희소 전문가 혼합(mixture-of-experts) 모델이며 토큰당 약 230억 개의 파라미터가 활성화되고, 1,048,576토큰 컨텍스트 윈도우(이 중 MiniMax는 512K가 사용 가능하다고 보장)에 텍스트, 이미지, 비디오 입력을 지원하며, Artificial Analysis Intelligence Index v4.3.2에서 29점을 기록했다. 벤더 수치로 BrowseComp에서 83.5, BankerToolBench에서 76.1을 보고하는데 — 이는 MiniMax 자체 수치이며 여기서 재현된 것은 아니다 — Artificial Analysis는 이를 초당 출력 토큰 145개로 측정했으며, 이는 해당 순위표에서 열 번째로 빠른 모델이다.

하지만 에이전트 플릿에 관련된 숫자는 캐시 읽기 요금입니다: 캐시된 토큰 백만 개당 $0.06, 입력 가격의 5분의 1입니다. 에이전트 루프는 프리픽스가 지배적입니다 — 동일한 시스템 프롬프트, 동일한 도구 스키마, 동일하게 누적되는 이력이 매 턴마다 다시 전송됩니다 — 따라서 루프의 실효 비용은 대부분의 토큰에 대해 $0.30보다 $0.06에 훨씬 더 가깝습니다. 바로 이 계산 덕분에, METR이 OpenAI의 2026년 7월 ExploitGym 평가 내에서 문서화한 종류의 1,200개 에이전트 실행은 연구 그룹이 단지 읽기만 하는 것이 아니라 실제로 재현할 수 있는 것이 됩니다.

원장의 GPU 측면

Agora-2의 비용 구조는 자체 구현 부록에 공개되어 있으며, 반가울 정도로 구체적이다. 뷰당 RTX PRO 4500 Blackwell Server Edition 한 장. 4인 플레이어 세션에는 네 장. 이 카드들은 각 참가자의 뷰를 640×480 해상도에서 초당 15회의 잠재 업데이트와 30개의 표시 프레임을 목표로 생성하며, 시뮬레이션은 30Hz 틱으로 진행된다. 보고서는 또한 주변 작업의 학습 규모도 제시한다: 32개의 B200 GPU에 걸친 유효 글로벌 배치 128.

MiniMax M3와 같은 단위로 환산하면, 즉 동시 참가자 한 명당 데이터센터 GPU 한 장이고, 공유 시뮬레이션은 그중 한 장에 얹혀 함께 돌아간다. 이는 여러분의 에이전트가 얼마나 오래 숙고하든 개의치 않고, 에이전트들이 조용해져도 줄어들지 않는 고정 비용이다. 여기서 두 가지 결과가 나오는데, 서로 반대 방향을 가리킨다. 참가자 수가 적고 에이전트당 추론이 많은 경우에는 토큰 모델이 분명히 더 저렴하다. 생각하는 데는 몇 센트를 내고, 방 안의 두 번째 에이전트에는 아무것도 내지 않는다. 참가자 수가 많고 상호작용이 촘촘한 경우에는 계산이 뒤집힌다. 공유 세계에 동시 참가자가 스무 명이면 GPU 스무 장이고, 이 숫자는 각자가 소비하는 토큰 수에 따라 늘어나지 않는다.

• 비용 단위 — Agora-2는 참가자 뷰당 RTX PRO 4500 1개 vs MiniMax M3는 100만 토큰당 $0.30/$1.20

• 캐시 읽기 — Agora-2 해당 없음, 토큰 과금 없음 vs MiniMax M3 캐시 1M당 $0.06

• 독립 점수 — Agora-2는 공개된 점수 없음 vs MiniMax M3 AA Intelligence Index 29 (v4.3.2)

• 컨텍스트 — Agora-2 공유 상태 + 뷰별 제한된 히스토리 vs MiniMax M3 1,048,576 토큰, 512K 보장

• 출력 — Agora-2 640×480 비디오(30 fps 목표) vs MiniMax M3 텍스트

• 접근성 — Agora-2 브라우저 프리뷰, API 없음, 가중치 없음 vs MiniMax M3 오픈 가중치, 커뮤니티 라이선스, API

Generated two-column scoreboard for Agora-2 and MiniMax M3 on unit of cost, cache reads, independent score, context, output and access: Agora-2 one RTX PRO 4500 per view, cache reads not applicable, none published, shared state plus bounded history, 640x480 video at a 30 fps target, browser preview with no API or weights; MiniMax M3 $0.30/$1.20 per 1M tokens, $0.06 per 1M cached, AA Index 29, 1,048,576 tokens with 512K guaranteed, text output, open weights under a community licence with an API. Footer reads 'MiniMax M3 per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

두 비용이 대체재가 아닌 이유

이것을 양자택일로 읽고 싶은 유혹이 들지만, 그것은 양자택일이 아니다. MiniMax M3는 정책 두뇌다: 부분적으로 관측된 상황을 읽고, 추론하고, 도구를 호출하며, 행동을 출력한다. Agora-2는 행동이 다른 참여자에게 보이는 결과를 낳는 환경이다 — 결합된 행동이 공유 상태를 어떻게 변화시키는지 예측하는 시뮬레이션 모델, 그러한 행동을 적용하는 월드 서버, 그리고 각 참여자가 동일한 세계를 자신의 관점에서 볼 수 있게 하는 뷰별 렌더러로 이루어져 있다. Odyssey의 16개 자율 개체는 어떤 언어 모델로도 구동되지 않는다. 이들은 강화 학습으로 훈련된 순환 스칼라 및 공간 정책으로, 16개 관측 이력을 입력으로 삼아 네 번의 시뮬레이션 틱마다 행동한다. 그 설계 선택이 바로 단서다. 초당 30틱에서는 무엇을 할지 결정하는 것이 제어 문제이며, 제어 문제는 API를 호출하는 대신 작은 정책을 훈련함으로써 해결된다.

따라서 멀티 에이전트 작업을 계획하는 팀에게 솔직한 프레이밍은, 이것들이 서로 다른 계층에 존재하며 각각에 대한 예산이 필요하다는 것입니다. 추론 계층은 저렴하고 탄력적이며, 여러 선택지를 두고 골라 쓸 수 있습니다. 환경 계층은 게임 엔진이 아닌 다른 무언가를 원한다면, 현재 GPU가 필수인 풋프린트를 지닌 연구 프리뷰이며 공개된 API가 없습니다. 두 사실 모두 충분히 새로운 것입니다 — M3는 5월부터, Agora-2는 9월부터 — 그래서 이 조합에 대한 비용 모델을 가진 사람은 아직 거의 없습니다.

무엇이 검증되었고 무엇이 목표인가

MiniMax M3의 독립 평가 점수, 컨텍스트 윈도우, 모달리티 및 가격은 공개된 사실이며 오늘 확인할 수 있습니다. BrowseComp 및 BankerToolBench 수치는 벤더가 보고한 것이므로 이를 인용할 때마다 그렇게 표시해야 합니다.

Agora-2의 수치는 전적으로 Team Odyssey의 기술 보고서에서 비롯되며, 회사 외부의 누구도 이를 재현하지 못했다. 30개의 모니터링 클립에서 구조화된 접두사 렌더러의 30.11dB PSNR 대 VAE 기준선의 20.67dB라는 렌더링 결과는, 보고서 자체가 지적하듯, 학습 예산이 서로 맞춰지지 않은 완전한 시스템들 간의 비교다. 교차 어텐션 대비 45.8%의 디노이저 시간 감소는 합성 입력에 대해 무작위로 초기화된 디노이저에서 비롯되며, 이미지 품질이 아니라 실행 비용을 측정한다. 또한 한계 섹션은 다음과 같이 분명히 밝힌다: 초당 15회 업데이트 및 초당 30프레임 속도는 목표치이다; 라이브 다중 에이전트 상호작용 중 지속 프레임 레이트와 입력-디스플레이 지연은 "정량적으로 평가되지 않았다"; 장기 시각 품질, 뷰 간 일치도 및 종단 간 행동 준수는 평가되지 않은 채 남아 있다; 환경에는 명시적 기하 구조와 고정된 외형 어휘를 갖춘 계측된 엔진이 필요하다; 그리고 학습 도메인 밖으로의 전이는 검증되지 않았다. 뷰당 GPU 하나를 기준으로 비용 모델을 구축하는 사람이라면 누구든 그 섹션을 먼저 읽어야 한다. GPU당 처리량이 바로 측정되지 않은 항목이기 때문이다.

전화

에이전트 플릿을 구축하고 있다면 — 여러 모델, 긴 루프, 도구 호출, 렌더링 없음 — MiniMax M3는 이를 대규모로 해내는 가장 저렴하고 신뢰할 수 있는 방법이며, 청구서를 좌우하는 숫자는 바로 캐시 읽기 요금입니다. 이는 OrcaRouter에서 MiniMax 자체 정가에 마크업 없이 라우팅되므로, $0.06의 캐시 요금이 곧 지불하는 금액이며, 실행 중 엔드포인트가 저하되면 제공자 간 페일오버가 함께합니다. 특히 플릿의 경우 패스스루가 평소보다 더 중요합니다: 캐시된 토큰에 붙는 리셀러 마진은 모든 에이전트의 모든 턴마다 곱해지는 마진입니다.

Screenshot of the OrcaRouter model page for MiniMax M3 (model ID minimax/minimax-m3), showing a 1,048,576-token context window, 512K maximum output, text, image and video input, and pricing of $0.30 input and $1.20 output per million tokens.

Agora-2는 라우팅해서 연결할 수 있는 대상이 아닙니다. API도, 가격도, 가중치도 없고 Odyssey의 브라우저 미리보기만 있을 뿐이며, 우리가 이를 호스팅하지도 않습니다. 이것은 인간과 합성 참가자 등 많은 참여자가 통제된 조건에서 상호작용하는 모습을 관찰할 수 있도록 특별히 만들어진 최초의 공유 세계 시뮬레이터이며, 그 아래에 있는 보고서는 이것이 현재 제품과 얼마나 거리가 있는지에 대해 이례적으로 솔직합니다. 당신의 문제가 대규모 추론이라면, MiniMax M3는 지금 이용 가능하며 저렴합니다. 당신의 문제가 그런 추론자 천 개가 하나의 세계를 공유할 때 무슨 일이 일어나는가라면, Odyssey는 경기장을 지어 놓고 어려운 측정은 다른 누군가가 실행하도록 남겨 두었습니다.