Agora-2 대 Grok 4.6 비교용 타이틀 카드를 생성했습니다. 부제는 '1,200개의 LLM 에이전트, 그리고 둘 다 사용하지 않는 시뮬레이터'입니다. 카드 세 장: 'Grok 4.6: AA Index 44, 1M당 $2/$6, 캐시 시 $0.50'; 'Agora-2: 16개의 RL 에이전트 정책, 루프에 LLM 없음'; 'Agora-2: 30 Hz 틱, 세션당 RTX PRO 4500 GPU 4장'. 하단 문구는 'Agora-2 수치는 Odyssey 자체 보고서 기반이며 재현되지 않음; Grok 4.6은 Artificial Analysis 기준.'입니다.
Guides & Insights

Agora-2 vs Grok 4.6: 에이전트 정책 문제 — 1,200개의 LLM 에이전트, 그리고 둘 중 어느 것도 사용하지 않는 시뮬레이터

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

돈이 드는 숫자가 하나 있다. 2026년 7월 허깅페이스 사건에 대한 METR의 조사는 단일 평가 실행 안에서 대략 1,200개의 조율된 에이전트를 집계했다. Grok 4.6의 요금표 기준으로 — 입력 토큰 100만 개당 2.00달러, 출력 100만 개당 6.00달러 — 그 정도 규모의 함대가 6일 동안 긴 트랜스크립트를 쏟아내는 비용은 자금이 넉넉한 팀이라면 실제로 감당할 수 있는 청구서다. 그렇지 않으면 달리 손을 뻗게 될 모델의 가격이라면, 그렇지 않다. 그것이 Grok 4.6의 진짜 제품 주장이며, Agora-2가 조용히 반박하는 것도 바로 그 주장이다. Odyssey가 2026년 9월 21일 자사의 멀티 에이전트 월드 모델을 선보였을 때 — 최대 20명의 인간과 AI 에이전트를 위한 공유 환경을 생성하는 플레이 가능한 프리뷰 — 그 안의 에이전트들은 전혀 언어 모델이 아니었다. 대신 Odyssey는 작은 강화학습 정책들을 훈련시켰다. 이 짝이 던지는 흥미로운 질문은 어느 쪽이 더 나은가가 아니다. 그 랩이 왜 LLM을 건너뛰었는가이다.

플릿에 중요한 단위로 제공되는 요금표

Grok 4.6은 2026년 8월 12일에 출시된 xAI의 프런티어 등급 모델입니다. 500,000토큰 컨텍스트 윈도, 텍스트·이미지·파일 입력, 구성 가능한 추론 노력(reasoning effort), 네이티브 도구 호출, 구조화된 출력, 그리고 인덱스 v4.3.2 기준 Artificial Analysis Intelligence Index 44점을 갖췄습니다. 이는 GPT-5.6 Sol을 47점, Kimi K3를 44점으로 평가한 바로 그 인덱스입니다. Artificial Analysis는 이 모델의 GPQA Diamond 점수를 94.9로 산정하며, xAI가 자사 개발자 문서에서 "Latest"로 표기한 모델이기도 합니다. 이 모델은 일급 OpenAI Responses 모델로 제공되는데, 바로 이 점이 실질적으로 중요합니다. 에이전트 프레임워크가 어댑터를 작성하는 대신 베이스 URL만 바꿔서 도입할 수 있기 때문입니다.

하지만 흥미로운 숫자는 $2/$6 조합이 컨텍스트 윈도우와 맞물린다는 점이다. 장기 지평 에이전트 루프는 지저분한 워크로드다 — 에이전트당 시간당 누적되는 도구 출력이 수만 토큰에 달하며, 그 대부분은 중복이다. Grok 4.6의 캐시 읽기 요율은 백만 토큰당 $0.50로, 입력 가격의 4분의 1이다. 이것이 1000개 에이전트 실행을 단지 가능한 것에 그치지 않고 산술적으로 그럴듯하게 만든다. 티어 경계에 주목하라: 200K 토큰을 초과하는 프롬프트는 기본 요율의 두 배로 청구되므로, 긴 이력을 키우는 에이전트는 조용히 자기 비용을 두 배로 만든다.

• 가격 — Agora-2는 공개된 가격 없음, 브라우저 미리보기만 vs Grok 4.6은 100만당 $2.00/$6.00, 캐시 읽기 $0.50, 200K 입력 초과 시 두 배

• 맥락 — Agora-2 공유 상태 및 제한된 뷰별 기록 vs Grok 4.6 500,000 토큰

• 독립 점수 — Agora-2는 공개된 수치 없음 vs Grok 4.6 AA Intelligence Index 44 (v4.3.2)

• 추론 — Agora-해당 없음, 언어 모델이 아님 vs Grok 4 구성 가능한 노력, 네이티브 도구

• 접근 — Agora-2 플레이 가능한 프리뷰, API 없음, 가중치 없음 vs Grok 4.6 독점 API

• 하드웨어 — Agora-2는 동시 4개 뷰를 위한 RTX PRO 4500 GPU 4장, Grok 4.6은 호스팅 엔드포인트

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

Why Odyssey는 LLM을 아레나에 넣지 않았을까

16명의 AI 에이전트가 4명의 인간과 싸우는 세계를 구축한다면, 당연한 지름길은 유능한 텍스트 모델을 컨트롤에 연결해 플레이하게 하는 것입니다. Odyssey는 그렇게 하지 않았으며, 기술 보고서는 구성 표에서 그 이유를 설명합니다. Agora-2의 에이전트 정책은 16개 관측 이력을 소비하는 순환 스칼라 및 공간 정책으로, 14개의 이산 이동 분기에 걸쳐 4번의 시뮬레이션 틱마다 행동을 출력합니다. 시뮬레이션 자체는 30Hz 틱 시간 기준으로 진행됩니다. 부분적으로 관측된 시점에서 고정된 저수준 행동 어휘를 사용해 초당 30번 결정을 내리도록 요청받은 모델은 추론 문제가 아니라 제어 문제이며, 제어 문제는 500K 컨텍스트 프런티어 모델에 프롬프트를 넣는 것이 아니라 작은 정책을 훈련함으로써 해결됩니다.

이 점은 분명히 짚고 넘어갈 가치가 있다. 왜냐하면 세계 모델 범주에 대해 가장 흔한 오해이기 때문이다. Agora-2는 시스템에서 같은 자리를 두고 Grok 4.6과 경쟁하지 않는다. 그것은 그 아래의 자리, 즉 정책이 훈련되고 평가되는 환경을 차지한다. 보고서의 아키텍처는 이 분할을 명확히 밝힌다. 시뮬레이션 모델은 결합된 행동이 공유 상태를 어떻게 변화시키는지 예측하고, 월드 서버는 이를 적용하며, 뷰별 렌더링 모델은 그 상태로부터 각 참여자의 고유한 640×480 시점을 생성한다. 상호작용 루프 어디에도 텍스트 모델은 등장하지 않는다.

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Grok 4.6 같은 모델이 등장하는 지점은 한 단계 위입니다. 평가 스캐폴딩을 작성하고, 기록을 분석하거나, 당신이 그 행동을 연구하려는 도구 사용 에이전트를 구동하는 존재로서 말이죠. 바로 그것이 METR의 조사에서 GPT-5.6 Sol이 맡은 역할이었습니다 — 전체 플릿의 약 5%, 그리고 로그를 읽는 분석가 — 그리고 그것은 Grok 4.6의 가격과 컨텍스트 창이 저렴하게 만드는 역할입니다.

증거 격차는 대부분의 이런 맞대결에서보다 여기서 더 크다

Grok 4.6의 지수 점수는 독립적으로 측정되었고, 요금표는 공개되어 있으며, 컨텍스트 윈도는 문서화되어 있습니다. Agora-2의 수치는 Team Odyssey가 작성하고 아무도 재현하지 않은 보고서에서 나온 것입니다. 30개의 모니터링 클립에서 Agora-2의 구조화된 프리픽스 렌더러는 30.11dB PSNR에 도달하는데, VAE 기준선은 20.67dB입니다 — 이 비교는 보고서 자체가 경고하듯이 훈련 예산이 일치하지 않는 완전한 시스템 간의 비교이며, 분리된 아키텍처 테스트가 아닙니다. Agora-2의 컨디셔닝 벤치마크는 크로스 어텐션 대비 45.8%의 디노이저 시간 감소를 보여주지만, 합성 입력에 무작위로 초기화된 디노이저를 사용하며 이미지 품질이 아니라 실행 비용을 측정합니다.

그다음으로, 이례적으로 직설적인 한계 섹션이 나온다. 명시된 15개의 잠재 업데이트와 초당 30개의 표시 프레임은 목표치이다. 실시간 다중 에이전트 상호작용 중 지속적인 프레임 속도와 입력-디스플레이 지연은 "정량적으로 평가되지 않았다." 장기 시각 품질, 뷰 간 일치, 엔드투엔드 행동 준수는 모두 평가되지 않은 항목으로 나열되어 있다. 이 환경은 명시적 지오메트리와 고정된 외형 어휘를 갖춘 계측된 게임 엔진을 필요로 하며, 새로운 자산, 규칙 또는 환경으로의 전환은 테스트되지 않았다. Agora-2에 관한 어떤 헤드라인 숫자를 읽기 전에 그 목록을 읽어라.

어떤 것이 당신의 스택에 어울리나요?

오늘 멀티 에이전트 시스템을 운영하거나 연구하고 있다면, Grok 4.6은 실제로 배포할 수 있는 구성 요소입니다 — 대규모 에이전트 플릿을 경제적으로 운영할 수 있게 하는 요금의 프런티어급 텍스트 모델이며, 공개된 점수와 문서화된 API 표면을 갖추고 있습니다. OrcaRouter에서는 xAI 자체 정가로 마크업 없이 제공됩니다. 따라서 위의 $2/$6과 향후 요금 변경은 발생하는 당일에 청구서에 반영되며, 기본 엔드포인트가 저하될 경우 자동 장애 조치가 이루어집니다. 두 사실 모두 특히 플릿 워크로드에 중요합니다. 에이전트 1천 개는 곧 저하된 제공자에 부딪힐 수 있는 1천 번의 기회이며, $6 출력에 붙는 마크업은 전체 실행에 곱해지는 마크업입니다.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2는 배포 가능한 인프라가 아니며 우리가 호스팅하지도 않습니다 — API도, 가중치도, 가격도 없고, 오직 Odyssey 자체의 플레이 가능한 프리뷰만 있습니다. 그것이 제공하는 것은 다른 종류의 가치입니다. METR 보고서가 이제 시급하다고 보여 주는 상호작용 연구를 위한 통제된 환경을, API 청구서 대신 동시 뷰 4개를 위한 RTX PRO 4500 GPU 4대라는 비용으로 제공합니다. 솔직한 평가는 이 둘이 경쟁 관계가 아니라는 것입니다. Grok 4.6은 오늘날 토큰 단위로 구매할 수 있는 정책 두뇌이고, Agora-2는 그러한 두뇌 수천 개가 만났을 때 벌어지는 일을 시험할 장소에 대한 제안입니다. 후자는 더 흥미로운 연구이며 덜 완성된 제품이고, Odyssey 자체 보고서는 그중 어떤 부분이 아직 목표인지 상쾌할 정도로 명확합니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트