
Agora-2: Odyssey의 플레이어블 월드 모델, 4개의 GPU에서 참가자 20명 실행
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 181 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Agora-2는 하나의 시뮬레이션에 참가자 20개를 넣고 이를 플레이 가능한 연구 프리뷰라고 부른다. Odyssey는 2026년 9월 21일 "Agora-2 소개: 멀티 에이전트 월드 시뮬레이션의 발전"이라는 제목의 글에서 이를 공개했으며, Oliver Cameron이 서명했다. 그리고 회자되는 숫자는 20이다. 정작 중요한 숫자는 그 안의 분할이다. 한 세션은 최대 4명의 동시 인간 컨트롤러와 16개의 자율 개체를 함께 지원하며, 이들은 같은 종류의 참가자가 아니다 — 4명의 사람이 이동 명령을 입력하고, 16개의 정책이 이를 실행한다. Odyssey는 그 정책들을 직접 학습시켰는데, 그것도 자기가 학습에 사용한 게임의 스테이지들에서였다: 논문에 따르면 그 세계는 Diablo II의 캡처로부터 학습된다.
통제된 참가자와 시뮬레이션된 참가자 사이의 그 구분이 Agora-2에 관한 거의 모든 흥미로운 점이 존재하는 곳이다. 이는 또한 대부분의 보도가 흐려질 지점이기도 한데, “20명의 플레이어”가 “네 명의 플레이어와 화면 밖에서도 유지되는 상태를 공유하는 열여섯 개의 학습된 에이전트”보다 더 깔끔한 문장이기 때문이다. Odyssey가 출시하는 것은 멀티플레이어를 덧붙인 비디오 생성기가 아니다. 그것은 물리, 애니메이션, 렌더링이 모두 학습된 구성 요소로 대체되었고, 유일한 진정한 콘텐츠 소스가 기록된 플레이 데이터셋인 게임 서버에 더 가깝다.
스무 명의 참가자는 네 명의 사람과 열여섯 개의 정책이다.
Odyssey는 Agora-2가 Agora-1보다 다섯 배 많은 참가자를 지원하며, 단일 환경을 시뮬레이션하는 것에서 더 긴 호라이즌의 행동을 가진 여러 환경을 시뮬레이션하는 것으로 전환했다고 분명히 밝힙니다. 세션별 형태는 다음과 같습니다:
• 인간 컨트롤러 — 최대 4명 동시, 각각 이동 및 행동 입력 제공
• 자율 개체 — 세션당 16개, 플레이어가 아니라 학습된 몬스터 및 동반자 정책에 의해 구동됨
• 총 참가자 — 하나의 공유 월드 상태에 20명, 이는 Odyssey가 앞세우는 수치
• 환경 — Agora-1이 시뮬레이션할 수 있었던 단일 환경에서 여러 개로 증가
• 콘텐츠 기반 — Diablo II의 캡처물이므로, 세계관, 에셋, 규칙 모두 {{1}}하나의 기록된 코퍼스{{/1}}에서 계승됩니다
• 공개 형태 — 제품이 아니라 플레이 가능한 연구 프리뷰이며, 가중치도 라이선스도 가격도 없음
자율적인 16개체는 장식이 아니다. Odyssey의 보고서는 몬스터 정책과 동반자 정책을 별도로 훈련하는 방법을 설명하며, 평가 수치는 구체적이다: 기본 교사에 복구 및 리텐션 데이터를 더해 뽑은 최종 단계 몬스터 정책 예시 23,771개, 그리고 동반자 정책용 예시 128,005개이며, 각각 252개의 평가 에피소드와 24개의 평가 케이스에 대해 채점되었다. 이 정책들이 바로 4인 세션이 사람들로 가득 찬 것처럼 느껴지게 만든다. 또한 참가자 수가 수용량 주장이 아니라 설계상의 선택인 이유이기도 하다 — 16은 세계 서버가 4명의 인간과 함께 감당하도록 훈련된 에이전트 수이지, 이론적으로 수용할 수 있는 수가 아니다.
아키텍처는 작은 모델 하나와 큰 모델 하나로 구성됩니다.
Agora-2는 '무슨 일이 일어나는가'를 결정하는 것과 '어떻게 보이는가'를 결정하는 것을 분리하며, 이 둘 사이의 크기 격차는 논문에서 가장 눈에 띄는 숫자다. 시뮬레이션 모델은 4,457,777개의 파라미터 — 약 446만 개 — 를 가지며, 레이어 네 개, 너비 256, 헤드 네 개, 4단계 히스토리 윈도, 열네 개의 이동 분기, 그리고 방향을 위한 별도 헤드를 갖는다. 렌더러는 약 10억 개 파라미터의 플로 매칭 트랜스포머로, 너비 2,048의 블록 16개, 그중 5개가 인과적 시간 어텐션을 담당하며, 업데이트마다 다섯 개의 솔버 스텝 동안 실행된다.
렌더러는 원시 세계가 아니라 342-토큰 접두사에 조건화된다:
• 지도 — 144개 토큰, 시점 주변의 12×12 로컬 타일 그리드
{{1}}엔티티{{/1}} — 36개 토큰, 그중 4개는 사용자가 제어하는 참여자용이고 32개는 기타 엔티티 슬롯용
• 일시적 효과 — 맵도 엔티티도 아닌 효과에는 160토큰
• 보기 및 명단 — 카메라 동작과 세션 명단에 각각 토큰 하나씩
• 업데이트당 — 342개의 컨디셔닝 토큰에 어텐션하는 300개의 이미지 토큰
• 코덱 — 2프레임에서 15×20×32로 변환되는 RAE 기반 잠재, 그런 다음 출력 시 x264 CRF 18 또는 NVENC QP 18
Odyssey는 조건화가 이런 방식으로 구조화된 이유를 밝힌다: 학습된 세계는 어떤 특정 카메라보다도 오래 지속되는 상태에 엔티티 속성을 유지해야 한다. 그 글은 그것을 명확히 말한다 — 엔티티 속성은 특정 뷰와 무관하게 유지되기 때문에, 엔티티가 프레임 밖에 있을 때도 계속 사용할 수 있다. 바로 그 문장이 Agora-2를 비디오 모델과 구분 짓는다. 최근 프레임에만 조건화하는 생성기는 몬스터에게서 시선을 돌리는 순간 그 몬스터를 잃어버리지만, 명시적 상태를 유지하는 세계 모델은 그렇지 않다.

GPU 네 개가 플레이어 네 명을 산다
보고서에 나오는 서빙 계획은 Agora-2에서 가장 덜 공개된 부분이자, 이런 세계에 비용이 얼마나 들지 추산하려는 누구에게나 가장 유용한 부분이다. 4인 플레이어 세션을 위한 Odyssey의 구성은 NVIDIA RTX PRO 4500 카드 네 장으로, GPU당 렌더러 하나이며, 그중 한 GPU가 시뮬레이션 모델과 에이전트 정책도 함께 호스팅한다. 제시된 목표는 초당 15회의 잠재 업데이트와 초당 30프레임 표시다.
부록의 두 숫자는 그 구성을 구체화한다. 165와트에서 팀은 렌더러 변경으로 인한 추론 감소 9.9%를 측정했다 — 구현당 3,200회 호출에서 62.92밀리초에서 56.69밀리초로 줄었다. 그리고 렌더러의 훈련도 마찬가지로 구체적이었다: 4,232,000개 세그먼트에서 6만 회 업데이트한 뒤 4,332,800개 세그먼트에서 6만 회를 더 업데이트했으며, 학습률 1e-4의 AdamW, 배치 128, EMA 0.9999, 32대의 B200 GPU에서 실행했다. 그 코퍼스는 항목별로 나뉜다 — 1,200,000개의 전체 로스터 전투 세그먼트, 2,016,000개의 계층화된 특수 능력 세그먼트, 504,000개의 시체 횡단 세그먼트, 512,000개의 자율 개체 없는 이동 세그먼트, 100,800개의 보스 포털 수명 주기 세그먼트.
그 두 문단을 함께 읽으면 이 제품의 형태가 분명해진다. 렌더러는 파라미터 수에서 세 자릿수만큼 더 큰, 비용이 많이 드는 절반이고, 서빙에서는 동시 시청자 한 명당 GPU 한 대가 필요하며, 학습에는 B200 32대가 든다. 시뮬레이션 모델 — 실제로 세상에서 무슨 일이 일어나는지를 결정하는 부분 — 은 450만 개 파라미터로, 대부분의 임베딩 테이블보다도 작다. Agora-2는 게임 엔진의 옷을 입은 렌더링 문제다.
공개된 숫자들, 그리고 그것들이 보여주지 않는 한 가지
보고서의 정량적 결과는 Odyssey 자체의 표현에 따르면 경쟁 벤치마크 점수라기보다 자체 설계 선택에 대한 어블레이션이며, 그렇게 읽어야 한다:
• 구조화된 프리픽스 vs VAE 베이스라인 — 0.001279의 평균 제곱 오차와 30.11 dB PSNR 대 0.010272와 20.67 dB, 9.44 dB의 이득, 30개 클립과 3개 시드에서 얻은 90회의 쌍별 평가 기준
• 렌더러 어텐션 — 구조화된 프리픽스를 사용한 2프레임 디노이저 업데이트당 20.09밀리초로, 크로스 어텐션의 37.06밀리초, 풀링된 AdaLN의 18.82밀리초와 대비되며, 디노이저 45.8%, 코어 34.1% 감소
• 50%에서의 히스토리 드롭아웃 — 스트리밍 오류 0.05695, 콜드 스타트 0.19535로, 드롭아웃이 없을 때의 0.06041, 0.21082에 비해 개선되었으나 맵 교란 충실도는 다소 저하됨
• 시뮬레이션 정확도 — 이동 분기 예측에서 85.17%, 더 어려운 차단 예시 하위 집합에서 68.17%, 애니메이션 모드에서 95.84%이며, 예측된 모드 전환율은 기록된 3.54%에 비해 7.49%입니다
그 수치들 각각은 Agora-2의 또 다른 구성과 비교해 측정된 값입니다. 그중 어느 것도 출시된 시스템과의 비교가 아니며, 실제 플레이를 설명하지도 않습니다. 보고서 8장은 이 격차를 솔직히 인정합니다. 새로운 자산, 규칙 또는 환경으로의 전환은 여전히 검증되지 않았습니다. 오류는 누적됩니다. 독립적으로 생성된 이미지들은 외형, 가시성 또는 이벤트 타이밍에서 여전히 서로 어긋날 수 있습니다. 그리고 전체를 인용할 가치가 있는 문장: 실시간 다중 에이전트 상호작용 중의 지속적인 프레임률과 입력-디스플레이 지연은 정량적으로 평가되지 않았습니다. 위의 초당 15회 업데이트와 초당 30프레임은 측정값이 아니라 목표치입니다.

미리보기가 있는 위치와 포함되지 않는 것
플레이 가능한 프리뷰는 Odyssey 자체 사이트에 있으며, 데모 주소인 agora.odyssey.ml을 통해 접속할 수 있고, 이는 agora.odyssey.systems로 리디렉션됩니다. 기술 보고서는 같은 발표에서 링크된 PDF입니다. 공개되지 않은 점은 공개된 점만큼이나 주목할 만합니다: 모델 가중치, 저장소, 라이선스, 추론 API, 가격이 모두 없습니다. Odyssey는 이번 릴리스를 연구 프리뷰라고 설명하며, 기반이 되는 월드 모델 내부에서 다중 에이전트 상호작용을 향한 궤적을 향후 작업으로 취급합니다. PROWL은 확장 중인 연구 스레드로, Odyssey-3는 최종 목적지로 명명되어 있습니다.
Agora-2를 기반으로 구축하려는 사람이라면 이는 중요합니다. 왜냐하면 오늘날 실질적인 답은 불가능하기 때문입니다 — 우리를 통해서도, 다른 누구의 호스팅 엔드포인트를 통해서도요. OrcaRouter는 Agora-2, Agora-1 또는 Odyssey-3를 제공하지 않습니다. 그런 모델 라우트는 우리 카탈로그에 존재하지 않습니다. 우리 플랫폼이 제공하는 것은 학습된 세계 주변에 놓일 수 있는 나머지 구축 요소입니다: 200개 이상의 모델을 포괄하는 단일 엔드포인트, 각 제공업체의 정가로 마크업 없이 책정, 따라서 공급업체가 가격을 인하하면 변경 사항이 같은 날 여기에서 라이브로 반영되며, 제공업체가 성능 저하될 때 요청을 자동으로 페일오버하는 라우팅 계층. 레벨 레이아웃을 생성하거나 정책 코드를 작성하거나 녹화된 플레이에 캡션을 달기 위해 모델을 사용하게 된다면, 그것이 우리가 실제로 도움을 줄 수 있는 부분입니다.
볼 만한 것
Agora-2는 실질적인 결과와 실질적인 유의점을 함께 내놓으며, 이 둘은 혼동하기 쉽다. 그 결과란, 기록된 플레이 코퍼스에서 스무 명의 참가자를 위해 공유되고 지속적이며 다중 환경인 세계를 시뮬레이션하고 렌더링할 수 있으며, Odyssey가 그것을 가능하게 만든 구체적인 설계 결정들 — 명시적 상태, 구조화된 조건화 프리픽스, 아주 작은 시뮬레이션 모델 — 을 가리킬 수 있다는 것이다. 유의점은 논문 자체의 8절이 실시간 지연, 지속 프레임 레이트, 환경 간 전이, 오류 누적을 평가되지 않은 항목으로 나열한다는 것이다. 실제 4인 세션에서 나온 프레임 레이트 추적 데이터를 누군가 공개하기 전까지, 정직한 요약은 Agora-2가 아키텍처를 입증했으며 경험은 측정되지 않은 채 남겨 두었다는 것이다.
두 번째로 주목할 점은 진행 방향입니다. Odyssey 자체의 구상은 Agora-2를 다중 에이전트 상호작용을 기초 월드 모델 안에 넣는 과정의 한 단계로 두고, PROWL은 연구 확장으로, Odyssey-3은 명명된 목표로 제시합니다. 그렇게 된다면, 흥미로운 질문은 월드 모델이 20명의 참가자를 감당할 수 있는지가 아니라, 월드 모델이 훈련된 적 없는 세계로 그들을 데려갈 수 있는지가 됩니다. — 이는 바로 현재 보고서가 답하지 않는 전이 질문입니다.

