Agora-2 vs Kimi K3용 타이틀 카드를 생성했으며, 부제는 '공유 세계 속 스무 명의 참가자, 그리고 그 안에서 한 가지 역할을 맡은 모델'입니다. 세 장의 카드: 'Kimi K3: AA 지수 44, 100만 토큰당 $3/$15, 100만 컨텍스트'; 'Kimi K3: 오픈 웨이트, 수정된 MIT 라이선스'; 'Agora-2: 보고서 공개, 웨이트 없음, API 없음'. 하단 문구는 'Kimi K3는 Artificial Analysis 기준; Agora-2는 벤더 보고로 미재현'입니다.
Guides & Insights

Agora-2 vs Kimi K3: 공유 세계 속 스무 명의 참가자, 그리고 그 안에서 하나의 역할을 맡은 1M 토큰 모델

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

벤치마크를 걷어내면 이 비교를 결정짓는 단 하나의 비대칭성이 남습니다. Odyssey발표했습니다Agora-22026년 9월 21일 — 학습된 시뮬레이션과 뷰별 렌더러를 바탕으로, 최대 20명의 인간과 AI 에이전트를 위해 실시간으로 640×480 해상도에서 공유된 상호작용 환경을 생성하는 플레이 가능한 멀티 에이전트 세계 모델인Kimi K3는 Moonshot AI의 2조 8천억 개 파라미터 오픈 웨이트 모델로, 1,048,576 토큰 컨텍스트 창과 Artificial Analysis Intelligence Index 44점을 갖추고 있으며, 7월 15일에 출시되어 7월 27일부터 다운로드할 수 있습니다. 둘 다 연구팀에게 중요한 의미에서는 오픈입니다 — Kimi K3의 가중치는 수정된 MIT 라이선스로 Hugging Face에 공개되어 있고, Agora-2의 기술 보고서는 전문이 공개되어 있습니다 — 그러나 구매자에게 중요한 의미에서는 어느 쪽도 오픈이 아닙니다: Agora-2에는 가중치도, API도, 가격도 없으며, Kimi K3의 라이선스에는 상업적 제한이 붙어 있습니다. 유용한 질문은 어느 쪽이 더 똑똑한가가 아닙니다. 이번 분기에 둘 중 어느 쪽이 멀티 에이전트 시스템의 일부가 될 수 있는가입니다.

실제로 다운로드할 수 있는 것은 무엇이며, 그것으로 무엇을 얻을 수 있는가

Kimi K3는 훨씬 더 일반적인 대상입니다. 백만 토큰 컨텍스트를 갖춘 2.8T 파라미터 MoE로, 텍스트와 이미지 입력, 샘플링 파라미터 대신 최상위 수준의 추론 강도 제어, 네이티브 도구 호출, OpenAI 호환 인터페이스를 제공합니다. 가격은 백만 토큰당 $3.00/$15.00이며 캐시 읽기 요율은 $0.30이고, index v4.3.2에서 44점을 기록해 해당 보드의 오픈 웨이트 모델 중 3위로, MiMo-V2.6-Pro의 46점과 GLM-5.3의 45점 뒤를 잇습니다. 같은 보드에서 terminal-bench 2.1에서는 85.0점, SciCode에서는 59.5점을 받았습니다. 멀티 에이전트 시스템에 에이전트당 두뇌가 필요하다면, 이것은 저렴하게 임대하거나 직접 실행할 수 있는 두뇌입니다.

Agora-2는 성격이 다른 아티팩트다. Odyssey가 공개한 것은 23페이지 분량의 기술 보고서와 브라우저 미리보기다. 그 보고서는 엔티티 정체성, 위치, 체력, 애니메이션, 사망 및 리스폰에 대한 명시적 표현을 갖춘 아이소메트릭 액션 게임 환경을 설명한다. 또한 엔티티 이력, 행동, 국소 기하 구조로부터 이동, 전투, 애니메이션을 예측하는 시뮬레이션 모델과, 공유 상태의 압축된 시각적 표현으로부터 각 참가자 자신의 뷰를 생성하는 참가자별 렌더링 모델도 설명한다. 그 설명에는 언어 모델이 전혀 없고, 그 안에 다운로드할 수 있는 것도 전혀 없다.

• 무엇인가 — Agora-2, 뷰당 640×480을 렌더링하는 학습된 게임 엔진 vs Kimi K3, 2.8T 매개변수 오픈 웨이트 텍스트 모델

• 독립 점수 — Agora-2는 공개된 점수 없음 vs Kimi K3는 AA Intelligence Index 44(v4.3.2), 오픈 웨이트 선두

• 컨텍스트 — Agora-2 공유 상태와 제한된 뷰별 히스토리 vs Kimi K3 1,048,576 토큰

• 가격 — Agora-2는 공개된 가격 없음, 브라우저 미리보기만 vs Kimi K3는 100만 토큰당 $3.00/$15.00, 캐시 시 $0.30

• 라이선스 — Agora-2는 보고서만 공개, 가중치 미공개 vs Kimi K3는 수정 MIT, Hugging Face에 가중치 공개

• 입력 — Agora-2 브라우저 컨트롤 및 16개 RL 에이전트 정책 vs Kimi K3 텍스트와 이미지

Generated two-column scoreboard for Agora-2 and Kimi K3 across what each is, independent score, context, price, licence and inputs: Agora-2 a learned game engine, none published, shared state plus bounded history, no price, report public with no weights, browser controls plus 16 RL policies; Kimi K3 a 2.8T-parameter text model, AA Index 44, 1,048,576 tokens, $3.00/$15.00 per 1M, modified MIT with weights on Hugging Face, text and image input. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Kimi K3 per Artificial Analysis.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

다중 에이전트 시스템에서 각자가 수행하는 역할

이 둘은 오직 둘 모두를 포함하는 시스템 안에서만 만난다. Kimi K3는 결정 계층의 후보다 — 도구 출력을 읽고, 코드를 작성하며, 장기적 루프에서 다음 행동을 선택하는 구성 요소다. 백만 토큰 창과 $0.30의 캐시 읽기 단가는 에이전트 루프가 만들어내는 워크로드, 즉 전체 입력 가격으로는 감당하기 어려울 만큼 거대하고 반복적인 컨텍스트를 정확히 겨냥한다.

Agora-2는 그 아래 계층, 즉 환경의 후보입니다. Odyssey의 자체 프레이밍에 따르면, 다중 에이전트 세계 모델은 연구자들이 에이전트가 "통제된 시뮬레이션 내에서, 유해 행동을 실제 세계 시스템을 위험에 노출시키지 않고 조사할 수 있는 환경에서" 어떻게 상호작용하는지 연구할 수 있게 해줍니다. 이 문장은 약 1,200개의 에이전트가 평가 샌드박스 내부에서 침입을 조율했던 METR 보고서에 대한 직접적인 대응으로 읽힙니다. Agora-2의 16개 자율 개체를 구동하는 정책은 LLM이 아닙니다. 그것은 강화 학습으로 훈련된 순환적 스칼라 및 공간 정책으로, 16개 관측 이력을 입력으로 받아 4번의 시뮬레이션 틱마다 행동을 출력합니다. Kimi K3급 에이전트가 16명의 상대도 결정을 내리고 있을 때 무엇을 하는지 알고 싶다면, Agora-2는 아레나를 구축하는 한 가지 방법입니다. 그것은 에이전트를 대체하는 방법은 아닙니다.

양쪽의 숫자를 읽기

Kimi K3의 44는 Moonshot 소속이 아닌 제3자에 의해 측정되었으며, 이 페이지의 다른 모든 모델과 동일한 v4.3.2 지수에서 나온 점수입니다. 그리고 바로 이 점수 덕분에 Kimi K3는 신뢰할 만한 오픈 웨이트 프런티어 모델이 됩니다. 컨텍스트 윈도, 가격, 모달리티 목록은 공개된 사실입니다.

Agora-2의 수치는 Team Odyssey 자체 보고서에서 나옵니다. 핵심 결과는 렌더링 비교입니다: 30개의 모니터링 클립에서 각각 3개의 샘플링 시드를 사용해, 구조화된 접두사 렌더러가 30.11dB PSNR에 도달한 반면 VAE 기반 베이스라인은 20.67dB를 기록했습니다. 보고서는 이것이 훈련 예산이 서로 맞지 않는 완전한 시스템들을 비교한 것이며 아키텍처 자체를 분리해 평가하지는 않는다고 신중히 밝힙니다. cross-attention 대비 45.8%의 디노이저 시간 감소를 보여주는 컨디셔닝 벤치마크는 합성 입력을 사용한 무작위 초기화 디노이저에서 실행됩니다 — 실행 비용 테스트이며, 명시적으로 이미지 품질을 측정하는 지표가 아닙니다. 시뮬레이션 평가는 홀드아웃된 기록 예제에 대한 단일 단계 이동 및 애니메이션 예측을 다룹니다.

한계점 섹션은 나머지 내용을 말해준다. 초당 30프레임 디스플레이 목표와 초당 15회 잠재 업데이트 주기는 목표치로 제시되어 있으며, 라이브 다중 에이전트 플레이 중 지속 프레임 레이트와 입력-디스플레이 지연시간은 정량적으로 평가되지 않았다. 장기적 시각 품질, 뷰 간 일치도, 엔드투엔드 행동 준수는 평가되지 않았다. 절차적 레이아웃 변형은 학습 도메인 내에는 존재하지만 새로운 자산, 규칙 또는 환경으로의 전이는 검증되지 않았다. 이는 Odyssey에 대한 비판이 아니다 — 이 보고서는 대부분의 출시 자료보다 자체 격차에 대해 더 솔직하다 — 하지만 Agora-2의 역량에 관해 당신이 읽는 모든 내용에 대한 올바른 사전 기대다.

이번 주에 어떤 것을 기반으로 만들 수 있을까요?

프로덕션 환경에서 최전선의 오픈 웨이트 모델이 필요하다면, 답은 Kimi K3이며 다른 모델과는 격차가 큽니다. 독립적인 44점, 100만 토큰 컨텍스트 창, 이미지 입력, 그리고 저렴한 캐시 읽기가 결합된 $3/$15 요금제는 7월부터 제공되어 온, 바로 배포 가능한 패키지입니다. OrcaRouter에서는 Moonshot 자체 정가에 마크업 없이 제공되며, 이는 이 모델에서 유난히 중요합니다. 장문 컨텍스트 에이전트 루프는 토큰 대부분을 반복되는 프리픽스에 소비하는데, 변경 없이 그대로 전달되는 $0.30의 캐시 읽기 요금이 감당 가능한 플릿과 그렇지 않은 플릿을 가르는 차이이기 때문입니다. 제공자 간 자동 페일오버가 그 나머지 절반입니다 — 루프가 길수록 실행 중 제공자 장애의 비용은 더 커집니다.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing a 1,048,576-token context window, text and image input with text output, and pricing of $3.00 input and $15.00 output per million tokens.

Agora-2에는 요금표가 없으므로 라우팅할 대상도 없고, 우리가 그것을 호스팅하지도 않습니다. 그것이 멀티 에이전트 팀에 제공하는 것은 오늘 브라우저에서 플레이할 수 있는 환경의 연구 프리뷰이며, 공개 아키텍처 보고서로 뒷받침되고, 지금까지 게임 엔진 밖에서는 공유 세계 시뮬레이터가 없었던 범주에 속합니다. 에이전트들이 서로에게 무엇을 하는지에 관심이 있다면, 그것은 정말로 유용하게 갖출 만한 것이고 오후 한나절을 들일 가치가 있습니다. 에이전트들이 무엇을 할 수 있는지에 관심이 있다면, Kimi K3가 그 모델이고 월드 모델은 그것을 대체하지 못합니다. 둘은 같은 스택의 서로 다른 계층에 위치하며, 그 계층 중 하나만이 스프레드시트에 넣을 수 있는 가격을 가지고 있습니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트