Agora-2 vs Qwen 3.8 Max의 타이틀 카드 생성, 부제는 '한 모델은 영상을 보고, 다른 모델은 영상을 만든다'. 세 장의 카드: 'Qwen3.8-Max: AA 지수 45, 1M당 $2/$6, 1M 컨텍스트'; 'Qwen3.8-Max: 텍스트, 이미지, 영상 읽기'; 'Agora-2: 참가자당 640x480 영상 생성, API 없음'. 하단 문구는 'Qwen3.8-Max는 Artificial Analysis 기준; Agora-2는 벤더 보고이며 재현되지 않음'.
Guides & Insights

Agora-2 vs Qwen 3.8 Max: 한 모델은 영상을 보고, 다른 모델은 영상을 만든다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 조합의 중심에는 흥미로운 역전이 자리한다. Qwen3.8-Max — 2026년 8월 3일에 출시되어 9월 2일에 갱신된 이 벤더의 플래그십으로, 백만 토큰당 $2.00/$6.00로 책정되어 있으며 — 1,000,000토큰 컨텍스트 창 전반에 걸쳐 텍스트 및 이미지와 더불어 비디오를 네이티브로 읽는다. Agora-2, 멀티 에이전트 세계 모델 Odyssey가 2026년 9월 21일에 미리 선보였으며, 비디오를 생성한다: 참가자당 640×480 스트림, 초당 열다섯 번의 잠재 업데이트, 하나의 시뮬레이션된 세계를 공유하는 최대 20명의 인간과 에이전트를 위해. 하나의 모델은 프레임을 소비하고 설명하도록 만들어졌고, 다른 하나는 프레임을 출력하여 참가자가 그 안에서 행동할 수 있게 하도록 만들어졌다. 둘을 함께 놓으면 어느 벤더도 만들려고 하지 않았던 무언가를 얻게 된다 — 실제로 그것을 지켜볼 수 있는 언어 모델로 멀티 에이전트 시뮬레이션을 분석하는 방법을.

프레임의 양면

Qwen3.8-Max는 Alibaba의 최고 성능 등급이자 가장 정석적인 모델입니다: 텍스트, 이미지, 영상을 받아들이는 네이티브 멀티모달 모델로, 100만 토큰 컨텍스트, 131,072 토큰 출력, 네이티브 도구 사용, 그리고 index v4.3.2 기준 Artificial Analysis Intelligence Index 45를 갖추고 있습니다. 8월 출시에 대한 앞선 보도에서는 40을 인용했지만, 그 수치는 이전 index 개정판에서 나온 것이므로 이번 수치와 나란히 놓아서는 안 됩니다. Artificial Analysis는 이를 terminal-bench 2.1에서 88.8, GPQA Diamond에서 92.8로 측정합니다. Alibaba는 자체 마이그레이션 가이드에서 이를 GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro와 정면으로 겨냥하며, 이용 가능한 가장 강력한 추론이 필요한 작업이라면 언제든 이를 권장합니다.

Agora-2의 사양은 그것과 거의 전적으로 다르다. 뷰당 하나씩인 네 개의 렌더러 구성 요소가 있으며, 각각 너비 2,048의 16블록 모델로 단일 참가자의 시점을 생성한다. 4개 레이어와 너비 256의 시뮬레이션 모델은 4단계 엔티티 이력으로부터 14개의 이산 이동 분기 전반에 걸쳐 이동, 전투, 애니메이션을 예측한다. 정체성, 위치, 체력, 애니메이션, 사망 및 리스폰을 보유하는 공유 월드 상태가 있어, 엔티티 속성이 특정 카메라와 무관하게 지속된다 — 프레임 밖의 엔티티는 다시 나타날 때 재구성되는 대신 자신의 위치를 유지한다. 언어가 없으므로 컨텍스트 윈도우도 없다. 이에 상응하는 제약은 사망, 리스폰 및 카메라 불연속성에서 재설정되는, 뷰별로 한정된 시각적 이력이다.

• 출력 — 참가자당 Agora-2 640×480 비디오, 30 fps 목표 vs Qwen3.8-Max 텍스트, 응답당 최대 131,072 토큰

• 입력 — Agora-2 브라우저 제어 + 16개 RL 에이전트 정책 vs Qwen3.8-Max 텍스트, 이미지 및 동영상

• 독립 점수 — Agora-2 미공개 vs Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)

• 가격 — Agora-2 공개된 가격 없음, 프리뷰 전용 vs Qwen3.8-Max 100만 토큰당 $2.00/$6.00, 캐시 읽기 $0.25

• 메모리 — Agora-2 공유 상태 및 뷰별 제한된 이력 vs Qwen3.8-Max 1,000,000토큰 컨텍스트

• 접근 — Agora-2는 API 없음, 가중치 없음 vs Qwen3.8-Max는 독점 API, 100만 컨텍스트

Generated two-column scoreboard for Agora-2 and Qwen3.8-Max on output, input, independent score, price, memory and access: Agora-2 640x480 video per participant, browser controls plus 16 RL policies, none published, no published price and preview only, shared state plus bounded history, no API or weights; Qwen3.8-Max text up to 131,072 tokens, text, image and video input, AA Index 45, $2.00/$6.00 per 1M, a 1,000,000-token context, a proprietary API. Footer reads 'Qwen3.8-Max per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

비디오 판독 모델이 공유 세계 시뮬레이터에 더하는 것

오디세이가 Agora-2를 구축하려는 근거는 다중 에이전트 상호작용이 통제된 조건에서 연구할 가치가 있는 대상이 되었다는 것이며, 이 회사는 2026년 7월 평가 샌드박스 안의 약 1,200개 에이전트가 며칠에 걸친 침입을 조직한 사건을 그 이유에 대한 증거로 인용한다. 이런 종류의 연구에서 어려운 부분은 상호작용을 생성하는 것이 아니라 그것을 해석하는 것이다. 상호작용하는 스무 명의 참가자에 대한 수천 개의 프레임을 내보내는 세계 모델은 어떤 인간 팀도 다 볼 수 없는 분량의 영상을 만들어낸다.

네이티브 비디오 입력을 지원하는 모델이 범주 불일치에서 벗어나 하나의 구성 요소가 되는 지점이 바로 여기다. Agora-2의 한 세션은 외부에서 보면 Qwen3.8-Max가 수용한다고 주장하는 바로 그 대상이다: 보고서가 처리 가능하다고 확인한 해상도의 비디오이며, 모델이 명시적 공유 스키마로부터 렌더링하는 정체성, 건강, 애니메이션 상태를 가진 엔티티들이 포함된다. 프레임 스트림을 상태 로그와 짝지어 보라 — 보고서는 둘 다 공개하며, 그 그림 6은 렌더링된 프레임들과 함께 네 개의 연속 틱에서의 플레이어와 적 상태를 보여준다 — 그러면 비디오 가능 추론 모델에게 무슨 일이 일어났는지, 누가 시작했는지, 그리고 시각적 묘사가 실제로 기록된 상태와 일치하는지를 물어볼 수 있는 코퍼스가 된다. 마지막 질문은 보고서가 평가되지 않은 것으로 나열한 것이다: 독립적으로 생성된 뷰들 간의 일치와 종단 간 행동 준수는 둘 다 명시적으로 열린 상태로 남아 있다.

백만 토큰 컨텍스트가 나머지 절반입니다. 긴 세션의 상태 로그, 도구 출력, 전사된 주석까지 이 안에 들어가는데, 이는 한 번의 인카운터를 분석하는 것과 한나절의 플레이를 분석하는 것 사이의 실질적인 차이입니다.

검증된 수치가 멈추는 곳

Qwen3.8-Max의 지수 점수, 컨텍스트 윈도우, 모달리티, 요금표는 공개된 사실이며, 명시된 항목은 독립적으로 측정된 것입니다. 9월 2일의 리프레시는 알리바바가 여전히 이 티어를 계속 다듬고 있음을 시사합니다.

Agora-2의 수치는 Team Odyssey의 기술 보고서에 실려 있으며 회사 외부에서는 재현된 사례가 없다. 이 보고서는 30개의 모니터링 클립에서 20.67dB VAE 기준선 대비 30.11dB PSNR을 기록한 구조화된 프리픽스 렌더러를 주장하며, 구조화된 셀프 어텐션 조건화가 크로스 어텐션보다 디노이저 시간을 45.8% 줄인다고 밝힌다. 후자는 합성 입력으로 무작위 초기화된 디노이저에서 측정된 것으로, 보고서는 이것이 이미지 품질이 아니라 실행 비용 벤치마크라고 명시한다. 이 보고서의 한계 섹션은 두 번 읽어야 할 부분이다. 15잠재-업데이트 및 초당 30프레임 비율은 목표치이며, 실시간 다중 에이전트 플레이 중 지속 프레임 속도와 입력-디스플레이 지연 시간은 정량적으로 평가되지 않았고, 장기 시각 품질과 뷰 간 일치도는 평가되지 않았으며, 환경은 명시적 기하 구조와 고정된 외형 어휘를 갖춘 계측 엔진을 필요로 하고, 새로운 자산, 규칙 또는 환경으로의 전이는 검증되지 않았다.

그 주의 사항 중 두 가지는 위에서 제안한 페어링에 직접 적용됩니다. 실시간 플레이 중 프레임 레이트가 측정되지 않는다면, 비디오 모델에 입력하게 될 프레임 스트림은 아직 처리량 보장이 없습니다. 그리고 교차 뷰 일치도가 평가되지 않는다면, 흥미로운 분석 — 동일한 이벤트가 네 관점에서 일관되게 보였는가 — 은 바로 미해결 질문이며, 확정된 입력이 아닙니다. 이 조합은 유망하지만 전혀 검증되지 않았습니다.

오늘 어떤 것을 사용할 수 있나요?

Qwen3.8-Max는 이제 배포 가능합니다: 백만 토큰 창과 네이티브 도구 사용, 독립적으로 측정된 지수 45를 갖춘 $2/$6의 프런티어급 멀티모달 모델입니다. 영상이나 문서 중심 분석을 하는 사람이라면, 이 가격대에서 프레임을 아예 입력받는 몇 안 되는 모델 중 하나이며, $0.25의 캐시 읽기 요금 덕분에 길고 반복적인 컨텍스트를 저렴하게 다룰 수 있습니다. OrcaRouter를 통해서는 알리바바의 정가에 마크업 없이 제공되므로, 해당 요금이 그대로 전달되고 향후 가격 변동이 있더라도 같은 날 청구서에 반영됩니다, 기본 엔드포인트가 성능 저하를 보이면 자동 장애 조치가 이루어집니다 — 전체 가치가 재시작하기 비싼 긴 컨텍스트에 달려 있는 워크로드라면 충분히 갖출 만한 기능입니다.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) (model ID qwen/qwen3.8-max-0902), showing a 1M-token context, 131K maximum output, text, image and video input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2는 OrcaRouter에 없습니다. 우리가 호스팅하지 않으며, API도 가중치도 없고, 유일한 입구는 Odyssey 자체의 브라우저 프리뷰뿐입니다. 그것이 제공하는 것은 거의 존재하지 않는 범주에 속하는 연구 산출물입니다. 인간과 RL 정책이 동일한 상태에 작용하고 모든 참가자가 각자의 생성된 뷰를 받는 공유 세계입니다. 멀티 에이전트 시스템을 만든다면, 오후 한나절을 투자할 가치가 있는 조합은 뻔합니다. 프리뷰를 플레이하고, 프레임과 상태 로그를 캡처한 뒤, 둘 다 백만 토큰 멀티모달 모델에 넘겨 실제로 무슨 일이 일어났는지 물어보는 것입니다. Agora-2는 경기장을 제공하면서도 어려운 부분을 측정하지 않았다고 인정합니다. Qwen3.8-Max는 그것을 할 수 있는 도구이며, 경기장이 아직 프리뷰인 동안 $2/$6에 이용할 수 있습니다.