
Odyssey-3: Odyssey의 새로운 월드 모델, Physics-IQ 정상에 오르고 퍼블릭 프리뷰 공개
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Odyssey-3 Pro는 Physics-IQ Verified의 비디오-투-비디오 트랙에서 66.1점을 기록했고, Odyssey는 2026년 10월 8일에 그 수치를 개발자에게 실제로 중요한 것 바로 옆에 공개했습니다. 바로 Odyssey-3의 공개 연구 프리뷰인데, Odyssey-3는 프롬프트로부터 환경을 생성한 뒤 누군가 그 안을 걸어 다니거나, 카메라를 움직이거나, 이벤트를 트리거하는 동안 실시간으로 계속 그 환경을 예측하도록 만들어진 자기회귀 확산 트랜스포머입니다. Odyssey-3가 모델이고, Odyssey-3 Pro는 그중 720p 등급으로, 베이스 모델의 832×480에 맞서 1280×720으로 구동됩니다. 둘 다 같은 날 공개되며, experience.odyssey.systems에서 직접 조작해 볼 수 있는 프리뷰로 제공되고, API 접근을 위한 별도의 문의 경로도 마련되어 있습니다.
그 조합이 바로 이 글을 단순한 벤치마크 게시물 이상으로 만든다. 상호작용형 월드 모델은 2년 동안 데모웨어에 머물러 있었다. 고정된 궤적에서 그럴듯한 동작의 몇 프레임을 생성하는 모델은 제어를 건드린 뒤에도 예측의 일관성을 유지하는 모델과 같은 산출물이 아니다. Odyssey는 두 번째를 주장하고 있으며, 누구나 그 주장을 시험해 볼 수 있게 한다.
정확히 무엇이 출시되었나요?
체크포인트 두 개, 아키텍처 하나, 가중치 없음.
• Odyssey-3 — 480p 티어, 832×480 출력, 벤치마크 하네스에서 16 fps, 리더보드의 정규화된 비용 열에 생성된 비디오당 $0.139로 기재되어 있습니다.
• Odyssey-3 Pro — 720p 등급, 1280×720, 동일한 기준으로 영상당 $0.267에 책정되어 있습니다.
• 액세스 — 브라우저에서 1인칭 내비게이션, 3인칭 내비게이션, 독립적인 카메라 이동을 제공하는 리서치 프리뷰입니다. API 액세스는 셀프서비스 키가 아니라 문의 양식입니다.
• 개방성 — 없음. 가중치도, 라이선스도, 토큰당 가격도 공개되지 않았다. 같은 사이트의 API 약관 페이지는 2026-01-22에 마지막으로 업데이트되었으며 여전히 "Odyssey-2 API의 프로토타입"에 적용된다. 이는 상업적 표면이 얼마나 새로운지를 보여준다.
이 아키텍처는 Odyssey 자체 문서에서, 교사 강제와 인과적 마스킹을 통해 자기회귀적으로 확장된 다단계 비디오 확산 트랜스포머이며, 분포 매칭과 적대적 증류를 결합해 몇 단계짜리 증류 변형으로 만들어 내는 후속 학습 파이프라인을 갖춘 것으로 설명된다 — 실시간 상호작용을 애초에 가능하게 만드는 부분이다. 확산은 충실도를 주고, 자기회귀는 행동 시퀀스를 견뎌 내는 모델을 주며, 증류는 클럭 속도를 준다. 세 가지 모두 핵심을 떠받치고 있으며, 세 가지 모두 독립적인 설명이 아니라 벤더가 자기 시스템을 설명한 것이다.
벤치마크, 이사회가 실제로 읽는 방식대로 읽어보면
![The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.](https://cms.orcarouter.ai/api/media/file/2-1765.png)
Physics-IQ Verified는 Anates Labs가 DeepMind와 함께 운영하며, 게임하기에 정말 까다로운 벤치마크입니다: 실제 물리 실험 영상(유체 역학, 광학, 고체 역학, 자기학, 열역학)을 모델에 보여주고, 그 연속을 실제로 일어난 일과 비교해 점수를 매깁니다. 현재 16개 연구소의 41개 모델을 순위에 올리고 있습니다. Odyssey-3 Pro의 66.1은 Odyssey가 보고한 video-to-video 트랙에서 가장 높은 원점수이며, 같은 보드의 순 개선도 열은 트랙 평균 대비 백분율 포인트 상승을 측정하는데, 이는 미묘하게 다른 이야기를 들려줍니다:
• 트랙 평균 대비 순개선폭 — FLUX 3 [large]가 +12.27 pp로 1위, Odyssey-3 Pro가 +11.15 pp로 2위, Odyssey-3가 +9.99 pp로 3위입니다.
• 생성된 비디오당 비용 — Odyssey-3 Pro $0.267, Odyssey-3 $0.139, FLUX 3 [large]의 $0.868, Seedance 2.5의 $2.838 대비. (비용은 리더보드가 가능한 경우 24 fps 및 1280 너비 출력으로 정규화되어, 동일한 프레임 속도를 공유하지 않는 모델 간에도 비교할 수 있습니다.)
• 하위 지표 선두 — Odyssey-3가 시공간 하위 지표에서 44.70으로 1위를 차지하며 42.97의 Odyssey-3 Pro를 앞섰습니다. FLUX 3 [large]는 공간 지표에서 64.36, 가중 공간 지표에서 53.25로 1위를 차지했으며, 두 Odyssey 항목은 공간 지표에서 2위와 4위를 기록했습니다.
그러므로 솔직한 해석은 "Odyssey-3가 세계 최고의 비디오 모델이다"가 아니다. 그것은 이렇다: 상호작용을 위한 월드 모델이, 이전에는 시네마틱 생성기들의 영역이었던 물리적 개연성 리더보드에서 최상위권에 올랐고, 그렇게 하는 데 든 비용은 FLUX 3의 정규화 비용의 약 3분의 1 수준이었다. Odyssey의 별도 주장 — 이미지-투-비디오 트랙에서 Odyssey-3 Pro가 54.7, best-of-8 — 은 같은 리더보드에 있으며, 같은 단서가 적용된다: 이것들은 자체 제출 구성이고, 리더보드는 사용자 지정 프롬프트로 제출된 항목과 벤치마크 자체 프롬프트로 실행된 항목을 섞어 놓는다. Odyssey는 두 곳 모두에 나타나는데, 이는 이례적으로 투명하며 동시에 그 두 행이 같은 것을 측정하고 있지 않다는 뜻이기도 하다.

"월드 모델"이 "비디오 모델"의 동의어가 아닌 이유
이 차이는 제품 논거의 전부이므로, 분명히 말할 가치가 있습니다. 클립 생성기는 프롬프트를 받아 고정된 객체를 반환하며, 출력은 요청하는 모든 사람에게 동일합니다. Odyssey-3는 프롬프트를 받아 당신이 그 안에서 행동하는 시스템을 반환합니다 — 미리보기의 1인칭 및 3인칭 카메라 모드와 생성 도중 이벤트를 받아들일 수 있는 능력은, 프롬프트가 말한 것이 아니라 당신이 방금 한 행동을 바탕으로 다음에 무슨 일이 일어날지 예측하는 메커니즘입니다.
그 속성은 Odyssey의 출시 자료에 담긴 물리 시스템 결과를 지금과 같은 모습으로 만드는 요인이다. 회사에 따르면, 동결된 월드 모델에 부착되어 수십 시간의 로봇 시연 데이터로 훈련된 액션 디코더는 시연에는 결코 없던 복구 행동을 만들어냈다 — 놓친 파지 후 그리퍼 방향을 재조정하고, 특이한 방향으로 떨어진 물체를 회수하는 행동이다. Flexion이 Odyssey-3 위에 구축한 휴머노이드 정책은 수십 시간의 원격조작 데이터로 훈련되어, 비교 대상이었던 VLA 기준선을 무너뜨린 조명 변화 속에서도 계속 실행되었다고 보고한다. 20시간의 시뮬레이션 데이터로 훈련된 주행 정책은 실제 도로에서 폐루프로 주행했으며, 실제 영상으로 훈련된 정책에 비해 안전 운전자 개입 사이 주행 거리가 약 77%에 달했다고 보고한다. 시뮬레이션 비행 데이터로 훈련된 드론 내비게이션과 GTA V에서의 게임 플레이가 추가 훈련 없이 이동 동작을 Red Dead Redemption 2로, 오토바이 주행을 Sleeping Dogs로 전이했다고 보고한다.
그 모든 것은 독립적 재현 없이 공급업체가 보고한 결과이며, 그중 두 가지는 Odyssey가 측정치가 아니라 정성적 관찰이라고 명시적으로 규정한 것이다. 하지만 그것들은 그 주장에 꼭 맞는 종류의 증거다: 흥미로운 부분은 모델이 학습된 작업을 수행할 수 있다는 것이 아니다. 동결된 백본에 작은 어댑터를 더하면 수십 시간 분량의 데이터에서 의미 있는 행동을 얻어내고, 때때로 그 범위를 넘어 일반화한다는 점이다.
아직 입증되지 않은 것은 무엇인가

세 가지입니다. 그리고 그것들은 결코 작지 않습니다.
첫째, 어떤 독립적인 평가자도 Odyssey-3를 실행한 적이 없습니다. Physics-IQ 항목은 제출물입니다. 그리고 Odyssey 자체 글에서 두 번째 점수 산정 출처인 WorldMark — 여기서 Odyssey-3는 네 개 스플릿 중 세 개에서 1위를 차지합니다 — 는 벤치마크 자체의 캡션을 사용해 작성자가 수행한 평가이며, Odyssey의 표현을 빌리자면 "보고된 13개 지표 점수의 평균"입니다. 그것은 회사가 다른 누군가의 데이터셋에서 스스로를 채점하는 것입니다. 대부분의 출시가 제공하는 것보다는 많습니다. 그것은 제3자에 의한 것이 아닙니다.
둘째, 그 평가에서 Odyssey-3가 이기지 못하는 단 하나의 부문은 마케팅 주장에 가장 가까운 부문이다. 1인칭 실제 환경에서는 80.6으로 3위를 차지해, 84.4의 Lyra 2.0과 83.0의 AlayaWorld 뒤에 있다. 같은 평가에서 이 모델의 우위는 양식화된 환경과 3인칭 환경에 집중되어 있다 — 1인칭 양식화 77.2, 3인칭 실제 79.0, 3인칭 양식화 76.3. 포토리얼 1인칭 구현을 위해 개발하고 있다면, 신경 써야 할 순위는 Odyssey-3가 1위가 아닌 바로 그 순위다.
셋째, 가용성입니다. 그 문장에서 "Research preview"라는 말은 실질적인 역할을 톡톡히 하고 있습니다. 요금제 페이지도, 레이트 리밋 문서도, 셀프서비스 키도 없습니다. 이걸 제품에 넣고 싶다면, 대기열에 줄을 서야 합니다.
두 번째 계약 없이 그것을 비교하기
이런 출시의 실질적인 문제는 이겁니다: Odyssey-3는 이번 주 비디오 생성 분야에서 가장 흥미로운 존재인데, 여전히 호출할 수가 없습니다. 실제로 이와 비교해 벤치마크할 모델들은 사정이 다릅니다.
OrcaRouter는 Odyssey-3를 호스팅하지 않으며, 설령 호스팅한다 해도 전달해 드릴 공개 가격이 없습니다. 하나의 키로 접근할 수 있는 것은 비교 대상의 나머지입니다 — 768P에서 생성된 영상 1초당 $0.08의 minimax/minimax-h3, Kling 비디오 라인, 그리고 단일 엔드포인트 뒤에 있는 200개 이상의 모델 — 를 0% 마크업이 적용된 공급자 정가로 제공하므로, 공급자의 가격 변경이 다음 갱신 시점이 아니라 같은 날 청구서에 반영됩니다. 공급자 간 자동 장애 조치 덕분에 한 업스트림이 잠시 문제를 겪는다고 해서 평가 스윕이 중단되지 않으며, 라우팅 DSL을 사용하면 여러 모델을 하나의 인터페이스 뒤에 배치할 수 있어 일대일 비교가 두 번째 통합이 아니라 구성 변경만으로 가능합니다. Odyssey가 셀프서비스 API를 공개한다면, 바로 그 형태에 끼워 넣고 싶으실 겁니다.
무엇이 그것을 해결할까요?
자신이 선택하지 않은 하네스에서 Odyssey-3를 독립적으로 실행한 결과. 프리뷰 접근 권한을 가진 십여 명의 실무자가 1분간의 거친 카메라 움직임 후 환경이 어디까지 온전하게 유지되는지, 어디서 그렇지 않은지를 설명한 사례. 가격. 이 중 하나라도 있으면 이것은 강력한 출시에서 하나의 기준점으로 바뀐다.
이미 사실인 것은 더 좁지만 여전히 주목할 만하다: 생성 모델이 사진을 잘 찍는지보다 물리학을 이해하는지를 측정하는 유일한 공개 리더보드에서, 상호작용을 목적으로 하는 모델이 2위와 3위에 자리하고 있으며, 정규화된 비용은 1위 모델보다 낮다.
