
Odyssey-3 프리뷰: Odyssey의 월드 모델, 세계를 지켜보는 것에서 그 안에서 행동하는 것으로 나아가다
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
Odyssey-3는 Odyssey가 2026년 9월 15일에 공개한 최신 파운데이션 월드 모델로, 자사 발표에서 "로봇을 구동하고, 자동차를 운전하고, AI를 훈련하고, 드론을 조종하며, 심지어 비디오 게임을 하는" 것을 가능하게 하는 모델이라고 설명했습니다. 이 미리보기를 자세히 읽을 가치가 있게 만드는 것은 구현체 목록이 아니라 — 메커니즘입니다. Odyssey-3는 시각적 관찰로부터 다양한 시나리오를 시뮬레이션하도록 훈련된 자기회귀 확산 트랜스포머이며, 회사는 여기에 학습된 액션 디코더를 부착합니다. 이는 모델의 내부 장면 표현을 특정 하드웨어가 필요로 하는 모터 명령으로 변환하는 구성 요소입니다. 이는 로봇 팔의 그럴듯한 클립을 생성하는 모델과 로봇 팔을 움직이도록 요청받는 모델의 차이입니다. Odyssey는 이것이 가능하게 하는 시스템 부류를 "물리적 에이전트"라고 부릅니다 — 회사의 표현을 빌리면, "세상의 언어를 구사하는" 모델입니다. 이 틀이 미리보기 보도에서 떠도는 "물리학 에이전트"라는 라벨과 가깝게 들린다면, 그것은 같은 주장을 합리적으로 읽은 것이지만, Odyssey 자신의 표현은 아니며, 현 단계에서는 측정된 결과가 아니라 의도에 대한 설명입니다.
오디세이가 실제로 발표한 것
이 게시물은 예고일 뿐, 출시가 아니다. Odyssey는 "앞으로 몇 주 안에 이를 공개적으로 출시하게 되어 기쁘다"고 말하며 날짜도, 가격도, 접근 채널도 밝히지 않는다. 발표문에서 연결된 Odyssey-3 기술 보고서는 없다 — 이 페이지가 가리키는 유일한 논문은 회사의 강화 학습 연구인 PROWL-1이며, 유일한 PDF는 Starchild-1의 것이다. 이러한 부재는 분명히 짚고 넘어갈 가치가 있다. 왜냐하면 그것이 아래의 모든 내용을 규정하기 때문이다: 이 기사의 모든 능력 주장은 Odyssey의 것이며, 재현된 바 없고, Odyssey가 제공하지 않은 Odyssey-3 수치를 아직 공개한 제3자도 없다.
이 게시물이 명시하는 것은 아키텍처와 학습 철학이다. 이 모델은 자기회귀 확산 트랜스포머다. 이는 작업별 레이블이 아니라 세계에 대한 시각적 관찰을 통해 학습되는데, Odyssey는 이것이 모델에게 "물리학, 역학, 인과관계, 인간 행동"에 대한 학습된 이해를 부여한다고 주장하며, 그들의 설명에 따르면 이런 방식으로 사전 학습되지 않은 시스템보다 데이터 요구량도 더 적다. 그 밑에 깔린 베팅은 세계 모델 분야 전체가 하고 있는 바로 그것이다. 즉, 대규모로 장면의 다음 상태를 예측하는 일은 모델로 하여금 물리적 객체가 실제로 어떻게 작동하는지를 내면화하도록 강제한다는 것이다. 물리학을 틀리게 배우는 모델은 긴 롤아웃에서 비일관성 속으로 표류하며 회복할 수 없기 때문이다.

하나의 백본, 여섯 개의 바디
이번 발표에서 가장 구체적인 증거는 동일한 파운데이션 모델에 의해 구동되는 구현체들의 확산이다. Odyssey는 다음과 같이 보고한다:
• 로봇 팔 — "단 수십 시간의 로봇 시연"만으로 다양한 팔을 제어하고 복잡한 작업을 완수하는 방법을 학습했으며, 그립에 실패한 뒤 그리퍼 방향을 다시 조정하는 것처럼 시연에는 전혀 없었던 복구 행동까지 포함합니다.
• 휴머노이드 — Flexion과 함께 수행한 작업으로, 수십 시간 분량의 휴머노이드 원격조작 데이터를 기반으로 구축되어 실시간으로 실행되는 정책을 갖추고 있으며, Odyssey는 이것이 자사가 테스트한 비전-언어-행동(VLA) 베이스라인보다 조명 변화에 더 잘 일반화되었다고 주장한다.
• 주행 — 폐루프 주행을 위한 실시간 웨이포인트를 생성하는 동결된 백본으로, "단 20시간의 시뮬레이션 주행 데이터"로 학습되었습니다.
• 드론 — 수십 시간의 시뮬레이션 비행 데이터로부터 장애물을 회피하는 실내 비행, 그리고 백본을 고정한 정성적 롤아웃.
• 비디오 게임 — Grand Theft Auto V 장시간 플레이 세션, 해당 타이틀에서 추가 정책 학습 없이 Red Dead Redemption 2와 Sleeping Dogs로 전이.
• AI 훈련 환경 — 다른 에이전트의 훈련장으로 사용되는 생성된 세계이며, PROWL-1 작업과 연관됩니다.
저 행들 전반에 걸친 패턴이 바로 실제 주장이다. 그것은 Odyssey-3가 그중 어느 하나에 뛰어나다는 것이 아니라, 하나의 가중치 세트가 작은 학습된 출력 어댑터와 함께 그 모두에 도달한다는 것이다. 세계가 움직이는 방식에 대한 범용 모델은 로봇별 정책과는 매우 다른 자산이며, 그것이 바로 이번 프리뷰가 그 위치에 도달한 이유다.
단 하나의 숫자, 그리고 그것이 증명하지 못하는 것
Odyssey는 Odyssey-3에 대해 단 하나의 비교 수치를 공개한다. 순전히 시뮬레이션에서 훈련된 주행 정책은 동일한 20시간의 시뮬레이션 데이터를 사용했을 때, 실제 영상으로 훈련된 정책이 안전 운전자의 개입 사이에서 주행한 거리의 약 77%를 주행했다. 이는 sim-to-real 수치이며, 정말 흥미로운 수치다. 시뮬레이션으로 훈련된 주행과 실제 데이터로 훈련된 주행 사이의 격차를 일부라도 좁히는 것이 이 문제의 어려운 부분이다. 또한 이 글에 나오는 유일한 수치이기도 하다.
정확도 표도, 성공률도, 교차 신체 벤치마크도, 공동 평가에서 이름이 명시된 다른 월드 모델과의 비교도 없다. 이 페이지의 푸터 카드는 Odyssey-3가 "월드 모델의 물리적 정확성에서 최첨단을 진전시킨다"고 주장하지만, 페이지 어디에도 이를 수치로 뒷받침하는 내용은 없다. Odyssey는 또한 Poke & Wiggle과의 평가 파트너십을 언급하며 이것이 "서로 다른 신체, 시점, 제어"를 아우른다고 하지만, 아직 여기서 나온 결과는 하나도 공개하지 않았다. 여기 있는 모든 것은 벤더의 주장이며, 77%라는 수치는 외부 주체가 이를 다시 실행하기 전까지는 정확히 그렇게 읽어야 한다.
누락된 벤치마크 표가 의미하는 것
벤치마크의 부재를 경고 신호로 읽기는 쉽다. 그것은 이 분야의 현주소로 읽는 편이 더 낫다. 월드 모델에는 아직 MMLU나 GPQA에 상응하는 것 — 모두가 기준으로 삼아 보고하는, 공유되고 저렴하며 널리 신뢰받는 평가 — 이 없다. Odyssey의 자체 프레이밍은 규모 문제를 다른 방향에서 인정한다: 그 글은 프런티어 월드 모델들이 여전히 "언어 모델보다 대략 100배 뒤처져 있다"고 말한다. 평가 기준 자체가 확립되지 않았을 때, 점수판 대신 아키텍처와 구현체 전반을 앞세우는 프리뷰 글은 프런티어를 정직하게 설명하는 것이며, 독자는 정성적 주장을 확정된 것으로 보지 말고 방향성으로 받아들여야 한다. Poke & Wiggle 파트너십이 주목할 만한 것이다: 여러 신체와 관점을 가로지르는 평가가 공개된 수치를 갖춘다면, 이 모든 것에 대한 첫 독립적 평가가 될 것이다.

“다가오는 몇 주”가 진짜 헤드라인이다
이번 분기에 결정을 내려야 하는 사람이라면, 발표문에서 실제로 중요한 문장은 가용성에 관한 문장이다. Odyssey-3는 일반 제공되지 않으며, 공개된 가격도, API 문서도, 명시된 날짜도 없다 — 그저 "앞으로 몇 주 안에"일 뿐이다. 그래서 이것은 오늘 평가할 수 있는 모델과는 다른 범주에 속한다. 또한 이는 Odyssey-3를 상대로 불가피하게 작성될 비교 페이지들이 당분간은 출시된 제품과 연구 프리뷰 사이의 비교라는 뜻이다. 이는 형식적인 문제가 아니라 실제적인 구분이다: 프리뷰는 뛰어날 수 있지만, 그렇다고 해서 월요일에 파이프라인에 넣을 수 있는 것은 아니다.
타이밍이 중요한 두 번째 이유가 있다. Odyssey는 기업가치 14억 5,000만 달러로 3억 1,000만 달러 규모의 시리즈 B 투자를 유치했고, AWS가 자사의 선호 클라우드 제공업체가 되었다 — 이 회사는 프런티어 월드 모델을 밀어붙일 컴퓨팅 파워를 갖추고 있으며, 정식 출시 몇 달 전에 공개되는 프리뷰는 그 작업을 보여주는 방식이다. 이 발표는 역량에 대한 선언이 아니라 궤적에 대한 선언으로 읽어라.
오늘 만든다면 이걸 어떻게 해야 할까
Odyssey-3 자체는 호출할 수 있는 대상이 아니며, OrcaRouter도 그것을 제공하지 않습니다 — 아직 라우팅할 대상이 없으니 어떤 라우팅 계층도 제공하지 않습니다. 지금 해 둘 가치가 있는 일은 이 결정을 두 부분으로 나누는 것입니다. 첫 번째 부분은 세계 모델이며, 그에 대한 정직한 답은 공개 릴리스와 첫 번째 독립 평가를 기다리라는 것입니다. 두 번째 부분은 그 주변의 모든 것입니다. 과제를 정책이 소비할 수 있는 형태로 바꿔 주는 언어 모델, 장면을 읽는 비전 모델, 녹화된 시연에 레이블을 붙이는 전사 모델이죠. 그 주변 스택은 평범한 라우팅 작업이며, 오늘날 200개 이상의 모델에 걸쳐 제공업체 정가에 0% 마크업으로 이용할 수 있는 단일 API에서 자동 페일오버와 함께 이용할 수 있고, 제공업체가 성능 저하를 보일 때 자동으로 전환됩니다. 이 계층을 나중이 아니라 지금 라우팅해야 하는 이유는, Odyssey-3가 출시될 때도 여러분이 여전히 운영하게 될 계층이 바로 이 계층이기 때문입니다. 그리고 프롬프트 모델을 바꾸는 것은 설정 변경이지만, 통합을 다시 작성하는 것은 그렇지 않습니다.
또한 월드 모델 문제는 가능한 한 가장 저렴한 방식으로 열어 두는 것이 좋습니다. Odyssey-3 같은 모델이 실제로 라우팅된 제공자에 도달하면, 같은 날 제공자 정가로 나타나므로, 시험해 보는 데 드는 비용은 계약이 아니라 API 호출 한 번입니다. 새 모델을 바로 투입할 수 있도록 주변 파이프라인을 구축하는 것이 아직도 움직이고 있는 최전선을 위한 실질적인 준비입니다.
무엇이 그 판단을 바꾸겠는가
이 미리보기를 확정된 사실로 바꿔 줄 세 가지가 있습니다. 아키텍처와 학습 세부 사항을 담은 기술 보고서가 공개되면 외부 그룹이 무엇이든 재현할 수 있게 될 것입니다. 첫 번째 독립 벤치마크, 이상적으로는 Poke & Wiggle의 크로스바디 작업이 나오면 공급업체의 주장을 다른 누군가가 측정한 수치로 대체하게 될 것입니다. 그리고 날짜와 가격이 명시된 공개 릴리스가 나오면 Odyssey-3와의 모든 비교는 독자가 실제로 실행할 수 있는 두 가지 사이의 비교가 될 것입니다.
그때까지, 방어 가능한 요약은 이것이다: Odyssey-3는 진정으로 어려운 것 — 하나의 월드 모델, 여러 몸체, 렌더링이 아닌 제어 — 에 대한 신뢰할 만한 주장이며, 이 분야에서 실적을 쌓은 자금력 있는 연구소에서 나왔고, 거의 숫자도 없고 출시일도 없이 제시되었다. 그것이 최전선 미리보기의 모습이다. 능력 주장은 방향성을 보여주는 것으로, 아키텍처는 흥미로운 부분으로, 출시일은 당신의 계획을 바꾸는 유일한 문장으로 취급하라.

