
Odyssey-3 vs MiniMax H3: 차이는 다운로드입니다
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
2026년 8월 3일, 2K 비디오 모델의 가중치가 누구나 내려받아 실행할 수 있는 이름으로 Hugging Face에 공개됐다: MiniMax H3. 6주 후인 9월 15일, Odyssey는 연구 페이지를 공개했다. 그 대상은 Odyssey-3 — 로봇 팔, 자동차, 드론, 그리고 세 개의 비디오 게임을 구동하는 파운데이션 월드 모델 — 이다. 그리고 다운로드 링크가 들어갈 자리에는 한 문장을 넣었다: "앞으로 몇 주 안에" 공개될 예정이다. 그 두 문장이 비교의 전부다. 이 모델들 중 하나는 오늘 밤 당신의 클러스터에, 당신이 가진 실리콘 위에, 당신이 읽을 수 있는 라이선스 아래에 있을 수 있다. 다른 하나는 그 연구소 밖의 누구도 살 수도, 빌릴 수도, 내려받을 수도 없으며, 회사는 그것이 언제 바뀔지는 말하지 않았다. 그 비대칭은 이 맞대결의 각주가 아니다. 그것이 바로 이 맞대결이다.
MiniMax H3가 실제로 제공하는 것
H3는 2026년 7월 31일에 발표되었고 8월 3일에 오픈 소스로 공개되었습니다. 이는 단일 작업 비디오 생성기가 아닌 범용 모델입니다. 텍스트, 이미지, 비디오, 오디오를 컨텍스트로 읽고, 최대 2K 해상도로 최대 15초 길이의 비디오를 32kHz 네이티브 스테레오 오디오와 초당 24프레임으로 생성합니다. 6가지 화면비(21:9부터 9:16까지)를 지원하며, 11개 언어에서 대화를 안정적으로 지원합니다. 오픈 베이스의 공개된 변형은 두 가지입니다 — 텍스트-투-비디오 및 첫 프레임, 마지막 프레임 또는 첫 프레임과 마지막 프레임 생성을 위한 H3-Base-FL2VA와, 최대 9개의 이미지, 3개의 비디오 클립, 3개의 오디오 클립을 입력받을 수 있으며 입력 파일이 최대 12개로 제한되는 H3-Base-Ref2VA입니다.
이 비교에서 중요한 부분은 개방된 절반이 어디서 멈추는가이다. 전체 H3 시스템은 3단계 파이프라인이다: H3-Context-IR은 컨텍스트를 전처리하고 오케스트레이션하며, H3-Base는 768p로 생성하고, H3-Regenerate-2K는 결과를 2K로 끌어올린다. H3-Base의 가중치만 공개되어 있으며, Apache나 MIT가 아니라 MiniMax H3 Community License로 배포된다 — 조건이 붙은 라이선스이므로 상용 파이프라인에 들어가기 전에 읽어볼 가치가 있다. Context-IR 단계와 2K 재생성 모듈은 MiniMax 측에서 실행된다. 따라서 여기서 "open weights"로 얻는 것은 파이프라인의 중간 부분이다. H3-Base를 다운로드해 자체 호스팅하는 팀은 768p 비디오 생성만 얻을 수 있고, 벤더를 호출하지 않고서는 2K로 갈 길이 없다.

대신 Odyssey-3이 제공하는 것
그 대신 Odyssey-3가 제공하는 것은 하나의 주장과 일련의 시연입니다. Odyssey는 이를 파운데이션 세계 모델이라고 설명하며, 공개한 아키텍처 세부 사항은 나중에 검증할 수 있을 만큼 구체적입니다: 세계에 대한 대규모 시각 관측 모음으로 학습된 자기회귀 확산 트랜스포머로, 회사는 이것이 물리, 동역학, 인과관계, 인간 행동에 대한 학습된 이해를 낳는다고 말합니다. 과제 적응은 관측-행동 쌍으로 학습된 행동 디코더를 덧붙여 이루어지며, 사전 학습된 세계 모델은 고정된 채로 유지됩니다 — 작은 정책은 모델 자체를 미세 조정하는 대신 고정된 모델의 표현을 읽습니다.
이 시연들은 여섯 가지 구현체에 걸쳐 있습니다. 로봇 팔은 수십 시간의 시연을 거쳐, 훈련 데이터에는 없던 회복 행동—놓친 파지 후 그리퍼 방향을 다시 조정하는—까지 포함합니다. Flexion으로 구축된 휴머노이드 정책은 수십 시간의 원격조작 데이터로 만들어졌으며, Odyssey는 이것이 자사가 비교 테스트한 VLA 기준선보다 더 잘 일반화한다고 말하지만 수치는 공개하지 않았습니다. 20시간의 시뮬레이션 데이터로 학습한 폐루프 주행은 인도에서 주행되었습니다. 시뮬레이션 데이터로부터의 실내 장애물 회피 드론 비행. 게임 환경, 여기에는 Grand Theft Auto V에서 훈련된 정책이 해당 타이틀에서 추가 훈련 없이 Red Dead Redemption 2와 Sleeping Dogs로 전이된 사례가 포함됩니다; 대략 두 시간의 GTA 영상만으로 RDR2에서 말 타기 움직임을 만들어내기에 충분했습니다. 그리고 다른 AI를 훈련하기 위한 환경 생성은 회사의 PROWL 강화학습 작업과 연결되어 있습니다.
페이지에서 유일하게 확실한 숫자는 실제 영상과의 비교에서 나온다: Odyssey는 시뮬레이션으로 훈련된 주행 정책이 안전 운전자 개입과 다음 개입 사이에서 주행한 거리가 실제 데이터로 훈련된 정책의 약 77%에 해당한다고 보고한다. 이는 벤더 측 수치로, 재현된 바 없고, 이를 뒷받침하는 기술 보고서도 없으며, 어떤 제3자도 Odyssey-3에 대한 결과를 발표하지 않았다. 이는 월드 모델이 유용한지를 결정하는 종류의 숫자이며, 현재로서는 한 회사의 주장일 뿐이다.
전혀 닮지 않아 보이는 두 개의 락인
MiniMax H3를 '오픈된 쪽'으로, Odyssey-3를 '닫힌 쪽'으로 분류하고 싶은 유혹이 있지만, 라이선스의 현실은 그보다 더 흥미롭고, 양방향으로 작동한다.
MiniMax H3는 중간은 열려 있고 가장자리는 닫혀 있습니다. 생성기를 손에 쥐고, 검사하고, 미세 조정하고, 네트워크 호출 없이 실행할 수 있습니다. 그것을 범용 모델로 만들어 주는 컨텍스트 오케스트레이션은 손에 쥘 수 없고, 2K 단계도 손에 쥘 수 없습니다. 제품의 품질 주장이 출력 해상도에 달려 있다면, 오픈 웨이트 배포에는 오직 벤더의 호스티드 티어만이 끌어올릴 수 있는 상한이 있습니다.
Odyssey-3는 모든 계층에서 비공개이며, 회사 스스로 내놓은 설명 방식 때문에 더욱 이상하게 느껴진다. 로봇, 드론, 차량을 겨냥한 월드 모델은 자사가 통제하는 하드웨어에서 추론을 돌리는 구매자들, 즉 공장 현장, 시험용 차량, 기체를 겨냥한 것이다. 그런 구매자들은 제어 루프에 호스팅된 엔드포인트를 사용할 수 없다. 지연 시간과 연결성이 이를 불가능하게 만든다. 따라서 이런 모델의 비즈니스 모델에는 가중치가 반드시 포함되어야 하며, 그렇지 않다면 Odyssey가 계속 거론하는 세그먼트에는 고객이 없게 된다. 오늘 라이선스가 없다는 사실은 의도 표명이라기보다 상업 조건이 아직 작성 중이라는 진술에 가깝다. 2026년 6월에 발표된 Odyssey의 3억 1,000만 달러 규모 시리즈 B 투자 유치, 14억 5,000만 달러 기업가치, AWS를 선호 클라우드로, Trainium을 컴퓨팅 기반으로 삼은 것이 바로 그 조건들이 결정될 맥락이다.
차원별로
• 출력물 — MiniMax H3: 렌더링된 클립, 4~15초, 스테레오 오디오 지원 최대 2K. Odyssey-3: 시뮬레이션된 월드 상태와 연결된 하드웨어용 모터 동작.
• 다운로드할 수 있는 항목 — MiniMax H3: H3-Base 가중치, 커뮤니티 라이선스, 768p. Odyssey-3: 없음; 가중치도, 라이선스도, 리포지토리도 없습니다.
• 업체가 보유하는 것 — MiniMax H3: H3-Context-IR과 H3-Regenerate-2K, 이를 범용적으로 만들고 2K로 구현하는 두 모듈. Odyssey-3: 전부.
• 가격 — MiniMax H3: 초당 요금 공개, 768p에서 약 $0.08, 2K에서 $0.13, 여기에 재생성된 출력 초당 $0.05 추가(벤더 제공 수치). Odyssey-3: 어디에도 공개된 정보 없음.
• 사용 가능 여부 — MiniMax H3: 2026년 8월 3일부터 공개, 현재 호출 가능. Odyssey-3: 2026년 9월 15일 발표, "몇 주 내"이며 날짜는 미정.
• 제3자 근거 자료 — MiniMax H3: 제3자 평가에서 영상 편집 부문 1위, 텍스트→영상 및 이미지→영상 부문 2~3위. Odyssey-3: 벤더가 제시한 수치 하나뿐이며 외부 실행 결과는 전혀 없음.
이번 달에 무언가를 만들어야 한다면
실질적인 결과는 이 둘 중 하나만이 당신이 실제로 실행에 옮길 수 있는 결정이라는 것입니다. MiniMax H3는 OrcaRouter에서 minimax/minimax-h3 공급자의 정가로, 마크업 0%로 라우팅되므로, 벤더의 요율이 곧 당신이 지불하는 요율이며, MiniMax가 숫자를 바꾸면 갱신 시점이 아니라 같은 날 청구서도 함께 바뀝니다. 이는 대부분의 경우보다 초 단위 과금 비디오 모델에서 더 중요합니다. 768p에서 2K까지의 격차가 거의 2대 1에 달하고, 프로토타입과 출시 사이의 차이가 바로 그 두 티어 사이의 차이일 수 있기 때문입니다.
여기서 직접적인 벤더 통합보다 라우터를 선택하는 두 번째 이유가 있습니다. H3의 개방형 절반은 그 자체로 진정으로 유용하며, 그것에 대해 관심을 가질 가능성이 가장 높은 팀은 GPU를 보유하고 이에 대한 의견을 가진 팀입니다. 그러한 팀은 혼합 구성에 놓이게 됩니다: 대량 작업을 위한 자체 호스팅 H3-Base, 2K 재생성을 위한 호스팅 경로, 그리고 비디오 주변에서 파이프라인이 필요로 하는 모든 것을 위한 하나 또는 두 개의 다른 모델. 하나의 키와 제공자 간 자동 장애 조치는 단일 모델 스택보다 그러한 형태에서 더 가치가 있으며, 라우팅 DSL은 주변 모델들 — 프롬프트 모델, 시작 프레임을 위한 이미지 모델, 비디오 모델 — 을 세 번의 통합 대신 하나의 호출로 구성합니다.
Odyssey-3는, 분명히 말하자면, OrcaRouter나 다른 누구에 의해서도 라우팅되지 않습니다. 라우팅할 엔드포인트도 없고 전달할 가격도 없습니다. 이 글은 그 반대를 주장하지 않습니다.
두 공급업체 모두에게 물어볼 가치가 있는 질문
MiniMax는 H3에 관한 흥미로운 질문에 이미 답했고, 그 답은 “중간, 768p, 우리 라이선스 하에”입니다. H3를 평가하고 있다면, 테스트해야 할 것은 오픈 베이스에 자체 인프라를 더한 것이 호스팅된 2K 경로를 사용 가능한 초당 비용에서 능가하는지입니다 — 그리고 2K 출력을 근거로 제품 주장을 세우기 전에 그것을 테스트하는 것입니다.
Odyssey는 아직 자사 버전에 대한 답을 내놓지 않았다. 출시 기간이 닫히면 첫 번째 질문은 벤치마크가 아니라 라이선스다. 이 여섯 가지 구현체 중 어느 것이 지원되는 배포인지, 누구의 하드웨어에서, 어떤 가격으로, 그리고 동결된 월드 모델이 로봇 팔을 구동하게 만드는 액션 디코더를 고객이 훈련하는 것인지 Odyssey가 제공하는 것인지다. 하나의 백본으로 로봇 팔, 휴머노이드, 자동차, 드론, 세 가지 게임에 도달하는 월드 모델은 일반성 주장이며, 일반성이야말로 그것을 정책이 아니라 파운데이션 모델로 만든다 — 바로 그렇기 때문에 시연 영상이 아니라 상업적 조건이 누가 그것을 사용할 수 있는지를 결정할 것이다.

그때까지 정직한 스코어보드는 이렇게 읽힌다: 당신이 풀할 수 있는 모델 하나, 지켜볼 수 있는 모델 하나. 먼저 저장소와 라이선스를 확인하고, 벤치마크는 그다음으로 확인하라 — 바로 그 순서로, 앞의 둘 없이는 세 번째를 검증할 수 없기 때문이다.

전체 파이프라인을 자동 장애 조치 기능이 있는 하나의 API 키 뒤에 두세요. 세 개의 개별 통합을 사용하는 대신 말이죠.
