Odyssey-3 vs Kandinsky 6.0 Video 타이틀 카드. 왼쪽 패널은 Odyssey-3 제목으로 대화형 환경을 표시하며, 2026년 10월 8일에 공개된 연구 프리뷰, 832x480 또는 1280x720 Pro, 가중치 없음 및 가격 없음; 오른쪽 패널은 Kandinsky 6.0 Video 제목으로, 2026년 10월 6일 MIT 라이선스 하에 오픈 가중치를 표시하며, 44 kHz 오디오가 포함된 5초 클립, Full HD 1920x1080, Physics-IQ 미제출.
Guides & Insights

Odyssey-3 vs Kandinsky 6.0 Video: 폐쇄형 인터랙티브 프리뷰에 맞선 오픈 웨이트와 오디오

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Kandinsky 6.0 Video는 2026년 10월 6일에 등장했는데, 오픈 모델 릴리스가 첫날에 좀처럼 갖추지 못하는 것을 함께했습니다. 바로 Diffusers, ComfyUI, vLLM-Omni, SGLang, FastVideo의 지원이며, 이는 모두 저장소 자체 업데이트 로그에 문서화되어 있고, 10월 4일 제출된 arXiv 보고서와 Hugging Face의 MIT 라이선스 체크포인트도 함께 제공됩니다. Odyssey-3는 이틀 뒤인 10월 8일에, 프롬프트로부터 환경을 구축하고 그 안을 이동할 때 변화를 실시간으로 예측하는 자기회귀 확산 트랜스포머의 공개 연구 프리뷰로 등장했습니다. 하나는 오늘 밤 여러분의 GPU에서 직접 다운로드해 실행할 수 있는 290억 매개변수 모델입니다. 다른 하나는 Odyssey의 브라우저 프리뷰와 문의 양식을 통해서만 접근할 수 있는 대화형 시스템입니다. 이 둘은 2026년 10월 같은 주에 '비디오 모델'이 의미한 것의 양극단이며, 둘 사이의 선택은 벤치마크보다 누가 가중치를 쥐고 있는지에 관한 문제입니다.

그들은 또한 당신에게 서로 다른 것을 요구한다. Kandinsky 6.0 Video는 생성 모델이다. 프롬프트를 입력하면 동기화된 오디오가 포함된 5초 클립이 출력된다. Odyssey-3는 예측 모델이다. 행동하라, 그러면 세상이 반응하는 것을 보게 된다. 어느 쪽도 다른 쪽을 대체하지 않으며, 이 둘이 48시간 간격으로 출시되었다는 사실은 둘 중 어느 쪽이든 가진 가장 유용한 맥락이다.

벤더들의 자체 용어로 본 두 아키텍처

Kandinsky 6.0 Video는 동기화된 오디오-비디오 생성을 위한 파운데이션 확산 모델 제품군으로, 3B 파라미터의 Kandinsky 6.0 Video Lite와 29B의 Kandinsky 6.0 Video Pro로 구성됩니다. 두 모델 모두 44 kHz 오디오가 동기화된 5초 클립을 생성하며, 립싱크를 포함해 텍스트-오디오-비디오 및 이미지-오디오-비디오 모드를 지원하고, 플러그인 방식의 초해상도 모델이 출력을 Full HD 1920×1080으로 끌어올립니다. 이 기법은 사전 학습된 비디오 스트림과 새로 학습된 오디오 스트림을 양방향 교차 어텐션으로 연결하는 이중 스트림 CrossDiT로, 두 모달리티가 따로 생성되어 합쳐지는 것이 아니라 시간과 의미 측면에서 정렬됩니다. 학습 레시피는 연속적입니다. 오디오 스트림을 대규모 오디오 코퍼스로 처음부터 학습한 뒤, 단일 모달리티의 충실도를 유지하면서 두 스트림을 쌍을 이룬 오디오-비디오 데이터로 공동 학습하고, 이어서 지도 미세 조정, 강화 학습 후속 학습, 증류를 수행합니다.

Odyssey-3는 Odyssey가 설명하는 자기회귀 확산 트랜스포머로, 교사 강제와 인과적 마스킹을 통해 확장된 다단계 비디오 확산 모델이며, 선행 관측에서 이어가고 행동 입력을 조건으로 미래 상태를 예측하도록 학습된 다음, 분포 매칭과 적대적 증류를 통해 상호작용이 가능할 만큼 빠른 몇 단계 변형으로 증류되었다. 832×480으로 실행되고, Odyssey-3 Pro는 1280×720이며, 오디오를 생성하지 않으며, 그 존재 목적 전체는 출력이 방금 전에 당신이 한 행동에 달려 있다는 것이다.

첫날부터의 지원이야말로 아무도 벤치마킹하지 않는 차이입니다

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

Kandinsky 6.0 업데이트 로그를 다시 읽어 보세요. 이 비교에서 가장 구체적인 사실이기 때문입니다. 10월 6일, 이 프로젝트는 Diffusers, ComfyUI 노드 레지스트리, vLLM-Omni, SGLang, FastVideo, 그리고 증류된 Pro 모델을 위한 Hugging Face Space에서 사용 가능함을 기록했습니다. 즉, 하루 만에 다섯 개의 독립적인 추론 스택입니다. 체크포인트가 서빙 프레임워크에 도달하기를 몇 달 동안 기다려 온 사람이라면, 그 숫자가 바로 모델의 사용 가능 여부를 결정하는 숫자입니다.

이제 이것을 Odyssey-3의 접근 스토리 옆에 놓아 보세요. 이 프리뷰는 experience.odyssey.systems에서 1인칭 내비게이션, 3인칭 내비게이션, 독립적인 카메라 이동으로 실행됩니다. API 접근은 문의 양식입니다. 가격 페이지도, 레이트 리밋 문서도, 셀프서비스 키도 없습니다. 이 사이트의 API 약관은 2026-01-22에 마지막으로 업데이트되었으며, 여전히 "Odyssey-2 API의 프로토타입"을 규율합니다 — 상업적 표면은 이번 달에 출시된 모델에 맞게 다시 작성되지 않았습니다.

• 실행 위치 — Odyssey 서버만이 아니라 자체 GPU에서, 가중치와 코드는 MIT 라이선스로.

• 통합 방식 — Diffusers 파이프라인, ComfyUI 노드, vLLM-Omni, SGLang, FastVideo, 그리고 브라우저 미리보기와 문의 양식에 대응하는 방법.

• 점검할 수 있는 것 — 공개 보고서에 있는 아키텍처, 학습 레시피, 체크포인트 크기를 가중치도 논문도 없는 학습 파이프라인에 관한 벤더 설명과 대조하는 것.

• 수정할 수 있는 것 — 파인튜닝, LoRA, 양자화 및 증류, 이 모두를 커뮤니티는 출시 다음 날 Hugging Face에 공개했는데, 그에 맞서는 것은 아무것도 없습니다.

차원별로

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

• 출력 — Kandinsky 두 티어 모두에 대해 동기화된 44 kHz 오디오가 포함된 5초 클립이며, Odyssey-3의 경우 오디오가 없는 상호작용 환경입니다.

• 해상도 — Kandinsky 6.0 Video용 플러그인 초해상도 모델을 통한 Full HD 1920×1080으로, Odyssey-3의 832×480 및 Odyssey-3 Pro의 1280×720과 대비됩니다.

• 입력 모달리티 — Kandinsky의 경우 텍스트와 이미지, 텍스트-오디오-비디오 및 이미지-오디오-비디오 모드로; Odyssey-3의 경우 프롬프트와 실시간 제어 입력.

• 매개변수 — Lite 및 Pro 등급은 3B와 29B가 공개된 반면, Odyssey-3의 두 등급은 모두 비공개입니다.

• 하드웨어 — NVIDIA GPU와 Python 3.13 또는 3.14, Kandinsky용으로 H100/H200부터 RTX 5090급 카드까지 제공되는 프리셋 포함; Odyssey-3용 브라우저.

• 가격 — GPU가 있다면 Kandinsky 6.0 Video는 클립당 $0인 반면, Odyssey-3에는 어떤 종류의 공개된 가격도 없습니다. Odyssey-3와 Odyssey-3 Pro에 대한 보드의 정규화된 비용 추정치는 프롬프트 처리를 제외하고 생성된 비디오당 $0.139와 $0.267입니다.

• 제3자 점수 평가 — 어느 모델도 자체 생성 결과물이 독립적인 일대일 비교에 포함되어 있지 않습니다. Kandinsky의 보고서는 전작과의 나란히 놓고 하는 인간 평가에 의존하고 있으며, Odyssey-3의 수치는 벤치마크 제출과 공급업체가 수행한 평가에서 나온 것입니다.

• 라이선스 — Kandinsky 6.0 Video의 경우 MIT이며, 라이선스할 가중치가 없기 때문에 공개된 라이선스는 없습니다.

벤치마크가 말하는 것과 말하지 않는 것

Kandinsky 6.0 Video는 실제 물리 실험의 연속 장면을 41개 모델에 걸쳐 채점하는 Anates Labs와 DeepMind의 보드인 Physics-IQ Verified에 나타나지 않습니다. 여기서 Odyssey-3의 일대일 비교 상대도 마찬가지입니다. 보드는 클립을 생성하는 모델을 채점하고, 이 둘 모두 클립을 생성하기 때문입니다. 보드에 실제로 올라 있는 것은 Kandinsky의 이전 월드 모델 계열인 Kandinsky-WM 1.0으로, 트랙 평균 대비 순위 20위, −8.02pp입니다 — 다른 계열, 다른 목적이며, 보드에 있는 유일한 Kandinsky 항목입니다.

대조적으로, Odyssey-3의 행은 다음과 같습니다: 벤치마크 자체 프롬프트에서 +2.15pp로 8위, 동영상당 $0.129이며, 사용자 지정 프롬프트에서 +9.99pp로 3위이고, Odyssey-3 Pro는 종합 2위로 +11.15pp입니다. 이 수치들은 해당 특정 테스트에서 Kandinsky 라인이 기록한 그 어떤 수치보다 더 좋으며, 또한 서로 다른 능력을 측정합니다 — Odyssey-3는 교란 이후 무엇을 예측하는지로 점수가 매겨지는데, 이는 해당 제품의 프리뷰가 내세우는 바로 그 내용입니다.

Kandinsky가 스스로 내세우는 근거는 기술 보고서에 있는 인간 평가입니다: Kandinsky 6.0 Video Pro는 전작인 Kandinsky 5.0 Video Pro를 확실히 능가하며, 특히 음성 품질에서 선도적인 오디오-비디오 생성 모델들과 비교해도 경쟁력을 유지합니다. 그것은 벤더가 직접 진행한 나란히 비교이며, 공개된 체크포인트를 통해 5090 한 대와 반나절만 가진 사람이라면 누구나 검증할 수 있는 종류의 주장입니다. Odyssey-3의 이에 상응하는 주장은 API 키 없이는 누구도 검증할 수 없습니다.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

그들에게 다가가기

OrcaRouter는 두 모델 중 어느 것도 호스팅하지 않으며, 그렇지 않다고 암시하는 일도 결코 없을 것입니다: Odyssey-3는 누구든 라우팅할 수 있는 공개된 요금이 없고, Kandinsky 6.0 Video는 오픈 웨이트이므로, 이를 실행하는 올바른 방법은 호스팅된 엔드포인트가 아니라 자체 GPU에서 리포지토리 자체의 설정을 사용하는 것입니다.

하나의 OrcaRouter 키가 적합한 위치는 실험을 둘러싼 계층입니다. Kandinsky의 저장소는 GPU, 환경, 비교 대상을 당신이 제공한다고 가정합니다; 제공하지 않는 것은 당신이 벤치마크하려는 모델을 호출하는 방법입니다. 단일 OrcaRouter 키 뒤에 200개 이상의 모델이 0% 마크업으로 제공자 정가에 있습니다 — 2026년 7월 31일 M​iniMax가 공개한 오픈 가중치 비디오 모델인 minimax/minimax-h3를 포함하며, 768P 출력 1초당 $0.08입니다 — 따라서 공급업체 가격 변경이 같은 날 청구서에 반영됩니다, 자동 장애 조치가 평가 스윕이 한 업스트림의 문제가 있는 시간에 죽지 않도록 합니다, 그리고 라우팅 DSL을 사용하면 작업이 생성하고 점수를 매기는 경우 호스팅된 비디오 모델과 비전 모델을 하나의 인터페이스 뒤에 둘 수 있습니다. 여전히 저장소를 복제하고 설정을 직접 실행해야 합니다. 단지 장비의 나머지 절반을 구축할 필요가 없을 뿐입니다.

어느 걸 진짜 원해

직접 소유할 수 있는 결과물 — 읽어볼 수 있는 상업적 조건, 파인튜닝할 수 있는 가중치, 다른 사람의 API가 살아 있어야만 돌아가는 게 아닌 파이프라인 — 이 필요하다면, Kandinsky 6.0 Video가 답입니다. 그리고 출시 첫날부터 제공되는 프레임워크 지원은 연구용 산출물에 걸고 있는 게 아니라는 뜻입니다. 영상에 사운드가 필요하다면, 둘 중 이것만이 사운드를 생성합니다.

문제가 생성이 아니라 예측이라면 — 반응해야 하는 정책, 훈련 환경, 다음 상태가 마지막 행동에 달려 있는 모든 것 — Odyssey-3는 둘 중 그걸 해내는 유일한 모델이고, 동시에 당신이 살 수 없는 모델이기도 하다. 이것이 두 모델이 모두 출시된 주에 이 맞대결이 지닌 솔직한 형국이다: 다운로드할 수 있는 오픈 모델과 시험해볼 수만 있는 인터랙티브 모델, 벤치마크 증거는 비공개 모델 편에 서고 실용적 증거는 오픈 모델 편에 선다.