Thẻ tiêu đề cho Odyssey-3 vs Kandinsky 6.0 Video, với bảng bên trái có tiêu đề Odyssey-3 ghi một môi trường tương tác, bản xem trước nghiên cứu ra mắt ngày 8 tháng 10 năm 2026, 832x480 hoặc 1280x720 Pro, không có trọng số và không có giá; và bảng bên phải có tiêu đề Kandinsky 6.0 Video ghi trọng số mở vào ngày 6 tháng 10 năm 2026 theo giấy phép MIT, clip 5 giây với âm thanh 44 kHz, Full HD 1920x1080, Physics-IQ chưa được gửi.
Guides & Insights

Odyssey-3 so với Kandinsky 6.0 Video: Trọng số mở và âm thanh đối đầu với bản xem trước tương tác đóng

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Kandinsky 6.0 Video ra mắt ngày 6 tháng 10 năm 2026 với điều mà các bản phát hành mô hình mở hiếm khi có được ngay ngày đầu: hỗ trợ trong Diffusers, ComfyUI, vLLM-Omni, SGLang và FastVideo, tất cả đều được ghi lại trong nhật ký cập nhật của chính kho lưu trữ, cùng với một báo cáo arXiv gửi ngày 4 tháng 10 và các checkpoint cấp phép MIT trên Hugging Face. Odyssey-3 ra mắt hai ngày sau đó, vào ngày 8 tháng 10, dưới dạng bản xem trước nghiên cứu công khai của một transformer khuếch tán tự hồi quy, thứ dựng nên một môi trường từ câu lệnh và dự đoán các thay đổi theo thời gian thực khi bạn di chuyển trong đó. Một bên là mô hình 29 tỷ tham số mà bạn có thể tải về và chạy trên GPU của riêng mình ngay tối nay. Bên kia là một hệ thống tương tác mà bạn chỉ có thể tiếp cận qua bản xem trước trên trình duyệt của Odyssey và một biểu mẫu liên hệ. Chúng là hai thái cực của ý nghĩa "mô hình video" trong cùng một tuần của tháng 10 năm 2026, và lựa chọn giữa chúng không nằm ở các benchmark mà ở việc ai nắm giữ trọng số.

Chúng cũng mong đợi những điều khác nhau ở bạn. Kandinsky 6.0 Video là một mô hình tạo sinh: đầu vào là prompt, đầu ra là một clip năm giây với âm thanh đồng bộ. Odyssey-3 là một mô hình dự đoán: hãy hành động, rồi xem thế giới phản hồi. Cả hai không thay thế cho nhau, và việc chúng ra mắt cách nhau 48 giờ là ngữ cảnh hữu ích nhất mà mỗi mô hình có được.

Hai kiến trúc, theo cách gọi của chính các nhà cung cấp

Kandinsky 6.0 Video là một họ mô hình diffusion nền tảng để tạo đồng bộ âm thanh-video, bao gồm Kandinsky 6.0 Video Lite với 3 tỷ tham số và Kandinsky 6.0 Video Pro với 29 tỷ. Cả hai đều tạo các clip dài năm giây với âm thanh 44 kHz được đồng bộ, bao gồm cả đồng bộ khẩu hình, ở chế độ văn bản-thành-âm thanh-video và hình ảnh-thành-âm thanh-video, và một mô hình siêu phân giải plug-in nâng đầu ra lên Full HD 1920×1080. Kỹ thuật này là CrossDiT hai luồng, kết nối một luồng video đã được huấn luyện trước với một luồng âm thanh mới được huấn luyện thông qua cơ chế chú ý chéo hai chiều, nhờ đó hai phương thức căn chỉnh về thời gian và ngữ nghĩa thay vì được tạo riêng rồi ghép lại. Quy trình huấn luyện mang tính liên tục: luồng âm thanh được huấn luyện từ đầu trên các tập dữ liệu âm thanh lớn, sau đó cả hai luồng được huấn luyện cùng nhau trên dữ liệu âm thanh-video theo cặp trong khi vẫn bảo toàn độ trung thực đơn phương thức, tiếp theo là tinh chỉnh có giám sát, hậu huấn luyện bằng học tăng cường và chưng cất.

Odyssey-3 là một transformer khuếch tán tự hồi quy được Odyssey mô tả như một mô hình khuếch tán video nhiều bước, được mở rộng thông qua teacher forcing và mặt nạ nhân quả, được huấn luyện để tiếp tục từ những quan sát trước đó và dự đoán các trạng thái tương lai với điều kiện là các đầu vào hành động, sau đó được chưng cất bằng khớp phân phối và chưng cất đối kháng thành một biến thể vài bước đủ nhanh để có thể tương tác. Nó chạy ở độ phân giải 832×480, với Odyssey-3 Pro ở 1280×720, không tạo ra âm thanh, và toàn bộ mục đích của nó là đầu ra phụ thuộc vào những gì bạn đã làm ngay trước đó.

Hỗ trợ ngay từ ngày đầu là sự khác biệt mà không ai đo lường.

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

Đọc lại nhật ký cập nhật Kandinsky 6.0, vì đó là dữ kiện cụ thể nhất trong so sánh này. Vào ngày 6 tháng 10, dự án ghi nhận khả năng hiện diện trên Diffusers, sổ đăng ký node của ComfyUI, vLLM-Omni, SGLang và FastVideo, cùng một Hugging Face Space cho mô hình Pro đã chưng cất. Đó là năm ngăn xếp độc lập trong một. Với bất kỳ ai đã chờ đợi hàng tháng trời để một checkpoint được phục vụ, đó chính là con số quyết định liệu mô hình có dùng được hay không.

Giờ hãy đặt nó cạnh câu chuyện truy cập của Odyssey-3. Bản xem trước chạy tại experience.odyssey.systems với điều hướng góc nhìn thứ nhất, điều hướng góc nhìn thứ ba và di chuyển camera độc lập. Truy cập API là một biểu mẫu liên hệ. Không có trang định giá, không có tài liệu giới hạn tốc độ và không có khóa tự phục vụ. Điều khoản API của trang web được cập nhật lần cuối vào 2026-01-22 và vẫn điều chỉnh “bản nguyên mẫu của Odyssey-2 API” — bề mặt thương mại chưa được viết lại cho mô hình đã phát hành trong tháng này.

• Nơi nó chạy — GPU của chính bạn, với trọng số và mã nguồn theo giấy phép MIT, thay vì chỉ trên máy chủ của Odyssey.

• Cách bạn tích hợp nó — pipeline Diffusers, các node ComfyUI, vLLM-Omni, SGLang, FastVideo, đối chiếu với bản xem trước trên trình duyệt và một biểu mẫu liên hệ.

• Những gì bạn có thể kiểm tra — kiến trúc, công thức huấn luyện và kích thước checkpoint trong một báo cáo công khai, đối chiếu với mô tả của nhà cung cấp về pipeline huấn luyện không có trọng số và không có bài báo.

• Những gì bạn có thể sửa đổi — fine-tunes, LoRAs, lượng tử hóa và chưng cất, tất cả những thứ mà cộng đồng vốn đã công bố trên Hugging Face ngay một ngày sau khi phát hành, so với không có gì cả.

Từng chiều một

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

• Đầu ra — các clip năm giây với âm thanh 44 kHz được đồng bộ hóa cho cả hai bậc Kandinsky, đối chiếu với một môi trường tương tác không có âm thanh dành cho Odyssey-3.

• Độ phân giải — Full HD 1920×1080 thông qua mô hình siêu phân giải dạng plug-in dành cho Kandinsky 6.0 Video, so với 832×480 của Odyssey-3 và 1280×720 của Odyssey-3 Pro.

• Các phương thức đầu vào — văn bản và hình ảnh cho Kandinsky, ở chế độ văn bản-sang-âm thanh-video và hình ảnh-sang-âm thanh-video; một lời nhắc cùng đầu vào điều khiển trực tiếp cho Odyssey-3.

• Thông số — 3B và 29B được công bố cho các hạng Lite và Pro, so với không được tiết lộ cho cả hai hạng Odyssey-3.

• Phần cứng — một GPU NVIDIA và Python 3.13 hoặc 3.14, với các preset được cung cấp sẵn cho H100/H200 cho đến các card hạng RTX 5090 dành cho Kandinsky; một trình duyệt cho Odyssey-3.

• Giá — $0 mỗi clip cho Kandinsky 6.0 Video nếu bạn có GPU, so với việc không có bất kỳ mức giá công bố nào cho Odyssey-3. Ước tính chi phí chuẩn hóa của bảng cho Odyssey-3 và Odyssey-3 Pro là $0.139 và $0.267 mỗi video được tạo, không bao gồm xử lý prompt.

• Chấm điểm bởi bên thứ ba — không có kết quả sinh của mô hình nào nằm trong một cuộc so tài độc lập. Báo cáo của Kandinsky dựa trên đánh giá song song của con người đối chiếu với phiên bản tiền nhiệm; các con số của Odyssey-3 đến từ một bài nộp benchmark cùng với một đánh giá do nhà cung cấp tự thực hiện.

• Giấy phép — MIT cho Kandinsky 6.0 Video, so với việc không có giấy phép nào được công bố vì không có trọng số nào để cấp phép.

Các benchmark nói gì và không nói gì

Kandinsky 6.0 Video không xuất hiện trên Physics-IQ Verified, bảng xếp hạng của Anates Labs và DeepMind, nơi chấm điểm các đoạn tiếp nối của các thí nghiệm vật lý thực tế trên 41 mô hình. Đối thủ đối đầu trực tiếp của Odyssey-3 ở đây cũng vậy, bởi vì bảng xếp hạng chấm điểm các mô hình tạo clip và cả hai đều tạo clip. Điều mà bảng xếp hạng thực sự có là dòng mô hình thế giới trước đó của Kandinsky, Kandinsky-WM 1.0, ở vị trí thứ 20 và −8.02 pp so với mức trung bình của hạng mục — một họ khác, một mục đích khác, và là mục Kandinsky duy nhất trên bảng.

Các dòng của Odyssey-3, để so sánh: xếp thứ 8 với +2,15 pp trên chính các prompt của benchmark và $0,129 mỗi video, và xếp thứ 3 với +9,99 pp trên prompt tùy chỉnh, còn Odyssey-3 Pro đứng thứ hai chung cuộc với +11,15 pp. Đó là những con số tốt hơn bất kỳ con số nào mà dòng Kandinsky có được trong bài kiểm tra cụ thể đó, và chúng còn đo một năng lực khác — Odyssey-3 được chấm điểm dựa trên những gì nó dự đoán sau một nhiễu loạn, cũng chính là điều mà bản xem trước của nó quảng bá.

Bằng chứng của chính Kandinsky là đánh giá của con người trong báo cáo kỹ thuật: Kandinsky 6.0 Video Pro rõ ràng vượt trội so với phiên bản tiền nhiệm Kandinsky 5.0 Video Pro, và vẫn cạnh tranh được với các mô hình tạo âm thanh-video hàng đầu, đặc biệt về chất lượng giọng nói. Đó là một so sánh song song do nhà cung cấp thực hiện, và đây là kiểu tuyên bố mà bất kỳ ai có một chiếc 5090 và một buổi chiều đều có thể đối chiếu với một checkpoint đã phát hành. Tuyên bố tương đương của Odyssey-3 thì không ai có thể kiểm chứng nếu không có khóa API.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Tiếp cận họ

OrcaRouter không host cả hai mô hình, và sẽ không bao giờ ngụ ý điều ngược lại: Odyssey-3 không có mức giá công bố nào để bất kỳ ai định tuyến, và Kandinsky 6.0 Video là open weights, nghĩa là cách đúng để chạy nó là thiết lập của chính repository trên GPU của bạn, chứ không phải một endpoint được host.

Chỗ một khóa OrcaRouter khớp vào là lớp bao quanh thử nghiệm. Kho mã nguồn của Kandinsky giả định bạn tự cung cấp GPU, môi trường và phép so sánh; điều nó không cung cấp là cách gọi những mô hình mà bạn muốn dùng để đánh giá nó.Hơn 200 mô hình nằm sau một khóa OrcaRouter duy nhất theo giá niêm yết của nhà cung cấp với markup 0% — bao gồm minimax/minimax-h3, mô hình video trọng số mở do MiniMax phát hành ngày 31 tháng 7, 2026, với giá $0.08 mỗi giây đầu ra 768P — vì vậy khi nhà cung cấp thay đổi giá, hóa đơn của bạn nhận thay đổi ngay trong cùng ngày, cơ chế chuyển đổi dự phòng tự động giữ cho một đợt đánh giá không chết vì một giờ lỗi của một nhà cung cấp thượng nguồn, và DSL định tuyến cho phép bạn đặt một mô hình video được lưu trữ và một mô hình thị giác sau một giao diện khi công việc là tạo rồi chấm điểm. Bạn vẫn tự clone kho mã nguồn và chạy phần thiết lập. Chỉ có điều bạn không phải xây nửa còn lại của dàn thử nghiệm.

Bạn thực sự muốn cái nào?

Nếu bạn cần đầu ra mà mình thực sự sở hữu — điều khoản thương mại có thể đọc rõ, trọng số có thể tinh chỉnh, một pipeline chạy được mà không phụ thuộc vào việc API của người khác có đang hoạt động hay không — thì Kandinsky 6.0 Video chính là câu trả lời, và việc hỗ trợ framework ngay từ ngày đầu nghĩa là bạn không đặt cược vào một sản phẩm nghiên cứu. Nếu bạn cần âm thanh cho video, đây là cái duy nhất trong hai cái tạo ra âm thanh.

Nếu vấn đề là dự đoán chứ không phải sản xuất — một chính sách phải phản ứng, một môi trường huấn luyện, bất cứ thứ gì mà trạng thái tiếp theo phụ thuộc vào hành động trước đó — thì Odyssey-3 là mô hình duy nhất trong hai mô hình làm được điều đó, và nó cũng là mô hình bạn không thể mua. Đó là hình hài trung thực của cuộc đối đầu này trong tuần cả hai ra mắt: một mô hình mở mà bạn có thể tải về và một mô hình tương tác mà bạn chỉ có thể dùng thử, với bằng chứng benchmark nghiêng về mô hình đóng còn bằng chứng thực tế nghiêng về mô hình mở.