
Odyssey-3 so với Kandinsky 6.0 Video: Trọng số mở và âm thanh đối đầu với bản xem trước tương tác đóng
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Kandinsky 6.0 Video ra mắt ngày 6 tháng 10 năm 2026 với điều mà các bản phát hành mô hình mở hiếm khi có được ngay ngày đầu: hỗ trợ trong Diffusers, ComfyUI, vLLM-Omni, SGLang và FastVideo, tất cả đều được ghi lại trong nhật ký cập nhật của chính kho lưu trữ, cùng với một báo cáo arXiv gửi ngày 4 tháng 10 và các checkpoint cấp phép MIT trên Hugging Face. Odyssey-3 ra mắt hai ngày sau đó, vào ngày 8 tháng 10, dưới dạng bản xem trước nghiên cứu công khai của một transformer khuếch tán tự hồi quy, thứ dựng nên một môi trường từ câu lệnh và dự đoán các thay đổi theo thời gian thực khi bạn di chuyển trong đó. Một bên là mô hình 29 tỷ tham số mà bạn có thể tải về và chạy trên GPU của riêng mình ngay tối nay. Bên kia là một hệ thống tương tác mà bạn chỉ có thể tiếp cận qua bản xem trước trên trình duyệt của Odyssey và một biểu mẫu liên hệ. Chúng là hai thái cực của ý nghĩa "mô hình video" trong cùng một tuần của tháng 10 năm 2026, và lựa chọn giữa chúng không nằm ở các benchmark mà ở việc ai nắm giữ trọng số.
Chúng cũng mong đợi những điều khác nhau ở bạn. Kandinsky 6.0 Video là một mô hình tạo sinh: đầu vào là prompt, đầu ra là một clip năm giây với âm thanh đồng bộ. Odyssey-3 là một mô hình dự đoán: hãy hành động, rồi xem thế giới phản hồi. Cả hai không thay thế cho nhau, và việc chúng ra mắt cách nhau 48 giờ là ngữ cảnh hữu ích nhất mà mỗi mô hình có được.
Hai kiến trúc, theo cách gọi của chính các nhà cung cấp
Kandinsky 6.0 Video là một họ mô hình diffusion nền tảng để tạo đồng bộ âm thanh-video, bao gồm Kandinsky 6.0 Video Lite với 3 tỷ tham số và Kandinsky 6.0 Video Pro với 29 tỷ. Cả hai đều tạo các clip dài năm giây với âm thanh 44 kHz được đồng bộ, bao gồm cả đồng bộ khẩu hình, ở chế độ văn bản-thành-âm thanh-video và hình ảnh-thành-âm thanh-video, và một mô hình siêu phân giải plug-in nâng đầu ra lên Full HD 1920×1080. Kỹ thuật này là CrossDiT hai luồng, kết nối một luồng video đã được huấn luyện trước với một luồng âm thanh mới được huấn luyện thông qua cơ chế chú ý chéo hai chiều, nhờ đó hai phương thức căn chỉnh về thời gian và ngữ nghĩa thay vì được tạo riêng rồi ghép lại. Quy trình huấn luyện mang tính liên tục: luồng âm thanh được huấn luyện từ đầu trên các tập dữ liệu âm thanh lớn, sau đó cả hai luồng được huấn luyện cùng nhau trên dữ liệu âm thanh-video theo cặp trong khi vẫn bảo toàn độ trung thực đơn phương thức, tiếp theo là tinh chỉnh có giám sát, hậu huấn luyện bằng học tăng cường và chưng cất.
Odyssey-3 là một transformer khuếch tán tự hồi quy được Odyssey mô tả như một mô hình khuếch tán video nhiều bước, được mở rộng thông qua teacher forcing và mặt nạ nhân quả, được huấn luyện để tiếp tục từ những quan sát trước đó và dự đoán các trạng thái tương lai với điều kiện là các đầu vào hành động, sau đó được chưng cất bằng khớp phân phối và chưng cất đối kháng thành một biến thể vài bước đủ nhanh để có thể tương tác. Nó chạy ở độ phân giải 832×480, với Odyssey-3 Pro ở 1280×720, không tạo ra âm thanh, và toàn bộ mục đích của nó là đầu ra phụ thuộc vào những gì bạn đã làm ngay trước đó.
Hỗ trợ ngay từ ngày đầu là sự khác biệt mà không ai đo lường.

Đọc lại nhật ký cập nhật Kandinsky 6.0, vì đó là dữ kiện cụ thể nhất trong so sánh này. Vào ngày 6 tháng 10, dự án ghi nhận khả năng hiện diện trên Diffusers, sổ đăng ký node của ComfyUI, vLLM-Omni, SGLang và FastVideo, cùng một Hugging Face Space cho mô hình Pro đã chưng cất. Đó là năm ngăn xếp độc lập trong một. Với bất kỳ ai đã chờ đợi hàng tháng trời để một checkpoint được phục vụ, đó chính là con số quyết định liệu mô hình có dùng được hay không.
Giờ hãy đặt nó cạnh câu chuyện truy cập của Odyssey-3. Bản xem trước chạy tại experience.odyssey.systems với điều hướng góc nhìn thứ nhất, điều hướng góc nhìn thứ ba và di chuyển camera độc lập. Truy cập API là một biểu mẫu liên hệ. Không có trang định giá, không có tài liệu giới hạn tốc độ và không có khóa tự phục vụ. Điều khoản API của trang web được cập nhật lần cuối vào 2026-01-22 và vẫn điều chỉnh “bản nguyên mẫu của Odyssey-2 API” — bề mặt thương mại chưa được viết lại cho mô hình đã phát hành trong tháng này.
• Nơi nó chạy — GPU của chính bạn, với trọng số và mã nguồn theo giấy phép MIT, thay vì chỉ trên máy chủ của Odyssey.
• Cách bạn tích hợp nó — pipeline Diffusers, các node ComfyUI, vLLM-Omni, SGLang, FastVideo, đối chiếu với bản xem trước trên trình duyệt và một biểu mẫu liên hệ.
• Những gì bạn có thể kiểm tra — kiến trúc, công thức huấn luyện và kích thước checkpoint trong một báo cáo công khai, đối chiếu với mô tả của nhà cung cấp về pipeline huấn luyện không có trọng số và không có bài báo.
• Những gì bạn có thể sửa đổi — fine-tunes, LoRAs, lượng tử hóa và chưng cất, tất cả những thứ mà cộng đồng vốn đã công bố trên Hugging Face ngay một ngày sau khi phát hành, so với không có gì cả.
Từng chiều một

• Đầu ra — các clip năm giây với âm thanh 44 kHz được đồng bộ hóa cho cả hai bậc Kandinsky, đối chiếu với một môi trường tương tác không có âm thanh dành cho Odyssey-3.
• Độ phân giải — Full HD 1920×1080 thông qua mô hình siêu phân giải dạng plug-in dành cho Kandinsky 6.0 Video, so với 832×480 của Odyssey-3 và 1280×720 của Odyssey-3 Pro.
• Các phương thức đầu vào — văn bản và hình ảnh cho Kandinsky, ở chế độ văn bản-sang-âm thanh-video và hình ảnh-sang-âm thanh-video; một lời nhắc cùng đầu vào điều khiển trực tiếp cho Odyssey-3.
• Thông số — 3B và 29B được công bố cho các hạng Lite và Pro, so với không được tiết lộ cho cả hai hạng Odyssey-3.
• Phần cứng — một GPU NVIDIA và Python 3.13 hoặc 3.14, với các preset được cung cấp sẵn cho H100/H200 cho đến các card hạng RTX 5090 dành cho Kandinsky; một trình duyệt cho Odyssey-3.
• Giá — $0 mỗi clip cho Kandinsky 6.0 Video nếu bạn có GPU, so với việc không có bất kỳ mức giá công bố nào cho Odyssey-3. Ước tính chi phí chuẩn hóa của bảng cho Odyssey-3 và Odyssey-3 Pro là $0.139 và $0.267 mỗi video được tạo, không bao gồm xử lý prompt.
• Chấm điểm bởi bên thứ ba — không có kết quả sinh của mô hình nào nằm trong một cuộc so tài độc lập. Báo cáo của Kandinsky dựa trên đánh giá song song của con người đối chiếu với phiên bản tiền nhiệm; các con số của Odyssey-3 đến từ một bài nộp benchmark cùng với một đánh giá do nhà cung cấp tự thực hiện.
• Giấy phép — MIT cho Kandinsky 6.0 Video, so với việc không có giấy phép nào được công bố vì không có trọng số nào để cấp phép.
Các benchmark nói gì và không nói gì
Kandinsky 6.0 Video không xuất hiện trên Physics-IQ Verified, bảng xếp hạng của Anates Labs và DeepMind, nơi chấm điểm các đoạn tiếp nối của các thí nghiệm vật lý thực tế trên 41 mô hình. Đối thủ đối đầu trực tiếp của Odyssey-3 ở đây cũng vậy, bởi vì bảng xếp hạng chấm điểm các mô hình tạo clip và cả hai đều tạo clip. Điều mà bảng xếp hạng thực sự có là dòng mô hình thế giới trước đó của Kandinsky, Kandinsky-WM 1.0, ở vị trí thứ 20 và −8.02 pp so với mức trung bình của hạng mục — một họ khác, một mục đích khác, và là mục Kandinsky duy nhất trên bảng.
Các dòng của Odyssey-3, để so sánh: xếp thứ 8 với +2,15 pp trên chính các prompt của benchmark và $0,129 mỗi video, và xếp thứ 3 với +9,99 pp trên prompt tùy chỉnh, còn Odyssey-3 Pro đứng thứ hai chung cuộc với +11,15 pp. Đó là những con số tốt hơn bất kỳ con số nào mà dòng Kandinsky có được trong bài kiểm tra cụ thể đó, và chúng còn đo một năng lực khác — Odyssey-3 được chấm điểm dựa trên những gì nó dự đoán sau một nhiễu loạn, cũng chính là điều mà bản xem trước của nó quảng bá.
Bằng chứng của chính Kandinsky là đánh giá của con người trong báo cáo kỹ thuật: Kandinsky 6.0 Video Pro rõ ràng vượt trội so với phiên bản tiền nhiệm Kandinsky 5.0 Video Pro, và vẫn cạnh tranh được với các mô hình tạo âm thanh-video hàng đầu, đặc biệt về chất lượng giọng nói. Đó là một so sánh song song do nhà cung cấp thực hiện, và đây là kiểu tuyên bố mà bất kỳ ai có một chiếc 5090 và một buổi chiều đều có thể đối chiếu với một checkpoint đã phát hành. Tuyên bố tương đương của Odyssey-3 thì không ai có thể kiểm chứng nếu không có khóa API.

Tiếp cận họ
OrcaRouter không host cả hai mô hình, và sẽ không bao giờ ngụ ý điều ngược lại: Odyssey-3 không có mức giá công bố nào để bất kỳ ai định tuyến, và Kandinsky 6.0 Video là open weights, nghĩa là cách đúng để chạy nó là thiết lập của chính repository trên GPU của bạn, chứ không phải một endpoint được host.
Chỗ một khóa OrcaRouter khớp vào là lớp bao quanh thử nghiệm. Kho mã nguồn của Kandinsky giả định bạn tự cung cấp GPU, môi trường và phép so sánh; điều nó không cung cấp là cách gọi những mô hình mà bạn muốn dùng để đánh giá nó.Hơn 200 mô hình nằm sau một khóa OrcaRouter duy nhất theo giá niêm yết của nhà cung cấp với markup 0% — bao gồm minimax/minimax-h3, mô hình video trọng số mở do MiniMax phát hành ngày 31 tháng 7, 2026, với giá $0.08 mỗi giây đầu ra 768P — vì vậy khi nhà cung cấp thay đổi giá, hóa đơn của bạn nhận thay đổi ngay trong cùng ngày, cơ chế chuyển đổi dự phòng tự động giữ cho một đợt đánh giá không chết vì một giờ lỗi của một nhà cung cấp thượng nguồn, và DSL định tuyến cho phép bạn đặt một mô hình video được lưu trữ và một mô hình thị giác sau một giao diện khi công việc là tạo rồi chấm điểm. Bạn vẫn tự clone kho mã nguồn và chạy phần thiết lập. Chỉ có điều bạn không phải xây nửa còn lại của dàn thử nghiệm.
Bạn thực sự muốn cái nào?
Nếu bạn cần đầu ra mà mình thực sự sở hữu — điều khoản thương mại có thể đọc rõ, trọng số có thể tinh chỉnh, một pipeline chạy được mà không phụ thuộc vào việc API của người khác có đang hoạt động hay không — thì Kandinsky 6.0 Video chính là câu trả lời, và việc hỗ trợ framework ngay từ ngày đầu nghĩa là bạn không đặt cược vào một sản phẩm nghiên cứu. Nếu bạn cần âm thanh cho video, đây là cái duy nhất trong hai cái tạo ra âm thanh.
Nếu vấn đề là dự đoán chứ không phải sản xuất — một chính sách phải phản ứng, một môi trường huấn luyện, bất cứ thứ gì mà trạng thái tiếp theo phụ thuộc vào hành động trước đó — thì Odyssey-3 là mô hình duy nhất trong hai mô hình làm được điều đó, và nó cũng là mô hình bạn không thể mua. Đó là hình hài trung thực của cuộc đối đầu này trong tuần cả hai ra mắt: một mô hình mở mà bạn có thể tải về và một mô hình tương tác mà bạn chỉ có thể dùng thử, với bằng chứng benchmark nghiêng về mô hình đóng còn bằng chứng thực tế nghiêng về mô hình mở.
