Thẻ tiêu đề cho một bài viết so sánh Kandinsky 6.0 Video và đối thủ được nêu tên của nó, với phụ đề “Phiên bản trong bài báo không phải phiên bản bạn mua”, cùng ba nhãn hỗ trợ lấy từ chính bằng chứng của bài viết.
Engineering & Research

Kandinsky 6.0 Video so với Seedance 2.5: Phiên bản trong bài báo không phải là phiên bản bạn mua

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Câu được trích dẫn nhiều nhất trong màn so tài này là một phép so sánh với sai mô hình. Báo cáo kỹ thuật Kandinsky 6.0 Video, được công bố ngày 6 tháng 10 năm 2026 cùng với việc MIT phát hành trọng số, đánh giá so với Dreamina Seedance 2.0 — thế hệ trước. Seedance 2.5, mô hình video và âm thanh hiện tại của ByteDance, đã được phát hành từ ngày 31 tháng 7 năm 2026 và chính là bản đang được bán. Vậy nên khi báo cáo kết luận rằng Seedance "được ưa thích hơn trên các tiêu chí hình ảnh, với mức chênh lệch có ý nghĩa thống kê về chất lượng hình ảnh tổng thể, lỗi hình ảnh, độ chân thực chuyển động, và khả năng tuân theo prompt hình ảnh," thì nó đang mô tả một bản dựng mà bạn không thể cấp phép ngày hôm nay, được đánh giá bởi phòng thí nghiệm đã viết Kandinsky 6.0 Video. Cả hai nửa của câu đó đều quan trọng, và không nửa nào là lý do để bỏ qua phép so sánh — khoảng cách phiên bản đặt ra giới hạn dưới cho mức độ nó có thể cho bạn biết, còn cách định khung cho bạn biết nên tin ai về điều gì.

Có gì thay đổi giữa hai phiên bản Seedance

Bước nhảy từ 2.0 lên 2.5 không phải là một màn sơn lại, và đó chính là lý do việc thay thế này không hề mang tính hình thức bề ngoài. Seedance 2.5 tạo ra tối đa ba mươi giây trong một lần chạy — gấp sáu lần phạm vi của mô hình trong báo cáo, và gấp sáu lần con số năm giây cố định của Kandinsky 6.0 Video. Nó bổ sung khả năng nhắm mục tiêu ở cấp mốc thời gian và chỉnh sửa hậu kỳ ở cấp vùng, nghĩa là có thể áp dụng thay đổi cho một khoảng của clip hoặc một phần của khung hình thay vì phải tạo lại toàn bộ. Nó đọc văn bản cùng với khoảng ba mươi hình ảnh, mười video và mười clip âm thanh làm tài liệu tham chiếu trong một yêu cầu, so với chỉ một khung hình đuôi được mặt nạ duy nhất của Kandinsky 6.0 Video. Và nó tạo ra âm thanh đồng bộ với lời thoại, đây là lý do duy nhất khiến cặp đôi này cùng nằm trong một bài viết.

Mỗi một trong số đó là một năng lực mà phần đánh giá của báo cáo không kiểm tra. Do đó, kết quả theo tiêu chí hình ảnh cho bạn biết rằng Kandinsky 6.0 Video đã kém hơn thế hệ trước của Seedance về chất lượng hình ảnh tổng thể, các lỗi hình ảnh (artefacts), độ chân thực của chuyển động và khả năng bám sát câu lệnh. Nó không cho bạn biết bản dựng hiện tại sẽ làm được gì, và giả định trung thực là một thế hệ mới hơn không trở nên tệ hơn trên những khía cạnh mà ghi chú phát hành của chính nó nhấn mạnh.

Điều mà đánh giá của chính báo cáo xác lập được và không xác lập được

Phương pháp được trình bày đủ kỹ để có thể cân nhắc. Các cặp song song được tạo từ cùng một lời nhắc bởi hai mô hình, cả hai clip đều được ẩn danh, vị trí trái/phải được ngẫu nhiên hóa theo từng nhiệm vụ, thứ tự nhiệm vụ được xáo trộn, âm thanh ban đầu bị tắt đối với các câu hỏi thị giác và sau đó được bật đối với các câu hỏi âm thanh, một tùy chọn hòa đối xứng và một tùy chọn N/A rõ ràng khi không thể đánh giá một tiêu chí, tổng hợp theo đa số phiếu giữa các người gán nhãn, và khoảng 200 hoặc nhiều hơn các so sánh theo cặp cho mỗi tiêu chí được đánh giá.

Với phương pháp đó, kết quả của Seedance 2.0 phân tách theo cách mà bất kỳ ai từng đọc phần so sánh với Kling trong cùng báo cáo cũng sẽ thấy quen thuộc. Các tiêu chí hình ảnh nghiêng về Seedance với mức chênh lệch vượt ngưỡng ý nghĩa. Ở lĩnh vực âm thanh thì sát hơn nhiều: đồng bộ âm thanh-hình ảnh gần như ngang bằng, còn chất lượng giọng nói nghiêng về Kandinsky 6.0 Video Pro. Giữa hai nhận định đó là toàn bộ quyết định, bởi nó có nghĩa là checkpoint audio-video mở mới nhất đang tụt lại một cách đo lường được ở việc clip trông như thế nào và vượt lên một cách đo lường được ở việc giọng nói trong đó nghe ra sao.

Những giới hạn đối với kết quả đó là những giới hạn thông thường, và không hạn chế nào trong số đó đủ sức đánh đổ nó. Nó được các tác giả của Kandinsky chạy trên các prompt do họ tự chọn, với những người gán nhãn do họ tuyển dụng. Không có đấu trường mù công khai nào chấm điểm Kandinsky 6.0 Video cả, nên chưa có bên ngoài nào kiểm chứng liệu prompt của một người lạ có tái tạo được sự phân tách đó hay không. Báo cáo cũng tiết lộ mức trần mà nó đang đo lường so với: các clip dài tối đa năm giây, tạo cơ bản ở độ phân giải SD với Full HD đạt được qua một công đoạn siêu phân giải, và một khoảng cách còn tồn tại so với các hệ thống độc quyền mạnh nhất về chất lượng hình ảnh và chất lượng âm thanh tổng thể.

Ba khoảng trống mang tính cấu trúc mà không một benchmark nào có thể nắm bắt được

Thời lượng là yếu tố đầu tiên và thẳng thừng nhất. Kandinsky 6.0 Video được huấn luyện và đánh giá ở 121 khung hình, chạy suy luận ở 121 khung hình, 5 giây ở 24 fps, và không có chế độ kéo dài — một tác phẩm ba mươi giây là sáu lần tạo, năm mối nối, và rủi ro về tính liên tục do bạn tự chịu. Seedance 2.5 làm ba mươi giây trong một lượt. Đối với một đoạn đối thoại đơn lẻ, một bản giới thiệu sản phẩm, hoặc bất cứ thứ gì mà mối nối sẽ lộ ra, đó không phải là khác biệt về điểm chuẩn; đó là khác biệt ở chỗ công việc là một lần kết xuất hay một bước ghép nối.

Thứ hai là điều kiện hóa bằng tham chiếu, và sự bất đối xứng lộ rõ. Kandinsky 6.0 Video nhận một ảnh tham chiếu và áp dụng nó như một khung đuôi được mặt nạ hóa — một keyframe để nội suy hướng tới. Seedance 2.5 nhận một tập làm việc gồm khoảng ba mươi ảnh, mười clip video và mười clip âm thanh như một ngữ cảnh. Tính nhất quán nhân vật xuyên suốt một chuỗi, chuyển phong cách từ một mood board, một màn trình diễn mang vào từ một clip sẵn có: đó là những khối lượng công việc mà số lượng tham chiếu cho phép và chế độ một khung hình không cố gắng thực hiện.

Điều thứ ba là khả năng chỉnh sửa, và đây mới là yếu tố thay đổi cả một quy trình làm việc chứ không chỉ một cảnh quay đơn lẻ. Chỉnh sửa ở cấp vùng và cấp mốc thời gian nghĩa là một cửa sổ ba giây bị lỗi được sửa ngay tại chỗ. Kandinsky 6.0 Video không có bề mặt chỉnh sửa nào — năm giây hỏng phải được tạo lại, và nếu nó đã được ghép với bốn đoạn khác thì các mối ghép cũng phải được xem xét lại. Các nhóm đang tính toán chi phí cho thói quen render lại nên tính luôn khác biệt đó vào lựa chọn mô hình ngay từ đầu, thay vì để rồi mới phát hiện ra.

• Thời lượng — Kandinsky 6.0 Video: cố định 5 giây, 121 khung hình ở 24 fps, không có chế độ gia hạn. Seedance 2.5: tối đa 30 giây trong một lần chạy.

• Điều kiện hóa tham chiếu — Kandinsky 6.0 Video: một hình ảnh, được áp dụng làm khung đuôi được mặt nạ hóa. Seedance 2.5: khoảng ba mươi hình ảnh, mười video và mười clip âm thanh mỗi yêu cầu.

• Chỉnh sửa — Kandinsky 6.0 Video: không có; tạo lại và ghép lại. Seedance 2.5: nhắm mục tiêu theo mốc thời gian và chỉnh sửa theo vùng sau khi tạo.

• Độ phân giải — Kandinsky 6.0 Video: SD ở 512×768, Full HD 1920×1080 thông qua một bước siêu phân giải tích hợp sẵn. Seedance 2.5: tùy thuộc vào chế độ, với giá mỗi clip được xác định bởi độ phân giải bạn chọn.

• Âm thanh — Kandinsky 6.0 Video: 44 kHz với đồng bộ khẩu hình, được tạo đồng thời với hình ảnh. Seedance 2.5: âm thanh đồng bộ bao gồm lời thoại, được tạo cùng với video.

• Trọng số — Kandinsky 6.0 Video: MIT, Lite 3B và Pro 29B, với mã nguồn và tích hợp diffusers. Seedance 2.5: không.

Hai mét không thể chuyển đổi lẫn nhau

Seedance 2.5 được tính theo token, với mức khoảng $0.51 cho một clip năm giây ở 480p và khoảng $1.16 ở 720p. Lý do phải diễn đạt như vậy thay vì theo mức giá mỗi giây là số lượng token tỷ lệ với lượng cảnh quay, nên một lần tạo ba mươi giây không phải là ba mươi giây ở một mức giá cố định — mà là gấp sáu lần số token của một lần năm giây với cùng thiết lập, và các thao tác chỉnh sửa được tính giá dựa trên phần chúng tác động đến. Một pipeline thường xuyên tạo lại sẽ thấy đồng hồ đo phản ứng với thói quen đó.

Kandinsky 6.0 Video không có đồng hồ đo vì không có gì để mua. Chi phí của nó là một cỗ máy và một chiếc đồng hồ, và báo cáo cung cấp chiếc đồng hồ: khoảng 402 giây thời gian làm việc trên H100 cho một clip Pro Full HD năm giây, 854 trên RTX 5090, 1.247 trên RTX 4090, cần block offloading nếu mức phân bổ đỉnh dưới 72,8 GiB, và một preset VRAM 16 GB lượng tử hóa text encoder thành NF4 — thay đổi preset duy nhất mà báo cáo nói là làm thay đổi chính clip. Checkpoint chưng cất, được đo ngang bằng với mô hình đầy đủ ở mức ưu tiên trung bình 51% so với 49% mà không có tiêu chí nào đạt ý nghĩa thống kê, chính là thứ khiến những con số đó trở nên khả thi.

• Chi phí mỗi năm giây — Kandinsky 6.0 Video: không có giá niêm yết; từ sáu đến hai mươi mốt phút của một GPU tùy thuộc vào card. Seedance 2.5: khoảng $0.51 ở 480p và $1.16 ở 720p tính bằng token.

Không có gì trong hai dòng đó là có thể so sánh tương xứng với nhau, và nỗ lực thông thường nhằm quy chúng về một con số duy nhất — chia đơn giá GPU-giờ cho các clip năm giây — đang ngầm giả định mức sử dụng tối đa, không có thời gian nhàn rỗi và việc bạn đã sở hữu card. Phép so sánh hữu ích hơn mang tính định tính: chi phí của Seedance 2.5 tỉ lệ với lượng bạn tạo ra và biến mất khi bạn dừng lại; chi phí của Kandinsky 6.0 Video thì phát sinh dù bạn có tạo ra hay không.

Two-column scoreboard comparing Kandinsky 6.0 Video and Seedance 2.5 across six shared dimensions, with the vendor-vs-third-party sourcing line printed along the bottom.

Nơi có thể tiếp cận được từng cái một

Cả hai mô hình đều không có trên OrcaRouter, và không có tuyên bố nào như vậy được đưa ra. Seedance 2.5 được truy cập thông qua các nền tảng riêng của nhà cung cấp và một số dịch vụ bên thứ ba; Kandinsky 6.0 Video là một checkpoint bạn tải xuống theo giấy phép MIT và chạy trên phần cứng của riêng bạn. Bất kỳ trang nào nói với bạn rằng cả hai chỉ cách một lệnh gọi API trên một nền tảng đa mô hình đều đang mô tả những mô hình khác nhau.

Lý do một lớp định tuyến vẫn đáng được nhắc đến trong một pipeline Kandinsky hay Seedance là các hệ thống này chủ yếu là văn bản nếu tính theo số lượt gọi và là video nếu tính theo chi phí. Việc mở rộng prompt biến một ghi chú cảnh quay thành caption dài có cấu trúc mà một mô hình T2AV mong đợi. Lời thoại được phác thảo trước khi một lượt lip-sync thử xử lý nó, và được viết lại khi lượt đó làm hỏng nó. Sáu phương án sinh ứng viên cho cùng một nhịp được xem xét và một được chọn — một phán đoán bằng văn bản về một sản phẩm video, đây là cách rẻ nhất để đưa ra quyết định tốn kém một cách chính xác. Trên một endpoint OpenAI-compatible duy nhất trên hơn 200 mô hình với giá niêm yết của nhà cung cấp được chuyển nguyên cùng mức cộng thêm 0%, những lượt gọi đó tốn đúng bằng mức nhà cung cấp tính và không hơn, kể cả vào ngày sau khi một nhà cung cấp thay đổi biểu giá. DSL định tuyến khẳng định được chỗ đứng của nó khi bên đánh giá rẻ và bên đánh giá kỹ lưỡng nên là những mô hình khác nhau tại cùng một vị trí gọi, và cơ chế chuyển đổi dự phòng tự động cũng đáng có chỗ vì một caption bị hỏng trong khi clip thứ tư trong số sáu đang render nên được định tuyến lại thay vì kết thúc phiên.

Điều gì sẽ làm thay đổi cặp đấu này?

Khoảng cách phiên bản chính là toàn bộ câu chuyện, và cũng là con đường ngắn nhất để giải quyết nó. Một lần chạy Seedance 2.5 đối đầu với Kandinsky 6.0 Video sẽ phân định được liệu những điểm thua kém về tiêu chí hình ảnh mà báo cáo ghi nhận so với 2.0 đã mở rộng, thu hẹp hay đảo ngược — báo cáo không thể trả lời điều đó, và các tác giả của nó cũng không có cách nào để trả lời. Hiện tại, lập trường có thể bảo vệ được còn hẹp hơn điều mà hoạt động marketing của cả hai bên mong muốn: dựa trên bằng chứng do chính phòng thí nghiệm của mô hình công bố, Seedance dẫn trước về việc clip trông như thế nào, còn Kandinsky 6.0 dẫn trước về việc lời thoại trong clip nghe ra sao, và phiên bản Seedance mà nhận định đó dựa vào lại đi sau một thế hệ so với phiên bản bạn sẽ mua.

Hãy chọn cho phù hợp. Nếu công việc dài, nặng về tài liệu tham chiếu hoặc thiên về chỉnh sửa, thì những khoảng trống cấu trúc sẽ quyết định trước cả khi chất lượng xuất hiện. Nếu công việc là một cảnh nói chuyện năm giây, nơi lời thoại phải nghe đúng ngay lần đầu, thì lợi thế đo lường được của Kandinsky 6.0 Video nằm chính ở tiêu chí đó — và giấy phép MIT nghĩa là câu trả lời không phụ thuộc vào lộ trình của bất kỳ ai. Điều cần để mắt tới không phải một bảng xếp hạng. Mà là một lần chạy lại của phép so sánh mà báo cáo chưa từng có thể thực hiện.

Screenshot of the arXiv abstract page for paper 2610.05608, "Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation", showing the 4 October 2026 submission date and the abstract, including the listed limitations that the models generate clips of up to 5 seconds and that base generation runs at SD resolution with Full HD obtained through super-resolution.Screenshot of the Hugging Face model card for kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers, showing the MIT licence and the family description - Kandinsky 6.0 Video Lite at 3B parameters and Pro at 29B, generating 5-second clips with synchronized 44 kHz audio in T2AV and I2AV modes.

Cách rẻ nhất để thực hiện lời gọi đắt đỏ một cách chính xác: một DSL định tuyến cho phép hoán đổi trình đánh giá theo từng giai đoạn, cùng cơ chế chuyển đổi dự phòng tự động để một caption hỏng không khiến đoạn clip phải trả giá.