Một thẻ tiêu đề được tạo ghi 'Kandinsky 6.0 Video so với Alibaba Wan 2.7' với phụ đề 'Trọng số mở đối đầu với một bộ bốn mô hình'. Logo OrcaRouter nằm ở góc dưới cùng bên phải.
Guides & Insights

Kandinsky 6.0 Video vs Alibaba Wan 2.7: Trọng số mở đối đầu với bộ bốn mô hình

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Kandinsky 6.0 Video cho bạn một checkpoint 29 tỷ tham số để tải về, và đổi lại là một clip năm giây. Wan 2.7 cho bạn bốn biến thể chuyên biệt cho từng tác vụ, clip dài tới mười lăm giây, cùng một hóa đơn tính theo từng giây. Hai câu đó chính là toàn bộ sự so sánh, và lý do nó đáng được viết ra là vì hầu hết các trang so sánh đối đầu đều đối chiếu hai bên ở chất lượng hình ảnh — nơi cả hai đều không có điểm số độc lập nào đủ để ngã ngũ — rồi bỏ qua đúng cái trục mà chúng thực sự rẽ khác nhau, tức là thứ mà mỗi bên kỳ vọng bạn mang tới.

Phòng thí nghiệm Kandinsky của Sber đã mở mã nguồn Kandinsky 6.0 Video trong tuần đầu tiên của tháng 10 năm 2026 theo giấy phép MIT, với hai kích cỡ — Pro ở 29B và Lite ở 3B — kèm mã nguồn, checkpoint và tích hợp diffusers. Wan 2.7 của Alibaba ra mắt ngày 3 tháng 4 năm 2026 dưới dạng một bộ công cụ: văn bản-thành-video, hình ảnh-thành-video, tham chiếu-thành-video và chỉnh sửa video, tính phí theo từng giây video được tạo. Một trong hai là mô hình bạn tự chạy; cái còn lại là dịch vụ bạn mua. Câu hỏi thú vị không phải là cái nào tốt hơn mà là cái nào có hình hài phù hợp với công việc.

Trục duy nhất mà ở đó chúng có thể được so sánh trực tiếp

Cả hai mô hình đều tạo video kèm âm thanh, chứ không phải video mà sau đó bạn mới gán nhạc. Điều đó hiếm hơn vẻ ngoài của nó, và đó là lý do hai mô hình này được nhắc đến cùng nhau — phần lớn lĩnh vực vẫn tạo ra một MP4 im lặng rồi để phần âm thanh cho một lượt xử lý riêng.

Kandinsky 6.0 Video thực hiện điều đó bằng CrossDiT hai luồng: một luồng video được khởi tạo từ checkpoint Kandinsky 5.0 Video, một luồng âm thanh được huấn luyện từ đầu trên các tập dữ liệu âm thanh lớn, và cơ chế cross-attention hai chiều kết nối chúng, được huấn luyện đồng thời sau một giai đoạn tiền huấn luyện liên tục. Đầu ra là âm thanh 44 kHz với khớp khẩu hình, từ một câu lệnh văn bản (T2AV) hoặc một ảnh tham chiếu (I2AV).

Wan 2.7 cũng tạo ra âm thanh gốc, nhưng không công bố cơ chế ở mức chi tiết tương tự. Tài liệu của chính hãng nêu chất lượng âm thanh và độ chính xác của văn bản trên màn hình là hai lĩnh vực vẫn cần cải thiện — một lưu ý về độ trung thực đáng để ghi nhớ, bởi vì chính nhà cung cấp nói điều đó, chứ không phải một người đánh giá đang phỏng đoán.

Đó là nơi sự tương đồng kết thúc. Mọi thứ bên dưới dòng này là sự khác biệt, không phải là một bảng xếp hạng.

Năm giây so với mười lăm giây, và điều đó tác động thế nào đến một danh sách cảnh quay

Kandinsky 6.0 Video được huấn luyện ở 121 khung hình, 24 fps — năm giây — và bản phát hành không có chế độ kéo dài. Bài báo, công thức phục vụ được hợp nhất vào vLLM-Omni, và bảng hiệu năng của kho lưu trữ đều được xây dựng xoay quanh độ dài clip duy nhất đó. Một tác phẩm ba mươi giây là sáu lần tạo và năm mối nối, và các mối nối là thứ bạn phải tự che giấu.

Wan 2.7 bao quát từ hai đến mười lăm giây trong một lần tạo, được quyết định theo từng yêu cầu. Đối với một clip talking-head, một cảnh chèn sản phẩm hay một động tác máy quay đơn lẻ, sự khác biệt đó không phải là một tiện ích — mà là sự khác biệt giữa một lần render và một bước dựng ghép. Với bất cứ thứ gì được dựng theo từng cảnh quay, năm giây là một đơn vị công việc bình thường và khoảng cách đó gần như biến mất.

• Clip tối đa — Kandinsky 6.0 Video: 5 giây, cố định, 121 khung hình ở 24 fps. Wan 2.7: 2–15 giây, đặt theo từng yêu cầu.

• Độ phân giải — Kandinsky 6.0 Video: SD, HD và Full HD (1920×1080) thông qua một mô hình siêu phân giải riêng biệt. Wan 2.7: lên đến 1080p.

• Điều kiện hóa tham chiếu — Kandinsky 6.0 Video: một hình ảnh, được áp dụng làm khung đuôi được mặt nạ hóa. Wan 2.7: tối đa năm hình ảnh chủ thể và năm clip tham chiếu, mười tài nguyên mỗi yêu cầu.

• Tác vụ — Kandinsky 6.0 Video: T2AV và I2AV. Wan 2.7: chuyển văn bản thành video, chuyển hình ảnh thành video, chuyển tham chiếu thành video và chỉnh sửa video dưới dạng các biến thể riêng biệt với tính phí riêng.

• Trọng số — Kandinsky 6.0 Video: MIT, có thể tải xuống, Pro và Lite. Wan 2.7: không.

Bốn nhiệm vụ so với hai chế độ

Số lượng tác vụ là phần của Wan 2.7 thường bị đánh giá thấp trong các bảng so sánh, bởi vì đó không phải là một tuyên bố về chất lượng — mà là một tuyên bố về phạm vi. Chỉnh sửa dựa trên hướng dẫn đối với cảnh quay hiện có, trong đó bạn mô tả một thay đổi và nhận lại đúng cảnh quay đó với thay đổi được áp dụng, là một dạng tác vụ mà Kandinsky 6.0 Video hoàn toàn không đảm nhận. Tham chiếu sang video, trong đó màn trình diễn được cung cấp điều khiển một chủ thể được tạo ra, cũng nằm ngoài hai chế độ của nó.

Cách tính phí của nó phản ánh phạm vi. Các biến thể text-to-video và image-to-video của Wan 2.7 chỉ tính phí dựa trên thời lượng đầu ra — $0.10/giây ở 720p và $0.15/giây ở 1080p trên các endpoint quốc tế tại Singapore, với Bắc Kinh và Tokyo niêm yết $0.086/giây và $0.143/giây cho cùng công việc. Biến thể reference-to-video cũng tính phí video đầu vào, giới hạn ở năm giây, vì vậy một tham chiếu năm giây tạo ra bản tạo mười lăm giây sẽ được tính phí cho hai mươi giây công việc. Biến thể video-edit chỉ tính phí đầu ra và coi đoạn phim đầu vào là miễn phí — đây là mức giá thuận lợi nhất trong dòng sản phẩm, và là lý do chỉnh sửa là nơi 2.7 thực sự rẻ.

Hai dữ kiện về vòng đời cần được đặt bên cạnh những con số đó. Alibaba đã gắn mức ưu đãi ra mắt 30% có thời hạn vào chính các nền tảng Bailian và Qwen Cloud của mình, và ưu đãi này đã hết hạn vào ngày 23 tháng 9 năm 2026. Riêng thông báo ngừng hoạt động của Model Studio thuộc Alibaba Cloud (ID 118434) sẽ đưa một số mô hình cũ hơn ngừng hoạt động vào ngày 10 tháng 10 năm 2026, và wan2.7-r2v cùng wan2.7-image nằm trong danh sách đó. Đây là việc ở cấp biến thể chứ không phải đóng hẳn cả thế hệ — wan2.7-t2v và wan2.7-i2v vẫn được niêm yết với mức giá còn hiệu lực — nhưng nếu reference-to-video chính là lý do bạn đang cân nhắc 2.7, thì con đường đó chỉ còn bốn ngày nữa.

Những gì các hội đồng độc lập cho thấy và không cho thấy

Đây là phần mà hầu hết các so sánh giữa hai mô hình này đều âm thầm gian lận, nên thật đáng để nói chính xác về những gì tồn tại.

Wan 2.7 có các điểm số độc lập trên ba bảng video riêng biệt của Artificial Analysis, và chúng không đồng nhất với nhau vì chúng đo lường những khía cạnh khác nhau:

• Text-to-video — Wan2.7-260612 (bản dựng tháng Sáu) đứng thứ 13–14 với Elo 1.030 (±9) sau 5.571 phiếu bầu, ở mức 9,00 USD/phút.

• Ảnh sang video — Wan 2.7 (bản dựng tháng Tư) đứng thứ 12 với Elo 1.077 (±8) qua 4.571 phiếu bầu, ở mức $9,00/phút.

• Chỉnh sửa video — Wan 2.7 đứng thứ 5 với Elo 1.077 (±5) qua 17.988 phiếu bầu, ở mức $16,90/phút.

Đọc ba điều đó cùng nhau, kết luận hữu ích không phải là “Wan 2.7 đứng thứ mười hai ở video”. Mà là mô hình này mạnh hơn rõ rệt ở khả năng chỉnh sửa so với tạo sinh, trên các bảng được xây dựng cho từng loại, và rằng việc trích dẫn một con số duy nhất cho nó là một sai lầm theo cả hai hướng.

Kandinsky 6.0 Video không có điểm số nào trên bất kỳ bảng nào trong số đó. Bằng chứng được công bố của nó đến từ phía nhà cung cấp, và đáng để nói rõ chính xác đó là gì: một lần chạy VABench trong đó phòng thí nghiệm báo cáo Pro dẫn đầu về chất lượng giọng nói, thẩm mỹ âm thanh, căn chỉnh văn bản-video và âm thanh-video, độ chính xác đồng bộ môi, mất đồng bộ và độ chân thực thị giác trong số ba hệ thống được đánh giá — hai hệ thống còn lại là mô hình Lite của chính họ và LTX 2.5 — cùng một đánh giá con người song song do phòng thí nghiệm thực hiện với khoảng 200 hoặc hơn so sánh từng cặp theo mỗi tiêu chí, trong đó Pro cạnh tranh được với Kling 2.6 và Veo 3.1 Fast, kém hơn MiniMax H3 và Dreamina Seedance 2.0 ở các tiêu chí thị giác, và vẫn cạnh tranh ở chất lượng giọng nói và đồng bộ âm thanh-video. Không có phần nào trong đó được tái lập bên ngoài Sber, và không phần nào là Elo trên một bảng công khai mù. Cách hiểu đúng là "đầy hứa hẹn nhưng chưa được thẩm định", không phải "ngang tầm Veo".

Mỗi thứ tốn bao nhiêu, được nêu theo cách diễn đạt mà mỗi bên sử dụng.

Hai mô hình định giá không thể được rút gọn thành một con số, và giả vờ điều ngược lại chính là cách các nhóm đưa ra một quyết định sai lầm.

Wan 2.7 tính theo mức giá mỗi giây. Một clip 1080p dài mười lăm giây khoảng $2,25. Một tác phẩm ba mươi giây là hai lần tạo sinh cộng với một lần chỉnh sửa — $4,50 cho phần tạo sinh thô cộng thời gian dựng của bạn, hoặc ít hơn nếu biến thể chỉnh sửa đảm nhiệm công việc, vì nó không tính phí đầu vào.

Kandinsky 6.0 Video hoàn toàn không có mức giá nào, bởi vì không có dịch vụ nào để mua. Cái nó có là chi phí GPU-giờ do bạn tự cung cấp. Các con số của chính kho lưu trữ đặt ra mức sàn: một clip Pro Full HD năm giây tốn khoảng 402 giây thời gian xử lý trên H100 sau khi khởi động, 854 trên RTX 5090 và 1.247 trên RTX 4090. Checkpoint chưng cất — thứ mà bài báo đo được là ngang bằng với mô hình đầy đủ, tỷ lệ ưu tiên trung bình 51% so với 49%, không tiêu chí nào đạt độ ý nghĩa — mới là cái bạn thực sự sẽ đưa vào phục vụ. Bất cứ thứ gì dưới 72,8 GiB phân bổ đỉnh đều cần offload theo khối, và preset 16 GB lượng tử hóa bộ mã hóa văn bản sang NF4, mà bài báo xác nhận là thay đổi preset duy nhất làm biến đổi chính clip.

Nói thẳng ra: chi phí của Wan 2.7 là một dòng trên hóa đơn mà bạn có thể dự báo được. Chi phí của Kandinsky 6.0 Video là một cỗ máy bạn sở hữu, một lần render mất vài phút cho mỗi năm giây, và tùy chọn — không phải nghĩa vụ — để tinh chỉnh.

Nơi một router nằm trong này

OrcaRouter không cung cấp Kandinsky 6.0 Video lẫn Alibaba Wan 2.7, và ở đây cũng không đưa ra tuyên bố nào như vậy. Kandinsky là thứ bạn tự tải về và chạy; Wan 2.7 thì được truy cập qua các nền tảng của chính Alibaba. Điều mà một pipeline dựng trên một trong hai mô hình cần ở một router chính là lớp văn bản bao quanh khâu render: việc mở rộng prompt để biến mô tả cảnh quay thành chú thích dài hoặc ngắn mà các mô hình này được huấn luyện, phần xử lý chú thích và hội thoại cấp dữ liệu cho lượt image-to-video, và các bản tóm tắt đánh giá để quyết định bản tạo nào trong số nhiều bản là bản đáng giữ. Đó đều là những lệnh gọi văn bản thông thường, và chúng chạy trên một endpoint tương thích OpenAI trên hơn 200 mô hình với giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, nên một đợt giảm giá từ nhà cung cấp sẽ có hiệu lực ngay trong ngày thay vì phải chờ hết một chu kỳ hợp đồng. Chuyển đổi dự phòng tự động ở đây đáng giá hơn so với một khối lượng công việc chat, bởi vì một lệnh gọi tạo chú thích thất bại ở phút thứ tư của một phiên hỏi đáp nên được định tuyến lại thay vì làm mất bản render.

Quyết định, mỗi mục một dòng

Nếu sản phẩm bàn giao là một clip hoàn chỉnh có âm thanh và bạn không muốn phải sở hữu GPU, thì Wan 2.7 là cái duy nhất trong hai cái mang lại cho bạn điều đó, và biến thể chỉnh sửa của nó là thứ mạnh nhất trong dòng sản phẩm dựa trên bằng chứng hiện có. Hãy kiểm tra việc ngừng cung cấp ngày 10 tháng 10 trước khi cam kết dùng reference-to-video.

Nếu sản phẩm bàn giao là một pipeline bạn kiểm soát, nếu các đơn vị năm giây phù hợp với danh sách cảnh quay của bạn, và nếu bạn muốn tinh chỉnh hoặc chạy ngoại tuyến, thì Kandinsky 6.0 Video là cái duy nhất trong hai cái cho phép điều đó — với cái giá là khâu render chậm trên phần cứng tiêu dùng và một tuyên bố về chất lượng vẫn hoàn toàn thuộc về chính phòng thí nghiệm. Sự kiện đáng để theo dõi ở phía đó rất đơn giản: một Elo.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Alibaba Wan 2.7 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Tasks: text and image to AV', 'Reference input: one image', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Alibaba Wan 2.7 column reads 'Max clip: 2 to 15s', 'Resolution: up to 1080p', 'Tasks: four variants', 'Reference input: ten assets', 'Weights: none', 'Price: $0.10 to $0.15/s'. A footer reads 'Kandinsky figures vendor-reported; Wan pricing per Alibaba. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

Có một sự bất đối xứng đáng được gọi tên trước khi khép lại, bởi nó sẽ tồn tại lâu hơn cả hai mô hình. Mức trần của Wan 2.7 là do Alibaba đặt ra về mặt hợp đồng lẫn kỹ thuật — khi các biến thể trong bộ sản phẩm bị ngừng cung cấp hoặc đổi giá, pipeline của bạn sẽ thừa hưởng quyết định đó. Mức trần của Kandinsky 6.0 Video nằm ở chính phần cứng của bạn, và giấy phép MIT nghĩa là một bản fork có thể tồn tại lâu hơn lộ trình của phòng thí nghiệm. Những đội từng bị tổn thất vì một mô hình biến mất khỏi danh mục thường đánh giá mức khác biệt đó nặng hơn hẳn sau một năm so với ngày họ đưa ra lựa chọn.

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.