Một thẻ tiêu đề được tạo tự động ghi 'Kandinsky 6.0 Video vs Grok Imagine Video' cùng phụ đề 'Bảng xếp hạng đã đảo chiều', phía trên một hàng biểu tượng được dán nhãn 'Tạo Video', 'Âm thanh đồng bộ' và 'Triển khai trọng số mở'. Logo OrcaRouter nằm ở góc dưới cùng bên phải.
Guides & Insights

Kandinsky 6.0 Video vs Grok Imagine Video: Bảng xếp hạng đã đảo chiều

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào tháng 1 năm 2026, khi Grok Imagine Video ra mắt, nó đứng đầu đấu trường video của Artificial Analysis ở cả hai chế độ. Hôm nay, cùng bảng xếp hạng đó đặt bản dựng hiện tại của nó ở vị trí thứ mười một hoặc mười hai trong text-to-video. Đó không phải là một t và cũng không phải là thất bại — đó là điều xảy ra với một hạng mục chuyển động nhanh trong một năm, và đó là lý do trung thực để so sánh mô hình tạo sinh của xAI với Kandinsky 6.0 Video ngay lúc này. Một trong số chúng là dịch vụ được tối ưu cho việc bạn có thể tạo thêm một clip nhanh đến mức nào; cái còn lại là một checkpoint được cấp phép MIT, 29B tham số ở kích thước Pro và 3 ở bản Lite, do Kandinsky Lab của Sber phát hành trong tuần đầu tiên của tháng 10 năm 2026, tạo ra năm giây video với âm thanh 44 kHz đồng bộ và khớp khẩu hình. Câu hỏi thú vị không phải là cái nào đang dẫn đầu trên một bảng xếp hạng — mà là mỗi cái có thể làm gì tiếp theo về mặt cấu trúc.

Tấm ván đã di chuyển bên dưới nó

Grok Imagine Video là mô hình tạo sinh của xAI, phát hành lần đầu vào ngày 29 tháng 1 năm 2026 và ổn định ở phiên bản 1.5 kể từ ngày 16 tháng 6. Trên bảng xếp hạng text-to-video của Artificial Analysis, bản 1.5 của nó đứng thứ 11–12 với Elo 1.045 (±9) trên 4.056 lượt bình chọn, được niêm yết ở mức 15,00 đô la Mỹ mỗi phút. Bản gốc không có trên bảng xếp hạng đó.

Tạo video từ ảnh là nơi dòng sản phẩm này mạnh hơn, và cũng là nơi hai bản dựng tách biệt theo một cách đáng để đọc kỹ:

• grok-imagine-video-1.5 — hạng 7–9, Elo 1.098 (±8), 5.267 lượt bình chọn, 8,40 USD/phút.

• grok-imagine-video (bản dựng tháng Một) — hạng 12–17, Elo 1.072 (±7), 14.371 phiếu, 4,20 USD/phút.

• Để so sánh, vị trí dẫn đầu của bảng I2V đó — MiniMax H3 Max — đạt Elo 1.195 (±9) qua 5.894 phiếu bầu, còn Wan 3.0 đứng thứ sáu với 1.164.

Hai cách đọc sau đây, và cả hai đều đúng. Bản dựng mới hơn của xAI thực sự vượt qua chính phiên bản tiền nhiệm của nó ở mảng chuyển hình ảnh thành video, với mức chênh 26 Elo, và để làm được điều đó, nó tốn gấp đôi chi phí mỗi phút. Còn câu chuyện trong tuần ra mắt — một mô hình đã xuất hiện ở vị trí dẫn đầu — đã không trụ được: bối cảnh đã thay đổi, đấu trường đã tích lũy hàng chục nghìn lượt bình chọn trải khắp hàng tá hệ thống mới hơn, và vị trí tầm trung là nơi chín tháng cạnh tranh đặt một trình tạo nhanh, đa dụng.

Kandinsky 6.0 Video không có Elo trên bất kỳ bảng xếp hạng nào. Bằng chứng của nó là một lần chạy VABench và một đánh giá do con người thực hiện trong phòng thí nghiệm, cả hai đều do Sber công bố, không có cái nào được tái lập bên ngoài Sber. Đặt một mô hình mở chưa được kiểm toán bên cạnh một mô hình thương mại đã được chấm điểm chính là kiểu so sánh cần được xử lý cẩn trọng: vị thế của mô hình đã được chấm điểm là có thật và không mấy tốt đẹp, còn vị thế của mô hình chưa được chấm điểm thì chưa biết. “Chưa biết” không phải là “tốt hơn”.

Hai kiểu nhanh, và chỉ một trong số đó được đo bằng giây.

Mục tiêu thiết kế của Grok Imagine Video là năng suất trên mỗi nhà sáng tạo. Nó được tích hợp trực tiếp vào X, trả về một clip hoàn chỉnh có âm thanh, và bộ tính năng của nó giống như một danh sách những việc người ta thực sự làm trên bảng tin: nhiều tỷ lệ khung hình, chuyển động camera, thêm, xóa và hoán đổi đối tượng, chuyển đổi phong cách, tạo sinh có điều kiện tham chiếu từ nhiều hình ảnh để đảm bảo tính nhất quán của nhân vật, âm thanh gốc với lời thoại, hiệu ứng và nhạc. Độ dài clip lên tới mười lăm giây, độ phân giải tối đa là 1080p. Toàn bộ sản phẩm được xây dựng sao cho lần thử thứ hai chỉ tốn của bạn vài phút và vài xu.

Kandinsky 6.0 Video nhanh theo một nghĩa khác — không phải trên mỗi lần thử, mà trên mỗi đơn vị sở hữu. Không có gì về nó là tức thời. Thời gian làm việc của chính kho lưu trữ đối với mô hình không chưng cất, sau khi khởi động và không tính việc tải trọng số lẫn mã hóa MP4, đặt một clip Pro Full HD dài năm giây ở khoảng 402 giây trên H100, 854 trên RTX 5090, 1.000 trên 4090 và 3.530 trên RTX 5060 Ti. Lite Full HD là 284 giây trên H100. Công cụ khiến điều đó trở nên dễ chịu hơn là checkpoint đã chưng cất, thứ mà bài báo đo được là ngang bằng với mô hình đầy đủ — được ưa thích hơn hoặc hòa ở phần lớn các tiêu chí, tỷ lệ ưa thích trung bình 51% so với 49%, không có khác biệt riêng lẻ nào đạt mức ý nghĩa. Thứ bạn nhận được để đổi lấy việc render chậm là một mô hình trên đĩa của chính mình, không hề có đồng hồ tính theo từng clip nào chạy cả.

Đó mới là hình hài thật sự của cuộc đối đầu này. Grok Imagine Video tối ưu hóa chi phí cho lần thử thứ mười. Kandinsky 6.0 Video tối ưu hóa chi phí cho lần thử thứ mười nghìn, và bắt bạn trả bằng phần cứng cùng sự kiên nhẫn cho lần đầu tiên.

Cả hai đều tạo ra âm thanh — và chúng là cùng một tuyên bố

Đây là trục mà một so sánh hời hợt sẽ nói "hòa" và sai.

Grok Imagine Video tạo ra âm thanh gốc với lời thoại, hiệu ứng và nhạc như một trong nhiều tính năng. Đây là một công cụ tạo sinh đa dụng mà tình cờ có kèm cả âm thanh.

Kandinsky 6.0 Video được xây dựng xoay quanh âm thanh. Kiến trúc là CrossDiT hai luồng, ghép một luồng video được khởi tạo từ Kandinsky 5.0 Video với một luồng âm thanh được huấn luyện từ đầu trên các kho ngữ liệu âm thanh lớn, kết nối bằng cross-attention hai chiều và được huấn luyện chung. Đầu ra là 44 kHz với đồng bộ khẩu hình rõ ràng, và giai đoạn học tăng cường của bài báo được báo cáo là cắt giảm 47% tỷ lệ lỗi từ của giọng nói được tạo — đo bằng Whisper-large-v3, một trong các mô hình thưởng của RL, một chi tiết đáng lưu ý vì bài báo báo cáo thêm một WER thứ hai, không thể so sánh, song song với VABench bằng Qwen3-ASR-1.7B. Giọng nói chính là thứ mà mô hình được hậu huấn luyện trên đó.

Ngược lại, nghiên cứu của chính Sber lại thẳng thắn về những điểm mà nó thua kém. Trong đánh giá so sánh song song của phòng thí nghiệm, MiniMax H3 và Dreamina Seedance 2.0 được ưa thích hơn ở các tiêu chí hình ảnh với khoảng cách đáng kể, và mô hình này được mô tả là có sức cạnh tranh thay vì dẫn trước. Tuyên bố đáng được xem xét nghiêm túc thì hẹp hơn và hữu ích hơn: so với Kling 2.6 và Veo 3.1 Fast, kết quả so kè theo từng tiêu chí, và Kandinsky 6.0 Video vẫn cạnh tranh về chất lượng giọng nói và đồng bộ âm thanh-hình ảnh, nơi phần lớn các so sánh là hòa.

Mười lăm giây so với năm giây, và cái giá phải trả để đạt được từng thứ

• Clip tối đa — Grok Imagine Video: tối đa 15 giây. Kandinsky 6.0 Video: cố định 5 giây, 121 khung hình ở 24 fps, không có chế độ kéo dài trong bản phát hành.

• Độ phân giải — Grok Imagine: lên đến 1080p. Kandinsky 6. Video: SD, HD và Full HD thông qua một mô hình siêu phân giải chuyên dụng, nâng cấp x2, x4 hoặc x2.25 cho các clip dài năm giây.

• Đầu vào tham chiếu — Grok Imagine Video: tạo có điều kiện tham chiếu từ một số hình ảnh để đảm bảo tính nhất quán của nhân vật, cùng với thêm/xóa/hoán đổi đối tượng. Kandinsky 6.0 Video: một hình ảnh, được áp dụng làm khung đuôi được mặt nạ hóa.

• Bảng giá — Grok Imagine Video: tính theo mỗi giây đầu ra, từ mức thấp nhất của khung giá lên tới $0,30/giây ở 1080p, cộng thêm phí cho mỗi ảnh đầu vào; quyền truy cập miễn phí chỉ có được qua các gói đăng ký X. Kandinsky 6.0 Video: không có — không dịch vụ, không mức giá, chỉ có thời gian GPU do bạn cung cấp.

• Trọng số — Grok Imagine Video: không. Kandinsky 6.0 Video: MIT, Pro và Lite, với tích hợp diffusers.

Mức phụ trội cho bản Grok mới hơn chính là con số cần khoanh tròn. Đi từ bản tháng 1 lên bản 1.5 tốn gấp đôi chi phí mỗi phút trên bảng xếp hạng image-to-video và mang lại 26 Elo. Đó là một cải thiện thực sự với một cái giá thực sự, và đó cũng là sự đánh đổi tương tự mà mọi nhà cung cấp video đang yêu cầu người mua thực hiện ngay lúc này.

Bộ định tuyến phù hợp ở đâu và không phù hợp ở đâu

OrcaRouter không cung cấp Grok Imagine Video hay Kandinsky 6.0 Video, và không có nội dung nào ở đây tuyên bố điều ngược lại: Kandinsky thì bạn tự tải về và chạy, còn Grok Imagine Video được truy cập thông qua chính các nền tảng của xAI. Điều mà một pipeline được xây dựng trên một trong hai mô hình này cần ở một router là phần văn bản bao quanh bản render — danh sách cảnh quay, việc mở rộng prompt để biến một ý tưởng thành chú thích dài hoặc ngắn mà các mô hình này được huấn luyện trên đó, công việc tạo chú thích và phiên âm, cùng các bản tóm tắt đánh giá để quyết định giữ lại bản tạo nào. Những việc đó chạy trên một endpoint tương thích OpenAI với hơn 200 mô hình văn bản theo giá niêm yết của nhà cung cấp với mức tăng giá 0%, nên một bản phát hành từ nhà cung cấp sẽ hoạt động trên cùng key ngay khi nó ra mắt, với tính năng chuyển đổi dự phòng tự động để một cuộc gọi thất bại giữa hàng đợi render được định tuyến lại thay vì làm đình trệ cả lô. Việc điều phối xung quanh một mô hình video là một bài toán định tuyến ngay cả khi bản thân mô hình video không thể định tuyến, và đó là trường hợp của cả hai mô hình này hiện nay.

Cái nào, và để làm gì

Hãy chọn Grok Imagine Video khi công việc cần đến số lượng: clip mạng xã hội, những vòng lặp nhanh, một cảnh quay mà bạn sẽ phải tạo lại sáu lần mới ưng ý, và một hạn chót không thể kéo dài. Mức giá cho mỗi lần thử chính là sản phẩm, và việc nó giờ nằm ở khoảng giữa bảng xếp hạng thay vì ở vị trí dẫn đầu chính là cái giá bình thường của một hạng mục chuyển động nhanh đến vậy.

Hãy chọn Kandinsky 6.0 Video khi công việc là một quy trình: một đơn vị năm giây cố định mà bạn có thể xử lý theo lô, một lượt chuyển ảnh thành video nơi độ trung thực với ảnh tĩnh được cung cấp là điều quan trọng, lời nói mà bạn muốn nghe rõ, và một sản phẩm bàn giao mà bạn không muốn phải thuê. Hãy dự trù cho việc render, hãy chờ một lần render chậm trên thiết bị phổ thông, và hãy coi mọi số liệu trong bài này là của chính Sber cho đến khi có ai đó bên ngoài chấm điểm nó.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

Điều khiến cặp so tài này đáng theo dõi là bên nào có thể chịu đựng được một quý thất bát. Nếu Grok Imagine Video tụt sâu hơn nữa trên đấu trường, câu trả lời là một mô hình tốt hơn và một mức giá mới — đó là cách hạng mục này vận hành và xAI đã cho thấy họ sẽ tung ra một mô hình như vậy. Nếu Kandinsky 6.0 Video hóa ra chỉ ở tầm trung sau khi được chấm điểm, checkpoint vẫn tồn tại, vẫn chạy và vẫn fine-tune được; không có gì về giấy phép thay đổi theo con số đó. Đó là những kiểu bền bỉ khác nhau, và chỉ một trong số đó được Elo đo lường.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.