
Kandinsky 6.0 Video vs Grok Imagine Video: Bảng xếp hạng đã đảo chiều
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 150 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Vào tháng 1 năm 2026, khi Grok Imagine Video ra mắt, nó đứng đầu đấu trường video của Artificial Analysis ở cả hai chế độ. Hôm nay, cùng bảng xếp hạng đó đặt bản dựng hiện tại của nó ở vị trí thứ mười một hoặc mười hai trong text-to-video. Đó không phải là một t và cũng không phải là thất bại — đó là điều xảy ra với một hạng mục chuyển động nhanh trong một năm, và đó là lý do trung thực để so sánh mô hình tạo sinh của xAI với Kandinsky 6.0 Video ngay lúc này. Một trong số chúng là dịch vụ được tối ưu cho việc bạn có thể tạo thêm một clip nhanh đến mức nào; cái còn lại là một checkpoint được cấp phép MIT, 29B tham số ở kích thước Pro và 3 ở bản Lite, do Kandinsky Lab của Sber phát hành trong tuần đầu tiên của tháng 10 năm 2026, tạo ra năm giây video với âm thanh 44 kHz đồng bộ và khớp khẩu hình. Câu hỏi thú vị không phải là cái nào đang dẫn đầu trên một bảng xếp hạng — mà là mỗi cái có thể làm gì tiếp theo về mặt cấu trúc.
Tấm ván đã di chuyển bên dưới nó
Grok Imagine Video là mô hình tạo sinh của xAI, phát hành lần đầu vào ngày 29 tháng 1 năm 2026 và ổn định ở phiên bản 1.5 kể từ ngày 16 tháng 6. Trên bảng xếp hạng text-to-video của Artificial Analysis, bản 1.5 của nó đứng thứ 11–12 với Elo 1.045 (±9) trên 4.056 lượt bình chọn, được niêm yết ở mức 15,00 đô la Mỹ mỗi phút. Bản gốc không có trên bảng xếp hạng đó.
Tạo video từ ảnh là nơi dòng sản phẩm này mạnh hơn, và cũng là nơi hai bản dựng tách biệt theo một cách đáng để đọc kỹ:
• grok-imagine-video-1.5 — hạng 7–9, Elo 1.098 (±8), 5.267 lượt bình chọn, 8,40 USD/phút.
• grok-imagine-video (bản dựng tháng Một) — hạng 12–17, Elo 1.072 (±7), 14.371 phiếu, 4,20 USD/phút.
• Để so sánh, vị trí dẫn đầu của bảng I2V đó — MiniMax H3 Max — đạt Elo 1.195 (±9) qua 5.894 phiếu bầu, còn Wan 3.0 đứng thứ sáu với 1.164.
Hai cách đọc sau đây, và cả hai đều đúng. Bản dựng mới hơn của xAI thực sự vượt qua chính phiên bản tiền nhiệm của nó ở mảng chuyển hình ảnh thành video, với mức chênh 26 Elo, và để làm được điều đó, nó tốn gấp đôi chi phí mỗi phút. Còn câu chuyện trong tuần ra mắt — một mô hình đã xuất hiện ở vị trí dẫn đầu — đã không trụ được: bối cảnh đã thay đổi, đấu trường đã tích lũy hàng chục nghìn lượt bình chọn trải khắp hàng tá hệ thống mới hơn, và vị trí tầm trung là nơi chín tháng cạnh tranh đặt một trình tạo nhanh, đa dụng.
Kandinsky 6.0 Video không có Elo trên bất kỳ bảng xếp hạng nào. Bằng chứng của nó là một lần chạy VABench và một đánh giá do con người thực hiện trong phòng thí nghiệm, cả hai đều do Sber công bố, không có cái nào được tái lập bên ngoài Sber. Đặt một mô hình mở chưa được kiểm toán bên cạnh một mô hình thương mại đã được chấm điểm chính là kiểu so sánh cần được xử lý cẩn trọng: vị thế của mô hình đã được chấm điểm là có thật và không mấy tốt đẹp, còn vị thế của mô hình chưa được chấm điểm thì chưa biết. “Chưa biết” không phải là “tốt hơn”.
Hai kiểu nhanh, và chỉ một trong số đó được đo bằng giây.
Mục tiêu thiết kế của Grok Imagine Video là năng suất trên mỗi nhà sáng tạo. Nó được tích hợp trực tiếp vào X, trả về một clip hoàn chỉnh có âm thanh, và bộ tính năng của nó giống như một danh sách những việc người ta thực sự làm trên bảng tin: nhiều tỷ lệ khung hình, chuyển động camera, thêm, xóa và hoán đổi đối tượng, chuyển đổi phong cách, tạo sinh có điều kiện tham chiếu từ nhiều hình ảnh để đảm bảo tính nhất quán của nhân vật, âm thanh gốc với lời thoại, hiệu ứng và nhạc. Độ dài clip lên tới mười lăm giây, độ phân giải tối đa là 1080p. Toàn bộ sản phẩm được xây dựng sao cho lần thử thứ hai chỉ tốn của bạn vài phút và vài xu.
Kandinsky 6.0 Video nhanh theo một nghĩa khác — không phải trên mỗi lần thử, mà trên mỗi đơn vị sở hữu. Không có gì về nó là tức thời. Thời gian làm việc của chính kho lưu trữ đối với mô hình không chưng cất, sau khi khởi động và không tính việc tải trọng số lẫn mã hóa MP4, đặt một clip Pro Full HD dài năm giây ở khoảng 402 giây trên H100, 854 trên RTX 5090, 1.000 trên 4090 và 3.530 trên RTX 5060 Ti. Lite Full HD là 284 giây trên H100. Công cụ khiến điều đó trở nên dễ chịu hơn là checkpoint đã chưng cất, thứ mà bài báo đo được là ngang bằng với mô hình đầy đủ — được ưa thích hơn hoặc hòa ở phần lớn các tiêu chí, tỷ lệ ưa thích trung bình 51% so với 49%, không có khác biệt riêng lẻ nào đạt mức ý nghĩa. Thứ bạn nhận được để đổi lấy việc render chậm là một mô hình trên đĩa của chính mình, không hề có đồng hồ tính theo từng clip nào chạy cả.
Đó mới là hình hài thật sự của cuộc đối đầu này. Grok Imagine Video tối ưu hóa chi phí cho lần thử thứ mười. Kandinsky 6.0 Video tối ưu hóa chi phí cho lần thử thứ mười nghìn, và bắt bạn trả bằng phần cứng cùng sự kiên nhẫn cho lần đầu tiên.
Cả hai đều tạo ra âm thanh — và chúng là cùng một tuyên bố
Đây là trục mà một so sánh hời hợt sẽ nói "hòa" và sai.
Grok Imagine Video tạo ra âm thanh gốc với lời thoại, hiệu ứng và nhạc như một trong nhiều tính năng. Đây là một công cụ tạo sinh đa dụng mà tình cờ có kèm cả âm thanh.
Kandinsky 6.0 Video được xây dựng xoay quanh âm thanh. Kiến trúc là CrossDiT hai luồng, ghép một luồng video được khởi tạo từ Kandinsky 5.0 Video với một luồng âm thanh được huấn luyện từ đầu trên các kho ngữ liệu âm thanh lớn, kết nối bằng cross-attention hai chiều và được huấn luyện chung. Đầu ra là 44 kHz với đồng bộ khẩu hình rõ ràng, và giai đoạn học tăng cường của bài báo được báo cáo là cắt giảm 47% tỷ lệ lỗi từ của giọng nói được tạo — đo bằng Whisper-large-v3, một trong các mô hình thưởng của RL, một chi tiết đáng lưu ý vì bài báo báo cáo thêm một WER thứ hai, không thể so sánh, song song với VABench bằng Qwen3-ASR-1.7B. Giọng nói chính là thứ mà mô hình được hậu huấn luyện trên đó.
Ngược lại, nghiên cứu của chính Sber lại thẳng thắn về những điểm mà nó thua kém. Trong đánh giá so sánh song song của phòng thí nghiệm, MiniMax H3 và Dreamina Seedance 2.0 được ưa thích hơn ở các tiêu chí hình ảnh với khoảng cách đáng kể, và mô hình này được mô tả là có sức cạnh tranh thay vì dẫn trước. Tuyên bố đáng được xem xét nghiêm túc thì hẹp hơn và hữu ích hơn: so với Kling 2.6 và Veo 3.1 Fast, kết quả so kè theo từng tiêu chí, và Kandinsky 6.0 Video vẫn cạnh tranh về chất lượng giọng nói và đồng bộ âm thanh-hình ảnh, nơi phần lớn các so sánh là hòa.
Mười lăm giây so với năm giây, và cái giá phải trả để đạt được từng thứ
• Clip tối đa — Grok Imagine Video: tối đa 15 giây. Kandinsky 6.0 Video: cố định 5 giây, 121 khung hình ở 24 fps, không có chế độ kéo dài trong bản phát hành.
• Độ phân giải — Grok Imagine: lên đến 1080p. Kandinsky 6. Video: SD, HD và Full HD thông qua một mô hình siêu phân giải chuyên dụng, nâng cấp x2, x4 hoặc x2.25 cho các clip dài năm giây.
• Đầu vào tham chiếu — Grok Imagine Video: tạo có điều kiện tham chiếu từ một số hình ảnh để đảm bảo tính nhất quán của nhân vật, cùng với thêm/xóa/hoán đổi đối tượng. Kandinsky 6.0 Video: một hình ảnh, được áp dụng làm khung đuôi được mặt nạ hóa.
• Bảng giá — Grok Imagine Video: tính theo mỗi giây đầu ra, từ mức thấp nhất của khung giá lên tới $0,30/giây ở 1080p, cộng thêm phí cho mỗi ảnh đầu vào; quyền truy cập miễn phí chỉ có được qua các gói đăng ký X. Kandinsky 6.0 Video: không có — không dịch vụ, không mức giá, chỉ có thời gian GPU do bạn cung cấp.
• Trọng số — Grok Imagine Video: không. Kandinsky 6.0 Video: MIT, Pro và Lite, với tích hợp diffusers.
Mức phụ trội cho bản Grok mới hơn chính là con số cần khoanh tròn. Đi từ bản tháng 1 lên bản 1.5 tốn gấp đôi chi phí mỗi phút trên bảng xếp hạng image-to-video và mang lại 26 Elo. Đó là một cải thiện thực sự với một cái giá thực sự, và đó cũng là sự đánh đổi tương tự mà mọi nhà cung cấp video đang yêu cầu người mua thực hiện ngay lúc này.
Bộ định tuyến phù hợp ở đâu và không phù hợp ở đâu
OrcaRouter không cung cấp Grok Imagine Video hay Kandinsky 6.0 Video, và không có nội dung nào ở đây tuyên bố điều ngược lại: Kandinsky thì bạn tự tải về và chạy, còn Grok Imagine Video được truy cập thông qua chính các nền tảng của xAI. Điều mà một pipeline được xây dựng trên một trong hai mô hình này cần ở một router là phần văn bản bao quanh bản render — danh sách cảnh quay, việc mở rộng prompt để biến một ý tưởng thành chú thích dài hoặc ngắn mà các mô hình này được huấn luyện trên đó, công việc tạo chú thích và phiên âm, cùng các bản tóm tắt đánh giá để quyết định giữ lại bản tạo nào. Những việc đó chạy trên một endpoint tương thích OpenAI với hơn 200 mô hình văn bản theo giá niêm yết của nhà cung cấp với mức tăng giá 0%, nên một bản phát hành từ nhà cung cấp sẽ hoạt động trên cùng key ngay khi nó ra mắt, với tính năng chuyển đổi dự phòng tự động để một cuộc gọi thất bại giữa hàng đợi render được định tuyến lại thay vì làm đình trệ cả lô. Việc điều phối xung quanh một mô hình video là một bài toán định tuyến ngay cả khi bản thân mô hình video không thể định tuyến, và đó là trường hợp của cả hai mô hình này hiện nay.
Cái nào, và để làm gì
Hãy chọn Grok Imagine Video khi công việc cần đến số lượng: clip mạng xã hội, những vòng lặp nhanh, một cảnh quay mà bạn sẽ phải tạo lại sáu lần mới ưng ý, và một hạn chót không thể kéo dài. Mức giá cho mỗi lần thử chính là sản phẩm, và việc nó giờ nằm ở khoảng giữa bảng xếp hạng thay vì ở vị trí dẫn đầu chính là cái giá bình thường của một hạng mục chuyển động nhanh đến vậy.
Hãy chọn Kandinsky 6.0 Video khi công việc là một quy trình: một đơn vị năm giây cố định mà bạn có thể xử lý theo lô, một lượt chuyển ảnh thành video nơi độ trung thực với ảnh tĩnh được cung cấp là điều quan trọng, lời nói mà bạn muốn nghe rõ, và một sản phẩm bàn giao mà bạn không muốn phải thuê. Hãy dự trù cho việc render, hãy chờ một lần render chậm trên thiết bị phổ thông, và hãy coi mọi số liệu trong bài này là của chính Sber cho đến khi có ai đó bên ngoài chấm điểm nó.


Điều khiến cặp so tài này đáng theo dõi là bên nào có thể chịu đựng được một quý thất bát. Nếu Grok Imagine Video tụt sâu hơn nữa trên đấu trường, câu trả lời là một mô hình tốt hơn và một mức giá mới — đó là cách hạng mục này vận hành và xAI đã cho thấy họ sẽ tung ra một mô hình như vậy. Nếu Kandinsky 6.0 Video hóa ra chỉ ở tầm trung sau khi được chấm điểm, checkpoint vẫn tồn tại, vẫn chạy và vẫn fine-tune được; không có gì về giấy phép thay đổi theo con số đó. Đó là những kiểu bền bỉ khác nhau, và chỉ một trong số đó được Elo đo lường.

