Một thẻ tiêu đề được tạo hiển thị 'Kandinsky 6.0 Video vs Google Veo 3.1' với phụ đề 'Ba bậc so với hai kích cỡ'. Logo OrcaRouter nằm ở góc dưới cùng bên phải.
Guides & Insights

Kandinsky 6.0 Video vs Google Veo 3.1: Ba Bậc Đối Đầu Hai Kích Cỡ

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hãy mở báo cáo kỹ thuật của Sber về Kandinsky 6.0 Video và tìm phần đối đầu trực tiếp, bạn sẽ nhận ra điều mà các trang so sánh bỏ sót: đối thủ không phải là Veo 3.1. Mà là Veo 3.1 Fast. Sber đã thực hiện đánh giá con người của mình với hạng giữa trong ba hạng dịch vụ của Veo, và chỉ riêng lựa chọn đó đã cho bạn biết nhiều hơn về cuộc đối đầu này so với bất kỳ tuyên bố chất lượng nào trong đó. Veo 3.1 đã được cung cấp rộng rãi từ ngày 17 tháng 11 năm 2025 trong ba hạng dịch vụ; Kandinsky 6.0 Video ra mắt vào tuần đầu tiên của tháng 10 năm 2026 với hai kích thước có thể tải xuống, Pro ở 29B và Lite ở 3B, theo giấy phép MIT. Một trong số này là dịch vụ bạn mua theo giây, cái kia là checkpoint bạn tự chạy — và câu hỏi về hạng, không phải câu hỏi về chất lượng, mới là nơi quyết định thực sự nằm.

Veo 3.1 là ba sản phẩm cùng khoác chung một cái tên

Mô hình của Google hiện được cung cấp rộng rãi ở các phiên bản Standard, Fast và Lite; cả ba đều tạo ra cùng một họ định dạng: 720p, 1080p và native 4K ở 24 fps, thời lượng gốc 4, 6 hoặc 8 giây, với các đầu ra dài hơn được báo cáo ở 1080p và tính năng nối mở rộng cảnh vượt xa hơn thế, hỗ trợ tối đa ba ảnh tham chiếu để đảm bảo tính nhất quán của nhân vật và bối cảnh, cùng các điều khiển seed và negative prompt. Đầu ra mang siêu dữ liệu nguồn gốc SynthID và C2PA.

Điều phân biệt các bậc là giá và tốc độ, và bảng xếp hạng độc lập nói lên điều gì đó không mấy dễ chịu về khoảng cách. Trên bảng xếp hạng text-to-video của Artificial Analysis, cả ba chỉ cách nhau trong vòng 14 Elo — Veo 3.1 đạt 962 (±10) với 2.998 phiếu bầu, Veo 3.1 Fast đạt 961 (±10) với 4.325 phiếu, Veo 3.1 Lite đạt 948 (±10) với 2.903 phiếu — trong khi mức giá niêm yết của chúng lần lượt là 24,00 USD, 7,20 USD và 4,80 USD mỗi phút. Đọc những con số đó cùng nhau và đấu trường đang nói với bạn rằng nó không thể phân biệt một cách đáng tin cậy các bậc theo sở thích. Điều đó không có nghĩa là các bậc giống hệt nhau; nó có nghĩa là câu hỏi thực sự của người mua là bậc nào đáp ứng được tiêu chuẩn của họ, bởi vì bảng xếp hạng sở thích sẽ không trả lời hộ họ.

Kandinsky 6.0 Video tiếp cận vấn đề biến thể theo cách ngược lại. Có hai kích cỡ — Pro ở 29B và Lite ở 3B — dùng chung một kiến trúc và một định dạng đầu ra cố định: 5 giây, 121 khung hình ở 24 fps, âm thanh 44 kHz được đồng bộ với khớp môi, từ văn bản hoặc ảnh tham chiếu, cùng một mô hình siêu phân giải riêng nâng kết quả lên Full HD. Không có biến thể Fast và không có chế độ kéo dài. Bạn chọn một kích cỡ và một GPU.

Điều mà đánh giá của chính phòng thí nghiệm thực sự khẳng định

Đây là dữ liệu đối đầu trực tiếp duy nhất tồn tại giữa hai hệ thống này, và nó đều do nhà cung cấp tự báo cáo ở cả hai phía của dấu gạch chéo — Sber thực hiện, Sber công bố, và không ai ngoài Sber tái lập được nó. Nói chính xác về nó quan trọng hơn nói theo hướng có lợi.

Trong chế độ văn bản sang âm thanh-video, báo cáo cho thấy Kandinsky 6.0 Video Pro được ưa chuộng hơn về lỗi hình ảnh và chuyển động camera với mức chênh lệch có ý nghĩa thống kê, và nhỉnh hơn một chút về độ chân thực của chuyển động trong một lĩnh vực mà các kết quả hòa nhau chiếm ưu thế. Veo 3.1 Fast dẫn đầu về khả năng tuân theo prompt hình ảnh, chất lượng giọng nói, đồng bộ hóa âm thanh-video, chất lượng âm thanh tổng thể, tuân theo prompt âm thanh và giải quyết tác vụ người dùng, tất cả ngoại trừ giọng nói đều đạt mức ý nghĩa thống kê. Chất lượng hình ảnh tổng thể gần như ngang bằng, với Veo nhỉnh hơn một chút.

Trong chế độ image-to-video, xu hướng này đảo chiều ở nửa phần hình ảnh. Kandinsky 6.0 Video Pro được ưu tiên hơn về chất lượng hình ảnh tổng thể, độ khớp với ảnh tham chiếu, lỗi hình ảnh và chuyển động camera, tất cả đều có ý nghĩa. Veo 3.1 Fast vẫn dẫn đầu về khả năng tuân theo prompt hình ảnh, đồng bộ âm thanh-hình ảnh, chất lượng âm thanh tổng thể, tuân theo prompt âm thanh và giải quyết tác vụ người dùng, cũng đều có ý nghĩa. Độ chân thực của chuyển động và chất lượng giọng nói gần như ngang bằng nhau.

Có hai điều rút ra. Kết quả image-to-video mới là phát hiện thực sự: việc một mô hình mở được ưa thích hơn về độ khớp với ảnh tham chiếu và chất lượng hình ảnh tổng thể so với một mô hình thuộc phân khúc của Google, trong chính nghiên cứu của phòng thí nghiệm, là một khẳng định đáng để cân nhắc. Còn kết quả âm thanh là chỗ Veo giữ được lợi thế bất kể chế độ nào — điều này đưa chúng ta đến dấu hiệu cảnh báo mà không ai nhắc tới.

Cờ âm thanh quyết định liệu đánh giá đó có công bằng hay không

Veo 3.1 tạo âm thanh stereo 48 kHz gốc — hội thoại, âm thanh nền, tiếng động — cùng lúc với hình ảnh. Đây là một trong những tính năng mạnh nhất của mô hình. Tuy nhiên, trên API, tham số âm thanh mặc định là tắt, và việc tạo không có âm thanh có giá thấp hơn việc tạo có âm thanh: khoảng $0,20 mỗi giây khi không có âm thanh so với khoảng $0,40 mỗi giây khi bật âm thanh trên gói Standard do Google công bố.

Kandinsky 6.0 Video không có công tắc như vậy. Âm thanh là một phần của đầu ra và pipeline phục vụ được hợp nhất vào vLLM-Omni phát ra AAC 44,1 kHz theo mặc định. Vì vậy, hai mô hình không đối mặt với cùng một mặc định: một mô hình ưu tiên âm thanh, mô hình kia ưu tiên im lặng với âm thanh như một tùy chọn nâng cấp.

Sự bất đối xứng đó có một cái giá cụ thể trong các so sánh. Bất kỳ cuộc đối đầu trực tiếp nào đặt một Veo 3.1 im lặng đối đầu với một đối thủ mà âm thanh luôn được xuất kèm, rồi chấm điểm cả hai trên một bảng đánh giá có tính đến âm thanh, đều đã khiến Veo bị thiệt thòi chỉ vì một sự ngẫu nhiên của cài đặt mặc định. Khi bạn đọc các con số của Sber ở trên — hoặc của bất kỳ ai khác — câu hỏi đầu tiên cần đặt ra là liệu phía Veo có bật âm thanh hay không. Câu hỏi thứ hai là mức chênh lệch giá là bao nhiêu, bởi vì ở gói Standard, bật âm thanh sẽ khiến giá tăng gấp đôi.

Năm giây so với tám, và 1080p so với 4K gốc

Khoảng cách về định dạng chính là nơi bản tóm tắt thiết kế của hai mô hình được thể hiện rõ.

• Độ dài clip — Kandinsky 6.0 Video: cố định 5 giây, 121 khung hình ở 24 fps, không kéo dài. Veo 3.1: 4, 6 hoặc 8 giây gốc, dài hơn ở 1080p, nối chuỗi mở rộng cảnh vượt quá mức đó.

• Độ phân giải — Kandinsky 6.0 Video: SD, HD và Full HD (1920×1080) thông qua một bước siêu phân giải. Veo 3.1: 720p, 1080p và 4K gốc.

• Nguồn gốc — Kandinsky 6.0 Video: không có thông tin nào được nêu trong bản phát hành. Veo 3.1: siêu dữ liệu SynthID và C2PA trên đầu ra.

• Đầu vào tham chiếu — Kandinsky 6.0 Video: một hình ảnh, được áp dụng làm khung đuôi có mặt nạ. Veo 3.1: tối đa ba hình ảnh tham chiếu cùng seed và negative prompt.

• Định dạng — Kandinsky 6.0 Video: AAC 44.1 kHz đi kèm hình ảnh, luôn bật. Veo 3.1: stereo 48 kHz, tùy chọn, được tính giá theo hai cách.

Dòng nguồn gốc xuất xứ là dòng có hệ quả trong mua sắm. Nếu sản phẩm bàn giao của bạn phải có thể truy xuất nguồn gốc — công việc thương hiệu, nội dung phát sóng, bất cứ thứ gì mà đội pháp lý sẽ xem xét — thì Veo 3.1 đính kèm siêu dữ liệu cho biết cảnh quay đã được tạo ra, còn Kandinsky 6.0 Video thì không. Đó không phải là khác biệt về chất lượng và không có benchmark nào thể hiện được điều đó, nhưng đó là kiểu yêu cầu tự nó quyết định việc chọn nhà cung cấp, và một mô hình mở không có tính năng đó không phải là giải pháp thay thế cắm-là-chạy cho một đội ngũ cần nó.

Dòng 4K cũng quan trọng theo cùng một cách, và vì cùng một lý do. Full HD của Kandinsky 6.0 Video là có thật — có một mô hình SR chuyên dụng, và gói SR của kho mã xử lý việc nâng cấp độ phân giải x2, x4 và x2.25 cho các clip năm giây — nhưng nó chạm trần đúng ở nơi đường xử lý gốc của Veo 3.1 bắt đầu tại đầu trên. Với công việc trên màn hình lớn, mức trần đó không thể thương lượng.

Chi phí của một clip ở mỗi bên là bao nhiêu

Veo 3.1 là hóa đơn tính theo giây. Ở bậc Standard, một clip 1080p dài năm giây có âm thanh tốn khoảng $2.00, còn cùng clip đó không có âm thanh thì khoảng $1.00; Fast và Lite nằm dưới mức đó, và vì điểm arena của chúng nằm trong khoảng tin cậy của Standard, nên khó có thể phản đối các bậc rẻ hơn dựa trên bằng chứng.

Kandinsky 6.0 Video không có hóa đơn. Nó có thời gian GPU. Các con số trong kho lưu trữ dành cho mô hình không chưng cất, được đo sau warmup và đã loại trừ việc tải trọng số cùng mã hóa MP4, cho thấy một clip Pro Full HD dài năm giây tốn khoảng 402 giây trên H100, 854 giây trên RTX 5090, 1,247 giây trên RTX 4090 và 3,530 giây trên RTX 5060 Ti. Lite Full HD là 284 giây trên H100. Mức cấp phát đỉnh trong một lần chạy Pro SD lên tới 72.8 GiB, nên bất cứ cấu hình nào dưới ngưỡng đó đều cần block offloading — và preset 16 GB lượng tử hóa text encoder thành NF4, thay đổi preset duy nhất mà bài báo xác nhận là có làm biến đổi chính clip chứ không chỉ tạo ra nhiễu ở mức làm tròn.

Hai cấu trúc chi phí đó không thể so sánh với nhau. Một cái là hóa đơn bạn dự tính theo từng giây thành phẩm; cái kia là một cỗ máy bạn mua, một lần render được đo bằng phút, và tùy chọn tinh chỉnh — thứ mà Veo 3.1 không cung cấp ở bất kỳ gói nào.

Câu hỏi về hạng là một câu hỏi định tuyến.

OrcaRouter không cung cấp Google Veo 3.1 lẫn Kandinsky 6.0 Video, và điều đó cũng không được ngụ ý ở đây — Veo 3.1 được truy cập qua chính các bề mặt của Google còn Kandinsky thì bạn tự tải về. Nhưng cấu trúc của quyết định về Veo đáng được gọi tên, bởi vì đó chính là bài toán mà lớp định tuyến của chúng tôi tồn tại để giải quyết ở phía văn bản: ba hạng có điểm số độc lập không thể phân biệt được và mức giá chênh nhau gấp năm chính là trường hợp mà "định tuyến cái rẻ và chỉ nâng cấp khi chưa vượt qua ngưỡng" thắng "chuẩn hóa trên mô hình hàng đầu". Định tuyến thích ứng và DSL định tuyến của OrcaRouter thể hiện điều đó như một chính sách được cấu hình trên hơn 200 mô hình văn bản tại một endpoint tương thích OpenAI, theo giá niêm yết của nhà cung cấp với mức chênh 0%, với tính năng tự động chuyển đổi dự phòng khi một tuyến gặp sự cố. Chính trực giác đó khi áp dụng cho chi tiêu video — Fast theo mặc định, Standard cho những cảnh quay quan trọng — là một quyết định mua sắm mà bạn có thể đưa ra ngay hôm nay mà không cần đến router nào cả.

Cái nào, cho ai

Chọn Veo 3.1 nếu sản phẩm bàn giao cần âm thanh được xử lý nghiêm túc, nếu nó cần 4K hoặc một clip dài hơn năm giây, hoặc nếu ai đó ở khâu sau yêu cầu siêu dữ liệu xuất xứ. Hãy chọn gói một cách có chủ đích thay vì mặc định dùng Standard, và dự trù ngân sách cho cờ âm thanh thay vì phát hiện nó trên hóa đơn.

Chọn Kandinsky 6.0 Video nếu bạn muốn trọng số, nếu năm giây phù hợp với đơn vị công việc của bạn, và nếu độ trung thực ảnh-thành-video so với một ảnh tĩnh được cung cấp chính là công việc — chiều kích duy nhất mà nghiên cứu của chính phòng thí nghiệm đặt nó vượt một hạng Veo với biên độ đáng kể. Hãy biết trước rằng âm thanh luôn bật, thông tin nguồn gốc không có, và tuyên bố về chất lượng hoàn toàn dựa vào một báo cáo do chính tác giả của nó viết.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Google Veo 3.1 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Audio: 44.1 kHz, always on', 'Provenance: none stated', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Google Veo 3.1 column reads 'Max clip: 4, 6 or 8s', 'Resolution: up to native 4K', 'Audio: 48 kHz, optional', 'Provenance: SynthID and C2PA', 'Weights: none', 'Price: $4.80 to $24.00/min'. A footer reads 'Veo rates and Elo per Artificial Analysis; Kandinsky vendor-reported. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.

Sự bất đối xứng cần nắm giữ là việc Veo 3.1 đã được đưa vào sản xuất được mười một tháng và do đó đã tích lũy được thứ mà một mô hình mở ra mắt trong tháng này không thể có: một tập hợp các kiểu thất bại đã được người dùng của nó công bố, và một đường cong giá mà một nhóm tài chính có thể mô hình hóa. Đối lại, giấy phép MIT của Kandinsky nghĩa là mô hình trên đĩa của bạn không phụ thuộc vào lộ trình của bất kỳ ai. Cái nào trong số đó đáng giá hơn không phải là một câu hỏi benchmark.

A screenshot of OrcaRouter's own model page for kling/kling-3-turbo, titled 'Kling 3.0 Turbo', credited to Kling and dated 2026-06-17, showing the route endpoint /v1/video/generations and a price of $0.11 per request, with a description explaining that Kling 3.0 Turbo is Kuaishou's speed-optimized model in the Kling 3.0 generation with native audio bundled in, handling text-to-video and image-to-video, and multi-shot storyboarding of up to six shots in a single generation.