Một thẻ tiêu đề được tạo có nội dung 'Kandinsky 6.0 Video đổ bộ vào vLLM-Omni' với phụ đề 'Một checkpoint trở thành một dịch vụ', phía trên một hàng biểu tượng được dán nhãn 'Tạo video', 'Âm thanh đồng bộ' và 'Triển khai trọng số mở'. Logo OrcaRouter nằm ở góc dưới cùng bên phải.
Engineering & Research

Kandinsky 6.0 Video cập bến vLLM-Omni: Lớp phục vụ bổ sung thêm gì cho một mô hình mở

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Yêu cầu kéo (pull request) #8537 đã được hợp nhất vào vLLM-Omni lúc 07:55 UTC sáng nay, và nó chỉ làm đúng một việc: biến Kandinsky 6.0 Video thành có thể phục vụ. Bản thân mô hình đã đến từ Kandinsky Lab của Sber cùng ngày dưới dạng một cặp — Kandinsky 6.0 Video Pro với 29 tỷ tham số và Kandinsky 6.0 Video Lite với 3 tỷ — tạo ra các clip dài năm giây với âm thanh 44 kHz được đồng bộ, bao gồm cả khớp khẩu hình, từ một câu lệnh văn bản hoặc một hình ảnh tham chiếu, với mã nguồn, trọng số và tích hợp diffusers đều theo giấy phép MIT. Điều mà nó chưa có cho đến sáng nay là một cách để chạy nó bên trong một máy chủ suy luận thay vì một dòng lệnh chạy một lần.

Sự khác biệt đó đáng giá hơn vẻ ngoài của nó, và đó là lý do đây là một câu chuyện tách biệt với bản phát hành. Một checkpoint mở mà bạn có thể chạy trên card của riêng mình là một sản phẩm nghiên cứu; một checkpoint mở với pipeline phía máy chủ, các điểm vào dùng chung và một công thức phục vụ là thứ bạn có thể đặt phía sau một hàng đợi. Bản phát hành tuần này đã cho bạn cái thứ nhất. Bản hợp nhất hôm nay là khởi đầu của cái thứ hai.

Cái gì thực sự đã hợp nhất

PR này bổ sung khả năng chuyển văn bản thành video và âm thanh cùng chuyển hình ảnh thành video và âm thanh vào vLLM-Omni từ checkpoint kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. Phần thú vị nằm ở các lựa chọn kỹ thuật, vì chúng cho bạn thấy kiến trúc thực sự trông ra sao khi một người nào đó không phải là tác giả phải phục vụ nó.

• Một DiT khử nhiễu cho cả hai phương thức. Pipeline được đăng ký là Kandinsky6TI2VAPipeline, và các latent video cùng các latent âm thanh được khử nhiễu chung bởi một transformer duy nhất thay vì bởi hai mô hình chạy tuần tự. Điều đó phản ánh CrossDiT hai luồng của bài báo, nơi một luồng video đã được huấn luyện trước và một luồng âm thanh xây dựng từ đầu được kết nối bằng cross-attention hai chiều.

• Trọng số được nạp theo từng thư mục. Checkpoint trên Hub được đọc dưới dạng transformer/, vae/, text_encoder/, text_encoder_2/ và audio_vae/. Các tên nội bộ của checkpoint đã xuất bản — videoT và audioT — được ánh xạ sang video_dec_block và audio_dec_block tại thời điểm nạp, đây là kiểu chi tiết có thể ngốn cả một ngày nếu bạn tự mình phát hiện ra.

• Âm thanh được bật theo mặc định. Pipeline phát ra AAC 44,1 kHz thay vì coi âm thanh như một cờ chọn tham gia, nên một yêu cầu không có tham số âm thanh vẫn trả về giọng nói, nhạc hoặc âm nền được đồng bộ hóa.

• Đầu vào ảnh là một khung đuôi đã được mặt nạ hóa, chứ không phải một chế độ riêng biệt. Việc điều kiện hóa bằng ảnh tham chiếu được áp dụng thông qua mặt nạ, nhờ đó cùng một pipeline phục vụ cả T2AV lẫn I2AV mà không cần phân nhánh.

Smoke test của người gửi là một mức sàn hữu ích: một NVIDIA H100 80GB duy nhất với FlashAttention-3, bật CPU offload, 864×480, 125 khung hình, 50 bước, CFG 5.0, seed 42. Đó là một clip 5 giây ở độ phân giải chỉ dưới HD, không phải bản render Full HD, và PR không hề tuyên bố ngược lại.

Điểm kiểm tra không phải là một dịch vụ

Lý do để quan tâm đến một merge như thế này là những gì nó loại bỏ khỏi danh sách của bạn. Việc chạy bản triển khai tham chiếu đồng nghĩa với việc clone repository, chạy just setup, để nó biên dịch SageAttention trên bất kỳ thứ gì dưới Hopper, tải checkpoint vào một thư mục cache và gọi một lệnh generate mà đầu ra rơi vào một thư mục có gắn dấu thời gian. Điều đó thì ổn cho lần xem đầu tiên và khá bất tiện cho một sản phẩm.

vLLM-Omni đưa mô hình vào bên trong một tiến trình phục vụ, với đúng những điểm vào suy luận ngoại tuyến mà dự án dùng cho các mô hình khuếch tán khác của mình (examples/offline_inference/text_to_video/text_to_video.py và người anh em image-to-video của nó) cùng một công thức phục vụ tại recipes/Kandinsky/Kandinsky6-TI2VA.md. Kéo theo đó là hai hệ quả thực tiễn. Câu chuyện triển khai của bạn trở thành một container giao tiếp qua giao diện HTTP thay vì một script bạn phải cặm cụi trông coi, và mô hình không còn là trường hợp đặc biệt trong stack của bạn nữa — nó nằm ngay cạnh bất cứ thứ gì khác bạn chạy trên máy chủ đó.

Hãy lưu ý đây không phải là gì. Đây không phải là một endpoint được lưu trữ, không phải là một mức giá, và không phải là một phép đo chất lượng độc lập. Đây là thêm một nơi nữa mà mô hình có thể chạy, được đóng góp bởi một người bên ngoài phòng thí nghiệm, ba ngày sau khi các trọng số xuất hiện.

Một clip năm giây tốn bao nhiêu thời gian thực tế, trên các card thật

Bảng của chính kho lưu trữ là điểm khởi đầu trung thực. Đây là thời gian chạy của mô hình cơ sở không chưng cất cho một clip 5 giây, sau khi làm nóng, không bao gồm việc tải trọng số và mã hóa MP4. Full HD ở đây nghĩa là lượt siêu phân giải cũng đang chạy.

• Full HD (Pro) — 402 giây trên H100, 765 giây trên RTX PRO 6000, 854 giây trên RTX 5090, 1.106 giây trên A100 80GB, 1.247 giây trên RTX 4090 và 3.530 giây trên RTX 5060 Ti.

• Full HD (Lite) — 284 giây trên H100, 387 giây trên RTX PRO 6000, 406 giây trên RTX 5090, 664 giây trên A100 80GB, 578 giây trên RTX 4090 và 1.774 giây trên RTX 5060 Ti.

• SD (Pro) — 356 giây trên H100 so với 936 giây trên RTX 4090, đây là trường hợp mà sự thiệt thòi của card tiêu dùng là nhỏ nhất và bài toán kinh tế cũng ít tệ nhất.

Hình dạng của bảng đó quan trọng hơn bất kỳ ô riêng lẻ nào. H100 nhanh hơn 4090 khoảng ba lần trên Pro Full HD, và nhanh hơn 5060 Ti khoảng sáu lần trong cùng tác vụ — nhưng giai đoạn SR tốn chi phí như nhau ở cả hai kích cỡ model, khoảng 64 giây ở HD và khoảng 96 giây ở Full HD trên 5090. Lite không giúp bạn có một lượt super-resolution ngắn hơn, vì model SR được huấn luyện riêng và không quan tâm model nền nào đã cung cấp đầu vào cho nó.

Con đường 16 GB và cài đặt duy nhất có thể thay đổi hình ảnh của bạn

Bộ nhớ được cấp phát đỉnh trong một lần chạy Pro SD đạt 72,8 GiB, vượt quá mọi card phổ thông. Repository trả lời bằng block offloading — chỉ hai transformer block thường trú trên GPU tại một thời điểm, phần còn lại được truyền từ bộ nhớ host — cùng với ba preset cho card 32 GB, 24 GB và 16 GB. Hai preset 32 và 24 GB giống hệt nhau, vì trên 24 GB, dung lượng dư thêm không giúp tăng tốc độ.

Điều cần lưu ý này bị chôn khá kỹ và đáng được nhắc lại: ở preset 16 GB, bộ mã hóa văn bản được lượng tử hóa xuống NF4, và bài báo nói rõ rằng đây là thay đổi preset duy nhất tác động đến chính clip. Một cách biểu diễn văn bản khác sẽ tạo ra một video khác. Mọi thứ khác — độ dài phân đoạn, dải không gian, offloading — chỉ thay đổi đầu ra ở mức nhiễu làm tròn, với khoảng 12% số pixel khác nhau một mức độ sáng ở xấp xỉ 57 dB PSNR. Nếu bạn đang tái tạo kết quả của người khác trên card 16 GB mà nó không khớp, thì đó là điều đầu tiên cần kiểm tra.

Ba điều mà ghi chú phát hành không giải quyết

• Năm giây là giới hạn trần, không phải mặc định. Mô hình được huấn luyện ở 121 khung hình và 24 fps, và cả bài báo lẫn công thức phục vụ đều được xây dựng xoay quanh mức đó. Không có chế độ gia hạn trong bản phát hành. Bất cứ thứ gì dài hơn đều là bài toán nối ghép mà bạn phải tự lo.

• Checkpoint đã chưng cất mới chính là thứ bạn thực sự đưa vào phục vụ, và nó đã được đo ở mức ngang bằng. Phần ablation của bài báo cho thấy mô hình đã chưng cất được ưu tiên hoặc hòa trên phần lớn các tiêu chí, không có khác biệt đơn lẻ nào đạt mức ý nghĩa, với tỷ lệ ưu tiên trung bình là 51% so với 49%. Đó là cái giá bạn chấp nhận để đổi lấy tốc độ.

• Có hai con số tỷ lệ lỗi từ trong bài báo và chúng không thể so sánh được. Mức giảm 47% trong WER của giọng nói được tạo đi kèm với giai đoạn học tăng cường được chấm điểm bằng Whisper-large-v3, một trong các mô hình thưởng RL; WER được báo cáo cùng với VABench sử dụng Qwen3-ASR-1.7B trên tập con giọng nói. Chính các tác giả nói như vậy. Trích dẫn cái này như cái kia là sai lầm dễ mắc nhất với bản phát hành này.

Bộ định tuyến nằm ở đâu trong một ngăn xếp như thế này

OrcaRouter không phục vụ Kandinsky 6.0 Video, và không có gì ở đây nên được hiểu là khẳng định rằng nó có phục vụ — bạn có thể tự chạy mô hình từ Hub, hoặc truy cập nó thông qua các giao diện riêng của phòng thí nghiệm. Điều mà một pipeline như thế này cần ở một router là phần văn bản xung quanh nó. Bước mở rộng prompt biến mô tả cảnh quay thành chú thích dài, trung bình hoặc ngắn mà mô hình đã được huấn luyện, công việc chú thích và chép lời cấp dữ liệu cho một bước image-to-video, các bản tóm tắt đánh giá quyết định giữ lại bản nào trong bốn lần tạo: đó đều là những lệnh gọi văn bản thông thường, và chúng chạy trên một endpoint tương thích OpenAI áp dụng cho hơn 200 mô hình với giá niêm yết của nhà cung cấp được chuyển nguyên ở mức tăng giá 0%, vì vậy thay đổi giá của nhà cung cấp có hiệu lực ngay trong cùng ngày. Chuyển đổi dự phòng tự động ở đây quan trọng hơn mức thông thường, vì một bản render năm phút bị hỏng ở bước chú thích nên được định tuyến lại thay vì khởi động lại tác vụ.

Điều đáng chú ý tiếp theo không phải là một bản hợp nhất nữa, mà là một con số. Kandinsky 6.0 Video Pro có kết quả do nhà cung cấp báo cáo trên VABench và một đánh giá con người do phòng thí nghiệm thực hiện đối chiếu với Kling 2.6, Veo 3.1 Fast, MiniMax H3 và Seedance 2.0 — và chưa có điểm arena độc lập nào. Khi một điểm như vậy xuất hiện, tuyên bố về trọng số mở không còn là một lập luận về khả năng truy cập mà bắt đầu là một lập luận về chất lượng, và đó chính là phép so sánh quyết định liệu đây là một mô hình mà các đội nhóm tải về hay một mô hình mà họ ngưỡng mộ.

A generated scoreboard titled 'Kandinsky 6.0 Video — the scoreboard' with a single column of six rows: 'Sizes: Pro 29B, Lite 3B', 'Clip length: 5s fixed', 'Audio: 44 kHz lip-sync', 'Resolution: Full HD plus SR', 'Licence: MIT' and 'Serving: vLLM-Omni day 0'. A footer reads 'All figures vendor-reported; no independent Elo yet. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the GitHub repository page for kandinskylab/kandinsky-6, showing 11 commits, 35 stars and 4 forks, an MIT license badge, and a README titled 'Kandinsky 6.0: A family of diffusion models for Video + Audio Generation' with badges for KANDINSKYLAB, REPORT, DIFFUSERS and COMFYUI; recent commits include 'README update', 'Added source code', 'Some improvements for just generate' and 'Keep ComfyUI user documentation in README'.

Kho lưu trữ cũng cung cấp hai nút ComfyUI — kandinsky6 và kandinsky6-sr — có thể cài đặt thông qua ComfyUI Manager, cùng hai Hugging Face Space: một cho checkpoint chưng cất Pro và một cho bản demo siêu phân giải video. Giữa CLI, các nút ComfyUI, gói diffusers và giờ là pipeline vLLM-Omni, bề mặt triển khai vào ngày thứ ba rộng hơn mức mà hầu hết mô hình video mở làm được trong cả một quý. Chính sự rộng khắp đó mới là câu chuyện thật của tuần này: Sber đã phát hành cả một họ mô hình, chứ không phải một bài báo kèm theo demo.

A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.