การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Kandinsky 6.0 Video Lands in vLLM-Omni' พร้อมคำโปรยย่อยว่า 'A checkpoint becomes a service' โดยอยู่เหนือแถวไอคอนที่ติดป้ายกำกับว่า 'Video Generation', 'Synchronized Audio' และ 'Open-Weight Deployment' โลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Engineering & Research

Kandinsky 6.0 Video มาสู่ vLLM-Omni: เลเยอร์การให้บริการเพิ่มอะไรให้กับโมเดลแบบเปิด

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

พูลรีเควสต์ #8537 ถูก merge เข้า vLLM-Omni เมื่อเวลา 07:55 UTC เช้านี้ และมันทำสิ่งเดียวเท่านั้น: ทำให้ Kandinsky 6.0 Video สามารถให้บริการได้ โมเดลนี้มาถึงจาก Kandinsky Lab ของ Sber ในวันเดียวกันเป็นคู่ — Kandinsky 6.0 Video Pro ที่ 29B พารามิเตอร์ และ Kandinsky 6.0 Video Lite ที่ 3B — สร้างคลิปห้าวินาทีพร้อมเสียง 44 kHz ที่ซิงโครไนซ์กัน รวมถึง lip-sync จากพรอมป์ข้อความหรือภาพอ้างอิง โดยมีโค้ด น้ำหนักโมเดล และการผสานรวม diffusers ทั้งหมดภายใต้ MIT สิ่งที่มันยังไม่มีจนถึงเช้านี้คือวิธีรันมันภายในเซิร์ฟเวอร์ inference แทนที่จะเป็นบรรทัดคำสั่งแบบใช้ครั้งเดียว

ความแตกต่างนั้นมีค่ามากกว่าที่มันฟังดู และนี่คือเหตุผลที่เรื่องนี้เป็นเรื่องแยกต่างหากจากรีลีส เช็คพอยต์แบบเปิดที่คุณรันบนการ์ดของตัวเองได้เป็นเพียงอาร์ติแฟกต์งานวิจัย ส่วนเช็คพอยต์แบบเปิดที่มีไปป์ไลน์ฝั่งเซิร์ฟเวอร์ มีจุดเข้าใช้งานที่แชร์ร่วมกัน และมีสูตรการให้บริการ คือสิ่งที่คุณนำไปวางไว้หลังคิวได้ รีลีสของสัปดาห์นี้มอบอย่างแรกให้คุณ การ merge ของวันนี้คือจุดเริ่มต้นของอย่างที่สอง

สิ่งที่ถูกผสานรวมจริง ๆ

PR นี้เพิ่มความสามารถ text-to-video-and-audio และ image-to-video-and-audio ให้กับ vLLM-Omni จากเช็กพอยต์ kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers ตัวเลือกทางวิศวกรรมต่าง ๆ คือส่วนที่น่าสนใจ เพราะมันบอกให้เห็นว่าสถาปัตยกรรมมีหน้าตาจริง ๆ อย่างไรเมื่อคนอื่นที่ไม่ใช่ผู้เขียนต้องนำมันไปให้บริการ

• DiT ตัวเดียวลดสัญญาณรบกวนทั้งสองมอดาลิตี ไปป์ไลน์นี้ลงทะเบียนเป็น Kandinsky6TI2VAPipeline และเลเทนต์วิดีโอกับเลเทนต์เสียงจะถูกลดสัญญาณรบกวนร่วมกันโดยทรานส์ฟอร์มเมอร์เพียงตัวเดียว แทนที่จะเป็นสองโมเดลที่รันตามลำดับ ซึ่งสอดคล้องกับ CrossDiT แบบสองสตรีมในเปเปอร์ ที่ซึ่งสตรีมวิดีโอที่ผ่านการฝึกมาแล้วและสตรีมเสียงที่สร้างขึ้นจากศูนย์ถูกเชื่อมต่อกันด้วย cross-attention แบบสองทิศทาง

• โหลดเวตทีละโฟลเดอร์ โดยเช็กพอยต์จาก Hub จะถูกอ่านเป็น transformer/, vae/, text_encoder/, text_encoder_2/ และ audio_vae/ ชื่อภายในของเช็กพอยต์ที่เผยแพร่ — videoT และ audioT — จะถูกแมปไปยัง video_dec_block และ audio_dec_block ตอนโหลด ซึ่งเป็นรายละเอียดประเภทที่กินเวลาไปเป็นวันถ้าคุณเป็นคนค้นพบมันเอง

• ระบบเสียงเปิดใช้งานตามค่าเริ่มต้น ไปป์ไลน์จะส่งออก AAC ที่ 44.1 kHz แทนที่จะถือว่าเสียงเป็นแฟล็กแบบเลือกเปิดใช้ ดังนั้นคำขอที่ไม่มีพารามิเตอร์เสียงก็ยังคงได้รับการตอบกลับพร้อมเสียงพูด เพลง หรือเสียงบรรยากาศที่ซิงโครไนซ์กัน

• อินพุตรูปภาพเป็นเฟรมท้ายที่ถูกมาสก์ ไม่ใช่โหมดแยกต่างหาก การปรับเงื่อนไขด้วยภาพอ้างอิงถูกนำมาใช้ผ่านการมาสก์ ซึ่งเป็นวิธีที่ไปป์ไลน์เดียวกันรองรับทั้ง T2AV และ I2AV โดยไม่ต้องแยกสาขา

การทดสอบ smoke test ของผู้ส่งถือเป็นค่าพื้นฐานที่มีประโยชน์: NVIDIA H100 80GB หนึ่งตัวพร้อม FlashAttention-3, เปิด CPU offload, 864×480, 125 เฟรม, 50 สเต็ป, CFG 5.0, seed 42 นั่นคือคลิป 5 วินาทีที่ความละเอียดต่ำกว่า HD เล็กน้อย ไม่ใช่การเรนเดอร์แบบ Full HD และ PR ก็ไม่ได้อ้างเป็นอย่างอื่น

จุดตรวจไม่ใช่บริการ

เหตุผลที่ต้องสนใจ merge แบบนี้คือสิ่งที่มันตัดออกไปจากรายการของคุณ การรัน reference implementation หมายถึงการโคลน repository การรัน just setup ปล่อยให้มันคอมไพล์ SageAttention บนอะไรก็ตามที่ต่ำกว่า Hopper ดาวน์โหลด checkpoint ลงในไดเรกทอรีแคช และเรียกใช้คำสั่ง generate ซึ่งผลลัพธ์ไปอยู่ในโฟลเดอร์ที่ตั้งชื่อตามเวลา ทั้งหมดนี้โอเคสำหรับการลองดูครั้งแรก แต่ไม่สะดวกสำหรับผลิตภัณฑ์

vLLM-Omni ให้โมเดลแก่คุณภายในโปรเซสการให้บริการ โดยมีจุดเริ่มต้นสำหรับการอนุมานแบบออฟไลน์แบบเดียวกับที่โปรเจกต์ใช้สำหรับโมเดลการแพร่กระจายอื่น ๆ ของมัน (examples/offline_inference/text_to_video/text_to_video.py และไฟล์พี่น้องสำหรับ image-to-video) และมีสูตรการให้บริการที่ recipes/Kandinsky/Kandinsky6-TI2VA.md ผลในทางปฏิบัติสองประการตามมา เรื่องการนำไปใช้งานของคุณกลายเป็นคอนเทนเนอร์ที่สื่อสารผ่านอินเทอร์เฟซ HTTP แทนที่จะเป็นสคริปต์ที่คุณต้องดูแลจัดการ และโมเดลก็ไม่ถือเป็นกรณีพิเศษในสแตกของคุณอีกต่อไป — มันอยู่เคียงข้างทุกอย่างที่คุณรันในเซิร์ฟเวอร์นั้น

โปรดสังเกตว่าสิ่งนี้ไม่ใช่อะไร มันไม่ใช่เอนด์พอยต์ที่โฮสต์ไว้ ไม่ใช่ราคา และไม่ใช่การวัดคุณภาพที่เป็นอิสระ มันเป็นอีกหนึ่งที่ที่โมเดลสามารถรันได้ ซึ่งมีคนนอกแล็บร่วมสมทบ สามวันหลังจากน้ำหนักโมเดลเปิดตัว

คลิปห้าวินาทีใช้เวลาจริงเท่าไรบนการ์ดจริง

ตารางของรีโพซิทอรีเองคือจุดเริ่มต้นที่ตรงไปตรงมา นี่คือเวลาทำงานของโมเดลฐานแบบไม่กลั่น สำหรับคลิป 5 วินาทีหนึ่งคลิปหลังจากวอร์มอัป โดยไม่นับรวมการโหลดเวทและการเข้ารหัส MP4 Full HD ในที่นี้หมายความว่าการประมวลผลซูเปอร์เรโซลูชันก็ทำงานอยู่ด้วย

• Full HD (Pro) — 402 วินาทีบน H100, 765 วินาทีบน RTX PRO 6000, 854 วินาทีบน RTX 5090, 1,106 วินาทีบน A100 80GB, 1,247 วินาทีบน RTX 4090 และ 3,530 วินาทีบน RTX 5060 Ti

• Full HD (Lite) — 284 วินาทีบน H100, 387 วินาทีบน RTX PRO 6000, 406 วินาทีบน RTX 5090, 664 วินาทีบน A100 80GB, 578 วินาทีบน RTX 4090 และ 1,774 วินาทีบน RTX 5060 Ti

• SD (Pro) — 356 วินาทีบน H100 เทียบกับ 936 วินาทีบน RTX 4090 ซึ่งเป็นจุดที่บทลงโทษของการ์ดระดับผู้บริโภคมีน้อยที่สุด และความคุ้มค่าทางเศรษฐศาสตร์ก็แย่น้อยที่สุด

รูปร่างของตารางนั้นสำคัญกว่าช่องใดช่องหนึ่งเดี่ยว ๆ มาก H100 เร็วกว่า 4090 ประมาณสามเท่าใน Pro Full HD และเร็วกว่า 5060 Ti ประมาณหกเท่าในงานเดียวกัน — แต่ขั้นตอน SR มีต้นทุนเท่ากันไม่ว่าจะเป็นขนาดโมเดลใด ประมาณ 64 วินาทีที่ HD และประมาณ 96 วินาทีที่ Full HD บน 5090 Lite ไม่ได้ช่วยให้คุณได้รอบซูเปอร์เรโซลูชันที่สั้นลง เพราะโมเดล SR ถูกเทรนแยกต่างหาก และไม่สนใจว่าโมเดลฐานตัวใดเป็นตัวป้อนข้อมูลให้มัน

เส้นทาง 16 GB และการตั้งค่าเพียงหนึ่งเดียวที่เปลี่ยนภาพของคุณ

หน่วยความจำที่จัดสรรมากที่สุดระหว่างการรัน Pro SD แตะที่ 72.8 GiB ซึ่งเกินกว่าการ์ดระดับผู้บริโภคทุกรุ่น รีพозиทอรีตอบโจทย์ด้วยการออฟโหลดบล็อก — ให้มีบล็อกทรานส์ฟอร์เมอร์ประจำการบน GPU เพียงสองบล็อกในแต่ละครั้ง ส่วนที่เหลือสตรีมจากหน่วยความจำโฮสต์ — พร้อมพรีเซ็ตสามแบบสำหรับการ์ด 32 GB, 24 GB และ 16 GB พรีเซ็ต 32 และ 24 GB เหมือนกัน เพราะเหนือ 24 GB ขึ้นไป ส่วนเผื่อที่เพิ่มขึ้นไม่ได้กลายเป็นความเร็ว

ข้อควรระวังนี้ถูกฝังไว้และควรค่าแก่การกล่าวซ้ำ: บนพรีเซ็ต 16 GB ตัวเข้ารหัสข้อความถูกควอนไทซ์เป็น NF4 และเปเปอร์ระบุชัดเจนว่านี่เป็นเพียงการเปลี่ยนแปลงพรีเซ็ตเดียวที่เปลี่ยนแปลงตัวคลิปเอง การแทนข้อความที่ต่างกันให้ผลลัพธ์เป็นวิดีโอที่ต่างกัน ทุกอย่างอื่น — ความยาวเซกเมนต์, แถบเชิงพื้นที่, การออฟโหลด — เปลี่ยนแปลงเอาต์พุตในระดับของสัญญาณรบกวนจากการปัดเศษ โดยประมาณ 12% ของพิกเซลต่างกันหนึ่งระดับความสว่าง ที่ค่า PSNR ประมาณ 57 dB หากคุณกำลังทำซ้ำผลลัพธ์ของคนอื่นบนการ์ด 16 GB แล้วผลไม่ตรงกัน นั่นคือสิ่งแรกที่ควรตรวจสอบ

สามสิ่งที่บันทึกประจำรุ่นไม่ได้ไขข้อสงสัย

• ห้าวินาทีคือขีดจำกัดสูงสุด ไม่ใช่ค่าเริ่มต้น โมเดลนี้ถูกฝึกที่ 121 เฟรมและ 24 fps และทั้งเปเปอร์และสูตรการให้บริการถูกสร้างขึ้นโดยอิงจากสิ่งนั้น ไม่มีโหมดขยายในเวอร์ชันที่เผยแพร่ อะไรที่ยาวกว่านี้ถือเป็นปัญหาการต่อคลิปที่คุณต้องจัดการเอง

• เช็กพอยต์แบบกลั่นกรอง (distilled) คือสิ่งที่คุณจะนำไปให้บริการจริง และผลการวัดอยู่ในระดับทัดเทียมกัน การทดลองแบบ ablation ในงานวิจัยระบุว่าโมเดลที่กลั่นกรองแล้วเป็นที่ชื่นชอบมากกว่าหรือเสมอกันในเกณฑ์ส่วนใหญ่ โดยไม่มีความแตกต่างใด ๆ ที่มีนัยสำคัญทางสถิติ ด้วยสัดส่วนความชื่นชอบเฉลี่ย 51% ต่อ 49% นั่นคือสิ่งที่คุณต้องแลกมาสำหรับความเร็ว

• ในบทความนี้มีตัวเลข WER (อัตราความผิดพลาดระดับคำ) สองตัว และตัวเลขทั้งสองไม่สามารถนำมาเปรียบเทียบกันได้ การลดลง 47% ของ WER ของเสียงที่สร้างขึ้นซึ่งมาพร้อมกับขั้นการเรียนรู้แบบเสริมกำลังนั้นวัดด้วย Whisper-large-v3 ซึ่งเป็นหนึ่งในโมเดลรางวัลของ RL ส่วน WER ที่รายงานควบคู่กับ VABench ใช้ Qwen3-ASR-1.7B กับชุดย่อยเสียงพูด ผู้เขียนเองก็บอกเช่นนั้น การอ้างตัวเลขหนึ่งแทนอีกตัวถือเป็นความผิดพลาดที่เกิดขึ้นได้ง่ายที่สุดกับการเปิดตัวครั้งนี้

ตำแหน่งที่เราเตอร์วางอยู่ในสแต็กแบบนี้

OrcaRouter ไม่ได้ให้บริการ Kandinsky 6.0 Video และไม่มีสิ่งใดในที่นี้ที่ควรถูกตีความว่าเป็นข้ออ้างว่าให้บริการดังกล่าว — โมเดลนี้คุณต้องรันเองจาก Hub หรือเข้าถึงได้ผ่านช่องทางของแล็บเองเท่านั้น สิ่งที่ไปป์ไลน์แบบนี้ต้องการจากเราเตอร์ก็คือข้อความที่อยู่รอบ ๆ ตัวมัน กระบวนการขยายพรอมป์ตที่เปลี่ยนคำอธิบายช็อตให้กลายเป็นแคปชันแบบยาว กลาง หรือสั้นที่โมเดลถูกฝึกมา งานแคปชันและทรานสคริปต์ที่ป้อนเข้าสู่ขั้นตอน image-to-video สรุปการรีวิวที่ใช้ตัดสินว่าจะเก็บภาพใดจากสี่เจเนอเรชัน สิ่งเหล่านี้ล้วนเป็นการเรียกข้อความธรรมดา ๆ และทำงานบนปลายทางที่เข้ากันได้กับ OpenAI เพียงจุดเดียว ครอบคลุมโมเดลกว่า 200 ตัว โดยราคาตามรายการของผู้ให้บริการถูกส่งต่อโดยบวกเพิ่มเพียง 0% ดังนั้นเมื่อผู้จำหน่ายปรับราคา ราคาใหม่จะมีผลทันทีในวันเดียวกัน การสลับไปใช้ระบบสำรองอัตโนมัติจึงสำคัญกว่าปกติในกรณีนี้ เพราะการเรนเดอร์ห้านาทีที่ล้มเหลวในขั้นตอนแคปชันควรถูกเปลี่ยนเส้นทางแทนที่จะเริ่มงานใหม่

สิ่งต่อไปที่ต้องจับตาดูไม่ใช่การรวมอีกครั้ง แต่เป็นตัวเลข Kandinsky 6.0 Video Pro มีผลลัพธ์ที่ผู้ขายรายงานเองบน VABench และการประเมินโดยมนุษย์ที่ดำเนินการในแล็บเทียบกับ Kling 2.6, Veo 3.1 Fast, MiniMax H3 และ Seedance 2.0 — และยังไม่มีคะแนนจากอารีนาอิสระ เมื่อมีคะแนนนั้นปรากฏขึ้น ข้ออ้างเรื่องโอเพนเวตจะเลิกเป็นข้อถกเถียงเรื่องการเข้าถึง และเริ่มเป็นข้อถกเถียงเรื่องคุณภาพ ซึ่งเป็นการเปรียบเทียบที่ตัดสินว่าโมเดลนี้เป็นโมเดลที่ทีมต่างๆ ดาวน์โหลด หรือเป็นโมเดลที่พวกเขาชื่นชม

A generated scoreboard titled 'Kandinsky 6.0 Video — the scoreboard' with a single column of six rows: 'Sizes: Pro 29B, Lite 3B', 'Clip length: 5s fixed', 'Audio: 44 kHz lip-sync', 'Resolution: Full HD plus SR', 'Licence: MIT' and 'Serving: vLLM-Omni day 0'. A footer reads 'All figures vendor-reported; no independent Elo yet. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the GitHub repository page for kandinskylab/kandinsky-6, showing 11 commits, 35 stars and 4 forks, an MIT license badge, and a README titled 'Kandinsky 6.0: A family of diffusion models for Video + Audio Generation' with badges for KANDINSKYLAB, REPORT, DIFFUSERS and COMFYUI; recent commits include 'README update', 'Added source code', 'Some improvements for just generate' and 'Keep ComfyUI user documentation in README'.

ที่เก็บโค้ดนี้ยังมาพร้อมโหนด ComfyUI สองตัว — kandinsky6 และ kandinsky6-sr — ที่ติดตั้งได้ผ่าน ComfyUI Manager และ Hugging Face Spaces อีกสองแห่ง: แห่งหนึ่งสำหรับเช็คพอยต์ Pro distill และอีกแห่งสำหรับเดโมการซูเปอร์เรโซลูชันวิดีโอ ระหว่าง CLI, โหนด ComfyUI, ชุดรวม diffusers และตอนนี้ก็มีไปป์ไลน์ vLLM-Omni ขอบเขตการนำไปใช้งานในวันที่สามนั้นกว้างกว่าที่โมเดลวิดีโอโอเพนซอร์สส่วนใหญ่ทำได้ในหนึ่งไตรมาส ความกว้างนี้คือเรื่องราวจริงของสัปดาห์: Sber เปิดตัวทั้งตระกูล ไม่ใช่เปเปอร์ที่แนบเดโมมา

A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube