
Kandinsky 6.0 Video มาสู่ vLLM-Omni: เลเยอร์การให้บริการเพิ่มอะไรให้กับโมเดลแบบเปิด
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 150 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
พูลรีเควสต์ #8537 ถูก merge เข้า vLLM-Omni เมื่อเวลา 07:55 UTC เช้านี้ และมันทำสิ่งเดียวเท่านั้น: ทำให้ Kandinsky 6.0 Video สามารถให้บริการได้ โมเดลนี้มาถึงจาก Kandinsky Lab ของ Sber ในวันเดียวกันเป็นคู่ — Kandinsky 6.0 Video Pro ที่ 29B พารามิเตอร์ และ Kandinsky 6.0 Video Lite ที่ 3B — สร้างคลิปห้าวินาทีพร้อมเสียง 44 kHz ที่ซิงโครไนซ์กัน รวมถึง lip-sync จากพรอมป์ข้อความหรือภาพอ้างอิง โดยมีโค้ด น้ำหนักโมเดล และการผสานรวม diffusers ทั้งหมดภายใต้ MIT สิ่งที่มันยังไม่มีจนถึงเช้านี้คือวิธีรันมันภายในเซิร์ฟเวอร์ inference แทนที่จะเป็นบรรทัดคำสั่งแบบใช้ครั้งเดียว
ความแตกต่างนั้นมีค่ามากกว่าที่มันฟังดู และนี่คือเหตุผลที่เรื่องนี้เป็นเรื่องแยกต่างหากจากรีลีส เช็คพอยต์แบบเปิดที่คุณรันบนการ์ดของตัวเองได้เป็นเพียงอาร์ติแฟกต์งานวิจัย ส่วนเช็คพอยต์แบบเปิดที่มีไปป์ไลน์ฝั่งเซิร์ฟเวอร์ มีจุดเข้าใช้งานที่แชร์ร่วมกัน และมีสูตรการให้บริการ คือสิ่งที่คุณนำไปวางไว้หลังคิวได้ รีลีสของสัปดาห์นี้มอบอย่างแรกให้คุณ การ merge ของวันนี้คือจุดเริ่มต้นของอย่างที่สอง
สิ่งที่ถูกผสานรวมจริง ๆ
PR นี้เพิ่มความสามารถ text-to-video-and-audio และ image-to-video-and-audio ให้กับ vLLM-Omni จากเช็กพอยต์ kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers ตัวเลือกทางวิศวกรรมต่าง ๆ คือส่วนที่น่าสนใจ เพราะมันบอกให้เห็นว่าสถาปัตยกรรมมีหน้าตาจริง ๆ อย่างไรเมื่อคนอื่นที่ไม่ใช่ผู้เขียนต้องนำมันไปให้บริการ
• DiT ตัวเดียวลดสัญญาณรบกวนทั้งสองมอดาลิตี ไปป์ไลน์นี้ลงทะเบียนเป็น Kandinsky6TI2VAPipeline และเลเทนต์วิดีโอกับเลเทนต์เสียงจะถูกลดสัญญาณรบกวนร่วมกันโดยทรานส์ฟอร์มเมอร์เพียงตัวเดียว แทนที่จะเป็นสองโมเดลที่รันตามลำดับ ซึ่งสอดคล้องกับ CrossDiT แบบสองสตรีมในเปเปอร์ ที่ซึ่งสตรีมวิดีโอที่ผ่านการฝึกมาแล้วและสตรีมเสียงที่สร้างขึ้นจากศูนย์ถูกเชื่อมต่อกันด้วย cross-attention แบบสองทิศทาง
• โหลดเวตทีละโฟลเดอร์ โดยเช็กพอยต์จาก Hub จะถูกอ่านเป็น transformer/, vae/, text_encoder/, text_encoder_2/ และ audio_vae/ ชื่อภายในของเช็กพอยต์ที่เผยแพร่ — videoT และ audioT — จะถูกแมปไปยัง video_dec_block และ audio_dec_block ตอนโหลด ซึ่งเป็นรายละเอียดประเภทที่กินเวลาไปเป็นวันถ้าคุณเป็นคนค้นพบมันเอง
• ระบบเสียงเปิดใช้งานตามค่าเริ่มต้น ไปป์ไลน์จะส่งออก AAC ที่ 44.1 kHz แทนที่จะถือว่าเสียงเป็นแฟล็กแบบเลือกเปิดใช้ ดังนั้นคำขอที่ไม่มีพารามิเตอร์เสียงก็ยังคงได้รับการตอบกลับพร้อมเสียงพูด เพลง หรือเสียงบรรยากาศที่ซิงโครไนซ์กัน
• อินพุตรูปภาพเป็นเฟรมท้ายที่ถูกมาสก์ ไม่ใช่โหมดแยกต่างหาก การปรับเงื่อนไขด้วยภาพอ้างอิงถูกนำมาใช้ผ่านการมาสก์ ซึ่งเป็นวิธีที่ไปป์ไลน์เดียวกันรองรับทั้ง T2AV และ I2AV โดยไม่ต้องแยกสาขา
การทดสอบ smoke test ของผู้ส่งถือเป็นค่าพื้นฐานที่มีประโยชน์: NVIDIA H100 80GB หนึ่งตัวพร้อม FlashAttention-3, เปิด CPU offload, 864×480, 125 เฟรม, 50 สเต็ป, CFG 5.0, seed 42 นั่นคือคลิป 5 วินาทีที่ความละเอียดต่ำกว่า HD เล็กน้อย ไม่ใช่การเรนเดอร์แบบ Full HD และ PR ก็ไม่ได้อ้างเป็นอย่างอื่น
จุดตรวจไม่ใช่บริการ
เหตุผลที่ต้องสนใจ merge แบบนี้คือสิ่งที่มันตัดออกไปจากรายการของคุณ การรัน reference implementation หมายถึงการโคลน repository การรัน just setup ปล่อยให้มันคอมไพล์ SageAttention บนอะไรก็ตามที่ต่ำกว่า Hopper ดาวน์โหลด checkpoint ลงในไดเรกทอรีแคช และเรียกใช้คำสั่ง generate ซึ่งผลลัพธ์ไปอยู่ในโฟลเดอร์ที่ตั้งชื่อตามเวลา ทั้งหมดนี้โอเคสำหรับการลองดูครั้งแรก แต่ไม่สะดวกสำหรับผลิตภัณฑ์
vLLM-Omni ให้โมเดลแก่คุณภายในโปรเซสการให้บริการ โดยมีจุดเริ่มต้นสำหรับการอนุมานแบบออฟไลน์แบบเดียวกับที่โปรเจกต์ใช้สำหรับโมเดลการแพร่กระจายอื่น ๆ ของมัน (examples/offline_inference/text_to_video/text_to_video.py และไฟล์พี่น้องสำหรับ image-to-video) และมีสูตรการให้บริการที่ recipes/Kandinsky/Kandinsky6-TI2VA.md ผลในทางปฏิบัติสองประการตามมา เรื่องการนำไปใช้งานของคุณกลายเป็นคอนเทนเนอร์ที่สื่อสารผ่านอินเทอร์เฟซ HTTP แทนที่จะเป็นสคริปต์ที่คุณต้องดูแลจัดการ และโมเดลก็ไม่ถือเป็นกรณีพิเศษในสแตกของคุณอีกต่อไป — มันอยู่เคียงข้างทุกอย่างที่คุณรันในเซิร์ฟเวอร์นั้น
โปรดสังเกตว่าสิ่งนี้ไม่ใช่อะไร มันไม่ใช่เอนด์พอยต์ที่โฮสต์ไว้ ไม่ใช่ราคา และไม่ใช่การวัดคุณภาพที่เป็นอิสระ มันเป็นอีกหนึ่งที่ที่โมเดลสามารถรันได้ ซึ่งมีคนนอกแล็บร่วมสมทบ สามวันหลังจากน้ำหนักโมเดลเปิดตัว
คลิปห้าวินาทีใช้เวลาจริงเท่าไรบนการ์ดจริง
ตารางของรีโพซิทอรีเองคือจุดเริ่มต้นที่ตรงไปตรงมา นี่คือเวลาทำงานของโมเดลฐานแบบไม่กลั่น สำหรับคลิป 5 วินาทีหนึ่งคลิปหลังจากวอร์มอัป โดยไม่นับรวมการโหลดเวทและการเข้ารหัส MP4 Full HD ในที่นี้หมายความว่าการประมวลผลซูเปอร์เรโซลูชันก็ทำงานอยู่ด้วย
• Full HD (Pro) — 402 วินาทีบน H100, 765 วินาทีบน RTX PRO 6000, 854 วินาทีบน RTX 5090, 1,106 วินาทีบน A100 80GB, 1,247 วินาทีบน RTX 4090 และ 3,530 วินาทีบน RTX 5060 Ti
• Full HD (Lite) — 284 วินาทีบน H100, 387 วินาทีบน RTX PRO 6000, 406 วินาทีบน RTX 5090, 664 วินาทีบน A100 80GB, 578 วินาทีบน RTX 4090 และ 1,774 วินาทีบน RTX 5060 Ti
• SD (Pro) — 356 วินาทีบน H100 เทียบกับ 936 วินาทีบน RTX 4090 ซึ่งเป็นจุดที่บทลงโทษของการ์ดระดับผู้บริโภคมีน้อยที่สุด และความคุ้มค่าทางเศรษฐศาสตร์ก็แย่น้อยที่สุด
รูปร่างของตารางนั้นสำคัญกว่าช่องใดช่องหนึ่งเดี่ยว ๆ มาก H100 เร็วกว่า 4090 ประมาณสามเท่าใน Pro Full HD และเร็วกว่า 5060 Ti ประมาณหกเท่าในงานเดียวกัน — แต่ขั้นตอน SR มีต้นทุนเท่ากันไม่ว่าจะเป็นขนาดโมเดลใด ประมาณ 64 วินาทีที่ HD และประมาณ 96 วินาทีที่ Full HD บน 5090 Lite ไม่ได้ช่วยให้คุณได้รอบซูเปอร์เรโซลูชันที่สั้นลง เพราะโมเดล SR ถูกเทรนแยกต่างหาก และไม่สนใจว่าโมเดลฐานตัวใดเป็นตัวป้อนข้อมูลให้มัน
เส้นทาง 16 GB และการตั้งค่าเพียงหนึ่งเดียวที่เปลี่ยนภาพของคุณ
หน่วยความจำที่จัดสรรมากที่สุดระหว่างการรัน Pro SD แตะที่ 72.8 GiB ซึ่งเกินกว่าการ์ดระดับผู้บริโภคทุกรุ่น รีพозиทอรีตอบโจทย์ด้วยการออฟโหลดบล็อก — ให้มีบล็อกทรานส์ฟอร์เมอร์ประจำการบน GPU เพียงสองบล็อกในแต่ละครั้ง ส่วนที่เหลือสตรีมจากหน่วยความจำโฮสต์ — พร้อมพรีเซ็ตสามแบบสำหรับการ์ด 32 GB, 24 GB และ 16 GB พรีเซ็ต 32 และ 24 GB เหมือนกัน เพราะเหนือ 24 GB ขึ้นไป ส่วนเผื่อที่เพิ่มขึ้นไม่ได้กลายเป็นความเร็ว
ข้อควรระวังนี้ถูกฝังไว้และควรค่าแก่การกล่าวซ้ำ: บนพรีเซ็ต 16 GB ตัวเข้ารหัสข้อความถูกควอนไทซ์เป็น NF4 และเปเปอร์ระบุชัดเจนว่านี่เป็นเพียงการเปลี่ยนแปลงพรีเซ็ตเดียวที่เปลี่ยนแปลงตัวคลิปเอง การแทนข้อความที่ต่างกันให้ผลลัพธ์เป็นวิดีโอที่ต่างกัน ทุกอย่างอื่น — ความยาวเซกเมนต์, แถบเชิงพื้นที่, การออฟโหลด — เปลี่ยนแปลงเอาต์พุตในระดับของสัญญาณรบกวนจากการปัดเศษ โดยประมาณ 12% ของพิกเซลต่างกันหนึ่งระดับความสว่าง ที่ค่า PSNR ประมาณ 57 dB หากคุณกำลังทำซ้ำผลลัพธ์ของคนอื่นบนการ์ด 16 GB แล้วผลไม่ตรงกัน นั่นคือสิ่งแรกที่ควรตรวจสอบ
สามสิ่งที่บันทึกประจำรุ่นไม่ได้ไขข้อสงสัย
• ห้าวินาทีคือขีดจำกัดสูงสุด ไม่ใช่ค่าเริ่มต้น โมเดลนี้ถูกฝึกที่ 121 เฟรมและ 24 fps และทั้งเปเปอร์และสูตรการให้บริการถูกสร้างขึ้นโดยอิงจากสิ่งนั้น ไม่มีโหมดขยายในเวอร์ชันที่เผยแพร่ อะไรที่ยาวกว่านี้ถือเป็นปัญหาการต่อคลิปที่คุณต้องจัดการเอง
• เช็กพอยต์แบบกลั่นกรอง (distilled) คือสิ่งที่คุณจะนำไปให้บริการจริง และผลการวัดอยู่ในระดับทัดเทียมกัน การทดลองแบบ ablation ในงานวิจัยระบุว่าโมเดลที่กลั่นกรองแล้วเป็นที่ชื่นชอบมากกว่าหรือเสมอกันในเกณฑ์ส่วนใหญ่ โดยไม่มีความแตกต่างใด ๆ ที่มีนัยสำคัญทางสถิติ ด้วยสัดส่วนความชื่นชอบเฉลี่ย 51% ต่อ 49% นั่นคือสิ่งที่คุณต้องแลกมาสำหรับความเร็ว
• ในบทความนี้มีตัวเลข WER (อัตราความผิดพลาดระดับคำ) สองตัว และตัวเลขทั้งสองไม่สามารถนำมาเปรียบเทียบกันได้ การลดลง 47% ของ WER ของเสียงที่สร้างขึ้นซึ่งมาพร้อมกับขั้นการเรียนรู้แบบเสริมกำลังนั้นวัดด้วย Whisper-large-v3 ซึ่งเป็นหนึ่งในโมเดลรางวัลของ RL ส่วน WER ที่รายงานควบคู่กับ VABench ใช้ Qwen3-ASR-1.7B กับชุดย่อยเสียงพูด ผู้เขียนเองก็บอกเช่นนั้น การอ้างตัวเลขหนึ่งแทนอีกตัวถือเป็นความผิดพลาดที่เกิดขึ้นได้ง่ายที่สุดกับการเปิดตัวครั้งนี้
ตำแหน่งที่เราเตอร์วางอยู่ในสแต็กแบบนี้
OrcaRouter ไม่ได้ให้บริการ Kandinsky 6.0 Video และไม่มีสิ่งใดในที่นี้ที่ควรถูกตีความว่าเป็นข้ออ้างว่าให้บริการดังกล่าว — โมเดลนี้คุณต้องรันเองจาก Hub หรือเข้าถึงได้ผ่านช่องทางของแล็บเองเท่านั้น สิ่งที่ไปป์ไลน์แบบนี้ต้องการจากเราเตอร์ก็คือข้อความที่อยู่รอบ ๆ ตัวมัน กระบวนการขยายพรอมป์ตที่เปลี่ยนคำอธิบายช็อตให้กลายเป็นแคปชันแบบยาว กลาง หรือสั้นที่โมเดลถูกฝึกมา งานแคปชันและทรานสคริปต์ที่ป้อนเข้าสู่ขั้นตอน image-to-video สรุปการรีวิวที่ใช้ตัดสินว่าจะเก็บภาพใดจากสี่เจเนอเรชัน สิ่งเหล่านี้ล้วนเป็นการเรียกข้อความธรรมดา ๆ และทำงานบนปลายทางที่เข้ากันได้กับ OpenAI เพียงจุดเดียว ครอบคลุมโมเดลกว่า 200 ตัว โดยราคาตามรายการของผู้ให้บริการถูกส่งต่อโดยบวกเพิ่มเพียง 0% ดังนั้นเมื่อผู้จำหน่ายปรับราคา ราคาใหม่จะมีผลทันทีในวันเดียวกัน การสลับไปใช้ระบบสำรองอัตโนมัติจึงสำคัญกว่าปกติในกรณีนี้ เพราะการเรนเดอร์ห้านาทีที่ล้มเหลวในขั้นตอนแคปชันควรถูกเปลี่ยนเส้นทางแทนที่จะเริ่มงานใหม่
สิ่งต่อไปที่ต้องจับตาดูไม่ใช่การรวมอีกครั้ง แต่เป็นตัวเลข Kandinsky 6.0 Video Pro มีผลลัพธ์ที่ผู้ขายรายงานเองบน VABench และการประเมินโดยมนุษย์ที่ดำเนินการในแล็บเทียบกับ Kling 2.6, Veo 3.1 Fast, MiniMax H3 และ Seedance 2.0 — และยังไม่มีคะแนนจากอารีนาอิสระ เมื่อมีคะแนนนั้นปรากฏขึ้น ข้ออ้างเรื่องโอเพนเวตจะเลิกเป็นข้อถกเถียงเรื่องการเข้าถึง และเริ่มเป็นข้อถกเถียงเรื่องคุณภาพ ซึ่งเป็นการเปรียบเทียบที่ตัดสินว่าโมเดลนี้เป็นโมเดลที่ทีมต่างๆ ดาวน์โหลด หรือเป็นโมเดลที่พวกเขาชื่นชม


ที่เก็บโค้ดนี้ยังมาพร้อมโหนด ComfyUI สองตัว — kandinsky6 และ kandinsky6-sr — ที่ติดตั้งได้ผ่าน ComfyUI Manager และ Hugging Face Spaces อีกสองแห่ง: แห่งหนึ่งสำหรับเช็คพอยต์ Pro distill และอีกแห่งสำหรับเดโมการซูเปอร์เรโซลูชันวิดีโอ ระหว่าง CLI, โหนด ComfyUI, ชุดรวม diffusers และตอนนี้ก็มีไปป์ไลน์ vLLM-Omni ขอบเขตการนำไปใช้งานในวันที่สามนั้นกว้างกว่าที่โมเดลวิดีโอโอเพนซอร์สส่วนใหญ่ทำได้ในหนึ่งไตรมาส ความกว้างนี้คือเรื่องราวจริงของสัปดาห์: Sber เปิดตัวทั้งตระกูล ไม่ใช่เปเปอร์ที่แนบเดโมมา

