ไทเทิลการ์ดสำหรับบทความที่เปรียบเทียบ Kandinsky 6.0 Video กับคู่แข่งที่ระบุชื่อ โดยมีคำบรรยายรองว่า “เวอร์ชันในเปเปอร์ไม่ใช่เวอร์ชันที่คุณซื้อ” พร้อมป้ายกำกับสนับสนุนสามป้ายที่นำมาจากหลักฐานของบทความเอง
Engineering & Research

Kandinsky 6.0 Video กับ Seedance 2.5: เวอร์ชันในเปเปอร์ไม่ใช่เวอร์ชันที่คุณซื้อ

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ประโยคที่ถูกอ้างอิงมากที่สุดในการเทียบครั้งนี้คือการเปรียบเทียบกับโมเดลที่ผิด รายงานทางเทคนิคของ Kandinsky 6.0 Video ซึ่งเผยแพร่เมื่อวันที่ 6 ตุลาคม 2026 พร้อมการเปิดให้ใช้เวตภายใต้สัญญาอนุญาต MIT ได้ทำการทดสอบเปรียบเทียบกับ Dreamina Seedance 2.0 — ซึ่งเป็นรุ่นก่อนหน้า Seedance 2.5 โมเดลวิดีโอและเสียงรุ่นปัจจุบันของ ByteDance เปิดให้ใช้งานมาตั้งแต่วันที่ 31 กรกฎาคม 2026 และเป็นรุ่นที่วางจำหน่ายอยู่จริง ดังนั้น เมื่อรายงานสรุปว่า Seedance "เป็นที่ชื่นชอบมากกว่าเมื่อพิจารณาจากเกณฑ์ด้านภาพ โดยมีส่วนต่างที่มีนัยสำคัญทางสถิติในด้านคุณภาพภาพโดยรวม อาร์ติแฟกต์ ความสมจริงของการเคลื่อนไหว และการทำตามพรอมป์ต์ด้านภาพ" นั่นคือการอธิบายบิลด์ที่คุณไม่สามารถขอสิทธิ์ใช้งานได้ในวันนี้ ซึ่งประเมินโดยแล็บที่เขียน Kandinsky 6.0 Video ขึ้นมา ทั้งสองครึ่งของประโยคนั้นล้วนสำคัญ และไม่มีครึ่งใดเป็นเหตุผลให้เพิกเฉยต่อการเปรียบเทียบนี้ — ช่องว่างระหว่างเวอร์ชันกำหนดขอบเขตล่างว่ามันบอกอะไรคุณได้มากน้อยเพียงใด และการวางกรอบเช่นนี้บอกคุณว่าควรเชื่อใครในเรื่องอะไร

มีอะไรเปลี่ยนแปลงไประหว่างสองเวอร์ชันของ Seedance

การก้าวจาก 2.0 สู่ 2.5 ไม่ใช่การวาดใหม่ทับ ซึ่งเป็นเหตุผลว่าทำไมการแทนที่นี้จึงไม่ใช่แค่เรื่องผิวเผิน Seedance 2.5 สร้างได้นานสูงสุดสามสิบวินาทีในครั้งเดียว — มากกว่าขอบเขตความสามารถของโมเดลในรายงานถึงหกเท่า และมากกว่าห้าวินาทีคงที่ของ Kandinsky 6.0 Video ถึงหกเท่า มันเพิ่มการกำหนดเป้าหมายระดับไทม์สแตมป์และการแก้ไขหลังสร้างในระดับพื้นที่ ซึ่งหมายความว่าการเปลี่ยนแปลงสามารถนำไปใช้กับช่วงหนึ่งของคลิปหรือบางส่วนของเฟรมได้ แทนที่จะสร้างทั้งชิ้นใหม่ มันอ่านข้อความพร้อมกับภาพราวสามสิบภาพ วิดีโอสิบคลิป และคลิปเสียงสิบคลิปเป็นวัสดุอ้างอิงในคำขอเดียว เทียบกับเฟรมหางที่ถูกมาสก์เพียงหนึ่งเฟรมของ Kandinsky 6.0 Video และมันสร้างเสียงที่ซิงโครไนซ์พร้อมบทสนทนา ซึ่งเป็นเหตุผลเดียวที่คู่นี้ควรอยู่ในบทความเดียวกันตั้งแต่แรก

ทั้งหมดนั้นล้วนเป็นความสามารถที่การประเมินในรายงานไม่ได้ทดสอบ ดังนั้นผลลัพธ์ตามเกณฑ์ด้านภาพจึงบอกคุณได้เพียงว่า Kandinsky 6.0 Video เป็นรองรุ่นก่อนของ Seedance ในด้านคุณภาพภาพโดยรวม อาร์ติแฟกต์ ความสมจริงของการเคลื่อนไหว และการทำตามพรอมป์ต์ แต่ไม่ได้บอกว่าบิลด์ปัจจุบันจะทำได้แค่ไหน และข้อสันนิษฐานที่ซื่อตรงก็คือ รุ่นใหม่กว่าจะไม่แย่ลงในด้านต่าง ๆ ที่บันทึกการเผยแพร่ของตัวเองเน้นไว้

สิ่งที่การประเมินของรายงานเองยืนยันและไม่ได้ยืนยัน

วิธีการนี้ได้รับการเปิดเผยอย่างละเอียดเพียงพอที่จะนำมาชั่งน้ำหนักได้ โดยใช้คู่เทียบแบบเคียงข้างกันที่สร้างจากพรอมป์ต์เดียวกันด้วยสองโมเดล คลิปทั้งสองถูกทำให้ไม่ระบุตัวตน ตำแหน่งซ้าย/ขวาถูกสุ่มสำหรับแต่ละงาน ลำดับงานถูกสลับ ปิดเสียงก่อนสำหรับคำถามเชิงภาพแล้วจึงเปิดเสียงสำหรับคำถามเชิงเสียง มีตัวเลือกเสมอแบบสมมาตรและตัวเลือก N/A อย่างชัดเจนในกรณีที่ไม่สามารถตัดสินเกณฑ์ได้ การรวมผลแบบเสียงข้างมากจากผู้ติดป้ายกำกับ และการเปรียบเทียบแบบเป็นคู่ประมาณ 200 คู่ขึ้นไปสำหรับแต่ละเกณฑ์ที่ประเมิน

ในวิธีนั้น ผลลัพธ์ของ Seedance 2.0 แยกออกในแบบที่ใครก็ตามที่เคยอ่านการเปรียบเทียบ Kling ในรายงานฉบับเดียวกันจะคุ้นเคย เกณฑ์ด้านภาพตกเป็นของ Seedance ด้วยส่วนต่างที่ผ่านระดับมีนัยสำคัญ ด้านเสียงนั้นใกล้กันกว่ามาก: การซิงโครไนซ์เสียง-วิดีโอเกือบเสมอกัน และคุณภาพเสียงพูดเป็นต่อ Kandinsky 6.0 Video Pro ระหว่างสองข้อความนั้นคือการตัดสินใจทั้งหมด เพราะมันหมายความว่าเช็กพอยต์เสียง-วิดีโอแบบเปิดล่าสุดตามหลังอย่างวัดได้ในเรื่องรูปลักษณ์ของคลิป และนำหน้าอย่างวัดได้ในเรื่องเสียงพูดในคลิปนั้นฟังเป็นอย่างไร

ข้อจำกัดของผลลัพธ์นั้นเป็นข้อจำกัดทั่วไป และไม่มีข้อใดถึงขั้นทำให้ผลลัพธ์นั้นใช้ไม่ได้ การทดสอบนี้ดำเนินการโดยผู้เขียน Kandinsky โดยใช้พรอมป์ที่พวกเขาเลือกเอง และใช้ผู้ประเมินที่พวกเขาคัดเลือกมาเอง ไม่มีเวทีทดสอบแบบตาบอดสาธารณะใดให้คะแนน Kandinsky 6.0 Video เลย ดังนั้นจึงยังไม่มีสิ่งภายนอกใดทดสอบว่าพรอมป์ของบุคคลภายนอกจะให้ผลลัพธ์ที่แยกออกมาแบบเดียวกันหรือไม่ รายงานยังเปิดเผยเพดานที่กำลังวัดเทียบด้วย: คลิปความยาวไม่เกิน 5 วินาที การสร้างพื้นฐานที่ความละเอียด SD โดยไปถึง Full HD ผ่านขั้นตอนการเพิ่มความละเอียดแบบซูเปอร์เรโซลูชัน และช่องว่างที่ยังเหลืออยู่เมื่อเทียบกับระบบที่เป็นกรรมสิทธิ์ที่แข็งแกร่งที่สุดในด้านคุณภาพภาพและคุณภาพเสียงโดยรวม

ช่องว่างเชิงโครงสร้างสามประการที่ไม่มีเกณฑ์มาตรฐานใดจะจับได้

ระยะเวลาเป็นข้อแรกและตรงไปตรงมาที่สุด Kandinsky 6.0 Video ถูกฝึกและประเมินผลที่ 121 เฟรม รัน inference ที่ 121 เฟรม หรือ 5 วินาทีที่ 24 fps และไม่มีโหมดขยายความยาวมาให้ — ชิ้นงาน 30 วินาทีจึงต้องสร้าง 6 ครั้ง ต่อ 5 จุด และความเสี่ยงด้านความต่อเนื่องที่คุณต้องรับผิดชอบเอง Seedance 2.5 ทำ 30 วินาทีในครั้งเดียว สำหรับการแลกบทสนทนาครั้งเดียว การพาชมผลิตภัณฑ์ หรืออะไรก็ตามที่รอยต่อจะมองเห็นได้ นั่นไม่ใช่ความแตกต่างด้าน benchmark แต่เป็นความแตกต่างว่างานนี้จะเป็นการเรนเดอร์ครั้งเดียวหรือเป็นขั้นตอนการประกอบ

อย่างที่สองคือการปรับเงื่อนไขด้วยภาพอ้างอิง และความไม่สมมาตรนั้นชัดเจนมาก Kandinsky 6.0 Video รับภาพอ้างอิงเพียงภาพเดียวแล้วนำไปใช้เป็นเฟรมท้ายที่ถูกมาสก์ — เป็นคีย์เฟรมสำหรับอินเทอร์โพเลตเข้าหา Seedance 2.5 รับชุดทำงานซึ่งประกอบด้วยภาพราวสามสิบภาพ คลิปวิดีโอสิบคลิป และคลิปเสียงสิบคลิปเป็นบริบทเดียว ความสม่ำเสมอของตัวละครตลอดทั้งลำดับ การถ่ายโอนสไตล์จากมู้ดบอร์ด การแสดงที่นำเข้ามาจากคลิปที่มีอยู่: สิ่งเหล่านี้คือภาระงานที่จำนวนภาพอ้างอิงทำให้เป็นไปได้ และโหมดเฟรมเดียวไม่ได้พยายามทำ

ข้อที่สามคือความสามารถในการแก้ไข และเป็นข้อที่เปลี่ยนแปลงกระบวนการทำงานมากกว่าจะเปลี่ยนเพียงช็อตเดียว การแก้ไขระดับภูมิภาคและระดับเวลาหมายความว่าช่วงสามวินาทีที่มีข้อบกพร่องจะถูกซ่อมแซมในตำแหน่งเดิม Kandinsky 6.0 Video ไม่มีพื้นที่สำหรับแก้ไข — ห้าวินาทีที่ไม่ดีจะถูกสร้างใหม่ และหากมันถูกต่อเข้ากับอีกสี่ช่วง การเชื่อมต่อก็จะถูกพิจารณาใหม่ด้วย ทีมที่คิดราคานิสัยการเรนเดอร์ซ้ำควรคิดความแตกต่างนั้นเข้าไปในการเลือกโมเดล แทนที่จะมาค้นพบภายหลัง

• ระยะเวลา — Kandinsky 6.0 Video: คงที่ 5 วินาที, 121 เฟรม ที่ 24 fps, ไม่มีโหมดขยาย Seedance 2.5: สูงสุด 30 วินาทีในรอบเดียว

• การปรับเงื่อนไขด้วยข้อมูลอ้างอิง — Kandinsky 6.0 Video: หนึ่งภาพ ใช้เป็นเฟรมท้ายแบบมาสก์ Seedance 2.5: ประมาณ 30 ภาพ 10 วิดีโอ และ 10 คลิปเสียงต่อคำขอ

• การตัดต่อ — Kandinsky 6.0 Video: ไม่มี; สร้างใหม่และเชื่อมต่อใหม่ Seedance 2.5: การกำหนดเป้าหมายระดับเวลาและการแก้ไขหลังการสร้างระดับพื้นที่

• ความละเอียด — Kandinsky 6.0 Video: SD ที่ 512×768, Full HD 1920×1080 ผ่านขั้นตอน super-resolution ที่มีมาให้ในตัว Seedance 2.5: ขึ้นอยู่กับโหมด โดยราคาต่อคลิปจะกำหนดตามความละเอียดที่คุณเลือก

• เสียง — Kandinsky 6.0 Video: 44 kHz พร้อมลิปซิงก์ สร้างร่วมกับภาพ Seedance 2.5: เสียงที่ซิงโครไนซ์รวมถึงบทสนทนา สร้างพร้อมกับวิดีโอ

• เวต (Weights) — Kandinsky 6.0 Video: MIT, Lite 3B และ Pro 29B พร้อมโค้ดและการผสานรวม diffusers ส่วน Seedance 2.5: ไม่มี

มิเตอร์สองตัวที่ไม่แปลงเข้าหากัน

Seedance 2.5 คิดค่าบริการเป็นโทเคน ซึ่งอยู่ที่ประมาณ $0.51 สำหรับคลิปความยาวห้าวินาทีที่ 480p และประมาณ $1.16 ที่ 720p เหตุผลที่ต้องพูดแบบนั้นแทนที่จะบอกเป็นอัตราต่อวินาที คือจำนวนโทเคนจะปรับตามความยาวของฟุตเทจ ดังนั้นการสร้างความยาวสามสิบวินาทีจึงไม่ใช่อัตราคงที่สำหรับสามสิบวินาที — มันคือจำนวนโทเคนเป็นหกเท่าของคลิปห้าวินาทีที่การตั้งค่าเดียวกัน และการดำเนินการตัดต่อจะคิดราคาตามสิ่งที่มันแตะต้อง ไปป์ไลน์ที่สร้างใหม่เป็นประจำจะพบว่ามิเตอร์ตอบสนองต่อนิสัยนั้น

Kandinsky 6.0 Video ไม่มีมาตรวัดค่าใช้จ่ายเพราะไม่มีอะไรให้ซื้อ ต้นทุนของมันคือเครื่องหนึ่งเครื่องกับนาฬิกาหนึ่งเรือน และรายงานก็ให้ค่าเวลามา: ใช้เวลาทำงานประมาณ 402 วินาทีบน H100 สำหรับคลิป Pro Full HD ความยาวห้าวินาที, 854 บน RTX 5090, 1,247 บน RTX 4090, จำเป็นต้องใช้ block offloading เมื่อการจัดสรรหน่วยความจำสูงสุดต่ำกว่า 72.8 GiB และพรีเซ็ต VRAM 16 GB ที่ควอนไทซ์ text encoder เป็น NF4 — เป็นการเปลี่ยนพรีเซ็ตเพียงอย่างเดียวที่รายงานระบุว่าส่งผลต่อตัวคลิปเอง เช็กพอยต์แบบกลั่น ซึ่งวัดแล้วอยู่ในระดับเดียวกับโมเดลเต็มด้วยความชอบเฉลี่ย 51% ต่อ 49% โดยไม่มีเกณฑ์ใดแตะระดับนัยสำคัญทางสถิติ คือสิ่งที่ทำให้ตัวเลขเหล่านั้นใช้งานได้จริง

• ค่าใช้จ่ายต่อ 5 วินาที — Kandinsky 6.0 Video: ไม่มีราคาที่ประกาศไว้; ใช้เวลา 6 ถึง 21 นาทีบน GPU หนึ่งตัว ขึ้นอยู่กับการ์ด Seedance 2.5: ประมาณ $0.51 ที่ 480p และ $1.16 ที่ 720p เมื่อคิดเป็นโทเคน

ไม่มีสิ่งใดในสองบรรทัดนั้นที่เทียบเคียงกันได้ และความพยายามตามปกติที่จะย่อให้เหลือตัวเลขเดียว — ด้วยการนำอัตราค่า GPU ต่อชั่วโมงมาหารด้วยคลิปความยาวห้าวินาที — ก็สมมติโดยปริยายว่าใช้งานเต็มกำลัง ไม่มีเวลาว่างเลย และคุณมีการ์ดนั้นอยู่แล้ว การเปรียบเทียบที่มีประโยชน์กว่าคือการเปรียบเทียบเชิงคุณภาพ: ต้นทุนของ Seedance 2.5 จะแปรผันตามปริมาณที่คุณสร้าง และหายไปเมื่อคุณหยุด ส่วนต้นทุนของ Kandinsky 6.0 Video เกิดขึ้นไม่ว่าคุณจะสร้างหรือไม่ก็ตาม

Two-column scoreboard comparing Kandinsky 6.0 Video and Seedance 2.5 across six shared dimensions, with the vendor-vs-third-party sourcing line printed along the bottom.

ที่ที่สามารถเข้าถึงแต่ละรายการได้

ไม่มีโมเดลใดอยู่บน OrcaRouter และไม่มีการกล่าวอ้างใด ๆ เช่นนั้น Seedance 2.5 เข้าถึงได้ผ่านแพลตฟอร์มของผู้ขายเองและบริการของบุคคลที่สามหลายแห่ง ส่วน Kandinsky 6.0 Video เป็นเช็กพอยต์ที่คุณดาวน์โหลดภายใต้ MIT และรันบนฮาร์ดแวร์ของคุณเอง หน้าใดก็ตามที่บอกคุณว่าทั้งสองเรียกใช้ได้ด้วยการเรียก API เพียงครั้งเดียวบนแพลตฟอร์มที่มีหลายโมเดล กำลังอธิบายโมเดลที่แตกต่างออกไป

เหตุผลที่ชั้นการจัดเส้นทางยังคงควรค่าแก่การกล่าวถึงในไปป์ไลน์ Kandinsky หรือ Seedance ก็คือ ระบบเหล่านี้มีข้อความเป็นส่วนใหญ่เมื่อนับตามจำนวนครั้งที่เรียกใช้ และมีวิดีโอเป็นส่วนใหญ่เมื่อนับตามต้นทุน การขยายพรอมป์ต์เปลี่ยนโน้ตช็อตให้กลายเป็นแคปชันยาวที่มีโครงสร้างตามที่โมเดล T2AV คาดหวัง บทสนทนาถูกร่างขึ้นก่อนที่รอบ lip-sync จะลองทำ และถูกเขียนใหม่เมื่อรอบนั้นทำให้มันเพี้ยน ผลลัพธ์ที่สร้างขึ้นหกแบบที่เป็นตัวเลือกของบีตเดียวกันจะถูกตรวจทานและเลือกมาหนึ่งอัน — ซึ่งเป็นการตัดสินด้วยข้อความเกี่ยวกับชิ้นงานวิดีโอ และเป็นวิธีที่ถูกที่สุดในการตัดสินใจเรื่องแพงให้ถูกต้อง บนเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI ครอบคลุมโมเดลกว่า 200 รายการ ในราคาตามที่ผู้ให้บริการตั้งไว้โดยบวกเพิ่ม 0% การเรียกเหล่านั้นมีค่าใช้จ่ายเท่าที่ผู้ให้บริการเรียกเก็บและไม่มากไปกว่านั้น รวมถึงในวันถัดจากที่ผู้ขายเปลี่ยนอัตราของตน DSL สำหรับการจัดเส้นทางพิสูจน์คุณค่าของมันเมื่อผู้ตรวจทานแบบประหยัดและผู้ตรวจทานแบบละเอียดควรเป็นโมเดลที่ต่างกัน ณ จุดเรียกใช้เดียวกัน และการสลับอัตโนมัติเมื่อเกิดข้อขัดข้องก็พิสูจน์คุณค่าของมันเช่นกัน เพราะแคปชันที่ล้มเหลวระหว่างที่คลิปที่สี่จากหกกำลังเรนเดอร์ควรถูกจัดเส้นทางใหม่ แทนที่จะจบเซสชัน

อะไรที่จะทำให้แมตช์นี้เปลี่ยนไป

ช่องว่างระหว่างเวอร์ชันคือเรื่องทั้งหมด และยังเป็นเส้นทางที่สั้นที่สุดในการไขมัน การรัน Seedance 2.5 เทียบกับ Kandinsky 6.0 Video จะช่วยชี้ขาดว่าความเสียเปรียบด้านเกณฑ์ภาพที่รายงานบันทึกไว้เมื่อเทียบกับ 2.0 นั้นกว้างขึ้น แคบลง หรือกลับทิศ — รายงานไม่สามารถตอบได้ และผู้เขียนก็ไม่มีทางตอบ สำหรับตอนนี้ จุดยืนที่ป้องกันได้นั้นแคบกว่าที่การตลาดของฝ่ายใดฝ่ายหนึ่งต้องการ: จากหลักฐานที่เผยแพร่โดยห้องปฏิบัติการของโมเดลเอง Seedance นำในเรื่องภาพของคลิปที่ดูเป็นอย่างไร และ Kandinsky 6.0 Video นำในเรื่องเสียงพูดในคลิปที่ฟังเป็นอย่างไร และเวอร์ชันของ Seedance ที่ข้อกล่าวอ้างนั้นอิงอยู่นั้นล้าหลังเวอร์ชันที่คุณจะซื้ออยู่หนึ่งรุ่น

เลือกให้เหมาะสมกับแต่ละกรณี ถ้างานยาว มีข้อมูลอ้างอิงหนาแน่น หรือขับเคลื่อนด้วยการตัดต่อ ช่องว่างเชิงโครงสร้างจะเป็นตัวตัดสินก่อนที่ประสิทธิภาพจะเข้ามาเกี่ยวข้อง ถ้างานเป็นช็อตคนพูดความยาวห้าวินาทีที่บทสนทนาต้องฟังดูถูกต้องตั้งแต่ครั้งแรก ข้อได้เปรียบของ Kandinsky 6.0 Video อยู่ที่เกณฑ์นั้นโดยตรง — และสัญญาอนุญาต MIT หมายความว่าคำตอบไม่ได้ขึ้นอยู่กับโรดแมปของใคร สิ่งที่ต้องจับตาดูไม่ใช่ตารางอันดับ แต่คือการรันซ้ำของการเปรียบเทียบที่รายงานไม่เคยสามารถรันได้

Screenshot of the arXiv abstract page for paper 2610.05608, "Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation", showing the 4 October 2026 submission date and the abstract, including the listed limitations that the models generate clips of up to 5 seconds and that base generation runs at SD resolution with Full HD obtained through super-resolution.Screenshot of the Hugging Face model card for kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers, showing the MIT licence and the family description - Kandinsky 6.0 Video Lite at 3B parameters and Pro at 29B, generating 5-second clips with synchronized 44 kHz audio in T2AV and I2AV modes.

วิธีที่ประหยัดที่สุดในการเรียกใช้งานที่มีค่าใช้จ่ายสูงอย่างถูกต้อง: DSL สำหรับจัดเส้นทางที่สลับผู้ตรวจสอบในแต่ละขั้นตอน พร้อมระบบสลับสำรองอัตโนมัติเมื่อเกิดข้อขัดข้อง เพื่อให้แคปชันที่ล่มไม่ทำให้ต้องเสียคลิปไป

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube