
Kandinsky 6.0 Video กับ Alibaba Wan 2.7: น้ำหนักแบบเปิดปะทะชุดสี่โมเดล
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 150 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Kandinsky 6.0 Video มอบเช็กพอยต์ขนาด 29B พารามิเตอร์ที่คุณดาวน์โหลดได้ และได้คลิปความยาวห้าวินาทีกลับมาเป็นสิ่งตอบแทน Wan 2.7 มอบตัวแปรเฉพาะงานสี่แบบ คลิปยาวสูงสุดสิบห้าวินาที และใบแจ้งหนี้ที่คิดราคาต่อวินาที สองประโยคนี้คือการเปรียบเทียบทั้งหมด และเหตุผลที่มันคุ้มค่าที่จะจดบันทึกไว้ก็คือ หน้าเปรียบเทียบแบบตัวต่อตัวส่วนใหญ่มักเทียบกันที่คุณภาพของภาพ ซึ่งไม่มีฝ่ายไหนมีคะแนนอิสระที่จะชี้ขาดได้ และมักข้ามแกนที่ทั้งสองแตกต่างกันจริง ๆ ไป ซึ่งแกนนั้นแหละคือสิ่งที่แต่ละตัวคาดหวังให้คุณนำมาเอง
Kandinsky Lab ของ Sber เปิดซอร์ส Kandinsky 6.0 Video ในสัปดาห์แรกของเดือนตุลาคม 2026 ภายใต้สัญญาอนุญาต MIT ในสองขนาด — Pro ที่ 29B และ Lite ที่ 3B — พร้อมโค้ด เช็คพอยต์ และการผสานรวมกับ diffusers ส่วน Wan 2.7 ของ Alibaba เปิดตัวเมื่อวันที่ 3 เมษายน 2026 ในรูปแบบชุดรวม: text-to-video, image-to-video, reference-to-video และ video-edit โดยคิดค่าบริการตามวินาทีของวิดีโอที่สร้างขึ้น หนึ่งในนั้นคือโมเดลที่คุณรันเอง ส่วนอีกอันคือบริการที่คุณซื้อ คำถามที่น่าสนใจไม่ใช่ว่าอันไหนดีกว่า แต่เป็นอันไหนที่มีรูปแบบเหมาะสมกับงาน
แกนเดียวที่พวกเขาสามารถเปรียบเทียบกันได้โดยตรง
ทั้งสองโมเดลสร้างวิดีโอพร้อมเสียง ไม่ใช่วิดีโอที่คุณต้องนำไปใส่เสียงประกอบทีหลัง เรื่องนี้หายากกว่าที่ฟังดู และนี่คือเหตุผลที่สองตัวนี้ถูกพูดถึงคู่กันตั้งแต่แรก — วงการส่วนใหญ่ยังคงสร้างไฟล์ MP4 แบบไร้เสียง แล้วปล่อยให้การทำเสียงเป็นขั้นตอนแยกต่างหาก
Kandinsky 6.0 Video ทำได้ด้วย CrossDiT แบบสองสตรีม: สตรีมวิดีโอที่เริ่มต้นจาก checkpoint ของ Kandinsky 5.0 Video, สตรีมเสียงที่ฝึกตั้งแต่เริ่มต้นบนคลังข้อมูลเสียงขนาดใหญ่ และ cross-attention แบบสองทิศทางที่เชื่อมทั้งสองเข้าด้วยกัน โดยฝึกพร้อมกันหลังจากขั้นตอน pretraining แบบต่อเนื่อง เอาต์พุตเป็นเสียง 44 kHz พร้อม lip-sync จากพรอมป์ต์ข้อความ (T2AV) หรือภาพอ้างอิง (I2AV)
Wan 2.7 ผลิตเสียงแบบเนทีฟได้เช่นกัน โดยไม่ได้เปิดเผยกลไกในระดับรายละเอียดเดียวกัน เอกสารของมันเองระบุว่าคุณภาพเสียงและความแม่นยำของข้อความบนหน้าจอเป็นสองด้านที่ยังต้องพัฒนา — เป็นข้อแม้ด้านความเที่ยงตรงที่ควรจดจำไว้ เพราะเป็นผู้ขายที่พูดเอง ไม่ใช่นักรีวิวที่คาดเดา
นั่นคือจุดที่ความคล้ายคลึงสิ้นสุดลง ทุกสิ่งใต้เส้นนี้คือความแตกต่าง ไม่ใช่การจัดอันดับ
ห้าวินาทีเทียบกับสิบห้าวินาที และสิ่งนั้นส่งผลต่อช็อตลิสต์อย่างไร
Kandinsky 6.0 Video ได้รับการฝึกด้วย 121 เฟรม ที่ 24 fps — ห้าวินาที — และเวอร์ชันเผยแพร่ไม่มีโหมดขยายความยาว ทั้งบทความ สูตรการให้บริการที่ถูกรวมเข้าใน vLLM-Omni และตารางประสิทธิภาพของรีโพซิทอรี ต่างก็สร้างขึ้นโดยอิงกับความยาวคลิปเดียวนี้ทั้งหมด ชิ้นงานยาว 30 วินาทีคือการสร้าง 6 ครั้งและการเชื่อมต่อ 5 ครั้ง และรอยต่อเหล่านั้นคุณต้องซ่อนเอง
Wan 2.7 ครอบคลุมความยาวสองถึงสิบห้าวินาทีต่อการสร้างหนึ่งครั้ง โดยตัดสินใจเป็นรายคำขอ สำหรับคลิปพูดหน้ากล้อง ภาพแทรกสินค้า หรือการเคลื่อนกล้องครั้งเดียว ความต่างนั้นไม่ใช่แค่ความสะดวก — มันคือความต่างระหว่างการเรนเดอร์ครั้งเดียวกับขั้นตอนการประกอบเข้าด้วยกัน สำหรับงานที่สร้างทีละช็อต ห้าวินาทีเป็นหน่วยงานปกติ และช่องว่างนั้นแทบจะหายไป
• ความยาวคลิปสูงสุด — Kandinsky 6.0 Video: 5 วินาที, คงที่, 121 เฟรม ที่ 24 fps. Wan 2.7: 2–15 วินาที, ตั้งค่าตามคำขอ
• ความละเอียด — Kandinsky 6.0 Video: SD, HD และ Full HD (1920×1080) ผ่านโมเดลซูเปอร์เรโซลูชันแยกต่างหาก Wan 2.7: สูงสุด 1080p
• การปรับเงื่อนไขด้วยข้อมูลอ้างอิง — Kandinsky 6.0 Video: หนึ่งภาพ ใช้เป็นเฟรมท้ายที่มาสก์ไว้ Wan 2.7: รองรับภาพsubjectได้สูงสุดห้าภาพและคลิปอ้างอิงห้าคลิป สินทรัพย์สิบรายการต่อคำขอ
• งาน — Kandinsky 6.0 Video: T2AV และ I2AV. Wan 2.7: การสร้างวิดีโอจากข้อความ, การสร้างวิดีโอจากภาพ, การสร้างวิดีโอจากภาพอ้างอิง และการแก้ไขวิดีโอ เป็นรูปแบบแยกกันพร้อมการเรียกเก็บเงินแยกกัน
• เวต — Kandinsky 6.0 Video: MIT, ดาวน์โหลดได้, Pro และ Lite. Wan 2.7: ไม่มี
สี่ภารกิจกับสองโหมด
จำนวนงานคือส่วนของ Wan 2.7 ที่ถูกนำเสนอต่ำกว่าความเป็นจริงในตารางเปรียบเทียบ เพราะมันไม่ใช่การอ้างเรื่องคุณภาพ — แต่เป็นการอ้างเรื่องขอบเขตความสามารถ การแก้ไขฟุตเทจที่มีอยู่ตามคำสั่ง ซึ่งคุณอธิบายการเปลี่ยนแปลงแล้วได้ช็อตเดิมกลับมาพร้อมการเปลี่ยนแปลงนั้น เป็นประเภทงานที่ Kandinsky 6.0 Video ไม่ได้พยายามทำเลย Reference-to-video ซึ่งการแสดงที่ป้อนเข้ามาขับเคลื่อนตัวแบบที่สร้างขึ้น ก็อยู่นอกเหนือจากสองโหมดของมันเช่นกัน
การคิดค่าบริการของมันสะท้อนลักษณะของงาน รูปแบบ text-to-video และ image-to-video ของ Wan 2.7 คิดค่าบริการตามระยะเวลาเอาต์พุตเท่านั้น — $0.10/วินาทีที่ความละเอียด 720p และ $0.15/วินาทีที่ความละเอียด 1080p บนเอนด์พอยต์สิงคโปร์สำหรับการใช้งานระหว่างประเทศ โดยปักกิ่งและโตเกียวมีอัตราอยู่ที่ $0.086/วินาที และ $0.143/วินาที สำหรับงานเดียวกัน รูปแบบ reference-to-video คิดค่าบริการวิดีโออินพุตด้วย โดยจำกัดเพดานไว้ที่ 5 วินาที ดังนั้นวิดีโออ้างอิง 5 วินาทีที่ขับเคลื่อนการสร้าง 15 วินาที จะถูกคิดค่าบริการเป็นงาน 20 วินาที รูปแบบ video-edit คิดค่าบริการเฉพาะเอาต์พุต และถือว่าฟุตเทจอินพุตฟรี — ซึ่งเป็นอัตราค่าบริการที่ได้เปรียบที่สุดเพียงหนึ่งเดียวในตระกูลนี้ และเป็นเหตุผลว่าทำไมการตัดต่อจึงเป็นจุดที่ 2.7 ราคาถูก
ข้อเท็จจริงด้านวงจรชีวิตสองข้อควรอยู่ข้าง ๆ ตัวเลขเหล่านั้น Alibaba แนบส่วนลดเปิดตัว 30% แบบจำกัดเวลากับแพลตฟอร์ม Bailian และ Qwen Cloud ของตัวเอง และส่วนลดนั้นหมดอายุเมื่อวันที่ 23 กันยายน 2026 อีกกรณีหนึ่ง ประกาศปลดระวาง Model Studio ของ Alibaba Cloud (ID 118434) จะทำให้โมเดลรุ่นเก่าหลายรุ่นออฟไลน์ในวันที่ 10 ตุลาคม 2026 และwan2.7-r2v และ wan2.7-image อยู่ในรายการนั้น นั่นเป็นระดับรุ่นย่อย มากกว่าการปิดเจเนอเรชันทั้งหมด — wan2.7-t2v และ wan2.7-i2v ยังคงอยู่ในรายการพร้อมราคาที่ใช้งานได้ — แต่ถ้า reference-to-video เป็นเหตุผลที่คุณกำลังพิจารณา 2.7 เส้นทางนั้นเหลือเวลาอีกสี่วัน
คณะกรรมการอิสระแสดงให้เห็นอะไร และไม่แสดงให้เห็นอะไร
นี่คือส่วนที่การเปรียบเทียบสองโมเดลนี้ส่วนใหญ่แอบโกงกันแบบเงียบ ๆ ดังนั้นจึงคุ้มค่าที่จะแม่นยำเกี่ยวกับสิ่งที่มีอยู่จริง
Wan 2.7 มีคะแนนอิสระบนกระดานจัดอันดับวิดีโอของ Artificial Analysis ถึงสามกระดานที่แยกจากกัน และคะแนนเหล่านั้นไม่ตรงกัน เพราะแต่ละกระดานวัดสิ่งที่แตกต่างกัน
• ข้อความเป็นวิดีโอ — Wan2.7-260612 (บิลด์เดือนมิถุนายน) อยู่อันดับที่ 13–14 ด้วย Elo 1,030 (±9) จาก 5,571 โหวต ที่ราคา $9.00/นาที
• ภาพเป็นวิดีโอ — Wan 2.7 (เวอร์ชันเดือนเมษายน) อยู่อันดับที่ 12 ด้วยคะแนน Elo 1,077 (±8) จาก 4,571 โหวต ในราคา $9.00/นาที
• การตัดต่อวิดีโอ — Wan 2.7 อยู่อันดับที่ 5 ด้วย Elo 1,077 (±5) จาก 17,988 โหวต ในราคา $16.90/นาที
อ่านทั้งสามอย่างนี้ควบคู่กัน แล้วข้อสรุปที่มีประโยชน์ไม่ใช่ "Wan 2.7 อยู่อันดับสิบสองด้านวิดีโอ" แต่คือ โมเดลนี้แข็งแกร่งด้านการตัดต่อมากกว่าด้านการสร้างอย่างเห็นได้ชัด บนกระดานจัดอันดับที่สร้างขึ้นสำหรับแต่ละด้าน และการอ้างตัวเลขเพียงตัวเดียวสำหรับมันถือเป็นความผิดพลาดไม่ว่าจะไปในทางใด
Kandinsky 6.0 Video ไม่มีคะแนนบนกระดานใด ๆ เหล่านั้น หลักฐานที่เผยแพร่ของมันมาจากฝั่งผู้ขาย และควรกล่าวให้ชัดเจนว่ามันคืออะไร: การรัน VABench ซึ่งห้องปฏิบัติการรายงานว่า Pro นำในด้านคุณภาพเสียง สุนทรียภาพของเสียง การจัดตำแหน่งข้อความ-วิดีโอและเสียง-วิดีโอ ความแม่นยำในการซิงค์ริมฝีปาก การไม่ซิงโครไนซ์ และความสมจริงทางภาพ ในบรรดาสามระบบที่ประเมิน — อีกสองระบบคือโมเดล Lite ของตัวเองและ LTX 2.5 — และการประเมินโดยมนุษย์แบบเคียงข้างที่ดำเนินการโดยห้องปฏิบัติการ โดยมีจำนวนการเปรียบเทียบแบบจับคู่ประมาณ 200 ครั้งหรือมากกว่าต่อเกณฑ์ ซึ่ง Pro แข่งขันได้กับ Kling 2.6 และ Veo 3.1 Fast ตามหลัง MiniMax H3 และ Dreamina Seedance 2.0 ในเกณฑ์ด้านภาพ และยังคงแข่งขันได้ในด้านคุณภาพเสียงและการซิงโครไนซ์เสียง-วิดีโอ ไม่มีส่วนใดถูกทำซ้ำนอก Sber และไม่มีส่วนใดเป็นการจัดอันดับ Elo บนกระดานสาธารณะแบบ blind การตีความที่ถูกต้องคือ "มีแนวโน้มดีและยังไม่ได้รับการตรวจสอบ" ไม่ใช่ "เทียบเท่า Veo"
ค่าใช้จ่ายของแต่ละรายการ โดยระบุตามถ้อยคำที่แต่ละฝ่ายใช้
โมเดลการกำหนดราคาทั้งสองแบบไม่อาจลดทอนให้เหลือเป็นตัวเลขเดียว และการแสร้งทำเป็นว่าไม่เป็นเช่นนั้นคือสิ่งที่ทำให้ทีมตัดสินใจผิดพลาด
Wan 2.7 คิดราคาตามวินาที คลิป 1080p ความยาวสิบห้าวินาทีอยู่ที่ประมาณ $2.25 ชิ้นงานความยาวสามสิบวินาทีใช้การเจนสองครั้งบวกการตัดต่อหนึ่งครั้ง — ค่าการเจนดิบ $4.50 บวกเวลาประกอบของคุณ หรือน้อยกว่านั้นหากตัวเลือกการตัดต่อเป็นตัวทำงาน เพราะมันไม่คิดค่าอินพุต
Kandinsky 6.0 Video ไม่มีอัตราค่าใช้จ่ายใด ๆ เลย เพราะไม่มีบริการให้ซื้อ สิ่งที่มันมีคือต้นทุนต่อชั่วโมง GPU ที่คุณเป็นผู้กำหนด ตัวเลขของรีโพซิทอรีเองกำหนดพื้นขั้นต่ำไว้: คลิป Pro Full HD ความยาวห้าวินาทีใช้เวลาทำงานประมาณ 402 วินาทีบน H100 หลังวอร์มアップ, 854 วินาทีบน RTX 5090 และ 1,247 วินาทีบน RTX 4090 ดิสทิลด์เช็กพอยต์ — ซึ่งเปเปอร์วัดแล้วว่าทัดเทียมกับโมเดลเต็ม โดยค่าความชอบเฉลี่ย 51% ต่อ 49% และไม่มีเกณฑ์ใดถึงระดับมีนัยสำคัญ — คือตัวที่คุณจะนำไปให้บริการจริง ๆ สิ่งใดก็ตามที่มีการจัดสรรสูงสุดต่ำกว่า 72.8 GiB จำเป็นต้องใช้การออฟโหลดบล็อก และพรีเซ็ต 16 GB จะควอนไทซ์ตัวเข้ารหัสข้อความเป็น NF4 ซึ่งเปเปอร์ยืนยันว่าเป็นเพียงการเปลี่ยนแปลงพรีเซ็ตเดียวที่เปลี่ยนแปลงตัวคลิปเอง
พูดให้ตรง ๆ ว่า ต้นทุนของ Wan 2.7 คือรายการหนึ่งบนใบแจ้งหนี้ที่คุณคาดการณ์ได้ ส่วนต้นทุนของ Kandinsky 6.0 Video คือเครื่องจักรที่คุณเป็นเจ้าของ การเรนเดอร์ที่ใช้เวลาหลายนาทีต่อห้าวินาที และทางเลือก — ไม่ใช่ภาระผูกพัน — ในการปรับจูนละเอียด
ตำแหน่งที่เราเตอร์ตั้งอยู่ในนี้
OrcaRouter ไม่ได้ให้บริการทั้ง Kandinsky 6.0 Video และ Alibaba Wan 2.7 และที่นี่ไม่มีการกล่าวอ้างถึงทั้งสองกรณีดังกล่าว Kandinsky คุณสามารถดาวน์โหลดและรันเองได้ ส่วน Wan 2.7 เข้าถึงได้ผ่านแพลตฟอร์มของ Alibaba เอง สิ่งที่ไปป์ไลน์ที่สร้างบนโมเดลใดโมเดลหนึ่งต้องการจากเราเตอร์คือชั้นข้อความที่ล้อมรอบการเรนเดอร์ ได้แก่ การขยายพรอมป์ที่เปลี่ยนคำอธิบายช็อตให้เป็นแคปชันแบบยาวหรือแบบสั้นที่โมเดลเหล่านี้ถูกฝึกมา งานด้านแคปชันและบทสนทนาที่ป้อนเข้าสู่ขั้นตอน image-to-video และสรุปการรีวิวที่ตัดสินว่าผลลัพธ์ใดจากการสร้างหลายครั้งคือชิ้นที่ควรเก็บไว้ นั่นคือการเรียกข้อความทั่วไป และทำงานบนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงหนึ่งเดียวครอบคลุมโมเดลกว่า 200 รุ่น ด้วยราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยบวกกำไร 0% ดังนั้นการลดราคาของผู้ให้บริการจึงมีผลทันทีในวันเดียวกัน แทนที่จะต้องรอหลังจบรอบสัญญา การสลับระบบสำรองอัตโนมัติมีค่ามากกว่าที่นี่เมื่อเทียบกับงานแชต เพราะการเรียกแคปชันที่ล้มเหลวตอนนาทีที่สี่ของเซสชันถาม-ตอบ ควรถูกเปลี่ยนเส้นทางแทนที่จะทำให้การเรนเดอร์สูญหาย
การตัดสินใจ สรุปเป็นบรรทัดละหนึ่งข้อ
ถ้าสิ่งที่ต้องส่งมอบคือคลิปสำเร็จรูปที่มีเสียง และคุณไม่อยากเป็นเจ้าของ GPU Wan 2.7 เป็นเพียงหนึ่งเดียวในสองตัวที่ขายสิ่งนั้นให้คุณ และรุ่นสำหรับตัดต่อของมันคือสิ่งที่แข็งแกร่งที่สุดในตระกูลจากหลักฐานที่มีอยู่ ตรวจสอบการปลดระวางวันที่ 10 ตุลาคมก่อนตัดสินใจใช้ reference-to-video
หากสิ่งส่งมอบคือไปป์ไลน์ที่คุณควบคุม หากหน่วยห้าวินาทีเหมาะกับช็อตลิสต์ของคุณ และหากคุณต้องการไฟน์จูนหรือรันแบบออฟไลน์ Kandinsky 6.0 Video ก็เป็นเพียงหนึ่งเดียวในสองตัวที่อนุญาตให้ทำได้ — โดยแลกมาด้วยการเรนเดอร์ที่ช้าบนฮาร์ดแวร์ของผู้บริโภค และคำกล่าวอ้างด้านคุณภาพที่ยังคงเป็นของทางห้องแล็บเองทั้งหมด เหตุการณ์ที่ต้องจับตาดูในฝั่งนั้นเรียบง่าย: ค่า Elo


ความไม่สมมาตรประการหนึ่งควรค่าแก่การเอ่ยถึงก่อนปิดท้าย เพราะมันจะอยู่ยาวนานกว่าทั้งสองโมเดล เพดานของ Wan 2.7 เป็นของ Alibaba ที่จะกำหนดทั้งในทางสัญญาและทางเทคนิค เมื่อตัวแปรต่างๆ ของชุดนี้ถูกปลดระวางหรือปรับราคาใหม่ ไพป์ไลน์ของคุณก็จะรับช่วงการตัดสินใจนั้นไปด้วย ส่วนเพดานของ Kandinsky 6.0 Video คือฮาร์ดแวร์ของคุณเอง และสัญญาอนุญาต MIT หมายความว่าฟอร์กหนึ่งสามารถมีอายุยืนยาวกว่าโรดแมปของแล็บได้ ทีมที่เคยเจ็บช้ำจากการที่โมเดลหนึ่งหายไปจากแคตตาล็อกมักให้น้ำหนักกับความต่างนี้มากขึ้นเมื่อผ่านไปหนึ่งปี มากกว่าวันที่พวกเขาเลือก

