
Kandinsky 6.0 Video กับ Grok Imagine Video: ลีดเดอร์บอร์ดพลิกโผ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 150 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ในเดือนมกราคม 2026 เมื่อ Grok Imagine Video เปิดตัว มันครองอันดับหนึ่งในสนามประลองวิดีโอของ Artificial Analysis ในทั้งสองโหมด วันนี้บอร์ดเดียวกันจัดอันดับบิลด์ปัจจุบันของมันไว้ที่สิบเอ็ดหรือสิบสองในด้านข้อความเป็นวิดีโอ นั่นไม่ใช่เรื่องอื้อฉาวและไม่ใช่ความล้มเหลว — มันคือสิ่งที่เกิดขึ้นกับหมวดหมู่ที่เคลื่อนไหวเร็วในเก้าเดือน และเป็นเหตุผลที่ซื่อสัตย์ในการเปรียบเทียบโมเดลสร้างของ xAI กับ Kandinsky 6.0 Video ตอนนี้ หนึ่งในนั้นคือบริการที่ปรับให้เหมาะกับความรวดเร็วในการสร้างคลิปชิ้นต่อไป ส่วนอีกอันคือเช็คพอยต์ที่ได้รับสัญญาอนุญาต MIT ขนาด 29B พารามิเตอร์ในรุ่น Pro และ 3B ในรุ่น Lite เปิดตัวโดย Sber's Kandinsky Lab ในสัปดาห์แรกของเดือนตุลาคม 2026 สร้างวิดีโอห้าวินาทีพร้อมเสียง 44 kHz ที่ซิงโครไนซ์และการขยับปาก คำถามที่น่าสนใจไม่ใช่ว่าอันไหนนำหน้าบนบอร์ด — แต่เป็นว่าอันไหนแต่ละอันสามารถทำอะไรต่อไปได้ในเชิงโครงสร้าง
กระดานที่เคลื่อนอยู่ใต้มัน
Grok Imagine Video เป็นโมเดลสร้างของ xAI เปิดตัวครั้งแรกเมื่อวันที่ 29 มกราคม 2026 และเสถียรที่เวอร์ชัน 1.5 ตั้งแต่ 16 มิถุนายน บนกระดานจัดอันดับ text-to-video ของ Artificial Analysis บิลด์ 1.5 ของมันอยู่อันดับที่ 11–12 ด้วยคะแนน Elo 1,045 (±9) จาก 4,056 โหวต ระบุราคาไว้ที่ 15.00 ดอลลาร์ต่อนาที บิลด์ดั้งเดิมไม่อยู่บนกระดานนั้น
image-to-video เป็นจุดที่ตระกูลนี้แข็งแกร่งกว่า และเป็นจุดที่สองบิลด์แยกออกจากกันในแบบที่คุ้มค่าแก่การอ่านอย่างละเอียด:
• grok-imagine-video-1.5 — อันดับที่ 7–9, Elo 1,098 (±8), 5,267 โหวต, $8.40 ต่อนาที
• grok-imagine-video (บิลด์เดือนมกราคม) — อันดับที่ 12–17, Elo 1,072 (±7), 14,371 โหวต, $4.20/นาที
• เพื่อให้เห็นภาพ อันดับสูงสุดของกระดาน I2V นั้น — MiniMax H3 Max — อยู่ที่ Elo 1,195 (±9) จาก 5,894 คะแนนโหวต และ Wan 3.0 อยู่อันดับที่หกที่ 1,164
การตีความสองแบบมีดังนี้ และทั้งสองแบบเป็นจริง บิลด์ใหม่กว่าของ xAI ล้ำหน้ารุ่นก่อนของตัวเองในด้าน image-to-video จริง ๆ ถึง 26 Elo และต้องจ่ายแพงเป็นสองเท่าต่อนาทีจึงจะได้สถานะนั้น และเรื่องราวในสัปดาห์เปิดตัว — โมเดลที่ขึ้นไปถึงจุดสูงสุด — ก็ไม่ได้คงอยู่: สนามแข่งขันเคลื่อนไป อารีนาสะสมคะแนนโหวตหลายหมื่นคะแนนจากระบบใหม่กว่าสิบสองระบบ และตำแหน่งกลางตารางคือจุดที่การแข่งขันเก้าเดือนนำเครื่องสร้างอเนกประสงค์ที่เร็วมาวางไว้
Kandinsky 6.0 Video ไม่มีคะแนน Elo บนกระดานจัดอันดับใดเลย หลักฐานที่มีคือผลการรัน VABench และการประเมินโดยมนุษย์ที่แล็บจัดทำขึ้นเอง ซึ่งทั้งสองอย่างเผยแพร่โดย Sber และไม่มีการทำซ้ำจากภายนอกเลย การนำโมเดลโอเพนซอร์สที่ยังไม่ผ่านการตรวจสอบมาวางเทียบเคียงกับโมเดลเชิงพาณิชย์ที่มีคะแนนแล้วนั้น เป็นการเปรียบเทียบที่ต้องระมัดระวังอย่างยิ่ง ตำแหน่งของโมเดลที่มีคะแนนนั้นเป็นของจริงและไม่น่าชื่นชม ส่วนตำแหน่งของโมเดลที่ยังไม่มีคะแนนนั้นไม่เป็นที่ทราบ "ไม่ทราบ" ไม่ได้หมายความว่า "ดีกว่า"
ความเร็วมีสองแบบ และมีเพียงแบบเดียวเท่านั้นที่วัดเป็นวินาที
เป้าหมายการออกแบบของ Grok Imagine คือปริมาณผลงานต่อผู้สร้าง มันเชื่อมต่อกับ X มันส่งคืนคลิปที่เสร็จสมบูรณ์พร้อมเสียง และชุดฟีเจอร์ของมันดูเหมือนรายการสิ่งที่ผู้คนทำในฟีด: อัตราส่วนภาพหลายแบบ การเคลื่อนกล้อง การย้าย ลบ และสลับวัตถุ การถ่ายโอนสไตล์ การสร้างโดยมีเงื่อนไขจากภาพอ้างอิงหลายภาพเพื่อความสม่ำเสมอของตัวละคร เสียงในตัวพร้อมบทสนทนาและเอฟเฟกต์ ความยาวคลิปสูงสุดถึงสิบห้าวินาที ความละเอียดสูงสุดที่ 1080p ผลลัพธ์คือการลองครั้งที่สองใช้เวลาแค่ไม่กี่นาทีและค่าใช้จ่ายไม่กี่ดอลลาร์
Kandinsky 6.0 Video เร็วในความหมายที่ต่างออกไป — ไม่ใช่เร็วต่อครั้งที่ลอง แต่เร็วต่อหน่วยของการเป็นเจ้าของ ไม่มีส่วนไหนของมันที่เกิดขึ้นทันทีทันใด เวลาทำงานที่ที่เก็บโค้ดของมันเองระบุสำหรับโมเดลแบบไม่กลั่น หลังวอร์มอัปและไม่รวมการโหลดเวตกับการเข้ารหัส MP4 ทำให้คลิป Pro Full HD ความยาวห้าวินาทีอยู่ที่ราว 402 วินาทีบน H100, 854 บน RTX 5090, 1,247 บน RTX 4090 และ 3,530 บน RTX 5060 Ti ส่วน Lite Full HD ใช้ 284 วินาทีบน H100 เครื่องมือที่ทำให้เรื่องนี้พอทนได้คือเช็กพอยต์แบบกลั่น ซึ่งเปเปอร์วัดแล้วว่าอยู่ในระดับเท่าเทียมกับโมเดลเต็ม — ถูกเลือกมากกว่าหรือเสมอกันในเกณฑ์ส่วนใหญ่ ความชอบเฉลี่ย 51% ต่อ 49% โดยไม่มีผลต่างรายข้อใดที่ถึงระดับมีนัยสำคัญ สิ่งที่คุณได้แลกมากับการเรนเดอร์ที่ช้านี้คือโมเดลที่อยู่ในดิสก์ของคุณเอง โดยไม่มีมิเตอร์ต่อคลิปเดินอยู่เลย
นั่นคือลักษณะที่แท้จริงของการจับคู่นี้ Grok Imagine Video ทำให้ต้นทุนของการลองครั้งที่สิบเหมาะสมที่สุด Kandinsky 6.0 Video ทำให้ต้นทุนของการลองครั้งที่หนึ่งหมื่นเหมาะสมที่สุด และเรียกเก็บค่าตอบแทนจากคุณด้วยฮาร์ดแวร์และความอดทนสำหรับครั้งแรก
ทั้งคู่สร้างเสียง — และทั้งสองไม่ใช่ข้อกล่าวอ้างเดียวกัน
นี่คือแกนที่การเปรียบเทียบแบบขอไปทีจะบอกว่า "เสมอ" และคิดผิด
Grok Imagine Video สร้างเสียงในตัวพร้อมบทสนทนา เอฟเฟกต์ และดนตรี ซึ่งเป็นเพียงหนึ่งในฟีเจอร์มากมาย เป็นเครื่องมือสร้างแบบอเนกประสงค์ที่บังเอิญมีเสียงรวมอยู่ด้วย
Kandinsky 6.0 Video ถูกสร้างขึ้นโดยมีเสียงเป็นศูนย์กลาง สถาปัตยกรรมนี้เป็น CrossDiT แบบสองสตรีม ที่จับคู่สตรีมวิดีโอซึ่งเริ่มต้นจาก Kandinsky 5.0 Video กับสตรีมเสียงที่ฝึกจากศูนย์บนคลังเสียงขนาดใหญ่ เชื่อมต่อกันด้วย cross-attention แบบสองทิศทาง และฝึกฝนร่วมกัน เอาต์พุตเป็น 44 kHz พร้อม lip-sync ที่ชัดเจน และขั้นตอน reinforcement-learning ของบทความนี้ถูกรายงานว่าลดอัตราความผิดพลาดของคำ (word error rate) ของเสียงพูดที่สร้างขึ้นได้ 47% — วัดด้วย Whisper-large-v3 ซึ่งเป็นหนึ่งในโมเดลให้รางวัล (reward models) ของ RL รายละเอียดนี้สำคัญเพราะบทความรายงานค่า WER ที่สองซึ่งไม่สามารถเปรียบเทียบได้ ควบคู่กับ VABench โดยใช้ Qwen3-ASR-1.7B เสียงพูดคือสิ่งที่โมเดลนี้ถูกฝึกเพิ่มเติม (post-trained)
ในทางกลับกัน การศึกษาของ Sber เองก็ยอมรับอย่างตรงไปตรงมาในจุดที่โมเดลนี้เป็นรอง ในการประเมินแบบเทียบเคียงกันของแล็บ MiniMax H3 และ Dreamina Seedance 2.0 ได้รับการเลือกมากกว่าในเกณฑ์ด้านภาพด้วยส่วนต่างที่ชัดเจน และโมเดลนี้ถูกอธิบายว่าอยู่ในระดับที่แข่งขันได้มากกว่าจะเป็นผู้นำ ข้ออ้างที่ควรค่าแก่การพิจารณาอย่างจริงจังนั้นแคบกว่าและมีประโยชน์มากกว่า: เมื่อเทียบกับ Kling 2.6 และ Veo 3.1 Fast ผลลัพธ์จะได้เปรียบเสียเปรียบสลับกันไปในแต่ละเกณฑ์ และ Kandinsky 6.0 Video ยังคงแข่งขันได้ในด้านคุณภาพเสียงพูดและการซิงโครไนซ์เสียงกับภาพ โดยมีสัดส่วนการเปรียบเทียบที่ออกมาเสมอกันสูง
สิบห้าวินาทีปะทะห้าวินาที และสิ่งที่แต่ละอย่างต้องแลกเพื่อไปให้ถึง
• ความยาวคลิปสูงสุด — Grok Imagine Video: สูงสุด 15 วินาที Kandinsky 6.0 Video: 5 วินาทีแบบคงที่ 121 เฟรมที่ 24 fps ไม่มีโหมดขยายในเวอร์ชันเปิดตัว
• ความละเอียด — Grok Imagine Video: สูงสุด 1080p Kandinsky 6.0 Video: SD, HD และ Full HD ผ่านโมเดลซูเปอร์เรโซลูชันโดยเฉพาะ เพิ่มความละเอียดแบบ x2, x4 หรือ x2.25 ของคลิปความยาว 5 วินาที
• อินพุตอ้างอิง — Grok Imagine Video: การสร้างโดยมีเงื่อนไขอ้างอิงจากภาพหลายภาพเพื่อความสอดคล้องของตัวละคร รวมถึงการเพิ่ม/ลบ/สลับวัตถุ Kandinsky 6.0 Video: ภาพเดียว นำไปใช้เป็นเฟรมท้ายแบบมาสก์
• ราคา — Grok Imagine Video: คิดตามวินาทีของเอาต์พุต ตั้งแต่ราคาต่ำสุดของช่วง ไปจนถึง $0.30/วินาที ที่ 1080p โดยมีค่าใช้จ่ายเพิ่มเติมต่ออินพุตรูปภาพ; การเข้าถึงฟรีจะอยู่ภายใต้ระดับการสมัครสมาชิก X Kandinsky 6.0 Video: ไม่มี — ไม่มีบริการ ไม่มีอัตราค่าบริการ มีเพียงเวลาการประมวลผล GPU ที่คุณจัดหาให้
• น้ำหนัก — Grok Imagine Video: ไม่มี. Kandinsky 6.0 Video: MIT, Pro และ Lite พร้อมการผสานรวมกับ diffusers
ค่าพรีเมียมสำหรับบิลด์ Grok ที่ใหม่กว่าคือตัวเลขที่ควรวงไว้ การขยับจากบิลด์เดือนมกราคมไปเป็น 1.5 มีค่าใช้จ่ายต่อนาทีเป็นสองเท่าบนบอร์ด image-to-video และแลกมาได้ 26 Elo นั่นคือการพัฒนาที่แท้จริงในราคาที่ต้องจ่ายจริง และเป็นข้อแลกเปลี่ยนแบบเดียวกันที่ผู้ขายวิดีโอทุกรายกำลังขอให้ผู้ซื้อตัดสินใจอยู่ในตอนนี้
จุดที่เราเตอร์เหมาะ และจุดที่มันไม่เหมาะ
OrcaRouter ไม่ให้บริการ Grok Imagine Video หรือ Kandinsky 6.0 Video และไม่มีข้อความใดในที่นี้กล่าวอ้างเป็นอย่างอื่น: Kandinsky คุณต้องดาวน์โหลดและรันเอง ส่วน Grok Imagine Video เข้าถึงผ่านช่องทางของ xAI เอง สิ่งที่ไปป์ไลน์ที่สร้างบนโมเดลใดโมเดลหนึ่งต้องการจากเราเตอร์คือข้อความที่อยู่รอบการเรนเดอร์ — รายการช็อต การขยายพรอมป์ที่เปลี่ยนไอเดียให้เป็นแคปชันแบบยาวหรือแบบสั้นที่โมเดลเหล่านี้ถูกฝึกมา งานใส่แคปชันและถอดเสียง และสรุปการตรวจทานที่ตัดสินว่าผลลัพธ์การสร้างใดจะถูกเก็บไว้ สิ่งเหล่านั้นทำงานบน endpoint เดียวที่เข้ากันได้กับ OpenAI ครอบคลุมโมเดลข้อความกว่า 200 โมเดล ในราคาตามรายการของผู้ให้บริการโดยคิดมาร์กอัป 0% ดังนั้นรุ่นที่ผู้ให้บริการปล่อยจะพร้อมใช้งานบนคีย์เดียวกันทันทีที่วางจำหน่าย พร้อมระบบ failover อัตโนมัติ เพื่อให้การเรียกที่ล้มเหลวระหว่างคิวเรนเดอร์ถูกเปลี่ยนเส้นทางแทนที่จะทำให้แบตช์หยุดชะงัก การประสานงานรอบโมเดลวิดีโอเป็นปัญหาด้านการกำหนดเส้นทาง แม้ตัวโมเดลวิดีโอเองจะไม่สามารถกำหนดเส้นทางได้ ซึ่งเป็นกรณีของทั้งสองโมเดลนี้ในปัจจุบัน
อันไหน และเพื่ออะไร
เลือกใช้ Grok Imagine Video เมื่องานมีปริมาณมาก ทั้งคลิปโซเชียล การทำซ้ำอย่างรวดเร็ว ช็อตที่คุณจะเจนซ้ำหกรอบกว่าจะได้ตามต้องการ และเดดไลน์ที่ไม่ยอมยืดออก สิ่งที่มันขายคือราคาต่อครั้งที่ลอง และการที่ตอนนี้มันอยู่กลางตารางแทนที่จะอยู่บนสุดคือต้นทุนปกติของหมวดหมู่ที่เคลื่อนไหวเร็วขนาดนี้
เลือกใช้ Kandinsky 6.0 Video เมื่องานเป็นแบบไปป์ไลน์: หน่วยห้าวินาทีคงที่ที่คุณสามารถประมวลผลเป็นชุดได้, การแปลงภาพเป็นวิดีโอที่ความเที่ยงตรงต่อภาพนิ่งที่ให้มาเป็นสิ่งที่สำคัญ, คำพูดที่คุณต้องการให้ฟังเข้าใจได้, และชิ้นงานส่งมอบที่คุณไม่อยากเช่า จัดงบสำหรับการเรนเดอร์ คาดว่าจะช้าเมื่อใช้กับอุปกรณ์ระดับผู้บริโภคใด ๆ และให้ถือว่าตัวเลขคุณภาพทุกตัวในบทความนี้เป็นของ Sber เอง จนกว่าจะมีคนนอกห้องแล็บให้คะแนน


สิ่งที่ทำให้การจับคู่นี้น่าจับตาคือตัวไหนที่รับมือกับไตรมาสที่ย่ำแย่ได้ ถ้า Grok Imagine Video ร่วงต่ำลงไปอีกในอารีน่า คำตอบคือโมเดลที่ดีขึ้นและราคาใหม่ — นั่นคือวิธีที่หมวดนี้ทำงาน และ xAI ก็แสดงให้เห็นแล้วว่ามันจะเปิดตัวสักตัว ถ้า Kandinsky 6.0 Video กลายเป็นกลางตารางเมื่อถูกให้คะแนนแล้ว เช็กพอยต์ก็ยังมีอยู่ ยังรันได้ และยังไฟน์จูนได้ ไม่มีอะไรเกี่ยวกับสัญญาอนุญาตที่เปลี่ยนไปตามตัวเลขนั้น นั่นคือความคงทนคนละแบบ และมีเพียงแบบเดียวเท่านั้นที่วัดด้วย Elo

