การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Kandinsky 6.0 Video vs Grok Imagine Video' โดยมีคำบรรยายย่อยว่า 'ตารางคะแนนพลิกกลับ' อยู่เหนือแถวไอคอนที่ติดป้ายว่า 'การสร้างวิดีโอ' 'เสียงที่ซิงโครไนซ์' และ 'การปรับใช้แบบโอเพนเวท' โลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Guides & Insights

Kandinsky 6.0 Video กับ Grok Imagine Video: ลีดเดอร์บอร์ดพลิกโผ

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ในเดือนมกราคม 2026 เมื่อ Grok Imagine Video เปิดตัว มันครองอันดับหนึ่งในสนามประลองวิดีโอของ Artificial Analysis ในทั้งสองโหมด วันนี้บอร์ดเดียวกันจัดอันดับบิลด์ปัจจุบันของมันไว้ที่สิบเอ็ดหรือสิบสองในด้านข้อความเป็นวิดีโอ นั่นไม่ใช่เรื่องอื้อฉาวและไม่ใช่ความล้มเหลว — มันคือสิ่งที่เกิดขึ้นกับหมวดหมู่ที่เคลื่อนไหวเร็วในเก้าเดือน และเป็นเหตุผลที่ซื่อสัตย์ในการเปรียบเทียบโมเดลสร้างของ xAI กับ Kandinsky 6.0 Video ตอนนี้ หนึ่งในนั้นคือบริการที่ปรับให้เหมาะกับความรวดเร็วในการสร้างคลิปชิ้นต่อไป ส่วนอีกอันคือเช็คพอยต์ที่ได้รับสัญญาอนุญาต MIT ขนาด 29B พารามิเตอร์ในรุ่น Pro และ 3B ในรุ่น Lite เปิดตัวโดย Sber's Kandinsky Lab ในสัปดาห์แรกของเดือนตุลาคม 2026 สร้างวิดีโอห้าวินาทีพร้อมเสียง 44 kHz ที่ซิงโครไนซ์และการขยับปาก คำถามที่น่าสนใจไม่ใช่ว่าอันไหนนำหน้าบนบอร์ด — แต่เป็นว่าอันไหนแต่ละอันสามารถทำอะไรต่อไปได้ในเชิงโครงสร้าง

กระดานที่เคลื่อนอยู่ใต้มัน

Grok Imagine Video เป็นโมเดลสร้างของ xAI เปิดตัวครั้งแรกเมื่อวันที่ 29 มกราคม 2026 และเสถียรที่เวอร์ชัน 1.5 ตั้งแต่ 16 มิถุนายน บนกระดานจัดอันดับ text-to-video ของ Artificial Analysis บิลด์ 1.5 ของมันอยู่อันดับที่ 11–12 ด้วยคะแนน Elo 1,045 (±9) จาก 4,056 โหวต ระบุราคาไว้ที่ 15.00 ดอลลาร์ต่อนาที บิลด์ดั้งเดิมไม่อยู่บนกระดานนั้น

image-to-video เป็นจุดที่ตระกูลนี้แข็งแกร่งกว่า และเป็นจุดที่สองบิลด์แยกออกจากกันในแบบที่คุ้มค่าแก่การอ่านอย่างละเอียด:

• grok-imagine-video-1.5 — อันดับที่ 7–9, Elo 1,098 (±8), 5,267 โหวต, $8.40 ต่อนาที

• grok-imagine-video (บิลด์เดือนมกราคม) — อันดับที่ 12–17, Elo 1,072 (±7), 14,371 โหวต, $4.20/นาที

• เพื่อให้เห็นภาพ อันดับสูงสุดของกระดาน I2V นั้น — MiniMax H3 Max — อยู่ที่ Elo 1,195 (±9) จาก 5,894 คะแนนโหวต และ Wan 3.0 อยู่อันดับที่หกที่ 1,164

การตีความสองแบบมีดังนี้ และทั้งสองแบบเป็นจริง บิลด์ใหม่กว่าของ xAI ล้ำหน้ารุ่นก่อนของตัวเองในด้าน image-to-video จริง ๆ ถึง 26 Elo และต้องจ่ายแพงเป็นสองเท่าต่อนาทีจึงจะได้สถานะนั้น และเรื่องราวในสัปดาห์เปิดตัว — โมเดลที่ขึ้นไปถึงจุดสูงสุด — ก็ไม่ได้คงอยู่: สนามแข่งขันเคลื่อนไป อารีนาสะสมคะแนนโหวตหลายหมื่นคะแนนจากระบบใหม่กว่าสิบสองระบบ และตำแหน่งกลางตารางคือจุดที่การแข่งขันเก้าเดือนนำเครื่องสร้างอเนกประสงค์ที่เร็วมาวางไว้

Kandinsky 6.0 Video ไม่มีคะแนน Elo บนกระดานจัดอันดับใดเลย หลักฐานที่มีคือผลการรัน VABench และการประเมินโดยมนุษย์ที่แล็บจัดทำขึ้นเอง ซึ่งทั้งสองอย่างเผยแพร่โดย Sber และไม่มีการทำซ้ำจากภายนอกเลย การนำโมเดลโอเพนซอร์สที่ยังไม่ผ่านการตรวจสอบมาวางเทียบเคียงกับโมเดลเชิงพาณิชย์ที่มีคะแนนแล้วนั้น เป็นการเปรียบเทียบที่ต้องระมัดระวังอย่างยิ่ง ตำแหน่งของโมเดลที่มีคะแนนนั้นเป็นของจริงและไม่น่าชื่นชม ส่วนตำแหน่งของโมเดลที่ยังไม่มีคะแนนนั้นไม่เป็นที่ทราบ "ไม่ทราบ" ไม่ได้หมายความว่า "ดีกว่า"

ความเร็วมีสองแบบ และมีเพียงแบบเดียวเท่านั้นที่วัดเป็นวินาที

เป้าหมายการออกแบบของ Grok Imagine คือปริมาณผลงานต่อผู้สร้าง มันเชื่อมต่อกับ X มันส่งคืนคลิปที่เสร็จสมบูรณ์พร้อมเสียง และชุดฟีเจอร์ของมันดูเหมือนรายการสิ่งที่ผู้คนทำในฟีด: อัตราส่วนภาพหลายแบบ การเคลื่อนกล้อง การย้าย ลบ และสลับวัตถุ การถ่ายโอนสไตล์ การสร้างโดยมีเงื่อนไขจากภาพอ้างอิงหลายภาพเพื่อความสม่ำเสมอของตัวละคร เสียงในตัวพร้อมบทสนทนาและเอฟเฟกต์ ความยาวคลิปสูงสุดถึงสิบห้าวินาที ความละเอียดสูงสุดที่ 1080p ผลลัพธ์คือการลองครั้งที่สองใช้เวลาแค่ไม่กี่นาทีและค่าใช้จ่ายไม่กี่ดอลลาร์

Kandinsky 6.0 Video เร็วในความหมายที่ต่างออกไป — ไม่ใช่เร็วต่อครั้งที่ลอง แต่เร็วต่อหน่วยของการเป็นเจ้าของ ไม่มีส่วนไหนของมันที่เกิดขึ้นทันทีทันใด เวลาทำงานที่ที่เก็บโค้ดของมันเองระบุสำหรับโมเดลแบบไม่กลั่น หลังวอร์มอัปและไม่รวมการโหลดเวตกับการเข้ารหัส MP4 ทำให้คลิป Pro Full HD ความยาวห้าวินาทีอยู่ที่ราว 402 วินาทีบน H100, 854 บน RTX 5090, 1,247 บน RTX 4090 และ 3,530 บน RTX 5060 Ti ส่วน Lite Full HD ใช้ 284 วินาทีบน H100 เครื่องมือที่ทำให้เรื่องนี้พอทนได้คือเช็กพอยต์แบบกลั่น ซึ่งเปเปอร์วัดแล้วว่าอยู่ในระดับเท่าเทียมกับโมเดลเต็ม — ถูกเลือกมากกว่าหรือเสมอกันในเกณฑ์ส่วนใหญ่ ความชอบเฉลี่ย 51% ต่อ 49% โดยไม่มีผลต่างรายข้อใดที่ถึงระดับมีนัยสำคัญ สิ่งที่คุณได้แลกมากับการเรนเดอร์ที่ช้านี้คือโมเดลที่อยู่ในดิสก์ของคุณเอง โดยไม่มีมิเตอร์ต่อคลิปเดินอยู่เลย

นั่นคือลักษณะที่แท้จริงของการจับคู่นี้ Grok Imagine Video ทำให้ต้นทุนของการลองครั้งที่สิบเหมาะสมที่สุด Kandinsky 6.0 Video ทำให้ต้นทุนของการลองครั้งที่หนึ่งหมื่นเหมาะสมที่สุด และเรียกเก็บค่าตอบแทนจากคุณด้วยฮาร์ดแวร์และความอดทนสำหรับครั้งแรก

ทั้งคู่สร้างเสียง — และทั้งสองไม่ใช่ข้อกล่าวอ้างเดียวกัน

นี่คือแกนที่การเปรียบเทียบแบบขอไปทีจะบอกว่า "เสมอ" และคิดผิด

Grok Imagine Video สร้างเสียงในตัวพร้อมบทสนทนา เอฟเฟกต์ และดนตรี ซึ่งเป็นเพียงหนึ่งในฟีเจอร์มากมาย เป็นเครื่องมือสร้างแบบอเนกประสงค์ที่บังเอิญมีเสียงรวมอยู่ด้วย

Kandinsky 6.0 Video ถูกสร้างขึ้นโดยมีเสียงเป็นศูนย์กลาง สถาปัตยกรรมนี้เป็น CrossDiT แบบสองสตรีม ที่จับคู่สตรีมวิดีโอซึ่งเริ่มต้นจาก Kandinsky 5.0 Video กับสตรีมเสียงที่ฝึกจากศูนย์บนคลังเสียงขนาดใหญ่ เชื่อมต่อกันด้วย cross-attention แบบสองทิศทาง และฝึกฝนร่วมกัน เอาต์พุตเป็น 44 kHz พร้อม lip-sync ที่ชัดเจน และขั้นตอน reinforcement-learning ของบทความนี้ถูกรายงานว่าลดอัตราความผิดพลาดของคำ (word error rate) ของเสียงพูดที่สร้างขึ้นได้ 47% — วัดด้วย Whisper-large-v3 ซึ่งเป็นหนึ่งในโมเดลให้รางวัล (reward models) ของ RL รายละเอียดนี้สำคัญเพราะบทความรายงานค่า WER ที่สองซึ่งไม่สามารถเปรียบเทียบได้ ควบคู่กับ VABench โดยใช้ Qwen3-ASR-1.7B เสียงพูดคือสิ่งที่โมเดลนี้ถูกฝึกเพิ่มเติม (post-trained)

ในทางกลับกัน การศึกษาของ Sber เองก็ยอมรับอย่างตรงไปตรงมาในจุดที่โมเดลนี้เป็นรอง ในการประเมินแบบเทียบเคียงกันของแล็บ MiniMax H3 และ Dreamina Seedance 2.0 ได้รับการเลือกมากกว่าในเกณฑ์ด้านภาพด้วยส่วนต่างที่ชัดเจน และโมเดลนี้ถูกอธิบายว่าอยู่ในระดับที่แข่งขันได้มากกว่าจะเป็นผู้นำ ข้ออ้างที่ควรค่าแก่การพิจารณาอย่างจริงจังนั้นแคบกว่าและมีประโยชน์มากกว่า: เมื่อเทียบกับ Kling 2.6 และ Veo 3.1 Fast ผลลัพธ์จะได้เปรียบเสียเปรียบสลับกันไปในแต่ละเกณฑ์ และ Kandinsky 6.0 Video ยังคงแข่งขันได้ในด้านคุณภาพเสียงพูดและการซิงโครไนซ์เสียงกับภาพ โดยมีสัดส่วนการเปรียบเทียบที่ออกมาเสมอกันสูง

สิบห้าวินาทีปะทะห้าวินาที และสิ่งที่แต่ละอย่างต้องแลกเพื่อไปให้ถึง

• ความยาวคลิปสูงสุด — Grok Imagine Video: สูงสุด 15 วินาที Kandinsky 6.0 Video: 5 วินาทีแบบคงที่ 121 เฟรมที่ 24 fps ไม่มีโหมดขยายในเวอร์ชันเปิดตัว

• ความละเอียด — Grok Imagine Video: สูงสุด 1080p Kandinsky 6.0 Video: SD, HD และ Full HD ผ่านโมเดลซูเปอร์เรโซลูชันโดยเฉพาะ เพิ่มความละเอียดแบบ x2, x4 หรือ x2.25 ของคลิปความยาว 5 วินาที

• อินพุตอ้างอิง — Grok Imagine Video: การสร้างโดยมีเงื่อนไขอ้างอิงจากภาพหลายภาพเพื่อความสอดคล้องของตัวละคร รวมถึงการเพิ่ม/ลบ/สลับวัตถุ Kandinsky 6.0 Video: ภาพเดียว นำไปใช้เป็นเฟรมท้ายแบบมาสก์

• ราคา — Grok Imagine Video: คิดตามวินาทีของเอาต์พุต ตั้งแต่ราคาต่ำสุดของช่วง ไปจนถึง $0.30/วินาที ที่ 1080p โดยมีค่าใช้จ่ายเพิ่มเติมต่ออินพุตรูปภาพ; การเข้าถึงฟรีจะอยู่ภายใต้ระดับการสมัครสมาชิก X Kandinsky 6.0 Video: ไม่มี — ไม่มีบริการ ไม่มีอัตราค่าบริการ มีเพียงเวลาการประมวลผล GPU ที่คุณจัดหาให้

• น้ำหนัก — Grok Imagine Video: ไม่มี. Kandinsky 6.0 Video: MIT, Pro และ Lite พร้อมการผสานรวมกับ diffusers

ค่าพรีเมียมสำหรับบิลด์ Grok ที่ใหม่กว่าคือตัวเลขที่ควรวงไว้ การขยับจากบิลด์เดือนมกราคมไปเป็น 1.5 มีค่าใช้จ่ายต่อนาทีเป็นสองเท่าบนบอร์ด image-to-video และแลกมาได้ 26 Elo นั่นคือการพัฒนาที่แท้จริงในราคาที่ต้องจ่ายจริง และเป็นข้อแลกเปลี่ยนแบบเดียวกันที่ผู้ขายวิดีโอทุกรายกำลังขอให้ผู้ซื้อตัดสินใจอยู่ในตอนนี้

จุดที่เราเตอร์เหมาะ และจุดที่มันไม่เหมาะ

OrcaRouter ไม่ให้บริการ Grok Imagine Video หรือ Kandinsky 6.0 Video และไม่มีข้อความใดในที่นี้กล่าวอ้างเป็นอย่างอื่น: Kandinsky คุณต้องดาวน์โหลดและรันเอง ส่วน Grok Imagine Video เข้าถึงผ่านช่องทางของ xAI เอง สิ่งที่ไปป์ไลน์ที่สร้างบนโมเดลใดโมเดลหนึ่งต้องการจากเราเตอร์คือข้อความที่อยู่รอบการเรนเดอร์ — รายการช็อต การขยายพรอมป์ที่เปลี่ยนไอเดียให้เป็นแคปชันแบบยาวหรือแบบสั้นที่โมเดลเหล่านี้ถูกฝึกมา งานใส่แคปชันและถอดเสียง และสรุปการตรวจทานที่ตัดสินว่าผลลัพธ์การสร้างใดจะถูกเก็บไว้ สิ่งเหล่านั้นทำงานบน endpoint เดียวที่เข้ากันได้กับ OpenAI ครอบคลุมโมเดลข้อความกว่า 200 โมเดล ในราคาตามรายการของผู้ให้บริการโดยคิดมาร์กอัป 0% ดังนั้นรุ่นที่ผู้ให้บริการปล่อยจะพร้อมใช้งานบนคีย์เดียวกันทันทีที่วางจำหน่าย พร้อมระบบ failover อัตโนมัติ เพื่อให้การเรียกที่ล้มเหลวระหว่างคิวเรนเดอร์ถูกเปลี่ยนเส้นทางแทนที่จะทำให้แบตช์หยุดชะงัก การประสานงานรอบโมเดลวิดีโอเป็นปัญหาด้านการกำหนดเส้นทาง แม้ตัวโมเดลวิดีโอเองจะไม่สามารถกำหนดเส้นทางได้ ซึ่งเป็นกรณีของทั้งสองโมเดลนี้ในปัจจุบัน

อันไหน และเพื่ออะไร

เลือกใช้ Grok Imagine Video เมื่องานมีปริมาณมาก ทั้งคลิปโซเชียล การทำซ้ำอย่างรวดเร็ว ช็อตที่คุณจะเจนซ้ำหกรอบกว่าจะได้ตามต้องการ และเดดไลน์ที่ไม่ยอมยืดออก สิ่งที่มันขายคือราคาต่อครั้งที่ลอง และการที่ตอนนี้มันอยู่กลางตารางแทนที่จะอยู่บนสุดคือต้นทุนปกติของหมวดหมู่ที่เคลื่อนไหวเร็วขนาดนี้

เลือกใช้ Kandinsky 6.0 Video เมื่องานเป็นแบบไปป์ไลน์: หน่วยห้าวินาทีคงที่ที่คุณสามารถประมวลผลเป็นชุดได้, การแปลงภาพเป็นวิดีโอที่ความเที่ยงตรงต่อภาพนิ่งที่ให้มาเป็นสิ่งที่สำคัญ, คำพูดที่คุณต้องการให้ฟังเข้าใจได้, และชิ้นงานส่งมอบที่คุณไม่อยากเช่า จัดงบสำหรับการเรนเดอร์ คาดว่าจะช้าเมื่อใช้กับอุปกรณ์ระดับผู้บริโภคใด ๆ และให้ถือว่าตัวเลขคุณภาพทุกตัวในบทความนี้เป็นของ Sber เอง จนกว่าจะมีคนนอกห้องแล็บให้คะแนน

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

สิ่งที่ทำให้การจับคู่นี้น่าจับตาคือตัวไหนที่รับมือกับไตรมาสที่ย่ำแย่ได้ ถ้า Grok Imagine Video ร่วงต่ำลงไปอีกในอารีน่า คำตอบคือโมเดลที่ดีขึ้นและราคาใหม่ — นั่นคือวิธีที่หมวดนี้ทำงาน และ xAI ก็แสดงให้เห็นแล้วว่ามันจะเปิดตัวสักตัว ถ้า Kandinsky 6.0 Video กลายเป็นกลางตารางเมื่อถูกให้คะแนนแล้ว เช็กพอยต์ก็ยังมีอยู่ ยังรันได้ และยังไฟน์จูนได้ ไม่มีอะไรเกี่ยวกับสัญญาอนุญาตที่เปลี่ยนไปตามตัวเลขนั้น นั่นคือความคงทนคนละแบบ และมีเพียงแบบเดียวเท่านั้นที่วัดด้วย Elo

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube