การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความ 'Vidu Q4 Preview vs MiniMax H3' พร้อมคำบรรยายใต้ภาพ 'ห่างกันสิบหก Elo ห่างกันสามบอร์ด' และไทล์สถิติสามไทล์ที่ระบุว่า '1,195 MiniMax H3 Max', '1,181 MiniMax H3' และ '1,179 Vidu Q4 Preview' โดยแต่ละไทล์มีคำบรรยายว่า 'image-to-video Elo' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Vidu Q4 Preview vs MiniMax H3: อันดับสูงสุดของบอร์ดเสมอกัน และมีเพียงหนึ่งเดียวในนั้นที่ติดสามบอร์ด

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

บอร์ด image-to-video ของ Artificial Analysis ซึ่งอ่านค่าเมื่อวันที่ 8 ตุลาคม 2026 จัดให้ MiniMax H3 Maxอยู่อันดับหนึ่งด้วย 1,195 Elo MiniMax H3อันดับสองด้วย 1,181 และ Vidu Q4 Previewอันดับสามด้วย 1,179 ห่างกันสิบหกคะแนนระหว่างอันดับหนึ่งกับอันดับสาม โดยมีช่วงความเชื่อมั่นประมาณ ±10 และ ±11 จากจำนวนโหวต 5,894, 7,284 และ 5,543 ตามลำดับ นั่นคือการเสมอทางสถิติที่แต่งตัวเป็นโพเดียม และหน้าใดก็ตามที่เปิดด้วยการประกาศผู้ชนะบนบอร์ดนี้กำลังอ่านสัญญาณรบกวน

ดังนั้นคำถามที่น่าสนใจจึงไม่ใช่ว่ารุ่นใดในสองรุ่นนี้ดีกว่า แต่เป็นว่าเกิดอะไรขึ้นกับการเปรียบเทียบเมื่อคุณก้าวออกจากบอร์ดเดียวที่ทั้งสองปรากฏอยู่ — เพราะ MiniMax H3 เปิดตัวเมื่อวันที่ 31 กรกฎาคม 2026 ในฐานะโมเดลแบบ omni-modal ที่อ่านข้อความ ภาพ วิดีโอ และเสียงอ้างอิงเป็นบริบทเดียว และ Vidu Q4 Preview มาถึงเมื่อวันที่ 7 ตุลาคม 2026 พร้อมโหมดอินพุตสองโหมดและปลายทาง API สองปลายทาง หนึ่งในนั้นถูกวัดในสามแห่ง อีกอันถูกวัดในแห่งเดียว

การเสมอกันสามทางหมายความว่าอะไร และไม่หมายความว่าอะไร

ทั้งสองรายการของ MiniMax และบิลด์ของ Vidu ต่างอยู่ในช่วงของกันและกัน ดังนั้นคำกล่าวที่ตรงไปตรงมาคือ โมเดลแปลงภาพเป็นวิดีโอสามอันดับแรกแยกไม่ออกจากกันตามความชอบของมนุษย์ที่ขนาดตัวอย่างปัจจุบัน รายละเอียดสองประการทำให้การเสมอกันนั้นดูไม่น่าชื่นชมสำหรับทุกคนเท่าที่ฟังดู

ประการแรกคืออายุ คะแนนโหวตของ MiniMax H3 มาจากเดือนกรกฎาคม 2026 และของ H3 Max มาจากเดือนสิงหาคม ส่วนของ Vidu Q4 Preview มาจากเดือนตุลาคม กลุ่มคะแนนโหวตที่ใหญ่กว่าและเก่ากว่าจะถูกวัดเทียบกับสนามแข่งขันที่แตกต่างและคู่แข่งชุดที่แตกต่าง ซึ่งเป็นดาบสองคม: วัดได้ดีกว่า และเกี่ยวกับคำถามที่ต่างออกไปเล็กน้อย ช่องว่าง 16 คะแนนในทิศทางใดก็ตามตรงนี้ไม่ใช่หลักฐาน

คอลัมน์ที่สองคือคอลัมน์ราคา Artificial Analysis บันทึก MiniMax H3 ไว้ที่ $7.80 ต่อนาที และ H3 Max ที่ $4.80 ต่อนาทีบนบอร์ดนี้ Vidu Q4 Preview ถูกบันทึกไว้ที่ $7.20 หากอ่านค่าเหล่านี้เป็นอันดับ H3 Max ดูเหมือนจะเป็นตัวเลือกที่คุ้มค่าในสามตัว — แต่อัตราของผู้ให้บริการที่เป็นพื้นฐานอธิบายป้ายกำกับนี้ มากกว่าที่จะขัดแย้งกับมัน เราระบุ MiniMax-H3 ไว้ที่ $0.08 ต่อวินาทีที่ 768P และ $0.13 ต่อวินาทีที่ 2K บนโมเดลการ์ดของเราเอง ซึ่งเท่ากับ $4.80 และ $7.80 ต่อนาที ตัวเลข MiniMax สองค่าบนบอร์ดคือโมเดลเดียวกันที่ตั้งราคาในสองระดับความละเอียด ไม่ใช่ระดับพรีเมียมและระดับราคาถูก คอลัมน์ต่อนาทีบนบอร์ดความชอบมีประโยชน์สำหรับอันดับของขนาด และเป็นอันตรายสำหรับสิ่งที่ละเอียดกว่านั้น

ที่ซึ่ง MiniMax H3 ปรากฏขึ้น แต่ Vidu Q4 Preview ไม่ปรากฏ

นี่คือส่วนของการเปรียบเทียบที่ยังคงอยู่แม้ผลจะเสมอกัน และมันเป็นความแตกต่างเชิงโครงสร้าง ไม่ใช่เชิงคุณภาพ

MiniMax H3 (768p) อยู่อันดับสี่บนกระดาน text-to-video ด้วยคะแนน Elo 1,137 จาก 8,315 โหวต โดย H3 Max อยู่อันดับห้าที่ 1,130 จาก 5,719 โหวต มันอยู่อันดับสี่อีกครั้งบนกระดาน video-editing ที่ 1,119 จาก 7,023 โหวต บนกระดานที่จัดอันดับโมเดลจากการตัดต่อวิดีโอตามคำสั่งข้อความโดยคงเสียงไว้ Vidu Q4 Preview ไม่ปรากฏบนกระดานใดเลย

การไม่มีเส้นทางนั้นไม่ใช่ช่องว่างของการวัด — มันคือสิ่งที่ผลิตภัณฑ์นี้เป็น เอกสาร API ของ Vidu Q4 Preview ระบุปลายทางไว้สองรายการ /ent/v2/img2video และ /ent/v2/reference2video ส่วนหน้าเพจผลิตภัณฑ์ระบุโหมดไว้สองโหมด ได้แก่ Image-to-Video และ Reference-to-Video ในเอกสารนี้ไม่มีเส้นทาง text-to-video เลย และก็ไม่มีเส้นทางสำหรับตัดต่อวิดีโอเช่นกัน ซึ่งหมายความว่าโมเดลไม่สามารถนำคลิปที่มีอยู่แล้วมาเปลี่ยนแปลงสิ่งใดในคลิปนั้นได้ MiniMax H3 ทำได้ทั้งสองอย่าง และการวางกรอบแบบ omni-modal ของมัน — การอ้างอิงข้อความ รูปภาพ วิดีโอ และเสียงในบริบทเดียว — คือเหตุผลที่มันทำได้

ควรพูดให้ชัดเจนเกี่ยวกับด้านเสียง ทั้งสองโมเดลทำเสียงแบบเนทีฟ และทั้งสองไม่เหมือนกัน Vidu Q4 Preview สร้างเสียงและวิดีโอ ด้วยaudio พารามิเตอร์ใน image-to-video ที่ส่งออกวิดีโอที่มีบทสนทนาและเอฟเฟกต์เสียง และรองรับคลิปเสียงอ้างอิงได้สูงสุดสามคลิปเพื่อให้เสียงของตัวละครสอดคล้องกัน MiniMax H3 ส่งออกเสียงสเตอริโอแบบเนทีฟและรับเสียงเป็นอินพุตโมดาลิตีควบคู่ไปกับรูปภาพและวิดีโอ กรณีการใช้งานเสียงอ้างอิงเป็นจุดแข็งเฉพาะของ Vidu กรณีการใช้งานอ้างอิงทุกอย่างเป็นของ MiniMax

การคำนวณต่อวินาที ทีละระดับ

โมเดลทั้งสองคิดค่าบริการตามวินาทีของเอาต์พุตที่สร้างขึ้น ซึ่งทำให้สิ่งนี้เป็นการเปรียบเทียบที่หาได้ยาก โดยที่เราสามารถนำเรตการ์ดของทั้งสองมาเทียบกันได้โดยตรงโดยไม่ต้องแปลงหน่วย

• 540p — เฉพาะ Vidu Q4 Preview: 9 เครดิตต่อวินาที ประมาณ $0.045 ตามอัตราเครดิตมาตรฐาน $0.005 ที่แพลตฟอร์มประกาศไว้

• 720P 768P — Vidu Q4 Preview 19 เครดิตต่อวินาที ประมาณ $0.095 เทียบกับ MiniMax-H3 $0.08 ต่อวินาที

• 1080p — Vidu Q4 Preview 24 เครดิตต่อวินาที ประมาณ $0.12 เทียบกับ MiniMax-H3 ที่ไม่มีระดับ 1080p ที่ประกาศไว้

• 2K — Vidu Q4 Preview 38 เครดิตต่อวินาที ประมาณ $0.19 เทียบกับ MiniMax-H3 $0.13 ต่อวินาที

• 4K — เฉพาะ Vidu Q4 Preview: 78 เครดิตต่อวินาที ประมาณ $0.39

รูปแบบที่ได้จากสิ่งนั้นไม่ใช่ "อันหนึ่งถูกกว่า" พื้นราคาของ Vidu Q4 Preview ต่ำลงจริง ๆ — ระดับ 540p ของมันเป็นระดับสำหรับการบล็อกที่ตั้งราคาตามการใช้งานจริง ๆ เพื่อพิสูจน์องค์ประกอบก่อนจ่ายสำหรับการเรนเดอร์ความละเอียดเต็ม และไม่มีอะไรในตารางราคาของ MiniMax ที่ทำหน้าที่นั้น MiniMax H3 ถูกกว่าที่ 2K ซึ่งเป็นระดับสูงสุดที่ทั้งสองโมเดลมีร่วมกัน ประมาณหนึ่งในสาม และระดับ 4K ของ Vidu เป็นระดับการสร้าง 4K เพียงหนึ่งเดียวในการเปรียบเทียบ ด้วยราคาที่สะท้อนสิ่งนั้น

ตัวเลขเปิดตัว 0.014 ดอลลาร์ต่อวินาทีที่มาพร้อมกับประกาศของ Vidu นั้นเป็นระดับ 540p ในอัตราเครดิตที่ลดแล้ว ไม่ใช่อัตราทั่วไป ขณะนี้แพลตฟอร์มของ Shengshu กำลังจัดโปรโมชันส่วนลดแพ็กเกจแบบจำกัดเวลา สูงสุด 30% สำหรับแพ็กเครดิต ซึ่งลดทุกระดับลงพร้อมกัน มากกว่าจะเปลี่ยนรูปร่างของเส้นโค้ง ให้ใช้เส้นโค้งอัตราตามราคาที่ประกาศเป็นเกณฑ์เปรียบเทียบ และมองส่วนลดเป็นเพียงการชดเชยชั่วคราว

ในส่วนของเรา: เราให้บริการเส้นทาง MiniMax-H3 โดยเปิดให้บริการอยู่บน API โมเดลสาธารณะที่ minimax/minimax-h3 โดยคิดค่าบริการตามวินาทีของผลลัพธ์ที่สร้างขึ้น ในอัตราตามที่ผู้ให้บริการกำหนด และส่งผ่านโดยไม่บวกเพิ่มใด ๆ สามารถเรียกใช้ได้บนปลายทางที่เข้ากันได้กับ OpenAI เดียวกับโมเดลข้อความทุกตัวที่เราให้บริการ Vidu Q4 Preview ไม่ใช่เส้นทางของ OrcaRouter และหน้านี้ไม่ได้อ้างว่าเป็นเช่นนั้น — โมเดลวิดีโอที่เราให้บริการนั้นอยู่บนคีย์เดียวและรูปแบบคำขอเดียวเคียงกับโมเดลภาษา ซึ่งเป็นรูปแบบที่ทำให้การเปรียบเทียบหลาย ๆ ตัวมีต้นทุนต่ำ ผลในทางปฏิบัติประการหนึ่งของการคิดราคาแบบส่งผ่าน: เมื่อผู้ให้บริการปรับอัตราต่อวินาที การเปลี่ยนแปลงนั้นจะมองเห็นได้บนเส้นทางในวันเดียวกัน แทนที่จะเป็นตอนต่อสัญญา

“omni-modal” ให้ประโยชน์อะไรในคำขอจริง

บริบทแบบรวมเป็นหนึ่งของ MiniMax H3 นั้นอ่านเป็นรายการฟีเจอร์ได้ง่าย และมองข้ามความแตกต่างเชิงวิศวกรรมไปได้ง่าย โมเดลที่รับวิดีโอเป็นข้อมูลอ้างอิงอินพุตสามารถชี้ไปที่ช็อตที่มีอยู่แล้วและสั่งให้ต่อ ขยาย หรือปรับสไตล์ใหม่ได้ ส่วนโมเดลที่ไม่รับอินพุตวิดีโอทำเช่นนั้นไม่ได้ นั่นคือกลไกที่อยู่เบื้องหลังการปรากฏตัวของ H3 บนกระดานตัดต่อ และนี่ก็เป็นเหตุผลว่าทำไมช่วงเอาต์พุต 4–15 วินาทีของโมเดลจึงเป็นข้อจำกัดที่น้อยกว่าที่ตัวเลขบ่งชี้ — การขยายแบบหลายรอบ (multi-turn extension) เป็นวิธีปกติในการสร้างลำดับที่ยาวขึ้นจากมัน

เพดาน 16 วินาทีของ Vidu Q4 Preview ก็เป็นต่อการสร้างเช่นกัน และโหมด Reference-to-Video ของมันถูกสร้างขึ้นสำหรับการเล่าเรื่องแบบหลายช็อตภายในหน้าต่างเวลานั้น โดยเอกสารอธิบายถึงการสลับกล้องอัจฉริยะและความสอดคล้องในตำแหน่งกล้องหลายตำแหน่ง สิ่งที่มันไม่มีคือเส้นทางที่จะรับคลิปที่คุณถ่ายไว้แล้วและแก้ไขมัน หากเวิร์กโฟลว์ของคุณเริ่มจากฟุตเทจแทนที่จะเป็นภาพนิ่งหรือชุดอ้างอิง หนึ่งในสองโมเดลนี้ก็ไม่สามารถใช้ได้กับคุณ และไม่มีตัวเลข Elo ใดที่จะปิดช่องว่างนั้นได้

อันไหน แยกตามงาน

เลือกใช้ MiniMax H3 เมื่ออินพุตเป็นสิ่งอื่นใดนอกเหนือจากภาพหรือชุดอ้างอิง ไม่ว่าจะเป็นข้อความเป็นวิดีโอ การตัดต่อวิดีโอเป็นวิดีโอ การป้อนเสียง การขยายหลายรอบเกินสิบห้าวินาที หรือไปป์ไลน์ที่โมเดลจำเป็นต้องรองรับกรณีการใช้งานมากพอสำหรับบอร์ดที่แตกต่างกันถึงสามบอร์ด — นั่นคืออาณาเขตของ H3 และเป็นเพียงตัวเดียวในสองตัวที่มีคุณสมบัติเหล่านี้ เรต 2K ของมันยังถูกกว่าอีกตัวในระดับท็อปที่ทั้งสองมีร่วมกัน

เลือก Vidu Q4 Preview เมื่องานที่ทำคือความสม่ำเสมอของนักแสดงและเสียง หรือเมื่อคุณต้องการระดับการสร้างที่ 4K หรือเมื่อคุณอยากได้พาสบล็อกกิง 540p ราคาถูกไว้ลองปรับช็อตก่อนตัดสินใจจริง การอ้างอิงภาพ 15 รายการและเสียง 3 รายการถือเป็นงบการอ้างอิงที่เผยแพร่ซึ่งมากกว่าที่ MiniMax ระบุไว้ และไม่มีโมเดลอื่นในการเปรียบเทียบนี้ที่สร้างที่ 4K โดยกำเนิด ชุดโหมดที่แคบกว่าคือสิ่งที่ต้องแลกมาสำหรับเรื่องนั้น

อะไรจะเปลี่ยนสิ่งนี้: การเปิดตัว Vidu Q4 ฉบับเต็มที่เพิ่มเอนด์พอยต์แปลงข้อความเป็นวิดีโอ (text-to-video) จะนำสองโมเดลมาอยู่บนบอร์ดเดียวกัน และเปลี่ยนเรื่องนี้ให้กลายเป็นการแข่งขันแบบตรงไปตรงมา AA-Video-I2V v2.0 ซึ่งประกาศว่าจะมาพร้อม 1080p ตลอดทั้งระบบและการจัดหมวดหมู่ความสามารถฉบับปรับปรุง จะเข้ามาแทนที่คะแนนโหวตที่อยู่ด้านบนของบอร์ด แทนที่จะเพียงจัดเรียงคะแนนเหล่านั้นใหม่ — และมันจะชี้ชัดว่าการเสมอกันสามทางในปัจจุบันเป็นการเสมอกันจริงหรือเป็นข้อจำกัดของการวัด จนกว่าจะถึงตอนนั้น ตัวเลขที่ต้องจดจำคือ 16 โดยมีชื่อบอร์ดและวันที่อยู่ข้างๆ

สิ่งเดียวที่ควรค่าแก่การจดจำจากโพเดียมนี้เอง: การเป็นที่หนึ่งที่อยู่เหนืออันดับสามเพียงสิบหก Elo ในช่วงห่างที่กว้างขนาดนั้น ไม่ใช่การจัดอันดับ มันคือสามโมเดลที่ผู้ลงคะแนนที่เป็นมนุษย์ไม่สามารถแยกออกจากกันได้ และการตัดสินใจเลือกระหว่างพวกมันต้องมาจากทุกสิ่งอื่นๆ บนหน้านี้

A generated two-column scoreboard titled 'Vidu Q4 Preview vs MiniMax H3 - the scoreboard'. The left column reads: Image-to-video Elo 1,179 (3rd); Text-to-video not present; Video editing not present; Max resolution 4K generation tier; Clip length 1-16 seconds; Price at 2K about 0.19 USD per second. The right column reads: Image-to-video Elo 1,181 (2nd); Text-to-video 4th, 1,137; Video editing 4th, 1,119; Max resolution 2K; Clip length 4-15 seconds; Price at 2K 0.13 USD per second. A footer reads 'All Elo and rank figures per Artificial Analysis, 8 Oct 2026; prices per vendor rate cards.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the OrcaRouter model page for minimax/minimax-h3, showing MiniMax-H3 described as MiniMax's omni-modal video generation model and the Hailuo 3 generation, released July 31, 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio, billed per second of generated output at $0.08/s at 768P and $0.13/s at 2K, with an OpenAI-compatible code sample and a per-second price of $0.0800.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube