MiniMax H3 (Hailuo 3.0): โมเดลวิดีโอ AI ความละเอียด 2K พร้อม Omni-Reference อธิบาย
Guides & Insights

MiniMax H3 (Hailuo 3.0): โมเดลวิดีโอ AI ความละเอียด 2K พร้อม Omni-Reference อธิบาย

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

MiniMax H3 หรือที่รู้จักกันในชื่อ Hailuo 3.0 เป็นโมเดลสร้างวิดีโอด้วย AI รุ่นล่าสุดของ Mini​Max ซึ่งเปิดตัวที่งาน WAIC 2026 (วันที่ 17 กรกฎาคม 2026) เปิดให้สาธารณะใช้งานในวันที่ 31 กรกฎาคม และตอนนี้เปิดให้ใช้งานได้พร้อมกัน 4 ช่องทาง ได้แก่ แพลตฟอร์ม Hailuo ของ Mini​Max, Luma Agents, การดาวน์โหลดแบบ open-weight และ AI Gateway ของ Vercel (ตั้งแต่วันที่ 30 สิงหาคม) ซึ่งเป็นช่องทางที่ MiniMax H3 Max เวอร์ชันใหม่ที่เน้นความเร็วเป็นหลักเปิดตัวมาพร้อมกัน มันยกระดับสายวิดีโอของ Mini​Max ขึ้นเป็นความละเอียด 2K แบบเนทีฟ เพิ่มเสียงที่ซิงก์กันในรอบเดียว และแนะนำระบบควบคุมแบบ “omni-reference” ที่ครบครันผิดปกติ พัฒนาการล่าสุดอยู่ที่ฝั่ง self-hosting: ตั้งแต่วันที่ 1 กันยายน น้ำหนัก H3-Base เวอร์ชันเปิดสามารถให้บริการผ่าน vLLM-Omni ร่วมกับ FastH3 ของ FastVideo ซึ่งเร็วพอที่จะเรนเดอร์ MP4 แบบวิดีโอพร้อมเสียงความยาว 10.1 วินาทีทั้งไฟล์ได้ในราว 8.7 วินาที — เร็วกว่าระยะเวลาเล่นจริงของคลิปด้วยซ้ำ คู่มือนี้จะอธิบายว่า H3 จริง ๆ คืออะไร มีอะไรใหม่อย่างแท้จริง และอยู่ในตำแหน่งใดของโมเดลวิดีโอชั้นแนวหน้าปี 2026 — โดยระบุที่มาของความสามารถและติดป้ายข้อกล่าวอ้างด้านคุณภาพไว้อย่างชัดเจน

หมายเหตุด้านความถูกต้อง: ความสามารถของ H3 อ้างอิงจากประกาศและเอกสารแพลตฟอร์มของ Mini​Max ความพร้อมใช้ของ Vercel AI Gateway ได้รับการยืนยันแล้ว — แคตตาล็อกโมเดลของ Vercel ระบุทั้ง MiniMax H3 และ MiniMax H3 Max และ changelog ของ Vercel ก็บันทึกส่วนลดเปิดตัว — แม้ว่าเงื่อนไขโปรโมชันจะประกาศโดยผู้ให้บริการเองก็ตาม การผสานรวม Luma Agents และการเผยแพร่แบบ open-weight ยังคงเป็นข้อมูลที่ผู้ให้บริการประกาศ ณ เวลาที่เขียนนี้ เอกสารผลิตภัณฑ์ของ Luma เองยังไม่ระบุ H3 และเงื่อนไขการเข้าถึงการผสานรวมยังไม่ชัดเจน คุณภาพวิดีโอส่วนใหญ่เป็นเรื่องอัตวิสัย ประเมินจากเวทีที่ใช้ความชอบของมนุษย์เป็นเกณฑ์ ขณะนี้ H3 มีคะแนน Artificial Analysis arena ในช่วงแรก — ประมาณ 1,184 สำหรับ image-to-video และ 1,226 สำหรับ text-to-video พร้อมเสียง บันทึกเมื่อวันที่ 27 สิงหาคม 2026 — แม้อันดับใน arena จะเลื่อนไปเรื่อย ๆ เมื่อมีเสียงโหวตสะสม ตัวเลขการให้บริการแบบเร็วกว่าการเล่นจริง (faster-than-playback) ของวันที่ 1 กันยายน — ไฟล์ MP4 ความยาว 10.1 วินาทีพร้อมเสียงซิงโครไนซ์ ถูกเรนเดอร์จนเสร็จในเวลาประมาณ 8.7 วินาที — รายงานโดยทีม vLLM-Omni ในโพสต์บล็อกของทีมเอง โดยวัดบนเซิร์ฟเวอร์ 8× NVIDIA B300 เป็นค่าที่ทีมวัดขึ้นเอง ยังไม่ได้รับการทำซ้ำโดยอิสระ และเป็นการวัด FastH3 ซึ่งเป็นอะแดปเตอร์แบบกลั่นสี่ขั้นตอนของ FastVideo ไม่ใช่โมเดลฐานเต็มรูปแบบ โปรดถือว่าข้อกล่าวอ้างเชิงเปรียบเทียบอย่าง “อันไหนดูดีที่สุด” เป็นข้อสรุปชั่วคราว สเปกและราคาสามารถเปลี่ยนแปลงได้ — โปรดตรวจสอบก่อนเริ่มสร้างระบบ

TL;DR. H3 เป็นโมเดล text-to-video และ image-to-video แบบ native-2K 24fps ที่สร้างคลิปความยาว 5–15 วินาที (ขยายได้ถึง ~30 วินาที) พร้อมบทสนทนา เอฟเฟกต์เสียง และบรรยากาศเสียงที่ซิงค์กันในรอบเดียว จุดเด่นของมันคือ omni-reference (ภาพอ้างอิงได้ถึง 9 ภาพ คลิปวิดีโอ 3 คลิป และคลิปเสียง 3 คลิปเพื่อความสม่ำเสมอ) และการแก้ไขแบบใช้คำสั่ง (เปลี่ยนตัวละคร วัตถุ ฉาก เสียง หรือจังหวะโดยไม่ต้องสร้างใหม่) นับตั้งแต่เปิดตัวก็แพร่กระจายอย่างรวดเร็ว: น้ำหนักโมเดลฐานเปิดเป็นโอเพนซอร์สเมื่อวันที่ 3 สิงหาคม Mini​Max ประกาศ H3 ใน Luma Agents เมื่อวันที่ 6 สิงหาคม (วิดีโอ 2K ยาวสูงสุด 15 วินาทีพร้อมเสียงสเตอริโอแบบ native แม้เงื่อนไขการเข้าถึงยังไม่เปิดเผยต่อสาธารณะ) และในวันที่ 30 สิงหาคม MiniMax H3 และ MiniMax H3 Max ก็มาถึง AI Gateway ของ Vercel พร้อมส่วนลดเปิดตัว 50% เป็นเวลาสองสัปดาห์ ตั้งแต่ 1 กันยายน น้ำหนักโมเดลฐานแบบเปิดยังสามารถให้บริการเพื่อการสร้างแบบเรียลไทม์ได้: ผ่าน vLLM-Omni ร่วมกับ FastH3 ของ FastVideo ไฟล์ MP4 แบบวิดีโอและเสียงความยาว 10.1 วินาทีจะเรนเดอร์เสร็จในเวลาประมาณ 8.7 วินาที ซึ่งเร็วกว่าระยะเวลาเล่นจริง ตามเกณฑ์มาตรฐานของทีม vLLM-Omni มันเป็นก้าวสำคัญที่เหนือกว่า Hailuo 2.3 (ซึ่งเป็น 1080p ความยาว ~10 วินาที ไม่มี omni-reference) และแข่งขันกับ Kling 3.0, Go​ogle Veo 3.1, ByteDance Seedance 2.0 และอื่นๆ — แข็งแกร่งในด้านการควบคุมและเสียง โดยคะแนนจากแอรีนาอิสระช่วงแรกยังต้องรอให้ชัดเจน

ประเด็นสำคัญ

• H3 = Hailuo 3.0 โมเดลวิดีโอล่าสุดจาก MiniMax เปิดตัวที่งาน WAIC 2026 และปล่อยให้ใช้งานเมื่อวันที่ 31 กรกฎาคม; สามารถใช้งานได้ผ่าน Hailuo, Luma Agents, โอเพนเวต (open weights) และ AI Gateway ของ Vercel

• เนทีฟ 2K ที่ 24fps, คลิป 5–15 วินาที (ขยายได้ถึง ~30 วินาที), อัตราส่วนภาพหลายแบบ, ข้อความเป็นวิดีโอและรูปภาพเป็นวิดีโอ

• Omni-reference: รูปภาพสูงสุด 9 รูป, คลิปวิดีโอ 3 คลิป, และคลิปเสียง 3 คลิป เพื่อใช้อ้างอิงสำหรับความสอดคล้องของสไตล์ ตัวละคร การเคลื่อนไหว และเสียง

• บทสนทนาที่ประสานกัน เอฟเฟกต์เสียง และบรรยากาศ ถูกสร้างขึ้นในรอบเดียว; การแก้ไขตามคำสั่งโดยไม่ต้องสร้างใหม่ทั้งหมด

• น้ำหนักโมเดลฐานเปิดซอร์สเมื่อวันที่ 3 สิงหาคมภายใต้สัญญาอนุญาตสำหรับชุมชน ส่วนโมดูล Context-IR และ 2K-regeneration ยังคงใช้งานผ่าน API เท่านั้น

ในวันที่ 30 สิงหาคม MiniMax H3 และ MiniMax H3 Max เปิดตัวบน AI Gateway ของ Vercel พร้อมส่วนลดเปิดตัว 50% จนถึงวันที่ 13 กันยายน

• ตั้งแต่วันที่ 1 กันยายน ค่าน้ำหนัก H3-Base แบบเปิดสามารถให้บริการสำหรับการสร้างแบบเรียลไทม์ได้ — วิดีโอและเสียง MP4 ความยาว 10.1 วินาทีที่เรนเดอร์ในเวลาประมาณ 8.7 วินาที ซึ่งเร็วกว่าความยาวคลิป — ผ่าน vLLM-Omni และ FastH3 ของ FastVideo (ผล benchmark ที่ทีมรายงาน ยังไม่มีการทดสอบซ้ำโดยอิสระ)

• การอัปเกรดครั้งใหญ่เหนือ Hailuo 2.3 (1080p, ~10 วินาที); แข่งขันกับ Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7 และอื่นๆ

จริงๆ แล้ว MiniMax H3 คืออะไร

Mini​Max เป็นบริษัท AI ชั้นนำของจีน (บริษัทเข้าจดทะเบียนในตลาดหลักทรัพย์ฮ่องกงเมื่อเดือนมกราคม 2026 โดยระดมทุนได้ประมาณ 619 ล้านดอลลาร์สหรัฐ ด้วยมูลค่าประเมินราว 4 พันล้านดอลลาร์สหรัฐ และมีผู้สนับสนุนรวมถึง Alibaba และ Tencent) แบรนด์วิดีโอสำหรับผู้บริโภคคือ {{1}}Hailuo{{/1}} ซึ่งเป็นที่รู้จักในด้านการจำลองฟิสิกส์ที่เหนือชั้น การสร้างที่รวดเร็ว และราคาที่เข้าถึงได้ {{2}}H3{{/2}} คือโมเดล Hailuo รุ่นที่สาม เปิดตัวพร้อมกับโมเดลข้อความ {{3}}M3{{/3}} ของ Mini​Max และโซลูชันมัลติโมดัลอื่น ๆ ที่งาน WAIC 2026 และเปิดให้สาธารณชนใช้งานเมื่อวันที่ 31 กรกฎาคม 2026 โดยที่ M3 คือ LLM แบบข้อความ/agentic ส่วน H3 คือโมเดลสร้างวิดีโอโดยตรง

มีอะไรใหม่: 2K, omni-reference, และ one-pass audio

สามสิ่งที่นิยาม H3 อย่างแรก 2K เนทีฟที่ 24fps — ซึ่งสูงขึ้นจาก 1080p ของ Hailuo 2.3 — ที่จังหวะมาตรฐานภาพยนตร์ โดยคลิปมีความยาว 5 ถึง 15 วินาที (สามารถขยายได้ถึงประมาณ 30 วินาทีผ่านเครื่องมือ Extend) และอัตราส่วนภาพตั้งแต่ 21:9 ถึง 9:16 อย่างที่สอง omni-reference: คุณสามารถป้อนภาพอ้างอิงได้สูงสุด 9 ภาพ คลิปวิดีโอ 3 คลิป และคลิปเสียง 3 คลิปพร้อมกัน เพื่อล็อกสไตล์ เอกลักษณ์ตัวละคร การเคลื่อนไหว หรือเสียง — พื้นผิวควบคุมที่เอื้อเฟื้อผิดปกติสำหรับรักษาความสอดคล้องของตัวละครหรือลุคในแต่ละช็อต อย่างที่สาม เสียงที่ซิงค์ในรอบเดียว: H3 สร้างบทสนทนา เสียงประกอบ และบรรยากาศแวดล้อมที่สอดคล้องกับเหตุการณ์บนหน้าจอ แทนที่จะต้องมีขั้นตอนเสียงแยกต่างหาก

การแก้ไขตามคำสั่ง

คุณสมบัติที่สำคัญอย่างเงียบๆ คือการแก้ไขตามคำสั่ง: แทนที่จะสร้างคลิปใหม่ทั้งหมดเพื่อเปลี่ยนแปลง คุณสามารถอธิบายการแก้ไข — สลับตัวละคร ปรับเปลี่ยนวัตถุ เปลี่ยนฉาก ปรับเสียง หรือปรับจังหวะของช็อต — และ H3 จะนำไปปรับใช้ สำหรับงานสร้างสรรค์ที่ต้องทำซ้ำ การแก้ไขในที่เดิมแทนที่จะสุ่มสร้างใหม่นั้นเป็นข้อได้เปรียบในขั้นตอนการทำงานจริงๆ

มันเปรียบเทียบกับ Hailuo 2.3 อย่างไร

การก้าวกระโดดระหว่างรุ่นนั้นชัดเจน: H3 ขยับจาก 1080p ไปเป็น 2K ดั้งเดิม เพิ่มความยาวสูงสุดของรุ่นเดี่ยวจากประมาณ 10 วินาทีเป็น 15 วินาที (และสามารถขยายได้ถึง 30 วินาที) และเพิ่มทั้งอินพุตแบบ omni-reference และการแก้ไขตามคำสั่ง ซึ่ง 2.3 ขาดไป หากคุณใช้ Hailuo 2.3 H3 คือการอัปเกรดโดยตรงในเรื่องความละเอียด ความยาว การควบคุม และเสียง

ตำแหน่งของ H3 ในพรมแดนปี 2026

ตอนนี้ H3 มีคะแนน Artificial Analysis arena ในช่วงแรกเริ่ม — ประมาณ 1,184 ในด้านภาพเป็นวิดีโอ และ 1,226 ในด้านข้อความเป็นวิดีโอพร้อมเสียง ซึ่งบันทึกเมื่อวันที่ 27 สิงหาคม 2026 — แม้ว่าอันดับใน arena จะเปลี่ยนแปลงไปเมื่อคะแนนเสียงเพิ่มขึ้น ดังนั้นควรตัดสินจากพรอมต์ทดสอบของคุณเอง มากกว่าจะเชื่อจากข้อกล่าวอ้างใด ๆ เพียงข้อเดียว

หมายเหตุเกี่ยวกับ OpenAI Sora

ถ้าคุณกำลังสำรวจภาพรวมในวงการนี้: OpenAI ได้ยุติประสบการณ์เว็บและแอปของ Sora ในเดือนเมษายน 2026 โดย API ของมันมีกำหนดสิ้นสุดในเดือนกันยายน 2026 — ดังนั้น Sora จึงไม่ใช่โมเดลที่จะเริ่มเวิร์กโฟลว์วิดีโอใหม่ ๆ ขอบเขตที่ยังใช้งานได้จริงคือกลุ่มที่กล่าวถึงข้างต้น และ H3 ก็เข้าร่วมกับกลุ่มนั้น

วิธีเข้าถึง H3 และฟิลด์ที่เหลือ

ตอนนี้ H3 สามารถเข้าถึงได้สี่วิธี และรายการดังกล่าวก็เพิ่มขึ้นนับตั้งแต่เปิดตัว

• Hailuo (แพลตฟอร์มของ MiniMax เอง): ผลิตภัณฑ์เต็มรูปแบบ รวมถึงการแก้ไขตามคำสั่ง และการอัปสเกล H3-Regenerate-2K เป็น 2K

• Luma Agents: MiniMax ประกาศเมื่อวันที่ 6 สิงหาคม 2026 ว่า H3 พร้อมใช้งานในผลิตภัณฑ์ Agents แบบหลายโมเดลของ Luma แล้ว โดยสามารถสร้างวิดีโอความละเอียด 2K ได้สูงสุด 15 วินาที พร้อมเสียงสเตอริโอแบบเนทีฟ นี่เป็นการประกาศจากผู้ให้บริการ และเงื่อนไขการเข้าถึงยังไม่เปิดเผยต่อสาธารณะ — เอกสารผลิตภัณฑ์ของ Luma เองยังไม่ได้ระบุ H3 ในขณะที่เขียนนี้ — ดังนั้นจึงคาดว่ารายละเอียดด้านราคาและคุณสมบัติการมีสิทธิ์จะมีความชัดเจนในไม่ช้า การที่ Luma โฮสต์โมเดลวิดีโอของคู่แข่งภายในผลิตภัณฑ์ Agents ของตัวเอง เป็นสัญญาณว่าตลาดโมเดลวิดีโอปี 2026 กลายเป็นสินค้าที่ใช้แทนกันได้มากเพียงใด

• Vercel AI Gateway: เมื่อวันที่ 30 สิงหาคม 2026 MiniMax และ Vercel ได้ประกาศว่า MiniMax H3 และ MiniMax H3 Max ทั้งสองรุ่นสามารถใช้งานได้ผ่าน AI Gateway ของ Vercel โดยคำขอที่เรียกเก็บผ่านเกตเวย์จะได้รับส่วนลด 50% ตั้งแต่วันที่ 30 สิงหาคมถึง 13 กันยายน 2026 รหัสโมเดล — minimax/minimax-h3 และ minimax/minimax-h3-max — ยังคงไม่เปลี่ยนแปลง ดังนั้นการผสานรวมเกตเวย์ที่มีอยู่จะได้รับอัตราส่วนลดโดยไม่ต้องเปลี่ยนแปลงโค้ด ความพร้อมใช้งานได้รับการยืนยันในแคตตาล็อกโมเดลและบันทึกการเปลี่ยนแปลงของ Vercel เงื่อนไขโปรโมชันเป็นไปตามที่ผู้ขายประกาศ

• โมเดลน้ำหนักเปิด: เมื่อวันที่ 3 สิงหาคม 2026 MiniMax ได้เผยแพร่น้ำหนักของโมเดลฐาน H3 — ซึ่งเป็น dense transformer ขนาด 33B ชื่อ H3-Base — บน Hugging Face และ ModelScope ภายใต้สิทธิ์การใช้งาน MiniMax H3 Community License โดยมีเช็คพอยต์สองเวอร์ชัน: H3-Base-FL2VA สำหรับการสร้างวิดีโอ/เสียงจากข้อความและการสร้างคีย์เฟรม และ H3-Base-Ref2VA สำหรับการสร้างโดยอ้างอิงจากตัวอย่าง สองในสามโมดูลของระบบ — H3-Context-IR (ตัวประมวลผลพรอมป์) และ H3-Regenerate-2K (ตัวขยายความละเอียด 2K) — ไม่ได้รวมอยู่ในการเผยแพร่แบบเปิด และยังคงใช้งานผ่าน API เท่านั้น ดังนั้นการใช้งานบนเซิร์ฟเวอร์ของตนเองจึงจำกัดความละเอียดต่ำกว่า 2K และตั้งแต่ 1 กันยายนเป็นต้นไป น้ำหนักฐานชุดเดียวกันนี้สามารถให้บริการสำหรับการสร้างแบบเรียลไทม์ผ่าน vLLM-Omni และ FastH3 ของ FastVideo — ซึ่งเป็นตัวปรับแบบกลั่นสี่ขั้นตอนที่เรนเดอร์วิดีโอพร้อมเสียง MP4 ความยาว 10.1 วินาทีได้สมบูรณ์ในเวลาประมาณ 8.7 วินาทีบนเซิร์ฟเวอร์ NVIDIA B300 จำนวน 8 ตัว ซึ่งเร็วกว่าระยะเวลาการเล่นจริง (รายงานโดยทีมพัฒนา ยังไม่มีการทำซ้ำโดยอิสระ)

MiniMax H3 พร้อมใช้งานบน OrcaRouter ในราคาตามรายการของผู้ให้บริการ — $0.08 ต่อวินาทีที่ 768p และ $0.13 ต่อวินาทีที่ 2K — ส่งผ่านแบบไม่มีมาร์กอัป (0%) และมี failover อัตโนมัติ คุณจึงสามารถเรียกใช้ตระกูล H3 ผ่าน API ที่เข้ากันได้กับ OpenAI เพียงตัวเดียว แทนที่จะต้องไปเชื่อมต่อกับเอนด์พอยต์ของผู้ให้บริการที่เพิ่งเปิดตัวมาได้ไม่กี่วัน เนื่องจากไม่มีผู้ให้บริการรายใดโฮสต์โมเดลได้ครบทุกรุ่น แนวทางที่ใช้ได้จริงคือการส่งทราฟฟิก LLM และเอเจนต์ผ่านเอนด์พอยต์เดียว (OrcaRouter ยังรองรับโมเดลข้อความ M3 ของ MiniMax เองด้วย) และใช้โมเดลวิดีโอที่ดีที่สุดสำหรับแต่ละโปรเจกต์โดยตรง MiniMax H3 Max ยังไม่มีให้บริการผ่าน OrcaRouter — ตอนนี้ให้บริการผ่านช่องทางของบุคคลที่สาม — ดังนั้นหากคุณกำลังทำโปรโตไทป์กับมัน การทำ failover ไว้เป็นนิสัยจะคุ้มค่า: ลองโมเดลที่เพิ่งออกมาได้ไม่กี่วันโดยไม่ต้องเสี่ยงให้ไปป์ไลน์โปรดักชันต้องพึ่งพามัน

การให้บริการแบบเรียลไทม์: วิดีโอเร็วกว่าการเล่น

การพัฒนาที่อยู่เบื้องหลังการอัปเดตนี้อยู่ในด้าน self-hosting open base checkpoint ของ MiniMax H3 เป็น dense transformer ขนาด 33B และการสร้างคลิปด้วยวิธีมาตรฐานหมายถึงต้องทำ forward ของ diffusion-transformer ประมาณ 49 ครั้งบนกำหนดการ denoising ที่ยาว FastVideo ซึ่งเป็นโปรเจกต์โอเพนซอร์สสำหรับเทรนและอินเฟอเรนซ์วิดีโอ ได้เผยแพร่โมเดล student ที่ถูกกลั่นจาก H3-Base ชื่อ FastH3: โมเดลแบบสี่ขั้นตอน (สไตล์ DMD2) ที่นำ text encoder, video VAE, audio VAE, tokenizers และ schedulers ของ H3 มาใช้ใหม่ แต่ลดลูป denoising ลงเหลือการ forward ผ่าน transformer เพียงสี่ครั้งบนตำแหน่ง sigma ห้าตำแหน่ง vLLM-Omni ซึ่งเป็น multimodal serving runtime ได้รวม FastH3 adapter เข้าที่ตอนโหลด (pull request #6714) และเปิดใช้งานผ่าน endpoint /v1/videos ที่เข้ากันได้กับ O​penAI ควบคู่ไปกับการรองรับ base-H3 ที่มีอยู่ก่อนหน้านี้

ตัวเลขที่เป็นหัวข้อข่าววัดจากฮาร์ดแวร์ขนาดใหญ่ บนเซิร์ฟเวอร์ NVIDIA B300 จำนวน 8 ตัว ที่ความละเอียด 1344×768 และ 24fps ทีม vLLM-Omni รายงานว่าไฟล์ MP4 ความยาว 10.1 วินาทีเต็ม — ทั้งวิดีโอและเสียงที่ซิงค์กัน — ถูกเรนเดอร์แบบ end-to-end ในเวลาประมาณ 8.7 วินาที ซึ่งเร็วกว่าระยะเวลาการเล่นจริง นี่เป็น benchmark ที่ทีมรายงานเองเผยแพร่เมื่อวันที่ 1 กันยายน 2026 และยังไม่มีการทดสอบซ้ำอย่างอิสระ ตัวทีมเองก็ระบุว่าชุด benchmark ดิบยังอยู่ในระหว่างรอการเผยแพร่ และไม่ได้อ้างว่าคุณภาพเทียบเท่ากันระหว่างรุ่น base และ FastH3 บนฮาร์ดแวร์ที่เล็กกว่านั้นตัวเลขก็ไม่จัดจ้านเท่า — สูตรสำหรับชุมชนยังครอบคลุมการตั้งค่า RTX 5090 จำนวน 2 ตัวและการ์ดจอเดียวด้วย — และ FastH3 v1 รองรับเฉพาะ text-to-video-audio (T2VA) ที่ความละเอียด 1344×768 แทนที่จะเป็น 2K ซึ่งยังคงอยู่ในฝั่ง API

สำหรับผู้อ่าน นี่เปลี่ยนความหมายของ “self-hosting H3” ไปโดยสิ้นเชิง เมื่อก่อน น้ำหนักโมเดลแบบเปิดรันได้แต่ช้า — พอใช้กับงานแบตช์ แต่ใช้กับอะไรที่เป็นอินเทอร์แอกทีฟไม่ได้ ด้วย FastH3 บน vLLM-Omni ไพพ์ไลน์ H3 ในองค์กรสามารถประมวลผลคลิปความยาวสิบวินาทีให้เสร็จในเวลาที่สั้นกว่าความยาวคลิปมาก ซึ่งเป็นเกณฑ์ที่ทำให้ลูปผลิตภัณฑ์แบบเรียลไทม์ — การพรีวิชวลไลซ์สด การปรับช็อตซ้ำอย่างรวดเร็ว วิดีโอที่ขับเคลื่อนด้วยเอเจนต์ — ใช้งานได้จริง หากคุณไม่อยากรันเซิร์ฟเวอร์ 8 GPU เส้นทางแบบจัดการก็ไม่เปลี่ยนแปลง: MiniMax H3 อยู่บน OrcaRouter ในราคารายการของผู้ให้บริการ ส่งผ่านโดยคิดมาร์กอัป 0% พร้อมเฟลโอเวอร์อัตโนมัติ คุณจึงเรียกใช้ตระกูล H3 ผ่าน API ที่เข้ากันได้กับ OpenAI เพียงตัวเดียว โดยไม่ต้องเป็นเจ้าของฮาร์ดแวร์

สามสถานการณ์ที่ H3 โดดเด่น

1. ภาพยนตร์สั้นที่สอดคล้องกับตัวละครและสไตล์

Omni-reference (สูงสุด 9 ภาพ, 3 คลิป, 3 เสียง) ถูกสร้างขึ้นเพื่อรักษาความสม่ำเสมอของตัวละคร ลุค และเสียงในหลายช็อต — เหมาะสำหรับเนื้อเรื่องสั้นและเนื้อหาที่เป็นตอนๆ

2. สื่อสังคมและโฆษณาสร้างสรรค์ที่มีเสียง

One-pass synchronized dialogue, SFX, and ambience plus flexible aspect ratios (9:16 to 21:9) suit fast social and advertising workflows that need finished audio, not just visuals.

3. การแก้ไขอย่างสร้างสรรค์แบบวนซ้ำ

การแก้ไขตามคำแนะนำช่วยให้ทีมปรับแต่งคลิปโดยใช้คำอธิบายแทนการสร้างใหม่ ซึ่งช่วยเร่งการผลิตที่เน้นการแก้ไขหลายครั้ง

คำถามที่พบบ่อย

MiniMax H3 คืออะไร

H3 คือ Hailuo 3.0 โมเดลสร้างวิดีโอด้วย AI รุ่นล่าสุดของ Mini​Max เปิดตัวที่งาน WAIC 2026 (17 กรกฎาคม 2026) และเปิดให้ใช้งานเมื่อวันที่ 31 กรกฎาคม 2026 โดยสามารถสร้างวิดีโอเนทีฟ 2K ที่ 24fps พร้อมเสียงที่ซิงโครไนซ์ จากข้อความหรือรูปภาพ ด้วยการควบคุมแบบ omni-reference และการแก้ไขตามคำสั่ง

H3 เหมือนกับ MiniMax M3 ไหม

ไม่ใช่ M3 คือ LLM สำหรับงานข้อความ/เอเจนต์ของ MiniMax ส่วน H3 (Hailuo 3.0) คือโมเดลสร้างวิดีโอของบริษัท ทั้งคู่เปิดตัวในงานเดียวกันแต่ทำหน้าที่ต่างกัน

ตอนนี้ฉันสามารถใช้ H3 ได้ที่ไหน?

สี่ช่องทาง: แพลตฟอร์ม Hailuo ของ Mini​Max (ตัวเต็ม), AI Gateway ของ Vercel (ทั้ง H3 และ MiniMax H3 Max พร้อมส่วนลดช่วงเปิดตัว 50% จนถึงวันที่ 13 กันยายน), Luma Agents (ประกาศเมื่อวันที่ 6 สิงหาคม 2026 — รองรับวิดีโอ 2K ความยาวสูงสุด 15 วินาทีพร้อมเสียงสเตอริโอเนทีฟ, เงื่อนไขการเข้าถึงยังไม่ชัดเจน) และการโฮสต์ด้วยตนเองผ่านน้ำหนักโมเดลแบบเปิดของ H3-Base บน Hugging Face และ ModelScope — โดยตั้งแต่วันที่ 1 กันยายนเป็นต้นมา น้ำหนักโมเดลเหล่านี้สามารถให้บริการด้วยความเร็วที่เร็วกว่าระยะเวลาเล่นจริง ผ่าน vLLM-Omni ร่วมกับ FastH3 ของ FastVideo (เช่น สร้างไฟล์ MP4 วิดีโอและเสียงความยาว 10.1 วินาทีได้ในเวลาประมาณ 8.7 วินาทีบน B300 จำนวน 8 ตัว ตามทีม vLLM-Omni) โมเดลพื้นฐานยังถูกจัดเส้นทางบน OrcaRouter ในราคาตามรายการของผู้ให้บริการ

คลิป H3 มีความยาวและความละเอียดเท่าไหร่

เนทีฟ 2K ที่ 24fps, 5–15 วินาทีต่อการสร้าง, ขยายได้ถึงประมาณ 30 วินาที, ในอัตราส่วนภาพตั้งแต่ 21:9 ถึง 9:16.

omni-reference คืออะไร?

ระบบควบคุมที่รองรับภาพอ้างอิงสูงสุด 9 ภาพ, คลิปวิดีโอ 3 คลิป, และคลิปเสียง 3 คลิปในครั้งเดียวเพื่อรักษาความสม่ำเสมอของสไตล์ ตัวละคร การเคลื่อนไหว และเสียง

H3 ดีกว่า Kling 3.0 หรือ Veo 3.1 ไหม?

ขึ้นอยู่กับมิติที่พิจารณา Kling 3.0 ให้ 4K แบบเนทีฟและเป็นผู้นำในบางสนาม ขณะที่ Veo 3.1 แข็งแกร่งในบทสนทนา 48kHz ส่วน H3 เน้นการควบคุมแบบ omni-reference เสียงแบบ one-pass การตัดต่อ และราคา H3 มีคะแนน Artificial Analysis arena ในช่วงแรก (ประมาณ 1,184 สำหรับ image-to-video และ 1,226 สำหรับ text-to-video พร้อมเสียง ณ ปลายเดือนสิงหาคม) ซึ่งจะเปลี่ยนแปลงไปเมื่อคะแนนเสียงสะสมเพิ่มขึ้น — ลองทดสอบกับพรอมป์ตของคุณเอง

H3 เป็นโอเพนเวทหรือไม่?

ใช่บางส่วน MiniMax เปิดซอร์สน้ำหนักพื้นฐานของ H3 เมื่อวันที่ 3 สิงหาคม 2026 ซึ่งเป็นโมเดล Transformer ขนาด 33B ที่เผยแพร่บน Hugging Face และ ModelScope ภายใต้สัญญาอนุญาต MiniMax H3 Community License พร้อมด้วยเช็คพอยต์ FL2VA และ Ref2VA ตามข้อกำหนดของใบอนุญาต MiniMax การเผยแพร่ครั้งนี้จำกัดภูมิภาคที่ให้บริการ และข้อกำหนดยังรวมถึงผลลัพธ์ที่สร้างขึ้นด้วย โดยต้องระบุแหล่งที่มา โมดูลสองตัวที่ช่วยเติมเต็มประสบการณ์ระดับเรือธง ได้แก่ H3-Context-IR (การประมวลผลพรอมป์ต์ล่วงหน้า) และ H3-Regenerate-2K (การขยายเป็นความละเอียด 2K) ไม่ได้รวมอยู่ในแพ็กเกจเปิดซอร์สนี้ และยังคงเป็น API เท่านั้น ตั้งแต่วันที่ 1 กันยายนเป็นต้นไป น้ำหนักพื้นฐานที่เปิดไว้ยังสามารถใช้สำหรับการสร้างแบบเรียลไทม์ผ่าน vLLM-Omni และ FastH3 ของ FastVideo (FastH3 v1 รองรับเฉพาะการแปลงข้อความเป็นวิดีโอและเสียงเท่านั้น) ดังนั้น ใช่สำหรับโมเดลพื้นฐาน แต่มีข้อควรระวัง

บรรทัดล่าง

MiniMax H3 (Hailuo 3.0) คือการก้าวกระโดดครั้งสำคัญของสายผลิตภัณฑ์วิดีโอ MiniMax อย่างแท้จริง: มาพร้อม 2K แบบเนทีฟ เสียงซิงก์ในพาสเดียว การควบคุมแบบ omni-reference ที่ยืดหยุ่นเต็มที่ และการตัดต่อตามคำสั่ง ในราคาที่เข้าถึงได้ นับตั้งแต่เปิดตัว H3 ก็เข้าถึงได้ง่ายขึ้นอย่างมาก เพราะตอนนี้ถูกให้บริการผ่าน OrcaRouter ในราคารายการของผู้ให้บริการ ทำงานภายใน Luma Agents และเปิดน้ำหนักโมเดลพื้นฐานให้โฮสต์เองได้ (ซึ่งตั้งแต่วันที่ 1 กันยายนเป็นต้นมา ตัวโมเดลก็เร็วพอที่จะเรนเดอร์คลิปความยาว 10.1 วินาทีเสร็จได้เร็วกว่าระยะเวลาที่คลิปเล่นจริง ผ่าน vLLM-Omni และ FastH3 จาก FastVideo) นอกจากนี้ H3 และ MiniMax H3 Max ยังอยู่บน AI Gateway ของ Vercel พร้อมส่วนลดเปิดตัว 50% นานสองสัปดาห์ อย่างไรก็ตาม H3 จะไม่เหนือกว่าคู่แข่งที่เน้นความละเอียด 4K แบบเนทีฟโดยอัตโนมัติ และคะแนนในช่วงแรกบน Arena ก็ยังอยู่ในช่วงปรับตัว — แต่ในด้านการควบคุม เสียง และความเร็วในการปรับแก้ซ้ำ H3 ถือว่าน่าดึงดูดทีเดียว ลองนำ H3 ไปเทียบกับ Kling 3.0, Veo 3.1, Seedance 2.0 และโมเดลอื่นๆ ด้วยฟุตเทจของคุณเอง พร้อมทั้งรักษาสแตกโมเดลในภาพรวมให้เป็นกลางระหว่างผู้จำหน่ายผ่านเอ็นด์พอยต์เดียวอย่าง OrcaRouter

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube