
MiniMax H3 (Hailuo 3.0): โมเดลวิดีโอ AI ความละเอียด 2K พร้อม Omni-Reference อธิบาย
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
MiniMax H3 หรือที่รู้จักกันในชื่อ Hailuo 3.0 เป็นโมเดลสร้างวิดีโอด้วย AI รุ่นล่าสุดของ MiniMax ซึ่งเปิดตัวที่งาน WAIC 2026 (วันที่ 17 กรกฎาคม 2026) เปิดให้สาธารณะใช้งานในวันที่ 31 กรกฎาคม และตอนนี้เปิดให้ใช้งานได้พร้อมกัน 4 ช่องทาง ได้แก่ แพลตฟอร์ม Hailuo ของ MiniMax, Luma Agents, การดาวน์โหลดแบบ open-weight และ AI Gateway ของ Vercel (ตั้งแต่วันที่ 30 สิงหาคม) ซึ่งเป็นช่องทางที่ MiniMax H3 Max เวอร์ชันใหม่ที่เน้นความเร็วเป็นหลักเปิดตัวมาพร้อมกัน มันยกระดับสายวิดีโอของ MiniMax ขึ้นเป็นความละเอียด 2K แบบเนทีฟ เพิ่มเสียงที่ซิงก์กันในรอบเดียว และแนะนำระบบควบคุมแบบ “omni-reference” ที่ครบครันผิดปกติ พัฒนาการล่าสุดอยู่ที่ฝั่ง self-hosting: ตั้งแต่วันที่ 1 กันยายน น้ำหนัก H3-Base เวอร์ชันเปิดสามารถให้บริการผ่าน vLLM-Omni ร่วมกับ FastH3 ของ FastVideo ซึ่งเร็วพอที่จะเรนเดอร์ MP4 แบบวิดีโอพร้อมเสียงความยาว 10.1 วินาทีทั้งไฟล์ได้ในราว 8.7 วินาที — เร็วกว่าระยะเวลาเล่นจริงของคลิปด้วยซ้ำ คู่มือนี้จะอธิบายว่า H3 จริง ๆ คืออะไร มีอะไรใหม่อย่างแท้จริง และอยู่ในตำแหน่งใดของโมเดลวิดีโอชั้นแนวหน้าปี 2026 — โดยระบุที่มาของความสามารถและติดป้ายข้อกล่าวอ้างด้านคุณภาพไว้อย่างชัดเจน
หมายเหตุด้านความถูกต้อง: ความสามารถของ H3 อ้างอิงจากประกาศและเอกสารแพลตฟอร์มของ MiniMax ความพร้อมใช้ของ Vercel AI Gateway ได้รับการยืนยันแล้ว — แคตตาล็อกโมเดลของ Vercel ระบุทั้ง MiniMax H3 และ MiniMax H3 Max และ changelog ของ Vercel ก็บันทึกส่วนลดเปิดตัว — แม้ว่าเงื่อนไขโปรโมชันจะประกาศโดยผู้ให้บริการเองก็ตาม การผสานรวม Luma Agents และการเผยแพร่แบบ open-weight ยังคงเป็นข้อมูลที่ผู้ให้บริการประกาศ ณ เวลาที่เขียนนี้ เอกสารผลิตภัณฑ์ของ Luma เองยังไม่ระบุ H3 และเงื่อนไขการเข้าถึงการผสานรวมยังไม่ชัดเจน คุณภาพวิดีโอส่วนใหญ่เป็นเรื่องอัตวิสัย ประเมินจากเวทีที่ใช้ความชอบของมนุษย์เป็นเกณฑ์ ขณะนี้ H3 มีคะแนน Artificial Analysis arena ในช่วงแรก — ประมาณ 1,184 สำหรับ image-to-video และ 1,226 สำหรับ text-to-video พร้อมเสียง บันทึกเมื่อวันที่ 27 สิงหาคม 2026 — แม้อันดับใน arena จะเลื่อนไปเรื่อย ๆ เมื่อมีเสียงโหวตสะสม ตัวเลขการให้บริการแบบเร็วกว่าการเล่นจริง (faster-than-playback) ของวันที่ 1 กันยายน — ไฟล์ MP4 ความยาว 10.1 วินาทีพร้อมเสียงซิงโครไนซ์ ถูกเรนเดอร์จนเสร็จในเวลาประมาณ 8.7 วินาที — รายงานโดยทีม vLLM-Omni ในโพสต์บล็อกของทีมเอง โดยวัดบนเซิร์ฟเวอร์ 8× NVIDIA B300 เป็นค่าที่ทีมวัดขึ้นเอง ยังไม่ได้รับการทำซ้ำโดยอิสระ และเป็นการวัด FastH3 ซึ่งเป็นอะแดปเตอร์แบบกลั่นสี่ขั้นตอนของ FastVideo ไม่ใช่โมเดลฐานเต็มรูปแบบ โปรดถือว่าข้อกล่าวอ้างเชิงเปรียบเทียบอย่าง “อันไหนดูดีที่สุด” เป็นข้อสรุปชั่วคราว สเปกและราคาสามารถเปลี่ยนแปลงได้ — โปรดตรวจสอบก่อนเริ่มสร้างระบบ
TL;DR. H3 เป็นโมเดล text-to-video และ image-to-video แบบ native-2K 24fps ที่สร้างคลิปความยาว 5–15 วินาที (ขยายได้ถึง ~30 วินาที) พร้อมบทสนทนา เอฟเฟกต์เสียง และบรรยากาศเสียงที่ซิงค์กันในรอบเดียว จุดเด่นของมันคือ omni-reference (ภาพอ้างอิงได้ถึง 9 ภาพ คลิปวิดีโอ 3 คลิป และคลิปเสียง 3 คลิปเพื่อความสม่ำเสมอ) และการแก้ไขแบบใช้คำสั่ง (เปลี่ยนตัวละคร วัตถุ ฉาก เสียง หรือจังหวะโดยไม่ต้องสร้างใหม่) นับตั้งแต่เปิดตัวก็แพร่กระจายอย่างรวดเร็ว: น้ำหนักโมเดลฐานเปิดเป็นโอเพนซอร์สเมื่อวันที่ 3 สิงหาคม MiniMax ประกาศ H3 ใน Luma Agents เมื่อวันที่ 6 สิงหาคม (วิดีโอ 2K ยาวสูงสุด 15 วินาทีพร้อมเสียงสเตอริโอแบบ native แม้เงื่อนไขการเข้าถึงยังไม่เปิดเผยต่อสาธารณะ) และในวันที่ 30 สิงหาคม MiniMax H3 และ MiniMax H3 Max ก็มาถึง AI Gateway ของ Vercel พร้อมส่วนลดเปิดตัว 50% เป็นเวลาสองสัปดาห์ ตั้งแต่ 1 กันยายน น้ำหนักโมเดลฐานแบบเปิดยังสามารถให้บริการเพื่อการสร้างแบบเรียลไทม์ได้: ผ่าน vLLM-Omni ร่วมกับ FastH3 ของ FastVideo ไฟล์ MP4 แบบวิดีโอและเสียงความยาว 10.1 วินาทีจะเรนเดอร์เสร็จในเวลาประมาณ 8.7 วินาที ซึ่งเร็วกว่าระยะเวลาเล่นจริง ตามเกณฑ์มาตรฐานของทีม vLLM-Omni มันเป็นก้าวสำคัญที่เหนือกว่า Hailuo 2.3 (ซึ่งเป็น 1080p ความยาว ~10 วินาที ไม่มี omni-reference) และแข่งขันกับ Kling 3.0, Google Veo 3.1, ByteDance Seedance 2.0 และอื่นๆ — แข็งแกร่งในด้านการควบคุมและเสียง โดยคะแนนจากแอรีนาอิสระช่วงแรกยังต้องรอให้ชัดเจน
ประเด็นสำคัญ
• H3 = Hailuo 3.0 โมเดลวิดีโอล่าสุดจาก MiniMax เปิดตัวที่งาน WAIC 2026 และปล่อยให้ใช้งานเมื่อวันที่ 31 กรกฎาคม; สามารถใช้งานได้ผ่าน Hailuo, Luma Agents, โอเพนเวต (open weights) และ AI Gateway ของ Vercel
• เนทีฟ 2K ที่ 24fps, คลิป 5–15 วินาที (ขยายได้ถึง ~30 วินาที), อัตราส่วนภาพหลายแบบ, ข้อความเป็นวิดีโอและรูปภาพเป็นวิดีโอ
• Omni-reference: รูปภาพสูงสุด 9 รูป, คลิปวิดีโอ 3 คลิป, และคลิปเสียง 3 คลิป เพื่อใช้อ้างอิงสำหรับความสอดคล้องของสไตล์ ตัวละคร การเคลื่อนไหว และเสียง
• บทสนทนาที่ประสานกัน เอฟเฟกต์เสียง และบรรยากาศ ถูกสร้างขึ้นในรอบเดียว; การแก้ไขตามคำสั่งโดยไม่ต้องสร้างใหม่ทั้งหมด
• น้ำหนักโมเดลฐานเปิดซอร์สเมื่อวันที่ 3 สิงหาคมภายใต้สัญญาอนุญาตสำหรับชุมชน ส่วนโมดูล Context-IR และ 2K-regeneration ยังคงใช้งานผ่าน API เท่านั้น
ในวันที่ 30 สิงหาคม MiniMax H3 และ MiniMax H3 Max เปิดตัวบน AI Gateway ของ Vercel พร้อมส่วนลดเปิดตัว 50% จนถึงวันที่ 13 กันยายน
• ตั้งแต่วันที่ 1 กันยายน ค่าน้ำหนัก H3-Base แบบเปิดสามารถให้บริการสำหรับการสร้างแบบเรียลไทม์ได้ — วิดีโอและเสียง MP4 ความยาว 10.1 วินาทีที่เรนเดอร์ในเวลาประมาณ 8.7 วินาที ซึ่งเร็วกว่าความยาวคลิป — ผ่าน vLLM-Omni และ FastH3 ของ FastVideo (ผล benchmark ที่ทีมรายงาน ยังไม่มีการทดสอบซ้ำโดยอิสระ)
• การอัปเกรดครั้งใหญ่เหนือ Hailuo 2.3 (1080p, ~10 วินาที); แข่งขันกับ Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7 และอื่นๆ
จริงๆ แล้ว MiniMax H3 คืออะไร
MiniMax เป็นบริษัท AI ชั้นนำของจีน (บริษัทเข้าจดทะเบียนในตลาดหลักทรัพย์ฮ่องกงเมื่อเดือนมกราคม 2026 โดยระดมทุนได้ประมาณ 619 ล้านดอลลาร์สหรัฐ ด้วยมูลค่าประเมินราว 4 พันล้านดอลลาร์สหรัฐ และมีผู้สนับสนุนรวมถึง Alibaba และ Tencent) แบรนด์วิดีโอสำหรับผู้บริโภคคือ {{1}}Hailuo{{/1}} ซึ่งเป็นที่รู้จักในด้านการจำลองฟิสิกส์ที่เหนือชั้น การสร้างที่รวดเร็ว และราคาที่เข้าถึงได้ {{2}}H3{{/2}} คือโมเดล Hailuo รุ่นที่สาม เปิดตัวพร้อมกับโมเดลข้อความ {{3}}M3{{/3}} ของ MiniMax และโซลูชันมัลติโมดัลอื่น ๆ ที่งาน WAIC 2026 และเปิดให้สาธารณชนใช้งานเมื่อวันที่ 31 กรกฎาคม 2026 โดยที่ M3 คือ LLM แบบข้อความ/agentic ส่วน H3 คือโมเดลสร้างวิดีโอโดยตรง
มีอะไรใหม่: 2K, omni-reference, และ one-pass audio
สามสิ่งที่นิยาม H3 อย่างแรก 2K เนทีฟที่ 24fps — ซึ่งสูงขึ้นจาก 1080p ของ Hailuo 2.3 — ที่จังหวะมาตรฐานภาพยนตร์ โดยคลิปมีความยาว 5 ถึง 15 วินาที (สามารถขยายได้ถึงประมาณ 30 วินาทีผ่านเครื่องมือ Extend) และอัตราส่วนภาพตั้งแต่ 21:9 ถึง 9:16 อย่างที่สอง omni-reference: คุณสามารถป้อนภาพอ้างอิงได้สูงสุด 9 ภาพ คลิปวิดีโอ 3 คลิป และคลิปเสียง 3 คลิปพร้อมกัน เพื่อล็อกสไตล์ เอกลักษณ์ตัวละคร การเคลื่อนไหว หรือเสียง — พื้นผิวควบคุมที่เอื้อเฟื้อผิดปกติสำหรับรักษาความสอดคล้องของตัวละครหรือลุคในแต่ละช็อต อย่างที่สาม เสียงที่ซิงค์ในรอบเดียว: H3 สร้างบทสนทนา เสียงประกอบ และบรรยากาศแวดล้อมที่สอดคล้องกับเหตุการณ์บนหน้าจอ แทนที่จะต้องมีขั้นตอนเสียงแยกต่างหาก

การแก้ไขตามคำสั่ง
คุณสมบัติที่สำคัญอย่างเงียบๆ คือการแก้ไขตามคำสั่ง: แทนที่จะสร้างคลิปใหม่ทั้งหมดเพื่อเปลี่ยนแปลง คุณสามารถอธิบายการแก้ไข — สลับตัวละคร ปรับเปลี่ยนวัตถุ เปลี่ยนฉาก ปรับเสียง หรือปรับจังหวะของช็อต — และ H3 จะนำไปปรับใช้ สำหรับงานสร้างสรรค์ที่ต้องทำซ้ำ การแก้ไขในที่เดิมแทนที่จะสุ่มสร้างใหม่นั้นเป็นข้อได้เปรียบในขั้นตอนการทำงานจริงๆ
มันเปรียบเทียบกับ Hailuo 2.3 อย่างไร
การก้าวกระโดดระหว่างรุ่นนั้นชัดเจน: H3 ขยับจาก 1080p ไปเป็น 2K ดั้งเดิม เพิ่มความยาวสูงสุดของรุ่นเดี่ยวจากประมาณ 10 วินาทีเป็น 15 วินาที (และสามารถขยายได้ถึง 30 วินาที) และเพิ่มทั้งอินพุตแบบ omni-reference และการแก้ไขตามคำสั่ง ซึ่ง 2.3 ขาดไป หากคุณใช้ Hailuo 2.3 H3 คือการอัปเกรดโดยตรงในเรื่องความละเอียด ความยาว การควบคุม และเสียง
ตำแหน่งของ H3 ในพรมแดนปี 2026
ตอนนี้ H3 มีคะแนน Artificial Analysis arena ในช่วงแรกเริ่ม — ประมาณ 1,184 ในด้านภาพเป็นวิดีโอ และ 1,226 ในด้านข้อความเป็นวิดีโอพร้อมเสียง ซึ่งบันทึกเมื่อวันที่ 27 สิงหาคม 2026 — แม้ว่าอันดับใน arena จะเปลี่ยนแปลงไปเมื่อคะแนนเสียงเพิ่มขึ้น ดังนั้นควรตัดสินจากพรอมต์ทดสอบของคุณเอง มากกว่าจะเชื่อจากข้อกล่าวอ้างใด ๆ เพียงข้อเดียว
หมายเหตุเกี่ยวกับ OpenAI Sora
ถ้าคุณกำลังสำรวจภาพรวมในวงการนี้: OpenAI ได้ยุติประสบการณ์เว็บและแอปของ Sora ในเดือนเมษายน 2026 โดย API ของมันมีกำหนดสิ้นสุดในเดือนกันยายน 2026 — ดังนั้น Sora จึงไม่ใช่โมเดลที่จะเริ่มเวิร์กโฟลว์วิดีโอใหม่ ๆ ขอบเขตที่ยังใช้งานได้จริงคือกลุ่มที่กล่าวถึงข้างต้น และ H3 ก็เข้าร่วมกับกลุ่มนั้น
วิธีเข้าถึง H3 และฟิลด์ที่เหลือ
ตอนนี้ H3 สามารถเข้าถึงได้สี่วิธี และรายการดังกล่าวก็เพิ่มขึ้นนับตั้งแต่เปิดตัว
• Hailuo (แพลตฟอร์มของ MiniMax เอง): ผลิตภัณฑ์เต็มรูปแบบ รวมถึงการแก้ไขตามคำสั่ง และการอัปสเกล H3-Regenerate-2K เป็น 2K
• Luma Agents: MiniMax ประกาศเมื่อวันที่ 6 สิงหาคม 2026 ว่า H3 พร้อมใช้งานในผลิตภัณฑ์ Agents แบบหลายโมเดลของ Luma แล้ว โดยสามารถสร้างวิดีโอความละเอียด 2K ได้สูงสุด 15 วินาที พร้อมเสียงสเตอริโอแบบเนทีฟ นี่เป็นการประกาศจากผู้ให้บริการ และเงื่อนไขการเข้าถึงยังไม่เปิดเผยต่อสาธารณะ — เอกสารผลิตภัณฑ์ของ Luma เองยังไม่ได้ระบุ H3 ในขณะที่เขียนนี้ — ดังนั้นจึงคาดว่ารายละเอียดด้านราคาและคุณสมบัติการมีสิทธิ์จะมีความชัดเจนในไม่ช้า การที่ Luma โฮสต์โมเดลวิดีโอของคู่แข่งภายในผลิตภัณฑ์ Agents ของตัวเอง เป็นสัญญาณว่าตลาดโมเดลวิดีโอปี 2026 กลายเป็นสินค้าที่ใช้แทนกันได้มากเพียงใด
• Vercel AI Gateway: เมื่อวันที่ 30 สิงหาคม 2026 MiniMax และ Vercel ได้ประกาศว่า MiniMax H3 และ MiniMax H3 Max ทั้งสองรุ่นสามารถใช้งานได้ผ่าน AI Gateway ของ Vercel โดยคำขอที่เรียกเก็บผ่านเกตเวย์จะได้รับส่วนลด 50% ตั้งแต่วันที่ 30 สิงหาคมถึง 13 กันยายน 2026 รหัสโมเดล — minimax/minimax-h3 และ minimax/minimax-h3-max — ยังคงไม่เปลี่ยนแปลง ดังนั้นการผสานรวมเกตเวย์ที่มีอยู่จะได้รับอัตราส่วนลดโดยไม่ต้องเปลี่ยนแปลงโค้ด ความพร้อมใช้งานได้รับการยืนยันในแคตตาล็อกโมเดลและบันทึกการเปลี่ยนแปลงของ Vercel เงื่อนไขโปรโมชันเป็นไปตามที่ผู้ขายประกาศ
• โมเดลน้ำหนักเปิด: เมื่อวันที่ 3 สิงหาคม 2026 MiniMax ได้เผยแพร่น้ำหนักของโมเดลฐาน H3 — ซึ่งเป็น dense transformer ขนาด 33B ชื่อ H3-Base — บน Hugging Face และ ModelScope ภายใต้สิทธิ์การใช้งาน MiniMax H3 Community License โดยมีเช็คพอยต์สองเวอร์ชัน: H3-Base-FL2VA สำหรับการสร้างวิดีโอ/เสียงจากข้อความและการสร้างคีย์เฟรม และ H3-Base-Ref2VA สำหรับการสร้างโดยอ้างอิงจากตัวอย่าง สองในสามโมดูลของระบบ — H3-Context-IR (ตัวประมวลผลพรอมป์) และ H3-Regenerate-2K (ตัวขยายความละเอียด 2K) — ไม่ได้รวมอยู่ในการเผยแพร่แบบเปิด และยังคงใช้งานผ่าน API เท่านั้น ดังนั้นการใช้งานบนเซิร์ฟเวอร์ของตนเองจึงจำกัดความละเอียดต่ำกว่า 2K และตั้งแต่ 1 กันยายนเป็นต้นไป น้ำหนักฐานชุดเดียวกันนี้สามารถให้บริการสำหรับการสร้างแบบเรียลไทม์ผ่าน vLLM-Omni และ FastH3 ของ FastVideo — ซึ่งเป็นตัวปรับแบบกลั่นสี่ขั้นตอนที่เรนเดอร์วิดีโอพร้อมเสียง MP4 ความยาว 10.1 วินาทีได้สมบูรณ์ในเวลาประมาณ 8.7 วินาทีบนเซิร์ฟเวอร์ NVIDIA B300 จำนวน 8 ตัว ซึ่งเร็วกว่าระยะเวลาการเล่นจริง (รายงานโดยทีมพัฒนา ยังไม่มีการทำซ้ำโดยอิสระ)
MiniMax H3 พร้อมใช้งานบน OrcaRouter ในราคาตามรายการของผู้ให้บริการ — $0.08 ต่อวินาทีที่ 768p และ $0.13 ต่อวินาทีที่ 2K — ส่งผ่านแบบไม่มีมาร์กอัป (0%) และมี failover อัตโนมัติ คุณจึงสามารถเรียกใช้ตระกูล H3 ผ่าน API ที่เข้ากันได้กับ OpenAI เพียงตัวเดียว แทนที่จะต้องไปเชื่อมต่อกับเอนด์พอยต์ของผู้ให้บริการที่เพิ่งเปิดตัวมาได้ไม่กี่วัน เนื่องจากไม่มีผู้ให้บริการรายใดโฮสต์โมเดลได้ครบทุกรุ่น แนวทางที่ใช้ได้จริงคือการส่งทราฟฟิก LLM และเอเจนต์ผ่านเอนด์พอยต์เดียว (OrcaRouter ยังรองรับโมเดลข้อความ M3 ของ MiniMax เองด้วย) และใช้โมเดลวิดีโอที่ดีที่สุดสำหรับแต่ละโปรเจกต์โดยตรง MiniMax H3 Max ยังไม่มีให้บริการผ่าน OrcaRouter — ตอนนี้ให้บริการผ่านช่องทางของบุคคลที่สาม — ดังนั้นหากคุณกำลังทำโปรโตไทป์กับมัน การทำ failover ไว้เป็นนิสัยจะคุ้มค่า: ลองโมเดลที่เพิ่งออกมาได้ไม่กี่วันโดยไม่ต้องเสี่ยงให้ไปป์ไลน์โปรดักชันต้องพึ่งพามัน

การให้บริการแบบเรียลไทม์: วิดีโอเร็วกว่าการเล่น
การพัฒนาที่อยู่เบื้องหลังการอัปเดตนี้อยู่ในด้าน self-hosting open base checkpoint ของ MiniMax H3 เป็น dense transformer ขนาด 33B และการสร้างคลิปด้วยวิธีมาตรฐานหมายถึงต้องทำ forward ของ diffusion-transformer ประมาณ 49 ครั้งบนกำหนดการ denoising ที่ยาว FastVideo ซึ่งเป็นโปรเจกต์โอเพนซอร์สสำหรับเทรนและอินเฟอเรนซ์วิดีโอ ได้เผยแพร่โมเดล student ที่ถูกกลั่นจาก H3-Base ชื่อ FastH3: โมเดลแบบสี่ขั้นตอน (สไตล์ DMD2) ที่นำ text encoder, video VAE, audio VAE, tokenizers และ schedulers ของ H3 มาใช้ใหม่ แต่ลดลูป denoising ลงเหลือการ forward ผ่าน transformer เพียงสี่ครั้งบนตำแหน่ง sigma ห้าตำแหน่ง vLLM-Omni ซึ่งเป็น multimodal serving runtime ได้รวม FastH3 adapter เข้าที่ตอนโหลด (pull request #6714) และเปิดใช้งานผ่าน endpoint /v1/videos ที่เข้ากันได้กับ OpenAI ควบคู่ไปกับการรองรับ base-H3 ที่มีอยู่ก่อนหน้านี้
ตัวเลขที่เป็นหัวข้อข่าววัดจากฮาร์ดแวร์ขนาดใหญ่ บนเซิร์ฟเวอร์ NVIDIA B300 จำนวน 8 ตัว ที่ความละเอียด 1344×768 และ 24fps ทีม vLLM-Omni รายงานว่าไฟล์ MP4 ความยาว 10.1 วินาทีเต็ม — ทั้งวิดีโอและเสียงที่ซิงค์กัน — ถูกเรนเดอร์แบบ end-to-end ในเวลาประมาณ 8.7 วินาที ซึ่งเร็วกว่าระยะเวลาการเล่นจริง นี่เป็น benchmark ที่ทีมรายงานเองเผยแพร่เมื่อวันที่ 1 กันยายน 2026 และยังไม่มีการทดสอบซ้ำอย่างอิสระ ตัวทีมเองก็ระบุว่าชุด benchmark ดิบยังอยู่ในระหว่างรอการเผยแพร่ และไม่ได้อ้างว่าคุณภาพเทียบเท่ากันระหว่างรุ่น base และ FastH3 บนฮาร์ดแวร์ที่เล็กกว่านั้นตัวเลขก็ไม่จัดจ้านเท่า — สูตรสำหรับชุมชนยังครอบคลุมการตั้งค่า RTX 5090 จำนวน 2 ตัวและการ์ดจอเดียวด้วย — และ FastH3 v1 รองรับเฉพาะ text-to-video-audio (T2VA) ที่ความละเอียด 1344×768 แทนที่จะเป็น 2K ซึ่งยังคงอยู่ในฝั่ง API
สำหรับผู้อ่าน นี่เปลี่ยนความหมายของ “self-hosting H3” ไปโดยสิ้นเชิง เมื่อก่อน น้ำหนักโมเดลแบบเปิดรันได้แต่ช้า — พอใช้กับงานแบตช์ แต่ใช้กับอะไรที่เป็นอินเทอร์แอกทีฟไม่ได้ ด้วย FastH3 บน vLLM-Omni ไพพ์ไลน์ H3 ในองค์กรสามารถประมวลผลคลิปความยาวสิบวินาทีให้เสร็จในเวลาที่สั้นกว่าความยาวคลิปมาก ซึ่งเป็นเกณฑ์ที่ทำให้ลูปผลิตภัณฑ์แบบเรียลไทม์ — การพรีวิชวลไลซ์สด การปรับช็อตซ้ำอย่างรวดเร็ว วิดีโอที่ขับเคลื่อนด้วยเอเจนต์ — ใช้งานได้จริง หากคุณไม่อยากรันเซิร์ฟเวอร์ 8 GPU เส้นทางแบบจัดการก็ไม่เปลี่ยนแปลง: MiniMax H3 อยู่บน OrcaRouter ในราคารายการของผู้ให้บริการ ส่งผ่านโดยคิดมาร์กอัป 0% พร้อมเฟลโอเวอร์อัตโนมัติ คุณจึงเรียกใช้ตระกูล H3 ผ่าน API ที่เข้ากันได้กับ OpenAI เพียงตัวเดียว โดยไม่ต้องเป็นเจ้าของฮาร์ดแวร์
สามสถานการณ์ที่ H3 โดดเด่น
1. ภาพยนตร์สั้นที่สอดคล้องกับตัวละครและสไตล์
Omni-reference (สูงสุด 9 ภาพ, 3 คลิป, 3 เสียง) ถูกสร้างขึ้นเพื่อรักษาความสม่ำเสมอของตัวละคร ลุค และเสียงในหลายช็อต — เหมาะสำหรับเนื้อเรื่องสั้นและเนื้อหาที่เป็นตอนๆ
2. สื่อสังคมและโฆษณาสร้างสรรค์ที่มีเสียง
One-pass synchronized dialogue, SFX, and ambience plus flexible aspect ratios (9:16 to 21:9) suit fast social and advertising workflows that need finished audio, not just visuals.
3. การแก้ไขอย่างสร้างสรรค์แบบวนซ้ำ
การแก้ไขตามคำแนะนำช่วยให้ทีมปรับแต่งคลิปโดยใช้คำอธิบายแทนการสร้างใหม่ ซึ่งช่วยเร่งการผลิตที่เน้นการแก้ไขหลายครั้ง

คำถามที่พบบ่อย
MiniMax H3 คืออะไร
H3 คือ Hailuo 3.0 โมเดลสร้างวิดีโอด้วย AI รุ่นล่าสุดของ MiniMax เปิดตัวที่งาน WAIC 2026 (17 กรกฎาคม 2026) และเปิดให้ใช้งานเมื่อวันที่ 31 กรกฎาคม 2026 โดยสามารถสร้างวิดีโอเนทีฟ 2K ที่ 24fps พร้อมเสียงที่ซิงโครไนซ์ จากข้อความหรือรูปภาพ ด้วยการควบคุมแบบ omni-reference และการแก้ไขตามคำสั่ง
H3 เหมือนกับ MiniMax M3 ไหม
ไม่ใช่ M3 คือ LLM สำหรับงานข้อความ/เอเจนต์ของ MiniMax ส่วน H3 (Hailuo 3.0) คือโมเดลสร้างวิดีโอของบริษัท ทั้งคู่เปิดตัวในงานเดียวกันแต่ทำหน้าที่ต่างกัน
ตอนนี้ฉันสามารถใช้ H3 ได้ที่ไหน?
สี่ช่องทาง: แพลตฟอร์ม Hailuo ของ MiniMax (ตัวเต็ม), AI Gateway ของ Vercel (ทั้ง H3 และ MiniMax H3 Max พร้อมส่วนลดช่วงเปิดตัว 50% จนถึงวันที่ 13 กันยายน), Luma Agents (ประกาศเมื่อวันที่ 6 สิงหาคม 2026 — รองรับวิดีโอ 2K ความยาวสูงสุด 15 วินาทีพร้อมเสียงสเตอริโอเนทีฟ, เงื่อนไขการเข้าถึงยังไม่ชัดเจน) และการโฮสต์ด้วยตนเองผ่านน้ำหนักโมเดลแบบเปิดของ H3-Base บน Hugging Face และ ModelScope — โดยตั้งแต่วันที่ 1 กันยายนเป็นต้นมา น้ำหนักโมเดลเหล่านี้สามารถให้บริการด้วยความเร็วที่เร็วกว่าระยะเวลาเล่นจริง ผ่าน vLLM-Omni ร่วมกับ FastH3 ของ FastVideo (เช่น สร้างไฟล์ MP4 วิดีโอและเสียงความยาว 10.1 วินาทีได้ในเวลาประมาณ 8.7 วินาทีบน B300 จำนวน 8 ตัว ตามทีม vLLM-Omni) โมเดลพื้นฐานยังถูกจัดเส้นทางบน OrcaRouter ในราคาตามรายการของผู้ให้บริการ
คลิป H3 มีความยาวและความละเอียดเท่าไหร่
เนทีฟ 2K ที่ 24fps, 5–15 วินาทีต่อการสร้าง, ขยายได้ถึงประมาณ 30 วินาที, ในอัตราส่วนภาพตั้งแต่ 21:9 ถึง 9:16.
omni-reference คืออะไร?
ระบบควบคุมที่รองรับภาพอ้างอิงสูงสุด 9 ภาพ, คลิปวิดีโอ 3 คลิป, และคลิปเสียง 3 คลิปในครั้งเดียวเพื่อรักษาความสม่ำเสมอของสไตล์ ตัวละคร การเคลื่อนไหว และเสียง
H3 ดีกว่า Kling 3.0 หรือ Veo 3.1 ไหม?
ขึ้นอยู่กับมิติที่พิจารณา Kling 3.0 ให้ 4K แบบเนทีฟและเป็นผู้นำในบางสนาม ขณะที่ Veo 3.1 แข็งแกร่งในบทสนทนา 48kHz ส่วน H3 เน้นการควบคุมแบบ omni-reference เสียงแบบ one-pass การตัดต่อ และราคา H3 มีคะแนน Artificial Analysis arena ในช่วงแรก (ประมาณ 1,184 สำหรับ image-to-video และ 1,226 สำหรับ text-to-video พร้อมเสียง ณ ปลายเดือนสิงหาคม) ซึ่งจะเปลี่ยนแปลงไปเมื่อคะแนนเสียงสะสมเพิ่มขึ้น — ลองทดสอบกับพรอมป์ตของคุณเอง
H3 เป็นโอเพนเวทหรือไม่?
ใช่บางส่วน MiniMax เปิดซอร์สน้ำหนักพื้นฐานของ H3 เมื่อวันที่ 3 สิงหาคม 2026 ซึ่งเป็นโมเดล Transformer ขนาด 33B ที่เผยแพร่บน Hugging Face และ ModelScope ภายใต้สัญญาอนุญาต MiniMax H3 Community License พร้อมด้วยเช็คพอยต์ FL2VA และ Ref2VA ตามข้อกำหนดของใบอนุญาต MiniMax การเผยแพร่ครั้งนี้จำกัดภูมิภาคที่ให้บริการ และข้อกำหนดยังรวมถึงผลลัพธ์ที่สร้างขึ้นด้วย โดยต้องระบุแหล่งที่มา โมดูลสองตัวที่ช่วยเติมเต็มประสบการณ์ระดับเรือธง ได้แก่ H3-Context-IR (การประมวลผลพรอมป์ต์ล่วงหน้า) และ H3-Regenerate-2K (การขยายเป็นความละเอียด 2K) ไม่ได้รวมอยู่ในแพ็กเกจเปิดซอร์สนี้ และยังคงเป็น API เท่านั้น ตั้งแต่วันที่ 1 กันยายนเป็นต้นไป น้ำหนักพื้นฐานที่เปิดไว้ยังสามารถใช้สำหรับการสร้างแบบเรียลไทม์ผ่าน vLLM-Omni และ FastH3 ของ FastVideo (FastH3 v1 รองรับเฉพาะการแปลงข้อความเป็นวิดีโอและเสียงเท่านั้น) ดังนั้น ใช่สำหรับโมเดลพื้นฐาน แต่มีข้อควรระวัง
บรรทัดล่าง
MiniMax H3 (Hailuo 3.0) คือการก้าวกระโดดครั้งสำคัญของสายผลิตภัณฑ์วิดีโอ MiniMax อย่างแท้จริง: มาพร้อม 2K แบบเนทีฟ เสียงซิงก์ในพาสเดียว การควบคุมแบบ omni-reference ที่ยืดหยุ่นเต็มที่ และการตัดต่อตามคำสั่ง ในราคาที่เข้าถึงได้ นับตั้งแต่เปิดตัว H3 ก็เข้าถึงได้ง่ายขึ้นอย่างมาก เพราะตอนนี้ถูกให้บริการผ่าน OrcaRouter ในราคารายการของผู้ให้บริการ ทำงานภายใน Luma Agents และเปิดน้ำหนักโมเดลพื้นฐานให้โฮสต์เองได้ (ซึ่งตั้งแต่วันที่ 1 กันยายนเป็นต้นมา ตัวโมเดลก็เร็วพอที่จะเรนเดอร์คลิปความยาว 10.1 วินาทีเสร็จได้เร็วกว่าระยะเวลาที่คลิปเล่นจริง ผ่าน vLLM-Omni และ FastH3 จาก FastVideo) นอกจากนี้ H3 และ MiniMax H3 Max ยังอยู่บน AI Gateway ของ Vercel พร้อมส่วนลดเปิดตัว 50% นานสองสัปดาห์ อย่างไรก็ตาม H3 จะไม่เหนือกว่าคู่แข่งที่เน้นความละเอียด 4K แบบเนทีฟโดยอัตโนมัติ และคะแนนในช่วงแรกบน Arena ก็ยังอยู่ในช่วงปรับตัว — แต่ในด้านการควบคุม เสียง และความเร็วในการปรับแก้ซ้ำ H3 ถือว่าน่าดึงดูดทีเดียว ลองนำ H3 ไปเทียบกับ Kling 3.0, Veo 3.1, Seedance 2.0 และโมเดลอื่นๆ ด้วยฟุตเทจของคุณเอง พร้อมทั้งรักษาสแตกโมเดลในภาพรวมให้เป็นกลางระหว่างผู้จำหน่ายผ่านเอ็นด์พอยต์เดียวอย่าง OrcaRouter
