MiniMax H3 (Hailuo 3.0): Mô hình video AI 2K với Omni-Reference, giải thích
Guides & Insights

MiniMax H3 (Hailuo 3.0): Mô hình video AI 2K với Omni-Reference, giải thích

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

MiniMax H3 — thường được biết đến nhiều hơn với tên gọi Hailuo 3.0 — là mô hình AI tạo video mới nhất của Mini​Max, được trình làng tại WAIC 2026 (ngày 17 tháng 7 năm 2026), phát hành công khai vào ngày 31 tháng 7, và hiện có thể truy cập theo bốn cách cùng một lúc: nền tảng Hailuo của Mini​Max, Luma Agents, bản tải xuống trọng số mở (open-weight), và — kể từ ngày 30 tháng 8 — AI Gateway của Vercel, nơi bản MiniMax H3 Max mới ưu tiên tốc độ cũng được ra mắt cùng lúc. Mô hình này nâng dòng video của Mini​Max lên độ phân giải 2K gốc, bổ sung âm thanh đồng bộ ngay trong một lần xử lý, đồng thời giới thiệu một hệ thống điều khiển “omni-reference” phong phú khác thường. Diễn biến mới nhất nằm ở khía cạnh tự lưu trữ (self-hosting): kể từ ngày 1 tháng 9, các trọng số H3-Base mở có thể được phục vụ qua vLLM-Omni cùng với FastH3 của FastVideo, đủ nhanh để kết xuất một tệp MP4 hoàn chỉnh dài 10,1 giây gồm cả video lẫn âm thanh trong khoảng 8,7 giây — nhanh hơn cả thời lượng phát lại của chính nó. Hướng dẫn này giải thích H3 thực chất là gì, điều gì thực sự mới, và vị trí của nó trong số các mô hình video tiên phong năm 2026 — với các khả năng được dẫn nguồn và các tuyên bố về chất lượng được dán nhãn rõ ràng.

Lưu ý về độ chính xác: Khả năng của H3 bắt nguồn từ {{1}}công bố của Mini​Max và tài liệu nền tảng{{/1}}. Khả năng khả dụng của Vercel AI Gateway đã được xác nhận — {{2}}danh mục mô hình của Vercel liệt kê cả MiniMax H3 lẫn MiniMax H3 Max, và nhật ký thay đổi của Vercel ghi nhận mức chiết khấu khi ra mắt{{/2}} — mặc dù {{3}}bản thân các điều khoản khuyến mãi do nhà cung cấp công bố{{/3}}. Việc tích hợp Luma Agents và việc phát hành mô hình open-weight vẫn {{4}}chỉ mới được nhà cung cấp công bố tính đến thời điểm viết bài; tài liệu sản phẩm của chính Luma vẫn chưa liệt kê H3, và các điều khoản truy cập của tích hợp vẫn chưa rõ ràng{{/4}}. Chất lượng video phần lớn mang tính {{5}}chủ quan và được đánh giá qua các đấu trường xếp hạng theo sở thích con người; H3 hiện đã có điểm số đấu trường Artificial Analysis ban đầu — khoảng 1.184 cho tác vụ chuyển ảnh thành video và 1.226 cho tác vụ chuyển văn bản thành video có âm thanh, được ghi nhận vào ngày 27 tháng 8 năm 2026 — dù thứ hạng đấu trường sẽ dịch chuyển khi phiếu bầu tích lũy thêm{{/5}}. Số liệu phục vụ nhanh hơn tốc độ phát lại ngày 1 tháng 9 — {{6}}một tệp MP4 hoàn chỉnh dài 10,1 giây với âm thanh đồng bộ được kết xuất trong khoảng 8,7 giây{{/6}} — do {{7}}nhóm vLLM-Omni báo cáo trong bài đăng blog của chính họ, được đo trên máy chủ 8× NVIDIA B300; đây là điểm chuẩn của nhóm chưa được tái lập độc lập, và nó đo FastH3, bộ chuyển đổi chưng cất bốn bước của FastVideo, chứ không phải toàn bộ mô hình cơ sở{{/7}}. Hãy coi {{8}}các tuyên bố so sánh kiểu “cái nào trông đẹp nhất” là những nhận định mang tính tạm thời{{/8}}. {{9}}Thông số kỹ thuật và giá cả có thể thay đổi — hãy kiểm chứng trước khi xây dựng.{{/9}}

TL;DR. H3 là mô hình text-to-video và image-to-video native-2K, 24fps, tạo ra các clip dài 5–15 giây (có thể mở rộng tới ~30 giây) với hội thoại, hiệu ứng âm thanh và âm thanh môi trường được đồng bộ ngay trong một lần tạo. Điểm nổi bật của mô hình là tính năng omni-reference (tối đa 9 ảnh tham chiếu, 3 clip video và 3 clip âm thanh để đảm bảo tính nhất quán) và khả năng chỉnh sửa theo hướng dẫn (thay đổi nhân vật, vật thể, bối cảnh, âm thanh hoặc nhịp độ mà không cần tạo lại). Kể từ khi ra mắt, mô hình đã nhanh chóng phổ biến: bộ trọng số nền tảng được mở công khai vào ngày 3 tháng 8; Mini​Max công bố H3 trên Luma Agents vào ngày 6 tháng 8 (video 2K dài tối đa 15 giây với âm thanh nổi gốc, dù các điều khoản truy cập vẫn chưa được công bố công khai); và vào ngày 30 tháng 8, MiniMax H3 cùng MiniMax H3 Max đã có mặt trên AI Gateway của Vercel với ưu đãi ra mắt giảm 50% trong hai tuần. Kể từ ngày 1 tháng 9, bộ trọng số nền tảng mở cũng có thể được dùng để tạo video theo thời gian thực: thông qua vLLM-Omni với FastH3 của FastVideo, một tệp MP4 video + âm thanh hoàn chỉnh dài 10,1 giây được render trong khoảng 8,7 giây — nhanh hơn cả tốc độ phát lại, theo benchmark của nhóm vLLM-Omni. Đây là một bước tiến lớn so với Hailuo 2.3 (vốn là 1080p, ~10 giây, không có omni-reference), và nó cạnh tranh trực tiếp với Kling 3.0, Go​ogle Veo 3.1, ByteDance Seedance 2.0 cùng nhiều mô hình khác — mạnh về khả năng điều khiển và âm thanh, với các điểm số arena độc lập ban đầu vẫn cần được củng cố thêm.

Những điểm chính rút ra

• H3 = Hailuo 3.0, mô hình video mới nhất của MiniMax, được công bố tại WAIC 2026 và phát hành vào ngày 31 tháng 7; hiện có thông qua Hailuo, Luma Agents, open weights và AI Gateway của Vercel.

• Gốc 2K ở 24fps, các clip 5–15 giây (có thể kéo dài đến ~30 giây), nhiều tỷ lệ khung hình, chuyển văn bản thành video và chuyển hình ảnh thành video.

• Omni-reference: lên tới 9 hình ảnh, 3 đoạn video và 3 đoạn âm thanh làm tài liệu tham khảo để đảm bảo tính nhất quán về phong cách, nhân vật, chuyển động và giọng nói.

• Hội thoại được đồng bộ hóa, SFX và âm thanh môi trường được tạo ra trong một lần duy nhất; chỉnh sửa dựa trên hướng dẫn mà không cần tạo lại toàn bộ.

Các trọng số cơ sở được mở mã nguồn vào ngày 3 tháng 8 theo giấy phép cộng đồng; các mô-đun Context-IR và tái tạo 2K vẫn chỉ khả dụng qua API.

• Vào ngày 30 tháng 8, MiniMax H3 và MiniMax H3 Max đã ra mắt trên AI Gateway của Vercel với mức giảm giá 50% cho đến ngày 13 tháng 9.

• Kể từ ngày 1 tháng 9, các trọng số H3-Base mở có thể được phục vụ để tạo thời gian thực — một tệp MP4 video và âm thanh dài 10,1 giây được kết xuất trong khoảng 8,7 giây, nhanh hơn tốc độ phát lại — thông qua vLLM-Omni và FastH3 của FastVideo (điểm chuẩn do nhóm báo cáo, chưa được tái lập độc lập).

• Nâng cấp lớn so với Hailuo 2.3 (1080p, ~10s); cạnh tranh với Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7, và nhiều hơn nữa.

MiniMax H3 thực chất là gì

Mini​Max là một công ty AI lớn của Trung Quốc (họ đã hoàn thành đợt IPO tại Hồng Kông vào tháng 1 năm 2026, được cho là huy động khoảng 619 triệu USD với mức định giá khoảng 4 tỷ USD, với các nhà đầu tư bao gồm Alibaba và Tencent). Thương hiệu video tiêu dùng của họ là Hailuo, nổi tiếng với khả năng mô phỏng vật lý dẫn đầu phân khúc, tốc độ tạo video nhanh và mức giá phải chăng. H3 là mô hình Hailuo thế hệ thứ ba, được công bố cùng với mô hình văn bản M3 của Mini​Max và các giải pháp đa phương thức khác tại WAIC 2026, đồng thời được phát hành công khai vào ngày 31 tháng 7 năm 2026. Trong khi M3 là LLM văn bản/tác tử, H3 là một mô hình tạo video đúng nghĩa.

Mới: 2K, tham chiếu đa hướng và âm thanh một lần

Ba điều định nghĩa H3. Đầu tiên, native 2K ở 24fps — một bước tiến so với 1080p của Hailuo 2.3 — ở nhịp phim tiêu chuẩn, với các clip từ 5 đến 15 giây (có thể kéo dài đến khoảng 30 giây qua công cụ Extend) và tỷ lệ khung hình từ 21:9 đến 9:16. Thứ hai, omni-reference: bạn có thể cung cấp tới 9 ảnh tham chiếu, 3 clip video và 3 clip âm thanh cùng lúc để khóa phong cách, nhận dạng nhân vật, chuyển động hoặc giọng nói — một bề mặt điều khiển hào phóng bất thường để giữ cho nhân vật hoặc diện mạo nhất quán qua các cảnh quay. Thứ ba, âm thanh đồng bộ trong một lần xử lý: H3 tạo ra hội thoại, hiệu ứng âm thanh và không khí môi trường đồng bộ với hành động trên màn hình, thay vì yêu cầu một bước âm thanh riêng biệt.

Chỉnh sửa theo hướng dẫn

Một tính năng quan trọng nhưng kín đáo là chỉnh sửa dựa trên hướng dẫn: thay vì tạo lại toàn bộ một đoạn clip từ đầu để thực hiện thay đổi, bạn có thể mô tả một chỉnh sửa — hoán đổi nhân vật, thay đổi đối tượng, thay đổi cảnh, điều chỉnh âm thanh hoặc thay đổi nhịp độ của cảnh quay — và H3 sẽ áp dụng nó. Đối với công việc sáng tạo lặp đi lặp lại, chỉnh sửa ngay tại chỗ thay vì phải "tung xúc xắc" lại với một bản tạo mới thực sự là một lợi thế về quy trình làm việc.

Nó so sánh như thế nào với Hailuo 2.3

Bước nhảy vọt về thế hệ rất rõ ràng: H3 chuyển từ 1080p lên 2K gốc, kéo dài độ dài tối đa của một đoạn tạo từ khoảng 10 giây lên 15 giây (với tính năng kéo dài 30 giây), đồng thời bổ sung cả đầu vào tham chiếu toàn hướng và chỉnh sửa dựa trên hướng dẫn, những thứ mà 2.3 còn thiếu. Nếu bạn đã từng sử dụng Hailuo 2.3, thì H3 là một bản nâng cấp trực tiếp về độ phân giải, độ dài, khả năng điều khiển và âm thanh.

Vị trí của H3 trong biên giới năm 2026

H3 hiện mang điểm số đấu trường Artificial Analysis sơ bộ — khoảng 1.184 cho chuyển ảnh thành video và 1.226 cho chuyển văn bản thành video có âm thanh, được ghi nhận ngày 27 tháng 8 năm 2026 — mặc dù thứ hạng đấu trường thay đổi khi phiếu bầu tích lũy, nên hãy tự đánh giá bằng các lời nhắc thử nghiệm của riêng bạn thay vì dựa vào bất kỳ tuyên bố đơn lẻ nào.

Một lưu ý về OpenAI Sora

Nếu bạn đang lập bản đồ lĩnh vực này: OpenAI đã ngừng cung cấp trải nghiệm web và ứng dụng Sora vào tháng 4 năm 2026, với API dự kiến kết thúc vào tháng 9 năm 2026 — vì vậy Sora không phải là mô hình để bắt đầu các quy trình video mới. Ranh giới trực tiếp hiện tại là tập hợp nêu trên, và H3 gia nhập vào đó.

Cách truy cập H3 và phần còn lại của khu vực

H3 hiện có thể truy cập qua bốn cách, và danh sách đó đã tăng lên kể từ khi ra mắt.

• Hailuo (nền tảng riêng của Mini​​Max): toàn bộ sản phẩm, bao gồm chỉnh sửa dựa trên hướng dẫn và tính năng nâng cấp H3-Regenerate-2K lên 2K.

{{1}}Luma Agents: Mini​Max đã công bố vào ngày 6 tháng 8 năm 2026 rằng H3 hiện có sẵn trong sản phẩm Agents đa mô hình của Luma, tạo ra tối đa 15 giây video 2K với âm thanh nổi gốc.{{/1}} {{2}}Đây là thông tin do nhà cung cấp công bố và các điều khoản truy cập vẫn chưa được công khai — tài liệu sản phẩm của chính Luma hiện không liệt kê H3 — vì vậy hãy mong đợi chi tiết về giá cả và điều kiện đủ tư cách sẽ sớm được hoàn thiện.{{/2}} {{3}}Việc Luma lưu trữ mô hình video của một đối thủ ngay trong sản phẩm Agents của mình là dấu hiệu cho thấy thị trường mô hình video năm 2026 đã trở nên dễ thay thế lẫn nhau đến mức nào.{{/3}}

• Vercel AI Gateway: vào ngày 30 tháng 8 năm 2026, MiniMax và Vercel đã công bố rằng cả MiniMax H3 lẫn MiniMax H3 Max đều có sẵn qua AI Gateway của Vercel, với các yêu cầu được tính phí qua cổng này được giảm 50% từ ngày 30 tháng 8 đến ngày 13 tháng 9 năm 2026. Các ID mô hình — minimax/minimax-h3 và minimax/minimax-h3-max — không thay đổi, nên các tích hợp cổng hiện có sẽ tự động nhận được mức giá chiết khấu mà không cần thay đổi mã. Tính khả dụng được xác nhận trong danh mục mô hình và nhật ký thay đổi của Vercel; các điều khoản khuyến mãi do nhà cung cấp công bố.

• Trọng số mở: vào ngày 3 tháng 8 năm 2026, Mini​Max đã phát hành trọng số cơ sở của H3 — một dense transformer 33B, H3-Base — trên Hugging Face và ModelScope theo MiniMax H3 Community License, dưới dạng hai checkpoint: H3-Base-FL2VA để tạo văn bản thành video/âm thanh và tạo keyframe, và H3-Base-Ref2VA để tạo dựa trên tham chiếu. Hai trong ba mô-đun hệ thống — H3-Context-IR (bộ tiền xử lý prompt) và H3-Regenerate-2K (bộ nâng cấp lên 2K) — không nằm trong bản phát hành mở và vẫn chỉ khả dụng qua API, vì vậy các phiên chạy tự lưu trữ bị giới hạn ở mức dưới 2K. Và kể từ ngày 1 tháng 9, cùng các trọng số cơ sở đó có thể được sử dụng để tạo sinh thời gian thực thông qua vLLM-Omni và FastH3 của FastVideo — một bộ điều hợp chưng cất bốn bước kết xuất một tệp MP4 video và âm thanh hoàn chỉnh dài 10,1 giây trong khoảng 8,7 giây trên máy chủ 8× NVIDIA B300, nhanh hơn thời lượng phát của nó (theo báo cáo của nhóm, chưa được tái lập độc lập).

MiniMax H3 đã có trên OrcaRouter với giá niêm yết của nhà cung cấp — $0.08 mỗi giây ở 768p và $0.13 mỗi giây ở 2K — được truyền qua với mức phụ phí 0% và tự động chuyển đổi dự phòng, nhờ đó bạn có thể gọi gia đình H3 qua một API tương thích O​penAI duy nhất thay vì tự đấu nối endpoint của nhà cung cấp mới chỉ ra mắt vài ngày. Vì không nhà cung cấp nào lưu trữ mọi mô hình, cách làm thiết thực là đưa toàn bộ lưu lượng LLM và agent của bạn qua một endpoint duy nhất (OrcaRouter cũng truyền tải mô hình văn bản M3 của riêng Mini​Max) và dùng thẳng mô hình video tốt nhất cho từng dự án. MiniMax H3 Max chưa được định tuyến trên OrcaRouter — hiện nó được phục vụ qua các kênh bên thứ ba — vì vậy nếu bạn đang thử nghiệm nguyên mẫu dựa trên nó, thói quen chuyển đổi dự phòng sẽ được đền đáp: cứ thử một mô hình mới ra mắt vài ngày mà không cần đặt cược cả một pipeline sản xuất vào nó.

Phân phối thời gian thực: video nhanh hơn tốc độ phát lại

Sự phát triển đằng sau bản cập nhật này nằm ở phía tự lưu trữ. {{1}}Checkpoint cơ sở mở của MiniMax H3 là một transformer dense 33 tỷ tham số; để tạo clip theo cách thông thường, cần chạy khoảng 49 lượt forward diffusion-transformer trong một lịch trình khử nhiễu dài.{{/1}} {{2}}FastVideo, dự án mã nguồn mở cho huấn luyện và suy luận video, đã công bố một mô hình student được chưng cất từ H3-Base có tên FastH3: mô hình bốn bước (kiểu DMD2) này tái sử dụng bộ mã hóa văn bản, VAE video, VAE âm thanh, tokenizer và bộ lập lịch của H3, nhưng giảm vòng khử nhiễu xuống chỉ còn bốn lượt forward transformer trên năm vị trí sigma.{{/2}} {{3}}vLLM-Omni, runtime phục vụ đa phương thức, hợp nhất adapter FastH3 ngay tại thời điểm tải (pull request #6714) và cung cấp nó qua endpoint /v1/videos tương thích OpenAI, bên cạnh hỗ trợ base-H3 trước đó.{{/3}}

Con số trong tiêu đề được đo trên phần cứng cỡ lớn. Trên một máy chủ 8× NVIDIA B300 ở độ phân giải 1344×768 và 24 fps, nhóm vLLM-Omni báo cáo rằng một tệp MP4 hoàn chỉnh dài 10,1 giây — gồm video và âm thanh đồng bộ — được render trọn vẹn trong khoảng 8,7 giây, nhanh hơn thời lượng phát lại của chính video đó. Đây là điểm chuẩn do chính nhóm công bố vào ngày 1 tháng 9 năm 2026 và chưa được kiểm chứng độc lập; bản thân nhóm cũng lưu ý rằng bộ benchmark thô vẫn đang chờ công bố và không tuyên bố chất lượng giữa bản base và FastH3 là tương đương. Trên phần cứng phổ thông hơn, các con số bớt ấn tượng hơn — công thức cộng đồng cũng hỗ trợ cấu hình 2× RTX 5090 và máy một GPU — và FastH3 v1 chỉ mới hỗ trợ text-to-video-audio (T2VA), ở 1344×768 thay vì 2K như phía API.

Đối với người đọc, điều này làm thay đổi ý nghĩa của cụm từ “tự lưu trữ H3”. Trước đây, các trọng số cơ sở mở chạy được nhưng chậm — ổn cho công việc xử lý hàng loạt, chứ không phải cho bất kỳ điều gì mang tính tương tác. Với FastH3 trên vLLM-Omni, một pipeline H3 triển khai tại chỗ có thể xử lý xong một clip mười giây trong thời gian ngắn hơn hẳn thời lượng của clip — đó là ngưỡng mà các vòng lặp sản phẩm thời gian thực — tiền dựng hình trực tiếp, lặp cảnh quay nhanh, video điều khiển bằng agent — bắt đầu trở nên khả thi. Nếu bạn không muốn vận hành một máy chủ tám GPU, phương án quản lý sẵn vẫn không thay đổi: MiniMax H3 có mặt trên OrcaRouter ở mức giá niêm yết của nhà cung cấp, được chuyển tiếp với phụ phí 0% và khả năng chuyển đổi dự phòng tự động, để bạn có thể gọi đến gia đình H3 qua một API tương thích O​penAI mà không cần sở hữu phần cứng.

Ba kịch bản mà H3 tỏa sáng

1. Phim ngắn nhất quán về nhân vật và phong cách

Omni-reference (tối đa 9 hình ảnh, 3 video clip, 3 âm thanh) được xây dựng để duy trì tính nhất quán của nhân vật, diện mạo và giọng nói xuyên suốt nhiều cảnh quay — lý tưởng cho các đoạn phim ngắn có cốt truyện và nội dung theo tập.

2. Nội dung sáng tạo trên mạng xã hội và quảng cáo có âm thanh

Đối thoại đồng bộ một lần, hiệu ứng âm thanh và không gian âm thanh cùng với tỷ lệ khung hình linh hoạt (9:16 đến 21:9) phù hợp với quy trình làm việc nhanh chóng trên mạng xã hội và quảng cáo, vốn cần âm thanh hoàn chỉnh, không chỉ hình ảnh.

3. Chỉnh sửa sáng tạo lặp đi lặp lại

Chỉnh sửa dựa trên hướng dẫn cho phép các nhóm tinh chỉnh một clip một cách mô tả thay vì tạo lại, điều này giúp tăng tốc quá trình sản xuất có nhiều bản sửa đổi.

Câu hỏi thường gặp

MiniMax H3 là gì?

H3 là Hailuo 3.0, mô hình tạo video bằng AI mới nhất của Mini​MAX, được công bố tại WAIC 2026 (17 tháng 7 năm 2026) và phát hành vào ngày 31 tháng 7 năm 2026. Mô hình này tạo ra video 2K gốc, 24 khung hình/giây với âm thanh đồng bộ, từ văn bản hoặc hình ảnh, với khả năng điều khiển tham chiếu toàn diện và chỉnh sửa theo hướng dẫn.

H3 có giống MiniMax M3 không?

Không. M3 là LLM văn bản/tác tử của Mini​Max; H3 (Hailuo 3.0) là mô hình tạo video của hãng. Chúng được ra mắt tại cùng một sự kiện nhưng đảm nhận các nhiệm vụ khác nhau.

Bây giờ tôi có thể sử dụng H3 ở đâu?

Bốn nơi: nền tảng Hailuo của Mini​Max (bản sản phẩm đầy đủ), AI Gateway của Vercel (cả H3 và MiniMax H3 Max, với mức giảm 50% khi ra mắt đến hết ngày 13 tháng 9), Luma Agents (được công bố ngày 6 tháng 8 năm 2026 — video 2K dài tới 15 giây với âm thanh nổi gốc, điều khoản truy cập vẫn chưa rõ ràng), và tự triển khai qua các trọng số H3-Base mở trên Hugging Face và ModelScope — mà kể từ ngày 1 tháng 9, có thể được phục vụ với tốc độ nhanh hơn tốc độ phát lại thông qua vLLM-Omni với FastH3 của FastVideo (video MP4 kèm âm thanh dài 10,1 giây trong khoảng 8,7 giây trên 8× B300, theo nhóm vLLM-Omni). Mô hình nền cũng được định tuyến trên OrcaRouter với giá niêm yết của nhà cung cấp.

Độ dài và độ phân giải của các clip H3 là bao nhiêu?

2K gốc ở 24fps, 5–15 giây mỗi lần tạo, có thể kéo dài đến khoảng 30 giây, với tỷ lệ khung hình từ 21:9 đến 9:16.

Omni-reference là gì?

Một hệ thống điều khiển có thể chấp nhận tới 9 hình ảnh tham chiếu, 3 đoạn video và 3 đoạn âm thanh cùng lúc để giữ cho phong cách, nhân vật, chuyển động và giọng nói nhất quán.

H3 có tốt hơn Kling 3.0 hay Veo 3.1 không?

Điều đó còn phụ thuộc vào trục đánh giá. Kling 3.0 hỗ trợ 4K gốc và dẫn đầu ở một số hạng mục; Veo 3.1 mạnh về hội thoại 48kHz. H3 nhấn mạnh vào khả năng kiểm soát omni-reference, âm thanh một lượt, chỉnh sửa và giá cả. H3 có điểm số ban đầu tại Artificial Analysis arena (khoảng 1,184 cho image-to-video và 1,226 cho text-to-video có âm thanh tính đến cuối tháng 8) sẽ thay đổi khi phiếu bầu tích lũy — hãy thử nghiệm trên các prompt của riêng bạn.

H3 có phải là open-weight không?

{{1}}Một phần. MiniMax đã phát hành mở các trọng số gốc của H3 vào ngày 3 tháng 8 năm 2026{{/1}} — một mô hình transformer 33B được phát hành trên Hugging Face và ModelScope theo MiniMax H3 Community License, kèm các checkpoint FL2VA và Ref2VA. {{2}}Theo điều khoản giấy phép của MiniMax, bản phát hành này giới hạn khu vực triển khai, áp dụng cả với các đầu ra được tạo sinh và yêu cầu ghi công.{{/2}} {{3}}Hai mô-đun giúp hoàn thiện trải nghiệm flagship — H3-Context-IR (tiền xử lý prompt) và H3-Regenerate-2K (bản nâng cấp 2K) — không nằm trong bản phát hành mở và chỉ khả dụng qua API.{{/3}} {{4}}Kể từ ngày 1 tháng 9, các trọng số gốc mở cũng có thể được phục vụ để tạo sinh thời gian thực qua vLLM-Omni và FastH3 của FastVideo (FastH3 v1 chỉ hỗ trợ chuyển văn bản thành video–âm thanh).{{/4}} {{5}}Vậy nên, câu trả lời là có đối với mô hình gốc, nhưng kèm theo các lưu ý.{{/5}}

Kết luận

MiniMax H3 (Hailuo 3.0) là một bước tiến đáng kể của dòng video Mini​Max: độ phân giải 2K gốc, âm thanh đồng bộ chỉ trong một lần tạo, khả năng kiểm soát đa tham chiếu linh hoạt và chỉnh sửa dựa trên hướng dẫn, với mức giá dễ tiếp cận. Kể từ khi ra mắt, sản phẩm cũng trở nên dễ tiếp cận hơn rất nhiều — nó được định tuyến trên OrcaRouter theo giá niêm yết của nhà cung cấp, chạy bên trong Luma Agents, trọng số gốc được mở để tự lưu trữ (và kể từ ngày 1 tháng 9, tốc độ đủ nhanh để kết xuất clip dài 10,1 giây nhanh hơn thời gian phát, thông qua vLLM-Omni và FastVideo FastH3), đồng thời sản phẩm này cùng MiniMax H3 Max hiện có mặt trên AI Gateway của Vercel với ưu đãi giảm 50% trong hai tuần đầu ra mắt. Sản phẩm sẽ không tự động vượt trội hơn các đối thủ đang đẩy mạnh độ phân giải 4K gốc, và điểm số trên bảng xếp hạng ban đầu của nó vẫn đang dần ổn định — nhưng về khả năng kiểm soát, âm thanh và tốc độ lặp, sản phẩm rất thuyết phục. Hãy đánh giá H3 so với Kling 3.0, Veo 3.1, Seedance 2.0 và các sản phẩm còn lại trên chính footage của bạn, đồng thời giữ toàn bộ hệ thống mô hình rộng hơn ở trạng thái trung lập với nhà cung cấp thông qua một điểm cuối duy nhất như OrcaRouter. Evaluate H3 against Kling 3.0, Veo 3.1, Seedance 2.0, and the rest on your own footage, and keep your broader model stack vendor-neutral through one endpoint like OrcaRouter.