MiniMax H3 (Hailuo 3.0): 2K AI-видеомодель с Omni-Reference, объяснение
Guides & Insights

MiniMax H3 (Hailuo 3.0): 2K AI-видеомодель с Omni-Reference, объяснение

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

MiniMax H3 — более известная как Hailuo 3.0 — это новейшая модель генерации видео от MiniMax, анонсированная на WAIC 2026 (17 июля 2026 года), выпущенная для публики 31 июля и теперь доступная сразу четырьмя способами: на платформе Hailuo от MiniMax, в Luma Agents, как загрузка с открытыми весами и — с 30 августа — в AI Gateway от Vercel, где вместе с ней запустили новую скоростную MiniMax H3 Max. H3 переводит видеолинейку MiniMax на нативное разрешение 2K, добавляет синхронизированный звук за один проход и представляет необычно богатую систему управления «omni-reference». Самое свежее обновление касается самохостинга: с 1 сентября открытые веса H3-Base можно обслуживать через vLLM-Omni с FastH3 от FastVideo, которой достаточно быстро отрендерить полный 10,1-секундный видео- и аудио-MP4 примерно за 8,7 секунды — быстрее, чем длится сам ролик. Это руководство объясняет, что такое H3 на самом деле, что в нём действительно нового и какое место он занимает среди передовых видеомоделей 2026 года — при этом возможности указаны с источниками, а заявления о качестве чётко обозначены.

Примечание о точности: информация о возможностях H3 взята из анонса MiniMax и документации платформы. Доступность Vercel AI Gateway подтверждена — каталог моделей Vercel включает и MiniMax H3, и MiniMax H3 Max, а в журнале изменений Vercel описана скидка при запуске, — хотя сами условия промоакции объявлены вендором. Интеграция с Luma Agents и выпуск с открытыми весами на момент написания остаются лишь анонсами вендора; в собственной документации Luma H3 пока не указан, а условия доступа к интеграции неясны. Качество видео по большей части субъективно и оценивается на аренах предпочтений пользователей; для H3 уже есть ранние баллы на арене Artificial Analysis — около 1 184 для image-to-video и 1 226 для text-to-video со звуком, зафиксированные 27 августа 2026 года, — хотя рейтинги на аренах меняются по мере накопления голосов. Показатель «быстрее воспроизведения» от 1 сентября — полное 10,1-секундное MP4 с синхронизированным звуком, отрендеренное примерно за 8,7 секунды, — приводит команда vLLM-Omni в своём блоге; замеры проводились на сервере с 8× NVIDIA B300. Это внутренний бенчмарк команды, который ещё не воспроизведён независимо; он характеризует FastH3, четырёхшаговый дистиллированный адаптер FastVideo, а не полную базовую модель. Относитесь к сравнительным заявлениям о том, «какая модель выглядит лучше», как к предварительным. Характеристики и цены меняются — проверяйте, прежде чем строить.

TL;DR. H3 — это модель генерации видео из текста и изображений нативно в 2K, 24 fps, которая создаёт клипы длительностью 5–15 секунд (расширяемые до ~30 секунд) с синхронизированными диалогами, звуковыми эффектами и фоновым звуком за один проход. Её ключевые особенности: omni-reference (до 9 референсных изображений, до 3 видеоклипов и до 3 аудиоклипов для согласованности) и редактирование по текстовым инструкциям (изменение персонажей, объектов, сцен, звука или темпа без перегенерации). С момента запуска она быстро распространилась: базовые веса стали открытыми 3 августа, Mini​Max анонсировала H3 в Luma Agents 6 августа (до 15 секунд видео 2K с нативным стереозвуком, хотя условия доступа пока не публичны), а 30 августа MiniMax H3 и MiniMax H3 Max появились на AI Gateway от Vercel с двухнедельной скидкой 50% в честь запуска. С 1 сентября открытые базовые веса можно также использовать для генерации в реальном времени: через vLLM-Omni с FastH3 от FastVideo полный 10,1-секундный видео- и аудиофайл MP4 рендерится примерно за 8,7 секунды — быстрее, чем длится воспроизведение, по данным бенчмарка команды vLLM-Omni. Это большой шаг вперёд по сравнению с Hailuo 2.3 (который был 1080p, ~10 секунд, без omni-reference), и она конкурирует с Kling 3.0, Go​ogle Veo 3.1, ByteDance Seedance 2.0 и другими — она сильна в управлении и звуке, хотя ранние независимые оценки на аренах ещё предстоит уточнить.

Основные выводы

• H3 = Hailuo 3.0, новейшая видеомодель MiniMax, представленная на WAIC 2026 и выпущенная 31 июля; доступна через Hailuo, Luma Agents, открытые веса и AI Gateway от Vercel.

• Нативное 2K при 24 кадрах в секунду, клипы длительностью 5–15 секунд (можно продлить до ~30 секунд), несколько соотношений сторон, преобразование текста в видео и изображения в видео.

• Omni-reference: до 9 изображений, 3 видеофрагмента и 3 аудиофрагмента в качестве референсов для согласованности стиля, персонажа, движения и голоса.

• Синхронизированный диалог, звуковые эффекты и атмосфера, создаваемые за один проход; редактирование на основе инструкций без полной регенерации.

• Базовые веса были опубликованы в открытом доступе 3 августа по лицензии для сообщества; модули Context-IR и 2K-регенерации остаются доступными только через API.

30 августа MiniMax H3 и MiniMax H3 Max стали доступны на AI Gateway от Vercel со скидкой 50% в честь запуска до 13 сентября.

• Начиная с 1 сентября открытые веса H3-Base можно использовать для генерации в реальном времени — MP4-файл с видео и звуком длительностью 10,1 секунды рендерится примерно за 8,7 секунды, то есть быстрее, чем само воспроизведение, — через vLLM-Omni и FastH3 от FastVideo (показатель заявлен командой, независимо пока не воспроизведён).

• Большое обновление по сравнению с Hailuo 2.3 (1080p, ~10 с); конкурирует с Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7 и другими.

Что такое MiniMax H3 на самом деле

MiniMax — крупная китайская ИИ-компания (в январе 2026 года она провела IPO в Гонконге; сообщается, что компания привлекла около 619 миллионов долларов при оценке примерно в 4 миллиарда долларов; среди инвесторов — Alibaba и Tencent). Её потребительский видеобренд — Hailuo, известный передовой физической симуляцией, быстрой генерацией и доступными ценами. H3 — модель Hailuo третьего поколения, представленная вместе с текстовой моделью MiniMax M3 и другими мультимодальными решениями на WAIC 2026 и выпущенная в публичный доступ 31 июля 2026 года. В то время как M3 — это текстовая/агентная LLM, H3 — это именно модель генерации видео.

Что нового: 2K, omni-reference и однопроходное аудио

Три вещи определяют H3. Во-первых, нативное 2K при 24fps — шаг вперед по сравнению с 1080p у Hailuo 2.3 — с кинематографической частотой кадров, с клипами от 5 до 15 секунд (можно продлить до примерно 30 секунд с помощью инструмента Extend) и соотношениями сторон от 21:9 до 9:16. Во-вторых, omni-reference: вы можете одновременно загружать до 9 референсных изображений, 3 видеофрагмента и 3 аудиоклипа, чтобы зафиксировать стиль, идентичность персонажа, движения или голос — необычайно щедрый набор инструментов для сохранения персонажа или внешнего вида между кадрами. В-третьих, синхронизированное аудио за один проход: H3 генерирует диалоги, звуковые эффекты и окружающую атмосферу, синхронизированные с действием на экране, вместо того чтобы требовать отдельного этапа с аудио.

Редактирование на основе инструкций

Неприметная, но важная функция — это редактирование на основе инструкций: вместо того чтобы пересоздавать клип с нуля для внесения изменений, вы можете описать правку — заменить персонажа, изменить объект, сменить сцену, отрегулировать звук или изменить темп кадра — и H3 применит её. Для итеративной творческой работы редактирование на месте, а не повторное бросание кубиков при новой генерации, является реальным преимуществом в рабочем процессе.

Как он соотносится с Hailuo 2.3

Очевиден скачок поколений: H3 переходит с 1080p на нативное 2K, увеличивает максимальную длину одного поколения с примерно 10 секунд до 15 (с возможностью расширения до 30 секунд), а также добавляет как omni-reference входы, так и редактирование на основе инструкций, чего не было в 2.3. Если вы использовали Hailuo 2.3, H3 — это прямое улучшение по разрешению, длине, управлению и аудио.

Где H3 находится на передовой 2026 года?

Теперь H3 имеет ранние оценки арены Artificial Analysis — примерно 1 184 в image-to-video и 1 226 в text-to-video с аудио, зафиксированные 27 августа 2026 года, — хотя рейтинги арены меняются по мере накопления голосов, так что оценивайте его по собственным тестовым запросам, а не на основе какого-либо единичного утверждения.

Заметка об O​penAI Sora

Если вы составляете карту этой области: OpenAI прекратила поддержку веб-версии и приложений Sora в апреле 2026 года, а её API должен быть отключён в сентябре 2026 года — так что Sora не та модель, на которой стоит начинать новые видеопроекты. Актуальный рубеж — это набор выше, и H3 присоединяется к нему.

Как получить доступ к H3 и остальной части поля

H3 теперь доступен четырьмя способами, и этот список вырос с момента запуска.

• Hailuo (собственная платформа Mini​Max): полный продукт, включая редактирование на основе инструкций и апскейл H3-Regenerate-2K до 2K.

• Luma Agents: Mini​Max объявила 6 августа 2026 года, что H3 теперь доступен в мультимодельном продукте Luma Agents, генерируя до 15 секунд видео в 2K с нативным стереозвуком. Это анонс от вендора, и условия доступа пока не опубликованы — в документации самого продукта Luma H3 на данный момент не значится — так что подробности о ценах и праве на использование появятся в ближайшее время. Размещение конкурирующей видеомодели в собственном продукте Luma Agents говорит о том, насколько взаимозаменяемым стал рынок видеомоделей в 2026 году.

• Vercel AI Gateway: 30 августа 2026 года Mini​Max и Vercel объявили, что и MiniMax H3, и MiniMax H3 Max доступны через AI Gateway от Vercel, при этом запросы, обрабатываемые через шлюз, тарифицируются со скидкой 50% с 30 августа по 13 сентября 2026 года. Идентификаторы моделей — minimax/minimax-h3 и minimax/minimax-h3-max — не изменились, поэтому существующие интеграции со шлюзом автоматически получают скидку без изменения кода. Доступность подтверждена в каталоге моделей Vercel и журнале изменений; условия акции объявлены вендором.

• Открытые веса: 3 августа 2026 года MiniMax выпустила базовые веса H3 — плотный трансформер на 33B параметров, H3-Base, — на Hugging Face и ModelScope под лицензией MiniMax H3 Community License в виде двух контрольных точек: H3-Base-FL2VA для генерации текста в видео/аудио и ключевых кадров, и H3-Base-Ref2VA для генерации на основе референсов. Два из трёх системных модулей — H3-Context-IR (препроцессор промптов) и H3-Regenerate-2K (апскейлер до 2K) — не входят в открытый релиз и остаются доступными только через API, поэтому при самостоятельном хостинге разрешение ограничено значением ниже 2K. А с 1 сентября те же базовые веса можно использовать для генерации в реальном времени через vLLM-Omni и FastVideo FastH3 — четырёхшаговый дистиллированный адаптер, который рендерит полный 10,1-секундный MP4 с видео и звуком примерно за 8,7 секунды на сервере с 8× NVIDIA B300, быстрее, чем длится его воспроизведение (по данным команды, независимо пока не воспроизведено).

MiniMax H3 доступен на OrcaRouter по цене из прайс-листа провайдера — $0,08 за секунду при 768p и $0,13 за секунду при 2K — без наценки и с автоматическим переключением, так что вы можете вызывать семейство H3 через один API, совместимый с O​penAI, а не подключаться к вендорскому эндпоинту, которому всего несколько дней. Поскольку ни один провайдер не размещает все модели, практичный подход — направлять трафик ваших LLM и агентов через один эндпоинт (OrcaRouter также передаёт собственную текстовую модель M3 от Mini​Max), а лучшую видеомодель для каждого проекта использовать напрямую. MiniMax H3 Max пока не маршрутизируется через OrcaRouter — сейчас он обслуживается через сторонние каналы — так что если вы прототипируете на его основе, привычка закладывать автоматическое переключение окупается: можно опробовать модель, появившуюся несколько дней назад, не ставя на кон производственный пайплайн.

Обслуживание в реальном времени: видео быстрее воспроизведения.

Разработка, стоящая за этим обновлением, относится к стороне самостоятельного хостинга. Открытый базовый чекпойнт MiniMax H3 — это плотный трансформер на 33 млрд параметров, и генерация клипа стандартным способом означает выполнение примерно 49 проходов диффузионного трансформера по длинному расписанию денойзинга. FastVideo, проект с открытым исходным кодом для обучения и инференса видеомоделей, опубликовал дистиллированную модель-ученицу H3-Base под названием FastH3: это модель в стиле DMD2 с четырьмя шагами, которая переиспользует текстовый энкодер, видео-VAE, аудио-VAE, токенизаторы и шедулеры H3, но сокращает цикл денойзинга до четырёх проходов трансформера по пяти позициям сигмы. vLLM-Omni, мультимодальная среда выполнения для сервинга, встраивает адаптер FastH3 на этапе загрузки (pull request #6714) и предоставляет его через OpenAI-совместимый эндпоинт /v1/videos, наряду с более ранней поддержкой base-H3.

Основной показатель измерен на крупном оборудовании. На сервере с 8× NVIDIA B300 при разрешении 1344×768 и 24 кадрах в секунду команда vLLM-Omni сообщает, что полный 10,1-секундный MP4 — видео и синхронизированный звук — обрабатывается от начала до конца примерно за 8,7 секунды, то есть быстрее, чем длится само видео. Это результат, представленный самой командой и опубликованный 1 сентября 2026 года; независимо он пока не воспроизведён. Команда также отмечает, что исходный набор бенчмарков ещё ожидает публикации, и не заявляет о паритете качества между базовой версией и FastH3. На более скромном оборудовании цифры менее впечатляющие — рецепт сообщества также охватывает конфигурации с 2× RTX 5090 и с одним GPU, — а FastH3 v1 поддерживает только связку текст-в-видео-аудио (T2VA) при 1344×768, а не 2K, которое остаётся на стороне API.

Для читателя это смещает смысл понятия «self-hosting H3». Раньше открытые базовые веса работали, но медленно — для пакетной обработки хорошо, а для чего-либо интерактивного нет. С FastH3 на vLLM-Omni локальный конвейер H3 может обработать десятисекундный клип значительно быстрее, чем длится клип, а это тот порог, при котором продуктовые циклы реального времени — живая предварительная визуализация, быстрая итерация кадров, видео, управляемое агентами — становятся реально применимыми. Если вы не хотите запускать сервер с восемью GPU, управляемый путь не изменился: MiniMax H3 доступен на OrcaRouter по цене провайдера, проходит без наценки и с автоматическим переключением при сбоях, так что вы можете вызывать семейство H3 через единый O​penAI-совместимый API, не владея оборудованием.

Три сценария, где H3 проявляет себя

1. Короткометражные фильмы, согласованные по персонажам и стилю

Omni-reference (до 9 изображений, 3 клипов, 3 аудио) создан для сохранения согласованности персонажа, внешности и голоса на протяжении нескольких кадров — идеально подходит для нарративных короткометражек и эпизодического контента.

2. Социальные и рекламные креативы со звуком

Однопроходный синхронизированный диалог, звуковые эффекты и атмосфера плюс гибкие соотношения сторон (9:16 до 21:9) подходят для быстрых рабочих процессов в социальных сетях и рекламе, которым требуется завершенный звук, а не только визуальные эффекты.

3. Итеративное творческое редактирование

Редактирование на основе инструкций позволяет командам уточнять клип описательно, а не перегенерировать его, что ускоряет производство с большим количеством правок.

Часто задаваемые вопросы

Что такое MiniMax H3?

H3 — это Hailuo 3.0, новейшая модель генерации видео на основе ИИ от Mini​Max, представленная на WAIC 2026 (17 июля 2026 года) и выпущенная 31 июля 2026 года. Она создает нативное видео в разрешении 2K с частотой 24 кадра в секунду и синхронизированным звуком на основе текста или изображений, с омни-референсным управлением и редактированием на основе инструкций.

H3 — это то же самое, что Mini​Max M3?

Нет. M3 — это текстовая/агентная LLM от MiniMax, а H3 (Hailuo 3.0) — её модель генерации видео. Они были представлены на одном мероприятии, но выполняют разные задачи.

Где сейчас можно использовать H3?

Четыре площадки: платформа Hailuo от Mini​Max (полноценный продукт), Vercel AI Gateway (и H3, и MiniMax H3 Max, со скидкой 50% в честь запуска до 13 сентября), Luma Agents (анонсированы 6 августа 2026 года — до 15 секунд 2K-видео с нативным стереозвуком; условия доступа пока неясны) и самостоятельный хостинг через открытые веса H3-Base на Hugging Face и ModelScope — которые с 1 сентября можно обслуживать со скоростью выше скорости воспроизведения через vLLM-Omni с FastH3 от FastVideo (MP4 с видео и аудио длительностью 10,1 секунды примерно за 8,7 секунды на 8× B300, по данным команды vLLM-Omni). Базовая модель также маршрутизируется через OrcaRouter по цене из прайс-листа провайдера.

Какова продолжительность и разрешение клипов H3?

Нативное 2K при 24 кадрах в секунду, 5–15 секунд на генерацию, с возможностью продления до примерно 30 секунд, в соотношениях сторон от 21:9 до 9:16.

Что такое omni-reference?

Система управления, которая принимает до 9 эталонных изображений, 3 видеоклипа и 3 аудиоклипа одновременно, чтобы сохранить единообразие стиля, персонажа, движения и голоса.

H3 лучше, чем Kling 3.0 или Veo 3.1?

Это зависит от критерия. Kling 3.0 предлагает нативное 4K и лидирует в некоторых аренах; Veo 3.1 силён в диалогах на 48 кГц. H3 делает акцент на омни-референс контроле, однопроходном аудио, редактировании и цене. У H3 есть ранние оценки в арене Artificial Analysis (около 1,184 для image-to-video и 1,226 для text-to-video с аудио по состоянию на конец августа), которые изменятся по мере накопления голосов — протестируйте на своих промптах.

Является ли H3 моделью с открытыми весами?

Частично. Mini​Max открыла исходный код базовых весов H3 3 августа 2026 года — это трансформер на 33B параметров, выпущенный на Hugging Face и ModelScope под лицензией MiniMax H3 Community License, с контрольными точками FL2VA и Ref2VA. Согласно условиям лицензии Mini​Max, релиз ограничивает регионы развертывания и распространяется на сгенерированные результаты, а также требует указания авторства. Два модуля, которые дополняют флагманский опыт — H3-Context-IR (предобработка промптов) и H3-Regenerate-2K (апскейл до 2K) — не входят в открытый релиз и остаются доступными только через API. С 1 сентября открытые базовые веса также можно использовать для генерации в реальном времени через vLLM-Omni и FastH3 от FastVideo (FastH3 v1 поддерживает только текст-в-видео-аудио). Так что да, для базовой модели — с оговорками.

Суть

MiniMax H3 (Hailuo 3.0) — это серьезный шаг вперед для видеолинейки MiniMax: нативное 2K, синхронизированное аудио за один проход, широкие возможности omni-reference-контроля и редактирование на основе инструкций — по доступной цене. С момента запуска он также стал значительно доступнее: он маршрутизируется через OrcaRouter по прейскурантной цене провайдера, работает внутри Luma Agents, его базовые веса открыты для самостоятельного хостинга (а с 1 сентября он достаточно быстр, чтобы рендерить 10,1-секундный клип быстрее, чем тот проигрывается, с помощью vLLM-Omni и FastH3 от FastVideo), а он сам и MiniMax H3 Max теперь представлены на AI Gateway от Vercel с двухнедельной скидкой 50% в честь запуска. Он не будет автоматически превосходить по разрешению конкурентов с нативным 4K, и его ранние оценки на аренах еще не устоялись — но по контролю, аудио и скорости итераций он выглядит убедительно. Протестируйте H3 на собственных материалах против Kling 3.0, Veo 3.1, Seedance 2.0 и остальных и сохраняйте независимость от вендоров в вашем более широком стеке моделей через единую конечную точку, например OrcaRouter.