
Как использовать MiniMax H3: промпты, локальные запуски и аудио, которое не мусор
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
4 августа Саймон Уиллисон скачал примерно 115 ГБ весов, запустил неофициальный MLX-порт MiniMax H3 на своём MacBook Pro M5 Max и попросил радужного скунса, перепрыгивающего через мшистое бревно в супермаркете. Чуть менее чем через 45 минут у него появился ролик, который он описал как по-настоящему впечатляющий — со звуковой дорожкой, которую он назвал странным мусором, похожим на речь. Его собственный диагноз был самой полезной частью: он не давал модели никаких аудио-указаний и не прочитал предварительно руководство по промптингу. Это максимально краткое описание того, каково это — начинать использовать H3, который также продаётся как Hailuo 3.0. Картинка получается более или менее бесплатно. Всё остальное — звук, хронометраж сцен, разрешение 2K, персонаж, которому нужно пережить четыре дубля подряд, — приходится явно запрашивать в формате, более строгом, чем почти у любой другой видеомодели, используемой в настоящее время.
Это руководство по использованию, а не освещение запуска. В нём выделяются три уровня источников, и каждый раз они помечены: собственная документация компании (карточка модели, два руководства по написанию промптов, входящие в репозиторий, документация API платформы); результаты сообщества от людей, которые действительно запускали её, — мейнтейнеры ComfyUI, независимые бенчмаркеры, документация реселлеров и обсуждения на Hugging Face, все они датированы в период с 31 июля по 5 августа 2026 года; а также небольшое число случаев, когда мы сами читали первичный файл и говорим об этом. Данные сообщества — это единичные отчёты на неконтролируемом оборудовании, если не указано иное. Если практики не согласны друг с другом, разногласие фиксируется, а не разрешается.
Прежде всего: вы, вероятно, не запускаете всю модель.
Большая часть путаницы в первую неделю H3 сводится к одному структурному факту, который маркетинговые тексты размывают. H3 — это не одна модель. Согласно её карточке модели, это система из трёх частей, и только средняя часть была открыта:
• H3-Context-IR — мультимодальный препроцессор инструкций. Он читает ваш текст, изображения, аудио и видео, анализирует их взаимосвязи и выдает структурированное, семантически обогащенное представление вашего запроса. Только в виде размещенного API. Он представлен как отдельный тип задачи, который возвращает обогащенный промпт и вообще никакого видео.
• H3-Base — генеративная модель на 33 млрд параметров, которая действительно создаёт кадры и звук. Это часть с открытыми весами.
• H3-Regenerate-2K — проход регенерации в контексте, который повышает результат 768p до 2K. Только через API на хостинге.
Отсюда непосредственно вытекают два следствия, и они определяют весь ваш рабочий процесс. Во-первых, локальная генерация упирается в потолок 768p. Родной холст H3 имеет короткую сторону 768 пикселей и ограничен размером 768×1344 — примерно 1344×768 для 16:9. Если ваш результат ComfyUI не 2K, ничего не сломано; пакет, который вы скачали, — это H3-Base, и модуля апскейла в нём нет. Во-вторых, хостируемый API исправит неаккуратный промпт, а локальная установка — нет. Всё, что Context-IR делает для платного API-вызова — выводя структуру, определяя, какой референс что означает, заполняя части, которые вы оставили неясными, — это шаг, который теперь вы выполняете вручную или с помощью другой модели, прежде чем H3-Base вообще увидит ваши слова. Эта единственная асимметрия объясняет большинство сообщений о том, что «один и тот же промпт работает в Hailuo, но выглядит сломанным в ComfyUI».

Стоит отметить из самого репозитория: веса имеют тег minimax-h3-community-license-agreement, а не Apache или MIT (подробнее об этом ниже, поскольку именно это определяет, можно ли вообще выпускать продукт), модель указана с 33B параметрами в F32/BF16, и на сегодняшний день ровно один инференс-провайдер — fal — указан как обслуживающий её. Двадцать три файнтюна, двадцать квантизаций и тридцать один Space уже существуют на её основе, что служит надёжным признаком того, как быстро отреагировало сообщество.
Формат промпта: блоки кадров, а не тайм-коды.
Именно здесь сообщество и документация открыто вступают в конфликт, и это важнее, чем что-либо другое в этой статье.
Шаблон, распространявшийся быстрее всего — сначала через Reddit, а затем в нескольких опубликованных руководствах, — разбивает клип на временные интервалы: [0s-2s], [2s-5s], и так далее, после чего идёт структура из шести блоков: стилевой контракт, таймлайн, камера, звук, явно прописанный текст и негативный список. Он был восстановлен методом обратной разработки при чтении 45 примеров промптов, выпущенных компанией, и это не бессмыслица: эти примеры действительно представляют собой списки кадров с приложенной звуковой партитурой; медианная длина — около 130 китайских символов, а самые длинные доходят до 657 и 858 символов.
Но собственный VIDEO_PROMPT_WRITING_GUIDE_base_en.md компании, находящийся в папке docs репозитория, предписывает иное. Он организует по шот-блокам, а не по временным диапазонам. Мы читаем его напрямую; структура, которую он требует, такова:
• Инструкция — правила выравнивания изображения, используемые для режимов ключевых кадров (I2VA, FL2VA, L2VA) и не применяемые для чистого режима «текст-в-видео».
• integrated_multimodal_description — основная часть, разделённая на [Shot 1], [Shot 2], и так далее.
• общий саундскейп — от одного до четырех предложений о диегетическом звуке.
• недиегетическая музыка — одно-три предложения о музыкальном сопровождении.
В рамках этой системы условности достаточно конкретны, чтобы их можно было проверить. [Shot 1] вообще не содержит временной метки — последующие кадры начинаются с абсолютной склейки, сформулированной как «At 00:03.500, the camera cuts to…». Движение камеры записывается как тип движения плюс амплитуда плюс скорость, встроенные в естественный английский, а не нагромождённые в виде ярлыков: медленный наезд с малой амплитудой, а не camera: dolly-in, slow. Доступные движения — привычный набор: zoom, pan, tilt, tracking, arc, POV и shake в слабых или сильных вариантах. Диалог оборачивается в теги: <d>[English] Get in the car.</d>, при этом пунктуация сохраняется в точности и никогда не переводится и не перефразируется. Говорящие получают стабильные идентификаторы — (S1), (S2) и (S1,S2) для совместной реплики — с возрастом, полом, тембром и акцентом, описанными при первом появлении. Закадровый голос помечается как внеэкранная реплика с явным указанием, что губы остаются сомкнутыми; именно так вы не даёте модели синхронизировать губы с закадровым текстом на лице. Перекрёстные разговоры используют <scenetrans> как маркер плюс утверждение о непрерывности.
Явные запреты из руководства так же информативны, как и его правила: не ставьте временную метку на первом кадре, не повторяйте диалоги, пение или музыку на экране внутри overall_soundscape, не используйте абстрактные слова для описания настроения в non_diegetic_music, и никогда не переписывайте строки диалога. И одно заметное отсутствие — в официальном руководстве вообще нет раздела с негативными подсказками, что означает, что список «запрещённых переходов» в популярном шаблоне сообщества — это изобретение сообщества, а не документированная функция.
Насколько серьёзно воспринимать конфликт? В обсуждении на Hugging Face в репозитории H3 один участник сообщества опубликовал структуру в стиле таймкода как руководство, а другой практик прямо ответил, что он использовал похожую структуру, что она совершенно неверна, и что людям следует читать прилагаемое руководство. Это один человек противоречит другому, а не решение мейнтейнера. Наше прочтение свидетельств: оба варианта работают через размещённый API, потому что Context-IR нормализует всё, что вы ему отправляете; только документированный формат надёжен напрямую с H3-Base. Если вы запускаете локальные веса, следуйте файлу в репозитории. Если вы работаете через API и промпт с таймкодом даёт вам хорошие клипы, предобработчик делает эту работу за вас, и не следует делать вывод, что именно формат это обеспечил.
Компиляция ленивого брифа в диалект H3.
Возьмём двенадцатисловный промпт Уиллисона в качестве входных данных — радужного скунса, перепрыгивающего через замшелое бревно в супермаркете. При документированной записи это превращается примерно в: [Shot 1]блок, который открывается указанием стиля (игровое кино, ручная камера, флуоресцентное освещение) и кадра (проход в супермаркете, замшелое бревно поперёк линолеума, уходящие вглубь стеллажи), затем называет субъект и действие в физическом порядке — два мягких шага, приседание, прыжок, приземление — а камера совершает медленное движение с малой амплитудой, завершающееся по ту сторону бревна; overall_soundscapeиз когтей по линолеуму, влажного шороха бревна, гула холодильника и далёкого стука колёсиков тележек; а non_diegetic_music — строка короткого лёгкого перебора струн без вокала. Ничего из этого нельзя назвать творческой гениальностью. Это та же идея, но с четырьмя действительно предоставленными пунктами, которые требует H3, — и это разница между незапрошенным фоновым шумом помещения и саундтреком, который вы спроектировали.
Этот шаг механический, рутинный и впустую тратит человеческий труд — именно поэтому компания выпустила для него инструмент, который почти никто не осветил. Репозиторий содержит директорию skills с девятью навыками агента, и первый из них — h3-prompt-writing — делает именно это: принимает запрос и создаёт структурированный H3-промпт во всех пяти режимах генерации, включая разделы звукового ландшафта и музыки. Остальные восемь — это жанровые рецепты (реклама продукта, 3D-анимационный короткометражный фильм, эксплейнер в технике бумажного крафта, субтитры для музыкального клипа, интро для кооперативной игры, гибрид рисованной анимации и живого действия и так далее), которые оборачивают тот же формат в рабочий процесс.
Для выполнения этого навыка нужна текстовая модель, а не видеомодель, и именно здесь роутер действительно полезен, а не заглушка. Собственная LLM компании, MiniMax M3, является разумным выбором для этой задачи, и она доступна в OrcaRouter по цене $0,30 за миллион входных токенов и $1,20 за миллион выходных — это цена провайдера по прайс-листу, так как мы передаём её с нулевой наценкой — с контекстным окном в 1 млн токенов и, что необычно, с видео в качестве принимаемого типа входных данных. Именно эта последняя деталь делает её подходящей: вы можете передать ей официальное руководство по промптам, свой бриф и реальный референсный клип одним вызовом и получить на выходе [Shot N] блок, который его описывает. Составление промпта стоит долю цента по сравнению с генерацией видео, которая оплачивается посекундно, так что нет причин писать их вручную. Два честных предостережения: Сама генерация видео H3 не запускается в OrcaRouter — клипы поступают с платформы компании, fal, или с вашего собственного GPU — а шаг компиляции — это удобство, а не гарантия качества. Что роутер даёт вам здесь — так это то, что текстовая половина пайплайна находится за одним ключом с автоматическим переключением при сбое, так что сбой провайдера в середине батча не оставит очередь рендеринга в подвешенном состоянии, а замена M3 на другую модель для сравнения скомпилированных промптов — это изменение строки, а не новый контракт.

Аудио — это то, на чём все теряются в первый день
Наиболее часто подтверждаемый сбой за первую неделю — это тот, на который наткнулся Уиллисон: оставьте звук неуказанным — и H3 придумает что-то, да ещё и плохо. Он получил речеподобный шум из промпта без аудиоинструкций. Разбор официальных примеров методом обратной разработки сообщает о том же классе сбоя в более мягкой форме — опустите аудиоблок, и модель выдаст незапрошенный фоновый шум комнаты — и подаёт это как отсутствие, а не как ошибку, что является правильным способом думать о совместной аудио-видео модели. Она всегда генерирует звуковую дорожку. Ваш единственный выбор — указать её или нет.
Объединяя рекомендации из официального руководства по промптам с тем, что, согласно документации реселлеров и отзывам обозревателей, действительно работает:
• Диалог — это самое сложное, что можно запросить. Ограничьте реплики одним-двумя предложениями на каждые пять секунд клипа. Чрезмерно длинные реплики приводят к торопливой речи, звуку, выходящему за последний кадр, или напряжённой синхронизации губ — о чём единодушно сообщают рецензенты.
• Опишите говорящего перед репликой и подачу вместе с ней.Возраст, пол, тембр и акцент при первом появлении — согласно официальному руководству; простые, прямые указания по подаче (чётко, тепло, монотонно), а не развёрнутые режиссёрские указания, которые, как сообщается, ухудшают синхронизацию.
• Привяжите каждый эффект к видимому событию. «Хлопок пробки ровно в тот момент, когда пробка летит», а не «звук: хлопок». Слова as, when и then — это то, что обеспечивает синхронизацию.
• Кратко опишите музыку по жанру, темпу, настроению и инструментовке — никогда не по исполнителю или песне. Добавьте "no vocals", когда изображение должно быть на первом плане; это задокументированный способ сохранить чистоту микса.
• Создайте атмосферу одним предложением. Дождь по стеклу, приглушённый гул беседы, редкое звяканье чашек, мягкий фоновый джаз — всё уложено в одно предложение, а не расписано по пунктам.
• Не повторяйте диалог в разделе звукового сопровождения. Явный запрет в официальном руководстве; разделы предполагаются непересекающимися, и повторение строки там — способ получить её дважды.
• Если слово должно быть читаемым на экране, введите его в кавычках. Рецензенты сообщают, что заданные строки отображаются четко, тогда как расплывчатые запросы («элементы HUD», «вывеска») превращаются в буквообразный шум.
Там, где аудио действительно показывает себя, по мнению многих рецензентов, — это конкретные физические звуки: фоли и эффекты, привязанные к чему-то видимому, — а также атмосфера. С абстрактными или атмосферными запросами оно справляется слабее. Сцены с несколькими говорящими часто требуют редактирования, чтобы правильно выстроить порядок реплик, а качество произношения варьируется в зависимости от языка, поэтому протестируйте целевой язык на черновом клипе, прежде чем доверять ему проект. Некоторые рецензенты также отмечают честный потолок: звук достаточно хорош для распространения в социальных сетях, но в целом недостаточно хорош, чтобы сдать его как эфирный микс или микс для платной рекламы без замены. Это не рекомендации вендора; это то, что сообщают практики.
Ссылки: дайте каждому файлу задачу
Референсная система H3 — её самое сильное отличие и место, где чаще всего допускаются ошибки настройки. Задокументированные лимиты из документации API платформы: до 9 изображений, 3 видеоклипа и 3 аудиоклипа, максимум 12 файлов суммарно, при этом каждый референсный видеоклип или аудиоклип должен быть длительностью от 2 до 15 секунд, а их суммарная длительность не должна превышать 15 секунд. Для генерации видео по референсу требуется хотя бы одно изображение или видео; только аудио не принимается.
Метод, на котором сходятся и официальное справочное руководство, и сообщения сообщества, заключается в том, чтобы пометить каждый входной файл и назначить ему задачу. Ссылайтесь по тегу в точном порядке, в котором файлы были прикреплены — <Picture 1>, <Video 1>, <Audio 1> — и затем укажите в промпте, какой референс отвечает за какое свойство: идентичность, стиль, движение, камеру или голос. Официальные примеры промптов начинаются именно так, объявляя, что первое изображение — это общий референс настроения и стиля, а второе изображение — главный персонаж. Практики сообщают, что явное назначение работает значительно лучше, чем просто загрузить девять изображений и надеяться.
Две детали, которые стоят людям рендеров:
• <Picture 1> — это не мудборд, это буквально первый кадр на 0,000-й секунде, и он относится к [Кадру 1]. Опишите, что на нём изображено (стиль, объекты, композиция, якорные точки сцены), прежде чем описывать действие, которое из него следует. Относитесь к нему как к статичному кадру, который вы оживляете, а не как к подсказке.
• Есть два отдельных чекпойнта, и использование неправильного молча приводит к сбою. fl2va обрабатывает преобразование текста в видео и работу с первым/последним кадром; ref2va обрабатывает преобразование референса в видео. Это самая часто сообщаемая ошибка ComfyUI: граф R2V выполняется, когда всё ещё выбрана модель FL2VA. Также стоит знать, что один из комментаторов к анонсу ComfyUI отмечает, что поставляемый шаблон R2V открывает только два слота для референсных изображений, хотя модель принимает девять — это ограничение шаблона, а не модели.
В размещенном сервисе — еще два практических замечания из документации реселлера: ratio-параметр обязателен на эндпоинтах ref2va, его нельзя оставлять как "adaptive", а перекрывающиеся задания при параллелизме задач возвращают 429 вместо постановки в очередь — поэтому выполняйте их пакетами последовательно или создайте собственную очередь. Локально, ref_image_size по умолчанию равен match, что быстрее; max сохраняет короткую сторону до 2048 пикселей на референсе и требует времени.
Сколько на самом деле стоит локальный запуск в реальном времени
Загрузка полного официального репозитория составляет 498 ГБ, а перепакованное зеркало ComfyUI — 343 ГБ. Ни то, ни другое вам не нужно целиком. Четыре файла, перечисленные в собственном руководстве ComfyUI для преобразования текста в видео и изображения в видео, составляют около 42,5 ГБ.
• Диффузионная модель — minimax_h3_fl2va_pruned_int8_convrot.safetensors, 20.97 GB, в models/diffusion_models.
• Текстовый энкодер — qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors, 15,69 ГБ, в models/text_encoders.
• Video VAE — minimax_h3_video_vae_fp16.safetensors, 5.21 ГБ, в models/vae.
• Audio VAE — minimax_h3_audio_vae_fp32.safetensors, 0.61 ГБ, также в models/vae.
• Добавить для референс-в-видео — minimax_h3_ref2va_pruned_int8_convrot.safetensors, ещё 20,97 ГБ.
Эти 42,5 ГБ — не показатель VRAM: это диск, и части модели передаются потоково и выгружаются. То, что модель вообще помещается на потребительские видеокарты, — инженерный трюк, задокументированный в ComfyUI: примерно 40% параметров живут в ветвях модуляции AdaLN, чьи выходы можно вычислить заранее и заменить функционально эквивалентными таблицами поиска, сокращая загруженную модель с 33,12B до примерно 20,11B — по заявлению ComfyUI, без потери качества. В полной точности это было бы 123,6 ГБ. Необрезанные чекпоинты int8 (по 34,04 ГБ каждый) и bf16 (по 66,28 ГБ каждый) существуют, если вы дообучаете модель или гонитесь за последними процентами точности.
Требуется ComfyUI 0.30.0 или новее — в комплекте идёт три шаблона: T2V, I2V и R2V. База, на которой сходятся все гайды и мейнтейнеры для первого запуска, намеренно небольшая: 16:9 при 0,4 МП (864×480), 5 секунд, 20 шагов, семплер res_multistep с планировщиком simple, denoise 1.0, batch 1.Сначала получите один MP4, в котором есть и видео, и стереозвук, прежде чем менять разрешение или длительность. Ещё один арифметический нюанс, к которому стоит быть готовым: длительности привязываются к сетке кадров 17k+5, поэтому запрос на 5 секунд даёт 124 кадра — около 5,17 секунды при 24 fps — а 10-секундный — 243 кадра, то есть 10,125 секунды. Запросы длительностью 5–15 секунд находятся в более безопасной зоне.

Что это стоит в реальном времени, по сообщениям сообщества (все одиночные запуски, неконтролируемые, на разных настройках — график выше отображает каждую конфигурацию рядом с её столбцом): видеокарта RTX 3060 на 12 ГБ с 32 ГБ системной оперативной памяти и быстрым NVMe завершила базовый тест 864×480 / 124 кадра / 20 шагов менее чем за девять минут с использованием динамической выгрузки. Ноутбук с RTX 4090 на 16 ГБ с включённым SageAttention выполнил 960×540, 5 секунд, 20 шагов за 182 секунды. Сборка NVFP4 на одном RTX 5090 создала 243-кадровый (10,1 с) клип 864×480 за 10 шагов за 175 секунд, достигнув пика 26,9 ГиБ видеопамяти при всего 31,7 ГБ файлов на диске. Собственный эталонный пример из кулинарной книги SGLang — 1344×768, 124 кадра, 50 шагов на двух RTX 5090 с послойной выгрузкой — занял 559,67 секунды. А путь Apple Silicon через неофициальный порт MLX занял чуть менее 45 минут для одного клипа.
Практические заметки, извлечённые из этих отчётов:
• Системная ОЗУ и скорость диска являются критически важными, а не опциональными. На карте с 12 ГБ выбранные файлы по замыслу превышают объем видеопамяти, поэтому путь выгрузки проходит через ОЗУ, а затем через SSD. 32 ГБ ОЗУ фигурируют в обоих успешных отчетах с низким объемом видеопамяти. Не существует подтвержденного результата для 8 ГБ.
• SageAttention — единственное бесплатное ускорение — примерно 2× в ComfyUI, меньше, если в вашем прогоне преобладает трафик оффлоада. Установите wheel, соответствующий вашей точной сборке PyTorch и CUDA, а также ComfyUI-KJNodes, затем вставьте Patch Sage Attention KJ между загрузчиком UNET и гайдером и установите его в auto. Ожидайте предупреждений о том, что некоторые слои H3 не в FP16/BF16; такой откат задокументирован и это нормально.
• Количество шагов можно менять. В бенчмарке 5090 использовалось 10 шагов, базовый конфиг ComfyUI — 20, а эталонная конфигурация SGLang — 50. Никто не публиковал кривую зависимости качества от количества шагов, так что определите свой минимальный порог, прежде чем предполагать, что вам нужно 50.
• При ошибке OOM меняйте по одной переменной за раз. Документированный способ восстановления — вернуться к 0,4 МП, 5 секундам, batch 1 и менять по одному параметру за попытку.
• Беззвучное аудио означает, что аудио-VAE не подключён к узлу вывода видео. Это отдельный сбой, не связанный с плохим звуком, и его легко ошибочно принять за отказ модели генерировать звук.
• Поддержка Apple Silicon неофициальна. Уиллисон использовал PipeNetwork/minimax-h3-mlx, порт сообщества, запускаемый через uv с файлом требований MLX. В собственных материалах компании перечисляются SGLang, vLLM, Diffusers и ComfyUI, с типичным развёртыванием на четырёх GPU в BF16, и ничего не говорится о Metal или MPS. Считайте, что поддержку Mac обеспечивает сообщество.
Локальное против облачного: цифры
Поскольку модуль 2K и препроцессор промптов доступны только на хостинге, это не совсем «или-или». Архитектура подталкивает вас к следующей схеме: итерируйте локально в разрешении 768p, где каждая попытка обходится в электричество и три минуты, а затем купите готовый результат. Посекундная оплата подходит для того, что вы сохраняете, и разорительна для тех сорока, что выбрасываете.
Что касается цены, будьте осторожны: она варьируется примерно в 2 раза в зависимости от поставщика, а в блоге самого вендора не указана ни одна сумма в долларах — только то, что 2K стоит менее трети от цены массовых моделей, а 768p — менее половины цены конкурентных 720p. Что конкретно опубликовано: fal, единственный на данный момент провайдер инференса, указанный в репозитории Hugging Face, берёт $0,16 в секунду за 768p и $0,26 в секунду за 2K. Сторонние трекеры сообщают, что собственный прайс компании заметно ниже — около $0,09–$0,10 в секунду за 768p и $0,13–$0,14 в секунду за 2K — и их данные не сходятся между собой до цента, так что относитесь к ним как к ориентировочным и проверяйте страницу с ценами платформы, прежде чем закладывать бюджет. Также заложите в бюджет то, что эталонное видео тарифицируется по своей собственной длительности, а не только по сгенерированному результату.
Проверим на реальных цифрах. Сто сохранённых клипов по восемь секунд каждый — это 800 генерируемых секунд: около $112 при тарифе $0.14 за 2K, примерно $208 по тарифу fal $0.26 и около $76, если выдавать в 768p по нижней границе прайса. Сорок отбракованных на каждый сохранённый клип — вот что определяет счёт, и именно их стоит генерировать локально. Это также причина, по которой цена сравнения должна быть честной — на OrcaRouter текстовая часть этого конвейера передаётся по прайс-листу провайдера с наценкой 0%, поэтому когда вендор снижает цену, она обновляется в тот же день, а не после пересчёта маржи. Генерация видео, опять же, не наша; смысл лишь в том, что этап компиляции не должен быть статьёй расходов, о которой приходится думать.
Прочитайте лицензию, прежде чем создавать продукт на её основе.
Это та часть, которую пропускает большинство руководств «как использовать», и для многих читателей именно она меняет решение. Мы напрямую читаем файл LICENSE в репозитории. Веса распространяются по лицензии H3 Community License Agreement, а не по лицензии с открытым исходным кодом, и она содержит условия, достаточно необычные для того, чтобы процитировать их по существу:
• Территория. Лицензия определяет «Применимую территорию» как всемирную за исключением Европейского союза, Соединённого Королевства, Республики Корея и Соединённых Штатов Америки. Если читать буквально, это исключает значительную часть людей, которые в настоящее время публикуют результаты локальной генерации, — и ограничение сформулировано так, чтобы распространяться на результаты, а не только на веса.
• Атрибуция. Коммерческое использование требует отображения «H3» на интерфейсе продукта; лицензия также рекомендует уведомление «Powered by H3».
• Порог выручки. Организации, зарабатывающие более $20 миллионов в год на продуктах или услугах, созданных на его основе, должны получить отдельное письменное разрешение от компании.
• Без дистилляции. Вы не можете использовать H3 или его выходные данные для улучшения любой другой модели ИИ, кроме производных H3. Это исключает стандартный подход с синтетическими данными.
• Применимое право. Гонконг (САР), с исключительной подсудностью судам Гонконга.
• Один по-настоящему открытый компонент. Текстовый энкодер Qwen3-VL-32B имеет лицензию Apache 2.0; указанные выше ограничения относятся к весам H3.
Мы не ваши юристы, и это не юридическая консультация — прочитайте лицензию и документ Q&A, который компания прикладывает к ней, и если вы создаёте коммерческий продукт на исключённой территории, получите консультацию юриста, а не довольствуйтесь прочтением из блога. Практическая развилка: размещённый API — это отдельная сделка с иными условиями, чем у лицензии сообщества на веса, так что если локальная лицензия вам не подходит, путь через API может быть по-прежнему доступен. Проверьте условия той платформы, у которой вы покупаете.
План тестирования на первую неделю
Пять прогонов в таком порядке достаточно, чтобы понять, подходит ли H3 для вашего пайплайна:
• Прогон 1 — проверка работоспособности. шаблон T2V, 864×480, 5 секунд, 20 шагов, res_multistep/simple. Критерий успеха — MP4 со стереозвуком внутри, а не хороший клип.
• Прогон 2 — докажите, что формат имеет значение. Один и тот же объект дважды: один раз как свободное описание в одну строку, другой раз в виде [Shot 1] плюс overall_soundscape плюс non_diegetic_music. Если второй вариант не окажется явно лучше по сравнению с H3-Base, значит, в вашей настройке что-то не так.
• Дубль 3 — одна реплика диалога. Один говорящий, одно предложение, описанная подача, пять секунд. Это самый быстрый способ оценить, достаточно ли аудио качественно для ваших нужд и как произносится ваш целевой язык.
• Прогон 4 — дисциплина референсов. R2V с чекпоинтом ref2va, два или три референса, каждый из которых явно помечен и получил задачу, при этом <Изображение 1> описано как фактический первый кадр. Затем намеренно нарушьте это: прикрепите те же референсы без назначений и сравните.
• Запуск 5 — финиш. Прогоните свой лучший локальный промпт 768p через размещённый API на 2K и посмотрите, что добавляют Context-IR и проход регенерации. Именно эту разницу даёт цена за секунду, и это единственный способ честно рассчитать стоимость гибридного рабочего процесса.
Часто задаваемые вопросы
Могу ли я получить 2K из локальных весов?
Нет. Открытый пакет — это H3-Base, чей собственный холст имеет короткую сторону 768 пикселей (до 768×1344). 2K получается из H3-Regenerate-2K, отдельного внутриконтекстного модуля регенерации, который компания оставила на размещённом API. Вы можете повышать разрешение локально любым универсальным апскейлером, но это другая операция, нежели собственный проход регенерации H3, и результат не будет совпадать.
Почему один и тот же промпт ведёт себя по-разному в API и в ComfyUI?
Поскольку API сначала запускает H3-Context-IR. Он читает ваш текст и ваши ссылки, анализирует, как они соотносятся, и передаёт H3-Base структурированную, обогащённую инструкцию. Локально такого этапа нет — H3-Base получает ваши сырые слова. Расплывчатый промпт, который через API даёт достойный клип, на самом деле спасается препроцессором, который вы не устанавливали, именно поэтому задокументированный формат промпта гораздо важнее для локальных пользователей, чем для пользователей API.
Шаблон таймкода [0s-2s] неверен?
Это не то, что требует поставляемое руководство. Файл компании VIDEO_PROMPT_WRITING_GUIDE_base_en.md организует материал по блокам [Shot N], не указывает временную метку для Shot 1 и выражает последующие склейки абсолютным временем («В 00:03.500 камера переключается на…»). В нём также нет раздела с негативным промптом, так что список «запрещённых переходов» в популярном шаблоне — это дополнение сообщества. Тем не менее практики сообщают о хороших результатах API с формой таймкода — вероятно, потому что Context-IR её нормализует. Наш вывод: используйте документированный формат при работе с локальными весами и не приписывайте скобкам таймкода результаты API, которых мог добиться препроцессор.
Может ли компания в США или ЕС использовать открытые веса в коммерческих целях?
Прочитанный нами текст лицензии исключает ЕС, Великобританию, Южную Корею и США из применимой территории, причём исключение сформулировано так, что покрывает как результаты, так и веса модели. Это серьёзное препятствие для коммерческого развёртывания в этих регионах, и это юридический вопрос, а не технический — прочитайте лицензию и файл с вопросами и ответами самостоятельно и проконсультируйтесь со специалистом. API, размещённый на платформе, регулируется собственными условиями платформы, а не лицензией сообщества, поэтому его стоит оценивать отдельно, а не исходить из того, что на него распространяются аналогичные ограничения.
Что проверить перед коммитом
H3 — необычно хорошее соотношение цены и качества для конкретного типа работы: коротких клипов с проработанным звуковым дизайном и стабильными референсами, где вы готовы написать настоящий раскадровочный лист. Он необычно требователен к тому, как вы формулируете запрос. Три вещи, которые стоит проверить самостоятельно, потому что именно они меняются быстрее всего: появятся ли рядом с fal другие инференс-провайдеры (именно это снизит цену за секунду), расширится ли темплейт R2V в ComfyUI с двух слотов для референсов до девяти, как у модели, и победит ли привычка сообщества работать с таймкодами или задокументированный формат шот-блоков, когда кто-нибудь проведёт контролируемое сравнение с локальными весами. Никто пока не опубликовал такое сравнение. Пока этого не сделали, руководство в репозитории — более надёжный вариант, и оно лежит в том же скачанном файле, на который вы уже потратили 42 ГБ.
