
Vidu Q4 Preview против MiniMax H3: на вершине таблицы — ничья, и только один из них присутствует в трёх таблицах
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Рейтинг image-to-video от Artificial Analysis, по состоянию на 8 октября 2026 года, ставит MiniMax H3 Maxна первое место с 1 195 Elo, MiniMax H3на второе с 1 181, а Vidu Q4 Previewна третье с 1 179. Первое и третье места разделяют шестнадцать пунктов при интервалах примерно ±10 и ±11 и 5 894, 7 284 и 5 543 голосах соответственно. Это статистическая ничья, наряженная под подиум, и любая страница, которая открывается объявлением победителя в этом рейтинге, читает шум.
Итак, интересный вопрос не в том, какая из этих двух моделей лучше. Он в том, что происходит со сравнением, как только вы уходите с единственного табло, где обе появляются, — потому что MiniMax H3 была выпущена 31 июля 2026 года как омнимодальная модель, которая считывает текстовые, графические, видео- и аудиореференсы как единый контекст, а Vidu Q4 Preview появилась 7 октября 2026 года с двумя режимами ввода и двумя конечными точками API. Одну из них измеряют в трёх местах. Другую — в одном.
Что означает и что не означает тройная ничья
И оба варианта MiniMax, и сборка Vidu лежат внутри интервалов друг друга, поэтому честно будет сказать, что три лучшие модели преобразования изображения в видео неразличимы по человеческому предпочтению при текущих объёмах выборок. Две детали делают эту ничью менее лестной для всех, чем это звучит.
Первое — возраст. Голоса MiniMax H3 — с июля 2026 года, а H3 Max — с августа; голоса Vidu Q4 Preview — с октября. Более крупные и старые пулы голосов измеряются на фоне другого конкурентного поля и другого набора соперников, и это имеет двоякие последствия: лучше измерены, но и отвечают на несколько иной вопрос. Разрыв в 16 пунктов в любую сторону здесь не является доказательством.
Второй — столбец с ценой. Artificial Analysis фиксирует MiniMax H3 на уровне $7,80 за минуту и H3 Max на уровне $4,80 за минуту в этой таблице. Vidu Q4 Preview зафиксирован на уровне $7,20. Если воспринимать это как рейтинг, H3 Max выглядит самым выгодным из трёх — но базовые тарифы вендора объясняют эту метку, а не противоречат ей. В нашей собственной карточке модели мы указываем MiniMax-H3 по цене $0,08 за секунду при 768P и $0,13 за секунду при 2K, что составляет $4,80 и $7,80 за минуту. Две цифры MiniMax в таблице — это одна и та же модель по цене двух уровней разрешения, а не премиального и дешёвого уровня. Колонки с ценой за минуту в таблице предпочтений полезны для оценки порядков величины и опасны для более точных сравнений.
Где MiniMax H3 появляется, а Vidu Q4 Preview — нет
Это та часть противостояния, которая сохраняется при ничьей, и это различие структурное, а не качественное.
MiniMax H3 (768p) занимает четвёртое место в рейтинге преобразования текста в видео с 1 137 баллами Elo по итогам 8 315 голосов, а H3 Max — пятое с 1 130 по итогам 5 719. MiniMax H3 снова четвёртый в рейтинге редактирования видео с 1 119 по итогам 7 023 голосов — в рейтинге, который ранжирует модели по редактированию видео согласно текстовой инструкции с сохранением звука. Vidu Q4 Preview не фигурирует ни в одном из них.
Это отсутствие — не пробел в измерениях, а сама суть продукта. API Vidu Q4 Preview документирует две конечные точки, /ent/v2/img2video и /ent/v2/reference2video, а на странице продукта указаны два режима: Image-to-Video и Reference-to-Video. Пути text-to-video в документации нет. Пути для редактирования видео тоже нет — то есть модель не может взять существующий клип и что-то в нём изменить. MiniMax H3 умеет и то, и другое, и причина в его омнимодальном подходе — текстовые, графические, видео- и аудиореференсы в одном контексте.
Стоит внести ясность в аудиосторону, потому что обе модели работают с нативным аудио, а это не одно и то же. Vidu Q4 Preview генерирует аудио и видео вместе, с параметром audio в эндпоинте image-to-video, который выдаёт видео с диалогами и звуковыми эффектами, и принимает до трёх референсных аудиоклипов, чтобы голос персонажа оставался единообразным. MiniMax H3 выдаёт нативное стереоаудио и принимает аудио как входную модальность наряду с изображениями и видео. Сценарий с референсным голосом — сильная сторона Vidu; сценарий, где референсом служит всё, — сильная сторона MiniMax.
Посекундная арифметика, уровень за уровнем
Обе модели тарифицируются посекундно за сгенерированный вывод, что делает это редким сравнением, в котором тарифные ставки можно сопоставить друг с другом без конвертации.
• 540p — только для Vidu Q4 Preview: 9 кредитов в секунду, около $0,045 при опубликованной платформой стандартной ставке $0,005 за кредит
• 720P / 768P — Vidu Q4 Preview: 19 кредитов в секунду, около $0,095 против $0,08 в секунду у MiniMax-H3
• 1080p — Vidu Q4 Preview: 24 кредита в секунду, около $0,12, тогда как у MiniMax-H3 нет опубликованного тарифа 1080p
• 2K — Vidu Q4 Preview: 38 кредитов в секунду, около $0,19 против $0,13 в секунду у MiniMax-H3
• 4K — только для Vidu Q4 Preview: 78 кредитов в секунду, около $0,39
Закономерность, которая из этого следует, — не «один дешевле». Нижняя граница у Vidu Q4 Preview действительно ниже: его 540p-уровень — это уровень блокинга, цена которого точно соответствует тому, для чего он используется, — проверить композицию, прежде чем платить за рендер в полном разрешении, — и ничто в прайс-листе MiniMax не играет эту роль. MiniMax H3 дешевле в 2K — верхнем уровне, общем для обеих моделей, — примерно на треть. А 4K-уровень Vidu — единственный уровень генерации 4K в этом сравнении, и цена это отражает.
Стартовая цифра $0.014 в секунду, сопровождавшая Vidu, — это уровень 540p по дисконтированной ставке за кредиты, а не общая ставка. Платформа Shengshu в настоящее время предлагает ограниченные по времени пакетные скидки до 30% на наборы кредитов, которые снижают все уровни сразу, а не меняют форму кривой. Рассматривайте кривую прайс-листовых ставок как основу для сравнения, а скидку — как временную поправку.
С нашей стороны: мы маршрутизируем MiniMax-H3. Он работает в публичном API моделей по адресу minimax/minimax-h3, тарифицируется за секунду сгенерированного результата по ставке вендора из прайс-листа, передаваемой как есть, без каких-либо наценок, и вызывается через тот же OpenAI-совместимый эндпоинт, что и все текстовые модели, которые мы обслуживаем. Vidu Q4 Preview не является маршрутом OrcaRouter, и эта страница не утверждает обратного — видеомодели, которые мы действительно обслуживаем, располагаются на одном ключе и с одной формой запроса рядом с языковыми моделями, и именно такая организация делает сравнение нескольких из них недорогим. Одно практическое следствие сквозной тарификации: когда вендор меняет ставку за секунду, это изменение видно на маршруте в тот же день, а не при продлении контракта.
Что даёт «omni-modal» в реальном запросе
Унифицированный контекст MiniMax H3 легко принять за список функций и не заметить инженерного отличия. Модели, принимающей видео в качестве входного референса, можно указать на существующий кадр и попросить продолжить, продлить или изменить его стиль; модель без видеовхода этого не может. Именно этот механизм стоит за присутствием H3 на монтажной панели, и он же объясняет, почему диапазон вывода этой модели в 4–15 секунд — не такое серьёзное ограничение, как можно подумать по этой цифре: многоходовое продление является обычным способом построить из него более длинную последовательность.
16-секундный потолок Vidu Q4 Preview тоже действует на одну генерацию, а его режим Reference-to-Video создан для многосценного повествования в пределах этого окна; в документации описываются интеллектуальное переключение камер и согласованность между несколькими позициями камеры. Чего у него нет — так это способа принять уже снятый вами клип и изменить его. Если ваш рабочий процесс начинается с видеоматериала, а не со стоп-кадра или набора референсов, одна из этих двух моделей просто недоступна вам, и никакое число Elo этого не компенсирует.
Какой именно, по работе?
Выбирайте MiniMax H3, когда на входе что угодно, кроме изображения или набора референсов. Генерация видео по тексту, редактирование видео-в-видео, аудиовход, многоходовое продление свыше пятнадцати секунд или пайплайн, где модели нужно покрывать сценарии использования, которых хватило бы на три разные доски, — это территория H3, и только она из этих двух имеет хоть что-то из этого. К тому же её тариф на 2K — дешевле из двух на общем для них верхнем уровне.
Выбирайте Vidu Q4 Preview, когда задача — согласованность персонажей и голоса, когда нужен уровень генерации 4K или когда хочется дешёвый черновой прогон в 540p, чтобы доработать кадр до принятия окончательного решения. Пятнадцать референсов-изображений и три аудиореференса — это более крупный опубликованный бюджет референсов, чем документирует MiniMax, и ни одна другая модель в этом сравнении не генерирует нативно в 4K. Более узкий набор режимов — плата за это.
Что могло бы это изменить: полный релиз Vidu Q4, добавляющий эндпоинт преобразования текста в видео, поставил бы обе модели на одни и те же таблицы лидеров и превратил бы это в прямое состязание. AA-Video-I2V v2.0, анонсированная с поддержкой 1080p повсюду и пересмотренной таксономией возможностей, заменила бы голоса в верхней части таблицы, а не пересортировала бы их, — и она решила бы, является ли текущая тройная ничья ничьей или ограничением измерения. До тех пор число, которое стоит запомнить, — шестнадцать, вместе с названием таблицы и датой рядом с ним.
Единственное, что стоит вынести из самого пьедестала: первое место, которое отстоит на шестнадцать пунктов Elo от третьего, при таких широких интервалах — это не ранжирование. Это три модели, которые голосующие люди не могут разделить между собой, и решение между ними должно исходить из всего остального на этой странице.



