
Vidu Q4 Preview vs MiniMax H3: 최상위권은 동률이며, 그중 하나만 세 개의 보드에 올라 있다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Artificial Analysis의 이미지-투-비디오 리더보드는 2026년 10월 8일 기준으로 확인한 결과, 다음과 같이 순위를 매긴다: MiniMax H3 Max가 1,195 Elo로 1위, MiniMax H3가 1,181로 2위, 그리고 Vidu Q4 Preview가 1,179로 3위다. 1위와 3위의 차이는 16점이며, 각각 약 ±10과 ±11의 구간에서 5,284표, 7,284표, 5,543표를 얻은 결과다. 이는 통계적 동점을 시상대처럼 포장한 것이며, 이 리더보드에서 승자를 선언하며 시작하는 페이지는 잡음을 읽고 있는 셈이다.
그래서 흥미로운 질문은 이 두 모델 중 어느 쪽이 더 나은가가 아니다. 그것은 두 모델이 모두 등장하는 단 하나의 보드에서 벗어나면 그 비교가 어떻게 되는가이다 — 왜냐하면 MiniMax H3는 2026년 7월 31일에 텍스트, 이미지, 비디오, 오디오 레퍼런스를 하나의 컨텍스트로 읽는 옴니모달 모델로 출시되었고, Vidu Q4 Preview는 2026년 10월 7일에 두 가지 입력 모드와 두 개의 API 엔드포인트와 함께 등장했기 때문이다. 그중 하나는 세 곳에서 측정된다. 다른 하나는 한 곳에서 측정된다.
3자 동점이 의미하는 것과 의미하지 않는 것
MiniMax 항목들과 Vidu 빌드는 서로의 구간 안에 들어가 있으므로, 솔직히 말하면 상위 세 이미지-투-비디오 모델은 현재 표본 크기에서 인간 선호도로는 구분할 수 없다. 두 가지 세부 사항 때문에 그 동점은 들리는 것만큼 모두에게 호의적이지 않다.
첫 번째는 시점입니다. MiniMax H3의 투표는 2026년 7월, H3 Max의 투표는 8월에 이루어졌고, Vidu Q4 Preview의 투표는 10월에 이루어졌습니다. 더 크고 오래된 투표 풀은 다른 경쟁 구도와 다른 상대 집단을 기준으로 측정되는데, 이는 양쪽으로 작용합니다. 더 잘 측정된 것이면서도 약간 다른 질문에 관한 것이기도 합니다. 여기서 어느 방향으로든 16점 차이는 증거가 아닙니다.
두 번째는 가격 열입니다. Artificial Analysis는 이 보드에서 MiniMax H3를 분당 $7.80, H3 Max를 분당 $4.80으로 기록합니다. Vidu Q4 Preview는 $7.20으로 기록됩니다. 이를 순위로 읽으면 H3 Max가 세 제품 중 가성비 선택처럼 보입니다. 그러나 그 밑에 깔린 공급사 요금은 이 표기를 반박하기보다 설명해 줍니다. 우리는 자체 모델 카드에서 MiniMax-H3를 768P에서 초당 $0.08, 2K에서 초당 $0.13으로 기재하며, 이는 분당 $4.80과 $7.80입니다. 보드에 있는 두 MiniMax 수치는 프리미엄 티어와 저가 티어가 아니라, 동일한 모델을 두 해상도 티어로 가격 책정한 것입니다. 선호도 보드의 분당 열은 자릿수 차이에는 유용하지만, 그보다 더 세밀한 판단에는 위험합니다.
MiniMax H3가 표시되고 Vidu Q4 Preview는 표시되지 않는 경우
이것은 동점에서도 살아남는 맞대결의 부분이며, 이는 질이 아닌 구조의 차이입니다.
MiniMax H3(768p)는 텍스트-투-비디오 보드에서 8,315표 이상에서 1,137 Elo로 4위이고, H3 Max는 5,719표 이상에서 1,130으로 5위입니다. 비디오 편집 보드에서도 7,023표 이상에서 1,119로 다시 4위인데, 이 보드는 오디오를 유지한 채 텍스트 지시로 비디오를 편집하는 작업을 기준으로 모델 순위를 매깁니다. Vidu Q4 Preview는 두 보드 어디에도 나타나지 않습니다.
그 부재는 측정상의 공백이 아니다 — 그것이 바로 이 제품의 정체성이다. Vidu Q4 Preview의 API는 두 개의 엔드포인트, /ent/v2/img2video 와 /ent/v2/reference2video를 문서화하고 있고, 제품 페이지에는 Image-to-Video와 Reference-to-Video 두 가지 모드가 나열되어 있다. 문서에는 text-to-video 경로가 없다. video-editing 경로도 없는데, 이는 이 모델이 기존 클립을 가져다 그 안의 무언가를 바꿀 수 없다는 뜻이다. MiniMax H3는 둘 다 해내며, 텍스트·이미지·비디오·오디오 레퍼런스를 하나의 컨텍스트에 담는 옴니모달 프레이밍이 바로 그 이유다.
오디오 쪽은 정확히 짚고 넘어갈 필요가 있습니다. 두 모델 모두 네이티브 오디오를 지원하지만, 둘은 같은 것이 아니기 때문입니다. Vidu Q4 Preview는 오디오와 비디오를 함께 생성하며, 이미지-투-비디오 엔드포인트에 audio 파라미터가 있어 대사와 음향 효과가 담긴 비디오를 출력하고, 캐릭터의 목소리를 일관되게 유지하기 위해 최대 세 개의 참조 오디오 클립을 받을 수 있습니다. MiniMax H3는 네이티브 스테레오 오디오를 출력하며 이미지 및 비디오와 함께 오디오를 입력 모달리티로 받습니다. 참조 음성 활용 사례는 Vidu의 특별한 강점이고, 모든 것을 참조하는 활용 사례는 MiniMax의 강점입니다.
초당 계산, 계층별로
두 모델 모두 생성된 출력의 초당 요금을 부과하므로, 요금표를 별도 환산 없이 서로 맞대어 볼 수 있는 드문 비교가 됩니다.
• 540p — Vidu Q4 Preview 전용: 초당 9크레딧, 플랫폼이 공개한 표준 크레딧 요율 $0.005 기준 약 $0.045
• 720P / 768P — Vidu Q4 Preview 초당 19 크레딧, 약 $0.095 vs MiniMax-H3 초당 $0.08
• 1080p — Vidu Q4 Preview 초당 24크레딧, 약 $0.12, MiniMax-H3는 공개된 1080p 티어 없음
• 2K — Vidu Q4 Preview 초당 38크레딧, 약 $0.19 vs MiniMax-H3 초당 $0.13
• 4K — Vidu Q4 Preview 전용: 초당 78크레딧, 약 $0.39
그로부터 도출되는 패턴은 "한쪽이 더 저렴하다"가 아니다. Vidu Q4 Preview의 하한은 정말로 더 낮다 — 540p 등급은 정확히 그것이 사용되는 용도에 맞춰 가격이 책정된 블로킹 등급으로, 풀해상도 렌더링 비용을 지불하기 전에 구도를 검증하기 위한 것이며, MiniMax의 요금표에는 그런 역할을 하는 항목이 없다. MiniMax H3는 두 모델이 공통으로 가진 최상위 등급인 2K에서 약 3분의 1 더 저렴하다. 그리고 Vidu의 4K 등급은 비교 대상 중 유일한 4K 생성 등급이며, 그에 걸맞은 가격에 책정되어 있다.
Vidu의 발표와 함께 공개된 초당 $0.014라는 출시 수치는 일반 요율이 아니라 할인된 크레딧 요율이 적용된 540p 등급입니다. Shengshu의 플랫폼은 현재 크레딧 번들에 대해 최대 30%까지의 한시 패키지 할인을 진행 중이며, 이는 곡선의 모양을 바꾸기보다는 모든 등급을 함께 낮춥니다. 비교 기준은 정가 요율 곡선으로 하고, 할인은 일시적인 상쇄로 취급하십시오.
저희 쪽에서는 MiniMax-H3를 라우팅합니다. 이 모델은 minimax/minimax-h3의 퍼블릭 모델 API에서 라이브로 제공되며, 생성된 출력 1초당 벤더의 정가로 청구되고 아무것도 더하지 않고 그대로 전달되며, 저희가 서비스하는 모든 텍스트 모델과 동일한 OpenAI 호환 엔드포인트에서 호출할 수 있습니다. Vidu Q4 Preview는 OrcaRouter 라우트가 아니며, 이 페이지는 그렇다고 주장하지 않습니다 — 저희가 실제로 제공하는 비디오 모델들은 언어 모델 바로 옆에서 하나의 키와 하나의 요청 형태로 자리 잡고 있으며, 이것이 여러 모델을 저렴하게 비교할 수 있게 하는 구성입니다. 패스스루 가격 책정의 실질적인 결과 하나: 벤더가 초당 요금을 변경하면, 그 변경은 계약 갱신 시점이 아니라 같은 날 라우트에서 확인할 수 있습니다.
실제 요청에서 "omni-modal"이 무엇을 가져다주는가
MiniMax H3의 통합 컨텍스트는 기능 목록으로 읽기 쉽지만 엔지니어링 차이로는 놓치기 쉽다. 비디오를 입력 레퍼런스로 받아들이는 모델은 기존 샷을 가리키며 계속 이어가거나, 확장하거나, 스타일을 바꾸도록 요청할 수 있다; 비디오 입력이 없는 모델은 그럴 수 없다. 그것이 편집 보드에서 H3가 존재하는 메커니즘이며, 또한 이 모델의 4–15초 출력 범위가 숫자가 시사하는 것보다 덜 제한적인 이유이기도 하다 — 멀티턴 확장이 더 긴 시퀀스를 그것으로부터 만들어 내는 일반적인 방식이기 때문이다.
Vidu Q4 Preview의 16초 상한 역시 생성 1회당 기준이며, Reference-to-Video 모드는 그 시간 창 안에서 멀티숏 스토리텔링을 위해 설계되었습니다. 문서에서는 지능형 카메라 전환과 여러 카메라 위치에 걸친 일관성을 설명합니다. 하지만 이미 촬영한 클립을 받아 수정할 수 있는 경로는 없습니다. 사용자의 워크플로가 스틸 이미지나 레퍼런스 세트가 아니라 푸티지에서 시작한다면, 이 두 모델 중 하나는 사용자에게 아예 선택할 수 없는 모델이며, 어떤 Elo 수치도 그 간극을 메우지 못합니다.
직업별로는 어느 쪽이야?
입력이 이미지나 참조 세트가 아닌 경우에는 MiniMax H3를 선택하세요. 텍스트-투-비디오, 비디오-투-비디오 편집, 오디오 입력, 15초를 넘는 멀티턴 확장, 또는 모델이 세 가지 서로 다른 보드에 해당하는 사용 사례를 아우를 필요가 있는 파이프라인 — 그게 바로 H3의 영역이며, 둘 중 이걸 하나라도 갖춘 쪽은 H3뿐입니다. 또한 두 모델이 공통으로 제공하는 최상위 등급에서 2K 요금도 둘 중 더 저렴합니다.
캐스트와 음성의 일관성이 중요할 때, 4K 생성 티어가 필요할 때, 또는 확정하기 전에 샷을 반복 수정할 저렴한 540p 블로킹 패스를 원할 때 Vidu Q4 Preview를 선택하세요. 15개의 이미지 레퍼런스와 3개의 오디오 레퍼런스는 MiniMax가 문서화한 것보다 더 큰 공개 레퍼런스 예산이며, 이 비교에서 다른 어떤 모델도 4K로 네이티브 생성하지 않습니다. 더 좁은 모드 세트가 그에 대한 대가입니다.
이것을 바꿀 것은 무엇인가: 텍스트-투-비디오 엔드포인트를 추가한 완전한 Vidu Q4 릴리스는 두 모델을 같은 보드에 올려놓고 이것을 정면 승부로 만들 것이다. 전반에 걸친 1080p와 개정된 기능 분류 체계를 갖춘다고 발표된 AA-Video-I2V v2.0은 보드 상단의 득표를 재정렬하기보다 대체할 것이며, 현재의 3자 동점이 동점인지 측정 한계인지도 결판낼 것이다. 그때까지 기억할 숫자는 16이며, 그 옆에 보드 이름과 날짜를 함께 둔다.
시상대 자체에서 얻을 만한 단 하나: 3위보다 16 Elo 앞선 1위가, 저렇게 넓은 구간에서는, 순위가 아니다. 그것은 인간 투표자들이 구분할 수 없는 세 모델이며, 그들 사이의 결정은 이 페이지의 다른 모든 것에서 나와야 한다.



