생성된 타이틀 카드에는 'Kandinsky 6.0 Video vs Hailuo 2.3'라는 제목과 '다운로드에 맞선 가격표'라는 부제가 있으며, '비디오 생성', '동기화된 오디오', '오픈웨이트 배포'라고 라벨이 붙은 아이콘 행 위에 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 있습니다.
Guides & Insights

Kandinsky 6.0 Video 대 Hailuo 2.3: 가격표 대 다운로드

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

계산부터 시작하자. 이 둘이 겹치는 유일한 지점이니까. 6초짜리 무음 1080p 클립은 Hailuo 2.3—2026년 4월의 저가형 비디오 모델—에서 초당 몇 센트—클립당 대략 $0.48—에 책정된다. 동기화된 44 kHz 오디오와 립싱크가 있는 5초 클립은 Kandinsky 6.0 Video로 만들면—이 모델은 2026년 10월 첫째 주에 Sber의 Kandinsky Lab이 MIT 라이선스로 오픈소스화했다—클립당 비용이 들지 않고 Full HD에서 H100 시간 약 7분이 든다. 이것이 두 문장으로 요약되는 대결의 전부이며, 그것이 함의하는 결정은 "어느 쪽이 더 나은가"가 아니라 어떤 미터기를 돌리고 싶은지다: 초당 청구서인가, 아니면 자신의 하드웨어인가.

그 구분에서 나머지 모든 것이 따라오며, 대부분의 비교 페이지는 이들을 서로 다른 가격대의 같은 종류의 제품으로 취급함으로써 그것을 거꾸로 이해한다. 그렇지 않다. Hailuo 2.3은 스타일리스트의 브리프가 있는 서비스이며 사운드가 없다. Kandinsky 6.0 Video는 두 가지 크기의 체크포인트 패밀리다 — Pro는 29B, Lite는 3B — 사운드를 핵심 아키텍처 특징으로 삼는다.

저렴한 제품이 실제로 잘하는 것

Hailuo 2.3의 명성은 정당하며 구체적입니다. 시네마틱 카메라 움직임, 인간의 움직임과 미세 표정을 잘 처리하며, 스타일화된 콘텐츠와 애니메 콘텐츠에서는 가격이 시사하는 것보다 더 강력합니다. 텍스트-투-비디오와 이미지-투-비디오를 최대 1080p로 생성합니다. MiniMax는 이를 포토리얼리스틱 모델로 마케팅하지 않으며, 실제로도 그렇지 않습니다. 그것은 움직임을 잘 보는 안목을 지닌 스타일리스트입니다.

그 한계 역시 똑같이 구체적이며, 그것이 이 비교가 짧은 이유이다.

• 네이티브 오디오가 없습니다. Hailuo 2.3은 무음 출력이며, 오디오가 있던 이전 Hailuo 세대는 여기에 이어지지 않습니다. 모든 클립에는 후속 단계에서 사운드를 추가해야 합니다.

• 1080p에서는 클립 최대 길이가 6초, 768p에서는 10초이며, 종료 프레임 제어 기능이 없어 클립이 하나의 시퀀스로 깔끔하게 이어지지 않습니다.

• 현재 독립 리더보드에는 없습니다. Hailuo 2.3은 오늘 기준 Artificial Analysis의 텍스트-투-비디오, 이미지-투-비디오 또는 비디오 편집 리더보드에 나타나지 않으므로, 어떤 것과도 비교할 공개 Elo가 없습니다. 비디오 아레나에서 20위 후반쯤에 올랐다는 이전 언급들은 현재 게시된 리더보드와 일치하지 않으며, 현재 순위가 아니라 오래된 스냅샷으로 취급해야 합니다.

가격은 서로 다른 두 주체가 두 가지 통화로 제시하며, 둘 다 알아둘 가치가 있습니다. MiniMax 자체 API는 선불 포인트 패키지를 판매하는데, 6초 768p 표준 클립은 1포인트를 소모하고 10초 768p 또는 6초 1080p 클립은 2포인트를 소모합니다. 더 빠른 Hailuo-2.3-Fast 변형은 이를 대략 0.7포인트와 1.1~1.3포인트로 줄입니다. 제3자 추적기들은 초당 약 $0.067~$0.082의 더 평탄한 요율을 나열하며, 그중 하나는 $0.0817/초로 "최대 1080p, 클립당 최대 10초, 무음 출력"을 언급하고 6초 클립 300개에 월 약 $147을 제시합니다. 어느 경로를 택하든 규모는 같으며, 이 카테고리에서 가장 저렴한 생성입니다.

이미 대체된 세대를 구매하는 것의 문제점

Hailuo 2.3에 관한 한, 어떤 스펙보다 더 중요한 라이프사이클상의 사실이 하나 있는데, 이는 그 모델에 대한 비판이 아니다. MiniMax는 이미 다음으로 넘어갔다. 그 후속작인 MiniMax H3 — Hailuo 3 세대 — 는 2026년 7월 31일에 출시되었으며, 전혀 다른 등급의 제품이다. 텍스트, 이미지, 비디오, 오디오 레퍼런스를 하나의 컨텍스트로 읽는 옴니모달 모델로, 네이티브 스테레오 오디오와 함께 768p 또는 2K로 4초에서 15초 길이의 클립을 생성하며, 출력 1초당 과금된다.

그것은 제조사 측 주장이 아닙니다. 독립 게시판들에 올라와 있고, 배치도 강력합니다:

• 텍스트-투-비디오 — MiniMax H3 (768p), 8,315표 기준 Elo 1,137(±9)로 4위, 분당 $4.80.

• 이미지-투-비디오 — MiniMax H3, 7,284표에서 Elo 1,181(±8)로 2위, 분당 $7.80.

• 비디오 편집 — MiniMax H3, 12,043표에서 Elo 1,132(±6)로 2위, 분당 $7.80.

2026년 10월에 Hailuo 2.3을 구매하는 일을 솔직하게 정리하면 이렇습니다. 당신은 플래그십 세대가 두 생성 모드 모두에서 상위 5위권이고, 2.3에는 없는 오디오를 갖추고 있으며, 초당 비용이 아마 5~10배 더 드는 제품군의 보급형 등급을 사는 것입니다. 이는 대량 스타일링 작업에는 충분히 합리적인 결정입니다. 보급형 등급은 바로 그런 용도로 존재하니까요. 하지만 그것은 기본값이 아니라 의도적인 선택이어야 합니다. 오늘 2.3을 평가하는 사람이라면 누구든 먼저 H3를 나란히 놓고 가격을 따져봐야 합니다. 둘 사이의 격차는 점진적인 수준이 아니기 때문입니다.

5초 대 6초, 그리고 그 차이가 보기보다 작은 이유

길이 면에서 Kandinsky 6.0 Video는 이기지 못한다. 이 모델은 121프레임과 24fps로 학습되었고 — 5초 분량이다 — 공개 버전에는 확장 모드가 없다. Hailuo 2.3은 1080p에서 6초를 제공한다. 둘 다 연속된 장면을 만들기에는 충분하지 않으며, 둘 다 30초짜리 작품을 만들려면 다섯 번이나 여섯 번의 생성에 이어 붙이는 작업까지 더해야 함을 의미한다.

정작 중요한 격차는 다른 곳에 있습니다.

• 오디오 — Kandinsky 6.0 Video: 립싱크를 지원하는 44 kHz, 영상과 함께 생성되며 항상 켜져 있음. Hailuo 2.3: 설계상 없음.

• 해상도 — Kandinsky 6.0 Video: 전용 초해상도 모델을 통한 SD, HD, Full HD, 5초 클립을 x2, x4 또는 x2.25로 업스케일. Hailuo 2.3: 최대 1080p, SR 단계 없음.

• 컨디셔닝 — Kandinsky 6.0 Video: 텍스트→오디오-비디오 및 이미지→오디오-비디오, 참조 이미지 하나가 마지막 프레임으로 적용됨. Hailuo 2.3: 텍스트→비디오 및 이미지→비디오, 종료 프레임 제어 없음.

• 가중치 — Kandinsky 6.0 Video: MIT, Pro 및 Lite, diffusers 통합 및 — 오늘 아침부터 — vLLM-Omni 서빙 파이프라인. Hailuo 2.3: 미출시.

• 가격 — Hailuo 2.3: 출력 1초당 또는 선불 패키지에 대한 포인트 차감 방식이며, 더 저렴한 Fast 변형이 있음. Kandinsky 6.0 Video: 요금이 전혀 없음; GPU는 직접 제공해야 함.

공급업체 자체 증거가 말하는 것, 그리고 말할 수 없는 것

Kandinsky 6.0 Video의 품질 주장은 외부 감사를 받지 않았으며, 그렇게 설명해야 합니다. Sber는 VABench 결과를 보고했는데, 여기서 Pro는 평가된 세 시스템 — 자체 Lite 모델과 LTX 2.5 — 중 음성 품질, 오디오 심미성, 텍스트-비디오 및 오디오-비디오 정렬, 립싱크 정확도, 비동기화, 시각적 사실성에서 앞섭니다. 또한 실험실에서 실시한 병렬 인간 평가를 보고하는데, 기준당 대략 200건 이상의 쌍대 비교에서 이 모델은 Kling 2.6 및 Veo 3.1 Fast와 경쟁력이 있고, 시각적 기준에서는 MiniMax H3 및 Dreamina Seedance 2.0에 뒤처지며, 음성 품질과 오디오-비디오 동기화에서는 경쟁력을 유지합니다. 공개된 블라인드 Elo는 없으며, 외부 재현도 없습니다.

Hailuo 2.3의 증거는 반대 양상이다. 널리 쓰이지만 가격은 공개되어 있음에도 현재 독립 비디오 리더보드에는 없어서, 현재의 경쟁 구도에 견줘 놓을 수도 없다. 두 모델 모두 구매자가 가장 원할 만한 것을 갖추지 못했고, Hailuo의 경우에는 자사의 후속 모델이 그것을 갖췄다. 바로 그 점이 언급할 가치가 있는 비대칭성이다. 한 모델의 제품군은 이미 점수가 매겨지고 자리를 잡았지만, 다른 모델의 제품군은 전혀 점수가 매겨지지 않았다.

그렇다면 남는 것은 오디오 격차이며, 이것은 기능 목록의 한 줄이라기보다 진정한 격차다. Hailuo 2.3의 무음은 한 가지를 단순화한다 — 클립을 마스터링 패스에 넘길 때 보존할 사운드트랙이 없다 — 그리고 다른 하나를 복잡하게 만든다: 모든 토킹 헤드, 내레이션이 있는 모든 제품 광고, 음향 효과가 동작에 정확히 맞아야 하는 모든 클립은 이제 두 번의 생성에 더해 당신이 책임져야 하는 정렬 단계를 필요로 한다. Kandinsky 6.0 Video의 전체 아키텍처는 바로 그 문제를 겨냥한다: 비디오 스트림과 처음부터 생성하는 오디오 스트림을 양방향 교차 어텐션 아래에서 짝짓는 이중 스트림 CrossDiT, 그리고 논문이 생성 음성의 단어 오류율을 47% 줄인다고 보고하는 강화학습 단계를 갖추고 있다 — 이는 RL 보상 모델 중 하나인 Whisper-large-v3로 측정한 것이며, 논문이 VABench와 함께 보고하는 별도의 Qwen3-ASR-1.7B 단어 오류율과는 비교할 수 없다.

라우터가 적합한 경우와 그렇지 않은 경우

OrcaRouter는 Kandinsky 6.0 Video나 Hailuo 2.3을 제공하지 않으며, 여기서 그런 주장도 하지 않습니다 — Kandinsky는 직접 다운로드해 실행하는 것이고, Hailuo 2.3은 MiniMax 자체 API와 포인트 시스템을 통해 접근합니다. 둘 중 하나를 기반으로 구축된 파이프라인이 라우터에 필요로 하는 것은 렌더링을 둘러싼 텍스트입니다: 샷 리스트, 브리프를 이 모델들이 학습한 길거나 짧은 캡션으로 바꿔 주는 프롬프트 확장, 캡션 및 대사 작업, 그리고 어떤 생성물을 유지할지 결정하는 리뷰 요약입니다. 이들은 일반적인 텍스트 호출이며, 200개 이상의 모델에 걸쳐 하나의 OpenAI 호환 엔드포인트에서 실행됩니다 공급자 정가에 0% 마크업으로, 따라서 공급업체 가격 변경은 적용되는 당일 동일한 키에 바로 반영되고, 자동 페일오버로 렌더 중 실패한 호출이 배치를 잃지 않고 다시 라우팅됩니다. 비디오 모델을 둘러싼 오케스트레이션 계층은 비디오 모델 자체가 라우팅 가능하지 않더라도 라우팅 문제입니다 — 오늘 이 둘 모두가 바로 그런 상황입니다.

어느 걸 고를까?

작업량이 많고, 미학이 양식화되었거나 애니메이션 스타일이며, 결과물이 무음이고, 클립당 과금 기준이 중요한 제약일 때는 Hailuo 2.3을 선택하세요. 이는 이 범주에서 가장 저렴한 쓸 만한 생성 모델이며, 가격도 그에 맞게 책정되어 있습니다. 결정하기 전에 MiniMax H3의 가격을 나란히 비교해 보세요. 같은 제품군의 플래그십 생성 모델이 두 모드 모두에서 상위 5위 안에 들고, 2.3에는 없던 오디오를 갖추고 있기 때문입니다.

결과물에 사운드가 필요할 때, 5초 단위가 촬영 목록에 맞을 때, 제공된 스틸 이미지에 대한 이미지-투-비디오 충실도가 요구사항일 때, 그리고 모델을 임대하는 것보다 소유하는 것이 더 중요할 때 Kandinsky 6.0 Video를 선택하세요. 비용을 분명히 밝힌 상태로 접근하세요: 요금 없음, 5초 상한, Pro 모델의 경우 H100에서 약 402초, RTX 5090에서 854초가 걸리는 Full HD 렌더, 최대 할당량이 72.8 GiB 미만일 때 필요한 블록 오프로딩, 그리고 실험실 밖의 누군가가 점수를 매기기 전까지는 전적으로 Sber 자체의 품질 주장입니다.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Hailuo 2.3 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Audio: 44 kHz, always on', 'Independent Elo: none', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Hailuo 2.3 column reads 'Max clip: 6 to 10s', 'Resolution: up to 1080p', 'Audio: none', 'Independent Elo: not listed', 'Weights: none', 'Price: about $0.08/s'. A footer reads 'Hailuo rates per third-party listings; Kandinsky vendor-reported. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

두 가격표 아래에 깔린 질문은 이번 분기에 많은 비디오 인프라를 좌우하는 바로 그 질문이다. Hailuo 2.3은 초 단위로 요금을 청구하고 파일 하나를 건네준다; Kandinsky 6.0 Video는 GPU를 청구하고 라이선스 하나를 건네준다. 한 달에 클립 100개를 만드는 팀에게는 스프레드시트가 측정하는 모든 축에서 청구서가 이긴다. 파인튜닝을 하거나, 오프라인으로 실행하거나, 차세대가 출시된 뒤에도 같은 모델을 계속 쓰려는 팀에게는 스프레드시트가 볼 수 없는 단 하나의 축에서 다운로드가 이긴다.

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.