'Kandinsky 6.0 Video vs Grok Imagine Video'라고 적힌 생성된 타이틀 카드가 '리더보드가 뒤집혔다'라는 부제와 함께, '비디오 생성', '동기화된 오디오', '오픈 웨이트 배포'라고 라벨이 붙은 아이콘 행 위에 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 있습니다.
Guides & Insights

Kandinsky 6.0 Video vs Grok Imagine Video: 리더보드가 뒤집혔다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 1월에, Grok Imagine Video가 출시되었을 때, 그것은 Artificial Analysis 비디오 아레나에서 두 모드 모두 1위를 차지했습니다. 오늘 같은 리더보드에서 현재 빌드는 텍스트-투-비디오 부문에서 11위 또는 12위입니다. 그것은 스캔들도 실패도 아닙니다 — 그것은 9개월 만에 빠르게 변하는 카테고리에서 벌어지는 일이며, xAI의 생성 모델과 Kandinsky 6.0 Video를 지금 비교하는 솔직한 이유입니다. 그중 하나는 얼마나 빨리 또 다른 클립을 만들 수 있는지에 최적화된 서비스이고, 다른 하나는 MIT 라이선스 체크포인트로, Pro 버전에서는 29B 파라미터, Lite 버전에서는 3B이며, 2026년 10월 첫째 주에 Sber의 Kandinsky Lab이 공개했고, 동기화된 44 kHz 오디오와 립싱크가 있는 5초 비디오를 생성합니다. 흥미로운 질문은 어느 쪽이 리더보드에서 앞서 있는가가 아니라, 각자가 구조적으로 다음에 무엇을 할 수 있는가입니다.

그 아래에서 움직인 판

Grok Imagine Video는 xAI의 생성 모델로, 2026년 1월 29일에 처음 출시되었으며 6월 16일부터 버전 1.5로 안정화되었습니다. Artificial Analysis의 텍스트-투-비디오 리더보드에서 1.5 빌드는 4,056표에서 Elo 1,045(±9)로 11~12위에 올랐으며, 분당 $15.00로 책정되어 있습니다. 원래 빌드는 해당 리더보드에 없습니다.

이미지-투-비디오는 이 제품군이 더 강한 영역이며, 두 빌드가 주의 깊게 살펴볼 만한 방식으로 갈라지는 지점이기도 합니다:

• grok-imagine-video-1.5 — 7~9위, Elo 1,098(±8), 5,267표, 분당 $8.40.

• grok-imagine-video (1월 빌드) — 12~17위, Elo 1,072 (±7), 14,371표, $4.20/분.

• 규모를 가늠해 보자면, 그 I2V 리더보드의 1위인 MiniMax H3 Max는 5,894표를 기준으로 Elo 1,195(±9)에 자리하고, Wan 3.0은 1,164로 6위입니다.

두 가지 해석이 뒤따르며, 둘 다 사실이다. xAI의 더 새로운 빌드는 이미지-투-비디오에서 자사 전작보다 26 Elo만큼 확실히 앞서지만, 그러기 위해 분당 두 배의 비용이 든다. 그리고 출시 주간의 이야기 — 정상에 도착한 모델 — 는 유지되지 않았다: 판도가 움직였고, 아레나는 십여 개의 더 새로운 시스템에 걸쳐 수만 표를 축적했으며, 9개월의 경쟁이 빠르고 범용적인 생성기를 놓이는 자리는 중위권이다.

Kandinsky 6.0 Video는 어떤 리더보드에서도 Elo 점수가 없습니다. 그 근거는 VABench 실행과 Sber가 발표한 연구소 주도 인간 평가뿐이며, 둘 다 Sber 외부에서는 재현된 적이 없습니다. 감사를 거치지 않은 오픈 모델을 점수가 매겨진 상용 모델 옆에 놓는 것은 바로 신중하게 다뤄야 할 비교입니다. 점수가 매겨진 모델의 위치는 실재하며 보기 좋지 않고, 점수가 없는 모델의 위치는 알 수 없습니다. '알 수 없음'은 '더 나음'이 아닙니다.

두 가지 종류의 빠름이 있고, 그중 하나만이 초 단위로 측정된다

Grok Imagine Video의 설계 목표는 크리에이터당 처리량이다. 이는 X에 통합되어 있으며, 사운드까지 갖춘 완성된 클립을 돌려주고, 그 기능 구성은 사람들이 피드에서 실제로 하는 일들을 그대로 나열한 것처럼 보인다: 다양한 화면 비율, 카메라 모션, 객체 추가·제거·교체, 스타일 변환, 캐릭터 일관성을 위한 여러 이미지 기반 참조 조건 생성, 대화와 효과음, 음악이 포함된 네이티브 오디오. 클립 길이는 최대 15초이며 해상도는 최대 1080p다. 제품 전체는 두 번째 시도에 몇 분과 몇 센트밖에 들지 않도록 만들어졌다.

Kandinsky 6.0 Video는 다른 의미에서 빠릅니다. 시도당이 아니라 소유 단위당 빠른 것입니다. 그 어떤 부분도 즉각적이지는 않습니다. 비증류 모델에 대한 리포지토리 자체의 작업 시간은 워밍업 후, 가중치 로딩과 MP4 인코딩을 제외하고, 5초 Pro Full HD 클립 기준으로 H100에서 약 402초, RTX 5090에서 854초, RTX 4090에서 1,247초, RTX 5060 Ti에서 3,530초입니다. Lite Full HD는 H100에서 284초입니다. 이를 견딜 만하게 만드는 도구는 증류 체크포인트인데, 논문에서는 전체 모델과 동등한 수준으로 측정했습니다. 대부분의 기준에서 더 선호되거나 동등했고, 평균 선호도는 51% 대 49%였으며, 개별 차이는 유의미한 수준에 도달하지 않았습니다. 느린 렌더링과 맞바꾸어 얻는 것은 클립당 요금이 전혀 부과되지 않는, 자신의 디스크에 있는 모델입니다.

그것이 이 맞대결의 진짜 구도다. Grok Imagine Video는 열 번째 시도의 비용을 최적화한다. Kandinsky 6.0 Video는 만 번째 시도의 비용을 최적화하는 대신, 첫 번째 시도에 대한 대가를 하드웨어와 인내심으로 청구한다.

둘 다 오디오를 생성합니다 — 그리고 둘은 같은 주장이 아닙니다.

이것은 게으른 비교라면 '무승부'라고 말하며 틀렸을 축이다.

Grok Imagine Video는 대사, 효과음, 음악이 포함된 네이티브 오디오를 여러 기능 중 하나로 제공합니다. 이는 음향을 부수적으로 포함하는 범용 생성기입니다.

Kandinsky 6.0 Video는 사운드를 중심으로 구축되었습니다. 이 아키텍처는 Kandinsky 5.0 Video에서 초기화된 비디오 스트림과 대규모 오디오 코퍼스로 처음부터 학습된 오디오 스트림을 짝지은 듀얼 스트림 CrossDiT이며, 양방향 교차 어텐션으로 연결되어 공동으로 학습됩니다. 출력은 44kHz에 명시적 립싱크를 지원하며, 논문의 강화학습 단계는 생성된 음성의 단어 오류율을 47% 줄인다고 보고됩니다 — Whisper-large-v3로 측정되었는데, 이는 RL 보상 모델 중 하나이며, 논문이 Qwen3-ASR-1.7B를 사용해 VABench와 함께 비교 불가능한 두 번째 WER을 보고하기 때문에 중요한 세부 사항입니다. 음성이 바로 이 모델이 사후 학습을 수행한 대상입니다.

그와 대조적으로, Sber 자체 연구는 자사 모델이 어디에서 뒤처지는지 솔직하게 밝힌다. 연구소의 나란히 비교 평가에서 MiniMax H3와 Dreamina Seedance 2.0은 시각적 기준에서 상당한 격차로 선호되며, 해당 모델은 앞서기보다는 경쟁력이 있는 것으로 묘사된다. 진지하게 받아들일 만한 주장은 더 좁고 더 유용하다: Kling 2.6 및 Veo 3.1 Fast와 비교하면 결과가 기준별로 엇갈리고, Kandinsky 6.0 Video는 음성 품질과 오디오-비디오 동기화에서 경쟁력을 유지하는데, 비교의 상당 부분이 무승부다.

15초 대 5초, 그리고 각각이 도달하는 데 드는 비용

• 최대 클립 — Grok Imagine Video: 최대 15초. Kandinsky 6.0 Video: 5초 고정, 24 fps로 121프레임, 이번 릴리스에는 연장 모드가 없습니다.

• 해상도 — Grok Imagine Video: 최대 1080p. Kandinsky 6.0 Video: 전용 초해상도 모델을 통한 SD, HD, Full HD, 5초 클립의 x2, x4 또는 x2.25 업스케일.

• 참조 입력 — Grok Video: 캐릭터 일관성을 위한 여러 이미지 기반 참조 조건 생성, 그리고 추가/제거/교체. Kandinsky 6.0 Video: 이미지 한 장을 마스크 처리된 마지막 프레임으로 적용.

• 가격 — Grok Imagine Video: 출력 1초당, 범위의 최저가부터 1080p에서 초당 $0.30까지이며, 이미지 입력당 추가 요금이 부과됩니다; 무료 이용은 X 구독 등급을 통해서만 가능합니다. Kandinsky 6.0 Video: 없음 — 서비스도, 요금도 없고, 사용자가 제공하는 GPU 시간만 필요합니다.

• 가중치 — Grok Imagine Video: 아니요. Kandinsky 6.0 Video: MIT, Pro 및 Lite, diffusers 통합 지원.

새로운 Grok 빌드에 대한 프리미엄이 바로 동그라미 쳐야 할 숫자다. 1월 빌드에서 1.5로 가면 이미지-투-비디오 보드에서 분당 비용이 두 배로 들고, 26 Elo를 얻는다. 그것은 실제 가격에 이루어지는 진짜 개선이며, 지금 모든 비디오 공급업체가 구매자에게 요구하는 것과 똑같은 거래다.

라우터가 적합한 경우와 그렇지 않은 경우

OrcaRouter는 Grok Imagine Video나 Kandinsky 6.0 Video를 제공하지 않으며, 이 글 어디에도 그렇다고 주장하지 않습니다. Kandinsky는 직접 내려받아 실행하는 것이고, Grok Imagine Video는 xAI 자체 채널을 통해 접근합니다. 두 모델 중 어느 것으로 파이프라인을 구축하든 라우터에 필요한 것은 렌더를 둘러싼 텍스트입니다. 즉 샷 리스트, 아이디어를 이 모델들이 학습한 길거나 짧은 캡션으로 바꿔 주는 프롬프트 확장, 캡셔닝과 전사 작업, 그리고 어느 생성물을 남길지 결정하는 리뷰 요약입니다. 이런 작업은 200개 이상의 텍스트 모델에 걸쳐 하나의 OpenAI 호환 엔드포인트에서 실행됩니다공급자 정가에 0% 마크업으로, 따라서 벤더의 가격 인하가 적용되는 날 같은 키에서 곧바로 사용할 수 있고, 자동 장애 조치 덕분에 렌더 큐 도중 실패한 호출이 배치를 멈춰 세우는 대신 다른 경로로 재라우팅됩니다. 비디오 모델을 둘러싼 오케스트레이션은 비디오 모델 자체가 라우팅 가능하지 않더라도 라우팅 문제이며, 오늘날 이 두 모델이 바로 그런 경우입니다.

어느 것이요, 그리고 무엇을 위한 건가요?

작업량이 많을 때 Grok Imagine Video를 선택하세요: 소셜 클립, 빠른 반복, 제대로 나올 때까지 여섯 번도 다시 생성하게 되는 한 장면, 그리고 늘어나지 않는 마감 기한 말입니다. 시도당 가격이 바로 이 제품의 핵심이며, 이제 최상위가 아니라 중위권에 자리한다는 사실은 이렇게 빠르게 움직이는 카테고리에서 치르는 당연한 비용입니다.

작업이 파이프라인일 때는 Kandinsky 6.0 Video를 선택하세요. 일괄 처리할 수 있는 고정된 5초 단위, 제공된 스틸 이미지에 대한 충실도가 핵심인 이미지-투-비디오 패스, 알아들을 수 있게 만들려는 음성, 그리고 임대하기보다는 직접 확보하고 싶은 결과물이라면 더욱 그렇습니다. 렌더링 비용을 감안하고, 소비자용 등급에서는 느릴 것이라고 예상하며, 이 글의 모든 품질 수치는 연구소 밖의 누군가가 점수를 매기기 전까지 Sber 자체 수치로 취급하세요.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

이 대결을 지켜볼 가치가 있게 만드는 것은 어느 쪽이 부진한 분기를 견뎌낼 수 있느냐다. Grok Imagine Video가 아레나에서 더 아래로 밀리면, 답은 더 나은 모델과 새로운 가격이다. 그것이 이 범주가 작동하는 방식이며, xAI는 이미 그런 모델을 하나 출시할 것임을 보여줬다. Kandinsky 6.0 Video가 일단 채점된 뒤 중위권으로 드러난다면, 그 체크포인트는 여전히 존재하고, 여전히 실행되며, 여전히 파인튜닝할 수 있다. 라이선스에 관해서는 그 숫자에 따라 달라지는 것이 없다. 이것들은 서로 다른 종류의 지속성이며, 그중 하나만 Elo로 측정된다.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.