생성된 타이틀 카드에는 'Kandinsky 6.0 Video vs Google Veo 3.1'라는 제목과 '세 개의 티어 대 두 개의 크기'라는 부제가 표시됩니다. OrcaRouter 로고는 오른쪽 아래 모서리에 있습니다.
Guides & Insights

Kandinsky 6.0 Video vs Google Veo 3.1: 세 가지 티어 대 두 가지 크기

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Sber의 기술 보고서를 열어 Kandinsky 6.0 Video에 대한 정면 대결 섹션을 찾아보면, 비교 페이지들이 놓치는 무언가를 발견하게 될 것이다. 상대는 Veo 3.1이 아니다. 그것은 Veo 3.1 Fast다. Sber는 Veo의 세 등급 중 중간 등급을 상대로 인간 평가를 진행했는데, 그 단 하나의 선택이 이 대결에 대해 이 안의 어떤 품질 주장보다 더 많은 것을 말해준다. Veo 3.1은 2025년 11월 17일부터 세 가지 서비스 등급으로 정식 제공되어 왔고, Kandinsky 6.0 Video는 2026년 10월 첫째 주에 MIT 라이선스로, 다운로드 가능한 두 가지 크기인 Pro 29B와 Lite 3B로 등장했다. 이 중 하나는 초 단위로 구매하는 서비스이고, 다른 하나는 직접 실행하는 체크포인트다. 그리고 실제로 결정이 내려지는 곳은 품질 문제가 아니라 등급 문제다.

Veo 3.1은 하나의 이름을 쓴 세 개의 제품이다

Google의 모델은 Standard, Fast, Lite로 일반 제공되며, 세 가지 모두 동일한 포맷군을 생성합니다: 24fps의 720p, 1080p, 네이티브 4K, 네이티브 길이 4초, 6초, 8초, 1080p에서 더 긴 출력이 보고되고 그 이상은 장면 확장 체이닝이 가능하며, 캐릭터 및 장면 일관성을 위한 최대 3개의 참조 이미지, 그리고 시드 및 네거티브 프롬프트 제어가 포함됩니다. 출력에는 SynthID 및 C2PA 출처 메타데이터가 포함됩니다.

티어를 구분하는 것은 가격과 속도이며, 독립적인 보드는 그 격차에 대해 불편한 사실을 말해준다. Artificial Analysis의 텍스트-투-비디오 리더보드에서 세 모델은 서로 14 Elo 이내에 있다 — Veo 3.1은 2,998표에서 962(±10), Veo 3.1 Fast는 4,325표에서 961(±10), Veo 3.1 Lite는 2,903표에서 948(±10) — 반면 공시된 요금은 분당 $24.00, $7.20, $4.80이다. 이 둘을 함께 읽으면, 아레나는 티어를 선호도로 안정적으로 구분할 수 없다고 말하는 셈이다. 그렇다고 티어가 동일하다는 뜻은 아니다; 그것은 구매자의 진짜 질문이 어느 티어가 자신의 기준을 충족하는지라는 뜻이다. 왜냐하면 선호도 보드는 그 질문에 답해주지 않기 때문이다.

Kandinsky 6.0 Video는 변화에 대해 반대 접근을 취합니다. Pro는 29B, Lite는 3B인 두 가지 크기가 있으며, 하나의 아키텍처와 하나의 고정된 출력 형식을 공유합니다: 5초, 24 fps의 121프레임, 립싱크가 포함된 동기화된 44 kHz 오디오, 텍스트 또는 참조 이미지로부터 생성되며, 별도의 초해상도 모델이 결과를 Full HD로 높입니다. Fast 변형도, 확장 모드도 없습니다. 크기와 GPU를 선택하면 됩니다.

연구소 자체 평가가 실제로 주장하는 것

이 두 시스템 사이에 존재하는 유일한 일대일 비교 데이터이며, 슬래시 양쪽 모두 벤더가 보고한 것입니다 — Sber가 실행했고, Sber가 공개했으며, Sber 외부에서는 누구도 이를 재현한 적이 없습니다. 이를 유리하게 말하는 것보다 정확하게 말하는 것이 더 중요합니다.

텍스트-오디오-비디오 모드에서 보고서에 따르면 Kandinsky 6.0 Video Pro가 아티팩트와 카메라 모션에서 통계적으로 유의미한 격차로 선호되며, 동점이 많았던 가운데 모션 사실성에서는 약간 앞선다. Veo 3.1 Fast는 시각적 프롬프트 따르기, 음성 품질, 오디오-비디오 동기화, 전반적인 오디오 품질, 사운드 프롬프트 따르기, 사용자 과제 해결에서 앞서며, 음성을 제외한 모든 항목이 유의성에 도달했다. 전반적인 시각 품질은 거의 동등하지만 Veo가 약간 우세하다.

이미지-투-비디오에서는 판도가 시각적인 쪽으로 뒤집힙니다. Kandinsky 6.0 Image-to-Video Pro는 전반적인 시각 품질, 참조 이미지 정렬, 아티팩트, 카메라 모션에서 더 선호되며, 모두 유의미합니다. Veo 3 Fast는 시각 프롬프트 준수, 오디오-비디오 동기화, 전반적인 오디오 품질, 사운드 프롬프트 준수, 사용자 과제 해결에서 앞서며, 이 역시 유의미합니다. 모션 사실성과 음성 품질은 거의 대등한 것으로 나타납니다.

두 가지가 이어집니다. 이미지-투-비디오 결과는 진짜 발견입니다: 오픈 모델이 참조 이미지 대응도와 전반적인 시각 품질에서 Google 티어를 상대로 선호된다는 것은, 연구소 자체 연구에서 나온, 진지하게 고려할 가치가 있는 실제 주장입니다. 그리고 오디오 결과는 모드에 관계없이 Veo가 우위를 유지하는 부분입니다 — 이는 아무도 언급하지 않는 경고 신호로 우리를 이끕니다.

그 평가가 공정한지를 결정하는 오디오 플래그

Veo 3.1은 네이티브 48 kHz 스테레오 오디오—대사, 앰비언스, 폴리—를 영상과 함께 생성합니다. 이는 이 모델의 가장 강력한 기능 중 하나입니다. 하지만 API에서는 오디오 매개변수의 기본값이 꺼짐이며, 무음 생성은 오디오 생성보다 저렴합니다. 구글이 공개한 Standard 등급에서 무음은 초당 약 $0.20인 반면, 오디오를 켜면 초당 약 $0.40입니다.

Kandinsky 6.0 Video에는 그런 스위치가 없습니다. 오디오는 출력의 일부이며, vLLM-Omni에 병합된 서빙 파이프라인은 기본적으로 44.1 kHz AAC를 내보냅니다. 따라서 두 모델은 같은 기본값을 마주하지 않습니다. 하나는 오디오 우선이고, 다른 하나는 사운드를 업그레이드로 하는 무음 우선입니다.

그 비대칭성은 비교에서 특정한 대가를 치르게 한다. 오디오가 항상 함께 제공되는 경쟁자와 소리 없는 Veo 3.1을 맞붙게 한 뒤, 오디오를 인식하는 평가 기준에서 두 모델을 채점하는 모든 맞대결은 기본 설정이라는 우연 때문에 Veo에게 불리하게 작용해 왔다. 위의 Sber 수치를 보든, 다른 누구의 수치를 보든, 가장 먼저 물어야 할 것은 Veo 쪽의 오디오가 켜져 있었는가이다. 두 번째는 가격 차이가 얼마였는가이다. 왜냐하면 Standard 티어에서는 사운드를 켜면 가격이 두 배가 되기 때문이다.

5초 대 8초, 그리고 1080p 대 네이티브 4K

포맷 격차는 두 모델의 디자인 브리프가 드러나는 지점이다.

• 클립 길이 — Kandinsky 6.0 Video: 5초 고정, 24fps에서 121프레임, 확장 없음. Veo 3.1: 기본 4, 6 또는 8초, 1080p에서 더 길게, 그 이상은 장면 확장 체이닝.

• 해상도 — Kandinsky 6.0 Video: SD, HD 및 Full HD(1920×1080), 초해상도 패스 적용. Veo 3.1: 720p, 1080p 및 네이티브 4K.

• 출처 — Kandinsky 6.0 Video: 릴리스에서 언급된 바 없음. Veo 3.1: 출력물에 SynthID 및 C2PA 메타데이터.

• 참조 입력 — Kandinsky 6.0 Video: 이미지 한 장, 마스크 처리된 마지막 프레임으로 적용됨. Veo 3.1: 최대 세 장의 참조 이미지와 시드 및 네거티브 프롬프트.

• 형식 — Kandinsky 6.0 Video: 44.1 kHz AAC, 영상과 함께 항상 켜짐. Veo 3.1: 48 kHz 스테레오, 선택 사항, 두 가지 가격 책정 방식.

출처 표기 라인은 조달상의 결과를 좌우하는 부분이다. 당신의 산출물이 추적 가능해야 한다면 — 브랜드 작업, 방송, 법무팀이 들여다볼 수 있는 그 무엇이든 — Veo 3.1은 해당 푸티지가 생성되었음을 알리는 메타데이터를 첨부하지만, Kandinsky 6.0 Video는 그렇지 않다. 그것은 품질 차이가 아니며 어떤 벤치마크도 이를 보여주지 않겠지만, 그것만으로 벤더를 결정하게 만드는 종류의 요구사항이며, 그것이 없는 오픈 모델은 그것을 필요로 하는 팀에게 바로 대체할 수 있는 대체품이 아니다.

4K 라인도 같은 방식으로, 같은 이유에서 중요합니다. Kandinsky 6.0 Video의 Full HD는 실제로 구현되어 있습니다 — 전용 SR 모델이 있고, 저장소의 SR 패키지는 5초 클립의 x2, x4, x2.25 업스케일을 처리합니다 — 하지만 Veo 3.1의 네이티브 경로가 상한에서 시작하는 지점에서 한계에 도달합니다. 대형 화면 작업에서 그 한계는 타협할 수 없습니다.

각 측에서 클립에 드는 비용

Veo 3.1은 초 단위로 청구됩니다. Standard 등급에서 오디오가 포함된 5초 1080p 클립은 약 $2.00이고, 같은 클립을 무음으로 만들면 약 $1.00입니다. Fast와 Lite는 그보다 낮으며, 이들의 아레나 점수가 Standard의 신뢰 구간 안에 들어오기 때문에, 증거만 놓고 보면 더 저렴한 등급을 반박하기 어렵습니다.

Kandinsky 6.0 Video에는 청구서가 없습니다. 그 대신 GPU 시간이 있습니다. 저장소의 비증류 모델 수치는 워밍업 후 가중치 로딩과 MP4 인코딩을 제외하고 측정한 것으로, 5초 Pro Full HD 클립 기준 H100에서 약 402초, RTX 5090에서 854초, RTX 4090에서 1,247초, RTX 5060 Ti에서 3,530초입니다. Lite Full HD는 H100에서 284초입니다. Pro SD 실행의 최대 할당량은 72.8 GiB에 도달하므로, 그보다 낮은 메모리는 블록 오프로딩이 필요합니다. 그리고 16GB 프리셋은 텍스트 인코더를 NF4로 양자화하는데, 이는 논문이 반올림 수준의 노이즈를 도입하는 것이 아니라 클립 자체를 변경한다고 확인한 유일한 프리셋 변경입니다.

그 두 가지 비용 구조는 서로 비교할 수 없습니다. 하나는 완성된 1초당 예측하는 청구서이고, 다른 하나는 구매하는 머신, 분 단위로 측정되는 렌더, 그리고 미세 조정 옵션입니다 — Veo 3.1은 어떤 티어에서도 이를 제공하지 않습니다.

티어 질문은 라우팅 질문입니다.

OrcaRouter는 Google Veo 3.1도 Kandinsky 6.0 Video도 제공하지 않으며, 여기서 어느 쪽도 암시되지 않습니다 — Veo 3.1은 Google 자체의 채널을 통해 접근되고, Kandinsky는 직접 다운로드하는 것입니다. 하지만 Veo 결정의 구조는 짚고 넘어갈 가치가 있습니다. 왜냐하면 그것은 우리의 라우팅 계층이 텍스트 측면에서 해결하기 위해 존재하는 문제이기 때문입니다: 독립적인 점수가 구분 불가능하고 가격이 5배 차이 나는 세 개의 티어는 "저렴한 것을 라우팅하고 기준을 통과하지 못했을 때만 에스컬레이션하는 것"이 "플래그십으로 표준화하는 것"을 능가하는 바로 그 경우입니다. OrcaRouter의 적응형 라우팅과 라우팅 DSL은 이를 하나의 OpenAI 호환 엔드포인트에서 200개 이상의 텍스트 모델 전반에 걸쳐 구성된 정책으로 표현합니다, 공급자 정가에 0% 마크업, 라우트가 다운될 때 자동 장애 조치 기능을 갖추고 있습니다. 비디오 지출에 적용된 동일한 본능 — 기본적으로 Fast, 중요한 장면에는 Standard — 은 라우터 없이도 오늘 내릴 수 있는 조달 결정입니다.

어느 것, 누구를 위한 것인가

납품물에서 사운드를 제대로 다뤄야 한다면, 4K가 필요하거나 5초보다 긴 클립이 필요하다면, 또는 하위 단계의 누군가가 프로버넌스 메타데이터를 요구한다면 Veo 3.1을 선택하세요. Standard로 기본 설정하지 말고 티어를 의도적으로 고르고, 인보이스에서 뒤늦게 발견하는 대신 오디오 플래그에 대한 예산을 미리 잡아두세요.

가중치를 원하고, 5초가 당신의 작업 단위에 맞으며, 제공된 스틸 이미지에 대한 이미지-투-비디오 충실도가 바로 그 작업이라면 Kandinsky 6.0 Video를 선택하세요 — 연구소 자체 연구에서 상당한 격차로 Veo 티어보다 앞세우는 유일한 차원입니다. 오디오는 항상 켜져 있고, 출처 표시는 없으며, 품질 주장은 전적으로 작성자가 쓴 보고서에 의존한다는 점을 알고 들어가세요.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Google Veo 3.1 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Audio: 44.1 kHz, always on', 'Provenance: none stated', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Google Veo 3.1 column reads 'Max clip: 4, 6 or 8s', 'Resolution: up to native 4K', 'Audio: 48 kHz, optional', 'Provenance: SynthID and C2PA', 'Weights: none', 'Price: $4.80 to $24.00/min'. A footer reads 'Veo rates and Elo per Artificial Analysis; Kandinsky vendor-reported. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.

붙잡아야 할 비대칭성은 이것이다. Veo 3.1은 11개월째 실제 서비스에 투입되어 왔고, 따라서 이번 달 공개된 오픈 모델이 가질 수 없는 것을 축적해 왔다. 사용자들이 이미 공개한 실패 모드 지도, 그리고 재무팀이 모델링할 수 있는 가격 곡선이다. 반면 Kandinsky의 MIT 라이선스는 당신의 디스크에 있는 모델이 누구의 로드맵에도 의존하지 않는다는 뜻이다. 이 중 어느 쪽이 더 가치 있는지는 벤치마크 질문이 아니다.

A screenshot of OrcaRouter's own model page for kling/kling-3-turbo, titled 'Kling 3.0 Turbo', credited to Kling and dated 2026-06-17, showing the route endpoint /v1/video/generations and a price of $0.11 per request, with a description explaining that Kling 3.0 Turbo is Kuaishou's speed-optimized model in the Kling 3.0 generation with native audio bundled in, handling text-to-video and image-to-video, and multi-shot storyboarding of up to six shots in a single generation.