생성된 타이틀 카드에는 'Kandinsky 6.0 Video Lands in vLLM-Omni'라는 문구와 'A checkpoint becomes a service'라는 부제가 담겨 있으며, 이 카드는 'Video Generation', 'Synchronized Audio', 'Open-Weight Deployment'라는 라벨이 붙은 아이콘 행 위에 놓인다. OrcaRouter 로고는 오른쪽 아래 모서리에 자리한다.
Engineering & Research

Kandinsky 6.0 Video, vLLM-Omni에 도입: 서빙 레이어가 오픈 모델에 더하는 것

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

오늘 아침 07:55 UTC에 풀 리퀘스트 #8537이 vLLM-Omni에 병합되었고, 그것이 하는 일은 단 하나입니다: Kandinsky 6.0 Video를 서빙 가능하게 만드는 것입니다. 모델 자체는 같은 날 Sber의 Kandinsky Lab에서 한 쌍으로 등장했습니다 — Kandinsky 6.0 Video Pro는 29B 파라미터, Kandinsky 6.0 Video Lite는 3B — 텍스트 프롬프트나 참조 이미지로부터 립싱크까지 포함해 44 kHz 오디오가 동기화된 5초 클립을 생성하며, 코드와 가중치, diffusers 통합은 모두 MIT 아래에 있습니다. 오늘 아침까지 이것에 없었던 것은 일회성 명령줄 대신 추론 서버 안에서 실행할 방법이었습니다.

그 구분은 들리는 것보다 더 큰 가치가 있으며, 이것이 이 이야기가 릴리스와 별개의 이야기인 이유다. 자신의 카드에서 실행할 수 있는 오픈 체크포인트는 연구 산출물이다. 서버 측 파이프라인, 공유 진입점, 서빙 레시피를 갖춘 오픈 체크포인트는 큐 뒤에 둘 수 있는 무언가다. 이번 주 릴리스는 첫 번째를 주었다. 오늘의 병합은 두 번째의 시작이다.

실제로 병합된 것

이 PR은 체크포인트 kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers로부터 vLLM-Omni에 텍스트→비디오·오디오와 이미지→비디오·오디오를 추가합니다. 흥미로운 부분은 엔지니어링 선택인데, 작성자가 아닌 다른 사람이 이 아키텍처를 서빙해야 할 때 그것이 실제로 어떤 모습인지 알려주기 때문입니다.

• 하나의 DiT가 두 모달리티를 모두 디노이즈합니다. 파이프라인은 Kandinsky6TI2VAPipeline으로 등록되어 있으며, 비디오 잠재 변수와 오디오 잠재 변수는 순차적으로 실행되는 두 모델이 아니라 단일 트랜스포머에 의해 공동으로 디노이즈됩니다. 이는 사전 학습된 비디오 스트림과 처음부터 학습한 오디오 스트림이 양방향 교차 어텐션으로 연결되는 논문의 듀얼 스트림 CrossDiT를 반영합니다.

• 가중치는 폴더 단위로 로드됩니다. Hub 체크포인트는 transformer/, vae/, text_encoder/, text_encoder_2/, audio_vae/로 읽힙니다. 공개된 체크포인트의 내부 이름인 videoT와 audioT는 로드 시 video_dec_block과 audio_dec_block에 매핑되는데, 이는 직접 발견하면 하루를 잡아먹는 종류의 세부 사항입니다.

• 오디오는 기본적으로 켜져 있습니다. 이 파이프라인은 사운드를 선택적 플래그로 취급하는 대신 44.1kHz AAC를 출력하므로, 오디오 매개변수가 전혀 없는 요청이라도 동기화된 음성, 음악 또는 앰비언스와 함께 반환됩니다.

• 이미지 입력은 별도의 모드가 아니라 마스킹된 테일 프레임입니다. 참조 이미지 컨디셔닝은 마스킹을 통해 적용되며, 이는 동일한 파이프라인이 분기 없이 T2AV와 I2AV를 모두 처리하는 방식입니다.

제출자의 스모크 테스트는 유용한 최소 기준입니다: 단일 NVIDIA H100 80GB, FlashAttention-3 사용, CPU 오프로드 켜짐, 864×480, 125프레임, 50스텝, CFG 5.0, 시드 42. 이는 HD에 살짝 못 미치는 5초 클립이며, Full HD 렌더가 아니고, PR에서도 달리 주장하지 않습니다.

체크포인트는 서비스가 아닙니다

이런 병합을 신경 써야 하는 이유는 그것이 여러분의 목록에서 무엇을 없애주는가에 있습니다. 참조 구현을 실행한다는 것은 저장소를 복제하고, setup만 실행하고, Hopper 미만에서는 SageAttention을 컴파일하게 하고, 체크포인트를 캐시 디렉터리에 다운로드하고, 출력이 타임스탬프가 붙은 폴더에 들어가는 generate 명령을 호출하는 것을 의미합니다. 그건 첫인상용으로는 괜찮지만 제품용으로는 어색합니다.

vLLM-Omni는 모델을 서빙 프로세스 안에서 제공하며, 프로젝트가 다른 diffusion 모델들에 사용하는 것과 동일한 오프라인 추론 진입점(examples/offline_inference/text_to_video/text_to_video.py 및 그 image-to-video 대응 예제)과 recipes/Kandinsky/Kandinsky6-TI2VA.md의 서빙 레시피를 함께 제공합니다. 여기에는 두 가지 실질적인 결과가 따릅니다. 배포 방식은 당신이 관리하는 스크립트가 아니라 HTTP 인터페이스로 통신하는 컨테이너가 되고, 모델은 더 이상 당신의 스택에서 특별한 예외가 아니게 됩니다 — 해당 서버에서 실행하는 다른 무엇이든 그 옆에 자리합니다.

이것이 무엇이 아닌지 주목하세요. 이것은 호스팅된 엔드포인트가 아니고, 가격도 아니며, 독립적인 품질 측정도 아닙니다. 이것은 모델이 실행될 수 있는 또 하나의 장소이며, 가중치가 나타난 지 사흘 후에 연구소 밖의 누군가가 기여한 것입니다.

실제 카드에서 5초짜리 클립에 실제 시간이 얼마나 드는가

저장소 자체의 표가 정직한 출발점입니다. 다음은 워밍업 후 5초짜리 단일 클립에 대한, 가중치 로딩과 MP4 인코딩을 제외한 비증류 기본 모델의 작업 시간입니다. 여기서 풀 HD란 초해상도 패스도 함께 실행된다는 뜻입니다.

• 풀 HD (Pro) — H100에서 402초, RTX PRO 6000에서 765초, RTX 5090에서 854초, A100 80GB에서 1,106초, RTX 4090에서 1,247초, RTX 5060 Ti에서 3,530초.

• 풀 HD (Lite) — H100에서 284초, RTX PRO 6000에서 387초, RTX 5090에서 406초, A100 80GB에서 664초, RTX 4090에서 578초, RTX 5060 Ti에서 1,774초.

• SD (Pro) — H100에서 356초인 반면 RTX 4090에서는 936초로, 소비자용 카드의 불이익이 가장 작고 경제성이 가장 덜 나쁜 지점이다.

그 표의 형태는 어떤 단일 셀보다도 더 중요합니다. Pro Full HD에서 H100은 4090보다 대략 세 배 빠르고, 같은 작업에서 5060 Ti보다 대략 여섯 배 빠릅니다. 하지만 SR 단계는 어느 모델 크기에서든 비용이 동일합니다. 5090에서는 HD에서 약 64초, Full HD에서 약 96초입니다. Lite를 써도 초해상도 패스가 더 짧아지지는 않습니다. SR 모델은 별도로 학습되어 어떤 베이스 모델이 입력을 제공했는지 신경 쓰지 않기 때문입니다.

16 GB 경로, 그리고 사진을 바꾸는 단 하나의 설정

Pro SD 실행 시 최대 할당 메모리는 72.8 GiB에 도달하며, 이는 모든 소비자용 카드를 넘어섭니다. 리포지토리는 블록 오프로딩으로 대응합니다 — 한 번에 두 개의 트랜스포머 블록만 GPU에 상주하고 나머지는 호스트 메모리에서 스트리밍됩니다 — 또한 32 GB, 24 GB, 16 GB 카드용 프리셋 세 가지를 제공합니다. 32 GB와 24 GB 프리셋은 동일합니다. 24 GB를 초과하면 추가 여유 공간이 속도로 이어지지 않기 때문입니다.

이 주의사항은 잘 드러나지 않지만 다시 강조할 가치가 있습니다: 16 GB 프리셋에서는 텍스트 인코더가 NF4로 양자화되며, 논문은 이것이 클립 자체를 바꾸는 유일한 프리셋 변경이라고 분명히 밝힙니다. 다른 텍스트 표현은 다른 영상을 만들어냅니다. 그 외의 모든 것 — 세그먼트 길이, 공간 스트립, 오프로딩 — 은 반올림 잡음 수준에서 출력을 바꾸며, 대략 57 dB PSNR에서 약 12%의 픽셀이 한 밝기 수준만큼 달라질 정도입니다. 16 GB 카드에서 다른 사람의 결과를 재현 중인데 일치하지 않는다면, 그것이 가장 먼저 확인해야 할 사항입니다.

릴리스 노트가 해결하지 못하는 세 가지

• 5초는 기본값이 아니라 상한선입니다. 모델은 121프레임과 24fps로 학습되었고, 논문과 서빙 레시피 모두 이를 전제로 만들어졌습니다. 릴리스에는 확장 모드가 없습니다. 그보다 긴 것은 당신이 책임져야 할 스티칭 문제입니다.

• 증류된 체크포인트가 실제로 서빙하게 될 모델이며, 동등한 수준으로 측정되었습니다. 논문의 절제 연구에 따르면 증류 모델은 대부분의 기준에서 선호되거나 동등했고, 개별 차이는 유의성에 도달하지 않았으며, 평균 선호도는 51% 대 49%였습니다. 그것이 속도를 위해 감수하는 트레이드오프입니다.

• 논문에는 두 개의 단어 오류율 숫자가 있고, 이들은 서로 비교할 수 없다. 강화학습 단계에 수반되는 생성 음성 WER의 47% 감소는 RL 보상 모델 중 하나인 Whisper-large-v3로 채점된다. VABench와 함께 보고된 WER은 음성 하위 집합에서 Qwen3-ASR-1.7B를 사용한다. 저자들 스스로 그렇게 밝히고 있다. 하나를 다른 하나로 인용하는 것은 이번 릴리스에서 저지르기 가장 쉬운 실수다.

이런 스택에서 라우터가 어디에 위치하는지

OrcaRouter는 Kandinsky 6.0 Video를 제공하지 않으며, 여기에서 그렇다고 주장하는 것으로 읽혀서는 안 됩니다 — 이 모델은 Hub에서 직접 실행하거나 해당 연구소의 자체 인터페이스를 통해 접근할 수 있습니다. 이런 파이프라인이 라우터에 필요로 하는 것은 그 주변의 텍스트 작업입니다. 샷 설명을 모델이 학습한 장문, 중문 또는 단문 캡션으로 바꾸는 프롬프트 확장 단계, 이미지-투-비디오 단계에 공급되는 캡션 및 전사 작업, 네 가지 생성 중 무엇을 유지할지 결정하는 리뷰 요약: 이것들은 평범한 텍스트 호출이며, 200개 이상의 모델에 걸쳐 하나의 OpenAI 호환 엔드포인트에서 실행되고, 제공업체 정가가 0% 마크업으로 그대로 전달되므로, 벤더 가격 변경이 같은 날 바로 반영됩니다. 여기서는 자동 장애 조치가 평소보다 더 중요합니다. 캡션 단계에서 중단되는 5분짜리 렌더는 다시 시작하기보다 경로를 바꿔야 하기 때문입니다.

다음으로 주목할 것은 또 다른 병합이 아니라 숫자다. Kandinsky 6.0 Video Pro는 VABench에서 벤더가 보고한 결과와 Kling 2.6, Veo 3.1 Fast, MiniMax H3, Seedance 2.0을 상대로 한 연구소 주도 인간 평가를 갖고 있으며, 아직 독립적인 아레나 점수는 없다. 그 점수가 나타나면 오픈 웨이트라는 주장은 접근성에 관한 논쟁에서 품질에 관한 논쟁으로 바뀌게 되고, 그것이 바로 이 모델이 팀들이 다운로드하는 모델인지 감탄하는 모델인지를 결정하는 비교다.

A generated scoreboard titled 'Kandinsky 6.0 Video — the scoreboard' with a single column of six rows: 'Sizes: Pro 29B, Lite 3B', 'Clip length: 5s fixed', 'Audio: 44 kHz lip-sync', 'Resolution: Full HD plus SR', 'Licence: MIT' and 'Serving: vLLM-Omni day 0'. A footer reads 'All figures vendor-reported; no independent Elo yet. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the GitHub repository page for kandinskylab/kandinsky-6, showing 11 commits, 35 stars and 4 forks, an MIT license badge, and a README titled 'Kandinsky 6.0: A family of diffusion models for Video + Audio Generation' with badges for KANDINSKYLAB, REPORT, DIFFUSERS and COMFYUI; recent commits include 'README update', 'Added source code', 'Some improvements for just generate' and 'Keep ComfyUI user documentation in README'.

이 저장소는 또한 두 개의 ComfyUI 노드 — kandinsky6와 kandinsky6-sr — 를 제공하며, 이는 ComfyUI Manager를 통해 설치할 수 있습니다. 그리고 두 개의 Hugging Face Spaces도 제공합니다: 하나는 Pro distill 체크포인트용이고 다른 하나는 비디오 초해상도 데모용입니다. CLI, ComfyUI 노드, diffusers 번들, 그리고 이제 vLLM-Omni 파이프라인까지 고려하면, 배포 범위는 대부분의 오픈 비디오 모델이 한 분기에 걸쳐 해내는 것보다 3일 차에 더 넓습니다. 그 폭이 이번 주의 실제 이야기입니다: Sber는 데모가 딸린 논문이 아니라 하나의 패밀리를 공개했습니다.

A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.