‘Kandinsky 6.0 Video vs Alibaba Wan 2.7’이라고 적힌 생성된 타이틀 카드에는 ‘오픈 웨이트 대 4개 모델 제품군’이라는 부제가 붙어 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 있습니다.
Guides & Insights

Kandinsky 6 대 Alibaba Wan 2.7: 4개 모델 제품군에 맞선 오픈 웨이트

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Kandinsky 6.0 Video는 다운로드할 수 있는 29B 파라미터 체크포인트와 그 대가로 5초짜리 클립을 제공합니다. Wan 2.7은 네 가지 작업별 변형, 최대 15초 클립, 초당 청구서를 제공합니다. 이 두 문장이 바로 비교이며, 이를 적어 둘 가치가 있는 이유는 대부분의 일대일 비교 페이지가 시각적 품질로 둘을 비교하는데, 그 품질에서는 어느 쪽도 결판을 낼 독립적인 점수가 없고, 정작 두 모델이 진정으로 갈라지는 축은 건너뛰기 때문입니다. 그 축이야말로 각 모델이 당신에게 가져오기를 기대하는 것입니다.

Sber의 Kandinsky Lab은 2026년 10월 첫째 주에 Kandinsky 6.0 Video를 MIT 라이선스로 오픈소스화했습니다. Pro(29B)와 Lite(3B) 두 가지 크기로, 코드, 체크포인트, diffusers 통합을 포함합니다. Alibaba의 Wan 2.7은 2026년 4월 3일 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스-투-비디오, 비디오-편집을 아우르는 제품군으로 출시되었으며, 생성된 비디오 1초당 과금됩니다. 이 둘 중 하나는 직접 실행하는 모델이고, 다른 하나는 구매하는 서비스입니다. 흥미로운 질문은 어느 쪽이 더 나은가가 아니라, 어느 쪽이 그 작업에 맞는 형태인가입니다.

그들이 직접 비교될 수 있는 단 하나의 축

두 모델 모두 소리가 포함된 영상을 생성합니다. 나중에 음악을 입히는 영상이 아닙니다. 이는 들리는 것보다 드문 일이며, 이 두 모델이 애초에 함께 언급되는 이유이기도 합니다 — 이 분야의 대부분은 여전히 무음 MP4를 만들고 오디오는 별도 단계로 남겨 둡니다.

Kandinsky 6.0 Video는 듀얼 스트림 CrossDiT로 이를 구현합니다. 비디오 스트림은 Kandinsky 5.0 Video 체크포인트에서 초기화되고, 오디오 스트림은 대규모 오디오 코퍼스로 처음부터 학습되며, 양방향 교차 어텐션이 이 둘을 연결합니다. 이는 연속 사전 학습 단계 이후 공동으로 학습됩니다. 출력은 립싱크가 적용된 44 kHz 오디오이며, 텍스트 프롬프트(T2AV) 또는 참조 이미지(I2AV)로부터 생성됩니다.

Wan 2.7은 네이티브 오디오도 생성하지만, 그 메커니즘을 같은 수준으로 자세히 공개하지는 않는다. 자체 문서에서는 오디오 품질과 화면 텍스트 정확도를 아직 개선이 필요한 두 영역으로 명시한다 — 이는 검토자가 추측한 것이 아니라 공급업체가 직접 말한 것이므로, 계속 염두에 둘 만한 충실도상의 유의점이다.

닮은 점은 거기까지입니다. 이 선 아래에 있는 모든 것은 순위가 아니라 차이입니다.

5초 대 15초, 그리고 그것이 샷 리스트에 미치는 영향

Kandinsky 6.0 Video는 121프레임, 24fps — 5초 — 로 학습되었으며, 이번 릴리스에는 확장 모드가 없습니다. 논문, vLLM-Omni에 병합된 서빙 레시피, 저장소의 성능 표는 모두 이 단일 클립 길이를 기준으로 만들어졌습니다. 30초짜리 작품은 여섯 번의 생성과 다섯 번의 이어 붙이기로 이루어지며, 그 이음새는 직접 감춰야 합니다.

Wan 2.7은 한 번의 생성으로 2초에서 15초까지 커버하며, 이는 요청별로 결정됩니다. 토킹 헤드 클립, 제품 삽입 장면 또는 단일 카메라 무브의 경우, 그 차이는 편의성의 문제가 아니라 한 번의 렌더와 조립 단계 하나의 차이입니다. 샷별로 만드는 작업에서는 5초가 일반적인 작업 단위이며 그 격차는 대부분 사라집니다.

• 최대 클립 — Kandinsky 6.0 Video: 5초, 고정, 24fps에서 121프레임. Wan 2.7: 2–15초, 요청별 설정.

• 해상도 — Kandinsky 6.0 Video: 별도의 초해상도 모델을 통한 SD, HD 및 Full HD(1920×1080). Wan 2.7: 최대 1080p.

• 레퍼런스 컨디셔닝 — Kandinsky 6.0 Video: 이미지 1개, 마스크 처리된 마지막 프레임으로 적용됩니다. Wan 2.7: 최대 5개의 피사체 이미지와 5개의 레퍼런스 클립, 요청당 10개 에셋.

• 작업 — Kandinsky 6.0 Video: T2AV 및 I2AV. Wan 2.7: 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스-투-비디오, 비디오 편집이 별도 변형과 별도 과금으로 제공됩니다.

• 가중치 — Kandinsky 6.0 Video: MIT, 다운로드 가능, Pro 및 Lite. Wan 2.7: 없음.

네 가지 작업 대 두 가지 모드

비교표에서 Wan 2.7이 저평가받는 부분은 작업 수입니다. 그것은 품질에 대한 주장이 아니라 범위에 대한 주장이기 때문입니다. 변경 사항을 설명하면 동일한 장면이 그 변경이 적용된 채 돌아오는 기존 영상의 지시 기반 편집은 Kandinsky 6.0 Video가 전혀 시도하지 않는 작업 부하입니다. 제공된 퍼포먼스가 생성된 피사체를 이끄는 레퍼런스 투 비디오 역시 두 모드에 속하지 않습니다.

과금은 범위를 반영한다. Wan 2.7의 텍스트-투-비디오 및 이미지-투-비디오 변형은 출력 길이에만 과금된다 — 국제 싱가포르 엔드포인트에서 720p는 초당 $0.10, 1080p는 초당 $0.15이며, 베이징과 도쿄는 동일 작업에 초당 $0.086과 $0.143을 책정한다. 레퍼런스-투-비디오 변형은 입력 비디오에도 과금하며 최대 5초로 제한되므로, 5초짜리 레퍼런스로 15초 생성을 하면 20초 작업에 대해 과금된다. 비디오 편집 변형은 출력에만 과금하고 입력 영상은 무료로 취급한다 — 이는 제품군에서 단연 가장 유리한 요율이며, 2.7이 진정으로 저렴한 곳이 편집인 이유이기도 하다.

그 수치 옆에 함께 놓아야 할 두 가지 수명 주기 관련 사실이 있습니다. 알리바바는 자사의 Bailian과 Qwen Cloud 서비스에 한시적인 30% 출시 할인을 적용했으며, 이 할인은 2026년 9월 23일에 종료되었습니다. 별도로, 알리바바 클라우드의 Model Studio 종료 공지(ID 118434)에 따라 여러 구형 모델이 2026년 10월 10일에 오프라인으로 전환되며, wan2.7-r2v와 wan2.7-image가 그 목록에 포함됩니다. 이는 생성 자체의 종료가 아니라 변형 수준의 조치입니다 — wan2.7-t2v와 wan2.7-i2v 모두 현재 요금으로 목록에 남아 있습니다 — 하지만 2.7을 살펴본 이유가 레퍼런스-투-비디오(reference-to-video)였다면, 그 경로에는 나흘밖에 남지 않았습니다.

독립 이사회가 보여 주는 것과 보여 주지 않는 것

이 두 모델을 비교하는 대부분의 글이 슬그머니 속임수를 쓰는 부분이 바로 여기이므로, 무엇이 실제로 존재하는지 정확히 따져볼 만하다.

Wan 2.7은 세 개의 개별 Artificial Analysis 비디오 리더보드에서 독립적인 점수를 받았는데, 각기 다른 것을 측정하기 때문에 서로 일치하지 않습니다:

• 텍스트-투-비디오 — Wan2.7-260612(6월 빌드)는 5,571표에서 Elo 1,030(±9)으로 13~14위에 자리하며, 분당 $9.00입니다.

• 이미지-투-비디오 — Wan 2.7(4월 빌드)은 4,571표에서 Elo 1,077(±8)로 12위이며, 분당 $9.00입니다.

• 비디오 편집 — Wan 2.7은 17,988표에서 Elo 1,077(±5)로 5위이며, 분당 $16.90입니다.

그 세 가지를 함께 읽으면 유용한 결론은 "Wan 2.7이 비디오에서 12위"라는 것이 아니다. 그것은 이 모델이 각각을 위해 만들어진 리더보드에서 생성보다 편집에서 현저히 더 강하며, 이 모델에 단일 숫자를 인용하는 것은 어느 방향으로든 실수라는 점이다.

Kandinsky 6.0 Video는 그중 어느 것에서도 점수를 받지 못했다. 공개된 근거는 벤더 측 자료이며, 그것이 정확히 무엇인지 밝힐 가치가 있다: 실험실이 평가한 세 시스템 중 Pro가 음성 품질, 오디오 미학, 텍스트-비디오 및 오디오-비디오 정렬, 립싱크 정확도, 비동기화, 시각적 사실성에서 앞선다고 보고한 VABench 실행 — 나머지 둘은 자체 Lite 모델과 LTX 2.5이다 — 그리고 기준당 약 200건 이상의 쌍별 비교를 포함한 실험실 주관의 나란히 비교 인간 평가로, 여기서 Pro는 Kling 2.6 및 Veo 3.1 Fast와 경쟁력이 있고, 시각적 기준에서는 MiniMax H3 및 Dreamina Seedance 2.0에 뒤처지며, 음성 품질과 오디오-비디오 동기화에서는 경쟁력을 유지한다. 그중 어느 것도 Sber 외부에서 재현되지 않았고, 그중 어느 것도 블라인드 공개 리더보드의 Elo가 아니다. 올바른 해석은 "유망하지만 검증되지 않음"이지, "Veo와 맞먹음"이 아니다.

각각의 비용은 각 측이 사용하는 용어로 표시됩니다

두 가지 가격 책정 모델은 하나의 숫자로 환원될 수 없으며, 그렇지 않은 척하는 것이 바로 팀이 잘못된 결정을 내리는 방식이다.

Wan 2.7은 초당 요금제입니다. 15초 1080p 클립은 약 $2.25입니다. 30초짜리 작품은 두 번의 생성에 편집을 더한 것으로 — $4.50의 원본 생성 비용에 어셈블리 시간이 더해지며, 편집 변형이 작업을 처리하면 더 적게 들 수 있습니다. 입력에 대해서는 비용을 청구하지 않기 때문입니다.

Kandinsky 6.0 Video는 요금이 전혀 없습니다. 구매할 서비스가 없기 때문입니다. 대신 사용자가 제공하는 GPU 시간당 비용이 있습니다. 저장소 자체의 수치가 하한을 설정합니다: Pro Full HD 5초 클립은 워밍업 후 H100에서 약 402초의 작업 시간이 걸리고, RTX 5090에서는 854초, RTX 4090에서는 1,247초가 걸립니다. 증류된 체크포인트 — 논문에서 전체 모델과 동등한 수준으로 측정되었으며, 평균 선호도는 51% 대 49%이고 어떤 기준도 유의성에 도달하지 못했습니다 — 가 실제로 서비스하게 될 대상입니다. 최대 할당량이 72.8 GiB 미만이면 블록 오프로딩이 필요하며, 16 GB 프리셋은 텍스트 인코더를 NF4로 양자화하는데, 논문에서는 이것이 클립 자체를 변경하는 유일한 프리셋 변경이라고 확인했습니다.

쉽게 말해: Wan 2.7의 비용은 예측할 수 있는 청구서의 한 줄이다. Kandinsky 6.0 Video의 비용은 당신이 소유한 기계, 5초마다 몇 분씩 걸리는 렌더링, 그리고 파인튜닝을 할 수 있는 선택지—의무가 아닌—다.

이 안에서 라우터가 어디에 위치하는지

OrcaRouter는 Kandinsky 6.0 Video나 Alibaba Wan 2.7을 제공하지 않으며, 여기서 어느 쪽 주장도 하지 않습니다. Kandinsky는 직접 다운로드해 실행하는 것이고, Wan 2.7은 Alibaba 자체 플랫폼을 통해 접근합니다. 두 모델 중 하나로 구축된 파이프라인이 라우터에 필요로 하는 것은 렌더를 둘러싼 텍스트 계층입니다. 즉, 샷 설명을 이 모델들이 훈련받은 길거나 짧은 캡션으로 바꾸는 프롬프트 확장, 이미지-투-비디오 패스에 공급되는 캡션 및 대사 작업, 그리고 여러 생성 결과 중 어느 것이 최종본인지 결정하는 리뷰 요약입니다. 이들은 일반적인 텍스트 호출이며, 200개 이상의 모델에 걸쳐 하나의 OpenAI 호환 엔드포인트에서 실행되며, 공급자 정가가 0% 마크업으로 그대로 전달되며, 따라서 공급업체 인하가 계약 주기를 기다린 뒤가 아니라 같은 날 바로 적용됩니다. 자동 장애 조치는 채팅 워크로드에서보다 여기에서 더 가치가 있습니다. 왜냐하면 Q&A 세션 4분 시점에 실패하는 캡션 호출은 렌더를 잃는 대신 경로를 재지정해야 하기 때문입니다.

결정 사항, 각각 한 줄로

결과물이 사운드가 있는 완성된 클립이고 GPU를 직접 소유하고 싶지 않다면, Wan 2.7은 둘 중에서 그것을 제공하는 유일한 제품이며, 사용 가능한 증거로 볼 때 그 편집 변형은 제품군에서 가장 강력한 것입니다. reference-to-video를 선택하기 전에 10월 10일 지원 종료를 확인하세요.

결과물이 당신이 통제하는 파이프라인이고, 5초 단위가 당신의 샷 리스트에 맞으며, 파인튜닝하거나 오프라인으로 실행하고 싶다면, Kandinsky 6.0 Video는 둘 중 이를 허용하는 유일한 모델입니다 — 그 대가는 소비자용 하드웨어에서 느린 렌더링과, 여전히 전적으로 해당 연구소 자체의 주장인 품질입니다. 그쪽에서 지켜볼 이벤트는 간단합니다: Elo입니다.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Alibaba Wan 2.7 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Tasks: text and image to AV', 'Reference input: one image', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Alibaba Wan 2.7 column reads 'Max clip: 2 to 15s', 'Resolution: up to 1080p', 'Tasks: four variants', 'Reference input: ten assets', 'Weights: none', 'Price: $0.10 to $0.15/s'. A footer reads 'Kandinsky figures vendor-reported; Wan pricing per Alibaba. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

마무리하기 전에 한 가지 비대칭은 짚고 넘어갈 만하다. 그것은 두 모델보다 오래 남을 것이기 때문이다. Wan 2.7의 상한은 계약적으로나 기술적으로 Alibaba가 정하는 것이며 — 제품군의 변형이 단종되거나 가격이 바뀌면, 당신의 파이프라인은 그 결정을 그대로 물려받는다. Kandinsky 6.0 Video의 상한은 당신 자신의 하드웨어이고, MIT 라이선스는 포크가 연구소의 로드맵보다 오래 살아남을 수 있음을 뜻한다. 카탈로그에서 모델이 사라지는 일로 피해를 입어 본 팀들은 선택한 날보다 1년 뒤에 그 차이에 더 큰 비중을 두는 경향이 있다.

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.