
Kandinsky 6.0 Video vs Seedance 2.5: 논문 속 버전은 당신이 구매하는 버전이 아니다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 150 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
이번 맞대결에서 가장 많이 인용된 문장은 잘못된 모델과의 비교다. 2026년 10월 6일 MIT 라이선스로 가중치가 공개되면서 발표된 Kandinsky 6.0 Video 기술 보고서가 벤치마크한 대상은 Dreamina Seedance 2.0 — 이전 세대다. Seedance 2.5, 바이트댄스의 현재 비디오·오디오 모델은 2026년 7월 31일부터 출시되어 판매 중인 버전이다. 따라서 보고서가 Seedance가 "시각적 기준에서 선호되며, 전반적인 시각 품질, 아티팩트, 모션 사실성, 시각적 프롬프트 준수에서 통계적으로 유의미한 격차로 우세하다"고 결론 내릴 때, 그것은 오늘날 라이선스할 수 없는 빌드를 설명하는 것이며, 그 평가를 수행한 곳은 Kandinsky 6.0 Video를 만든 연구소다. 그 문장의 양쪽 절반은 모두 중요하며, 어느 쪽도 이 비교를 무시할 이유가 되지 않는다. 버전 격차는 이 비교가 알려줄 수 있는 것의 하한을 정하고, 그 틀은 무엇을 누구에게 신뢰해야 하는지 알려준다.
두 Seedance 버전 간에 무엇이 바뀌었나요?
2.0에서 2.5로의 단계는 리페인트가 아니며, 바로 그 점이 이 대체가 겉치레가 아닌 이유다. Seedance 2.5는 한 번의 패스로 최대 30초를 생성한다 — 보고서에 나온 모델 범위의 여섯 배이자, Kandinsky 6.0 Video의 고정된 5초의 여섯 배다. 여기에는 타임스탬프 수준의 타기팅과 영역 수준의 생성 후 편집이 추가되어, 전체를 재생성하는 대신 클립의 특정 구간이나 프레임의 일부에 변경을 적용할 수 있다. 한 요청에서 텍스트와 함께 약 30개의 이미지, 10개의 비디오, 10개의 오디오 클립을 참조 자료로 읽어들이는데, 이는 단일 마스크된 마지막 프레임을 사용하는 Kandinsky 6.0 Video와 대조적이다. 그리고 대사와 동기화된 오디오를 생성하는데, 이것이 이 둘이 같은 글에 함께 포함되는 유일한 이유다.
그 각각은 보고서의 평가가 테스트하지 않은 기능입니다. 따라서 시각 기준 결과는 Kandinsky 6.0 Video가 전체 시각 품질, 아티팩트, 모션 사실성 및 프롬프트 준수에서 Seedance의 이전 세대에 뒤처졌다는 것을 알려줍니다. 그것은 현재 빌드가 무엇을 할지 알려주지 않으며, 솔직한 가정은 새로운 세대가 자체 릴리스 노트에서 강조하는 축에서 더 나빠지지 않는다는 것입니다.
보고서 자체의 평가가 입증하는 것과 입증하지 않는 것
이 방법은 검토될 수 있을 만큼 충분히 철저하게 공개되어 있다. 동일한 프롬프트로 두 모델이 생성한 나란한 비교 쌍, 두 클립 모두의 익명화, 과제별 좌/우 위치 무작위화, 과제 순서 섞기, 시각 질문에 대해서는 오디오를 먼저 비활성화한 뒤 오디오 질문에 대해서는 활성화하기, 대칭적 동점 옵션과 기준을 판단할 수 없는 경우를 위한 명시적 N/A 옵션, 주석자 간 다수결 집계, 그리고 평가되는 각 기준마다 약 200개 이상의 쌍별 비교.
그 방법에서는, Seedance 2.0의 결과가 같은 보고서의 Kling 비교를 읽어본 사람이라면 누구나 익숙하게 여길 방식으로 갈린다. 시각적 기준은 유의성을 확실히 넘는 격차로 Seedance에 돌아간다. 오디오 영역은 훨씬 접전이다: 오디오-비디오 동기화는 거의 동등한 수준에 이르고, 음성 품질은 Kandinsky 6.0 Video Pro에 우위를 준다. 그 두 진술 사이에 전체 결정이 놓여 있다, 왜냐하면 그것은 가장 최신의 오픈 오디오-비디오 체크포인트가 클립이 보이는 방식에서는 측정 가능하게 뒤처지고, 그 안의 음성이 들리는 방식에서는 측정 가능하게 앞선다는 것을 의미하기 때문이다.
그 결과에 대한 한계는 흔한 것들이며, 어느 것도 그 결과를 치명적으로 훼손하지 않는다. 그것은 Kandinsky의 저자들이 직접 선택한 프롬프트와 그들이 모집한 평가자들을 통해 수행되었다. 어떤 공개 블라인드 아레나도 Kandinsky 6.0 Video를 전혀 채점하지 않으므로, 외부에서 낯선 사람의 프롬프트가 그 차이를 재현하는지 검증한 적이 없다. 그 보고서는 또한 자신이 견주고 있는 상한도 공개한다: 최대 5초 길이의 클립, SD 해상도의 기본 생성과 초해상도 단계를 거쳐 도달하는 Full HD, 그리고 시각적 품질과 전반적인 오디오 품질에서 가장 강력한 독점 시스템들에 비해 남아 있는 격차.
어떤 벤치마크도 포착하지 못할 세 가지 구조적 격차
길이는 가장 먼저, 그리고 가장 노골적으로 드러나는 차이다. Kandinsky 6.0 Video는 121프레임으로 학습 및 평가되고, 121프레임으로 추론을 실행하며, 24fps에서 5초 분량이고, 확장 모드 없이 제공된다 — 30초짜리 결과물은 6번의 생성, 5번의 이어 붙이기, 그리고 당신이 감당해야 할 연속성 위험이다. Seedance 2.5는 30초를 한 번의 패스로 처리한다. 단일 대화 주고받기, 제품 시연, 또는 이음새가 눈에 띌 수밖에 없는 그 어떤 경우든, 이는 벤치마크 차이가 아니다. 작업이 한 번의 렌더로 끝나는지, 아니면 조립 단계가 필요한지의 차이다.
두 번째는 레퍼런스 컨디셔닝인데, 그 비대칭이 극명하다. Kandinsky 6.0 Video는 레퍼런스 이미지 하나를 마스킹된 테일 프레임, 즉 보간해 나아갈 키프레임으로 적용한다. Seedance 2.5는 약 30장의 이미지, 10개의 비디오 클립, 10개의 오디오 클립으로 이루어진 작업 세트를 하나의 컨텍스트로 받아들인다. 시퀀스 전반에 걸친 캐릭터 일관성, 무드 보드로부터의 스타일 전이, 기존 클립에서 이어받은 퍼포먼스 — 이런 것들은 레퍼런스 개수가 가능하게 만드는 작업 부하이며, 단일 프레임 모드는 시도조차 하지 않는다.
세 번째는 편집 가능성이며, 이는 단일 샷이 아니라 워크플로를 바꾸는 요소입니다. 영역 수준 및 타임스탬프 수준 편집은 결함이 있는 3초 구간을 제자리에서 수정할 수 있다는 뜻입니다. Kandinsky 6.0 Video에는 편집 인터페이스가 없습니다 — 잘못된 5초는 재생성되며, 그것이 다른 네 개와 연결된 경우 연결부도 다시 고려됩니다. 재렌더링 습관에 비용을 산정하는 팀은 그 차이를 나중에 발견하기보다 모델 선택에 반영해 비용을 산정해야 합니다.
• 길이 — Kandinsky 6.0 Video: 5초 고정, 24fps에서 121프레임, 확장 모드 없음. Seedance 2.5: 단일 패스로 최대 30초.
• 레퍼런스 컨디셔닝 — Kandinsky 6.0 Video: 이미지 하나를 마스킹된 마지막 프레임으로 적용. Seedance 2.5: 요청당 이미지 약 30개, 비디오 10개, 오디오 클립 10개.
• 편집 — Kandinsky 6.0 Video: 없음; 재생성 후 재결합. Seedance 2.5: 타임스탬프 수준 타기팅 및 영역 수준의 생성 후 편집.
• 해상도 — Kandinsky 6.0 Video: 512×768의 SD, 내장된 초해상도 단계를 거쳐 Full HD 1920×1080. Seedance 2.5: 모드에 따라 다르며, 클립당 가격은 선택한 해상도에 따라 결정됩니다.
• 오디오 — Kandinsky 6.0 Video: 립싱크를 지원하는 44 kHz, 화면과 함께 생성. Seedance 2.5: 대화를 포함한 동기화 오디오, 비디오와 함께 생성.
• 가중치 — Kandinsky 6.0 Video: MIT, Lite 3B 및 Pro 29B, 코드와 diffusers 통합 포함. Seedance 2.5: 없음.
서로 환산되지 않는 두 미터
Seedance 2.5는 토큰으로 계량되며, 480p의 5초 클립은 약 $0.51, 720p는 약 $1.16에 달합니다. 이를 초당 요금이 아니라 이런 방식으로 말하는 이유는 토큰 수가 영상 분량에 비례해 늘어나기 때문입니다. 따라서 30초 생성은 고정 요금으로 30초를 쓰는 것이 아니라, 동일 설정에서 5초 생성의 6배에 해당하는 토큰을 사용합니다. 그리고 편집 작업은 해당 작업이 건드리는 분량을 기준으로 가격이 책정됩니다. 습관적으로 재생성하는 파이프라인이라면, 과금 계량기가 그러한 습관에 반응한다는 사실을 알게 될 것입니다.
Kandinsky 6.0 Video에는 요금 계량기가 없다. 살 것이 아무것도 없기 때문이다. 그 비용은 기계 한 대와 시간이며, 보고서가 그 시간을 제시한다. Pro Full HD 5초 클립 하나에 H100에서 약 402초의 작업 시간, RTX 5090에서는 854초, RTX 4090에서는 1,247초, 72.8 GiB 최대 할당 미만에서는 블록 오프로딩이 필요하고, 텍스트 인코더를 NF4로 양자화하는 16GB VRAM 프리셋도 있다. 보고서가 클립 자체를 바꾼다고 말하는 유일한 프리셋 변경이 바로 그것이다. 증류된 체크포인트는 평균 선호도 51% 대 49%로 전체 모델과 동등하게 측정되었고 어떤 기준도 통계적 유의성에 도달하지 못했는데, 바로 이 체크포인트가 그 수치들을 실행 가능하게 만든다.
• 5초당 비용 — Kandinsky 6.0 Video: 정가 없음; GPU 한 대로 그래픽 카드에 따라 6분에서 21분. Seedance 2.5: 480p에서 약 $0.51, 720p에서 $1.16(토큰 기준).
그 두 라인에서 서로 같은 기준으로 잴 수 있는 것은 아무것도 없으며, 이들을 하나의 수치로 환산하려는 흔한 시도—GPU 시간당 요금을 5초 클립으로 나누는 것—는 완전 가동, 유휴 시간 제로, 그리고 이미 보유한 카드를 암묵적으로 전제한다. 더 유용한 비교는 정성적이다: Seedance 2.5의 비용은 얼마나 생성하느냐에 따라 달라지고 멈추면 사라진다; Kandinsky 6.0 Video의 비용은 생성하든 하지 않든 발생한다.

각각에 접근할 수 있는 곳
두 모델 모두 OrcaRouter에 없으며, 어느 쪽 주장도 제기되고 있지 않습니다. Seedance 2.5는 벤더 자체 플랫폼과 여러 서드파티 서비스를 통해 접근합니다. Kandinsky 6.0 Video는 MIT 라이선스로 다운로드해 자체 하드웨어에서 실행하는 체크포인트입니다. 두 모델 모두 멀티모델 플랫폼에서 API 호출 한 번이면 된다고 알려 주는 페이지는 서로 다른 모델을 설명하는 것입니다.
칸딘스키나 시댄스 파이프라인에서 라우팅 계층을 여전히 언급할 가치가 있는 이유는, 이런 시스템이 호출 횟수 기준으로는 대부분 텍스트이고 비용 기준으로는 비디오라는 점이다. 프롬프트 확장은 샷 메모를 T2AV 모델이 기대하는 길고 구조화된 캡션으로 바꾼다. 대사는 립싱크 패스가 시도하기 전에 초안이 작성되고, 패스가 이를 망가뜨리면 다시 작성된다. 같은 비트에 대한 여섯 개의 후보 생성물을 검토하고 그중 하나를 선택한다 — 비디오 결과물에 대한 텍스트 판단이며, 이는 비싼 결정을 올바르게 내리는 가장 저렴한 방법이다. 200개 이상의 모델에 걸쳐 공급자 정가에 0% 마크업으로 그대로 전달되는 단일 OpenAI 호환 엔드포인트에서는 그 호출 비용이 공급자가 부과하는 만큼만 들 뿐 그 이상은 들지 않으며, 벤더가 요금을 변경한 다음 날에도 마찬가지다. 라우팅 DSL은 저렴한 검토자와 신중한 검토자가 같은 호출 지점에서 서로 다른 모델이어야 할 때 그 존재 가치를 입증하고, 자동 페일오버는 6개 클립 중 네 번째를 렌더링하는 도중에 죽어버린 캡션이 세션을 끝내는 대신 경로를 재지정해야 하기 때문에 그 가치를 입증한다.
무엇이 이 대진의 판도를 바꿀까
버전 격차가 모든 것을 말해주며, 동시에 그것을 해소할 가장 짧은 길이기도 하다. Seedance 2.5를 Kandinsky 6.0 Video와 맞붙여 실행하면, 보고서가 2.0을 상대로 기록한 시각 기준상의 손실이 커졌는지, 줄었는지, 아니면 역전됐는지 판가름 날 것이다 — 보고서는 그 답을 낼 수 없고, 보고서 작성자들도 그럴 방법이 없었다. 당장은, 방어 가능한 입장은 어느 쪽 마케팅이 바라는 것보다 좁다: 해당 모델 자체 연구소가 공개한 증거에 따르면, Seedance는 클립이 어떻게 보이는지에서 앞서고 Kandinsky 6.0 Video는 그 안의 발화가 어떻게 들리는지에서 앞서며, 그 주장이 기대는 Seedance 버전은 당신이 구매하게 될 버전보다 한 세대 뒤처져 있다.
그에 맞게 선택하십시오. 작업이 길거나 참조가 많거나 편집 주도라면, 품질이 끼어들기도 전에 구조적 격차가 판가름합니다. 작업이 첫 테이크부터 대사가 제대로 들려야 하는 5초짜리 토킹 샷이라면, Kandinsky 6.0 Video의 측정된 우위는 바로 그 기준에 있습니다 — 그리고 MIT 라이선스 덕분에 답은 누구의 로드맵에도 달려 있지 않습니다. 주시할 것은 리더보드가 아닙니다. 그것은 그 보고서가 끝내 실행하지 못했던 비교를 다시 돌려보는 일입니다.


값비싼 호출을 올바르게 수행하는 가장 저렴한 방법: 단계별로 리뷰어를 교체하는 라우팅 DSL, 자동 페일오버를 갖춰 죽은 캡션 때문에 클립을 잃는 일이 없도록 합니다.
