
Tavus Griffin vs Alibaba Wan 2.7: 대화형 모델 대 생성형 모델
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
흔히 끌리는 비교 방식은 Tavus Griffin과 Alibaba Wan 2.7을 영상 초당 기준으로 비교하는 것이지만, 그런 비교는 할 수 없다. Wan 2.7에는 공개된 요금표가 있다 — Alibaba Cloud의 국제 싱가포르 엔드포인트에서 1080p 기준 분당 $9.00이며, 베이징과 도쿄 티어는 더 저렴하다 — 그리고 Tavus Griffin에는 요금표가 전혀 없다. Griffin-Lite가 2026년 10월 1일, 요청 양식을 통해야 하는 엄선된 신뢰 테스터를 대상으로 한 연구 프리뷰로 출시되었기 때문이다. 두 제품이 공유하는 것은 한 단어, 영상이다. 그 외에는 둘은 서로 다른 질문에 대한 답이다. 하나는 대화에서 다음에 무엇이 일어나야 하는지를 묻고, 다른 하나는 설명된 장면이 어떻게 보이는지를 묻는다. 흥미로운 비교는 품질이 아니라, 각각이 무엇인가를 만들어 내기 전에 여러분에게 무엇을 요구하는지, 그리고 여러분이 무엇을 돌려받는지이다.
차이는 해상도가 아니라 루프에 있습니다
Wan 2.7은 프롬프트로부터 클립을 하나씩 생성합니다. 설명을 쓰면 영상 한 조각이 나오고, 그것을 살펴본 뒤 또 다른 설명을 씁니다. Wan 2.7은 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스-투-비디오, 비디오-편집의 네 가지 모델로 구성된 제품군이며, 상호작용은 근본적으로 트랜잭션적입니다: 입력, 렌더링된 출력, 그리고 그것을 유지할지에 대한 결정입니다. 무엇을 요청할지 아직 결정하고 있는 동안에는 그 어떤 것도 실행되지 않습니다.
Griffin은 반대 방식으로 설계되었습니다. 이는 전이중 시스템으로, 오디오와 비디오를 입력받아 1초 미만 간격으로 대화를 재평가하는 연속 대화 모델링 엔진입니다. 침묵할지, 신호를 보낼지, 맞장구를 칠지, 발언권을 가져갈지 결정하고, 표현 제어를 출력해 스트리밍 음성 생성기와 스트리밍 비디오 생성기를 병렬로 구동합니다. 단일 참조 사진으로부터 320ms 청크 단위로 720p를 생성하며, 중요한 주장은 문장 중간에 내린 결정이 같은 미니 턴 안에 목소리와 얼굴에 나타난다는 것입니다. 이에 대한 벤치마크는 클립 순위표가 아닙니다. 바로 여러분이 그것에 끼어들 수 있는지 여부입니다.
간단히 말해: Wan 2.7은 "이 장면이 움직이면 어떻게 보이는가?"라는 질문에 답한다. Griffin은 "그 사람이 방금 말을 멈췄다는 점을 감안할 때, 이 얼굴과 목소리는 앞으로 200밀리초 동안 무엇을 해야 하는가?"라는 질문에 답한다.
가격, 하나가 있는 한쪽에
Wan 2.7의 공개 요금은 생성된 영상 1초당 기준이며, 요금제는 제품군 전체에서 일률적이지 않은데, 이는 대부분의 비교 페이지가 건너뛰는 세부 사항입니다.
• wan2.7-t2v 및 wan2.7-i2v — 출력 길이에 대해서만 과금됩니다. 국제 싱가포르: 720p에서 초당 $0.10, 1080p에서 초당 $0.15이며, 이는 리더보드에 나타나는 분당 $9.00 수치입니다. 베이징과 도쿄는 동일한 작업에 대해 초당 $0.086과 $0.143을 제시합니다.
• wan2.7-r2v(레퍼런스 투 비디오) — 입력 비디오 길이를 기준으로 청구되며, 최대 5초로 제한되고, 여기에 출력분이 더해집니다. 5초짜리 레퍼런스를 15초 생성에 넣으면 20초분이 청구됩니다.
• wan2.7-videoedit — 출력물에 대해서만 과금되며, 입력 영상은 무료입니다.
그 숫자들 옆에는 두 가지 라이프사이클 사실이 나란히 있어야 합니다. Alibaba는 자사 Bailian 및 Qwen Cloud 서비스에 2026년 9월 23일까지 적용되는 한시적 30% 출시 할인을 걸었지만, 이제 지났습니다. 그리고 Alibaba Cloud의 Model Studio 지원 종료 공지(ID 118434)는 2026년 10월 10일에 여러 구형 모델을 오프라인으로 전환하며, 여기에는 wan2.7-r2v와 wan2.7-image가 포함됩니다. 이는 세대 자체의 지원 종료가 아니라 변형 모델 수준의 종료입니다. wan2.7-t2v와 wan2.7-i2v는 여전히 목록에 남아 있고 요금도 유효하며, 페이지는 9월 11일에 업데이트된 최신 상태입니다. 하지만 reference-to-video 때문에 2.7을 살펴보고 있었다면, 그 경로에는 종료 날짜가 정해져 있습니다.
Griffin과의 비교에는 정직한 대목이 하나 있습니다: Wan 2.7의 가격 옆에 놓을 가격은 없습니다. Tavus가 가격을 전혀 공개하지 않았기 때문입니다. Griffin-Lite는 Tavus 플랫폼에 없고, 발표문은 현재 고객 사용용으로 제공되지 않을 것이라고 밝히며, 회사 자신의 맺음말은 Griffin이 안전하게 출시할 방법을 찾아낸 뒤에 나올 것이라는 것입니다. 초당 요금도, 요청당 요금도, 무료 티어도, 엔터프라이즈 티어도 없습니다. Griffin의 가격을 인용하는 사람은 그것을 지어내는 것입니다.
품질 점수: 충족하지 못하는 두 개의 보드
두 모델은 완전히 서로 다른 평가 도구로 채점되었기 때문에, 두 모델 간의 Elo 비교는 존재하지 않습니다.
Wan 2.7은 Artificial Analysis의 비디오 아레나에 두 개의 항목을 갖고 있으며, 그 둘은 같은 위치에 있지 않습니다 — 이것이 Wan 2.7에 대해 숫자 하나만 인용할 때의 함정입니다. 그곳의 Elo는 블라인드 쌍대 인간 선호 투표에서 도출되는데, 이는 짧게 생성된 클립을 위해 만들어진 방법론이며, 아래 두 수치는 모두 2026년 10월 2일에 확인한 보드에서 나온 것입니다.
• 텍스트-투-비디오(오디오 포함) 부문의 Wan2.7-260612(6월 빌드) — 13–14위, Elo 1,032(±10), 4,645표 기준, $9.00/분.
• Wan 2.7(4월 빌드)의 이미지 투 비디오(오디오 포함) — 34개 중 12위, 4,571표 기준 Elo 1,077, 분당 $9.00, 대략 같은 투표 수를 가진 리더보드이면서도 이를 상당히 더 높은 순위에 올려놓는다.
• Wan 3.0, 더 새로운 형제 모델 — 텍스트-투-비디오에서 Elo 1,157로 1위, 이미지-투-비디오에서 1,164로 6위, 둘 다 분당 $12.00. 이것은 Wan 2.7을 무엇과 비교하기 전에 알아둘 가치가 있는 숫자입니다: Alibaba의 자체 차세대 모델은 테이블 최상위권이고 2.7은 중위권 빌드입니다.

Griffin은 NVIDIA의 VideoFDB에서 평가됩니다. VideoFDB는 NVIDIA가 2026년 9월에 독립적으로 구축하고 0~5점 루브릭에 따라 언어 모델 심사자를 사용해 채점한 전이중 오디오-비주얼 대화용 벤치마크입니다. Griffin-Lite는 생성 트랙에서 3.83점을 기록했으며, 이는 3.92점의 인간 참조 및 다음으로 높은 공개 시스템의 2.80점과 비교됩니다. 지각 트랙에서는 4.20점의 인간 참조와 비교해 3.73점을 기록했습니다. Tavus는 또한 H100s에서 공개된 네 가지 스트리밍 확산 베이스라인과 비교해 생성기의 실제 오디오→비디오 지연 시간이 0.43초라고 보고합니다.
두 수치 세트 모두 타당하며, 어느 쪽도 다른 맥락으로 그대로 옮겨갈 수는 없다. 아레나의 Elo는 클립 선호도에 대한 투표 집계이고, VideoFDB는 대화 행동에 대한 심사위원의 루브릭 점수다. 둘 사이에는 연결 다리가 없으며, 저표본 함정은 반대 방향으로도 작동한다. Wan 2.7에 대한 아레나의 ±10 구간은 충분히 넓어서 이웃 모델 대비 위치가 촘촘하게 확정되지 않으며, 5점 루브릭에서 NVIDIA의 인간 대비 0.09점 생성 격차는 "인간 수준"이 아니라 "인간 참조에 가깝다"고 읽는 것이 정직할 만큼 작다. 지각 비교 또한 동일 조건 비교가 아니다. Griffin이 앞선다고 배치된 여러 시스템, 이를테면 OpenAI의 gpt-realtime과 MiniCPM-o 4.5는 오디오 전용 구성으로 점수가 매겨진 반면, Griffin은 영상도 지각한다. 0.29점 우위의 일부는 눈이 있다는 점을 측정한 것이다.
각자 당신에게 필요한 것
바로 여기에서 비교가 유용해집니다. 왜냐하면 입력이 곧 제품이기 때문입니다.
• 입력 — Wan 2.7은 텍스트, 이미지, 비디오, 오디오를 입력받습니다. Griffin은 카메라와 마이크를 통해 실시간 인물을 입력받으며, 요청에 따라 클립을 생성하는 기능은 전혀 없습니다.
• 출력 — Wan 2.7은 비디오 파일을 생성하며, 생성당 2~15초, 최대 1080p, 네이티브 오디오를 지원합니다. Griffin은 지속적인 대화를 생성합니다: 720p 비디오를 25 fps로 320 ms 청크 단위로 실시간 생성하고 디코딩되는 대로 재생합니다.
• 무엇이 이를 제어하는가 — Wan 2.7은 프롬프트와 최대 5개의 피사체 이미지 및 5개의 참조 클립으로 제어되며, 요청당 참조 자산 10개라는 상한 내에서 작동합니다. Griffin은 사람이 하는 행동, 즉 멈춤, 시선을 돌림, 제스처, 끼어들기에 의해 제어됩니다.
• 시간 범위 — Wan 2.7의 작업 단위는 최대 15초짜리 클립 하나이며, 이를 당신이 이어 붙여 완성합니다. Griffin의 작업 단위는 대화입니다. 그래서 이 아키텍처는 더 긴 단일 생성을 위해 애쓰는 대신 드리프트를 해결해야 했습니다 — 자체 생성 이력으로 학습해 긴 롤아웃에서도 안정적으로 유지되는 자기회귀 생성기로의 3단계 증류를 통해서요.
• 출력 컨테이너 — Wan 2.7은 당신이 소유하고 편집, 색보정, 배포할 수 있는 파일을 돌려줍니다. Griffin은 렌더링된 세션을 돌려줍니다. 편집할 파일이 없습니다. 픽셀은 참조 사진과 모델 자체의 이력으로부터 청크 단위로 생성되며, 배경과 그림자, 그리고 사람이 앉아 있는 의자까지 생성의 일부이기 때문입니다.
언급할 만한 구조적 차이가 하나 있습니다: Wan 2.7의 비용은 출력 길이에 따라 달라지고, 품질은 프롬프트가 얼마나 구체적인지에 따라 달라집니다. Griffin의 비용은 측정되지 않았고, 품질은 상대방이 얼마나 자연스러운지에 따라 달라집니다. 하나는 더 나은 브리프를 작성해서 개선할 수 있고, 다른 하나는 실제 사람들과 함께 사용해야만 개선할 수 있습니다.

레퍼런스와 일관성, 두 디자인이 충돌하는 지점
Wan 2.7은 제공된 레퍼런스를 통해 피사체 일관성을 제어합니다: 피사체 이미지 5장, 레퍼런스 클립 5개, 총 10개의 에셋입니다. 이는 사진적 접근 방식입니다 — 피사체가 어떻게 보이는지 보여주면 생성 전반에 걸쳐 그 모습을 유지합니다.
Griffin은 같은 대상을 정반대 방식으로 제어한다. 이는 하나의 참조 이미지로부터 실시간으로 모든 프레임의 모든 픽셀을 생성하며, 발표에서는 얼굴이 아니라 장면 전체를 제어한다고 분명히 밝힌다. 즉 팔과 손가락, 의자의 움직임, 드리우는 그림자와 뒤쪽 배경까지다. 이때 일관성은 환경을 합성 플레이트가 아니라 생성 대상으로 만듦으로써 달성된다.
두 접근 방식 중 어느 것도 엄밀히 더 낫지는 않으며, 실패하는 방식이 서로 다릅니다. 참조 조건부 생성은 긴 클립에 걸쳐 제공된 피사체로부터 멀어지는 드리프트로 인해 실패합니다. 자기회귀 이력을 사용하는 청크별 생성은 드리프트 처리가 잘못되면 긴 세션에 걸쳐 표류하여 실패하는데, 이는 바로 세 번째 증류 단계가 방지하기 위해 존재하는 실패입니다. 산출물이 특정 룩의 특정 인물일 때 Wan 2.7이 더 안전한 선택입니다. Griffin은 그 브리프를 두고 경쟁하지 않습니다.
안전, 출처 및 릴리스 태세
Wan 2.7에는 압축 후에도 살아남는 워터마크에 필적하는, 공개된 출처 추적 시스템이 없습니다. 발표문에서는 오디오 품질과 화면 텍스트 정확도를 여전히 개선이 필요한 영역으로 꼽았는데, 이는 안전성 문제라기보다는 충실도 측면의 유의 사항입니다.
Griffin의 안전성 스토리는 뒤집혀 있다: Tavus가 Griffin을 프리뷰로 유지하는 이유로 내세운 것은, 더 나은 인터페이스로 만들어 주는 바로 그 속성이 누군가에게 자신이 인간과 대화하고 있다고 믿게 설득하는 데도 더 뛰어나게 만든다는 점이며, 수치도 그 우려를 뒷받침한다. 회사 자체의 라이브 연구에서 참가자 54명 중 26명은 상대가 실제 사람이라고 믿었지만, 이전 Phoenix-4.5 / Raven-1 / Sparrow-2 스택에서는 41명 중 1명이었다. 의심한 참가자들은 대개 처음 20초 안에 의심하는 경향이 있었다. Tavus는 출시 전에 추가적인 정렬 및 고지 작업이 필요하다고 말하며, 고지 기능을 구축하고 있고, 안전 평가와 관련해 여러 조직과 협력하고 있다고 밝힌다. 그것은 누구든 이 모델에 관해 발표한 것 중 가장 실질적인 내용이며, 또한 구매할 제품이 없는 이유이기도 하다.
두 가지를 도구로 비교하는 사람이라면 누구나 알 수 있듯, 실질적인 결과는 간단하다. 하나는 필요할 때 생성할 수 있고 오늘 바로 출시할 수 있으며, 다른 하나는 평가 대상이고 그 출시는 벤더가 아직 해결하지 못한 문제에 달려 있다.
어느 것, 무엇을 위해
• 산출물이 푸티지라면 Wan 2.7을 선택하세요. 기존 소재에 대한 지시 기반 편집은 이 모델이 유난히 강하고 유난히 저렴한 작업입니다. 편집 변형은 출력에 대해서만 과금하고 입력 푸티지는 무료로 취급하기 때문입니다. 해당 reference-to-video 변형은 이를 선택하기 전에 10월 10일 단종과 견주어 확인해 볼 가치가 있습니다.
• 이번 분기에는 어떤 용도로도 Griffin을 선택하지 마십시오. 선택할 수 없기 때문입니다. 사람이 구분할 수 있는지 알아야 하거나, 로드맵이 영상 계층이 아니라 상호작용 계층에 의존한다면 접근 권한을 요청하십시오.
• 어느 한 모델이 아니라 그 격차를 보라. Griffin의 등장으로 더 흥미로운 비교는 미래의 비교가 된다. 즉, 전체 대화를 생성하는 시스템과 전체 장면을 생성하는 스위트를 맞세우는 비교다. 둘 다 해내는 첫 제품이야말로 이 글을 다시 읽으며 견줘볼 가치가 있는 제품이 될 것이다.
라우터가 적합한 경우와 그렇지 않은 경우
이 두 모델은 모두 OrcaRouter 카탈로그에 없으며, 이는 이 섹션에서 무엇보다 먼저 짚고 넘어갈 만한 사실입니다. Wan 2.7은 알리바바 자체 플랫폼인 Alibaba Cloud의 Model Studio와 Qwen Cloud를 통해, 그리고 출시 후 이를 통합한 서드파티 창작 도구를 통해 이용할 수 있습니다. Tavus Griffin은 요청 양식을 통해서만 이용할 수 있습니다. 둘 중 하나라도 라우팅 가능해지면 제공업체 정가로 표시될 것입니다.
비디오 파이프라인에서 라우팅 문제에 해당하는 부분은 그 주변의 텍스트입니다. 숏 리스트, 프롬프트 확장, 캡션 생성, 품질 검토 요약, 그리고 레퍼런스-투-비디오 패스에 입력되는 트랜스크립트나 대화 작업은 모두 텍스트 호출이며, 이들은 OrcaRouter의 동일한 OpenAI 호환 엔드포인트에서 200개 이상의 다른 모델과 함께 실행됩니다(제공사 정가에 0% 마크업이 추가된 가격으로), 따라서 벤더 가격 인하는 계약 주기를 거친 뒤가 아니라 같은 날 바로 반영됩니다. 값싼 모델을 대량 패스에, 프런티어 모델을 최종 패스에 나눠 쓰는 것은 두 번째 벤더 관계를 맺는 일이 아니라 그곳에서의 설정 변경일 뿐입니다 — 이는 생성 레이어에도 적용되는 것과 같은 논리인데, 생성 레이어를 호출할 수 있게 되면 말이죠.
지켜볼 것: Wan 2.7 제품군의 참조 및 편집 변형이 10월 10일 Model Studio 종료 후에도 변경 없이 유지되는지, 그리고 Griffin의 안전 게이트가 엔드포인트가 포함된 공개 모델 카드를 내놓는지 여부다. 이 두 사건이야말로 이 비교를 설계 에세이에서 조달 결정으로 바꿔 놓을 것이다.

