HeyGen Video vs Griffin을 위한 히어로 카드로, 세 개의 칩이 "HeyGen Video — 초당 $0.01", "Griffin — 요청 시 액세스", "HeyGen Video — 768p에서 5~15초"라고 표시되어 있으며, 여섯 개의 행이 있습니다: HeyGen 출시: 2026년 9월 30일; Griffin 발표: 2026년 10월 1일; HeyGen 가격: 초당 $0.01; Griffin 가격: 미공개; HeyGen 출력: 5~15초 클립; Griffin 출력: 라이브 세션. 푸터: "HeyGen Video는 2026년 9월 30일에 출시되었고, Griffin은 2026년 10월 1일에 프리뷰로 발표되었습니다."
Guides & Insights

Tavus Griffin vs HeyGen Video 1: 36시간 차이, 그리고 구매 가능한 것은 단 하나뿐

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 번의 출시가 서로 36시간 이내에 시장의 같은 구석에서 이루어졌고, 이 짝에서 가장 흥미로운 점은 달력이다. HeyGen Video는 2026년 9월 30일 출시되어 10월 내내 초당 $0.01에 제공되었으며, MiniMax H3에서 튜닝되어 식별자 heygen-video-1 아래에 배포되었다. Tavus Griffin은 2026년 10월 1일, 54명의 참가자 중 26명이 상대가 실제 사람이라고 믿은 실시간 대면 연구와 함께 발표되었으며, 요청 양식을 거친 엄선된 신뢰 테스터에게만 제공되고, 식별자도, 엔드포인트도, 가격도 없다. 둘 다 설득력 있는 인간을 생성하는 것에 관한 것이다. 솔직히 비교하는 이유는 Tavus Griffin과 HeyGen Video 1 중에서 구매자가 선택할 수 있다는 점이 아니라 — 오늘날 둘 중 하나만 구매할 수 있다 — 그 차이가 각각 무엇을 하도록 만들어졌는지, 그리고 생성된 인간의 1초가 실제로 어떤 가치가 있는지를 설명한다는 점이다.

하나는 클립을 팔고, 다른 하나는 대화를 판다

HeyGen Video는 사람을 다루는 데 유난히 뛰어난 범용 비디오 모델입니다. 프롬프트를 받거나, 프롬프트와 이미지 한 장, 또는 프롬프트와 최대 9개의 레퍼런스 이미지, 3개의 레퍼런스 비디오, 3개의 레퍼런스 오디오 클립을 받아, 480p 또는 768p, 24fps, 32kHz 스테레오 AAC 오디오로 생성된 대화, 앰비언스, 효과를 담은 5~15초 길이의 클립을 반환합니다. 세 가지 모드가 컨디셔닝을 담당합니다 — text_to_video, image_to_video, 그리고 reference_to_video, 즉 기본값 — 그리고 목록 순서가 프롬프트에서 지칭하는 레이블이 되므로, reference_images의 첫 번째 항목은 <Picture 1>입니다. 요청에 알 수 없는 필드가 있으면 무시되지 않고 거부되며, 시드는 부호 없는 32비트 정수로, 이를 고정하고 한 번에 한 절씩 변경하면 샷을 재현 가능하게 만듭니다. 이는 결정론적 엔벨로프를 갖춘 프로덕션 도구입니다.

Griffin은 그러한 속성 거의 전부를 뒤집는다. 단일 참조 사진으로부터 25 fps로 320 ms 청크 단위의 720p를 생성하고, 각 청크를 디코딩되는 즉시 재생하므로 지정할 클립 길이도, 돌려줄 파일도 없다. Continuous Conversational Modeling 엔진은 오디오와 비디오를 입력받아 1초 미만 간격으로 대화를 재평가하며, 침묵할지, 신호를 보낼지, 맞장구칠지, 발언권을 가져갈지 선택하고, 그 표현 제어는 스트리밍 음성 생성기와 스트리밍 비디오 생성기를 병렬로 구동한다. 문장 중간에 내린 결정은 같은 미니 턴 안에서 목소리와 얼굴에 드러난다. 프롬프트를 쓰는 것이 아니라 말을 거는 것이다. 그러면 그것은 멈춤, 시선을 돌림, 또는 끼어들기에 반응한다.

그렇기 때문에 둘 다 사람을 생성하더라도 이 둘은 서로 대체할 수 있는 것이 아니다. HeyGen Video는 묘사된 순간이 어떤 모습인지 질문받는다. Griffin은 다음에 무엇이 일어나야 하는지 질문받는다.

초를 살 수 있는 쪽에서, 각 초에 드는 비용

HeyGen Video의 출시 가격은 10월까지 초당 $0.01이며, HeyGen 자체 설명 문구에서는 이를 표준 $0.02에서 50% 할인이라고 설명합니다. 같은 페이지의 비용 차트에는 출시 프로모션 이전, 오디오 포함 768p 기준 초당 정가라고 각주가 달려 있는데, 이 차트는 이를 $0.03으로 제시합니다. 이는 벤더 자체의 출시 자료에서 설명 문구와 차트 사이에 50%의 격차가 있다는 뜻이며, HeyGen이 API 가격 페이지를 공개할 때까지는 $0.01이 실제 적용 중이므로 확정이고, 10월 이후 가격은 $0.02와 $0.03 사이 어딘가라고 보는 것이 안전한 해석입니다.

대량 작업 팀이 실제로 생각하는 단위인 1,000초—10초짜리 클립 100개—에 대한 숫자를 계산해 보세요:

• 10월 HeyGen Video — 초당 $0.01로 $10.

• 10월 이후 HeyGen Video — $0.02에 $20, 또는 차트의 $0.03에 $30.

• MiniMax H3, 튜닝의 기반이 된 베이스 모델 — MiniMax의 초당 0.08달러 정가 기준 80달러.

• Kling 3.0 Pro — $168, 초당 $0.168.

• Veo 3.1 — 초당 $0.40 기준 $400.

아르키메데스가 HeyGen 출시의 헤드라인인 이유는 폐기율 때문이다. 소셜 컷다운, 광고 변형, 제품 루프를 만드는 팀들은 출시하는 양보다 훨씬 더 많이 생성하며, 10초짜리 시도 하나에 10센트라면 후보작을 버리는 경제성이 완전히 달라진다. 문제는 상한선이다. 768p, 24fps는 2K 납품 포맷이 아니며, MiniMax H3는 MiniMax 자체 호스팅 API의 별도 재생성 모듈을 통해 초당 $0.13에 2K에 도달하는데, HeyGen Video에는 이에 상응하는 기능이 없다. 납품 목표가 768p를 넘는다면, 그 싼 1초는 당신에게 필요한 1초가 아니다.

그 목록에서 Griffin의 칸은 비어 있고, 그다지 희망적인 방식은 아니다. Tavus는 요금을 공개하지 않았는데, Griffin-Lite는 연구 프리뷰로서 자체 발표에 따르면 현재 고객 사용에는 제공되지 않으며 Tavus 플랫폼에도 없기 때문이다. 1,000초 모델에서는 기입할 것이 없다. Griffin에 대한 수치를 인용하는 사람은 그것을 지어내는 것이다.

품질 수치, 그리고 누가 평가하는가

이 두 모델 중 어느 것도 독립적인 점수를 가지고 있지 않으며, 두 공급업체 모두 차트를 제공하기 때문에 이 점은 미리 말해둘 만합니다.

HeyGen의 것은 HeyGen Video를 1000으로 정규화한 Elo 표로, 그다음 Dreamina Seedance 2.0이 955, H3 Max 제품군이 952에서 860까지 분포하고, Kling 3.0 Pro가 857, Veo 3.1이 744입니다. 각주가 거의 대부분의 역할을 합니다. 점수는 4,800표가 있는 Artificial Analysis Arena 쿼리의 내부 평가 세트에서 나왔으며, HeyGen 자체 점수는 더 간단한 비교를 위해 1000으로 정규화되었습니다. 벤더가 자사를 자체 차트의 맨 위에 정규화하는 것은 표현 방식의 선택이지, 자사가 앞선다는 증거는 아닙니다. 그 아래의 상대적 간격이 정보를 제공하는 부분입니다.

더 유용한 것은 맞대결인데, 이는 HeyGen이 자기가 만들지 않은 무언가를 상대로 시험하는 유일한 자리다. HeyGen은 블라인드 테스터들이 650표에 걸친 비교 가운데 55.8%에서 자사 모델을 차트에 오른 H3 Max post-train보다 선호했다고 밝힌다. 범위는 49~62%다. 그 범위가 정직한 디테일이다. 낮은 쪽 끝에서는 50%를 걸치므로, 벤더 자체 수치로도 그 경쟁자에 대한 선호가 노이즈와 뚜렷이 구분되지 않는다. 축별 분석은 특정 실패 프로필처럼 읽히는 방식으로 뒤섞여 있다 — 원본 이미지 충실도에서 65%, 타이밍에서 66%인 반면, 일관성에서는 43%, 음악에서는 45%다.

Griffin의 수치는 다른 누군가가 만든 도구에서 나온 것이며, 바로 이 점이 중요한 차이다. NVIDIA의 VideoFDB는 전이중(full-duplex) 오디오-비주얼 대화를 위한 벤치마크로 두 개 트랙에서 채점되며, NVIDIA가 이를 직접 만들고 공개된 루브릭에 따라 자체 심사자로 평가를 수행한다. Griffin-Lite는 생성 항목에서 5점 만점에 3.83점을 받았는데, 이는 인간 참조 3.92점과 공개된 차순위 시스템의 2.80점에 대비되는 점수이고, 인지 항목에서는 3.73점으로 인간 참조 4.20점에 대비된다. Tavus는 또한 H100에서 공개된 네 가지 스트리밍 확산(diffusion) 기준선과 비교해 생성기의 실제 오디오-투-비디오 지연 시간이 0.43초라고 보고한다. 단, 주의할 점은 여전히 남는다. 5점 척도의 언어 모델 심사 루브릭에서 인간과의 0.09점 차이는 '동등'이 아니라 '근접'이며, 인지 항목 우위의 일부는 비디오 입력 없이 작동하는 시스템과 비교해 측정된 것이다. 그러나 채점자는 벤더가 아니다.

• 독립적 품질 점수 — 둘 다 없다. 2026년 10월 2일 기준으로 HeyGen Video는 Artificial Analysis의 세 가지 비디오 보드 어디에도 등재되어 있지 않으며, Griffin도 마찬가지다. Griffin은 영원히 등재되지 못할 수도 있다: 짧은 클립에 대한 쌍별 선호도 투표로는 실시간 대화를 평가할 수 없기 때문이다.

같은 리더보드들은 실제로 기본 모델을 싣고 있다. MiniMax H3는 텍스트-투-비디오(오디오 포함)에서 Elo 1,139로 4위, 이미지-투-비디오에서 1,181로 2위이며, 둘 다 분당 $4.80이다. 따라서 HeyGen의 포스트트레인은 독립 아레나가 이미 최상위권으로 평가하는 기반 위에서 경쟁하고 있는데, 이는 HeyGen이 직접 공개하지 않은 모델에 유리한 가장 강력한 논거다.

A screenshot of the top of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026: Wan 3.0 first at Elo 1,157 and $12.00/min, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at Elo 1,139 with 7,496 votes and $4.80/min, MiniMax H3 Max (based on MiniMax H3) fifth at 1,134 with 5,510 votes, and FLUX 3 sixth at 1,127, with release months and per-minute API pricing columns visible.

둘 다 같은 이유로 저렴하거나 값을 매길 수 없다.

두 출시 모두의 밑바탕에 깔린 구조적 사실은 설득력 있는 인간을 만드는 일이 저렴해졌다는 것이며, 어느 회사의 원가 우위도 자사가 판매하는 것에서 비롯되지 않는다는 점이다.

HeyGen Video는 MiniMax가 자체 커뮤니티 라이선스로 가중치를 공개하며 출시한 MiniMax H3의 후속 학습 모델이다. 그로 인해 H3는 다른 기업들이 특화하고 재판매할 수 있는 토대가 되었고, HeyGen은 5주 만에 비즈니스 영상, 제품 데모, 교육, 부동산 투어라는 다른 버티컬을 위해 그렇게 한 두 번째 제품이다. 이러한 패턴이 HeyGen이 베이스보다 낮은 가격을 책정할 수 있는 이유다. HeyGen은 베이스 모델 비용을 떠안지 않으며, 베이스는 다른 누군가의 오픈 웨이트 공개물이기 때문이다.

Griffin은 정반대의 베팅이다. Tavus는 상호작용 자체를 중심으로 전체 시스템 — 코덱, 스트리밍 음성 생성기, 스트리밍 영상 생성기, 대화형 모델 — 을 구축했고, 긴 롤아웃이 드리프트하지 않도록 대규모 양방향 확산 교사 모델을 세 단계에 걸쳐 몇 단계짜리 자기회귀 생성기로 증류했다. 그것은 기댈 공개 기반이 없는 값비싼 연구이며, 출시가 게이팅된 이유의 그럴듯한 일부다: 그 아래에는 비용을 분산할 값싼 토대가 없다.

두 회사 모두 또한 서로 다른 방향에서 같은 불편한 지점에 도달한다. HeyGen 자체 문서에는 이 모델이 가장 취약한 부분이 나열되어 있는데, 이는 드문 일이며 읽어볼 가치가 있다: 화면상의 긴 텍스트, 꽃잎, 종이, 머리카락처럼 부드럽고 유기적인 움직임, 그리고 장비를 조립하거나 작동하는 것과 같이 가까이서 손으로 하는 작업이다. 이 모델은 짧고 한정된 샷—한 피사체, 한 장소, 한 동작, 고정되었거나 거의 움직이지 않는 카메라—에서 가장 뛰어나다. Griffin의 한계는 실패 모드 목록이 아니라 아직 해결되지 않은 안전 문제다: Tavus는 인간 상호작용 모델을 더 나은 인터페이스로 만드는 속성이, 사람에게 자신이 인간과 대화하고 있다고 설득하는 일에서도 더 뛰어나게 만든다고 분명히 밝히며, 공개 메커니즘을 구축하는 동안 프리뷰를 보류하고 있다고도 말한다.

구매자가 오늘 실제로 할 수 있는 일

HeyGen Video는 이제 호출할 수 있습니다. POST /v3/models/videos와 함께 x-api-key 헤더를 사용해 실행되며, 유료 API 키에서만 작동합니다. 다운로드 링크는 서명되어 만료되므로 폴링할 때마다 갱신되고, 호출은 작업당 한 번만 시도됩니다. HeyGen 자체에서도 이를 보장이 아닌 지연 시간 최적화로 취급하라고 안내합니다. 이번 달에 테스트해 본다면, 0.01달러 프로모션 초당 요금이 적용 중이고, 출력 상한은 768p이며, 프롬프트 모드는 실질적인 비용 레버입니다. 기본은 터보, 더 긴 처리에는 퀄리티, 텍스트를 그대로 전송하려면 비활성화하세요.

Griffin은 호출할 수 없습니다. 액세스는 요청 양식과 연구 프리뷰입니다. 키도, 식별자도, 엔드포인트도, SLA도 없으며, 가용성에 관해 공개된 유일한 설명은 Tavus가 이를 안전하게 공개할 방법을 알아낸 후에야 나올 것이라는 점입니다.

두 가지 모두의 공통점은, 어느 쪽도 라우터가 접근을 도와줄 수 있는 모델이 아니라는 점입니다. 그리고 Griffin의 경우, 그것은 일시적인 문제가 아니라 범주의 문제입니다 — 실시간 전이중 세션은 요청-응답 호출이 아닙니다. 두 파이프라인 중 어느 쪽에서든 라우터가 실제로 도움이 되는 것은 영상 주변의 계층입니다. 프롬프트 확장, 참조 이미지 목록, 샷 설명, 캡션 생성, 리뷰 요약은 모두 텍스트 호출이며, OpenAI, Google 및 기타에서 오는 호출은 OrcaRouter 카탈로그에 있고, 동일한 키로 200개 이상의 모델을 제공하는 하나의 OpenAI 호환 엔드포인트 뒤에 있으며, 공급업체 정가에 0% 마크업을 더한 가격으로, 따라서 공급업체 가격 변경이 같은 날 바로 반영됩니다. 영상 모델 자체와 관련해서는 유용한 사실이 하나 있습니다: MiniMax H3 — HeyGen Video가 튜닝된 기반이며, HeyGen의 $0.01이 초당 가격을 밑도는 대상 — 는 여기에서 다음과 같이 라우팅됩니다: minimax/minimax-h3초당 $0.08, 2K는 $0.13입니다. HeyGen Video 자체는 우리 카탈로그에 없고 Griffin도 없습니다; 둘 다 각자 공급업체의 API와 여러 타사 플랫폼을 통해 제공됩니다.

A screenshot of OrcaRouter's own model page for MiniMax-H3, captured 2 October 2026, showing the model id minimax/minimax-h3 labelled "text + image + video + audio", an Output type of video, a p50 time-to-first-token of 375 ms, and the OrcaRouter navigation and pricing panels alongside.

어느 것이며, 누구를 위한 건가요?

• 결과물이 내장 사운드가 있는 짧고 자체 완결적인 인물 중심 영상이고, 768p 24fps로도 감수할 수 있다면 HeyGen Video를 사용하세요. 10월 이후 요금은 프로모션 10센트가 아니라 초당 $0.02에서 $0.03 사이로 예산을 잡으세요. 그리고 워크플로를 여기에 확정하기 전에 긴 화면 텍스트와 클로즈업 손 작업을 충분히 테스트하세요. HeyGen이 이미 그런 부분이 문제가 발생하는 지점이라고 알려줬기 때문입니다.

• Griffin을 기준으로 계획하지 마세요. 1분 통화에서 생성된 사람과 실제 사람을 구분할 수 있는지가 질문이거나, 렌더링된 클립에 로드맵을 확정하기 전에 실시간 상호작용 계층이 어디로 향하는지 확인해야 한다면 액세스 권한을 요청하세요.

• 공개 문제를 주목하세요. 그것이 두 회사 모두를 움직일 단 하나의 사안이기 때문입니다. HeyGen Video의 고객들에게는 명쾌한 답이 마련되어 있습니다 — 모델은 오픈 웨이트 베이스를 포스트트레인한 것이고, 출력물은 출처가 알려진 파일입니다 — 반면 Tavus는 아직 그런 답이 없기 때문에 모델 하나를 공개하지 않고 있습니다. 더 나은 공개 메커니즘을 발표하는 회사가 더 가치 있는 문제를 해결한 셈이 될 것입니다.

A two-column scoreboard titled "Tavus Griffin vs HeyGen Video 1 — the scoreboard". Left column "Tavus Griffin": Status: research preview; Price: none published; Output: live session; Resolution: 720p at 25 fps; Clip length: none - a session; Independent score: none. Right column "HeyGen Video 1": Status: live 30 September 2026; Price: $0.01 per second; Output: video file; Resolution: 768p at 24 fps; Clip length: 5 to 15 seconds; Independent score: none yet. Footer: "HeyGen price per HeyGen's launch page, October 2026. Neither has an independent score."