
Tavus Griffin vs MiniMax H3: 양방향 대화형 모델이 출시된 비디오 생성기를 만나다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Tavus Griffin과 MiniMax H3는 둘 다 화면에 움직이며 말하는 사람을 띄우지만, 그 첫인상을 넘어서면 두 제품이 같은 제품 카테고리에 있다고 보기는 어렵습니다. Griffin은 Human Interaction Model로, 실시간으로 양방향 대화를 주고받도록 만들어진 비디오-투-비디오 시스템입니다. Tavus가 2026년 10월에 발표했으며 현재는 일부 선별된 초기 테스터에게만 제한적으로 제공됩니다. MiniMax H3는 옴니모달 비디오 생성기입니다. 프롬프트와 함께 선택적으로 이미지, 비디오, 오디오 참조 자료를 입력하면 완성된 클립을 돌려받습니다. 하나는 비공개로 평가되고 있고, 다른 하나는 몇 달째 다운로드와 라이선스, 유료 사용이 가능합니다. 해상도나 프레임 레이트가 아니라 바로 이 차이가 둘 중 어느 쪽이 여러분의 스택에 들어갈지를 결정합니다.
각각이 실제로 무엇인지
Griffin은 Tavus가 렌더러가 아니라 참여자처럼 행동하는 모델을 만들려는 시도다. 회사는 이를 최초의 인간 상호작용 모델이라고 설명하며, 공개한 아키텍처는 이 작업을 두 가지로 나눈다. 지속적 대화 모델링은 페르소나가 매순간 무엇을 하고 있어야 하는지 결정하고, 오디오-비주얼 생성은 그에 맞는 음성과 얼굴을 스트리밍한다. 결정적으로 이는 풀 듀플렉스다. 말하는 동안에도 보고 듣기 때문에 방해받을 수 있고, 발화 도중 반응할 수 있으며, 응답하기 전에 명확한 턴 종료 신호를 기다리지 않는다. Tavus가 내세우는 관점은 이전 시스템들이 얼굴을 생성하는 법을 배웠다는 것이며, Griffin은 사람들로부터 대화 행동을 배우도록 만들어졌다.
MiniMax H3는 Hailuo 3 세대이며, 2026년 7월 31일에 출시되고 2026년 8월 3일에 MiniMax H3 Community License 하에 오픈 소스로 공개되었으며, H3-Base-FL2VA 및 H3-Base-Ref2VA 변형이 공개적으로 게시되었습니다. 텍스트, 이미지, 비디오 및 오디오 참조를 하나의 통합 컨텍스트로 읽고, 3단계 파이프라인(H3-Context-IR, 그다음 768p의 H3-Base, 그다음 H3-Regenerate-2K)을 통해 생성된 네이티브 스테레오 오디오와 함께 768P 또는 2K의 4~15초 클립을 반환합니다. 이는 유난히 넓은 입력 범위와 진정으로 허용적인 라이선스를 갖춘 생성기입니다 — 현재 Griffin에게는 전혀 없는 모든 것입니다.
사양을 나란히

왜 "duplex"가 흥미로운 단어인가
모든 비디오 생성기는 H3를 포함해, 클립이 완성된 뒤 어떻게 보이는지로 평가된다. Griffin은 클립이 보여줄 수 없는 것으로 평가된다: 여러분이 그것을 중단시킨 뒤 200밀리초 동안 무슨 일이 일어나는지 말이다. 그것이 바로 Human Interaction Model이라는 프레이밍이 가리키는 문제이며, Tavus의 대표 수치가 시각적이 아니라 행동적인 이유다.
가장 많이 인용되는 수치는 1분짜리 화상 통화 후 48%의 사람들, 즉 참가자 54명 중 26명이 Griffin을 실제 인물이라고 믿었다는 것이며, Tavus의 이전 스택인 Phoenix-4.5, Sparrow-2, Raven-1의 경우에는 2.4%, 즉 41명 중 1명에 그쳤다. Tavus는 또한 확신하지 못한 사람들은 처음 20초 이내에 의심하는 경향이 있었다고 보고하는데, 이는 헤드라인보다 더 유용한 세부 사항이다: 이는 착각이 초반에 유지되거나 초반에 무너진다는 것을 의미한다.
두 번째 숫자 집합은 2026년 9월에 채점된 NVIDIA의 VideoFDB 벤치마크에서 나온 것으로, Tavus에 따르면 Griffin은 대면 AI에 대한 독립 테스트에서 1위를 차지했습니다. 생성 측면에서 Griffin은 3.83점을 받았으며, 이는 가장 강력하게 보고된 기준선(Gemini 2.5 + Anam 구성)의 2.80점과 비교됩니다. 인간 참조 점수는 3.92점, 과제 목표 달성률은 62.8%였습니다. 인식 측면에서는 3.73점을 받았으며, MiniCPM-o 4.5의 3.44점, Gemini 2.5 Flash Native의 3.17점, 오디오 전용 OpenAI gpt-realtime 구성의 2.97점과 비교됩니다. 인간 참조 점수는 4.20점, 과제 목표 달성률은 73.8%였고, 이는 평가된 15개 모델 전체를 통틀어 나온 결과입니다. Tavus는 또한 Griffin이 즉각적인 반응에서 차선의 시스템보다 37% 앞선다고 주장합니다. 이는 NVIDIA가 구축한 벤치마크에 기반한 공급업체 보고 수치이므로 그렇게 읽어야 하지만, 인간 비교 지점들은 기억할 가치가 있습니다. 3.83점 대 인간 점수 3.92점은 비디오 생성이 역사적으로 보여 온 것보다 훨씬 작은 격차이기 때문입니다.
오늘 구매할 수 있는 것
여기서 두 모델은 더 이상 비교 자체가 불가능해진다.
MiniMax H3는 하나의 제품입니다. 호스팅 방식으로 제공되며, 생성된 출력의 초 단위로 가격이 책정되고, 그 오픈 변형들은 모델 허브에 올라가 다운로드를 기다리고 있습니다. 존재하지 않는 무언가를 담은 15초, 2K, 스테레오 오디오 클립을 원한다면 오늘 오후에 바로 얻을 수 있고, 임대하는 대신 직접 가중치를 실행할 수도 있습니다.
Tavus Griffin은 제품이 아니다. Tavus는 Griffin 관련 글에서 연구 프리뷰인 Griffin-Lite가 오늘 엄선된 얼리 테스터 그룹에게 제공되며, 더 강력한 모델의 더 넓은 출시가 뒤따를 것이고, Griffin은 아직 Tavus 플랫폼에 없으며 회사가 이를 안전하게 출시할 방법을 마련한 뒤에야 출시될 것임을 분명히 밝히고 있다. 이는 공급업체가 자사의 가장 화려한 결과물에 대해 보여주는 이례적으로 많은 솔직함이며, 계획 수립에 중요하다: Griffin을 의존성으로 제품 로드맵에 넣을 수 없고, 가격을 매길 수도 없다. 가격이 없기 때문이다.
그래서 솔직한 기획 질문은 "어느 쪽이 더 나은가"가 아니라 "내가 필요한 계층에 어느 쪽이 존재하는가"이다.

OrcaRouter가 적합한 위치
MiniMax H3는 저희 카탈로그에 있습니다. 모델 페이지는 minimax/minimax-h3에 있으며, 요금은 제공자가 청구하는 방식 그대로입니다. 768P에서는 생성 출력 1초당 $0.08, 2K에서는 1초당 $0.13입니다. OrcaRouter는 제공자 정가를 0% 마크업으로 그대로 전달하므로, MiniMax 가격이 변경되면 다음 청구 주기가 아니라 발표되는 당일에 저희 카드에 반영됩니다. Griffin은 카탈로그에 없으며, Tavus가 고객에게 출시할 때까지는 없을 것입니다 — 저희는 서비스할 수 없는 모델을 호스팅하지 않으며, 선별된 테스터로 제한된 연구 프리뷰는 라우터가 라우팅할 수 있는 대상이 아닙니다.
실질적인 결과는 이 두 모델 중 하나는 애플리케이션에 코드 한 줄만 더하면 되고, 다른 하나는 전화번호가 적힌 연구 논문이라는 점입니다. 이미 여러 비디오 및 언어 모델을 라우팅하고 있다면, H3의 초당 과금 또한 이 경로를 자동 장애 조치 뒤에 둘 만한 종류의 경로로 만들어 줍니다: 포화된 제공자에 부딪힌 요청은 타임아웃이 드러나는 대신 정상 제공자로 재시도되고, 라우팅 DSL을 사용하면 2K 작업을 특정 제공자에 고정하면서 768P 초안은 용량이 가장 저렴한 곳으로 떨어지게 할 수 있습니다. 모델 퓨전은 여기서 언급할 만한 또 다른 지렛대입니다 — H3의 초당 가격은 충분히 낮아서 생성 전에 텍스트 모델을 동원해 프롬프트를 다시 쓰고 재편집하는 비용이 잘못된 첫 시도로 인해 낭비되는 초보다 종종 더 저렴합니다.

비교가 뒤집힐 수 있는 경우
이 비교를 바꿀 수 있는 것은 세 가지, 오직 세 가지뿐입니다.
첫째, Tavus가 Griffin을 공개 요율이 책정된 상용 API로 출시한다면, "대화 대 클립"이라는 전체 프레이밍은 일정 결정이 아니라 진짜 구매 결정의 문제가 되고, 48%라는 대면 수치도 생성형 출력의 품질과 직접 경쟁하기 시작한다. 둘째, H3의 실시간 관련 서사가 개선된다면 — MiniMax는 공격적으로 제품을 내놓아 왔다 — 스트리밍할 수 있는 초당 생성기는 Griffin의 핵심 강점을 무디게 만들 것이다. 셋째, NVIDIA나 다른 중립 주체가 H3 또는 그 후속 모델을 포함해 VideoFDB를 다시 실행한다면, Griffin이 대면 AI에서 최초라는 주장은 더는 반증 불가능하지 않게 된다. Tavus는 안전 우려가 해소되는 대로 곧 Griffin을 출시할 예정이라고 말한다. 그 한 문장이 전체 타임라인이다.
결론
MiniMax H3와 Tavus Griffin은 현재 경쟁 관계가 아닙니다. 둘 중 하나만 구매할 수 있기 때문입니다. H3는 출시되어 있고, 오픈 웨이트이며, 초당 과금되는 옴니모달 생성기로 가격이 공개되어 있고 4~15초 출력 창을 제공합니다. Griffin은 누구든 공개한 것 중 가장 뛰어난 대면 수치를 가진 양방향 대화 모델이지만, API도 없고 가격도 없으며, 자사 벤더가 고객이 아직 사용할 수 없다고 명시했습니다. 오늘 영상 생성이 필요하다면 H3가 답이며 초당 센트 단위로 측정할 수 있습니다. 끊어 말할 수 있는 실시간 얼굴이 필요하다면 Tavus를 지켜보세요. 하지만 먼저 나머지 제품을 만드세요. 출시일은 날짜가 아니라 한 문장이기 때문입니다.
