'H略
Guides & Insights

HeyGen Voice vs Sesame Preview: 당신이 구매할 수 있는 음성 대 오직 대화만 나눌 수 있는 음성

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이것은 모델 비교가 아니며, 그렇지 않은 척하는 것이 여기서 저지를 수 있는 유일한 진짜 오류일 것이다. HeyGen Voice는 API 엔진이다 — Artificial Analysis의 Controlled Voice 아레나에서 1,202 Elo로 1위를 차지했고, HeyGen의 v3 엔드포인트를 통해 노출되며, 크레딧 단위로 판매되고, 단 한 번의 녹음으로 복제할 수 있다. Sesame Preview는 웹 페이지를 열고 네 명의 이름 있는 페르소나 중 하나에게 말을 걸어 접근하는 무료 소비자용 음성 어시스턴트로, 공개 엔드포인트도, 모델 식별자도, 임대할 수 있는 가격도 없다. 둘 중 하나는 출시할 수 있다. 다른 하나는 좋은 대화형 음성이 어떤 소리인지 알게 해주는 이유이며, 결코 배포하는 대상이 아니다.

각각이 실제로 무엇인지

Sesame Preview는 대화형 음성의 시연입니다. 회사 자체 사이트를 통해 접속해 Maya, Miles, Simone 또는 Charlie와 대화할 수 있으며, 이 경험은 친근함과 표현력을 위해 의도적으로 최적화되어 있습니다 — 회사는 컴패니언들이 왜 그렇게 행동하는지 설명할 때 이를 분명히 밝힙니다. 현재는 영어만 지원하며, 팀은 다국어 능력이 데이터 오염으로 인해 부수적으로 나타나고 "아직 성능이 좋지 않다"고 언급하며, 20개 언어를 넘어 확장하는 것은 향후 계획이라고 말합니다. 회사 자체의 설명은 진행 중입니다: "우리는 아직 거기까지 가지 못했습니다."

데모 밑에는 Conversational Speech Model이 있습니다. 이는 두 개의 자기회귀적 Llama 스타일 트랜스포머로 구축된 멀티모달 텍스트-음성 아키텍처입니다. 이 모델은 세 가지 크기로 제공됩니다 — Tiny는 1B 백본과 100M 디코더, Small은 3B와 250M, Medium은 8B와 300M — 각각 2,048토큰 시퀀스 길이, 약 2분 분량의 오디오로, 대략 100만 시간의 대부분 영어 음성 데이터에 걸쳐 5에포크 동안 학습되었습니다. 핵심 연구 구성 요소는 Apache 2.0에 따라 오픈소스로 공개되어 있으며, 이를 위한 GitHub 저장소도 있습니다. 데모 — 사람들이 실제로 칭찬하는 그 대상 — 는 그게 아닙니다. 데모에는 공개 API가 없습니다.

HeyGen Voice는 정반대의 구성입니다. 사용해 볼 수 있는 무료 소비자용 앱은 없고, 음성 카탈로그, 음성 엔드포인트, 복제 경로, 요금 청구를 갖춘 문서화된 API가 있을 뿐입니다. 브라우저에서 그것을 열고 마음 내키는 대로 대화를 나누는 것은 할 수 없습니다.

어차피 왜 둘이 비교되는 걸까

이 둘이 비교되는 이유는 둘 다 합성 음성이 무언가를 넘어섰다는 증거로 제시되기 때문이다. Sesame Preview는 대화형 오디오가 어떤 소리를 낼 수 있는지에 대한 기대치를 새로 정립했다 — 출시 당시 반응은 텍스트 음성 변환 엔진이라기보다 얼마나 사람처럼 들리는가에 집중됐다. 통제된 보드에서의 HeyGen Voice의 1,202는 같은 주장을 숫자 형태로 보여준다: 모든 모델이 동일한 8개의 복제 참조 음성으로 말할 때 42개 항목 중 1위다.

차이는 그 주장을 이후에 가지고 무엇을 할 수 있느냐에 있습니다. 보드 포지션은 재현 가능하고, 테스트 가능하며, 엔드포인트에 연결되어 있습니다. 데모에서 받은 인상은 그중 어느 것에도 해당하지 않습니다. 그리고 중요한 점은, Sesame Preview가 통제된 보드에 전혀 나타나지 않으므로 1,202와 비교할 Elo가 없다는 것입니다. 사람들이 하려는 비교는 불가능합니다. Sesame가 그것을 잃어서가 아니라, 그 모델이 애초에 보드에 등록된 적이 없기 때문입니다.

점수판

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Controlled Voice Elo — HeyGen Voice: 1,202, 42개 중 1위. Sesame Preview: 목록에 없음.

• 액세스 — HeyGen Voice: 문서화된 v3 API, POST /v3/voices/speech. Sesame Preview: 소비자용 웹 앱 및 iOS 앱, 공개 엔드포인트 없음.

• 가격 — HeyGen Voice: 아레나 자체의 크레딧 가격 환산 기준으로 100만 자당 $30.00이며, HeyGen은 음성 요금을 공개하지 않습니다. Sesame Preview: 무료이며, 어떤 가격으로도 구매할 수 없습니다.

• 음성 선택 — HeyGen Voice: 300개 이상의 사전 제작 음성, 텍스트로 설명하는 음성 디자인, 즉각적이고 전문적인 복제. Sesame Preview: 네 가지 고정 페르소나.

• 언어 — HeyGen Voice: "수십 개 언어", 개수는 미공개. Sesame Preview: 영어만 지원하며, 회사 자체 설명에 따르면 현재 다국어 지원 성능은 기대에 미치지 못함.

• 오픈 웨이트 — HeyGen Voice: 없음. Sesame Preview: CSM은 Apache 2.0에 따라 1B, 3B, 8B 크기로 공개되었습니다.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

중요한 것은 바로 Apache 2.0 세부 사항입니다.

“API 없음”이라는 판정 아래에 묻혀 있는 사실은 Sesame이 연구 모델을 Apache 2.0으로 오픈소스화했다는 점이다 — 관대한 라이선스이며, 세 가지 크기로 제공되고, 데이터 센터 없이도 실행할 수 있을 만큼 작은 1B 변형도 있다. 이는 데모와는 진정으로 다른 제안이며, Sesame Preview의 음성과 유사한 것이 출시 제품에 들어가게 되는 유일한 경로다.

두 가지 유의점이 이 이야기를 정직하게 유지합니다. 공개된 CSM 구성 요소는 연구용 산출물입니다. 회사는 이 모델들이 음성 콘텐츠는 처리하지만 대화 구조는 처리하지 못한다고 밝히며, 완전 듀플렉스 모델을 향후 과제로 제시합니다. 따라서 공개된 가중치는 대화형 경험이 아닙니다. 그리고 로컬에서 실행되는 8B 백본은 호스팅 추론 100만 자당 $19.30과는 다른 비용 구조를 가집니다. 이는 아레나에서 가장 저렴한 최상위권 경쟁사가 청구하는 요금입니다. 셀프 호스팅에는 문자당 청구서가 없고, GPU 시간당 청구서라는 매우 현실적인 비용이 있습니다.

빌더 입장에서 보면, 그것은 질문을 다시 정리하게 만든다. Sesame Preview에서 인상 깊었던 것이 대화였다면, 공개된 가중치로는 그것을 얻을 수 없다. 인상 깊었던 것이 음성 모델 자체의 음성 품질이었다면, 어쩌면 얻을 수 있을지도 모른다 — 그리고 그것은 데모와는 달리 검증할 수 있는 방식이 있다.

HeyGen Voice에서 출시가 어떤 모습인지

실질적인 차이는 평범한 것들입니다. HeyGen의 API는 음성 선택, 텍스트, 그리고 선택적인 속도 0.5~1.5 사이 및 피치 ±50반음 범위, BCP-47 로캘 힌트를 받습니다. 사용자 지정 음성은 세 가지 방식으로 제공됩니다: 1,000자로 제한된 프롬프트에서 순위가 매겨진 최대 세 가지 옵션을 반환하는 설명 기반 설계 경로, 한 번의 녹음으로 만드는 즉시 클론, 그리고 20분 이상으로 훈련된 프로페셔널 클론입니다. voices 엔드포인트의 엔진 필터는 HeyGen 이외의 엔진도 허용하므로, 이 플랫폼은 자체 모델을 둘러싼 폐쇄적인 생태계가 아닙니다.

그런 것들은 Sesame 쪽에는 전혀 없으며, 그것은 Sesame의 결점이 아니라 바로 그 물건의 본질입니다. 무엇이 가능한지를 보여주기 위해 최적화된 데모가 SLA를 떠안아서는 안 됩니다.

그렇지만 청구서는 더 모호한 절반이다. HeyGen은 크레딧을 판매한다. 600개에 월 $29, 1,000개에 $49, 1,500개에 $149이며, 모델과 길이, 복잡도에 따라 소비량이 달라진다고 밝히지만 음성 요율은 공개하지 않는다. 아레나가 제시한 100만 자당 $30.00은 Artificial Analysis가 그 크레딧을 환산한 것이지 HeyGen의 견적이 아니다. 따라서 출시할 수 있는 모델의 가격은 매겨져 있지만, 그것은 다른 누군가의 계산에 기반한 것이다. 이는 엔진에 대한 비판이라기보다는 실측 파일럿을 해야 한다는 근거가 된다.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

당신이 감탄하는 데모로 실제로 무엇을 해야 할까

유용한 접근은 Sesame Preview가 보여주는 두 가지를 분리하는 것이다. 대화적 행동 — 말차례 주고받기, 기억, 누군가와 대화하고 있다는 감각 — 은 아직 공개되지 않았고 엔드포인트도 없는 시스템의 산물이다. 음성 품질은 Apache 2.0 가중치가 뒷받침하는 부분이며, 누구의 허락도 구하지 않고 자신의 오디오로 평가할 수 있는 부분이다.

그 사이의 모든 것에 대해, 마이그레이션 경로는 평범한 것입니다: API와 순위를 갖춘 엔진에서 출시하고, Sesame의 모델이 상용화된다면 그것을 채택하는 것이 재작성이 아니라 구성 변경이 되도록 설계하십시오. 즉, 첫날부터 음성 제공자에 대한 추상화를 의미합니다 — 하나의 인터페이스, 하나의 키, 구성으로 선택되는 엔진. OrcaRouter의 라우팅 계층은 바로 이를 위해 구축되었습니다: 마크업 없이 공급자 정가로 단일 엔드포인트 뒤에 많은 공급자를 배치하고, 공급업체가 지연될 때 자동 장애 조치하며, 애플리케이션 코드를 건드리지 않고 음성 뒤의 엔진을 교체할 수 있는 라우팅 DSL을 제공합니다. 요점은 Sesame 모델을 호스팅한다는 것이 아니라 — 호스팅하지 않습니다 — 당신이 존경하는 음성이 구매 가능해지는 날, 그것을 시도하는 비용이 구성 파일의 한 줄이어야 한다는 것입니다.

정직한 마무리

Sesame Preview는 HeyGen Voice의 경쟁자가 아니며, 그렇게 평가되어서도 안 됩니다. 이것은 무료이고 영어 전용이며 네 가지 페르소나를 제공하는 데모로, 대화형 오디오에 대한 기대치를 재설정했고 허용적 라이선스로 연구 가중치를 세 가지 크기로 공개했습니다. HeyGen Voice는 음성을 고정한 유일한 음성 리더보드에서 1위를 차지한 엔진이며, 오늘 바로 호출할 수 있는 API로 판매되고, 아직 계산할 수 없는 가격에 제공됩니다.

이번 분기에 출시할 수 있는 음성이 필요하다면, 결정은 이 둘 사이가 아니라 HeyGen Voice와 아레나의 다른 유료 엔진들 사이에 있습니다. Sesame를 기다리고 있다면, 앱이 아니라 가중치를 기다리세요.