'GPT-Live-1 vs Sesame Preview'의 히어로 타이틀 카드, 부제 '여기서 가장 좋은 음성은 API가 없는 쪽이다', 배지 문구 '하나는 무료이자 폐쇄형이고, 하나는 유료이자 호출 가능하다', 그리고 세 개의 카드: 'Sesame Preview — 무료 앱, API 없음, 프로덕션 음성 미출시', 'GPT-Live-1 — 음성 분당 $0.05, 2026년 9월 10일부터 공개 API' 및 'Sesame에서 구축 가능한 부분 — CSM-1B, Apache-2.0, 10억 개 파라미터, 100만 자당 $7 또는 자체 호스팅', 그 아래 하단 스트립 문구 'Sesame의 프로덕션 음성에는 공개된 벤치마크가 없으며, GPT-Live-1 음성 수치는 OpenAI가 보고한 값이다.' OrcaRouter 로고는 오른쪽 하단에 합성되어 있다.
Guides & Insights

GPT-Live-1 vs Sesame Preview: 이 비교에서 최고의 음성은 당신이 살 수 없는 바로 그 음성이다

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

둘 다 써본 사람에게 물어보면 순위는 명확하다: Sesame Preview는 대부분의 사람이 대화해 본 음성 비서 중 가장 설득력 있는 음성 비서다. 또한 이것은 그 위에 구축할 수 없는 제품이기도 하다. GPT-Live-1과 Sesame Preview는 끊임없이 비교된다 — 둘 다 대화형이고, 둘 다 끼어들기를 처리하며, 둘 다 전화 자동 안내가 아니라 사람처럼 들린다 — 하지만 제공 방식은 정반대다. GPT-Live-1은 분 단위로 임대하는 호스팅 모델로, 2026년 9월 10일부터 공개적으로 호출할 수 있다. Sesame Preview는 API가 전혀 없는 무료 소비자용 앱이며, 사람들이 감탄하는 그 목소리는 한 번도 공개된 적 없는 프로덕션 모델에서 구동된다.

각각이 실제로 무엇인지

• GPT-Live-1 — OpenAI의 전이중 음성 모델로, 2026년 7월 8일부터 ChatGPT에, 9월 10일부터는 API에 음성 분당 $0.05로 제공됩니다. API 음성 12종, 복제 없음, 이미지나 동영상 입력 없음, 각 세션마다 전사본과 응답 텍스트가 반환됩니다.

• Sesame Preview — Sesame의 소비자용 음성 어시스턴트. 2026년 5월부터 iOS에서 무료로 제공되며, 2026년 8월 초부터 Android에서 폭넓게 이용할 수 있고, 음성 우선 웹 프리뷰도 있습니다. 네 명의 에이전트 — Maya, Miles, Simone, Charlie — 는 영어만 지원하며, 통화 제한 시간은 30분이고 로그아웃 상태에서는 5분으로 줄어듭니다.

• CSM-1B — Sesame에서 공개된 부분: 2026년 4월 23일 Apache 2.0 라이선스로 공개된 1B 대화형 음성 모델로, 별도의 디코더와 Kyutai의 Mimi 코덱을 갖춘 Llama 아키텍처 백본을 기반으로 구축되어 약 4K 토큰의 컨텍스트에서 24kHz 모노 영어 음성을 생성합니다.

위의 세 줄이 바로 이 결정의 전체 윤곽이다. 한 회사는 모델을 분 단위로 판매한다. 다른 회사는 앱을 무료로 제공하고, 그 앱에 들어 있는 모델과는 다른 더 작은 모델을 오픈소스로 공개한다.

데모와 다운로드 사이의 격차

Sesame은 이 점에 대해 이례적으로 솔직하게 밝혀 왔으며, 이는 이 둘을 평가하는 누구에게나 가장 중요한 단 하나의 사실이다. Preview 앱의 음성, 즉 바이럴 클립과 “동급 최고의 음성 모드”라는 평가를 만들어낸 그 음성은 더 큰 규모의 폐쇄형 프로덕션 모델이다. CSM-1B는 같은 연구소에서 나온 10억 개 파라미터의 오픈 체크포인트이며, 둘 다 실행해 본 사람들의 평가에 따르면 확연히 더 약한 음성이다. Preview의 세션은 또한 상한이 정해져 있고 영어로 제한되며, 작업 실행은 없다. 에이전트는 말할 뿐, 예약하거나 구매하거나 어떤 서류도 제출하지 않는다.

개발자들에게는 실질적이지만 더 좁은 제안이 남는다. 라이선스 비용이 없는 자가 호스팅 가능한 대화형 음성 체크포인트로, 제3자 추론 제공업체 한 곳에서 100만 자당 $7 — 합성 오디오 1시간당 약 $0.35 — 에 호스팅되거나, 자체 하드웨어에서 무료로 사용할 수 있다. 아무도 Preview voice나 CSM-1B에 대한 독립적인 벤치마크를 공개하지 않았으므로, 어느 쪽이든 품질 주장은 측정값이 아니라 청취 인상이다. Sesame은 또한 공개 가격, 엔터프라이즈 등급, 수익화 계획을 공개하지 않았다. 회사가 밝힌 방향은 연구 파트너십과 계획된 하드웨어 제품이다.

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

$0.05의 1분이 무료로는 살 수 없는 것

GPT-Live-1이 개발자에게 내세우는 것은 소리가 더 좋다는 점이 아니다. 아무도 측정할 수 없는 클로즈드 모델을 상대로 그런 주장은 이길 수 없기 때문이다. 그것은 바로 이 제품이 호출 가능하고 가격이 매겨져 있다는 점이다. 구체적으로, 요금 미터가 돌아갈 때 얻는 것은:

• 여러분이 제어하는 하나의 세션 — 하나의 모델 ID, 하나의 Live Sessions 엔드포인트, WebRTC를 통해 실행되는 공개된 통합 예제, 그리고 지침, 음성, 위임 블록으로 구성하는 세션

• 문서화된 동작으로서의 인터럽트 처리 — Full Duplex Bench v1.5에서 80.1%의 상호작용성으로 GPT-Realtime-2.1의 45.4%를 앞섰으며, 0.798초의 턴테이킹 지연과 87%의 도구 호출 성공률을 기록했습니다. 이 세 가지는 모두 OpenAI 자체 수치로, 릴리스와 함께 공개되었고 작성 시점까지 누구도 재현하지 못했습니다.

• 직접 선택하는 추론 백엔드 — 음성 레이어는 무거운 작업을 비동기 경계를 넘겨 세션 구성에 명시된 별도 모델로 전달하며, 그 모델은 대화가 계속되는 동안에도 계속 작동합니다. OpenAI 문서의 예시에서 그 백엔드는 GPT-5.6 Terra이고, 7월 소비자 출시 당시에는 GPT-5.5였습니다.

• 전사 내용, 응답 텍스트 및 전화 통화 형태의 과금 — 1시간 연속 연결 회선당 $3.00, 초 단위 과금, 세션 초기화 15초는 가산되지 않고 무료로 제공됩니다.

Sesame는 더 나은 대화를 제공하고, 그런 것들은 전혀 없습니다. 제품을 만들고 있다면, "더 나은 대화, API 없음, 가격 없음, 벤치마크 없음, 영어만, 30분 제한"은 비교가 아니라 대기자 명단입니다.

이제 GPT-Live-1에는 소비자 출시 당시에는 존재하지 않았던 숫자가 하나 있으며, 그것은 위의 모든 것에 대한 정직한 대응물이다. Artificial Analysis의 Speech to Speech Index는 GPT-Live-1에 69.8%를 부여한다 — 11개 모델 중 7위로, 73.9%의 GPT-Realtime-2.1보다 뒤처지고 79.0%의 Grok Voice Think Fast 2.0보다도 뒤처진다. 따라서 당신이 구매할 수 있는 모델은 독립 평가표에서도 최고가 아니다. 그 평가표가 점수화할 수 없는 것이 바로 Sesame이 실제로 앞서고 있는 부분이다: 그 지수의 11개 모델 중 어느 것도 대화할 때의 느낌에 대해 평가받지 않았고, Sesame Preview 음성은 어디에도 항목이 없다.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

스택에서 어느 회사에도 속하지 않는 부분

여기에서 두 옵션이 수렴하며, 결정이 더 이상 이분법적이지 않게 되는 지점입니다. Sesame Preview도 GPT-Live-1도 완전한 에이전트가 아닙니다. Sesame의 에이전트는 작업을 실행하지 않습니다. GPT-Live-1은 추론, 검색 또는 도구가 필요한 모든 것을 백엔드 모델에 명시적으로 위임합니다. 두 설계 모두에서 흥미로운 작업은 음성 뒤에서, 일반 텍스트 모델 호출에서 일어나며, 그 계층은 음성 계층과 달리 이식 가능합니다 — 음성 모델용 프롬프트를 단 하나도 다시 녹음하지 않고 백엔드를 옮길 수 있습니다.

그 백엔드는 OrcaRouter가 유용하게 쓰이는 곳이기도 하며, 우리가 무엇을 처리하고 무엇을 처리하지 않는지 정확히 짚고 넘어갈 가치가 있다. 우리는 GPT-Live-1을 라우팅하지 않는다. Live Sessions 엔드포인트는 OpenAI의 것이고, 그곳의 음성 레이어에는 손이 닿지 않기 때문이다. Sesame의 프로덕션 모델도 라우팅하지 않는데, 이유는 더 단순하다. 그것은 한 번도 API로 제공된 적이 없다. 우리가 라우팅하는 것은 두 제품이 작업을 넘겨주는 그 계층이다. 열한 개 업스트림 프로바이더에서 온 약 190개 모델이 마크업 없이 프로바이더 정가로 하나의 키 뒤에서 돌아가며, 프로바이더 전반에 걸친 자동 페일오버와 여러 모델을 하나의 호출로 조합할 수 있는 라우팅 DSL을 갖추고 있다. 검증되지 않은 음성 프런트 엔드 위에 무언가를 만드는 팀에게, 그것이야말로 정작 중요한 헤지다. 음성 레이어는 추론 레이어를 함께 끌고 가지 않고도 교체하거나 버려질 수 있고, 3월에 걸었던 모델은 한 줄만 고치면 6월에 교체할 수 있다.

볼 것

세 가지가 이 비교를 바꿀 것이며, 그중 어느 것도 아직 누구의 손에 달려 있지 않다. Sesame API는 — 유료라 하더라도 — 이 범주에서 가장 강력한 음성을 즉시 구축 가능한 옵션으로 만들어 주고, GPT-Live-1의 $0.05 옆에 실제 가격을 제시할 것이다. Preview 음성의 공개된 벤치마크는 청취 인상을 숫자로 바꿔 줄 것이고, 독립 평가는 데모에서만 경쟁해 온 음성에 대체로 가혹한 편이다. 그리고 OpenAI의 상호작용성 및 지연 수치를 외부에서 처음으로 재현하는 것이 전이중이 실제 역량 격차인지, 아니면 잘 고른 평가인지를 판가름할 것이다.

그때까지는 솔직한 구분이 이렇다. 자신을 위해 목소리를 고른다면 Sesame Preview를 사용하라 — 무료이고, 더 좋으며, 그것을 선호하는 데 드는 비용이 없다. 출시하고 판매하고 지원해야 하는 제품을 위해 목소리를 고른다면, GPT-Live-1은 둘 중 실제로 구매할 수 있는 유일한 것이며, 그것이 더 좋은 소리를 내는 쪽이 아니라는 사실이 입장료다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트