
StepAudio 3 Realtime vs Sesame Preview: 모두가 칭찬하는 음성 vs 점수를 가진 음성
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
2026년의 대부분 기간 동안, 음성 AI에 관해 누구든 내놓을 수 있었던 가장 강력한 주장은 들어본 느낌뿐이었다. Sesame의 어시스턴트는 다른 무엇보다도 더 인간처럼 들렸고, 그렇게 말하는 사람이 충분히 많아서 그것이 기준점이 되었다 — 벤치마크도, 숫자도, 확인할 방법도 없이. 2026년 9월 15일, StepAudio 3 Realtime이 StepFun에서 등장했는데, 그 품질을 측정 가능한 가장 가까운 형태에 숫자로 붙여서였다: Artificial Analysis의 Conversational Dynamics 평가에서 98.9%, 1위. Sesame Preview는 그 리더보드에 없다.
흥미로운 점은 한쪽이 다른 쪽을 이겼다는 사실이 아니다. Sesame이 유명해진 그 품질을 이제 제3자가 점수화하고 있는데, 정작 그 명성을 지닌 모델은 그 품질을 기준으로 측정된 적이 없다는 점이다.
이들 각각이 실제로 무엇인지
그것들은 같은 종류의 객체가 아니며, 그 사실이 어떤 점수보다도 비교를 더 많이 좌우한다.
Sesame Preview는 소비자용 음성 비서입니다. 2026년 5월부터 iOS에서 무료로 제공되었고, 2026년 8월 초부터는 Android에서도 폭넓게 제공되었으며, Maya, Miles, Simone, Charlie라는 네 명의 에이전트를 중심으로 만들어졌습니다. 이들은 세션 전반에 걸쳐 맥락을 유지하고, 웹을 검색하며, 알림을 설정합니다. 영어만 지원합니다. 통화는 최대 30분으로 제한되며, 로그아웃 상태에서는 5분으로 줄어듭니다. 프로덕션 음성용 API도 없고, 엔터프라이즈 등급도 없으며, 공개된 가격 정보도 없습니다.
StepAudio 3 Realtime은 개발자용 인터페이스입니다. StepAudio 3 패밀리의 다섯 모델 중 하나로, 모두 같은 날 출시되었으며 모두 StepFun의 오픈 플랫폼에서 상용 API로 제공됩니다. 네이티브 전이중 대화를 처리하고, 먼저 전사하지 않고 음성 자체를 직접 추론하며, 대화가 계속되는 동안 도구 호출과 장시간 작업의 비동기 실행을 지원합니다. 중국어 우선입니다. 오픈 웨이트가 아니며, 현재 기간 한정 무료 프리뷰 가격으로 제공되고 있고 프리뷰 이후 요금은 발표되지 않았습니다.
이 중 하나는 그 위에 지을 수 있습니다. 다른 하나는 방문할 수 있습니다.
Sesame이 유명한 측정 가능한 것
Conversational Dynamics는 특정 벤치마크이며, 그것이 무엇을 담고 있는지 알아 둘 가치가 있습니다. 이 벤치마크는 발언 순서 주고받기, 멈춤 처리, 끼어들기 후 복구, 그리고 모델이 짧은 맞장구—"uh-huh", "right", "mm"—를 대화의 발언권을 잡으려는 시도가 아니라 격려로 올바르게 해석하는지를 채점합니다. 이러한 행동은 바로 청자가 어떤 음성이 로봇 같기보다 인간처럼 느껴진다고 말할 때 묘사하는 행동이며, 어시스턴트를 단순히 정확한 것을 넘어 대화하기 즐거운 존재로 만드는 행동입니다.
StepAudio 3 Realtime은 98.9%로 그 순위표를 선두하며, 98.4%의 Qwen Audio 3.0 Realtime Plus와 95.3%의 GPT-Realtime-2를 앞선다. 또한 StepFun이 인용한 대로 Speech Reasoning에서 99.7%로 1위를 차지하는데, 그 이면에는 전사 단계를 거치면 평평해질 톤과 강조를 원본 오디오에 대한 추론이 보존한다는 아키텍처적 주장이 자리한다 — 빈정거림을 듣는 것과 칭찬을 듣는 것의 차이다.
그 결과에 대한 솔직한 정리는 이렇습니다. 그 벤치마크는 Sesame이 칭찬받는 부분을 측정하는 데 있어 업계가 가진 가장 가까운 기준인데, Sesame은 그 벤치마크에 참가한 적이 없습니다. 그것은 StepAudio 3 Realtime이 Sesame보다 더 좋게 들린다는 증거가 아닙니다. 그것은 이 주장 중 하나는 검증 가능하고 다른 하나는 지금까지는 그렇지 않다는 증거이며, 검증 가능한 쪽은 현재 대부분의 사람이 한 번도 대화해 본 적 없는 모델이 차지하고 있다는 증거입니다.

진짜 결정인 가용성 비대칭
위의 모든 내용은 흥미롭습니다. 이 부분이 결정적입니다.
Sesame의 음성 — 사람들이 극찬하는 바로 그 음성 — 은 Sesame이 API로 공개한 적이 없는, 더 큰 규모의 비공개 프로덕션 모델이다. 그것을 구매하거나, 라이선스를 취득하거나, 자신의 제품에서 호출할 수 없다. Sesame의 대화 타이밍이 현존 최고라는 글을 읽고 그것을 가질 수 있다고 결론지었다면, 그 결론은 증거에서 도출되지 않는다.
Sesame이 실제로 오픈소스로 공개한 것은 Apache-2.0으로 릴리스된 CSM-1B다. 이는 어시스턴트가 아니라 합성 블록이다: Llama 백본이 첫 번째 Mimi 코드북을 예측하고 더 작은 Llama 디코더가 나머지를 예측하며, Mimi 코덱이 이를 24 kHz 파형으로 렌더링한다. 영어 전용이며, 10~15초 참조 클립에서 음성을 복제하고, 텍스트를 전혀 생성할 수 없다 — 별도의 언어 모델과 짝지어 사용해야 한다. 둘 다 실행해 본 사람들은 CSM-1B의 음성이 Preview 앱의 음성보다 확연히 약하다고 말하며, 모델 카드는 굳이 말하지 않던 부분을 대놓고 밝힌다: CSM의 미세 조정된 변형이 대화형 데모를 구동하며, 그 변형은 다운로드할 수 있는 체크포인트가 아니다.
StepAudio 3 Realtime에는 그런 모호함이 전혀 없습니다. 공개된 모델 패밀리가 뒷받침하고, 명시된 기능 세트와 찾아볼 수 있는 제3자 배치를 갖춘 상용 API입니다. 또한 중국어 우선이고, 프리뷰 가격으로 책정되어 있으며, 대화 역동성에서 1위를 차지하는 바로 그 리더보드에서 첫 오디오 도달 시간 8.83초를 기록합니다. 이는 Gemini 3.8 Live의 1.18초, GPT-Live-1의 1.24~1.34초와 대비됩니다. 대화 품질 면에서 무엇을 제공하든, StepFun 자체 서빙 환경 밖에서 대화 속도로 그것을 전달할 수 있다는 점은 아직 입증하지 못했습니다.

보이스 스택을 고르는 중이라면 이걸 어떻게 해야 할까요?
먼저 두 질문을 분리하는 것부터 시작하세요. "대화는 어떤 느낌이어야 하는가?"와 "나는 무엇을 출시할 수 있는가?"는 서로 다른 답을 가지며, 둘 중 하나만 조달 결정입니다.
취향을 조율하는 중이라면 — 제품에 얼마나 따뜻함을 담아야 할지, 어느 정도의 침묵이 편안한지, 에이전트가 얼마나 빨리 발언권을 넘겨야 하는지 결정하는 중이라면 — Sesame Preview는 무료이고, 정말 뛰어나며, 오후 한나절을 보내기 좋은 곳입니다. 참고 기준으로 삼으세요. 다만 그것을 중심으로 연동을 계획하지는 마세요. 연동할 대상이 없기 때문입니다.
제품을 출시하려는 상황이라면, StepAudio 3 Realtime은 실제 후보이지만 실제 주의사항도 있습니다: 프리뷰 가격, 중국어 우선 지원 범위, Artificial Analysis의 지수 점수 없음, 그리고 아직 해결되지 않은 지연 시간 문제입니다. 대화 품질보다 지연 시간을 먼저 테스트하세요. 턴테이킹 벤치마크에서 이기지만 말을 시작하는 데 문장 하나 분량의 시간 대부분이 걸리는 모델은, 그 최고의 품질을 당신이 결코 보여주지 못할 수도 있는 모델입니다.
그리고 만약 Sesame의 실제 프로덕션 음성이 언젠가 API를 갖게 된다면, 이 모든 비교는 다시 실행될 것이다 — 왜냐하면 그것을 판가름할 벤치마크가 이미 존재하고, Sesame도 마침내 그 벤치마크에 등장해야만 하기 때문이다.
라우팅이 적합한 경우와 그렇지 않은 경우
보이스 에이전트는 하나의 모델이 아닙니다. StepAudio 3 Realtime을 실행하든 다른 무엇을 실행하든, 대화는 끊임없이 일반 텍스트 모델에 작업을 넘깁니다 — 조회, 추출, 유지된 일시 중지 뒤에서 실행되는 추론 호출 같은 작업을요. 바로 이 위임 계층에 비용 편차가 존재하며, 한 제공자의 안 좋은 한 시간이 곧 당신의 서비스 중단이 되는 곳입니다.
우리 자체 지원 범위를 정확히 말하자면, StepAudio 3 제품군의 라이브 및 음성 엔드포인트는 OrcaRouter에 없으며, Sesame이 구축한 어떤 것도 마찬가지입니다. OrcaRouter에 있는 것은 음성 에이전트가 위임하는 텍스트 레이어입니다 — 하나의 API 뒤에 거의 200개의 모델, 자동 페일오버, 여러 모델을 하나의 호출로 구성하는 라우팅 DSL, 그리고 단일 모델의 판단만으로는 충분하지 않을 때의 모델 퓨전이며, 제공업체 정가가 마크업 없이 그대로 전달됩니다.
그러한 분리 덕분에 가용성 문제는 겉보기보다 덜 치명적이다. 음성 모델은 다시 검토할 수 있는 결정이지만, 위임 계층은 되돌리기에 비용이 많이 드는 쪽이며, 어떤 음성 벤더를 선택하기 전에 라우터 뒤에 두어볼 가치가 있는 쪽이다.

평결
Sesame Preview는 측정할 수 없는 점에서는 이기고, 돈으로 살 수 있는 모든 점에서는 진다. 그것은 사용할 수 있는 가장 소리가 좋은 음성이고, 무료이며, 프로덕션에 투입할 수는 없다 — 그리고 이제 제3자가 그것이 유명한 품질을 점수화하니, 그 점수판에서 그것이 빠져 있다는 것은 보호된 우위가 아니라 증거의 공백이다.
StepAudio 3 Realtime은 가용성, 측정 가능성, 역량에서 앞서며, 가격, 언어 지원 범위, 지연 시간에 대해서는 진정한 미해결 질문을 안고 있다. 두 제품 중 오늘 당장 그 위에 구축할 수 있는 것은 이것뿐이며, 이는 어떤 벤치마크보다 실용적인 문제를 더 빠르게 정리해 준다.
주목할 점은 간단하며, 이는 양쪽 모두에 해당한다: Sesame의 프로덕션 음성에 대한 Conversational Dynamics 점수, 또는 StepAudio 3 Realtime이 현재 품질 면에서 앞서는 모델들과 같은 범위에 들게 하는 지연 시간 수치. 둘 중 하나만 있어도 이는 측정값과 평판 사이의 비교에서 실제 맞대결로 바뀔 것이다.
