'Realtime-Venus vs Sesame Preview'의 히어로 타이틀 카드, 부제 '두 연구소, 같은 함정, 반대 방향', 세 장의 카드에는 'Sesame Preview: 무료 앱, 에이전트 네 개, 2026년 5월 이후 API 없음', 'Realtime-Venus: Apache-2.0 가중치, 제품 없음, 발표 없음', '둘 다 독립적으로 검증된 음성 점수를 공개하지 않음'이라고 적혀 있으며, 그 아래 푸터 스트립에는 'Sesame의 기능은 자사 모바일 프리뷰 문서 기준; Realtime-Venus 수치는 기술 보고서에서 인용, 재현되지 않음.'이라고 적혀 있다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

Realtime-Venus vs Sesame Preview: 얻을 수 있는 것이 좋은 것이 아니다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Realtime-Venus와 Sesame Preview는 음성 모델의 용도에 대해 완전히 다른 생각을 가진 연구소들이 만들었으며, 서로 반대 방향에서 동일한 함정에 빠졌다. Sesame Preview는 무료 소비자 앱으로, iOS는 2026년 5월부터, Android는 8월 초부터 제공되며, 네 개의 대화형 에이전트, 통화 중 실시간 웹 검색, 그리고 리뷰어들이 동급 최고라고 부른 음성을 갖추고 있다. Sesame이 공개한 오픈 웨이트는 회사 스스로가 데모에서 들은 그 음성이라고 내세우지 않는, 별개의 더 작은 모델이다. Ant Group의 Venus Team과 Tsinghua University가 만든 9B 전이중 시스템인 Realtime-Venus는 반대 방향으로 갔다. 다운로드 가능한 아티팩트가 진짜이며, 제품은 전혀 없다. 두 경우 모두, 실제로 이용할 수 있는 것과 인상적인 것 사이의 간극이, 둘 중 어느 하나를 두고 무엇이든 계획하기 전에 이해해야 할 가장 유용한 점이다.

각각이 실제로 무엇인지

A screenshot of the Sesame mobile preview page, captured 18 September 2026, showing the header navigation with Blog, Team, Mobile Preview and Research Preview, the headline 'Personal agents for curious people', the line 'Preview available now on iOS and Android', and both the App Store and Google Play download badges.

Sesame Preview는 제품입니다. Sesame는 2023년 브렌던 아이리브, 안킷 쿠마르, 라이언 브라운이 설립한 샌프란시스코의 연구소로, a16z, Sequoia, Spark, Matrix의 투자를 받았으며, 소비자용 음성 비서는 마야, 마일스, 시몬, 찰리라는 네 가지 성격을 탑재하고 있습니다. 각각 뚜렷이 다른 기질과 목소리를 지녔습니다. 이 에이전트는 대화 중에 웹을 검색하고, 메모와 알림을 만들며, 통화 후 요약을 보낼 수 있습니다. 기억은 에이전트별로 관리되며, 로그인한 상태에서는 웹과 모바일 간에 동기화됩니다. 또한 과거 기억은 읽되 새 기억은 기록하지 않는 시크릿 모드가 있습니다. 무료이며 광고가 없고, 회사는 데이터를 판매하지 않는다고 밝힙니다.

Realtime-Venus는 연구용 릴리스입니다. Hugging Face에 Apache-2.0 라이선스로 공개된 9B 체크포인트 두 개 — 시청각 상호작용을 위한 Realtime-Venus-Omni와 음성 상호작용을 위한 Realtime-Venus-Audio — 와 함께 2026년 9월 12일 arXiv에 제출된 기술 보고서, 프로젝트 페이지, 그리고 Realtime-Venus-Harness 구성 요소를 담은 동반 저장소가 있습니다. 앱도, API도, 가격도, 벤더의 발표도 없습니다. 해당 저장소는 어떤 추론 제공업체에 의해서도 배포되지 않으며, 다운로드도 추적되지 않습니다.

양방향의 함정

Sesame의 버전은 전형적인 오픈워싱(open-washing) 형태이며, Sesame은 대부분보다 그 점에 대해 더 정직합니다. 연구소가 Apache-2.0으로 공개한 CSM 체크포인트는 기본 음성 생성 모델로, Llama 백본이 Mimi 코덱 디코더에 입력을 공급하는 구조이며, 문서에는 그것이 앱의 음성이 아니고 엔드투엔드 음성 대 음성 시스템도 아니라고 명시되어 있습니다. 그것은 텍스트를 생성할 수 없으며, 주로 영어 데이터로 학습되어 그 외 언어에 대한 능력은 제한적입니다. Sesame Preview를 구동하는 것은 아직 공개되지 않은 더 큰 프로덕션 모델입니다. 따라서 데모에서 들은 음성을 찾아 나섰다면, 당신은 그 자체가 아니라 그 음성의 연구 계보를 찾은 것입니다. 네 명의 에이전트 중 하나가 당신의 통화에 응답할 때, 당신은 다운로드할 수 없는 무언가를 듣고 있는 것입니다.

Realtime-Venus의 버전은 그 거울상이며, 어쩌면 더 낯선 쪽이다. 공개된 모든 것은 진짜다: 실제 가중치, 실제 코드, 실제 보고서, 관대한 라이선스. 빠져 있는 것은 GPU를 소유하지 않고도 그것을 사용할 방법이다. BF16의 9B 체크포인트 두 개는 활성화 메모리를 제외하고도 각각 약 18기가바이트의 가중치이며, 둘 다 라이브 오디오 및 비디오 입력으로 연속 1초 스트리밍 루프를 실행하도록 설계되었다. 그것은 서버급 배포다. 동일한 기능을 휴대폰에 탑재해 제공하는 소비자용 앱은 이번 릴리스가 시도하지 않는 일을 하는 것이며, 다운로드 가능한 모델과 실행 가능한 모델 사이의 간극이 바로 그것을 원하는 대부분의 사람들이 막히게 되는 지점이다.

측정 가능성은 더 뚜렷한 차이입니다

두 모델 모두 독립적인 음성 품질 점수는 없지만, 그 이유는 다릅니다.

• Sesame Preview — 아레나 참가 기록도 없고, 프로덕션 보이스에 대한 공개된 평가도 없다. 그 명성은 리뷰어들과 오리지널 데모가 청취자에게 미친 효과에 기대고 있는데, 이는 일종의 실질적 증거이긴 하지만 전혀 정량화되지 않았다.

• CSM-1B — 오픈 체크포인트는 기반 생성 모델이며, 대화형 시스템이 아니기 때문에 대화형 시스템과 비교 평가되지 않습니다.

• Realtime-Venus — 자체 보고된 음성 지표 하나인 VoiceBench AlpacaEval 점수 4.81은 보고서에서 최고의 비교 수치와 일치한다고 설명하고 있습니다. 제3자가 이를 평가한 적은 없습니다.

• 어느 쪽도 당신에게 주지 않는 것 — 결과에 아무런 이해관계가 없는 사람이 만들어 낸 숫자. 음성 품질이 구매 기준이라면, 그 비교 전체는 점수화할 수 없으며, 표에 의존하기보다 둘 다 들어 보고 스스로 결정하는 것이 정직한 행동이다.

번갈아 나서는, 둘 다 증명할 것이 있는

Sesame의 명성은 바로 이것 위에 세워졌다. 그 연구소를 유명하게 만든 데모는 숨소리와 망설임, 끼어들기 타이밍이 있는 목소리였고, 청취자들이 전화 건너편에 사람이 있다고 믿을 만큼 설득력이 있었다. 그것은 대화 역학에 관한 주장이며, 바로 그 점이 이 제품이 팔리는 근거다.

Realtime-Venus는 수치를 덧붙여 같은 주장을 한다. Full-Duplex-Bench v1.5에서 자사의 오디오 체크포인트는 사용자 끼어들기의 75%에 응답한다고 보고하며, 발화 지속률은 맞장구(backchannels)에서 97%, 타인 지향 발화(other-directed speech)에서 88%, 배경 발화(background speech)에서 86%라고 한다 — 세 가지 발화 지속 지표 모두에서 Gemini 3.1 Live와 GPT-4o를 능가한다고 밝혔다. 이 수치들은 자체 보고서에서 나온 것이며 아무도 이를 재현하지 못했다.

그래서 이 비교는 숫자 없는 데모와 데모 없는 숫자를 맞세우는 셈인데, 이는 정말 곤란한 처지이며 지금 이 범주 전체가 스스로를 보고하는 방식을 꽤 잘 설명해 줍니다. 확실하게 말할 수 있는 한 가지는, 어느 주장도 외부 제3자의 검증을 통과하지 못했다는 것이고, 백채널에서의 97% 지속률은 확정된 것으로 인용되기 전에 제3자의 검증을 받을 만큼 충분히 높습니다.

A two-column comparison scoreboard titled 'Realtime-Venus vs Sesame Preview — the scoreboard'. The left column, labelled Realtime-Venus, reads 'What it is: research release, Apache-2.0 weights', 'Product: none', 'Agents or voices: one reference voice', 'Languages: English and Chinese', 'Independent voice score: none', 'Runs on: a GPU node you own'. The right column, labelled Sesame Preview, reads 'What it is: free consumer app, closed production voice', 'Product: iOS since May 2026, Android since early August', 'Agents or voices: Maya, Miles, Simone, Charlie', 'Languages: English only', 'Independent voice score: none', 'Runs on: your phone'. The footer reads 'Sesame capabilities per its own mobile preview documentation; Realtime-Venus figures from its technical report, unreproduced.'

실제로 만들 수 있는 것

Sesame Preview는 빌더에게 아무것도 제공하지 않습니다. API도, 모델 식별자도, 요금표도 없고, 이를 제공하겠다는 계획도 밝혀진 바 없습니다. 통화는 로그인 시 30분, 그렇지 않으면 5분으로 제한되며, 공식적으로 지원되는 언어는 영어뿐이고, 에이전트는 조사하고 기억하지만 작업을 실행하지는 않습니다 — 항공편을 예약해주지 않습니다. 무료 티어가 바로 제품입니다. 그것은 소비자용으로는 지극히 좋은 제안이지만 통합에는 막다른 길입니다.

Realtime-Venus는 빌더에게 그것을 실행할 장소만 빼고 모든 것을 제공한다. 가중치는 허용적 라이선스로 제공되고, 코드는 표준 Transformers 호출로 로드되며, 전이중 스트리밍은 메서드 스위치 하나로 진입하고, 문서화된 루프는 1초의 스트리밍 프리필 후 스트리밍 생성이 반복되는 형태다. 장시간 비디오 메모리는 memory-minutes 매개변수로 활성화되며, 학습이 필요 없다고 설명되는데, 이는 보통 미세 조정이 필요한 기능으로서는 이례적이다. 두 가지 주의점은 발견에 맡겨지지 않고 문서화되어 있다: 유틸리티 임포트 전에 상수를 높이지 않으면 긴 비디오를 조용히 잘라내는 프레임 상한, 그리고 전이중 비디오에 렌더링되는 비라틴 문자 자막을 위한 CJK 폰트 요구 사항.

그것이 바꾸지 못하는 사실이 하나 있다. 하네스 — 이 아키텍처에서 가장 독특한 부분인 비동기 위임을 실행하는 구성 요소 — 는 별도의 GitHub 저장소에 있고, 모델보다 문서화가 훨씬 부족하며, 프로덕션 준비 상태를 판단하기 가장 어려운 부분이다. 실제 배포에서 위임 경로는 대화형 프런트 엔드 뒤에 놓인 평범한 텍스트 추론일 뿐이다. OrcaRouter는 Realtime-Venus도 Sesame Preview도 제공하지 않는다. 두 음성 레이어 모두 우리가 제공하는 범위 밖에 있으며, 존재하지도 않는 호스팅 관계를 암시하는 대신 이를 분명히 밝힌다. 하나의 키로 제공자 정가 그대로, 마크업 없이 거의 200개의 텍스트 모델은 우리가 실제로 다루는 그 아키텍처의 절반이며, 다음을 갖추고 있다: 업스트림 장애가 발생해도 위임된 작업이 살아남도록 하는 자동 장애 조치, 여러 모델을 하나의 호출로 조합하는 라우팅 DSL, 그리고 한 모델의 판단만으로는 충분하지 않을 때 쓰는 모델 퓨전. 그것은 흥미로운 부분은 판매되지 않는 설계에서 구매할 수 있는 부분이다.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge with the Any-to-Any, Transformers, Safetensors, audio, video, speech and streaming tags, and a side panel stating 'This model isn't deployed by any Inference Provider.'

정직한 추천

오늘날 이용할 수 있는 가장 듣기 좋은 대화형 음성을 원하면서 이를 통합할 필요가 없는 소비자라면, Sesame Preview는 무료이고 두 모바일 플랫폼 모두에서 제공되며, 그 명성은 리뷰어들이 계속 그렇게 말할 만큼 충분히 마땅합니다. 사용해 보고 즐기세요.

연구자이거나, 직접 검사하고 파인튜닝할 수 있는 개방형 오디오-비주얼 풀듀플렉스 스택이 필요한 충분한 자원을 갖춘 엔지니어링 팀이라면, Realtime-Venus는 매우 드문 실제 선택지 중 하나이며, 그 벤치마크가 자체 보고라는 사실이 가중치가 진정으로 공개되어 있고 아키텍처가 진정으로 문서화되어 있다는 점을 바꾸지는 않습니다.

이번 분기에 출시할 음성 레이어를 찾고 있는 제품 팀이라면, 이 둘 중 어느 것도 답이 아닙니다. 그리고 이 조합에서 얻을 수 있는 유용한 교훈은 왜 그런가에 있습니다. 한 연구소는 뛰어난 무언가를 만들고 좋은 부분은 닫아 두었습니다. 다른 한 곳은 모든 것을 공개하고 인프라는 여러분이 공급하도록 남겨 두었습니다. 이 범주는 들을 만한 가치가 있는 음성을 만들 수 있음을 입증했지만, 그 음성이 앱 이외의 어떤 형태로든 구매 가능해야 하는지는 아직 결정하지 못했습니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트