'Gemini 3.8 TTS vs Sesame Preview'용으로 생성된 히어로 카드로, 흰색 배경에 부드러운 파란색과 청록색 그라데이션 액센트가 들어갑니다. 왼쪽 카드 'Gemini 3.8 Flash TTS'에는 2위 Elo 1,260, 아레나 보이스 8개, API 엔드포인트, 정규화 기준 100만 자당 $16.50이 나열됩니다. 오른쪽 카드 'Sesame'은 'Preview 앱 — 무료, 영어 전용, API 없음, 모델 ID 없음'과 'CSM-1B 체크포인트 — Apache 2.0, 2B 파라미터, Llama 백본'으로 나뉩니다. 하단 문구에는 'Elo는 Artificial Analysis Provider Voice Arena 기준, 2026년 9월; CSM-1B 세부 정보는 해당 모델 카드 기준.'이라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Gemini 3.8 TTS vs Sesame Preview: 하나는 다운로드, 다른 하나는 앱

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

다음 둘 사이의 비교를 검색해 보세요: Gemini 3.8 Flash TTSSesame Preview 그러면 이 둘을 같은 범주의 두 제품으로 다루는 글이 많이 나옵니다. 하지만 그렇지 않으며, 그 차이는 단순한 기술적 세부 사항이 아닙니다. Gemini 3.8 Flash TTS는 API 엔드포인트입니다. 모델 식별자, 공개된 요금표, Artificial Analysis Provider Voice Arena에서 1,999개 샘플에 걸쳐 Elo 1,260으로 2위를 기록한 리더보드 행, 그리고 문서화된 요청 형식이 있습니다. Sesame Preview는 이름이 있는 에이전트, 멀티턴 대화, 30분 통화 제한을 갖춘 무료 소비자용 음성 비서 앱입니다. 여기에는 API도, 모델 ID도, 요금제도, 그 보드의 점수도 없습니다.

Sesame 아티팩트 중 실제로 기반으로 삼을 수 있는 단 하나는 또 다른 것입니다: CSM-1B, Hugging Face의 Apache 2.0 체크포인트로, Llama 백본과 Mimi 오디오 디코더를 사용해 텍스트에서 오디오 코드를 생성합니다. 이는 사람들이 앱의 음성이 얼마나 사람처럼 들리는지 설명할 때 말하는 그 음성이 아닙니다. 그래서 비교는 답할 수 있는 질문으로 귀결됩니다: 음성 모델을 빌릴 것인가, 아니면 다운로드할 것인가?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

'Sesame'라고 불리는 두 가지, 그리고 그중 오직 하나만이 빌드 가능하다

명명 방식이 대부분의 혼란의 원인이므로, 더 나아가기 전에 그것을 분리하십시오.

• Sesame Preview — 앱. 무료로 사용할 수 있으며, 에이전트 이름은 Maya, Miles, Simone, Charlie이고, 턴 간에 지속되는 컨텍스트를 갖춘 멀티턴 대화, 웹 검색과 알림 기능, 영어만 지원, 통화 시간 30분 제한이 있습니다. 개발자용 인터페이스가 없습니다: 인증할 대상도, 사용량을 측정할 것도, 호출할 엔드포인트도 없습니다.

• CSM-1B — 체크포인트. Hugging Face에 sesame/csm-1b로 Apache 2.0 라이선스로 공개되었으며, Llama 백본과 Mimi 오디오 코드를 생성하는 더 작은 디코더를 갖추고 있습니다. 약 20억 개 파라미터, 영어, F32 가중치이며, Hugging Face Transformers를 통해 실행됩니다. 모델 카드에는 1B 변형이 2025년 3월에 출시되었고 네이티브 Transformers 지원이 2025년 5월에 도착했다고 기록되어 있습니다.

그 둘은 같은 회사와 연구 계보를 공유하지만, 관계는 대략 거기서 끝난다. 앱은 제품이고, 체크포인트는 그에 앞선 연구에서 나온 산출물이다. 앱의 대화 기억을 칭찬하는 리뷰어들은 음성 모델을 둘러싼 검색과 상태 관리를 갖춘 시스템을 설명하는 것이지, 다운로드할 수 있는 2B 체크포인트의 속성을 두고 하는 말이 아니다.

체크포인트에 실제로 무엇이 들어 있나요?

CSM-1B는 실행할 계획이 있는 사람이라면 누구에게나 중요한 아키텍처적 의미에서 텍스트 음성 변환 모델입니다. 텍스트와 오디오 컨텍스트를 입력으로 받아 RVQ 오디오 코드를 출력하고, 디코더가 이를 파형으로 변환합니다. 모델 카드에 있는 실용적인 사실은 다음과 같습니다:

• 라이선스 — Apache 2.0. 이것은 이 페이지에서 가장 중대한 한 줄이다. 연구 전용 가중치 라이선스와 달리, Apache 2.0은 별도의 계약 없이 상업적 사용을 허용하며, 이로 인해 CSM-1B는 진정으로 사용 가능한 몇 안 되는 오픈 음성 체크포인트 중 하나가 된다.

• 크기 — F32 기준 약 2B 매개변수. 동시 작업을 하려면 실제 하드웨어가 필요할 만큼 크고, 개발용으로는 단일 가속기에서 실행할 수 있을 만큼 작습니다.

• 언어 — 카드에 따르면 영어. 다국어 모델이 아닙니다.

• 트랙션 — 이 글을 쓰는 시점 기준 지난달 141,461회 다운로드되었으며, 리포지토리에는 약 245,000개의 좋아요가 있습니다. 이는 오픈 음성 모델 기준으로 널리 사용되는 체크포인트이며, 이 아티팩트가 앱에 대한 언론 보도와 무관하게 실제 사용자 기반을 갖추고 있다는 가장 강력한 근거입니다.

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

카드가 제공하지 않는 것은 무엇과도 비교할 수 있는 품질 주장이다. 아레나 순위표의 행도 없고, 제3자가 재현한 벤더 벤치마크도 없으며, 체크포인트의 출력이 앱의 출력과 어떻게 관련되는지에 대한 공개된 평가도 없다. 다운로드 가능한 모델이 앱처럼 들린다고 말하는 사람은 누구든 그 이름에서 추론하고 있는 것이다.

왜 직접 비교가 없으며, 그것이 왜 연구 공백이 아닌지

리더보드에 Gemini 3.8 TTS 대 Sesame Preview 비교가 없는 이유는, 있을 수 없기 때문입니다. 아레나는 청취자들이 호스팅된 엔드포인트에서 생성된 클립을 비교하도록 하여 모델 순위를 매깁니다. 이 비교 쌍의 한쪽은 엔드포인트가 없어서 등록될 수 없습니다.

그 점은 정확히 짚고 넘어갈 가치가 있다. 왜냐하면 "일대일 비교가 존재하지 않는다"는 말은 흔히 데이터가 빠져 있는 것처럼 쓰이기 때문이다. 그것은 빠진 게 아니다. 정의되지 않은 것이다. 비교되는 두 대상은 측정 가능한 공통의 면을 공유하지 않는다:

• Gemini 3.8 Flash TTS는 자체 호스팅 네이티브 음성으로 평가됩니다. Sesame Preview는 그런 의미에서 평가할 네이티브 음성이 없습니다 — 에이전트가 있습니다.

• Gemini 3.8 Flash TTS는 토큰 단위의 요금표를 공개합니다. Sesame Preview는 무료이며 아무것도 공개하지 않습니다. 청구할 것이 없기 때문입니다.

• Gemini 3.8 Flash TTS는 스크립트를 받아 오디오를 반환합니다. Sesame Preview는 대화를 받아 대화를 반환하며, 여기에는 앱이 그 위에 얹는 검색 및 메모리 기능이 무엇이든 포함됩니다.

정당한 비교에 가장 가까운 것은 Gemini 3.8 Flash TTS와 CSM-1B 사이의 비교이며, 그마저도 고르지 않다: 한쪽에는 독립적인 Elo와 공급업체 요금표가 있지만, 다른 쪽에는 둘 다 없다. 비교할 수 있는 것은 약속의 형태 — 종량제 API 대 다운로드 가능한 체크포인트 — 이며, 그 비교에는 리더보드가 필요하지 않다.

이것에서 숫자가 적혀 있는 유일한 면

이 조합에서 정량적인 모든 것은 구글 쪽에 있고, 그 자체가 핵심이다.

Artificial Analysis Provider Voice Arena에서 2026년 9월 24일 기준, Gemini 3.8 Flash TTS는 2026년 9월 23일 출시되어 1,999개 샘플과 8개 아레나 음성 전반에서 Elo 1,260으로 2위입니다. 그 자매 모델인 Gemini 3.8 Flash-Lite TTS는 1,235로 6위입니다. Google은 Flash TTS를 2026년 12월 31일까지 백만 텍스트 토큰 입력당 $0.50, 백만 오디오 토큰 출력당 $9.00로 청구하며, 이후에는 $18.00입니다. Flash-Lite TTS는 $0.50와 $6.00, 이후 $12.00입니다. Artificial Analysis는 이를 백만 문자당 $16.50와 $11.00로 정규화하여 다른 단위로 청구하는 모델들과 같은 보드를 공유할 수 있게 합니다. 그 정규화는 보드의 계산이며, Google의 인용이 아닙니다.

그에 반해 CSM-1B에는 가격이 없습니다. 계량기가 없기 때문입니다. CSM-1B에는 다운로드 수, 라이선스, 파라미터 수가 있습니다. 의사결정 프레임워크에 Elo가 필요하다면, 이 비교는 Sesame 쪽에 대한 Elo를 제공하지 않을 것이며, 솔직한 결론은 둘 중 하나가 입증되지 않았다기보다는 두 옵션이 서로 다른 기준으로 평가되고 있다는 것입니다.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

원했던 것이 앱 경험이었다면

이 비교를 검색하는 많은 사람들은 모델을 전혀 선택하고 있는 게 아닙니다. 그들은 Sesame 앱을 써 보고 대화가 느껴지는 방식이 마음에 들어서, 그것을 자신의 제품에 원합니다. 그것은 다른 문제이며, 다운로드로는 해결되지 않습니다.

앱이 그런 느낌을 주는 이유는 대부분 음성 모델 때문이 아닙니다. 턴 전반에 걸친 지속적 컨텍스트, 대화 중 웹 검색을 할지 결정하는 것, 에이전트가 언제 말할지의 타이밍 — 이런 것들은 오케스트레이션이며, 그중 어느 것도 2B 체크포인트에 들어 있지 않습니다. CSM-1B를 다운로드하면 목소리는 얻을 수 있습니다. 그 위에 앱의 동작을 구축하는 것은 당신의 엔지니어링이며, 30분 통화 제한과 API의 부재는 완성된 버전을 빌려 쓸 수도 없다는 뜻입니다.

원하셨던 것이 호출할 수 있는 음성 모델이라면, 솔직한 답은 Gemini 3.8 Flash TTS가 문서화된 인터페이스, 공개된 가격, 독립적인 평가 점수, 그리고 단일 요청에서의 2인 대화를 갖춘 선택지라는 것입니다. 원하셨던 것이 직접 보유할 수 있는 가중치라면, Apache 2.0 하의 CSM-1B가 둘 중 실제로 가질 수 있는 쪽입니다 — 그 대가는 하드웨어와 서빙 스택, 그리고 모든 품질 보증을 직접 마련해야 한다는 점입니다.

OrcaRouter는 이들 중 어느 것도 호스팅하지 않습니다. Google의 모델은 Google 자체 API와 9월 23일 발표에서 명시된 서피스를 통해 호출되며, CSM-1B는 직접 실행하는 체크포인트입니다. OrcaRouter가 맡는 것은 그 선택 위의 계층입니다: 200개 이상의 모델을 마크업 없이 공급자 정가로 단일 키 뒤에서 제공하므로 공급업체 요율 변경이 같은 날 반영되고, 자동 장애 조치로 실험적 경로가 프로덕션 의존성이 되지 않게 하며, 하나의 목소리로 전체 작업을 감당할 수 없을 때 모델들을 하나의 호출로 구성하는 라우팅 DSL을 제공합니다.

이 비교를 한마디로 줄이면, 사실 비교라고 할 수 없습니다. 한쪽에는 요율표와 Elo가 있고, 다른 쪽에는 라이선스와 다운로드 수가 있습니다. 실제로 채울 수 있는 열이 있는 쪽을 고르세요.