Breeze TTS 2 — 1,215 Elo에서 새로운 오픈 가중치 TTS 리더. 재생성된 일러스트레이션.
Guides & Insights

Breeze TTS 2: 1,215 Elo의 새로운 오픈 가중치 TTS 선두주자

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Breeze TTS 2는 이제 Artificial Analysis의 Provider Voices Speech Arena에서 오픈 가중치 텍스트 음성 변환 모델 중 1위에 올랐다. 1,215 Elo를 보유하며, 이전 오픈 가중치 선두였던 Fish Audio S2 Pro보다 90포인트 앞서고, 100개 이상의 평가된 시스템 중 전체 6위를 기록했다. 이 순위 배정은 BreezeBlue가 2026년 8월 중순에 모델을 공개한 이후 줄곧 주장해온 바를 독립적으로 처음 확인해준 것이다. 즉, 약 15명 규모의 스타트업이 만든 2주 된 음성 모델이 상용 텍스트 음성 변환 최전선에 설 수 있다는 것이다. 오픈 가중치는 2026년 8월 25일 Hugging Face에 공개되었고, 아레나 결과는 하루 만에 뒤따랐다. Breeze TTS 2가 어떤 모델로 자리매김하든, 더 이상 벤더의 약속이 아니다 — 이를 증명하는 Elo가 있기 때문이다.

실제로 무슨 일이 일어났는지, 순서대로

여기서 타임라인이 중요한 이유는, 왜 대부분의 사람들이 3주 전까지만 해도 들어보지 못한 회사에서 "오픈 가중치 리더보드" 게시물이 나오는지 설명해 주기 때문입니다. BreezeBlue는 중국 최고의 AI 연구소 중 하나의 기술 공동 창업자였던 양빈(Yang Bin)이 위안징 캐피탈(Yuanjing Capital)과 레드포인트 차이나(Redpoint China)가 주도한 600만 달러의 시드 라운드로 설립했습니다. 이 모델은 세 가지 눈에 띄는 이정표를 거쳤습니다:

• 2026년 8월 7일 — BreezeBlue가 음성 디자인, 음성 연출, 지연 시간 평가를 위한 자체 텍스트 음성 변환 벤치마크 제품군을 Hugging Face에 게시했습니다.

• 2026년 8월 16~17일 — 회사는 Breeze TTS 2를 인터랙티브 미디어를 위한 실시간 플래그십 음성 모델로 공식 발표하고, 100만 자당 34달러에 호스팅 API를 열었다.

• 2026년 8월 25일 — 가중치와 PyTorch 추론 코드가 Hugging Face에 BreezeBlue/Breeze-TTS-2로 오픈소스화되었으며, 이는 연구 및 비상업적 라이선스 하의 3B 파라미터 모델입니다.

Artificial Analysis Provider Voices 순위는 오픈 가중치가 공개된 지 며칠 만에 라이브로 제공되었습니다. 아레나가 블라인드 방식의 나란히 듣기 비교로 모델을 평가하기 때문에, 1,215 Elo는 BreezeBlue가 자체적으로 실행한 벤치마크가 아니라 실제 샘플을 비교한 청취자들이 축적한 판단입니다. 바로 이것이 이렇게 어린 모델에게 가장 부족한 것입니다.

점수판

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• 아레나 순위 — Provider Voices 전체 6위, 모든 오픈 웨이트 모델 중 1위로 Fish Audio S2 Pro(1,125 Elo)를 앞섰습니다.

• Elo — 1,215, 95% 신뢰구간은 약 ±17 (Artificial Analysis, 2026년 8월 말 기준).

• 언어 — BreezeBlue 기준 50개; 모델 카드는 영어와 중국어로 태그되어 있습니다.

• 가격 — BreezeBlue 호스팅 엔드포인트에서 1M 문자당 $34이며, 오픈 가중치는 무료로 다운로드할 수 있지만 비상업적 라이선스가 적용됩니다.

• 속도 — Artificial Analysis 측정 기준 약 초당 45자 — 여러 경쟁 제품보다 느린 수준이며, 장문 작업에 중요합니다.

• 지연 시간 — BreezeBlue 기준 40ms 미만의 스트리밍 지연 시간(공급업체 명시 사항이며, 독립적으로 측정된 값이 아님).

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

Breeze TTS 2가 실제로 다르게 하는 것

Elo가 헤드라인을 차지하지만, 제품 주장이 점수보다 더 흥미롭습니다. Breeze TTS 2는 대부분의 텍스트 음성 변환 모델이 부차적인 것으로 취급하는 두 가지 아이디어를 중심으로 구축되었습니다: 음성 설계 및 음성 연출. 음성 설계는 제로샷 및 레퍼런스 프리 방식입니다. 자연어로 음성을 설명하면("따뜻하고 40대 중반의 내레이터, 약간의 남부 사투리와 건조한 위트를 가진"), 모델은 스튜디오 녹음이나 레퍼런스 클립 없이 해당 음성을 생성합니다. 음성 연출은 화자의 음색과 전달 의도를 분리하므로, 모델이 다른 캐릭터로 흘러가지 않으면서도 대사를 비꼬거나, 속삭이거나, 급하게 들리게 만들 수 있습니다. BreezeBlue는 동일한 화자 정체성이 이러한 변화 속에서도 유지된다고 주장하며, 자체 음성 연출 벤치마크에서 화자 유사도 0.67 SPK_SIM(벤더 제공)을 보고했습니다.

이 두 가지 기능은 Breeze TTS 2의 목표 시장을 가리킵니다. 보도 자료는 분명합니다: 비디오 게임 캐릭터, 디지털 컴패니언, 내러티브 스토리텔링, 방송 드라마, 그리고 가상 스트리머 — 단순한 또 하나의 내레이션 API가 아니라, 장시간의 역할 중심 다중 캐릭터 오디오입니다. 이 회사는 컴패니언 보이스 라이브러리인 Voice Galaxy를 제공하며, 여기에는 15,000개 이상의 커뮤니티 및 스튜디오 제작 캐릭터 음성이 포함되어 있습니다. BreezeBlue의 데모 릴은 10분이 넘는 다중 캐릭터 팬 라디오 드라마입니다. 자체 발표한 벤치마크(벤더 보고, 미재현)에서 Breeze TTS 2는 텍스트 음성 변환 Voice Design 벤치마크에서 1위를 차지했다고 주장하며, Role Fit 점수는 78.02로 MiMo-V2.5-TTS의 72.78을 앞섰고, Voice Direction 복합 점수는 4.25입니다.

라이선스 별표

'open weights'라는 표현이 너무 많은 마케팅 역할을 하기 전에 모델 카드를 읽어 보세요. Breeze TTS 2는 3B 파라미터, safetensors, F32/BF16이고, 그 소스 코드는 Apache 2.0입니다. 그러나 가중치, 파생 모델, 자체 호스팅 출력물은 breezeblue-research-and-non-commercial-license에 따라 연구 및 비상업적 용도로만 사용이 허가됩니다. 즉, 여기서의 'open weights'는 '당신의 제품에 무료로 사용할 수 있는 것'이 아닙니다. 상업적 자체 호스팅은 라이선스 조항에 따라 허용되지 않으며, 상업적 경로는 호스팅 API를 통해 문자 100만 자당 34달러입니다. 이는 2026년의 다른 여러 오픈 릴리스와 같은 형태입니다 — 연구 목적으로는 검사 및 자체 호스팅이 가능하지만, 수익 창출 용도는 공급업체 자체 엔드포인트에 유보되어 있습니다.

이렇게 어린 모델에게 라우터가 중요한 이유

지금 Breeze TTS 2의 솔직한 리스크는 품질이 아니라 나이입니다. 모델은 공개된 지 10일, 가중치는 공개된 지 2일밖에 안 됐습니다. 어떤 프로덕션 팀도 이렇게 어린 모델에, 그 모델에서 이탈할 방법도 없이 음성 파이프라인을 걸어서는 안 됩니다. 그리고 그것이 바로 라우팅 레이어가 흡수하기 위해 존재하는 실패 모드입니다. 공급업체 엔드포인트를 여러 경로 중 하나로 취급하는 게이트웨이를 통해 Breeze TTS 2를 평가한다면, 오늘의 Elo 리더를 얻게 되고, API가 저하되면 폴백 공급자로 자동 페일오버되며, 일주일 된 모델이 회귀를 보이면 한 줄만 고치면 됩니다. 이것은 라우팅 DSL이 모든 모델에 적용하는 것과 같은 규율입니다. 대안과 함께 구성하고, 인터페이스를 안정적으로 유지하고, 모델이 핵심 역할을 맡기 전에 스스로 증명하게 두는 것입니다. 이 시리즈의 어떤 모델도 아직 OrcaRouter 자체에는 라우팅되어 있지 않습니다. 따라서 솔직한 조언은, Breeze TTS 2를 이미 운영 중인 게이트웨이에 연결하고 — Elo가 더 오래되고 더 믿을 만해지는 동안 — 현재 공급자도 계속 함께 라이브 상태로 두라는 것입니다.

다음에 볼 콘텐츠

Provider Voices #1-open-weights 자리는 오늘의 화제이지만, 이 모델에게는 두 아레나 중 더 약한 쪽이다. 모든 모델이 동일한 고정 참조 음성으로 비교되는 Artificial Analysis의 Controlled Voice 아레나에서 Breeze TTS 2는 오픈 가중치 모델 중 1,002 Elo로 3위, Mistral의 Voxtral(1,010)에 이어 전체 39개 중 16위다. 프로바이더 음성 점수(1,215, 오픈 1위)와 통제 음성 점수(1,002, 오픈 3위) 사이의 격차는 주목할 만하다. 이는 Breeze TTS 2의 장점이 자체적으로 설계한 음성에 집중되어 있음을 시사하는데, 이는 정확히 제품의 주장이자 독립적인 벤치마크가 계속 압박해야 할 주장이기도 하다. 통제 음성 Elo가 프로바이더 음성 수치에 수렴하는지, 상업용 라이선스가 강화되거나 완화되는지, 그리고 무엇보다 BreezeBlue 자체 스위트 밖에서 음성 설계 및 음성 방향 벤치마크를 재현하는 사람이 나타나는지 지켜보라.

한 달 전만 해도 존재하지 않던 모델인 Breeze TTS 2는 이미 텍스트 음성 변환 모델이 얻을 수 있는 가장 유용한 것을 획득했다. 바로 마케팅과 일치하는 독립적인 점수다. 이 모델이 대화형 제품의 기본 음성이 될지는 다음 Elo 업데이트보다는 라이선스와 셀프 호스팅 스토리가 어떻게 전개되느냐에 더 달려 있다. 하지만 이번 주 기준으로 오픈 웨이트 텍스트 음성 변환에는 새로운 선두주자가 생겼고, 그 나이는 겨우 2주다.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.