
Claude 음성 유출: Claude 앱의 숨겨진 "미리보기" 탭, 그리고 그 옆에 등장한 음성 데이터 옵트인
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 82 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
2026년 10월 4일 이전 어느 시점에, Claude 웹 인터페이스에 아직 표시되어서는 안 될 내비게이션 항목이 나타났습니다: 별도의 음성 탭이 내부 미리보기 라벨을 달고 있었습니다. 이에 대한 발표도, 모델 카드도, 가격 행도, API 항목도, 날짜도 없습니다. 같은 무렵 — 10월 5일에 보도됨 — 에 업체는 공개하지 않은 또 다른 무언가를 조용히 추가했습니다: 사용자가 음성 녹음과 음성 채팅 데이터를 "AI 모델을 개선하기 위해" 제공할 수 있게 하는 소비자 옵트인으로, 텍스트 대화에 대해 이미 요구하는 동의와는 별개입니다. 출시 라인업은 여전히 네 가지 텍스트 출력 모델 — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 그리고 Claude Haiku 5.5 — 이며, 자체 음성 모델을 출시한 적은 없습니다. 따라서 이 유출로 제기되는 유용한 질문은 "회사가 음성 모델을 출시하는가"가 아닙니다. 그 질문은 더 좁습니다: 그 탭은 인터페이스가 구축되고 있음을 입증하고, 옵트인은 회사가 음성 훈련 데이터를 원한다는 지금까지 나온 첫 번째 확실한 증거입니다. 이 둘은 서로 다른 주장이며, 날짜를 붙일 수 있는 것은 두 번째뿐입니다.
아래의 모든 내용은 확인된 것, 보도되었지만 검증되지 않은 것, 그리고 추론으로 분류되어 있습니다. Anthropic은 그 탭에 대해 전혀 언급하지 않았으며, 이는 핵심 사실의 출처가 보도자료가 아니라 스크린샷이라는 뜻입니다.
실제로 목격된 것, 그리고 그것이 우리에게 말해주지 않는 것
이 발견은 X의 @testingcatalog에서 비롯된 것으로, 2026년 10월 4일에 게시되었고 같은 매체에서 10월 10일에 기사로 작성되었다. 그 기사의 표현에 따르면, "별도의 Voice 항목이 내부 Preview 레이블과 함께 Claude의 웹 내비게이션에 나타났으며", "그 기능과 공개 이용 가능성은 아직 알려지지 않았다." 이것이 직접적인 증거의 전부다. 그 보고서는 이 레이블이 출시가 아니라 내부 미리보기 환경을 가리키는 것으로 명시적으로 규정한다.
그 아티팩트로부터 세 가지가 도출되며, 그중 어느 것도 명세가 아니다:
• 범위 — 내부 미리보기 라벨은 Anthropic 내부 어딘가에 빌드가 존재한다고 알려줄 뿐입니다. 그 빌드에 새 모델이 포함되어 있다는 뜻은 아닙니다. 내비게이션 탭은 UI입니다.
• 제공업체 — 보고서는 Anthropic이 "기반 음성 제공업체를 확인하지 않았으며," 자사 API를 통해 전용 텍스트 음성 변환 모델을 출시하지 않았고, 네이티브 엔드투엔드 실시간 오디오 모델을 출시하지 않았다고 지적한다. 마지막 두 가지는 검증 가능하며 사실이다. Anthropic의 공개 모델 문서는 현재 모델 네 개를 나열하며 네 가지 모두를 같은 방식으로 설명한다: 텍스트 및 이미지 입력, 텍스트 출력.
• 시기 — 보고되거나 암시된 날짜는 없다. 해당 글에 따르면, "공개 출시 시기에 관해서는 언급이 없다."
알아 둘 가치가 있는 선례가 있는데, 이는 양방향으로 작용한다. Anthropic은 전에도 미리보기 배너 아래에서 제품을 출시한 적이 있다 — Mythos 라인은 일반 공개에 앞서 미리보기로 나갔다 — 따라서 내부 Preview 라벨이 자동으로 잘못된 단서인 것은 아니다. 하지만 Anthropic은 또 몇 달 동안 프로덕션 코드에 출시되지 않은 음성 모드 플래그를 방치해 왔다: 2026년 4월 Claude Code 소스 패키지 유출로 음성 모드를 포함한 미출시 기능 플래그 세트가 드러났으며, 브리지 및 백그라운드 에이전트 작업도 함께 있었다. 음성 기능은 1년 훨씬 넘게 Anthropic에서 눈에 띄게 진행 중이었지만 음성 모델은 나타나지 않았다. 그 탭은 그런 이력과 일치하며 그 이력을 진전시키지 않는다.
옵트인은 날짜가 붙은 신호입니다
유출의 후반부는 스크린샷이 아니라 개인정보 보호 변경 사항이기 때문에 더 확실하다. 2026년 10월 5일 여러 매체가 보도한 바에 따르면, Anthropic은 사용자가 모델 개선을 위해 음성 녹음과 음성 채팅 데이터를 제공할 수 있는 선택적 설정을 추가했다. 보도된 프롬프트 문구는 "당사가 AI 모델을 개선하기 위해 귀하의 음성 데이터를 사용하도록 허용해 주세요"이며, 함께 나온 설명에는 오디오 및 음성 채팅 데이터가 모델이 음성을 처리하는 방식을 개선하는 데 도움이 된다고 되어 있다. 보도된 구체적 내용은 모두 동일한 보도 묶음에서 나온 것이다:
위치 — Claude의 설정 안, 개인정보 보호 아래에 명시적 동의 토글로 표시됩니다.
• 기본값은 비활성화입니다. 사용자에게 동의를 구하며, 자동으로 등록되지 않습니다.
• 그 범위 — 기존 텍스트 대화의 동의 메커니즘과는 별개라는 점이 가장 중요한 세부 사항이다.
• 가역성 — 보도에 따르면, 이후에 이 기능을 끄고 설정에서 음성 데이터를 삭제할 수 있습니다.
왜 별도의 동의가 중요한가: 전체 음성 파이프라인이 Anthropic 모델이 관여하지 않는 벤더 통합이었다면, 동의를 통합할 자연스러운 위치는 이미 존재했을 것이다. 별도의 음성 데이터 채널을 분리하는 것은 음성으로 학습할 의도가 있을 때 하는 일이다 — 새 모델을 위해서든, 기존 모델 내부의 특화된 음성 계층을 위해서든. 이는 증거가 아니라 인센티브에서 나온 논증이며, 그렇게 읽어야 한다. 정직한 반대 해석은, 음성 기능을 대규모로 운영하는 회사는 누가 오디오를 공급하든 자체 평가 코퍼스와 자체 실패 분석이 필요하다는 것이다. 또한 나중에 끌 수 있도록 설계된 옵트인은 결정을 내리는 동안 규정을 준수하는 가장 저렴한 방법이기도 하다.
이 변화가 실제보다 더 날카로워 보이게 만드는 맥락이 하나 더 있습니다. Anthropic이 상업용 제품에 대해 제공하는 자체 개인정보 보호 문서는 2026년 3월 16일자 글에서 "우리는 모델 학습을 위해 귀하의 음성을 사용하지 않습니다"라고 단호히 밝히며, 음성이 텍스트로 변환된 후에는 오디오 녹음이 삭제된다고 명시합니다. 그 글은 Claude for Work, Anthropic API 및 이와 유사한 상업용 서비스 영역을 대상으로 합니다. 새로운 옵트인은 소비자 측 설정입니다. 두 진술은 동시에 사실일 수 있습니다. 그리고 그것이 바로 한쪽 사업에서는 학습 데이터 파이프라인을 구축하면서 다른 쪽에서는 계약상 약속을 지키는 회사의 모습 그대로입니다.

Anthropic은 1년 동안 음성 제품을 보유해 왔지만, 그 기간 내내 음성 모델은 없었다
이것은 유출 보도가 흔히 건너뛰는 부분이며, 탭을 제대로 읽기 위해 필요한 맥락입니다.
Claude 음성 모드는 2025년 5월 모바일 앱의 음성 대화 기능으로 출시되었다. 처음부터 이 기능은 래퍼였다. Anthropic의 언어 모델이 추론을 담당했고, 음성 자체는 다른 곳에서 왔다. 그 스택은 공개된 적이 없다. 테크크런치가 2026년 7월 23일 음성 모드 업그레이드를 다뤘을 때, "Anthropic은 이번 릴리스에서 음성 모델에 아무런 변경도 가하지 않았다"는 점과 회사가 "어떤 종류의 음성 스택을 사용하는지 자세히 밝히지 않았다"는 점을 모두 짚었다. 2025년 이후의 보도는 ElevenLabs를 음성 공급업체로 지목해 왔는데, 이는 Anthropic이 확인한 어떤 내용에서라기보다 주로 Anthropic의 하위 처리업체 공시에서 추론된 것이다. 이 공급업체는 검증되지 않은 것으로 간주하라.
2026년 7월 업그레이드는 포함하지 않은 것 때문에 시사하는 바가 크다. 모델 선택 — Claude Haiku만이 아니라 Claude Opus, Claude Sonnet, Claude Haiku 중에서 고를 수 있게 된 것 — 과 Gmail, Calendar, Slack, Canva, Notion 커넥터, 더 긴 대화, 그리고 베타로 출시된 다국어 지원을 추가했다. 그 모든 변화는 오디오보다 앞선 단계에 있다. 오디오는 변하지 않았다.
Anthropic 자체 도움말 문서에 나와 있는 현재의 음성 모드:
• 모델 — 음성 모드는 텍스트 채팅에서 사용하는 것과 동일한 Claude 모델을 사용할 수 있으며, "텍스트 채팅에서 마지막으로 사용한 모델로 시작합니다." 한 가지 예외가 명시되어 있습니다: Claude Fable은 음성 모드에서 사용할 수 없습니다.
• 가용성 — Free부터 Enterprise까지 모든 플랜에서 제공되는 베타 기능으로, Claude 모바일, 데스크톱 및 웹에서 사용할 수 있지만 휴대폰에서 가장 잘 작동하도록 설계되었습니다.
• 음성 — "미리 설정된 제한적 선택"으로, 음성 복제나 사칭을 명시적으로 방지하기 위한 것입니다.
• 청구 — 음성 대화는 일반 요금제 한도에 포함됩니다. 별도의 음성 사용량 측정기는 없습니다.
• 한계 — 받아쓰기는 Claude Cowork와 Claude Code에는 있지만, 음성 모드는 없습니다.
• 언어 — 영어와 기타 언어, 비영어 언어는 여전히 베타로 표시됩니다.
그 모든 문장은 다른 누군가의 발화를 둘러싼 제품을 설명한다. 그중 어느 것도 음성 모델을 설명하지 않는다.
Voice 탭이 될 수 있는 세 가지, 그리고 그중 오직 하나만이 모델이다
이 유출을 과대해석하기 쉬운 이유는 세 가지 그럴듯한 미래가 모두 내비게이션 바에서는 똑같아 보이기 때문이다.
• 인터페이스 변경 — 전용 음성 화면, 프롬프트 바의 음성 버튼, 설정의 음성 선택기. Anthropic은 이미 2026년 2월에 이와 비슷한 것을 준비하고 있다고 보도된 바 있다. 그게 전부라면, 이 탭은 리디자인이고 기반 오디오 스택은 그대로다.
• 공급업체 교체 — 동일한 캐스케이드 아키텍처, 그 뒤에 다른 음성 벤더. 외부에서는 보이지 않는다. 이것만으로도 훈련 데이터 옵트인을 설명할 수 있는데, 보관이 허용된 오디오 없이는 공급업체 교체를 평가할 수 없기 때문이다.
• 네이티브 음성 대 음성 모델 — Anthropic이 자체 오디오 모델을 훈련하고 캐스케이드를 버리는 것. 이것은 비용이 많이 드는 해석이며, Claude 위에 무언가를 구축하는 누구에게나 중요한 해석이고, 동의된 음성 코퍼스가 필요한 유일한 해석이다. 또한 이는 증거가 아직 뒷받침하지 않는 해석이기도 하다.
그 탭은 그 둘을 구분할 수 없다. 다음 두 가지 확인 가능한 사실이 그것을 구분해 줄 것이다: Anthropic의 모델 목록에 오디오 모델 ID가 나타나는 것, 또는 Anthropic의 하위 처리업체 페이지에 새로운 음성 항목이 추가되는 것. 둘 중 어느 것도 일어나지 않았다.
Anthropic이 없는 곳
Anthropic이 이 계층을 장악하기까지 얼마나 멀리 떨어져 있는지 확인하는 가장 명확한 방법은 Anthropic이 등장하지 않는 곳을 살펴보고, 그다음 Anthropic이 실제로 공개하는 것을 살펴보는 것입니다. 독립적인 음성-대-음성 비교는 — Artificial Analysis가 추론, 대화 역학, 에이전트 성능 전반에 걸쳐 약 40개 모델을 아우르는 비교를 유지하고 있습니다 — Gemini 3.8 Live, GPT-Realtime-2 및 GPT-Live-1, Qwen Audio 3.0 Realtime, Grok Voice Think Fast 2.0, StepAudio 3 Realtime, Nova 2.0 Sonic, NVIDIA, Kyutai, 그리고 소수의 오픈소스 노력들의 네이티브 오디오 모델로 채워져 있습니다. Anthropic은 그런 목록 어디에도 나타나지 않습니다. 별도의 항목 세트는 캐스케이드 음성 에이전트 파이프라인 — 음성-텍스트 모델, LLM, 텍스트-음성 모델이 함께 연결된 — 을 다루는데, 이는 Anthropic 자체 음성 모드가 가장 닮은 아키텍처입니다. 그에 반해, Anthropic 자체 모델 문서는 명확합니다: 네 개의 현재 모델이 있으며, 모두 동일한 방식으로 설명됩니다 — 텍스트 및 이미지 입력, 텍스트 출력, 페이지 어디에도 오디오 모델 ID가 없습니다.

그것은 제품에 대한 비판이 아닙니다. 그것은 오늘날 가치가 어디에서 포착되고 있는지에 대한 진술이며, Voice 탭이 왜 흥미로운지를 설명해 줍니다: 음성은 다른 모든 프런티어 랩이 자체 모델을 보유하고 있지만 Anthropic은 그렇지 않은 유일한 모달리티입니다.
별다를 것 없는 이번 달에 그것에 대해 어떻게 해야 할까
이 모든 것의 실질적인 의미는 10월 4일 빌더에게 달라진 것이 전혀 없었다는 것입니다. 보이스 모드는 7월과 같은 제품입니다. 어떤 모델 ID도 추가되거나 폐기되지 않았습니다. 가격도 변동되지 않았습니다. 오늘 Claude에서 음성을 출시하고 있다면, 당신은 캐스케이드를 출시하는 것입니다: 생각을 위한 Claude 모델, 말하기를 위한 별도 모델, 그리고 그 사이를 이어 주는 글루입니다. 유출이 그 사실을 바꾸지는 않으며, Preview라고 적힌 탭을 중심으로 구축하는 것이 바로 팀이 결국 누군가의 내부 브랜치에 로드맵 의존성을 안게 되는 방식입니다.
이것이 주장하는 바는 스택의 음성 쪽을 교체 가능하게 유지하라는 것입니다. 왜냐하면 실제로 락인이 발생하는 곳은 그 연결 구조, 즉 어디서든 호출할 수 있는 Claude 모델이 아니라 음성 벤더에 맞춰 작성한 접착 코드에 있기 때문입니다. 구체적으로 Claude 쪽은 이미 라우팅이 가능합니다: Claude Opus 5.5, Claude Sonnet 5.5, Claude Fable 5.1, Claude Haiku 4.5가 OrcaRouter 카탈로그에 있으며 Anthropic의 정가에 0% 마크업으로 제공됩니다 — 공급자 정가가 그대로 전달되므로 Anthropic이 가격을 인하하면 같은 날 바로 저희 쪽에도 반영됩니다 — 그리고 이들과 함께 사용할 텍스트 음성 변환 모델(Gemini의 TTS 프리뷰, tts-1-hd 등)도 동일한 키 뒤에 있습니다. 음성 파이프라인의 양쪽 절반을 위한 단일 엔드포인트라는 것은 벤더 교체가 두 번째 계약이 아니라 모델 문자열 변경에 불과하다는 뜻이며, 자동 페일오버 덕분에 파이프라인의 검증되지 않은 절반이 호출 실패 대신 작동하는 폴백으로 저하됩니다.
{{1}}실제로{{/1}} 이것을 확인해 줄 것은 무엇인가
추측은 접어두고 구체적이며 확인 가능한 네 곳을 보라. 각각은 날짜를 특정할 수 있는 사건이고, 그중 어느 하나라도 이것을 유출에서 뉴스로 바꾼다:
• Anthropic의 모델 문서나 Models API 목록에 오디오 입력 또는 오디오 출력이 있는 새 항목이 추가되는 것. 그것이 자사(퍼스트파티) 음성 모델의 존재를 증명하는 유일한 산출물이다.
• Anthropic의 하위 처리업체 페이지에 음성 관련 추가 사항. 그것은 오히려 반대를 증명한다 — 내부 모델이 아니라 새로운 외부 공급업체라는 점을.
• 소비자 앱에서 Voice 탭이 Preview 라벨을 잃는 것. 그것이 롤아웃이며, 그 기능이 관찰 대상이 아니라 검토 대상이 되는 순간이다.
• 가격 논쟁. 앤스로픽은 자기가 파는 것에 값을 매긴다. 분당 음성 가격이야말로 어떤 벤치마크보다 아키텍처 문제를 더 빨리 정리해 줄 것이다.
그중 하나라도 실현되기 전까지, 2026년 10월에 대한 정확한 요약은 이것이다. Anthropic은 음성 인터페이스를 구축하고 있고, 사상 처음으로 동의를 받은 음성 데이터를 수집하고 있으며, 아직까지 음성 모델을 한 번도 출시한 적이 없다. 그 탭은 이 세 가지 사실 중 가장 정보가 적은 동시에 가장 멀리 퍼진 것이다.

열린 질문은 Anthropic이 더 나은 음성 경험을 원하는지가 아니다 — 그 점은 옵트인이 답한다. 문제는 Anthropic에서 '더 나은 음성'이 자사가 소유한 모델을 뜻하는지, 아니면 더 신중하게 관리하는 벤더를 뜻하는지다. 그 두 경로는 한동안 외부에서 똑같아 보이다가, 그다음에는 전혀 달라 보인다.
