
AuK: 텐센트, 모든 오디오 작업을 텍스트 명령으로 취급하는 1.5B 음성 모델을 조용히 오픈소스로 공개
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
오늘날 다운로드할 수 있는 그 어떤 단일 음성 도구도 한 번에 해내지 못할 문장이 여기 있다: 이 녹음을 가져다가 "house"라는 단어를 "home"으로 바꾸고, 음높이를 반음 올리고, 마지막 구절 앞의 숨소리를 없애고, 배경 잡음을 제거한 다음, 그 결과를 "따뜻한 중년 남성에 약간의 광둥어 억양"이라고만 묘사된 완전히 새로운 목소리로 다시 읽어라. 그 문장에 대한 텐센트의 답은 AuK다. 15억 개 파라미터의 "음성 생성 및 편집을 위한 파운데이션 모델"로, 이번 주에 아무런 출시 게시물도, 보도자료도 없이 오픈소스로 공개됐다. 그리고 그 증류된 형제 모델 AuK-Flash는 이제, 우리가 처음 이 기사를 썼을 때 이 이야기에 빠져 있던 바로 그 한 가지, 즉 숫자가 붙은 기술 보고서를 함께 내놓는다. "AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing"(arXiv:2609.08936, cs.SD, 2026-09-08 제출)은 이제 Hugging Face 모델 카드와 GitHub README 양쪽에서 인용되고 있으며, 논문 목록 날짜는 2026-09-08, 코드 저장소 자체의 뉴스 항목 날짜는 2026/09/09로 되어 있다. 그 보고서가 하지 않는 일은 정작 중요했던 질문을 해결하는 것이다 — 그 안의 모든 수치는 텐센트 자체 수치이고, 텐센트가 고른 베이스라인에 대해 산출된 것이며, 2026-09-10 현재 회사 밖에서는 아무도 단 하나도 재현하지 못했다.
이것은 현재까지 알려진 내용을 정리한 글이며, 한 차례 개정되었습니다. Tencent는 우리가 찾을 수 있는 주요 채널 어디에서도 아직 AuK를 발표하지 않았습니다. 따라서 확인된 기록은 다음과 같습니다: AuK와 AuK-Flash의 Hugging Face 모델 카드 및 저장소, Tencent-Hunyuan 조직 아래의 코드 저장소, auk-project.github.io의 프로젝트 사이트, 그리고 이제 논문입니다. 그 마지막 추가 사항은 알 수 있는 범위를 바꿉니다 — 아키텍처, 학습 레시피, 평가 수치가 처음으로 자세히 설명됩니다 — 검증된 내용은 바꾸지 않습니다. 아래의 모든 수치는 벤더가 보고한 것으로 취급하십시오. 정확히 그렇기 때문입니다. 그리고 이 보고서의 비교는 전적으로 다른 오픈 모델을 대상으로 한 것이며, AuK가 실제로 경쟁하게 될 폐쇄형 호스팅 음성 플랫폼을 대상으로 한 것이 아니라는 점에 유의하십시오.
실제로 출시된 것은 무엇이며, 얼마나 조용히 이루어졌는가
타임라인은 여전히 이번 릴리스에 관해 가장 정직한 요약이며, 1차 검토에서 한 가지만 바로잡으면 이렇다. Hugging Face 리포지토리들은 8월 중순에 만들어졌다 — AuK는 2026-08-18 — 하지만 이번 주까지 아무 움직임 없이 잠겨 있었다. 우리가 2026-09-09에 AuK 모델 카드를 읽었을 때, 그 안의 단 하나뿐인 뉴스 줄에는 2026-09-07 날짜가 붙어 있었다. 하루 뒤 같은 줄은 2026/09/09로 표시되며 독자들을 논문과 데모 Spaces로 안내한다. 추론 및 학습 코드를 담고 있는 GitHub 리포지토리는 2026-08-19에 만들어졌고 마지막 푸시는 2026-09-09에 이루어졌다. 다시 말해 가중치, 그다음 코드, 그다음 기술 보고서 — 나흘 동안 세 차례의 단계적 공개이며, 이 글을 쓰는 시점까지도 Tencent의 주요 채널에서는 여전히 어떤 발표도 없다.
• 모델 가중치는 Hugging Face의 tencent org에 있으며, ModelScope의 Tencent-Hunyuan에도 미러링되어 있습니다 — 두 미러 모두 동일한 MIT 라이선스입니다.
• 각 모델 리포지토리에는 단일 safetensors 체크포인트와 config, VAE가 들어 있습니다. AuK의 경우 auk_base.safetensors(6.12GB)와 vae.safetensors(0.64GB)가 있으며, AuK-Flash도 동일한 구성입니다. 모델 카드는 추가로 Qwen/Qwen2.5-Omni-3B를 다운로드하라고 안내하는데, 이는 AuK가 런타임에 별도로 로드하는 텍스트 인코더입니다.
• “아무도 알아차리지 못했다”는 프레이밍은 수명을 다했고, 그것도 빠르게 그렇게 됐다. 2026-09-09에 확인했을 때 코드 저장소는 별 0개, 포크 0개에 머물러 있었다. 2026-09-10 기준으로는 별 216개, 포크 12개, 첫 오픈 이슈를 보여준다. AuK 카드는 지난달 약 30회의 다운로드와 좋아요 26개를 보고한다. 변하지 않은 점: 토론 탭은 비어 있고, 카드에는 여전히 해당 체크포인트가 어떤 추론 제공자에 의해서도 배포되지 않았다고 적혀 있다.
• 모델 카드 두 개, README, 논문 모두 Hugging Face와 ModelScope의 데모 Space를 링크합니다. 확인했을 때 Hugging Face Space는 로그인 없이는 공개적으로 접근할 수 없었으므로, 익명 사용자의 경우 "브라우저에서 사용해 보기" 경로는 확인되지 않은 것으로 간주하세요.

위의 Hugging Face 카드는 여전히 설치 가능한 릴리스의 공개 표면 전체입니다: 모델 카드, config, 두 개의 safetensors 파일, 그리고 라이선스입니다. 그 이후 추가된 것은 그 주변의 문서 계층, 즉 논문, 벤치마크 표, 인용 블록이며, 그중 어느 것도 그 뒤에 변경 로그도, 토론 스레드도, 추론 제공자 목록도 없다는 사실을 바꾸지 않습니다.
핵심 제안: 하나의 지시 인터페이스, 열여섯 가지 음성 작업
AuK의 주장은 이것이 지금까지 공개된 최고의 텍스트 음성 변환 모델이라는 것이 아니다. 생성이 모델이 단일 자연어 인터페이스를 통해 수행하도록 훈련된 다섯 가지 음성 작업 계열 중 하나에 불과하다는 것이다. 여기서 요청은 텍스트와 선택적 참조 오디오 파일을 함께 담을 수 있는 채팅 메시지다. 논문은 프로젝트 사이트가 이미 홍보하고 있던 분류 체계를 정확히 공식화한다:
• 음성 생성 — 제로샷 TTS(참조 클립의 목소리로 이 텍스트를 말하기) 및 명령 TTS(참조 오디오 없이 목소리 설명만으로 음성을 생성하기).
• 내용 편집 — 기존 녹음에서 단어를 교체, 삽입 또는 삭제하여 말한 내용을 다시 쓰는 작업; 그리고 가사 편집은 선율과 목소리를 유지하면서 노래 가사를 다시 쓰는 작업입니다.
• 음향 편집 — 반음 단위 피치, 말하기 속도 조절, 데시벨 단위 음량.
{{KEEP}}Paralinguistic editing{{/KEEP}} — 감정 변화, 설명에 따른 음색 변화, 액센트 제거, 비언어적 소리(숨소리, 웃음, 기침) 추가 또는 제거, 그리고 화자를 유지하면서 일반 발화와 속삭임 사이를 전환하는 것.
—향상 및 분리: 음성 잡음 제거 및 잔향 제거, 발화 순서에 따른 음성 분리, 음악/보컬 분리, 그리고 화자가 말하는 내용으로 식별되는 대상 화자 추출.
인스트럭션 TTS 사례는 이것을 일반적인 보이스 클로닝 릴리스와 구분 짓는 지점이다. AuK는 오직 텍스트 설명으로만 존재하는 목소리로 문장을 읽는데, 문서에 실린 예시 자체는 막 집에 돌아온 파트너에게 말을 거는 20대 여성으로, 따뜻하고 다정하며 가볍게 교태를 부리고, 부드럽고 달콤한 음색에 문장 끝이 약간 올라가는 어조를 지니며, 참조 클립이 전혀 첨부되지 않은 경우를 지정한다. 이는 참조 녹음의 필요성을 없애는데, 이것이 바로 클로닝의 통상적인 진입 장벽 비용이다. 그 보고서는 그 작업에 처음으로 수치를 제시했으며, 이는 AuK가 경쟁 진영을 근소하게 앞서는 것이 아니라 확실히 앞서는 몇 안 되는 부분 중 하나다.
"1.5B" 안에서: 그 숫자는 런타임을 과소평가한다.
AuK의 파라미터 수는 확산 트랜스포머를 설명하는 것이지 전체 파이프라인을 설명하는 것이 아니며, 이제 논문은 양쪽 절반을 모두 명시한다. 백본은 하이브리드 rectified-flow 트랜스포머로, 10개의 듀얼 스트림 MMDiT 블록 뒤에 20개의 통합 단일 스트림 DiT 블록이 이어지는 30개 레이어로 구성되며, 히든 크기 1536, 차원 64의 어텐션 헤드 24개, SwiGLU 중간 너비 3072를 가지며, 여기서 "약 15억 파라미터"라는 수치가 나온다. 그 주위에는 별도로 로드되는 두 구성 요소가 있다: 지시문과 참조 오디오를 의미론적 조건으로 변환하는 멀티모달 LLM(Qwen/Qwen2.5-Omni-3B)과, 설정에서 BigVGANFlowVAE라고 부르는 causal 24 kHz 오디오 VAE — 후자는 50 Hz 프레임 레이트에서 64차원 잠재 변수를 실행하며, 인코더 채널 폭은 최대 768, 디코더는 최대 1536이다. 따라서 전체 런타임은 약 1.5B 백본에 3B 인코더와 VAE를 더한 것이며, 다운로드 안내에서는 인코더가 자체 약관을 가진 별도의 체크포인트임을 명확히 밝힌다.
보고서에 따르면 훈련은 여러 단계로, 그리고 프로젝트 사이트가 겨우 암시했을 뿐인 규모로 진행되었다. 생성만으로 이루어진 50,000회 업데이트의 워밍업, 이어서 600,000회의 생성 및 편집 공동 업데이트가 약 195만 시간의 효과적 감독에 해당하는 약 30억 3천만 개의 명령–오디오 인스턴스에 대해 256개 GPU에서 수행되었고, VAE에는 추가로 124만 회의 업데이트가 이루어졌다. 사후 훈련은 인간 피드백 선호도 최적화와 보상 기반 강화 학습을 결합했으며, 818개의 유용한 선호 그룹과 9,080개의 평가된 후보, 10,000개의 제로샷 및 5,000개의 명령 수행 프롬프트로 이루어진 RL 프롬프트 풀, 30,000개의 스타일 판정 샘플, 그리고 Qwen2.5-Omni-7B에서 미세 조정된 보상 모델을 기반으로 했다. 이는 1.5B 오픈 릴리스로서는 상당한 사후 훈련 스택이며, "오픈 가중치"가 산출물을 설명하는 것이지 그것을 만들어낸 컴퓨팅을 설명하는 것은 아니라는 점을 상기시켜 준다 — 재현할 수 있을지 따져볼 때 붙들고 있을 만한 점이다.

그 명세서에 있는 모든 수치는 우리가 측정한 것이 아니라 텐센트 자체의 리포지토리와 웹사이트에서 읽어온 것이며, 논문도 그 점을 바꾸지 않았습니다 — 다만 그런 항목 중 더 많은 것을 "주장됨"에서 "문서화됨"으로 옮겼을 뿐입니다. 우리가 처음 발표한 이후 실제로 검증된 유일한 숫자는 그 리포지토리 자체의 활동량으로, 하루 만에 스타 0개에서 수백 개로 늘었습니다.

프로젝트 사이트는 아키텍처 다이어그램과 학술 공동 브랜딩이 자리 잡고 있는 곳으로 남아 있으며, 여전히 모델의 형태를 확인하는 가장 저렴한 방법이다: 의미적 컨디셔닝을 위한 멀티모달 언어 모델, 음향을 위한 50 Hz VAE, 그리고 플로 매칭 목적 아래의 하이브리드 트랜스포머. 처음 살펴보았을 때 점수 없이 평가 도구만 나열했던 그 벤치마크 섹션에는 이제 참고할 논문이 생겼다.
기술 보고서가 공개되었고, 그 수치는 텐센트 자체에서 나온 것이다
이것이 이번 업데이트의 핵심 내용입니다. 이 논문은 일곱 개의 평가 스위트 전반에 걸친 결과를 보고합니다 — 프로젝트 사이트가 숫자 없이 광고해 오던 바로 그 목록입니다 — 그리고 대부분의 생성 및 콘텐츠 편집 축에서 AuK가 오픈 진영에서 앞서 있습니다. 이것을 벤더 벤치마크 표로 읽으십시오. 실제로 그렇기 때문입니다: tencent가 모든 비교를 수행했고, 모든 베이스라인을 선택했으며, 하네스를 재현할 코드는 아직 공개하지 않았습니다.
• Seed-TTS-Eval의 제로샷 TTS에서 AuK는 평균 2.65 WER와 0.795 화자 유사도를 기록한 반면, Qwen3-TTS는 3.07과 0.745, Seed-TTS는 3.65와 0.778, VoxCPM2는 3.65와 0.767을 보였다. AuK-Flash는 2.85와 0.790을 기록했다. 최고의 개별 분할 결과는 영어 테스트 세트에서 1.02 WER, 중국어 하드 세트에서 5.91이다.
InstructTTSEval의 명령 제어 TTS에서 AuK는 중국어에서 83.37, 영어 설명 따르기에서 81.60을 기록했으며, 이는 Qwen3-TTS-VD의 81.10, 82.40 및 MOSS-VoiceGenerator의 80.00, 82.00과 비교됩니다. AuK-Flash는 중국어에서 78.80이지만, 82.40으로 해당 분야 최고 영어 점수와 동률을 이뤘습니다.
• SpeechEditBench의 콘텐츠 편집: Ming-UniAudio의 76.46에 맞선 91.83 정확도, 그리고 운율 부문에서 26.50에 맞선 71.33 — 보고서 전체에서 가장 큰 두 격차입니다.
• Ming-Freeform-Audio-Edit의 명령어 기반 편집, 전체 설정: Ming-UniAudio와 비교해 중국어에서는 단어 오류가 10.46에서 3.09로, 영어에서는 14.28에서 3.96로 감소하며, 편집 정확도는 79.62에서 91.47로, 70.98에서 85.25로 상승합니다. 음향 편집에서는 동일한 비교에서 중국어 단어 오류가 5.01에서 2.02로, 영어는 10.75에서 3.48로 낮아집니다.
MMAE-Speech에서의 준언어적 편집: 지시 수행률 48.23, 콘텐츠 재작성 88.11로, Step-Audio-EditX의 43.52와 77.27, Ming-UniAudio의 34.13과 76.01을 앞선다. AuK-Flash는 표에서 13.85로 가장 높은 편집 모델 재현율을 기록했다.
• 복원: 모델이 압도적이라기보다 경쟁력 있는 경우 — DNS Challenge는 비동기화 단어 오류 2.66, 화자 유사도 0.99로 RE-USE의 3.31에 맞서고; CHiME-4는 단어 오류 7.98로 RE-USE의 10.71에 맞서며; Libri2Mix는 단어 오류 9.12로 MossFormer2-SS의 9.34에 맞서고; VCTKSR은 단어 오류 3.06, 유사도 0.97.
• VAE 자체를 별도로 평가하면: AuK-VAE는 음성에서 PESQ 4.143, 일반 오디오에서 3.833, 음악에서 3.884에 도달한 반면, MiniMax-H3-AudioVAE는 3.633, 2.835, 2.801에 머물렀습니다 — 이는 겉보기보다 더 중요한 완승입니다. 손실성 음향 잠재 표현은 그 위에 구축되는 모든 작업의 성능을 제한하기 때문입니다.
그 글머리 기호 항목들 전반에 걸친 패턴은 헤드라인 성과보다 더 흥미롭다. AuK는 "말해지는 내용이나 들리는 방식을 바꾸고 나머지는 모두 유지하는" 모든 작업, 즉 콘텐츠 편집, 운율, 음향 편집, 재구성에서 훨씬 앞서 있다. 감정 및 준언어적 편집에서는 해당 분야와 훨씬 비슷한데, 둘 다 취약한 벤치마크에서 AuK의 SpeechEditBench 감정 정확도 9.94는 Ming-UniAudio의 3.43과 거의 구분되지 않으며, 전체 음향 점수 37.07은 베이스라인들과 같은 범위에 있다. 따라서 "모든 음성 작업을 위한 하나의 모델"은 텐센트의 프레이밍이다. 보고서가 실제로 보여주는 것은 그중 여러 작업에는 탁월하고 나머지에는 그저 존재하는 정도인 하나의 모델이다.
두 개의 체크포인트: AuK 및 AuK-Flash
텐센트는 동일한 MIT 라이선스로 두 가지 변형을 출시했다. AuK는 완전한 품질의 베이스 모델이며, 보고서는 샘플링 설정을 32회의 함수 평가와 2.0의 classifier-free guidance 스케일로 고정한다. AuK-Flash는 증류 버전으로, 일관성 초기화와 태스크 라우팅된 Decoupled DMD 목적 함수를 사용하며, 가이던스를 완전히 끈 상태에서 네 번의 고정 스텝으로 생성하는데, 논문은 이를 동일 조건에서 전체 모델 대비 4.5배의 월클록 속도 향상으로 보고한다. 논문 자체의 수치는 대부분의 생성 작업에서 Flash가 전체 모델에 근접함을 보여준다 — Seed-TTS-Eval에서 평균 단어 오류 2.85와 유사도 0.790 — 이는 속도 주장을 일축하기보다 검증할 가치가 있게 만든다: 교사 모델에 가까운 품질의 4단계 확산은 1.5B 음성 편집기가 단일 GPU에서 대화형으로 느껴지게 만들 수 있는 것이다. 그렇긴 하지만, "동일 조건"은 텐센트의 벤치마크를 설명하는 텐센트의 표현이며, 저자들이 측정한 4.5배라는 수치는 조달 결정을 바꾸기 전에 제3자의 검증이 필요한 바로 그런 종류의 주장이다.
오늘 실행할 수 있는 것
실용적인 범위는 일반적인 조용한 가중치 공개보다 넓습니다. 코드도 함께 공개되었기 때문입니다. 설치 대상은 uv 또는 Conda를 통한 Python 3.10이며, README는 Gradio, ComfyUI 노드 또는 파인튜닝 스택을 함께 가져오는 추가 설치 대상을 제공합니다. 명령줄 도구 auk-infer는 동일한 메시지 형태로 모든 작업을 포괄합니다. --instruction은 항상 필요하고, --audio는 작업에 따라 선택 사항입니다. Gradio 서버(auk-gradio)는 선택기로 모델을 노출하며, 재사용 가능한 워크플로가 있는 ComfyUI 사용자 정의 노드도 있습니다. 다만 통합은 30초 소스+대상 시퀀스 제한과 함께 문서화되어 있습니다. Python API는 CLI를 그대로 반영하며, 경량 파인튜닝 파이프라인은 추론과 동일한 메시지 형식을 사용하는 instruction-plus-audio 쌍의 JSONL로 학습합니다. README는 또한 자유 형식 요청을 즉시 실행 가능한 auk-infer 명령으로 바꾸는 Prompt Enhancer를 설명합니다. 이는 OpenAI 호환 채팅 엔드포인트를 요구하며, 클라우드 ASR 자격 증명이 설정되지 않은 경우 음성 인식을 위해 로컬 SenseVoiceSmall 모델로 폴백합니다. 한 가지 현재 제한이 분명히 문서화되어 있습니다. Qwen3-Omni는 아직 인코더 경로로 지원되지 않으므로, 다운로드해야 할 체크포인트는 여전히 Qwen2.5-Omni-3B입니다.
문서가 여전히 알려주지 않는 것은 하드웨어 하한입니다. 추론용 VRAM 수치는 공개되어 있지 않습니다. 구성 파일에는 ~91GB 피크가 ~75GB로 떨어질 수 있다는 그래디언트 체크포인팅 관련 메모가 있는데, 이는 현실적인 단일 실행 추론 수치라기보다 학습 시 메모리 범위를 설명하는 것이며, AuK와 AuK-Flash를 함께 로드하는 참조 명령은 둘을 두 개의 GPU에 분산시키면서 둘 다 하나의 GPU를 공유할 수 있다고 언급합니다. 다운로드 자체에 대한 예산도 잡아 두세요: 변형당 대략 6.8GB에 Qwen2.5-Omni-3B 인코더가 추가되며, 그런 다음 자신의 GPU에서 메모리를 측정하세요.
확인되지 않은 것은 무엇입니까?
이렇게 이른 시점에 모델을 다루는 핵심은 여전히 알 수 없는 부분을 정확히 짚는 것이며, 그 보고서는 이 목록에서 정확히 한 항목만 제거하고 나머지는 그대로 두었습니다:
• 우리가 찾을 수 있는 독립적인 실행은 존재하지 않습니다. 제3자 음성 샘플도, 벤치마크 재현도, 토론 스레드에서의 인상도 없습니다. 저장소의 첫 번째 공개 이슈는 등록되었지만 답변이 없고, 모델 카드의 다운로드 수는 여전히 수십 건에 불과하므로, 현재 이 이야기의 전부는 게시된 표와 재현된 표 사이의 간극입니다.
• 이 평가는 자체적으로 수행되었으며, 한 가지 특정한 측면에서 범위가 좁다. 보고서에 등장하는 모든 베이스라인은 또 다른 오픈 가중치 모델이다 — Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS. 구매자가 실제로 AuK와 견주어 저울질할 만한 폐쇄형 호스팅 음성 플랫폼은 하나도 등장하지 않는다. 따라서 여기서 "업계를 선도한다"는 것은 "텐센트가 선정한 오픈 필드를 선도한다"는 뜻이다.
• "AuK"라는 이름은 여전히 논문, 카드, 코드 어디에서도 풀어서 밝힌 적이 없으며, 검색할 때 바닷새, American University of Kuwait, 그리고 무관한 저장소들과 심하게 충돌한다.
• 이제 팀은 적어도 가시화되었다 — 논문에는 Ziyang Ma가 이끄는 33명의 저자가 이름을 올렸고, 소속은 Tencent Hunyuan org, Shanghai Jiao Tong University, Shanghai Innovation Institution, Nanyang Technological University에 걸쳐 있다 — 그러나 Tencent 내부에서 누가 이 모델을 일상적으로 책임지는지, 그리고 그것이 Hunyuan 라인인지 별도의 학술 협업인지는 명시되지 않은 채 남아 있다.
• 언어 지원 범위는 여전히 일부만 문서화되어 있습니다: AuK-Flash 카드는 중국어와 영어를 명시하고 코드 예제는 둘을 혼용하지만, 기본 모델에는 공식 언어 목록이 없습니다. 라이선스도 양상은 비슷합니다 — AuK 자체는 MIT이지만, 별도로 다운로드하는 Qwen 인코더는 자체 약관을 따르므로, "MIT 모델"과 "실행에 필요한 모든 것까지 MIT"는 같은 말이 아닙니다.
통합된 오픈 가중치 음성 모델이 중요한 이유
AuK의 작업 목록을 오늘날 빌더가 실제로 하는 일과 견주어 보면, 숫자가 나오기 전보다 그 베팅이 더 선명해진다. 기존 도구로 그 모든 작업을 수행한다는 것은 여러 전문 모델을 연결하는 일을 뜻한다 — 복제를 위한 하나의 오픈 체크포인트, 향상을 위한 또 다른 모델, 별도의 분리기, 콘텐츠를 위한 수동 또는 모델 지원 편집 — 또는 여러 폐쇄형 호스팅 API를 임대하는 일이며, 각각 작업당 그리고 오디오 분당 가격이 매겨지고, AuK가 설명하는 방식으로 편집할 수 있는 것은 하나도 없다. 그 모든 것을 하나의 텍스트 조건부 생성 문제로 취급하는 단일 오픈 가중치 체크포인트는 진정으로 다른 객체이며, 이제 보고서는 마케팅이 했던 것보다 그 주장의 더 날카로운 버전을 뒷받침한다: 편집 쪽은 실재하며, 열망에 그치는 것이 아니다. 음성 복제는 지난 한 해 동안 상품화되었지만, 명령 기반 콘텐츠 및 운율 편집은 폐쇄형 호스팅 플랫폼이 여전히 마진을 버는 영역이며, 콘텐츠 편집에서 91.83 대 76.46은 오픈 모델이 그 영역을 차지할 수 있다는 첫 번째 증거다.
정직하게 단서를 달자면, 이것은 조건화를 위해 3B 언어 모델을 덧붙인 확산 모델이고, 그 형태의 비용을 그대로 물려받는다. 작업별 품질은 고르지 않다 — "편집한 부분만 빼고 모든 것을 보존하라"는 작업에서는 뛰어나지만 감정 표현은 더 빈약하며 — 호스팅 엔드포인트도, 배치 처리 방안도, Flash 변형의 내부 비교 외에는 공개된 지연 시간도 없다. 그 주변의 음성 파이프라인 구성 요소들 — 무엇을 말할지 결정하는 LLM과 Prompt Enhancer의 OpenAI 호환 채팅 엔드포인트 — 에게는 라우팅 API가 자연스러운 선택이며, OrcaRouter는 200개 이상의 모델을 공급자 정가로 마크업 없이 제공하므로, 스택의 그 절반에는 키 하나만 필요하고 두 번째 계약은 필요 없다. 오디오 쪽 절반은 여전히 당신이 통제하는 GPU와, Tencent 밖에서는 아무도 감사하지 않은 체크포인트다.
지금 누가 봐야 하고, 누가 기다려야 할까요?
음성 연구자, 도구 개발자, 그리고 새 음성 모델을 평가하는 일을 하는 모든 사람에게 이번 주 AuK를 다운로드할 이유는 첫날보다 더 강해졌지만, 여전히 같은 단서 조항이 따라붙습니다. 이제 문서화된 아키텍처, 재현 가능해 보이는 레시피, 그리고 넘어서야 할 대상들의 전체 표를 얻을 수 있습니다 — 바로 그 점이 재현되지 않은 주장을 공격할 가치가 있게 만듭니다. 일찍 도입하는 비용은 여전히 주말 동안의 설정 작업과 GPU 한 대입니다. 프로덕션 음성 스택을 선택하려는 사람에게 이 보고서는 결정의 형태를 바꾸지만 결정을 확정해 주지는 않습니다: 이제 논쟁할 수 있는 숫자가 있지만, 그것은 공급업체의 숫자이고, 실제로 벤치마크 비교 대상으로 삼을 폐쇄형 플랫폼은 제외하며, 여전히 API도, VRAM 하한도, 검증된 실적도 없습니다. 순서대로 주목하십시오: Seed-TTS-Eval 및 SpeechEditBench 행의 독립적 재현; 공개된 샘플 또는 접근 가능한 데모 Space; 그리고 AuK를 채택하는 추론 제공업체 또는 호스팅 API입니다. 그 시점에서 우리 쪽의 패스스루 가격은 제공업체의 정가이며, 같은 날 적용됩니다. 0% 마크업이란 바로 그런 뜻이기 때문입니다. 흥미로운 질문은 이제 Tencent가 또 하나의 TTS 모델을 출시했는지가 아닙니다 — 하나의 오픈 모델이 정말로 그 다섯 가지 작업군을 동시에 모두 감당할 수 있는지이며, 이제 Tencent가 자체 답을 공개했으니 남은 것은 다른 누군가가 그것을 검증하는 일뿐입니다.
