
AuK vs AuK-Flash: 32개의 샘플링 스텝 또는 4개, 그리고 학생이 때때로 이기는 이유
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123지능49코딩
두 체크포인트 모두 용량이 정확히 6.122GB이며, 둘 다 MIT 라이선스로 배포됩니다. 또한 둘 다 동일한 별도 다운로드 방식의 30억 파라미터 명령 인코더와 동일한 637MB VAE로 구동됩니다. AuK 및 AuK-Flash는 프로비저닝 측면에서 거의 차이가 없지만, 매 호출마다 체감되는 한 가지, 즉 샘플러가 실행되는 횟수에서 차이가 있습니다. AuK는 9월 9일에 텐센트의 Hunyuan 팀과 상하이 자오퉁 대학 및 NTU 소속 학계 공동 저자들이 Hugging Face에 올린 1.5B 오픈 가중치 음성 생성·편집 파운데이션 모델로, classifier-free guidance 2.0을 적용해 32번의 함수 평가를 수행합니다. 증류된 학생 모델인 AuK-Flash는 가이던스를 완전히 끈 채 4번만 실행하여, 4.5배의 벽시계 시간(wall-clock) 속도 향상을 제공합니다. 당연한 해석은 Flash가 지연 시간이 품질보다 우선할 때 선택하는 저비용 옵션이라는 것입니다. 그러나 이 해석은 틀렸으며, 공급업체 자체 평가 표가 이를 반박합니다. 기술 보고서의 일대일 비교 항목에서 Flash는 MMAE-Speech의 편집 비율 지표, SpeechEditBench의 준언어적 열, 영어 지시 수행, 음향 편집 화자 유사성, 그리고 4가지 개선 지각 품질 행 모두에서 최고 점수를 기록했습니다. 이는 다운그레이드가 아닙니다. 서로 다른 트레이드오프이며, 어떤 쪽을 원하는지는 실제로 어떤 작업을 실행하는지에 달려 있습니다.
그것들 사이에 실제로 무엇이 다른가요?
마케팅을 벗겨 내면 선택의 여지는 설정 파일 하나로 귀결된다. AuK의 런타임은 하이브리드 rectified-flow Transformer로, 이중 스트림 MMDiT 블록이 단일 스트림 DiT 블록으로 이어지는 구조이며, bfloat16 Euler 솔버를 24kHz로, 64차원 잠재 변수를 50Hz로 구동한다. AuK-Flash는 동일한 아키텍처에 증류된 샘플러를 결합한 버전으로, consistency initialization과 task-routed Decoupled DMD로 생성되었다. 그 외 모든 구성 요소는 공유된다.
• 샘플링 단계 — AuK: 함수 평가 32회, 설정 가능. AuK-Flash: 4회, 고정.
• 분류기 없는 가이던스 — AuK: 스케일 2.0, 튜닝 가능. AuK-Flash: 없음 (CFG=0).
• 체크포인트 크기 — AuK: auk_base.safetensors, 6.122 GB. AuK-Flash: auk_flash.safetensors, 6.122 GB. 메가바이트 단위까지 동일.
• 공유 런타임 — 637MB VAE와 Qwen/Qwen2.5-Omni-3B 인코더로 구성되며, 별도로 다운로드되어 양쪽 모두에서 사용됩니다.
• 주장 속도 — AuK-Flash: 동일한 하드웨어, 지속 시간 및 배치 크기에서 32-NFE 티처보다 wall-clock 기준 4.5배 빠름.
• 라이선스 — 둘 다 MIT이며, 이번만큼은 말 그대로입니다.
그 동일한 체크포인트 크기가 전체 비교의 구도를 바꾸는 핵심 세부사항입니다. 증류된 변형 모델은 대개 더 작은 크기로 속도를 확보합니다. 그러나 AuK-Flash는 더 작지 않습니다. 디스크를 절약하지도, 전송 시간을 절약하지도 않으며, 인코더와 VAE가 공유되고 DiT의 폭이 동일하므로 학생(student) 모델을 선택해도 VRAM을 의미 있게 절약하지 못합니다. Flash가 돌려주는 유일한 자원은 시간뿐입니다. 그래도 하나 짚고 넘어갈 예산 함정이 있습니다. 모델 이름의 "1.5B"는 확산 백본(diffusion backbone)을 가리키며, 디스크에 저장된 파일은 6.122GB입니다. 그 파일 크기에 맞춰 준비하세요.
AuK-Flash가 실제로 전체 모델을 능가하는 부분
이것은 "증류된 것이 더 나쁘다"는 직관이 틀린 부분으로, 보고서 표에서 서로 관련 없는 여러 작업군에 걸쳐 그대로 성립합니다. 지각부터 시작하죠. DNS Challenge enhancement set에서 Flash는 AuK의 3.86에 맞서 UTMOS 4.05를 기록했고, CHiME-4에서는 3.91 대 3.72, Libri2Mix에서는 4.03 대 3.87, VCTKSR에서는 4.05 대 3.93을 기록했습니다. Flash는 또한 이 네 세트 중 두 세트에서 인식 오류 항목에서도 이기는데, CHiME-4의 WER은 7.84 대 7.98, VCTKSR의 WER은 2.92 대 3.06입니다. 인간 평가 자연스러움은 학생 모델이 일관되게 앞서는 유일한 축이며, 보고서는 이를 명시적으로 밝힙니다. 전체 모델은 더 강력한 언어 정확성과 편집 충실도를 제공하는 반면, Flash는 "종종 더 나은 지각 품질"을 제공한다는 것입니다.
이러한 우위는 향상(enhancement) 작업에만 국한되지 않습니다. MMAE-Speech의 편집 비율(edit-ratio) 지표, 즉 편집이 의도한 크기로 적용되는지 여부에서 Flash는 13.85점으로 AuK의 12.44점을 앞섰습니다. SpeechEditBench의 준언어적(paralinguistic) 항목에서는 39.25 대 38.50입니다. InstructTTSEval의 영어 설명-음성 변환 과제에서는 82.40 대 81.60으로, 해당 행의 최고 기준선과 동률을 이룹니다. Ming-Freeform 제품군의 음향 편집에서는 화자 유사도가 계열 내에서 가장 높은 0.79(중국어)와 0.75(영어)를 기록했으며, 기본 모델은 각각 0.78과 0.74입니다. 다시 말해 화자 정체성 보존은 4단계가 제공하는 이점 중 하나입니다. 보고서 자체 요약에 따르면 전체 모델은 평균 인식 오류가 더 낮은 반면, Flash는 화자 정체성을 더 잘 보존합니다. 음색이 단어 오류보다 더 중요한 음성 변환, 더빙, 또는 향상 작업을 수행한다면, 학생(student) 모델이 더 나은 선택입니다.

32단계가 여전히 그 가치를 증명하는 곳
기본 모델의 장점은 더 많은 샘플링 예산을 가진 확산 모델에서 기대할 수 있는 바로 그 지점, 즉 출력이 언어적으로 정확해야 하는 모든 것에 집중되어 있습니다.
Seed-TTS-Eval에서 AuK의 평균 WER은 2.65이고 Flash는 2.85이며, 화자 유사도는 0.795 대 0.790입니다. 그 평균 내부의 분포가 평균 자체보다 더 유용합니다. 둘 다 영어 테스트 세트에서는 사실상 동률(1.02와 1.03)이지만, 중국어에서는 1.02 대 1.10으로 차이가 나며, 어려운 중국어 하위 집합에서는 5.91 대 6.43으로 다시 차이가 납니다. 중국어가 추가 단계가 효과를 발휘하는 영역입니다.
같은 패턴은 지시 수행에서도 나타난다. InstructTTSEval의 중국어 설명-음성 변환 작업에서 격차는 크다: AuK가 83.37인 반면 Flash는 78.80이다. 보고서는 기본 모델이 해당 스위트의 중국어 지표 세 가지 모두에서 앞서는 반면, Flash의 "주요 장점은 더 강력한 영어 DSD 결과"라고 언급한다. 결정적 차이는 아키텍처가 아니라 언어이다.
편집 충실도가 이 둘을 가장 크게 갈라놓는다. SpeechEditBench 콘텐츠 편집 정확도는 Flash의 87.50 대비 AuK가 91.83으로, 이번 비교에서 가장 큰 단일 격차다. 음향 편집도 37.07 대 30.26으로 거의 그만큼 한쪽으로 치우쳐 있다. Ming-Freeform 스위트에서 AuK는 중요한 거의 모든 영역에서 더 낮은 WER을 기록한다: 전체 중국어 편집에서 3.34 대 3.09, 전체 영어 편집에서는 4.84 대 3.96으로 격차가 훨씬 더 벌어진다. 제품이 누군가의 녹음에서 단어를 다시 쓰는 작업(가사 편집, 콘텐츠 교체, 삽입 및 삭제)을 수행한다면, 32-스텝 모델이 전사의 정확성을 지켜주는 모델이며, 8배의 스텝 차이는 그 비용을 지불할 가치가 있다.
두 모델 모두 보고서 자체의 수치로도 감정 편집에서 여전히 약합니다. SpeechEditBench 감정 정확도는 AuK가 9.94, Flash가 6.29입니다. 이것은 증류 과정의 부산물이 아닙니다. 아무도 해결하지 못한 작업군이며, 학생 모델을 선택한다고 해서 지금보다 더 나빠지지는 않습니다.
4.5×는 샘플러 번호이지, 엔드투엔드 번호가 아닙니다.
여기 헤드라인의 속도 향상이 숨기고 있는 계산이 있습니다. 그리고 그것은 아키텍처를 플래시에 적용하기 전에 이해해야 할 가장 유용한 단 하나의 것입니다.
AuK-Flash는 4개의 샘플링 단계를 실행하는 반면, AuK는 32개를 실행합니다. 이는 8배 더 적은 단계입니다. 공급업체는 벽시계 시간 기준 4.5배 더 빠르다고 보고합니다. 이 두 수치의 차이는 샘플링 루프 주변의 모든 것에서 비롯되며, 그중에서도 인코더가 지배적입니다. 두 체크포인트 모두 로드하고 모든 요청마다 실행해야 하는 Qwen2.5-Omni-3B 멀티모달 모델이 바로 그것입니다. 그 인코더는 확산 백본보다 약 2배 크며, 그 비용은 고정되어 있습니다. Flash는 그 속도를 높일 수 없습니다. Flash는 그 일부가 아니기 때문입니다.
그러므로 이 주장을 정직하게 표현하면 다음과 같습니다: {{1}}동일 조건에서 확산(diffusion) 부분에 대해 얻는 속도 향상은 4.5×입니다{{/1}}, 그리고 {{2}}샘플링 루프가 실제로 차지하는 벽시계 시간(wall clock)의 비율만큼이 최종 속도 향상입니다{{/2}}. 긴 형식 생성(long-form generation)을 실행하는 경우, {{3}}많은 잠재 프레임에 걸친 32단계가 지배적{{/3}}이면 공개된 수치에 가깝게 도달할 것입니다. 작업 부하가 {{4}}무거운 명령 전처리가 포함된 짧은 클립{{/4}}이거나 소규모 요청을 배치 처리하는 경우, 각 호출의 더 큰 부분이 {{5}}공유 인코더{{/5}}에 머물러 실제 속도 향상은 4.5×보다 훨씬 작아집니다. 대기 시간 예산을 그에 의존하기 전에 자신의 작업 구성을 직접 측정하십시오. 아직 그 최종(end-to-end) 수치를 공개한 사람은 없습니다. 절대 대기 시간 수치나 VRAM 요구 사항을 전혀 보고하지 않는 공급업체조차도 말이죠.
{{1}}저자들의 말로 본 증류 비용{{/1}}
기술 보고서는 학생 모델이 실패하는 지점에 대해 이례적으로 솔직하며, 그러한 실패 모드들은 벤치마크 표보다 배포자에게 더 유용하다.
{{1}}교사 가이던스 타깃이 문제로 밝혀졌다.{{/1}} 일관성 분기에서 CFG 타깃을 사용하면 {{2}}"소수의 스텝만 거친 학생 모델이 과포화된 예측에 노출될 수 있다"{{/2}}고 저자들은 말하며, 이것이 오버슈트와 가청 클리핑을 유발한다고 한다. 별도로, 균일한 Decoupled DMD 스케줄은 {{3}}"다중 화자 및 보컬 분리를 저하시키며,"{{/3}} 일부 학생 출력은 처리되지 않은 혼합 신호 쪽으로 회귀한다. 즉, 증류가 모델이 수행해야 했던 분리를 지워버리는 것이다. Task-routed DMD는 앞서 설명된 해결책이며, 보고서가 그 특정 약점을 균일 변형에 한정한 이유이기도 하다. 음성 분리가 파이프라인의 핵심 부분이라면, 이를 신뢰하기 전에 이 문단을 기준으로 테스트해야 한다.
두 가지 추가 제약은 통계적이라기보다 운영상의 것이다. 파이프라인의 Prompt Enhancer는 속도, 음량, 음높이에 관한 구어체 표현을 지원되는 고정 값 집합에 매핑하며, 음향 추론이 실행되기 전에 매핑할 수 없는 모든 것을 거부한다. 따라서 지원되지 않는 요청은 우아하게 저하되는 대신 조기에 실패한다. 또한 저장소는 인코더 경로로 Qwen/Qwen2.5-Omni-3B만 허용하며, README에는 Qwen3-Omni가 현재 지원되지 않는다고 명시되어 있어 최신 인코더가 드롭인 업그레이드가 아니다. ComfyUI 통합에는 소스 및 대상 시퀀스에 30초 제한이 있다.
둘 다 실행하는 것이 의도된 구성입니다.
저장소의 자체 멀티-GPU 예제는 AuK를 한 장치에, AuK-Flash를 다른 장치에 둡니다 — cuda:0과 cuda:1 — 이는 Tencent가 이 둘이 경쟁하기보다 공존할 것으로 본다는 분명한 신호입니다. 이는 또한 대부분의 프로덕션 음성 스택에 맞는 정답인데, 두 모델의 강점이 서로 겹치지 않기 때문입니다. 편집 작업이 많은 요청과 중국어 요청은 AuK로 보내고, 향상, 분리, 영어 지시 수행, 그리고 대화형 작업은 AuK-Flash로 보내세요. 두 모델 모두 동일한 인코더와 동일한 VAE를 로드하므로, 공유 런타임 비용은 한 번만 지불하면 되고 그 뒤에서 체크포인트를 전환하면 됩니다.
그것은 모델 계층에서의 라우팅 결정이며, OrcaRouter가 호스팅 모델에 대해 API 계층에서 적용하는 것과 동일한 형태입니다. 두 가지가 오늘날 만나는 지점은 AuK 자체 파이프라인의 이음새입니다. Prompt Enhancer에는 OpenAI 호환 채팅 엔드포인트가 필요하며, 이는 대략적인 지시를 모델이 지원하는 어휘로 변환하는 데 사용됩니다. 또한 선택적 ASR 폴백에는 전사 경로가 필요합니다. 둘 중 하나를 OpenAI 호환 채팅 엔드포인트에 연결하면 200개 이상의 모델에서 사용할 수 있는 하나의 키, 0% 마크업으로 전달되는 공급업체 목록 가격, 그리고 백엔드가 중단될 경우 자동 장애 조치를 얻을 수 있습니다. 이것이 중요한 이유는 바로 이 릴리스가 이틀밖에 되지 않았고 호스팅 API도 독립적인 재현도 없기 때문이며, 검증되지 않은 의존성이 하드코딩된 엔드포인트에 자리 잡는 것을 원하지 않기 때문입니다.
하지만 무엇이 제공되지 않는지 분명히 하세요. AuK도 AuK-Flash도 어떤 호스팅 추론 제공업체를 통해서도 제공되지 않습니다 — Hugging Face 카드에 그렇게 직접 명시되어 있습니다 — 그리고 둘 다 오늘날 OrcaRouter를 통해 라우팅할 수 없습니다. 이것은 처음부터 끝까지 자체 호스팅 결정입니다.

아직 알려지지 않은 것은 무엇인가?
이번 릴리스에 관한 거의 모든 내용은 공급업체 보고입니다. 4.5배 속도 향상, WER 수치, SpeechEditBench 열, UTMOS 행은 모두 9월 8일에 제출된 AuK 팀 자체 기술 보고서(arXiv 2609.08936)에서 나온 것이며, 독립적인 재현 결과나 제3자 리더보드 등재, 중립적 하네스 테스트 결과는 없습니다. 채택 신호도 마찬가지로 빈약합니다. 9월 10일 기준 두 개의 Hugging Face 저장소는 지난 한 달간 다운로드 30회, 각각 약 24개의 좋아요를 기록했고, GitHub 저장소는 스타 217개, 포크 12개, 기여자 3명을 보여줍니다. 이는 연구 차원의 공개이지, 대세 합류가 아닙니다.
img src="4.png" alt="Tencent-Hunyuan AuK GitHub 저장소 README의 스크린샷: 2026년 9월 9일 오픈소스 공지와 AuK 및 AuK-Flash 변형 테이블 표시"> p>이번 릴리스는 그 자체로 조용했는데, 그 점을 분명히 짚고 넘어갈 가치가 있다. 과잉 해석하기 쉬운 릴리스이기 때문이다. Hunyuan의 발표도, 블로그 포스트도, 가격 페이지도, 출시 이벤트도 없었다. 공급업체의 유일한 날짜 기재 성명은 저장소 README의 한 줄, 즉 [2026/09/09] AuK를 오픈소스로 공개합니다가 전부다. Hugging Face 저장소 메타데이터를 보면 스페이스는 더 이른 8월 중순에 생성되었고, 가중치는 9월 9일과 10일에 마지막으로 수정되었으므로, 패키징은 발표보다 먼저 이루어졌다. 저장소에서 확인할 수 있는 것은 두 변형 모두의 MIT 라이선스 가중치, 기술 보고서, Hugging Face와 ModelScope용으로 동작하는 다운로드 지침, 그리고 문서화된 작업 목록이다. 확인되지 않은 것은 보고된 수치 중 어떤 것도 독립적인 테스트 환경에서 유효한지, 호스팅된 엔드포인트가 등장할지, 그리고 다른 사람들이 실행한 후에도 Flash 체크포인트가 권장 기본값으로 유지될지 여부다.

어느 걸 고를까?
콘텐츠 제작이나 가사 편집 작업을 하고 있거나, 어떤 형태로든 중국어 음성을 서비스한다면 AuK를 채택하고 32단계를 수용하십시오. 그 경우 AuK의 장점은 큽니다. 두 개의 독립적인 편집 제품군에서 일관되게 나타나며, 사용자가 즉시 알아차리는 정확성 오류, 곧 대본 속 잘못된 단어와 정확히 같은 종류의 문제를 해결합니다.
향상, 분리, 음성 변환, 또는 결과를 기다리는 사람이 있는 어떤 작업을 구축 중이라면 AuK-Flash를 사용하세요. 샘플링 루프에서 훨씬 더 빠르고, 지각 품질 항목을 완전히 석권하며, 증류된 원본 모델보다 화자 정체성을 더 잘 보존합니다. 존재하는 품질 격차는 아마 실행하지 않을 작업에 집중되어 있습니다.
둘 모두를 포괄하는 음성 제품을 만들고 있다면, 둘 다 실행하세요. 동일한 디스크, 동일한 인코더, 동일한 라이선스, 하나의 구성 차이 — 그리고 리포지토리가 이미 보여주는 배포 패턴이 있습니다. 기다릴 가치가 있는 유일한 것은 직접 측정한 종단 간 지연 시간입니다. 4.5배라는 수치는 실제이지만, 이는 샘플러에 해당하는 것이며, 그중 얼마나 많은 부분이 사용자에게 도달하는지는 오직 워크로드 구성만이 알려줍니다.
