
AuK:腾讯悄然开源1.5B语音模型,将所有音频任务视为文本指令
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
没有哪款你今天能下载到的单一语音工具能一次性完成这样一句话:拿这段录音,把“house”换成“home”,把音高提高一个半音,去掉最后一个短语前的换气声,去除背景噪音,然后用一种仅被描述为“略带粤语口音的温暖中年男性”的全新声音重新朗读结果。腾讯对这句话的回答是 AuK,一个 15 亿参数的“语音生成与编辑基础模型”,本周开源,既没有发布博客也没有新闻稿——而它的蒸馏版姊妹模型 AuK-Flash 如今补上了我们首次报道这个故事时所缺少的东西:一份附有数字的技术报告。《AuK 技术报告:一个开源的语音生成与编辑基础模型》(arXiv:2609.08936,cs.SD,2026-09-08 提交)现在已被 Hugging Face 模型卡和 GitHub README 同时引用,论文条目日期为 2026-09-08,代码仓库自身的动态行日期为 2026/09/09。这份报告没有做到的,是解决那个真正重要的问题——报告里的每一个数字都是腾讯自己跑出来的,对比的是腾讯自己挑选的基线,而截至 2026-09-10,公司外部没有任何人复现过其中任何一个结果。
这是一篇“目前已知信息”的报道,已经修订过一次。腾讯仍未在我们能找到的任何主要渠道上宣布 AuK,因此目前的记录包括:AuK 和 AuK-Flash 的 Hugging Face 模型卡片与仓库、Tencent-Hunyuan 组织下的代码仓库、auk-project.github.io 上的项目站点,以及现在的论文。这最新增加的内容改变了可知的范围——架构、训练方案和评估数据首次被详细描述——但没有改变已获验证的内容。请将下方所有数字视为供应商报告的数据,因为事实正是如此,并注意该报告的对比完全是针对其他开源模型,而非 AuK 实际将与之竞争的封闭式托管语音平台。
实际发布了什么,又是何等悄无声息
时间线仍然是对发布最诚实的总结,只是与我们第一遍相比有一处修正。Hugging Face 仓库创建于八月中旬——AuK 于 2026-08-18 创建——但一直沉寂到本周。当我们在 2026-09-09 查看 AuK 模型卡时,其唯一一条新闻的日期是 2026-09-07;一天之后,同一行文字变成了 2026/09/09,并将读者指向论文和演示 Spaces。GitHub 仓库保存着推理和训练代码,创建于 2026-08-19,最后一次推送是在 2026-09-09。换言之:先是权重,然后是代码,再是技术报告——四天内三批发布,而截至撰写本文时,腾讯的主要渠道仍然没有任何公告。
这些权重托管在 Hugging Face 上的 tencent 组织下,并在 ModelScope 上的 Tencent-Hunyuan 下镜像——两个镜像,相同的 MIT 许可证。
• 每个模型仓库包含一个 safetensors 检查点,外加一个配置和一个 VAE:AuK 对应 auk_base.safetensors(6.12 GB)和 vae.safetensors(0.64 GB);AuK-Flash 采用相同布局。模型卡片要求您同时下载 Qwen/Qwen2.5-Omni-3B,这是 AuK 在运行时单独加载的文本编码器。
“没有人注意到”的说法已经过时了,而且很快。代码仓库在我们于 2026-09-09 查看时还是零星标、零复刻;到 2026-09-10 时已显示 216 个星标、12 个复刻,并出现了第一个公开问题。AuK 卡片显示最近一个月约有三十次下载,26 个点赞。没有变化的是:讨论选项卡仍为空,卡片仍注明该检查点尚未被任何推理提供商部署。
• 两张模型卡、README 以及论文链接的演示 Space 均位于 Hugging Face 和 ModelScope 上。我们检查时发现,Hugging Face 上的 Space 在未登录状态下无法公开访问,因此“在浏览器中试用”这一路径对匿名用户而言应视为未经确认。

上面的 Hugging Face 卡片仍然是一个可安装版本的全部公共表面:一张模型卡、一个配置、两个 safetensors 文件和一个许可证。此后新增的只是围绕它的文档层——一篇论文、一张基准测试表和一个引用块——而这些都改变不了一个事实:它背后没有变更日志、没有讨论帖,也没有推理提供商列表。
卖点:一个指令接口,十六种语音任务
AuK 的主张并不是说它是史上发布过的最好的文本转语音模型。而是说生成只是该模型通过单一自然语言界面训练完成的五类语音任务之一,其中请求是一条可以携带文本以及可选参考音频文件的聊天消息。这篇论文正式确立了项目网站此前已经在宣传的分类体系:
• 语音生成 — 零样本语音合成(用参考音频的声音朗读此文本)和指令式语音合成(仅根据语音描述生成语音,完全不需要参考音频)。
• 内容编辑——改写已说内容:在现有录音中替换、插入或删除词语;以及歌词编辑,它在保留旋律和嗓音的同时改写演唱的歌词。
• 声学编辑 — 以半音为单位的音高、语速缩放和以分贝为单位的音量。
• 副语言编辑——情绪变化、根据描述改变音色、消除口音、添加或移除非语言声音(呼吸声、笑声、咳嗽声),以及在保持说话者不变的情况下在正常语音和耳语之间转换。
• 增强与分离 — 语音去噪与去混响、按说话顺序进行语音分离、音乐/人声分离,以及根据说话内容识别并提取目标说话人。
指令式TTS这一案例,正是它区别于普通语音克隆发布的地方:AuK会以一种仅存在于文字描述中的声音来朗读句子——文档自带的示例指定了一位二十多岁的女性,对刚进门的伴侣说话,语气温暖、关切,带点轻佻的撒娇,音色柔美甜美,句尾微微上扬,而这一切都没有附带任何参考音频片段。这免去了对参考录音的需求,而参考录音通常是语音克隆的门槛成本。报告首次为这一任务给出了量化数据,而这也是AuK少数几处明显胜出、而非勉强领先于同领域产品的地方。
“1.5B”背后:这个数字低估了运行时开销
AuK的参数数量描述的是扩散Transformer,而非整个流水线,论文现在明确说明了这两个部分。主干网络是一个混合整流流(rectified-flow)Transformer——由十个双流MMDiT模块加二十个统一单流DiT模块组成的三十层结构,隐藏层大小为1536,24个维度为64的注意力头,SwiGLU中间层宽度为3072——"约15亿参数"这一数字正是由此而来。其周围是两个分别加载的组件:一个多模态大语言模型(Qwen/Qwen2.5-Omni-3B),负责将指令和任何参考音频转化为语义条件;以及一个因果24 kHz音频VAE——配置中将其命名为BigVGANFlowVAE——以50 Hz帧率处理64维潜变量,编码器通道宽度最高为768,解码器最高为1536。因此,完整运行时包括约15亿参数的主干网络、一个30亿参数的编码器和VAE,而下载说明中明确指出,编码器是一个独立检查点,适用其自身的条款。
据报告所述,训练分阶段进行,其规模远超项目网站所暗示的:先进行仅生成的 50,000 步预热,随后是 600,000 步生成与编辑联合更新,基于约 30.3 亿条指令-音频实例(相当于约 195 万小时的有效监督),在 256 块 GPU 上完成;此外,VAE 还经过了 124 万步更新。后训练阶段将人类反馈偏好优化与基于奖励的强化学习相结合,构建于 818 个信息丰富的偏好组、9,080 个已评分候选、由 10,000 条零样本和 5,000 条指令遵循提示组成的 RL 提示池、30,000 个风格评判样本,以及一个从 Qwen2.5-Omni-7B 微调而来的奖励模型之上。对于一个 1.5B 参数的开源发布而言,这堪称一套严肃扎实的后训练技术栈;同时它也提醒我们:"开放权重"描述的是产物本身,而非产生它所消耗的算力——在权衡自己能否复现时,这一点值得铭记。

那份规格表里的每一个数字都是从腾讯自己的代码库和网站读取的,而非由我们实测;论文并没有改变这一点——它只是把更多这样的数字从“声称”变成了“记录在案”。自我们首次发布以来,唯一真正经过测试的数字是代码库自身的活跃度,它在一天之内从零颗星涨到了几百颗。

项目站点仍然是架构图和学术联名的所在地,也依然是了解模型结构最便捷的方式:一个用于语义条件的多模态语言模型、一个用于声学的 50 Hz VAE,以及一个采用流匹配目标的混合 Transformer。其基准测试部分——我们初次查看时只列出了没有分数的评估框架——现在有了可以引用的论文。
技术报告出炉,这些数字是腾讯自己的。
这就是本次更新的核心内容。论文报告了七个评估套件的结果——与项目网站上此前宣传但未给出数字的列表一致——在大多数生成和内容编辑维度上,AuK 领先于开源领域。应将这些结果视作厂商基准测试表,因为它们本质上就是如此:tencent 运行了所有对比实验、选择了所有基线,且尚未发布用于复现该测试框架的代码。
• Seed-TTS-Eval 上的零样本 TTS:AuK 平均 WER 为 2.65,说话人相似度为 0.795;相比之下,Qwen3-TTS 为 3.07 和 0.745,Seed-TTS 为 3.65 和 0.778,VoxCPM2 为 3.65 和 0.767。AuK-Flash 达到 2.85 和 0.790。最佳单项数据集结果为:英文测试集 WER 1.02,中文困难集 WER 5.91。
• 在InstructTTSEval上的指令控制TTS:AuK在中文描述跟随任务中得分83.37,在英文任务中得分81.60,相比之下Qwen3-TTS-VD得分为81.10和82.40,MOSS-VoiceGenerator得分为80.00和82.00。AuK-Flash在中文任务中得分为78.80,但在英文任务中以82.40追平了该领域最佳成绩。
{{1}}SpeechEditBench上的内容编辑{{/1}}:{{2}}准确率91.83,而Ming-UniAudio为76.46{{/2}},{{3}}韵律得分71.33,而后者仅为26.50{{/3}}——{{4}}这是整个报告中差距最大的两项。{{/4}}
• 在Ming-Freeform-Audio-Edit上进行指令引导编辑,完整设置下:与Ming-UniAudio相比,中文词错误率从10.46降至3.09,英文从14.28降至3.96;编辑准确率从79.62升至91.47,英文从70.98升至85.25。在声学编辑方面,同样的对比使中文词错误率从5.01降至2.02,英文从10.75降至3.48。
• 在MMAE-Speech上的副语言编辑:指令遵循率48.23,内容重写88.11,对比Step-Audio-EditX的43.52和77.27,以及Ming-UniAudio的34.13和76.01。AuK-Flash在表中以13.85取得最佳编辑模型召回率。
• 恢复方面,模型具有竞争力而非主导地位:DNS Challenge去同步词错误率2.66,说话人相似度0.99,而RE-USE为3.31;CHiME-4词错误率7.98,而RE-USE为10.71;Libri2Mix词错误率9.12,而MossFormer2-SS为9.34;以及VCTKSR词错误率3.06,相似度0.97。
• 单独评估VAE本身:{{1}}AuK-VAE在语音上达到4.143 PESQ,{{2}}在通用音频上为3.833,{{3}}在音乐上为3.884,{{4}}相比之下{{5}}MiniMax-H3-AudioVAE分别为3.633、2.835和2.801{{6}}——这是一次全面胜出,其意义远超表面数据,{{7}}因为有损声学潜变量会给建立在其上的每一个任务设下上限。
这些条目之间的规律比头条式的胜利更有意思。在一切意味着“改变所说内容或其听感,并保持其他一切不变”的任务上——内容编辑、韵律、声学编辑、重建——AuK 都遥遥领先。在情感编辑和副语言编辑方面,它与业内同行之间的差距要小得多:它在 SpeechEditBench 上的情感准确率为 9.94,与 Ming-UniAudio 的 3.43 几乎无法区分——在这个基准上两者都表现疲弱——其整体声学得分 37.07 也与基线处于同一区间。因此,“一个模型完成所有语音任务”是 Tencent 的表述框架;报告实际展示的,是一个模型在若干任务上极为出色,而在其余任务上仅仅是在场而已。
两个检查点:AuK 和 AuK-Flash
腾讯以相同的 MIT 许可证发布了两个变体。AuK 是完整质量的基础模型,报告将其采样设置定为 32 次函数评估,分类器无引导尺度为 2.0。AuK-Flash 是蒸馏版本:一致性初始化加任务路由的解耦 DMD 目标,以四个固定步骤生成,且完全关闭引导,论文报告其在匹配条件下比完整模型实现 4.5 倍的墙钟加速。论文自身的数据让 Flash 在大多数生成任务上保持接近——Seed-TTS-Eval 上平均词错误率为 2.85,相似度为 0.790——这正是让速度声明值得测试而非忽视的原因:四步扩散接近教师质量,才能让 1.5B 的语音编辑器在单 GPU 上具有交互感。话虽如此,“匹配条件”是腾讯描述自家基准的说法,而作者测得的 4.5 倍数字,恰恰是那种在改变任何采购决策之前需要第三方验证的声明。
你今天可以运行的内容
实际功能范围比典型的低调权重发布更广,因为代码也随之一起发布了。安装以 Python 3.10 为目标,可通过 uv 或 Conda 进行;README 还提供了额外的安装选项,用于引入 Gradio、ComfyUI 节点或微调技术栈。命令行工具 auk-infer 以相同的消息格式涵盖所有任务:始终需要 `--instruction`,而 `--audio` 则根据任务可选。一个 Gradio 服务器(auk-gradio)通过选择器展示模型,并带有 ComfyUI 自定义节点和可复用工作流,不过集成文档中写明存在 30 秒的源加目标序列长度限制。Python API 与 CLI 对应,轻量级微调流水线使用与推理相同的消息格式,在指令加音频对的 JSONL 数据上进行训练。README 还描述了一个 Prompt Enhancer,可将自由形式的请求转换为可直接运行的 auk-infer 命令;它需要一个兼容 OpenAI 的聊天端点,并且在未设置云 ASR 凭据时会回退到本地 SenseVoiceSmall 模型进行语音识别。当前有一个限制被明确指出:Qwen3-Omni 尚不支持作为编码器路径,因此仍然需要下载 Qwen2.5-Omni-3B 检查点。
文档始终没有给你一个硬件底线:推理没有公布任何显存(VRAM)数字。配置文件中的梯度检查点说明提到峰值约 91 GB、可降至约 75 GB,但这是训练时的内存占用范围,而非实际单次推理的数字;而参考命令将 AuK 和 AuK-Flash 一起加载时,会把它们分布到两块 GPU 上——尽管注释指出两者可以共享一块。至于下载本身,请做好预算:每个变体约 6.8 GB,外加 Qwen2.5-Omni-3B 编码器,然后在你自己的 GPU 上实测内存。
什么尚未确认
对未知保持精确,依然是这么早就要报道一款模型的意义所在;而这份报告恰恰从这份清单中移除了一项,其余则原封未动:
• 我们找不到任何独立的运行结果。没有第三方语音样本,没有基准复现,也没有讨论帖中的印象。该仓库的第一个未解决问题已被提交但无人回答,模型卡的下载次数仍停留在几十次,因此,已发表的表格与可复现的结果之间的差距,目前就是全部故事。
• 该评估为自行运行,且在某一方面范围狭窄。报告中的每个基线都是另一个开放权重模型——Qwen3-TTS、Seed-TTS、VoxCPM2、Ming-UniAudio、Step-Audio-EditX、MOSS-VoiceGenerator、RE-USE、MossFormer2-SS。买家实际会拿来与 AuK 比较的封闭托管语音平台均未出现,因此这里的“leading the field”意为“在腾讯选定的开放领域中领先”。
• "AuK" 这个名称在论文、卡片或代码中的任何地方都从未被展开过,而且在搜索中它与海鸟、American University of Kuwait 以及不相关的代码仓库严重冲突。
• 这个团队现在至少是可见的——论文列有33位作者,由Ziyang Ma牵头,隶属机构涵盖腾讯混元组织、上海交通大学、上海创新研究院和南洋理工大学——但腾讯内部日常由谁负责该模型,以及它属于混元产品线还是独立的学术合作,仍未说明。
• 语言覆盖范围仍然只有部分文档记录:AuK-Flash 卡片声明支持中文和英文,代码示例中两者混用,但基础模型没有正式的语言列表。许可协议的情况也类似 —— AuK 本身是 MIT 许可,而其单独下载的 Qwen 编码器带有自己的条款,因此“MIT 模型”和“MIT 涵盖运行所需的一切”并不是同一个说法。
为什么统一的开源权重语音模型很重要
将AuK的任务清单与构建者今天实际所做的工作对照来看,这个赌注比数据到来之前更加清晰了。用现有工具完成所有这些工作,意味着要串联多个专用模型——一个开源检查点用于克隆,另一个用于增强,还要一个单独的分隔器,外加手动或模型辅助的内容编辑——或者租用多个封闭的托管API,每个都按任务和音频分钟数计费,而且没有一个能像AuK所描述的那样进行编辑。一个将所有这些问题统一视为文本条件生成问题的单一开放权重检查点,是一个真正不同的对象,而这份报告对这一主张的支持力度比市场营销宣传更强:编辑这一半是真实的,而非空想。过去一年里,声音克隆已经被商品化,但指令驱动的内容和韵律编辑仍然是封闭托管平台赚取利润的阵地,而内容编辑上91.83对76.46的得分,是开源模型能够拿下这块阵地的首个证据。
诚实的限定是,这是一个扩散模型,附带了一个用于条件控制的3B语言模型,因此继承了这种形态的成本。每个任务的质量参差不齐——在“保留一切,只进行编辑”这类任务上表现出色,在情感方面则较为薄弱——而且除了Flash变体自身的内部对比之外,没有任何托管端点、没有批处理方案,也没有已发布的延迟数据。围绕它的语音管线的各个部分——决定该说什么的LLM,以及Prompt Enhancer的OpenAI兼容聊天端点——路由API自然是合适的选择,而OrcaRouter以供应商列表价格提供200多个模型,不加价,因此该堆栈的一半只需要一个密钥,无需第二份合同。音频部分则仍然是一个由你控制的GPU,加上一个除腾讯之外无人审计过的检查点。
现在谁该看,谁该等待
对于语音研究人员、工具构建者以及任何工作职责是评估新语音模型的人来说,本周下载 AuK 的理由比发布首日更充分,而且仍然伴随着同样的提醒。你现在可以获得有文档记录的架构、看起来可复现的配方,以及一张完整的待超越目标表——这正是让一个尚未被复现的声明值得去挑战的原因。抢先一步的代价仍然是一个周末的搭建时间和一块 GPU。对于任何正在选择生产级语音技术栈的人来说,这份报告改变了决策的形态,却没有终结决策:现在有了可以争论的数字,但这些数字出自厂商,它们排除了你实际会拿来对比评测的封闭平台,而且依然没有 API、没有 VRAM 下限、也没有过往业绩。请按顺序关注以下三点:对 Seed-TTS-Eval 和 SpeechEditBench 各行数据的独立复现;已发布的音频样本或可访问的演示 Space;以及某个推理服务商或托管 API 开始支持 AuK——到那时,我们这边的转售价格就是服务商的标价,当天同步,因为这就是 0% 加价的意义。有趣的问题不再是腾讯是否又发布了一个 TTS 模型——而是一个开放模型能否真正同时撑起那五类任务;既然腾讯已经公布了自己的答案,剩下唯一要做的事,就是让别人去验证它。
