
AuK-Flash和AuK:腾讯悄然发布了一款能够生成、编辑和分离音频的开源语音模型
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百万 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
本周,腾讯发布了2026年意义最重大的两个开源语音模型,却几乎没有告知任何人。大约在9月7日,腾讯在Hugging Face上的组织公开了AuK——用其模型卡的话说,这是一个“用于语音生成和编辑的1.5B基础模型”——以及AuK-Flash,即同一模型的蒸馏四步变体,两者均采用MIT许可证。两个仓库都没有附带腾讯的博客文章、社交公告或新闻稿;两者合计只被下载了几十次,模型卡所链接的代码仓库无法访问,而且在可索引的网络上任何地方都不存在独立的基准测试。本文阐述了从这两个仓库、配置文件和腾讯自己的项目页面中实际能够获知的信息——以及哪些内容仍未得到验证。
即使没有独立的数据支撑,这一说法也值得认真对待,因为其应用范围非同寻常。AuK并非又一个语音克隆模型。通过单一的自然语言指令接口,它承诺实现零样本(zero-shot)和基于指令的文本转语音,编辑能力可触及所说的内容、表达方式以及周围的非语言声音,此外还包括语音增强、语音分离和音乐分离。该领域历来是为上述每项任务分别构建不同的专用模型。腾讯押注于一个生成式骨干架构,认为单一模型即可完成所有这些任务——并且AuK-Flash的运行速度足以满足接近实时的使用需求。
两个检查点,一次发布
Hugging Face API 的时间戳讲述了一个仓库在公开之前一直保持私有的故事。基础仓库 tencent/AuK 创建于 2026 年 8 月 18 日,tencent/AuK-Flash 创建于 8 月 21 日;两者最后修改时间均为 9 月 8 日,模型卡片上有一条日期为 9 月 7 日的新闻条目——"[2026/09/07] AuK 现已开源。代码和模型权重均已公开提供。" 自然而然的解读是,腾讯在 8 月中下旬构建了这些仓库,在 9 月 7 日左右将其转为公开,并在 9 月 8 日再次修改了模型卡片。索引网页上没有任何关于该模型的信息,下载计数也只有几十次——因此"悄然发布"并非修辞上的选择,而是字面上的事实。
![A screenshot of the Hugging Face repository page for tencent/AuK-Flash, showing the model name under the Tencent organization with the tags Text-to-Speech, Chinese, English, speech, zero-shot-tts, voice-cloning, speech-generation, speech-editing, speech-enhancement, source-separation, speech-separation, instruction-guided, diffusion, distillation and few-step-inference, License mit; the model card headed 'AuK-Flash: Fast 4-Step Speech Generation and Editing' with a news line dated [2026/09/07] reading 'AuK is now open-source. Code and model weights are publicly available. Try it on the Demo Space or the ModelScope Space'; a Contents list covering News, Introduction, Model Architecture, Supported Tasks, Download the weights, Citation and License; a right rail showing the base model tencent/AuK in the model tree and an Inference Providers panel; and the Introduction opening 'AuK is a 1.5B foundation model for speech generation and editing. Trained on millions of hours of diverse audio data, AuK supports zero-shot and instruction-based TTS.'](https://cms.orcarouter.ai/api/media/file/2-723.png)
这两个检查点是同一架构在其生命周期不同阶段的产物。AuK 是教师模型:一个以高质量生成为目标的基础模型。AuK-Flash 是学生模型:经过蒸馏以实现快速四步推理,这正是它成为更具吸引力的部署目标的原因,也是它在标题中领先的理由。在腾讯的项目页面上,该模型系列被描述为约 15 亿参数,训练数据在模型卡上仅被描述为“数百万小时的多样化音频数据”,而项目页面则进一步明确为约 303 亿条指令–音频实例上的约 195 万小时有效监督。项目页面还带有上海交通大学和腾讯混元的标识,将 AuK 归属于腾讯混元的开放模型研究线,而非商业产品系列。训练并非预训练之后发生的全部:腾讯描述了一个后训练阶段,该阶段将用于开放式编辑的人类反馈偏好优化与用于语音生成的基于奖励的强化学习相结合。
模型卡中的变体表格清楚地说明了二者之间的区别:AuK 是 {{1}}“用于高质量生成的基础模型”,{{/1}}AuK-Flash 是 {{2}}“用于快速 4 步推理的蒸馏模型”。{{/2}}两者都可以从 Hugging Face 和 ModelScope 的 Tencent-Hunyuan 命名空间下载,并且均采用 MIT 许可证——这是开放权重发布所能采用的最宽松的许可证之一,对于任何想要在其基础上构建产品的人来说都至关重要。
一个指令驱动模型实际做什么
AuK 的界面是一个单一的提示框:你把自然语言指令交给模型,如果任务需要,再提供一个音频参考,它就会返回音频。按照卡片自身的分类法,五类任务分别是:
• 语音生成 — 零样本TTS可从参考片段克隆声音,而“指令式TTS”仅凭声音描述(如“温暖的女声,稍慢一些”)即可合成语音,完全无需参考音频。
• 内容编辑——重写所说内容:在现有录音中替换、插入或删除词语,以及歌词编辑,即在保持旋律和歌手声音的同时重写歌唱片段的歌词。
• 声学编辑 — 音高(半音)、语速和音量(分贝)均可针对现有片段调整,同时保持身份和内容不变。
• 副语言编辑——情感、音色(按描述调整)、去口音化、添加或移除呼吸声、笑声和咳嗽声等非言语声音,以及在正常说话与耳语之间转换。
• 增强与分离——语音增强(去噪和去混响)、按说话顺序的语音分离、将歌声从混音中提取出来的音乐分离,以及根据说话内容识别的目标说话人提取。
这份清单才是真正的差异化优势。2026年最具能力的开源语音系统通常只擅长其中一两项——语音克隆和TTS是竞争最拥挤的领域——而在其余方面要么表现薄弱,要么完全缺失。AuK押注的是广度:用相同的权重、相同的指令格式,覆盖生成、编辑和分离等任务,而这种覆盖面通常只会以一组微调专用模型的形式发布。
它是如何构建的
将代码库与项目页面放在一起阅读,可以得出一致的架构全貌。AuK 并不是那种读取文本并输出token的自回归音频语言模型,而是一个沿袭图像模型风格的流匹配扩散系统,由三部分组成:
• 一个多模态大语言模型——Qwen/Qwen2.5-Omni-3B(需单独下载)——读取指令和任何参考音频,并生成语义条件。
• 一个在语音、通用音频和音乐上联合训练的音频 VAE,能够通过 50 Hz 的声学潜变量以 24 kHz 进行编码和解码;该仓库的配置将其标识为 BigVGANFlowVAE,潜变量维度为 64,下采样倍率为 480,并以单独的 vae.safetensors 文件形式提供。
生成核心是一个混合式修正流 Transformer:双流 MMDiT 模块先分别处理文本与音频的条件信息,随后由统一的单流 DiT 模块将它们融合,并以流匹配目标进行训练。发布的配置显示,模型宽度为 1,536,含 24 个注意力头、10 个双流层和 20 个单流层。
AuK-Flash 是同一个 Transformer 经过蒸馏后的产物。腾讯描述了一个两阶段流程:先是轨迹级一致性初始化,然后是“任务路由解耦”的 DMD 目标,最后辅以干净预测回归监督。据项目页面介绍,其效果是在四步采样内达到接近教师模型的生成质量,推理时无需无分类器引导,在同等条件下相比完整模型实现了约 4.5 倍的墙钟加速。这些是厂商声称、未经复现的结论,但它们正是 AuK-Flash 成为构建者首选变体的具体原因。
腾讯声称的内容,以及读者可以核实的内容
该项目页面作出了强烈的定性声明——AuK在生成和编辑方面“领先”,在增强和分离等信号级恢复任务上“具有竞争力”——并列出了支撑这些声明的基准套件:生成方面有Seed-TTS-Eval和InstructTTSEval,编辑方面有MMAE-Speech、SpeechEditBench和Ming-Freeform-Audio-Edit,感知质量方面有DNSMOS和UTMOS,增强与分离方面有DNS Challenge、CHiME-4和Libri2Mix。页面没有公布任何数值评分,背后也没有论文支撑,更没有第三方复现过其中任何结果。所有这些声明均来自供应商自述,在独立评测结果出现之前,都应如此看待。

还有两项声明需要标注出来,因为它们未通过2026年9月9日的直接核查。首先,卡片称代码已公开可用,并提供了 github.com/Tencent-Hunyuan/AuK 链接,指向安装、Gradio、ComfyUI 和微调说明——但截至撰写本文时,该仓库返回HTTP 404错误,并且它不在Tencent-Hunyuan组织的公开仓库列表中。代码可能只是仍在逐步发布;无论如何,“代码可用”目前只是卡片上的一项声明,读者无法据此实际使用。其次,卡片指向了Hugging Face和ModelScope上的演示Spaces:ModelScope的studio可以正常响应,但Hugging Face的Space在检查时返回了授权拦截页面,因此这些演示充其量只是部分公开。
这里有什么,缺少什么
在2026年9月9日进行盘点,方能将真正的发布与完整的发布区分开来。
• 目前提供两个依据 MIT 许可证发布的可下载权重集:tencent/AuK 为基础模型,tencent/AuK-Flash 为蒸馏出的四步变体;每个权重集约 6.1 GB,包含扩散 Transformer 及捆绑的 VAE。二者已镜像至 Hugging Face 和 ModelScope。
• 呈现——在统一指令接口下涵盖异常广泛的任务面:生成、内容与声学和副语言编辑、增强与分离,全部集成于单一模型家族。
• 展示——一个具体的“快速”案例:AuK-Flash 蒸馏后仅需四步,无需无分类器引导,据厂商称可实现 4.5 倍墙钟时间加速。
• 缺失——一项公告。目前尚没有任何腾讯博客文章、社交媒体帖子、新闻稿或 Hunyuan 频道帖子指向这两个仓库。
• 缺失——论文或技术报告。项目页面上的引用块是占位符,没有作者,也没有 arXiv 标识符,而且基准测试声明背后没有任何已发布的数字。
• 缺失——可访问的代码。截至状态检查时,卡片所链接的 GitHub 仓库和 Cookbook 均返回 404,因此目前唯一可运行的产物只有权重,外加社区围绕它们自行整合的内容。
• 缺失 —— 服务托管与独立评估。没有推理提供商托管 AuK,也不存在托管 API;下载量仅有几十次,尚无任何人发布过复现结果。

今天运行AuK-Flash,还是在等待?
如果你想自己运行 AuK-Flash,虽然代码这边没有明说,但下载路径是明确的:拉取 tencent/AuK-Flash 和 tencent/AuK(基础模型是可选的,除非你想要教师模型),同时还要拉取 Qwen/Qwen2.5-Omni-3B,因为检查点里只包含扩散 Transformer 和层融合权重——多模态编码器与 VAE 在运行时从各自的独立文件加载,模型卡片也注明,加载过程中缺少 text_encoder 键属于预期情况。硬件才是真正的瓶颈。这是一个约 1.5B 参数的扩散 Transformer,光检查点就约 6.1 GB,还要与约 3B 参数的多模态编码器和一个 VAE 一起运行,所以合理的起点是 24 GB 显存的 GPU,而不是笔记本上能跑的那种模型;配置中的显存说明提到,梯度检查点可以把训练峰值从大约 91 GB 压低到 75 GB,但那是针对训练而言,不应被当作推理需求。软件方面,配置默认使用 flash-attention 后端,但推理 CLI 可以回退到普通 torch attention 后端,这样首次运行时就不需要额外编译 flash-attn 了。
今天是否值得做这件事,取决于你在构建什么。坦率地说,目前的局面是:这是一个值得关注并在沙盒中测试的模型,而不是一个可以马上接入生产管线的模型——没有论文、没有可获取的代码、也没有独立评估,其能力声明完全依赖于腾讯的单方面说法。对于如今需要通过 API 实现语音生成、编辑或分离的团队来说,选择一个确实在提供服务的模型才是务实之举——这正是 OrcaRouter 在有端点的模型之间扮演的角色:一个 API 接入 200 多个模型,提供商列表价原样传递、零加价,所以供应商的价格从第一天起就是你的价格;同时具备自动故障转移,让你可以在真实流量的一小部分上试用一个未经验证的新模型,而不必把整条管线押在它上面。这些目前对 AuK 或 AuK-Flash 都不适用,因为还没有任何服务托管它们。只要有提供商托管 AuK,路由器的经济性就会成为评估它的廉价途径;在那之前,你只能选择自行托管权重,或者继续等待。
常见问题
AuK 或 AuK-Flash 是否可以通过 API 使用?
不。两者都只是权重发布。没有推理服务商托管它们,也没有托管API,所以目前没有可调用的接口——唯一的使用方式是下载权重并自行运行。
AuK和AuK-Flash有什么区别?
同一模型家族的两个阶段。AuK 是基础模型,主打高质量生成;AuK-Flash 是其蒸馏变体,针对无需无分类器引导的快速四步推理进行了调优。腾讯称,在匹配条件下,其运行速度约为基础模型的 4.5 倍。该加速数据系厂商自报,尚未经过独立测量验证。
AuK-Flash可以用于商业用途吗?
权重以MIT许可证发布,该许可证允许在保留许可证声明的前提下进行商业使用——这是最常见的限制最少的开放权重许可证。卡片所链接的独立代码仓库截至2026年9月9日无法访问,因此关于代码复用的实际答案仍需等待其出现后才能确定。
看什么
• 代码仓库 — github.com/Tencent-Hunyuan/AuK 是价值最高的那个缺失工件。一旦它出现,Cookbook 的指令模板就能将上述任务列表从营销话术变成可运行的内容。
• 一次独立运行——首次第三方复现将判定:所谓“领先”的生成与编辑宣称在真实音频面前是否依然成立,以及四步 AuK-Flash 是否真的接近基础模型。
• 一篇论文——项目页上的引用是占位符,这通常意味着 arXiv 投稿即将发布;训练方案、基准测试数值与蒸馏细节都包含在论文中。
• 服务上架条目:首个托管 AuK 的推理服务提供商将其从权重目录变成带价格的、可调用的模型,自此它就可以通过路由器试用,而不是作为一个需要自行托管的项目。
AuK和AuK-Flash是真实但尚未完成的存在,正如大多数最有趣的开源发布通常那样:权重是真实的,围绕它们的故事尚未书写。将tencent/AuK-Flash加入书签,在论文或独立基准测试出现之前,将所有能力声明视为厂商自报,并留意未来几天是否会带来代码,使其从一个有前景的产物转变为一个可构建的项目。
