一張為 AuK 生成的主視覺標題卡,上方為「AuK」字標,下方兩行副標題是「騰訊的開源 1.5B 語音模型」與「一個自然語言指令即可處理所有音訊任務——複製、編輯、增強、分離」。畫面中包含一道柔和的藍色波形,正由細細的文字游標插入符編輯,另有四個扁平圖示,分別標示「語音複製」「編輯」「增強」「分離」,右下角則合成 OrcaRouter 的標誌。
Guides & Insights

AuK:騰訊低調開源一款 1.5B 語音模型,將每個音訊任務視為文字指令

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這是一個你今天可以下載的任何單一語音工具都無法一次完成的要求:拿這段錄音,把「house」這個詞換成「home」,將音調升高一個半音,去掉最後一個短語前的呼吸聲,清除背景噪音,然後用一種僅被描述為「一位帶有輕微粵語口音的溫暖中年男性」的全新聲音重新朗讀結果。騰訊對這段話的回應是 AuK,一個 15 億參數的「語音生成與編輯基礎模型」,本週開源,沒有發布貼文,也沒有新聞稿——而其蒸餾版兄弟模型 AuK-Flash 現在帶來了我們最初報導這個故事時所缺少的一樣東西:一份附有數字的技術報告。《AuK 技術報告:用於語音生成與編輯的開源基礎模型》(arXiv:2609.08936, cs.SD,2026-09-08 提交)現在同時被 Hugging Face 模型卡片和 GitHub README 引用,論文列表日期為 2026-09-08,程式碼儲存庫的新聞行日期為 2026/09/09。這份報告沒有做到的,是解決那個關鍵問題——報告中的每一個數字都是騰訊自己的,是針對騰訊選定的基準進行測試的,截至 2026-09-10,公司外部還沒有人重現出任何一個數字。

這是一篇「目前為止已知資訊」的彙整文章,已修訂過一次。騰訊至今仍未在我們能找到的任何主要官方管道上宣布 AuK,因此目前的紀錄是:AuK 與 AuK-Flash 的 Hugging Face 模型卡與儲存庫、Tencent-Hunyuan 組織下的程式碼儲存庫、auk-project.github.io 專案網站,以及現在這篇論文。最後新增的這項改變了「可知」的範疇——架構、訓練配方與評測數字首次獲得詳細描述——但並未改變「已驗證」的範疇。請將以下所有數字視為廠商自行回報,因為事實正是如此;另請注意,該報告的比較對象完全是其他開源模型,而非 AuK 實際要競爭的閉源託管語音平台。

實際發佈了什麼,以及有多低調

時間線仍然是這次發佈最誠實的總結,只是相較於我們第一輪的檢視,需要修正一處。Hugging Face 的儲存庫是在八月中旬建立的——AuK 於 2026-08-18 建立——但一直閒置到本週。當我們在 2026-09-09 閱讀 AuK 的模型卡時,它唯一的新聞行註記的日期是 2026-09-07;一天之後,同一行文字變成 2026/09/09,並將讀者導向論文與 demo Spaces。而存放推理與訓練程式碼的 GitHub 儲存庫,建立於 2026-08-19,最後一次推送是在 2026-09-09。換句話說:先有權重,再有程式碼,然後是技術報告——四天內分三階段釋出,而截至撰寫本文時,騰訊的主要官方管道仍然沒有任何公告。

• 權重託管在 Hugging Face 的 tencent 組織下,並鏡像於 ModelScope 的 Tencent-Hunyuan 之下——兩處鏡像,同為 MIT 許可證。

每個模型儲存庫都包含一個 safetensors 檢查點,外加一個設定檔和一個 VAE:AuK 的 auk_base.safetensors 為 6.12 GB、vae.safetensors 為 0.64 GB;AuK-Flash 的佈局也相同。模型卡要求您另外下載 Qwen/Qwen2.5-Omni-3B,也就是 AuK 在執行時會分別載入的文字編碼器。

•「沒人注意到」的框架已經失效,而且很快。程式碼倉庫在我們於2026-09-09檢查時還是零顆星、零個分叉;到了2026-09-10已顯示216顆星、12個分叉和它的第一個開放問題。AuK 卡片回報上個月約有三十次下載、26個讚。沒有改變的是:討論分頁仍是空的,卡片仍註明該檢查點尚未由任何推論提供者部署。

• 模型卡片、README 和論文連結的演示 Spaces 均位於 Hugging Face 和 ModelScope 上。我們檢查時,Hugging Face Space 在未登入情況下無法公開訪問,因此對於匿名使用者,「在瀏覽器中試用」路徑應視為未經驗證。

A screenshot of the Hugging Face model page for tencent/AuK, captured September 9, 2026, showing the Tencent org, the model name, the Text-to-Speech pipeline tag, model tags including zero-shot-tts, voice-cloning, speech-editing, instruction-guided and diffusion, the licence "mit", and the model card opening with "AuK: An Open-Source Foundational Model for Speech Generation and Editing", a News entry dated 2026/09/07 reading "AuK is now open-source. Code and model weights are publicly available.", and the start of the Introduction describing AuK as a 1.5B foundation model.

上面的 Hugging Face 卡片仍是可安裝版本的完整公開表面:一張模型卡、一個配置、兩個 safetensors 檔案和一份授權。之後新增的只是圍繞它的文件層——一篇論文、一個基準測試表和一個引用區塊——而這些都沒有改變一個事實:背後沒有變更日誌、沒有討論串,也沒有推論提供者列表。

賣點:單一指令介面,十六種語音任務

AuK 的主張並非它是史上最佳的文字轉語音模型,而是生成只是該模型透過單一自然語言介面被訓練執行的五大語音任務家族之一;在此介面中,請求是一則聊天訊息,可攜帶文字及一個選用的參考音訊檔案。該論文正式化了專案網站早已宣揚的分類法:

• 語音生成 — 零樣本 TTS(以參考音訊中的語音朗讀此文字)與指令式 TTS(僅憑語音描述生成語音,完全不需要參考音訊)。

• 內容編輯——改寫所說的內容:在現有錄音中替換、插入或刪除文字;以及歌詞編輯,可在保留旋律與歌聲的同時改寫演唱的歌詞。

• 聲學編輯 — 以半音調整音高、縮放語速,以及以分貝調整音量。

• 副語言編輯 — 情緒變化、根據描述進行音色轉變、去除口音、添加或移除非語言聲音(呼吸聲、笑聲、咳嗽聲),以及在保持說話者不變的情況下,在正常說話與耳語之間轉換。

• 增強與分離 — 語音降噪與去迴響、依說話順序進行語音分離、音樂/人聲分離,以及根據說話者所說的內容來辨識並提取目標說話者。

指令式語音合成(instruction-TTS)這個案例,正是讓它有別於一般語音克隆產品的地方:AuK 會以一種僅存在於文字描述中的聲音來朗讀句子——官方文件中的例子便指定一位二十多歲的女性,對著剛回家的伴侶說話,語氣溫暖、關懷且帶點俏皮,音色柔美甜蜜,句尾微微上揚,而且完全不需要附上任何參考音檔。如此一來,便省去了參考錄音的需求,而那正是語音克隆通常要付出的門檻成本。這份報告首次為這項任務給出了量化數據,而這也是 AuK 少數徹底擊敗競爭對手、而非僅是略勝一籌的地方。

在「1.5B」內部:這個數字低估了運行時間

AuK 的參數量描述的是擴散 transformer,而非整個 pipeline,論文現在明確說明了這兩部分。骨幹是一個混合 rectified-flow Transformer——由十個雙流 MMDiT 區塊和其後的二十個統一單流 DiT 區塊組成,共三十層,隱藏大小 1536,24 個維度 64 的注意力頭,SwiGLU 中間寬度 3072,這就是「約 15 億參數」這個數字的來源。圍繞它的還有兩個獨立載入的元件:一個多模態 LLM(Qwen/Qwen2.5-Omni-3B),負責將指令和任何參考音訊轉換為語義條件;以及一個因果式 24 kHz 音訊 VAE——設定檔中稱之為 BigVGANFlowVAE——以 50 Hz 的幀率處理 64 維潛在變量,編碼器通道寬度最高 768,解碼器最高 1536。因此,完整的執行環境是約 1.5B 的骨幹網路、3B 的編碼器,再加上 VAE;而下載說明也明確指出,編碼器是單獨的 checkpoint,有自己的條款。

根據報告,訓練分階段進行,其規模遠比專案網站所暗示的還要大:先是僅生成(generation-only)的暖身階段,共 50,000 次更新;隨後是 600,000 次生成與編輯聯合更新,使用約 30.3 億個「指令–音訊」實例,相當於約 195 萬小時的有效監督,橫跨 256 張 GPU;另外還有 124 萬次針對 VAE 的更新。後期訓練結合了人類回饋偏好最佳化與基於獎勵的強化學習,建立在 818 個具資訊量的偏好群組、9,080 個已評分候選樣本、內含 10,000 個 zero-shot 與 5,000 個指令跟隨提示的 RL 提示池、30,000 個風格評審樣本,以及一個從 Qwen2.5-Omni-7B 微調而來的獎勵模型之上。對一個 1.5B 的開源釋出來說,這是一套相當紮實的後期訓練堆疊;同時也提醒我們:「開放權重」(open weights)描述的是成品本身,而非產出它所動用的算力——在權衡自己能否重現時,這點值得謹記。

A generated single-column scoreboard for AuK listing Params: 1.5B backbone + 3B Qwen encoder; License: MIT; Open-sourced: 2026-09-07 weights · 2026-09-09 code; Tasks: 16 across 5 speech families; Runtime: 24 kHz · 50 Hz audio latents; AuK-Flash: 4-step, no CFG, 4.5× faster (vendor), with the footer "Specs from Tencent's repos & project site; vendor-reported, not independently reproduced yet." and the OrcaRouter logo composited in the bottom-right corner.

那份規格表中的每一個數字,都是取自騰訊自家的儲存庫和網站,而非由我們實測;論文並未改變這點——它只是把更多項目從「宣稱」轉為「有據可查」。自我們首次發布以來,唯一真正經過檢驗的數字,是該儲存庫自身的活動:它在一天之內從零顆星漲到幾百顆星。

A screenshot of the AuK project website at auk-project.github.io, captured September 9, 2026, showing the title "AuK: An Open-Source Foundational Model for Speech Generation and Editing", badge links for GitHub, Hugging Face and ModelScope, the AuK-Flash variant name alongside Tencent Hunyuan co-branding, the tagline "One model for every speech task", and the opening description of AuK as a 1.5B-parameter foundational model with a multimodal language model, a 50 Hz VAE and a hybrid transformer under a flow-matching objective.

專案網站仍舊是架構圖與學術聯名品牌的展示所在,也是了解模型形貌最省事的方式:一個用於語義條件化的多模態語言模型、一個用於聲學的 50 Hz VAE,以及一個採用流匹配目標的混合 transformer。其基準測試章節,初次查看時僅列出了沒有分數的評估工具,如今則有論文可供參考。

技术报告出炉,数字是腾讯自己的。

這是更新的實質內容。該論文報告了七個評估套件的結果——與專案網站先前一直在宣傳但未附上數字的清單相同——並且在大多數生成與內容編輯軸線上,AuK 領先開放領域。請將這些視為供應商基準測試表,因為它們正是如此:tencent 執行了所有比較、選擇了每個基線,且尚未發布任何可用於重現該測試框架的程式碼。

• Seed-TTS-Eval 上的零樣本 TTS:AuK 平均 WER 為 2.65,說話者相似度為 0.795;對比 Qwen3-TTS 的 3.07 與 0.745、Seed-TTS 的 3.65 與 0.778,以及 VoxCPM2 的 3.65 與 0.767。AuK-Flash 則達到 2.85 與 0.790。最佳單一子集成績為英文測試集 WER 1.02 與中文困難集 WER 5.91。

• 在 InstructTTSEval 上的指令控制 TTS:AuK 在中文上得分 83.37,在英文描述跟隨上得分 81.60,對比 Qwen3-TTS-VD 的 81.10 和 82.40,以及 MOSS-VoiceGenerator 的 80.00 和 82.00。AuK-Flash 在中文上為 78.80,但在英文上以 82.40 追平該領域最佳。

• SpeechEditBench 上的內容編輯:準確率 91.83,相較於 Ming-UniAudio 的 76.46;韻律方面 71.33,相較於 26.50 —— 這是報告中差距最大的兩項。

• 在 Ming-Freeform-Audio-Edit 上進行指令引導式編輯,完整設定下:與 Ming-UniAudio 相比,中文詞錯誤率從 10.46 降至 3.09,英文詞錯誤率從 14.28 降至 3.96;編輯準確率分別從 79.62 提升至 91.47,以及從 70.98 提升至 85.25。在聲學編輯方面,相同比較下,中文詞錯誤率從 5.01 降至 2.02,英文詞錯誤率從 10.75 降至 3.48。

在MMAE-Speech上進行副語言編輯:指令遵循率為48.23,內容改寫為88.11,相對於Step-Audio-EditX的43.52和77.27,以及Ming-UniAudio的34.13和76.01。AuK-Flash在表格中以13.85取得了最佳的編輯模型召回率。

• 復原(Restoration)方面,模型的表現具有競爭力而非主導性:DNS Challenge 去同步化字錯誤率為 2.66,說話者相似度為 0.99,而 RE-USE 為 3.31;CHiME-4 字錯誤率為 7.98,而 RE-USE 為 10.71;Libri2Mix 字錯誤率為 9.12,而 MossFormer2-SS 為 9.34;以及 VCTKSR 字錯誤率為 3.06,相似度為 0.97。

• 單獨評估 VAE 本身:AuK-VAE 在語音上達到 4.143 PESQ,一般音訊 3.833,音樂 3.884;而 MiniMax-H3-AudioVAE 則為 3.633、2.835 和 2.801——這是一場全面勝利,且其意義遠比表面上看起來重大,因為有損的音訊潛在表徵會為所有建構於其上的任務設下天花板。

這些條列之間的規律,比標題式的勝利更有意思。AuK 在一切代表「改變所說的內容或聽起來的方式,同時保留其他一切」的任務上遙遙領先——內容編輯、韻律、聲學編輯、重建。在情緒與副語言編輯方面,它則與領域內其他模型差距小得多;其 SpeechEditBench 情緒準確率 9.94 與 Ming-UniAudio 的 3.43 在一個兩者都表現偏弱的基準上幾乎難以區分,而整體聲學分數 37.07 也與基線落在相同範圍。所以,「一個模型搞定所有語音任務」是騰訊的定調;這份報告實際上顯示的是,有一個模型在其中幾項任務上表現出色,其餘任務則僅是聊備一格。

兩個檢查點:AuK 和 AuK-Flash

騰訊在同一個MIT授權下推出了兩個變體。AuK是完整的基礎模型,報告將其實驗設定定為32次函數評估,無分類器引導尺度為2.0。AuK-Flash是蒸餾版本:採用一致性初始化與任務路由的解耦DMD目標,以四次固定步數生成,且完全關閉引導;論文報告稱在匹配條件下,相較完整模型有4.5倍的實際執行時間加速。論文自身的數據顯示,Flash在大多數生成任務上與完整模型相當接近——在Seed-TTS-Eval上平均字錯誤率為2.85,相似度為0.790——這正是讓速度宣稱值得實測而非直接駁斥的原因:四步擴散若能達到接近教師模型的品質,就能讓1.5B的語音編輯器在單一GPU上擁有互動式體驗。不過,「匹配條件」是騰訊用來描述自家基準測試的說法,而由作者測量出的4.5倍數字,正是那種在改變任何採購決策之前,需要第三方驗證的宣稱。

你今天可以運行什麼

實際涵蓋範圍比典型的靜默權重發布更廣,因為程式碼也隨之發布。安裝以 uv 或 Conda 為目標,支援 Python 3.10,README 還提供額外的安裝目標,可拉入 Gradio、ComfyUI 節點或微調堆疊。命令列工具 auk-infer 以相同的訊息格式涵蓋所有任務:--instruction 一定需要,--audio 則視任務而定可選。Gradio 伺服器(auk-gradio)以選擇器方式展示模型,還有 ComfyUI 自訂節點與可重複使用的工作流程,不過該整合的文件標明 30 秒的來源加目標序列長度限制。Python API 與 CLI 相對應,而輕量微調管線則使用與推論相同的訊息格式,在包含指令加音訊配對的 JSONL 上進行訓練。README 也描述了 Prompt Enhancer,它可將自由形式的請求轉換為可直接執行的 auk-infer 指令;它預期使用 OpenAI 相容的聊天端點,若未設定雲端 ASR 憑證,則會退回本地的 SenseVoiceSmall 模型進行語音辨識。目前有一項限制被明確記錄:Qwen3-Omni 尚不支援作為編碼器路徑,因此仍須下載 Qwen2.5-Omni-3B 檢查點。

文檔仍未提供的是硬體規格下限。文件中沒有公布推論所需的 VRAM 數字。設定檔中帶有 gradient-checkpointing 的註記,提及峰值約 91 GB 可降至約 75 GB,但這描述的是訓練時的記憶體需求範圍,而非實際單次推論的數字;而參考命令會同時載入 AuK 和 AuK-Flash,將兩者分散到兩張 GPU 上——同時註明兩者可共用一張。下載本身的預算也要納入考量:每個變體約 6.8 GB,加上 Qwen2.5-Omni-3B 編碼器,然後在您自己的 GPU 上實際測量記憶體使用量。

什麼尚未被確認

對未知保持精確,仍然是這麼早就報導一款模型的重點;而這份報告恰好從這份清單中移除了一項,其餘則保持不變:

• 我們找不到任何獨立的執行結果。沒有第三方語音樣本、沒有基準測試重現、沒有討論串的評價。該儲存庫的第一個公開 issue 已提交但未獲回應,而模型卡的下載次數仍停留在數十次,因此發表表格與重現結果之間的差距,目前就是整個故事。

• 這項評估是自行執行,且在某一特定方面範圍狹窄。報告中的每個基準都是另一個開放權重模型——Qwen3-TTS、Seed-TTS、VoxCPM2、Ming-UniAudio、Step-Audio-EditX、MOSS-VoiceGenerator、RE-USE、MossFormer2-SS。買家實際拿來與 AuK 比較的封閉式託管語音平台一個都沒出現,所以這裡的「領先業界」其實是「領先騰訊所選的開放領域」。

「AuK」這個名稱在論文、卡片或程式碼中仍從未被展開說明,而且在搜尋時會與海雀、科威特美國大學及不相關的儲存庫產生嚴重衝突。

• 團隊現在至少是可見的——論文列有33位作者,由Ziyang Ma領銜,隸屬機構涵蓋騰訊混元組織、上海交通大學、上海創新機構及南洋理工大學——但騰訊內部究竟誰在日常負責該模型,以及它是混元產品線還是獨立的學術合作,仍未說明。

• 語言涵蓋範圍仍未完整記錄:AuK-Flash 卡片標示中文和英文,程式碼範例也混用兩種語言,但基礎模型並未提供正式的語言清單。授權條款也是如此——AuK 本身為 MIT 授權,而其分別下載的 Qwen 編碼器則有自己的條款,因此「MIT 模型」與「MIT 執行所需的一切」並非同等的陳述。

為何統一的開放權重語音模型如此重要

將 AuK 的任務清單對照開發者今天實際在做的事情來讀,這個賭注會變得比數字出現之前更清晰。用現有工具完成所有這些工作,意味著要串聯多個專業模型——一個用於克隆的開放檢查點、另一個用於增強、一個單獨的分離器,加上手動或模型輔助的內容編輯——或者租用多個封閉的託管 API,每個都按任務和音頻分鐘數計費,而且沒有一個能像 AuK 所描述的那樣可編輯。一個將所有這些視為單一文本條件生成問題的開放權重檢查點,是截然不同的產物,而這份報告現在比行銷說法更能支持這個主張的銳利版本:編輯這一部分是真的,不是空想。語音克隆在過去一年已商品化,但指令驅動的內容與韻律編輯才是封閉託管平台仍能賺取利潤之處,而內容編輯上 91.83 對 76.46 的成績,正是開放模型能奪下這塊陣地的首個證據。

需要誠實說明的是,這是一個擴散模型,上面附加了一個 3B 語言模型用於條件控制,因此也繼承了這種架構的成本。各任務的品質參差不齊——在「除了編輯之外保留一切」的任務上表現出色,在情感方面則較為薄弱——而且除了 Flash 變體的內部對比之外,既沒有託管端點,也沒有批次處理方案,更沒有公開的延遲數據。至於圍繞它的語音管線各部分——決定該說什麼的 LLM,以及 Prompt Enhancer 的 OpenAI 相容聊天端點——路由 API 是自然而然的選擇;OrcaRouter 以供應商列表價格提供 200 多個模型,不另加價,因此那一半技術棧只需要一個金鑰,無需第二份合約。音訊那一半仍然是你所掌控的 GPU,以及騰訊以外無人審核過的檢查點。

誰現在應該看,誰又應該等待?

對於語音研究人員、工具開發者,以及任何工作涉及評估新語音模型的人來說,本週下載 AuK 的理由比第一天時更充分,但仍伴隨同樣的但書。你現在可以獲得一份有文件記載的架構、一個看似可重現的配方,以及一張完整的待超越目標表格——這正是讓一個未經重現的宣稱值得被挑戰的原因。搶先採用的代價仍然是一個週末的環境設定和一張 GPU。對於正在選擇正式語音技術棧的人來說,這份報告改變了決策的形狀,但沒有定案:現在有了可以辯論的數據,但那些是廠商提供的數字,它們排除了你實際上會拿來對比的封閉平台,而且仍然沒有 API、沒有 VRAM 下限、也沒有實績紀錄。依序觀察:先是 Seed-TTS-Eval 和 SpeechEditBench 欄位的獨立重現;接著是公開發佈的樣本或可實際操作的 Demo Space;最後是某個推論供應商或託管 API 開始採用 AuK,屆時我們這端的轉售價格就是供應商的定價,當天同步,因為這就是 0% 加價的意義。有趣的問題不再是騰訊是否又推出了一個 TTS 模型——而是單一開放模型是否真能同時承載那五個任務家族,而既然騰訊已經公佈了自己的答案,剩下唯一的事就是讓別人來驗證它。