Một thẻ tiêu đề hero được tạo cho AuK, hiển thị logo chữ "AuK" phía trên hai dòng phụ đề "Mô hình giọng nói mã nguồn mở 1.5B của Tencent" và "Một chỉ dẫn bằng ngôn ngữ tự nhiên cho mọi tác vụ âm thanh — nhân bản, chỉnh sửa, tăng cường, tách âm", với một dạng sóng màu xanh dương dịu đang được con trỏ văn bản dạng vạch mảnh chỉnh sửa, bốn biểu tượng phẳng có nhãn Nhân bản giọng nói, Chỉnh sửa, Tăng cường và Tách âm, cùng logo OrcaRouter được đặt ở góc dưới bên phải.
Guides & Insights

AuK: Tencent âm thầm mở mã nguồn mô hình giọng nói 1.5B coi mọi tác vụ âm thanh như một lệnh văn bản

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây là một câu mà không một công cụ xử lý giọng nói nào bạn có thể tải về hôm nay có thể làm trọn vẹn trong một lần: lấy bản ghi âm này, thay từ "house" bằng "home", nâng cao độ lên nửa cung, bỏ đi hơi thở trước cụm từ cuối, khử tiếng ồn nền, rồi đọc lại kết quả bằng một giọng nói hoàn toàn mới chỉ được mô tả là "một người đàn ông trung niên ấm áp với chút giọng Quảng Đông". Câu trả lời của Tencent cho câu nói đó là AuK, một "mô hình nền tảng cho tạo sinh và chỉnh sửa giọng nói" với 1,5 tỷ tham số, được phát hành mã nguồn mở trong tuần này mà không có bài đăng ra mắt cũng như thông cáo báo chí — và người anh em chưng cất của nó, AuK-Flash, giờ đây đi kèm với thứ còn thiếu trong câu chuyện này khi chúng tôi lần đầu viết về nó: một báo cáo kỹ thuật có kèm con số. "AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing" (arXiv:2609.08936, cs.SD, nộp ngày 2026-09-08) hiện được trích dẫn trên cả thẻ mô hình Hugging Face lẫn README trên GitHub, với phần liệt kê bài báo ghi ngày 2026-09-08 và dòng tin tức riêng của kho mã nguồn ghi ngày 2026/09/09. Điều báo cáo không làm được là giải quyết câu hỏi vốn quan trọng — mọi con số trong đó đều là của riêng Tencent, chạy so với các mốc so sánh do Tencent chọn, và tính đến ngày 2026-09-10, chưa một ai bên ngoài công ty tái lập được dù chỉ một con số.

Đây là bài tổng hợp những gì chúng ta biết cho đến nay, đã được chỉnh sửa một lần. Tencent vẫn chưa công bố AuK trên bất kỳ kênh chính thức nào mà chúng tôi tìm thấy được, nên hồ sơ hiện có là: các thẻ mô hình (model card) và kho lưu trữ trên Hugging Face cho AuK và AuK-Flash, kho mã nguồn thuộc tổ chức Tencent-Hunyuan, trang web dự án tại auk-project.github.io, và giờ là bài báo. Bổ sung cuối cùng này thay đổi những gì có thể biết — kiến trúc, công thức huấn luyện và các con số đánh giá lần đầu tiên được mô tả chi tiết — mà không thay đổi những gì đã được xác minh. Hãy coi mọi con số bên dưới là do nhà cung cấp báo cáo, vì thực tế đúng là như vậy, và lưu ý rằng các so sánh trong báo cáo hoàn toàn dựa trên các mô hình mở khác, chứ không phải các nền tảng giọng nói đóng lưu trữ mà AuK thực sự sẽ cạnh tranh.

Thứ thực sự được ra mắt, và mức độ kín tiếng đến đâu

Dòng thời gian vẫn là bản tóm tắt trung thực nhất về bản phát hành, với một hiệu chỉnh so với lần rà soát đầu tiên của chúng tôi. Các kho lưu trữ Hugging Face được tạo vào giữa tháng 8 — AuK vào ngày 2026-08-18 — nhưng vẫn im lìm cho đến tuần này. Khi chúng tôi đọc thẻ mô hình AuK vào ngày 2026-09-09, dòng tin tức duy nhất của nó được ghi ngày 2026-09-07; một ngày sau, dòng tương tự ghi 2026/09/09 và hướng người đọc đến bài báo và các demo Spaces. Kho lưu trữ GitHub, nơi chứa mã nguồn suy luận và huấn luyện, được tạo vào ngày 2026-08-19 và được đẩy lần cuối vào ngày 2026-09-09. Nói cách khác: trọng số, sau đó là mã nguồn, rồi đến báo cáo kỹ thuật — ba giai đoạn phát hành trong bốn ngày, và vẫn chưa có thông báo nào từ các kênh chính thức của Tencent tính đến thời điểm bài viết này được thực hiện.

Các trọng số nằm trên Hugging Face dưới tổ chức tencent và được nhân bản trên ModelScope dưới Tencent-Hunyuan — hai bản sao, cùng giấy phép MIT.

• Mỗi kho mô hình chứa một checkpoint safetensors duy nhất cùng với một tệp cấu hình và một VAE: auk_base.safetensors ở 6,12 GB và vae.safetensors ở 0,64 GB cho AuK; bố cục tương tự cho AuK-Flash. Trang thẻ mô hình yêu cầu bạn cũng tải xuống Qwen/Qwen2.5-Omni-3B, bộ mã hóa văn bản mà AuK tải riêng trong thời gian chạy.

• Khung "không ai chú ý" đã hết hạn, và nhanh chóng. Kho mã nguồn đứng ở mức 0 sao và 0 fork khi chúng tôi kiểm tra vào ngày 2026-09-09; đến ngày 2026-09-10, nó hiển thị 216 sao, 12 fork và issue mở đầu tiên. Thẻ AuK báo cáo khoảng ba mươi lượt tải trong tháng qua với 26 lượt thích. Điều không thay đổi: các tab thảo luận vẫn trống, và thẻ vẫn ghi chú rằng checkpoint chưa được triển khai bởi bất kỳ nhà cung cấp suy luận nào.

• Cả hai thẻ mô hình, README và bản demo liên kết bài báo Spaces trên Hugging Face và ModelScope. Space trên Hugging Face không thể truy cập công khai nếu chưa đăng nhập tại thời điểm chúng tôi kiểm tra, vì vậy hãy coi đường dẫn "dùng thử trong trình duyệt của bạn" là chưa được xác nhận đối với người dùng ẩn danh.

A screenshot of the Hugging Face model page for tencent/AuK, captured September 9, 2026, showing the Tencent org, the model name, the Text-to-Speech pipeline tag, model tags including zero-shot-tts, voice-cloning, speech-editing, instruction-guided and diffusion, the licence "mit", and the model card opening with "AuK: An Open-Source Foundational Model for Speech Generation and Editing", a News entry dated 2026/09/07 reading "AuK is now open-source. Code and model weights are publicly available.", and the start of the Introduction describing AuK as a 1.5B foundation model.

Thẻ Hugging Face ở trên vẫn là toàn bộ bề mặt công khai của một bản phát hành có thể cài đặt: một thẻ mô hình, một tệp cấu hình, hai tệp safetensors và một giấy phép. Những gì được bổ sung từ đó đến nay chỉ là lớp tài liệu xung quanh nó — một bài báo khoa học, một bảng điểm chuẩn và một khối trích dẫn — và không điều nào trong số đó làm thay đổi thực tế rằng phía sau không hề có nhật ký thay đổi, chủ đề thảo luận hay danh sách nhà cung cấp suy luận.

Điểm nhấn: một giao diện chỉ dẫn, mười sáu tác vụ tiếng nói.

Lời tuyên bố của AuK không phải là đây là mô hình chuyển văn bản thành giọng nói tốt nhất từng được phát hành. Điều nó khẳng định là việc tạo giọng nói chỉ là một trong năm nhóm tác vụ giọng nói mà mô hình được huấn luyện để thực hiện thông qua một giao diện ngôn ngữ tự nhiên duy nhất, trong đó một yêu cầu là một tin nhắn trò chuyện có thể mang văn bản cùng với một tệp âm thanh tham chiếu tùy chọn. Bài báo chính thức hóa chính xác hệ thống phân loại mà trang web dự án đã quảng bá:

• Tạo giọng nói — TTS zero-shot (đọc văn bản này bằng giọng của đoạn clip tham chiếu) và TTS theo chỉ dẫn (tạo giọng nói chỉ từ mô tả giọng nói, không cần bất kỳ âm thanh tham chiếu nào).

• Chỉnh sửa nội dung — viết lại những gì đã được nói: thay thế, chèn hoặc xóa từ trong một bản ghi âm hiện có; và chỉnh sửa lời bài hát, thao tác viết lại phần lời đã được hát trong khi vẫn bảo tồn giai điệu và giọng hát.

• Chỉnh sửa âm thanh — điều chỉnh cao độ theo nửa cung, thay đổi tốc độ nói và âm lượng theo decibel.

• Chỉnh sửa cận ngôn ngữ — thay đổi cảm xúc, thay đổi âm sắc theo mô tả, loại bỏ giọng vùng miền, thêm hoặc bớt các âm thanh phi ngôn ngữ (hơi thở, tiếng cười, tiếng ho) và chuyển đổi giữa giọng nói thường với giọng thì thầm trong khi vẫn giữ nguyên người nói.

— Tăng cường và tách — khử nhiễu và khử vang giọng nói, tách giọng nói theo thứ tự nói, tách nhạc/giọng hát, và trích xuất giọng nói mục tiêu được xác định bằng nội dung người nói.

Trường hợp instruction-TTS chính là điều làm nên sự khác biệt của bản phát hành này so với một bản clone giọng nói thông thường: AuK sẽ đọc một câu bằng giọng nói chỉ tồn tại dưới dạng mô tả văn bản — ví dụ của chính tài liệu mô tả một phụ nữ ở độ tuổi đôi mươi nói chuyện với người bạn đời vừa về nhà, với giọng ấm áp, ân cần và khẽ đùa giỡn, âm sắc mềm mại ngọt ngào, và ngữ điệu cuối câu hơi lên cao — tất cả mà không có đoạn clip tham chiếu nào đi kèm. Điều này loại bỏ nhu cầu về một bản ghi tham chiếu, vốn thường là chi phí tiên quyết của việc clone giọng. Báo cáo lần đầu tiên đưa ra con số cụ thể cho tác vụ này, và đây là một trong số ít khía cạnh mà AuK vượt trội hoàn toàn so với các đối thủ thay vì chỉ nhỉnh hơn.

Bên trong "1.5B": con số này đánh giá thấp runtime.

Số lượng tham số của AuK mô tả transformer khuếch tán, không phải toàn bộ pipeline, và bài báo giờ đây đã nêu rõ cả hai phần. Backbone là một Transformer lai rectified-flow — ba mươi lớp được tạo thành từ mười khối MMDiT hai luồng, tiếp theo là hai mươi khối DiT đơn luồng hợp nhất, kích thước ẩn 1536, 24 đầu attention có chiều 64, độ rộng trung gian SwiGLU 3072 — đây chính là nguồn gốc của con số "khoảng 1,5 tỷ tham số". Bao quanh nó là hai thành phần được tải riêng biệt: một LLM đa phương thức (Qwen/Qwen2.5-Omni-3B) biến chỉ dẫn và mọi âm thanh tham chiếu thành điều kiện hóa ngữ nghĩa, và một VAE âm thanh nhân quả 24 kHz — cấu hình đặt tên nó là BigVGANFlowVAE — chạy các biến tiềm ẩn 64 chiều ở tốc độ khung hình 50 Hz, với độ rộng kênh bộ mã hóa lên tới 768 và bộ giải mã lên tới 1536. Vậy nên toàn bộ runtime là backbone ~1,5B cộng với bộ mã hóa 3B cộng với VAE, và hướng dẫn tải xuống nêu rõ rằng bộ mã hóa là một checkpoint riêng biệt với các điều khoản riêng của nó.

Theo báo cáo, quá trình huấn luyện diễn ra theo nhiều giai đoạn và ở quy mô mà trang dự án chỉ hé lộ: khởi động chỉ tạo sinh với 50.000 bước cập nhật, sau đó là 600.000 bước cập nhật kết hợp tạo sinh và biên tập, trên khoảng 3,03 tỷ mẫu hướng dẫn–âm thanh tương ứng với khoảng 1,95 triệu giờ giám sát hiệu dụng, trải trên 256 GPU, cùng 1,24 triệu bước cập nhật bổ sung trên VAE. Giai đoạn hậu huấn luyện kết hợp tối ưu hóa ưu tiên theo phản hồi con người với học tăng cường dựa trên phần thưởng, xây dựng trên 818 nhóm ưu tiên giàu thông tin và 9.080 ứng viên được chấm điểm, các tập prompt RL gồm 10.000 prompt zero-shot và 5.000 prompt tuân theo hướng dẫn, 30.000 mẫu đánh giá phong cách, cùng một mô hình phần thưởng được tinh chỉnh từ Qwen2.5-Omni-7B. Đó là một bộ công cụ hậu huấn luyện nghiêm túc cho một bản phát hành mở 1.5B, đồng thời cũng là lời nhắc rằng "trọng số mở" mô tả sản phẩm đầu ra, chứ không phải hạ tầng tính toán đã tạo ra nó — một điểm đáng ghi nhớ khi cân nhắc liệu bạn có thể tái tạo nó hay không.

A generated single-column scoreboard for AuK listing Params: 1.5B backbone + 3B Qwen encoder; License: MIT; Open-sourced: 2026-09-07 weights · 2026-09-09 code; Tasks: 16 across 5 speech families; Runtime: 24 kHz · 50 Hz audio latents; AuK-Flash: 4-step, no CFG, 4.5× faster (vendor), with the footer "Specs from Tencent's repos & project site; vendor-reported, not independently reproduced yet." and the OrcaRouter logo composited in the bottom-right corner.

Mọi con số trong bảng thông số kỹ thuật đó đều được đọc từ chính kho lưu trữ và trang web của Tencent thay vì do chúng tôi đo lường, và bài báo không thay đổi điều đó — nó chỉ chuyển nhiều dòng trong số đó từ {{1}}được công bố{{/1}} sang {{2}}được ghi nhận{{/2}}. Con số duy nhất thực sự được kiểm nghiệm kể từ khi chúng tôi xuất bản lần đầu là hoạt động của chính kho lưu trữ, tăng từ không sao lên vài trăm sao trong một ngày.

A screenshot of the AuK project website at auk-project.github.io, captured September 9, 2026, showing the title "AuK: An Open-Source Foundational Model for Speech Generation and Editing", badge links for GitHub, Hugging Face and ModelScope, the AuK-Flash variant name alongside Tencent Hunyuan co-branding, the tagline "One model for every speech task", and the opening description of AuK as a 1.5B-parameter foundational model with a multimodal language model, a 50 Hz VAE and a hybrid transformer under a flow-matching objective.

Trang web dự án vẫn là nơi lưu giữ sơ đồ kiến trúc và phần thương hiệu đồng hành học thuật, đồng thời vẫn là cách nhanh nhất để hình dung cấu trúc của mô hình: một mô hình ngôn ngữ đa phương thức dùng cho điều kiện hóa ngữ nghĩa, một VAE 50 Hz cho âm thanh, và một transformer lai vận hành theo hàm mục tiêu flow-matching. Phần benchmark của trang, nơi từng chỉ liệt kê một bộ công cụ đánh giá mà không có điểm số khi chúng tôi xem lần đầu, giờ đã có một bài báo để tham chiếu.

Bản báo cáo kỹ thuật được công bố, và các con số là của riêng Tencent.

Đây là nội dung chính của bản cập nhật. Bài báo công bố kết quả trên bảy bộ đánh giá — cùng danh sách mà trang dự án đã quảng bá trước đó mà không kèm số liệu — và trên hầu hết các trục tạo sinh và chỉnh sửa nội dung, AuK dẫn đầu trong nhóm mã nguồn mở. Hãy đọc chúng như một bảng benchmark của nhà cung cấp, vì thực chất chúng là vậy: Tencent đã chạy mọi phép so sánh, tự chọn mọi baseline, và vẫn chưa công bố mã nguồn để tái tạo lại bộ khung đánh giá.

• TTS zero-shot trên Seed-TTS-Eval: AuK đạt trung bình WER 2.65 với độ tương đồng giọng nói 0.795, so với Qwen3-TTS ở mức 3.07 và 0.745, Seed-TTS ở mức 3.65 và 0.778, và VoxCPM2 ở mức 3.65 và 0.767. AuK-Flash đạt 2.85 và 0.790. Các tập con đơn lẻ tốt nhất đạt WER 1.02 trên bộ kiểm tra tiếng Anh và 5.91 trên bộ khó tiếng Trung.

• TTS điều khiển bằng chỉ dẫn trên InstructTTSEval: AuK đạt 83.37 cho tiếng Trung và 81.60 cho khả năng bám sát mô tả tiếng Anh, so với Qwen3-TTS-VD ở mức 81.10 và 82.40 và MOSS-VoiceGenerator ở mức 80.00 và 82.00. AuK-Flash đạt 78.80 cho tiếng Trung nhưng ngang bằng điểm tiếng Anh tốt nhất trong lĩnh vực ở mức 82.40.

• Chỉnh sửa nội dung trên SpeechEditBench: độ chính xác 91.83 so với 76.46 của Ming-UniAudio, và 71.33 về ngữ điệu so với 26.50 — hai khoảng cách lớn nhất trong báo cáo.

Chỉnh sửa theo hướng dẫn trên Ming-Freeform-Audio-Edit, cài đặt đầy đủ: tỷ lệ lỗi từ giảm từ 10,46 xuống 3,09 trên tiếng Trung và từ 14,28 xuống 3,96 trên tiếng Anh so với Ming-UniAudio, với độ chính xác chỉnh sửa tăng từ 79,62 lên 91,47 và từ 70,98 lên 85,25. Đối với chỉnh sửa âm học, cùng so sánh đó đưa tỷ lệ lỗi từ từ 5,01 xuống 2,02 trong tiếng Trung và từ 10,75 xuống 3,48 trong tiếng Anh.

• Chỉnh sửa ngữ điệu trên MMAE-Speech: tỷ lệ tuân theo chỉ dẫn 48,23 và viết lại nội dung 88,11 so với Step-Audio-EditX ở mức 43,52 và 77,27, và Ming-UniAudio ở mức 34,13 và 76,01. AuK-Flash đạt độ thu hồi mô hình chỉnh sửa tốt nhất trong bảng ở mức 13,85.

• Phục hồi, nơi mô hình mang tính cạnh tranh thay vì chiếm ưu thế: DNS Challenge tỷ lệ lỗi từ không đồng bộ 2.66 với độ tương đồng giọng nói 0.99 so với RE-USE ở mức 3.31; CHiME-4 tỷ lệ lỗi từ 7.98 so với RE-USE ở mức 10.71; Libri2Mix tỷ lệ lỗi từ 9.12 so với MossFormer2-SS ở mức 9.34; và VCTKSR tỷ lệ lỗi từ 3.06 với độ tương đồng 0.97.

• Bản thân VAE, khi được đánh giá riêng: AuK-VAE đạt 4.143 PESQ trên giọng nói, 3.833 trên âm thanh tổng quát và 3.884 trên âm nhạc, so với MiniMax-H3-AudioVAE ở mức 3.633, 2.835 và 2.801 — một cú quét sạch có ý nghĩa lớn hơn vẻ bề ngoài, bởi vì một latent âm thanh tổn hao đặt trần cho mọi tác vụ được xây dựng trên nó.

Xu hướng xuyên suốt các gạch đầu dòng đó thú vị hơn những chiến thắng nổi bật. AuK vượt xa ở mọi hạng mục mang ý nghĩa "thay đổi điều được nói hoặc cách nó phát ra âm thanh, và giữ nguyên mọi thứ khác" — chỉnh sửa nội dung, ngữ điệu, chỉnh sửa âm học, tái tạo. Nó gần với mặt bằng chung hơn nhiều ở mảng chỉnh sửa cảm xúc và cận ngôn ngữ, nơi độ chính xác cảm xúc trên SpeechEditBench của nó là 9.94 gần như không thể phân biệt với 3.43 của Ming-UniAudio trên một benchmark mà cả hai đều yếu, và điểm âm học tổng thể 37.07 của nó nằm trong cùng khoảng với các baseline. Vậy nên "một mô hình cho mọi tác vụ giọng nói" là cách Tencent đóng khung; điều báo cáo thực sự cho thấy là một mô hình xuất sắc ở một vài tác vụ và chỉ góp mặt ở phần còn lại.

Hai điểm kiểm tra: AuK và AuK-Flash

Tencent đã phát hành hai biến thể dưới cùng một giấy phép MIT. AuK là mô hình cơ sở chất lượng đầy đủ, và báo cáo cố định cài đặt lấy mẫu của nó ở 32 lần đánh giá hàm với thang hướng dẫn không phân loại là 2.0. AuK-Flash là phiên bản chưng cất: khởi tạo nhất quán và mục tiêu DMD tách rời định tuyến theo tác vụ, tạo sinh trong bốn bước cố định với hướng dẫn bị tắt hoàn toàn, được bài báo báo cáo là nhanh hơn 4,5× theo thời gian thực so với mô hình đầy đủ trong các điều kiện tương đương. Các con số của chính bài báo vẫn giữ Flash ở mức gần ngang bằng trong hầu hết các tác vụ tạo sinh — lỗi từ trung bình 2,85 và độ tương đồng 0,790 trên Seed-TTS-Eval — điều này khiến cho tuyên bố về tốc độ đáng để kiểm chứng hơn là bác bỏ: khuếch tán bốn bước với chất lượng gần bằng mô hình giáo viên chính là thứ làm cho trình biên tập giọng nói 1,5B có cảm giác tương tác trên một GPU duy nhất. Tuy nhiên, "điều kiện tương đương" là cụm từ của Tencent mô tả tiêu chuẩn đánh giá của Tencent, và con số 4,5× do chính các tác giả đo được chính là loại tuyên bố cần một bên thứ ba xác nhận trước khi nó thay đổi bất kỳ quyết định mua sắm nào.

Những gì bạn có thể chạy hôm nay

Phạm vi ứng dụng thực tế rộng hơn so với một bản phát hành trọng số âm thầm điển hình, vì mã nguồn đi kèm với nó. Cài đặt nhắm đến Python 3.10 qua uv hoặc Conda, và README cung cấp các tùy chọn cài đặt bổ sung để kéo về Gradio, các nút ComfyUI, hoặc bộ công cụ tinh chỉnh. Công cụ dòng lệnh auk-infer bao phủ mọi tác vụ với cùng một cấu trúc tin nhắn: --instruction luôn bắt buộc, còn --audio là tùy chọn tùy theo tác vụ. Một máy chủ Gradio (auk-gradio) cho phép truy cập các mô hình với bộ chọn, và có các nút tùy chỉnh ComfyUI với một quy trình làm việc tái sử dụng, mặc dù tích hợp được ghi nhận với giới hạn 30 giây cho chuỗi nguồn-và-đích. Một API Python phản chiếu CLI, và một đường ống tinh chỉnh nhẹ huấn luyện trên các cặp chỉ thị-âm thanh ở định dạng JSONL, sử dụng cùng cấu trúc tin nhắn như khi suy luận. README cũng mô tả một Prompt Enhancer biến các yêu cầu tự do thành các lệnh auk-infer sẵn sàng chạy; nó giả định có một điểm cuối chat tương thích OpenAI và chuyển sang dùng mô hình SenseVoiceSmall cục bộ để nhận dạng giọng nói khi không có thông tin xác thực ASR đám mây nào được thiết lập. Một hạn chế hiện tại được nêu rõ ràng: Qwen3-Omni chưa được hỗ trợ làm đường dẫn mã hóa, vì vậy checkpoint Qwen2.5-Omni-3B vẫn là bản cần tải xuống.

Điều mà các tài liệu vẫn chưa cung cấp cho bạn là một ngưỡng phần cứng tối thiểu. Không có con số VRAM nào được công bố cho quá trình suy luận. Các tệp cấu hình có ghi chú về gradient-checkpointing với mức đỉnh khoảng ~91 GB giảm xuống còn ~75 GB, con số này mô tả mức bộ nhớ trong thời gian huấn luyện chứ không phải con số suy luận thực tế cho một lần chạy, và lệnh tham chiếu nạp AuK cùng AuK-Flash với nhau sẽ phân bổ chúng trên hai GPU — trong khi lưu ý rằng cả hai có thể dùng chung một GPU. Hãy dự trù cho việc tải xuống: khoảng 6,8 GB cho mỗi biến thể cộng với bộ mã hóa Qwen2.5-Omni-3B, sau đó tự đo bộ nhớ trên GPU của bạn.

Điều gì chưa được xác nhận

Việc chính xác về những điều chưa biết vẫn là mục đích của việc đưa tin về một mô hình sớm như thế này, và báo cáo đã loại bỏ đúng một mục khỏi danh sách này trong khi vẫn giữ nguyên phần còn lại:

• Không có bất kỳ lần chạy độc lập nào mà chúng tôi có thể tìm thấy. Không có mẫu giọng nói bên thứ ba, không có bản tái lập chuẩn đối sánh, không có ấn tượng từ các luồng thảo luận. Vấn đề mở đầu tiên của kho lưu trữ được gửi nhưng chưa được trả lời, và số lượt tải của thẻ mô hình vẫn chỉ ở mức hàng chục, do đó khoảng cách giữa một bảng kết quả được công bố và một bảng kết quả được tái tạo hiện chính là toàn bộ câu chuyện.

• Việc đánh giá là tự thực hiện và hạn hẹp ở một khía cạnh cụ thể. Mọi baseline trong báo cáo đều là một mô hình trọng số mở khác — Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS. Không có nền tảng giọng nói đóng (closed hosted) nào mà người mua thực sự sẽ đem AuK ra so sánh xuất hiện, vì vậy "dẫn đầu lĩnh vực" ở đây có nghĩa là "dẫn đầu lĩnh vực mở mà Tencent đã chọn".

• Tên "AuK" vẫn không bao giờ được viết đầy đủ ở bất kỳ đâu trong bài báo, thẻ hay mã nguồn, và nó gây xung đột lớn khi tìm kiếm với chim biển, Đại học American University of Kuwait và các kho lưu trữ không liên quan.

• Nhóm nghiên cứu ít nhất cũng đã lộ diện — bài báo có 33 tác giả, đứng đầu là Ziyang Ma, với các đơn vị công tác trải dài từ tổ chức Tencent Hunyuan, Đại học Giao thông Thượng Hải, Viện Sáng tạo Thượng Hải và Đại học Công nghệ Nanyang — nhưng ai trong nội bộ Tencent quản lý mô hình hằng ngày, và liệu đây là một dòng sản phẩm Hunyuan hay một hợp tác học thuật riêng biệt, vẫn chưa được nêu rõ.

• Phạm vi ngôn ngữ vẫn chỉ được ghi nhận một phần: thẻ AuK-Flash công bố tiếng Trung và tiếng Anh, và các ví dụ mã kết hợp cả hai, nhưng mô hình cơ sở không có danh sách ngôn ngữ chính thức. Cấp phép cũng có hình dạng tương tự — bản thân AuK được cấp MIT, trong khi bộ mã hóa Qwen tải riêng rẽ lại có các điều khoản riêng của nó, do đó "mô hình MIT" và "MIT mọi thứ bạn cần để chạy nó" không phải là cùng một tuyên bố.

Tại sao một mô hình giọng nói hợp nhất với trọng số mở lại quan trọng

Đọc danh sách tác vụ của AuK so với những gì một builder thực sự làm hôm nay, và ván cược trở nên rõ ràng hơn so với trước khi các con số xuất hiện. Làm tất cả những công việc đó bằng các công cụ hiện có đồng nghĩa với việc phải chuỗi nối nhiều mô hình chuyên biệt — một checkpoint mở để clone, một mô hình khác để nâng cao, một bộ tách riêng, và chỉnh sửa thủ công hoặc có mô hình hỗ trợ cho nội dung — hoặc thuê nhiều API đóng lưu trữ, mỗi cái tính phí theo tác vụ và theo phút âm thanh, và không cái nào chỉnh sửa được theo cách AuK mô tả. Một checkpoint trọng số mở duy nhất xử lý tất cả các tác vụ đó như một bài toán sinh có điều kiện bằng văn bản là một thứ thực sự khác biệt, và báo cáo giờ đây hỗ trợ một phiên bản sắc nét hơn của tuyên bố đó so với phần marketing: nửa chỉnh sửa là thật, không phải kỳ vọng. Voice cloning đã bị hàng hóa hóa trong năm qua, nhưng chỉnh sửa nội dung và ngữ điệu điều khiển bằng chỉ dẫn mới là nơi các nền tảng đóng vẫn còn kiếm được biên lợi nhuận của họ, và điểm 91.83 so với 76.46 về chỉnh sửa nội dung là bằng chứng đầu tiên cho thấy một mô hình mở có thể chiếm được mảng đất đó.

Sự đánh giá thẳng thắn là đây là một mô hình khuếch tán (diffusion model) với một mô hình ngôn ngữ 3B được gắn thêm vào để điều kiện hóa, và nó kế thừa chi phí của hình thái đó. Chất lượng cho từng tác vụ không đồng đều — xuất sắc khi tác vụ là "giữ nguyên mọi thứ trừ phần chỉnh sửa", mỏng hơn về cảm xúc — và không có endpoint được lưu trữ, không có câu chuyện batch, và không có độ trễ được công bố cho bất kỳ thứ gì ngoài sự so sánh nội bộ của biến thể Flash. Đối với các mảnh ghép của một pipeline giọng nói xung quanh nó — LLM quyết định nội dung cần nói, và endpoint chat tương thích OpenAI của Prompt Enhancer — một API định tuyến là lựa chọn tự nhiên, và OrcaRouter hỗ trợ hơn 200 mô hình với giá niêm yết của nhà cung cấp, không tăng giá, để nửa stack chỉ cần một khóa và không cần hợp đồng thứ hai. Nửa âm thanh vẫn là một GPU bạn kiểm soát và một checkpoint mà không ai ngoài Tencent đã kiểm tra.

Ai nên xem ngay bây giờ, và ai nên chờ đợi?

Đối với các nhà nghiên cứu giọng nói, những người xây dựng công cụ và bất kỳ ai có nhiệm vụ đánh giá các mô hình giọng nói mới, lý do để tải AuK trong tuần này mạnh hơn so với ngày đầu ra mắt nhưng vẫn đi kèm với cùng một lời cảnh báo. Giờ đây bạn có một kiến trúc được tài liệu hóa, một công thức trông có vẻ tái lập được và một bảng đầy đủ các mục tiêu cần vượt qua — chính điều đó khiến một tuyên bố chưa được tái lập trở nên đáng để công kích. Cái giá của việc tiếp cận sớm vẫn là một ngày cuối tuần cài đặt và một GPU. Đối với bất kỳ ai đang chọn một bộ công nghệ giọng nói cho sản xuất, báo cáo này làm thay đổi cục diện quyết định mà không giải quyết dứt điểm nó: giờ đây đã có những con số để tranh luận, nhưng đó là số liệu của nhà cung cấp, chúng loại trừ các nền tảng đóng mà bạn thực sự sẽ đem ra so sánh chuẩn, và vẫn chưa có API, chưa có mức VRAM tối thiểu và chưa có thành tích nào. Hãy theo dõi, theo thứ tự: một bản tái lập độc lập các dòng Seed-TTS-Eval và SpeechEditBench; các mẫu đã công bố hoặc một demo Space có thể truy cập; và một nhà cung cấp dịch vụ inference hoặc API lưu trữ bắt đầu hỗ trợ AuK, lúc đó giá chuyển tiếp từ phía chúng tôi chính là giá niêm yết của nhà cung cấp, áp dụng ngay trong ngày, vì đó là ý nghĩa của mức phụ giá 0%. Câu hỏi thú vị không còn là liệu Tencent có tung ra thêm một mô hình TTS nữa hay không — mà là liệu một mô hình mở có thể thực sự đảm đương cùng lúc cả năm nhóm tác vụ đó hay không, và giờ Tencent đã công bố câu trả lời của riêng mình, điều duy nhất còn lại là để người khác kiểm chứng nó.