
AuK: Tencent เปิดซอร์สโมเดลเสียงขนาด 1.5B อย่างเงียบ ๆ ที่ถือว่างานเสียงทุกอย่างเป็นคำสั่งข้อความ
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
นี่คือประโยคที่ไม่มีเครื่องมือเสียงพูดเพียงตัวเดียวที่คุณดาวน์โหลดได้ในวันนี้จะทำได้ในครั้งเดียว: นำไฟล์บันทึกนี้มาเปลี่ยนคำว่า "house" เป็น "home" เพิ่มระดับเสียงขึ้นครึ่งเสียง (เซมิโทน) เอาลมหายใจก่อนวลีสุดท้ายออกไป ขจัดเสียงรบกวนพื้นหลัง แล้วอ่านผลลัพธ์ซ้ำด้วยเสียงใหม่เอี่ยมที่อธิบายเพียงว่า "ผู้ชายวัยกลางคนที่อบอุ่นด้วยสำเนียงกวางตุ้งเล็กน้อย" คำตอบของเทนเซ็นต์ต่อประโยคนั้นคือ AuK โมเดลพื้นฐานสำหรับการสร้างและแก้ไขเสียงพูดขนาด 1.5 พันล้านพารามิเตอร์ ซึ่งเปิดเป็นโอเพนซอร์สในสัปดาห์นี้โดยไม่มีโพสต์เปิดตัวและไม่มีข่าวประชาสัมพันธ์ — และ AuK-Flash รุ่นกลั่นของมันตอนนี้มาพร้อมกับสิ่งหนึ่งที่ขาดหายไปจากเรื่องนี้เมื่อเราเขียนถึงครั้งแรก: รายงานทางเทคนิคที่มีตัวเลขประกอบ ตอนนี้ "AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing" (arXiv:2609.08936, cs.SD, ส่งเมื่อ 2026-09-08) ถูกอ้างอิงทั้งในการ์ดโมเดลของ Hugging Face และ README ของ GitHub โดยรายการเอกสารลงวันที่ 2026-09-08 และบรรทัดข่าวของที่เก็บโค้ดเองลงวันที่ 2026/09/09 สิ่งที่รายงานไม่ได้ทำคือการไขข้อสงสัยที่สำคัญ — ตัวเลขทุกตัวในนั้นเป็นของเทนเซ็นต์เอง รันเทียบกับเบสไลน์ที่เทนเซ็นต์เลือก และ ณ วันที่ 2026-09-10 ยังไม่มีใครนอกบริษัททำซ้ำได้แม้แต่ตัวเดียว
นี่คือบทความสรุปเท่าที่ทราบในตอนนี้ ซึ่งแก้ไขปรับปรุงแล้วหนึ่งครั้ง เทนเซนต์ยังไม่ได้ประกาศเปิดตัว AuK ผ่านช่องทางหลักใดๆ ที่เราหาได้ ดังนั้นหลักฐานที่มีอยู่จึงเป็นเพียง: การ์ดโมเดลและคลังเก็บโค้ดสำหรับ AuK และ AuK-Flash บน Hugging Face, คลังเก็บโค้ดภายใต้องค์กร Tencent-Hunyuan, เว็บไซต์โครงการที่ auk-project.github.io และตอนนี้ก็มีรายงานวิจัยเพิ่มเข้ามา การเพิ่มเติมส่วนหลังนี้เปลี่ยนสิ่งที่เราสามารถรู้ได้ — สถาปัตยกรรม สูตรการฝึก และตัวเลขประเมินผลถูกอธิบายอย่างละเอียดเป็นครั้งแรก — โดยไม่ได้เปลี่ยนสิ่งที่ได้รับการยืนยันแล้ว จงถือว่าตัวเลขทั้งหมดด้านล่างนี้เป็นข้อมูลที่ผู้ผลิตเป็นผู้รายงาน เพราะแท้จริงแล้วมันเป็นเช่นนั้น และโปรดสังเกตว่าการเปรียบเทียบในรายงานทำกับโมเดลโอเพนอื่นเท่านั้น ไม่ใช่กับแพลตฟอร์มเสียงแบบบริการโฮสต์แบบปิดที่ AuK จะต้องแข่งขันด้วยจริงๆ
จริงๆ แล้วมีอะไรเปิดตัวบ้าง และเงียบแค่ไหน
ไทม์ไลน์ยังคงเป็นบทสรุปที่ตรงไปตรงมาที่สุดของการเปิดตัวครั้งนี้ โดยมีการแก้ไขหนึ่งจุดจากรอบแรกของเรา ที่เก็บข้อมูลบน Hugging Face ถูกสร้างขึ้นในช่วงกลางเดือนสิงหาคม — AuK เมื่อวันที่ 2026-08-18 — แต่ไม่ได้มีการเคลื่อนไหวใด ๆ จนกระทั่งสัปดาห์นี้ เมื่อเราอ่านการ์ดโมเดลของ AuK เมื่อวันที่ 2026-09-09 บรรทัดข่าวเพียงบรรทัดเดียวของมันระบุวันที่ 2026-09-07; วันต่อมา บรรทัดเดียวกันนี้แสดงเป็น 2026/09/09 และชี้ให้ผู้อ่านไปที่เอกสารวิชาการและ Spaces สำหรับสาธิต ที่เก็บข้อมูลบน GitHub ซึ่งเก็บโค้ดสำหรับการอนุมานและการฝึก ถูกสร้างเมื่อวันที่ 2026-08-19 และมีการ push ครั้งล่าสุดเมื่อวันที่ 2026-09-09 กล่าวอีกนัยหนึ่ง: ค่าน้ำหนัก ตามด้วยโค้ด แล้วก็รายงานทางเทคนิค — การปล่อยแบบเป็นขั้นตอนสามครั้งในสี่วัน และยังไม่มีการประกาศจากช่องทางหลักของเทนเซ็นต์ ณ เวลาที่เขียน
• น้ำหนักของโมเดลอยู่บน Hugging Face ภายใต้องค์กร tencent และถูกมิร์เรอร์บน ModelScope ภายใต้ Tencent-Hunyuan — สองมิร์เรอร์ ใช้สัญญาอนุญาต MIT เหมือนกัน
• พื้นที่เก็บโมเดลแต่ละรายการบรรจุ checkpoint safetensors หนึ่งเดียว พร้อมด้วย config และ VAE: auk_base.safetensors ขนาด 6.12 GB และ vae.safetensors ขนาด 0.64 GB สำหรับ AuK; และมีรูปแบบเดียวกันสำหรับ AuK-Flash การ์ดโมเดลแนะนำให้คุณดาวน์โหลด Qwen/Qwen2.5-Omni-3B เพิ่มเติมด้วย ซึ่งเป็น text encoder ที่ AuK โหลดแยกต่างหากในขณะรันไทม์
กรอบ 'ไม่มีใครสังเกตเห็น' หมดอายุไปแล้ว และเร็วมาก ที่เก็บโค้ดมีดาวเป็นศูนย์และฟอร์กเป็นศูนย์เมื่อเราตรวจสอบเมื่อวันที่ 2026-09-09; ภายในวันที่ 2026-09-10 มันแสดงดาว 216 ดาว ฟอร์ก 12 รายการ และอิสชัวแรกที่เปิดอยู่ การ์ด AuK รายงานว่ามีการดาวน์โหลดประมาณสามสิบครั้งในเดือนที่ผ่านมา พร้อมกับถูกใจ 26 ครั้ง สิ่งที่ไม่เปลี่ยนแปลง: แท็บสนทนายังว่างเปล่า และการ์ดยังระบุว่าเช็คพอยต์ไม่ได้ถูกปรับใช้โดยผู้ให้บริการอนุมานใด ๆ
• การ์ดโมเดลทั้งสอง, README และลิงก์ paper สาธิต Spaces บน Hugging Face และ ModelScope. Space บน Hugging Face ไม่สามารถเข้าถึงได้โดยสาธารณะโดยไม่ต้องเข้าสู่ระบบเมื่อเราตรวจสอบ ดังนั้นให้ถือว่าเส้นทาง "try it in your browser" ยังไม่ได้รับการยืนยันสำหรับผู้ใช้ที่ไม่ได้เข้าสู่ระบบ

การ์ด Hugging Face ข้างต้นยังคงเป็นพื้นผิวสาธารณะทั้งหมดของรีลีสที่ติดตั้งได้: การ์ดโมเดล คอนฟิก ไฟล์ safetensors สองไฟล์ และใบอนุญาต สิ่งที่ถูกเพิ่มเติมตั้งแต่นั้นคือชั้นเอกสารประกอบรอบ ๆ ตัวมัน — เอกสารวิจัย ตาราง benchmark และบล็อกการอ้างอิง — และไม่มีสิ่งใดเปลี่ยนแปลงข้อเท็จจริงที่ว่าไม่มี changelog กระทู้สนทนา หรือรายการผู้ให้บริการ inference อยู่เบื้องหลังมัน
แนวคิด: อินเทอร์เฟซคำสั่งเดียว รองรับงานเสียงพูดสิบหกงาน
คำกล่าวอ้างของ AuK ไม่ใช่ว่ามันเป็นโมเดลแปลงข้อความเป็นเสียงพูดที่ดีที่สุดเท่าที่เคยเปิดตัวมา แต่มันคือการที่การสร้างเสียงพูดเป็นเพียงหนึ่งในห้ากลุ่มงานด้านเสียงที่โมเดลถูกฝึกให้ทำผ่านอินเทอร์เฟซภาษาธรรมชาติเพียงหนึ่งเดียว โดยคำขอคือข้อความแชทที่สามารถบรรจุข้อความและไฟล์เสียงอ้างอิงเสริมได้ เอกสารฉบับนี้ทำให้การจัดหมวดหมู่ที่เว็บไซต์ของโครงการได้ประชาสัมพันธ์ไว้แล้วเป็นทางการ:
• การสร้างคำพูด — TTS แบบ zero-shot (พูดข้อความนี้ด้วยเสียงจากคลิปอ้างอิง) และ TTS แบบ instruction (สร้างคำพูดจากคำอธิบายเสียงเพียงอย่างเดียว โดยไม่ต้องมีเสียงอ้างอิงเลย)
• การแก้ไขเนื้อหา — เขียนคำพูดใหม่: แทนที่ แทรก หรือลบคำในไฟล์บันทึกเสียงที่มีอยู่; และการแก้ไขเนื้อเพลง ซึ่งเขียนเนื้อเพลงที่ขับร้องไว้ใหม่โดยคงทำนองและเสียงร้องไว้
• การตัดต่อเสียง — ระดับเสียงในหน่วยเซมิโทน การปรับอัตราการพูด และระดับความดังในหน่วยเดซิเบล
• การแก้ไขอวัจนภาษา — การเปลี่ยนอารมณ์ การเปลี่ยนสีเสียงตามคำอธิบาย การลดสำเนียง การเพิ่มหรือลบเสียงที่ไม่ใช่คำพูด (เสียงลมหายใจ เสียงหัวเราะ เสียงไอ) และการแปลงระหว่างการพูดปกติกับเสียงกระซิบ โดยยังคงเสียงของผู้พูดคนเดิมไว้
• การเพิ่มคุณภาพและการแยกสัญญาณ — การลดเสียงรบกวนและการลดเสียงก้องของคำพูด, การแยกคำพูดตามลำดับการพูด, การแยกดนตรีและเสียงร้อง, และการสกัดเสียงผู้พูดเป้าหมายที่ระบุจากสิ่งที่ผู้พูดพูด
กรณี instruction-TTS เป็นสิ่งที่แยกสิ่งนี้ออกจากรีลีสการโคลนเสียงทั่วไป: AuK จะอ่านประโยคด้วยเสียงที่มีอยู่เพียงเป็นคำอธิบายข้อความเท่านั้น — ตัวอย่างในเอกสารเองระบุถึงผู้หญิงอายุยี่สิบต้นๆ พูดกับคู่รักที่เพิ่งกลับมาบ้าน ด้วยน้ำเสียงอบอุ่น เอาใจใส่ และหยอกเย้าเบาๆ มีน้ำเสียงที่นุ่มหวานและท้ายประโยคที่สูงขึ้นเล็กน้อย โดยไม่มีคลิปอ้างอิงแนบมา ซึ่งช่วยขจัดความจำเป็นต้องมีการบันทึกเสียงอ้างอิง ซึ่งเป็นต้นทุนที่เป็นอุปสรรคตามปกติของการโคลนเสียง รายงานระบุตัวเลขสำหรับงานนั้นเป็นครั้งแรก และเป็นหนึ่งในไม่กี่จุดที่ AuK ชนะคู่แข่งอย่างชัดเจนมากกว่าเอาชนะแบบเฉียดฉิว
ภายใน "1.5B" ตัวเลขทำให้รันไทม์ดูน้อยเกินความเป็นจริง
จำนวนพารามิเตอร์ของ AuK อธิบายถึง diffusion transformer ไม่ใช่ทั้งไปป์ไลน์ และเอกสารฉบับนี้ระบุทั้งสองส่วนไว้อย่างชัดเจนแล้ว โครงสร้างหลัก (backbone) เป็น hybrid rectified-flow Transformer — สามสิบเลเยอร์ประกอบด้วยบล็อก MMDiT แบบ dual-stream จำนวนสิบบล็อก ตามด้วยบล็อก DiT แบบ single-stream แบบรวม (unified) จำนวนยี่สิบบล็อก ขนาด hidden 1536, แอตเทนชันเฮด 24 ตัว แต่ละตัวมีมิติ 64, ความกว้างขั้นกลางของ SwiGLU 3072 ซึ่งเป็นที่มาของตัวเลข "ประมาณ 1.5 พันล้านพารามิเตอร์" รอบ ๆ ประกอบด้วยสองส่วนประกอบที่โหลดแยกกัน: multimodal LLM (Qwen/Qwen2.5-Omni-3B) ที่แปลงคำสั่งและเสียงอ้างอิงใด ๆ ให้เป็น semantic conditioning และ causal 24 kHz audio VAE — ในการตั้งค่าคอนฟิกเรียกมันว่า BigVGANFlowVAE — ซึ่งประมวลผล latents 64 มิติที่อัตราเฟรม 50 Hz โดยมีความกว้างช่องสัญญาณของเอนโค้ดเดอร์สูงสุด 768 และดีโค้ดเดอร์สูงสุด 1536 ดังนั้นรันไทม์ทั้งหมดคือ backbone ประมาณ 1.5B บวกเอนโค้ดเดอร์ 3B และ VAE และคำแนะนำในการดาวน์โหลดระบุชัดเจนว่าเอนโค้ดเดอร์เป็นเช็คพอยต์แยกต่างหากที่มีข้อกำหนดของตัวเอง
ตามรายงาน การฝึกดำเนินเป็นขั้นตอนและในขนาดที่ไซต์โปรเจกต์บอกใบ้เพียงผิวเผินเท่านั้น: การวอร์มอัพเฉพาะการสร้างด้วยการอัปเดต 50,000 ครั้ง จากนั้นเป็นการอัปเดตแบบร่วมการสร้างและการแก้ไข 600,000 ครั้ง บนอินสแตนซ์คำสั่ง–เสียงประมาณ 3.03 พันล้านรายการ ซึ่งคิดเป็นเวลาการกำกับดูแลที่มีประสิทธิผลประมาณ 1.95 ล้านชั่วโมง ครอบคลุม GPU 256 ตัว และมีการอัปเดตเพิ่มเติมอีก 1.24 ล้านครั้งบน VAE การฝึกหลังการฝึกผสานการปรับให้เหมาะสมตามความชอบจากฟีดแบ็กมนุษย์เข้ากับการเรียนรู้แบบเสริมกำลังตามรางวัล สร้างขึ้นจากกลุ่มความชอบที่ให้ข้อมูล 818 กลุ่มและผู้สมัครที่ได้รับการให้คะแนน 9,080 ราย ชุดพรอมต์ RL จำนวน 10,000 พรอมต์แบบ zero-shot และ 5,000 พรอมต์แบบปฏิบัติตามคำสั่ง ตัวอย่างการตัดสินรูปแบบ 30,000 ตัวอย่าง และโมเดลรางวัลที่ปรับละเอียดจาก Qwen2.5-Omni-7B นับเป็นชุดการฝึกหลังการฝึกที่จริงจังสำหรับการเผยแพร่แบบเปิดขนาด 1.5B และยังเป็นเครื่องเตือนใจว่า "น้ำหนักเปิด" อธิบายถึงอาร์ติแฟกต์ ไม่ใช่พลังคำนวณที่ผลิตมันขึ้นมา — เป็นประเด็นที่ควรจดจำไว้เมื่อชั่งน้ำหนักว่าคุณจะสามารถทำซ้ำได้หรือไม่

ตัวเลขทุกตัวในสเปกชีตนั้นอ่านจาก repositories และเว็บไซต์ของ Tencent เอง แทนที่จะถูกวัดโดยเรา และบทความก็ไม่ได้เปลี่ยนสิ่งนั้น — มันแค่ย้ายบรรทัดเหล่านั้นจำนวนมากขึ้นจาก "ที่อ้างว่า" ไปเป็น "ที่บันทึกไว้" ตัวเลขหนึ่งที่ถูกทดสอบจริงตั้งแต่เราตีพิมพ์ครั้งแรกคือกิจกรรมของ repository เอง ซึ่งจากศูนย์ดาวกลายเป็นสองสามร้อยดาวในหนึ่งวัน

โปรเจกต์ไซต์ยังคงเป็นที่ที่ไดอะแกรมสถาปัตยกรรมและการสร้างแบรนด์ร่วมทางวิชาการอยู่ และยังคงเป็นวิธีที่ถูกที่สุดในการมองเห็นรูปร่างของโมเดล: โมเดลภาษาแบบมัลติโมดัลสำหรับการปรับสภาพเชิงความหมาย, VAE 50 เฮิรตซ์สำหรับเสียง, และไฮบริดทรานส์ฟอร์เมอร์ภายใต้วัตถุประสงค์การจับคู่โฟลว์ ส่วนหมวดเบนช์มาร์ก ซึ่งตอนแรกเราดูมีเพียงชุดการประเมินที่ไม่มีคะแนน บัดนี้มีเอกสารวิชาการให้อ้างอิงแล้ว
รายงานทางเทคนิคเผยแพร่ออกมา และตัวเลขเป็นของเทนเซ็นต์เอง
นี่คือสาระสำคัญของการอัปเดต เอกสารรายงานผลลัพธ์จากชุดการประเมินเจ็ดชุด — รายการเดียวกับที่เว็บไซต์โครงการเคยโฆษณาไว้โดยไม่มีตัวเลข — และในมิติส่วนใหญ่ของการสร้างเนื้อหาและการแก้ไขเนื้อหา AuK เป็นผู้นำในกลุ่มโอเพน อ่านสิ่งเหล่านี้เป็นตารางเกณฑ์มาตรฐานจากผู้ขาย เพราะมันเป็นเช่นนั้นจริง: tencent เป็นผู้ดำเนินการเปรียบเทียบทั้งหมด เลือกเกณฑ์พื้นฐานทั้งหมด และยังไม่ได้เผยแพร่โค้ดสำหรับการทำซ้ำชุดการทดสอบ
• Zero-shot TTS บน Seed-TTS-Eval: AuK มีค่าเฉลี่ย WER 2.65 พร้อมความคล้ายคลึงของผู้พูด 0.795 เทียบกับ Qwen3-TTS ที่ 3.07 และ 0.745, Seed-TTS ที่ 3.65 และ 0.778, และ VoxCPM2 ที่ 3.65 และ 0.767. AuK-Flash อยู่ที่ 2.85 และ 0.790. ชุดย่อยที่ดีที่สุดคือ WER 1.02 ในชุดทดสอบภาษาอังกฤษ และ 5.91 ในชุดยากภาษาจีน
• TTS ที่ควบคุมด้วยคำสั่งบน InstructTTSEval: AuK ได้คะแนน 83.37 ในภาษาจีน และ 81.60 ในการทำตามคำอธิบายภาษาอังกฤษ เทียบกับ Qwen3-TTS-VD ที่ 81.10 และ 82.40 และ MOSS-VoiceGenerator ที่ 80.00 และ 82.00 AuK-Flash ได้ 78.80 ในภาษาจีน แต่เสมอคะแนนภาษาอังกฤษที่ดีที่สุดในกลุ่มที่ 82.40
• การแก้ไขเนื้อหาบน SpeechEditBench: ความแม่นยำ 91.83 เทียบกับ 76.46 ของ Ming-UniAudio และ 71.33 ในด้าน prosody เทียบกับ 26.50 — สองช่องว่างที่ใหญ่ที่สุดในรายงานทั้งหมด
• การแก้ไขแบบชี้นำด้วยคำสั่งบน Ming-Freeform-Audio-Edit ในโหมดเต็ม: อัตราความผิดพลาดของคำลดลงจาก 10.46 เป็น 3.09 สำหรับภาษาจีน และจาก 14.28 เป็น 3.96 สำหรับภาษาอังกฤษ เมื่อเทียบกับ Ming-UniAudio โดยความแม่นยำในการแก้ไขเพิ่มขึ้นจาก 79.62 เป็น 91.47 และจาก 70.98 เป็น 85.25 สำหรับการแก้ไขทางเสียง การเปรียบเทียบเดียวกันนี้ทำให้อัตราความผิดพลาดของคำเปลี่ยนจาก 5.01 เป็น 2.02 ในภาษาจีน และจาก 10.75 เป็น 3.48 ในภาษาอังกฤษ
• การแก้ไขแบบ Paralinguistic บน MMAE-Speech: อัตราการปฏิบัติตามคำสั่ง 48.23 และการเขียนเนื้อหาใหม่ 88.11 เทียบกับ Step-Audio-EditX ที่ 43.52 และ 77.27 และ Ming-UniAudio ที่ 34.13 และ 76.01 AuK-Flash ทำค่า recall ของโมเดลแก้ไขดีที่สุดในตารางที่ 13.85
การฟื้นฟู ซึ่งโมเดลมีการแข่งขันมากกว่าจะโดดเด่น: DNS Challenge มีค่าความคลาดเคลื่อนของคำแบบ desynchronised 2.66 โดยมีความคล้ายคลึงของผู้พูด 0.99 เทียบกับ RE-USE ที่ 3.31; CHiME-4 มีค่าความคลาดเคลื่อนของคำ 7.98 เทียบกับ RE-USE ที่ 10.71; Libri2Mix มีค่าความคลาดเคลื่อนของคำ 9.12 เทียบกับ MossFormer2-SS ที่ 9.34; และ VCTKSR มีค่าความคลาดเคลื่อนของคำ 3.06 โดยมีความคล้ายคลึง 0.97
ตัว VAE เอง เมื่อประเมินแยกต่างหาก: AuK-VAE ได้ 4.143 PESQ บนเสียงพูด, 3.833 บนเสียงทั่วไป และ 3.884 บนเพลง เทียบกับ MiniMax-H3-AudioVAE ที่ 3.633, 2.835 และ 2.801 — การชนะขาดทุกด้านซึ่งสำคัญมากกว่าที่เห็น เพราะ latent ทางเสียงแบบ lossy เป็นตัวจำกัดทุกงานที่สร้างต่อจากมัน
รูปแบบที่ปรากฏในหัวข้อย่อยเหล่านี้น่าสนใจมากกว่าชัยชนะในพาดหัวเสียอีก AuK นำหน้าอย่างเห็นได้ชัดในทุกสิ่งที่หมายถึง "เปลี่ยนสิ่งที่พูดหรือเปลี่ยนเสียงให้ต่างไป โดยคงสิ่งอื่นไว้ทั้งหมด" — ไม่ว่าจะเป็นการแก้ไขเนื้อหา การปรับจังหวะเสียง การแก้ไขเชิงเสียง หรือการบูรณะ แต่ในด้านการแก้ไขอารมณ์และอวัจนภาษา มันกลับใกล้เคียงกับระบบอื่น ๆ ในวงการมากกว่า โดยความแม่นยำด้านอารมณ์ของ SpeechEditBench ที่ 9.94 แทบไม่ต่างจากของ Ming-UniAudio ที่ 3.43 ในเกณฑ์วัดที่ทั้งคู่ทำได้อ่อน และคะแนนเสียงโดยรวมที่ 37.07 ก็อยู่ในช่วงเดียวกับค่าพื้นฐาน ดังนั้น "หนึ่งโมเดลสำหรับทุกงานด้านเสียงพูด" จึงเป็นเพียงกรอบการนำเสนอของ Tencent; สิ่งที่รายงานแสดงจริง ๆ คือโมเดลหนึ่งที่ยอดเยี่ยมในหลายงาน แต่เพียงแค่ปรากฏอยู่ในงานที่เหลือเท่านั้น
สองเช็คพอยต์: AuK และ AuK-Flash
Tencent เปิดตัวสองเวอร์ชันภายใต้สัญญาอนุญาต MIT เดียวกัน AuK คือโมเดลฐานคุณภาพเต็ม และรายงานระบุการตั้งค่าการสุ่มตัวอย่างที่ 32 ครั้งของการประเมินฟังก์ชัน โดยมีค่าการชี้นำแบบไร้ตัวจำแนก (classifier-free guidance) เท่ากับ 2.0 AuK-Flash คือเวอร์ชันกลั่นกรอง: การเริ่มต้นแบบคงเส้นคงวาและวัตถุประสงค์ Decoupled DMD ที่จัดเส้นทางตามงาน ซึ่งสร้างผลลัพธ์ในสี่ขั้นตอนคงที่โดยปิดการชี้นำทั้งหมด ทางเอกสารรายงานว่ามีความเร็วเพิ่มขึ้น 4.5 เท่าเมื่อวัดจากเวลาจริง เมื่อเทียบกับโมเดลเต็มภายใต้เงื่อนไขที่เท่ากัน ตัวเลขในเอกสารเองทำให้ Flash ใกล้เคียงกับโมเดลเต็มในงานสร้างเสียงส่วนใหญ่ — อัตราคำผิดเฉลี่ย 2.85 และความคล้ายคลึง 0.790 บน Seed-TTS-Eval — ซึ่งเป็นสิ่งที่ทำให้การอ้างความเร็วนี้ควรค่าแก่การทดสอบมากกว่าจะมองข้าม: การแพร่แบบสี่ขั้นตอนที่คุณภาพใกล้เคียงโมเดลครูคือสิ่งที่ทำให้โปรแกรมแก้ไขเสียงพูดขนาด 1.5B ให้ความรู้สึกโต้ตอบได้บน GPU ตัวเดียว อย่างไรก็ตาม "เงื่อนไขที่เท่ากัน" เป็นวลีของ Tencent ที่ใช้อธิบายเกณฑ์วัดของ Tencent เอง และตัวเลข 4.5 เท่าที่ผู้เขียนวัดได้ก็เป็นข้ออ้างแบบที่ต้องมีบุคคลที่สามมาพิสูจน์ก่อนที่จะเปลี่ยนการตัดสินใจจัดซื้อใดๆ
สิ่งที่คุณสามารถรันได้ในวันนี้
{{1}}ขอบเขตการใช้งานจริงกว้างกว่าการปล่อยน้ำหนักโมเดลแบบเงียบๆ ทั่วไป เนื่องจากโค้ดมาพร้อมกับมัน{{/1}} {{2}}การติดตั้งรองรับ Python 3.10 ผ่าน uv หรือ Conda และ README เสนอตัวเลือกการติดตั้งเพิ่มเติมที่รวม Gradio, โหนด ComfyUI หรือชุดเครื่องมือ fine-tuning{{/2}} {{3}}เครื่องมือบรรทัดคำสั่ง auk-infer ครอบคลุมทุกงานด้วยรูปแบบข้อความเดียวกัน: ต้องระบุ --instruction เสมอ และ --audio เป็นตัวเลือกขึ้นอยู่กับงาน{{/3}} {{4}}เซิร์ฟเวอร์ Gradio (auk-gradio) เผยแพร่โมเดลพร้อมตัวเลือก และมีโหนดกำหนดเองของ ComfyUI พร้อมเวิร์กโฟลว์ที่นำกลับมาใช้ใหม่ได้ แม้ว่าการผสานรวมจะระบุขีดจำกัดลำดับแหล่งบวกเป้าหมาย 30 วินาทีไว้ในเอกสาร{{/4}} {{5}}Python API สะท้อน CLI และไปป์ไลน์ fine-tuning น้ำหนักเบาฝึกบน JSONL ของคู่คำสั่งบวกเสียงโดยใช้รูปแบบข้อความเดียวกับการอนุมาน{{/5}} {{6}}README ยังอธิบาย Prompt Enhancer ที่แปลงคำขอรูปแบบอิสระเป็นคำสั่ง auk-infer ที่พร้อมรัน; โดยคาดหวังเอนด์พอยต์แชทที่เข้ากันได้กับ OpenAI และจะสำรองไปใช้โมเดล SenseVoiceSmall ในเครื่องสำหรับการรู้จำเสียงเมื่อไม่ได้ตั้งค่าข้อมูลประจำตัว ASR บนคลาวด์{{/6}} {{7}}ข้อจำกัดปัจจุบันข้อหนึ่งถูกบันทึกไว้อย่างตรงไปตรงมา: Qwen3-Omni ยังไม่รองรับเป็นเส้นทางตัวเข้ารหัส ดังนั้น checkpoint Qwen2.5-Omni-3B จึงยังคงเป็นตัวที่ต้องดาวน์โหลด{{/7}}
สิ่งที่เอกสารยังไม่ได้ให้คุณคือข้อกำหนดฮาร์ดแวร์ขั้นต่ำ ไม่มีการเผยแพร่ตัวเลข VRAM สำหรับการอนุมาน (inference) ไฟล์คอนฟิกมีหมายเหตุเกี่ยวกับ gradient-checkpointing ว่าจุดสูงสุดประมาณ 91 GB จะลดลงเหลือประมาณ 75 GB ซึ่งอธิบายขอบเขตหน่วยความจำในช่วงการเทรน (training-time) มากกว่าจะเป็นตัวเลขการอนุมานแบบครั้งเดียวที่สมจริง และคำสั่งอ้างอิงที่โหลด AuK และ AuK-Flash พร้อมกันจะกระจายทั้งคู่ไปยัง GPU สองตัว — แม้จะระบุไว้ว่าทั้งคู่สามารถใช้ GPU ร่วมกันได้เพียงตัวเดียวก็ตาม สำหรับการดาวน์โหลดเอง ให้เตรียมพื้นที่ไว้: ประมาณ 6.8 GB ต่อเวอร์ชัน รวมถึงตัวเข้ารหัส Qwen2.5-Omni-3B จากนั้นวัดหน่วยความจำบน GPU ของคุณเอง
สิ่งที่ไม่ได้รับการยืนยัน
การให้ความแม่นยำเกี่ยวกับสิ่งที่ไม่ทราบยังคงเป็นจุดประสงค์ของการรายงานโมเดลในช่วงต้นนี้ และรายงานได้นำรายการหนึ่งออกจากรายการนี้โดยปล่อยให้ส่วนที่เหลือคงเดิม:
• ไม่มีการรันอิสระใดที่เราสามารถหาได้ ไม่มีตัวอย่างเสียงจากบุคคลที่สาม ไม่มีการจำลองการวัดประสิทธิภาพ ไม่มีความคิดเห็นในกระทู้สนทนา ปัญหาแรกที่เปิดในคลังเก็บโค้ดถูกยื่นไว้และยังไม่มีคำตอบ และจำนวนดาวน์โหลดของโมเดลการ์ดยังคงเป็นสิบกว่า ดังนั้นช่องว่างระหว่างตารางที่ตีพิมพ์กับที่ทำซ้ำได้จึงเป็นเรื่องราวทั้งหมดในตอนนี้
• การประเมินนี้ดำเนินการขึ้นเองและมีขอบเขตแคบในแง่หนึ่งโดยเฉพาะ ทุกระบบเปรียบเทียบ (baseline) ในรายงานล้วนเป็นโมเดลโอเพ่นเวทอื่น ๆ — Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS ไม่มีแพลตฟอร์มบริการเสียงแบบปิดที่ผู้ซื้อจะนำมาเทียบกับ AuK จริง ๆ ปรากฏอยู่เลย ดังนั้นคำว่า "เป็นผู้นำวงการ" ในที่นี้จึงหมายถึง "เป็นผู้นำในกลุ่มโอเพ่นที่ Tencent คัดเลือกมา"
• ชื่อ "AuK" ยังไม่ถูกขยายความที่ใดเลยในเอกสาร การ์ด หรือโค้ด และชนกันอย่างรุนแรงในการค้นหากับนกทะเล American University of Kuwait และ repositories ที่ไม่เกี่ยวข้อง
อย่างน้อยตอนนี้ทีมก็ปรากฏให้เห็นแล้ว — บทความวิจัยฉบับนี้มีผู้เขียน 33 คน นำโดย Ziyang Ma (จื่อหยาง หม่า) โดยมีสังกัดครอบคลุมหน่วยงาน Tencent Hunyuan, มหาวิทยาลัยเซี่ยงไฮ้เจียวทง, สถาบันนวัตกรรมเซี่ยงไฮ้ และมหาวิทยาลัยเทคโนโลยีนานยาง — แต่ยังไม่มีการระบุชัดเจนว่าใครใน Tencent ดูแลโมเดลนี้ในแต่ละวัน และไม่มีการระบุว่าโมเดลนี้อยู่ในตระกูล Hunyuan หรือเป็นความร่วมมือทางวิชาการที่แยกต่างหาก
ความครอบคลุมด้านภาษายังคงมีการบันทึกไว้เพียงบางส่วนเท่านั้น: การ์ด AuK-Flash ระบุภาษาจีนและภาษาอังกฤษ และตัวอย่างโค้ดก็ผสมทั้งสองภาษา แต่โมเดลพื้นฐานไม่มีรายการภาษาที่เป็นทางการ การอนุญาตสิทธิ์ก็มีลักษณะเดียวกัน — ตัว AuK เองเป็น MIT ในขณะที่ตัวเข้ารหัส Qwen ที่ดาวน์โหลดแยกต่างหากมีข้อกำหนดของตัวเอง ดังนั้น "โมเดล MIT" และ "ทุกอย่างที่คุณต้องใช้ในการรันมันเป็น MIT" จึงไม่ใช่ข้อความเดียวกัน
เหตุใดโมเดลเสียงพูดแบบ open-weights ที่เป็นหนึ่งเดียวจึงมีความสำคัญ
อ่านรายการงานของ AuK เทียบกับสิ่งที่ผู้สร้างจริง ๆ ทำในวันนี้ การเดิมพันก็ชัดเจนขึ้นกว่าตอนที่ตัวเลขยังมาไม่ถึง การทำงานทั้งหมดนั้นด้วยเครื่องมือที่มีอยู่หมายถึงการต่อห่วงโซ่โมเดลเฉพาะทางหลายตัว — เช็คพอยต์โอเพนหนึ่งตัวสำหรับการโคลน อีกตัวหนึ่งสำหรับการเพิ่มคุณภาพ ตัวแยกสัญญาณอีกตัวหนึ่ง และการแก้ไขเนื้อหาด้วยมือหรือด้วยความช่วยเหลือของโมเดล — หรือเช่า API โฮสต์แบบปิดหลายตัว ซึ่งแต่ละตัวคิดราคาต่องานและต่อนาทีของเสียง และไม่มีตัวใดแก้ไขได้ในแบบที่ AuK อธิบายไว้ เช็คพอยต์โอเพนเวตเดียวที่ปฏิบัติต่อทั้งหมดนั้นเป็นปัญหาการสร้างแบบมีเงื่อนไขด้วยข้อความเพียงปัญหาเดียว ถือเป็นวัตถุที่แตกต่างออกไปจริง ๆ และรายงานฉบับนี้ก็สนับสนุนข้อกล่าวอ้างในเวอร์ชันที่คมชัดกว่าที่การตลาดเคยทำไว้: ครึ่งหนึ่งของการแก้ไขนั้นเป็นจริง ไม่ใช่แค่ความทะเยอทะยาน การโคลนเสียงถูกทำให้เป็นสินค้าทั่วไปในช่วงปีที่ผ่านมา แต่การแก้ไขเนื้อหาและจังหวะเสียงที่ขับเคลื่อนด้วยคำสั่งคือจุดที่แพลตฟอร์มโฮสต์แบบปิดยังคงทำกำไรได้ และคะแนน 91.83 เทียบกับ 76.46 ในการแก้ไขเนื้อหาคือหลักฐานชิ้นแรกที่แสดงว่าโมเดลโอเพนสามารถยึดพื้นที่นั้นได้
ข้อแม้ที่พูดกันตรง ๆ ก็คือ นี่คือโมเดลดิฟฟิวชันที่มีโมเดลภาษาขนาด 3B ต่อพ่วงไว้สำหรับคอนดิชัน และมันสืบทอดต้นทุนของโครงสร้างแบบนั้นมา คุณภาพในแต่ละงานไม่สม่ำเสมอ — ดีเยี่ยมเมื่องานคือ "คงทุกอย่างไว้ยกเว้นการแก้ไข" แต่เรื่องอารมณ์ทำได้บางกว่า — และไม่มี hosted endpoint ไม่มีแนวทางเรื่องแบตช์ และไม่มีการเปิดเผยค่าหน่วงสำหรับอะไรเลย นอกจากการเปรียบเทียบภายในของตัวแปร Flash สำหรับชิ้นส่วนของไปป์ไลน์เสียงที่อยู่รอบ ๆ มัน — LLM ที่ตัดสินใจว่าควรพูดอะไร และ endpoint แชตแบบเข้ากันได้กับ OpenAI ของ Prompt Enhancer — routing API คือสิ่งที่ลงตัวโดยธรรมชาติ และ OrcaRouter ให้บริการโมเดล 200+ ตัวในราคารายการของผู้ให้บริการโดยไม่บวกมาร์กอัป ฉะนั้นครึ่งหนึ่งของสแตกจึงใช้แค่คีย์เดียวและไม่ต้องมีสัญญาฉบับที่สอง ส่วนเสียงยังคงเป็น GPU ที่คุณควบคุมเองกับ checkpoint ที่ไม่มีใครนอก Tencent เคยตรวจสอบ
ใครควรลงมือตอนนี้ และใครควรรอ
สำหรับนักวิจัยด้านเสียงพูด ผู้สร้างเครื่องมือ และใครก็ตามที่หน้าที่คือการประเมินโมเดลเสียงรุ่นใหม่ เหตุผลที่จะดาวน์โหลด AuK ในสัปดาห์นี้แข็งแกร่งกว่าวันแรกที่เปิดตัว และยังมาพร้อมข้อแม้เดิมเหมือนเดิม ตอนนี้คุณจะได้สถาปัตยกรรมที่บันทึกไว้ สูตรการสร้างที่ดูเหมือนจะทำซ้ำได้ และตารางเป้าหมายเต็มรูปแบบที่ต้องเอาชนะ — ซึ่งนี่คือสิ่งที่ทำให้ข้อกล่าวอ้างที่ยังไม่มีใครพิสูจน์ซ้ำน่าจู่โจม ต้นทุนของการเป็นคนแรกยังคงเป็นการใช้เวลาช่วงสุดสัปดาห์ในการติดตั้งและ GPU หนึ่งตัว สำหรับใครก็ตามที่เลือกสแตกเสียงสำหรับการผลิตจริง รายงานนี้เปลี่ยนรูปร่างของการตัดสินใจโดยไม่ทำให้มันจบลง: ตอนนี้มีตัวเลขให้เถียงกัน แต่ตัวเลขเหล่านั้นเป็นของเวนเดอร์เอง ไม่รวมแพลตฟอร์มปิดที่คุณจะเอาไปเทียบจริง ๆ และยังไม่มี API ไม่มีเพดาน VRAM และไม่มีประวัติการใช้งาน ให้ดูตามลำดับนี้: การทำซ้ำอย่างอิสระของแถว Seed-TTS-Eval และ SpeechEditBench; ตัวอย่างเสียงที่เผยแพร่หรือเดโม่ Space ที่เข้าถึงได้; และผู้ให้บริการอินเฟอเรนซ์หรือ hosted API ที่รับ AuK ขึ้นมา ซึ่งตอนนั้นราคา pass-through ฝั่งเราคือราคารายการของผู้ให้บริการ ในวันเดียวกัน เพราะนั่นคือความหมายของมาร์กอัป 0% คำถามที่น่าสนใจไม่ใช่อีกต่อไปว่า Tencent ส่งโมเดล TTS อีกตัวออกมาหรือไม่ — แต่คือว่าโมเดลเปิดตัวเดียวจะยึดงานทั้งห้าตระกูลนั้นพร้อมกันได้จริงหรือไม่ และตอนนี้ Tencent ได้เผยแพร่คำตอบของตัวเองแล้ว สิ่งที่เหลืออยู่ก็คือให้คนอื่นไปตรวจสอบมัน
