
VoxCPM2: ยอดดาวน์โหลด 900,000 ครั้งต่อเดือน และ Transformers ยังโหลดมันไม่ได้
- metaใหม่Meta: Muse Spark 1.22026-08-05$1.25 / $4.25 ต่อ 1 ล้านโทเค็น · 705 tok/s
- qwenใหม่Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 ต่อ 1 ล้านโทเค็น · 57 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3150ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 201 tok/s
- orcaใหม่OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicใหม่Anthropic: Claude Opus 52026-07-2461ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2150ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1651ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1557ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0951ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0955ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0959ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0854ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0641ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3053ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1651ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
ข้อมูลเมตาของ Hugging Face สำหรับ VoxCPM2 ระบุไลบรารีของมันว่า voxcpm — ไม่ใช่ transformers. ฟิลด์เดียวนี้ชี้ให้เห็นช่องว่างอันแปลกประหลาดในวงการเสียงโอเพนซอร์สในขณะนี้: โมเดลข้อความเป็นเสียง (text-to-speech) ขนาด 2B พารามิเตอร์ของ OpenBMB มียอดดาวน์โหลด 900,282 ครั้งในช่วงสามสิบวันที่ผ่านมา ก่อให้เกิดฟินจูนสาธารณะ 25 ตัว, การควอนไทซ์ 10 รายการ, อะแดปเตอร์ 7 ตัว และ Spaces กว่า 100 รายการ แต่ยังคงไม่สามารถโหลดได้ด้วยไลบรารีที่โมเดลอื่นเกือบทั้งหมดบนเว็บไซต์นั้นใช้ พูลรีเควสเพื่อแก้ไขปัญหานี้ถูกเปิดเมื่อวันที่ 4 สิงหาคม 2026 และยังคงเปิดอยู่จนถึงทุกวันนี้
ช่องว่างนั้นเป็นสิ่งที่ควรทำความเข้าใจก่อนที่การแก้ไขจะมาถึง เพราะมันกำหนดว่าการผสานรวมโมเดลนี้จะทำให้คุณเสียต้นทุนเท่าใดในสัปดาห์นี้เทียบกับไตรมาสหน้า และยังตั้งอยู่บนคำถามที่น่าสนใจยิ่งกว่า นั่นคือ VoxCPM2 นั้นนำหน้าอย่างที่สื่อรายงานจริงหรือไม่ ทุกอย่างด้านล่างนี้อ่านจากแหล่งข้อมูลหลักสามแหล่ง ได้แก่ openbmb/VoxCPM2 ซึ่งเป็นโมเดลการ์ดและข้อมูลเมตาของที่เก็บ, README ของ GitHub สำหรับ OpenBMB/VoxCPM และรายงานทางเทคนิค VoxCPM2 (arXiv:2606.06928, ส่งเมื่อ 5 มิถุนายน 2026) ตัวเลขเกณฑ์มาตรฐานทุกตัวในบทความนี้เป็นของ OpenBMB เอง ซึ่งดำเนินการโดย OpenBMB และ—ตามที่รายงานระบุไว้ในตารางเปรียบเทียบหลัก—ตัวเลขของคู่แข่งในตารางนั้นคัดลอกมาจากเอกสารอื่น ๆ แทนที่จะทดสอบใหม่ในเงื่อนไขที่เทียบเคียงกัน เท่าที่เราค้นหา ยังไม่มีห้องปฏิบัติการอิสระใดเผยแพร่การทำซ้ำผลลัพธ์เหล่านี้เลย
เอกสารข้อมูลจำเพาะ ในหน้าจอเดียว
VoxCPM2 ถูกเผยแพร่ในเดือนเมษายน 2026 (ที่เก็บ Hugging Face ถูกสร้างเมื่อวันที่ 3 เมษายน และมีการแก้ไขล่าสุดเมื่อวันที่ 16 เมษายน) ซึ่งเป็นรุ่นที่สามของสายผลิตภัณฑ์ VoxCPM เมื่อเทียบกับรุ่นก่อนหน้าโดยตรง:
• ขนาด — พารามิเตอร์ 2B เทียบกับ backbone 0.8B ของ VoxCPM1.5 และ backbone 0.6B ของ VoxCPM-0.5B
• ภาษา — 30 ภาษาและอีก 9 สำเนียงจีน เทียบกับเวอร์ชันก่อนหน้าทั้งสองที่มีเฉพาะภาษาจีนและภาษาอังกฤษ
• เสียง — รองรับอินพุตอ้างอิง 16 kHz และส่งออก 48 kHz ขณะที่ VoxCPM1.5 ใช้ 44.1 kHz ทั้งอินพุตและเอาต์พุตแบบสมมาตร
• แกนหลัก — MiniCPM-4-1B (28 เลเยอร์ ความกว้าง 2048) ในฐานะโมเดลภาษาความหมายข้อความ ซึ่งพัฒนาจาก MiniCPM-4-0.5B (24 เลเยอร์ ความกว้าง 1024)
• งบประมาณลำดับ — 8192 โทเคนที่อัตราโทเคนฝั่งโมเดลภาษา 6.25 เฮิรตซ์ ซึ่งคิดเป็นเสียงประมาณ 20 นาทีในหนึ่งคอนเท็กซ์
• ต้นทุนของคำพูดหนึ่งวินาที — ปัจจัยเรียลไทม์ 0.30 ใน PyTorch ธรรมดา และ 0.13 ผ่าน Nano-vLLM บน RTX 4090 หนึ่งตัว ที่ VRAM ประมาณ 8 GB VoxCPM1.5 ทำได้ 0.15 ที่ 0.8B และ 6 GB.
• ใบอนุญาต — Apache-2.0 สำหรับน้ำหนักโมเดล โค้ดฟินจูน และเครื่องมืออินเฟอเรนซ์ ไม่มีการจำกัดการเข้าถึง ไม่มีเงื่อนไขการใช้งานเพิ่มเติม อนุญาตให้ใช้เชิงพาณิชย์
• ข้อมูลการฝึก — "มากกว่า 2 ล้านชั่วโมง" ของเสียงพูดหลายภาษา โดยไม่มีการระบุชื่อคลังข้อมูลและไม่มีคำชี้แจงแหล่งที่มา
อ่านบรรทัด RTF สองครั้ง เพราะมันวิ่งผิดทาง VoxCPM2 ช้ากว่าโมเดล 0.8B ที่มันแทนที่ประมาณสองเท่าต่อวินาทีของเสียงที่สร้าง และต้องการ VRAM เพิ่มขึ้นอีกหนึ่งในสาม โมเดล 2B ไม่ได้เพิ่ม throughput แต่เพิ่มภาษาและการควบคุม และแลกมาด้วยความหน่วง ถ้าคุณกำลังรันเอเจนต์แบบเรียลไทม์ ข้อแลกเปลี่ยนนั้นคือสิ่งแรกที่ต้องคิดราคา
สิ่งที่ PR #47756 เปลี่ยนแปลงจริงๆ
วันนี้ การรัน VoxCPM2 หมายถึงการติดตั้งแพ็กเกจของ OpenBMB เอง — pip install voxcpm, Python 3.10 ถึง 3.12, PyTorch 2.5 หรือใหม่กว่า, CUDA 12 หรือใหม่กว่า — และโหลดโมเดลผ่าน VoxCPM.from_pretrained ซึ่งไม่เกี่ยวข้องกับ Transformers API เลย ทุกอย่างที่ตามมาจากการตัดสินใจนั้นเป็นแบบเฉพาะ: การแบตช์ของคุณเอง, ตัวเชื่อมการ serve ของคุณเอง, การจัดการโหมดการสร้างทั้งห้าโหมดด้วยตัวคุณเอง
งานที่อยู่ระหว่างดำเนินการจะเปลี่ยนแปลงสิ่งนั้น Issue #47695 "เพิ่มการรองรับแบบเนทีฟสำหรับ OpenBMB VoxCPM2" ถูกเปิดขึ้นเมื่อวันที่ 31 กรกฎาคม PR #47756 "การสนับสนุนสำหรับ VoxCPM2" ตามมาเมื่อวันที่ 4 สิงหาคม และอัปเดตล่าสุดเมื่อวันที่ 5 สิงหาคม โดยติดป้าย "New model" และเพิ่มการกำหนดค่าแบบโมดูลาร์พร้อมการนำแบบจำลองไปใช้งาน, โทเคไนเซอร์และโปรเซสเซอร์แบบกำหนดเอง, การเข้ารหัสและถอดรหัส AudioVAE แบบสตรีมมิ่ง, การปรับสภาพด้วยเสียงอ้างอิง, การต่อเนื่องเสียงจากพรอมป์, การลงทะเบียนคลาสอัตโนมัติ และรายการไปป์ไลน์ข้อความเป็นคลื่นเสียง — โดยรายงานว่าการทดสอบแบบจำลอง 64 รายการผ่านทั้งหมด มันถูกวางซ้อนอยู่บน PR #47736 ซึ่งเพิ่ม MiniCPM4 เอง เพราะแกนหลักข้อความต้องถูกเพิ่มก่อนที่แบบจำลองเสียงพูดที่ครอบมันจะทำงานได้

รายละเอียดสองข้อควรค่าแก่การให้ความสำคัญ และทั้งสองข้อต่างบั่นทอนการมองในแง่ดี ประการแรก ทั้งสามรายการ — issue และพูลรีเควสต์ทั้งสอง — ถูกเปิดโดยคอนทริบิวเตอร์ในคอมมูนิตี้คนเดียวกัน ไม่ใช่โดย OpenBMB และไม่ใช่โดยเมนเทนเนอร์ของ Hugging Face ไม่มีความมุ่งมั่นจากผู้จำหน่ายอยู่เบื้องหลังเรื่องนี้ จึงไม่มีกรอบเวลาที่คุณจะใช้วางแผนได้ ประการที่สอง สแตกของพูลรีเควสต์สองรายการที่มี 203 คอมมิตซึ่งเกี่ยวข้องกับโมดาลิตี้ใหม่ไม่ใช่การรีวิวที่รวดเร็ว พูลรีเควสต์โมเดลใหม่ใน Transformers ตามปกติต้องใช้เวลาหลายสัปดาห์ในการโต้ตอบกับเมนเทนเนอร์หลายรอบ และรายการนี้มีคอมเมนต์เพียงสี่รายการเท่านั้นจนถึงตอนนี้
การอ่านเชิงปฏิบัติ: หากคลาส Transformers ดั้งเดิมเป็นเสาหลักของสถาปัตยกรรมคุณ — เพราะคุณวางมาตรฐานบน AutoModel หรือเพราะเลเยอร์การให้บริการของคุณรองรับเฉพาะ Transformers — VoxCPM2 ยังไม่พร้อมสำหรับคุณ และยังไม่มีกำหนดวันที่แน่นอน หากคุณสามารถอยู่ภายใน voxcpm แพ็กเกจ โมเดลนี้ใช้งานได้เต็มรูปแบบแล้วในตอนนี้ และระบบนิเวศได้แสดงให้เห็นชัดเจนว่าสิ่งนี้เป็นที่ยอมรับ: มีการดาวน์โหลด 900,282 ครั้งเกิดขึ้นโดยที่ไม่มีการรองรับดั้งเดิมเลยแม้แต่น้อย ยังมีอีกแนวทางสายกลางที่สื่อส่วนใหญ่มองข้าม OpenBMB มีอินทิเกรชัน vLLM-Omni ที่เปิด OpenAI-compatible /v1/audio/speech endpoint รวมถึงบิลด์ llama.cpp-omni ที่มีเวต GGUF ซึ่งทำงานบน CPU, Metal, CUDA หรือ Vulkan โดยไม่ต้องพึ่งพา Python เลย หากสิ่งที่คุณต้องการจาก Transformers จริงๆ คืออินเทอร์เฟซการให้บริการมาตรฐาน แทนที่จะเป็นตัวคลาสเอง สิ่งนั้นก็มีอยู่แล้ว
"Tokenizer-free" ไม่ได้หมายความว่าไม่ถูก quantize
วลีที่ปรากฏในพาดหัวทุกอันเกี่ยวกับรุ่นนี้คือวลีที่มักถูกอ่านผิดบ่อยที่สุด VoxCPM2 ไม่มีตัวแปลงสัญญาณเสียงแบบไม่ต่อเนื่องภายนอก — ไม่มีคลังคำศัพท์โทเค็นเสียงที่เรียนรู้ได้คั่นอยู่ระหว่างโมเดลภาษาและรูปคลื่นเสียง เหมือนกับที่มีในตระกูล CosyVoice หรือ Moshi นั่นคือข้อกล่าวอ้าง และมันเป็นความจริง
ยังมีการควอนไทซ์อยู่ภายในโมเดล โครงข่ายหลักใช้คอขวดกึ่งไม่ต่อเนื่องที่หาอนุพันธ์ได้ซึ่งอิงตาม Finite Scalar Quantization และบทความระบุบทบาทของมันไว้อย่างชัดเจน: โมเดลภาษาเชิงความหมายสำหรับข้อความสร้าง hidden states, FSQ ควอนไทซ์สเกลาร์ตามแต่ละมิติให้เป็น "โครงกระดูกเชิงความหมาย", โมเดลภาษาเสียงแบบ residual จะนำรายละเอียดปลีกย่อยที่ FSQ ทิ้งไปกลับคืนมา และ local diffusion transformer เปลี่ยนกระแสเงื่อนไขทั้งสองให้เป็น continuous latent patch ถัดไปด้วย flow matching สี่ขั้นตอนที่คุณเห็นตัวย่อว่า LocEnc, TSLM, RALM และ LocDiT คือสายโซ่ดังกล่าวนั้นพอดี
ความแตกต่างที่สำคัญในทางปฏิบัติไม่ใช่ "quantized กับไม่" แต่เป็นว่าคอขวดถูกฝึกแบบ end-to-end ร่วมกับทุกอย่างรอบข้าง แทนที่จะถูกตรึงไว้ล่วงหน้าเป็นโคเดกแยกต่างหากที่มี loss ของตัวเอง นี่คือสิ่งที่กำจัดโหมดความล้มเหลวปกติที่โมเดลภาษาเรียนรู้ที่จะทำนายโทเคนซึ่งโคเดกไม่สามารถถอดรหัสได้อย่างเที่ยงตรง VoxCPM2 ขยายคอขวด FSQ จาก 256 เป็น 512 มิติ และแทนที่การรวมแบบ element-wise เดิมที่ป้อนให้โมเดล residual ด้วยการต่อและการฉายภาพที่เรียนรู้ได้ (learnable concatenation-projection) — ซึ่งเป็นการเปลี่ยนแปลงเล็กน้อย และเป็นหนึ่งในไม่กี่จุดในรายงานที่ได้รับการสนับสนุนด้วยกลไกที่ระบุไว้ มากกว่าผลต่างจาก benchmark
เอาต์พุต 48 kHz ถูกสร้างขึ้นมาเพียงบางส่วน และนั่นคือการออกแบบ
"48 kHz studio-quality output" เป็นสเปกที่ถูกกล่าวถึงมากที่สุดของโมเดล และเป็นสเปกที่ถูกเข้าใจผิดอย่างกว้างขวางที่สุดด้วย AudioVAE V2 เป็นแบบไม่สมมาตร: ตัวเข้ารหัสทำงานที่ 16 kHz ส่วนตัวถอดรหัสสร้างใหม่ที่ 48 kHz บทความเรียกสิ่งนี้ว่า "implicit super-resolution" ซึ่งเป็นชื่อที่ตรงไปตรงมาสำหรับสิ่งที่มันเป็น
{{1}}จงทำตามผลที่ตามมา{{/1}} ตัวเข้ารหัส 16 kHz มีเพดาน Nyquist ที่ 8 kHz ดังนั้นไม่มีสิ่งใดที่สูงกว่า 8 kHz ในเสียงอ้างอิงของคุณไปถึงโมเดลได้ ทุกบิตของพลังงานในสองอ็อกเทฟบนสุดของเอาต์พุต — {{2}}อากาศในเสียงพูด เสียงเสียดแทรก ความสว่างของขอบฉาบ{{/2}} — ถูกสร้างขึ้นโดยตัวถอดรหัสจากความน่าจะเป็นก่อนหน้าที่สมเหตุสมผล ไม่ได้ถูกส่งต่อมาจากเสียงของคนที่คุณโคลน สำหรับงานบรรยายและงานเอเจนต์ส่วนใหญ่ สิ่งนี้มองไม่เห็นหรือถือเป็นการปรับปรุง เพราะความน่าจะเป็นก่อนหน้าที่เรียนรู้มาอย่างดีนั้นดีกว่าชั้นวาง 8 kHz แบบตายตัว สำหรับใครก็ตามที่หน้าที่คือความเที่ยงตรงต่อเสียงที่บันทึกไว้เฉพาะบุคคล {{3}}มันคือข้อเท็จจริงที่ต้องออกแบบให้สอดรับ และไม่ใช่สิ่งที่การทดสอบการฟังบนลำโพงแล็ปท็อปของคุณจะเผยให้เห็น{{/3}}
เหตุผลของบทความนี้เป็นข้อโต้แย้งทางวิศวกรรมที่น่าเชื่อถือที่สุดในรายงาน และควรกล่าวซ้ำเพราะไม่ใช่การตลาด: การคงเอาencoderไว้ที่ 16 kHz ทำให้ OpenBMB นำคลังข้อมูลการฝึก VoxCPM 16 kHz ดั้งเดิมมาใช้ทั้งหมดได้ โดยไม่เกิดความไม่สอดคล้องของ latent ระหว่างแหล่งข้อมูลที่บันทึกที่อัตราตัวอย่างต่างกัน และหลีกเลี่ยงการระเบิดของความยาวลำดับที่อัตราการป้อนข้อมูลที่สูงกว่าจะบังคับให้เกิดในลูป autoregressive การยกเฉพาะตัวถอดรหัส (decoder) ช่วยให้ได้ความเที่ยงตรงของเอาต์พุตโดยไม่ต้องจ่ายในส่วนที่แพงที่สุดของโมเดล นั่นคือการแลกเปลี่ยนที่ดี ซึ่งทำขึ้นอย่างจงใจ และยังหมายความว่าผู้ใช้ VoxCPM1.5 กำลังย้ายจาก encoder ที่ 44.1 kHz ไปเป็น 16 kHz — การลดระดับฝั่งอินพุตที่ขายแฝงอยู่ในการอัปเกรดฝั่งเอาต์พุต ตารางการสร้างใหม่ของ OpenBMB เองแสดงให้เห็นรูปร่างของสิ่งนั้น: codec ของ VoxCPM1.5 ยังคงให้ค่า full-band mel-distance ที่ดีที่สุดจากสามรุ่น โดยได้ 1.139 เทียบกับ 1.335 ของ AudioVAE V2 เนื่องจากทำงานที่อัตราตัวอย่างสูงโดยกำเนิด แทนที่จะต้องสร้างใหม่จากอัตราที่ต่ำขึ้นไป
การอ่านสกอร์บอร์ดของ OpenBMB ในแบบที่ OpenBMB เขียนไว้
แข่งขันได้ ไม่ใช่ที่หนึ่ง
บน Seed-TTS-Eval ซึ่งเป็นเกณฑ์มาตรฐานการโคลนเสียงแบบ zero-shot มาตรฐาน VoxCPM2 รายงานอัตราคำผิด 1.84% ด้วยความคล้ายคลึงของผู้พูด 75.3% ในชุดภาษาอังกฤษ อัตราตัวอักษรผิด 0.97% ด้วยความคล้ายคลึง 79.5% ในภาษาจีน และ CER 8.13% ด้วยความคล้ายคลึง 75.3% ในชุดย่อยภาษาจีนที่ยาก คำที่บทความใช้เองคือ "competitive" และตารางสนับสนุนคำนั้นมากกว่าคำที่แรงกว่าที่กล่าวถึงกัน

ในบรรดาระบบโอเพนซอร์สในตารางเดียวกันนั้น Fish Audio S2 มีอัตราความผิดพลาดที่ดีกว่าในทั้งสามชุดย่อย (0.99 / 0.54 / 5.99) Qwen3-TTS เอาชนะมันในค่า WER ภาษาอังกฤษที่ 1.23 และ LongCat-Audio-DiT กวาดชัยชนะในห้าจากหกช่อง — ค่า WER 1.50 และความคล้ายคลึง 78.6 ในภาษาอังกฤษ ความคล้ายคลึง 81.8 ในภาษาจีน ค่า CER 6.04 และความคล้ายคลึง 79.7 ในภาษาจีนที่ยาก จุดที่ VoxCPM2 โดดเด่นจริงๆ คือความสมดุล: มันเป็นหนึ่งในไม่กี่ระบบที่อยู่ใกล้จุดสูงสุดในด้านความคล้ายคลึงและมีความน่าเชื่อถือในด้านความชัดเจนพร้อมกัน และเป็นระบบเดียวในรายการนั้นที่รองรับการออกแบบเสียงด้วยภาษาธรรมชาติด้วย แต่ "state-of-the-art" ไม่ใช่สิ่งที่ตารางหลักของมันแสดงให้เห็น และกรอบที่ซื่อสัตย์ก็คือ นี่คือระบบทั่วไปที่แข็งแกร่ง ไม่ใช่ผู้นำด้านเบนช์มาร์ก
การเพิ่มพารามิเตอร์เป็น 3.3 เท่า แทบไม่ได้ช่วยให้ความชัดเจนดีขึ้นเลย
แถวที่มีประโยชน์ที่สุดในตารางนั้นคือแถวที่ไม่มีใครอ้างถึง VoxCPM-0.5B รุ่นแรกขนาด 0.6B จากเดือนกันยายน 2025 ได้คะแนน WER ภาษาอังกฤษ 1.85% และ CER ภาษาจีน 0.93% ส่วน VoxCPM2 ขนาด 2B ได้ 1.84% และ 0.97% ซึ่งถือว่าอยู่ในระดับความคลาดเคลื่อนทางสถิติสำหรับภาษาอังกฤษ และแย่กว่าเล็กน้อยสำหรับภาษาจีน
สิ่งที่พารามิเตอร์เพิ่มเติมส่งมอบจริง ๆ นั้นเห็นได้ในคอลัมน์ความคล้ายคลึงเท่านั้น ไม่มีที่อื่น: ค่า SIM ภาษาอังกฤษเพิ่มขึ้นจาก 72.9 เป็น 75.3 ส่วนภาษาจีนจาก 77.2 เป็น 79.5 อย่างอื่นทั้งหมดที่รุ่น 2B นำมานั้นอยู่นอกเกณฑ์มาตรฐานนี้โดยสิ้นเชิง — ภาษาที่เพิ่มขึ้นอีก 28 ภาษา การออกแบบเสียงจากคำอธิบายที่เป็นข้อความ การโคลนเสียงที่ควบคุมสไตล์ได้ เอาต์พุต 48 kHz นั่นเป็นจำนวนมาก และเป็นเหตุผลที่ตรงไปตรงมาสำหรับการอัปเกรด แต่หากภาระงานของคุณคือการโคลนเสียงภาษาอังกฤษหรือภาษาจีน และคุณตัดสินใจจากอัตราความผิดพลาด VoxCPM2 ก็ไม่ได้ให้อะไรที่โมเดล 0.6B ไม่ได้ให้อยู่แล้ว โดยมีน้ำหนักมากกว่าสามเท่าและความหน่วงเป็นสองเท่า ที่น่าสนใจคือ VoxCPM1.5 แย่ที่สุดในสามรุ่นบนเกณฑ์มาตรฐานนี้ (2.12 / 1.18) ซึ่งทำให้พัฒนาการของตระกูลนี้ดูเหมือนบันไดน้อยลง และดูเหมือนผลิตภัณฑ์สามชนิดที่แตกต่างกันมากขึ้น
โมเดลเดียว สองการประเมิน ห่างกันเป็นสิบเท่า
นี่คือจุดที่ต้องใช้ความระมัดระวัง เนื่องจากผลลัพธ์หลายภาษาทั้งสองรายการในรายงานนี้ขัดแย้งกันอย่างรุนแรง และทั้งคู่ถูกอ้างถึงราวกับว่าสามารถชี้ขาดเรื่องนี้ได้
หัวข้อข่าวคืออัตราความผิดพลาดเฉลี่ย 1.68% ใน 30 ภาษา ซึ่งมาจากชุดทดสอบที่ OpenBMB สร้างขึ้นเอง — 500 ประโยคต่อภาษา — และประเมินผลโดยใช้ Gemini 3.1 Flash Lite เป็นตัวจดจำ ในชุดทดสอบนี้ VoxCPM2 ทำผลงานได้ ภาษาอังกฤษ 0.42, จีน 0.92, ฮินดี 0.79, อาหรับ 1.23
รายงานนี้ยังรัน MiniMax-MLS-Test ซึ่งเป็นชุดทดสอบ 24 ภาษาของบุคคลที่สาม ให้คะแนนด้วย Whisper-large-v3 เช่นกัน กับโมเดลเดียวกัน ในนั้น VoxCPM2 ได้คะแนนฮินดี 19.70 และอาหรับ 13.05 — แย่กว่าเกณฑ์มาตรฐานของตัวเองถึง 25 เท่าและ 10 เท่าตามลำดับ สำหรับภาษาที่รองรับอย่างเป็นทางการ และในคอลัมน์เดียวกัน: กวางตุ้ง 38.58, เช็ก 24.13, โรมาเนีย 21.58, ยูเครน 6.32
สามสิ่งนี้ช่วยอธิบายเรื่องส่วนใหญ่ให้สอดคล้องกันได้ และควรแยกแยะให้ชัดเจน เพราะเรื่องเล่าที่แพร่หลายกันทั่วไปนั้นเข้าใจผิดเกี่ยวกับประเด็นเหล่านี้:
• ไม่รองรับภาษาเช็ก โรมาเนีย และยูเครน ตรวจสอบแท็กภาษาของคลังเก็บโค้ดเอง: มี 30 รหัส และไม่มีรหัสใดเป็น cs, ro หรือ uk การวิจารณ์ VoxCPM2 เรื่อง WER ภาษาเช็กที่ 24% คือการวิจารณ์มันในภาษาที่มันไม่เคยอ้างสิทธิ์ ภาษากวางตุ้งน่าจะจัดอยู่ใน "9 ภาษาถิ่นจีน" ได้ แต่ทุกระบบในคอลัมน์นั้นมีอัตราสูงกว่า 30% สำหรับภาษานี้ ซึ่งชี้ไปที่ตัวรู้จำเสียงมากกว่าตัวโมเดลใด ๆ
• อาหรับและฮินดีได้รับการรองรับ และนี่คือสิ่งที่ค้นพบที่แท้จริง ภาษาเหล่านี้เป็นสองภาษาที่ OpenBMB อ้างว่าครอบคลุม และการประเมินทั้งสองครั้งของพวกเขาแตกต่างกันถึงหนึ่งลำดับความสำคัญ (order of magnitude) คำอธิบายในบทความเองระบุว่าภาษาเหล่านี้มี"ปริมาณข้อมูลค่อนข้างจำกัด"ในคลังข้อมูลฝึก และ"ส่วนหนึ่งของ WER ที่สูงกว่าอาจมาจากความแม่นยำที่จำกัดของตัวรู้จำ" นั่นเป็นสมมติฐานที่สมเหตุสมผลและยังไม่ผ่านการทดสอบ หากคุณกำลังส่งมอบระบบเสียงพูดภาษาอาหรับหรือฮินดี ช่วงค่าที่เผยแพร่ของโมเดลนี้คือ 0.79% ถึง 19.70% และไม่มีปลายด้านใดที่ได้รับการยืนยันอย่างอิสระ จัดสรรเวลาหนึ่งวันเพื่อวัดผลด้วยตัวเอง และอย่าใช้ตัวเลขใดตัวเลขหนึ่งเป็นฐานในการวางแผนงบประมาณ
• เมตริกไม่ได้เป็นหน่วยเดียวกันด้วยซ้ำภาษาฮินดีถูกให้คะแนนเป็นอัตราความผิดพลาดระดับตัวอักษรในชุดข้อมูลภายใน และเป็นอัตราความผิดพลาดระดับคำบน MiniMax-MLS สิ่งเหล่านี้เป็นปริมาณที่เทียบเคียงไม่ได้ ซึ่งเป็นอีกเหตุผลหนึ่งที่ทำให้ช่องว่าง 25 เท่าไม่ใช่ข้อกล่าวหาที่ชัดเจน และอีกเหตุผลหนึ่งที่ค่าเฉลี่ย 1.68% ไม่ควรถูกตีความว่าเป็นคะแนนที่เทียบเคียงกันโดยตรง
ข้อควรระวังเดียวกันนี้ใช้กับข้อกล่าวอ้างที่ใช้ตัวเลขมากที่สุดในการรายงานเกี่ยวกับโมเดลนี้ นั่นคือ VoxCPM2 เอาชนะ ElevenLabs ในด้านความคล้ายคลึงของเสียงพูด (speaker similarity) ด้วยคะแนน 85.4% เทียบกับ 61.3% ในภาษาอังกฤษ และชนะใน 22 จาก 24 ภาษา นั่นคือสิ่งที่ตารางระบุจริง ๆ แต่มันก็เป็นตารางที่บทความประกอบขึ้นจากผลลัพธ์ที่เคยรายงานไว้ก่อนหน้าบางส่วน และเป็นตารางที่คอลัมน์ความชัดเจน (intelligibility) ของ ElevenLabs มีค่า WER 73.94% สำหรับภาษาไทย 73.42% สำหรับภาษาเวียดนาม และ 16.03% สำหรับภาษาจีน ตัวเลขเหล่านั้นไม่ใช่ตัวเลขของผลิตภัณฑ์เชิงพาณิชย์ที่ทำงานได้ตามปกติ แต่เป็นสัญญาณของความไม่ตรงกันในการให้คะแนนหรือการตั้งค่าคอนฟิก ตารางที่บกพร่องในคอลัมน์หนึ่งจะไม่น่าเชื่อถือในอีกคอลัมน์หนึ่งเพียงเพราะผลลัพธ์นั้นเชิดชูโมเดลที่คุณกำลังอ่านเกี่ยวกับอยู่
ห้าโหมดจากแกนหลักเดียว — และสูตรที่ขับเคลื่อนตัวเลขของคุณ
แนวคิดที่สะอาดที่สุดในสถาปัตยกรรมคือ VoxCPM2 ไม่มีโมเดลหรือเฮดแยกสำหรับความสามารถแต่ละอย่าง ทั้งห้าโหมดใช้พารามิเตอร์ชุดเดียวกัน เพียงแต่จัดเรียงลำดับอินพุตต่างกัน ซึ่งเป็นเหตุผลว่าเช็คพอยต์ขนาด 2B ตัวเดียวครอบคลุมสิ่งที่ปกติต้องใช้กองเรือเล็ก ๆ:
• TTS พื้นฐาน — ข้อความเข้า เสียงออกมา
• การออกแบบเสียง — คำอธิบายในวงเล็บเพียงแค่ถูกเติมไว้หน้าข้อความ ดังนั้น "(ชายวัยกลางคนที่เหนื่อยล้า เสียงแหบ พูดช้าๆ)" และบรรทัดข้อความนั้นจะผ่านโมเดลภาษาตัวเดียวกันโดยไม่มีโมดูลเพิ่มเติม ไม่มีเสียงอ้างอิงใดๆ เลย
• การโคลนเสียงอ้างอิง — คือคลิปอ้างอิงแบบแยกเดี่ยวที่กำหนดเอกลักษณ์ของผู้พูด โดยไม่จำเป็นต้องมีบทถอดเสียง
• การโคลนเสียงที่ควบคุมได้ — คลิปอ้างอิงพร้อมคำอธิบายสไตล์เสียง เพื่อให้คุณสามารถโคลนเสียงแล้วกำหนดให้เสียงนั้นฟังดูเร่งรีบหรือขบขันได้
• การโคลนนิ่งแบบต่อเนื่อง — คลิปอ้างอิงที่จับคู่กับบทถอดเสียง ใช้เป็นเสียงนำที่โมเดลจะสานต่อ ซึ่งเป็นโหมดที่มีความเที่ยงตรงสูงสุด
ในรายงานมีตัวตั้งค่าหนึ่งที่ซ่อนอยู่ ซึ่งบทความส่วนใหญ่มักมองข้าม และมันคือตัวที่อาจเปลี่ยนผลลัพธ์ของคุณได้มากที่สุด เส้นทางการคอนดิชันสองแบบ — isolated reference และ continuation prefix — ใช้แยกกันหรือรวมกันก็ได้ และมีการแลกเปลี่ยนข้อดีข้อเสียระหว่างกัน ในการทดลอง ablation ของ OpenBMB เอง การใช้ทั้งสองแบบร่วมกันให้ความคล้ายคลึงของผู้พูดดีที่สุดในทุกชุดย่อย การละเว้น continuation prefix และส่งเพียง isolated reference ให้ความชัดเจนของเสียงดีที่สุดสำหรับข้อความจีนที่ยาก โดยได้ CER 6.85% เทียบกับ 7.44% ขณะที่ยอมแลกคะแนนความคล้ายคลึงที่ลดลงประมาณห้าจุด คำอธิบายในงานวิจัยฟังดูสมเหตุสมผล: หากไม่มีคำนำหน้าเสียงชั่วคราวที่กำหนดทำนองเสียง ตัวแบบจะมีอิสระมากขึ้นในการเลือกรูปแบบการพูดที่รับมือกับข้อความยาก ๆ ได้
{{1}}ดังนั้น ค่าเริ่มต้นคือทางเลือก ไม่ใช่เพดาน งานจับคู่เสียงต้องการทั้งสองเส้นทาง ข้อความที่ยากหรือผิดปกติต้องการให้อ้างอิงเท่านั้น ข้อพับที่ตรงไปตรงมาประการหนึ่ง: ตัวเลขสัมบูรณ์ในตาราง ablation ไม่สอดคล้องกับตารางหลักสำหรับสูตรที่บทความระบุว่าใช้ตลอดทั้งฉบับ ซึ่งใน preprint มีแนวโน้มที่จะเป็นความผิดพลาดในการลงบัญชีมากกว่าสิ่งที่น่ากลัว — แต่นั่นเป็นเหตุผลที่สามที่จะถือว่าตัวเลขทุกตัวในที่นี้เป็นแนวทางที่ต้องทดสอบ มากกว่าค่าที่จะอ้างอิง{{/1}}
การออกแบบเสียง: เชื่อฟังมากกว่าที่จะเป็นธรรมชาติ
การออกแบบเสียงเป็นฟีเจอร์ที่ทำให้รีลีสนี้ดูน่าสนใจมากกว่าเป็นเพียงการอัปเกรดเล็กน้อย และเป็นจุดที่ตัวเลขของเวนเดอร์เองเผยให้เห็นถึงการแลกเปลี่ยนที่แท้จริงได้ชัดเจนที่สุด
บน InstructTTSEval VoxCPM2 ได้คะแนน 84.2 ในการระบุพารามิเตอร์ทางเสียง 83.2 ในคำสั่งแบบเชิงบรรยาย และ 71.4 ในการสวมบทบาทสำหรับภาษาอังกฤษ — ซึ่งตัวเลขสุดท้ายนี้ดีที่สุดในตาราง นำหน้า Qwen3-TTS-1.7B-VD ที่ 68.4 และ Gemini-TTS-Pro ที่ 67.2 สำหรับภาษาจีนนั้นอ่อนกว่าและลำดับกลับกัน: 85.2 / 71.5 / 60.8 เทียบกับของ Gemini-TTS-Pro ที่ 89.0 / 90.1 / 75.5 ดังนั้นข้อกล่าวอ้างที่แข็งแกร่งที่สุดที่มีคือ VoxCPM2 เป็นผู้นำด้านการสวมบทบาทภาษาอังกฤษ และตามหลังระบบปิดระดับแนวหน้าในเกือบทุกด้านอื่น ๆ ในการทำตามคำสั่ง
แผงผู้ฟังที่เป็นมนุษย์ — ผู้ฟัง 50 คน แบบสุ่มและปกปิดสองทาง ตามที่ระบุในรายงาน — ทำให้ผลการเปรียบเทียบคมชัดยิ่งขึ้น ในการสร้างเสียงแบบควบคุมได้ VoxCPM2 ชนะด้านการทำตามคำสั่งที่ 4.50 เทียบกับ Qwen3-TTS-VD ที่ 4.41 แต่แพ้ด้านความเป็นธรรมชาติที่ 4.48 เทียบกับ 4.61 ในการโคลนเสียงแบบ zero-shot ทั่วไป VoxCPM2 ชนะด้านความคล้ายคลึงของเสียงผู้พูด (4.74 เทียบกับ 4.69) และเสมอหรือตามหลังด้านความเป็นธรรมชาติ (4.78 เทียบกับ Qwen3-TTS ที่ 4.80 โดยช่วงความเชื่อมั่นทับซ้อนกัน)
รูปแบบนี้สอดคล้องกันพอที่จะใช้วางแผนได้: VoxCPM2 ทำตามที่คุณสั่งและเสียงฟังดูเป็นมนุษย์น้อยลงเล็กน้อย ส่วน Qwen3-TTS ฟังดูดีขึ้นเล็กน้อยแต่ทำตามคำสั่งได้แม่นยำน้อยลงเล็กน้อย ว่าตัวไหนเหมาะสมนั้นขึ้นอยู่กับว่าคุณค่าของผลิตภัณฑ์ของคุณคือการควบคุมที่แม่นยำหรือการส่งมอบที่ราบรื่น OpenBMB ระบุผลที่ตามมานี้ไว้ในส่วนข้อจำกัดของตัวเอง และเป็นสิ่งที่ผู้จำหน่ายมักจะละเว้น: การออกแบบเสียงและการโคลนที่ควบคุมได้ "อาจให้ผลลัพธ์ที่แปรผันในแต่ละรอบการทำงาน" และการจะได้เสียงที่ต้องการอาจต้องลองหลายครั้ง สร้างกลไกการลองซ้ำในไปป์ไลน์ของคุณ และถ้าเสียงมีความสำคัญ ก็ควรมีด่านตรวจฟังโดยมนุษย์
ค่าใช้จ่ายในการใช้งาน และเมื่อใดที่การเช่าเป็นทางเลือกที่เหมาะสม
ไม่มี VoxCPM2 ที่โฮสต์ไว้ที่ใดเลย แถบด้านข้างของ Hugging Face เองก็ระบุไว้ชัดเจน — "โมเดลนี้ไม่ได้ให้บริการโดย Inference Provider ใด ๆ" — และนั่นรวมถึงเราด้วย: OrcaRouter ไม่ได้ให้บริการ VoxCPM2 และต่อให้อยากให้เป็นอย่างอื่นมากแค่ไหนก็ไม่เปลี่ยนความจริงที่ว่าโมเดล TTS ขนาด 2B ที่ไม่มีพาร์ทเนอร์ด้าน inference คือน้ำหนักที่คุณโฮสต์เองหรือไม่มีเลย
ซึ่งทำให้คำถามเรื่องต้นทุนกลายเป็น{{1}}คำถามเรื่อง GPU{{/1}} และตัวเลขก็ชัดเจน ด้วยค่า real-time factor ของ Nano-vLLM ที่ 0.13 บนการ์ด RTX 4090 หนึ่งใบ หนึ่งชั่วโมงการใช้ GPU จะผลิตเสียงได้ประมาณ 7.7 ชั่วโมง ดังนั้น {{2}}ต้นทุนต่อชั่วโมงเสียง{{/2}} ของคุณคืออัตรารายชั่วโมงของการ์ด 24 GB หนึ่งใบหารด้วยประมาณ 7.7 ใน PyTorch ธรรมดาที่ RTF 0.30 ตัวเลขจะลดลงเหลือเสียงประมาณ 3.3 ชั่วโมงต่อชั่วโมงการใช้ GPU {{3}}ตัวเลขทั้งสองเป็นของ OpenBMB ซึ่งวัดบนฮาร์ดแวร์ของพวกเขาด้วยข้อความของพวกเขา และทั้งคู่จะเปลี่ยนไปเมื่อใช้กับของคุณ{{/3}} — ขนาด batch ความยากของข้อความ และจำนวนครั้งที่ต้องลองใหม่ที่ quality gate บังคับ ล้วนเป็นตัวคูณที่เลข RTF ไม่ได้รวมไว้ {{4}}อัตราการลองใหม่{{/4}} คือสิ่งที่ผู้คนมักลืม: โมเดลที่ผู้ขายบอกว่า {{5}}อาจต้องลองหลายครั้งเพื่อให้ได้เสียงตามเป้าหมาย{{/5}} ไม่ได้มีต้นทุนตามที่ RTF บ่งบอก

การเปรียบเทียบที่ผู้คนต้องการ ณ จุดนี้คือการเทียบกับ API ที่เช่าใช้ และคำตอบตามตรงก็คือทั้งสองสิ่งไม่สามารถแปลงหากันได้อย่างราบรื่น openai/tts-1-hdคิดค่าบริการที่ $30.00 ต่อล้านโทเค็นทั้งขาเข้าและขาออก — ซึ่งเป็นราคารายการของผู้ให้บริการที่ส่งผ่านตรงมาบน OrcaRouter เนื่องจากเราไม่บวกกำไร 0% ดังนั้นตัวเลขบนหน้าโมเดลของเราคือตัวเลขที่ OpenAI เรียกเก็บจริง แต่โทเค็นไม่ใช่วินาที และไม่มีอัตราที่เผยแพร่ใดที่จะแปลงระหว่างสองสิ่งนี้ได้อย่างน่าเชื่อถือพอจะนำมาสร้างสเปรดชีตได้ ใครก็ตามที่แสดงการเปรียบเทียบต่อชั่วโมงที่ดูเรียบร้อยระหว่างโมเดล TTS แบบโอเพนเวตที่โฮสต์เองกับ API ที่คิดค่าใช้จ่ายตามโทเค็น ได้ตั้งสมมติฐานบางอย่างที่พวกเขาไม่ได้แสดงให้คุณเห็น
สิ่งที่น่าสนใจคือเส้นแบ่งในเชิงสถาปัตยกรรมอยู่ตรงไหน การโฮสต์ VoxCPM2 ด้วยตัวเองสมเหตุสมผลเมื่อคุณต้องการเสียงโคลนเฉพาะบุคคล เมื่อมีปริมาณเสียงสม่ำเสมอมากพอที่จะทำให้ GPU มีงานทำตลอดเวลา เมื่อข้อมูลไม่สามารถออกนอกโครงสร้างพื้นฐานของคุณ หรือเมื่อคุณตั้งใจจะปรับจูนมันด้วย LoRA — และมันรองรับการทำเช่นนั้นด้วยเสียงเป้าหมายเพียง 5 ถึง 10 นาที ซึ่งถือว่าประหยัดอย่างแท้จริง การเช่าใช้สมเหตุสมผลเมื่อปริมาณงานพุ่งสูงเป็นช่วงๆ เมื่อคุณไม่มีบุคลากรดูแล GPU หรือเมื่อเสียงนั้นใช้แทนกันได้ ผลิตภัณฑ์เสียงจริงส่วนใหญ่ประกอบด้วยสองระบบ ไม่ใช่ระบบเดียว: ชั้นการสังเคราะห์เสียง กับโมเดลภาษาที่ทำหน้าที่คิดประมวลผลอยู่เบื้องหลัง ครึ่งที่เป็นการคิดประมวลผลคือส่วนที่คุ้มค่าจะวางไว้เบื้องหลังคีย์เดียวที่มีการสลับผู้ให้บริการอัตโนมัติ เพื่อให้การเปลี่ยนโมเดลเป็นเพียงการแก้สตริง ไม่ใช่วงจรการจัดซื้อจัดจ้าง นั่นคือรูปแบบที่ OrcaRouter ถูกสร้างขึ้นมา เพื่อรองรับโมเดลกว่า 200+ รุ่น ส่วนครึ่งที่เป็นการสังเคราะห์เสียง เมื่อเป็นเสียงเฉพาะที่คุณเป็นเจ้าของและปรับแต่งเอง ควรอยู่บนฮาร์ดแวร์ของคุณเอง VoxCPM2 อยู่ในหมวดหมู่ที่สองนั้นอย่างชัดเจน และความจริงที่ว่าไม่มีใครให้บริการมันเป็นผลสืบเนื่องมาจากธรรมชาติของมัน ไม่ใช่ความบกพร่อง
สิ่งที่ OpenBMB บอกให้คุณไม่ควรคาดหวัง
ส่วนข้อจำกัดมีความตรงไปตรงมาอย่างผิดปกติสำหรับการเปิดตัวที่มีแรงผลักดันขนาดนี้ และสั้นพอที่จะนำมาพิจารณาอย่างจริงจัง:
• คุณภาพการโคลนเสียงเป็นพื้นผิวที่สามารถนำไปใช้ในทางที่ผิดการ์ดระบุไว้โดยตรงว่า โมเดลสร้างคำพูดที่สมจริงพอที่จะใช้ปลอมแปลงตัวตนและฉ้อโกง และเสียงที่สร้างโดย AI ควรมีการติดฉลาก Apache-2.0 ไม่ได้วางข้อจำกัดใดๆ เกี่ยวกับเรื่องนี้เลย — ต่างจากลิขสิทธิ์ของโมเดลเสียงแบบเปิดน้ำหนักหลายรุ่นที่แข่งขันกัน ไม่มีข้อกำหนดการใช้งานที่ยอมรับได้ให้อ้างเป็นข้ออ้าง นโยบายความยินยอมและการเปิดเผยข้อมูลเป็นสิ่งที่คุณต้องเขียนขึ้นเอง
• ความผันแปรระหว่างรอบการทดสอบเป็นสิ่งที่คาดหวังได้บนคุณสมบัติควบคุมทั้งสอง ไม่ใช่บั๊กที่ต้องรายงาน
• 30 ภาษาเป็นขอบเขตที่แท้จริง สิ่งใดก็ตามที่อยู่นอกเหนือจากนี้อาจทำงานได้และยังไม่ผ่านการทดสอบ คาดว่าจะต้องปรับแต่ง
• ความสม่ำเสมอของการควบคุมสไตล์ถูกอธิบายว่ายังอยู่ระหว่างการพัฒนาโดยผู้ที่สร้างมันขึ้นมา.
และช่องว่างที่การ์ดไม่ได้เอ่ยถึง: ไม่มีการเปิดเผยคลังข้อมูลสำหรับฝึกเลย ดังนั้นสัญญาอนุญาต Apache-2.0 บนน้ำหนักจึงแค่ตอบคำถามในส่วนของโค้ดเท่านั้น และไม่ได้พูดถึงที่มาของข้อมูลเลย ไม่มีการประเมินอย่างอิสระสำหรับตัวเลขใดๆ ในบทความนี้ ไม่มีค่าหน่วงที่เผยแพร่เป็นมิลลิวินาที — RTF เป็นอัตราส่วนปริมาณงาน และเอเจนต์เสียงจะอยู่หรือตายขึ้นอยู่กับเวลาจนถึงเสียงแรก ซึ่งไม่ปรากฏที่ไหนในรายงาน
สามคำถามที่การ์ดโมเดลไม่ได้ให้คำตอบ
ฉันควรย้ายออกจาก VoxCPM1.5 หรือ VoxCPM-0.5B หรือไม่
เฉพาะสำหรับความสามารถใหม่ และหลังจากที่วัดผลแล้วเท่านั้น หากคุณต้องการภาษาที่นอกเหนือจากจีนและอังกฤษ การออกแบบเสียง หรือการโคลนนิ่งที่ควบคุมสไตล์ได้ การอัปเกรดคือหัวใจสำคัญ และไม่มีทางเลือกอื่นในตระกูลนี้ หากคุณใช้การโคลนนิ่งภาษาอังกฤษหรือจีนอยู่ในตอนนี้และพอใจอยู่แล้ว เหตุผลก็ดูจะอ่อนในตัวเอง เกณฑ์วัดเดียวกันแสดงว่า VoxCPM-0.5B มีอัตราความผิดพลาดเทียบเท่า VoxCPM2 และคุณจะต้องจ่ายค่าแลเทนซีเป็นสองเท่าและ VRAM เพิ่มขึ้นอีกหนึ่งในสาม เพื่อความคล้ายคลึงของเสียงผู้พูดที่เพิ่มขึ้นประมาณ 2.4 จุด นอกจากนี้ยังมีรายละเอียดการย้ายระบบที่มองข้ามได้ง่าย — หากคุณป้อนเสียงอ้างอิง 44.1 kHz ให้ VoxCPM1.5 ตัวเข้ารหัสของ VoxCPM2 รับที่ 16 kHz ดังนั้นไปป์ไลน์เสียงอ้างอิงของคุณจะเปลี่ยนไป และย่านความถี่สูงของแหล่งข้อมูลต้นทางก็ไม่สำคัญอีกต่อไป
ฉันสามารถวางจำหน่ายผลิตภัณฑ์เสียงเชิงพาณิชย์โดยใช้สิ่งนี้ได้จริงหรือ?
ในทางกฎหมาย ใบอนุญาตนี้ถือว่าปล่อยเสรีเกือบเท่าที่จะมีได้ นั่นคือ Apache-2.0 ไม่มีเกต ไม่มีข้อจำกัดการใช้งาน อนุญาตการใช้เชิงพาณิชย์อย่างชัดเจน ครอบคลุมทั้งน้ำหนักโมเดลและโค้ดสำหรับการปรับแต่ง คำถามที่ยังไม่มีคำตอบไม่ใช่ข้อความในใบอนุญาต แต่เป็นสิ่งที่ขาดหายไปเบื้องหลัง OpenBMB ไม่ได้ระบุคลังข้อมูลฝึกฝน ซึ่งหมายความว่าไม่มีใครบอกคุณได้ว่าเสียงของใครอยู่ในข้อมูล 2 ล้านชั่วโมงนั้น สำหรับโมเดลที่มีคุณสมบัติหลักคือการเลียนเสียงของบุคคลใดบุคคลหนึ่ง นี่เป็นคำถามที่ต้องถามทนายของคุณเอง ไม่ใช่เป็นสิ่งที่อยู่ในโมเดลการ์ด และเป็นคำถามเดียวกับที่โมเดลเสียงแบบเปิดน้ำหนักทุกรุ่นในปัจจุบันต่างหลบเลี่ยง ในทางปฏิบัติ อุปสรรคที่หนักหนากว่ากลับเป็นเรื่องการดำเนินการ ยังไม่มีคลาส Transformers แบบเนทีฟ ยังไม่มีเอนด์พอยต์ที่โฮสต์ไว้ที่ใด มีความแปรปรวนระหว่างการรันแต่ละครั้งของคุณสมบัติควบคุม และไม่มีตัวเลขเวลาจนถึงเสียงแรก หากคุณกำลังสร้างอะไรก็ตามที่โต้ตอบได้
มันดีพอที่จะแทนที่ผู้ให้บริการ TTS แบบเสียเงินหรือไม่
สำหรับการบรรยายภาษาอังกฤษและจีน เนื้อหาที่บันทึกล่วงหน้า และปริมาณงานใดๆ ที่คุณควบคุมเสียงเฉพาะและประมวลผลเป็นชุดได้: ใช่ จากหลักฐานที่มี และใบอนุญาตทำให้การลองใช้แทบไม่มีค่าใช้จ่าย สำหรับเอเจนต์สนทนาแบบเรียลไทม์: วัดเวลาจนถึงเสียงแรกด้วยตัวเองก่อนตัดสินใจ เพราะไม่มีใครเผยแพร่ตัวเลขนี้ และ RTF จะไม่บอกคุณ สำหรับภาษาอาหรับ ภาษาฮินดี หรือภาษาใดๆ ในกลุ่มหางยาว: ผลการประเมินสองชุดของผู้ขายเองขัดแย้งกันในระดับสิบเท่า ดังนั้นจงถือว่าโมเดลนี้ยังไม่ผ่านการพิสูจน์ในภาษาเหล่านั้น ไม่ว่าคุณจะเห็นตัวเลขใดถูกอ้างถึงก็ตาม และสำหรับสิ่งใดก็ตามที่การออกเสียงผิดเป็นเหตุการณ์ทางธุรกิจมากกว่าความรำคาญ โปรดทราบว่า VoxCPM2 ไม่ใช่ผู้นำด้านความชัดเจนของเสียง แม้แต่ในตารางของตัวเอง — Fish Audio S2 และ LongCat-Audio-DiT นำหน้ามันในจุดนั้น และพวกมันเป็นโอเพนเวต (open-weights) เช่นกัน
ดูอะไรดี
สองสิ่งนี้ดำเนินไปตามจังหวะเวลาที่ต่างกัน อันที่ใกล้คือ PR #47756 และ PR ของ MiniCPM4 ที่อยู่ด้านล่าง ถ้าทั้งสองถูกรวมเข้าด้วยกัน VoxCPM2 จะกลายเป็นการเรียกใช้ AutoModelและต้นทุนการผสานรวมสำหรับทุกคนที่ใช้ Transformers เป็นมาตรฐานจะลดลงเกือบเป็นศูนย์ในชั่วข้ามคืน — และเมื่อพิจารณาว่ามีการดาวน์โหลด 900,282 ครั้งต่อเดือนด้วยวิธีที่ยากลำบากอยู่แล้ว นั่นคือการปลดล็อกที่มีความหมายอย่างยิ่ง ถ้าทั้งสองหยุดชะงัก คำตอบสำหรับทีมเหล่านั้นก็ยังคงเป็น "ใช้แพ็กเกจของ OpenBMB หรือปลายทาง vLLM-Omni" และผู้มีส่วนร่วมในชุมชนที่แบกรับ PR ทั้งสองไม่มีอำนาจต่อรองที่จะเปลี่ยนแปลงสิ่งนั้นได้
สิ่งที่ช้ากว่าคือการที่ใครก็ตามนอก OpenBMB จะเผยแพร่ตัวเลขออกมาจริงหรือไม่ สี่เดือนหลังการเปิดตัว มียอดดาวน์โหลด 900,000 ครั้งต่อเดือน มี finetunes 25 ตัว และ Spaces มากกว่า 100 รายการที่สร้างบนมัน ตัวเลขประสิทธิภาพทุกตัวที่หมุนเวียนอยู่ในตอนนี้ยังคงสืบย้อนไปถึงรายงานทางเทคนิคฉบับเดียวที่เขียนโดยคนที่ฝึกโมเดลเอง ซึ่งไม่ใช่การตำหนิ OpenBMB ที่บันทึกงานของตนอย่างละเอียดและซื่อสัตย์มากกว่าส่วนใหญ่ — รายงานนั้นเปิดเผยทางเลือกของ recogniser จุดอ่อนด้านปริมาณข้อมูล และความไม่เสถียรของตัวโมเดลเอง หากแต่เป็นการตำหนิพวกเราที่เหลือ สิ่งที่มีค่าที่สุดเพียงหนึ่งเดียวที่ใครก็ตามในชุมชนเสียงโอเพนซอร์สสามารถเผยแพร่ในเดือนนี้ได้ คือการรัน Whisper-scored Seed-TTS-Eval และ MiniMax-MLS ของ VoxCPM2, Qwen3-TTS, Fish Audio S2 และ LongCat-Audio-DiT ภายใต้เงื่อนไขที่เหมือนกันทุกประการ จนกว่าสิ่งนั้นจะเกิดขึ้น บทสรุปที่ยุติธรรมของ VoxCPM2 คือ มันเป็นโมเดลเสียงแบบ open-weights ที่มีความสามารถมากที่สุดต่อ checkpoint ที่ใครเคยส่งออกมา และมันไม่ใช่โมเดลที่แม่นยำที่สุด ซึ่งทั้งสองครึ่งของประโยคนั้นล้วนพึ่งพาคำพูดของคนที่ปล่อยโมเดลเท่านั้น
