VoxCPM2-1
Engineering & Research

VoxCPM2: 900.000 lượt tải mỗi tháng, mà Transformers vẫn không nạp nổi

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Siêu dữ liệu của Hugging Face cho VoxCPM2 liệt kê thư viện của nó là voxcpm — không phải transformers. Chính trường dữ liệu đơn lẻ đó giải thích một khoảng trống kỳ lạ trong thế giới giọng nói mã nguồn mở hiện tại: mô hình chuyển văn bản thành giọng nói 2B tham số của OpenBMB đã đạt 900.282 lượt tải xuống trong ba mươi ngày qua, tạo ra 25 bản tinh chỉnh công khai, 10 bản lượng tử hóa, 7 adapter và hơn 100 Spaces, nhưng vẫn không thể được tải bằng thư viện mà gần như mọi mô hình khác trên trang web đó đều sử dụng. Pull request để khắc phục điều đó đã được mở vào ngày 4 tháng 8 năm 2026 và vẫn còn mở cho đến hôm nay.

Khoảng cách đó đáng để hiểu trước khi bản sửa lỗi được tung ra, vì nó định hình chi phí tích hợp mô hình này đối với bạn trong tuần này so với quý sau. Và nó nằm trên một câu hỏi thú vị hơn, đó là liệu VoxCPM2 có thực sự vượt trội như các bài đưa tin gợi ý hay không. Mọi thứ dưới đây được đọc từ ba nguồn chính: openbmb/VoxCPM2 thẻ mô hình và siêu dữ liệu kho lưu trữ, README GitHub của OpenBMB/VoxCPM, và Báo cáo kỹ thuật VoxCPM2 (arXiv:2606.06928, nộp ngày 5 tháng 6 năm 2026). Mọi số liệu benchmark trong bài viết này là của riêng OpenBMB, do OpenBMB chạy, và — như chính bài báo nêu rõ cho bảng so sánh chính của nó — các con số đối thủ trong đó được sao chép từ các bài báo khác thay vì chạy lại trong cùng điều kiện. Theo những gì chúng tôi có thể tìm thấy, chưa có phòng thí nghiệm độc lập nào công bố bản tái hiện cho bất kỳ con số nào trong số đó.

Bảng thông số kỹ thuật, trong một màn hình

VoxCPM2 được phát hành vào tháng 4 năm 2026 (kho lưu trữ Hugging Face được tạo vào ngày 3 tháng 4, lần truy cập cuối vào ngày 16 tháng 4) như là thế hệ thứ ba của dòng VoxCPM. So với phiên bản tiền nhiệm trực tiếp của nó:

Kích thước — 2B tham số so với bộ nền 0,8B của VoxCPM1.5 và 0,6B của VoxCPM-0.5B.

Ngôn ngữ — 30 ngôn ngữ cộng 9 phương ngữ tiếng Trung, so với chỉ tiếng Trung và tiếng Anh trong cả hai phiên bản trước đó.

Âm thanh — chấp nhận tín hiệu tham chiếu 16 kHz, xuất ra 48 kHz, so với VoxCPM1.5 có đầu vào/đầu ra đối xứng 44.1 kHz.

Backbone — MiniCPM-4-1B (28 lớp, độ rộng 2048) làm mô hình ngôn ngữ ngữ nghĩa văn bản, nâng cấp từ MiniCPM-4-0.5B (24 lớp, độ rộng 1024).

Ngân sách chuỗi — 8192 token ở tốc độ token phía mô hình ngôn ngữ 6.25 Hz, tương đương khoảng 20 phút âm thanh trong một ngữ cảnh.

Chi phí cho một giây lời nói — hệ số thời gian thực 0.30 trong PyTorch thuần và 0.13 qua Nano-vLLM trên một RTX 4090, với khoảng 8 GB VRAM. VoxCPM1.5 đạt 0.15 ở 0.8B và 6 GB.

Giấy phép — Apache-2.0 trên các trọng số, mã tinh chỉnh và bộ công cụ suy luận. Không có rào cản, không có điều khoản bổ sung về sử dụng, cho phép sử dụng thương mại.

Dữ liệu huấn luyện — "hơn 2 triệu giờ" lời nói đa ngôn ngữ, không nêu tên kho ngữ liệu và không có tuyên bố về nguồn gốc.

Hãy đọc dòng RTF hai lần, vì nó chạy ngược chiều. VoxCPM2 chậm hơn khoảng gấp đôi trên mỗi giây âm thanh được tạo ra so với mô hình 0.8B mà nó thay thế, và cần thêm một phần ba dung lượng VRAM. Mô hình 2B không mua được thông lượng; nó mua được thêm ngôn ngữ và khả năng kiểm soát, và cái giá phải trả là độ trễ. Nếu bạn đang chạy một tác nhân thời gian thực, sự đánh đổi đó là điều đầu tiên cần định giá.

PR #47756 thực sự thay đổi điều gì

Ngày nay, chạy VoxCPM2 nghĩa là cài đặt gói riêng của OpenBMB — pip install voxcpm, Python 3.10 đến 3.12, PyTorch 2.5 trở lên, CUDA 12 trở lên — và tải mô hình qua VoxCPM.from_pretrained, một lệnh gọi không liên quan gì đến API Transformers. Mọi thứ phía sau quyết định đó đều được tùy chỉnh riêng: xử lý theo lô của riêng bạn, mã kết nối phục vụ của riêng bạn, cách xử lý của riêng bạn đối với năm chế độ sinh.

Công việc đang triển khai sẽ thay đổi điều đó. Issue #47695, "Thêm hỗ trợ gốc cho OpenBMB VoxCPM2," được tạo vào ngày 31 tháng 7. PR #47756, "hỗ trợ cho VoxCPM2," được tạo vào ngày 4 tháng 8 và được cập nhật lần cuối vào ngày 5 tháng 8. Nó mang nhãn "New model" và bổ sung cấu hình mô-đun và triển khai mô hình, tokenizer và processor tùy chỉnh, mã hóa và giải mã AudioVAE với phát trực tuyến, điều kiện hóa theo giọng tham chiếu, tiếp tục âm thanh theo lời nhắc, đăng ký lớp tự động và mục nhập pipeline chuyển văn bản thành dạng sóng — với 64 bài kiểm tra mô hình được báo cáo là đạt. Nó được xếp chồng lên PR #47736, vốn thêm chính MiniCPM4; phần lõi văn bản phải được hợp nhất trước khi mô hình giọng nói bao quanh nó có thể được đưa vào.

VoxCPM2-2

Hai chi tiết đáng được coi trọng, và cả hai đều đi ngược lại sự lạc quan. Thứ nhất, cả ba mục — issue và cả hai pull request — đều được mở bởi cùng một người đóng góp cộng đồng, không phải OpenBMB và cũng không phải maintainer của Hugging Face. Không có cam kết từ nhà cung cấp đằng sau việc này, do đó không có mốc thời gian nào để bạn có thể dựa vào mà lên kế hoạch. Thứ hai, một stack gồm hai PR với 203 commit liên quan đến một modality mới không phải là một đợt review nhanh. Các PR mô hình mới trong Transformers thường mất hàng tuần với nhiều vòng trao đổi với maintainer, và PR này mới chỉ có bốn bình luận cho đến nay.

Cách hiểu thực tế: nếu một lớp Transformers gốc là thành phần chịu lực cho kiến trúc của bạn — vì bạn chuẩn hóa theo AutoModel, hoặc vì tầng phục vụ của bạn chỉ hỗ trợ Transformers — VoxCPM2 chưa sẵn sàng cho bạn, và chưa có thời điểm cụ thể. Nếu bạn có thể làm việc trong gói voxcpm, mô hình hoàn toàn có thể sử dụng ngay hôm nay, và hệ sinh thái đã cho thấy rõ rằng điều này có thể chấp nhận được: 900.282 lượt tải xuống đã diễn ra mà hoàn toàn không có hỗ trợ gốc. Cũng có một con đường trung gian mà hầu hết các bài viết đều bỏ sót. OpenBMB cung cấp một bộ tích hợp vLLM-Omni mở ra endpoint tương thích OpenAI /v1/audio/speech, cùng với bản dựng llama.cpp-omni với trọng số GGUF chạy trên CPU, Metal, CUDA hoặc Vulkan mà không cần phụ thuộc Python nào cả. Nếu thứ bạn thực sự muốn từ Transformers là một giao diện phục vụ tiêu chuẩn thay vì bản thân lớp đó, thì thứ đó đã tồn tại.

"Tokenizer-free" không có nghĩa là chưa lượng tử hóa

Cụm từ trong mọi tiêu đề về mô hình này là cụm từ thường bị đọc sai nhất. VoxCPM2 không có bộ codec âm thanh rời rạc bên ngoài — không có từ vựng token tiếng nói được học nào nằm giữa mô hình ngôn ngữ và dạng sóng, như trong dòng CosyVoice hay Moshi. Đó là tuyên bố, và nó đúng.

Bên trong mô hình vẫn còn lượng tử hóa. Backbone chạy một nút thắt bán rời rạc khả vi dựa trên Finite Scalar Quantization, và bài báo nêu rõ vai trò của nó: mô hình ngôn ngữ ngữ nghĩa văn bản tạo ra các trạng thái ẩn, FSQ lượng tử hóa vô hướng từng chiều của chúng thành một "khung ngữ nghĩa", mô hình ngôn ngữ âm học dư khôi phục chi tiết mịn mà FSQ đã loại bỏ, và một transformer khuếch tán cục bộ biến cả hai luồng điều kiện thành mảng tiềm ẩn liên tục tiếp theo bằng flow matching. Bốn giai đoạn mà bạn thấy được viết tắt là LocEnc, TSLM, RALM và LocDiT chính xác là chuỗi đó.

Sự khác biệt thực sự quan trọng trong thực tế không phải là "lượng tử hóa hay không." Mà là bottleneck được huấn luyện end-to-end cùng với mọi thứ xung quanh nó, thay vì bị đóng băng từ trước như một codec riêng biệt với hàm mất mát của riêng nó. Đó chính là điều loại bỏ chế độ lỗi thường gặp khi mô hình ngôn ngữ học cách dự đoán các token mà codec không thể giải mã một cách trung thực. VoxCPM2 đã mở rộng bottleneck FSQ từ 256 lên 512 chiều và thay thế phép cộng theo từng phần tử cũ cấp dữ liệu cho mô hình residual bằng một phép chiếu-ghép nối (concatenation-projection) có thể học được — những thay đổi nhỏ, và nằm trong số ít thay đổi trong báo cáo được hỗ trợ bởi một cơ chế được nêu rõ thay vì chỉ là một chênh lệch benchmark.

Đầu ra 48 kHz một phần là bịa đặt, và đó chính là thiết kế.

"Đầu ra chất lượng phòng thu 48 kHz" là thông số được trích dẫn nhiều nhất của mô hình và cũng là thông số bị hiểu lầm rộng rãi nhất. AudioVAE V2 không đối xứng: bộ mã hóa hoạt động ở 16 kHz, bộ giải mã tái tạo ở 48 kHz. Bài báo gọi đây là "siêu phân giải ngầm" — một cái tên trung thực cho bản chất của nó.

Hãy theo dõi hệ quả. Một bộ mã hóa 16 kHz có trần Nyquist 8 kHz, nên không có gì trên 8 kHz trong âm thanh tham chiếu của bạn đến được mô hình. Mọi chút năng lượng trong hai quãng tám cao nhất của đầu ra — độ thoáng của giọng nói, âm xuýt, độ sáng ở mép chũm chọe — đều do bộ giải mã tạo ra từ một tiền nghiệm hợp lý, chứ không phải được mang sang từ người nói mà bạn đã nhân bản. Với hầu hết công việc dẫn chuyện và agent, điều này là vô hình hoặc là một sự cải thiện, vì một tiền nghiệm học được tốt vượt trội hơn một bộ lọc shelf cứng ở 8 kHz. Còn với những người có công việc gắn với độ trung thực với một giọng nói thu âm cụ thể, đó là một thực tế phải tính đến khi thiết kế, và đó không phải là điều mà một bài nghe thử trên loa laptop của bạn sẽ phát hiện ra.

Lý do bài báo đưa ra là lập luận kỹ thuật đáng tin cậy nhất trong báo cáo, và đáng được nhắc lại vì nó không phải là lời tiếp thị: giữ bộ mã hóa ở 16 kHz cho phép OpenBMB tái sử dụng toàn bộ ngữ liệu huấn luyện 16 kHz gốc của VoxCPM, loại bỏ sự lệch tiềm ẩn giữa các nguồn được ghi ở các tốc độ lấy mẫu khác nhau, và tránh sự bùng nổ độ dài chuỗi mà tốc độ đầu vào cao hơn sẽ gây ra cho vòng lặp tự hồi quy. Chỉ nâng cấp bộ giải mã sẽ mang lại độ trung thực đầu ra mà không phải trả giá ở phần đắt đỏ nhất của mô hình. Đó là một sự đánh đổi tốt, được thực hiện một cách có chủ đích. Điều đó cũng có nghĩa là người dùng VoxCPM1.5 đang chuyển từ bộ mã hóa 44.1 kHz sang bộ mã hóa 16 kHz — một sự giảm cấp ở phía đầu vào nằm gọn trong một sự nâng cấp ở phía đầu ra. Bảng tái tạo của chính OpenBMB cho thấy rõ điều đó: codec của VoxCPM1.5 vẫn đạt khoảng cách mel băng tần đầy đủ tốt nhất trong ba thế hệ, 1.139 so với 1.335 của AudioVAE V2, vì nó hoạt động nguyên bản ở tốc độ lấy mẫu cao thay vì tái tạo ngược lên một tốc độ cao hơn.

Đọc bảng điểm của OpenBMB theo cách OpenBMB đã viết

Cạnh tranh, không phải là nhất

Trên chuẩn đánh giá nhân bản giọng nói zero-shot tiêu chuẩn Seed-TTS-Eval, VoxCPM2 đạt 1,84% tỷ lệ lỗi từ với độ tương đồng người nói 75,3% trên bộ tiếng Anh, 0,97% tỷ lệ lỗi ký tự với độ tương đồng 79,5% trên bộ tiếng Trung, và 8,13% CER với độ tương đồng 75,3% trên tập con tiếng Trung khó. Bài báo tự mô tả kết quả này là "cạnh tranh", và bảng số liệu ủng hộ từ ngữ đó hơn là những nhận định mạnh mẽ hơn đang lan truyền.

VoxCPM2-3

Trong số các hệ thống mã nguồn mở trong cùng bảng đó, Fish Audio S2 đạt tỷ lệ lỗi tốt hơn trên cả ba tập con (0,99 / 0,54 / 5,99). Qwen3-TTS vượt qua nó về WER tiếng Anh ở mức 1,23. Và LongCat-Audio-DiT thắng áp đảo ở năm trên sáu ô — WER 1,50 và độ tương đồng 78,6 trên tiếng Anh, độ tương đồng 81,8 trên tiếng Trung, CER 6,04 và độ tương đồng 79,7 trên tiếng Trung khó. Điểm mà VoxCPM2 thực sự nổi bật là sự cân bằng: đây là một trong số rất ít hệ thống đồng thời gần đứng đầu về độ tương đồng và ở mức đáng nể về độ dễ hiểu, đồng thời là hệ thống duy nhất trong danh sách đó cũng hỗ trợ thiết kế giọng nói bằng ngôn ngữ tự nhiên. Nhưng 'tiên tiến nhất' không phải là điều mà chính bảng kết quả của nó cho thấy, và nói một cách trung thực thì đây là một hệ thống đa năng mạnh mẽ, chứ không phải là người dẫn đầu benchmark.

Gấp 3,3 lần tham số hầu như không cải thiện được độ dễ hiểu.

Hàng hữu ích nhất trong bảng đó là hàng không ai trích dẫn. VoxCPM-0.5B, thế hệ đầu tiên 0,6B từ tháng 9 năm 2025, đạt 1,85% WER tiếng Anh và 0,93% CER tiếng Trung. VoxCPM2, ở mức 2B, đạt 1,84% và 0,97%. Khác biệt nằm trong khoảng nhiễu ở tiếng Anh, và kém hơn một chút ở tiếng Trung.

Điều mà các tham số bổ sung thực sự mang lại chỉ có thể thấy ở các cột độ tương đồng chứ không ở đâu khác: SIM tiếng Anh tăng từ 72.9 lên 75.3, tiếng Trung từ 77.2 lên 79.5. Mọi thứ khác mà bản 2B mua được đều nằm hoàn toàn ngoài benchmark này — thêm 28 ngôn ngữ, thiết kế giọng nói từ mô tả văn bản, nhân bản giọng có kiểm soát phong cách, đầu ra 48 kHz. Đó là rất nhiều, và đó là lý do trung thực để nâng cấp. Nhưng nếu tác vụ của bạn là nhân bản tiếng Anh hoặc tiếng Trung và bạn chọn dựa trên tỷ lệ lỗi, VoxCPM2 chẳng cho bạn thứ gì mà mô hình 0.6B chưa từng cho bạn, với trọng số gấp ba lần và độ trễ gấp đôi. Thú vị thay, VoxCPM1.5 là mô hình tệ nhất trong ba mô hình trên benchmark này (2.12 / 1.18), khiến sự tiến triển của dòng sản phẩm trông không giống một bậc thang mà giống ba sản phẩm khác nhau.

Một mô hình, hai đánh giá, cách nhau một bậc độ lớn

Đây là nơi cần thận trọng, vì hai kết quả đa ngôn ngữ trong báo cáo này mâu thuẫn gay gắt với nhau và cả hai đều được trích dẫn như thể chúng giải quyết được vấn đề.

Điểm nổi bật là tỷ lệ lỗi trung bình 1,68% trên 30 ngôn ngữ. Con số này đến từ bộ dữ liệu kiểm tra do chính OpenBMB xây dựng — 500 câu nói cho mỗi ngôn ngữ — và được chấm điểm bằng Gemini 3.1 Flash Lite làm bộ nhận dạng. Trên bộ dữ liệu này, VoxCPM2 đạt mức lỗi tiếng Anh 0,42, tiếng Trung 0,92, tiếng Hindi 0,79, tiếng Ả Rập 1,23.

Báo cáo cũng chạy MiniMax-MLS-Test, một bộ dữ liệu 24 ngôn ngữ của bên thứ ba được chấm điểm bằng Whisper-large-v3. Cùng một mô hình. Tại đó, VoxCPM2 đạt điểm tiếng Hindi 19.70 và tiếng Ả Rập 13.05 — tệ hơn lần lượt 25 lần và 10 lần so với kết quả benchmark của chính nó, trên các ngôn ngữ mà nó chính thức hỗ trợ. Cũng trong cột đó: tiếng Quảng Đông 38.58, tiếng Séc 24.13, tiếng Romania 21.58, tiếng Ukraina 6.32.

Ba điều này dung hòa được hầu hết vấn đề, và chúng đáng được tách bạch vì phiên bản phổ biến rộng rãi của câu chuyện này đã hiểu sai chúng:

Tiếng Séc, tiếng Romania và tiếng Ukraina không nằm trong số các ngôn ngữ được hỗ trợ. Hãy kiểm tra các thẻ ngôn ngữ của chính kho lưu trữ: 30 mã ngôn ngữ, và không có mã nào là cs, ro hay uk. Chê trách VoxCPM2 vì WER tiếng Séc 24% cũng là chê trách nó vì một ngôn ngữ mà nó chưa từng tuyên bố hỗ trợ. Tiếng Quảng Đông dường như nằm trong nhóm "9 phương ngữ tiếng Trung", nhưng mọi hệ thống trong cột đó đều có WER trên 30% đối với nó, điều này cho thấy vấn đề nằm ở bộ nhận dạng chứ không phải ở bất kỳ mô hình nào.

Tiếng Ả Rập và tiếng Hindi được hỗ trợ, và đó mới là phát hiện thực sự. Đây là hai ngôn ngữ mà OpenBMB tuyên bố bao phủ và hai kết quả đánh giá của mô hình này chênh lệch nhau một bậc độ lớn. Lời giải thích của chính bài báo là các ngôn ngữ này có "khối lượng dữ liệu tương đối hạn chế" trong kho ngữ liệu huấn luyện và "một phần WER cao hơn có thể xuất phát từ độ chính xác hạn chế của bộ nhận dạng". Đó là một giả thuyết hợp lý nhưng chưa được kiểm chứng. Nếu bạn đang phát hành sản phẩm nhận dạng giọng nói tiếng Ả Rập hoặc tiếng Hindi, phạm vi được công bố cho mô hình này là từ 0,79% đến 19,70% và cả hai đầu đều không được xác minh độc lập. Hãy dành một ngày để tự đo lường; đừng dựa vào bất kỳ con số nào trong hai con số đó.

Các chỉ số thậm chí còn không cùng đơn vị.Tiếng Hindi được chấm theo tỷ lệ lỗi ký tự trên bộ dữ liệu nội bộ và tỷ lệ lỗi từ trên MiniMax-MLS. Đây là những đại lượng không thể so sánh được, điều này là một lý do nữa khiến khoảng cách 25 lần không phải là một lời kết tội rõ ràng — và là một lý do nữa khiến mức trung bình 1,68% không nên được xem như một điểm số so sánh trực tiếp.

Điều thận trọng tương tự cũng áp dụng cho tuyên bố có sức nặng số liệu lớn nhất trong bài viết về mô hình này: rằng VoxCPM2 đánh bại ElevenLabs về độ tương đồng giọng nói, 85.4% so với 61.3% ở tiếng Anh, thắng 22 trên 24 ngôn ngữ. Đó thực sự là những gì bảng số liệu thể hiện. Đây cũng là bảng số liệu mà bài báo tập hợp một phần từ các kết quả đã được công bố trước đó, và là bảng mà cột độ rõ ràng của ElevenLabs chứa WER 73.94% đối với tiếng Thái, 73.42% đối với tiếng Việt và 16.03% đối với tiếng Trung. Đó không phải là con số của một sản phẩm thương mại hoạt động bình thường; chúng là dấu hiệu của sự sai lệch trong khâu chấm điểm hoặc cấu hình. Một bảng số liệu hỏng ở cột này thì không thể trở nên đáng tin cậy ở cột khác chỉ vì kết quả làm hài lòng mô hình mà bạn đang đọc.

Năm chế độ từ một nền tảng duy nhất — và công thức thúc đẩy số liệu của bạn

Ý tưởng gọn gàng nhất trong kiến trúc này là VoxCPM2 không có các mô hình hay head riêng biệt cho các khả năng của mình. Cả năm chế độ đều dùng cùng một bộ tham số, chỉ khác nhau ở cách bố trí chuỗi đầu vào, vì vậy một checkpoint 2B duy nhất bao phủ được những gì thường cần cả một đội nhỏ:

Basic TTS — văn bản vào, âm thanh ra.

Thiết kế giọng nói — mô tả trong ngoặc đơn chỉ đơn giản được nối vào trước văn bản, vì vậy "(một người đàn ông trung niên mệt mỏi, giọng khàn, nói chậm)" và chính dòng văn bản đó cùng được xử lý bởi cùng một mô hình ngôn ngữ mà không cần mô-đun bổ sung nào. Không cần bất kỳ âm thanh tham chiếu nào.

Nhân bản tham chiếu — một clip tham chiếu độc lập xác định danh tính người nói mà không cần bản phiên âm.

Nhân bản có thể điều khiển — đoạn clip tham chiếu kèm mô tả phong cách, để bạn có thể nhân bản một giọng nói và sau đó yêu cầu nó nghe gấp gáp hoặc thích thú.

Nhân bản tiếp nối — đoạn clip tham chiếu được ghép với bản phiên âm của nó, được xử lý như tiền tố âm thanh mà mô hình tiếp tục, đây là chế độ có độ trung thực cao nhất.

Ẩn trong báo cáo là một núm điều chỉnh mà hầu hết các bài viết bỏ qua, và đó là thứ có khả năng thay đổi kết quả của bạn nhất. Hai con đường điều kiện hóa — tham chiếu cô lập và tiền tố tiếp nối — có thể được sử dụng riêng rẽ hoặc cùng nhau, và chúng đánh đổi lẫn nhau. Trong thử nghiệm loại bỏ (ablation) của chính OpenBMB, việc sử dụng cả hai cùng nhau cho độ tương đồng giọng nói tốt nhất trên mọi tập con. Bỏ tiền tố tiếp nối và chỉ truyền tham chiếu cô lập cho độ rõ ràng tốt nhất trên văn bản tiếng Trung khó, với 6,85% CER so với 7,44%, đồng thời hy sinh khoảng năm điểm tương đồng. Giải thích của bài báo là hợp lý: không có tiền tố âm thanh theo thời gian để cố định ngữ điệu, mô hình có nhiều tự do hơn để lựa chọn cách truyền đạt phù hợp với văn bản khó.

Vậy nên mặc định là một lựa chọn, không phải một giới hạn. Công việc khớp giọng nói cần cả hai hướng; văn bản khó hoặc bất thường chỉ cần tham chiếu. Một điểm cần nói thẳng: các con số tuyệt đối trong bảng ablation đó không khớp với bảng chính cho công thức mà bài báo nói đã dùng xuyên suốt; trong một bản preprint, điều này nhiều khả năng là sơ suất ghi sổ hơn là điều gì đó mờ ám — nhưng đó là lý do thứ ba để coi mọi con số ở đây là hướng cần kiểm tra thay vì giá trị để trích dẫn.

Thiết kế giọng nói: vâng lời hơn là tự nhiên

Thiết kế giọng nói là tính năng khiến bản phát hành này trở nên thú vị thay vì chỉ mang tính gia tăng, và đây cũng là điểm mà các con số của chính nhà cung cấp bộc lộ rõ nhất về một sự đánh đổi thực sự.

Trên InstructTTSEval, VoxCPM2 đạt 84.2 về đặc tả tham số âm học, 83.2 về chỉ dẫn theo phong cách mô tả và 71.4 về nhập vai cho tiếng Anh — con số cuối cùng này là tốt nhất trong bảng, vượt qua Qwen3-TTS-1.7B-VD ở mức 68.4 và Gemini-TTS-Pro ở mức 67.2. Với tiếng Trung, kết quả yếu hơn và thứ tự đảo ngược: 85.2 / 71.5 / 60.8, so với Gemini-TTS-Pro là 89.0 / 90.1 / 75.5. Vì vậy, nhận định mạnh nhất có thể đưa ra là VoxCPM2 dẫn đầu về nhập vai tiếng Anh và xếp sau một hệ thống frontier đóng gần như ở mọi khía cạnh khác trong việc tuân thủ chỉ dẫn.

Hội đồng nghe thử — 50 người nghe, ngẫu nhiên hóa và mù đôi, theo báo cáo — làm rõ hơn điều đó. Về sinh có điều khiển, VoxCPM2 đạt 4.50 về khả năng làm theo chỉ dẫn so với 4.41 của Qwen3-TTS-VD, và thua về độ tự nhiên với 4.48 so với 4.61. Về nhân bản zero-shot thông thường, nó thắng về độ tương đồng giọng nói (4.74 so với 4.69) và hòa hoặc kém về độ tự nhiên (4.78 so với 4.80 của Qwen3-TTS, với khoảng tin cậy chồng lấn).

Mô hình này đủ nhất quán để có thể dựa vào đó mà lên kế hoạch: VoxCPM2 làm đúng những gì bạn yêu cầu và nghe kém tự nhiên hơn một chút, còn Qwen3-TTS nghe tốt hơn một chút nhưng tuân theo chỉ dẫn kém sát hơn một chút. Chọn cái nào hoàn toàn phụ thuộc vào việc giá trị sản phẩm của bạn nằm ở khả năng kiểm soát chính xác hay khả năng phân phối dễ dàng. OpenBMB tự chỉ ra chính hệ quả đó trong phần hạn chế của mình, một điều mà các nhà cung cấp thường bỏ qua: thiết kế giọng nói và nhân bản có kiểm soát “có thể tạo ra kết quả khác nhau giữa các lần chạy”, và để có được giọng nói bạn mong muốn có thể phải thử nhiều lần. Hãy tích hợp cơ chế thử lại vào quy trình của bạn và, nếu giọng nói quan trọng, hãy thêm một khâu kiểm tra nghe của con người.

Chi phí vận hành là bao nhiêu, và khi nào thuê là lựa chọn đúng đắn

Không có VoxCPM2 được lưu trữ ở bất kỳ đâu. Thanh bên của chính Hugging Face nói rõ ràng — "Mô hình này không được triển khai bởi bất kỳ Nhà cung cấp suy luận nào" — và điều đó bao gồm cả chúng tôi: OrcaRouter không phục vụ VoxCPM2, và dù có muốn đến đâu, một mô hình TTS 2B không có đối tác suy luận thì cũng chỉ là trọng số bạn tự lưu trữ hoặc không có gì.

Điều đó khiến bài toán chi phí trở thành bài toán GPU, và phép toán rất gọn. Với hệ số thời gian thực (RTF) 0,13 của Nano-vLLM trên một chiếc RTX 4090, một giờ GPU tạo ra khoảng 7,7 giờ âm thanh, nên chi phí cho mỗi giờ âm thanh của bạn bằng mức giá theo giờ cho một card 24 GB chia cho khoảng 7,7. Với PyTorch thuần túy ở RTF 0,30, con số đó giảm xuống còn khoảng 3,3 giờ âm thanh trên mỗi giờ GPU. Cả hai con số này đều là của OpenBMB, đo trên phần cứng của họ với văn bản của họ, và cả hai sẽ thay đổi trên hệ thống của bạn — kích thước batch, độ khó văn bản và số lần thử lại mà quy trình kiểm soát chất lượng của bạn buộc phải thực hiện đều là các hệ số nhân mà con số RTF không bao gồm. Tỷ lệ thử lại là thứ mà mọi người hay quên: một mô hình mà nhà cung cấp nói với bạn rằng có thể cần nhiều lần thử để đạt được giọng đọc mục tiêu sẽ không có chi phí như con số RTF của nó ám chỉ.

VoxCPM2-4

Điều mà mọi người muốn so sánh ở thời điểm này là với một API thuê ngoài, và câu trả lời trung thực là hai bên không thể quy đổi cho nhau một cách rõ ràng. openai/tts-1-hd tính phí $30.00 cho mỗi triệu token đầu vào và đầu ra — đó là giá niêm yết của nhà cung cấp được chuyển thẳng qua OrcaRouter, vì chúng tôi không tính phí chênh lệch, nên con số trên trang mô hình của chúng tôi chính là con số mà OpenAI tính phí. Nhưng token không phải là giây, và không có tỷ lệ quy đổi nào được công bố đủ tin cậy để dùng làm cơ sở lập bảng tính. Bất kỳ ai cho bạn xem một sự so sánh theo giờ gọn gàng giữa mô hình TTS trọng số mở tự lưu trữ và một API tính phí theo token đều đã đưa ra một giả định mà họ không cho bạn thấy.

{{1}}Điều đáng nói là đường ranh giới kiến trúc nằm ở đâu.{{/1}} Tự lưu trữ VoxCPM2 hợp lý khi bạn cần một giọng nói nhân bản cụ thể, {{2}}khi lưu lượng âm thanh đủ ổn định để giữ GPU luôn bận rộn,{{/2}} {{3}}khi dữ liệu không thể rời khỏi hạ tầng của bạn,{{/3}} hoặc khi bạn định {{KEEP}}LoRA-finetune{{/KEEP}} nó {{4}}— và nó hỗ trợ điều đó chỉ với 5 đến 10 phút âm thanh mục tiêu,{{/4}} điều này thực sự rẻ. Thuê ngoài hợp lý {{5}}khi lưu lượng không ổn định,{{/5}} {{6}}khi bạn không thể bố trí nhân sự vận hành GPU,{{/6}} hoặc khi giọng nói có thể thay thế cho nhau. Hầu hết các sản phẩm giọng nói thực thụ là hai hệ thống, không phải một: {{7}}một lớp tổng hợp và một mô hình ngôn ngữ đảm nhận phần suy luận.{{/7}} Nửa suy luận là phần đáng để đặt sau một chìa khóa duy nhất với khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, {{8}}để việc thay đổi mô hình chỉ là đổi một chuỗi chứ không phải một chu trình mua sắm;{{/8}} {{9}}đó chính là vai trò mà OrcaRouter đảm nhận, trên 200+ mô hình.{{/9}} Còn nửa tổng hợp, khi đó là giọng nói cụ thể mà bạn sở hữu và tinh chỉnh, {{10}}thuộc về phần cứng của chính bạn.{{/10}} VoxCPM2 nằm gọn trong loại thứ hai đó, {{11}}và việc không ai cung cấp nó là hệ quả của bản chất nó, chứ không phải sự sơ suất.{{/11}}

Điều OpenBMB khuyên bạn đừng mong đợi

Phần hạn chế thẳng thắn một cách lạ thường đối với một bản phát hành đang có nhiều đà như vậy, và nó đủ ngắn để được coi trọng:

Chất lượng nhân bản giọng nói là một bề mặt lạm dụng. Thẻ mô tả nói rõ điều đó: mô hình tạo ra giọng nói đủ chân thực để phục vụ việc mạo danh và lừa đảo, và âm thanh do AI tạo ra nên được gắn nhãn. Apache-2.0 không đặt bất kỳ hạn chế nào về điều này — không giống như giấy phép của một số mô hình giọng nói mã nguồn mở cạnh tranh khác, không có điều khoản sử dụng được chấp nhận nào để dựa vào. Chính sách đồng thuận và tiết lộ là do bạn tự xây dựng.

Sai lệch giữa các lần chạy là điều bình thường trên hai tính năng kiểm soát, không phải là lỗi cần báo cáo.

30 ngôn ngữ là một ranh giới thực sự. Bất cứ thứ gì ngoài chúng có thể hoạt động và chưa được kiểm tra; hãy chuẩn bị tinh chỉnh.

Tính nhất quán của kiểm soát phong cách được mô tả là vẫn đang trong quá trình phát triển bởi những người đã tạo ra nó.

Và những khoảng trống mà thẻ không nêu tên: không có công bố ngữ liệu huấn luyện nào cả, vì vậy giấy phép Apache-2.0 trên các trọng số chỉ giải quyết vấn đề mã nguồn và không nói gì về nguồn gốc dữ liệu. Không có đánh giá độc lập nào cho bất kỳ con số nào trong bài viết này. Không có độ trễ công bố tính bằng mili giây — RTF là tỷ lệ thông lượng, và một tác nhân giọng nói sống hay chết phụ thuộc vào thời gian đến âm thanh đầu tiên, điều không xuất hiện ở bất kỳ đâu trong báo cáo.

Ba câu hỏi mà thẻ mô hình không giải đáp

Tôi có nên chuyển khỏi VoxCPM1.5 hay VoxCPM-0.5B không?

Chỉ khi cần các khả năng mới và chỉ sau khi đã đo lường. Nếu bạn cần ngôn ngữ ngoài tiếng Trung và tiếng Anh, thiết kế giọng nói hoặc nhân bản có kiểm soát phong cách, thì việc nâng cấp chính là điều cốt yếu và không có lựa chọn thay thế nào trong cùng dòng sản phẩm. Nếu hiện tại bạn đang chạy nhân bản tiếng Anh hoặc tiếng Trung và thấy hài lòng, thì lý do nâng cấp hiển nhiên là không thuyết phục: cùng một benchmark cho thấy VoxCPM-0.5B có tỷ lệ lỗi ngang bằng VoxCPM2, và bạn sẽ phải trả gấp đôi độ trễ cùng thêm một phần ba VRAM để đổi lấy khoảng 2,4 điểm độ tương đồng giọng nói. Ngoài ra còn một chi tiết chuyển đổi dễ bị bỏ qua — nếu trước đây bạn đưa âm thanh tham chiếu 44,1 kHz vào VoxCPM1.5, thì bộ mã hóa của VoxCPM2 chỉ nhận 16 kHz, nên quy trình tham chiếu của bạn thay đổi và phần tần số cao của nguồn liệu không còn quan trọng nữa.

Tôi có thực sự có thể phát hành một sản phẩm giọng nói thương mại trên nền tảng này không?

{{1}}Về mặt pháp lý, giấy phép này thuộc loại thoáng nhất có thể: Apache-2.0, không có cổng chặn, không hạn chế sử dụng, cho phép sử dụng thương mại một cách minh bạch, cả mã trọng số lẫn mã tinh chỉnh đều được bao phủ.{{/1}} {{2}}Câu hỏi mở không nằm ở văn bản giấy phép mà ở những gì còn thiếu phía sau nó.{{/2}} {{3}}OpenBMB không nêu tên kho dữ liệu huấn luyện, nghĩa là không ai có thể cho bạn biết giọng nói của những ai nằm trong 2 triệu giờ đó.{{/3}} {{4}}Đối với một mô hình có tính năng chủ đạo là tái tạo giọng nói của một người cụ thể, đó là câu hỏi dành cho luật sư của bạn chứ không phải cho một model card — và đó cũng là câu hỏi mà mọi mô hình giọng nói mã mở hiện nay đều né tránh.{{/4}} {{5}}Về mặt thực tiễn, các rào cản khó hơn nằm ở vận hành:{{/5}} {{6}}chưa có lớp Transformers gốc,{{/6}} {{7}}chưa có endpoint lưu trữ ở bất kỳ đâu, độ biến thiên giữa các lần chạy ở các tính năng điều khiển, và không có số liệu thời gian đến âm thanh đầu tiên nếu bạn đang xây dựng bất kỳ thứ gì mang tính hội thoại.{{/7}}

Liệu nó có đủ tốt để thay thế một nhà cung cấp TTS trả phí không?

Đối với tường thuật tiếng Anh và tiếng Trung, nội dung ghi âm sẵn, và bất kỳ khối lượng công việc nào bạn kiểm soát một giọng nói cụ thể và có thể xử lý theo lô: có, dựa trên bằng chứng hiện có, và giấy phép khiến việc dùng thử gần như miễn phí. Đối với các tác nhân hội thoại thời gian thực: hãy tự đo thời gian đến âm thanh đầu tiên (time-to-first-audio) trước khi cam kết, vì không ai công bố số liệu này và RTF sẽ không cho bạn biết. Đối với tiếng Ả Rập, tiếng Hindi, hoặc bất kỳ ngôn ngữ nào thuộc nhóm đuôi dài: hai bài đánh giá của chính nhà cung cấp chênh lệch nhau tới một bậc độ lớn, vì vậy hãy coi mô hình là chưa được kiểm chứng ở những ngôn ngữ đó, bất kể bạn đã thấy con số nào được trích dẫn. Và đối với bất kỳ trường hợp nào mà phát âm sai là một sự cố kinh doanh chứ không chỉ là phiền toái, hãy lưu ý rằng VoxCPM2 không phải là người dẫn đầu về độ rõ âm ngay cả trong bảng xếp hạng của chính nó — Fish Audio S2 và LongCat-Audio-DiT đứng trên nó trong bảng đó, và chúng cũng là các mô hình trọng số mở.

Xem gì

Hai điều, xảy ra ở các thời điểm khác nhau. Việc gần nhất là PR #47756 và PR MiniCPM4 nằm ngay phía dưới nó. Nếu chúng được hợp nhất, VoxCPM2 sẽ trở thành một AutoModel call và chi phí tích hợp cho mọi người đã chuẩn hoá trên Transformers giảm xuống gần như bằng không chỉ sau một đêm — và với 900.282 lượt tải mỗi tháng đã được thực hiện theo cách gian nan, đó là một sự mở khoá đầy ý nghĩa. Nếu chúng bị đình trệ, câu trả lời cho các đội ngũ đó vẫn là "hãy dùng gói OpenBMB hoặc điểm cuối vLLM-Omni," và người đóng góp cộng đồng đang phụ trách cả hai PR không có đòn bẩy nào để thay đổi điều đó.

Điều chậm hơn là liệu {{1}}có ai bên ngoài OpenBMB từng công bố một con số nào không{{/1}}. Bốn tháng sau khi phát hành, với 900.000 lượt tải mỗi tháng, 25 bản tinh chỉnh và hơn 100 Spaces được xây dựng trên nó, mọi số liệu hiệu năng đang lưu hành vẫn đều bắt nguồn từ một báo cáo kỹ thuật duy nhất do chính những người huấn luyện mô hình viết ra. Đó không phải là lời chê trách nhắm vào OpenBMB — tổ chức đã ghi chép công trình của họ kỹ lưỡng và trung thực hơn hầu hết những nơi khác; báo cáo chủ động tiết lộ các lựa chọn bộ nhận dạng, những điểm yếu về khối lượng dữ liệu và cả sự bất ổn định của chính nó. Đó là lời chê trách dành cho tất cả những người còn lại trong chúng ta. Điều giá trị nhất mà bất kỳ ai trong cộng đồng giọng nói mã nguồn mở có thể công bố trong tháng này là một bài chạy Seed-TTS-Eval và MiniMax-MLS được chấm điểm bằng Whisper trên VoxCPM2, Qwen3-TTS, Fish Audio S2 và LongCat-Audio-DiT trong các điều kiện giống hệt nhau. Cho đến khi điều đó tồn tại, tóm tắt công bằng về VoxCPM2 là: đây là mô hình giọng nói mã nguồn mở có năng lực cao nhất trên mỗi checkpoint mà bất kỳ ai từng phát hành, nhưng không phải là mô hình chính xác nhất, và cả hai vế của câu đó đều dựa vào lời của nhà cung cấp.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube