
Eleven v4 vs VoxCPM2: Một mô hình được xếp hạng đối đầu với một checkpoint bạn không thể thuê
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 982 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 197 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Sự thật hữu ích nhất trong màn đối đầu này là một hàng không hề tồn tại. ElevenLabs Eleven v4 giữ vị trí số 1 trên Provider Voice Arena của Artificial Analysis với Elo 1.319 qua 1.674 lần xuất hiện, ở mức 80,00 USD cho mỗi triệu ký tự. VoxCPM2, checkpoint của OpenBMB phát hành vào tháng 4 năm 2026, không xuất hiện ở bất kỳ đâu trên cả hai bảng xếp hạng giọng nói — không được xếp hạng, không thuộc nhóm chưa xếp hạng, cũng không phải một mục xem trước. Đó không phải là một phán quyết về chất lượng. Nó có nghĩa là dù bạn hy vọng so sánh con số nào với 1.319, thì chưa ai tạo ra con số đó, và việc so sánh phải dựa trên thứ gì đó khác ngoài sở thích. Điều còn lại là quyền sở hữu, tinh chỉnh, và một câu hỏi về cấp phép mà một endpoint được lưu trữ không cho phép bạn đặt ra.
Mỗi bên thực sự đưa cho bạn những gì
Đây là những loại sản phẩm khác nhau, và sự khác biệt không phải là chuyện hình thức.
• Truy cập — Eleven v4 là một endpoint được lưu trữ, truy cập qua API riêng của ElevenLabs, tính phí theo ký tự. VoxCPM2 là một checkpoint trên Hugging Face tại openbmb/VoxCPM2; bạn tải nó về và chạy nó, và không có endpoint chính chủ nào để gọi.
• Giấy phép — VoxCPM2 phát hành theo Apache 2.0, rõ ràng miễn phí cho mục đích thương mại. Eleven v4 là API thương mại với các điều khoản thuộc ElevenLabs. Sự khác biệt đó có ý nghĩa nếu bộ phận pháp lý của bạn hỏi liệu bạn có thể tinh chỉnh, phân phối lại hoặc phát hành trọng số hay không; với checkpoint thì câu trả lời được ghi rõ và cố định.
• Kích thước và phần cứng — VoxCPM2 có 2 tỷ tham số trên nền tảng MiniCPM-4 và thẻ thông số ghi khoảng 8 GB VRAM ở bfloat16, với độ dài chuỗi tối đa 8.192 token. ElevenLabs không công bố số lượng tham số cho Eleven v4, và dấu chân phần cứng của một mô hình chạy trên dịch vụ lưu trữ không phải là thứ bạn phải quản lý.
• Chuỗi đầu ra — VoxCPM2 chấp nhận âm thanh tham chiếu 16 kHz và phát ra 48 kHz thông qua tính năng siêu phân giải tích hợp sẵn của AudioVAE V2, không có bộ tăng mẫu bên ngoài trong đường tín hiệu. Hosted TTS đưa cho bạn một luồng ở bất kỳ tốc độ nào mà nhà cung cấp đã chọn.
• Điểm độc lập — Eleven v4 có một điểm, và nó đứng ở vị trí đầu tiên. VoxCPM2 không có điểm nào. Sự vắng mặt không phải là một điểm thấp; đó là một mô hình chưa được chấm điểm, và hai thứ đó không bao giờ nên được nhắc đến trong cùng một câu như thể cái thứ hai là một con số.

Con số thay thế cho Elo còn thiếu
Nếu bạn không thể so sánh sở thích, hãy so sánh những gì bạn có thể tính toán, và với một mô hình tự triển khai thì đó chính là thông lượng. Thẻ của VoxCPM2 ghi hệ số thời gian thực vào khoảng 0,30 trong PyTorch tiêu chuẩn trên RTX 4090, giảm xuống còn khoảng 0,13 khi chạy dưới Nano-VLLM. Hệ số thời gian thực là số giây tính toán trên mỗi giây âm thanh, vì vậy hai con số đó có nghĩa là một giờ GPU tạo ra khoảng 3,3 giờ giọng nói hoàn chỉnh trong trường hợp đầu tiên và khoảng 7,7 giờ trong trường hợp thứ hai.

Hai hệ quả rút ra ngay lập tức. Ngăn xếp phục vụ quan trọng hơn mô hình: cùng một checkpoint trên cùng một card sẽ tăng hơn gấp đôi đầu ra khi bạn đổi engine suy luận, vì vậy bất kỳ mô hình chi phí nào dùng con số 0,30 đều đang phóng đại chi phí tự vận hành của bạn lên khoảng 2,3 lần. Và mức độ sử dụng là tất cả: một card nằm không thì dù ở bất kỳ mức giá nào cũng không thắng nổi API tính theo ký tự, bởi hóa đơn của API tăng theo lượng bạn nói, còn hóa đơn của card tăng theo thời điểm bạn mua nó.
Đó là lý do vì sao phiên bản trung thực của quyết định này không phải là “cái nào nghe hay hơn”. Mà là “bạn sản xuất bao nhiêu giờ âm thanh mỗi tháng, và phần cứng có đang bận không”. Dưới mức khối lượng mà một card vẫn được nạp thường trực, API thắng và thắng không sát nút. Trên mức đó, trên phần cứng bạn đã sở hữu, chi phí biên của checkpoint cho mỗi phần nghìn giờ bằng chi phí của nó cho giờ đầu tiên — và đó là một lợi thế cấu trúc mà không bảng giá nào có thể sánh được.
Năng lực mà một endpoint được host sẽ không bán cho bạn
Đây là điểm mà phép so sánh không còn là một hình ảnh phản chiếu, bởi vì có một điều VoxCPM2 làm được mà Eleven v4 về cơ bản không thể làm: bạn có thể huấn luyện lại nó. Thẻ mô hình ghi rõ cả SFT đầy đủ lẫn tinh chỉnh LoRA chỉ với năm đến mười phút âm thanh, cùng tập lệnh huấn luyện và cấu hình được cung cấp cho mỗi cách.
Điều đó thay đổi hình dạng của một chương trình giọng nói. Một API được lưu trữ cho bạn một mô hình cố định cùng bất kỳ khả năng nhân bản nào mà nhà cung cấp cho phép truy cập — trong trường hợp của Eleven v4 là mười giây âm thanh tham chiếu để tạo bản sao tức thì, với một hạng chuyên nghiệp cao hơn ở phía trên. Một checkpoint có thể tinh chỉnh bằng LoRA cho bạn một mô hình chưa từng thấy dữ liệu của bất kỳ ai khác và có hành vi mà bạn có thể khóa theo phiên bản. Đối với giọng nói thương hiệu, một lĩnh vực được quản lý chặt chẽ, hoặc một ngôn ngữ mà dàn giọng của nhà cung cấp xử lý kém, đó là một loại giải pháp khác, chứ không phải một giải pháp rẻ hơn.
Sự đánh đổi này là rõ ràng và đáng để nói ra: với VoxCPM2, bạn chấp nhận rằng chưa từng có bên thứ ba nào chấm điểm mô hình, rằng các bảo đảm chất lượng là những thứ do chính bạn xây dựng và đo lường, và rằng giới hạn chuỗi 8.192 token cùng cảnh báo của chính thẻ mô hình — rằng thiết kế giọng nói và kiểm soát phong cách thay đổi giữa các lần chạy và rằng nên tạo từ một đến ba lần — giờ đây là vấn đề QA của bạn.
Điều mà Eleven v4 mang lại cho bạn mà checkpoint không thể.
Ngược lại, lợi thế của mô hình hosted nằm ở những thứ xuất hiện trên lịch phát hành chứ không phải trên bảng thông số kỹ thuật.
• Một thứ hạng được đo lường — đứng đầu trên một bảng xếp hạng với 1.674 mẫu đứng sau ước tính, cùng khoảng tin cậy rộng khoảng ±19 điểm quanh nó. Bất kể bảng xếp hạng đó đo lường điều gì, nó đều độc lập với cả hai nhà cung cấp và là tín hiệu chất lượng từ bên thứ ba duy nhất trong so sánh này.
• Hướng dẫn biểu diễn trong văn bản — các thẻ âm thanh nội tuyến như [cười], [thì thầm] và [nói giận dữ bằng giọng Pháp], cùng với các lời nhắc truyền đạt bằng ngôn ngữ tự nhiên và hỗ trợ Bảng phiên âm quốc tế được cải thiện. Muốn khiến một mô hình tự triển khai thay đổi cảm xúc thì phải tạo lại hoặc tinh chỉnh; ở đây, nó chỉ là một token trong kịch bản.
• Phạm vi bao phủ mà bạn không cần phải xác minh — hơn 90 ngôn ngữ so với 30 của VoxCPM2, kèm theo lưu ý rằng danh sách của checkpoint là tường minh và được nêu tên cụ thể (bao gồm cả các phương ngữ tiếng Trung) trong khi con số "hơn 90" của nhà cung cấp chỉ là một con số đếm không kèm danh sách.
• Không có bề mặt vận hành — không GPU, không ngăn xếp phục vụ, không trôi phiên bản, và mức giá khuyến mại $0,022 cho mỗi 1.000 ký tự đến ngày 12 tháng 10, so với giá niêm yết $0,08 sau đó.

Cả hai thứ này đều không phải của chúng ta, và đó chính là điểm của phần này.
OrcaRouter không lưu trữ mô hình nào trong hai mô hình này. Không có endpoint ElevenLabs và cũng không có endpoint VoxCPM2 trong danh mục của chúng tôi, và câu trả lời định tuyến trung thực là Eleven v4 được truy cập thông qua API riêng của ElevenLabs, còn VoxCPM2 là thứ bạn tự triển khai trên phần cứng của mình. Chúng tôi sẽ không ngụ ý điều gì khác chỉ để làm cho một so sánh trông gọn gàng hơn.
Điểm mà một khóa duy nhất thực sự hữu ích là quyết định trước quyết định. Lý do các cuộc thảo luận về tự vận hành bị đình trệ là vì phương án thay thế chưa bao giờ được đánh giá: một API chỉ là một lời gọi còn một checkpoint là cả một serving stack, nên API thắng theo mặc định thay vì thắng bằng tính toán. Đóng góp của OrcaRouter nằm ở chỗ nửa phần hosted của phép so sánh đó rất rẻ để kiểm thử — hơn 200 mô hình sau một API key duy nhất, với giá niêm yết của nhà cung cấp được chuyển nguyên ở mức markup 0%, nên phương án hosted được đánh giá theo mức giá thực của nó thay vì mức ước tính, cùng với chuyển đổi dự phòng tự động nếu bạn đặt một ứng viên phía sau một đường dẫn đang chạy trước khi bạn quyết định xong.
Làm thế nào để quyết định, chỉ trong một lượt
Chọn Eleven v4 nếu giọng nói phải đạt ngay trong lần thu đầu tiên và bạn muốn hoàn thành trong tuần này. Bạn có được vị trí dẫn đầu trên một bảng xếp hạng độc lập, một cú pháp chỉ dẫn được ghi lại thành tài liệu, số lượng ngôn ngữ được ghi nhận nhiều nhất trong so sánh này và không cần cơ sở hạ tầng. Bạn trả $0.08 cho mỗi 1.000 ký tự từ ngày 13 tháng 10 trở đi, và bạn chấp nhận rằng mình không thể huấn luyện lại nó, ghim phiên bản cho nó, hoặc giữ âm thanh trên phần cứng của riêng bạn.
Chọn VoxCPM2 nếu mô hình bắt buộc phải là của bạn. Apache 2.0, 2B tham số chạy trên khoảng 8 GB VRAM, đầu ra 48 kHz không có upsampler trong chuỗi xử lý, và một quy trình tinh chỉnh chỉ cần năm đến mười phút âm thanh — đó là những năng lực mà một endpoint được lưu trữ không cung cấp ở bất kỳ mức giá nào, và việc không có một dòng trên bảng arena chính là cái giá phải trả cho chúng. Hãy đo các số liệu thông lượng trên card của riêng bạn trước khi cam kết, vì các hệ số thời gian thực 0.30 và 0.13 là số đo của chính model card, và ngăn xếp phục vụ của bạn sẽ không tái tạo chúng một cách chính xác.
Và nếu câu trả lời trung thực là bạn không biết lượng âm thanh hàng tháng của mình, thì đó chính là con số bạn cần đi tìm. Nó quyết định sự so sánh này. Không bo mạch nào sẽ cho bạn biết đâu.
