
Gemini 3.8 TTS vs VoxCPM2: Thuê một giọng nói hay tự vận hành một giọng nói, bằng những con số thực tế
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Không có dòng bảng xếp hạng nào đặt Gemini 3.8 Flash TTS và VoxCPM2 cạnh nhau, và chính sự vắng mặt đó là dữ kiện hữu ích nhất trong phép so sánh này. Gemini 3.8 Flash TTS là một endpoint được lưu trữ với Elo 1.260 ở vị trí thứ 2 trên Artificial Analysis Provider Voice Arena cùng bảng giá được công bố tính theo token. VoxCPM2 là một checkpoint của OpenBMB — 2 tỷ tham số, Apache 2.0, phát hành tháng 4 năm 2026 — mà không nhà cung cấp suy luận nào lưu trữ. Bạn không thể thuê nó. Bạn phải tự chạy nó.
Vậy nên câu hỏi không phải là mô hình nào nghe hay hơn. Mà là liệu khối lượng công việc của bạn được phục vụ tốt hơn khi trả tiền theo ký tự cho GPU của người khác, hay khi sở hữu GPU và trả tiền cho chúng dù chúng có đang hoạt động hay không. Đó là một câu hỏi số học, và khác với hầu hết các so sánh mô hình, nó có một câu trả lời mà bạn có thể tính toán trước khi đưa ra quyết định.

Một trong hai cái này bạn thuê, cái kia bạn vận hành.
Hãy bắt đầu với những gì mỗi thứ thực sự mang lại cho bạn.
• Truy cập — Gemini 3.8 Flash TTS chỉ có qua API, được gọi thông qua Gemini API và các bề mặt Google được nêu trong thông báo ngày 23 tháng 9 năm 2026 của nó. VoxCPM2 không có endpoint first-party nào đang được dùng trong sản xuất và không có nhà cung cấp suy luận nào phục vụ nó; bản checkpoint chính là sản phẩm.
• Giấy phép — VoxCPM2 được phát hành theo Apache 2.0, cho phép sử dụng thương mại mà không cần thỏa thuận riêng. Đó là một giấy phép thực sự thông thoáng, và nó không phải là mặc định cho các trọng số giọng nói mở, một số trong đó được phát hành theo các điều khoản chỉ dành cho nghiên cứu, khiến việc sử dụng thương mại phải quay lại thông qua một API được lưu trữ.
• Kích thước — VoxCPM2 có 2 tỷ tham số và vừa trong khoảng 8 GB VRAM ở độ chính xác giảm để phát triển, với đỉnh phục vụ khoảng 22 GB trên card 24 GB. Google chưa công bố số lượng tham số cho cả hai mô hình Gemini 3.8 TTS.
• Tạo giọng nói — Gemini 3.8 Flash TTS thực hiện thiết kế giọng nói từ mô tả bằng văn bản, nhân bản giọng nói từ mẫu 30 giây, và hội thoại hai người nói trong một lần gọi. VoxCPM2 là mô hình chuyển văn bản thành giọng nói một giọng; một cuộc hội thoại là hai lần chạy được ghép lại.
• Điểm số độc lập — Flash TTS có một. VoxCPM2 không xuất hiện trong các hàng được xếp hạng trên Provider Voice Arena được ghi nhận vào ngày 24 tháng 9 năm 2026. Việc vắng mặt trên một bảng xếp hạng không phải là phán quyết về chất lượng — thông thường điều đó có nghĩa là chưa có ai đưa mô hình vào — nhưng nó đồng nghĩa với việc không có con số ưu tiên của bên thứ ba để cân nhắc.

Điểm cuối cùng đó có ý nghĩa theo cả hai hướng và đáng được nói thẳng ra thay vì nói lấp lửng: nếu bạn cần một tín hiệu chất lượng độc lập trước khi cam kết, chỉ một trong hai cái này cung cấp được điều đó.
Con số quyết định: hệ số thời gian thực
Tự host một mô hình giọng nói biến hóa đơn tính theo ký tự thành hóa đơn tính theo giờ GPU, và tỷ giá quy đổi giữa hai đơn vị đó chính là hệ số thời gian thực của mô hình — số giây tính toán cần để tạo ra một giây âm thanh.
Các con số được công bố của VoxCPM2 là 0,30 trong PyTorch thuần và 0,13 dưới Nano-VLLM. Hãy hiểu những con số đó là thông lượng chứ không phải độ trễ: ở mức 0,13, một giờ GPU thời gian thực tạo ra lượng âm thanh hoàn chỉnh vào khoảng 7,7 giờ. Ở mức 0,30, cùng một giờ GPU tạo ra gần 3,3 giờ. Đây là những con số của chính thẻ mô hình, được OpenBMB đo lường, và chúng là đầu vào quan trọng nhất cho bất kỳ quyết định tự xây dựng hay mua lại nào ở đây.
Ba điều rút ra từ chúng.
• Ngăn xếp phục vụ quan trọng hơn cả mô hình. Chuyển từ PyTorch thuần sang Nano-VLLM giúp tăng hơn gấp đôi thông lượng trên cùng một phần cứng. Bất kỳ mô hình chi phí nào xây dựng trên con số 0,30 đều phóng đại chi phí tự vận hành lên khoảng 2,3 lần.
• Mức độ tận dụng là tất cả. Một GPU thuê mà nằm không 90% thời gian thì dù giá thế nào cũng không rẻ hơn API. Điểm hòa vốn chỉ xuất hiện khi bạn giữ cho card luôn bận rộn.
• Gom lô lại một lần nữa thay đổi bài toán. Hệ số thời gian thực được đo trên từng luồng; một máy chủ xử lý các yêu cầu đồng thời sẽ phân bổ chi phí cố định cho chúng, và đó chính xác là bối cảnh mà việc tự vận hành bắt đầu chiếm ưu thế.
Một giờ âm thanh tốn bao nhiêu, theo cả hai chiều
Đặt hai mô hình tính phí trên cùng một trục. Một giờ âm thanh thành phẩm là 3.600 giây đầu ra.
Về phía thuê, Google tính phí theo token thay vì ký tự: 0,50 USD cho mỗi triệu token văn bản đầu vào và 9,00 USD cho mỗi triệu token âm thanh đầu ra đến hết ngày 31 tháng 12 năm 2026, sau đó là 18,00 USD; Flash-Lite TTS là 0,50 USD và 6,00 USD, sau đó là 12,00 USD. Batch và Flex áp dụng mức 0,25 USD và 4,50 USD cho Flash TTS so với 0,25 USD và 3,00 USD cho Flash-Lite TTS, còn Priority áp dụng mức 0,90 USD và 16,00 USD. Artificial Analysis chuẩn hóa mức giá tiêu chuẩn thành 16,50 USD và 11,00 USD mỗi triệu ký tự, đây là cách quy đổi của bảng xếp hạng chứ không phải báo giá của Google, và đó là con số cần dùng khi so sánh với một mô hình tính phí theo ký tự.
Ở phía tự sở hữu, hoàn toàn không có mức giá theo ký tự. Chi phí là giờ GPU, nhân với số giờ bạn cần ở mức thông lượng nêu trên, cộng với ngăn xếp phục vụ, cộng với đội ngũ vận hành nó. Lợi thế của VoxCPM2 là chi phí biên của giờ thứ một nghìn cũng bằng giờ đầu tiên — và nhược điểm của nó là chi phí biên của giờ đầu tiên là một GPU.
Đó là lý do khiến quyết định này trở nên rõ ràng một cách bất thường:
• Dưới một mức khối lượng nhất định, API thắng và thắng không hề sát nút. Bạn đang trả mức chỉ ở hàng đơn vị đô-la cho mỗi giờ âm thanh, so với chi phí vốn, và mức giá khuyến mại của Google càng nới rộng khoảng cách đó cho đến ngày 1 tháng 1 năm 2027.
• Trên ngưỡng khối lượng đó, với phần cứng bạn đã sở hữu và có thể duy trì hoạt động, checkpoint Apache 2.0 thắng áp đảo — và không giống như checkpoint được cấp phép cho nghiên cứu, không có gì trong giấy phép ngăn bạn phát hành nó.
• Ở giữa, câu trả lời trung thực là bạn đang mua quyền lựa chọn chứ không phải tiết kiệm. Tự vận hành mang lại khả năng ghim một phiên bản, giữ âm thanh trên hạ tầng của chính bạn và không còn phải bận tâm về việc nhà cung cấp thay đổi mức giá.
Trong đó mỗi cái là câu trả lời đúng
Chọn Gemini 3.8 Flash TTS khi bạn muốn sản phẩm được tài liệu hóa tốt hơn. Nó có điểm số độc lập, mức giá được công bố, hội thoại hai người nói trong một lần gọi, thiết kế và nhân bản giọng nói, và không có bề mặt vận hành nào ngoài một khóa API. Flash-Lite TTS cùng dòng mang đến cho bạn một mức giá thứ hai trong cùng giao diện ở mức chuẩn hóa 11,00 USD mỗi triệu ký tự. Điều bạn phải chấp nhận để đổi lại là mức giá tăng gấp đôi vào ngày 1 tháng 1 năm 2027 và việc không thể chạy mô hình ở bất cứ đâu.
Chọn VoxCPM2 khi phần việc vận hành mới là điểm mấu chốt. Apache 2.0 nghĩa là việc sử dụng thương mại được cho phép hoàn toàn, kích thước 2B nghĩa là chỉ một accelerator là đủ, và hệ số thời gian thực 0.13 dưới Nano-VLLM nghĩa là một card khiêm tốn tạo ra vài giờ âm thanh mỗi giờ đồng hồ thực. Điều bạn chấp nhận là không ai khác sẽ vận hành nó thay bạn: không có endpoint được host, không có dòng arena, không có bảng giá nhà cung cấp, và mọi đảm bảo chất lượng bạn có đều là thứ bạn tự xây dựng và đo lường.

Cả hai mô hình đều không được OrcaRouter lưu trữ, và điều đó đáng để nói thẳng ra thay vì ngụ ý ngược lại. Nơi để gọi Gemini 3.8 Flash TTS là API của chính Google cùng những bề mặt mà Google đã nêu tên; VoxCPM2 là một checkpoint do bạn tự triển khai. Điều OrcaRouter đảm nhiệm là lớp nằm phía trên quyết định đó — hơn 200 mô hình sau một khóa duy nhất tại giá niêm yết của nhà cung cấp mà không cộng thêm, nên khi nhà cung cấp thay đổi giá thì phía chúng tôi cập nhật ngay trong cùng ngày thay vì đợi đến kỳ thanh toán tiếp theo, chuyển đổi dự phòng tự động để một mô hình đang được đánh giá không bao giờ phải trở thành phụ thuộc cho môi trường production, cùng một DSL định tuyến giúp ghép nhiều mô hình vào một lệnh gọi khi một giọng đơn lẻ không đảm đương nổi toàn bộ công việc.
Xem gì tiếp theo
Hai điều sẽ thay đổi đáng kể sự so sánh này, và cả hai đều chưa xảy ra.
Đầu tiên là việc có ai đó đang host VoxCPM2. Việc nó vắng mặt trên thị trường suy luận là lý do chính khiến hai mô hình được so sánh về kinh tế thay vì chất lượng — nếu một nhà cung cấp nhận nó, bài toán thuê-so-với-sở-hữu sẽ không còn là yếu tố quyết định nữa, và dòng còn thiếu trên arena sẽ trở thành thứ bạn muốn được điền vào.
Điều thứ hai là thay đổi giá vào tháng Một từ phía Google. Ở mức giá khuyến mãi, API đủ rẻ đến mức hầu hết các khối lượng công việc không nên tự vận hành bất cứ thứ gì; ở mức giá sau khuyến mãi, khoảng cách thu hẹp đến mức một đội ngũ đã có năng lực GPU sẵn có và khối lượng ổn định nên tính toán lại các con số thay vì mặc định rằng API vẫn chiếm ưu thế.
Cho đến khi một trong những điều đó thay đổi, yếu tố đầu vào quyết định không phải là bảng xếp hạng. Mà là số giờ âm thanh bạn sản xuất mỗi tháng, và liệu card có đang bận hay không.
