
GPT-Live-1 vs VoxCPM2: Một bên chỉ tốn 0,05 USD một phút, bên kia tốn một GPU 24 GB
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Cách gọn gàng nhất để so sánh GPT-Live-1 với VoxCPM2 là nhận ra rằng chúng chỉ trông giống đối thủ cho đến khi bạn gắn một con số vào phần cứng. GPT-Live-1 là mô hình giọng nói song công hoàn toàn của OpenAI, có trong API từ ngày 10 tháng 9 năm 2026 với giá 0,05 USD mỗi phút giọng nói và không cần cài đặt gì. VoxCPM2 là mô hình chuyển văn bản thành giọng nói trọng số mở 2 tỷ tham số của OpenBMB, phát hành theo Apache 2.0 vào tháng 4 năm 2026, chạy trên khoảng 8 GB VRAM và không được nhà cung cấp suy luận nào triển khai — vì vậy nếu bạn muốn nó, bạn phải sở hữu cỗ máy. Một cái là cuộc trò chuyện bạn thuê theo giây; cái kia là một bộ tổng hợp bạn tự vận hành. Câu hỏi không phải là cái nào tốt hơn, mà là cái nào khối lượng công việc của bạn thực sự có thể hấp thụ.

Hai mô hình, hai nhiệm vụ, mỗi mô hình một dòng thông số trung thực.
• Chức năng — GPT-Live-1 thực hiện một cuộc hội thoại: nó vừa nghe vừa nói cùng lúc, luân phiên lượt, xử lý việc ngắt lời và phản hồi ngắn, rồi trả về bản chép lời. VoxCPM2 chuyển văn bản thành giọng nói. Nó không bao giờ nghe thấy gì cả.
• Truy cập — GPT-Live-1 được lưu trữ và đóng, nằm sau endpoint Live Sessions một model ID, với ví dụ tích hợp đã công bố chạy qua WebRTC. VoxCPM2 là một checkpoint có thể tải xuống trên Hugging Face và ModelScope, Apache 2.0, miễn phí cho mục đích thương mại.
• Giá — GPT-Live-1 là $0.05 mỗi phút thoại, tính phí theo từng giây, với backend ủy nhiệm được tính phí riêng. VoxCPM2 là $0 mỗi lượt gọi cộng thêm một GPU, và chi phí tổng thể chỉ nằm ở việc lưu trữ mã nguồn mở.
• Mức chiếm dụng tài nguyên — GPT-Live-1 không cần bất kỳ phần cứng nào của bạn. VoxCPM2 cần khoảng 8 GB VRAM (6–8 GB ở Q4), Python 3.10+, PyTorch 2.5+ và CUDA 12+.
• Điểm chuẩn — mọi số liệu giọng nói của GPT-Live-1 đều là của OpenAI, chưa được tái lập; bảng đánh giá độc lập duy nhất xếp nó thứ bảy trong số mười một. Các con số được công bố của VoxCPM2 là của OpenBMB, và những đo lường độc lập hiện có về các tuyên bố đa ngôn ngữ của nó lại cho thấy điều ngược lại.
Câu hỏi 24 GB, đã có giá
Các số liệu phục vụ của VoxCPM2 chính là thứ quyết định việc tự vận hành là một sở thích hay là cả một kiến trúc. Trên một chiếc RTX 4090 duy nhất, mô hình chạy với hệ số thời gian thực khoảng 0,30 trong PyTorch thuần và khoảng 0,13 với nhánh Nano-VLLM — nghĩa là tạo ra được khoảng 7,7 giờ âm thanh cho mỗi giờ thời gian GPU ở cấu hình nhanh hơn. Đó là những con số của chính model card chứ không phải một phép đo từ bên ngoài; một công thức phục vụ độc lập đã được kiểm chứng trên 4090 với CUDA 12.9 báo cáo các hệ số thời gian thực ở trạng thái ổn định khoảng 0,120 cho tổng hợp zero-shot và 0,139 cho nhân bản giọng nói, với bộ nhớ GPU đỉnh gần 22 GB trên 24 GB. Cả hai bộ số đều là trạng thái ổn định, không phải khởi động nguội — yêu cầu đầu tiên trong một tiến trình mới chậm hơn nhiều, và đó là con số người ta trích dẫn khi nói rằng mô hình không dùng được.
Đặt điều đó bên cạnh API. GPT-Live-1 với giá 0,05 đô la một phút là 3,00 đô la cho một giờ trò chuyện liên tục. Một card 24 GB thuê trên thị trường mở nằm ở mức vài đô la một giờ, và việc sở hữu một chiếc sẽ khấu hao thành khoảng tương tự khi đã tính đến mức độ sử dụng. Vậy nên phép so sánh đáp xuống đúng chỗ mà những phép so sánh kiểu này thường đáp xuống, với một điểm bất đối xứng khó chịu: hóa đơn GPU vẫn đến bất kể có ai nói chuyện với sản phẩm của bạn hay không, còn hóa đơn API co giãn về 0 vào một ngày vắng vẻ và lên tới năm chữ số vào một ngày bận rộn. Tổng hợp theo lô một danh mục cố định là sự phù hợp hoàn hảo cho GPU. Một đường dây điện thoại luôn bật là sự phù hợp hoàn hảo cho kiểu tính theo đồng hồ đo.
Điều VoxCPM2 làm được mà không một dự án mở nào khác làm được
Lý do VoxCPM2 đáng được chú ý đến vậy không phải là nó thắng các benchmark — phần lớn thì không — mà là nó thiết kế một giọng nói từ mô tả văn bản mà hoàn toàn không cần âm thanh tham chiếu. Đó là một năng lực thực sự mới trong các mô hình trọng số mở, và nó thay đổi quy trình làm việc cho bất cứ ai cần một giọng nói chưa tồn tại: thử giọng bằng văn xuôi, lặp lại bằng văn xuôi, rồi chỉ sau đó mới quyết định có nhân bản hay không. Bên cạnh đó, nó còn có thêm 30 ngôn ngữ cùng chín phương ngữ Trung Quốc, đầu ra 48 kHz qua một tầng siêu phân giải tích hợp, và khả năng tinh chỉnh chỉ với 5–10 phút âm thanh.
Cơ sở bằng chứng mỏng hơn danh sách tính năng. Báo cáo của chính OpenBMB đưa ra tỷ lệ lỗi từ tiếng Anh là 1,84% và tỷ lệ lỗi ký tự tiếng Trung là 0,97%, cùng mức lỗi trung bình 1,68% trên 30 ngôn ngữ, được đo trên bộ 500 phát ngôn mỗi ngôn ngữ của chính họ và được chấm điểm bằng mô hình của một nhà cung cấp khác. Ở nơi có một bài kiểm tra độc lập, khoảng cách rất lớn: trên bộ kiểm thử đa ngôn ngữ của MiniMax được chấm bằng Whisper-large-v3, tiếng Hindi ở mức 19,70 và tiếng Ả Rập ở mức 13,05 — tệ hơn gấp nhiều lần so với các con số do chính họ báo cáo. OpenBMB cũng cảnh báo rằng thiết kế giọng nói và điều khiển phong cách tạo ra kết quả thay đổi giữa các lần chạy và gợi ý nên tạo từ một đến ba lần để có được đầu ra mà bạn muốn, một cách nói kín đáo rằng chi phí mỗi lần gọi cho một kết quả dùng được không chỉ là một lần gọi.
Khoản "thuế tích hợp" mà không ai đưa vào bảng so sánh
Một chi tiết tầm thường quyết định liệu VoxCPM2 là một tuần làm việc hay cả một tháng. Kho lưu trữ Hugging Face của nó được gắn thẻ voxcpm thay vì transformers, nghĩa là thư viện mà gần như mọi thứ khác trên trang đó dùng để tải không thể nạp được mô hình này. Pull request để khắc phục điều đó được mở vào ngày 4 tháng 8 năm 2026 và vẫn chưa được hợp nhất vào lúc chúng tôi kiểm tra gần nhất. Các pull request để thêm nó vào những stack phục vụ khác đã được hợp nhất, và mức độ đón nhận thì không còn gì phải bàn: 393.079 lượt tải xuống trong ba mươi ngày qua tính đến thời điểm ghi nhận này, cùng với 27 adapter, 30 bản finetune, 12 bản lượng tử hoá và 100 Spaces được xây dựng dựa trên checkpoint.

Cái giá tương đương của GPT-Live-1 là một cuộc viết lại tầng truyền tải. Các phiên của nó được xây dựng quanh một kết nối trực tiếp thay vì một endpoint âm thanh theo kiểu yêu cầu-phản hồi, và việc tính phí theo hai đồng hồ đo nghĩa là mọi lệnh gọi suy luận được ủy quyền, lệnh gọi công cụ và tìm kiếm web đều bị tính theo mức giá riêng của mô hình backend, cộng thêm trên phút thoại. Các nhóm chuyển đổi từ một tích hợp thời gian thực tính phí theo token nên dự trù việc chuyển đổi này như một nhiệm vụ kỹ thuật, chứ không phải chỉ là đổi ID mô hình.
Khi nào một lớp định tuyến thực sự hữu ích
OrcaRouter không cung cấp GPT-Live-1 lẫn VoxCPM2, và cần nói rõ điều đó thay vì để phần còn lại của mục này ngụ ý điều ngược lại. Lớp giọng nói của GPT-Live-1 nằm sau endpoint riêng của OpenAI; VoxCPM2 hoàn toàn không có nhà cung cấp dịch vụ lưu trữ nào. Cả hai đều không phải thứ bạn có thể gọi bằng khóa của chúng tôi.
Lý do câu hỏi về định tuyến vẫn còn được nhắc đến là vì cả hai mô hình đều nằm ở rìa của một pipeline mà khúc giữa là văn bản. Một triển khai VoxCPM2 thường phải đáp ứng một thứ gì đó — một trình tạo kịch bản, một bước dịch, một bộ chuẩn hoá văn bản, một mô hình đối thoại quyết định xem tiếp theo sẽ nói gì — và đó đều là những lệnh gọi mô hình thông thường. Một phiên GPT-Live-1 giao phó việc suy nghĩ của mình cho một mô hình backend được chỉ định trong cấu hình phiên, và theo tài liệu của chính OpenAI thì backend đó là GPT-5.6 Terra, vốn có sẵn qua OrcaRouter với mức giá niêm yết của OpenAI. Việc uỷ quyền phía máy khách còn đi xa hơn, cho phép ứng dụng của chính bạn cung cấp backend, nghĩa là mô hình đằng sau giọng nói có thể là bất kỳ endpoint nào bạn kiểm soát. Khoảng 190 mô hình từ mười một nhà cung cấp thượng nguồn nằm sau một khoá duy nhất ở giá niêm yết, không cộng thêm lợi nhuận — nên khi một nhà cung cấp cắt giảm giá, mức cắt đó có hiệu lực ngay tại đây trong cùng ngày chứ không phải chờ đến kỳ gia hạn — cùng với khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp và một DSL định tuyến để kết hợp nhiều mô hình vào một lệnh gọi. Một khoản bảo hiểm rẻ cho nửa phần của hệ thống thay đổi thường xuyên nhất.
Một lưu ý nên nằm trong phần này thay vì bị chôn vùi trong đó, vì đó là chi tiết khiến phần GPT-Live-1 của so sánh này kém chắc chắn hơn mức các benchmark của nhà cung cấp gợi ý. Trên Chỉ số Speech to Speech độc lập của Artificial Analysis, GPT-Live-1 đạt 69,8% — thứ bảy trong số mười một, sau GPT-Realtime-2.1 ở 73,9% và Grok Voice Think Fast 2.0 ở 79,0%. Mô hình này là thứ rẻ nhất trên bảng đó tính theo mỗi giờ âm thanh đầu vào ở mức $4.42, và nó không phải là tốt nhất. Hãy dự trù cho khả năng rằng lớp giọng nói bạn chọn làm chuẩn không phải là lớp bạn sẽ giữ lại.

Cái nào, để làm gì
Hãy chọn VoxCPM2 nếu văn bản có trước khi âm thanh xuất hiện. Thuyết minh, sách nói, lồng tiếng, trợ năng, lời thoại trong trò chơi, một sản phẩm cần giọng nói mà chưa ai thu âm — và đặc biệt là bất kỳ khối lượng công việc nào có sản lượng lớn, có thể dự đoán được và đáng để đầu tư một khoản chi phí vốn cố định. Hãy chấp nhận rằng bạn sẽ tự vận hành nó, rằng hệ thống công cụ xung quanh nó vẫn đang trong quá trình ổn định, và rằng những tuyên bố về chất lượng đa ngôn ngữ cần được chính bạn kiểm tra bằng cách nghe trước khi chúng đến tay khách hàng.
Hãy chọn GPT-Live-1 nếu đầu dây bên kia là một người. Tác nhân thoại, hỗ trợ qua điện thoại, luồng tiếp nhận, bất cứ thứ gì mà mô hình phải quyết định trong thời gian thực liệu người đó đã nói xong hay chưa. Hãy trả mức phí theo phút để có đặc quyền không phải ôm lấy vấn đề, và dự trù backend được giao phó thành một mục riêng, vì đó là nơi cuộc gọi trở nên rẻ hoặc đắt.
Sai lầm là coi chúng như những lựa chọn thay thế trong một cuộc so tài. Với hầu hết các đội cần cả hai, chúng là hai lớp của cùng một sản phẩm, và câu trả lời thực sự sai duy nhất là chọn phương án tự vận hành chỉ vì giấy phép ghi là miễn phí mà không định giá GPU – thứ khiến điều đó thành sự thật.
