Thẻ tiêu đề hero cho 'GPT-Live-1 vs VoxCPM2', với phụ đề 'Một cuộc trò chuyện đi thuê hay một GPU bạn sở hữu', kèm huy hiệu ghi 'Một cái là full duplex, một cái là text-to-speech - hai công việc khác nhau' và ba thẻ: 'GPT-Live-1 — 0,05 USD mỗi phút thoại, chỉ có API, không cần cài đặt gì', 'VoxCPM2 — Apache-2.0, 2 tỷ tham số, ~8 GB VRAM, không nhà cung cấp suy luận nào triển khai nó' và 'Thông lượng tự vận hành — khoảng 7,7 giờ âm thanh mỗi GPU-giờ ở RTF 0,13, 393.079 lượt tải trong 30 ngày qua', phía trên dải chân trang ghi 'Điểm chuẩn VoxCPM2 do OpenBMB báo cáo; các số liệu thoại của GPT-Live-1 do OpenAI báo cáo và chưa được tái lập.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Engineering & Research

GPT-Live-1 vs VoxCPM2: Một bên chỉ tốn 0,05 USD một phút, bên kia tốn một GPU 24 GB

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cách gọn gàng nhất để so sánh GPT-Live-1 với VoxCPM2 là nhận ra rằng chúng chỉ trông giống đối thủ cho đến khi bạn gắn một con số vào phần cứng. GPT-Live-1 là mô hình giọng nói song công hoàn toàn của OpenAI, có trong API từ ngày 10 tháng 9 năm 2026 với giá 0,05 USD mỗi phút giọng nói và không cần cài đặt gì. VoxCPM2 là mô hình chuyển văn bản thành giọng nói trọng số mở 2 tỷ tham số của OpenBMB, phát hành theo Apache 2.0 vào tháng 4 năm 2026, chạy trên khoảng 8 GB VRAM và không được nhà cung cấp suy luận nào triển khai — vì vậy nếu bạn muốn nó, bạn phải sở hữu cỗ máy. Một cái là cuộc trò chuyện bạn thuê theo giây; cái kia là một bộ tổng hợp bạn tự vận hành. Câu hỏi không phải là cái nào tốt hơn, mà là cái nào khối lượng công việc của bạn thực sự có thể hấp thụ.

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

Hai mô hình, hai nhiệm vụ, mỗi mô hình một dòng thông số trung thực.

• Chức năng — GPT-Live-1 thực hiện một cuộc hội thoại: nó vừa nghe vừa nói cùng lúc, luân phiên lượt, xử lý việc ngắt lời và phản hồi ngắn, rồi trả về bản chép lời. VoxCPM2 chuyển văn bản thành giọng nói. Nó không bao giờ nghe thấy gì cả.

• Truy cập — GPT-Live-1 được lưu trữ và đóng, nằm sau endpoint Live Sessions một model ID, với ví dụ tích hợp đã công bố chạy qua WebRTC. VoxCPM2 là một checkpoint có thể tải xuống trên Hugging Face và ModelScope, Apache 2.0, miễn phí cho mục đích thương mại.

• Giá — GPT-Live-1 là $0.05 mỗi phút thoại, tính phí theo từng giây, với backend ủy nhiệm được tính phí riêng. VoxCPM2 là $0 mỗi lượt gọi cộng thêm một GPU, và chi phí tổng thể chỉ nằm ở việc lưu trữ mã nguồn mở.

• Mức chiếm dụng tài nguyên — GPT-Live-1 không cần bất kỳ phần cứng nào của bạn. VoxCPM2 cần khoảng 8 GB VRAM (6–8 GB ở Q4), Python 3.10+, PyTorch 2.5+ và CUDA 12+.

• Điểm chuẩn — mọi số liệu giọng nói của GPT-Live-1 đều là của OpenAI, chưa được tái lập; bảng đánh giá độc lập duy nhất xếp nó thứ bảy trong số mười một. Các con số được công bố của VoxCPM2 là của OpenBMB, và những đo lường độc lập hiện có về các tuyên bố đa ngôn ngữ của nó lại cho thấy điều ngược lại.

Câu hỏi 24 GB, đã có giá

Các số liệu phục vụ của VoxCPM2 chính là thứ quyết định việc tự vận hành là một sở thích hay là cả một kiến trúc. Trên một chiếc RTX 4090 duy nhất, mô hình chạy với hệ số thời gian thực khoảng 0,30 trong PyTorch thuần và khoảng 0,13 với nhánh Nano-VLLM — nghĩa là tạo ra được khoảng 7,7 giờ âm thanh cho mỗi giờ thời gian GPU ở cấu hình nhanh hơn. Đó là những con số của chính model card chứ không phải một phép đo từ bên ngoài; một công thức phục vụ độc lập đã được kiểm chứng trên 4090 với CUDA 12.9 báo cáo các hệ số thời gian thực ở trạng thái ổn định khoảng 0,120 cho tổng hợp zero-shot và 0,139 cho nhân bản giọng nói, với bộ nhớ GPU đỉnh gần 22 GB trên 24 GB. Cả hai bộ số đều là trạng thái ổn định, không phải khởi động nguội — yêu cầu đầu tiên trong một tiến trình mới chậm hơn nhiều, và đó là con số người ta trích dẫn khi nói rằng mô hình không dùng được.

Đặt điều đó bên cạnh API. GPT-Live-1 với giá 0,05 đô la một phút là 3,00 đô la cho một giờ trò chuyện liên tục. Một card 24 GB thuê trên thị trường mở nằm ở mức vài đô la một giờ, và việc sở hữu một chiếc sẽ khấu hao thành khoảng tương tự khi đã tính đến mức độ sử dụng. Vậy nên phép so sánh đáp xuống đúng chỗ mà những phép so sánh kiểu này thường đáp xuống, với một điểm bất đối xứng khó chịu: hóa đơn GPU vẫn đến bất kể có ai nói chuyện với sản phẩm của bạn hay không, còn hóa đơn API co giãn về 0 vào một ngày vắng vẻ và lên tới năm chữ số vào một ngày bận rộn. Tổng hợp theo lô một danh mục cố định là sự phù hợp hoàn hảo cho GPU. Một đường dây điện thoại luôn bật là sự phù hợp hoàn hảo cho kiểu tính theo đồng hồ đo.

Điều VoxCPM2 làm được mà không một dự án mở nào khác làm được

Lý do VoxCPM2 đáng được chú ý đến vậy không phải là nó thắng các benchmark — phần lớn thì không — mà là nó thiết kế một giọng nói từ mô tả văn bản mà hoàn toàn không cần âm thanh tham chiếu. Đó là một năng lực thực sự mới trong các mô hình trọng số mở, và nó thay đổi quy trình làm việc cho bất cứ ai cần một giọng nói chưa tồn tại: thử giọng bằng văn xuôi, lặp lại bằng văn xuôi, rồi chỉ sau đó mới quyết định có nhân bản hay không. Bên cạnh đó, nó còn có thêm 30 ngôn ngữ cùng chín phương ngữ Trung Quốc, đầu ra 48 kHz qua một tầng siêu phân giải tích hợp, và khả năng tinh chỉnh chỉ với 5–10 phút âm thanh.

Cơ sở bằng chứng mỏng hơn danh sách tính năng. Báo cáo của chính OpenBMB đưa ra tỷ lệ lỗi từ tiếng Anh là 1,84% và tỷ lệ lỗi ký tự tiếng Trung là 0,97%, cùng mức lỗi trung bình 1,68% trên 30 ngôn ngữ, được đo trên bộ 500 phát ngôn mỗi ngôn ngữ của chính họ và được chấm điểm bằng mô hình của một nhà cung cấp khác. Ở nơi có một bài kiểm tra độc lập, khoảng cách rất lớn: trên bộ kiểm thử đa ngôn ngữ của MiniMax được chấm bằng Whisper-large-v3, tiếng Hindi ở mức 19,70 và tiếng Ả Rập ở mức 13,05 — tệ hơn gấp nhiều lần so với các con số do chính họ báo cáo. OpenBMB cũng cảnh báo rằng thiết kế giọng nói và điều khiển phong cách tạo ra kết quả thay đổi giữa các lần chạy và gợi ý nên tạo từ một đến ba lần để có được đầu ra mà bạn muốn, một cách nói kín đáo rằng chi phí mỗi lần gọi cho một kết quả dùng được không chỉ là một lần gọi.

Khoản "thuế tích hợp" mà không ai đưa vào bảng so sánh

Một chi tiết tầm thường quyết định liệu VoxCPM2 là một tuần làm việc hay cả một tháng. Kho lưu trữ Hugging Face của nó được gắn thẻ voxcpm thay vì transformers, nghĩa là thư viện mà gần như mọi thứ khác trên trang đó dùng để tải không thể nạp được mô hình này. Pull request để khắc phục điều đó được mở vào ngày 4 tháng 8 năm 2026 và vẫn chưa được hợp nhất vào lúc chúng tôi kiểm tra gần nhất. Các pull request để thêm nó vào những stack phục vụ khác đã được hợp nhất, và mức độ đón nhận thì không còn gì phải bàn: 393.079 lượt tải xuống trong ba mươi ngày qua tính đến thời điểm ghi nhận này, cùng với 27 adapter, 30 bản finetune, 12 bản lượng tử hoá và 100 Spaces được xây dựng dựa trên checkpoint.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

Cái giá tương đương của GPT-Live-1 là một cuộc viết lại tầng truyền tải. Các phiên của nó được xây dựng quanh một kết nối trực tiếp thay vì một endpoint âm thanh theo kiểu yêu cầu-phản hồi, và việc tính phí theo hai đồng hồ đo nghĩa là mọi lệnh gọi suy luận được ủy quyền, lệnh gọi công cụ và tìm kiếm web đều bị tính theo mức giá riêng của mô hình backend, cộng thêm trên phút thoại. Các nhóm chuyển đổi từ một tích hợp thời gian thực tính phí theo token nên dự trù việc chuyển đổi này như một nhiệm vụ kỹ thuật, chứ không phải chỉ là đổi ID mô hình.

Khi nào một lớp định tuyến thực sự hữu ích

OrcaRouter không cung cấp GPT-Live-1 lẫn VoxCPM2, và cần nói rõ điều đó thay vì để phần còn lại của mục này ngụ ý điều ngược lại. Lớp giọng nói của GPT-Live-1 nằm sau endpoint riêng của OpenAI; VoxCPM2 hoàn toàn không có nhà cung cấp dịch vụ lưu trữ nào. Cả hai đều không phải thứ bạn có thể gọi bằng khóa của chúng tôi.

Lý do câu hỏi về định tuyến vẫn còn được nhắc đến là vì cả hai mô hình đều nằm ở rìa của một pipeline mà khúc giữa là văn bản. Một triển khai VoxCPM2 thường phải đáp ứng một thứ gì đó — một trình tạo kịch bản, một bước dịch, một bộ chuẩn hoá văn bản, một mô hình đối thoại quyết định xem tiếp theo sẽ nói gì — và đó đều là những lệnh gọi mô hình thông thường. Một phiên GPT-Live-1 giao phó việc suy nghĩ của mình cho một mô hình backend được chỉ định trong cấu hình phiên, và theo tài liệu của chính OpenAI thì backend đó là GPT-5.6 Terra, vốn có sẵn qua OrcaRouter với mức giá niêm yết của OpenAI. Việc uỷ quyền phía máy khách còn đi xa hơn, cho phép ứng dụng của chính bạn cung cấp backend, nghĩa là mô hình đằng sau giọng nói có thể là bất kỳ endpoint nào bạn kiểm soát. Khoảng 190 mô hình từ mười một nhà cung cấp thượng nguồn nằm sau một khoá duy nhất ở giá niêm yết, không cộng thêm lợi nhuận — nên khi một nhà cung cấp cắt giảm giá, mức cắt đó có hiệu lực ngay tại đây trong cùng ngày chứ không phải chờ đến kỳ gia hạn — cùng với khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp và một DSL định tuyến để kết hợp nhiều mô hình vào một lệnh gọi. Một khoản bảo hiểm rẻ cho nửa phần của hệ thống thay đổi thường xuyên nhất.

Một lưu ý nên nằm trong phần này thay vì bị chôn vùi trong đó, vì đó là chi tiết khiến phần GPT-Live-1 của so sánh này kém chắc chắn hơn mức các benchmark của nhà cung cấp gợi ý. Trên Chỉ số Speech to Speech độc lập của Artificial Analysis, GPT-Live-1 đạt 69,8% — thứ bảy trong số mười một, sau GPT-Realtime-2.1 ở 73,9% và Gr​ok Voice Think Fast 2.0 ở 79,0%. Mô hình này là thứ rẻ nhất trên bảng đó tính theo mỗi giờ âm thanh đầu vào ở mức $4.42, và nó không phải là tốt nhất. Hãy dự trù cho khả năng rằng lớp giọng nói bạn chọn làm chuẩn không phải là lớp bạn sẽ giữ lại.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

Cái nào, để làm gì

Hãy chọn VoxCPM2 nếu văn bản có trước khi âm thanh xuất hiện. Thuyết minh, sách nói, lồng tiếng, trợ năng, lời thoại trong trò chơi, một sản phẩm cần giọng nói mà chưa ai thu âm — và đặc biệt là bất kỳ khối lượng công việc nào có sản lượng lớn, có thể dự đoán được và đáng để đầu tư một khoản chi phí vốn cố định. Hãy chấp nhận rằng bạn sẽ tự vận hành nó, rằng hệ thống công cụ xung quanh nó vẫn đang trong quá trình ổn định, và rằng những tuyên bố về chất lượng đa ngôn ngữ cần được chính bạn kiểm tra bằng cách nghe trước khi chúng đến tay khách hàng.

Hãy chọn GPT-Live-1 nếu đầu dây bên kia là một người. Tác nhân thoại, hỗ trợ qua điện thoại, luồng tiếp nhận, bất cứ thứ gì mà mô hình phải quyết định trong thời gian thực liệu người đó đã nói xong hay chưa. Hãy trả mức phí theo phút để có đặc quyền không phải ôm lấy vấn đề, và dự trù backend được giao phó thành một mục riêng, vì đó là nơi cuộc gọi trở nên rẻ hoặc đắt.

Sai lầm là coi chúng như những lựa chọn thay thế trong một cuộc so tài. Với hầu hết các đội cần cả hai, chúng là hai lớp của cùng một sản phẩm, và câu trả lời thực sự sai duy nhất là chọn phương án tự vận hành chỉ vì giấy phép ghi là miễn phí mà không định giá GPU – thứ khiến điều đó thành sự thật.