Một thẻ tiêu đề hero ghi 'GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B' với phụ đề 'Hóa đơn tính theo phút hay một GPU 80 GB' và dòng '$0.05 một phút so với một bộ tăng tốc 80 GB', phía trên hai khung: khung bên trái hiển thị đường viền đám mây với mặt đồng hồ đo và biểu tượng đồng xu, khung bên phải hiển thị bo mạch tăng tốc máy chủ với biểu tượng chip và nhãn '80 GB VRAM', với logo OrcaRouter được ghép ở góc.
Guides & Insights

GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B: Hóa đơn theo phút hay một GPU 80 GB

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Việc lựa chọn giữa GPT-Live-1 và NVIDIA Nemotron VoiceChat 11B không phải là lựa chọn giữa hai mô hình giọng nói. Đó là lựa chọn giữa hai mô hình kinh doanh khoác lên mình bộ cánh mô hình giọng nói. GPT-Live-1 là một API được lưu trữ mà OpenAI đưa vào quyền truy cập dành cho nhà phát triển vào ngày 10 tháng 9 năm 2026, tính phí 0,05 USD mỗi phút âm thanh mà không cần đến phần cứng nào của bạn. NVIDIA Nemotron VoiceChat 11B — được công bố với tên NVIDIA-NemotronLabs-VoiceChat-11B, cùng một container NGC ghi ngày 21 tháng 7 năm 2026 và một checkpoint Hugging Face đi kèm — là một mô hình giọng nói song công toàn phần, trọng số mở, 11 tỷ tham số, sẽ không chạy trên bất cứ thứ gì dưới 80 GB GPU. Một trong hai thứ này khiến bạn tốn tiền theo từng phút hội thoại; thứ còn lại khiến bạn tốn tiền bất kể có ai gọi hay không.

Điểm hòa vốn đơn giản hơn so với những gì các bộ tài liệu thuyết trình của nhà cung cấp gợi ý

Bắt đầu với con số mà cả hai bên đều đồng ý. GPT-Live-1 ở mức $0.05 một phút là $3.00 cho một giờ đường dây mở liên tục. Đó là giá của một cuộc trò chuyện thoại luôn bật.

Giờ hãy định giá phương án thay thế. Nemotron VoiceChat 11B cần một GPU có ít nhất 80 GB VRAM — một card A100, H100, H200, B100, B200 hoặc thuộc lớp RTX 6000, chạy trên Linux. Thuê một trong số đó trên thị trường mở rơi vào mức vài đô la một giờ, còn sở hữu một card thì khấu hao thành con số tương tự sau khi tính đến mức sử dụng. Vậy một đường thoại luôn bật gần như hòa tiền: GPU thuê tốn khoảng bằng chi phí API, trước khi bạn phải trả tiền cho bất cứ thứ gì chạy trên đó.

Đó là phép so sánh sai, và đó cũng là chỗ mà hầu hết các bài viết về build-vs-buy đều dừng lại. Phép so sánh đúng là trên mỗi GPU, không phải trên mỗi dòng, và nó phụ thuộc vào một con số mà NVIDIA chưa công bố.

• GPT-Live-1 trên tài khoản Tier 1 — 25 phiên đồng thời, tức 1,25 đô-la một phút, hay 75 đô-la một giờ, khi cả 25 kênh đều hoạt động

• Nemotron VoiceChat 11B trên một GPU 80 GB — bất kể bao nhiêu phiên đồng thời mà một mô hình hybrid Mamba/Transformer 11B vừa trong 80 GB, với chi phí thuê xấp xỉ của card đó

Một mô hình 11B trên một bộ tăng tốc 80 GB là rất nhiều dư địa, và 80 GB là một yêu cầu mà trên thực tế đem lại rất nhiều năng lực xử lý theo lô. Nếu một card gánh được thậm chí sáu cuộc hội thoại đồng thời, thì tự vận hành rẻ hơn đáng kể so với API khi tải tối đa. Nếu nó gánh được một cuộc rưỡi, thì không. Cho đến khi ai đó đo hiệu năng mức đồng thời trên lưu lượng thật, quan điểm trung thực là điểm hòa vốn có khả năng nghiêng về việc tự vận hành ở quy mô lớn, và rằng cả hai nhà cung cấp đều chưa đưa cho bạn con số để chứng minh điều đó.

A two-column comparison scoreboard titled 'GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B - the scoreboard'. The GPT-Live-1 column lists Shape hosted API; Cost $0.05 / minute; Turn-taking 0.8 s, vendor-reported; Voices 12; Tool calling delegated to backend model; Ops burden none, vendor runs it. The Nemotron VoiceChat 11B column lists Shape open weights; Cost one 80 GB GPU, billed while idle; Turn-taking 448 ms on Full-Duplex-Bench 1.0; Voices 1 fixed voice, Aria; Tool calling in-session, separate output channel; Ops burden you run the GPU on Linux. A footer reads 'Nemotron turn-taking figure is a published benchmark; GPT-Live-1 latency is OpenAI's own and unreproduced.'

Ở nơi mô hình mở thực sự tốt hơn, chứ không chỉ rẻ hơn

Việc so sánh độ trễ xứng đáng được chú trọng kỹ hơn so với việc so sánh giá, vì trên khía cạnh này, mô hình mở có bằng chứng tốt hơn.

• Độ trễ chuyển lượt — Nemotron VoiceChat 11B báo cáo 448 ms cho việc chuyển lượt mượt mà trên Full-Duplex-Bench 1.0, với độ trễ ngắt và nhường là 480 ms và tỷ lệ chiếm lượt khi người dùng ngắt lời là 1.00. Con số của GPT-Live-1 là 0,8 giây, giảm từ 1,4, theo báo cáo của OpenAI.

Hãy đọc hai con số đó cạnh nhau cùng với nguồn dẫn kèm theo, và bức tranh sẽ đảo ngược. Các số liệu của NVIDIA đến từ một bộ đánh giá chuẩn đã được công bố, được đặc tả công khai. Còn của Ope​nAI đến từ Ope​nAI, so sánh mô hình mới của mình với thế hệ trước của chính mình, và chưa được tái lập một cách độc lập. Với bằng chứng hiện có, mô hình trọng số mở nhanh hơn một cách đo lường được ở chính khía cạnh khiến một tác nhân thoại trở nên giống người, còn mô hình chạy trên máy chủ chỉ nhanh hơn theo đúng tài liệu truyền thông của chính nó.

NVIDIA cũng tuyên bố một điều đầu tiên: Nemotron VoiceChat 11B được mô tả là mô hình song công toàn phần mở đầu tiên hỗ trợ gọi công cụ trong thời gian thực trong cuộc trò chuyện, sử dụng một kênh đầu ra riêng và các cụm từ giữ chỗ đặt trước để tác nhân có thể tiếp tục nói trong khi chờ API bên ngoài. Thẻ mô hình đi kèm ba mẫu âm thanh mời bạn lắng nghe đúng điều đó — luân phiên lượt tự nhiên được mô tả là phản hồi khoảng 450 ms, barge-in nơi mô hình nhường lời ngay lập tức, và các công cụ được gọi trực tiếp giữa cuộc trò chuyện. Những mẫu đó là của nhà cung cấp, và chúng củng cố con số 448 ms thay vì kiểm tra độc lập, nhưng ít nhất chúng là bằng chứng âm thanh gắn với một checkpoint có thể tải xuống chứ không phải một con số trong bài đăng ra mắt. Đó là cùng một vấn đề kiến trúc mà GPT-Live-1 giải quyết bằng ủy quyền, được trả lời theo cách khác — mô hình mở tự giữ đường dây; mô hình được lưu trữ chuyển nhiệm vụ cho một mô hình suy luận riêng và để lớp thoại giữ cuộc trò chuyện tiếp diễn.

Những điểm tương đồng cũng có sức gợi mở không kém những điểm khác biệt. Cả hai đều hoạt động song công toàn phần, nghĩa là cả hai vừa nghe vừa nói cùng lúc thay vì luân phiên theo lượt. Cả hai đều hỗ trợ ngắt lời và chen ngang. Cả hai đều được huấn luyện trên dữ liệu giọng nói ở quy mô khiến những pipeline ASR-rồi-LLM-rồi-TTS xếp tầng kiểu cũ trông như ba sản phẩm riêng biệt được gắn chắp nối lại với nhau — checkpoint của NVIDIA đã được huấn luyện trên khoảng 550.000 giờ giọng nói.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the openmdw-1.1 license tag, a model size of 11B params, 3,630 downloads last month, an inference-providers row stating the model isn't deployed by any Inference Provider, a model tree descending from NVIDIA-Nemotron-Nano-12B-v2-Base, three audio samples labelled natural turn-taking at roughly 450 ms response, barge-in where the model yields instantly, and tool calling live, and the description that NVIDIA NemotronLabs VoiceChat is an 11B end-to-end real-time speech full duplex model and the first open full-duplex model to support tool calling.

Điều bạn đánh đổi, và đó không chỉ là tiền bạc

Điều đầu tiên bạn phải từ bỏ với mô hình mở là giọng nói. Bản checkpoint được phát hành chỉ dùng một giọng cố định duy nhất, tên là Aria, và không hỗ trợ nhân bản giọng nói hay thư viện giọng nói. GPT-Live-1 cung cấp mười hai giọng trải khắp các accent, phương ngữ và ngôn ngữ khác nhau, và Ope​nAI đã remaster chúng riêng cho mô hình này. Nếu giọng nói của sản phẩm là một phần bản sắc của nó, hoặc nếu bạn cần phục vụ nhiều thị trường với những agent có giọng khác nhau chỉ từ một lần triển khai, thì riêng điều này gần như đã đủ để loại bỏ — và đây là hạn chế ít lộ ra nhất khi so sánh thông số kỹ thuật, vì nó trông giống một con số đếm tính năng hơn là một quyết định sản phẩm.

Điều thứ hai bạn phải từ bỏ là mức trần về ngữ cảnh. Mô hình mang một giới hạn phát ngôn trong thời gian huấn luyện khoảng 142 giây và một hạn chế thực tế về việc lưu giữ hơn khoảng hai phút ngữ cảnh âm thanh. Một cuộc gọi kéo dài hai mươi phút không phải là một ngữ cảnh liên tục đối với checkpoint này; nó là một chuỗi các đoạn mà hệ thống xung quanh phải quản lý. Các mô hình được host nói chung thường đảm nhiệm phần sổ sách đó cho bạn.

Điều thứ ba là những gì bạn được phép làm với nó. Thẻ mô hình Hugging Face mang giấy phép openmdw-1.1, trong khi một số bài viết về bản phát hành này mô tả nó là chỉ dùng cho nghiên cứu và trang container của NGC lại mô tả các thành phần là sẵn sàng cho mục đích thương mại hoặc phi thương mại. Ba nguồn, ba cách hiểu khác nhau, và chỉ văn bản giấy phép mới có hiệu lực chi phối. Sự khác biệt đó là kiểu vấn đề thường lộ ra trong một cuộc rà soát pháp lý ba tuần trước khi ra mắt. Hãy giải quyết nó trước khi bạn xây dựng, chứ không phải sau đó.

Điều thứ tư là vận hành. Một GPU 80 GB không phải là một mục chi phí mà bạn có thể tắt vào một ngày Chủ nhật yên ắng: ngay cả khi không có lưu lượng truy cập, bạn vẫn đang trả tiền cho card đó, và bạn phải tự chịu trách nhiệm về đường cong mở rộng, việc nâng cấp driver, lập kế hoạch dung lượng và lịch trực on-call cho một luồng âm thanh thời gian thực, nơi một kết nối bị ngắt nghĩa là một khách hàng bị mất. Cũng không có phương án dự phòng hosted nào để bạn dựa vào trong khi làm cho nó chạy được — dòng nhà cung cấp suy luận trên thẻ Hugging Face ghi rõ rằng mô hình không được bất kỳ nhà cung cấp suy luận nào triển khai, nên không có phiên bản trả tiền theo phút của checkpoint này để bạn phát triển nguyên mẫu dựa trên đó. Bạn phải tự host nó, nếu không thì đừng dùng nó. Công việc đó vô hình trong so sánh theo phút và rất hữu hình trên kế hoạch tuyển dụng.

Mô hình hybrid mà hầu hết các đội ngũ thực sự nên cân nhắc

Cách định hình giúp quyết định này trở nên khả thi là hai mô hình không nhất thiết phải là một lựa chọn nhị phân. Một tác nhân giọng nói thường có lớp giọng nói và lớp lý luận, và lớp lý luận chính là nơi có sự linh hoạt.

GPT-Live-1 được xây dựng theo cách này một cách có chủ đích. Lớp thoại của nó giữ cho cuộc trò chuyện luôn sống động trong khi phần suy nghĩ được giao phó thông qua Responses API cho một mô hình văn bản thông thường — ví dụ WebRTC đã công bố của chính Ope​nAI kết nối backend đó với GPT-5.6 Terra. Một nửa đó trong ngăn xếp của bạn là một lệnh gọi API thông thường, được tính giá theo token, với sự lựa chọn nhà cung cấp thực sự. GPT-5.6 Terra được phục vụ thông qua OrcaRouter ở mức $2.00 mỗi triệu token đầu vào và $12.00 mỗi triệu token đầu ra, với ngữ cảnh 1M token và cả /v1/chat/completions lẫn /v1/responses đều được cung cấp, nằm bên cạnh khoảng 190 mô hình khác có thể truy cập chỉ với một khóa duy nhất.

Điều đó đặc biệt quan trọng với một dự án tự vận hành, bởi vì nó thay đổi hồ sơ rủi ro. Nếu bạn dựng Nemotron VoiceChat 11B lên và nó không trụ nổi trước lưu lượng của bạn, thì nửa phần thoại là chi phí GPU chìm — nhưng nửa phần lý luận có thể được di chuyển, chuyển đổi dự phòng, hoặc tách ra giữa một mô hình rẻ cho những lượt hội thoại thường ngày và một mô hình mạnh cho các tình huống leo thang, mà không cần chạm đến đường âm thanh. Chuyển đổi dự phòng tự động giữa các nhà cung cấp thượng nguồn chính là khác biệt giữa một buổi chiều tồi tệ và một quý tồi tệ khi một phụ thuộc đơn nguồn gặp sự cố.

Lưu ý rõ ràng điều gì có và không có sẵn ở đâu: cả GPT-Live-1 lẫn Nemotron VoiceChat 11B đều không được OrcaRouter phục vụ. Cả hai đều đến từ nguồn gốc riêng của chúng — endpoint Live Sessions của OpenAI trong một trường hợp, GPU của chính bạn trong trường hợp còn lại. Lợi thế định tuyến hoàn toàn nằm ở hạ nguồn của âm thanh.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Xây dựng dựa trên cái nào

• Chọn GPT-Live-1 nếu bạn muốn ra mắt trong quý này, nếu bạn cần nhiều hơn một giọng nói, nếu các cuộc hội thoại của bạn thường kéo dài hơn hai phút ngữ cảnh liên tục, hoặc nếu lưu lượng chưa đủ cao để biện minh cho một GPU vẫn tính phí khi nhàn rỗi.

• Chọn NVIDIA Nemotron VoiceChat 11B nếu bạn đã vận hành GPU 80 GB, nếu bạn cần khả năng đối đáp theo lượt dưới 500 ms dựa trên bằng chứng thay vì lời khẳng định, nếu bạn cần âm thanh lưu trong hạ tầng của riêng mình vì lý do lưu trú dữ liệu, hoặc nếu bạn đang ở mức khối lượng cuộc gọi mà đồng hồ tính theo phút của API là dòng lớn nhất trên hóa đơn.

• Tạo nguyên mẫu trên API và chạy benchmark cho checkpoint. Quyết định phụ thuộc vào một con số chưa được công bố — số phiên đồng thời trên mỗi card 80 GB — và cách duy nhất để có nó là đo nó trên hình thái lưu lượng của chính bạn. Đó là một tuần làm việc, và nó là sự khác biệt giữa một quyết định hạ tầng có thể biện minh và một phỏng đoán được khoác lên vẻ ngoài của một quyết định.