
Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B: Giọng nói bạn không thể cấp phép, và giọng nói bạn không thể phát hành
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3055Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1653Trí tuệ69Lập trình60Toán
Hai trong số những mô hình giọng nói được bàn tán nhiều nhất năm 2026 có điểm chung mà không một bài đưa tin ra mắt nào sẽ nói cho bạn biết: bạn không thể đưa bất kỳ mô hình nào trong hai mô hình đó vào một sản phẩm.Sesame Preview là trợ lý tiêu dùng miễn phí mà giọng hội thoại của nó đã khiến TestingCatalog gọi nó là "một trong những chế độ giọng nói tốt nhất hiện có trên thị trường," và mô hình sản xuất đằng sau nó không có API, không có ID mô hình, và không có giấy phép nào để bạn có thể mua — công ty chỉ đơn giản là chưa phát hành nó.NVIDIA NemotronLabs VoiceChat 11B là hình ảnh phản chiếu: các trọng số được công khai, thiết kế song công toàn phần là một lần đầu tiên đích thực, và giấy phép ghi rõ chỉ dành cho mục đích nghiên cứu, vì vậy cũng không ai có thể phát hành nó một cách hợp pháp. Một bên là giọng nói bạn có thể nghe nhưng không thể thuê. Bên kia là giọng nói bạn có thể nắm giữ nhưng không thể bán. Đây là sự so sánh giữa hai cánh cửa bị khóa, và câu hỏi hữu ích là bạn đang đứng trước ổ khóa nào.
Hai cánh cửa bị khóa, với những ổ khóa khác nhau
{{1}}Hãy bắt đầu với hình dạng của từng sản phẩm, vì tên gọi che giấu sự khác biệt giữa hai sản phẩm.{{/1}} {{2}}Sesame Preview là một ứng dụng, không phải một API.{{/2}} {{3}}Nó đi kèm bốn tác nhân với tính cách riêng biệt — Maya (ấm áp và sáng tạo), Miles (thoải mái và sắc sảo), Simone (tò mò và thông thái), Charlie (hóm hỉnh và ấm áp) — mỗi tác nhân có giọng nói và bộ nhớ riêng, đồng bộ trên web và di động khi bạn đăng nhập.{{/3}} {{4}}Nó tìm kiếm trên web, đi sâu nghiên cứu, ghi chú và đặt lời nhắc, và gửi bản tóm tắt sau mỗi cuộc gọi.{{/4}} {{5}}Bản xem trước miễn phí, không có gói trả phí, chỉ hỗ trợ tiếng Anh, giới hạn tối đa 30 phút mỗi cuộc gọi khi đăng nhập (nếu không thì năm phút), và cố ý không thực hiện tác vụ: nó sẽ động não và nghiên cứu, nhưng sẽ không đặt vé máy bay cho bạn.{{/5}} {{6}}Không có khóa API nào trong sản phẩm — giọng nói production là một tính năng của ứng dụng, không phải một endpoint.{{/6}}

NVIDIA NemotronLabs VoiceChat 11B có hình dạng ngược lại: một checkpoint, không phải một sản phẩm. Nó xuất hiện trên Hugging Face vào ngày 3 tháng 8 năm 2026 mà không có thông báo nào — không có bài đăng ra mắt, không có báo cáo kỹ thuật, không có dòng tweet; thẻ mô hình chính là thông báo. Đây là mô hình giọng nói song công toàn phần {{1}}11B tham số{{/1}} (chúng tôi đã phân tích phần đầu tệp safetensors và đếm được {{2}}11,095 tỷ tham số{{/2}} trải trên {{3}}1.626 tensor{{/3}}) được xây dựng thành một khối thống nhất: một bộ mã hóa Fast Conformer xử lý âm thanh 16 kHz trong các khung 80 ms với {{4}}không có ngữ cảnh bên phải{{/4}}, một bộ xử lý nền {{5}}Nemotron Nano 9B v2{{/5}} đảm nhận việc suy luận, một bộ giải mã {{6}}NVIDIA TTS{{/6}} ghi âm thanh 22,05 kHz, một bộ giải mã RNN-T phiên âm người dùng, và một kênh đầu ra riêng biệt phát ra các tập lệnh gọi công cụ mà không làm ô nhiễm phản hồi nói. Nó nghe và nói cùng một lúc, có thể bị ngắt lời giữa chừng, và NVIDIA quảng bá đây là mô hình song công toàn phần mã nguồn mở đầu tiên có khả năng gọi công cụ. Liệu lời quảng bá đó có đứng vững trước thực tế hay không là chủ đề của phần riêng bên dưới.
Điểm chuẩn mà họ phân kỳ — hai ứng viên cho "cuộc trò chuyện hay nhất", hai tiêu chuẩn bằng chứng hỏng hóc.
Cả hai mô hình đều đặt toàn bộ danh tiếng của mình vào cùng một điều: chất lượng hội thoại — nhịp chuyển lượt, sự ngắt lời, thời điểm lên tiếng tự nhiên, cảm giác của một cuộc trao đổi thực thụ. Đó là lý do vì sao chúng xứng đáng xuất hiện chung trong một bài viết. Và đó cũng chính là nơi phép so sánh trở nên kỳ lạ, bởi không ứng viên nào có thể được chấm điểm một cách chính xác.
Sesame Preview không có bất kỳ con số nào. Mô hình sản xuất chưa được phát hành và không được niêm yết — không có ID mô hình, không có mục nào trên bảng xếp hạng chuyển giọng nói thành giọng nói của Artificial Analysis, không có mục tiêu độ trễ, không có bất kỳ điểm chuẩn nào. Nhận định “một trong những chế độ giọng nói tốt nhất hiện có trên thị trường” của TestingCatalog chỉ là sự đồng thuận của người đánh giá, không phải một phép đo, và không có cách nào để A/B mù nó với bất kỳ thứ gì. Mô hình Sesame duy nhất mà bất kỳ ai cũng có thể tự chạy là CSM-1B base trọng số mở, và đó là một checkpoint chuyển văn bản thành giọng nói, không phải giọng nói của ứng dụng.
NVIDIA NemotronLabs VoiceChat 11B lại gặp phải {{1}}vấn đề ngược lại{{/1}}: nó có số liệu, nhưng các con số bị phân tách giữa hai tiêu chuẩn bằng chứng không thống nhất với nhau. NVIDIA báo cáo mất 448 ms để hoàn thành một lượt nói mượt mà, 480 ms để nhường lượt khi bị ngắt lời, và tỷ lệ tiếp quản hoàn hảo 1.0 khi người dùng ngắt lời — tất cả đều do nhà cung cấp tự đo trên Full-Duplex-Bench 1.0 của chính NVIDIA, không có con số nào được tái lập độc lập. Các phép đo độc lập của dòng mô hình này được xếp dưới một tên gọi và mức tham số khác — "Nemotron 3 VoiceChat (V1)" ở 12B, một nhãn mà NVIDIA chưa từng đối chiếu với checkpoint 11B trên Hugging Face — và chúng không mấy tốt đẹp về mặt hiểu: 29.2% trên Big Bench Audio theo Artificial Analysis, so với 37.0% trên bảng điểm của chính NVIDIA. Trên VoiceBench, dòng mô hình này đạt 58.10, kết quả full-duplex mở tốt nhất trên bảng xếp hạng. Vì vậy, cùng một mô hình vừa dẫn đầu trong số các checkpoint full-duplex mở, vừa kém hơn khoảng ba lần so với các mô hình dẫn đầu thời gian thực dạng lưu trữ ở khả năng hiểu những gì nó nghe được.

Sự khác biệt, do đó, không nằm ở việc cái nào tốt hơn. Mà là hai ứng viên cho cuộc trò chuyện hay nhất năm 2026 đang bị đánh giá dựa trên những bằng chứng trái ngược và thiếu sót như nhau. Giọng nói mà các nhà đánh giá cho là nghe giống con người nhất lại không hề có phép đo nào, còn giọng nói có thứ hạng thực sự trên bảng xếp hạng lại là cái có những điểm yếu bị phơi bày công khai. Bạn không thể so sánh một danh tiếng với một con số, và ở đây chỉ có một con số duy nhất — và đó không phải là con số đẹp.
Truy cập — bản tải xuống từ cửa hàng ứng dụng, hoặc bản build 80 GB
Nếu bạn muốn thử một trong hai, điểm xuất phát khác nhau theo cách quan trọng hơn bất kỳ thông số kỹ thuật nào.
Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.
NVIDIA NemotronLabs VoiceChat 11B cũng không phải là một bản tải về mà bạn có thể chạy ngay — mà là một bản build bạn phải tự dựng lên. Hugging Face nêu rõ mô hình này "{{1}}không được triển khai bởi bất kỳ Nhà cung cấp suy luận nào{{/1}}"; NVIDIA chưa lưu trữ nó; và config.json trong kho lưu trữ là một cấu hình huấn luyện NeMo, nên không có checkpoint Transformers nào để bạn trỏ AutoModel vào. Cách thức được hỗ trợ là một môi trường conda được khóa ở Python 3.12, PyTorch 2.10 và Transformers 4.56, với causal-conv1d và mamba-ssm được biên dịch từ mã nguồn, trên GPU 80 GB (A100, H100, H200, B200 hoặc RTX 6000) chạy vLLM — hoặc container NGC NIM của NVIDIA, vốn cung cấp một {{2}}WebSocket tương thích Realtime của OpenAI tại /v1/realtime{{/2}} khi bạn đã có phần cứng đó. Bộ đếm lượt tải phản ánh câu chuyện truy cập: khoảng 80 lượt tải trong tháng đầu tiên của mô hình so với 107 lượt thích. Mọi người đã bookmark nó; gần như không ai chạy nó. Một lưu ý thẳng thắn cho nhà nghiên cứu nào thực sự chạy nó: xương sống suy luận mà checkpoint này được xây dựng trên, Nemotron Nano 9B v2, bản thân nó là một mô hình được lưu trữ mà bạn có thể gọi ngay hôm nay — còn mô hình song công toàn phần dựng quanh nó thì không, và khoảng cách đó chính là mấu chốt.

Giá — một ứng dụng miễn phí, tạ miễn phí, và hóa đơn 80 GB
Cả hai mô hình đều "miễn phí," và từ này gây hiểu lầm ở mức độ như nhau trong cả hai trường hợp.
Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.
Thước đo trung thực cho thời điểm một trong hai mô hình này có thể mua được: dù bạn chọn mô hình giọng nói lưu trữ nào, bạn nên trả đúng giá niêm yết của nhà cung cấp, không có phụ phí định tuyến nào cộng thêm — cơ chế chuyển tiếp giúp việc giảm giá của nhà cung cấp hiện lên trong hóa đơn của bạn ngay trong ngày thay vì phải chờ đến hết một chu kỳ hợp đồng. Không mô hình nào trong bài viết này có thể gọi được qua OrcaRouter: giọng nói sản xuất của Sesame hoàn toàn không có API, và NVIDIA NemotronLabs VoiceChat 11B không thể gọi qua bất kỳ thứ gì. Thước đo này dành cho giọng nói bạn thực sự có thể mua, và nó chính xác là tiêu chuẩn giúp dễ dàng định giá một cách trung thực một mức TTS cơ bản $7 mỗi triệu ký tự hoặc một API chất lượng Sesame trong tương lai.
Memory — ứng dụng ghi nhớ so với mô hình hay quên
Ở đây, khoảng cách là một hẻm núi, và đó là lý do cụ thể nhất khiến hai thứ này không thể thay thế cho nhau. Sesame Preview — ứng dụng ghi nhớ: mỗi agent có bộ nhớ riêng của chính mình, đồng bộ trên web và di động khi bạn đăng nhập, cuộc gọi có thể kéo dài tới 30 phút, và Incognito Mode đọc các ký ức trước đây mà không tạo ra ký ức mới. Ngược lại, CSM-1B mã nguồn mở có cửa sổ ngữ cảnh 4K — khoảng ba đến bốn phút văn bản — và dù sao cũng chẳng có tai để nghe bạn.
NVIDIA NemotronLabs VoiceChat 11B giữ tối đa khoảng hai phút ngữ cảnh âm thanh — bộ nạp dữ liệu huấn luyện giới hạn các phát ngôn ở mức 142.39 giây, và thẻ thông tin cảnh báo rằng cuộc trò chuyện vượt quá cửa sổ hai phút có thể không được lưu giữ. Đối với một cuộc gọi hỗ trợ cần nhớ những gì đã thống nhất bốn phút trước, mức trần đó tự nó đã là yếu tố loại trừ. Thêm vào một giọng nói cố định duy nhất (Aria) mà không có tính năng nhân bản giọng trong checkpoint được phát hành, và mô hình cởi mở về kiến trúc của nó cũng chính là mô hình không thể nhớ khách hàng hoặc thay đổi giọng nói của chính mình.
Điều mà từng cái thực sự tệ
Đã thu thập, vì một sự so sánh chỉ dừng lại ở điểm mạnh là tiếp thị:
• Sesame Preview: không có API — bạn không thể tích hợp giọng nói này vào sản phẩm, và mô hình sản xuất chưa được phát hành và chưa được chấm điểm. Chỉ hỗ trợ tiếng Anh, không thực hiện tác vụ, giới hạn cuộc gọi 30 phút, và không có bất kỳ benchmark độc lập nào. Mô hình mở duy nhất, CSM-1B, có cửa sổ ngữ cảnh 4K, không gọi công cụ, không có khả năng nghe, và không phải là giọng nói của ứng dụng.
• NVIDIA NemotronLabs VoiceChat 11B: giấy phép chỉ dành cho nghiên cứu (OpenMDW v1.1) — bạn có thể tải về, nghiên cứu và tinh chỉnh, nhưng không được phát hành, và bất kỳ ai xây dựng dựa trên nó cũng không được phép. Không có endpoint lưu trữ, nên "dùng thử" có nghĩa là cần GPU 80 GB và tự build từ mã nguồn. Chỉ hỗ trợ tiếng Anh, giới hạn bộ nhớ khoảng 2 phút, một giọng nói cố định. NVIDIA cho biết mô hình có thể kém hơn chính nền tảng của nó về kiến thức và khả năng làm theo chỉ dẫn, với suy luận nhiều bước và số học được đánh giá là yếu. Nó có thể ngắt lời giữa câu, suy giảm thành những lời lẽ vô nghĩa không thể khôi phục hoặc tự nói chuyện một mình sau vài lượt, bỏ sót từ trong bản phiên âm, và rõ ràng không phù hợp với những căn phòng ồn ào hoặc có tiếng vang. Việc gọi công cụ chỉ hoạt động với các lời nhắc và phản hồi chỉ chứa ASCII, tối đa năm công cụ mỗi phiên, và độ chính xác tham số (44.2%) cùng tỷ lệ thành công ngay lần đầu (33%) cho thấy mô hình chọn đúng công cụ đáng tin cậy hơn là điền tham số cho công cụ.
Ai nên chọn cái nào
Bởi vì cả hai đều không thể gọi được, câu trả lời trung thực bắt đầu từ những gì bạn đang cố gắng làm.
• Trải nghiệm giọng nói được đánh giá cao nhất năm 2026: Sesame Preview, miễn phí, ngay hôm nay — dưới dạng ứng dụng. Bốn tác nhân, khả năng xử lý ngắt lời, trải nghiệm chế độ lái xe mà các nhà đánh giá liên tục nhắc đến: đó là một sản phẩm tiêu dùng đúng nghĩa, và giá trị của nó chính là thứ bạn không thể đo đếm được.
• Nghiên cứu mô hình hóa giọng nói song công toàn phần: NVIDIA NemotronLabs VoiceChat 11B là bản tải xuống thú vị hơn trong danh mục của nó — một checkpoint mở 11B với kênh gọi công cụ hoạt động, khoảng 550.000 giờ âm thanh huấn luyện pha trộn, và kết quả VoiceBench song công toàn phần mở tốt nhất cho đến nay, tất cả với chi phí bằng không cho các trọng số. Giấy phép chỉ dành cho mục đích nghiên cứu không phải là ràng buộc đối với công việc đó.
• Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.
• Ra mắt sản phẩm giọng nói trong quý này:không phải lựa chọn nào trong số này. Bạn cần một mô hình chuyển đổi giọng nói sang giọng nói theo thời gian thực được lưu trữ (hosted) có giấy phép thương mại, và cách an toàn để áp dụng một mô hình mà bạn chưa sẵn sàng đưa vào sản xuất là định tuyến đến nó song song với một mô hình đã được kiểm chứng, có chuyển đổi dự phòng tự động, để một giọng nói chưa được kiểm chứng không bao giờ làm hỏng cuộc gọi trực tiếp. Một API duy nhất trên 200+ mô hình được lưu trữ với giá niêm yết của nhà cung cấp, không tính phí chênh lệch, chính là điều khiến việc thử một giọng nói mới chỉ là một thay đổi cấu hình chứ không phải viết lại toàn bộ.
Khuôn mẫu này đáng được đặt tên vì nó sẽ tái diễn. Cả hai mô hình này chỉ còn cách một sự kiện nữa là có thể gọi được — Sesame vào ngày họ phát hành ID mô hình hoặc API, NVIDIA NemotronLabs VoiceChat 11B vào ngày NVIDIA công bố giấy phép thương mại hoặc có ai đó lưu trữ nó. Khi điều đó xảy ra, nước đi đúng đắn không phải là dỡ bỏ ngăn xếp giọng nói hiện tại của bạn, mà là đặt giọng nói mới bên cạnh giọng nói cũ và định tuyến kèm khả năng chuyển đổi dự phòng, giống hệt như bạn vẫn làm với bất kỳ mô hình mới nào chưa được kiểm chứng. Đây là hai giọng nói chưa thể phát hành tốt nhất của năm 2026; hạ tầng để phát hành giọng nói thứ ba đã tồn tại sẵn rồi.
Điều gì sẽ thay đổi sự so sánh này?
Bốn sự kiện sẽ viết lại bài phân tích này. Một API hoặc ID mô hình cho giọng nói sản xuất của Sesame — ngay khi điều đó xảy ra, Sesame không còn là một ứng dụng mà trở thành ứng viên mà thị trường voice-API lưu trữ đang chờ đợi. Một giấy phép thương mại hoặc một điểm cuối lưu trữ (hosted endpoint) cho NVIDIA NemotronLabs VoiceChat 11B, điều này sẽ biến một sản phẩm nghiên cứu thành một lựa chọn sản phẩm thực sự chỉ sau một đêm. Một điểm đánh giá độc lập cho giọng nói Sesame — việc xuất hiện trên bảng xếp hạng speech-to-speech của Artificial Analysis sẽ giúp tuyên bố "giọng nói tốt nhất" có cơ sở để được kiểm chứng. Và một báo cáo kỹ thuật từ NVIDIA đối chiếu checkpoint 11B với các mục "Nemotron 3 VoiceChat (V1)" 12B mà các bảng xếp hạng đo lường, đây là điều kiện tiên quyết để tin tưởng bất kỳ con số nào của dòng mô hình này. Cho đến khi bất kỳ điều nào trong số đó xảy ra, tóm tắt chính xác rất đơn giản: hai giọng hội thoại thú vị nhất năm 2026 đều đang bị khóa — một bởi công ty không bán, một bởi giấy phép không được phát hành.
Câu hỏi thường gặp
Tôi có thể sử dụng giọng nói của một trong hai mô hình trong ứng dụng của riêng tôi không?
No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.
Thực sự thì trong hai cái đó, cái nào nghe giống con người hơn?
Không rõ, vì những lý do khác nhau cho từng cái. Sesame Preview hoàn toàn không có điểm số độc lập nào — việc TestingCatalog xem đây là "một trong những chế độ giọng nói tốt nhất trên thị trường" là sự đồng thuận của giới đánh giá, chứ không phải một phép đo. Nhịp hội thoại của NVIDIA NemotronLabs VoiceChat 11B (448 ms chuyển lượt nói, 480 ms nhường lời ngắt xen) do NVIDIA công bố và chưa được tái lập, còn chỉ số Big Bench Audio độc lập của nó (29,2%, theo Artificial Analysis, xếp mục "Nemotron 3 VoiceChat (V1)") đo lường khả năng hiểu, chứ không phải độ dễ chịu của giọng nói. Một cái có danh tiếng mà bạn có thể nghe thấy; cái còn lại có những con số trả lời một câu hỏi khác.
NVIDIA NemotronLabs VoiceChat 11B có thực sự miễn phí không?
Trọng số thì miễn phí; nhưng mô hình thì không hề rẻ. Chạy được nó cần một GPU 80 GB (khoảng 2–3 đô la mỗi giờ nếu thuê theo nhu cầu, 1.500–2.200 đô la mỗi tháng nếu giữ chạy liên tục) và phải tự build từ mã nguồn, và giấy phép OpenMDW v1.1 chỉ giới hạn cho mục đích nghiên cứu — nên ngay cả sau khi chi bộn tiền, bạn vẫn không thể hợp pháp đưa nó ra phục vụ khách hàng.
