Thẻ hero được tạo tự động có tiêu đề 'HeyGen Voice vs Sesame Preview', đối chiếu một API giọng nói đã được tài liệu hóa, mang điểm Elo đo lường được, với một bản demo dành cho người dùng phổ thông không có endpoint công khai, được đánh dấu bằng ngày 9 tháng 10 năm 2026 của Artificial Analysis. Logo OrcaRouter xuất hiện ở góc dưới cùng bên phải.
Guides & Insights

HeyGen Voice vs Sesame Preview: Giọng nói bạn có thể mua đối đầu với giọng nói bạn chỉ có thể trò chuyện cùng

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây không phải là một so sánh mô hình, và giả vờ rằng nó là như vậy sẽ là sai lầm thực sự duy nhất có thể mắc phải ở đây. HeyGen Voice là một engine API — xếp hạng nhất trên đấu trường Controlled Voice của Artificial Analysis với 1.202 Elo, được cung cấp qua các endpoint v3 của HeyGen, bán theo credit, có thể nhân bản chỉ từ một bản ghi âm duy nhất. Sesame Preview là một trợ lý giọng nói tiêu dùng miễn phí mà bạn truy cập bằng cách mở một trang web và nói chuyện với một trong bốn nhân vật có tên, không có endpoint công khai, không có mã định danh mô hình và không có mức giá nào để thuê nó. Một trong hai thứ đó bạn có thể đưa vào sản phẩm. Thứ còn lại là lý do bạn biết một giọng hội thoại hay nghe như thế nào, và không bao giờ là thứ bạn triển khai.

Thực tế mỗi thứ là gì

Sesame Preview là một bản trình diễn về lời nói hội thoại. Bạn truy cập nó thông qua trang web của chính công ty, bạn trò chuyện với Maya, Miles, Simone hoặc Charlie, và trải nghiệm này được cố ý tối ưu hóa cho sự thân thiện và khả năng biểu đạt — công ty nói rõ điều đó khi mô tả lý do những người bạn đồng hành hành xử theo cách chúng làm. Hiện tại nó chỉ hỗ trợ tiếng Anh, với việc nhóm lưu ý rằng khả năng đa ngôn ngữ xuất hiện một cách ngẫu nhiên từ ô nhiễm dữ liệu và "chưa hoạt động tốt," và rằng việc mở rộng ra ngoài hai mươi ngôn ngữ là kế hoạch trong tương lai. Cách công ty tự định vị vẫn đang trong quá trình hoàn thiện: "Chúng tôi vẫn chưa đến được đó."

Bên dưới bản demo là Conversational Speech Model, một kiến trúc đa phương thức văn bản và giọng nói được xây dựng từ hai transformer kiểu Llama tự hồi quy. Nó có ba kích cỡ — Tiny với backbone 1B và decoder 100M, Small ở 3B và 250M, Medium ở 8B và 300M — mỗi mô hình được huấn luyện ở độ dài chuỗi 2.048 token, tương đương khoảng hai phút âm thanh, trong năm epoch trên khoảng một triệu giờ giọng nói chủ yếu là tiếng Anh. Các thành phần nghiên cứu chính được mở mã nguồn theo Apache 2.0, và có một kho GitHub dành cho chúng. Bản demo — thứ mà mọi người thực sự ca ngợi — không phải thứ đó. Bản demo không có API công khai.

HeyGen Voice là cách sắp đặt ngược lại. Không có ứng dụng tiêu dùng miễn phí để thử; chỉ có một API được ghi tài liệu với danh mục giọng nói, một điểm cuối tổng hợp giọng nói, các đường dẫn nhân bản giọng và một hóa đơn. Điều bạn không thể làm là mở nó trong trình duyệt và trò chuyện với nó tùy hứng.

Vậy tại sao hai thứ đó lại được đem ra so sánh với nhau chứ?

Chúng được đem ra so sánh với nhau vì cả hai đều được dùng làm bằng chứng rằng giọng nói tổng hợp đã vượt qua một ngưỡng nào đó. Sesame Preview đã đặt lại kỳ vọng về việc âm thanh hội thoại có thể nghe như thế nào — những phản ứng khi nó ra mắt xoay quanh việc nó nghe giống một con người đến mức nào thay vì giống một cỗ máy chuyển văn bản thành giọng nói. Điểm 1,202 của HeyGen Voice trên bảng xếp hạng có kiểm soát là cùng một tuyên bố ở dạng số: vị trí thứ nhất trong số bốn mươi hai mục khi mọi mô hình đều nói bằng cùng tám giọng tham chiếu được nhân bản.

Điểm khác biệt nằm ở việc bạn có thể làm gì với tuyên bố đó về sau. Một vị trí trên bảng xếp hạng có thể tái lập, có thể kiểm chứng và gắn với một endpoint. Một ấn tượng từ bản demo thì không có bất kỳ điều nào trong số đó — và quan trọng là, Sesame Preview hoàn toàn không xuất hiện trên bảng xếp hạng được kiểm soát, nên không có Elo nào để so với mức 1.202. Phép so sánh mà mọi người muốn thực hiện là không thể có, không phải vì Sesame đã thua nó mà vì mô hình chưa từng được đưa vào.

Bảng tỷ số

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Elo Giọng nói được Kiểm soát — Giọng HeyGen: 1.202, #1 trong 42. Sesame Preview: không có trong danh sách.

• Truy cập — HeyGen Voice: API v3 đã được ghi tài liệu, POST /v3/voices/speech. Sesame Preview: ứng dụng web dành cho người tiêu dùng và ứng dụng iOS; không có endpoint công khai.

• Giá — HeyGen Voice: $30.00 cho 1 triệu ký tự theo cách quy đổi giá tín dụng của chính arena; HeyGen không công bố đơn giá cho giọng nói. Sesame Preview: miễn phí và không thể mua với bất kỳ mức giá nào.

• Chọn giọng nói — HeyGen Voice: hơn 300 giọng nói dựng sẵn, thiết kế giọng nói bằng mô tả văn bản, nhân bản tức thì và chuyên nghiệp. Sesame Preview: bốn nhân dạng cố định.

• Ngôn ngữ — HeyGen Voice: "hàng chục ngôn ngữ", số lượng chưa được công bố. Sesame Preview: chỉ tiếng Anh, với hỗ trợ đa ngôn ngữ hiện đang kém hiệu quả theo chính lời thừa nhận của công ty.

• Trọng số mở — HeyGen Voice: không có. Sesame Preview: CSM được phát hành theo giấy phép Apache 2.0 với các kích thước 1B, 3B và 8B.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

Chi tiết Apache 2.0 mới là điều quan trọng

Ẩn dưới phán quyết "không có API" là sự thật rằng Sesame đã mở mã nguồn mô hình nghiên cứu theo Apache 2.0 — một giấy phép thoáng, với ba kích cỡ, trong đó có biến thể 1B đủ nhỏ để chạy mà không cần trung tâm dữ liệu. Đó là một đề xuất thực sự khác biệt so với bản demo, và đó là con đường duy nhất để bất cứ thứ gì giống với giọng nói của Sesame Preview có thể xuất hiện trong một sản phẩm đã phát hành.

Có hai lưu ý để giữ cho điều này trung thực. Các thành phần CSM được phát hành là sản phẩm nghiên cứu: công ty lưu ý rằng các mô hình xử lý nội dung lời nói nhưng không xử lý cấu trúc hội thoại, và hướng tới các mô hình song công hoàn toàn như công việc trong tương lai — vì vậy các trọng số được phát hành không phải là trải nghiệm tương tác. Và một backbone 8B chạy cục bộ có cấu trúc chi phí khác với 19,30 đô la cho mỗi triệu ký tự suy luận trên máy chủ, mức giá mà đối thủ hàng đầu rẻ nhất trên đấu trường đang thu. Tự vận hành (self-hosting) không có hóa đơn theo từng ký tự, nhưng có một hóa đơn theo giờ GPU rất thực tế.

Đối với một builder, điều đó định hình lại câu hỏi. Nếu điều khiến bạn ấn tượng ở Sesame Preview là cuộc trò chuyện, thì trọng số mở không mang lại điều đó cho bạn. Nếu điều khiến bạn ấn tượng là chất lượng giọng nói của chính mô hình giọng nói, thì chúng có thể — và điều đó có thể kiểm chứng theo một cách mà bản demo thì không.

Việc ship trên HeyGen Voice trông như thế nào

Những khác biệt thực tế là những khác biệt thông thường. API của HeyGen nhận lựa chọn giọng nói, văn bản và tùy chọn tốc độ trong khoảng 0,5 đến 1,5 và cao độ trong khoảng ±50 nửa cung, với BCP-47 locale gợi ý. Giọng nói tùy chỉnh có ba cách: một lộ trình thiết kế dựa trên mô tả trả về tối đa ba lựa chọn được xếp hạng từ một lời nhắc giới hạn 1.000 ký tự, một bản sao tức thì từ một bản ghi âm, và một bản sao chuyên nghiệp được huấn luyện trên hai mươi phút hoặc hơn. Bộ lọc engine trên endpoint giọng nói cũng chấp nhận các engine không phải HeyGen, nên nền tảng không phải là một khu vườn có tường bao quanh mô hình của riêng nó.

Không có điều nào trong số đó tồn tại ở phía Sesame, và đó không phải là khuyết điểm của Sesame Preview — mà là bản chất của thứ này. Một bản demo được tối ưu hóa để cho thấy những gì có thể làm được thì không nên đi kèm SLA.

Tuy nhiên, hóa đơn chỉ là phần nhẹ nhàng hơn. HeyGen bán tín dụng — 600 với $29/tháng, 1.000 với $49, 1.500 với $149 — và nêu rằng mức tiêu thụ thay đổi theo mô hình, thời lượng và độ phức tạp, mà không công bố đơn giá giọng nói. Mức $30.00 mỗi triệu ký tự mà đấu trường liệt kê là cách quy đổi của Artificial Analysis từ những tín dụng đó, không phải báo giá từ HeyGen. Vậy nên mô hình bạn có thể đưa vào vận hành đã có giá, nhưng dựa trên phép tính của người khác — đó là lý do để thực hiện một cuộc thí điểm có đo lường thay vì chỉ trích công cụ.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

Thực sự nên làm gì với một bản demo mà bạn ngưỡng mộ

Động thái hữu ích là tách riêng hai thứ mà Sesame Preview trình diễn. Hành vi hội thoại — luân phiên lượt nói, ghi nhớ, cảm giác như đang nói chuyện với một ai đó — là sản phẩm của một hệ thống chưa được phát hành và không có endpoint. Chất lượng giọng nói là phần có trọng số Apache 2.0 đằng sau, và là phần bạn có thể đánh giá trên âm thanh của chính mình mà không cần xin phép bất kỳ ai.

Đối với mọi thứ ở khoảng giữa, lộ trình chuyển đổi là lộ trình tầm thường: triển khai trên một engine có API và có xếp hạng, và thiết kế sao cho việc áp dụng mô hình của Sesame, nếu nó có ngày nào đó được thương mại hóa, chỉ là một thay đổi cấu hình chứ không phải viết lại. Điều đó có nghĩa là phải có một lớp trừu tượng hóa trên nhà cung cấp giọng nói ngay từ ngày đầu — một giao diện, một khóa, engine được chọn qua cấu hình. Lớp định tuyến của OrcaRouter được xây dựng chính xác cho việc này: nhiều nhà cung cấp phía sau một endpoint duy nhất với giá niêm yết của nhà cung cấp, không cộng thêm phụ phí, tự động chuyển đổi dự phòng khi một nhà cung cấp bị đình trệ, và một DSL định tuyến cho phép bạn thay engine phía sau một giọng nói mà không cần chạm vào mã ứng dụng. Vấn đề không phải là nó lưu trữ một mô hình Sesame — nó không làm vậy — mà là vào ngày một giọng nói bạn ngưỡng mộ trở nên có thể mua được, chi phí để thử nó chỉ nên là một dòng trong tệp cấu hình.

Cú chốt trung thực

Sesame Preview không phải là đối thủ của HeyGen Voice và không nên được đánh giá như vậy. Đây là một bản trình diễn miễn phí, chỉ dùng tiếng Anh, gồm bốn persona, thứ tình cờ đã thiết lập lại kỳ vọng cho âm thanh hội thoại và tình cờ đã phát hành các trọng số nghiên cứu được cấp phép tự do ở ba kích cỡ. HeyGen Voice là engine xếp hạng cao nhất trên bảng xếp hạng giọng nói duy nhất giữ cố định giọng nói, được bán qua một API bạn có thể gọi ngay hôm nay, với mức giá bạn chưa thể tính được.

Nếu bạn cần một giọng nói có thể đưa ra thị trường trong quý này, quyết định không nằm giữa hai lựa chọn này — mà nằm giữa HeyGen Voice và những lựa chọn được định giá khác trên đấu trường. Nếu bạn đang chờ Sesame, hãy chờ trọng số, không phải ứng dụng.