Một thẻ hero được tạo có tiêu đề 'HeyGen Voice ra mắt ở vị trí số 1 trên Controlled Voice Arena' với dòng '1.202 Elo — dẫn trước Qwen-Audio-3.1-TTS-Plus và Eleven v4 Turbo' và ghi chú 'Cùng tám giọng tham chiếu được nhân bản — Artificial Analysis, ngày 9 tháng 10 năm 2026'. Logo OrcaRouter xuất hiện ở góc dưới cùng bên phải.
Guides & Insights

HeyGen Voice ra mắt ở vị trí số 1 trên Controlled Voice TTS Arena — Đánh bại Qwen và ElevenLabs về giọng nói nhân bản

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 9 tháng 10 năm 2026, Artificial Analysis đã thêm HeyGen Voice vào đấu trường Controlled Voice của mình và mô hình này đã vươn thẳng lên vị trí dẫn đầu. HeyGen Voice — mô hình chuyển văn bản thành giọng nói đầu tiên của HeyGen được đánh giá trên bảng — đạt 1.202 Elo, xếp trên Qwen-Audio-3.1-TTS-Plus với 1.186 và Eleven v4 Turbo của ElevenLabs với 1.167. Cartesia Sonic 3.6, mô hình đang dẫn đầu bảng Provider Voices mở của trang, đứng thứ năm ở đây với 1.143. Đó là một kết quả thực sự trên một bảng xếp hạng được xây dựng để loại bỏ yếu tố gây nhiễu lớn nhất trong đánh giá giọng nói, và đó cũng là một kết quả mang ý nghĩa rất cụ thể nhưng dễ bị diễn giải quá mức: HeyGen Voice là giọng nói tốt nhất trong đấu trường này trên tám giọng tham chiếu được nhân bản, chứ chưa phải là nhà vô địch đã được đo lường của bảng xếp hạng với chín mươi sáu mô hình.

Controlled Voice board đo lường những gì và vì sao điều đó quan trọng

Artificial Analysis vận hành hai bảng xếp hạng giọng nói và chúng trả lời những câu hỏi khác nhau. Đấu trường Provider Voices cho phép mỗi nhà cung cấp tự cung cấp giọng nói gốc của mình — những giọng demo chỉn chu mà một công ty chọn để đại diện cho chính mình — và xếp hạng các mô hình dựa trên mức độ hay của những giọng đó. Bảng xếp hạng của nó rộng và trưởng thành: chín mươi sáu mục, với Eleven v4 Turbo đứng đầu ở 1.328 Elo và Cartesia Sonic 3.6 đứng thứ tư ở 1.280.

Đấu trường Controlled Voice làm một việc hẹp hơn và, với bất kỳ ai đang tung ra sản phẩm, hữu ích hơn. Mọi mô hình trên đó đều tạo giọng nói từ cùng tám giọng đã được sao chép — bốn giọng Mỹ, bốn giọng Anh — nên phép so sánh không phải là "giọng marketing của ai hay hơn" mà là "mỗi engine xử lý cùng một giọng, cùng văn bản và cùng điều kiện ghi âm như thế nào." Đây là thứ gần nhất mà ngành có được với một phép thử so sánh tương đương (like-for-like) đối với chính engine thay vì cuốn demo reel, và đây là bảng xếp hạng quan trọng nếu bạn định sao chép một giọng nói rồi giao nó cho một mô hình TTS.

HeyGen Voice hiện dẫn đầu. Biên độ cách biệt là 16 Elo so với Qwen-Audio-3.1-TTS-Plus và 35 Elo so với Eleven v4 Turbo, với khoảng tin cậy 95% được báo cáo rơi vào khoảng 1,185 đến 1,219 trên con số của HeyGen. Mười sáu Elo là một khoảng cách thực sự nhưng không phải vực thẳm — trên một bảng xếp hạng dày đặc như thế này, đó là khác biệt giữa nhất và nhì, chứ không phải giữa dùng được và không dùng được.

A generated single-column scoreboard titled 'HeyGen Voice — the scoreboard' with rows reading 'Controlled Voice Elo: 1,202', '95% confidence interval: roughly 1,185 to 1,219', 'Rank in the controlled field: #1 of 42 ranked entries', 'Provider Voices Elo: not listed, insufficient votes', "Price on the arena's basis: $30.00 per 1M characters, derived from credit pricing" and 'Elo anchor: the board baseline is 1,000 points', with a footer reading 'Elo per Artificial Analysis, 9 October 2026. Price shown is the arena's conversion of credit pricing.' The OrcaRouter logo appears in the bottom-right corner.

Nơi HeyGen Voice chưa được xếp hạng

Điểm mấu chốt trung thực của kết quả này là HeyGen Voice hoàn toàn không xuất hiện trên bảng Provider Voices, và việc nó vắng mặt không phải là tín hiệu về chất lượng. Artificial Analysis lưu ý rằng các mô hình có thể bị bỏ sót vì chưa có đủ phiếu bầu. Một mô hình mới vài ngày tuổi, chỉ có một đấu trường được chấm điểm theo cách khác đằng sau nó, đơn giản là chưa tích lũy đủ lượng người nghe mù mà bảng lớn hơn yêu cầu.

Vậy cách hiểu đúng vào ngày 10 tháng 10 năm 2026 là: HeyGen Voice là giọng nói được xếp hạng hàng đầu trong so sánh giọng nói nhân bản có kiểm soát, và là một ẩn số khi đối chiếu với toàn bộ lĩnh vực rộng hơn. Bất cứ ai trích dẫn "mô hình TTS tốt nhất thế giới" từ con số này đều đang trích dẫn một bảng xếp hạng nhỏ hơn những gì câu nói hàm ý.

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing the ranked model list with Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, alongside samples, release dates and API pricing columns and 8-voice arena badges.

Hai con số đằng sau Elo

• Elo Giọng nói được kiểm soát — Giọng HeyGen: 1.202 (KTC 95% khoảng 1.185–1.219). Qwen-Audio-3.1-TTS-Plus: 1.186. Eleven v4 Turbo: 1.167.

• Bảng xếp hạng Elo giọng nói của nhà cung cấp — HeyGen Voice: không được liệt kê (không đủ phiếu bầu). Eleven v4 Turbo: 1.328 ở vị trí #1. Sonic 3.6: 1.280 ở vị trí #4.

• Xếp hạng trong nhóm được kiểm soát — HeyGen Voice: #1 trong 42 mục được xếp hạng (#42 là OpenVoice v2 với 812).

• Giá theo cách tính của arena — HeyGen Voice: $30.00 mỗi 1 triệu ký tự, cách quy đổi của chính arena từ mức giá theo credit của HeyGen. Qwen-Audio-3.1-TTS-Plus: $19.30 mỗi 1 triệu ký tự. Eleven v4 Turbo: $40.00 mỗi 1 triệu ký tự.

• Mốc neo Elo — OpenAudio S1 là điểm tham chiếu cố định ở mức 1.000, do đó HeyGen Voice cao hơn mốc neo 202 điểm.

• Còn ai khác nằm trong top năm — Eleven v4 với 1.160 và Sonic 3.6 với 1.143 hoàn thiện top năm phía sau những người dẫn đầu.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech, above the Realtime Video and Avatar Management groups.

Những gì HeyGen thực sự đã ra mắt

Công cụ đằng sau mục này là TTS nội bộ của HeyGen, được cung cấp trong API v3 của công ty. Một cuộc gọi GET /v3/voices sẽ nhận một bộ lọc engine với các giá trị bao gồm orca — engine giọng nói của chính HeyGen — cùng với starfish và một luồng chuyển tiếp tới giọng ElevenLabs. Việc tổng hợp giọng nói chạy qua POST /v3/voices/speech; tinh chỉnh theo từng yêu cầu cho phép đặt speed từ 0.5 đến 1.5 và pitch từ −50 đến +50 nửa cung, với gợi ý locale theo BCP-47.

Danh mục được liệt kê là 300+ giọng dựng sẵn trải khắp hàng chục ngôn ngữ. Giọng tùy chỉnh có ba kiểu: thiết kế văn bản thành giọng nói tạo ra tối đa ba tùy chọn được xếp hạng từ một mô tả giới hạn ở 1.000 ký tự, một bản sao tức thì từ một bản ghi âm duy nhất, và một bản sao chuyên nghiệp được huấn luyện trên hai mươi phút âm thanh trở lên. Cái cuối cùng chính là phần mà bảng xếp hạng Controlled Voice đang thực sự kiểm thử áp lực — tám giọng tham chiếu đó đều là bản sao, và chất lượng bản sao chính là điểm phân biệt các engine TTS.

Các engine cũng được nêu tên trong tài liệu là có thể chọn theo từng giọng nói, nghĩa là HeyGen không bắt bạn phải dùng model của họ: bạn có thể định tuyến đến engine giọng nói của bên thứ ba thông qua API của họ khi bạn thích dùng một engine như vậy. Đó là việc một nhà cung cấp đang tự phòng ngừa rủi ro cho model của chính họ, và điều đó đáng để biết khi bạn đọc một tuyên bố "#1 voice" về HeyGen.

Điều này thay đổi gì cho bất kỳ ai đang chọn một giọng nói

Ba hệ quả thực tiễn kéo theo khi một kết quả về giọng nói có kiểm soát được đưa vào áp dụng, và không hệ quả nào trong số đó là "chuyển đổi tất cả mọi thứ".

Đầu tiên, nếu trường hợp sử dụng của bạn là giọng thương hiệu được nhân bản — một người nói, nhiều câu thoại — thì đây chính là bảng xếp hạng bạn cần xem, và HeyGen Voice là mô hình nên thử trước tiên. Một bảng xếp hạng giữ cố định giọng nói chính là đang đo lường đúng thứ mà bạn thực sự sẽ làm.

Thứ hai, nếu trường hợp sử dụng của bạn là một dàn nhân vật đa dạng với giọng nghe như người bản xứ bằng những ngôn ngữ mà bản sao giọng nói của bạn không bao phủ, thì bảng Provider Voices và chín mươi sáu mục của nó vẫn là tài liệu tham chiếu liên quan, và HeyGen Voice chưa có xếp hạng ở đó. Không có gì trong kết quả giọng được sao chép cho bạn biết cách engine xử lý một trăm giọng nói riêng biệt.

Thứ ba, giá giờ đã có một con số, nhưng không phải con số do nhà cung cấp công bố. Đấu trường liệt kê HeyGen Voice ở mức $30.00 cho mỗi 1 triệu ký tự, một phép quy đổi của Artificial Analysis từ hệ thống tín dụng mà trang của chính HeyGen chưa bao giờ chuyển đổi thành đơn giá cho giọng nói. Điều đó đặt nhà dẫn đầu mới dưới mức $40.00 của Eleven v4 Turbo và trên mức $19.30 của phân khúc Qwen — một mức giá tầm trung gắn với điểm số đứng đầu, và là mức giá được suy ra chứ không phải được báo giá.

Câu hỏi về định tuyến

Việc chọn giọng nói có một đặc tính mà hầu hết các lựa chọn mô hình không có: lỗi có thể được người dùng cuối nghe thấy chỉ trong vòng một âm tiết. Điều đó khiến việc di trú trở nên rẻ để kiểm thử và đắt đỏ nếu làm sai trong production. Chạy một engine mới phía sau cùng giao diện như nhà cung cấp hiện tại — một bề mặt API, một key, giá niêm yết của nhà cung cấp được chuyển thẳng thay vì bị đội giá, với tự động chuyển đổi dự phòng sang nhà cung cấp giọng nói thứ hai khi một yêu cầu thất bại — là cách bạn nhận được câu trả lời thật về âm thanh của chính mình thay vì câu trả lời từ biểu đồ Elo về tám giọng tham chiếu. Lớp định tuyến của OrcaRouter tồn tại chính xác cho kiểu quyết định đó: đưa phương án thách thức vào một phần nhỏ lưu lượng, giữ phương án hiện tại ở trạng thái sẵn sàng, và để cơ chế dự phòng bao phủ giai đoạn mà mô hình mới chưa được chứng minh. Bảng xếp hạng cho bạn biết cần nhìn vào đâu. Nó không thể cho bạn biết kịch bản của bạn nghe như thế nào.

Xem gì tiếp theo

Hai con số sẽ định đoạt câu chuyện này. Con số đầu tiên là liệu HeyGen Voice có tích lũy đủ phiếu để lọt vào bảng Provider Voices hay không, và liệu nó sẽ đứng ở đâu so với 1.328 của Eleven v4 Turbo — một mô hình dẫn đầu bảng đó nhưng lại xếp sau trong đấu trường có kiểm soát, đúng là khoảng cách mà hai bảng tồn tại để phơi bày. Con số thứ hai là liệu HeyGen có công bố mức giá giọng nói của riêng mình hay không, để $30.00 mà đấu trường đã suy ra có thể được đối chiếu với con số từ nhà cung cấp thay vì được suy ra từ tín dụng. Cho đến khi cả hai điều đó tồn tại, màn ra mắt ở vị trí #1 trên bảng có kiểm soát là một khẳng định mạnh mẽ về chất lượng giọng nói nhân bản và là một câu hỏi bỏ ngỏ về mọi thứ khác.