
HeyGen Voice so với Qwen-Audio-3.0-TTS: Bạn phải trả gì cho điểm Elo, và bạn thực sự đã benchmark phiên bản Qwen nào
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Hãy làm phép tính trước, vì nó ít chênh lệch hơn so với điều mà bảng điểm gợi ra. Qwen-Audio-3.0-TTS-Plus có giá $19.30 cho mỗi triệu ký tự trên nền tảng Model Studio — mức giá mà nhà cung cấp công bố. HeyGen Voice nằm ở mức $30.00 cho mỗi triệu ký tự trên biểu đồ giá riêng của Artificial Analysis, một con số mà trang này suy ra từ cách định giá tín dụng của HeyGen, bởi trang giá công khai của HeyGen bán tín dụng mà không nói rõ một lần tạo giọng nói tiêu tốn bao nhiêu. Trong khi đó, khoảng cách ở hạng mục giọng nói được kiểm soát giữa chúng là 79 Elo: HeyGen Voice đạt 1.202 trên đấu trường giữ cố định cả tám giọng tham chiếu, còn Qwen-Audio-3.0-TTS-Plus đạt 1.123. Vậy nên mô hình rẻ hơn bị xếp hạng kém xa mô hình tốt hơn, tỷ lệ giữa chúng vào khoảng 1,55×, và chỉ một trong hai mức giá đó là con số mà nhà cung cấp bán nó đã đứng tên công bố.
Cái bẫy trong cái tên
Trước tất cả những điều đó, hãy xác định đúng tier, vì đây là một dòng sẽ sẵn sàng để bạn benchmark nhầm mô hình. Có hai mục Alibaba đáng lưu ý ở đây và chúng không thể hoán đổi cho nhau.
Qwen-Audio-3.0-TTS-Plus là mô hình mà bài viết này đem ra so sánh. Nó đạt 1.123 điểm trên bảng kiểm soát — đứng thứ bảy trong số bốn mươi hai — và 1.264 điểm trên bảng Provider Voices, nơi nó xếp thứ sáu trong số chín mươi sáu. Đây là một sản phẩm TTS phát trực tuyến thực tế, hiện hành, với mức giá công bố là 19,30 USD cho mỗi triệu ký tự.
Qwen-Audio-3.1-TTS-Plus là bậc kế nhiệm của nó, và đây là mô hình đang đứng thứ hai trên bảng xếp hạng có kiểm soát với 1.186 — mô hình tiến gần nhất tới việc đánh bại HeyGen Voice khi ra mắt. Mức giá của nó được niêm yết vẫn là 19,30 USD, mặc dù tài liệu của Alibaba cảnh báo rằng các phiên bản mô hình khác nhau yêu cầu giọng nói tương ứng, nên "cùng giá, bậc mới hơn" không có nghĩa là "thay thế trực tiếp".
Bất kỳ ai đọc “#1 đứng trên Qwen” rồi đánh giá Qwen-Audio-3.0-TTS sẽ đang kiểm thử một mô hình yếu hơn 63 Elo so với mô hình mà tiêu đề nói tới. Chuyện tranh cãi về bậc xếp hạng đáng giá 63 điểm, nhiều hơn khoảng cách giữa HeyGen Voice và vị trí thứ ba.
Bảng tỷ số

• Elo Giọng nói được kiểm soát (cùng 8 giọng đã nhân bản) — HeyGen Voice: 1.202, #1 trong 42. Qwen-Audio-3.0-TTS-Plus: 1.123, #7.
• Điểm Elo Giọng nói Nhà cung cấp (giọng nói bản địa) — Qwen-Audio-3.0-TTS-Plus: 1.264, #6 trong số 96. HeyGen Voice: không được xếp hạng.
• Giá cho mỗi 1 triệu ký tự — Qwen-Audio-3.0-TTS-Plus: 19,30 USD, do nhà cung cấp công bố trên Alibaba Cloud. HeyGen Voice: 30,00 USD theo cách quy đổi giá tín dụng của chính arena; HeyGen không công bố mức giá cho giọng nói.
• Chi phí cho 100 giờ thuyết minh — Qwen-Audio-3.0-TTS-Plus: khoảng $926 với ~480.000 ký tự cho mỗi giờ đọc. HeyGen Voice: khoảng $1.440 theo mức quy đổi $30,00 của arena — được suy ra, không phải giá được báo trực tiếp.
• Điều khiển giọng nói — Qwen-Audio-3.0-TTS-Plus: chỉ dẫn tham số, thẻ cảm xúc và ngôn ngữ, nhân bản giọng nói và thiết kế giọng nói. HeyGen Voice: thiết kế văn bản thành giọng nói từ mô tả tối đa 1.000 ký tự, nhân bản tức thì, nhân bản chuyên nghiệp được huấn luyện trên hơn 20 phút.
• Đầu ra — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 và Opus ở tốc độ lấy mẫu lên tới 48kHz, với tốc độ, cao độ, âm lượng và bitrate có thể điều chỉnh. HeyGen Voice: tốc độ 0,5–1,5 và cao độ ±50 nửa cung mỗi yêu cầu.

Kỹ thuật của Alibaba thực sự mang lại cho bạn những gì
Dòng sản phẩm Qwen-Audio-3.0-TTS là một sản phẩm streaming và tài liệu cũng được viết theo đúng tinh thần đó. Các yêu cầu được truyền qua một giao thức WebSocket dùng chung với CosyVoice, với luồng sự kiện run-task, continue-task và finish-task cùng các phản hồi task-started, result-generated, task-finished và task-failed đi kèm. Tính năng hủy được hỗ trợ trên mọi mô hình Qwen-Audio-TTS ở cả hai khu vực Bắc Kinh và Singapore thông qua streaming_cancel(). Đầu ra đạt tới 48kHz, và các định dạng bao gồm cả Opus, điều này rất quan trọng nếu bạn đưa âm thanh vào trình duyệt hoặc cuộc gọi điện thoại thay vì một tệp WAV.
Hai chi tiết trong tài liệu đó rất dễ bị bỏ sót và tốn kém nếu phát hiện muộn. Các thẻ cảm xúc và ngôn ngữ phong phú chỉ áp dụng cho các gói Plus và Flash — không phải toàn bộ dòng sản phẩm — và chúng chỉ hoạt động ở chế độ truyền phát một chiều. Và khóa API khác nhau giữa khu vực Singapore và Bắc Kinh, với các workspace được định địa chỉ tại các URL có dạng wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Khóa theo khu vực là một chi tiết cấp phát cho đến ngày chúng trở thành sự cố ngừng dịch vụ.
Phía HeyGen là một dạng sản phẩm khác: một API kiểu REST v3, trong đó POST /v3/voices/speech tạo ra giọng nói, GET /v3/voices liệt kê danh mục đứng sau một bộ lọc engine, và tính năng thiết kế giọng nói trả về tối đa ba tùy chọn được xếp hạng từ một câu lệnh văn bản kèm seed để đảm bảo khả năng tái lập. Tài liệu cũng tiết lộ rằng bộ lọc engine chấp nhận cả những giá trị vượt ra ngoài các engine của chính HeyGen — vì vậy HeyGen sẵn sàng định tuyến bạn đến một engine giọng nói của bên thứ ba thông qua API của mình. Một nhà cung cấp tung ra mô hình của đối thủ như một tùy chọn có thể chọn được đang cho bạn biết điều gì đó về việc họ nghĩ thế mạnh của mình nằm ở đâu.

79 Elo đi đâu
Khoảng cách 79 điểm trên một bảng được kiểm soát là rất đáng kể — lớn hơn mức chênh lệch 16 điểm phân tách HeyGen Voice với vị trí thứ hai, và gần bằng khoảng cách giữa vị trí thứ ba và thứ tám trong lĩnh vực đó. Con số này cũng chỉ được đo trên một trục.
Đấu trường được kiểm soát sao chép tám giọng và giữ chúng cố định. Nó không nói gì về bề mặt điều khiển dựa trên hướng dẫn mà Qwen cung cấp, không nói gì về đầu ra Opus 48kHz thông qua WebSocket có thể hủy, và không nói gì về triển khai theo khu vực. Đó là những thuộc tính kỹ thuật, và chúng là lý do một đội xây dựng trung tâm liên lạc tiếng Quan Thoại sẽ không chuyển sang một mô hình đạt điểm cao hơn 79 điểm trên tám giọng tham chiếu tiếng Anh.
Điều mà kết quả có kiểm soát thực sự nói thì hẹp hơn và vẫn hữu ích: khi cả hai engine được đưa cùng một giọng nói đã nhân bản, người nghe thích bản dựng của HeyGen Voice hơn. Nếu sản phẩm của bạn nhân bản giọng nói, thì đó là trục của bạn. Nếu sản phẩm của bạn chọn một giọng nói từ danh mục và truyền trực tiếp vào cuộc gọi, thì bảng xếp hạng nhà cung cấp gần với thực tế của bạn hơn — và ở đó HeyGen Voice không có thứ hạng nào cả trong khi Qwen-Audio-3.0-TTS-Plus đứng thứ sáu trong số chín mươi sáu.
Lập luận về giá, được xem xét một cách nghiêm túc
Ở mức 19,30 USD mỗi triệu ký tự, Qwen-Audio-3.0-TTS-Plus có chi phí chỉ bằng khoảng một nửa gói 40 USD của ElevenLabs và khoảng 40% mức 49 USD của Cartesia Sonic 3.6. Với khối lượng 100 giờ tường thuật — khoảng 48 triệu ký tự ở tốc độ nói thông thường — chi phí sẽ vào khoảng 926 USD. Cùng khối lượng đó trên Eleven v4 Turbo sẽ tốn khoảng 1.920 USD, còn trên Sonic 3.6 là khoảng 2.352 USD. HeyGen Voice, ở mức 30,00 USD của arena, rơi vào khoảng gần 1.440 USD: nằm giữa nhóm giá rẻ và hai đối thủ đương nhiệm, nghiêng về mức giữa hơn là mức cao nhất.
Phép tính đó mang một lưu ý mà những phép tính khác không cần có. $19,30 là mức giá do chính Alibaba công bố. $30,00 là kết quả quy đổi của Artificial Analysis từ một hệ thống tín dụng mà HeyGen chưa từng chuyển đổi sang số ký tự, nên đây là một ước tính thiện chí chứ không phải một báo giá. Nếu tỷ lệ ký tự trên mỗi tín dụng thực tế tệ hơn mức biểu đồ giả định, lợi thế 79-Elo sẽ tốn kém hơn mức 1,55× mà nó hàm ý; nếu tốt hơn, thì ít hơn. Một mô hình mà bạn phải suy đoán giá là mô hình bạn nên chạy thử trên một phần lưu lượng được đo lường, thay vì một mô hình bạn lấy làm chuẩn. Đó không phải là lời chỉ trích engine — mà là mô tả thông tin sẵn có vào ngày 10 tháng 10 năm 2026.
Đang quyết định
Hãy chọn Qwen-Audio-3.0-TTS-Plus khi chi phí và hạ tầng streaming là yếu tố quyết định. Mức dưới 20 USD cho mỗi triệu ký tự, một WebSocket có thể hủy với đầu ra Opus 48kHz, một tham số hướng dẫn và các thẻ cảm xúc, cùng vị trí thứ sáu trên bảng xếp hạng nhà cung cấp khiến nó trở thành giọng được đánh giá tốt tiết kiệm nhất trong so sánh này. Thay vào đó, hãy chọn bậc 3.1 nếu bạn muốn mô hình thực sự đứng thứ hai trên bảng có kiểm soát, và hãy xác minh danh sách giọng trước khi cho rằng việc hoán đổi là miễn phí.
Hãy thử nghiệm HeyGen Voice khi độ trung thực của bản sao chính là sản phẩm. Một người nói, nhiều câu thoại, một giọng nói mà mỗi lần đều phải là *chính* giọng đó — đó là trục mà bảng đánh giá có kiểm soát đo lường và cũng là trục mà nó dẫn đầu toàn bộ lĩnh vực. Hãy dự trù cho một giai đoạn đo lường, vì mô hình tín dụng nghĩa là bạn sẽ biết chi phí thật của mình bằng cách chạy văn bản của chính bạn thay vì đọc bảng giá.
Và hãy bỏ qua hoàn toàn phần so sánh nếu khối lượng công việc là tiếng Trung và theo thời gian thực. Cả hai chỉ số Elo đều không được đo trên giọng nói của bạn, bằng ngôn ngữ của bạn, ở ngân sách độ trễ của bạn.
Giữ cả hai trong tầm với
Đây là một trong những cặp kết hợp mà ở đó lớp định tuyến khẳng định được vị trí của mình thay vì chỉ là một thứ gắn thêm. Một API key duy nhất dùng cho cả hai nhà cung cấp — giá niêm yết của nhà cung cấp được chuyển nguyên vẹn không cộng thêm, nên mức $19.30 mà Alibaba công bố chính là giá bạn trả và mọi thay đổi giá của Qwen được cập nhật ngay trong cùng ngày — loại bỏ nhu cầu phải chọn sẵn một bên thắng trước khi bạn có bằng chứng. Tính năng chuyển đổi dự phòng tự động xử lý rủi ro hiển nhiên trong một pipeline giọng nói, nơi một luồng bị đình trệ có thể bị người nghe nhận ra, và DSL định tuyến cho phép bạn gửi phần tường thuật số lượng lớn đến engine rẻ hơn và những câu thoại quan trọng với giọng clone đến engine đạt điểm cao hơn 79 điểm, mà không cần hai thư viện client và hai quan hệ thanh toán. Giá trị của OrcaRouter ở đây không nằm ở việc nó vận hành một mô hình giọng nói; mà ở chỗ nó khiến chi phí để tìm ra mô hình bạn muốn gần như bằng không.
Những câu hỏi còn bỏ ngỏ
Ba điều sẽ giải quyết được chuyện này. Một mức giá cho giọng nói trên trang định giá của chính HeyGen sẽ biến 30,00 USD mà arena suy ra thành một con số bạn có thể kiểm toán. Một mục HeyGen trên bảng Provider Voices sẽ cho chúng ta biết liệu lợi thế giọng nhân bản có đứng vững trước các giọng native hay không — bài kiểm tra mà Qwen-Audio-3.0-TTS-Plus vượt qua ở vị trí thứ sáu trong chín mươi sáu. Và một kết quả giọng có kiểm soát cho Qwen-Audio-3.1-TTS-Plus so với HeyGen Voice sau nhiều phiếu bầu hơn sẽ cho chúng ta biết liệu 16 Elo có phải là một thứ tự ổn định. Cho đến lúc đó: Qwen là lựa chọn có giá, có thể stream, được xếp hạng tốt; HeyGen Voice là lựa chọn điểm cao hơn, không thể định giá; và hạng bạn benchmark quan trọng hơn tiêu đề bạn đọc.
