Một thẻ hero cho 'ElevenLabs Eleven v4 vs Qwen-Audio-3.1-TTS-Plus' với hai thẻ điểm: Qwen-Audio-3.1-TTS-Plus ở Elo 1,178, hạng 1 và $19.30 cho mỗi 1M ký tự; ElevenLabs Eleven v4 ở Elo 1,157, hạng 2 và $80.00 cho mỗi 1M ký tự; với chú thích '21 điểm Elo đối đầu với khoảng cách giá gấp bốn lần'. Chân trang: 'Controlled Voice Arena, theo Artificial Analysis, tháng 9 năm 2026.' Logo OrcaRouter nằm ở góc dưới cùng bên phải.
Engineering & Research

Eleven v4 so với Qwen Audio 3.1: Giọng rẻ nhất trên bảng đã giành chiến thắng

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trên bảng đấu, nơi mọi mô hình dự thi đều được cấp cùng tám giọng nói nhân bản, Alibaba Qwen-Audio-3.1-TTS-Plus về nhất với Elo 1.178 và ElevenLabs Eleven v4 về nhì với 1.157. Mô hình giành chiến thắng có giá 19,30 USD cho mỗi triệu ký tự trên bảng đó. Mô hình về nhì có giá 80,00 USD. Đó là khoảng cách chất lượng 21 điểm và khoảng cách giá gấp bốn lần đi theo hai hướng ngược nhau, và đây là kết quả thú vị nhất trong cả tuần ra mắt — thú vị hơn vị trí số một mà ElevenLabs giành được ở đấu trường kia, bởi ở đấu trường đó, thứ tự xếp hạng diễn ra theo thông lệ và người thắng là giọng đắt nhất trong top mười.

Hai bảng xếp hạng này không thể thay thế cho nhau, và lý do cuộc so tài này cho ra kết quả như vậy hoàn toàn nằm ở việc bạn nhìn vào bảng nào. Provider Voice để người nghe đánh giá giọng của chính từng nhà cung cấp. Controlled Voice nhân bản cùng tám giọng — bốn giọng Mỹ, bốn giọng Anh — cho mọi mô hình, nên không ai có thể thắng nhờ dàn giọng mặc định của mình. ElevenLabs thắng bảng đầu tiên với cách biệt 61 điểm. Alibaba thắng bảng thứ hai với cách biệt 21 điểm. Không bảng nào sai, và bảng thứ hai mới là bảng dự đoán một sản phẩm phát hành giọng thương hiệu được nhân bản.

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

Bảng điểm giọng nói được kiểm soát, đầy đủ

• Ưu tiên đánh giá mù, các bản sao được ghép cặp — Qwen-Audio-3.1-TTS-Plus xếp hạng 1, Elo 1,178, $19.30 mỗi triệu ký tự so với Eleven v4 xếp hạng 2, Elo 1,157, $80.00.

• Ưu tiên mù, giọng nói riêng của từng nhà cung cấp — Eleven v4 xếp hạng 1, Elo 1.319 so với Qwen-Audio-3.0-TTS-Plus xếp hạng 4, Elo 1.258. Khoảng cách 61 điểm theo chiều ngược lại.

• Giá, chuẩn hoá arena — Qwen 19,30 USD so với Eleven v4 80,00 USD. Qwen rẻ hơn 76%.

• Giá, bảng giá nhà cung cấp — Eleven v4: $0,022 mỗi nghìn ký tự theo giá khuyến mãi và $0,08 sau ngày 12 tháng 10. Bảng giá riêng của Qwen Audio 3.1 không phải là thứ chúng tôi có thể đọc được, nên chuẩn hóa arena là mức giá duy nhất mà chúng tôi có thể so sánh.

• Phiên bản trên mỗi bo mạch — 3.1 trên Controlled Voice, 3.0 trên Provider Voice. Chúng là các mô hình khác nhau và các bo mạch không thể thay thế cho nhau.

• Mục 3.0 trên Controlled Voice — hạng 5, Elo 1.124, cùng mức giá $19.30. Bản phát hành 3.1 có giá trị cao hơn 54 Elo so với bản tiền nhiệm của chính nó ở mức giá y hệt.

• Các thế hệ trước của Qwen trên Provider Voice — Qwen3 TTS Flash xếp hạng 79, Elo 944; Qwen3 TTS xếp hạng 82, Elo 930.

• Sản phẩm chủ lực trước đây của chính ElevenLabs trên Controlled Voice — Eleven v3 xếp hạng 7, Elo 1.073.

• Kiểm tra nhanh tính hợp lý của biểu đồ thanh nhóm — khoảng trải tám mức từ hạng 1 đến hạng 10 trên Controlled Voice là 121 Elo. Mức dẫn trước 21 điểm của Qwen so với Eleven v4 chưa bằng một phần năm toàn bộ dải điểm của cả nhóm, và đó là thang đo hợp lý để giữ nó ở mức ấy.

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

Hai hàng ở đó đóng vai trò chủ yếu. Hàng đầu tiên là so sánh 3.0 với 3.1: Alibaba tăng 54 Elo chỉ sau một lần nâng phiên bản mà hoàn toàn không thay đổi giá. Đó là nhịp độ nhanh hơn bước chuyển 84 điểm từ v3 lên v4 của ElevenLabs, và điều đó có nghĩa thứ tự xếp hạng cụ thể trong bài viết này chỉ là một bản chụp tức thời mà cả hai nhà cung cấp đang tích cực xáo trộn.

Điều thứ hai là tổng mức chênh lệch 121 điểm. Khoảng cách 21 điểm trên một bảng điểm có dải hữu dụng khoảng 120 điểm là một khác biệt có thật nhưng khiêm tốn — xấp xỉ cùng độ lớn với khoảng cách giữa bản 3.1 của chính Qwen và bản 3.0 của nó. Nếu trường hợp sử dụng của bạn nằm ở một ngôn ngữ mà cả hai mô hình đều không được tinh chỉnh cho, thì mức chênh đó nằm gọn trong phạm vi mà chỉ vài script kiểm thử khó là có thể lật ngược.

Vấn đề về phiên bản mà không ai lên tiếng

Kết quả đang lan truyền với nội dung “Eleven v4 đứng thứ hai trên Controlled Voice” là chính xác nhưng chưa đầy đủ, và việc thiếu sót đó có ý nghĩa với bất kỳ ai đang lập kế hoạch dựa trên nó. Mô hình nằm trên Eleven v4 trên bảng đó là bản phát hành 3.1 của Alibaba. Trong khi đó, mục Qwen trên bảng Provider Voice là bản phát hành 3.0 — mô hình 3.1 không xuất hiện trong các hàng đầu của bảng đó theo cách chúng tôi đọc. Vì vậy, hai tiêu đề — “Eleven v4 đứng số một” và “Eleven v4 đứng số hai” — là những nhận định về hai mô hình Qwen khác nhau trong hai tác vụ khác nhau, và phiên bản Qwen đã đánh bại nó trên một bảng không phải là phiên bản Qwen mà nó đã đánh bại trên bảng kia.

Đây không phải là một cái bẫy dành cho nhà cung cấp nào; đây là lý do để không tin vào bất kỳ bản tóm tắt một câu nào về một tuần như thế này. Nếu bạn đang chọn giữa hai hệ thống này, phép so sánh bạn muốn là 3.1 so với v4 trên chính giọng đã nhân bản của bạn, bằng chính ngôn ngữ của bạn, và cả hai nhà cung cấp đều chưa công bố điều đó.

Những gì chúng ta có thể và không thể nói về Qwen Audio 3.1

Ở đây, sự trung thực về bằng chứng đáng giá hơn một bảng thông số đầy đủ, nên đây là ranh giới mà bài viết này đang dựa vào. Từ các bảng xếp hạng đấu trường mà chúng tôi có, đối với Qwen-Audio-3.1-TTS-Plus: chỉ số Elo cho giọng nói được kiểm soát là 1.178, mức chuẩn hoá giá là 19,30 USD mỗi triệu ký tự, và việc nó là bản phát hành hiện tại trong một dòng sản phẩm mà phiên bản trước đạt điểm thấp hơn 54 điểm ở cùng mức giá.

Chúng tôi không có, và sẽ không đoán mò về: độ phủ ngôn ngữ, độ trễ, giới hạn đầu vào mỗi yêu cầu, liệu nó có hỗ trợ chỉ dẫn cách thể hiện nội tuyến hay không, liệu nó có cung cấp tính năng nhân bản giọng nói ngoài tám giọng của đấu trường hay không, hay nó tính phí ra sao trên bảng giá riêng của mình. Những điều đó đều được ghi rõ cho Eleven v4 — hơn 90 ngôn ngữ, giới hạn 10.000 ký tự, thẻ âm thanh, nhân bản tức thì trong mười giây, hỗ trợ âm vị IPA — và việc chúng vắng mặt ở phía Qwen là một khoảng trống trong những gì có thể đọc công khai, chứ không phải là điểm trừ đối với mô hình. Một quyết định mua hàng chỉ dựa trên bài viết này sẽ là quyết định dựa trên hai con số.

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

Một sự tương phản vẫn đứng vững trước hạn chế đó, bởi vì cả hai phía đều do nhà cung cấp công bố hoặc cả hai đều do bảng công bố. Về giá, chuẩn hoá của bảng là mẫu số chung và nó nghiêng về Qwen 76%. Về chất lượng trong điều kiện người nói được ghép khớp, cùng bảng đó nghiêng về Qwen 21 Elo. Hai dòng đó có thể so sánh được. Mọi thứ khác ở đây thì không, và bài viết sẽ không giả vờ điều ngược lại.

Vì sao một hội đồng quản trị bị kiểm soát nên có sức nặng hơn mức thông thường

Hầu hết các so sánh giọng nói đều mặc định theo bất kỳ bảng xếp hạng nào đưa mô hình mà bạn đã thích lên đầu. Trong màn đối đầu này, có một lý do có nguyên tắc để ưu tiên Controlled Voice, và lý do đó mang tính cụ thể chứ không chung chung.

Alibaba và ElevenLabs đang cạnh tranh với những tài sản vô cùng khác biệt. Lợi thế của ElevenLabs là một thư viện giọng nói được xây dựng qua nhiều năm tuyển chọn kỹ lưỡng; còn của Alibaba là một tổ chức nghiên cứu phát hành các phiên bản mô hình với nhịp độ nhanh. Một bảng đấu cho phép mỗi thí sinh mang giọng nói của riêng mình sẽ đo lường thư viện cũng nhiều như đo lường bộ tổng hợp, và trên bảng đấu đó ElevenLabs thắng 61 điểm. Loại bỏ các thư viện ra — cùng tám người nói được nhân bản cho tất cả mọi người — và lợi thế đổi chủ. Nếu giọng nói mà người dùng của bạn nghe là bản sao của một người cụ thể, bạn không mua thư viện của ElevenLabs, vì vậy bảng đấu có kiểm soát mới là bảng mô tả việc mua của bạn. Nếu bạn đang chọn từ một menu các giọng nói có sẵn, điều ngược lại mới đúng và mức chênh lệch 61 điểm của Eleven v4 chính là con số đáng giá.

Có một lý do thứ hai, kém thoải mái hơn, để đánh trọng số cho kết quả đã kiểm soát. Một bảng giọng của nhà cung cấp thưởng cho một dàn giọng mặc định đặc trưng, và một dàn giọng đặc trưng có thể gây phân cực theo những cách mà Elo trung bình che giấu — điều người nghe này thấy có cá tính thì người nghe khác lại thấy giả tạo. Một bảng giọng nhân bản với những người nói được ghép cặp loại bỏ hoàn toàn biến số đó, khiến nó trở thành phép đo có khả năng tái lập cao hơn trong hai phép đo.

Chạy một trong hai, và những gì chúng ta thực sự định tuyến

OrcaRouter không lưu trữ mô hình giọng nói của ElevenLabs lẫn Alibaba. Cả hai nhà cung cấp đều không nằm trong danh mục của chúng tôi, vì vậy không có cách nào để gọi một trong hai thông qua chúng tôi và bài viết này sẽ không gợi ý điều ngược lại — bạn hãy truy cập API riêng của nhà cung cấp và một số nền tảng bên thứ ba đối với cả hai.

Điều chúng tôi bao gồm là lớp ở phía trên. Nếu ngăn xếp giọng nói của bạn chỉ là một nút trong một pipeline lớn hơn, chúng tôi cung cấp hơn 200 mô hình sau một API key duy nhất, với giá niêm yết của nhà cung cấp được chuyển nguyên qua ở mức 0% markup, nhờ đó mọi thay đổi giá ở bất kỳ khâu thượng nguồn nào — kể cả cửa sổ khuyến mãi của ElevenLabs và mức giá niêm yết lớn hơn nhiều theo sau đó vào ngày 12 tháng 10 — đều được phản ánh ở phía chúng tôi ngay trong ngày xảy ra, thay vì vào kỳ thanh toán tiếp theo. Với một quyết định xoay quanh tỷ lệ giá 4 lần, thời điểm đó chính là khác biệt giữa một so sánh còn đứng vững theo thời gian và một so sánh bị xem là sai chỉ sau ba tuần.

Và ở những nơi mà đường thoại không thể ngừng hoạt động, tính năng chuyển đổi dự phòng tự động sẽ đưa lưu lượng sang một upstream khỏe mạnh thay vì để yêu cầu thất bại. Trong một cuộc đối đầu mà chất lượng sát nút đến vậy và giá cả lại lệch hẳn một chiều đến thế, kiến trúc hợp lý là đặt cả hai mô hình phía sau một endpoint duy nhất, để việc định tuyến quyết định tỷ lệ phân chia — chứ không phải một lựa chọn cố định được đưa ra từ ảnh chụp bảng xếp hạng mà cả hai nhà cung cấp đều sẽ phá vỡ trong vòng một quý.

Phán quyết, và ngày hết hạn của nó

Chọn Qwen-Audio-3.1-TTS-Plus nếu bạn đang nhân bản giọng nói và để mắt đến chi phí. Nó đứng đầu trên bảng xếp hạng giữ cố định tập người nói, giá chỉ bằng khoảng một phần tư, và đường xu hướng của nó đang tiến nhanh hơn — 54 Elo chỉ trong một bước phiên bản với mức giá không đổi cho thấy phiên bản kế tiếp là một cửa đặt tốt hơn so với phiên bản hiện tại, xét trên lý thuyết.

Chọn Eleven v4 nếu người dùng của bạn nghe thấy giọng nói tiêu chuẩn, nếu bạn cần độ phủ ở những ngôn ngữ bạn có thể kiểm chứng trước khi phát hành, hoặc nếu bộ tính năng được tài liệu hóa — thẻ âm thanh, điều khiển âm vị, yêu cầu 10.000 ký tự, yêu cầu mười giây — đang đảm nhận công việc trong sản phẩm của bạn mà các bảng đấu trường không đo lường. Việc nó dẫn trước 61 điểm trên bảng giọng nói nhà cung cấp không phải là chuyện nhỏ, và hai tính năng bạn có thể viết vào kịch bản là năng lực, không phải điểm số.

Đặt một ngày đánh giá. Alibaba đã tăng 54 Elo trong một lần nâng cấp phiên bản ở chu kỳ này và ElevenLabs đã tăng 84 qua một thế hệ đầy đủ, và mức giá khuyến mãi của Eleven v4 sẽ hết hạn vào ngày 12 tháng 10. Dù so sánh này nói gì vào hôm nay, hai dữ kiện có nhiều khả năng lật ngược nó nhất — một bản phát hành 3.2 và một mức giá được hoàn nguyên — đều đến trước khi quý kết thúc.