Một thẻ hero so sánh Qwen-Audio-3.1-TTS với ElevenLabs Eleven v3, liệt kê 16 ngôn ngữ cùng 20 phương ngữ của Qwen, mức giảm giá 70% và việc không có điểm arena, đối chiếu với 74 ngôn ngữ của ElevenLabs, khoảng 100 USD cho mỗi triệu ký tự và Elo 1.168, phía trên một dải băng ghi 'Công bố tại Apsara, ngày 23 tháng 9 năm 2026'.
Guides & Insights

Qwen-Audio-3.1 vs ElevenLabs: Mức giảm giá 70% chạm mặt kẻ đương nhiệm

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Nhà cung cấp đã cắt giảm giá API Qwen-Audio-3.1-TTS của mình khoảng 70% vào ngày 23 tháng 9 năm 2026, được công bố trên sân khấu tại Apsara Conference ở Hàng Châu cùng với bốn mô hình giọng nói khác. Chính con số đó là lý do bài so sánh này đáng để viết: ElevenLabs Eleven v3 đã là giọng nói sản xuất mặc định cho hầu hết các nhóm phương Tây với mức giá thực tế gần 100 USD cho mỗi triệu ký tự, và một đối thủ đáng tin cậy vừa định giá lại cùng công việc đó ở mức chỉ bằng một phần nhỏ, đồng thời mở rộng độ phủ ngôn ngữ. Hai hệ thống không tương đương — Qwen-Audio-3.1-TTS là API chỉ chạy trên nền tảng được host từ Tongyi Lab của nhà cung cấp, với hệ sinh thái giọng nói nhỏ hơn, trong khi ElevenLabs là một nền tảng nội dung đầy đủ với thư viện giọng nói sâu nhất trong ngành. Nhưng nếu quyết định của bạn từng bị định đoạt bởi hóa đơn, thì phép tính đã thay đổi trong tuần này.

Điều gì thực sự đã được phát hành vào ngày 23 tháng 9

Qwen-Audio-3.1 không phải là một mô hình. Đó là một bản làm mới năm mô hình của toàn bộ ngăn xếp giọng nói của Alibaba, và các cấp bậc rất quan trọng vì chúng có mức giá khác nhau và các công việc khác nhau:

Qwen-Audio-3.1-TTS — phiên bản kế nhiệm trực tiếp của mô hình tổng hợp mà hầu hết các nhóm sử dụng. Bổ sung thêm bảy ngôn ngữ, nâng tổng số lên 16, giữ nguyên 20 vùng phương ngữ Trung Quốc, bổ sung khả năng chuyển đổi âm sắc xuyên ngôn ngữ tự nhiên (một giọng nói xuyên suốt tiếng Quan Thoại, tiếng Quảng Đông, tiếng Anh, tiếng Nhật), điều khiển cảm xúc, tốc độ và phong cách thể hiện bằng chỉ dẫn, đồng thời xử lý âm thanh tham chiếu bị nhiễu, vang hoặc kém chất lượng mà không cần chế độ khử nhiễu riêng.

Qwen-Audio-3.1-TTS-Next — một hạng mới, và là một sản phẩm khác. Alibaba gọi nó là mô hình "Audiogen": nó tạo giọng nói, hiệu ứng âm thanh và âm nền trong một lượt duy nhất từ văn bản, dấu thời gian và âm thanh tham chiếu. Hội thoại nhiều người nói, podcast, âm cảnh phim và truyền hình, đầu ra 48 kHz. Theo tài liệu Model Studio của Alibaba Cloud, nó nhận tối đa 3.000 ký tự đầu vào, giới hạn âm thanh tạo ra ở 240 giây đối với podcast và 120 giây với các trường hợp khác, chạy ở mức 3 yêu cầu mỗi giây và trả về WAV, MP3 hoặc PCM.

Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-NextQwen-Audio-3.1-Realtime — lần lượt là nhận dạng, hiểu âm thanh (cảm xúc, âm nhạc, âm thanh môi trường, định vị sự kiện) và hội thoại song công hoàn toàn. Realtime là sản phẩm mà Alibaba đang đẩy mạnh vào phần cứng: Qwen Office, Qoder, QwenNote A2, robot để bàn QwenNote Eva và kính Qwen AI.

Các đợt giảm giá diễn ra trên toàn bộ dòng sản phẩm, không chỉ riêng TTS: tổng hợp giảm khoảng 70%, thời gian thực giảm khoảng 85%, nhận dạng giảm tới 95%. Alibaba cũng đã mở mã nguồn Qwen-Audio-Agent, một framework để xây dựng các tác nhân thoại thời gian thực, và ra mắt Qwen3.8-LiveTranslate với độ trễ được đưa xuống dưới 2,5 giây.

A screenshot of Alibaba Cloud Model Studio's English documentation site showing the reference page for qwen3.8-livetranslate-flash-realtime, a real-time audio and video translation model that accepts audio and images and outputs text and audio across 60 input languages and 29 speech output languages, under an Apsara 2026 Conference banner, with the Speech-to-Speech branch of the navigation listing the qwen-audio-3.0 realtime models.

Bảng tỷ số

A two-column scoreboard for Qwen-Audio-3.1-TTS and ElevenLabs Eleven v3 across price, languages, weights, voice library, delivery control and arena score, with a footer stating that the Qwen figures are vendor-reported and unscored and the ElevenLabs figures are per Artificial Analysis.

Giá — Qwen-Audio-3.1-TTS: thấp hơn khoảng 70% so với thế hệ Qwen-Audio trước đó, vốn đặt hạng 3.0 Plus ở mức gần 27,60 USD cho mỗi 1 triệu ký tự và hạng Flash ở mức gần 15 USD. ElevenLabs Eleven v3: khoảng 100 USD cho mỗi 1 triệu ký tự theo dữ liệu từ Artificial Analysis, với Flash ở mức khoảng 50 USD.

Ngôn ngữ — Qwen-Audio-3.1-TTS: 16 ngôn ngữ cùng 20 vùng phương ngữ Trung Quốc. ElevenLabs Eleven v3: 74 ngôn ngữ.

Trọng số — Qwen-Audio-3.1-TTS: đóng, chỉ được lưu trữ trên Alibaba Cloud Model Studio. ElevenLabs Eleven v3: đóng, chỉ được lưu trữ.

Thư viện giọng nói — Qwen-Audio-3.1-TTS: nhân bản gốc cùng khả năng chuyển đổi âm sắc xuyên ngôn ngữ; không có chợ công khai nào tương đương. ElevenLabs: thư viện giọng nói chia sẻ lớn nhất trong ngành, cùng khả năng nhân bản tức thì từ khoảng 30 giây âm thanh.

Kiểm soát cách truyền đạt — Qwen-Audio-3.1-TTS: cảm xúc, nhịp độ và phong cách dựa trên chỉ dẫn, kế thừa 86 thẻ truyền đạt nội tuyến được giới thiệu từ phiên bản 3.0. ElevenLabs Eleven v3: thẻ âm thanh cùng toàn bộ nền tảng xung quanh (lồng tiếng, agent, studio).

Đánh giá chuẩn độc lập — Qwen-Audio-3.1-TTS: chưa có. ElevenLabs Eleven v3: 1.168 Elo trên bảng xếp hạng Provider Voice Arena của Artificial Analysis tính đến tháng 8 năm 2026.

Nơi kẻ thách thức thực sự giành chiến thắng

Ba điều, và chỉ một trong số đó là giá.

Giá cả, rõ ràng rồi. Mức giảm 70% so với đối thủ hiện hữu có giá 100 USD cho mỗi một triệu ký tự không phải là chênh lệch đáng bỏ qua. Đó là sự khác biệt giữa một sản phẩm bạn dùng để tạo nguyên mẫu và một sản phẩm bạn phát hành cho mọi người dùng. Nếu bạn đang tạo lời dẫn với khối lượng lớn, khoản tiết kiệm hằng năm không phải là một mục chi phí mà bạn phải đấu tranh để bảo vệ trong nội bộ — nó tự chứng minh giá trị của chính nó.

Tiếng Trung, không thể nhầm lẫn. Hai mươi vùng phương ngữ tiếng Trung là một con hào mà không thứ gì ElevenLabs cung cấp có thể đến gần. Nếu sản phẩm của bạn phục vụ người dùng Trung Quốc đại lục, hoặc người nói tiếng Quảng Đông, hoặc khán giả cộng đồng hải ngoại chuyển đổi ngôn ngữ giữa câu, thì cuộc so sánh đã kết thúc trước cả khi nó bắt đầu.

Chuyển đổi âm sắc xuyên ngôn ngữ. Qwen-Audio-3.1-TTS lấy một giọng nói và truyền tải nó một cách tự nhiên qua tiếng Quan Thoại, tiếng Quảng Đông, tiếng Anh và tiếng Nhật. Đó là một năng lực cụ thể gắn với một trường hợp sử dụng cụ thể — một giọng nói mang thương hiệu duy nhất vẫn giữ nguyên khi chuyển đổi ngôn ngữ — và đây là một điểm khác biệt thực sự cho bất kỳ ai đang bản địa hóa một người dẫn duy nhất thay vì tuyển chọn người mới cho từng thị trường.

Nơi ElevenLabs vẫn chiếm ưu thế, và không hề sít sao

Độ phủ ngôn ngữ là điều đầu tiên, và cũng là điều lớn nhất. Bảy mươi tư ngôn ngữ so với mười sáu không phải là khoảng cách bạn có thể thu hẹp bằng một thông báo về giá. Nếu bạn phát hành bằng tiếng Ba Lan, tiếng Thổ Nhĩ Kỳ, tiếng Việt và tiếng Bồ Đào Nha, ElevenLabs đáp ứng được cho bạn ngay hôm nay, còn Qwen-Audio-3.1-TTS thì không.

Thứ hai là hệ sinh thái. ElevenLabs không phải là một điểm cuối tổng hợp; nó là một nền tảng nội dung. Một thư viện giọng nói dùng chung mà bạn có thể cấp phép thay vì sao chép, các quy trình lồng tiếng, hạ tầng agent, một sản phẩm studio, một bề mặt API được tài liệu hóa với nhiều năm thư viện client đằng sau. Di chuyển khỏi đó là cả một dự án, không phải một thay đổi cấu hình, và những đội ngũ đã xây dựng trên đó biết chính xác họ sẽ phải từ bỏ điều gì.

Điều thứ ba là thứ khó gọi tên hơn và vẫn đáng được gọi tên: cảm nhận về độ tự nhiên trên một giọng tiếng Anh duy nhất. Tổng hợp của Qwen từ trước đến nay vốn xuất sắc với tiếng Trung và chỉ ở mức rất tốt với tiếng Anh, và dù bản phát hành 3.1 tuyên bố cải thiện khả năng thể hiện đa ngôn ngữ, vẫn chưa có bài kiểm tra nghe độc lập nào trên mô hình mới. Bất kỳ ai nói với bạn rằng họ biết giọng Qwen mới nghe như thế nào bằng tiếng Anh đều đang đoán mò.

Con số mà chưa ai nên trích dẫn

Đây là phần của câu chuyện sẽ bị xuyên tạc trong các bài đưa tin, nên xin nói rõ ràng ở đây. Qwen-Audio-3.1-TTS không có điểm đánh giá độc lập nào. Phiên bản tiền nhiệm của nó, Qwen-Audio-3.0-TTS-Plus, đứng ở mức 1.234 Elo trên bảng xếp hạng Provider Voice Arena của Artificial Analysis tính đến giữa tháng 8 năm 2026, xếp hạng từ thứ hai đến thứ năm trên bảng đó. Qwen-Audio-3.1-TTS vẫn chưa được thêm vào bất kỳ đấu trường nào. Mọi tuyên bố về chất lượng trong tài liệu ra mắt của Alibaba đều do nhà cung cấp tự báo cáo và chưa được tái lập.

Điều đó không làm cho những tuyên bố trở thành sai. Nó khiến chúng chưa được xác minh, và điều đó có nghĩa là cách mô tả trung thực cho cuộc so tài này ở thời điểm hiện tại là: một mô hình có giá nhưng không có điểm số, đối đầu với một mô hình có điểm số và mức giá cao hơn nhiều. Bất cứ điều gì mạnh hơn thế đều là suy đoán khoác lên mình bộ áo của benchmark.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in its August 2026 state, ranking text-to-speech models by Elo: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,234 and ElevenLabs Eleven v3 at 1,168.

Nguyên tắc tương tự cũng áp dụng cho độ trễ. Con số token đầu tiên được Alibaba nhấn mạnh cho phần ASR của dòng sản phẩm này — 92 mili giây — đến từ đánh giá hiệu năng có độ đồng thời cao của chính công ty trên thông số 0.6B, không phải từ kiểm thử của bên thứ ba; và các phân tích công bố từ sau khi ra mắt lưu ý rằng ASR và TTS là những sản phẩm riêng biệt trong một pipeline chứ không phải một mô hình đầu-cuối duy nhất, đồng thời các báo cáo từ cộng đồng mô tả độ trễ tích tụ trong các cuộc hội thoại dài theo kiểu pseudo-streaming. Hãy coi các con số độ trễ của nhà cung cấp trong toàn bộ dòng sản phẩm này là mức trần, chứ không phải trải nghiệm đã được đo lường.

Việc giảm giá có giá trị gì trong thực tế

Hãy lấy một khối lượng công việc thực tế: một sản phẩm tổng hợp 20 triệu ký tự lời dẫn mỗi tháng bằng cả tiếng Anh lẫn tiếng Quan Thoại. Với mức giá khoảng 100 USD mỗi triệu ký tự của ElevenLabs Eleven v3, con số đó là khoảng 2.000 USD một tháng, tức 24.000 USD một năm. Ở mức giá khoảng 27,60 USD mỗi triệu ký tự của Qwen-Audio-3.0-TTS-Plus, cùng khối lượng đó vốn đã chỉ khoảng 552 USD một tháng. Áp dụng mức giảm ~70% mà Alibaba công bố ngày 23 tháng 9, cùng khối lượng công việc ấy sẽ rơi xuống chỉ còn vài trăm USD một tháng.

Không có con số nào trong số đó là giá niêm yết mà bạn có thể ký hợp đồng dựa trên đó — ElevenLabs tính phí bằng tín dụng thông qua các gói đăng ký, còn mức cắt giảm của Alibaba là phần trăm giảm so với các mức giá khác nhau theo khu vực và theo gói. Nhưng hình dạng của phép so sánh là rõ ràng, và chính hình dạng đó là thứ bạn dựa vào để lập ngân sách.

Một lưu ý đáng nêu ra cho bất kỳ ai đang mô hình hóa điều này một cách cẩn thận: Alibaba Cloud đã chuyển cách tính phí phiên âm thời gian thực trên node Singapore từ tính theo thời lượng sang tính theo token, với mức $0,93 mỗi triệu token đầu vào và $0,70 mỗi triệu token đầu ra. Tính phí theo token khó dự đoán hơn so với tính phí theo thời lượng khi bạn không kiểm soát được một đoạn âm thanh nhất định sẽ trở thành bao nhiêu token, và tiếng ồn, khoảng lặng cùng ngữ cảnh nhiều lượt đều làm tăng mức tiêu thụ token. Một mức giảm 70% được công bố không tự động đồng nghĩa với mức tiết kiệm 70% trên lưu lượng cụ thể của bạn.

Làm thế nào để thực sự chạy switch

Nếu bạn đang đánh giá điều này, điều hữu ích cần biết là việc di chuyển sẽ tiêu tốn của bạn bao nhiêu thời gian kỹ thuật. Cả hai mô hình đều là API đóng được lưu trữ, nên dù sao bạn cũng đang tích hợp với một điểm cuối HTTP, và công việc chỉ là một client, một chính sách thử lại và một danh mục giọng nói — không phải là tái kiến trúc.

Đó là lúc đặc tính của OrcaRouter phát huy tác dụng, nhưng trước tiên xin nói thẳng một điều: chúng tôi không định tuyến Qwen-Audio-3.1-TTS hay bất kỳ mô hình Qwen-Audio nào. Các endpoint giọng nói của Alibaba nằm ngoài phạm vi của chúng tôi, và điều tương tự cũng đúng với ElevenLabs. Thứ chúng tôi bao phủ là lớp suy luận xung quanh chúng — một API key duy nhất cho hơn 200 mô hình văn bản với mức markup 0%, nghĩa là giá niêm yết của nhà cung cấp được chuyển thẳng qua, nên khi nhà cung cấp cắt giảm giá thì phía chúng tôi cập nhật ngay trong cùng ngày thay vì phải chờ qua một chu kỳ định giá lại. Với các đội ngũ đang xây dựng ứng dụng điều khiển một pipeline giọng nói — công cụ tóm tắt, công cụ tạo kịch bản, công cụ lập kế hoạch nội dung — điều đó nghĩa là một hợp đồng duy nhất thay vì nhiều hợp đồng, tự động chuyển đổi dự phòng khi một upstream bị suy giảm, cùng một DSL định tuyến để kết hợp các mô hình vào một lệnh gọi duy nhất. Điều đó không có nghĩa là bạn gọi giọng nói của Qwen thông qua chúng tôi. Ai nói với bạn điều ngược lại thì hẳn chưa đọc danh mục sản phẩm.

Ai nên di chuyển, và ai nên chờ đợi

Hãy chuyển ngay nếu khối lượng công việc của bạn ưu tiên tiếng Trung, nếu độ bao phủ phương ngữ nằm trong danh sách yêu cầu của bạn, nếu chi phí theo khối lượng là ràng buộc khiến bạn phải dùng một giọng nói rẻ hơn nhưng kém hơn, hoặc nếu bạn cần một giọng nói mang thương hiệu duy nhất có thể trụ vững khi chuyển đổi ngôn ngữ. Mức giá ngày 23 tháng 9 khiến bài toán kinh tế khó mà phản đối, và chất lượng tiếng Trung vốn đã có sức cạnh tranh ngay cả trước đó.

Khoan đã nếu bạn phát hành bằng hơn khoảng mười sáu ngôn ngữ, nếu sản phẩm của bạn phụ thuộc vào một thư viện giọng nói có thể cấp phép thay vì nhân bản giọng nói, nếu bạn đã lún sâu vào công cụ lồng tiếng hoặc công cụ tác nhân của một nền tảng, hoặc nếu quy trình thu mua của bạn yêu cầu điểm chất lượng độc lập trước khi phê duyệt. Không điều nào trong số đó là trở ngại vĩnh viễn, nhưng không điều nào trong số đó được giải quyết bằng một đợt giảm giá.

Và hãy để ý một điều cụ thể: liệu Qwen-Audio-3.1-TTS có xuất hiện trên một đấu trường nghe mù hay không. Ngay khi nó xuất hiện, so sánh này không còn là về giá cả và số lượng ngôn ngữ nữa, mà bắt đầu là về việc liệu giọng rẻ hơn có thực sự tốt như vậy không. Đó là câu hỏi mà buổi ra mắt đã không trả lời.