Một thẻ hero so sánh Qwen-Audio-3.0-TTS và Qwen-Audio-3.1-TTS, liệt kê bản phát hành ngày 20 tháng 7 năm 2026, Elo 1.238 và 86 thẻ thể hiện nội tuyến của mẫu cũ hơn, đối chiếu với thông báo ngày 23 tháng 9 năm 2026, mức giảm giá 70% và điều khiển dựa trên hướng dẫn của mẫu mới hơn, với một mũi tên được gắn nhãn 'chín tuần' ở giữa chúng.
Guides & Insights

Qwen-Audio-3.1-TTS so với Qwen-Audio-3.0-TTS: Hai tháng đã mang lại những gì

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Qwen-Audio-3.0-TTS ra mắt vào ngày 20 tháng 7 năm 2026 và vươn thẳng lên đỉnh các bảng xếp hạng giọng nói độc lập — gói Plus đạt 1.238 Elo trên bảng xếp hạng Provider Voice Arena của Artificial Analysis, đứng thứ hai trên bảng. Chín tuần sau, vào ngày 23 tháng 9 năm 2026, nhà cung cấp công bố Qwen-Audio-3.1-TTS tại Hội nghị Apsara ở Hàng Châu kèm mức giảm giá khoảng 70%. Thời điểm đó khiến đây trở thành một so sánh khác thường: mẫu đang bị thay thế không hề lỗi thời, nó đã được đánh giá chuẩn, đã được chứng minh và vẫn ở gần vị trí dẫn đầu. Vậy nên câu hỏi thực sự không phải là mẫu nào tốt hơn. Mà là cụ thể điều gì đã thay đổi, liệu có điều nào trong đó ảnh hưởng đến khối lượng công việc của bạn hay không, và điều gì sẽ xảy ra với điểm số mà bạn đã tin tưởng khi mẫu kế nhiệm vẫn chưa được chấm điểm chút nào.

Hai tháng, năm điểm cuối, một gia đình

Alibaba không chỉ phát hành một mô hình duy nhất. Bản phát hành 3.1 bao gồm năm mô hình: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next và Qwen-Audio-3.1-Realtime. Đối với bất kỳ ai hiện đang gọi Qwen-Audio-3.0-TTS, chỉ một trong số đó là bản thay thế trực tiếp — gói TTS thông thường — và một mô hình là sản phẩm mới thực sự chứ không phải bản nâng cấp.

Cái thứ hai đó đáng để hiểu ngay cả khi bạn không bao giờ gọi nó. Qwen-Audio-3.1-TTS-Next là thứ mà Alibaba gọi là mô hình “Audiogen”: một lượt duy nhất tạo ra giọng nói, hiệu ứng âm thanh và âm thanh nền cùng nhau từ văn bản, dấu thời gian và âm thanh tham chiếu. Hội thoại nhiều người nói, ghép podcast, âm cảnh cảnh quay, đầu ra 48 kHz. Tài liệu Model Studio của Alibaba Cloud liệt kê rõ ràng các giới hạn của nó — 3.000 ký tự đầu vào, 240 giây âm thanh được tạo cho podcast và 120 giây trong trường hợp khác, 3 yêu cầu mỗi giây, đầu ra WAV, MP3 hoặc PCM, và nó chấp nhận tối đa ba clip tham chiếu dài 30 giây mỗi clip ở định dạng WAV, MP3 hoặc OGG Opus. Đầu vào tham chiếu PCM thô không được hỗ trợ. Giá là 0,848 USD cho mỗi triệu token đầu vào và 1,696 USD cho mỗi triệu token đầu ra trên node Bắc Kinh, không bao gồm mức giá khuyến mãi, và nó chỉ xử lý tiếng Trung và tiếng Anh.

Nếu bạn đang dùng 3.0-TTS và công việc của bạn là “biến kịch bản này thành giọng nói”, thì không có gì trong đó làm thay đổi tích hợp của bạn. Nếu công việc của bạn là “lắp ghép một podcast có hai người dẫn với nhạc nền”, thì 3.1-TTS-Next là một hạng mục sản phẩm khác và có thể chính là lý do để bạn xem xét bản phát hành này.

Bản nâng cấp, từng dòng một

A two-column scoreboard for Qwen-Audio-3.1-TTS and Qwen-Audio-3.0-TTS across languages, dialects, timbre transfer, delivery control, noisy reference audio and arena score, with a footer stating that the 3.1 figures are vendor-reported and unscored and the 3.0 Plus Elo is per Artificial Analysis.

• Ngôn ngữ — Qwen-Audio-3.1-TTS: theo báo cáo của nhà cung cấp là 16 ngôn ngữ, với bảy ngôn ngữ được bổ sung so với thế hệ trước. Qwen-Audio-3.0-TTS: 16 ngôn ngữ như được liệt kê trong các bài đưa tin đã công bố về bản phát hành tháng Bảy.

• Phương ngữ Trung Quốc — Qwen-Audio-3.1-TTS: 20 vùng phương ngữ, được kế thừa. Qwen-Audio-3.0-TTS: 20 vùng phương ngữ.

• Chuyển đổi âm sắc xuyên ngôn ngữ — Qwen-Audio-3.1-TTS: có, một giọng nói được giữ nguyên qua tiếng Quan Thoại, tiếng Quảng Đông, tiếng Anh và tiếng Nhật. Qwen-Audio-3.0-TTS: không hỗ trợ.

• Kiểm soát cách thể hiện — Qwen-Audio-3.1-TTS: điều khiển cảm xúc, tốc độ và phong cách dựa trên chỉ dẫn. Qwen-Audio-3.0-TTS: 86 thẻ thể hiện nội tuyến.

• Đầu vào tham chiếu nhiễu — Qwen-Audio-3.1-TTS: xử lý trực tiếp âm thanh tham chiếu bị nhiễu hoặc có tiếng vọng, không có chế độ khử nhiễu riêng. Qwen-Audio-3.0-TTS: yêu cầu âm thanh tham chiếu sạch.

• Điểm số độc lập — Qwen-Audio-3.1-TTS: chưa có. Qwen-Audio-3.0-TTS-Plus: 1.238 Elo trên bảng xếp hạng Provider Voice Arena của Artificial Analysis tính đến tháng 8 năm 2026.

Số lượng ngôn ngữ không khớp, và điều đó quan trọng.

Đây là một chi tiết nhỏ mà sẽ bị lấp liếm ở mọi nơi khác, nên nó đáng để nêu rõ. Tài liệu ra mắt của Alibaba nói rằng hạng 3.1 TTS bổ sung bảy ngôn ngữ. Các bài đưa tin đã công bố về thế hệ 3.0 tháng Bảy — bao gồm cả các bài so sánh của chính chúng tôi từ tháng đó — liệt kê 16 ngôn ngữ cho hạng 3.0. Bảy cộng với 16 là 23, không phải 16, và Alibaba vẫn chưa công bố bản đối chiếu hai con số này.

Những lời giải thích khả dĩ đều kém hào nhoáng: con số 3.1 có thể đang đếm một tập hợp khác, con số 3.0 có thể đã bị phóng đại khi ra mắt, hoặc “thêm bảy” có thể mô tả bậc ASR chứ không phải TTS. Chúng ta không biết là trường hợp nào. Điều chúng ta biết là số lượng ngôn ngữ ở cả hai phía của phép so sánh này là con số do nhà cung cấp tự báo cáo, chưa từng được kiểm toán độc lập, và bất kỳ ai trích dẫn “16 ngôn ngữ” như một dữ kiện chắc chắn về một trong hai mô hình đều đang trích dẫn một slide tiếp thị. Hãy đối chiếu những ngôn ngữ cụ thể mà bạn cần với tài liệu Model Studio trước khi bạn lập kế hoạch dựa trên một con số.

A screenshot of Alibaba Cloud Model Studio's English documentation site with the Speech-to-Speech branch of the navigation open, showing the reference page for qwen3.8-livetranslate-flash-realtime with its model capabilities and context limit tables, under an Apsara 2026 Conference banner.

Kiểm soát chỉ thị là thay đổi thực sự xuất hiện trong mã

Trong mọi thứ thuộc bản phát hành TTS 3.1, đây là thứ làm thay đổi cách bạn viết prompt. Thế hệ 3.0 kiểm soát cách thể hiện thông qua 86 thẻ nội tuyến — một vốn từ cố định mà bạn phải học, chèn vào đúng vị trí, và nó chỉ làm đúng những gì được ghi và không hơn. Bậc 3.1 thay thế điều đó bằng chỉ dẫn ngôn ngữ tự nhiên: bạn mô tả cảm xúc, nhịp độ, phong cách mà bạn muốn, và mô hình diễn giải nó.

Khác biệt thực tế nằm ở tính biểu đạt so với tính dự đoán được. Một bộ từ vựng thẻ là một hợp đồng — cùng một thẻ luôn tạo ra cùng một cách thể hiện mỗi lần, đó là điều bạn muốn trong một dây chuyền sản xuất nơi một giọng nói phải nhất quán trên mười nghìn clip. Chỉ dẫn dạng tự do thì rộng hơn nhưng lỏng hơn, và nó thừa hưởng vấn đề độ nhạy với prompt thường thấy: hai cách diễn đạt “ấm áp nhưng không ủy mị” sẽ không cho kết quả giống hệt nhau, và hai lần gọi cùng một cách diễn đạt vào những ngày khác nhau cũng vậy.

Nếu pipeline hiện tại của bạn được xây dựng trên 86 thẻ đó, thì việc nâng cấp không hề miễn phí. Bạn đang đánh đổi một bề mặt điều khiển mang tính xác định để lấy một bề mặt mang tính xác suất, và công việc chuyển đổi không nằm ở lệnh gọi API — mà là xác thực lại mọi mẫu prompt bạn có theo cách diễn giải của mô hình mới. Hãy dự trù ngân sách cho việc đó trước khi bạn dự trù ngân sách cho khoản tiết kiệm.

Chuyển đổi âm sắc xuyên ngôn ngữ, và nó thực sự để làm gì

Một giọng tham chiếu duy nhất, được mang xuyên suốt tiếng Quan Thoại, tiếng Quảng Đông, tiếng Anh và tiếng Nhật, vẫn giữ nguyên bản sắc khi ngôn ngữ thay đổi. Trên giấy tờ, điều này đọc như một gạch đầu dòng tính năng. Trong thực tế, nó giải quyết một vấn đề cụ thể và tốn kém: một người dẫn chương trình duy nhất phải hiện diện ở nhiều hơn một ngôn ngữ mà không nghe như một người khác trong mỗi ngôn ngữ.

Giải pháp tình thế truyền thống là thuê một diễn viên lồng tiếng riêng cho mỗi ngôn ngữ và chấp nhận rằng giọng thương hiệu của bạn giờ đây là bốn giọng khác nhau cùng dùng chung một kịch bản. Giải pháp thay thế là nhân bản một người nói sang từng ngôn ngữ, đúng kiểu quy trình mà các giọng nhân bản thường bị trôi — khẩu âm vẫn còn, âm sắc mỏng đi, và người nghe nhận ra chỉ trong vòng một câu. Chuyển âm sắc xuyên ngôn ngữ là tuyên bố rằng không cần phải thỏa hiệp theo cách nào trong hai cách đó.

Hiện tại, nó cũng hoàn toàn chưa được kiểm chứng. Không có bài kiểm tra nghe nào từ bên thứ ba đối với Qwen-Audio-3.1-TTS ở bất kỳ ngôn ngữ nào, và các bản demo của chính Alibaba là bằng chứng duy nhất cho thấy khả năng chuyển giao này vẫn đúng. Nếu khả năng này là lý do bạn đang cân nhắc nâng cấp, hãy kiểm tra nó trên âm thanh tham chiếu của chính bạn trước khi quyết định — đó là một thử nghiệm năm phút và là thử nghiệm duy nhất trả lời được câu hỏi.

Việc giảm giá tác động thế nào đến dự luật 3.0

Alibaba đã cắt giảm giá dịch vụ giọng nói trên toàn bộ các dịch vụ: tổng hợp khoảng 70%, thời gian thực khoảng 85%, nhận dạng lên tới 95%. Đợt điều chỉnh có hiệu lực trên Alibaba Cloud Model Studio vào 00:00 ngày 22 tháng 9 năm 2026 theo giờ Bắc Kinh, bao gồm các khu vực Bắc Kinh và Singapore, và áp dụng cho các endpoint TTS 3.1 và realtime 3.0. Sau điều chỉnh, bậc TTS Flash niêm yết ở mức 1,5 nhân dân tệ mỗi triệu token đầu vào và 12 nhân dân tệ mỗi triệu token đầu ra; bậc realtime Flash niêm yết ở mức 1,5 cho đầu vào văn bản, 6 cho đầu vào âm thanh, 4,5 cho đầu ra văn bản và 12 cho đầu ra kết hợp văn bản và âm thanh, trên mỗi triệu token.

Đây là phần quan trọng nếu bạn đang chạy 3.0-TTS. Gói 3.0 Plus đang dao động quanh mức 27,60 đô la cho mỗi triệu ký tự trên Artificial Analysis tính đến tháng 8, còn gói Flash ở quanh mức 15 đô la. Nếu mức giảm khoảng 70% áp dụng cho gói bạn dùng, hóa đơn của bạn với cùng khối lượng công việc sẽ giảm xuống chỉ còn khoảng một phần ba so với trước — mà bạn không cần thay đổi một dòng mã nào. Đó là điều bất thường ở bản phát hành này: với một khách hàng dùng 3.0, việc giảm giá còn đáng giá hơn cả việc nâng cấp mô hình, và nó đến bất kể bạn có chuyển đổi hay không.

Hai điều cần lưu ý. Mức cắt giảm theo phần trăm được báo giá dựa trên các mức giá khác nhau theo khu vực và theo gói, nên con số 70% trên tiêu đề không phải là lời hứa về lưu lượng cụ thể của bạn. Và Alibaba Cloud đã chuyển việc tính phí phiên âm thời gian thực trên node Singapore từ tính theo thời lượng sang tính theo token — 0,93 USD cho mỗi triệu token đầu vào và 0,70 USD cho mỗi triệu token đầu ra — đây là cơ sở khó dự đoán hơn khi khoảng lặng, tiếng ồn và ngữ cảnh nhiều lượt đều làm tăng mức tiêu thụ token. Hãy đọc bảng giá mới dựa trên âm thanh của chính bạn, chứ không phải dựa trên thông cáo báo chí.

Khi nào Qwen-Audio-3.0-TTS vẫn là lựa chọn đúng đắn

Ba trường hợp, và chúng không phải là những trường hợp biên.

Khi bạn cần một con số có thể bảo vệ được.Qwen-Audio-3.0-TTS-Plus có điểm Elo độc lập là 1.238 — cùng bảng xếp hạng đó ghi 1.259 cho mô hình ấy vào tháng 9, vẫn đứng thứ hai, nghĩa là điểm số đã trôi lên chứ không hề suy giảm — từ một đấu trường nghe mù với hàng nghìn lượt bình chọn phía sau. Qwen-Audio-3.1-TTS hoàn toàn không có điểm đấu trường nào. Nếu quy trình phê duyệt của bạn đòi hỏi bằng chứng từ bên thứ ba, thì mô hình cũ hơn chính là cái có bằng chứng đó, và việc giảm giá không thay đổi được điều ấy.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, ranking text-to-speech models by Elo with vote counts and API pricing: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,259 on a rank range of 2-3, and ElevenLabs Eleven v3 at 1,166.

Khi tính xác định thắng tính biểu đạt. Nếu pipeline sản xuất của bạn được xây dựng trên bề mặt điều khiển 86-tag, bạn có một hệ thống mà bạn có thể suy luận về đầu ra của nó. Điều khiển dựa trên hướng dẫn có năng lực hơn và kém dự đoán được hơn, và chi phí chuyển đổi là có thật.

Khi không có gì trong bản nâng cấp này đụng đến khối lượng công việc của bạn. Nếu bạn tổng hợp tiếng Quan Thoại và tiếng Anh ở mức âm lượng vừa phải với giọng tham chiếu sạch và một bộ thẻ truyền đạt cố định, thì chuyển đổi âm sắc xuyên ngôn ngữ, khả năng chống nhiễu đầu vào và bảy ngôn ngữ bổ sung đều đang giải quyết những vấn đề mà bạn không hề mắc phải. Hãy chấp nhận mức giảm giá, giữ nguyên mô hình.

Vận hành cả hai mà không cần chạy hai tích hợp

Phần khó khăn của việc chuyển đổi từ thế hệ này sang thế hệ khác là bạn thường muốn cả hai mô hình hoạt động cùng lúc — 3.0 cho đường dẫn sản xuất với điểm số phía sau, 3.1 cho các ngôn ngữ mới và tính năng chuyển giao, và một cách để di chuyển lưu lượng giữa chúng mà không cần triển khai lại. Cả hai đều là API đóng được lưu trữ trên Alibaba Cloud Model Studio, vì vậy đó là hai điểm cuối, hai giới hạn tốc độ và hai chế độ lỗi đằng sau một tính năng.

Một lưu ý trung thực về vị trí của chúng tôi: OrcaRouter không định tuyến Qwen-Audio-3.1-TTS hay bất kỳ model Qwen-Audio nào, và chúng tôi hoàn toàn không định tuyến các endpoint giọng nói của Alibaba. Thứ chúng tôi cung cấp là lớp suy luận văn bản xung quanh một pipeline như thế này — một API key dùng chung cho hơn 200 model với mức markup 0%, giá niêm yết của nhà cung cấp được chuyển thẳng qua, nên việc nhà cung cấp giảm giá sẽ đến phía chúng tôi ngay trong ngày thay vì sau một chu kỳ định giá lại. Nếu dịch vụ đang vận hành pipeline giọng nói của bạn là trình tạo kịch bản, trình tóm tắt hay trình lập kế hoạch nội dung, điều đó nghĩa là một hợp đồng thay vì nhiều hợp đồng, tự động chuyển đổi dự phòng khi một upstream bị suy giảm, và một DSL định tuyến để kết hợp các model vào một lời gọi duy nhất. Điều đó không có nghĩa là bạn gọi giọng nói của Qwen thông qua chúng tôi, và bất kỳ trang nào gợi ý điều ngược lại là sai về danh mục của chính chúng tôi.

Bản tóm tắt trung thực

Qwen-Audio-3.1-TTS là một bản nâng cấp thực sự với ba bổ sung quan trọng — điều khiển cách thể hiện dựa trên hướng dẫn, chuyển đổi âm sắc xuyên ngôn ngữ, và khả năng chống chịu với âm thanh tham chiếu kém — cùng với việc giảm giá còn đáng giá hơn bất kỳ điều nào trong số đó. Qwen-Audio-3.0-TTS không bị thay thế theo cách mà một mô hình hai tháng tuổi thường bị: nó vẫn giữ một điểm chuẩn độc lập mà phiên bản kế nhiệm chưa đạt được, và nó vẫn bao phủ phạm vi phương ngữ Trung Quốc mà phần lớn sự khác biệt của dòng sản phẩm này dựa vào.

Vậy nên quyết định này hẹp hơn những gì hoạt động tiếp thị gợi ý. Nếu bạn đang tạo ở khối lượng lớn, thay đổi về giá đã thuộc về bạn. Nếu bạn cần các ngôn ngữ mới hoặc tính năng chuyển đổi âm sắc, hãy di chuyển và kiểm chứng tính năng đó trên chính âm thanh của bạn trước. Nếu bạn cần một con số chất lượng có thể bảo vệ được, hãy đợi cho đến khi Qwen-Audio-3.1-TTS xuất hiện trên một đấu trường nghe mù — đó là sự kiện duy nhất có thể giải quyết vấn đề này, và cho đến khi điều đó xảy ra, quan điểm trung thực là mẫu mới hơn là mẫu rẻ hơn còn mẫu cũ hơn là mẫu đã được chứng minh.