
StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: Một trong hai có Điểm Arena, và đó không phải là cái mới
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Đây là toàn bộ so sánh trong một dòng. Qwen-Audio-3.0-TTS nằm trên Text-to-Speech Arena với mức Elo 1.234 cho hạng Plus của nó — số điểm đạt được qua 2.502 phiếu nghe mù. StepAudio 3 TTS, được StepFun phát hành vào ngày 15 tháng 9 năm 2026, hoàn toàn không có trên bảng xếp hạng đó. Phiên bản tiền nhiệm của nó là: StepAudio 2.5 TTS giữ mức Elo 1.209 từ 1.306 phiếu bầu.
Vậy câu hỏi thực sự không phải là “cái nào nghe hay hơn”. Mà là liệu khoảng cách Elo 25 điểm, được đo trên thế hệ trước, có còn đứng vững sau một bản phát hành mà StepFun nói rằng đã cải thiện ngữ điệu và giảm giá hơn một nửa hay không. Chưa ai tiến hành cuộc bình chọn đó, và mọi thứ bên dưới được sắp xếp xoay quanh khoảng trống đó trong bằng chứng thay vì giả vờ nó không tồn tại.
Bảng, đúng như những gì nó thực sự thể hiện hôm nay
Đáng để xem bảng xếp hạng thật, vì một số bài viết đang lan truyền trích dẫn một phiên bản đã lỗi thời của chúng. Đấu trường nghe mù xếp hạng các mô hình tổng hợp dựa trên việc người bình chọn thích mẫu nào hơn. Hãy đọc ngang qua phần trên cùng của bảng giọng nói nhà cung cấp:
• Cartesia Sonic 3.6 — Elo 1,277, tháng 8 năm 2026, $49.0 mỗi triệu ký tự
• Inworld Realtime TTS-2 — Elo 1.243, tháng 8 năm 2026, 20,8 USD mỗi triệu ký tự
• SpeechifyAI Simba 3.2 — Elo 1.238, tháng 7 năm 2026, 6,6 USD mỗi triệu ký tự
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1.234, tháng 7 năm 2026, 27,6 USD mỗi triệu ký tự, 8 giọng arena
• VUI Labs Luna TTS — Elo 1.229, tháng 6 năm 2026, $80,0 mỗi triệu ký tự
• Inworld Realtime TTS-2 Flash — Elo 1.213, tháng 8 năm 2026, 10,4 USD cho mỗi triệu ký tự
• StepFun StepAudio 2.5 TTS — Elo 1.209, tháng 8 năm 2026, 85,0 USD cho mỗi triệu ký tự, 8 giọng đấu trường
• Google Gemini 3.1 Flash TTS — Elo 1.204, tháng 4 năm 2026, 18,3 USD cho mỗi triệu ký tự

Hai điều rút ra ngay lập tức từ danh sách đó. Điều đầu tiên là gói Plus của Qwen không phải là kẻ dẫn đầu — nó đứng thứ tư, sau Cartesia, Inworld và Speechify, và con số 1,234 được trích dẫn như một vương miện chỉ là điểm tầm trung trên một bảng xếp hạng đã thay đổi kể từ đó. Điều thứ hai là StepAudio 2.5 TTS đã được chạy lại vào tháng 8 năm 2026 và xếp thứ bảy, kém Qwen 25 Elo, với mức giá gấp hơn ba lần.
Và điều thứ ba còn quan trọng hơn tất cả những điều trên: hãy nhìn vào các khoảng tin cậy. Gói Plus của Qwen được liệt kê ở mức −14/+14 trên 2.502 mẫu. StepAudio 2.5 TTS được liệt kê ở mức −16/+16 trên 1.306 mẫu. Các khoảng đó chồng lấn nhau. Khoảng cách 25 điểm giữa hai mô hình có thanh sai số trải rộng 14 và 16 điểm theo cả hai hướng không phải là một khác biệt chất lượng đã được chứng minh — mà là hai mô hình mà đấu trường hiện tại chưa thể phân tách, được xếp theo một thứ tự mà chỉ cần thêm vài trăm phiếu bầu nữa là có thể đảo ngược.

Điểm dữ liệu bị thiếu khiến bạn phải trả giá như thế nào
StepAudio 3 TTS là mô hình mà StepFun dùng để thay thế StepAudio 2.5 TTS, và khi ra mắt, nó tuyên bố có khả năng kiểm soát âm sắc, ngữ điệu, nhịp điệu và khoảng dừng lấy hơi, cùng các hành vi cận ngôn ngữ — tiếng cười, sự ngập ngừng, nói lắp, lặp lại, tự sửa lỗi — được truyền tải qua một kiến trúc streaming, nơi quá trình tạo và phát lại diễn ra chồng lấn.
Đó chính xác là tập hợp những phẩm chất mà đấu trường đo lường. Đó cũng chính xác là lý do vì sao việc thiếu vắng một điểm số gây bực bội thay vì chí mạng: bài đánh giá có thể trả lời câu hỏi ấy thì tồn tại, được vận hành công khai, và đơn giản là chưa được chạy lại kể từ khi mô hình mới ra mắt. Bất kỳ ai nói với bạn rằng StepAudio 3 TTS nghe hay hơn Qwen-Audio-3.0-TTS đều đang ngoại suy từ một phiên bản tiền nhiệm vốn đã thua với cách biệt nằm trong chính khoảng sai số của nó.
Giá là phần được ghi chép đầy đủ, và nó đã biến động rất nhiều
StepAudio 3 TTS tính phí 2,5 nhân dân tệ cho mỗi 10.000 ký tự trên nền tảng của chính StepFun. StepAudio 2.5 TTS được tính phí ở mức 5,8. Trên cột giá theo ký tự của chính đấu trường, mô hình cũ có giá $85,00 cho mỗi triệu ký tự; 2,5 nhân dân tệ cho mỗi 10.000 ký tự tương đương khoảng $35 cho mỗi triệu theo tỷ giá gần đây — một cách quy đổi của chúng tôi chứ không phải một con số đã được công bố, và đáng để làm lại theo khu vực và tỷ giá ngoại hối của riêng bạn. Đó là mức cắt giảm gần 60% trên cùng một khoản mục.
Nó vẫn cao hơn Qwen. Qwen-Audio-3.0-TTS-Plus được niêm yết ở mức 27,6 USD mỗi triệu ký tự, và gói Flash thậm chí còn rẻ hơn, với Alibaba Cloud Model Studio tính phí tổng hợp theo ký tự đầu vào thay vì theo âm thanh tạo ra — đầu ra không bị tính phí riêng. Các nền tảng bên thứ ba niêm yết gói Flash báo giá ở mức cao trong khoảng mười mấy đô la mỗi triệu, dù sự khác biệt theo khu vực khiến bất kỳ con số tiêu đề đơn lẻ nào cũng không đáng tin cậy.
Vậy cục diện là thế này: StepFun đã giảm chi phí tổng hợp xuống khoảng một nửa, thu hẹp phần lớn khoảng cách với Qwen, và không vượt qua được nó. Nếu giá trên mỗi ký tự là ràng buộc quyết định của bạn, lập luận sẽ thu hẹp lại nhưng câu trả lời không thay đổi. Nếu không phải vậy, giá đã không còn là lý do để chọn mô hình nào trong hai mô hình.
Kho giọng nói và độ bao phủ ngôn ngữ không gần nhau
Đây là lúc việc so sánh không còn là vấn đề phán đoán chủ quan nữa mà trở thành một câu hỏi về đặc tả.
• Kho giọng nói — Qwen-Audio-3.0-TTS có hơn 1.000 giọng nói trên các phân hạng của nó, so với StepAudio 3 TTS không có số lượng công bố tương đương
• Ngôn ngữ — Qwen-Audio-3.0-TTS 16 ngôn ngữ cùng 20 phương ngữ Trung Quốc, với phiên bản Flash được tinh chỉnh cho các ngôn ngữ ít tài nguyên và tính xác thực phương ngữ, so với StepAudio 3 TTS vốn ưu tiên tiếng Trung và không có tuyên bố bao phủ tương đương
• Kích thước yêu cầu — Qwen-Audio-3.0-TTS 20,000 ký tự mỗi yêu cầu so với StepAudio 3 TTS không được công bố
• Độ trễ — Qwen-Audio-3.0-TTS Flash hướng tới độ trễ gói đầu tiên trong vòng 200 ms theo tài liệu của chính Alibaba, so với chế độ truyền phát của StepAudio 3 TTS, vốn không có số liệu được công bố
• Phân tầng — Qwen-Audio-3.0-TTS Plus cho khả năng biểu cảm và Flash cho thời gian thực, sáu giọng nói hàng đầu bị khóa vào tầng này hoặc tầng kia so với StepAudio 3 TTS chỉ có một tầng
• Bề mặt điều khiển — chỉ dẫn cách thể hiện bằng ngôn ngữ tự nhiên của Qwen-Audio-3.0-TTS cùng các thẻ biểu cảm nội tuyến như [excited], [laughing], [whispers] được nhúng trong văn bản đầu vào so với ngữ điệu do mô hình StepAudio 3 TTS suy luận từ ngữ cảnh
• Nhân bản giọng nói — StepAudio 3 TTS mức giá cố định 9,9 nhân dân tệ cho mỗi giọng nói được nhân bản trên tất cả các gói TTS, so với tính năng nhân bản của Qwen-Audio-3.0-TTS thông qua Alibaba Cloud Model Studio
• Đầu ra — Qwen-Audio-3.0-TTS tốc độ lấy mẫu mặc định 24 kHz so với StepAudio 3 TTS không được công bố
Hàng bề mặt điều khiển đó mới là khác biệt thiết kế thực sự, và nó không phải là một câu hỏi về chất lượng. Các thẻ biểu cảm của Qwen tường minh và đồng bộ: bạn viết cảm xúc vào văn bản và mô hình thể hiện nó ra, điều này khiến chúng có thể kiểm thử và thân thiện với hồi quy. Mô tả của StepFun là về một mô hình tự suy ra sự ngập ngừng hay tiếng cười phù hợp từ ngữ cảnh, nghe hay hơn khi nó đúng và khó xác định hơn nhiều khi nó sai. Hãy chọn dựa theo việc bạn muốn tự dàn dựng màn trình diễn hay giao phó nó.

Làm thế nào để quyết định mà không có phép đo
Bạn không thể suy luận để tìm ra câu trả lời từ những con số đã công bố, vì con số mang tính quyết định không hề tồn tại. Điều đó chỉ còn lại việc kiểm thử, và việc kiểm thử hai thứ này có một dạng thức cụ thể đáng để tính trước.
Cả hai đều là API thương mại chỉ chạy trên hạ tầng của nhà cung cấp — Qwen-Audio-3.0-TTS thông qua Alibaba Cloud Model Studio, StepAudio 3 TTS thông qua nền tảng mở của StepFun. Cả hai đều không phải trọng số mở, nên không có cách tự triển khai để đánh giá. Nói chính xác về những gì OrcaRouter đáp ứng ở đây: các mô hình chuyển văn bản thành giọng nói trong danh mục của chúng tôi hiện nay là dòng OpenAI tts-1, gpt-4o-mini-tts và các bản xem trước Gemini TTS của Google. Không mô hình nào trong số các mô hình được đề cập trong bài viết này nằm trong đó, và Qwen-Audio-3.0-TTS cũng không — không có nội dung nào ở đây nên được hiểu là tuyên bố rằng chúng tôi cung cấp chúng.
Phần thực sự nằm trên OrcaRouter là nửa văn bản của pipeline. Các script mà lớp tổng hợp của bạn đọc được tạo bởi một mô hình ngôn ngữ, và đó là thành phần thay đổi thường xuyên nhất, tốn kém nhất khi phải ký hợp đồng lại, và dễ bị để không ghim phiên bản nhất — gần 200 mô hình văn bản sau một API, tự động chuyển đổi dự phòng, một routing DSL kết hợp nhiều mô hình thành một lời gọi, và model fusion khi phán đoán của một mô hình là chưa đủ, với giá niêm yết của nhà cung cấp được chuyển nguyên, không cộng thêm phụ phí. Nếu bạn chạy đánh giá mù giữa hai mô hình tổng hợp này, hãy tạo ngữ liệu qua một endpoint để cả hai ứng viên đọc cùng một đầu vào, và giữ lớp tổng hợp phía sau một giao diện mà bạn có thể hoán đổi.
Điều này để lại quyết định ở đâu
Hãy chọn Qwen-Audio-3.0-TTS ngay hôm nay nếu bạn cần độ bao quát — hơn một nghìn giọng nói, 16 ngôn ngữ và 20 phương ngữ, giới hạn yêu cầu 20.000 ký tự đã được ghi trong tài liệu, một hạng độ trễ và một hạng khả năng biểu cảm, mục tiêu 200 ms cho gói đầu tiên, và mức giá thấp hơn của StepFun. Đây là mô hình có số đo thực tế đằng sau và phạm vi rộng hơn, và vị trí thứ tư trên Elo của nó là một kết quả thật, dù nó không phải là ngôi vương như nó thường được trích dẫn.
Hãy chọn StepAudio 3 TTS nếu bạn đang xây dựng theo hướng ưu tiên tiếng Trung, muốn chỉ một gói duy nhất thay vì phải đưa ra quyết định chọn gói, muốn nhân bản giọng với mức phí cố định đã công bố, và sẵn sàng đón đầu một mô hình chưa được kiểm nghiệm mù. Bạn đang trả cao hơn khoảng 27% cho mỗi ký tự so với gói Plus của Qwen để đổi lấy một thế hệ cải thiện ngữ điệu được cho là vượt trội so với một mô hình từng kém 25 Elo với các thanh sai số chồng lấn.
Điều có thể giải quyết chuyện này là chạy lại đấu trường một lần với StepAudio 3 TTS trong nhóm. Cho đến khi cuộc bỏ phiếu đó diễn ra, đây là một mô hình đã được đo lường đối đầu với một mô hình chưa được đo lường, và 25 điểm tách biệt các phiên bản tiền nhiệm của chúng nằm trong ngưỡng nhiễu — đó không phải là một bảng xếp hạng, và không nên được bán như thể là một bảng xếp hạng.
