
GPT-Live-1 so với Qwen-Audio-3.0-TTS: Hội thoại và người dẫn chuyện không phải là cùng một hạng mục.
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình

Nếu đặt GPT-Live-1 và Qwen-Audio-3.0-TTS cạnh nhau xét theo giá mỗi giờ âm thanh thì khoảng cách trông thật dứt khoát: Qwen-Audio-3.0-TTS-Plus của Alibaba tổng hợp giọng nói ở mức $27.6 cho mỗi triệu ký tự, tương đương khoảng $1.66 âm thanh mỗi giờ, trong khi GPT-Live-1 của OpenAI tính $3.00 cho một giờ đường dây mở liên tục. Người dẫn chuyện rẻ hơn, nên người dẫn chuyện thắng — chỉ có điều đây là phép so sánh sai, và lý do nó sai chính là điều hữu ích nhất mà bất kỳ ai có thể rút ra từ màn so tài này. Qwen-Audio-3.0-TTS là mô hình chuyển văn bản thành giọng nói. GPT-Live-1 là mô hình hội thoại song công toàn phần. Một trong hai đọc những gì bạn đã viết. Cái còn lại phải quyết định, vài lần mỗi giây, liệu bạn đã nói xong chưa.
Một cái kết xuất, một cái trò chuyện
Chuyển văn bản thành giọng nói nhận văn bản và trả về âm thanh. Không có âm thanh đầu vào, không có lượt nào để thực hiện, không có khái niệm bị ngắt lời và không có bản chép lời để trả về, vì mô hình chưa từng nghe thấy gì. Mô hình chi phí của nó giống như một máy in: trang vào, âm thanh ra, chất lượng và thông lượng là hai con số duy nhất quan trọng, và bạn có thể đo cả hai trước khi phát hành.
Một mô hình hội thoại song công xử lý âm thanh đến trong khi vẫn đang tạo âm thanh đi. Nhiệm vụ của nó bao gồm những phần của cuộc hội thoại không liên quan đến từ ngữ — tạm dừng khi người dùng tạm dừng, tiếp tục xuyên qua một tín hiệu đáp lời như “ừ” thay vì coi đó là sự ngắt lời, nhường lượt nói giữa câu, và kích hoạt một lệnh gọi công cụ mà không làm đứt mạch. GPT-Live-1 làm được tất cả những điều đó và trả về bản chép lời nhận dạng giọng nói song song với phiên hội thoại, điều mà nó chỉ có thể làm được vì nó đã lắng nghe suốt quá trình.
Nếu sản phẩm của bạn đọc thành tiếng các bài viết, chuyển tài liệu thành âm thanh hoặc thuyết minh video, thì GPT-Live-1 là công cụ không phù hợp với mức giá mỗi giờ gấp bốn lần. Nếu sản phẩm của bạn nhận cuộc gọi điện thoại, Qwen-Audio-3.0-TTS chỉ là một phần ba của một quy trình vẫn còn cần mô hình ASR và mô hình ngôn ngữ để trở thành một cuộc trò chuyện.
Nơi Qwen-Audio-3.0-TTS thực sự là câu trả lời tốt nhất
Lập luận cho mô hình của Alibaba không phải là tiếp thị. Được phát hành vào ngày 20 tháng 7 năm 2026 bởi Tongyi Lab của Alibaba và được cung cấp dưới dạng API đóng, lưu trữ thông qua Alibaba Cloud Model Studio, phiên bản Plus đã chiếm vị trí đầu bảng trên đấu trường chuyển văn bản thành giọng nói của Artificial Analysis khi ra mắt. Tuy nhiên, bảng xếp hạng luôn biến động, và bảng này đã biến động: tính đến tháng 9 năm 2026, Qwen-Audio-3.0-TTS-Plus đứng thứ tư trên Provider Voice Arena với Elo 1.232 trên 2.306 mẫu, sau Cartesia Sonic 3.6 với 1.275, Inworld Realtime TTS-2 với 1.244 và Simba 3.2 của Speechify với 1.233 — ba mô hình từ tháng 8 và tháng 7 được phát hành sau nó. Đứng thứ tư trong hơn hai mươi mô hình, với vị trí dẫn đầu đã mất và lợi thế về giá vẫn còn nguyên, vẫn là một vị trí mạnh. Chỉ là nó không phải là vị trí mà các bài đưa tin ra mắt đã mô tả.

Nó dẫn đầu ở 10 trong số 16 ngôn ngữ mà nó hỗ trợ, bổ sung 20 vùng phương ngữ Trung Quốc, hỗ trợ nhân bản giọng nói từ mẫu ngắn bao gồm cả nhân bản xuyên ngôn ngữ, và mang 86 thẻ cảm xúc cùng cách thể hiện dạng nội tuyến.
Những lưu ý đó đủ cụ thể để có thể lập kế hoạch có tính đến chúng.
• Thông lượng — Plus tạo ra khoảng 16 ký tự mỗi giây, so với 30,2 của Simba 3.2, 27 của Gemini 3.1 Flash TTS và khoảng 120 của Sonic 3.5. Với kết xuất theo lô, điều này gần như không thấy được; nhưng với một sản phẩm chạy trực tiếp, đây chính là con số quyết định bộ đệm của bạn.
• Tài liệu về giá — con số $27,6 cho mỗi triệu ký tự được trích dẫn rộng rãi không phải mọi bản chụp đều khớp với trang định giá của chính Alibaba, trang này tại một số thời điểm đã liệt kê mức thấp hơn cho cả hai hạng. Hãy kiểm tra con số hiện tại ở cấp tài khoản trước khi bạn dự báo, chứ không phải con số của bảng xếp hạng.
• Thư viện giọng nói — mặc dù hỗ trợ 16 ngôn ngữ, các giọng cài sẵn công khai gần như hoàn toàn là tiếng Trung và tiếng Anh. Mười bốn ngôn ngữ còn lại tồn tại thông qua quy trình nhân bản thay vì có sẵn.
• Giới hạn tính năng — 86 thẻ cảm xúc nội tuyến chỉ hoạt động ở chế độ truyền luồng một chiều, nên khả năng điều khiển biểu cảm không được duy trì trên mọi đường tích hợp.
• Các hạng — Flash nhắm đến độ trễ gói đầu tiên khoảng 300 ms cho việc sử dụng thời gian thực; Plus là hạng chất lượng. Chúng là những sản phẩm khác nhau nhưng có cùng tên, và chọn nhầm là lỗi đầu tiên thường gặp.
Phiên bản trung thực của dự luật Cascade
Đây là điều mà so sánh theo giờ bỏ sót. Một sản phẩm đàm thoại được xây dựng trên mô hình TTS là một chuỗi xếp tầng: mô hình ASR chuyển lời nói của người gọi thành văn bản, mô hình ngôn ngữ quyết định sẽ nói gì, và mô hình TTS đọc nó. Ba nhà cung cấp, ba hóa đơn, ba ngân sách độ trễ cộng dồn, và một điểm bàn giao tại mỗi ranh giới nơi ngữ điệu biến mất. Chặng TTS có thể tốn $1.66 một giờ âm thanh. Hai chặng còn lại mới thực sự là nơi tiền bạc và sai sót nằm ở đó — và mô hình xếp tầng không thể nghe thấy một khoảng lặng ở giữa câu mà nó đang nói.
GPT-Live-1 gộp ba phần lại thành một phiên và một đồng hồ đo, với mức $0.05 mỗi phút thoại, còn backend suy luận được tính phí riêng. Có hai chi tiết giữ cho hóa đơn đó minh bạch. Việc khởi tạo phiên tính trước 15 giây thoại, được trừ vào thời lượng sau đó chứ không cộng thêm vào. Và backend là một đồng hồ đo thứ hai: mọi lệnh gọi suy luận được ủy quyền, lệnh triệu gọi công cụ và tìm kiếm web đều tính phí theo mức giá thông thường của mô hình đó, nên việc hướng ủy quyền tới một bộ suy luận hàng đầu vốn tìm kiếm ở mỗi lượt sẽ tạo ra một cuộc gọi đắt đỏ phía sau một lớp thoại rẻ.
Điều mà các bảng đánh giá độc lập nói về hai mô hình này thật đáng suy ngẫm, chính bởi vì chúng đo lường những thứ khác nhau và cả hai đều không tô hồng cho đối tượng của mình. Qwen-Audio-3.0-TTS-Plus đứng thứ tư về chất lượng và gần chót về thông lượng. GPT-Live-1 đứng thứ bảy trong số mười một mô hình trên Chỉ số Speech to Speech của Artificial Analysis với 69,8% — xếp sau GPT-Realtime-2.1 mà nó thay thế, ở mức 73,9% — trong khi được tính giá ở mức thấp nhất trong khoảng chi phí trên mỗi giờ âm thanh đầu vào của chỉ số này, 4,42 USD so với 10,75 USD của GPT-Realtime-2.1. Không mô hình nào giành được vị trí dẫn đầu trong hạng mục của chính mình. Cả hai đều rẻ hơn thứ mà chúng được tạo ra để đánh bại.

Đồng hồ đo thứ hai đó chính là nơi một lớp định tuyến trở thành một quyết định thiết kế thay vì một sự tối ưu hóa. OrcaRouter không mang cả GPT-Live-1 lẫn Qwen-Audio-3.0-TTS — lớp giọng nói trong cả hai trường hợp đều nằm ngoài tầm với của chúng tôi, và chúng tôi không định tuyến phần nào của nó. Còn nhánh suy luận thì không như vậy. Khoảng 190 mô hình từ mười một nhà cung cấp thượng nguồn nằm sau một khóa duy nhất với giá niêm yết của nhà cung cấp và không phụ thu thêm, và việc nhà cung cấp cắt giảm giá được áp dụng ngay trong cùng ngày thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo. Đối với một cascade, điều đó bao trùm thẳng nhánh giữa: giữ hai tùy chọn ASR và ba bộ suy luận phía sau một endpoint, chạy A/B chúng với nhau trên lưu lượng thật, và để cơ chế chuyển đổi dự phòng tự động hấp thụ một buổi chiều tồi tệ từ phía thượng nguồn mà không làm rớt cuộc gọi.
Câu hỏi về sự đồng thuận lại cho thấy điều ngược lại.
Nhân bản giọng nói là khả năng hữu ích nhất về mặt thương mại của Qwen-Audio-3.0-TTS và cũng là bề mặt tuân thủ lớn nhất của nó. Mười giây âm thanh tham chiếu là đủ để tái tạo một người nói, xuyên ngôn ngữ, điều này mang tính chuyển đổi cho việc bản địa hóa và là một rủi ro pháp lý ở bất cứ đâu danh tính là vấn đề. OpenAI đã phát hành GPT-Live-1 mà không có nhân bản và hoàn toàn không có giọng tùy chỉnh — 12 giọng API để lựa chọn, và đó là toàn bộ danh sách.
Sự bất đối xứng đó rất dễ bị bỏ qua trong một so sánh tính năng và khó bị bỏ qua trong một đánh giá rủi ro. Một sản phẩm chỉ nói bằng một trong mười hai giọng của nhà cung cấp có câu trả lời cho "đó là giọng của ai, và ai đã đồng ý với nó" ngắn hơn nhiều so với một sản phẩm có thể tái tạo bất kỳ giọng nói nào từ một mẫu. Nếu bạn cần nhân bản giọng nói, quyết định về pipeline đã được đưa ra sẵn cho bạn, và câu hỏi trở thành điều gì chi phối nó. Nếu bạn không cần, hạn chế của GPT-Live-1 đáng để đọc như một biện pháp kiểm soát mà bạn không phải tự xây dựng.
Nên mua cái nào
Mua Qwen-Audio-3.0-TTS nếu đầu ra là nội dung: thuyết minh, bản địa hóa, âm thanh trợ năng, lồng tiếng, hoặc bất kỳ quy trình nào mà văn bản tồn tại trước khi có âm thanh và chất lượng trên mỗi giờ kết xuất là thước đo. Bắt đầu với Flash nếu bạn cần phát lại theo thời gian thực, chuyển sang Plus khi chính giọng nói là sản phẩm bàn giao, và định giá quy trình nhân bản tách biệt với các giọng đặt trước.
Hãy mua GPT-Live-1 nếu đầu vào là con người. Các đường dây hỗ trợ, luồng đặt chỗ, phỏng vấn tiếp nhận, bất cứ thứ gì mà âm tiết đầu tiên của người dùng vang lên trong khi mô hình đang nói dở câu và hệ thống phải hành xử như một người lắng nghe chứ không phải một người phát. Nó có giá cao hơn cho mỗi giờ âm thanh, và nó là cái duy nhất trong hai cái có thể bị ngắt lời.
Hai cái này bổ trợ cho nhau thường xuyên hơn nhiều so với việc là đối thủ: rất nhiều sản phẩm muốn Qwen-Audio-3.0-TTS đọc một tài liệu và một mô hình song công xử lý cuộc gọi diễn ra sau đó. Điều chúng không nên dùng chung là mô hình chi phí. Mỗi giờ âm thanh là thước đo phù hợp cho đúng một trong hai.
