Thẻ tiêu đề hero cho 'Realtime-Venus vs Qwen-Audio-3.0-TTS', với phụ đề 'Một renderer và một listener không phải là cùng một khoản mua', cùng ba thẻ ghi 'Qwen-Audio-3.0-TTS-Plus: Elo 1.259, đứng thứ hai trên Artificial Analysis Provider Voice Arena', 'Realtime-Venus: hoàn toàn không tồn tại điểm số chất lượng giọng nói', và 'Đầu vào chính là toàn bộ khác biệt: chỉ văn bản, so với âm thanh, video và văn bản', phía trên một dải chân trang ghi 'Số liệu Qwen theo Artificial Analysis; số liệu Realtime-Venus lấy từ báo cáo kỹ thuật của nó, chưa được tái lập.' Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

Realtime-Venus vs Qwen-Audio-3.0-TTS: Một bên đọc kịch bản của bạn, bên kia phải nghe bạn

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Sự so sánh hấp dẫn giữa Realtime-Venus và Qwen-Audio-3.0-TTS là giá mỗi giờ âm thanh, và nó đưa ra một câu trả lời gọn gàng nhưng hoàn toàn sai. Qwen-Audio-3.0-TTS-Plus tạo ra giọng nói với giá khoảng 27,6 đô la mỗi triệu ký tự, tương đương gần 1,66 đô la cho một giờ âm thanh hoàn chỉnh. Realtime-Venus, hệ thống song công hoàn toàn 9B do Nhóm Venus của Ant Group xây dựng cùng Đại học Thanh Hoa, không có giá nào cả vì nó không có dịch vụ lưu trữ — nhưng nếu tự lưu trữ, bạn sẽ tốn một nút GPU chạy liên tục, ít nhất là cao hơn một bậc độ lớn mỗi giờ. Trình kết xuất thắng về mặt số học. Phép toán đang đo lường hai sản phẩm khác nhau: Qwen-Audio-3.0-TTS nhận văn bản và trả về âm thanh, còn Realtime-Venus nhận âm thanh và video và trả về một cuộc trò chuyện. Câu hỏi thực sự phân biệt chúng không phải là chúng xuất ra cái gì. Mà là liệu có thứ gì đó phải nói lại hay không.

Đầu vào chính là toàn bộ sự khác biệt.

Qwen-Audio-3.0-TTS, được Tongyi Lab của Alibaba Cloud phát hành vào ngày 20 tháng 7 năm 2026, là một mô hình chuyển văn bản thành giọng nói được cung cấp dưới dạng API lưu trữ, không có trọng số mở. Văn bản đi vào qua một điểm cuối HTTP và âm thanh đi ra. Không có đường đầu vào âm thanh, không có lượt nào để thực hiện, không có bản chép lời để trả về, và không có khái niệm bị ngắt lời — mô hình chưa từng nghe thấy bất cứ điều gì. Toàn bộ mô hình chi phí của nó giống như một cỗ máy in: ký tự vào, âm thanh ra.

Realtime-Venus, ngược lại, thường trực lắng nghe. Checkpoint âm thanh-hình ảnh mang một bộ mã hóa hình ảnh SigLIP2 cho các khung hình truyền phát và một bộ mã hóa âm thanh Whisper-Medium cấp dữ liệu cho backbone Qwen3-8B, và cả hai checkpoint đều chạy vòng lặp tương tác một giây để liên tục cập nhật trạng thái hội thoại và quyết định nói hay giữ im lặng. Nó tạo ra giọng nói thông qua các token S3 rời rạc và một bộ giải mã flow-matching dạng truyền phát thay vì một công đoạn tổng hợp riêng biệt, và nó có thể trả về văn bản cùng với dạng sóng.

Đó không phải là sự khác biệt về tính năng. Đó là sự khác biệt giữa một thành phần và một hệ thống. Đặt hai thứ cạnh nhau, một trong số chúng có thể được thả thẳng vào một pipeline vốn đã có sẵn một bộ nhận dạng giọng nói và một mô hình ngôn ngữ ở phía trước. Cái còn lại thì thay thế cả ba.

Một ví dụ đã giải sẽ làm cho nó trở nên cụ thể.

Hãy hình dung một tổng đài hỗ trợ. Một khách hàng gọi đến, mô tả vấn đề một cách lộn xộn, ngắt giữa câu để tìm số tài khoản, bị ngắt lời bởi một thông báo từ phía sau, rồi hỏi thêm một câu trước khi điện thoại viên trả lời xong.

Một hệ thống được xây dựng trên Qwen-Audio-3.0-TTS xử lý việc này như ba nhà cung cấp và ba hóa đơn: một bộ nhận dạng chuyển lời nói của người gọi thành văn bản, một mô hình ngôn ngữ quyết định sẽ nói gì, và Qwen-Audio-3.0-TTS đọc lên. Mỗi chặng đều tăng độ trễ, và mỗi ranh giới là nơi ngữ điệu chết. Thất bại nghiêm trọng mang tính cấu trúc — phần TTS không thể nghe thấy khoảng dừng ở giữa câu mà nó đang nói, vì vậy việc ngắt lời phải được xử lý bởi một thứ gì đó ở phía trước nó.

Realtime-Venus xử lý cùng cuộc gọi đó như một mô hình duy nhất, không có bộ phát hiện hoạt động giọng nói bên ngoài, không có chuyển giao. Các số liệu Full-Duplex-Bench v1.5 của nó — 75% phản hồi khi bị ngắt lời và tỷ lệ tiếp tục 97% khi có tín hiệu đáp lời, 88% khi có lời nói hướng đến người khác và 86% khi có tiếng nói nền — chính xác là những chỉ số mô tả bối cảnh này. Chúng cũng là số liệu tự báo cáo, từ báo cáo kỹ thuật của chính mô hình, không có tái lập bên ngoài. Hãy đọc chúng như một tuyên bố thiết kế, chứ không phải một phép đo.

Chất lượng giọng nói: một bên có Elo, bên kia chẳng có gì.

Đây là phần chênh lệch nhất trong phép so sánh, và nó có lợi cho Alibaba với cách biệt lớn.

• Điểm số độc lập — Qwen-Audio-3.0-TTS-Plus đứng thứ hai trên Provider Voice Arena của Artificial Analysis với Elo 1.259 trên 1.544 mẫu tính đến ngày 18 tháng 9 năm 2026, sau Cartesia Sonic 3.6 ở mức 1.277 và trên Inworld Realtime TTS-2 ở mức 1.247 cùng Speechify Simba 3.2 ở mức 1.241.

• Khởi nguồn — cột công bố phát hành của chính arena liệt kê mô hình này là một mục của tháng 9 năm 2026, tức là hạng theo điểm số hiện tại chứ không phải ngày ra mắt 20 tháng 7 năm 2026. Dù có xê dịch thế nào, nó vẫn luôn nằm trong top hai suốt thời gian qua.

• Realtime-Venus — không có mục tham gia arena, không có đánh giá giọng nói từ bên thứ ba, không có gì cả. Con số duy nhất liên quan đến giọng nói của nó là điểm VoiceBench AlpacaEval 4,81 do chính nó tự báo cáo, mà báo cáo mô tả là khớp với con số so sánh tốt nhất.

• Điều đó nghĩa là gì — chưa có ai ngoài nhóm tác giả đánh giá liệu Realtime-Venus nghe có hay không. Đó không phải là điểm trừ đối với nó; nó chỉ đơn thuần là chưa được biết, và chưa được biết thì khác với tệ. Nhưng nếu chất lượng giọng nói là thứ cần bàn giao, thì mua một mô hình được xếp hạng Elo vẫn hơn là chọn một mô hình chưa được xếp hạng bằng niềm tin.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured 18 September 2026, showing the ranked table: Cartesia Sonic 3.6 first at Elo 1,277 with 1,810 samples, released August 2026 at $49.0 per million characters; Alibaba's Qwen-Audio-3.0-TTS-Plus second at Elo 1,259 with 1,544 samples and $27.6 per million characters; Inworld Realtime TTS-2 third at Elo 1,247; SpeechifyAI Simba 3.2 fourth at Elo 1,241; VUI Labs Luna TTS fifth at Elo 1,231; Inworld Realtime TTS-2 Flash sixth at Elo 1,216; StepFun StepAudio 2.5 TTS seventh at Elo 1,209; and BreezeBlue Breeze TTS 2 eighth at Elo 1,207 with an Open Weights badge.A two-column comparison scoreboard titled 'Realtime-Venus vs Qwen-Audio-3.0-TTS — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Job: full-duplex conversation', 'Input: audio, video and text', 'Output: text and speech', 'Independent voice score: none', 'Availability: Apache-2.0 weights, no API', 'Price: none published'. The right column, labelled Qwen-Audio-3.0-TTS, reads 'Job: text-to-speech rendering', 'Input: text only', 'Output: audio', 'Independent voice score: Elo 1,259, second of 20-plus', 'Availability: hosted API since 20 July 2026', 'Price: about $27.6 per 1M characters'. The footer reads 'Qwen figures per Artificial Analysis and Alibaba Cloud documentation; Realtime-Venus figures from its technical report, unreproduced.'

Ngôn ngữ, giọng nói và điều khiển biểu cảm

Mô hình của Alibaba được xây dựng để đảm bảo độ bao phủ rộng trong khả năng truyền đạt. Nó cung cấp hơn một nghìn giọng nói, bao phủ mười sáu ngôn ngữ trong đó có hai mươi vùng phương ngữ Trung Quốc, và cung cấp 86 thẻ nội tuyến cho cảm xúc và cách truyền đạt — một bề mặt điều khiển mà bạn viết trực tiếp vào văn bản, cùng với các chỉ dẫn truyền đạt bằng ngôn ngữ tự nhiên. Đầu ra đạt tối đa 48 kHz, tăng từ 24 kHz ở thế hệ trước, và một lần tổng hợp có thể kéo dài tới ba phút. Gói Flash hướng tới khoảng 300 mili giây đến gói đầu tiên để phát lại theo thời gian thực; gói Plus là gói chất lượng cao và tạo ra với tốc độ khoảng mười sáu ký tự mỗi giây, đủ chậm để tạo ra khác biệt trong một sản phẩm trực tiếp và gần như không đáng kể khi kết xuất theo lô.

Realtime-Venus có tài liệu bằng tiếng Anh và tiếng Trung, phát hành kèm một giọng tham chiếu cùng với các trọng số, và cho bạn một bộ giải mã từ token sang dạng sóng thay vì một thư viện giọng nói. Khả năng biểu đạt theo nghĩa của Qwen — thẻ, hướng dẫn, hàng nghìn preset — không có tương đương ở đây. Thay vào đó, nó có khả năng thay đổi cách thể hiện để đáp lại những gì nó đang nghe, một kiểu điều khiển biểu đạt khác và khó đưa lên bảng thông số kỹ thuật hơn nhiều.

Cái giá của mỗi con đường, thành thật mà nói

Có một lưu ý thực sự về con số của Alibaba trước khi bất kỳ ai lập ngân sách dựa trên nó. Mức $27.6 cho mỗi triệu ký tự được trích dẫn rộng rãi không khớp với trang định giá của chính Alibaba trong mọi ảnh chụp, và các bậc giá được định giá riêng. Hãy kiểm tra con số ở cấp tài khoản thay vì tin vào một bảng so sánh, kể cả bảng này.

Realtime-Venus không có giá niêm yết vì chẳng có gì để mua. Chi phí là hai checkpoint 9B ở BF16 — mỗi cái khoảng mười tám gigabyte trọng số trước khi tính đến bộ nhớ kích hoạt — cộng thêm một vòng lặp truyền phát liên tục, nghĩa là một nút GPU tính phí theo tháng dù có ai gọi hay không. Với lưu lượng ổn định, cách này rẻ hơn trên mỗi cuộc hội thoại so với API giọng nói tính phí theo mức sử dụng. Với lưu lượng ngắt quãng, nó tệ hơn hẳn, và điểm giao nhau chính là câu hỏi tài chính duy nhất đáng bận tâm.

Có một con đường thứ ba mà nhiều đội ngũ sẽ chọn, và đáng để gọi tên vì nó thay đổi hình dạng của quyết định. Nếu bạn giữ một cascade, chặng duy nhất cần phải là mô hình hosted là chặng giữa — phần suy luận. OrcaRouter không cung cấp Qwen-Audio-3.0-TTS lẫn Realtime-Venus; cả hai lớp giọng nói đều nằm ngoài phạm vi chúng tôi phục vụ, và chúng tôi thà nói thẳng điều đó còn hơn ngụ ý điều khác. Chặng suy luận là thứ chúng tôi thực sự đảm nhiệm: gần 200 mô hình văn bản sau một khóa duy nhất với giá niêm yết của nhà cung cấp, không thêm phụ phí, tự động chuyển đổi dự phòng giữa các upstream để một buổi chiều trục trặc ở một nhà cung cấp không làm rớt cuộc gọi đang diễn ra, một DSL định tuyến cho phép kết hợp nhiều mô hình thành một lệnh gọi duy nhất, và hợp nhất mô hình khi một quyết định xứng đáng có nhiều hơn một ý kiến. Trong một cascade, đó là chặng bạn muốn có thể thay thế nhất mà không cần đàm phán hợp đồng, và cũng là chặng mà việc nhà cung cấp giảm giá có hiệu lực ngay trong ngày thay vì đến kỳ gia hạn.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge alongside the Any-to-Any, Safetensors, audio, video, streaming and full-duplex tags, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Nhân bản vô tính là con dao hai lưỡi.

Qwen-Audio-3.0-TTS có thể nhân bản một giọng nói từ mẫu tham chiếu ngắn, theo cách xuyên ngôn ngữ, và được tài liệu ghi nhận là có khả năng chống chịu tốt với đầu vào nhiễu hoặc vang. Đó là năng lực hữu ích nhất về mặt thương mại trong phép so sánh này và cũng là bề mặt tuân thủ lớn nhất. Một sản phẩm có thể tái tạo bất kỳ người nói nào từ mười giây âm thanh sẽ có câu trả lời dài hơn nhiều cho câu hỏi "đó là giọng của ai, và ai đã đồng ý cho việc đó" so với một sản phẩm chỉ nói bằng các cài đặt sẵn của nhà cung cấp.

Realtime-Venus phát hành kèm một giọng tham chiếu cùng với các trọng số. Bạn có thể nhân bản bằng nó nếu bạn có âm thanh và lần chạy huấn luyện, nhưng không có gì trong bản phát hành được xây dựng nhằm làm cho việc đó trở nên dễ dàng — điều mà, đối với một triển khai tự lưu trữ bên trong ranh giới tuân thủ, có thể được coi là mặc định an toàn hơn.

Bạn thực sự đang mua cái nào

Mua Qwen-Audio-3.0-TTS khi đầu ra là âm thanh. Thuyết minh, bản địa hóa, khả năng tiếp cận, lồng tiếng, bất kỳ quy trình nào mà văn bản tồn tại trước khi âm thanh xuất hiện và chất lượng trên mỗi giờ kết xuất là thước đo. Bắt đầu với Flash nếu việc phát lại là trực tiếp, chuyển sang Plus khi chính giọng nói là sản phẩm, và định giá quy trình nhân bản tách biệt với thư viện preset.

Hãy chọn Realtime-Venus khi đầu vào là một người và hệ thống phải hành xử như một người lắng nghe. Hỗ trợ nhận biết camera, tương tác rảnh tay, bất cứ thứ gì mà con người sẽ ngắt lời giữa câu và mong hệ thống xử lý được. Sự đánh đổi thật rõ ràng: bạn từ bỏ một giọng nói được xếp hạng Elo, một nghìn preset và mọi tùy chọn hosted, đổi lại bạn nhận được thứ duy nhất trong hai thứ có thể nghe thấy bạn.

Hầu hết các sản phẩm đều muốn cả hai, ở những chỗ khác nhau. Điều chúng không nên dùng chung là mô hình chi phí — giá mỗi giờ âm thanh là chỉ số phù hợp cho đúng một trong hai mô hình này, và đó không phải là mô hình đang duy trì cuộc trò chuyện.