Thẻ hero được tạo cho 'Gemini 3.8 TTS vs Qwen Audio 3.0 TTS' trên nền trắng với các điểm nhấn gradient xanh dương và xanh lam dịu nhẹ. Thẻ bên trái 'Qwen-Audio-3.0-TTS-Plus' liệt kê Elo 1.259, 15 giọng arena, 16 ngôn ngữ + 20 phương ngữ và 27,6 USD cho mỗi 1 triệu ký tự; thẻ bên phải 'Gemini 3.8 Flash TTS' liệt kê Elo 1.260, 8 giọng arena, 130 ngôn ngữ và 33,0 USD cho mỗi 1 triệu ký tự. Một dòng chân trang ghi 'Elo theo Artificial Analysis Provider Voice Arena, tháng 9 năm 2026.' Logo OrcaRouter được ghép vào góc dưới bên phải.
Engineering & Research

Gemini 3.8 TTS so với Qwen Audio 3.0 TTS: Hai câu trả lời khác nhau cho “Làm cho âm thanh nghe đúng”

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Chỉ một điểm Elo duy nhất tách biệt hai mô hình này trên Artificial Analysis Provider Voice Arena, và chúng đạt tới đó bằng cách giải quyết những bài toán hoàn toàn khác nhau. Qwen-Audio-3.0-TTS-Plus đang ở vị trí thứ 3 với Elo 1.259 trên 1.447 mẫu và 15 giọng arena, phát hành tháng 9 năm 2026 và có giá niêm yết 27,60 USD cho mỗi triệu ký tự. Gemini 3.8 Flash TTS đang ở vị trí thứ 2 với 1.260 trên 1.999 mẫu và 8 giọng arena, phát hành ngày 23 tháng 9 năm 2026 và có giá niêm yết 33,00 USD cho mỗi triệu ký tự. Không thể phân biệt được về mặt thống kê, chênh nhau hai mươi phần trăm về giá, và được xây dựng trên những lý thuyết trái ngược về điều gì làm nên một giọng nói tổng hợp tốt.

Phần lý thuyết mới là phần thú vị. Câu trả lời của Qwen là điều khiển nội tuyến: 86 thẻ thể hiện mà bạn rắc vào văn bản để mô hình biết chỗ nào cần lấy hơi, nhấn mạnh và chuyển tông giọng. Câu trả lời của Google là một lớp chỉ dẫn: hướng dẫn theo từng dòng, dàn dựng hai người nói, và một tập nhỏ các tín hiệu phi ngôn từ. Nếu bạn đã xây dựng một pipeline phát ra các chú thích kiểu SSML, một trong hai sẽ phù hợp còn cái kia thì không, và khả năng tương thích đó quan trọng hơn một điểm Elo đơn lẻ.

Hai thứ đó thực sự nằm ở đâu trên bàn cờ

Để đọc Provider Voice Arena một cách trung thực, cần nhìn vào các khoảng, chứ không phải các thứ hạng.

• Qwen-Audio-3.0-TTS-Plus — xếp hạng 3, Elo 1.259, 1.447 mẫu, 15 giọng nói trong đấu trường, tháng 9 năm 2026, 27,6 USD cho mỗi 1 triệu ký tự.

• Gemini 3.8 Flash TTS — hạng 2, Elo 1.260, 1.999 mẫu, 8 giọng đấu trường, tháng 9 năm 2026, 33,0 USD cho mỗi 1 triệu ký tự.

• Cartesia Sonic 3.6 — hạng 1, Elo 1.273, 1.757 mẫu, 8 giọng trong arena, tháng 8 năm 2026, 49,0 USD cho mỗi 1 triệu ký tự.

Ba vị trí dẫn đầu là một nhóm. Các khoảng được công bố ở hai vị trí đầu kéo dài mười bảy điểm về mỗi phía, rộng hơn toàn bộ khoảng cách giữa hạng nhất và hạng ba, vì vậy thứ tự giữa chúng không phải là bằng chứng ổn định. Điều mà bảng xếp hạng thực sự xác lập là cả ba đều nằm trong nhóm dẫn đầu và không có gì bên dưới họ ở gần — hạng 10, Gemini 3.1 Flash TTS, đang ở mức 1.199.

Điểm bất đối xứng đáng lưu ý là số lượng giọng đọc trong đấu trường. Qwen đưa vào 15 giọng so với 8 giọng của Gemini, vì vậy điểm của Qwen là mức trung bình trên một mẫu rộng hơn trong chính sản phẩm của nhà cung cấp. Điều này có hai mặt: đây là ước tính công bằng hơn về tổng thể danh mục giọng của Qwen, đồng thời cho Qwen nhiều cơ hội hơn để đưa vào một giọng yếu làm kéo mức trung bình xuống. Cả hai cách hiểu đều không thay đổi kết luận rằng hai bên ngang nhau.

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

86 thẻ giao hàng so với một lớp hướng

Đây là sự khác biệt thực chất và nó quyết định phần lớn các tích hợp.

Qwen-Audio-3.0-TTS cung cấp 86 thẻ thể hiện nội tuyến — các chú thích được nhúng trong văn bản nhằm điều khiển cách đọc một đoạn. Đây là một cách tiếp cận đánh dấu: kịch bản của bạn mang theo phần trình diễn. Điều đó quen thuộc với bất kỳ ai từng làm việc với SSML, và nó kết hợp tốt với các công cụ tạo văn bản bằng lập trình, bởi vì bề mặt điều khiển là một phép biến đổi chuỗi thay vì một lời gọi API.

Gemini 3.8 Flash TTS đi theo hướng khác. Bạn chỉ đạo một câu thoại giống như bạn chỉ đạo một diễn viên — nhịp độ, nhấn mạnh, sắc thái cảm xúc — dưới dạng một chỉ dẫn riêng thay vì đánh dấu nội dòng. Các cảnh có hai người nói có thể được dàn dựng trong một lần gọi duy nhất. Và một tập nhỏ các tín hiệu phi ngôn từ được viết thẳng vào kịch bản: <laughs>, <sigh>, <gasp> như các tín hiệu nội dòng, cùng với |mhm||yeah| cho các âm thanh đáp lời.

Vậy nên cả hai mô hình đều chấp nhận chú thích trong văn bản; khác biệt nằm ở kích thước từ vựng và vị trí của phần điều khiển còn lại. Của Qwen rộng hơn và phẳng hơn — 86 thẻ, tất cả đều nằm trong văn bản. Của Google hẹp hơn trong văn bản và rộng hơn bên ngoài văn bản, với chỉ dẫn cách thể hiện và sắp xếp người nói là các tham số ở cấp lệnh gọi. Nếu bạn đang chuyển một hệ thống vốn đã phát ra nhiều đánh dấu nội tuyến, thì Qwen là bản chuyển ngắn hơn. Nếu dù sao bạn cũng đang xây dựng logic chỉ dẫn cách thể hiện trong mã ứng dụng, thì cách phân tách của Google gọn gàng hơn.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Phạm vi ngôn ngữ so với phạm vi phương ngữ

Các con số về độ bao phủ không thể so sánh được, và việc so sánh chúng một cách ngây thơ là một sai lầm.

Gemini 3.8 Flash TTS hỗ trợ 130 ngôn ngữ, tự động nhận diện từ văn bản; Flash-Lite TTS hỗ trợ 101. Đó là độ bao phủ rộng khắp các ngữ hệ, đúng thứ bạn cần cho một lượt bản địa hoá phải vươn tới phần đuôi dài của các thị trường.

Qwen-Audio-3.0-TTS bao phủ 16 ngôn ngữ cùng 20 vùng phương ngữ Trung Quốc. Đó là chiều sâu trong một ngữ hệ. Hai mươi vùng phương ngữ không phải là một con số nhỏ hơn 130 ngôn ngữ theo vẻ ngoài của nó — đó là một kiểu tuyên bố khác, và với một sản phẩm phục vụ người dùng nói tiếng Trung trên khắp các vùng đại lục, đó mới là điều hữu ích hơn. Một mô hình có 130 ngôn ngữ và chỉ một giọng Quan Thoại không phục vụ người dùng ở Tứ Xuyên theo cách mà một mô hình có 20 vùng phương ngữ làm được.

Điều nào quan trọng phụ thuộc hoàn toàn vào đối tượng của bạn. Nếu yêu cầu của bạn là “ít nhất cũng tạm chấp nhận được ở hai mươi thị trường”, thì Gemini. Nếu là “thực sự đúng ở thị trường Trung Quốc”, thì Qwen.

Giá, và điều mà con số trên mỗi ký tự che giấu

• Qwen-Audio-3.0-TTS-Plus — 27,60 USD cho mỗi 1 triệu ký tự theo cơ sở chuẩn hóa của bảng xếp hạng; biến thể Flash có giá khoảng 15 USD cho mỗi 1 triệu ký tự với độ trễ gói đầu tiên được công bố khoảng 300 ms.

• Gemini 3.8 Flash TTS — $33.00 cho 1 triệu ký tự đã chuẩn hóa; được Google tính phí $0.50 cho mỗi triệu token văn bản đầu vào và $9.00 cho mỗi triệu token âm thanh đầu ra đến hết ngày 31 tháng 12 năm 2026, sau đó là $1.00 và $18.00.

• Gemini 3.8 Flash-Lite TTS — 22,10 USD cho mỗi 1 triệu ký tự đã chuẩn hoá, xếp thứ 6 với điểm Elo là 1.235; được tính phí 6,00 USD cho mỗi một triệu token âm thanh đến hết ngày 31 tháng 12 năm 2026.

Cả hai số liệu theo ký tự đều là kết quả chuẩn hóa của Artificial Analysis, không phải giá niêm yết của nhà cung cấp — Qwen tính phí qua Alibaba Cloud Model Studio và Google tính phí theo token, và cả hai đều không công bố đơn giá theo ký tự cho các mô hình này. Hãy dùng chúng để xét tỷ lệ, vốn xấp xỉ 1,2 lần theo hướng có lợi cho Qwen, chứ không phải để làm báo giá.

Các tầng khác biệt về cấu trúc. Qwen tách thành Plus và Flash, trong đó hạng Flash đánh đổi chất lượng để lấy tuyên bố gói đầu tiên ~300 ms. Google tách thành Flash và Flash-Lite, rồi chia tiếp thành Standard, Batch và Flex, và Priority — $4.50, $9.00 và $16.20 mỗi triệu token âm thanh trên Flash TTS. Mô hình của Google khuyến khích việc phân loại khối lượng công việc của bạn; mô hình của Qwen khuyến khích việc chọn một hạng chất lượng ngay từ đầu.

Tính sẵn có là điểm khác biệt thực sự còn lại. Gemini 3.8 Flash TTS được cung cấp rộng rãi trên Gemini Developer API. Qwen-Audio-3.0-TTS là mô hình đóng và chỉ chạy dưới dạng dịch vụ được host, được phục vụ qua Alibaba Cloud Model Studio và không có trọng số mở. Nếu bạn cần tự chạy mô hình, cả hai đều không dành cho bạn — nhưng nếu hạ tầng của bạn đã nằm trên Alibaba Cloud, thì mô hình Qwen là lựa chọn không có bài toán truyền dữ liệu ra ngoài (egress) phải giải quyết.

Tuyên bố của nhà cung cấp từ cả hai phía

Cả hai mô hình đều không có tiêu chuẩn đánh giá độc lập nào ngoài arena, và cả hai nhà cung cấp đều đã công bố những tuyên bố mà cần được ghi nhãn đúng như vậy.

Của Google, đối với Gemini 3.8 Flash TTS: đứng đầu trên Hume AI Voice Design Benchmark ở mức 71,4, đứng đầu về mô hình hóa giọng ở mức 60,8, đứng thứ nhất và thứ hai trên Hume Overall Quality Index cho Flash và Flash-Lite, và các vị trí hàng đầu về ưu tiên mù được tuyên bố cho tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Việt, tiếng Ả Rập chuẩn hiện đại, tiếng Tây Ban Nha Mexico và tiếng Hindi. Các lần chạy không được công khai.

Của Alibaba, đối với Qwen-Audio-3.0-TTS: hệ thống diễn đạt gồm 86 thẻ, 20 vùng phương ngữ và con số gói đầu tiên ~300 ms trên biến thể Flash. Cũng chưa được tái tạo.

Elo của đấu trường là con số chất lượng duy nhất được thu thập độc lập trong bài viết này, và nó cho thấy hai bên đang đồng hạng nhất trên bảng xếp hạng.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

Gemini bổ sung những gì mà Qwen không có

Tạo giọng nói là khoảng trống rõ ràng nhất. Gemini 3.8 Flash TTS hỗ trợ thiết kế giọng nói từ mô tả bằng ngôn ngữ tự nhiên và sao chép giọng nói từ mẫu 30 giây, với xác minh sự đồng ý và dấu thủy vân SynthID cùng thông tin xác thực C2PA trên đầu ra. Giọng nói tùy chỉnh có hai dạng: 200 giọng nói có trạng thái cho mỗi dự án với thời gian tồn tại một năm, hoặc giọng nói không trạng thái được định địa chỉ bằng một voicekey_... handle hết hạn sau bảy ngày. Phối lại giọng nói được liệt kê là sắp ra mắt.

Kiểm soát định dạng đầu ra là điểm thứ hai. WAV 24 kHz mono PCM có dấu 16-bit trên endpoint unary, PCM không có header (audio/l16) trên endpoint streaming, cùng với audio/mulaw và audio/alaw và tốc độ mẫu có thể cấu hình. Đối với công việc liên quan đến điện thoại, hỗ trợ mulaw loại bỏ một bước chuyển mã.

Gọi cái nào

Chọn {{1}}Qwen-Audio-3.0-TTS{{/1}} nếu người dùng của bạn nói tiếng Trung và yêu cầu là độ phủ phương ngữ, nếu bạn muốn một bộ từ vựng đánh dấu nội tuyến phong phú mà trình tạo của bạn có thể xuất trực tiếp, hoặc nếu bạn đã ở trên {{2}}Alibaba Cloud{{/2}} và muốn con đường ngắn nhất đến một endpoint hoạt động được. Đây cũng là lựa chọn rẻ hơn trong hai trên cơ sở chuẩn hóa, và biến thể Flash thậm chí còn rẻ hơn nếu gói đầu tiên ~300 ms là chấp nhận được.

Chọn Gemini 3.8 Flash TTS nếu bạn cần độ bao phủ trên nhiều ngôn ngữ hơn là chiều sâu ở một ngôn ngữ, nếu bạn cần tạo hoặc nhân bản một giọng nói cụ thể, nếu bạn cần đầu ra mulaw hoặc alaw, hoặc nếu "sẵn có rộng rãi thay vì chỉ được lưu trữ" là một yêu cầu mua sắm.

Cả hai đều không phải là lựa chọn tồi và cũng không có bên nào rõ ràng tốt hơn — đó chính là điểm mấu chốt của khoảng cách một điểm Elo. Quyết định nằm ở sự tương thích, không phải chất lượng.

Đó cũng chính là lý do để chưa vội cam kết gắn bó hẳn với bên nào. OrcaRouter mang đến cho bạn hơn 200 mô hình chỉ sau một khóa duy nhất, với đúng giá niêm yết của nhà cung cấp và không cộng thêm phí, nhờ đó mọi thay đổi về mức giá từ bất kỳ phòng thí nghiệm nào cũng hiện lên hóa đơn của bạn ngay trong ngày thay vì đợi đến kỳ gia hạn, và cơ chế tự động chuyển đổi dự phòng nghĩa là một điểm cuối tổng hợp bị chững lại khi tải cao sẽ được chuyển sang một điểm cuối khác thay vì làm rơi yêu cầu. Chúng tôi không lưu trữ Qwen-Audio-3.0-TTS — dịch vụ đó được cung cấp qua Alibaba Cloud Model Studio — và chúng tôi cũng không lưu trữ các điểm cuối TTS của Gemini 3.8, vốn đến từ API của Google. Thứ chúng tôi đảm nhận là lớp văn bản và lớp định tuyến phía trên nó, và chính điều đó cho phép bạn chạy thử cả hai trên lưu lượng thực tế trong một tháng trước khi đưa ra lựa chọn.

Con số cần theo dõi là bản cập nhật arena tiếp theo. Với 1.447 mẫu trên Qwen và 1.999 mẫu trên Gemini, cả hai khoảng vẫn còn đủ rộng để chỉ một tháng bình chọn có thể tách chúng ra — hoặc xác nhận rằng thế hòa chính là câu trả lời.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày