
Gemini 3.8 Live vs Qwen-Audio-3.1-TTS: Hai nửa của một ngăn xếp giọng nói, tái định giá cách nhau tám ngày
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 36 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 181 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Gemini 3.8 Live là mô hình chuyển giọng nói thành giọng nói của Google, được phát hành vào ngày 15 tháng 9 năm 2026 dưới dạng gemini-3.8-live và gemini-3.8-live-extended-thinking trên Live API. Qwen-Audio-3.1-TTS là mô hình chuyển văn bản thành giọng nói của Alibaba, được công bố tại Hội nghị Apsara ở Hàng Châu vào ngày 23 tháng 9 năm 2026, tám ngày sau đó, kèm theo mức giảm giá khoảng 70% cho dịch vụ tổng hợp giọng nói. Khoảng cách tám ngày đó là lý do tại sao so sánh này đáng đọc ngay bây giờ thay vì vào tháng Bảy. Không có gì thay đổi về vai trò của hai sản phẩm — một cái lắng nghe và nói, cái kia đọc văn bản thành tiếng — nhưng cả hai nửa của một pipeline giọng nói trong sản xuất đều được xây dựng lại hoặc điều chỉnh giá trong vòng một nửa tháng, và phép tính từng định đoạt cuộc so tài này đã lặng lẽ thay đổi.
Hai nửa, được làm mới cách nhau tám ngày
Hãy bắt đầu với điều khiến sự kết hợp này khác thường: hai mô hình không cạnh tranh với nhau. Một sản phẩm thoại có miệng và có tai, và hai mô hình này mỗi cái đảm nhận một vai. Gemini 3.8 Live khép kín vòng lặp — âm thanh và video đi vào, âm thanh đi ra, xử lý ngắt lời, các lệnh gọi công cụ chạy bên dưới cuộc hội thoại. Qwen-Audio-3.1-TTS nhận một chuỗi và một giọng tham chiếu rồi trả về một màn trình diễn. Nó là một cái miệng tốt hơn bất cứ thứ gì khác, và nó không cố trở thành một cái tai.
Điều khiến thời điểm tháng 9 trở nên thú vị là hai thông báo nhắm vào hai đầu đối lập của cùng một dòng ngân sách. Bản ra mắt ngày 15 tháng 9 của Google là một câu chuyện về năng lực mà không kèm theo thay đổi giá nào; thông báo ngày 23 tháng 9 của Alibaba chủ yếu là câu chuyện về biên lợi nhuận, với năng lực mới đi kèm. Một nhóm đã xây dựng pipeline lai vào tháng 8, chỉ trong vòng tám ngày, đã được trao một lý do để xem xét lại cả hai chặng — và chỉ một trong hai chặng đó trở nên rẻ hơn.
Bản phát hành 3.1 thực sự đã thay đổi điều gì ở phía Qwen
Alibaba không chỉ phát hành một mô hình vào ngày 23 tháng 9. Thế hệ 3.1 bao gồm năm endpoint — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next và Qwen-Audio-3.1-Realtime — và chỉ một trong số đó, bậc TTS thông thường, là bản thay thế trực tiếp cho bất kỳ ai đang gọi mô hình TTS 3.0.
Ở bậc đó, ba thứ đã thay đổi và một trong số đó là chi phí chuyển đổi thực sự. Điều khiển cách truyền đạt đã chuyển từ một bộ từ vựng cố định gồm 86 thẻ inline sang chỉ dẫn bằng ngôn ngữ tự nhiên: bạn mô tả cảm xúc, nhịp độ và phong cách mình muốn thay vì chèn đúng dấu ngoặc vào đúng vị trí. Tính năng chuyển đổi âm sắc xuyên ngôn ngữ đã ra mắt, cho phép một giọng tham chiếu mang bản sắc của nó xuyên suốt tiếng Quan Thoại, tiếng Quảng Đông, tiếng Anh và tiếng Nhật. Và mô hình giờ đây có thể xử lý trực tiếp âm thanh tham chiếu bị nhiễu hoặc có tiếng vọng, mà không cần một bước khử nhiễu riêng. Độ phủ ngôn ngữ không thay đổi, ở mức 16 ngôn ngữ do nhà cung cấp báo cáo, cộng với 20 vùng phương ngữ Trung Quốc, và — điều này đáng lưu ý vì nó bị lấp liếm ở những nơi khác — tài liệu của chính Alibaba nói rằng bậc 3.1 bổ sung bảy ngôn ngữ, điều này không khớp với 16 ngôn ngữ mà độ phủ được công bố của thế hệ tháng 7 liệt kê. Hãy coi cả hai con số là do nhà cung cấp báo cáo cho đến khi bạn đối chiếu các ngôn ngữ cụ thể mình cần với Model Studio.
Sản phẩm thực sự mới trong bản phát hành này là Qwen-Audio-3.1-TTS-Next, thứ mà Alibaba gọi là mô hình "Audiogen": một lượt xử lý tạo ra giọng nói, hiệu ứng âm thanh và âm nền cùng lúc, dành cho đối thoại nhiều người nói, dựng podcast và dựng cảnh. Nó được niêm yết ở mức $0.848 cho mỗi triệu token đầu vào và $1.696 cho mỗi triệu token đầu ra trên node Bắc Kinh, giới hạn ở 3.000 ký tự đầu vào, 240 giây âm thanh được tạo cho podcast và 120 giây trong các trường hợp khác, ba yêu cầu mỗi giây, chấp nhận tối đa ba clip tham chiếu dài 30 giây mỗi clip. Nó chỉ hỗ trợ tiếng Trung và tiếng Anh. Nếu pipeline của bạn chỉ là một người dẫn chuyện đọc kịch bản, sản phẩm đó không liên quan đến bạn; nếu đó là hai người dẫn và một nền nhạc, thì đó chính là lý do để bạn xem xét bản phát hành này.
Đường nối mới là thứ bạn thực sự đang chọn.
Vì hai mô hình không làm cùng một công việc, nên quyết định này không phải là một cuộc so tài. Đó là câu hỏi về việc bạn đặt điểm bàn giao ở đâu, và bạn sẵn sàng trả bao nhiêu để đường nối trở nên vô hình.
Có hai kiến trúc trung thực. Thứ nhất là một mạng duy nhất: Gemini 3.8 Live xử lý toàn bộ lượt thoại, nghe người gọi, quyết định nói gì và nói điều đó, còn bạn chấp nhận giọng mà nó đưa cho bạn — thứ bạn không thể nhân bản và không thể gắn thương hiệu. Thứ hai là một chuỗi tầng: nhận dạng, rồi suy luận, rồi Qwen-Audio-3.1-TTS làm phần miệng, cho bạn một nghìn giọng nói, bao gồm một giọng do chính talent của bạn thu âm, đổi lại là độ trễ qua hai hoặc ba ranh giới nhà cung cấp và ngữ điệu bị mất khi một câu bị chia tách qua một lời gọi API.
Hầu hết các nhóm cuối cùng đều dùng cả hai, và đó không phải là sự thiếu can đảm. Hãy dùng mô hình thời gian thực ở nơi độ trễ được cảm nhận rõ — ngắt lời, xác nhận, tiếng “mm-hm” cho người gọi biết bạn vẫn đang ở đó — và dùng mô hình tổng hợp ở nơi chất lượng được nghe thấy: việc đọc lại dài một chính sách, số xác nhận được đọc với nhịp độ chậm rãi có chủ đích, giọng nói mang thương hiệu phải giống hệt nhau trong từng cuộc gọi. Giải pháp kết hợp là câu trả lời đúng cho một lớp lớn các sản phẩm. Đó cũng là nơi mô hình chi phí trở nên khó, bởi vì giờ đây bạn đang đo lường hai đơn vị khác nhau.

Được tính giá theo giờ âm thanh, đơn vị duy nhất mà cả hai đều phù hợp.
Google tính phí Live API theo phút; Alibaba tính phí các bậc Qwen TTS theo ký tự và theo token. Để so sánh chúng, bạn phải chọn một đơn vị chuẩn hóa, và đơn vị duy nhất có thể biện luận được cho giọng nói là giờ âm thanh hoàn chỉnh.
Tính phí đầu vào — Gemini 3.8 Live tính theo mỗi phút âm thanh, $0,005 đầu vào và $0,018 đầu ra so với Qwen-Audio-3.1-TTS tính theo mỗi triệu ký tự, với gói 3.0 Plus đang ở mức gần $27,60 và gói Flash gần $15 trước đợt cắt giảm, còn gói TTS Flash niêm yết ở mức 1,5 nhân dân tệ mỗi triệu token đầu vào và 12 nhân dân tệ mỗi triệu token đầu ra sau đợt đó
Tính phí đầu ra — Gemini 3.8 Live cuộc trò chuyện hai chiều chạy khoảng $1,38 cho một giờ trò chuyện theo đồng hồ thực tế ở giá niêm yết, trước mọi bộ nhớ đệm so với Qwen-Audio-3.1-TTS một luồng một chiều, với gói 3.1-Next ở mức $0,848 mỗi triệu token đầu vào và $1,696 mỗi triệu token đầu ra trên node Bắc Kinh
Nghe được người gọi — Gemini 3.8 Live có, đầu vào âm thanh và video gốc so với Qwen-Audio-3.1-TTS không, đầu vào văn bản và đầu ra âm thanh
Giọng nói — Gemini 3.8 Live một giọng, không thể nhân bản, không thể gắn thương hiệu so với Qwen-Audio-3.1-TTS hơn một nghìn giọng với khả năng nhân bản zero-shot từ âm thanh tham chiếu nhiễu
Ngôn ngữ — Gemini 3.8 Live được nhà cung cấp báo cáo là 97, chuyển đổi ngay giữa cuộc trò chuyện so với Qwen-Audio-3.1-TTS được nhà cung cấp báo cáo là 16 cộng 20 vùng phương ngữ Trung Quốc, với khả năng chuyển đổi âm sắc giữa tiếng Quan Thoại, tiếng Quảng Đông, tiếng Anh và tiếng Nhật
Kiểm soát cách thể hiện — Gemini 3.8 Live lời nhắc và ngữ cảnh hội thoại so với Qwen-Audio-3.1-TTS chỉ dẫn bằng ngôn ngữ tự nhiên, thay thế 86 thẻ nội tuyến của thế hệ 3.0
Điểm độc lập — Gemini 3.8 Live 82,6 trên Artificial Analysis Speech to Speech Index cho biến thể Extended Thinking và 76,0 cho bản tiêu chuẩn so với Qwen-Audio-3.1-TTS không có; con số Qwen gần nhất là 1.259 Elo cho gói 3.0 Plus thế hệ trước trên Provider Voice Arena, đây là điểm số của phiên bản tiền nhiệm chứ không phải của mô hình này
Mức giảm phần trăm được báo giá dựa trên các mức giá thay đổi theo khu vực và hạng, nên con số 70% trên tiêu đề không phải là lời hứa về lưu lượng của bạn, và Alibaba Cloud cũng đã chuyển dịch vụ phiên âm thời gian thực trên node Singapore từ tính cước theo thời lượng sang tính cước theo token — một cơ sở khó dự đoán hơn, vì khoảng lặng và ngữ cảnh nhiều lượt đều làm tăng mức tiêu thụ token. Hãy đối chiếu bảng giá cước mới với chính âm thanh của bạn.

Những gì bản nâng cấp 3.1 không giải quyết
Đây là phần dễ bị hiểu sai theo cả hai hướng. Những cải tiến của 3.1 không biến Qwen-Audio-3.1-TTS thành ứng viên cho công việc mà Gemini 3.8 Live đảm nhận — điều khiển dựa trên chỉ dẫn, chuyển đổi âm sắc và khả năng chịu đầu vào nhiễu đều khiến nó thành một cái miệng tốt hơn, và không điều nào trong số đó cho nó một cái tai. Tương tự, vị trí benchmark của Gemini 3.8 Live không cho bạn biết bất cứ điều gì về việc liệu giọng nói mang thương hiệu của bạn có trụ được qua một câu tiếng Quảng Đông hay không.
Cũng có một lỗ hổng trong bằng chứng mà việc giảm giá khiến việc bỏ qua nó trở nên hấp dẫn hơn. Qwen-Audio-3.1-TTS không có điểm số độc lập. Mức 1.259 Elo xuất hiện bên cạnh tên Qwen trên Provider Voice Arena thuộc về Qwen-Audio-3.0-TTS-Plus, mô hình đang được thay thế, được đo trên 1.447 mẫu. Hàng Arena của chính mô hình kế nhiệm vẫn chưa tồn tại. Nếu quy trình phê duyệt của bạn yêu cầu một con số của bên thứ ba — và với giọng nói thương hiệu thì có lẽ nên như vậy — thì mô hình mới hơn là mô hình không có nó, còn gói rẻ hơn là gói mà bạn chưa thể bảo vệ. Sự kiện duy nhất có thể giải quyết được điều này là Qwen-Audio-3.1-TTS xuất hiện trên một bảng nghe mù.
Khi một phím có tác dụng và không có tác dụng
Một hệ quả của bản phát hành 3.1 rất dễ bị bỏ qua vì nó trông giống một chi tiết kỹ thuật prompt hơn là một chi tiết hạ tầng. Việc thay thế 86 thẻ được mã hóa cứng bằng chỉ dẫn dạng tự do biến các chỉ dẫn truyền đạt của bạn thành những tạo tác văn bản. Giờ đây bạn tạo chúng, đánh phiên bản cho chúng và tái xác thực từng cái một dựa trên cách diễn giải của mô hình mới — và kiểu thất bại là sự trôi dạt, không phải lỗi, vì hai cách diễn đạt "ấm áp nhưng không đa cảm" sẽ không tạo ra kết quả giống hệt nhau.
Đó là một bài toán suy luận văn bản được bao quanh bởi một pipeline giọng nói, và đó chính là chỗ chúng tôi hữu dụng. OrcaRouter không định tuyến Qwen-Audio-3.1-TTS hay bất kỳ mô hình Qwen-Audio nào, và chúng tôi cũng không định tuyến các endpoint Gemini 3.8 Live — không nửa nào của stack này có thể gọi được qua chúng tôi, và không có gì ở đây nên được hiểu là một tuyên bố rằng nó có thể. Thứ chúng tôi thực sự cung cấp là lớp viết và kiểm tra văn bản định hướng: qwen/qwen3.8-flash và google/gemini-3.8-flash trong số hơn 200 mô hình, tất cả từ một khóa duy nhất với giá niêm yết của nhà cung cấp, không cộng thêm phí, cùng một DSL định tuyến cho phép kết hợp nhiều mô hình vào một lệnh gọi duy nhất và tự động chuyển đổi dự phòng khi một upstream bị suy giảm. Khi bạn chuẩn bị xác thực lại mười nghìn prompt phân phối với một mô hình vừa thay đổi cách nó đọc chúng, việc tạo ra các biến thể và chấm điểm chúng theo tính nhất quán chính là phần lẽ ra phải là một hợp đồng duy nhất, chứ không phải bốn hợp đồng riêng lẻ.
Đo lường những gì trước khi bạn chọn
Ba thử nghiệm trả lời được nhiều hơn bất kỳ hội đồng nào. Hãy lấy một giọng tham chiếu và một đoạn kịch bản của chính bạn cho chạy qua Qwen-Audio-3.1-TTS và lắng nghe xem liệu điều khiển dựa trên chỉ dẫn có cho bạn cùng một cách thể hiện hai lần hay không — đó là rủi ro chuyển đổi, và đo nó thì rẻ hơn là lập kế hoạch để né nó. Hãy lấy một bản ghi cuộc gọi thật có tiếng ồn nền của chính bạn cho chạy qua Gemini 3.8 Live và kiểm tra xem lượt lời có giữ được không khi người gọi ngắt lời giữa từ — đó là điều mà chuyển đổi giọng nói sang giọng nói đang cố định lượng, và nó không trụ nổi khi tiếp xúc với một đường dây điện thoại thật đủ tin cậy để có thể được tin mà không cần kiểm chứng. Và hãy làm phép tính trên khối lượng của chính bạn theo giờ âm thanh thay vì theo đơn vị mà hai nhà cung cấp xuất hóa đơn, vì trong trường hợp cụ thể này, chênh lệch giá dự kiến giữa "TTS Trung Quốc giá rẻ" và "Google flagship" vốn không lớn như vẻ ngoài của nó, và sau ngày 23 tháng 9 thì nó còn nhỏ hơn nữa.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
