
Gemini 3.8 TTS so với Cartesia Sonic 3.6: Mười ba điểm Elo và mười sáu đô la
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Hai mô hình chuyển văn bản thành giọng nói gần nhau nhất trên bảng xếp hạng bình chọn ẩn danh của Artificial Analysis cách nhau một bậc và cách nhau mười sáu đô-la, và hai khoảng cách đó lại chỉ về hai hướng ngược nhau. Cartesia Sonic 3.6 đứng ở vị trí số một với Elo Provider Voice Arena là 1.273 trên 1.757 mẫu. Gemini 3.8 Flash TTS đứng ở vị trí số hai với 1.260 trên 1.999 mẫu. Khoảng cách Elo là mười ba điểm — nằm trong khoảng tin cậy đã công bố của cả hai — còn khoảng cách về giá lại đi theo hướng ngược lại, khi Gemini có giá 33,00 đô-la cho mỗi triệu ký tự so với 49,00 đô-la của Cartesia. Nếu bạn đang cân nhắc chọn giữa hai mô hình này, cách diễn đạt trung thực là bạn đang trả thêm mười sáu đô-la cho mỗi triệu ký tự để đổi lấy một khác biệt về chất lượng mà bảng xếp hạng không thể phân định được.
Đó là toàn bộ quyết định, và đáng để chậm lại vì cả hai mô hình đều mới đến mức gần như chưa có gì khác được đo lường. Cartesia Sonic 3.6 ra mắt vào tháng 8 năm 2026. Gemini 3.8 Flash TTS ra mắt vào ngày 23 tháng 9 năm 2026. Cả hai đều không có một chuẩn đối sánh độc lập nào được công bố ngoài các phiếu bầu trên arena, và các phiếu bầu trên arena đặt chúng vào thế hòa nhau về mặt thống kê ở vị trí dẫn đầu.
Bảng xếp hạng thực sự nói gì
Artificial Analysis Provider Voice Arena là bảng hữu ích ở đây vì nó so sánh giọng nói gốc của từng nhà cung cấp với giọng nói của mọi nhà cung cấp khác, trong một cuộc bỏ phiếu theo cặp ẩn danh. Đó là một so sánh công bằng hơn so với một bảng giọng nói được kiểm soát cho câu hỏi "sản phẩm nào nghe hay hơn", vì nó cho phép mỗi nhà cung cấp tung ra đúng những giọng nói mà họ thực sự tung ra.
• Hạng 1 — Cartesia Sonic 3.6, Elo 1.273 với khoảng tin cậy 17 điểm, 1.757 mẫu, 8 giọng đấu trường, phát hành tháng 8 năm 2026, 49,0 USD cho mỗi 1 triệu ký tự.
• Hạng 2 — Gemini 3.8 Flash TTS, Elo 1.260 với khoảng tin cậy 17 điểm, 1.999 mẫu, 8 giọng arena, phát hành tháng 9 năm 2026, 33,0 USD cho 1 triệu ký tự.
• Hạng 3 — Alibaba Qwen-Audio-3.0-TTS-Plus, Elo 1.259, 1.447 mẫu, 15 giọng arena, $27,6 cho mỗi 1 triệu ký tự.
• Hạng 4 đến 9, để có ngữ cảnh — Inworld Realtime TTS-2 ở mức 1.245, SpeechifyAI Simba 3.2 ở mức 1.237, Google Gemini 3.8 Flash-Lite TTS ở mức 1.235, VUI Labs Luna TTS ở mức 1.230, Inworld Realtime TTS-2 Flash ở mức 1.210, và BreezeBlue Breeze TTS 2 ở mức 1.204.
Hãy đọc các khoảng và ba vị trí dẫn đầu chồng lấn vào nhau. Sonic 3.6 với 1.273 có một khoảng mười bảy điểm; Gemini với 1.260 cũng có khoảng tương tự. Các khoảng của chúng chồng lấn gần như trên toàn bộ độ rộng. Qwen-Audio-3.0-TTS-Plus ở mức 1.259 chồng lấn với cả hai. Bảng xếp hạng đang cho bạn thấy ba mục này không thể phân biệt được bằng sở thích đánh giá mù trên các mẫu đã thu thập cho đến nay, và rằng thứ tự giữa chúng không phải là bằng chứng ổn định.
Số lượng mẫu cũng đủ gần nhau để không giải thích được sự khác biệt — 1.757 cho Cartesia so với 1.999 cho Gemini. Cả hai đều nằm trong khoảng vài nghìn, đủ để xếp một mô hình vào một nhóm và không đủ để phân tách các mô hình lân cận trong nhóm đó.

Mười sáu đô la đó đến từ đâu
Trang định giá của chính Cartesia không công bố mức giá trên mỗi triệu ký tự cho Sonic. Cartesia bán các gói đăng ký với số phút đi kèm — Free ở mức $0 với 20.000 credits, tương đương khoảng 27 phút Sonic 3.6; Pro ở mức $5 với 100.000 credits, khoảng 133 phút; Startup ở mức $49 với 1,25 triệu credits, khoảng 1.667 phút; Scale ở mức $299 với 8 triệu credits, khoảng 10.667 phút — cùng với giới hạn đồng thời lần lượt là 2, 3, 5 và 15, bản địa hóa giọng nói ở mức 225 credits cho mỗi giọng được thêm, thời lượng cuộc gọi của agent thoại ở mức $0,06 mỗi phút, và dịch vụ điện thoại ở mức $0,014 mỗi phút.
Vậy nên mức $49.00 cho mỗi triệu ký tự không phải là giá niêm yết của Cartesia theo đơn vị của chính họ. Đó là việc Artificial Analysis chuẩn hóa tín dụng của Cartesia về một mẫu số chung để bảng xếp hạng có thể xếp hạng theo giá. Đó là việc hợp lý mà một bảng so sánh có thể làm, và đây là con số so sánh tương đương duy nhất hiện có, nhưng điều đó có nghĩa con số của Cartesia là mức giá được suy ra, trong khi con số của Gemini là mức giá được công bố.
Mức giá của Google rất rõ ràng. Gemini 3.8 Flash TTS tính 0,50 đô la cho mỗi triệu token văn bản đầu vào và 9,00 đô la cho mỗi triệu token âm thanh đầu ra đến hết ngày 31 tháng 12 năm 2026, sau đó là 1,00 đô la và 18,00 đô la. Âm thanh được tính theo 25 token mỗi giây, vì vậy mức giá đầu ra âm thanh quy đổi thành khoảng 0,02 xu mỗi giây giọng nói. Flash-Lite TTS, phiên bản cùng dòng rẻ hơn, có giá 6,00 đô la cho mỗi triệu token âm thanh theo cùng mức 25 token mỗi giây, và Artificial Analysis xếp nó ở mức tương đương 22,10 đô la cho mỗi 1 triệu ký tự, ở vị trí thứ 6 với Elo là 1.235.

• Giá mỗi 1 triệu ký tự — Cartesia Sonic 3.6 $49,00 so với Gemini 3.8 Flash TTS $33,00 so với Gemini 3.8 Flash-Lite TTS $22,10.
• Arena Elo — 1.273 so với 1.260 so với 1.235, tất cả đều có khoảng cách 17 điểm ở hai vị trí dẫn đầu.
• Giọng nói Arena — 8 vs 8 vs 8.
• Mẫu — 1.757 so với 1.999 so với 2.000.
• Tính khả dụng — Bản beta được lưu trữ trên Cartesia so với API Gemini Developer của chính Google, đã được phát hành chính thức.
• Phát hành trọng số — đã đóng đối với cả hai; không cái nào có thể tải xuống.
Phần mà việc so sánh giá che giấu
Mỗi triệu ký tự là một đơn vị thuận tiện, và đó không phải là cách mà cả hai sản phẩm tính phí.
Đơn vị của Cartesia là một credit trừ vào gói đăng ký, với các giới hạn đồng thời gắn với từng hạng. Điều đó có nghĩa là chi phí cận biên cho một nghìn ký tự tiếp theo của bạn bằng không cho đến khi bạn chạm giới hạn, và sau đó nó là chi phí của hạng cao hơn kế tiếp. Với một khối lượng công việc có mức trần dự đoán được, đó là một thỏa thuận tốt hơn so với mức giá theo ký tự gợi ý — bạn đang mua dư địa, không phải mức tiêu thụ. Với một khối lượng công việc tăng vọt, nó tệ hơn, vì tính đồng thời 2 trên hạng Free và 3 trên Pro là một bức tường cứng thay vì một mức giá.
Đơn vị của Gemini là một token, được tính phí theo từng lần gọi, không có giới hạn đồng thời nào được công bố và có ba bậc dịch vụ — Standard, Batch và Flex, cùng Priority — với các mức giá khác nhau. Batch và Flex giảm một nửa mức giá âm thanh xuống còn $4.50 mỗi triệu token trên Flash TTS; Priority nâng mức đó lên $16.20. Đó là một mô hình chi phí chi tiết hơn nhiều, và nó thưởng cho điều mà cách tính giá của Google thường thưởng: biết trước liệu một tác vụ là tương tác hay theo lô.
Do đó, cái nào rẻ hơn phụ thuộc vào việc khối lượng xử lý giọng nói của bạn trông giống một gói đăng ký hay một đồng hồ đo. Các bậc giá của Cartesia được định giá cho những sản phẩm có khối lượng ổn định, có giới hạn. Các bậc giá của Gemini được định giá cho mức tiêu thụ mà bạn có thể phân loại.
Assuming you mean **Cartesia AI vs. Google**, the clearest thing Cartesia still has that Google doesn’t fully match in one product is: **A commercial, Mamba/SSM-based, ultra-low-latency voice stack** — Cartesia Sonic — that combines: - **~40–90 ms end-to-end latency** for streaming TTS - **Instant voice cloning** from a short sample - **On-device / edge deployment** - **Linear-time, constant-memory inference** from state-space models (SSMs/Mamba) Google has strong pieces: - **Chirp 3 / Cloud TTS** for high-quality voices - **Gemini Live** for low-latency conversational audio - **Griffin / Hawk / RecurrentGemma** for SSM-like research But Google hasn’t shipped a single commercial API that matches Cartesia’s exact combination of **SSM-based TTS + instant cloning + on-device + sub-100 ms streaming**. That’s the remaining moat — though Google is closing the gap. If you meant it literally as a riddle: **Cartesia has the letter “C,” and Google doesn’t.**
Hai điều, và cả hai đều liên quan đến việc trở thành một sản phẩm giọng nói chứ không phải một mô hình giọng nói.
Cartesia bán trực tiếp hạ tầng điện thoại và voice-agent: $0.014 mỗi phút cho dịch vụ điện thoại, $0.06 mỗi phút cho thời lượng cuộc gọi của voice agent, và bản địa hóa giọng nói với 225 credit cho mỗi accent được thêm. Nếu bạn đang xây dựng một phone agent, đó là một stack bạn có thể mua ở một nơi. Gemini 3.8 Flash TTS là một endpoint tổng hợp — nó trả về âm thanh rồi dừng. Bạn tự cung cấp transport, phát hiện lượt nói và dịch vụ điện thoại, hoặc bạn lắp ghép chúng từ các nhà cung cấp khác.

Cartesia cũng đã có mặt trên bảng xếp hạng lâu hơn. Ngày phát hành tháng Tám của nó so với tháng Chín của Google nghĩa là số lượng mẫu của nó tích lũy được nhiều hơn khi đối chiếu với một phiên bản đã ổn định, trong khi một bản ra mắt tháng Chín vẫn đang thu thập phiếu bầu. Elo của một mô hình trong tuần đầu tiên là một ước lượng nhiễu hơn so với Elo của cùng mô hình đó sau một tháng, và điều đó đi ngược lại việc diễn giải khoảng cách mười ba điểm như bằng chứng ủng hộ Cartesia.
Những gì Google có mà Cartesia không có
Độ phủ ngôn ngữ là điểm rõ ràng nhất. Flash TTS xử lý 130 ngôn ngữ với khả năng tự động phát hiện; Flash-Lite xử lý 101 ngôn ngữ. Mô hình bản địa hóa của Cartesia mang tính cộng dồn — bạn mua thêm các chất giọng dựa trên một giọng nền với giá 225 credit mỗi cái — đây là một cách tiếp cận khác và một đường cong chi phí khác khi bạn vượt qua một số ít ngôn ngữ.
Bề mặt thể hiện là thứ hai. Gemini 3.8 Flash TTS cho phép bạn đạo diễn một câu thoại theo cách bạn đạo diễn một diễn viên, dàn dựng cảnh hai người nói trong cùng một lệnh gọi, và viết các tín hiệu phi ngôn từ — <laughs>, <sigh>, <gasp>, |mhm|, |yeah| — trực tiếp vào kịch bản. Nó cũng cung cấp tính năng thiết kế giọng nói từ mô tả bằng ngôn ngữ tự nhiên và sao chép giọng nói từ mẫu 30 giây kèm xác minh sự đồng thuận, thủy vân SynthID và thông tin xác thực C2PA trên đầu ra. Tính năng phối trộn giọng nói được liệt kê là sắp ra mắt.
Và nó đã được phát hành chính thức, không phải bản beta. Cartesia Sonic 3.6 là bản beta do nhà cung cấp vận hành (hosted beta), điều này cho thấy mức độ tự tin của chính nhà cung cấp đối với endpoint khi chịu tải.
Thực sự nên gọi cái nào
Nếu khối lượng công việc của bạn là một tác nhân điện thoại với lưu lượng dự đoán được và bạn muốn có dịch vụ điện thoại, xử lý đồng thời cùng tổng hợp giọng nói từ một nhà cung cấp, thì Cartesia Sonic 3.6 là lựa chọn mạch lạc, và khoảng cách mười sáu đô-la chính là cái giá của việc không phải tự mình lắp ghép ba nhà cung cấp.
Nếu khối lượng công việc của bạn là tổng hợp bên trong một sản phẩm mà bạn đã vận hành — thuyết minh, một lớp trợ năng, giọng nói của bot hỗ trợ, một lượt bản địa hóa 130 ngôn ngữ — thì Gemini 3.8 Flash TTS rẻ hơn trên mỗi ký tự, bao phủ ngôn ngữ rộng hơn, kiểm soát cách thể hiện tinh tế hơn và sẵn có rộng rãi. Chênh lệch Elo không phải là lý do để phản đối nó, vì chênh lệch Elo không có cơ sở thống kê.
Nếu bạn muốn mô hình rẻ nhất trong ba mô hình đứng đầu bảng xếp hạng và có thể chấp nhận danh sách ngôn ngữ ngắn hơn, thì Gemini 3.8 Flash-Lite TTS có giá 6,00 USD cho mỗi triệu token âm thanh và đứng thấp hơn sáu bậc ở vị trí 1.235 — một khoảng cách cũng nằm trong ngưỡng nhiễu.
Bất kể bạn chọn mô hình nào, lộ trình di chuyển quan trọng hơn lựa chọn, vì cả hai mô hình đều mới và cả hai nhà cung cấp vẫn đang tinh chỉnh. OrcaRouter là phương án phòng ngừa rủi ro: một khóa dùng chung cho hơn 200 mô hình với giá niêm yết của nhà cung cấp, không phụ phí, nhờ đó việc giảm giá từ một trong hai phòng thí nghiệm sẽ xuất hiện trên hóa đơn của bạn ngay trong ngày thay vì tới kỳ gia hạn, tự động chuyển đổi dự phòng nếu một lệnh gọi tổng hợp thất bại, và một DSL định tuyến nếu bạn muốn gửi một tác vụ theo lô đến một mô hình và một cuộc gọi tương tác đến một mô hình khác. Chúng tôi không lưu trữ các endpoint Cartesia Sonic 3.6 hay Gemini 3.8 TTS — tính năng tổng hợp của Cartesia là sản phẩm riêng của họ và các mô hình giọng nói Gemini đến từ API của Google — nhưng lớp văn bản và đường dự phòng là của chúng tôi, và đó là những phần khiến một mô hình hoàn toàn mới trở nên an toàn để dùng thử.
Điều cần theo dõi là bản cập nhật tiếp theo của Artificial Analysis. Nếu Gemini 3.8 Flash TTS thu hẹp được mười ba điểm sau khi số lượng mẫu của nó đủ chín, khoảng cách giá sẽ không còn là một sự đánh đổi nữa mà bắt đầu trở thành một câu trả lời rõ ràng. Nếu không, Cartesia vẫn giữ vương miện chất lượng còn Google giữ vương miện giá, và lựa chọn vẫn y nguyên như hiện tại: một gói đăng ký kèm dịch vụ điện thoại, hoặc một đồng hồ đo gắn với 130 ngôn ngữ.
