
Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: Giọng nói biết lắng nghe vs Ông hoàng đấu trường
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Có hai lý thuyết cạnh tranh giải thích vì sao giọng nói tổng hợp lại tạo cảm giác như con người, và hiện tại hai ví dụ thương mại tốt nhất cho từng lý thuyết là Inworld Realtime TTS-2 và Cartesia Sonic 3.6. Lý thuyết của Cartesia cho rằng tính người nằm trong âm thanh: khiến âm sắc, ngữ điệu và nhịp điệu không thể phân biệt với một người thật, và người nghe sẽ xếp bạn ở vị trí số một — đó là điều Sonic 3.6 đã làm vào tháng 8, khi vọt lên đứng đầu Provider Voice arena của Artificial Analysis với Elo 1.282. Lý thuyết của Inworld cho rằng tính người nằm trong việc lắng nghe: TTS-2 điều chỉnh cách truyền tải dựa trên âm thanh thực tế của cuộc trò chuyện diễn ra trước đó, vì vậy nó không chỉ nghe giống một người mà còn đáp lại như một người. Tuần này, hai lý thuyết đã va chạm trên bảng xếp hạng: chính cách chấm điểm lại đưa Inworld Realtime TTS-2 lên vị trí số 2 trên bảng nhà cung cấp, với Elo 1.252, cũng đưa nó lên vị trí số 1 trên Controlled Voice arena — bảng xếp hạng mà Cartesia từng dẫn đầu — với 1.123 so với 1.119 của Sonic 3.6. Một mô hình nắm giữ vương miện nhà cung cấp. Mô hình còn lại vừa giành lấy vương miện có kiểm soát.
Đây không phải là cuộc so tài mà một bên rõ ràng sai. Hai mô hình được xây dựng cho các công việc chồng chéo nhưng không giống hệt nhau, và chênh lệch giá — Sonic 3.6 ở mức 49,0 đô la mỗi triệu ký tự so với 25 đô la theo yêu cầu cho Inworld Realtime TTS-2 — là đủ thực tế để quyết định có cả yếu tố ngân sách lẫn chất lượng.
Hai lý thuyết về giọng nói giống người
Cartesia âm thầm phát hành Sonic 3.6 vào tháng 8 năm 2026, một bản phát hành nhỏ cải tiến hơn Sonic 3.5 mà không thay đổi giá bán lẫn câu chuyện kiến trúc. Sự cải tiến xuất hiện đúng nơi Cartesia cần đến: mô hình vươn lên Elo 1.282 trên đấu trường Provider Voice của Artificial Analysis — nơi mọi mô hình dùng giọng đọc gốc của riêng mình — và giữ vững vị trí dẫn đầu đấu trường Controlled Voice suốt tháng 8. Trên bảng có kiểm soát, mọi mô hình đều được nhân bản lên cùng tám giọng tham chiếu, nên ngôi vương đó là phán quyết về chính engine tổng hợp, độc lập với diễn viên lồng tiếng. Sau đợt chấm điểm lại cho bản phát hành GA của Inworld trong tuần này, Cartesia vẫn dẫn đầu bảng provider, nhưng Sonic 3.6 giờ đứng #2 trên bảng có kiểm soát với Elo 1.119, kém Inworld Realtime TTS-2 bốn điểm khi đối thủ đạt 1.123.
Inworld Realtime TTS-2 xuất phát từ một trường phái khác. Dòng sản phẩm tiền nhiệm của nó, TTS 1.5, đã dành đầu năm 2026 để giữ vị trí gần đỉnh tại cùng các đấu trường đó, và bản xem trước nghiên cứu của TTS-2 đạt mức Elo 1.209 trên bảng xếp hạng provider vào tháng 6. Kể từ đó, phiên bản GA đã leo cao hơn: trên các bảng xếp hạng hiện tại, mô hình đạt 1.252 trên bảng Provider Voice (#2, sau Sonic 3.6 với 1.282) và 1.123 trên bảng Controlled Voice (#1). Điều thực sự tạo nên khác biệt của mô hình chủ lực, tuy vậy, không nằm ở Elo; mà nằm ở việc mô hình nhận các lượt trò chuyện trước đó làm đầu vào âm thanh và để chúng định hình cách nó truyền tải câu tiếp theo. Cartesia hiệu chỉnh cảm xúc dựa trên bản ghi hội thoại. Inworld lắng nghe cách câu cuối cùng được nói ra.
Bảng điểm, được dán nhãn trung thực.
Chỉ số Elo được lấy từ các đấu trường hội thoại của Artificial Analysis, đọc từ bảng xếp hạng trực tiếp vào tháng 9 năm 2026. Số liệu độ trễ do nhà cung cấp báo cáo trừ khi có ghi chú khác, và chưa có bản kiểm toán độ trễ độc lập nào được công bố cho cả hai mô hình.
• Chất lượng độc lập — Cartesia Sonic 3.6: Elo 1,282 (#1, Giọng nói của nhà cung cấp) và 1,119 (#2, Giọng nói được kiểm soát) so với Inworld Realtime TTS-2: Elo 1,252 (#2, Giọng nói của nhà cung cấp) và 1,123 (#1, Giọng nói được kiểm soát)
• Giá mỗi 1 triệu ký tự — $49.0 (theo dữ liệu theo dõi của Artificial Analysis) so với $25 trả theo yêu cầu, $20.8 mức trung bình theo dữ liệu của Artificial Analysis, giảm xuống $12.50 khi mua với khối lượng lớn (theo nhà cung cấp)
• Thời gian phát âm thanh đầu tiên — dưới 90 ms (theo công bố của nhà cung cấp) so với mức trung vị dưới 200 ms, dưới 100 ms tại p99 trong các bài thử nghiệm ra mắt của Inworld (theo công bố của nhà cung cấp); giải pháp độ trễ thấp của Inworld để đối đầu với Sonic là tầng TTS-2 Flash riêng biệt với thời gian đến byte đầu tiên khoảng 25 ms.
• Ngôn ngữ — 42 ngôn ngữ được bản địa hóa so với 100+ ngôn ngữ cho việc điều hướng phân phối, với tuyên bố nhận dạng giọng nói đơn nhất của Inworld mở rộng đến 200+ địa phương (theo công bố của nhà cung cấp)
• Nhân bản giọng nói tức thì — ~10 giây âm thanh so với 5–15 giây, cùng với bản beta nhân bản chuyên nghiệp cần ~10 phút âm thanh để tạo ra các bản nhân bản có độ trung thực cao hơn
• Kiểm soát giọng đọc — thẻ chú thích nội tuyến như [laughter], điều chỉnh âm lượng và tốc độ hoặc điều khiển bằng tiếng Anh tự nhiên như "[calm, reassuring]" hay [whisper], chỉ thị cấp độ yêu cầu, và ba chế độ ổn định từ Stable đến Expressive.

Tại sao "lắng nghe cuộc trò chuyện" lại là một trục khác biệt
Bảng điểm ở trên đo cách một giọng nói nghe như thế nào khi đứng riêng lẻ. Khía cạnh mà hai mô hình thực sự khác biệt không xuất hiện trên bất kỳ bảng xếp hạng nào, vì nó chỉ tồn tại qua nhiều lượt hội thoại.
Inworld Realtime TTS-2 được xây dựng cho tình huống một người vừa nói điều gì đó với nó. Mô hình tiếp nhận âm thanh của các lượt trò chuyện trước — không chỉ bản ghi văn bản của chúng — phân tích giọng điệu, nhịp độ và trạng thái cảm xúc, rồi chọn trạng thái phản hồi trước khi cất tiếng. Nếu người gọi đang bực bội, cách truyền tải sẽ thay đổi; nếu họ đang thư giãn, nó sẽ trở lại trạng thái bình thường. Đó là lý do Inworld tiếp thị mô hình này cho các agent, bạn đồng hành và trò chơi thay vì cho việc tường thuật: tính năng này vô nghĩa trong một lần gọi chuyển văn bản thành âm thanh một chiều, nhưng lại có ý nghĩa trong một cuộc hội thoại.
Cartesia Sonic 3.6 hoạt động theo cách khác. Đây là một engine phát trực tuyến nhanh, chất lượng cao, và tuyên bố của Cartesia là tự động hiệu chỉnh cảm xúc từ bản transcript — nó đọc các từ và điều chỉnh theo. Điều nó không làm là nghe âm thanh của những lượt thoại trước đó. Trong một lượt nói đơn lẻ, cả hai có thể nghe tương đương nhau; còn trong một cuộc hội thoại, Inworld đang mô hình hóa điều mà Sonic không cố gắng thực hiện. Nếu sản phẩm của bạn là một bản lồng tiếng một lượt, việc mô hình hóa đó là dư thừa. Nếu nó là một trợ lý trực tiếp, thì đó chính là sản phẩm.

Tốc độ, giá và lưu ý về Flash
Về độ trễ thuần túy, Cartesia vẫn là đơn vị dẫn đầu: thời gian đến âm thanh đầu tiên dưới 90 ms là con số do nhà cung cấp công bố, nhưng đó là con số công ty đã xuất xưởng từ thế hệ Sonic 3 và chưa ai công bố bản kiểm toán nào mâu thuẫn. Sản phẩm chủ lực của Inworld phản hồi ở mức hội thoại tương tự trong vòng chưa đến 200 ms, điều này đủ tốt cho các tác nhân trực tiếp. Chiến lược độ trễ thực sự của Inworld nằm ở tầng Flash, được phát hành cùng với mô hình GA — một mô hình riêng biệt có thời gian đến byte đầu tiên khoảng 25 ms, nhắm đến khối lượng công việc lớn, nơi chi phí và độ trễ kiểu Sonic quan trọng hơn tính biểu cảm. Điểm cần lưu ý là Flash là một phiên bản rút gọn trong cùng gia đình: nhân bản tức thời và phi ngôn ngữ nhúng, nhưng không có nhân bản chuyên nghiệp và không có điều khiển ngôn ngữ tự nhiên đầy đủ.
Giá lại giảm theo hướng ngược lại. Sonic 3.6 có giá 49,0 USD mỗi triệu ký tự — gần gấp đôi mức giá theo yêu cầu 25 USD của Inworld, và gần bốn lần mức cao nhất là 12,50 USD. Khoảng cách về chất lượng giữa chúng, trên các bảng xếp hạng nơi cả hai xuất hiện, không biện minh cho mức chênh lệnh đó đối với người mua khối lượng lớn. Đối với một tác nhân giọng nói thời gian thực tạo ra hàng nghìn ký tự mỗi cuộc trò chuyện, chênh lệnh trên mỗi ký tự chính là sự khác biệt giữa một nền kinh tế đơn vị lành mạnh và một nền kinh tế mỏng manh.
Nên chọn cái nào
• Chọn Cartesia Sonic 3.6 nếu bạn muốn ngôi vương trên bảng xếp hạng nhà cung cấp — giọng nói đạt điểm cao nhất khi sử dụng giọng đọc gốc của chính nó, Elo 1,282, cho các câu nói ngắn, khép kín như câu trả lời của trợ lý, lời thoại trò chơi và thông báo trạng thái. Với mức giá 49 đô la mỗi triệu ký tự, bạn trả tiền cho ngôi vương, và nó vẫn là mô hình cần phải vượt qua trên bảng xếp hạng đó.
• Chọn Inworld Realtime TTS-2 nếu sản phẩm là một cuộc hội thoại nhiều lượt, nơi lời đáp cần phản hồi người ở đầu dây bên kia — các cuộc gọi hỗ trợ, một người bạn đồng hành, một cuộc phỏng vấn, một buổi dạy kèm. Hiện nó dẫn đầu bảng xếp hạng có kiểm soát, nơi mọi mô hình đều nói cùng tám giọng tham chiếu, và nó làm vậy với giá chỉ bằng khoảng một nửa trong khi vẫn nghe âm thanh của cuộc trò chuyện.
• Hãy đưa tính năng chuyển đổi ngay vào lớp định tuyến nếu bạn không thể biết trước cuộc gọi cần loại giọng nói nào. Tính đến thời điểm viết bài này, cả hai mô hình đều chưa có trên OrcaRouter — Sonic được truy cập qua API riêng của Cartesia và một số nền tảng bên thứ ba, Inworld qua API của chính nó — nhưng một lớp định tuyến chính là cấu trúc cho phép cuộc trò chuyện bắt đầu bằng một giọng nói rồi chuyển sang giọng nói kia khi xảy ra lỗi, với giá niêm yết của từng nhà cung cấp được chuyển thẳng, không cộng thêm phí. Ngày một trong những bảng xếp hạng này lại đảo chiều — và tuần này chúng đã như vậy — lựa chọn chỉ còn là thay đổi cấu hình thay vì viết lại mã.
Phiên bản ngắn
Đây là một sự phân nhánh thực sự, và câu trả lời thẳng thắn là sự phân nhánh nằm ở việc luân phiên lượt nói, chứ không phải chất lượng âm thanh. Nếu bạn cần một giọng nói độc lập có điểm số cao nhất sử dụng giọng nói gốc của riêng mình, Cartesia Sonic 3.6 đang giữ ngôi vương nhà cung cấp với Elo 1.282 và tính phí 49 đô la mỗi triệu ký tự. Nếu bạn cần một giọng nói phản hồi theo cách nó được nói chuyện cùng, Inworld Realtime TTS-2 vừa chính thức phát hành (GA) trong tuần này ở mức 25 đô la trả theo nhu cầu, dẫn đầu bảng xếp hạng có kiểm soát — nơi cả hai so tài bằng những giọng nói ngang bằng — và mang một tính năng nhận thức hội thoại mà không một đấu trường nào đo lường trọn vẹn. Các bảng điểm hiện đang chia đều giữa hai mô hình — đây là bức tranh trung thực nhất có thể về một thị trường nơi "tốt nhất" phụ thuộc vào bài kiểm tra.

