
GPT-Live-1 vs Inworld Realtime TTS-2: Cuộc chiến giá về giọng nói, đề cao việc lắng nghe
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Inworld Realtime TTS-2 đã đạt mức phát hành rộng rãi với một thứ mà thị trường giọng nói vẫn còn thiếu: một bảng giá được công bố. Mô hình chủ lực có giá 25 USD mỗi triệu ký tự khi dùng theo nhu cầu, phiên bản anh em nhanh hơn là Inworld Realtime TTS-2 Flash có giá 15 USD, và cả hai đều giảm dần theo các bậc khối lượng xuống còn 12,50 USD và 7 USD. Với vị trí Elo 1.244 và vị trí thứ hai trên đấu trường giọng nói của Artificial Analysis, điều đó khiến mô hình chủ lực có giá chỉ bằng khoảng một nửa so với mô hình dẫn đầu đấu trường hiện tại và là một trong những cách rẻ nhất để sở hữu một giọng nói nằm trong top 5. GPT-Live-1 là mô hình còn lại trong phép so sánh này và là đề xuất trái ngược — 0,05 USD mỗi phút giọng nói, không liên quan đến ký tự, và không có cách nào mua nó mà không đồng thời mua cả khả năng lắng nghe, khả năng luân phiên lượt nói và khả năng xử lý ngắt lời vốn đi kèm.
Điều thú vị khi so sánh chúng là khoảng cách giá trông có vẻ khổng lồ rồi phần lớn lại biến mất. Synthesis đang trong một cuộc chiến giá. Conversation thì không.
Inworld thực sự đã phát hành những gì
Dòng TTS-2 khởi đầu như một bản xem trước nghiên cứu vào tháng 5 năm 2026 với một tuyên bố cụ thể: rằng đây là một mô hình không tạo ra giọng nói một cách tách biệt. Nó lấy các lượt trước đó của một cuộc hội thoại làm đầu vào âm thanh, suy luận về tông giọng và nhịp điệu, rồi điều chỉnh cách nó phản hồi. Cách định vị đó — nhận biết hội thoại thay vì âm thanh sạch hơn — chính là điều tách biệt nó khỏi các công cụ tường thuật vốn thống trị text-to-speech suốt năm 2025.
Việc GA đã biến bản xem trước thành một họ sản phẩm và kèm theo một bảng giá. Flash là phương án thiên về thông lượng, khi Inworld công bố thời gian đến byte đầu tiên phía máy chủ khoảng 20 mili giây ở phân vị thứ 90, so với 100 mili giây ở mẫu chủ lực, và thời gian trung vị đến âm thanh đầu tiên dưới 200 mili giây. Đó là các số liệu của nhà cung cấp từ tài liệu của chính Inworld; phép đo của bên thứ ba duy nhất đang lưu hành, từ Coval, cho thấy Flash ở khoảng 25 mili giây và mẫu chủ lực ở mức đầu hàng trăm mili giây. Cả hai đều chưa được kiểm chứng độc lập từ đầu đến cuối.
Tính năng đáng chú ý nhất không liên quan gì đến độ trễ. Inworld đã bổ sung chế độ nguyên văn để số đơn hàng, mã xác nhận, địa chỉ và số sê-ri được đọc lại từng ký tự một thay vì bị chuẩn hóa thành thứ gì đó nghe tự nhiên nhưng sai. Đối với một tác nhân thoại vừa nhận đặt chỗ, chỉ một thẻ đó là khác biệt giữa một sản phẩm hoạt động được và một bản demo bị chuyển lên cho người thật xử lý.

Từng chiều một
• Loại — GPT-Live-1: speech-to-speech song công hoàn toàn trong một mô hình so với Inworld Realtime TTS-2: một mô hình chuyển văn bản thành giọng nói, với tính năng song công có sẵn riêng thông qua Realtime API của Inworld
• Đơn vị giá — GPT-Live-1: 0,05 USD mỗi phút thoại, tính phí theo từng giây, backend suy luận được tính riêng, so với Inworld Realtime TTS-2: 25 USD mỗi triệu ký tự khi dùng theo yêu cầu, 20 USD ở gói Creator và 12,50 USD ở bậc cao nhất, với Flash ở mức 15 USD, 10 USD và 7 USD
• Chất lượng độc lập — GPT-Live-1: 70,3% trên Speech to Speech Index, đồng hạng sáu trong số mười bốn, so với Inworld Realtime TTS-2: Elo 1.244 từ 1.091 mẫu và đứng thứ hai trên Artificial Analysis Provider Voice arena, với Flash ở Elo 1.211 từ 1.626 mẫu và đứng thứ sáu
• Ngắt lời — GPT-Live-1: native, được quyết định bên trong mô hình nhiều lần mỗi giây so với Inworld Realtime TTS-2: không phải là thuộc tính của mô hình TTS; API Realtime của Inworld hỗ trợ barge-in với độ trễ ngắt lời khoảng 100 mili giây, qua một socket duy nhất sử dụng giao thức OpenAI Realtime
• Độ trễ — GPT-Live-1: độ trễ chuyển lượt là 0,798 giây trong thử nghiệm của chính OpenAI, không công bố thời gian đến âm thanh đầu tiên so với Inworld Realtime TTS-2: 100 mili giây phía máy chủ ở phân vị thứ 90, Flash ở mức 20, với trung vị dưới một giây để đến đoạn âm thanh đầu tiên trên toàn bộ pipeline Realtime API
• Ngôn ngữ — GPT-Live-1: các ngôn ngữ chính được phục vụ tốt, nhưng không đồng đều ở những ngôn ngữ ngoài nhóm đó, so với Inworld Realtime TTS-2: hơn 200 locale, với 15 locale đạt chất lượng Tier 1 và 79 locale khác đạt Tier 2, cùng một bản sắc giọng nói được giữ nguyên xuyên suốt tất cả
• Giọng nói và nhân bản giọng nói — GPT-Live-1: mười hai preset, không nhân bản so với Inworld Realtime TTS-2: 282 giọng có sẵn, nhân bản zero-shot tức thì từ 5 đến 15 giây âm thanh được ủy quyền, nhân bản chuyên nghiệp và điều khiển toàn bộ cách thể hiện chỉ trên flagship
• Triển khai — GPT-Live-1: chỉ dạng hosted, một endpoint, không có gói miễn phí, giới hạn đồng thời ở mức 25 đến 500 phiên so với Inworld Realtime TTS-2: API hosted cùng một container tại chỗ (on-premises) có kiểm soát truy cập, yêu cầu H100, và một gói miễn phí theo yêu cầu bao gồm tối đa khoảng 70 phút tổng hợp

Câu hỏi về duplex, được trả lời chính xác
Sẽ rất dễ để viết so sánh này thành “một bên lắng nghe, bên kia chỉ nói”, và điều đó sẽ sai theo một cách đáng kể. Các mô hình chuyển văn bản thành giọng nói của Inworld là đầu vào văn bản, đầu ra âm thanh. Nhưng Inworld cũng cung cấp một Realtime API chạy trên một kết nối WebSocket, WebRTC hoặc SIP duy nhất và có tính song công theo đúng nghĩa mà nhà phát triển quan tâm: nó nhận tính năng phát hiện hoạt động giọng nói theo ngữ nghĩa với thiết lập độ sẵn sàng có thể điều chỉnh, hỗ trợ điều khiển lượt thủ công, và ngắt khi người dùng nói chen vào trong khoảng 100 mili giây. Nó tương thích giao thức với giao diện OpenAI Realtime, khiến việc di chuyển trở thành một thao tác cấu hình thay vì phải viết lại.
Điều mà Realtime API của Inworld không phải là một mô hình speech-to-speech gốc. Nó là một cascade — một mô hình nhận dạng giọng nói có thể thay thế, một mô hình ngôn ngữ do bạn chọn, và một bộ tổng hợp — được điều phối trong cùng một kết nối. Đó là một lựa chọn kiến trúc chính đáng và cũng là lựa chọn mà hầu hết các voice agent production đưa ra. Nó chỉ đơn giản là một lựa chọn khác so với GPT-Live-1, nơi một mô hình duy nhất quyết định thời điểm nhường lượt.
Sự khác biệt thực tế thể hiện rõ khi người gọi ngắt lời giữa câu. Trong mô hình cascade, việc ngắt lời được phát hiện, quá trình sinh phản hồi bị hủy, và một lượt mới bắt đầu — một trình tự vận hành tốt nhưng khiến bạn tốn một vòng khứ hồi. Trong mô hình đầu-cuối, quyết định vốn đã được đưa ra liên tục. Cái trước là một hệ thống phản hồi nhanh. Cái sau là một hệ thống không bao giờ ngừng lắng nghe.

Tính toán các con số, bởi vì các đơn vị đo đang che giấu câu trả lời.
Tốc độ nói ở khoảng 150 từ một phút, và tiếng Anh trung bình khoảng 5,5 ký tự mỗi từ, nên một phút đầu ra giọng nói tương đương khoảng 800 đến 900 ký tự. Với mức 25 USD mỗi triệu, Inworld Realtime TTS-2 tạo ra một phút giọng nói với chi phí khoảng hai xu. Với mức 15 USD của Flash, con số này dưới một xu rưỡi.
So với mức 0,05 USD mỗi phút thoại của GPT-Live-1, điều đó trông như một màn thắng áp đảo — cho đến khi bạn tính giá phần còn lại mà GPT-Live-1 đang làm. Realtime API của Inworld vẫn cần nhận dạng giọng nói và một mô hình ngôn ngữ, cả hai đều được tính phí riêng và đều mang độ trễ của riêng chúng. Gộp những khoản đó vào, chi phí mỗi phút của cascade sẽ vượt quá 5 xu đối với bất kỳ cuộc gọi nào có một câu hỏi thực sự. Khoản phụ trội của mô hình đầu-cuối không phải để trả cho giọng nói. Nó là để trả cho việc luân phiên lượt nói, và nó xấp xỉ chi phí của giai đoạn nhận dạng giọng nói mà bạn không còn phải mua.
Nơi cascade chiếm ưu thế quyết định là ở khối lượng mà không cần hội thoại. Các cuộc gọi thông báo, xác nhận giao hàng, nhắc nhở lịch hẹn, IVR theo kịch bản — bất cứ thứ gì mà văn bản đã được biết trước khi cuộc gọi bắt đầu và sẽ không ai ngắt lời. Ở đó, giá theo ký tự từ $7 đến $15 mỗi triệu ký tự đơn giản là rẻ hơn so với song công tính theo phút, và việc trả tiền cho lượt lời mà bạn không bao giờ dùng là lãng phí.
Cũng có một con đường trung dung mà cách đóng khung bằng hai mô hình đã che khuất. Nếu dù sao bạn cũng đang lắp ghép một cascade, thì tầng giọng nói không nhất thiết phải đến từ một nhà cung cấp giọng nói chuyên dụng: các mô hình TTS của chính OpenAI và các mô hình xem trước Gemini TTS của Google cũng chỉ là những endpoint API thông thường, và chúng đã được định tuyến. Khoảng 190 mô hình từ mười một nhà cung cấp thượng nguồn nằm sau một khóa OrcaRouter duy nhất, với giá niêm yết của nhà cung cấp và không cộng thêm đồng nào — nhờ đó một mô hình tổng hợp có thể nằm trong cùng một danh mục, trên cùng một khóa và cùng một hóa đơn với mô hình suy luận mà nó cấp dữ liệu cho, kèm khả năng chuyển đổi dự phòng tự động nếu một endpoint suy giảm giữa chừng khi triển khai. Đây là chặng kém hào nhoáng nhất của một ngăn xếp giọng nói và cũng là chặng dễ hợp nhất nhất. Cả Realtime TTS-2 của Inworld lẫn endpoint Live Sessions của GPT-Live-1 đều không khả dụng theo cách đó; hai thứ đó thuộc về nhà cung cấp của chúng.
Chọn cái nào?
Chọn Inworld Realtime TTS-2 nếu khối lượng sử dụng là mấu chốt và cuộc hội thoại đã được kịch bản hóa. Dành cho các agent thông lượng cao, thông báo, sản phẩm đa ngôn ngữ nơi 200 locale và một bản sắc giọng nói được giữ nguyên là điều quan trọng, hoặc bất kỳ triển khai nào cần container tại chỗ. Bạn nhận được một giọng nói top hai trên đấu trường với mức giá chỉ bằng khoảng một nửa giá của sản phẩm dẫn đầu, một gói miễn phí để tạo nguyên mẫu, tính năng nhân bản mà GPT-Live-1 hoàn toàn không cung cấp, và một Realtime API xử lý ngắt lời thành thạo theo mô hình cascade mà bạn có thể đã chạy.
Chọn GPT-Live-1 nếu sự ngắt lời chính là sản phẩm. Những cuộc gọi đi chệch kịch bản, người gọi nói lấn át agent, những quy trình mà việc luân phiên lượt lời là khác biệt giữa một cuộc trò chuyện và một menu. Bạn trả mức giá theo phút không giảm khi giọng nói trở nên rẻ, bạn từ bỏ cloning và 200 ngôn ngữ, và bạn mua lại những mối nối.
Cuộc chiến giá trong tổng hợp giọng nói là có thật và là tin tốt cho bất kỳ ai đang xây dựng một tác nhân thoại — một giọng nói top 5 giờ đây chỉ tốn một phần năm so với cách đây mười tám tháng. Điều đó chỉ không giải quyết được phép so sánh này, bởi vì thứ mà GPT-Live-1 tính phí không phải là thứ mà Inworld đang giảm giá.
