Thẻ tiêu đề hero cho 'GPT-Live-1 vs Sesame Preview', có phụ đề 'Giọng nói tốt nhất ở đây là giọng không có API', với huy hiệu ghi 'Một bên miễn phí và đóng, một bên trả phí và có thể gọi được' và ba thẻ: 'Sesame Preview — ứng dụng miễn phí, không có API, giọng nói production chưa phát hành', 'GPT-Live-1 — 0,05 USD mỗi phút giọng nói, API công khai kể từ ngày 10 tháng 9 năm 2026' và 'Phần có thể xây dựng của Sesame — CSM-1B, Apache-2.0, 1 tỷ tham số, 7 USD mỗi 1 triệu ký tự hoặc tự host', phía trên một dải chân trang ghi 'Giọng nói production của Sesame không có điểm chuẩn nào được công bố; các số liệu về giọng nói của GPT-Live-1 do OpenAI báo cáo.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

GPT-Live-1 vs Sesame Preview: Giọng nói tốt nhất trong so sánh này là giọng bạn không thể mua

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

Hỏi bất kỳ ai đã dùng cả hai thì thứ hạng không hề sát nút: Sesame Preview là trợ lý giọng nói thuyết phục nhất mà hầu hết mọi người từng nói chuyện cùng. Nó cũng là thứ bạn không thể xây dựng dựa trên. GPT-Live-1 và Sesame Preview liên tục được đem ra so sánh — cả hai đều đối thoại được, cả hai đều xử lý việc ngắt lời, cả hai nghe như một người thật chứ không phải một tổng đài tự động — nhưng chúng được cung cấp theo hai cách trái ngược. GPT-Live-1 là một mô hình được lưu trữ mà bạn thuê theo phút, có thể gọi công khai kể từ ngày 10 tháng 9 năm 2026. Sesame Preview là một ứng dụng tiêu dùng miễn phí không có API nào cả, và giọng nói khiến người ta ấn tượng chạy trên một mô hình sản xuất chưa từng được phát hành.

Thực tế mỗi thứ là gì

• GPT-Live-1 — mô hình giọng nói song công hoàn toàn của Ope​nAI, có trong ChatGPT từ ngày 8 tháng 7 năm 2026, trong API từ ngày 10 tháng 9 với giá 0,05 USD mỗi phút giọng nói. Mười hai giọng nói API, không nhân bản, không có đầu vào hình ảnh hoặc video, bản ghi chép và văn bản phản hồi được trả về trong mỗi phiên.

Sesame Preview — trợ lý giọng nói dành cho người tiêu dùng của Sesame. Miễn phí trên iOS từ tháng 5 năm 2026, có mặt rộng rãi trên Android từ đầu tháng 8 năm 2026, cùng với bản xem trước trên web ưu tiên giọng nói. Bốn tác nhân — Maya, Miles, Simone và Charlie — chỉ hỗ trợ tiếng Anh, với giới hạn cuộc gọi 30 phút, giảm xuống còn 5 phút khi đăng xuất.

• CSM-1B — phần mở của Sesame: một mô hình giọng nói hội thoại 1B được phát hành theo giấy phép Apache 2.0 vào ngày 23 tháng 4 năm 2026, được xây dựng trên xương sống kiến trúc Llama với một bộ giải mã riêng và codec Mimi của Kyutai, tạo ra giọng nói tiếng Anh mono 24 kHz từ ngữ cảnh khoảng 4K token.

Ba dòng trên là toàn bộ cục diện của quyết định. Một công ty bán mô hình tính theo phút. Công ty còn lại cho không một ứng dụng và mở mã nguồn một mô hình nhỏ hơn, không phải mô hình nằm trong ứng dụng.

Khoảng cách giữa bản demo và bản tải xuống

Sesame đã tỏ ra thẳng thắn một cách bất thường về điều này, và đó là sự thật quan trọng nhất đối với bất kỳ ai đang đánh giá cặp mô hình này. Giọng nói trong ứng dụng Preview — giọng đã tạo ra các clip lan truyền và những đánh giá “chế độ giọng nói tốt nhất trong phân khúc” — là một mô hình sản xuất đóng, lớn hơn. CSM-1B là một checkpoint mở 1 tỷ tham số từ cùng phòng thí nghiệm, và theo đánh giá của những người đã chạy cả hai, đây là một giọng nói yếu hơn rõ rệt. Các phiên trên Preview cũng bị giới hạn hạn mức và chỉ dùng tiếng Anh, và không có khả năng thực thi tác vụ: các agent chỉ nói, chúng không đặt chỗ, mua hay nộp hồ sơ gì cả.

Điều đó để lại cho các nhà phát triển một lời chào thực sự nhưng hẹp hơn: một checkpoint giọng nói hội thoại có thể tự triển khai mà không mất phí cấp phép, được một nhà cung cấp suy luận bên thứ ba lưu trữ ở mức 7 USD mỗi triệu ký tự — khoảng 0,35 USD mỗi giờ âm thanh được tổng hợp — hoặc miễn phí trên phần cứng của riêng bạn. Chưa ai công bố một phép đánh giá độc lập nào cho Preview voice hoặc CSM-1B, nên bất kỳ tuyên bố chất lượng nào theo hướng nào cũng chỉ là ấn tượng khi nghe, không phải một phép đo. Sesame cũng chưa công bố giá công khai, gói dành cho doanh nghiệp hay kế hoạch kiếm tiền nào; định hướng được công ty nêu rõ là các quan hệ đối tác nghiên cứu và một sản phẩm phần cứng đang được lên kế hoạch.

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

Những gì 0,05 đô la một phút mua được mà miễn phí không có

Chiêu tiếp thị của GPT-Live-1 với một nhà phát triển không phải là nó nghe hay hơn, vì lập luận đó không thể thắng được trước một mô hình đóng mà không ai có thể đo lường. Mà là thứ đó có thể gọi được và có giá. Cụ thể, đây là những gì bạn nhận được khi đồng hồ đang chạy:

• Một phiên do bạn kiểm soát — một model ID, một endpoint Live Sessions, ví dụ tích hợp đã được công bố chạy qua WebRTC, và một phiên do bạn cấu hình với instructions, voices và một khối delegation.

• Xử lý ngắt lời như một hành vi được tài liệu hóa — khả năng tương tác đạt 80,1% trên Full Duplex Bench v1.5 so với 45,4% của GPT-Realtime-2.1, với độ trễ chuyển lượt là 0,798 giây và tỷ lệ gọi công cụ thành công là 87%. Cả ba đều là số liệu của chính Ope​nAI, được công bố cùng bản phát hành và chưa được bất kỳ ai tái lập tại thời điểm viết bài.

• Một backend suy luận do bạn chọn — lớp giọng nói giao công việc nặng xuyên qua một ranh giới bất đồng bộ cho một mô hình riêng được nêu tên trong cấu hình phiên, mô hình này vẫn tiếp tục làm việc trong khi cuộc trò chuyện tiếp diễn. Trong ví dụ tài liệu của Ope​nAI, backend đó là GPT-5.6 Terra; tại buổi ra mắt cho người tiêu dùng vào tháng Bảy, nó là GPT-5.5.

• Bản ghi, văn bản phản hồi và tính phí kiểu điện thoại — $3.00 cho một giờ đường dây mở liên tục, tính theo từng giây, với 15 giây khởi tạo phiên được ghi có thay vì cộng thêm.

Sesame mang đến cho bạn một cuộc trò chuyện tốt hơn và không có những thứ đó. Nếu bạn đang xây dựng một sản phẩm, "cuộc trò chuyện tốt hơn, không API, không giá, không benchmark, chỉ tiếng Anh, giới hạn 30 phút" không phải là một so sánh — mà là một danh sách chờ.

Hiện có một con số trên GPT-Live-1 mà chưa từng tồn tại vào thời điểm ra mắt cho người tiêu dùng, và nó là đối trọng trung thực cho mọi điều ở trên. Chỉ số Speech to Speech của Artificial Analysis chấm GPT-Live-1 69,8% — đứng thứ bảy trong số mười một mô hình, xếp sau GPT-Realtime-2.1 với 73,9% và sau Grok Voice Think Fast 2.0 với 79,0%. Vậy nên mô hình bạn có thể mua cũng không phải là mô hình tốt nhất trên bảng xếp hạng độc lập. Điều mà bảng xếp hạng không thể chấm điểm lại chính là thứ Sesame thực sự đang thắng: không mô hình nào trong số mười một mô hình trên chỉ số đó được đánh giá về cảm giác khi trò chuyện với nó, và giọng Sesame Preview không có dòng nào ở bất kỳ đâu.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

Phần của stack không thuộc về công ty nào trong hai công ty đó.

Đây là điểm mà cả hai lựa chọn hội tụ, và cũng là nơi quyết định không còn mang tính nhị phân nữa. Cả Sesame Preview lẫn GPT-Live-1 đều không phải là một agent hoàn chỉnh. Các agent của Sesame không thực thi nhiệm vụ; GPT-Live-1 chủ động giao phó mọi thứ đòi hỏi suy luận, truy xuất hoặc công cụ cho một mô hình backend. Trong cả hai thiết kế, phần việc thú vị diễn ra phía sau giọng nói, trong một lệnh gọi mô hình văn bản thuần, và lớp đó có tính di động theo cách mà lớp giọng nói không có được — bạn có thể chuyển backend mà không cần ghi lại dù chỉ một prompt cho mô hình giọng nói.

Backend đó cũng là nơi OrcaRouter trở nên hữu ích, và cần nói thật chính xác về những gì chúng tôi có và không đảm nhận. Chúng tôi không định tuyến GPT-Live-1: endpoint Live Sessions là của Ope​nAI, và lớp giọng nói ở đó nằm ngoài tầm với. Chúng tôi cũng không định tuyến mô hình production của Sesame, với lý do đơn giản hơn là nó chưa bao giờ được cung cấp dưới dạng API. Thứ chúng tôi định tuyến là lớp mà cả hai sản phẩm đều giao việc cho. Khoảng 190 mô hình từ mười một nhà cung cấp thượng nguồn chạy phía sau một khóa duy nhất với giá niêm yết của nhà cung cấp, không tính thêm phụ thu, kèm khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp và một DSL định tuyến có thể kết hợp nhiều mô hình vào một lời gọi duy nhất. Với một nhóm đang xây dựng trên một giao diện giọng nói chưa được kiểm chứng, đó chính là biện pháp phòng ngừa đáng giá: lớp giọng nói có thể bị thay thế hoặc bị bỏ rơi mà không kéo theo lớp suy luận, và mô hình bạn đặt cược vào tháng Ba có thể được thay bằng mô hình khác vào tháng Sáu chỉ với việc sửa một dòng.

Xem gì

Ba điều sẽ thay đổi sự so sánh này, và chưa điều nào trong số đó nằm trong tay bất kỳ ai. Một API Sesame — ngay cả khi phải trả phí — sẽ lập tức biến giọng nói mạnh nhất trong hạng mục này thành một lựa chọn có thể xây dựng được, và sẽ đặt một mức giá thực sự bên cạnh con số 0,05 USD của GPT-Live-1. Một bộ đánh giá chuẩn được công bố về giọng Preview sẽ biến một ấn tượng khi nghe thành một con số, và các đánh giá độc lập thường không nương tay với những giọng nói chỉ từng cạnh tranh trong các bản demo. Và lần tái lập bên ngoài đầu tiên các số liệu về khả năng tương tác và độ trễ của OpenAI sẽ định đoạt liệu song công toàn phần là một khoảng cách năng lực thực sự hay chỉ là một phép đánh giá được chọn khéo léo.

Cho đến lúc đó, sự phân chia trung thực là thế này. Nếu bạn đang chọn một giọng nói cho chính mình, hãy dùng Sesame Preview — nó miễn phí, nó hay hơn, và bạn chẳng mất gì khi thích nó hơn. Nếu bạn đang chọn một giọng nói cho một sản phẩm mà bạn phải phát hành, bán và hỗ trợ, thì GPT-Live-1 là lựa chọn duy nhất trong hai cái mà bạn thực sự có thể mua, và việc nó không phải là cái nghe hay hơn chính là cái giá phải trả để được tham gia.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày