Thẻ tiêu đề hero được tạo cho StepAudio 3 Realtime vs Sesame Preview với dòng kicker 'OrcaRouter · model radar — đối đầu trực diện', tiêu đề chính 'StepAudio 3 Realtime vs Sesame Preview' và phụ đề 'Giọng nói mà ai cũng ca ngợi đối đầu với giọng nói có điểm số trên bảng xếp hạng', phía trên hai thẻ model bo tròn nằm hai bên dấu versus.
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview: Giọng nói được mọi người ca ngợi vs giọng nói có điểm số

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trong phần lớn năm 2026, tuyên bố mạnh mẽ nhất mà bất kỳ ai có thể đưa ra về AI giọng nói chỉ là một ấn tượng khi nghe. Trợ lý của Sesame nghe giống người hơn bất cứ thứ gì khác, và đủ nhiều người nói như vậy đến mức nó trở thành điểm tham chiếu — không có chuẩn đánh giá, không có con số, và không có cách nào để kiểm chứng. Vào ngày 15 tháng 9 năm 2026, StepAudio 3 Realtime đã ra mắt từ StepFun với một con số gắn với phiên bản gần nhất có thể đo lường được của chất lượng đó: 98,9% trên đánh giá Conversational Dynamics của Artificial Analysis, vị trí thứ nhất. Sesame Preview không có trên bảng xếp hạng đó.

Điều thú vị không phải là việc cái này đánh bại cái kia. Mà là chất lượng đã làm nên tên tuổi của Sesame giờ đây lại là thứ do một bên thứ ba chấm điểm, còn mô hình mang danh tiếng ấy thì chưa từng được đo lường đối chiếu với nó.

Mỗi thứ trong số này thực sự là gì

Chúng không phải cùng một loại đối tượng, và điều đó quyết định phần lớn phép so sánh hơn bất kỳ điểm số nào.

Sesame Preview là một trợ lý giọng nói dành cho người tiêu dùng. Miễn phí trên iOS từ tháng 5 năm 2026 và phổ biến rộng rãi trên Android từ đầu tháng 8 năm 2026, được xây dựng xoay quanh bốn tác nhân có tên — Maya, Miles, Simone và Charlie — có khả năng ghi nhớ ngữ cảnh xuyên suốt các phiên, tìm kiếm trên web và đặt nhắc nhở. Nó chỉ hỗ trợ tiếng Anh. Các cuộc gọi kéo dài tối đa 30 phút, giảm xuống còn năm phút khi bạn đăng xuất. Không có API cho giọng nói ở môi trường production, không có gói dành cho doanh nghiệp và không có bảng giá công khai.

StepAudio 3 Realtime là một giao diện dành cho nhà phát triển. Đây là một trong năm mô hình thuộc gia đình StepAudio 3, tất cả đều được phát hành cùng ngày và đều có mặt trên nền tảng mở của StepFun dưới dạng API thương mại. Mô hình này xử lý hội thoại song công toàn phần nguyên bản, suy luận trực tiếp trên giọng nói thay vì phiên âm trước, đồng thời hỗ trợ gọi công cụ và thực thi bất đồng bộ các tác vụ dài trong khi cuộc hội thoại vẫn tiếp diễn. Mô hình ưu tiên tiếng Trung. Đây không phải là mô hình trọng số mở, và hiện đang có mức giá xem trước miễn phí có thời hạn, với mức giá sau xem trước chưa được công bố.

Một trong số này bạn có thể xây dựng dựa trên. Cái còn lại bạn có thể ghé thăm.

Điều có thể đo lường được mà Sesame nổi tiếng

Conversational Dynamics là một benchmark cụ thể, và đáng để biết nó bao gồm những gì. Nó chấm điểm việc luân phiên lượt lời, xử lý khoảng dừng, khôi phục sau ngắt lời, và liệu một mô hình có diễn giải đúng một tín hiệu đáp lời ngắn — "uh-huh", "right", "mm" — như sự khích lệ thay vì như một nỗ lực giành lượt trò chuyện hay không. Đó chính xác là những hành vi mà người nghe mô tả khi họ nói rằng một giọng nói mang lại cảm giác con người chứ không phải máy móc, và chúng là những hành vi khiến một trợ lý trở nên dễ chịu khi trò chuyện thay vì chỉ đơn thuần chính xác.

StepAudio 3 Realtime dẫn đầu bảng xếp hạng đó với 98,9%, xếp trên Qwen Audio 3.0 Realtime Plus ở 98,4% và GPT-Realtime-2 ở 95,3%. Nó cũng đứng nhất ở hạng mục Speech Reasoning với 99,7% như StepFun trích dẫn, đằng sau đó là luận điểm về kiến trúc rằng suy luận trực tiếp trên âm thanh thô bảo toàn được ngữ điệu và sự nhấn mạnh mà một bước phiên âm trung gian sẽ làm phẳng đi — sự khác biệt giữa việc nghe ra sự mỉa mai và nghe ra một lời khen.

Đây là cách đặt vấn đề trung thực về kết quả đó. Bài benchmark là thứ gần nhất mà ngành này có để đo lường điều mà Sesame được ca ngợi, và Sesame chưa được đưa vào đó. Đó không phải bằng chứng cho thấy StepAudio 3 Realtime nghe hay hơn Sesame. Đó là bằng chứng rằng một trong những tuyên bố này có thể kiểm chứng được, còn tuyên bố kia, cho đến nay, thì không — và rằng cái có thể kiểm chứng được hiện đang do một mô hình mà hầu hết mọi người chưa từng nói chuyện cùng nắm giữ.

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

Sự bất đối xứng về tính sẵn có, thứ mới là quyết định thực sự.

Mọi thứ ở trên đều thú vị. Phần này mang tính quyết định.

Giọng nói của Sesame — thứ mà mọi người trầm trồ — là một mô hình sản xuất lớn hơn, đóng kín mà Sesame chưa từng phát hành dưới dạng API. Bạn không thể mua nó, cấp phép cho nó, hay gọi nó từ sản phẩm của riêng bạn. Nếu bạn đọc được rằng nhịp điệu hội thoại của Sesame là tốt nhất hiện có và kết luận rằng bạn có thể sở hữu nó, thì kết luận đó không suy ra được từ bằng chứng.

Điều Sesame thực sự mở mã nguồn là CSM-1B, được phát hành theo Apache-2.0. Đây là một khối tổng hợp, không phải trợ lý: một xương sống Llama dự đoán codebook Mimi đầu tiên và một bộ giải mã Llama nhỏ hơn dự đoán phần còn lại, rồi codec Mimi kết xuất thành dạng sóng 24 kHz. Nó chỉ hỗ trợ tiếng Anh, nhân bản giọng nói từ một đoạn clip tham chiếu dài 10–15 giây, và hoàn toàn không thể tạo văn bản — bạn phải ghép nó với một mô hình ngôn ngữ riêng. Những người đã chạy cả hai mô tả giọng của CSM-1B yếu hơn rõ rệt so với giọng của ứng dụng Preview, và thẻ mô hình nói toạc ra điều vẫn thường được giữ kín: một biến thể tinh chỉnh của CSM vận hành bản demo tương tác, và biến thể đó không phải là checkpoint bạn có thể tải về.

StepAudio 3 Realtime không có chút mơ hồ nào như vậy. Đây là API thương mại với một họ mô hình đã công bố đằng sau, một bộ năng lực được nêu rõ, và các vị trí của bên thứ ba mà bạn có thể tra cứu. Nó cũng ưu tiên tiếng Trung, có giá xem trước, và công bố thời gian đến âm thanh đầu tiên là 8,83 giây trên cùng bảng xếp hạng nơi nó thắng về động lực hội thoại — so với 1,18 giây của Gemini 3.8 Live và 1,24 đến 1,34 giây của GPT-Live-1. Bất kể nó mang lại chất lượng hội thoại gì, nó vẫn chưa chứng minh được rằng có thể cung cấp chất lượng đó ở tốc độ hội thoại bên ngoài thiết lập phục vụ của chính StepFun.

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

Làm gì với điều này nếu bạn đang chọn một ngăn xếp giọng nói

Hãy bắt đầu bằng việc tách hai câu hỏi này ra. "Cuộc trò chuyện nên mang lại cảm giác như thế nào?" và "tôi có thể tung ra được gì?" có những câu trả lời khác nhau, và chỉ một trong số đó là quyết định mua sắm.

Nếu bạn đang hiệu chỉnh gu — quyết định sản phẩm của mình nên có bao nhiêu độ ấm, mức im lặng nào là dễ chịu, một tác nhân nên nhường lượt nhanh đến mức nào — thì Sesame Preview miễn phí, thực sự xuất sắc và là một nơi tốt để dành một buổi chiều. Hãy dùng nó làm điểm tham chiếu. Đừng lên kế hoạch tích hợp xoay quanh nó, vì chẳng có gì để tích hợp cả.

Nếu bạn đang tung ra sản phẩm, StepAudio 3 Realtime là một ứng viên thực sự với những lưu ý thực tế: giá xem trước, phạm vi bao phủ ưu tiên tiếng Trung, không có điểm chỉ số trên Artificial Analysis, và câu hỏi về độ trễ chưa được giải quyết. Hãy kiểm tra độ trễ trước chất lượng hội thoại. Một mô hình giành chiến thắng trong bài kiểm tra lượt lời nhưng mất gần như cả một câu để bắt đầu nói là một mô hình mà bạn có thể sẽ không bao giờ có cơ hội thể hiện chất lượng tốt nhất của nó.

Và nếu giọng production của Sesame cuối cùng có API, toàn bộ so sánh này sẽ được chạy lại — bởi vì benchmark có thể phân định điều đó đã tồn tại, và Sesame cuối cùng sẽ phải xuất hiện trên đó.

Khi nào định tuyến phù hợp, và khi nào không

Các agent thoại không phải là một mô hình duy nhất. Dù bạn đang chạy StepAudio 3 Realtime hay bất kỳ thứ gì khác, cuộc hội thoại liên tục giao việc cho các mô hình văn bản thông thường — một lượt tra cứu, một lượt trích xuất, một lệnh gọi suy luận chạy phía sau một khoảng tạm dừng được giữ. Lớp ủy thác đó chính là nơi phát sinh chênh lệch chi phí và là nơi một giờ lỗi của một nhà cung cấp trở thành sự cố ngừng dịch vụ của bạn.

Để chính xác về phạm vi bao phủ của chính chúng tôi: các endpoint live và voice trong dòng StepAudio 3 không nằm trên OrcaRouter, và bất cứ thứ gì Sesame đã xây dựng cũng vậy. Những gì nằm trên OrcaRouter là lớp văn bản mà một voice agent giao phó cho — gần 200 mô hình sau một API, tự động chuyển đổi dự phòng, một DSL định tuyến giúp kết hợp nhiều mô hình thành một lời gọi, và model fusion khi phán đoán của một mô hình duy nhất là chưa đủ, với giá niêm yết của nhà cung cấp được chuyển tiếp mà không có phụ phí.

Chính sự tách biệt đó khiến câu hỏi về tính khả dụng bớt chí mạng hơn vẻ ngoài của nó. Mô hình giọng nói là một quyết định bạn có thể xem xét lại; lớp ủy quyền mới là thứ trở nên tốn kém khi phải tháo gỡ, và chính nó đáng để đặt phía sau một router trước khi bạn cam kết với bất kỳ nhà cung cấp giọng nói nào.

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

Bản án

Sesame Preview thắng ở đúng thứ không thể đo lường được, và thua ở mọi thứ có thể mua bằng tiền. Đây là giọng nói hay nhất hiện có, nó miễn phí, và bạn không thể đưa nó vào production — và giờ khi một bên thứ ba chấm điểm đúng cái chất lượng mà nó nổi tiếng, việc nó vắng mặt trên bảng điểm đó là một lỗ hổng trong bằng chứng, chứ không phải một lợi thế dẫn đầu được bảo vệ.

StepAudio 3 Realtime thắng thế về tính sẵn có, khả năng đo lường và năng lực, đồng thời mang những câu hỏi mở thực sự về giá, độ phủ ngôn ngữ và độ trễ. Đây là lựa chọn duy nhất trong hai lựa chọn mà bạn có thể xây dựng dựa trên ngay hôm nay, điều này giải quyết câu hỏi thực tiễn nhanh hơn bất kỳ benchmark nào.

Điều đáng chú ý rất đơn giản, và nó đúng theo cả hai hướng: một điểm Conversational Dynamics cho giọng nói production của Sesame, hoặc một con số độ trễ cho StepAudio 3 Realtime khiến nó nằm cùng tầm với những mô hình mà nó hiện đang vượt trội về chất lượng. Một trong hai điều đó sẽ biến đây từ một phép so sánh giữa một số đo và một danh tiếng thành một cuộc đối đầu trực tiếp thực sự.