
Realtime-Venus vs Sesame Preview: Thứ bạn có thể có được không phải là thứ tốt
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus và Sesame Preview được xây dựng bởi các phòng thí nghiệm có những quan điểm hoàn toàn khác nhau về mục đích của một mô hình giọng nói, và chúng đã vấp phải cùng một cái bẫy từ hai hướng đối lập. Sesame Preview là một ứng dụng tiêu dùng miễn phí — có trên iOS từ tháng 5 năm 2026, Android từ đầu tháng 8 — với bốn tác nhân hội thoại, tìm kiếm web trực tiếp trong cuộc gọi, và một giọng nói mà giới đánh giá đã gọi là tốt nhất trong phân khúc. Các trọng số mở mà Sesame công bố là một mô hình khác, nhỏ hơn, mà chính công ty không giới thiệu là giọng nói bạn đã nghe trong bản demo. Realtime-Venus, hệ thống song công hoàn toàn 9B của Venus Team thuộc Ant Group và Đại học Thanh Hoa, đi theo hướng ngược lại: những gì có thể tải về chính là thứ thật, và không có sản phẩm nào cả. Trong cả hai trường hợp, khoảng cách giữa những gì có sẵn và những gì gây ấn tượng là điều hữu ích nhất cần hiểu trước khi bạn lên kế hoạch cho bất cứ điều gì dựa trên một trong hai.
Thực tế mỗi thứ là gì

Sesame Preview là một sản phẩm. Sesame là một phòng thí nghiệm ở San Francisco được thành lập vào năm 2023 bởi Brendan Iribe, Ankit Kumar và Ryan Brown, được hậu thuẫn bởi a16z, Sequoia, Spark và Matrix, và trợ lý giọng nói dành cho người tiêu dùng của hãng cung cấp bốn tính cách — Maya, Miles, Simone và Charlie — mỗi tính cách có khí chất và giọng nói riêng. Trợ lý có thể tìm kiếm web ngay giữa cuộc trò chuyện, ghi chú và tạo nhắc nhở, và gửi bản tóm tắt sau cuộc gọi. Bộ nhớ được lưu theo từng trợ lý và đồng bộ giữa web và thiết bị di động khi bạn đã đăng nhập, cùng chế độ ẩn danh cho phép đọc các ký ức trước đây mà không ghi ký ức mới. Nó miễn phí, không chạy quảng cáo và công ty nói rằng họ không bán dữ liệu.
Realtime-Venus là một bản phát hành nghiên cứu. Hai checkpoint 9B theo giấy phép Apache-2.0 trên Hugging Face — Realtime-Venus-Omni cho tương tác nghe nhìn và Realtime-Venus-Audio cho tương tác bằng giọng nói — cùng với một báo cáo kỹ thuật được gửi lên arXiv vào ngày 12 tháng 9 năm 2026, một trang dự án, và một kho lưu trữ đồng hành chứa thành phần Realtime-Venus-Harness. Không có ứng dụng, không có API, không có giá, và không có thông báo nào từ nhà cung cấp. Kho lưu trữ không được triển khai bởi bất kỳ nhà cung cấp suy luận nào, và lượt tải xuống không được theo dõi.
Cái bẫy, theo cả hai hướng
Phiên bản của Sesame mang hình hài open-washing kinh điển, và Sesame trung thực về điều đó hơn hầu hết các bên khác. Checkpoint CSM mà phòng thí nghiệm phát hành theo giấy phép Apache-2.0 là một mô hình tạo giọng nói nền tảng — một xương sống Llama cấp dữ liệu cho bộ giải mã Mimi-codec — và tài liệu nói rõ rằng đó không phải là giọng của ứng dụng và cũng không phải một hệ thống chuyển giọng nói sang giọng nói đầu-cuối. Nó không thể sinh văn bản, và nó được huấn luyện chủ yếu trên dữ liệu tiếng Anh với năng lực hạn chế ngoài phạm vi đó. Thứ vận hành Sesame Preview là một mô hình sản xuất lớn hơn chưa được phát hành. Vậy nên nếu bạn đi tìm giọng nói từ bản demo, bạn chỉ tìm thấy dòng dõi nghiên cứu của nó chứ không phải chính bản thân nó. Khi một trong bốn tác nhân trả lời cuộc gọi của bạn, bạn đang nghe thứ mà mình không thể tải về.
Phiên bản của Realtime-Venus là hình ảnh phản chiếu, và có thể nói là phiên bản kỳ lạ hơn. Mọi thứ được công bố đều chân thực: trọng số thật, mã thật, báo cáo thật, một giấy phép dễ dãi. Điều còn thiếu là bất kỳ cách nào để sử dụng nó mà không cần sở hữu GPU. Hai checkpoint 9B ở BF16 nặng khoảng mười tám gigabyte trọng số mỗi cái, chưa tính bộ nhớ kích hoạt, và cả hai đều được thiết kế để chạy một vòng lặp streaming một giây liên tục với đầu vào âm thanh và video trực tiếp. Đó là một triển khai cấp máy chủ. Một ứng dụng tiêu dùng mang cùng khả năng đó đến điện thoại đang làm điều mà bản phát hành này không hề cố gắng thực hiện, và khoảng cách giữa một mô hình có thể tải xuống và một mô hình có thể chạy được chính là chỗ mà hầu hết những người muốn nó sẽ bị mắc kẹt.
Tính đo lường được là sự khác biệt rõ nét hơn.
Cả hai mô hình đều không có điểm chất lượng giọng nói độc lập, nhưng lý do thì khác nhau.
• Sesame Preview — không có mục nào trên arena, không có đánh giá nào được công bố về giọng nói bản production. Danh tiếng của nó dựa vào những người đánh giá và tác động của bản demo gốc đối với người nghe, vốn là bằng chứng thật theo một kiểu nào đó và hoàn toàn chưa được định lượng.
• CSM-1B — {{1}}điểm kiểm tra mở{{/1}} là một mô hình sinh cơ sở; nó không được đánh giá chuẩn so với các hệ thống hội thoại bởi vì nó không phải là một hệ thống như vậy.
• Realtime-Venus — một chỉ số giọng nói do chính họ tự công bố, điểm VoiceBench AlpacaEval là 4.81, được báo cáo của họ mô tả là ngang bằng với con số so sánh tốt nhất. Chưa có bên thứ ba nào đánh giá nó.
• Điều mà cả hai đều không mang lại cho bạn — một con số được tạo ra bởi người không có lợi ích gì trong kết quả. Nếu chất lượng giọng nói là tiêu chí mua hàng của bạn, thì toàn bộ so sánh này không thể cho điểm được, và cách làm trung thực là nghe cả hai rồi tự quyết định thay vì dựa vào một bảng biểu.
Luân phiên lượt, nơi cả hai đều có điều để chứng minh
Danh tiếng của Sesame được gây dựng chính nhờ điều này. Bản demo khiến phòng thí nghiệm trở nên nổi tiếng là một giọng nói có hơi thở, sự ngập ngừng và thời điểm ngắt lời đủ thuyết phục đến mức người nghe tưởng rằng có một người thật đang ở đầu dây bên kia. Đó là một tuyên bố về động lực hội thoại, và đó chính là thứ mà sản phẩm này được bán dựa vào.
Realtime-Venus đưa ra tuyên bố tương tự kèm theo số liệu. Trên Full-Duplex-Bench v1.5, audio checkpoint của nó báo cáo phản hồi 75% các gián đoạn của người dùng, với tỷ lệ tiếp tục là 97% trong backchannels, 88% trong lời nói hướng đến người khác và 86% trong lời nói nền — được tuyên bố là vượt qua Gemini 3.1 Live và GPT-4o trên cả ba chỉ số tiếp tục. Những con số đó đến từ báo cáo của chính nó và chưa ai tái tạo được chúng.
Vậy nên sự so sánh ở đây là một bản demo không có con số, đối chiếu với một con số không có bản demo, và đó thực sự là một thế đứng awkward, đồng thời là một cách mô tả công bằng về cách cả hạng mục này tự báo cáo về chính mình vào lúc này. Điều duy nhất có thể khẳng định chắc chắn là cả hai tuyên bố đều chưa từng qua được tay một bên thứ ba, và tỷ lệ tiếp tục 97% dưới các backchannel là đủ cao để xứng đáng có một bên như vậy trước khi nó bị trích dẫn như một điều đã ngã ngũ.

Những gì bạn thực sự có thể xây dựng
Sesame Preview chẳng mang lại gì cho nhà phát triển. Không có API, không có mã định danh mô hình, không có bảng giá và không có kế hoạch nào được công bố cho một API như vậy. Cuộc gọi bị giới hạn tối đa ba mươi phút khi đã đăng nhập và năm phút nếu không, tiếng Anh là ngôn ngữ duy nhất được hỗ trợ chính thức, và tác nhân sẽ nghiên cứu và ghi nhớ nhưng không thực thi tác vụ — nó sẽ không đặt vé máy bay. Gói miễn phí chính là sản phẩm. Đó là một ưu đãi tiêu dùng hoàn toàn tốt và là ngõ cụt cho việc tích hợp.
Realtime-Venus mang đến cho người xây dựng mọi thứ, ngoại trừ một nơi để chạy nó. Các trọng số được cấp phép theo giấy phép thoáng, mã nguồn tải bằng các lệnh gọi Transformers tiêu chuẩn, chế độ streaming song công hoàn toàn có thể được vào chỉ bằng một lần chuyển phương thức duy nhất, và vòng lặp được tài liệu hóa là một giây prefill streaming, tiếp theo là sinh streaming, rồi lặp lại. Bộ nhớ video dài được bật bằng tham số memory-minutes và được mô tả là không cần huấn luyện, điều không bình thường đối với một năng lực vốn thường đòi hỏi tinh chỉnh. Hai điểm cần lưu ý được ghi trong tài liệu thay vì để người ta tự phát hiện: một giới hạn khung hình âm thầm cắt ngắn video dài trừ khi một hằng số được tăng trước khi import tiện ích, và yêu cầu về phông chữ CJK cho phụ đề không phải chữ Latinh được kết xuất vào video song công.
Điều mà tất cả những thứ đó không hề thay đổi là: harness — thành phần thực thi các ủy nhiệm bất đồng bộ, vốn là phần đặc trưng nhất của kiến trúc — nằm trong một kho GitHub riêng, được tài liệu hóa ít ỏi hơn nhiều so với mô hình, và là phần khó đánh giá nhất về mức độ sẵn sàng cho môi trường sản xuất. Trong một triển khai thực tế, chặng ủy nhiệm chỉ là suy luận văn bản thông thường đặt sau một giao diện hội thoại. OrcaRouter không cung cấp Realtime-Venus lẫn Sesame Preview; cả hai lớp giọng nói đều nằm ngoài phạm vi chúng tôi phục vụ, và chúng tôi nói thẳng điều đó thay vì ngụ ý về một mối quan hệ lưu trữ không hề tồn tại. Gần 200 mô hình văn bản sau một khóa duy nhất với giá niêm yết của nhà cung cấp, không đánh thêm là nửa phần của kiến trúc đó mà chúng tôi thực sự bao phủ, với chuyển đổi dự phòng tự động để một tác vụ được ủy nhiệm vẫn sống sót qua sự cố ngừng hoạt động của nhà cung cấp, một DSL định tuyến kết hợp nhiều mô hình vào một lời gọi, và hợp nhất mô hình cho những khi phán đoán của một mô hình là chưa đủ. Đó là phần có thể mua được của một thiết kế mà phần thú vị thì không để bán.

Đề xuất trung thực
Nếu bạn là người tiêu dùng muốn giọng nói đàm thoại nghe hay nhất hiện có và không cần tích hợp nó, thì Sesame Preview miễn phí, có mặt trên cả hai nền tảng di động, và danh tiếng của nó xứng đáng đến mức các nhà đánh giá cứ liên tục khẳng định như vậy. Hãy dùng thử và tận hưởng.
Nếu bạn là một nhà nghiên cứu hoặc một đội ngũ kỹ thuật có nguồn lực dồi dào cần một ngăn xếp nghe nhìn song công toàn phần mở mà bạn có thể kiểm tra và tinh chỉnh, thì Realtime-Venus là một trong số rất ít lựa chọn thực sự, và việc các benchmark của nó được tự báo cáo không làm thay đổi việc trọng số thực sự mở và kiến trúc thực sự được tài liệu hóa.
Nếu bạn là một đội ngũ sản phẩm đang tìm kiếm một lớp giọng nói để ra mắt trong quý này, thì cả hai đều không phải là câu trả lời dành cho bạn, và bài học hữu ích rút ra từ việc so sánh cặp đôi này chính là lý do vì sao. Một phòng thí nghiệm đã tạo ra một thứ xuất sắc và giữ phần hay ho lại dưới dạng đóng kín; phòng còn lại công bố mọi thứ và để bạn tự lo phần hạ tầng. Hạng mục này đã chứng minh rằng nó có thể tạo ra một giọng nói đáng để lắng nghe và vẫn chưa quyết định liệu giọng nói đó có nên mua được dưới bất kỳ hình thức nào khác ngoài một ứng dụng hay không.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
