การ์ดชื่อเรื่องหลักสำหรับ 'Realtime-Venus vs Sesame Preview' มีคำบรรยายใต้ชื่อว่า 'สองแล็บ กับดักเดียวกัน ทิศทางตรงข้าม' โดยมีการ์ดสามใบที่มีข้อความว่า 'Sesame Preview: แอปฟรี เอเจนต์สี่ตัว ไม่มี API ตั้งแต่เดือนพฤษภาคม 2026', 'Realtime-Venus: เวท Apache-2.0 ไม่มีผลิตภัณฑ์ ไม่มีการประกาศ', และ 'ทั้งสองไม่เผยแพร่คะแนนเสียงที่ตรวจสอบอย่างอิสระ' เหนือแถบส่วนท้ายที่ระบุว่า 'ความสามารถของ Sesame ตามเอกสารพรีวิวบนมือถือของตัวเอง; ตัวเลขของ Realtime-Venus จากรายงานทางเทคนิคของมัน ยังไม่ถูกทำซ้ำ' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Realtime-Venus กับ Sesame Preview: สิ่งที่คุณได้มาไม่ใช่สิ่งที่ดี

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Realtime-Venus และ Sesame Preview ถูกสร้างขึ้นโดยแล็บที่มีแนวคิดแตกต่างกันโดยสิ้นเชิงเกี่ยวกับว่าโมเดลเสียงมีไว้เพื่ออะไร และทั้งคู่ก็สะดุดเข้าไปในกับดักเดียวกันจากทิศทางที่ตรงกันข้าม Sesame Preview เป็นแอปสำหรับผู้บริโภคฟรี — มีบน iOS ตั้งแต่เดือนพฤษภาคม 2026 และ Android ตั้งแต่ต้นเดือนสิงหาคม — พร้อมด้วยเอเจนต์สนทนา 4 ตัว การค้นหาเว็บแบบสดระหว่างการสนทนา และเสียงที่นักวิจารณ์ยกให้เป็นระดับดีที่สุดในคลาส เวตแบบเปิดที่ Sesame เผยแพร่กลับเป็นโมเดลอีกตัวที่เล็กกว่า ซึ่งทางบริษัทเองก็ไม่ได้นำเสนอว่าเป็นเสียงที่คุณได้ยินในเดโม ส่วน Realtime-Venus ระบบฟูลดูเพล็กซ์ขนาด 9B จากทีม Venus ของ Ant Group และมหาวิทยาลัยชิงหัว กลับไปในทางตรงกันข้าม นั่นคือสิ่งที่ดาวน์โหลดได้คือของจริง แต่ไม่มีผลิตภัณฑ์ใด ๆ เลย ในทั้งสองกรณี ช่องว่างระหว่างสิ่งที่พร้อมให้ใช้กับสิ่งที่สร้างความประทับใจได้ คือสิ่งที่最有ประโยชน์ที่สุดที่ควรทำความเข้าใจก่อนที่คุณจะวางแผนสิ่งใดโดยอิงกับตัวใดตัวหนึ่ง

แต่ละอย่างจริงๆ แล้วคืออะไร

A screenshot of the Sesame mobile preview page, captured 18 September 2026, showing the header navigation with Blog, Team, Mobile Preview and Research Preview, the headline 'Personal agents for curious people', the line 'Preview available now on iOS and Android', and both the App Store and Google Play download badges.

Sesame Preview เป็นผลิตภัณฑ์ Sesame เป็นแล็บในซานฟรานซิสโก ก่อตั้งขึ้นในปี 2023 โดย Brendan Iribe, Ankit Kumar และ Ryan Brown ได้รับการสนับสนุนจาก a16z, Sequoia, Spark และ Matrix และผู้ช่วยเสียงสำหรับผู้บริโภคของบริษัทมีสี่บุคลิก — Maya, Miles, Simone และ Charlie — โดยแต่ละคนมีอารมณ์และเสียงที่แตกต่างกัน เอเจนต์สามารถค้นหาเว็บกลางบทสนทนา จดบันทึกและเตือนความจำ และส่งสรุปหลังการโทร หน่วยความจำแยกตามเอเจนต์และซิงก์ระหว่างเว็บกับมือถือเมื่อคุณลงชื่อเข้าใช้ พร้อมโหมดไม่ระบุตัวตนที่อ่านความจำในอดีตโดยไม่เขียนความจำใหม่ ใช้งานฟรี ไม่มีโฆษณา และบริษัทกล่าวว่าไม่ขายข้อมูล

Realtime-Venus เป็นรุ่นเผยแพร่สำหรับการวิจัย มีเช็กพอยต์ขนาด 9B สองตัวภายใต้ Apache-2.0 บน Hugging Face — Realtime-Venus-Omni สำหรับการโต้ตอบด้วยเสียงและภาพ และ Realtime-Venus-Audio สำหรับการโต้ตอบด้วยเสียงพูด — พร้อมรายงานทางเทคนิคที่ส่งไปยัง arXiv เมื่อวันที่ 12 กันยายน 2026 หน้าโปรเจกต์ และที่เก็บโค้ดคู่กันซึ่งมีคอมโพเนนต์ Realtime-Venus-Harness ไม่มีแอป ไม่มี API ไม่มีราคา และไม่มีการประกาศจากผู้ให้บริการ ที่เก็บโค้ดนี้ไม่ได้ถูกนำไปปรับใช้โดยผู้ให้บริการ inference รายใด และไม่มีการติดตามจำนวนดาวน์โหลด

กับดัก ในทั้งสองทิศทาง

เวอร์ชันของ Sesame มีลักษณะ classic open-washing และ Sesame ก็ซื่อสัตย์เรื่องนี้มากกว่าองค์กรส่วนใหญ่ CSM checkpoint ที่แล็บเปิดตัวภายใต้ Apache-2.0 เป็นโมเดลฐานสำหรับสร้างเสียงพูด — แกนหลัก Llama ที่ป้อนเข้าสู่ตัวถอดรหัส Mimi-codec — และเอกสารก็ระบุชัดเจนว่ามันไม่ใช่เสียงของแอป และไม่ใช่ระบบ speech-to-speech แบบ end-to-end มันสร้างข้อความไม่ได้ และถูกฝึกด้วยข้อมูลภาษาอังกฤษเป็นหลัก โดยมีความสามารถจำกัดนอกเหนือจากภาษาอังกฤษ สิ่งที่ขับเคลื่อน Sesame Preview คือโมเดลโปรดักชันขนาดใหญ่กว่าที่ยังไม่ถูกเปิดตัว ดังนั้น หากคุณตามหาเสียงจากเดโม คุณจะพบเชื้อสายงานวิจัยของมัน ไม่ใช่ตัวมันเอง เมื่อหนึ่งในสี่เอเจนต์ตอบสายของคุณ คุณกำลังได้ยินบางสิ่งที่คุณดาวน์โหลดไม่ได้

เวอร์ชันของ Realtime-Venus เป็นภาพสะท้อนกลับ และอาจกล่าวได้ว่าเป็นเวอร์ชันที่แปลกกว่าด้วย ทุกสิ่งที่เผยแพร่ออกมานั้นเป็นของจริง: น้ำหนักจริง โค้ดจริง รายงานจริง สัญญาอนุญาตแบบผ่อนปรน สิ่งที่ขาดหายไปคือหนทางใด ๆ ในการใช้งานมันที่ไม่ต้องเป็นเจ้าของ GPU เช็คพอยต์ขนาด 9B สองตัวใน BF16 มีน้ำหนักประมาณสิบแปดกิกะไบต์ต่อตัวก่อนจะรวมหน่วยความจำสำหรับแอ็กติเวชัน และทั้งคู่ถูกออกแบบมาให้รันลูปสตรีมมิ่งต่อเนื่องขนาดหนึ่งวินาทีพร้อมอินพุตเสียงและวิดีโอแบบสด นั่นคือการติดตั้งใช้งานระดับเซิร์ฟเวอร์ แอปสำหรับผู้บริโภคที่ส่งมอบความสามารถเดียวกันนี้ไปยังโทรศัพท์กำลังทำสิ่งที่รีลีสนี้ไม่ได้พยายามทำ และช่องว่างระหว่างโมเดลที่ดาวน์โหลดได้กับโมเดลที่รันได้ก็คือจุดที่คนส่วนใหญ่ที่ต้องการมันจะติดอยู่พอดี

ความสามารถในการวัดได้คือความแตกต่างที่ชัดเจนกว่า

ทั้งสองโมเดลไม่มีคะแนนคุณภาพเสียงที่เป็นอิสระ แต่เหตุผลแตกต่างกัน

• Sesame Preview — ไม่มีการส่งเข้าอารีนา ไม่มีการเผยแพร่การประเมินเสียงเวอร์ชันโปรดักชัน ชื่อเสียงของมันอาศัยนักวิจารณ์และผลกระทบของเดโมต้นฉบับที่มีต่อผู้ฟัง ซึ่งเป็นหลักฐานจริงในแบบหนึ่งและไม่ได้ถูกวัดปริมาณเลย

• CSM-1B — เช็กพอยต์แบบเปิดเป็นโมเดลฐานสำหรับการสร้าง จึงไม่ได้ถูกนำไปวัดผลเทียบกับระบบสนทนา เพราะมันไม่ใช่ระบบสนทนา

• Realtime-Venus — ตัวเลขด้านเสียงที่รายงานเองเพียงหนึ่งตัว ได้แก่คะแนน VoiceBench AlpacaEval ที่ 4.81 ซึ่งรายงานของมันระบุว่าเทียบเท่ากับตัวเลขเปรียบเทียบที่ดีที่สุด ยังไม่มีบุคคลที่สามใดประเมินมัน

• สิ่งที่ทั้งสองฝ่ายไม่ได้ให้คุณ — ตัวเลขที่ออกโดยคนซึ่งไม่มีส่วนได้ส่วนเสียกับผลลัพธ์ หากคุณภาพเสียงเป็นเกณฑ์การซื้อของคุณ การเปรียบเทียบทั้งหมดก็ไม่อาจให้คะแนนได้ และทางเลือกที่ซื่อสัตย์คือฟังทั้งสองตัวแล้วตัดสินใจด้วยตัวเอง แทนที่จะยอมเชื่อตาราง

การผลัดกัน ซึ่งทั้งคู่ต่างมีอะไรต้องพิสูจน์

ชื่อเสียงของ Sesame ถูกสร้างขึ้นจากสิ่งนี้อย่างแท้จริง เดโมที่ทำให้แล็บโด่งดังคือเสียงที่มีลมหายใจ มีความลังเล และจังหวะการขัดจังหวะที่แนบเนียนพอจนผู้ฟังคิดว่ามีคนอยู่ปลายสาย นั่นเป็นข้อกล่าวอ้างเกี่ยวกับพลวัตของการสนทนา และมันเป็นสิ่งที่ผลิตภัณฑ์นี้ใช้ขาย

Realtime-Venus อ้างแบบเดียวกันโดยมีตัวเลขประกอบด้วย บน Full-Duplex-Bench v1.5 checkpoint ด้านเสียงของมันรายงานว่าตอบสนองต่อการขัดจังหวะของผู้ใช้ถึง 75% โดยมีอัตราการพูดต่อ 97% เมื่อมี backchannels, 88% เมื่อเป็นคำพูดที่มุ่งไปยังผู้อื่น และ 86% เมื่อมีเสียงพูดพื้นหลัง — ซึ่งระบุว่าสูงกว่า Gemini 3.1 Live และ GPT-4o ในตัวชี้วัดการพูดต่อทั้งสามตัว ตัวเลขเหล่านั้นมาจากรายงานของมันเองและยังไม่มีใครทำซ้ำได้

ดังนั้นการเปรียบเทียบนี้จึงเป็นการนำเดโมที่ไม่มีตัวเลขมาเทียบกับตัวเลขที่ไม่มีเดโม ซึ่งเป็นสถานะที่อึดอัดอย่างแท้จริง และเป็นคำอธิบายที่ตรงไปตรงมาว่าหมวดหมู่นี้ทั้งหมดรายงานเกี่ยวกับตัวเองอย่างไรในตอนนี้ สิ่งเดียวที่พูดได้อย่างมั่นใจก็คือ ไม่มีข้ออ้างใดที่ผ่านการตรวจสอบจากบุคคลภายนอก และอัตราการดำเนินต่อไป 97% ในช่องทางหลังบ้านนั้นสูงพอที่จะสมควรได้รับการตรวจสอบจากบุคคลภายนอกก่อนที่จะถูกอ้างว่าเป็นเรื่องที่ยุติแล้ว

A two-column comparison scoreboard titled 'Realtime-Venus vs Sesame Preview — the scoreboard'. The left column, labelled Realtime-Venus, reads 'What it is: research release, Apache-2.0 weights', 'Product: none', 'Agents or voices: one reference voice', 'Languages: English and Chinese', 'Independent voice score: none', 'Runs on: a GPU node you own'. The right column, labelled Sesame Preview, reads 'What it is: free consumer app, closed production voice', 'Product: iOS since May 2026, Android since early August', 'Agents or voices: Maya, Miles, Simone, Charlie', 'Languages: English only', 'Independent voice score: none', 'Runs on: your phone'. The footer reads 'Sesame capabilities per its own mobile preview documentation; Realtime-Venus figures from its technical report, unreproduced.'

สิ่งที่คุณสามารถสร้างได้จริงๆ

Sesame Preview ไม่มีอะไรให้ผู้สร้างเลย ไม่มี API ไม่มีตัวระบุโมเดล ไม่มีตารางราคา และไม่มีแผนที่ระบุไว้สำหรับสิ่งนั้น การเรียกใช้จำกัดที่สามสิบนาทีเมื่อล็อกอิน และห้านาทีเมื่อไม่ได้ล็อกอิน ภาษาอังกฤษเป็นภาษาเดียวที่รองรับอย่างเป็นทางการ และเอเจนต์จะค้นคว้าและจดจำได้ แต่จะไม่ลงมือทำภารกิจ — มันจะไม่จองเที่ยวบิน แพ็กเกจฟรีคือตัวผลิตภัณฑ์ นั่นเป็นข้อเสนอสำหรับผู้บริโภคที่ยอดเยี่ยมและเป็นทางตันสำหรับการผสานรวม

Realtime-Venus มอบทุกอย่างให้ผู้พัฒนา ยกเว้นที่สำหรับรันมัน น้ำหนักโมเดลมีสัญญาอนุญาตแบบ permissive โค้ดโหลดได้ด้วยการเรียก Transformers มาตรฐาน การสตรีมแบบ full-duplex เข้าใช้ได้ด้วยการสลับเมธอดเพียงครั้งเดียว และลูปที่ระบุไว้ในเอกสารคือการ prefill แบบสตรีมหนึ่งวินาที ตามด้วยการสร้างแบบสตรีม แล้วทำซ้ำ หน่วยความจำสำหรับวิดีโอยาวเปิดใช้งานด้วยพารามิเตอร์ memory-minutes และถูกอธิบายว่าเป็นแบบ training-free ซึ่งเป็นเรื่องผิดปกติสำหรับความสามารถที่โดยปกติต้อง fine-tuning มีข้อควรระวังสองข้อที่ระบุไว้ในเอกสาร แทนที่จะปล่อยให้ไปค้นพบเอง: เพดานจำนวนเฟรมที่ตัดทอนวิดีโอยาวอย่างเงียบ ๆ เว้นแต่จะเพิ่มค่าคงที่ก่อนการ import ยูทิลิตี้ และข้อกำหนดฟอนต์ CJK สำหรับคำบรรยายที่ไม่ใช่ละตินซึ่งเรนเดอร์ลงในวิดีโอแบบ duplex

สิ่งที่ไม่มีสิ่งใดเปลี่ยนแปลงได้ก็คือ harness — องค์ประกอบที่รันการมอบหมายงานแบบอะซิงโครนัส ซึ่งเป็นส่วนที่โดดเด่นที่สุดของสถาปัตยกรรม — อยู่ในรีโพซิทอรี GitHub แยกต่างหาก มีเอกสารประกอบน้อยกว่าโมเดลมาก และเป็นส่วนที่ยากที่สุดในการตัดสินว่าพร้อมสำหรับการใช้งานจริงหรือไม่ ในการปรับใช้จริง ขาของการมอบหมายงานคือการอนุมานข้อความธรรมดาที่อยู่เบื้องหลังส่วนหน้าสำหรับสนทนา OrcaRouter ไม่มีทั้ง Realtime-Venus และ Sesame Preview; ชั้นเสียงทั้งสองอยู่นอกเหนือสิ่งที่เราให้บริการ และเราพูดอย่างตรงไปตรงมาแทนที่จะบอกเป็นนัยถึงความสัมพันธ์ด้านโฮสติ้งที่ไม่มีอยู่จริง โมเดลข้อความเกือบ 200 รายการหลังคีย์เดียวในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่มคือครึ่งหนึ่งของสถาปัตยกรรมนั้นที่เราครอบคลุมอยู่จริง โดยมี การ failover อัตโนมัติเพื่อให้งานที่ถูกมอบหมายรอดพ้นจากเหตุขัดข้องของต้นทาง, routing DSL ที่รวมโมเดลหลายตัวไว้ในการเรียกครั้งเดียว และ model fusion ที่การตัดสินใจของโมเดลเดียวไม่เพียงพอ มันคือส่วนที่ซื้อได้ของดีไซน์ที่ส่วนที่น่าสนใจนั้นไม่ได้มีไว้ขาย

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge with the Any-to-Any, Transformers, Safetensors, audio, video, speech and streaming tags, and a side panel stating 'This model isn't deployed by any Inference Provider.'

คำแนะนำที่ซื่อสัตย์

ถ้าคุณเป็นผู้บริโภคที่ต้องการเสียงสนทนาที่ฟังดูดีที่สุดที่มีอยู่ในตอนนี้ และไม่จำเป็นต้องนำไปผสานรวมกับระบบอื่น Sesame Preview นั้นใช้งานฟรี มีให้ใช้บนแพลตฟอร์มมือถือทั้งสองระบบ และชื่อเสียงของมันก็คู่ควรพอจนนักวิจารณ์ยังคงพูดถึงกันอยู่เรื่อย ๆ ลองใช้และเพลิดเพลินไปกับมันได้เลย

หากคุณเป็นนักวิจัยหรือทีมวิศวกรรมที่มีทรัพยากรพร้อม ซึ่งต้องการสแตกเสียงและภาพแบบฟูลดูเพล็กซ์แบบเปิดที่คุณสามารถตรวจสอบและปรับแต่งละเอียดได้ Realtime-Venus ก็เป็นหนึ่งในตัวเลือกจริงเพียงไม่กี่ตัวเลือก และการที่เบนช์มาร์กของมันเป็นข้อมูลที่รายงานเองก็ไม่ได้เปลี่ยนข้อเท็จจริงที่ว่าน้ำหนักของมันเปิดอย่างแท้จริงและสถาปัตยกรรมของมันมีเอกสารประกอบอย่างแท้จริง

หากคุณเป็นทีมผลิตภัณฑ์ที่กำลังมองหาเลเยอร์เสียงเพื่อส่งมอบในไตรมาสนี้ ไม่มีสิ่งใดในสองสิ่งนี้ที่เป็นคำตอบของคุณ และข้อคิดที่มีประโยชน์จากการจับคู่นี้คือเหตุผลว่าทำไม แล็บหนึ่งแห่งสร้างสิ่งที่ดีเยี่ยมขึ้นมาและเก็บส่วนที่ดีไว้แบบปิด ส่วนอีกแห่งเผยแพร่ทุกอย่างและปล่อยให้คุณจัดหาโครงสร้างพื้นฐานเอง หมวดหมู่นี้พิสูจน์แล้วว่าสามารถสร้างเสียงที่ควรค่าแก่การฟังได้ และยังไม่ได้ตัดสินใจว่าเสียงนั้นควรซื้อหาได้ในรูปแบบอื่นใดนอกเหนือจากแอปหรือไม่

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube