
Realtime-Venus กับ Sesame Preview: สิ่งที่คุณได้มาไม่ใช่สิ่งที่ดี
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus และ Sesame Preview ถูกสร้างขึ้นโดยแล็บที่มีแนวคิดแตกต่างกันโดยสิ้นเชิงเกี่ยวกับว่าโมเดลเสียงมีไว้เพื่ออะไร และทั้งคู่ก็สะดุดเข้าไปในกับดักเดียวกันจากทิศทางที่ตรงกันข้าม Sesame Preview เป็นแอปสำหรับผู้บริโภคฟรี — มีบน iOS ตั้งแต่เดือนพฤษภาคม 2026 และ Android ตั้งแต่ต้นเดือนสิงหาคม — พร้อมด้วยเอเจนต์สนทนา 4 ตัว การค้นหาเว็บแบบสดระหว่างการสนทนา และเสียงที่นักวิจารณ์ยกให้เป็นระดับดีที่สุดในคลาส เวตแบบเปิดที่ Sesame เผยแพร่กลับเป็นโมเดลอีกตัวที่เล็กกว่า ซึ่งทางบริษัทเองก็ไม่ได้นำเสนอว่าเป็นเสียงที่คุณได้ยินในเดโม ส่วน Realtime-Venus ระบบฟูลดูเพล็กซ์ขนาด 9B จากทีม Venus ของ Ant Group และมหาวิทยาลัยชิงหัว กลับไปในทางตรงกันข้าม นั่นคือสิ่งที่ดาวน์โหลดได้คือของจริง แต่ไม่มีผลิตภัณฑ์ใด ๆ เลย ในทั้งสองกรณี ช่องว่างระหว่างสิ่งที่พร้อมให้ใช้กับสิ่งที่สร้างความประทับใจได้ คือสิ่งที่最有ประโยชน์ที่สุดที่ควรทำความเข้าใจก่อนที่คุณจะวางแผนสิ่งใดโดยอิงกับตัวใดตัวหนึ่ง
แต่ละอย่างจริงๆ แล้วคืออะไร

Sesame Preview เป็นผลิตภัณฑ์ Sesame เป็นแล็บในซานฟรานซิสโก ก่อตั้งขึ้นในปี 2023 โดย Brendan Iribe, Ankit Kumar และ Ryan Brown ได้รับการสนับสนุนจาก a16z, Sequoia, Spark และ Matrix และผู้ช่วยเสียงสำหรับผู้บริโภคของบริษัทมีสี่บุคลิก — Maya, Miles, Simone และ Charlie — โดยแต่ละคนมีอารมณ์และเสียงที่แตกต่างกัน เอเจนต์สามารถค้นหาเว็บกลางบทสนทนา จดบันทึกและเตือนความจำ และส่งสรุปหลังการโทร หน่วยความจำแยกตามเอเจนต์และซิงก์ระหว่างเว็บกับมือถือเมื่อคุณลงชื่อเข้าใช้ พร้อมโหมดไม่ระบุตัวตนที่อ่านความจำในอดีตโดยไม่เขียนความจำใหม่ ใช้งานฟรี ไม่มีโฆษณา และบริษัทกล่าวว่าไม่ขายข้อมูล
Realtime-Venus เป็นรุ่นเผยแพร่สำหรับการวิจัย มีเช็กพอยต์ขนาด 9B สองตัวภายใต้ Apache-2.0 บน Hugging Face — Realtime-Venus-Omni สำหรับการโต้ตอบด้วยเสียงและภาพ และ Realtime-Venus-Audio สำหรับการโต้ตอบด้วยเสียงพูด — พร้อมรายงานทางเทคนิคที่ส่งไปยัง arXiv เมื่อวันที่ 12 กันยายน 2026 หน้าโปรเจกต์ และที่เก็บโค้ดคู่กันซึ่งมีคอมโพเนนต์ Realtime-Venus-Harness ไม่มีแอป ไม่มี API ไม่มีราคา และไม่มีการประกาศจากผู้ให้บริการ ที่เก็บโค้ดนี้ไม่ได้ถูกนำไปปรับใช้โดยผู้ให้บริการ inference รายใด และไม่มีการติดตามจำนวนดาวน์โหลด
กับดัก ในทั้งสองทิศทาง
เวอร์ชันของ Sesame มีลักษณะ classic open-washing และ Sesame ก็ซื่อสัตย์เรื่องนี้มากกว่าองค์กรส่วนใหญ่ CSM checkpoint ที่แล็บเปิดตัวภายใต้ Apache-2.0 เป็นโมเดลฐานสำหรับสร้างเสียงพูด — แกนหลัก Llama ที่ป้อนเข้าสู่ตัวถอดรหัส Mimi-codec — และเอกสารก็ระบุชัดเจนว่ามันไม่ใช่เสียงของแอป และไม่ใช่ระบบ speech-to-speech แบบ end-to-end มันสร้างข้อความไม่ได้ และถูกฝึกด้วยข้อมูลภาษาอังกฤษเป็นหลัก โดยมีความสามารถจำกัดนอกเหนือจากภาษาอังกฤษ สิ่งที่ขับเคลื่อน Sesame Preview คือโมเดลโปรดักชันขนาดใหญ่กว่าที่ยังไม่ถูกเปิดตัว ดังนั้น หากคุณตามหาเสียงจากเดโม คุณจะพบเชื้อสายงานวิจัยของมัน ไม่ใช่ตัวมันเอง เมื่อหนึ่งในสี่เอเจนต์ตอบสายของคุณ คุณกำลังได้ยินบางสิ่งที่คุณดาวน์โหลดไม่ได้
เวอร์ชันของ Realtime-Venus เป็นภาพสะท้อนกลับ และอาจกล่าวได้ว่าเป็นเวอร์ชันที่แปลกกว่าด้วย ทุกสิ่งที่เผยแพร่ออกมานั้นเป็นของจริง: น้ำหนักจริง โค้ดจริง รายงานจริง สัญญาอนุญาตแบบผ่อนปรน สิ่งที่ขาดหายไปคือหนทางใด ๆ ในการใช้งานมันที่ไม่ต้องเป็นเจ้าของ GPU เช็คพอยต์ขนาด 9B สองตัวใน BF16 มีน้ำหนักประมาณสิบแปดกิกะไบต์ต่อตัวก่อนจะรวมหน่วยความจำสำหรับแอ็กติเวชัน และทั้งคู่ถูกออกแบบมาให้รันลูปสตรีมมิ่งต่อเนื่องขนาดหนึ่งวินาทีพร้อมอินพุตเสียงและวิดีโอแบบสด นั่นคือการติดตั้งใช้งานระดับเซิร์ฟเวอร์ แอปสำหรับผู้บริโภคที่ส่งมอบความสามารถเดียวกันนี้ไปยังโทรศัพท์กำลังทำสิ่งที่รีลีสนี้ไม่ได้พยายามทำ และช่องว่างระหว่างโมเดลที่ดาวน์โหลดได้กับโมเดลที่รันได้ก็คือจุดที่คนส่วนใหญ่ที่ต้องการมันจะติดอยู่พอดี
ความสามารถในการวัดได้คือความแตกต่างที่ชัดเจนกว่า
ทั้งสองโมเดลไม่มีคะแนนคุณภาพเสียงที่เป็นอิสระ แต่เหตุผลแตกต่างกัน
• Sesame Preview — ไม่มีการส่งเข้าอารีนา ไม่มีการเผยแพร่การประเมินเสียงเวอร์ชันโปรดักชัน ชื่อเสียงของมันอาศัยนักวิจารณ์และผลกระทบของเดโมต้นฉบับที่มีต่อผู้ฟัง ซึ่งเป็นหลักฐานจริงในแบบหนึ่งและไม่ได้ถูกวัดปริมาณเลย
• CSM-1B — เช็กพอยต์แบบเปิดเป็นโมเดลฐานสำหรับการสร้าง จึงไม่ได้ถูกนำไปวัดผลเทียบกับระบบสนทนา เพราะมันไม่ใช่ระบบสนทนา
• Realtime-Venus — ตัวเลขด้านเสียงที่รายงานเองเพียงหนึ่งตัว ได้แก่คะแนน VoiceBench AlpacaEval ที่ 4.81 ซึ่งรายงานของมันระบุว่าเทียบเท่ากับตัวเลขเปรียบเทียบที่ดีที่สุด ยังไม่มีบุคคลที่สามใดประเมินมัน
• สิ่งที่ทั้งสองฝ่ายไม่ได้ให้คุณ — ตัวเลขที่ออกโดยคนซึ่งไม่มีส่วนได้ส่วนเสียกับผลลัพธ์ หากคุณภาพเสียงเป็นเกณฑ์การซื้อของคุณ การเปรียบเทียบทั้งหมดก็ไม่อาจให้คะแนนได้ และทางเลือกที่ซื่อสัตย์คือฟังทั้งสองตัวแล้วตัดสินใจด้วยตัวเอง แทนที่จะยอมเชื่อตาราง
การผลัดกัน ซึ่งทั้งคู่ต่างมีอะไรต้องพิสูจน์
ชื่อเสียงของ Sesame ถูกสร้างขึ้นจากสิ่งนี้อย่างแท้จริง เดโมที่ทำให้แล็บโด่งดังคือเสียงที่มีลมหายใจ มีความลังเล และจังหวะการขัดจังหวะที่แนบเนียนพอจนผู้ฟังคิดว่ามีคนอยู่ปลายสาย นั่นเป็นข้อกล่าวอ้างเกี่ยวกับพลวัตของการสนทนา และมันเป็นสิ่งที่ผลิตภัณฑ์นี้ใช้ขาย
Realtime-Venus อ้างแบบเดียวกันโดยมีตัวเลขประกอบด้วย บน Full-Duplex-Bench v1.5 checkpoint ด้านเสียงของมันรายงานว่าตอบสนองต่อการขัดจังหวะของผู้ใช้ถึง 75% โดยมีอัตราการพูดต่อ 97% เมื่อมี backchannels, 88% เมื่อเป็นคำพูดที่มุ่งไปยังผู้อื่น และ 86% เมื่อมีเสียงพูดพื้นหลัง — ซึ่งระบุว่าสูงกว่า Gemini 3.1 Live และ GPT-4o ในตัวชี้วัดการพูดต่อทั้งสามตัว ตัวเลขเหล่านั้นมาจากรายงานของมันเองและยังไม่มีใครทำซ้ำได้
ดังนั้นการเปรียบเทียบนี้จึงเป็นการนำเดโมที่ไม่มีตัวเลขมาเทียบกับตัวเลขที่ไม่มีเดโม ซึ่งเป็นสถานะที่อึดอัดอย่างแท้จริง และเป็นคำอธิบายที่ตรงไปตรงมาว่าหมวดหมู่นี้ทั้งหมดรายงานเกี่ยวกับตัวเองอย่างไรในตอนนี้ สิ่งเดียวที่พูดได้อย่างมั่นใจก็คือ ไม่มีข้ออ้างใดที่ผ่านการตรวจสอบจากบุคคลภายนอก และอัตราการดำเนินต่อไป 97% ในช่องทางหลังบ้านนั้นสูงพอที่จะสมควรได้รับการตรวจสอบจากบุคคลภายนอกก่อนที่จะถูกอ้างว่าเป็นเรื่องที่ยุติแล้ว

สิ่งที่คุณสามารถสร้างได้จริงๆ
Sesame Preview ไม่มีอะไรให้ผู้สร้างเลย ไม่มี API ไม่มีตัวระบุโมเดล ไม่มีตารางราคา และไม่มีแผนที่ระบุไว้สำหรับสิ่งนั้น การเรียกใช้จำกัดที่สามสิบนาทีเมื่อล็อกอิน และห้านาทีเมื่อไม่ได้ล็อกอิน ภาษาอังกฤษเป็นภาษาเดียวที่รองรับอย่างเป็นทางการ และเอเจนต์จะค้นคว้าและจดจำได้ แต่จะไม่ลงมือทำภารกิจ — มันจะไม่จองเที่ยวบิน แพ็กเกจฟรีคือตัวผลิตภัณฑ์ นั่นเป็นข้อเสนอสำหรับผู้บริโภคที่ยอดเยี่ยมและเป็นทางตันสำหรับการผสานรวม
Realtime-Venus มอบทุกอย่างให้ผู้พัฒนา ยกเว้นที่สำหรับรันมัน น้ำหนักโมเดลมีสัญญาอนุญาตแบบ permissive โค้ดโหลดได้ด้วยการเรียก Transformers มาตรฐาน การสตรีมแบบ full-duplex เข้าใช้ได้ด้วยการสลับเมธอดเพียงครั้งเดียว และลูปที่ระบุไว้ในเอกสารคือการ prefill แบบสตรีมหนึ่งวินาที ตามด้วยการสร้างแบบสตรีม แล้วทำซ้ำ หน่วยความจำสำหรับวิดีโอยาวเปิดใช้งานด้วยพารามิเตอร์ memory-minutes และถูกอธิบายว่าเป็นแบบ training-free ซึ่งเป็นเรื่องผิดปกติสำหรับความสามารถที่โดยปกติต้อง fine-tuning มีข้อควรระวังสองข้อที่ระบุไว้ในเอกสาร แทนที่จะปล่อยให้ไปค้นพบเอง: เพดานจำนวนเฟรมที่ตัดทอนวิดีโอยาวอย่างเงียบ ๆ เว้นแต่จะเพิ่มค่าคงที่ก่อนการ import ยูทิลิตี้ และข้อกำหนดฟอนต์ CJK สำหรับคำบรรยายที่ไม่ใช่ละตินซึ่งเรนเดอร์ลงในวิดีโอแบบ duplex
สิ่งที่ไม่มีสิ่งใดเปลี่ยนแปลงได้ก็คือ harness — องค์ประกอบที่รันการมอบหมายงานแบบอะซิงโครนัส ซึ่งเป็นส่วนที่โดดเด่นที่สุดของสถาปัตยกรรม — อยู่ในรีโพซิทอรี GitHub แยกต่างหาก มีเอกสารประกอบน้อยกว่าโมเดลมาก และเป็นส่วนที่ยากที่สุดในการตัดสินว่าพร้อมสำหรับการใช้งานจริงหรือไม่ ในการปรับใช้จริง ขาของการมอบหมายงานคือการอนุมานข้อความธรรมดาที่อยู่เบื้องหลังส่วนหน้าสำหรับสนทนา OrcaRouter ไม่มีทั้ง Realtime-Venus และ Sesame Preview; ชั้นเสียงทั้งสองอยู่นอกเหนือสิ่งที่เราให้บริการ และเราพูดอย่างตรงไปตรงมาแทนที่จะบอกเป็นนัยถึงความสัมพันธ์ด้านโฮสติ้งที่ไม่มีอยู่จริง โมเดลข้อความเกือบ 200 รายการหลังคีย์เดียวในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่มคือครึ่งหนึ่งของสถาปัตยกรรมนั้นที่เราครอบคลุมอยู่จริง โดยมี การ failover อัตโนมัติเพื่อให้งานที่ถูกมอบหมายรอดพ้นจากเหตุขัดข้องของต้นทาง, routing DSL ที่รวมโมเดลหลายตัวไว้ในการเรียกครั้งเดียว และ model fusion ที่การตัดสินใจของโมเดลเดียวไม่เพียงพอ มันคือส่วนที่ซื้อได้ของดีไซน์ที่ส่วนที่น่าสนใจนั้นไม่ได้มีไว้ขาย

คำแนะนำที่ซื่อสัตย์
ถ้าคุณเป็นผู้บริโภคที่ต้องการเสียงสนทนาที่ฟังดูดีที่สุดที่มีอยู่ในตอนนี้ และไม่จำเป็นต้องนำไปผสานรวมกับระบบอื่น Sesame Preview นั้นใช้งานฟรี มีให้ใช้บนแพลตฟอร์มมือถือทั้งสองระบบ และชื่อเสียงของมันก็คู่ควรพอจนนักวิจารณ์ยังคงพูดถึงกันอยู่เรื่อย ๆ ลองใช้และเพลิดเพลินไปกับมันได้เลย
หากคุณเป็นนักวิจัยหรือทีมวิศวกรรมที่มีทรัพยากรพร้อม ซึ่งต้องการสแตกเสียงและภาพแบบฟูลดูเพล็กซ์แบบเปิดที่คุณสามารถตรวจสอบและปรับแต่งละเอียดได้ Realtime-Venus ก็เป็นหนึ่งในตัวเลือกจริงเพียงไม่กี่ตัวเลือก และการที่เบนช์มาร์กของมันเป็นข้อมูลที่รายงานเองก็ไม่ได้เปลี่ยนข้อเท็จจริงที่ว่าน้ำหนักของมันเปิดอย่างแท้จริงและสถาปัตยกรรมของมันมีเอกสารประกอบอย่างแท้จริง
หากคุณเป็นทีมผลิตภัณฑ์ที่กำลังมองหาเลเยอร์เสียงเพื่อส่งมอบในไตรมาสนี้ ไม่มีสิ่งใดในสองสิ่งนี้ที่เป็นคำตอบของคุณ และข้อคิดที่มีประโยชน์จากการจับคู่นี้คือเหตุผลว่าทำไม แล็บหนึ่งแห่งสร้างสิ่งที่ดีเยี่ยมขึ้นมาและเก็บส่วนที่ดีไว้แบบปิด ส่วนอีกแห่งเผยแพร่ทุกอย่างและปล่อยให้คุณจัดหาโครงสร้างพื้นฐานเอง หมวดหมู่นี้พิสูจน์แล้วว่าสามารถสร้างเสียงที่ควรค่าแก่การฟังได้ และยังไม่ได้ตัดสินใจว่าเสียงนั้นควรซื้อหาได้ในรูปแบบอื่นใดนอกเหนือจากแอปหรือไม่
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
