การ์ดหัวเรื่องแบบฮีโร่ที่สร้างขึ้นสำหรับ StepAudio 3 Realtime vs Sesame Preview พร้อมคำโปรย 'OrcaRouter · เรดาร์โมเดล — ประจันหน้า' พาดหัว 'StepAudio 3 Realtime vs Sesame Preview' และคำบรรยายย่อย 'เสียงที่ทุกคนยกย่อง เมื่อเทียบกับเสียงที่มีคะแนนบนลีดเดอร์บอร์ด' เหนือการ์ดโมเดลทรงมนสองใบที่อยู่คนละข้างของเครื่องหมาย versus
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview: เสียงที่ทุกคนยกย่อง vs เสียงที่มีคะแนน

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ตลอดเกือบทั้งปี 2026 คำกล่าวอ้างที่หนักแน่นที่สุดที่ใคร ๆ ก็ทำได้เกี่ยวกับ AI เสียง คือความรู้สึกจากการฟัง ผู้ช่วยของ Sesame ฟังดูเป็นมนุษย์มากกว่าสิ่งอื่นใด และมีคนพูดเช่นนั้นมากพอจนมันกลายเป็นจุดอ้างอิง — โดยไม่มีเกณฑ์มาตรฐาน ไม่มีตัวเลข และไม่มีวิธีตรวจสอบ วันที่ 15 กันยายน 2026 StepAudio 3 Realtime เปิดตัวจาก StepFun พร้อมตัวเลขที่ผูกกับเวอร์ชันซึ่งวัดได้ใกล้เคียงที่สุดของคุณภาพนั้น: 98.9% ในการประเมิน Conversational Dynamics ของ Artificial Analysis เป็นอันดับหนึ่ง Sesame Preview ไม่ได้อยู่ในกระดานนั้น

ส่วนที่น่าสนใจไม่ใช่ว่าตัวหนึ่งเอาชนะอีกตัวหนึ่งได้ แต่เป็นว่าคุณภาพที่ทำให้ Sesame โด่งดัง ตอนนี้กลายเป็นสิ่งที่บุคคลที่สามให้คะแนน และโมเดลที่มีชื่อเสียงนั้นยังไม่เคยถูกวัดเทียบกับสิ่งนี้เลย

แต่ละสิ่งเหล่านี้จริง ๆ แล้วคืออะไร

พวกมันไม่ใช่สิ่งประเภทเดียวกัน และนั่นเป็นตัวกำหนดการเปรียบเทียบได้มากกว่าคะแนนใด ๆ

Sesame Preview เป็นผู้ช่วยเสียงสำหรับผู้บริโภค เปิดให้ใช้ฟรีบน iOS ตั้งแต่เดือนพฤษภาคม 2026 และเปิดให้ใช้อย่างแพร่หลายบน Android ตั้งแต่ต้นเดือนสิงหาคม 2026 โดยสร้างขึ้นรอบ ๆ เอเจนต์ที่มีชื่อสี่ตัว ได้แก่ Maya, Miles, Simone และ Charlie ซึ่งจดจำบริบทข้ามเซสชัน ค้นหาเว็บ และตั้งการแจ้งเตือนได้ รองรับเฉพาะภาษาอังกฤษเท่านั้น การสนทนามีเวลาจำกัดสูงสุด 30 นาที ซึ่งจะลดลงเหลือห้านาทีเมื่อคุณออกจากระบบ ไม่มี API สำหรับเสียงในเวอร์ชันใช้งานจริง ไม่มีแพ็กเกจสำหรับองค์กร และไม่มีข้อมูลราคาสาธารณะ

StepAudio 3 Realtime เป็นพื้นผิวสำหรับนักพัฒนา โดยเป็นหนึ่งในห้าโมเดลในตระกูล StepAudio 3 ซึ่งเปิดตัววันเดียวกันทั้งหมดและให้บริการอยู่บนแพลตฟอร์มเปิดของ StepFun ในฐานะ API เชิงพาณิชย์ รองรับการสนทนาแบบฟูลดูเพล็กซ์โดยกำเนิด ให้เหตุผลโดยตรงจากเสียงพูดแทนการถอดเสียงก่อน และรองรับการเรียกใช้เครื่องมือและการทำงานแบบอะซิงโครนัสของงานที่ใช้เวลานานในขณะที่การสนทนายังดำเนินอยู่ เน้นภาษาจีนเป็นหลัก ไม่ใช่โมเดลที่เปิดน้ำหนัก และขณะนี้อยู่ในราคาช่วงทดลองใช้ฟรีแบบจำกัดเวลา โดยยังไม่ประกาศอัตราค่าบริการหลังช่วงทดลอง

หนึ่งในสิ่งเหล่านี้คุณสามารถสร้างต่อยอดได้ ส่วนอีกสิ่งหนึ่งคุณสามารถไปเยี่ยมชมได้

สิ่งที่วัดผลได้ซึ่ง Sesame ขึ้นชื่อ

Conversational Dynamics เป็นเบนช์มาร์กเฉพาะทาง และการรู้ว่ามันวัดอะไรบ้างก็มีประโยชน์ มันให้คะแนนการผลัดกันพูด การจัดการช่วงหยุด การฟื้นตัวหลังถูกขัดจังหวะ และว่าโมเดลอ่านสัญญาณตอบรับสั้น ๆ — “uh-huh”, “right”, “mm” — ได้ถูกต้องหรือไม่ ว่าเป็นกำลังใจมากกว่าจะเป็นการแย่งสิทธิ์ในการพูด สิ่งเหล่านี้คือพฤติกรรมที่ผู้ฟังบรรยายไว้อย่างแม่นยำเมื่อพวกเขาบอกว่าเสียงหนึ่งฟังดูเป็นมนุษย์มากกว่าหุ่นยนต์ และเป็นพฤติกรรมที่ทำให้ผู้ช่วยน่าคุยด้วย ไม่ใช่แค่แม่นยำเท่านั้น

StepAudio 3 Realtime ครองอันดับหนึ่งบนบอร์ดจัดอันดับนั้นที่ 98.9% นำหน้า Qwen Audio 3.0 Realtime Plus ที่ 98.4% และ GPT-Realtime-2 ที่ 95.3% อีกทั้งยังอยู่ในอันดับหนึ่งของด้าน Speech Reasoning ที่ 99.7% ตามที่ StepFun อ้างถึง ซึ่งเบื้องหลังนั้นคือข้ออ้างเชิงสถาปัตยกรรมว่า การให้เหตุผลบนเสียงดิบโดยตรงช่วยรักษาโทนเสียงและน้ำหนักเน้นที่การแปลงเป็นข้อความ (transcription) จะทำให้แบนราบ — ความต่างระหว่างการได้ยินถ้อยคำประชดกับการได้ยินคำชม

นี่คือการนำเสนอผลลัพธ์นั้นอย่างตรงไปตรงมา เบนช์มาร์กคือสิ่งที่ใกล้เคียงที่สุดที่อุตสาหกรรมมีต่อการวัดสิ่งที่ Sesame ได้รับคำชื่นชม และ Sesame ยังไม่ได้ถูกส่งเข้าไปในเบนช์มาร์กนั้น นั่นไม่ใช่หลักฐานว่า StepAudio 3 Realtime ฟังดูดีกว่า Sesame มันเป็นหลักฐานว่าข้ออ้างหนึ่งในนี้ตรวจสอบได้ ส่วนอีกข้อหนึ่ง ณ ตอนนี้ยังตรวจสอบไม่ได้ — และข้อที่ตรวจสอบได้นั้นปัจจุบันเป็นของโมเดลที่คนส่วนใหญ่ไม่เคยพูดคุยด้วย

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

ความไม่สมมาตรของความพร้อมใช้งาน ซึ่งเป็นจุดตัดสินใจที่แท้จริง

ทุกอย่างข้างต้นน่าสนใจ ส่วนนี้เป็นตัวชี้ขาด

เสียงของ Sesame — เสียงที่ผู้คนพากันชื่นชม — เป็นโมเดลโปรดักชันแบบปิดที่มีขนาดใหญ่กว่า ซึ่ง Sesame ไม่เคยเปิดให้ใช้เป็น API คุณไม่สามารถซื้อ รับสิทธิ์ใช้งาน หรือเรียกใช้จากผลิตภัณฑ์ของคุณเองได้ หากคุณอ่านว่าจังหวะการสนทนาของ Sesame ดีที่สุดเท่าที่มี และสรุปว่าคุณจะได้มันมาใช้ ข้อสรุปนั้นก็ไม่ได้เป็นไปตามหลักฐาน

สิ่งที่ Sesame เปิดซอร์สจริง ๆ คือ CSM-1B ซึ่งเผยแพร่ภายใต้ Apache-2.0 มันเป็นบล็อกสังเคราะห์เสียง ไม่ใช่ผู้ช่วย: แกนหลัก Llama ทำนาย Mimi codebook แรก และตัวถอดรหัส Llama ที่เล็กกว่าทำนายส่วนที่เหลือ ซึ่งโคเดก Mimi เรนเดอร์ออกมาเป็นรูปคลื่น 24 kHz มันรองรับเฉพาะภาษาอังกฤษ มันโคลนเสียงจากคลิปอ้างอิงความยาว 10 ถึง 15 วินาที และมันไม่สามารถสร้างข้อความได้เลย — คุณต้องจับคู่มันกับแบบจำลองภาษาต่างหาก ผู้ที่ลองใช้ทั้งสองแบบอธิบายว่าเสียงของ CSM-1B อ่อนกว่าแอป Preview อย่างเห็นได้ชัด และการ์ดแบบจำลองก็เผยสิ่งที่ปกติไม่พูดออกมาตรง ๆ ว่า ตัวแปรที่ปรับละเอียดของ CSM เป็นตัวขับเคลื่อนเดโมแบบอินเทอร์แอกทีฟ และตัวแปรนั้นไม่ใช่เช็กพอยต์ที่คุณดาวน์โหลดได้

StepAudio 3 Realtime ไม่มีความคลุมเครือแบบนั้นเลย มันเป็น API เชิงพาณิชย์ที่มีตระกูลโมเดลที่เผยแพร่รองรับ มีชุดความสามารถที่ระบุไว้ และมีอันดับจากบุคคลที่สามที่คุณค้นดูได้ นอกจากนี้ยังให้ความสำคัญกับภาษาจีนเป็นอันดับแรก ตั้งราคาแบบพรีวิว และบันทึกเวลาถึงเสียงแรก (time to first audio) ที่ 8.83 วินาที บนลีดเดอร์บอร์ดเดียวกันกับที่มันชนะด้าน conversational dynamics — เมื่อเทียบกับ 1.18 วินาทีของ Gemini 3.8 Live และ 1.24 ถึง 1.34 วินาทีของ GPT-Live-1 ไม่ว่ามันจะมอบคุณภาพการสนทนาได้แค่ไหน มันก็ยังไม่ได้พิสูจน์ว่าสามารถส่งมอบสิ่งนั้นด้วยความเร็วระดับการสนทนาได้นอกระบบการให้บริการของ StepFun เอง

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

จะทำอย่างไรกับสิ่งนี้หากคุณกำลังเลือกสแต็กเสียง

เริ่มจากการแยกสองคำถามนี้ออกจากกัน "บทสนทนาควรให้ความรู้สึกแบบไหน" กับ "ฉันปล่อยอะไรออกไปได้บ้าง" มีคำตอบที่แตกต่างกัน และมีเพียงคำถามเดียวเท่านั้นที่เป็นการตัดสินใจเรื่องการจัดซื้อจัดหา

ถ้าคุณกำลังปรับจูนรสนิยม — ตัดสินใจว่าผลิตภัณฑ์ของคุณควรมีความอบอุ่นแค่ไหน ความเงียบแค่ไหนจึงจะสบาย และเอเจนต์ควรปล่อยให้อีกฝ่ายได้พูดเร็วเพียงใด — Sesame Preview นั้นฟรี ดีเยี่ยมจริง ๆ และเป็นที่ที่ดีสำหรับใช้เวลาสักช่วงบ่าย ใช้มันเป็นจุดอ้างอิง อย่าวางแผนจะผสานการทำงานเข้ากับมัน เพราะไม่มีอะไรให้ผสานด้วย

หากคุณกำลังปล่อยผลิตภัณฑ์ StepAudio 3 Realtime เป็นตัวเลือกจริงที่มีข้อควรระวังจริง ทั้งราคาพรีวิว ความครอบคลุมที่เน้นภาษาจีนก่อน ไม่มีคะแนนดัชนีบน Artificial Analysis และคำถามเรื่องความหน่วงที่ยังไม่คลี่คลาย ให้ทดสอบความหน่วงก่อนคุณภาพการสนทนา โมเดลที่ชนะเบนช์มาร์กการผลัดกันพูด แต่ใช้เวลาเริ่มพูดเกือบเท่ากับหนึ่งประโยค คือโมเดลที่คุณอาจไม่มีโอกาสได้แสดงคุณภาพที่ดีที่สุดของมันเลย

และถ้าเสียงโปรดักชันของ {{1}}Sesame's{{/1}} มี API สักวัน การเปรียบเทียบทั้งหมดนี้ก็จะถูกทำซ้ำ — เพราะเบนช์มาร์กที่จะชี้ขาดเรื่องนี้มีอยู่แล้ว และในที่สุด {{2}}Sesame{{/2}} ก็จะต้องปรากฏบนมัน

จุดที่การกำหนดเส้นทางเหมาะสม และจุดที่มันไม่เหมาะสม

Voice agents ไม่ใช่โมเดลเดียว ไม่ว่าคุณจะรัน StepAudio 3 Realtime หรืออะไรก็ตาม บทสนทนาก็จะส่งงานให้โมเดลข้อความทั่วไปอยู่ตลอด — การค้นหา การดึงข้อมูล การเรียกใช้การให้เหตุผลที่ทำงานอยู่เบื้องหลังช่วงหยุดที่ถูกคงไว้ เลเยอร์การมอบหมายงานนี้คือที่ที่ความแปรปรวนของต้นทุนอยู่ และเป็นที่ที่ชั่วโมงแย่ ๆ ของผู้ให้บริการรายหนึ่งกลายเป็นระบบล่มของคุณ

เพื่อความแม่นยำเกี่ยวกับความครอบคลุมของเราเอง: เอนด์พอยต์แบบไลฟ์และแบบเสียงในตระกูล StepAudio 3 ไม่ได้อยู่บน OrcaRouter และไม่มีสิ่งใดที่ Sesame สร้างขึ้นอยู่บนนั้นเช่นกัน สิ่งที่อยู่บน OrcaRouter คือเลเยอร์ข้อความที่เอเจนต์เสียงมอบหมายงานให้ — โมเดลเกือบ 200 รายการภายใต้ API เดียว, การสลับสำรองอัตโนมัติ, DSL การจัดเส้นทางที่ประกอบหลายอย่างเข้าไว้ในหนึ่งการเรียก, และการหลอมรวมโมเดลเมื่อวิจารณญาณของโมเดลเดียวไม่เพียงพอ, โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยไม่มีการบวกเพิ่มใด ๆ

การแยกส่วนแบบนั้นเองที่ทำให้คำถามเรื่องความพร้อมใช้งานไม่ร้ายแรงเท่าที่เห็น โมเดลเสียงเป็นการตัดสินใจที่คุณกลับมาทบทวนได้ ส่วนเลเยอร์การมอบหมายงานคือสิ่งที่ยิ่งรื้อถอนออกแล้วยิ่งมีค่าใช้จ่ายสูง และเป็นสิ่งที่คุ้มค่าจะวางไว้หลังเราเตอร์ก่อนที่คุณจะผูกพันกับผู้ให้บริการเสียงรายใด

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

คำตัดสิน

Sesame Preview ชนะในสิ่งที่ไม่อาจวัดได้ และแพ้ในทุกสิ่งที่ซื้อได้ มันเป็นเสียงที่ฟังดีที่สุดที่มีให้ใช้ มันฟรี และคุณไม่สามารถนำมันไปใช้ในโปรดักชันได้ — และในเมื่อตอนนี้มีบุคคลที่สามให้คะแนนคุณภาพที่มันขึ้นชื่อ การที่มันไม่ปรากฏบนกระดานคะแนนนั้นคือช่องว่างในหลักฐาน ไม่ใช่ตำแหน่งผู้นำที่ได้รับการคุ้มครอง

StepAudio 3 Realtime ชนะในด้านความพร้อมใช้งาน ความสามารถในการวัดผล และขีดความสามารถ และยังมีคำถามเปิดที่แท้จริงเกี่ยวกับราคา ความครอบคลุมของภาษา และความหน่วง มันเป็นเพียงหนึ่งเดียวจากสองตัวเลือกที่คุณสามารถสร้างต่อยอดได้ในวันนี้ ซึ่งตอบคำถามในทางปฏิบัติได้เร็วกว่าการทดสอบมาตรฐานใด ๆ

สิ่งที่ต้องจับตานั้นง่าย และมันส่งผลได้สองทาง: คะแนน Conversational Dynamics สำหรับเสียงโปรดักชันของ Sesame หรือค่าความหน่วงของ StepAudio 3 Realtime ที่ทำให้มันอยู่ในช่วงเดียวกับโมเดลที่ปัจจุบันมันเอาชนะได้ในด้านคุณภาพ ไม่ว่าจะเป็นอันใดอันหนึ่ง สิ่งนี้จะเปลี่ยนจากการเปรียบเทียบระหว่างการวัดค่ากับชื่อเสียง ให้กลายเป็นการเปรียบเทียบแบบตัวต่อตัวจริง ๆ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube