
StepAudio 3 Realtime vs Sesame Preview: เสียงที่ทุกคนยกย่อง vs เสียงที่มีคะแนน
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
ตลอดเกือบทั้งปี 2026 คำกล่าวอ้างที่หนักแน่นที่สุดที่ใคร ๆ ก็ทำได้เกี่ยวกับ AI เสียง คือความรู้สึกจากการฟัง ผู้ช่วยของ Sesame ฟังดูเป็นมนุษย์มากกว่าสิ่งอื่นใด และมีคนพูดเช่นนั้นมากพอจนมันกลายเป็นจุดอ้างอิง — โดยไม่มีเกณฑ์มาตรฐาน ไม่มีตัวเลข และไม่มีวิธีตรวจสอบ วันที่ 15 กันยายน 2026 StepAudio 3 Realtime เปิดตัวจาก StepFun พร้อมตัวเลขที่ผูกกับเวอร์ชันซึ่งวัดได้ใกล้เคียงที่สุดของคุณภาพนั้น: 98.9% ในการประเมิน Conversational Dynamics ของ Artificial Analysis เป็นอันดับหนึ่ง Sesame Preview ไม่ได้อยู่ในกระดานนั้น
ส่วนที่น่าสนใจไม่ใช่ว่าตัวหนึ่งเอาชนะอีกตัวหนึ่งได้ แต่เป็นว่าคุณภาพที่ทำให้ Sesame โด่งดัง ตอนนี้กลายเป็นสิ่งที่บุคคลที่สามให้คะแนน และโมเดลที่มีชื่อเสียงนั้นยังไม่เคยถูกวัดเทียบกับสิ่งนี้เลย
แต่ละสิ่งเหล่านี้จริง ๆ แล้วคืออะไร
พวกมันไม่ใช่สิ่งประเภทเดียวกัน และนั่นเป็นตัวกำหนดการเปรียบเทียบได้มากกว่าคะแนนใด ๆ
Sesame Preview เป็นผู้ช่วยเสียงสำหรับผู้บริโภค เปิดให้ใช้ฟรีบน iOS ตั้งแต่เดือนพฤษภาคม 2026 และเปิดให้ใช้อย่างแพร่หลายบน Android ตั้งแต่ต้นเดือนสิงหาคม 2026 โดยสร้างขึ้นรอบ ๆ เอเจนต์ที่มีชื่อสี่ตัว ได้แก่ Maya, Miles, Simone และ Charlie ซึ่งจดจำบริบทข้ามเซสชัน ค้นหาเว็บ และตั้งการแจ้งเตือนได้ รองรับเฉพาะภาษาอังกฤษเท่านั้น การสนทนามีเวลาจำกัดสูงสุด 30 นาที ซึ่งจะลดลงเหลือห้านาทีเมื่อคุณออกจากระบบ ไม่มี API สำหรับเสียงในเวอร์ชันใช้งานจริง ไม่มีแพ็กเกจสำหรับองค์กร และไม่มีข้อมูลราคาสาธารณะ
StepAudio 3 Realtime เป็นพื้นผิวสำหรับนักพัฒนา โดยเป็นหนึ่งในห้าโมเดลในตระกูล StepAudio 3 ซึ่งเปิดตัววันเดียวกันทั้งหมดและให้บริการอยู่บนแพลตฟอร์มเปิดของ StepFun ในฐานะ API เชิงพาณิชย์ รองรับการสนทนาแบบฟูลดูเพล็กซ์โดยกำเนิด ให้เหตุผลโดยตรงจากเสียงพูดแทนการถอดเสียงก่อน และรองรับการเรียกใช้เครื่องมือและการทำงานแบบอะซิงโครนัสของงานที่ใช้เวลานานในขณะที่การสนทนายังดำเนินอยู่ เน้นภาษาจีนเป็นหลัก ไม่ใช่โมเดลที่เปิดน้ำหนัก และขณะนี้อยู่ในราคาช่วงทดลองใช้ฟรีแบบจำกัดเวลา โดยยังไม่ประกาศอัตราค่าบริการหลังช่วงทดลอง
หนึ่งในสิ่งเหล่านี้คุณสามารถสร้างต่อยอดได้ ส่วนอีกสิ่งหนึ่งคุณสามารถไปเยี่ยมชมได้
สิ่งที่วัดผลได้ซึ่ง Sesame ขึ้นชื่อ
Conversational Dynamics เป็นเบนช์มาร์กเฉพาะทาง และการรู้ว่ามันวัดอะไรบ้างก็มีประโยชน์ มันให้คะแนนการผลัดกันพูด การจัดการช่วงหยุด การฟื้นตัวหลังถูกขัดจังหวะ และว่าโมเดลอ่านสัญญาณตอบรับสั้น ๆ — “uh-huh”, “right”, “mm” — ได้ถูกต้องหรือไม่ ว่าเป็นกำลังใจมากกว่าจะเป็นการแย่งสิทธิ์ในการพูด สิ่งเหล่านี้คือพฤติกรรมที่ผู้ฟังบรรยายไว้อย่างแม่นยำเมื่อพวกเขาบอกว่าเสียงหนึ่งฟังดูเป็นมนุษย์มากกว่าหุ่นยนต์ และเป็นพฤติกรรมที่ทำให้ผู้ช่วยน่าคุยด้วย ไม่ใช่แค่แม่นยำเท่านั้น
StepAudio 3 Realtime ครองอันดับหนึ่งบนบอร์ดจัดอันดับนั้นที่ 98.9% นำหน้า Qwen Audio 3.0 Realtime Plus ที่ 98.4% และ GPT-Realtime-2 ที่ 95.3% อีกทั้งยังอยู่ในอันดับหนึ่งของด้าน Speech Reasoning ที่ 99.7% ตามที่ StepFun อ้างถึง ซึ่งเบื้องหลังนั้นคือข้ออ้างเชิงสถาปัตยกรรมว่า การให้เหตุผลบนเสียงดิบโดยตรงช่วยรักษาโทนเสียงและน้ำหนักเน้นที่การแปลงเป็นข้อความ (transcription) จะทำให้แบนราบ — ความต่างระหว่างการได้ยินถ้อยคำประชดกับการได้ยินคำชม
นี่คือการนำเสนอผลลัพธ์นั้นอย่างตรงไปตรงมา เบนช์มาร์กคือสิ่งที่ใกล้เคียงที่สุดที่อุตสาหกรรมมีต่อการวัดสิ่งที่ Sesame ได้รับคำชื่นชม และ Sesame ยังไม่ได้ถูกส่งเข้าไปในเบนช์มาร์กนั้น นั่นไม่ใช่หลักฐานว่า StepAudio 3 Realtime ฟังดูดีกว่า Sesame มันเป็นหลักฐานว่าข้ออ้างหนึ่งในนี้ตรวจสอบได้ ส่วนอีกข้อหนึ่ง ณ ตอนนี้ยังตรวจสอบไม่ได้ — และข้อที่ตรวจสอบได้นั้นปัจจุบันเป็นของโมเดลที่คนส่วนใหญ่ไม่เคยพูดคุยด้วย

ความไม่สมมาตรของความพร้อมใช้งาน ซึ่งเป็นจุดตัดสินใจที่แท้จริง
ทุกอย่างข้างต้นน่าสนใจ ส่วนนี้เป็นตัวชี้ขาด
เสียงของ Sesame — เสียงที่ผู้คนพากันชื่นชม — เป็นโมเดลโปรดักชันแบบปิดที่มีขนาดใหญ่กว่า ซึ่ง Sesame ไม่เคยเปิดให้ใช้เป็น API คุณไม่สามารถซื้อ รับสิทธิ์ใช้งาน หรือเรียกใช้จากผลิตภัณฑ์ของคุณเองได้ หากคุณอ่านว่าจังหวะการสนทนาของ Sesame ดีที่สุดเท่าที่มี และสรุปว่าคุณจะได้มันมาใช้ ข้อสรุปนั้นก็ไม่ได้เป็นไปตามหลักฐาน
สิ่งที่ Sesame เปิดซอร์สจริง ๆ คือ CSM-1B ซึ่งเผยแพร่ภายใต้ Apache-2.0 มันเป็นบล็อกสังเคราะห์เสียง ไม่ใช่ผู้ช่วย: แกนหลัก Llama ทำนาย Mimi codebook แรก และตัวถอดรหัส Llama ที่เล็กกว่าทำนายส่วนที่เหลือ ซึ่งโคเดก Mimi เรนเดอร์ออกมาเป็นรูปคลื่น 24 kHz มันรองรับเฉพาะภาษาอังกฤษ มันโคลนเสียงจากคลิปอ้างอิงความยาว 10 ถึง 15 วินาที และมันไม่สามารถสร้างข้อความได้เลย — คุณต้องจับคู่มันกับแบบจำลองภาษาต่างหาก ผู้ที่ลองใช้ทั้งสองแบบอธิบายว่าเสียงของ CSM-1B อ่อนกว่าแอป Preview อย่างเห็นได้ชัด และการ์ดแบบจำลองก็เผยสิ่งที่ปกติไม่พูดออกมาตรง ๆ ว่า ตัวแปรที่ปรับละเอียดของ CSM เป็นตัวขับเคลื่อนเดโมแบบอินเทอร์แอกทีฟ และตัวแปรนั้นไม่ใช่เช็กพอยต์ที่คุณดาวน์โหลดได้
StepAudio 3 Realtime ไม่มีความคลุมเครือแบบนั้นเลย มันเป็น API เชิงพาณิชย์ที่มีตระกูลโมเดลที่เผยแพร่รองรับ มีชุดความสามารถที่ระบุไว้ และมีอันดับจากบุคคลที่สามที่คุณค้นดูได้ นอกจากนี้ยังให้ความสำคัญกับภาษาจีนเป็นอันดับแรก ตั้งราคาแบบพรีวิว และบันทึกเวลาถึงเสียงแรก (time to first audio) ที่ 8.83 วินาที บนลีดเดอร์บอร์ดเดียวกันกับที่มันชนะด้าน conversational dynamics — เมื่อเทียบกับ 1.18 วินาทีของ Gemini 3.8 Live และ 1.24 ถึง 1.34 วินาทีของ GPT-Live-1 ไม่ว่ามันจะมอบคุณภาพการสนทนาได้แค่ไหน มันก็ยังไม่ได้พิสูจน์ว่าสามารถส่งมอบสิ่งนั้นด้วยความเร็วระดับการสนทนาได้นอกระบบการให้บริการของ StepFun เอง

จะทำอย่างไรกับสิ่งนี้หากคุณกำลังเลือกสแต็กเสียง
เริ่มจากการแยกสองคำถามนี้ออกจากกัน "บทสนทนาควรให้ความรู้สึกแบบไหน" กับ "ฉันปล่อยอะไรออกไปได้บ้าง" มีคำตอบที่แตกต่างกัน และมีเพียงคำถามเดียวเท่านั้นที่เป็นการตัดสินใจเรื่องการจัดซื้อจัดหา
ถ้าคุณกำลังปรับจูนรสนิยม — ตัดสินใจว่าผลิตภัณฑ์ของคุณควรมีความอบอุ่นแค่ไหน ความเงียบแค่ไหนจึงจะสบาย และเอเจนต์ควรปล่อยให้อีกฝ่ายได้พูดเร็วเพียงใด — Sesame Preview นั้นฟรี ดีเยี่ยมจริง ๆ และเป็นที่ที่ดีสำหรับใช้เวลาสักช่วงบ่าย ใช้มันเป็นจุดอ้างอิง อย่าวางแผนจะผสานการทำงานเข้ากับมัน เพราะไม่มีอะไรให้ผสานด้วย
หากคุณกำลังปล่อยผลิตภัณฑ์ StepAudio 3 Realtime เป็นตัวเลือกจริงที่มีข้อควรระวังจริง ทั้งราคาพรีวิว ความครอบคลุมที่เน้นภาษาจีนก่อน ไม่มีคะแนนดัชนีบน Artificial Analysis และคำถามเรื่องความหน่วงที่ยังไม่คลี่คลาย ให้ทดสอบความหน่วงก่อนคุณภาพการสนทนา โมเดลที่ชนะเบนช์มาร์กการผลัดกันพูด แต่ใช้เวลาเริ่มพูดเกือบเท่ากับหนึ่งประโยค คือโมเดลที่คุณอาจไม่มีโอกาสได้แสดงคุณภาพที่ดีที่สุดของมันเลย
และถ้าเสียงโปรดักชันของ {{1}}Sesame's{{/1}} มี API สักวัน การเปรียบเทียบทั้งหมดนี้ก็จะถูกทำซ้ำ — เพราะเบนช์มาร์กที่จะชี้ขาดเรื่องนี้มีอยู่แล้ว และในที่สุด {{2}}Sesame{{/2}} ก็จะต้องปรากฏบนมัน
จุดที่การกำหนดเส้นทางเหมาะสม และจุดที่มันไม่เหมาะสม
Voice agents ไม่ใช่โมเดลเดียว ไม่ว่าคุณจะรัน StepAudio 3 Realtime หรืออะไรก็ตาม บทสนทนาก็จะส่งงานให้โมเดลข้อความทั่วไปอยู่ตลอด — การค้นหา การดึงข้อมูล การเรียกใช้การให้เหตุผลที่ทำงานอยู่เบื้องหลังช่วงหยุดที่ถูกคงไว้ เลเยอร์การมอบหมายงานนี้คือที่ที่ความแปรปรวนของต้นทุนอยู่ และเป็นที่ที่ชั่วโมงแย่ ๆ ของผู้ให้บริการรายหนึ่งกลายเป็นระบบล่มของคุณ
เพื่อความแม่นยำเกี่ยวกับความครอบคลุมของเราเอง: เอนด์พอยต์แบบไลฟ์และแบบเสียงในตระกูล StepAudio 3 ไม่ได้อยู่บน OrcaRouter และไม่มีสิ่งใดที่ Sesame สร้างขึ้นอยู่บนนั้นเช่นกัน สิ่งที่อยู่บน OrcaRouter คือเลเยอร์ข้อความที่เอเจนต์เสียงมอบหมายงานให้ — โมเดลเกือบ 200 รายการภายใต้ API เดียว, การสลับสำรองอัตโนมัติ, DSL การจัดเส้นทางที่ประกอบหลายอย่างเข้าไว้ในหนึ่งการเรียก, และการหลอมรวมโมเดลเมื่อวิจารณญาณของโมเดลเดียวไม่เพียงพอ, โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยไม่มีการบวกเพิ่มใด ๆ
การแยกส่วนแบบนั้นเองที่ทำให้คำถามเรื่องความพร้อมใช้งานไม่ร้ายแรงเท่าที่เห็น โมเดลเสียงเป็นการตัดสินใจที่คุณกลับมาทบทวนได้ ส่วนเลเยอร์การมอบหมายงานคือสิ่งที่ยิ่งรื้อถอนออกแล้วยิ่งมีค่าใช้จ่ายสูง และเป็นสิ่งที่คุ้มค่าจะวางไว้หลังเราเตอร์ก่อนที่คุณจะผูกพันกับผู้ให้บริการเสียงรายใด

คำตัดสิน
Sesame Preview ชนะในสิ่งที่ไม่อาจวัดได้ และแพ้ในทุกสิ่งที่ซื้อได้ มันเป็นเสียงที่ฟังดีที่สุดที่มีให้ใช้ มันฟรี และคุณไม่สามารถนำมันไปใช้ในโปรดักชันได้ — และในเมื่อตอนนี้มีบุคคลที่สามให้คะแนนคุณภาพที่มันขึ้นชื่อ การที่มันไม่ปรากฏบนกระดานคะแนนนั้นคือช่องว่างในหลักฐาน ไม่ใช่ตำแหน่งผู้นำที่ได้รับการคุ้มครอง
StepAudio 3 Realtime ชนะในด้านความพร้อมใช้งาน ความสามารถในการวัดผล และขีดความสามารถ และยังมีคำถามเปิดที่แท้จริงเกี่ยวกับราคา ความครอบคลุมของภาษา และความหน่วง มันเป็นเพียงหนึ่งเดียวจากสองตัวเลือกที่คุณสามารถสร้างต่อยอดได้ในวันนี้ ซึ่งตอบคำถามในทางปฏิบัติได้เร็วกว่าการทดสอบมาตรฐานใด ๆ
สิ่งที่ต้องจับตานั้นง่าย และมันส่งผลได้สองทาง: คะแนน Conversational Dynamics สำหรับเสียงโปรดักชันของ Sesame หรือค่าความหน่วงของ StepAudio 3 Realtime ที่ทำให้มันอยู่ในช่วงเดียวกับโมเดลที่ปัจจุบันมันเอาชนะได้ในด้านคุณภาพ ไม่ว่าจะเป็นอันใดอันหนึ่ง สิ่งนี้จะเปลี่ยนจากการเปรียบเทียบระหว่างการวัดค่ากับชื่อเสียง ให้กลายเป็นการเปรียบเทียบแบบตัวต่อตัวจริง ๆ
