การ์ดฮีโร่ที่สร้างขึ้นชื่อ 'HeyGen Voice vs Sesame Preview' เปรียบเทียบ API คำพูดที่มีเอกสารประกอบซึ่งมีค่า Elo ที่วัดได้ กับเดโมสำหรับผู้บริโภคที่ไม่มีจุดเชื่อมต่อสาธารณะ โดยระบุวันที่จาก Artificial Analysis คือ 9 ตุลาคม 2026 โลโก้ OrcaRouter ปรากฏที่มุมขวาล่าง
Guides & Insights

HeyGen Voice vs Sesame Preview: เสียงที่คุณซื้อได้ กับเสียงที่คุณทำได้เพียงพูดคุยด้วย

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

นี่ไม่ใช่การเปรียบเทียบโมเดล และการแสร้งทำเป็นว่าเป็นเช่นนั้นก็จะเป็นความผิดพลาดจริงเพียงอย่างเดียวที่ทำได้ในที่นี้ HeyGen Voice เป็นเอนจิน API — อยู่ในอันดับหนึ่งในสนาม Controlled Voice ของ Artificial Analysis ด้วยคะแนน 1,202 Elo เปิดให้เข้าถึงผ่าน endpoint v3 ของ HeyGen ขายเป็นเครดิต และโคลนเสียงได้จากการอัดเสียงเพียงครั้งเดียว Sesame Preview เป็นผู้ช่วยเสียงสำหรับผู้ใช้ทั่วไปแบบฟรี ที่คุณเข้าถึงได้โดยเปิดหน้าเว็บและพูดกับหนึ่งในสี่เพอร์โซนาที่มีชื่อ โดยไม่มี endpoint สาธารณะ ไม่มีตัวระบุโมเดล และไม่มีราคาให้เช่าใช้ ตัวหนึ่งคุณนำไปใช้งานจริงได้ อีกตัวคือเหตุผลที่คุณรู้ว่าเสียงสนทนาที่ดีควรฟังเป็นอย่างไร และไม่เคยเป็นสิ่งที่คุณนำไปใช้งานจริงเลย

แต่ละอย่างจริงๆ แล้วคืออะไร

Sesame Preview เป็นการสาธิตการสนทนาด้วยเสียงพูด คุณเข้าถึงมันผ่านเว็บไซต์ของบริษัทเอง คุณพูดคุยกับ Maya, Miles, Simone หรือ Charlie และประสบการณ์นี้ถูกปรับแต่งอย่างจงใจเพื่อความเป็นมิตรและการแสดงออก — บริษัทกล่าวเช่นนั้นเมื่ออธิบายว่าทำไมเพื่อนเหล่านี้จึงมีพฤติกรรมเช่นนี้ ปัจจุบันมีเฉพาะภาษาอังกฤษเท่านั้น โดยทีมงานระบุว่าความสามารถหลายภาษาปรากฏขึ้นโดยบังเอิญจากการปนเปื้อนของข้อมูล และ "ยังทำงานได้ไม่ดีนัก" และการขยายเกินกว่ายี่สิบภาษาเป็นแผนในอนาคต กรอบของบริษัทเองเป็นงานที่อยู่ระหว่างดำเนินการ: "เรายังไปไม่ถึงตรงนั้น"

ภายใต้เดโมนั้นคือ Conversational Speech Model สถาปัตยกรรมแบบหลายรูปแบบที่รวมข้อความและเสียง ซึ่งสร้างจากทรานส์ฟอร์เมอร์สไตล์ Llama แบบออโตเรเกรสซีฟสองตัว โดยมีให้ใช้งานในสามขนาด — Tiny ที่มีแบ็กโบน 1B และเดโคเดอร์ 100M, Small ที่ 3B และ 250M, Medium ที่ 8B และ 300M — แต่ละขนาดถูกฝึกด้วยความยาวลำดับ 2,048 โทเคน ซึ่งประมาณสองนาทีของเสียง เป็นเวลาห้าอีพอคบนเสียงส่วนใหญ่ที่เป็นภาษาอังกฤษราวหนึ่งล้านชั่วโมง องค์ประกอบงานวิจัยหลักถูกเปิดเป็นโอเพนซอร์สภายใต้ Apache 2.0 และมีรีพอซิทอรี GitHub สำหรับสิ่งเหล่านั้น ส่วนเดโม — สิ่งที่ผู้คนยกย่องจริง ๆ — ไม่ใช่สิ่งนั้น เดโมไม่มี API สาธารณะ

HeyGen Voice คือรูปแบบที่กลับกัน ไม่มีแอปสำหรับผู้บริโภคฟรีให้ลองใช้ แต่มี API ที่มีเอกสารประกอบ พร้อมแค็ตตาล็อกเสียง จุดเชื่อมต่อสำหรับการพูด เส้นทางการโคลนเสียง และค่าใช้จ่าย สิ่งที่คุณทำไม่ได้คือเปิดมันในเบราว์เซอร์แล้วสนทนากับมันตามอำเภอใจ

ทำไมถึงยังเอาสองสิ่งนั้นมาเปรียบเทียบกันอยู่ดี

พวกมันถูกนำมาเปรียบเทียบกันเพราะทั้งคู่ถูกยกขึ้นมาเป็นหลักฐานว่าเสียงสังเคราะห์ได้ก้าวข้ามบางสิ่งบางอย่างไปแล้ว Sesame Preview รีเซ็ตความคาดหวังว่าออดิโอเชิงบทสนทนาจะฟังดูเป็นอย่างไรได้ — ปฏิกิริยาตอนที่มันเปิดตัวนั้นเกี่ยวกับว่ามันฟังดูเหมือนคนมากแค่ไหน มากกว่าจะเหมือนระบบแปลงข้อความเป็นเสียงพูด คะแนน 1,202 ของ HeyGen Voice บนบอร์ดแบบควบคุมคือข้ออ้างเดียวกันในรูปแบบตัวเลข: อันดับหนึ่งจากทั้งหมดสี่สิบสองรายการ เมื่อทุกโมเดลพูดด้วยเสียงอ้างอิงที่โคลนมาแปดเสียงเดียวกัน

ความแตกต่างอยู่ที่สิ่งที่คุณทำกับข้อกล่าวอ้างนั้นได้หลังจากนั้น ตำแหน่งบนบอร์ดสามารถทำซ้ำได้ ตรวจสอบได้ และผูกกับเอนด์พอยต์ ส่วนความประทับใจจากเดโมไม่เป็นสิ่งเหล่านั้นเลย — และที่สำคัญ Sesame Preview ไม่ปรากฏบนบอร์ดควบคุมเลย ดังนั้นจึงไม่มี Elo ให้เปรียบเทียบกับ 1,202 การเปรียบเทียบที่ผู้คนอยากทำนั้นไม่มีให้ทำ ไม่ใช่เพราะ Sesame แพ้มัน แต่เพราะโมเดลนี้ไม่เคยถูกส่งเข้าบอร์ดตั้งแต่แรก

กระดานคะแนน

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Elo เสียงแบบควบคุม — HeyGen Voice: 1,202, อันดับ 1 จาก 42 Sesame Preview: ไม่มีรายชื่อ

• การเข้าถึง — HeyGen Voice: API v3 ที่มีเอกสารประกอบ, POST /v3/voices/speech Sesame Preview: แอปเว็บสำหรับผู้บริโภคและแอป iOS; ไม่มี endpoint สาธารณะ

• ราคา — HeyGen Voice: $30.00 ต่อ 1 ล้านตัวอักษร โดยอิงจากการแปลงราคาเครดิตของ arena เอง; HeyGen ไม่เผยแพร่อัตราค่าบริการเสียง Sesame Preview: ฟรี และไม่สามารถซื้อได้ในราคาใด ๆ

• การเลือกเสียง — HeyGen Voice: เสียงสำเร็จรูปมากกว่า 300 เสียง การออกแบบเสียงด้วยคำบรรยาย การโคลนเสียงแบบทันใจและระดับมืออาชีพ Sesame Preview: บุคลิกเสียงคงที่สี่แบบ

• ภาษา — HeyGen Voice: "หลายสิบภาษา" จำนวนยังไม่เปิดเผย. Sesame Preview: ภาษาอังกฤษเท่านั้น โดยบริษัทเองยอมรับว่าการรองรับหลายภาษามีประสิทธิภาพต่ำในปัจจุบัน

• น้ำหนักแบบเปิด — HeyGen Voice: ไม่มี. Sesame Preview: CSM เผยแพร่ภายใต้ Apache 2.0 ในขนาด 1B, 3B และ 8B

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

รายละเอียด Apache 2.0 คือสิ่งที่สำคัญ

ภายใต้คำตัดสิน "ไม่มี API" มีข้อเท็จจริงที่ถูกฝังอยู่ นั่นคือ Sesame ได้เปิดซอร์สโมเดลงานวิจัยภายใต้ Apache 2.0 — สัญญาอนุญาตแบบผ่อนปรน ในสามขนาด โดยมีตัวแปร 1B ที่เล็กพอจะรันได้โดยไม่ต้องมีศูนย์ข้อมูล นั่นเป็นข้อเสนอที่แตกต่างจากเดโมอย่างแท้จริง และเป็นเส้นทางเดียวที่สิ่งที่คล้ายเสียงของ Sesame Preview จะไปอยู่ในผลิตภัณฑ์ที่วางจำหน่ายจริง

ข้อควรระวังสองประการทำให้เรื่องนี้ยังคงซื่อตรง คอมโพเนนต์ CSM ที่เผยแพร่นั้นเป็นชิ้นงานวิจัย: บริษัทระบุว่าโมเดลเหล่านี้จัดการเนื้อหาคำพูดได้ แต่ไม่จัดการโครงสร้างบทสนทนา และชี้ไปที่โมเดลแบบฟุลดูเพล็กซ์เต็มรูปแบบในฐานะงานในอนาคต — ดังนั้นเวตที่เผยแพร่จึงไม่ใช่ประสบการณ์แบบอินเทอร์แอกทีฟ และการรันแบ็กโบน 8B ในเครื่องก็มีโครงสร้างต้นทุนที่แตกต่างจาก $19.30 ต่อล้านตัวอักษรสำหรับการประมวลผลแบบโฮสต์ ซึ่งเป็นราคาที่คู่แข่งระดับท็อปที่ถูกที่สุดบนอารีนาคิด การโฮสต์เองไม่มีบิลต่อตัวอักษร แต่มีบิลต่อชั่วโมง GPU ที่เป็นของจริงอย่างยิ่ง

สำหรับนักพัฒนา สิ่งนี้ทำให้กรอบคำถามเปลี่ยนไป ถ้าสิ่งที่ทำให้คุณประทับใจใน Sesame Preview คือการสนทนา เวตแบบเปิดไม่ได้ให้สิ่งนั้นกับคุณ ถ้าสิ่งที่ทำให้คุณประทับใจคือคุณภาพเสียงของโมเดลเสียงพูดเอง เวตเหล่านั้นอาจให้ได้ — และนั่นเป็นสิ่งที่ทดสอบได้ในแบบที่เดโมทำไม่ได้

การจัดส่งบน HeyGen Voice มีหน้าตาเป็นอย่างไร

ความแตกต่างในทางปฏิบัติก็เป็นเรื่องธรรมดา API ของ HeyGen รับการเลือกเสียง ข้อความ และไม่บังคับ ความเร็ว ระหว่าง 0.5 ถึง 1.5 และ ระดับเสียง ในช่วง ±50 เซมิโทน พร้อมกับ BCP-47 โลแคล คำแนะนำ เสียงที่กำหนดเองมีสามวิธี: เส้นทางการออกแบบที่ขับเคลื่อนด้วยคำอธิบายซึ่งส่งคืนตัวเลือกที่จัดอันดับได้สูงสุดสามรายการจากพรอมต์ที่จำกัดไว้ที่ 1,000 ตัวอักษร การโคลนแบบทันทีจากการบันทึกหนึ่งครั้ง และการโคลนระดับมืออาชีพที่ฝึกฝนจากยี่สิบนาทีขึ้นไป. เอนจิน ฟิลเตอร์บนเอนด์พอยต์ voices ยังรองรับเอนจินที่ไม่ใช่ HeyGen ดังนั้นแพลตฟอร์มจึงไม่ใช่สวนปิดล้อมรอบโมเดลของตัวเอง

ไม่มีสิ่งเหล่านั้นอยู่ในฝั่ง Sesame และมันไม่ใช่จุดบกพร่องของ Sesame Preview — มันเป็นอย่างที่มันเป็น เดโมที่ปรับมาเพื่อแสดงให้เห็นว่าอะไรเป็นไปได้ไม่ควรมี SLA

อย่างไรก็ตาม ค่าใช้จ่ายเป็นส่วนที่เบากว่า HeyGen ขายเครดิต — 600 เครดิตในราคา $29/เดือน, 1,000 เครดิตในราคา $49, 1,500 เครดิตในราคา $149 — และระบุว่าปริมาณการใช้แตกต่างกันไปตามโมเดล ระยะเวลา และความซับซ้อน โดยไม่เปิดเผยอัตราค่าบริการเสียง $30.00 ต่อล้านตัวอักษรที่ arena ระบุไว้คือการแปลงเครดิตเหล่านั้นของ Artificial Analysis ไม่ใช่ใบเสนอราคาจาก HeyGen ดังนั้นโมเดลที่คุณนำไปใช้งานได้นั้นมีราคาแล้ว แต่เป็นราคาที่อิงการคำนวณของคนอื่น — ซึ่งเป็นข้อสนับสนุนให้ทำการนำร่องแบบวัดผล มากกว่าจะเป็นการวิจารณ์ตัวเอนจิน

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

สิ่งที่ควรทำจริง ๆ กับเดโมที่คุณชื่นชม

สิ่งที่มีประโยชน์คือการแยกสองสิ่งที่ Sesame Preview สาธิตให้เห็นออกจากกัน พฤติกรรมการสนทนา — การผลัดกันพูด ความจำ และความรู้สึกว่ากำลังคุยกับใครสักคน — เป็นผลผลิตของระบบที่ยังไม่เปิดตัวและยังไม่มีเอนด์พอยต์ ส่วนคุณภาพเสียงคือส่วนที่มีเวตโมเดลภายใต้ Apache 2.0 หนุนอยู่เบื้องหลัง และเป็นส่วนที่คุณประเมินได้บนเสียงของคุณเองโดยไม่ต้องขออนุญาตจากใคร

สำหรับทุกสิ่งในระหว่างนั้น เส้นทางการย้ายระบบก็เป็นแบบธรรมดา ๆ นั่นเอง: ปล่อยบนเอนจินที่มี API และมีอันดับ และออกแบบให้การนำโมเดลของ Sesame มาใช้ หากวันหนึ่งมันวางจำหน่ายเชิงพาณิชย์ เป็นเพียงการเปลี่ยนการตั้งค่า ไม่ใช่การเขียนใหม่ทั้งหมด นั่นหมายถึงการมีชั้นนามธรรมเหนือผู้ให้บริการเสียงตั้งแต่วันแรก — อินเทอร์เฟซเดียว คีย์เดียว เลือกเอนจินผ่านการตั้งค่า ชั้นการกำหนดเส้นทางของ OrcaRouter ถูกสร้างมาเพื่อสิ่งนี้โดยเฉพาะ: ผู้ให้บริการหลายรายอยู่เบื้องหลังปลายทางเดียว ในราคาตามที่ผู้ให้บริการประกาศโดยไม่บวกเพิ่ม การสลับไปใช้รายอื่นอัตโนมัติเมื่อผู้ขายหยุดชะงัก และ DSL สำหรับการกำหนดเส้นทางที่ให้คุณสลับเอนจินเบื้องหลังเสียงหนึ่ง ๆ ได้โดยไม่ต้องแตะโค้ดแอปพลิเคชัน ประเด็นไม่ใช่ว่ามันโฮสต์โมเดล Sesame อยู่ — มันไม่ได้โฮสต์ — แต่คือวันที่เสียงที่คุณชื่นชอบกลายเป็นสิ่งที่ซื้อได้ ค่าใช้จ่ายในการลองมันควรเป็นแค่บรรทัดเดียวในไฟล์การตั้งค่า

การปิดที่ซื่อสัตย์

Sesame Preview ไม่ใช่คู่แข่งของ HeyGen Voice และไม่ควรถูกประเมินในฐานะคู่แข่ง มันเป็นการสาธิตแบบสี่ persona ที่ฟรี ใช้ภาษาอังกฤษเท่านั้น ซึ่งบังเอิญได้รีเซ็ตความคาดหวังสำหรับเสียงสนทนา และบังเอิญได้เผยแพร่น้ำหนักการวิจัยที่ได้รับอนุญาตแบบ permissive ในสามขนาด HeyGen Voice เป็นเครื่องยนต์ที่ติดอันดับสูงสุดบน leaderboard เสียงพูดแห่งเดียวที่รักษาเสียงให้คงที่ ขายผ่าน API ที่คุณสามารถเรียกใช้ได้วันนี้ ในราคาที่คุณยังไม่สามารถคำนวณได้

หากคุณต้องการเสียงที่สามารถเปิดตัวได้ในไตรมาสนี้ การตัดสินใจไม่ได้อยู่ระหว่างสองตัวนี้ — แต่อยู่ระหว่าง HeyGen Voice กับเอนจินที่มีราคาอื่น ๆ บนอารีนา หากคุณกำลังรอ Sesame อยู่ ให้รอที่เวท ไม่ใช่ที่แอป

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube