
HeyGen Voice vs Sesame Preview: เสียงที่คุณซื้อได้ กับเสียงที่คุณทำได้เพียงพูดคุยด้วย
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
นี่ไม่ใช่การเปรียบเทียบโมเดล และการแสร้งทำเป็นว่าเป็นเช่นนั้นก็จะเป็นความผิดพลาดจริงเพียงอย่างเดียวที่ทำได้ในที่นี้ HeyGen Voice เป็นเอนจิน API — อยู่ในอันดับหนึ่งในสนาม Controlled Voice ของ Artificial Analysis ด้วยคะแนน 1,202 Elo เปิดให้เข้าถึงผ่าน endpoint v3 ของ HeyGen ขายเป็นเครดิต และโคลนเสียงได้จากการอัดเสียงเพียงครั้งเดียว Sesame Preview เป็นผู้ช่วยเสียงสำหรับผู้ใช้ทั่วไปแบบฟรี ที่คุณเข้าถึงได้โดยเปิดหน้าเว็บและพูดกับหนึ่งในสี่เพอร์โซนาที่มีชื่อ โดยไม่มี endpoint สาธารณะ ไม่มีตัวระบุโมเดล และไม่มีราคาให้เช่าใช้ ตัวหนึ่งคุณนำไปใช้งานจริงได้ อีกตัวคือเหตุผลที่คุณรู้ว่าเสียงสนทนาที่ดีควรฟังเป็นอย่างไร และไม่เคยเป็นสิ่งที่คุณนำไปใช้งานจริงเลย
แต่ละอย่างจริงๆ แล้วคืออะไร
Sesame Preview เป็นการสาธิตการสนทนาด้วยเสียงพูด คุณเข้าถึงมันผ่านเว็บไซต์ของบริษัทเอง คุณพูดคุยกับ Maya, Miles, Simone หรือ Charlie และประสบการณ์นี้ถูกปรับแต่งอย่างจงใจเพื่อความเป็นมิตรและการแสดงออก — บริษัทกล่าวเช่นนั้นเมื่ออธิบายว่าทำไมเพื่อนเหล่านี้จึงมีพฤติกรรมเช่นนี้ ปัจจุบันมีเฉพาะภาษาอังกฤษเท่านั้น โดยทีมงานระบุว่าความสามารถหลายภาษาปรากฏขึ้นโดยบังเอิญจากการปนเปื้อนของข้อมูล และ "ยังทำงานได้ไม่ดีนัก" และการขยายเกินกว่ายี่สิบภาษาเป็นแผนในอนาคต กรอบของบริษัทเองเป็นงานที่อยู่ระหว่างดำเนินการ: "เรายังไปไม่ถึงตรงนั้น"
ภายใต้เดโมนั้นคือ Conversational Speech Model สถาปัตยกรรมแบบหลายรูปแบบที่รวมข้อความและเสียง ซึ่งสร้างจากทรานส์ฟอร์เมอร์สไตล์ Llama แบบออโตเรเกรสซีฟสองตัว โดยมีให้ใช้งานในสามขนาด — Tiny ที่มีแบ็กโบน 1B และเดโคเดอร์ 100M, Small ที่ 3B และ 250M, Medium ที่ 8B และ 300M — แต่ละขนาดถูกฝึกด้วยความยาวลำดับ 2,048 โทเคน ซึ่งประมาณสองนาทีของเสียง เป็นเวลาห้าอีพอคบนเสียงส่วนใหญ่ที่เป็นภาษาอังกฤษราวหนึ่งล้านชั่วโมง องค์ประกอบงานวิจัยหลักถูกเปิดเป็นโอเพนซอร์สภายใต้ Apache 2.0 และมีรีพอซิทอรี GitHub สำหรับสิ่งเหล่านั้น ส่วนเดโม — สิ่งที่ผู้คนยกย่องจริง ๆ — ไม่ใช่สิ่งนั้น เดโมไม่มี API สาธารณะ
HeyGen Voice คือรูปแบบที่กลับกัน ไม่มีแอปสำหรับผู้บริโภคฟรีให้ลองใช้ แต่มี API ที่มีเอกสารประกอบ พร้อมแค็ตตาล็อกเสียง จุดเชื่อมต่อสำหรับการพูด เส้นทางการโคลนเสียง และค่าใช้จ่าย สิ่งที่คุณทำไม่ได้คือเปิดมันในเบราว์เซอร์แล้วสนทนากับมันตามอำเภอใจ
ทำไมถึงยังเอาสองสิ่งนั้นมาเปรียบเทียบกันอยู่ดี
พวกมันถูกนำมาเปรียบเทียบกันเพราะทั้งคู่ถูกยกขึ้นมาเป็นหลักฐานว่าเสียงสังเคราะห์ได้ก้าวข้ามบางสิ่งบางอย่างไปแล้ว Sesame Preview รีเซ็ตความคาดหวังว่าออดิโอเชิงบทสนทนาจะฟังดูเป็นอย่างไรได้ — ปฏิกิริยาตอนที่มันเปิดตัวนั้นเกี่ยวกับว่ามันฟังดูเหมือนคนมากแค่ไหน มากกว่าจะเหมือนระบบแปลงข้อความเป็นเสียงพูด คะแนน 1,202 ของ HeyGen Voice บนบอร์ดแบบควบคุมคือข้ออ้างเดียวกันในรูปแบบตัวเลข: อันดับหนึ่งจากทั้งหมดสี่สิบสองรายการ เมื่อทุกโมเดลพูดด้วยเสียงอ้างอิงที่โคลนมาแปดเสียงเดียวกัน
ความแตกต่างอยู่ที่สิ่งที่คุณทำกับข้อกล่าวอ้างนั้นได้หลังจากนั้น ตำแหน่งบนบอร์ดสามารถทำซ้ำได้ ตรวจสอบได้ และผูกกับเอนด์พอยต์ ส่วนความประทับใจจากเดโมไม่เป็นสิ่งเหล่านั้นเลย — และที่สำคัญ Sesame Preview ไม่ปรากฏบนบอร์ดควบคุมเลย ดังนั้นจึงไม่มี Elo ให้เปรียบเทียบกับ 1,202 การเปรียบเทียบที่ผู้คนอยากทำนั้นไม่มีให้ทำ ไม่ใช่เพราะ Sesame แพ้มัน แต่เพราะโมเดลนี้ไม่เคยถูกส่งเข้าบอร์ดตั้งแต่แรก
กระดานคะแนน

• Elo เสียงแบบควบคุม — HeyGen Voice: 1,202, อันดับ 1 จาก 42 Sesame Preview: ไม่มีรายชื่อ
• การเข้าถึง — HeyGen Voice: API v3 ที่มีเอกสารประกอบ, POST /v3/voices/speech Sesame Preview: แอปเว็บสำหรับผู้บริโภคและแอป iOS; ไม่มี endpoint สาธารณะ
• ราคา — HeyGen Voice: $30.00 ต่อ 1 ล้านตัวอักษร โดยอิงจากการแปลงราคาเครดิตของ arena เอง; HeyGen ไม่เผยแพร่อัตราค่าบริการเสียง Sesame Preview: ฟรี และไม่สามารถซื้อได้ในราคาใด ๆ
• การเลือกเสียง — HeyGen Voice: เสียงสำเร็จรูปมากกว่า 300 เสียง การออกแบบเสียงด้วยคำบรรยาย การโคลนเสียงแบบทันใจและระดับมืออาชีพ Sesame Preview: บุคลิกเสียงคงที่สี่แบบ
• ภาษา — HeyGen Voice: "หลายสิบภาษา" จำนวนยังไม่เปิดเผย. Sesame Preview: ภาษาอังกฤษเท่านั้น โดยบริษัทเองยอมรับว่าการรองรับหลายภาษามีประสิทธิภาพต่ำในปัจจุบัน
• น้ำหนักแบบเปิด — HeyGen Voice: ไม่มี. Sesame Preview: CSM เผยแพร่ภายใต้ Apache 2.0 ในขนาด 1B, 3B และ 8B

รายละเอียด Apache 2.0 คือสิ่งที่สำคัญ
ภายใต้คำตัดสิน "ไม่มี API" มีข้อเท็จจริงที่ถูกฝังอยู่ นั่นคือ Sesame ได้เปิดซอร์สโมเดลงานวิจัยภายใต้ Apache 2.0 — สัญญาอนุญาตแบบผ่อนปรน ในสามขนาด โดยมีตัวแปร 1B ที่เล็กพอจะรันได้โดยไม่ต้องมีศูนย์ข้อมูล นั่นเป็นข้อเสนอที่แตกต่างจากเดโมอย่างแท้จริง และเป็นเส้นทางเดียวที่สิ่งที่คล้ายเสียงของ Sesame Preview จะไปอยู่ในผลิตภัณฑ์ที่วางจำหน่ายจริง
ข้อควรระวังสองประการทำให้เรื่องนี้ยังคงซื่อตรง คอมโพเนนต์ CSM ที่เผยแพร่นั้นเป็นชิ้นงานวิจัย: บริษัทระบุว่าโมเดลเหล่านี้จัดการเนื้อหาคำพูดได้ แต่ไม่จัดการโครงสร้างบทสนทนา และชี้ไปที่โมเดลแบบฟุลดูเพล็กซ์เต็มรูปแบบในฐานะงานในอนาคต — ดังนั้นเวตที่เผยแพร่จึงไม่ใช่ประสบการณ์แบบอินเทอร์แอกทีฟ และการรันแบ็กโบน 8B ในเครื่องก็มีโครงสร้างต้นทุนที่แตกต่างจาก $19.30 ต่อล้านตัวอักษรสำหรับการประมวลผลแบบโฮสต์ ซึ่งเป็นราคาที่คู่แข่งระดับท็อปที่ถูกที่สุดบนอารีนาคิด การโฮสต์เองไม่มีบิลต่อตัวอักษร แต่มีบิลต่อชั่วโมง GPU ที่เป็นของจริงอย่างยิ่ง
สำหรับนักพัฒนา สิ่งนี้ทำให้กรอบคำถามเปลี่ยนไป ถ้าสิ่งที่ทำให้คุณประทับใจใน Sesame Preview คือการสนทนา เวตแบบเปิดไม่ได้ให้สิ่งนั้นกับคุณ ถ้าสิ่งที่ทำให้คุณประทับใจคือคุณภาพเสียงของโมเดลเสียงพูดเอง เวตเหล่านั้นอาจให้ได้ — และนั่นเป็นสิ่งที่ทดสอบได้ในแบบที่เดโมทำไม่ได้
การจัดส่งบน HeyGen Voice มีหน้าตาเป็นอย่างไร
ความแตกต่างในทางปฏิบัติก็เป็นเรื่องธรรมดา API ของ HeyGen รับการเลือกเสียง ข้อความ และไม่บังคับ ความเร็ว ระหว่าง 0.5 ถึง 1.5 และ ระดับเสียง ในช่วง ±50 เซมิโทน พร้อมกับ BCP-47 โลแคล คำแนะนำ เสียงที่กำหนดเองมีสามวิธี: เส้นทางการออกแบบที่ขับเคลื่อนด้วยคำอธิบายซึ่งส่งคืนตัวเลือกที่จัดอันดับได้สูงสุดสามรายการจากพรอมต์ที่จำกัดไว้ที่ 1,000 ตัวอักษร การโคลนแบบทันทีจากการบันทึกหนึ่งครั้ง และการโคลนระดับมืออาชีพที่ฝึกฝนจากยี่สิบนาทีขึ้นไป. เอนจิน ฟิลเตอร์บนเอนด์พอยต์ voices ยังรองรับเอนจินที่ไม่ใช่ HeyGen ดังนั้นแพลตฟอร์มจึงไม่ใช่สวนปิดล้อมรอบโมเดลของตัวเอง
ไม่มีสิ่งเหล่านั้นอยู่ในฝั่ง Sesame และมันไม่ใช่จุดบกพร่องของ Sesame Preview — มันเป็นอย่างที่มันเป็น เดโมที่ปรับมาเพื่อแสดงให้เห็นว่าอะไรเป็นไปได้ไม่ควรมี SLA
อย่างไรก็ตาม ค่าใช้จ่ายเป็นส่วนที่เบากว่า HeyGen ขายเครดิต — 600 เครดิตในราคา $29/เดือน, 1,000 เครดิตในราคา $49, 1,500 เครดิตในราคา $149 — และระบุว่าปริมาณการใช้แตกต่างกันไปตามโมเดล ระยะเวลา และความซับซ้อน โดยไม่เปิดเผยอัตราค่าบริการเสียง $30.00 ต่อล้านตัวอักษรที่ arena ระบุไว้คือการแปลงเครดิตเหล่านั้นของ Artificial Analysis ไม่ใช่ใบเสนอราคาจาก HeyGen ดังนั้นโมเดลที่คุณนำไปใช้งานได้นั้นมีราคาแล้ว แต่เป็นราคาที่อิงการคำนวณของคนอื่น — ซึ่งเป็นข้อสนับสนุนให้ทำการนำร่องแบบวัดผล มากกว่าจะเป็นการวิจารณ์ตัวเอนจิน

สิ่งที่ควรทำจริง ๆ กับเดโมที่คุณชื่นชม
สิ่งที่มีประโยชน์คือการแยกสองสิ่งที่ Sesame Preview สาธิตให้เห็นออกจากกัน พฤติกรรมการสนทนา — การผลัดกันพูด ความจำ และความรู้สึกว่ากำลังคุยกับใครสักคน — เป็นผลผลิตของระบบที่ยังไม่เปิดตัวและยังไม่มีเอนด์พอยต์ ส่วนคุณภาพเสียงคือส่วนที่มีเวตโมเดลภายใต้ Apache 2.0 หนุนอยู่เบื้องหลัง และเป็นส่วนที่คุณประเมินได้บนเสียงของคุณเองโดยไม่ต้องขออนุญาตจากใคร
สำหรับทุกสิ่งในระหว่างนั้น เส้นทางการย้ายระบบก็เป็นแบบธรรมดา ๆ นั่นเอง: ปล่อยบนเอนจินที่มี API และมีอันดับ และออกแบบให้การนำโมเดลของ Sesame มาใช้ หากวันหนึ่งมันวางจำหน่ายเชิงพาณิชย์ เป็นเพียงการเปลี่ยนการตั้งค่า ไม่ใช่การเขียนใหม่ทั้งหมด นั่นหมายถึงการมีชั้นนามธรรมเหนือผู้ให้บริการเสียงตั้งแต่วันแรก — อินเทอร์เฟซเดียว คีย์เดียว เลือกเอนจินผ่านการตั้งค่า ชั้นการกำหนดเส้นทางของ OrcaRouter ถูกสร้างมาเพื่อสิ่งนี้โดยเฉพาะ: ผู้ให้บริการหลายรายอยู่เบื้องหลังปลายทางเดียว ในราคาตามที่ผู้ให้บริการประกาศโดยไม่บวกเพิ่ม การสลับไปใช้รายอื่นอัตโนมัติเมื่อผู้ขายหยุดชะงัก และ DSL สำหรับการกำหนดเส้นทางที่ให้คุณสลับเอนจินเบื้องหลังเสียงหนึ่ง ๆ ได้โดยไม่ต้องแตะโค้ดแอปพลิเคชัน ประเด็นไม่ใช่ว่ามันโฮสต์โมเดล Sesame อยู่ — มันไม่ได้โฮสต์ — แต่คือวันที่เสียงที่คุณชื่นชอบกลายเป็นสิ่งที่ซื้อได้ ค่าใช้จ่ายในการลองมันควรเป็นแค่บรรทัดเดียวในไฟล์การตั้งค่า
การปิดที่ซื่อสัตย์
Sesame Preview ไม่ใช่คู่แข่งของ HeyGen Voice และไม่ควรถูกประเมินในฐานะคู่แข่ง มันเป็นการสาธิตแบบสี่ persona ที่ฟรี ใช้ภาษาอังกฤษเท่านั้น ซึ่งบังเอิญได้รีเซ็ตความคาดหวังสำหรับเสียงสนทนา และบังเอิญได้เผยแพร่น้ำหนักการวิจัยที่ได้รับอนุญาตแบบ permissive ในสามขนาด HeyGen Voice เป็นเครื่องยนต์ที่ติดอันดับสูงสุดบน leaderboard เสียงพูดแห่งเดียวที่รักษาเสียงให้คงที่ ขายผ่าน API ที่คุณสามารถเรียกใช้ได้วันนี้ ในราคาที่คุณยังไม่สามารถคำนวณได้
หากคุณต้องการเสียงที่สามารถเปิดตัวได้ในไตรมาสนี้ การตัดสินใจไม่ได้อยู่ระหว่างสองตัวนี้ — แต่อยู่ระหว่าง HeyGen Voice กับเอนจินที่มีราคาอื่น ๆ บนอารีนา หากคุณกำลังรอ Sesame อยู่ ให้รอที่เวท ไม่ใช่ที่แอป
