การ์ดฮีโร่ที่สร้างขึ้นซึ่งมีชื่อว่า 'HeyGen Voice เปิดตัวอันดับ 1 บน Controlled Voice Arena' พร้อมบรรทัด '1,202 Elo — นำหน้า Qwen-Audio-3.1-TTS-Plus และ Eleven v4 Turbo' และหมายเหตุ 'เสียงอ้างอิงที่โคลนมาแปดเสียงชุดเดียวกัน — Artificial Analysis, 9 ต.ค. 2026' โลโก้ OrcaRouter ปรากฏที่มุมขวาล่าง
Guides & Insights

HeyGen Voice เปิดตัวในอันดับ 1 บน Controlled Voice TTS Arena — เอาชนะ Qwen และ ElevenLabs ในหมวดการโคลนเสียง

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 9 ตุลาคม 2026 Artificial Analysis ได้เพิ่ม HeyGen Voice เข้าใน Controlled Voice arena ของตน และโมเดลนี้ก็ขึ้นไปอยู่อันดับสูงสุดทันที HeyGen Voice — โมเดลแปลงข้อความเป็นเสียงตัวแรกจาก HeyGen ที่ได้รับการประเมินบนบอร์ด — ทำคะแนนได้ 1,202 Elo นำหน้า Qwen-Audio-3.1-TTS-Plus ที่ 1,186 และ Eleven v4 Turbo ของ ElevenLabs ที่ 1,167 Cartesia Sonic 3.6 ซึ่งครองอันดับหนึ่งในบอร์ด Provider Voices แบบเปิดของเว็บไซต์ อยู่อันดับห้าในที่นี้ที่ 1,143 นั่นเป็นผลลัพธ์ที่แท้จริงบนลีดเดอร์บอร์ดที่สร้างขึ้นเพื่อขจัดปัจจัยรบกวนที่ใหญ่ที่สุดเพียงหนึ่งเดียวในการประเมินเสียง และยังเป็นผลลัพธ์ที่มีความหมายเฉพาะเจาะจงมากซึ่งตีความเกินเลยได้ง่าย: HeyGen Voice เป็นเสียงที่ดีที่สุดในสนามนี้จากเสียงอ้างอิงที่โคลนมาแปดเสียง ยังไม่ใช่แชมป์ที่ผ่านการวัดแล้วของบอร์ดที่มีเก้าสิบหกโมเดล

สิ่งที่บอร์ด Controlled Voice วัด และเหตุใดจึงสำคัญ

Artificial Analysis ดำเนินการบอร์ดเสียงพูดสองบอร์ด และทั้งสองตอบคำถามที่แตกต่างกัน โดยสนามแข่ง Provider Voices เปิดให้ผู้ให้บริการแต่ละรายส่งเสียงเนทีฟของตนเอง — เสียงเดโมที่ขัดเกลาแล้วซึ่งบริษัทเลือกมาเป็นตัวแทนของตนเอง — และจัดอันดับโมเดลตามคุณภาพของเสียงเหล่านั้น ลีดเดอร์บอร์ดของมันกว้างขวางและสมบูรณ์: มีเก้าสิบหกรายการ โดย Eleven v4 Turbo อยู่อันดับสูงสุดที่ 1,328 Elo และ Cartesia Sonic 3.6 อยู่อันดับสี่ที่ 1,280

สนาม Controlled Voice ทำสิ่งที่แคบกว่าและมีประโยชน์กว่าสำหรับใครก็ตามที่นำผลิตภัณฑ์ออกจำหน่าย ทุกโมเดลบนนั้นสร้างเสียงพูดจากเสียงโคลนแปดเสียงเดียวกัน — สหรัฐฯ 4 เสียง สหราชอาณาจักร 4 เสียง — ดังนั้นการเปรียบเทียบจึงไม่ใช่ "เสียงการตลาดของใครดีกว่า" แต่เป็น "แต่ละเอนจินจัดการกับเสียงเดียวกัน ข้อความเดียวกัน และเงื่อนไขการบันทึกเดียวกันได้อย่างไร" มันเป็นสิ่งที่ใกล้เคียงที่สุดที่อุตสาหกรรมมีต่อการทดสอบเอนจินแบบเทียบเคียงกัน มากกว่าการดูเดโม และมันเป็นกระดานที่สำคัญหากคุณวางแผนจะโคลนเสียงและป้อนให้โมเดล TTS

ตอนนี้ HeyGen Voice ขึ้นนำแล้ว ส่วนต่างอยู่ที่ 16 Elo เหนือ Qwen-Audio-3.1-TTS-Plus และ 35 เหนือ Eleven v4 Turbo โดยมีช่วงความเชื่อมั่น 95% ที่รายงานไว้ประมาณ 1,185 ถึง 1,219 สำหรับค่าของ HeyGen สิบหก Elo เป็นช่องว่างจริง แต่ไม่ใช่เหว — บนลีดเดอร์บอร์ดที่แน่นขนาดนี้ มันคือความต่างระหว่างอันดับหนึ่งกับอันดับสอง ไม่ใช่ระหว่างใช้ได้กับใช้ไม่ได้

A generated single-column scoreboard titled 'HeyGen Voice — the scoreboard' with rows reading 'Controlled Voice Elo: 1,202', '95% confidence interval: roughly 1,185 to 1,219', 'Rank in the controlled field: #1 of 42 ranked entries', 'Provider Voices Elo: not listed, insufficient votes', "Price on the arena's basis: $30.00 per 1M characters, derived from credit pricing" and 'Elo anchor: the board baseline is 1,000 points', with a footer reading 'Elo per Artificial Analysis, 9 October 2026. Price shown is the arena's conversion of credit pricing.' The OrcaRouter logo appears in the bottom-right corner.

ที่ที่ HeyGen Voice ยังไม่ได้รับการจัดอันดับ

แง่มุมที่ตรงไปตรงมาของผลลัพธ์นี้คือ HeyGen Voice ไม่ปรากฏอยู่บนบอร์ด Provider Voices เลย และการที่มันหายไปก็ไม่ใช่สัญญาณเกี่ยวกับคุณภาพ Artificial Analysis ระบุว่าโมเดลอาจถูกตัดออกได้เนื่องจากยังมีคะแนนโหวตไม่มากพอ โมเดลที่เพิ่งมีอายุเพียงไม่กี่วัน โดยมีอารีนาที่ให้คะแนนต่างออกไปเพียงแห่งเดียวอยู่เบื้องหลัง ก็ยังไม่ได้สะสมปริมาณผู้ฟังแบบไม่รู้ว่าเป็นโมเดลใดมากพอตามที่บอร์ดที่ใหญ่กว่าต้องการ

ดังนั้น การตีความที่ถูกต้อง ณ วันที่ 10 ตุลาคม 2026 คือ: HeyGen Voice เป็นเสียงที่ได้อันดับสูงสุดในการเปรียบเทียบเสียงโคลนแบบควบคุม และเป็นตัวแปรที่ยังไม่ทราบค่าเมื่อเทียบกับสนามที่กว้างกว่า ใครก็ตามที่ยกคำว่า "โมเดล TTS ที่ดีที่สุดในโลก" มาจากตัวเลขนี้ กำลังอ้างอิงจากกระดานคะแนนที่เล็กกว่าที่ประโยคนี้สื่อ

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing the ranked model list with Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, alongside samples, release dates and API pricing columns and 8-voice arena badges.

ตัวเลขสองตัวที่อยู่เบื้องหลัง Elo

• Controlled Voice Elo — HeyGen Voice: 1,202 (ช่วงความเชื่อมั่น 95% ประมาณ 1,185–1,219) Qwen-Audio-3.1-TTS-Plus: 1,186 Eleven v4 Turbo: 1,167

• Provider Voices Elo — HeyGen Voice: ไม่ปรากฏในรายการ (คะแนนโหวตไม่เพียงพอ) Eleven v4 Turbo: 1,328 ที่อันดับ 1 Sonic 3.6: 1,280 ที่อันดับ 4

• อันดับในกลุ่มเปรียบเทียบที่ควบคุม — HeyGen Voice: ที่ 1 จาก 42 รายการที่ได้รับการจัดอันดับ (อันดับที่ 42 คือ OpenVoice v2 ที่ 812)

• ราคาตามเกณฑ์ของอารีนา — HeyGen Voice: 30.00 ดอลลาร์ต่อ 1 ล้านตัวอักษร ซึ่งเป็นการแปลงราคาเครดิตของ HeyGen ตามเกณฑ์ของอารีนาเอง Qwen-Audio-3.1-TTS-Plus: 19.30 ดอลลาร์ต่อ 1 ล้านตัวอักษร Eleven v4 Turbo: 40.00 ดอลลาร์ต่อ 1 ล้านตัวอักษร

• จุดอ้างอิง Elo — OpenAudio S1 เป็นจุดอ้างอิงคงที่ที่ 1,000 ดังนั้น HeyGen Voice จึงสูงกว่าจุดอ้างอิงอยู่ 202 คะแนน

• ใครอีกที่อยู่ในห้าอันดับแรก — Eleven v4 ที่ 1,160 และ Sonic 3.6 ที่ 1,143 ปิดท้ายห้าอันดับแรกตามหลังผู้นำ

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech, above the Realtime Video and Avatar Management groups.

สิ่งที่ HeyGen เปิดตัวจริง ๆ

เอนจินที่อยู่เบื้องหลังรายการนี้คือ TTS ภายในของ HeyGen ซึ่งเปิดให้ใช้ใน API v3 ของบริษัท GET /v3/voices เป็นการเรียกที่ใช้engine เป็นตัวกรองที่มีค่ารวมถึง orca — เอนจินเสียงของ HeyGen เอง — ควบคู่กับ starfish และการส่งผ่านไปยังเสียงของ ElevenLabs การเรนเดอร์เสียงทำงานผ่าน POST /v3/voices/speech; การปรับแต่งต่อคำขอเปิดให้ตั้งค่า speed ตั้งแต่ 0.5 ถึง 1.5 และ pitch ตั้งแต่ −50 ถึง +50 เซมิโทน โดยมี BCP-47 locale เป็นคำใบ้.

แคตตาล็อกระบุว่ามีเสียงสำเร็จรูปมากกว่า 300 เสียงในหลายสิบภาษา เสียงกำหนดเองมีสามรูปแบบ ได้แก่ การออกแบบเสียงจากข้อความที่สร้างตัวเลือกจัดอันดับได้สูงสุดสามแบบจากคำอธิบายที่จำกัดความยาวไว้ที่ 1,000 ตัวอักษร การโคลนแบบทันทีจากการบันทึกเพียงครั้งเดียว และการโคลนระดับมืออาชีพที่ฝึกจากเสียงความยาวยี่สิบนาทีขึ้นไป อันสุดท้ายนี้คือส่วนที่กระดานผู้นำ Controlled Voice กำลังทดสอบขีดจำกัดอย่างแท้จริง — เสียงอ้างอิงแปดเสียงนั้นเป็นเสียงโคลน และคุณภาพของเสียงโคลนคือจุดที่เครื่องยนต์ TTS แยกความแตกต่างออกจากกัน

เอนจินยังถูกระบุในเอกสารว่าเลือกได้แยกตามเสียง ซึ่งหมายความว่า HeyGen ไม่ได้บังคับให้คุณใช้โมเดลของตัวเอง: คุณสามารถส่งต่อไปยังเอนจินเสียงของบุคคลที่สามผ่าน API ของมันได้ หากคุณชอบตัวไหนมากกว่า นั่นคือการที่ผู้ขายป้องกันความเสี่ยงให้โมเดลของตัวเอง และเป็นสิ่งที่ควรรู้เมื่อคุณอ่านคำกล่าวอ้าง "#1 voice" เกี่ยวกับ HeyGen

การเปลี่ยนแปลงนี้ส่งผลอย่างไรกับใครก็ตามที่เลือกเสียง

เมื่อผลลัพธ์จากการควบคุมโทนเสียงเกิดขึ้นจริง ย่อมมีผลในทางปฏิบัติตามมาสามประการ และไม่มีข้อใดในนั้นเลยที่เป็นการ "เปลี่ยนทุกอย่าง"

อย่างแรก ถ้ากรณีการใช้งานของคุณคือเสียงแบรนด์แบบโคลน — ผู้พูดคนเดียว หลายบทพูด — ตอนนี้กระดานนี้คือสิ่งที่คุณต้องอ่าน และ HeyGen Voice คือโมเดลที่ควรทดสอบก่อน กระดานจัดอันดับที่ตรึงเสียงให้คงที่นั้นกำลังวัดสิ่งที่คุณจะทำจริง

ประการที่สอง หากกรณีการใช้งานของคุณคือการมีตัวละครที่ฟังดูเป็นเจ้าของภาษาจำนวนมากในภาษาที่โคลนของคุณไม่ครอบคลุม บอร์ด Provider Voices และรายการทั้งเก้าสิบหกรายการของมันยังคงเป็นข้อมูลอ้างอิงที่เกี่ยวข้อง และ HeyGen Voice ยังไม่มีอันดับในนั้น ไม่มีอะไรในผลลัพธ์เสียงโคลนที่บอกคุณว่าเอนจินจัดการกับหนึ่งร้อยเสียงที่แตกต่างกันได้อย่างไร

ประการที่สาม ราคาตอนนี้มีตัวเลขแล้ว แต่ไม่ใช่ตัวเลขที่ผู้ขายเผยแพร่ Arena ระบุว่า HeyGen Voice อยู่ที่ $30.00 ต่อ 1 ล้านตัวอักษร ซึ่งเป็นการแปลงระบบเครดิตโดย Artificial Analysis ที่หน้าเพจของ HeyGen เองไม่เคยแปลงเป็นอัตราค่าบริการเสียง นั่นทำให้ผู้นำคนใหม่มีราคาต่ำกว่า $40.00 ของ Eleven v4 Turbo และสูงกว่าระดับ Qwen ที่ $19.30 — ราคาระดับกลางสนามที่ผูกกับคะแนนอันดับหนึ่ง และเป็นราคาที่ได้มาจากการคำนวณมากกว่าจะเป็นราคาที่ถูกอ้างโดยตรง

คำถามเกี่ยวกับการกำหนดเส้นทาง

การเลือกเสียงมีคุณสมบัติหนึ่งที่ตัวเลือกโมเดลส่วนใหญ่ไม่มี: ความล้มเหลวนั้นผู้ใช้ปลายทางได้ยินได้ภายในหนึ่งพยางค์ ซึ่งทำให้การย้ายระบบมีต้นทุนต่ำในการทดสอบและมีต้นทุนสูงหากทำผิดในโปรดักชัน การรันเอนจินใหม่ภายใต้อินเทอร์เฟซเดียวกับระบบเดิม — API surface เดียว คีย์เดียว ราคาตามรายการของผู้ให้บริการถูกส่งผ่านแทนการบวกกำไร พร้อม failover อัตโนมัติไปยังผู้ให้บริการเสียงรายที่สองเมื่อคำขอล้มเหลว — คือวิธีที่คุณจะได้คำตอบจริงเกี่ยวกับเสียงของคุณเอง แทนที่จะเป็นคำตอบจากแผนภูมิ Elo เกี่ยวกับเสียงอ้างอิงแปดเสียง เลเยอร์ routing ของ OrcaRouter มีอยู่เพื่อการตัดสินใจรูปแบบนี้โดยเฉพาะ: วางผู้ท้าชิงบนปริมาณทราฟฟิกเพียงเศษส่วนหนึ่ง ทำให้ระบบเดิมยังพร้อมใช้งาน และให้ failover ครอบคลุมช่วงเวลาที่โมเดลใหม่ยังพิสูจน์ไม่ได้ ลีดเดอร์บอร์ดบอกคุณว่าควรมองตรงไหน แต่บอกคุณไม่ได้ว่าสคริปต์ของคุณฟังดูเป็นอย่างไร

สิ่งที่ควรดูต่อไป

ตัวเลขสองตัวจะตัดสินเรื่องนี้ ตัวแรกคือ HeyGen Voice จะสะสมคะแนนเสียงได้มากพอที่จะเข้าสู่บอร์ด Provider Voices หรือไม่ และจะอยู่อันดับใดเมื่อเทียบกับ 1,328 ของ Eleven v4 Turbo — โมเดลที่นำอยู่ในบอร์ดนั้นแต่กลับตามหลังในอารีนาแบบควบคุม ซึ่งเป็นช่องว่างที่บอร์ดทั้งสองมีขึ้นมาเพื่อเปิดเผยอย่างแม่นยำ ตัวที่สองคือ HeyGen จะเผยแพร่อัตราค่าเสียงของตนเองหรือไม่ เพื่อให้ $30.00 ที่อารีนาคำนวณได้นั้นถูกตรวจสอบเทียบกับตัวเลขจากผู้ให้บริการ แทนที่จะอนุมานจากเครดิต จนกว่าทั้งสองอย่างจะปรากฏ การเปิดตัวในอันดับ #1 บนบอร์ดแบบควบคุมจึงเป็นข้อกล่าวอ้างที่หนักแน่นเกี่ยวกับคุณภาพเสียงโคลน และเป็นคำถามที่ยังไม่มีคำตอบสำหรับทุกสิ่งอื่น

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube