
HeyGen Voice เปิดตัวในอันดับ 1 บน Controlled Voice TTS Arena — เอาชนะ Qwen และ ElevenLabs ในหมวดการโคลนเสียง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
เมื่อวันที่ 9 ตุลาคม 2026 Artificial Analysis ได้เพิ่ม HeyGen Voice เข้าใน Controlled Voice arena ของตน และโมเดลนี้ก็ขึ้นไปอยู่อันดับสูงสุดทันที HeyGen Voice — โมเดลแปลงข้อความเป็นเสียงตัวแรกจาก HeyGen ที่ได้รับการประเมินบนบอร์ด — ทำคะแนนได้ 1,202 Elo นำหน้า Qwen-Audio-3.1-TTS-Plus ที่ 1,186 และ Eleven v4 Turbo ของ ElevenLabs ที่ 1,167 Cartesia Sonic 3.6 ซึ่งครองอันดับหนึ่งในบอร์ด Provider Voices แบบเปิดของเว็บไซต์ อยู่อันดับห้าในที่นี้ที่ 1,143 นั่นเป็นผลลัพธ์ที่แท้จริงบนลีดเดอร์บอร์ดที่สร้างขึ้นเพื่อขจัดปัจจัยรบกวนที่ใหญ่ที่สุดเพียงหนึ่งเดียวในการประเมินเสียง และยังเป็นผลลัพธ์ที่มีความหมายเฉพาะเจาะจงมากซึ่งตีความเกินเลยได้ง่าย: HeyGen Voice เป็นเสียงที่ดีที่สุดในสนามนี้จากเสียงอ้างอิงที่โคลนมาแปดเสียง ยังไม่ใช่แชมป์ที่ผ่านการวัดแล้วของบอร์ดที่มีเก้าสิบหกโมเดล
สิ่งที่บอร์ด Controlled Voice วัด และเหตุใดจึงสำคัญ
Artificial Analysis ดำเนินการบอร์ดเสียงพูดสองบอร์ด และทั้งสองตอบคำถามที่แตกต่างกัน โดยสนามแข่ง Provider Voices เปิดให้ผู้ให้บริการแต่ละรายส่งเสียงเนทีฟของตนเอง — เสียงเดโมที่ขัดเกลาแล้วซึ่งบริษัทเลือกมาเป็นตัวแทนของตนเอง — และจัดอันดับโมเดลตามคุณภาพของเสียงเหล่านั้น ลีดเดอร์บอร์ดของมันกว้างขวางและสมบูรณ์: มีเก้าสิบหกรายการ โดย Eleven v4 Turbo อยู่อันดับสูงสุดที่ 1,328 Elo และ Cartesia Sonic 3.6 อยู่อันดับสี่ที่ 1,280
สนาม Controlled Voice ทำสิ่งที่แคบกว่าและมีประโยชน์กว่าสำหรับใครก็ตามที่นำผลิตภัณฑ์ออกจำหน่าย ทุกโมเดลบนนั้นสร้างเสียงพูดจากเสียงโคลนแปดเสียงเดียวกัน — สหรัฐฯ 4 เสียง สหราชอาณาจักร 4 เสียง — ดังนั้นการเปรียบเทียบจึงไม่ใช่ "เสียงการตลาดของใครดีกว่า" แต่เป็น "แต่ละเอนจินจัดการกับเสียงเดียวกัน ข้อความเดียวกัน และเงื่อนไขการบันทึกเดียวกันได้อย่างไร" มันเป็นสิ่งที่ใกล้เคียงที่สุดที่อุตสาหกรรมมีต่อการทดสอบเอนจินแบบเทียบเคียงกัน มากกว่าการดูเดโม และมันเป็นกระดานที่สำคัญหากคุณวางแผนจะโคลนเสียงและป้อนให้โมเดล TTS
ตอนนี้ HeyGen Voice ขึ้นนำแล้ว ส่วนต่างอยู่ที่ 16 Elo เหนือ Qwen-Audio-3.1-TTS-Plus และ 35 เหนือ Eleven v4 Turbo โดยมีช่วงความเชื่อมั่น 95% ที่รายงานไว้ประมาณ 1,185 ถึง 1,219 สำหรับค่าของ HeyGen สิบหก Elo เป็นช่องว่างจริง แต่ไม่ใช่เหว — บนลีดเดอร์บอร์ดที่แน่นขนาดนี้ มันคือความต่างระหว่างอันดับหนึ่งกับอันดับสอง ไม่ใช่ระหว่างใช้ได้กับใช้ไม่ได้

ที่ที่ HeyGen Voice ยังไม่ได้รับการจัดอันดับ
แง่มุมที่ตรงไปตรงมาของผลลัพธ์นี้คือ HeyGen Voice ไม่ปรากฏอยู่บนบอร์ด Provider Voices เลย และการที่มันหายไปก็ไม่ใช่สัญญาณเกี่ยวกับคุณภาพ Artificial Analysis ระบุว่าโมเดลอาจถูกตัดออกได้เนื่องจากยังมีคะแนนโหวตไม่มากพอ โมเดลที่เพิ่งมีอายุเพียงไม่กี่วัน โดยมีอารีนาที่ให้คะแนนต่างออกไปเพียงแห่งเดียวอยู่เบื้องหลัง ก็ยังไม่ได้สะสมปริมาณผู้ฟังแบบไม่รู้ว่าเป็นโมเดลใดมากพอตามที่บอร์ดที่ใหญ่กว่าต้องการ
ดังนั้น การตีความที่ถูกต้อง ณ วันที่ 10 ตุลาคม 2026 คือ: HeyGen Voice เป็นเสียงที่ได้อันดับสูงสุดในการเปรียบเทียบเสียงโคลนแบบควบคุม และเป็นตัวแปรที่ยังไม่ทราบค่าเมื่อเทียบกับสนามที่กว้างกว่า ใครก็ตามที่ยกคำว่า "โมเดล TTS ที่ดีที่สุดในโลก" มาจากตัวเลขนี้ กำลังอ้างอิงจากกระดานคะแนนที่เล็กกว่าที่ประโยคนี้สื่อ

ตัวเลขสองตัวที่อยู่เบื้องหลัง Elo
• Controlled Voice Elo — HeyGen Voice: 1,202 (ช่วงความเชื่อมั่น 95% ประมาณ 1,185–1,219) Qwen-Audio-3.1-TTS-Plus: 1,186 Eleven v4 Turbo: 1,167
• Provider Voices Elo — HeyGen Voice: ไม่ปรากฏในรายการ (คะแนนโหวตไม่เพียงพอ) Eleven v4 Turbo: 1,328 ที่อันดับ 1 Sonic 3.6: 1,280 ที่อันดับ 4
• อันดับในกลุ่มเปรียบเทียบที่ควบคุม — HeyGen Voice: ที่ 1 จาก 42 รายการที่ได้รับการจัดอันดับ (อันดับที่ 42 คือ OpenVoice v2 ที่ 812)
• ราคาตามเกณฑ์ของอารีนา — HeyGen Voice: 30.00 ดอลลาร์ต่อ 1 ล้านตัวอักษร ซึ่งเป็นการแปลงราคาเครดิตของ HeyGen ตามเกณฑ์ของอารีนาเอง Qwen-Audio-3.1-TTS-Plus: 19.30 ดอลลาร์ต่อ 1 ล้านตัวอักษร Eleven v4 Turbo: 40.00 ดอลลาร์ต่อ 1 ล้านตัวอักษร
• จุดอ้างอิง Elo — OpenAudio S1 เป็นจุดอ้างอิงคงที่ที่ 1,000 ดังนั้น HeyGen Voice จึงสูงกว่าจุดอ้างอิงอยู่ 202 คะแนน
• ใครอีกที่อยู่ในห้าอันดับแรก — Eleven v4 ที่ 1,160 และ Sonic 3.6 ที่ 1,143 ปิดท้ายห้าอันดับแรกตามหลังผู้นำ

สิ่งที่ HeyGen เปิดตัวจริง ๆ
เอนจินที่อยู่เบื้องหลังรายการนี้คือ TTS ภายในของ HeyGen ซึ่งเปิดให้ใช้ใน API v3 ของบริษัท GET /v3/voices เป็นการเรียกที่ใช้engine เป็นตัวกรองที่มีค่ารวมถึง orca — เอนจินเสียงของ HeyGen เอง — ควบคู่กับ starfish และการส่งผ่านไปยังเสียงของ ElevenLabs การเรนเดอร์เสียงทำงานผ่าน POST /v3/voices/speech; การปรับแต่งต่อคำขอเปิดให้ตั้งค่า speed ตั้งแต่ 0.5 ถึง 1.5 และ pitch ตั้งแต่ −50 ถึง +50 เซมิโทน โดยมี BCP-47 locale เป็นคำใบ้.
แคตตาล็อกระบุว่ามีเสียงสำเร็จรูปมากกว่า 300 เสียงในหลายสิบภาษา เสียงกำหนดเองมีสามรูปแบบ ได้แก่ การออกแบบเสียงจากข้อความที่สร้างตัวเลือกจัดอันดับได้สูงสุดสามแบบจากคำอธิบายที่จำกัดความยาวไว้ที่ 1,000 ตัวอักษร การโคลนแบบทันทีจากการบันทึกเพียงครั้งเดียว และการโคลนระดับมืออาชีพที่ฝึกจากเสียงความยาวยี่สิบนาทีขึ้นไป อันสุดท้ายนี้คือส่วนที่กระดานผู้นำ Controlled Voice กำลังทดสอบขีดจำกัดอย่างแท้จริง — เสียงอ้างอิงแปดเสียงนั้นเป็นเสียงโคลน และคุณภาพของเสียงโคลนคือจุดที่เครื่องยนต์ TTS แยกความแตกต่างออกจากกัน
เอนจินยังถูกระบุในเอกสารว่าเลือกได้แยกตามเสียง ซึ่งหมายความว่า HeyGen ไม่ได้บังคับให้คุณใช้โมเดลของตัวเอง: คุณสามารถส่งต่อไปยังเอนจินเสียงของบุคคลที่สามผ่าน API ของมันได้ หากคุณชอบตัวไหนมากกว่า นั่นคือการที่ผู้ขายป้องกันความเสี่ยงให้โมเดลของตัวเอง และเป็นสิ่งที่ควรรู้เมื่อคุณอ่านคำกล่าวอ้าง "#1 voice" เกี่ยวกับ HeyGen
การเปลี่ยนแปลงนี้ส่งผลอย่างไรกับใครก็ตามที่เลือกเสียง
เมื่อผลลัพธ์จากการควบคุมโทนเสียงเกิดขึ้นจริง ย่อมมีผลในทางปฏิบัติตามมาสามประการ และไม่มีข้อใดในนั้นเลยที่เป็นการ "เปลี่ยนทุกอย่าง"
อย่างแรก ถ้ากรณีการใช้งานของคุณคือเสียงแบรนด์แบบโคลน — ผู้พูดคนเดียว หลายบทพูด — ตอนนี้กระดานนี้คือสิ่งที่คุณต้องอ่าน และ HeyGen Voice คือโมเดลที่ควรทดสอบก่อน กระดานจัดอันดับที่ตรึงเสียงให้คงที่นั้นกำลังวัดสิ่งที่คุณจะทำจริง
ประการที่สอง หากกรณีการใช้งานของคุณคือการมีตัวละครที่ฟังดูเป็นเจ้าของภาษาจำนวนมากในภาษาที่โคลนของคุณไม่ครอบคลุม บอร์ด Provider Voices และรายการทั้งเก้าสิบหกรายการของมันยังคงเป็นข้อมูลอ้างอิงที่เกี่ยวข้อง และ HeyGen Voice ยังไม่มีอันดับในนั้น ไม่มีอะไรในผลลัพธ์เสียงโคลนที่บอกคุณว่าเอนจินจัดการกับหนึ่งร้อยเสียงที่แตกต่างกันได้อย่างไร
ประการที่สาม ราคาตอนนี้มีตัวเลขแล้ว แต่ไม่ใช่ตัวเลขที่ผู้ขายเผยแพร่ Arena ระบุว่า HeyGen Voice อยู่ที่ $30.00 ต่อ 1 ล้านตัวอักษร ซึ่งเป็นการแปลงระบบเครดิตโดย Artificial Analysis ที่หน้าเพจของ HeyGen เองไม่เคยแปลงเป็นอัตราค่าบริการเสียง นั่นทำให้ผู้นำคนใหม่มีราคาต่ำกว่า $40.00 ของ Eleven v4 Turbo และสูงกว่าระดับ Qwen ที่ $19.30 — ราคาระดับกลางสนามที่ผูกกับคะแนนอันดับหนึ่ง และเป็นราคาที่ได้มาจากการคำนวณมากกว่าจะเป็นราคาที่ถูกอ้างโดยตรง
คำถามเกี่ยวกับการกำหนดเส้นทาง
การเลือกเสียงมีคุณสมบัติหนึ่งที่ตัวเลือกโมเดลส่วนใหญ่ไม่มี: ความล้มเหลวนั้นผู้ใช้ปลายทางได้ยินได้ภายในหนึ่งพยางค์ ซึ่งทำให้การย้ายระบบมีต้นทุนต่ำในการทดสอบและมีต้นทุนสูงหากทำผิดในโปรดักชัน การรันเอนจินใหม่ภายใต้อินเทอร์เฟซเดียวกับระบบเดิม — API surface เดียว คีย์เดียว ราคาตามรายการของผู้ให้บริการถูกส่งผ่านแทนการบวกกำไร พร้อม failover อัตโนมัติไปยังผู้ให้บริการเสียงรายที่สองเมื่อคำขอล้มเหลว — คือวิธีที่คุณจะได้คำตอบจริงเกี่ยวกับเสียงของคุณเอง แทนที่จะเป็นคำตอบจากแผนภูมิ Elo เกี่ยวกับเสียงอ้างอิงแปดเสียง เลเยอร์ routing ของ OrcaRouter มีอยู่เพื่อการตัดสินใจรูปแบบนี้โดยเฉพาะ: วางผู้ท้าชิงบนปริมาณทราฟฟิกเพียงเศษส่วนหนึ่ง ทำให้ระบบเดิมยังพร้อมใช้งาน และให้ failover ครอบคลุมช่วงเวลาที่โมเดลใหม่ยังพิสูจน์ไม่ได้ ลีดเดอร์บอร์ดบอกคุณว่าควรมองตรงไหน แต่บอกคุณไม่ได้ว่าสคริปต์ของคุณฟังดูเป็นอย่างไร
สิ่งที่ควรดูต่อไป
ตัวเลขสองตัวจะตัดสินเรื่องนี้ ตัวแรกคือ HeyGen Voice จะสะสมคะแนนเสียงได้มากพอที่จะเข้าสู่บอร์ด Provider Voices หรือไม่ และจะอยู่อันดับใดเมื่อเทียบกับ 1,328 ของ Eleven v4 Turbo — โมเดลที่นำอยู่ในบอร์ดนั้นแต่กลับตามหลังในอารีนาแบบควบคุม ซึ่งเป็นช่องว่างที่บอร์ดทั้งสองมีขึ้นมาเพื่อเปิดเผยอย่างแม่นยำ ตัวที่สองคือ HeyGen จะเผยแพร่อัตราค่าเสียงของตนเองหรือไม่ เพื่อให้ $30.00 ที่อารีนาคำนวณได้นั้นถูกตรวจสอบเทียบกับตัวเลขจากผู้ให้บริการ แทนที่จะอนุมานจากเครดิต จนกว่าทั้งสองอย่างจะปรากฏ การเปิดตัวในอันดับ #1 บนบอร์ดแบบควบคุมจึงเป็นข้อกล่าวอ้างที่หนักแน่นเกี่ยวกับคุณภาพเสียงโคลน และเป็นคำถามที่ยังไม่มีคำตอบสำหรับทุกสิ่งอื่น
