การ์ดฮีโร่ที่สร้างขึ้นชื่อ 'HeyGen Voice vs Qwen-Audio-3.0-TTS' แสดงช่องว่าง Elo 79 จุดของเสียงแบบควบคุม เมื่อเทียบกับราคาต่อล้านอักขระสองราคา โดยมีหมายเหตุว่าราคาหนึ่งเป็นราคาที่ผู้จำหน่ายเผยแพร่ และอีกราคาหนึ่งเป็นการแปลงราคาเครดิตที่ arena คำนวณขึ้น ตามข้อมูลของ Artificial Analysis, 9 ตุลาคม 2026 โลโก้ OrcaRouter ปรากฏที่มุมขวาล่าง
Engineering & Research

HeyGen Voice vs Qwen-Audio-3.0-TTS: คุณจ่ายอะไรไปเพื่อ Elo และ Qwen Tier ใดที่คุณทดสอบจริง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ลองคำนวณดูก่อน เพราะตัวเลขไม่ได้เอนไปข้างใดข้างหนึ่งมากอย่างที่สกอร์บอร์ดชวนให้คิด Qwen-Audio-3.0-TTS-Plus มีค่าใช้จ่าย 19.30 ดอลลาร์ต่อล้านตัวอักษรบนแพลตฟอร์ม Model Studio ซึ่งเป็นเรตที่ผู้ขายประกาศเอง ส่วน HeyGen Voice อยู่ที่ 30.00 ดอลลาร์ต่อล้านตัวอักษรในตารางราคาของ Artificial Analysis เอง เป็นตัวเลขที่เว็บไซต์นั้นคำนวณมาจากระบบราคาแบบเครดิตของ HeyGen เนื่องจากหน้าราคาสาธารณะของ HeyGen ขายเป็นเครดิตโดยไม่ได้ระบุว่าการสร้างเสียงหนึ่งครั้งใช้ไปเท่าใด ขณะที่ช่องว่างด้านเสียงแบบควบคุมระหว่างทั้งสองอยู่ที่ 79 Elo: HeyGen Voice ได้ 1,202 คะแนนในอารีนาที่ตรึงเสียงอ้างอิงทั้งแปดไว้คงที่ ส่วน Qwen-Audio-3.0-TTS-Plus ได้ 1,123 คะแนน ดังนั้นโมเดลที่ถูกกว่า�าจึงจัดอันดับตามหลังโมเดลที่ดีกว่าอยู่ไกล อัตราส่วนระหว่างทั้งสองอยู่ที่ราว 1.55 เท่า และมีเพียงราคาเดียวจากสองราคานั้นที่เป็นตัวเลขที่ผู้ขายซึ่งขายมันลงชื่อรับรองไว้

กับดักในชื่อ

ก่อนจะทำสิ่งเหล่านั้นทั้งหมด จัดเทียร์ให้ถูกต้องก่อน เพราะนี่คือตระกูลที่ยินดีปล่อยให้คุณไปทดสอบโมเดลผิดตัวได้อย่างสบาย ๆ รายการของ Alibaba สองรายการสำคัญตรงนี้ และทั้งสองใช้แทนกันไม่ได้

Qwen-Audio-3.0-TTS-Plus เป็นโมเดลที่บทความนี้ใช้เปรียบเทียบด้วย โดยได้คะแนน 1,123 บนบอร์ดแบบควบคุม — เป็นอันดับเจ็ดจากสี่สิบสอง — และ 1,264 บนบอร์ด Provider Voices ซึ่งอยู่อันดับหกจากเก้าสิบหก เป็นผลิตภัณฑ์ TTS แบบสตรีมมิ่งที่มีอยู่จริงและเป็นปัจจุบัน โดยมีอัตราที่ประกาศไว้ที่ 19.30 ดอลลาร์ต่อล้านตัวอักษร

Qwen-Audio-3.1-TTS-Plus เป็นระดับรุ่นสืบทอดของมัน และเป็นรุ่นที่อยู่อันดับสองบนบอร์ดแบบควบคุมด้วยคะแนน 1,186 — โมเดลที่เข้าใกล้การเอาชนะ HeyGen Voice ในการเปิดตัวมากที่สุด ราคาของมันระบุไว้ที่ $19.30 เท่ากัน แม้ว่าเอกสารของ Alibaba จะเตือนว่าโมเดลต่างเวอร์ชันจำเป็นต้องใช้เสียงที่จับคู่กัน ดังนั้น "ราคาเดียวกัน แต่เป็นรุ่นใหม่กว่า" จึงไม่ได้หมายความว่า "ใช้แทนกันได้ทันที"

ใครก็ตามที่อ่าน “#1 นำหน้า Qwen” แล้วนำ Qwen-Audio-3.0-TTS ไปทดสอบวัดประสิทธิภาพ จะได้ทดสอบโมเดลที่อ่อนกว่าโมเดลที่พาดหัวข่าวกล่าวถึงอยู่ 63 Elo ข้อกังขาเรื่องระดับชั้นมีน้ำหนักถึง 63 คะแนน ซึ่งมากกว่าส่วนต่างระหว่าง HeyGen Voice กับอันดับที่สาม

กระดานคะแนน

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• คะแนน Elo เสียงแบบควบคุม (เสียงโคลนเดียวกัน 8 เสียง) — HeyGen Voice: 1,202 อันดับ 1 จาก 42. Qwen-Audio-3.0-TTS-Plus: 1,123 อันดับ 7.

• Elo ของเสียงผู้ให้บริการ (เสียงเจ้าของภาษา) — Qwen-Audio-3.0-TTS-Plus: 1,264, #6 จาก 96. HeyGen Voice: ไม่ถูกจัดอันดับ

• ราคาต่อ 1 ล้านตัวอักษร — Qwen-Audio-3.0-TTS-Plus: 19.30 ดอลลาร์สหรัฐ เผยแพร่โดยผู้จำหน่ายบน Alibaba Cloud HeyGen Voice: 30.00 ดอลลาร์สหรัฐ ตามการแปลงราคาเครดิตของอารีนาเอง โดย HeyGen ไม่ได้เผยแพร่อัตราค่าบริการเสียง

• ต้นทุนการบรรยายเสียง 100 ชั่วโมง — Qwen-Audio-3.0-TTS-Plus: ประมาณ $926 ที่อัตรา ~480,000 ตัวอักษรต่อชั่วโมงการพูด HeyGen Voice: ประมาณ $1,440 ตามอัตราแปลง $30.00 ของอารีนา — เป็นการคำนวณขึ้นมา ไม่ใช่ราคาที่อ้างอิง

• การควบคุมด้วยเสียง — Qwen-Audio-3.0-TTS-Plus: คำสั่งพารามิเตอร์, แท็กอารมณ์และภาษา, การโคลนเสียงและการออกแบบเสียง HeyGen Voice: การออกแบบข้อความเป็นเสียงจากคำอธิบายไม่เกิน 1,000 ตัวอักษร โคลนทันที โคลนระดับมืออาชีพที่ฝึกด้วยข้อมูล 20+ นาที

• เอาต์พุต — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 และ Opus ที่สูงถึง 48kHz พร้อมปรับอัตรา ระดับเสียง ความดัง และบิตเรตได้ HeyGen Voice: ความเร็ว 0.5–1.5 และระดับเสียง ±50 เซมิโทนต่อคำขอ

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

สิ่งที่งานวิศวกรรมของ Alibaba มอบให้คุณจริง ๆ

ตระกูล Qwen-Audio-3.0-TTS เป็นผลิตภัณฑ์แบบสตรีมมิ่ง และเอกสารก็เขียนในลักษณะเช่นนั้น คำขอจะส่งผ่านโปรโตคอล WebSocket ที่ใช้ร่วมกับ CosyVoice โดยมีลำดับเหตุการณ์ run-task, continue-task และ finish-task และการตอบกลับ task-started, result-generated, task-finished และ task-failed ควบคู่กันไป การยกเลิกได้รับการรองรับบนโมเดล Qwen-Audio-TTS ทุกตัวทั้งในภูมิภาคปักกิ่งและสิงคโปร์ผ่าน streaming_cancel() เอาต์พุตไปถึง 48kHz และรูปแบบไฟล์รวมถึง Opus ซึ่งสำคัญหากคุณต้องย้ายเสียงไปยังเบราว์เซอร์หรือสายโทรศัพท์แทนที่จะเป็นไฟล์ WAV

รายละเอียดสองอย่างในเอกสารนั้นเป็นเรื่องที่มองข้ามได้ง่าย และต้องจ่ายแพงถ้าค่อยมาพบทีหลัง แท็กอารมณ์และแท็กภาษาที่มีสีสันใช้ได้เฉพาะกับแพ็กเกจ Plus และ Flash เท่านั้น ไม่ใช่ทั้งตระกูล และใช้งานได้เฉพาะในโหมดสตรีมมิ่งทิศทางเดียวเท่านั้น นอกจากนี้ คีย์ API ยังแตกต่างกันระหว่างภูมิภาคสิงคโปร์กับปักกิ่ง โดยเวิร์กสเปซจะถูกเข้าถึงที่ URL ในรูปแบบ wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference คีย์แบบรายภูมิภาคเป็นแค่รายละเอียดตอนจัดเตรียมระบบ จนกว่าจะถึงวันที่มันกลายเป็นเหตุระบบล่ม

ฝั่งของ HeyGen เป็นผลิตภัณฑ์อีกรูปแบบหนึ่ง: API v3 สไตล์ REST ที่ POST /v3/voices/speech สร้างเสียงพูด, GET /v3/voices แสดงรายการแค็ตตาล็อกที่อยู่เบื้องหลังการกรองด้วย engine และการออกแบบเสียงจะคืนค่าตัวเลือกที่จัดอันดับไว้สูงสุดสามรายการจากพรอมป์ต์ข้อความ พร้อมซีด (seed) เพื่อให้ทำซ้ำได้ เอกสารยังเปิดเผยอีกว่าตัวกรอง engine ยอมรับค่าที่นอกเหนือไปจากของ HeyGen เอง — ดังนั้น HeyGen ก็ยินดีพาคุณไปยังเอนจินเสียงของบุคคลที่สามผ่าน API ของตัวเอง ผู้ขายที่จัดส่งโมเดลของคู่แข่งมาเป็นตัวเลือกที่เลือกได้ กำลังบอกอะไรบางอย่างกับคุณว่ามันคิดว่าจุดแข็งของตัวเองอยู่ตรงไหน

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

79 Elo ไปไหน

ช่องว่าง 79 คะแนนบนกระดานจัดอันดับแบบควบคุมถือว่ามาก — มากกว่าส่วนต่าง 16 คะแนนที่แยก HeyGen Voice จากอันดับสอง และประมาณระยะห่างระหว่างอันดับสามกับอันดับแปดในกลุ่มนั้น ช่องว่างนี้ยังวัดบนแกนเดียวด้วย

สนามทดสอบแบบควบคุมจะโคลนเสียงแปดเสียงและตรึงเสียงเหล่านั้นไว้ให้คงที่ ไม่ได้บอกอะไรเกี่ยวกับส่วนควบคุมที่ขับเคลื่อนด้วยคำสั่งซึ่ง Qwen เปิดให้ใช้งาน ไม่ได้บอกอะไรเกี่ยวกับเอาต์พุต Opus 48kHz ผ่าน WebSocket ที่ยกเลิกได้ และไม่ได้บอกอะไรเกี่ยวกับการติดตั้งใช้งานในระดับภูมิภาค สิ่งเหล่านี้คือคุณสมบัติทางวิศวกรรม และนั่นคือเหตุผลที่ทีมซึ่งสร้างศูนย์ติดต่อลูกค้าภาษาจีนกลางจะไม่เปลี่ยนไปใช้โมเดลที่ได้คะแนนสูงกว่า 79 คะแนนบนเสียงอ้างอิงภาษาอังกฤษแปดเสียง

สิ่งที่ผลลัพธ์แบบควบคุมบอกนั้นแคบกว่าและยังมีประโยชน์: เมื่อทั้งสองเอนจินได้รับเสียงโคลนเดียวกัน ผู้ฟังชอบการเรนเดอร์ของ HeyGen Voice มากกว่า หากผลิตภัณฑ์ของคุณโคลนเสียง นั่นคือแกนของคุณ หากผลิตภัณฑ์ของคุณเลือกเสียงจากแค็ตตาล็อกและสตรีมเข้าไปในการโทร บอร์ดผู้ให้บริการจะใกล้เคียงกับความเป็นจริงของคุณมากกว่า — และในบอร์ดนั้น HeyGen Voice ไม่มีอันดับเลย ในขณะที่ Qwen-Audio-3.0-TTS-Plus อยู่อันดับหกจากเก้าสิบหก

ข้อโต้แย้งเรื่องราคา เมื่อได้รับการพิจารณาอย่างจริงจัง

ที่ราคา 19.30 ดอลลาร์ต่อล้านตัวอักษร Qwen-Audio-3.0-TTS-Plus มีค่าใช้จ่ายประมาณครึ่งหนึ่งของระดับราคา 40 ดอลลาร์ของ ElevenLabs และประมาณ 40% ของ 49 ดอลลาร์ของ Cartesia Sonic 3.6 สำหรับภาระงานบรรยาย 100 ชั่วโมง — ประมาณ 48 ล้านตัวอักษรที่อัตราการพูดทั่วไป — นั่นอยู่ที่ราว 926 ดอลลาร์ ปริมาณเดียวกันบน Eleven v4 Turbo จะอยู่ที่ประมาณ 1,920 ดอลลาร์ และบน Sonic 3.6 ประมาณ 2,352 ดอลลาร์ HeyGen Voice ที่ราคา 30.00 ดอลลาร์ของเวทีนี้ อยู่ใกล้ 1,440 ดอลลาร์: อยู่ระหว่างระดับราคาถูกกับสองเจ้าตลาดเดิม โดยใกล้เคียงกับตรงกลางมากกว่าด้านบน

เลขคณิตนั้นมีข้อแม้ที่กรณีอื่น ๆ ไม่จำเป็นต้องมี $19.30 คืออัตราที่ Alibaba ประกาศเอง $30.00 คือการแปลงระบบเครดิตของ Artificial Analysis ซึ่ง HeyGen ไม่เคยแปลงเป็นจำนวนตัวอักษร ดังนั้นมันจึงเป็นค่าประมาณโดยสุจริตมากกว่าจะเป็นราคาที่อ้างอิงได้จริง หากอัตราส่วนตัวอักษรต่อเครดิตที่แท้จริงแย่กว่าที่แผนภูมิสมมติไว้ ข้อได้เปรียบ 79-Elo ก็มีต้นทุนสูงกว่าที่ค่า 1.55× บ่งชี้ไว้ หากอัตราส่วนดีกว่า ก็มีต้นทุนต่ำกว่า โมเดลที่คุณต้องอนุมานราคาเอง คือโมเดลที่คุณควรทดลองนำร่องบนสัดส่วนทราฟฟิกที่วัดได้ แทนที่จะเป็นโมเดลที่คุณกำหนดเป็นมาตรฐาน นั่นไม่ใช่การวิจารณ์ตัวเอนจิน — แต่เป็นการบรรยายถึงข้อมูลที่มีอยู่ ณ วันที่ 10 ตุลาคม 2026

การตัดสินใจ

เลือก Qwen-Audio-3.0-TTS-Plus เมื่อต้นทุนและโครงสร้างพื้นฐานสตรีมมิงเป็นตัวกำหนดการตัดสินใจ ราคาต่ำกว่า $20 ต่อล้านอักขระ, WebSocket ที่ยกเลิกได้พร้อมเอาต์พุต Opus 48kHz, พารามิเตอร์ instruction และแท็กอารมณ์, และอันดับที่ 6 บนกระดานผู้ให้บริการ ทำให้มันเป็นเสียงที่ประหยัดที่สุดและได้คะแนนดีในบรรดาตัวเลือกที่เปรียบเทียบกันนี้ เลือกระดับ 3.1 แทนหากคุณต้องการโมเดลที่ได้อันดับสองจริงบนกระดานแบบควบคุม และตรวจสอบรายการเสียงก่อนสันนิษฐานว่าการสลับนั้นฟรี

ทดสอบ HeyGen Voice เมื่อความเที่ยงตรงของการโคลนเสียงคือตัวผลิตภัณฑ์ ผู้พูดหนึ่งคน หลายบทพูด เสียงที่ต้องเป็น *เสียงนั้น* ทุกครั้ง — นั่นคือแกนที่บอร์ดควบคุมวัด และเป็นแกนที่มันนำหน้าทั้งวงการ ตั้งงบไว้สำหรับช่วงวัดผล เพราะโมเดลเครดิตหมายความว่าคุณจะได้รู้ต้นทุนที่แท้จริงจากการรันข้อความของคุณเอง แทนที่จะอ่านตารางราคา

และไม่ต้องสนใจการเปรียบเทียบนั้นเลยหากภาระงานเป็นภาษาจีนและเป็นแบบเรียลไทม์ คะแนน Elo ทั้งสองจำนวนไม่ได้ถูกวัดกับเสียงของคุณ ในภาษาของคุณ ภายใต้งบประมาณความหน่วงของคุณ

ทำให้ทั้งคู่ยังคงเข้าถึงได้

นี่คือหนึ่งในการจับคู่ที่ชั้นการจัดเส้นทางพิสูจน์คุณค่าของตัวเอง แทนที่จะเป็นแค่ส่วนเสริมที่แปะเพิ่มเข้าไป API คีย์เดียวที่ครอบคลุมทั้งสองผู้ให้บริการ — ราคาตามรายการของผู้ให้บริการที่ส่งผ่านไปโดยไม่บวกเพิ่ม ดังนั้นราคา $19.30 ที่ Alibaba ประกาศไว้คือสิ่งที่คุณจ่าย และการปรับราคาของ Qwen จะมีผลทันทีในวันเดียวกัน — ขจัดความจำเป็นในการเลือกผู้ชนะก่อนที่คุณจะมีหลักฐาน ยิ่งไปกว่านั้น การสลับสำรองอัตโนมัติยังครอบคลุมความเสี่ยงที่เห็นได้ชัดในไปป์ไลน์เสียง ซึ่งสตรีมที่หยุดชะงักนั้นผู้ฟังสามารถได้ยินได้ และ DSL สำหรับการจัดเส้นทางยังช่วยให้คุณส่งงานบรรยายจำนวนมากไปยังเอนจินราคาถูก และส่งบรรทัดที่สำคัญต่อการโคลนไปยังเอนจินที่ได้คะแนนสูงกว่า 79 คะแนน โดยไม่ต้องมีไลบรารีไคลเอนต์สองตัวและความสัมพันธ์ด้านการเรียกเก็บเงินสองชุด คุณค่าของ OrcaRouter ในที่นี้ไม่ใช่การที่มันโฮสต์โมเดลเสียง หากแต่คือการที่มันทำให้ค่าใช้จ่ายในการค้นหาว่าคุณต้องการตัวไหนแทบจะเป็นศูนย์

คำถามที่ยังเปิดอยู่

สามสิ่งจะช่วยยุติเรื่องนี้ได้ อัตราค่าบริการเสียงบนหน้า�าราคาของ HeyGen เองจะเปลี่ยน $30.00 ที่อารีนาคำนวณได้ให้เป็นตัวเลขที่คุณตรวจสอบได้ การเพิ่มรายการ HeyGen บนบอร์ด Provider Voices จะบอกเราว่าความได้เปรียบของเสียงโคลนยังคงอยู่หรือไม่เมื่อเจอเสียงแบบเนทีฟ — การทดสอบที่ Qwen-Audio-3.0-TTS-Plus ผ่านมาในอันดับที่หกจากเก้าสิบหก และผลลัพธ์เสียงแบบควบคุมของ Qwen-Audio-3.1-TTS-Plus เมื่อเทียบกับ HeyGen Voice หลังจากมีโหวตมากขึ้น จะบอกเราว่า 16 Elo เป็นลำดับที่มั่นคงหรือไม่ จนกว่าจะถึงตอนนั้น: Qwen คือตัวเลือกที่มีราคา ชัดเจน สตรีมได้ และมีอันดับดี; HeyGen Voice คือตัวเลือกที่ได้คะแนนสูงกว่า แต่ไม่มีราคา; และระดับที่คุณนำมาทดสอบสำคัญกว่าพาดหัวที่คุณอ่าน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube