
HeyGen Voice vs Qwen-Audio-3.0-TTS: คุณจ่ายอะไรไปเพื่อ Elo และ Qwen Tier ใดที่คุณทดสอบจริง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ลองคำนวณดูก่อน เพราะตัวเลขไม่ได้เอนไปข้างใดข้างหนึ่งมากอย่างที่สกอร์บอร์ดชวนให้คิด Qwen-Audio-3.0-TTS-Plus มีค่าใช้จ่าย 19.30 ดอลลาร์ต่อล้านตัวอักษรบนแพลตฟอร์ม Model Studio ซึ่งเป็นเรตที่ผู้ขายประกาศเอง ส่วน HeyGen Voice อยู่ที่ 30.00 ดอลลาร์ต่อล้านตัวอักษรในตารางราคาของ Artificial Analysis เอง เป็นตัวเลขที่เว็บไซต์นั้นคำนวณมาจากระบบราคาแบบเครดิตของ HeyGen เนื่องจากหน้าราคาสาธารณะของ HeyGen ขายเป็นเครดิตโดยไม่ได้ระบุว่าการสร้างเสียงหนึ่งครั้งใช้ไปเท่าใด ขณะที่ช่องว่างด้านเสียงแบบควบคุมระหว่างทั้งสองอยู่ที่ 79 Elo: HeyGen Voice ได้ 1,202 คะแนนในอารีนาที่ตรึงเสียงอ้างอิงทั้งแปดไว้คงที่ ส่วน Qwen-Audio-3.0-TTS-Plus ได้ 1,123 คะแนน ดังนั้นโมเดลที่ถูกกว่า�าจึงจัดอันดับตามหลังโมเดลที่ดีกว่าอยู่ไกล อัตราส่วนระหว่างทั้งสองอยู่ที่ราว 1.55 เท่า และมีเพียงราคาเดียวจากสองราคานั้นที่เป็นตัวเลขที่ผู้ขายซึ่งขายมันลงชื่อรับรองไว้
กับดักในชื่อ
ก่อนจะทำสิ่งเหล่านั้นทั้งหมด จัดเทียร์ให้ถูกต้องก่อน เพราะนี่คือตระกูลที่ยินดีปล่อยให้คุณไปทดสอบโมเดลผิดตัวได้อย่างสบาย ๆ รายการของ Alibaba สองรายการสำคัญตรงนี้ และทั้งสองใช้แทนกันไม่ได้
Qwen-Audio-3.0-TTS-Plus เป็นโมเดลที่บทความนี้ใช้เปรียบเทียบด้วย โดยได้คะแนน 1,123 บนบอร์ดแบบควบคุม — เป็นอันดับเจ็ดจากสี่สิบสอง — และ 1,264 บนบอร์ด Provider Voices ซึ่งอยู่อันดับหกจากเก้าสิบหก เป็นผลิตภัณฑ์ TTS แบบสตรีมมิ่งที่มีอยู่จริงและเป็นปัจจุบัน โดยมีอัตราที่ประกาศไว้ที่ 19.30 ดอลลาร์ต่อล้านตัวอักษร
Qwen-Audio-3.1-TTS-Plus เป็นระดับรุ่นสืบทอดของมัน และเป็นรุ่นที่อยู่อันดับสองบนบอร์ดแบบควบคุมด้วยคะแนน 1,186 — โมเดลที่เข้าใกล้การเอาชนะ HeyGen Voice ในการเปิดตัวมากที่สุด ราคาของมันระบุไว้ที่ $19.30 เท่ากัน แม้ว่าเอกสารของ Alibaba จะเตือนว่าโมเดลต่างเวอร์ชันจำเป็นต้องใช้เสียงที่จับคู่กัน ดังนั้น "ราคาเดียวกัน แต่เป็นรุ่นใหม่กว่า" จึงไม่ได้หมายความว่า "ใช้แทนกันได้ทันที"
ใครก็ตามที่อ่าน “#1 นำหน้า Qwen” แล้วนำ Qwen-Audio-3.0-TTS ไปทดสอบวัดประสิทธิภาพ จะได้ทดสอบโมเดลที่อ่อนกว่าโมเดลที่พาดหัวข่าวกล่าวถึงอยู่ 63 Elo ข้อกังขาเรื่องระดับชั้นมีน้ำหนักถึง 63 คะแนน ซึ่งมากกว่าส่วนต่างระหว่าง HeyGen Voice กับอันดับที่สาม
กระดานคะแนน

• คะแนน Elo เสียงแบบควบคุม (เสียงโคลนเดียวกัน 8 เสียง) — HeyGen Voice: 1,202 อันดับ 1 จาก 42. Qwen-Audio-3.0-TTS-Plus: 1,123 อันดับ 7.
• Elo ของเสียงผู้ให้บริการ (เสียงเจ้าของภาษา) — Qwen-Audio-3.0-TTS-Plus: 1,264, #6 จาก 96. HeyGen Voice: ไม่ถูกจัดอันดับ
• ราคาต่อ 1 ล้านตัวอักษร — Qwen-Audio-3.0-TTS-Plus: 19.30 ดอลลาร์สหรัฐ เผยแพร่โดยผู้จำหน่ายบน Alibaba Cloud HeyGen Voice: 30.00 ดอลลาร์สหรัฐ ตามการแปลงราคาเครดิตของอารีนาเอง โดย HeyGen ไม่ได้เผยแพร่อัตราค่าบริการเสียง
• ต้นทุนการบรรยายเสียง 100 ชั่วโมง — Qwen-Audio-3.0-TTS-Plus: ประมาณ $926 ที่อัตรา ~480,000 ตัวอักษรต่อชั่วโมงการพูด HeyGen Voice: ประมาณ $1,440 ตามอัตราแปลง $30.00 ของอารีนา — เป็นการคำนวณขึ้นมา ไม่ใช่ราคาที่อ้างอิง
• การควบคุมด้วยเสียง — Qwen-Audio-3.0-TTS-Plus: คำสั่งพารามิเตอร์, แท็กอารมณ์และภาษา, การโคลนเสียงและการออกแบบเสียง HeyGen Voice: การออกแบบข้อความเป็นเสียงจากคำอธิบายไม่เกิน 1,000 ตัวอักษร โคลนทันที โคลนระดับมืออาชีพที่ฝึกด้วยข้อมูล 20+ นาที
• เอาต์พุต — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 และ Opus ที่สูงถึง 48kHz พร้อมปรับอัตรา ระดับเสียง ความดัง และบิตเรตได้ HeyGen Voice: ความเร็ว 0.5–1.5 และระดับเสียง ±50 เซมิโทนต่อคำขอ

สิ่งที่งานวิศวกรรมของ Alibaba มอบให้คุณจริง ๆ
ตระกูล Qwen-Audio-3.0-TTS เป็นผลิตภัณฑ์แบบสตรีมมิ่ง และเอกสารก็เขียนในลักษณะเช่นนั้น คำขอจะส่งผ่านโปรโตคอล WebSocket ที่ใช้ร่วมกับ CosyVoice โดยมีลำดับเหตุการณ์ run-task, continue-task และ finish-task และการตอบกลับ task-started, result-generated, task-finished และ task-failed ควบคู่กันไป การยกเลิกได้รับการรองรับบนโมเดล Qwen-Audio-TTS ทุกตัวทั้งในภูมิภาคปักกิ่งและสิงคโปร์ผ่าน streaming_cancel() เอาต์พุตไปถึง 48kHz และรูปแบบไฟล์รวมถึง Opus ซึ่งสำคัญหากคุณต้องย้ายเสียงไปยังเบราว์เซอร์หรือสายโทรศัพท์แทนที่จะเป็นไฟล์ WAV
รายละเอียดสองอย่างในเอกสารนั้นเป็นเรื่องที่มองข้ามได้ง่าย และต้องจ่ายแพงถ้าค่อยมาพบทีหลัง แท็กอารมณ์และแท็กภาษาที่มีสีสันใช้ได้เฉพาะกับแพ็กเกจ Plus และ Flash เท่านั้น ไม่ใช่ทั้งตระกูล และใช้งานได้เฉพาะในโหมดสตรีมมิ่งทิศทางเดียวเท่านั้น นอกจากนี้ คีย์ API ยังแตกต่างกันระหว่างภูมิภาคสิงคโปร์กับปักกิ่ง โดยเวิร์กสเปซจะถูกเข้าถึงที่ URL ในรูปแบบ wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference คีย์แบบรายภูมิภาคเป็นแค่รายละเอียดตอนจัดเตรียมระบบ จนกว่าจะถึงวันที่มันกลายเป็นเหตุระบบล่ม
ฝั่งของ HeyGen เป็นผลิตภัณฑ์อีกรูปแบบหนึ่ง: API v3 สไตล์ REST ที่ POST /v3/voices/speech สร้างเสียงพูด, GET /v3/voices แสดงรายการแค็ตตาล็อกที่อยู่เบื้องหลังการกรองด้วย engine และการออกแบบเสียงจะคืนค่าตัวเลือกที่จัดอันดับไว้สูงสุดสามรายการจากพรอมป์ต์ข้อความ พร้อมซีด (seed) เพื่อให้ทำซ้ำได้ เอกสารยังเปิดเผยอีกว่าตัวกรอง engine ยอมรับค่าที่นอกเหนือไปจากของ HeyGen เอง — ดังนั้น HeyGen ก็ยินดีพาคุณไปยังเอนจินเสียงของบุคคลที่สามผ่าน API ของตัวเอง ผู้ขายที่จัดส่งโมเดลของคู่แข่งมาเป็นตัวเลือกที่เลือกได้ กำลังบอกอะไรบางอย่างกับคุณว่ามันคิดว่าจุดแข็งของตัวเองอยู่ตรงไหน

79 Elo ไปไหน
ช่องว่าง 79 คะแนนบนกระดานจัดอันดับแบบควบคุมถือว่ามาก — มากกว่าส่วนต่าง 16 คะแนนที่แยก HeyGen Voice จากอันดับสอง และประมาณระยะห่างระหว่างอันดับสามกับอันดับแปดในกลุ่มนั้น ช่องว่างนี้ยังวัดบนแกนเดียวด้วย
สนามทดสอบแบบควบคุมจะโคลนเสียงแปดเสียงและตรึงเสียงเหล่านั้นไว้ให้คงที่ ไม่ได้บอกอะไรเกี่ยวกับส่วนควบคุมที่ขับเคลื่อนด้วยคำสั่งซึ่ง Qwen เปิดให้ใช้งาน ไม่ได้บอกอะไรเกี่ยวกับเอาต์พุต Opus 48kHz ผ่าน WebSocket ที่ยกเลิกได้ และไม่ได้บอกอะไรเกี่ยวกับการติดตั้งใช้งานในระดับภูมิภาค สิ่งเหล่านี้คือคุณสมบัติทางวิศวกรรม และนั่นคือเหตุผลที่ทีมซึ่งสร้างศูนย์ติดต่อลูกค้าภาษาจีนกลางจะไม่เปลี่ยนไปใช้โมเดลที่ได้คะแนนสูงกว่า 79 คะแนนบนเสียงอ้างอิงภาษาอังกฤษแปดเสียง
สิ่งที่ผลลัพธ์แบบควบคุมบอกนั้นแคบกว่าและยังมีประโยชน์: เมื่อทั้งสองเอนจินได้รับเสียงโคลนเดียวกัน ผู้ฟังชอบการเรนเดอร์ของ HeyGen Voice มากกว่า หากผลิตภัณฑ์ของคุณโคลนเสียง นั่นคือแกนของคุณ หากผลิตภัณฑ์ของคุณเลือกเสียงจากแค็ตตาล็อกและสตรีมเข้าไปในการโทร บอร์ดผู้ให้บริการจะใกล้เคียงกับความเป็นจริงของคุณมากกว่า — และในบอร์ดนั้น HeyGen Voice ไม่มีอันดับเลย ในขณะที่ Qwen-Audio-3.0-TTS-Plus อยู่อันดับหกจากเก้าสิบหก
ข้อโต้แย้งเรื่องราคา เมื่อได้รับการพิจารณาอย่างจริงจัง
ที่ราคา 19.30 ดอลลาร์ต่อล้านตัวอักษร Qwen-Audio-3.0-TTS-Plus มีค่าใช้จ่ายประมาณครึ่งหนึ่งของระดับราคา 40 ดอลลาร์ของ ElevenLabs และประมาณ 40% ของ 49 ดอลลาร์ของ Cartesia Sonic 3.6 สำหรับภาระงานบรรยาย 100 ชั่วโมง — ประมาณ 48 ล้านตัวอักษรที่อัตราการพูดทั่วไป — นั่นอยู่ที่ราว 926 ดอลลาร์ ปริมาณเดียวกันบน Eleven v4 Turbo จะอยู่ที่ประมาณ 1,920 ดอลลาร์ และบน Sonic 3.6 ประมาณ 2,352 ดอลลาร์ HeyGen Voice ที่ราคา 30.00 ดอลลาร์ของเวทีนี้ อยู่ใกล้ 1,440 ดอลลาร์: อยู่ระหว่างระดับราคาถูกกับสองเจ้าตลาดเดิม โดยใกล้เคียงกับตรงกลางมากกว่าด้านบน
เลขคณิตนั้นมีข้อแม้ที่กรณีอื่น ๆ ไม่จำเป็นต้องมี $19.30 คืออัตราที่ Alibaba ประกาศเอง $30.00 คือการแปลงระบบเครดิตของ Artificial Analysis ซึ่ง HeyGen ไม่เคยแปลงเป็นจำนวนตัวอักษร ดังนั้นมันจึงเป็นค่าประมาณโดยสุจริตมากกว่าจะเป็นราคาที่อ้างอิงได้จริง หากอัตราส่วนตัวอักษรต่อเครดิตที่แท้จริงแย่กว่าที่แผนภูมิสมมติไว้ ข้อได้เปรียบ 79-Elo ก็มีต้นทุนสูงกว่าที่ค่า 1.55× บ่งชี้ไว้ หากอัตราส่วนดีกว่า ก็มีต้นทุนต่ำกว่า โมเดลที่คุณต้องอนุมานราคาเอง คือโมเดลที่คุณควรทดลองนำร่องบนสัดส่วนทราฟฟิกที่วัดได้ แทนที่จะเป็นโมเดลที่คุณกำหนดเป็นมาตรฐาน นั่นไม่ใช่การวิจารณ์ตัวเอนจิน — แต่เป็นการบรรยายถึงข้อมูลที่มีอยู่ ณ วันที่ 10 ตุลาคม 2026
การตัดสินใจ
เลือก Qwen-Audio-3.0-TTS-Plus เมื่อต้นทุนและโครงสร้างพื้นฐานสตรีมมิงเป็นตัวกำหนดการตัดสินใจ ราคาต่ำกว่า $20 ต่อล้านอักขระ, WebSocket ที่ยกเลิกได้พร้อมเอาต์พุต Opus 48kHz, พารามิเตอร์ instruction และแท็กอารมณ์, และอันดับที่ 6 บนกระดานผู้ให้บริการ ทำให้มันเป็นเสียงที่ประหยัดที่สุดและได้คะแนนดีในบรรดาตัวเลือกที่เปรียบเทียบกันนี้ เลือกระดับ 3.1 แทนหากคุณต้องการโมเดลที่ได้อันดับสองจริงบนกระดานแบบควบคุม และตรวจสอบรายการเสียงก่อนสันนิษฐานว่าการสลับนั้นฟรี
ทดสอบ HeyGen Voice เมื่อความเที่ยงตรงของการโคลนเสียงคือตัวผลิตภัณฑ์ ผู้พูดหนึ่งคน หลายบทพูด เสียงที่ต้องเป็น *เสียงนั้น* ทุกครั้ง — นั่นคือแกนที่บอร์ดควบคุมวัด และเป็นแกนที่มันนำหน้าทั้งวงการ ตั้งงบไว้สำหรับช่วงวัดผล เพราะโมเดลเครดิตหมายความว่าคุณจะได้รู้ต้นทุนที่แท้จริงจากการรันข้อความของคุณเอง แทนที่จะอ่านตารางราคา
และไม่ต้องสนใจการเปรียบเทียบนั้นเลยหากภาระงานเป็นภาษาจีนและเป็นแบบเรียลไทม์ คะแนน Elo ทั้งสองจำนวนไม่ได้ถูกวัดกับเสียงของคุณ ในภาษาของคุณ ภายใต้งบประมาณความหน่วงของคุณ
ทำให้ทั้งคู่ยังคงเข้าถึงได้
นี่คือหนึ่งในการจับคู่ที่ชั้นการจัดเส้นทางพิสูจน์คุณค่าของตัวเอง แทนที่จะเป็นแค่ส่วนเสริมที่แปะเพิ่มเข้าไป API คีย์เดียวที่ครอบคลุมทั้งสองผู้ให้บริการ — ราคาตามรายการของผู้ให้บริการที่ส่งผ่านไปโดยไม่บวกเพิ่ม ดังนั้นราคา $19.30 ที่ Alibaba ประกาศไว้คือสิ่งที่คุณจ่าย และการปรับราคาของ Qwen จะมีผลทันทีในวันเดียวกัน — ขจัดความจำเป็นในการเลือกผู้ชนะก่อนที่คุณจะมีหลักฐาน ยิ่งไปกว่านั้น การสลับสำรองอัตโนมัติยังครอบคลุมความเสี่ยงที่เห็นได้ชัดในไปป์ไลน์เสียง ซึ่งสตรีมที่หยุดชะงักนั้นผู้ฟังสามารถได้ยินได้ และ DSL สำหรับการจัดเส้นทางยังช่วยให้คุณส่งงานบรรยายจำนวนมากไปยังเอนจินราคาถูก และส่งบรรทัดที่สำคัญต่อการโคลนไปยังเอนจินที่ได้คะแนนสูงกว่า 79 คะแนน โดยไม่ต้องมีไลบรารีไคลเอนต์สองตัวและความสัมพันธ์ด้านการเรียกเก็บเงินสองชุด คุณค่าของ OrcaRouter ในที่นี้ไม่ใช่การที่มันโฮสต์โมเดลเสียง หากแต่คือการที่มันทำให้ค่าใช้จ่ายในการค้นหาว่าคุณต้องการตัวไหนแทบจะเป็นศูนย์
คำถามที่ยังเปิดอยู่
สามสิ่งจะช่วยยุติเรื่องนี้ได้ อัตราค่าบริการเสียงบนหน้า�าราคาของ HeyGen เองจะเปลี่ยน $30.00 ที่อารีนาคำนวณได้ให้เป็นตัวเลขที่คุณตรวจสอบได้ การเพิ่มรายการ HeyGen บนบอร์ด Provider Voices จะบอกเราว่าความได้เปรียบของเสียงโคลนยังคงอยู่หรือไม่เมื่อเจอเสียงแบบเนทีฟ — การทดสอบที่ Qwen-Audio-3.0-TTS-Plus ผ่านมาในอันดับที่หกจากเก้าสิบหก และผลลัพธ์เสียงแบบควบคุมของ Qwen-Audio-3.1-TTS-Plus เมื่อเทียบกับ HeyGen Voice หลังจากมีโหวตมากขึ้น จะบอกเราว่า 16 Elo เป็นลำดับที่มั่นคงหรือไม่ จนกว่าจะถึงตอนนั้น: Qwen คือตัวเลือกที่มีราคา ชัดเจน สตรีมได้ และมีอันดับดี; HeyGen Voice คือตัวเลือกที่ได้คะแนนสูงกว่า แต่ไม่มีราคา; และระดับที่คุณนำมาทดสอบสำคัญกว่าพาดหัวที่คุณอ่าน
