
Eleven v4 กับ Qwen Audio 3.1: เสียงที่ถูกที่สุดบนกระดานเป็นฝ่ายชนะ
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 982 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 197 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
บนกระดานที่ผู้เข้าแข่งขันทุกคนได้รับเสียงโคลนแปดเสียงชุดเดียวกัน Alibaba Qwen-Audio-3.1-TTS-Plus คว้าอันดับหนึ่งที่ Elo 1,178 และ ElevenLabs Eleven v4 คว้าอันดับสองที่ 1,157. โมเดลที่ชนะมีค่าใช้จ่าย $19.30 ต่อล้านตัวอักษรบนกระดานนั้น โมเดลที่ได้อันดับสองมีค่าใช้จ่าย $80.00 นั่นคือช่องว่างด้านคุณภาพ 21 จุด และช่องว่างด้านราคาถึงสี่เท่าที่ชี้ไปในทิศทางตรงกันข้าม และเป็นผลลัพธ์ที่น่าสนใจที่สุดในสัปดาห์เปิดตัวทั้งหมด — น่าสนใจกว่าอันดับหนึ่งที่ ElevenLabs คว้าได้ในอีกเวที เพราะบนเวทีนั้น การจัดอันดับเป็นไปตามปกติ และผู้ชนะคือเสียงที่แพงที่สุดในสิบอันดับแรก
กระดานทั้งสองใช้แทนกันไม่ได้ และเหตุผลที่การเปรียบเทียบนี้ให้ผลออกมาแบบนี้ก็ล้วนขึ้นอยู่กับว่าคุณดูกระดานอันไหน Provider Voice ให้ผู้ฟังตัดสินเสียงของผู้ให้บริการแต่ละรายเอง ส่วน Controlled Voice โคลนเสียงเดียวกันแปดเสียง — สี่เสียงสหรัฐฯ สี่เสียงสหราชอาณาจักร — ให้กับทุกโมเดล ดังนั้นจึงไม่มีใครชนะได้เพราะชุดเสียงเริ่มต้นของตัวเอง ElevenLabs ชนะอันแรกด้วย 61 คะแนน Alibaba ชนะอันที่สองด้วย 21 คะแนน ไม่มีกระดานไหนผิด และอันที่สองคืออันที่ทำนายผลิตภัณฑ์ที่จะวางจำหน่ายพร้อมเสียงแบรนด์ที่โคลนมา

สกอร์บอร์ดแบบควบคุมเสียง ฉบับเต็ม
• การทดสอบความชอบแบบไม่เปิดเผย โดยใช้เสียงโคลนที่จับคู่กัน — Qwen-Audio-3.1-TTS-Plus อยู่อันดับ 1 คะแนน Elo 1,178 ราคา $19.30 ต่อล้านตัวอักษร เทียบกับ Eleven v4 อยู่อันดับ 2 คะแนน Elo 1,157 ราคา $80.00
• การเลือกแบบไม่เปิดเผยชื่อ โดยใช้เสียงของแต่ละผู้ให้บริการเอง — Eleven v4 อันดับ 1, Elo 1,319 เทียบกับ Qwen-Audio-3.0-TTS-Plus อันดับ 4, Elo 1,258 ช่องว่าง 61 คะแนนในทิศทางตรงกันข้าม
• ราคา, การปรับมาตรฐานอารีนา — Qwen $19.30 เทียบกับ Eleven v4 $80.00 Qwen ถูกกว่า 76%
• ราคา, บัตรราคาผู้ขาย — Eleven v4 $0.022 ต่อพันตัวอักษรในราคาโปรโมชัน และ $0.08 หลังวันที่ 12 ตุลาคม บัตรราคาของ Qwen Audio 3.1 เองไม่ใช่สิ่งที่เราอ่านได้ ดังนั้นการปรับมาตรฐานของอารีน่า (arena normalisation) จึงเป็นราคาเดียวที่เราเปรียบเทียบได้
• เวอร์ชันบนบอร์ดแต่ละตัว — 3.1 บน Controlled Voice, 3.0 บน Provider Voice ทั้งสองเป็นโมเดลที่แตกต่างกัน และบอร์ดไม่สามารถใช้สลับกันได้
• รายการ 3.0 บน Controlled Voice — อันดับ 5, Elo 1,124, ราคา $19.30 เท่ากัน การเปิดตัว 3.1 ให้ค่า Elo มากกว่ารุ่นก่อนหน้าของตัวเอง 54 Elo ที่ราคาเดียวกัน
• เจเนอเรชันก่อนหน้าของ Qwen บน Provider Voice — Qwen3 TTS Flash อันดับ 79, Elo 944; Qwen3 TTS อันดับ 82, Elo 930
• เรือธงรุ่นก่อนหน้าของ ElevenLabs เองใน Controlled Voice — Eleven v3 อยู่อันดับ 7, Elo 1,073
• การตรวจสอบความสมเหตุสมผลแบบแผนภูมิแท่งกลุ่ม — การกระจายแบบแปดทางจากอันดับ 1 ถึงอันดับ 10 บน Controlled Voice คือ 121 Elo ส่วนต่าง 21 คะแนนที่ Qwen นำหน้า Eleven v4 นั้นน้อยกว่าหนึ่งในห้าของช่วงทั้งหมดของกลุ่ม ซึ่งเป็นสเกลที่เหมาะสมที่จะยึดไว้

สองแถวตรงนั้นทำงานส่วนใหญ่ แถวแรกคือการเปรียบเทียบ 3.0 กับ 3.1: Alibaba ขยับขึ้น 54 Elo ในการอัปเดตเวอร์ชันครั้งเดียว โดยไม่เปลี่ยนราคาเลย นั่นเป็นจังหวะที่เร็วกว่าการขยับ 84 คะแนนจาก v3 สู่ v4 ของ ElevenLabs และหมายความว่าการจัดอันดับเฉพาะในบทความนี้เป็นเพียงภาพ ณ ขณะหนึ่งที่ผู้ให้บริการทั้งสองรายกำลังเปลี่ยนแปลงอย่างต่อเนื่อง
อันดับสองคือช่วงคะแนนรวม 121 จุด ช่องว่าง 21 จุดบนกระดานที่มีช่วงที่มีประโยชน์ประมาณ 120 จุดนั้นเป็นความแตกต่างที่มีอยู่จริงแต่ไม่มากนัก — โดยประมาณอยู่ในระดับเดียวกับช่องว่างระหว่าง Qwen 3.1 กับ 3.0 ของทาง Qwen เอง หากกรณีการใช้งานของคุณอยู่ในภาษาที่ทั้งสองโมเดลไม่ได้ถูกปรับจูนมาเพื่อภาษานั้น อัตราความต่างนั้นก็ยังอยู่ในวิสัยที่สคริปต์ทดสอบยาก ๆ ไม่กี่ชุดสามารถพลิกผลได้
ปัญหาเวอร์ชันที่ไม่มีใครทักท้วง
ผลลัพธ์ที่เผยแพร่ในชื่อ "Eleven v4 เป็นอันดับสองบน Controlled Voice" นั้นถูกต้องและไม่สมบูรณ์ และการละเว้นนี้มีความสำคัญสำหรับใครก็ตามที่วางแผนโดยอิงจากมัน โมเดลที่อยู่เหนือ Eleven v4 บนบอร์ดนั้นคือรุ่น 3.1 ของ Alibaba ส่วนรายการ Qwen บนบอร์ด Provider Voice นั้นเป็นรุ่น 3.0 — โมเดล 3.1 ไม่ปรากฏในแถวบนสุดของบอร์ดนั้นเท่าที่เราอ่าน ดังนั้นพาดหัวสองอัน — "Eleven v4 เป็นอันดับหนึ่ง" และ "Eleven v4 เป็นอันดับสอง" — เป็นข้อความเกี่ยวกับโมเดล Qwen สองรุ่นที่แตกต่างกันในสองงานที่แตกต่างกัน และเวอร์ชัน Qwen ที่เอาชนะมันบนบอร์ดหนึ่งไม่ใช่เวอร์ชัน Qwen ที่มันเอาชนะได้บนอีกบอร์ดหนึ่ง
นี่ไม่ใช่การจับผิดผู้จำหน่ายรายใดรายหนึ่ง แต่เป็นเหตุผลให้ไม่ไว้วางใจบทสรุปสั้น ๆ ประโยคเดียวของสัปดาห์แบบนี้ หากคุณกำลังเลือกระหว่างสองระบบนี้ การเปรียบเทียบที่คุณต้องการคือ 3.1 กับ v4 บนเสียงโคลนของคุณเอง ในภาษาของคุณเอง และไม่มีผู้จำหน่ายรายใดเผยแพร่สิ่งนั้น
สิ่งที่เราสามารถและไม่สามารถพูดเกี่ยวกับ Qwen Audio 3.1
ความซื่อตรงเกี่ยวกับหลักฐานมีค่ามากกว่าตารางสเปกแบบเต็ม ณ จุดนี้ ดังนั้นนี่คือขอบเขตของสิ่งที่บทความนี้อาศัยอยู่ จากกระดานอารีนาที่เรามี สำหรับ Qwen-Audio-3.1-TTS-Plus: ค่า Elo แบบควบคุมเสียงที่ 1,178 การปรับมาตรฐานราคาที่ 19.30 ดอลลาร์ต่อล้านตัวอักษร และข้อเท็จจริงที่ว่ามันเป็นรุ่นปัจจุบันในสายผลิตภัณฑ์ที่เวอร์ชันก่อนหน้าทำคะแนนได้ต่ำกว่า 54 คะแนนในราคาเดียวกัน
เราไม่มี และจะไม่เดเกี่ยวกับ: ความครอบคลุมภาษาของมัน ความหน่วงของมัน ขีดจำกัดอินพุตต่อคำขอของมัน ว่ามันรองรับคำสั่งการนำส่งแบบอินไลน์หรือไม่ ว่ามันเสนอการโคลนเสียงเกินกว่าแปดเสียงของอารีนาหรือไม่ หรือมันคิดค่าบริการตามเรตการ์ดของตัวเองอย่างไร สิ่งเหล่านั้นมีเอกสารระบุไว้ทั้งหมดสำหรับ Eleven v4 — มากกว่า 90 ภาษา ขีดจำกัด 10,000 ตัวอักษร แท็กเสียง การโคลนทันทีในสิบวินาที การรองรับหน่วยเสียง IPA — และการไม่มีสิ่งเหล่านี้ในฝั่ง Qwen เป็นช่องว่างในสิ่งที่เปิดเผยต่อสาธารณะ ไม่ใช่การตำหนิตัวโมเดล การตัดสินใจซื้อโดยอาศัยบทความนี้เพียงอย่างเดียวจะเป็นการตัดสินใจบนตัวเลขสองตัว

ความแตกต่างหนึ่งอย่างยังคงอยู่รอดจากข้อจำกัดนั้น เพราะทั้งสองฝั่งเป็นข้อมูลที่ผู้จำหน่ายระบุ หรือทั้งสองฝั่งเป็นข้อมูลที่คณะกรรมการระบุ ในด้านราคา การปรับมาตรฐานของคณะกรรมการคือตัวหารร่วม และมันสนับสนุน Qwen อยู่ 76% ในด้านคุณภาพภายใต้ผู้พูดที่จับคู่กัน คณะกรรมการชุดเดียวกันสนับสนุน Qwen อยู่ 21 Elo สองแถวนั้นเปรียบเทียบกันได้ ส่วนทุกอย่างอื่นที่นี่เปรียบเทียบกันไม่ได้ และบทความจะไม่แสร้งทำเป็นว่าเป็นเช่นนั้น
เหตุใดคณะกรรมการที่ถูกควบคุมจึงควรมีน้ำหนักมากกว่าปกติ
การเปรียบเทียบเสียงส่วนใหญ่มักยึดตามลีดเดอร์บอร์ดที่จัดให้โมเดลที่คุณชอบอยู่แล้วอยู่อันดับต้น ๆ ในการเปรียบเทียบครั้งนี้ มีเหตุผลเชิงหลักการที่ควรเลือก Controlled Voice และเหตุผลนั้นเป็นเหตุผลเฉพาะเจาะจง ไม่ใช่เหตุผลทั่วไป
Alibaba และ ElevenLabs กำลังแข่งขันกันด้วยสินทรัพย์ที่แตกต่างกันอย่างมาก ข้อได้เปรียบของ ElevenLabs คือไลบรารีเสียงที่สร้างขึ้นจากกระบวนการคัดเลือกนักพากย์ที่ดูแลมาหลายปี ส่วนข้อได้เปรียบของ Alibaba คือองค์กรวิจัยที่ปล่อยเวอร์ชันโมเดลด้วยจังหวะที่รวดเร็ว บอร์ดที่ให้ผู้เข้าแข่งขันแต่ละรายนำเสียงของตัวเองมา วัดไลบรารีพอ ๆ กับวัดตัวสังเคราะห์เสียง และบนบอร์ดนั้น ElevenLabs ชนะไป 61 คะแนน ถ้าตัดไลบรารีออก — ทุกคนใช้ผู้พูดที่ถูกโคลนแปดเสียงเหมือนกัน — ข้อได้เปรียบก็เปลี่ยนมือ ถ้าเสียงที่ผู้ใช้ของคุณได้ยินเป็นโคลนของบุคคลเฉพาะราย คุณไม่ได้กำลังซื้อไลบรารีของ ElevenLabs ดังนั้นบอร์ดแบบควบคุมคือบอร์ดที่อธิบายการซื้อของคุณ ถ้าคุณเลือกจากเมนูเสียงสำเร็จรูป กลับกัน และส่วนต่าง 61 คะแนนของ Eleven v4 คือตัวเลขที่คุ้มค่า
ยังมีเหตุผลประการที่สองที่ชวนอึดอัดกว่าในการให้น้ำหนักกับผลลัพธ์จากฝั่งที่ควบคุมไว้ คณะกรรมการที่ใช้เสียงจากผู้ขายจะให้คะแนนสูงกับทีมนักพากย์ชุดเริ่มต้นที่มีเอกลักษณ์ และทีมนักพากย์ที่มีเอกลักษณ์อาจสร้างความแตกแยกได้ในแบบที่ค่า Elo เฉลี่ยปกปิดเอาไว้ — สิ่งที่ผู้ฟังคนหนึ่งมองว่ามีเอกลักษณ์ อีกคนกลับมองว่าเสแสร้ง ส่วนคณะกรรมการที่ใช้เสียงโคลนซึ่งจับคู่ผู้พูดไว้แล้วจะขจัดตัวแปรนั้นออกไปทั้งหมด ซึ่งทำให้มันเป็นการวัดที่ทำซ้ำได้มากกว่าในบรรดาสองวิธีนี้
การรันอันใดอันหนึ่ง และสิ่งที่เราเราเตอร์จริง ๆ
OrcaRouter ไม่ได้เป็นผู้โฮสต์ทั้ง ElevenLabs และโมเดลเสียงพูดของ Alibaba ทั้งสองผู้ให้บริการไม่อยู่ในแค็ตตาล็อกของเรา ดังนั้นจึงไม่มีวิธีใดที่จะเรียกใช้ตัวใดตัวหนึ่งผ่านเราได้ และบทความนี้จะไม่เสนอแนะเป็นอย่างอื่น — สำหรับทั้งสองนั้น คุณต้องไปที่ API ของผู้ให้บริการเองและแพลตฟอร์มบุคคลที่สามหลายแห่ง
สิ่งที่เราครอบคลุมคือชั้นที่อยู่เหนือขึ้นไป หากสแตกเสียงพูดของคุณเป็นเพียงโหนดเดียวในไปป์ไลน์ที่ใหญ่กว่า เราให้บริการโมเดลมากกว่า 200 รายการผ่านคีย์ API เดียว โดยส่งต่อราคาตามรายการของผู้ให้บริการในอัตราบวกกำไร 0% ดังนั้นการปรับราคาที่ต้นทางใดก็ตาม — รวมถึงช่วงโปรโมชันของ ElevenLabs และราคาตามรายการที่สูงขึ้นมากซึ่งจะตามมาในวันที่ 12 ตุลาคม — จะสะท้อนอยู่ฝั่งเราในวันที่เกิดขึ้นจริง ไม่ใช่รอถึงรอบการเรียกเก็บเงินถัดไป สำหรับการตัดสินใจที่ขึ้นอยู่กับอัตราส่วนราคา 4 เท่า จังหวะเวลานั้นคือความแตกต่างระหว่างการเปรียบเทียบที่ยังใช้ได้ดีในระยะยาว กับการเปรียบเทียบที่อ่านแล้วผิดตั้งแต่สามสัปดาห์ให้หลัง
และในกรณีที่เส้นทางเสียงไม่สามารถล่มได้ การสลับไปยังระบบสำรองอัตโนมัติจะย้ายทราฟฟิกไปยังอัปสตรีมที่ยังทำงานปกติ แทนที่จะทำให้คำขอล้มเหลว. ในการเปรียบเทียบที่สูสีกันขนาดนี้ในด้านคุณภาพ และราคาแตกต่างกันมากขนาดนี้ สถาปัตยกรรมที่สมเหตุสมผลคือให้ทั้งสองโมเดลอยู่เบื้องหลังเอนด์พอยต์เดียว โดยมีระบบกำหนดเส้นทางเป็นตัวตัดสินการแบ่งสัดส่วน — ไม่ใช่การเลือกแบบถาวรจากสแนปช็อตของลีดเดอร์บอร์ดที่ผู้ขายทั้งสองรายจะทำให้เป็นโมฆะภายในหนึ่งไตรมาส
คำตัดสิน และวันหมดอายุของมัน
เลือก Qwen-Audio-3.1-TTS-Plus หากคุณกำลังโคลนเสียงและคำนึงถึงค่าใช้จ่าย มันเป็นอันดับหนึ่งบนกระดานที่ควบคุมผู้พูดให้คงที่ ราคาเพียงประมาณหนึ่งในสี่ และเส้นของมันกำลังขยับเร็วขึ้น — 54 Elo ในหนึ่งก้าวของเวอร์ชันที่อัตราไม่เปลี่ยน ชี้ว่าเวอร์ชันถัดไปเป็นตัวเลือกที่ดีกว่าตัวปัจจุบันบนกระดาษ
เลือก Eleven v4 ถ้าผู้ใช้ของคุณได้ยินเสียงสำเร็จรูป ถ้าคุณต้องการการรองรับในภาษาที่คุณตรวจสอบได้ก่อนปล่อยผลิตภัณฑ์ หรือถ้าชุดฟีเจอร์ที่มีเอกสารระบุ — แท็กเสียง, การควบคุมหน่วยเสียง, คำขอ 10,000 ตัวอักษร, การโคลนเสียงสิบวินาที — กำลังทำหน้าที่ในผลิตภัณฑ์ของคุณในแบบที่บอร์ด Arena ไม่ได้วัด ความนำ 61 คะแนนบนบอร์ดเสียงผู้ให้บริการไม่ใช่เรื่องเล็กน้อย และสองฟีเจอร์ที่คุณเขียนลงในสคริปต์ได้นั้นเป็นความสามารถ ไม่ใช่คะแนน
กำหนดวันทบทวน Alibaba ขยับ 54 Elo ในการอัปเดตเวอร์ชันรอบนี้ และ ElevenLabs ขยับ 84 ตลอดหนึ่งเจนเนอเรชันเต็ม และอัตราโปรโมชันของ Eleven v4 หมดอายุวันที่ 12 ตุลาคม ไม่ว่าการเปรียบเทียบนี้จะบอกอะไรในวันนี้ ข้อเท็จจริงสองข้อที่มีแนวโน้มที่สุดที่จะพลิกผล — การเปิดตัว 3.2 และราคาที่กลับไปเป็นเดิม — ต่างก็จะเกิดขึ้นก่อนสิ้นไตรมาส
