การ์ดหลักสำหรับ 'ElevenLabs Eleven v4 vs Qwen-Audio-3.1-TTS-Plus' พร้อมการ์ดคะแนนสองใบ: Qwen-Audio-3.1-TTS-Plus ที่ Elo 1,178 อันดับ 1 และ $19.30 ต่อ 1 ล้านตัวอักษร; ElevenLabs Eleven v4 ที่ Elo 1,157 อันดับ 2 และ $80.00 ต่อ 1 ล้านตัวอักษร; คำบรรยายว่า '21 คะแนน Elo เทียบกับช่องว่างราคาที่ต่างกันถึงสี่เท่า' ส่วนท้าย: 'Controlled Voice Arena ตามข้อมูลจาก Artificial Analysis, กันยายน 2026' โลโก้ OrcaRouter อยู่ที่มุมล่างขวา
Engineering & Research

Eleven v4 กับ Qwen Audio 3.1: เสียงที่ถูกที่สุดบนกระดานเป็นฝ่ายชนะ

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

บนกระดานที่ผู้เข้าแข่งขันทุกคนได้รับเสียงโคลนแปดเสียงชุดเดียวกัน Alibaba Qwen-Audio-3.1-TTS-Plus คว้าอันดับหนึ่งที่ Elo 1,178 และ ElevenLabs Eleven v4 คว้าอันดับสองที่ 1,157. โมเดลที่ชนะมีค่าใช้จ่าย $19.30 ต่อล้านตัวอักษรบนกระดานนั้น โมเดลที่ได้อันดับสองมีค่าใช้จ่าย $80.00 นั่นคือช่องว่างด้านคุณภาพ 21 จุด และช่องว่างด้านราคาถึงสี่เท่าที่ชี้ไปในทิศทางตรงกันข้าม และเป็นผลลัพธ์ที่น่าสนใจที่สุดในสัปดาห์เปิดตัวทั้งหมด — น่าสนใจกว่าอันดับหนึ่งที่ ElevenLabs คว้าได้ในอีกเวที เพราะบนเวทีนั้น การจัดอันดับเป็นไปตามปกติ และผู้ชนะคือเสียงที่แพงที่สุดในสิบอันดับแรก

กระดานทั้งสองใช้แทนกันไม่ได้ และเหตุผลที่การเปรียบเทียบนี้ให้ผลออกมาแบบนี้ก็ล้วนขึ้นอยู่กับว่าคุณดูกระดานอันไหน Provider Voice ให้ผู้ฟังตัดสินเสียงของผู้ให้บริการแต่ละรายเอง ส่วน Controlled Voice โคลนเสียงเดียวกันแปดเสียง — สี่เสียงสหรัฐฯ สี่เสียงสหราชอาณาจักร — ให้กับทุกโมเดล ดังนั้นจึงไม่มีใครชนะได้เพราะชุดเสียงเริ่มต้นของตัวเอง ElevenLabs ชนะอันแรกด้วย 61 คะแนน Alibaba ชนะอันที่สองด้วย 21 คะแนน ไม่มีกระดานไหนผิด และอันที่สองคืออันที่ทำนายผลิตภัณฑ์ที่จะวางจำหน่ายพร้อมเสียงแบรนด์ที่โคลนมา

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

สกอร์บอร์ดแบบควบคุมเสียง ฉบับเต็ม

• การทดสอบความชอบแบบไม่เปิดเผย โดยใช้เสียงโคลนที่จับคู่กัน — Qwen-Audio-3.1-TTS-Plus อยู่อันดับ 1 คะแนน Elo 1,178 ราคา $19.30 ต่อล้านตัวอักษร เทียบกับ Eleven v4 อยู่อันดับ 2 คะแนน Elo 1,157 ราคา $80.00

• การเลือกแบบไม่เปิดเผยชื่อ โดยใช้เสียงของแต่ละผู้ให้บริการเอง — Eleven v4 อันดับ 1, Elo 1,319 เทียบกับ Qwen-Audio-3.0-TTS-Plus อันดับ 4, Elo 1,258 ช่องว่าง 61 คะแนนในทิศทางตรงกันข้าม

• ราคา, การปรับมาตรฐานอารีนา — Qwen $19.30 เทียบกับ Eleven v4 $80.00 Qwen ถูกกว่า 76%

• ราคา, บัตรราคาผู้ขาย — Eleven v4 $0.022 ต่อพันตัวอักษรในราคาโปรโมชัน และ $0.08 หลังวันที่ 12 ตุลาคม บัตรราคาของ Qwen Audio 3.1 เองไม่ใช่สิ่งที่เราอ่านได้ ดังนั้นการปรับมาตรฐานของอารีน่า (arena normalisation) จึงเป็นราคาเดียวที่เราเปรียบเทียบได้

• เวอร์ชันบนบอร์ดแต่ละตัว — 3.1 บน Controlled Voice, 3.0 บน Provider Voice ทั้งสองเป็นโมเดลที่แตกต่างกัน และบอร์ดไม่สามารถใช้สลับกันได้

• รายการ 3.0 บน Controlled Voice — อันดับ 5, Elo 1,124, ราคา $19.30 เท่ากัน การเปิดตัว 3.1 ให้ค่า Elo มากกว่ารุ่นก่อนหน้าของตัวเอง 54 Elo ที่ราคาเดียวกัน

• เจเนอเรชันก่อนหน้าของ Qwen บน Provider Voice — Qwen3 TTS Flash อันดับ 79, Elo 944; Qwen3 TTS อันดับ 82, Elo 930

• เรือธงรุ่นก่อนหน้าของ ElevenLabs เองใน Controlled Voice — Eleven v3 อยู่อันดับ 7, Elo 1,073

• การตรวจสอบความสมเหตุสมผลแบบแผนภูมิแท่งกลุ่ม — การกระจายแบบแปดทางจากอันดับ 1 ถึงอันดับ 10 บน Controlled Voice คือ 121 Elo ส่วนต่าง 21 คะแนนที่ Qwen นำหน้า Eleven v4 นั้นน้อยกว่าหนึ่งในห้าของช่วงทั้งหมดของกลุ่ม ซึ่งเป็นสเกลที่เหมาะสมที่จะยึดไว้

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

สองแถวตรงนั้นทำงานส่วนใหญ่ แถวแรกคือการเปรียบเทียบ 3.0 กับ 3.1: Alibaba ขยับขึ้น 54 Elo ในการอัปเดตเวอร์ชันครั้งเดียว โดยไม่เปลี่ยนราคาเลย นั่นเป็นจังหวะที่เร็วกว่าการขยับ 84 คะแนนจาก v3 สู่ v4 ของ ElevenLabs และหมายความว่าการจัดอันดับเฉพาะในบทความนี้เป็นเพียงภาพ ณ ขณะหนึ่งที่ผู้ให้บริการทั้งสองรายกำลังเปลี่ยนแปลงอย่างต่อเนื่อง

อันดับสองคือช่วงคะแนนรวม 121 จุด ช่องว่าง 21 จุดบนกระดานที่มีช่วงที่มีประโยชน์ประมาณ 120 จุดนั้นเป็นความแตกต่างที่มีอยู่จริงแต่ไม่มากนัก — โดยประมาณอยู่ในระดับเดียวกับช่องว่างระหว่าง Qwen 3.1 กับ 3.0 ของทาง Qwen เอง หากกรณีการใช้งานของคุณอยู่ในภาษาที่ทั้งสองโมเดลไม่ได้ถูกปรับจูนมาเพื่อภาษานั้น อัตราความต่างนั้นก็ยังอยู่ในวิสัยที่สคริปต์ทดสอบยาก ๆ ไม่กี่ชุดสามารถพลิกผลได้

ปัญหาเวอร์ชันที่ไม่มีใครทักท้วง

ผลลัพธ์ที่เผยแพร่ในชื่อ "Eleven v4 เป็นอันดับสองบน Controlled Voice" นั้นถูกต้องและไม่สมบูรณ์ และการละเว้นนี้มีความสำคัญสำหรับใครก็ตามที่วางแผนโดยอิงจากมัน โมเดลที่อยู่เหนือ Eleven v4 บนบอร์ดนั้นคือรุ่น 3.1 ของ Alibaba ส่วนรายการ Qwen บนบอร์ด Provider Voice นั้นเป็นรุ่น 3.0 — โมเดล 3.1 ไม่ปรากฏในแถวบนสุดของบอร์ดนั้นเท่าที่เราอ่าน ดังนั้นพาดหัวสองอัน — "Eleven v4 เป็นอันดับหนึ่ง" และ "Eleven v4 เป็นอันดับสอง" — เป็นข้อความเกี่ยวกับโมเดล Qwen สองรุ่นที่แตกต่างกันในสองงานที่แตกต่างกัน และเวอร์ชัน Qwen ที่เอาชนะมันบนบอร์ดหนึ่งไม่ใช่เวอร์ชัน Qwen ที่มันเอาชนะได้บนอีกบอร์ดหนึ่ง

นี่ไม่ใช่การจับผิดผู้จำหน่ายรายใดรายหนึ่ง แต่เป็นเหตุผลให้ไม่ไว้วางใจบทสรุปสั้น ๆ ประโยคเดียวของสัปดาห์แบบนี้ หากคุณกำลังเลือกระหว่างสองระบบนี้ การเปรียบเทียบที่คุณต้องการคือ 3.1 กับ v4 บนเสียงโคลนของคุณเอง ในภาษาของคุณเอง และไม่มีผู้จำหน่ายรายใดเผยแพร่สิ่งนั้น

สิ่งที่เราสามารถและไม่สามารถพูดเกี่ยวกับ Qwen Audio 3.1

ความซื่อตรงเกี่ยวกับหลักฐานมีค่ามากกว่าตารางสเปกแบบเต็ม ณ จุดนี้ ดังนั้นนี่คือขอบเขตของสิ่งที่บทความนี้อาศัยอยู่ จากกระดานอารีนาที่เรามี สำหรับ Qwen-Audio-3.1-TTS-Plus: ค่า Elo แบบควบคุมเสียงที่ 1,178 การปรับมาตรฐานราคาที่ 19.30 ดอลลาร์ต่อล้านตัวอักษร และข้อเท็จจริงที่ว่ามันเป็นรุ่นปัจจุบันในสายผลิตภัณฑ์ที่เวอร์ชันก่อนหน้าทำคะแนนได้ต่ำกว่า 54 คะแนนในราคาเดียวกัน

เราไม่มี และจะไม่เดเกี่ยวกับ: ความครอบคลุมภาษาของมัน ความหน่วงของมัน ขีดจำกัดอินพุตต่อคำขอของมัน ว่ามันรองรับคำสั่งการนำส่งแบบอินไลน์หรือไม่ ว่ามันเสนอการโคลนเสียงเกินกว่าแปดเสียงของอารีนาหรือไม่ หรือมันคิดค่าบริการตามเรตการ์ดของตัวเองอย่างไร สิ่งเหล่านั้นมีเอกสารระบุไว้ทั้งหมดสำหรับ Eleven v4 — มากกว่า 90 ภาษา ขีดจำกัด 10,000 ตัวอักษร แท็กเสียง การโคลนทันทีในสิบวินาที การรองรับหน่วยเสียง IPA — และการไม่มีสิ่งเหล่านี้ในฝั่ง Qwen เป็นช่องว่างในสิ่งที่เปิดเผยต่อสาธารณะ ไม่ใช่การตำหนิตัวโมเดล การตัดสินใจซื้อโดยอาศัยบทความนี้เพียงอย่างเดียวจะเป็นการตัดสินใจบนตัวเลขสองตัว

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

ความแตกต่างหนึ่งอย่างยังคงอยู่รอดจากข้อจำกัดนั้น เพราะทั้งสองฝั่งเป็นข้อมูลที่ผู้จำหน่ายระบุ หรือทั้งสองฝั่งเป็นข้อมูลที่คณะกรรมการระบุ ในด้านราคา การปรับมาตรฐานของคณะกรรมการคือตัวหารร่วม และมันสนับสนุน Qwen อยู่ 76% ในด้านคุณภาพภายใต้ผู้พูดที่จับคู่กัน คณะกรรมการชุดเดียวกันสนับสนุน Qwen อยู่ 21 Elo สองแถวนั้นเปรียบเทียบกันได้ ส่วนทุกอย่างอื่นที่นี่เปรียบเทียบกันไม่ได้ และบทความจะไม่แสร้งทำเป็นว่าเป็นเช่นนั้น

เหตุใดคณะกรรมการที่ถูกควบคุมจึงควรมีน้ำหนักมากกว่าปกติ

การเปรียบเทียบเสียงส่วนใหญ่มักยึดตามลีดเดอร์บอร์ดที่จัดให้โมเดลที่คุณชอบอยู่แล้วอยู่อันดับต้น ๆ ในการเปรียบเทียบครั้งนี้ มีเหตุผลเชิงหลักการที่ควรเลือก Controlled Voice และเหตุผลนั้นเป็นเหตุผลเฉพาะเจาะจง ไม่ใช่เหตุผลทั่วไป

Alibaba และ ElevenLabs กำลังแข่งขันกันด้วยสินทรัพย์ที่แตกต่างกันอย่างมาก ข้อได้เปรียบของ ElevenLabs คือไลบรารีเสียงที่สร้างขึ้นจากกระบวนการคัดเลือกนักพากย์ที่ดูแลมาหลายปี ส่วนข้อได้เปรียบของ Alibaba คือองค์กรวิจัยที่ปล่อยเวอร์ชันโมเดลด้วยจังหวะที่รวดเร็ว บอร์ดที่ให้ผู้เข้าแข่งขันแต่ละรายนำเสียงของตัวเองมา วัดไลบรารีพอ ๆ กับวัดตัวสังเคราะห์เสียง และบนบอร์ดนั้น ElevenLabs ชนะไป 61 คะแนน ถ้าตัดไลบรารีออก — ทุกคนใช้ผู้พูดที่ถูกโคลนแปดเสียงเหมือนกัน — ข้อได้เปรียบก็เปลี่ยนมือ ถ้าเสียงที่ผู้ใช้ของคุณได้ยินเป็นโคลนของบุคคลเฉพาะราย คุณไม่ได้กำลังซื้อไลบรารีของ ElevenLabs ดังนั้นบอร์ดแบบควบคุมคือบอร์ดที่อธิบายการซื้อของคุณ ถ้าคุณเลือกจากเมนูเสียงสำเร็จรูป กลับกัน และส่วนต่าง 61 คะแนนของ Eleven v4 คือตัวเลขที่คุ้มค่า

ยังมีเหตุผลประการที่สองที่ชวนอึดอัดกว่าในการให้น้ำหนักกับผลลัพธ์จากฝั่งที่ควบคุมไว้ คณะกรรมการที่ใช้เสียงจากผู้ขายจะให้คะแนนสูงกับทีมนักพากย์ชุดเริ่มต้นที่มีเอกลักษณ์ และทีมนักพากย์ที่มีเอกลักษณ์อาจสร้างความแตกแยกได้ในแบบที่ค่า Elo เฉลี่ยปกปิดเอาไว้ — สิ่งที่ผู้ฟังคนหนึ่งมองว่ามีเอกลักษณ์ อีกคนกลับมองว่าเสแสร้ง ส่วนคณะกรรมการที่ใช้เสียงโคลนซึ่งจับคู่ผู้พูดไว้แล้วจะขจัดตัวแปรนั้นออกไปทั้งหมด ซึ่งทำให้มันเป็นการวัดที่ทำซ้ำได้มากกว่าในบรรดาสองวิธีนี้

การรันอันใดอันหนึ่ง และสิ่งที่เราเราเตอร์จริง ๆ

OrcaRouter ไม่ได้เป็นผู้โฮสต์ทั้ง ElevenLabs และโมเดลเสียงพูดของ Alibaba ทั้งสองผู้ให้บริการไม่อยู่ในแค็ตตาล็อกของเรา ดังนั้นจึงไม่มีวิธีใดที่จะเรียกใช้ตัวใดตัวหนึ่งผ่านเราได้ และบทความนี้จะไม่เสนอแนะเป็นอย่างอื่น — สำหรับทั้งสองนั้น คุณต้องไปที่ API ของผู้ให้บริการเองและแพลตฟอร์มบุคคลที่สามหลายแห่ง

สิ่งที่เราครอบคลุมคือชั้นที่อยู่เหนือขึ้นไป หากสแตกเสียงพูดของคุณเป็นเพียงโหนดเดียวในไปป์ไลน์ที่ใหญ่กว่า เราให้บริการโมเดลมากกว่า 200 รายการผ่านคีย์ API เดียว โดยส่งต่อราคาตามรายการของผู้ให้บริการในอัตราบวกกำไร 0% ดังนั้นการปรับราคาที่ต้นทางใดก็ตาม — รวมถึงช่วงโปรโมชันของ ElevenLabs และราคาตามรายการที่สูงขึ้นมากซึ่งจะตามมาในวันที่ 12 ตุลาคม — จะสะท้อนอยู่ฝั่งเราในวันที่เกิดขึ้นจริง ไม่ใช่รอถึงรอบการเรียกเก็บเงินถัดไป สำหรับการตัดสินใจที่ขึ้นอยู่กับอัตราส่วนราคา 4 เท่า จังหวะเวลานั้นคือความแตกต่างระหว่างการเปรียบเทียบที่ยังใช้ได้ดีในระยะยาว กับการเปรียบเทียบที่อ่านแล้วผิดตั้งแต่สามสัปดาห์ให้หลัง

และในกรณีที่เส้นทางเสียงไม่สามารถล่มได้ การสลับไปยังระบบสำรองอัตโนมัติจะย้ายทราฟฟิกไปยังอัปสตรีมที่ยังทำงานปกติ แทนที่จะทำให้คำขอล้มเหลว. ในการเปรียบเทียบที่สูสีกันขนาดนี้ในด้านคุณภาพ และราคาแตกต่างกันมากขนาดนี้ สถาปัตยกรรมที่สมเหตุสมผลคือให้ทั้งสองโมเดลอยู่เบื้องหลังเอนด์พอยต์เดียว โดยมีระบบกำหนดเส้นทางเป็นตัวตัดสินการแบ่งสัดส่วน — ไม่ใช่การเลือกแบบถาวรจากสแนปช็อตของลีดเดอร์บอร์ดที่ผู้ขายทั้งสองรายจะทำให้เป็นโมฆะภายในหนึ่งไตรมาส

คำตัดสิน และวันหมดอายุของมัน

เลือก Qwen-Audio-3.1-TTS-Plus หากคุณกำลังโคลนเสียงและคำนึงถึงค่าใช้จ่าย มันเป็นอันดับหนึ่งบนกระดานที่ควบคุมผู้พูดให้คงที่ ราคาเพียงประมาณหนึ่งในสี่ และเส้นของมันกำลังขยับเร็วขึ้น — 54 Elo ในหนึ่งก้าวของเวอร์ชันที่อัตราไม่เปลี่ยน ชี้ว่าเวอร์ชันถัดไปเป็นตัวเลือกที่ดีกว่าตัวปัจจุบันบนกระดาษ

เลือก Eleven v4 ถ้าผู้ใช้ของคุณได้ยินเสียงสำเร็จรูป ถ้าคุณต้องการการรองรับในภาษาที่คุณตรวจสอบได้ก่อนปล่อยผลิตภัณฑ์ หรือถ้าชุดฟีเจอร์ที่มีเอกสารระบุ — แท็กเสียง, การควบคุมหน่วยเสียง, คำขอ 10,000 ตัวอักษร, การโคลนเสียงสิบวินาที — กำลังทำหน้าที่ในผลิตภัณฑ์ของคุณในแบบที่บอร์ด Arena ไม่ได้วัด ความนำ 61 คะแนนบนบอร์ดเสียงผู้ให้บริการไม่ใช่เรื่องเล็กน้อย และสองฟีเจอร์ที่คุณเขียนลงในสคริปต์ได้นั้นเป็นความสามารถ ไม่ใช่คะแนน

กำหนดวันทบทวน Alibaba ขยับ 54 Elo ในการอัปเดตเวอร์ชันรอบนี้ และ ElevenLabs ขยับ 84 ตลอดหนึ่งเจนเนอเรชันเต็ม และอัตราโปรโมชันของ Eleven v4 หมดอายุวันที่ 12 ตุลาคม ไม่ว่าการเปรียบเทียบนี้จะบอกอะไรในวันนี้ ข้อเท็จจริงสองข้อที่มีแนวโน้มที่สุดที่จะพลิกผล — การเปิดตัว 3.2 และราคาที่กลับไปเป็นเดิม — ต่างก็จะเกิดขึ้นก่อนสิ้นไตรมาส

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube