![การ์ดฮีโร่ที่สร้างขึ้นสำหรับ ElevenLabs Eleven v4 โดยมีสองแผง: ด้านซ้ายเป็นบล็อกสคริปต์ที่แสดงแท็กเสียงแบบอินไลน์ เช่น [laughs], [whispers] และ [said angrily in French accent]; ด้านขวาเป็นแผงที่ระบุอันดับ 1, Elo 1,319, $80.00 ต่อ 1M ตัวอักษร และจำนวนการปรากฏ 1,674 ครั้งบน Provider Voice Arena ของ Artificial Analysis พร้อมข้อความส่วนท้ายว่า 'อันดับ Provider Voice, Elo และราคาตามข้อมูลของ Artificial Analysis, กันยายน 2026; ไวยากรณ์แท็กและความหน่วงเป็นข้อมูลที่ผู้จำหน่ายจัดทำเอกสารไว้' โลโก้ OrcaRouter อยู่ที่มุมขวาล่าง](https://cms.orcarouter.ai/api/media/file/1-1462.png)
Audio Tags และการโคลนเสียงสิบวินาทีของ Eleven v4: สิ่งที่เปลี่ยนไปในไปป์ไลน์ของคุณ
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 982 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 197 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
สิ่งที่สำคัญที่สุดเกี่ยวกับ ElevenLabs Eleven v4 ไม่ใช่ Elo ของมัน แต่คือความที่โมเดลอ่านคำสั่งกำกับที่เขียนไว้ในสคริปต์ได้ — [หัวเราะ], [กระซิบ], [ถอนหายใจ], [พูดด้วยความโกรธเป็นสำเนียงฝรั่งเศส], แม้กระทั่ง [ฝนตกเบา ๆ] — และความที่ ElevenLabs Eleven v4 Turbo ซึ่งเป็นรุ่นพี่น้องที่มีความหน่วงต่ำและเปิดตัววันเดียวกัน ทำตามแท็กเดียวกันได้ โดยมีค่ามัธยฐานของเวลาถึงเสียงพูดแรกที่ผู้ขายระบุไว้ที่ประมาณ 150 มิลลิวินาที ทั้งสองรุ่นเปิดให้ใช้งานทั่วไปเมื่อวันที่ 28 กันยายน 2026 Provider Voice Arena ของ Artificial Analysis จัดให้ Eleven v4 อยู่อันดับ 1 ด้วย Elo 1,319 จากการปรากฏ 1,674 ครั้ง ในราคาบอร์ด 80.00 ดอลลาร์ต่อล้านตัวอักษร การจัดอันดับคือพาดหัวข่าว ส่วนไวยากรณ์คำสั่งกำกับและการโคลนเสียงในสิบวินาทีคือส่วนที่เปลี่ยนสิ่งที่คุณต้องสร้าง
![A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.](https://cms.orcarouter.ai/api/media/file/2-1397.png)
สองโมเดล เปิดตัวครั้งเดียว หน้าที่ต่างกัน
เมื่อวันที่ 28 กันยายน 2026 ElevenLabs ได้เปิดตัวเอนด์พอยต์สองรายการ และทั้งสองไม่ใช่ผลิตภัณฑ์เดียวกันที่เพียงสลับความเร็วได้ ElevenLabs Eleven v4เป็นโมเดลที่เน้นการแสดงออก รองรับกว่า 90 ภาษา จำกัด 10,000 ตัวอักษรต่อคำขอ รองรับสัทอักษรสากล (International Phonetic Alphabet) ที่ดีขึ้นสำหรับการออกเสียงแบบกำหนดเอง และบทสนทนาหลายผู้พูดที่บริษัทระบุว่าคงเอกลักษณ์ของผู้พูดไว้ได้ตลอดทั้งฉาก ElevenLabs Eleven v4 Turboยังคงรองรับกว่า 90 ภาษาและข้อจำกัด 10,000 ตัวอักษรเช่นเดิม แต่ปรับแต่งมาสำหรับเอเจนต์ — ประกาศระบุค่ามัธยฐานความหน่วงในการประมวลผลประมาณ 100 มิลลิวินาที และค่ามัธยฐานเวลาถึงเสียงพูดแรกประมาณ 150 มิลลิวินาที ซึ่งวัดโดย ElevenLabs ในเดือนกันยายน 2026

คำถามเชิงปฏิบัติ — โมเดลเรือธงเร็วพอสำหรับเอเจนต์ทางโทรศัพท์หรือไม่ — ยังไม่มีคำตอบที่เผยแพร่ออกมา ElevenLabs ให้ตัวเลขความหน่วงสำหรับ Turbo ไม่ใช่สำหรับ Eleven v4 เอง และทั้งสองเป็นเอนด์พอยต์ที่แยกจากกัน ไม่ใช่โมเดลเดียวที่ใช้สองชื่อ หากงบเวลาของเอเจนต์คุณอยู่ที่ 200 มิลลิวินาทีถึงเสียงแรก Turbo คือเอนด์พอยต์ที่ระบุไว้ในเอกสาร ส่วนโมเดลเรือธงไม่ใช่
แท็กเหล่านี้เป็นอินเทอร์เฟซจริง และเป็นดีเพนเดนซีจริง
แท็กเสียงแบบอินไลน์ไม่ใช่เรื่องใหม่สำหรับการสังเคราะห์เสียงพูด แต่การเปลี่ยนแปลงที่มีประโยชน์ตรงนี้คือความแม่นยำในการทำตามคำสั่ง ประกาศระบุว่า Eleven v4 ทำตามแท็กเสียงและพรอมต์คำสั่งแบบภาษาธรรมชาติได้แม่นยำกว่าโมเดลก่อนหน้า และนี่คือวิธีที่คุณสั่งให้หัวเราะ กระซิบ หรือพูดด้วยสำเนียงเฉพาะได้ โดยไม่ต้องแก้ไขเสียงในภายหลัง
ผลที่ตามมาในทางปฏิบัติสามประการมีดังนี้ และสิ่งเหล่านี้สำคัญกว่าคลิปวิดีโอสาธิต:
• สคริปต์ของคุณกลายเป็นอาร์ติแฟกต์แบบเทมเพลต ไม่ใช่สตริง แท็กคือโทเคนในไปป์ไลน์เนื้อหาของคุณ: มันต้องมีการ escape หากข้อความที่ไม่น่าเชื่อถือถูกส่งผ่านเข้ามา และมันต้องอยู่รอดผ่าน CMS เลเยอร์การแปล และการตรวจทาน diff ของคุณ นักแปลที่ทิ้ง [กระซิบ] ไป ได้เปลี่ยนการแสดงอย่างเงียบ ๆ
• การปฏิบัติตามแท็กเป็นคำกล่าวอ้างของผู้ให้บริการที่ผูกกับเวอร์ชันหนึ่ง คำกล่าวอ้างว่าโมเดลรุ่นนี้ทำตามแท็กได้ดีกว่ารุ่นก่อนเป็นของ ElevenLabs เอง ทดสอบโดย ElevenLabs เอง และจะไม่เป็นจริงเหมือนกันในทุกภาษา ควรตรวจสอบกับสคริปต์และโลแคลของคุณเองก่อนที่คุณจะสร้างสไตล์ไกด์จากสิ่งนี้
• แท็กเสียงเอฟเฟกต์อย่าง [light rain] หรือ [phone buzzing] ย้ายงานบางส่วนของงานหลังการผลิตเสียงเข้ามาอยู่ในพรอมป์ข้อความ นั่นคือการเปลี่ยนภาระต้นทุนที่ควรค่าแก่การวัด: หากแท็กหนึ่งแทนที่การทำโฟลีย์หนึ่งรอบ มันก็ประหยัด แต่หากมันไม่ได้แทนที่อะไรเลยและเพียงเพิ่มความแปรปรวน มันก็คือโหมดความล้มเหลวรูปแบบใหม่ในกระบวนการ QA ของคุณ
10 วินาทีคือตัวเลขที่เปลี่ยนการ onboarding
Instant Voice Cloning ในเวอร์ชันนี้จับเสียงได้อย่างแม่นยำสูงจากเสียงตัวอย่างเพียงสิบวินาที โดยยังมีระดับการโคลนแบบมืออาชีพที่สูงกว่านั้นให้ใช้งานอยู่ สิบวินาทีสั้นพอที่จะยุบขั้นตอนในเวิร์กโฟลว์ลง: การเก็บความยินยอม การอัปโหลดตัวอย่าง และการสังเคราะห์ครั้งแรกสามารถทำได้ในคราวเดียว บนมือถือ โดยไม่ต้องมีสตูดิโอ
ปัญหาความยินยอมไม่ได้ลดลงตามจำนวนตัวอย่าง แต่กลับเพิ่มขึ้น เพราะเกณฑ์ในการสร้างเสียงโคลนที่ฟังดูสมจริงได้ลดลงเหลือเพียงคลิปเสียงที่ใครก็บันทึกได้ หากคุณกำลังโคลนเสียงที่คุณไม่ได้เป็นเจ้าของ คำถามด้านการปฏิบัติตามข้อกำหนดตอนนี้เป็นเรื่องที่คุณต้องตอบเองทั้งหมดก่อนการเรียก API — โมเดลจะทำตามที่คุณสั่ง จงมองตัวเลขสิบวินาทีเป็นเกณฑ์เชิงปฏิบัติการ ไม่ใช่ใบอนุญาต
ค่าใช้จ่ายในช่วงที่โอกาสยังเปิดอยู่
ElevenLabs ปรับราคาใหม่ตอนเปิดตัว และอัตราโปรโมชั่นคือราคาที่อยู่บนหน้าเว็บวันนี้ ในตารางราคา API นั้น Eleven v4 ระบุไว้ที่ $0.022 ต่อ 1,000 ตัวอักษร เทียบกับราคาที่ประกาศไว้ $0.08 และ Eleven v4 Turbo ที่ $0.011 เทียบกับ $0.04 ทั้งคู่มีป้ายกำกับเดียวกัน: ลด 72% ถึงวันที่ 12 ตุลาคม หน้าเดียวกันนี้ตั้งราคาเรือธงรุ่นก่อนอย่าง Eleven v3 ไว้ที่ $0.08 ต่อ 1,000 ตัวอักษร
• ราคาบนกระดานในอารีนา ต่อล้านตัวอักษร — Eleven v4 $80.00 สูงที่สุดในสิบอันดับแรกของกระดานนั้น
• ตารางราคาของผู้ขาย ต่อพันตัวอักษร — $0.022 จนถึงวันที่ 12 ตุลาคม จากนั้น $0.08
• สิ่งนี้หมายความว่าอย่างไรในทางปฏิบัติ — เดือนที่มีการใช้งานสคริปต์หนักถึงห้าล้านตัวอักษร มีค่าใช้จ่าย 110 ดอลลาร์ในช่วงเวลาดังกล่าว และ 400 ดอลลาร์หลังจากนั้น บนเอนด์พอยต์เดียวกันด้วยโค้ดเดียวกัน

ใครก็ตามที่กำลังจัดงบสำหรับไตรมาส 1 โดยอิงจากตัวเลขที่อยู่บนหน้านี้ในวันนี้ กำลังจัดงบโดยอิงจากตัวเลขที่จะหมดอายุในอีกสองสัปดาห์ ให้ใช้ $0.08
จุดที่เราเตอร์พิสูจน์คุณค่าของตัวเองในงานเปิดตัวแบบนี้
OrcaRouter ไม่ได้โฮสต์ ElevenLabs ดังนั้นในงานเปิดตัวนี้จึงไม่มีอะไรให้เรียกผ่านเรา และเราจะไม่สื่อเป็นนัยเป็นอย่างอื่น — จุดที่ควรเรียก Eleven v4 คือ API ของ ElevenLabs เอง สิ่งที่คีย์เดียวมีประโยชน์จริง ๆ ในช่วงสองสัปดาห์หลังการเปิดตัวก็คือการเปรียบเทียบ หากคุณกำลังตัดสินใจว่ารุ่นเรือธงใหม่จะดีกว่าสิ่งที่คุณใช้อยู่หรือไม่ คุณย่อมต้องการทดสอบ A/B ทั้งสองบนสคริปต์ของคุณเองมากกว่าบนกระดานจัดอันดับ และการทำเช่นนั้นข้ามผู้ให้บริการสองรายหมายถึงบัญชีสองบัญชี ความสัมพันธ์ด้านการเรียกเก็บเงินสองชุด และเส้นทางการผสานรวมสองเส้นทาง ก่อนที่คุณจะได้คำตอบ
นั่นคือกรณีที่เราจัดการ: API key เดียวใช้ได้กับโมเดลกว่า 200 รายการ โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านที่มาร์กอัป 0% ดังนั้นเมื่อผู้ขายปรับราคา — รวมถึงช่วงโปรโมชันที่มีวันหมดอายุ — ฝั่งเราจะอัปเดตให้สดทันทีในวันเดียวกัน แทนที่จะรอถึงรอบบิลถัดไป ในกรณีที่เส้นทางเสียงเป็นส่วนที่ลูกค้าใช้งานโดยตรง ระบบสำรองอัตโนมัติจะย้ายทราฟฟิกไปยัง upstream ที่ยังทำงานปกติเมื่อ endpoint หนึ่งเริ่มมีปัญหา ซึ่งนี่คือวิธีที่คุณทดลองโมเดลใหม่ล่าสุดได้โดยไม่ต้องเดิมพันการเปิดตัวทั้งครั้งไว้กับมัน
ควรทดสอบอะไรก่อน และควรเพิกเฉยต่ออะไร
การตรวจสอบสามข้อจะบอกคุณได้มากกว่าการจัดอันดับใด ๆ ข้อแรก ลองรันสคริปต์ที่สมจริงและยาวที่สุดของคุณผ่านขีดจำกัด 10,000 ตัวอักษร แล้วดูว่ารอยต่อตกอยู่ตรงไหน — ขีดจำกัดนี้คิดต่อคำขอ และบทสนทนาที่มีผู้พูดหลายคนคือฟีเจอร์ที่มีแนวโน้มจะถูกแบ่งด้วยขีดจำกัดนี้มากที่สุด ข้อสอง ใส่ห้าประโยคของคุณเองที่มีแท็กลงในทั้ง v4 และ v4 Turbo แล้วฟังการคลาดเคลื่อนของการทำตามแท็กระหว่างปลายทางแบบแสดงอารมณ์กับปลายทางแบบความหน่วงต่ำ พวกมันเป็นโมเดลคนละตัว และแท็กที่ได้ผลบนตัวหนึ่งอาจไม่ได้ผลเหมือนกันบนอีกตัว ข้อสาม คิดราคาปริมาณตัวอักษรต่อเดือนจริงของคุณที่ $0.08 แทนที่จะเป็น $0.022 เพราะนั่นคือตัวเลขที่ไตรมาสถัดไปของคุณดำเนินไปบนนั้น
ตัวเลขความชอบแบบไม่เปิดเผย ~75% ในประกาศเป็นการวัดจากผู้ขาย และเราจะไม่นำมันไปแปรรูปเป็นสิ่งอื่นใด ตัวเลขอิสระในการเปิดตัวนี้คือตัวเลขบนกระดาน: อันดับหนึ่งที่ 1,319 Elo จากการปรากฏตัว 1,674 ครั้ง และช่วงประมาณ ±19 คะแนนโดยรอบ นั่นเป็นผลลัพธ์ที่แข็งแกร่งบนกระดานจริง มันไม่ใช่ข้อกำหนด และมันจะไม่บอกคุณว่าไวยากรณ์แท็กของคุณจะรอดจากการแปลหรือไม่
