การ์ดฮีโร่ที่สร้างขึ้นสำหรับ ElevenLabs Eleven v4 โดยมีสองแผง: ด้านซ้ายเป็นบล็อกสคริปต์ที่แสดงแท็กเสียงแบบอินไลน์ เช่น [laughs], [whispers] และ [said angrily in French accent]; ด้านขวาเป็นแผงที่ระบุอันดับ 1, Elo 1,319, $80.00 ต่อ 1M ตัวอักษร และจำนวนการปรากฏ 1,674 ครั้งบน Provider Voice Arena ของ Artificial Analysis พร้อมข้อความส่วนท้ายว่า 'อันดับ Provider Voice, Elo และราคาตามข้อมูลของ Artificial Analysis, กันยายน 2026; ไวยากรณ์แท็กและความหน่วงเป็นข้อมูลที่ผู้จำหน่ายจัดทำเอกสารไว้' โลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Engineering & Research

Audio Tags และการโคลนเสียงสิบวินาทีของ Eleven v4: สิ่งที่เปลี่ยนไปในไปป์ไลน์ของคุณ

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สิ่งที่สำคัญที่สุดเกี่ยวกับ ElevenLabs Eleven v4 ไม่ใช่ Elo ของมัน แต่คือความที่โมเดลอ่านคำสั่งกำกับที่เขียนไว้ในสคริปต์ได้ — [หัวเราะ], [กระซิบ], [ถอนหายใจ], [พูดด้วยความโกรธเป็นสำเนียงฝรั่งเศส], แม้กระทั่ง [ฝนตกเบา ๆ] — และความที่ ElevenLabs Eleven v4 Turbo ซึ่งเป็นรุ่นพี่น้องที่มีความหน่วงต่ำและเปิดตัววันเดียวกัน ทำตามแท็กเดียวกันได้ โดยมีค่ามัธยฐานของเวลาถึงเสียงพูดแรกที่ผู้ขายระบุไว้ที่ประมาณ 150 มิลลิวินาที ทั้งสองรุ่นเปิดให้ใช้งานทั่วไปเมื่อวันที่ 28 กันยายน 2026 Provider Voice Arena ของ Artificial Analysis จัดให้ Eleven v4 อยู่อันดับ 1 ด้วย Elo 1,319 จากการปรากฏ 1,674 ครั้ง ในราคาบอร์ด 80.00 ดอลลาร์ต่อล้านตัวอักษร การจัดอันดับคือพาดหัวข่าว ส่วนไวยากรณ์คำสั่งกำกับและการโคลนเสียงในสิบวินาทีคือส่วนที่เปลี่ยนสิ่งที่คุณต้องสร้าง

A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.

สองโมเดล เปิดตัวครั้งเดียว หน้าที่ต่างกัน

เมื่อวันที่ 28 กันยายน 2026 ElevenLabs ได้เปิดตัวเอนด์พอยต์สองรายการ และทั้งสองไม่ใช่ผลิตภัณฑ์เดียวกันที่เพียงสลับความเร็วได้ ElevenLabs Eleven v4เป็นโมเดลที่เน้นการแสดงออก รองรับกว่า 90 ภาษา จำกัด 10,000 ตัวอักษรต่อคำขอ รองรับสัทอักษรสากล (International Phonetic Alphabet) ที่ดีขึ้นสำหรับการออกเสียงแบบกำหนดเอง และบทสนทนาหลายผู้พูดที่บริษัทระบุว่าคงเอกลักษณ์ของผู้พูดไว้ได้ตลอดทั้งฉาก ElevenLabs Eleven v4 Turboยังคงรองรับกว่า 90 ภาษาและข้อจำกัด 10,000 ตัวอักษรเช่นเดิม แต่ปรับแต่งมาสำหรับเอเจนต์ — ประกาศระบุค่ามัธยฐานความหน่วงในการประมวลผลประมาณ 100 มิลลิวินาที และค่ามัธยฐานเวลาถึงเสียงพูดแรกประมาณ 150 มิลลิวินาที ซึ่งวัดโดย ElevenLabs ในเดือนกันยายน 2026

A screenshot of the ElevenLabs models documentation page, flagship Text to Speech section. Eleven v4 is described as the most emotive, high quality speech synthesis model, with exceptional voice cloning capabilities, 90+ languages supported, a 10,000 character limit and support for natural multi-speaker dialogue. Eleven v4 Turbo is described as the most emotive, real-time speech synthesis model, with ultra-low latency (median inference latency of ~100ms), exceptional voice cloning capabilities, 90+ languages supported and audio tags for fine-grained control. Below them the page lists Eleven v3, Eleven v3 Conversational, Eleven Multilingual v2 and Eleven Flash v2.5.

คำถามเชิงปฏิบัติ — โมเดลเรือธงเร็วพอสำหรับเอเจนต์ทางโทรศัพท์หรือไม่ — ยังไม่มีคำตอบที่เผยแพร่ออกมา ElevenLabs ให้ตัวเลขความหน่วงสำหรับ Turbo ไม่ใช่สำหรับ Eleven v4 เอง และทั้งสองเป็นเอนด์พอยต์ที่แยกจากกัน ไม่ใช่โมเดลเดียวที่ใช้สองชื่อ หากงบเวลาของเอเจนต์คุณอยู่ที่ 200 มิลลิวินาทีถึงเสียงแรก Turbo คือเอนด์พอยต์ที่ระบุไว้ในเอกสาร ส่วนโมเดลเรือธงไม่ใช่

แท็กเหล่านี้เป็นอินเทอร์เฟซจริง และเป็นดีเพนเดนซีจริง

แท็กเสียงแบบอินไลน์ไม่ใช่เรื่องใหม่สำหรับการสังเคราะห์เสียงพูด แต่การเปลี่ยนแปลงที่มีประโยชน์ตรงนี้คือความแม่นยำในการทำตามคำสั่ง ประกาศระบุว่า Eleven v4 ทำตามแท็กเสียงและพรอมต์คำสั่งแบบภาษาธรรมชาติได้แม่นยำกว่าโมเดลก่อนหน้า และนี่คือวิธีที่คุณสั่งให้หัวเราะ กระซิบ หรือพูดด้วยสำเนียงเฉพาะได้ โดยไม่ต้องแก้ไขเสียงในภายหลัง

ผลที่ตามมาในทางปฏิบัติสามประการมีดังนี้ และสิ่งเหล่านี้สำคัญกว่าคลิปวิดีโอสาธิต:

• สคริปต์ของคุณกลายเป็นอาร์ติแฟกต์แบบเทมเพลต ไม่ใช่สตริง แท็กคือโทเคนในไปป์ไลน์เนื้อหาของคุณ: มันต้องมีการ escape หากข้อความที่ไม่น่าเชื่อถือถูกส่งผ่านเข้ามา และมันต้องอยู่รอดผ่าน CMS เลเยอร์การแปล และการตรวจทาน diff ของคุณ นักแปลที่ทิ้ง [กระซิบ] ไป ได้เปลี่ยนการแสดงอย่างเงียบ ๆ

• การปฏิบัติตามแท็กเป็นคำกล่าวอ้างของผู้ให้บริการที่ผูกกับเวอร์ชันหนึ่ง คำกล่าวอ้างว่าโมเดลรุ่นนี้ทำตามแท็กได้ดีกว่ารุ่นก่อนเป็นของ ElevenLabs เอง ทดสอบโดย ElevenLabs เอง และจะไม่เป็นจริงเหมือนกันในทุกภาษา ควรตรวจสอบกับสคริปต์และโลแคลของคุณเองก่อนที่คุณจะสร้างสไตล์ไกด์จากสิ่งนี้

• แท็กเสียงเอฟเฟกต์อย่าง [light rain] หรือ [phone buzzing] ย้ายงานบางส่วนของงานหลังการผลิตเสียงเข้ามาอยู่ในพรอมป์ข้อความ นั่นคือการเปลี่ยนภาระต้นทุนที่ควรค่าแก่การวัด: หากแท็กหนึ่งแทนที่การทำโฟลีย์หนึ่งรอบ มันก็ประหยัด แต่หากมันไม่ได้แทนที่อะไรเลยและเพียงเพิ่มความแปรปรวน มันก็คือโหมดความล้มเหลวรูปแบบใหม่ในกระบวนการ QA ของคุณ

10 วินาทีคือตัวเลขที่เปลี่ยนการ onboarding

Instant Voice Cloning ในเวอร์ชันนี้จับเสียงได้อย่างแม่นยำสูงจากเสียงตัวอย่างเพียงสิบวินาที โดยยังมีระดับการโคลนแบบมืออาชีพที่สูงกว่านั้นให้ใช้งานอยู่ สิบวินาทีสั้นพอที่จะยุบขั้นตอนในเวิร์กโฟลว์ลง: การเก็บความยินยอม การอัปโหลดตัวอย่าง และการสังเคราะห์ครั้งแรกสามารถทำได้ในคราวเดียว บนมือถือ โดยไม่ต้องมีสตูดิโอ

ปัญหาความยินยอมไม่ได้ลดลงตามจำนวนตัวอย่าง แต่กลับเพิ่มขึ้น เพราะเกณฑ์ในการสร้างเสียงโคลนที่ฟังดูสมจริงได้ลดลงเหลือเพียงคลิปเสียงที่ใครก็บันทึกได้ หากคุณกำลังโคลนเสียงที่คุณไม่ได้เป็นเจ้าของ คำถามด้านการปฏิบัติตามข้อกำหนดตอนนี้เป็นเรื่องที่คุณต้องตอบเองทั้งหมดก่อนการเรียก API — โมเดลจะทำตามที่คุณสั่ง จงมองตัวเลขสิบวินาทีเป็นเกณฑ์เชิงปฏิบัติการ ไม่ใช่ใบอนุญาต

ค่าใช้จ่ายในช่วงที่โอกาสยังเปิดอยู่

ElevenLabs ปรับราคาใหม่ตอนเปิดตัว และอัตราโปรโมชั่นคือราคาที่อยู่บนหน้าเว็บวันนี้ ในตารางราคา API นั้น Eleven v4 ระบุไว้ที่ $0.022 ต่อ 1,000 ตัวอักษร เทียบกับราคาที่ประกาศไว้ $0.08 และ Eleven v4 Turbo ที่ $0.011 เทียบกับ $0.04 ทั้งคู่มีป้ายกำกับเดียวกัน: ลด 72% ถึงวันที่ 12 ตุลาคม หน้าเดียวกันนี้ตั้งราคาเรือธงรุ่นก่อนอย่าง Eleven v3 ไว้ที่ $0.08 ต่อ 1,000 ตัวอักษร

• ราคาบนกระดานในอารีนา ต่อล้านตัวอักษร — Eleven v4 $80.00 สูงที่สุดในสิบอันดับแรกของกระดานนั้น

• ตารางราคาของผู้ขาย ต่อพันตัวอักษร — $0.022 จนถึงวันที่ 12 ตุลาคม จากนั้น $0.08

• สิ่งนี้หมายความว่าอย่างไรในทางปฏิบัติ — เดือนที่มีการใช้งานสคริปต์หนักถึงห้าล้านตัวอักษร มีค่าใช้จ่าย 110 ดอลลาร์ในช่วงเวลาดังกล่าว และ 400 ดอลลาร์หลังจากนั้น บนเอนด์พอยต์เดียวกันด้วยโค้ดเดียวกัน

A screenshot of the ElevenLabs API pricing page filtered to ElevenAPI. Four Text to Speech columns are shown: v4 at $0.022 with $0.08 struck through, v4 Turbo at $0.011 with $0.04 struck through, both carrying a '72% off until Oct 12' badge, Eleven v3 at $0.08 and Eleven v3 Conversational at $0.04 per 1K characters. The v4 column lists audio tags for fine-grained control and 90+ languages supported; the Turbo column lists ultra-low latency (~100ms) and v4 expressiveness tuned for latency; the v3 column lists 70+ languages and a 5,000 character limit. The cost calculator below prices a Starter plan at $6 per month with 272.727k characters of TTS (v4) included.

ใครก็ตามที่กำลังจัดงบสำหรับไตรมาส 1 โดยอิงจากตัวเลขที่อยู่บนหน้านี้ในวันนี้ กำลังจัดงบโดยอิงจากตัวเลขที่จะหมดอายุในอีกสองสัปดาห์ ให้ใช้ $0.08

จุดที่เราเตอร์พิสูจน์คุณค่าของตัวเองในงานเปิดตัวแบบนี้

OrcaRouter ไม่ได้โฮสต์ ElevenLabs ดังนั้นในงานเปิดตัวนี้จึงไม่มีอะไรให้เรียกผ่านเรา และเราจะไม่สื่อเป็นนัยเป็นอย่างอื่น — จุดที่ควรเรียก Eleven v4 คือ API ของ ElevenLabs เอง สิ่งที่คีย์เดียวมีประโยชน์จริง ๆ ในช่วงสองสัปดาห์หลังการเปิดตัวก็คือการเปรียบเทียบ หากคุณกำลังตัดสินใจว่ารุ่นเรือธงใหม่จะดีกว่าสิ่งที่คุณใช้อยู่หรือไม่ คุณย่อมต้องการทดสอบ A/B ทั้งสองบนสคริปต์ของคุณเองมากกว่าบนกระดานจัดอันดับ และการทำเช่นนั้นข้ามผู้ให้บริการสองรายหมายถึงบัญชีสองบัญชี ความสัมพันธ์ด้านการเรียกเก็บเงินสองชุด และเส้นทางการผสานรวมสองเส้นทาง ก่อนที่คุณจะได้คำตอบ

นั่นคือกรณีที่เราจัดการ: API key เดียวใช้ได้กับโมเดลกว่า 200 รายการ โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านที่มาร์กอัป 0% ดังนั้นเมื่อผู้ขายปรับราคา — รวมถึงช่วงโปรโมชันที่มีวันหมดอายุ — ฝั่งเราจะอัปเดตให้สดทันทีในวันเดียวกัน แทนที่จะรอถึงรอบบิลถัดไป ในกรณีที่เส้นทางเสียงเป็นส่วนที่ลูกค้าใช้งานโดยตรง ระบบสำรองอัตโนมัติจะย้ายทราฟฟิกไปยัง upstream ที่ยังทำงานปกติเมื่อ endpoint หนึ่งเริ่มมีปัญหา ซึ่งนี่คือวิธีที่คุณทดลองโมเดลใหม่ล่าสุดได้โดยไม่ต้องเดิมพันการเปิดตัวทั้งครั้งไว้กับมัน

ควรทดสอบอะไรก่อน และควรเพิกเฉยต่ออะไร

การตรวจสอบสามข้อจะบอกคุณได้มากกว่าการจัดอันดับใด ๆ ข้อแรก ลองรันสคริปต์ที่สมจริงและยาวที่สุดของคุณผ่านขีดจำกัด 10,000 ตัวอักษร แล้วดูว่ารอยต่อตกอยู่ตรงไหน — ขีดจำกัดนี้คิดต่อคำขอ และบทสนทนาที่มีผู้พูดหลายคนคือฟีเจอร์ที่มีแนวโน้มจะถูกแบ่งด้วยขีดจำกัดนี้มากที่สุด ข้อสอง ใส่ห้าประโยคของคุณเองที่มีแท็กลงในทั้ง v4 และ v4 Turbo แล้วฟังการคลาดเคลื่อนของการทำตามแท็กระหว่างปลายทางแบบแสดงอารมณ์กับปลายทางแบบความหน่วงต่ำ พวกมันเป็นโมเดลคนละตัว และแท็กที่ได้ผลบนตัวหนึ่งอาจไม่ได้ผลเหมือนกันบนอีกตัว ข้อสาม คิดราคาปริมาณตัวอักษรต่อเดือนจริงของคุณที่ $0.08 แทนที่จะเป็น $0.022 เพราะนั่นคือตัวเลขที่ไตรมาสถัดไปของคุณดำเนินไปบนนั้น

ตัวเลขความชอบแบบไม่เปิดเผย ~75% ในประกาศเป็นการวัดจากผู้ขาย และเราจะไม่นำมันไปแปรรูปเป็นสิ่งอื่นใด ตัวเลขอิสระในการเปิดตัวนี้คือตัวเลขบนกระดาน: อันดับหนึ่งที่ 1,319 Elo จากการปรากฏตัว 1,674 ครั้ง และช่วงประมาณ ±19 คะแนนโดยรอบ นั่นเป็นผลลัพธ์ที่แข็งแกร่งบนกระดานจริง มันไม่ใช่ข้อกำหนด และมันจะไม่บอกคุณว่าไวยากรณ์แท็กของคุณจะรอดจากการแปลหรือไม่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube