
Eleven v4 đứng đầu Voice Arena: Sản phẩm chủ lực mới của ElevenLabs thực sự đã giành được gì
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 983 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 196 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
ElevenLabs Eleven v4 đã ra mắt vào ngày 28 tháng 9 và ngay lập tức vươn lên đứng đầu Provider Voice Arena của Artificial Analysis với Elo 1,319 — hơn 43 điểm so với Cartesia Sonic 3.6 ở mức 1,276 và hơn 52 điểm so với Google Gemini 3.8 Flash TTS ở mức 1,267. Đây cũng là, với mức $80.00 mỗi triệu ký tự trên cùng bảng xếp hạng đó, mô hình đắt nhất trong top mười. Và trên đấu trường thứ hai — đấu trường được xây dựng từ các giọng nói nhân bản thay vì bộ giọng nói riêng của từng nhà cung cấp — nó không thắng chút nào: nó về nhì, sau một mô hình có giá chỉ bằng một phần tư. Cả hai điều đó đều đúng, và phần hữu ích của lần ra mắt này là xác định xem trường hợp sử dụng của bạn rơi vào bên nào.
Điều gì thực sự đã được phát hành vào ngày 28 tháng 9?
ElevenLabs đã đưa hai mô hình vào trạng thái sẵn sàng chung, chứ không phải một. ElevenLabs Eleven v4 là mô hình tổng hợp chủ lực — công ty gọi đây là mô hình giàu cảm xúc nhất của mình, và tài liệu của họ đặt giới hạn đầu vào ở 10.000 ký tự mỗi yêu cầu cùng phạm vi ngôn ngữ hơn 90. ElevenLabs Eleven v4 Turbo là phiên bản anh em có độ trễ thấp: vẫn hơn 90 ngôn ngữ, giới hạn 10.000 ký tự, và hỗ trợ các thẻ âm thanh nội tuyến cho phép bạn viết chỉ dẫn cách thể hiện ngay vào kịch bản — một tiếng cười, một lời thì thầm, một tiếng ù trên đường dây. Cả hai đều hoạt động trên các bề mặt agent, sáng tạo và API của công ty ngay từ ngày đầu tiên, tức là một đợt ra mắt nhanh hơn so với thế hệ v3.
Trang thông báo là nơi chứa danh sách tính năng và, đáng chú ý, không chứa phần định giá. ElevenLabs mô tả một kiến trúc mới, xử lý giọng điệu, nhịp độ và cá tính tốt hơn, đối thoại nhiều người nói đáng tin cậy hơn với danh tính người nói ổn định, đầu vào âm vị IPA được cải thiện, cùng các bản sao giọng nói tức thì được tạo từ mười giây âm thanh bên cạnh gói sao chép giọng chuyên nghiệp hiện có. Con số duy nhất trên đó là một tuyên bố về người nghe: nhà cung cấp nói rằng trong các so sánh mù, v4 được ưu tiên trong khoảng ba phần tư số trường hợp. Đó là con số do nhà cung cấp đưa ra, chưa được tái lập, và nên được đọc bên cạnh các con số trên bảng bên dưới chứ không phải thay thế chúng.
Nơi thực sự có thông tin định giá — trang định giá API — mới là tài liệu quan trọng hơn, và nó được đề cập ở phần dưới. Bản ngắn gọn: đợt ra mắt này không phải là một đợt tăng giá.
Hai bảng, hai câu trả lời khác nhau
Artificial Analysis vận hành hai đấu trường giọng nói và chúng không phải là biến thể của nhau. Provider Voice cho người nghe so sánh giọng nói riêng của từng nhà cung cấp. Controlled Voice nhân bản cùng tám giọng nói — bốn giọng Mỹ, bốn giọng Anh — cho mọi đối thủ tham gia, do đó người nói được giữ cố định và chỉ có mô hình thay đổi. Một mô hình có dàn giọng mặc định tuyệt vời có thể thắng cái đầu tiên và thua cái thứ hai. Eleven v4 làm chính xác điều đó.
• Provider Voice, Eleven v4 — hạng 1, Elo 1.319, 80,00 USD mỗi triệu ký tự, 1.674 mẫu, tám giọng arena, tháng 9 năm 2026
• Giọng nói nhà cung cấp, Cartesia Sonic 3.6 — xếp hạng 2, Elo 1.276, $49,00
• Giọng nói nhà cung cấp, Google Gemini 3.8 Flash TTS — xếp hạng 3, Elo 1.267, $16.50
• Provider Voice, mẫu flagship trước đây ElevenLabs Eleven v3 — hạng 18, Elo 1.169, 100,00 $
• Giọng nói được kiểm soát, Alibaba Qwen-Audio-3.1-TTS-Plus — hạng 1, Elo 1.178
• Controlled Voice, Eleven v4 — xếp hạng 2, Elo 1.157, 80,00 USD
• Giọng nói được kiểm soát, Cartesia Sonic 3.6 — hạng 4, Elo 1.138
• Giọng nói được kiểm soát, ElevenLabs Eleven v3 — hạng 7, Elo 1.073
• Giọng nói được kiểm soát, Google Gemini 3.8 Flash TTS — hạng 13, Elo 1.048
• Mục open-weights tốt nhất trên Provider Voice — Breeze TTS 2, Elo 1.206, 34,00 USD

Bước nhảy về thế hệ là điểm đáng chú ý nhất với bất kỳ ai đang dùng ElevenLabs: so với chính phiên bản tiền nhiệm của nó trên cùng bảng xếp hạng, Eleven v4 tăng 150 điểm Elo ở hạng mục Provider Voice và 84 điểm ở Controlled Voice. Đó là một bước tiến mang tính thế hệ, không phải một lần tinh chỉnh, và mức cải thiện còn lớn hơn trên bảng xếp hạng nơi nhà cung cấp được chọn giọng — cách nói trung thực rằng dàn giọng mặc định mới của nó thực sự là một phần tạo nên mức tăng.

Bảng phát âm mà chúng ta không thể định lượng bằng con số
Artificial Analysis thực sự có một phần Pronunciation Robustness, và đáng để mô tả cho đúng vì bản tóm tắt xếp hạng đang lan truyền mô tả Eleven v4 là đứng đầu phần này. Bảng đo tỷ lệ các đoạn được tô sáng mà người đánh giá cho là được phát âm đúng, với tối đa ba người đánh giá mỗi clip, và các prompt được gửi chính xác như đã viết — không mở rộng số, không chuẩn hóa văn bản. Nó được chia thành các tiểu mục, và mục đích của thiết kế là một mô hình âm thầm viết lại "Dr." hoặc "$4.50" trước khi nói sẽ bị điểm kém một cách có chủ đích.
Điều mà bảng xếp hạng không công bố, trong bản hiển thị mà chúng tôi có thể đọc được, là điểm số dạng số có thể trích dẫn cho từng mô hình. Vì vậy, không có con số nào để trích dẫn cho Eleven v4 ở đó, và Elo 1.319 thuộc về mức độ ưa thích trong đấu trường — người nghe thích giọng nói đó đến mức nào — chứ không phải độ chính xác phát âm. Nếu bạn thấy hai điều đó bị đánh đồng với nhau, thì đó chính là sự đánh đồng. Tuyên bố có thể bảo vệ được từ lần ra mắt này là tuyên bố gắn với các con số: đứng nhất ở Provider Voice với 1.319, đứng thứ hai ở Controlled Voice với 1.157.
Ưu đãi ra mắt mới là thông tin thực sự đáng chú ý cho hóa đơn của bạn.
ElevenLabs đã điều chỉnh giá cho các mô hình mới cùng lúc với việc ra mắt chúng, và mức giảm giá đủ lớn để tự nó thay đổi quyết định mua hàng. Trên trang định giá API, Eleven v4 được niêm yết ở mức $0,022 cho mỗi nghìn ký tự so với giá niêm yết $0,08 — giảm 72% — và Eleven v4 Turbo được niêm yết ở mức $0,011 so với $0,04. Cả hai đều có cùng khung thời gian: chương trình khuyến mãi kéo dài đến ngày 12 tháng 10. Sau đó, các con số sẽ quay về mức cũ, và giá v4 sau khi hoàn nguyên sẽ gấp đôi mức giá hiện tại của v3 do chính ElevenLabs cung cấp là $0,08. Hãy lập kế hoạch dựa trên con số sau khuyến mãi, không phải con số khuyến mãi.
Việc tái định giá cũng làm thay đổi vị thế của v4 so với các đối thủ theo từng ký tự, điều mà chuẩn hóa của arena đã cho thấy ở mức $80.00 mỗi triệu. Sonic 3.6 ở đó là $49.00, Breeze TTS 2 là $34.00, Qwen-Audio-3.0-TTS-Plus là $19.30, và Gemini 3.8 Flash TTS là $16.50. Ở mức giá khuyến mãi, Eleven v4 với $22 mỗi triệu hạ thấp hơn Sonic 3.6 một cách hoàn toàn. Ở giá niêm yết, đây là giọng đắt nhất trên bảng với khoảng cách lớn. Bất kỳ ai đang lập ngân sách cho Q1 nên nhìn vào con số thứ hai.

Một tháng cụ thể sẽ khiến khoảng cách trở nên rõ ràng. Với năm triệu ký tự — một sản phẩm cỡ trung đọc khoảng một trăm giờ thoại — Eleven v4 trong khoảng thời gian ưu đãi tốn $110. Ở mức $0.08 đã khôi phục trở lại, chi phí là $400. Sonic 3.6 tốn $245. Gemini 3.8 Flash TTS tốn $82.50. Cùng tháng đó, v3 của chính ElevenLabs cũng tốn $400, và đó chính là sự thật kỳ lạ nằm dưới lần ra mắt này: trong hai tuần tới, mẫu flagship mới rẻ hơn mô hình mà nó thay thế, và vào ngày cửa sổ ưu đãi đóng lại, nó không còn rẻ hơn nữa mà chỉ trở nên tốt hơn.
Tuyên bố về độ trễ là do nhà cung cấp đưa ra và phụ thuộc vào từng hạng.
ElevenLabs công bố các con số độ trễ theo từng hạng, không theo họ mô hình, và đó là những phép đo do chính công ty thực hiện chứ không phải bất kỳ dữ liệu độc lập nào. Eleven v4 Turbo được ghi nhận ở mức suy luận trung vị khoảng 100 ms và thời gian đến âm thanh nói đầu tiên trung vị khoảng 150 ms, đo vào tháng 9 năm 2026. Eleven v3 Conversational được ghi nhận ở khoảng 280 ms, còn các hạng Flash và Turbo cũ hơn ở khoảng 75 ms. Tài liệu không công bố con số tương đương cho chính Eleven v4, tức là hạng mà bạn sẽ muốn nếu đang xây dựng một agent thời gian thực và đọc bảng thông số kỹ thuật thay vì tự kiểm nghiệm.
Cartesia tuyên bố Sonic có độ trễ dưới 90 ms và mô tả nó đứng đầu về độ tự nhiên, với khả năng nhân bản giọng nói chỉ từ mười giây âm thanh, từ điển phát âm tùy chỉnh và một bộ tuân thủ bao gồm HIPAA, SOC 2 Type 2, GDPR và PCI. Đó là những tuyên bố của chính nhà cung cấp trên trang sản phẩm của chính họ — cùng loại bằng chứng với các con số về bậc độ trễ của ElevenLabs, và không thể hoán đổi với Elo của arena. Nơi hai nhà cung cấp thực sự có thể so sánh trực tiếp chỉ là trên các bảng xếp hạng.
Điều này để lại cho bạn điều gì, và cách dùng thử nó
Nếu bạn đang chọn giọng cho một sản phẩm mà dàn giọng mặc định chính là thứ người dùng của bạn nghe thấy, thì kết quả Provider Voice mới là thứ đáng quan tâm, và Eleven v4 vừa giành được nó, kèm theo ưu đãi giảm giá trong hai tuần. Nếu bạn đang nhân bản giọng của một người cụ thể và mọi mô hình ứng viên đều được yêu cầu tái tạo đúng tám giọng nói đó, thì bảng Controlled Voice mới là thứ đáng quan tâm, và Eleven v4 đứng thứ hai — kém người dẫn đầu 21 Elo và, theo giá niêm yết, tốn hơn gấp bốn lần chi phí trên mỗi ký tự. Cả hai kết quả đều không sai; chúng là câu trả lời cho những câu hỏi khác nhau, và kết quả thứ hai chính là câu hỏi mà phần lớn công việc nhân bản giọng trong sản xuất thực tế đang đặt ra.
OrcaRouter không lưu trữ ElevenLabs, Cartesia hay bất kỳ nhà cung cấp nào khác trên các bảng này, nên không có gì ở đây để gọi qua chúng tôi và chúng tôi sẽ không ngụ ý điều ngược lại. Điều chúng tôi cung cấp là phần hạ tầng bao quanh, trong trường hợp ngăn xếp giọng nói của bạn trải rộng trên nhiều nhà cung cấp: một khóa API duy nhất cho hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển nguyên qua ở mức 0% markup, nên khi một nhà cung cấp giảm giá — kể cả một cửa sổ khuyến mãi như thế này — phía chúng tôi sẽ cập nhật ngay trong cùng ngày thay vì đợi đến kỳ xuất hóa đơn tiếp theo. Khi một luồng giọng nói mang tính then chốt cho vận hành sản xuất, chuyển đổi dự phòng tự động sẽ chuyển sang một upstream khỏe mạnh khi một upstream bị suy giảm, đây là cách thiết thực để thử nghiệm một endpoint hoàn toàn mới mà không đặt cược cả một bản phát hành vào nó.
Ngày cần đánh dấu vào lịch là ngày 12 tháng 10. Đó là thời điểm Eleven v4 không còn là giọng nói tốt rẻ nhất trên bảng nữa mà trở thành giọng đắt nhất, và bất kỳ bản so sánh nào viết trong tuần này trích dẫn mức $22 mỗi triệu mà không nói rõ điều đó thì đều là bản so sánh mà bạn nên chạy lại sau ba tuần.
