Thẻ hero được tạo cho 'Gemini 3.8 TTS vs ElevenLabs' trên nền trắng với các điểm nhấn gradient xanh lam và xanh lơ dịu nhẹ. Thẻ bên trái 'ElevenLabs Eleven v3' liệt kê $100 mỗi 1M ký tự, hơn 70 ngôn ngữ, Elo 1.167 và xếp hạng 17; thẻ bên phải 'Gemini 3.8 Flash TTS' liệt kê $33 mỗi 1M ký tự, 130 ngôn ngữ, Elo 1.260 và xếp hạng 2. Một dòng chân trang ghi 'Elo theo Artificial Analysis Provider Voice Arena, tháng 9 năm 2026.' Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

Gemini 3.8 TTS vs ElevenLabs: Gấp ba lần giá thì bạn nhận được gì?

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Với cùng khối lượng, mô hình tổng hợp hàng đầu của ElevenLabs có chi phí cao gấp khoảng ba lần so với mô hình mới của nhà cung cấp. ElevenLabs Eleven v3 tính phí $0.10 mỗi nghìn ký tự — $100 mỗi triệu ký tự — và Gemini 3.8 Flash TTS tính phí $9.00 mỗi triệu token âm thanh, mà Artificial Analysis chuẩn hóa thành $33.00 mỗi triệu ký tự. Đó là khoảng cách 3,0 lần trên thang đo, và đây là dữ kiện lớn nhất trong so sánh này. Câu hỏi thú vị không phải là liệu khoảng cách đó có thật hay không; mà là khoản chênh thêm sáu mươi bảy đô-la mỗi triệu ký tự thực sự đang mua được gì, bởi vì câu trả lời không phải là "giọng nói tốt hơn".

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

Ba mét, không phải một

Điều đầu tiên cần làm rõ là hai sản phẩm này không đo lường cùng một thứ, và các bảng giá được công bố đã che giấu điều đó.

• ElevenLabs tính phí theo ký tự. Eleven v3 là 0,10 USD cho mỗi 1.000 ký tự, giới hạn ở 5.000 ký tự mỗi yêu cầu. Eleven v3 Conversational là 0,05 USD cho mỗi 1.000 ký tự, và các mô hình Flash và Turbo cũng là 0,05 USD cho mỗi 1.000 ký tự nhưng có giới hạn yêu cầu 40.000 ký tự và độ trễ được cho là ~75 ms so với ~280 ms của v3 Conversational.

Google tính phí theo token, và token âm thanh không phải là token văn bản. Gemini 3.8 Flash TTS tính $0.50 cho mỗi triệu token văn bản đầu vào và $9.00 cho mỗi triệu token âm thanh đầu ra, được đo ở mức 25 token âm thanh mỗi giây giọng nói được tạo ra. Không có giới hạn ký tự trên mỗi yêu cầu nào được công bố.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis không lập hóa đơn cho bên nào; nó chuẩn hóa. Mức $100.00 và $33.00 trên mỗi triệu ký tự trên bảng xếp hạng Provider Voice Arena của nó là một mẫu số chung được suy ra để bảng có thể xếp hạng theo giá. Hữu ích cho một tỷ lệ, chứ không phải để báo giá.

Vậy phiên bản trung thực của con số 3,0x là: trên cơ sở so sánh cùng loại duy nhất hiện có, Google chỉ bằng khoảng một phần ba mức giá. Điều đó có nghĩa gì trong bảng tính của riêng bạn phụ thuộc vào việc khối lượng công việc của bạn chủ yếu là chuỗi ngắn hay chuỗi dài — một thước đo âm thanh theo giây và một thước đo văn bản theo ký tự sẽ khác biệt rõ rệt khi lời nói trở nên dài hơn, vì khoảng lặng, khoảng dừng và phần đệm ngữ điệu đều tốn token âm thanh và không tốn ký tự nào.

Một tháng làm việc

Hãy lấy một triệu ký tự văn bản, tương đương độ dài của một cuốn tiểu thuyết cỡ trung, được chuyển thành giọng nói một lần.

• ElevenLabs Eleven v3 — $100.00 cho phần tổng hợp, cộng thêm bậc gói bất kỳ bạn cần để chạy nó ở mức đồng thời của bạn. Các gói được công bố gồm Starter ở mức $6, Creator ở mức $22, Pro ở mức $99, Scale ở mức $299 và Business ở mức $990, và hạn mức ký tự được gộp vào các gói đó thay vì tính phí riêng.

• Gemini 3.8 Flash TTS — tương đương $33.00, hoặc khoảng $16.50 nếu tác vụ có thể chạy theo lô, vì gói Batch và Flex giảm một nửa mức giá âm thanh xuống còn $4.50 mỗi triệu token. Dịch vụ ưu tiên đẩy mức này lên $16.20 mỗi triệu token, tương đương khoảng $59.40, vẫn thấp hơn đáng kể so với ElevenLabs.

• Gemini 3.8 Flash-Lite TTS — $6,00 mỗi triệu token âm thanh, tương đương khoảng $22,10 theo cùng cách chuẩn hóa, với cái giá là 101 ngôn ngữ thay vì 130.

Chạy cùng một triệu ký tự qua mức giá khuyến mãi của Google thì khoảng cách còn nới rộng hơn nữa, vì cả hai mô hình Gemini TTS mới đều đang ở mức một nửa giá cho đến ngày 31 tháng 12 năm 2026 rồi sau đó sẽ tăng gấp đôi. Bất kỳ ai xây dựng bài toán kinh doanh dựa trên các con số tháng 9 là đang xây dựng nó trên một mức chiết khấu đã có ngày hết hiệu lực được công bố.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

Điểm duy nhất mà so sánh đảo chiều là ở những câu nói rất ngắn. Cách tính theo ký tự gần như không thu phí cho một xác nhận ba từ; cách tính theo giây âm thanh lại tính phí cho giây mà xác nhận đó cần để nói ra, kể cả khoảng lặng xung quanh nó. Nếu sản phẩm của bạn là giao diện giọng nói được xây dựng từ các câu trả lời một câu, phép tính sẽ nghiêng về ElevenLabs. Nếu đó là tường thuật, sách nói, bản địa hóa dạng dài hay bất cứ thứ gì mà văn bản dài và âm thanh còn dài hơn, nó sẽ nghiêng mạnh về Google.

Câu hỏi về chất lượng, thành thật mà nói

Trên Đấu trường Giọng nói Nhà cung cấp của Artificial Analysis — bình chọn theo cặp kín giữa các giọng nói bản địa của từng nhà cung cấp — hai mô hình không hề sát nút, và Google đang dẫn trước.

• Gemini 3.8 Flash TTS — xếp hạng 2, Elo 1.260, khoảng 17 điểm, 1.999 mẫu, 8 giọng đấu trường, phát hành tháng 9 năm 2026.

• ElevenLabs Eleven v3 — xếp hạng 17, Elo 1.167, khoảng tin cậy 11 điểm, 4.345 mẫu, 8 giọng nói Arena, được ghi là tháng 2 năm 2026 trên bảng xếp hạng.

Hai bên cách nhau 93 điểm Elo, và khác với khoảng cách giữa ba vị trí dẫn đầu trên bảng xếp hạng đó, khoảng cách này là thật: khoảng của Eleven v3 là 1.156 đến 1.178 còn của Gemini là 1.243 đến 1.277, không hề chồng lấn. Số lượng mẫu của Eleven v3 nhiều hơn gấp đôi của Gemini, nên ước lượng cũng không hề mỏng.

Đó thực sự là một kết quả khó xử cho lập luận về giá, và nó đi ngược lại kết luận hiển nhiên. ElevenLabs thu cao gấp ba lần và xếp thấp hơn mười bảy bậc về mức độ ưu tiên trong đánh giá mù. Dù khoản thêm sáu mươi bảy đô la mua được thứ gì, thì trong một so sánh trực tiếp, đó không phải là giọng nghe hay hơn.

ElevenLabs thực sự đang bán gì

ElevenLabs không chủ yếu bán một endpoint tổng hợp, và việc định giá nó như thể đúng là như vậy chính là chỗ mà hầu hết các so sánh đều sai. Số tiền bỏ ra mua được những gì:

• Thư viện giọng nói. Thư viện giọng nói dùng chung của ElevenLabs có hàng trăm giọng và là một bề mặt sản phẩm thực thụ — điều khiến người ta tìm đến ElevenLabs thường là một giọng nói cụ thể mà họ đã nghe ở đâu đó, chứ không phải mô hình đằng sau nó. Gemini 3.8 Flash TTS đi kèm 30 giọng studio dựng sẵn, một lối thiết kế giọng nói giúp tạo ra một giọng từ mô tả bằng ngôn ngữ tự nhiên, và một lối nhân bản giúp sao chép từ mẫu 30 giây với xác minh sự đồng ý, dấu thủy văn SynthID và thông tin xác thực C2PA được đính kèm. Danh mục mặc định nhỏ hơn; khả năng tạo một giọng nói cụ thể thì tương đương.

• Các tầng độ trễ như những sản phẩm riêng biệt. Flash và Turbo ở ~75 ms với giới hạn 40.000 ký tự là một sản phẩm khác với v3 ở ~280 ms và 5.000 ký tự, và cả hai đều rẻ hơn v3. Nếu ứng dụng của bạn cần dưới 100 ms, ElevenLabs bán điều đó một cách rõ ràng, còn tài liệu ra mắt của Google không đưa ra tuyên bố độ trễ tương đương cho cả hai mô hình TTS mới.

• Một hệ sinh thái. Lồng tiếng, tác nhân thoại, các điểm cuối hội thoại, một cấu trúc gói gắn kèm tính đồng thời — cùng lý do Cartesia bán dịch vụ điện thoại: đó là một ngăn xếp, không phải một mô hình.

Nếu bạn đang mua một stack, thì 3.0x chính là cái giá của việc không tự lắp ghép nó. Nếu bạn đang mua một lệnh gọi tổng hợp, bạn đang trả khoản đó để đổi lấy một thư viện giọng nói và một bậc độ trễ.

Google thực sự đang bán gì

Lập luận phản biện thì hẹp hơn và mạnh hơn so với "rẻ hơn".

• Độ phủ ngôn ngữ — 130 ngôn ngữ trên Flash TTS và 101 trên Flash-Lite TTS, tự động phát hiện từ văn bản, so với hơn 70 ngôn ngữ mà ElevenLabs công bố cho Eleven v3. Đối với một lượt bản địa hóa, sự khác biệt đó không phải là so sánh tính năng, mà là một khoảng trống độ phủ.

• Chỉ đạo — kiểm soát cách thể hiện theo từng dòng, dàn dựng cảnh hai người nói trong một cuộc gọi duy nhất, và các tín hiệu phi ngôn từ được viết vào kịch bản dưới dạng <laughs>, <sigh>, <gasp>, |mhm||yeah|. Google tuyên bố thế hệ 3.8 đã cải thiện tính nhất quán ở dạng dài và khả năng điều khiển hai người nói so với Gemini 3.1 Flash TTS, đúng là mục đích tồn tại của những tính năng đó. Tuyên bố của nhà cung cấp, chưa được tái lập.

• Mô hình trạng thái giọng nói — 200 giọng tùy chỉnh có trạng thái cho mỗi dự án với TTL một năm, hoặc các giọng không trạng thái được định danh bằng một voicekey_... handle hết hạn sau bảy ngày. Đó là một quyết định về hạ tầng mà bạn có thể lên kế hoạch dựa trên đó.

• Kiểm soát đầu ra — WAV 24 kHz mono PCM có dấu 16-bit trên điểm cuối unary, PCM không có tiêu đề (audio/l16) trên điểm cuối streaming, và audio/mulaw cùng audio/alaw với tần số lấy mẫu có thể cấu hình.

Các điểm chuẩn khi ra mắt của Google là do nhà cung cấp báo cáo và nên được hiểu theo cách đó: đứng đầu trên Hume AI Voice Design Benchmark với 71,4 và đứng đầu về mô hình hóa khẩu âm với 60,8, lần lượt đứng nhất và nhì trên Chỉ số Chất lượng Tổng thể Hume dành cho Flash và Flash-Lite, cùng các vị trí dẫn đầu trong xếp hạng ưu tiên mù được công bố ở tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Việt, tiếng Ả Rập chuẩn hiện đại, tiếng Tây Ban Nha Mexico và tiếng Hindi. Không có lượt chạy nào trong số đó được công khai. Điểm Elo đấu trường ở trên là con số duy nhất được thu thập độc lập trong bài viết này, và nó tình cờ đồng thuận với hướng của các tuyên bố từ nhà cung cấp.

Phép tính chuyển mạch

Hãy chuyển nếu khối lượng công việc của bạn thuộc dạng dài, đa ngôn ngữ hoặc đủ lớn để mức 3.0x xuất hiện như một mục chi phí riêng, và nếu bạn có thể chấp nhận một danh mục giọng nói mặc định nhỏ hơn cùng việc không có gói dưới 100 ms nào được công bố. Điều đó bao gồm tường thuật, lồng tiếng, trợ năng và hầu hết giọng nói nhúng trong sản phẩm.

Ở lại nếu bạn đang mua cả bộ sản phẩm — thư viện giọng nói, các bậc độ trễ, sản phẩm lồng tiếng và tác nhân — hoặc nếu khối lượng công việc của bạn chủ yếu là những câu nói rất ngắn, nơi việc đo âm thanh theo từng giây khiến bạn bị thiệt. Cũng hãy ở lại nếu bạn đã tinh chỉnh một bản sắc giọng nói trên ElevenLabs mà người dùng của bạn nhận ra, vì tính liên tục của giọng nói là một tính năng sản phẩm và việc tạo lại nó trên một mô hình mới là cả một dự án.

Dù theo cách nào, nước đi khôn ngoan là chạy cả hai trong một tháng trên lưu lượng thật trước khi chốt, và đó chính là lý lẽ để không nối trực tiếp bên nào vào codebase của bạn. OrcaRouter đặt hơn 200 mô hình sau một khóa duy nhất với giá niêm yết của nhà cung cấp, không cộng thêm phụ phí, nên khi bên nào trong hai phòng lab thay đổi giá, hoá đơn của bạn nhận thay đổi đó ngay trong ngày thay vì đợi tới kỳ gia hạn, và cơ chế tự động chuyển đổi dự phòng giữ cho luồng thoại production luôn hoạt động khi một endpoint hoàn toàn mới gặp trục trặc. Chúng tôi không lưu trữ ElevenLabs — lớp tổng hợp và lớp agent là sản phẩm riêng của họ — và chúng tôi cũng không lưu trữ các endpoint TTS Gemini 3.8, vốn đến từ API của Google. Thứ chúng tôi cung cấp là lớp văn bản bên dưới và lớp định tuyến bên trên nó.

Con số đáng để theo dõi là điểm Elo của Eleven v3 trên bản cập nhật bảng xếp hạng tiếp theo. Chín mươi ba điểm là mức thiếu hụt lớn đối với một mô hình có giá cao gấp ba lần, và nếu khoảng tin cậy thu hẹp mà khoảng cách không khép lại, lập luận về giá sẽ không còn là một sự đánh đổi nữa mà trở thành một phán quyết.