Một thẻ hero được tạo cho bài viết 'Gemini 3.8 Live vs ElevenLabs', hiển thị hai thẻ bo tròn ở hai bên tiêu đề. Thẻ bên trái ghi 'Gemini 3.8 Live' phía trên một biểu tượng đám mây và dạng sóng cùng dòng 'chuyển giọng nói thành giọng nói, một lượt, mỗi phút'; thẻ bên phải ghi 'ElevenLabs Agents' phía trên một biểu tượng đường ống ba khối được dán nhãn 'STT - LLM - TTS' và dòng 'lắp ráp, mỗi phút agent'. Một phụ đề ghi 'Một thành phần bạn thuê so với một hệ thống thuê các thành phần'. Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Gemini 3.8 Live vs ElevenLabs: Một mô hình đối đầu với một pipeline

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mở tài liệu của ElevenLabs về nền tảng agent của họ và bạn sẽ thấy một mô hình Gemini nằm ngay ở giữa. ElevenLabs Agents là một chuỗi xếp tầng — một giao diện nhận dạng giọng nói, một mô hình ngôn ngữ, và một giao diện tổng hợp giọng nói — và mô hình ngôn ngữ trong ngăn xếp được công bố là một mô hình Gemini. Đó là điểm khởi đầu đúng đắn cho một so sánh Gemini 3.8 Live với ElevenLabs, bởi vì hai thứ được đem ra so sánh không phải cùng một loại đối tượng. Gemini 3.8 Live là mô hình speech-to-speech, ra mắt trên Live API vào ngày 15 tháng 9 năm 2026, được tính giá theo từng phút âm thanh. ElevenLabs Eleven v3 là mô hình tổng hợp hàng đầu của một nền tảng giọng nói cũng bán ElevenLabs Agents, và nó được tính giá theo ký tự, không phải theo cuộc hội thoại. Một cái là thành phần bạn có thể thuê. Cái kia là một hệ thống thuê các thành phần — bao gồm, trong ít nhất một cấu hình được công bố, cả thành phần của một mô hình Gemini nữa.

Sự bất đối xứng đó giải quyết phần lớn những câu hỏi mà người ta thực sự đặt ra cho màn so sánh này. Nếu bạn đang hỏi nên gọi cái nào, câu trả lời trung thực là chúng không phải là phương án thay thế cho nhau: một cái là mô hình có bảng giá và không có khả năng thoại, cái kia là sản phẩm có khả năng thoại, giới hạn đồng thời và ba đồng hồ đo cùng chạy một lúc. Cái nào rẻ hơn, tốt hơn hay nhanh hơn phụ thuộc hoàn toàn vào việc ứng dụng của bạn vốn đã mang hình dạng nào trong hai hình dạng đó.

Một mô hình, hoặc ba mô hình theo trình tự

Gemini 3.8 Live là một hệ thống chuyển giọng nói thành giọng nói thuần bản địa. Âm thanh đi vào, âm thanh đi ra, và quá trình suy luận diễn ra trong cùng một lượt lan truyền xuôi tạo ra giọng nói — một mô hình, một ngân sách độ trễ, một hóa đơn. Google đã phát hành nó dưới hai biến thể vào ngày 15 tháng 9 năm 2026: gemini-3.8-live cho công việc hội thoại ở quy mô lớn, và gemini-3.8-live-extended-thinking cho cùng giao diện đó nhưng có suy luận nhiều bước phía sau. Cả hai đều xử lý 97 ngôn ngữ với khả năng chuyển đổi ngay giữa cuộc hội thoại, cả hai đều xử lý đầu vào hình ảnh gần như theo thời gian thực, cả hai đều chạy các lệnh gọi công cụ và API ở chế độ nền trong khi cuộc hội thoại vẫn tiếp diễn, và cả hai đều gắn dấu bản quyền kỹ thuật số SynthID vào từng giây âm thanh được tạo ra. Mức giá công bố là 0,005 đô la Mỹ cho mỗi phút âm thanh đầu vào và 0,018 đô la Mỹ cho mỗi phút âm thanh đầu ra.

ElevenLabs Agents không phải như vậy. Nó là một pipeline, và chính pipeline là sản phẩm. Một mô hình nhận dạng giọng nói thời gian thực phiên âm lời của người gọi, một mô hình ngôn ngữ quyết định sẽ nói gì, và một mô hình tổng hợp — Eleven Flash v2 trong cấu hình mà ElevenLabs mô tả trong tài liệu — đọc câu trả lời. Mỗi giai đoạn được tính phí riêng, mỗi giai đoạn có thể được thay thế, và toàn bộ nằm sau một lớp được quản lý xử lý điện thoại, phát hiện lượt hội thoại và xử lý đồng thời. ElevenLabs Eleven v3, mô hình tổng hợp chủ lực của công ty, lại là một sản phẩm khác: một mô hình chuyển văn bản thành giọng nói có giá 100 USD cho mỗi triệu ký tự, được bán cho tường thuật, lồng tiếng và thiết kế giọng nói thay vì để duy trì một cuộc hội thoại.

Vậy điều đầu tiên cần nắm cho đúng là “Gemini 3.8 Live vs ElevenLabs Eleven v3” không phải là màn đối đầu trực tiếp giữa hai mô hình giọng nói. Eleven v3 không nhận đầu vào âm thanh và không duy trì hội thoại. Phép so sánh thực sự có ý nghĩa là Gemini 3.8 Live đối đầu với ElevenLabs Agents, với Eleven v3 chỉ góp mặt như mức trần chất lượng tổng hợp mà nền tảng này được xây dựng xoay quanh.

Vị trí thực tế của từng thứ trên bàn cờ

Không có bảng xếp hạng nào đặt hai thứ này đối đầu với nhau, và lý do thì rất đáng suy ngẫm: chúng liên tục xuất hiện trên những bảng khác nhau, đo lường những thứ khác nhau.

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

Trên Chỉ số Speech to Speech của Artificial Analysis — chỉ số kết hợp lý luận giọng nói, hoàn thành tác vụ agentic, mức độ ưu tiên trên đấu trường và thành công tác vụ thành một con số duy nhất — Gemini 3.8 Live đạt 76,0, với biến thể Extended Thinking đạt 82,6 ở vị trí đầu tiên. Đó là những phép đo do Artificial Analysis thực hiện dưới harness riêng của mình, không phải số liệu do Google công bố, mặc dù thông báo của chính Google có trích dẫn các con số từ cùng những thành phần đó.

ElevenLabs hoàn toàn không xuất hiện trên bảng xếp hạng đó, vì nó không phát hành mô hình chuyển giọng nói thành giọng nói nào để đo lường. Nơi nó xuất hiện là Speech Agent Arena, vốn đánh giá các agent đã được lắp ghép hoàn chỉnh thay vì đánh giá mô hình, và bức tranh ở đó thực sự rất pha trộn: ElevenLabs Agents đã được đo ở mức 937 Elo với tỷ lệ thành công nhiệm vụ 90,5%, so với 1.046 Elo và tỷ lệ thành công nhiệm vụ 74,6% của một agent được xây dựng trên thế hệ Gemini Live trước đó, với agent Gemini đạt âm thanh đầu tiên trong 0,96 giây. Hãy đọc kỹ cặp số liệu đó. Agent dựa trên Gemini thắng về mức độ ưa thích và tốc độ; agent ElevenLabs thắng về việc hoàn thành nhiệm vụ. Đó là một cascade đánh bại một mô hình gốc về độ tin cậy, một kết quả mà các sơ đồ kiến trúc không thể dự đoán được.

Hai lưu ý về những con số đó, và cả hai đều quan trọng. Phía Gemini trong so sánh đó dùng thế hệ Gemini Live đầu năm 2026, chứ không phải 3.8 Live, nên đây không phải là kết quả đánh giá về mô hình mà bài viết này đang nói tới. Và bảng xếp hạng thứ ba đang được nhắc tới — đấu trường giọng nói Provider Voices của Artificial Analysis, nơi xếp hạng các mô hình tổng hợp giọng nói — đặt ElevenLabs Eleven v3 ở mức 1.177 Elo và biến thể hội thoại, ElevenLabs v3 Conversational, ở mức 1.219 Elo, so với 1.283 của đơn vị dẫn đầu, Cartesia Sonic 3.6. Bảng đó đo mức độ hay của giọng nói, chứ không đo hiệu suất của agent, và việc trộn lẫn hai thứ này chính là cách người ta rốt cuộc trích dẫn điểm tổng hợp giọng nói như bằng chứng về một hệ thống hội thoại.

So sánh thông số

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• Kiến trúc — Gemini 3.8 Live là một mô hình speech-to-speech nguyên bản duy nhất, trong khi ElevenLabs Agents là một chuỗi xếp tầng gồm nhận dạng giọng nói, một mô hình ngôn ngữ và tổng hợp giọng nói

• Đầu vào và đầu ra — Gemini 3.8 Live nhận âm thanh và trả về âm thanh trong một lượt duy nhất, so với ElevenLabs nhận âm thanh qua Scribe v2 Realtime và trả về qua Eleven Flash v2, với một bản chép lời văn bản ở giữa

• Những gì bạn có thể hoán đổi — Gemini 3.8 Live: không có gì, mô hình vẫn là mô hình; so với ElevenLabs: mọi giai đoạn đều độc lập, kể cả mô hình ngôn ngữ, mà trong ngăn xếp được tài liệu hóa là mô hình của Google

• Ngôn ngữ — Gemini 3.8 Live 97 với khả năng chuyển đổi ngay trong cuộc trò chuyện so với ElevenLabs Eleven v3 74

• Giá âm thanh — Gemini 3.8 Live 0,005 USD mỗi phút đầu vào và 0,018 USD mỗi phút đầu ra, so với ElevenLabs tính giá theo phút agent với token mô hình ngôn ngữ được tính riêng cộng thêm

• Điện thoại — Gemini 3.8 Live: không có dịch vụ first-party; bạn tự mang nhà mạng và tự quản lý phiên, so với ElevenLabs: được quản lý, first-party

• Tính đồng thời — Gemini 3.8 Live, tùy theo hạn ngạch Live API của bạn cho phép, so với ElevenLabs được bán theo các bậc đồng thời

• Công cụ agent — công cụ chạy nền Gemini 3.8 Live và việc thực thi API ngay trong mô hình, so với ElevenLabs, một lớp agent được quản lý với tính năng phát hiện lượt nói, quy trình công việc và thư viện giọng nói

• Artifact mở — không bên nào. Cả hai đều đóng, chỉ trên đám mây và độc quyền.

• Độ trễ — Gemini 3.8 Live mất 1,18 giây để có âm thanh đầu tiên đối với mô hình tiêu chuẩn và 1,35 giây đối với Extended Thinking, theo Artificial Analysis; còn ElevenLabs thì không công bố dưới dạng một con số duy nhất, vì độ trễ của một quy trình xếp tầng là tổng của ba giai đoạn

Hàng cuối cùng là hàng giải thích lựa chọn kiến trúc rõ hơn bất kỳ hàng nào khác. Một mô hình native chỉ có một ngân sách độ trễ. Một cascade có ba, và lý do các nhóm vẫn chọn cascade nằm ở mọi thứ phía trên nó: bản chép lời bạn có thể ghi log, công đoạn bạn có thể hoán đổi, và số điện thoại vốn hoạt động ngay.

Giá của một phút, cả hai chiều

Phép tính của Gemini 3.8 Live dễ một cách bất thường vì chỉ có một đồng hồ đo. Một phút hội thoại đại khái bằng một phút âm thanh của người gọi cộng một phút âm thanh của mô hình: $0.005 cộng $0.018, tức khoảng 2,3 xu một phút theo mức giá đã công bố. Cột chi phí mỗi giờ của Artificial Analysis, vốn quy đổi chi phí hoàn thành một bộ suy luận âm thanh cố định thành con số theo giờ, đặt mô hình tiêu chuẩn ở mức $0.84 mỗi giờ âm thanh đầu vào — mức giá trả phí rẻ nhất trên bảng đó — và biến thể Extended Thinking ở mức $3.50.

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

Cách tính của ElevenLabs phức tạp hơn, và đó chính là điều đáng nói chứ không phải một lời chỉ trích. Một phút agent không chỉ có một mức giá: có phí nền tảng cho chính phút agent đó, lượng token mô hình ngôn ngữ tiêu thụ ở chặng giữa, và số phút của nhà mạng bên dưới — ba đồng hồ đo, trong trường hợp xấu nhất là ba nhà cung cấp, và một hóa đơn thay đổi khi bất kỳ một trong số đó thay đổi. Phía tổng hợp thì dễ hiểu hơn: ElevenLabs Eleven v3 với mức 100 đô la cho mỗi triệu ký tự tương đương khoảng 8 đô la một giờ tường thuật liên tục ở tốc độ nói thông thường, so với khoảng 2,70 đô la cho đối thủ open-weights rẻ nhất trên cùng đấu trường đó. ElevenLabs thu mức phí cao hơn cho giọng nói, và trên bảng xếp hạng đó, mức phí cao ấy là có thật — nó đứng thứ tư chung cuộc.

Trên thực tế, hai cấu trúc chi phí này có nghĩa là Gemini 3.8 Live rẻ hơn trên mỗi phút hội thoại và rẻ hơn nhiều trên mỗi giờ âm thanh, trong khi ElevenLabs đắt hơn và dễ dự đoán hơn nhiều khi vận hành. Một đội không có kỹ sư ML và cần dựng một số điện thoại sẽ chi ít hơn cho ElevenLabs trong tháng đầu tiên, bởi vì lựa chọn thay thế là tự xây dựng thứ mà ElevenLabs đã xây sẵn. Một đội đã tự vận hành quản lý phiên và nhà mạng riêng sẽ chi ít hơn cho mô hình thô, bởi vì họ không phải trả tiền cho một pipeline mà họ đã có.

ElevenLabs thực sự giỏi hơn ở điểm nào

Sẽ rất dễ để đọc khoảng cách giá như một phán quyết. Nhưng nó không phải vậy, và những lý do chính là những điều mà một bảng giá cước không bao giờ cho thấy.

• Viễn thông. ElevenLabs bán số điện thoại, SIP trunking và khả năng xử lý đồng thời để trả lời cuộc gọi. Google bán một mô hình biết nói. Nếu sản phẩm của bạn là một đường dây điện thoại, khoảng cách giữa hai câu đó là hàng tháng trời kỹ thuật.

• Bản sắc giọng nói. Voice Library, quy trình nhân bản giọng nói và studio lồng tiếng là một bề mặt sản phẩm đã trưởng thành. Gemini 3.8 Live cho bạn một mô hình; nó không cho bạn một danh mục giọng nói đã được cấp phép hay một quy trình làm việc để bản địa hoá một bản ghi âm sẵn có sang chín ngôn ngữ.

• Mặc định là có bản chép lời. Vì một cascade phiên âm trước khi suy luận, bạn nhận được nhật ký văn bản của mọi cuộc gọi miễn phí — hữu ích cho việc tuân thủ, cho đánh giá, và cho công việc không hào nhoáng là tìm ra lý do tại sao tác nhân lại làm sai điều gì đó. Một mô hình speech-to-speech gốc không có artifact như vậy trừ khi bạn tự xây dựng một cái.

• Các thành phần có thể hoán đổi. Khi một mô hình ngôn ngữ tốt hơn ra mắt, một cascade của ElevenLabs có thể áp dụng nó mà không cần huấn luyện lại bất cứ thứ gì. Đó chính xác là lý do ngăn xếp được tài liệu hóa có một mô hình Google ở giữa — và đó là lập luận mạnh nhất cho kiến trúc cascade.

Những gì mô hình thô mang lại cho bạn

Lập luận phản bác không nằm ở giá. Nó nằm ở việc một lượt truyền xuôi duy nhất có thể làm được điều mà ba giai đoạn không thể.

Gemini 3.8 Live nghe trực tiếp ngữ điệu, giọng điệu và sự ngập ngừng thay vì qua một bản chép lời đã loại bỏ chúng, đó là lý do tại sao nó có thể chuyển đổi ngôn ngữ giữa câu và tại sao điểm số động lực hội thoại của nó — 96,1% đối với mô hình tiêu chuẩn, theo Artificial Analysis — là thành phần duy nhất mà nó đánh bại người anh em nặng về lý luận của chính mình. Nó cũng chạy các lệnh gọi công cụ và API trong nền trong khi vẫn tiếp tục nói, vì vậy việc tra cứu không tạo ra sự im lặng. Và biến thể Extended Thinking là một khả năng thực sự khác biệt chứ không phải là một phiên bản lớn hơn của cùng một khả năng: nó giải quyết 68,6% các tình huống dịch vụ khách hàng τ-Voice so với 30,1% của mô hình tiêu chuẩn, một khoảng cách 38 điểm, con số đơn lẻ lớn nhất trong bản phát hành và là lý do Google tách dòng sản phẩm thành hai.

Nếu công việc của agent của bạn là hoàn thành một tác vụ nhiều bước thay vì duy trì một cuộc trò chuyện dễ chịu, thì khoảng cách 38 điểm đó chính là toàn bộ quyết định, và nó tốn $3.50 một giờ thay vì $0.84 — vẫn thấp hơn mọi mô hình mà nó đánh bại trên bảng xếp hạng đó.

Chân giữa là chân mà bạn thực sự có thể di chuyển được.

Đây là điểm nối đáng được gọi tên, vì đó là nơi câu hỏi kiến trúc biến thành câu hỏi mua sắm. Trong một cascade, chặng giữa — phần quyết định nói gì, gọi các công cụ và thực hiện suy luận — là suy luận văn bản thông thường. Đây cũng là chặng có độ biến động chi phí lớn nhất, mức độ khóa chặt cao nhất và ít lý do nhất để bị gắn với bất kỳ nhà cung cấp đơn lẻ nào. Ngăn xếp mà ElevenLabs mô tả trong tài liệu tình cờ dùng một mô hình Gemini ở đó. Điều đó không nhất thiết phải như vậy.

OrcaRouter đảm nhận chặng đó chứ không phải hai chặng ngoài. Chúng tôi không vận hành các endpoint thoại Gemini 3.8 Live — chúng đến từ Live API của chính Google — và chúng tôi cũng không vận hành ElevenLabs, nơi có lớp tổng hợp giọng nói và lớp agent là sản phẩm riêng của họ. Thứ chúng tôi cung cấp là lớp văn bản bên dưới: hơn 200 mô hình sau một khóa duy nhất, đúng giá niêm yết của nhà cung cấp, không phụ phí, nhờ đó khi một phòng lab thượng nguồn giảm giá, hóa đơn của bạn nhận được mức giá mới ngay trong ngày chứ không phải đợi đến kỳ gia hạn kế tiếp. Với riêng một ngăn xếp thoại, ba trong số những đặc tính đó chứng tỏ được giá trị của mình. Tự động chuyển đổi dự phòng giữ cho cuộc gọi không bị ngắt khi backend báo lỗi hoặc hết thời gian chờ ngay giữa câu — một kiểu lỗi mà người gọi nhận ra tức thì. DSL định tuyến kết hợp nhiều mô hình vào một cuộc gọi, để một mô hình rẻ có thể xử lý các lượt xác nhận còn mô hình mạnh hơn đảm nhận phần giao dịch. Và model fusion cho phép một nhóm mô hình cùng trả lời ở những lượt mà phán đoán của một mô hình đơn lẻ chưa đủ đáng tin để một mình gánh vác. Thay đổi mô hình nào nằm ở giữa một cascade chỉ là thay đổi cấu hình, không phải xây lại — đó chính là lý do toàn bộ kiến trúc cascade tồn tại.

Chọn cái nào?

Chọn ElevenLabs nếu bạn đang triển khai một đường dây điện thoại và không muốn tự xây dựng một voice stack. Bạn đang mua dịch vụ điện thoại, một danh mục giọng nói, bản ghi, khả năng xử lý đồng thời và một hợp đồng hỗ trợ, và khoản phụ phí theo phút chính là cái giá của những thứ đó. Bạn cũng đang mua khả năng đổi model ngay giữa chừng mà không phải thay đổi bất cứ thứ gì khác, điều này có giá trị lớn hơn nghe tưởng.

Chọn Gemini 3.8 Live nếu giọng nói chỉ là một tính năng của thứ bạn đã vận hành. Bạn nhận được mức giá speech-to-speech đủ năng lực rẻ nhất mà hiện có ai đó công bố, 97 ngôn ngữ với khả năng chuyển đổi ngay giữa cuộc trò chuyện, thực thi công cụ diễn ra trong khi mô hình vẫn tiếp tục nói, và — nếu agent của bạn phải hoàn thành nhiệm vụ chứ không chỉ trò chuyện — khoảng cách agentic 38 điểm mà biến thể Extended Thinking mua được với chi phí âm thanh theo giờ cao gấp khoảng bốn lần. Bạn tự cung cấp nhà mạng, vòng đời phiên và log.

Những điều cần theo dõi: liệu ElevenLabs có công bố một con số độ trễ duy nhất cho một phút agent được quản lý hay không, vì đó chính là con số sẽ khiến so sánh này mang tính định lượng thay vì chỉ mang tính cấu trúc; và liệu kết quả của Speech Agent Arena có đứng vững khi một agent được xây dựng trên 3.8 Live được đo trên đó hay không, vì một cascade hiện đang đánh bại một mô hình gốc về mức độ thành công tác vụ là điều thú vị nhất trong cuộc so tài này và cũng là điều ít được giải thích nhất.