Một thẻ hero được tạo cho 'Gemini 3.8 Live with Live Avatar' trên nền trắng với gradient xanh lam và xanh lơ dịu nhẹ. Ba thẻ xếp chồng lên nhau ghi '15 tháng 9 năm 2026 — Gemini 3.8 Live và 3.8 Extended Thinking ra mắt trên Live', '24 tháng 9 năm 2026 — Live Avatar được công bố, Gemini Enterprise', 'Hôm nay — avatar là một tính năng doanh nghiệp, không phải ID mô hình'. Một dòng chân trang ghi 'Ngày tháng theo Google DeepMind.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Gemini 3.8 Live với Live Avatar: Google mang đến gương mặt cho mô hình giọng nói của mình

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking ra mắt vào ngày 15 tháng 9 năm 2026 — hai endpoint đối thoại trực tiếp native mà Google đã mở trên API của nhà cung cấp, một cái tối ưu cho độ trễ và một cái cho khả năng suy xét. Vào ngày 24 tháng 9, công ty công bố Gemini 3.8 Live with Live Avatar, thứ kết hợp tạo video gần thời gian thực với cùng vòng lặp giọng nói để mô hình có một gương mặt trong khi nó nói. Không có gì về hai ID mô hình thay đổi. Điều thay đổi là diện mạo mà cuộc trò chuyện được phép có, và — quan trọng hơn về hệ quả — những gì mô hình được phép làm với cuộc trò chuyện trong khi cuộc trò chuyện vẫn đang diễn ra.

Cái gì thực sự đã được phát hành vào ngày 24 tháng 9?

Bài đăng của DeepMind ngắn gọn và cụ thể, và đáng để tách bạch giữa điều nó tuyên bố và điều nó thực sự hàm ý. Live Avatar, theo chính lời của Google, "mang lại sự hiện diện thị giác gần như theo thời gian thực cho AI hội thoại của Gemini" bằng cách kết hợp tạo video theo thời gian thực với ngăn xếp giọng nói hiện có. Công ty mô tả khả năng khớp khẩu hình chính xác, biểu cảm tự nhiên và luân phiên lượt nói mượt mà, đồng thời đưa ra hai ví dụ triển khai: dịch vụ khách hàng và hướng dẫn tương tác. Rồi sau đó là câu quan trọng nhất với bất kỳ ai đang lên kế hoạch xây dựng — "Bắt đầu từ hôm nay, Gemini 3.8 Live với Live Avatar đã có mặt trên Gemini Enterprise."

Đó là toàn bộ câu chuyện về tính khả dụng. Live Avatar không phải là một ID model của Gemini API. Danh sách model âm thanh của API vẫn còn gemini-3.8-live và gemini-3.8-live-extended-thinking, và không có dòng nào dành cho avatar, còn bảng giá thì không có mục nào cho avatar. Tính năng này nằm trong Gemini Enterprise, nghĩa là đối tượng của thông báo này là các khách hàng doanh nghiệp và những nhà phát triển tích hợp thay mặt họ, chứ không phải những nhà phát triển cá nhân đang gọi Live API bằng một key ngay hôm nay.

Hai tuyên bố trong bài đăng đáng được trích dẫn chính xác, vì cả hai đều mạnh hơn ngôn ngữ ra mắt thông thường. Thứ nhất: Live Avatar “có tính năng đồng bộ hóa giọng nói sang giọng nói đa ngôn ngữ gốc” và “có thể chuyển đổi liền mạch qua 97 ngôn ngữ mà không làm giảm độ trung thực của video hay tạo ra hiện tượng lệch hình ảnh”. Con số 97 cũng chính là số ngôn ngữ mà bản ra mắt ngày 15 tháng 9 đã tuyên bố cho các mô hình đối thoại trực tiếp nền tảng, nên đây là tuyên bố đa ngôn ngữ hiện có được nhắc lại với một ràng buộc mới gắn kèm — khớp khẩu hình và hoạt họa khuôn mặt phải theo kịp khi ngôn ngữ thay đổi giữa câu. Thứ hai: mọi đầu ra đều được gắn watermark bằng SynthID, “được dệt trực tiếp vào đầu ra âm thanh và video”. Cả hai track, không chỉ giọng nói.

Khả năng thực sự mới chính là cái ở giữa.

Đọc qua phần hình ảnh và đoạn thú vị nhất là đoạn nói về các lệnh gọi công cụ. Google cho biết Live Avatar được hỗ trợ bởi "gọi công cụ không đồng bộ" có thể "kích hoạt các lệnh gọi công cụ và tìm nạp dữ liệu trong nền trong khi vẫn tiếp tục đối thoại tích cực, xử lý các tác vụ phức tạp trong khi đảm bảo luồng hội thoại không bị gián đoạn." Ví dụ minh họa là thủ tục nhận phòng của khách sạn, nơi mô hình gọi công cụ trong nền và vẫn tiếp tục trò chuyện.

Đó là một khác biệt kiến trúc thực sự so với dạng request-response mà hầu hết các tích hợp thoại được xây dựng xoay quanh, và đó chính là phần đi kèm một khoản chi phí. Thực thi bất đồng bộ nghĩa là mô hình đang làm công việc mà bản ghi thoại không hiển thị. Trong một pipeline văn bản, bạn sẽ thấy lời gọi công cụ như một lượt. Ở đây nó diễn ra bên dưới một cuộc hội thoại vẫn đang tiếp diễn, điều này làm dấy lên đúng những câu hỏi mà bất kỳ việc thực thi đồng thời nào cũng làm dấy lên: điều gì xảy ra nếu lời gọi công cụ thất bại âm thầm ngay giữa câu, và làm sao người gọi biết được? Bài viết của Google không nói, và model card là nơi cần tìm điều đó. Hãy coi tuyên bố "luồng hội thoại không bị ngắt" là do nhà cung cấp tự báo cáo và chưa được bất kỳ bên thứ ba nào mà chúng tôi tìm thấy kiểm chứng.

Ảnh đại diện cài sẵn, và danh sách cho phép mà giới hạn một nửa thú vị

Câu chuyện tùy chỉnh có hai tầng và chỉ một trong số đó được cung cấp rộng rãi. Mọi triển khai doanh nghiệp đều nhận được “một thư viện gồm nhiều avatar đặt sẵn đa dạng”. Avatar tùy chỉnh — được tạo “từ một hình ảnh tham chiếu chất lượng cao” trong khi “giữ nguyên nét giống với tham chiếu, phong cách thương hiệu hoặc bản sắc nhân vật” — nằm sau một cổng chặn, và Google nói rõ: “Avatar tùy chỉnh hiện chỉ khả dụng thông qua allowlisting dành cho doanh nghiệp.”

Vậy nên khả năng mà hầu hết các đội thực sự muốn, cái cho phép avatar khớp với một thương hiệu hoặc một nhân vật có tên, lại chính là cái bạn không thể tự phục vụ. Nếu kế hoạch của bạn phụ thuộc vào một người dẫn chương trình tổng hợp trông giống linh vật của bạn, thì bạn đang chờ một quyết định allowlist chứ không phải chờ một bản phát hành model. Đó là một thực tế mua sắm, không phải một thực tế kỹ thuật, và nó là kiểu thứ âm thầm trôi qua một quý.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

Vị trí của nó so với phần còn lại của dòng

Live Avatar không xuất hiện trong một dòng sản phẩm trống rỗng, và vị trí mà nó chiếm giữ dễ thấy nhất khi đặt cạnh những sản phẩm anh em cùng ra mắt trong cùng hai tuần.

• Hình thức phát hành — Gemini 3.8 Live với Live Avatar là một năng lực cấp doanh nghiệp bên trong Gemini Enterprise, so với Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking là các endpoint của Gemini API có mã model và mức giá theo phút được công bố
• Nhà phát triển có thể gọi — Live Avatar: không, không có mã model và không có dòng nào trên bảng giá, so với hai endpoint Live: có, gemini-3.8-live và gemini-3.8-live-extended-thinking
• Đầu ra — Live Avatar: âm thanh cùng video được đồng bộ hoá, so với các endpoint Live: chỉ có âm thanh
• Tuyên bố về ngôn ngữ — Live Avatar: 97 ngôn ngữ với khớp khẩu hình và duy trì biểu cảm liên tục, so với các endpoint Live: 97 ngôn ngữ với khả năng chuyển đổi tự động ngay giữa cuộc trò chuyện
• Watermark — Live Avatar: SynthID trên cả track âm thanh lẫn track video, so với các endpoint Live: SynthID trên âm thanh được tạo

Bản thân hai endpoint Live là cặp đôi đã được ghi chép kỹ lưỡng. Các đo lường độc lập cho thấy chúng cách xa nhau trên một số trục và gần nhau trên những trục khác: trên Artificial Analysis Speech to Speech Index, Gemini 3.8 Live Extended Thinking (High) đạt 82,6 so với 76,0 của Gemini 3.8 Live, một khoảng cách chủ yếu được tạo nên bởi chất lượng suy luận chứ không phải động lực hội thoại, nơi thứ tự bị đảo ngược. Số liệu của chính Google cho thấy chúng đạt 68,6% và 30,1% về mức hoàn thành tác vụ τ-Voice và 98% và 92% trên Big Bench Audio. Live Avatar kế thừa bất kỳ mô hình nào trong số đó mà bạn gọi bên dưới nó, và cũng kế thừa mức giá của chúng, vì avatar là một lớp trình bày bên trên cùng một vòng lặp hội thoại.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

Những gì điều này không thay đổi

Nó không làm cho các mô hình trở nên tốt hơn. Live Avatar là một lớp trình bày và điều phối: các chỉ số chất lượng của Gemini 3.8 Live vẫn như hồi ngày 15 tháng 9, và bất kỳ ai cần biến thể mạnh hơn trong hai biến thể vẫn phải chọn Extended Thinking và chấp nhận độ trễ của nó. Nó không đưa video vào API. Và nó không thay đổi giá để nói chuyện với mô hình, vốn vẫn được tính theo mức giá âm thanh theo phút của Live API — 0,005 USD mỗi phút âm thanh đầu vào và 0,018 USD mỗi phút âm thanh đầu ra — với việc tạo video của avatar không được niêm yết giá công khai vì nó không được bán riêng.

Điều nó thay đổi là tập hợp các sản phẩm có thể được xây dựng mà không cần một lớp kết xuất riêng. Một tác nhân hỗ trợ trước đây chỉ nói rồi để lại một bảng trống trên màn hình giờ có thể giữ một gương mặt trong khi nó làm việc, và công việc nó đang làm ở hậu trường không còn hiện ra như khoảng lặng chết. Đó là một thay đổi có ý nghĩa đối với hình dạng của một giao diện và một thay đổi khiêm tốn đối với mô hình nền tảng. Cả hai điều đó đều có thể cùng đúng một lúc.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

Những điều cần theo dõi, và một lưu ý về định tuyến

Ba điều sẽ đưa thứ này từ một thông báo thành một quyết định xây dựng. Việc đưa avatar tùy chỉnh vào danh sách trắng sẽ phải được mở ra, vì avatar đặt sẵn là một bản demo còn avatar tùy chỉnh là một sản phẩm. Track video sẽ phải có một mức giá, vì không ai có thể mô hình hóa kinh tế đơn vị trên một đầu ra không có giá. Và một endpoint avatar sẽ phải xuất hiện trong danh sách model của API, vì đó là sự khác biệt giữa một tính năng dành cho doanh nghiệp và một thứ mà nhà phát triển có thể gọi ngay tối nay.

Về phía chúng tôi, có một điều đáng được nói chính xác, vì rất dễ giả định điều ngược lại: OrcaRouter không định tuyến các endpoint Gemini 3.8 Live hay Live Avatar, và không có gì ở đây nên được hiểu như một tuyên bố rằng nó có định tuyến. Thứ chúng tôi thực sự cung cấp là phần còn lại của dòng 3.8 của Google — google/gemini-3.8-flash nằm trong số đó — cùng với danh mục hơn 200 mô hình từ một khóa duy nhất với giá niêm yết của nhà cung cấp, không cộng thêm. Nếu Live Avatar đưa kiến trúc của bạn về phía một agent phải suy luận về điều khách hàng đã nói, thì nửa suy luận của ngăn xếp đó chính là nửa bạn có thể hợp nhất ngay hôm nay.