Thẻ hero được tạo cho 'Gemini 3.8 Live vs Gemini 3.8 TTS' trên nền trắng với các điểm nhấn gradient xanh dương và xanh lơ dịu nhẹ. Cột bên trái với tiêu đề 'Phát hành trên Live API' liệt kê 'gemini-3.8-live', 'nghe và nói', 'âm thanh vào, âm thanh ra'; cột bên phải với tiêu đề 'Phát hành trên các endpoint TTS' liệt kê 'gemini-3.8-flash-tts', 'đọc văn bản viết', 'văn bản vào, âm thanh ra'. Dòng chân trang ghi 'Cả hai đều không được gọi là Gemini 3.8 TTS.' Logo OrcaRouter được ghép vào góc dưới bên phải.
Guides & Insights

Gemini 3.8 Live vs Gemini 3.8 TTS: Một vòng lặp hội thoại và một giọng đọc chia sẻ cùng tên thế hệ

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Gemini 3.8 Live là một mô hình giọng nói sang giọng nói ra mắt vào ngày 15 tháng 9 năm 2026 với tên gemini-3.8-live và gemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" hoàn toàn không phải là một mô hình — nó là thuật ngữ chung mà các bài đưa tin về đợt ra mắt, bao gồm cả tiêu đề bài đăng của chính Google, dùng để chỉ cặp endpoint chuyển văn bản thành giọng nói ra mắt vào ngày 23 tháng 9 năm 2026 với tên gemini-3.8-flash-tts và gemini-3.8-flash-lite-tts. Vậy đây không phải là trang so sánh thông thường, nơi hai sản phẩm tranh giành một công việc. Đây là một trang nói về hai công việc dùng chung một số thế hệ, và về sai lầm cụ thể mà người ta mắc phải khi coi hai từ "Live" và "TTS" là hai biến thể của cùng một thứ.

Bản fork mà số thế hệ dùng chung che giấu

Tài liệu về tạo giọng nói của Google tự vạch ra ranh giới, và câu đó rất dễ bị đọc lướt qua: "Khả năng TTS khác với việc tạo giọng nói được cung cấp qua Live API." Cùng đoạn đó giải thích lý do, và lý do mang tính cấu trúc chứ không phải là vấn đề chất lượng. Live API được xây dựng cho "âm thanh tương tác, phi cấu trúc, và các đầu vào cùng đầu ra đa phương thức." TTS qua Gemini API "được thiết kế riêng cho các tình huống đòi hỏi việc đọc lại văn bản chính xác với khả năng kiểm soát chi tiết." Một ghi chú ở phần sau nói rõ dạng đầu vào: các mô hình TTS chỉ nhận văn bản và chỉ trả về âm thanh.

Ràng buộc duy nhất đó — văn bản vào, âm thanh ra, không có đầu vào âm thanh — chính là toàn bộ sự so sánh. Một mô hình Gemini 3.8 Live nghe thấy người đang nói chuyện với nó. Một mô hình Gemini 3.8 Flash TTS hoặc Flash-Lite TTS không bao giờ nghe thấy ai; nó đọc một chuỗi ký tự và thể hiện chuỗi đó. Mọi thứ khác đều suy ra từ đó: những bài đánh giá tồn tại cho cái này là vô nghĩa đối với cái kia, giá cả được tính theo những đơn vị khác nhau, và các kiểu lỗi thì hoàn toàn không thể so sánh được.

Điều này quan trọng vì xét từ bên ngoài, hai trường hợp sử dụng trông giống hệt nhau. Một tác nhân thoại và một pipeline tường thuật đều cuối cùng phát ra giọng nói nghe như người thật. Chỉ một trong hai có thể bị ngắt lời.

Nơi "Gemini 3.8 TTS" thực sự được phân giải

Mở bảng các mô hình được hỗ trợ cho tính năng tạo giọng nói của Gemini API, bạn sẽ thấy bốn mục TTS và không có mục nào tên là Gemini 3.8 TTS. Hai trong số đó thuộc thế hệ này: Gemini 3.8 Flash TTS, mã mô hình gemini-3.8-flash-tts, với 130 ngôn ngữ, và Gemini 3.8 Flash-Lite TTS, mã mô hình gemini-3.8-flash-lite-tts, với 101 ngôn ngữ. Hai mục còn lại — Gemini 3.1 Flash TTS Preview và Gemini 2.5 Pro Preview TTS — là thế hệ preview mà Flash-Lite thay thế.

Vậy nên khi ai đó nói “Gemini 3.8 TTS”, họ thường đang ám chỉ tier Flash, vì đó là thứ mà bài đăng ra mắt nhắc đến đầu tiên và là thứ được bảng Arena xếp hạng cao nhất. Khi họ nói điều đó về một voice agent trực tiếp, họ chẳng đang trỏ đến thứ gì cả, bởi vì thứ họ muốn nằm trên một endpoint khác, với một cái tên khác và một hợp đồng đầu vào khác.

Có một va chạm thứ ba đáng được gọi tên, vì nó tạo ra lời khuyên tồi tệ nhất. Gemini 3.8 Live không phải là một mô hình chuyển văn bản thành giọng nói với các tính năng bổ sung. Nó là một mô hình chuyển giọng nói thành giọng nói, và lý do nó tốn nhiều chi phí hơn trên mỗi đơn vị là vì nó đang làm nhiều việc hơn trên mỗi đơn vị: lắng nghe, suy luận ngay giữa lúc đang nói, xử lý việc ngắt lời, và ở biến thể Extended Thinking, cân nhắc trước khi trả lời.

Con số duy nhất thực sự so sánh được

Điểm chất lượng không chuyển đổi giữa hai nhóm này; không có một bảng điểm duy nhất nào chấm điểm một người kể chuyện và một người trò chuyện trên cùng một trục. Tiền thì có thể chuyển đổi, một khi bạn chọn đơn vị một cách trung thực, và đơn vị trung thực cho bất kỳ thứ gì về giọng nói là giờ âm thanh.

• Tính theo đầu vào — Gemini 3.8 Live tính phí theo mỗi phút âm thanh, $0.005 mỗi phút đầu vào và $0.018 mỗi phút đầu ra, so với Gemini 3.8 Flash TTS tính phí theo mỗi triệu token âm thanh, $9.00 đến hết ngày 31 tháng 12 năm 2026 và $18.00 sau đó
• Tính theo đầu ra — âm thanh hai chiều của Gemini 3.8 Live tốn khoảng $1.38 cho một giờ nhập và xuất đồng thời theo giá niêm yết, trước mọi khoản lưu đệm prompt, so với Gemini 3.8 Flash TTS là luồng một chiều, và một triệu ký tự của bản tường thuật hoàn chỉnh tốn $16.5 theo cách chuẩn hóa của Artificial Analysis
• Đầu vào văn bản — Gemini 3.8 Live tính phí văn bản và âm thanh trên các dòng riêng biệt, $0.75 mỗi triệu token văn bản đầu vào và $4.50 đầu ra, so với các endpoint TTS tính phí đầu vào văn bản ở mức $0.50 mỗi triệu token
• Phân hạng Flash-Lite — Gemini 3.8 Live không có phiên bản rẻ hơn; lựa chọn là Live hoặc Extended Thinking, so với Gemini 3.8 Flash-Lite TTS niêm yết ở mức $6.00 rồi $12.00 mỗi triệu token âm thanh, với Artificial Analysis ở mức $11.0 mỗi triệu ký tự
• Hình thức đầu vào — Gemini 3.8 Live nhận âm thanh, video và văn bản, xuất âm thanh, so với các endpoint TTS nhận văn bản, xuất âm thanh

Con số Live là phép tính của chúng tôi dựa trên mức giá theo phút do Google công bố, không phải là con số theo giờ do Google công bố. Các con số theo ký tự là cách chuẩn hóa của Artificial Analysis và là những con số nên trích dẫn khi bạn so sánh các bậc tổng hợp. Lưu ý rằng bảng Speech to Speech của chính Artificial Analysis có một cột chi phí mỗi giờ âm thanh đầu vào riêng cho các mô hình Live — khoảng 3,50 USD cho Gemini 3.8 Live và 0,84 USD cho biến thể Extended Thinking — đây lại là một cách chuẩn hóa khác nữa và không nên đem đối chiếu với bảng giá theo phút như thể hai thứ là cùng một phép đo.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

Điều gì sẽ hỏng khi bạn chọn sai?

Các kiểu thất bại ấy rất có tính chỉ dẫn vì chúng quá khác biệt.

Gọi một endpoint TTS khi bạn cần một vòng lặp hội thoại và không có lỗi nào xảy ra. Yêu cầu trả về âm thanh hợp lệ. Bạn nhận được một phản hồi trôi chảy, được đọc tốt cho một chuỗi cố định, và rồi im lặng — bởi vì chưa từng có gì lắng nghe. Các nhóm phát hiện điều này khi họ xây dựng bài kiểm tra barge-in đầu tiên và nhận ra rằng "người dùng" phải đợi toàn bộ clip kết thúc trước khi lượt tiếp theo có thể bắt đầu. Việc gắn thêm một cuộc hội thoại vào một endpoint tổng hợp có nghĩa là thêm nhận dạng giọng nói, một chính sách lượt nói và một cơ chế ngắt lời xung quanh nó, đến lúc đó bạn đã xây dựng lại một cascade và bạn đang trả tiền cho hai mô hình thay vì một.

Gọi một Live endpoint khi bạn cần thuyết minh và bạn phải trả tiền cho khả năng mình không dùng đến. Một mô hình Live được tính phí ở cả hai chiều, vì nó mong đợi cả hai chiều. Đối với sách nói hoặc lồng tiếng cho video đào tạo, phía đầu vào là một kịch bản không bao giờ thay đổi và mô hình không cần nghe bất cứ điều gì. Bạn đang mua một vòng lặp hội thoại để đọc to một tài liệu.

Trường hợp duy nhất mà lựa chọn thực sự là trường hợp duy nhất là cascade, nhận dạng, rồi suy luận, rồi câu. Kiến trúc đó đã lỗi thời, và đối với nhiều hệ thống sản xuất, nó vẫn là kiến trúc đúng, bởi vì nó cho phép bạn thực hiện từng giai đoạn một cách độc lập và chọn một quy trình cho mỗi giai đoạn. Nó khiến bạn phải trả giá bằng độ trễ và khiến bạn đánh mất ngữ điệu mà một mô hình đầu-cuối duy nhất xuyên ranh giới có được. Sự đánh đổi là có thật theo cả hai hướng.

Nơi tuyến đường đã

OrcaRouter không cung cấp các endpoint Gemini 3.8 Live hay các endpoint TTS 3.8, và điều đó đáng để nói trước khi bàn đến bất cứ điều gì về định tuyến, bởi vì với một danh mục rộng đến vậy, người ta rất dễ mặc định điều ngược lại. Điều mà danh mục này thực sự có là phần còn lại của gia đình — google/gemini-3.8-flash nằm trong số 28 mô hình Google và hơn 200 mô hình tổng cộng, tất cả từ một khóa duy nhất với giá niêm yết của nhà cung cấp, không cộng thêm phí.

Điều đó đặc biệt quan trọng đối với hệ thống xếp tầng. Nếu kiến trúc của bạn là nhận dạng, rồi suy luận, rồi tổng hợp, thì giai đoạn suy luận là giai đoạn mà một khóa duy nhất xuyên suốt nhiều nhà cung cấp mang lại lợi ích, vì đây là giai đoạn bạn hoán đổi thường xuyên nhất và cũng là giai đoạn mà việc nhà cung cấp giảm giá đáng lẽ phải được phản ánh vào hóa đơn của bạn ngay trong cùng ngày thay vì vào kỳ gia hạn hợp đồng tiếp theo. Đây cũng là giai đoạn mà chuyển đổi dự phòng tự động chứng minh giá trị của nó: một hệ thống xếp tầng có ba chỗ có thể hỏng, và chỗ ở giữa là chỗ rẻ nhất để tạo dự phòng.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

Một quy tắc quyết định ngắn gọn

Nếu mô hình phải phản hồi một điều gì đó mà nó chưa có sẵn dưới dạng văn bản, bạn cần Gemini 3.8 Live, và bạn nên dự trù ngân sách theo mức giá âm thanh tính theo phút của Google, đồng thời chuẩn bị tinh thần cân nhắc xem mình cần biến thể nào trong hai biến thể. Nếu văn bản đã được viết sẵn và công việc là thể hiện nó, bạn cần Gemini 3.8 Flash TTS hoặc Flash-Lite TTS, và bạn nên dự trù ngân sách theo mỗi triệu ký tự, rồi chọn gói dựa trên độ phủ ngôn ngữ và việc liệu khoảng cách về chất lượng có xứng đáng với khoảng cách về giá hay không.

Và nếu bạn đang được yêu cầu so sánh "Gemini 3.8 Live và Gemini 3.8 TTS" như thể chúng là hai sản phẩm, điều hữu ích đầu tiên bạn có thể làm là hỏi xem đó là endpoint nào. Cái tên trên brief không quy về một endpoint cụ thể, và câu trả lời thay đổi kiến trúc chứ không chỉ mỗi hóa đơn.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.