Thẻ hero được tạo cho "Gemini 3.8 TTS: hai chim bồ nồng, hai mô hình" trên nền trắng với các điểm nhấn chuyển sắc xanh dương và xanh lam dịu nhẹ. Ba thẻ hiển thị "Gemini 3.8 Flash TTS — Elo 1.260, hạng 2, 8 giọng arena, 9,00 USD cho mỗi 1 triệu token âm thanh", "Gemini 3.8 Flash-Lite TTS — Elo 1.235, hạng 6, 6,00 USD cho mỗi 1 triệu token âm thanh" và "Đối thoại hai người nói — được hỗ trợ, thiết kế giọng nói, nhân bản trong 30 giây". Một dòng chân trang ghi "Elo theo Artificial Analysis Provider Voice Arena, tháng 9 năm 2026; giá niêm yết theo Google." Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

Gemini 3.8 TTS: Hai con bồ nông, hai mô hình và mức giá tăng gấp đôi vào tháng 1

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cách nhanh nhất để hiểu nhà cung cấp đã phát hành gì vào ngày 23 tháng 9 năm 2026 là xem bản demo được lan truyền cùng với nó: hai con bồ nông tranh luận xem có nên chuyển đến Pacifica Pier hay không, mỗi con một giọng, theo kịch bản từng lượt. Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS là hai mô hình đằng sau bản demo đó, cả hai đều được cung cấp rộng rãi trên Gemini API, và những con bồ nông không phải là chiêu trò. Chúng là điều đầu tiên trong thế hệ này mà các mô hình giọng nói Gemini trước đây hoàn toàn không thể làm được: hai người nói, một lần tạo, một kịch bản kiểm soát ai nói gì.

Giá cả là nửa còn lại của câu chuyện, và đó chính là điểm hai mô hình tách nhau. Flash TTS tính phí $0,50 mỗi triệu token văn bản đầu vào và $9,00 mỗi triệu token âm thanh đầu ra đến ngày 31 tháng 12 năm 2026, sau đó là $18,00; Flash-Lite TTS tính phí $0,50 và $6,00 theo cùng lịch đó, sau đó là $12,00. Đó là mức giá của chính Google. Khi được Artificial Analysis quy đổi về cơ sở mỗi triệu ký tự để có thể nằm cùng bảng với mọi mô hình khác, chúng cho ra mức $16,50 và $11,00 — rẻ hơn khoảng một phần ba đối với mô hình Lite, và cả hai đều thấp hơn nhiều so với mức mà các mô hình đứng đầu bảng đó tính phí.

Vậy nên câu hỏi thú vị không phải là liệu các mô hình có tốt hay không. Mà là bạn nên xây dựng dựa trên mô hình nào trong hai, bởi vì khoảng cách giữa chúng không phải là khoảng cách mà bạn sẽ đoán ra từ tên gọi.

Thông báo ngày 23 tháng 9 thực sự có nội dung gì

Hai mô hình, không phải một, và Google nói rõ rằng chúng là sự tách biệt chứ không phải một phiên bản nhỏ và một phiên bản lớn của cùng một thứ. Thông báo nêu tên năm nơi chúng xuất hiện — Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook và Google Vids — và các mã định danh API thì rất rõ ràng: gemini-3.8-flash-tts và gemini-3.8-flash-lite-tts.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

Danh sách khả năng dài hơn những gì tiêu đề gợi ý. Từ thông báo của Google và tài liệu tạo giọng nói của Gemini API:

• Thiết kế giọng nói — bạn mô tả một giọng nói bằng từ ngữ và nhận lại ID giọng nói tùy chỉnh, thay vì chọn từ một danh sách cố định.

• Nhân bản giọng nói — một mẫu 30 giây tạo ra ID giọng nói, đây là hướng mà hầu hết các nhóm sẽ thực sự sử dụng cho giọng thương hiệu hoặc người dẫn chuyện.

• Đối thoại hai người nói — trường hợp chim bồ nông. Kịch bản chứa các lượt lời của người nói thay vì một khối văn xuôi duy nhất.

• Định dạng ở cấp lượt — tài liệu mô tả một chú thích speech_metadata gắn chỉ dẫn vào một lượt cụ thể thay vì toàn bộ yêu cầu.

• Giọng nói dựng sẵn, cùng với Thư viện giọng nói mở rộng có thể truy cập tại GET /v1beta/voices.

• Ba kiểu mã hóa âm thanh — mặc định là WAV, với mulaw và alaw sẵn có cho các pipeline dạng điện thoại.

• Chỉ đầu vào là văn bản, chỉ đầu ra là âm thanh. Tài liệu nói thẳng về điều này: các mô hình TTS không nhận bất kỳ dạng đầu vào nào khác và không tạo ra bất kỳ dạng đầu ra nào khác, và có một mục Giới hạn riêng liệt kê các hạn chế.

Điều không có trong thông báo là bất kỳ con số nào mà một người lập kế hoạch dung lượng cần. Giới hạn tốc độ, hạn ngạch và thời hạn lưu trữ của một giọng nói đã thiết kế đều nằm trong tài liệu và trang định giá, chứ không nằm trong bài đăng ra mắt, và đó thường là lý do khiến tuần ra mắt diễn ra suôn sẻ với demo nhưng tồi tệ với production.

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

Những con bồ nông mới chính là tin tức thật sự.

TTS đơn giọng đã là một bài toán gần như được giải quyết trong hai năm qua. Điều còn thiếu là một mô hình có thể giữ hai danh tính tách biệt xuyên suốt một kịch bản dài mà không bị trôi lệch, và đó mới là điều bản demo thực sự kiểm chứng — không phải liệu giọng nói có nghe như người thật hay không, mà là liệu người nói A có vẫn là người nói A ở phút thứ tư hay không.

Hai điều suy ra từ đó, và chúng là lý do điều này quan trọng vượt ra ngoài những món đồ chơi podcast.

Điều đầu tiên là đơn vị công việc thay đổi. Với mô hình một người nói, một đoạn hội thoại dài hai mươi phút là hai mươi phút âm thanh mà bạn ghép lại từ hai lượt chạy độc lập, và mọi mối nối đều là nơi ngữ điệu bị đặt lại. Với mô hình hai người nói, đó là một lần gọi, một ngữ cảnh, và mô hình có thể phản ứng với câu thoại ngay trước nó. Đó là một khác biệt về chất lượng mà bạn không thể bù đắp bằng hậu xử lý.

Điều thứ hai là định dạng script trở thành giao diện. Nếu pipeline của bạn vốn đã xuất ra thứ gì đó có dạng SSML — một chú thích cho mỗi cụm từ — thì việc tạo này gần như có thể thay thế trực tiếp. Nếu pipeline của bạn đưa cho mô hình một đống văn bản và hy vọng, thì giờ đây bạn có lý do để tái cấu trúc nó, bởi vì phong cách vốn từng ngầm hiểu giờ đây là thứ bạn phải nói ra thành lời. Đó là cùng một sự đánh đổi mà phần còn lại của lĩnh vực đang thực hiện theo những cách khác nhau, và đó là trục mà hai mô hình Google này cạnh tranh với mọi thứ khác trên bàn cờ.

Chi phí cho một giờ âm thanh two-pelican là bao nhiêu

Việc tính toán token đáng để làm một lần, vì con số trên mỗi triệu token âm thanh không phải là con số trên mỗi giờ, và sự khác biệt này đã khiến nhiều người bất ngờ.

Token âm thanh được tạo ra ở tốc độ cố định mỗi giây đầu ra, vì vậy chi phí tỉ lệ với độ dài của audio thành phẩm, chứ không phải độ dài của kịch bản. Lấy mức giá của chính Google cho Flash TTS — 9,00 USD cho mỗi triệu token âm thanh đầu ra — thì phép tính cho một bản thành phẩm dài một giờ rơi vào khoảng dưới 10 USD ở gói tiêu chuẩn, với mô hình Lite chỉ bằng hai phần ba mức đó. Giá Batch và Flex, ở mức 0,25 USD đầu vào và 4,50 USD đầu ra cho Flash TTS so với 0,25 USD và 3,00 USD cho Flash-Lite TTS, càng cắt giảm thêm cho bất kỳ thứ gì không cần tạo theo yêu cầu. Priority, ở mức 0,90 USD và 16,00 USD, dành cho những công việc cần tạo theo yêu cầu.

Ba hệ quả thực tiễn:

• Tạo lại một đoạn văn thì rẻ; tạo lại cả một chuỗi lại là một quyết định. Với mức giá này, phần đắt đỏ trong pipeline giọng nói không còn là suy luận nữa mà quay trở lại là con người — người phê duyệt bản thu.

• Chi phí đầu vào văn bản chỉ là nhiễu. 0,50 USD cho mỗi triệu token văn bản trên một kịch bản dài vài nghìn từ là một sai số làm tròn so với phần âm thanh. Đừng tối ưu hóa kịch bản theo độ dài.

• Mốc 31 tháng 12 là có thật và nó tăng gấp đôi mức giá audio. Nếu bạn đang lên kế hoạch triển khai cho năm 2027, hãy dự toán theo con số sau khuyến mãi, không phải con số khi ra mắt, nếu không bạn sẽ phải lập lại kế hoạch vào tháng Một.

Con số độc lập, và những con số không độc lập

Một số liệu trong đợt ra mắt này đến từ một nơi khác ngoài Google. Trên Artificial Analysis Provider Voice Arena, ghi nhận ngày 24 tháng 9 năm 2026, Gemini 3.8 Flash TTS đứng ở vị trí thứ 2 với Elo 1.260 trên 1.999 mẫu và 8 giọng arena, còn Gemini 3.8 Flash-Lite TTS đứng ở vị trí thứ 6 với 1.235 trên 2.000 mẫu. Cả hai đều nằm trong khoảng tin cậy của nhau ở mức ±16 và ±17, vì vậy bảng xếp hạng cho thấy chúng không thể phân biệt được về mặt thống kê dựa trên sở thích — đây thực sự là một kết quả hữu ích, bởi vì điều đó có nghĩa là phiên bản rẻ hơn không bị người nghe đánh giá tệ hơn một cách đáng kể.

Mọi thứ còn lại đều là tuyên bố của chính Google và nên được hiểu đúng như vậy: ngôn ngữ biểu cảm, số lượng ngôn ngữ, chất lượng nhân bản. Arena chỉ cho bạn một bảng xếp hạng theo sở thích và không gì hơn. Nó không cho bạn biết mỗi mô hình xử lý một kịch bản dài 40 phút mà không bị trôi lệch như thế nào, nó hành xử ra sao với một danh từ riêng mà nó chưa từng thấy, hay điều gì xảy ra với một giọng đã được thiết kế sau một tuần.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

Mô hình Lite cũng là lập luận thuyết phục hơn cho việc cặp này là một sự phân tách thực sự chứ không phải một bậc tiếp thị. Khoảng cách Elo 25 điểm nằm trong biên sai số, đối chiếu với khoảng cách giá 33%, chính là dáng dấp của một quyết định mà các pipeline nhạy cảm về giá nên đưa ra theo hướng nghiêng về Lite gần như mọi lúc — và cũng là dáng dấp của một quyết định mà các pipeline nhạy cảm về độ trễ nên đưa ra theo hướng ngược lại, vì hai bên khác nhau cả trên đồng hồ lẫn trên hóa đơn.

Chạy nó ở đâu, và phiên bản trung thực của câu trả lời đó

OrcaRouter không lưu trữ các endpoint Gemini 3.8 TTS. Điều đó đáng được nói thẳng thay vì ám chỉ ngược lại, bởi vì điều hữu ích chúng ta có thể nói về hai mô hình này không phải là chúng tôi phục vụ chúng — chúng tôi không làm vậy — mà là việc nhà cung cấp giảm giá như thay đổi ngày 31 tháng 12 chính là kiểu sự kiện khiến cho định tuyến trở nên đáng có.

OrcaRouter đưa hơn 200 mô hình vào sau một API key duy nhất với mức giá niêm yết của nhà cung cấp và không phụ trội, nên bảng giá của nhà cung cấp chính là mức bạn phải trả, và khi bảng giá đó thay đổi, bên chúng tôi cập nhật ngay trong cùng ngày thay vì đợi đến kỳ thanh toán tiếp theo. Với một pipeline giọng nói đang trong quá trình chuyển đổi, lớp dự phòng quan trọng hơn cả danh mục: bạn có thể đưa một luồng yêu cầu vào một mô hình vẫn đang được đánh giá mà không đặt cược một tuyến production vào nó, bởi vì một cuộc gọi thất bại có thể chuyển sang thứ đã được kiểm chứng. DSL định tuyến kết hợp nhiều mô hình vào một cuộc gọi cho những trường hợp mà một giọng đơn lẻ không đủ tốt, và tính năng hợp nhất mô hình trả lời một prompt bằng cả một hội đồng khi câu trả lời quan trọng hơn độ trễ.

Đối với chính các mô hình Gemini 3.8 TTS, nơi để gọi chúng là API riêng của Google, cùng những bề mặt mà Google đã nêu tên vào ngày 23 tháng 9. Điều mà cặp mô hình này làm cho kiến trúc của bạn — một lệnh gọi cho hai người nói, định kiểu dưới dạng chú thích, một giọng nói có thể được mô tả thay vì được chọn — chính là phần tồn tại lâu hơn ưu đãi ra mắt.

Xem gì tiếp theo

Ba điều sẽ quyết định liệu thế hệ này là một bước nhảy vọt hay chỉ là một tính năng.

Đầu tiên là hiện tượng trôi. Chưa ai công bố một đánh giá dài hơi về việc liệu nhánh hai người nói có giữ được danh tính suốt một giờ đồng hồ hay không, và cho đến khi có ai đó làm điều đó, demo pelican vẫn chỉ là demo. Thứ hai là vòng đời của giọng nói. Một giọng được thiết kế mà hết hạn sau một tuần là nguyên mẫu; một giọng có thể được tái dẫn xuất từ một cấu hình đã lưu là sản phẩm, và câu trả lời phụ thuộc vào việc bạn giữ lại định danh nào trong hai định danh. Thứ ba là điều gì xảy ra sau ngày 31 tháng 12, khi mức giá khuyến mãi kết thúc và chi phí mỗi giờ của một pipeline giọng nói tăng gấp đôi chỉ sau một đêm.

Không có điều nào trong số đó thấy được từ bài đăng ra mắt. Cả ba đều thấy được từ tài liệu, và đó chính là nơi các bài đưa tin về ra mắt dừng đọc.