
Gemini 3.8 Flash TTS cất tiếng chào: Google tách dòng sản phẩm giọng nói thành hai và cắt giảm giá
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Nhà cung cấp đã phát hành hai mô hình giọng nói vào ngày 23 tháng 9 năm 2026, và thông báo được viết như thể tiêu đề là chất lượng giọng nói. Nhưng thực tế không phải vậy. Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS là những mô hình chuyển văn bản thành giọng nói đầu tiên mà nhà cung cấp đưa lên Gemini Developer API với mức giá thấp hơn mô hình xem trước mà chúng thay thế — và với bất kỳ ai đang trả tiền theo ký tự ở nơi khác, đó chính là phần làm thay đổi một dòng ngân sách. Mức giá đầu ra âm thanh trên Gemini 3.8 Flash TTS là $9.00 mỗi triệu token đến hết năm 2026. Âm thanh được tính phí ở mức 25 token mỗi giây, tương đương khoảng 0,02 xu mỗi giây giọng nói được tạo. Mô hình mà nó thay thế, Gemini 3.1 Flash TTS Preview, có mức giá $20.00 mỗi triệu token âm thanh.
Nửa sau của câu chuyện là hiện giờ có hai mô hình, không phải một. Google đã tách dòng sản phẩm: Flash TTS mang đầy đủ bộ ngôn ngữ và tốc độ âm thanh cao hơn, còn Flash-Lite TTS mang danh sách ngôn ngữ ngắn hơn và rẻ hơn. Đó là một hình dạng khác so với cách bố trí một mô hình xem trước duy nhất vốn đã có trên API từ tháng Tư, và nó cho bạn biết Google nghĩ thị trường trông như thế nào — một số ít ứng dụng cần 130 ngôn ngữ và nhân bản giọng nói, cùng với số lượng lớn hơn nhiều ứng dụng chỉ cần một giọng tiếng Anh đủ tốt cho bot hỗ trợ và không cần gì khác.
Điều gì thực sự đã được phát hành vào ngày 23 tháng 9
Cả hai mô hình đều được cung cấp rộng rãi trên Gemini API và trong AI Studio kể từ thời điểm công bố, không bị giới hạn sau danh sách chờ. Tên trên API là gemini-3.8-flash-tts và gemini-3.8-flash-lite-tts.
• Flash TTS — 130 ngôn ngữ, tự động phát hiện ngôn ngữ từ văn bản, 30 giọng thu phòng thu dựng sẵn bao gồm Kore và Puck.
• Flash-Lite TTS — 101 ngôn ngữ, cùng giao diện thiết kế giọng nói, được định vị là phân khúc khối lượng lớn.
• Cả hai — thiết kế giọng nói từ mô tả bằng ngôn ngữ tự nhiên, hướng dẫn cách thể hiện theo từng dòng, dàn dựng cảnh có hai người nói, và các tín hiệu phi ngôn từ được viết thẳng vào kịch bản.
• Đầu ra — WAV 24 kHz mono PCM có dấu 16-bit trên điểm cuối unary; PCM không có header (audio/l16) trên điểm cuối streaming; audio/mulaw và audio/alaw cũng được chấp nhận, với tốc độ lấy mẫu có thể cấu hình.
Bảng giá, tính trên mỗi triệu token, đáng để đọc trọn vẹn vì các bậc không chỉ khác nhau ở con số được nêu bật:
• Flash TTS Standard — 0,50 USD cho văn bản đầu vào / 9,00 USD cho âm thanh đầu ra, tăng lên 1,00 USD / 18,00 USD sau ngày 31 tháng 12 năm 2026.
• Flash TTS Batch và Flex — $0.25 / $4.50.
• Flash TTS Priority — 0,90 USD / 16,20 USD.
• Flash-Lite TTS Standard — $0.50 / $6.00, tăng lên $1.00 / $12.00 sau ngày 31 tháng 12 năm 2026.
• Flash-Lite TTS Batch và Flex — 0,25 USD / 3,00 USD.
• Ưu tiên Flash-Lite TTS — 0,90 đô la Mỹ / 10,80 đô la Mỹ.
• Gemini 3.1 Flash TTS Preview, để so sánh — $1.00 / $20.00, theo lô $0.50 / $10.00.
Điều cần lưu ý là thời gian khuyến mãi. Google đã định giá cả hai mô hình mới ở mức nửa giá cho đến cuối năm và công bố các con số sau khuyến mãi trong cùng một bảng. Bất kỳ ai đang mô hình hóa chi phí trên mỗi nghìn phút nên dùng con số tháng 1, không phải con số tháng 9.

Thiết kế giọng nói là khả năng thực sự mới
Giọng nói dựng sẵn chỉ là điều kiện tối thiểu. Điều Google thêm vào trong 3.8 là cách mô tả giọng nói bằng từ ngữ và nhận được nó, cùng cách nhân bản một giọng từ mẫu ngắn đi kèm kiểm tra đồng ý.
Thiết kế giọng nói nhận một câu lệnh bằng ngôn ngữ tự nhiên — nhịp độ, âm sắc, giọng điệu, những thứ mà nếu không bạn sẽ phải dành cả buổi chiều để thử giọng — và trả về một giọng nói sử dụng được mà không cần bản ghi tham chiếu. Sao chép giọng nói thì ngược lại: bạn cung cấp một mẫu 30 giây, hệ thống xác minh sự đồng ý, và giọng nói thu được sẽ được đánh dấu bằng hình mờ SynthID và thông tin xác thực C2PA trên âm thanh được tạo. Pha trộn giọng nói, tính năng cho phép bạn kết hợp hoặc sửa đổi một giọng nói tùy chỉnh hiện có, được liệt kê là sắp ra mắt thay vì đã phát hành.
Giọng nói tùy chỉnh có hai loại và chúng hành xử khác nhau đủ để sự phân biệt này quan trọng trong môi trường production. Giọng nói tùy chỉnh có trạng thái được lưu trữ theo dự án, giới hạn ở 200 mỗi dự án, với thời gian tồn tại một năm. Giọng nói không trạng thái được định địa chỉ bằng một voicekey_... mã và hết hạn sau bảy ngày. Nếu ứng dụng của bạn cấp phát một giọng nói cho mỗi khách hàng, giới hạn và TTL là hai con số quyết định liệu bạn có cần một lớp lưu trữ riêng hay không.
Các điều khiển cách thể hiện là nửa còn lại của "mới". Bạn có thể chỉ đạo một câu thoại theo cách bạn chỉ đạo một diễn viên — nhịp độ, nhấn mạnh, sắc thái cảm xúc — thay vì chỉ chọn một giọng và hy vọng. Các cảnh hai người nói có thể được dàn dựng trong một cuộc gọi. Và những âm thanh phi ngôn ngữ là các yếu tố kịch bản hạng nhất: <laughs>, <sigh> và <gasp> như các tín hiệu nội tuyến, cùng với |mhm| và |yeah| cho những âm thanh phản hồi nhỏ tạo cho cuộc trò chuyện tổng hợp nghe như một cuộc trò chuyện thật. Đọc dài được cho là giữ được danh tính người nói với độ trôi tối thiểu, đây là kiểu lỗi xuất hiện đầu tiên khi bạn tạo một chương sách nói dài 40 phút.
Các điểm chuẩn, và ai đã chạy chúng
Tài liệu ra mắt của Google dựa vào hai đánh giá từ bên ngoài và một loạt thứ hạng trên đấu trường. Tất cả đều do nhà cung cấp tự báo cáo — Google đang trích dẫn chúng, và các lần chạy cơ sở không được công khai — nên hãy coi chúng là những tuyên bố thay vì các phép đo.

• Hume AI Voice Design Benchmark — Gemini 3.8 Flash TTS đứng đầu với 71.4, và đứng đầu về mô hình hóa giọng điệu với 60.8.
• Chỉ số chất lượng tổng thể Hume — Flash TTS đứng thứ nhất, Flash-Lite TTS đứng thứ hai.
• Ưu tiên mù trong Speech Arena — các vị trí dẫn đầu thuộc về tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Việt, tiếng Ả Rập chuẩn hiện đại, tiếng Tây Ban Nha Mexico và tiếng Hindi.
• So với Gemini 3.1 Flash TTS — Google tuyên bố có những cải thiện về tính nhất quán ở dạng dài và khả năng điều khiển kịch bản hai người nói, vốn chính xác là hai thứ mà các tính năng chỉ đạo giọng đọc được thiết kế để xử lý.
Có một điểm sai lệch đã được ghi nhận đáng để lưu ý, vì nó sẽ khiến bất kỳ ai đối chiếu các nguồn đều bối rối. Bài đăng trên blog mô tả một thư viện hơn 2.000 giọng sẵn sàng cho sản xuất. Tài liệu dành cho nhà phát triển mô tả “hàng trăm” giọng trong Extended Voice Library bên cạnh 30 giọng studio dựng sẵn. Các nguồn tin bên thứ ba lại đưa ra những con số cao hơn một bậc độ lớn nữa. Những con số này không thể dung hòa được nếu chỉ nhìn từ bên ngoài — cách hiểu trung thực là bộ dựng sẵn mà bạn nhận được theo mặc định là 30, Extended Voice Library thì lớn hơn và được mô tả mơ hồ, còn những con số lớn ám chỉ một danh mục bao gồm cả các giọng do người dùng tạo. Nếu số lượng giọng là yếu tố then chốt cho quyết định của bạn, hãy kiểm tra giọng cụ thể mà bạn cần thay vì tin vào bất kỳ con số nào trong ba con số trên.
Nó có nghĩa gì nếu bạn đang xây dựng dựa trên nó
Thay đổi thực tế là chuyển văn bản thành giọng nói đã chuyển từ một mục chi phí chuyên biệt thành thứ bạn có thể đưa vào cùng mô hình chi phí với token ngôn ngữ của mình. Với 25 token mỗi giây, một giờ âm thanh được tạo là 90.000 token âm thanh, mà ở mức giá khuyến mãi Flash-Lite thì chỉ khoảng 54 xu. Điều đó đủ rẻ để câu hỏi thú vị không còn là "liệu chúng ta có đủ khả năng chi trả cho một giọng nói tổng hợp không" mà trở thành "bề mặt này cần tầng nào trong hai tầng".
Thay đổi thực tiễn thứ hai là một mô hình TTS hoàn toàn mới đúng là kiểu thứ bạn muốn dùng thử mà không đặt cược một đường production vào nó. Đó là lý do để đặt một mô hình mới phía sau router thay vì đấu nối trực tiếp: OrcaRouter cung cấp hơn 200 mô hình phía sau một khóa duy nhất với mức giá niêm yết của nhà cung cấp, không tính thêm, và tính năng chuyển đổi dự phòng tự động của nó nghĩa là một endpoint giọng nói mới chập chờn khi tải cao sẽ chuyển xuống một mô hình bạn đã tin cậy thay vì làm rớt cuộc gọi. Chúng tôi không lưu trữ các endpoint Gemini 3.8 TTS — những endpoint đó đến từ API của chính Google — nhưng lớp văn bản bên dưới giọng nói, và đường dự phòng khi một cuộc gọi tổng hợp thất bại, mới là những phần mà router thực sự dành cho.
Còn thiếu gì nữa?
Ba điều đang thiếu vắng trong buổi ra mắt và mỗi điều trong số đó đều là một hạn chế thực sự, chứ không phải chuyện bắt bẻ vụn vặt.
Không có đánh giá độc lập nào đã được công bố. Các con số Hume của Google là việc nhà cung cấp trích dẫn chuẩn đối sánh của bên thứ ba — điều này tốt hơn không có gì và kém hơn một cuộc kiểm toán. Cho đến khi Artificial Analysis hoặc một đơn vị tương đương công bố kết quả chạy của chính họ trên cùng các mô hình, mọi tuyên bố về chất lượng trong bài viết này đều nên được đọc như một tuyên bố.
Không có tùy chọn trọng số mở. Cả hai mô hình đều đóng và chỉ có API, khiến chúng thuộc một hạng mục khác với các mô hình giọng nói mở đang lần lượt xuất hiện trong cùng lĩnh vực. Nếu việc triển khai của bạn yêu cầu tự chạy mô hình, bản ra mắt này không dành cho bạn.
Và mức giá khuyến mãi cũng kết thúc. Mức giá tháng 1 năm 2027 cho Flash TTS gấp đôi mức giá tháng 9, và bất kỳ bài toán kinh doanh nào dựa trên các con số thời điểm ra mắt sẽ cần phải làm lại trong quý đầu tiên. Đó không phải là một lời chỉ trích — việc công bố cả hai con số ngay từ đầu là trung thực hơn hầu hết — nhưng đó mới là con số thuộc về bảng tính.
Google vẫn chưa cho biết liệu Gemini 3.1 Flash TTS Preview có bị ngừng hỗ trợ hay không, chỉ nói rằng Flash-Lite TTS được định vị là bản thay thế chủ lực của nó. Bất kỳ ai vẫn đang dùng mô hình xem trước nên lên kế hoạch chuyển đổi thay vì chờ thông báo ngừng hoạt động.

