
Tạo và triển khai âm thanh tùy chỉnh với Gemini 3.8 Flash TTS: Thiết kế giọng nói, nhân bản giọng nói và hai chiếc đồng hồ quyết định
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 506 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 184 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS đều cho phép bạn tạo ra một giọng nói từ mô tả bằng văn bản thay vì chọn một giọng có sẵn trong danh sách, và cả hai đã chính thức khả dụng rộng rãi trên Gemini API vào ngày 23 tháng 9 năm 2026. Thông điệp nổi bật mà mọi người đang lặp lại là thiết kế giọng nói. Phần đáng để hoạch định là điều gì xảy ra với một giọng nói đã thiết kế sau đó, bởi vì nhà cung cấp cho bạn hai cách để giữ lại một giọng và gắn một vòng đời khác nhau cho mỗi cách. Chọn sai cách, và giọng nói mà sản phẩm của bạn phụ thuộc vào sẽ hết hạn trong một tuần.
Đó chính là khoảng trống trong các bài đưa tin về buổi ra mắt cho đến nay. Các bài đăng thông báo giải thích rằng bạn có thể dùng câu lệnh để tạo ra một giọng nói, và một vài bài trong số đó có nhắc đến việc nhân bản từ mẫu 30 giây. Không bài nào đi sâu vào mô hình lưu trữ, tức là yếu tố quyết định liệu một pipeline giọng nói có thể tái lập từ tệp cấu hình hay phải được cấp phát lại theo lịch. Bài viết này bao quát toàn bộ lộ trình — thiết kế, lưu trữ, gọi và thanh toán — với mức giá và hạn mức đúng như Google công bố.
Có gì đã được phát hành vào ngày 23 tháng 9
Hai mô hình, một schema API. Các định danh là gemini-3.8-flash-tts và gemini-3.8-flash-lite-tts, và tài liệu của Google nói rõ rằng cả hai đều dùng "cùng một schema API và định dạng prompt hoàn toàn giống nhau" — chuyển đổi giữa chúng chỉ là thay đổi một tham số, chứ không phải viết lại.
• Đầu vào — chỉ văn bản. Cả hai mô hình đều nhận văn bản và trả về âm thanh; chúng không phải là mô hình đa phương thức và không tạo văn bản trả lại.
• Đầu ra — WAV, PCM có dấu 16 bit mono 24 kHz trên điểm cuối unary; PCM không có tiêu đề (audio/l16) trên điểm cuối truyền phát; audio/mulaw và audio/alaw được chấp nhận với tốc độ lấy mẫu có thể cấu hình.
• Ngôn ngữ — 130 trên Flash TTS, 101 trên Flash-Lite TTS, được tự động nhận diện từ văn bản thay vì khai báo trong yêu cầu.
• Giọng nói — 30 giọng studio được tuyển chọn có trong tài liệu (bao gồm Kore và Puck), một Thư viện Giọng nói Mở rộng gồm “hàng trăm” giọng khác có thể truy vấn thông qua endpoint voices, cùng với hai cách tạo bên dưới.
• Direction — kiểm soát cách thể hiện theo từng dòng, các cảnh hai người nói được dàn dựng từ một kịch bản duy nhất, và các tín hiệu phi ngôn từ như <laughs>, <sigh> và |mhm| được viết thẳng vào bản chép lời.
Hai cấp độ tồn tại vì các khối lượng công việc đã phân hóa. Flash TTS được định vị cho độ trung thực âm thanh tối đa và khả năng diễn xuất phức tạp; Flash-Lite TTS được chính Google mô tả là "sự thay thế chủ lực" cho gemini-3.1-flash-tts-preview, hướng đến lồng tiếng hàng loạt, tính năng đọc to và các chuỗi tác nhân thoại. Cả hai đều thay thế một mô hình xem trước duy nhất đã có trên API từ tháng 4 năm 2026, vì vậy nếu bạn đang dùng bản xem trước, việc di chuyển là một quyết định về cấp độ chứ không phải là nâng cấp phiên bản.

Thiết kế một giọng nói là một prompt, và điều đó thay đổi bước đánh giá.
Khu vực tạo là thứ thực sự mới trong thế hệ này. Một giọng nói dựa trên prompt được xây dựng từ mô tả ngôn ngữ tự nhiên — vai trò, giọng điệu, đặc điểm giọng nói — và trả về một mã định danh mà bạn tái sử dụng. Trong API, đây là một lệnh gọi tạo giọng nói với store: true và một đầu vào prompt; trong các ví dụ của chính Google, các mô tả trải dài từ một DJ Melbourne đầy năng lượng đến một con rồng Nhật Bản. Sau khi được tạo, giọng nói được tham chiếu trong một yêu cầu đọc bằng mã định danh của nó, và các hướng dẫn phong cách cho từng yêu cầu sau đó có thể tối thiểu hoặc trống, vì đặc điểm đã được tích hợp sẵn vào giọng nói.
Hệ quả thực tế là một thay đổi về quy trình làm việc, chứ không chỉ là một tính năng. Việc tuyển chọn giọng nói từng là một cuộc đàm phán cấp phép hoặc một lần đặt phòng thu, nghĩa là việc chọn giọng diễn ra một lần, từ sớm, và vượt qua vòng đánh giá vì thay đổi nó rất tốn kém. Khi một giọng nói chỉ là một đoạn văn bản, việc tuyển chọn trở thành một design token — thứ mà một product manager có thể yêu cầu tạo lại vào thứ Ba. Các nhóm đưa chuỗi mô tả vào hệ thống quản lý mã nguồn và coi ID giọng nói được tạo ra như một build artifact sẽ có đầu ra nhất quán giữa các môi trường. Các nhóm tạo giọng nói thủ công trong AI Studio thì sẽ không, và lỗi sẽ trông giống như một sự khác biệt không thể giải thích giữa âm thanh staging và production.
Hai chiếc đồng hồ
Đây là phần mà các bài đăng ra mắt bỏ qua. Google cho phép bạn lưu giữ một giọng nói được thiết kế hoặc nhân bản ở một trong hai trạng thái, và chúng hết hạn với tốc độ khác nhau một trời một vực.
• Giọng nói đã lưu — được tạo khi bật tính năng lưu trữ, chúng nằm trong dự án của bạn và được quản lý bởi hạn mức 200 giọng nói cho mỗi dự án với thời gian tồn tại là một năm.
• Khóa không trạng thái — sao chép giọng nói có thể trả về một khóa do máy khách quản lý (dạng voicekey_…) thay vì một mã định danh được lưu trữ, và khóa đó có thời hạn bảy ngày.
Đọc cùng nhau, cặp đôi đó là một chỉ dẫn thiết kế. Một giọng nói được lưu trữ là cam kết kéo dài cả năm và mức trần cứng 200 mỗi dự án, điều này thì hào phóng với một sản phẩm có dàn giọng cố định và vô dụng với bất kỳ thứ gì tạo ra giọng mới cho mỗi khách hàng. Khóa phi trạng thái thì ngược lại: không áp lực hạn ngạch, nhưng là chiếc khóa bạn phải tạo lại hằng tuần, nghĩa là ứng dụng của bạn cần một luồng làm mới và hạ tầng của bạn cần lưu trữ thông tin xác thực luân chuyển. Cả hai đều không sai. Chọn mà không để ý mình đã chọn cái nào chính là cách một tác nhân thoại im lặng vào ngày thứ tám.
Có thêm hai thuộc tính gắn liền với nhân bản và đáng để biết trước khi bạn hứa bất cứ điều gì với một nhóm pháp lý. Việc tạo một giọng nói được nhân bản đòi hỏi một bản ghi âm đồng ý bằng lời từ chủ sở hữu giọng nói, bản ghi này phải khớp với người nói tham chiếu — một kiểm tra bằng lời nói, không phải một ô đánh dấu. Và đầu ra mang tính nguồn gốc: mọi clip đều được gắn thủy vân bằng SynthID, và các giọng nói được nhân bản còn mang thêm thông tin xác thực nội dung C2PA. Con đường thiết kế này cố ý là con đường khó bị lạm dụng hơn, và cả hai rào cản đều mang tính cấu trúc thay vì chỉ là những tuyên bố chính sách.
Một điểm không nhất quán đáng để nêu ra hơn là giải quyết. Bảng mô hình được hỗ trợ của Google liệt kê thiết kế giọng nói và nhân bản giọng nói là có sẵn trên cả hai mô hình 3.8 TTS. Hầu hết các bài đưa tin về đợt ra mắt mô tả nhân bản giọng nói như một phần thuộc câu chuyện Flash TTS nói riêng. Nếu nhân bản giọng nói quan trọng đối với quyết định của bạn giữa các bậc dịch vụ, hãy xác minh điều đó dựa trên tài liệu dành cho bậc bạn định triển khai thay vì tin vào bất kỳ bản tóm tắt nào.
Chi phí cho một giờ âm thanh là bao nhiêu
Google tính phí giọng nói theo token, không phải theo ký tự hay giây, và cách quy đổi đã được công bố: âm thanh được tính ở mức 25 token mỗi giây đầu ra, tức 90.000 token mỗi giờ. Điều đó khiến phép tính trở nên rõ ràng một cách lạ thường, và đó chính là con số cần đưa vào ngân sách thay vì mức giá trên mỗi triệu.
• Flash TTS tiêu chuẩn — $0,50 mỗi triệu token văn bản đầu vào, $9,00 mỗi triệu token âm thanh đầu ra đến hết ngày 31 tháng 12 năm 2026, sau đó là $1,00 và $18,00. Batch và Flex là $0,25 và $4,50; Priority là $0,90 và $16,20.
• Flash-Lite TTS standard — $0.50 và $6.00 đến hết cùng ngày, sau đó $1.00 và $12.00. Batch và Flex $0.25 và $3.00; Priority $0.90 và $10.80.
• Tính theo giây — Flash TTS tính ra khoảng 0,81 USD mỗi giờ âm thanh được tạo trong thời gian khuyến mãi và khoảng 1,62 USD sau đó; Flash-Lite TTS khoảng 0,54 USD và sau đó là 1,08 USD.
• So với mô hình mà nó thay thế — gemini-3.1-flash-tts-preview có mức giá 1,00 USD và 20,00 USD mỗi triệu, vì vậy dòng đầu ra âm thanh đã giảm 55% ở Flash TTS và 70% ở Flash-Lite TTS.
Đừng hoạch định dựa trên con số khuyến mãi. Google công bố cả hai cột trong cùng một bảng, nghĩa là mức giá tháng Một không phải là tin đồn phải chờ khám phá sau này — nó đã nằm trên bảng giá ngay hôm nay, và mọi ước tính trên mỗi nghìn phút được xây dựng ở mức 0,81 đô la đều phải trụ được khi con số đó bị nhân đôi.
Một con số độc lập, và một vài con số thì không.
Thông báo của Google mở đầu bằng các kết quả benchmark, và chúng nên được đọc đúng như bản chất của chúng. Công ty cho biết Flash TTS đã giành vị trí đầu tiên trên Voice Design Benchmark của Hume AI với 71,4 điểm, dẫn đầu về mô hình hóa trọng âm với 60,8, và rằng Flash TTS cùng Flash-Lite TTS đã xếp thứ nhất và thứ hai trên Overall Quality Index của Hume, với những vị trí xếp hạng mạnh về ưu tiên mù (blind-preference) trên Voice Arena đối với tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Việt, tiếng Ả Rập chuẩn hiện đại, tiếng Tây Ban Nha Mexico và tiếng Hindi. Tất cả đều do nhà cung cấp tự báo cáo, không có lần chạy nào được công khai.
Có một chi tiết trong danh sách đó đáng để lưu ý. Alan Cowen, được ghi là một tác giả trong thông báo của Google, là người sáng lập Hume AI — phòng thí nghiệm có Voice Design Benchmark cung cấp con số chủ đạo. Điều đó không khiến con số trở nên sai, và benchmark của Hume là một benchmark thật, nhưng hai bên không độc lập với nhau, và người đọc đang cân nhắc con số 71,4 nên biết điều đó trước khi lặp lại nó như một sự xác thực từ bên thứ ba.
Con số được thu thập độc lập này nằm trên Provider Voice Arena của Artificial Analysis, được ghi lại cho bài viết này vào ngày 24 tháng 9 năm 2026: Gemini 3.8 Flash TTS đứng thứ hai với Elo 1.260 cùng khoảng 17 điểm trên 1.999 mẫu, sau Cartesia Sonic 3.6 ở mức 1.273. Gemini 3.8 Flash-Lite TTS đứng thứ sáu với 1.235. Mô hình bị thay thế, Gemini 3.1 Flash TTS, đứng thứ mười với 1.199 trên 3.430 mẫu. Ưu tiên của người nghe trong đánh giá mù, không phải đánh giá của chính phòng thí nghiệm — và là con số chất lượng duy nhất ở đây mà Google không đặt hàng.

Nơi có thể chạy nó, và nơi thì chưa.
Cả hai mô hình đều đã có sẵn ngay hôm nay trong Gemini API và Google AI Studio, không cần danh sách chờ. Các bề mặt dành cho người tiêu dùng và doanh nghiệp mới chỉ ở giai đoạn được lên kế hoạch chứ chưa được phát hành: Flash TTS sắp có mặt trên Gemini Notebook và Flash-Lite TTS trên Google Vids, quyền truy cập Gemini Enterprise được mô tả là "sắp ra mắt", còn tính năng phối lại giọng nói — điều chỉnh âm sắc, cao độ, tốc độ và giọng điệu trên một giọng nói hiện có — được liệt kê như một tính năng trong tương lai chứ chưa phải hiện tại. Nếu kế hoạch của bạn phụ thuộc vào việc phối lại giọng nói, thì tính năng đó vẫn chưa tồn tại.
Về phía chúng tôi, nói thật trước đã: các endpoint TTS Gemini 3.8 không nằm trên bảng định tuyến của OrcaRouter. Thế hệ mà chúng thay thế thì có — google/gemini-3.1-flash-tts-preview nằm trong danh mục ở đúng mức $1.00 và $20.00 mỗi triệu token mà Google công bố, bởi vì giá niêm yết của nhà cung cấp được chuyển nguyên vẹn, không cộng thêm lợi nhuận, và nó phản hồi trên cùng /v1/audio/speech endpoint mà SDK tương thích OpenAI của bạn vốn đã nhắm tới. Điều đó quan trọng hơn vẻ ngoài của nó đối với một khối lượng công việc thoại, bởi vì thứ bạn thực sự mua là một endpoint ổn định mà ứng dụng của bạn có thể gọi trong khi các mô hình phía sau nó thay đổi. Mã của bạn giữ một chuỗi tên mô hình; danh mục giữ việc định tuyến. Khi cửa sổ khuyến mãi của Google khép lại vào ngày 31 tháng 12 và Flash TTS tăng gấp đôi, giá của một mô hình đã được định tuyến sẽ thay đổi ngay trong ngày đó thay vì đợi đến lần gia hạn hợp đồng tiếp theo — và một mô hình gặp sự cố sẽ chuyển sang dự phòng thay vì kéo theo cả hàng đợi thuyết minh của bạn.

Nếu bạn đang đánh giá thế hệ này trước khi cam kết, thử nghiệm rẻ tiền là một thử nghiệm hai tầng. Hãy chạy cùng một kịch bản qua Flash TTS và Flash-Lite TTS, vì lược đồ giống hệt nhau và khác biệt chỉ là một tham số — sau đó hãy quyết định bằng chính âm thanh của bạn thay vì bằng biểu đồ đánh giá chuẩn, và kiểm tra trên Artificial Analysis xem khoảng cách chất lượng có vượt qua các thanh sai số của nó không trước khi bạn trả khoản phí cao cấp. Với một dự án thuyết minh quy mô lớn, khoản phí cao cấp đó là tiền thật; còn với một bot hỗ trợ đọc to một số điện thoại, nó không hẳn mang lại cho bạn bất cứ thứ gì mà người nghe có thể nghe thấy.
