Mô hình chuyển văn bản thành giọng nói nhanh, hiệu quả về chi phí của Google để tạo âm thanh thời gian thực, được truy cập qua OrcaRouter.
google/gemini-3.1-flash-tts-preview là mô hình chuyển văn bản thành giọng nói từ Google, thuộc dòng Gemini Flash. Mô hình này nhận đầu vào là văn bản và tạo ra đầu ra âm thanh giọng nói. Mô hình được…
Khả năng chính là chuyển đổi văn bản viết thành giọng nói tự nhiên. Mô hình được thiết kế để tối ưu tốc độ, tận dụng kiến trúc Flash nhằm giảm độ trễ. Mô hình hỗ trợ nhiều ngôn ngữ và giọng nói? Hỗ trợ ngôn ngữ và giọng nói của bản xem trước cụ thể này không được nêu chi tiết trong các thông tin được cung cấp; bạn nên tham khảo tài liệu của Google để biết các tùy chọn giọng nói hiện tại. Mô hình có thể xử lý nhiều đầu vào văn bản khác nhau bao gồm dấu câu, số và viết tắt, tạo ra đầu ra giọng nói phản ánh nhịp điệu và giọng điệu mong muốn.
Các trường hợp sử dụng tốt nhất bao gồm bất kỳ ứng dụng nào yêu cầu tạo giọng nói với độ trễ thấp: trợ lý giọng nói thời gian thực, lồng tiếng dịch trực tiếp, chatbot tương tác có đầu ra giọng nói và hệ thống điện thoại tự động. Công nghệ này cũng vượt trội trong xử lý hàng loạt khi bạn cần tạo nhiều đoạn âm thanh ngắn một cách nhanh chóng. Các nhà sản xuất nội dung có thể sử dụng nó để lồng tiếng động trong trò chơi điện tử hoặc sách nói. Vì chi phí đầu ra cao so với đầu vào, nó sẽ kinh tế nhất khi âm thanh đầu ra được cô đọng.
Nếu trường hợp sử dụng của bạn liên quan đến việc tạo âm thanh cực dài (ví dụ: hàng giờ phát biểu) hoặc không yêu cầu độ trễ thấp, hãy cân nhắc mô hình TTS theo lô với chi phí đầu ra trên mỗi token thấp hơn. Đối với các ứng dụng mà khối lượng đầu vào chiếm ưu thế (ví dụ: nhiều lời nhắc ngắn), chi phí đầu vào rẻ khiến mô hình Flash này trở nên hấp dẫn. Đối với các tình huống yêu cầu chất lượng đầu ra rất cao—chẳng hạn như các nhân vật giàu cảm xúc—bạn có thể đánh giá các mô hình TTS cao cấp từ Google hoặc các nhà cung cấp khác. Luôn theo dõi tổng khối lượng token và yêu cầu về độ trễ.
Là một mô hình Gemini Flash, biến thể TTS này được tối ưu hóa cho độ trễ thấp. Các điểm chuẩn độ trễ cụ thể (ví dụ: thời gian đến gói âm thanh đầu tiên) không được cung cấp trong các dữ kiện có sẵn. Trong thực tế, các mô hình Flash thường phản hồi trong vòng vài trăm mili giây đối với đầu vào ngắn. Độ trễ có thể thay đổi dựa trên độ dài đầu ra, điều kiện mạng và tải yêu cầu đồng thời. Việc định tuyến của OrcaRouter có thể thêm chi phí tối thiểu. Đối với các ứng dụng thời gian thực, hãy kiểm tra với thời lượng âm thanh dự kiến của bạn dưới tải.
Điểm mạnh bao gồm chi phí đầu vào thấp ($1.00/1M tokens), tốc độ sinh nhanh và cơ sở hạ tầng mạnh mẽ của Google. Trạng thái xem trước có nghĩa là chất lượng mô hình và tính khả dụng có thể thay đổi. Một hạn chế là chi phí đầu ra cao ($20.00/1M tokens) so với các mô hình văn bản. Ngoài ra, chất lượng âm thanh đầu ra—như tính tự nhiên, sự đa dạng giọng và ngữ điệu—không được đánh giá chuẩn ở đây. Bạn nên đánh giá chất lượng giọng nói của mô hình cho lĩnh vực cụ thể của bạn (ví dụ: thuật ngữ kỹ thuật, phạm vi cảm xúc) trước khi triển khai sản xuất.
Không có điểm chuẩn nào cho google/gemini-3.1-flash-tts-preview được cung cấp trong các dữ kiện sẵn có. Các mô hình TTS thường được đánh giá dựa trên các chỉ số như Mean Opinion Score (MOS) về độ tự nhiên, tỷ lệ lỗi từ (WER) về độ rõ ràng, và phân vị độ trễ. Nếu không có số liệu cụ thể, bạn nên chạy đánh giá của riêng mình bằng cách sử dụng các prompt đại diện để đánh giá chất lượng và tốc độ so với yêu cầu của bạn. OrcaRouter không thêm hoặc sửa đổi hiệu suất của mô hình.
Các dữ liệu có sẵn không xác định ngôn ngữ được hỗ trợ hoặc khả năng giọng địa phương cho bản xem trước TTS này. Các mô hình TTS rộng hơn của Google thường hỗ trợ nhiều ngôn ngữ, nhưng phạm vi của biến thể cụ thể này chưa được biết đến. Bạn nên thử nghiệm với văn bản đa ngôn ngữ để xác nhận chất lượng đầu ra. Đối với tiếng Anh, hiệu suất có thể mạnh mẽ nhờ đầu tư của Google. Đối với các ngôn ngữ ít phổ biến hơn, hãy cân nhắc liên hệ trực tiếp với Google hoặc thử nghiệm với văn bản mẫu qua API của OrcaRouter.
Giá cả tuân theo tỷ giá chính thức của Google, không có phụ phí từ OrcaRouter. Token đầu vào (văn bản) có giá $1.00 cho mỗi 1 triệu token. Token đầu ra (âm thanh) có giá $20.00 cho mỗi 1 triệu token. Token đầu ra được tạo ra theo từng đơn vị âm thanh; tỷ lệ chính xác giữa token và thời gian không được xác định. Bạn sẽ bị tính phí cho cả token đầu vào và đầu ra được sử dụng trong mỗi yêu cầu. Không có phí nền tảng bổ sung hoặc yêu cầu chi tiêu tối thiểu. Việc thanh toán được thực hiện thông qua các phương thức thanh toán hiện có của OrcaRouter.
Token đầu vào rẻ hơn 20 lần so với token đầu ra. Điều này khuyến khích việc gửi các prompt văn bản dài hơn (trong giới hạn token) để tạo ra đầu ra âm thanh dài hơn tương ứng, vì chi phí đầu vào vẫn thấp. Ví dụ, tạo một đoạn âm thanh dài 1 phút có thể tiêu tốn nhiều token đầu ra với giá $20/1M, trong khi prompt văn bản chỉ tốn vài xu. Tối ưu hóa bằng cách giữ đầu ra ngắn gọn bất cứ khi nào có thể. Nếu trường hợp sử dụng của bạn tạo ra âm thanh rất dài, chi phí đầu ra cho mỗi yêu cầu có thể tăng lên nhanh chóng.
Các dữ kiện có sẵn không đề cập đến bất kỳ chương trình lưu trữ đệm hoặc giảm giá nào cho mô hình này trên OrcaRouter. Giá của OrcaRouter là truyền trực tiếp theo mức giá của nhà cung cấp. Bạn có thể muốn kiểm tra với OrcaRouter về các tùy chọn giảm giá số lượng lớn hoặc dung lượng dự trữ có thể áp dụng cho các mô hình. Vì chi phí token đầu ra cao, việc lưu trữ đệm các đoạn âm thanh đã tạo để sử dụng lặp lại (ví dụ: các phản hồi phổ biến) có thể giảm đáng kể tổng chi tiêu.
So sánh không được cung cấp trực tiếp. Tuy nhiên, Flash TTS của Google được định vị là tiết kiệm chi phí cho việc sử dụng thời gian thực với chi phí đầu vào thấp. Các mô hình TTS khác (ví dụ: OpenAI TTS, ElevenLabs) có thể có cấu trúc giá khác — thường tính phí theo ký tự hoặc theo giây âm thanh. Mô hình này với mức giá đầu ra theo token có thể đắt hơn cho âm thanh rất dài nhưng rẻ hơn cho các tạo sinh ngắn, bùng nổ. Hãy đánh giá khối lượng token dự kiến của bạn so với các dịch vụ khác trong danh mục của OrcaRouter.
Sử dụng bất kỳ ứng dụng khách nào tương thích với OpenAI. Đặt URL cơ sở là https://api.orcarouter.ai/v1, khóa API từ tài khoản OrcaRouter của bạn và ID mô hình là "google/gemini-3.1-flash-tts-preview". Gửi yêu cầu hoàn thành cuộc trò chuyện với tin nhắn người dùng chứa văn bản cần được nói. Phản hồi sẽ bao gồm nội dung âm thanh (có thể là một đoạn mã hóa base64 hoặc URL). Định dạng đầu ra chính xác phụ thuộc vào triển khai mô hình của Google. Tham khảo tài liệu của OrcaRouter về hỗ trợ phát trực tuyến và phân tích phản hồi.
Các tham số hoàn thiện chat tiêu chuẩn được áp dụng: model, messages (với role và content), và tùy chọn temperature hoặc top_p cho sự biến thiên đầu ra (mặc dù ít liên quan đến TTS). Đối với lựa chọn giọng nói, model của Google có thể hỗ trợ một tham số bổ sung (ví dụ: voice name). Các dữ kiện có sẵn không liệt kê các tham số TTS cụ thể. Bạn có thể cần truyền các trường bổ sung như "voice" hoặc "language" trong phần thân yêu cầu. Tham khảo tài liệu API của Google cho model preview để biết các tùy chọn chính xác.
Thông thường, các mô hình TTS hỗ trợ phát trực tuyến âm thanh, nơi các khối âm thanh được gửi đi khi chúng được tạo ra. Các dữ kiện được cung cấp không xác nhận hỗ trợ phát trực tuyến cho mô hình xem trước này. Nếu tính năng phát trực tuyến được bật, bạn có thể sử dụng tham số stream đặt thành true trong yêu cầu API của mình và xử lý các khối khi chúng đến. OrcaRouter hỗ trợ phát trực tuyến cho các mô hình tương thích. Hãy thử nghiệm với một yêu cầu đơn giản để xem âm thanh được trả về dần dần hay dưới dạng một khối hoàn chỉnh.
Nếu bạn đã sử dụng một API tương thích với OpenAI, hãy thay đổi URL cơ sở thành https://api.orcarouter.ai/v1 và cập nhật ID mô hình. Cập nhật các tham số yêu cầu của bạn để phù hợp với thông số kỹ thuật TTS của Google (ví dụ: tên giọng nói). Bạn có thể cần điều chỉnh xử lý đầu ra âm thanh nếu định dạng khác nhau (ví dụ: MP3 so với WAV). Kiểm tra với các mẫu prompt để xác minh chất lượng. Vì giá cả không có markup, chi phí của bạn có thể thay đổi dựa trên mức sử dụng token. Không yêu cầu công cụ di chuyển đặc biệt.
OpenAI cung cấp các mô hình TTS (tts-1, tts-1-hd) với giá theo ký tự (~0,015 USD cho 1k ký tự). Ngược lại, mô hình của Google sử dụng giá dựa trên token, có thể tiết kiệm hơn cho đầu vào ngắn nhưng đắt hơn cho đầu ra dài. TTS của OpenAI hỗ trợ nhiều giọng nói và ngôn ngữ; thông tin chi tiết về phiên bản xem trước của Google chưa được biết đầy đủ. Độ trễ: cả Flash và mô hình của OpenAI đều được thiết kế để có độ trễ thấp. Chất lượng mang tính chủ quan; bạn nên thử nghiệm với nội dung của mình để so sánh độ tự nhiên và ngữ điệu.
Google cũng cung cấp các mô hình TTS cao cấp (ví dụ: WaveNet, Studio) thông qua API Cloud Text-to-Speech của mình. Các mô hình đó thường tính phí theo từng ký tự văn bản được gửi đi, có thể rẻ hơn cho những đoạn âm thanh rất dài nhưng có chi phí mỗi yêu cầu cao hơn. Flash TTS nhanh hơn và có cấu trúc định giá đầu vào đơn giản hơn (theo token) nhưng có thể có ít tùy chọn giọng nói hơn. Đối với giọng nói trung thực cao, giàu cảm xúc, mô hình cao cấp có thể tốt hơn. Đối với tốc độ và chi phí đầu vào thấp, biến thể Flash có lợi thế.
Nếu bạn cần phản hồi thời gian thực và có các văn bản đầu vào ngắn (nhiều yêu cầu nhỏ), mô hình Flash này với chi phí đầu vào thấp và tốc độ sinh nhanh là lý tưởng. Đối với việc tạo âm thanh rất dài (ví dụ: sách nói đầy đủ), một mô hình tính phí theo ký tự đầu vào (như TTS tiêu chuẩn của Google) có thể rẻ hơn, vì tránh được chi phí token đầu ra. Cũng cần cân nhắc đến sự đa dạng giọng nói và hỗ trợ ngôn ngữ: nếu bạn yêu cầu nhiều giọng nói riêng biệt, hãy kiểm tra xem bản xem trước này có hỗ trợ không. Hãy thử nghiệm cả hai tùy chọn với khối lượng công việc của bạn trước khi cam kết.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1voice| Đầu vào / 1M tokens | $1.00 |
| Đầu ra / 1M tokens | $20.00 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/google/gemini-3.1-flash-tts-previewMở @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview