Google Gemini 2.5 Pro preview với TTS, truy cập qua OrcaRouter với mức phụ phí bằng không.
google/gemini-2.5-pro-preview-tts là mô hình chuyển văn bản thành giọng nói bản xem trước của Google, được xây dựng trên nền tảng Gemini 2.5 Pro. Nó chuyển đổi đầu vào văn bản thành đầu ra âm thanh…
Khả năng chính của google/gemini-2.5-pro-preview-tts là chuyển đổi văn bản viết thành âm thanh nói. Mô hình được xây dựng trên Google Gemini 2.5 Pro, cho thấy khả năng hiểu ngôn ngữ mạnh mẽ, từ đó mang lại cách diễn đạt tự nhiên, ngữ điệu phù hợp và phát âm rõ ràng. Mô hình chỉ chấp nhận đầu vào văn bản, do đó không đa phương thức ở phía đầu vào. Nó không xử lý đầu vào âm thanh, hình ảnh hoặc video. Đầu ra có khả năng là âm thanh ở định dạng kỹ thuật số tiêu chuẩn. Là một mô hình TTS, nó có thể hỗ trợ nhiều ngôn ngữ, nhưng hỗ trợ ngôn ngữ cụ thể cho bản xem trước này vẫn chưa được tiết lộ. Mô hình được tối ưu hóa để tạo giọng nói, không phải cho các khả năng khác của Gemini 2.5 Pro như suy luận hoặc tạo mã.
Mô hình này xuất sắc trong các ứng dụng yêu cầu chuyển đổi văn bản viết thành giọng nói tự nhiên. Các trường hợp sử dụng tốt nhất bao gồm trợ lý giọng nói nơi trợ lý đọc to các phản hồi, tường thuật sách nói và podcast tự động, các tính năng trợ năng đọc văn bản trên màn hình cho người khiếm thị, và các hệ thống dịch vụ khách hàng cung cấp phản hồi bằng giọng nói. Nó cũng có thể được sử dụng cho các ứng dụng học ngôn ngữ nơi cách phát âm đúng được mô phỏng, hoặc để tạo nội dung giọng nói từ các nguồn cấp dữ liệu RSS hoặc bài báo. Do tình trạng xem trước của nó, nên kiểm tra kỹ lưỡng cho ngôn ngữ, lĩnh vực hoặc yêu cầu phong cách cụ thể của bạn trước khi cam kết triển khai quy mô lớn.
Mặc dù google/gemini-2.5-pro-preview-tts cung cấp chất lượng TTS cao cấp, nhưng nó có thể là quá mức cần thiết cho các tiếng bíp đơn giản hoặc âm thanh thông báo, hoặc cho các ứng dụng yêu cầu độ trễ thấp nhưng thời gian xử lý của mô hình lại dài hơn so với các chip TTS chuyên dụng. Nếu bạn chỉ cần giọng nói cơ bản, đơn điệu hoặc có khối lượng rất lớn với các ràng buộc ngân sách nghiêm ngặt, một mô hình TTS nhẹ hơn (ví dụ: từ các nhà cung cấp khác trên OrcaRouter) với chi phí mỗi token thấp hơn có thể phù hợp hơn. Ngoài ra, nếu trường hợp sử dụng của bạn yêu cầu phát trực tuyến thời gian thực với độ trễ cực thấp, hãy đánh giá xem mô hình xem trước của Gemini có đáp ứng yêu cầu về tốc độ của bạn hay không, vì các mô hình lớn hơn có thể gây ra độ trễ token đầu tiên cao hơn.
Tính đến thời điểm phát hành bản xem trước của mô hình, Google chưa công bố điểm chuẩn cụ thể cho biến thể gemini-2.5-pro-preview-tts. Mô hình cơ sở Gemini 2.5 Pro bên dưới đã thể hiện hiệu suất mạnh mẽ trong các tác vụ hiểu ngôn ngữ và suy luận, nhưng các chỉ số chất lượng giọng nói của biến thể TTS (ví dụ: Mean Opinion Score, Word Error Rate) chưa được công khai chia sẻ. Khi không có điểm chuẩn chính thức, OrcaRouter khuyến nghị đánh giá mô hình trên bộ kiểm thử đầu vào văn bản của riêng bạn, đo lường chất lượng âm thanh chủ quan, độ trễ và độ tin cậy khi chịu tải. Đối với các quyết định sản xuất, hãy tiến hành so sánh A/B của riêng bạn với các dịch vụ TTS khác.
Các số liệu cụ thể về độ trễ của google/gemini-2.5-pro-preview-tts chưa được công bố công khai. Là mô hình TTS dựa trên kiến trúc mô hình ngôn ngữ lớn, nó có thể có độ trễ cao hơn so với các mô hình TTS nơ-ron chuyên biệt được tối ưu hóa cho truyền phát thời gian thực. Các yếu tố ảnh hưởng đến tốc độ bao gồm độ dài của văn bản đầu vào, thời gian xử lý nội bộ của mô hình và thời gian khứ hồi mạng đến các điểm cuối của OrcaRouter. Đối với các ứng dụng yêu cầu độ trễ thấp (ví dụ: AI đàm thoại), hãy kiểm tra mô hình này với độ dài đầu vào điển hình để đánh giá tính phù hợp. Cân nhắc sử dụng tính năng truyền phát hoặc tạo văn bản theo khối nếu API hỗ trợ.
Strengths: Được xây dựng trên kiến trúc Gemini 2.5 Pro tiên tiến của Google, mô hình này có khả năng tạo ra giọng nói tự nhiên, biểu cảm cao với ngữ điệu và phát âm tốt. Truy cập qua API tương thích OpenAI của OrcaRouter giúp đơn giản hóa việc tích hợp. Không có markup về giá nhà cung cấp giúp chi phí có thể dự đoán trước. Limitations: Phương thức đầu vào chỉ là văn bản; không thể xử lý âm thanh hoặc các phương thức khác. Là phiên bản xem trước, mô hình có thể có các trường hợp ngoại lệ chưa được khám phá hoặc chất lượng không đồng nhất. Kích thước cửa sổ ngữ cảnh chưa được biết, hạn chế độ dài văn bản có thể chuyển đổi trong một yêu cầu duy nhất. Chi tiết định dạng đầu ra không được cung cấp. Mô hình không được thiết kế cho các tác vụ như nhận dạng giọng nói hoặc nhân bản giọng nói.
Giá cho google/gemini-2.5-pro-preview-tts dựa trên mức sử dụng token, tính phí $1.00 cho mỗi 1 triệu token đầu vào và $20.00 cho mỗi 1 triệu token đầu ra. Token đầu vào bao gồm văn bản gợi ý và bất kỳ hướng dẫn nào. Token đầu ra đại diện cho âm thanh được tạo ra. OrcaRouter lập hóa đơn theo đúng tỷ lệ của nhà cung cấp, không tăng phí, nghĩa là bạn chỉ trả số tiền mà Google tính, cộng với bất kỳ loại thuế áp dụng nào. Không có cam kết tối thiểu hoặc phí hàng tháng. Mức sử dụng được đo lường theo từng yêu cầu và được tổng hợp trên hóa đơn OrcaRouter của bạn. Vì số lượng token đầu ra TTS có thể cao (âm thanh đậm đặc token hơn văn bản), chi phí đầu ra là chi phí chính.
Giá token đầu ra ($20 per 1M) cao hơn đáng kể so với token đầu vào ($1 per 1M). Điều này là điển hình cho các mô hình sinh vì token đầu ra yêu cầu nhiều tính toán hơn. Đối với chuyển văn bản thành giọng nói, đầu ra âm thanh được biểu diễn dưới dạng một chuỗi các token, và việc chuyển đổi văn bản thành giọng nói liên quan đến việc tạo ra một chuỗi dài các token âm thanh. Tổng chi phí cho một tác vụ cụ thể phụ thuộc vào độ dài của âm thanh đầu ra so với văn bản đầu vào. Nếu bạn cần tạo ra các đoạn giọng nói dài (ví dụ: một cuốn sách nói đầy đủ), chi phí có thể tích lũy. Đối với các lời nhắc ngắn (ví dụ: một câu đơn), chi phí là tối thiểu. Theo dõi việc sử dụng token của bạn để dự toán chi phí.
Không, OrcaRouter không thêm bất kỳ markup nào vào giá của nhà cung cấp cho google/gemini-2.5-pro-preview-tts. Các mức giá được niêm yết là $1.00 cho 1M token đầu vào và $20.00 cho 1M token đầu ra chính xác là những gì Google tính. OrcaRouter chuyển tiếp các mức giá này trực tiếp đến bạn. Điều này nhất quán với mô hình định giá của OrcaRouter cho nhiều mô hình, nơi nền tảng hoạt động như một proxy minh bạch. Bạn chỉ trả tiền cho các token bạn sử dụng. Mọi tính năng tùy chọn như bộ nhớ đệm hoặc hỗ trợ cao cấp có thể phát sinh phí riêng, nhưng chi phí cơ bản cho mỗi token không có markup.
Để sử dụng google/gemini-2.5-pro-preview-tts, hãy gửi yêu cầu đến API tương thích OpenAI của OrcaRouter tại base URL https://api.orcarouter.ai/v1. Sử dụng model ID 'google/gemini-2.5-pro-preview-tts' trong các lệnh gọi API của bạn. Định dạng yêu cầu tuân theo cấu trúc chat completions chuẩn của OpenAI với trường 'model', mảng 'messages' chứa prompt văn bản của bạn (có vai trò system và/hoặc user), cùng các tham số tiêu chuẩn như temperature và max_tokens. Phản hồi sẽ chứa các token âm thanh đã được tạo, mà client của bạn có thể giải mã để phát dưới dạng giọng nói. Xác thực được thực hiện thông qua khóa API do OrcaRouter cung cấp.
API hỗ trợ các tham số tương thích với OpenAI tiêu chuẩn bao gồm 'model', 'messages' (mảng các đối tượng với role và content), 'temperature' (để kiểm soát độ biến thiên đầu ra âm thanh), 'max_tokens' (để giới hạn độ dài âm thanh được tạo) và 'top_p'. Là một mô hình TTS, có thể có thêm các tham số cho phong cách giọng nói hoặc tốc độ, nhưng các tham số này chưa được ghi lại trong các dữ kiện có sẵn. Tham khảo tài liệu API của OrcaRouter để biết các trường được hỗ trợ mới nhất. Tham số 'response_format' có thể cho phép chỉ định định dạng mã hóa âm thanh (ví dụ: wav hoặc mp3). Nếu không được hỗ trợ mặc định, bạn có thể cần giải mã luồng token được trả về.
Nếu bạn hiện đang sử dụng một dịch vụ TTS khác (ví dụ: Google Cloud Text-to-Speech, Amazon Polly), việc chuyển sang google/gemini-2.5-pro-preview-tts qua OrcaRouter bao gồm việc cập nhật endpoint API và định dạng yêu cầu của bạn. OrcaRouter sử dụng các endpoint tương thích với OpenAI, vì vậy bạn sẽ chuyển từ SDK dành riêng cho nhà cung cấp sang SDK tương thích với OpenAI. Thay thế base URL hiện tại của bạn bằng https://api.orcarouter.ai/v1, sử dụng ID mô hình 'google/gemini-2.5-pro-preview-tts', và điều chỉnh nội dung yêu cầu của bạn để khớp với schema chat completions. Bạn có thể cần sửa đổi cách xử lý phản hồi: thay vì nhận trực tiếp các tệp âm thanh, bạn sẽ nhận được đầu ra được token hóa mà bạn cần giải mã. Kiểm tra với các đầu vào mẫu.
Xác thực được thực hiện bằng cách bao gồm một khóa API trong tiêu đề Authorization (định dạng: Bearer YOUR_API_KEY). Bạn lấy khóa API từ tài khoản OrcaRouter của mình. Giới hạn tốc độ được OrcaRouter đặt dựa trên gói cước của bạn; chúng không giống với giới hạn của Google. Đối với việc sử dụng khối lượng lớn, hãy liên hệ với OrcaRouter để điều chỉnh giới hạn. Mô hình xem trước có thể có các hạn chế bổ sung từ Google – nếu bạn gặp lỗi như 'model not available', hãy kiểm tra xem gói cước OrcaRouter của bạn có bao gồm mô hình này không. Không có giới hạn tốc độ cụ thể nào được tiết lộ cho mô hình này, nhưng các phương pháp thực hành tốt nhất thông thường (thử lại với backoff theo cấp số nhân) được khuyến nghị.
google/gemini-2.5-pro-preview-tts là một biến thể chuyên biệt của dòng Gemini 2.5 Pro được tối ưu cho chức năng chuyển văn bản thành giọng nói. Các mô hình Gemini 2.5 Pro khác có mục đích tổng quát và xử lý đầu vào văn bản, hình ảnh, âm thanh và video; chúng không tạo ra đầu ra giọng nói nguyên bản. Biến thể TTS này loại bỏ đầu vào đa phương thức và tập trung vào việc tạo âm thanh từ văn bản. Nó có thể sử dụng cùng cơ chế hiểu ngôn ngữ nền tảng để điều chỉnh ngữ điệu và nhịp điệu, nhưng không phù hợp cho việc suy luận, lập trình hoặc phân tích đa phương thức. Nếu bạn cần khả năng TTS mà vẫn muốn giữ đầu vào đa phương thức, bạn có thể kết hợp một mô hình Gemini tiêu chuẩn với một pipeline TTS riêng. Phiên bản xem trước TTS cung cấp một pipeline tinh gọn hơn.
OrcaRouter cung cấp quyền truy cập vào các mô hình TTS từ nhiều nhà cung cấp khác nhau. Mô hình từ Google này dựa trên kiến trúc mô hình ngôn ngữ lớn, có thể tạo ra giọng nói tự nhiên hơn và nhận biết ngữ cảnh tốt hơn so với các hệ thống TTS tổng hợp hoặc tham số cũ hơn. Tuy nhiên, nó có thể chậm hơn và đắt hơn trên mỗi token so với các mô hình TTS thần kinh chuyên dụng được thiết kế cho độ trễ thấp và thông lượng cao. Nhiều dịch vụ TTS phổ biến tính phí theo ký tự hoặc theo giây âm thanh, chứ không phải theo token, khiến việc so sánh chi phí trực tiếp trở nên phức tạp. Đối với các triển khai sản xuất yêu cầu chi phí cực thấp, các mô hình TTS chuyên dụng có thể được ưu tiên hơn. Mô hình của Google phù hợp nhất cho các trường hợp sử dụng mà chất lượng đầu ra cao nhất biện minh cho chi phí token đầu ra cao hơn.
Chọn mô hình này nếu bạn cần chất lượng giọng nói hiện đại từ kiến trúc Gemini mới nhất của Google và muốn truy cập thông qua API tương thích với OpenAI tiêu chuẩn mà không cần quản lý thông tin xác thực Google Cloud. Mức giá không tăng phí đảm bảo tính minh bạch. Mô hình này lý tưởng cho các ứng dụng yêu cầu tính tự nhiên cao, chẳng hạn như AI đàm thoại hoặc nội dung tường thuật. Trạng thái xem trước cho phép thử nghiệm sớm để đánh giá chất lượng cho lĩnh vực của bạn. Tuy nhiên, nếu bạn cần phát trực tuyến thời gian thực với độ trễ dưới 100ms, mô hình TTS phát trực tuyến chuyên dụng có thể phù hợp hơn. Ngoài ra, nếu ngân sách của bạn nhạy cảm, hãy kiểm tra mức tiêu thụ token đầu ra cho các trường hợp sử dụng điển hình để đảm bảo chi phí chấp nhận được.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1voice| Đầu vào / 1M tokens | $1.00 |
| Đầu ra / 1M tokens | $20.00 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/google/gemini-2.5-pro-preview-ttsMở @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts