Googleの高速でコスト効率の良い、リアルタイム音声生成のためのテキスト読み上げモデル。OrcaRouter経由でアクセスされます。
google/gemini-3.1-flash-tts-previewは、Googleが提供するテキスト読み上げモデルであり、Gemini Flashファミリーの一部です。テキスト入力を受け付け、音声出力を生成します。このモデルは速度とコストを最適化しており、リアルタイムアプリケーションに適しています。現在プレビュー段階であり、開発が進行中で、利用可能性は変わる可能性があります。OrcaRoute…
主な機能は、書かれたテキストを自然な響きの音声に変換することです。このモデルは速度を重視して設計されており、Flashアーキテクチャを活用してレイテンシを低減します。複数の言語と音声をサポートしていますか?この特定のプレビューの言語と音声のサポートは提供された情報では詳しく説明されていません。現在の音声オプションについてはGoogleのドキュメントを参照してください。このモデルは、句読点、数字、略語を含むさまざまなテキスト入力を処理し、意図されたリズムとトーンを反映した音声出力を生成します。
最適なユースケースは、低遅延音声生成が重要なアプリケーションです。リアルタイム音声アシスタント、ライブ翻訳の吹き替え、音声出力を備えたインタラクティブチャットボット、自動電話システムなどです。また、多数の短い音声クリップを迅速に生成する必要があるバッチ処理にも優れています。コンテンツ制作者は、ビデオゲームやオーディオブックのダイナミックなナレーションに使用できます。出力コストが入力に比べて高いため、出力音声が簡潔である場合に最も経済的です。
ユースケースが非常に長い音声生成(例:数時間のスピーチ)を含む場合や、低レイテンシを必要としない場合は、トークンあたりの出力コストが低いバッチ処理対応のTTSモデルを検討してください。入力ボリュームが支配的なアプリケーション(例:多数の短いプロンプト)では、入力コストが安いため、このFlashモデルが魅力的です。非常に高い出力品質が求められるシナリオ(例:感情表現豊かなキャラクター)では、Googleや他のプロバイダーが提供するプレミアムTTSモデルを評価することをお勧めします。常にトークン総量とレイテンシ要件を監視してください。
Gemini Flashモデルとして、このTTSバリアントは低レイテンシに最適化されています。具体的な遅延ベンチマーク(例:最初のオーディオパケットまでの時間)は、利用可能な情報では提供されていません。実際には、Flashモデルは短い入力に対しては数百ミリ秒以内に応答することがよくあります。遅延は、出力の長さ、ネットワーク状況、同時リクエスト負荷によって変わる可能性があります。OrcaRouterのルーティングは最小限のオーバーヘッドを追加する可能性があります。リアルタイムアプリケーションの場合は、負荷下で想定されるオーディオの長さでテストしてください。
強みとしては、低い入力コスト($1.00/1Mトークン)、高速生成、そしてGoogleの堅牢なインフラが挙げられます。プレビュー段階であるため、モデルの品質や可用性は変更される可能性があります。制限点として、テキストモデルと比較して出力コスト($20.00/1Mトークン)が高いことがあります。さらに、出力音声の品質(自然さ、アクセントの多様性、韻律など)はここではベンチマークされていません。実運用に移行する前に、特定のドメイン(例:専門用語、感情表現の幅)におけるモデルの音声品質を評価すべきです。
利用可能な事実には、google/gemini-3.1-flash-tts-previewのベンチマークスコアは提供されていません。TTSモデルは通常、自然性に関する平均オピニオンスコア(MOS)、明瞭度に関する単語誤り率(WER)、レイテンシーのパーセンタイルなどの指標で評価されます。具体的な数値がない場合は、代表的なプロンプトを使用して独自の評価を実施し、要件に照らして品質と速度を評価してください。OrcaRouterはモデルのパフォーマンスを追加したり変更したりしません。
利用可能な事実では、このTTSプレビューが対応する言語やアクセント機能は明記されていません。Googleの一般的なTTSモデルは通常、複数の言語をサポートしていますが、この特定のバリアントの対応範囲は不明です。出力品質を確認するには、多言語テキストでテストすることを推奨します。英語については、Googleの投資によりパフォーマンスは堅牢である可能性が高いです。あまり一般的でない言語については、Googleに直接問い合わせるか、OrcaRouterのAPIを介してサンプルテキストでテストすることを検討してください。
料金はGoogleの公式レートに従い、OrcaRouterによるマークアップはありません。入力トークン(テキスト)は100万トークンあたり$1.00です。出力トークン(音声)は100万トークンあたり$20.00です。出力トークンは音声の単位ごとに生成されます。正確なトークンと時間の比率は指定されていません。各リクエストで使用された入力トークンと出力トークンの両方に対して課金されます。追加のプラットフォーム手数料や最低利用額の要件はありません。請求はOrcaRouterの既存の支払い方法を介して行われます。
入力トークンは出力トークンよりも20倍安価です。これにより、トークン制限内で長いテキストプロンプトを送信し、それに比例して長い音声出力を生成するインセンティブが生まれます。入力コストは低く抑えられるためです。例えば、1分間の音声クリップを生成する場合、$20/1Mで多くの出力トークンを消費する可能性がありますが、テキストプロンプトのコストはわずか数セントです。可能な限り出力を簡潔に保つことで最適化してください。使用ケースで非常に長い音声を生成する場合、リクエストごとの出力コストが急速に増加する可能性があります。
入手可能な事実には、このモデルに対するOrcaRouterのキャッシングや割引プログラムについての言及はありません。OrcaRouterの料金はプロバイダー料金のパススルーです。モデル間で適用される可能性のある一括割引オプションや予約容量について、OrcaRouterに確認することをお勧めします。出力トークンコストが高いため、生成された音声セグメントを繰り返し使用(例:一般的な応答)のためにキャッシュすることで、総支出を大幅に削減できます。
直接の比較は提供されていません。ただし、GoogleのFlash TTSは、低い入力コストでリアルタイム使用に費用対効果が高いと位置づけられています。他のTTSモデル(例:OpenAI TTS、ElevenLabs)は、異なる価格体系を持つ場合があり、多くの場合、文字単位または音声の秒単位で課金されます。このモデルのトークン出力価格は、非常に長い音声では高くなる可能性がありますが、短くバースト的な生成では安くなります。OrcaRouterのカタログで、期待されるトークン量を他の提供サービスと比較評価してください。
任意のOpenAI互換クライアントを使用してください。ベースURLを https://api.orcarouter.ai/v1 に、APIキーをOrcaRouterアカウントのものに、モデルIDを "google/gemini-3.1-flash-tts-preview" に設定します。発話させるテキストを含むユーザーメッセージでチャット補完リクエストを送信します。レスポンスにはオーディオコンテンツ(おそらくbase64エンコードされたチャンクまたはURL)が含まれます。正確な出力形式はGoogleのモデル実装に依存します。ストリーミングサポートとレスポンス解析については、OrcaRouterのドキュメントを参照してください。
標準的なチャット完了パラメータが適用されます:モデル、メッセージ(ロールとコンテンツ)、および出力の多様性のためにオプションでtemperatureまたはtop_p(TTSではあまり重要ではありません)。音声選択については、Googleのモデルは追加パラメータ(例:音声名)をサポートする場合があります。利用可能な事実には、具体的なTTSパラメータは記載されていません。リクエスト本文に「voice」や「language」などの追加フィールドを渡す必要があるかもしれません。正確なオプションについては、プレビューモデルのGoogle APIドキュメントを参照してください。
TTSモデルがストリーミング音声をサポートすることは一般的です。音声チャンクが生成され次第送信されます。提供された情報では、このプレビューモデルがストリーミングをサポートしているか確認できません。ストリーミングが有効な場合、APIリクエストでstreamパラメータをtrueに設定し、チャンクが到着するたびに処理できます。OrcaRouterは互換性のあるモデルでストリーミングをサポートしています。簡単なリクエストでテストし、音声がインクリメンタルに返されるか、完全なblobとして返されるかを確認してください。
既にOpenAI互換のAPIを使用している場合、ベースURLを https://api.orcarouter.ai/v1 に変更し、モデルIDを更新してください。リクエストパラメータをGoogleのTTS仕様(例:音声名)に合わせて更新します。フォーマットが異なる場合(例:MP3 vs WAV)、音声出力の処理を調整する必要があるかもしれません。サンプルプロンプトでテストして品質を確認してください。価格はゼロマークアップのため、トークン使用量に応じてコストが変わる可能性があります。特別な移行ツールは必要ありません。
OpenAIはTTSモデル(tts-1, tts-1-hd)を提供しており、1文字あたりの料金(約1,000文字あたり0.015ドル)です。対照的に、Googleのモデルはトークンベースの料金設定で、短い入力には経済的ですが、長い出力には高くなることがあります。OpenAIのTTSは複数の音声と言語をサポートしています。Googleのプレビューの詳細は完全には明らかになっていません。レイテンシー:FlashとOpenAIのモデルはどちらも低レイテンシーを想定して設計されています。品質は主観的なものです。自然さと韻律を比較するために、実際のコンテンツでテストすることをお勧めします。
Googleは、Cloud Text-to-Speech APIを通じてプレミアムTTSモデル(例えばWaveNet、Studio)も提供しています。これらのモデルは通常、送信テキストの文字数に応じて課金され、非常に長い音声では安価になる一方、リクエストごとのコストは高くなります。Flash TTSはより高速で、シンプルな入力価格設定(トークン単位)を備えていますが、音声オプションが少ない可能性があります。高忠実度で感情豊かな音声が必要な場合は、プレミアムモデルの方が適しているかもしれません。速度と入力あたりの低コストを重視するなら、Flash版が有利です。
リアルタイム応答が必要で、短い入力テキスト(多数の小さなリクエスト)を扱う場合、このFlashモデルの低い入力コストと高速生成が理想的です。非常に長い音声生成(例:完全なオーディオブック)では、Googleの標準TTSのように入力文字ごとに課金するモデルの方が、出力トークンコストが発生しないため安価になる可能性があります。また、音声の多様性と言語サポートも検討してください:多くの異なる音声が必要な場合は、このプレビューがそれをサポートしているか確認してください。本番導入前に、両方のオプションを実際のワークロードでテストしてください。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1voice| 入力 / 1M tokens | $1.00 |
| 出力 / 1M tokens | $20.00 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
GET /api/public/models/google/gemini-3.1-flash-tts-preview開く @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview