OpenAIの高精細テキスト読み上げモデル。OrcaRouterのAPI経由でアクセス、1Mトークンあたり30ドル(マークアップゼロ)。
openai/tts-1-hd は、テキストを高精細な自然な音声に変換する OpenAI のテキスト読み上げモデルです。標準の TTS-1 モデルの強化版であり、オーディオ品質の向上、より自然なプロソディ、アーティファクトの低減を実現しています。このモデルは、プロフェッショナルなナレーションやインタラクティブ音声システムなど、忠実度と表現力が重要視されるユースケース向けに設計されています。入力とし…
OpenAIのTTS-1-HDは、alloy、echo、fable、onyx、nova、shimmerを含む複数の内蔵ボイスをサポートしています。各ボイスは、深く響くものから明るくエネルギッシュなものまで、異なるトーンを持っています。このモデルはまた、英語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語など、複数の言語を自然なアクセントとリズムで処理します。APIリクエストでボイスと言語を指定できます。高精細モデルは、標準バージョンと比較して、アクセントの正確性と感情表現の幅を向上させます。サポートされている言語の完全なリストについては、OpenAIの公式ドキュメントを参照してください。
openai/tts-1-hd は標準の TTS-1 よりも低レイテンシーに最適化されており、音声アシスタントやライブキャプションなどのリアルタイムアプリケーションに適しています。ただし、正確なレイテンシーはテキストの長さ、ネットワーク速度、サーバー負荷などの要因に依存します。このモデルは API を介したストリーミング応答をサポートしており、オーディオ全体が生成される前に再生を開始できます。これにより、知覚される遅延が軽減されます。ほぼ瞬時の応答が必要な場合は、速度を品質よりも優先する標準の TTS-1 モデルの使用を検討してください。OrcaRouter の安定したインフラストラクチャにより、追加のレイテンシーが最小限に抑えられます。
アプリケーションに高品質なオーディオが必要ない場合は、OpenAIの標準TTS-1モデルや他の予算に優しいTTSプロバイダーを検討してください。例えば、内部テスト用の音声生成、低品質の音声アラート、または文字数制限のあるシナリオでは、より安価なモデルを使用することでコストを削減できます。また、多くのバリエーションを試している場合や、極めて低レイテンシーが必要な場合も、TTS-1の方が適しているかもしれません。openai/tts-1-hdは単純な通知にはオーバースペックです。品質の基準とコスト許容度を評価してください。HDモデルはOrcaRouter上では標準バージョンと同じトークン単価ですが、出力されるオーディオが長くなるとトークン数が増える可能性があります。
OpenAIのTTS-1-HDは、明瞭性の向上、より自然な韻律、クリックやバズアーティファクトの低減により、より高忠実度の音声を提供します。感情的なトーンをより適切に捉え、句読点や間の処理も正確です。正確なベンチマークスコアは提供されていませんが、ユーザーや開発者の報告によれば、主観的な品質が顕著に向上しています。このモデルは、一貫した声質が重要なオーディオブックのような長尺コンテンツに特に効果的です。単純な短いフレーズでは、その差は微妙かもしれません。トレードオフとして計算コストがわずかに高くなりますが、トークンあたりの価格は同じです。
品質は高いものの、openai/tts-1-hdには制限があります。特に一般的でない名前、外来語、専門用語については、時折誤った発音を生成することがあります。このモデルは、歌、効果音、または非音声オーディオを生成できません。また、リクエストごとにテキスト入力の最大長(コンテキストウィンドウ)がありますが、正確な制限は公開されていません。非常に長い入力は分割して連結する必要があるかもしれません。このモデルは標準APIを通じたカスタムボイスクローニングをサポートしていません。さらに、細かい粒度で話す速度やピッチを制御するようには設計されていません。そのような高度な機能については、専用の音声合成プラットフォームを検討してください。
速度は、テキストの長さと要求された音声フォーマットに依存します。openai/tts-1-hdは、前世代よりも低レイテンシ向けに最適化されていますが、利用可能な最速のオプションではありません。通常の文では、標準的な条件下で応答時間は1秒未満です。ストリーミング機能により、部分的な結果を得ることができます。OrcaRouterのAPI自体は、リクエストをOpenAIに直接プロキシするため、オーバーヘッドは無視できる程度です。ミリ秒単位が重要なリアルタイムアプリケーションでは、標準のTTS-1モデル(非HD版)の方が、最初の音声バイトをより高速に配信できる場合があります。通常のペイロードでベンチマークを実施し、許容できるパフォーマンスを判断することを検討してください。
openai/tts-1-hd の価格は、入力トークン100万トークンあたり$30.00、出力トークン100万トークンあたり$30.00です。入力トークンは送信したテキストに、出力トークンは生成された音声に対応します。これはプロバイダーの料金であり、OrcaRouterは追加のマークアップを加えません。実際の使用量のみが請求されます。トークンは入力と出力の両方でカウントされますが、音声出力は本質的に長い時間となるため、出力トークンのコストが支配的になる可能性があります。例えば、1,000文字のテキストの場合、入力トークンのコストは約$0.0012ですが、出力(たとえば30秒の音声)はより高くなる可能性があります。
OrcaRouterでは、TTS-1とTTS-1-HDはトークンあたりの価格が同じであるため、コストの差は単価ではなくトークン使用量にあります。TTS-1-HDは異なる圧縮設定で高品質な音声を生成する可能性があるため、同じテキストに対する出力トークン数はTTS-1と類似する場合があります。ただし、品質が向上したことでリトライ回数が少なくて済むのであれば、全体的にはHDモデルの方が費用対効果が高い可能性があります。他のTTSプロバイダーは、より低い文字単価を提供する場合がありますが、品質も低くなります。音声の忠実度と予算のバランスを考慮してください。大量利用のアプリケーションでは、わずかなパーセンテージの違いでも重要です。
OrcaRouterは、リクエストごとに音声、言語、テキストが異なる可能性があるため、TTS応答のキャッシュを提供しません。ただし、追加料金なしでプロバイダーの価格をそのまま適用します。このモデルに対するOrcaRouter経由の段階的割引やボリュームディスカウントはなく、コストは使用量に比例して増加します。非常に高い使用量を見込んでいる場合は、OpenAIに直接連絡してエンタープライズ価格を検討してもよいでしょう。ただし、OrcaRouterを通じては、シンプルな従量課金制のメリットがあります。最低契約額や隠れたコストは一切かかりません。
OpenAI互換のクライアント(例:Pythonのopenaiライブラリ)は、ベースURLを https://api.orcarouter.ai/v1 に設定することで使用できます。リクエストにモデルID "openai/tts-1-hd" を含めてください。例えば、Pythonを使用する場合:client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_orcarouter_key')。次に、client.audio.speech.create(model='openai/tts-1-hd', voice='alloy', input='Hello world', response_format='mp3') を呼び出します。OrcaRouterはリクエストをOpenAIに転送し、オーディオファイルを返します。APIキーはOpenAIから直接ではなく、OrcaRouterから取得したものであることを確認してください。
このAPIはいくつかのパラメータをサポートしています: model (必須: openai/tts-1-hd)、input (読み上げるテキスト)、voice (alloy, echo, fable, onyx, nova, shimmer のいずれか)、response_format (mp3, opus, aac, flac)、speed (0.25から4.0までの浮動小数点数、デフォルトは1.0)、およびオプションのstreamingブール値です。また、languageを設定することで、特定の言語の発音を向上させることができます。OrcaRouterはこれらを変更せずに通過させます。temperatureやtop_pのようなパラメータはTTSモデルには適用されません。詳細については、OpenAIの音声APIドキュメントを参照してください。
はい。移行にはたった2つの変更のみが必要です:ベースURLを「https://api.openai.com/v1」から「https://api.orcarouter.ai/v1」に変更し、OpenAIキーの代わりにOrcaRouter APIキーを使用することです。リクエストとレスポンスの構造は同一です。コードのロジックやパラメータ名を修正する必要はありません。OrcaRouterは同じストリーミング処理やエラーハンドリングの規約もサポートしています。そのため、単一のゲートウェイを通じて複数のモデルを管理したい開発者にとって、切り替えは簡単です。
主な違いは音質です。TTS-1-HDは、明瞭さとより自然な抑揚を備えた高忠実度を実現するよう設計されています。一方、TTS-1は低レイテンシーと高速生成に最適化されています。どちらもOrcaRouterでのトークン単価は同じです。HDモデルはOpenAIのバックエンドで若干多くの計算リソースを消費しますが、同じテキスト入力に対するトークン数は同一です。短く単純なフレーズでは品質の差は無視できる程度かもしれませんが、長文や感情的なコンテンツではHDバージョンの方が明らかに優れています。品質と速度の要件に基づいて選択してください。
ElevenLabsは、音声クローニング機能を備えた非常に表現力豊かな音声を提供しますが、文字単位のコストは高めです。Google Cloud TTSは幅広い音声とSSMLサポートを提供しますが、OpenAIのHDモデルほど自然ではない可能性があります。openai/tts-1-hdは品質とコストのバランスが取れており、シンプルなトークンベースの価格設定モデルを採用しています。標準APIを通じたカスタム音声クローニングはサポートしておらず、その点ではElevenLabsが優れています。Googleのモデルはより多くの言語カバレッジと細かい制御を提供します。OrcaRouterを使用すると、テキストの典型的な長さでテストを実行することにより、コストを直接比較できます。
openai/tts-1-hdを使用するのは、アプリケーションの成功が音質に依存する場合です。例えば、プロフェッショナルなコンテンツを作成している場合、第一印象が重要なユーザー向け音声アシスタント、または明瞭な音声が必要なアクセシビリティツールなどです。ユーザーが品質の違いを識別できない場合(社内通知システムや出力が大幅に圧縮される場合など)は避けてください。また、OrcaRouterではTTS-1とTTS-1-HDのトークン単価が同じであるため、HDモデルは単価にペナルティを与えません。より高品質な設定により長い音声が生成された場合のみ、コストが増加します。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1response_formatspeedvoice| 入力 / 1M tokens | $30.00 |
| 出力 / 1M tokens | $30.00 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
@misc{orcarouter_tts_1_hd,
title = {openai/tts-1-hd API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/tts-1-hd}
}openai. (n.d.). openai/tts-1-hd API. OrcaRouter. https://www.orcarouter.ai/models/openai/tts-1-hd