このモデルはgpt-3.5-turboの4倍のコンテキスト長を提供し、より高いコストで、1回のリクエストで約20ページのテキストをサポートすることができます。トレーニングデータ:最大...
GPT-3.5 Turbo 16kは、OpenAIのGPT-3.5 Turboモデルの拡張コンテキストバージョンであり、分割せずに大量のテキストを処理する必要があるタスクをサポートするために当初リリースされました。そのコンテキストウィンドウ容量は16,385トークン(約12,000語)で、1回の推論呼び出しで記事全体、トランスクリプト、コードリポジトリを処理しながら、最大4,096トークンを出力で…
GPT-3.5 Turbo 16kは、長いコンテキストが有利なテキストベースのタスクに優れています。これには、複数ページのドキュメントの要約、一貫性のあるマルチターン会話の維持、長い文章に対する質問への回答、大規模なコードベースでのコードレビューの実行が含まれます。16kのコンテキストウィンドウにより、章全体や長いメールスレッドを一度に取り込むことができ、手動でのテキスト分割の必要性を減らします。また、このモデルは、メールの下書き、クリエイティブコンテンツの作成、説明の提供などの標準的な生成タスクも処理します。GPT-3.5クラスのモデルであるため、指示に従い流暢なテキストを生成することに長けていますが、複雑な推論や微妙なドメイン知識ではGPT-4に及ばない場合があります。
アプリケーションに拡張コンテキストウィンドウが必要ない場合、標準のGPT-3.5 Turbo 4kモデル(または他のより安価なバリアント)の方がコスト効率が良い場合があります。短いプロンプトと4,000トークン未満の出力を扱うタスクでは、16kバージョンは利点がなく、トークンあたりのコストも同じです。また、パイプラインが既にチャンク化されたテキストで動作しており、大きなコンテキストの恩恵を受けない場合は、より小さいか高速なモデルを検討すべきです。OrcaRouterでは、モデルIDを簡単に切り替えられます。たとえば、コンテキストの必要性が最小限の場合は「openai/gpt-3.5-turbo」(4k)を使用します。平均的な入力トークン数を評価し、リクエストの95%以上をカバーするモデルを選択して、未使用の容量に支払うことを避けてください。
16kコンテキストの主な利点は、1回のリクエストでより長い入力を処理できることです。これにより、一貫性が保たれ、テキストを複数のウィンドウに分割する際に生じる問題が解消されます。例えば、1万字の研究論文全体をモデルに入力し、手動でセグメントをつなぎ合わせることなく、主要な知見を抽出するよう依頼できます。会話アプリケーションでは、長いカスタマーサポートのやり取りにおける会話履歴全体をモデルが記憶できるため、文脈をより考慮した応答が可能になります。コードタスクでは、複数のファイルや完全な関数ライブラリをプロンプトに含めることで、モデルがファイル間の依存関係を理解できるようになります。この能力により、チャンク分割や状態管理のロジックを構築するエンジニアリングのオーバーヘッドが削減されます。
GPT-3.5 Turbo 16kは、GPT-3.5シリーズの一般的な制限を引き継いでいます。特にニッチまたは極めて詳細な領域において、もっともらしく聞こえるが不正確または根拠のない情報(幻覚)を生成する可能性があります。このモデルはテキストのみであり、画像、音声、その他のモダリティを処理できません。その推論の深さはGPT‑4より低いため、複雑な多段階の論理、数学的証明、または微妙な法的解釈に苦労する可能性があります。MMLU‑Proスコア46.2は立派ではありますが、GPT‑4の典型的な>80スコアを大幅に下回っており、高度なトピックにおける事実の正確性が低いことを示しています。さらに、16,384トークンのコンテキスト制限は大きいものの無限ではありません。非常に長い文書には、依然として注意深いプロンプトエンジニアリングやチャンキングが必要です。
GPT-3.5 Turbo 16k は、MMLU‑Pro ベンチマークで 46.2 のスコアを達成しています。MMLU‑Pro は Massive Multitask Language Understanding データセットから厳選されたサブセットであり、STEM、社会科学、人文科学、法律を含む 57 の多様な分野にわたってモデルの知識の深さを評価するように設計されています。このスコアは、正答した質問の割合を示しています。比較として、より小さな GPT-3.5 Turbo (4k) は通常、標準的な MMLU で約 43 点を獲得し、GPT‑4 は 80 点以上です。46.2 という数字は、このモデルが複雑な事実素材をある程度理解しているものの、純粋な知識検索においては最先端ではないことを示しています。このモデルは、トップレベルの推論よりも、許容可能な事実精度で流暢なテキストを生成することが重要なタスクに最適です。
特定の推論ベンチマークは提供されていませんが、GPT-3.5 Turbo 16kは、論理推論、算術、常識的推論において、標準のGPT-3.5 Turboと同様の動作を示します。単純な論理パズルや複数ステップの指示を解くことはできますが、制約の厳守や反事実的推論を必要とするタスクでは失敗する可能性があります。コンテキストウィンドウの拡大は、それ自体で推論能力を向上させるわけではなく、より多くの入力を考慮できるようにするだけです。実際には、ユーザーはこのモデルが要約、翻訳、チャットボットアプリケーションで満足のいくパフォーマンスを発揮すると報告していますが、人間による検証なしに重要な決定をこのモデルに依存すべきではありません。MMLU‑Proスコア46.2は、ドメイン固有の専門知識が中程度であることを裏付けています。
GPT-3.5 Turbo 16kの速度とレイテンシの指標は明示的に示されていませんが、GPT-3.5クラスのモデルであるため、一般的にGPT‑4より高速で、リアルタイムアプリケーションに適しています。OrcaRouterでは、応答時間はOpenAIのバックエンドとネットワーク要因に依存します。4,000トークン未満の一般的な入力では、モデルは数百ミリ秒から数秒以内に最初のトークンを返すことがよくあります。標準のGPT-3.5 Turbo (4k)モデルと同程度のレイテンシが期待されます。これは、コンテキスト制限以外は基盤アーキテクチャが同一であるためです。16kモデルは、非常に長いプロンプトを処理する際に、より多くのトークンに注意を払う必要があるため、わずかに遅くなる可能性がありますが、その差は通常わずかです。レイテンシに敏感なユースケースでは、特定のプロンプト長でテストすることをお勧めします。
OrcaRouterにおけるGPT-3.5 Turbo 16kの料金は、入力トークン100万トークンあたり$3.00、出力トークン100万トークンあたり$4.00であり、OpenAIプロバイダーの正確なレートで請求され、マークアップは一切ありません。追加のプラットフォーム手数料、サブスクリプション階層、または数量割引は適用されず、料金は固定されており透明です。料金は各リクエストのトークン数に基づいて計算されます。入力トークンはメッセージ配列内の総トークン数、出力トークンは応答で生成されたトークンです。OrcaRouterはオーバーヘッドトークンを追加することはありません。使用した分だけお支払いいただき、ご利用状況はOrcaRouterのダッシュボードで明細表示されます。
主なコストのトレードオフは、大きなコンテキストウィンドウに対して支払うか、より小さなコンテキストを持つ安価なモデルを使用するかの間です。平均的な入力が4,000トークンをめったに超えない場合、OpenAIで100万トークンあたり$1.50入力/$2.00出力の標準GPT-3.5 Turbo (4k)の方が経済的です。しかし、入力が定期的に4,000トークンを超える場合、16kモデルは高価なチャンキングや検索ロジックを防ぎます。GPT-3.5 Turbo 16kのトークンあたりの価格は4kバリアントの2倍です。したがって、トークンの分布を評価する必要があります: リクエストの50%以上が4kトークンを超える場合、チャンキングを実装するためのエンジニアリング時間を考慮すると、16kモデルが全体的に安価になる可能性があります。
OrcaRouterはデフォルトではモデル出力やプロンプト補完をキャッシュしません。各リクエストはそのままOpenAIに送信されます。つまり、繰り返し入力される場合も含め、すべての呼び出しで完全なトークンコストが発生します。コストを削減するには、ご自身の側でプロンプトキャッシュを実装することを検討してください。例えば、システムメッセージをキャッシュしたり、ベクトルデータベースを使用して関連コンテキストを取得することで、毎回完全なドキュメントを再送信する代わりにすることができます。モデルの料金はトークン単位であり、送信されたトークンの総数に基づいて計算されるため、入力長を短くすることで直接コストを削減できます。ゼロマークアップポリシーにより、使用するキャッシュ戦略によって、直接OpenAIを使用した場合と同じ割合で節約が実現されます。
OrcaRouterは、GPT-3.5 Turbo 16kに一切のマークアップを適用しません。提示された料金(入力トークン100万件あたり3.00ドル、出力トークン100万件あたり4.00ドル)は、OpenAIがこのモデルに対して設定したレートそのものです。OrcaRouterはこれに手数料を上乗せすることはありません。この方針により、OrcaRouterは単純なリセラーとして機能し、プラットフォームの追加料金なしでプロバイダーのレートを支払うことになります。最低利用額や契約義務もありません。ただし、今後OpenAIが料金を変更した場合、OrcaRouterはその変更をそのまま適用することにご注意ください。コストはOrcaRouterのダッシュボードでリアルタイムに確認でき、トークン使用量とモデルごとのコストが表示されます。
OrcaRouterを介してGPT-3.5 Turbo 16kを使用するには、APIクライアントのベースURLをhttps://api.orcarouter.ai/v1に設定し、モデルIDとして「openai/gpt-3.5-turbo-16k」を使用します。すべてのOpenAIチャットコンプリーションのパラメータ(messages、temperature、top_p、frequency_penalty、presence_penalty、max_tokens、stop、streamを含む)がサポートされています。認証には、Authorizationヘッダー(Bearer <key>)に有効なOrcaRouter APIキーを指定する必要があります。curlを使用した例:curl https://api.orcarouter.ai/v1/chat/completions -H "Authorization: Bearer YOUR_KEY" -H "Content-Type: application/json" -d '{"model":"openai/gpt-3.5-turbo-16k","messages":[{"role":"user","content":"Hello"}],"max_tokens":1024}'。OrcaRouterはOpenAIと同じJSON構造を返します。
OrcaRouterを介してGPT-3.5 Turbo 16kを使用する場合、すべてのOpenAI chat‑completionパラメータが利用可能です。主要なパラメータは次のとおりです: messages(role/contentオブジェクトの配列)、temperature(0‑2、デフォルト1)、top_p(0‑1、デフォルト1)、n(生成する補完数、デフォルト1)、stream(ブール値、デフォルトfalse)、max_tokens(最大4096)、stop(1つ以上の文字列)、frequency_penalty(‑2‑2、デフォルト0)、presence_penalty(‑2‑2、デフォルト0)、およびlogit_bias(トークンIDとバイアスのマップ)。モデルIDは正確に "openai/gpt-3.5-turbo-16k" でなければなりません。max_tokensは4096を超えることはできず、プロンプトと補完の合計トークン数は16,384以内に収める必要があります。OrcaRouterはこれらの制限を検証し、超過した場合はエラーを返します。
OpenAIとの直接統合からOrcaRouterを使用したGPT-3.5 Turbo 16kへの移行には、3つの変更のみが必要です:ベースURLをhttps://api.openai.com/v1からhttps://api.orcarouter.ai/v1に更新し、APIキーをOrcaRouterキーに置き換え、モデルIDを"gpt-3.5-turbo-16k"から"openai/gpt-3.5-turbo-16k"に変更します。それ以外のコード(メッセージフォーマット、パラメータ処理、レスポンス解析を含む)はすべてまったく同じままです。以前に4kバージョンを使用していた場合は、モデルIDのみを変更することで16kモデルに切り替えられます。スキーマやレート制限の変更は不要です。OrcaRouterはOpenAIのAPI仕様をミラーしています。テストは、短いプロンプトで1回のリクエストを行い、認証とレスポンス構造を確認することで実施できます。
GPT-3.5 Turbo 16kとGPT-3.5 Turbo 4k(モデルID "openai/gpt-3.5-turbo")は、同じ基本アーキテクチャと機能を共有しています。唯一の違いはコンテキストウィンドウ(16,384トークン vs. 4,096トークン)と価格です。4kバリアントはより安価です。OpenAIでは、入力トークン100万件あたり1.50ドル、出力トークン100万件あたり2.00ドルかかります。OrcaRouterでも同じ料金が適用されます。16kバージョンはちょうど2倍のコストです。MMLU(標準)などのベンチマークでのパフォーマンスはほぼ同一で、GPT-3.5 Turbo 4kはMMLUで約43のスコア、16kバージョンはMMLU‑Pro(より難しいバリアント)で46.2のスコアです。4kトークン内に収まるタスクには、4kモデルの方が経済的です。より長いタスクには、16kモデルがコンテキスト切り捨てエラーを回避します。
GPT‑4(例:"openai/gpt-4")と比較すると、GPT-3.5 Turbo 16kは推論、事実の正確性、安全性の調整において著しく劣ります。GPT‑4は通常MMLUで80以上を獲得し、複雑なマルチステップロジックや微妙な指示をはるかにうまく処理します。また、いくつかのバリアントでは画像をサポートし、コンテキストウィンドウは最大8,192トークンまたは32,768トークンです。しかし、GPT‑4ははるかに遅く、コストも高く、トークンあたり10〜20倍になることがよくあります。Claudeモデル(例:"anthropic/claude-2")も大きなコンテキストウィンドウ(100kトークン)と強力な推論を提供しますが、GPT-3.5 Turboよりも価格が高く、APIのセマンティクスが異なる場合があります。GPT-3.5 Turbo 16kは、トップクラスの推論を必要とせず、拡張されたコンテキストだけが必要な場合に費用対効果の高い選択肢です。OrcaRouterを使用すると、任意のモデルを簡単に試すことができます。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-16k",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_p| 入力 / 1M tokens | $3.00 |
| 出力 / 1M tokens | $4.00 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
@misc{orcarouter_gpt_3_5_turbo_16k,
title = {GPT-3.5 Turbo 16k API},
author = {OpenAI},
year = {2023},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-16k}
}OpenAI. (2023). GPT-3.5 Turbo 16k API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-16k