GPT-4o("o"は"omni"の略)は、OpenAIの最新AIモデルであり、テキストと画像の両方の入力を受け付け、テキスト出力をサポートします。[GPT-4 Turbo](/models/openai/gpt-4-turbo)の知能レベルを維持しつつ、2倍...
GPT-4o (2024-05-13) は、OpenAI のマルチモーダル言語モデルであり、OrcaRouter の API を通じてアクセス可能です。テキスト、画像、ファイルを処理し、視覚データとテキストデータが混在するタスクに適しています。このモデルの 128,000…
GPT-4o は入力の一部として提供される画像を分析できます。視覚的な内容を説明し、画像内のオブジェクトやテキスト、空間的な関係に関する質問に答えることができます。スキャンされた文書や写真からテキストを抽出し、文字起こしすることもできます。画像を直接処理するため、別途OCRやビジョンモデルは必要ありません。画像はコンテキストウィンドウ内に収まるようにトークン化されます。例えば、ユーザーはグラフのスクリーンショットをアップロードし、モデルにトレンドを解釈するよう依頼できます。モデルの理解は単純なキャプションに限定されず、コンテンツについて推論し、複数の画像を比較し、テキストの指示とともに視覚的な手がかりを使用できます。この機能は同じAPI呼び出しに統合されており、テキストのみのリクエストと同じメッセージ形式を使用します。OrcaRouterでは、コンテンツ配列内で画像をbase64エンコードされたデータまたはURLとして送信します。モデルIDは "openai/gpt-4o-2024-05-13" のままです。
GPT-4oはファイルを入力として受け付けます。対応形式には、PDF、Microsoft Office文書(Word、Excel、PowerPoint)、テキストファイル、画像形式が含まれます。PDFやOfficeファイルの場合、モデルはテキストコンテンツを抽出し、レイアウトを分析します。複雑な書式を直接レンダリングするのではなく、テキストコンテンツを読み取ります。これにより、手動での抽出を行わずにレポート、契約書、スプレッドシート、プレゼンテーションを処理するのに役立ちます。ファイルコンテンツはトークン化され、入力トークン総数にカウントされます。モデルはファイルの内容に関する質問に答えたり、要約したり、表形式のデータに対して計算を実行したりできます。ファイルを使用する場合、適切なOpenAI APIフィールドを使用してメッセージコンテンツの一部として含めます。OrcaRouterは変更せずに送信を処理します。モデルの能力は抽出されたテキストの品質に依存することに注意してください。PDF内のスキャン画像が多く含まれている場合、埋め込みテキストレイヤーがないと完全に読み取れない可能性があります。
GPT-4oは、GPT-4o-miniや以前のGPT-3.5バリアントといった代替モデルよりもコストが高いプレミアムモデルです。タスクにマルチモーダル機能(例:テキストのみのタスク)、大規模なコンテキスト(最大128K)、またはMATH-500(79.1)で測定される数学的推論レベルが必要ない場合、より低コストのモデルのほうが経済的です。たとえば、単純な分類、短いコンテンツ生成、基本的なチャットなどは、低コストのモデルでも許容できる品質で処理できます。また、アプリケーションがレイテンシに敏感で、より小型のモデルの方が高速である場合、絶対的な精度よりも速度を優先するトレードオフが有効かもしれません。さらに、画像やファイルを処理する頻度が低いのであれば、追加のマルチモーダル機能は不要です。OrcaRouterはさまざまなモデルを提供しているため、最適な価格性能比を選択できます。ユースケースの要件をベンチマークスコアや価格と照らし合わせて評価し、GPT-4oの利点が追加コストを正当化するかどうかを判断してください。
GPT-4oは1リクエストあたり最大16,384トークンを生成できます。これは寛大な制限であり、長文の回答、詳細なコード、複数段落の分析を可能にします。ただし、出力トークンは100万トークンあたり15.00ドルで課金されるため、長い出力ほど高額になります。API呼び出しのmax_tokensパラメータを使用して出力長を制御できます。非常に長い生成が必要になると予想される場合は、リクエストをバッチ処理または分割することを検討してください。16,384の制限は、要求された場合の推論ステップや思考連鎖を含む、全体の完了に適用されます。拡張思考を必要とする非常に複雑なタスクでは、複数の呼び出しを使用する必要があるかもしれません。OrcaRouterでは、出力トークン数がAPIレスポンスのusageフィールドで報告されるため、コストを正確に追跡できます。OrcaRouterによって追加の制限が課されることはなく、モデルのネイティブキャップが適用されます。
GPT-4oはMATH-500ベンチマークで79.1を記録しました。MATH-500は、代数、幾何学、数論、確率などのさまざまなトピックにわたる500の難解な数学問題で構成されています。79.1というスコアは、モデルが問題の79.1%を正解したことを意味し、特にマルチモーダルモデルとして強力な数学的推論能力を示す結果です。このベンチマークは、問題解決能力と段階的推論の両方をテストします。このスコアは、数学チュータリング、科学計算、論理パズルを含むアプリケーションの期待値を導くのに役立ちます。ベンチマークのパフォーマンスが実際のタスクで同一の結果を保証するわけではなく、ドメイン固有の調整やプロンプトエンジニアリングが必要になる場合があることに注意してください。このモデルを検討する際は、MATH-500スコアを評価対象の他のモデルと比較してください。OrcaRouterは追加のベンチマークデータを提供しないため、これがこのモデルに対して提供される唯一の参照ポイントです。
レイテンシは、入力の長さ、期待される出力の長さ、OpenAIサーバーの現在の負荷、アプリケーションとOrcaRouter間のネットワーク経路など、いくつかの要因に依存します。OrcaRouterは、基盤となるプロバイダの応答時間に比べて大きなオーバーヘッドを追加しません。数値トークンの適度な入力(数千トークン)と短い出力(1,000トークン未満)を持つ一般的なリクエストでは、応答は数秒以内に到着することが多いです。より長い出力(16,384トークン近く)は、モデルがトークンを逐次生成するため、当然ながらより多くの時間がかかります。画像入力も、トークン化と処理のためにレイテンシが増加します。出力長を短くする、プロンプトを短くする、リクエストをバッチ化することで、レイテンシを最適化できます。OrcaRouterは、必要に応じてストリーミングを介して非同期に結果を返す標準APIエンドポイントを提供します。リアルタイム対話型アプリケーションの場合は、ストリーミングモード(stream: true)を使用して、トークンが到着次第処理を開始することを検討してください。モデルファクトには具体的なレイテンシの数値は記載されていないため、これらは定性的な推定値です。
強み: マルチモーダル入力(テキスト、画像、ファイル)、128Kの大規模コンテキストウィンドウ、強力な数学的推論(MATH-500: 79.1)、および高い出力トークン制限(16,384)。長文書やマルチターン会話を効果的に処理します。APIは標準のOpenAI互換で、統合を容易にします。制限事項: 小型モデルと比較してコストが高い。マルチモーダル性や大規模コンテキストの恩恵を受けないタスクには最適化されていません。非英語のパフォーマンスや特定の安全性ベンチマークに関する情報は提供されていません。非常に複雑なシーンや低解像度の画像に対する画像理解は限定的である可能性があります。また、モデルは学習分布外の問題に対して誤った回答を生成する可能性があります。開示されたレイテンシ保証はありません。非常に低いレイテンシや非常に低いコストを必要とするユーザーには、別のモデルの方が適している可能性があります。MATH-500での79.1のベンチマークスコアは、最も難しい数学問題に対する改善の余地があることを示しています。これらのトレードオフがアプリケーションの要件に合致するかどうかを評価してください。
GPT-4oはトークン単位で課金され、入力トークンと出力トークンで異なる料金が設定されています。入力トークンは100万トークンあたり5.00ドル、出力トークンは100万トークンあたり15.00ドルです。これらはプロバイダーの料金であり、OrcaRouterはマークアップなしでそのまま適用します。1リクエストあたりのコスト = (入力トークン数/1e6 * 5) + (出力トークン数/1e6 * 15)。例えば、4,000入力トークンと200出力トークンの会話の場合、(0.004*5ドル) + (0.0002*15ドル) = 0.02ドル + 0.003ドル = 0.023ドルとなります。API呼び出し自体に追加料金はなく、消費したトークンに対してのみ支払います。料金はプロバイダーの変更に基づいて動的に更新されます。OrcaRouterは将来の調整もそのまま適用します。マークアップがないため、ユーザーはOpenAIの直接顧客と同じ料金を享受できますが、OrcaRouterの統合管理と請求の利便性も得られます。画像やファイルはトークン化され、入力トークン数に計上されるため、テキストのみの入力と比較してコストが増加することが多い点に注意してください。
いいえ。OrcaRouterは、割引やキャッシュされたトークン、または繰り返し入力に対する割引料金を提供していません。すべてのトークンは標準のプロバイダーレートで課金されます。キャッシュコストや大量利用に対する追加料金は別途発生しません。$5/$15(100万トークンあたり)は固定レートです。非常に高いスループットを必要とするユーザーはカスタム契約について問い合わせることも可能ですが、標準サービスにはボリュームディスカウントは含まれません。さらに、接続料金や月額最低料金などの隠れた費用もありません。料金は透明であり、トークン使用量に直接紐付いています。コスト最適化のためには、入力サイズ(例:履歴のトリミング、短いプロンプトの使用)や出力長(例:max_tokensの低い値の設定)を削減することを検討してください。また、モデルの機能(マルチモーダル、大規模コンテキスト)が必要な場合にのみモデルを使用することで、コストを抑えることができます。アプリケーションで毎回同じ繰り返しプロンプトがある場合、アプリケーションレイヤーでのキャッシュによりトークン使用量を削減できる可能性がありますが、OrcaRouter自体はそのような機能を提供していません。
GPT-4o はプレミアム価格です。多くのタスクでは、より安価なモデル(例:GPT-4o-mini や GPT-3.5-turbo)で十分な場合があります。複雑さと要求される精度を評価してトレードオフを検討してください。タスクが限られたコンテキストでの単純な抽出や分類である場合、より安価なモデルでも同様のパフォーマンスを低コストで発揮する可能性があります。逆に、画像や長文書の微妙な理解、または高い数学的精度(MATH-500 スコア 79.1 対より安価なモデルの低いスコア)が必要なタスクでは、GPT-4o のプレミアム価格に見合う価値があるかもしれません。代表的なサンプルで A/B テストを実施し、品質とコストを比較してください。また、テキストの長さに関係なく、百万トークンあたりの同じ価格が適用されることに注意してください。短いリクエストほど安くなります。ワークフローで頻繁に 128K のフルコンテキストを使用する場合、そのリクエストの入力トークンコストが高くなる可能性があります。コンテキストが本当に必要かどうかを確認してください。OrcaRouter は使用状況のメトリクスを提供するため、監視と最適化が可能です。
OrcaRouter上でGPT-4oを呼び出すには、OpenAI互換のAPIエンドポイントを使用します:base_url = "https://api.orcarouter.ai/v1"。モデルパラメータを"openai/gpt-4o-2024-05-13"に設定します。OrcaRouterからのAPIキーが必要です。リクエスト形式は標準のOpenAI Chat Completions APIに従います:roles(system、user、assistant)を含むmessages配列、画像やファイルのオプションのコンテンツ、temperature、max_tokens、top_p、frequency_penalty、presence_penalty、stopなどのパラメータ。例えば、単純なテキストリクエストはPOSTで/chat/completionsに送信されます。画像の場合は、ユーザーメッセージの一部としてtype "image_url"でコンテンツを含めます。ファイルの場合も、コンテンツの一部として含めます(具体的な形式はOpenAIの仕様に従います)。応答には、アシスタントのメッセージ、使用統計(prompt_tokens、completion_tokens、total_tokens)、およびその他のメタデータが含まれます。標準のContent-TypeとAuthorization以外に特別なヘッダーは必要ありません。統合はOpenAIを直接使用する場合と同一です。
すべての標準的なOpenAI Chat Completionsパラメータがサポートされています:messages(必須)、model(必須、"openai/gpt-4o-2024-05-13"に設定)、temperature(0~2、デフォルト1)、top_p(0~1、デフォルト1)、n(補完数、デフォルト1)、stop(文字列または文字列のリスト)、max_tokens(デフォルト16,384、上限16,384)、presence_penalty(-2から2、デフォルト0)、frequency_penalty(-2から2、デフォルト0)、logit_bias(トークンIDとバイアス値のマップ)、user(不正使用監視用の文字列)、stream(ブール値、デフォルトfalse)、およびfunctions/tools(関数呼び出し用)。マルチモーダル入力の場合、messagesコンテンツはタイプ"text"または"image_url"のコンテンツ部分の配列にできます。さらに、OpenAIのドキュメントに従って"file"タイプのコンテンツを含めることもできます(例:PDF添付)。OrcaRouterはこれらのパラメータを変更せずにプロバイダに直接渡します。128Kトークンのコンテキストウィンドウを超えないように注意してください。APIは、無効なリクエスト、レート制限、または認証失敗に対して標準のエラーコードを返します。
移行は簡単です。OrcaRouterのAPIは完全にOpenAI互換だからです。変更が必要なのは、ベースURLを `https://api.openai.com/v1` から `https://api.orcarouter.ai/v1` に、モデルIDを `"gpt-4o-2024-05-13"` から `"openai/gpt-4o-2024-05-13"` に変更するだけです。APIキーはOrcaRouterのものをOpenAIキーの代わりに使用します。OpenAIのPython/Nodeライブラリや生のHTTPリクエストを使っている既存のコードは、他の変更なしで動作します。メッセージ形式、パラメータ名、レスポンス構造は同一です。ベースURLパラメータを受け付けるライブラリでは、それをOrcaRouterのエンドポイントに設定するだけです。OpenAIのクライアントを使用していた場合、`base_url` をOrcaRouterのエンドポイントに設定してインスタンス化できます。プロンプトエンジニアリングやキャッシュロジックの変更は不要です。OrcaRouterはストリーミング(`stream: true`)と関数呼び出しも以前と同様にサポートしています。テストは少量のリクエストで動作を確認することができます。
OrcaRouterはモデルの動作を変更しません。純粋にゲートウェイとして機能し、リクエストをOpenAIのサーバーに転送し、応答をそのまま返します。OrcaRouterによる追加の前処理、後処理、またはコンテンツフィルタリングは一切適用されません。データの取り扱いについて:OrcaRouterは、課金および運用監視に必要な範囲を超えて、プロンプトや完了データを保存または記録しません。OpenAI自身のデータポリシーが、OrcaRouterを介したモデルの使用に適用されます。提供された事実に基づくと、標準的なAPIログ以外でのOrcaRouterによるデータ保持については言及されていません。ユーザーは、データの取り扱いを理解するために、OrcaRouterのプライバシーポリシーとOpenAIのポリシーの両方を確認する必要があります。厳格なデータ保存場所要件がある場合は、利用可能なオプションについてOrcaRouterに相談してください。OrcaRouterが他の顧客とデータを共有するという兆候はありません。モデルIDのみが変更される必要があり、カスタム指示は注入されません。
GPT-4o と GPT-4o-mini の主な違いは、コンテキストウィンドウサイズ、マルチモーダル機能、ベンチマークパフォーマンス、およびコストです。GPT-4o は 128K のコンテキストウィンドウを提供し、画像やファイル入力をサポートします。GPT-4o-mini(OpenAI の提供に基づく)は通常、コンテキストサイズが小さく(例:128K または一部のバージョンでは 16K)、すべてのモダリティをサポートしない場合があります。MATH-500 では、GPT-4o が 79.1 をスコアリングし、GPT-4o-mini はそれより低いスコアになります。価格:GPT-4o は 100万トークンあたり $5/$15 ですが、GPT-4o-mini は大幅に安価です(例:一部のバージョンでは 100万トークンあたり $0.15/$0.60)。したがって、GPT-4o-mini は低コストが最優先される単純なタスクに適しており、GPT-4o は複雑な推論、長いコンテキスト、マルチモーダルタスクに適しています。これらを選択する際には、精度要件とビジョンやファイル処理の必要性を考慮してください。OrcaRouter は両方のモデルを個別の ID で提供しています。ワークロードで画像や大きなコンテキストをほとんど使用しない場合、GPT-4o-mini が経済的に優れた選択肢になる可能性があります。
GPT-4o (2024-05-13) はマルチモーダルモデルであり、128Kのコンテキストウィンドウを持ちます。一方、古いGPT-4バージョン(gpt-4-0613など)は通常、8Kまたは32Kのコンテキストを持ち、テキストのみです(一部の後期バージョンでは別のビジョンエンドポイントを通じて画像をサポートしています)。GPT-4oの価格(100万トークンあたり$5/$15)は、GPT-4 Turboのピーク時の価格(例:100万トークンあたり$10/$30)よりも一般的に低くなっています。ベンチマーク性能:提示されたMATH-500スコア79.1はGPT-4oのものです。GPT-4には提供された事実の中に公式のMATH-500スコアはありませんでしたが、類似の数学ベンチマークでは低いスコアであることが知られていました。GPT-4oはまた、古いGPT-4(バージョンに応じて4Kまたは8K)と比較して、より高い出力制限(16Kトークン)を提供します。全体的に、GPT-4oはマルチモーダルで長いコンテキストのアプリケーションに対してより良い価値を提供します。ただし、古いGPT-4モデルは特定のタスク向けにファインチューニングされている可能性がありますので、ご自身のデータで評価してください。OrcaRouterを通じて、両方のモデルファミリーにアクセスできます。
直接比較には、ここでは提供されていないモデル固有の事実が必要です。一般的に、両モデルは推論とマルチモーダル能力において競争力があります。GPT-4oは128Kのコンテキストウィンドウを持ち、Claude(Sonnet)の200Kコンテキストと同程度です。両方とも画像をサポートしています。ベンチマークスコアは異なります:GPT-4oはMATH-500で79.1を提供していますが、Claude 3.5 Sonnetの同ベンチマークのスコアは提供されていません。価格:GPT-4oは100万トークンあたり$5/$15、Claude Sonnetの価格は通常100万トークンあたり約$3/$15です(変更される可能性があります)。したがって、GPT-4oの入力コストは高くなります。パフォーマンスの違いはタスクに依存します:一部のユーザーは長文作成でClaudeが優れていると感じる一方、GPT-4oは数学とコーディングに優れています。管理された評価がない場合、代表的なサンプルで両方をテストすることをお勧めします。OrcaRouterは両方のモデルを提供しているため、モデルIDを変更することで簡単に比較できます。最終的に、最適なモデルは正確性、レイテンシ、コストに関する具体的な要件に依存します。提供された事実にはClaudeのスコアが含まれていないため、この比較は定性的なものにとどまります。
Llama 3(例:Llama 3 70B)はオープンソースモデルであり、セルフホスティングが可能です。一方、GPT-4oはプロプライエタリであり、API経由でアクセスします。GPT-4oはマルチモーダル入力(テキスト、画像、ファイル)をサポートし、128Kのコンテキストを持っています。一方、Llama 3は通常テキストのみ(ビジョン用にファインチューニングされていない限り)であり、コンテキストも小さい(例:8Kまたは32K)。ベンチマークスコア:GPT-4oのMATH-500スコアは79.1です。Llama 3 70Bは類似の数学ベンチマークで約70~75のスコアです(事実として提供されていませんが、一般的な知識)。コスト:GPT-4oのAPIコストはトークンあたり固定です。Llama 3のセルフホスティングにはインフラストラクチャコスト(GPU、電気代)がかかり、高ボリュームでは低くなる可能性があります。レイテンシ:APIベースのGPT-4oはバーストワークロードに対して高速かもしれません。セルフホストモデルは、容量が予約されていれば一貫したレイテンシを提供できます。柔軟性:Llama 3はファインチューニング可能ですが、GPT-4oはできません。ベンダーロックインを避けたい、または機密データを完全にオンプレミスで処理したいユーザーにとって、オープンソースモデルは魅力的です。OrcaRouterは両方のタイプへのアクセスを提供します。GPT-4oをAPI経由で使用することも、可能であればOrcaRouterを通じてオープンソースモデルにアクセスすることもできます。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-05-13",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamtemperaturetool_choicetoolstop_logprobstop_pweb_search_options| 入力 / 1M tokens | $5.00 |
|---|---|
| 出力 / 1M tokens | $15.00 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
今週の開発者の声
@misc{orcarouter_gpt_4o_2024_05_13,
title = {GPT-4o (2024-05-13) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13}
}OpenAI. (2024). GPT-4o (2024-05-13) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13