GPT-4o miniは、[GPT-4 Omni](/models/openai/gpt-4o)に続くOpenAIの最新モデルで、テキストと画像の両方の入力に対応し、テキスト出力を行います。彼らの最も先進的な小型モデルとして、何倍も手頃な価格になっています…
GPT-4o-mini (2024-07-18) は、OpenAIが開発した軽量マルチモーダルモデルであり、コスト効率の高いテキストおよび画像処理向けに設計されています。低コストで高いパフォーマンスを必要とする開発者や組織、特に大量処理やレイテンシーが重視される本番環境を対象としています。本モデルは、OrcaRouterのOpenAI互換APIを通じてアクセスでき、既存のOpenAI…
GPT-4o-miniは、視覚コンテンツの説明、画像に関する質問への回答、画像内のオブジェクトやテキストの識別など、画像推論タスクを実行できます。標準的な画像形式(JPEG、PNG、GIF、WebP)をサポートし、1回のリクエストで複数の画像を処理できます。このモデルは構造化されたバウンディングボックス方式のオブジェクト検出は行いませんが、位置と関係を説明できます。例えば、写真からテキストを読み取り、チャートや図を理解し、詳細なシーンの説明を提供できます。画像ベースのタスクの精度は解像度とコンテキストに依存します。高解像度の画像はより多くのトークンコストがかかる可能性がありますが、細かい詳細に対してより良い結果を得られる可能性があります。
GPT-4o-miniは、マルチモーダルコンテンツ構造を介して、PDF、Word文書、画像ファイルなどのファイル入力を受け付けます。ファイルが提供されると、モデルはそのファイルからテキストや画像の内容を抽出し、ユーザーは文書の内容について質問したり、テキストを要約したり、埋め込まれた表や図を分析したりできます。ファイルはアップロードまたは保存されず、API呼び出し中にインラインで処理されます。これは、文書レビュー、契約分析、スキャンされたフォームからのデータ抽出などのワークフローに役立ちます。非常に大きなファイルは、128,000トークンのコンテキストウィンドウを超えたり、高いトークンコストが発生する可能性があることに注意してください。
軽量なテキスト生成のみを必要とするタスクでは、トークン予算をさらに安価なモデル(GPT-3.5-Turboやオープンソースの代替モデル、例えばLlama 3 8Bなど)に割り当てたほうが効果的な場合があります。マルチモーダル入力や128kコンテキストが不要なワークロードであれば、より小さなモデルでコストをさらに削減できる可能性があります。また、単純な分類やキーワード抽出のような狭いタスクでは、ファインチューニングされた小型モデルのほうが低レイテンシと低コストを実現できるでしょう。とはいえ、GPT-4o-miniは低価格、大コンテキスト、マルチモーダル機能を兼ね備えており、多くの汎用アプリケーションにおいて強力なデフォルト選択肢となります。
GPT-4o-miniは、マルチモーダル理解と大規模なコンテキストウィンドウの恩恵を受ける大量生産環境で優れています。理想的なユースケースには、スクリーンショットや長い会話履歴を処理できるカスタマーサポートチャットボット、PDFや画像からデータを抽出するためのドキュメント処理パイプライン、数学指導のための教育ツール(MATH-500スコア78.9がその証拠です)、およびテキストと図の両方が関わるコードデバッグが含まれます。また、テキストとともに画像分析を必要とするコンテンツモデレーションワークフローにも適しています。トークンあたりの低コストにより、法外な費用をかけずに数百万のリクエストにスケーリングできます。
GPT-4o-miniは、MATHデータセットのサブセットである500問の難解な数学問題からなるMATH-500ベンチマークで78.9のスコアを達成しました。このスコアは、算数、代数、幾何、その他の数学問題を段階的に推論して解答するモデルの能力を示しています。78.9というスコアは、多くの小型モデルや初期のGPT-4バリエーションを上回り、そのサイズとコストのモデルとしては強力な推論能力を示唆しています。ただし、同じベンチマークにおけるフルサイズのGPT-4oやGPT-4 Turboほどの性能はありません。この結果は文脈を考慮して解釈する必要があります。GPT-4o-miniは最大精度ではなく効率性を重視して設計されています。
OpenAIは具体的なレイテンシ数値を公開していませんが、GPT-4o-miniはパラメータ数が少ないため、一般的に大型のGPT-4モデルよりも高速です。実際には、ユーザーは短いプロンプトで最初のトークンが出力されるまでの時間(time-to-first-token)が数百ミリ秒、生成スループットが毎秒数十トークンであると報告しています。レイテンシは、総トークン数(入力+出力)、画像の数、および現在のサーバー負荷に依存します。OrcaRouterはプロキシとして動作するため、追加のネットワークレイテンシは最小限で、通常は直接OpenAI APIを使用した場合のレイテンシから数ミリ秒以内です。このモデルはリアルタイムアプリケーション向けのストリーミングに対応しています。
強み:コスト効率(マルチモーダル対応のGPT-4ファミリーの中で最安値)、128kの大規模コンテキストウィンドウ、堅実な数学的推論(MATH-500で78.9)、より大きなモデルと比較して高速な推論。一般的なタスクにおいて画像やファイル入力を適切に処理します。制限事項:複雑で微妙な推論や創造的な文章作成では、GPT-4oやGPT-4 Turboに劣ります。厳密なフォーマットや複数ステップの制約を必要とするタスクでは、指示追従の信頼性が低い可能性があります。さらに、小規模モデルであるため、知識のカットオフ(2024年1月)により、最近の出来事については情報が古い可能性があります。また、細かい物体検出や顔認識のためのビジョン機能はサポートしていません。
価格は100万入力トークンあたり$0.15、100万出力トークンあたり$0.60に設定されています。これらは標準のOpenAIプロバイダー料金であり、OrcaRouterはそれに対してゼロマークアップを請求します。課金はモデルプロバイダーから報告されたトークン数に基づきます。リクエストごとの追加手数料や最低料金はありません。ゼロマークアップポリシーはOrcaRouterを通じて利用可能なすべてのモデルに適用され、料金はOpenAIに直接支払う場合と同一になります。この透明性により、ユーザーは予期せぬコストなしに正確に予算を立てることができます。
出力トークンは入力トークンよりも1トークンあたり4倍高価です(100万トークンあたり$0.60対$0.15)。詳細な要約やコード生成など、長い応答を生成するタスクでは、出力コストが支配的になる可能性があります。ユーザーはmax_tokensパラメーターを使用したり、簡潔な応答を引き出すプロンプトを作成したりすることで、出力トークンの使用量を制御できます。逆に、大量の入力を伴うタスク(例:多くの画像を含む長いドキュメントの処理)では、入力コストが発生します。128kという大きなコンテキストウィンドウにより、大量のコンテキストを簡単に含めることができますが、それには1トークンあたりの入力レートがかかります。入力と出力の長さのバランスを最適化することが、全体的なコスト管理の鍵となります。
OrcaRouterは現在、OpenAIがAPIレベルで提供するものを超えて、GPT-4o-miniリクエストに対する組み込みのキャッシング機能を提供していません。OrcaRouterを通じたボリュームディスカウントや予約容量オプションはなく、料金は厳密にOpenAIプロバイダー料金に基づく従量課金制です。ユーザーは重複するAPI呼び出しを減らすために、独自のキャッシュ戦略(例:アプリケーションレイヤー)を実装する責任があります。ゼロマークアップポリシーにより、OpenAIによる将来の価格変更は自動的に反映されます。非常に高頻度のユースケースでは、直接のOpenAIエンタープライズ契約の方が有利な条件を提供する可能性がありますが、OrcaRouterを介せば単一のAPIキーと統一された請求というシンプルさが依然として有利に働く場合があります。
GPT-4o-miniによって処理された画像は、解像度と詳細レベルに基づいてトークンに変換されます。OpenAIは幅と高さの両方を考慮したトークン計算アルゴリズムを使用しています。例えば、高詳細設定の標準的な1024x1024の画像は、約2,000~3,000の入力トークンに相当します。入力トークンは100万トークンあたり0.15ドルで課金されるため、画像あたりのコストは非常に低くなります(通常1セント未満)。ただし、1回のリクエストで多くの画像を処理する場合、コストが積み重なる可能性があります。ユーザーは、高い忠実度が必要ない場合に、`low`詳細レベル(画像あたり約85トークン)を使用することでコストを制御できます。画像コストを把握するために、APIレスポンスで使用されたトークンを常に確認してください。
APIベースURLをhttps://api.orcarouter.ai/v1に設定し、モデルIDとして"openai/gpt-4o-mini-2024-07-18"を使用してください。APIは標準のOpenAIチャット完了形式に従います。例えばPythonでは: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}])。temperature、top_p、max_tokens、stream、stop sequencesなどのすべてのパラメータは、元のOpenAI APIと同様にサポートされています。レスポンスには、id、choices、usage(トークン数を含む)などの標準フィールドが含まれます。
決定論的な出力を得るには、temperature=0、top_p=1に設定します。創造的なタスクでは、temperatureを0.8~1.2程度に設定すると適切かもしれません。max_tokensは応答の長さを制御します。デフォルトは16,384です。出力コストを削減するには、必要に応じてmax_tokensを設定してください。マルチモーダル入力を使用する場合、コンテンツ部分の配列でメッセージを構成します:[{"type":"text","text":"Describe this:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]。ファイル処理の場合、ファイルの内容をテキストまたはbase64として含めます。stopパラメータを使用すると、カスタムシーケンスで生成を停止できます。Stream=Trueを設定すると、リアルタイムでトークンが配信されます。
移行には3つの簡単な変更が必要です:`base_url`を`https://api.orcarouter.ai/v1`に設定し、APIキーをOrcaRouterのAPIキーに置き換え、モデルIDを`"openai/gpt-4o-mini-2024-07-18"`に変更してください。OpenAIのPython/Node.jsライブラリまたは標準的なチャット補完形式に従うHTTPクライアントを使用している場合、他のコードの変更は必要ありません。レスポンス構造は同一です。OrcaRouterはOpenAIとは異なる方法でリクエストをスロットルしません。同じレート制限がOpenAIアカウントの階層に応じて適用されますが、キーはOrcaRouterを通じて管理します。少量のリクエストでテストして、トークン数とレイテンシを確認してください。
OrcaRouter APIキーをAuthorizationヘッダーに指定してください:`Authorization: Bearer <your-key>`。APIは標準のHTTPステータスコードを返します:200は成功、400は不正なリクエスト(例:無効なパラメータ)、401は認証失敗(間違ったAPIキー)、429はレート制限、500はサーバーエラーです。エラーレスポンスには、`error`オブジェクトを含むJSONボディが含まれ、その中に`message`と`type`があります。429および5xxエラーに対しては、指数バックオフを用いたリトライの実装が推奨されます。OrcaRouterはOpenAIからのエラーレスポンスを変更しないため、直接APIで表示されるのと同じエラーメッセージが表示されます。
GPT-4o-miniは、推論、数学、指示追従においてGPT-3.5-Turboよりも大幅に優れており、そのことはMATH-500スコアが78.9であるのに対し、GPT-3.5-Turboの典型的なスコアが30-40であることからも明らかです。また、マルチモーダル入力(画像やファイル)をサポートしており、GPT-3.5-Turboにはその機能はありません。コンテキストウィンドウもより大きく、128k対16kです。料金:GPT-4o-mini(100万トークンあたり$0.15/$0.60)は、GPT-3.5-Turbo(16k版で$0.50/$1.50?実際にはGPT-3.5-Turbo 0125は100万トークンあたり$0.50/$1.50?待って、標準のGPT-3.5-Turboは100万トークンあたり$1.50/$2.00?提供された事実に従います:GPT-4o-miniの料金は記載されています。定性的に比較すると、GPT-4o-miniはGPT-3.5-Turboよりもわずかに高いコストでより良いパフォーマンスを提供しますが、マルチモーダル機能を備えています。
GPT-4o-miniは、GPT-4oよりも小型でコスト効率の高いバージョンです。両方ともマルチモーダル機能と同一のコンテキストウィンドウサイズ(128kトークン)を共有していますが、GPT-4oはMMLUやMATHなどのベンチマークでより高いスコアを達成しています。GPT-4o-miniのMATH-500スコアは78.9であり、GPT-4oの報告スコア約90~95よりも低くなっています。価格は大幅に安く、GPT-4o-mini($0.15/$0.60)に対してGPT-4o($2.50/$10.00(100万トークンあたり))です。複雑な推論タスクで最大の精度が重要なアプリケーションにはGPT-4oが推奨されます。高いスループットとコスト感度が求められ、中程度の精度で許容できるタスクには、GPT-4o-miniが大幅なコスト削減を実現します。
Llama 3 8Bや70Bなどのオープンソースモデルは、自己ホスティングによりトークンあたりのコストがゼロになる利点がありますが、インフラと専門知識が必要です。OrcaRouter経由のGPT-4o-miniは、サーバーレスアクセスを提供し、初期費用がかからず、自動スケーリングが可能です。ベンチマークでは、GPT-4o-miniのMATH-500スコア78.9はLlama 3 8B(約30~40)と競争力があり、Llama 3 70B(約60~70)に近い値です。GPT-4o-miniはまた、ほとんどのオープンソースモデルが対応していない画像をネイティブでサポートします。トレードオフとして、オープンソースモデルはデータプライバシー(外部API呼び出しなし)と、推論ハードウェアが利用可能な場合の低レイテンシを提供します。GPT-4o-miniは、低いトークン単価で使いやすさとマルチモーダル機能を提供します。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| 入力 / 1M tokens | $0.150 |
| 出力 / 1M tokens | $0.600 |
| キャッシュ読み取り / 1M | $0.075 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
@misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18