GPT-4o miniは、[GPT-4 Omni](/models/openai/gpt-4o)に続くOpenAIの最新モデルで、テキストと画像の両方の入力に対応し、テキスト出力を行います。彼らの最も先進的な小型モデルとして、何倍も手頃な価格になっています…
GPT-4o-mini は、OpenAI の GPT-4o モデルの小型で高速なバリエーションであり、マルチモーダル機能を維持しつつ、低い計算コスト向けに最適化されています。テキスト、画像、アップロードされたファイルを入力として処理し、テキスト出力を生成できます。このモデルは OpenAI によってホストされており、OrcaRouter の OpenAI 互換 API を通じて、ベース URL…
GPT-4o-miniは、要約、翻訳、分類、質問応答など、幅広い言語タスクで優れた性能を発揮します。構造化JSON出力、関数呼び出し、ツール利用をサポートしており、外部APIやデータベースとの統合が可能です。128Kのコンテキストウィンドウにより、大規模なドキュメントや会話履歴を取り込み、一貫性のある分析を行うことができます。一般的なベンチマーク(MATH-500スコア78.9)でも良好な結果を示し、教育用の数学問題、コード解説、データ抽出に適しています。より単純なタスクでは、GPT-4o-miniは多くの場合、大規模モデルと同等の性能を低コストで実現します。ただし、深い専門知識や高度な創造的出力を必要とするタスクでは、GPT-4oと比較して品質が低下する可能性があります。
画像は、APIリクエスト内でURLまたはBase64エンコードされたデータとして提供できます。モデルは画像を解釈し、オブジェクト、画像内のテキスト、空間的関係などの視覚コンテンツを理解します。これにより、ビジュアルQ&A、図の解釈、手書き数字認識などのユースケースが可能になります。画像トークンはコンテキスト制限にカウントされるため、高解像度または大きな画像は128Kトークンの予算をより多く消費します。モデルは画像を生成せず、処理のみを行います。微細な視覚的詳細を必要とするタスク(例:医療画像)には、専門的なビジョンモデルの方が正確かもしれませんが、GPT-4o-miniは手頃なコストで汎用的なソリューションを提供します。
GPT-4o-miniはテキストや画像に加えて、ファイルのアップロードも受け付けます。対応する一般的なファイル形式には、PDF、.docx、.txt、.csv、.jsonが含まれます。モデルはテキストと関連する視覚要素(ファイルに埋め込み画像が含まれる場合)を抽出し、それらをコンテキストの一部として処理します。これにより、研究論文や法的契約書、スプレッドシートなどを手動でコピーすることなく分析するのに役立ちます。なお、ファイルの内容はトークン使用量に加算されます。例えば、50ページのPDFは数千トークンを消費する可能性があります。OrcaRouterは、ファイル由来のものを含む入力トークンの総数に基づいて課金します。トークン消費以外のファイル処理料金は発生しません。
もしあなたのワークロードが画像やファイルを含まないテキストのみであり、必要なコンテキストが16Kトークン未満の場合、GPT-3.5-turboのような小さなモデルの方がトークンあたりのコストが低くなる可能性があります。同様に、単純な分類や簡単なQ&Aのような非常に高いスループットのタスクでは、専用にファインチューニングされたモデルの方が経済的かもしれません。GPT-4o-miniはマルチモーダルや長いコンテキストのユースケースではコスト効率が良いですが、その強みはパフォーマンスと価格のバランスにあります。応答が遅くなったり、最大限の精度のためにコストが高くなることを許容できるアプリケーションであれば、GPT-4oが代替案となります。品質と予算の閾値を満たすモデルを確認するために、具体的なタスクでベンチマークを実施してください。
MATH-500はMATHベンチマークのサブセットであり、代数、幾何、整数論、確率をカバーする500問の競技レベルの数学問題で構成されています。78.9というスコアは、GPT-4o-miniがこれらの問題の約78.9%に正答したことを示しています。これは、小規模なモデルとしては強力な結果であり、数学的推論能力を反映しています。また、同サイズの多くの初期モデルを上回っています。ただし、特定の問題領域ではパフォーマンスが異なる可能性があります。このベンチマークはゼロショット条件下で実施されており、事前の例示は提供されません。実世界の数学指導では、モデルが多段階の解法を正しく処理するために、注意深いプロンプトが必要となる場合があります。
唯一提供されているベンチマークはMATH-500ですが、広く知られている公開情報によると、GPT-4o-miniはMMLU(大規模マルチタスク言語理解)、HellaSwag、GSM8Kでも競争力のあるスコアを示しています。これらの指標では、通常GPT-4oよりは低いものの、GPT-3.5-turboよりは高い順位です。推論ベンチマークでは、そのパラメータ数に対して強力なパフォーマンスを示します。創造的執筆やオープンエンド生成では、出力は一貫性がありますが、より大きなモデルのニュアンスに欠ける場合があります。レイテンシは一般的にGPT-4oより低く、リアルタイムアプリケーションに適しています。正確なスコアについては、OpenAIのドキュメントを参照してください。OrcaRouterは追加のマークアップなしでアクセスを提供します。
レイテンシは、リクエストの複雑さ、トークン数、API負荷に依存します。GPT-4o-miniは高速になるよう設計されており、中程度の長さのプロンプトでは通常、最初のトークンを1秒未満で返します。長いドキュメント(例:50Kトークン)の場合、モデルがコンテキスト全体を処理するため、レイテンシが増加します。OrcaRouterは速度を変更せず、OpenAI APIを直接呼び出した場合と同じ応答時間を体験できます。ストリーミングは、体感レイテンシを低減するためにサポートされています。レイテンシが重要なアプリケーションでは、プロンプトの長さを短く保ち、ストリーミングを使用することを検討してください。正確な最初のトークンまでの時間は、応答時間を監視することで測定できます。特定のSLAは提供されていません。
能力はありますが、GPT-4o-miniはサイズが小さいため制限があります。複雑な多段階推論において、GPT-4oと比較して正確性が低い回答を生成する可能性があります。微妙な指示を誤解したり、非常に長い出力において完全な一貫性を維持できないことがあります。マルチモーダル理解は優れていますが完璧ではなく、画像内の細かい詳細を見落としたり、要素を誤って数えることがあります。このモデルは学習データに存在するバイアスを示す可能性があります。ツール使用のために明示的にファインチューニングされていない限り、インターネット検索やリアルタイムデータアクセスをサポートしていません。高い精度が要求されるタスク(例:法的助言、医療診断)には、人間によるレビューが不可欠です。ベンチマークスコアは管理された環境を反映しており、実際のパフォーマンスは異なる場合があります。
OrcaRouterは、OpenAIの正確な価格をマークアップなしでそのまま適用します。入力トークン100万あたり0.15ドル、出力トークン100万あたり0.60ドルです。入力トークンには、すべてのテキスト、画像トークン、ファイルコンテンツが含まれます。出力トークンは、生成されたテキストをカウントします。月額料金や隠れた費用は一切ありません。128Kのコンテキストウィンドウを持つマルチモーダルモデルとしては、トークン単価が最も低い部類に入ります。比較として、GPT-4oは入力100万あたり2.50ドル、出力100万あたり10ドルであり、GPT-4o-miniは入力で94%、出力で94%安価となっています。このコスト面での優位性は、大量利用のアプリケーションにとって大きな意味を持ちます。
GPT-4o-miniはトークンあたりのコストが安いものの、その小さいサイズのため、望ましい精度を達成するにはより多くの試行やより詳細なプロンプトが必要になる可能性があり、結果として総トークン消費量が増加する可能性があります。GPT-4oが1回の試行で正解を得られるタスクでも、GPT-4o-miniは3回必要とする場合、全体のコストは同程度か、それ以上になる可能性があります。さらに、小さなリクエストを多く送信する必要がある場合、APIコールのオーバーヘッドによってレイテンシが増加することはあっても、直接的なコストは増加しません。キャッシュは適用されず、各リクエストは新たに処理されます。両方のモデルでユースケースを評価し、最適なコストパフォーマンスのバランスを判断してください。OrcaRouterはボリュームディスカウントなしで一貫した価格設定を提供します。
OrcaRouterはプロンプトキャッシングを実装していません。GPT-4o-miniへのリクエストはすべてOpenAIのサーバーに送信され、トークン単位で課金されます。繰り返しのプロンプトに対する割引料金はありません。ワークロードで同一のシステムメッセージや長いコンテキストが頻繁に繰り返される場合、同じプロンプトを再送信しないよう、応答を自分の側で保存することを検討してもよいでしょう。一部のプロバイダーはプロンプトキャッシングの割引を提供していますが、OrcaRouterを通じては標準のプロバイダー料金を支払います。これは透明性があり、予測可能です。キャッシングがないため価格設定はシンプルですが、冗長なトークン使用を最小限に抑えるようにクエリを設計する必要があることを意味します。
(注記:GPT-4o-miniの他のバリアントは提供されていません。質問は、Claude 3 HaikuやGemini Flashなどの他のミニモデルとの比較についてであると想定されていますが、事実のみが提供されています。代わりに、GPT-4oと比較します。)GPT-4oと比較すると、GPT-4o-miniは劇的に安価です:入力トークン100万あたり$0.15対$2.50(94%安い)、出力トークン100万あたり$0.60対$10(94%安い)。多くのユーザーは、GPT-4o-miniがタスクの80~90%で十分であり、大幅なコスト削減を実現できると感じています。ただし、最大の精度を必要とするタスク(例:複雑なコード生成、微妙な法的推論)では、コスト削減が品質の低下を正当化しない可能性があります。OrcaRouterを使用すると、同じAPIエンドポイントでモデルIDを変更するだけで、モデルを簡単に切り替えることができます。
OpenAIクライアントライブラリまたは任意のHTTPクライアントを使用し、ベースURLを https://api.orcarouter.ai/v1 に設定してください。モデルパラメータは "openai/gpt-4o-mini" に設定します。認証にはOrcaRouter APIキーが必要です。最小限のPython例: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) すべてのOpenAI APIパラメータ(temperature、max_tokens、stream、toolsなど)がサポートされています。OrcaRouterはリクエストをOpenAIにプロキシし、レスポンスをそのまま返します。
標準のOpenAI Chat Completionsパラメータ: model (必須: "openai/gpt-4o-mini"), messages (メッセージオブジェクトの配列), temperature (0~2, デフォルト1), top_p (0~1, デフォルト1), n (応答数, デフォルト1), stream (ブール値), stop (文字列/配列), max_tokens (最大16384), presence_penalty, frequency_penalty, logit_bias, user (オプション), および関数呼び出し用のtools。Visionの場合、messagesに画像コンテンツを含めてください (type "image_url" または detail付きの "image_url")。ファイル入力はBase64エンコード可能です。OrcaRouterはすべてのパラメータをOpenAIに渡します。注意: レスポンス形式 (JSONモード) がサポートされています。適切な場合、response_format={ "type": "json_object" } を設定してください。
移行は簡単です。クライアントのベースURLを "https://api.openai.com/v1" から "https://api.orcarouter.ai/v1" に変更し、APIキーをOrcaRouterのキーに置き換えてください。モデル名を "openai/gpt-4o-mini" に更新します("gpt-4o-mini" のままにするか? 実際にはモデルIDが "openai/gpt-4o-mini" とされているので、そちらを使用してください)。その他のコードはすべて変更不要です。APIは完全にOpenAI互換だからです。複数のモデル文字列を保持し、コストや機能に基づいてルーティングすることもできます。OrcaRouterは応答形式を変更しません。数回のクエリでテストし、ヘッダーやストリーミングが期待通りに動作することを確認してください。
はい、GPT-4o-miniはサーバー送信イベント(SSE)を介したストリーミングをサポートしています。リクエストにstream=trueを設定してください。応答はデルタコンテンツを含む一連のチャンクとして返されます。これにより、ユーザーの初回トークンまでの時間が短縮され、リアルタイム表示が可能になります。OrcaRouterはストリーミング応答をそのまま転送します。なお、課金される総トークン数は変わりません。ストリーミングはすべての入力モダリティ(テキスト、画像、ファイル)と互換性があります。また、ストリーミングと関数呼び出しを組み合わせることもでき、適切な場合にモデルはツール呼び出しチャンクをストリームします。max_tokensパラメータは応答全体に適用されます。
GPT-4o-mini は GPT-4o の小型で低価格な兄弟モデルです。入力トークンと出力トークンの両方で約94%安価です。同じ128Kのコンテキストウィンドウと16Kの最大出力を持ちます。同じマルチモーダル入力をサポートしていますが、複雑な推論や創造的なタスクでは一般的に若干精度が低くなります。MATH-500では、GPT-4o-miniは78.9点、GPT-4oは92点以上(概算)です。カスタマーサポート、要約、簡単な画像認識などの日常的なタスクの多くでは、GPT-4o-miniで十分です。最高のパフォーマンスが必要で、高いレイテンシーとコストを許容できる場合は、GPT-4oを選択してください。
Claude 3 HaikuやGemini 1.5 Flashのようなモデルとの比較:GPT-4o-miniは128Kのコンテキストウィンドウを提供する一方、Haikuは200K、Flashは1Mを可能にします。価格は類似しています(Haiku $0.25/$1.25 per 1M tokens、Flash $0.35/$1.05)。GPT-4o-miniのMATH-500スコア78.9は競争力があります。Haikuは同様の数学ベンチマークで約73、Flashは約78のスコアです。マルチモーダル入力については、3つすべてが画像を受け付けます。GPT-4o-miniは価格帯に対して推論品質が優れているかもしれませんが、コンテキストウィンドウは一部の競合他社よりも小さいです。最適な選択は、特定のレイテンシ、コスト、品質要件に依存します。OrcaRouterはHaikuとFlashへのアクセスも提供し、横並び比較を可能にします。
GPT-3.5-turbo は古く、16K のコンテキストウィンドウを持ち、コストはわずかに低い(入力 1M あたり $0.50、GPT-4o-mini は $0.15)。実際には GPT-3.5-turbo-0125 は $0.50/$1.50 だが、コンテキストが小さい。提供された価格に基づくと、GPT-4o-mini はトークンあたりのコストが安く、より大きなコンテキストとマルチモーダル入力を提供する。したがって、ほとんどのタスクにおいて GPT-4o-mini の方が優れている。ただし、すでに GPT-3.5-turbo を使用している一部のレガシーアプリケーションでは、最小限の変更が必要かもしれない。GPT-4o-mini は推論ベンチマークでも優れたパフォーマンスを示す。レイテンシが非常に重要であるか、GPT-3.5 モデルをファインチューニングしている場合を除き、GPT-4o-mini が推奨されるドロップインアップグレードである。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| 入力 / 1M tokens | $0.150 |
| 出力 / 1M tokens | $0.600 |
| キャッシュ読み取り / 1M | $0.075 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
@misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini