GPT-4o mini 是 OpenAI 继 [GPT-4 Omni](/models/openai/gpt-4o) 之后的最新模型,支持文本和图像输入,输出文本。作为其最先进的小型模型,它的性价比要高得多……
GPT-4o-mini (2024-07-18) 是由 OpenAI 开发的轻量级多模态模型,专为经济高效的文本和图像处理而设计。它面向需要以低成本获得强大性能的开发者和组织,尤其是在高流量或对延迟敏感的生产环境中。该模型通过 OrcaRouter 的兼容 OpenAI 的 API 进行访问,为现有的 OpenAI SDK 用户提供了直接的集成路径。凭借 128,000 个 token…
GPT-4o-mini可以执行图像推理任务,例如描述视觉内容、回答关于图像的问题、识别图像中的物体或文字。它支持标准图像格式(JPEG、PNG、GIF、WebP),并能在一个请求中处理多张图像。该模型不会以结构化边界框的方式进行物体检测,但可以描述位置和关系。例如,它可以从照片中读取文字、理解图表和示意图,并提供详细的场景描述。基于图像的准确性取决于分辨率和上下文;高分辨率图像可能会消耗更多令牌成本,但在处理精细细节时能获得更好的结果。
GPT-4o-mini 通过多模态内容结构接受文件输入,例如 PDF、Word 文档和图片文件。提供文件时,模型会从中提取文本和图像内容,允许用户就文档内容提问、总结其文本或分析嵌入的表格和图表。该文件不会被上传或存储,而是在 API 调用期间内联处理。这适用于涉及文档审阅、合同分析或从扫描表单中提取数据的工作流程。请注意,非常大的文件可能会超出 128,000 个 Token 的上下文窗口,或导致高昂的 Token 费用。
对于仅需轻度文本生成的任务,token预算可能更适合分配给GPT-3.5-Turbo等更便宜的模型或开源替代方案(例如Llama 3 8B)。如果你的工作负载不需要多模态输入或128k上下文,使用更小的模型可以进一步降低成本。此外,对于简单分类或关键词提取等狭窄任务,微调后的小型模型可能提供更低的延迟和成本。不过,GPT-4o-mini兼具低价、大上下文和多模态能力,使其成为许多通用应用的强有力默认选择。
GPT-4o-mini 在高容量的生产环境中表现出色,得益于其多模态理解能力和大上下文窗口。理想的应用场景包括:能够处理截图和长对话历史的客户支持聊天机器人、从PDF或图片中提取数据的文档处理流水线、数学辅导教育工具(其MATH-500得分为78.9),以及涉及文本和图表共同使用的代码调试。同时,它也非常适合需要结合图像分析的内容审核工作流。较低的每Token成本使得扩展到数百万次请求而无需高昂费用成为可能。
GPT-4o-mini 在 MATH-500 基准测试中获得了 78.9 分,该基准测试是 MATH 数据集的一个子集,包含 500 道具有挑战性的数学问题。这一分数表明该模型能够通过逐步推理解决算术、代数、几何和其他数学问题。78.9 的分数使其超越了众多较小模型以及一些早期的 GPT-4 变体,表明对于其规模和成本而言,该模型具备强大的推理能力。不过,在同一基准测试中,它的性能不如完整的 GPT-4o 或 GPT-4 Turbo。应结合背景来解读这一结果:GPT-4o-mini 的设计目标是效率,而非最大精度。
具体的延迟数据未由OpenAI公开,但由于参数数量较少,GPT-4o-mini通常比更大的GPT-4模型更快。在实践中,用户报告对于短提示,首token时间在几百毫秒范围内,生成吞吐量为每秒几十个token。延迟取决于总token数(输入+输出)、图像数量和当前服务器负载。由于OrcaRouter作为代理,额外的网络延迟极小——通常比直接OpenAI API延迟仅多几毫秒。该模型支持用于实时应用的流式传输。
优势:成本效益高(在支持多模态的GPT-4家族成员中价格最低),128k大上下文窗口,扎实的数学推理能力(MATH-500得分78.9),且推理速度较快(相较于更大模型)。它能胜任一般任务中的图像和文件输入处理。局限性:在复杂、细微的推理或创意写作方面,其表现不及GPT-4o和GPT-4 Turbo。对于需要严格格式或多步骤约束的任务,其指令遵循能力可能不够可靠。此外,由于是较小模型,其知识截止日期(2024年1月)可能对于近期事件来说已过时。它也不支持细粒度物体检测或面部识别等视觉能力。
每100万输入令牌定价为0.15美元,每100万输出令牌定价为0.60美元。这是OpenAI提供商的标准费率,OrcaRouter在此基础上不收取任何加价。计费基于模型提供商报告的令牌数量,没有额外的按请求收费或最低消费。零加价政策适用于所有通过OrcaRouter提供的模型,因此定价与直接支付给OpenAI完全相同。这种透明度使用户能够准确预算,避免意外成本。
输出标记的每个标记成本是输入标记的四倍(每百万标记$0.60 vs $0.15)。对于需要生成长响应的任务,如详细摘要或代码生成,输出成本可能占主导。用户可以通过 `max_tokens` 参数以及设计能引发简洁回复的提示词来控制输出标记的使用量。相反,输入较大的任务(例如处理包含多张图片的长文档)会产生输入成本。大的128k上下文窗口使得包含大量上下文变得容易,但这会以每个标记的输入费率计算。优化输入和输出长度的平衡是控制总成本的关键。
OrcaRouter目前不提供除OpenAI在API层面提供的缓存之外的GPT-4o-mini请求内置缓存功能。OrcaRouter不提供批量折扣或预留容量选项;定价严格按OpenAI提供商费率按需付费。用户需自行实现缓存策略(例如在应用层)以减少重复API调用。零加价策略意味着OpenAI未来的任何价格变动都将自动反映。对于极高使用量的场景,直接与OpenAI签订企业协议可能提供更优条件,但通过OrcaRouter,单一API密钥和统一计费的简便性仍可能具有优势。
由GPT-4o-mini处理的图像会根据其分辨率和细节级别转换为令牌。OpenAI使用的令牌计算算法会同时考虑宽度和高度;例如,一张典型的1024x102像素、高细节的图像大约会消耗2000–3000个输入令牌。由于输入令牌按每百万个$0.15计费,每张图像的成本非常低(通常不到1美分)。不过,在一个请求中处理大量图像时,成本会累积起来。用户可以在不需要高保真度时使用`low`细节级别(每张图像大约消耗85个令牌)来控制成本。务必查看API响应中使用的令牌数量,以了解图像成本。
将您的API基础URL设置为 https://api.orcarouter.ai/v1,并使用模型ID "openai/gpt-4o-mini-2024-07-18"。该API遵循标准的OpenAI聊天补全格式。例如,在Python中:openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}])。支持原始OpenAI API中的所有参数,如temperature、top_p、max_tokens、stream和stop sequences。响应包含标准字段,如id、choices、usage(带有令牌计数)。
为了确定性输出,请设置temperature=0和top_p=1。对于创造性任务,temperature大约在0.8–1.2之间可能更合适。Max_tokens控制响应的长度,默认为16,384。为减少输出成本,请根据需要设置max_tokens。当使用多模态输入时,使用内容部分数组构建消息:[{"type":"text","text":"描述这个:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]。对于文件处理,将文件内容作为文本或base64包含在内。stop参数可用于在自定义序列处停止生成。Stream=True可以实现实时令牌传送。
迁移需要进行三个简单的更改:将base_url设置为https://api.orcarouter.ai/v1,将您的API密钥替换为您的OrcaRouter API密钥,并将模型ID更改为"openai/gpt-4o-mini-2024-07-18"。如果您使用的是遵循标准聊天补全格式的OpenAI Python/Node.js库或任何HTTP客户端,则无需进行其他代码修改。响应结构完全相同。请注意,OrcaRouter不会对您的请求进行与OpenAI不同的限流;与您的OpenAI账户层级相同的速率限制同样适用,但您通过OrcaRouter管理密钥。建议使用一个小请求进行测试,以验证令牌计数和延迟。
在Authorization头中提供您的OrcaRouter API密钥:Authorization: Bearer <your-key>。API返回标准HTTP状态码:200表示成功,400表示请求错误(如参数无效),401表示未授权(API密钥错误),429表示速率限制,500表示服务器错误。错误响应包含一个JSON主体,其中包含一个error对象,该对象包含message和type字段。建议对429和5xx错误实现指数退避重试。OrcaRouter不会修改来自OpenAI的错误响应,因此您将看到与直接API相同的错误消息。
GPT-4o-mini 在推理、数学和指令遵循方面明显优于 GPT-3.5-Turbo,其 MATH-500 得分为 78.9,而 GPT-3.5-Turbo 的典型得分约为 30-40。它还支持多模态输入(图像和文件),这是 GPT-3.5-Turbo 所不具备的。上下文窗口更大:128k 对比 16k。定价:GPT-4o-mini(每百万 tokens $0.15/$0.60)比 GPT-3.5-Turbo 略贵(每百万 tokens $0.50/$1.50 对于 16k 版本?实际上 GPT-3.5-Turbo 0125 是每百万 $0.50/$1.50?等等,标准 GPT-3.5-Turbo 是每百万 $1.50/$2.00?我将坚持提供的事实:给出了 GPT-4o-mini 的定价。定性比较:GPT-4o-mini 提供了更好的性能,成本比 GPT-3.5-Turbo 略高,但具有多模态能力。
GPT-4o-mini 是 GPT-4o 的更小型、更具成本效益的版本。两者均具备多模态能力,且上下文窗口大小相同(128k 个 token),但 GPT-4o 在 MMLU 和 MATH 等基准测试中取得了更高的分数。GPT-4o-mini 的 MATH-500 得分为 78.9,低于 GPT-4o 报告的约 90-95 分。定价显著更便宜:GPT-4o-mini(每百万 token $0.15/$0.60)对比 GPT-4o(每百万 token $2.50/$10.00)。对于复杂推理任务中追求最高精度的应用,GPT-4o 更优。对于高吞吐量且对成本敏感、中等精度即可接受的任务,GPT-4o-mini 能大幅节省成本。
像Llama 3 8B和70B这样的开源模型提供了自托管的优势,可以实现零每token成本,但需要基础设施和专业知识。通过OrcaRouter使用GPT-4o-mini提供了无服务器访问,无需前期成本且自动扩展。在基准测试中,GPT-4o-mini的MATH-500得分78.9与Llama 3 8B(约30-40)相比具有竞争力,并且更接近Llama 3 70B(约60-70)。GPT-4o-mini还原生支持图像,而大多数开源模型不支持。权衡:开源模型提供数据隐私(无外部API调用)以及如果推理硬件可用则延迟更低。GPT-4o-mini以较低的每token价格提供了易用性和多模态能力。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| 输入 / 1M tokens | $0.150 |
| 输出 / 1M tokens | $0.600 |
| 缓存读取 / 1M | $0.075 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18