GPT-4o mini 是 OpenAI 继 [GPT-4 Omni](/models/openai/gpt-4o) 之后的最新模型,支持文本和图像输入,输出文本。作为其最先进的小型模型,它的性价比要高得多……
GPT-4o-mini 是 OpenAI GPT-4o 模型的一个更小、更快的变体,专为降低计算成本而优化,同时保留多模态能力。它可以处理文本、图像和上传的文件作为输入,生成文本输出。该模型由 OpenAI 托管,可通过 OrcaRouter 兼容 OpenAI 的 API 访问,基础 URL 为 https://api.orcarouter.ai/v1,使用模型标识符…
GPT-4o-mini 在广泛的语言任务中表现出色,包括摘要、翻译、分类和问答。它支持结构化 JSON 输出、函数调用和工具使用,能够与外部 API 和数据库集成。128K 的上下文窗口使其能够处理大型文档或对话历史,以进行连贯的分析。它在常见基准测试中表现良好(MATH-500 得分为 78.9),适用于教育数学问题、代码解释和数据提取。对于较简单的任务,GPT-4o-mini 通常以较低的成本达到与更大模型相当的性能。然而,对于需要深厚领域专业知识或高度创造性输出的任务,其质量可能不如 GPT-4o。
图像可以通过URL或base64编码的数据在API请求中提供。模型能够解读图像,理解视觉内容,如物体、图像中的文字以及空间关系。这支持了视觉问答、图表解读和手写数字识别等应用场景。图像会消耗上下文限制的token,因此高分辨率或大尺寸图像会占用更多128K token预算。模型本身不生成图像,仅处理图像。对于需要精细视觉细节的任务(如医学影像),专用视觉模型可能更准确,但GPT-4o-mini以合理成本提供了通用解决方案。
GPT-4o-mini 除了文本和图片外,还支持上传文件。常见的文件类型包括 PDF、.docx、.txt、.csv 和 .json。模型会提取文件中的文本及相关视觉元素(如果文件包含嵌入图片),并将其作为上下文的一部分进行处理。这对于分析研究论文、法律合同或电子表格非常有用,无需手动复制。请注意,文件内容会消耗 token;例如,一份 50 页的 PDF 可能消耗数千个 token。OrcaRouter 根据总输入 token(包括文件产生的 token)计费。除 token 消耗外,不收取额外的文件处理费用。
如果工作负载仅涉及文本,不包含图片或文件,且所需上下文低于16K tokens,那么较小的模型(如GPT-3.5-turbo)可能提供更低的每token成本。同样,对于简单分类或琐碎问答这类极高吞吐量的任务,专用的微调模型可能更经济。GPT-4o-mini在多模态或长上下文场景中具有成本效益,但其优势在于平衡性能与价格。如果你的应用能够接受较慢的响应或为追求最高准确度而承担更高成本,GPT-4o是一种替代选择。请针对你的具体任务进行基准测试,以确认哪个模型能满足你的质量和预算门槛。
MATH-500是MATH基准测试的一个子集,包含500道竞赛级别的数学问题,涵盖代数、几何、数论和概率。78.9的分数表明GPT-4o-mini正确回答了约78.9%的问题。对于一个较小的模型来说,这是一个强劲的成绩,反映了其数学推理能力。它超越了众多先前类似规模的模型。然而,在特定问题领域上的表现可能有所不同。该基准测试在零样本条件下进行,即不提供任何示例。在实际的数学辅导中,可能需要仔细设计提示词,才能正确处理多步骤解答。
虽然唯一提供的基准测试是MATH-500,但广泛公开的信息表明,GPT-4o-mini在MMLU(大规模多任务语言理解)、HellaSwag和GSM8K上也具有竞争力。在这些指标上,它通常低于GPT-4o但高于GPT-3.5-turbo。在推理基准测试中,就其参数量而言,它表现出色。在创意写作或开放生成任务中,其输出连贯,但可能缺乏更大模型的细腻度。延迟通常低于GPT-4o,因此适用于实时应用。具体分数请参考OpenAI的文档。OrcaRouter提供访问服务,且无需额外加价。
延迟取决于请求复杂度、token数量和API负载。GPT-4o-mini设计为快速响应——对于中等长度的提示,通常在不到一秒内返回第一个token。对于长文档(如50K tokens),延迟会随模型处理完整上下文而增加。OrcaRouter不改变速度;您将体验到与直接调用OpenAI API相同的响应时间。支持流式传输以减少感知延迟。对于延迟敏感的应用,建议保持提示简短并使用流式传输。精确的首token时间可通过监控响应时间测量;不提供具体的服务等级协议(SLA)。
尽管GPT-4o-mini具备一定能力,但由于模型规模较小,存在局限性。在复杂的多步推理任务中,其答案的准确性可能低于GPT-4o。它有时会误解细微的指令,或在极长输出中难以保持完美的连贯性。其多模态理解能力不错但并非无懈可击,可能会遗漏图像中的微小细节或计数出错。模型可能继承训练数据中的偏见。它不支持联网搜索或实时数据访问,除非经过专门微调以使用工具。对于需要高精度的任务(如法律建议、医疗诊断),人工审核至关重要。基准测试分数反映的是受控环境下的表现,实际应用效果可能有所差异。
OrcaRouter 以零加价方式传递 OpenAI 的精确定价:每100万个输入令牌0.15美元,每100万个输出令牌0.60美元。输入令牌包括所有文本、图像令牌和文件内容。输出令牌为生成的文本。没有月费或隐藏费用。对于具有128K上下文窗口的多模态模型而言,这是每令牌成本最低的之一。作为对比,GPT-4o 的成本为每100万输入令牌2.50美元,每100万输出令牌10美元,这使得 GPT-4o-mini 在输入和输出上分别便宜94%。对于高流量应用,这一成本优势非常显著。
尽管GPT-4o-mini每token便宜,但其较小的规模可能需要更多尝试或更详细的提示才能达到所需准确性,从而可能增加总token消耗量。对于GPT-4o一次尝试就能得到正确答案而GPT-4o-mini需要三次的任务,总体成本可能相似甚至更高。此外,如果需要提交大量小请求,API调用的开销可能会增加延迟,但不会直接增加成本。不应用缓存;每个请求都是全新处理的。使用两种模型评估您的用例,以确定最佳性价比平衡。OrcaRouter提供一致的定价,没有批量折扣。
OrcaRouter 不实现提示缓存。每次向 GPT-4o-mini 发出的请求都会发送到 OpenAI 的服务器并按 token 计费。重复的提示没有折扣价。如果您的工作负载经常重复相同的系统消息或冗长的上下文,您可以考虑在本地存储响应,以避免重复提交相同的提示。一些提供商提供提示缓存折扣,但通过 OrcaRouter,您需要支付标准提供商费率。这是透明且可预测的。缺少缓存简化了定价,但意味着您应该设计查询以最小化冗余 token 的使用。
(注:未提供GPT-4o-mini的其他变体。假设问题是在与其他小模型如Claude 3 Haiku或Gemini Flash进行比较,但仅提供事实。因此,这里与GPT-4o进行比较。)与GPT-4o相比,GPT-4o-mini的成本大幅降低:每100万输入token的价格为0.15美元对2.50美元(便宜94%),每100万输出token的价格为0.60美元对10美元(便宜94%)。许多用户发现GPT-4o-mini足以应对80-90%的任务,可节省大量成本。然而,对于需要最高准确度的任务(例如复杂代码生成、细致的法律推理),成本节省可能无法弥补质量下降。OrcaRouter允许您通过相同的API端点轻松切换模型,只需更改模型ID。
使用 OpenAI 客户端库或任何 HTTP 客户端,将基础 URL 指向 https://api.orcarouter.ai/v1。将模型参数设置为 "openai/gpt-4o-mini"。认证需要 OrcaRouter API 密钥。一个最小的 Python 示例: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) 支持所有 OpenAI API 参数,包括 temperature、max_tokens、stream 和 tools。OrcaRouter 将请求代理到 OpenAI,并原样返回响应。
标准 OpenAI Chat Completions 参数:模型(必填:"openai/gpt-4o-mini")、消息(消息对象数组)、temperature(0-2,默认1)、top_p(0-1,默认1)、n(响应数量,默认1)、stream(布尔值)、stop(字符串/数组)、max_tokens(最多16384)、presence_penalty、frequency_penalty、logit_bias、user(可选),以及用于函数调用的 tools。对于视觉功能,在消息中包含图像内容(类型为 "image_url" 或带有详情的 "image_url")。文件输入可以是 base64 编码。OrcaRouter 将所有参数传递给 OpenAI。注意:支持响应格式(JSON 模式);适当时设置 response_format={ "type": "json_object" }。
迁移很简单:将客户端的基础 URL 从 "https://api.openai.com/v1" 改为 "https://api.orcarouter.ai/v1",并将您的 API 密钥替换为 OrcaRouter key。将模型名称更新为 "openai/gpt-4o-mini"(或者保留为 "gpt-4o-mini"?实际情况是模型 ID 为 "openai/gpt-4o-mini",因此请使用该名称)。其他所有代码保持不变,因为 API 完全兼容 OpenAI。您还可以保留多个模型字符串,并根据成本或能力进行路由。OrcaRouter 不会更改响应格式。测试几个查询以确保标头和流式传输正常工作。
是的,GPT-4o-mini 支持通过服务器发送事件(SSE)进行流式传输。在请求中设置 stream=true。响应将包含一系列包含增量内容的块。这减少了用户的首令牌时间,并支持实时显示。OrcaRouter 会原样转发流式响应。请注意,计费的总令牌数保持不变。流式传输兼容所有输入模态(文本、图像、文件)。您还可以将流式传输与函数调用结合使用;模型会在适当时流式传输工具调用块。max_tokens 参数应用于整个响应。
GPT-4o-mini 是 GPT-4o 更小、更便宜的版本。它在输入和输出 token 上成本降低约 94%。它拥有相同的 128K 上下文窗口和 16K 最大输出,支持相同的多模态输入,但在复杂推理和创意任务上通常准确度略低。在 MATH-500 测试中,GPT-4o-mini 得分为 78.9,而 GPT-4o 得分约为 92+。对于许多日常任务,如客户支持、摘要和简单视觉处理,GPT-4o-mini 已经足够。当你需要顶级性能并能接受更高延迟和成本时,请选择 GPT-4o。
与Claude 3 Haiku或Gemini 1.5 Flash等模型对比:GPT-4o-mini提供128K上下文窗口,而Haiku支持200K,Flash支持1M。定价相近(Haiku每百万token $0.25/$1.25;Flash $0.35/$1.05)。GPT-4o-mini的MATH-500得分为78.9,具有竞争力;Haiku在类似数学基准测试中约73分,Flash约78分。多模态输入方面,三者均支持图像。以该价格点而言,GPT-4o-mini的推理质量可能更优,但上下文窗口小于部分竞品。最佳选择取决于具体延迟、成本和质量需求。OrcaRouter也提供对Haiku和Flash的访问,支持并排比较。
GPT-3.5-turbo是较旧的模型,具有16K上下文窗口,成本略低(每100万输入令牌0.50美元,而GPT-4o-mini为0.15美元?实际上GPT-3.5-turbo-0125的成本为0.50/1.50美元,但上下文较小。根据提供的定价,GPT-4o-mini每个令牌更便宜,提供更大的上下文和多模态输入。因此,对于大多数任务,GPT-4o-mini更优越。然而,一些已经在使用GPT-3.5-turbo的遗留应用程序可能只需要最小的更改。GPT-4o-mini在推理基准测试中也表现更好。除非延迟极其关键,或者您已经微调了GPT-3.5模型,否则GPT-4o-mini是推荐的直接升级。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| 输入 / 1M tokens | $0.150 |
| 输出 / 1M tokens | $0.600 |
| 缓存读取 / 1M | $0.075 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini