OpenAI GPT-4.1 Mini:成本高效的推理,具备1M上下文、图像输入和出色的MATH-500得分
该模型是OpenAI GPT-4.1系列的缩小版本,具体发布于2025年4月14日。其设计旨在以远低于全尺寸GPT-4.1模型的成本,提供强大的推理和指令跟随性能。该模型接受文本、图像和文件作为输入,具备多模态能力。用户可通过OrcaRouter的兼容OpenAI API进行访问,该API将请求路由至OpenAI的基础设施,且不提供商家的每token定价加价。
它擅长处理结合推理与大量上下文的复杂任务,例如文档分析、长文档摘要、代码理解以及复杂的多步骤指令。其在MATH-500基准测试中获得92.5的高分,表明它在数学问题解决方面表现出色。该模型还能处理图像相关任务,如描述图片、从照片中提取文字(OCR)以及解答有关视觉内容的问题。通过文件上传功能,它可以处理PDF、电子表格及其他结构化数据。
当任务需要强大的推理能力、极大的上下文窗口或多模态能力时,应选用此模型。更便宜的模型(例如,GPT-4.1 mini本身已属于廉价选项;但与更小的模型如GPT-3.5 Turbo相比)可能在数学、逻辑或长程依赖上缺乏所需精度。如果您的应用需要完整的100万token上下文或需要解释图像,此模型非常合适。对于简单的文本分类或简短回复,更轻量的模型可能更具成本效益。
考虑迁移到GPT-4.1(完整版)或GPT-4o,如果你的任务需要在极其复杂的推理上近乎完美的准确性,例如高级定理证明、带有细微差别的法律文件解读,或要求深度风格一致性的创意写作。迷你变体有时可能会在边缘案例或遵循高度特定的格式化指令时产生不够精确的输出。此处未提供更广泛测试(例如MMLU)的基准分数,但作为迷你模型,它可能在某些推理领域不如全尺寸旗舰模型。
图像的分词和处理方式与GPT-4o类似,但底层模型更小。该模型可以描述图像内容、回答关于视觉元素的问题,并从图像中提取文本。文件处理方式为提取文本内容(针对PDF或DOCX等文档),或将其视为图像(如果包含扫描页面)。该模型不支持视频或音频输入。对于文件密集型工作流,大上下文窗口允许在单个提示中包含大量页面或图像。
该模型在MATH-500基准测试中获得了92.5分,该测试涵盖了不同难度级别的数学推理能力。这是一个优异的成绩,尤其对于小型模型而言,表明它在代数、几何、微积分及其他数学主题上具有高精度。MATH-500是MATH数据集的一个子集。作为参考,许多更大的模型得分在90分出头到中间区间,因此这一表现在成本和模型规模上具有竞争力。
未提供通用推理(如MMLU、GSM8K)的直接基准测试,但根据MATH-500的结果,该模型在数学推理方面的表现可能仅比更大的GPT-4变体低几个百分点。在需要深度常识或创造性推理的任务上,较大的模型通常保持优势。用户应使用自己的数据集进行评估,以确定该微型变体是否满足精度要求。其代价是显著降低的成本和延迟。
未提供确切的延迟数据,但作为较小模型,openai/gpt-4.1-mini-2025-04-14 的响应速度通常快于其完整版。它针对高吞吐量和低单次请求时间进行了优化,尤其适用于较短输出。对于长文本生成任务(接近32K最大输出),延迟可能仍然明显,但应低于完整版GPT-4.1。网络和队列时间取决于OrcaRouter的基础设施和当前负载。
该模型并非在所有类别中都是顶尖表现者。它在应对高度微妙或模糊的指令时可能会遇到困难,其知识截止日期隐含地与发布日期(2025年4月14日)相关联。该模型不适合在没有人类监督的情况下做出安全关键决策。此外,作为迷你模型,其参数比完整版本更少,因此在处理罕见或高度专业化的话题时,输出可能不够自信。当用户使用超长上下文时,模型对早期token的召回可能会略有下降。
OrcaRouter 采用精确的提供商费率,无任何加价:每百万输入令牌 0.40 美元,每百万输出令牌 1.60 美元。输入令牌包括完整提示文本、任何图像令牌化及文件文本。输出令牌仅计完成令牌。无额外按请求收费或隐藏成本。这种透明定价便于估算大规模应用的成本。
由于OrcaRouter不收取任何额外费用,您只需支付OpenAI的原始费用。这对于高用量用户尤为有利,因为其他中间商可能会对其加价。定价公开且稳定,流式处理或批量处理均无附加费用。请注意,您的总账单还会受到图像或文件分词开销的影响,这部分会增加输入token数。
完整的 GPT-4.1 模型(若可用)定价可能更高,每 token 费用通常是其他模型的数倍。mini 版本提供了更低的价格,同时在许多任务上依然保持强劲性能。例如,与 GPT-4o 相比,GPT-4.1 mini 通常更便宜,尽管此处未提供其他模型的具体定价。如果你能接受在部分任务上略微降低准确度,mini 模型可以大幅降低月度成本。文中未提及缓存折扣,因此用户应假设采用标准的按 token 计费方式。
向 https://api.orcarouter.ai/v1/chat/completions 发送请求,并将模型参数设置为 "openai/gpt-4.1-mini-2025-04-14"。该 API 完全兼容 OpenAI,因此您可以使用相同的 SDK(例如 openai Python 库、Node.js),只需修改 base URL。需要通过 API 密钥进行身份验证。示例:openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; 然后调用 openai.ChatCompletion.create,其中 model="openai/gpt-4.1-mini-2025-04-14"。
所有标准的OpenAI参数均受支持:temperature、top_p、max_tokens、n、stop、presence_penalty、frequency_penalty 以及 logit_bias。图像输入可通过 content 数组以 type 为 "image_url" 的形式提供。对于文件上传,您可以包含文件ID(如果使用 OrcaRouter 的文件API)或直接嵌入文件文本。max_tokens 参数不得超过 32,768。设置 stream=true 可支持流式传输。响应格式与 OpenAI 的 Chat Completion 结构一致。
如果您当前直接使用OpenAI的API,迁移到OrcaRouter只需更新基础URL和API密钥。如果您使用其他模型网关,请检查您的请求格式是否与OpenAI的架构匹配。OrcaRouter不需要任何供应商特定的头部或封装。对于使用openai Python库的现有代码库,请将openai.api_base更改为OrcaRouter端点。确保您拥有一个有效的OrcaRouter账户和API密钥。无需其他代码更改。
完整的GPT-4.1模型预计在各项基准测试中均能取得更高分数,尤其在通用知识和复杂推理方面表现更优。但其成本可能更高、速度也更慢。而mini变体则为大多数实际任务提供了优越的性价比,通过牺牲几个百分点的准确率,换取了显著更低的延迟和每token成本。mini版同样拥有100万token上下文窗口和多模态能力,因此差异主要在于原始智能水平和输出质量。
GPT-4o 是一款旗舰多模态模型,具备更广泛的能力,包括音频和实时视频处理。GPT-4.1 mini 则来自后续版本(2025 年 4 月),侧重于效率,并非完整的后续迭代。在没有直接基准比较的情况下,可以合理推断 GPT-4o 在大多数任务上优于 mini 版本,但 mini 可能成本更低、速度更快。选择取决于你需要 GPT-4o 的额外能力,还是能接受 mini 在性能上的权衡。
Claude Haiku是Anthropic推出的快速、低成本模型,目标类似。两者都拥有大上下文窗口(Haiku有20万tokens,而本模型有100万)。MATH-500得分92.5表明其数学推理能力具有竞争力。在没有并排基准测试的情况下,用户应根据自己的具体任务对两者进行评估。本模型直接支持图像输入,而Haiku也支持图像。定价可能有所不同;本模型每百万输入0.40美元,相对较低。偏好可能取决于生态系统和风格。
GPT-3.5 Turbo 是一款较旧、更便宜的模型,推理能力较弱,且不支持原生图像。GPT-4.1 mini 模型是一次重大升级:它支持图像,拥有更大的上下文窗口(1M 对比 16K),并在数学基准测试中得分远高于前者。GPT-3.5 Turbo 仍适用于非常简单、高并发的任务,即使 mini 版本的成本也显得过高时,但对于任何需要细致理解的任务,此模型都远胜一筹。如果你目前正在使用 GPT-3.5 Turbo,建议升级到此模型以获得更准确的输出。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4.1-mini-2025-04-14",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| 输入 / 1M tokens | $0.400 |
| 输出 / 1M tokens | $1.60 |
| 缓存读取 / 1M | $0.100 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_gpt_4_1_mini_2025_04_14,
title = {openai/gpt-4.1-mini-2025-04-14 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4.1-mini-2025-04-14}
}openai. (n.d.). openai/gpt-4.1-mini-2025-04-14 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4.1-mini-2025-04-14