GPT-4o mini Search Preview 是一个专为聊天补全中的网页搜索而设计的专用模型。它经过训练,能够理解并执行网页搜索查询。
GPT-4o-mini Search Preview 是 OpenAI 的 GPT-4o-mini 模型的一个变体,内置了网络搜索功能。它旨在提供融合互联网实时信息的答案,适用于依赖当前事件、实时数据或近期更新的查询。该模型保留了基础 GPT-4o-mini 架构,但增加了一个搜索预览层,可自动检索和处理网页内容以辅助生成回复。该模型支持 128,000 个 token…
该模型将通用语言理解与生成能力与实时网络搜索相结合。它可以回答关于近期事件的问题,从特定网站提取数据,并综合多个在线来源的信息。它保留了典型的GPT-4o-mini能力:文本摘要、翻译、代码生成、逻辑推理和创意写作。搜索预览增加了获取最新新闻、股票价格、天气、产品详情以及其他时效性数据的功能。然而,由于该模型针对速度和效率进行了优化,其推理深度可能低于完整的GPT-4o模型。
该模型在答案依赖于变化或最新信息的场景中表现出色。例如,需要查看订单状态或退货政策的实时客服代理、生成热门话题摘要的内容工具,以及从多个在线来源整合事实的研究助手。它还可用于根据当前数据验证声明,例如核对公司的最新公告或体育比分。由于其成本相对较低且响应速度快,它适用于高请求量的应用,其中网络信息依据是一项关键特性。
如果您的应用不需要网页搜索或最新信息,请考虑使用不带搜索预览功能的基础版GPT-4o-mini。基础模型成本更低(每token定价相同,但省去了搜索检索的额外开销),并且对于纯对话任务可能响应更快。对于不需要广泛世界知识的简单查询,较小的模型如GPT-4o-mini(基础版)甚至旧版模型如GPT-3.5 Turbo可能就足够了。请评估搜索预览功能是否值得为您的特定用例付出额外成本。
搜索预览由模型在判断查询需要外部信息时自动触发。您无需配置搜索API或手动传入搜索结果。但您可以通过提示模型明确使用网络搜索或指定信息来源来影响其行为。该模型遵循OpenAI应用的标准安全与内容过滤器。请注意,与基础模型相比,网络搜索可能会引入延迟,因为模型在生成最终响应前需等待搜索结果。
GPT-4o-mini搜索预览版的具体基准测试得分尚未作为独立变体公开发布。然而,基于基础的GPT-4o-mini,该模型有望在MMLU、HellaSwag和GSM8K等标准NLP基准测试中表现良好,但准确性可能低于完整的GPT-4o。搜索预览功能可能会提升需要当前知识(例如关于近期事件的常识问答)的任务表现,但不会改变底层模型的推理能力。在事实准确性方面,该模型依赖于其检索到的网络来源的质量和时效性。
GPT-4o-mini Search Preview 专为低延迟场景设计,相较于 GPT-4o 延迟更低。基础版 GPT-4o-mini 以快速推理著称,而 Search Preview 额外增加了网页检索的耗时。总响应时间取决于网络延迟、检索结果数量以及上下文长度等因素。在典型使用中,响应会在几秒内生成。对于要求绝对最低延迟的应用,基础版 GPT-4o-mini(不带搜索功能)会更快。OrcaRouter 的 API 支持流式传输,可逐个显示生成的令牌。
优势:该模型无需额外集成搜索即可提供最新信息,拥有大上下文窗口(128k令牌),且在大批量使用时成本效益高。局限:仅支持文本输入;有时可能检索到不完整或不相关的网络内容;推理能力不如GPT-4o深入;搜索预览功能可能增加延迟。此外,该模型可能并非始终明确引用来源,因此用户应核实关键信息。它不适用于多模态理解、高级数学或复杂思维链推理等任务,在这些方面GPT-4o表现更优。
OrcaRouter 以提供商费率提供 GPT-4o-mini 搜索预览功能,零加价:每百万输入令牌 0.15 美元,每百万输出令牌 0.60 美元。这意味着您支付的价格与 OpenAI 收取的价格完全相同,没有任何额外费用。定价按令牌计算,上下文令牌计为输入,生成的令牌计为输出。该模型使用标准的 OpenAI 令牌化方案。搜索预览功能本身不收取额外费用;尽管额外进行了网络检索,但成本与基础 GPT-4o-mini 相同。
与GPT-4o(每百万输入token收费2.50美元,每百万输出token收费10美元)相比,GPT-4o-mini搜索预览版的价格显著更低——输入成本约低16倍,输出成本约低16.6倍。这使得它在每查询成本至关重要的应用中具有很强的竞争力,尤其当需要网络搜索功能时。然而,基础版GPT-4o-mini(无搜索预览)的每token成本相同,但缺乏搜索功能。如果不需要搜索,可以省去少量额外延迟,但每token成本完全一致。
OrcaRouter 可能支持缓存搜索结果或模型响应,具体取决于配置。如果启用,针对相同信息的重复查询可能从缓存中提供服务,从而减少延迟和令牌使用。不过,缓存策略各有不同。为了获取最新信息,模型通常会在每次请求时重新进行网络搜索。要降低成本,如果您的查询不需要网络数据,可以考虑使用基础的 GPT-4o-mini。请始终通过 OrcaRouter 的仪表盘监控您的令牌使用情况,以了解自己的花费。
OrcaRouter 以 OpenAI 的统一定价传递,不增加任何加成。计费基于提供商报告的令牌数量。无设置费、月最低消费或 API 网关额外费用。您只需按指定费率为您使用的令牌付费。对于 GPT-4o-mini Search Preview,这意味着每百万输入令牌 0.15 美元,每百万输出令牌 0.60 美元。确保您的账户已在 OrcaRouter 上设置好,以便以这些费率访问该模型。
要使用该模型,请向 https://api.orcarouter.ai/v1/chat/completions 发送 POST 请求,并将 model 字段设置为 "openai/gpt-4o-mini-search-preview"。该端点兼容 OpenAI 的接口,因此您只需更改基础 URL 和 API 密钥,即可使用任何 OpenAI SDK 或客户端。示例 curl 命令如下: curl https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_ORCAROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "openai/gpt-4o-mini-search-preview", "messages": [{"role": "user", "content": "What is the current weather in London?"}] }' 搜索预览将自动触发。
该API支持所有标准OpenAI聊天完成参数:temperature(0-2,默认1)、top_p、n、stream、stop、max_tokens(最多16384)、presence_penalty、frequency_penalty和logit_bias。模型会遵循这些参数。对于搜索预览,无需额外参数,由模型自行决定何时搜索。但您可以提示它显式发起网络搜索(例如,“搜索最新的...新闻”),以鼓励其进行检索。请注意,如果模型认为内部知识已足够,它仍可能选择不进行搜索。
如果您已经在使用OpenAI的API,迁移到OrcaRouter非常简单:将基础URL从https://api.openai.com/v1更改为https://api.orcarouter.ai/v1,并将您的API密钥替换为OrcaRouter提供的密钥。模型ID变为"openai/gpt-4o-mini-search-preview"。所有其他请求体和响应格式保持不变。您可以在不修改的情况下使用任何OpenAI客户端库(Python、Node.js等)。OrcaRouter还支持流式传输、函数调用以及与OpenAI API兼容的其他高级功能。
要在请求中启用流式响应,请设置"stream": true。OrcaRouter将以服务器推送事件(Server-Sent Events)的形式返回数据,与OpenAI的流式格式一致。每个事件包含响应的增量部分。流式响应对于面向用户的应用程序尤其有用,可以实时展示生成的令牌。对于搜索预览查询,模型在输出最终答案之前,可能会先指示正在搜索。流式数据将包含这些中间令牌。请确保你的客户端能够妥善处理部分更新。
GPT-4o-mini Search Preview 是 GPT-4o 的一个更小、更快、更经济的变体,新增了网络搜索能力。虽然 GPT-4o 拥有更卓越的推理能力、更大的知识库(截至其训练截止日期)以及多模态支持(图像、音频),但此模型仅支持文本,并依赖网络搜索来弥补其有限的训练知识。对于需要深度分析或复杂数学的任务,GPT-4o 更胜一筹。而对于需要最新信息且成本敏感的应用程序,GPT-4o-mini Search Preview 是一个强有力的替代方案。定价大约便宜 16 倍。
基础版GPT-4o-mini不包含网络搜索功能,仅依赖于训练数据,其数据截止于2023年底。GPT-4o-mini搜索预览版增加了从互联网检索实时信息的能力。两个模型拥有相同的上下文窗口(128k tokens)、最大输出长度(16384)以及按token计费的价格。由于需要网络检索,搜索预览版可能会略有更高的延迟。如果您的应用程序不需要实时数据,基础版在功能上完全相同,且可能更快。两个模型均通过OrcaRouter访问,但使用不同的模型ID。
其他支持搜索功能的模型包括结合Google搜索接地(Google Search grounding)的Gemini,或使用基于插件的网页检索的模型。GPT-4o-mini搜索预览版提供了无需外部插件的原生集成。它通常比更大的支持搜索的模型(如带有浏览功能的GPT-4)更便宜。然而,与专用的搜索API相比,其搜索结果可能不够全面。为了获得高精度的网络知识,可考虑补充使用事实搜索API,并将结果输入基础模型。该模型最适合受益于当前网络数据的简单到中等复杂度的查询。
当您需要以下条件时,请选择此模型:(1)每次查询成本低,(2)无需自定义集成即可自动联网搜索,(3)响应速度快,(4)上下文窗口大。如果您需要多模态输入或更深入的推理,请选择完整的GPT-4o变体。如果您不需要联网搜索且希望响应速度稍快,请选择基础的GPT-4o-mini。如果您需要对搜索来源和结果进行精细控制,请选择专用搜索API加小型模型。此模型最适合作为GPT-3.5或GPT-4o-mini的即插即用替代品,用于需要实时信息的应用场景。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-search-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| 输入 / 1M tokens | $0.150 |
| 输出 / 1M tokens | $0.600 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_gpt_4o_mini_search_preview,
title = {GPT-4o-mini Search Preview API},
author = {OpenAI},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview}
}OpenAI. (2025). GPT-4o-mini Search Preview API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview