GPT-4o mini Search Preview는 Chat Completions에서 웹 검색을 위한 특화된 모델입니다. 웹 검색 쿼리를 이해하고 실행하도록 훈련되었습니다.
GPT-4o-mini Search Preview는 OpenAI의 GPT-4o-mini 모델 변형으로, 내장된 웹 검색 기능을 포함하고 있습니다. 이 모델은 인터넷의 실시간 정보를 통합한 답변을 제공하도록 설계되어, 최신 이벤트, 실시간 데이터 또는 최근 업데이트에 의존하는 질문에 적합합니다. 기본 GPT-4o-mini 아키텍처를 유지하면서, 응답을…
이 모델은 일반적인 언어 이해 및 생성 기능과 실시간 웹 검색을 결합합니다. 최근 사건에 대한 질문에 답하고, 특정 웹사이트에서 데이터를 가져오며, 여러 온라인 소스의 정보를 종합할 수 있습니다. 일반적인 GPT-4o-mini의 기능(텍스트 요약, 번역, 코드 생성, 논리적 추론, 창작 글쓰기)을 그대로 유지합니다. 검색 미리보기 기능을 통해 최신 뉴스, 주가, 날씨, 제품 정보 등 시간에 민감한 데이터에 접근할 수 있습니다. 그러나 이 모델은 속도와 효율성에 맞춰 조정되었기 때문에 추론 깊이가 전체 GPT-4o 모델보다 낮을 수 있습니다.
이 모델은 답변이 변화하거나 최신 정보에 의존하는 시나리오에서 뛰어난 성능을 발휘합니다. 예를 들어 주문 상태나 반품 정책을 확인해야 하는 실시간 고객 서비스 상담원, 트렌드 주제의 요약을 생성하는 콘텐츠 도구, 여러 온라인 출처에서 사실을 수집하는 연구 보조원 등이 있습니다. 또한 회사의 최신 발표나 스포츠 점수 확인과 같이 현재 데이터를 기준으로 주장을 검증하는 데에도 유용합니다. 상대적으로 낮은 비용과 빠른 응답 시간 덕분에 웹 기반 정보 확인이 핵심 기능인 높은 요청 볼륨의 애플리케이션에 적합합니다.
애플리케이션에 웹 검색이나 최신 정보가 필요하지 않다면, 검색 미리보기 기능이 없는 기본 GPT-4o-mini를 사용하는 것을 고려해 보세요. 기본 모델은 훨씬 저렴하며(동일한 토큰당 가격이지만 검색 검색 오버헤드 없음), 순수 대화형 작업의 경우 더 빠를 수 있습니다. 광범위한 세계 지식이 필요하지 않은 매우 간단한 질문의 경우 GPT-4o-mini(기본)나 이전 모델인 GPT-3.5 Turbo와 같은 소형 모델로도 충분할 수 있습니다. 특정 사용 사례에서 검색 미리보기 기능이 비용을 정당화하는지 평가하세요.
검색 미리보기는 모델이 쿼리에 외부 정보가 필요하다고 판단할 때 자동으로 트리거됩니다. 검색 API를 구성하거나 검색 결과를 수동으로 전달할 필요가 없습니다. 하지만 명시적으로 웹 검색을 사용하도록 프롬프트를 작성하거나 출처를 지정함으로써 모델의 동작에 영향을 줄 수 있습니다. 모델은 OpenAI에서 적용하는 표준 안전 및 콘텐츠 필터를 준수합니다. 웹 검색은 기본 모델에 비해 지연 시간이 발생할 수 있습니다. 모델이 최종 응답을 생성하기 전에 검색 결과를 기다리기 때문입니다.
GPT-4o-mini Search Preview의 구체적인 벤치마크 점수는 별도의 변형으로 공개적으로 발표되지 않았습니다. 하지만 기본 GPT-4o-mini를 기반으로, 이 모델은 MMLU, HellaSwag, GSM8K와 같은 표준 NLP 벤치마크에서 좋은 성능을 보일 것으로 예상되지만, 전체 GPT-4o보다는 정확도가 낮을 가능성이 있습니다. 검색 미리보기 기능은 최신 지식이 필요한 작업(예: 최근 사건에 관한 상식)에서 성능을 향상시킬 수 있지만, 기본 모델의 추론 능력을 변경하지는 않습니다. 사실적 정확성의 경우, 모델은 검색하여 가져온 웹 소스의 품질과 최신성에 의존합니다.
GPT-4o-mini Search Preview는 GPT-4o에 비해 낮은 지연 시간을 위해 설계되었습니다. 기본 GPT-4o-mini는 빠른 추론으로 알려져 있으며, 검색 미리보기는 웹 검색을 위해 추가 시간이 소요됩니다. 총 응답 시간은 네트워크 지연 시간, 검색 결과 수, 컨텍스트 길이 등의 요소에 따라 달라집니다. 일반적인 사용에서는 몇 초 이내에 응답이 생성됩니다. 절대적인 최소 지연 시간이 필요한 애플리케이션의 경우, 기본 GPT-4o-mini(검색 없음)가 더 빠릅니다. OrcaRouter의 API는 스트리밍을 지원하여 토큰이 생성되는 대로 표시를 시작할 수 있습니다.
장점: 이 모델은 별도의 검색 통합 없이 최신 정보를 제공하며, 대규모 컨텍스트 윈도우(128k 토큰)를 갖추고 있어 대량 사용 시 비용 효율적입니다. 한계: 텍스트만 입력 가능하며, 때로 불완전하거나 관련 없는 웹 콘텐츠를 검색할 수 있습니다. GPT-4o에 비해 추론 깊이가 낮고, 검색 미리보기로 인해 지연 시간이 증가할 수 있습니다. 또한 모델이 출처를 항상 명시적으로 인용하지는 않으므로, 사용자는 중요한 정보를 확인해야 합니다. 이 모델은 GPT-4o가 더 뛰어난 멀티모달 이해, 고급 수학, 복잡한 사고 과정 추론과 같은 작업에는 적합하지 않습니다.
OrcaRouter는 GPT-4o-mini Search Preview를 제공업체 요금 그대로 청구하며, 마크업이 전혀 없습니다: 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.60입니다. 즉, 추가 수수료 없이 OpenAI가 청구하는 금액을 정확히 지불하게 됩니다. 가격은 토큰 단위로 책정되며, 컨텍스트 토큰은 입력, 생성된 토큰은 출력으로 계산됩니다. 이 모델은 표준 OpenAI 토큰화 방식을 사용합니다. Search Preview 기능 자체에 대한 추가 요금은 없으며, 비용은 기본 GPT-4o-mini와 동일합니다(추가 웹 검색 기능이 있음에도 불구하고).
GPT-4o(입력 토큰 100만 개당 $2.50, 출력 토큰 100만 개당 $10)와 비교했을 때, GPT-4o-mini Search Preview는 입력 비용이 약 16배, 출력 비용이 약 16.6배 저렴하여 비용 효율성이 매우 높습니다. 따라서 쿼리당 비용이 중요한 애플리케이션, 특히 웹 검색이 필요한 경우에 강력한 후보가 됩니다. 그러나 기본 GPT-4o-mini(검색 프리뷰 없는 버전)는 토큰당 동일한 비용이지만 검색 기능이 없습니다. 검색이 필요하지 않다면 약간의 추가 지연 시간을 절약할 수 있지만, 토큰당 비용은 동일합니다.
OrcaRouter는 구성에 따라 검색 결과나 모델 응답을 캐싱할 수 있습니다. 활성화된 경우, 동일한 정보에 대한 반복 요청은 캐시에서 제공되어 지연 시간과 토큰 사용량을 모두 줄일 수 있습니다. 그러나 캐싱 정책은 다양합니다. 가장 최신 정보를 위해서는 모델이 일반적으로 각 요청 시 새로운 웹 검색을 수행합니다. 비용을 최소화하려면 웹 데이터가 필요하지 않은 쿼리의 경우 기본 GPT-4o-mini를 사용하는 것을 고려하세요. 항상 OrcaRouter의 대시보드를 통해 토큰 사용량을 모니터링하여 지출을 파악하세요.
OrcaRouter는 OpenAI의 정확한 가격을 마진 없이 그대로 전달합니다. 요금은 제공자가 보고한 토큰 수를 기준으로 청구됩니다. 설정 수수료, 월 최소 사용량 또는 API 게이트웨이에 대한 추가 요금은 없습니다. 지정된 요율에 따라 사용한 토큰에 대해서만 비용을 지불하면 됩니다. GPT-4o-mini Search Preview의 경우 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.60입니다. 이 요율로 모델에 액세스하려면 OrcaRouter에 계정을 설정하세요.
모델을 사용하려면 POST 요청을 https://api.orcarouter.ai/v1/chat/completions 로 보내고 model 필드를 "openai/gpt-4o-mini-search-preview"로 설정하세요. 이 엔드포인트는 OpenAI와 호환되므로 기본 URL과 API 키만 변경하면 모든 OpenAI SDK 또는 클라이언트를 사용할 수 있습니다. curl 예시: curl https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_ORCAROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "openai/gpt-4o-mini-search-preview", "messages": [{"role": "user", "content": "What is the current weather in London?"}] }' 검색 프리뷰는 자동으로 트리거됩니다.
API는 모든 표준 OpenAI 채팅 완성 매개변수를 지원합니다: temperature (0-2, 기본값 1), top_p, n, stream, stop, max_tokens (최대 16384), presence_penalty, frequency_penalty, logit_bias. 모델은 이러한 매개변수를 준수합니다. 검색 미리보기의 경우 추가 매개변수가 필요하지 않습니다. 모델이 검색 시점을 결정합니다. 그러나 명시적으로 웹 검색을 요청하도록 프롬프트할 수 있습니다(예: "웹에서 최신 뉴스 검색..."). 이렇게 하면 검색을 유도할 수 있습니다. 모델이 내부 지식이 충분하다고 판단하면 검색을 하지 않을 수도 있습니다.
OpenAI API를 이미 사용 중이시라면, OrcaRouter로 마이그레이션하는 것은 간단합니다: base URL을 https://api.openai.com/v1에서 https://api.orcarouter.ai/v1로 변경하고, API 키를 OrcaRouter의 키로 교체하세요. 모델 ID는 "openai/gpt-4o-mini-search-preview"가 됩니다. 다른 모든 요청 본문과 응답 형식은 동일하게 유지됩니다. 수정 없이 모든 OpenAI 클라이언트 라이브러리(Python, Node.js 등)를 사용할 수 있습니다. OrcaRouter는 또한 OpenAI API와 호환되는 스트리밍, 함수 호출 및 기타 고급 기능을 지원합니다.
응답을 스트리밍하려면 요청에 "stream": true를 설정하세요. OrcaRouter는 OpenAI의 스트리밍 형식과 동일하게 서버 전송 이벤트(server-sent events)로 데이터를 반환합니다. 각 이벤트에는 응답의 델타(delta)가 포함됩니다. 스트리밍은 사용자 대상 애플리케이션에서 토큰이 생성됨에 따라 실시간으로 표시하는 데 특히 유용합니다. 검색 미리보기 쿼리의 경우, 모델이 최종 답변을 출력하기 전에 먼저 검색 중임을 나타낼 수 있습니다. 스트림에는 이러한 중간 토큰이 포함됩니다. 클라이언트가 부분 업데이트를 원활하게 처리할 수 있도록 하세요.
GPT-4o-mini Search Preview는 GPT-4o의 더 작고, 빠르며, 저렴한 변형으로, 웹 검색 기능이 추가되었습니다. GPT-4o는 뛰어난 추론 능력, 더 큰 지식 기반(훈련 기준일까지), 그리고 멀티모달 지원(이미지, 오디오)을 갖추고 있지만, 이 모델은 텍스트 전용이며 제한된 훈련 지식을 극복하기 위해 웹 검색에 의존합니다. 심층 분석이나 복잡한 수학이 필요한 작업에는 GPT-4o가 더 좋습니다. 비용에 민감하고 최신 정보가 필요한 애플리케이션에는 GPT-4o-mini Search Preview가 강력한 대안입니다. 가격은 약 16배 저렴합니다.
기본 GPT-4o-mini는 웹 검색을 포함하지 않으며, 2023년 후반의 마감일이 있는 학습 데이터에만 의존합니다. GPT-4o-mini Search Preview는 인터넷에서 최신 정보를 검색할 수 있는 기능을 추가합니다. 두 모델 모두 동일한 컨텍스트 창(128k 토큰), 최대 출력(16384), 토큰당 가격을 가지고 있습니다. 검색 미리보기 변형은 웹 검색으로 인해 약간 더 높은 지연 시간이 발생할 수 있습니다. 애플리케이션에 실시간 데이터가 필요하지 않은 경우 기본 모델은 기능적으로 동일하며 더 빠를 수 있습니다. 두 모델 모두 서로 다른 모델 ID로 OrcaRouter를 통해 액세스됩니다.
다른 검색 가능 모델로는 Google Search 접지를 활용한 Gemini나, 플러그인 기반 웹 검색을 사용하는 모델이 있습니다. GPT-4o-mini Search Preview는 외부 플러그인 없이 기본 통합을 제공합니다. 일반적으로 더 큰 검색 가능 모델(예: 브라우징 기능이 있는 GPT-4)보다 저렴합니다. 그러나 전용 검색 API에 비해 검색 결과의 포괄성이 떨어질 수 있습니다. 정확도가 높은 웹 지식이 필요한 경우, 사실 검색 API를 보조 수단으로 활용하고 결과를 기본 모델에 공급하는 방안을 고려하세요. 이 모델은 최신 웹 데이터가 도움이 되는 단순하거나 중간 정도 복잡한 쿼리에 가장 적합합니다.
다음과 같은 경우 이 모델을 선택하십시오: (1) 쿼리당 비용이 낮은 경우, (2) 사용자 정의 통합 없이 자동 웹 검색이 필요한 경우, (3) 빠른 응답 시간이 필요한 경우, (4) 큰 컨텍스트 창이 필요한 경우. 멀티모달 입력이나 더 깊은 추론이 필요한 경우 전체 GPT-4o 변형을 선택하십시오. 웹 검색이 필요 없고 약간 더 빠른 응답을 원하는 경우 기본 GPT-4o-mini를 선택하십시오. 검색 소스와 결과에 대한 세밀한 제어가 필요한 경우 전용 검색 API와 소형 모델을 선택하십시오. 이 모델은 실시간 정보가 유용한 애플리케이션에서 GPT-3.5 또는 GPT-4o-mini를 대체하는 용도로 가장 적합합니다.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-search-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| 입력 / 1M tokens | $0.150 |
| 출력 / 1M tokens | $0.600 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
GET /api/public/models/openai/gpt-4o-mini-search-preview열기 @misc{orcarouter_gpt_4o_mini_search_preview,
title = {GPT-4o-mini Search Preview API},
author = {OpenAI},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview}
}OpenAI. (2025). GPT-4o-mini Search Preview API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview