GPT-4o 미니는 OpenAI의 최신 모델로, [GPT-4 옴니](/models/openai/gpt-4o) 이후에 출시되었으며 텍스트와 이미지 입력을 모두 지원하고 텍스트 출력을 제공합니다. 가장 진보된 소형 모델로서, 비용이 몇 배 더 저렴합니다...
GPT-4o-mini는 OpenAI의 GPT-4o 모델의 더 작고 빠른 변형으로, 멀티모달 기능을 유지하면서 낮은 계산 비용에 최적화되었습니다. 텍스트, 이미지, 업로드된 파일을 입력으로 처리하고 텍스트 출력을 생성할 수 있습니다. 이 모델은 OpenAI에서 호스팅하며, 기본 URL https://api.orcarouter.ai/v1에서…
GPT-4o-mini는 요약, 번역, 분류, 질문 응답을 포함한 광범위한 언어 작업에서 뛰어난 성능을 보입니다. 구조화된 JSON 출력, 함수 호출, 도구 사용을 지원하여 외부 API 및 데이터베이스와의 통합을 가능하게 합니다. 128K 컨텍스트 창을 통해 대용량 문서나 대화 기록을 수용하여 일관된 분석을 수행할 수 있습니다. 일반적인 벤치마크(MATH-500 점수 78.9)에서 우수한 성능을 보이며, 교육용 수학 문제, 코드 설명, 데이터 추출에 적합합니다. 더 간단한 작업의 경우 GPT-4o-mini는 비용의 극히 일부만으로도 더 큰 모델과 종종 비슷한 성능을 발휘합니다. 그러나 깊은 도메인 전문 지식이나 고도로 창의적인 출력이 필요한 작업에서는 GPT-4o에 비해 품질이 저하될 수 있습니다.
이미지는 URL 또는 base64로 인코딩된 데이터 형태로 API 요청 내에 제공될 수 있습니다. 모델은 이미지를 해석하여 객체, 이미지 내 텍스트, 공간 관계 등 시각적 콘텐츠를 이해합니다. 이를 통해 시각적 Q&A, 다이어그램 해석, 손글씨 숫자 인식과 같은 활용 사례를 지원합니다. 이미지 토큰은 컨텍스트 제한에 포함되므로 고해상도 또는 큰 이미지일수록 128K 토큰 예산을 더 많이 소모합니다. 모델은 이미지를 생성하지 않고 처리만 수행합니다. 의료 영상과 같이 세밀한 시각적 디테일이 필요한 작업에는 특화된 비전 모델이 더 정확할 수 있지만, GPT-4o-mini는 합리적인 비용으로 범용 솔루션을 제공합니다.
GPT-4o-mini는 텍스트와 이미지 외에도 업로드된 파일을 허용합니다. 일반적인 파일 형식으로는 PDF, .docx, .txt, .csv, .json이 있습니다. 모델은 파일에서 텍스트와 관련 시각적 요소(파일에 포함된 이미지가 있는 경우)를 추출하여 컨텍스트의 일부로 처리합니다. 이는 연구 논문, 법률 계약서 또는 스프레드시트를 수동으로 복사하지 않고 분석할 때 유용합니다. 파일 내용은 토큰 사용량에 포함됩니다. 예를 들어 50페이지 분량의 PDF는 수천 개의 토큰을 소비할 수 있습니다. OrcaRouter는 파일에서 발생한 토큰을 포함한 총 입력 토큰을 기준으로 요금을 청구합니다. 토큰 소비 외에 추가 파일 처리 수수료는 없습니다.
만약 작업에 이미지나 파일 없이 텍스트만 포함되고, 필요한 컨텍스트가 16K 토큰 미만이라면, 더 작은 모델(예: GPT-3.5-turbo)이 토큰당 비용이 더 낮을 수 있습니다. 마찬가지로, 단순 분류 또는 간단한 Q&A 같은 매우 높은 처리량의 작업에는 전용 파인튜닝된 모델이 더 경제적일 수 있습니다. GPT-4o-mini는 멀티모달 또는 긴 컨텍스트 사용 사례에 비용 효율적이지만, 그 강점은 성능과 가격의 균형에 있습니다. 애플리케이션이 최대 정확도를 위해 느린 응답이나 더 높은 비용을 감수할 수 있다면, GPT-4o가 대안이 될 수 있습니다. 특정 작업을 벤치마킹하여 어떤 모델이 품질 및 예산 기준을 충족하는지 확인하십시오.
MATH-500은 MATH 벤치마크의 하위 집합으로, 대수학, 기하학, 정수론, 확률을 포함한 500개의 경쟁 수준 수학 문제로 구성되어 있습니다. 78.9점은 GPT-4o-mini가 이 문제들의 약 78.9%를 정확히 답했음을 의미합니다. 이는 더 작은 모델로서 강력한 결과이며, 수학적 추론 능력을 반영합니다. 비슷한 크기의 많은 이전 모델들을 능가합니다. 하지만 특정 문제 영역에서는 성능이 달라질 수 있습니다. 벤치마크는 제로샷 조건에서 수행되었으며, 즉 사전 예시가 제공되지 않았습니다. 실제 수학 튜터링에서는 모델이 다단계 해결을 올바르게 처리하도록 신중한 프롬프트가 필요할 수 있습니다.
제공된 벤치마크가 MATH-500뿐이지만, 널리 알려진 공개 정보에 따르면 GPT-4o-mini는 MMLU (massive multitask language understanding), HellaSwag, GSM8K에서도 경쟁력 있는 점수를 기록합니다. 일반적으로 이러한 지표에서 GPT-4o보다는 낮지만 GPT-3.5-turbo보다는 높은 순위를 차지합니다. 추론 벤치마크에서는 파라미터 수 대비 강력한 성능을 보여줍니다. 창작 글쓰기나 개방형 생성에서는 출력이 일관되지만 더 큰 모델의 미묘함이 부족할 수 있습니다. 지연 시간은 일반적으로 GPT-4o보다 낮아 실시간 애플리케이션에 적합합니다. 정확한 점수는 OpenAI의 문서를 참조하십시오. OrcaRouter는 추가 마크업 없이 액세스를 제공합니다.
지연 시간은 요청 복잡성, 토큰 수, API 부하에 따라 달라집니다. GPT-4o-mini는 빠른 응답을 위해 설계되었으며, 일반적으로 중간 길이의 프롬프트에서는 1초 이내에 첫 번째 토큰을 반환합니다. 긴 문서(예: 50K 토큰)의 경우 모델이 전체 컨텍스트를 처리하면서 지연 시간이 증가합니다. OrcaRouter는 속도를 변경하지 않으며, 직접 OpenAI API 호출과 동일한 응답 시간을 경험합니다. 지연 시간을 줄이기 위해 스트리밍이 지원됩니다. 지연 시간이 중요한 애플리케이션에서는 프롬프트 길이를 짧게 유지하고 스트리밍을 사용하는 것이 좋습니다. 정확한 최초 응답 시간(time-to-first-token)은 응답 시간을 모니터링하여 측정할 수 있으며, 특정 SLA는 제공되지 않습니다.
능력이 있음에도 불구하고, GPT-4o-mini는 더 작은 크기로 인해 한계가 있습니다. GPT-4o에 비해 복잡한 다단계 추론에서 덜 정확한 답변을 생성할 수 있습니다. 미묘한 지침을 잘못 해석하거나 매우 긴 출력에서 완벽한 일관성을 유지하지 못할 때도 있습니다. 다중 모드 이해는 좋지만 완벽하지는 않습니다. 이미지의 작은 세부 사항을 놓치거나 요소를 잘못 셀 수 있습니다. 모델은 훈련 데이터에 존재하는 편향을 나타낼 수 있습니다. 도구 사용을 위해 명시적으로 미세 조정되지 않는 한 인터넷 검색이나 실시간 데이터 액세스를 지원하지 않습니다. 높은 정밀도가 필요한 작업(예: 법률 상담, 의료 진단)에는 인간의 검토가 필수적입니다. 벤치마크 점수는 통제된 환경을 반영합니다. 실제 성능은 다를 수 있습니다.
OrcaRouter는 OpenAI의 정확한 가격을 마크업 없이 그대로 전달합니다: 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.60입니다. 입력 토큰에는 모든 텍스트, 이미지 토큰 및 파일 콘텐츠가 포함됩니다. 출력 토큰은 생성된 텍스트를 계산합니다. 월 사용료나 숨겨진 요금은 없습니다. 이는 128K 컨텍스트 윈도우를 가진 멀티모달 모델 중에서 가장 낮은 토큰당 비용 중 하나입니다. 비교를 위해 GPT-4o는 입력 100만 개당 $2.50, 출력 100만 개당 $10이며, GPT-4o-mini는 입력에서 94% 저렴하고 출력에서 94% 저렴합니다. 비용 이점은 대규모 애플리케이션에 중요합니다.
GPT-4o-mini는 토큰당 저렴하지만, 크기가 작기 때문에 원하는 정확도를 얻기 위해 더 많은 시도나 더 상세한 프롬프트가 필요할 수 있으며, 이로 인해 총 토큰 소비량이 증가할 수 있습니다. GPT-4o가 한 번에 정답을 얻는 작업에서 GPT-4o-mini가 세 번 필요하다면, 전체 비용이 비슷하거나 오히려 더 높을 수 있습니다. 또한, 많은 소규모 요청을 제출해야 하는 경우 API 호출의 오버헤드가 지연 시간을 추가할 수 있지만 직접적인 비용은 증가하지 않습니다. 캐싱이 적용되지 않으며, 각 요청은 새로 처리됩니다. 두 모델로 사용 사례를 평가하여 최적의 비용-성능 균형을 결정하십시오. OrcaRouter는 볼륨 할인 없이 일관된 가격을 제공합니다.
OrcaRouter는 프롬프트 캐싱을 구현하지 않습니다. GPT-4o-mini에 대한 모든 요청은 OpenAI의 서버로 전송되며 토큰당 요금이 부과됩니다. 반복된 프롬프트에 대한 할인 요금은 없습니다. 워크로드에서 동일한 시스템 메시지나 긴 컨텍스트를 자주 반복하는 경우, 동일한 프롬프트를 다시 제출하지 않도록 사용자 측에서 응답을 저장하는 것을 고려할 수 있습니다. 일부 제공업체는 프롬프트 캐싱 할인을 제공하지만, OrcaRouter를 통해서는 표준 제공업체 요금을 지불합니다. 이는 투명하고 예측 가능합니다. 캐싱이 없으면 가격 책정이 단순화되지만, 중복 토큰 사용을 최소화하도록 쿼리를 설계해야 함을 의미합니다.
(참고: GPT-4o-mini의 다른 변형은 제공되지 않습니다. 질문이 Claude 3 Haiku나 Gemini Flash와 같은 다른 미니 모델과의 비교에 관한 것이라고 가정하지만, 제공된 정보는 사실뿐입니다. 대신 GPT-4o와 비교합니다.) GPT-4o와 비교하여 GPT-4o-mini는 매우 저렴합니다: 입력 토큰 100만 개당 $0.15 대 $2.50 (94% 저렴), 출력 토큰 100만 개당 $0.60 대 $10 (94% 저렴). 많은 사용자가 GPT-4o-mini가 작업의 80-90%에 충분하다고 생각하며, 큰 비용 절감 효과를 제공합니다. 그러나 최대 정확도가 필요한 작업(예: 복잡한 코드 생성, 미묘한 법적 추론)의 경우 비용 절감이 품질 저하를 정당화하지 못할 수 있습니다. OrcaRouter를 사용하면 동일한 API 엔드포인트에서 모델 ID만 변경하여 모델 간에 쉽게 전환할 수 있습니다.
OpenAI 클라이언트 라이브러리 또는 모든 HTTP 클라이언트를 사용하여 기본 URL을 https://api.orcarouter.ai/v1 로 설정하세요. model 매개변수를 "openai/gpt-4o-mini"로 설정하세요. 인증에는 OrcaRouter API 키가 필요합니다. 최소한의 Python 예제: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) 모든 OpenAI API 매개변수( temperature, max_tokens, stream, tools 등)가 지원됩니다. OrcaRouter는 요청을 OpenAI에 프록시하고 응답을 변경하지 않고 반환합니다.
표준 OpenAI Chat Completions 파라미터: model (필수: "openai/gpt-4o-mini"), messages (메시지 객체 배열), temperature (0-2, 기본값 1), top_p (0-1, 기본값 1), n (응답 수, 기본값 1), stream (부울), stop (문자열/배열), max_tokens (최대 16384), presence_penalty, frequency_penalty, logit_bias, user (선택 사항), 그리고 함수 호출을 위한 tools. 비전을 지원하려면 메시지에 이미지 콘텐츠를 포함합니다("image_url" 또는 "image_url" + detail). 파일 입력은 base64 인코딩 가능합니다. OrcaRouter는 모든 파라미터를 OpenAI에 전달합니다. 참고: 응답 형식(JSON 모드) 지원; 적절한 경우 response_format={ "type": "json_object" } 설정.
마이그레이션은 간단합니다: 클라이언트의 기본 URL을 "https://api.openai.com/v1"에서 "https://api.orcarouter.ai/v1"로 변경하고 API 키를 OrcaRouter 키로 교체하세요. 모델 이름을 "openai/gpt-4o-mini"로 업데이트하거나 (그대로 "gpt-4o-mini"로 유지할 수도 있지만, 사실상 모델 ID가 "openai/gpt-4o-mini"이므로 이를 사용하세요). 다른 모든 코드는 API가 완전히 OpenAI와 호환되므로 변경되지 않습니다. 여러 모델 문자열을 유지하고 비용이나 기능에 따라 라우팅할 수도 있습니다. OrcaRouter는 응답 형식을 변경하지 않습니다. 헤더와 스트리밍이 예상대로 작동하는지 확인하기 위해 몇 가지 쿼리로 테스트해보세요.
네, GPT-4o-mini는 서버 전송 이벤트(SSE)를 통한 스트리밍을 지원합니다. 요청에 stream=true를 설정하세요. 응답은 델타 콘텐츠를 포함하는 여러 청크로 구성됩니다. 이렇게 하면 사용자의 첫 토큰 수신 시간이 단축되고 실시간 표시가 가능합니다. OrcaRouter는 스트리밍 응답을 수정 없이 전달합니다. 청구되는 총 토큰 수는 동일하게 유지됩니다. 스트리밍은 모든 입력 방식(텍스트, 이미지, 파일)과 호환됩니다. 스트리밍을 함수 호출과 결합할 수도 있습니다. 모델은 적절한 경우 툴 호출 청크를 스트리밍합니다. max_tokens 매개변수는 전체 응답에 적용됩니다.
GPT-4o-mini는 GPT-4o의 더 작고 저렴한 형제입니다. 입력 및 출력 토큰 모두에서 약 94% 저렴합니다. 동일한 128K 컨텍스트 창과 16K 최대 출력을 지원합니다. 동일한 멀티모달 입력을 지원하지만 복잡한 추론 및 창의적 작업에서는 일반적으로 약간 덜 정확합니다. MATH-500에서 GPT-4o-mini는 78.9점, GPT-4o는 92+점(근사치)입니다. 고객 지원, 요약, 간단한 비전과 같은 많은 일상 작업에서는 GPT-4o-mini로 충분합니다. 최고 수준의 성능이 필요하고 더 높은 지연 시간과 비용을 감수할 수 있다면 GPT-4o를 선택하세요.
Claude 3 Haiku 또는 Gemini 1.5 Flash 같은 모델과 비교하면: GPT-4o-mini는 128K 컨텍스트 윈도우를 제공하는 반면, Haiku는 200K, Flash는 1M을 지원합니다. 가격은 비슷합니다 (Haiku $0.25/$1.25, 1M 토큰당; Flash $0.35/$1.05, 1M 토큰당). GPT-4o-mini의 MATH-500 점수 78.9는 경쟁력이 있습니다. Haiku는 비슷한 수학 벤치마크에서 약 73점, Flash는 약 78점을 기록합니다. 멀티모달 입력의 경우, 세 모델 모두 이미지를 지원합니다. GPT-4o-mini는 가격 대비 더 나은 추론 품질을 제공할 수 있지만, 컨텍스트 윈도우는 일부 경쟁사보다 작습니다. 최선의 선택은 특정 지연 시간, 비용 및 품질 요구 사항에 따라 달라집니다. OrcaRouter는 또한 Haiku와 Flash에 대한 액세스를 제공하여 나란히 비교할 수 있습니다.
GPT-3.5-turbo는 더 오래된 모델이며, 16K 컨텍스트 창을 가지고 있고, 비용이 약간 더 저렴합니다 (GPT-4o-mini의 1M 입력당 $0.15와 비교하여 $0.50)? 사실 GPT-3.5-turbo-0125는 $0.50/$1.50이지만 컨텍스트가 더 작습니다. 제공된 가격 책정에 따르면, GPT-4o-mini는 토큰당 더 저렴하고 더 큰 컨텍스트와 멀티모달 입력을 제공합니다. 따라서 대부분의 작업에서 GPT-4o-mini가 우수합니다. 그러나 이미 GPT-3.5-turbo를 사용 중인 일부 레거시 애플리케이션은 최소한의 변경만 필요할 수 있습니다. GPT-4o-mini는 추론 벤치마크에서도 더 나은 성능을 보입니다. 지연 시간이 매우 중요하거나 GPT-3.5 모델을 미세 조정한 경우가 아니라면, GPT-4o-mini가 권장되는 드롭인 업그레이드입니다.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| 입력 / 1M tokens | $0.150 |
| 출력 / 1M tokens | $0.600 |
| 캐시 읽기 / 1M | $0.075 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
@misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini