GPT-4o 미니는 OpenAI의 최신 모델로, [GPT-4 옴니](/models/openai/gpt-4o) 이후에 출시되었으며 텍스트와 이미지 입력을 모두 지원하고 텍스트 출력을 제공합니다. 가장 진보된 소형 모델로서, 비용이 몇 배 더 저렴합니다...
GPT-4o-mini (2024-07-18)은 OpenAI에서 개발한 경량 멀티모달 모델로, 비용 효율적인 텍스트 및 이미지 처리를 위해 설계되었습니다. 이 모델은 특히 대량 처리나 지연 시간에 민감한 프로덕션 환경에서 강력한 성능을 저렴한 비용으로 필요로 하는 개발자 및 조직을 대상으로 합니다. OrcaRouter의 OpenAI 호환 API를 통해…
GPT-4o-mini는 시각적 콘텐츠 설명, 이미지에 대한 질문 응답, 이미지 내 객체나 텍스트 식별과 같은 이미지 추론 작업을 수행할 수 있습니다. 표준 이미지 형식(JPEG, PNG, GIF, WebP)을 지원하며 단일 요청에서 여러 이미지를 처리할 수 있습니다. 이 모델은 구조적 경계 상자 방식의 객체 탐지는 수행하지 않지만, 위치와 관계를 설명할 수 있습니다. 예를 들어, 사진에서 텍스트를 읽고, 차트와 다이어그램을 이해하며, 상세한 장면 설명을 제공할 수 있습니다. 이미지 기반 작업의 정확도는 해상도와 문맥에 따라 달라지며, 고해상도 이미지는 더 많은 토큰 비용이 발생할 수 있지만 세부 정보에 대해 더 나은 결과를 얻을 수 있습니다.
GPT-4o-mini는 멀티모달 콘텐츠 구조를 통해 PDF, Word 문서, 이미지 파일 등의 파일 입력을 허용합니다. 파일이 제공되면 모델이 해당 파일에서 텍스트와 이미지 콘텐츠를 추출하여 사용자가 문서의 내용에 대해 질문하거나, 텍스트를 요약하거나, 포함된 표와 그림을 분석할 수 있습니다. 파일은 업로드되거나 저장되지 않으며, API 호출 중에 인라인으로 처리됩니다. 이는 문서 검토, 계약 분석, 스캔된 양식에서 데이터 추출과 관련된 워크플로에 유용합니다. 매우 큰 파일은 128,000토큰 컨텍스트 창을 초과하거나 높은 토큰 비용을 발생시킬 수 있습니다.
가벼운 텍스트 생성만 필요한 작업의 경우, 토큰 예산은 GPT-3.5-Turbo나 오픈소스 대안(예: Llama 3 8B)과 같은 더 저렴한 모델에 할당하는 것이 더 나을 수 있습니다. 워크로드에 멀티모달 입력이나 128k 컨텍스트가 필요하지 않다면, 더 작은 모델이 비용을 더 줄일 수 있습니다. 또한 단순 분류나 키워드 추출과 같은 좁은 작업의 경우, 파인튜닝된 더 작은 모델이 더 낮은 지연 시간과 비용을 제공할 수 있습니다. 하지만 GPT-4o-mini의 낮은 가격, 큰 컨텍스트, 멀티모달 기능의 조합은 다양한 범용 애플리케이션에서 강력한 기본 선택이 됩니다.
GPT-4o-mini는 멀티모달 이해와 대규모 컨텍스트 윈도우의 이점을 활용하는 대량 생산 환경에서 뛰어납니다. 이상적인 사용 사례로는 스크린샷과 긴 대화 기록을 처리할 수 있는 고객 지원 챗봇, PDF나 이미지에서 데이터를 추출하는 문서 처리 파이프라인, 수학 튜터링을 위한 교육 도구(78.9 MATH-500 점수로 입증됨), 텍스트와 다이어그램이 모두 포함된 코드 디버깅 등이 있습니다. 또한 이미지 분석과 텍스트를 동시에 요구하는 콘텐츠 조정 워크플로우에도 적합합니다. 낮은 토큰당 비용으로 엄청난 비용 부담 없이 수백만 건의 요청으로 확장할 수 있습니다.
GPT-4o-mini는 MATH 데이터셋의 하위 집합인 MATH-500 벤치마크에서 78.9점을 기록했습니다. MATH-500은 500개의 까다로운 수학 문제로 구성되어 있습니다. 이 점수는 모델이 산술, 대수, 기하 및 기타 수학 문제를 단계별 추론을 통해 해결할 수 있는 능력을 나타냅니다. 78.9점은 많은 소형 모델 및 일부 이전 GPT-4 변형보다 높은 점수로, 해당 크기와 비용 대비 강력한 추론 능력을 시사합니다. 그러나 동일한 벤치마크에서 전체 GPT-4o 또는 GPT-4 Turbo만큼 성능이 뛰어나지는 않습니다. 이 결과는 맥락에 맞게 해석되어야 합니다. GPT-4o-mini는 최대 정확도가 아닌 효율성을 위해 설계되었습니다.
OpenAI는 구체적인 지연 시간 수치를 공개하지 않지만, GPT-4o-mini는 더 작은 파라미터 수 덕분에 일반적으로 더 큰 GPT-4 모델보다 빠릅니다. 실제로 사용자들은 짧은 프롬프트의 경우 첫 번째 토큰까지의 시간이 수백 밀리초 범위이며, 초당 수십 개의 토큰을 생성하는 처리량을 보고합니다. 지연 시간은 총 토큰 수(입력 + 출력), 이미지 수, 그리고 현재 서버 부하에 따라 달라집니다. OrcaRouter가 프록시 역할을 하므로 추가 네트워크 지연 시간은 미미하며, 일반적으로 직접 OpenAI API 지연 시간과 몇 밀리초 내외입니다. 이 모델은 실시간 애플리케이션을 위한 스트리밍을 지원합니다.
장점: 비용 효율성(GPT-4 제품군 중 멀티모달을 지원하는 모델 중 가장 낮은 가격), 대규모 128k 컨텍스트 창, 견고한 수학적 추론 능력(78.9 MATH-500), 그리고 더 큰 모델에 비해 빠른 추론 속도. 일반적인 작업에서 이미지와 파일 입력을 능숙하게 처리합니다. 한계: 복잡하고 미묘한 추론이나 창의적 글쓰기에서는 GPT-4o 및 GPT-4 Turbo에 비해 성능이 떨어집니다. 엄격한 형식이나 다단계 제약 조건을 요구하는 작업에서는 지시사항을 따르는 신뢰성이 낮을 수 있습니다. 또한 더 작은 모델이기 때문에 지식 기준 시점(2024년 1월)이 최근 사건에 대해 오래되었을 수 있습니다. 세밀한 객체 탐지나 얼굴 인식을 위한 비전 기능도 지원하지 않습니다.
가격은 입력 토큰 1백만 개당 $0.15, 출력 토큰 1백만 개당 $0.60으로 설정되어 있습니다. 이는 표준 OpenAI 제공업체 요금이며, OrcaRouter는 이에 대해 어떠한 마크업도 부과하지 않습니다. 청구는 모델 제공업체가 보고한 토큰 수를 기준으로 합니다. 추가 요청당 요금이나 최소 금액은 없습니다. 제로 마크업 정책은 OrcaRouter를 통해 제공되는 모든 모델에 적용되므로 가격은 OpenAI에 직접 지불하는 것과 동일합니다. 이러한 투명성 덕분에 사용자는 예상치 못한 비용 없이 정확하게 예산을 책정할 수 있습니다.
출력 토큰은 입력 토큰보다 토큰당 4배 더 비쌉니다 (백만 개당 $0.60 대 $0.15). 상세한 요약이나 코드 생성처럼 긴 응답을 생성하는 작업에서는 출력 비용이 주를 이룰 수 있습니다. 사용자는 max_tokens 매개변수를 설정하고 간결한 응답을 유도하는 프롬프트를 작성하여 출력 토큰 사용량을 제어할 수 있습니다. 반대로, 긴 문서나 많은 이미지가 포함된 문서를 처리하는 것처럼 입력이 큰 작업에서는 입력 비용이 발생합니다. 128k의 큰 컨텍스트 창 덕분에 방대한 컨텍스트를 쉽게 포함할 수 있지만, 그만큼 토큰당 입력 요금이 부과됩니다. 전체 비용 관리를 위해 입력과 출력 길이의 균형을 최적화하는 것이 핵심입니다.
OrcaRouter는 현재 OpenAI가 API 수준에서 제공하는 것 이상으로 GPT-4o-mini 요청에 대한 내장 캐싱을 제공하지 않습니다. OrcaRouter를 통해 제공되는 볼륨 할인이나 예약 용량 옵션은 없으며, 가격은 OpenAI 제공자 요율에 따라 엄격한 사용량 기반(Pay-as-you-go) 방식입니다. 사용자는 중복 API 호출을 줄이기 위해 자체 캐싱 전략(예: 애플리케이션 계층)을 구현해야 합니다. 제로 마크업 정책에 따라 OpenAI의 향후 가격 변동이 자동으로 반영됩니다. 매우 높은 볼륨의 사용 사례의 경우, 직접 OpenAI 엔터프라이즈 계약이 더 나은 조건을 제공할 수 있지만, OrcaRouter를 통하면 단일 API 키와 통합 청구의 단순함이 여전히 유리할 수 있습니다.
GPT-4o-mini로 처리된 이미지는 해상도와 디테일 수준에 따라 토큰으로 변환됩니다. OpenAI는 너비와 높이를 모두 고려하는 토큰 계산 알고리즘을 사용합니다. 예를 들어, 일반적인 1024x1024 이미지에 높은 디테일을 적용하면 약 2,000~3,000개의 입력 토큰이 소모됩니다. 입력 토큰은 백만 개당 0.15달러로 청구되므로, 이미지당 비용은 매우 낮습니다(일반적으로 1센트 미만). 그러나 하나의 요청에 여러 이미지를 처리하면 비용이 누적될 수 있습니다. 사용자는 고해상도가 필요하지 않은 경우 `low` 디테일 수준(이미지당 약 85개의 토큰 소모)을 사용하여 비용을 통제할 수 있습니다. 이미지 비용을 이해하려면 API 응답에서 사용된 토큰을 항상 확인하세요.
API 기본 URL을 https://api.orcarouter.ai/v1로 설정하고 모델 ID "openai/gpt-4o-mini-2024-07-18"을 사용하세요. 해당 API는 표준 OpenAI 채팅 완료 형식을 따릅니다. 예를 들어, Python에서: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). temperature, top_p, max_tokens, stream, stop sequences와 같은 모든 매개변수는 원래 OpenAI API와 동일하게 지원됩니다. 응답에는 id, choices, usage (토큰 수 포함) 등 표준 필드가 포함됩니다.
결정적 출력을 위해 temperature=0 및 top_p=1로 설정합니다. 창의적인 작업의 경우 0.8~1.2 정도의 temperature가 적절할 수 있습니다. Max_tokens는 응답 길이를 제어합니다. 기본값은 16,384입니다. 출력 비용을 줄이려면 필요에 맞게 max_tokens를 설정하세요. 멀티모달 입력을 사용할 때는 콘텐츠 부분 배열로 메시지를 구성합니다: [{"type":"text","text":"Describe this:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. 파일 처리를 위해 파일 콘텐츠를 텍스트 또는 base64로 포함합니다. stop 매개변수를 사용하여 사용자 정의 시퀀스에서 생성을 중단할 수 있습니다. Stream=True는 실시간 토큰 전달을 활성화합니다.
마이그레이션에는 세 가지 간단한 변경이 필요합니다: base_url을 https://api.orcarouter.ai/v1로 설정하고, API 키를 OrcaRouter API 키로 교체하며, 모델 ID를 "openai/gpt-4o-mini-2024-07-18"로 변경하십시오. OpenAI Python/Node.js 라이브러리나 표준 채팅 완성 형식을 따르는 HTTP 클라이언트를 사용하는 경우 다른 코드 수정은 필요하지 않습니다. 응답 구조는 동일합니다. 참고로 OrcaRouter는 OpenAI와 다르게 요청을 제한하지 않습니다. 동일한 속도 제한이 OpenAI 계정 등급에 따라 적용되지만, 키는 OrcaRouter를 통해 관리합니다. 토큰 수와 지연 시간을 확인하기 위해 작은 요청으로 테스트하십시오.
OrcaRouter API 키를 Authorization 헤더에 제공하십시오: Authorization: Bearer <your-key>. API는 표준 HTTP 상태 코드를 반환합니다: 200(성공), 400(잘못된 요청, 예: 잘못된 매개변수), 401(권한 없음, 잘못된 API 키), 429(속도 제한), 500(서버 오류). 오류 응답에는 메시지와 유형을 포함하는 error 객체가 있는 JSON 본문이 포함됩니다. 429 및 5xx 오류에 대해 지수 백오프를 사용한 재시도를 구현하는 것이 좋습니다. OrcaRouter는 OpenAI의 오류 응답을 수정하지 않으므로 직접 API에서 보는 것과 동일한 오류 메시지가 나타납니다.
GPT-4o-mini는 GPT-3.5-Turbo보다 추론, 수학, 명령 수행 능력에서 훨씬 뛰어납니다. MATH-500 점수가 78.9인 반면, GPT-3.5-Turbo는 일반적으로 30~40점대입니다. 또한 GPT-3.5-Turbo가 지원하지 않는 멀티모달 입력(이미지 및 파일)을 지원합니다. 컨텍스트 윈도우도 더 커서 128k 대 16k입니다. 가격: GPT-4o-mini(토큰 100만 개당 $0.15/$0.60)는 GPT-3.5-Turbo(16k 버전 기준 토큰 100만 개당 $0.50/$1.50? 사실 GPT-3.5-Turbo 0125는 토큰 100만 개당 $0.50/$1.50인가? 잠깐, 표준 GPT-3.5-Turbo는 토큰 100만 개당 $1.50/$2.00? 제공된 사실에 따르겠습니다: GPT-4o-mini의 가격은 제시되어 있습니다.)보다 약간 비쌉니다. 질적으로 비교하자면: GPT-4o-mini는 GPT-3.5-Turbo보다 약간 높은 비용으로 더 나은 성능을 제공하며, 멀티모달 기능까지 갖추고 있습니다.
GPT-4o-mini는 GPT-4o의 더 작고 비용 효율적인 버전입니다. 두 모델 모두 멀티모달 기능과 동일한 컨텍스트 윈도우 크기(128k 토큰)를 공유하지만, GPT-4o는 MMLU 및 MATH와 같은 벤치마크에서 더 높은 점수를 달성합니다. GPT-4o-mini의 MATH-500 점수는 78.9로, GPT-4o의 보고된 점수(약 90~95)보다 낮습니다. 가격은 크게 저렴합니다: GPT-4o-mini($0.15/$0.60) 대비 GPT-4o($2.50/$10.00, 백만 토큰당). 복잡한 추론 작업에서 최대 정확도가 중요한 애플리케이션의 경우 GPT-4o가 선호됩니다. 높은 처리량과 비용 민감도가 중요하고 적당한 정확도가 허용되는 작업의 경우 GPT-4o-mini가 상당한 비용 절감을 제공합니다.
Llama 3 8B 및 70B와 같은 오픈소스 모델은 토큰당 비용 없이 자체 호스팅이 가능하다는 장점이 있지만, 인프라와 전문성이 필요합니다. OrcaRouter를 통한 GPT-4o-mini는 선불 비용 없이 서버리스 액세스를 제공하고 자동 확장이 가능합니다. 벤치마크에서 GPT-4o-mini의 MATH-500 점수는 78.9로, Llama 3 8B(약 30-40)와 경쟁력이 있으며 Llama 3 70B(약 60-70)에 가깝습니다. GPT-4o-mini는 또한 대부분의 오픈소스 모델이 지원하지 않는 이미지를 기본적으로 지원합니다. 트레이드오프: 오픈소스 모델은 데이터 프라이버시(외부 API 호출 없음)와 추론 하드웨어가 있을 경우 더 낮은 지연 시간을 제공합니다. GPT-4o-mini는 낮은 토큰당 가격으로 사용 편의성과 멀티모달 기능을 제공합니다.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| 입력 / 1M tokens | $0.150 |
| 출력 / 1M tokens | $0.600 |
| 캐시 읽기 / 1M | $0.075 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
@misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18