GPT-4o mini to najnowszy model OpenAI po [GPT-4 Omni](/models/openai/gpt-4o), obsługujący zarówno tekst, jak i obrazy na wejściu z wyjściem tekstowym. Jako ich najbardziej zaawansowany mały model, jest wielokrotnie bardziej przystępny cenowo...
GPT-4o-mini (2024-07-18) to lekki multimodalny model opracowany przez OpenAI, zaprojektowany do efektywnego kosztowo przetwarzania tekstu i obrazów. Jest przeznaczony dla programistów i organizacji,…
GPT-4o-mini może wykonywać zadania wnioskowania obrazowego, takie jak opisywanie treści wizualnych, odpowiadanie na pytania dotyczące obrazów oraz identyfikowanie obiektów lub tekstu wewnątrz obrazów. Obsługuje standardowe formaty obrazów (JPEG, PNG, GIF, WebP) i może przetwarzać wiele obrazów w jednym zapytaniu. Model nie wykonuje wykrywania obiektów w sensie strukturyzowanych ramek ograniczających, ale może opisywać lokalizacje i relacje. Na przykład może odczytać tekst z fotografii, rozumieć wykresy i diagramy oraz dostarczać szczegółowe opisy scen. Dokładność zadań opartych na obrazach zależy od rozdzielczości i kontekstu; obrazy o wysokiej rozdzielczości mogą wiązać się z wyższymi kosztami tokenów, ale mogą przynieść lepsze wyniki w przypadku drobnych szczegółów.
GPT-4o-mini akceptuje pliki wejściowe, takie jak pliki PDF, dokumenty Worda oraz obrazy, za pomocą multimodalnej struktury treści. Gdy plik jest dostarczony, model wyodrębnia z niego tekst i zawartość obrazu, umożliwiając użytkownikom zadawanie pytań dotyczących treści dokumentu, podsumowywanie jego tekstu lub analizowanie osadzonych tabel i wykresów. Plik nie jest przesyłany ani przechowywany – jest przetwarzany bezpośrednio podczas wywołania API. Jest to przydatne w przepływach pracy obejmujących przegląd dokumentów, analizę umów lub wyodrębnianie danych z zeskanowanych formularzy. Należy pamiętać, że bardzo duże pliki mogą przekroczyć okno kontekstowe o długości 128 000 tokenów lub generować wysokie koszty tokenów.
Do zadań wymagających jedynie lekkiego generowania tekstu, budżety tokenów mogą być lepiej obsłużone przez jeszcze tańsze modele, takie jak GPT-3.5-Turbo lub alternatywy open-source (np. Llama 3 8B). Jeśli twoje obciążenie nie wymaga multimodalnego wejścia ani kontekstu 128k, mniejszy model może dodatkowo obniżyć koszty. Ponadto w przypadku wąskich zadań, takich jak prosta klasyfikacja lub ekstrakcja słów kluczowych, dostrojony mniejszy model może zapewnić mniejsze opóźnienie i niższy koszt. Jednak połączenie niskiej ceny, dużego kontekstu i możliwości multimodalnych GPT-4o-mini czyni go silnym domyślnym wyborem dla wielu ogólnych zastosowań.
GPT-4o-mini sprawdza się w środowiskach produkcyjnych o dużej skali, które korzystają z multimodalnego rozumienia i dużych kontekstów. Idealne przypadki użycia obejmują chatboty obsługi klienta, które mogą obsługiwać zrzuty ekranu i długie historie rozmów, potoki przetwarzania dokumentów do wyodrębniania danych z plików PDF lub obrazów, narzędzia edukacyjne do korepetycji z matematyki (co potwierdza wynik 78.9 w MATH-500) oraz debugowanie kodu, w którym biorą udział zarówno tekst, jak i diagramy. Jest również dobrze dostosowany do przepływów pracy moderacji treści wymagających analizy obrazu wraz z tekstem. Niski koszt na token umożliwia skalowanie do milionów żądań bez wygórowanych kosztów.
GPT-4o-mini osiąga wynik 78.9 w benchmarku MATH-500, podzbiorze zbioru danych MATH składającym się z 500 wymagających problemów matematycznych. Wynik ten wskazuje na zdolność modelu do rozwiązywania zadań z arytmetyki, algebry, geometrii i innych problemów matematycznych z rozumowaniem krok po kroku. Wynik 78.9 plasuje go powyżej wielu mniejszych modeli i niektórych wcześniejszych wariantów GPT-4, co sugeruje silne zdolności rozumowania jak na model o takich rozmiarach i koszcie. Nie jest on jednak tak wydajny jak pełny GPT-4o czy GPT-4 Turbo w tym samym benchmarku. Wynik należy interpretować w kontekście: GPT-4o-mini został zaprojektowany z myślą o wydajności, a nie o maksymalnej dokładności.
Konkretne wartości opóźnień nie są publicznie ujawniane przez OpenAI, ale GPT-4o-mini jest generalnie szybsze od większych modeli GPT-4 ze względu na mniejszą liczbę parametrów. W praktyce użytkownicy raportują czas do pierwszego tokena w zakresie kilkuset milisekund dla krótkich podpowiedzi i przepustowość generowania na poziomie kilkudziesięciu tokenów na sekundę. Opóźnienie zależy od całkowitej liczby tokenów (wejściowych + wyjściowych), liczby obrazów oraz bieżącego obciążenia serwera. Ponieważ OrcaRouter działa jako proxy, dodatkowe opóźnienie sieciowe jest minimalne — zazwyczaj w granicach kilku milisekund w stosunku do bezpośredniego opóźnienia API OpenAI. Model obsługuje strumieniowanie do zastosowań czasu rzeczywistego.
Mocne strony: Opłacalność (najniższa cena wśród członków rodziny GPT-4 z obsługą multimodalną), duże okno kontekstowe 128k, solidne rozumowanie matematyczne (78,9 MATH-500) oraz szybka inferencja w porównaniu z większymi modelami. Radzi sobie z obrazami i plikami w ogólnych zadaniach. Ograniczenia: W przypadku złożonego, wymagającego rozumowania lub kreatywnego pisania wypada gorzej niż GPT-4o i GPT-4 Turbo. Jego podążanie za instrukcjami może być mniej niezawodne w zadaniach wymagających ścisłego formatowania lub wieloetapowych ograniczeń. Ponadto, jako mniejszy model, jego granica wiedzy (styczeń 2024) może być nieaktualna dla bardzo bieżących wydarzeń. Nie obsługuje również możliwości wizyjnych do szczegółowego wykrywania obiektów czy rozpoznawania twarzy.
Ceny wynoszą $0.15 za 1 milion tokenów wejściowych i $0.60 za 1 milion tokenów wyjściowych. Są to standardowe stawki dostawcy OpenAI, a OrcaRouter nie dolicza żadnej marży. Rozliczenie opiera się na liczbie tokenów zgłaszanej przez dostawcę modelu. Nie ma dodatkowych opłat za żądanie ani minimalnych kwot. Polityka zerowej marży dotyczy wszystkich modeli dostępnych za pośrednictwem OrcaRouter, co sprawia, że ceny są identyczne z tymi, które płaciłbyś bezpośrednio OpenAI. Ta przejrzystość pozwala użytkownikom na dokładne budżetowanie bez niespodziewanych kosztów.
Tokeny wyjściowe są czterokrotnie droższe na token niż tokeny wejściowe ($0,60 vs $0,15 za milion). W przypadku zadań generujących długie odpowiedzi, takich jak szczegółowe podsumowania czy generowanie kodu, koszty wyjściowe mogą dominować. Użytkownicy mogą kontrolować użycie tokenów wyjściowych za pomocą parametru max_tokens oraz poprzez formułowanie promptów skłaniających do zwięzłych odpowiedzi. Z kolei zadania z dużymi danymi wejściowymi (np. przetwarzanie długich dokumentów z wieloma obrazami) generują koszty wejściowe. Duże okno kontekstowe 128k ułatwia uwzględnianie obszernego kontekstu, ale wiąże się to ze stawką za token wejściowy. Optymalizacja równowagi między długością wejścia i wyjścia jest kluczowa dla zarządzania całkowitym kosztem.
OrcaRouter nie oferuje obecnie wbudowanego cache'owania dla żądań GPT-4o-mini poza tym, co OpenAI zapewnia na poziomie API. W OrcaRouter nie ma zniżek za ilość ani opcji rezerwowanej przepustowości; cennik jest ściśle oparty na modelu pay-as-you-go według stawek dostawcy OpenAI. Użytkownicy są odpowiedzialni za implementację własnych strategii cache'owania (np. na poziomie aplikacji), aby ograniczyć liczbę zduplikowanych wywołań API. Zasada zerowej marży oznacza, że wszelkie przyszłe zmiany cen przez OpenAI są odzwierciedlane automatycznie. W przypadku bardzo dużego wolumenu użycia bezpośrednie umowy enterprise z OpenAI mogą oferować korzystniejsze warunki, ale przez OrcaRouter prostota pojedynczego klucza API i jednolitego fakturowania wciąż może być zaletą.
Obrazy przetwarzane przez GPT-4o-mini są konwertowane na tokeny na podstawie ich rozdzielczości i poziomu szczegółowości. OpenAI używa algorytmu obliczania tokenów, który uwzględnia zarówno szerokość, jak i wysokość; na przykład typowy obraz 1024x1024 o wysokim poziomie szczegółowości może kosztować około 2000–3000 tokenów wejściowych. Ponieważ tokeny wejściowe są rozliczane po 0,15 USD za milion, koszt na obraz jest bardzo niski (zazwyczaj poniżej centa). Jednak przetwarzanie wielu obrazów w jednym żądaniu może się sumować. Użytkownicy mogą kontrolować koszty, używając poziomu szczegółowości `low` (kosztuje około 85 tokenów na obraz), gdy wysoka wierność nie jest wymagana. Zawsze sprawdzaj tokeny użyte w odpowiedzi API, aby zrozumieć koszty obrazów.
Ustaw bazowy URL API na https://api.orcarouter.ai/v1 i użyj identyfikatora modelu "openai/gpt-4o-mini-2024-07-18". API jest zgodne ze standardowym formatem uzupełniania czatów OpenAI. Na przykład w Pythonie: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "twój-klucz-orcarouter"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). Wszystkie parametry, takie jak temperature, top_p, max_tokens, stream i sekwencje stop, są obsługiwane jak w oryginalnym API OpenAI. Odpowiedzi zawierają standardowe pola, takie jak id, choices, usage z liczbą tokenów.
Aby uzyskać deterministyczne wyniki, ustaw temperature=0 i top_p=1. W zadaniach wymagających kreatywności odpowiednia może być temperatura w zakresie 0.8–1.2. Max_tokens kontroluje długość odpowiedzi; domyślnie wynosi 16 384. Aby obniżyć koszt generowania, ustaw max_tokens według własnych potrzeb. W przypadku danych multimodalnych strukturyzuj wiadomości przy użyciu tablicy części treści: [{"type":"text","text":"Opisz to:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. Do przetwarzania plików dołącz ich treść jako tekst lub base64. Parametr stop może służyć do zatrzymywania generacji na określonych sekwencjach. Stream=True umożliwia dostarczanie tokenów w czasie rzeczywistym.
Migracja wymaga trzech prostych zmian: Ustaw base_url na https://api.orcarouter.ai/v1, zastąp swój klucz API kluczem API OrcaRouter, i zmień identyfikator modelu na "openai/gpt-4o-mini-2024-07-18". Żadne inne modyfikacje kodu nie powinny być konieczne, jeśli używasz bibliotek OpenAI Python/Node.js lub dowolnego klienta HTTP, który stosuje standardowy format uzupełniania czatu. Struktura odpowiedzi jest identyczna. Zauważ, że OrcaRouter nie ogranicza przepustowości Twoich żądań inaczej niż OpenAI; te same limity szybkości obowiązują zgodnie z poziomem Twojego konta OpenAI, ale kluczami zarządzasz przez OrcaRouter. Przetestuj za pomocą małego żądania, aby zweryfikować liczbę tokenów i opóźnienie.
Podaj swój klucz API OrcaRouter w nagłówku Authorization: Authorization: Bearer <your-key>. API zwraca standardowe kody stanu HTTP: 200 – sukces, 400 – błędne żądanie (np. nieprawidłowe parametry), 401 – brak autoryzacji (nieprawidłowy klucz API), 429 – ograniczenie szybkości, 500 – błędy serwera. Odpowiedzi błędów zawierają ciało JSON z obiektem error zawierającym message i type. Zaleca się implementację ponownych prób z wykładniczym opóźnieniem dla błędów 429 i 5xx. OrcaRouter nie modyfikuje odpowiedzi błędów z OpenAI, więc te same komunikaty błędów, które widzisz w bezpośrednim API, pojawią się tutaj.
GPT-4o-mini jest znacząco bardziej wydajny niż GPT-3.5-Turbo w zakresie rozumowania, matematyki i wykonywania instrukcji, co potwierdza jego wynik w teście MATH-500 wynoszący 78,9 wobec typowego wyniku GPT-3.5-Turbo wynoszącego około 30-40. Obsługuje także wejścia multimodalne (obrazy i pliki), czego GPT-3.5-Turbo nie robi. Okno kontekstu jest większe: 128k vs 16k. Ceny: GPT-4o-mini ($0,15/$0,60 za milion tokenów) jest nieco droższy niż GPT-3.5-Turbo ($0,50/$1,50 dla wersji 16k? Właściwie GPT-3.5-Turbo 0125 to $0,50/$1,50 za milion? Czekaj, standardowy GPT-3.5-Turbo to $1,50/$2,00 za milion? Trzymam się podanych faktów: cena GPT-4o-mini jest podana. Porównanie jakościowe: GPT-4o-mini oferuje lepszą wydajność przy nieco wyższym koszcie niż GPT-3.5-Turbo, ale z możliwością multimodalną.
GPT-4o-mini to mniejsza, bardziej opłacalna wersja GPT-4o. Podczas gdy obie wersje mają możliwości multimodalne i ten sam rozmiar okna kontekstowego (128 tys. tokenów), GPT-4o osiąga wyższe wyniki w benchmarkach takich jak MMLU i MATH. Wynik GPT-4o-mini w MATH-500 wynoszący 78,9 jest niższy niż zgłaszany wynik GPT-4o wynoszący około 90–95. Ceny są znacznie niższe: GPT-4o-mini (0,15 USD / 0,60 USD) w porównaniu do GPT-4o (2,50 USD / 10,00 USD za milion tokenów). W przypadku aplikacji, w których maksymalna dokładność w złożonych zadaniach rozumowania jest kluczowa, preferowany jest GPT-4o. W przypadku zadań o dużej przepustowości i wrażliwych na koszty, gdzie akceptowalna jest umiarkowana dokładność, GPT-4o-mini oferuje znaczne oszczędności.
Modele open-source, takie jak Llama 3 8B i 70B, oferują przewagę samodzielnego hostowania przy zerowym koszcie za token, ale wymagają infrastruktury i wiedzy specjalistycznej. GPT-4o-mini za pośrednictwem OrcaRouter zapewnia dostęp bezserwerowy bez kosztów początkowych i z automatycznym skalowaniem. W testach porównawczych wynik GPT-4o-mini MATH-500 wynoszący 78,9 jest konkurencyjny w stosunku do Llama 3 8B (około 30-40) i bliższy Llama 3 70B (około 60-70). GPT-4o-mini obsługuje również natywnie obrazy, czego większość modeli open-source nie robi. Kompromis: modele open-source oferują prywatność danych (żadne zewnętrzne wywołania API) i niższe opóźnienia, jeśli dostępny jest sprzęt do inferencji. GPT-4o-mini oferuje łatwość użycia i możliwości multimodalne przy niskiej cenie za token.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Wejście / 1M tokenów | $0.150 |
| Wyjście / 1M tokenów | $0.600 |
| Odczyt cache / 1M | $0.075 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Otwórz @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18