GPT-4o mini to najnowszy model OpenAI po [GPT-4 Omni](/models/openai/gpt-4o), obsługujący zarówno tekst, jak i obrazy na wejściu z wyjściem tekstowym. Jako ich najbardziej zaawansowany mały model, jest wielokrotnie bardziej przystępny cenowo...
GPT-4o-mini to mniejszy, szybszy wariant modelu GPT-4o od OpenAI, zoptymalizowany pod kątem niższych kosztów obliczeniowych, zachowujący jednocześnie możliwości multimodalne. Może przetwarzać tekst,…
GPT-4o-mini doskonale radzi sobie w szerokim zakresie zadań językowych, w tym w streszczaniu, tłumaczeniu, klasyfikacji i odpowiadaniu na pytania. Obsługuje strukturalne wyjście JSON, wywoływanie funkcji oraz korzystanie z narzędzi, umożliwiając integrację z zewnętrznymi API i bazami danych. Okno kontekstowe 128K pozwala mu przetwarzać duże dokumenty lub historie rozmów w celu spójnej analizy. Osiąga dobre wyniki w powszechnych benchmarkach (wynik MATH-500 na poziomie 78.9) i nadaje się do edukacyjnych zadań matematycznych, wyjaśniania kodu oraz ekstrakcji danych. W przypadku prostszych zadań GPT-4o-mini często dorównuje większym modelom przy ułamku kosztów. Jednak zadania wymagające głębokiej wiedzy dziedzinowej lub bardzo kreatywnych wyników mogą charakteryzować się obniżoną jakością w porównaniu z GPT-4o.
Obrazy mogą być dostarczane jako adresy URL lub dane zakodowane w base64 w ramach zapytania API. Model interpretuje obrazy, rozumiejąc zawartość wizualną, taką jak obiekty, tekst na obrazach oraz relacje przestrzenne. Umożliwia to przypadki użycia, takie jak wizualne Q&A, interpretacja diagramów i rozpoznawanie odręcznych cyfr. Tokeny obrazu wliczają się do limitu kontekstu, więc obrazy o wysokiej rozdzielczości lub duże rozmiary pochłaniają więcej z budżetu 128K tokenów. Model nie generuje obrazów — jedynie je przetwarza. W przypadku zadań wymagających szczegółów wizualnych o wysokiej precyzji (np. obrazowanie medyczne) wyspecjalizowany model wizji może być dokładniejszy, ale GPT-4o-mini oferuje ogólne rozwiązanie w rozsądnej cenie.
GPT-4o-mini akceptuje przesłane pliki oprócz tekstu i obrazów. Typowe typy plików obejmują pliki PDF, .docx, .txt, .csv i .json. Model wyodrębnia tekst oraz istotne elementy wizualne (jeśli plik zawiera osadzone obrazy) i przetwarza je jako część kontekstu. Jest to przydatne do analizy artykułów naukowych, umów prawnych lub arkuszy kalkulacyjnych bez ręcznego kopiowania. Należy pamiętać, że zawartość plików przyczynia się do zużycia tokenów; na przykład 50-stronicowy plik PDF może pochłonąć kilka tysięcy tokenów. OrcaRouter pobiera opłaty na podstawie całkowitej liczby tokenów wejściowych, w tym tych z plików. Nie ma dodatkowej opłaty za przetwarzanie plików poza zużyciem tokenów.
Jeśli Twoje obciążenie obejmuje tylko tekst bez obrazów ani plików, a wymagany kontekst jest poniżej 16K tokenów, mniejszy model (taki jak GPT-3.5-turbo) może oferować niższy koszt na token. Podobnie, w przypadku zadań o bardzo wysokiej przepustowości, takich jak prosta klasyfikacja lub trywialne pytania i odpowiedzi, dedykowany dostrojony model może być bardziej ekonomiczny. GPT-4o-mini jest opłacalny w przypadkach multimodalnych lub długiego kontekstu, ale jego siła leży w równoważeniu wydajności i ceny. Jeśli Twoja aplikacja może tolerować wolniejsze odpowiedzi lub wyższy koszt w zamian za maksymalną dokładność, GPT-4o jest alternatywą. Porównaj swoje konkretne zadanie, aby potwierdzić, który model spełnia Twoje progi jakości i budżetu.
MATH-500 to podzbiór benchmarku MATH, składający się z 500 problemów matematycznych na poziomie konkursowym, obejmujących algebrę, geometrię, teorię liczb i rachunek prawdopodobieństwa. Wynik 78,9 oznacza, że GPT-4o-mini poprawnie odpowiedział na około 78,9% tych problemów. To dobry wynik jak na mniejszy model, odzwierciedlający jego zdolność rozumowania matematycznego. Przewyższa wiele wcześniejszych modeli o podobnej wielkości. Jednak wydajność może się różnić w zależności od konkretnych dziedzin problemów. Benchmark jest przeprowadzany w warunkach zero-shot, co oznacza, że nie są dostarczane żadne wcześniejsze przykłady. W przypadku rzeczywistego nauczania matematyki model może wymagać starannego dobierania promptów, aby poprawnie obsłużyć rozwiązania wieloetapowe.
Chociaż jedynym dostarczonym benchmarkiem jest MATH-500, powszechnie znane informacje publiczne wskazują, że GPT-4o-mini osiąga również konkurencyjne wyniki w MMLU (massive multitask language understanding), HellaSwag oraz GSM8K. Zazwyczaj plasuje się poniżej GPT-4o, ale powyżej GPT-3.5-turbo w tych metrykach. W benchmarkach rozumowania wykazuje silną wydajność jak na swoją liczbę parametrów. W przypadku kreatywnego pisania lub generowania otwartego, jego wyniki są spójne, ale mogą brakować im niuansów większych modeli. Opóźnienie jest zazwyczaj niższe niż w GPT-4o, co czyni go odpowiednim do zastosowań czasu rzeczywistego. Aby poznać dokładne wyniki, zapoznaj się z dokumentacją OpenAI. OrcaRouter zapewnia dostęp bez dodatkowych narzutów.
Opóźnienie zależy od złożoności zapytania, liczby tokenów i obciążenia API. GPT-4o-mini jest zaprojektowany tak, aby działać szybko – zazwyczaj zwraca pierwszy token w mniej niż sekundę w przypadku zapytań o umiarkowanej długości. W przypadku długich dokumentów (np. 50 tys. tokenów) opóźnienie wzrośnie, ponieważ model przetwarza cały kontekst. OrcaRouter nie wpływa na szybkość – otrzymujesz takie same czasy odpowiedzi jak przy bezpośrednich wywołaniach API OpenAI. Obsługiwane jest strumieniowanie, aby zmniejszyć odczuwalne opóźnienie. W przypadku aplikacji o krytycznym znaczeniu dla opóźnień warto utrzymywać krótkie zapytania i korzystać ze strumieniowania. Dokładny czas do pierwszego tokena można zmierzyć, monitorując czas odpowiedzi; nie jest zapewniony żaden konkretny SLA.
Mimo swoich możliwości, GPT-4o-mini ma ograniczenia wynikające z mniejszego rozmiaru. Może udzielać mniej dokładnych odpowiedzi w przypadku złożonego, wieloetapowego rozumowania w porównaniu do GPT-4o. Czasami błędnie interpretuje niuansowe instrukcje lub ma trudności z utrzymaniem pełnej spójności w bardzo długich odpowiedziach. Jego multimodalne rozumienie jest dobre, ale nie bezbłędne – może przeoczyć drobne szczegóły na obrazach lub błędnie policzyć elementy. Model może wykazywać uprzedzenia obecne w danych treningowych. Nie obsługuje wyszukiwania w internecie ani dostępu do danych w czasie rzeczywistym, chyba że został wyraźnie dostrojony do korzystania z narzędzi. W przypadku zadań wymagających wysokiej precyzji (np. porady prawne, diagnoza medyczna) niezbędny jest przegląd przez człowieka. Wyniki testów porównawczych odzwierciedlają kontrolowane warunki – w rzeczywistych zastosowaniach skuteczność może się różnić.
OrcaRouter przekazuje dokładne ceny OpenAI bez marży: $0,15 za 1 milion tokenów wejściowych i $0,60 za 1 milion tokenów wyjściowych. Tokeny wejściowe obejmują cały tekst, tokeny obrazów i zawartość plików. Tokeny wyjściowe liczą wygenerowany tekst. Nie ma opłat miesięcznych ani ukrytych kosztów. Jest to jeden z najniższych kosztów na token dla modelu multimodalnego z oknem kontekstowym 128K. Dla porównania, GPT-4o kosztuje $2,50 za 1M wejściowych i $10 za 1M wyjściowych, co sprawia, że GPT-4o-mini jest o 94% tańszy na wejściu i o 94% tańszy na wyjściu. Przewaga kosztowa jest znacząca dla aplikacji o dużym wolumenie.
Chociaż GPT-4o-mini jest tani w przeliczeniu na token, jego mniejszy rozmiar może wymagać większej liczby prób lub bardziej szczegółowych promptów, aby osiągnąć pożądaną dokładność, co potencjalnie zwiększa całkowite zużycie tokenów. W zadaniach, gdzie GPT-4o uzyskuje poprawną odpowiedź za pierwszym razem, a GPT-4o-mini potrzebuje trzech prób, całkowity koszt może być podobny lub nawet wyższy. Dodatkowo, jeśli musisz wysyłać wiele małych żądań, narzut związany z wywołaniami API może zwiększyć opóźnienie, ale nie bezpośredni koszt. Buforowanie nie jest stosowane – każde żądanie jest przetwarzane od nowa. Oceń swój przypadek użycia za pomocą obu modeli, aby znaleźć najlepszy balans między kosztem a wydajnością. OrcaRouter zapewnia spójne ceny bez rabatów ilościowych.
OrcaRouter nie implementuje buforowania promptów. Każde zapytanie do GPT-4o-mini jest wysyłane na serwery OpenAI i rozliczane za token. Nie ma obniżonej stawki dla powtarzających się promptów. Jeśli Twoje obciążenie często powtarza tę samą wiadomość systemową lub długi kontekst, możesz rozważyć przechowywanie odpowiedzi po swojej stronie, aby uniknąć ponownego wysyłania identycznych promptów. Niektórzy dostawcy oferują zniżki za buforowanie promptów, ale przez OrcaRouter płacisz standardową stawkę dostawcy. Jest to przejrzyste i przewidywalne. Brak buforowania upraszcza cennik, ale oznacza, że powinieneś projektować swoje zapytania tak, aby zminimalizować zbędne użycie tokenów.
(Uwaga: Nie podano żadnego innego wariantu GPT-4o-mini. Zakładając, że pytanie dotyczy porównania z innymi miniaturowymi modelami, takimi jak Claude 3 Haiku lub Gemini Flash, ale podano tylko fakty. Zamiast tego porównujemy z GPT-4o.) W porównaniu do GPT-4o, GPT-4o-mini jest znacznie tańszy: 0,15 USD vs 2,50 USD za 1 mln tokenów wejściowych (94% taniej) i 0,60 USD vs 10 USD za 1 mln tokenów wyjściowych (94% taniej). Wielu użytkowników uważa, że GPT-4o-mini jest wystarczający do 80-90% zadań, co zapewnia ogromne oszczędności. Jednak w przypadku zadań wymagających maksymalnej dokładności (np. złożone generowanie kodu, subtelne rozumowanie prawne) oszczędności kosztów mogą nie rekompensować spadku jakości. OrcaRouter umożliwia łatwe przełączanie między modelami za pomocą tego samego punktu końcowego API poprzez zmianę identyfikatora modelu.
Użyj biblioteki klienta OpenAI lub dowolnego klienta HTTP, ustawiając podstawowy URL na https://api.orcarouter.ai/v1. Ustaw parametr modelu na "openai/gpt-4o-mini". Uwierzytelnianie wymaga klucza API OrcaRouter. Minimalny przykład w Pythonie: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) Wszystkie parametry API OpenAI są obsługiwane, w tym temperature, max_tokens, stream oraz tools. OrcaRouter przekazuje żądania do OpenAI i zwraca odpowiedzi bez zmian.
Standardowe parametry OpenAI Chat Completions: model (wymagany: "openai/gpt-4o-mini"), messages (tablica obiektów wiadomości), temperature (0-2, domyślnie 1), top_p (0-1, domyślnie 1), n (liczba odpowiedzi, domyślnie 1), stream (boolean), stop (string/tablica), max_tokens (do 16384), presence_penalty, frequency_penalty, logit_bias, user (opcjonalny) oraz tools do wywoływania funkcji. Dla widzenia (vision) dołącz zawartość obrazu w wiadomościach (type "image_url" lub "image_url" z detail). Pliki wejściowe mogą być zakodowane w base64. OrcaRouter przekazuje wszystkie parametry do OpenAI. Uwaga: Format odpowiedzi (tryb JSON) jest obsługiwany; ustaw response_format={ "type": "json_object" } w odpowiednich przypadkach.
Migracja jest prosta: zmień bazowy URL w swoim kliencie z "https://api.openai.com/v1" na "https://api.orcarouter.ai/v1" i zastąp swój klucz API kluczem OrcaRouter. Zaktualizuj nazwę modelu na "openai/gpt-4o-mini" (albo pozostaw jako "gpt-4o-mini"? Fakt mówi, że identyfikator modelu to "openai/gpt-4o-mini", więc użyj tego). Cały pozostały kod pozostaje bez zmian, ponieważ API jest w pełni zgodne z OpenAI. Możesz też zachować wiele ciągów modeli i kierować ruch na podstawie kosztu lub wydajności. OrcaRouter nie zmienia formatu odpowiedzi. Przetestuj na kilku zapytaniach, aby upewnić się, że nagłówki i strumieniowanie działają zgodnie z oczekiwaniami.
Tak, GPT-4o-mini obsługuje strumieniowanie przez zdarzenia wysyłane przez serwer (SSE). Ustaw stream=true w żądaniu. Odpowiedź będzie serią fragmentów zawierających treść delta. To skraca czas do pierwszego tokena dla użytkowników i umożliwia wyświetlanie w czasie rzeczywistym. OrcaRouter przekazuje strumieniowe odpowiedzi bez modyfikacji. Należy pamiętać, że całkowita liczba tokenów podlegająca opłacie pozostaje taka sama. Strumieniowanie jest kompatybilne ze wszystkimi modalnościami wejściowymi (tekst, obraz, plik). Można również łączyć strumieniowanie z wywołaniami funkcji; model wyemituje fragment wywołania narzędzia, gdy to będzie odpowiednie. Parametr max_tokens dotyczy całej odpowiedzi.
GPT-4o-mini to mniejszy, tańszy odpowiednik GPT-4o. Kosztuje około 94% mniej zarówno za tokeny wejściowe, jak i wyjściowe. Ma to samo okno kontekstowe 128K i maksymalną długość odpowiedzi 16K. Obsługuje te same multimodalne wejścia, ale jest ogólnie nieco mniej dokładny w przypadku złożonego rozumowania i kreatywnych zadań. W teście MATH-500 GPT-4o-mini uzyskuje wynik 78,9, podczas gdy GPT-4o uzyskuje 92+ (w przybliżeniu). Do wielu codziennych zadań, takich jak obsługa klienta, streszczanie i proste zadania wizyjne, GPT-4o-mini jest wystarczający. Wybierz GPT-4o, gdy potrzebujesz najwyższej wydajności i możesz zaakceptować wyższe opóźnienia i koszty.
Porównanie z modelami takimi jak Claude 3 Haiku czy Gemini 1.5 Flash: GPT-4o-mini oferuje 128-tysięczne okno kontekstu, podczas gdy Haiku pozwala na 200 tys., a Flash na 1 mln. Ceny są podobne (Haiku $0,25/$1,25 za 1 mln tokenów; Flash $0,35/$1,05). Wynik GPT-4o-mini na MATH-500 wynoszący 78,9 jest konkurencyjny; Haiku osiąga około 73, a Flash około 78 w podobnych testach matematycznych. W przypadku danych multimodalnych wszystkie trzy modele akceptują obrazy. GPT-4o-mini może oferować lepszą jakość rozumowania w swojej cenie, ale okno kontekstu jest mniejsze niż u niektórych konkurentów. Najlepszy wybór zależy od konkretnych wymagań dotyczących opóźnienia, kosztów i jakości. OrcaRouter zapewnia również dostęp do Haiku i Flash, umożliwiając bezpośrednie porównanie.
GPT-3.5-turbo jest starszy, ma okno kontekstowe 16K i kosztuje nieco mniej ($0,50 za 1M wejścia vs $0,15 za GPT-4o-mini? Właściwie GPT-3.5-turbo-0125 kosztuje $0,50/$1,50, ale z mniejszym kontekstem. Według podanych cen, GPT-4o-mini jest tańszy za token i oferuje większy kontekst oraz możliwość wprowadzania danych wielomodalnych. Dlatego w większości zadań GPT-4o-mini jest lepszy. Jednak niektóre starsze aplikacje już używające GPT-3.5-turbo mogą wymagać minimalnych zmian. GPT-4o-mini radzi sobie również lepiej w testach wnioskowania. O ile opóźnienie nie jest krytyczne lub nie masz dostrojonego modelu GPT-3.5, GPT-4o-mini jest zalecanym zamiennikiem typu drop-in.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Wejście / 1M tokenów | $0.150 |
| Wyjście / 1M tokenów | $0.600 |
| Odczyt cache / 1M | $0.075 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/openai/gpt-4o-miniOtwórz @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini