Wersja GPT-4o z 2024-08-06 oferuje lepszą wydajność w zakresie ustrukturyzowanych wyników, z możliwością dostarczenia schematu JSON w respone_format. Czytaj więcej [tutaj](https://openai.com/index/introducing-structured-outputs-in-the-api/). GPT-4o ("o" jak "omni") to...
GPT-4o (2024-08-06) to wersja modelu GPT-4o od OpenAI, wydana w sierpniu 2024 roku. Jest to wielomodalny duży model językowy, który przetwarza dane wejściowe w postaci tekstu, obrazów i plików. Model…
Główne atuty modelu to rozumowanie matematyczne i rozumienie multimodalne. Jego wynik 79.5 w teście MATH-500 wskazuje na silną zdolność do rozwiązywania złożonych problemów matematycznych krok po kroku. Potrafi interpretować obrazy, diagramy i wykresy, dostarczając dokładnych opisów lub analiz. Okno kontekstu o wielkości 128K pozwala mu przetwarzać duże ilości informacji, takie jak cała książka lub seria obrazów z powiązanym tekstem. Obsługuje również przesyłanie plików, co czyni go przydatnym do zadań takich jak wyodrębnianie danych z arkuszy kalkulacyjnych lub odczytywanie plików z kodem. Te możliwości są wspierane przez ciągłą optymalizację OpenAI, a model jest szeroko używany w środowiskach produkcyjnych.
GPT-4o (2024-08-06) wyróżnia się w zadaniach wymagających łączenia informacji wizualnych i tekstowych. Przykłady obejmują rozwiązywanie problemów matematycznych z diagramami, analizę zrzutów ekranu interfejsów użytkownika pod kątem raportów o błędach, wyodrębnianie danych ze skanowanych dokumentów oraz szczegółowe wyjaśnienia skomplikowanych ilustracji. Jest również skuteczny w generowaniu kodu i debugowaniu, gdy kontekst zawiera zrzuty ekranu błędów lub struktury plików. Aplikacje edukacyjne korzystają z jego logicznego rozumowania krok po kroku. W przypadku zadań czysto tekstowych i prostych, takich jak podstawowe pytania i odpowiedzi lub podsumowania krótkich tekstów, tańszy model, taki jak GPT-4o mini, może być wystarczający. Model ten najlepiej rezerwować dla wysokowartościowych, multimodalnych lub wymagających intensywnego rozumowania przepływów pracy.
W przypadku zadań, które nie wykorzystują obrazu, przetwarzania plików ani zaawansowanego rozumowania, mniejszy i tańszy model jest bardziej opłacalny. Na przykład proste aplikacje czatowe, generowanie krótkich treści lub zadania klasyfikacji mogą być obsługiwane przez modele takie jak GPT-4o mini lub GPT-3.5 Turbo. Jeśli Twoja aplikacja przetwarza tylko tekst i nie wymaga okna kontekstowego 128K, model z mniejszym kontekstem może zmniejszyć opóźnienie i koszt. Dodatkowo, jeśli Twoje dane nie obejmują obrazów ani plików, model tekstowy jest wystarczający. Oceń, czy złożoność zadania uzasadnia wyższą cenę za token modelu GPT-4o. OrcaRouter oferuje gamę modeli w różnych przedziałach cenowych, aby dopasować się do różnych przypadków użycia.
Tak, model akceptuje wprowadzanie plików. Możesz przesyłać pliki takie jak PDF-y, dokumenty Word, arkusze kalkulacyjne, obrazy i pliki z kodem. Model wyodrębnia i rozumie zawartość tych plików, traktując je jako część kontekstu. Na przykład może odczytać tekst z PDF-a, interpretować liczby w CSV lub analizować kod źródłowy w pliku .py. W połączeniu z wprowadzaniem obrazów może przetwarzać treści mieszane, takie jak dokument z osadzonymi wykresami. Jest to szczególnie przydatne do automatyzacji ekstrakcji danych, przeglądu dokumentów i analizy kodu. Należy pamiętać, że przetwarzanie plików wlicza się do okna kontekstowego 128 000 tokenów, więc duże pliki mogą zajmować znaczną ilość miejsca.
W benchmarku MATH-500 model GPT-4o (2024-08-06) osiągnął wynik 79,5. MATH-500 to podzbiór zbioru danych MATH, składający się z 500 wymagających zadań matematycznych na poziomie konkursowym, obejmujących tematy takie jak algebra, geometria, teoria liczb i rachunek prawdopodobieństwa. Wynik 79,5 oznacza poprawne odpowiedzi na około cztery z pięciu zadań. Plasuje to model wśród najlepszych w zakresie rozumowania matematycznego. Chociaż nie podano wyników z innych benchmarków, ta miara pokazuje siłę modelu w krok po kroku logicznym wnioskowaniu i arytmetyce. Użytkownicy mogą oczekiwać niezawodnej wydajności w aplikacjach wymagających dużego nakładu matematyki, takich jak korepetycje, weryfikacja i generowanie zadań.
Szczegółowe wyniki benchmarków poza MATH-500 nie są podane w dostępnych faktach. Jednak rodzina modeli GPT-4o jest powszechnie znana z konkurencyjnych wyników w zakresie standardowych benchmarków, takich jak MMLU (masywne wielozadaniowe rozumienie języka), HumanEval (generowanie kodu) oraz różnych zadań wizyjno-językowych. Wersja z sierpnia 2024 roku może zawierać aktualizacje poprawiające wnioskowanie i śledzenie instrukcji. Bez dokładnych liczb użytkownicy powinni odwoływać się do opublikowanych ewaluacji OpenAI, aby uzyskać najbardziej aktualne dane. Dla celów praktycznych model uważany jest za najnowocześniejszy wśród modeli z otwartym API pod względem połączonych możliwości tekstowych i wizyjnych.
Brak konkretnych danych dotyczących opóźnień i przepustowości dla tego modelu. Ogólnie GPT-4o jest zaprojektowane tak, aby było szybsze od wcześniejszych wariantów GPT-4, przy zachowaniu jakości. Opóźnienie zależy od czynników takich jak długość wejścia i wyjścia, liczba równoczesnych zapytań oraz infrastruktura backendu. Gdy dostęp jest realizowany przez OrcaRouter, zapytania są kierowane do serwerów OpenAI, a czasy odpowiedzi są podobne jak w przypadku bezpośrednich wywołań API. Użytkownicy mogą zoptymalizować działanie, używając najmniejszego niezbędnego kontekstu i ustawiając rozsądne limity max_tokens. W przypadku aplikacji czasu rzeczywistego zaleca się testowanie z reprezentatywnymi obciążeniami. OrcaRouter nie wprowadza dodatkowego opóźnienia poza routingiem sieciowym.
Mocne strony: silne rozumowanie matematyczne (MATH-500 79,5), multimodalne wejście (tekst, obrazy, pliki), duże okno kontekstu 128K oraz wysoki limit tokenów wyjściowych (16 384). Jest szczególnie skuteczny w przypadku złożonego rozumowania, rozumienia obrazów i zadań wymagających długiego kontekstu. Ograniczenia: wyższy koszt w porównaniu z mniejszymi modelami; może nie być optymalny do prostych zadań lub zadań o niskim opóźnieniu; dokładność może się różnić w przypadku niejednoznacznych lub źle sformatowanych danych wejściowych; możliwości wizyjne mogą nie działać dobrze na zniekształconych lub niskiej rozdzielczości obrazach. Ponadto, jak wszystkie LLM, może generować pozornie poprawne, ale nieprawidłowe odpowiedzi, zwłaszcza w dziedzinach spoza danych treningowych. Można to złagodzić poprzez walidację wyników i stosowanie inżynierii promptów.
Cennik dla GPT-4o (2024-08-06) opiera się na użyciu tokenów. Tokeny wejściowe są rozliczane w cenie 2,50 USD za 1 milion tokenów. Tokeny wyjściowe są rozliczane w cenie 10,00 USD za 1 milion tokenów. Jest to stawka dostawcy (OpenAI), a OrcaRouter nie dolicza żadnej marży – płacisz dokładnie tyle samo, co w przypadku bezpośredniego wywołania OpenAI. Tokeny są liczone na podstawie wysłanego i odebranego tekstu. Obrazy i pliki wejściowe zużywają tokeny proporcjonalnie do ich rozmiaru i złożoności przetwarzania (koszt tokenów dla obrazów jest zgodny z polityką OpenAI). Nie ma dodatkowych opłat za korzystanie z punktu końcowego API. Rozliczenia są zazwyczaj agregowane za okres użytkowania, a zużycie tokenów możesz monitorować za pomocą panelu OrcaRouter.
Żadnych ukrytych kosztów ani dopłat. OrcaRouter rozlicza się według dokładnej stawki dostawcy, bez żadnej marży. Podane ceny (2,50 $ za 1M wejściowych tokenów, 10 $ za 1M wyjściowych tokenów) są już w pełni kompleksowe. Nie ma dodatkowych opłat za uwierzytelnianie, połączenie czy wsparcie techniczne. Jednak dane wejściowe w postaci obrazów i plików wiążą się z kosztami tokenów określonymi przez politykę cenową OpenAI, które mogą przekraczać koszt tokenów dla samego tekstu. Na przykład obraz o rozdzielczości 1080×1080 może kosztować określoną liczbę tokenów poza tokenami tekstowymi. Sprawdź dokumentację OpenAI, aby poznać dokładne ceny tokenów dla obrazów. OrcaRouter przenosi te koszty bez marży. Według obecnych informacji nie ma zniżek opartych na buforowaniu (cache).
Wybór GPT-4o (2024-08-06) zamiast tańszych modeli, takich jak GPT-4o mini czy GPT-3.5 Turbo, wiąże się z kompromisem między wydajnością a kosztami. Cena za token jest wyższa, więc w przypadku aplikacji o dużej skali koszty mogą szybko rosnąć. Jeśli jednak zadanie wymaga możliwości multimodalnych modelu lub 128K kontekstu, tańsze modele mogą nie wystarczyć, co potencjalnie prowadzi do niekompletnych lub niższej jakości wyników. W przypadku zadań tekstowych z prostym wnioskowaniem tańszy model obniża wydatki bez większego uszczerbku na jakości. OrcaRouter umożliwia łatwe przełączanie między modelami, dzięki czemu możesz eksperymentować, aby znaleźć najlepszą równowagę kosztów i wydajności dla każdego przypadku użycia.
Dostępne fakty nie wspominają o żadnych mechanizmach buforowania ani rabatów dla tego modelu. OrcaRouter rozlicza według stawki dostawcy bez marży, więc wszelkie rabaty pochodziłyby prawdopodobnie z własnych cen OpenAI (np. rabaty warstwowe dla dużego wolumenu użycia, jeśli dotyczy). OrcaRouter może oferować własne funkcje buforowania, ale nie zostało to potwierdzone dla tego modelu. Aby zminimalizować koszty, rozważ zmniejszenie użycia tokenów wejściowych przez skracanie historii konwersacji, używanie krótszych promptów oraz ograniczenie długości odpowiedzi za pomocą parametru max_tokens. W przypadku powtarzających się identycznych zapytań możesz zaimplementować buforowanie na poziomie aplikacji.
Aby wywołać GPT-4o (2024-08-06) przez OrcaRouter, użyj podstawowego adresu URL https://api.orcarouter.ai/v1 i ustaw identyfikator modelu na "openai/gpt-4o-2024-08-06". API jest w pełni kompatybilne z bibliotekami klienckimi OpenAI. Na przykład w Pythonie z biblioteką openai skonfigurujesz openai.api_base = "https://api.orcarouter.ai/v1" i openai.api_key = "your-orcarouter-api-key". Następnie wywołaj openai.ChatCompletion.create(model="openai/gpt-4o-2024-08-06", messages=[...]). Wszystkie standardowe parametry (temperature, max_tokens, top_p, itp.) są obsługiwane. Szczegóły dotyczące uwierzytelniania i limitów prędkości znajdziesz w dokumentacji OrcaRouter.
Ponieważ model obsługuje API zgodne z OpenAI, możesz użyć pełnego zestawu parametrów dostępnych w punkcie końcowym uzupełnień czatu OpenAI. Kluczowe parametry to: model (ustawiony na ID modelu), messages (lista obiektów rola-treść), temperature (0-2), top_p (0-1), n (liczba uzupełnień), max_tokens (do 16384), stop (sekwencje), frequency_penalty, presence_penalty, logit_bias oraz user (do śledzenia użycia). W przypadku danych multimodalnych dołączasz obraz lub file_url w treści wiadomości w odpowiednim formacie (np. content: [{type: "text", text: "..."}, {type: "image_url", image_url: {...}}]). Zapoznaj się z dokumentacją OpenAI dotyczącą składni obrazów i plików.
Migracja z bezpośredniego API OpenAI do OrcaRouter wymaga dwóch zmian: 1) Ustaw podstawowy URL na https://api.orcarouter.ai/v1 oraz 2) Zastąp swój klucz API OpenAI kluczem API OrcaRouter. Nie są wymagane żadne zmiany w kodzie dotyczące formatowania wiadomości ani parametrów. Identyfikator modelu zmienia się z "gpt-4o-2024-08-06" na "openai/gpt-4o-2024-08-06". Cała istniejąca logika obsługi strumieniowania, wywoływania funkcji i parsowania odpowiedzi pozostaje taka sama. API OrcaRouter zostało zaprojektowane jako bezpośredni zamiennik. Po przełączeniu możesz również uzyskać dostęp do modeli innych dostawców za pomocą tego samego interfejsu, co umożliwia łatwe porównywanie i równoważenie obciążenia.
Uwierzytelnianie odbywa się za pomocą klucza API dostarczonego przez OrcaRouter. Należy go umieścić w nagłówku jako "Authorization: Bearer YOUR_ORCAROUTER_API_KEY". Limity szybkości są zarządzane przez OrcaRouter i mogą różnić się od bezpośrednich limitów OpenAI. Sprawdź swój plan OrcaRouter, aby poznać szczegóły. Jeśli przekroczysz limity szybkości, otrzymasz odpowiedzi HTTP 429. Aby temu zapobiec, zaimplementuj logikę ponawiania z wykładniczym wycofaniem. OrcaRouter może również pozwolić na ustawienie limitów szybkości na użytkownika za pomocą parametru user. W przypadku potrzeb o wysokiej przepustowości skontaktuj się z pomocą techniczną OrcaRouter w celu ustalenia niestandardowych rozwiązań. Sam model nie ma osobnych limitów szybkości – podlega ogólnym limitom punktu końcowego.
GPT-4o (2024-08-06) jest pełnowymiarowym flagowym modelem, podczas gdy GPT-4o mini jest mniejszym, tańszym wariantem. Kluczowe różnice: GPT-4o ma okno kontekstu 128K (w porównaniu do GPT-4o mini, które również ma 128K, ale mini ma niższy limit wyjścia, zazwyczaj również 16K? Właściwie to GPT-4o mini również ma kontekst 128K i wyjście 16K, ale jest mniej wydajne w zakresie rozumowania i widzenia). Pełny model uzyskuje 79.5 w MATH-500; GPT-4o mini osiąga niższe wyniki w benchmarkach matematycznych. Cennik: GPT-4o jest droższe ($2.50/$10 w porównaniu do GPT-4o mini za $0.15/$0.60 za 1M tokenów). W przypadku zadań wymagających dużej dokładności lub złożonego rozumowania, pełny model jest uzasadniony. W przypadku prostszych zadań, mini stanowi opłacalną alternatywę.
W porównaniu do GPT-4 (np. GPT-4-0613 lub GPT-4 Turbo), GPT-4o (2024-08-06) oferuje kilka ulepszeń: natywne wejście multimodalne (tekst, obrazy, pliki) bez konieczności stosowania oddzielnych modeli wizyjnych, większe okno kontekstowe (128K w porównaniu do 32K w starszych wersjach GPT-4) oraz szybsze wnioskowanie. Ceny są niższe niż we wcześniejszych wariantach GPT-4, które często były droższe. Na przykład GPT-4 Turbo miał podobny kontekst, ale wyższe ceny. Pod względem benchmarków, wynik MATH-500 wynoszący 79,5 przewyższa starsze modele GPT-4. Jednak niektórzy użytkownicy mogą uznać wcześniejsze modele za bardziej stabilne w konkretnych zadaniach ze względu na dłuższą historię treningu. Ogólnie rzecz biorąc, GPT-4o jest bardziej nowoczesnym i wydajnym następcą.
Wybór zależy od konkretnych potrzeb i preferencji dostawcy. GPT-4o (2024-08-06) doskonale radzi sobie z rozumowaniem matematycznym (MATH-500 79.5) oraz zadaniami multimodalnymi z tekstem, obrazami i plikami. Modele Claude od Anthropic mogą oferować silniejsze funkcje bezpieczeństwa lub dłuższe okna kontekstowe w niektórych wersjach, ale zazwyczaj mają wyższe ceny. Modele Gemini od Google zapewniają multimodalność i duży kontekst, ale mogą mieć inne profile wydajności. Korzystając z OrcaRouter, możesz testować wielu dostawców za pomocą jednego API. W przypadku zadań wymagających wysokiej dokładności matematycznej, GPT-4o jest silnym kandydatem. W przypadku czystej sumaryzacji tekstu lub zadań o niskich kosztach, inne modele mogą być bardziej ekonomiczne. Oceń wyniki benchmarków i ceny dla swojego przypadku użycia.
Podczas korzystania z GPT-4o za pośrednictwem OrcaRouter, Twoje dane są wysyłane do serwerów OpenAI w celu przeprowadzenia wnioskowania. OrcaRouter nie przechowuje ani nie przetwarza Twoich promptów poza ich przekazywaniem dalej. Obowiązują zasady korzystania z danych przez OpenAI – sprawdź warunki OpenAI, jeśli masz obawy dotyczące wykorzystania danych do trenowania modeli lub ich przechowywania. Jeśli potrzebujesz, aby dane pozostały w określonej jurysdykcji lub chcesz uniknąć niektórych dostawców, OrcaRouter pozwala wybrać spośród wielu dostawców dla każdego żądania. Możesz również skorzystać z funkcji routingu OrcaRouter, aby kierować zapytania do dostawców spełniających Twoje wymogi zgodności. Zawsze zapoznaj się z dokumentacją dotyczącą przetwarzania danych zarówno OrcaRouter, jak i podstawowego dostawcy.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-08-06",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Wejście / 1M tokenów | $2.50 |
| Wyjście / 1M tokenów | $10.00 |
| Odczyt cache / 1M | $1.25 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/openai/gpt-4o-2024-08-06Otwórz @misc{orcarouter_gpt_4o_2024_08_06,
title = {GPT-4o (2024-08-06) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06}
}OpenAI. (2024). GPT-4o (2024-08-06) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06