GPT-4o ("o" od "omni") to najnowszy model AI firmy OpenAI, obsługujący zarówno tekst, jak i obrazy jako wejścia, z wyjściem tekstowym. Utrzymuje poziom inteligencji [GPT-4 Turbo](/models/openai/gpt-4-turbo), będąc dwa razy...
GPT-4o (2024-05-13) to wielomodalny model językowy od OpenAI, dostępny przez API OrcaRouter. Przetwarza tekst, obrazy i pliki, dzięki czemu nadaje się do zadań łączących dane wizualne i tekstowe.…
GPT-4o może analizować obrazy dostarczone jako część wejścia. Potrafi opisać zawartość wizualną, odpowiadać na pytania dotyczące obiektów, tekstu w obrazach oraz relacji przestrzennych. Może również wyodrębniać i transkrybować tekst ze skanowanych dokumentów lub zdjęć. Ponieważ przetwarza obrazy bezpośrednio, nie potrzebujesz oddzielnego modelu OCR ani wizyjnego. Obraz jest tokenizowany, aby zmieścić się w oknie kontekstu. Na przykład użytkownik może przesłać zrzut ekranu wykresu i poprosić model o interpretację trendów. Zrozumienie modelu nie ogranicza się do prostych podpisów; potrafi wnioskować o treści, porównywać wiele obrazów i wykorzystywać wskazówki wizualne wraz z instrukcjami tekstowymi. Ta funkcjonalność jest zintegrowana w tym samym wywołaniu API, używając tego samego formatu wiadomości co w przypadku żądań tylko tekstowych. W OrcaRouter wysyłasz obrazy jako dane zakodowane w base64 lub adresy URL w tablicy content. Identyfikator modelu pozostaje "openai/gpt-4o-2024-05-13".
GPT-4o akceptuje pliki jako dane wejściowe. Obsługiwane formaty obejmują PDF, dokumenty Microsoft Office (Word, Excel, PowerPoint), pliki tekstowe oraz formaty obrazów. W przypadku plików PDF i Office model wyodrębnia treść tekstową i analizuje układ. Nie renderuje bezpośrednio złożonego formatowania, ale odczytuje treść tekstową. Jest to przydatne do przetwarzania raportów, umów, arkuszy kalkulacyjnych lub prezentacji bez ręcznego wyodrębniania. Treść pliku jest tokenizowana i wliczana do całkowitej liczby tokenów wejściowych. Model może odpowiadać na pytania dotyczące zawartości plików, podsumowywać je lub wykonywać obliczenia na danych tabelarycznych. Podczas korzystania z plików dołączasz je jako część treści wiadomości, używając odpowiednich pól API OpenAI. OrcaRouter obsługuje transmisję bez modyfikacji. Należy pamiętać, że możliwości modelu zależą od jakości wyodrębnionego tekstu; mocno zeskanowane obrazy w plikach PDF mogą nie być w pełni czytelne, jeśli nie zawierają osadzonych warstw tekstowych.
GPT-4o to model premium o wyższym koszcie niż alternatywy takie jak GPT-4o-mini czy wcześniejsze warianty GPT-3.5. Jeśli Twoje zadanie nie wymaga możliwości multimodalnych (np. zadania tekstowe), dużego kontekstu (do 128K) ani poziomu rozumowania matematycznego mierzonego przez MATH-500 (79,1), tańszy model może być bardziej ekonomiczny. Na przykład prosta klasyfikacja, generowanie krótkich treści czy podstawowa rozmowa mogą być obsługiwane przez modele o niższym koszcie, które wciąż zapewniają akceptowalną jakość. Ponadto, jeśli Twoja aplikacja jest wrażliwa na opóźnienia, a mniejszy model jest szybszy, kompromis może faworyzować szybkość kosztem absolutnej dokładności. Wreszcie, jeśli rzadko przetwarzasz obrazy lub pliki, dodatkowa funkcjonalność multimodalna jest niepotrzebna. OrcaRouter oferuje szereg modeli, dzięki czemu możesz wybrać najlepszy stosunek ceny do wydajności. Oceń wymagania swojego przypadku użycia w zestawieniu z wynikami benchmarków i cenami, aby określić, czy zalety GPT-4o uzasadniają dodatkowy koszt.
GPT-4o może generować do 16 384 tokenów na żądanie. To hojny limit umożliwiający tworzenie rozbudowanych odpowiedzi, szczegółowego kodu lub wieloakapitowych analiz. Jednak tokeny wyjściowe są rozliczane po 15,00 USD za milion, co sprawia, że dłuższe wyniki są droższe. Długość odpowiedzi można kontrolować za pomocą parametru max_tokens w wywołaniu API. Jeśli przewidujesz potrzebę bardzo długich generacji, rozważ dzielenie lub łączenie zapytań. Limit 16 384 dotyczy całego uzupełnienia, w tym kroków wnioskowania lub łańcucha myśli, jeśli zostały zażądane. W przypadku bardzo złożonych zadań wymagających rozszerzonego myślenia może być konieczne użycie wielu wywołań. W OrcaRouter liczba tokenów wyjściowych jest raportowana w polu usage odpowiedzi API, co pozwala na dokładne śledzenie kosztów. OrcaRouter nie nakłada dodatkowych limitów – obowiązuje natywny limit modelu.
GPT-4o uzyskał wynik 79,1 w benchmarku MATH-500. MATH-500 składa się z 500 wymagających problemów matematycznych z różnych dziedzin, takich jak algebra, geometria, teoria liczb i prawdopodobieństwo. Wynik 79,1 oznacza, że model poprawnie odpowiedział na 79,1% problemów. Jest to silny wynik, który wskazuje na solidne zdolności rozumowania matematycznego, zwłaszcza w przypadku modelu multimodalnego. Benchmark testuje zarówno rozwiązywanie problemów, jak i krok po kroku rozumowanie. Wynik ten może kierować oczekiwaniami wobec aplikacji związanych z korepetycjami matematycznymi, obliczeniami naukowymi lub łamigłówkami logicznymi. Należy pamiętać, że wyniki benchmarku nie gwarantują identycznych rezultatów w rzeczywistych zadaniach; może być konieczne dostrojenie do konkretnej dziedziny lub inżynieria promptów. Rozważając ten model, porównaj jego wynik MATH-500 z wynikami innych ocenianych modeli. OrcaRouter nie dostarcza dodatkowych danych benchmarkowych, więc jest to jedyny punkt odniesienia dla tego modelu.
Opóźnienie zależy od kilku czynników: długości danych wejściowych, długości oczekiwanego wyjścia, bieżącego obciążenia serwerów OpenAI oraz ścieżki sieciowej między Twoją aplikacją a OrcaRouter. OrcaRouter nie dodaje znaczącego narzutu poza czasem odpowiedzi bazowego dostawcy. W przypadku typowych zapytań o umiarkowanej długości wejścia (kilka tysięcy tokenów) i krótkich wynikach (poniżej 1000 tokenów), odpowiedzi często pojawiają się w ciągu kilku sekund. Dłuższe wyniki (blisko 16 384 tokenów) będą naturalnie wymagać więcej czasu, ponieważ model generuje tokeny sekwencyjnie. Obrazy jako dane wejściowe również zwiększają opóźnienie z powodu tokenizacji i przetwarzania. Możesz zoptymalizować opóźnienie, skracając długość wyjścia, używając krótszych podpowiedzi lub grupując zapytania w pakiety. OrcaRouter udostępnia standardowe punkty końcowe API, które w razie potrzeby zwracają wyniki asynchronicznie za pomocą strumieniowania. W przypadku interaktywnych aplikacji czasu rzeczywistego rozważ użycie trybu strumieniowania (stream: true), aby rozpocząć przetwarzanie natychmiast po otrzymaniu tokenów. W faktach dotyczących modelu nie podano konkretnych wartości opóźnienia, są to więc jedynie szacunki jakościowe.
Mocne strony: multimodalne wejście (tekst, obraz, plik), duże okno kontekstu 128K, silne rozumowanie matematyczne (MATH-500: 79.1) oraz wysoki limit tokenów wyjściowych (16,384). Skutecznie obsługuje długie dokumenty i rozmowy wieloetapowe. API jest standardowo zgodne z OpenAI, co ułatwia integrację. Ograniczenia: Wyższy koszt w porównaniu do mniejszych modeli. Nie jest zoptymalizowany do zadań, które nie korzystają z multimodalności lub dużego kontekstu. Nie podano informacji o wydajności w językach innych niż angielski ani o konkretnych benchmarkach bezpieczeństwa. Rozumienie obrazów może być ograniczone w przypadku bardzo złożonych scen lub obrazów o niskiej rozdzielczości. Ponadto model może generować niepoprawne odpowiedzi na problemy spoza swojej dystrybucji treningowej. Nie ma ujawnionej gwarancji opóźnienia. Dla użytkowników wymagających bardzo niskiego opóźnienia lub bardzo niskiego kosztu, lepszy może być inny model. Wynik benchmarku 79.1 w MATH-500 wskazuje na miejsce do poprawy w najtrudniejszych problemach matematycznych. Oceń, czy te kompromisy są zgodne z wymaganiami Twojej aplikacji.
GPT-4o jest rozliczane za token, z oddzielnymi stawkami za tokeny wejściowe i wyjściowe. Tokeny wejściowe kosztują $5.00 za 1 milion tokenów. Tokeny wyjściowe kosztują $15.00 za 1 milion tokenów. Są to stawki dostawcy, przekazywane przez OrcaRouter z zerową marżą. Koszt na żądanie = (tokeny wejściowe/1e6 * 5) + (tokeny wyjściowe/1e6 * 15). Na przykład rozmowa z 4,000 tokenów wejściowych i 200 tokenów wyjściowych kosztowałaby (0.004*$5) + (0.0002*$15) = $0.02 + $0.003 = $0.023. Nie ma dodatkowych opłat za same wywołania API; płacisz tylko za zużyte tokeny. Ceny są aktualizowane dynamicznie na podstawie zmian dostawcy; OrcaRouter przekazuje wszelkie przyszłe korekty. Ponieważ nie ma marży, użytkownicy korzystają z tych samych stawek co bezpośredni klienci OpenAI, ale z wygodą zunifikowanego zarządzania i rozliczeń OrcaRouter. Należy pamiętać, że obrazy i pliki są tokenizowane i przyczyniają się do liczby tokenów wejściowych, często zwiększając koszt w porównaniu z danymi wejściowymi tylko tekstowymi.
Nie. OrcaRouter nie oferuje zniżek, tokenów w cache ani obniżonych cen za powtarzające się wejścia. Każdy token jest rozliczany według standardowej stawki dostawcy. Nie ma osobnego kosztu cache ani dodatkowych opłat za duży wolumen. Stawki 5 USD/15 USD za milion tokenów są stałe. Użytkownicy wymagający bardzo wysokiej przepustowości mogą zapytać o indywidualne ustalenia, ale standardowa usługa nie obejmuje rabatów ilościowych. Ponadto nie ma ukrytych opłat, takich jak opłaty za połączenie czy miesięczne minima. Ceny są przejrzyste i bezpośrednio związane z użyciem tokenów. Aby zoptymalizować koszty, rozważ zmniejszenie rozmiaru wejścia (np. skrócenie historii, używanie krótszych promptów) oraz długości wyjścia (np. ustawienie niższej wartości max_tokens). Korzystanie z modelu tylko wtedy, gdy jego możliwości (multimodalne, duży kontekst) są niezbędne, również pomaga kontrolować koszty. Jeśli Twoja aplikacja ma powtarzające się, identyczne prompty, buforowanie na poziomie aplikacji może zmniejszyć użycie tokenów, ale sam OrcaRouter nie oferuje takiej funkcji.
GPT-4o ma wyższą cenę premium. W przypadku wielu zadań tańszy model (np. GPT-4o-mini lub GPT-3.5-turbo) może być wystarczający. Wyważ, oceniając złożoność i wymaganą dokładność. Jeśli Twoje zadanie obejmuje prostą ekstrakcję lub klasyfikację z ograniczonym kontekstem, tańszy model może osiągnąć podobne wyniki przy ułamku kosztów. I odwrotnie, jeśli zadanie wymaga niuansowego zrozumienia obrazów, długich dokumentów lub wysokiej precyzji matematycznej (wynik MATH-500 na poziomie 79,1 w porównaniu z niższymi wynikami tańszych modeli), GPT-4o może być warty dopłaty. Przeprowadź testy A/B na reprezentatywnej próbce, aby porównać jakość i koszt. Weź też pod uwagę, że ta sama cena za milion tokenów obowiązuje niezależnie od długości tekstu – krótsze żądania są tańsze. Jeśli Twój przepływ pracy często wykorzystuje pełny kontekst 128K, koszt tokenów wejściowych dla takiego żądania może być wysoki – upewnij się, że ten kontekst jest naprawdę potrzebny. OrcaRouter dostarcza metryki użycia, dzięki czemu możesz monitorować i optymalizować.
Aby wywołać GPT-4o na OrcaRouter, użyj punktu końcowego API zgodnego z OpenAI: base_url = "https://api.orcarouter.ai/v1". Ustaw parametr model na "openai/gpt-4o-2024-05-13". Będziesz potrzebować klucza API z OrcaRouter. Format żądania jest zgodny ze standardowym API OpenAI Chat Completions: tablica messages z rolami (system, user, assistant), opcjonalna zawartość dla obrazów i plików oraz parametry takie jak temperature, max_tokens, top_p, frequency_penalty, presence_penalty i stop. Na przykład proste żądanie tekstowe jest wysyłane jako POST do /chat/completions. W przypadku obrazów dołącz zawartość jako część wiadomości użytkownika z typem "image_url". W przypadku plików również dołącz je jako część zawartości (konkretny format jest zgodny ze specyfikacją OpenAI). Odpowiedź będzie zawierać wiadomość asystenta, statystyki użycia (prompt_tokens, completion_tokens, total_tokens) oraz inne metadane. Nie są wymagane żadne specjalne nagłówki poza standardowymi Content-Type i Authorization. Integracja jest identyczna jak przy bezpośrednim korzystaniu z OpenAI.
Wszystkie standardowe parametry OpenAI Chat Completions są obsługiwane: messages (wymagane), model (wymagany, ustawiony na "openai/gpt-4o-2024-05-13"), temperature (0–2, domyślnie 1), top_p (0–1, domyślnie 1), n (liczba odpowiedzi, domyślnie 1), stop (ciągi znaków lub lista ciągów znaków), max_tokens (domyślnie 16,384, cap na 16,384), presence_penalty (−2 do 2, domyślnie 0), frequency_penalty (−2 do 2, domyślnie 0), logit_bias (mapa identyfikatorów tokenów na wartość błędu), user (ciąg znaków do monitorowania nadużyć), stream (wartość logiczna, domyślnie false) oraz functions/tools (do wywoływania funkcji). W przypadku danych multimodalnych, zawartość wiadomości może być tablicą elementów treści z typem "text" lub "image_url". Dodatkowo możesz uwzględnić treści typu "file" zgodnie z dokumentacją OpenAI (np. dla załączników PDF). OrcaRouter przekazuje te parametry bezpośrednio do dostawcy bez modyfikacji. Upewnij się, że nie przekraczasz okna kontekstowego 128K tokenów. API zwraca standardowe kody błędów dla nieprawidłowych żądań, ograniczeń szybkości lub błędów uwierzytelniania.
Migracja jest prosta, ponieważ API OrcaRouter jest w pełni kompatybilne z OpenAI. Musisz zmienić tylko dwie rzeczy: podstawowy URL z https://api.openai.com/v1 na https://api.orcarouter.ai/v1 oraz identyfikator modelu z "gpt-4o-2024-05-13" na "openai/gpt-4o-2024-05-13". Twój klucz API z OrcaRouter zastępuje klucz OpenAI. Cały istniejący kod, który używa bibliotek OpenAI Python/Node lub bezpośrednich żądań HTTP, będzie działać bez żadnych innych modyfikacji. Format wiadomości, nazwy parametrów i struktura odpowiedzi są identyczne. Dla bibliotek, które akceptują parametr base URL, po prostu ustaw go na punkt końcowy OrcaRouter. Jeśli używałeś klienta OpenAI, możesz go zainicjować z parametrem base_url ustawionym na punkt końcowy OrcaRouter. Nie są wymagane żadne zmiany w inżynierii promptów ani logice buforowania. OrcaRouter obsługuje również strumieniowanie (stream: true) i wywoływanie funkcji dokładnie tak jak wcześniej. Testowanie można przeprowadzić za pomocą małego zestawu żądań, aby zweryfikować, że zachowanie jest zgodne.
OrcaRouter nie modyfikuje zachowania modelu. Działa wyłącznie jako brama, przekazując Twoje żądania na serwery OpenAI i zwracając odpowiedź w formie niezmienionej. OrcaRouter nie stosuje żadnego dodatkowego przetwarzania wstępnego, końcowego ani filtrowania treści. Jeśli chodzi o przetwarzanie danych: OrcaRouter nie przechowuje ani nie rejestruje danych promptów ani odpowiedzi poza tym, co jest niezbędne do celów rozliczeniowych i monitorowania operacyjnego. W przypadku korzystania z modelu za pośrednictwem OrcaRouter mają zastosowanie własne polityki danych OpenAI. Zgodnie z przedstawionymi faktami, nie ma wzmianki o przechowywaniu danych przez OrcaRouter poza standardowym rejestrowaniem API. Użytkownicy powinni zapoznać się zarówno z polityką prywatności OrcaRouter, jak i polityką OpenAI, aby zrozumieć sposób przetwarzania danych. Jeśli masz restrykcyjne wymagania dotyczące lokalizacji danych, skonsultuj się z OrcaRouter dostępne opcje. Nie ma oznak, że OrcaRouter udostępnia dane innym klientom. Jedyną wymaganą modyfikacją jest identyfikator modelu; nie są dodawane żadne niestandardowe instrukcje.
Główne różnice między GPT-4o a GPT-4o-mini to rozmiar okna kontekstowego, możliwości multimodalne, wyniki benchmarków oraz koszt. GPT-4o oferuje 128K okno kontekstowe i obsługuje obrazy oraz pliki. GPT-4o-mini (w oparciu o ofertę OpenAI) ma zazwyczaj mniejsze okno kontekstowe (np. 128K lub 16K w niektórych wersjach) i może nie obsługiwać wszystkich modalności. W teście MATH-500 GPT-4o uzyskuje 79.1; GPT-4o-mini uzyskałby niższy wynik. Cennik: GPT-4o kosztuje $5/$15 za milion tokenów, podczas gdy GPT-4o-mini jest znacznie tańszy (np. $0.15/$0.60 za milion tokenów w niektórych wersjach). Zatem GPT-4o-mini nadaje się do prostszych zadań, gdzie kluczowy jest niższy koszt, natomiast GPT-4o jest lepszy do złożonego rozumowania, długich kontekstów i zadań multimodalnych. Wybierając między nimi, należy uwzględnić wymagania co do dokładności oraz potrzebę obsługi obrazów lub plików. OrcaRouter oferuje oba modele pod odrębnymi identyfikatorami. Jeśli Twoje zadania rzadko korzystają z obrazów lub dużego kontekstu, GPT-4o-mini może być bardziej opłacalnym wyborem.
GPT-4o (2024-05-13) to model multimodalny z kontekstem 128K tokenów, podczas gdy starsze wersje GPT-4 (takie jak gpt-4-0613) mają zazwyczaj kontekst 8K lub 32K i są wyłącznie tekstowe (niektóre nowsze wersje obsługują obrazy poprzez osobne endpointy wizyjne). Ceny GPT-4o ($5/$15 za milion tokenów) są generalnie niższe niż szczytowe ceny GPT-4 Turbo (np. $10/$30 za milion tokenów). Wyniki benchmarków: podany wynik MATH-500 wynoszący 79,1 dotyczy GPT-4o; GPT-4 nie ma oficjalnego wyniku MATH-500 w podanych faktach, ale wiadomo, że uzyskiwał niższe wyniki w podobnych benchmarkach matematycznych. GPT-4o oferuje również wyższy limit wyjściowy (16K tokenów) w porównaniu do starszego GPT-4 (4K lub 8K, w zależności od wersji). Ogólnie rzecz biorąc, GPT-4o zapewnia lepszy stosunek jakości do ceny w zastosowaniach multimodalnych i wymagających długiego kontekstu. Jednak starsze modele GPT-4 mogły zostać dostrojone do konkretnych zadań; należy je ocenić na własnych danych. Poprzez OrcaRouter dostępne są obie rodziny modeli.
Bezpośrednie porównanie wymaga faktów specyficznych dla modelu, których tutaj nie podano. Ogólnie oba modele są konkurencyjne w zakresie rozumowania i możliwości multimodalnych. GPT-4o ma 128-tysięczne okno kontekstu, podobne do 200-tysięcznego okna Claude'a (w przypadku Sonnet). Oba obsługują obrazy. Wyniki benchmarków są różne: GPT-4o uzyskuje wynik MATH-500 na poziomie 79,1; wyniki Claude 3.5 Sonnet w tym benchmarku nie są podane. Cennik: GPT-4o kosztuje 5/15 USD za milion tokenów; cennik Claude Sonnet wynosi zazwyczaj około 3/15 USD za milion tokenów (może ulec zmianie). Tym samym koszty wejściowe dla GPT-4o są wyższe. Różnice w wydajności zależą od zadania: niektórzy użytkownicy uważają Claude'a za lepszy do długich form pisemnych, podczas gdy GPT-4o celuje w matematyce i kodowaniu. Bez kontrolowanej oceny zaleca się przetestowanie obu na reprezentatywnych próbkach. OrcaRouter oferuje oba modele, więc łatwo je porównać, zmieniając identyfikator modelu. Ostatecznie wybór najlepszego modelu zależy od konkretnych wymagań dotyczących dokładności, szybkości i kosztów. Podane fakty nie obejmują wyników Claude'a, dlatego to porównanie pozostaje jakościowe.
Llama 3 (np. Llama 3 70B) to model open-source, który można hostować samodzielnie, podczas gdy GPT-4o jest zastrzeżony i dostępny przez API. GPT-4o obsługuje multimodalne wejścia (tekst, obraz, plik) z kontekstem 128K, podczas gdy Llama 3 jest zazwyczaj tylko tekstowa (chyba że dostrojona do wizji) i ma mniejszy kontekst (np. 8K lub 32K). Wyniki benchmarków: wynik GPT-4o w MATH-500 to 79,1; Llama 3 70B uzyskuje około 70–75 w podobnych benchmarkach matematycznych (nie podane w faktach, ale ogólna wiedza). Koszt: koszt API GPT-4o za token jest stały; samodzielne hostowanie Llama 3 wiąże się z kosztami infrastruktury (GPU, prąd), które mogą być niższe przy dużych wolumenach. Opóźnienie: GPT-4o oparty na API może być szybszy dla obciążeń skokowych; modele hostowane samodzielnie mogą oferować stałe opóźnienie, jeśli zarezerwowana jest pojemność. Elastyczność: Llama 3 można dostroić; GPT-4o nie. Dla użytkowników chcących uniknąć uzależnienia od dostawcy lub w pełni obsługiwać wrażliwe dane lokalnie, modele open-source są atrakcyjne. OrcaRouter zapewnia dostęp do obu typów: możesz używać GPT-4o przez API oraz uzyskiwać dostęp do modeli open-source za pośrednictwem OrcaRouter, jeśli są dostępne.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-05-13",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamtemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Wejście / 1M tokenów | $5.00 |
|---|---|
| Wyjście / 1M tokenów | $15.00 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
O czym mówią programiści w tym tygodniu
GET /api/public/models/openai/gpt-4o-2024-05-13Otwórz @misc{orcarouter_gpt_4o_2024_05_13,
title = {GPT-4o (2024-05-13) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13}
}OpenAI. (2024). GPT-4o (2024-05-13) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13