Opłacalny model tekstowy od OpenAI z wynikiem 46.2 w MMLU-Pro, dostępny przez API OrcaRouter.
openai/gpt-3.5-turbo-0125 to model generowania tekstu opracowany przez OpenAI i dostępny za pośrednictwem API OrcaRouter. Jest częścią rodziny GPT-3.5-Turbo, zoptymalizowanej pod kątem zadań…
GPT-3.5-Turbo-0125 doskonale radzi sobie z szerokim zakresem zadań tekstowych, w tym z czatami, streszczaniem, tłumaczeniem, odpowiadaniem na pytania i generowaniem treści. Dobrze interpretuje instrukcje i potrafi tworzyć spójne, odpowiednie kontekstowo odpowiedzi dla wsparcia klienta, burzy mózgów i etykietowania danych. Dane treningowe obejmują różnorodne dziedziny do kwietnia 2023 roku, co zapewnia rozsądną wydajność w zakresie ogólnej wiedzy i stylów pisania. W przypadku ustrukturyzowanych danych wyjściowych może formatować JSON lub stosować niestandardowe schematy, jeśli zostanie o to wyraźnie poproszony.
Jeśli twoja aplikacja obsługuje bardzo duże wolumeny z prostymi, powtarzalnymi zadaniami, takimi jak prosta klasyfikacja lub generowanie pojedynczych zdań, warto rozważyć użycie mniejszych modeli, takich jak GPT-3.5-Turbo-Instruct, a nawet alternatyw open-source hostowanych na OrcaRouter. Oszczędności kosztów mogą być znaczące, gdy liczba tokenów jest niska, a wymagania dotyczące dokładności minimalne. Jednak GPT-3.5-Turbo-0125 pozostaje opłacalnym wyborem do większości zastosowań ogólnych, zwłaszcza biorąc pod uwagę jego wysoki wynik benchmarku 46.2 w MMLU-Pro.
Tak, model został wytrenowany na tekście wielojęzycznym, choć najlepsze wyniki osiąga w języku angielskim. Potrafi rozumieć i generować tekst w wielu językach, w tym hiszpańskim, francuskim, chińskim, arabskim i innych. Dokładność może się obniżyć w przypadku języków o ograniczonej reprezentacji w danych treningowych lub w przypadku wysoce idiomatycznych wyrażeń. Do zadań wymagających precyzyjnej płynności wielojęzycznej warto rozważyć uzupełnienie o dostrojenie językowe lub użycie rodzimego modelu. Wejście i wyjście mają zawsze postać tekstu, więc obsługiwane są znaki spoza zestawu angielskiego.
Ponieważ całkowite okno kontekstu wynosi 16 385 tokenów (szeroko znana publiczna specyfikacja), model może przetworzyć umiarkowanie długie dokumenty w jednym przebiegu. Jednak wynik jest ograniczony do 4096 tokenów na żądanie. W przypadku dłuższych wyników należy zastosować podejście map-reduce lub przesuwnego okna. Mechanizm uwagi modelu może utrzymać spójność w całym kontekście, ale wydajność może się pogorszyć w zadaniach wymagających odwoływania się do samego początku długiego promptu. W przypadku bardzo długich tekstów zaleca się strategie dzielenia na fragmenty i podsumowywania.
MMLU-Pro to ulepszona wersja benchmarku Massive Multitask Language Understanding, mierząca zdolność modelu do odpowiadania na pytania z 57 dziedzin, w tym nauk ścisłych, prawa i humanistyki. Wynik 46,2 oznacza, że GPT-3.5-Turbo-0125 poprawnie odpowiada na około 46,2% pytań, co jest konkurencyjne wśród mniejszych modeli. Wynik ten odzwierciedla silną ogólną wiedzę, ale także wskazuje na pole do poprawy w porównaniu z większymi modelami, takimi jak GPT-4. W przypadku zadań wymagających głębokiej wiedzy specjalistycznej warto rozważyć ocenę modelu na dziedzinowych benchmarkach.
Dokładne opóźnienie zależy od rozmiaru żądania, warunków sieciowych oraz bieżącego obciążenia infrastruktury OpenAI. W typowym użyciu GPT-3.5-Turbo-0125 odpowiada w ciągu kilku sekund na krótkie prompt, często szybciej niż większe modele. OrcaRouter nie dodaje znaczącego narzutu do czasu odpowiedzi dostawcy. W przypadku aplikacji czasu rzeczywistego przetestuj z własnym obciążeniem. Szybkość i koszt modelu czynią go popularnym wyborem dla interaktywnych chatbotów i potoków produkcyjnych, gdzie opóźnienie na żądanie ma znaczenie.
GPT-3.5-Turbo-0125 jest szeroko stosowany ze względu na swoją niezawodność, spójne formatowanie oraz silne umiejętności podążania za instrukcjami. Rzadko zdarza się, by nie wygenerował spójnej odpowiedzi, a także łagodnie radzi sobie z literówkami czy niejednoznacznymi sformułowaniami. Zakres danych treningowych obejmujący kwiecień 2023 r. pozwala mu dokładnie odpowiadać na pytania dotyczące wydarzeń bieżących z tamtego okresu. Model obsługuje również komunikaty systemowe do ustawiania zachowania, co ułatwia dostosowanie go do różnych zastosowań, takich jak odgrywanie ról czy ograniczone generowanie tekstu.
Ten model może mieć trudności ze złożonym rozumowaniem, wieloetapową arytmetyką i bardzo precyzyjnymi instrukcjami. Czasami generuje poprawne brzmiące, ale nieprawidłowe odpowiedzi (halucynacje) i może niekonsekwentnie egzekwować ścisłe zasady formatowania. Długość jego odpowiedzi jest ograniczona do 4096 tokenów, co może być niewystarczające do generowania długich treści. Dodatkowo domyślnie nie ma dostępu do internetu i nie może pobierać informacji w czasie rzeczywistym ani wykonywać działań poza interfejsem czatu. W przypadku zaawansowanej logiki lub aktualnych danych warto rozważyć generowanie wspomagane wyszukiwaniem (RAG) lub bardziej zaawansowany model.
OrcaRouter przekazuje dokładne ceny OpenAI bez żadnej marży: 0,50 USD za 1 milion tokenów wejściowych i 1,50 USD za 1 milion tokenów wyjściowych. Nie ma żadnych dodatkowych opłat za platformę, kosztów subskrypcji ani opłat za pojedyncze zapytanie poza tymi stawkami za tokeny. Tokeny wejściowe obejmują prompt, wiadomość systemową i historię konwersacji; tokeny wyjściowe to wygenerowana odpowiedź. Rozliczenia opierają się na liczbie przetworzonych tokenów, mierzonej za pomocą tokenizatora tiktoken dla GPT-3.5.
Choć GPT-3.5-Turbo-0125 jest już jednym z najbardziej opłacalnych modeli od OpenAI, możesz go dodatkowo zoptymalizować, wysyłając krótsze prompty, przycinając historię rozmów tam, gdzie to możliwe, i używając mniejszej wartości max_tokens, jeśli pozwala na to Twój przypadek użycia. Unikaj nadmiernie długich wiadomości systemowych, jeśli nie są potrzebne. W przypadku bardzo dużej objętości rozważ, czy darmowy lub open-source'owy model na OrcaRouter może spełnić Twoje wymagania dotyczące dokładności. Kompromis polega na tym, że tańsze modele mogą wymagać bardziej rygorystycznego inżynierii promptów lub dostrajania.
OrcaRouter nie oferuje obecnie wbudowanego mechanizmu buforowania zapytań ani odpowiedzi. Każde wywołanie API jest rozliczane na podstawie tokenów wysłanych i odebranych w tym żądaniu. Jeśli używasz tego samego zapytania w wielu wywołaniach (np. identyczne komunikaty systemowe), za każdym razem płacisz za te tokeny. Aby obniżyć koszty, rozważ buforowanie identycznych żądań na poziomie aplikacji lub grupowanie wielu zapytań w jedno zapytanie z wieloma komunikatami użytkownika.
Użyj standardowego punktu końcowego OpenAI Chat Completions z bazowym URL https://api.orcarouter.ai/v1. Ustaw parametr model na 'openai/gpt-3.5-turbo-0125'. Dołącz swój klucz API OrcaRouter w nagłówku Autoryzacji. Przykład użycia cURL: curl https://api.orcarouter.ai/v1/chat/completions -H 'Authorization: Bearer YOUR_API_KEY' -H 'Content-Type: application/json' -d '{"model":"openai/gpt-3.5-turbo-0125","messages":[{"role":"user","content":"Hello"}]}'. Format odpowiedzi jest zgodny ze specyfikacją OpenAI.
Wszystkie standardowe parametry zakończeń czatu OpenAI są dostępne, w tym: 'messages', 'max_tokens' (do 4096), 'temperature', 'top_p', 'frequency_penalty', 'presence_penalty', 'stop' i 'stream'. Obsługiwany jest także parametr 'n' (liczba zakończeń). Model na bramce OrcaRouter nie obsługuje parametrów 'logprobs' ani 'logit_bias'. Należy pamiętać, że parametr 'max_tokens' jest ograniczony do 4096, aby dopasować się do limitu wyjściowego modelu. W przypadku przesyłania strumieniowego ustaw 'stream': true, aby otrzymywać przyrostowe wersje różnicowe.
Jeśli obecnie korzystasz bezpośrednio z OpenAI, migracja do OrcaRouter jest prosta: zmień podstawowy URL z https://api.openai.com/v1 na https://api.orcarouter.ai/v1, zaktualizuj ID modelu na 'openai/gpt-3.5-turbo-0125', jeśli używałeś ogólnego aliasu, i zastąp swój klucz API kluczem z OrcaRouter. Nie są wymagane żadne zmiany w kodzie dotyczące formatu wiadomości ani parametrów. Jeśli korzystałeś z innego dostawcy, upewnij się, że Twoja biblioteka kliencka obsługuje schemat zgodny z OpenAI. OrcaRouter to rozwiązanie typu "drop-in replacement".
GPT-4 generalnie przewyższa GPT-3.5-Turbo-0125 w złożonym rozumowaniu, dokładności faktograficznej i realizacji niuansowych instrukcji, co odzwierciedlają wyższe wyniki w testach porównawczych MMLU i innych. Jednak GPT-4 jest znacznie droższy (zazwyczaj 10-krotność kosztu na token) i może mieć wyższe opóźnienie. GPT-3.5-Turbo-0125 oferuje przekonujący kompromis między ceną a wydajnością dla zadań, które nie wymagają głębi GPT-4. Wybierz większy model do zaawansowanych analiz lub gdy margines błędu jest wąski.
Anthropic's Claude 3 Haiku to konkurencyjny model niskokosztowy z szybkim wnioskowaniem i silnymi funkcjami bezpieczeństwa. Oba modele są wyłącznie tekstowe i przeznaczone do zastosowań o dużej objętości. Chociaż konkretne porównania benchmarków różnią się, GPT-3.5-Turbo-0125 jest powszechnie przyjęty i korzysta z obszernej dokumentacji oraz ekosystemu. Claude 3 Haiku może mieć inne mocne strony w kreatywnym pisaniu i zachowaniu odmowy. Wybór zależy od preferencji programisty i wymagań integracyjnych. OrcaRouter obsługuje oba modele, więc możesz bezpośrednio porównać.
Modele open-source (np. Llama 3, Mistral) mogą być uruchamiane na własnym sprzęcie lub za pomocą OrcaRouter, co potencjalnie obniża koszty za token, szczególnie przy większej skali. Wymagają jednak często większego nakładu konfiguracji, inżynierii podpowiedzi i mogą słabiej podążać za instrukcjami. GPT-3.5-Turbo-0125 oferuje gotowe rozwiązanie, stałą jakość i zerowe zarządzanie infrastrukturą. Dla zespołów bez doświadczenia w uczeniu maszynowym zarządzane API jest często lepszym wyborem. Przeprowadź testy wydajnościowe na swoim konkretnym obciążeniu, aby podjąć decyzję.
OpenAI może wydać nowsze wersje GPT-3.5-Turbo lub wycofać tę konkretną migawkę. OrcaRouter zaktualizuje dostępne modele odpowiednio. Jeśli Twoja aplikacja polega na spójnym działaniu, warto przypisać konkretną wersję modelu, używając dokładnego identyfikatora modelu. OrcaRouter zapewnia wcześniejsze powiadomienia o wycofaniach. W przypadku systemów produkcyjnych o wysokim ryzyku rozważ testowanie nowych wersji w środowisku stagingowym przed przejściem.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-0125",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_pparallel_tool_calls| Wejście / 1M tokenów | $0.500 |
| Wyjście / 1M tokenów | $1.50 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/openai/gpt-3.5-turbo-0125Otwórz @misc{orcarouter_gpt_3_5_turbo_0125,
title = {openai/gpt-3.5-turbo-0125 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125}
}openai. (n.d.). openai/gpt-3.5-turbo-0125 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125