OpenAI:s gpt-3.5-turbo-1106 via OrcaRouter: 16K kontext, 46.2 MMLU-Pro, $1/$2 per 1M tokens, nollpåslagsprissättning.
gpt-3.5-turbo-1106 är en specifik ögonblicksbild av OpenAI:s GPT-3.5 Turbo-modell, som gjordes tillgänglig i november 2023. Det är en textbaserad modell, vilket innebär att den endast accepterar och…
Den här modellen utmärker sig för allmänna textgenereringsuppgifter: svara på frågor, delta i dialog, sammanfatta dokument, översätta text, skapa kreativt skrivande och ge förklaringar. Den stöder funktionsanrop, vilket gör det möjligt att mata ut strukturerad data och interagera med externa verktyg eller API:er baserat på angivna funktionsscheman. Den kan också hantera flervarvskonversationer med ett kontextfönster på upp till 16K tokens. För uppgifter som kräver hög noggrannhet vid faktabaserade frågor, kodgenerering eller strukturerat resonemang, presterar den bra men kan ibland producera mindre precisa utdata än större modeller.
Funktionsanrop i gpt-3.5-turbo-1106 gör att modellen kan generera strukturerade JSON-utdata baserat på funktionsdefinitioner du anger i förfrågan. När du inkluderar en lista med funktioner med namn, beskrivningar och parameterscheman kan modellen bestämma sig för att anropa en eller flera funktioner genom att returnera ett function_call-objekt. Detta är användbart för att bygga agenter som behöver fråga databaser, anropa API:er eller utföra åtgärder. Funktionen förbättrades i 1106-versionen jämfört med tidigare versioner, vilket gjorde den mer tillförlitlig och minskade redundant verktygsanvändning. OrcaRouter stöder alla OpenAI-kompatibla funktionsanropsparametrar.
Om din användning innefattar mycket enkla uppgifter med mycket hög volym, kan du överväga en ännu billigare modell som gpt-3.5-turbo-0125 (samma pris men nyare) eller mindre open source-modeller som erbjuds via OrcaRouter. Å andra sidan, om du behöver betydligt bättre resonemang, faktualitet, multimodal inmatning (bilder, ljud) eller ett större kontextfönster (128K tokens), överväg att uppgradera till gpt-4o eller gpt-4-turbo. gpt-3.5-turbo-1106 är ett balanserat val för de flesta textbaserade applikationer där kostnad per token är en primär faktor.
MMLU-Pro är en variant av Massive Multitask Language Understanding-riktmärket som innehåller 57 ämnen med en mer utmanande uppsättning frågor. En poäng på 46,2 indikerar att modellen korrekt svarade på 46,2 % av testfrågorna. Detta är en måttlig poäng, som återspeglar modellens allmänna kunskaper inom olika domäner. Som jämförelse får större modeller som GPT-4 vanligtvis över 80 poäng på liknande riktmärken. Denna poäng hjälper till att sätta förväntningar: gpt-3.5-turbo-1106 är kapabel, men inte i toppklass för djup resonemang eller specialiserad kunskap.
Inga andra benchmarkresultat finns tillgängliga för denna modell, men offentlig information visar att gpt-3.5-turbo-1106 presterar starkt på MMLU, HumanEval (kodgenerering) och sammanfattningsuppgifter i förhållande till sin storleksklass. Den anses generellt vara en av de bäst presterande modellerna med öppen vikt för sin kostnadsklass. Användare kan förvänta sig god prestanda på vanliga NLP-uppgifter, men bör vara medvetna om att den kan ligga efter GPT-4 när det gäller komplex resonemangsförmåga, matematik och flerstegsinstruktioner. För faktamässig konsekvens kan modellen producera trovärdiga men felaktiga svar, så verifiering rekommenderas för kritiska tillämpningar.
Specifika latenssiffror anges inte. Men som en text-only modell med relativt få parametrar (jämfört med GPT-4) erbjuder gpt-3.5-turbo-1106 generellt låg latensutgång, och slutför ofta korta svar på under en sekund under måttlig belastning. Genomströmningen kan vara hög, vilket gör den lämplig för realtidsapplikationer i kombination med streaming. OrcaRouters infrastruktur säkerställer pålitlig anslutning till OpenAIs slutpunkter. För de mest exakta latensförväntningarna bör användare benchmarka sina egna användningsfall med hjälp av OrcaRouter API.
Viktiga begränsningar inkluderar: en maximal utmatning på 4 096 tokens, vilket begränsar genereringslängden; ingen multimodal förmåga (kan inte bearbeta bilder eller ljud); en tendens att hallucinera om obskyra fakta; och begränsat resonemangsdjup för komplexa problem. Modellens 16K kontextfönster, även om det är generöst, är mindre än vissa alternativ (t.ex. 128K). Den har också en lägre kunskapsgräns än senare ögonblicksbilder (januari 2023). På kontroversiella eller tvetydiga uppmaningar kan den producera partiska eller osäkra utdata. Utvecklare bör implementera lämpliga skyddsräcken och mänsklig tillsyn för produktionsanvändning.
Prissättningen för openai/gpt-3.5-turbo-1106 via OrcaRouter faktureras enligt leverantörens taxa utan påslag. Specifikt kostar inmatningstokens $1.00 per 1 miljon tokens och utmatningstokens $2.00 per 1 miljon tokens. Detta gäller alla förfrågningar, inklusive streaming. Det tillkommer inga plattformsavgifter. Avgifterna beräknas baserat på antalet tokens i prompten (inmatning) och det genererade svaret (utmatning). Både cachade och icke-cachade förfrågningar faktureras till samma taxa. Du kan följa din användning via OrcaRouters instrumentpanel.
För applikationer som kräver många korta interaktioner (t.ex. chatbot-konversationer) är kostnaden per meddelande låg eftersom varje förfrågan förbrukar få tokens. För uppgifter som involverar långa uppmaningar eller genererar långa svar, skalar kostnaden linjärt med tokenantal. Jämfört med GPT-4 (som kan vara 10-30x dyrare) är gpt-3.5-turbo-1106 ekonomisk för volym. Men om en uppgift kan lösas med färre tokens med en billigare modell, kan det vara ännu mer kostnadseffektivt. OrcaRouters noll-påslagsprissättning säkerställer att du bara betalar vad OpenAI tar ut.
Inga specifika cachnings- eller rabattprogram nämns för denna modell på OrcaRouter. Alla förfrågningar faktureras till standardleverantörspriset. Vissa plattformar erbjuder promptcachning för att minska kostnaderna för upprepade indata, men OrcaRouters dokumentation anger inte en sådan funktion för denna modell. Användare bör planera sin tokenanvändning därefter. För mycket hög volym kan det vara värt att kontakta OrcaRouter direkt för att fråga om volymrabatter, även om inga annonseras. Själva nollpåslagsprissättningen ger redan en transparent kostnadsbas.
För att göra en förfrågan, skicka en POST-förfrågan till https://api.orcarouter.ai/v1/chat/completions med en JSON-body som innehåller fältet model satt till 'openai/gpt-3.5-turbo-1106', och en messages-array (med role och content). Inkludera din OrcaRouter API-nyckel i Authorization-headern (Bearer <key>). Valfria parametrar inkluderar temperature, max_tokens, top_p, frequency_penalty, presence_penalty, stop, stream och functions. Svaret följer OpenAIs chat completion-format. Exempel med Python openai-biblioteket: client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key').
Denna modell stöder samma parametrar som OpenAI:s gpt-3.5-turbo-1106. Viktiga parametrar inkluderar: messages (obligatorisk array av objekt med role, content, eventuellt name), max_tokens (standard oändligt men begränsat till 4096), temperature (0-2, standard 1), top_p (0-1, standard 1), n (antal val, standard 1), stream (boolesk), stop (sträng eller array med upp till 4 strängar), presence_penalty (-2 till 2), frequency_penalty (-2 till 2), logit_bias (karta över token-ID:n till bias), user (sträng för slutanvändaridentifikation), functions (array av funktionsobjekt), function_call (auto/none eller specifik funktion). Alla stöds via OrcaRouter.
Migrationen kräver endast två ändringar i din befintliga OpenAI-baserade kod. För det första, ändra bas-URL:en från https://api.openai.com/v1 till https://api.orcarouter.ai/v1. För det andra, ersätt din OpenAI API-nyckel med en OrcaRouter API-nyckel. Förfrågans- och svarsformaten är identiska, så inga ändringar av nyttolaststrukturen behövs. Efter att ha uppdaterat dessa två inställningar kommer all befintlig logik för chat-kompletteringar, funktionsanrop och strömning att fortsätta fungera. Du kan också använda samma OpenAI-klientbibliotek (t.ex. Python openai, Node.js openai) genom att skicka den nya base_url och api_key.
OrcaRouter returnerar vanliga HTTP-statuskoder och felmeddelanden som är kompatibla med OpenAIs API. Vanliga fel: 401 (obehörig), 429 (för många förfrågningar), 500 (serverfel). OrcaRouter tillämpar hastighetsbegränsningar baserat på din plan; för detaljer, se OrcaRouter-dokumentationen. Eftersom den underliggande modellen är värd hos OpenAI, vidarebefordras fel från leverantören transparent (t.ex. 400 för ogiltiga parametrar, 503 för överbelastning). Det rekommenderas att implementera exponentiell backoff för 429- och 5xx-fel. Streamingfel signaleras av en trunkerad ström; lyssna efter finish_reason i den sista biten.
0125-snapshoten är en nyare version av GPT-3.5 Turbo, släppt i januari 2025. Den erbjuder samma prissättning och text-bara modalitet men inkluderar en nyare kunskapsgräns och möjligen förbättrad konsekvens och faktisk noggrannhet. Båda modellerna delar samma 16K kontextfönster och 4K utdatagräns. gpt-3.5-turbo-0125 rekommenderas generellt framför 1106-versionen för nya projekt på grund av dess nyhet, men 1106-snapshoten finns fortfarande tillgänglig av kompatibilitetsskäl. Inga benchmark-poäng anges för någon av modellerna utöver 46.2 MMLU-Pro för 1106; användare kan testa båda för deras specifika användningsfall.
gpt-4o är OpenAIs mer kapabla modell som stöder text-, bild- och ljudinmatningar, och har ett 128K kontextfönster och 16K maximala utmatningstoken. Den får betydligt högre poäng på resonemangsriktmärken och är mer pålitlig för komplexa uppgifter. Den är dock betydligt dyrare: ungefär 10–15 gånger kostnaden per token jämfört med gpt-3.5-turbo-1106. För applikationer där hög noggrannhet och multimodalitet inte krävs, erbjuder gpt-3.5-turbo-1106 bättre kostnadseffektivitet. Om du behöver de avancerade funktionerna är det enkelt att uppgradera till gpt-4o via OrcaRouter genom att ändra modell-ID till 'openai/gpt-4o'.
Jämförbara modeller från andra leverantörer inkluderar Anthropics Claude 3 Haiku (endast text, liknande hastighet och kostnad) och Googles Gemini 1.5 Flash. Var och en har olika API-format men kan nås via OrcaRouter. gpt-3.5-turbo-1106 är allmänt antagen och integrerad i många verktyg. Dess funktionsanropsstöd är moget. Däremot kan modeller som Claude 3 Haiku erbjuda större kontextfönster (200K) till liknande priser, medan Gemini 1.5 Flash tillhandahåller multimodala funktioner. Valet beror på ekosystemkompatibilitet, specifik benchmarkprestanda och latenskrav. OrcaRouter gör att du kan prova olika modeller under samma API-format.
Välj gpt-3.5-turbo-1106 när du behöver en pålitlig, kostnadseffektiv textmodell som är brett kompatibel med befintliga verktyg och stöder funktionsanrop. Den är idealisk för högvolymapplikationer där varje förfrågan är relativt kort och inte kräver djup resonemangsförmåga. Undvik den om du behöver multimodala indata, ett större kontextfönster eller högre faktamässig noggrannhet för komplexa ämnen. Om du behöver den senaste kunskapsgränsen, föredra gpt-3.5-turbo-0125. För ultimat prestanda, välj gpt-4o. OrcaRouters modellkatalog gör det möjligt att enkelt växla mellan dessa alternativ utan kodändringar.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-1106",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_p| Inmatning / 1M token | $1.00 |
| Utdata / 1M tokens | $2.00 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/openai/gpt-3.5-turbo-1106Öppna @misc{orcarouter_gpt_3_5_turbo_1106,
title = {openai/gpt-3.5-turbo-1106 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-1106}
}openai. (n.d.). openai/gpt-3.5-turbo-1106 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-1106