Den senaste GPT-4 Turbo-modellen med bildigenkänningsfunktioner. Bildigenkänningsförfrågningar kan nu använda JSON-läge och funktionsanrop. Träningsdata: fram till december 2023.
GPT-4 Turbo är en stor språkmodell som släppts av OpenAI och som bearbetar både text- och bildinmatningar. Den bygger på GPT-4:s arkitektur men utökar kontextfönstret till 128 000 tokens — ungefär…
GPT-4 Turbo visar starka resonemangsförmågor, särskilt inom matematik (MATH-500-poäng på 73,7), kodgenerering och flerstegsproblemlösning. Den kan följa komplexa instruktioner över långa konversationer, upprätthålla konsekvens över tusentals tokens och generera sammanhängande tekniska förklaringar. Modellen kan även analysera bilder — såsom skärmdumpar, diagram och tryckt text — när indata innehåller bildinformation. Den är dock inte specialiserad för alla domäner; för enkla klassificerings- eller extraheringsuppgifter kan en mindre modell som GPT-3.5 Turbo vara tillräcklig och mer ekonomisk.
Ett 128,000-tokens kontextfönster gör att du kan mata in stora dokument — hela böcker, långa juridiska avtal, fullständiga kodförråd eller långa konversationer — utan att behöva dela upp innehållet i bitar. Till exempel kan du klistra in en fullständig forskningsartikel och ställa frågor om vilket avsnitt som helst utan att förlora de tidigare delarna. Detta är särskilt värdefullt för uppgifter som dokumentsammanfattning, lagstiftningsanalys eller felsökning av en stor kodbas där modellen behöver se hela strukturen. På OrcaRouter debiteras detta kontext som indatatokens, så att mata in ett 100K-tokens dokument skulle kosta ungefär $1.00 per fråga (100K * $10/1M).
GPT-4 Turbo accepterar bilder som en del av indata, vilket gör att den kan förstå visuellt innehåll som fotografier, diagram, illustrationer och skärmdumpar. Modellen kan beskriva vad som finns i en bild, svara på frågor om dess innehåll och till och med utföra diagramresonemang (t.ex. tolka ett flödesschema eller en graf). Bilder tillhandahålls vanligtvis som URL:er eller base64-kodade data inom OpenAIs chat completion-format. Kostnaden för bildbehandling ingår i antalet indata-tokens, som beräknas baserat på bildupplösning och detaljnivå enligt OpenAIs prismodell.
Om ditt användningsfall involverar uppgifter med hög volym och låg komplexitet – såsom enkel textklassificering, grundläggande Q&A på korta sammanhang eller repetitiv extrahering – kan en mindre modell som GPT-3.5 Turbo eller en dedikerad finjusterad modell ge acceptabla resultat till en bråkdel av kostnaden. GPT-4 Turbos prissättning är ungefär 20 gånger högre än GPT-3.5 Turbo per inmatningstoken och 30 gånger högre per utmatningstoken. För applikationer där svarstid är viktig svarar GPT-3.5 Turbo även snabbare. Utvärdera avvägningen mellan noggrannhet och kostnad; för många produktionspipelines kan en hybridansats med en billig modell för filtrering och GPT-4 Turbo för komplexa fall optimera utgifterna.
GPT-4 Turbo uppnådde en poäng på 73,7 på MATH-500-riktmärket, som utvärderar en modells förmåga att lösa matematikproblem på grundskole- till gymnasienivå inom ämnen som algebra, geometri och kalkyl. Denna poäng indikerar stark matematisk resonemangsförmåga men är inte toppmodern; vissa specialiserade modeller eller större ensembler kan överstiga 80. Riktmärket är användbart för att jämföra modeller när det gäller systematisk problemlösning snarare än rå språkgenerering. På OrcaRouter kan du testa detta själv genom att skicka en uppsättning matematikproblem via API:et och jämföra resultaten.
Styrkor inkluderar djup resonemangsförmåga, hantering av långa kontexter samt kompetens i att generera och förklara kod. Modellen visar också god prestanda på uppgifter som kombinerar text och bild, som att tolka diagram. Begränsningar inkluderar en relativt modest output-gräns på 4 096 tokens, vilket innebär att långformig generering (t.ex. att skriva ett helt kapitel) kräver flera anrop. Modellen kan ibland producera felaktiga svar i gränsfall — den är inte ofelbar. Dessutom är den kanske inte det bästa valet för realtidsapplikationer på grund av högre latens jämfört med mindre modeller. Inga hastighetsmätningar anges, men anekdotiska rapporter tyder på att den är något långsammare än GPT-3.5 Turbo.
Exakta fördröjningssiffror för GPT-4 Turbo på OrcaRouter publiceras inte; prestanda beror på leverantörens infrastruktur och begäranbelastning. I praktiken är modellens inferenstid längre än mindre modeller på grund av dess större parameterantal och kontextbearbetning. För korta indata är svarstiderna typiskt några sekunder, medan mycket stora kontexter (t.ex. 100K tokens) kan öka fördröjningen avsevärt eftersom modellen måste bearbeta alla tokens innan utdata genereras. OrcaRouter marknadsför ingen specifik acceleration. Användare som behöver lägre fördröjning för interaktiva applikationer kan föredra en snabbare modell, medan batchbearbetning av komplexa uppgifter fortfarande är genomförbar.
Priset är per token: $10.00 per 1 miljon input-tokens och $30.00 per 1 miljon output-tokens. Detta matchar OpenAIs direktpris, utan extra påslag från OrcaRouter. Input-tokens inkluderar systemmeddelandet, användarmeddelanden, bildtokens och eventuell konversationshistorik. Output-tokens är modellens genererade svar. Den totala kostnaden för en förfrågan beräknas som (input_tokens * $0.00001) + (output_tokens * $0.00003). Det finns inga minimiavgifter eller månatliga åtaganden; du betalar endast för de tokens du använder.
GPT-4 Turbo är betydligt dyrare än mindre modeller som GPT-3.5 Turbo ($0.50/$1.50 per 1M tokens) men erbjuder överlägsen resonemangsförmåga och kontexthantering. För uppgifter som endast kräver grundläggande funktioner kan användning av GPT-4 Turbo leda till onödiga kostnader. Å andra sidan, jämfört med den ursprungliga GPT-4 ($30/$60 per 1M tokens), är GPT-4 Turbo 33% billigare på inmatning och 50% billigare på utmatning, vilket gör det till ett mer kostnadseffektivt alternativ för högprestandakrav. OrcaRouters nollpåslagsprissättning säkerställer att du betalar samma taxa som när du använder OpenAI direkt.
OrcaRouter erbjuder inga specifika rabatter, volymprissättning eller svarscachning för GPT-4 Turbo utöver de angivna per-token-priserna. Prissättningen är enkel: du betalar exakt vad OpenAI tar ut, utan extra avgifter. Det finns inga åtaganderabatter, förköp av tokens eller nivåindelad prissättning. Cachning av uppmaningar eller svar annonseras inte, så varje förfrågan debiteras till standardpriset. Om du förväntar dig mycket höga volymer kan du kontakta OrcaRouter eller överväga att använda en dedikerad API-endpoint med ditt eget cachningslager för att minska återkommande kostnader för identiska indata.
Utmatningstokens kostar tre gånger mer än inmatningstokens ($30 mot $10 per 1M). Därför kan långa genereringar snabbt öka räkningen. Exempelvis skulle en 2 000-tokens respons kosta $0.06, medan en 4 000-tokens respons kostar $0.12. För att kontrollera kostnaderna, överväg att ställa in en lägre max_tokens-parameter, använda kortare uppmaningar, eller använda iterativ förfining där modellen producerar kortare utmatningar och sedan utökar dem i ett separat anrop endast vid behov. För uppgifter som sammanfattning kan en modell med lägre kostnad per utmatningstoken vara att föredra om sammanhanget inte är kritiskt.
Du kan anropa GPT-4 Turbo via OrcaRouters OpenAI-kompatibla API. Skaffa först en API-nyckel från OrcaRouter. Ställ sedan in bas-URL:en till https://api.orcarouter.ai/v1 och använd modell-ID:t "openai/gpt-4-turbo" i dina chattkompletteringsförfrågningar. Exempelvis med OpenAI Python SDK skapar du en klient där base_url pekar på OrcaRouter och model="openai/gpt-4-turbo". Förfrågnings- och svarsformaten är identiska med OpenAIs inbyggda API, så minimala kodändringar krävs för att byta från direkt OpenAI-användning.
API:et stöder standardparametrar för OpenAI-chattkomplettering: messages (array med role och content), temperature (0-2), top_p, n, stream, stop, max_tokens (begränsad till 4096), presence_penalty, frequency_penalty, logit_bias, user, och funktionsanrop/verktyg. För bildindata kan du inkludera en content-del med typen "image_url" och url. Modellen stöder inte ytterligare parametrar utöver OpenAI:s specifikation. Alla parametrar fungerar exakt som dokumenterat för OpenAI:s GPT-4 Turbo. Observera att parametern max_tokens inte får överstiga 4096, vilket är modellens utdatagräns.
Migreringen är enkel: ersätt din OpenAI-bas-URL med OrcaRouters slutpunkt https://api.orcarouter.ai/v1 och ändra modellnamnet till "openai/gpt-4-turbo". Använd din OrcaRouter API-nyckel istället för din OpenAI API-nyckel. Resten av din kod — meddelandeformatering, streaming, felhantering — förblir oförändrad eftersom API:et är fullt kompatibelt. Om du använde OpenAI Python-biblioteket kan du helt enkelt ställa in openai.api_base (eller motsvarande i nyare versioner) till OrcaRouter-URL:en. Detta gör att du kan testa GPT-4 Turbo via OrcaRouter utan att skriva om någon logik.
GPT-4 Turbo är en evolution av GPT-4 med ett större kontextfönster (128K jämfört med upp till 32K i tidigare GPT-4-varianter) och billigare prissättning per token: $10/$30 per 1M tokens jämfört med $30/$60 per 1M tokens för GPT-4. Båda modellerna stöder vision, men GPT-4 Turbo förbättrar också effektivitet och mindre resonemangskvalitet. I riktmärken som MATH-500 får GPT-4 Turbo 73,7, medan den ursprungliga GPT-4 (med kontext 8K) fick runt 52,9 på en mindre MATH-testuppsättning — siffrorna är inte direkt jämförbara på grund av olika testversioner, men förbättringen är indikativ. På OrcaRouter finns de äldre GPT-4-modellerna också tillgängliga till respektive prissättning.
GPT-3.5 Turbo är betydligt billigare ($0,50/$1,50 per 1M tokens) och snabbare, vilket gör den lämplig för högvolymsapplikationer med låg latens. Den har dock ett mindre kontextfönster (16K eller 4K beroende på variant) och betydligt svagare resonemang, kodgenerering och bildigenkänning. För uppgifter som kräver flerstegsresonemang eller stor kontext presterar GPT-4 Turbo klart bättre. I en direkt jämförelse av matematiskt resonemang når GPT-3.5 Turbo vanligtvis under 30 på MATH-500, medan GPT-4 Turbo når 73,7. Välj GPT-3.5 Turbo för enkla uppgifter och kostnadsbesparingar, men lita på GPT-4 Turbo när noggrannhet eller kontextlängd är avgörande.
En direkt jämförelse sida vid sida ges inte, men allmän kunskap visar att Anthropic Claude 3 och Google Gemini 1.5 erbjuder liknande funktioner. Claude 3 Opus har ett kontextfönster på 200K och jämförbar resonemangsförmåga, medan Gemini 1.5 Pro kan hantera upp till 1M tokens. Däremot har varje modell olika pris- och prestandaprofiler. På OrcaRouter kan du även få tillgång till andra leverantörers modeller för jämförelse. GPT-4 Turbo förblir konkurrenskraftig tack vare sin balans mellan pris, resonemangskvalitet och utvecklarekossystem (OpenAI SDK). För bildbehandlingsuppgifter stöder både Claude och Gemini även bildinmatning.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4-turbo",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_p| Inmatning / 1M token | $10.00 |
| Utdata / 1M tokens | $30.00 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
GET /api/public/models/openai/gpt-4-turboÖppna @misc{orcarouter_gpt_4_turbo,
title = {GPT-4 Turbo API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4-turbo}
}OpenAI. (2024). GPT-4 Turbo API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4-turbo