OpenAI GPT-4o-mini förhandsvisning med utökat sammanhang för sökorienterad textgenerering till låg kostnad.
Denna modell är en förhandsvisningsvariant av GPT-4o-mini från OpenAI, optimerad för sökinriktad textgenerering. Den accepterar endast textinmatning och erbjuder ett kontextfönster på 128 000 tokens,…
Modellen utmärker sig på att förstå och generera text baserat på stora kontexter (upp till 128k tokens) och producera utdata på upp till 16 384 tokens. Den behåller GPT-4o-minis kärnstyrkor: snabb inferens, bra följsamhet av instruktioner och kostnadseffektivitet. Sök-förhandsvisningsfinjusteringen förbättrar troligen dess förmåga att extrahera relevanta utdrag, jämföra information och besvara frågor som kräver att man skannar långa avsnitt. Den kan användas för sammanfattning, frågebesvarande, informationsutvinning och flervarvskonversation så länge indatan förblir text. Den stöder inte funktionsanrop eller verktygsanvändning som standard, men du kan införliva externa sökresultat i din prompt.
Baserat på dess utformning är modellen bäst för uppgifter där en användare tillhandahåller ett långt textblock som innehåller den information som behövs för att generera ett svar. Detta omfattar scenarier som att analysera en uppsättning sökresultat (som text), jämföra produktbeskrivningar, extrahera viktiga fakta från forskningsartiklar eller sammanfatta mötesprotokoll. Kontexten på 128k gör det möjligt att bearbeta hela böcker eller flerdokumentssamlingar i en enda förfrågan. Modellen är dock kanske inte optimal för kreativt skrivande, kodgenerering eller uppgifter som kräver multimodal förståelse. För dessa, överväg standardmodellerna GPT-4o-mini eller GPT-4o.
Om din uppgift är mycket enkel—som en kort fråga-svar eller klassificering—och inte kräver den stora kontextfönstret eller sökspecifik anpassning, kan en billigare modell som GPT-4o-mini (utan preview) eller till och med GPT-3.5 Turbo räcka. Preview-modellens prissättning är identisk med GPT-4o-mini, så kostnad är inte en differentierare. Men om latens är prioritet, är GPT-4o-mini redan en av de snabbaste modellerna; preview-versionen borde ha liknande hastighet. Om du inte behöver sökfokus, kan standard GPT-4o-mini vara mer allmänt testad och stabil.
Det maximala antalet utdatatokens per förfrågan är 16 384. Ingångskontexten kan vara upp till 128 000 tokens. Dessa är generösa gränser som möjliggör långa svar och mycket långa kontexter. Men eftersom modellen endast är textbaserad måste alla tokens vara text. Det finns inget inbyggt stöd för strukturerad data som JSON-schema-tvång, även om du kan instruera modellen att generera JSON. Förhandsversionen kan ha hastighetsbegränsningar; när du använder OrcaRouter beror dessa begränsningar på din kontonivå och backend-leverantörens tillgänglighet.
OpenAI har inte publicerat separata benchmark-resultat för denna specifika förhandsvisningsmodell. Däremot är den underliggande GPT-4o-mini känd för att uppnå starka resultat inom många NLP-benchmarks, samtidigt som den är betydligt snabbare och billigare än GPT-4o. Användare kan förvänta sig liknande allmän prestanda, med potentiellt bättre resultat på uppgifter som involverar informationssökning eller långkontextresonemang på grund av sökjusteringen. Utan officiella benchmarks rekommenderas det att utvärdera modellen på din egen testuppsättning för att mäta dess effektivitet för din domän.
GPT-4o-mini är en av de snabbaste modellerna i GPT-4-familjen, och denna förhandsversion bör ha jämförbar latens. Typisk tid-till-första-token är låg, vilket gör den lämplig för interaktiva applikationer. Exakt latens beror på förfrågningsstorlek, utdatalängd och nuvarande leverantörsbelastning. 128k-kontexten kan öka tiden-till-första-token jämfört med kortare kontexter, men när strömningen väl börjar produceras token snabbt. OrcaRouter tillför ingen betydande överhead; API-anropen är optimerade för minimal latens.
Den främsta styrkan är kombinationen av hög hastighet, låg kostnad och förmågan att hantera mycket långa kontexter. För uppgifter där svaret finns i den angivna texten kan denna modell extrahera det effektivt utan den högre kostnaden för GPT-4o. Den ärver också den starka instruktionsföljden från GPT-4o-mini. Den kan dock inte matcha den nyanserade resonemangsförmågan, kreativiteten eller faktagranskningen hos större modeller som GPT-4o eller GPT-4 Turbo. I komplexa resonemangsuppgifter presterar de större modellerna ofta bättre, men med högre latens och kostnad.
Som en förhandsvisning kan modellen ha oupptäckta buggar eller inkonsekvent beteende. Den har inte testats lika brett som stabila utgåvor. Sökoptimeringen kan orsaka oväntade utdata när indatan inte innehåller tillräckligt med information, vilket potentiellt kan leda till hallucination. Modellen kan inte använda externa verktyg eller surfa på webben om du inte tillhandahåller relevant innehåll. Om din uppgift kräver uppdaterade webbsökningsresultat måste du manuellt injicera dem i prompten. Dessutom stöder den inte bilder eller ljud, vilket begränsar dess användning i multimodala scenarier.
OrcaRouter vidarebefordrar leverantörens prissättning utan påslag. För openai/gpt-4o-mini-search-preview-2025-03-11 är kostnaden $0.15 per 1 miljon inmatningstoken och $0.60 per 1 miljon utmatningstoken. Inmatningstoken inkluderar hela prompten (systemmeddelande, användarmeddelanden och eventuell historik). Utmatningstoken är den genererade texten. Det finns inga ytterligare avgifter från OrcaRouter. Detta gör modellen mycket prisvärd för användning i stor skala, särskilt vid bearbetning av långa kontexter.
Inga specifika caching-rabatter nämns för denna modell på OrcaRouter. Prissättningen är per token, betala per användning. Vissa leverantörer erbjuder prompt-caching som minskar kostnaden för upprepade prefix, men det är inte bekräftat för denna förhandsvisning. Vanligtvis kan OpenAI erbjuda caching för vissa modeller i sitt API, men denna förhandsvisning kanske inte är berättigad. Kontrollera OpenAIs dokumentation för de senaste caching-policyerna. På OrcaRouter debiteras du samma avgift oavsett användningsmönster.
Vid $0.15 inmatning / $0.60 utdata per miljon tokens är det identiskt med standard GPT-4o-mini. Det gör det betydligt billigare än GPT-4o ($2.50 inmatning / $10 utdata) och GPT-4 Turbo ($10 inmatning / $30 utdata). Det är dyrare än äldre modeller som GPT-3.5 Turbo ($0.50/$1.50 per miljon?). Värdet kommer dock från den stora kontexten och sökanpassningen. Om du behöver hela kontexten är kostnadsfördelen jämfört med större modeller betydande.
För att använda modellen, ställ in din API-bas-URL till https://api.orcarouter.ai/v1, din API-nyckel (från OrcaRouter) och modell-ID:t till exakt "openai/gpt-4o-mini-search-preview-2025-03-11". Exempel med standard OpenAI Python-klient: ``` client = OpenAI(api_key="your_orcarouter_key", base_url="https://api.orcarouter.ai/v1") response = client.chat.completions.create( model="openai/gpt-4o-mini-search-preview-2025-03-11", messages=[{"role": "user", "content": "Your prompt"}] ) ``` Alla standardparametrar för chattkompletteringar stöds, inklusive temperature, max_tokens, top_p, frequency_penalty, presence_penalty och stoppsekvenser. Streaming är tillgängligt med stream=True.
Modellen stöder samma parametrar som OpenAI Chat Completions API. Nyckelparametrar: temperature (standard 1.0, intervall 0-2), top_p (standard 1.0), max_tokens (standard varierar, kan ställas in upp till 16384), stop (lista med strängar), frequency_penalty (standard 0), presence_penalty (standard 0) och logit_bias. Du kan också skicka med user_id för övervakning. Det finns ännu inget inbyggt stöd för response_format-schema; om du behöver strukturerad utdata, använd promptinstruktioner. Modellen respekterar systemmeddelanden för att ställa in kontext.
Migration kräver inga kodändringar i request-strukturen utöver att uppdatera modell-ID:t. I ditt API-anrop, ersätt modellsträngen med "openai/gpt-4o-mini-search-preview-2025-03-11". Se till att din bas-URL pekar till OrcaRouter (https://api.orcarouter.ai/v1) om du inte redan använder den. Eftersom det är en förhandsvisning, testa noggrant: svar kan skilja sig i stil eller noggrannhet. Du kan villkorligt växla mellan modeller i din applikation genom att lagra modell-ID:t i konfigurationen. Övervaka prestanda och kostnader för att säkerställa att förhandsvisningen uppfyller dina behov innan full utrullning.
Båda modellerna delar samma grundarkitektur och prissättning. Den vanliga GPT-4o-mini är en generell modell utan specifik sökjustering. Förhandsversionen är utformad för att förbättra prestandan på uppgifter som innebär att extrahera och sammanställa information från stora textkontexter, såsom sökresultatanalys. I praktiken kan förhandsversionen hantera långa promptar med många fakta mer exakt, medan standardversionen kan vara bättre för öppna konversationer, kreativt skrivande eller uppgifter där sökbeteende inte behövs. Om din applikation redan fungerar med standard GPT-4o-mini är det låg risk att testa förhandsversionen på grund av identiskt API.
GPT-4o är OpenAI:s flaggskepps multimodala modell med högre resonemangsförmåga, bildförståelse och ett större kontextfönster (128k tokens). Den är dock betydligt dyrare ($2.50/$10 per miljon tokens) och långsammare. Sökförhandsvisningen av GPT-4o-mini byter visst resonemangsdjup mot hastighet och kostnad. För uppgifter som är rent textbaserade och inte kräver komplexa flerstegsresonemang kan förhandsvisningen vara tillräcklig till en bråkdel av kostnaden. För uppgifter som kräver multimodal inmatning eller högre noggrannhet förblir GPT-4o överlägsen.
Claude 3 Haiku (Anthropic) och Gemini 1.5 Flash (Google) är också snabba, billiga modeller med stora kontexter. Haiku har 200k tokens kontext, Flash upp till 1M. Priserna varierar. Sökförhandsvisningen av GPT-4o-mini är unik eftersom det är en förhandsvisning av en sökoptimerad variant från OpenAI. Utan direkta benchmark-jämförelser är det svårt att säga vilken som är bäst. Alla tre är utmärkta för informationshämtningsuppgifter. Valet kan bero på ekosystemkompatibilitet, prompt-stil och specifik prestanda på dina data. OrcaRouter erbjuder enhetlig åtkomst till alla, vilket möjliggör enkel A/B-testning.
Välj denna modell om ditt främsta krav är kostnadseffektivitet, snabba svarstider och du arbetar med textbaserade indata som inte kräver avancerad resonemangsförmåga. Den är idealisk för applikationer med hög volym där varje förfrågans sammanhang är stort (t.ex. bearbetning av långa dokument) men utdata är relativt kort. Om du behöver bästa möjliga noggrannhet, särskilt för tvetydiga eller komplexa frågor, eller om du behöver bearbeta bilder, då är GPT-4o ett bättre val. Förhandsvisningsmodellen är också lämplig för prototypframtagning och testning innan du binder dig till en dyrare modell.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-search-preview-2025-03-11",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| Inmatning / 1M token | $0.150 |
| Utdata / 1M tokens | $0.600 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/openai/gpt-4o-mini-search-preview-2025-03-11Öppna @misc{orcarouter_gpt_4o_mini_search_preview_2025_03_11,
title = {openai/gpt-4o-mini-search-preview-2025-03-11 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview-2025-03-11}
}openai. (n.d.). openai/gpt-4o-mini-search-preview-2025-03-11 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview-2025-03-11