Gemini 2.5 Flash är Googles toppmoderna arbetshästmodell, specifikt utformad för avancerat resonemang, kodning, matematik och vetenskapliga uppgifter. Den har inbyggda "tänkande"-förmågor, vilket gör att den kan ge svar med större...
Google Gemini 2.5 Flash är en multimodal språkmodell utvecklad av Google. Den tillhör serien Gemini 2.5, utformad för effektiv bearbetning av text, bild, ljud och video som indata. Modellen stöder…
Gemini 2.5 Flash accepterar fem inmatningsmodaliteter: filer (t.ex. PDF-filer, dokument), bilder, text, ljud och video. Detta gör att användare kan tillhandahålla en rik blandning av data i en enda begäran. Till exempel kan du skicka in en videoinspelning, ett medföljande textmanus och ett PDF-referensdokument, och modellen kommer att resonera över alla modaliteter. Modellen bearbetar dessa inmatningar inbyggt utan att kräva separat kodning eller uppdelning för de flesta format. Detta multimodala stöd är särskilt användbart för uppgifter som videosammanfattning, analys av flera dokument och interaktiva assistenter.
Med ett kontextfönster på 1 048 576 tokens kan Gemini 2.5 Flash bearbeta hela böcker, långa kodbaser eller timmar av transkriberat ljud i en enda omgång. Detta eliminerar behovet av glidande fönstertekniker eller externt minne. Användningsområden inkluderar granskning av ett helt mjukvaruprojekt för buggar, analys av långa juridiska dokument med omfattande hänvisningar eller sammanfattning av ett flera timmar långt möte. Den stora kontexten gör det också möjligt för modellen att bibehålla koherens över mycket långa konversationer, även om utmatningslängden är begränsad till 65 536 tokens.
Baserat på riktmärken utmärker sig Gemini 2.5 Flash i matematiskt resonemang och uppnår 93.2 på MATH-500. Den visar också stark prestanda inom kodgenerering och förståelse tack vare sin stora kontext och multimodala träning. Modellens förmåga att hantera ljud och video inbyggt minskar förbearbetningskostnader. Dess låga kostnad per token gör den attraktiv för batchbehandling och realtidsapplikationer. För uppgifter som kräver extremt hög kreativitet eller domänspecifik expertis kan en specialiserad eller större modell vara att föredra.
Gemini 2.5 Flash är redan prismässigt konkurrenskraftigt med $0,30 per 1M inmatning och $2,50 per 1M utmatningstokens. Men för mycket enkla uppgifter som klassificering eller kort textgenerering kan en mindre modell som Gemini 1.5 Flash eller tredjepartsalternativ erbjuda lägre kostnad per token. Utvärdera din förväntade tokenanvändning och latenskrav. Om din arbetsbelastning inte kräver den fulla 1M-kontexten eller multimodala indata, kan en textbaserad modell med ett mindre kontextfönster minska kostnaderna. OrcaRouters katalog erbjuder alternativ för kostnadsjämförelse.
MATH-500 är ett benchmark som består av 500 utmanande matematikproblem som täcker algebra, geometri, sannolikhetslära och talteori. En poäng på 93.2 innebär att modellen korrekt löste 93.2% av dessa problem, vilket indikerar stark matematisk resonemang och problemlösningsförmåga. Denna poäng placerar Gemini 2.5 Flash bland de bäst presterande modellerna för matematikuppgifter. Benchmarktestet testar både beräkningsnoggrannhet och logiskt resonemang. Utvecklare som arbetar med utbildningsverktyg, vetenskaplig beräkning eller matematiktunga arbetsflöden kan använda denna poäng som referens.
Hastigheten beror på förfrågans komplexitet, tokenlängd och serverbelastning. Google har inte publicerat specifika latenssiffror för Gemini 2.5 Flash. Beteckningen "Flash" indikerar dock optimering för låg latens jämfört med Pro-varianten. Vid normal användning via OrcaRouter är svarstiderna konkurrenskraftiga för realtidsapplikationer. För scenarier med hög genomströmning, överväg att batcha förfrågningar eller använda strömmande utdata. OrcaRouter stöder strömmande svar via sitt OpenAI-kompatibla API, vilket kan minska upplevd latens.
Jämfört med budgetmodeller som GPT-4o mini eller Claude 3 Haiku erbjuder Gemini 2.5 Flash ett större kontextfönster (1M jämfört med vanligtvis 128K-200K) och stöd för multimodal indata. Dess MATH-500-poäng på 93.2 är högre än många liknande prissatta alternativ. Kostnaden är konkurrenskraftig, särskilt för utdatatokens till $2.50 per 1M tokens. För uppgifter som enbart fokuserar på kreativt skrivande eller konversationsflyt kan dock andra modeller prestera bättre. Benchmarkdata för icke-matematiska uppgifter tillhandahålls inte, så direkt jämförelse är begränsad.
Medan Gemini 2.5 Flash presterar bra inom matematik och kod, täcks inte dess prestanda inom andra dimensioner—som faktaminnesåterkallelse, nyanserad språkförståelse eller kreativ generering—av den angivna benchmarken. Eftersom det är en “Flash”-modell kan den avväga något resonemangsdjup för hastighet. Den maximala utdatan på 65,536 tokens kan vara otillräcklig för att generera mycket långa rapporter eller sammanfattningar av extremt långa indata. Dessutom specificeras inte modellens träningsdatas avgränsning och eventuella bias; användare bör validera utdata för kritiska tillämpningar.
Prissättningen är enkel: $0,30 per 1 miljon tokens för inmatning och $2,50 per 1 miljon tokens för utmatning. Dessa avgifter faktureras till Googles leverantörspris utan något påslag från OrcaRouter. Inga dolda avgifter eller tillägg. Till exempel skulle bearbetning av 10 miljoner inmatningstokens kosta $3,00, och generering av 1 miljon utmatningstokens skulle kosta $2,50. Prissättningen gäller för alla stödda inmatningsmodaliteter. Tokenantal inkluderar all text, bildpatchar (efter konvertering) och ljud-/videosegment enligt Googles tokeniseringsschema.
Cachelagring av promptar kan minska inmatningskostnader när samma kontext återanvänds över flera förfrågningar. Google Gemini-modeller stöder automatisk cachelagring av upprepade prefix-tokens. På OrcaRouter följer cachelagringsbeteendet Googles policyer. Om din applikation ofta skickar samma systeminstruktioner eller referensdokument kan cachelagring sänka effektiva inmatningskostnader per token. De exakta besparingarna beror på cacheträffsgraden. Inga specifika cachelagringsrabatter anges i prisinformationen, men användare bör konsultera Googles dokumentation för behörighet till cachelagring.
Gemini 2.5 Pro kostar vanligtvis mer per token än Flash (exakta priser anges inte för Pro), men kan ge högre kvalitet på komplexa resonemangsuppgifter. Flash är utformad för applikationer där hastighet och ekonomi prioriteras. För högvolymproduktion kan den lägre kostnaden per token för Flash leda till betydande besparingar. Om en uppgift däremot kräver absolut bästa noggrannhet (t.ex. vid juridiska eller medicinska resonemang), kan merkostnaden för Pro vara motiverad. Utvärdera båda på ett urval av dina data för att fastställa den optimala avvägningen mellan pris och prestanda.
OrcaRouter lägger inte till påslag, så priset per token ligger på Googles leverantörspris. Volymrabatter kan vara tillgängliga direkt från Google för företag, men dessa återspeglas inte i den angivna standardprissättningen med betalning per användning. OrcaRouter erbjuder en enkel modell per token utan minimiåtaganden. Användare kan kontakta OrcaRouter för information om eventuella volymbaserade arrangemang, även om ingen specifik rabattstruktur anges i fakta.
Anropa Gemini 2.5 Flash via OrcaRouters OpenAI-kompatibla API. Sätt bas-URL till https://api.orcarouter.ai/v1 och modell-ID till "google/gemini-2.5-flash". Använd valfri OpenAI SDK eller HTTP-klient. Autentisering kräver en API-nyckel från OrcaRouter. Skicka en POST-begäran till /chat/completions med modellparametern. Exempel i Python: client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_KEY"); response = client.chat.completions.create(model="google/gemini-2.5-flash", messages=[{"role":"user","content":"Hello"}]). API:et stöder streaming, funktionsanrop och andra standard OpenAI-parametrar.
Alla standard OpenAI-chatkompletteringsparametrar stöds, inklusive: messages (array av meddelandeobjekt), temperature (0–2), top_p, max_tokens (upp till 65536), frequency_penalty, presence_penalty, stop, stream (boolean) och logprobs. För multimodal inmatning, använd innehållsstrukturen med text- och image_url- eller file_url-delar. Ljud- och videoinmatningar kan tillhandahållas som base64-kodade data-URI:er eller URL:er beroende på filstorlek. API:et stöder också response_format med JSON-läge om det behövs. Se OrcaRouters dokumentation för exakta formateringsdetaljer.
Migreringen är enkel eftersom OrcaRouter använder en OpenAI-kompatibel slutpunkt. Om du använder OpenAI, Anthropic eller andra leverantörer, ändra bas-URL:en till https://api.orcarouter.ai/v1 och din API-nyckel till en OrcaRouter-nyckel. Uppdatera modell-ID:t till "google/gemini-2.5-flash". Inga ändringar behövs för meddelandeformat, streaming eller andra anropsstrukturer. För användare som kommer från Googles inbyggda Vertex AI eller Generative AI SDK måste du anpassa dig till OpenAIs meddelandeformat, men många bibliotek har konverteringsverktyg.
OrcaRouter exponerar standard HTTP-felkoder: 401 för obehörig, 429 för hastighetsbegränsning, 500 för serverfel. Hastighetsbegränsningar beror på din OrcaRouter-plan. Google kan också införa egna hastighetsbegränsningar per API-nyckel. API:t returnerar fel i OpenAI-format. För stora förfrågningar som överstiger 1M kontextfönster eller 65K utdata, kommer du att få ett 400-fel. OrcaRouters dokumentation tillhandahåller specifika nivåer för hastighetsbegränsningar. Om du når hastighetsbegränsningar, överväg att försöka igen med exponentiell backoff.
GPT-4o mini är en mindre, billigare modell från OpenAI med ett kontextfönster på 128K tokens (8 gånger mindre än Gemini 2.5 Flash). GPT-4o mini är endast textbaserad, medan Gemini 2.5 Flash stöder fil, bild, ljud och video. På MATH-500 får GPT-4o mini cirka 70-80 (ingen exakt siffra angiven för denna jämförelse), medan Gemini 2.5 Flash får 93.2. GPT-4o minis prissättning är ungefär $0,15/$0,60 per 1M tokens (inmatning/utmatning) – billigare än Gemini Flash för inmatning men dyrare för utmatning. Välj Gemini Flash för multimodala, långkontext-uppgifter; välj GPT-4o mini för mycket lågkostnadstextbaserade applikationer.
Gemini 2.0 Flash (föregående generation) hade ett kontextfönster på 1M tokens och liknande multimodal support. Gemini 2.5 Flash förbättrar dock matematisk resonemangsförmåga, vilket visas av ett MATH-500-resultat på 93.2 jämfört med 2.0 Flashs resultat (inte angivet, men troligen lägre). Priset för 2.5 Flash är $0.30/$2.50 per 1M tokens, medan 2.0 Flash var $0.15/$0.60 per 1M tokens – så 2.5 Flash är dyrare per token. Avvägningen är bättre noggrannhet. För kostnadskänsliga projekt som inte kräver hög matematisk prestanda kan 2.0 Flash vara att föredra. OrcaRouter erbjuder båda versionerna.
Andra budgetvänliga multimodala modeller inkluderar Claude 3 Haiku (200K kontext, text+bild) och Llama 3.2 90B (128K kontext, text+bild). Gemini 2.5 Flash erbjuder det största kontextfönstret (1M) och stöder ljud/video inbyggt, vilket är ovanligt i den här prisklassen. Dess MATH-500-poäng på 93.2 är högre än många jämförbara modeller. För ren textgenerering kan dock modeller som Mistral Small erbjuda lägre latens. Det optimala valet beror på dina specifika modalitetskrav och om den större kontexten rättfärdigar kostnaden.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Inmatning / 1M token | $0.300 |
| Utdata / 1M tokens | $2.50 |
| Cacheläsning / 1M | $0.030 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/google/gemini-2.5-flashÖppna @misc{orcarouter_gemini_2_5_flash,
title = {Gemini 2.5 Flash API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash}
}Google. (2025). Gemini 2.5 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash