Gemini 3.5 Flash-Lite är Googles mest kostnadseffektiva Gemini-modell, specialbyggd för mycket högvolym-, latenskänsliga arbetsbelastningar där kostnad per anrop dominerar. Trots sitt pris är den inbyggt multimodal — den accepterar text, bilder, video, ljud och filer med textutdata — och har samma 1M-tokens kontextfönster och upp till 64K utdatatokens som den större Flash-nivån, så långa dokument och blandade mediainmatningar förblir inom räckhåll. Till ungefär en femtedel av priset för 3.6 Flash, är det rätt verktyg för klassificering, extrahering, dirigering, sammanfattning, lätta agenter, syntetisk datagenerering och alla pipeline som körs miljontals gånger. Det stöder fortfarande konfigurerbar resonemangsinsats, inbyggt verktygsanrop och strukturerade utdata, och slår över sin vikt i agentiska och långkontextuella riktmärken för en lätt modell — till exempel 74.0% på OSWorld-Verified och 72.2% på 128k multi-needle retrieval, bekvämt före den tidigare 3.1 Flash-Lite. Den talar både OpenAI chat-completions-formatet och Geminis inbyggda generateContent API, så du kan blanda den med tyngre modeller bakom en enda integration — dirigera enkel, högvolymstrafik till Flash-Lite och eskalera svåra uppgifter till 3.6 Flash eller en Pro-modell.
Google Gemini 3.5 Flash-Lite är en multimodal språkmodell utvecklad av Google, som erbjuds via OrcaRouters OpenAI-kompatibla API. Den accepterar text, bild, video, fil och ljudinmatningar, vilket gör…
Gemini 3.5 Flash-Lite är kapabel till en mängd olika uppgifter tack vare sitt multimodala indata och stöd för verktygsanvändning. Den hanterar textbaserade uppgifter som sammanfattning, frågebesvarande och kodgenerering. Med bilder kan den beskriva scener, extrahera text från dokument eller tolka diagram. Videoindata möjliggör aktivitetsigenkänning, bildtexter och tidsmässigt resonemang. Ljudindata underlättar transkription, språkidentifiering och talbaserad analys. Modellen stöder också verktygsanrop, vilket visas av dess CharXiv Reasoning‑poäng på 76.5 (med verktyg). Detta innebär att den kan integreras i agentiska arbetsflöden där den anropar externa API:er eller databaser. Den är dock inte utformad för kreativt skrivande, högt abstrakt resonemang eller uppgifter som kräver djup domänexpertis. Dess styrka ligger i hastighet, kostnad och bredd av modalitetsstöd snarare än ren prestanda.
Du bör välja Gemini 3.5 Flash-Lite när kostnad och genomströmning är primära bekymmer och uppgiften ryms inom dess kapacitetsområde. Den utmärker sig i högvolymspipelines såsom att indexera tusentals dokument, transkribera timmar av ljud eller köra realtidsklassificering på bildströmmar. Dess stora kontextfönster (1 miljon tokens) gör den idealisk för uppgifter som kräver en global förståelse av långa indata, såsom rättsfallsanalys eller kodbasrefaktorering. Större modeller (t.ex. Gemini 3.5 Pro) kan uppnå högre noggrannhet på komplexa benchmarks men medför betydligt högre kostnader per token och lägre genomströmning. Om din applikation kan tolerera mindre kvalitetsavvägningar för en 10–100x kostnadsreduktion, är denna modell ett starkt val. Omvänt, för uppgifter som kräver faktaprecision, kreativ generering eller toppmodern resonemangsförmåga rekommenderas en större modell.
Ja, modellen accepterar inbyggt video- och ljudinmatning tillsammans med text, bilder och filer. Videoinmatning kan ges som en sekvens av bildrutor eller en videofil; modellen bearbetar visuella bildrutor och eventuellt tillhörande ljudspår. Ljudinmatning fungerar med vanliga format som WAV, MP3 eller FLAC. Det stora kontextfönstret gör att långa inspelningar kan bearbetas i en enda begäran – till exempel kan en timmes ljudtranskription med hög detaljrikedom förbruka cirka 10 000 tokens. Detta är användbart för mötessammanfattningar, poddanalyser eller röstbaserad kundsupport. Observera att modellen inte genererar ljud- eller videoutdata; svar är alltid text. Kvaliteten på multimodal förståelse motsvarar modellens flash‑lite-nivå: tillräcklig för extraktion och klassificering, men kan missa subtila detaljer jämfört med större multimodala modeller.
Gemini 3.5 Flash-Lite stöder verktygskall, vilket framgår av dess benchmark-prestanda på CharXiv Reasoning med verktyg (poäng 76.5). Det innebär att du kan definiera funktioner eller API:er som modellen kan anropa under svarsskapandet. Typiska användningsfall inkluderar databassökningar, webbsökningar eller aritmetiska operationer. Modellen väljer när den ska anropa ett verktyg baserat på användarens instruktion och sammanhanget. Användning av verktyg kan förbättra faktacertighet och möjliggöra komplex flerstegsresonemang. Men eftersom modellen är en flash-lite-variant kan dess tillförlitlighet vid verktygskall vara lägre än hos en större specialiserad modell. Om din applikation i hög grad är beroende av felfri verktygsorkestrering kan du behöva lägga till valideringslager eller reservlogik. OrcaRouter överför verktygsdefinitioner i samma format som OpenAIs API, vilket gör integrationen enkel.
Modellen uppnådde ett resultat på 76,5 på CharXiv Reasoning-riktmärket vid utvärdering med verktyg. CharXiv testar förmågan att utföra resonemang över diagrambaserad visuell data, vilket kräver att modellen tolkar en diagrambild och svarar på frågor om den. Villkoret ”med verktyg” innebär att modellen kunde anropa externa funktioner (t.ex. en miniräknare) för att hjälpa till. Detta resultat indikerar måttlig prestanda – den är kapabel till diagramrelaterat resonemang men inte på nivån av specialistmodeller. Inga andra riktmärkesresultat har tillhandahållits för denna modell. För jämförelse skulle större modeller som Gemini 3.5 Pro sannolikt få högre poäng på denna uppgift. Värdet är användbart som referenspunkt: du kan förvänta dig rimlig diagramtolkning, men bör testa noggrant om din applikation kräver hög noggrannhet i visuella resonemangsuppgifter.
Endast CharXiv Reasoning (med verktyg)-poängen har angetts: 76,5. Ingen ytterligare benchmarkdata – såsom MMLU, HumanEval eller poäng för långkontextsökning – finns tillgänglig för Gemini 3.5 Flash‑Lite i den medföljande informationen. Det innebär att generalisering av dess prestanda till andra uppgifter kräver empirisk testning på dina egna data. Med tanke på modellens flash‑lite-natur förväntas den underprestera jämfört med fullstora modeller på de flesta standardiserade benchmark. Dock uppväger dess effektivitet och låga kostnad ofta dessa brister i produktionsmiljöer. Om du behöver verifierad prestanda på ett specifikt benchmark (t.ex. kodgenerering eller flerspråkig förståelse) bör du köra din egen utvärdering. OrcaRouter tillhandahåller inte separata benchmarkresultat; siffrorna som citeras här kommer direkt från leverantören.
Latensdetaljer anges inte i den tillhandahållna datan. Som en tumregel är flash‑lite-modeller utformade för låg latens i förhållande till sina större syskon, men den faktiska svarstiden beror på många faktorer: indatalängd, utdatalängd, samtidig förfrågningsbelastning och den underliggande hårdvaran. Med en 1M kontextfönster kan bearbetning av mycket långa uppmaningar öka latensen avsevärt på grund av den kvadratiska skalningen av attention. För korta indata (t.ex. några hundra tokens) kan du förvänta dig svar under en sekund. För indata nära 1M-tokengränsen kan latensen nå tiotals sekunder. OrcaRouter garanterar inte specifika latens-SLA:er för denna modell. Om låg latens är avgörande, överväg att använda ett mindre kontext (t.ex. via trunkering) eller en dedikerad slutpunkt. Du kan övervaka svarstider via OrcaRouter-instrumentpanelen.
Gemini 3.5 Flash-Lite är inte utformad för toppmodern noggrannhet. Dess styrkor är hastighet, kostnad och stort sammanhang. Begränsningarna inkluderar lägre prestanda på komplexa resonemangsriktmärken, minskad faktamässig återkallelse jämfört med större modeller och en tendens att ”hallucinera” på tvetydiga indata. Modellen kan ha svårt med uppgifter som kräver djup domänexpertis (t.ex. juridisk resonemang, medicinsk diagnos) eller nyanserat kreativt arbete. Dess förmåga att använda verktyg, även om den är funktionell, kanske inte är lika pålitlig som hos en dedikerad agentmodell. Dessutom, eftersom endast ett riktmärkespoäng anges (CharXiv Reasoning 76.5 med verktyg), kan du inte anta god prestanda på andra domäner utan testning. För kritiska tillämpningar, använd alltid dina egna data som riktmärke och överväg att använda en reservmodell med högre kapacitet när förtroendet är lågt.
Priset är $0.30 per 1 miljon inmatningstokens och $2.50 per 1 miljon utmatningstokens. Dessa priser är leverantörens priser som debiteras utan påslag av OrcaRouter. Inmatningstokens inkluderar alla tokens i prompten (text, bildtokens, videoramar, ljudprover, filinnehåll) oavsett modalitet. Utmatningstokens är de genererade texttokens. För en typisk långkontextfråga som förbrukar 100,000 inmatningstokens och 1,000 utmatningstokens skulle kostnaden vara ungefär ($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325 per förfrågan. I stor skala kan denna modell bearbeta miljontals förfrågningar för några hundra dollar. Jämför detta med större modeller som ofta kostar 10-50x mer per token. Det låga utmatningspriset är särskilt fördelaktigt för applikationer som genererar långa svar (t.ex. sammanfattningar av hela dokument).
Den angivna informationen anger inget specifikt cachelagringssystem eller rabatterad prissättning för cachelagrade token. Därför bör du anta att varje token som skickas till modellen debiteras enligt standard inmatningstaxan på $0,30 per miljon token, oavsett upprepning. Vissa leverantörer erbjuder automatisk prompt-cachelagring där upprepade prefix debiteras till en lägre taxa (t.ex. 50 % rabatt). För denna modell har ingen sådan cachelagringsrabatt annonserats. Om du ofta skickar samma kontext (t.ex. en stor systemprompt) kan du överväga att undersöka om OrcaRouter eller Google implementerar transparent cachelagring. I avsaknad av explicit information är det säkrast att budgetera fulla kostnader per token för alla inmatningar. Optimering genom att trimma återanvänt innehåll kan minska din effektiva faktura.
Noll påslag innebär att OrcaRouter tar exakt leverantörens taxa utan att lägga till någon extra marginal. För Gemini 3.5 Flash-Lite är inmatningspriset $0,30/1M tokens och utmatningspriset $2,50/1M tokens – det är vad Google debiterar, och OrcaRouter skickar det vidare utan höjning. Du betalar ingen ytterligare plattformsavgift per token. Detta är ovanligt bland API‑gateways, som normalt lägger på 10–20 % eller mer. Avsaknaden av påslag gör denna modell ännu mer kostnadseffektiv när den nås via OrcaRouter. Du betalar fortfarande för bandbredd och API‑infrastruktur, men dessa kostnader ingår i leverantörens taxa; OrcaRouter specificerar dem inte separat. Denna prismodell är transparent: kostnaden som visas i din användningsinstrumentpanel är den slutliga kostnaden.
Du anropar det via OrcaRouters OpenAI‑kompatibla API vid bas‑URL:en https://api.orcarouter.ai/v1. Ställ in model‑parametern till "google/gemini-3.5-flash-lite". Både chattkompletteringar (POST /v1/chat/completions) och inbäddningar (om de stöds) fungerar. För multimodala indata strukturerar du meddelanden med en roles‑array och innehållsobjekt som kan innehålla fält som text, image_url eller file_url. Exempel på cURL‑förfrågan: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' Du måste använda en OrcaRouter API‑nyckel, inte en Google API‑nyckel.
Modellen stöder standard OpenAI‑kompatibla parametrar: model, messages, max_tokens (upp till modellens gräns på 65 536), temperature, top_p, stop, frequency_penalty, presence_penalty och tools (för funktionsanrop). Ytterligare Google‑specifika parametrar (som safety_settings) kanske inte exponeras direkt; om du behöver dem, kontrollera OrcaRouter-dokumentationen för motsvarigheter. Modellen respekterar max_tokens-gränsen. För multimodal indata stöder fältet type i content: text, image_url, video_url (om OrcaRouter exponerar det), audio_url och file_url. Filtypen kan acceptera PDF-filer, CSV-filer, etc. Observera att stora mediafiler kan behöva förkodas som data-URI:er eller vara värdade offentligt. OrcaRouter kan också kräva att filen är under en viss storlek. Konsultera alltid den senaste API-dokumentationen för exakt parameterstöd.
För att migrera från en annan API-leverantör (t.ex. Google AI Studio, Vertex AI eller andra gateways) till OrcaRouter, ersätt bas-URL:en med https://api.orcarouter.ai/v1 och ställ in modell-ID:t till "google/gemini-3.5-flash-lite". Om din befintliga kod använder OpenAI Python-klienten, skicka base_url och api_key. Exempel: from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) Du kan behöva justera multimodal meddelandeformatering om din tidigare leverantör använde ett annat schema (t.ex. Anthropic). OrcaRouter förväntar sig OpenAI-format. Användarinnehållsmatriser kan innehålla flera delar. Verktygsdefinitioner är också i OpenAI-stil. Det tillkommer ingen extra migrationsavgift; du betalar endast per token enligt beskrivningen.
Inga direkta jämförelsedata tillhandahålls, men vi kan resonera kvalitativt. Gemini 2.0 Flash (om den finns) skulle sannolikt vara en tidigare generationens flash-modell. Gemini 3.5 Flash‑Lite är en nyare, lätt variant med ett större kontextfönster (1M jämfört med troligen 128K) och lägre prissättning. Kostnaden per token för Gemini 3.5 Flash‑Lite är $0,30/$2,50 per miljon tokens, vilket är mycket lågt. Äldre flash-modeller kan ha högre kostnader per token och kortare kontextfönster. Däremot kan Gemini 2.0 Flash ha bättre råprecision om det är en full flash-modell snarare än en lätt variant. Om din uppgift kräver högsta kvalitet och du har råd med högre kostnad, kan den äldre full flash-modellen vara bättre. Om du behöver ett stort kontextfönster och låg kostnad är 3.5 Flash‑Lite det logiska valet.
GPT-4o mini från OpenAI är en liknande lågkostnads, multimodal modell. Den har ett kontextfönster på 128K tokens (betydligt mindre än 1M) och prissätts till $0,15 per miljon inmatningstokens och $0,60 per miljon utmatningstokens (från början av 2025; priserna kan ha ändrats). Gemini 3.5 Flash‑Lite erbjuder ett 8x större kontextfönster till 2x inmatningspriset och 4x utmatningspriset. Så Gemini är dyrare per token men ger mycket större kontextkapacitet. För uppgifter där hela kontexten på 1M behövs (t.ex. bearbetning av hela böcker) är Gemini Flash‑Lite mer kostnadseffektivt än att försöka dela upp inmatningen i flera GPT‑4o mini-anrop. Om kontexten är kort är GPT‑4o mini billigare och kan ha bättre benchmark-prestanda. Inga benchmark-resultat är direkt jämförbara utan data.
Inga benchmark-jämförelser tillhandahålls. Llama 3.2 90B (förutsatt att denna modell existerar) är en stor öppenviktsmodell med ett mindre kontextfönster (vanligtvis 128K tokens) och högre kostnad per token när den körs via ett API. Gemini 3.5 Flash‑Lite är en proprietär modell med ett betydligt större kontextfönster och mycket låg prissättning – en av de billigaste multimodala modellerna per token som finns tillgängliga. Llama 3.2 90B kan uppnå högre noggrannhet på många NLP‑benchmarks på grund av sin storlek, men är inte multimodal och har en striktare kontextgräns. Om din uppgift är textbaserad och du behöver högsta noggrannhet kan Llama 90B (om den är tillgänglig via OrcaRouter) vara bättre. För multimodala, långkontext‑ eller högkapacitetsscenarier har Gemini Flash‑Lite tydliga fördelar. Valet beror på de specifika kraven i din applikation.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Inmatning / 1M token | $0.300 |
| Utdata / 1M tokens | $2.50 |
| Cacheläsning / 1M | $0.030 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/google/gemini-3.5-flash-liteÖppna @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite