Gemini 3.5 Flash-Lite

google/gemini-3.5-flash-lite
NyUtvalt
VisionLjudVerktygJSONResonemang
av Google · 2026-07-21

Gemini 3.5 Flash-Lite är Googles mest kostnadseffektiva Gemini-modell, specialbyggd för mycket högvolym-, latenskänsliga arbetsbelastningar där kostnad per anrop dominerar. Trots sitt pris är den inbyggt multimodal — den accepterar text, bilder, video, ljud och filer med textutdata — och har samma 1M-tokens kontextfönster och upp till 64K utdatatokens som den större Flash-nivån, så långa dokument och blandade mediainmatningar förblir inom räckhåll. Till ungefär en femtedel av priset för 3.6 Flash, är det rätt verktyg för klassificering, extrahering, dirigering, sammanfattning, lätta agenter, syntetisk datagenerering och alla pipeline som körs miljontals gånger. Det stöder fortfarande konfigurerbar resonemangsinsats, inbyggt verktygsanrop och strukturerade utdata, och slår över sin vikt i agentiska och långkontextuella riktmärken för en lätt modell — till exempel 74.0% på OSWorld-Verified och 72.2% på 128k multi-needle retrieval, bekvämt före den tidigare 3.1 Flash-Lite. Den talar både OpenAI chat-completions-formatet och Geminis inbyggda generateContent API, så du kan blanda den med tyngre modeller bakom en enda integration — dirigera enkel, högvolymstrafik till Flash-Lite och eskalera svåra uppgifter till 3.6 Flash eller en Pro-modell.

ctx1.05M tokens
Max output65.5K
Inmatningtext + image + video + file + audio
Utdatatext
p50 TTFT1.32 s
INMATNING$0.30/ 1M token
UTDATA$2.50/ 1M token
p50 TTFT1.32 s7d
p95 TTFT10.00 s7d
TRAFIK6.3Mtokens/7d

Google Gemini 3.5 Flash-Lite är en multimodal språkmodell utvecklad av Google, som erbjuds via OrcaRouters OpenAI-kompatibla API. Den accepterar text, bild, video, fil och ljudinmatningar, vilket gör…

Vad är Google Gemini 3.5 Flash-Lite?

Vem är den här modellen avsedd för?

Vilka modaliteter stödjer modellen?

Vad är storleken på kontextfönstret och maximal utdata?

Kodexempel

Anropa från valfritt SDK

OpenAI-kompatibel — behåll det SDK du redan använder

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parametrar som stöds

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Priser

Inmatning / 1M token$0.300
Utdata / 1M tokens$2.50
Cacheläsning / 1M$0.030
ValutaUSD

Kostnadskalkylator

Token/månad10MM
Andel input70%%
Uppskattat/månad $9.60 · Med promptcachning $8.66

Uppskattning baserad på listpris

Token- och kostnadsberäknare

Input-token: 18Kostnad per förfrågan: $0.001255

Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.

Prestanda

p50 TTFT
1.32 s
Utdatahastighet
818 tok/s
p95 TTFT
10.00 s
Felfrekvens
4.7%

Offentliga benchmarks

49.3
AA Coding
Bättre än 59% av jämförda modeller
#50 av 123
36.5
AA Intelligence
Bättre än 54% av jämförda modeller
#58 av 125
CharXiv Reasoning (no tools)
74.5
CharXiv Reasoning (with tools)
76.5
GDM-MRCR v2 8-needle (128k avg)
72.2
GDM-MRCR v2 8-needle (1M pointwise)
21.3
GPQA Diamond
83.8
Humanity's Last Exam
17.5
Long-Context Recall
62.0
MLE-Bench
39.2
OSWorld-Verified
74.0
SciCode
40.9
SWE-Bench Pro (Public)
54.2
tau_banking
16.5
Terminal-bench 2.1 (Terminus-2)
54.0
terminalbench_v2_1
53.6
Källa: artificialanalysis.ai, deepmind.google

Så jämför den sig

Gemini 3.5 Flash-LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Input $/M$0.30$2.00$4.00$0.50
Output $/M$2.50$12.00$18.00$3.00
Kontext1.0M1.0M1.0M1.0M
Kvalitet6/1010/1010/109/10
Jämför sida vid sidaJämför sida vid sidaJämför sida vid sidaJämför sida vid sida

Vanliga frågor

Vad är priset per token för Gemini 3.5 Flash-Lite på OrcaRouter?
Priset är $0.30 per miljon inmatningstokens och $2.50 per miljon utmatningstokens. Dessa är leverantörspriser med noll påslag. Inmatningstokens inkluderar alla modaliteter (text, bild, video, ljud, fil). Utmatningstokens är genererad text.
Vad är storleken på kontextfönstret?
Kontextfönstret är 1 048 576 tokens (ungefär 1 miljon). Den maximala utdatalängden är 65 536 tokens. Detta gör det möjligt att hantera mycket långa dokument, videor eller ljudinspelningar i en enda API-begäran.
Vilka är de viktigaste styrkorna hos denna modell?
Dess främsta styrkor är: mycket låg kostnad per token, stöd för fem inmatningsmodaliteter (text, bild, video, ljud, fil), ett massivt 1M kontextfönster och förmåga att använda verktyg (CharXiv Reasoning-poäng 76.5 med verktyg). Den är utformad för produktionspipelines med hög genomströmning och kostnadskänslighet.
Hur står det sig jämfört med större modeller som Gemini 3.5 Pro?
Inga direkta jämförelser av riktmärken tillhandahålls. Som en flash‑lite-variant prioriterar denna modell effektivitet och låg kostnad framför rå prestanda. Större modeller som Gemini 3.5 Pro skulle sannolikt uppnå högre noggrannhet i komplexa resonemangsuppgifter, men kosta betydligt mer per token. Använd denna modell när kostnad och genomströmning är kritiska.
Cachar modellen prompts för att minska kostnaderna?
Den angivna informationen nämner ingen cachningsmekanism eller rabatterad prissättning för cachade tokens. Du bör anta att alla tokens debiteras till standardpriset för inmatning. Om cachning är viktigt, kontrollera med OrcaRouter eller Google för eventuella rabatter.
Hur kommer jag åt denna modell via ett OpenAI-kompatibelt API?
Använd OrcaRouter's API med bas-URL https://api.orcarouter.ai/v1. Ställ in modellparametern till "google/gemini-3.5-flash-lite". API:t är fullt kompatibelt med OpenAI chat completions-format, inklusive multimodalt innehåll och verktygsdefinitioner.
Vilken datahantering och integritet kan jag förvänta mig?
Datahanteringen styrs av Googles policyer (leverantören) och OrcaRuters villkor. Modellen behandlar dina indata, och utdata returneras till dig. Inga specifika privatlivscertifieringar för denna modell tillhandahålls. För känsliga data, granska leverantörens databehandlingsavtal.
Kan jag använda den här modellen för realtidsapplikationer?
Latensdetaljer är inte specificerade. Modellen kan returnera svar på sekunder för korta indata, men bearbetning av mycket långa prompts (nära 1 miljon tokens) kan ta tiotals sekunder. Den är lämplig för nästan realtidsapplikationer med måttliga indatastorlekar. För strikta realtidskrav, testa med dina förväntade indatalängder.
Vad är CharXiv Reasoning benchmark-poängen?
Modellen uppnådde en poäng på 76,5 på CharXiv Reasoning med verktyg. Detta benchmark testar diagramförståelse och resonemang. Poängen indikerar måttlig prestanda; modellen kan tolka diagram och besvara frågor, men inte på nivån av dedikerade resonemangsmodeller. Inga andra benchmark-poäng anges.
Finns det någon minimikostnad eller något åtagande för att använda OrcaRouter?
OrcaRouter kräver ingen minimiutgift per månad. Du debiteras endast för de tokens du använder till leverantörens priser utan påslag. Ingen förskottsbetalning eller långsiktigt kontrakt. Registrera dig helt enkelt för en API-nyckel och börja skicka förfrågningar.

Bädda in denna badge

Google: Gemini 3.5 Flash-Lite$0.30/M in1324ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg" alt="Google: Gemini 3.5 Flash-Lite på OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.5 Flash-Lite](https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite)

Modellkort som data

GET /api/public/models/google/gemini-3.5-flash-liteÖppna