Gemini 3.5 Flash-Lite

google/gemini-3.5-flash-lite
NuovoIn evidenza
VisioneAudioStrumentiJSONRagionamento
di Google · 2026-07-21

Gemini 3.5 Flash-Lite è il modello Gemini più conveniente di Google, progettato specificamente per carichi di lavoro ad altissimo volume e sensibili alla latenza, dove il costo per chiamata è dominante. Nonostante il suo prezzo, è nativamente multimodale — accetta testo, immagini, video, audio e file con output di testo — e ha la stessa finestra di contesto da 1 milione di token e fino a 64.000 token di output del livello Flash più grande, quindi documenti lunghi e input multimediali misti rimangono alla portata. A circa un quinto del prezzo di 3.6 Flash, è lo strumento giusto per classificazione, estrazione, instradamento, riepilogo, agenti leggeri, generazione di dati sintetici e qualsiasi pipeline eseguita milioni di volte. Supporta ancora lo sforzo di ragionamento configurabile, la chiamata nativa agli strumenti e gli output strutturati, e supera le aspettative nei benchmark agentici e a contesto lungo per un modello leggero — ad esempio 74.0% su OSWorld-Verified e 72.2% su recupero multi-needle da 128k, comodamente davanti al precedente 3.1 Flash-Lite. Parla sia il formato chat-completions di OpenAI che l'API generateContent nativa di Gemini, quindi puoi mescolarlo con modelli più pesanti dietro un'unica integrazione — instradando il traffico facile e ad alto volume a Flash-Lite e inoltrando i compiti difficili a 3.6 Flash o a un modello Pro.

ctx1.05M token
Output max65.5K
Inputtext + image + video + file + audio
Outputtext
p50 TTFT1.30 s
INGRESSO$0.30/ 1M token
USCITA$2.50/ 1M token
p50 TTFT1.30 s7 g
p95 TTFT10.00 s7 g
TRAFFICO5.9Mtoken / 7 g

Google Gemini 3.5 Flash-Lite è un modello linguistico multimodale sviluppato da Google, offerto tramite l'API compatibile con OpenAI di OrcaRouter. Accetta input di testo, immagini, video, file e…

Cos'è Google Gemini 3.5 Flash-Lite?

A chi è pensato questo modello?

Quali modalità supporta il modello?

Quanto è grande la finestra di contesto e l'output massimo?

Esempi di codice

Chiama da qualsiasi SDK

Compatibile con OpenAI: mantieni il tuo SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parametri supportati

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Prezzi

Input / 1M token$0.300
Output / 1M token$2.50
Lettura cache / 1M$0.030
ValutaUSD

Calcolatore dei costi

Token / mese10MM
Quota di input70%%
Stimato / mese $9.60 · Con cache dei prompt $8.66

Stima basata sul prezzo di listino

Stima di token e costo

Token di input: 17Costo per richiesta: $0.001255

Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.

Prestazioni

p50 TTFT
1.30 s
Velocità di output
829 tok/s
p95 TTFT
10.00 s
Tasso di errore
5.0%

Benchmark pubblici

49.3
AA Coding
Migliore del 60% dei modelli confrontati
n. 49 su 122
36.5
AA Intelligence
Migliore del 54% dei modelli confrontati
n. 57 su 124
CharXiv Reasoning (no tools)
74.5
CharXiv Reasoning (with tools)
76.5
GDM-MRCR v2 8-needle (128k avg)
72.2
GDM-MRCR v2 8-needle (1M pointwise)
21.3
GPQA Diamond
83.8
Humanity's Last Exam
17.5
Long-Context Recall
62.0
MLE-Bench
39.2
OSWorld-Verified
74.0
SciCode
40.9
SWE-Bench Pro (Public)
54.2
tau_banking
16.5
Terminal-bench 2.1 (Terminus-2)
54.0
terminalbench_v2_1
53.6
Fonte: artificialanalysis.ai, deepmind.google

A confronto

Gemini 3.5 Flash-LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Input $/M$0.30$2.00$4.00$0.50
Output $/M$2.50$12.00$18.00$3.00
Contesto1.0M1.0M1.0M1.0M
Qualità6/1010/1010/109/10
Confronta affiancatiConfronta affiancatiConfronta affiancatiConfronta affiancati

FAQ

Qual è il prezzo per token per Gemini 3.5 Flash-Lite su OrcaRouter?
Il prezzo è di $0.30 per milione di token di input e $2.50 per milione di token di output. Queste sono le tariffe del fornitore senza markup. I token di input includono tutte le modalità (testo, immagine, video, audio, file). I token di output sono testo generato.
Qual è la dimensione della finestra di contesto?
La finestra di contesto è di 1.048.576 token (circa 1 milione). La lunghezza massima dell'output è di 65.536 token. Ciò consente di gestire documenti, video o registrazioni audio molto lunghi in una singola richiesta API.
Quali sono i punti di forza principali di questo modello?
I suoi punti di forza principali sono: costo molto basso per token, supporto per cinque modalità di input (testo, immagine, video, audio, file), una finestra di contesto massiccia di 1M e capacità di utilizzo di strumenti (punteggio CharXiv Reasoning 76.5 con strumenti). È progettato per pipeline di produzione ad alto rendimento e sensibili ai costi.
Come si confronta con modelli più grandi come Gemini 3.5 Pro?
Non vengono forniti confronti diretti di benchmark. Essendo una variante flash‑lite, questo modello dà priorità all'efficienza e al basso costo rispetto alle prestazioni brute. Modelli più grandi come Gemini 3.5 Pro avrebbero probabilmente una maggiore precisione in compiti di ragionamento complessi, ma costerebbero significativamente di più per token. Utilizza questo modello quando il costo e la produttività sono critici.
Il modello memorizza nella cache i prompt per ridurre i costi?
Le informazioni fornite non menzionano alcun meccanismo di caching o prezzi scontati per token in cache. Si deve presupporre che tutti i token vengano fatturati alla tariffa standard di input. Se il caching è importante, verifica con OrcaRouter o Google per eventuali sconti disponibili.
Come accedo a questo modello tramite un'API compatibile con OpenAI?
Utilizza l'API di OrcaRouter all'URL di base https://api.orcarouter.ai/v1. Imposta il parametro model su "google/gemini-3.5-flash-lite". L'API è completamente compatibile con il formato di completamento chat di OpenAI, inclusi contenuti multimodali e definizioni di strumenti.
Quali pratiche di gestione dei dati e privacy posso aspettarmi?
La gestione dei dati è regolata dalle politiche di Google (il fornitore) e dai termini di OrcaRouter. Il modello elabora i tuoi input e l'output ti viene restituito. Non vengono fornite certificazioni di privacy specifiche per questo modello. Per dati sensibili, consulta l'accordo sul trattamento dei dati del fornitore.
Posso usare questo modello per applicazioni in tempo reale?
I dettagli sulla latenza non sono specificati. Il modello può restituire risposte in secondi per input brevi, ma l'elaborazione di prompt molto lunghi (quasi 1 milione di token) può richiedere decine di secondi. È adatto per applicazioni quasi in tempo reale con dimensioni di input moderate. Per requisiti di tempo reale rigorosi, testa con le lunghezze di input previste.
Qual è il punteggio del benchmark di ragionamento CharXiv?
Il modello ha raggiunto un punteggio di 76.5 su CharXiv Reasoning with tools. Questo benchmark testa la comprensione e il ragionamento sui grafici. Il punteggio indica una prestazione moderata; il modello può interpretare i grafici e rispondere a domande, ma non al livello dei modelli di ragionamento dedicati. Non vengono forniti altri punteggi di benchmark.
C'è un costo minimo o un impegno per utilizzare OrcaRouter?
OrcaRouter non impone una spesa mensile minima. Vieni fatturato solo per i token che utilizzi, alle tariffe del fornitore con zero ricarichi. Non ci sono costi iniziali né contratti a lungo termine. Basta registrarsi per ottenere una chiave API e iniziare a fare richieste.

Incorpora questo badge

Google: Gemini 3.5 Flash-Lite$0.30/M in1298ms p50tramite OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg" alt="Google: Gemini 3.5 Flash-Lite su OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.5 Flash-Lite](https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite)

Scheda del modello come dati

GET /api/public/models/google/gemini-3.5-flash-liteApri
Leggibile dalle macchine:/llms.txt/llms-full.txt