Gemini 3.5 Flash-Lite è il modello Gemini più conveniente di Google, progettato specificamente per carichi di lavoro ad altissimo volume e sensibili alla latenza, dove il costo per chiamata è dominante. Nonostante il suo prezzo, è nativamente multimodale — accetta testo, immagini, video, audio e file con output di testo — e ha la stessa finestra di contesto da 1 milione di token e fino a 64.000 token di output del livello Flash più grande, quindi documenti lunghi e input multimediali misti rimangono alla portata. A circa un quinto del prezzo di 3.6 Flash, è lo strumento giusto per classificazione, estrazione, instradamento, riepilogo, agenti leggeri, generazione di dati sintetici e qualsiasi pipeline eseguita milioni di volte. Supporta ancora lo sforzo di ragionamento configurabile, la chiamata nativa agli strumenti e gli output strutturati, e supera le aspettative nei benchmark agentici e a contesto lungo per un modello leggero — ad esempio 74.0% su OSWorld-Verified e 72.2% su recupero multi-needle da 128k, comodamente davanti al precedente 3.1 Flash-Lite. Parla sia il formato chat-completions di OpenAI che l'API generateContent nativa di Gemini, quindi puoi mescolarlo con modelli più pesanti dietro un'unica integrazione — instradando il traffico facile e ad alto volume a Flash-Lite e inoltrando i compiti difficili a 3.6 Flash o a un modello Pro.
Google Gemini 3.5 Flash-Lite è un modello linguistico multimodale sviluppato da Google, offerto tramite l'API compatibile con OpenAI di OrcaRouter. Accetta input di testo, immagini, video, file e…
Gemini 3.5 Flash-Lite è in grado di svolgere un'ampia gamma di compiti grazie al suo input multimodale e al supporto per l'uso di strumenti. Gestisce compiti puramente testuali come riepiloghi, risposte a domande e generazione di codice. Con le immagini, può descrivere scene, estrarre testo da documenti o interpretare diagrammi. Gli input video consentono il riconoscimento delle attività, la creazione di didascalie e il ragionamento temporale. Gli input audio facilitano la trascrizione, l'identificazione della lingua e l'analisi basata sul parlato. Il modello supporta anche la chiamata di strumenti, come dimostrato dal suo punteggio CharXiv Reasoning di 76.5 (con strumenti). Ciò significa che può essere integrato in flussi di lavoro agentici in cui chiama API esterne o database. Tuttavia, non è progettato per la scrittura creativa, il ragionamento altamente astratto o compiti che richiedono una profonda competenza di dominio. Il suo punto di forza risiede nella velocità, nel costo e nell'ampiezza del supporto delle modalità piuttosto che nelle prestazioni grezze.
Dovresti scegliere Gemini 3.5 Flash-Lite quando costo e throughput sono le preoccupazioni principali e il compito rientra nel suo ambito di capacità. Eccelle in pipeline ad alto volume come l'indicizzazione di migliaia di documenti, la trascrizione di ore di audio o l'esecuzione di classificazione in tempo reale su flussi di immagini. La sua ampia finestra di contesto (1 milione di token) lo rende ideale per compiti che richiedono una comprensione globale di input lunghi, come l'analisi di casi giudiziari o il refactoring di codebase. I modelli più grandi (ad esempio, Gemini 3.5 Pro) possono raggiungere una maggiore accuratezza su benchmark complessi, ma comportano costi per token significativamente più elevati e throughput inferiore. Se la tua applicazione può tollerare compromessi di qualità minori per una riduzione dei costi di 10-100x, questo modello è una scelta valida. Al contrario, per compiti che richiedono precisione fattuale, generazione creativa o ragionamento all'avanguardia, si consiglia un modello più grande.
Sì, il modello accetta nativamente input video e audio insieme a testo, immagini e file. L'input video può essere fornito come sequenza di fotogrammi o come file video; il modello elabora i fotogrammi visivi e qualsiasi traccia audio associata. L'input audio funziona con formati comuni come WAV, MP3 o FLAC. La finestra di contesto ampia consente di elaborare registrazioni lunghe in un'unica richiesta – ad esempio, una trascrizione audio di un'ora con alto dettaglio potrebbe consumare circa 10.000 token. Ciò è utile per il riepilogo di riunioni, l'analisi di podcast o il supporto clienti basato su voce. Nota che il modello non genera output audio o video; le risposte sono sempre testo. La qualità della comprensione multimodale corrisponde al livello flash‑lite del modello: adeguata per estrazione e classificazione, ma potrebbe perdere dettagli sottili rispetto a modelli multimodali più grandi.
Gemini 3.5 Flash-Lite supporta la chiamata di strumenti, come indicato dalle sue prestazioni di benchmark su CharXiv Reasoning con strumenti (punteggio 76.5). Ciò significa che puoi definire funzioni o API che il modello può invocare durante la generazione della risposta. I casi d'uso tipici includono ricerche in database, ricerche web o operazioni aritmetiche. Il modello sceglie quando chiamare uno strumento in base all'istruzione dell'utente e al contesto. L'uso degli strumenti può migliorare l'accuratezza fattuale e consentire ragionamenti complessi in più fasi. Tuttavia, poiché il modello è una variante flash‑lite, la sua affidabilità nella chiamata di strumenti potrebbe essere inferiore a quella di un modello specializzato più grande. Se la tua applicazione dipende fortemente da un'orchestrazione impeccabile degli strumenti, potresti dover aggiungere livelli di validazione o logica di fallback. OrcaRouter passa le definizioni degli strumenti nello stesso formato dell'API di OpenAI, rendendo l'integrazione semplice.
Il modello ha ottenuto un punteggio di 76.5 nel benchmark CharXiv Reasoning quando valutato con strumenti. CharXiv testa la capacità di effettuare ragionamenti su dati visivi basati su grafici, richiedendo al modello di interpretare un'immagine di un grafico e rispondere a domande al riguardo. La condizione "con strumenti" significa che il modello poteva chiamare funzioni esterne (ad esempio, una calcolatrice) per assistere. Questo punteggio indica una prestazione moderata – è in grado di ragionare su grafici ma non al livello dei modelli specialistici. Non sono stati forniti altri punteggi di benchmark per questo modello. Per confronto, modelli più grandi come Gemini 3.5 Pro probabilmente otterrebbero un punteggio più alto in questo compito. Il valore è utile come punto di riferimento: puoi aspettarti una ragionevole interpretazione dei grafici, ma dovresti testare approfonditamente se la tua applicazione richiede alta accuratezza in compiti di ragionamento visivo.
Solo il punteggio CharXiv Reasoning (con strumenti) è stato fornito: 76.5. Nessun dato aggiuntivo di benchmark – come MMLU, HumanEval o punteggi di recupero a lungo contesto – è disponibile per Gemini 3.5 Flash‑Lite nelle informazioni fornite. Ciò significa che generalizzare le sue prestazioni ad altri compiti richiede test empirici sui propri dati. Data la natura flash‑lite del modello, ci si aspetta che sia inferiore ai modelli a grandezza naturale nella maggior parte dei benchmark standardizzati. Tuttavia, la sua efficienza e il basso costo spesso compensano questi deficit in ambienti di produzione. Se hai bisogno di prestazioni verificate su un benchmark specifico (es. generazione di codice o comprensione multilingue), dovresti eseguire la tua valutazione. OrcaRouter non ospita risultati di benchmark separati; i numeri citati qui provengono direttamente dal fornitore.
I dettagli sulla latenza non sono specificati nei dati forniti. Come regola generale, i modelli flash‑lite sono progettati per una bassa latenza rispetto ai loro fratelli più grandi, ma il tempo di risposta effettivo dipende da molti fattori: lunghezza dell'input, lunghezza dell'output, carico di richieste concorrenti e hardware sottostante. Con una finestra di contesto di 1M, l'elaborazione di prompt molto lunghi può aumentare notevolmente la latenza a causa dello scaling quadratico dell'attenzione. Per input brevi (ad esempio, poche centinaia di token), ci si possono aspettare risposte inferiori a un secondo. Per input vicini al limite di 1M token, la latenza potrebbe raggiungere decine di secondi. OrcaRouter non garantisce specifici SLA di latenza per questo modello. Se la bassa latenza è critica, considera l'utilizzo di un contesto più piccolo (ad esempio, tramite troncamento) o un endpoint dedicato. Puoi monitorare i tempi di risposta attraverso il dashboard di OrcaRouter.
Gemini 3.5 Flash-Lite non è progettato per garantire un'accuratezza all'avanguardia. I suoi punti di forza sono velocità, costo e contesto esteso. Le limitazioni includono prestazioni inferiori nei benchmark di ragionamento complesso, una ridotta capacità di richiamo fattuale rispetto a modelli più grandi e una tendenza ad "allucinare" su input ambigui. Il modello potrebbe avere difficoltà con attività che richiedono competenze di dominio approfondite (ad esempio, ragionamento legale, diagnosi medica) o lavori creativi ricchi di sfumature. La sua capacità di utilizzo degli strumenti, sebbene funzionale, potrebbe non essere affidabile quanto quella di un modello agentico dedicato. Inoltre, poiché viene fornito un solo punteggio di benchmark (CharXiv Reasoning 76.5 con strumenti), non è possibile presupporre buone prestazioni in altri domini senza test. Per applicazioni critiche, esegui sempre benchmark sui tuoi dati e valuta l'utilizzo di un fallback a un modello più capace quando la confidenza è bassa.
Il prezzo è di $0.30 per 1 milione di token in input e $2.50 per 1 milione di token in output. Queste tariffe sono le tariffe del provider fatturate senza alcun ricarico da OrcaRouter. I token in input includono tutti i token nel prompt (testo, token di immagini, fotogrammi video, campioni audio, contenuti di file) indipendentemente dalla modalità. I token in output sono i token di testo generati. Per una tipica query a contesto lungo che consuma 100.000 token in input e 1.000 token in output, il costo sarebbe approssimativamente ($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325 per richiesta. Su larga scala, questo modello può elaborare milioni di query per poche centinaia di dollari. Confrontalo con modelli più grandi che spesso costano 10‑50x in più per token. Il basso prezzo di output è particolarmente vantaggioso per applicazioni che generano risposte lunghe (ad esempio, riassunti di documenti completi).
Le informazioni fornite non specificano alcun meccanismo di caching o prezzi scontati per token memorizzati nella cache. Pertanto, si deve presumere che ogni token inviato al modello venga fatturato alla tariffa di input standard di $0,30 per milione di token, indipendentemente dalla ripetizione. Alcuni provider offrono il caching automatico dei prompt, in cui i prefissi ripetuti vengono fatturati a una tariffa inferiore (ad esempio, con il 50% di sconto). Per questo modello, non è stato annunciato alcun sconto di caching. Se invii frequentemente lo stesso contesto (ad esempio, un prompt di sistema di grandi dimensioni), potresti voler verificare se OrcaRouter o Google implementano il caching trasparente. In assenza di informazioni esplicite, è più sicuro preventivare il costo pieno per token per tutti gli input. Ottimizzare tagliando i contenuti riutilizzati può ridurre la fattura effettiva.
Margine zero significa che OrcaRouter addebita esattamente la tariffa del fornitore senza aggiungere alcun margine extra. Per Gemini 3.5 Flash-Lite, il prezzo di input è $0.30/1M token e il prezzo di output è $2.50/1M token – questo è ciò che Google addebita, e OrcaRouter lo trasmette senza aumento. Non paghi alcuna commissione aggiuntiva per token per la piattaforma. Questo è insolito tra i gateway API, che solitamente aggiungono il 10‑20% o più. L'assenza di margine rende questo modello ancora più conveniente se accessibile tramite OrcaRouter. Si pagano comunque la larghezza di banda e l'infrastruttura API, ma questi costi sono inclusi nella tariffa del fornitore; OrcaRouter non li dettaglia separatamente. Questo modello di prezzo è trasparente: il costo mostrato nel tuo dashboard di utilizzo è il costo finale.
Lo invochi utilizzando l'API compatibile con OpenAI di OrcaRouter all'URL di base https://api.orcarouter.ai/v1. Imposta il parametro model su "google/gemini-3.5-flash-lite". Funzionano sia le chat completions (POST /v1/chat/completions) sia gli embeddings (se supportati). Per input multimodali, struttura i messaggi con un array roles e oggetti content che possono includere campi text, image_url o file_url. Esempio di richiesta cURL: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' Devi utilizzare una chiave API di OrcaRouter, non una chiave API di Google.
Il modello supporta i parametri standard compatibili con OpenAI: model, messages, max_tokens (fino al limite di 65.536 del modello), temperature, top_p, stop, frequency_penalty, presence_penalty e tools (per il function calling). Parametri aggiuntivi specifici di Google (come safety_settings) potrebbero non essere esposti direttamente; se necessari, consulta la documentazione di OrcaRouter per eventuali equivalenti. Il modello rispetterà il limite di max_tokens. Per input multimodali, il campo type in content supporta: text, image_url, video_url (se esposto da OrcaRouter), audio_url e file_url. Il tipo file può accettare PDF, CSV, ecc. Nota che file multimediali di grandi dimensioni potrebbero dover essere pre‑codificati come data URI o ospitati pubblicamente. OrcaRouter potrebbe anche richiedere che il file non superi una certa dimensione. Consulta sempre la documentazione API più recente per il supporto esatto dei parametri.
Per migrare da un altro fornitore di API (ad esempio, Google AI Studio, Vertex AI o altri gateway) a OrcaRouter, sostituisci l'URL di base con https://api.orcarouter.ai/v1 e imposta l'ID del modello su "google/gemini-3.5-flash-lite". Se il tuo codice esistente utilizza il client Python di OpenAI, passa base_url e api_key. Esempio: ``` from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) ``` Potrebbe essere necessario adattare la formattazione dei messaggi multimodali se il tuo precedente fornitore utilizzava uno schema diverso (ad esempio, Anthropic). OrcaRouter prevede il formato OpenAI. Gli array di contenuto utente possono includere più parti. Anche le definizioni degli strumenti sono in stile OpenAI. Non è previsto alcun costo aggiuntivo per la migrazione; si paga solo per token come descritto.
Non vengono forniti dati di confronto diretti, ma possiamo ragionare qualitativamente. Gemini 2.0 Flash (se esiste) sarebbe probabilmente un modello flash di generazione precedente. Gemini 3.5 Flash‑Lite è una variante più recente e leggera con una finestra di contesto più ampia (1M contro probabili 128K) e un prezzo inferiore. Il costo per token per Gemini 3.5 Flash‑Lite è di $0.30/$2.50 per milione di token, che è molto basso. I modelli flash più vecchi potrebbero avere costi per token più alti e finestre di contesto più corte. Tuttavia, Gemini 2.0 Flash potrebbe avere una migliore accuratezza grezza se si tratta di un modello flash completo piuttosto che di una variante lite. Se il tuo compito richiede la massima qualità e puoi permetterti un costo più alto, il modello flash completo più vecchio potrebbe essere migliore. Se hai bisogno di un contesto ampio e di un costo basso, la 3.5 Flash‑Lite è la scelta logica.
GPT-4o mini di OpenAI è un modello multimodale a basso costo simile. Ha una finestra di contesto di 128K token (significativamente più piccola di 1M) e ha un prezzo di $0.15 per milione di token di input e $0.60 per milione di token di output (a partire dall'inizio del 2025; i prezzi potrebbero essere cambiati). Gemini 3.5 Flash‑Lite offre una finestra di contesto 8 volte più grande con un prezzo di input 2 volte superiore e un prezzo di output 4 volte superiore. Quindi Gemini è più costoso per token ma offre una capacità di contesto molto maggiore. Per attività in cui è necessaria l'intera finestra di contesto di 1M (ad esempio, l'elaborazione di interi libri), Gemini Flash‑Lite è più conveniente rispetto al tentativo di suddividere l'input in più chiamate GPT‑4o mini. Se il contesto è breve, GPT‑4o mini è più economico e potrebbe avere prestazioni migliori nei benchmark. Nessun punteggio di benchmark è direttamente confrontabile senza dati.
Non vengono forniti confronti di benchmark. Llama 3.2 90B (supponendo che questo modello esista) è un modello open‑weights di grandi dimensioni con una finestra di contesto più piccola (tipicamente 128K token) e un costo per token più elevato quando eseguito tramite API. Gemini 3.5 Flash‑Lite è un modello proprietario con una finestra di contesto molto più ampia e un prezzo molto basso – uno dei modelli multimodali più economici per token disponibili. Llama 3.2 90B potrebbe ottenere una maggiore accuratezza su molti benchmark NLP grazie alle sue dimensioni, ma non è multimodale e ha un limite di contesto più restrittivo. Se il tuo compito è solo testuale e hai bisogno della massima accuratezza, Llama 90B (se accessibile tramite OrcaRouter) potrebbe essere migliore. Per scenari multimodali, di contesto lungo o di alta produttività, Gemini Flash‑Lite ha chiari vantaggi. La scelta dipende dai requisiti specifici della tua applicazione.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Input / 1M token | $0.300 |
| Output / 1M token | $2.50 |
| Lettura cache / 1M | $0.030 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/google/gemini-3.5-flash-liteApri @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite