Gemini 3.5 Flash-Lite

google/gemini-3.5-flash-lite
NouveauEn vedette
VisionAudioOutilsJSONRaisonnement
par Google · 2026-07-21

Gemini 3.5 Flash-Lite est le modèle Gemini le plus rentable de Google, conçu spécifiquement pour les charges de travail à très haut volume et sensibles à la latence, où le coût par appel domine. Malgré son prix, il est nativement multimodal — acceptant du texte, des images, des vidéos, de l'audio et des fichiers avec sortie textuelle — et conserve la même fenêtre de contexte de 1M tokens et jusqu'à 64K tokens de sortie que le niveau Flash supérieur, de sorte que les longs documents et les entrées multimédia restent à portée. À environ un cinquième du prix de 3.6 Flash, c'est l'outil idéal pour la classification, l'extraction, le routage, le résumé, les agents légers, la génération de données synthétiques et tout pipeline exécuté des millions de fois. Il prend toujours en charge l'effort de raisonnement configurable, l'appel d'outils natif et les sorties structurées, et dépasse son poids sur les benchmarks agentiques et à long contexte pour un modèle léger — par exemple 74,0 % sur OSWorld-Verified et 72,2 % sur la recherche multi-aiguille 128k, confortablement en avance sur le précédent 3.1 Flash-Lite. Il parle à la fois le format de complétion de chat OpenAI et l'API generateContent native de Gemini, vous pouvez donc le mélanger avec des modèles plus lourds derrière une intégration unique — en routant le trafic facile et à volume élevé vers Flash-Lite et en escaladant les tâches difficiles vers 3.6 Flash ou un modèle Pro.

ctx1.05M tokens
Sortie max65.5K
Entréetext + image + video + file + audio
Sortietext
p50 TTFT1.30 s
ENTRÉE$0.30/ 1M tokens
SORTIE$2.50/ 1M tokens
p50 TTFT1.30 s7 j
TTFT p9510.00 s7 j
TRAFIC5.9Mtokens / 7 j

Google Gemini 3.5 Flash-Lite est un modèle de langage multimodal développé par Google, proposé via l'API compatible OpenAI d'OrcaRouter. Il accepte les entrées de texte, d'image, de vidéo, de fichier…

Qu'est-ce que Google Gemini 3.5 Flash-Lite ?

À qui ce modèle est-il destiné ?

Quelles modalités le modèle prend-il en charge ?

Quelle est la taille de la fenêtre de contexte et de la sortie maximale ?

Exemples de code

Appelez depuis n'importe quel SDK

Compatible OpenAI — gardez votre SDK actuel

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Paramètres pris en charge

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Tarifs

Entrée / 1M tokens$0.300
Sortie / 1M tokens$2.50
Lecture cache / 1M$0.030
DeviseUSD

Calculateur de coût

Tokens / mois10MM
Part d'entrée70%%
Estimé / mois $9.60 · Avec cache de prompt $8.66

Estimation basée sur le tarif public

Estimateur de tokens et de coût

Tokens d'entrée: 17Coût par requête: $0.001255

Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.

Performances

p50 TTFT
1.30 s
Vitesse de sortie
829 tok/s
TTFT p95
10.00 s
Taux d'erreur
5.0%

Benchmarks publics

49.3
AA Coding
Meilleur que 60 % des modèles comparés
n°49 sur 122
36.5
AA Intelligence
Meilleur que 54 % des modèles comparés
n°57 sur 124
CharXiv Reasoning (no tools)
74.5
CharXiv Reasoning (with tools)
76.5
GDM-MRCR v2 8-needle (128k avg)
72.2
GDM-MRCR v2 8-needle (1M pointwise)
21.3
GPQA Diamond
83.8
Humanity's Last Exam
17.5
Long-Context Recall
62.0
MLE-Bench
39.2
OSWorld-Verified
74.0
SciCode
40.9
SWE-Bench Pro (Public)
54.2
tau_banking
16.5
Terminal-bench 2.1 (Terminus-2)
54.0
terminalbench_v2_1
53.6
Source: artificialanalysis.ai, deepmind.google

Comparatif

Gemini 3.5 Flash-LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Entrée $/M$0.30$2.00$4.00$0.50
Sortie $/M$2.50$12.00$18.00$3.00
Contexte1.0M1.0M1.0M1.0M
Qualité6/1010/1010/109/10
Comparer côte à côteComparer côte à côteComparer côte à côteComparer côte à côte

FAQ

Quel est le prix par jeton pour Gemini 3.5 Flash-Lite sur OrcaRouter ?
Le prix est de $0,30 par million de jetons d'entrée et de $2,50 par million de jetons de sortie. Ce sont les tarifs du fournisseur avec une marge nulle. Les jetons d'entrée incluent toutes les modalités (texte, image, vidéo, audio, fichier). Les jetons de sortie sont du texte généré.
Quelle est la taille de la fenêtre de contexte ?
La fenêtre de contexte est de 1,048,576 tokens (environ 1 million). La longueur maximale de sortie est de 65,536 tokens. Cela permet de traiter de très longs documents, vidéos ou enregistrements audio en une seule requête API.
Quelles sont les principales forces de ce modèle ?
Ses principaux atouts sont : un coût très faible par jeton, la prise en charge de cinq modalités d'entrée (texte, image, vidéo, audio, fichier), une fenêtre de contexte massive de 1M, et la capacité d'utilisation d'outils (score CharXiv Reasoning 76,5 avec outils). Il est conçu pour les pipelines de production à haut débit et sensibles aux coûts.
Comment se compare-t-il aux modèles plus grands comme Gemini 3.5 Pro ?
Aucune comparaison directe de benchmarks n'est fournie. En tant que variante flash‑lite, ce modèle privilégie l'efficacité et le faible coût par rapport aux performances brutes. Des modèles plus grands comme Gemini 3.5 Pro atteindraient probablement une meilleure précision sur des tâches de raisonnement complexes, mais coûtent beaucoup plus par token. Utilisez ce modèle lorsque le coût et le débit sont critiques.
Le modèle met-il en cache les prompts pour réduire les coûts ?
Les informations fournies ne mentionnent aucun mécanisme de mise en cache ni de tarif réduit pour les tokens mis en cache. Vous devez supposer que tous les tokens sont facturés au taux d'entrée standard. Si la mise en cache est importante, vérifiez auprès d'OrcaRouter ou de Google pour tout rabais disponible.
Comment puis‑je accéder à ce modèle via une API compatible OpenAI ?
Utilisez l'API d'OrcaRouter à l'URL de base https://api.orcarouter.ai/v1. Définissez le paramètre model sur "google/gemini-3.5-flash-lite". L'API est entièrement compatible avec le format de complétions de chat d'OpenAI, y compris le contenu multimodal et les définitions d'outils.
À quelles mesures de traitement des données et de confidentialité puis-je m'attendre ?
Le traitement des données est régi par les politiques de Google (le fournisseur) et les conditions d'OrcaRouter. Le modèle traite vos entrées, et le résultat vous est renvoyé. Aucune certification de confidentialité spécifique n'est fournie pour ce modèle. Pour les données sensibles, consultez l'accord de traitement des données du fournisseur.
Puis-je utiliser ce modèle pour des applications en temps réel ?
Les détails de latence ne sont pas spécifiés. Le modèle peut renvoyer des réponses en quelques secondes pour des entrées courtes, mais le traitement de très longues invites (près d'un million de jetons) peut prendre des dizaines de secondes. Il est adapté aux applications quasi temps réel avec des tailles d'entrée modérées. Pour des exigences strictes en temps réel, testez avec la longueur d'entrée prévue.
Quel est le score du benchmark CharXiv Reasoning ?
Le modèle a obtenu un score de 76,5 sur CharXiv Reasoning avec outils. Ce benchmark teste la compréhension des graphiques et le raisonnement. Le score indique une performance modérée ; le modèle peut interpréter des graphiques et répondre à des questions, mais pas au niveau des modèles de raisonnement dédiés. Aucun autre score de benchmark n'est fourni.
Y a-t-il un coût minimum ou un engagement pour utiliser OrcaRouter ?
OrcaRouter n'impose pas un minimum de dépenses mensuelles. Vous êtes facturé uniquement pour les tokens que vous utilisez aux tarifs du fournisseur sans marge. Il n'y a pas de frais initiaux ni de contrat à long terme. Inscrivez-vous simplement pour obtenir une clé API et commencez à faire des requêtes.

Intégrer ce badge

Google: Gemini 3.5 Flash-Lite$0.30/M in1298ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg" alt="Google: Gemini 3.5 Flash-Lite sur OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.5 Flash-Lite](https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite)

Fiche du modèle en données

GET /api/public/models/google/gemini-3.5-flash-liteOuvrir
Lisible par machine:/llms.txt/llms-full.txt