Gemini 3.5 Flash-Lite est le modèle Gemini le plus rentable de Google, conçu spécifiquement pour les charges de travail à très haut volume et sensibles à la latence, où le coût par appel domine. Malgré son prix, il est nativement multimodal — acceptant du texte, des images, des vidéos, de l'audio et des fichiers avec sortie textuelle — et conserve la même fenêtre de contexte de 1M tokens et jusqu'à 64K tokens de sortie que le niveau Flash supérieur, de sorte que les longs documents et les entrées multimédia restent à portée. À environ un cinquième du prix de 3.6 Flash, c'est l'outil idéal pour la classification, l'extraction, le routage, le résumé, les agents légers, la génération de données synthétiques et tout pipeline exécuté des millions de fois. Il prend toujours en charge l'effort de raisonnement configurable, l'appel d'outils natif et les sorties structurées, et dépasse son poids sur les benchmarks agentiques et à long contexte pour un modèle léger — par exemple 74,0 % sur OSWorld-Verified et 72,2 % sur la recherche multi-aiguille 128k, confortablement en avance sur le précédent 3.1 Flash-Lite. Il parle à la fois le format de complétion de chat OpenAI et l'API generateContent native de Gemini, vous pouvez donc le mélanger avec des modèles plus lourds derrière une intégration unique — en routant le trafic facile et à volume élevé vers Flash-Lite et en escaladant les tâches difficiles vers 3.6 Flash ou un modèle Pro.
Google Gemini 3.5 Flash-Lite est un modèle de langage multimodal développé par Google, proposé via l'API compatible OpenAI d'OrcaRouter. Il accepte les entrées de texte, d'image, de vidéo, de fichier…
Gemini 3.5 Flash-Lite est capable d’effectuer une large gamme de tâches grâce à son entrée multimodale et sa prise en charge de l’utilisation d’outils. Il gère des tâches purement textuelles comme le résumé, la réponse aux questions et la génération de code. Avec des images, il peut décrire des scènes, extraire du texte de documents ou interpréter des diagrammes. Les entrées vidéo permettent la reconnaissance d’activités, le légendage et le raisonnement temporel. Les entrées audio facilitent la transcription, l’identification de langue et l’analyse basée sur la parole. Le modèle prend également en charge l’appel d’outils, comme le montre son score CharXiv Reasoning de 76,5 (avec outils). Cela signifie qu’il peut être intégré dans des workflows agentiques où il appelle des API externes ou des bases de données. Cependant, il n’est pas conçu pour l’écriture créative, le raisonnement hautement abstrait ou les tâches nécessitant une expertise approfondie dans un domaine. Sa force réside dans la vitesse, le coût et l’étendue du support des modalités plutôt que dans les performances brutes.
Vous devriez choisir Gemini 3.5 Flash-Lite lorsque le coût et le débit sont les principales préoccupations et que la tâche s'inscrit dans ses capacités. Il excelle dans les pipelines à haut volume, comme l'indexation de milliers de documents, la transcription d'heures d'audio ou la classification en temps réel de flux d'images. Sa grande fenêtre de contexte (1M tokens) le rend idéal pour les tâches nécessitant une compréhension globale de longues entrées, comme l'analyse de dossiers judiciaires ou le refactoring de code. Des modèles plus volumineux (par exemple, Gemini 3.5 Pro) peuvent atteindre une meilleure précision sur des benchmarks complexes, mais avec des coûts par token nettement plus élevés et un débit réduit. Si votre application peut tolérer des compromis de qualité mineurs pour une réduction de coût de 10 à 100 fois, ce modèle est un bon choix. En revanche, pour les tâches nécessitant une précision factuelle, une génération créative ou un raisonnement de pointe, un modèle plus grand est recommandé.
Oui, le modèle accepte nativement les entrées vidéo et audio en plus du texte, des images et des fichiers. L’entrée vidéo peut être fournie sous forme d’une séquence d’images ou d’un fichier vidéo ; le modèle traite les images visuelles et toute piste audio associée. L’entrée audio fonctionne avec des formats courants comme WAV, MP3 ou FLAC. La grande fenêtre de contexte permet de traiter de longs enregistrements en une seule requête – par exemple, une transcription audio d’une heure avec un haut niveau de détail pourrait consommer environ 10 000 tokens. Ceci est utile pour la synthèse de réunions, l’analyse de podcasts ou le support client vocal. Notez que le modèle ne génère pas de sortie audio ou vidéo ; les réponses sont toujours textuelles. La qualité de la compréhension multimodale correspond au niveau flash‑lite du modèle : adéquate pour l’extraction et la classification, mais peut manquer des détails subtils par rapport à des modèles multimodaux plus grands.
Gemini 3.5 Flash-Lite prend en charge l'appel d'outils, comme l'indiquent ses performances de référence sur CharXiv Reasoning avec outils (score 76,5). Cela signifie que vous pouvez définir des fonctions ou des API que le modèle peut invoquer pendant la génération de réponses. Les cas d'utilisation typiques incluent les recherches dans des bases de données, les recherches Web ou les opérations arithmétiques. Le modèle choisit quand appeler un outil en fonction de l'instruction de l'utilisateur et du contexte. L'utilisation d'outils peut améliorer la précision factuelle et permettre un raisonnement complexe en plusieurs étapes. Cependant, comme le modèle est une variante flash-lite, sa fiabilité d'appel d'outils peut être inférieure à celle d'un modèle spécialisé plus grand. Si votre application dépend fortement d'une orchestration parfaite des outils, vous devrez peut-être ajouter des couches de validation ou une logique de repli. OrcaRouter transmet les définitions d'outils dans le même format que l'API d'OpenAI, ce qui rend l'intégration simple.
Le modèle a obtenu un score de 76,5 sur le benchmark CharXiv Reasoning lors d'une évaluation avec outils. CharXiv teste la capacité à effectuer un raisonnement sur des données visuelles basées sur des graphiques, ce qui exige que le modèle interprète une image de graphique et réponde à des questions à son sujet. La condition « with tools » signifie que le modèle pouvait appeler des fonctions externes (par exemple, une calculatrice) pour l'assister. Ce score indique une performance modérée – il est capable de raisonnement lié aux graphiques, mais pas au niveau des modèles spécialisés. Aucun autre score de benchmark n'a été fourni pour ce modèle. À titre de comparaison, des modèles plus grands tels que Gemini 3.5 Pro obtiendraient probablement un score plus élevé sur cette tâche. Cette valeur est utile comme point de référence : on peut s'attendre à une interprétation raisonnable des graphiques, mais il faut tester minutieusement si votre application exige une haute précision dans les tâches de raisonnement visuel.
Seul le score CharXiv Reasoning (avec outils) a été fourni : 76.5. Aucune donnée de benchmark supplémentaire – telle que les scores MMLU, HumanEval ou de récupération en contexte long – n'est disponible pour Gemini 3.5 Flash‑Lite dans les informations fournies. Cela signifie que généraliser ses performances à d'autres tâches nécessite des tests empiriques sur vos propres données. Compte tenu de la nature flash‑lite du modèle, il est attendu qu'il soit moins performant que les modèles de taille complète sur la plupart des benchmarks standard. Cependant, son efficacité et son faible coût compensent souvent ces lacunes dans les environnements de production. Si vous avez besoin de performances vérifiées sur un benchmark spécifique (par exemple, la génération de code ou la compréhension multilingue), vous devez effectuer votre propre évaluation. OrcaRouter n'héberge pas de résultats de benchmark séparés ; les chiffres cités ici proviennent directement du fournisseur.
Les détails de latence ne sont pas spécifiés dans les données fournies. En règle générale, les modèles flash‑lite sont conçus pour une faible latence par rapport à leurs homologues plus grands, mais le temps de réponse réel dépend de nombreux facteurs : longueur d'entrée, longueur de sortie, charge de requêtes concurrente et matériel sous-jacent. Avec une fenêtre de contexte de 1M, le traitement de longs prompts peut augmenter considérablement la latence en raison du scaling quadratique de l'attention. Pour des entrées courtes (par exemple, quelques centaines de tokens), vous pouvez vous attendre à des réponses inférieures à la seconde. Pour des entrées proches de la limite de 1M tokens, la latence peut atteindre des dizaines de secondes. OrcaRouter ne garantit pas de SLA de latence spécifique pour ce modèle. Si la faible latence est critique, envisagez d'utiliser un contexte plus petit (par exemple, via la troncature) ou un endpoint dédié. Vous pouvez surveiller les temps de réponse via le tableau de bord OrcaRouter.
Gemini 3.5 Flash-Lite n'est pas conçu pour une précision de pointe. Ses points forts sont la vitesse, le coût et le grand contexte. Les limitations incluent des performances réduites sur les benchmarks de raisonnement complexes, un rappel factuel moindre par rapport aux modèles plus grands, et une tendance à « halluciner » sur des entrées ambiguës. Le modèle peut rencontrer des difficultés avec des tâches nécessitant une expertise approfondie (par exemple, raisonnement juridique, diagnostic médical) ou un travail créatif nuancé. Sa capacité d'utilisation d'outils, bien que fonctionnelle, peut ne pas être aussi fiable que celle d'un modèle agentique dédié. De plus, comme un seul score de benchmark est fourni (CharXiv Reasoning 76.5 avec outils), vous ne pouvez pas supposer de bonnes performances dans d'autres domaines sans tests. Pour les applications critiques, effectuez toujours un benchmark sur vos propres données et envisagez d'utiliser un modèle plus performant comme solution de repli lorsque la confiance est faible.
Les prix sont de $0.30 par 1 million de jetons d’entrée et $2.50 par 1 million de jetons de sortie. Ces tarifs sont les tarifs des fournisseurs facturés sans aucune majoration par OrcaRouter. Les jetons d’entrée incluent tous les jetons de l’invite (texte, jetons d’image, trames vidéo, échantillons audio, contenus de fichiers) quel que soit le mode. Les jetons de sortie sont les jetons de texte générés. Pour une requête typique à contexte long consommant 100 000 jetons d’entrée et 1 000 jetons de sortie, le coût serait approximativement ($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325 par requête. À grande échelle, ce modèle peut traiter des millions de requêtes pour quelques centaines de dollars. Comparez cela aux modèles plus gros qui coûtent souvent 10‑50x plus par jeton. Le faible coût des jetons de sortie est particulièrement avantageux pour les applications qui génèrent des réponses longues (par exemple, des résumés de documents complets).
Les informations fournies ne spécifient aucun mécanisme de cache ni de tarification réduite pour les tokens en cache. Par conséquent, vous devez supposer que chaque token envoyé au modèle est facturé au tarif d'entrée standard de 0,30 $ par million de tokens, quelle que soit la répétition. Certains fournisseurs proposent une mise en cache automatique des prompts où les préfixes répétés sont facturés à un tarif réduit (par exemple, 50 % de réduction). Pour ce modèle, aucune remise de ce type n'a été annoncée. Si vous réenvoyez fréquemment le même contexte (par exemple, un prompt système volumineux), vous pouvez vérifier si OrcaRouter ou Google implémente un cache transparent. En l'absence d'informations explicites, il est plus sûr de budgétiser le coût total par token pour toutes les entrées. Optimiser en rognant le contenu réutilisé peut réduire votre facture effective.
Aucune majoration signifie qu'OrcaRouter facture exactement le tarif du fournisseur sans ajouter de marge supplémentaire. Pour Gemini 3.5 Flash-Lite, le prix d'entrée est $0.30/1M tokens et le prix de sortie est $2.50/1M tokens – c'est ce que Google facture, et OrcaRouter le transmet sans augmentation. Vous ne payez aucun frais de plateforme supplémentaire par token. C'est inhabituel parmi les passerelles API, qui ajoutent généralement 10‑20% ou plus. L'absence de majoration rend ce modèle encore plus rentable lorsqu'il est accessible via OrcaRouter. Vous payez toujours pour la bande passante et l'infrastructure API, mais ces coûts sont inclus dans le tarif du fournisseur ; OrcaRouter ne les détaille pas séparément. Ce modèle de tarification est transparent : le coût affiché dans votre tableau de bord d'utilisation est le coût final.
Vous l'appelez en utilisant l'API compatible OpenAI d'OrcaRouter à l'URL de base https://api.orcarouter.ai/v1. Définissez le paramètre model sur "google/gemini-3.5-flash-lite". Les deux fonctions de chat completions (POST /v1/chat/completions) et d'embeddings (si supporté) fonctionnent. Pour les entrées multimodales, vous structurez les messages avec un tableau de rôles (roles array) et des objets de contenu qui peuvent inclure les champs text, image_url, ou file_url. Exemple de requête cURL : curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' Vous devez utiliser une clé API OrcaRouter, et non une clé API Google.
Le modèle prend en charge les paramètres standard compatibles avec OpenAI : model, messages, max_tokens (jusqu'à la limite de 65,536 du modèle), temperature, top_p, stop, frequency_penalty, presence_penalty et tools (pour l'appel de fonctions). Les paramètres supplémentaires spécifiques à Google (comme safety_settings) peuvent ne pas être exposés directement ; si vous en avez besoin, consultez la documentation d'OrcaRouter pour les équivalents. Le modèle respectera la limite max_tokens. Pour l'entrée multimodale, le champ type dans content prend en charge : text, image_url, video_url (si OrcaRouter l'expose), audio_url et file_url. Le type file peut accepter les PDF, les CSV, etc. Notez que les fichiers multimédia volumineux peuvent devoir être pré-encodés en data URIs ou hébergés publiquement. OrcaRouter peut également exiger que le fichier soit en dessous d'une certaine taille. Consultez toujours la documentation la plus récente de l'API pour connaître la prise en charge exacte des paramètres.
Pour migrer depuis un autre fournisseur d'API (par exemple, Google AI Studio, Vertex AI ou d'autres passerelles) vers OrcaRouter, remplacez l'URL de base par https://api.orcarouter.ai/v1 et définissez l'ID du modèle sur "google/gemini-3.5-flash-lite". Si votre code existant utilise le client Python OpenAI, passez base_url et api_key. Exemple : from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="VOTRE_CLÉ_API_ORCAROUTER") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) Vous devrez peut-être ajuster le formatage des messages multimodaux si votre précédent fournisseur utilisait un schéma différent (par exemple, Anthropic). OrcaRouter attend le format OpenAI. Les tableaux de contenu utilisateur peuvent inclure plusieurs parties. Les définitions d'outils sont également de style OpenAI. Il n'y a pas de frais de migration supplémentaires ; vous payez uniquement par token comme décrit.
Aucune donnée de comparaison directe n'est fournie, mais nous pouvons raisonner qualitativement. Gemini 2.0 Flash (s'il existe) serait probablement un modèle flash de génération antérieure. Gemini 3.5 Flash‑Lite est un modèle allégé plus récent, avec une fenêtre de contexte plus grande (1M contre probablement 128K) et un tarif inférieur. Le coût par token pour Gemini 3.5 Flash‑Lite est de $0.30/$2.50 par million de tokens, ce qui est très bas. Les anciens modèles flash peuvent avoir des coûts par token plus élevés et des fenêtres de contexte plus courtes. Cependant, Gemini 2.0 Flash pourrait offrir une meilleure précision brute s'il s'agit d'un modèle flash complet plutôt que d'une variante allégée. Si votre tâche nécessite la plus haute qualité et que vous pouvez supporter un coût plus élevé, l'ancien modèle flash complet pourrait être meilleur. Si vous avez besoin d'un grand contexte et d'un faible coût, le 3.5 Flash‑Lite est le choix logique.
GPT-4o mini d'OpenAI est un modèle multimodal similaire à faible coût. Il dispose d'une fenêtre de contexte de 128K jetons (considérablement plus petite que 1M) et est proposé à 0,15 $ par million de jetons d'entrée et 0,60 $ par million de jetons de sortie (début 2025 ; les prix peuvent avoir changé). Gemini 3.5 Flash‑Lite offre une fenêtre de contexte 8 fois plus grande pour un prix d'entrée 2 fois supérieur et un prix de sortie 4 fois supérieur. Gemini est donc plus cher par jeton mais offre une capacité de contexte beaucoup plus grande. Pour les tâches nécessitant le contexte complet de 1M (par exemple, le traitement de livres entiers), Gemini Flash‑Lite est plus rentable que de tenter de diviser l'entrée entre plusieurs appels GPT‑4o mini. Si le contexte est court, GPT‑4o mini est moins cher et peut offrir de meilleures performances sur les benchmarks. Aucun des scores de benchmark n'est directement comparable sans données.
Aucune comparaison de benchmarks n'est fournie. Llama 3.2 90B (en supposant que ce modèle existe) est un grand modèle open‑weights avec une fenêtre de contexte plus petite (généralement 128 000 tokens) et un coût par token plus élevé lorsqu'il est utilisé via une API. Gemini 3.5 Flash‑Lite est un modèle propriétaire avec une fenêtre de contexte beaucoup plus grande et un prix très bas – l'un des modèles multimodaux les moins chers par token disponibles. Llama 3.2 90B pourrait atteindre une meilleure précision sur de nombreux benchmarks de TALN en raison de sa taille, mais il n'est pas multimodal et a une limite de contexte plus stricte. Si votre tâche est uniquement textuelle et que vous avez besoin de la meilleure précision, Llama 90B (s'il est accessible via OrcaRouter) pourrait être préférable. Pour les scénarios multimodaux, à contexte long ou à haut débit, Gemini Flash‑Lite présente des avantages évidents. Le choix dépend des exigences spécifiques de votre application.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Entrée / 1M tokens | $0.300 |
| Sortie / 1M tokens | $2.50 |
| Lecture cache / 1M | $0.030 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/google/gemini-3.5-flash-liteOuvrir @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite