Gemini 3.6 Flash est le dernier modèle rapide et économique de Google dans la famille Gemini 3 — un modèle nativement multimodal qui lit le texte, les images, les vidéos, l'audio et les fichiers et répond en texte, avec une fenêtre de contexte de 1 million de tokens et jusqu'à 64 000 tokens de sortie. Il est conçu pour les équipes qui ont besoin d'une qualité proche de la frontière à la vitesse et au prix de la gamme Flash, et constitue un choix par défaut solide pour les agents de codage, la compréhension de documents et de médias, la génération augmentée par récupération, et l'automatisation à haut débit. Par rapport au précédent 3.5 Flash, il est nettement plus efficace en termes de tokens et moins verbeux — atteignant une qualité identique ou supérieure tout en émettant moins de tokens de sortie, ce qui réduit directement le coût et la latence lors des longues exécutions agentiques. Il prend en charge un effort de raisonnement configurable (permettant aux appelants d'ajuster la profondeur par rapport à la vitesse par requête), l'appel d'outils natif et les sorties structurées, et il tient bien la route dans les évaluations de contexte long et de codage agentique pour sa catégorie, notamment 91,8 % sur la récupération multi-aiguille moyenne de 128k et des scores compétitifs sur SWE-Bench Pro, Terminal-Bench et OSWorld. Gemini 3.6 Flash parle à la fois le format chat-completions d'OpenAI et l'API native generateContent de Gemini, ce qui en fait une mise à niveau directe pour les intégrations existantes compatibles Gemini et OpenAI. Utilisez-le comme cheval de bataille quotidien lorsque vous voulez la plupart de l'intelligence d'un modèle de pointe sans en payer le prix.
Google Gemini 3.6 Flash est un grand modèle multimodal développé par Google, proposé via l'API d'OrcaRouter avec une tarification transparente (sans marge). Il accepte des entrées textuelles, images,…
Gemini 3.6 Flash excelle dans le traitement de longs contextes (jusqu'à 1 048 576 tokens) et la gestion d'entrées multimodales. Son score de référence de 91,8 sur GDM-MRCR v2 8-needle (moyenne de 128k) indique une forte récupération et compréhension à travers de nombreuses aiguilles dans une botte de foin, ce qui signifie qu'il peut localiser avec précision des informations spécifiques dans de grands documents. Le modèle prend également en charge les entrées audio et vidéo, permettant des cas d'utilisation comme la transcription de la parole à partir d'une vidéo, l'analyse de graphiques ou la réponse à des questions sur une séquence d'images. Le nom Flash implique une faible latence et une efficacité en termes de coûts, ce qui le rend adapté aux applications en temps réel ou à volume élevé. Étant donné qu'il est proposé via OrcaRouter au prix du fournisseur sans marge bénéficiaire, le coût total est transparent et prévisible.
Gemini 3.6 Flash est déjà la variante Flash optimisée en coût de Google. Cependant, si votre cas d'usage ne nécessite pas d'entrées multimodales (par exemple, des tâches textuelles uniquement), un modèle textuel plus petit avec une fenêtre de contexte plus courte pourrait être moins cher et plus rapide. Si votre tâche tient dans 8K–32K jetons, des modèles comme Gemini 1.5 Flash (si disponible via OrcaRouter) ou d'autres modèles légers pourraient suffire à des coûts par jeton inférieurs. De plus, si vous n'utilisez jamais d'audio, de vidéo ou de fichiers, vous pourriez payer pour des capacités dont vous n'avez pas besoin. La décision doit être basée sur vos modalités d'entrée exactes, la longueur de contexte requise et les exigences de qualité. OrcaRouter répertorie les tarifs pour chaque modèle, vous pouvez donc comparer les taux par jeton et sélectionner l'option la plus économique.
Les tâches qui bénéficient de Gemini 3.6 Flash incluent : (1) la récupération de contexte long et le question-réponse à partir de documents dépassant 100 000 tokens, (2) le raisonnement multimodal où les données visuelles, audio et textuelles doivent être combinées, (3) le résumé ou l’analyse vidéo, (4) le traitement de fichiers tels que l’analyse de PDF, de feuilles de calcul ou de présentations contenant des images et du texte, et (5) les applications sensibles aux coûts qui nécessitent encore une capacité multimodale. La limite de sortie de 65 536 tokens permet de générer de longs résumés, rapports ou codes. Le modèle est moins adapté aux tâches nécessitant une déduction logique stricte ou un raisonnement mathématique qui pourraient exiger une variante non Flash ; de tels cas d’usage peuvent bénéficier d’une précision plus élevée mais à un coût plus élevé. Évaluez vos tâches spécifiques par rapport à des alternatives pour confirmer la qualité.
Via l'API compatible OpenAI d'OrcaRouter, Gemini 3.6 Flash prend en charge les réponses en streaming (en utilisant le paramètre `stream`) et l'appel de fonctions (c'est-à-dire l'utilisation d'outils) lorsqu'il est correctement configuré. La disponibilité exacte de ces fonctionnalités dépend de l'API Google sous-jacente, mais OrcaRouter mappe le format de requête OpenAI vers les endpoints de Google. Pour le streaming, définissez `"stream": true` dans la requête. Pour l'appel de fonctions, définissez les outils dans le corps de la requête en utilisant le schéma OpenAI standard. Vous devriez tester ces fonctionnalités avec l'ID de modèle `google/gemini-3.6-flash` à l'URL de base d'OrcaRouter. Notez que toutes les versions du modèle Gemini ne supportent pas toutes les capacités ; référez-vous à la documentation de Google pour la version spécifique du modèle derrière l'alias.
Le score de référence fourni est de 91,8 sur le test GDM-MRCR v2 à 8 aiguilles avec une longueur de contexte moyenne de 128K tokens. Le GDM-MRCR (Google’s Multi-Context Retrieval) v2 mesure la capacité d’un modèle à retrouver et raisonner sur plusieurs éléments d’information (« aiguilles ») placés dans un long contexte. Un score de 91,8 indique que le modèle a réussi à trouver et à répondre correctement aux requêtes concernant 91,8 % des aiguilles en moyenne. C’est un résultat solide pour un modèle Flash, démontrant que Gemini 3.6 Flash peut extraire des faits de manière fiable à partir de documents très longs. Les benchmarks ne sont pas exhaustifs ; ils testent des scénarios spécifiques. Les performances réelles peuvent varier en fonction de la complexité de la tâche de recherche, du nombre de distracteurs et du format des informations.
Les données de latence ne sont pas fournies pour Gemini 3.6 Flash, mais les modèles Flash sont généralement optimisés pour un temps d'inférence plus faible par rapport aux variantes non Flash. Le temps de réponse réel dépend de facteurs tels que la longueur du contexte d'entrée, le nombre de tokens de sortie demandés, la complexité du codage multimodal (par exemple, le nombre d'images ou de trames vidéo) et la charge du serveur chez le fournisseur. Comme OrcaRouter agit comme une passerelle, la latence inclut à la fois l'aller-retour vers les serveurs de Google et toute surcharge due au routage de l'API d'OrcaRouter. Pour les applications nécessitant une très faible latence, il est recommandé de tester avec des prompts représentatifs et de mesurer le temps de bout en bout. En général, les modèles Flash sont conçus pour être plus rapides que les modèles Pro, et le streaming peut réduire la latence perçue.
Bien que Gemini 3.6 Flash fonctionne bien sur le benchmark de long contexte fourni, sa variante Flash peut avoir une précision inférieure sur les tâches de raisonnement, de mathématiques ou de génération de code par rapport à des modèles plus grands et plus coûteux. Les scores de comparaison exacts pour ces tâches ne sont pas fournis. De plus, la limite de sortie de 65,536 tokens, bien que généreuse, peut être insuffisante pour générer des documents très longs ou des bases de code entières. Le modèle peut également présenter des biais ou des erreurs factuelles communes aux grands modèles de langage. La qualité de compréhension multimodale peut se dégrader avec de nombreuses images ou de longues vidéos en raison de la compression des tokens. Enfin, parce que le modèle est accessible via OrcaRouter, toute interruption de service chez Google ou OrcaRouter pourrait affecter la disponibilité. Testez toujours le modèle sur vos données spécifiques pour valider la qualité.
Gemini 3.6 Flash offre une fenêtre de contexte de 1 048 576 tokens (environ 1 million de tokens) pour l’entrée totale, incluant tout contenu textuel, image, vidéo, fichier et audio. Le nombre maximal de tokens de sortie autorisé dans une seule réponse est de 65 536 tokens. Cela signifie que vous pouvez fournir des documents très longs, plusieurs images ou de longs transcriptions et recevoir une réponse substantielle. La grande fenêtre de contexte est un atout clé, permettant des tâches comme la synthèse de livres, l’examen de documents juridiques et des conversations multi-tours avec un historique étendu. Cependant, le contexte complet de 1M peut engendrer un temps de traitement et un coût en tokens non négligeables. Soyez conscient que l’utilisation de grands contextes consomme des tokens d’entrée au tarif de 1,50 $ par million de tokens, donc une entrée de 1M coûterait 1,50 $ par requête (plus le coût de sortie).
Le prix est de 1,50 $ pour 1 000 000 de jetons d’entrée et de 7,50 $ pour 1 000 000 de jetons de sortie. OrcaRouter facture ces tarifs exactement tels que fournis par Google, sans aucune majoration. Il n’y a pas de frais supplémentaires par requête ni de surtaxes de plateforme. Les jetons d’entrée incluent tous les jetons provenant des messages de l’utilisateur (historique système, utilisateur et assistant) ainsi que tout contenu multimodal encodé en jetons. Les jetons de sortie ne comptent que le texte généré. Le coût par requête dépend de la longueur de votre entrée et de votre sortie. Par exemple, une entrée de 100 000 jetons avec une sortie de 1 000 jetons coûterait 0,15 $ (entrée) + 0,0075 $ (sortie) = 0,1575 $. Pour une utilisation à volume élevé, cette tarification transparente permet une prédiction précise des coûts.
OrcaRouter ne propose actuellement aucune réduction de cache ou de volume spécifique à Gemini 3.6 Flash. La tarification est fixe par jeton au tarif du fournisseur. Certaines plateformes d'IA offrent des réductions basées sur le cache pour les contextes répétés, mais cette fonctionnalité n'est pas mentionnée pour ce modèle via OrcaRouter. Vous pouvez réduire les coûts en optimisant la longueur des invites, en limitant les contextes inutiles et en utilisant des jetons de sortie plus courts. Si vous avez besoin de tarifs par jeton plus bas, demandez-vous si un modèle plus petit (par exemple, Gemini 1.5 Flash) suffirait pour votre tâche. Google peut offrir différents niveaux de tarification pour la capacité réservée, mais cela n'est pas disponible via l'API pay-as-you-go d'OrcaRouter. Vérifiez toujours la documentation d'OrcaRouter pour toute mise à jour des options de tarification.
Étant donné qu'OrcaRouter transmet le prix du fournisseur sans marge, le coût par jeton pour Gemini 3.6 Flash via OrcaRouter devrait être identique à ce que Google facture directement. Cependant, en utilisant OrcaRouter, vous obtenez une API unifiée compatible OpenAI et pouvez bénéficier d'une facturation et d'une intégration simplifiées. Il n'y a pas de coût supplémentaire pour le service de passerelle. Si vous avez un contrat direct avec Google Cloud, vous pourriez recevoir des remises sur volume qui pourraient réduire le prix en dessous de 1,50 $/7,50 $ par million de jetons. OrcaRouter n'offre pas de telles remises, donc pour un volume très élevé (>10 milliards de jetons/mois), un accord direct pourrait être moins cher. Pour la plupart des utilisateurs, OrcaRouter offre une parité de prix avec la commodité d'une API standard.
Lorsque vous incluez des images, des vidéos, de l'audio ou des fichiers dans votre invite, le service convertit ces éléments en jetons qui comptent dans votre limite de jetons d'entrée et sont facturés au tarif d'entrée (1,50 $ pour 1 million de jetons). Le nombre exact de jetons consommés par image ou par seconde d'audio n'est pas précisé, mais à titre indicatif, chaque image peut consommer de plusieurs centaines à quelques milliers de jetons selon la résolution (résolution plus élevée = plus de jetons). Les vidéos sont généralement traitées comme une séquence d'images, chacune coûtant des jetons. Les fichiers comme les PDF sont extraits sous forme de texte et d'images, les images étant tokenisées en conséquence. Pour estimer les coûts, vous devez tester avec des exemples d'invites multimodales et surveiller l'utilisation des jetons via le champ `usage` de la réponse de l'API (si disponible). Minimiser le contenu visuel ou utiliser des versions de résolution inférieure peut réduire les dépenses.
Pour utiliser Gemini 3.6 Flash, envoyez des requêtes à l’endpoint compatible OpenAI d’OrcaRouter. Définissez l’URL de base sur `https://api.orcarouter.ai/v1`. Dans le corps de la requête, spécifiez le modèle comme `"google/gemini-3.6-flash"`. L’API prend en charge le même endpoint de complétions de chat qu’OpenAI : `POST /chat/completions`. Vous pouvez utiliser n’importe quel SDK OpenAI (Python, Node.js, etc.) en configurant `api_key` et `base_url`. Exemple en Python : `client = OpenAI(api_key="your_orcarouter_key", base_url="https://api.orcarouter.ai/v1")` puis `response = client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...])`. Le modèle accepte des paramètres standards comme `temperature`, `max_tokens`, `stream` et `tools`.
Les paramètres pris en charge incluent `messages` (tableau d'objets message avec rôle et contenu), `max_tokens` (jusqu'à 65536), `temperature`, `top_p`, les séquences `stop`, `stream` (booléen), `tools` (pour l'appel de fonctions), et `tool_choice`. Le contenu multimodal peut être inclus dans le champ `content` d'un message en utilisant un tableau de parties (par ex. text, image_url, audio_data). Le format exact suit la convention de l'API vision d'OpenAI. OrcaRouter traduit ces paramètres vers l'API Google sous-jacente. Notez que tous les paramètres spécifiques à l'OCR (comme `response_modalities`) peuvent ne pas être disponibles. Pour plus de détails sur les formats d'image et d'audio pris en charge, consultez la documentation d'OrcaRouter, mais généralement JPEG, PNG, GIF, MP3 et WAV sont acceptés. Définissez `max_tokens` sur la longueur de sortie souhaitée dans la limite de 65536.
Si votre application utilise actuellement l’API d’OpenAI (par exemple `gpt-4o`), la migration vers Gemini 3.6 Flash via OrcaRouter nécessite de changer deux choses : l’URL de base et le nom du modèle. Mettez à jour la configuration de votre client : définissez l’URL de base sur `https://api.orcarouter.ai/v1` et utilisez l’ID du modèle `"google/gemini-3.6-flash"`. Votre format de message existant, incluant les rôles système, utilisateur et assistant, devrait fonctionner tel quel. Pour la prise en charge multimodale, vous pouvez adapter votre code pour inclure des URL d’images ou d’audio en utilisant la structure des messages vision d’OpenAI. OrcaRouter gère la traduction de l’API, vous n’avez donc pas besoin de modifier la structure de votre requête au-delà du modèle et de l’URL de base. Testez d’abord avec un petit nombre de requêtes pour confirmer le comportement attendu et l’utilisation des tokens.
Pour utiliser OrcaRouter, vous avez besoin d'une clé API fournie par la plateforme. Incluez cette clé dans l'en-tête `Authorization` sous la forme `Bearer <votre_clé>`. Les données envoyées via OrcaRouter sont transmises aux serveurs d'inférence de Google ; OrcaRouter n'entraîne pas sur vos données et ne stocke pas les invites au-delà de ce qui est nécessaire au traitement des requêtes (par exemple, la journalisation pour la facturation). Les politiques de gestion des données de Google s'appliquent au fournisseur de modèle. OrcaRouter n'ajoute aucune conservation de données supplémentaire au-delà des journaux de requêtes standard. Pour les informations sensibles, consultez la politique de confidentialité d'OrcaRouter et les conditions d'utilisation des données Gemini de Google. Étant donné que l'API est compatible OpenAI, vous pouvez mettre en œuvre des mesures de sécurité standard comme le chiffrement en transit (HTTPS) et la rotation des clés.
Les deux modèles prennent en charge les entrées multimodales (texte, images, audio) et offrent de grandes fenêtres de contexte. GPT-4o dispose d'un contexte par défaut de 128K (extensible à 256K) tandis que Gemini 3.6 Flash offre 1,048,576 tokens (1M). Les tarifs diffèrent : GPT-4o coûte $2.50 par 1M d'entrée et $10 par 1M de sortie (au moment de la rédaction) contre $1.50/$7.50 pour Gemini 3.6 Flash. Les scores de référence ne sont pas directement comparables en raison de tests différents, mais le score de 91.8 de Gemini 3.6 Flash sur un benchmark de récupération spécifique suggère de bonnes performances. GPT-4o peut offrir un meilleur suivi des instructions et un meilleur raisonnement dans de nombreuses tâches, tandis que Gemini 3.6 Flash excelle dans la récupération en contexte long et l'efficacité des coûts. Le choix dépend de vos priorités : la longueur du contexte, le coût ou la précision brute pour votre cas d'utilisation spécifique.
Claude 3.5 Sonnet (contexte de 200K) a une fenêtre de contexte plus courte que les 1M tokens de Gemini 3.6 Flash. Tarification par token : Claude 3.5 Sonnet est à $3.00 par 1M d'entrée et $15.00 par 1M de sortie, soit plus élevé que les $1.50/$7.50 de Gemini. Claude peut avoir des points forts en matière de raisonnement nuancé et de conformité de sécurité, tandis que Gemini Flash se concentre sur la polyvalence multimodale et la récupération en contexte long. Le support de Gemini pour les entrées vidéo et audio lui donne un avantage pour les tâches impliquant ces modalités. Cependant, la sortie de Claude est généralement plus longue (jusqu'à 8192 tokens contre 65K pour Gemini). Pour les tâches nécessitant des sorties très longues (par exemple, la génération de rapports entiers), Gemini 3.6 Flash pourrait être plus approprié. Les comparaisons de référence sur des ensembles de données standard ne sont pas fournies, donc des tests empiriques sont recommandés.
Choisissez Gemini 3.6 Flash lorsque vos exigences principales sont : (a) une fenêtre de contexte supérieure à 128 000 tokens (jusqu'à 1 million), (b) le besoin de traiter des entrées audio, vidéo ou fichiers, et (c) un faible coût par token parmi les modèles multimodaux. Il est particulièrement performant pour la récupération de longs documents (comme en témoigne son score de 91,8 au benchmark). Si votre tâche est purement textuelle et tient dans 128 000 tokens, des modèles comme GPT-4o mini ou Claude 3 Haiku peuvent être moins chers. Si vous avez besoin de la plus haute précision de raisonnement et que votre budget le permet, un modèle Pro (par exemple Gemini 3.6 Pro, si disponible via OrcaRouter) pourrait être meilleur malgré un coût plus élevé. Utilisez les données de benchmark et les comparaisons de prix sur OrcaRouter pour éclairer votre sélection.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.6-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Entrée / 1M tokens | $1.50 |
| Sortie / 1M tokens | $7.50 |
| Lecture cache / 1M | $0.150 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/google/gemini-3.6-flashOuvrir @misc{orcarouter_gemini_3_6_flash,
title = {Gemini 3.6 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.6-flash}
}Google. (2026). Gemini 3.6 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.6-flash