Gemini 3.6 Flash

google/gemini-3.6-flash
NouveauEn vedette
VisionAudioOutilsJSONRaisonnement
par Google · 2026-07-21

Gemini 3.6 Flash est le dernier modèle rapide et économique de Google dans la famille Gemini 3 — un modèle nativement multimodal qui lit le texte, les images, les vidéos, l'audio et les fichiers et répond en texte, avec une fenêtre de contexte de 1 million de tokens et jusqu'à 64 000 tokens de sortie. Il est conçu pour les équipes qui ont besoin d'une qualité proche de la frontière à la vitesse et au prix de la gamme Flash, et constitue un choix par défaut solide pour les agents de codage, la compréhension de documents et de médias, la génération augmentée par récupération, et l'automatisation à haut débit. Par rapport au précédent 3.5 Flash, il est nettement plus efficace en termes de tokens et moins verbeux — atteignant une qualité identique ou supérieure tout en émettant moins de tokens de sortie, ce qui réduit directement le coût et la latence lors des longues exécutions agentiques. Il prend en charge un effort de raisonnement configurable (permettant aux appelants d'ajuster la profondeur par rapport à la vitesse par requête), l'appel d'outils natif et les sorties structurées, et il tient bien la route dans les évaluations de contexte long et de codage agentique pour sa catégorie, notamment 91,8 % sur la récupération multi-aiguille moyenne de 128k et des scores compétitifs sur SWE-Bench Pro, Terminal-Bench et OSWorld. Gemini 3.6 Flash parle à la fois le format chat-completions d'OpenAI et l'API native generateContent de Gemini, ce qui en fait une mise à niveau directe pour les intégrations existantes compatibles Gemini et OpenAI. Utilisez-le comme cheval de bataille quotidien lorsque vous voulez la plupart de l'intelligence d'un modèle de pointe sans en payer le prix.

ctx1.05M tokens
Sortie max65.5K
Entréetext + image + video + file + audio
Sortietext
p50 TTFT1.67 s
ENTRÉE$1.50/ 1M tokens
SORTIE$7.50/ 1M tokens
p50 TTFT1.67 s7 j
TTFT p955.38 s7 j
TRAFIC7.6Ktokens / 7 j

Google Gemini 3.6 Flash est un grand modèle multimodal développé par Google, proposé via l'API d'OrcaRouter avec une tarification transparente (sans marge). Il accepte des entrées textuelles, images,…

Qu'est-ce que Google Gemini 3.6 Flash et à qui s'adresse-t-il ?

En quoi la variante Flash diffère-t-elle des autres modèles Gemini ?

Quelles modalités d'entrée Gemini 3.6 Flash prend-elle en charge ?

Exemples de code

Appelez depuis n'importe quel SDK

Compatible OpenAI — gardez votre SDK actuel

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.6-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Paramètres pris en charge

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Tarifs

Entrée / 1M tokens$1.50
Sortie / 1M tokens$7.50
Lecture cache / 1M$0.150
DeviseUSD

Calculateur de coût

Tokens / mois10MM
Part d'entrée70%%
Estimé / mois $33.00 · Avec cache de prompt $28.28

Estimation basée sur le tarif public

Estimateur de tokens et de coût

Tokens d'entrée: 17Coût par requête: $0.003775

Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.

Performances

p50 TTFT
1.67 s
Vitesse de sortie
712 tok/s
TTFT p95
5.38 s
Taux d'erreur
25.0%

Benchmarks publics

69.2
AA Coding
Meilleur que 87 % des modèles comparés
n°16 sur 122
50.1
AA Intelligence
Meilleur que 82 % des modèles comparés
n°22 sur 124
CharXiv Reasoning (no tools)
85.2
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
49.0
GDM-MRCR v2 8-needle (128k avg)
91.8
GDM-MRCR v2 8-needle (1M pointwise)
54.0
GPQA Diamond
92.8
Humanity's Last Exam
38.3
Long-Context Recall
69.7
MLE-Bench
63.9
OSWorld-Verified
83.0
SciCode
52.7
SWE-Bench Pro (Public)
58.7
tau_banking
24.5
Terminal-bench 2.1 (Terminus-2)
78.0
terminalbench_v2_1
77.5
Source: artificialanalysis.ai, deepmind.google

Comparatif

Gemini 3.6 FlashGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Entrée $/M$1.50$2.00$4.00$0.50
Sortie $/M$7.50$12.00$18.00$3.00
Contexte1.0M1.0M1.0M1.0M
Qualité8/1010/1010/109/10
Comparer côte à côteComparer côte à côteComparer côte à côteComparer côte à côte

FAQ

Quel est le coût d'utilisation de Gemini 3.6 Flash via OrcaRouter ?
Le prix est de 1,50 $ par million de tokens d'entrée et 7,50 $ par million de tokens de sortie. OrcaRouter facture au tarif du fournisseur sans aucune marge. Il n'y a pas de frais supplémentaires.
Quelle est la fenêtre de contexte de Gemini 3.6 Flash ?
La fenêtre de contexte est de 1 048 576 tokens (environ 1 million de tokens). La sortie maximale est de 65 536 tokens. Le contexte inclut toutes les modalités d’entrée (texte, image, vidéo, fichier, audio).
Quelles sont les principales forces de ce modèle ?
Gemini 3.6 Flash offre une très grande fenêtre de contexte, prend en charge cinq modalités d'entrée (texte, image, vidéo, fichier, audio) et obtient un score élevé de 91.8 au benchmark de récupération GDM-MRCR v2 8-needle (moyenne 128k). De plus, en tant que variante Flash, elle est économique.
Comment Gemini 3.6 Flash se compare-t-il à GPT-4o ou Claude 3.5 Sonnet ?
Il a une fenêtre de contexte plus grande (1M contre 128K/200K) et un tarif par jeton plus bas ($1.50/$7.50 contre ~$2.50/$10 ou $3/$15). Les scores de benchmark ne sont pas directement comparables, mais Gemini Flash est optimisé pour la récupération de longs contextes. GPT-4o et Claude peuvent offrir une meilleure précision de raisonnement dans certaines tâches.
Comment OrcaRouter gère-t-il mes données lorsque j'utilise ce modèle ?
OrcaRouter transmet vos requêtes aux serveurs d'inférence de Google. OrcaRouter n'utilise pas vos données pour l'entraînement et ne conserve pas les invites au-delà de ce qui est nécessaire pour le traitement et la facturation. Les politiques de confidentialité des données de Google s'appliquent. Vous trouverez des détails dans la politique de confidentialité d'OrcaRouter.
Puis-je appeler Gemini 3.6 Flash en utilisant le SDK Python d'OpenAI ?
Oui. Définissez l'URL de base sur https://api.orcarouter.ai/v1 et l'ID du modèle sur "google/gemini-3.6-flash". Utilisez la bibliothèque Python OpenAI avec votre clé API OrcaRouter. Exemple : client = OpenAI(api_key="your_key", base_url="https://api.orcarouter.ai/v1") puis client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...]).
Le modèle prend-il en charge le streaming et l'appel de fonctions ?
Via OrcaRouter, oui. Vous pouvez définir stream=true et inclure des outils dans la requête. L'API traduit le format OpenAI vers l'API de Google. Testez avec votre cas d'utilisation pour confirmer la pleine compatibilité.
Que signifie le score de benchmark 91.8 sur GDM-MRCR v2 8-needle ?
Il mesure la précision du modèle dans la récupération de plusieurs éléments d'information spécifiques à partir d'un contexte long (moyenne de 128K tokens). Un score de 91.8% signifie que le modèle a répondu correctement dans 91.8% des scénarios de récupération testés. Cela indique une forte performance dans les tâches de contexte long.

Intégrer ce badge

Google: Gemini 3.6 Flash$1.50/M in1666ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.6-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg" alt="Google: Gemini 3.6 Flash sur OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.6 Flash](https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg)](https://www.orcarouter.ai/models/google/gemini-3.6-flash)

Fiche du modèle en données

GET /api/public/models/google/gemini-3.6-flashOuvrir
Lisible par machine:/llms.txt/llms-full.txt