Gemini 3.8 Flash est le modèle Flash le plus intelligent de Google, avec des gains significatifs par rapport à 3.7 Flash dans l'ingénierie logicielle, les tâches agentiques et le raisonnement multi-étapes.
Gemini 3.8 Flash est destiné aux équipes qui ont besoin d’un modèle Google avec une entrée multimodale étendue, une longue fenêtre de contexte, une grande limite de sortie et une API compatible…
Les capacités annoncées sont une prise en charge large des entrées, un contexte de 1 048 576 tokens, une limite de sortie de 65 536 tokens, et un score de 54.9 sur HLE-Verified. HLE-Verified est un benchmark de niveau expert, donc ce score suggère que le modèle peut traiter des questions qui exigent une mémorisation difficile, du raisonnement et du calcul. Comme il accepte le texte, les images, les vidéos, les fichiers et l'audio, un même flux de travail peut transmettre un document, un enregistrement et des instructions de suivi ensemble. Sur OrcaRouter, aucun SDK Google séparé n'est nécessaire : le modèle est exposé en tant que google/gemini-3.8-flash derrière l'API standard compatible OpenAI. C'est pratique pour les pipelines qui envoient actuellement des requêtes de complétion de chat. Une sortie maximale élevée permet au modèle de produire des rapports complets, des fichiers de code ou des sorties structurées en une seule génération. Cela signifie-t-il que le modèle prend en charge l'appel d'outils, l'exécution de code ou la sortie structurée ? La fiche du catalogue ne répertorie pas ces fonctionnalités. Toute capacité de ce type doit être testée avant que vous ne vous y fiiez.
Une fenêtre de contexte de 1 048 576 jetons permet des prompts contenant un grand document, un livre, un vaste ensemble de fichiers ou une longue transcription enregistrée. Cela réduit le besoin de découpage, de récupération ou de résumé multi-tours lorsque le matériel source peut tenir dans la limite du fournisseur. Cela permet aussi d’inclure le texte source, les instructions de la tâche et des exemples dans un même appel. Le budget de contexte pratique peut être plus petit si vous demandez une très longue réponse, car cette liste n’indique pas comment l’entrée et la sortie se partagent la fenêtre. Pour une fiabilité maximale, placez l’instruction là où le modèle est le plus susceptible d’y répondre et testez avec votre propre structure de prompt. Si votre requête totale dépasse la limite du fournisseur, OrcaRouter renverra une erreur en amont. Les appels à long contexte sont facturés par jeton : un large contexte n’est donc pas gratuit ; les jetons d’entrée sont facturés à 0,75 $ pour 1 M. Pour les tâches où la majeure partie de la fenêtre n’est pas pertinente, un prompt plus court peut être tout aussi performant à un coût inférieur.
Toutes les tâches n'ont pas besoin d'un contexte de 1 048 576 jetons, d'une entrée multimodale ou d'un score HLE-Verified de 54,9. Pour la classification de textes courts, la génération de titres, le routage simple ou l'extraction à faible complexité, un modèle moins coûteux peut souvent produire un résultat acceptable à moindre coût. Dans OrcaRouter, changer d'ID de modèle ne modifie pas la structure générale de l'API : les équipes peuvent donc prototyper sur un modèle moins onéreux et passer à google/gemini-3.8-flash uniquement lorsque la qualité ou la longueur l'exige. Si la charge de travail n'utilise que du texte et de petits prompts, le grand contexte et la prise en charge multimédia n'apportent aucune valeur ajoutée. Si la sortie souhaitée dépasse 65 536 jetons, ce modèle ne peut pas la produire en une seule génération. La structure tarifaire compte également : les jetons de sortie coûtent 3,75 $ par million, soit cinq fois le tarif des jetons d'entrée. Une charge de travail axée sur la génération sera dominée par le coût de sortie. Dans de tels cas, des générations plus courtes ou un modèle de sortie moins coûteux sont souvent plus économiques.
HLE-Verified est le sous-ensemble vérifié du benchmark Humanity's Last Exam, qui contient des questions difficiles de niveau expert dont l'exactitude a été vérifiée. Gemini 3.8 Flash atteint un score de 54,9 sur ce benchmark selon le catalogue OrcaRouter. Des scores plus élevés signifient que le modèle répond correctement à une plus grande proportion de ces éléments difficiles. Un score supérieur à 50 indique que le modèle traite correctement plus de la moitié des éléments HLE vérifiés dans cette évaluation. Il s'agit d'un point de référence pour les tâches difficiles de connaissances, de mathématiques et de raisonnement, et non d'un profil de qualité complet. Cette liste ne fournit aucun autre score de benchmark ; les performances en MMLU, en codage, en mathématiques ou en suivi d'instructions ne sont donc pas dérivées de ce nombre. La qualité en production varie selon la tâche et le style de prompt, et les chiffres de benchmark peuvent être affectés par la méthodologie d'évaluation. Les équipes doivent exécuter des exemples de validation privés via OrcaRouter et comparer ce modèle à d'autres candidats plutôt que de traiter un score agrégé comme le seul critère de décision.
La limite de sortie maximale de 65 536 jetons fixe une borne supérieure à la longueur d'une réponse générée. Elle devient importante lorsque la tâche exige une analyse approfondie, un document long ou une charge utile structurée de grande taille. Pour les tâches d'évaluation à réponse courte telles que HLE-Verified, la limite de sortie ne constitue généralement pas un goulot d'étranglement. Pour la génération de contenu, elle élimine le besoin de fractionner la sortie dans la plupart des cas courants. La limite de sortie interagit également avec la fenêtre de contexte de 1 048 576 jetons, car une invite qui remplit tout le contexte ainsi qu'une sortie de longueur maximale peuvent dépasser le budget total du fournisseur, à moins que celui-ci ne sépare les allocations d'entrée et de sortie. Cette fiche de catalogue ne précise pas cette règle de comptabilisation. En pratique, définissez max_tokens sur la valeur la plus grande dont vous avez besoin au lieu d'utiliser systématiquement 65 536. Les sorties longues sont facturées à 3,75 $ par million de jetons, donc une génération inutile augmente le coût. Si l'application a besoin de plus de 65 536 jetons dans une seule réponse, ce modèle ne suffit pas à lui seul.
Le catalogue OrcaRouter ne publie pas de chiffre de latence ni de débit pour Gemini 3.8 Flash. Le temps de réponse dépend de la taille du prompt, de la longueur de la sortie, des conditions réseau, de la concurrence et de la charge côté fournisseur. Le nom Flash dans la gamme de modèles de Google signale généralement un modèle plus réactif que les gammes de produits plus grandes ou plus profondes, mais aucun objectif de vitesse concret n'apparaît dans cette liste. Si vous traitez des requêtes utilisateur, mesurez le temps de bout en bout via OrcaRouter avec des charges réalistes. Une réponse courte arrivera plus vite qu'une génération longue, car le temps de génération total augmente généralement avec la longueur de la sortie. Le modèle de tarification n'ajoute pas de frais de latence par requête ; vous payez selon les jetons d'entrée et de sortie. Pour réduire le temps d'horloge, excluez tout contenu inutile du prompt, plafonnez max_tokens et évitez d'envoyer des médias volumineux lorsque ce n'est pas nécessaire. Aucune garantie de vitesse n'est fournie sur cette page de catalogue ; les applications sensibles aux performances doivent donc être testées en charge avant le lancement.
Cette fiche ne fournit aucun rapport de limitations distinct. Les faits documentés sont le nom du modèle, le fournisseur, la fenêtre de contexte, la sortie maximale, les modalités d'entrée, le prix, l'accès à l'API et un score de référence. La fiche ne revendique aucune prise en charge de l'appel d'outils, de l'exécution de code, de la génération d'images, de la sortie audio ou de la sortie structurée. Ces fonctionnalités doivent être vérifiées par une requête réelle avant de s'y fier. Un score HLE-Verified de 54,9 signifie que le modèle rate environ 45 % des éléments experts vérifiés de ce benchmark ; ce n'est donc pas un moteur de raisonnement parfait. La grande fenêtre de contexte ne garantit pas une attention égale à tout le contenu, et aucune donnée sur les hallucinations, les biais, les refus ou la précision par domaine n'est répertoriée. Les entrées multimédia sont prises en charge, mais le catalogue ne précise pas comment chaque type de média est tokenisé ni quelles limites s'appliquent à la taille des fichiers. Pour les sorties critiques pour la sécurité ou réglementées, mettez en place votre propre validation. Si une tâche sort du cadre des entrées ou sorties prises en charge, choisissez un modèle dont la fiche catalogue correspond.
Gemini 3.8 Flash est facturé au tarif du fournisseur : 0,75 $ pour 1 000 000 de jetons d'entrée et 3,75 $ pour 1 000 000 de jetons de sortie. OrcaRouter n'ajoute aucune marge à ce tarif. Les jetons d'entrée couvrent le texte et le contenu multimédia soumis au modèle, bien que ce catalogue ne fournisse aucune formule de calcul des jetons par image, par vidéo ou par audio. Les jetons de sortie couvrent le texte renvoyé par le modèle. Comme le tarif de sortie est cinq fois le tarif d'entrée, les réponses longues peuvent représenter l'essentiel de la facture, même lorsque le prompt est volumineux. Pour maîtriser les coûts, rédigez des prompts qui fournissent un contexte pertinent et demandez une réponse concise lorsque c'est possible. Le catalogue ne mentionne aucun frais de session, ni frais de plateforme, ni charge d'abonnement fixe. Les seuls frais précisés sont les montants par jeton. Les champs d'utilisation de la réponse renvoyés par l'API doivent être utilisés pour confirmer le nombre de jetons d'entrée et de sortie facturés pour chaque appel.
À 0,75 $ par million de jetons d’entrée, une invite complète de 1 048 576 jetons coûterait environ 0,79 $ en entrée avant la génération de la sortie, sur la base directe du prix indiqué et de la taille du contexte. Une sortie complète de 65 536 jetons coûterait environ 0,25 $ au tarif de 3,75 $ par million. Une requête utilisant toute la fenêtre d’entrée et toute la limite de sortie totaliserait environ 1,04 $ aux tarifs du fournisseur, sans aucune majoration. La plupart des requêtes réelles utilisent beaucoup moins ; ces valeurs doivent donc être considérées comme un calcul de borne supérieure, et non comme une facture type. Les jetons de sortie étant plus chers, la conception la plus économique consiste à envoyer uniquement le contenu dont le modèle a besoin et à demander un résultat ciblé. Les entrées vidéo et audio n’ont pas de prix détaillé distinct dans cet enregistrement, le total des invites riches en médias dépendra donc de la façon dont le fournisseur tokenise ces entrées. Suivez la consommation de chaque réponse pour estimer les dépenses globales avec précision.
OrcaRouter répertorie Gemini 3.8 Flash au tarif du fournisseur avec une marge nulle, les prix par jeton affichés doivent donc correspondre au tarif du fournisseur en amont, Google. Aucun frais supplémentaire OrcaRouter par jeton n'apparaît dans l'enregistrement du catalogue. La mise en cache est un problème distinct : aucun prix de succès du cache de prompt, aucune remise liée au cache ni paramètre de mise en cache automatique ne figurent dans les informations fournies sur le modèle. Vous ne devez pas supposer que des préfixes identiques répétés seront facturés à un tarif réduit. L'absence de prix de cache répertorié implique que le modèle de coût le plus sûr repose sur la facturation intégrale des jetons d'entrée. Si la mise en cache devient disponible, elle pourrait réduire le coût effectif des prompts répétés, mais ce comportement n'est pas garanti dans cette entrée. Pour maîtriser les coûts sans mise en cache, gardez les blocs de prompt partagés courts, utilisez un stockage externe pour les contenus statiques volumineux lorsque c'est possible et évitez de renvoyer des doublons sauf si la tâche l'exige.
Lorsque les modèles OrcaRouter sont facturés au tarif du fournisseur sans marge, la différence de prix entre les modèles provient de leurs tarifs en amont. Gemini 3.8 Flash coûte 0,75 $ pour 1M de jetons d'entrée et 3,75 $ pour 1M de jetons de sortie. Qu'un autre modèle soit moins cher dépend du tarif fournisseur de cet autre modèle, qui n'est pas affiché dans cette entrée. Comme il n'y a pas de frais par jeton OrcaRouter, la comparaison des prix est directe : vous comparez les colonnes de tarifs des fournisseurs. Le prix n'est pas le seul facteur. Un modèle moins cher qui produit des résultats inutilisables peut nécessiter des nouvelles tentatives, une relecture humaine ou des invites supplémentaires, ce qui finit par le rendre plus cher qu'un modèle ayant un taux de réussite plus élevé. Pour les tâches courtes et simples, les modèles à moindre coût conservent un avantage évident. Pour les tâches de raisonnement complexes ou les travaux multimodaux / à contexte long, évaluez la dépense totale par réponse réussie. Mesurez à la fois la qualité et le coût sur votre propre ensemble de données avant de sélectionner un ID de modèle par défaut.
OrcaRouter expose une API compatible OpenAI à l'adresse https://api.orcarouter.ai/v1. Définissez votre base_url sur cette adresse et le champ model sur google/gemini-3.8-flash. Un SDK OpenAI ou tout client prenant en charge les requêtes de complétion de chat OpenAI peut alors appeler le modèle. Par exemple, un client Python instancierait OpenAI avec base_url=https://api.orcarouter.ai/v1 et api_key défini sur votre clé OrcaRouter, puis appellerait chat.completions.create avec model=google/gemini-3.8-flash. La réponse doit inclure les champs choices et usage dans le style habituel. Cela signifie que le code existant n'a pas besoin d'un client spécifique à Google. Pour une entrée image, vidéo, fichier ou audio, la requête doit utiliser un format de contenu accepté par le modèle et transmis via OrcaRouter ; cette page du catalogue n'affiche pas le schéma multimédia, testez donc d'abord une petite requête. Utilisez l'ID du modèle exactement tel qu'il est écrit, y compris le préfixe google.
Au minimum, définissez le modèle sur google/gemini-3.8-flash et fournissez un tableau de messages avec le contenu utilisateur. Le point de terminaison est compatible OpenAI ; les paramètres standard tels que max_tokens, temperature, top_p, stop et stream peuvent donc être disponibles, selon la prise en charge du fournisseur. L'entrée du catalogue n'indique pas de valeurs par défaut ni de restrictions de plage pour les paramètres d'échantillonnage. La sortie maximale indiquée étant de 65 536 jetons, les requêtes qui définissent max_tokens au-delà de cette valeur doivent être traitées avec prudence ; le modèle en amont peut les rejeter ou les plafonner. Si votre tâche nécessite une réponse longue, définissez explicitement max_tokens sur la longueur attendue. Si une réponse courte suffit, gardez max_tokens à une valeur basse pour éviter de payer une sortie inutile. Le tableau de messages doit utiliser les mêmes rôles que ceux employés avec les autres modèles de style OpenAI. Pour les entrées multimédia, ajoutez le contenu multimédia au format utilisé par votre client API et vérifiez qu'OrcaRouter renvoie une complétion valide plutôt qu'une erreur d'encodage d'entrée.
Oui. Comme OrcaRouter utilise une API compatible OpenAI, la migration implique généralement trois changements : définir l'URL de base sur https://api.orcarouter.ai/v1, utiliser une clé API OrcaRouter, et remplacer le nom du modèle par google/gemini-3.8-flash. Le code qui lit choices[0].message.content et usage devrait continuer à fonctionner. Les flux de travail textuels devraient migrer proprement. Les flux de travail multimodaux sont moins certains : si votre code actuel envoie des images avec des parties de contenu spécifiques à OpenAI, ces champs peuvent ou non être acceptés tels quels par Gemini 3.8 Flash. La fiche du catalogue ne comprend pas de spécification de conversion multimédia. Avant de migrer un trafic à fort volume ou fortement médiatique, exécutez un petit ensemble de requêtes identiques sur les deux points de terminaison et comparez les réponses et les messages d'erreur. Conservez votre identifiant de modèle existant comme solution de repli pendant la migration, car le comportement d'un modèle n'est pas garanti d'être identique à un autre, même via la même forme d'API.
Cette page de catalogue ne comprend qu'un seul modèle Google, elle ne présente donc pas de tableau comparatif côte à côte avec d'autres variantes Gemini. Dans la dénomination de Google, Flash désigne généralement un modèle conçu pour un équilibre entre vitesse et coût, tandis que d'autres niveaux Gemini peuvent viser des capacités supérieures ou des tarifs différents. Ces affirmations ne sont pas étayées par les faits contenus dans cette entrée ; la sélection finale doit donc reposer sur les champs du catalogue propres à chaque modèle. Comparez la fenêtre de contexte, la sortie maximale, les modalités d'entrée, le prix et le score de référence. Gemini 3.8 Flash dispose d'un contexte de 1 048 576 jetons, d'une sortie maximale de 65 536, d'une entrée multimodale et d'un score HLE-Verified de 54,9. Un autre modèle Gemini pourrait avoir un contexte plus petit ou un prix différent, mais cette information n'est pas fournie ici. Exécutez les mêmes invites d'évaluation via OrcaRouter pour chaque candidat. C'est plus fiable que de supposer que deux modèles du même fournisseur partagent le même comportement.
Pour des tâches simples, un modèle moins cher par jeton peut battre Gemini 3.8 Flash sur le coût. Gemini 3.8 Flash facture 0,75 $ par million de jetons en entrée et 3,75 $ par million en sortie ; un autre modèle avec un tarif inférieur peut être attractif lorsque les sorties sont courtes et les tâches simples. Cependant, le prix seul ne détermine pas le coût total. Si un modèle moins cher redémarre ou produit des réponses médiocres sur des demandes complexes, les appels supplémentaires peuvent dépasser les économies réalisées. Les principaux atouts compensatoires de Gemini 3.8 Flash sont le score HLE-Verified de 54,9, l'entrée multimodale, le grand contexte et la longue limite de sortie. Si votre charge de travail n'utilise pas ces atouts, le modèle moins cher est le choix rationnel. Utilisez OrcaRouter pour exécuter les deux modèles sur un échantillon représentatif et comparer la précision, la longueur des sorties et la dépense totale par résultat réussi. Les limites de contexte comptent aussi, car un modèle avec une fenêtre plus petite peut nécessiter une récupération ou un découpage supplémentaire, ce qui ajoute un coût d'intégration.
Les modèles spécialisés en raisonnement sont généralement optimisés pour consacrer un calcul supplémentaire aux problèmes difficiles de logique et de mathématiques. Cette entrée de catalogue n’inclut pas un autre modèle à des fins de comparaison, donc l’orientation ci-dessous est qualitative. Gemini 3.8 Flash prend tout son sens lorsque votre charge de travail nécessite un contexte long, une sortie très longue, ou une entrée composée de texte plus image, vidéo, fichier et audio. Ces fonctionnalités peuvent être plus importantes qu’un point supplémentaire sur un benchmark difficile. Le profil Flash suggère également une option à plus faible latence qu’un modèle de raisonnement plus lourd, bien qu’aucune affirmation de vitesse ne soit indiquée ici. Si la tâche est une preuve difficile, une analyse de code ou une question de planification en plusieurs étapes, comparez google/gemini-3.8-flash à un modèle de raisonnement sur vos propres invites de style HLE. Si vous n’avez pas besoin d’une délibération approfondie, un modèle de classe Flash peut éviter un coût plus élevé et des réponses plus lentes. Il n’y a pas de vainqueur universel ; les facteurs décisifs sont la taille du contexte, la prise en charge des modalités, la latence requise, la longueur de sortie et la qualité mesurée sur la tâche.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-3.8-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Entrée / 1M tokens | $0.750 |
| Sortie / 1M tokens | $3.75 |
| Lecture cache / 1M | $0.075 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/google/gemini-3.8-flashOuvrir @misc{orcarouter_gemini_3_8_flash,
title = {Gemini 3.8 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.8-flash}
}Google. (2026). Gemini 3.8 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.8-flash