
APIs LLM gratuites en 2026 : ce qui est réellement gratuit, et ce que vous payez à la place
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Recherchez une API LLM gratuite et vous obtenez une liste. Treize fournisseurs, quinze fournisseurs, un tableau de logos, une colonne de coches vertes. Ce que presque aucune de ces listes ne vous dit, c'est ce qui détermine si le niveau gratuit vous est utile : chaque API LLM gratuite vous facture quelque chose. Simplement pas en argent.
Il y a trois monnaies. Vous payez avec vos données, vous payez avec votre plafond, ou vous payez avec votre palier de modèle — et généralement les trois à la fois. Cet article passe en revue chacune à partir de la documentation des fournisseurs eux-mêmes, et non d’un tableau de seconde main, puis répond à la question que ces listes évitent : que se passe-t-il lorsque le palier gratuit est épuisé ?
Devise 1 : vos données
C'est celui qui devrait trancher la question pour la plupart des équipes, et c'est celui qui n'obtient qu'une note de bas de page au mieux.
La page de tarification de l'API Gemini de Google est inhabituellement directe à ce sujet. Pour chaque modèle avec un niveau gratuit, la page indique ce qu'il advient de votre contenu. Sur le niveau gratuit, la ligne indique « Contenu utilisé pour améliorer nos produits. » Sur le niveau payant du même modèle, la même ligne indique « Contenu non utilisé pour améliorer nos produits. » Même modèle, même point de terminaison, même code — la seule chose qui change, c'est de savoir si Google a le droit de conserver ce que vous avez envoyé.
Mistral fonctionne de la même manière avec une valeur par défaut différente. Sur La Plateforme, les données d'entrée et de sortie sont utilisées pour entraîner les modèles sauf si vous vous y opposez, et les utilisateurs du plan gratuit peuvent s'y opposer — c'est une option dans le menu Confidentialité de la console d'administration, et une fois que vous avez confirmé, Mistral cesse d'utiliser vos entrées et sorties pour l'entraînement. Les plans Team et Enterprise ne font pas du tout partie du pool d'entraînement.
Cette distinction importe plus qu'il n'y paraît. Beaucoup de comparatifs que vous trouverez affirment carrément que le niveau gratuit de Mistral exige que vous acceptiez l'entraînement. C'était le cas avec une ancienne politique, mais ce ne l'est plus aujourd'hui. Si vous évaluez en vous basant sur un article de blog vieux de six mois, vous vous tromperez dans les deux sens — en supposant qu'un fournisseur soit sûr alors qu'il ne l'est pas, ou en écartant un alors qu'une case à cocher aurait tout résolu.
La règle pratique : si le prompt contient quoi que ce soit que vous hésiteriez à coller dans un forum public, le niveau gratuit n'est pas gratuit. Les dossiers clients, le code interne, les textes de produits non publiés, tout ce qui est sous NDA — le coût d'un niveau gratuit dans ce cas est un problème de gouvernance des données que vous avez discrètement créé pour que quelqu'un d'autre le trouve.

Devise deux : votre plafond
Les niveaux gratuits sont mesurés sur plus d'axes que ce que les gens attendent, et vous atteignez celui qui s'épuise en premier. Groq publie les limites de son plan gratuit par modèle, et la forme est instructive :
Comparez ces deux lignes de modèles entre elles. Mêmes requêtes par minute, mais le modèle plus grand vous donne 1 000 requêtes par jour au lieu de 14 400 — soit quatorze fois moins pour passer à une capacité supérieure. Et les limites s'appliquent au niveau de l'organisation, pas par utilisateur, donc un deuxième développeur sur le même compte n'a pas sa propre allocation ; il pioche dans la vôtre.
Un plafond quotidien est celui qui tue silencieusement les projets. 1 000 requêtes par jour semble généreux jusqu'à ce que vous le rattachiez à quelque chose de réel : une fonctionnalité de chat avec 50 utilisateurs à 20 échanges chacun représente votre journée entière. Un travail par lots nocturne qui réessaie en cas d'échec peut épuiser le plafond avant le petit-déjeuner. Les limites de débit par minute, vous pouvez les contourner avec une file d'attente. Un plafond par jour, vous ne pouvez pas — vous ne pouvez qu'attendre minuit.
Le nombre à calculer avant de construire n'est pas « y a-t-il un niveau gratuit ? » mais « quel est mon budget de requêtes par jour et par utilisateur, et combien d'utilisateurs cela supporte-t-il ? » Si la réponse est moins de cent, vous construisez une démo, et vous devez le savoir dès le départ.
Devise trois : votre niveau de modèle
Le troisième coût est celui qui détermine ce que vous pouvez réellement construire : les modèles de pointe ne sont pas disponibles dans les offres gratuites, et l'écart se creuse.
Le niveau gratuit de Google couvre désormais la classe Flash et les modèles d'embedding — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite et Gemini 2.0 Flash. La gamme Pro n'en fait pas partie. C'est un rétrécissement délibéré : les modèles Pro ont été réservés à un accès API payant en 2026, et le niveau gratuit est limité à Flash et aux modèles inférieurs depuis lors.
Ce n'est pas une critique — les modèles de classe Flash en 2026 sont réellement performants, et pour la classification, l'extraction, le routage, la synthèse et la plupart des travaux de récupération augmentée, ils constituent le bon choix, que vous payiez ou non. Mais cela signifie qu'un niveau gratuit ne peut pas répondre à la question dont vous attendez le plus la réponse lors de l'évaluation, à savoir « Le bon modèle résout-il mon cas difficile ? » Vous évaluerez le modèle bon marché et en inférerez les performances du modèle supérieur, et cette inférence est souvent erronée dans les deux sens.
Celui qui est vraiment gratuit par token.
Il existe une catégorie que les synthèses mentionnent généralement sans vraiment l'approfondir : les modèles open-weight que vous exécutez vous-même. Téléchargez les poids, servez-les sur votre propre matériel, et le coût marginal par token est réellement nul. Pas de limite de débit, pas de quota quotidien, pas de clause d'entraînement, pas de palier — vous possédez l'ensemble.
Ce que vous avez fait, c'est déplacer le coût d'un poste de dépense vers une ligne de paie. Il faut que quelqu'un dimensionne le GPU, choisisse et règle la pile de service, la maintienne à jour, réponde à l'appel de 3 h du matin quand le débit s'effondre, et refasse tout cela quand un meilleur checkpoint arrive deux mois plus tard. Pour une équipe qui gère déjà l'infrastructure, cela peut être de loin l'option la moins chère à grande échelle. Pour une équipe de trois personnes qui met un produit sur le marché, une semaine d'ingénieur passée à la tuyauterie d'inférence coûte plus cher que plusieurs années de la facture API qu'elle remplace.
L'auto-hébergement est la bonne réponse lorsque vous avez du volume, une exigence de confidentialité qui n'admet aucune autre solution, ou une équipe de plateforme existante. C'est la mauvaise réponse lorsque ce dont vous aviez réellement besoin était de ne plus penser à l'inférence.

Le coût que personne ne prend en compte : les offres gratuites ne se composent pas
Voici le mode de défaillance qui coûte réellement du temps aux équipes, et il vient de ce que l'on suit trop bien les conseils du niveau gratuit.
Vous prenez la voie raisonnable. Le niveau gratuit de Google pour les tâches de classe Flash. Le niveau gratuit d'un autre fournisseur pour l'inférence rapide à poids ouverts. Un troisième pour la parole. Chacun est réellement gratuit, chacun était une bonne décision individuelle. Six semaines plus tard, vous tenez trois clés API, trois SDK, trois régimes de limite de débit, trois relations de facturation et trois comportements d'échec différents — et votre logique de nouvelle tentative, votre observabilité et votre comptabilité des coûts doivent toutes les comprendre.
Puis l'un d'eux change. Un fournisseur réduit son offre gratuite — comme ce fut le cas lorsque les modèles de classe Pro sont devenus exclusivement payants. Votre chemin de repli n'a jamais été testé car il ne s'est jamais déclenché. La migration que vous effectuez maintenant n'est pas un changement de configuration ; c'est une refactorisation de la couche que vous avez construite pour masquer les différences, et vous le faites sous contrainte de temps parce que le système est déjà en production.
Le niveau gratuit était gratuit. Le verrouillage que vous avez accumulé pour l'obtenir ne l'était pas. C'est la véritable raison de se soucier de la portabilité de votre couche d'accès : non pas l'idéologie de la neutralité des fournisseurs, mais le fait que les niveaux gratuits sont la partie la plus volatile de l'offre d'un fournisseur, et construire directement sur trois d'entre eux garantit que vous devrez migrer quelque chose dans l'année.
Ce qu'il faut réellement faire
Si vous faites un prototype et que les données ne sont pas sensibles — profitez des offres gratuites des fournisseurs, et profitez-en sans culpabilité. C'est exactement pour cela qu'elles existent. Écrivez l'intégration derrière votre propre interface dès le premier jour, pour que changer de fournisseur soit un changement de configuration et non une refonte.
Si les données sont sensibles — n'utilisez pas d'offre gratuite qui entraîne ses modèles sur vos données. Soit vous payez pour le niveau où le fournisseur s'engage contractuellement à ne pas le faire (la distinction entre l'offre gratuite et l'offre payante de Google est explicite à ce sujet), soit vous désactivez l'entraînement lorsque le fournisseur le permet sur le plan gratuit, soit vous auto-hébergez. Il n'y a pas de quatrième option, et le découvrir après le lancement coûte considérablement plus cher que la facture API que vous cherchiez à éviter.
Si vous évaluez des modèles les uns contre les autres — le niveau gratuit vous induira en erreur, car il ne contient pas les modèles que vous déploieriez. Évaluez sur le niveau que vous prévoyez d’utiliser en production, avec vos propres prompts. Le coût d’une véritable évaluation est de quelques dollars ; le coût d’un mauvais choix est le trimestre.
Si vous passez en production — la question n'est plus « qu'est-ce qui est gratuit » mais « quel est le coût par token, et que se passe-t-il si ce fournisseur a une panne ». Ce sont des questions différentes avec des réponses différentes, et un niveau gratuit ne répond à aucune des deux.
Où OrcaRouter s'intègre
OrcaRouter propose une sélection tournante de modèles d'IA gratuits appelables à 0 $ par jeton, en plus de crédits API gratuits issus de distributions ouvertes de bons, de programmes étudiants et de hackathons partenaires. Créer un compte et accepter une offre ouverte ne nécessite aucun moyen de paiement ; la sélection de modèles gratuits évolue au fur et à mesure que de nouveaux modèles open-weight et promotionnels arrivent, et les crédits promotionnels issus d'un bon ou d'un hackathon sont normalement utilisables sur l'ensemble du catalogue, et non limités aux modèles gratuits.
La partie qui compte pour le problème décrit ci-dessus est ce qui se passe ensuite. Tout passe par un seul endpoint compatible OpenAI, donc le modèle gratuit sur lequel vous prototypez et le modèle de pointe que vous déployez sont la même intégration — un changement de chaîne dans le champ model, pas une migration. Lorsqu'un niveau gratuit se réduit ou qu'un modèle devient obsolète, vous changez un ID de modèle. Lorsque vous devez comparer Gemini 3.6 Flash à DeepSeek V4 Flash sur vos propres prompts, vous le faites sans vous inscrire à quoi que ce soit de nouveau.
Voilà le pitch honnête pour un routeur dans un article sur les API gratuites : non pas que nous soyons moins chers que le gratuit, mais que les offres gratuites sont la chose la plus volatile sur laquelle bâtir, et que le coût de cette volatilité est précisément ce qui mérite d'être éliminé par conception.

La version courte
Les API LLM gratuites en 2026 sont réelles, utiles et méritent d'être utilisées — pour le prototypage, pour les charges de travail non sensibles, pour l'apprentissage, et pour la grande classe de tâches qu'un modèle de classe Flash gère parfaitement bien. Elles ne constituent pas une stratégie de production, et elles ne sont pas gratuites.
Avant de vous appuyer sur l'un d'eux, obtenez par écrit trois réponses issues de la documentation du fournisseur plutôt que d'un récapitulatif : ce niveau s'entraîne-t-il sur mes données, quel est mon plafond de requêtes par jour, et le modèle que je compte réellement déployer est-il même disponible ici ? Si vous pouvez répondre aux trois et que l'offre vous plaît toujours, acceptez-la. Si vous ne pouvez pas y répondre, vous ne l'avez pas chiffrée — vous avez simplement vu le nombre zéro et arrêté de lire.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
