Hero-titelkaart met de tekst 'Free LLM APIs in 2026' en de ondertitel 'Wat is er echt gratis — en waarmee betaal je in plaats daarvan', met drie kaarten onder de kop DE DRIE VALUTA'S: JOUW GEGEVENS (gratis tiers kunnen erop trainen), JOUW PLAFOND (verzoeken per dag raken op) en JOUW TIER (frontiermodellen zijn alleen betaald).
Guides & Insights

Gratis LLM-API's in 2026: Wat is écht gratis, en wat betaal je in plaats daarvan?

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zoek naar een gratis LLM API en je krijgt een lijst. Dertien providers, vijftien providers, een tabel met logo's, een kolom met groene vinkjes. Wat bijna geen van die lijsten je vertelt, is het deel dat bepaalt of de gratis laag voor jou enige nut heeft: elke gratis LLM API rekent je iets aan. Alleen niet in geld.

Er zijn drie valuta's. Je betaalt met je data, je betaalt met je plafond, of je betaalt met je modelniveau — en meestal alle drie tegelijk. Dit stuk behandelt elk daarvan aan de hand van de eigen documentatie van de aanbieders, niet een tabel uit tweede hand, en beantwoordt daarna de vraag die die lijsten overslaan: wat gebeurt er wanneer de gratis laag opraakt?

Valuta één: uw gegevens

Dit is degene die voor de meeste teams de vraag zou moeten beslissen, en het is degene die hooguit een voetnoot krijgt.

De prijspagina van de Gemini API van Google is daar ongebruikelijk direct over. Voor elk model met een gratis laag vermeldt de pagina wat er met je inhoud gebeurt. Op de gratis laag luidt de regel: "Inhoud die wordt gebruikt om onze producten te verbeteren." Op de betaalde laag van hetzelfde model luidt dezelfde regel: "Inhoud die niet wordt gebruikt om onze producten te verbeteren." Hetzelfde model, hetzelfde eindpunt, dezelfde code — het enige dat verandert is of Google wat je hebt verzonden mag houden.

Mistral werkt op dezelfde manier met een andere standaardinstelling. Op La Plateforme worden invoer- en uitvoergegevens gebruikt om modellen te trainen, tenzij je je afmeldt, en gebruikers van het gratis abonnement kunnen zich afmelden — het is een schakelaar in het Privacy-menu van de Admin Console, en zodra je dit bevestigt, stopt Mistral met het gebruiken van je invoer en uitvoer voor training. Team- en Enterprise-abonnementen zitten helemaal niet in de trainingspool.

Dat onderscheid is belangrijker dan het lijkt. Veel overzichten die je zult vinden stellen botweg dat Mistral's gratis laag vereist dat je training accepteert. Dat gold voor een eerder beleid en dat is nu niet meer het geval. Als je beoordeelt op basis van een blogpost van zes maanden geleden, zul je dit in beide richtingen fout hebben — aannemen dat een aanbieder veilig is terwijl dat niet zo is, of er één uitsluiten terwijl een checkbox het had opgelost.

De praktische regel: als de prompt iets bevat dat je niet in een openbaar forum zou plakken, is de gratis laag niet gratis. Klantgegevens, interne code, niet-uitgebrachte productteksten, alles onder een NDA — de kosten van een gratis laag daar zijn een data-governanceprobleem dat je stilletjes hebt gecreëerd voor iemand anders om te vinden.

Table titled 'What the free tier actually gives you' showing Groq's published free-plan limits — llama-3.1-8b-instant at 30 requests/min, 14,400 requests/day, 6,000 tokens/min, 500,000 tokens/day; llama-3.3-70b-versatile at 30 requests/min, 1,000 requests/day, 12,000 tokens/min, 100,000 tokens/day; whisper-large-v3 at 20 requests/min, 2,000 requests/day — alongside Google's free-tier Gemini model list and the pricing-page clause 'Content used to improve our products' on free versus 'not used' on paid.

Valuta twee: jouw plafond

Gratis abonnementen worden op meer assen gemeten dan mensen verwachten, en je raakt degene die het eerst op is. Groq publiceert de limieten van het gratis abonnement per model, en de vorm is leerzaam:

Vergelijk die twee modelrijen met elkaar. Hetzelfde aantal verzoeken per minuut, maar het grotere model geeft je 1.000 verzoeken per dag in plaats van 14.400 — een veertienvoudige verlaging voor een stap omhoog in capaciteit. En de limieten gelden op organisatieniveau, niet per gebruiker, dus een tweede ontwikkelaar op hetzelfde account krijgt geen eigen quotum; ze tasten het jouwe aan.

A daily cap is the one that quietly kills projects. {{1}}1,000 requests a day sounds generous until you attach it to anything real: a chat feature with 50 users at 20 turns each is your entire day.{{/1}} {{2}}A nightly batch job that retries on failure can burn the cap before breakfast.{{/2}} {{3}}Rate limits per minute you can engineer around with a queue.{{/3}} {{4}}A per-day ceiling you cannot — you can only wait for midnight.{{/4}}

Het getal dat je moet uitrekenen voordat je gaat bouwen is niet "is er een gratis tier" maar "wat is mijn budget voor verzoeken per dag per gebruiker, en hoeveel gebruikers kan dat aan?" Als het antwoord onder de honderd ligt, bouw je een demo, en dat moet je van tevoren weten.

Valuta drie: je modelniveau

De derde kostenpost is degene die bepaalt wat je daadwerkelijk kunt bouwen: frontiermodellen zijn niet beschikbaar in de gratis lagen, en de kloof wordt groter.

Googles gratis laag dekt nu de Flash-klasse en de embeddingmodellen — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite en Gemini 2.0 Flash. De Pro-lijn zit er niet bij. Dat is een bewuste versmalling: Pro-series modellen zijn in 2026 voor API-toegang naar betaald-only verplaatst, en de gratis laag is sindsdien Flash-en-lager.

Dit is geen klacht — Flash-klasse modellen zijn in 2026 echt sterk, en voor classificatie, extractie, routering, samenvatting en de meeste retrieval-augmented taken zijn ze de juiste keuze, of je nu betaalt of niet. Maar het betekent wel dat een gratis laag de vraag niet kan beantwoorden die je tijdens de evaluatie het liefst beantwoord wilt hebben, namelijk "lost het goede model mijn lastige geval op?" Je zult het goedkope model evalueren en naar boven toe afleiden, en die afleiding is vaak in beide richtingen fout.

De enige die echt gratis is per token

Er is een categorie die de overzichten meestal vermelden maar zelden doordenken: open-weight modellen die je zelf draait. Download de gewichten, serveer ze op je eigen hardware, en de marginale kosten per token zijn werkelijk nul. Geen rate limit, geen dagelijkse limiet, geen trainingsclausule, geen tier — het is volledig van jou.

Wat je hebt gedaan is de kosten verplaatsen van een budgetpost naar een loonkostenpost. Iemand moet de GPU dimensioneren, de serving-stack kiezen en afstemmen, deze gepatcht houden, de 3 uur 's nachts-melding afhandelen wanneer de doorvoer instort, en het allemaal opnieuw doen wanneer er twee maanden later een betere checkpoint verschijnt. Voor een team dat al infrastructuur draait, kan dat op volume met ruime marge de goedkoopste optie zijn. Voor een team van drie dat een product uitbrengt, kost een engineerweek besteed aan inference-plumbing meer dan enkele jaren van de API-rekening die het vervangt.

Self-hosting is het juiste antwoord wanneer je volume hebt, een privacyvereiste die geen andere oplossing toelaat, of een bestaand platformteam. Het is het verkeerde antwoord wanneer wat je eigenlijk nodig had, was om niet meer over inferentie na te denken.

Decision guide titled 'Which free option fits', mapping four situations to approaches: prototyping with non-sensitive data to taking the vendor free tiers; sensitive data to not using a free tier that trains on inputs; high volume to self-hosting open weights; shipping to production to asking cost per token and outage behaviour instead of what is free.

De kosten die niemand in de tabel opneemt: gratis lagen combineren niet

Hier is de faalmodus die teams daadwerkelijk tijd kost, en die komt voort uit het te goed opvolgen van het gratis-laag-advies.

Je kiest de verstandige weg. Google's gratis laag voor het Flash-klasse werk. Een andere provider's gratis laag voor snelle open-weight inferentie. Een derde voor spraak. Elk is werkelijk gratis, elk was op zich een goede beslissing. Zes weken later heb je drie API-sleutels, drie SDK's, drie rate-limit-regimes, drie factureringsrelaties en drie verschillende storingsgedragingen — en je retry-logica, je observability en je kostenadministratie moeten ze allemaal begrijpen.

Dan verandert er een van hen. Een provider beperkt zijn gratis niveau — zoals gebeurde toen Pro-klasse modellen alleen nog betaald werden. Je fallbackpad is nooit getest omdat het nooit werd geactiveerd. De migratie die je nu uitvoert is geen configuratiewijziging; het is een refactoring van de laag die je hebt gebouwd om de verschillen te verdoezelen, en je doet het onder tijdsdruk omdat het systeem al in productie is.

De gratis laag was gratis. De lock-in die je opliep om die te krijgen, was dat niet. Dit is de echte reden om je druk te maken over de vraag of je toegangslaag draagbaar is: niet ideologie over leveranciersneutraliteit, maar het feit dat gratis lagen het meest onvoorspelbare onderdeel zijn van het aanbod van elke provider, en rechtstreeks op drie daarvan bouwen garandeert dat je binnen het jaar iets zult migreren.

Wat je daadwerkelijk moet doen

Als je aan het prototypen bent en de data niet gevoelig is — neem dan de gratis tiers van de leveranciers, en neem ze zonder schuldgevoel. Ze bestaan juist hiervoor. Schrijf de integratie vanaf dag één achter één eigen interface, zodat het wisselen van provider een configuratiewijziging is en geen refactor.

Als de data gevoelig is — gebruik geen gratis laag die op jouw invoer traint. Betaal voor de laag waar de leverancier contractueel niet traint (de Google-lijn over gratis versus betaald is hier expliciet over), schakel training uit waar de aanbieder dit op het gratis abonnement toestaat, of host zelf. Er is geen vierde optie, en dit na de lancering ontdekken is aanzienlijk duurder dan de API-rekening die je wilde vermijden.

Als je modellen tegen elkaar evalueert — de gratis laag zal je misleiden, omdat die niet de modellen bevat die je in productie zou nemen. Evalueer op de laag die je in productie wilt gebruiken, met je eigen prompts. Een goede evaluatie kost een paar dollar; een verkeerde keuze kost je het kwartaal.

Als je naar productie gaat — is de vraag niet langer "wat is gratis" maar "wat zijn de kosten per token, en wat gebeurt er als deze provider uitvalt." Dat zijn verschillende vragen met verschillende antwoorden, en een gratis laag beantwoordt geen van beide.

Waar OrcaRouter past

OrcaRouter draait een wisselende reeks gratis AI-modellen die aanroepbaar zijn voor $0 per token, naast gratis API-tegoeden uit open voucher-acties, studentenprogramma's en partner-hackathons. Het aanmaken van een account en het claimen van een open aanbieding vereist geen betaalmethode; de reeks gratis modellen verandert naarmate er nieuwe open-weight- en promotiemodellen verschijnen, en promotietegoed van een voucher of hackathon is normaal gesproken besteedbaar in de hele catalogus in plaats van beperkt tot de gratis modellen.

Wat voor het hierboven beschreven probleem echt van belang is, is wat er daarna gebeurt. Alles loopt via één OpenAI-compatibel eindpunt, dus het gratis model waarmee je prototypet en het frontiermodel waarmee je in productie gaat, zijn dezelfde integratie — een stringwijziging in het modelveld, geen migratie. Wanneer een gratis laag wordt ingeperkt of een model wordt uitgefaseerd, wijzig je een model-ID. Wanneer je Gemini 3.6 Flash met DeepSeek V4 Flash op je eigen prompts wilt vergelijken, doe je dat zonder je ergens nieuw voor aan te melden.

Dat is de eerlijke pitch voor een router in een stuk over gratis API's: niet dat wij goedkoper zijn dan gratis, maar dat gratis tiers het meest onbestendige zijn waar je op kunt bouwen, en de kosten van die onbestendigheid zijn het waard om weg te ontwerpen.

Screenshot of the OrcaRouter offers page at www.orcarouter.ai/offers in English, headlined 'Free AI API credits & free AI models' with the subtitle about claiming credits from live voucher drops, student programs and partner hackathons then calling a rotating set of free AI models at $0, plus live counters for hackathons, credit drops and top deposit match.

De korte versie

Gratis LLM-API's in 2026 zijn echt, nuttig en de moeite waard — voor prototypen, voor niet-gevoelige workloads, voor leren, en voor de grote klasse van taken die een Flash-klasse model prima aankan. Ze zijn geen productiestrategie, en ze zijn niet gratis.

Voordat je op één ervan bouwt, haal drie antwoorden op schrift uit de eigen documentatie van de provider in plaats van uit een overzichtsartikel: train deze tier op mijn data, wat is mijn plafond voor verzoeken per dag, en is het model dat ik daadwerkelijk zou uitbrengen hier überhaupt beschikbaar? Als je alle drie kunt beantwoorden en de deal nog steeds goed lijkt, neem hem aan. Als je ze niet kunt beantwoorden, heb je de prijs niet berekend — je hebt alleen het cijfer nul gezien en bent gestopt met lezen.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt