
Gratis LLM-API:er 2026: Vad som faktiskt är gratis, och vad du betalar istället
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sök efter ett gratis LLM-API så får du en lista. Tretton leverantörer, femton leverantörer, en tabell med logotyper, en kolumn med gröna bockar. Vad nästan ingen av dessa listor berättar för dig är den del som avgör om gratissnivån är till någon nytta för dig: varje gratis LLM-API tar betalt av dig i något. Det är bara inte kontanter.
Det finns tre valutor. Du betalar med dina data, du betalar med ditt tak, eller du betalar med din modellnivå — och oftast alla tre samtidigt. Den här texten går igenom var och en med leverantörernas egen dokumentation, inte en andrahandstabell, och svarar sedan på den fråga som listorna hoppar över: vad händer när gratissnivån tar slut.
{"score": 1, "reason": "Instruction is vague and underspecified; no clear task, context, or expected output."}
Det här är den som borde avgöra frågan för de flesta team, och det är den som i bästa fall får en fotnot.
Googles prissida för Gemini API är ovanligt rak på den punkten. För varje modell med en gratisnivå listar sidan vad som händer med ditt innehåll. På gratisnivån står det "Innehåll som används för att förbättra våra produkter." På betalnivån för samma modell står det "Innehåll som inte används för att förbättra våra produkter." Samma modell, samma slutpunkt, samma kod – det enda som ändras är om Google får behålla det du skickade.
Mistral fungerar på samma sätt med en annan standardinställning. På La Plateforme används in- och utdata för att träna modeller om du inte väljer bort det, och användare på gratisplanen kan välja bort det – det är en växling i sekretessmenyn i Admin Console, och när det har bekräftats slutar Mistral att använda dina in- och utdata för träning. Team- och Enterprise-planerna ingår inte alls i träningspoolen.
Den skillnaden är viktigare än den verkar. Många av de sammanställningar du hittar säger rakt ut att Mistrals gratisnivå kräver att du accepterar träning. Det stämde för en tidigare policy, men det stämmer inte nu. Om du utvärderar utifrån ett blogginlägg från sex månader sedan kommer du att ha fel i båda riktningarna — att anta att en leverantör är säker när den inte är det, eller att utesluta en när en kryssruta hade löst det.
Den praktiska regeln: om prompten innehåller något du skulle tveka att klistra in på ett offentligt forum, så är gratissnivån inte gratis. Kundregister, intern kod, opublicerad produkttext, allt som omfattas av ett NDA — kostnaden för en gratissnivå där är ett datastyrningsproblem som du tyst har skapat åt någon annan att hitta.

Valuta två: ditt tak
Gratisnivåer mäts på fler axlar än folk förväntar sig, och du träffar den som tar slut först. Groq publicerar sina gränser för gratispaketet per modell, och formen är lärorik:
Jämför de två modellraderna med varandra. Samma antal förfrågningar per minut, men den större modellen ger dig 1 000 förfrågningar per dag istället för 14 400 — en fjortonfaldig minskning för att kliva upp i kapacitet. Och begränsningarna gäller på organisationsnivå, inte per användare, så en andra utvecklare på samma konto får inte en egen tilldelning; de tar från din.
En daglig gräns är den som tyst dödar projekt. 1 000 förfrågningar om dagen låter generöst tills du kopplar det till något verkligt: en chattfunktion med 50 användare som tar 20 turer vardera är hela din dag. Ett nattligt batchjobb som gör om vid fel kan bränna gränsen före frukost. Hastighetsbegränsningar per minut kan du konstruera runt med en kö. En gräns per dag kan du inte – du kan bara vänta på midnatt.
Siffran du måste räkna ut innan du bygger är inte "finns det en gratisnivå" utan "vad är min budget för förfrågningar per dag per användare, och hur många användare klarar det?" Om svaret är under hundra bygger du en demo, och det bör du veta från början.
Valuta tre: din modellnivå
Den tredje kostnaden är den som formar vad du faktiskt kan bygga: frontlinjemodeller finns inte på gratissnivåer, och klyftan växer.
Googles gratisnivå omfattar nu Flash-klassen och inbäddningsmodellerna — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite och Gemini 2.0 Flash. Pro-serien ingår inte. Det är en medveten avgränsning: Pro-seriens modeller flyttades till enbart betalda för API-åtkomst 2026, och gratisnivån har sedan dess varit Flash och lägre.
Det här är inget klagomål — Flash-klassmodeller 2026 är genuint starka, och för klassificering, extraktion, routing, sammanfattning och det mesta retrieval-förstärkta arbetet är de rätt val oavsett om du betalar eller inte. Men det betyder att en gratissnivå inte kan svara på den fråga du helst vill ha besvarad under utvärderingen, vilket är "löser den bra modellen mitt svåra fall?" Du kommer att utvärdera den billiga modellen och extrapolera uppåt, och den extrapoleringen är ofta fel i båda riktningarna.
Den som verkligen är gratis per token
Det finns en kategori som sammanfattningarna brukar nämna och sällan tänker igenom: open-weight-modeller som du kör själv. Ladda ner vikterna, servera dem på din egen hårdvara, och marginalkostnaden per token är verkligen noll. Ingen hastighetsbegränsning, ingen daglig gräns, ingen träningsklausul, ingen nivå — du äger alltihop.
Det du har gjort är att flytta kostnaden från en kostnadsrad till en lönerad. Någon måste dimensionera GPU:n, välja och finjustera serving-stacken, hålla den patchad, hantera larmet klockan 03.00 när genomströmningen kollapsar, och göra om alltihop när en bättre checkpoint landar två månader senare. För ett team som redan driver infrastruktur kan det vara det klart billigaste alternativet i stor skala. För ett team på tre som levererar en produkt kostar en ingenjörsvecka på inferensplumbing mer än flera års API-räkning som den ersätter.
Self-hosting är rätt svar när du har volym, ett integritetskrav som inte medger någon annan lösning, eller ett befintligt plattformsteam. Det är fel svar när det du egentligen behövde var att sluta tänka på inferens.

Kostnaden ingen tar med i beräkningen: gratisnivåer kan inte komponeras
Här är det felsätt som faktiskt kostar team tid, och det kommer sig av att man följer råden om gratisnivån alltför väl.
Du tar den förnuftiga vägen. Googles gratissnivå för Flash-klassarbete. En annan leverantörs gratissnivå för snabb open-weight-inferens. En tredje för tal. Var och en är verkligen gratis, var och en var ett bra enskilt beslut. Sex veckor senare håller du i tre API-nycklar, tre SDK:er, tre rate-limit-regimer, tre faktureringsrelationer och tre olika felbeteenden — och din retry-logik, din observerbarhet och din kostnadsredovisning måste förstå dem alla.
Sedan ändras en av dem. En leverantör minskar sin gratisnivå – som när Pro-klassmodeller övergick till att bli enbart betalda. Din reservväg testades aldrig eftersom den aldrig utlöstes. Migreringen du nu gör är inte en konfigurationsändring; det är en omstrukturering av det lager du byggde för att dölja skillnaderna, och du gör det under tidspress eftersom systemet redan är i produktion.
Gratisnivån var gratis. Den inlåsning du ackumulerade för att få den var inte det. Detta är den verkliga anledningen till att bry sig om huruvida ditt åtkomstlager är portabelt: inte ideologi om leverantörsneutralitet, utan det faktum att gratissnivåer är den mest volatila delen av varje leverantörs utbud, och att bygga direkt mot tre av dem garanterar att du kommer att migrera något inom året.
Vad man faktiskt ska göra
Om du prototypar och datan inte är känslig — ta leverantörernas gratisnivåer, och ta dem utan dåligt samvete. De finns för precis detta. Skriv integrationen bakom ett eget gränssnitt från dag ett så att ett byte av leverantör är en konfigurationsändring och inte en refaktorering.
Om datan är känslig — använd inte en gratisnivå som tränar på dina indata. Betala antingen för den nivå där leverantören avtalsmässigt inte gör det (Googles gräns mellan gratis och betald är uttrycklig i detta), stäng av träning där leverantören tillåter det på gratisplanen, eller självhosta. Det finns inget fjärde alternativ, och att upptäcka detta efter lanseringen är betydligt dyrare än API-kostnaden du försökte undvika.
Om du utvärderar modeller mot varandra — kommer gratisnivån att vilseleda dig, eftersom den inte innehåller de modeller du skulle leverera. Utvärdera på den nivå du tänker köra i produktion, med dina egna prompts. Kostnaden för en ordentlig utvärdering är några dollar; kostnaden för att välja fel är kvartalet.
Om du går till produktion — är frågan inte längre "vad är gratis" utan "vad kostar varje token, och vad händer när den här leverantören har ett avbrott." Det är olika frågor med olika svar, och en gratisnivå besvarar ingen av dem.
Var OrcaRouter passar
OrcaRouter kör en roterande uppsättning gratis AI-modeller som kan anropas för $0 per token, tillsammans med gratis API-krediter från öppna vouchersläpp, studentprogram och partnerhackathons. Att skapa ett konto och aktivera ett öppet erbjudande kräver ingen betalningsmetod; utbudet av gratismodeller ändras allt eftersom nya open-weight- och promomodeller lanseras, och promokrediter från en voucher eller hackathon kan normalt användas i hela katalogen snarare än att vara begränsade till gratismodellerna.
Det som spelar roll för problemet som beskrivs ovan är vad som händer härnäst. Allt går via en OpenAI-kompatibel endpoint, så gratismodellen du prototypar på och frontier-modellen du lanserar med är samma integration — en strängändring i modellfältet, inte en migrering. När en gratisnivå krymper eller en modell fasas ut ändrar du ett modell-ID. När du behöver jämföra Gemini 3.6 Flash mot DeepSeek V4 Flash på dina egna prompts gör du det utan att registrera dig för något nytt.
Det är det ärliga argumentet för en router i en artikel om gratis API:er: inte att vi är billigare än gratis, utan att gratissnivåer är det mest volatila du kan bygga mot, och att kostnaden för den volatiliteten är det som är värt att designa bort.

Den korta versionen
Gratis LLM-API:er under 2026 är verkliga, användbara och värda att använda — för prototypframställning, för icke-känsliga arbetsbelastningar, för lärande och för den stora klassen av uppgifter som en Flash-klassmodell hanterar alldeles utmärkt. De är inte en produktionsstrategi, och de är inte gratis.
Innan du bygger på en, få tre svar skriftligen från leverantörens egen dokumentation snarare än en sammanfattning: tränar denna nivå på min data, vad är mitt tak för antal förfrågningar per dag, och är modellen jag faktiskt skulle leverera ens tillgänglig här? Om du kan svara på alla tre och fortfarande gillar erbjudandet, ta det. Om du inte kan svara på dem, har du inte prissatt det — du har bara sett siffran noll och slutat läsa.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
