
Kostenlose LLM-APIs im Jahr 2026: Was wirklich kostenlos ist und womit Sie stattdessen bezahlen
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sucht man nach einer kostenlosen LLM-API, bekommt man eine Liste. Dreizehn Anbieter, fünfzehn Anbieter, eine Tabelle mit Logos, eine Spalte mit grünen Häkchen. Was fast keine dieser Listen verrät, ist der Teil, der entscheidet, ob der kostenlose Tarif einem etwas nützt: Jede kostenlose LLM-API verlangt eine Bezahlung in irgendetwas. Nur eben nicht in bar.
Es gibt drei Währungen. Man bezahlt mit seinen Daten, mit seinem Limit oder mit seiner Modellstufe – und normalerweise mit allen dreien gleichzeitig. Dieser Artikel geht jede einzelne anhand der eigenen Dokumentation der Anbieter durch, nicht anhand einer Tabelle aus zweiter Hand, und beantwortet dann die Frage, die diese Listen auslassen: Was passiert, wenn das kostenlose Kontingent erschöpft ist?
Währung eins: deine Daten
Das ist derjenige, der die Frage für die meisten Teams entscheiden sollte, und genau der bekommt bestenfalls eine Fußnote.
Googles Preisseite für die Gemini-API ist ungewöhnlich direkt, was das betrifft. Für jedes Modell mit einem kostenlosen Tarif listet die Seite auf, was mit deinen Inhalten passiert. Beim kostenlosen Tarif lautet die Zeile „Content used to improve our products." Beim kostenpflichtigen Tarif desselben Modells lautet dieselbe Zeile „Content not used to improve our products." Dasselbe Modell, derselbe Endpunkt, derselbe Code – das Einzige, was sich ändert, ist, ob Google behalten darf, was du gesendet hast.
Mistral funktioniert auf die gleiche Weise, nur mit einer anderen Standardeinstellung. Auf La Plateforme werden Eingabe- und Ausgabedaten zum Trainieren von Modellen verwendet, sofern Sie nicht widersprechen, und Nutzer des kostenlosen Tarifs können widersprechen — es ist ein Schalter im Menü „Datenschutz“ der Admin-Konsole, und sobald dies bestätigt ist, verwendet Mistral Ihre Eingaben und Ausgaben nicht mehr für das Training. Team- und Enterprise-Tarife sind überhaupt nicht im Trainingspool.
Dieser Unterschied ist wichtiger, als es den Anschein hat. Viele der Übersichten, die Sie finden, behaupten schlichtweg, dass der kostenlose Tarif von Mistral verlangt, dass Sie dem Training zustimmen. Das galt für eine frühere Richtlinie, gilt aber heute nicht mehr. Wenn Sie anhand eines Blogbeitrags von vor sechs Monaten bewerten, werden Sie sich in beide Richtungen irren — Sie gehen davon aus, dass ein Anbieter sicher ist, obwohl er es nicht ist, oder schließen einen aus, obwohl ein Kontrollkästchen es gelöst hätte.
Die praktische Regel: wenn die Eingabeaufforderung etwas enthält, das du zögern würdest, in ein öffentliches Forum einzufügen, ist der kostenlose Tarif nicht kostenlos. Kundendatensätze, interner Code, unveröffentlichte Produkttexte, alles unter einer NDA – die Kosten eines kostenlosen Tarifs dort sind ein Daten-Governance-Problem, das du still für jemand anderen geschaffen hast, damit jemand anderes es findet.

Währung zwei: Ihre Obergrenze
Kostenlose Tarife werden auf mehr Achsen bemessen, als man erwartet, und man stößt an diejenige, die zuerst aufgebraucht ist. Groq veröffentlicht die Limits seines kostenlosen Plans pro Modell, und die Struktur ist aufschlussreich:
Vergleichen Sie diese beiden Modellzeilen miteinander. Gleiche Anfragen pro Minute, aber das größere Modell gibt Ihnen 1.000 Anfragen pro Tag statt 14.400 — eine vierzehnfache Reduzierung für den Schritt zu mehr Leistungsfähigkeit. Und die Limits gelten auf Organisationsebene, nicht pro Benutzer, sodass ein zweiter Entwickler auf demselben Konto kein eigenes Kontingent erhält, sondern von Ihrem zehrt.
Ein Tageslimit ist das, was Projekte lautlos tötet. 1.000 Anfragen pro Tag klingen großzügig, bis du sie an etwas Reales koppelst: Eine Chat-Funktion mit 50 Benutzern und je 20 Runden entspricht deinem gesamten Tageslimit. Ein nächtlicher Batch-Job, der es bei Fehlern erneut versucht, kann das Limit vor dem Frühstück aufbrauchen. Limits pro Minute kannst du mit einer Warteschlange umgehen. Eine Tagesobergrenze dagegen nicht – du kannst nur auf Mitternacht warten.
Die Zahl, die du herausfinden musst, bevor du baust, ist nicht "Gibt es einen kostenlosen Tarif?", sondern "Wie hoch ist mein Tagesbudget an Anfragen pro Benutzer, und wie viele Benutzer unterstützt das?" Wenn die Antwort unter hundert liegt, baust du eine Demo, und das solltest du von vornherein wissen.
Währung drei: Ihre Modellstufe
Der dritte Kostenfaktor ist derjenige, der bestimmt, was du tatsächlich bauen kannst: Frontier-Modelle sind nicht in kostenlosen Tarifen verfügbar, und die Lücke wird immer größer.
Googles kostenlose Stufe umfasst jetzt die Flash-Klasse und die Embedding-Modelle — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite und Gemini 2.0 Flash. Die Pro-Linie ist nicht enthalten. Das ist eine bewusste Einschränkung: Pro-Serien-Modelle wurden 2026 für den API-Zugriff auf kostenpflichtig umgestellt, und die kostenlose Stufe umfasst seither nur Flash und darunter.
Das ist keine Beschwerde — Flash-Klasse-Modelle sind 2026 wirklich stark, und für Klassifikation, Extraktion, Routing, Zusammenfassung und die meisten retrieval-gestützten Arbeiten sind sie die richtige Wahl, ob du zahlst oder nicht. Aber es bedeutet, dass ein kostenloser Tarif die Frage nicht beantworten kann, die du bei der Evaluierung am liebsten beantwortet haben möchtest, nämlich "Löst das gute Modell meinen schwierigen Fall?" Du wirst das günstige Modell evaluieren und daraus auf das bessere Modell schließen, und dieser Schluss ist in beide Richtungen häufig falsch.
Derjenige, der wirklich pro Token kostenlos ist
Es gibt eine Kategorie, die die Zusammenfassungen normalerweise erwähnen und selten durchdenken: Open-Weight-Modelle, die du selbst betreibst. Lade die Gewichte herunter, betreibe sie auf deiner eigenen Hardware, und die Grenzkosten pro Token sind wirklich null. Kein Ratenlimit, keine Tagesbegrenzung, keine Trainingsklausel, keine Stufe — dir gehört das Ganze.
Was du getan hast, ist, die Kosten von einem Einzelposten auf eine Gehaltszeile zu verlagern. Jemand muss die GPU dimensionieren, den Serving-Stack auswählen und optimieren, ihn gepatcht halten, den Anruf um 3 Uhr morgens entgegennehmen, wenn der Durchsatz zusammenbricht, und alles wiederholen, wenn zwei Monate später ein besseres Checkpoint erscheint. Für ein Team, das bereits Infrastruktur betreibt, kann das bei hohem Volumen die mit Abstand günstigste Option sein. Für ein Team von drei Personen, das ein Produkt ausliefert, kostet eine Entwicklerwoche, die für Inferenz-Verkabelung aufgewendet wird, mehr als mehrere Jahre der API-Rechnung, die sie ersetzt.
Self-Hosting ist die richtige Antwort, wenn Sie ein hohes Volumen haben, eine Datenschutzanforderung, die keine andere Lösung zulässt, oder ein bestehendes Plattform-Team. Es ist die falsche Antwort, wenn Sie eigentlich nur aufhören wollten, über Inferenz nachzudenken.

Die Kosten, die niemand in die Tabelle einträgt: Kostenlose Tarife lassen sich nicht kombinieren
Hier ist der Fehlermodus, der Teams tatsächlich Zeit kostet, und er entsteht dadurch, dass man dem Ratschlag zur kostenlosen Stufe allzu gut folgt.
Du wählst den vernünftigen Weg. Googles kostenlose Stufe für Arbeit der Flash-Klasse. Die kostenlose Stufe eines anderen Anbieters für schnelle Open-Weight-Inferenz. Eine dritte für Sprache. Jede ist wirklich kostenlos, und jede war eine gute Einzelentscheidung. Sechs Wochen später hältst du drei API-Schlüssel, drei SDKs, drei Rate-Limit-Regelungen, drei Abrechnungsbeziehungen und drei verschiedene Fehlerverhaltensweisen — und deine Retry-Logik, deine Observability und deine Kostenrechnung müssen all diese verstehen.
Dann ändert sich einer von ihnen. Ein Anbieter verkleinert sein kostenloses Kontingent – so geschehen, als Pro-Klassen-Modelle auf kostenpflichtig umgestellt wurden. Dein Fallback-Pfad wurde nie getestet, weil er nie ausgelöst wurde. Die Migration, die du jetzt durchführst, ist keine Konfigurationsänderung; sie ist ein Refactoring der Schicht, die du gebaut hast, um die Unterschiede zu überdecken – und du tust es unter Zeitdruck, weil das System bereits in Produktion ist.
Die kostenlose Stufe war kostenlos. Die Abhängigkeit, die du angesammelt hast, um sie zu bekommen, war es nicht. Das ist der wahre Grund, sich darum zu kümmern, ob deine Zugriffsschicht portabel ist: nicht Ideologie über Anbieterneutralität, sondern die Tatsache, dass kostenlose Stufen der volatilste Teil des Angebots eines Anbieters sind, und dass direkt gegen drei von ihnen zu bauen garantiert, dass du innerhalb eines Jahres etwas migrieren wirst.
Was man tatsächlich tun sollte
Wenn du Prototypen baust und die Daten nicht sensibel sind — nimm die kostenlosen Tarife der Anbieter, und nimm sie ohne schlechtes Gewissen. Genau dafür gibt es sie. Implementiere die Integration von Anfang an hinter einer eigenen Schnittstelle, sodass der Anbieterwechsel eine Konfigurationsänderung ist und kein Refactoring.
Wenn die Daten sensibel sind — nutze keine kostenlose Stufe, die mit deinen Eingaben trainiert. Zahle entweder für die Stufe, bei der der Anbieter vertraglich auf das Training verzichtet (die Grenze zwischen kostenlos und kostenpflichtig ist bei Google diesbezüglich eindeutig), deaktiviere das Training, wo der Anbieter es im kostenlosen Plan erlaubt, oder hoste selbst. Es gibt keine vierte Option, und das erst nach dem Launch festzustellen ist erheblich teurer als die API-Rechnung, die du vermeiden wolltest.
Wenn Sie Modelle gegeneinander bewerten — wird Sie die kostenlose Stufe in die Irre führen, denn sie enthält nicht die Modelle, die Sie ausliefern würden. Bewerten Sie auf der Stufe, die Sie in der Produktion einsetzen möchten, mit Ihren eigenen Prompts. Eine ordnungsgemäße Bewertung kostet ein paar Dollar; die falsche Wahl kostet Sie das Quartal.
Wenn Sie in Produktion gehen — stellt sich nicht mehr die Frage „Was ist kostenlos?“, sondern „Was kostet ein Token, und was passiert, wenn dieser Anbieter einen Ausfall hat?“ Das sind unterschiedliche Fragen mit unterschiedlichen Antworten, und ein kostenloser Tarif beantwortet keine davon.
Wo OrcaRouter passt
OrcaRouter betreibt eine rotierende Auswahl kostenloser KI-Modelle, aufrufbar für $0 pro Token, sowie kostenlose API-Guthaben aus offenen Voucher-Aktionen, Studentenprogrammen und Partner-Hackathons. Für die Erstellung eines Kontos und die Inanspruchnahme eines offenen Angebots ist keine Zahlungsmethode erforderlich; die Auswahl der kostenlosen Modelle ändert sich, wenn neue Open-Weight- und Promo-Modelle verfügbar werden, und Promo-Guthaben aus einem Voucher oder Hackathon kann normalerweise im gesamten Katalog ausgegeben werden, statt auf die kostenlosen Modelle beschränkt zu sein.
Der Teil, der für das oben beschriebene Problem zählt, ist das, was als Nächstes passiert. Alles läuft über einen OpenAI-kompatiblen Endpunkt, sodass das kostenlose Modell, mit dem du Prototypen erstellst, und das Spitzenmodell, mit dem du in Produktion gehst, dieselbe Integration sind – eine Zeichenfolgenänderung im Modellfeld, keine Migration. Wenn ein kostenloser Tarif eingeschränkt wird oder ein Modell eingestellt wird, änderst du eine Modell-ID. Wenn du Gemini 3.6 Flash mit DeepSeek V4 Flash anhand deiner eigenen Prompts vergleichen musst, tust du das, ohne dich für etwas Neues anzumelden.
Das ist der ehrliche Pitch für einen Router in einem Artikel über kostenlose APIs: nicht dass wir günstiger als kostenlos sind, sondern dass kostenlose Stufen das Volatilste sind, gegen das man entwickeln kann, und die Kosten dieser Volatilität sind das, was sich wegzudesignen lohnt.

Die Kurzfassung
Kostenlose LLM-APIs sind 2026 real, nützlich und ihren Einsatz wert — für Prototyping, für unkritische Arbeitslasten, zum Lernen und für die große Klasse von Aufgaben, die ein Modell der Flash-Klasse problemlos bewältigt. Sie sind keine Produktionsstrategie, und sie sind nicht kostenlos.
Bevor du auf einem aufbaust, hol dir drei Antworten schriftlich aus der eigenen Dokumentation des Anbieters statt aus einer Übersicht: trainiert dieser Tarif mit meinen Daten, wie hoch ist meine Obergrenze für Anfragen pro Tag, und ist das Modell, das ich tatsächlich einsetzen würde, hier überhaupt verfügbar? Wenn du alle drei beantworten kannst und dir das Angebot immer noch gefällt, nimm es. Wenn du sie nicht beantworten kannst, hast du es nicht kalkuliert — du hast nur die Zahl Null gesehen und aufgehört zu lesen.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
