
Darmowe API LLM w 2026 roku: Co jest naprawdę darmowe, a za co płacisz zamiast tego
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Poszukaj darmowego API LLM, a dostaniesz listę. Trzynastu dostawców, piętnastu dostawców, tabela z logo, kolumna zielonych ptaszków. To, co decyduje o tym, czy darmowy poziom jest ci do czegoś przydatny, to coś, o czym prawie żadna z tych list nie mówi: każde darmowe API LLM kosztuje cię coś. To po prostu nie jest gotówka.
Są trzy waluty. Płacisz swoimi danymi, swoim sufitem albo swoim poziomem modelu — i zwykle wszystkimi trzema naraz. Ten tekst omawia każdą z nich na podstawie dokumentacji dostawców, a nie wtórnej tabeli, a następnie odpowiada na pytanie, które te listy pomijają: co się dzieje, gdy wyczerpie się darmowy poziom.
Waluta pierwsza: Twoje dane
To jest to, co powinno rozstrzygnąć sprawę dla większości zespołów, a w najlepszym razie zostaje zepchnięte do przypisu.
Strona cenowa Gemini API od Google jest pod tym względem niezwykle bezpośrednia. Dla każdego modelu z bezpłatną warstwą strona podaje, co dzieje się z Twoimi treściami. W bezpłatnej warstwie tekst brzmi "Treści wykorzystywane do ulepszania naszych produktów." W płatnej warstwie tego samego modelu ten sam tekst brzmi "Treści nie wykorzystywane do ulepszania naszych produktów." Ten sam model, ten sam punkt końcowy, ten sam kod — jedyną rzeczą, która się zmienia, jest to, czy Google może zatrzymać to, co wysłałeś.
Mistral działa w ten sam sposób z innym ustawieniem domyślnym. Na La Plateforme dane wejściowe i wyjściowe są wykorzystywane do trenowania modeli, chyba że zrezygnujesz, a użytkownicy bezpłatnego planu mogą zrezygnować — to przełącznik w menu Prywatność w konsoli administracyjnej, a po potwierdzeniu Mistral przestaje używać Twoich danych wejściowych i wyjściowych do trenowania. Plany Team i Enterprise w ogóle nie znajdują się w puli treningowej.
To rozróżnienie ma większe znaczenie, niż się wydaje. Wiele zestawień, które znajdziesz, wprost stwierdza, że darmowy poziom Mistral wymaga zaakceptowania trenowania. To było prawdą w przypadku wcześniejszej polityki, ale teraz już nie jest. Jeśli oceniasz na podstawie wpisu na blogu sprzed sześciu miesięcy, pomylisz się w obie strony — zakładając, że dostawca jest bezpieczny, gdy nie jest, lub wykluczając go, gdy checkbox by to rozwiązał.
Praktyczna zasada: jeśli prompt zawiera cokolwiek, co wahałbyś się wkleić na publicznym forum, darmowy poziom nie jest darmowy. Dane klientów, wewnętrzny kod, nieopublikowane treści produktowe, wszystko objęte umową NDA — koszt darmowego poziomu w takim przypadku to problem z zarządzaniem danymi, który po cichu stworzyłeś, by ktoś inny go znalazł.

Waluta druga: twój pułap
Darmowe poziomy są rozliczane według większej liczby osi, niż ludzie się spodziewają, i natrafiasz na tę, która pierwsza się wyczerpie. Groq publikuje limity swojego darmowego planu dla każdego modelu, a ich kształt jest pouczający:
Przeczytaj te dwa wiersze modeli obok siebie. Ta sama liczba żądań na minutę, ale większy model daje ci 1000 żądań dziennie zamiast 14 400 — czyli czternastokrotnie mniej w zamian za wyższą wydajność. A limity dotyczą poziomu organizacji, a nie pojedynczego użytkownika, więc drugi programista na tym samym koncie nie ma własnego limitu — korzysta z Twojego.
Dzienny limit to ten, który po cichu zabija projekty. 1000 żądań dziennie brzmi szczodrze, dopóki nie przyłożysz go do czegoś realnego: funkcja czatu z 50 użytkownikami po 20 tur każdy to cały twój dzień. Nocne zadanie wsadowe, które ponawia próby po błędzie, może spalić limit przed śniadaniem. Ograniczenia na minutę można obejść za pomocą kolejki. Dziennego pułapu nie da się obejść — można tylko czekać do północy.
Liczba, którą musisz ustalić przed rozpoczęciem budowy, to nie "czy jest darmowy poziom", ale "jaki jest mój dzienny budżet żądań na użytkownika i ilu użytkowników to obsługuje?" Jeśli odpowiedź jest poniżej stu, budujesz demo i powinieneś o tym wiedzieć.
Waluta trzecia: poziom twojego modelu
Trzeci koszt to ten, który decyduje o tym, co w ogóle możesz zbudować: modele graniczne nie są dostępne w darmowych wersjach, a przepaść się pogłębia.
Darmowy poziom Google obejmuje teraz klasę Flash oraz modele osadzania — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite i Gemini 2.0 Flash. Nie ma na nim linii Pro. To celowe zawężenie: modele z serii Pro zostały przeniesione do wyłącznie płatnego dostępu API w 2026 roku, a darmowy poziom obejmuje od tego czasu modele Flash i niższe.
To nie jest narzekanie — modele klasy Flash w 2026 roku są naprawdę mocne, a do klasyfikacji, ekstrakcji, routingu, streszczania oraz większości prac wspomaganych wyszukiwaniem są właściwym wyborem, niezależnie od tego, czy płacisz. Ale to oznacza, że darmowy poziom nie może odpowiedzieć na pytanie, na które podczas ewaluacji najbardziej chcesz odpowiedzi, czyli „czy dobry model rozwiąże mój trudny przypadek?" Będziesz oceniać tani model i ekstrapolować w górę, a ta ekstrapolacja często bywa błędna w obie strony.
Ten, który naprawdę jest darmowy za token
Istnieje kategoria, którą zestawienia zwykle wymieniają, ale rzadko analizują: modele o otwartych wagach, które uruchamiasz samodzielnie. Pobierz wagi, uruchom je na własnym sprzęcie, a koszt krańcowy za token będzie naprawdę zerowy. Żadnych limitów szybkości, żadnych dziennych limitów, żadnej klauzuli o szkoleniach, żadnych progów — całość należy do Ciebie.
To, co zrobiliście, to przeniesienie kosztu z pozycji budżetowej do linii płac. Ktoś musi dobrać GPU, wybrać i dostroić stos serwujący, dbać o łatki, reagować na wezwanie o 3 nad ranem, gdy przepustowość spada, i powtórzyć to wszystko, gdy dwa miesiące później pojawi się lepszy checkpoint. Dla zespołu, który już zarządza infrastrukturą, może to być najtańsza opcja z dużym zapasem przy dużej skali. Dla trzyosobowego zespołu tworzącego produkt, tydzień pracy inżyniera spędzony na instalacjach inferencyjnych kosztuje więcej niż kilka lat rachunku za API, który zastępuje.
Self-hosting jest właściwą odpowiedzią, gdy masz duży wolumen, wymóg prywatności, który nie dopuszcza innego rozwiązania, lub istniejący zespół platformowy. Jest błędną odpowiedzią, gdy to, czego naprawdę potrzebowałeś, to przestać myśleć o inferencji.

Koszt, którego nikt nie wpisuje do tabeli: darmowe poziomy nie komponują się ze sobą
Oto sposób działania, który faktycznie kosztuje zespoły czas, a wynika on ze zbyt wiernego stosowania się do porad dotyczących darmowego poziomu.
Wybierasz rozsądną drogę. Darmowy poziom Google do pracy z modelami klasy Flash. Darmowy poziom innego dostawcy do szybkiej inferencji z otwartymi wagami. Trzeci do mowy. Każdy jest naprawdę darmowy, każdy był dobrą indywidualną decyzją. Sześć tygodni później trzymasz w ręku trzy klucze API, trzy SDK, trzy reżimy limitów, trzy relacje rozliczeniowe i trzy różne zachowania w przypadku awarii — a twoja logika ponawiania, obserwowalność i rozliczanie kosztów muszą rozumieć je wszystkie.
Potem jeden z nich się zmienia. Dostawca zawęża swój darmowy poziom — jak to miało miejsce, gdy modele klasy Pro stały się płatne. Twoja ścieżka rezerwowa nigdy nie została przetestowana, ponieważ nigdy się nie uruchomiła. Migracja, którą teraz przeprowadzasz, nie jest zmianą konfiguracji; to refaktoryzacja warstwy, którą zbudowałeś, aby zamaskować różnice, i robisz to pod presją czasu, ponieważ to jest już w produkcji.
Darmowy poziom był darmowy. Uzależnienie, które narosło, aby go zdobyć, już nie było darmowe. To jest prawdziwy powód, dla którego warto dbać o to, czy twoja warstwa dostępu jest przenośna: nie ideologia dotycząca neutralności dostawców, ale fakt, że darmowe poziomy są najbardziej zmienną częścią oferty każdego dostawcy, a budowanie bezpośrednio na trzech z nich gwarantuje, że w ciągu roku będziesz migrować coś.
Co właściwie zrobić
Jeśli prototypujesz, a dane nie są wrażliwe — bierz darmowe tery dostawców i bierz je bez wyrzutów sumienia. Istnieją właśnie po to. Od pierwszego dnia pisz integrację za jednym własnym interfejsem, aby zmiana dostawcy była zmianą konfiguracji, a nie refaktoryzacją.
Jeśli dane są wrażliwe — nie korzystaj z darmowego poziomu, który trenuje na twoich danych wejściowych. Albo zapłać za poziom, w którym dostawca jest umownie zobowiązany tego nie robić (rozróżnienie Google między wersją darmową a płatną jest w tej kwestii jednoznaczne), wyłącz trenowanie tam, gdzie dostawca pozwala na to w darmowym planie, albo hostuj samodzielnie. Nie ma czwartej opcji, a odkrycie tego po uruchomieniu jest znacznie droższe niż rachunek za API, którego unikałeś.
Jeśli porównujesz modele ze sobą — darmowy poziom wprowadzi cię w błąd, ponieważ nie zawiera modeli, które zamierzasz wdrożyć. Oceniaj na poziomie, którego zamierzasz używać w produkcji, na własnych promptach. Koszt rzetelnej ewaluacji to kilka dolarów; koszt błędnego wyboru to kwartał.
Jeśli przechodzisz do produkcji — pytanie przestaje brzmieć „co jest darmowe”, a staje się „jaki jest koszt za token i co się dzieje, gdy ten dostawca ma awarię”. To są różne pytania z różnymi odpowiedziami, a darmowy poziom nie odpowiada na żadne z nich.
Gdzie OrcaRouter znajduje zastosowanie
OrcaRouter udostępnia rotacyjny zestaw darmowych modeli AI, dostępnych po 0 USD za token, a także darmowe kredyty API z otwartych zrzutów voucherów, programów studenckich i hackathonów partnerskich. Utworzenie konta i skorzystanie z otwartej oferty nie wymaga metody płatności; zestaw darmowych modeli zmienia się w miarę pojawiania się nowych modeli open-weight i promocyjnych, a kredyty promocyjne z vouchera lub hackathonu są zwykle do wykorzystania w całym katalogu, a nie ograniczone do darmowych modeli.
Kluczowe dla opisanego powyżej problemu jest to, co dzieje się dalej. Wszystko przechodzi przez jeden endpoint kompatybilny z OpenAI, więc darmowy model, na którym prototypujesz, i najnowocześniejszy model, na którym wdrażasz, to ta sama integracja — zmiana ciągu znaków w polu modelu, a nie migracja. Gdy darmowy poziom się zawęża lub model jest wycofywany, zmieniasz ID modelu. Gdy potrzebujesz porównać Gemini 3.6 Flash z DeepSeek V4 Flash na własnych promptach, robisz to bez rejestrowania się w niczym nowym.
To jest uczciwy argument za routerem w artykule o darmowych API: nie chodzi o to, że jesteśmy tańsi niż darmowe, ale o to, że darmowe poziomy są najbardziej niestabilną rzeczą, na której można budować, a koszt tej niestabilności jest tym, co warto wyeliminować w procesie projektowania.

Krótka wersja
Darmowe API LLM w 2026 roku są realne, przydatne i warte wykorzystania — do prototypowania, do obciążeń niewrażliwych, do nauki oraz do szerokiej klasy zadań, z którymi model klasy Flash radzi sobie doskonale. Nie są strategią produkcyjną i nie są darmowe.
Zanim zaczniesz budować na którymś z nich, uzyskaj trzy odpowiedzi na piśmie z dokumentacji dostawcy, a nie z zestawienia: czy ten poziom trenuje na moich danych, jaki jest mój dzienny limit żądań, i czy model, który faktycznie wdrożę, jest w ogóle dostępny tutaj? Jeśli potrafisz odpowiedzieć na wszystkie trzy i nadal podoba Ci się oferta, bierz ją. Jeśli nie potrafisz na nie odpowiedzieć, nie wyceniłeś jej — po prostu zobaczyłeś zero i przestałeś czytać.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
