Cartão de título principal exibindo 'APIs gratuitas de LLM em 2026' com o subtítulo 'O que é realmente gratuito — e o que você paga em vez disso', mostrando três cartões sob o título AS TRÊS MOEDAS: SEUS DADOS (os níveis gratuitos podem treinar com eles), SEU LIMITE (as solicitações por dia se esgotam) e SEU NÍVEL (modelos de fronteira são somente pagos).
Guides & Insights

APIs de LLM gratuitas em 2026: O que é realmente gratuito e o que você paga em vez disso

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Pesquise por uma API LLM gratuita e você obtém uma lista. Treze provedores, quinze provedores, uma tabela de logotipos, uma coluna de marcas de verificação verdes. O que quase nenhuma dessas listas lhe diz é a parte que decide se o nível gratuito é útil para você: toda API LLM gratuita cobra algo de você. Só que não é dinheiro.

Há três moedas. Você paga com seus dados, paga com seu teto, ou paga com seu nível de modelo — e geralmente todos os três ao mesmo tempo. Este artigo analisa cada uma delas com a documentação dos próprios provedores, não uma tabela de segunda mão, e então responde à pergunta que essas listas ignoram: o que acontece quando o nível gratuito acaba.

Moeda 1: seus dados

Este é o que deveria decidir a questão para a maioria das equipes, e é o que, na melhor das hipóteses, ganha uma nota de rodapé.

A página de preços da API Gemini do Google é incomumente direta sobre isso. Para cada modelo com um nível gratuito, a página lista o que acontece com seu conteúdo. No nível gratuito, a linha diz "Conteúdo usado para melhorar nossos produtos." No nível pago do mesmo modelo, a mesma linha diz "Conteúdo não usado para melhorar nossos produtos." Mesmo modelo, mesmo endpoint, mesmo código — a única coisa que muda é se o Google pode manter o que você enviou.

A Mistral funciona da mesma forma com um padrão diferente. Na La Plateforme, os dados de entrada e saída são usados para treinar modelos, a menos que você opte por não participar, e os usuários do plano gratuito podem optar por não participar — é uma opção no menu Privacidade do Console de Administração e, uma vez confirmado, a Mistral para de usar suas entradas e saídas para treinamento. Os planos Team e Enterprise não estão no pool de treinamento de forma alguma.

Essa distinção importa mais do que parece. Muitos dos resumos que você encontrará afirmam categoricamente que o nível gratuito da Mistral exige que você aceite o treinamento. Isso era verdade em uma política anterior e não é verdade agora. Se você está avaliando com base em uma postagem de blog de seis meses atrás, você errará isso em ambas as direções — assumindo que um provedor é seguro quando não é, ou descartando um quando uma caixa de seleção teria resolvido.

A regra prática: se o prompt contiver qualquer coisa que você hesitaria em colar em um fórum público, o nível gratuito não é gratuito. Registros de clientes, código interno, textos de produtos não lançados, qualquer coisa sob um NDA — o custo de um nível gratuito nesse caso é um problema de governança de dados que você criou silenciosamente para outra pessoa encontrar.

Table titled 'What the free tier actually gives you' showing Groq's published free-plan limits — llama-3.1-8b-instant at 30 requests/min, 14,400 requests/day, 6,000 tokens/min, 500,000 tokens/day; llama-3.3-70b-versatile at 30 requests/min, 1,000 requests/day, 12,000 tokens/min, 100,000 tokens/day; whisper-large-v3 at 20 requests/min, 2,000 requests/day — alongside Google's free-tier Gemini model list and the pricing-page clause 'Content used to improve our products' on free versus 'not used' on paid.

Moeda dois: seu teto.

As camadas gratuitas são medidas em mais eixos do que as pessoas esperam, e você esbarra naquele que acaba primeiro. A Groq publica os limites do plano gratuito por modelo, e o formato é instrutivo:

Compare essas duas linhas de modelos entre si. Mesmas solicitações por minuto, mas o modelo maior oferece 1.000 solicitações por dia em vez de 14.400 — uma redução de quatorze vezes ao subir de nível em capacidade. E os limites se aplicam no nível da organização, não por usuário, então um segundo desenvolvedor na mesma conta não tem sua própria cota; ele consome a sua.

Um limite diário é o que mata projetos silenciosamente. 1.000 requisições por dia parece generoso até você aplicá-lo a algo real: um recurso de chat com 50 usuários, cada um com 20 interações, consome o seu dia inteiro. Um job em lote noturno que tenta novamente em caso de falha pode estourar o limite antes do café da manhã. Limites por minuto você pode contornar com uma fila na engenharia. Mas um teto diário, não — você só pode esperar a meia-noite.

O número que você precisa calcular antes de construir não é "existe um plano gratuito?", mas "qual é meu orçamento de requisições por dia por usuário, e quantos usuários isso suporta?" Se a resposta for menos de cem, você está construindo uma demonstração, e deve saber disso desde o início.

Moeda três: seu nível de modelo

O terceiro custo é aquele que molda o que você pode realmente construir: os modelos de fronteira não estão disponíveis nos planos gratuitos, e o fosso está aumentando.

O nível gratuito do Google agora cobre a classe Flash e os modelos de incorporação — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite e Gemini 2.0 Flash. A linha Pro não está incluída. Isso é uma redução deliberada: os modelos da série Pro foram movidos para acesso pago somente via API em 2026, e o nível gratuito passou a ser Flash e abaixo desde então.

Isto não é uma reclamação — os modelos de classe Flash em 2026 são genuinamente fortes, e para classificação, extração, roteamento, sumarização e a maior parte do trabalho de recuperação aumentada são a escolha correta, esteja você pagando ou não. Mas isso significa que um nível gratuito não pode responder à pergunta que você mais deseja responder durante a avaliação, que é"o modelo bom resolve meu caso difícil?" Você estará avaliando o modelo barato e inferindo para cima, e essa inferência é frequentemente errada em ambas as direções.

Aquele que é realmente gratuito por token

Existe uma categoria que os resumos costumam mencionar e raramente pensam a fundo: modelos de peso aberto que você mesmo executa. Baixe os pesos, sirva-os em seu próprio hardware, e o custo marginal por token é genuinamente zero. Sem limite de taxa, sem limite diário, sem cláusula de treinamento, sem nível — você é dono de tudo.

O que você fez foi mover o custo de um item de linha para uma linha de folha de pagamento. Alguém tem que dimensionar a GPU, escolher e ajustar a pilha de serviço, mantê-la corrigida, lidar com o chamado às 3 da manhã quando o throughput entrar em colapso e refazer tudo isso quando um checkpoint melhor chegar dois meses depois. Para uma equipe que já opera infraestrutura, essa pode ser a opção mais barata por uma ampla margem em volume. Para uma equipe de três pessoas lançando um produto, uma semana de engenheiro gasta em encanamento de inferência custa mais do que vários anos da conta da API que ela substituiu.

Auto-hospedagem é a resposta certa quando você tem volume, um requisito de privacidade que não admite outra solução, ou uma equipe de plataforma existente. É a resposta errada quando o que você realmente precisava era parar de pensar em inferência.

Decision guide titled 'Which free option fits', mapping four situations to approaches: prototyping with non-sensitive data to taking the vendor free tiers; sensitive data to not using a free tier that trains on inputs; high volume to self-hosting open weights; shipping to production to asking cost per token and outage behaviour instead of what is free.

O custo que ninguém coloca na mesa: níveis gratuitos não se compõem

Aqui está o modo de falha que realmente custa tempo às equipes, e ele vem de seguir à risca o conselho do nível gratuito.

Você segue o caminho sensato. O nível gratuito do Google para o trabalho da classe Flash. O nível gratuito de um provedor diferente para inferência rápida de pesos abertos. Um terceiro para fala. Cada um é genuinamente gratuito, cada um foi uma boa decisão individual. Seis semanas depois, você está segurando três chaves de API, três SDKs, três regimes de limite de taxa, três relações de cobrança e três comportamentos de falha diferentes — e sua lógica de repetição, sua observabilidade e sua contabilidade de custos precisam entender todos eles.

Então um deles muda. Um provedor restringe seu plano gratuito — como aconteceu quando os modelos da classe Pro passaram a ser somente pagos. Seu caminho de fallback nunca foi testado porque nunca foi acionado. A migração que você está fazendo agora não é uma mudança de configuração; é uma refatoração da camada que você construiu para mascarar as diferenças, e você está fazendo isso sob pressão de tempo porque a coisa já está em produção.

O nível gratuito era gratuito. O lock-in que você acumulou para obtê-lo não era gratuito. Esta é a verdadeira razão para se importar se sua camada de acesso é portável: não ideologia sobre neutralidade de fornecedores, mas o fato de que os níveis gratuitos são a parte mais volátil da oferta de qualquer provedor, e construir diretamente contra três deles garante que você vai migrar algo dentro do ano.

O que realmente fazer

Se você está prototipando e os dados não são sensíveis — aproveite os níveis gratuitos dos fornecedores, e aproveite-os sem culpa. Eles existem exatamente para isso. Escreva a integração por trás de uma interface própria desde o primeiro dia, para que trocar o provedor seja uma mudança de configuração e não uma refatoração.

Se os dados forem sensíveis — não use um plano gratuito que treine com seus dados. Ou pague pelo plano em que o fornecedor, por contrato, não o faz (o Google é explícito sobre isso na distinção entre versão gratuita e paga), desative o treinamento onde o provedor permitir no plano gratuito, ou faça self-hosting. Não existe uma quarta opção, e descobrir isso depois do lançamento é consideravelmente mais caro do que a conta da API que você estava evitando.

Se você está avaliando modelos uns contra os outros — o nível gratuito vai enganá-lo, porque não contém os modelos que você enviaria. Avalie no nível que você pretende usar em produção, com seus próprios prompts. O custo de uma avaliação adequada é de alguns dólares; o custo de escolher errado é o trimestre.

Se você for para produção — a pergunta deixa de ser "o que é gratuito" e passa a ser "qual é o custo por token, e o que acontece quando este provedor fica fora do ar." Essas são perguntas diferentes com respostas diferentes, e um plano gratuito não responde a nenhuma delas.

Onde o OrcaRouter se encaixa

A OrcaRouter executa um conjunto rotativo de modelos de IA gratuitos invocáveis a$0 por token, juntamente comcréditos gratuitos de API provenientes de distribuições abertas de vouchers, programas para estudantes e hackathons de parceiros. Criar uma conta e resgatar uma oferta aberta não exige método de pagamento; a lista de modelos gratuitos muda conforme novos modelos de pesos abertos e promocionais surgem, e o crédito promocional de um voucher ou hackathon normalmente pode ser gasto em todo o catálogo, em vez de ser limitado aos modelos gratuitos.

A parte que importa para o problema descrito acima é o que acontece em seguida. Tudo passa por um endpoint compatível com OpenAI, então o modelo gratuito com o qual você prototipa e o modelo de fronteira com o qual você publica são a mesma integração — uma alteração de string no campo do modelo, não uma migração. Quando um nível gratuito é reduzido ou um modelo é descontinuado, você altera um ID de modelo. Quando você precisa comparar Gemini 3.6 Flash com DeepSeek V4 Flash em seus próprios prompts, você faz isso sem se cadastrar em nada novo.

Essa é a proposta honesta para um roteador em um artigo sobre APIs gratuitas: não que sejamos mais baratos do que grátis, mas que as camadas gratuitas são a coisa mais volátil contra a qual você pode construir, e o custo dessa volatilidade é o que vale a pena eliminar no design.

Screenshot of the OrcaRouter offers page at www.orcarouter.ai/offers in English, headlined 'Free AI API credits & free AI models' with the subtitle about claiming credits from live voucher drops, student programs and partner hackathons then calling a rotating set of free AI models at $0, plus live counters for hackathons, credit drops and top deposit match.

A versão curta

APIs de LLM gratuitas em 2026 são reais, úteis e valem a pena — para prototipagem, para cargas de trabalho não sensíveis, para aprendizado e para a grande classe de tarefas que um modelo da classe Flash lida perfeitamente bem. Elas não são uma estratégia de produção, e também não são gratuitas.

Antes de construir sobre um, obtenha três respostas por escrito da própria documentação do provedor, em vez de um resumo: este nível treina com meus dados, qual é o meu limite de requisições por dia e o modelo que eu realmente colocaria em produção está disponível aqui? Se você conseguir responder às três e ainda gostar do negócio, aceite. Se não conseguir respondê-las, você não precificou — você apenas viu o número zero e parou de ler.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente