Card del titolo hero che riporta 'API LLM gratuite nel 2026' con il sottotitolo 'Cosa è davvero gratuito — e cosa paghi al suo posto', mostrando tre card sotto l'intestazione LE TRE VALUTE: I TUOI DATI (i livelli gratuiti potrebbero addestrarsi su di essi), IL TUO TETTO (le richieste giornaliere si esauriscono) e IL TUO LIVELLO (i modelli all'avanguardia sono solo a pagamento).
Guides & Insights

API LLM gratuite nel 2026: cosa è davvero gratuito e cosa paghi invece

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Cerca un'API LLM gratuita e ottieni un elenco. Tredici provider, quindici provider, una tabella di loghi, una colonna di spunte verdi. Ciò che quasi nessuno di questi elenchi ti dice è la parte che decide se il livello gratuito ti è utile: ogni API LLM gratuita ti fa pagare in qualcosa. Solo che non è contante.

Esistono tre valute. Paghi con i tuoi dati, paghi con il tuo tetto, oppure paghi con il livello del tuo modello — e di solito tutte e tre insieme. Questo articolo le esamina una per una usando la documentazione ufficiale dei provider, non una tabella di seconda mano, e poi risponde alla domanda che quegli elenchi saltano: cosa succede quando il livello gratuito finisce.

Valuta uno: i tuoi dati.

Questo è quello che dovrebbe decidere la questione per la maggior parte dei team, ed è quello che ottiene tutt'al più una nota a piè di pagina.

La pagina dei prezzi dell'API Gemini di Google è insolitamente diretta al riguardo. Per ogni modello con un piano gratuito, la pagina elenca cosa succede ai tuoi contenuti. Nel piano gratuito la riga recita "Contenuti utilizzati per migliorare i nostri prodotti." Nel piano a pagamento dello stesso modello, la stessa riga recita "Contenuti non utilizzati per migliorare i nostri prodotti." Stesso modello, stesso endpoint, stesso codice: l'unica cosa che cambia è se Google può conservare ciò che hai inviato.

Mistral funziona allo stesso modo con un'impostazione predefinita diversa. Su La Plateforme, i dati di input e output vengono utilizzati per addestrare i modelli a meno che tu non rinunci, e gli utenti del piano gratuito possono rinunciare — è un interruttore nel menu Privacy della Console di amministrazione e, una volta confermato, Mistral smette di utilizzare i tuoi input e output per l'addestramento. I piani Team e Enterprise non sono affatto nel pool di addestramento.

Questa distinzione conta più di quanto sembri. Molte delle rassegne che troverai affermano chiaramente che il livello gratuito di Mistral richiede di accettare l'addestramento. Questo era vero in una politica precedente, ma ora non lo è più. Se stai valutando sulla base di un post di sei mesi fa, sbaglierai in entrambe le direzioni — supporre che un provider sia sicuro quando non lo è, o escluderlo quando una casella di spunta avrebbe risolto il problema.

La regola pratica: se il prompt contiene qualcosa che esiteresti a incollare in un forum pubblico, il livello gratuito non è gratuito. Registri dei clienti, codice interno, testi di prodotti non ancora pubblicati, qualsiasi cosa coperta da un NDA — il costo di un livello gratuito, in quel caso, è un problema di governance dei dati che hai silenziosamente creato e che qualcun altro scoprirà.

Table titled 'What the free tier actually gives you' showing Groq's published free-plan limits — llama-3.1-8b-instant at 30 requests/min, 14,400 requests/day, 6,000 tokens/min, 500,000 tokens/day; llama-3.3-70b-versatile at 30 requests/min, 1,000 requests/day, 12,000 tokens/min, 100,000 tokens/day; whisper-large-v3 at 20 requests/min, 2,000 requests/day — alongside Google's free-tier Gemini model list and the pricing-page clause 'Content used to improve our products' on free versus 'not used' on paid.

Valuta due: il tuo massimale

I livelli gratuiti sono misurati su più assi di quanto ci si aspetti, e si raggiunge quello che si esaurisce per primo. Groq pubblica i limiti del suo piano gratuito per modello, e la struttura è istruttiva:

Confronta queste due righe di modelli tra loro. Stesse richieste al minuto, ma il modello più grande ti offre 1.000 richieste al giorno invece di 14.400 — una riduzione di quattordici volte per passare a una capacità superiore. E i limiti si applicano a livello di organizzazione, non per utente, quindi un secondo sviluppatore sullo stesso account non ha una propria quota; intacca la tua.

Il limite giornaliero è quello che uccide silenziosamente i progetti. 1.000 richieste al giorno sembrano generose finché non le leghi a qualcosa di reale: una chat con 50 utenti a 20 turni ciascuno è l'intera tua giornata. Un job batch notturno che riprova in caso di errore può bruciare il limite prima di colazione. I rate limit al minuto puoi aggirarli con una coda. Un tetto giornaliero no — puoi solo aspettare mezzanotte.

Il numero da calcolare prima di costruire non è "esiste un livello gratuito" ma "qual è il mio budget di richieste al giorno per utente, e quanti utenti supporta?" Se la risposta è sotto il centinaio, stai costruendo una demo e dovresti saperlo fin dall'inizio.

Valuta tre: il tuo livello di modello

Il terzo costo è quello che determina ciò che puoi effettivamente costruire: i modelli all'avanguardia non sono inclusi nei livelli gratuiti, e il divario si sta ampliando.

Il piano gratuito di Google ora copre la classe Flash e i modelli di embedding — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite e Gemini 2.0 Flash. La linea Pro non è inclusa. È una restrizione deliberata: i modelli della serie Pro sono stati resi solo a pagamento per l'accesso API nel 2026, e da allora il piano gratuito include solo Flash e modelli inferiori.

Questa non è una lamentela: i modelli di classe Flash nel 2026 sono davvero validi, e per classificazione, estrazione, instradamento, sintesi e la maggior parte del lavoro basato su retrieval aumentato sono la scelta giusta, che tu stia pagando o meno. Ma questo significa che un livello gratuito non può rispondere alla domanda a cui più desideri una risposta durante la valutazione, ovvero "il modello buono risolve il mio caso difficile?" Valuterai il modello economico e farai un'inferenza verso l'alto, e quell'inferenza è spesso sbagliata in entrambe le direzioni.

Quello che è davvero gratuito per token.

C'è una categoria che i riepiloghi di solito citano ma su cui raramente riflettono a fondo: i modelli open-weight che esegui tu stesso. Scarica i pesi, servili sul tuo hardware e il costo marginale per token è davvero zero. Nessun limite di richieste, nessun tetto giornaliero, nessuna clausola di addestramento, nessun livello — possiedi tutto.

Quello che hai fatto è spostare il costo da una voce di spesa a una voce di libro paga. Qualcuno deve dimensionare la GPU, scegliere e mettere a punto lo stack di serving, tenerlo aggiornato con le patch, gestire la chiamata alle 3 di notte quando il throughput crolla, e rifare tutto da capo quando due mesi dopo arriva un checkpoint migliore. Per un team che gestisce già infrastruttura, questa può essere l'opzione più economica con un ampio margine su volumi elevati. Per un team di tre persone che sta lanciando un prodotto, una settimana di lavoro di un ingegnere spesa per la messa a punto dell'inferenza costa più di diversi anni della fattura API che ha sostituito.

Il self-hosting è la risposta giusta quando hai volumi elevati, un requisito di privacy che non ammette altre soluzioni, o un team di piattaforma esistente. È la risposta sbagliata quando ciò di cui avevi realmente bisogno era smettere di pensare all'inferenza.

Decision guide titled 'Which free option fits', mapping four situations to approaches: prototyping with non-sensitive data to taking the vendor free tiers; sensitive data to not using a free tier that trains on inputs; high volume to self-hosting open weights; shipping to production to asking cost per token and outage behaviour instead of what is free.

Il costo che nessuno mette in tabella: i tier gratuiti non si compongono

Ecco la modalità di fallimento che in realtà costa tempo ai team, e deriva dal seguire troppo alla lettera il consiglio sul livello gratuito.

Prendi la strada più sensata. Il livello gratuito di Google per il lavoro di classe Flash. Il livello gratuito di un altro provider per l'inferenza open-weight veloce. Un terzo per il parlato. Ognuno è davvero gratuito, ognuno è stato una buona decisione individuale. Sei settimane dopo ti ritrovi con tre chiavi API, tre SDK, tre regimi di rate limit, tre rapporti di fatturazione e tre diversi comportamenti di errore — e la tua logica di retry, la tua osservabilità e la tua contabilità dei costi devono comprenderli tutti.

Poi uno di loro cambia. Un provider restringe il suo piano gratuito — come è successo quando i modelli di classe Pro sono passati al solo pagamento. Il tuo percorso di fallback non è mai stato testato perché non si è mai attivato. La migrazione che stai facendo ora non è un cambiamento di configurazione; è un refactoring del livello che hai costruito per mascherare le differenze, e la stai facendo sotto pressione perché il sistema è già in produzione.

Il livello gratuito era gratuito. Il lock-in che hai accumulato per ottenerlo non lo era. Questa è la vera ragione per cui dovrebbe importarti se il tuo strato di accesso è portabile: non ideologia sulla neutralità del fornitore, ma il fatto che i livelli gratuiti sono la parte più volatile dell'offerta di qualsiasi provider, e costruire direttamente su tre di essi garantisce che migrerai qualcosa entro l'anno.

Cosa fare concretamente

Se stai prototipando e i dati non sono sensibili — approfitta dei livelli gratuiti dei fornitori, e fallo senza sensi di colpa. Esistono proprio per questo. Scrivi l'integrazione dietro un'interfaccia tua fin dal primo giorno, così che cambiare fornitore sia una modifica di configurazione e non un refactoring.

Se i dati sono sensibili — non utilizzare un piano gratuito che si addestra sui tuoi input. O paga per il piano in cui il fornitore contrattualmente non lo fa (la distinzione tra piano gratuito e a pagamento di Google è esplicita al riguardo), disattiva l'addestramento dove il fornitore lo consente nel piano gratuito, oppure auto-ospita. Non esiste una quarta opzione, e scoprirlo dopo il lancio è notevolmente più costoso della fattura API che stavi evitando.

Se stai valutando modelli l'uno contro l'altro — il livello gratuito ti trarrà in inganno, perché non contiene i modelli che metteresti in produzione. Valuta sul livello che intendi utilizzare in produzione, con i tuoi prompt. Il costo di una valutazione corretta è di pochi dollari; il costo di scegliere male è il trimestre.

Se vai in produzione — la domanda non è più "cos'è gratuito" ma diventa "qual è il costo per token, e cosa succede quando questo provider ha un'interruzione." Sono domande diverse con risposte diverse, e un piano gratuito non risponde a nessuna delle due.

Dove si inserisce OrcaRouter

OrcaRouter gestisce una serie rotante di modelli di IA gratuiti chiamabili a $0 per token, insieme a crediti API gratuiti da drop di voucher aperti, programmi per studenti e hackathon dei partner. La creazione di un account e la richiesta di un'offerta aperta non richiedono alcun metodo di pagamento; la selezione di modelli gratuiti cambia man mano che arrivano nuovi modelli open-weight e promozionali, e il credito promozionale da un voucher o hackathon è normalmente spendibile sull'intero catalogo piuttosto che essere limitato ai modelli gratuiti.

La parte che conta per il problema descritto sopra è ciò che accade dopo. Tutto passa attraverso un endpoint compatibile con OpenAI, quindi il modello gratuito su cui fai il prototipo e il modello all'avanguardia su cui pubblichi sono la stessa integrazione — un cambio di stringa nel campo del modello, non una migrazione. Quando un livello gratuito si restringe o un modello viene deprecato, cambi un ID di modello. Quando devi confrontare Gemini 3.6 Flash con DeepSeek V4 Flash sui tuoi prompt, lo fai senza registrarti a nulla di nuovo.

Questo è il discorso onesto a favore di un router in un articolo sulle API gratuite: non che siamo più economici del gratuito, ma che i tier gratuiti sono la cosa più volatile su cui puoi costruire, e il costo di quella volatilità è ciò che vale la pena eliminare in fase di progettazione.

Screenshot of the OrcaRouter offers page at www.orcarouter.ai/offers in English, headlined 'Free AI API credits & free AI models' with the subtitle about claiming credits from live voucher drops, student programs and partner hackathons then calling a rotating set of free AI models at $0, plus live counters for hackathons, credit drops and top deposit match.

La versione breve

Le API LLM gratuite nel 2026 sono reali, utili e meritano di essere usate — per la prototipazione, per carichi di lavoro non sensibili, per l'apprendimento e per l'ampia classe di attività che un modello di classe Flash gestisce perfettamente. Non sono una strategia di produzione, e non sono gratuite.

Prima di basarti su uno, ottieni tre risposte per iscritto dalla documentazione del provider stesso, invece che da un riepilogo: questo livello usa i miei dati per l'addestramento, qual è il mio tetto massimo di richieste al giorno e il modello che rilascierei davvero è persino disponibile qui? Se riesci a rispondere a tutte e tre e l'offerta ti piace comunque, accettala. Se non riesci a rispondere, non ne hai calcolato il prezzo: hai solo visto il numero zero e hai smesso di leggere.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno