Tarjeta de título principal que dice 'APIs LLM gratuitas en 2026', con el subtítulo 'Lo que de verdad es gratis — y qué pagas a cambio', mostrando tres tarjetas bajo el encabezado LAS TRES MONEDAS: TUS DATOS (los planes gratuitos pueden entrenar con ellos), TU LÍMITE (las solicitudes diarias se agotan) y TU NIVEL (los modelos de vanguardia son solo de pago).
Guides & Insights

APIs de LLM gratuitas en 2026: Qué es realmente gratis y con qué pagas en su lugar

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Busca una API de LLM gratuita y obtienes una lista. Trece proveedores, quince proveedores, una tabla de logotipos, una columna de marcas verdes. Lo que casi ninguna de esas listas te dice es la parte que decide si el nivel gratuito te sirve de algo: toda API de LLM gratuita te cobra en algo. Simplemente no es dinero.

Hay tres monedas de cambio. Pagas con tus datos, pagas con tu límite, o pagas con tu nivel de modelo — y normalmente las tres a la vez. Este artículo revisa cada una con la documentación propia de los proveedores, no una tabla de segunda mano, y luego responde la pregunta que esas listas omiten: ¿qué sucede cuando se agota el nivel gratuito?

Moneda uno: tus datos

Esta es la que debería decidir la cuestión para la mayoría de los equipos, y es la que, en el mejor de los casos, recibe una nota al pie.

La página de precios de la API Gemini de Google es inusualmente directa al respecto. Para cada modelo con un nivel gratuito, la página indica lo que ocurre con tu contenido. En el nivel gratuito, la línea dice: "Contenido utilizado para mejorar nuestros productos." En el nivel de pago del mismo modelo, la misma línea dice: "Contenido no utilizado para mejorar nuestros productos." Mismo modelo, mismo endpoint, mismo código — lo único que cambia es si Google se queda con lo que enviaste.

Mistral funciona de la misma manera con un valor predeterminado diferente. En La Plateforme, los datos de entrada y salida se utilizan para entrenar modelos a menos que optes por no participar, y los usuarios del plan gratuito pueden optar por no participar — es un interruptor en el menú de Privacidad de la Consola de Administración y, una vez confirmado, Mistral deja de usar tus entradas y salidas para el entrenamiento. Los planes Team y Enterprise no están en el grupo de entrenamiento en absoluto.

Esa distinción importa más de lo que parece. Muchas de las recopilaciones que encontrarás afirman categóricamente que el nivel gratuito de Mistral requiere que aceptes el entrenamiento. Eso era cierto en una política anterior y ya no lo es. Si estás evaluando basándote en una publicación de blog de hace seis meses, te equivocarás en ambos sentidos: asumir que un proveedor es seguro cuando no lo es, o descartarlo cuando una casilla lo habría resuelto.

La regla práctica: si el prompt contiene algo que dudarías en pegar en un foro público, el nivel gratuito no es gratuito. Registros de clientes, código interno, textos de productos no publicados, cualquier cosa bajo un NDA — el costo de un nivel gratuito ahí es un problema de gobernanza de datos que has creado en silencio para que otro lo encuentre.

Table titled 'What the free tier actually gives you' showing Groq's published free-plan limits — llama-3.1-8b-instant at 30 requests/min, 14,400 requests/day, 6,000 tokens/min, 500,000 tokens/day; llama-3.3-70b-versatile at 30 requests/min, 1,000 requests/day, 12,000 tokens/min, 100,000 tokens/day; whisper-large-v3 at 20 requests/min, 2,000 requests/day — alongside Google's free-tier Gemini model list and the pricing-page clause 'Content used to improve our products' on free versus 'not used' on paid.

Moneda dos: tu techo

Los niveles gratuitos se miden en más ejes de lo que la gente espera, y te topas con el que se agote primero. Groq publica los límites de su plan gratuito por modelo, y la forma es instructiva:

Compara esas dos filas de modelos entre sí. Las mismas solicitudes por minuto, pero el modelo más grande te da 1,000 solicitudes al día en lugar de 14,400 — una reducción de catorce veces por mejorar la capacidad. Y los límites se aplican a nivel de organización, no por usuario, así que un segundo desarrollador en la misma cuenta no obtiene su propia cuota; consume la tuya.

Un límite diario es el que mata proyectos silenciosamente. 1,000 solicitudes al día suena generoso hasta que lo conectas con algo real: una función de chat con 50 usuarios a 20 turnos cada uno es todo tu día. Un trabajo por lotes nocturno que reintenta en caso de error puede agotar el límite antes del desayuno. Los límites de tasa por minuto se pueden sortear con una cola. Un tope diario no — solo puedes esperar a la medianoche.

El número que debes calcular antes de construir no es «¿hay un nivel gratuito?» sino «¿cuál es mi presupuesto de solicitudes por día por usuario, y a cuántos usuarios alcanza?» Si la respuesta es menos de cien, estás construyendo una demo y debes saberlo desde el principio.

Moneda tres: tu nivel de modelo

El tercer costo es el que da forma a lo que realmente puedes construir: los modelos de frontera no están en los niveles gratuitos, y la brecha se está ampliando.

El nivel gratuito de Google ahora cubre la clase Flash y los modelos de incrustación — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite y Gemini 2.0 Flash. La línea Pro no está incluida. Es una reducción deliberada: los modelos de la serie Pro pasaron a ser solo de pago para el acceso por API en 2026, y desde entonces el nivel gratuito ha sido Flash e inferiores.

Esto no es una queja — los modelos de clase Flash en 2026 son realmente sólidos, y para clasificación, extracción, enrutamiento, resumen y la mayoría del trabajo aumentado por recuperación son la opción correcta, pagues o no. Pero sí significa que un nivel gratuito no puede responder la pregunta que más quieres que se responda durante la evaluación, que es "¿resuelve el buen modelo mi caso difícil?" Estarás evaluando el modelo barato e infiriendo hacia arriba, y esa inferencia es frecuentemente errónea en ambas direcciones.

El que realmente es gratis por token

Existe una categoría que los resúmenes suelen mencionar y rara vez analizan a fondo: modelos de peso abierto que ejecutas tú mismo. Descarga los pesos, sírvelos en tu propio hardware y el costo marginal por token es realmente cero. Sin límite de peticiones, sin tope diario, sin cláusula de entrenamiento, sin niveles — eres dueño de todo.

Lo que has hecho es mover el costo de una partida presupuestaria a una línea de nómina. Alguien tiene que dimensionar la GPU, elegir y ajustar la pila de servidores, mantenerla actualizada, atender la llamada a las 3 a.m. cuando el rendimiento se desploma, y rehacer todo cuando un mejor checkpoint llega dos meses después. Para un equipo que ya gestiona infraestructura, esa puede ser la opción más barata por un amplio margen a escala. Para un equipo de tres personas lanzando un producto, una semana de ingeniero dedicada a la plomería de inferencia cuesta más que varios años de la factura de la API que reemplaza.

El autohospedaje es la respuesta correcta cuando tienes volumen, un requisito de privacidad que no admite otra solución, o un equipo de plataforma existente. Es la respuesta equivocada cuando lo que realmente necesitabas era dejar de pensar en la inferencia.

Decision guide titled 'Which free option fits', mapping four situations to approaches: prototyping with non-sensitive data to taking the vendor free tiers; sensitive data to not using a free tier that trains on inputs; high volume to self-hosting open weights; shipping to production to asking cost per token and outage behaviour instead of what is free.

El costo que nadie pone sobre la mesa: los niveles gratuitos no se componen.

Este es el modo de fallo que realmente cuesta tiempo a los equipos, y proviene de seguir demasiado bien el consejo del nivel gratuito.

Tomas el camino sensato. El nivel gratuito de Google para el trabajo de clase Flash. El nivel gratuito de otro proveedor para inferencia rápida de pesos abiertos. Un tercero para voz. Cada uno es genuinamente gratuito, cada uno fue una buena decisión individual. Seis semanas después tienes en tus manos tres claves de API, tres SDK, tres regímenes de límites de tasa, tres relaciones de facturación y tres comportamientos de fallo diferentes — y tu lógica de reintentos, tu observabilidad y tu contabilidad de costos tienen que entenderlos todos.

Entonces uno de ellos cambia. Un proveedor reduce su nivel gratuito — como ocurrió cuando los modelos de clase Pro pasaron a ser solo de pago. Tu ruta de respaldo nunca se probó porque nunca se disparó. La migración que estás haciendo ahora no es un cambio de configuración; es una refactorización de la capa que construiste para disimular las diferencias, y la estás haciendo bajo presión de tiempo porque el sistema ya está en producción.

El nivel gratuito era gratuito. El bloqueo que acumulaste para obtenerlo no lo era. Esta es la razón real para preocuparte de si tu capa de acceso es portable: no ideología sobre neutralidad de proveedores, sino el hecho de que los niveles gratuitos son la parte más volátil de la oferta de cualquier proveedor, y construir directamente sobre tres de ellos garantiza que migrarás algo antes de que termine el año.

Qué hacer realmente

Si estás creando un prototipo y los datos no son sensibles — aprovecha los niveles gratuitos de los proveedores, y aprovéchalos sin culpa. Existen precisamente para esto. Escribe la integración detrás de una interfaz propia desde el primer día, de modo que cambiar de proveedor sea un cambio de configuración y no una refactorización.

Si los datos son confidenciales — no utilice un plan gratuito que entrene con sus datos. O pague por el plan en el que el proveedor, por contrato, no lo hace (la distinción de Google entre el plan gratuito y el de pago es explícita al respecto), desactive el entrenamiento donde el proveedor lo permita en el plan gratuito, o alójelo usted mismo. No hay una cuarta opción, y descubrir esto después del lanzamiento es considerablemente más caro que la factura de la API que estaba evitando.

Si estás evaluando modelos entre sí — el nivel gratuito te engañará, porque no contiene los modelos que usarías en producción. Evalúa en el nivel que piensas usar en producción, con tus propias indicaciones. El costo de una evaluación adecuada es de unos pocos dólares; el costo de elegir mal es un trimestre.

Si vas a producción — la pregunta deja de ser «qué es gratis» y se convierte en «cuál es el costo por token y qué sucede cuando este proveedor tiene una caída». Esas son preguntas diferentes con respuestas diferentes, y un nivel gratuito no responde ninguna de las dos.

Dónde encaja OrcaRouter

OrcaRouter ofrece una selección rotativa de modelos de IA gratuitos invocables a $0 por token, junto con créditos gratuitos de API de lanzamientos abiertos de vales, programas estudiantiles y hackatones de socios. Crear una cuenta y reclamar una oferta abierta no requiere método de pago; la lista de modelos gratuitos cambia a medida que llegan nuevos modelos de peso abierto y promocionales, y el crédito promocional de un vale o hackatón normalmente se puede gastar en todo el catálogo en lugar de limitarse a los modelos gratuitos.

La parte que importa para el problema descrito arriba es lo que sucede después. Todo pasa por un endpoint compatible con OpenAI, así que el modelo gratuito con el que haces prototipos y el modelo de frontera con el que lanzas son la misma integración: un cambio de cadena en el campo de modelo, no una migración. Cuando un nivel gratuito se reduce o un modelo se deprecia, cambias un ID de modelo. Cuando necesitas comparar Gemini 3.6 Flash contra DeepSeek V4 Flash con tus propios prompts, lo haces sin registrarte en nada nuevo.

Ese es el argumento honesto a favor de un router en un artículo sobre APIs gratuitas: no es que seamos más baratos que gratis, sino que los niveles gratuitos son lo más volátil sobre lo que puedes construir, y el costo de esa volatilidad es lo que vale la pena eliminar mediante el diseño.

Screenshot of the OrcaRouter offers page at www.orcarouter.ai/offers in English, headlined 'Free AI API credits & free AI models' with the subtitle about claiming credits from live voucher drops, student programs and partner hackathons then calling a rotating set of free AI models at $0, plus live counters for hackathons, credit drops and top deposit match.

La versión corta

Las API de LLM gratuitas en 2026 son reales, útiles y vale la pena usarlas — para prototipos, para cargas de trabajo no sensibles, para aprender, y para la gran clase de tareas que un modelo de clase Flash maneja perfectamente bien. No son una estrategia de producción, y no son gratuitas.

Antes de construir sobre uno, obtén tres respuestas por escrito de la documentación del propio proveedor, no de un resumen: ¿este nivel entrena con mis datos, cuál es mi límite de solicitudes por día y el modelo que realmente voy a implementar está siquiera disponible aquí? Si puedes responder las tres y aún así te gusta el trato, acéptalo. Si no puedes responderlas, no has calculado el precio — solo has visto el número cero y has dejado de leer.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario