
API gratuita de Qwen 3.8 27B: Aún no — Qué ejecutar en su lugar
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
No — a fecha de 12 de agosto de 2026 no existe una API gratuita de Qwen3.8-27B, ni tampoco una de pago. El modelo fue anunciado el 3 de agosto con los pesos abiertos prometidos a Hugging Face y ModelScope «la semana del 10 de agosto», pero la organización oficial de Qwen aún no tiene ningún repositorio de Qwen3.8. Hasta que se publiquen los pesos, nadie puede alojar Qwen3.8-27B, así que «gratis» es irrelevante. Estas son las tres vías para acceder gratis una vez que los pesos estén disponibles (y lo que realmente cuesta cada una), además de los modelos que puedes ejecutar gratis localmente hoy.
Todavía no hay API gratuita — los pesos son la puerta de entrada.
Alibaba anunció la familia Qwen3.8 el 3 de agosto de 2026: el Qwen3.8-Max con 2,4 billones de parámetros (aproximadamente 95 mil millones de parámetros activos, un contexto de 1 millón de tokens, con un precio de $2 por millón de tokens de entrada y $6 por millón de tokens de salida en Alibaba Cloud Model Studio) y el Qwen3.8-27B, denso y de una sola máquina. Ambos se prometieron con pesos abiertos en Hugging Face y ModelScope esa misma semana.
Esa promesa ya lleva dos días de retraso. Revisé Hugging Face directamente el 12 de agosto: la organización oficial Qwen no tiene ningún repositorio Qwen3.8 de ningún tipo. Los repositorios Qwen3.8-27B-GGUF, -FP8, -NVFP4A16 y -NInfer que aparecen en la búsqueda de modelos son tarjetas de marcador de posición: cero archivos de peso, conteos de descargas de un solo dígito, tarjetas de modelo que literalmente dicen "reservado antes del lanzamiento de Qwen/Qwen3.8-27B". No los trates como evidencia de que el modelo existe; trátalos como personas reservando espacios de estacionamiento.
Dos cosas que no se pueden asumir. Primero, la licencia: no se ha nombrado ninguna para Qwen3.8-27B. Los pesos abiertos recientes de Qwen se han distribuido bajo la licencia Tongyi Qianwen, cuya cláusula de 100 millones de usuarios activos mensuales desencadena conversaciones sobre licencias comerciales a gran escala — Apache 2.0 no es un valor predeterminado seguro. Segundo, las especificaciones: Alibaba no ha publicado ninguna tabla de rendimiento, ventana de contexto ni requisito de hardware confirmado para el 27B. Todo lo que se repite hoy sobre él es una proyección.
Repasamos la lista de verificación previa al lanzamiento — qué está confirmado, qué es rumor, qué revisar antes de descargar — en Qwen3.8-27B Open Weights: What We Know Before the Drop. Este artículo es la parte que esa pieza no cubrió: cómo funcionará realmente lo de "gratis" una vez que el modelo se publique.
Después de que caigan los pesos: tres rutas hacia la libertad, y lo que realmente cuesta cada una
"Gratis" nunca es gratis. Las tres vías para obtener un Qwen3.8-27B gratuito trasladan el costo a algún lado; la diferencia es dónde aterriza. El 27B es un modelo denso — cada uno de sus ~27 mil millones de parámetros está activo en cada token — así que los costos a continuación se refieren a hardware real, no a marketing.

Ruta 1: Ejecútalo tú mismo — gratis en efectivo, con el precio en hardware
La única ruta donde «gratis» se vuelve literalmente cierto después de comprar el hardware. El cofundador de Unsloth, Daniel Han, espera que el 27B funcione con unos 17 GB de VRAM cuando se lance — un objetivo, no una especificación confirmada. Usando la escalera de cuantización medida de Qwen3.6-27B como referencia: Q4_K_M ronda los 16 GB, Q6_K los 21 GB, FP8 los 27 GB y BF16 completo los 54–56 GB. El mínimo realista hoy en día es una tarjeta de 24 GB — RTX 3090, RTX 4090 o clase A6000 — con Q4.
El momento es importante: los pesos oficiales con vLLM o SGLang suelen funcionar a los pocos días de su lanzamiento, pero las cuantizaciones comunitarias GGUF y AWQ llegan con una o dos semanas de retraso, por lo que un «descargar y ejecutar» al estilo Ollama no estará disponible el día del lanzamiento. Los costos ocultos son la electricidad, una máquina silenciosa y tu tiempo. La ventaja es la privacidad —nada sale de tu equipo— y un costo marginal de cero que se acumula si también usas la GPU para otros modelos.
Ruta 2: Planes gratuitos alojados — gratis en dinero, con precio en límites
Una vez publicados los pesos, espera una cuota de evaluación de Alibaba Cloud y niveles gratuitos de los hosts serverless habituales. El patrón que cabe esperar es el que Alibaba ya aplica para Qwen3.8-Max: una cuota de 1M de tokens para usuarios nuevos, solo en la región de Singapur, válida durante 90 días, sin acumulación — y los tokens de razonamiento se facturan como salida, así que un modelo que razona por defecto puede consumir toda la asignación en un fin de semana de prototipado. Lo que realmente pagas son límites de tasa, un bloqueo regional, una fecha de caducidad y que tus prompts vayan a un tercero. Un nivel gratuito es una rampa para evaluar el modelo, no un lugar para desplegarlo.
Ruta 3: el nivel gratuito de OrcaRouter — planificado, no activo
Debido a que la consulta de búsqueda es literalmente "gratis", vamos a ser explícitos: OrcaRouter planea un nivel gratuito para Qwen3.8-27B una vez que se publiquen los pesos. No está activo. No hay un endpoint al que llamar, y no voy a pegar un ejemplo de marcador de posición. Lo anunciaremos cuando haya algo que anunciar. Lo que sí alojamos hoy es Qwen3.8-Max a $2/$6 por 1M de tokens sin margen de beneficio — y el 27B no está en la plataforma, porque nadie puede servirlo todavía.
Lo que puedes usar gratis ahora mismo
Si tu necesidad es "un modelo abierto de clase 27B que pueda ejecutar sin pagar," no tienes que esperar. La respuesta honesta del mismo nivel es Qwen3.6-27B, el predecesor directo del modelo que estás esperando.

Qwen3.6-27B es Apache 2.0, un modelo denso de 27.8B con contexto de 262K y entrada nativa de texto, imagen y video. Un GGUF Q4_K_M ocupa unos 16.5GB y funciona a aproximadamente 25 tokens por segundo en una GPU de consumo de 24GB (16–18 tokens por segundo en un M4 Max). Cifras reportadas por el proveedor en su ficha del modelo: SWE-Bench Verified 77.2, MMLU-Pro 86.2, AIME 2026 94.1, GPQA Diamond 87.8 y MMMU 82.9. Si Qwen3.8-27B es "un 27B", este es el 27B que puedes tocar hoy mismo — misma familia, mismo diseño denso, ya abierto.
Nemotron 3.5 Lightning 30B A3B es una forma diferente, también gratuita: lanzado el 11 de agosto de 2026 bajo la licencia OpenMDW 1.1 de NVIDIA. Es un modelo Mezcla de Expertos (MoE) de 30B en total y ~3B activos, con una arquitectura híbrida Mamba-2 y hasta 1M de contexto. Los checkpoints NVFP4 pesan unos 21.6 GB y un GGUF Q4 unos 25 GB. Necesita una tarjeta de 24 GB o más, porque los 30 mil millones de parámetros están en memoria aunque solo se activen unos 3 mil millones por token. Los primeros informes lo sitúan cerca de 45 tokens por segundo en una sola GPU. Está diseñado para la capa de ejecución de agentes — llamadas a herramientas, validación, formato — no para razonamiento de frontera. Si tu carga es trabajo de agente de alto volumen, puede superar a un denso 27B en tu tarea real.
Y si lo que quieres específicamente es una API alojada gratuita hoy, en lugar de una instalación local, la única opción "gratuita" honesta es la cuota de Qwen3.8-Max de Alibaba: 1M de tokens, región de Singapur, 90 días. No es el 27B, y es una asignación de evaluación, no un servicio — úsala para probar el comportamiento de Qwen3.8 ahora y luego migra.
Cuando este consejo es incorrecto
Si ya tienes una GPU de 24GB+, el planteamiento de "esperar por niveles gratuitos" no es correcto para ti. El día en que se publiquen los pesos, vLLM con los pesos oficiales es tu nivel gratuito; estarías esperando por una conveniencia que no necesitas. Aguanta unas dos semanas solo si específicamente quieres la escalera de cuantización GGUF pulida.
Si estás haciendo un prototipo contra un contrato de API, las cuotas gratuitas alojadas (una vez que el 27B las tenga) pueden costar menos que tu tiempo — incluso con la caducidad de 90 días y el bloqueo regional, alquilar una máquina con GPU durante una semana de prototipado suele ser la opción más cara.
Si la licencia resulta ser Tongyi Qianwen en lugar de Apache, los "pesos libres" no significarán libertad para comercializar por encima del umbral de 100 millones de MAU. Lea el archivo LICENSE en el repositorio real antes de construir cualquier cosa sobre él — esa es la forma más común en que los "pesos abiertos gratuitos" se convierten en una factura.
Y si Alibaba vuelve a retrasar la fecha — ya han pasado dos días desde el plazo prometido — cada semana que pasa convierte a Qwen3.6-27B en la decisión correcta en lugar de la solución provisional.

En resumen
No existe una API gratuita de Qwen3.8-27B porque Qwen3.8-27B no existe en ningún lugar. Cuando se publiquen los pesos, las tres rutas gratuitas son el autoalojamiento (se paga en hardware), los niveles gratuitos alojados (se paga en límites) y el nivel gratuito planificado de OrcaRouter, que aún no está activo, y lo diremos cuando lo esté. Hoy en día, lo más cercano a algo gratuito es Qwen3.6-27B en tu propio hardware. Esperar no te cuesta nada, salvo la 27B; ejecutar el predecesor no te cuesta nada, salvo una GPU que puedes poner a trabajar en todo lo demás mientras tanto.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
