
Requisitos de VRAM del Qwen3.8-27B: Cuánto hardware realmente necesitarás
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenNUEVOQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2382 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
Alrededor de 17 GB de VRAM es la cifra que circula para el Qwen3.8-27B — Daniel Han, de Unsloth, dijo que «debería caber en aproximadamente 17 GB de VRAM en su lanzamiento» — y vale la pena ser precisos sobre qué es y qué no es. Es una proyección basada en el predecesor del 27B, no una especificación de Alibaba, porque el modelo aún no se ha lanzado; el repositorio oficial se prometió para la semana del 10 de agosto de 2026 y no había aparecido al momento de escribir esto. Este artículo clasifica la cuestión de la VRAM en lo que puedes tener por seguro, lo que es genuinamente incierto y cómo varía la cifra con tu cuantización, tu ventana de contexto y tu entorno de ejecución.
La respuesta honesta primero
No hay una especificación oficial de hardware para Qwen3.8-27B todavía. Todo lo que sigue está proyectado a partir de Qwen3.6-27B, el modelo predecesor del 27B: mismo número de parámetros, misma probable arquitectura híbrida, y lo más cercano que existe a una referencia de dimensionamiento. Trata las cifras como un margen de planificación, no como una hoja de requisitos. Las primeras mediciones reales llegarán de los cuantizadores y los mantenedores de frameworks de inferencia a los pocos días del lanzamiento de los pesos, y son esas cifras las que debes usar para fijar tu compra.
La escalera quant
La cantidad de VRAM que necesitas depende casi por completo de la cuantización que ejecutes. Partiendo de la tabla de Qwen3.6-27B medida por la comunidad:
Q4_K_M — aproximadamente 16 GB de VRAM. El punto óptimo para tarjetas de 24 GB, y el probable origen de esa cifra de "17 GB". El valor predeterminado de la mayoría de los equipos.
• Q3_K_M / IQ3 — aproximadamente 13 GB de VRAM. Cabe en tarjetas de 16 GB e incluso de 12 GB, con una visible pérdida de calidad.
• Q6_K — aproximadamente 21 GB de VRAM. Casi sin pérdidas, y un ajuste justo pero factible en una tarjeta de 24 GB.
{{1}}Q8_0{{/1}} — aproximadamente 27–30 GB de VRAM. Para tarjetas de 48 GB en las que quieres exprimir hasta la última gota de calidad.
• Servicio FP8 — aproximadamente 27 GB de VRAM para los pesos, por lo que una sola L40S es la opción común de GPU de inferencia.
• Precisión completa (BF16) — aproximadamente 54 GB de VRAM. Realísticamente, una tarjeta de clase H100, y el territorio donde la gente deja de llamarlo "local".
La versión corta: una GPU de 24 GB es la compra segura para este modelo, una tarjeta de 16 GB solo puede ejecutarlo si aceptas los quant bajos, y cualquier cosa con 8 GB o menos queda descartada a menos que el modelo resulte drásticamente más ligero que su predecesor.

La variable que nadie cita: la longitud de contexto.
Cada número anterior corresponde a un contexto modesto. La VRAM escala con el contexto porque la caché KV debe residir junto a los pesos. En Qwen3.6-27B, un contexto de 2K usó unos 11 GB, un contexto de 32K llevó la misma cuantización más allá de 14 GB, y 128K más que duplicó la huella de la caché. Si Qwen3.8-27B mantiene una ventana de contexto nativa grande — y la generación Qwen ha ido en esa dirección — reserva unos GB de margen adicional al tamaño de la cuantización, o limita el contexto en la configuración de tu runtime. Elegir una longitud de contexto que en realidad no utilizas es la forma más común de que los equipos terminen comprando una tarjeta más grande de la que necesitaban.
El comodín de la arquitectura híbrida
Qwen3.6-27B era un modelo híbrido: solo 16 de sus 65 capas usaban una caché KV tradicional, mientras que 48 usaban un estado recurrente fijo. El resultado era aproximadamente cuatro veces menos memoria KV que un modelo denso del mismo tamaño, lo cual explica en gran parte por qué un 27B parecía un modelo para tarjeta de 24 GB en lugar de uno de 48 GB. Si Qwen3.8-27B mantiene el diseño híbrido (probable, aunque no confirmado), los cálculos de longitud de contexto anteriores resultan más favorables de lo que parecen. El inconveniente es el soporte en tiempo de ejecución: una compilación de llama.cpp o vLLM que no implemente las capas recurrentes reportará un uso de memoria mucho mayor. Comprueba qué runtimes han integrado soporte antes de asumir que las proyecciones se cumplen.
¿Qué GPU funcionan realmente?
Concretamente, para las cartas comunes:
• RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M cómodamente, Q6_K si estás dispuesto a exprimirlo. Este es el público objetivo.
{{1}}RTX 3060 / 4060 Ti 16 GB{{/1}} — solo cuantizaciones de nivel IQ4 o Q3, con contexto moderado. Funcional, aunque no agradable.
• Tarjetas de 12 GB — Q3_K_M a calidad reducida. Adecuado para experimentación, no para servir.
• Apple Silicon: una Mac de 24 GB ejecuta los mismos archivos Q4 mediante MLX o llama.cpp; los modelos base de 16 GB sufren swap-thrash y quedan efectivamente descartados, como ya sucedió con Qwen3.6-27B.
• 48 GB y más (A6000, L40S, configuraciones de doble tarjeta) — servicio Q8_0 o FP8 con margen real.

O evita la GPU por completo
Si las matemáticas del hardware no te funcionan, el modelo no tiene por qué. OrcaRouter es una sola API para más de 200 modelos — incluida la familia Qwen — y traslada el precio de lista del proveedor sin ningún margen, por lo que Qwen3.8-Max cuesta actualmente $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida, lo mismo que en la propia página de precios del proveedor. El 27B en sí será un modelo local, pero cuando sus pesos estén disponibles y se gane la confianza, la misma clave enrutará hacia el proveedor que lo aloje — puedes desarrollar ya sobre esta generación y no tocar nunca el mercado de reventa de GPU.

La conclusión sobre el hardware: planifica con 16 GB para una ejecución cómoda de 4 bits, 24 GB para estar seguro y darte margen para el contexto y cuantizaciones más altas, y trata cada cifra aquí como provisional hasta que el repositorio esté disponible y aparezcan las primeras mediciones reales. La proyección de "17 GB" es un número de planificación sensato; simplemente aún no es un hecho.
