
Qwen3.8-27B en vLLM: Despliégalo en producción con una o dos GPU
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 por 1M de tokens · 42 tok/s
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-1326 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenNUEVOQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 3320 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
Sí: Qwen3.8 27B se usa en producción con vLLM actualmente, y en una sola GPU en la mayoría de los casos. La versión que importa es vLLM 0.17.0 o posterior: incluye la receta oficial, los kernels de atención híbrida que este modelo necesita y un endpoint /v1 compatible con OpenAI. Para una GPU Blackwell, ejecute la cuantización NVFP4: la propia receta de vLLM la mide en 24,6 GiB de VRAM con tamaño de tensor-parallel 1. Para una tarjeta de 48 GB, ejecute FP8. BF16 completo, un checkpoint de 51,7 GB, requiere una GPU de 80 GB o dos tarjetas de 48 GB en tensor-parallel. Los comandos exactos están abajo; el primero es de una sola línea.
Todo aquí fue verificado el 15 de agosto de 2026, el tercer día en que los pesos estuvieron en línea. La arquitectura, el contexto y la licencia provienen de la ficha del modelo Qwen3.8 27B en Hugging Face; el tamaño del checkpoint es la suma de los 18 fragmentos safetensors del repositorio; los comandos de vLLM y la cifra de 24.6 GiB provienen de la propia página de receta de vLLM para este modelo. Qwen3.8 27B es el modelo multimodal denso de 27 mil millones de parámetros de Alibaba — pesos bajo Apache 2.0, publicado del 13 al 14 de agosto — y debido a que los pesos son abiertos, puedes servirlo tú mismo en lugar de alquilar tokens. Esa bifurcación es de lo que realmente trata este artículo.
Los hechos que importan, con fuentes
• Arquitectura — 27B denso (27,8B contando la torre de visión y el vocabulario con relleno), 64 capas, tamaño oculto 5.120, vocabulario 248.320. Ficha oficial del modelo, verificada hoy.
• Atención — híbrido: 16 capas de atención completa, 48 capas lineales Gated DeltaNet en un patrón de bloques 3:1. Solo 16 capas mantienen una caché de clave-valor en crecimiento; las otras 48 mantienen en cambio un estado recurrente de tamaño fijo.
• Contexto — 262,144 tokens de forma nativa, extensible a aproximadamente 1M mediante el escalado YaRN RoPE. Ficha del modelo, verificada hoy.
• Entrada — texto, imagen y video nativos; salida de texto. vLLM expone los tres a través de la API estándar de chat-completions, sin archivo de proyector separado.
• Licencia — Apache 2.0. Este único hecho es la razón por la que existe siquiera la pregunta de "servirlo tú mismo vs alquilar los tokens".
• Pesos — el checkpoint BF16 totaliza 51.7 GB en 18 fragmentos safetensors (Hugging Face, verificado hoy). Qwen también publica checkpoints FP8 y NVFP4 diseñados para vLLM.
• Requisito de vLLM — 0.17.0 o posterior, con transformers ≥ 5.8.0. La página de recetas de vLLM, verificada hoy. «Cualquier vLLM» no es una instrucción segura; los kernels de capa recurrente son lo que añade la nueva versión.
• Predicción multi-token — un cabezal de borrador de decodificación especulativa se incluye en el checkpoint, por lo que no necesitas un modelo de borrador aparte. vLLM documenta el flag; aún no existe una cifra independiente de aceleración.
La escalera de GPU — qué quant en qué tarjeta
Tres formatos de inferencia cubren el rango práctico. Elige según la VRAM que realmente tengas, no por el "best quant".
• NVFP4 — 24.6 GiB en total (pesos más una caché KV FP8), según la receta de vLLM con TP1. Cabe en una GPU de clase Blackwell — en la práctica, una RTX 5090 de 32GB o una B200. Esta es la ruta de menor latencia y la que mantiene más contexto por tarjeta: la receta de vLLM reporta una capacidad de 6.6M de tokens KV incluso con la extensión de contexto de 1M.
• FP8 — alrededor de 26 GB de pesos. Una tarjeta de 48 GB (L40S, RTX A6000, RTX 6000 Ada) lo sirve con espacio para contexto; dos tarjetas de 48 GB en paralelo tensorial te dan margen para un contexto más largo o mayor concurrencia. La propia receta de vLLM ejecuta FP8 con TP4 en una bandeja GB300 de cuatro GPU cuando quieres la caché KV más grande posible.
• BF16 — 51.7 GB de pesos, por lo que una sola GPU de 80 GB (H100, A100 80GB, B200, GB300) o dos tarjetas de 48 GB en TP2. Esta es la opción de precisión de referencia, y es la que usa el comando de extensión de contexto de 1M que aparece a continuación.
• MXFP4 — no usar en NVIDIA. La ruta MXFP4 de vLLM actualmente carece de soporte para el método lineal; los mismos pesos se publican como NVFP4, que es el formato que realmente usa la receta de NVIDIA.

Ejecútalo — los comandos de vLLM
El valor predeterminado de baja latencia para una sola GPU (NVFP4, una GPU Blackwell), textualmente de la receta de vLLM:
vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
El comando FP8 de la misma receta (TP4, una bandeja GB300, la caché KV más grande):
vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3
Para dos tarjetas de 48GB, mantén el comando FP8 y establece --tensor-parallel-size 2 en lugar de 4.
Añade esto a cualquiera de los comandos para habilitar la decodificación especulativa MTP:
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
La extensión de contexto de 1M (también de la receta de vLLM):
vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

Point any OpenAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.
Lo que prometen y no prometen las páginas propias de vLLM
• Aún no hay cifras de throughput para 27B.A fecha del 15 de agosto, la página de recetas de vLLM no publica benchmarks de throughput ni de latencia para Qwen3.8 27B. La cifra de "más de 4.000 tokens por segundo por GPU" que circula pertenece al Qwen3.8 2.4T-A95B en un rack GB300 NVL72 de 72 GPU, es reportada por el proveedor y no corresponde a este modelo. Las cifras de tokens por segundo de la comunidad que verás circular para GGUF en llama.cpp u Ollama — un runtime y una carga de trabajo diferentes a los del servicio de vLLM.
• La afirmación de que la caché KV es barata depende del tiempo de ejecución. La ficha del modelo dice que solo 16 de las 64 capas conservan una caché, pero eso solo ayuda si el motor de servicio implementa realmente las capas Gated DeltaNet. vLLM 0.17+ es la versión que sí lo hace; por eso la fijación de versión es lo primero en este artículo y no una nota al pie.
• MTP está integrado pero no se ha medido aquí. El cabezal de draft está en el checkpoint y vLLM documenta el flag, pero nadie ha publicado todavía una cifra independiente de aceleración para este 27B en vLLM. Planea medirlo en tu propio tráfico.
• NVIDIA es la ruta probada. La receta de vLLM está escrita para GPU de NVIDIA (NVFP4 y FP8). Las implementaciones con AMD Instinct o Intel Gaudi de este modelo de atención híbrida siguen siendo de vanguardia, y este artículo no pretende lo contrario.
Sírvete tú mismo, o alquila los tokens.
Aquí es donde Apache 2.0 hace su trabajo. No hay una tarifa de licencia por token en Qwen3.8 27B, así que la única pregunta real es si posees el hardware o alquilas los tokens.
• Autoalojamiento (este artículo) — pagas por la GPU una vez, y cada token posterior es gratis. Una RTX 5090 que ya tienes convierte el comando NVFP4 en un endpoint de coste marginal cero, sin que ningún dato salga del equipo. Si tienes que alquilar la GPU, una 5090 en la nube o un par de A6000s es la partida, y todo el argumento solo gana si ya tienes la tarjeta o el volumen sostenido.
• Alquila los tokens — porque los pesos son abiertos, varios servidores lo ejecutan, y el precio mínimo es el costo del hardware. Qwen3.8 27B está disponible hoy en OrcaRouter a $0.33 por millón de tokens de entrada y $2.40 por millón de salida — sin recargo de proveedor que trasladar, ya que OrcaRouter ejecuta los pesos abiertos en su propia infraestructura — y los mismos pesos abiertos financian un nivel gratuito con límite de velocidad que cobra $0 por solicitud y devuelve HTTP 429 cuando superas su límite. Un mes representativo de 10 millones de tokens con 70% de entrada cuesta alrededor de $9.51 en el nivel de pago.
• La regla de decisión — si ya tienes la GPU, alójala tú mismo. Si tuvieras que comprar o alquilar una, la API se amortiza rápidamente en volúmenes de proyectos secundarios, y el mismo cliente compatible con OpenAI apunta a cualquiera de los dos endpoints, así que el código no cambia al moverte.

Cuando vLLM es la respuesta incorrecta
• Eres una sola persona con una laptop — vLLM es un motor de servicio, no una aplicación de escritorio. Para una ejecución local de un solo usuario, llama.cpp u Ollama con un Q4 GGUF es más sencillo y necesita una tarjeta de 24 GB, no una GPU Blackwell; nuestra guía para ejecutar Qwen3.8-27B localmente recorre ese camino de principio a fin.
• Necesitas un rendimiento garantizado con cero operaciones — el autoalojamiento significa que tú controlas la paginación, el encolado y la conmutación por error. Si «la API está caída» no es una frase que quieras en tu vocabulario, alquila los tokens y deja que otra persona administre la flota.
• Realmente necesitas el contexto completo de ~1M con calidad de vanguardia — ese es el trabajo del Qwen3.8 2.4T-A95B, servido por vLLM o SGLang en un rack GB300 NVL72 de 72 GPU. El Qwen3.8 27B en una o dos GPU no lo igualará; nuestro artículo sobre cómo servir el 2.4T explica por qué ese modelo es un problema de otra clase.
• Estás en una tarjeta de 24GB más antigua — NVFP4 es un formato de Blackwell; en tarjetas de 24GB Ampere (RTX 3090) o Ada (RTX 4090), la ruta FP8 es la opción de vLLM, y más allá de eso, una cuantización GGUF con llama.cpp es el límite pragmático. El mismo modelo en una tarjeta de 24GB es un asunto diferente.
• Debes atender la máxima concurrencia en una sola tarjeta — los valores predeterminados anteriores para una sola GPU son el punto de partida, no la configuración de producción. Ajusta --max-num-seqs, la caché KV y la configuración de MTP en función de tu propia combinación de solicitudes antes de darlo por terminado.
En resumen
Qwen3.8 27B es el raro 27B denso que vLLM sirve en una sola GPU en producción. Actualiza a vLLM 0.17.0+, obtén el quant NVFP4 para una tarjeta Blackwell de 32GB a 24.6 GiB, el quant FP8 para una tarjeta de 48GB o dos en tensor-parallel, y reserva BF16 para una GPU de 80GB. Los comandos son de una sola línea, el endpoint es compatible con OpenAI, y como los pesos son Apache 2.0 puedes servirlo tú mismo o alquilarlo a $0.33/$2.40 por millón de tokens con un nivel gratuito: el mismo código de cliente en ambos casos. Lo único que nadie tiene todavía es una cifra de rendimiento independiente para el 27B en vLLM, así que presupuesta una hora de benchmarking después de arrancarlo antes de prometerle a alguien una cifra de latencia.
