
Qwen3.8-27B-Uncensored-NVFP4: Un Runbook de Servicio para GPUs Blackwell
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Qwen3.8-27B-Uncensored-NVFP4 ha estado en Hugging Face desde el 19 de agosto de 2026, y en los diez días transcurridos desde entonces se ha descargado aproximadamente 32 700 veces. Esto no es una cobertura de lanzamiento — los pesos tienen diez días, no hay ningún anuncio que reportar, y las compilaciones hermanas Qwen3.8-27B-Uncensored-FP8 y Qwen3.8-27B-Uncensored-GGUF ya están documentadas en este blog. Es una guía operativa para una compilación que la gente está descargando activamente ahora mismo: qué es realmente NVFP4, por qué esta compilación específica mezcla NVFP4 con FP8, qué GPU se benefician y cuáles no, cómo servirlo, y quién debería elegirla por encima de las compilaciones FP8 o GGUF — y quién no.
Una cosa desde el principio, porque confunde a todo el que descarga por primera vez: el repositorio está restringido. El ingenuo hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4 de una sola línea falla con un error de autenticación hasta que hayas iniciado sesión en Hugging Face y hayas aceptado los términos de acceso del repositorio en la página del modelo. Todo lo siguiente asume que has hecho ambas cosas.
También de entrada: la tarjeta del modelo de este repositorio está detrás de esa misma puerta, así que nada aquí la parafrasea. Lo que sigue se basa en el listado público de archivos y en los metadatos del repositorio, en la documentación pública de NVFP4 de NVIDIA y en informes de campo de personas que sirven compilaciones de Qwen3.8-27B NVFP4 en Blackwell. Cuando un número proviene de un profesional en lugar de un proveedor, el texto lo indica.

Qué es esta compilación
Qwen3.8-27B-Uncensored-NVFP4 es la cuantización NVFP4 de Qwen3.8-27B-Uncensored, la versión abliterada del Qwen/Qwen3.8-27B de Alibaba que la organización orcarouter publicó el 2026-08-18. La abliteración elimina del flujo residual la dirección de rechazo del modelo; esa técnica se explica en nuestro explicador de modelos sin censura y no se reexplica aquí. La base es el denso 27B con atención híbrida — 48 capas de atención lineal más 16 capas de atención completa — comprensión nativa de imágenes y video, un contexto de 262,144 tokens y una cabeza integrada de decodificación especulativa MTP. Apache 2.0 de principio a fin.
{{1}}Lo que hace interesante esta compilación no es la abliteración sino la disposición de cuantización, porque es deliberadamente una compilación cuantizada — si buscaste NVFP4, el formato es la clave.{{/1}} Según los metadatos públicos del repositorio y la configuración de cuantización, es una compilación de tensores comprimidos de precisión mixta: las proyecciones de atención son FP8 (E4M3), los MLP son NVFP4 (4 bits, empaquetados), y el codificador de visión, la cabeza MTP, el lm_head y las normas y sesgos de atención lineal se dejan en BF16. {{2}}Los metadatos de safetensors del listado público de archivos coinciden con ese esquema: aproximadamente 3.500 millones de parámetros en BF16, 9.400 millones en FP8-E4M3 y 15.000 millones en los tensores empaquetados de 4 bits, unos 24,7 GB en disco repartidos en cinco shards más un shard adicional de modelo-extra.{{/2}} Nada de eso es una afirmación sobre cómo sirve — la VRAM en tiempo de ejecución y el rendimiento para este repositorio exacto no están publicados en ningún lugar que pueda citar hoy. El tamaño en disco proviene del listado de archivos, el formato proviene de la configuración, y el comportamiento de servicio a continuación está verificado por la comunidad en compilaciones NVFP4 estrechamente relacionadas.{{3}}
Qué es NVFP4 y en qué se diferencia de FP8 y de INT8/AWQ
NVFP4 es el formato de coma flotante de 4 bits de NVIDIA, presentado para los núcleos tensoriales de quinta generación en Blackwell, y el blog técnico propio de NVIDIA es la fuente primaria adecuada para ello. Almacena los pesos como E2M1 — un bit de signo, dos bits de exponente, un bit de mantisa — y los escala en bloques: cada 16 valores comparten una escala E4M3 FP8, y todo el tensor recibe un escalar FP32 por tensor. Ese esquema de dos niveles es el objetivo principal del formato: recupera el rango dinámico que un float de 4 bits ingenuo perdería, a costa de unos pocos bits de sobrecarga por bloque. Las diferencias prácticas, en forma de una línea:
• NVFP4 frente a FP8 — ambos son de coma flotante, pero FP8 (E4M3, de 8 bits) se ejecuta en Hopper y Blackwell, mientras que NVFP4 es de 4 bits y solo se acelera de forma nativa en Blackwell. NVIDIA cita pesos aproximadamente 3,5× menores que FP16 y alrededor de 1,8× menores que FP8, y en Blackwell la multiplicación de matrices (matmul) se ejecuta directamente en los Tensor Cores FP4.
• NVFP4 vs INT8/AWQ — INT8 (W8A8) y AWQ (W4A16) son formatos enteros que funcionan desde Ampere en adelante; AWQ es de 4 bits pero entero, y en la mayoría del hardware los pesos se descuantifican a un tipo más amplio para la multiplicación de matrices. NVFP4 es un flotante de 4 bits con escalado por bloques, por lo que conserva más precisión en los bits bajos, y tiene una ruta nativa de GEMM FP4 que los formatos enteros no tienen.
• NVFP4 vs MXFP4 — ambos se confunden constantemente. MXFP4 usa bloques de 32 elementos y escalas E8M0 (potencias de dos); NVFP4 usa bloques de 16 elementos y escalas E4M3. Los bloques más finos le dan a NVFP4 un mejor aislamiento de valores atípicos, por lo que el formato es el estándar de facto de 4 bits en las pilas de servicio de Blackwell.

Qué hardware se beneficia — y cuál no
El dato más importante sobre esta compilación: NVFP4 es un formato de Blackwell. Solo se justifica en las GPU cuyos núcleos tensores implementan FP4 GEMM de forma nativa; en cualquier otra cosa, es la herramienta equivocada, sin importar lo rápida que sea la máquina sobre el papel.
• Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — aquí es donde NVFP4 es la opción correcta: núcleos tensoriales FP4 nativos, la huella de grado servidor más pequeña de la línea sin censura y el formato para el que fue hecho el build.
• Hopper — H100/H200 — sin GEMM FP4 nativo. NVFP4 degrada a una ruta de de-cuantización solo de pesos que es más lenta y no aporta nada. Use Qwen3.8-27B-Uncensored-FP8 aquí; esa compilación está verificada exactamente en este hardware.
• Ampere/Ada — RTX 3090/4090 — NVFP4 tampoco acelera en estas. La compilación GGUF, con su nivel Q4_K_M de 16.8 GB, es la herramienta adecuada para una tarjeta de 24 GB.
• Apple Silicon — NVFP4 es irrelevante en un Mac. La versión MLX (o GGUF) es la que funciona.
Un matiz honesto: los forks comunitarios sí ejecutan NVFP4 solo de pesos en hardware anterior a Blackwell. Una compilación comunitaria de NVFP4 del mismo modelo ablacionado está configurada explícitamente para tarjetas clase V100 mediante un fork de vLLM parcheado, y las recetas recientes de DGX Spark en torno a Qwen3.8-27B son algo aparte. Esos son caminos especializados con sus propias advertencias, no lo que esta compilación tiene como objetivo. Si estás en Blackwell, nada de eso importa; si no estás en Blackwell, la compilación FP8 o GGUF es la mejor descarga.
Cómo servirlo
El repositorio está etiquetado para vLLM, y el formato compressed-tensors se lee automáticamente desde config.json; no seleccionas manualmente un esquema de cuantización. La pila en la que coinciden los profesionales para las compilaciones de Qwen3.8-27B NVFP4 es una vLLM reciente en una tarjeta Blackwell, una caché KV FP8 y la propia cabeza MTP del modelo utilizada para decodificación especulativa. La guía NVFP4 de Unsloth, que es la referencia comunitaria más citada, recomienda vLLM 0.25.0 o posterior con FlashInfer y la dependencia del kernel CUTLASS-DSL para la ruta FP4 rápida.
Un punto de partida funcional, ensamblado a partir de las banderas verificadas de nuestra compilación FP8 y las recetas comunitarias NVFP4, todo en una sola línea:
vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'
• Caché KV FP8 — la forma más ampliamente compatible de reducir a la mitad la memoria de caché; los profesionales informan que aproximadamente duplica el contexto que puedes mantener. El soporte de caché KV NVFP4 existe, pero se limita a algunos backends de atención, por lo que FP8 KV es la opción predeterminada más segura.
• Decodificación especulativa MTP — el modelo incluye un cabezal de borrador MTP, y la cuantización lo mantiene en BF16. Los profesionales informan que dos o tres tokens de borrador funcionan bien con pesos NVFP4 en Blackwell, con las mayores ganancias en salida estructurada como JSON y llamadas a herramientas.
• Vision — el codificador de visión se conserva en BF16 en esta compilación. Agrega --language-model-only para servir solo texto; elimínalo si necesitas entrada de imagen o video.
• En una DGX Spark — un par de advertencias reportadas en el campo: mantén --gpu-memory-utilization en 0.90 o menos (valores más altos han bloqueado la máquina durante la carga de pesos), y añade --safetensors-load-strategy lazy si la memoria es escasa. También necesitas una compilación GB10 de vLLM para los kernels sm_121a.
Rendimiento honesto: no hay cifras de rendimiento independientes publicadas para este repositorio exacto. Las mediciones que existen son para builds de NVFP4 estrechamente relacionados. Unsloth reporta 1,41–1,49× los tokens por segundo de BF16 en un B200 para su propia build de Qwen3.8-27B-NVFP4 (89,8 a 133,7 tok/s en batch 1, 3.048 a 4.407 en batch 64), y un usuario de DGX Spark en los foros de NVIDIA reporta aproximadamente 20–32 tok/s con pesos NVFP4, una caché KV FP8 y profundidad MTP 3. Ambos merecen ser citados; ninguno es un benchmark de este repositorio.
Patrones de uso que realmente funcionan
Los profesionales que ejecutan modelos de la familia Qwen3.8-27B en Blackwell convergen en un puñado de configuraciones. Trátalos como informes de campo, no como orientación del proveedor — Qwen no documenta la mayor parte de esto, y la propia tarjeta de este repositorio está restringida.
• reasoning_effort es la perilla que más importa. El xhigh predeterminado hace que el modelo piense durante mucho tiempo en cada solicitud. Quienes ejecutan bucles de agentes establecen medium por defecto y bajan a low — o desactivan el pensamiento por completo con enable_thinking: false — para llamadas individuales sensibles a la latencia. En una sola GPU Blackwell, el razonamiento xhigh en una tarea rutinaria es cómo terminas con un modelo rápido y respuestas lentas.
• Los muestreadores están emparejados con el modo de pensamiento, no son independientes. Consenso de la comunidad: con el pensamiento activado se ejecuta a temperatura 1.0 / top_p 0.95; con el pensamiento desactivado se ejecuta a temperatura 0.7 / top_p 0.80 con presence_penalty 1.5. Intercambiar los dos conjuntos degrada la calidad de la salida.
• Usa una plantilla de chat actual. La plantilla qwen3_5 envuelve cada turno del asistente en un bloque de pensamiento, y múltiples practicantes reportan respuestas en bucle o recortadas con plantillas desactualizadas; las variantes corregidas por la comunidad Qwen-Fixed-Chat-Templates y Qwen-Sharp establecen preserve_thinking y detienen los bucles. Si tu salida servida divaga más allá del token de parada, esto es lo primero que debes revisar.
• Prevea trazas de razonamiento largas en el trabajo con agentes. Los profesionales informan de que el modelo de la generación 3.8 emite aproximadamente el doble de tokens por tarea que su predecesor, el 3.6 — el salto de calidad se debe en parte a un razonamiento más largo. Para respuestas largas de xhigh, transmita la salida del razonamiento o se encontrará con tiempos de espera de la puerta de enlace.
• La llamada a herramientas permanece intacta tras la cuantización.La ruta de llamada a funciones sobrevive tanto a la abliteration como a la conversión de 4 bits; actívala con el analizador de llamadas a herramientas de qwen3_coder y el modelo elige herramientas igual que el modelo base.

Quién debería elegir esta build — y quién no
La decisión honesta, sin repetir los cálculos de selección de cuantización que nuestras publicaciones sobre FP8 y GGUF ya cubren en detalle:
• Elige NVFP4 si estás sirviendo en Blackwell y quieres la huella de nivel servidor más pequeña de la línea sin censura con velocidad de núcleos tensoriales FP4 — y estás realizando investigación, trabajo de red team o de interpretabilidad que legítimamente necesita un modelo abliterado.
• Elige Qwen3.8-27B-Uncensored-FP8 si estás en Hopper, o quieres la ruta de vLLM más ampliamente verificada: son los mismos pesos a 8 bits, verificados en un H200, con un mínimo de aproximadamente 40 GB de VRAM.
• Elige Qwen3.8-27B-Uncensored-GGUF si estás en una GPU de consumo o en una Mac, o quieres llama.cpp en lugar de vLLM — el nivel Q4_K_M es el punto óptimo local.
• No elijas ninguna si quieres la máxima fidelidad, estás construyendo cualquier cosa orientada al usuario (consulta el límite de seguridad a continuación) o no quieres autoalojar nada en absoluto: la misma línea sin censura se sirve a través de OrcaRouter, con acceso restringido a investigadores, por lo que no se requiere GPU.
El límite de seguridad — solo investigación
Este es un modelo abliterado, y la cuantificación no restablece las salvaguardas. La dirección de rechazo fue eliminada del flujo residual de Qwen/Qwen3.8-27B, y NVFP4 es un cambio de precisión, no una intervención de seguridad: el modelo cumplirá con solicitudes que el modelo base rechaza, y esta compilación no tiene moderación integrada. Se publica para investigación de interpretabilidad, seguridad de IA y red-team bajo Apache 2.0, y la responsabilidad es tuya.
Dos notas de evaluación que aparecen muy raramente en el espacio de modelos sin censura. Primero, una única sonda de jailbreak que pasa trivialmente no es una evaluación de seguridad aprobada: los modelos ablacionados fallan esas a propósito. Mide lo que realmente te importa con las baterías adecuadas (AdvBench, HarmBench y StrongREJECT para nocividad; XSTest-safe para exceso de rechazo) y compara las tasas de rechazo antes y después de la intervención. Segundo, evalúa el quant, no solo la base: una compilación de 4 bits puede cambiar el comportamiento en casos límite incluso cuando las puntuaciones agregadas se ven bien. No despliegues esto a los usuarios finales sin tus propias capas de moderación y prevención de abusos.
Dónde encaja OrcaRouter
Una compilación cuantizada de diez días es el caso típico para enrutar en lugar de cablear. Puedes levantar una ruta que apunte a la compilación NVFP4 que tú mismo ejecutas y conmutar por error a un modelo alojado si la compilación se comporta mal bajo carga: una sola interfaz, sin recablear entre proveedores cuando cambias. OrcaRouter transmite el precio de lista del proveedor con un margen del 0%, así que si el precio del modelo subyacente se mueve, tu endpoint lo refleja el mismo día en lugar de en tu ciclo de facturación.
Y si todo el objetivo es evitar ejecutar una GPU por completo: la misma línea sin censura está disponible a través de OrcaRouter, restringida a investigadores de seguridad y red teams, con conmutación automática por error entre proveedores. Ya sea que autoalojes esta compilación NVFP4 o uses la línea alojada, es una sola clave API en ambos casos.
El resultado final
Qwen3.8-27B-Uncensored-NVFP4 es la descarga correcta si estás sirviendo el modelo abliterado en Blackwell y quieres la huella más pequeña con la velocidad de los núcleos tensoriales FP4. Es la descarga incorrecta en Hopper (usa la versión FP8), en una GPU de consumo o de Apple (usa la versión GGUF o MLX), o si necesitas la máxima fidelidad. No es nueva — ha estado disponible para su descarga desde el 19 de agosto de 2026 — pero se está descargando en volumen, y ahora sabes en lo que te estás metiendo antes de aceptar la puerta.
No es otra versión de este modelo — Qwen3.8-Flash-Next-Uncensored es un lanzamiento aparte: abliterado de Qwen3.8-Flash-Next, una vista previa de mezcla de expertos de 176B almacenados / 6B activos de la arquitectura Qwen4. Misma técnica de abliteración, diferentes pesos, su propia colección.
Las seis compilaciones 27B — BF16, GGUF, MLX, FP8, INT8 y NVFP4 — están recopiladas en la colección Qwen3.8-27B-Uncensored en Hugging Face.
Estos pesos son solo locales por diseño. Como referencia alojada contra la cual medir la versión abliterada, Qwen3.8-27B se sirve en OrcaRouter al precio de lista del proveedor con un margen del 0% — el modelo original, con su alineación de seguridad intacta.
