Tarjeta de título hero para el artículo 'Qwen3.8-Flash-Next-Uncensored-NVFP4: A Blackwell Serving Runbook', que muestra el titular, el subtítulo 'A Blackwell Serving Runbook — NVFP4 experts, FP8 attention, BF16 PLE' y cuatro chips de especificaciones: 'Blackwell only — FP4 tensor cores', '330 GB → 178 GB', 'Gated on Hugging Face' y '262K context', con el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored-NVFP4: Un Runbook de Despliegue para Blackwell

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Qwen3.8-Flash-Next-Uncensored-NVFP4 se ejecuta exactamente en una familia de GPU: Blackwell. NVFP4 se ejecuta en núcleos tensoriales FP4 del hardware, y Hopper (H100/H200) y cualquier cosa más antigua simplemente no los tienen. Si estás en Hopper, detente aquí — la Qwen3.8-Flash-Next-Uncensored-FP8 es la que quieres. Todo lo que sigue asume Blackwell (B100, B200, GB200 o una tarjeta de la serie RTX 50), una compilación reciente de vLLM con soporte para qwen4_exp, y transformers ≥ 5.16.

Esta es la cuantización NVFP4 de la compilación abliterada (con rechazos eliminados) de Qw​en Qw​en/Qwen3.8-Flash-Next, reducida de 330 GB en BF16 a 178 GB en disco. OrcaRouter la publicó en Hugging Face el 27 de agosto de 2026 como orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4. El repositorio está restringido: debes haber iniciado sesión en Hugging Face y haber aceptado los términos del repositorio, o hf download y vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 ambos fallan con un error de autenticación antes de que se mueva un solo byte. Esta página es un runbook de servicio, no una cobertura de lanzamiento — la compilación tiene dos días, y las preguntas que la gente realmente se encuentra son sobre hardware, banderas y qué compilación elegir.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 repo (captured August 29 2026), showing the gate banner 'You need to agree to share your contact information to access this model', 'Login or Sign Up to review the conditions', Model size 125B params, tensor types F8_E4M3 · BF16 · U8 · I64, the apache-2.0 licence, the base-model line Qwen/Qwen3.8-Flash-Next, and the abliterated, uncensored, nvfp4, fp4, fp8, vllm and vision-language tags.

Y antes de que empiecen los números: Qwen3.8-Flash-Next-Uncensored no es Qwen3.8-27B-Uncensored. Son dos modelos diferentes que comparten un nombre de familia y una técnica de abliteración — pesos base distintos, arquitecturas distintas, colecciones de Hugging Face distintas. Flash-Next está abliterado a partir de Qw​en/Qwen3.8-Flash-Next, una vista previa de mezcla de expertos enrutada de la arquitectura Qwen4 (qwen4_exp): 512 expertos con diez enrutados más uno compartido activo, atención híbrida (capas lineales Gated DeltaNet junto con capas de atención completa), Hyper-Connections, un embedding de n-gramas PLE, una torre nativa de visión y video, y una cabeza de decodificación especulativa MTP. El 27B está abliterado a partir de Qw​en/Qwen3.8-27B, una base densa completamente distinta. Nada de las cifras de serving de una página del 27B se transfiere a este modelo; allí donde una página del 27B es genuinamente útil — el manual de abliteración, las matemáticas generales para elegir la cuantización — se enlaza abajo con qué se traslada y qué no.

A scoreboard card for Qwen3.8-Flash-Next-Uncensored-NVFP4 with six rows: base model Qwen/Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + accepted terms), precision NVFP4 experts - FP8 attention - BF16 PLE, on-disk size 178 GB from 330 GB BF16, KV cache BF16 (not quantized), hardware Blackwell only (FP4 tensor cores); footer reads 'All figures from the orcarouter model card, August 29 2026 - self-reported, not independently audited.'

Qué es esta build, precisión por precisión

Qwen3.8-Flash-Next es un MoE enrutado: cada token activa 10 de los 512 expertos más un experto compartido, y solo unos pocos miles de millones de parámetros están activos por token, aunque el modelo almacenado es mucho más grande. La compilación NVFP4 es una cuantificación de tensores comprimidos de precisión mixta de esa pila, y la división es todo el asunto:

• Pesos de experto MoE — NVFP4 (4 bits, NVIDIA FP4 E2M1, grupo-16 con escalas de bloque FP8).

• Atención (self_attn.{q,k,v,o}), las proyecciones de linear_attn, el experto compartido y lm_head — FP8 (de 8 bits).

• Embedding de n-gramas PLE, embeddings de tokens y de visión, Hyper-Connections, el indexador QSA, Gated-DeltaNet conv/dt, todas las normas y toda la torre de visión — BF16, mantenido a plena precisión.

Tres propiedades de la conversión importan más que la propia división de precisión. Primero, es solo de pesos: las activaciones se cuantizan dinámicamente en tiempo de ejecución, no hay calibración estática y los pesos se derivan directamente del checkpoint BF16 (la ficha califica la derivación de libre de datos). Segundo, la edición de abliteración está grabada en los pesos, por lo que la eliminación de rechazos sobrevive a la cuantización — una conversión de 4 bits es un cambio de precisión, no una intervención de seguridad. Tercero, la caché KV no se cuantiza; permanece en BF16 en tiempo de ejecución. Este último detalle es fácil de pasar por alto y cobra importancia en el contexto nativo de 262 144 tokens del modelo, donde la caché KV es una partida de memoria real junto a los pesos.

El tamaño en disco está dominado por un solo tensor. La tarjeta describe el embedding PLE n-gram como un único tensor de ~66B parámetros mantenido en BF16 por diseño; es el shard más grande y la razón por la que el build es de 178 GB en lugar de un número más reducido. Una discrepancia que conviene señalar en lugar de pasar por alto: la tarjeta hermana de FP8 llama a la misma tabla el PLE n-gram de 51B parámetros, y la nota W4A4 de esta tarjeta se refiere a ella como ~100 GB. Las dos tarjetas indican cifras distintas para la misma tabla, así que trate cada una como el número de su propia tarjeta — y al dimensionar un despliegue, asuma que la tabla es grande en BF16 y planifique en consecuencia.

La condición previa del hardware, explicada.

Esta es la sección más corta y más importante de la página. NVFP4 es un formato de Blackwell: la ruta rápida es una GEMM FP4 nativa en los tensor cores de quinta generación, y sin ese hardware el formato no tiene en qué ejecutarse. La línea de requisitos de la propia tarjeta es explícita — una GPU Blackwell (B100 / B200 / GB200 / serie RTX 50), porque NVFP4 utiliza los tensor cores FP4 del hardware, y no se ejecutará en Hopper (H100/H200) o más antiguas, que carecen de cómputo FP4.

Las redirecciones, en un solo lugar:

• En Hopper (H100/H200) — sirve Qwen3.8-Flash-Next-Uncensored-FP8 en su lugar. Son los mismos pesos en 8 bits, se ejecuta en Hopper y Blackwell, y es la compilación que cubre el runbook de FP8 de este blog.

• En una GPU NVIDIA de consumo o en una máquina con CPU — la compilación GGUF, con sus 13 quants de llama.cpp, es la ruta local.

• En Apple Silicon — la compilación MLX, en niveles de 4/6/8 bits, es la ruta nativa de Metal.

El requisito de tiempo de ejecución es tan vinculante como el silicio. qwen4_exp es una arquitectura completamente nueva, por lo que las compilaciones estándar de vLLM anteriores a ella se negarán a cargar el checkpoint. Necesitas un vLLM reciente con soporte para qwen4_exp además del lector NVFP4 de compressed-tensors (el formato se detecta desde config.json, no se selecciona manualmente), y transformers ≥ 5.16. La entrada multimodal además requiere la pila de visión Qw​en del runtime; el servicio solo de texto funciona sin ella.

El comando serve de la tarjeta, bandera por bandera.

La propia invocación de la tarjeta del modelo es un buen punto de partida, y vale la pena entender para qué sirve cada indicador en lugar de copiar y pegar a ciegas:

vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 --tensor-parallel-size 4 --trust-remote-code --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder

--tensor-parallel-size 4 — los pesos ocupan ~178 GB en disco, por lo que la tarjeta los reparte entre cuatro GPUs. Esta es la forma para la que está dimensionado el build; no lo tomes como una sugerencia.

--trust-remote-coderequerido para una arquitectura personalizada. El código de modelado de qwen4_exp aún no está en el registro estándar de transformers, por lo que vLLM carga el código de la arquitectura desde el repositorio. Estás confiando en ese código, lo cual es una decisión normal pero real para una arquitectura completamente nueva.

--enable-expert-parallel — distribuye los expertos entre los rangos de tensor-parallel en lugar de replicarlos, que es lo que hace factible un MoE de 512 expertos con TP4. La tarjeta hermana de FP8 indica la razón más precisa en esa compilación: sin ella, el ancho intermedio del MoE dividido por TP no es divisible por el tamaño de bloque de FP8. Considérelo como obligatorio, no opcional.

--enable-auto-tool-choice y --tool-call-parser qwen3_coder — juntos activan la llamada a funciones. La opción auto permite que el modelo decida si llamar a una herramienta, y el analizador qwen3_coder decodifica su formato de llamada a herramientas, la misma familia de analizadores con la que sirven Qwen3.8-27B y Qwen3.8-Flash-Next.

Una vez que esté activo, el endpoint compatible con OpenAI en /v1/chat/completions ofrece el conjunto completo de funciones a través de la pila Qwen4 del runtime: llamadas a herramientas como se indicó anteriormente, razonamiento mediante chat_template_kwargs.enable_thinking y visión a través de las partes de contenido image_url. No necesita un servidor separado para multimodal; es el mismo endpoint.

Una nota estructural de la ficha: no existe una variante W4A4 totalmente estática de esta compilación, y no va a haber una barata. Una conversión W4A4 estática necesita un pase hacia adelante de calibración de activaciones, y ese pase debe contener el embedding de n-gramas de ~100 GB en una sola GPU. Esa es la misma razón por la que la tabla PLE domina el listado de archivos, y es por la que esta compilación se mantiene solo-pesos con activaciones dinámicas.

Informes de campo de la comunidad: cómo se ve realmente servir esto

No se publican cifras de rendimiento o latencia para este repositorio exacto, y esta página no las inventará. Lo que sí existe es un creciente conjunto de informes de campo de profesionales que sirven las compilaciones base Qwen3.8-Flash-Next NVFP4 — la misma arquitectura, la misma división de precisión NVFP4/FP8/BF16, menos la edición de abliteration — y el comportamiento de servicio se traslada directamente. Estos son hallazgos de la comunidad, no orientación del proveedor, y quienes los reportaron usaban hardware Blackwell con el mismo esquema de cuantización.

La decodificación especulativa MTP es la mayor palanca de rendimiento. El modelo incluye un cabezal de borrador de predicción de múltiples tokens, y en una RTX PRO 6000 (96 GB, SM120) el módulo MTP se carga cuantizado a NVFP4 con unos 0.51 GB de VRAM — el informe midió una longitud de aceptación de 2.3–3.9 de un máximo de 4 y una tasa de aceptación de 0.86–0.96. El mismo informe midió una decodificación mediana de flujo único de 180–226 tok/s (216.9 en codificación, 225.8 en una carga de trabajo de llamadas a herramientas de agente, 136.6 en razonamiento) frente a una línea base de aproximadamente 105 tok/s, y respondió a un prompt de 216,685 tokens en 8.4 segundos. Trata los números como el equipo de una persona, no como una especificación.

Descarga el embedding de n-gramas PLE a la RAM del host. Debido a que la tabla es enorme y rara vez es el cuello de botella de rendimiento, las recetas comunitarias en tarjetas Blackwell individuales la fijan al host (~50 GiB de RAM libre del host en el informe RTX PRO 6000) y la asignan con mmap desde NVMe, intercambiando un poco de latencia por poder ajustar el modelo en absoluto. Espera hacer algo como esto a menos que tengas un presupuesto de VRAM muy grande.

Fija explícitamente la ventana de contexto. Con caché KV en BF16 y MTP activo, un pool de KV de tamaño automático se infló más allá de lo que la tarjeta podía contener y provocó un OOM durante el prefill largo; fijar max-model-len / max-total-tokens a 262144 restauró el margen. Con un contexto de 262K, la caché KV es una partida que presupuestas, no un valor predeterminado.

Un error de autotune de FlashInfer corrompe silenciosamente la salida.El modo de fallo más importante en el campo: el autotune selecciona tácticas de kernel fused-MoE solo por latencia y nunca verifica la corrección numérica, por lo que bajo ciertas formas decode colapsa en un token repetido. El informe de la RTX PRO 6000 lo reprodujo como 36 de 36 generaciones corruptas con el autotune activado, y 0 de 36 con él desactivado: la solución es desactivar el autotune de FlashInfer (en vLLM, --no-enable-flashinfer-autotune; en SGLang, --disable-flashinfer-autotune). Si la salida servida de repente se degenera, revisa esto antes de tocar cualquier otra cosa.

DGX Spark (GB10, SM121) necesita sus propios parches. Los pesos NVFP4 (~126 GiB en la compilación comunitaria) no caben en un Spark de 128 GB, por lo que las recetas de SGLang ejecutan tensor-parallel 2 entre dos nodos a través de RoCE, y el resolutor QSA de decodificación dispersa supedita el kernel rápido de FlashInfer a una comprobación is_sm100_supported() que falla en SM121, recurriendo a una ruta que muere durante el warmup: la solución es un parche pequeño más la descarga de PLE. Espera una decodificación de ~47–50 tok/s, con picos cercanos a 70 con MTP4 y CUDA graphs, y verifica que tu kernel realmente se ejecuta en SM121 antes de prometer un benchmark.

Razonamiento, llamada a herramientas y visión a través de la pila Qwen4

El consenso comunitario sobre la generación Qwen3.8 se traslada a este modelo con la advertencia habitual de que es práctica de campo, no orientación del proveedor.

reasoning_effort es el control que más importa. La plantilla de chat tiene xhigh por defecto, lo que hace que el modelo piense extensamente en cada solicitud. Los operadores de agent-loop configuran medium por defecto y bajan a low para llamadas sensibles a la latencia; enable_thinking false desactiva el razonamiento por completo cuando no lo necesitas. En una sola tarjeta Blackwell, dejar xhigh activado para llamadas rutinarias es cómo un modelo rápido produce respuestas lentas.

Asocie los muestreadores con el modo de pensamiento. Los profesionales coinciden en temperatura 1.0 / top-p 0.95 cuando el pensamiento está activado, y temperatura 0.7 / top-p 0.80 con una penalización de presencia de alrededor de 1.5 cuando está desactivado. Mezclar los dos conjuntos degrada la calidad de la salida.

La llamada a herramientas sobrevive tanto a la abliteración como a la conversión de 4 bits. La ruta de llamada a funciones está intacta, que es lo que conectan el analizador qwen3_coder y los indicadores de auto-tool-choice. Para un equipo rojo, esto es un hecho de doble filo, ya que significa que el uso indebido de agentes está plenamente operativo en un modelo no alineado — como se cubre más abajo.

La visión se conserva, y eso amplía la superficie de ataque. La torre de visión nunca fue tocada por la abliteración y permanece en BF16, por lo que la entrada de imágenes funciona a través de las partes de contenido image_url. Los profesionales que evalúan la línea sin censura tratan la ruta multimodal como un objetivo de evaluación de primera clase: la inyección de prompts transportada en una imagen aterriza en un modelo sin comportamiento de rechazo al que enfrentarse.

¿Qué build deberías servir?

La colección Flash-Next tiene cinco versiones — BF16, GGUF, MLX, FP8 y esta de NVFP4 — y la lógica honesta de selección se basa en el hardware y las compensaciones, no en una clasificación.

NVFP4 (esta compilación, ~178 GB en disco) — la elección de Blackwell. Núcleos tensoriales FP4, expertos de 4 bits, la compilación más reciente de la colección y la más pequeña de sus compilaciones de servidor vLLM, y la protagonista de esta página.

FP8 (~186 GB en disco) — la opción para Hopper, e igualmente adecuada para Blackwell. Los mismos pesos a 8 bits, que es la ruta de vLLM más ampliamente verificada y la que tiene el requisito de paralelismo de expertos más claro.

GGUF (13 quants, IQ2_XXS ~52 GB a Q5_K_M ~125 GB) — la elección de llama.cpp para equipos de consumo con NVIDIA, AMD o CPU. No se necesita Blackwell, no se necesita vLLM.

MLX (niveles de 4/6/8 bits, aproximadamente 163–221 GB) — la opción para Apple Silicon, Metal nativo, cabezal MTP incluido.

Dos notas honestas antes de que elijas. Primero, las versiones NVFP4 y FP8 están separadas por solo unos ocho GB en disco, porque ambas mantienen la gran tabla de n-gramas en BF16 — el ahorro de 4 bits se concentra en los pesos de los expertos, no en el espacio total. La verdadera ventaja de NVFP4 en Blackwell es la velocidad de los núcleos tensoriales FP4 en esos expertos, no un archivo drásticamente más pequeño. Segundo, la ficha describe NVFP4 como una derivación determinista de pesos que hereda la evaluación de abliteración con un pequeño intercambio adicional de calidad por los expertos de 4 bits, y no cuantifica ese intercambio. No está cuantificado — trátalo como un costo real pero no especificado de los expertos más pequeños, no como algo insignificante.

La evaluación, leída correctamente.

La ficha informa de la abliteration medida en la compilación BF16 servida con vLLM frente a la oficial Qw​en/Qwen3.8-Flash-Next: el rechazo de indicaciones dañinas cae del 64–100 % a aproximadamente el 0–3,3 %, el rechazo excesivo de indicaciones benignas se mantiene cerca de cero y la capacidad se mantiene dentro de ±2 puntos respecto a la base. Hay tres cosas que conviene entender correctamente sobre esas cifras. Son mediciones hechas en la compilación BF16, que esta compilación de 4 bits hereda por argumentación, no porque se hayan medido en ella. Son cifras del propio proveedor, obtenidas con un clasificador de frase inicial basado en reglas que las fichas de la colección describen como indicativas, no de nivel publicable: una medición interna de su propia edición, no una auditoría independiente. Y no dicen nada sobre el equilibrio de calidad de NVFP4 mencionado más arriba, que la ficha no cuantifica.

El límite de seguridad — solo investigación

La advertencia de la tarjeta es contundente, y es la parte de esta página que no debe leerse como texto genérico. A este modelo se le ha eliminado sustancialmente su alineación de seguridad: la dirección de rechazo fue ortogonalizada fuera del flujo residual, y el modelo cumplirá con solicitudes dañinas, poco éticas o ilegales que el Qwen3.8-Flash-Next original rechazaría. Se publica estrictamente para investigación legítima — interpretabilidad, estudio de la seguridad de la IA y de los mecanismos de rechazo, red-teaming y evaluación de robustez — y los autores no aceptan responsabilidad alguna por su uso indebido. Usted asume toda la responsabilidad por lo que genere, y debe añadir sus propias capas de seguridad y moderación antes de que cualquier cosa llegue a un usuario. Apache 2.0 es el mínimo; la restricción de fines de investigación se sitúa por encima.

Dos cosas que el discurso sobre los modelos sin censura entiende mal, y esta tarjeta las hace imposibles de pasar por alto. Primero, una prueba de jailbreak que tenga éxito contra este modelo no es una evaluación de seguridad aprobada: es el comportamiento anunciado. Un modelo abliterado falla esas pruebas a propósito; medirlo con una única prueba de «¿puedes hacerle jailbreak?» es medir que la edición funcionó, no que una salvaguarda sea fuerte. Segundo, la torre de visión conservada y la ruta intacta de llamada a herramientas amplían la superficie de ataque real más allá del texto: la inyección de instrucciones mediante entrada de imagen y el uso indebido de herramientas agénticas son totalmente operativos, que es precisamente por lo que el marco de red team trata esto como una sonda de capacidades, no como un candidato a chatbot. Si tu caso de uso es lanzar un asistente orientado al usuario, este no es tu modelo, y eso es por diseño.

Dónde encaja OrcaRouter

Una compilación de dos días de antigüedad, con acceso restringido y solo para autoalojamiento, es el caso de manual para el enrutamiento en lugar del cableado fijo. Cuando ejecutas este build NVFP4 tú mismo, puedes levantar una ruta que apunte a él y que haga failover a un modelo alojado si el build se comporta mal bajo carga — una sola interfaz, sin recablear entre proveedores al cambiar. Para el trabajo de evaluación específicamente, la línea base servida censurada es la comparación que quieres, y está a una sola tecla de distancia: el catálogo incluye el Qwen3.8-Flash de Ali​baba a $0.15 por millón de entrada y $0.47 por millón de salida, transferido al precio de lista del proveedor con un margen del 0%, por lo que un arnés de red team puede moverse entre la base censurada alojada y tu build local sin censura sin un segundo contrato, y cualquier cambio de precio del proveedor llega a tu endpoint el mismo día.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash (captured August 29 2026), showing the tagline 'Qwen3.8 Flash is a multimodal reasoning model from Alibaba', the Vision / Tools / JSON / Reasoning feature tags, pricing of $0.15 per 1M input tokens and $0.47 per 1M output tokens, a 1M-token context window with 131K max output, and the API endpoint https://api.orcarouter.ai/v1.

Quién debería descargar esto — y quién no

{{1}}Descarga orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 si estás en Blackwell, quieres la menor huella de servidor de la colección Flash-Next con velocidad de núcleos tensoriales FP4 y estás haciendo el trabajo de investigación para el que existe esta línea.{{/1}} {{2}}Descarga Qwen3.8-Flash-Next-Uncensored-FP8 si estás en Hopper o quieres la ruta más ampliamente verificada.{{/2}} {{3}}Descarga la compilación GGUF si tienes una GPU de consumo o un equipo con CPU, la compilación MLX si tienes Apple Silicon, y nada en absoluto si el objetivo es un despliegue orientado al usuario final.{{/3}} {{4}}Lee la puerta de acceso y el aviso legal antes de aceptar cualquiera de los dos: son los términos del modelo, no una formalidad.{{/4}}

Las cinco compilaciones de Flash-Next — BF16, GGUF, MLX, FP8 y NVFP4 — están reunidas en la colección Qwen3.8-Flash-Next-Uncensored en Hugging Face.

Un modelo diferente, no otra compilación de este: Qwen3.8-27B-Uncensored está ablacionado de una base diferente y tiene su propia colección y sus propios runbooks.

Estos pesos son solo locales por diseño. Para contar con una línea base alojada contra la cual medir la compilación abliterada, Qwen3.8-Flash se sirve en OrcaRouter al precio de lista del proveedor con un margen del 0 % — el modelo estándar, con la alineación de seguridad intacta.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube