Tarjeta de título principal para la reseña de Qwen3.8-27B, titulada 'Reseña de Qwen3.8-27B' con el subtítulo 'El 27B de pesos abiertos que es un Opus en casa — probado frente al bombo publicitario', que muestra una insignia de pesos abiertos, una insignia de Apache 2.0 y un conjunto de iconos de GPU y servidor sobre un fondo blanco limpio con suaves acentos de degradado azul.
Guides & Insights

Reseña de Qwen3.8-27B: el 27B de peso abierto que es "Opus en casa" — probado frente al hype

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Qwen3.8 27B es el mejor 27B de pesos abiertos que puedes auto-alojar ahora mismo, y no tiene rival cercano. Los pesos se publicaron el 14 de agosto de 2026 bajo Apache 2.0: un 27B denso (28B contando el codificador de visión) con contexto nativo de 262K, entrada nativa de imagen y video, y puntuaciones de codificación agéntica reportadas por el proveedor que se sitúan en o por encima de Cla​ude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. El precio principal es cero: descarga 55.6 GB y ejecútalo. Las advertencias también son reales — las pruebas independientes muestran que es aproximadamente tres veces más lento y más hambriento de tokens que su predecesor, cada benchmark en la ficha sigue siendo reportado por Ali​baba, y el contexto de 1M es una característica exclusiva del servicio alojado. Veredicto: si tienes una GPU de 24 GB o más y quieres una capacidad cercana a la frontera sin una facturación por uso, auto-alójalo — pero entra sabiendo exactamente dónde son débiles los números.

Primero el veredicto: ¿deberías usar Qwen3.8 27B?

Respuesta breve — sí para cargas de trabajo locales y privadas; espera a ver las cifras de terceros antes de tomar una decisión de compra. Qwen3.8 27B es el modelo poco común donde los pesos abiertos son el producto y la API es la conveniencia. Como la licencia es Apache 2.0, el precio por token es permanentemente cero una vez que tienes el hardware, y nada de lo que construyas sobre él puede volver a licenciarse ni cobrarse retroactivamente. Lo que sacrificas es velocidad, verificación y conveniencia.

Si ya ejecutas Qwen3.6-27B y estás satisfecho con él, la mejora es real pero no gratuita en términos de tiempo de reloj. Si llegaste aquí desde el lanzamiento de Qwen3.8-Max, este es el miembro más pequeño y autoalojable de la misma generación: una herramienta diferente para un trabajo diferente.

Los datos rápidos, verificados el 15 de agosto de 2026.

Publicado — los pesos se publicaron el 14 de agosto de 2026 en Qwen/Qwen3.8-27B en Hugging Face, con espejo en ModelScope; la cobertura con husos horarios también menciona el 13 de agosto, y el lanzamiento se produjo aproximadamente una semana después de que se anunciara la generación Qwen3.8.

Licencia — Apache 2.0: descargar, modificar, redistribuir, uso comercial, con una concesión explícita de patentes. Permanente.

Parámetros — 27B denso (28B contando el codificador de visión), 64 capas, tamaño oculto 5,120, vocabulario 248,320.

Arquitectura — atención híbrida: 48 capas de atención lineal Gated DeltaNet frente a 16 capas completas de Atención Gated (una proporción 3:1). Por eso un modelo denso de 27B puede manejar 262K tokens de contexto nativo.

Contexto — 262,144 tokens de forma nativa; ampliable a 1,000,000 mediante YaRN en la versión alojada.

Entrada — imagen y video nativos junto con texto; devuelve texto. El codificador visual es el motivo por el que el conteo de parámetros indica 28B.

Pensamiento — modo de razonamiento activado por defecto y desactivable a petición; reasoning_effort (low/medium/high) y preserve_thinking para ejecuciones de agentes de larga duración.

Pesos — 55.6 GB de safetensors BF16 en 18 fragmentos; FP8 y GGUFs de la comunidad también se incluyen.

Las especificaciones anteriores provienen de la ficha del modelo y la configuración de Hugging Face para Qwen3.8 27B, leídas hoy. Las afirmaciones de los benchmarks son reportadas por Ali​baba; hasta la fecha, ningún laboratorio independiente las ha reproducido.

En qué es realmente bueno Qwen3.8 27B

El caso más fuerte es la ingeniería de software agéntica. Ali​baba informa de un salto de 3x en DeepSWE 1.1 sobre el anterior 27B (42.2 frente a 13.3) y una puntuación superior a Cla​ude Opus 4.6 Max en SWE-bench Pro (61.7 frente a 53.4). Esos son los números que le valieron el apodo de "Opus en casa": un denso 27B haciendo trabajo de codificación cercano a la frontera en hardware que una persona puede poseer de verdad.

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

Tres cosas además de los números brutos hacen que sea una compra defendible:

Multimodal nativo.Imágenes y video como entrada, texto como salida: un documento con diagramas o un video explicativo no es un modelo separado. Las puntuaciones de razonamiento visual (85.6 con la función de cadena de pensamiento habilitada, 94.6 en matemáticas visuales, ambas reportadas por el proveedor) son donde el codificador visual justifica su existencia.

Contexto nativo de 262K.Las tareas de agentes de horizonte largo, las grandes bases de código y las transcripciones de varias horas caben en una sola ventana. El diseño híbrido de atención lineal mantiene el costo de KV de ese contexto más bajo que un modelo puro de atención completa del mismo tamaño.

Pesos gratuitos y permanentes. Este es el punto central de la categoría: un modelo de API cerrada se alquila; Qwen3.8 27B es propiedad. Con cuantización de 4 bits funciona en una tarjeta de 24 GB (clase RTX 3090/4090), y AMD brindó soporte desde el primer día (hasta 24.5 tokens/s en un Ryzen AI Max+ 395 y 51.8 tokens/s en una Radeon AI PRO R9700, según el propio blog de AMD).

Donde la reseña se pone fea: velocidad, tokens y verificación

Las pruebas independientes hasta ahora son un banco de pruebas de un solo evaluador, no un laboratorio, pero es la mejor señal que tenemos. Ejecutando Qwen3.8 27B contra Qwen3.6-27B en diez tareas del mundo real (evaluadas por GPT-5.5 mediante el banco de pruebas llmcompare), el 3.8 ganó nueve de diez y obtuvo una puntuación media de 8.838 frente a 6.862 — «uno de los aumentos de inteligencia más impresionantes» que el evaluador había visto. También usó casi el triple de tokens y fue considerablemente más lento; una tarea tardó aproximadamente un 600% más. Así que el salto de calidad es real, y también lo es el precio en tiempo de reloj.

Cuatro cosas más que reprocharle:

Aún no hay benchmarks de terceros. Toda cifra destacada en este artículo es reportada por Ali​baba al 15 de agosto. La ficha del proveedor es detallada, pero aún no se ha realizado una reproducción por parte de un laboratorio independiente. Si tu decisión depende de números verificados, espéralos: los pesos seguirán ahí.

El mínimo de VRAM es real. BF16 necesita una GPU de clase 80 GB. Para que quepa en una tarjeta de 24 GB, debes usar la versión de 4 bits, y los informes de la comunidad (hilo de comentarios en dev.to, días después del lanzamiento) dicen que las versiones cuantizadas "pierden el foco después de un contexto largo." Pesos oficiales si tienes la VRAM; cuantizados si no la tienes.

El contexto de 1M solo está disponible en el alojamiento. Los pesos abiertos se limitan a 262K. La cifra ampliable a 1M es una función alojada de Qwe​n Cloud, no algo que una copia local haga de forma predeterminada.

"Beats Opus" necesita matices.Los benchmarks de agentes recompensan comportamientos específicos del harness, y un comentario destacado en el post de lanzamiento en dev.to lo dijo sin rodeos: "no le ganan a opus en uso del mundo real". Trata la tabla de puntuaciones como un límite superior en un buen día, no como una promesa.

Cómo se sitúa en la familia Qwe​n 3.8

vs Qwen3.6-27B — la misma clase de hardware y un contexto de 262K, pero un gran salto de capacidad a costa de la velocidad y la eficiencia de tokens. Si ya ejecutas 3.6 y estás limitado por el throughput, quedarte es defendible.

frente a Qwen3-Coder-30B-A3B — el Coder es un MoE con aproximadamente 3.300 millones de parámetros activos que funciona mucho más rápido (~90–110 tokens/s). El 27B denso es más lento por token, pero hereda las ganancias agénticas de la generación; si las puntuaciones de ingeniería de software del 27B se sostienen bajo pruebas independientes, el rol del Coder-30B se reduce.

vs Qwen3.8-Max — el buque insignia MoE de 2.4T es un modelo de centro de datos (solo API, alrededor de $2/$6 por millón de tokens según la cobertura publicada) con contexto de 1M y vídeo. El de 27B es el que se puede desplegar. Responden a preguntas diferentes.

Costo: la cuestión de local versus API, resuelta.

Para un modelo cerrado, comparas precios por token. Para Qwen3.8 27B el token marginal no cuesta nada en tu propio hardware — el precio real es la GPU inicial y tu tiempo. En 4 bits, eso es una tarjeta de 24 GB; en BF16, es una máquina de clase 80 GB. Si solo necesitas evaluar el modelo, o no tienes el hardware, existe la ruta alojada: OrcaRouter ahora lista Qwen3.8 27B con un nivel gratuito con límite de tasa que cobra $0 y devuelve HTTP 429 una vez superado el límite, además de un nivel de pago a $0.33 por millón de tokens de entrada y $2.40 por millón de tokens de salida (verificado el 15 de agosto). La versión alojada de Qwe​n Cloud, con el contexto de 1M, está marcada como "próximamente."

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

El planteamiento honesto: para un modelo de pesos abiertos, un proveedor es una conveniencia, no una dependencia. El nivel gratuito es la forma más barata de decidir si una descarga de 55,6 GB vale la pena. Pero una vez que has decidido, los pesos son lo esencial — y son gratuitos.

Cómo probarlo de verdad

Evaluación más rápida — prueba el nivel alojado gratuito con límite de velocidad; si responde lo que necesitas, ya está, y no cuesta nada.

Prueba real en tu hardware — descarga un GGUF de la comunidad (la versión Q4_K_M pesa aproximadamente 17 GB y cabe en una tarjeta de 24 GB) y ejecútalo en llama.cpp u Ollama. Pasa la plantilla de chat Jinja o el modelo te responde en etiquetas de pensamiento. Para visión desde un GGUF también necesitas el archivo mmproj separado. Nuestra guía sobre cómo ejecutar Qwen3.8 27B localmente lo explica paso a paso.

Precisión completa — huggingface-cli download Qwen/Qwen3.8-27B en una GPU de clase 80 GB.

Verifica lo que descargaste — comprueba que el editor es la organización Qwe​n y valida los shards contra crc32.txt; aparecieron repositorios similares antes del lanzamiento.

Cuando esta reseña es incorrecta (y quién debería saltarse Qwen3.8 27B)

No tienes GPU y no alquilarás una. El nivel gratuito tiene un límite de tasa y el nivel de pago cuesta $0.33/$2.40 por millón — un modelo API pequeño puede servirte más barato y con mayor fiabilidad. Este modelo es para quienes quieren ser dueños de la inferencia.

Necesitas un SLA. El nivel alojado tiene solo unos días; la página del modelo OrcaRouter, consultada hoy, muestra una tasa de error del 33.3 % en los últimos siete días y una latencia p50 del primer token de 225 ms. Es un modelo completamente nuevo bajo carga temprana, no un contrato de producción. Quienes lo autoalojen deberían fijar el commit de descarga y mantener una alternativa.

Necesita puntos de referencia verificados para una decisión de compra. Las cifras reportadas por los proveedores son útiles como orientación, no aptas para adquisiciones. Espere a que sean reproducidas de forma independiente.

El contexto de 262K con pesos abiertos no es suficiente. La extensión de 1M solo está disponible en versión alojada por ahora.

El rendimiento es tu cuello de botella. El resumen en bloque o los lotes grandes serán un problema: este es un modelo denso de 27B que además consume aproximadamente 3 veces los tokens de su predecesor. Para trabajo masivo de bajo costo, gana un modelo más pequeño o más rápido.

Estás en una tarjeta de 12 GB. Los GGUFs de 2 bits apenas caben con una pérdida de calidad visible; este no es el modelo para ti.

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

El resultado final

Qwen3.8 27B es el 27B de pesos abiertos más potente disponible hoy en día, y es gratis para siempre bajo Apache 2.0. Si tienes una GPU de 24 GB+ y quieres codificación agéntica, contexto de 262K y entrada nativa de imagen/video sin facturación por uso, este es el modelo a comprar. Las razones para esperar son igualmente concretas: necesitas confirmación independiente de los benchmarks, un SLA, más de 262K de contexto en pesos abiertos, o mayor rendimiento que el que te da un 27B denso. El modelo está disponible, los pesos son reales y los números son buenos — solo recuerda de quién son esos números.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube