Tarjeta de título para el resumen de evaluaciones comparativas de Qwen3.8-27B, que muestra un informe de evaluación con un sello que dice OPEN WEIGHTS e iconos para codificación, rendimiento, visión, contexto largo y hardware local, con etiquetas que dicen 27B DENSE, 262K CONTEXT y APACHE 2.0.
Guides & Insights

Qwen3.8-27B Benchmarks: La tabla completa, con las salvedades adjuntas

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Qwen/Qwen3.8-27B obtiene 73.0 en Terminal-Bench 2.1, 61.7 en SWE-bench Pro, 90.3 en LiveCodeBench v6 y 84.3 en OSWorld-Verified — y cada una de esas cifras es de la propia Alibaba. El modelo de pesos abiertos de 27 mil millones de parámetros llegó a Hugging Face el 14 de agosto de 2026 bajo la licencia Apache 2.0, y en sus primeras dos semanas obtuvo tres resultados independientes de terceros: el puesto #1 en pesos abiertos en el benchmark Legal Agent de Harvey, en un estudio realizado por la empresa de IA legal Harvey y la empresa de memoria Engram; un puesto #9 en la clasificación general del leaderboard WebDev de Code Arena, el único modelo de su clase de tamaño dentro del top 10, según el anuncio de Alibaba del 25 de agosto; y, anunciado el 26 de agosto, el puesto #1 en pesos abiertos en el leaderboard Image-to-WebDev de Arena.ai, clasificado #7 en general con una puntuación reportada de 1,574. Esta página es el resumen completo y con fuentes: los 25 benchmarks oficiales de la ficha del modelo, qué cambió con respecto a su predecesor Qwen3.6-27B, qué midió una prueba de rendimiento independiente de AMD, esos resultados de legal-agent y webdev-arena, y qué afirmaciones deberías considerar aún provisionales.

Una guía de lectura antes de los números: {{1}}"oficial" aquí significa la evaluación de Alibaba impresa en la tarjeta del modelo en Qwen/Qwen3.8-27B{{/1}}. La reporta el proveedor y no ha sido reproducida. {{2}}"Independiente" significa que alguien externo al laboratorio la midió{{/2}} — hasta ahora eso cubre una prueba de rendimiento de hardware, un estudio de agentes en el ámbito legal y posiciones en dos de los rankings de desarrollo web de Arena.ai, el WebDev de Code Arena y la arena Image-to-WebDev. Los benchmarks cuyo harness importa se marcan en línea.

El modelo, una línea por especificación

27B parámetros densos (28B contando el codificador de visión), 64 capas, tamaño oculto 5120.

• Atención híbrida — 48 capas de atención lineal Gated DeltaNet más 16 capas de atención completa, una proporción de 3:1 — que es lo que hace que una ventana de 262K tokens sea asequible de ejecutar.

• 262,144 tokens de contexto nativo, extensible a 1,000,000 con escalado YaRN.

• Entrada nativa de imágenes y video (salida de texto), pesos Apache 2.0, aproximadamente 55,6 GB en BF16.

La versión corta: este es el modelo diseñado para tomar lo que Alibaba aprendió al construir el Qwen3.8-Max de 2,4 billones de parámetros y comprimirlo en algo que una sola GPU pueda ejecutar.

La tabla de resultados: todos los benchmarks en la tarjeta del modelo

Todas las puntuaciones que se indican a continuación son las reportadas por Alibaba en la tarjeta del modelo del 14 de agosto; entre paréntesis se muestra la puntuación de Qwen3.6-27B, al cual el modelo reemplaza.

Codificación. Terminal-Bench 2.1 (codificación de terminal basada en agentes) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Las ejecuciones de SWE-bench Pro y QwenSWEBench usaron el entorno de evaluación de Claude Code, según una nota al pie de la ficha del modelo — algo a tener en cuenta antes de compararlas con un modelo evaluado con un entorno diferente.

Agentes de largo horizonte y trabajo de oficina. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / puntuación 42.9 (10.6 / 27.3).

Razonamiento y conocimiento. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench seguimiento de instrucciones 79.5 (69.1). HLE es evaluado por GPT-4o, según la ficha.

Visión y uso de computadora.OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 con CI / 90.0 sin (85.1); BabyVision 85.6 con CI / 65.7 sin (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). «CI» es la mejora en tiempo de inferencia de Alibaba; la diferencia entre sus estados activado y desactivado es la cifra más informativa de la tarjeta sobre cuánta puntuación se puede comprar con cómputo de inferencia adicional.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Qué cambió realmente en comparación con Qwen3.6-27B

Todos los puntos de referencia de la tarjeta aumentaron, pero los deltas no son uniformes — y la forma de la mejora es la historia. Las ganancias se concentran en la codificación agéntica y el uso de computadoras, no en el recuerdo de conocimientos:

• DeepSWE 1.1 (codificación agéntica) 13.3 → 42.2, aproximadamente un salto de 3x

• QwenSWEBench 49.3 → 79.0

• Puntuación del último examen de los agentes: 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 y AndroidWorld 70.3 → 81.9

BabyVision (con CI) 28.9 → 85.6 — la mayor ganancia relativa en la tarjeta.

Mientras tanto, GPQA Diamond pasó de 87.8 a 89.2 y RealWorldQA de 84.1 a 85.9: una mejora real pero pequeña. Esta no es una versión "más inteligente en todo". Es una versión dirigida directamente a agentes que leen pantallas, usan herramientas y escriben código a lo largo de muchos pasos.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Desde que se publicó esta página, el desarrollo más importante es legal, no técnico. Alibaba anunció que Qw​en3.8-27B es el modelo de pesos abiertos n.º 1 en el benchmark Legal Agent de Harvey — una afirmación de clasificación proveniente del propio proveedor, por lo que trátala como declaración de Alibaba. El resultado que respalda esta afirmación es un estudio que no es de Alibaba: Harvey, la empresa de IA legal, y Engram, una startup de memoria de IA, construyeron un bufete de abogados sintético llamado Calderwood & Harkness a partir de más de 100 millones de tokens en aproximadamente 10,000 documentos y 266 asuntos, y luego adaptaron Qw​en3.8-27B a dicho bufete con memoria paramétrica, notas comprimidas y una herramienta de recuperación.

En 250 tareas legales, el 27B adaptado promedió un 67 %, superando a todos los modelos probados en el estudio —incluido Claude Opus 4.8— y en la corrección estricta de todo o nada, aventajó a Opus 4.8 por 30 % frente a 25 %, a aproximadamente $0.13 por consulta frente a $1.32 para Opus 4.8. Esas cifras son las reportadas por Harvey/Engram y aún no han sido reproducidas de forma independiente. Antes de entrenarse con los documentos propios de la firma, el mismo modelo obtuvo solo un 4,7 % en preguntas específicas de la firma; después de estudiarlos, un 72,6 %.

Lee el {{1}}#1{{/1}} con una gran salvedad: el modelo que encabezó el benchmark había estudiado el corpus de prueba de antemano, adaptado con los 100M de tokens de la empresa antes de ser evaluado. Eso lo convierte en una demostración de lo que el 27B puede absorber con un ajuste específico de dominio, no en una puntuación para los pesos estándar de Apache-2.0 en un banco de pruebas neutral — y cubre un solo dominio, el derecho, no la calidad general. Lo que sí respalda es el argumento detrás del tweet: un 27B lo suficientemente pequeño como para ejecutarse en una máquina local es bastante potente para un trabajo de nivel profesional una vez que tiene el conocimiento adecuado.

El segundo resultado independiente: #9 en general en WebDev de Code Arena

El segundo resultado independiente es uno de codificación, y es la razón por la que esta página cambió el 25 de agosto. Code Arena es el ranking de desarrollo web de Arena.ai — el proyecto anteriormente conocido como WebDev Arena, en el sitio anteriormente conocido como LMArena — donde los usuarios crean aplicaciones reales con pares anonimizados de modelos y votan por cuál resultado preferirían publicar. En ese ranking público, Qw​en3.8-27B se sitúa en el #9 en general con una puntuación de 1595, el único modelo de su clase de tamaño dentro del top 10.

La ubicación es la parte independiente: está en un ranking de terceros que cualquiera puede abrir. El titular que la rodea es declarado por Alibaba: el encuadre de "único modelo pequeño en el top 10", y las ubicaciones complementarias, provienen del anuncio del 25 de agosto de Qw​en. Merece la pena repetirlos con esa etiqueta. El 27B ocupa seis puestos por debajo del mucho más grande Qwen3.8-Max (que el anuncio sitúa en el #3 general), y muy por delante del Gemma 4-31B, de tamaño similar (que el mismo anuncio sitúa en el #80). El punto no es que un 27B supere a los modelos de frontera en la creación de aplicaciones web; es que un modelo lo bastante pequeño como para ejecutarse en una sola GPU está dentro del top diez de una arena de codificación a ciegas cuyos otros ocupantes son modelos mucho más grandes.

El tercer resultado independiente: #1 modelo abierto en Image-to-WebDev de Arena.ai.

El tercer resultado independiente llegó el 26 de agosto, y es el más fuerte hasta ahora para un modelo de este tamaño. Image-to-WebDev es el tablero hermano de WebDev de Code Arena en Arena.ai — la arena donde a un modelo se le da una captura de pantalla u otra referencia visual y tiene que convertirla en una interfaz web funcional, con votantes humanos ciegos eligiendo el resultado que preferirían publicar. En esa tabla de clasificación pública, Qw​en3.8-27B ocupa el puesto #1 entre los modelos abiertos y el #7 en general, con una puntuación de arena reportada de 1,574.

La posición es la parte independiente: está en una tabla de clasificación de terceros que cualquiera puede abrir. El titular que la rodea es declaración de Alibaba: el anuncio del equipo Qwen del 26 de agosto presenta el 27B como «a la par con modelos 100 veces su tamaño» en esta prueba, una comparación que la tabla de clasificación no documenta. Y un ranking de preferencias no es un veredicto de calidad de código: los votos de Image-to-WebDev miden qué resultado preferiría un humano lanzar, no si el HTML es seguro, accesible o mantenible. Lo que el resultado sí establece es que un modelo de pesos abiertos de 27B ahora lidera todo el campo abierto a la hora de convertir una imagen en una página, que es la habilidad sobre la que se construye la creciente categoría de productos «screenshot to site».

Las brechas honestas: dónde todavía pierde, y las advertencias metodológicas

Frente a la frontera, el panorama es halagador pero no unilateral. Donde Qw​en3.8-27B y Claude Opus 4.6 Max se superponen, Qw​en gana la mayoría — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, y todo el bloque de visión. Contra el Muse Glimmer-30B de Meta, el rival natural de clase local, gana los ocho benchmarks superpuestos de manera contundente. Pero aún pierde Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) y NL2Repo-Bench (42.3 vs 47.6) frente a Claude Opus 4.6 Max. Si tu carga de trabajo es el razonamiento de frontera más difícil — matemáticas de frontera, preguntas masivamente multidisciplinarias — el 27B aún no está a la altura.

Tres advertencias antes de citar nada de esto. Primero, la tabla de la tarjeta del modelo anterior sigue siendo totalmente reportada por Alibaba — aún no hay un índice de Artificial Analysis para el 27B. Ahora tiene tres resultados independientes de terceros, pero cada uno es limitado: el ranking de Code Arena mide la creación de aplicaciones web a partir de indicaciones de texto, el ranking de Image-to-WebDev mide convertir una captura de pantalla en una página funcional, ambos juzgados por votos ciegos sobre resultados anonimizados, y el estudio del agente legal de Harvey cubre un solo dominio con un modelo entrenado para la prueba. Ninguno es el de los pesos originales ejecutados en un banco de pruebas de propósito general. Segundo, la tarjeta del modelo usa el banco de pruebas de Claude Code para SWE-bench Pro y QwenSWEBench, y un juez GPT-4o para Humanity's Last Exam — las comparaciones con modelos evaluados en otras configuraciones cambiarán las cifras. Tercero, la ejecución de MathVision de Alibaba usó un prompt fijo mientras que los competidores obtuvieron el más alto de dos variantes. Nada de esto significa que los resultados sean incorrectos; significa que son un techo, no un piso, hasta que laboratorios independientes ejecuten el modelo en bancos de pruebas neutrales de propósito general.

Lo que se necesita para ejecutarlo

Qw​en3.8-27B es un modelo local, lo que cambia el significado de «rendimiento»: rendimiento en tu propio hardware en lugar de una tarjeta de precios. Los pesos BF16 ocupan aproximadamente 55,6 GB; cuantizados a 4 bits caben en una tarjeta de 24 GB como una RTX 3090 o 4090. AMD ofreció soporte Day-0 el día del lanzamiento, y sus propias mediciones con llama.cpp/Vulkan —agosto de 2026, con un promedio de tres o más ejecuciones— lo sitúan en 24,5 tokens/s en una Ryzen AI Max+ 395 y 51,8 tokens/s en una Radeon AI PRO R9700 con 32 GB, en sistemas con más de aproximadamente 24 GB de memoria gráfica variable o VRAM. Las pruebas de la comunidad con la versión FP8 en una NVIDIA GH200 mantuvieron 10 solicitudes concurrentes de contexto de 262K con un tiempo hasta el primer token inferior a 10 ms. Tus propios números diferirán —son GPU de otra persona— pero la tendencia es real: esta es la primera versión de Qw​en en esta clase que se ejecuta en una sola estación de trabajo, no solo en una reseña.

¿Pesos gratuitos o una API de pago?

La decisión que este modelo obliga a tomar es la que divide lo local de lo alojado: los pesos no cuestan nada, pero tus GPUs no son gratis. Autoalojarse significa ser dueño del silicio: una tarjeta de 24GB si aceptas la cuantización de 4 bits y una generación más lenta, algo más grande si quieres el contexto completo de 262K a plena calidad. La alternativa alojada en OrcaRouter es de $0.33 por millón de tokens de entrada y $2.40 por millón de salida, con el mismo contexto de 262K y entrada de imagen más video, y un tiempo hasta el primer token p50 de 225ms medido durante los últimos siete días: sin GPU que comprar, sin VRAM que vigilar. La aritmética es la que siempre haces con pesos abiertos: el rendimiento de tokens que realmente necesitas multiplicado por tu costo por token, frente al precio fijo de una tarjeta. Con un volumen alto y sostenido, el autoalojamiento gana; con un volumen irregular o modesto, pagar $0.33/$2.40 supera a comprar silicio que mantienes mayormente inactivo.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

En resumen

Qwen3.8-27B es el modelo de pesos abiertos más potente que Alibaba ha lanzado en esta clase de tamaño, según las propias cifras de Alibaba: el mejor de la tabla en codificación agéntica, uso de computadora y razonamiento visual, con una ventana de contexto de 262K y pesos con licencia Apache 2.0. La lectura correcta de la tabla de resultados es condicional — cada cifra de la ficha del modelo es reportada por el proveedor, específica del entorno de evaluación y aún no reproducida, y los modelos de frontera todavía ganan en los benchmarks de razonamiento más difíciles. Si estás decidiendo si alojarlo por tu cuenta o llamarlo como API, trata la tabla de benchmarks como la promesa, las cifras de rendimiento de AMD como la primera medición de hardware independiente, el resultado del agente legal de Harvey como la primera señal independiente de que la capacidad del modelo sobrevive fuera de los entornos de evaluación propios de Alibaba, y los dos puestos en la arena de desarrollo web — #9 en general en WebDev de Code Arena y #1 modelo abierto en Image-to-WebDev de Arena.ai — como las primeras confirmaciones independientes en tablas de clasificación de codificación de esa capacidad. Actualizaremos esta página a medida que más laboratorios independientes publiquen puntuaciones.