
Qwen3.8-27B Benchmarks: La tabla completa, con las salvedades adjuntas
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
Qwen3.8-27B obtiene 73,0 en Terminal-Bench 2.1, 61,7 en SWE-bench Pro, 90,3 en LiveCodeBench v6 y 84,3 en OSWorld-Verified, y cada una de esas cifras es de Alibaba. El modelo de pesos abiertos de 27 mil millones de parámetros se publicó en Hugging Face el 14 de agosto de 2026 bajo Apache 2.0, y a fecha de 15 de agosto nadie fuera de Alibaba ha evaluado de forma independiente su calidad. Esta página es el resumen completo y con fuentes: los 25 benchmarks oficiales de la ficha del modelo, qué cambió respecto a su predecesor Qwen3.6-27B, qué midió una prueba independiente de rendimiento de AMD y qué afirmaciones debes considerar provisionales.
Una guía de lectura antes de los números: "oficial" aquí significa la evaluación de Alibaba impresa en la tarjeta del modelo en Qwen/Qwen3.8-27B. Está reportada por el proveedor y no ha sido reproducida. "Independiente" significa que alguien fuera del laboratorio la midió — hasta ahora eso se aplica solo al rendimiento del hardware, no a ninguna puntuación de calidad. Los benchmarks cuyo entorno de evaluación importa se señalan en línea.
El modelo, una línea por especificación
27B parámetros densos (28B contando el codificador de visión), 64 capas, tamaño oculto 5120.
• Atención híbrida — 48 capas de atención lineal Gated DeltaNet más 16 capas de atención completa, una proporción de 3:1 — que es lo que hace que una ventana de 262K tokens sea asequible de ejecutar.
• 262,144 tokens de contexto nativo, extensible a 1,000,000 con escalado YaRN.
• Entrada nativa de imágenes y video (salida de texto), pesos Apache 2.0, aproximadamente 55,6 GB en BF16.
La versión corta: este es el modelo diseñado para tomar lo que Alibaba aprendió al construir el Qwen3.8-Max de 2,4 billones de parámetros y comprimirlo en algo que una sola GPU pueda ejecutar.
La tabla de resultados: todos los benchmarks en la tarjeta del modelo
Todas las puntuaciones que se indican a continuación son las reportadas por Alibaba en la tarjeta del modelo del 14 de agosto; entre paréntesis se muestra la puntuación de Qwen3.6-27B, al cual el modelo reemplaza.
Codificación. Terminal-Bench 2.1 (codificación de terminal basada en agentes) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Las ejecuciones de SWE-bench Pro y QwenSWEBench usaron el entorno de evaluación de Claude Code, según una nota al pie de la ficha del modelo — algo a tener en cuenta antes de compararlas con un modelo evaluado con un entorno diferente.
Agentes de largo horizonte y trabajo de oficina. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / puntuación 42.9 (10.6 / 27.3).
Razonamiento y conocimiento. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench seguimiento de instrucciones 79.5 (69.1). HLE es evaluado por GPT-4o, según la ficha.
Visión y uso de computadora.OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 con CI / 90.0 sin (85.1); BabyVision 85.6 con CI / 65.7 sin (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). «CI» es la mejora en tiempo de inferencia de Alibaba; la diferencia entre sus estados activado y desactivado es la cifra más informativa de la tarjeta sobre cuánta puntuación se puede comprar con cómputo de inferencia adicional.

Qué cambió realmente en comparación con Qwen3.6-27B
Todos los puntos de referencia de la tarjeta aumentaron, pero los deltas no son uniformes — y la forma de la mejora es la historia. Las ganancias se concentran en la codificación agéntica y el uso de computadoras, no en el recuerdo de conocimientos:
• DeepSWE 1.1 (codificación agéntica) 13.3 → 42.2, aproximadamente un salto de 3x
• QwenSWEBench 49.3 → 79.0
• Puntuación del último examen de los agentes: 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 y AndroidWorld 70.3 → 81.9
BabyVision (con CI) 28.9 → 85.6 — la mayor ganancia relativa en la tarjeta.
Mientras tanto, GPQA Diamond pasó de 87.8 a 89.2 y RealWorldQA de 84.1 a 85.9: una mejora real pero pequeña. Esta no es una versión "más inteligente en todo". Es una versión dirigida directamente a agentes que leen pantallas, usan herramientas y escriben código a lo largo de muchos pasos.

Las brechas honestas: dónde todavía pierde, y las advertencias metodológicas
Frente a la frontera, el panorama es halagador pero no unilateral. Donde Qwen3.8-27B y Claude Opus 4.6 Max se superponen, Qwen gana la mayoría — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench y todo el bloque de visión. Contra Muse Glimmer-30B de Meta, el rival natural de clase local, gana los ocho benchmarks superpuestos sin discusión. Pero aún pierde Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) y NL2Repo-Bench (42.3 vs 47.6) frente a Claude Opus 4.6 Max. Si tu carga de trabajo es el razonamiento de frontera más difícil — matemáticas de frontera, preguntas masivamente multidisciplinarias — el 27B aún no está a la altura.
Tres advertencias antes de que cites cualquiera de esto. Primera: nada de esto está verificado de forma independiente; no hay ningún índice de Artificial Analysis ni ninguna ejecución de LMArena para el modelo de 27B al 15 de agosto, y los propios arneses de Alibaba no son los que usarán terceros. Segunda: la ficha del modelo usa el arnés de Claude Code para SWE-bench Pro y QwenSWEBench, y un juez GPT-4o para Humanity's Last Exam; las comparaciones con modelos evaluados en otras configuraciones moverán las cifras. Tercera: la ejecución de MathVision de Alibaba usó un prompt fijo, mientras que los competidores obtuvieron la mayor de dos variantes. Nada de esto significa que los resultados sean incorrectos; significa que son un techo, no un suelo, hasta que alguien más ejecute el modelo.
Lo que se necesita para ejecutarlo
Qwen3.8-27B es un modelo local, lo que cambia el significado de "rendimiento": rendimiento en tu propio hardware en lugar de una tabla de precios. Los pesos BF16 son de aproximadamente 55,6 GB; cuantizados a 4 bits caben en una tarjeta de 24 GB como una RTX 3090 o 4090. AMD lanzó soporte Day-0 el día del lanzamiento, y sus propias mediciones de llama.cpp/Vulkan — agosto de 2026, promediando tres o más ejecuciones — lo sitúan en 24,5 tokens/s en un Ryzen AI Max+ 395 y 51,8 tokens/s en una Radeon AI PRO R9700 con 32 GB, en sistemas con más de aproximadamente 24 GB de memoria gráfica variable o VRAM. Las pruebas de la comunidad de la versión FP8 en una NVIDIA GH200 mantuvieron 10 solicitudes concurrentes de contexto de 262K con un tiempo hasta el primer token inferior a 10 ms. Tus propios números diferirán — esos son GPUs de otra persona — pero la forma es real: esta es la primera versión de Qwen en esta clase que se ejecuta, no solo en una reseña, en una sola estación de trabajo.
¿Pesos gratuitos o una API de pago?
La decisión que este modelo obliga a tomar es la que divide lo local de lo alojado: los pesos no cuestan nada, pero tus GPUs no son gratis. Autoalojarse significa ser dueño del silicio: una tarjeta de 24GB si aceptas la cuantización de 4 bits y una generación más lenta, algo más grande si quieres el contexto completo de 262K a plena calidad. La alternativa alojada en OrcaRouter es de $0.33 por millón de tokens de entrada y $2.40 por millón de salida, con el mismo contexto de 262K y entrada de imagen más video, y un tiempo hasta el primer token p50 de 225ms medido durante los últimos siete días: sin GPU que comprar, sin VRAM que vigilar. La aritmética es la que siempre haces con pesos abiertos: el rendimiento de tokens que realmente necesitas multiplicado por tu costo por token, frente al precio fijo de una tarjeta. Con un volumen alto y sostenido, el autoalojamiento gana; con un volumen irregular o modesto, pagar $0.33/$2.40 supera a comprar silicio que mantienes mayormente inactivo.

En resumen
Qwen3.8-27B es el modelo de pesos abiertos más potente que Alibaba ha lanzado en esta clase de tamaño, según los propios datos de Alibaba: el mejor de la tabla en codificación agéntica, uso de computadora y razonamiento visual, con una ventana de contexto de 262K y pesos bajo licencia Apache 2.0. La lectura correcta de la tabla de resultados es condicional: cada cifra es reportada por el proveedor, específica del entorno de evaluación y aún no ha sido reproducida, y los modelos de frontera siguen ganando en los benchmarks de razonamiento más difíciles. Si estás decidiendo si alojarlo tú mismo o usarlo como API, trata la tabla de benchmarks como la promesa y las cifras de rendimiento de AMD como la única medición independiente que existe hoy. Actualizaremos esta página el día en que un laboratorio independiente publique una puntuación.
