Una tarjeta de título principal para «AesCode 32B vs Qwen3.8 27B», con el subtítulo «el fine-tune y el ancestro», dibujada como un diagrama de linaje: una tarjeta de checkpoint Qwen3-VL-32B-Instruct a la izquierda alimenta con una flecha a una tarjeta «AesCode 32B fine-tune» etiquetada «solo autoalojado, 65 GB», mientras que una tarjeta más nueva y separada abajo a la derecha etiquetada «Qwen3.8 27B» lleva un marcador de API en vivo que dice «invocable hoy»; el logotipo de OrcaRouter se encuentra en la esquina inferior derecha.
Guides & Insights

AesCode 32B vs Qwen3.8 27B: Microsoft lo construyó sobre Qwen, y uno de ellos es invocable

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El detalle que reorganiza toda esta comparación está en la segunda línea de la tarjeta del modelo: AesCode 32B parte de Qwen3-VL-32B-Instruct. El modelo de código específico de diseño de Microsoft es un ajuste fino de Qwen3-VL, Apache 2.0, alojado en un repositorio de Hugging Face creado el 29 de septiembre de 2026, con el commit titulado "Release AesCode-32B" fechado el 7 de octubre de 2026 y sin ningún anuncio por parte de Microsoft. Qwen3.8 27B es el otro extremo de ese linaje: el propio modelo multimodal denso de 27B con pesos abiertos del proveedor, lanzado el 14 de agosto de 2026 bajo Apache 2.0, la arquitectura sucesora del checkpoint VL que Microsoft ajustó. Así que esto no es una comparación entre los productos insignia de dos proveedores. Es una comparación entre el modelo de pesos abiertos de propósito general de un laboratorio y el ajuste fino de investigación de la familia de un competidor, y la diferencia práctica entre ambos resulta ser casi en su totalidad sobre lo que se te permite hacer con el archivo una vez que lo tienes.

Misma licencia, misma familia, diferente cantidad de modelo

Ambos son Apache 2.0, ambos aceptan imágenes además de texto, y ambos devuelven texto. A partir de ahí, todo diverge, y la fila de despliegue es la que más diverge.

• Parámetros — AesCode 32B: 33B denso sobre una base Qwen3-VL-32B-Instruct. Qwen3.8 27B: 27B denso, 28B contando el codificador de visión, 64 capas con un tamaño oculto de 5120.

Memoria para ejecutarlo — AesCode 32B: la ficha aconseja planificar aproximadamente 65 GB de memoria de acelerador solo para los parámetros bf16, y su propio ejemplo de servicio utiliza paralelismo tensorial de cuatro vías. Qwen3.8 27B: aproximadamente 55.6 GB en bf16.

• Contexto — AesCode 32B: 24.576 tokens en la configuración reportada, con los prompts y las respuestas durante el entrenamiento limitados a 8.192. Qwen3.8 27B: 262.144 tokens nativos, ampliables a 1.000.000 con escalado YaRN.

• Atención — AesCode 32B: heredado del backbone Qwen3-VL. Qwen3.8 27B: híbrido, 48 capas de atención lineal Gated DeltaNet frente a 16 capas de atención completa en una proporción de 3:1, que es lo que hace que una ventana de 262K sea asequible de servir.

• Para qué sirve — AesCode 32B: generar artefactos visuales ricos en información como HTML y CSS editables, además de investigación sobre generación de código multimodal. Qwen3.8 27B: trabajo agéntico y multimodal general — programación, uso de computadora, comprensión de documentos y videos, invocación de herramientas.

• Dónde conseguirlo — AesCode 32B: una descarga de Hugging Face; ningún proveedor de inferencia lo despliega. Qwen3.8 27B: los pesos, o un endpoint alojado.

El doble de contexto, una huella ligeramente más pequeña, un backbone de una generación más reciente y una licencia idéntica. La única fila en la que AesCode 32B gana de forma contundente es la primera, y lo hace con un ajuste fino específico para la tarea.

En qué se midió realmente cada uno

Los dos regímenes de evaluación no se tocan, y fingir lo contrario es el error habitual en páginas como esta.

La ficha de Qwen3.8 27B es amplia y específica a la vez. Programación: Terminal-Bench 2.1 con 73.0, SWE-bench Pro con 61.7, QwenSWEBench con 79.0, LiveCodeBench v6 con 90.3. Razonamiento: GPQA Diamond 89.2, Humanity's Last Exam 30.8. Uso de computadora: OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9. Visión: MathVision 94.6 con la mejora en el momento de inferencia del proveedor y 90.0 sin ella, OmniDocBench 1.5 con 91.1. Todo son cifras del propio proveedor en su propio harness — con una nota al pie que vale la pena leer: que las ejecuciones de SWE-bench Pro y QwenSWEBench usaron el harness de Claude Code, por lo que no son directamente comparables con modelos evaluados en uno diferente.

AesCode 32B tiene un único benchmark y es de un solo propósito: 300 muestras de infografías, tres generaciones por prompt sin selección, renderizadas y puntuadas en siete canales. El resultado principal es un Overall de 85.89 con la imagen de referencia proporcionada, frente a 81.28 de GPT-5.5 y 80.39 de Claude Opus 4.8 bajo el mismo arnés de evaluación — además de la afirmación de que AesCode 32B supera a su propio backbone Qwen3-VL-32B por 22.4 puntos en la dimensión Visual y 24.8 en Overall.

Ponlos uno al lado del otro y nada coincide. Terminal-Bench mide si una tarea de shell se completa; la evaluación de AesCode mide si el texto de una infografía es legible, si su diseño no desborda el lienzo y si su tabla es una tabla HTML real. No hay ninguna métrica compartida, ningún harness compartido ni ninguna tarea compartida. La única afirmación honesta es que AesCode 32B es mucho mejor con artefactos de diseño que su propio backbone, y que Qwen3.8 27B es un modelo general sólido — y ninguna de las dos afirmaciones te dice nada sobre la otra.

A two-column comparison scoreboard for AesCode 32B and Qwen3.8 27B: the AesCode 32B column reads 'Parameters: 33B dense (Qwen3-VL-32B base)', 'Memory to run it: about 65 GB bf16, 4-way TP', 'Context: 24,576 tokens', 'Attention: inherited from the Qwen3-VL backbone', 'Where you get it: a Hugging Face download', 'Measured on: one 300-sample infographic benchmark'; the Qwen3.8 27B column reads 'Parameters: 27B dense (28B with vision tower)', 'Memory to run it: about 55.6 GB bf16', 'Context: 262,144 native, 1M with YaRN', 'Attention: hybrid Gated DeltaNet, 3:1 ratio', 'Where you get it: weights or a hosted endpoint', 'Measured on: Terminal-Bench 2.1, SWE-bench Pro, GPQA Diamond and more'; a footer line reads 'AesCode 32B figures Microsoft-reported on its own harness; Qwen3.8 27B figures Alibaba-reported with independent scoring from Artificial Analysis.' and the OrcaRouter logo sits in the bottom-right corner.

La brecha de evidencia es real esta vez, en una dirección.

Los benchmarks de proveedores son la norma en esta industria, así que importa que estos dos difieran en cuánto de sus afirmaciones como proveedores ha verificado alguien más.

Qwen3.8 27B se lanzó con la tabla propia del proveedor y luego acumuló resultados externos en cuestión de semanas. El historial independiente del modelo incluye un estudio de agentes legales realizado por la empresa de IA legal Harvey junto con la startup de memoria Engram, en el que un Qwen3.8 27B adaptado superó a todos los modelos que probó el estudio, incluido Claude Opus 4.8, en 250 tareas legales, con la importante salvedad de que el modelo adaptado había estudiado primero el corpus de 100 millones de tokens de la firma evaluada, por lo que es un resultado tanto sobre la adaptación como sobre el modelo. Incluye una posición en la tabla de clasificación WebDev de Code Arena y el primer puesto de pesos abiertos en la tabla de clasificación Image-to-WebDev de Arena.ai, y ambos son afirmaciones de clasificación retransmitidas por el proveedor en lugar de una metodología publicada. Y incluye una tabla de terceros con una puntuación publicada: Artificial Analysis registra a Qwen3.8 27B con 33.70 en su Intelligence Index, con un costo por tarea finalizada de alrededor de $1.01, y publica el desglose de tokens que respalda esa cifra.

AesCode 32B no tiene nada de eso. Sin colocación en arena, sin aparición en tablas de clasificación, sin reproducción por terceros, sin prueba de rendimiento independiente — y no porque alguien lo haya examinado y lo haya encontrado deficiente, sino porque un checkpoint que ningún proveedor sirve no puede ser evaluado por un arnés externo en primer lugar. Sus cifras son las del proveedor, calculadas por la misma pila de verificación que entrenó al modelo, sobre muestras que el proveedor eligió, frente a líneas base que el proveedor ejecutó. La publicación es inusualmente transparente sobre el método — los nombres de los canales de recompensa, los recuentos de rollout, los parámetros de decodificación y las tasas de fallo están todos publicados —, pero la transparencia sobre cómo se produjo una cifra no es lo mismo que alguien más la produzca.

El que cuesta una tarjeta registrada

Aquí es donde el linaje deja de ser trivia y empieza a ser la decisión.

AesCode 32B te exige 65 GB de memoria de acelerador, una ruta de servicio multimodal y la disposición de ejecutar un modelo no anunciado como adoptante temprano. Su propio ejemplo de servicio recurre a paralelismo tensorial de cuatro vías, y el modelo está documentado para un contexto de 24.576 tokens sin opción alojada a la que recurrir. Si ya tienes el hardware y tu canal de procesamiento realmente necesita ajuste fino específico del diseño, es un intercambio razonable. Para la mayoría de los equipos, es un proyecto de dos semanas antes de la primera salida útil.

Qwen3.8 27B está autoalojado en la propia infraestructura de OrcaRouter y ya se puede invocar hoy mismo a 0,33 $ por millón de tokens de entrada y 2,40 $ por millón de salida, con un contexto de 262.144 tokens y entrada de texto, imagen y vídeo. Esas son tarifas de lista transferidas sin ningún margen añadido por nuestra parte, y se encuentra bajo la misma clave que más de 200 modelos, de modo que la comparación con cualquier alternativa del catálogo es un parámetro de la solicitud y no un segundo contrato. Ese es todo el argumento práctico, y es enorme: el modelo que, en términos de familia, está una generación por detrás del núcleo de AesCode 32B es el que puedes evaluar esta misma tarde, con tus propios prompts, por unos pocos céntimos.

Hay aquí un punto de segundo orden que el ángulo del enrutamiento concreta. Dado que AesCode 32B es un ajuste fino de un checkpoint de Qwen3-VL, la familia te ofrece una forma barata de comprobar si el lado alojado de la arquitectura funciona siquiera antes de que te comprometas a autoalojar nada. Qwen3-VL 235B A22B Instruct está disponible a $0.40 por millón de tokens de entrada y $1.60 de salida, y Qwen3-VL 8B Instruct a $0.18 y $0.70. Ninguno de los dos es AesCode 32B y ninguno ha sido entrenado para la calidad de diseño, pero "¿puede un modelo de visión y lenguaje leer nuestras capturas de pantalla y escribir el marcado que necesitamos?" es respondible con ellos por céntimos, y la conmutación automática por error bajo el mismo endpoint significa que un mal día del proveedor no tumba el pipeline.

A screenshot of the Hugging Face model page for microsoft/AesCode-32B, showing the model card header, the Apache 2.0 licence tag and the model-index table carrying the 300-sample infographic evaluation with the 85.89 Overall score (captured October 11, 2026).

¿Quién debería elegir cuál?

Elige AesCode 32B si el artefacto es el entregable. Si produces diapositivas, paneles, carteles o informes en volumen, necesitas una salida estructurada que siga siendo editable y comparable —el modelo emite un documento HTML completo, usa estructuras de tabla HTML reales y especificaciones de ECharts para que ambas se mantengan inspeccionables— y tienes el hardware o el presupuesto para alquilarlo. Asúmelo aceptando tres cosas: ninguna verificación independiente de cifra alguna, unos 65 GB para los pesos y un contexto de 24K que limitará los documentos largos. La tasa de fallos graves del 4,3 % en los límites del lienzo que reporta la ficha, frente al 34,7 % de GPT-5.5, es la cifra más alentadora del lanzamiento, y también es la de Microsoft.

Toma Qwen3.8 27B si necesitas un modelo multimodal general de pesos abiertos que realmente puedas ejecutar y realmente puedas servir. Contexto de 262K, extensible a un millón; una huella de despliegue que cabe donde AesCode 32B no; una posición de licencia sin diferencias; alguna medición independiente tanto de su calidad como de su coste por tarea finalizada; y una opción alojada que significa que puedes empezar hoy y autoalojarte después sin reescribir la integración. Su diseño de atención escalonado y por capas es la razón por la que el contexto largo es asequible, y el contexto largo es lo que más suelen necesitar las canalizaciones de diseño y documentación.

Y si necesitas ambos —un generador de artefactos de diseño y un caballo de batalla general—, la división sensata no es ejecutar dos modelos de visión-lenguaje de clase 30B en tu propio equipo. Enruta el tráfico general hacia el lado alojado y mantén el especialista autoalojado, detrás de una sola clave, donde una interrupción del proveedor en cualquiera de las dos rutas sea un evento de conmutación por error en lugar de un incidente.

A screenshot of the OrcaRouter model page for Qwen3.8 27B, showing the model name, the 262,144-token context window, the text/image/video input modalities and the self-hosted pricing of $0.33 per million input tokens and $2.40 per million output.

Lo que hay que observar

La posición de AesCode 32B cambia por completo si pasa a ser invocable. Ahora mismo, la única debilidad real del modelo es el acceso, y eso es una condición temporal: que un proveedor de inferencia adopte el checkpoint, o que Microsoft publique un endpoint, convierte una adquisición de 65 GB en una selección de modelo. Hasta entonces, el resumen honesto de esta comparación es que el ajuste fino es mejor en una tarea, el modelo general es mejor para ser utilizable, y resulta que el modelo general es el ancestro: Microsoft eligió un checkpoint de Qwen3-VL como base porque era la base multimodal abierta más potente disponible, lo cual es, en sí mismo, lo más útil que esta comparación tiene que decir sobre Qwen3.8 27B.