Una tarjeta de título generada encabezada por «AesCode-8B vs Qwen3-8B» con dos tarjetas redondeadas una al lado de la otra. La tarjeta izquierda, AesCode-8B, lleva un icono de ventana de navegador que renderiza una página de póster y las líneas «Base: Qwen3-VL-8B-Instruct» y «Emite una página renderizada»; la tarjeta derecha, Qwen3-8B, lleva un icono de documento con un globo de diálogo y las líneas «El generalista propio de Qwen» y «Texto, 119 idiomas». Un separador entre ellas dice «primos, no padre e hijo» y una franja de texto que cruza la parte superior dice «AesCode-8B no es un ajuste fino de Qwen3-8B». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

AesCode-8B vs Qwen3-8B: Parecen padre e hijo, y no lo son

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Los nombres invitan a cometer un error. AesCode-8B es un modelo de 8B con una arquitectura base Qwen3-VL-8B-Instruct, Qwen3-8B es el modelo de 8B propio del proveedor, y la interpretación obvia es que el primero es un ajuste fino del segundo. No lo es. La configuración publicada de AesCode-8B declara Qwen3-VL-8B-Instruct como la base —el hermano de visión-lenguaje, un checkpoint distinto con una tarea distinta— y los metadatos de Hugging Face lo enumeran como un ajuste fino de ese modelo, no del Qwen3-8B de solo texto. Los dos modelos AesCode de esta categoría de tamaño son primos en lugar de padre e hijo, y esa distinción es exactamente lo que hace útil a esta página: te dice qué compró Microsoft cuando partió de un checkpoint de visión-lenguaje, qué costó eso en el lado del texto, y por qué una comparación con el generalista 8B común de la familia termina midiendo una bifurcación en lugar de una mejora.

Ambos son Apache 2.0 y ambos son descargables, pero sus historiales de publicación no podrían ser más diferentes. Qwen3-8B se lanzó en abril de 2025 como parte de la línea generacional Qwen3 del proveedor, con documentación, integración en el ecosistema y dieciocho meses de despliegues de otras personas a sus espaldas. AesCode-8B no incluye ninguna fecha de lanzamiento en ninguno de sus archivos. Microsoft creó el repositorio de Hugging Face el 2026-09-29, registró los pesos con el mensaje «Release AesCode-8B» a las 03:35 UTC del 2026-10-07 y publicó el código de entrenamiento en GitHub al día siguiente. No hay ninguna publicación de Microsoft Research, ninguna nota de lanzamiento, ninguna página de producto y ningún artículo — la cita de la model card dice «Under review» con el año de relleno 2027, y el repositorio mostraba dos descargas en el momento de redactar esto. Todo lo cuantitativo sobre AesCode-8B que aparece a continuación es de Microsoft y nadie lo ha reproducido.

El árbol genealógico que los nombres ocultan

La línea de la generación Qwen3 contiene varios checkpoints de clase 8B que comparten un linaje y no mucho más. Qwen3-8B es el generalista solo de texto: aproximadamente 8,2 mil millones de parámetros totales con alrededor de 7 mil millones no de embedding, atención de consulta agrupada, un contexto nativo de 32K tokens extensible a 131K mediante YaRN, y entrenamiento en 119 idiomas y dialectos. Razona, chatea, programa y llama a herramientas, y es uno de los modelos 8B más ampliamente autoalojados en el ecosistema abierto exactamente por esas razones. Qwen3-VL-8B-Instruct es el miembro multimodal: la misma generación de la familia, una torre de visión dedicada en la parte superior, imagen y texto de entrada, texto de salida.

Microsoft partió del segundo. La configuración de AesCode-8B especifica Qwen3VLForConditionalGeneration, con 36 capas ocultas, tamaño oculto de 4.096, 32 cabezas de atención y 8 cabezas de clave-valor, un vocabulario de 151.936 tokens y posiciones mrope intercaladas, y necesita transformers 4.57 o posterior. Los fragmentos suman 17.543.339.408 bytes, unos 8.800 millones de parámetros bf16, que es por lo que el campo de tamaño redondeado de Hugging Face indica 9B mientras que el proveedor indica 8B. Eso es un redondeo, no una discrepancia, y el recuento de parámetros no es el fork que importa: la modalidad de entrada y el contexto de servicio de 24.576 tokens sí lo son.

Entonces, el planteamiento honesto no es «generalista frente a su ajuste fino». Es: un generalista de texto con un contexto largo y dieciocho meses de historial de producción, frente a un checkpoint de investigación multimodal que emite un documento y nunca ha sido evaluado de forma independiente.

A generated two-column scoreboard titled "AesCode-8B vs Qwen3-8B - the scoreboard". Left column AesCode-8B reads Base Qwen3-VL-8B-Instruct, Parameters 8.8B, Output HTML and CSS page, Context 24,576 tokens, Languages English only, Evidence vendor rubric and unreproduced. Right column Qwen3-8B reads Base Qwen3-8B itself, Parameters 8.2B, Output text and tool calls, Context 32K native and 131K extended, Languages 119, Evidence 18 months independent. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Qwen3-8B specifications are Alibaba's." The OrcaRouter logo is composited bottom-right.

En qué gastó Microsoft el presupuesto de formación

El brief de diseño se cita en la tarjeta del modelo y explica la bifurcación: los modelos de código «no pueden ver cómo la disposición, la jerarquía y el color se combinan en el lienzo», mientras que los generadores de imágenes «componen páginas visualmente atractivas, pero a menudo representan mal el texto, los números y las relaciones lógicas». AesCode es el intento de tomar el sentido de la composición de uno y la verificabilidad del otro, y la receta es inusual de una manera específica.

Cada prompt de entrenamiento se empareja con una imagen de referencia generada a partir de ese mismo prompt —las propias ejecuciones de Microsoft usaron GPT-Image-2 para la imagen y GPT-5.5 para expandir un brief corto en un prompt de contenido detallado. La referencia solo aporta la disposición y el estilo; el prompt de texto sigue siendo la autoridad en cuanto al contenido. Luego, en inferencia, el modelo apenas la necesita: si se le retira la referencia a AesCode-8B, su puntuación Visual cae 1,00 punto sobre cien, frente a 19,55 del backbone y 10,04 de GPT-5.5. Un resultado relacionado es que las recompensas basadas en referencias elevaron la puntuación Visual de solo prompt de 25,17 a 69,71, de modo que el prior visual se trasladó a los pesos en lugar de quedarse en la entrada.

El resto es una historia de diseño de recompensas. La supervisión es un "grafo de diseño" de nodos y aristas —texto, gráficos, tablas, tarjetas, regiones, ranuras de imagen, con contención, alineación, orden y conexión como aristas—, elegido de modo que cada propiedad del lienzo pertenezca a un elemento con nombre y, por tanto, pueda puntuarse por sí misma. Siete canales puntúan el resultado: seis verificadores deterministas para ejecución, texto, límites, datos de tablas y gráficos, diseño semántico y espacios en blanco, más una Visual Graph Rubric específica de cada muestra, evaluada por un modelo de visión-lenguaje. Los candidatos se renderizan en un navegador Playwright en sandbox con las solicitudes externas bloqueadas, y el arnés lee de vuelta el DOM, los estilos computados, las cajas delimitadoras y una captura de pantalla, y por eso las tablas deben ser tablas HTML y los gráficos deben ser especificaciones de ECharts. El entrenamiento fue un ajuste fino supervisado con arranque en frío sobre 3.000 demostraciones, luego GDPO sobre 7.408 prompts durante 400 pasos en un único nodo de ocho NVIDIA B200, con cada canal de recompensa normalizado dentro de su grupo de rollout para que una señal densa basada en reglas no pueda ahogar a la visual, que es dispersa. Microsoft mide esa normalización en 5,12 puntos Visuales por encima del GRPO escalar simple.

Nada de esa maquinaria existe para hacer de AesCode-8B un mejor asistente general. Existe para que la salida sea verificable, y es la razón de que el contexto del modelo sea lo que es.

Lado a lado, con los números etiquetados

• Base — AesCode-8B: Qwen3-VL-8B-Instruct, un checkpoint de visión-lenguaje. Qwen3-8B: el generalista solo de texto de la misma generación.

• Parámetros — AesCode-8B: unos 8,8B bf16 repartidos en cuatro fragmentos. Qwen3-8B: unos 8,2B en total, aproximadamente 7B sin embeddings.

• Entradas — AesCode-8B: texto más una imagen de referencia opcional. Qwen3-8B: texto.

• Salida — AesCode-8B: un documento HTML y CSS completo. Qwen3-8B: texto, llamadas a herramientas, código.

• Contexto — Aescode-8B: 24,576 tokens en la configuración reportada. Qwen3-8B: 32K nativo, 131K extendido vía YaRN.

• Idiomas — AesCode-8B: la etiqueta de la tarjeta es solo "en". Qwen3-8B: 119 idiomas y dialectos.

• Evidencia — AesCode-8B: la propia rúbrica de infografía de 300 muestras de Microsoft, tres generaciones por prompt, sin reproducción externa. Qwen3-8B: dieciocho meses de benchmarks independientes, trabajo de cuantización y despliegue en producción.

• Licencia — Apache 2.0 en ambos casos, sin restricciones. Un empate, y no el factor diferenciador que la gente supone que es.

El vacío de evidencia es la verdadera comparación

Microsoft reporta AesCode-8B con 82.94 en Overall en su rúbrica, por delante de GPT-5.5 condicionado por referencia con 81.28 y de Claude Opus 4.8 con 80.39, y 31.1 puntos Visual por encima de su propio backbone condicionado por referencia. Tres números de esa tabla valen más que el titular. El primero es Style, donde AesCode-8B se sitúa en 53.21 y ningún modelo de la comparación supera 60 — y la definición de Style de Microsoft es diseño que no necesita más revisión visual antes de la entrega, así que en la única dimensión que pregunta si un humano enviaría la página sin editar, el modelo no es el líder. El segundo es el fallo de límite: un desbordamiento grave del canvas se repite en el 4.3% de las 300 muestras, frente al 34.7% de GPT-5.5. El tercero es que la mitad visual de la puntuación proviene de un juez de visión-lenguaje sin nombre, lo que significa que la mitad determinista es reproducible por un tercero y la otra mitad no.

Los números de Qwen3-8B provienen de un lugar completamente distinto, y eso importa más que qué conjunto sea más alto. Dieciocho meses de evaluación independiente, cuantizaciones de la comunidad, benchmarks de servicio y despliegues en producción son un tipo de evidencia diferente: no es una afirmación, es un historial de resultados. Puedes averiguar cómo se comporta Qwen3-8B bajo cuantización de cuatro bits en una tarjeta específica porque alguien lo ha publicado. No puedes hacer eso con AesCode-8B, porque a fecha de esta semana nadie fuera de Microsoft lo ha ejecutado en nada.

Y no hay ninguna métrica en común entre las dos tablas. Qwen3-8B no tiene puntuación de diseño de infografía; AesCode-8B no tiene ningún benchmark de razonamiento general publicado. La comparación no es que sea reñida ni que no lo sea: no está disponible.

Lo que en realidad implica ejecutar cada uno

A screenshot of the OrcaRouter model page for qwen/qwen3-vl-8b-instruct showing the Vision, Tools and JSON capability badges, the byline "by Qwen - 2025-10-14", the description "Qwen3-VL 8B Instruct - open-weight small vision-language model, 8B params, 128k context, no thinking mode", the pricing row reading $0.18 input and $0.70 output per million tokens, and the OpenAI-compatible code sample against the https://api.orcarouter.ai/v1 base URL.

Qwen3-8B es el sencillo. Un modelo de texto de 8.2B se cuantiza en una sola tarjeta de consumo, tiene dieciocho meses de herramientas detrás en todos los frameworks de servicio y entornos de ejecución locales, y se comporta de forma predecible. La extensión del contexto hasta 131K está documentada en lugar de ser folclore, y la cobertura de 119 idiomas es la razón por la que aparece en tantos pipelines multilingües.

AesCode-8B es un proyecto de servicio. El comando propio de la tarjeta es vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, con transformers 4.57 o posterior para la ruta sin vLLM. Los 17.5 GB de pesos en bf16 tienen que caber junto a una caché KV para 24,576 tokens y hasta dos imágenes, así que una sola tarjeta de 24 GB es técnicamente suficiente y incómodamente ajustada, y 40-48 GB o dos tarjetas de 24 GB es el mínimo realista. Incluye también en el presupuesto un renderizador, porque cada afirmación sobre la calidad de este modelo se hizo renderizando su salida HTML en un navegador en sandbox — si quieres saber si tus propias salidas son buenas, ese es el arnés que tienes que montar. Y ten en cuenta que el contexto de 24,576 tokens se probó en páginas individuales de infografías, no en las presentaciones de varias diapositivas para las que se promociona el modelo, así que la presión de contexto en una presentación real es territorio no probado.

La disponibilidad es la otra mitad del mismo punto. AesCode-8B no es algo que OrcaRouter enrute, y tampoco pudimos encontrar que se sirviera en ningún otro sitio; una evaluación hoy implica pesos en tu propio hardware. Su ancestro es otra historia: Qwen3-VL-8B-Instruct se puede invocar a través de OrcaRouter ahora mismo a $0.18 por millón de tokens de entrada y $0.70 por millón de salida con un contexto de 131,072 tokens, lo que lo convierte en la forma más barata de ver qué hace la versión sin ajustar de esta misma arquitectura con tus propios prompts de infografía. Más arriba en la misma línea, Qwen3.8-27B se puede enrutar a $0.33 y $2.40. El precio de lista del proveedor se repercute sin añadir ningún margen y la conmutación por error entre proveedores es automática, así que prototipar el prompt contra el backbone alojado cuesta una clave en lugar de una semana de GPU, y solo los prompts que realmente se renderizan bien se ganan el trabajo de reproducción.

A Hugging Face screenshot of the microsoft/AesCode-8B model card showing 0 likes at capture time, the Microsoft organisation follower count, the Image-Text-to-Text, Transformers, Safetensors and English tags with qwen3_vl and code-generation, an Apache-2.0 licence badge, and the opening card text describing AesCode as generating information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS, followed by the line that AesCode-8B starts from Qwen3-VL-8B-Instruct.

Cuál quieras depende del artefacto.

Elige AesCode-8B cuando el entregable sea una página y tenga que ser editable. La salida HTML estructurada que se puede diferenciar en Git, con tablas como tablas reales y gráficos como especificaciones de ECharts, es un artefacto genuinamente distinto de un párrafo de texto, y ninguna cantidad de capacidad general puede sustituirlo. Asume el intercambio con conocimiento de causa: un checkpoint de investigación no anunciado con un recuento de descargas de dos dígitos, un contexto de 24K, solo en inglés, sin evaluación independiente, un techo de Style que publica su propio proveedor y una factura de servicio medida en decenas de gigabytes.

Elige Qwen3-8B para todo lo demás — que, para la mayoría de los equipos, es todo. Es el generalista probado en este peso, tiene un contexto más largo, habla ciento diecinueve idiomas, funciona en hardware que ya tienes, y tiene dieciocho meses de experiencia en producción de otras personas detrás de las decisiones que estás a punto de tomar. Si no tienes una necesidad específica de emitir páginas renderizadas, esta comparación tiene una sola respuesta.

El argumento a favor de querer ambos es real, y no es un desempate. Un pipeline que lee documentos y produce presentaciones usa dos modelos con dos tipos de salida genuinamente diferentes, y la postura útil es mantener el renderizador de páginas en hardware que pueda soportarlo y enrutar el trabajo de lectura y razonamiento a algo alojado detrás del mismo endpoint que todo lo demás.

¿Qué haría que esta fuera una página que cierre mejor?

Tres cosas, y solo una de ellas trata sobre benchmarks. Una reproducción independiente de la caída de referencia de 82.94 y 1.00 puntos movería a AesCode-8B de afirmación del proveedor a resultado, y permitiría que la cuestión del tamaño 8B frente a 8B se respondiera por méritos. Un proveedor que adoptara el checkpoint colapsaría la columna de despliegue y convertiría "una semana de GPU" en "una llamada a la API". Y el artículo que la ficha cita como en revisión — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — respondería la pregunta que la ficha del modelo no puede: qué hace la rúbrica visual cuando el grafo de diseño contra el que puntúa es en sí mismo incorrecto.

Hasta que una de esas se materialice, la lectura defendible es la restrictiva. AesCode-8B es el más interesante de estos dos modelos y el menos utilizable. Es muy bueno en las partes del diseño visual que una máquina puede comprobar, mediocre en la parte que no se puede automatizar, y pertenece a la misma familia de la generación Qwen3 que el modelo con el que se lo compara, sin descender de él. Qwen3-8B es el que puedes poner en un pipeline esta tarde.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario