
AesCode-8B vs Gemma 4 12B: dos pequeños modelos de visión, dos resultados completamente diferentes
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 87 tok/s
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
AesCode-8B y Gemma 4 12B ambos reciben una imagen y una frase, y ambos son checkpoints Apache-2.0 que descargas en lugar de alquilar, por eso los motores de búsqueda los pondrán con gusto uno al lado del otro. El parecido es real y también superficial. Gemma 4 12B devuelve una respuesta: una descripción, una transcripción, un fragmento de código, una traza de razonamiento. AesCode-8B devuelve una página renderizada: una diapositiva, un póster o un panel como un documento HTML y CSS completo que puedes abrir en un navegador y editar a mano. Misma forma de entrada, misma clase de peso aproximada y una salida que casi no comparte nada con la otra. Esa única diferencia decide casi todas las preguntas prácticas que siguen, incluida cuál puedes poner delante de un usuario mañana.
Vale la pena decirlo desde el principio, porque determina cuánto peso pueden tener las cifras: Gemma 4 12B fue lanzado por DeepMind el 2026-06-03 con una tarjeta del modelo, documentación y un ecosistema, y ha sido probado de forma independiente desde entonces. AesCode-8B no se lanzó en absoluto. El repositorio de Microsoft para él se creó el 2026-09-29 y los pesos llegaron en un commit titulado "Release AesCode-8B" a las 03:35 UTC del 2026-10-07, y el código de entrenamiento y evaluación apareció en GitHub al día siguiente. No hay ninguna publicación de Microsoft Research, ni página de producto, ni nota de lanzamiento, ni preprint; la cita de la tarjeta del modelo dice "Under review" con el año provisional 2027. Al momento de escribir esto, el repositorio de 8B muestra dos descargas y un me gusta. Por lo tanto, todo lo cuantitativo sobre AesCode-8B es de Microsoft, y nada ha sido reproducido por nadie más.
Los dos modelos, en sus propios términos
Gemma 4 12B es un modelo abierto de tamaño medio, un checkpoint denso de 11,95 mil millones de parámetros cuya decisión de diseño definitoria es que no tiene un codificador separado de visión ni de audio: los parches de imagen y las formas de onda de audio entran directamente en el transformer. Maneja un contexto de 256K tokens y necesita unos 16 GB de VRAM, con los pesos BF16 en torno a 27 GB y las versiones cuantizadas por debajo de 7 GB. La propia ficha del proveedor —reportada por el proveedor y etiquetada como tal aquí— enumera DocVQA 94,9; InfoVQA 88,4; MMLU-Pro 77,2; GPQA Diamond 78,8; AIME 2026 77,5 y LiveCodeBench v6 72,0 en modo de pensamiento. La evaluación independiente es la parte que más importa: Artificial Analysis puntúa la configuración de razonamiento con un Índice de Inteligencia de 14, mide aproximadamente 114 tokens por segundo y calcula el precio de una llamada típica servida en cerca de $0,10 por millón de tokens de entrada y $0,30 por millón de tokens de salida. Tiene tres meses y medio de despliegue a sus espaldas.
AesCode-8B es un ajuste fino de Qwen3-VL-8B-Instruct, publicado con cuatro fragmentos de safetensors que suman 17.543.339.408 bytes —unos 8.800 millones de parámetros bf16, por lo que el campo de tamaño redondeado de Hugging Face indica 9B mientras que el proveedor dice 8B. La configuración publicada sigue una receta directa de Qwen3-VL: 36 capas ocultas, tamaño oculto de 4.096, 32 cabezas de atención con 8 cabezas clave-valor, un vocabulario de 151.936 tokens y un requisito de transformers 4.57 o posterior. Las ejecuciones reportadas por Microsoft usaron un contexto de 24.576 tokens con hasta 12.000 tokens de salida, temperatura 0.8, top-p 0.95 y tres generaciones por prompt sin selección. La licencia es Apache 2.0, sin restricciones de acceso y sin anexo de uso aceptable. Lo que no está incluido son los datos de entrenamiento y evaluación, y cualquier endpoint alojado: no pudimos encontrar AesCode-8B servido en ningún lugar, y no está en nuestro propio catálogo.
Para qué fueron entrenados realmente los modelos
El brief de diseño se cita en la tarjeta del modelo y vale la pena leerlo como la tesis completa: los modelos de código «no pueden ver cómo se combinan la disposición, la jerarquía y el color en el lienzo», mientras que los generadores de imágenes «componen páginas visualmente atractivas pero a menudo representan mal el texto, los números y las relaciones lógicas». AesCode es el intento de conservar a la vez el sentido de la composición y la verificabilidad.
El mecanismo es inusual en un aspecto concreto. Cada prompt de entrenamiento se empareja con una imagen de referencia generada a partir de ese mismo prompt, la cual aporta el diseño y el estilo, mientras que el prompt de texto sigue siendo la autoridad sobre el contenido. Luego, en inferencia, el modelo apenas necesita la imagen: si se le niega la referencia a AesCode-8B, su puntuación Visual cae 1.00 punto de cada cien. Si se le niega a Qwen3-VL-8B-Instruct, la caída es de 19.55. Si se le niega a GPT-5.5, evaluado bajo el mismo entorno de pruebas, la caída es de 10.04. El prior visual acabó en los pesos en lugar de en la entrada, y ese es el verdadero resultado de investigación que subyace al titular.
El objetivo de entrenamiento de Gemma 4 12B es el multimodal ordinario, y decirlo no es una crítica: leer la imagen, responder a la pregunta, seguir la instrucción, llamar a la herramienta. Nada en su ficha sugiere que alguna vez se haya orientado a producir un artefacto renderizado, y ninguna evaluación publicada de Gemma 4 12B mide la calidad de maquetación de documentos, el desbordamiento del lienzo o la consistencia del diseño, porque esas no son las métricas del modelo.
El marcador, y de quién es la rúbrica

• Parámetros — AesCode-8B: 8.8B bf16, denso. Gemma 4 12B: 11.95B denso.
• Entradas — AesCode-8B: texto más una imagen de referencia opcional. Gemma 4 12B: texto, imagen, audio y vídeo.
• Salida — AesCode-8B: un documento HTML y CSS completo. Gemma 4 12B: texto, incluidas llamadas a herramientas.
• Contexto — AesCode-8B: 24.576 tokens en la configuración reportada. Gemma 4 12B: 256K tokens.
• Licencia — ambas Apache 2.0, sin restricciones, pesos incluidos.
• Evidencia — AesCode-8B: la propia rúbrica de infografía de 300 muestras de Microsoft, tres generaciones por prompt, sin reproducción independiente. Gemma 4 12B: una ficha de proveedor más un Intelligence Index independiente de 14 y un rendimiento medido en Artificial Analysis.
Ahora la parte que el marcador no puede reflejar. Microsoft reporta AesCode-8B con 82,94 en la puntuación general en ese conjunto de 300 muestras, por delante de GPT-5.5 condicionado por referencia con 81,28 y de Claude Opus 4.8 con 80,39, y con 31,1 puntos en Visual de ventaja sobre su propio modelo base Qwen3-VL-8B. Lee todo esto como reportado por el proveedor y no reproducido, sobre una rúbrica que el proveedor construyó, sobre muestras que el proveedor eligió, puntuado por un arnés de evaluación contra el que el proveedor entrenó el modelo. La tarjeta es lo bastante honesta como para publicar una dimensión en la que ningún modelo de la comparación supera los 60 —Estilo, donde AesCode-8B se sitúa en 53,21 y GPT-5.5 lidera con 57,91—, y la propia definición de Microsoft de esa dimensión es diseño que no necesita más revisión visual antes de la entrega. En el único eje que plantea si un humano publicaría la página sin editarla, el modelo 8B no es el líder. Ese es el número al que hay que aferrarse cuando alguien cite el 82,94.
Donde realmente se superponen
Hay exactamente un estante compartido, y es más estrecho de lo que parece. Si estás evaluando modelos de visión abiertos y pequeños para un flujo de trabajo con gran carga documental, ambos son candidatos: uno para leer un documento, el otro para producir uno. Un equipo que genera paneles internos como HTML y además necesita extraer figuras de PDFs subidos toca ambos productos en la misma semana.
La división dentro de ese solapamiento es nítida. Gemma 4 12B es el modelo al que apuntas para un documento entrante. AesCode-8B es el modelo al que apuntas para un brief cuando el entregable es una página. Ninguno sustituye al otro, y un pipeline que quiera ambos es un pipeline de dos modelos, no una elección.

El despliegue, que es donde la asimetría realmente muerde
La historia de despliegue de Gemma 4 12B está resuelta. Lo descargas, lo cuantizas si quieres, lo ejecutas en 16 GB de VRAM, y existe una amplia base de herramientas que ya hace esto. Si prefieres no ejecutarlo en absoluto, una llamada servida es barata y se tarifica de forma independiente.
La historia de servicio de AesCode-8B se reduce a una línea de comandos y algo de aritmética. La ficha del modelo indica la ruta directamente: vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, con transformers 4.57 o posterior para la ruta sin vLLM. Los 17,5 GB de pesos en bf16 tienen que convivir con una caché KV para 24.576 tokens y hasta dos imágenes, así que una sola tarjeta de 24 GB es técnicamente suficiente y resulta incómodamente ajustada; 40-48 GB, o dos tarjetas de 24 GB, es el mínimo realista. Presupuesta también un renderizador, porque todas las afirmaciones de calidad sobre este modelo se hacen renderizando su salida HTML en un navegador en sandbox, así que puntuar tus propios resultados implica levantar algo con forma de Playwright con las peticiones externas bloqueadas.
Luego está el estado honesto de la disponibilidad. No enrutamos AesCode-8B y, por lo que podemos averiguar, nadie más tampoco; una evaluación hoy significa pesos en tu propio hardware. Lo más cercano que se puede invocar es la arquitectura a partir de la cual se ajustó el modelo. Qwen3-VL-8B-Instruct es enrutable a través de OrcaRouter ahora a $0.18 por millón de tokens de entrada y $0.70 por millón de salida en un contexto de 131,072 tokens, y los dos checkpoints que sí tenemos tienen el mismo precio — Gemma 4 26B-A4B a $0.06 y $0.33, Gemma 4 31B a $0.13 y $0.38. El precio de lista del proveedor se aplica tal cual, sin margen añadido, y la conmutación por error entre proveedores ocurre automáticamente, así que la manera económica de averiguar si tus prompts se renderizan bien en lo más mínimo es probar primero el modelo base sin ajustar y gastar la semana de GPU solo en los prompts que sobrevivan.

¿Cuál quieres realmente?
Elige AesCode-8B si el entregable es una página. El modelo emite HTML estructurado y editable —tablas como tablas HTML, gráficos como especificaciones de ECharts—, lo que significa que la salida genera diferencias en Git y un diseñador puede cambiarle el estilo sin regenerarla. Acepta la contrapartida: un checkpoint de investigación no anunciado con un recuento de descargas de dos dígitos, sin evaluación independiente, sin endpoint alojado, un contexto de 24K que solo se ha validado en páginas infográficas individuales, y una etiqueta de idioma solo en inglés en la ficha.
Elige Gemma 4 12B para todo lo demás. Lee documentos mejor que la mayoría de los modelos del doble de su tamaño, maneja audio, sigue instrucciones de herramientas, tiene un cuarto de millón de tokens de contexto y cuenta con tres meses y medio de la experiencia de otras personas. Si estás eligiendo uno de estos dos para que sea tu pequeño modelo de visión, y no se te ha pedido específicamente que produzcas presentaciones como código, esta es la respuesta.
Y si el requisito honesto es ambos, no lo trates como un criterio de desempate. Dirige el trabajo de lectura a un modelo alojado y mantén el trabajo de renderizado en cualquier máquina que pueda contener los pesos.
¿Qué cambiaría esta página?
Tres señales. Una reproducción independiente de la caída de referencia de 82.94 y 1.00 puntos movería a AesCode-8B de ser una afirmación de un proveedor a ser un resultado, y haría que la cuestión del tamaño 8B frente a 12B fuera genuinamente interesante en lugar de serlo solo nominalmente. Que un proveedor de inferencia adoptara el checkpoint colapsaría la columna de despliegue, que actualmente es la totalidad de la diferencia práctica. Y el artículo que Microsoft cita como en revisión —«AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards»— respondería a las preguntas que la ficha del modelo no puede, empezando por cómo se comporta la rúbrica visual cuando el propio grafo de diseño es incorrecto. Hasta que uno de esos elementos se materialice, la lectura defendible es estrecha y real: AesCode-8B es muy bueno en las partes del diseño visual que una máquina puede comprobar, mediocre en la parte que no puede, y Gemma 4 12B es un producto acabado que hace un trabajo diferente.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
