Una tarjeta de título principal generada para Solar Mini 4, con el titular 'Solar Mini 4 — la ejecución independiente', con el subtítulo 'Intelligence Index 24 y aproximadamente cinco veces el costo por tarea de GPT-6 Luna' y dos insignias que dicen 'Lanzado el 22 de septiembre de 2026' y 'Primera evaluación de terceros, 30 de septiembre de 2026'.
Guides & Insights

Solar Mini 4 obtuvo 24 puntos en el Artificial Analysis Index — y cuesta cinco veces más por tarea que GPT-6 Luna

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Solar Mini 4 cobra lo mismo por token de entrada que GPT-6 Luna, y aproximadamente cinco veces más por completar realmente una tarea. Esa es la historia completa de la primera evaluación independiente del nuevo modelo de Upstage, y no es la historia que contaron los materiales de lanzamiento. Solar Mini 4 se lanzó el 22 de septiembre de 2026 como un modelo de mezcla de expertos dispersa de 35.000 millones de parámetros que activa alrededor de 3.000 millones de parámetros por token, con un precio de $0,10 por millón de tokens de entrada y $0,40 por millón de tokens de salida. GPT-6 Luna, la gama de eficiencia de OpenAI, tiene un precio de lista de $0,10 y $0,50, con un nivel de contexto largo por encima de 272.000 tokens que duplica aproximadamente ambos precios. En una tabla de tarifas, parecen la misma compra. En el Intelligence Index de Artificial Analysis, donde ambos modelos se sometieron a la misma batería de diez evaluaciones, Solar Mini 4 cuesta $0,36 por tarea completada frente a $0,07 para GPT-6 Luna (max) — un factor de 5,4 que se debe enteramente a cómo se comportan los dos modelos durante una tarea y no a lo que cobran por token.

El 30 de septiembre de 2026, Artificial Analysis publicó su análisis del modelo, que obtiene 24 en el Intelligence Index v4.3.2. Todo lo que en este artículo se atribuye a Artificial Analysis es medición propia de esa organización; todo lo que se atribuye a Upstage es una afirmación del proveedor. La distinción importa aquí más que de costumbre, porque los dos conjuntos de cifras no siempre coinciden.

Lo que realmente dice la prueba independiente

A scoreboard titled 'Solar Mini 4 — the scoreboard' with the rows: Intelligence Index 24.05 against a median of 12; Cost per index task $0.36 against GPT-6 Luna (max) at $0.07; Rate card $0.10 in / $0.01 cached / $0.40 out per 1M; Output per index task 88,300 tokens, 71,600 of them reasoning; Output speed 204 tokens per second and 430 seconds per index task; Context Upstage says 512K while Artificial Analysis lists 1.05M; Weakest result Terminal-Bench 4.0 at 1%.

Solar Mini 4 se sitúa en 24.05 en el Intelligence Index, frente a una mediana de 12 entre los modelos de razonamiento de su segmento de precio. Eso lo coloca muy por encima de la media para su categoría de tamaño, y la propia formulación de Upstage —"la puntuación general más alta entre los modelos con 3B activos en la comparación del Artificial Analysis Intelligence Index"— supera pruebas independientes en ese punto concreto. Qwen3.6 35B A3B, que también activa 3B parámetros, obtiene 18.2 en el mismo índice. K2 Horizon MoVA 36B A4B, con 4B activos, obtiene 25.3 — y lo hace con un contexto más corto, 524K tokens frente a los 1.05M de Solar Mini 4. Frente a Inkling, un MoE de pesos abiertos de 975 mil millones de parámetros lanzado en julio, Solar Mini 4 queda en 24.1 frente a 25.0 — a menos de un punto de un modelo casi treinta veces más grande que cuesta $1.00/$4.05 por millón de tokens.

El perfil dentro de esa puntuación es irregular, y esa irregularidad es la parte útil:

• El razonamiento de contexto largo es su punto fuerte relativo. Solar Mini 4 obtiene un 83% en AA-LCR v1.1, al mismo nivel que MiniMax-M3 y GPT-6 Luna (max), y por delante de Gemini 3.8 Flash (high) y GPT-6 Astra (max), con un 81%.

• La programación científica se mantiene. 48 % en SciCode, un punto por delante de MiniMax-M3 e Inkling (xhigh).

• La codificación agéntica se derrumba. 1% en Terminal-Bench 4.0. No es "débil" — es 1%. En AutomationBench-AA, que ejecuta flujos de trabajo de varios pasos en aplicaciones SaaS reales, 22.3%.

• La precisión del conocimiento es baja, pero el modelo sabe que está adivinando. AA-Omniscience devuelve −11 con una precisión del 18 %; el modelo se abstiene en aproximadamente la mitad de las preguntas que se le hacen. Su tasa de no alucinación es del 64 %, muy por delante de Inkling (xhigh) con 32 % y de GPT-6 Luna (max) con 23 %. Un modelo que dice «No lo sé» la mitad de las veces y acierta dos tercios de las veces que responde es un instrumento distinto de un modelo que confabula con seguridad.

En el trabajo de conocimiento agéntico, las cifras son 1072 Elo en GDPval-AA y 872 Elo en AA-Briefcase, ambas cercanas a Inkling (xhigh).

El número multiplicado por cinco, desglosado

La cifra de coste por tarea de Artificial Analysis es la que decidirá la mayoría de las conversaciones de compras, y merece leerse como un desglose en lugar de citarse como un titular. Dos cosas la determinan.

Primero, el volumen. Solar Mini 4 emite alrededor de 88.300 tokens de salida por tarea de Intelligence Index; 71.600 de esos son tokens de razonamiento. A $0,40 por millón de tokens de salida, eso supone aproximadamente $0,035 de la factura —barato, porque la salida es barata. Lo que cuesta, en cambio, es tiempo: a una velocidad medida de 204 tokens por segundo, Artificial Analysis registra 430 segundos de trabajo para una tarea promedio de Intelligence Index, o unos 7,2 minutos. GPT-6 Luna (max) emite 50.000 tokens de salida por tarea a 127 tokens por segundo y tarda 396 segundos. Inkling (xhigh), un modelo de pesos abiertos de 975 mil millones de parámetros, emite 34.700 tokens y termina en 169 segundos. Solar Mini 4 es más lento que ambos, pero por un margen que no tiene nada que ver con la diferencia de costos de cinco veces.

Segundo — y esta es toda la historia — la entrada de escritura en caché. El desglose de costos de Artificial Analysis atribuye aproximadamente $0,30 de los $0,36 por tarea de Solar Mini 4 a los tokens escritos en la caché de prompt, frente a $0,03 por lecturas de caché, $0,035 por salida y un error de redondeo para la entrada genuinamente no almacenada en caché. Para GPT-6 Luna (max), la escritura en caché es $0,012 de $0,068 — aproximadamente el 17% de la factura, frente al 82% para Solar Mini 4. La entrada en caché es la línea más barata en la tarifa de Upstage a $0,01 por millón, y el modelo de Artificial Analysis sí la utiliza; el problema es cuánto hay que escribir antes de que se pueda leer. Un agente que reenvía una conversación en crecimiento en cada turno paga el costo de escritura con mucha más frecuencia que un modelo que responde en un turno corto y cerrado.

Esa es la conclusión que merece la pena llevar a producción: para un modelo como este, el precio por token no predice casi nada sobre la factura por tarea. El comportamiento de la caché sí lo hace.

Donde difieren los propios números de Upstage

A screenshot of Upstage's Console documentation page for Solar Mini 4, showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate, the description of a cost-efficient compact language model at 35B total and 3B active parameters built for agentic use cases, English, Japanese and Korean language support, tool calling, a 128K max output, the platforms Upstage Console and on-premises, and the version string solar-mini4-260922 with a training data cut-off of February 2026.

La publicación de lanzamiento de Upstage, publicada el 1 de octubre de 2026 bajo el título «Solar Mini 4: creado para cargas de trabajo de agentes de gran volumen», reporta 24,1 en el Artificial Analysis Intelligence Index —en la práctica, la misma cifra— y hace varias afirmaciones que se sitúan junto a los datos independientes, más que por encima de ellos.

El proveedor cita 22,3 % en AutomationBench-AA, coincidiendo exactamente con Artificial Analysis, y 47,2 en τ³-Banking, un benchmark de políticas y uso de herramientas que el conjunto de índices ha eliminado desde entonces. Reporta 83,3 % en AA-LCR y 47,6 % en SciCode, ambas cifras dentro de un error de redondeo respecto de las cifras independientes. En Humanity's Last Exam reporta 19,6 %, mientras que la página de Artificial Analysis presenta 25,8 % para el mismo modelo; ambas son lecturas plausibles de una evaluación notoriamente volátil, pero no son el mismo número y ninguna debería presentarse como la otra.

También hay dos líneas de especificaciones que no coinciden. Upstage documenta una ventana de contexto de 512K tokens con hasta 128K tokens de salida. Artificial Analysis indica una ventana de contexto de 1.0M tokens y una salida máxima de 262K. El blog de Upstage es explícito en que la cifra de 512K es el compromiso contractual de la versión que se lanza; la discrepancia es el tipo de cosa que vale la pena resolver contrastándola con una respuesta de la API antes de que alguien construya sobre ella un pipeline de recuperación.

El proveedor también hace la única comparación que puede hacer en sus propios términos: una prueba interna con tres tareas de agentes en coreano, ejecutadas tres veces por modelo, en la que completar 1000 conjuntos de tres tareas costó un estimado de $1.25 con Solar Mini 4 y $2.20 con MiMo-V2.5. Esa es una prueba realizada por el proveedor sobre tareas elegidas por el proveedor, con la latencia excluida, y apunta en dirección opuesta al resultado de Artificial Analysis. No es incorrecto —diferentes tareas ejercitan distintos presupuestos de tokens—, pero es una cifra de marketing, y el descuento de lanzamiento publicado del modelo es una razón aparte para volver a calcular tus propios números en lugar de adoptar los de cualquier otro.

Precios, según la documentación en vivo de la consola de Upstage: 0,10 USD por millón de tokens de entrada, 0,01 USD por millón de tokens de entrada en caché, 0,40 USD por millón de tokens de salida, con un descuento de lanzamiento anunciado actualmente del 50 % hasta el 22 de octubre de 2026 UTC, lo que deja las tarifas efectivas en 0,05 USD de entrada, 0,005 USD de entrada en caché y 0,20 USD de salida hasta entonces.

Qué significa esto si eres tú quien paga

Lo interesante de Solar Mini 4 no es que sea un mal modelo. Es que es un modelo pequeño genuinamente bueno cuya economía está dominada por un comportamiento que una tarifa no puede mostrarte. Un 24 en el índice con tres parámetros activos es un verdadero resultado de ingeniería, y las cargas de trabajo en coreano —el punto fuerte declarado del modelo, junto con el inglés y el japonés— son exactamente donde ese resultado tiene más probabilidades de valer su precio.

La parte incómoda es todo lo que viene después de la primera llamada. Los turnos largos del asistente, la baja reutilización de caché y una tarea que requiere siete minutos de decodificación por ejecución de índice suman un número que no se parece en nada a $0.10/$0.40. Si lo estás evaluando, el experimento honesto es una prueba de costo por trabajo completado con tu propia carga de trabajo, con la caché de prompts habilitada tal como la usaría realmente tu stack de producción — no una comparación de precios por token.

Esta es también la clase de problema que un enrutador está destinado a resolver, y la razón por la que OrcaRouter transfiere los precios de lista de los proveedores sin margen de beneficio así que un cambio de precio del proveedor llega a tu factura el mismo día. No enrutamos modelos de Upstage, por lo que ni Solar Mini 4 ni Solar Pro 4 están disponibles a través de nosotros — provienen de la propia API de Upstage y de plataformas de terceros. Lo que sí enrutamos es la otra mitad de esta comparación: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash y más de 200 modelos adicionales detrás de una sola clave, que es lo que hace práctico mantener un modelo barato y uno caro en la misma tarea y dejar que la conmutación automática por error y el enrutamiento por solicitud decidan cuál responde. Cuando la diferencia entre dos modelos es una brecha de coste por tarea de cinco veces que ninguna lista de precios revela, la capacidad de mover una sola solicitud entre ellos importa más que cualquier tabla de referencia.

A screenshot of the Artificial Analysis article dated September 30, 2026, headlined 'Korean AI Lab Upstage has released Solar Mini 4 which scores 24 on the Artificial Analysis Intelligence Index, but costs ~5x as much per task as GPT-6 Luna (max) despite similar per-token prices'. The visible key-results text covers the 3B-active Pareto claim, the 6-point lead over Qwen3.6 35B A3B at the same active size, 83% on AA-LCR v1.1 matching MiniMax-M3 and GPT-6 Luna (max), 48% on SciCode, and fast output at 208 tokens per second with slow tasks.

La versión corta: Solar Mini 4 es el nuevo punto de Pareto que Artificial Analysis traza para modelos con menos de tres mil millones de parámetros activos, y es aproximadamente cinco veces más caro por tarea completada que un modelo que se lista al mismo precio de entrada. Ambas afirmaciones son ciertas, y la segunda es la que aparece en una factura.