Una tarjeta de título principal generada que dice «Solar Mini 4 vs Granite 4.2 3B», con el subtítulo «Un modelo al que llamas y un checkpoint que descargas», y dos insignias que dicen «Cada uno con unos 3000 millones de parámetros activos por token» y «Uno cobra por token, el otro por vatio».
Guides & Insights

Solar Mini 4 vs Granite 4.2 3B: un modelo al que llamas y un checkpoint que descargas

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pon Solar Mini 4 junto a Granite 4.2 3B y el número interesante no es la diferencia en los benchmarks. Es que Granite 4.2 3B, el modelo de razonamiento de IBM con licencia Apache-2.0 lanzado el 25 de agosto de 2026, se ejecutará en un portátil esta noche gratis, mientras que Solar Mini 4, el modelo propietario de Upstage lanzado el 22 de septiembre de 2026, no se ejecutará en ningún equipo que poseas y cobra 0,10 $ por cada millón de tokens de entrada y 0,40 $ por cada millón de tokens de salida por responder una pregunta. Ambos activan aproximadamente tres mil millones de parámetros de cómputo por token. Uno es un archivo. El otro es un medidor.

Esa diferencia decide casi todo lo demás en esta comparación, incluido qué benchmarks merece la pena siquiera poner uno al lado del otro. Granite 4.2 3B tuvo una evaluación independiente mucho antes de que Solar Mini 4 la tuviera — Artificial Analysis le otorga un 9 en el Intelligence Index v4.3.2, del mismo conjunto de evaluaciones y la misma organización que puntúa a Solar Mini 4 con 24. Lo que significa que la diferencia de quince puntos aquí está inusualmente bien fundamentada: es un laboratorio, una metodología y dos modelos que nadie tuvo que aceptar por fe.

La especificación, en las dimensiones que realmente los separan

• Arquitectura — Solar Mini 4 es una mezcla dispersa de expertos: 35B parámetros totales, 3B activos por token, según Upstage. Granite 4.2 3B es denso, unos 3B parámetros con aproximadamente 4B en total, incluyendo embeddings, según los metadatos de safetensors. El mismo presupuesto de activación, dos formas distintas de gastarlo.

• Pesos — Solar Mini 4 es propietario y cerrado. Granite 4.2 3B se distribuye bajo Apache 2.0 con una receta de entrenamiento documentada hasta las proporciones de los datos.

• Contexto — Upstage documenta 512K tokens con hasta 128K de salida; Artificial Analysis indica 1.0M para el mismo modelo, así que considera que el límite máximo no está definido. Granite 4.2 3B ejecuta 131,072 tokens de forma nativa, extendidos a 512K mediante una quinta fase de preentrenamiento.

• Precio — Solar Mini 4 a $0.10 / $0.01 en caché / $0.40 por millón de tokens, actualmente con un 50 % de descuento hasta el 22 de octubre de 2026. Granite 4.2 3B no tiene tarifa de proveedor porque no hay nada que alquilar; los endpoints alojados que rastrea Artificial Analysis lo sitúan en torno a $0.03 / $0.12, y el autoalojamiento cuesta electricidad.

• Índice de inteligencia — 24 para Solar Mini 4, 9 para Granite 4.2 3B, ambos de Artificial Analysis v4.3.2.

• Velocidad — 204 tokens de salida por segundo para Solar Mini 4 y 223 para Granite 4.2 3B, ambos medidos por el mismo laboratorio, con un tiempo hasta el primer fragmento de 1,5 s y 0,5 s respectivamente. El modelo denso es el más rápido en ambos aspectos.

De qué está hecha realmente la brecha de quince puntos

A two-column comparison scoreboard titled 'Solar Mini 4 vs Granite 4.2 3B', subtitled 'Same activation budget, two different ways of spending it'. Solar Mini 4: parameters 35B total / 3B active; weights proprietary, no download; context 512K claimed and 1.05M listed; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05; cost per index task $0.36; output per task 88,300 tokens at 204 tok/s; non-hallucination 64.2%. Granite 4.2 3B: parameters 3.66B dense; weights Apache 2.0 on Hugging Face; context 131,072 native; price per 1M about $0.03 / $0.12 hosted; Intelligence Index 9.06; cost per index task $0.006; output per task 18,600 tokens at 223 tok/s; non-hallucination 73.7%.

Las evaluaciones individuales cuentan una historia menos halagadora que el titular para Granite 4.2 3B, y una más complicada para Solar Mini 4. En AA-LCR v1.1, el benchmark de razonamiento de contexto largo, Solar Mini 4 obtiene un 83 % y Granite 4.2 3B obtiene un 24 %. Esa única evaluación representa una enorme proporción de la diferencia del índice, y no es un accidente de escala: es lo que se compra con 512K a 1M tokens de contexto y el entrenamiento para usarlo. La ventana de Granite 4.2 3B llega como máximo a 131K de forma nativa; la fase extendida de 512K existe, pero el modelo no fue ajustado para razonar a través de ella como sí lo fue Solar Mini 4.

En conocimiento general, la brecha se reduce y luego se invierte en carácter. Granite 4.2 3B obtiene un 55,9 % en GPQA, y Solar Mini 4 no tiene ninguna cifra de GPQA; en Humanity's Last Exam los dos son 6,6 % y 25,8 % respectivamente, que es la comparación más directa y la que predice la diferencia de tamaño. Lo que Granite 4.2 3B no hace, según Artificial Analysis, es fabricar: su tasa de no alucinación en AA-Omniscience es del 73,7 %, superior al 64,2 % de Solar Mini 4. El modelo más pequeño es menos propenso a inventar una respuesta que no tiene.

La programación agéntica es donde ambos modelos fracasan, y donde importa leer las cifras. Solar Mini 4 obtiene un 1 % en Terminal-Bench 4.0 y un 22,3 % en AutomationBench-AA. Granite 4.2 3B obtiene un 0 % en Terminal-Bench 4.0, un 13,9 % en el antiguo Terminal-Bench 2.1 y un 5,6 % en τ³-Banking. Ninguno de los dos modelos es el instrumento adecuado para el trabajo autónomo en la terminal. Los miembros de 8B y 30B de la familia Granite 4.2 recibieron el aprendizaje por refuerzo agéntico de IBM y cuentan con resultados en SWE-Bench y Terminal-Bench; el 3B se saltó explícitamente ese bloque de entrenamiento, y el modelo de Upstage tiene un precio pensado para la recuperación, la estructuración y la aplicación de políticas, más que para manejar una shell.

Dónde Granite 4.2 3B sigue siendo la respuesta correcta

Siete gigabytes y un tercio de pesos en bfloat16, menos de cuatro gigabytes con una cuantización práctica, y una licencia Apache 2.0 que te permite afinarlo con tus propios datos y distribuir el resultado sin pedir permiso a nadie. Un estudiante con una sola GPU de consumo, un hospital que no puede enviar texto de pacientes a un tercero, un producto que necesita funcionar en un avión o en el sótano de una fábrica, un equipo que quiere poseer un modelo en lugar de alquilar un endpoint: todos esos casos eligen Granite 4.2 3B y no miran atrás. El motor funciona con vLLM, SGLang, Transformers y GGUF, y Ollama incluye una compilación granite4.2:3b.

Sus cifras reportadas por el proveedor merecen la cautela habitual. La ficha de IBM afirma 78.33 en AIME 2025, 66.67 en HMMT February 2025 y 69.71 en LiveCodeBench v6 —ninguna ha sido reproducida por ningún tercero—, y para un modelo denso de 3B la cifra de AIME se sitúa muy por encima del rango histórico. El índice 9 de Artificial Analysis registra el modelo como genuinamente útil y muy lejos de la frontera, que es la señal más fiable precisamente porque IBM no la publicó.

Donde Solar Mini 4 es la respuesta correcta

Cualquier cosa en la que el trabajo sea un documento extenso, una extracción estructurada repetida o una política que deba aplicarse de forma consistente en gran volumen —y en la que noventa segundos de latencia sean aceptables. El perfil de Solar Mini 4 es el de un especialista: 83 % en razonamiento de contexto largo, 48 % en programación científica, 64 % de no alucinación y una tendencia documentada a abstenerse en lugar de adivinar. También habla coreano como lengua de primera clase junto con el inglés y el japonés, lo cual, para un despliegue en el mercado coreano, no es una nota al pie.

Lo que los compradores no deberían hacer es comparar los dos precios de tokens y concluir que Solar Mini 4 es tres veces más caro. Artificial Analysis midió Solar Mini 4 en $0.36 por tarea completada del Intelligence Index — y, en la misma suite, Granite 4.2 3B en $0.006. Eso es un factor de sesenta, impulsado por las mismas cosas que inflan Solar Mini 4 frente a GPT-6 Luna (max): 88,300 tokens de salida por tarea frente a los 18,600 de Granite, y una estructura de costos en la que las escrituras de caché de prompt representan $0.30 de los $0.36 de Solar Mini 4 frente a $0.0006 de los $0.006 de Granite. Un precio de salida barato en un modelo verboso no es una tarea barata.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b showing the model summary table: developer Granite Team at IBM, a decoder-only dense transformer, base model Granite-4.1-3B-Base, 3B parameters, context length natively 128K with long-context extension to 512K, bfloat16 precision, twelve tested languages including Korean, a built-in chain-of-thought thinking mode, and an Apache-2.0 licence, with the model tree showing three finetunes and the base model ibm-granite/granite-4.1-3b-base.

Ninguno de los dos modelos está en OrcaRouter —ni enrutamos Granite ni Upstage—, así que si quieres Granite 4.2 3B, viene de Hugging Face, y si quieres Solar Mini 4, viene de la propia API de Upstage y de plataformas de terceros. Pero el patrón de dos modelos que sugiere esta comparación es aquel para el que están hechos los routers, y es la razón por la que OrcaRouter pone más de 200 modelos detrás de una sola clave con un 0 % de margen sobre el precio de lista del proveedor: ejecuta el trabajo de documentos largos y de idioma coreano contra el modelo que realmente justifique su coste, mantén los pasos de extracción deterministas en algo que alojes tú, y deja que el enrutamiento y la conmutación por error muevan una solicitud entre ellos por llamada en lugar de por contrato.

A screenshot of the Artificial Analysis comparison page headed 'Granite 4.2 3B Intelligence, Performance & Price Analysis', marked as an IBM open-weights model released August 2026, with an overall speed of 223.4 output tokens per second, a 131k-token context window, and the summary line that Granite 4.2 3B scores 9 on the Artificial Analysis Intelligence Index, placing it above average among comparable models with a median of 6.

Una última nota sobre los números anteriores. Cada cifra de Solar Mini 4 que proviene de Artificial Analysis es una medición independiente; cada cifra de Granite 4.2 3B de la ficha del modelo de IBM es una afirmación del proveedor que ningún tercero ha reproducido. Las puntuaciones del índice de Artificial Analysis de 24 y 9 son los únicos dos números aquí que fueron producidos por el mismo laboratorio bajo las mismas condiciones, y son los dos sobre los que se debe basar una decisión.