
Solar Mini 4 vs Granite 4.2 3B: un modelo al que llamas y un checkpoint que descargas
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 por 1M de tokens · 159 tok/s
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 220 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
Pon Solar Mini 4 junto a Granite 4.2 3B y el número interesante no es la diferencia en los benchmarks. Es que Granite 4.2 3B, el modelo de razonamiento de IBM con licencia Apache-2.0 lanzado el 25 de agosto de 2026, se ejecutará en un portátil esta noche gratis, mientras que Solar Mini 4, el modelo propietario de Upstage lanzado el 22 de septiembre de 2026, no se ejecutará en ningún equipo que poseas y cobra 0,10 $ por cada millón de tokens de entrada y 0,40 $ por cada millón de tokens de salida por responder una pregunta. Ambos activan aproximadamente tres mil millones de parámetros de cómputo por token. Uno es un archivo. El otro es un medidor.
Esa diferencia decide casi todo lo demás en esta comparación, incluido qué benchmarks merece la pena siquiera poner uno al lado del otro. Granite 4.2 3B tuvo una evaluación independiente mucho antes de que Solar Mini 4 la tuviera — Artificial Analysis le otorga un 9 en el Intelligence Index v4.3.2, del mismo conjunto de evaluaciones y la misma organización que puntúa a Solar Mini 4 con 24. Lo que significa que la diferencia de quince puntos aquí está inusualmente bien fundamentada: es un laboratorio, una metodología y dos modelos que nadie tuvo que aceptar por fe.
La especificación, en las dimensiones que realmente los separan
• Arquitectura — Solar Mini 4 es una mezcla dispersa de expertos: 35B parámetros totales, 3B activos por token, según Upstage. Granite 4.2 3B es denso, unos 3B parámetros con aproximadamente 4B en total, incluyendo embeddings, según los metadatos de safetensors. El mismo presupuesto de activación, dos formas distintas de gastarlo.
• Pesos — Solar Mini 4 es propietario y cerrado. Granite 4.2 3B se distribuye bajo Apache 2.0 con una receta de entrenamiento documentada hasta las proporciones de los datos.
• Contexto — Upstage documenta 512K tokens con hasta 128K de salida; Artificial Analysis indica 1.0M para el mismo modelo, así que considera que el límite máximo no está definido. Granite 4.2 3B ejecuta 131,072 tokens de forma nativa, extendidos a 512K mediante una quinta fase de preentrenamiento.
• Precio — Solar Mini 4 a $0.10 / $0.01 en caché / $0.40 por millón de tokens, actualmente con un 50 % de descuento hasta el 22 de octubre de 2026. Granite 4.2 3B no tiene tarifa de proveedor porque no hay nada que alquilar; los endpoints alojados que rastrea Artificial Analysis lo sitúan en torno a $0.03 / $0.12, y el autoalojamiento cuesta electricidad.
• Índice de inteligencia — 24 para Solar Mini 4, 9 para Granite 4.2 3B, ambos de Artificial Analysis v4.3.2.
• Velocidad — 204 tokens de salida por segundo para Solar Mini 4 y 223 para Granite 4.2 3B, ambos medidos por el mismo laboratorio, con un tiempo hasta el primer fragmento de 1,5 s y 0,5 s respectivamente. El modelo denso es el más rápido en ambos aspectos.
De qué está hecha realmente la brecha de quince puntos

Las evaluaciones individuales cuentan una historia menos halagadora que el titular para Granite 4.2 3B, y una más complicada para Solar Mini 4. En AA-LCR v1.1, el benchmark de razonamiento de contexto largo, Solar Mini 4 obtiene un 83 % y Granite 4.2 3B obtiene un 24 %. Esa única evaluación representa una enorme proporción de la diferencia del índice, y no es un accidente de escala: es lo que se compra con 512K a 1M tokens de contexto y el entrenamiento para usarlo. La ventana de Granite 4.2 3B llega como máximo a 131K de forma nativa; la fase extendida de 512K existe, pero el modelo no fue ajustado para razonar a través de ella como sí lo fue Solar Mini 4.
En conocimiento general, la brecha se reduce y luego se invierte en carácter. Granite 4.2 3B obtiene un 55,9 % en GPQA, y Solar Mini 4 no tiene ninguna cifra de GPQA; en Humanity's Last Exam los dos son 6,6 % y 25,8 % respectivamente, que es la comparación más directa y la que predice la diferencia de tamaño. Lo que Granite 4.2 3B no hace, según Artificial Analysis, es fabricar: su tasa de no alucinación en AA-Omniscience es del 73,7 %, superior al 64,2 % de Solar Mini 4. El modelo más pequeño es menos propenso a inventar una respuesta que no tiene.
La programación agéntica es donde ambos modelos fracasan, y donde importa leer las cifras. Solar Mini 4 obtiene un 1 % en Terminal-Bench 4.0 y un 22,3 % en AutomationBench-AA. Granite 4.2 3B obtiene un 0 % en Terminal-Bench 4.0, un 13,9 % en el antiguo Terminal-Bench 2.1 y un 5,6 % en τ³-Banking. Ninguno de los dos modelos es el instrumento adecuado para el trabajo autónomo en la terminal. Los miembros de 8B y 30B de la familia Granite 4.2 recibieron el aprendizaje por refuerzo agéntico de IBM y cuentan con resultados en SWE-Bench y Terminal-Bench; el 3B se saltó explícitamente ese bloque de entrenamiento, y el modelo de Upstage tiene un precio pensado para la recuperación, la estructuración y la aplicación de políticas, más que para manejar una shell.
Dónde Granite 4.2 3B sigue siendo la respuesta correcta
Siete gigabytes y un tercio de pesos en bfloat16, menos de cuatro gigabytes con una cuantización práctica, y una licencia Apache 2.0 que te permite afinarlo con tus propios datos y distribuir el resultado sin pedir permiso a nadie. Un estudiante con una sola GPU de consumo, un hospital que no puede enviar texto de pacientes a un tercero, un producto que necesita funcionar en un avión o en el sótano de una fábrica, un equipo que quiere poseer un modelo en lugar de alquilar un endpoint: todos esos casos eligen Granite 4.2 3B y no miran atrás. El motor funciona con vLLM, SGLang, Transformers y GGUF, y Ollama incluye una compilación granite4.2:3b.
Sus cifras reportadas por el proveedor merecen la cautela habitual. La ficha de IBM afirma 78.33 en AIME 2025, 66.67 en HMMT February 2025 y 69.71 en LiveCodeBench v6 —ninguna ha sido reproducida por ningún tercero—, y para un modelo denso de 3B la cifra de AIME se sitúa muy por encima del rango histórico. El índice 9 de Artificial Analysis registra el modelo como genuinamente útil y muy lejos de la frontera, que es la señal más fiable precisamente porque IBM no la publicó.
Donde Solar Mini 4 es la respuesta correcta
Cualquier cosa en la que el trabajo sea un documento extenso, una extracción estructurada repetida o una política que deba aplicarse de forma consistente en gran volumen —y en la que noventa segundos de latencia sean aceptables. El perfil de Solar Mini 4 es el de un especialista: 83 % en razonamiento de contexto largo, 48 % en programación científica, 64 % de no alucinación y una tendencia documentada a abstenerse en lugar de adivinar. También habla coreano como lengua de primera clase junto con el inglés y el japonés, lo cual, para un despliegue en el mercado coreano, no es una nota al pie.
Lo que los compradores no deberían hacer es comparar los dos precios de tokens y concluir que Solar Mini 4 es tres veces más caro. Artificial Analysis midió Solar Mini 4 en $0.36 por tarea completada del Intelligence Index — y, en la misma suite, Granite 4.2 3B en $0.006. Eso es un factor de sesenta, impulsado por las mismas cosas que inflan Solar Mini 4 frente a GPT-6 Luna (max): 88,300 tokens de salida por tarea frente a los 18,600 de Granite, y una estructura de costos en la que las escrituras de caché de prompt representan $0.30 de los $0.36 de Solar Mini 4 frente a $0.0006 de los $0.006 de Granite. Un precio de salida barato en un modelo verboso no es una tarea barata.

Ninguno de los dos modelos está en OrcaRouter —ni enrutamos Granite ni Upstage—, así que si quieres Granite 4.2 3B, viene de Hugging Face, y si quieres Solar Mini 4, viene de la propia API de Upstage y de plataformas de terceros. Pero el patrón de dos modelos que sugiere esta comparación es aquel para el que están hechos los routers, y es la razón por la que OrcaRouter pone más de 200 modelos detrás de una sola clave con un 0 % de margen sobre el precio de lista del proveedor: ejecuta el trabajo de documentos largos y de idioma coreano contra el modelo que realmente justifique su coste, mantén los pasos de extracción deterministas en algo que alojes tú, y deja que el enrutamiento y la conmutación por error muevan una solicitud entre ellos por llamada en lugar de por contrato.

Una última nota sobre los números anteriores. Cada cifra de Solar Mini 4 que proviene de Artificial Analysis es una medición independiente; cada cifra de Granite 4.2 3B de la ficha del modelo de IBM es una afirmación del proveedor que ningún tercero ha reproducido. Las puntuaciones del índice de Artificial Analysis de 24 y 9 son los únicos dos números aquí que fueron producidos por el mismo laboratorio bajo las mismas condiciones, y son los dos sobre los que se debe basar una decisión.
