
Solar Mini 4 vs Granite 4.2 3B : un modèle que vous appelez et un checkpoint que vous téléchargez
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 par million de tokens
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 par million de tokens · 159 tok/s
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 220 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Mettez Solar Mini 4 à côté de Granite 4.2 3B, et le nombre intéressant n’est pas l’écart au benchmark. C’est que Granite 4.2 3B, le modèle de raisonnement Apache-2.0 d’IBM publié le 25 août 2026, tournera ce soir sur un ordinateur portable pour rien, tandis que Solar Mini 4, le modèle propriétaire d’Upstage publié le 22 septembre 2026, ne tournera sur aucun appareil que vous possédez et facture 0,10 $ par million de jetons d’entrée et 0,40 $ par million de jetons de sortie pour répondre à une question. Les deux activent environ trois milliards de paramètres de calcul par jeton. L’un est un fichier. L’autre est un compteur.
Cette différence détermine presque tout le reste de cette comparaison, y compris quels benchmarks méritent même d’être mis côte à côte. Granite 4.2 3B a bénéficié d’une évaluation indépendante bien avant Solar Mini 4 — Artificial Analysis lui attribue une note de 9 sur l’Intelligence Index v4.3.2, issue de la même suite d’évaluation et de la même organisation qui attribue à Solar Mini 4 une note de 24. Ce qui signifie que l’écart de quinze points est ici inhabituellement bien étayé : un seul laboratoire, une seule méthodologie, et deux modèles que personne n’a eu à croire sur parole.
La spécification, sur les dimensions qui les séparent réellement
• Architecture — Solar Mini 4 est un mélange d’experts creux : 35 B de paramètres au total, 3 B actifs par token, selon Upstage. Granite 4.2 3B est dense, avec environ 3 B de paramètres et environ 4 B au total, embeddings compris, d’après les métadonnées safetensors. Même budget d’activation, deux façons différentes de le dépenser.
• Poids — Solar Mini 4 est propriétaire et fermé. Granite 4.2 3B est distribué sous Apache 2.0 avec une recette d'entraînement documentée jusque dans les proportions des données.
• Contexte — Upstage documente 512K tokens avec jusqu'à 128K de sortie ; Artificial Analysis indique 1,0 M pour le même modèle, donc considérez le plafond comme non établi. Granite 4.2 3B fonctionne nativement avec 131 072 tokens, étendu à 512K par une cinquième phase de pré-entraînement.
• Prix — Solar Mini 4 à 0,10 $ / 0,01 $ en cache / 0,40 $ par million de jetons, actuellement à -50 % jusqu'au 22 octobre 2026. Granite 4.2 3B n'a pas de grille tarifaire fournisseur, car il n'y a rien à louer ; les points de terminaison hébergés qu'Artificial Analysis suit l'estiment à environ 0,03 $ / 0,12 $, et l'auto-hébergement coûte de l'électricité.
• Intelligence Index — 24 pour Solar Mini 4, 9 pour Granite 4.2 3B, tous deux d’après Artificial Analysis v4.3.2.
• Vitesse — 204 jetons de sortie par seconde pour Solar Mini 4 et 223 pour Granite 4.2 3B, tous deux mesurés par le même laboratoire, avec un temps jusqu'au premier segment de 1,5 s et 0,5 s respectivement. Le modèle dense est le plus rapide sur ces deux points.
De quoi est réellement constitué l'écart de quinze points

Les évaluations individuelles racontent une histoire moins flatteuse que l'annonce principale pour Granite 4.2 3B, et une histoire plus compliquée pour Solar Mini 4. Sur AA-LCR v1.1, le benchmark de raisonnement à long contexte, Solar Mini 4 obtient 83 % et Granite 4.2 3B obtient 24 %. Cette seule évaluation représente une part énorme de la différence d'indice, et ce n'est pas un accident d'échelle — c'est ce que vous achetez avec 512K à 1M de tokens de contexte et l'entraînement nécessaire pour l'exploiter. La fenêtre de Granite 4.2 3B plafonne nativement à 131K ; la phase étendue à 512K existe, mais le modèle n'a pas été ajusté pour raisonner sur toute cette étendue comme l'a été Solar Mini 4.
Sur les connaissances générales, l'écart se resserre puis s'inverse en nature. Granite 4.2 3B obtient 55,9 % sur GPQA, et Solar Mini 4 n'a pas du tout de chiffre pour GPQA ; sur Humanity's Last Exam, les deux affichent 6,6 % et 25,8 % respectivement, ce qui est la comparaison la plus directe et celle que la différence de taille laisse présager. Ce que Granite 4.2 3B ne fait pas, selon Artificial Analysis, c'est fabriquer : son taux de non-hallucination AA-Omniscience est de 73,7 %, supérieur à celui de Solar Mini 4 (64,2 %). Le plus petit modèle est moins susceptible d'inventer une réponse qu'il n'a pas.
Le codage agentique est le point de chute des deux modèles, et c'est là que la lecture des chiffres compte. Solar Mini 4 obtient 1 % sur Terminal-Bench 4.0 et 22,3 % sur AutomationBench-AA. Granite 4.2 3B obtient 0 % sur Terminal-Bench 4.0, 13,9 % sur l'ancien Terminal-Bench 2.1 et 5,6 % sur τ³-Banking. Aucun des deux modèles n'est l'instrument adéquat pour le travail autonome en terminal. Les membres 8B et 30B de la famille Granite 4.2 ont bénéficié de l'apprentissage par renforcement agentique d'IBM et affichent des résultats sur SWE-Bench et Terminal-Bench ; le 3B a explicitement sauté ce bloc d'entraînement, et le modèle d'Upstage est positionné pour la récupération d'informations, la structuration et l'application de politiques plutôt que pour piloter un shell.
Là où Granite 4.2 3B reste encore la bonne réponse
Sept gigaoctets et un tiers de poids en bfloat16, moins de quatre gigaoctets à une quantification pratique, et une licence Apache 2.0 qui vous permet de l'affiner sur vos propres données et de diffuser le résultat sans demander à quiconque. Un étudiant avec un seul GPU grand public, un hôpital qui ne peut pas envoyer de texte de patients à un tiers, un produit qui doit fonctionner dans un avion ou dans un sous-sol d'usine, une équipe qui veut posséder un modèle plutôt que louer un point de terminaison — chacun de ces cas choisit Granite 4.2 3B et ne regarde pas en arrière. Le moteur s'exécute via vLLM, SGLang, Transformers et GGUF, et Ollama répertorie une version granite4.2:3b.
Ses chiffres rapportés par le fournisseur méritent la prudence habituelle. La fiche d’IBM revendique 78,33 sur AIME 2025, 66,67 sur HMMT February 2025 et 69,71 sur LiveCodeBench v6 — aucun n’ayant été reproduit par un tiers, et pour un modèle dense de 3B, le score AIME se situe bien au-dessus de la fourchette historique. L’indice Artificial Analysis de 9 classe le modèle comme véritablement utile et très loin de la frontière, ce qui est le signal le plus fiable, précisément parce qu’IBM ne l’a pas publié.
Où Solar Mini 4 est la bonne réponse
Tout travail impliquant un long document, une extraction structurée répétée ou une politique devant être appliquée de façon cohérente à grande échelle — et pour lequel une latence de quatre-vingt-dix secondes est acceptable. Le profil de Solar Mini 4 est celui d'un spécialiste : 83 % en raisonnement sur contexte long, 48 % en codage scientifique, 64 % en non-hallucination, et une tendance documentée à s'abstenir plutôt qu'à deviner. Il parle aussi le coréen comme langue de premier ordre aux côtés de l'anglais et du japonais, ce qui, pour un déploiement sur le marché coréen, n'est pas un détail.
Ce que les acheteurs ne doivent pas faire, c'est comparer les deux prix des tokens et conclure que Solar Mini 4 est trois fois plus cher. Artificial Analysis a mesuré Solar Mini 4 à 0,36 $ par tâche de l'Intelligence Index complétée — et, sur la même suite d'évaluations, Granite 4.2 3B à 0,006 $. Cela représente un facteur soixante, porté par les mêmes éléments qui gonflent Solar Mini 4 face à GPT-6 Luna (max) : 88 300 tokens de sortie par tâche contre 18 600 pour Granite, et une structure de coûts dans laquelle les écritures dans le cache de prompts représentent 0,30 $ des 0,36 $ de Solar Mini 4, contre 0,0006 $ des 0,006 $ de Granite. Un prix de sortie bon marché sur un modèle verbeux ne fait pas une tâche bon marché.

Aucun des deux modèles n'est disponible sur OrcaRouter — nous ne routons ni Granite ni Upstage — donc si vous voulez Granite 4.2 3B, il vient de Hugging Face, et si vous voulez Solar Mini 4, il vient de l'API propre d'Upstage et de plateformes tierces. Mais le schéma à deux modèles que suggère cette comparaison est exactement celui pour lequel les routeurs sont conçus, et c'est la raison pour laquelle OrcaRouter place plus de 200 modèles derrière une seule clé, avec 0 % de marge sur le prix catalogue du fournisseur : exécutez le travail sur documents longs et en coréen avec le modèle qui justifie réellement son coût, gardez les étapes d'extraction déterministes sur quelque chose que vous hébergez, et laissez le routage et le basculement transférer une requête entre eux à chaque appel plutôt que par contrat.

Une dernière remarque sur les chiffres ci-dessus. Chaque chiffre de Solar Mini 4 qui provient d’Artificial Analysis est une mesure indépendante ; chaque chiffre de Granite 4.2 3B issu de la fiche modèle d’IBM est une affirmation du fournisseur qu’aucun tiers n’a reproduite. Les scores de l’indice Artificial Analysis de 24 et 9 sont les deux seuls chiffres ici qui ont été produits par le même laboratoire dans les mêmes conditions — et ce sont les deux sur lesquels fonder une décision.
