
Solar Mini 4 a obtenu un score de 24 sur l'Artificial Analysis Index — et coûte cinq fois plus par tâche que GPT-6 Luna
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 par million de tokens
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 par million de tokens · 159 tok/s
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 220 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Solar Mini 4 facture le même prix par token d'entrée que GPT-6 Luna, et environ cinq fois plus pour réellement terminer une tâche. Telle est toute l'histoire de la première évaluation indépendante du nouveau modèle d'Upstage, et ce n'est pas celle que racontaient les supports de lancement. Solar Mini 4 a été lancé le 22 septembre 2026 sous la forme d'un mixture-of-experts clairsemé de 35 milliards de paramètres qui active environ 3 milliards de paramètres par token, à 0,10 $ par million de tokens d'entrée et 0,40 $ par million de tokens de sortie. GPT-6 Luna, la déclinaison d'efficience d'OpenAI, s'affiche à 0,10 $ et 0,50 $, avec un palier de contexte long au-delà de 272 000 tokens qui double à peu près ces deux montants. Sur une grille tarifaire, ils ressemblent au même achat. Sur l'Intelligence Index d'Artificial Analysis, où les deux modèles ont été soumis à la même suite de dix évaluations, Solar Mini 4 coûte 0,36 $ par tâche accomplie, contre 0,07 $ pour GPT-6 Luna (max) — un facteur de 5,4 qui découle entièrement de la façon dont les deux modèles se comportent pendant une tâche, et non de ce qu'ils facturent par token.
Le 30 septembre 2026, Artificial Analysis a publié son analyse du modèle, qui obtient 24 sur l'Intelligence Index v4.3.2. Tout ce qui, dans cet article, est attribué à Artificial Analysis relève de la mesure de cette organisation elle-même ; tout ce qui est attribué à Upstage est une affirmation du fournisseur. La distinction importe davantage ici que d'ordinaire, car les deux ensembles de chiffres ne concordent pas toujours.
Ce que dit réellement la candidature indépendante

Solar Mini 4 obtient 24,05 sur l'Intelligence Index, contre une médiane de 12 parmi les modèles de raisonnement de sa gamme de prix. Cela le place bien au-dessus de la moyenne de sa catégorie, et la présentation qu'en fait Upstage — « le meilleur score global parmi les modèles à 3B actifs dans la comparaison de l'Artificial Analysis Intelligence Index » — résiste à des tests indépendants sur ce point précis. Qwen3.6 35B A3B, qui active lui aussi 3B paramètres, obtient 18,2 sur le même indice. K2 Horizon MoVA 36B A4B, avec 4B actifs, obtient 25,3 — et il y parvient sur un contexte plus court, 524K tokens contre 1,05 M pour Solar Mini 4. Face à Inkling, un MoE à poids ouverts de 975 milliards de paramètres publié en juillet, Solar Mini 4 affiche 24,1 contre 25,0 — à un point près d'un modèle près de trente fois plus grand qui coûte 1,00 $/4,05 $ par million de tokens.
Le profil à l’intérieur de cette partition est irrégulier, et cette irrégularité est la partie utile :
• Le raisonnement sur de longs contextes est le point fort relatif.Solar Mini 4 obtient un score de 83 % sur AA-LCR v1.1, à égalité avec MiniMax-M3 et GPT-6 Luna (max), et devant Gemini 3.8 Flash (high) et GPT-6 Astra (max) à 81 %.
• Le codage scientifique tient bon. 48 % sur SciCode, un point devant MiniMax-M3 et Inkling (xhigh).
• Le codage agentique s'effondre. 1 % sur Terminal-Bench 4.0. Pas « faible » — 1 %. Sur AutomationBench-AA, qui exécute des workflows à plusieurs étapes sur de véritables applications SaaS, 22,3 %.
• La précision des connaissances est faible, mais le modèle sait qu'il devine.AA-Omniscience obtient −11 avec une précision de 18 % ; le modèle s'abstient pour environ la moitié des questions qui lui sont posées. Son taux de non-hallucination est de 64 %, bien devant Inkling (xhigh) à 32 % et GPT-6 Luna (max) à 23 %. Un modèle qui dit « Je ne sais pas » la moitié du temps et qui a raison deux fois sur trois lorsqu'il répond est un instrument différent d'un modèle qui confabule avec assurance.
En matière de travail agentique, les chiffres sont de 1072 Elo sur GDPval-AA et de 872 Elo sur AA-Briefassistant.
Le nombre cinq fois, décortiqué
Le chiffre du coût par tâche d'Artificial Analysis est celui qui décidera la plupart des conversations d'achat, et il mérite d'être lu comme une décomposition plutôt que cité comme un gros titre. Deux choses le déterminent.
D'abord, le volume. Solar Mini 4 émet environ 88 300 tokens de sortie par tâche de l'Intelligence Index ; 71 600 d'entre eux sont des tokens de raisonnement. À 0,40 $ par million de tokens de sortie, cela représente environ 0,035 $ de la facture — bon marché, car la sortie est bon marché. Ce qu'il coûte en revanche, c'est du temps : à une vitesse mesurée de 204 tokens par seconde, Artificial Analysis enregistre 430 secondes de travail pour une tâche moyenne de l'index, soit environ 7,2 minutes. GPT-6 Luna (max) émet 50 000 tokens de sortie par tâche à 127 tokens par seconde et prend 396 secondes. Inkling (xhigh), un modèle à poids ouverts de 975 milliards de paramètres, émet 34 700 tokens et termine en 169 secondes. Solar Mini 4 est plus lent que les deux, mais d'une marge sans rapport avec l'écart de coût d'un facteur cinq.
Deuxièmement — et c'est là toute l'histoire — l'entrée écrite dans le cache. La ventilation des coûts d'Artificial Analysis attribue environ 0,30 $ des 0,36 $ par tâche de Solar Mini 4 aux tokens écrits dans le cache de prompt, contre 0,03 $ pour les lectures de cache, 0,035 $ pour la sortie et une erreur d'arrondi pour l'entrée réellement non mise en cache. Pour GPT-6 Luna (max), l'écriture dans le cache représente 0,012 $ sur 0,068 $ — environ 17 % de la facture, contre 82 % pour Solar Mini 4. L'entrée mise en cache est la ligne la moins chère du tarif d'Upstage, à 0,01 $ par million, et le modèle d'Artificial Analysis l'utilise bien ; le problème, c'est la quantité qui doit être écrite avant de pouvoir être lue. Un agent qui renvoie une conversation croissante à chaque tour paie le coût d'écriture bien plus souvent qu'un modèle qui répond en un tour court et fermé.
Voilà la conclusion qu'il vaut la peine de retenir pour la production : pour un modèle comme celui-ci, le prix par token ne prédit presque rien de la facture par tâche. Le comportement du cache, si.
Là où les propres chiffres d'Upstage diffèrent

Le billet de lancement d'Upstage, publié le 1er octobre 2026 sous le titre « Solar Mini 4 : conçu pour les charges de travail d'agents à fort volume », rapporte 24,1 sur l'Artificial Analysis Intelligence Index — pratiquement le même chiffre — et formule plusieurs affirmations qui se situent à côté des données indépendantes plutôt qu'au-dessus d'elles.
Le fournisseur cite 22,3 % sur AutomationBench-AA, ce qui correspond exactement à Artificial Analysis, et 47,2 sur τ³-Banking, un benchmark d'usage de politiques et d'outils que la suite d'indices a depuis abandonné. Il rapporte 83,3 % sur AA-LCR et 47,6 % sur SciCode, tous deux à une erreur d'arrondi près des chiffres indépendants. Sur Humanity's Last Exam, il rapporte 19,6 %, tandis que la page d'Artificial Analysis affiche 25,8 % pour le même modèle ; les deux sont des lectures plausibles d'une évaluation notoirement volatile, mais ce n'est pas le même chiffre et ni l'un ni l'autre ne devrait être présenté à la place de l'autre.
Deux lignes de spécifications ne concordent pas non plus. Upstage documente une fenêtre de contexte de 512 K jetons avec jusqu’à 128 K jetons de sortie. Artificial Analysis répertorie une fenêtre de contexte de 1,0 M de jetons et une sortie maximale de 262 K. Le blog d’Upstage précise explicitement que le chiffre de 512 K correspond au contrat de livraison ; ce type d’écart mérite d’être résolu en le confrontant à une réponse d’API avant que quiconque ne construise un pipeline de récupération dessus.
Le fournisseur produit également la seule comparaison qu'il peut faire selon ses propres critères : un test interne portant sur trois tâches d'agent en coréen, exécutées trois fois par modèle, dans lequel la réalisation de 1 000 ensembles de trois tâches a coûté un montant estimé à 1,25 $ avec Solar Mini 4 et à 2,20 $ avec MiMo-V2.5. Il s'agit d'un test réalisé par le fournisseur sur des tâches choisies par le fournisseur, latence exclue, et il pointe dans la direction opposée au résultat d'Artificial Analysis. Il n'est pas faux — des tâches différentes sollicitent des budgets de tokens différents — mais c'est un chiffre marketing, et la remise de lancement publiée pour le modèle constitue une raison supplémentaire de recalculer vos propres chiffres plutôt que d'adopter ceux de qui que ce soit.
Tarification, d'après la documentation actuelle de la console Upstage : 0,10 $ par million de jetons d'entrée, 0,01 $ par million de jetons d'entrée mis en cache, 0,40 $ par million de jetons de sortie, avec une remise de lancement actuellement annoncée à 50 % jusqu'au 22 octobre 2026 UTC inclus, ce qui porte les tarifs effectifs à 0,05 $ en entrée, 0,005 $ en entrée mise en cache et 0,20 $ en sortie jusqu'à cette date.
Ce que cela signifie si c'est vous qui payez
Ce qui est intéressant avec Solar Mini 4, ce n'est pas que ce soit un mauvais modèle. C'est que c'est un petit modèle véritablement bon, dont l'économie est dominée par des comportements qu'une grille tarifaire ne peut pas montrer. Un 24 à l'indice avec trois paramètres actifs est un véritable résultat d'ingénierie, et les charges de travail en coréen — le point fort annoncé du modèle, aux côtés de l'anglais et du japonais — sont exactement là où ce résultat est le plus susceptible de valoir son prix.
La partie délicate, c’est tout ce qui se trouve en aval du premier appel. De longs tours de réponse de l’assistant, une faible réutilisation du cache et une tâche qui demande sept minutes de décodage par exécution d’index aboutissent à un chiffre qui ne ressemble en rien à 0,10 $/0,40 $. Si vous l’évaluez, l’expérience honnête consiste en un test de coût par tâche terminée sur votre propre charge de travail, avec la mise en cache des prompts activée comme votre stack de production l’utiliserait réellement — et non une comparaison des prix par token.
C'est aussi le type de problème qu'un routeur a pour vocation de résoudre, et la raison pour laquelle OrcaRouter récpercute les prix catalogue des fournisseurs à 0 % de marge, afin qu'un changement de prix d'un fournisseur se retrouve sur votre facture le jour même. Nous ne routons pas les modèles Upstage, donc ni Solar Mini 4 ni Solar Pro 4 n'est disponible chez nous — ils proviennent de l'API propre à Upstage et de plateformes tierces. Ce que nous routons, c'est l'autre moitié de cette comparaison : GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash et plus de 200 autres modèles derrière une seule clé, ce qui permet concrètement de garder un modèle bon marché et un modèle coûteux sur la même tâche et de laisser le basculement automatique et le routage par requête décider lequel répond. Quand la différence entre deux modèles est un écart de coût par tâche d'un facteur cinq qu'aucune liste de prix ne révèle, la possibilité de déplacer une seule requête de l'un à l'autre compte davantage que n'importe quel tableau de benchmarks.

En bref : Solar Mini 4 est le nouveau point de Pareto qu’Artificial Analysis trace pour les modèles de moins de trois milliards de paramètres actifs, et il est environ cinq fois plus cher par tâche accomplie qu’un modèle qui affiche le même prix d’entrée. Ces deux affirmations sont vraies, et c’est la seconde qui apparaît sur une facture.
