
Solar Pro 4 obtient un score de 42 : le flagship Agent-First d'Upstage, désormais mesuré indépendamment
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Upstage Solar Pro 4 est sorti le 10 août 2026, et le premier chiffre qui méritait qu’on s’y arrête était le prix : 0,30 $ par million de jetons d’entrée et 1,20 $ par million de jetons de sortie sur l’API d’Upstage, avec une offre de lancement qui réduit ces tarifs à 0,03 $ et 0,12 $ — soit 90 % de réduction — sur les listes actuelles. Quatre jours plus tard, le deuxième chiffre à retenir est arrivé. Le 12 août 2026, Artificial Analysis a publié la première évaluation indépendante de Solar Pro 4 et lui a attribué un score de 42 sur son indice d’intelligence, contre 14 pour Solar Pro 3 — soit un gain multiplié par trois par rapport au score mesuré du prédécesseur et un bond de 27 points selon le propre calcul du laboratoire — confirmant ainsi le positionnement d’Upstage de Solar Pro 4 comme son modèle propriétaire phare, le modèle qui remplace Solar Pro 3 au sommet de la gamme. Dans tous les cas, pas cher ; et désormais, mesuré de manière indépendante.
Ce qui a réellement été livré
Solar Pro 4 est le produit phare commercial du pivotement d'Upstage vers l'ère des agents. La société a passé 2026 à reconstruire la gamme Solar autour des charges de travail agentiques — son homologue open-weight Solar Open 2 est sorti fin juillet — et Solar Pro 4 est le produit hébergé vers lequel ce pivotement était orienté. Upstage le résume en une phrase : un modèle pour des tâches nécessitant un contexte soutenu, une exécution en plusieurs étapes et une réalisation de bout en bout plutôt que des réponses en une seule fois.
Concrètement, la page du modèle le décrit comme le modèle phare d'Upstage spécialisé pour l'usage agentique, adapté aux flux de travail agentiques, à la productivité bureautique, au travail intensif sur documents et au codage. Sur le papier, c'est le plus grand contexte que la gamme ait proposé — Solar Pro 3 offrait 128K — et le seul Solar à ce jour avec une histoire de raisonnement publiée et une surface d'appel d'outils destinée aux agents autonomes.
Spécifications telles que listées au lancement :
• Fenêtre de contexte — 524 288 jetons (524K) sur la fiche du fournisseur, soit environ quatre fois les 128K de la génération précédente ; la mesure indépendante d'Artificial Analysis enregistre 384K, donc considérez le chiffre le plus grand comme une affirmation d'Upstage.
• Prix — tarif officiel de l'API Upstage : 0,30 $ par million de jetons d'entrée / 1,20 $ par million de jetons de sortie, avec une entrée en cache à 0,06 $ ; une promotion de lancement la propose à 90 % de réduction, soit 0,03 $ / 0,12 $ sur les listes actuelles.
• Capacités — raisonnement, appel de fonctions, mode JSON, streaming et recherche web, avec prise en charge de l’entrée visuelle
• Poids — propriétaires, non ouverts ; aucune publication sur Hugging Face (contrairement au Solar Open 2, qui est ouvert)
• Accès — API Upstage Console ainsi que plusieurs plateformes tierces ; une application de chat sur solar-chat.upstage.ai pour des tests pratiques
Ces chiffres sont ceux annoncés par le fournisseur, pas une fiche technique auditée — et la première mesure indépendante contredit à présent l'un d'entre eux. Artificial Analysis enregistre une fenêtre de contexte de 384K tokens et une sortie maximale de 256K pour Solar Pro 4, contre les 524K et 128K–131K que le fournisseur liste. La liste des capacités et le propre chiffre de contexte d'Upstage proviennent de la page du modèle ; les chiffres d'AA sont la lecture indépendante.


Qu'est-ce qui a changé par rapport à Solar Pro 3 — les premiers chiffres indépendants
Les propres affirmations d'Upstage pour Solar Pro 4 portent sur trois axes d'amélioration par rapport à Solar Pro 3, tous pertinents pour les agents : le raisonnement sur documents longs, l'utilisation d'outils sur plusieurs tours et les performances sur les tâches en terminal. Ce sont précisément les dimensions où un modèle d'agent mérite sa place — suivre un fil conducteur sur un long document, maintenir une série d'appels d'outils sans perdre le fil et mener à bien les tâches exécutées dans un shell.
La première exécution indépendante confirme le sens de chacune de ces affirmations. Artificial Analysis a attribué à Solar Pro 4 un score de 42 sur son Intelligence Index, contre 14 pour Solar Pro 3, et les gains les plus nets se situent précisément là où Upstage les avait indiqués :
• Terminal-Bench v2.1 (tâches terminal) : 12 % → 57 %
AA-LCR (raisonnement à long contexte) : 31 % → 71 %
• τ³-Banking (utilisation d'outils multi-tour) : 9 % → 23 %
• GDPval-AA v2 (travail agentique réel) : Elo 498 → 1 277, au-dessus de la référence humaine de 1 000 et légèrement devant Qwen3.7 Max (1 272) et MiMo-V2.5-Pro (1 266).
Le placement dans l'indice est le fait marquant : 42 se retrouve aux côtés d'Inkling (xhigh, 42) et juste derrière MiMo-V2.5-Pro (43). Un modèle au prix d'une gamme économique se mesure désormais comme un agent sérieux.
Deux réserves accompagnaient ce score. L'amélioration AA-Omniscience (-53 → -1) tient surtout à l'abstention : Solar Pro 4 ne tente que 41 % des questions contre 92 % pour Solar Pro 3 ; son taux d'hallucination est passé de 88 % à 24 %, mais la précision est restée stable à 19 %. Et le gain d'intelligence se paie en latence — environ 8,6 minutes par tâche Intelligence Index contre 6,0 pour Solar Pro 3, tandis que l'utilisation de jetons s'est améliorée, passant d'environ 52k à 43k jetons de sortie par tâche. C'est un modèle plus intelligent, plus prudent, plus lent.
Pourquoi le prix compte plus que les caractéristiques techniques.
L'argument en faveur de Solar Pro 4, c'est son rapport prix/intelligence mesurée. Même au tarif officiel, un modèle avec un contexte de 384K à 524K à 0,30 $ par million de jetons d'entrée bat pratiquement tout le secteur — environ un seizième du prix d'entrée d'un modèle phare — et la promotion de -90 % fait passer ce prix à un seizième d'un seizième. Cela le place dans une fourchette où le marché vend actuellement de petits modèles rapides, et non des modèles capables d'agir comme agents avec un score de niveau intermédiaire vérifié.

Le raisonnement sceptique ne porte plus sur le fait que Solar Pro 4 est non éprouvé — la passe AA règle cette question — mais sur le fait qu'il est réel. Le gain d'omniscience est en partie un schéma de refus, pas seulement une connaissance. La latence mesurée est un recul par rapport à Solar Pro 3. Le contexte de 384K d'Artificial Analysis se situe en dessous du chiffre annoncé de 524K par le fournisseur. Et le badge « -90 % » signifie que le prix futur peut évoluer une fois la période promotionnelle terminée — le tarif durable est la liste à 0,30 $ / 1,20 $, pas l'étiquette à 0,03 $ / 0,12 $.
Qui devrait l'essayer, qui devrait attendre
Essayez-le maintenant si : vous êtes en train de prototyper un agent et que le coût dominant est celui des tokens, vous avez besoin d'une longue fenêtre de contexte et votre charge de travail tolère une réflexion plus lente, ou vous évaluez des charges de travail documentaires en coréen et d'Asie de l'Est où Upstage a toujours bien performé.
Attendez si : votre charge de travail est critique pour la production et ne peut pas absorber une régression pendant que le secteur ajuste ses attentes, vous avez besoin de poids ouverts pour l'auto-hébergement ou le réglage fin — Solar Pro 4 n'est pas ce modèle ; Solar Open 2 l'est — ou vous achetez sur la base du nombre de contexte de 524K, que la première mesure indépendante ne reproduit pas.
Une voie médiane existe et mérite d'être nommée : placer Solar Pro 4 derrière une couche de basculement plutôt que de miser tout un pipeline sur lui. Une passerelle de routage capable de basculer vers un second modèle en cas de délai dépassé ou d'erreur permet de capter les avantages d'un nouveau modèle peu coûteux sans le risque de point unique de défaillance — le schéma pour lequel la bascule automatique d'OrcaRouter existe, et parce qu'OrcaRouter transmet les prix catalogue des fournisseurs sans aucune marge, ce qu'Upstage facture est ce que vous payez, sans marge de revendeur en plus.
Que regarder ensuite
Le chapitre « pas encore de chiffres indépendants » de ce modèle est clos — il a fallu quatre jours. Ce qui compte maintenant, c'est ce qu'implique la première mesure. Le prix après promotion : le badge à 90 % est une offre d'ouverture, pas un engagement, et le tarif de liste derrière est de 0,30 $ / 1,20 $. Que Upstage réponde ou non à la latence mesurée et à l'écart de contexte 384K contre 524K, ce sont les deux résultats les plus exploitables de l'exécution AA. Et les charges de travail réelles des agents — le meilleur test d'un modèle d'appel d'outils, ce sont les tâches de longue durée en conditions réelles, pas un classement. Au 13 août 2026, le résumé précis de Solar Pro 4 est plus étroit et plus solide qu'il y a une semaine : un produit phare très abordable, conçu pour les agents, issu d'un laboratoire sérieux, confirmé comme le remplaçant de Solar Pro 3 par Upstage, avec un score indépendant de 42 à débattre.
