
Solar Mini 4 vs MathForm 8B : un modèle répond à la question, l'autre la rend vérifiable.
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 par million de tokens
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 par million de tokens · 159 tok/s
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 220 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Placez Solar Mini 4 à côté de MathForm 8B et vous comparez deux modèles qui ne se disputent pas le même token. Solar Mini 4 est le mélange d'experts creux de 35 milliards de paramètres d'Upstage, publié le 22 septembre 2026 avec environ 3 milliards de paramètres actifs par token, et il répond à des questions : lire un long document, raisonner dessus, renvoyer un résultat écrit. MathForm 8B est l'autoformalisateur de 8 milliards de paramètres d'OpenBMB, publié le 14 août 2026 sous licence Apache 2.0, et il fait quelque chose qu'aucun modèle de raisonnement ne fait du tout — il prend un énoncé mathématique en langage naturel et le réécrit sous la forme d'un théorème Lean 4 que le compilateur d'un assistant de preuve vérifiera par typage. L'un produit des réponses. L'autre produit des questions vérifiables par machine, et c'est le second qui est la denrée la plus rare.
La comparaison mérite quand même d’être faite, parce que tous les deux finissent dans le même type de pipeline, et parce que les deux ont des forces opposées d’une manière qui rend le choix inhabituellement limpide. Le modèle d’Upstage est performant sur les documents longs, faible sur le raisonnement difficile et coûteux par tâche terminée. Le modèle d’OpenBMB est étroit au point d’être inutile en dehors de sa niche, n’a jamais été évalué par un évaluateur indépendant, pas une seule fois, et ne coûte rien à exécuter une fois qu’on a un GPU.
Côte à côte, sur ce qui diffère
• De quoi il s'agit — Solar Mini 4 est un modèle de raisonnement général doté d'un contexte de 1 M de tokens (512 K selon la documentation d'Upstage elle-même) et d'un score mesuré de 24,1 sur l'Artificial Analysis Intelligence Index. MathForm 8B est un autoformaliseur mono-tâche, sans score d'indice publié, sans évaluation indépendante et sans revendication de capacités générales.
• Paramètres — 35B au total / 3B actifs, sparse, pour Solar Mini 4 ; 8.19B dense pour MathForm 8B, affiné à partir de Qwen3-8B sur le corpus FormalVerse d'OpenBMB, composé d'environ 367 000 exemples Lean 4 vérifiés.
• Licence et livraison — Solar Mini 4 est propriétaire, accessible via l'API d'Upstage et des plateformes tierces. MathForm 8B est constitué de poids Apache-2.0 avec un template de chat, quatre fragments safetensors et un chemin de déploiement Transformers, vLLM ou SGLang derrière un point de terminaison compatible OpenAI.
• Prix — Solar Mini 4 à 0,10 $ / 0,01 $ en cache / 0,40 $ par million de jetons, actuellement à 50 % de réduction jusqu'au 22 octobre 2026. MathForm 8B n'a pas de grille tarifaire ; son coût, c'est le GPU que vous mettez en dessous.
• Vitesse — 204 tokens de sortie par seconde pour Solar Mini 4 sur le harnais d'Artificial Analysis, avec 88 300 tokens de sortie par tâche d'index et environ 430 secondes de travail par tâche. La sortie de MathForm 8B est un en-tête de théorème Lean 4, quelques centaines de tokens au maximum.
• Indépendance des chiffres — Solar Mini 4 a été exécuté par un tiers. MathForm 8B non : chaque chiffre de son article provient des auteurs eux-mêmes, et le modèle est trop récent et trop spécialisé pour avoir fait l'objet d'une exécution indépendante.
Là où les deux modèles se rejoignent, et là où ils ne se rejoignent pas.

Ce sont les modes de défaillance qui rendent ce duo intéressant, car ils sont exactement opposés. Le résultat publié le plus faible de Solar Mini 4 est Terminal-Bench 4.0, à 1 %, avec AutomationBench-AA à 22,3 % — il est mauvais pour vérifier son propre travail dans un environnement qui lui fournit un retour d'information. Tout le postulat de conception de MathForm 8B repose sur la vérification : OpenBMB distingue un Syntax Check, qui demande si l'énoncé Lean 4 se compile, d'un Consistency Check, qui demande si l'énoncé compilé signifie réellement la même chose que le problème informel. L'échec classique qu'il vise à prévenir est un énoncé qui passe le contrôle de types tout en affaiblissant silencieusement l'assertion.
C'est une véritable distinction, et il vaut la peine d'être précis à ce sujet. Un modèle de raisonnement qui produit une preuve a un problème d'auto-vérification bien connu : rien dans la génération ne vous dit si la réponse est juste. Un compilateur, lui, le fait. Si votre flux de travail consiste à « convertir une banque de problèmes en quelque chose qu'une machine peut vérifier », MathForm 8B fait la moitié du travail que Solar Mini 4 ne peut pas faire du tout, et ce qui reste n'est pas une question de degré.
Les chiffres du fournisseur, étiquetés comme tels : l'article d'OpenBMB rapporte une moyenne Pass@8 de 88,06 % avec Syntax Check et de 72,37 % avec Consistency Check sur six benchmarks, et affirme qu'ils surpassent plusieurs autoformaliseurs spécialisés de 32B. Rien de tout cela n'a été reproduit par un tiers. L'écart de 16 points entre les deux vérifications est le chiffre instructif — il mesure la fréquence à laquelle une instruction compilée n'est pas tout à fait le problème que vous avez posé, et c'est la raison pour laquelle Consistency Check existe en tant que colonne distincte.
Pourquoi une équipe exécuterait les deux
Car le pipeline naturel comporte une étape peu coûteuse à fort volume et une étape coûteuse à faible volume. MathForm 8B s'exécute sur votre propre matériel et convertit des problèmes informels en en-têtes Lean 4, avec un compilateur disponible pour rejeter les sorties erronées avant qu'un humain ne les voie. Solar Mini 4 gère ce qui se passe autour de cela : lire l'article de support, extraire les hypothèses, résumer le résultat en coréen ou en anglais, et acheminer le travail. Les deux n'entrent jamais en concurrence pour la même requête, et c'est le plus petit qui est responsable de la partie du travail dotée d'un signal objectif de réussite/échec.
Aucun des deux modèles ne fait partie de ceux que nous pouvons router vers vous — les modèles d'Upstage ne sont pas sur OrcaRouter, et ceux d'OpenBMB non plus — donc si vous voulez Solar Mini 4, il provient de l'API propre à Upstage, et si vous voulez MathForm 8B, il provient de Hugging Face et de votre propre GPU. Ce que nous pouvons faire, c'est mettre le reste de ce pipeline derrière une seule clé : plus de 200 modèles avec 0 % de marge sur le prix catalogue des fournisseurs, un basculement automatique entre fournisseurs, et un DSL de routage qui vous permet d'enchaîner les modèles en un seul appel. Dans un workflow où un petit spécialiste effectue l'étape de formalisation et où un grand généraliste fait tout ce qui l'entoure, pouvoir changer le généraliste en modifiant une chaîne de modèle — au lieu de livrer une nouvelle intégration — c'est la différence entre un changement de deux semaines et un après-midi.

À retenir
Si votre question est « laquelle de ces options dois-je utiliser », la réponse honnête est que cela dépend de si vous avez besoin d'une réponse ou d'une formalisation, et aucun benchmark ne tranchera. Si votre question est « MathForm 8B vaut-il le téléchargement », la réponse est oui pour une seule tâche précise et étroite, et non pour tout le reste — c'est un formalisateur, pas un prouveur, et l'obligation de preuve reste ouverte dans la sortie qu'il produit. Si votre question est « Solar Mini 4 vaut-il 0,36 $ par tâche », la réponse est oui pour de longs documents en grande quantité, et non pour tout ce qui exige qu'il vérifie son propre travail.

Sourcing, pour clore. Chaque chiffre de Solar Mini 4 ci-dessus est une mesure indépendante d'Artificial Analysis, à l'exception de la fenêtre de contexte, qui provient d'Upstage elle-même et diffère de la leur. Chaque chiffre de MathForm 8B est déclaré par le fournisseur, issu de l'arXiv 2608.14221, et non reproduit ; sa sortie n'a pas été annoncée — les poids, le jeu de données FormalVerse et l'article sont tous apparus le 14 août 2026, sans billet de blog du fournisseur ni exécution d'un benchmark indépendant à ce jour.
