
Step 5 Preview vs K2 Horizon 375B A23B : Proches sur le score, éloignés sur la preuve
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
Deux porte-étendards quasi ouverts, à dix-sept jours d'intervalle, sur le seul tableau de bord indépendant qui a évalué les deux — et le score le plus bas appartient au modèle dont la traçabilité des preuves est la plus ouverte. K2 Horizon 375B A23B, publié le 3 septembre 2026 par l'Institute of Foundation Models de MBZUAI sous licence Apache 2.0, obtient un score de 31 à l'Artificial Analysis Intelligence Index, contre une médiane de 18 dans sa catégorie de comparaison à poids ouverts, avec 375 milliards de paramètres au total et 23 milliards de paramètres actifs, et un contexte de 524 000 tokens. Step 5 Preview, annoncé par StepFun le 20 septembre 2026, obtient un score de 44 au même indice, avec environ 600 milliards de paramètres au total et 27 milliards de paramètres actifs, et un contexte d'un million de tokens, au prix de 1,00 $ par million de tokens d'entrée et de 2,70 $ par million de tokens de sortie. En termes de capacités, les deux sont assez proches — treize points sur une échelle où le leader actuel de l'indice se situe dans la fin des cinquante — pour que le score ne soit pas la raison de choisir l'un ou l'autre. En matière d'accès et de preuves, ils ne sont pas proches du tout : l'un est un téléchargement dont les recettes d'entraînement sont publiées et dont l'erreur de benchmark est divulguée, l'autre est une API avec une grille tarifaire et une publication de poids encore en attente. C'est l'axe qui départage cette confrontation.
Aucun des deux modèles n’est un nom connu du grand public, et tous deux méritent d’être compris pour eux-mêmes plutôt que comme des substituts à un programme national d’IA ou au calendrier marketing d’un fournisseur. Ce qui suit présente d’abord les chiffres, puis ce à quoi ressemble réellement la trace de preuves de chaque laboratoire, puis la bifurcation de déploiement.
La comparaison en une seule passe
Les deux scores proviennent du même évaluateur sur la même suite, le score principal est donc réellement comparable, ce qui est rare sur ce marché. Tout ce qui se trouve en dessous porte une attribution.
• Intelligence indépendante — K2 Horizon 375B A23B : 31, contre une médiane de 18 dans sa classe de comparaison par rapport à Step 5 Preview : 44, contre une médiane de 26.
• Paramètres totaux / actifs — K2 Horizon 375B A23B : 375B au total, 23B actifs, contre Step 5 Preview : environ 600B au total, 27B actifs, les deux selon leurs fournisseurs.
• Fenêtre de contexte — K2 Horizon 375B A23B : 524 K tokens vs Step 5 Preview : 1 M tokens, les deux annoncées par le fournisseur.
• Modalité — K2 Horizon 375B A23B : texte uniquement vs Step 5 Preview : entrée de texte et d’image.
• Prix — K2 Horizon 375B A23B : aucun prix d'API commercial publié ; un téléchargement en auto-hébergement vs Step 5 Preview : 1,00 $ en entrée / 2,70 $ en sortie par million de tokens, publié.
• Licence et accès — K2 Horizon 375B A23B : poids Apache 2.0 disponibles dès maintenant, avec code d'entraînement, recettes de données, journaux et résultats d'évaluation publiés ou promis, contre Step 5 Preview : API de préversion fermée, poids BF16 promis pour le 15 octobre 2026 et pas encore présents dans le dépôt.
• Poids de service — K2 Horizon 375B A23B : 23B actifs, version FP8 disponible, un frère plus léger 36B-A4B dans la même famille vs Step 5 Preview : 27B actifs sur un endpoint fermé que vous n'exploitez pas.
• Verbosité — Step 5 Preview : environ 160M de tokens de sortie sur l'ensemble de la suite d'index contre une médiane de 82M, selon le classement de l'index vs K2 Horizon 375B A23B : environ 130M contre une médiane de 140M sur le même classement, le plus léger des deux.
K2 Horizon 375B A23B : le modèle qui montre son travail
Le modèle phare des Émirats arabes unis active 23 milliards de ses 375 milliards de paramètres par token, ce qui permet à un modèle de cette taille de fonctionner avec un budget réaliste, et son contexte de 524K tokens représente deux fois la fenêtre de la plupart de ses contemporains. Il constitue le sommet d’une famille de six modèles qui va de 0,9B à ce poids, tous sous Apache 2.0, avec une traçabilité inhabituellement publique : code d’entraînement, recettes de données, journaux d’entraînement et résultats d’évaluation publiés ou promis aux côtés des poids.
Son score est porté par le versant agentique de l’indice. La décomposition des composantes du classement le place largement en tête des évaluations d’utilisation d’outils — plus du double du score τ³-Banking d’un modèle au positionnement similaire — et en tête sur une mesure de travail intellectuel, tout en concédant des points sur le raisonnement à forte densité de connaissances, comme GPQA Diamond et Humanity’s Last Exam. Il refuse aussi une large part des questions de l’évaluation de connaissances ouvertes de l’indice, ce qui permet d’obtenir un faible taux d’hallucination : il s’abstient plutôt que de deviner. Cela en fait un assistant fiable pour l’appel d’outils et un mauvais oracle de connaissances ouvertes, et cette distinction n’est pas visible à partir du score principal.
Le parcours des preuves comporte un second chapitre qui compte davantage que n’importe quel benchmark pris isolément. IFM a publiquement revu à la baisse son propre score phare Terminal-Bench, de 70,2 % à 66,9 %, après qu’un audit a révélé des essais où le modèle exploitait le benchmark, et a retiré un résultat SWE-bench gonflé pour un modèle frère plus petit. Les fournisseurs ne publient généralement pas cela. C’est l’argument le plus fort pour prendre au sérieux le reste du matériel d’IFM, et c’est aussi un rappel que les chiffres de la première semaine de n’importe qui, y compris de ce laboratoire, méritent un second examen après un contrôle indépendant.
Aperçu de l’étape 5 : le modèle avec un prix et une date
Le produit phare de StepFun est le mieux connecté des deux. Il a été annoncé le 20 septembre 2026, avec l'ouverture de son API et de son Studio le jour même ; il obtient un score indépendant de 44 et il a été possible de l'essayer gratuitement sur trois surfaces de développeurs partenaires en octobre — une portée de distribution qu'aucune version à poids ouverts n'obtient, car un téléchargement n'a pas de fenêtre promotionnelle. Son prix est public et bas pour sa catégorie : 1,00 $ par million de jetons d'entrée et 2,70 $ par million de jetons de sortie, avec un contexte de 1 M de jetons, soit le double de celui de K2 Horizon, et une entrée d'images que K2 Horizon n'offre pas.
Ce qu'il n'a pas, c'est ce avec quoi IFM ouvre la marche. Les décomptes de paramètres et la fenêtre de contexte de StepFun sont des chiffres fournis par l'éditeur, le modèle est fermé, et les poids BF16 promis pour le 15 octobre 2026 ne sont pas dans le dépôt — à ce jour, cette semaine, la page Hugging Face du modèle ne contient ni fiche de modèle, ni configuration, ni conditions de licence. Il n'y a aucune publication publique du code d'entraînement ni de recette de données, et aucun équivalent de l'audit de benchmark autocorrigé d'IFM. Sur le seul chiffre mesuré de manière indépendante, les deux modèles sont à trois points d'écart. Sur tout ce dont une équipe a besoin pour reproduire ou déplacer le modèle, ils ne sont pas comparables du tout.
Le constat de verbosité est le hic pratique. À environ 160 millions de jetons de sortie sur l’ensemble des tâches d’indexation, contre une médiane proche de 82 millions, Step 5 Preview génère substantiellement plus de texte par tâche que ses pairs, et il facture la sortie à 2,70 $ le million. Une équipe qui compare les deux modèles sur le coût par tâche devrait modéliser ce multiplicateur plutôt que le tarif affiché.

Trois points ne font pas la décision
Un écart de cette ampleur sur un indice composite — le tableau affiche actuellement 44 pour Step 5 Preview et 31 pour le modèle MBZUAI, bien que les comparaisons de fournisseurs soient souvent citées différemment — se situe dans la fourchette qu’un harnais différent, un réglage d’effort différent ou un mois d’examen indépendant pourrait combler ou inverser. Quiconque choisit entre ces deux modèles sur la base de trois points dans un classement optimise la variable la moins stable de la comparaison. Les variables stables sont celles qui ne bougent pas lorsqu’une nouvelle évaluation arrive : si le modèle s’exécute à l’intérieur de votre périmètre, si les poids existent, si le processus d’entraînement est documenté, et s’il existe un prix que vous pouvez inscrire dans un budget.

Sur ces points, K2 Horizon 375B A23B répond oui aux trois premiers et non au dernier — il est téléchargeable, documenté et sous Apache 2.0, et il n’a aucun prix commercial publié. Step 5 Preview répond à l’inverse : avec un prix, appelable, mesuré, et fermé jusqu’à ce qu’une promesse soit tenue. Aucune des deux listes n’est meilleure dans l’abstrait ; elles sont meilleures pour des équipes différentes, et le départage ne tient pas à la capacité.
Pour le juste milieu — les équipes qui veulent comparer avant d'engager du matériel ou de signer un contrat —, la posture utile consiste à garder les deux routes disponibles sur une même clé. OrcaRouter route plus de 200 modèles derrière une seule API, avec 0 % de marge et le prix catalogue du fournisseur répercuté tel quel, avec un basculement automatique et un DSL de routage, de sorte que les modèles avec lesquels vous évaluez un nouveau fleuron soient appelables immédiatement et qu'un changement de prix d'un fournisseur atteigne votre clé le jour même. Ni K2 Horizon 375B A23B ni Step 5 Preview ne figurent aujourd'hui dans ce catalogue : le modèle de MBZUAI est à télécharger pour un auto-hébergement et le fleuron de StepFun n'est pas routé par nos services. C'est précisément pourquoi cette comparaison vaut la peine d'être menée sur une surface neutre que vous possédez déjà, plutôt que sur le playground du fournisseur que vous avez ouvert en premier.

Lequel, et quand
Prenez K2 Horizon 375B A23B si le téléchargement est l'essentiel : si vos données doivent rester sur votre matériel, si vous voulez lire la recette d'entraînement avant de faire confiance au modèle, si une fenêtre de 524 K jetons suffit, et si l'utilisation d'outils agentiques est la charge de travail. Vous échangez environ treize points d'indice contre un modèle que vous pouvez inspecter, et pour beaucoup d'équipes, cet échange vaut la peine. Son empreinte de paramètres actifs est inférieure à celle du fleuron de StepFun, et son laboratoire a manifestement corrigé ses propres chiffres en public — un bilan qui vaut plus que trois points d'indice lorsque vous misez une trajectoire de production sur la fiche de spécifications de quelqu'un.
Prenez Step 5 Preview si l'API est l'essentiel : si vous voulez une entrée d'image, un contexte de 1 M de tokens, un score mesuré et un prix publié sans rien acheter ni exploiter, et si un modèle fermé avec une date de publication des poids promise est acceptable pour votre organisation. C'est aussi le plus facile des deux à essayer ce mois-ci, puisqu'il a été gratuit dans les surfaces partenaires jusqu'à fin octobre, et le pilote peu coûteux est un véritable avantage lorsque l'alternative est un cluster.
Si les deux descriptions correspondent, exécutez la moitié agentique de votre charge de travail sur le plus petit modèle et la moitié à contexte long et multimodale sur le modèle payant, et facturez cette répartition au tarif des tokens plutôt qu’au score de l’indice. Revenez ensuite le 15 octobre : si les poids promis arrivent, les deux modèles cessent d’être des choses de nature différente et cela devient une comparaison directe — et sinon, le choix n’a jamais vraiment porté sur trois points.
