Carte de comparaison principale générée, intitulée « Step 5 Preview vs A.X-K2 », avec pour sous-titre « Un modèle API de 600B face à un téléchargement de 690B ». La colonne de gauche, « Step 5 Preview », indique : indice AA 44, médiane 26 ; StepFun, annoncé le 20 septembre 2026 ; environ 600B au total / 27B actifs ; contexte de 1M de tokens ; 1,00 $ en entrée / 2,70 $ en sortie par million ; API, avec tarification. La colonne de droite, « A.X-K2 », indique : indice AA 21, médiane 18 ; SK Telecom, publié le 12 août 2026 ; environ 690B au total / 33B actifs ; contexte de 262K tokens ; aucun prix d'API publié ; téléchargement sous Apache-2.0. Un pied de page précise : « Les chiffres des indices proviennent d'Artificial Analysis ; les spécifications d'A.X-K2 proviennent de SK Telecom. »
Guides & Insights

Step 5 Preview vs A.X-K2 : un modèle API de 600B face à un téléchargement de 690B

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Step 5 Preview et A.X-K2 sont les deux moitiés d'une décision qui revient sans cesse cet automne : louer un modèle de classe frontière via une API, ou emporter chez soi un fleuron à poids ouverts et l'exécuter soi-même. Step 5 Preview de StepFun, c'est la location — annoncé le 20 septembre 2026, appelable le jour même à 1,00 $ par million de tokens en entrée et 2,70 $ par million de tokens en sortie, environ 600 milliards de paramètres au total dont 27 milliards actifs, une fenêtre de contexte de 1 M de tokens, et un score indépendant de 44 à l'Artificial Analysis Intelligence Index. A.X-K2 de SK Telecom, c'est le téléchargement — publié le 12 août 2026 sous Apache 2.0, environ 688 à 692 milliards de paramètres au total dont 33 milliards actifs, une fenêtre de contexte de 262 K tokens, et un score de 21 à l'indice. L'un est plus gros, l'autre a un prix, et celui qui a un prix est celui qui obtient un score bien plus élevé. Cette inversion, c'est toute la comparaison, et elle mérite d'être comprise avant de choisir un camp par principe.

Le cadre habituel pour ces deux modèles est national : le fer de lance de l’IA souveraine de la Corée face à l’un des laboratoires les plus agressifs de Chine. Ce cadre n’est pas utile pour une décision de déploiement. Ce qui est utile, c’est que A.X-K2 est le seul des deux que vous pouvez détenir, et Step 5 Preview est le seul des deux que vous pouvez acheter au token. Tout le reste découle de cette division.

Les chiffres, rattachés à leurs sources

La seule mesure comparable de manière rigoureuse est l'Intelligence Index, et il est indépendant des deux côtés : 44 pour Step 5 Preview contre une médiane de 26 parmi les modèles comparables, et 21 pour A.X-K2 contre une médiane de 18 dans sa catégorie de comparaison à poids ouverts, les deux étant mesurés par le même tiers selon la même échelle. Lus au moment de la rédaction, ce sont les chiffres d'aujourd'hui — les scores de cet index évoluent lorsque l'évaluateur recalibre, et une lecture antérieure de la même page d'A.X-K2 affichait un nombre plus élevé. Tout le reste dans cette confrontation s'accompagne d'une attribution qu'il faut garder avec soi.

• Intelligence indépendante — Step 5 Preview : 44 sur l’Artificial Analysis Intelligence Index contre A.X-K2 : 21 sur le même indice, mesuré indépendamment.

• Paramètres totaux / actifs — Step 5 Preview : environ 600 Md au total, 27 Md actifs selon StepFun, contre A.X-K2 : environ 688–692 Md au total, 33 Md actifs selon les documents de SK Telecom et la fiche index.

• Fenêtre de contexte — Step 5 Preview : 1M tokens pour StepFun vs A.X-K2 : 262K tokens.

• Modalité — Step 5 Preview accepte le texte et les images ; A.X-K2 est uniquement textuel.

• Prix — Step 5 Preview : 1,00 $ par million en entrée et 2,70 $ par million en sortie, publiés par le fournisseur vs A.X-K2 : aucun prix d'API commercial publié.

• Où cela s’exécute — Step 5 Preview : l’API et le Studio propres à StepFun, ainsi que des surfaces partenaires pendant les fenêtres promotionnelles, par rapport à A.X-K2 : votre matériel, à partir d’un téléchargement.

• Sortie — Step 5 Preview annoncé le 20 septembre 2026 vs A.X-K2 sorti le 12 août 2026.

• Licence — Step 5 Preview : aperçu fermé avec des poids BF16 promis pour le 15 octobre 2026 vs A.X-K2 : Apache 2.0.

A.X-K2 : l’instrument le plus lourd, avec les preuves les plus ténues

SK Telecom a conçu A.X-K2 comme le successeur d’A.X K1, et l’architecture vise directement le coût du contexte long : une organisation de mélange d’experts avec 256 experts et 8 actifs par token, entraînée nativement en FP8, avec un mécanisme que l’entreprise appelle Sparse Gated Attention. C’est un travail d’ingénierie sérieux, et c’est la raison pour laquelle un modèle totalisant près de 700 milliards de paramètres peut être servi tout court par une organisation qui n’est pas un hyperscaler.

Ce qui lui manque, c’est une confirmation indépendante. SK Telecom rapporte un gain moyen de 32,2 points sur quatorze benchmarks par rapport à A.X K1, un bond d’environ 83,9 points sur les évaluations de contexte long et d’agents, 97,1 sur AIME 2026, 80,5 sur le benchmark coréen de connaissances KMMLU-Pro et 91,6 sur CLIcK, et affirme qu’il égale ou dépasse les récentes versions de Qwen et DeepSeek en mathématiques et en travail sur la langue coréenne. Chacun de ces chiffres est celui du fournisseur lui-même. Le score indépendant — 21 sur l’Intelligence Index — dépasse la médiane de 18 de sa classe de comparaison à poids ouverts, mais se situe vingt-trois points en dessous de Step 5 Preview, et les points forts d’A.X-K2 se situent là où cet indice particulier ne pèse pas lourd : ses neuf évaluations sont en grande partie en anglais, centrées sur le raisonnement et les agents, et aucune d’entre elles n’est un benchmark de langue coréenne.

Rien de tout cela ne fait d'A.X-K2 un modèle inférieur à son score. Cela fait de son score une borne inférieure de ce qu'il accomplit pour une charge de travail en coréen ou à forte composante mathématique, selon le fournisseur, jusqu'à ce qu'un laboratoire indépendant publie ces évaluations. Le volet coût est plus concret : un déploiement de référence de cette classe de poids nécessite quatre GPU de classe B300 et environ 656 GiB en FP8. C'est le prix du téléchargement et, contrairement à une facture de tokens, il ne redescend pas lorsque l'expérience se termine.

Aperçu de l'étape 5 : celui que vous pouvez essayer dès aujourd'hui via HTTP

L'avantage de Step 5 Preview n'est pas qu'il soit plus grand ou plus ouvert — il n'est ni l'un ni l'autre — mais qu'il soit facturé, appelable et noté de manière indépendante, et qu'il ait pu être essayé gratuitement sur trois surfaces partenaires au cours du mois d'octobre. Pour une équipe qui évalue plutôt qu'elle n'héberge elle-même, cette combinaison vaut plus qu'une licence Apache 2.0, car elle transforme une décision matérielle en un appel d'API. Le journal de StepFun sur le modèle est toutefois mince aux endroits habituels : la paire de paramètres 600B/27B et le contexte d'1M de tokens sont les chiffres du fournisseur lui-même, les poids promis n'ont pas été livrés, et le chiffre le plus utile du tableau indépendant à son sujet n'est sans doute pas le score de 44 mais la verbosité — environ 160 millions de tokens de sortie générés sur l'ensemble des tâches de l'indice, contre une médiane proche de 82 millions, et A.X-K2 est encore plus loin à environ 230 millions contre une médiane de 140 millions. Sur un modèle facturé 2,70 $ par million de tokens de sortie, cet écart fait la différence entre une évaluation bon marché et une habitude de production coûteuse.

Pourquoi le modèle plus grand obtient un score inférieur

Les nombres de paramètres ne sont pas des points, et cette comparaison le démontre clairement. Les quelque 300 milliards de paramètres totaux supplémentaires d'A.X-K2 achètent une densité qui se manifeste là où sa propre suite d'évaluation le récompense — profondeur en langue coréenne, mathématiques, connaissances générales — tandis que l'indice sur lequel les deux modèles apparaissent est essentiellement en anglais, axé sur le raisonnement et les agents, un terrain que les concepteurs de Step 5 Preview semblent avoir calibré délibérément. La conception à 27B de paramètres actifs rend aussi le modèle de StepFun nettement moins coûteux à servir à n'importe quel débit donné, ce qui explique l'existence même d'un tarif hébergé.

Il existe une seconde interprétation, moins flatteuse, qui joue en sens inverse. A.X-K2 est disponible depuis le 12 août et Step 5 Preview depuis le 20 septembre ; le modèle plus récent compte moins de semaines d’examen indépendant, et son score de 44 pourrait encore évoluer à mesure que d’autres évaluations paraissent. Les deux chiffres sont provisoires, comme le sont les scores du premier trimestre de n’importe quel modèle. La différence est que le score provisoire d’A.X-K2 constitue la meilleure preuve dont dispose quiconque à l’extérieur de SK Telecom, tandis que le score provisoire de Step 5 Preview repose sur une fiche de spécifications d’un fournisseur qu’un tiers a au moins partiellement reproduite.

L'économie du serving, là où la décision se joue réellement

Si vous pouvez l’invoquer, vous payez 1,00 $ en entrée et 2,70 $ en sortie par million de tokens, et c’est terminé — pas d’approvisionnement, pas de GPU, pas d’ops. Si vous le téléchargez, vous payez le matériel, l’énergie, le travail de quantification et le harnais d’évaluation, et vous gardez vos prompts et vos données à l’intérieur de votre propre périmètre. A.X-K2 à 33B actifs n’est pas un modèle pour ordinateur portable ; la configuration de référence est un petit cluster. L’aperçu fermé de Step 5 Preview n’offre aucun périmètre du tout avant le 15 octobre, date à laquelle les poids BF16 sont promis — et tant que ces fichiers n’apparaissent pas dans le dépôt, cette date est un engagement plutôt qu’une option.

Generated two-column scoreboard card titled 'Step 5 Preview vs A.X-K2 - the scoreboard'. The left column gives Step 5 Preview an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image input, $1.00 / $2.70 per 1M tokens, vendor API access as a closed preview, and a September 20 2026 release date. The right column gives A.X-K2 an independent index of 21 with a class median of 18, about 688-692B total and 33B active parameters, a 262K-token context, text-only input, no published price, Apache-2.0 download access, and an August 12 2026 release date. A footer reads 'Index figures per Artificial Analysis; vendor specifications per each lab, unreproduced.'

C'est le moment où une couche de routage mérite sa place plutôt que de se contenter de faire sa publicité. La plupart des équipes ne veulent pas répondre « louer ou posséder » une fois pour toutes ; elles veulent savoir ce qu'un modèle donne sur leur trafic avant d'acheter du matériel pour lui, puis conserver la possibilité de changer si la réponse évolue. OrcaRouter ne route pas Step 5 Preview, et il ne route pas A.X-K2 — ces deux-là sont aujourd'hui hors de notre catalogue. Ce qu'il fait, c'est mettre plus de 200 modèles derrière une seule clé API et une seule facture, à 0 % de marge, avec le prix catalogue du fournisseur répercuté tel quel, de sorte que l'ensemble de comparaison sur lequel vous testez l'un ou l'autre des nouveaux fleurons est celui que vous pouvez appeler dès cet après-midi, et le basculement automatique maintient un chemin de production en vie pendant que vous êtes encore en train de décider.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.Screenshot of the Artificial Analysis model page for A.X-K2, headed 'A.X-K2 Intelligence, Performance & Price Analysis', showing SK Telecom as the creator, an open-weights release date of August 2026, the line 'A.X-K2 scores 21 on the Artificial Analysis Intelligence Index, placing it above average among comparable models (median: 18)', a 262k-token context window, and the note that it generated 230M output tokens against a median of 140M.

Lequel choisir

Choisissez Step 5 Preview si votre charge de travail relève du raisonnement général, du codage agentique ou de tout ce qui exige un long contexte, si vous préférez payer au token plutôt que d’acheter du silicium, et si l’entrée d’images compte — il l’emporte sur le score indépendant, sur la longueur de contexte, sur la latence jusqu’à une première réponse et sur la variété des modalités, et c’est le seul des deux que vous pouvez mettre derrière un pilote sans processus d’achat ce mois-ci.

Choisissez A.X-K2 si votre langue est le coréen, si votre charge de travail est à forte densité mathématique, ou si les données ne peuvent tout simplement pas quitter votre infrastructure — et sachez, en le choisissant, que vous acceptez sur parole le tableau de benchmarks de SK Telecom, que la facture matérielle est bien réelle, et que le score indépendant que vous pouvez citer est inférieur de vingt-trois points. Si cet arbitrage vous semble mauvais, la réponse honnête n'est pas de choisir l'autre produit phare ; c'est de faire passer les deux au banc d'essai sur votre propre trafic, la seule comparaison que les chiffres d'aucun des deux fournisseurs ne sauraient remplacer.

Aucun des deux modèles n’est le choix par défaut sûr. Step 5 Preview est l’option économique, mesurée et invocable, dont les poids sont encore en route ; A.X-K2 est l’option plus lourde, souveraine et téléchargeable, dont les preuves restent à fournir. Choisissez la contrainte qui limite réellement votre équipe — le périmètre ou la facture — et laissez l’autre de côté.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement