Carte Hero pour l'affrontement Fugu Ultra v2 contre GLM 5.2, montrant un système d'orchestration opposé à un modèle Mixture-of-Experts unique, sous l'accroche « Vous payez pour la coordination, pas pour les paramètres ».
Guides & Insights

Fugu Ultra v2 vs GLM 5.2 : Vous payez pour la coordination, pas les paramètres

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Mettez les deux grilles tarifaires côte à côte et la comparaison ressemble à une erreur. Fugu Ultra v2, que Sakana AI a annoncé le 11 septembre 2026, facture 5 $ par million de tokens d'entrée et 30 $ par million de tokens de sortie. GLM 5.2, le modèle phare de Z.ai depuis le 16 juin 2026, facture 1,40 $ et 4,40 $. Les deux revendiquent une fenêtre de contexte de l'ordre du million de tokens. Tous deux ciblent exactement le même acheteur — l'équipe qui mène un travail agentique long, multi-étapes et à l'échelle d'un dépôt. L'un coûte environ 3,6 × le prix d'entrée et 6,8 × le prix de sortie de l'autre, et le moins cher est celui que l'on peut télécharger et garder. Toute la comparaison se réduit donc à une seule question : qu'achète réellement le surcoût, et achète-t-il quelque chose qu'un modèle unique ne peut pas être ?

Ils ne sont pas le même type d'objet

La raison pour laquelle cet écart de prix existe est que ces deux choses résolvent des tâches à long horizon avec des mécanismes complètement différents, et la différence se manifeste avant même que vous n’exécutiez un benchmark.

Fugu Ultra v2 — un système d'orchestration, pas un modèle de fondation. C'est le niveau maximisant les capacités de la gamme Fugu de Sakana AI : un point de terminaison unique compatible OpenAI qui décompose une tâche entrante et répartit les éléments sur un ensemble d'autres modèles, certains à poids ouverts et d'autres spécialisés. La formulation de Sakana elle-même est qu'il « pousse les performances de pointe plus haut que jamais, sans la dépendance indispensable aux modèles de frontière qu'il orchestre ». Vous achetez un ordonnanceur, et vous payez pour chaque token que cet ordonnanceur dépense à réfléchir, y compris les tokens d'orchestration internes.

GLM 5.2 — un modèle Mixture-of-Experts unique. Z.ai le publie comme un modèle text-in / text-out avec une fenêtre de contexte de 1 M de tokens « vraiment utilisable » et jusqu'à 128 K tokens en sortie, un raisonnement hybride contrôlé par reasoning_effort, et un appel d'outils natif. L'architecture rapportée compte environ 753 Md de paramètres au total, dont environ 40 Md actifs par token, bien que Z.ai n'ait pas confirmé le nombre de paramètres actifs pour 5.2 en particulier — considérez ce chiffre comme hérité de GLM-5.1.

C'est là que les chemins se séparent. L'une de ces choses est une chose que vous appelez ; l'autre est une chose qui appelle des choses.

Ce que Fugu Ultra v2 ne nous dirait pas

La page d'annonce de Sakana fait preuve d'une franchise inhabituelle sur un point et d'une discrétion inhabituelle sur un autre, et les deux comptent pour une décision d'achat.

La partie franche : l'entreprise affirme sans détour que Claude Fable 5, Claude Fable 5.1 et GPT-6 Astra ne font pas partie du pool de modèles de Fugu Ultra v2, tout en affirmant les surpasser sur les benchmarks. La justification avancée est la résilience — un pool interchangeable de modèles ouverts et spécialisés qui ne peut être révoqué, dont le prix ne peut être modifié, ni coupé par un fournisseur ou un bouleversement géopolitique. La date de coupure de l'entraînement est indiquée comme étant le 20260828. Quoi que vous pensiez de l'argument, il s'agit d'un véritable parti pris architectural, et c'est la raison la plus claire de choisir Fugu Ultra v2 plutôt qu'une stack que vous avez assemblée vous-même.

Ce qu’on ne dit pas : l’annonce ne précise pas de fenêtre de contexte et elle n’indique pas non plus la tarification des tokens de Fugu Ultra v2 sur la page elle-même. Les fiches de modèles tierces situent la fenêtre à 1 M de tokens et les tarifs à 5 $ / 0,50 $ en cache / 30 $, avec un palier de changement de tarif au-dessus d’environ 272 K tokens d’entrée qui passe à environ 10 $ / 1,00 $ / 45 $. Ce sont les chiffres utilisés dans le reste de cet article, mais ce sont des fiches, pas de la documentation du fournisseur — vérifiez-les par rapport à la grille tarifaire en vigueur de Sakana avant de fonder votre budget sur ces chiffres.

La question du coût par token à laquelle personne ne répond

La tarification par token est la mauvaise unité pour cette comparaison, et chaque page actuellement bien classée à ce sujet commet la même erreur. La facture d'un orchestrateur n'est pas la taille de votre prompt multipliée par un tarif ; c'est la taille de votre prompt, plus chaque sous-appel qu'il décide d'effectuer, plus les tokens de raisonnement des modèles qu'il loue, le tout majoré au tarif propre de l'orchestrateur.

Sakana le reconnaît directement : les tokens d'orchestration consommés en interne sont facturés comme des tokens d'entrée et de sortie ordinaires. Ce qui signifie que la façon honnête de comparer Fugu Ultra v2 avec GLM 5.2 est le coût par tâche accomplie, et aucun des deux fournisseurs ne publie ce chiffre.

Quelques points structurels qui restent valables quoi qu'il arrive :

Prix des entrées — Fugu Ultra v2 5,00 $ / 1 M contre GLM 5.2 1,40 $ / 1 M sur OrcaRouter au tarif fournisseur de Z.ai. Fugu coûte 3,6× plus cher avant même d'effectuer un seul sous-appel.

Prix de sortie — Fugu Ultra v2 30,00 $ / 1M contre GLM 5.2 4,40 $ / 1M. C'est le chiffre qui fait mal, parce que les agents émettent beaucoup de sorties, et un orchestrateur émet des sorties que vous n'avez pas demandées.

Entrée en cache — Fugu Ultra v2 affiche 0,50 $ / 1 M ; GLM 5.2 met en cache à 0,26 $ / 1 M, soit une réduction de 81 % par rapport à son propre tarif d'entrée. C'est dans les boucles d'agents répétées sur un prompt système stable que l'avantage de GLM 5.2 se cumule le plus fortement.

Nouvelle tarification du contexte long — Le palier indiqué de Fugu Ultra v2 au-delà d'environ 272K d'entrée fait passer toute la requête à environ le double du tarif d'entrée et à 1,5× le tarif de sortie. GLM 5.2 n'a aucune tarification par paliers de contexte : 1,40 $ / 4,40 $ au forfait, et ce jusqu'à 1M.

C’est cette dernière ligne qu’il faut entourer. Une exécution d’agent à long horizon passe la majeure partie de son existence au-delà de 272K tokens. Le tarif fixe de GLM 5.2 représente de vraies économies exactement là où celui de Fugu Ultra v2 double.

Two-column comparison scoreboard for Fugu Ultra v2 and GLM 5.2 covering type, release date, input price ($5.00 vs $1.40 per million tokens), output price ($30.00 vs $4.40), cached input ($0.50 vs $0.26) and long-context pricing (reprices above roughly 272K vs flat to 1M).

Les benchmarks ne touchent presque pas

Voici la chose véritablement étrange à propos de cette confrontation, et ce qu’aucune page de classement actuelle ne dit clairement : ces deux modèles ne sont presque jamais mesurés sur le même test.

Sakana rapporte que Fugu Ultra v2 est le meilleur ou ex æquo sur cinq des huit benchmarks — GDP.pdf, Chartography, SWEFish, DeepSWE et Toolathon — et parmi les deux premiers sur sept des huit. Les deux chiffres phares qu’il avance sont Chartography à 48,3, contre Opus 5 à 27,3 et Fable 5 à 29,5, et DeepSWE à 74,3. SWEFish et Toolathon sont des benchmarks internes propres à Sakana. Tout cela est déclaré par le fournisseur et aucun de ces résultats n’a été reproduit de manière indépendante à la date de publication.

Les chiffres de Z.ai pour GLM 5.2 proviennent d'une catégorie totalement différente : Terminal-Bench 2.1 à 81,0, SWE-bench Pro à 62,1, GPQA-Diamond à 91,2, AIME 2026 à 99,2, HLE à 40,5 — également rapportés par le fournisseur. Du côté indépendant, GLM 5.2 affiche un AA Coding Index de 68,8 et un Intelligence Index de 39 sur la page de re-notation d'Artificial Analysis, où il est signalé comme une estimation provisoire, classé n° 7 sur 113. Les citations plus anciennes de 51 ou 53 pour GLM 5.2 proviennent d'une échelle d'indice remplacée et ne doivent pas être reprises.

Donc, si vous voulez un chiffre clair en comparaison directe, il n’y en a pas. Ce qui s’approche le plus d’un axe commun, c’est que les deux sont solides en codage agentique, et la lecture honnête est que chaque entreprise a publié des résultats sur les tests qu’elle réussit bien. C’est une raison de mener votre propre évaluation, pas de choisir le chiffre le plus élevé.

Un point à signaler pour quiconque envisage d'acheter GLM 5.2 aujourd'hui : ce n'est plus le modèle le plus récent de Z.ai. GLM-5.3 est arrivé vers le 14 août 2026 au même prix catalogue, mais sous une licence personnalisée qui restreint les grands fournisseurs de cloud — ce qui fait de GLM 5.2 le dernierentièrement sous licence MITfleuron de Z.ai, et la raison pour laquelle il conserve encore un argument d'achat distinct.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

La licence est le facteur de division le plus marqué.

Mettez les benchmarks de côté, et la différence structurelle est plus flagrante que n’importe quel score.

GLM 5.2 est distribué sous forme de poids ouverts sous licence MIT sur Hugging Face, sans restrictions régionales. Vous pouvez le télécharger, l’exécuter sur votre propre matériel, le fine-tuner et l’intégrer dans un produit sans demander la permission à qui que ce soit ni payer le moindre tarif par token. Z.ai l’a entraîné — fait notable, selon les propres affirmations de l’entreprise, entièrement sur des accélérateurs Huawei Ascend plutôt que Nvidia.

Fugu Ultra v2 ne vous offre rien de tout cela. C’est un service hébergé : une politique d’orchestration sur un ensemble de modèles dont Sakana n’a décrit la composition qu’aux marges. Vous ne pouvez ni le télécharger, ni l’inspecter, ni l’épingler, ni l’exécuter en environnement isolé. Ce que vous obtenez à la place, c’est l’abstraction — un point de terminaison unique dont le comportement est, en principe, résilient à la disparition de n’importe quel modèle en amont. C’est un véritable avantage pour un système de production qui ne peut pas se permettre de voir une dépendance disparaître. C’est aussi un véritable coût, car vous avez échangé le contrôle contre cela.

Si votre contrainte est « le modèle ne doit pas changer sous moi », seule l’une de ces réponses convient. Si votre contrainte est « le modèle ne doit pas pouvoir être retiré par quelqu’un d’autre », seule l’autre convient.

Vitesse, et ce que les testeurs ont dit du dernier

GLM 5.2 n’est pas rapide, et cela se mesure : Artificial Analysis a enregistré environ 66,3 jetons par seconde avec un temps jusqu’au premier jeton d’environ 4,03 secondes, ce qui est modeste pour un modèle de classe frontière, et les propres utilisateurs de Z.ai se sont plaints d’une congestion du service aux heures de pointe.

Sakana ne publie aucun chiffre de latence ou de débit pour Fugu Ultra v2, ce qui est en soi révélateur — un système qui distribue les requêtes à plusieurs modèles a un profil de latence qui dépend entièrement de ce qu’il décide d’appeler, de sorte qu’un chiffre de débit unique serait quasiment dépourvu de sens. Pour le précédent Fugu Ultra, des testeurs ont rapporté publiquement des exécutions s’étirant sur environ 30 minutes et des coûts bien supérieurs au tarif d’un modèle unique sur la même tâche. Il s’agit du modèle de juin 2026 et non d’une preuve concernant la v2 — mais c’est le mode de défaillance à tester, et la raison pour laquelle une comparaison par token flatte les orchestrateurs.

Screenshot of the OrcaRouter model page for GLM 5.2 showing the z-ai/glm-5.2 identifier, a 1M token context window, 128K maximum output, and input pricing of $1.40 per million tokens with output at $4.40.

Comment vous appelleriez réellement chacun de ces éléments

GLM 5.2 est disponible sur OrcaRouter dès aujourd'hui aux tarifs de fournisseur de Z.ai — 1,40 $ par million de tokens en entrée et 4,40 $ par million de tokens en sortie, répercutés sans aucune marge, donc toute baisse de prix décidée par Z.ai arrive ici le jour même. Il est compatible avec OpenAI, donc y passer se résume à changer l'URL de base et l'ID du modèle dans le SDK que vous avez déjà, et vous pouvez le placer derrière une chaîne de basculement ou une règle de routage plutôt que de miser un chemin de production sur un seul fournisseur.

Fugu Ultra v2 n'est pas quelque chose que nous routons. Il est disponible via l'API compatible avec OpenAI de Sakana AI, et un seul changement de paramètre permet de faire basculer une intégration Fugu existante dessus. Si vous l'évaluez face à GLM 5.2, l'arrangement pratique consiste à conserver GLM 5.2 sur votre passerelle existante et à appeler Fugu Ultra v2 directement depuis Sakana pendant que vous décidez — les deux sont compatibles avec OpenAI, donc ils peuvent se trouver dans le même chemin de code derrière un flag.

Lequel choisir

Choisissez GLM 5.2 si vous voulez une valeur sûre à un prix connu : des poids sous licence MIT que vous pourriez auto-héberger dès demain, un tarif fixe de 1,40 $ / 4,40 $ sans pénalité pour les contextes longs, une fenêtre de 1 M réellement exploitable, et une remise qui se cumule sur les boucles d’agents mises en cache. Acceptez qu’il soit uniquement textuel, qu’il ait une génération de retard sur GLM-5.3, et que son score d’indice indépendant soit provisoire.

Choisissez Fugu Ultra v2 si ce que vous achetez, c’est de la résilience alliée à une capacité de pointe sur des tâches complexes à plusieurs étapes, et que vous êtes prêt à payer la coordination au token et à renoncer à la possibilité d’inspecter ou d’auto-héberger ce que vous appelez. L’affirmation du fournisseur lui-même est qu’il atteint une sortie de niveau frontière sans dépendre de modèles de frontière — une proposition réelle et inhabituelle, et que, à ce jour, absolument personne en dehors de Sakana n’a pu vérifier.

Ce que nous ne ferions pas, c'est choisir entre eux à partir du tableau de benchmarks. Les tests ne se recoupent guère, chaque fournisseur a publié sur son propre terrain le plus favorable, et le chiffre décisif — le coût par tâche longue finalisée — est précisément celui qu'aucune des deux entreprises n'a mis sur une page.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement