Une carte de titre principale pour « Fugu Max vs GLM-5.3 » avec le sous-titre « Le modèle de valeur est sapé par le modèle de volume », trois badges en forme de pilule indiquant « 6,00 $ vs 3,96 $ en sortie », « 7 962,7 M de tokens par 7 j », « 2,00 $ vs 1,26 $ en entrée », une ligne de pied de page indiquant « Sakana AI vs Z.ai - septembre 2026 », et le logo OrcaRouter dans le coin inférieur droit.
Engineering & Research

Fugu Max vs GLM-5.3 : le modèle de valeur est sapé par le modèle de volume

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Fugu Max a été positionné au prix pour l'emporter sur le coût, et GLM-5.3 est moins cher sur les deux axes. Le coordinateur de Sakana AI a été lancé le 11 septembre 2026 à 2,00 $ par million de tokens d'entrée et 6,00 $ par million de tokens de sortie, conçu pour router chaque tâche vers le modèle le moins coûteux capable de la traiter. GLM-5.3 de Z.ai, répertorié depuis le 18 août 2026, se situe à 1,26 $ en entrée et 3,96 $ en sortie par million sur OrcaRouter — entre un tiers et deux cinquièmes en dessous de Fugu Max sur les deux, à partir d'un seul modèle textuel avec une fenêtre de contexte publiée de 1 M et un plafond de sortie de 128 K. GLM-5.3 se trouve aussi être le modèle le plus sollicité de notre catalogue, et de loin. Cette combinaison — moins cher par token, et qui transporte manifestement du trafic de production à grande échelle — fait de cette confrontation celle où la prime d'orchestration est la plus difficile à justifier.

Moins cher sur les deux axes, avec la spécification publiée

La comparaison est inconfortable pour Fugu Max avant même qu’un benchmark n’entre en jeu, car il ne s’agit pas d’échanger de la capacité contre du prix. GLM-5.3 est un modèle phare proche de la frontière à part entière — Z.ai le décrit comme apportant environ 50 % d’amélioration en codage par rapport à GLM-5.2 et égalant Mythos 5 sur une sélection de capacités de cybersécurité. Ce n’est pas un modèle économique proposé comme alternative bon marché. C’est un modèle phare qui se trouve être proposé à un prix inférieur à celui d’un orchestrateur optimisé pour les coûts.

• Prix d'entrée — Fugu Max 2,00 $ par million de tokens vs GLM-5.3 1,26 $ par million de tokens

• Prix de sortie — Fugu Max 6,00 $ par million de tokens contre GLM-5.3 3,96 $ par million de tokens

• Entrée mise en cache — Fugu Max 0,25 $ par million de tokens, contre une mise en cache GLM-5.3 facturée comme une remise sur le tarif d’entrée de base

• Contexte — Fugu Max non publié vs GLM-5.3 1M tokens

• Plafond de sortie — Fugu Max non publié vs GLM-5.3 128K tokens

• Modalité — Fugu Max non publié vs GLM-5.3 texte uniquement, documenté comme tel

• Étiquettes de capacités — Fugu Max : aucune publiée vs GLM-5.3 : utilisation d’outils, mode JSON, raisonnement

• Chiffres de benchmark — six victoires affirmées pour Fugu Max, sans scores, face aux 46,2 à 66,9 rapportés par le fournisseur pour GLM-5.3 au test DeepSWE par rapport à la génération précédente, plus un score d'intelligence Artificial Analysis publié

• Poids — Fugu Max fermé, pool non divulgué vs GLM-5.3 d’un laboratoire avec une lignée à poids ouverts

• Trafic observé sur OrcaRouter — Fugu Max : aucun, non acheminé vs GLM-5.3 : 7 962,7 M de jetons au cours des sept derniers jours

Notez ce que font ensemble les deux dernières lignes. GLM-5.3 est issu d'une lignée à poids ouverts, ce qui constitue la forme la plus solide disponible de l'argument d'indépendance vis-à-vis des fournisseurs que Sakana met en avant comme la prémisse même de Fugu Max. Et il affiche un chiffre de trafic observable d'un ordre de grandeur supérieur à celui de la plupart des modèles que nous servons. Si la question est « que dois-je exécuter pour du travail de production à forte composante textuelle à un tarif bas », les éléments de preuve pointent vers autre chose que l'orchestrateur.

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

L’argument du volume, et pourquoi ce n’est pas simplement un concours de popularité

Un chiffre de trafic n’est pas un chiffre de qualité, et il ne devrait pas être interprété comme tel. Ce que 7,96 milliards de tokens en sept jours démontre, c’est que GLM-5.3 a été exploité à l’échelle de production par de nombreuses équipes indépendantes, sur des charges de travail réelles, sans provoquer de désaffection massive. C’est un signal faible sur la qualité et un signal fort sur l’aptitude opérationnelle : la latence est stable, le débit se maintient, l’API se comporte correctement sous charge, et les modes de défaillance sont connus d’une population suffisamment large pour qu’ils fassent surface publiquement. Un modèle publié la même semaine que Fugu Max n’a rien de tout cela derrière lui.

La ligne sur la latence souligne le point. GLM-5.3 affiche un temps jusqu'au premier token (p50) de 4,33 secondes sur le trafic que nous servons. Pour le travail agentique — la charge de travail que ces deux produits ciblent — le temps jusqu'au premier token se cumule à chaque tour de chaque sous-agent lancé par le coordinateur. Un orchestrateur moins cher qui lance quatre agents n'est pas moins cher si chacun attend plusieurs secondes avant d'émettre quoi que ce soit, et ce coût n'apparaît jamais sur une grille tarifaire.

Le contre-argument de Fugu Max est que son coordinateur achemine chaque requête vers le modèle capable le plus frugal, ce qui signifie en principe que de nombreuses tâches ne touchent jamais un backend coûteux. L’élargissement du pool de Sakana dans cette version a ajouté des modèles à poids ouverts et spécialisés, dont la famille NVIDIA Nemotron, grâce à une collaboration avec NVIDIA, donc les échelons bon marché de cette échelle sont bien réels. La question est de savoir si ces échelons sont moins chers que 3,96 $ par million de tokens de sortie. Pour la plupart des tâches textuelles, ils ne le sont pas — c’est un seuil bas, et les modèles à poids ouverts exécutés à des tarifs d’hébergement ne le dépassent généralement que d’une faible marge.

Des questions à se poser avant de choisir

Un orchestrateur est-il moins cher qu'un seul modèle à poids ouverts ? Pas par défaut, et l'intuition va dans le mauvais sens. L'orchestration ajoute les jetons de synthèse d'un coordinateur et, lors d'exécutions multi-agents, la sortie de chaque agent de l'équipe. La tarification de Fugu de Sakana élimine le pire des cas en facturant un tarif unique mixte basé sur le modèle participant le plus haut de gamme plutôt qu'en empilant les agents, ce qui constitue une concession réelle. Mais le tarif de base que vous mixez est de 6,00 $ en sortie, et le modèle unique que vous appelleriez autrement est à 3,96 $. L'orchestration fait économiser de l'argent lorsqu'elle évite des nouvelles tentatives, pas lorsqu'elle ajoute du parallélisme pour le seul plaisir d'en ajouter.

Une limitation au texte a-t-elle de l'importance pour l'un ou l'autre ? Pour GLM-5.3, elle est documentée, c'est donc une contrainte que vous pouvez anticiper — pas de vision, pas d'audio, pas de vidéo, et le catalogue l'indique. Pour Fugu Max, la modalité n'est tout simplement pas publiée. C'est pire qu'une limitation, car vous ne pouvez pas savoir si un pipeline qui envoie un PDF fonctionnera avant de l'essayer. Une contrainte non énoncée n'est pas la même chose qu'une contrainte absente.

Que se passe-t-il pour chacun d'eux lorsque les modèles sous-jacents changent ? GLM-5.3 est un seul modèle, à une seule version, entraîné et servi par Z.ai. Si Z.ai modifie sa tarification, le changement se répercute sur votre clé le jour même via OrcaRouter à 0 % de marge, et vous pouvez le voir et y réagir. Le comportement de Fugu Max dépend d'un pool dont Sakana ne divulgue pas les membres, de sorte que le retrait ou le changement de prix d'un laboratoire de pointe modifie silencieusement ce que vous achetez sans que le nom du produit change. Sakana présente cela comme de la résilience. C'est de la résilience pour le fournisseur et de l'opacité pour l'acheteur.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Où les décisions de routage sont réellement prises

Ces deux éléments sont, en pratique, des décisions de routage — Fugu Max les prend à l’intérieur d’un coordinateur opaque, et vous les prenez au niveau de l’API. OrcaRouter relève de la seconde catégorie : une API unique pour plus de 200 modèles avec un DSL de routage qui vous permet d’exprimer la politique explicitement, un basculement automatique en cas de dégradation d’un chemin de fournisseur, et une fusion de modèles lorsque vous voulez combiner délibérément les sorties plutôt que de confier cela à une boîte noire. GLM-5.3 figure dans ce catalogue au prix catalogue de Z.ai, avec 0 % de marge, ce qui vaut plus que d’habitude pour un modèle derrière lequel il y a autant de trafic : le tarif que vous voyez est celui que Z.ai publie, transmis sans modification.

La différence pratique, c’est l’auditabilité. Quand Fugu Max choisit un modèle pour votre requête, vous n’apprenez rien sur le modèle retenu ni sur la raison de ce choix. Quand vous écrivez vous-même la politique de routage, la décision se trouve dans votre dépôt, elle peut être examinée par quiconque relit votre code, et modifiée sans attendre un fournisseur. Pour les équipes soumises à un quelconque type d’obligation de conformité ou de comptabilité analytique, ce n’est pas une différence philosophique.

Le verdict

GLM-5.3 remporte cette comparaison sur les critères qui comptent le plus pour une équipe de production : il est moins cher en entrée et en sortie, sa fenêtre de contexte et son plafond de sortie sont publiés, ses limites de modalité sont énoncées, il intègre l’utilisation d’outils, le mode JSON et le raisonnement comme capacités documentées, il est issu d’une lignée de poids ouverts, et il affiche un chiffre de trafic sur sept jours approchant les huit milliards de jetons. Aucune interprétation des preuves publiques ne permet de considérer que Fugu Max est l’achat le mieux étayé à ce niveau de prix.

Fugu Max ne défend qu’un seul argument, et il est réel : pour les tâches où la deuxième passe d’un coordinateur détecte une erreur que la première passe aurait livrée, le coût par tâche terminée peut être plus avantageux que le coût par jeton. Cela mérite un pilote à périmètre défini si votre travail est vérifiable, à fort volume, et que vous êtes hors UE/EEE — avec un plafond de jetons de sortie fixé à l’avance et une mesure des jetons par tâche terminée. Sinon, le modèle unique qui coûte un tiers de moins et qui tourne sous charge de production depuis un mois est la réponse, et il est disponible sur OrcaRouter au prix catalogue de Z.ai, avec le tarif du fournisseur répercuté.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement