Une carte de titre principale pour « Fugu Max vs DeepSeek V4 Pro » avec le sous-titre « Le plus optimisé en coût est le plus cher », trois badges en forme de pilule indiquant « $6.00 vs $2.18 en sortie », « 1,6T MoE, 49B actifs », « plafond de sortie de 384K », une ligne de pied de page indiquant « Sakana AI vs DeepSeek - septembre 2026 », et le logo OrcaRouter dans le coin inférieur droit.
Engineering & Research

Fugu Max vs DeepSeek V4 Pro : celui optimisé pour le coût est celui qui est cher.

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Fugu Max est conçu pour être l'option bon marché, et DeepSeek V4 Pro le bat de toute façon sur le prix. Sakana AI a publié Fugu Max le 11 septembre 2026 à 2,00 $ par million de tokens d'entrée et 6,00 $ par million de tokens de sortie, le positionnant comme un coordinateur qui élargit la frontière coût-performance en routant chaque tâche vers le modèle le plus frugal de son pool. DeepSeek V4 Pro, référencé depuis avril 2026, se situe à 0,73 $ en entrée et 2,18 $ en sortie par million sur le tarif à l'usage d'OrcaRouter — environ un tiers de ce que facture Fugu Max sur les deux axes, à partir d'un seul modèle à mélange d'experts à poids ouverts avec un plafond de sortie de 384 K et aucune couche d'orchestration du tout. Cette inversion, c'est toute la comparaison. Tout le reste concernant ce duo est une question de ce que l'orchestration vous apporte lorsque la référence que vous cherchez à sous-coter est déjà moins chère que vous.

Deux façons de réduire une facture, et l’une d’elles est déjà plus basse.

L'argument de Sakana en faveur de Fugu Max est qu'un coordinateur peut réduire les dépenses en ne payant pas les tarifs des modèles frontière pour des tâches qui n'ont pas besoin de capacités frontière. C'est un argument solide. Le problème, c'est le modèle contre lequel il est formulé. DeepSeek V4 Pro est un mélange d'experts à 1 600 milliards de paramètres, dont 49 milliards de paramètres actifs par token, ce qui est la même idée de réduction des coûts exécutée un cran en dessous — vous payez pour les paramètres qu'un token active réellement, pas pour la taille du réseau. Les deux produits répondent à « comment arrêter de payer pour de la capacité que nous n'utilisons pas ». L'un d'eux facture 2,18 $ par million de tokens de sortie pour ce privilège.

• Prix des entrées — Fugu Max 2,00 $ par million de jetons contre DeepSeek V4 Pro 0,73 $ par million de jetons facturés à l'usage

• Prix de sortie — Fugu Max 6,00 $ par million de tokens contre DeepSeek V4 Pro 2,18 $ par million de tokens facturés à l’usage

• Entrée mise en cache — Fugu Max à 0,25 $ par million de tokens, contre l'entrée en cache-hit de DeepSeek V4 Pro facturée bien en dessous de son tarif de base, le tarif catalogue publié par le fournisseur restant sous 1,00 $ par million

• Contexte — Fugu Max non publié vs DeepSeek V4 Pro 1M tokens

• Plafond de sortie — Fugu Max non publié vs DeepSeek V4 Pro 384K jetons

• Modalité — Fugu Max non publié vs DeepSeek V4 Pro texte uniquement, avec utilisation d’outils, mode JSON et raisonnement

• Architecture — Fugu Max, un coordinateur entraîné sur un pool non divulgué, contre DeepSeek V4 Pro, un modèle MoE unique, lignée à poids ouverts

• Chiffres de benchmark — Fugu Max : six victoires affirmées sans aucun score, contre DeepSeek V4 Pro annoncé par son fournisseur à 87,9 sur Terminal Bench 2.1, 92,8 sur GPQA Diamond, 96,4 sur SWE-bench Vals

Un chiffre dans cette liste mérite d’être isolé. Deep​Seek annonce 87,9 sur Terminal Bench 2.1. Fugu Max revendique le « meilleur score global » sur Terminal Bench 2.1. Même benchmark, même fenêtre de publication, un côté publie un chiffre et l’autre publie le mot « meilleur ». C’est l’illustration la plus nette de l’asymétrie des preuves dans ce duo, et ce n’est pas un détail — c’est toute la raison pour laquelle l’écart de prix ne met pas fin au débat.

A two-column scoreboard titled "Fugu Max vs DeepSeek V4 Pro - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Cached input $0.25 / 1M, Context not published, Terminal Bench 2.1 best overall with no figure, Weights closed and pool undisclosed. Right column DeepSeek V4 Pro: Output price $2.18 / 1M, Input price $0.73 / 1M, Cached input below base rate, Context 1M tokens, Terminal Bench 2.1 87.9, Weights open-weights lineage. Footer reading "Fugu Max rows vendor-reported by Sakana AI with no scores published; DeepSeek rows vendor-reported, metered rate on OrcaRouter.", with the OrcaRouter logo bottom-right.

Ce que l’orchestration apporte lorsque la base est déjà peu coûteuse

L'argument en faveur d'un paiement plus élevé pour Fugu Max doit reposer sur des tâches qu'un modèle unique gère mal, et il existe une véritable catégorie de ces tâches. Les tâches à long horizon où une erreur de parcours se cumule — refactorisations multi-fichiers, modifications à l'échelle d'un dépôt, tout ce où un vérificateur qui contrôle la sortie du worker vaut plus qu'un worker plus puissant — sont exactement ce à quoi est destiné un dispositif Thinker/Worker/Verifier. La présentation que fait Sakana de sa gamme Fugu est la suivante : repérer une erreur lors d'une seconde passe coûte moins cher que de réussir du premier coup. Sur ces tâches, un tarif de sortie de 6,00 $ qui aboutit en une seule tentative peut surpasser un tarif de 2,18 $ qui en nécessite trois.

Cet argument a une forme testable et Sakana ne l’a pas exécuté en public. La comparaison que vous voudriez, c’est le coût par tâche terminée sur un benchmark auquel les deux systèmes s’attaquent — Terminal Bench 2.1 est juste là, il est agentique et repose par construction sur le terminal, et un seul des deux fournisseurs a publié un chiffre à son sujet. Tant que cet écart ne sera pas comblé, la position honnête est que l’avantage de coût de Fugu Max est affirmé au niveau des tokens et non prouvé au niveau des tâches, tandis que celui de DeepSeek V4 Pro est simple : les tokens eux-mêmes ne coûtent qu’un tiers du prix.

Il y a un point de second ordre concernant la composition du pool qui compte plus pour cette confrontation que pour la plupart. Le pool de Fugu Max s'est élargi dans cette version pour inclure des modèles à poids ouverts et spécialisés, la famille NVIDIA Nemotron étant nommée dans le cadre d'une collaboration avec NVIDIA. La présence de poids ouverts dans le pool signifie que l'échelon le moins cher de l'échelle de Sakana n'est pas exposé aux décisions tarifaires d'un autre laboratoire. DeepSeek V4 Pro, étant lui-même à poids ouverts, n'est exposé à aucune décision tarifaire hormis celles de DeepSeek — et c'est lui l'échelon. L'argument de résilience que Sakana avance pour l'orchestration s'applique directement à DeepSeek et seulement indirectement à l'approvisionnement sous-jacent de Fugu Max.

La mise en cache est ce qui rend réellement coûteuses les charges de travail des agents

Ni le tarif de base de l'un ni de l'autre fournisseur ne correspond au tarif que paie une boucle d'agent. Les longues exécutions d'agent réémettent un préfixe volumineux, en grande partie inchangé, à chaque tour, et c'est le taux de réussite du cache qui détermine la facture réelle. Fugu Max annonce l'entrée mise en cache à 0,25 $ par million, un chiffre véritable et agressif — un huitième de son propre tarif d'entrée de base. DeepSeek V4 Pro facture l'entrée bénéficiant d'un hit de cache bien en dessous de son tarif de base publié, et son tarif de sortie est fixé à environ trois fois son entrée, plutôt qu'au rapport de quatre à cinq fois qu'utilisent la plupart des fournisseurs, ce qui compresse spécifiquement le coût des boucles à forte génération.

Ce que vous ne pouvez pas faire aujourd'hui, c'est calculer la comparaison de manière fiable à partir de la grille tarifaire de l'un ou l'autre fournisseur, car le tarif mis en cache de Fugu Max s'applique à un nombre de tokens que vous ne pouvez pas prévoir. Un orchestrateur décide combien d'agents s'exécutent ; le contexte de chaque agent contribue ; le coordinateur ajoute le sien. L'engagement tarifaire de Sakana pour la gamme Fugu — un tarif mixte unique basé sur le modèle participant le plus haut de gamme, sans que les agents ne s'empilent dans la facture — élimine le pire scénario, ce qui constitue une véritable concession, à mettre à son crédit. Cela ne rend pas le volume connaissable à l'avance. La facture de DeepSeek V4 Pro est fonction des tokens que vous envoyez et des tokens que vous recevez, et de rien d'autre.

Cette prévisibilité est autant une propriété de routage qu’une propriété du modèle. DeepSeek V4 Pro est disponible sur OrcaRouter au prix catalogue du fournisseur, avec 0 % de majoration, de sorte qu’une révision tarifaire de DeepSeek atteint votre clé existante le jour même plutôt qu’à votre prochain renouvellement de contrat, et le basculement automatique vous couvre lorsqu’un chemin de fournisseur est limité en débit. Ce dernier point a un poids inhabituel pour ce modèle en particulier : DeepSeek a déjà révisé sa tarification une fois au cours de ce cycle, avec des paliers en heures pleines et heures creuses dont les chiffres finaux varient selon les sources. Lorsque la grille tarifaire d’un fournisseur évolue, le routeur fait la différence entre absorber le changement et le découvrir sur une facture.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Ce que nous n’avons pas pu vérifier

Trois éléments de la version Fugu Max n'ont pu être vérifiés par rapport à quoi que ce soit en dehors des propres documents de Sakana, et ils sont listés ici plutôt que passés sous silence. Premièrement, les six victoires de benchmark ne comportent aucun chiffre — Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench et SWEFish sont cités comme des victoires sans scores associés, et SWEFish est un benchmark interne de Sakana. Deuxièmement, la fenêtre de contexte, le plafond de sortie et les modalités prises en charge de Fugu Max ne sont pas publiés, de sorte que les lignes relatives aux modalités et au plafond ci-dessus comparent une spécification livrée à un silence. Troisièmement, il n'existe aucune évaluation indépendante de quelque modèle Fugu que ce soit, et il n'y a pas de fiche Artificial Analysis pour Fugu Max.

Pour DeepSeek V4 Pro, la situation est l’inverse. Le fournisseur rapporte une longue liste de chiffres — Terminal Bench 2.1 87,9, GPQA Diamond 92,8, SWE-bench Vals 96,4, HLE 42,7 et 60,0 dans deux configurations, MCP Atlas 73,6, Toolathlon-Verified 74,1, CyberGym 83,3 — et tous sont eux aussi rapportés par le fournisseur. La différence n’est pas qu’un fournisseur soit plus digne de confiance. Elle réside dans le fait que, lorsque les deux parties publient des chiffres, un désaccord est possible, et un désaccord peut être examiné. Une affirmation sans chiffre ne peut pas être vérifiée ; on peut seulement l’accepter ou l’ignorer.

Une mise en garde supplémentaire concernant la tarification Deep​Seek ci-dessus : notre propre page de modèle comporte deux chiffres, un tarif à l’usage de 0,73 $ en entrée et 2,18 $ en sortie par million dans les tuiles tarifaires, et une description plus ancienne de 0,44 $ en entrée et 0,87 $ en sortie par million. Deep​Seek a également annoncé des paliers en heures pleines et heures creuses, dont les tarifs finaux diffèrent selon les sources. Considérez 0,73 $ et 2,18 $ comme les tarifs qui vous seront réellement facturés par notre intermédiaire aujourd’hui, et vérifiez-les par rapport à la grille tarifaire publiée avant de bâtir un budget sur cette base.

En résumé

DeepSeek V4 Pro l'emporte dans cette comparaison selon les critères que Fugu Max a choisis. Il est moins cher en entrée et en sortie, il dispose d'une fenêtre de contexte publiée et d'un plafond de sortie de 384K, il rapporte un chiffre réel sur le benchmark où Fugu Max prétend être en tête, et sa lignée est open-weights, ce qui constitue la forme la plus forte disponible de l'argument d'indépendance vis-à-vis du fournisseur que Sakana vend. Si votre charge de travail est intensive en tokens et que votre priorité est le coût par token le plus bas et défendable pour un modèle que vous pouvez épingler, il n'y a pas photo.

Fugu Max répond à une question plus étroite que DeepSeek V4 Pro ne traite pas du tout : un coordinateur qui assemble sa propre équipe d'agents peut-il achever un travail difficile et de long terme en moins de tentatives qu'un seul modèle. Cela vaut la peine d'être testé en pilote si vous disposez de tâches vérifiables et tolérantes à l'échec et que vous êtes en dehors de l'UE/EEE. Évaluez son coût en jetons par tâche terminée, fixez d'abord un plafond, puis comparez-le au point de terminaison DeepSeek V4 Pro sur OrcaRouter au prix catalogue du fournisseur — une seule clé, 0 % de marge, et un tarif qui s'aligne sur celui du fournisseur.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, captured September 11, 2026, English UI), showing the FLAGSHIP and Featured badges, the deepseek/deepseek-v4-pro model ID, the Tools, JSON and Reasoning tags, the listing date 2026-04-24, the /v1/chat/completions and /v1/responses endpoints, the pricing tiles reading INPUT $0.73 and OUTPUT $2.18 per 1M tokens with p50 TTFT 919ms and 6,313.7M tokens of 7-day traffic, the 1M token context with 384K max output and text-only input, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement