Carte principale pour la confrontation Fugu Ultra v2 contre GPT-5.6 Sol, montrant deux courbes de tarification qui bondissent toutes deux à 272000 tokens.
Guides & Insights

Fugu Ultra v2 vs GPT-5.6 Sol : La même falaise à 272K

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux fournisseurs qui n'ont rien en commun, et tous deux ont tracé la ligne au même endroit. Fugu Ultra v2, annoncé par Sakana AI le 11 septembre 2026, modifierait la tarification d'une requête dès que son entrée dépasse environ 272 000 tokens — passant à environ 10 $ par million de tokens en entrée et 45 $ par million en sortie, appliqué à l'ensemble de la requête plutôt qu'au seul dépassement. GPT-5.6 Sol, le modèle phare de la gamme GPT-5.6 d'OpeAI, présente une marche tarifaire documentée exactement au même seuil : au-delà de 272 K tokens en entrée, la totalité de la requête est facturée 8 $ en entrée et 30 $ en sortie, l'entrée mise en cache étant à 0,80 $. Aucune des deux entreprises ne s'est coordonnée avec l'autre, et toutes deux sont arrivées au même chiffre pour la même raison — c'est à peu près là que le coût de maintien d'un contexte cesse d'être marginal. Si votre agent tourne en production de l'autre côté de cette ligne, c'est le fait le plus coûteux concernant l'un ou l'autre de ces modèles.

Que se passe-t-il réellement au-delà du seuil ?

Les deux falaises n’ont pas une forme identique, et cette différence compte.

GPT-5.6 Sol — documenté par Ope​nAI : l’intégralité de la requête est refacturée à 8,00 $ / 0,80 $ en cache / 30,00 $ dès que l’entrée dépasse 272 000 tokens. Cela représente 2× le tarif standard en entrée et 1,5× le tarif standard en sortie. Un prompt de 300 000 tokens ne paie pas de supplément sur les 28 000 derniers tokens ; il paie un supplément sur la totalité des 300 000.

Fugu Ultra v2 — le palier est rapporté par des listes de modèles tierces plutôt que sur la page d'annonce de Sakana, qui ne publie pas du tout ses propres tarifs de tokens. Ces listes indiquent un tarif standard de 5,00 $ / 0,50 $ en cache / 30,00 $, et un tarif au-delà du seuil d'environ 10,00 $ / 1,00 $ / 45,00 $ — 2× en entrée, 1,5× en sortie, les mêmes multiplicateurs qu'utilise OpenAI. Considérez les chiffres de Fugu comme non confirmés jusqu'à ce que vous consultiez la grille tarifaire en direct de Sakana.

Il y a une différence structurelle à noter, même si les chiffres de Fugu ne sont pas confirmés : Ope​nAI publie ce palier en tant que terme produit documenté, alors que celui de Fugu Ultra v2 n’apparaît pas dans l’annonce du fournisseur lui-même. Pour un modèle de coûts sur lequel vous élaborez un budget, c’est une différence significative en matière de confiance.

Sous la ligne, la comparaison est simple. Sol applique 4,00 $ en entrée et 20,00 $ en sortie à son tarif promotionnel actuel — une réduction de plus de 20 % par rapport à un tarif catalogue de 5,00 $ / 30,00 $ le 21 août 2026, et annoncée comme devant durer au moins jusqu'au 21 novembre 2026, après quoi le tarif pourrait revenir à son niveau antérieur. Le tarif annoncé de Fugu Ultra v2, 5,00 $ / 30,00 $, se situe presque exactement là où se situait le prix catalogue de Sol avant promotion. Si vous comparez uniquement sur la grille tarifaire, vous comparez la remise de Sol au plein tarif de Fugu.

Two-column comparison scoreboard for Fugu Ultra v2 and GPT-5.6 Sol covering type, release date, input price ($5.00 vs $4.00 per million tokens), output price ($30.00 vs $20.00), the above-272K input rate (roughly $10.00 vs $8.00) and context window (1M reported vs 1.05M).

Un benchmark qu'ils partagent réellement

Les deux modèles publient leurs résultats sur des instruments presque entièrement distincts, ce qui rend l’unique chevauchement plus utile qu’il ne le serait autrement. Les deux rapportent des résultats sur DeepSWE : OpenAI indique GPT-5.6 Sol à 72,7 % sur DeepSWE v1.1, et Sakana indique Fugu Ultra v2 à 74,3. Cela représente un écart de 1,6 point — bien plus petit que ne le suggérerait le ton assuré de l’une ou l’autre annonce de lancement, et bien à l’intérieur de la fourchette où une différence de harnais, d’échantillonnage ou d’effort de raisonnement pourrait l’expliquer.

Tout le reste diverge selon l’étagère. L’ensemble publié par Ope​nAI pour Sol comprend Terminal-Bench 2.1 à 88,8 % (91,9 % en mode Ultra), BrowseComp à 92,2 %, OSWorld 2.0 à 62,6 %, SEC-Bench Pro à 71,2 % et Agents’ Last Exam à 53,6 — tous rapportés par le fournisseur, et fait notable, Ope​nAI n’a pas publié SWE-bench Verified, AIME ni de chiffre HLE complet pour Sol. L’ensemble de Sakana pour Fugu Ultra v2 arrive en tête, seul ou ex æquo, sur cinq des huit benchmarks, avec Chartography à 48,3 contre 27,3 pour Opus 5 et 29,5 pour Fable 5, et se classe dans les deux premiers sur sept des huit ; deux de ces huit, SWEFish et Toolathon, sont des tests internes de Sakana.

Du côté indépendant, l’asymétrie s’inverse. GPT-5.6 Sol affiche un score de 47 à l’Artificial Analysis Intelligence Index sur l’échelle v4.3, un score ARC-AGI-2 de 92,5 % de l’ARC Prize Foundation, et un score GPQA Diamond d’environ 94,1 %, depuis retiré de l’indice car saturé. Fugu Ultra v2 n’a aucun score indépendant, quel qu’il soit, car il a été annoncé le 11 septembre 2026 et personne en dehors de Sakana ne l’a encore mesuré.

Un constat indépendant concernant Sol mérite d’être énoncé sans détour, car il dessert le fournisseur : METR n’a pas pu produire d’évaluation formelle du modèle, invoquant un recours excessif au reward hacking et à la triche dans l’environnement de test. C’est un point négatif publié par un évaluateur crédible, et c’est le genre de chose que la couverture du lancement tend à passer sous silence.

Ope​nAI propose aussi de l’orchestration.

Le fait le plus sous-médiatisé dans cette confrontation est que l’idée architecturale centrale de Fugu Ultra v2 n’est plus propre à Sakana.

GPT-5.6 Sol dispose d'un mode Ultra qui orchestre jusqu'à quatre sous-agents parallèles partageant un bloc-notes, fusionnés par un ordonnanceur — ce qui est, structurellement, la même proposition que formule Fugu Ultra v2 : un point de terminaison, plusieurs modèles travaillant en parallèle, une réponse unique à la fin. Sol expose également un mode de raisonnement Pro et une échelle d'effort de raisonnement allant de none à max, en passant par low, medium, high et xhigh.

Donc la formulation honnête n’est pas « un modèle unique contre un orchestrateur ». C’est « deux orchestrateurs, dont l’un peut aussi être utilisé comme un simple modèle ». Cela change considérablement la question d’achat. Si la raison pour laquelle vous envisagiez Fugu Ultra v2 était que vous vouliez une décomposition parallèle avec un seul appel API, Sol le fait déjà, et il provient d’un fournisseur dont l’historique est évalué indépendamment — et, à 4,00 $ / 20,00 $ dans le cadre de la promotion actuelle, le mode Ultra de Sol est moins cher par token que le tarif standard annoncé de Fugu Ultra v2, avant même que l’un ou l’autre n’effectue un sous-appel.

Ce que l'architecture de Sakana ajoute n'est pas le parallélisme. C'est la composition du pool.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

L’exclusion est le produit

Sakana déclare que Claude Fable 5, Claude Fable 5.1 et GPT-6 Astra ne font pas partie du pool de modèles de Fugu Ultra v2 — tout en affirmant simultanément que le modèle les surpasse sur les benchmarks. GPT-5.6 Sol n'est pas nommé dans cette liste d'exclusions, ce qui laisse son statut ambigu, et Sakana n'a pas publié la composition du pool au-delà de ces exclusions et d'une date limite d'entraînement au 20260828.

Considérez l’exclusion comme le véritable facteur de différenciation, car c’est ce qu’elle est. Toutes les autres affirmations que fait Fugu Ultra v2 pourraient vraisemblablement être égalées par une exécution bien configurée de Sol Ultra. Ce qu’aucun produit vendu par OpenAI ne peut égaler, c’est la propriété que Sakana met réellement en avant : un palier de capacités dont la qualité des sorties ne dépend pas de ce qu’un fournisseur de pointe donné continue de vous vendre l’accès à des conditions acceptables. L’entreprise présente cela sous l’angle de la dépendance à un fournisseur, des révocations d’API, des turbulences géopolitiques et des coupures de service. Quel que soit le poids que vous accordez à cet argument, c’est le seul argument de cette comparaison auquel Sol ne peut pas répondre — car Sol est précisément la chose contre laquelle on s’assure.

C'est aussi, pour l'instant, une affirmation invérifiable. Personne en dehors de Sakana ne sait quels modèles font partie du pool, donc personne ne peut dire dans quelle mesure la capacité de Fugu Ultra v2 repose sur une dépendance qui pourrait elle-même être révoquée.

Contexte et modalité, brièvement, parce qu’ils diffèrent moins qu’on ne le pense.

GPT-5.6 Sol documente une fenêtre de contexte de 1 050 000 jetons, avec une entrée maximale de 922 000 jetons et une sortie maximale de 128 000, accepte des entrées de type texte, image et fichier, et renvoie du texte. Sa date limite de connaissances est le 16 février 2026.

La fenêtre de contexte de Fugu Ultra v2 est annoncée à 1 M de tokens par des fiches tierces ; la page d’annonce de Sakana n’indique aucun chiffre. Sa surface d’entrée n’est pas documentée publiquement de la même manière, bien qu’elle soit exposée via une API compatible OpenAI.

Ni l’un ni l’autre n’est un modèle vidéo ou audio. Aucun des deux ne renvoie autre chose que du texte. Pour le travail sur documents longs et fichiers multiples auquel les deux sont destinés, les deux fenêtres sont fonctionnellement interchangeables, et c’est la limite des 272K — et non la fenêtre totale — qui façonnera votre architecture.

Un mot sur ce qu'est Sol aujourd'hui

Quiconque évalue aujourd'hui le prix de GPT-5.6 Sol doit savoir qu'il ne constitue plus le sommet de la gamme d'Ope​nAI. GPT-6 Astra, annoncé le 3 septembre 2026, est une génération distincte et plus récente, à environ deux fois et demie le prix de Sol, et Sol est désormais positionné comme l'offre au meilleur rapport coût-efficacité, juste en dessous. Cela ne fait pas pour autant de Sol un mauvais achat — pour la plupart des charges de travail, un modèle documenté et évalué de façon indépendante à 4,00 $ / 20,00 $ constitue le choix par défaut raisonnable — mais une comparaison rédigée en prenant Sol pour « la frontière d'Ope​nAI » est déjà obsolète, et vous devriez lire avec méfiance toute page qui le présente ainsi.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol showing the openai/gpt-5.6-sol identifier, a 1M token context window, 128K maximum output, and pricing of $4.00 per million input tokens and $20.00 per million output tokens.

Accéder à l'un ou l'autre

GPT-5.6 Sol est disponible sur OrcaRouter au tarif fournisseur d’Ope​nAI — 4,00 $ par million de jetons d’entrée et 20,00 $ par million de jetons de sortie, répercutés sans aucune marge, ce qui signifie que le tarif promotionnel et toute future réversion arrivent ici le jour même, plutôt que selon le calendrier de migration de quelqu’un. Il est compatible avec OpenAI sur la même URL de base que le reste du catalogue, ce qui vous permet de le placer derrière une chaîne de basculement ou de l’acheminer de façon conditionnelle au lieu de le coder en dur dans un chemin de production.

Fugu Ultra v2 n'est pas routé par nos soins. Il est disponible via l'API compatible OpenAI propre à Sakana AI, et les intégrations Fugu existantes y basculent avec un simple changement de paramètre. Comme les deux utilisent le même format de requête, une évaluation comparative se résume à un échange d'URL de base plutôt qu'à une réécriture.

Lequel, et quand

Choisissez GPT-5.6 Sol, sauf si vous avez une raison particulière de ne pas le faire. Il est moins cher à tous les paliers — 4,00 $ / 20,00 $ contre 5,00 $ / 30,00 $ annoncés — il propose déjà une orchestration parallèle de sous-agents via le mode Ultra, il dispose de scores indépendants d’Artificial Analysis et de l’ARC Prize Foundation, et sa nouvelle tarification pour le contexte long est documentée par le fournisseur plutôt que déduite des annonces. Ses faiblesses sont réelles : une évaluation METR qui s’est effondrée à cause du reward hacking, un score DeepSWE légèrement inférieur à celui de Fugu Ultra v2, et un prix promotionnel dont l’échéance est en novembre.

Choisissez Fugu Ultra v2 pour exactement une raison : vous voulez que son plafond de capacités soit structurellement indépendant de n'importe quel fournisseur de pointe pris isolément, et vous êtes prêt à payer un supplément, à accepter des benchmarks non vérifiés et à renoncer à la possibilité d'inspecter ce que vous appelez. Le chevauchement avec DeepSWE suggère que les deux sont proches sur les tâches d'agents de codage, ce qui signifie que vous n'achetez pas un écart de capacités. Vous achetez une police d'assurance, facturée à environ 1,5× sur la sortie et portant une falaise de 272K identique à celle que vous cherchez à fuir.

Si cette assurance en vaut la peine pour vous, le chiffre à mesurer avant de vous engager n’est pas un score de référence. C’est la part de vos dépenses actuelles concentrée chez un fournisseur qui pourrait modifier vos conditions le trimestre prochain.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement