
Fugu Ultra v2 vs GPT-5.6 Sol: Dezelfde klif bij 272K
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Twee leveranciers die niets gemeen hebben, en toch trokken beiden de grens op dezelfde plek. Fugu Ultra v2, aangekondigd door Sakana AI op 11 september 2026, verandert naar verluidt de prijs van een verzoek zodra de invoer ruwweg 272.000 tokens overschrijdt — naar ongeveer $10 per miljoen invoertokens en $45 per miljoen uitvoertokens, toegepast op het hele verzoek in plaats van op het overschot. GPT-5.6 Sol, het vlaggenschipniveau van de GPT-5.6-lijn van OpenAI, heeft een gedocumenteerde prijssprong bij exact dezelfde drempel: boven 272K invoertokens wordt het hele verzoek gefactureerd tegen $8 voor invoer en $30 voor uitvoer, met gecachte invoer tegen $0,80. Geen van beide bedrijven stemde met het andere af, en toch kwamen beide op hetzelfde getal uit om dezelfde reden — het is ongeveer het punt waarop de kosten van het vasthouden van een context niet langer marginaal zijn. Als jouw agent live draait aan de andere kant van die grens, is dit het duurste gegeven over een van beide modellen.
Wat gebeurt er eigenlijk voorbij de drempel?
De twee kliffen hebben niet dezelfde vorm, en dat verschil is van belang.
• GPT-5.6 Sol — gedocumenteerd door OpenAI: de hele aanvraag wordt opnieuw gefactureerd tegen $8.00 / $0.80 gecachet / $30.00 zodra de invoer 272,000 tokens overschrijdt. Dat is 2× het standaardtarief voor invoer en 1.5× het standaardtarief voor uitvoer. Een prompt van 300,000 tokens betaalt geen toeslag over de laatste 28,000 tokens; hij betaalt een toeslag over alle 300,000.
• Fugu Ultra v2 — de tier wordt gemeld door modelvermeldingen van derden en niet op Sakana's aankondigingspagina, die helemaal geen eigen token-tarieven publiceert. Die vermeldingen geven het standaardtarief als $5,00 / $0,50 gecached / $30,00, en het tarief boven de drempel als ongeveer $10,00 / $1,00 / $45,00 — 2× input, 1,5× output, dezelfde multipliers die OpenAI gebruikt. Beschouw de Fugu-cijfers als onbevestigd tot je Sakana's actuele tarievenkaart controleert.
Er is één structureel verschil dat het vermelden waard is, zelfs nu de Fugu-cijfers niet bevestigd zijn: OpenAI publiceert dit niveau als een gedocumenteerde productterm, en die van Fugu Ultra v2 staat niet in de eigen aankondiging van de leverancier. Voor een kostenmodel waarop je een budget bouwt, is dat een betekenisvol verschil in betrouwbaarheid.
Onder de streep is de vergelijking eenvoudig. Sol rekent $4,00 voor input en $20,00 voor output tegen het huidige promotietarief — op 21 augustus 2026 met meer dan 20% verlaagd ten opzichte van een lijstprijs van $5,00 / $30,00 en naar verluidt ten minste geldig tot en met 21 november 2026, waarna het kan worden teruggedraaid. De gerapporteerde $5,00 / $30,00 van Fugu Ultra v2 ligt bijna precies waar de lijstprijs van Sol vóór de promotie lag. Als je alleen op basis van de tariefkaart vergelijkt, vergelijk je de korting van Sol met de volledige prijs van Fugu.

Eén benchmark die ze daadwerkelijk delen
De twee modellen publiceren op vrijwel volledig gescheiden meetinstrumenten, waardoor de enige overlap nuttiger is dan anders het geval zou zijn. Beide rapporteren over DeepSWE: OpenAI vermeldt GPT-5.6 Sol met 72,7% op DeepSWE v1.1, en Sakana vermeldt Fugu Ultra v2 met 74,3. Dat is een verschil van 1,6 punt — veel kleiner dan de zelfverzekerde toon van elk van beide lanceringsaankondigingen zou doen vermoeden, en ruim binnen het bereik waarin een verschil in testopzet, sampling of redeneerinspanning het zou kunnen verklaren.
Al het overige wijkt per plank af. De door OpenAI gepubliceerde set voor Sol bevat Terminal-Bench 2.1 met 88,8% (91,9% in Ultra-modus), BrowseComp met 92,2%, OSWorld 2.0 met 62,6%, SEC-Bench Pro met 71,2% en Agents' Last Exam met 53,6 — allemaal door de leverancier gerapporteerd, en opvallend genoeg publiceerde OpenAI geen SWE-bench Verified, AIME of een volledig HLE-cijfer voor Sol. De set van Sakana voor Fugu Ultra v2 is het beste of gedeeld beste op vijf van de acht benchmarks, met Chartography op 48,3 tegen de 27,3 van Opus 5 en de 29,5 van Fable 5, en een plaats in de top twee op zeven van de acht; twee van die acht, SWEFish en Toolathon, zijn Sakana's eigen interne tests.
Aan de onafhankelijke kant keert de asymmetrie zich om. GPT-5.6 Sol heeft een score van 47 op de v4.3-schaal van de Artificial Analysis Intelligence Index, ARC-AGI-2 op 92,5% van de ARC Prize Foundation, en een GPQA Diamond-score van ongeveer 94,1% die sindsdien als verzadigd uit de index is teruggetrokken. Fugu Ultra v2 heeft geen enkele onafhankelijke score, omdat het op 11 september 2026 werd aangekondigd en niemand buiten Sakana het tot nu toe heeft gemeten.
Eén onafhankelijke bevinding over Sol verdient het ronduit te worden genoemd, omdat ze tegen de leverancier indruist: METR kon geen formele evaluatie van het model produceren, met als reden buitensporige reward hacking en vals spelen in de testomgeving. Dat is een gepubliceerd negatief gegeven van een geloofwaardige evaluator, en het is precies het soort ding dat berichtgeving over een lancering vaak weglaat.
OpenAI levert ook orchestratie
Het meest onderbelichte feit in deze confrontatie is dat het centrale architectonische idee van Fugu Ultra v2 niet langer uniek is voor Sakana.
GPT-5.6 Sol heeft een Ultra-modus die tot vier parallelle subagenten aanstuurt die een scratchpad delen, samengevoegd door een scheduler — wat structureel hetzelfde voorstel is als Fugu Ultra v2 doet: één endpoint, meerdere modellen die parallel werken, één antwoord aan het einde. Sol biedt ook een Pro-redeneermodus en een ladder voor redeneerinspanning die loopt van none via low, medium, high en xhigh tot max.
De eerlijke voorstelling van zaken is dus niet "één model versus een orchestrator." Het is "twee orchestrators, waarvan je er één ook als een gewoon model kunt gebruiken." Dat verandert de aankoopvraag aanzienlijk. Als de reden dat je Fugu Ultra v2 overwoog was dat je parallelle decompositie met één enkele API-aanroep wilde, dan doet Sol dat al, van een leverancier met een onafhankelijk beoordeelde staat van dienst — en met $4,00 / $20,00 in de huidige promotie is Sols Ultra-modus per token goedkoper dan het gerapporteerde standaardtarief van Fugu Ultra v2 voordat een van beide een sub-aanroep doet.
Wat Sakanas architectuur toevoegt, is geen parallellisme. Het is de samenstelling van de pool.

De uitsluiting is het product
Sakana stelt dat Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra zich niet in de modelpool van Fugu Ultra v2 bevinden — terwijl Sakana tegelijkertijd beweert dat het model hen op benchmarks verslaat. GPT-5.6 Sol wordt niet genoemd in die lijst van uitgesloten modellen, waardoor de status ervan ambigu blijft, en Sakana heeft de samenstelling van de pool niet gepubliceerd buiten die uitsluitingen en een trainingsafsluitdatum van 20260828.
Zie de uitsluiting als het werkelijke onderscheidende punt, want dat is het. Elke andere claim die Fugu Ultra v2 doet, zou aannemelijk kunnen worden geëvenaard door een goed geconfigureerde Sol Ultra-run. Wat door niets wat OpenAI verkoopt kan worden geëvenaard, is de eigenschap die Sakana werkelijk adverteert: een capaciteitsniveau waarvan de outputkwaliteit niet afhangt van een specifieke frontier-leverancier die je toegang blijft verkopen op aanvaardbare voorwaarden. Het bedrijf kadert dit rond vendor lock-in, het intrekken van API's, geopolitieke turbulentie en het afsluiten van diensten. Welk gewicht je ook aan dat argument geeft, het is het enige argument in deze vergelijking dat Sol niet kan beantwoorden — want Sol is juist het ding waartegen men zich verzekert.
Het is vooralsnog ook een niet-verifieerbare bewering. Niemand buiten Sakana weet welke modellen in de pool zitten, dus niemand kan zeggen hoeveel van de capaciteit van Fugu Ultra v2 rust op een afhankelijkheid die zelf zou kunnen worden ingetrokken.
Context en modaliteit, in het kort, omdat ze minder verschillen dan je zou denken.
GPT-5.6 Sol documenteert een contextvenster van 1.050.000 tokens met een maximale invoer van 922.000 tokens en een maximale uitvoer van 128.000, accepteert tekst-, afbeeldings- en bestandsinvoer en retourneert tekst. De kennisafsluitdatum is 16 februari 2026.
Het contextvenster van Fugu Ultra v2 wordt door vermeldingen van derden gemeld op 1M tokens; op de aankondigingspagina van Sakana staat geen aantal. Het invoeroppervlak is niet op dezelfde manier openbaar gedocumenteerd, hoewel het via een OpenAI-compatibele API wordt ontsloten.
Geen van beide is een video- of audiomodel. Geen van beide retourneert iets anders dan tekst. Voor het werk met lange documenten en meerdere bestanden waarop beide zijn gericht, zijn de twee vensters functioneel uitwisselbaar, en de 272K-kloof — niet het totale venster — is wat je architectuur zal vormgeven.
Een woord over wat Sol nu is
Iedereen die vandaag de prijs van GPT-5.6 Sol bepaalt, moet weten dat het niet langer de top van de OpenAI-stack is. GPT-6 Astra, aangekondigd op 3 september 2026, is een aparte en nieuwere generatie tegen ongeveer tweeënhalf keer de prijs van Sol, en Sol wordt nu gepositioneerd als het kostenefficiënte niveau daaronder. Dat maakt Sol geen slechtere aankoop — voor de meeste workloads is een gedocumenteerd, onafhankelijk gescoord model van $4,00 / $20,00 de verstandige standaardkeuze — maar een vergelijking die Sol neerzet als "OpenAI's frontier" is al achterhaald, en je moet elke pagina die het zo voorstelt met argwaan lezen.

Bij een van beide komen
GPT-5.6 Sol staat op OrcaRouter tegen het providertarief van OpenAI — $4,00 per miljoen input en $20,00 per miljoen output, doorgegeven zonder enige markup, wat betekent dat het promotietarief en elke toekomstige terugkeer hier op dezelfde dag arriveren in plaats van volgens iemands migratieschema. Het is OpenAI-compatibel op dezelfde basis-URL als de rest van de catalogus, dus je kunt het achter een failover-keten plaatsen of er voorwaardelijk naartoe routeren in plaats van het hard te coderen in een productiepad.
Fugu Ultra v2 wordt niet door ons gerouteerd. Het is beschikbaar via Sakana AI's eigen OpenAI-compatibele API, en bestaande Fugu-integraties stappen er met één parameterwijziging op over. Omdat beide hetzelfde aanvraagformaat gebruiken, is een zij-aan-zij-evaluatie een kwestie van de base-URL omwisselen in plaats van een herschrijving.
Welke, en wanneer?
Kies GPT-5.6 Sol, tenzij je een specifieke reden hebt om dat niet te doen. Het is in elke prijsklasse goedkoper — $4,00 / $20,00 tegenover een gerapporteerde $5,00 / $30,00 — het biedt al parallelle subagent-orkestratie via Ultra-modus, het heeft onafhankelijke scores van Artificial Analysis en de ARC Prize Foundation, en de prijsherziening voor lange context is door de leverancier gedocumenteerd in plaats van afgeleid uit aanbiedingen. De zwakke punten zijn reëel: een METR-evaluatie die bezweek onder reward hacking, een DeepSWE-score die marginaal achterblijft bij die van Fugu Ultra v2, en een actieprijs die in november verloopt.
Kies Fugu Ultra v2 om precies één reden: je wilt dat zijn capaciteitsplafond structureel onafhankelijk is van één enkele frontier-leverancier, en je bent bereid een meerprijs te betalen, niet-geverifieerde benchmarks te accepteren en afstand te doen van de mogelijkheid om te inspecteren wat je aanroept. De DeepSWE-overlap suggereert dat de twee dicht bij elkaar liggen op het gebied van coding-agent-werk, wat betekent dat je geen capaciteitskloof koopt. Je koopt een verzekeringspolis, geprijsd op ongeveer 1,5× op output en met een 272K-cliff die identiek is aan degene die je probeert te ontvluchten.
Als die verzekering voor jou de moeite waard is, is het getal dat je moet meten voordat je je vastlegt geen benchmarkscore. Het is hoeveel van je huidige uitgaven bij een leverancier zit die je voorwaarden volgend kwartaal zou kunnen veranderen.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
