Hero-kort för matchningen Fugu Ultra v2 mot GPT-5.6 Sol, som visar två priskurvor som båda hoppar vid 272 000 tokens.
Guides & Insights

Fugu Ultra v2 vs GPT-5.6 Sol: Samma stup vid 272K

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två leverantörer utan något gemensamt, och båda drog gränsen på samma ställe. Fugu Ultra v2, som tillkännagavs av Sakana AI den 11 september 2026, uppges sätta ett nytt pris för en begäran när dess indata passerar ungefär 272 000 tokens – och går då upp till omkring 10 USD per miljon indata och 45 USD per miljon utdata, vilket tillämpas på hela begäran i stället för på den överskjutande delen. GPT-5.6 Sol, Ope​nAI:s flaggskeppsnivå i G​PT-5.6-serien, har ett dokumenterat prisstup vid exakt samma tröskel: över 272K indata-tokens faktureras hela begäran med 8 USD i indata och 30 USD i utdata, med cachad indata på 0,80 USD. Inget av företagen samordnade med det andra, och båda landade på samma siffra av samma anledning – det är ungefär där kostnaden för att hålla en kontext slutar vara marginell. Om din agent kör live på andra sidan den gränsen är detta det enskilt dyraste faktumet om endera modellen.

Vad som faktiskt händer bortom tröskeln

De två klipporna är inte identiska till formen, och skillnaden har betydelse.

GPT-5.6 Sol — dokumenterad av OpenAI: hela begäran faktureras om med 8,00 $ / 0,80 $ cachat / 30,00 $ när indata överstiger 272 000 tokens. Det är 2× standardtaxan för indata och 1,5× standardtaxan för utdata. En prompt på 300 000 tokens betalar inte extra för de sista 28 000 tokens; den betalar extra för alla 300 000.

Fugu Ultra v2 — nivån rapporteras av modelllistningar från tredje part snarare än på Sakanas tillkännagivandesida, som inte publicerar sina egna tokenpriser över huvud taget. Dessa listningar anger standardpriset till $5,00 / $0,50 cachat / $30,00, och priset över tröskeln till ungefär $10,00 / $1,00 / $45,00 — 2× inmatning, 1,5× utmatning, samma multiplikatorer som OpenAI använder. Betrakta Fugu-siffrorna som obekräftade tills du kontrollerar Sakanas aktuella prislista.

Det finns en strukturell skillnad värd att notera, även om Fugu-siffrorna är obekräftade: OpenAI publicerar den här nivån som en dokumenterad produkterm, medan Fugu Ultra v2:s inte gör det i leverantörens eget tillkännagivande. För en kostnadsmodell som du bygger en budget på är det en betydande skillnad i tillförlitlighet.

Under linjen är jämförelsen enkel. Sol tar $4,00 för input och $20,00 för output till sitt nuvarande kampanjpris — en sänkning med mer än 20 % från ett listpris på $5,00 / $30,00 den 21 augusti 2026, och uppges gälla åtminstone till och med den 21 november 2026, varefter det kan återgå. Fugu Ultra v2:s rapporterade pris på $5,00 / $30,00 ligger nästan exakt där Sols listpris före kampanjen låg. Om du jämför enbart utifrån prislistan jämför du Sols rabatt mot Fugu:s fullpris.

Two-column comparison scoreboard for Fugu Ultra v2 and GPT-5.6 Sol covering type, release date, input price ($5.00 vs $4.00 per million tokens), output price ($30.00 vs $20.00), the above-272K input rate (roughly $10.00 vs $8.00) and context window (1M reported vs 1.05M).

Ett riktmärke de faktiskt delar

De två modellerna publiceras på nästan helt separata instrument, vilket gör den enda överlappningen mer användbar än den annars skulle vara. Båda rapporterar DeepSWE: OpenAI listar GPT-5.6 Sol på 72,7 % på DeepSWE v1.1, och Sakana listar Fugu Ultra v2 på 74,3. Det är en skillnad på 1,6 punkter – mycket mindre än vad den självsäkra tonen i något av lanseringstillkännagivandena skulle antyda, och väl inom det intervall där en skillnad i testramverk, sampling eller resonemangsansträngning skulle kunna förklara den.

Allt annat skiljer sig åt beroende på hylla. Ope​nAI:s publicerade uppsättning för Sol innehåller Terminal-Bench 2.1 på 88,8 % (91,9 % i Ultra-läge), BrowseComp på 92,2 %, OSWorld 2.0 på 62,6 %, SEC-Bench Pro på 71,2 % och Agents' Last Exam på 53,6 – alla rapporterade av leverantören, och noterbart är att Ope​nAI inte publicerade SWE-bench Verified, AIME eller en fullständig HLE-siffra för den. Sakanas uppsättning för Fugu Ultra v2 är bäst eller delat bäst på fem av åtta benchmarks, med Chartography på 48,3 mot Opus 5:s 27,3 och Fable 5:s 29,5, och placering bland de två bästa på sju av åtta; två av dessa åtta, SWEFish och Toolathon, är Sakanas egna interna tester.

På den oberoende sidan vänds asymmetrin. GPT-5.6 Sol har en poäng på 47 i Artificial Analysis Intelligence Index på v4.3-skalan, ARC-AGI-2 på 92,5 % från ARC Prize Foundation och ett GPQA Diamond-resultat på omkring 94,1 % som sedan dess har tagits bort från indexet då det anses vara mättat. Fugu Ultra v2 har ingen oberoende poäng av något slag, eftersom den tillkännagavs den 11 september 2026 och ingen utanför Sakana har mätt den ännu.

Ett oberoende fynd om Sol är värt att säga rakt ut, eftersom det går emot leverantören: METR kunde inte genomföra en formell utvärdering av modellen, med hänvisning till alltför omfattande reward hacking och fusk i testmiljön. Det är ett publicerat negativt resultat från en trovärdig utvärderare, och det är den typ av sak som lanseringsbevakning tenderar att utelämna.

OpenAI levererar också orkestrering

Det mest underrapporterade faktumet i den här matchen är att Fugu Ultra v2:s centrala arkitektoniska idé inte längre är unik för Sakana.

GPT-5.6 Sol har ett Ultra-läge som orkestrerar upp till fyra parallella subagenter som delar ett scratchpad, sammanfogade av en schemaläggare — vilket strukturellt sett är samma förslag som Fugu Ultra v2 lägger fram: en slutpunkt, flera modeller som arbetar parallellt, ett enda svar i slutet. Sol exponerar också ett Pro-resonemangsläge och en stege för resonemangsansträngning som sträcker sig från none via low, medium, high och xhigh till max.

Så den ärliga formuleringen är inte ”en enskild modell kontra en orkestrerare”. Det är ”två orkestrerare, varav du också kan använda en som en vanlig modell”. Det förändrar köpfrågan avsevärt. Om anledningen till att du övervägde Fugu Ultra v2 var att du ville ha parallell nedbrytning med ett enda API-anrop, gör Sol redan det, från en leverantör med en oberoende poängsatt historik — och till $4.00 / $20.00 i den aktuella kampanjen är Sols Ultra-läge billigare per token än Fugu Ultra v2:s rapporterade standardpris innan någon av dem gör ett underanrop.

Det som Sakanas arkitektur tillför är inte parallellism. Det är sammansättningen av poolen.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

Exkluderingen är produkten

Sakana uppger att Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra inte ingår i Fugu Ultra v2:s modellpool — samtidigt som man hävdar att modellen slår dem i benchmarks. GPT-5.6 Sol nämns inte i den listan över uteslutna modeller, vilket gör att dess status är oklar, och Sakana har inte offentliggjort vilka modeller som ingår i poolen utöver dessa uteslutningar och en träningscutoff på 20260828.

Läs undantaget som den faktiska särskiljande faktorn, för det är precis vad det är. Alla andra påståenden som Fugu Ultra v2 framför skulle rimligen kunna matchas av en välkonfigurerad Sol Ultra-körning. Det som inte kan matchas av något som OpenAI säljer är den egenskap som Sakana egentligen marknadsför: en förmågenivå vars utdatakvalitet inte är beroende av att en specifik frontier-leverantör fortsätter att sälja åtkomst till dig på acceptabla villkor. Företaget ramar in detta kring leverantörsinlåsning, API-återkallanden, geopolitisk turbulens och tjänsteavbrott. Vilken vikt du än ger det argumentet, är det det enda argumentet i den här jämförelsen som Sol inte kan svara på — eftersom Sol är det som man försäkrar sig mot.

Det är också, för närvarande, ett påstående som inte går att verifiera. Ingen utanför Sakana vet vilka modeller som finns i poolen, så ingen kan säga hur mycket av Fugu Ultra v2:s kapacitet som hänger på ett beroende som i sig självt skulle kunna återkallas.

Kontext och modalitet, i korthet, eftersom de skiljer sig mindre än man skulle tro

GPT-5.6 Sol anger ett kontextfönster på 1 050 000 tokens, med maximalt 922 000 indata-tokens och maximalt 128 000 utdata-tokens, tar emot text-, bild- och filindata samt returnerar text. Dess kunskapsgräns är 16 februari 2026.

Fugu Ultra v2:s kontextfönster rapporteras vara 1M tokens i listningar från tredje part; Sakanas tillkännagivandesida anger ingen siffra. Dess inmatningsyta dokumenteras inte offentligt på samma sätt, även om den exponeras via ett OpenAI-kompatibelt API.

Ingen av dem är en video- eller ljudmodell. Ingen av dem returnerar något annat än text. För arbetet med långa dokument och flera filer som båda är avsedda för är de två fönstren funktionellt utbytbara, och det är 272K-stupet – inte det totala fönstret – som kommer att forma din arkitektur.

Några ord om vad Sol är nu

Den som prissätter GPT-5.6 Sol i dag bör veta att den inte längre är toppen av OpenAI:s stack. GPT-6 Astra, som tillkännagavs den 3 september 2026, är en separat och nyare generation till ungefär två och en halv gånger Sols pris, och Sol positioneras nu som den kostnadseffektiva nivån under den. Det gör inte Sol till ett sämre köp – för de flesta arbetsbelastningar är en dokumenterad, oberoende poängsatt modell till $4.00 / $20.00 ett rimligt standardval – men en jämförelse som skrivits med Sol som "OpenAI:s frontlinje" är redan föråldrad, och du bör vara misstänksam mot varje sida som framställer den på det sättet.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol showing the openai/gpt-5.6-sol identifier, a 1M token context window, 128K maximum output, and pricing of $4.00 per million input tokens and $20.00 per million output tokens.

Att ta sig till någon av dem

GPT-5.6 Sol finns på OrcaRouter till OpenAI:s leverantörspris — $4.00 per miljon input och $20.00 per miljon output, som förs vidare utan påslag, vilket innebär att kampanjpriset och eventuella framtida återgångar når hit samma dag i stället för enligt någons migreringsschema. Den är OpenAI-kompatibel på samma bas-URL som resten av katalogen, så du kan lägga den bakom en failover-kedja eller villkorligt dirigera till den i stället för att hårdkoda den i en produktionsväg.

Fugu Ultra v2 dirigeras inte av oss. Den finns tillgänglig via Sakana AI:s egen OpenAI-kompatibla API, och befintliga Fugu-integrationer flyttas över till den med en enda parameterändring. Eftersom båda talar samma begäransformat är en sida-vid-sida-utvärdering ett byte av bas-URL snarare än en omskrivning.

Vilken, och när?

Välj GPT-5.6 Sol om du inte har en specifik anledning att låta bli. Det är billigare på varje nivå — 4,00 / 20,00 USD mot rapporterade 5,00 / 30,00 USD — det erbjuder redan parallell orkestrering av underagenter via Ultra-läget, det har oberoende poäng från Artificial Analysis och ARC Prize Foundation, och dess omprissättning för lång kontext dokumenteras av leverantören i stället för att härledas från listningar. Dess svagheter är verkliga: en METR-utvärdering som kollapsade på grund av reward hacking, en DeepSWE-poäng som ligger marginellt efter Fugu Ultra v2:s, och ett kampanjpris med utgång i november.

Välj Fugu Ultra v2 av exakt en anledning: du vill att dess kapacitetstak ska vara strukturellt oberoende av någon enskild frontier-leverantör, och du är beredd att betala ett premiumpris, acceptera overifierade benchmarks och avstå från möjligheten att inspektera vad du anropar. DeepSWE-överlappningen tyder på att de båda ligger nära varandra när det gäller kodagentarbete, vilket innebär att du inte köper ett kapacitetsgap. Du köper en försäkring, prissatt till ungefär 1,5× på utdata och med en 272K-klippa identisk med den du försöker undkomma.

Om den där försäkringen är värd det för dig är siffran du ska mäta innan du binder dig inte en benchmarkpoäng. Det är hur mycket av dina nuvarande utgifter som ligger hos en leverantör som kan ändra dina villkor nästa kvartal.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen