
Fugu Ultra v2 vs GPT-5.6 Sol: Ten sam klif przy 272K
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Dwóch dostawców, których nic nie łączy, a obaj wyznaczyli granicę w tym samym miejscu. Fugu Ultra v2, ogłoszony przez Sakana AI 11 września 2026 r., ma podobno zmieniać cenę żądania, gdy jego dane wejściowe przekroczą około 272 000 tokenów — przechodząc na około 10 USD za milion tokenów wejściowych i 45 USD za milion tokenów wyjściowych, stosowane do całego żądania, a nie tylko do nadwyżki. GPT-5.6 Sol, flagowy poziom OpenAI w linii GPT-5.6, ma udokumentowany próg dokładnie na tym samym poziomie: powyżej 272 tys. tokenów wejściowych całe żądanie jest rozliczane po 8 USD za dane wejściowe i 30 USD za dane wyjściowe, a dane wejściowe z pamięci podręcznej po 0,80 USD. Żadna z firm nie koordynowała działań z drugą, a obie trafiły na tę samą liczbę z tego samego powodu — to mniej więcej miejsce, w którym koszt utrzymywania kontekstu przestaje być marginalny. Jeśli Twój agent działa na żywo po drugiej stronie tej granicy, jest to pojedynczy najdroższy fakt dotyczący któregokolwiek z tych modeli.
Co tak naprawdę dzieje się po przekroczeniu progu?
Te dwa klify nie mają identycznego kształtu, a ta różnica ma znaczenie.
• GPT-5.6 Sol — udokumentowane przez OpenAI: całe żądanie jest ponownie rozliczane po $8.00 / $0.80 za cache / $30.00, gdy dane wejściowe przekroczą 272 000 tokenów. To 2× standardowej stawki za dane wejściowe i 1,5× standardowej stawki za dane wyjściowe. Prompt o długości 300 000 tokenów nie płaci premii za ostatnie 28 000 tokenów; płaci premię za wszystkie 300 000.
• Fugu Ultra v2 — ten poziom jest podawany przez katalogi modeli firm trzecich, a nie na stronie ogłoszeń Sakany, która w ogóle nie publikuje własnych stawek za tokeny. Te katalogi podają standardową stawkę na poziomie $5,00 / $0,50 z pamięci podręcznej / $30,00, a stawkę powyżej progu na około $10,00 / $1,00 / $45,00 — 2× za wejście, 1,5× za wyjście, te same mnożniki, których używa OpenAI. Traktuj wartości Fugu jako niepotwierdzone, dopóki nie sprawdzisz aktualnego cennika Sakany.
Jest jedna różnica strukturalna warta odnotowania, nawet jeśli liczby dotyczące Fugu nie zostały potwierdzone: OpenAI publikuje ten poziom jako udokumentowany termin produktowy, a Fugu Ultra v2 nie pojawia się w ogłoszeniu samego dostawcy. W przypadku modelu kosztów, na którym opierasz budżet, jest to znacząca różnica w poziomie pewności.
Poniżej linii porównanie jest proste. Sol pobiera 4,00 USD za wejście i 20,00 USD za wyjście w obecnej stawce promocyjnej — obniżonej o ponad 20% względem ceny katalogowej 5,00 USD / 30,00 USD w dniu 21 sierpnia 2026 r. i zgodnie z deklaracją mającej obowiązywać co najmniej do 21 listopada 2026 r., po czym może wrócić do poprzedniej wysokości. Podawana cena Fugu Ultra v2 na poziomie 5,00 USD / 30,00 USD jest niemal dokładnie tam, gdzie znajdowała się cena katalogowa Sol przed promocją. Jeśli porównujesz wyłącznie na podstawie cennika stawek, porównujesz rabat Sol z pełną ceną Fugu.

Jeden benchmark, który faktycznie współdzielą
Oba modele publikują wyniki na niemal całkowicie odrębnych zestawach testów, co sprawia, że ten jedyny punkt wspólny jest tym bardziej przydatny, niż byłby w innym wypadku. Oba podają wyniki dla DeepSWE: OpenAI wymienia GPT-5.6 Sol z wynikiem 72,7% w DeepSWE v1.1, a Sakana wymienia Fugu Ultra v2 z wynikiem 74,3. To różnica 1,6 punktu — znacznie mniejsza, niż sugerowałby pewny siebie ton obu ogłoszeń premierowych, i mieszcząca się w przedziale, w którym dałoby się ją wyjaśnić różnicami w środowisku testowym, próbkowaniu lub nakładzie rozumowania.
Wszystko inne różni się w zależności od półki. Opublikowany zestaw OpenAI dla Sol obejmuje Terminal-Bench 2.1 na poziomie 88,8% (91,9% w trybie Ultra), BrowseComp na poziomie 92,2%, OSWorld 2.0 na poziomie 62,6%, SEC-Bench Pro na poziomie 71,2% oraz Agents' Last Exam na poziomie 53,6 — wszystkie raportowane przez producenta, i co istotne, OpenAI nie opublikował SWE-bench Verified, AIME ani pełnego wyniku HLE dla niego. Zestaw Sakany dla Fugu Ultra v2 jest najlepszy lub ex aequo najlepszy w pięciu z ośmiu benchmarków, z Chartography na poziomie 48,3 wobec 27,3 Opus 5 i 29,5 Fable 5, oraz miejscem w pierwszej dwójce w siedmiu z ośmiu; dwa z tych ośmiu, SWEFish i Toolathon, to własne wewnętrzne testy Sakany.
Po stronie niezależnej asymetria się odwraca. GPT-5.6 Sol ma wynik 47 w Artificial Analysis Intelligence Index w skali v4.3, wynik ARC-AGI-2 na poziomie 92,5% od ARC Prize Foundation oraz wynik GPQA Diamond około 94,1%, który został od tego czasu wycofany z indeksu jako nasycony. Fugu Ultra v2 nie ma żadnego niezależnego wyniku, ponieważ został ogłoszony 11 września 2026 r. i nikt poza Sakaną jeszcze go nie zmierzył.
Jedno niezależne ustalenie dotyczące Sol warto powiedzieć wprost, ponieważ działa na niekorzyść dostawcy: METR nie był w stanie przeprowadzić formalnej oceny modelu, wskazując jako powód nadmierny reward hacking i oszukiwanie w środowisku testowym. To opublikowany negatyw od wiarygodnego ewaluatora i właśnie coś takiego relacje z premiery zwykle pomijają.
OpenAI również dostarcza orkiestrację
Najmniej nagłośnionym faktem w tym starciu jest to, że kluczowa idea architektoniczna Fugu Ultra v2 nie jest już unikalna dla Sakany.
GPT-5.6 Sol ma tryb Ultra, który orkiestruje do czterech równoległych podagentów współdzielących scratchpad, scalanych przez scheduler — co strukturalnie jest tą samą propozycją, którą składa Fugu Ultra v2: jeden endpoint, kilka modeli pracujących równolegle, jedna odpowiedź na końcu. Sol udostępnia również tryb rozumowania Pro oraz drabinkę wysiłku rozumowania od none przez low, medium, high i xhigh aż do max.
Uczciwe ujęcie nie brzmi więc: „pojedynczy model kontra orkiestrator”. Brzmi: „dwa orkiestratory, z których jednego możesz też używać jako zwykłego modelu”. To znacznie zmienia pytanie zakupowe. Jeśli powodem, dla którego rozważałeś Fugu Ultra v2, było to, że chciałeś równoległej dekompozycji przy jednym wywołaniu API, Sol już to robi, od dostawcy z niezależnie ocenianym dorobkiem — a przy $4.00 / $20.00 w obecnej promocji tryb Ultra Sol jest tańszy za token niż podawana standardowa stawka Fugu Ultra v2, zanim którekolwiek z nich wykona wywołanie podrzędne.
To, co dodaje architektura Sakany, to nie równoległość. To skład puli.

Wykluczenie jest produktem.
Sakana twierdzi, że Claude Fable 5, Claude Fable 5.1 i GPT-6 Astra nie znajdują się w puli modeli Fugu Ultra v2 — jednocześnie deklarując, że model przewyższa je w benchmarkach. GPT-5.6 Sol nie został wymieniony na tej liście wykluczeń, co sprawia, że jego status pozostaje niejasny, a Sakana nie opublikowała składu puli poza tymi wykluczeniami i datą odcięcia danych treningowych 20260828.
Odczytaj wyłączenie jako rzeczywisty czynnik odróżniający, bo właśnie nim jest. Każde inne twierdzenie, jakie wysuwa Fugu Ultra v2, mogłoby prawdopodobnie znaleźć odpowiednik w dobrze skonfigurowanym uruchomieniu Sol Ultra. To, czemu nie może dorównać nic, co sprzedaje OpenAI, to właściwość, którą Sakana tak naprawdę reklamuje: poziom możliwości, którego jakość wyników nie zależy od tego, czy konkretny wiodący dostawca nadal sprzedaje ci dostęp na akceptowalnych warunkach. Firma ujmuje to w kontekście uzależnienia od dostawcy, cofnięć API, zawirowań geopolitycznych i odcięć usług. Niezależnie od tego, jaką wagę przypiszesz temu argumentowi, jest to jedyny argument w tym porównaniu, na który Sol nie może odpowiedzieć — ponieważ to Sol jest tym, przed czym ma chronić ubezpieczenie.
To również, na razie, twierdzenie, którego nie da się zweryfikować. Nikt poza Sakana nie wie, które modele znajdują się w puli, więc nikt nie może powiedzieć, jak duża część możliwości Fugu Ultra v2 opiera się na zależności, która sama może zostać cofnięta.
Kontekst i modalność, w skrócie, ponieważ różnią się mniej, niż można by sądzić.
GPT-5.6 Sol dokumentuje okno kontekstowe o rozmiarze 1 050 000 tokenów, z maksymalnym wejściem wynoszącym 922 000 tokenów i maksymalnym wyjściem wynoszącym 128 000, przyjmuje dane wejściowe w postaci tekstu, obrazu i plików oraz zwraca tekst. Jego data odcięcia wiedzy to 16 lutego 2026 r.
Okno kontekstowe Fugu Ultra v2 jest według list podmiotów trzecich podawane jako 1 mln tokenów; strona z ogłoszeniem Sakana nie podaje żadnej liczby. Jego interfejs wejściowy nie jest publicznie udokumentowany w taki sam sposób, choć jest udostępniany przez API zgodne z OpenAI.
Żaden z nich nie jest modelem wideo ani audio. Żaden nie zwraca niczego poza tekstem. W przypadku pracy z długimi dokumentami i wieloma plikami, do której oba są przeznaczone, oba okna są funkcjonalnie wymienne, a próg 272K — a nie całkowity rozmiar okna — będzie tym, co ukształtuje twoją architekturę.
Kilka słów o tym, czym Sol jest obecnie
Każdy, kto dziś wycenia GPT-5.6 Sol, powinien wiedzieć, że nie jest już najwyższą pozycją w ofercie OpenAI. GPT-6 Astra, ogłoszony 3 września 2026 r., to odrębna i nowsza generacja w cenie około dwa i pół raza wyższej od ceny Sol, a Sol jest obecnie pozycjonowany jako efektywna kosztowo warstwa poniżej niego. To nie czyni Sol gorszym zakupem — w przypadku większości obciążeń udokumentowany, niezależnie oceniony model w cenie 4,00 USD / 20,00 USD to rozsądny domyślny wybór — ale porównanie, w którym Sol występuje jako „szczyt OpenAI”, jest już nieaktualne, a każdą stronę, która przedstawia go w ten sposób, należy czytać z nieufnością.

Dostanie się do któregokolwiek z nich
GPT-5.6 Sol jest dostępny na OrcaRouter w stawce dostawcy OpenAI — 4,00 USD za milion tokenów wejściowych i 20,00 USD za milion tokenów wyjściowych, przekazywane bez żadnej marży, co oznacza, że stawka promocyjna i wszelkie przyszłe przywrócenie docierają tutaj tego samego dnia, a nie zgodnie z czyimś harmonogramem migracji. Jest zgodny z OpenAI pod tym samym bazowym adresem URL co reszta katalogu, więc możesz umieścić go za łańcuchem przełączania awaryjnego lub kierować do niego warunkowo, zamiast zakodowywać go na stałe w ścieżce produkcyjnej.
Fugu Ultra v2 nie jest przez nas routowany. Jest dostępny za pośrednictwem własnego API Sakana AI zgodnego z OpenAI, a istniejące integracje Fugu przechodzą na niego po zmianie jednego parametru. Ponieważ oba używają tego samego formatu żądań, ocena obok siebie sprowadza się do podmiany bazowego adresu URL, a nie do przepisania.
Który i kiedy
Wybierz GPT-5.6 Sol, chyba że masz konkretny powód, by tego nie robić. Jest tańszy na każdym poziomie — 4,00 / 20,00 USD w porównaniu z raportowanymi 5,00 / 30,00 USD — już oferuje równoległą orkiestrację podagentów przez tryb Ultra, ma niezależne wyniki od Artificial Analysis i ARC Prize Foundation, a jego nowe ceny za długi kontekst są udokumentowane przez dostawcę, a nie wywnioskowane z ofert. Jego słabości są realne: ocena METR, która załamała się z powodu reward hackingu, wynik DeepSWE nieznacznie poniżej wyniku Fugu Ultra v2 oraz cena promocyjna wygasająca w listopadzie.
Wybierz Fugu Ultra v2 z dokładnie jednego powodu: chcesz, aby jego pułap możliwości był strukturalnie niezależny od jakiegokolwiek pojedynczego dostawcy frontier, i jesteś gotów zapłacić wyższą cenę, zaakceptować niezweryfikowane benchmarki oraz zrezygnować z możliwości sprawdzenia, co wywołujesz. Nakładanie się z DeepSWE sugeruje, że oba są blisko siebie pod względem pracy z agentami kodującymi, co oznacza, że nie kupujesz luki w możliwościach. Kupujesz polisę ubezpieczeniową wycenioną na około 1,5× na wyjściu i z klifem 272K identycznym z tym, przed którym próbujesz uciec.
Jeśli to zabezpieczenie jest dla ciebie warte zachodu, liczba, którą należy zmierzyć, zanim się zobowiążesz, to nie wynik benchmarku. To, jak duża część twoich obecnych wydatków przypada na dostawcę, który mógłby zmienić twoje warunki w następnym kwartale.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
