
Fugu Max kontra Kimi K3: Sakana wybrała ten wzorzec, więc przeczytajmy go
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Premiera Fugu Max od Sakana AI wymienia dokładnie trzy modele, aby uzasadnić swoją politykę cenową, a Kimi K3 od Moonshot AI jest jednym z nich. Twierdzenie jest takie, że stawka za tokeny wyjściowe Fugu Max jest o 40 do 60 procent niższa niż tych trzech, co czyni Kimi K3 — a nie Grok 4.6, nie Qwen3.8-Max — punktem odniesienia, który sama Sakana wybrała pod względem wartości. To niezwykle hojny gest ze strony dostawcy: wręcza ci miarkę i mówi, gdzie ją przyłożyć. Więc ta strona robi oczywistą rzecz i przykłada ją. Fugu Max został wydany 11 września 2026 roku w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych. Kimi K3 figuruje w cenniku za 3,00 USD i 15,00 USD. Twierdzenie o 60 procentach w przypadku tokenów wyjściowych jest arytmetycznie poprawne. Czego zdanie nie wspomina, to to, że model, którego cenę się podcina, publikuje pełny zapis niezależnie zmierzonych wyników, a model, który podcina, nie publikuje żadnych.
Zdanie o 40–60 procentach pod lupą
• Wejście — Fugu Max 2,00 USD za 1 mln tokenów vs Kimi K3 3,00 USD za 1 mln tokenów, co daje oszczędność 33 procent, a nie 40–60 procent, którymi chwali się komunikat
• Wyjście — Fugu Max 6,00 USD za 1 mln tokenów vs Kimi K3 15,00 USD za 1 mln tokenów, co jest o 60 procent poniżej górnej granicy podanego zakresu Sakana
• Wejście z pamięci podręcznej — Fugu Max 0,25 USD za 1 mln tokenów vs Kimi K3 0,30 USD za 1 mln tokenów; różnica jest tak mała, że pętle intensywnie korzystające z pamięci podręcznej jej nie zauważą
• Okno kontekstowe — Fugu Max: w komunikacie nie podano wartości vs Kimi K3: 1 048 576 tokenów
• Ponowna wycena długich promptów — w przypadku Fugu Max nie podano żadnego progu, a Kimi K3 ma stałą stawkę w całym oknie, bez dopłaty przy dowolnej długości
• Wdrażanie — Fugu Max wyłącznie przez API dostawcy, przynależność do puli nieujawniona vs Kimi K3 wagi do pobrania na licencji Kimi K3
• Niezależna ocena — Fugu Max: brak; nie istnieje też żadna strona Artificial Analysis dla żadnego modelu Fugu, w przeciwieństwie do Kimi K3, który ma Indeks Inteligencji Artificial Analysis na poziomie 44 i standaryzowany wynik 93,40% w SWE-bench Verified od Vals AI
Zwróć uwagę na kształt tego pierwszego wiersza. Zakres z nagłówka, od 40 do 60 procent, to rozpiętość między trzema wymienionymi z nazwy konkurentami, a Kimi K3 jest tym, który daje te 60. Przy samym wejściu porównanie wynosi 33 procent, co nadal jest realną oszczędnością, ale to już inne zdanie. To nie jest krytyka cen — 2,00 USD i 6,00 USD to naprawdę niskie liczby dla systemu, który twierdzi, że osiąga wyniki zbliżone do czołówki. To uwaga o tym, która liczba w komunikacie przekonuje, i o tym, jak akapit jest wokół niej ułożony.
Kimi K3 jest w naszym katalogu w cenie samego Moonshot — 3,00 USD za milion tokenów wejściowych, 0,30 USD przy trafieniu w cache, 15,00 USD za milion tokenów wyjściowych — przekazywanej bez marży (0%), więc jeśli Moonshot zmieni cennik, nowa stawka obowiązuje na tym samym kluczu tego samego dnia, a nie dopiero w kolejnym cyklu migracji. Ma to tu większe znaczenie niż zwykle, ponieważ obniżka ceny po stronie dostawcy jest dokładnie tym, co osłabia lub poszerza 60-procentową różnicę, na której opiera się całe to starcie.
Co publikuje wzorzec
Wyniki Kimi K3 są przeciwieństwem skąpych. We własnej karcie modelu Moonshot podaje Terminal-Bench 2.1 z wynikiem 88,3, GPQA Diamond z 93,5, HLE-Full z 43,5, a z narzędziami do 56,0, SWE-Marathon z 42,0, OSWorld-Verified z 84,8, MCPMark-Verified z 94,5 i DeepSWE z 67,5. Wszystkie dane raportowane przez dostawcę, a jest ich dużo.
Istnieje również warstwa niezależna, która ma znaczenie dla tego porównania. Artificial Analysis przyznaje Kimi K3 ocenę 44 w Indeksie Inteligencji v4.3 — drugie miejsce wśród modeli o otwartych wagach, za GLM-5.3 z wynikiem 45 — przy zarejestrowanej przepustowości 37,9 tokena wyjściowego na sekundę i czasie do pierwszego tokena wynoszącym 3,80 sekundy. Standaryzowany zestaw testów agentowych Vals AI daje mu 93,40% w SWE-bench Verified, za Claude Opus 5 i DeepSeek V4 Pro, ale blisko. Prowadzi również w Frontend Code Arena z 1679 punktami Elo, przed Claude Fable 5 z 1631 i GPT-5.6 Sol z 1618. Jedno zastrzeżenie: jeśli widziałeś Kimi K3 podawany z wynikiem 57 lub 60 w Indeksie Inteligencji, są to wartości sprzed korekty, pochodzące z okresu przed ponowną kalibracją skali przez Artificial Analysis we wrześniu 2026 roku, i nie należy ich przytaczać razem z aktualnymi liczbami.
Jest też sygnał użycia i pochodzi z naszej własnej bramy, a nie z czyjegokolwiek marketingu: Kimi K3 przepuścił przez OrcaRouter około 3,27 miliarda tokenów w ciągu ostatnich siedmiu dni, co stanowi największy ruch spośród wszystkich modeli w tym porównaniu. To nie jest pomiar jakości. To duża próbka tego, po co programiści sięgają, gdy jedynym kosztem wyboru jest cena tokena, i mówi, że stałe okno 1M oraz otwarte wagi zdobyły już znaczący udział w rzeczywistej pracy długoterminowej.

Tablica wyników, na której nie ma liczb
Sakana podaje, że Fugu Max uzyskuje najlepszy ogólny wynik w sześciu benchmarkach: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench i SWEFish. Stwierdza również, że Max rozszerza granicę Pareto koszt–wydajność w siedmiu z dziesięciu benchmarków. Oba stwierdzenia dotyczą pozycji na wykresie. Żadne z nich nie zawiera obok siebie wartości, marginesu ani wyniku konkurenta.
Te dwie listy ledwie się stykają, co jest praktycznym problemem. Kimi K3 podaje dla Terminal-Bench 2.1 wynik 88,3; Sakana twierdzi, że Fugu Max jest najlepszy ogółem w Terminal Bench 2.1, i nie podaje niczego, co można by z tym porównać. Ten pojedynczy wiersz to najczystsza ilustracja całego starcia: obaj dostawcy wymieniają ten sam test, jeden podaje liczbę, a drugi podaje słowo „best”. Dopóki Sakana nie opublikuje tej liczby, żadne opublikowane dowody nie odpowiadają na pytanie, czy Fugu Max pokonuje Kimi K3 w benchmarku, który Sakana postanowiła wysunąć na pierwszy plan.
Warto przedstawić uczciwy sposób odczytania tej premiery. Fugu Max to poziom kosztowy — wydany tego samego dnia co Fugu Ultra v2, który stawia na możliwości w cenie 5,00 USD za wejście i 30,00 USD za wyjście — a jego argument opiera się na wykresie Pareto, na którym tezą jest wynik na dolara, a nie sam wynik. W takim ujęciu sam wynik benchmarku byłby mniej uczciwą statystyką. Problem w tym, że premiera pomija także mianownik: własne materiały Sakany przyznają, że przełączanie modeli w trakcie zadania może ograniczyć ponowne wykorzystanie pamięci podręcznej kontekstu i generować dodatkowe tokeny orkiestracji, oraz potwierdzają, że firma nie ujawniła współczynnika trafień pamięci podręcznej modelu Fugu Max ani całkowitego kosztu tokenów na zadanie. Tak więc jedyny pomiar, który rozstrzygnąłby argument o poziomie kosztowym, to ten, którego nie dostarczono.
Ciężary, które możesz trzymać, albo basen, którego nie możesz zobaczyć
W tym miejscu te dwa produkty przestają być w ogóle porównywalne.
Kimi K3 udostępnia wagi do pobrania, co stanowi prawdziwą furtkę: jeśli ceny lub warunki się zmienią, model można uruchomić na własnej infrastrukturze. Licencja jest węższa, niż zwykle sugeruje określenie „otwarte wagi”. To Licencja Kimi K3, a nie zatwierdzona przez OSI licencja, a często powtarzany opis jej jako zmodyfikowanego MIT jest kwestionowany. Warunki wymagają odrębnej umowy z Moonshot w przypadku firm świadczących usługi modelu jako usługi o przychodach powyżej 20 mln USD w dowolnych dwunastu kolejnych miesiącach, a także oznaczenia autorstwa dla produktów powyżej 100 mln użytkowników miesięcznie lub 20 mln USD miesięcznego przychodu, przy czym użytek wewnętrzny jest zwolniony. A skala w praktyce jest realna: checkpoint ma około 1,5 terabajta, a Moonshot zaleca 64 lub więcej akceleratorów, więc samodzielne hostowanie to decyzja o klastrze inferencyjnym, a nie o laptopie.
Fugu Max nie oferuje nic z tych rzeczy — żadnych wag, żadnej puli możliwej do zbadania, żadnej opcji samodzielnego hostowania — a w zamian nie narzuca żadnego warunku licencyjnego, ponieważ nie ma czego licencjonować. Deklarowaną korzyścią Sakany jest odwrotność kontroli: pula obejmująca modele open-weight i wyspecjalizowane, rozszerzona dla Max o rodzinę NVIDIA Nemotron, oznacza, że żaden pojedynczy dostawca upstream — przez wycofanie lub zmianę ceny — nie może pogrążyć twojego produktu. To prawdziwe zabezpieczenie. Jest ono także niemożliwe do zweryfikowania z zewnątrz, ponieważ skład celowo nie jest publikowany, a to oznacza, że wynik Fugu Max ma termin ważności, którego wynik Kimi K3 nie ma.
Otwarte wagi i nieujawniona pula to dwie różne odpowiedzi na ten sam lęk. Jedna mówi, że możesz odejść. Druga mówi, że nie ma czego opuszczać.
Gdzie płaskie okno to rozstrzyga
Kontekst Kimi K3 wynoszący 1 048 576 tokenów jest jednolity — brak poziomu długiego kontekstu, brak dopłaty niezależnie od długości. W informacji o wydaniu Fugu Max nie podano żadnego okna, więc nie ma z czym go porównać ani na czym oprzeć planowania. W przypadku długoterminowego kodowania agentowego, na które nastawione są oba produkty, gdzie sesje spędzają większość życia głęboko w kontekście, ta asymetria ma większe znaczenie niż cennik.
Szybkość jest lustrzanym odbiciem tego samego problemu. Dla Kimi K3 zmierzono 37,9 tokena na sekundę przy 3,80 sekundy do pierwszego tokenu i jest to wolne — co naprawdę stanowi ograniczenie dla modelu zbudowanego wokół długich pętli, a Artificial Analysis wskazuje, że jest on wyraźnie rozwlekły. Sakana nie publikuje żadnej wartości opóźnienia ani przepustowości dla Fugu Max, co w przypadku orkiestratora można uznać raczej za uczciwe niż za wymijające: czas odpowiedzi zależy od tego, które modele wybierze i ile przebiegów wykona. Oznacza to jednak, że nie można modelować kosztu przełączenia w czasie zegarowym bez samodzielnego zmierzenia go. W przypadku wcześniejszego Fugu Ultra użytkownicy publicznie zgłaszali uruchomienia ciągnące się do blisko 30 minut. To model z czerwca 2026 r., a nie dowód dotyczący Maxa, ale to liczba, którą trzeba pobić podczas benchmarku.

Werdykt, w ujęciu samej Sakany
Sakana wybrała Kimi K3 jako jeden z trzech modeli, które Fugu Max przebija cenowo, a w przypadku stawki za output twierdzenie się broni: 6,00 USD wobec 15,00 USD to 60 procent mniej, dokładnie górna granica podanego zakresu. Biorąc komunikat za dobrą monetę, Fugu Max jest tańszym produktem.
Teraz zastosuj tę miarę, której uniknęło wydanie. Kimi K3 jest o 33 procent droższy za tokeny wejściowe i o 150 procent droższy za tokeny wyjściowe — a za te pieniądze daje ci okno 1 mln tokenów bez klifu zmiany ceny, możliwy do pobrania checkpoint na licencji uwarunkowanej przychodem, niezależne 44. miejsce w Intelligence Index, standaryzowany wynik 93,40% w SWE-bench Verified, pierwsze miejsce w Frontend Code Arena i największy rzeczywisty ruch spośród wszystkich modeli w tym porównaniu. Fugu Max daje ci niższą stawkę po obu stronach tokenu, sześć nieokreślonych liczbowo zwycięstw w benchmarkach, stawkę za cache o połowę niższą niż w K3, bez opublikowanego wskaźnika trafień, oraz pulę, której nie możesz sprawdzić.
Uczciwy wniosek jest taki, że Sakana wybrała miarkę, która stawia ją w korzystnym świetle pod względem ceny, i nie dała ci niczego, na podstawie czego mógłbyś zweryfikować jej możliwości. Jeśli twoje obciążenie ma duży wolumen, a twoje zadania są takiego rodzaju, że koordynator może je niezawodnie rozłożyć na części, różnica w stawce to realne pieniądze, a Fugu Max zasługuje na pilotaż o ograniczonym zakresie z rozliczaniem tokenów włączonym od pierwszego żądania. Jeśli potrzebujesz decyzji produkcyjnej, której możesz bronić w tym kwartale — okna, względem którego możesz planować, wyniku, na który możesz wskazać, i modelu, który mógłbyś nadal uruchamiać, gdyby dostawca zniknął — odpowiedzią jest Kimi K3, dostępny w OrcaRouter w cenie katalogowej Moonshot, ze stawką dostawcy przekazywaną bez zmian.

