
Solar Mini 4 uzyskał 24 punkty w Artificial Analysis Index — i kosztuje pięć razy więcej za zadanie niż GPT-6 Luna
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 za 1 mln tokenów
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 za 1 mln tokenów · 159 tok/s
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 220 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Solar Mini 4 pobiera taką samą opłatę za token wejściowy jak GPT-6 Luna, a około pięć razy więcej za faktyczne ukończenie zadania. To cała historia pierwszej niezależnej ewaluacji nowego modelu Upstage — i nie jest to historia, którą opowiadały materiały premierowe. Solar Mini 4 zadebiutował 22 września 2026 r. jako rzadki model mieszaniny ekspertów o 35 miliardach parametrów, aktywujący około 3 miliardów parametrów na token, w cenie 0,10 USD za milion tokenów wejściowych i 0,40 USD za milion tokenów wyjściowych. GPT-6 Luna, poziom efektywności OpenAI, ma cennik 0,10 USD i 0,50 USD, z poziomem długiego kontekstu powyżej 272 000 tokenów, który mniej więcej podwaja obie stawki. W cenniku wyglądają jak ten sam zakup. W Indeksie Inteligencji Artificial Analysis, gdzie oba modele przeszły ten sam zestaw dziesięciu ewaluacji, Solar Mini 4 kosztuje 0,36 USD za ukończone zadanie w porównaniu z 0,07 USD dla GPT-6 Luna (max) — współczynnik 5,4, który wynika w całości z tego, jak oba modele zachowują się w trakcie zadania, a nie z tego, ile pobierają za token.
30 września 2026 r. Artificial Analysis opublikowało swoje opracowanie dotyczące tego modelu, który uzyskuje 24 punkty w Intelligence Index v4.3.2. Wszystko w tym artykule, co przypisuje się Artificial Analysis, jest pomiarem własnym tej organizacji; wszystko, co przypisuje się Upstage, jest twierdzeniem dostawcy. To rozróżnienie ma tu większe znaczenie niż zwykle, ponieważ te dwa zestawy liczb nie zawsze są zgodne.
Co tak naprawdę mówi niezależne uruchomienie

Solar Mini 4 plasuje się na poziomie 24,05 w Intelligence Index, przy medianie wynoszącej 12 wśród modeli rozumujących w jego przedziale cenowym. To stawia go znacznie powyżej średniej w jego klasie wagowej, a własne sformułowanie Upstage — „najwyższy ogólny wynik wśród modeli z 3 mld aktywnych parametrów w zestawieniu Artificial Analysis Intelligence Index” — przechodzi niezależne testy w tym konkretnym punkcie. Qwen3.6 35B A3B, który również aktywuje 3 mld parametrów, uzyskuje 18,2 w tym samym indeksie. K2 Horizon MoVA 36B A4B, z 4 mld aktywnych parametrów, uzyskuje 25,3 — i robi to przy krótszym kontekście, 524 tys. tokenów w porównaniu z 1,05 mln w Solar Mini 4. W zestawieniu z Inkling, modelem MoE z otwartymi wagami o 975 mld parametrów wydanym w lipcu, Solar Mini 4 osiąga 24,1 wobec 25,0 — w granicach jednego punktu od modelu niemal trzydzieści razy większego, który kosztuje $1,00/$4,05 za milion tokenów.
Profil wewnątrz tego wyniku jest nierówny, a nierówność jest tym, co użyteczne:
• Rozumowanie na długim kontekście to względna mocna strona. Solar Mini 4 osiąga 83% w AA-LCR v1.1, na poziomie MiniMax-M3 i GPT-6 Luna (max) oraz przed Gemini 3.8 Flash (high) i GPT-6 Astra (max) z 81%.
• Kodowanie naukowe trzyma poziom. 48% w SciCode, o jeden punkt przed MiniMax-M3 i Inkling (xhigh).
• Kodowanie agentowe się załamuje. 1% w Terminal-Bench 4.0. Nie „słabo" — 1%. W AutomationBench-AA, który realizuje wieloetapowe przepływy pracy w rzeczywistych aplikacjach SaaS, 22,3%.
• Dokładność wiedzy jest niska, ale model wie, że zgaduje. AA-Omniscience uzyskuje −11 przy 18% dokładności; model wstrzymuje się od odpowiedzi na około połowę pytań, które się mu zadaje. Jego wskaźnik niehalucynowania wynosi 64%, znacznie wyprzedzając Inkling (xhigh) z 32% i GPT-6 Luna (max) z 23%. Model, który w połowie przypadków mówi „nie wiem”, a gdy już odpowiada, ma rację w dwóch trzecich przypadków, to inne narzędzie niż model, który pewnie konfabuluje.
W przypadku agentowej pracy z wiedzą wyniki wynoszą 1072 Elo w GDPval-AA i 872 Elo w AA-Briefcase, oba zbliżone do Inkling (xhigh).
Pięciokrotna liczba, rozłożona
Wskaźnik kosztu na zadanie Artificial Analysis to ten, który rozstrzygnie większość rozmów zakupowych, i zasługuje na to, by czytać go jako rozbicie, a nie cytować jako nagłówek. Napędzają go dwie rzeczy.
Po pierwsze, objętość. Solar Mini 4 emituje około 88 300 tokenów wyjściowych na zadanie Intelligence Index; 71 600 z nich to tokeny rozumowania. Przy 0,40 USD za milion tokenów wyjściowych to około 0,035 USD z rachunku — tanio, bo wyjście jest tanie. Jego kosztem jest natomiast czas: przy zmierzonych 204 tokenach na sekundę Artificial Analysis odnotowuje 430 sekund pracy na przeciętne zadanie indeksu, czyli około 7,2 minuty. GPT-6 Luna (max) emituje 50 000 tokenów wyjściowych na zadanie przy 127 tokenach na sekundę i zajmuje 396 sekund. Inkling (xhigh), model o otwartych wagach liczący 975 miliardów parametrów, emituje 34 700 tokenów i kończy w 169 sekund. Solar Mini 4 jest wolniejszy od obu, ale w stopniu, który nie ma nic wspólnego z pięciokrotną różnicą w kosztach.
Po drugie — i to jest cała historia — wejście zapisywane do pamięci podręcznej. Analiza kosztów Artificial Analysis przypisuje około 0,30 USD z 0,36 USD na zadanie w Solar Mini 4 tokenom zapisywanym do pamięci podręcznej promptu, wobec 0,03 USD za odczyty z pamięci podręcznej, 0,035 USD za wyjście i błędu zaokrąglenia w przypadku wejścia rzeczywiście nieobjętego pamięcią podręczną. W przypadku GPT-6 Luna (max) zapis do pamięci podręcznej to 0,012 USD z 0,068 USD — około 17% rachunku, wobec 82% dla Solar Mini 4. Buforowane wejście to najtańsza pozycja w cenniku Upstage — 0,01 USD za milion — i model Artificial Analysis faktycznie z niej korzysta; problem polega na tym, ile trzeba zapisać, zanim będzie można to odczytać. Agent, który przy każdej turze ponownie wysyła rosnącą rozmowę, ponosi koszt zapisu znacznie częściej niż model, który odpowiada w krótkiej, zamkniętej turze.
To jest wniosek, który warto zabrać ze sobą do produkcji: w przypadku modelu takiego jak ten cena za token niemal nic nie mówi o rachunku za pojedyncze zadanie. Za to zachowanie pamięci podręcznej — owszem.
Gdzie własne liczby Upstage się różnią

Wpis Upstage ogłaszający premierę, opublikowany 1 października 2026 r. pod tytułem „Solar Mini 4: zbudowany do obsługi intensywnych obciążeń agentowych”, podaje wynik 24,1 w Artificial Analysis Intelligence Index — w praktyce tę samą liczbę — i zawiera kilka twierdzeń, które stoją obok niezależnych danych, a nie ponad nimi.
Dostawca podaje 22,3% w AutomationBench-AA, dokładnie pokrywając się z danymi Artificial Analysis, oraz 47,2 w τ³-Banking — benchmarku polityk i użycia narzędzi, który zestaw indeksów od tego czasu usunął. Podaje 83,3% w AA-LCR i 47,6% w SciCode — oba wyniki mieszczą się w granicach błędu zaokrąglenia względem niezależnych wyników. W Humanity's Last Exam podaje 19,6%, podczas gdy strona Artificial Analysis podaje 25,8% dla tego samego modelu; oba są wiarygodnymi odczytami notorycznie niestabilnej ewaluacji, ale nie są tą samą liczbą i żadnego z nich nie należy przedstawiać jako drugiego.
Dwie pozycje specyfikacji również się nie zgadzają. Upstage dokumentuje okno kontekstowe o rozmiarze 512K tokenów z maksymalnie 128K tokenów wyjściowych. Artificial Analysis podaje okno kontekstowe 1,0 mln tokenów i maksymalne wyjście 262K. Blog Upstage wyraźnie stwierdza, że liczba 512K to obowiązująca specyfikacja; ta rozbieżność to coś, co warto rozstrzygnąć, konfrontując ją z odpowiedzią API, zanim ktokolwiek zbuduje na tym potok wyszukiwania.
Dostawca wykonuje również jedyne porównanie, jakie może przeprowadzić na własnych zasadach: wewnętrzny test obejmujący trzy koreańskojęzyczne zadania agentowe uruchamiane trzykrotnie na model, w którym ukończenie 1000 zestawów trzech zadań kosztowało szacunkowo 1,25 USD w przypadku Solar Mini 4 i 2,20 USD w przypadku MiMo-V2.5. To test przeprowadzony przez dostawcę na wybranych przez dostawcę zadaniach, z wyłączeniem opóźnień, i wskazuje odwrotny kierunek niż wynik Artificial Analysis. Nie jest błędny — różne zadania angażują różne budżety tokenów — ale to liczba marketingowa, a opublikowana zniżka premierowa modelu to osobny powód, by ponownie przeliczyć własne liczby, zamiast przyjmować czyjekolwiek.
Cennik, zgodnie z aktualną dokumentacją konsoli Upstage: 0,10 USD za milion tokenów wejściowych, 0,01 USD za milion buforowanych tokenów wejściowych, 0,40 USD za milion tokenów wyjściowych, przy czym obecnie reklamowana zniżka premierowa wynosi 50% i obowiązuje do 22 października 2026 r. UTC, co do tego czasu daje efektywne stawki 0,05 USD, 0,005 USD za buforowane tokeny wejściowe i 0,20 USD za tokeny wyjściowe.
Co to oznacza, jeśli to ty płacisz
Ciekawą rzeczą w Solar Mini 4 nie jest to, że to zły model. Chodzi o to, że to naprawdę dobry mały model, którego ekonomika jest zdominowana przez zachowania, których cennik nie pokaże. Wynik 24 w indeksie przy trzech aktywnych parametrach to prawdziwe osiągnięcie inżynieryjne, a obciążenia w języku koreańskim — deklarowana mocna strona modelu, obok angielskiego i japońskiego — to dokładnie ten obszar, w którym ten wynik najprawdopodobniej będzie wart swojej ceny.
Kłopotliwa jest cała reszta po pierwszym wywołaniu. Długie tury asystenta, niskie ponowne wykorzystanie pamięci podręcznej i zadanie, którego dekodowanie zajmuje siedem minut na przebieg indeksowania, sumują się do liczby, która nijak nie przypomina $0.10/$0.40. Jeśli to oceniasz, uczciwym eksperymentem jest test kosztu na ukończone zadanie na własnym obciążeniu, z włączonym buforowaniem promptów w sposób, w jaki faktycznie używałby go Twój stos produkcyjny — a nie porównanie cen tokenów.
To również ta klasa problemów, do których rozwiązania istnieje router, i powód, dla którego OrcaRouter przekazuje ceny katalogowe dostawców bez marży, w wysokości 0%, dzięki czemu zmiana ceny u dostawcy trafia na Twoje rozliczenie jeszcze tego samego dnia. Nie routujemy modeli Upstage, więc ani Solar Mini 4, ani Solar Pro 4 nie są dostępne za naszym pośrednictwem — pochodzą one z własnego API Upstage oraz platform zewnętrznych. To, co routujemy, to druga połowa tego porównania: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash oraz ponad 200 innych modeli za jednym kluczem, co sprawia, że praktyczne jest utrzymywanie taniego i drogiego modelu przy tym samym zadaniu i pozwolenie, by automatyczne przełączanie awaryjne oraz routing na poziomie pojedynczego żądania zdecydowały, który z nich odpowie. Gdy różnica między dwoma modelami to pięciokrotna luka w koszcie na zadanie, której nie ujawnia żaden cennik, możliwość przeniesienia pojedynczego żądania między nimi ma większe znaczenie niż jakakolwiek tabela benchmarków.

Krótka wersja: Solar Mini 4 to nowy punkt Pareto, który Artificial Analysis wyznacza dla modeli poniżej trzech miliardów aktywnych parametrów, a jest on około pięć razy droższy za ukończone zadanie niż model o takiej samej cenie wejściowej w cenniku. Oba te stwierdzenia są prawdziwe, a to drugie jest tym, które pojawia się na fakturze.
