Wygenerowana karta tytułowa hero dla Solar Mini 4 z nagłówkiem „Solar Mini 4 — niezależny przebieg”, z podtytułem „Indeks Inteligencji 24 i około pięciokrotnie wyższy koszt na zadanie niż GPT-6 Luna” oraz dwiema plakietkami z napisami „Wydano 22 września 2026” i „Pierwsza ewaluacja strony trzeciej, 30 września 2026”.
Guides & Insights

Solar Mini 4 uzyskał 24 punkty w Artificial Analysis Index — i kosztuje pięć razy więcej za zadanie niż GPT-6 Luna

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Solar Mini 4 pobiera taką samą opłatę za token wejściowy jak GPT-6 Luna, a około pięć razy więcej za faktyczne ukończenie zadania. To cała historia pierwszej niezależnej ewaluacji nowego modelu Upstage — i nie jest to historia, którą opowiadały materiały premierowe. Solar Mini 4 zadebiutował 22 września 2026 r. jako rzadki model mieszaniny ekspertów o 35 miliardach parametrów, aktywujący około 3 miliardów parametrów na token, w cenie 0,10 USD za milion tokenów wejściowych i 0,40 USD za milion tokenów wyjściowych. GPT-6 Luna, poziom efektywności OpenAI, ma cennik 0,10 USD i 0,50 USD, z poziomem długiego kontekstu powyżej 272 000 tokenów, który mniej więcej podwaja obie stawki. W cenniku wyglądają jak ten sam zakup. W Indeksie Inteligencji Artificial Analysis, gdzie oba modele przeszły ten sam zestaw dziesięciu ewaluacji, Solar Mini 4 kosztuje 0,36 USD za ukończone zadanie w porównaniu z 0,07 USD dla GPT-6 Luna (max) — współczynnik 5,4, który wynika w całości z tego, jak oba modele zachowują się w trakcie zadania, a nie z tego, ile pobierają za token.

30 września 2026 r. Artificial Analysis opublikowało swoje opracowanie dotyczące tego modelu, który uzyskuje 24 punkty w Intelligence Index v4.3.2. Wszystko w tym artykule, co przypisuje się Artificial Analysis, jest pomiarem własnym tej organizacji; wszystko, co przypisuje się Upstage, jest twierdzeniem dostawcy. To rozróżnienie ma tu większe znaczenie niż zwykle, ponieważ te dwa zestawy liczb nie zawsze są zgodne.

Co tak naprawdę mówi niezależne uruchomienie

A scoreboard titled 'Solar Mini 4 — the scoreboard' with the rows: Intelligence Index 24.05 against a median of 12; Cost per index task $0.36 against GPT-6 Luna (max) at $0.07; Rate card $0.10 in / $0.01 cached / $0.40 out per 1M; Output per index task 88,300 tokens, 71,600 of them reasoning; Output speed 204 tokens per second and 430 seconds per index task; Context Upstage says 512K while Artificial Analysis lists 1.05M; Weakest result Terminal-Bench 4.0 at 1%.

Solar Mini 4 plasuje się na poziomie 24,05 w Intelligence Index, przy medianie wynoszącej 12 wśród modeli rozumujących w jego przedziale cenowym. To stawia go znacznie powyżej średniej w jego klasie wagowej, a własne sformułowanie Upstage — „najwyższy ogólny wynik wśród modeli z 3 mld aktywnych parametrów w zestawieniu Artificial Analysis Intelligence Index” — przechodzi niezależne testy w tym konkretnym punkcie. Qwen3.6 35B A3B, który również aktywuje 3 mld parametrów, uzyskuje 18,2 w tym samym indeksie. K2 Horizon MoVA 36B A4B, z 4 mld aktywnych parametrów, uzyskuje 25,3 — i robi to przy krótszym kontekście, 524 tys. tokenów w porównaniu z 1,05 mln w Solar Mini 4. W zestawieniu z Inkling, modelem MoE z otwartymi wagami o 975 mld parametrów wydanym w lipcu, Solar Mini 4 osiąga 24,1 wobec 25,0 — w granicach jednego punktu od modelu niemal trzydzieści razy większego, który kosztuje $1,00/$4,05 za milion tokenów.

Profil wewnątrz tego wyniku jest nierówny, a nierówność jest tym, co użyteczne:

• Rozumowanie na długim kontekście to względna mocna strona. Solar Mini 4 osiąga 83% w AA-LCR v1.1, na poziomie MiniMax-M3 i GPT-6 Luna (max) oraz przed Gemini 3.8 Flash (high) i GPT-6 Astra (max) z 81%.

• Kodowanie naukowe trzyma poziom. 48% w SciCode, o jeden punkt przed MiniMax-M3 i Inkling (xhigh).

• Kodowanie agentowe się załamuje. 1% w Terminal-Bench 4.0. Nie „słabo" — 1%. W AutomationBench-AA, który realizuje wieloetapowe przepływy pracy w rzeczywistych aplikacjach SaaS, 22,3%.

• Dokładność wiedzy jest niska, ale model wie, że zgaduje. AA-Omniscience uzyskuje −11 przy 18% dokładności; model wstrzymuje się od odpowiedzi na około połowę pytań, które się mu zadaje. Jego wskaźnik niehalucynowania wynosi 64%, znacznie wyprzedzając Inkling (xhigh) z 32% i GPT-6 Luna (max) z 23%. Model, który w połowie przypadków mówi „nie wiem”, a gdy już odpowiada, ma rację w dwóch trzecich przypadków, to inne narzędzie niż model, który pewnie konfabuluje.

W przypadku agentowej pracy z wiedzą wyniki wynoszą 1072 Elo w GDPval-AA i 872 Elo w AA-Briefcase, oba zbliżone do Inkling (xhigh).

Pięciokrotna liczba, rozłożona

Wskaźnik kosztu na zadanie Artificial Analysis to ten, który rozstrzygnie większość rozmów zakupowych, i zasługuje na to, by czytać go jako rozbicie, a nie cytować jako nagłówek. Napędzają go dwie rzeczy.

Po pierwsze, objętość. Solar Mini 4 emituje około 88 300 tokenów wyjściowych na zadanie Intelligence Index; 71 600 z nich to tokeny rozumowania. Przy 0,40 USD za milion tokenów wyjściowych to około 0,035 USD z rachunku — tanio, bo wyjście jest tanie. Jego kosztem jest natomiast czas: przy zmierzonych 204 tokenach na sekundę Artificial Analysis odnotowuje 430 sekund pracy na przeciętne zadanie indeksu, czyli około 7,2 minuty. GPT-6 Luna (max) emituje 50 000 tokenów wyjściowych na zadanie przy 127 tokenach na sekundę i zajmuje 396 sekund. Inkling (xhigh), model o otwartych wagach liczący 975 miliardów parametrów, emituje 34 700 tokenów i kończy w 169 sekund. Solar Mini 4 jest wolniejszy od obu, ale w stopniu, który nie ma nic wspólnego z pięciokrotną różnicą w kosztach.

Po drugie — i to jest cała historia — wejście zapisywane do pamięci podręcznej. Analiza kosztów Artificial Analysis przypisuje około 0,30 USD z 0,36 USD na zadanie w Solar Mini 4 tokenom zapisywanym do pamięci podręcznej promptu, wobec 0,03 USD za odczyty z pamięci podręcznej, 0,035 USD za wyjście i błędu zaokrąglenia w przypadku wejścia rzeczywiście nieobjętego pamięcią podręczną. W przypadku GPT-6 Luna (max) zapis do pamięci podręcznej to 0,012 USD z 0,068 USD — około 17% rachunku, wobec 82% dla Solar Mini 4. Buforowane wejście to najtańsza pozycja w cenniku Upstage — 0,01 USD za milion — i model Artificial Analysis faktycznie z niej korzysta; problem polega na tym, ile trzeba zapisać, zanim będzie można to odczytać. Agent, który przy każdej turze ponownie wysyła rosnącą rozmowę, ponosi koszt zapisu znacznie częściej niż model, który odpowiada w krótkiej, zamkniętej turze.

To jest wniosek, który warto zabrać ze sobą do produkcji: w przypadku modelu takiego jak ten cena za token niemal nic nie mówi o rachunku za pojedyncze zadanie. Za to zachowanie pamięci podręcznej — owszem.

Gdzie własne liczby Upstage się różnią

A screenshot of Upstage's Console documentation page for Solar Mini 4, showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate, the description of a cost-efficient compact language model at 35B total and 3B active parameters built for agentic use cases, English, Japanese and Korean language support, tool calling, a 128K max output, the platforms Upstage Console and on-premises, and the version string solar-mini4-260922 with a training data cut-off of February 2026.

Wpis Upstage ogłaszający premierę, opublikowany 1 października 2026 r. pod tytułem „Solar Mini 4: zbudowany do obsługi intensywnych obciążeń agentowych”, podaje wynik 24,1 w Artificial Analysis Intelligence Index — w praktyce tę samą liczbę — i zawiera kilka twierdzeń, które stoją obok niezależnych danych, a nie ponad nimi.

Dostawca podaje 22,3% w AutomationBench-AA, dokładnie pokrywając się z danymi Artificial Analysis, oraz 47,2 w τ³-Banking — benchmarku polityk i użycia narzędzi, który zestaw indeksów od tego czasu usunął. Podaje 83,3% w AA-LCR i 47,6% w SciCode — oba wyniki mieszczą się w granicach błędu zaokrąglenia względem niezależnych wyników. W Humanity's Last Exam podaje 19,6%, podczas gdy strona Artificial Analysis podaje 25,8% dla tego samego modelu; oba są wiarygodnymi odczytami notorycznie niestabilnej ewaluacji, ale nie są tą samą liczbą i żadnego z nich nie należy przedstawiać jako drugiego.

Dwie pozycje specyfikacji również się nie zgadzają. Upstage dokumentuje okno kontekstowe o rozmiarze 512K tokenów z maksymalnie 128K tokenów wyjściowych. Artificial Analysis podaje okno kontekstowe 1,0 mln tokenów i maksymalne wyjście 262K. Blog Upstage wyraźnie stwierdza, że liczba 512K to obowiązująca specyfikacja; ta rozbieżność to coś, co warto rozstrzygnąć, konfrontując ją z odpowiedzią API, zanim ktokolwiek zbuduje na tym potok wyszukiwania.

Dostawca wykonuje również jedyne porównanie, jakie może przeprowadzić na własnych zasadach: wewnętrzny test obejmujący trzy koreańskojęzyczne zadania agentowe uruchamiane trzykrotnie na model, w którym ukończenie 1000 zestawów trzech zadań kosztowało szacunkowo 1,25 USD w przypadku Solar Mini 4 i 2,20 USD w przypadku MiMo-V2.5. To test przeprowadzony przez dostawcę na wybranych przez dostawcę zadaniach, z wyłączeniem opóźnień, i wskazuje odwrotny kierunek niż wynik Artificial Analysis. Nie jest błędny — różne zadania angażują różne budżety tokenów — ale to liczba marketingowa, a opublikowana zniżka premierowa modelu to osobny powód, by ponownie przeliczyć własne liczby, zamiast przyjmować czyjekolwiek.

Cennik, zgodnie z aktualną dokumentacją konsoli Upstage: 0,10 USD za milion tokenów wejściowych, 0,01 USD za milion buforowanych tokenów wejściowych, 0,40 USD za milion tokenów wyjściowych, przy czym obecnie reklamowana zniżka premierowa wynosi 50% i obowiązuje do 22 października 2026 r. UTC, co do tego czasu daje efektywne stawki 0,05 USD, 0,005 USD za buforowane tokeny wejściowe i 0,20 USD za tokeny wyjściowe.

Co to oznacza, jeśli to ty płacisz

Ciekawą rzeczą w Solar Mini 4 nie jest to, że to zły model. Chodzi o to, że to naprawdę dobry mały model, którego ekonomika jest zdominowana przez zachowania, których cennik nie pokaże. Wynik 24 w indeksie przy trzech aktywnych parametrach to prawdziwe osiągnięcie inżynieryjne, a obciążenia w języku koreańskim — deklarowana mocna strona modelu, obok angielskiego i japońskiego — to dokładnie ten obszar, w którym ten wynik najprawdopodobniej będzie wart swojej ceny.

Kłopotliwa jest cała reszta po pierwszym wywołaniu. Długie tury asystenta, niskie ponowne wykorzystanie pamięci podręcznej i zadanie, którego dekodowanie zajmuje siedem minut na przebieg indeksowania, sumują się do liczby, która nijak nie przypomina $0.10/$0.40. Jeśli to oceniasz, uczciwym eksperymentem jest test kosztu na ukończone zadanie na własnym obciążeniu, z włączonym buforowaniem promptów w sposób, w jaki faktycznie używałby go Twój stos produkcyjny — a nie porównanie cen tokenów.

To również ta klasa problemów, do których rozwiązania istnieje router, i powód, dla którego OrcaRouter przekazuje ceny katalogowe dostawców bez marży, w wysokości 0%, dzięki czemu zmiana ceny u dostawcy trafia na Twoje rozliczenie jeszcze tego samego dnia. Nie routujemy modeli Upstage, więc ani Solar Mini 4, ani Solar Pro 4 nie są dostępne za naszym pośrednictwem — pochodzą one z własnego API Upstage oraz platform zewnętrznych. To, co routujemy, to druga połowa tego porównania: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash oraz ponad 200 innych modeli za jednym kluczem, co sprawia, że praktyczne jest utrzymywanie taniego i drogiego modelu przy tym samym zadaniu i pozwolenie, by automatyczne przełączanie awaryjne oraz routing na poziomie pojedynczego żądania zdecydowały, który z nich odpowie. Gdy różnica między dwoma modelami to pięciokrotna luka w koszcie na zadanie, której nie ujawnia żaden cennik, możliwość przeniesienia pojedynczego żądania między nimi ma większe znaczenie niż jakakolwiek tabela benchmarków.

A screenshot of the Artificial Analysis article dated September 30, 2026, headlined 'Korean AI Lab Upstage has released Solar Mini 4 which scores 24 on the Artificial Analysis Intelligence Index, but costs ~5x as much per task as GPT-6 Luna (max) despite similar per-token prices'. The visible key-results text covers the 3B-active Pareto claim, the 6-point lead over Qwen3.6 35B A3B at the same active size, 83% on AA-LCR v1.1 matching MiniMax-M3 and GPT-6 Luna (max), 48% on SciCode, and fast output at 208 tokens per second with slow tasks.

Krótka wersja: Solar Mini 4 to nowy punkt Pareto, który Artificial Analysis wyznacza dla modeli poniżej trzech miliardów aktywnych parametrów, a jest on około pięć razy droższy za ukończone zadanie niż model o takiej samej cenie wejściowej w cenniku. Oba te stwierdzenia są prawdziwe, a to drugie jest tym, które pojawia się na fakturze.