
Solar Mini 4 vs MathForm 8B: jeden model odpowiada na pytanie, drugi umożliwia jego sprawdzenie
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 za 1 mln tokenów
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 za 1 mln tokenów · 159 tok/s
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 220 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Postaw Solar Mini 4 obok MathForm 8B, a porównujesz dwa modele, które nie konkurują o ten sam token. Solar Mini 4 to opracowany przez Upstage rzadki model mieszanki ekspertów o 35 miliardach parametrów, wydany 22 września 2026 roku, z około 3 miliardami parametrów aktywnych na token, który odpowiada na pytania: przeczytaj długi dokument, przeprowadź nad nim rozumowanie, zwróć pisemny wynik. MathForm 8B to opracowany przez OpenBMB 8-miliardowy autoformalizator, opublikowany 14 sierpnia 2026 roku na licencji Apache 2.0, który robi coś, czego żaden model rozumujący nie robi wcale — bierze matematyczne stwierdzenie w języku naturalnym i przepisuje je jako twierdzenie Lean 4, które kompilator asystenta dowodzenia sprawdzi pod względem typów. Jeden produkuje odpowiedzi. Drugi produkuje pytania weryfikowalne maszynowo, a ten drugi jest rzadszym towarem.
Porównanie i tak ma sens, ponieważ oba trafiają do tego samego rodzaju potoku przetwarzania, a ich przeciwne mocne strony sprawiają, że wybór jest wyjątkowo klarowny. Model Upstage jest mocny w długich dokumentach, słaby w trudnym rozumowaniu i kosztowny w przeliczeniu na ukończone zadanie. Model OpenBMB jest wąski do tego stopnia, że poza swoją niszą staje się bezużyteczny, nigdy nie został oceniony przez niezależnego ewaluatora, a jego uruchomienie nic nie kosztuje, gdy masz GPU.
Obok siebie, w kwestiach, które się różnią
• Co to jest — Solar Mini 4 to ogólny model rozumujący z kontekstem 1 mln tokenów (512K według dokumentacji samego Upstage) i zmierzonym wynikiem 24,1 w Artificial Analysis Intelligence Index. MathForm 8B to jednozadaniowy autoformalizator bez opublikowanego wyniku w indeksie, bez niezależnej oceny i bez twierdzeń o ogólnych możliwościach.
• Parametry — łącznie 35B / 3B aktywnych, rzadki, dla Solar Mini 4; 8,19B gęsty dla MathForm 8B, dostrojony z Qwen3-8B na korpusie FormalVerse OpenBMB zawierającym około 367 000 zweryfikowanych przykładów Lean 4.
• Licencja i dostarczanie — Solar Mini 4 jest własnościowy, dostępny poprzez API Upstage i platformy firm trzecich. MathForm 8B to wagi Apache-2.0 z szablonem czatu, czterema shardami safetensors i ścieżką wdrożenia w Transformers, vLLM lub SGLang za endpointem zgodnym z OpenAI.
• Cena — Solar Mini 4 w cenie $0,10 / $0,01 za tokeny z pamięci podręcznej / $0,40 za milion tokenów, obecnie 50% zniżki do 22 października 2026 r. MathForm 8B nie ma cennika; jego koszt to GPU, na którym go uruchomisz.
• Szybkość — 204 tokeny wyjściowe na sekundę dla Solar Mini 4 w środowisku testowym Artificial Analysis, przy 88 300 tokenach wyjściowych na zadanie indeksowe i około 430 sekundach pracy na zadanie. Wynik MathForm 8B to pojedynczy nagłówek twierdzenia w Lean 4, co najwyżej kilkaset tokenów.
• Niezależność jego liczb — Solar Mini 4 został uruchomiony przez stronę trzecią. MathForm 8B nie: każda liczba w jego pracy pochodzi od samych autorów, a model jest zbyt nowy i zbyt specjalistyczny, by doczekać się niezależnego uruchomienia.
Gdzie dwa modele się spotykają, a gdzie nie

Tryby awarii sprawiają, że to zestawienie jest interesujące, ponieważ są swoimi dokładnymi przeciwieństwami. Najsłabszy opublikowany wynik Solar Mini 4 to Terminal-Bench 4.0 na poziomie 1%, a AutomationBench-AA na poziomie 22,3% — słabo radzi sobie z weryfikowaniem własnej pracy w środowisku, które daje mu informację zwrotną. Cała przesłanka projektowa MathForm 8B to weryfikacja: OpenBMB rozróżnia kontrolę składni (Syntax Check), która pyta, czy stwierdzenie w Lean 4 się kompiluje, od kontroli spójności (Consistency Check), która pyta, czy stwierdzenie, które zostało skompilowane, faktycznie znaczy to samo co problem nieformalny. Klasyczny błąd, któremu ma zapobiegać, to stwierdzenie, które przechodzi kontrolę typów, a jednocześnie po cichu osłabia tezę.
To jest prawdziwa różnica i warto być precyzyjnym. Model rozumowania tworzący dowód ma dobrze znany problem samoweryfikacji: nic w procesie generowania nie mówi, czy odpowiedź jest poprawna. Kompilator tak. Jeśli twój przepływ pracy polega na przekształcaniu banku zadań w coś, co maszyna może sprawdzić, MathForm 8B wykonuje połowę zadania, którego Solar Mini 4 nie potrafi wykonać w ogóle, a to, co pozostaje, nie jest kwestią stopnia.
Liczby dostawcy, określane tym mianem: praca OpenBMB podaje średnią Pass@8 na poziomie 88,06% w ramach kontroli składni i 72,37% w ramach kontroli spójności w sześciu benchmarkach oraz twierdzi, że wyniki te przebijają kilka wyspecjalizowanych autoformalizatorów 32B. Żadnej z tych wartości nie odtworzyła niezależna strona trzecia. Spadek o 16 punktów między tymi dwoma kontrolami jest bardziej pouczającą liczbą — mierzy, jak często skompilowane twierdzenie nie do końca odpowiada problemowi, o który pytano, i dlatego kontrola spójności istnieje jako osobna kolumna.
Dlaczego zespół miałby uruchamiać oba
Ponieważ naturalny potok ma tani etap o dużej przepustowości i drogi etap o małej przepustowości. MathForm 8B działa na twoim własnym sprzęcie i przekształca nieformalne problemy w nagłówki Lean 4, a dostępny kompilator pozwala odrzucić błędne wyniki, zanim zobaczy je człowiek. Solar Mini 4 zajmuje się tym, co dzieje się wokół tego: czytaniem pracy towarzyszącej, wyodrębnianiem założeń, podsumowywaniem wyniku po koreańsku lub angielsku oraz kierowaniem pracą. Te dwa nigdy nie konkurują o to samo żądanie, a mniejszy z nich odpowiada za część zadania, która ma obiektywny sygnał zaliczenia/niepowodzenia.
Nie możemy kierować do ciebie żadnego z tych modeli — modele Upstage nie są dostępne w OrcaRouter, a modele OpenBMB również nie — więc jeśli chcesz Solar Mini 4, pochodzi on z własnego API Upstage, a jeśli chcesz MathForm 8B, pochodzi on z Hugging Face i z twojego własnego GPU. Możemy natomiast umieścić resztę tego pipeline'u za jednym kluczem: ponad 200 modeli z 0% narzutu względem ceny katalogowej dostawcy, automatyczne przełączanie awaryjne między dostawcami i DSL do routingu, który pozwala łączyć modele w jedno wywołanie. W przepływie pracy, w którym mały specjalista wykonuje krok formalizacji, a duży generalista robi wszystko wokół niego, możliwość zmiany generalisty poprzez edycję ciągu znaków modelu — zamiast wdrażania nowej integracji — to różnica między dwutygodniową zmianą a popołudniem.

Co zabrać ze sobą
Jeśli twoje pytanie brzmi: „którego z nich powinienem użyć”, szczera odpowiedź jest taka, że zależy to od tego, czy potrzebujesz odpowiedzi, czy formalizacji, i żaden benchmark tego nie rozstrzygnie. Jeśli twoje pytanie brzmi: „czy MathForm 8B jest wart pobrania”, odpowiedź brzmi: tak — do jednego wąskiego zadania, a nie — do czegokolwiek innego; to formalizator, a nie program dowodzący, a zobowiązanie dowodowe pozostaje otwarte w generowanym przez niego wyniku. Jeśli twoje pytanie brzmi: „czy Solar Mini 4 jest wart 0,36 USD za zadanie”, odpowiedź brzmi: tak — w przypadku długich dokumentów przy dużej skali, a nie — w przypadku wszystkiego, co wymaga, by sprawdzał własną pracę.

Źródła, na zakończenie. Każda wartość Solar Mini 4 podana powyżej pochodzi z niezależnego pomiaru Artificial Analysis, z wyjątkiem okna kontekstowego, które jest własną wartością Upstage i nie zgadza się z ich wartością. Każda wartość MathForm 8B jest podana przez dostawcę na podstawie arXiv 2608.14221 i nie została odtworzona, a jego premiera nie została zapowiedziana — wagi, zbiór danych FormalVerse i artykuł pojawiły się 14 sierpnia 2026 r., bez wpisu na blogu dostawcy i bez niezależnego przebiegu testu porównawczego do dziś.
