
Intern-Decision-0.8B vs MathForm 8B: Jeden z nich potrafi sprawdzić własną pracę
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 592 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Najbardziej użytecznym pytaniem, jakie możesz zadać o dowolnym małym modelu specjalistycznym, jest to, kto go sprawdza. Intern-Decision-0.8B i MathForm 8B istnieją, ponieważ model ogólny został dostrojony do wąskiego zastosowania; oba są pochodnymi wag Qwen na licencji Apache-2.0 i oba zostały udostępnione na Hugging Face bez kampanii marketingowej — ale znajdują się po przeciwnych stronach granicy, która decyduje o tym, jak byś je wdrożył. MathForm 8B to 8B model autoformalizacji od OpenBMB, wydany 14 sierpnia 2026 r., który tłumaczy matematykę w języku naturalnym na Lean 4 i przekazuje wynik kompilatorowi, a ten albo go akceptuje, albo nie. Intern-Decision-0.8B to 852 985 920-parametrowa głowica decyzyjna od InternLM, wgrana 26 września 2026 r., która zwraca skalibrowany rozkład prawdopodobieństwa dla opcji podanych wcześniej — i nic na świecie niezależnie nie weryfikuje, czy zwracana etykieta jest poprawna. Jeden z tych modeli generuje wynik z dowodem. Drugi generuje wynik z oceną pewności, a różnica w tym, co można zrobić z tymi dwiema rzeczami, stanowi cały artykuł.
To ujęcie wyjaśnia również, dlaczego luka w rozmiarze — 8B przeciw 0,8B, czynnik dziesięciu — jest najmniej interesującą liczbą w tym porównaniu. Żaden z modeli nie stara się być dobry w tym, co robi drugi, a ocena żadnego z nich nie mówi nic o drugim. Łączy je wzorzec wydania i linia Qwen, a oba te czynniki mają mniejsze znaczenie niż kwestia weryfikacji.
Czym każdy z nich właściwie jest
MathForm 8B jest dostarczonym artefaktem dwuetapowego przepisu opisanego w pracy MathForm: Skalowanie autoformalizacji matematycznej za pomocą wyszukiwania wiedzy i dopracowania kierowanego weryfikacją (arXiv 2608.14221). Planer wyszukiwania pobiera odpowiednie definicje i istniejące formalizacje z Mathlib przed uruchomieniem generatora; wygenerowane stwierdzenia są następnie poprawiane na podstawie diagnostyki kompilatora i informacji zwrotnych o spójności semantycznej; powstały korpus, FormalVerse, zawiera około 367 000 zweryfikowanych przykładów Lean 4; a MathForm 8B jest trenowany na nim poprzez nadzorowane dostrajanie, a następnie uczenie ze wzmocnieniem, wykorzystując kompilację Lean i sygnały spójności semantycznej jako nagrodę. Jest to model wyłącznie tekstowy oparty na Qwen3-8B, obsługiwany przez Transformers, vLLM lub SGLang z API zgodnym z OpenAI, z zalecaną długością kontekstu 16 384 tokenów i maksymalnym budżetem generowania 16 384 tokenów. Jego potok oceny, pliki benchmarków i skrypty Pass@k znajdują się w repozytorium GitHub OpenBMB, a zbiór danych treningowych jest publiczny.
Intern-Decision-0.8B to dostarczony artefakt przepisu, którego nikt nie opisał. Karta modelu mówi, że jest to „multimodalny ustrukturyzowany model decyzyjny dostrojony z Qwen3.5-0.8B”, i na tym się kończy — brak opisu danych, brak procedury treningowej, brak artykułu, brak repozytorium. To, co dokumentuje szczegółowo, to kontrakt wnioskowania. Dołączony silnik mapuje opcje każdego pytania na symbole pojedynczych tokenów, renderuje szkielet z jednym <decision> jako elementem zastępczym na pole, wykonuje jeden przyczynowy przebieg w przód, odczytuje logity na pozycji przed każdym elementem zastępczym, wykonuje softmax tylko po dozwolonych symbolach tego pola, stosuje dopasowaną kalibrację i mapuje symbole z powrotem na wartości twoich opcji. Nie ma generate() wywołania i nigdzie w tej ścieżce nie ma próbkowania. Przyjmuje tekst oraz maksymalnie osiem obrazów, obsługuje od jednego do szesnastu pytań, każde z maksymalnie 62 opcjami i odrzuca dane wejściowe powyżej 8 192 tokenów, zamiast je obcinać. Domyślna temperatura kalibracji wynosi 2,747760550703, dopasowywana dla każdego punktu kontrolnego przez minimalizację NLL na 1 728 przypadkach.
Przeczytaj te dwa akapity obok siebie, a asymetria jest uderzająca. MathForm 8B ma artykuł, zbiór danych, potok ewaluacyjny i repozytorium. Intern-Decision-0.8B ma opis API i tabelę benchmarków.
Asymetria weryfikacji, która jest sednem sprawy
Wynik MathForm 8B można sprawdzić za pomocą czegoś innego niż człowiek. Model emituje Lean 4, a Lean 4 albo się kompiluje, albo nie. Liczby OpenBMB podano w dwóch reżimach właśnie z tego powodu: Pass@8 na poziomie 88,06% w ramach Syntax Check, co oznacza, że wynik się kompiluje, oraz 72,37% w ramach Consistency Check, co oznacza, że się kompiluje i kontrola spójności semantycznej potwierdza, że sformułowanie formalne oznacza to samo, co przekazywało sformułowanie nieformalne. Obie wartości to średnie z sześciu testów porównawczych, a w artykule podano również wskaźniki zdawalności CC wynoszące 63% dla FATE-H i 37% dla trudniejszych podzbiorów FATE-X, wraz z twierdzeniem, że przewyższa to wyspecjalizowane autoformalizatory 32B. Są to dane raportowane przez dostawcę — testy przeprowadziła firma OpenBMB — ale cecha, która ma znaczenie, jest strukturalna, a nie statystyczna: system niższego szczebla wykorzystujący wynik MathForm 8B może odrzucić złe sformalizowanie, nie prosząc modelu o jego ocenę. Kompilator jest wyrocznią.
Intern-Decision-0.8B ma kontrakt typu i nie ma wyroczni. Kształt wyjścia jest gwarantowany — pole zadeklarowane jako choice zwraca rozkład po wymienionych wartościach opcji, score zwraca ważoną prawdopodobieństwem wartość oczekiwaną na podstawie twojej rubryki, noul zwraca prawdopodobieństwo odpowiedzi „tak”. Nic poza modelem nie może powiedzieć, czy argmax był poprawny. Wartość pewności to własna ocena modelu dotycząca jego własnej poprawności, a praca kalibracyjna karty to uczciwa próba nadania tej ocenie znaczenia — dopasowana temperatura, która zachowuje argmax, jednocześnie zaostrzając lub łagodząc prawdopodobieństwa, zwalidowana na odłożonych przypadkach — ale dobrze skalibrowana błędna odpowiedź to nadal błędna odpowiedź. Jeśli twój potok wymaga wiedzy, czy etykieta jest poprawna, potrzebujesz danych oznaczonych etykietami i musisz to zmierzyć samodzielnie.
To nie jest wada właściwa wyłącznie dla Intern-Decision-0.8B. To jest cecha każdego klasyfikatora i nierozwiązany problem w całej kategorii modeli decyzyjnych, do której należą Jev firmy TypeSafe i Laya firmy Convai. Warto powiedzieć to jasno, ponieważ tabela benchmarku z kolumną Brier score może stwarzać wrażenie, że kalibracja to weryfikacja. Tak nie jest. Kalibracja mówi, że kiedy ten model mówi 80%, ma rację w około 80% przypadków w ocenianym rozkładzie — co jest naprawdę przydatne do ustawiania progów i obliczania wartości oczekiwanej, i nie jest gwarancją poprawności dla pojedynczego elementu.
Tablica wyników, na wierszach, które mają oba modele
• Parametry — Intern-Decision-0.8B: 852 985 920 w shardzie językowym o rozmiarze 1,50 GB, shardzie wizyjnym o rozmiarze 176 MB i projektorze o rozmiarze 25 MB. MathForm 8B: gęsty 8B oparty na Qwen3-8B.
• Model bazowy — Intern-Decision-0.8B: Qwen3.5-0.8B, wydany w lutym 2026. MathForm 8B: Qwen3-8B.
• Zadanie — Intern-Decision-0.8B: decyzje typowane na podstawie schematu, który piszesz — wybór, wynik, binarny. MathForm 8B: matematyka w języku naturalnym do formalizacji w Lean 4.
• Wyjście — Intern-Decision-0.8B: skalibrowany rozkład plus argmax dla każdego pola, nie wygenerowano tekstu. MathForm 8B: wygenerowane źródło Lean 4, zazwyczaj długie.
• Weryfikacja — Intern-Decision-0.8B: brak zewnętrznej; pewność jest deklarowana samodzielnie. MathForm 8B: kompilator Lean 4 oraz kontrola spójności semantycznej.
• Opublikowane dowody — Intern-Decision-0.8B: tabela wyników dostawcy dla siedmiu benchmarków, nieodtworzona, bez artykułu. MathForm 8B: artykuł, publiczny zbiór danych liczący około 367 000 przykładów, potok ewaluacyjny i repozytorium, uruchamiane przez dostawcę.
• Licencja — Oba na licencji Apache 2.0, a Intern-Decision-0.8B dodatkowo zawiera zachowany plik licencji Qwen dla swoich wag źródłowych.

Kosztu i opóźnienia nie można porównywać, i to nie jest unik
InternLM zmierzył Intern-Decision-0.8B na poziomie 33,98 ms średnio i 37,50 ms w p95 na zapytanie na pojedynczym RTX 4090 na lokalnej ścieżce Hugging Face, a jego bliźniaczy model 2B osiągnął 33,28 ms średnio. Własna karta MathForm 8B zaleca do 16 384 nowych tokenów na formalizację przy temperaturze 0,6 i top_p 0,95. Te dwa pomiary nie dotyczą tej samej wielkości. Jeden to pojedyncze przejście w przód przez prompt; drugi to generowanie autoregresyjne, które może trwać tysiące tokenów. Przemnożenie budżetu formalizacji przez decyzję trwającą 34 ms nic nie mówi o względnej efektywności, ponieważ modele nie wykonują tej samej pracy — jeden czyta i ocenia, drugi czyta i pisze skrypt dowodu. Jeśli przepustowość jest twoim ograniczeniem, istotne fakty są prostsze niż proporcja. MathForm 8B formalizuje jedno stwierdzenie na generację, a przy 16 tys. tokenów na wyjście w gęstym modelu 8B jest to obciążenie wysycające GPU i kandydat do przetwarzania wsadowego za pomocą vLLM lub SGLang, które OpenBMB dokumentuje. Intern-Decision-0.8B odpowiada na szesnaście pytań obejmujących cały rekord w jednym przebiegu, więc jednostką pracy jest rekord, a nie pole, a budżet rekordu to limit wejściowy wynoszący 8 192 tokeny — który wyczerpuje się szybciej, niż czytelnik mógłby się spodziewać, gdy upychasz długi stan, rozbudowany schemat i do ośmiu obrazów.
Gdzie każde z nich jest właściwym narzędziem
MathForm 8B należy do potoku, którego wąskim gardłem jest weryfikacja matematyki przez człowieka. Autoformalizacja istnieje dlatego, że pisanie w Lean jest wolniejsze niż czytanie go, i dlatego, że stwierdzenie sprawdzalne maszynowo to takie, które asystent dowodzenia może następnie zaatakować. Cecha, która czyni go godnym zaufania — wynik zweryfikowany przez kompilator — jest także tym, co czyni go wąskim: formalizuje, ale nie dowodzi, a karta jednoznacznie stwierdza, że sprawdzanie kompilacji wymaga działającego Kimina Lean Server i że w eksperymentach użyto Lean 4.21.0. Każdy, kto go przyjmuje, przyjmuje ten stos technologiczny. Podobnie jak w przypadku każdego modelu z otwartymi wagami, liczącego sobie zaledwie dni lub tygodnie, skierowanie na niego ścieżki testowej i przejście na sprawdzony model, gdy utknie, to niskoryzykowny sposób jego oceny, co jest tym, do czego służy brama z automatycznym przełączaniem awaryjnym w obrębie łańcucha zapasowego — ponowienia, które następują, zanim rozpocznie się odpowiedź, dzięki czemu zablokowana formalizacja nigdy nie dociera do twojego wywołującego.
Intern-Decision-0.8B należy stosować wszędzie tam, gdzie istnieje już zamknięty zbiór odpowiedzi, a koszt generowania tekstu w celu jego odzyskania jest czystym marnotrawstwem. Triage, routing, ocenianie według rubryk, rozstrzyganie o zgodności rekordu z zapisaną polityką — przypadki, w których model generatywny jest używany jako drogi sposób wybierania z listy. Jego zalety to: jest deterministyczny, zwraca użyteczne prawdopodobieństwo, a nie ciąg znaków, który trzeba parsować, oraz przy 1,73 GB na dysku działa z zapasem poniżej kosztu pamięci przeglądarki na laptopie. Jego wady to: dokumentacja kończy się na powierzchni API, nikt spoza InternLM nie opublikował dla niego wyniku, a jedyna kolumna benchmarku sugerująca problem z bezpieczeństwem — wynik WildJailBreak 64,48 w porównaniu z 96,29 uzyskanymi przez Jev — pozostaje niewyjaśniona. Nie poddawaj go wrogim danym wejściowym, zanim sam nie przeprowadzisz tego testu.

Oba modele mają wspólne pochodzenie, które warto odnotować, ponieważ zmienia ono to, co daje ci „open”. Każdy z nich jest dostrojeniem checkpointu Qwen i każdy prawidłowo zachowuje licencję źródłową: MathForm 8B na licencji Apache 2.0 z podanym na karcie pochodzeniem od Qwen3-8B, Intern-Decision-0.8B na licencji Apache 2.0 z osobnym LICENSE-QWEN plikiem w repozytorium. Żadna z nich nie zawiera progu przychodowego ani ograniczenia dotyczącego pola zastosowania — inaczej niż LFM Open License v1.0 od Liquid AI, która uzależnia prawa komercyjne od tego, czy twoja organizacja pozostaje poniżej progu 10 milionów dolarów rocznego przychodu. Jeśli tworzysz komercyjnie, to właśnie ta różnica odróżnia te dwa wydania od części ekosystemu małych modeli i dotyczy obu z nich w równym stopniu.
Jeśli chcesz warstwę decyzyjną bez nieudokumentowanego punktu kontrolnego
Lukę między „głowica decyzyjna to właściwy kształt dla tego problemu” a „ta konkretna głowica decyzyjna to taka, którą można obronić przed recenzentem” zamyka hostowana alternatywa. Jev 1.13 firmy TypeSafe to model, względem którego InternLM testował swoją rodzinę na Jevbench, na Typed Decision i na ToolACE, i można go wywołać dziś przez pojedynczy punkt końcowy zgodny z OpenAI w cenie $0.042 za milion tokenów wejściowych, z wyjściem rozliczanym po zerowej stawce — to opublikowana stawka dostawcy, przekazana bez marży, a nie z narzutem po drodze. Dla czytelnika, który chce zmierzyć, czy głowica decyzyjna w ogóle pomaga, zanim zaangażuje się w checkpoint 0,8B z brakującym repozytorium, to tani pierwszy eksperyment, a oceny zewnętrzne Jev dają mu udokumentowaną historię, której Intern-Decision-0.8B jeszcze nie ma.

Krótka odpowiedź
Te dwa modele nie są alternatywami. MathForm 8B to specjalista, którego wynik może zweryfikować program, ukierunkowany na zadanie, w którym trudną częścią jest weryfikacja, a w zestawie ma pracę, zbiór danych i środowisko ewaluacyjne, które dowodzą tego twierdzenia. Intern-Decision-0.8B to specjalista, którego wynik możesz zweryfikować tylko ty, ukierunkowany na zadania, w których odpowiedzi były już zapisane, a trudną częścią było dotarcie do nich szybko i tanio; w zestawie ma moduł wnioskowania i tabelę. Jeśli potrzebujesz formalizacji, jest tylko jeden z nich, który warto brać pod uwagę. Jeśli potrzebujesz etykiety i jesteś gotów zbudować dane referencyjne, względem których można ją sprawdzić, 0.8B jest ciekawszym plikiem do pobrania — szybki, deterministyczny, na licencji Apache 2.0 i wystarczająco mały, że koszt przekonania się, czy jest cokolwiek wart, to jedno popołudnie, a nie pozycja w budżecie.
