
Kolibri vs MathForm-8B: Jedno z tych twierdzeń o dokładności można zweryfikować za pomocą kompilatora
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 218 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Kolibri i MathForm-8B mają wspólną licencję i niemal nic więcej. Oba są na licencji Apache 2.0, oba mają otwarte wagi, oba wydano w ciągu ostatnich trzech miesięcy — Kolibri firmy Aleph Alpha 3 października 2026, MathForm-8B firmy OpenBMB 14 sierpnia 2026 — i oba poświęcają dużą część swoich kart modeli matematyce. Na tym podobieństwa się kończą. Kolibri to niemiecko-angielski model typu mixture-of-experts o 78,1 mld parametrów, który aktywuje 3,46 mld parametrów na token i ma funkcjonować w regulowanym obiegu dokumentów. MathForm-8B to gęsty model o 8 mld parametrów dostrojony z Qwen3-8B z jednym zadaniem: wziąć problem matematyczny zapisany zwykłym angielskim i wygenerować jego formalnie poprawne sformułowanie w Lean 4. Różnica, która ma znaczenie dla każdego, kto ocenia którykolwiek z nich, nie polega na liczbie parametrów. Polega ona na tym, że deklaracja dokładności MathForm-8B jest wykonywalna. Można sprawdzić jego wynik za pomocą kompilatora. Wyniku Kolibri nie da się zweryfikować niczym innym niż kolejnym uruchomieniem benchmarku.
Ta asymetria to cały ten artykuł i uogólnia się znacznie poza te dwa modele. Tabela benchmarków dostawcy to twierdzenie. Asystent dowodzenia, który akceptuje formalizację, to wynik. Gdy cała przestrzeń wyjściowa modelu jest czymś, co maszyna może zweryfikować, warstwa marketingowa znika — albo kompilator Lean akceptuje dane stwierdzenie, albo nie, i żadne ujęcie w poście zapowiadającym premierę tego nie zmieni.
Co MathForm-8B tak naprawdę generuje
Autoformalizacja to wąskie, pozbawione blasku i naprawdę trudne zadanie, a karta modelu jest odświeżająco konkretna, jeśli chodzi o konfigurację.
• Wejście i wyjście — na wejściu stwierdzenie matematyczne w języku naturalnym, na wyjściu formalizacja w Lean 4, wraz z nagłówkiem twierdzenia.
• Model bazowy — Qwen/Qwen3-8B, dostrojony; Apache 2.0 wraz z resztą wydania OpenBMB.
• Trening — nadzorowane dostrajanie, po którym następuje uczenie ze wzmocnieniem na zbiorze danych FormalVerse, przy czym kompilacja Lean i informacja zwrotna o spójności semantycznej napędzają sygnał wzmocnienia.
• Potok danych — pozyskiwanie wiedzy z Mathlib, kompilacja i weryfikacja semantyczna, iteracyjne dopracowywanie, a następnie rekonstrukcja trajektorii. Diagram potoku na karcie modelu jest najbardziej informacyjnym elementem tego wydania.
• Ewaluacja — wskaźniki zaliczeń Pass@8 w ramach dwóch odrębnych sprawdzeń, Sprawdzenia składni i Sprawdzenia spójności, w sześciu benchmarkach, podane jako równo ważona średnia makro na wykresie na karcie, a nie w tabeli, którą moglibyśmy przytaczać wiersz po wierszu.
• Zestaw narzędzi — działający Kimina Lean Server do kontroli kompilacji, Lean 4.21.0 do eksperymentów oraz maksymalna sekwencja 16 384 tokenów z temperaturą 0,6 i top-p 0,95.
• Serwowanie — vLLM lub SGLang przy kontekście 16 384 tokenów, udostępniane przez interfejs czatu zgodny z OpenAI. Ten ostatni szczegół ma większe znaczenie, niż mogłoby się wydawać, ponieważ oznacza, że model wpina się w istniejący pipeline jako zwykły endpoint.
Zauważ dwa oddzielne sprawdzenia. Syntax Check sprawdza, czy instrukcja Lean w ogóle się parsuje i przechodzi kontrolę typów. Consistency Check sprawdza, czy sformalizowane stwierdzenie znaczy to samo co problem wyrażony w języku naturalnym — znacznie trudniejsza właściwość, ponieważ składniowo poprawna instrukcja Lean, która formalizuje błędne twierdzenie, jest gorsza niż błąd kompilacji. OpenBMB podaje oba, co jest dokładnie właściwym sposobem postępowania i jest powodem, dla którego to zadanie ma historię weryfikacji, jakiej nie ma rozumowanie ogólnego przeznaczenia.
Co Kolibri robi z matematyką i dlaczego jest innym rodzajem liczby
Kolibri jest dobry w matematyce w sensie benchmarkowym. We własnym środowisku testowym po treningu Aleph Alpha, przy wysokim wysiłku rozumowania, uzyskuje 96,9 w AIME 2025 w języku angielskim i 87,5 w języku niemieckim, 96,0 i 90,0 w AIME 2026 oraz średnią 96,5 w języku angielskim w swoim zestawie matematycznym w porównaniu do 88,8 w języku niemieckim. Dla kontekstu w tej samej tabeli, wynik Kolibri 96,9 w AIME 2025 w języku angielskim plasuje się powyżej Nemotron 3 Super 120B-A12B z 91,7 i Qwen3.6 35B-A3B z 84,6, a tuż poniżej Qwen3.8 27B z 97,9.
Każda z tych liczb jest raportowana przez dostawcę, na stanowisku testowym dostawcy, bez niezależnego odtworzenia, a dla Kolibri nie ma strony Artificial Analysis, z którą można by je porównać. To nie jest krytyka tych liczb; to stwierdzenie o tym, jakiego rodzaju obiektem one są. Wynik AIME to odsetek poprawnych odpowiedzi końcowych na egzaminie wielokrotnego wyboru. Mówi ci, że model potrafi dojść do liczby całkowitej. Nie mówi ci nic o tym, czy rozumowanie, które doprowadziło do tego wyniku, było poprawne, i nie pozostaje żaden artefakt, który mogłaby zbadać strona trzecia.
W zestawieniu z wynikiem MathForm-8B ta różnica jest uderzająca. Odpowiedź Kolibri na zadanie AIME to liczba. Wynik MathForm-8B to deklaracja twierdzenia w Lean 4, która albo kompiluje się z Mathlib, albo nie. Jeśli budujesz system, w którym teza matematyczna musi być możliwa do obrony — potok weryfikacji formalnej, przepływ pracy asystenta dowodowego, ścieżka audytu — drugi artefakt jest wart znacznie więcej niż pierwszy, a żaden wiersz benchmarku tego nie wyraża.

Gdzie te dwa rzeczywiście by się spotkały
Postawione jako walka, to starcie jest nieciekawe: specjalista 8B pokonuje generalistę 78B w formalizowaniu matematyki, a przegrywa we wszystkim innym, w tym w niemieckiej prozie administracyjnej, rozumowaniu nad dokumentami w długim kontekście i wywoływaniu narzędzi w trakcie trajektorii agenta obejmującej sto kroków. Ale te dwa modele nie są substytutami, a użyteczne pytanie brzmi, jak wygląda potok zbudowany z obu.
Naturalną kompozycją jest kompozycja oparta na routingu. Generalista z mocnym rozumowaniem i wywoływaniem narzędzi obsługuje wczytywanie danych, ujednoznacznianie i wyszukiwanie; specjalista jest wywoływany w dwóch procentach przypadków, które wymagają formalnego artefaktu. Zrobienie tego ręcznie oznacza dwóch dostawców, dwie umowy, dwa SDK, dwa zestawy poświadczeń i warstwę dyspozycji, którą ktoś utrzymuje. To przypadek, w którym pojedynczy endpoint się opłaca: jeden klucz zgodny z OpenAI, reguła routingu, która kieruje zapytania o matematycznym kształcie do endpointu formalizatora, a wszystko inne do generalisty, oraz przełączanie awaryjne, gdy jeden z nich działa wolno. To zadanie DSL-a routingu — składanie kilku modeli w jedno wywołanie zamiast zakodowania wyboru na sztywno w czasie tworzenia — a tam, gdzie przydaje się panel modeli odpowiadających wspólnie, obejmuje to fuzja modeli. Ani Kolibri, ani MathForm-8B nie znajdują się w OrcaRouter dzisiaj; przeszukaliśmy katalog pod kątem obu, sprawdzając każdą pisownię dostawcy i modelu, i żadnego tam nie ma. Argument o kompozycji dotyczy kształtu problemu, a nie tych dwóch konkretnych endpointów.
To, co jest w katalogu, to uniwersalna połowa tego wzorca w cenie, którą można zmierzyć. Qwen3.8-27B jest wyceniony na 0,33 USD za milion tokenów wejściowych i 2,40 USD za tokeny wyjściowe, z oknem 262 144 tokenów, a Qwen3.8-Max na 2,00 USD i 6,00 USD z oknem 1 mln tokenów. Dla zespołu badającego, czy etap formalizacji w ogóle warto dodawać do potoku dokumentów, tani eksperyment polega na skierowaniu tam pracy ogólnej, zmierzeniu liczby żądań, które naprawdę potrzebują artefaktu Lean, i dopiero wtedy podjęciu decyzji, czy warto zapewnić wyspecjalizowany endpoint o oknie 16 384 tokenów. Cena katalogowa dostawcy jest przekazywana bez doliczania czegokolwiek za token, więc liczby zmieniają się w dniu, w którym zmieni je dostawca.

Licencja to jedyna linia, w której są identyczne
Oba są objęte licencją Apache 2.0, a w kategorii, w której powszechne są niestandardowe licencje badawcze i klauzule dopuszczalnego użytku, jest to prawdziwy punkt równości, który warto wskazać — oznacza to, że żaden z modeli nie wymaga przeglądu prawnego, zanim będzie można go używać komercyjnie, modyfikować lub redystrybuować.
Zobowiązania różnią się w innych miejscach. Kolibri wnosi około 78 GB wag i minimalny próg sprzętowy w postaci dwóch kart A100 80 GB, dwóch H100 SXM5, jednego H200, jednego B200 lub jednego B300, a do tego pakiet aleph-alpha-inference dostawcy i wtyczkę vLLM. MathForm-8B w formacie bfloat16 to około 16 GB wag i działa na pojedynczym nowoczesnym akceleratorze przy kontekście 16 384 tokenów; jego zależności to zestaw narzędzi Lean, a w przypadku potoku ewaluacyjnego działający Kimina Lean Server. Jedno z tych wdrożeń mieści się w stacji roboczej. Drugie nie.
Liczby dotyczące kontekstu przemawiają w odwrotnym kierunku i to z dużą przewagą. Natywne okno Kolibri to 262 144 tokeny, z walidacją do 1 048 576, co czyni go modelem dokumentowym: pełny niemiecki dokument regulacyjny lub lotniczy podręcznik obsługi technicznej mieści się w jednym wywołaniu. MathForm-8B ma z założenia limit 16 384 tokenów, ponieważ żądanie formalizacji to pojedyncze sformułowanie problemu i nie ma powodu, by było dłuższe. Żadna z tych liczb nie jest wadą. Po prostu opisują różne zadania.

Wybieranie, a poniżej pytanie weryfikacyjne
• Wybierz MathForm-8B, jeśli Twój wynik musi być sprawdzalny. Jeśli system podrzędny korzysta z Lean 4 albo jeśli cały sens polega na tym, że asystent dowodzenia zatwierdza wynik, żaden generalista go nie zastąpi, a liczby Pass@8 w ramach Syntax Check i Consistency Check są tym, co należy analizować, a nie jakikolwiek wiersz AIME.
• Wybierz Kolibri, jeśli potrzebujesz jednego modelu, który czyta niemieckie i angielskie dokumenty w długim kontekście, wnioskuje na ich podstawie, wywołuje narzędzia, powstrzymuje się od odpowiedzi, gdy kontekst jej nie uzasadnia, i można go wdrożyć we własnym obwodzie na licencji, którą da się opisać w jednym zdaniu. Matematyka jest jego możliwością, a nie produktem, którym jest.
• Rozważ oba rozwiązania, jeśli budujesz potok formalizacji. Nie jako alternatywy, lecz jako dwa punkty końcowe za pojedynczą regułą routingu, przy czym specjalistę wywołuje się dla wąskiego wycinka żądań, które tego wymagają.
A jeśli oceniasz którykolwiek z nich na podstawie liczby z benchmarku, najpierw zastosuj jeden test: zapytaj, jaki artefakt pozostawia po sobie ta liczba. W przypadku MathForm-8B istnieje plik Lean i kompilator, który albo go akceptuje, albo nie, a oba możesz uruchomić samodzielnie jeszcze dziś po południu. W przypadku Kolibri jest procent w tabeli premiery, podany przez dostawcę, nieodtworzony, bez niezależnej strony indeksu, względem której można by go sprawdzić — a jedynym sposobem, aby go obalić, jest pobranie 78 GB wag, wynajęcie sprzętu i ponowne uruchomienie harnessu. Ta asymetria jest warta więcej niż sam wynik, gdy decydujesz, co wdrożyć do produkcji.
