
Laya kontra Decider: enkoder 421M przeciwko mieszance 35B
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Laya i Decider to oba modele decyzyjne o otwartych wagach, nieautoregresyjne, które odpowiadają na pytania o określonym typie odpowiedzi — wybór z dostarczonej listy, ocenę według uporządkowanej rubryki, prawdopodobieństwo tak/nie — w pojedynczym przebiegu w przód, i znajdują się na przeciwległych końcach spektrum rozmiarów. Convai Innovations udostępniła Layę 18 września 2026 r. na licencji Apache 2.0: enkoder ModernBERT-large o 421 mln parametrów dla języka angielskiego z oknem 512 tokenów, wielojęzyczny checkpoint mmBERT-base o 322 mln parametrów z oknem 1024 tokenów obejmującym ponad 100 języków oraz router, który wykrywa system pisma i kieruje do właściwego z nich. Rodzina Decider firmy Mapika obejmuje modele od decider-0.8b i decider-2b na małych bazach generatywnych aż po decider-35b-a3b, mieszaninę ekspertów o 35 mld parametrów z około 3 mld aktywnych parametrów. Oba można pobrać bezpłatnie i oba zwracają prawdopodobieństwa, a nie tekst. Powód, dla którego nie są wymienne, nie tkwi w liczbie dokładności, od której zaczyna większość opracowań.
Dwie rodziny, jeden architektoniczny zakład

Wspólne założenie jest takie, że decyzja nie potrzebuje pętli dekodowania. Model generatywny zapytany „czy to zgłoszenie jest prośbą o zwrot?” musi wygenerować tokeny, a w momencie, gdy je wygeneruje, bierzesz na siebie parsowanie, walidację schematu i ścieżkę ponawiania na ten jeden raz na dwieście, gdy zapomni nawiasu klamrowego. Laya i Decider oba to pomijają, odczytując odpowiedź bezpośrednio z pojedynczego przejścia w przód — Laya z kodera dwukierunkowego, Decider z logitów tokenów oznaczonych literami opcji w dedykowanym slocie odpowiedzi w prompcie.
Na tym kończy się podobieństwo. Laya to dwa małe enkodery za routerem językowym, co zapewnia jej okno 512 tokenów dla języka angielskiego i okno wielojęzyczne 1024 tokenów przy liczbie parametrów 421M i 322M. Decider zachowuje generatywny szkielet i dodaje na wierzchu readout: decider-2b to nadzorowany fine-tuning Qwen3.5-2B-Base, po którym następuje kalibracyjny przebieg uczenia ze wzmocnieniem na zadaniach przeglądarkowych na żywo i grach o dokładnych zasadach, podczas gdy decider-35b-a3b zamraża ekspertów routowanych i trenuje macierze blokowe za pomocą Muon. Praktyczną konsekwencją jest to, że Decider dziedziczy wiedzę o świecie modelu językowego, a Laya nie. Inną konsekwencją jest to, że Decider dziedziczy ślad modelu językowego.

Własna dokumentacja Mapiki podaje, że decider-2b osiąga medianę 18 ms na decyzję na B300 w bf16, przy batchu równym jeden, bez grafów CUDA ani kompilacji, a decider-35b-a3b – 41 ms w tej samej konfiguracji. Na GH200, przy kontekstach zgłoszeń do wsparcia o długości około 230 tokenów i od trzech do pięciu wpisanych pytań, ten sam projekt raportuje 49 ms w trybie eager, 4,0 ms z grafami CUDA i torch.compile oraz około 1370 decyzji na sekundę przy batchu 32. Są to liczby opublikowane przez dostawcę, pochodzące z własnego opisu projektu, a nie niezależny pomiar. Główna liczba Layi również została opublikowana przez dostawcę: 32,8 ms p50 na decyzję na Tesla T4 i 7,2 ms na pytanie przy rozmiarze batcha 10.
Pytanie o kalibrację, na które oba projekty odpowiadają w różnych skalach
Kalibracja to najważniejsza liczba dla modelu decyzyjnego, ponieważ cały sens zwracania prawdopodobieństwa polega na tym, że ktoś na dalszym etapie ustali dla niego próg. To także obszar, w którym bezpośrednie porównanie Laya i Decider wprowadzi cię w błąd.
Laya jest dostarczana z oczekiwanym błędem kalibracji wynoszącym 0,466 na własnej karcie modelu, a karta wprost stwierdza, że ponowne dopasowanie temperatury dla każdego typu pytania przesuwa tę wartość do 0,081. To nietypowo uczciwe ujawnienie, a jednocześnie oznacza, że dostarczany checkpoint nie jest skalibrowanym artefaktem. Liczba, którą otrzymujesz od razu po wyjęciu z pudełka, to 0,466.
Decider raportuje na podstawie zupełnie innego narzędzia. Decision Index — otwarty ranking, który przeprowadził każdą otwartą reprodukcję Jev na 132 422 żądaniach — umieszcza decider-35b-a3b na czwartym miejscu ogółem z wynikiem 54,3, za Jev z 59,5, i raportuje go jako najlepiej skalibrowany spośród 32 pozycji, z błędem kalibracji 3,1 punktu i 0,4% błędnych odpowiedzi przy deklarowanej pewności 95%+. decider-2b raportuje 8,8 punktu i 0,9%. To liczby opublikowane przez ranking, a 3,1 punktu w dziesięcioprzedziałowym ECE Indeksu to nie ten sam pomiar co 0,466 Laya w jego własnej ewaluacji. Umieszczenie ich obok siebie w tabeli byłoby błędem porównywania jabłek z pomarańczami przebranym za rygor. Można powiedzieć, że autor Decidera zdecydował się na pomiar w rankingu strony trzeciej, a autor Laya zdecydował się sam opublikować swój najsłabszy wynik kalibracji; żaden nie został poddany audytowi przez środowisko testowe drugiego.
W czym każdy z nich wygrywa, wymiar po wymiarze
• Backbone — Laya: ModernBERT-large 421M enkoder, dwukierunkowy. Decydent: Qwen3.5 bazy generatywne, od 0,8B do 35B-A3B.
• Języki — Laya: ponad 100 dzięki wielojęzycznemu checkpointowi o rozmiarze 322M stojącemu za routerem. Decider: tylko angielski, wskazany jako ograniczenie.
• Okno kontekstu — Laya: 512 tokenów w języku angielskim, 1024 w wersji wielojęzycznej. Decider: akceptuje dane wejściowe do 32 tys., trenowany do 16 tys. na generacji v6, testowany do 30 tys.
• Pułap zestawu opcji — Laya: gwałtownie się pogarsza po przekroczeniu około 20 opcji, 0,425 na Banking77 wobec 0,870 Jev. Decider: Choice w zakresie od 2 do 255 nazwanych opcji, Score w zakresie od 2 do 10 opisanych poziomów.
• Dokładność zero-shot — Laya: 0,362 w benchmarku typed-decisions, poniżej baseline'u klasy większościowej wynoszącego 0,461. Decider: nie opublikowano jako liczby zero-shot; projekt podaje zamiast tego wyniki specyficzne dla zadania.
• Kalibracja — Laya: ECE 0,466 w wersji dostarczonej, 0,081 po ponownym dopasowaniu temperatury dla poszczególnych typów pytań. Decider: 3,1 punktu w Decision Index dla 35B, najlepszy z 32 wpisów.
• Rozumowanie — Laya: brak, z założenia. Decydent: brak, stwierdzony wprost — to odczyt dopasowujący wzorce, a nie rozumujący.
• Licencja — Apache 2.0 dla obu.
Jeszcze jeden szczegół dotyczący Decider, o którym warto wiedzieć przed dokonaniem wyboru: projekt ostrzega, że wybieranie jednego rekordu z długiej tablicy JSON według pozycji to słaby przypadek użycia, i zaleca odwoływanie się do rekordów po kluczu. To rodzaj ograniczenia, o którym dowiesz się dopiero, gdy go uruchomisz.
Ile kosztuje cię eksploatacja któregokolwiek z nich
Profil kosztów Layi to projekt dostrajania. Model jest wystarczająco mały, by działać na procesorze laptopa przy pracy o niskiej przepustowości, ale dostarczany angielski checkpoint w trybie zero-shot osiąga wynik poniżej trywialnego baseline'u, co oznacza, że przyjęcie Layi to przyjęcie zadania zbudowania zbioru etykietowanego, dostrojenia i ponownego dopasowania temperatury dla każdego typu pytania. Nagrodą jest to, że gdy już to zrobisz, artefakt ma 421 mln parametrów i odpowiada w dziesiątkach milisekund na T4. Własny dostrojony checkpoint firmy Convai laya-typed-decisions osiąga 0,766 na zbiorze treningowym benchmarku — liczba, która mówi więcej o dostrajaniu niż o modelu bazowym, a karta to potwierdza.
Profil kosztów Decidera to decyzja o serwowaniu. Wybierasz, ile GPU wynająć, a rodzina daje ci prawdziwe pokrętło: 18 ms na 2B kontra 41 ms na 35B-A3B, przy czym większy model zapewnia zapas wiedzy i zdolności rozumowania na GPQA, GSM8K, CRUXEval i MMLU, którego nie mają małe modele. Jeśli twoje zadanie jest wąskie, a etykiety są stałe, decider-2b jest tańszą maszyną. Jeśli twoje zadanie wymaga, aby model coś wiedział, płacisz za mieszankę.
Gdzie pasuje OrcaRouter — a gdzie nie
Ani Laya, ani Decider nie są modelami hostowanymi na OrcaRouter. Wagi pobierasz i uruchamiasz samodzielnie — i nic tutaj tego nie zmienia. Zmienia się natomiast druga połowa wzorca. Typowany model decyzyjny prawie nigdy nie stanowi całej aplikacji: coś musi odczytać zgłoszenie, podsumować wątek albo naszkicować odpowiedź, którą przepuszcza decyzja. Ta połowa to wywołanie generatywne i właśnie dla niej powstał OrcaRouter — ponad 200 modeli za jednym kluczem zgodnym z OpenAI w cenie katalogowej dostawcy przekazywanej z marżą 0%, więc obniżka ceny u dostawcy trafia na Twoje rozliczenie tego samego dnia, a nie dopiero przy odnowieniu umowy. Jeśli dostrajasz checkpoint Laya na wynikach modelu frontier albo kierujesz ruch między decider-2b do triage'u a dużym modelem do trudnych 4%, utrzymanie strony generatywnej na jednym endpoincie oznacza, że strona decyzyjna i strona generowania nie potrzebują dwóch umów i dwóch SDK. Automatyczne przełączanie awaryjne obejmuje sytuację, w której to właśnie duży model jest tym, co pada.
Który wybrać
Wybierz Laya, jeśli Twoje dane wejściowe są wielojęzyczne, etykiet jest niewiele, budżet opóźnienia wynosi dziesiątki milisekund na przeciętnym sprzęcie i jesteś gotów dostroić model — bo będziesz musiał. Wybierz Decider, jeśli Twoje dane wejściowe są w języku angielskim, potrzebujesz, aby model wniósł pewną wiedzę o świecie do decyzji, i wolisz wybrać rozmiar modelu niż uruchamiać pipeline treningowy. Jeśli Twoje zestawy opcji przekraczają dwadzieścia etykiet, przeczytaj wynik Banking77 dla Laya, zanim podejmiesz decyzję; jeśli Twoje dane wejściowe to długie dokumenty JSON, do których odwołujesz się po pozycji, przeczytaj podane ograniczenie Decider, zanim podejmiesz decyzję.
Porównanie, które faktycznie rozstrzygnęłoby tę kwestię — oba modele na bajtowo identycznych danych wejściowych, te same prompty, ta sama kolejność opcji, ten sam przegląd progów — jeszcze nie istnieje. Dopóki go nie ma, uczciwym stanowiskiem jest, że Laya ma lepszą krzywą kosztów, a Decider lepsze dowody kalibracji, oraz że oba są wystarczająco wczesne, by ewaluacja, którą zbudujesz na własnych danych, była warta więcej niż opublikowane liczby któregokolwiek z tych projektów.

