
Laya kontra Nimble: dane kontrastywne kontra szybszy enkoder
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Laya i Nimble to dwa modele decyzyjne o otwartych wagach, których autorzy zrobili najwięcej, aby wyjaśnić, jak zostały zbudowane, a ich wyjaśnienia nie zgadzają się co do tego, gdzie tkwi trudność. Convai Innovations wydało Layę 18 września 2026 r. na licencji Apache 2.0 — 421M checkpoint ModernBERT-large dla języka angielskiego, 322M wielojęzyczny checkpoint mmBERT-base obejmujący ponad 100 języków, router działający w czasie poniżej milisekundy między nimi oraz opublikowany wynik 32,8 ms p50 na decyzję na karcie Tesla T4. Bespoke Labs zbudowało Nimble jako dostrojenie LoRA na Qwen3.5-9B, Apache 2.0, i opisuje go jako „Jev o otwartym kodzie źródłowym” — zainspirowany Jevem od TypeSafe AI, ale nieużywający ani jego wag, ani jego architektury, ani destylacji jego wyników. Odpowiedzią Convai na problem dokładności jest szybkość i baza możliwa do dostrojenia. Odpowiedzią Bespoke są dane treningowe. Ta różnica zasługuje na więcej uwagi niż trzypunktowa różnica w dokładności, która pojawia się w głównych tabelach.
Twierdzenie, które każdy projekt faktycznie wysuwa
Twierdzenie Layi ma charakter architektoniczny. Jest nieautoregresyjna w ścisłym sensie — dwukierunkowy enkoder, brak pętli dekodowania, brak JSON-a do parsowania, brak miejsca, w którym można wyemitować tekst poza zadeklarowanym typem. Ta gwarancja strukturalna jest tą samą, którą oferuje Jev, osiągniętą z innego kierunku, i jest naprawdę cenna dla każdego, kto napisał logikę ponawiania wokół modelu, który czasami zapomina zamknąć nawias klamrowy. Kosztem jest to, że enkoder 421M z oknem 512 tokenów i bez generatywnego pretreningu za sobą nie wie zbyt wiele. Convai mówi o tym na karcie modelu: „Laya to szybka baza do specjalizacji, a nie zero-shotowy silnik decyzyjny”.


Twierdzenie Nimble dotyczy danych. Metoda Bespoke to kontrastowe przygotowywanie danych, zaadaptowane z wcześniejszych prac zespołu nad Bespoke-MiniCheck: napisać dwa niemal identyczne przykłady różniące się jednym „faktem kluczowym”, tak aby poprawna etykieta się odwracała. Proces składa się z czterech podanych kroków — sprawdzenia, czy reguły decyzyjne mogą rzeczywiście prowadzić do różnych odpowiedzi; zbudowania pary poprzez zmianę co najwyżej ośmiu słów; zweryfikowania obu przykładów w osobnych wywołaniach modelu oraz kontroli polegającej na usunięciu każdego zdania; a także wygenerowania etykiet w kodzie przy zachowaniu tylko tych par, których etykiety faktycznie się różnią. Celem nie jest więcej przykładów, lecz ostrzejsze: zmuszenie modelu do nauczenia się, które dowody powinny zmieniać decyzję. To odmienna teoria wyjaśniająca, dlaczego małe modele decyzyjne zawodzą, i ciekawsza niż kolejny punkt dokładności.
Co faktycznie potwierdzają opublikowane liczby
Nimble podaje 90,12% zgodności z etykietami referencyjnymi na 324 odłożonych próbkach, wobec 93,21% dla Jev, 66,36% dla bazowego Qwen3.5-9B bez dostrajania i 84,88% dla Qwen3.8 27B bez dostrajania. Podaje medianę około 106 ms na H100 i 444 ms na M5 Pro z 64 GB. To własne wyniki Bespoke z ich harnessu. Zbiór ewaluacyjny 324 próbek to element, do którego trzeba podejść ostrożnie, a projekt sam wyjaśnia dlaczego: próbki obejmują sześć z dziesięciu rodzin źródeł treningowych, zostały wygenerowane i zwalidowane przez modele bez ludzkiej weryfikacji, więc generalizacja do niewidzianych kategorii jest nieudowodniona. Gdy model jest trenowany metodą kuracji danych, a następnie oceniany na odłożonym podziale tego samego wyselekcjonowanego rozkładu, wskaźnik dokładności jest stwierdzeniem o wewnętrznej spójności metody, a nie o Twoim ruchu.
Liczby modelu Laya pochodzą z przeciwnego końca. W benchmarku TypeSafe typed-decisions uzyskuje 0,362 w trybie zero-shot — losowo to 0,318, a baseline klasy większościowej to 0,461 — oraz 0,766 po dostrojeniu na własnym podziale treningowym tego benchmarku. W Banking77, z 77 etykietami, uzyskuje 0,425 wobec 0,870 modelu Jev, co jest najjaskrawszą ilustracją jego ograniczenia przy wielu opcjach. W AG News z czterema etykietami uzyskuje 0,950 wobec 0,910 Jev; w DAIR Emotion z sześcioma etykietami — 0,595 wobec 0,480. Jego błąd kalibracji wynosi 0,466 i spada do 0,081 po ponownym dopasowaniu temperatury dla poszczególnych typów pytań. W jednym teście zewnętrznym obejmującym 100 wiadomości o pilności Mars-base Jev uzyskał 100/100, a Laya 53/100. A w niezależnej ewaluacji wywołań narzędzi agenta Laya osiągnęła 100% czułości odmów w przypadku niebezpiecznych wywołań, ale tylko dzięki oznaczaniu wszystkiego, co jest porażką precyzji przebraną za sukces w zakresie bezpieczeństwa.
Połóż oba zestawy liczb obok siebie, a uczciwa interpretacja jest taka, że mierzono je na różnych rzeczach. 90,12% Nimble to zgodność z własnymi, wyselekcjonowanymi etykietami referencyjnymi. 0,362 Laya to wynik na benchmarku, którego nie zbudowano. Żadnej z tych liczb nie można przenieść.
Kalibracja: jedyne miejsce, w którym oba projekty są wyjątkowo szczere.
To tutaj oba projekty są sobie najbliższe duchem, a najbardziej rozbieżne w rezultacie.
README Bespoke ostrzega wyraźnie, że prawdopodobieństwa Nimble to znormalizowane softmaxem logity na dostarczonych kandydatach, a nie skalibrowane wskaźniki poprawności — 0,9 nie oznacza 90% poprawności. Zaleca dodanie opcji „żadna z powyższych”, ponieważ jeśli prawidłowej odpowiedzi nie ma wśród kandydatów, i tak wygrywa jeden z nich. W nowszej ocenie na 3 880 rekordach obejmującej 13 podzbiorów, Jev miał niższy raportowany błąd kalibracji w 11 z 13 podzbiorów i niższy wynik Brier'a w 10 z 13. Zatem podobna zgodność etykiet nie implikuje podobnej jakości prawdopodobieństw, i Bespoke tak twierdzi.
Ujawnienie Convai jest lustrzanym odbiciem: oczekiwany błąd kalibracji 0,466 widnieje na karcie, obok 0,081, który daje ponowne dopasowanie temperatury według typu pytania. Żaden z projektów nie dostarcza modelu, którego pewność można by wykorzystać bez dodatkowej pracy. Obydwa mówią to na piśmie. Jeśli budujesz próg pewności — automatyczne wydanie powyżej 0,95, eskalacja poniżej 0,7 — dokumentacja obu autorów mówi ci to samo: najpierw dopasuj próg na własnych oznaczonych danych.
Porównanie, wymiar po wymiarze
• Backbone — Laya: enkoder ModernBERT-large 421M, dwukierunkowy, bez generatywnego wstępnego trenowania. Nimble: Qwen3.5-9B z dostrojeniem LoRA, zachowana generatywna baza.
• Języki — Laya: ponad 100 dzięki wielojęzycznemu checkpointowi 322M. Nimble: angielski.
• Budżet promptu — Laya: 512 tokenów w języku angielskim, 1 024 w wersjach wielojęzycznych. Nimble: maksymalnie 2 048 tokenów na prompt, wyłącznie płaskie schematy, typy wyliczeniowe ograniczone do 26 opcji na pole.
• Szybkość — Laya: 32,8 ms p50 na T4, 7,2 ms na pytanie w partiach po 10. Nimble: około 106 ms mediany na H100, 444 ms na M5 Pro 64GB.
• Sprzęt — Laya: CPU, CUDA i Apple MPS; poniżej gigabajta pamięci rezydentnej w porcie MLX. Nimble: GPU CUDA BF16 dla podanych wartości, z obsługą ścieżek MLX i CUDA.
• Raportowana dokładność — Laya: 0,362 zero-shot, 0,766 po dostrojeniu, 0,425 na Banking77. Nimble: 90,12% na 324 wyselekcjonowanych próbkach odłożonych w porównaniu z 93,21% Jev's.
• Metoda — Laya: najpierw architektura, dostrajanie pod każde wdrożenie. Nimble: kontrastywne opracowanie danych, opublikowane jako przepis.
• Licencja — Apache 2.0 dla obu.
Dwie ograniczenia z tej listy zasługują na dwukrotne przeczytanie, zanim podejmiesz decyzję. Limit Nimble wynoszący 26 opcji na enum i pułap promptu 2048 tokenów to twarde ograniczenia schematu, a nie spadek wydajności — jeśli Twoja taksonomia ma czterdzieści etykiet albo Twój prompt zawiera długi dokument, Nimble jest niewłaściwym narzędziem, niezależnie od jego dokładności. A Nimble ocenia każde pole niezależnie, więc każda reguła spójności między polami — „jeśli A jest prawdziwe, to B musi być fałszywe” — musi znajdować się w Twoim kodzie, a nie w modelu.
Dlaczego przepis na dane jest bardziej przenośnym artefaktem
Oto argument za Nimble, który umyka tabelom dokładności. Bespoke opublikowało nie tylko wagi, ale także pipeline kuracji danych. Jeśli twój problem decyzyjny ma stałą taksonomię i potrafisz zapisać reguły, metodę kontrastywną możesz uruchomić na własnych danych, z własnymi faktami, na których się skupiasz, na dowolnym wybranym przez siebie modelu bazowym. 9B LoRA jest w równym stopniu demonstracją metody, co produktem.
Przenośność Layi jest odmienna i komplementarna. Ponieważ jest mała, ponieważ działa na CPU i ponieważ istnieją porty ONNX i MLX, Laya jest modelem, który można umieścić wewnątrz procesu niemającego GPU ani sieci. W niezależnym benchmarku agentów przeglądarkowych Laya ukończyła 0 z 50 zadań i przedwcześnie zadeklarowała ukończenie w 33 próbach — ale autorzy benchmarku zauważają, że została wytrenowana do pracy wymagającej osądu, takiej jak zgłoszenia do wsparcia, faktury i przegląd śladów agenta, a nie do nawigacji. Odczytuj ten wynik jako określenie zakresu, a nie werdykt, i jest on spójny z ujęciem obu projektów: to komponenty do konkretnej klasy decyzji, a nie agenci ogólnego przeznaczenia.
Ani Laya, ani Nimble nie są modelami hostowanymi na OrcaRouter. Oba są wagami, które uruchamiasz samodzielnie, i nic w tym tekście nie powinno być odczytywane jako twierdzenie, że je udostępniamy. Powód, dla którego produkt routingowy w ogóle się pojawia, jest tym samym powodem, dla którego pojawia się w każdej architekturze z modelem decyzyjnym: model decyzyjny odpowiada na jedno wywołanie, a aplikacja wokół niego nadal potrzebuje tekstu. Potok, który używa Nimble do oceny, czy szkic spełnia wymogi, a Laya do routowania wyjątku, nadal będzie potrzebować modelu generatywnego do napisania szkicu. Utrzymanie tej generatywnej połowy na jednym punkcie końcowym kompatybilnym z OpenAI — ponad 200 modeli, cena katalogowa dostawcy przekazywana z 0% marży dzięki czemu obniżka ceny dostawcy obowiązuje tego samego dnia, automatyczne przełączanie awaryjne między dostawcami — oznacza, że warstwę decyzyjną można wymienić bez dotykania kontraktu warstwy generatywnej.
Werdykt i eksperyment, który by go zmienił
Wybierz Nimble, jeśli Twoja taksonomia jest stała i wąska, dane wejściowe są angielskie i krótkie, masz GPU i zależy Ci na przepisie na dane tak samo jak na modelu. Wybierz Laya, jeśli potrzebujesz wielojęzycznych danych wejściowych, budżetu poniżej 40 ms lub procesu całkowicie bez GPU — i od początku wlicz koszt dostrajania, ponieważ punkt kontrolny zero-shot jest poniżej trywialnego baseline'u, a karta modelu tak podaje.
Eksperyment, który by to rozstrzygnął, to ocena parami na rzeczywistym ruchu: te same dane wejściowe, te same zestawy opcji, te same progi pewności, oceniane względem ludzkich etykiet, z diagramem niezawodności dla każdego z nich. Własna dokumentacja Nimble ostrzega, że jego prawdopodobieństwa nie są wskaźnikami poprawności, a karta Laya podaje błąd kalibracji 0,466 przed ponownym dopasowaniem, więc to ten diagram byłby artefaktem, który faktycznie powiedziałby ci, który model postawić przed produkcją. Żaden z projektów nie opublikował takiego diagramu i żaden nie opublikował diagramu drugiego. Zbuduj go na własnych danych, zanim ustawisz próg.

