Wygenerowana karta tytułowa do porównania Laya kontra Kev, zawierająca własny podtytuł tego artykułu oraz wiersz stopki wskazujący, po której stronie liczby są raportowane przez dostawcę, a po której pochodzą od stron trzecich.
Engineering & Research

Laya vs Kev: Dwa przepisy na lokalny model decyzyjny

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najbardziej użyteczną liczbą w porównaniu Laya kontra Kev jest paragon. Jared Palmer wytrenował rodzinę Kev za około 95 dolarów w czasie H100 na Modal, plus około trzech centów za wywołania API do danych ewaluacyjnych, i opublikował przepis wraz z wagami. Convai Innovations wybrało inną drogę w przypadku Laya: została wydana 18 września 2026 r., trzy dni po Jevie od TypeSafe AI, Apache 2.0, wagi na Hugging Face, pip install laya jako punkt wejściowy, i brak pipeline'u treningowego — 421M checkpoint ModernBERT-large dla języka angielskiego, 322M mmBERT-base wielojęzyczny i router wybierający między nimi. Kev to rodzina trzech małych modeli o rozmiarach 0.8B, 4B i 9B, z których każdy to zamrożona baza plus adapter LoRA o randze 16 i mała głowica wskaźnikowa. Oba odpowiadają na pytania z typami w jednym przebiegu w przód i żaden z nich nie generuje tekstu. Decyzja między nimi jest tak naprawdę decyzją o tym, który artefakt chcesz mieć na własność: checkpoint czy przepis.

Co tak naprawdę wypuszcza każdy projekt

Laya dostarcza wnioskowanie. Angielski checkpoint to dwukierunkowy enkoder z oknem 512 tokenów; wielojęzyczny obejmuje ponad 100 języków przy oknie 1024 tokenów i działa około dwa razy szybciej; router wykrywa pismo w mniej niż pół milisekundy. Zwraca odpowiedzi choice, score i noul — wybór z listy, oczekiwany poziom według uporządkowanej rubryki oraz skalibrowane prawdopodobieństwo, że twierdzenie jest prawdziwe. Istnieje trzeci checkpoint, laya-typed-decisions, który jest tym samym szkieletem 421M dostrojonym na podziale treningowym benchmarku typed-decisions. Karta modelu samego Convai zawiera zdanie, które powinno rządzić tym, jak czytasz każdą liczbę dotyczącą Laya: „Laya to szybka baza do specjalizacji, a nie silnik decyzyjny działający zero-shot.”

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Kev repository on GitHub, showing the description "tiny Jev-like family of decision models built on top of Qwen3.5 you can train and run on your own", the Apache-2.0 licence, and the Kev-0.8B, Kev-4B and Kev-9B releases.

Kev udostępnia metodę. Repozytorium dokumentuje decision-v7: dwie epoki na 10 000 przykładach pochodzących z dziesięciu publicznych zbiorów danych, 896 wygenerowanych przykładów polityki i 1 680 przykładów zbudowanych z 60 wygenerowanych struktur reguł. Głowica ocenia każdą dostarczoną opcję względem tokenu decide pytania i poddaje wynik operacji softmax. Ponieważ checkpointy Qwen3.5 mieszają mechanizm uwagi z rekurencyjnymi warstwami Gated DeltaNet, które ignorują maski uwagi, każde pytanie jest przetwarzane jako osobny wiersz, a stan współdzielony jest obliczany raz i buforowany — w ten sposób model utrzymuje pytania odizolowane od siebie bez ponoszenia kosztu nowego prefillu dla każdego pytania. Kev odwzorowuje publiczny kontrakt TypeSafe /v1/systemone, więc istniejący klient SDK TypeSafe może wskazywać na lokalny serwer Kev, poprzez zmianę bazowego adresu URL. README stwierdza, że do treningu nie wykorzystano żadnych wyników Jev.

Te dwa tryby awarii są różne i to jest prawdziwa historia.

Oba modele przegrywają z Jevem w zadaniach wymagających wiedzy, ale przegrywają w sposób, który wymaga różnych środków zaradczych.

Opublikowane słabości Layi dotyczą kształtu danych wejściowych. W benchmarku TypeSafe'a typed-decisions uzyskuje 0,362 w trybie zero-shot, wobec 0,318 dla losowego zgadywania i 0,461 dla baseline'u opartego na klasie większościowej — bliżej przypadku niż trywialnej odpowiedzi. Powyżej mniej więcej dwudziestu opcji się załamuje: 0,425 na Banking77 wobec 0,870 dla Jev's. Jest na tyle wrażliwa na kolejność, że samo odwrócenie kolejności opcji obniżyło dokładność o 13,75 punktu w jednym teście strony trzeciej, pozostawiając wskaźnik takich samych odpowiedzi na poziomie 42,5%. A dostarczane checkpointy przychodzą z nieprawidłowymi temperaturami — biblioteka ostrzega przy imporcie, co oznacza, że wartość kalibracji podana na karcie, oczekiwany błąd kalibracji 0,466, jest liczbą, którą faktycznie otrzymujesz przed ponownym dopasowaniem. Ponowne dopasowanie dla każdego typu pytania sprowadza ten wynik do 0,081, ale to praca, którą wykonujesz ty, a nie praca, którą wykonuje samo pobranie. Istnieje opublikowany wielojęzyczny przypadek awarii, który warto przeczytać w całości: w przypadku pism niełacińskich angielski checkpoint jest katastrofalnie nadmiernie pewny siebie, a przykład khmerski pokazuje dokładność 0,000 przy średniej pewności 0,952.

Opublikowane słabości Kev dotyczą wiedzy i arytmetyki. Kev-9B uzyskuje 0,837 w swoim własnym, zablokowanym teście na nowych źródłach — 0,832 dla modelu 4B i 0,668 dla 0,8B — oraz około 0,822 poza domeną na zbiorze deweloperskim wobec 0,857 Jev. Luka otwiera się tam, gdzie wymagana jest wiedza o świecie: MMLU około 70% wobec 90% Jev, MMLU-Pro 0,515 wobec 0,840, a arytmetyka dat z dokładnością do dnia 60% wobec 93%. W wąskim zbiorze routingu o stałych etykietach wygrywa — ewaluacja routingu zgłoszeń do pomocy technicznej dała Kev-9B 0,952 wobec 0,897 Jev — ale autor wyraźnie zaznacza, że to jego własny harness, że dane treningowe Jev nie są ujawnione i że nie da się zatem skonstruować kontrolowanego porównania. Kev pozostaje także nadmiernie pewny siebie w przypadku nowych źródeł; KEV_TEMPERATURE=2.0 zmniejszyło liczbę błędów z wysoką pewnością z 8,7% do 4,4% w testach własnych projektu, co pokazuje, że ustawienie domyślne nie jest bezpiecznym ustawieniem.

Praktyczne tłumaczenie: niepowodzenie Layi jest wywoływane przez twój zestaw opcji i formatowanie promptu, a naprawiasz je poprzez dostrajanie i ponowne dopasowanie. Niepowodzenie Kev'a jest wywoływane przez pytania, które wymagają faktów, a naprawiasz je, ograniczając model do routingu i klasyfikacji oraz pozostawiając wywołania zależne od wiedzy gdzie indziej. Żadna z tych poprawek nie jest flagą konfiguracji.

Co trzeba, aby im służyć

• Sprzęt — Laya: enkodery 421M/322M, przekonujące na CPU przy niskiej przepustowości i poniżej gigabajta pamięci rezydentnej dla portu MLX na Apple silicon. Kev: od 0,8B do 9B, wymagające GPU CUDA z BF16 dla modelu 9B, przy czym architektura Qwen3.5 wymaga flash-linear-attention na CUDA i ROCm.

• Opóźnienie — Laya: 32,8 ms p50 na decyzję na Tesla T4, 7,2 ms na pytanie przy partii 10. Kev: około 300 ms dla pięciu wpisanych pytań z modelu 4B na Macu z 32 GB w bf16, około 40 ms na H100.

• Górne limity — Laya: okno 512 tokenów dla języka angielskiego, 1024 w trybie wielojęzycznym. Kev: wybór spośród 1–255 opcji, wynik na 2–255 poziomach, 384 tokeny stanu treningowego, a 8192 podczas serwowania.

• Serwer — Laya: Python działający w procesie, plus społecznościowe porty ONNX, Go i Apple MLX. Kev: lokalny serwer powiązany z 127.0.0.1 bez uwierzytelniania, SDK npm oraz adaptery LangChain i LlamaIndex.

• Licencja — Apache 2.0 dla obu.

Dwie uwagi operacyjne, które nie pojawiają się w liczbach nagłówkowych. Serwer Keva obsługuje pojedyncze żądania i z założenia nie wymaga uwierzytelniania — to lokalny sidecar, a nie coś, co należy wystawiać. A opóźnienie Keva na Macu jest znacząco gorsze niż jego opóźnienie na H100, ponieważ szybkie jądra DeltaNet jeszcze nie istnieją dla MLX, co jest dokładnie tym rodzajem szczegółu, który zamienia twierdzenie „działa lokalnie” w twierdzenie „działa lokalnie na właściwym sprzęcie”.

Generatywna połowa wzorca

Oba te modele istnieją po to, aby zastąpić jedno konkretne wywołanie: wywołanie LLM, które wykonywałeś wyłącznie po to, by otrzymać z powrotem etykietę lub prawdopodobieństwo. Nie zastępują wywołań, w których faktycznie potrzebujesz prozy. System wsparcia, który używa Kev-9B do routowania zgłoszenia, nadal potrzebuje modelu do streszczenia wątku i przygotowania szkicu odpowiedzi, a tym modelem nie będzie LoRA 9B z głowicą pointer.

To jest ta szczelina, w której tkwi OrcaRouter, a nie twierdzenie o hostowaniu któregokolwiek z nich. Ani Laya, ani Kev nie znajdują się na naszej liście modeli — to wagi, które pobierasz — a artykuł byłby mylący, gdyby sugerował inaczej. Na liście znajduje się ponad 200 modeli generatywnych za jednym kluczem kompatybilnym z OpenAI po cenie katalogowej dostawcy przekazywanej z marżą 0%. Jeśli używasz Kev, aby zdecydować, do którego z trzech poziomów podsumowywania należy żądanie, albo używasz Laya do oceny, czy wersja robocza odpowiedzi jest akceptowalna, generatywna strona obu pętli to jeden punkt końcowy z automatycznym przełączaniem awaryjnym zamiast drugiej umowy i drugiego SDK. DSL routingu to element, który najbardziej naturalnie pasuje do architektury modelu decyzyjnego: połącz tani model i drogi w jedno wywołanie i pozwól, aby wynik modelu decyzyjnego wybrał gałąź.

Co obejrzeć dalej

Luka w dowodach jest taka sama dla obu i żaden z tych projektów jej nie zamknie. Nikt nie uruchomił Laya i Kev na identycznych co do bajtu danych wejściowych z tymi samymi promptami, tą samą kolejnością opcji i tym samym przeszukiwaniem progu ufności. Flagowe zwycięstwa Laya pochodzą z własnego harnessu tego projektu; twierdzenia Kev o niemal parytecie pochodzą z harnessu jego autora; audyt kalibracji, który wykazał, że kalibracja Jev zmienia się gwałtownie w zależności od zadania — 44,7% dokładności i 0,325 oczekiwanego błędu kalibracji w zadaniu priorytetowym z ukrytą polityką — pochodził od strony trzeciej, a ani Laya, ani Kev nie zostały poddane takiemu zabiegowi. Dopóki ktoś tego nie zrobi, powyższe liczby są najlepszymi dostępnymi i nie można ich ze sobą porównywać.

Jeśli decydujesz dziś: wybierz Kev, jeśli chcesz działający model routingu w tym tygodniu na GPU, które już wynajmujesz, i zaakceptuj, że nie będzie wiedział różnych rzeczy. Wybierz Laya, jeśli Twoje dane wejściowe są wielojęzyczne albo Twój budżet sprzętowy to laptop, i zaplanuj dostrajanie jako część projektu, a nie jako późniejszą optymalizację. Tak czy inaczej, mierz na własnych oznaczonych danych, zanim umieścisz próg ufności przed ruchem produkcyjnym — oba projekty, w swojej dokumentacji, mówią ci, żeby to zrobić.

A generated two-column scoreboard comparing Laya and Kev across backbone, context window, latency, benchmark accuracy, many-option performance and licence, with a footer reading "Kev figures are the author's own harness; Laya figures per its model card."