Wygenerowana karta tytułowa z napisem „Jev vs Laya” nad podtytułem „33 milisekundy na T4 i losowy baseline”, kontrastująca Jev (zamknięty, hostowany, silnik decyzyjny zero-shot, 0.727) z Laya (Apache 2.0, 421M ModernBERT, działa lokalnie, 0.362 zero-shot).
Engineering & Research

Jev vs Laya: 33 milisekundy na T4 i losowy baseline

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Karta modelu Laya zawiera zdanie, które rozstrzyga to porównanie, a napisali je ludzie, którzy stworzyli Laya. „Laya to szybka baza do specjalizacji, a nie silnik decyzyjny działający zero-shot". Convai Innovations wydało Laya 18 września 2026 roku, trzy dni po tym, jak TypeSafe AI wypuściło Jev, na licencji Apache 2.0, z wagami na Hugging Face i punktem wejścia pip install laya. Odpowiada na typowane pytania w pojedynczym przebiegu w przód, bez dekodowania token po tokenie, co jest tym samym architektonicznym założeniem, które przyjmuje Jev. Główna obietnica to opóźnienie p50 wynoszące 32,8 milisekundy na decyzję na Tesla T4, przedstawiane jako około 7,8 razy szybciej niż publikowane 236–276 ms p50 Jev przez jego hostowane API. To twierdzenie jest prawdziwe, ale mierzy też dwie różne rzeczy — lokalny GPU kontra wywołanie sieciowe — a obraz dokładności, który się pod tym kryje, powinien decydować o tym, czy go pobierzesz. W trybie zero-shot Laya uzyskuje 0,362 na benchmarku typowanych decyzji TypeSafe. Losowe zgadywanie daje 0,318. Baseline klasy większościowej daje 0,461. Laya, od razu po wyjęciu z pudełka, jest bliżej losowego zgadywania niż trywialnego baseline'u.

Czym właściwie jest Laya

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability per answer, free output, and the roughly 32,000-token request budget.

Laya jest dostarczana jako dwa checkpointy za wbudowanym routerem, który kieruje każde wejście do właściwego z nich. Angielski checkpoint to ModernBERT-large o 421 mln parametrów i kontekście 512 tokenów. Wariant wielojęzyczny to mmBERT-base o 322 mln parametrów i oknie 1024 tokenów obejmującym ponad 100 języków. Oba są nieautoregresyjne: pojedynczy przebieg w przód zwraca odpowiedź, więc nie ma pętli dekodowania, nie ma JSON-a do parsowania ani miejsca, w którym można by wyemitować tekst poza zadeklarowanym typem. Ta ostatnia właściwość to ta sama gwarancja strukturalna, jaką oferuje Jev, osiągnięta z innego kierunku, i jest naprawdę cenna dla każdego, kto napisał logikę ponawiania wokół modelu, który czasami zapomina zamknąć nawias klamrowy.

Jev to zamknięty odpowiednik: pierwszy model System One od TypeSafe AI, uruchomiony 15 września 2026, hostowany i dostępny w ramach wczesnego dostępu, z trzema typowanymi prymitywami — Choice z listy, którą dostarczasz, Score według uporządkowanej rubryki oraz Noul, twierdzenie tak/nie ze skalibrowanym prawdopodobieństwem. Wszystkie pytania są oceniane równolegle względem jednego wspólnego odczytu stanu, dane wyjściowe są bezpłatne, ponieważ nie ma tokenów wyjściowych, a dane wejściowe kosztują 0,042 USD za milion tokenów. Jego architektura, liczba parametrów i moc obliczeniowa użyta do trenowania nie zostały ujawnione, a TypeSafe poinformowało, że szczegóły są trzymane w tajemnicy, a artykuł może pojawić się później.

Twierdzenie o opóźnieniu, zmierzone prawidłowo

Wynik 32,8 ms p50 Layi na T4 to prawdziwa liczba i to dobra. Porównanie 7,8x z wynikiem Jev 236–276 ms to miejsce, w którym trzeba zachować ostrożność, a własna karta Layi jest niezwykle szczera co do tego, dlaczego: liczby Jev to publikowane przez strony trzecie wartości, których Convai nigdy nie zmierzyło samodzielnie, a porównanie zestawia lokalny przebieg w przód na GPU z wywołaniem hostowanego API, które obejmuje rundę sieciową i kolejkowanie. Odejmij sieć, a porównanie architektoniczne dotyczy dwóch modeli jednoprzebiegowych, jednego z 421 mln parametrów i drugiego o nieujawnionym rozmiarze, którego TypeSafe nigdy nie opublikował.

Jest też pewna liczba dotycząca przetwarzania wsadowego, którą warto znać: przy partii dziesięciu Laya podaje 7,2 ms na pytanie. Taki jest kształt produktu. Laya jest stworzona do uruchamiania lokalnie na dużą skalę, a społecznościowe porty działające na urządzeniu, takie jak laya-mlx, rozszerzają to na Apple Silicon. Wiralowe twierdzenia o „50x szybszy niż Jev” nie znajdują potwierdzenia w publikowanych przez sam projekt benchmarkach, a uczciwe ujęcie to duża różnica między środowiskiem lokalnym a chmurą, która jest częściowo architektoniczna, a częściowo to po prostu różnica między Twoim GPU a API kogoś innego.

Co mówią liczby dotyczące dokładności, w kolejności

To tutaj porównanie przestaje być pochlebne i warto przedstawić je po kolei, ponieważ kolejność ma znaczenie.

• Zero-shot w benchmarku typed-decisions firmy TypeSafe — Laya 0,362, losowy 0,318, klasa większościowa 0,461, Jev 0,727. Laya jest powyżej poziomu przypadku i poniżej trywialnej linii bazowej.

• Dostrojony na własnym podziale treningowym benchmarku — Laya 0,766 kontra Jev 0,727. Laya wygrywa, a zwycięstwo pochodzi z checkpointu, który widział dane treningowe benchmarku, co sprawia, że jest to stwierdzenie o dostrajaniu, a nie o modelu bazowym.

• Klasyfikacja intencji Banking77, gdzie zbiór opcji jest duży — Laya 0,425 w porównaniu z Jev 0,870. Laya gwałtownie się pogarsza po przekroczeniu około 20 opcji, a pola Choice w Jev są udokumentowane jako obsługujące do 255, zanim potrzebny jest dwuetapowy wzorzec oceniania.

• Kalibracja — Laya jest dostarczana ze średnim oczekiwanym błędem kalibracji wynoszącym 0,466, który poprawia się do 0,081 dopiero po ponownym dopasowaniu temperatury dla poszczególnych typów pytań. Jev jest trenowany metodą, którą TypeSafe nazywa RLCD (Reinforcement Learning for Calibrated Decisions), i dostarcza każdą odpowiedź wraz z rozkładem prawdopodobieństwa — choć TypeSafe zaleca też użytkownikom weryfikowanie progów na własnych oznaczonych danych, a jeden niezależny audyt wykazał, że kalibracja modelu Jev znacznie się różni w zależności od zadania.

Wzorzec jest jednoznaczny. Laya to mocna baza do dostrajania i słaby silnik decyzyjny zero-shot, i sama to o sobie mówi. Jev to mocny silnik decyzyjny zero-shot, którego kalibrację wciąż trzeba sprawdzać przy każdym wdrożeniu. To różne produkty o różnych strukturach cenowych, a wybór między nimi to głównie kwestia tego, czy masz dane z etykietami i pętlę treningową.

Arytmetyka kosztów nie ma tego samego kształtu co arytmetyka Jewa.

Jev kosztuje 0,042 USD za milion tokenów wejściowych, a tokeny wyjściowe są bezpłatne, co daje 42 USD za miliard, a wywołanie o maksymalnym rozmiarze przy udokumentowanym budżecie żądania wynoszącym ok. 32 000 tokenów kosztuje znacznie poniżej centa. Niezależny test Every objął 777 ocen w 37 dokumentach przy koszcie około ćwierci centa.

Koszt pojedynczego wywołania Laya jest zerowy na poziomie krańcowym, a w ujęciu zagregowanym niezerowy — a suma tych kosztów wcale nie jest mała. Model o 421 mln parametrów na T4 jest tani w uruchomieniu, a mimo to kosztuje cię GPU, a etap dostrajania, który czyni Laya konkurencyjnym, to miejsce, w którym leżą prawdziwe wydatki — etykietowanie danych, przebieg treningu, zestaw narzędzi do ewaluacji oraz ponowne dopasowywanie temperatury dla każdego typu pytania, które zmniejsza jego błąd kalibracji z 0,466 do 0,081. W przypadku stałej taksonomii, która nigdy się nie zmienia, jest to koszt jednorazowy, który zwraca się przy dużej skali. W przypadku taksonomii, która dryfuje, jest to koszt powtarzający się, a bazowy wynik zero-shot Jev’a wynoszący 0,727 staje się znacznie lepszą opcją.

Istnieje trzeci koszt, który łatwo przeoczyć: angielski checkpoint Laya ma okno kontekstu wynoszące 512 tokenów. To nie jest model decyzyjny z małym budżetem kontekstu — to model decyzyjny skrojony na akapit. Budżet żądań Jev wynoszący około 32 000 tokenów jest sześćdziesiąt razy większy, a nawet on jest o rząd wielkości mniejszy niż modele generatywne, względem których wyceniane są oba. Jeśli twoim stanem jest wątek wsparcia, a nie pojedyncza wiadomość wsparcia, okno żadnego z tych modeli nie jest ograniczeniem, względem którego powinieneś optymalizować.

Pytanie o wdrożenie to prawdziwa różnica

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window and the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 on a T4, and the pip install entry point.

Najsilniejszym argumentem Layi nie jest opóźnienie. Jest nim to, że wagi na licencji Apache 2.0 w Hugging Face oznaczają, że decyzja nigdy nie opuszcza twojej infrastruktury, a endpoint nigdy nie ma limitu zapytań. W przypadku decyzji dotyczącej routingu podejmowanej na podstawie dokumentacji medycznej, dokumentu prawnego lub historii konta klienta nie jest to preferencja — to czynnik rozstrzygający i żaden hostowany endpoint w żadnej cenie nie wygra tego argumentu. Jev od TypeSafe jest dostępny we wczesnym dostępie i ma listę oczekujących, a w jego własnej dokumentacji zaznaczono, że limity zapytań mogą się zmieniać bez powiadomienia.

Kontrargumentem jest to, z czego rezygnujesz. Nieujawniona większa architektura Jev wykonuje pracę, której nie mogą wykonać 421M parametrów Laya: zarówno luka zero-shot wynosząca 0,727 w porównaniu z 0,362, jak i luka w Banking77 wynosząca 0,870 w porównaniu z 0,425 są miarami tego, ile wiedzy znajduje się w modelu, zanim go wytrenujesz. Odpowiedzią Laya jest to, że tę wiedzę dostarczasz samodzielnie poprzez dostrajanie, a w wąskiej, ustalonej dziedzinie ta odpowiedź się sprawdza — wynik 0,766 po dostrojeniu jest tego dowodem.

Gdzie w rzeczywistym stosie znajduje się warstwa decyzyjna

Żaden z modeli nie generuje tekstu, więc żaden nie jest całym przepływem pracy. Wzorzec, dla którego oba zostały zaprojektowane, to dwa modele: warstwa decyzyjna, która wykonuje typowane wywołanie, oraz model generatywny, który obsługuje część wymagającą prozy, kodu lub wyjaśnienia. OrcaRouter nie udostępnia Jev ani Laya — Jev to endpoint wczesnego dostępu TypeSafe, a Laya to wagi, które uruchamiasz samodzielnie — ale generatywna połowa tego wzorca to dokładnie to, co obejmujemy: ponad 200 modeli za jednym kluczem zgodnym z OpenAI w cenie katalogowej dostawcy przekazywanej dalej z 0% narzutu, więc zmiana ceny dostawcy jest u nas widoczna tego samego dnia. Architekturę dwumodelową można testować bez drugiej umowy z dostawcą, a dzięki automatycznemu przełączaniu awaryjnemu ścieżka generatywna nie staje się pojedynczym punktem awarii, gdy decydujesz, czy tania warstwa decyzyjna jest wystarczająco dobrze skalibrowana, by automatyzować na jej podstawie.

Werdykt

Jeśli masz stałą, wąską taksonomię, oznaczone przykładami etykietami oraz wymóg dotyczący prywatności lub opóźnienia, który wyklucza hostowane API, Laya jest bardziej obronnym wyborem, a wyniki dostrajania to potwierdzają. Jeśli potrzebujesz, aby decyzja działała od razu po wyjęciu z pudełka, jeśli twoje zbiory opcji przekraczają dwadzieścia kategorii albo jeśli stan jest dłuższy niż akapit, sama karta modelu Laya mówi ci, że nie jest to produkt do tego zadania — a wynik zero-shot na poziomie 0,362 wobec bazowego wyniku większościowego 0,461 to liczba, o której warto pamiętać, gdy ktoś przytacza ci wskaźnik opóźnienia 7,8x.

To, co je łączy, jest bardziej użyteczne niż to, co je dzieli. Oba eliminują klasę błędów wynikających z formatowania wyjścia i nie robią nic z klasą błędów wynikających z osądu. Oba dostarczają prawdopodobieństwa i żaden nie ma opublikowanego diagramu niezawodności, któremu można zaufać bez sprawdzenia. Przetestuj kalibrację na własnych oznaczonych przypadkach, zanim zautomatyzujesz cokolwiek w oparciu o którekolwiek z nich — opóźnienie jest już skomodytyzowane, a wartość ufności jest tym, na co trzeba zapracować przy każdym wdrożeniu.

A generated two-column scoreboard comparing Jev and Laya across the same six labelled dimensions, with a footer reading "Laya zero-shot vs random 0.318 and majority baseline 0.461; per Laya's own model card."