Wygenerowana plansza tytułowa do porównania Laya kontra von, zawierająca podtytuł samego tego artykułu oraz wiersz stopki określający, po której stronie dane są raportowane przez dostawcę, a po której pochodzą od stron trzecich.
Engineering & Research

Laya kontra von: Kiedy benchmark dostawcy nie przekłada się

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zadanie klasyfikacji typu commita z sześcioma możliwymi etykietami, w którym losowe zgadywanie daje 8,3%, a von uzyskuje 26,7%. Zadanie routingu plików, w którym ten sam model uzyskuje 8,8%, ledwie powyżej poziomu losowego. Binarne zadanie rozległości zmian z AUC na poziomie 0,513, czyli rzut monetą. Te liczby pochodzą z oceny von przeprowadzonej przez stronę trzecią — otwartoźródłowego modelu System One od wfzyx, 395M enkodera ModernBERT-Large wydanego na licencji Apache 2.0 18 września 2026 r., tego samego dnia co Laya od Convai Innovations. Na własnym benchmarku jabr v2 modelu von sytuacja wygląda odwrotnie: 71,5% dokładności makro w 49 zadaniach i 869 przypadkach, routing wyboru na poziomie 83,4% oraz wynik ViZDoom wynoszący 9,38 średnich zabójstw przy czasie poniżej 18 ms w porównaniu z Jevem od TypeSafe AI z 5,62 zabójstwami i około 115 ms. Oba zestawy liczb są prawdziwe. Odległość między nimi to najbardziej użyteczna rzecz, jaką ktokolwiek opublikował na temat tej kategorii modeli, i odnosi się również do Laya.

Dwa modele, dwa szkielety, jeden wspólny tryb awarii

von i Laya są pod względem architektury bliskimi sąsiadami, dlatego problem transferu to właściwy pryzmat do ich porównania. Oba to nieautoregresyjne enkodery zbudowane na ModernBERT: von ma 395 mln parametrów, a angielski checkpoint Laya — 421 mln. Oba udostępniają te same trzy prymitywy — choice z podanej listy, score na uporządkowanej rubryce, noul jako skalibrowane prawdopodobieństwo odpowiedzi „tak” — i oba implementują /v1/systemone format transmisji, dzięki czemu klient napisany dla Jev od TypeSafe może zamiast tego wskazywać na lokalny serwer. Oba są na licencji Apache 2.0. Oba zwracają prawdopodobieństwa, a nie tekst, i żaden nie ma pętli dekodowania, w której mógłby halucynować.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

Różnice tkwią w historii trenowania. von został wstępnie wytrenowany na 2 bilionach tokenów ogólnych tekstów internetowych, literatury technicznej i kodu, a następnie dostrojony na zrównoważonym korpusie wielodomenowym liczącym około 290 000 przykładów, obejmującym przepływy pracy operacyjne i korporacyjne, cyberbezpieczeństwo i DevOps, bezpieczeństwo oraz moderowanie zgodnie z politykami, lingwistykę, triage i rozumowanie adwersarialne. Po treningu użyto Reinforcement Learning with Calibration Distribution, minimalizując kombinację entropii krzyżowej i wyniku Briera ze współczynnikiem lambda równym 0,5, a skalowanie temperatury zbiegło się przy T=1,1692. Checkpoint Laya dla języka angielskiego to ModernBERT-large dostrojony pod kształt decyzji typowanej, z oknem 512 tokenów, obok wielojęzycznego checkpointu mmBERT-base o 322 mln parametrów, obejmującego ponad 100 języków za routerem, oraz opublikowanego wyniku p50 wynoszącego 32,8 ms na decyzję na karcie Tesla T4.

Wspólny tryb awarii polega na tym, że oba są enkoderami wyszkolonymi do generowania odczytu, a nie modelami rozumującymi. Sam README vona wyraźnie stwierdza, że celuje w potoki wrażliwe na opóźnienia, w których modele autoregresyjne wprowadzają opóźnienie 500–2 000 ms i niedeterministyczne błędy parsowania schematu. To ujęcie mówi, do czego służy: do szybkiej, deterministycznej, statystycznie skalibrowanej klasyfikacji. Nie mówi jednak, że zadziała w twojej klasyfikacji, a niezależny benchmark jest tym, co się dzieje, gdy ktoś sprawdzi.

Uczciwie czytając własny benchmark vona

Wyniki jabr v2 są publikowane przez właściciela i nie zostały poddane niezależnemu audytowi, a kształt benchmarku ma znaczenie tak samo jak wynik. Czterdzieści dziewięć zadań i 869 przypadków to rozsądny zakres dla oceny modelu decyzyjnego, a 71,5% dokładności makro to mocny wynik jak na enkoder 395M. To właśnie rozbicie na domeny jest pouczające: triage objawów — 100,0%, usługi domowe — 95,7%, routing miejski — 94,7%, routing wyboru ogółem — 83,4%. To są zadania, wokół których zbudowano korpus treningowy — README opisuje dane do dostrajania jako operacyjne i korporacyjne przepływy pracy, bezpieczeństwo i DevOps, moderację bezpieczeństwa i polityk, lingwistykę, triage oraz rozumowanie adwersarialne. Wysoki wynik w triage'u objawów oznacza, że model nauczył się domeny triage'u, a nie tego, że nauczył się klasyfikować.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

Wynik ViZDoom jest tym, który cytuje się najczęściej, i zasługuje na uważną lekturę. Średnia liczba zabójstw na poziomie 9,38 w „Defend the Center”, osiem ziaren losowości, w trybie zero-shot na podstawie ustrukturyzowanego tekstu sceny, przy opóźnieniu poniżej 18 ms, w porównaniu z wynikiem 5,62 zabójstwa u Jev'a przy około 115 ms — co stanowi poprawę o 66,9%. To uderzający wynik, a jednocześnie środowisko gry oparte na ustrukturyzowanym tekście, w którym szybka, odruchowa polityka ma dokładnie właściwy kształt. Sposób, w jaki projekt ujmuje paradygmat System One — odruchowy, równoległy, deterministyczny, statystycznie skalibrowany — jest rzetelnym opisem tego, co nagradza to zadanie.

Następnie zewnętrzna ocena uruchomiła von na klasyfikacji typów commitów, routingu plików, wykrywaniu cech i ocenie szerokości zmian, i przegrała z modelami bazowymi opartymi na słowach kluczowych i wyrażeniach regularnych w niektórych z nich. AUC wynoszące 0,513 w zadaniu binarnym jest najbardziej wymowną liczbą: rzut monetą, pochodzącą od modelu, którego kalibracja została dostrojona do T=1,1692, a którego README twierdzi, że oczekiwany błąd kalibracji jest niemal idealny. Obie te rzeczy mogą być prawdą. Model może być dobrze skalibrowany na rozkładzie, na którym był trenowany, i bezużyteczny na rozkładzie, którego nigdy nie widział — a w istocie dobra kalibracja na niewłaściwym rozkładzie jest gorsza niż oczywiście zła kalibracja, ponieważ liczby dotyczące pewności wyglądają wiarygodnie.

Ten sam test zastosowany do Laya

Laya została poddana podobnej procedurze, a wyniki są zgodne z wynikami modelu von. W benchmarku typed-decisions firmy TypeSafe Laya uzyskuje 0,362 w trybie zero-shot wobec 0,318 dla losowego wyboru i 0,461 dla wyniku odniesienia klasy większościowej — bliżej losowego trafienia niż trywialnej odpowiedzi. Jej własna karta modelu podaje konkluzję: „Laya jest szybką bazą do specjalizacji, a nie zero-shotowym silnikiem decyzyjnym”. Powyżej około dwudziestu opcji gwałtownie się pogarsza, uzyskując 0,425 w Banking77 wobec 0,870 uzyskanych przez Jev. W jednym teście zewnętrznym na 100 wiadomościach o pilności z Mars-base Jev uzyskał 100/100, a Laya 53/100. W benchmarku agenta przeglądarkowego ukończyła 0 z 50 zadań, przedwcześnie deklarując ukończenie w 33 próbach, z czego 17 przed podjęciem jakiegokolwiek działania — choć autorzy benchmarku zauważają, że była trenowana do pracy wymagającej osądu, takiej jak zgłoszenia do wsparcia i faktury, a nie do nawigacji, co jest stwierdzeniem zakresu, a nie werdyktem.

Laya różni się od projektu von tym, co twierdzi o sobie. Convai opublikował na karcie modelu niepochlebny wynik zero-shot oraz oczekiwany błąd kalibracji 0,466, obok 0,081, jaki daje ponowne dopasowanie temperatury dla poszczególnych typów pytań. README projektu von publikuje pochlebny wynik jabr v2 i zwycięstwo w ViZDoom. Oba projekty są uczciwe co do tego, co zrobiły; tylko jeden z nich na pierwszym miejscu stawia benchmark, w którym model wypada słabo. To obserwacja dotycząca źródeł, a nie oskarżenie — ale jeśli wybierasz między tymi dwoma na podstawie opublikowanych dowodów, pamiętaj, że porównujesz projekt, który pokazał ci swój słaby wynik, z projektem, którego słaby wynik musiałeś znaleźć gdzie indziej.

Kontrast specyfikacji, wymiar po wymiarze

• Backbone — Laya: ModernBERT-large 421M angielski, mmBERT-base 322M wielojęzyczny. von: ModernBERT-Large 395M.

• Języki — Laya: ponad 100 dzięki wielojęzycznemu checkpointowi i routerowi. von: angielski, bez opublikowanego wielojęzycznego checkpointu.

• Okno kontekstu — Laya: 512 tokenów w języku angielskim, 1,024 w wersji wielojęzycznej. von: nie opublikowano na tych samych warunkach; przypadki jabr v2 to krótkie, ustrukturyzowane decyzje.

• Opóźnienie — Laya: 32,8 ms p50 na T4, 7,2 ms na pytanie przy batchu 10. von: deklarowane od poniżej 15 ms do poniżej 25 ms, poniżej 18 ms w przebiegu ViZDoom.

• Raportowana dokładność — Laya: 0,362 zero-shot, 0,766 po dostrojeniu na własnym podziale benchmarku, 0,425 na Banking77. von: 71,5% macro w 49 zadaniach jabr v2, 83,4% w routingu wyboru i 26,7% dla typu commita w niezależnym teście.

• Kalibracja — Laya: ECE 0,466 po wdrożeniu, 0,081 po ponownym dopasowaniu temperatury dla poszczególnych typów pytań. von: temperatura przeskalowana do T=1,1692 podczas douczania RLCD; deklarowano niemal idealne ECE na jego własnym rozkładzie.

• Serwowanie — Laya: pip install laya, a także porty społecznościowe ONNX, Go i Apple MLX. von: zestawy SDK dla Pythona i TypeScriptu, serwer HTTP przez von serve, gotowe presety do triage'u zgłoszeń, bezpieczeństwa poczty e-mail, moderacji i triage'u zdarzeń bezpieczeństwa.

• Sprzęt — Laya: CPU, CUDA i Apple MPS. od: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS i wielowątkowy CPU.

• Licencja — Apache 2.0 dla obu.

Ta część von, która jest naprawdę charakterystyczna

Kompozycyjne wzorce von to najbardziej niedoceniana rzecz w jego repozytorium. Bramkowanie pewności, rozdzielanie tras, punktacja złożona i trasowanie dwuetapowe są dostarczane jako nazwane wzorce obok presetów — triage zgłoszeń, bezpieczeństwo poczty e-mail, moderacja, triage zdarzeń bezpieczeństwa — i kodują architekturę, której model decyzyjny faktycznie potrzebuje w produkcji. Pojedyncze choice wywołanie rzadko stanowi cały system; użyteczny kształt to tani router pierwszego etapu, który kieruje do wyspecjalizowanego drugiego etapu, z bramką pewności, która eskaluje niepewne przypadki. von dostarcza to jako udokumentowany wzorzec, zamiast zostawiać to Tobie.

To przekłada się wprost na to, co OrcaRouter robi po stronie generatywnej — i warto powiedzieć to bez ogródek, bo obie połowy tego wzorca budują zwykle różne zespoły. Ani von, ani Laya nie są hostowane na OrcaRouter — oba to wagi, które pobierasz i uruchamiasz — i niczego tutaj nie należy odczytywać jako twierdzenia, że je udostępniamy. Na naszej liście jest druga połowa: ponad 200 modeli generatywnych za jednym kluczem zgodnym z OpenAI w cenie katalogowej dostawcy przekazywanej dalej z 0% marży, więc obniżka ceny od dostawcy trafia na Twój rachunek tego samego dnia, a nie dopiero przy odnowieniu. Jeśli brama pewności von uzna, że 4% żądań wymaga modelu frontier, to DSL routingu składa tę decyzję w jedno wywołanie zamiast dwóch umów i dwóch SDK, a automatyczny failover sprawia, że kosztowna gałąź nie staje się pojedynczym punktem awarii.

Co zrobić z dwoma modelami, które oba zawodzą poza swoim rozkładem treningowym

Praktyczny wniosek z oceny von nie jest taki, że von to zły model. Jest taki, że publikowana dokładność modelu decyzyjnego to twierdzenie o jego rozkładzie treningowym, a jedynym sposobem, aby stwierdzić, czy twój problem mieści się w tym rozkładzie, jest jego przetestowanie. Własna tabela benchmarków w README von porównuje go z GLiNER2, dostrojonym Qwen3.5 4B, Laya i Jev od TypeSafe pod względem rozmiaru, dokładności, opóźnienia i hostingu — co jest użyteczną tabelą, a także tabelą, w której każdy wpis dotyczący dokładności oprócz jednego pochodzi z własnego harnessu autora.

Spośród tych dwóch: wybierz von, jeśli chcesz szerszy zestaw opublikowanych domen, nieco mniejszy ślad, gotowe wzorce obsługi do triage'u i moderacji oraz dowody z ViZDoom, że dobrze radzi sobie z szybkimi decyzjami na tekście strukturalnym. Wybierz Laya, jeśli potrzebujesz wielojęzycznego wejścia — von nie ma wielojęzycznego checkpointu, a wariant 322M mmBERT w Laya obejmuje ponad 100 języków — albo jeśli wynik 32,8 ms na T4 i okno 512 tokenów dla angielskiego pasują do twojego obciążenia. Nie wybieraj żadnego z nich, dopóki nie spędzisz popołudnia na oznaczaniu kilkuset przykładów z własnego ruchu i przetestowaniu obu na nich. Dokumentacja obu projektów sama kieruje cię do tego eksperymentu, a wynik strony trzeciej dla von to właśnie to, co się dzieje, gdy nikt go nie przeprowadzi.

Jedyną rzeczą, która zmieniłaby to porównanie, jest ocena parami na identycznych danych wejściowych z diagramem niezawodności dla każdego modelu. Taka ocena nie istnieje. Dopóki tak się nie stanie, uczciwy ranking opiera się na jakości dowodów, a nie na wyniku: Laya opublikowała swój najgorszy wynik, von opublikował swój najlepszy wynik, a niezależny test modelu von jest najbliższym odpowiednikiem zewnętrznej kontroli, jaki ma którekolwiek z nich.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."