
Laya wyjaśniona: model decyzyjny, który odpowiada, nie pisząc ani jednego tokenu
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Najciekawszą rzeczą w Layi nie jest jej szybkość. Jest nią to, że każda opcja, którą jej podasz, otrzymuje ocenę przy własnym tokenie [MASK], a prawdopodobieństwa są następnie poddawane operacji softmax na opcjach tego jednego pytania. Convai Innovations opublikowała wagi Layi na Hugging Face 18 września 2026 roku na licencji Apache 2.0 — trzy punkty kontrolne, jedno repozytorium, 421 mln parametrów dla modelu angielskiego. Nie ma tokenów wyjściowych. Nie ma pętli dekodowania, nie ma JSON-a do parsowania, nie ma nawiasu klamrowego, którego można by zapomnieć zamknąć. Przekazujesz jej stan i zestaw typowanych pytań, a po jednym przebiegu w przód otrzymujesz wybór spośród nazwanych opcji, wynik porządkowy z oczekiwanym poziomem albo prawdopodobieństwo, że dane stwierdzenie jest prawdziwe. Ten projekt ma pewną konsekwencję, którą ludzie przeoczają: ponieważ przestrzeń odpowiedzi jest składana dla każdego żądania z osobna, a nie wbudowana w głowicę słownikową, schemat wymyślony dziś po południu nie wymaga ponownego trenowania. Ma też ograniczenie i projekt jasno je podaje na własnej karcie modelu: bazowe punkty kontrolne uzyskują 0,362 w benchmarku typowanych decyzji, wobec 0,318 przy losowym zgadywaniu i 0,461 przy zawsze odpowiadaniu klasą większościową. To zdanie samego Convai warto mieć w głowie — „Laya to szybka baza do specjalizacji, a nie silnik decyzyjny działający zero-shot”. Oczywistym punktem odniesienia jest Jev od TypeSafe AI, hostowany model System One bez opublikowanych wag, bez opublikowanej liczby parametrów i bez opublikowanego modelu bazowego. Laya jest odpowiedzią w postaci otwartych wag. To, czy ta odpowiedź jest dla ciebie przydatna, zależy niemal wyłącznie od tego, którą połowę potoku próbujesz zastąpić.
Czym Laya faktycznie jest, a czym nie jest
Zacznijmy od negatywu, bo właśnie tam większość opracowań popełnia błąd. Laya nie jest LLM-em. Jest nieautoregresyjna: pojedyncze przejście w przód tworzy odpowiedź, a model nigdy nie emituje tekstu. Porównywanie jej opóźnienia z liczbą tokenów na sekundę modelu czatu to porównywanie dwóch różnych operacji — jeden klasyfikuje, drugi generuje. Jeśli potrzebujesz akapitu, streszczenia, planu albo łańcucha rozumowania, Laya nie może ci go dać i nie próbuje.
Czym to jest: dwukierunkowy enkoder z dokręconą na górze głowicą decyzyjną. Angielski checkpoint to ModernBERT-large — 395 mln parametrów, w pełni dostrojony — plus głowica trenowana od zera, złożona z dwóch warstw transformera, skorera znaczników opcji i głowicy act/escalate, co daje łącznie 421 mln. Wielojęzyczny checkpoint zastępuje szkielet modelem mmBERT-base, 22 warstwy i słownik 256 tys. tokenów, co daje łącznie 322 mln. Trzy checkpointy są dostarczane w jednym repozytorium, a pobierany jest tylko ten, o który poprosisz:
• convaiinnovations/laya — ModernBERT-large, 421 mln parametrów, kontekst 512 tokenów, język angielski, około 808 MB na dysku.
• convaiinnovations/laya-multilingual — mmBERT-base, 322 mln parametrów, kontekst 1024 tokenów (enkoder obsługuje do 8192 dzięki RoPE), ponad 100 języków, około 2,2x szybciej, około 647 MB.
• convaiinnovations/laya-typed-decisions — ModernBERT-large, 421 mln parametrów, kontekst 1024 tokenów i jedyny z tych trzech, który ma wartość 0,766, którą zobaczysz cytowaną wszędzie.
Router stoi z przodu i wybiera punkt kontrolny dla każdego żądania, wykrywając pismo i język w mniej niż pół milisekundy, w czystym Pythonie, zanim nastąpi jakiekolwiek przejście w przód. To nie jest funkcja wygody. To funkcja poprawności, a dowody samego projektu pokazują dlaczego: angielski punkt kontrolny osiąga dokładność 0,000 w przypadku khmerskiego, jednocześnie raportując pewność 0,952. Model, który pozostaje pewny siebie, będąc całkowicie w błędzie, to dokładnie ten przypadek, w którym bramkowanie pewnością nie może cię uratować, więc decyzja o routingu musi zostać podjęta, zanim model zobaczy dane wejściowe. W przeglądzie obejmującym 51 języków router uczynił użytecznymi 45 z 51 języków — definiowaną jako przebicie trzykrotności wyniku losowego — w porównaniu z 23 z 51 w przypadku samego angielskiego punktu kontrolnego.

Fakt projektowy wart zrozumienia: jeden token [MASK] na opcję
Jeśli z tego artykułu masz wynieść jedną rzecz, to właśnie tę. W zwykłej głowicy klasyfikacyjnej zbiór etykiet jest ustalony w czasie treningu: warstwa końcowa ma jedno wyjście na klasę, a dodanie klasy oznacza ponowne trenowanie. Laya tego nie robi. Renderuje każdą opcję jako tekst ze znacznikiem, a moduł oceniający znacznik opcji odczytuje wynik z własnej pozycji [MASK] tej opcji. Następnie wykonuje softmax po opcjach należących do tego pytania.
Przestrzeń odpowiedzi jest więc definiowana w momencie żądania. To Ty piszesz opcje, a model je ocenia. Nowy schemat nie wymaga ponownego trenowania ani dostrajania, ponieważ w wagach nie ma niczego, co kodowałoby „billing” lub „technical” jako klasę — jest tylko mechanizm porównywania jednej wyrenderowanej opcji z inną w kontekście stanu.
O tym, jak dobrze to działa, decydują dwa budżety — i są one współdzielone. Każda sekwencja dzieli się na budżet podpowiedzi opcji (head_max_len, 192 tokeny na angielskim punkcie kontrolnym i 256 na dwóch pozostałych) oraz budżet dokumentu (to, co pozostaje z max_len). Na każde pytanie w danym wywołaniu odpowiada się w tym samym pojedynczym przebiegu w przód, więc wywołanie z sześcioma pytaniami to nie sześć wywołań modelu. Opcje dzielą jednak wspólny budżet opcji, dlatego pytanie z 77 opcjami, takie jak Banking77, przydziela około trzech do czterech tokenów na etykietę, a dokładność runie — 0,425 wobec opublikowanego przez Jev wyniku 0,870. Poprawka jest udokumentowana, a nie ukryta: zwiększ head_max_len i max_len albo rozbij duży zestaw opcji na dwuetapowy wybór od zgrubnego do doprecyzowanego.
Trzy prymitywy
Wszystko, co robi Laya, to jeden z trzech typów pytań, a każdy zwraca inny kształt:
• choice — prawdopodobieństwo dla każdej nazwanej opcji, plus etykieta z najwyższym wynikiem i poziom ufności. To prymityw routingu i klasyfikacji intencji.
• wynik — rozkład na uporządkowanej skali ocen plus oczekiwany poziom. To jest prymityw porządkowy: pilność, frustracja, dotkliwość.
• noul — skalibrowane prawdopodobieństwo, że stwierdzenie jest prawdziwe, od 0,0 do 1,0. Phishing, ryzyko odpływu klientów, wstrzykiwanie promptów.
Typy są ścisłe w sposób, który ma znaczenie operacyjne. Pytanie jednokrotnego wyboru nie może zwrócić opcji, której nie dostarczyłeś, ponieważ jedynymi opcjami, które może ocenić, są te, które wyrenderowałeś. To eliminuje całą klasę awarii produkcyjnych — wymyśloną wartość enuma, obcięty JSON, pętlę ponownych prób wokół parsera. Nie eliminuje błędu semantycznego. Model, który zwraca billing: 0.94 dla zgłoszenia, które powinno trafić do wsparcia technicznego, jest błędne i jest błędne z przekonaniem. Typowane dane wyjściowe gwarantują kształt odpowiedzi, nigdy jej poprawność.
RLCD, czyli dlaczego prawdopodobieństwa mają coś znaczyć
Większość klasyfikatorów jest trenowana tak, aby mieć rację. Laya jest trenowana tak, aby uczciwie mówić, na ile ma rację, a to bierze się z receptury treningowej.
Metoda nazywa się RLCD — Reinforcement Learning for Calibrated Decisions. Polityka emituje rozkład, a nie argmax; eksploracja dodaje do logitów szum gaussowski o zerowej średniej; a nagroda jest ściśle właściwą regułą punktacji — logarytmiczną plus sferyczną, z dodaną rangową regułą punktacji dla pytań porządkowych. To słowo „właściwa” odgrywa tu kluczową rolę. Ściśle właściwa reguła punktacji jest maksymalizowana w wartości oczekiwanej tylko wtedy, gdy podaje się swoje prawdziwe przekonania, więc asekurowanie się lub nadmierne twierdzenia powoduje utratę nagrody z samej konstrukcji, a nie z instrukcji. Aktualizacje to REINFORCE z bazą średniej grupowej, w stylu GRPO, a rozmowy wieloturowowe wykorzystują TD(λ=1.0) na fragmentach prefiksów.
Praktyczna konsekwencja jest taka, że próg pewności to coś, na czym sensownie można opierać logikę aplikacji — twierdzenie, którego nie można sformułować o softmaxie z klasyfikatora trenowanego z użyciem entropii krzyżowej. To także twierdzenie z zastrzeżeniem, które projekt otwarcie przyznaje: dostarczane punkty kontrolne są nadmiernie pewne siebie, a przed zaufaniem tym liczbom należy ponownie dopasować temperaturę na własnych danych. Ponowne dopasowanie jednej temperatury na typ pytania i liczbę opcji przesunęło średnie ECE z 0,466 do 0,081 na angielskim punkcie kontrolnym i z 0,314 do 0,106 na wielojęzycznym. Sugerowany przez projekt próg początkowy dla automatycznej akceptacji kontra przeglądu przez człowieka wynosi około 0,85.
Ile kosztuje prowadzenie
Wartości opóźnień pochodzą z samego projektu, zmierzone na Tesla T4, przy czym każdy checkpoint odpowiadał na bajtowo identyczne pytania w tym samym przebiegu:
• Jedno pytanie — 39,5 ms na laya, 32,8 ms na laya-multilingual.
• Pięć pytań — 84,5 ms i 40,1 ms.
• Dziesięć pytań przetworzonych wsadowo — 158,6 ms (15,9 ms na pytanie) i 72,3 ms (7,2 ms na pytanie).
• Pięćdziesiąt pytań — 771 ms i 337 ms, czyli 6,8 ms na pytanie w wielojęzycznym checkpointcie.
• Przepustowość wsadowa na pojedynczym T4 — od 103 do 332 pytań na sekundę.
Jeśli widziałeś krążące twierdzenie „50x szybszy niż Jev”, nie jest to wynik projektu i własny benchmark projektu go nie potwierdza. Opublikowane porównanie Convai to 7,8x w opóźnieniu p50 dla jednego pytania: 32,8 ms wobec 236–276 ms. To porównanie również należy czytać uważnie, ponieważ karta Laya oznacza stronę Jev jako opublikowane dane stron trzecich, których Convai nigdy nie zmierzył — nie ma dostępu do TypeSafe API — a także dlatego, że zestawia lokalny forward pass na GPU z wywołaniem hostowanego API, które obejmuje round-trip sieciowy i kolejkowanie. Architektoniczna część tej luki jest prawdziwa. Infrastrukturalna część nie jest właściwością modelu.
Jeśli chodzi o pamięć, ślad to kilkaset megabajtów na punkt kontrolny, a tabelę wdrożeń warto znać, zanim dobierzesz rozmiar hosta. Domyślne ustawienie leniwe utrzymuje w pamięci dwa punkty kontrolne (angielski i wielojęzyczny — to jedyne dwa, między którymi router wybiera automatycznie), więc po pierwszym wczytaniu danego języka przełączenie kosztuje wyłącznie detekcję. Router(max_loaded=1) na maszynie z ograniczoną pamięcią przeładowuje model przy każdym przełączeniu języka — zmierzony czas to 7,4 sekundy mediany na CPU i 10,3 sekundy na T4. Router(preload=True) to konfiguracja serwerowa: nic się nie przeładowuje, a opóźnienie na żądanie wynosi 32,8 ms na GPU lub 193–464 ms na CPU.
Uczciwa połowa
Właśnie tutaj ten element dowodzi swojej wartości, ponieważ powierzchnia wokół Laya jest głośna, a ograniczenia są konkretne.
Po pierwsze, liczba z nagłówka jest liczbą po dostrojeniu. Dokładność 0,766 należy do laya-typed-decisions, punktu kontrolnego dostrojonego na własnym podziale treningowym tego benchmarku. Bazowe punkty kontrolne osiągają 0,362 i 0,342 w trybie zero-shot wobec 0,318 dla losowej linii bazowej i 0,461 dla linii bazowej klasy większościowej — innymi słowy, poniżej trywialnej linii bazowej. Projekt mówi o tym we własnej liście ograniczeń, zamiast to ukrywać, a dostrojony punkt kontrolny przekracza pułap zgodności własnej nauczyciela wynoszący 0,735, co jest naprawdę mocnym wynikiem jak na enkoder 421M w czterech wąskich obszarach przepływu pracy (przetwarzanie faktur 0,804, incydenty bezpieczeństwa 0,766, obsługa klienta 0,764, obserwowalność śladów agenta 0,730). Ale to wynik dotyczący specjalizacji, a nie modelu bazowego, i każdy, kto cytuje 0,766 jako ogólną zdolność, błędnie odczytuje kartę modelu.
Po drugie, prymitywy nie są równie dobre. Pod względem dokładności na dostrojonym checkpoincie: noul 0,857, choice 0,733, score 0,723. Projekt nazywa ordinalny score wprost „najsłabszym prymitywem”, z SST-5 na poziomie 0,372. Jeśli twoją powierzchnią decyzyjną jest ocena nasilenia w skali 1–5, to właśnie temu prymitywowi masz najmniej powodów ufać od razu po wyjęciu z pudełka.
Po trzecie, dwa zachowania są udokumentowane jako błędy we własnym trackerze zgłoszeń projektu i oba dadzą ci się we znaki na produkcji, jeśli ich nie przeczytasz. action.act_probability nie niesie jeszcze użytecznego sygnału — zgłoszenie #185 — ponieważ wyjście głowicy decyzyjnej jest nieznormalizowane i ma około 300x skalę enkodera, co wysyca głowicę act, przez co odczytuje 1.0 dla niemal każdego wejścia. Jego surowe logity są odwrotnie skorelowane z poprawnością, z AUROC wynoszącym 0.30 na 396 oznaczonych decyzjach. Bramuj na confidence, który osiąga AUROC 0.77 na tych samych elementach. Osobno noul może podążać za własnymi etykietami opcji zamiast za stanem — zgłoszenie #156 — ponieważ render_options na sztywno ustawia etykiety noula na false: / true:, a ta para etykiet może zdominować odpowiedź, zwracając pewne „nie” dla jednoznacznie pozytywnego wejścia. Udokumentowanym obejściem jest zadanie tego samego pytania jako dwuopcyjnego choice z neutralnymi kluczami i twoim sformułowaniem tak/nie jako opisami.
Po czwarte, szczegół kalibracji, który łatwo przeoczyć i który warto przedstawić precyzyjnie. Checkpoint dostarcza dopasowaną temperaturę 0.1006 dla zasobnika choice:11+, a loader przycina każdą temperaturę do przedziału [0.5, 5.0]. To przycięcie wyświadcza ci przysługę. Tak ostra temperatura mogłaby wziąć naprawdę rozdzielony rozkład i zaraportować go jako niemal pewność; przycięcie sprawia, że najgorszym przypadkiem jest odpowiedź łagodniejsza, niż zamierzało dopasowanie, a loader emituje ostrzeżenie, w którym podaje nazwę dotkniętego zasobnika i mówi, by traktować tę pewność jako nieskalibrowaną. Czytaj ostrzeżenia przy wczytywaniu, zamiast je wyciszać.
Po piąte, w katalogu głównym repozytorium obowiązuje wyłącznie angielski, a tryb awarii poza angielskim nie jest łagodny — stąd router i stąd zalecenie, aby używać laya-multilingual do wszystkiego, co nie jest angielską prozą.
Niezależny obraz, tam gdzie istnieje, jest węższy niż obraz dostawcy i nie stoi z nim w sprzeczności. Niezależne starcie bezpośrednie — sysone-bench, 751 stanów w dziewięciu zestawach, z dnia 2026-09-21, uruchomione na identycznych co do bajtu danych wejściowych, z hashami pytań zweryfikowanymi jako identyczne przed porównaniem — daje Jevowi prowadzenie w triage'u, guardrails, moderacji, banking77 i wielojęzycznej intencji, a Laya prowadzi w AG News (0.940 vs 0.910) i MNLI (0.983 vs 0.867). Jej wynik bramkowania pewnością jest tym, wokół którego faktycznie bym planował: bramkowanie przy pewności 0.85 zachowało 58% ruchu Laya przy dokładności 0.878, wobec 78% ruchu Jev przy 0.917. Taki jest kształt tego kompromisu — Laya automatyzuje mniejszą część ruchu przy niższej dokładności na tej części, którą zatrzymuje, a jej własne uruchomienie routera podnosi wielojęzyczną intencję z 0.360 do 0.840.
Powierzchnia wokół niego, która jest niezwykle szeroka
W projekcie, którego wagi liczą sobie zaledwie kilka dni, zaskakuje przede wszystkim warstwa integracyjna. Wszystko to znajduje się w nadrzędnym repozytorium NandhaKishorM/laya, które w momencie pisania tego tekstu miało 19 871 gwiazdek na GitHubie, a w całości objęte jest licencją Apache 2.0:
• laya-serve — serwer HTTP, który udostępnia Router w tym samym formacie żądań i odpowiedzi POST /v1/systemone co hostowane API Jev firmy TypeSafe, więc istniejący klient TypeSafe przenosi się, zmieniając tylko swój bazowy URL. Uczciwie zaznaczmy domyślne ustawienie bezpieczeństwa: nasłuchuje na 0.0.0.0 bez uwierzytelniania, chyba że zostanie ustawiona zmienna LAYA_API_KEY, w którym to przypadku wymaga tokenu bearer. Istnieje wzmocniony wariant modułu NixOS, który działa pod jednostką systemd DynamicUser i przekazuje token przez LoadCredential, zamiast umieszczać go w magazynie.
• Pełny port TypeScript w laya-ts/ dla Node i przeglądarki, a także ścieżka agenta ONNX (laya.onnx_agent.ONNXAgent) do uruchamiania wyeksportowanego modelu w ONNX Runtime bez PyTorch w czasie działania.
• Serwer MCP dostępny w ramach opcjonalnego dodatku, udostępniający laya_predict, laya_route, laya_preset i laya_status jako narzędzia.
• Integracje z LangChain i LangGraph — LayaRouter do routingu krawędzi warunkowych z progiem ufności i mechanizmem fallback oraz LayaGuardrail.
• Nix flake z nix run .#laya-serve i modułem services.laya-serve, czterema plikami compose, ścieżką obrazu Docker z udokumentowanym szybkim startem oraz notatnikiem Kaggle, który uruchamia pełną pętlę fine-tuningu RLCD na darmowych 2xT4 GPU w ciągu czterech do pięciu godzin na około 30 tys. pytań.

Apache 2.0 to szczegół licencji, który decyduje o tym, czy możesz dostarczać to w ramach produktu: pozwala na użycie komercyjne, modyfikację i redystrybucję oraz nie wymaga publikowania swoich zmian ani dostrojonych wag. Obowiązkiem jest zwykłe uznanie autorstwa i zachowanie informacji prawnych, a także wyraźny brak przyznania praw patentowych lub do znaku towarowego poza tym, co stanowi licencja. Dla warstwy decyzyjnej, która znajduje się przed ruchem klientów, to zasadniczo inna propozycja niż hostowany endpoint z wczesnym dostępem, którego wagi, architektura i receptura treningowa są w całości nieujawnione — czym jest Jev dzisiaj, w cenie 0,042 USD za milion tokenów wejściowych, z darmowym wyjściem i wyłącznie tekstowym interfejsem wejściowym.
Gdzie to tak naprawdę pasuje: z przodu głowa decyzyjna, z tyłu routowany LLM
Wzorzec, który warto przyswoić, to nie „model decyzyjny zamiast LLM”. To dwuetapowy potok, a oba etapy istnieją dlatego, że drugi z nich jest w czymś słaby.
Umieść Laya na początku dla masowych, wąskich, maszynowo przetwarzalnych ocen: przypisz zgłoszenie, sklasyfikuj intencję, oceń pilność, zdecyduj, czy ten dokument jest istotny dla zapytania, sprawdź, czy ten szkic narusza politykę. Te wywołania mają stały zestaw odpowiedzi, zdarzają się tysiące razy na godzinę, a 33-milisekundowy lokalny przebieg w przód z zerową liczbą tokenów wyjściowych lepiej do nich pasuje niż generatywne przejście w obie strony. Następnie umieść model generatywny za nią dla wywołań, które naprawdę potrzebują prozy, syntezy lub rozumowania nad długim kontekstem — szkicowanie, wyjaśnianie, podsumowanie eskalacji.
Tu właśnie znajduje się OrcaRouter i warto precyzyjnie określić granicę. Nie udostępniamy Laya; to enkoder 421M, który uruchamiasz samodzielnie, a cały sens polega na tym, że działa tam, gdzie już znajdują się Twoje dane. Nie udostępniamy też Jev — to endpoint TypeSafe we wczesnym dostępie. Obejmujemy generatywną połowę tego samego potoku: ponad 200 modeli za jednym kluczem zgodnym z OpenAI, w cenie katalogowej dostawcy przekazywanej dalej z 0% marży, z automatycznym przełączaniem awaryjnym między dostawcami. Praktyczny powód, dla którego ma to znaczenie, to styk między tymi dwiema połowami. W momencie, gdy zaczynasz kierować decyzje do modelu generatywnego w przypadkach odrzuconych przez głowicę decyzyjną, masz drugą integrację, drugi rachunek i drugi tryb awarii. Jeden klucz dla strony generatywnej, z przełączaniem awaryjnym, jeśli dostawca ulegnie pogorszeniu, oznacza, że ścieżka eskalacji warstwy decyzyjnej to zmiana konfiguracji, a nie druga relacja z dostawcą. To skromne twierdzenie i jest prawdziwe.
Kto powinien to przyjąć, a kto powinien poczekać?
Wdróż Laya teraz, jeśli masz dane etykietowane i pętlę treningową oraz powierzchnię decyzyjną, która jest wystarczająco stabilna, by warto było ją specjalizować. Notatnik Kaggle istnieje właśnie po to, aby etap dostrajania nie był projektem badawczym, bazowe checkpointy ładują się w około dwie sekundy na CPU, a licencja pozwala komercyjnie wdrożyć wynik bez publikowania wag. Najlepiej pasują obciążenia, które projekt już zbenchmarkował: triage zgłoszeń, przetwarzanie faktur, klasyfikacja incydentów bezpieczeństwa, guardrails i moderacja oraz obserwowalność śladów agentów. W pytaniach wyboru utrzymuj liczbę opcji poniżej około 20, skalibruj temperaturę na własnych danych odłożonych, zanim wprowadzisz próg na produkcję, i opieraj bramkowanie na pewności, nigdy na act_probability.
Wstrzymaj się, jeśli Twoja decyzja musi być trafna od razu, bez danych oznaczonych. Bazowy checkpoint znajdujący się poniżej poziomu odniesienia klasy większościowej na benchmarku, względem którego został opublikowany, nie jest silnikiem zero-shot, a uczciwa interpretacja liczb porównujących dostawcę z niezależnymi podmiotami prowadzi do wniosku, że dobrze prowadzone hostowane API decyzyjne jest obecnie lepszym wyborem w trybie zero-shot. Wstrzymaj się również, jeśli Twoje zbiory opcji są duże i nie chcesz dostrajać budżetu głowicy, jeśli Twoja punktacja porządkowa musi być wiarygodna od razu albo jeśli potrzebujesz danych wejściowych w postaci obrazu, dźwięku lub długiego dokumentu — Laya obsługuje wyłącznie tekst, a jej domyślny budżet kontekstu wynosi od 512 do 1024 tokenów, co stanowi wybór dowodów, a nie całego dokumentu.
O tym, co rozstrzygnie tę kategorię, nie zdecydują liczby dotyczące opóźnienia, które są już wystarczająco dobre, by przestać być argumentem. Zdecyduje o tym, czy mały model, który podaje uczciwe prawdopodobieństwa na zdefiniowanej przez ciebie powierzchni decyzyjnej i który możesz douczyć na własnych etykietach, bije wywołanie dużego modelu generatywnego i parsowanie jego wyniku. Laya to wiarygodna, pierwsza poważna próba odpowiedzi na to pytanie w wersji z otwartymi wagami — a ma co najwyżej kilka dni, co jest właściwym sposobem czytania wszystkiego powyżej. Baza jest punktem wyjścia, nie produktem.

