Wygenerowana karta tytułowa dla Microsoft-Decision-1 vs Laya z podtytułem „pokrycie językowe kontra długość kontekstu”, z plakietkami o treści: 25 obsługiwanych języków vs ponad 100 języków, kontekst 32 768 tokenów vs okno 1024 tokenów, tylko hostowane API vs wagi Apache-2.0, oraz stopka informująca, że dane liczbowe obu dostawców są podawane przez nich samych.
Engineering & Research

Microsoft-Decision-1 kontra Laya: 25 języków za API, ponad 100 za pobraniem 322MB

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Policz języki, a porównanie wydaje się rozstrzygnięte. Microsoft-Decision-1, ogólnodostępny w Microsoft Foundry od 8 października 2026 r., wymienia 25 obsługiwanych języków i wprost stwierdza, że zasięg, jakość i kalibracja „mogą się różnić w zależności od języka”, wskazując języki inne niż angielski, a zwłaszcza te o mniejszych zasobach, jako obszar słabszych wyników. Laya, opublikowany przez Convai Innovations 18 września 2026 r. na licencji Apache 2.0, określa się jako wielojęzyczny w ponad 100 językach i podaje, że 45 z 51 przetestowanych języków pozostaje użytecznych dzięki routingowi, w porównaniu z 23 z 51 w przypadku jego angielskojęzycznego odpowiednika. Jeden to model 9B za punktem końcowym Azure z kontekstem 32 768 tokenów; drugi to klasyfikator o 421 milionach parametrów działający z szybkością 32,8 milisekundy na decyzję na pojedynczym Tesla T4 za darmo. Oba odmawiają zapisania tokenu i oba zwracają prawdopodobieństwa dla opcji, które zdefiniujesz.

Ale przeczytaj obie karty modeli w całości, a liczba języków przestaje być tą interesującą liczbą. To opowieść o kalibracji, która się za nią kryje, a dwa projekty opowiadają ją w przeciwnych kierunkach.

Laya publikuje liczbę, która stawia jej własny marketing w niezręcznej sytuacji

Karta modelu Laya stwierdza w swojej własnej sekcji ograniczeń, że bazowe checkpointy osiągają 0,362 w trybie zero-shot na benchmarku typed-decisions — poniżej linii bazowej klasy większościowej wynoszącej 0,461. To karta, która mówi, że jej model jest gorszy niż zgadywanie „najczęstszej odpowiedzi” w tym teście. Stwierdza również, że bazowe checkpointy w trybie zero-shot są bliskie losowości, że główny wynik 0,766 dla typed-decisions wymaga dostrajania (fine-tuning) na własnym podziale tego benchmarku, że porządkowe pytania z wynikiem porządkowym są najsłabszym prymitywem (SST-5 0,372), że pytania wyboru o wysokiej kardynalności cierpią, ponieważ 77 opcji pozostawia około trzech lub czterech tokenów na każdą, że żaden model nie może przestrzegać własnych etykiet, i że pole action.act_probability „nie niesie jeszcze użytecznego sygnału” przy AUROC 0,30. Własne zdanie podsumowujące Convai jest tym, które należy przenieść do każdej oceny: Laya to szybka baza do specjalizacji, a nie silnik decyzyjny zero-shot.

Ta szczerość jest cenniejsza, niż się wydaje, ponieważ mówi ci dokładnie, do czego służy Laya. Jest to enkoder, który dostrajasz na własnych etykietach — cała architektura jest zbudowana tak, aby nowe schematy nie wymagały ponownego trenowania, ale dobre wyniki w danym zadaniu już tak. Używany w ten sposób, opublikowane wyniki są mocne: 0,766 wobec 0,727 Jev na decyzjach typowanych po dostrojeniu, AG News 0,950 wobec 0,910, DAIR Emotion 0,595 wobec 0,480 oraz ECE 0,081 wobec 0,246 Jev — z uczciwą uwagą, że jest dostarczany z nadmierną pewnością siebie i wymaga ponownego dopasowania temperatury, co zmienia średnie ECE z 0,466 na 0,081.

Microsoft publikuje metodologię i nie ujawnia wyniku.

Strona Foundry modelu Microsoft-Decision-1 przeprowadza to samo ćwiczenie w przeciwnym kierunku. Szczegółowo opisuje ocenę — publiczne i społecznościowe benchmarki decyzyjne oraz wewnętrzne zbiory wyłączone z treningu, metryki obejmujące dokładność i błąd kalibracji, zmieniany porządek opcji, sparowane testy statystyczne, identyczny zestaw testowy dla porównywanych modeli — i podaje, że model „wypada na poziomie wiodących modeli decyzyjnych i przed innymi otwartymi modelami decyzyjnymi ocenianymi według tej samej metodologii”. Wymienia jego mocne obszary (rozumowanie, stosowanie reguł, odporność na formatowanie promptów) oraz słabe (specjalistyczna wiedza dziedzinowa, języki inne niż angielski).

A potem nie wypisuje nic. Żadnej wartości dokładności, żadnego błędu kalibracji, żadnej tabeli dla poszczególnych benchmarków. Samodzielnie raportowane ograniczenia są prawdziwe i użyteczne — wyniki zmieniają się wraz ze sformułowaniem i kolejnością opcji, źle sformułowane pytanie wciąż zwraca wynik, kalibracja jest najsilniejsza w przypadku znanych typów zadań, nie są generowane żadne wyjaśnienia — ale lista ograniczeń to nie pomiar. Zatem ten kompromis jest wyjątkowo klarowny: Laya daje ci liczby, które możesz próbować sfalsyfikować na własnych danych, a Microsoft daje ci postawę zgodności i kontekst 32K, w którym możesz umieścić długi dokument.

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

Co faktycznie daje różnica rozmiarów

To, że Laya jest mała, nie jest tu kompromisem — to jest zamierzone. Ponieważ każda opcja jest oceniana na własnym tokenie [MASK] i poddawana softmaxowi względem opcji tego pytania, przestrzeń odpowiedzi jest składana w momencie żądania, a nie wbudowana na stałe w głowicę słownictwa — dlatego schemat, który wymyślisz dziś po południu, nie wymaga ponownego trenowania, a model mieści się w 322–421 milionach parametrów. Wielojęzyczny checkpoint działa około 2,2 razy szybciej niż angielski, router wykrywa pismo w czasie poniżej pół milisekundy, a przepustowość wsadowa osiąga od 103 do 332 pytań na sekundę na jednym T4. W przypadku obciążenia, które ocenia każde zgłoszenie, każdy pobrany dokument lub każdą proponowaną akcję, ta przepustowość jest cechą, a nie liczbą parametrów.

Koszty tej konstrukcji są równie konkretne i warte wskazania w zestawieniu z alternatywą Microsoftu. Angielski checkpoint ma okno 512 tokenów; wielojęzyczny — 1024, rozszerzalne w kierunku 8K. Microsoft-Decision-1 ma 32 768. Długi wątek pomocy, pełna umowa lub wielostronicowy dokument polityki w ogóle nie mieszczą się w oknie Laya, a żadna szybkość nie zrekompensuje obcięcia. Laya odpowiada na jeden zestaw pytań na przebieg w przód, z udokumentowanym budżetem tokenów na opcję; Microsoft dokumentuje pojedyncze wywołanie obejmujące do 32 tys. tokenów, bez limitu na pytanie. A warto znać słabość Laya jako klasyfikatora na tle konkurencji: uzyskuje 0,425 w Banking77 wobec 0,870 Jev, co jest właśnie rodzajem drobnoziarnistego problemu intencji o wysokiej kardynalności, w którym etap specjalizacji ma największe znaczenie.

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

Porównanie kosztów, które {{1}}nie jest oparte na tokenach{{/1}}

Laya jest darmowa w punkcie użycia — self-hosted, Apache 2.0, wyceniona na koszt self-hosted wynoszący „$0” — a jej rzeczywista cena to przebieg dostrajania, który jesteś jej winien, zanim będzie dobra w twoim zadaniu. Microsoft-Decision-1 to hostowane API Foundry ze stawką za token, która nie jest podana na stronie modelu, bez wag do pobrania, bez ścieżki dostrajania i z wyłączonym wnioskowaniem wsadowym. Jedno to projekt etykietowania danych z góry, drugie to rozliczane wywołanie. Które jest tańsze, zależy wyłącznie od wolumenu, a próg opłacalności jest wysoki: enkoder 421M oceniający 300 elementów na sekundę na wynajętym T4 jest bardzo trudny do pobicia w przeliczeniu na decyzję, gdy zostanie wytrenowany.

Tu właśnie OrcaRouter zasługuje na swoje miejsce w potoku zbudowanym na którymkolwiek z tych modeli — i to wyłącznie po stronie generatywnej. Nie hostujemy ani Microsoft-Decision-1, ani Laya: oba zwracają prawdopodobieństwa, a nie tekst, żadnego z nich nie ma w naszym katalogu, a endpoint do scoringu nie jest celem typu chat-completions. To, co mamy, to model, który generuje to, co jest oceniane — wersję roboczą odpowiedzi, proponowane wywołanie narzędzia, kandydacką odpowiedź, którą następnie ocenia dostrojona głowica Laya. To ponad 200 modeli za jednym kluczem zgodnym z OpenAI w cenach katalogowych dostawcy przekazywanych dalej z 0% marży, z automatycznym przełączaniem awaryjnym, gdy jedna ścieżka obsługi zawodzi. W pętli, która ocenia wszystko, co generuje, wywołanie generowania jest tą częścią, która może się przewrócić, a failover to właśnie to, co utrzymuje kolejkę scoringu w ruchu.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

Który wybrać

Wybierz Laya jeśli Twoje decyzje przychodzą w wielu językach, jeśli Twój wolumen jest wystarczająco wysoki, by cena za token miała znaczenie, jeśli masz etykiety i tydzień na dostrojenie, albo jeśli musisz uruchamiać scoring na sprzęcie w obrębie własnej infrastruktury. Zaakceptuj okno od 512 do 1024 tokenów oraz to, że bazowy checkpoint będzie niemal losowy, dopóki go nie wyspecjalizujesz, a otrzymasz model decyzyjny, który uczciwie przyznaje, że jest punktem wyjścia.

Wybierz Microsoft-Decision-1, jeśli Twoje dane wejściowe to długie dokumenty, a nie zgłoszenia; jeśli Twoją bramą wdrożeniową jest uwierzytelnianie Azure, ujednolicone rozliczenia i pakiet Responsible AI, a nie pobranie; jeśli 25 języków pokrywa Twój ruch; albo jeśli wolisz w ogóle nie posiadać modelu. Zaakceptuj, że pierwszą krzywą kalibracji wyznaczysz samodzielnie, i zarezerwuj popołudnie na oznaczonej próbce, aby to zrobić — ponieważ w przeciwieństwie do Laya, ten nie poda Ci liczby ECE, z którą mógłbyś się spierać.