
Microsoft-Decision-1 kontra Laya: 25 języków za API, ponad 100 za pobraniem 322MB
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Policz języki, a porównanie wydaje się rozstrzygnięte. Microsoft-Decision-1, ogólnodostępny w Microsoft Foundry od 8 października 2026 r., wymienia 25 obsługiwanych języków i wprost stwierdza, że zasięg, jakość i kalibracja „mogą się różnić w zależności od języka”, wskazując języki inne niż angielski, a zwłaszcza te o mniejszych zasobach, jako obszar słabszych wyników. Laya, opublikowany przez Convai Innovations 18 września 2026 r. na licencji Apache 2.0, określa się jako wielojęzyczny w ponad 100 językach i podaje, że 45 z 51 przetestowanych języków pozostaje użytecznych dzięki routingowi, w porównaniu z 23 z 51 w przypadku jego angielskojęzycznego odpowiednika. Jeden to model 9B za punktem końcowym Azure z kontekstem 32 768 tokenów; drugi to klasyfikator o 421 milionach parametrów działający z szybkością 32,8 milisekundy na decyzję na pojedynczym Tesla T4 za darmo. Oba odmawiają zapisania tokenu i oba zwracają prawdopodobieństwa dla opcji, które zdefiniujesz.
Ale przeczytaj obie karty modeli w całości, a liczba języków przestaje być tą interesującą liczbą. To opowieść o kalibracji, która się za nią kryje, a dwa projekty opowiadają ją w przeciwnych kierunkach.
Laya publikuje liczbę, która stawia jej własny marketing w niezręcznej sytuacji
Karta modelu Laya stwierdza w swojej własnej sekcji ograniczeń, że bazowe checkpointy osiągają 0,362 w trybie zero-shot na benchmarku typed-decisions — poniżej linii bazowej klasy większościowej wynoszącej 0,461. To karta, która mówi, że jej model jest gorszy niż zgadywanie „najczęstszej odpowiedzi” w tym teście. Stwierdza również, że bazowe checkpointy w trybie zero-shot są bliskie losowości, że główny wynik 0,766 dla typed-decisions wymaga dostrajania (fine-tuning) na własnym podziale tego benchmarku, że porządkowe pytania z wynikiem porządkowym są najsłabszym prymitywem (SST-5 0,372), że pytania wyboru o wysokiej kardynalności cierpią, ponieważ 77 opcji pozostawia około trzech lub czterech tokenów na każdą, że żaden model nie może przestrzegać własnych etykiet, i że pole action.act_probability „nie niesie jeszcze użytecznego sygnału” przy AUROC 0,30. Własne zdanie podsumowujące Convai jest tym, które należy przenieść do każdej oceny: Laya to szybka baza do specjalizacji, a nie silnik decyzyjny zero-shot.
Ta szczerość jest cenniejsza, niż się wydaje, ponieważ mówi ci dokładnie, do czego służy Laya. Jest to enkoder, który dostrajasz na własnych etykietach — cała architektura jest zbudowana tak, aby nowe schematy nie wymagały ponownego trenowania, ale dobre wyniki w danym zadaniu już tak. Używany w ten sposób, opublikowane wyniki są mocne: 0,766 wobec 0,727 Jev na decyzjach typowanych po dostrojeniu, AG News 0,950 wobec 0,910, DAIR Emotion 0,595 wobec 0,480 oraz ECE 0,081 wobec 0,246 Jev — z uczciwą uwagą, że jest dostarczany z nadmierną pewnością siebie i wymaga ponownego dopasowania temperatury, co zmienia średnie ECE z 0,466 na 0,081.
Microsoft publikuje metodologię i nie ujawnia wyniku.
Strona Foundry modelu Microsoft-Decision-1 przeprowadza to samo ćwiczenie w przeciwnym kierunku. Szczegółowo opisuje ocenę — publiczne i społecznościowe benchmarki decyzyjne oraz wewnętrzne zbiory wyłączone z treningu, metryki obejmujące dokładność i błąd kalibracji, zmieniany porządek opcji, sparowane testy statystyczne, identyczny zestaw testowy dla porównywanych modeli — i podaje, że model „wypada na poziomie wiodących modeli decyzyjnych i przed innymi otwartymi modelami decyzyjnymi ocenianymi według tej samej metodologii”. Wymienia jego mocne obszary (rozumowanie, stosowanie reguł, odporność na formatowanie promptów) oraz słabe (specjalistyczna wiedza dziedzinowa, języki inne niż angielski).
A potem nie wypisuje nic. Żadnej wartości dokładności, żadnego błędu kalibracji, żadnej tabeli dla poszczególnych benchmarków. Samodzielnie raportowane ograniczenia są prawdziwe i użyteczne — wyniki zmieniają się wraz ze sformułowaniem i kolejnością opcji, źle sformułowane pytanie wciąż zwraca wynik, kalibracja jest najsilniejsza w przypadku znanych typów zadań, nie są generowane żadne wyjaśnienia — ale lista ograniczeń to nie pomiar. Zatem ten kompromis jest wyjątkowo klarowny: Laya daje ci liczby, które możesz próbować sfalsyfikować na własnych danych, a Microsoft daje ci postawę zgodności i kontekst 32K, w którym możesz umieścić długi dokument.

Co faktycznie daje różnica rozmiarów
To, że Laya jest mała, nie jest tu kompromisem — to jest zamierzone. Ponieważ każda opcja jest oceniana na własnym tokenie [MASK] i poddawana softmaxowi względem opcji tego pytania, przestrzeń odpowiedzi jest składana w momencie żądania, a nie wbudowana na stałe w głowicę słownictwa — dlatego schemat, który wymyślisz dziś po południu, nie wymaga ponownego trenowania, a model mieści się w 322–421 milionach parametrów. Wielojęzyczny checkpoint działa około 2,2 razy szybciej niż angielski, router wykrywa pismo w czasie poniżej pół milisekundy, a przepustowość wsadowa osiąga od 103 do 332 pytań na sekundę na jednym T4. W przypadku obciążenia, które ocenia każde zgłoszenie, każdy pobrany dokument lub każdą proponowaną akcję, ta przepustowość jest cechą, a nie liczbą parametrów.
Koszty tej konstrukcji są równie konkretne i warte wskazania w zestawieniu z alternatywą Microsoftu. Angielski checkpoint ma okno 512 tokenów; wielojęzyczny — 1024, rozszerzalne w kierunku 8K. Microsoft-Decision-1 ma 32 768. Długi wątek pomocy, pełna umowa lub wielostronicowy dokument polityki w ogóle nie mieszczą się w oknie Laya, a żadna szybkość nie zrekompensuje obcięcia. Laya odpowiada na jeden zestaw pytań na przebieg w przód, z udokumentowanym budżetem tokenów na opcję; Microsoft dokumentuje pojedyncze wywołanie obejmujące do 32 tys. tokenów, bez limitu na pytanie. A warto znać słabość Laya jako klasyfikatora na tle konkurencji: uzyskuje 0,425 w Banking77 wobec 0,870 Jev, co jest właśnie rodzajem drobnoziarnistego problemu intencji o wysokiej kardynalności, w którym etap specjalizacji ma największe znaczenie.

Porównanie kosztów, które {{1}}nie jest oparte na tokenach{{/1}}
Laya jest darmowa w punkcie użycia — self-hosted, Apache 2.0, wyceniona na koszt self-hosted wynoszący „$0” — a jej rzeczywista cena to przebieg dostrajania, który jesteś jej winien, zanim będzie dobra w twoim zadaniu. Microsoft-Decision-1 to hostowane API Foundry ze stawką za token, która nie jest podana na stronie modelu, bez wag do pobrania, bez ścieżki dostrajania i z wyłączonym wnioskowaniem wsadowym. Jedno to projekt etykietowania danych z góry, drugie to rozliczane wywołanie. Które jest tańsze, zależy wyłącznie od wolumenu, a próg opłacalności jest wysoki: enkoder 421M oceniający 300 elementów na sekundę na wynajętym T4 jest bardzo trudny do pobicia w przeliczeniu na decyzję, gdy zostanie wytrenowany.
Tu właśnie OrcaRouter zasługuje na swoje miejsce w potoku zbudowanym na którymkolwiek z tych modeli — i to wyłącznie po stronie generatywnej. Nie hostujemy ani Microsoft-Decision-1, ani Laya: oba zwracają prawdopodobieństwa, a nie tekst, żadnego z nich nie ma w naszym katalogu, a endpoint do scoringu nie jest celem typu chat-completions. To, co mamy, to model, który generuje to, co jest oceniane — wersję roboczą odpowiedzi, proponowane wywołanie narzędzia, kandydacką odpowiedź, którą następnie ocenia dostrojona głowica Laya. To ponad 200 modeli za jednym kluczem zgodnym z OpenAI w cenach katalogowych dostawcy przekazywanych dalej z 0% marży, z automatycznym przełączaniem awaryjnym, gdy jedna ścieżka obsługi zawodzi. W pętli, która ocenia wszystko, co generuje, wywołanie generowania jest tą częścią, która może się przewrócić, a failover to właśnie to, co utrzymuje kolejkę scoringu w ruchu.

Który wybrać
Wybierz Laya jeśli Twoje decyzje przychodzą w wielu językach, jeśli Twój wolumen jest wystarczająco wysoki, by cena za token miała znaczenie, jeśli masz etykiety i tydzień na dostrojenie, albo jeśli musisz uruchamiać scoring na sprzęcie w obrębie własnej infrastruktury. Zaakceptuj okno od 512 do 1024 tokenów oraz to, że bazowy checkpoint będzie niemal losowy, dopóki go nie wyspecjalizujesz, a otrzymasz model decyzyjny, który uczciwie przyznaje, że jest punktem wyjścia.
Wybierz Microsoft-Decision-1, jeśli Twoje dane wejściowe to długie dokumenty, a nie zgłoszenia; jeśli Twoją bramą wdrożeniową jest uwierzytelnianie Azure, ujednolicone rozliczenia i pakiet Responsible AI, a nie pobranie; jeśli 25 języków pokrywa Twój ruch; albo jeśli wolisz w ogóle nie posiadać modelu. Zaakceptuj, że pierwszą krzywą kalibracji wyznaczysz samodzielnie, i zarezerwuj popołudnie na oznaczonej próbce, aby to zrobić — ponieważ w przeciwieństwie do Laya, ten nie poda Ci liczby ECE, z którą mógłbyś się spierać.
