
„System One” jako kategoria modeli: gdzie plasuje się w niej Jev 1.13
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 349 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 208 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
"System One" to termin kategorii, którym TypeSafe określa swój podział na model, który decyduje, i model, który pisze, a Jev 1.13 (typesafe/jev-1.13) jest jego pierwszym członkiem — modelem, który zwraca odpowiedzi typowane zamiast zdań. To nie jest nowy model. TypeSafe udostępnił Jev 15.09.2026, a ta strona nie jest tekstem premierowym: model ma piętnaście dni i wykracza poza siedmiodniowe okno, dla którego pisze ten blog. W tym oknie OrcaRouter dodał model do swojego katalogu 24.09.2026 i otworzył kartę modelu Jev 1.13 pod adresem https://www.orcarouter.ai/models/typesafe/jev-1.13 — pierwszy raz, gdy można go wywołać przez bramę zewnętrznego dostawcy zamiast wyłącznie przez własny endpoint TypeSafe. Idea tej kategorii jest powodem, dla którego ta strona istnieje; zmiana w sposobie serwowania jest powodem, dla którego ma dzisiejszą datę.
Prosta wersja tej kategorii: LLM-owi zadaje się pytanie, a on pisze odpowiedź do przeczytania przez człowieka. Modelowi System One zadaje się pytanie, a on zwraca wartość, na podstawie której program ma podjąć rozgałęzienie. Własne sformułowanie TypeSafe jest takie, że „LLM-y produkują słowa dla ludzi”, podczas gdy „Jev produkuje decyzje z typami i bardziej przypomina kod: niezawodny, szybki, spójny wewnętrznie i bezpieczny pod względem typów”. To zdanie to cała kategoria ściśnięta w jednej klauzuli i warto je powoli rozpakować, ponieważ cztery przymiotniki wykonują różną ilość pracy, a jeden z nich wykonuje jej więcej niż pozostałe.
Co tak naprawdę głosi „bardziej jak kod”
Rozpatrz te cztery twierdzenia po kolei, ponieważ nie są to cztery przeformułowania stwierdzenia „jest lepsze”.
• Niezawodność — kształt wyjścia jest z góry ustalony. Deklarujesz pytanie; odpowiedź może zostać zwrócona wyłącznie jako jedna z wartości, które dopuściłeś. TypeSafe stwierdza wprost, że „model nigdy nie popełnia błędów typu” i zauważa, że jest to jedyne ich twierdzenie, które jest „matematycznie niemożliwe” do obalenia kontrprzykładem, ponieważ wartość, której nie ma w zadeklarowanym przez Ciebie zbiorze, nie jest wartością, którą model może wygenerować.
• Szybko — wszystkie odpowiedzi są generowane w jednym przebiegu, a nie token po tokenie. W wpisie premierowym TypeSafe ujęto to tak: „Jev wyprowadza wszystkie prawdopodobieństwa równolegle, zamiast generować autoregresyjnie token po tokenie”. W naszym własnym siedmiodniowym oknie serwowania kończącym się 2026-09-30 mediana czasu do pierwszego tokenu dla typesafe/jev-1.13 wynosi 151 ms, a p95 — 247 ms.
• Samospójność — ten sam stan przy tych samych pytaniach zwykle daje te same odpowiedzi. Analogia do programowania czyni to czytelnym, ale właśnie w tym miejscu analogia przestaje być dowodem: determinizm kompilatora jest właściwością jego konstrukcji, podczas gdy to jest twierdzeniem o zachowaniu. Uczciwym odczytem są tu nasze własne pomiary — odsetek błędów w ruchu na naszym placu zabaw w tym samym siedmiodniowym oknie wynosi 0,49%, więc jest to samospójne tak, jak samospójna jest dobra funkcja, a nie tak, jak samospójna jest arytmetyka.
• Bezpieczny typowo — i to właśnie ten, który ma największe znaczenie. Bezpieczny typowo nie jest tu przymiotnikiem jakościowym; to stwierdzenie o tym, gdzie model znajduje się względem kontrolera typów. W zwykłym potoku generatywnym system typów zaczyna działać po zakończeniu pracy modelu: model pisze tekst, parser zgaduje kształt, walidator go sprawdza, a ścieżka awaryjna obsługuje przypadki, w których zgadywanie było błędne. Model System One przenosi deklarację typu przed wywołanie. Trzy prymitywy opisane w naszej karcie to system typów: noul, osąd prawda/fałsz zwracany ze skalibrowanym prawdopodobieństwem; choice, jedna etykieta wybrana spośród maksymalnie 255 etykietowanych opcji; oraz score, ocena w uporządkowanej skali od 2 do 10 poziomów. Wybierasz prymityw, podajesz etykiety lub kryteria, a zwracana wartość pochodzi z tego zbioru.
TypeSafe podaje jedną różnicę między swoją dokumentacją a naszą, którą warto raczej odnotować niż rozstrzygać: dokumentacja dostawcy pokazuje przykład Score z indeksowaniem od zera, podczas gdy nasza karta dokumentuje skalę jako 2 do 10 poziomów. Oba opisują ten sam prymityw. Jeśli budujesz próg, przeczytaj stronę dostawcy, aby poznać dokładne indeksowanie, na którym działa Twój SDK.
Dwa tryby awarii, które przestają istnieć
Ciekawa konsekwencja „bez prozy" nie ma charakteru estetycznego. Polega ona na tym, że dwie awarie dominujące w produkcyjnych potokach generatywnych są w tym projekcie nieobecne, a nie łagodzone przezeń.
Dryf formatu jest pierwszy. LLM poproszony o zwrócenie JSON-a przez większość czasu zwraca JSON, a przez resztę czasu coś bliskiego JSON-owi — końcowy komentarz, blok markdown, pole przemianowane na synonim, obiekt zagnieżdżony tam, gdzie schemat oczekiwał ciągu znaków. Poprawki na poziomie promptu (mocniejsze instrukcje, przykłady few-shot, schemat w wiadomości systemowej) to próby utrzymania kształtu, który model może swobodnie porzucić, ponieważ kształt jest prośbą, a nie ograniczeniem. Sposób ujęcia tego w TypeSafe wyraźnie pokazuje kontrast: w przypadku ciągów znaków „możliwe wyniki i struktura” są jedynie prośbą, a odpowiedzi „wymagają parsowania i walidacji”, przy czym „zawsze istnieje pewne ryzyko, że AI wymknie się spod kontroli”. Gdy możliwe wyniki są zadeklarowane z góry, dryf nie ma dokąd uciec.
Nieparsowalne dane wyjściowe to ten drugi przypadek, a właściwie ta sama awaria w gorszym momencie — nie pole, które wróciło z drobnym błędem, lecz odpowiedź, której parser nie potrafi w ogóle odczytać, pojawiająca się w najmniej dogodnym punkcie przepływu pracy. Model, który emituje wartość typowaną, nie ma takiego stanu.
To argument strukturalny i tak też należy go przedstawić. Nie mówi on nic o tym, czy pojedyncza odpowiedź jest poprawna — pytanie wyboru może wskazać niewłaściwą etykietę, a noul może zwrócić true z wysoką pewnością, gdy uczciwa odpowiedź brzmi „fałsz". Znika natomiast kategoria błędów, które wychwyciłby parser. To realne i użyteczne ograniczenie i nie jest to to samo twierdzenie co „odpowiedzi są poprawne".
Dlaczego cena jest kształtem, a nie rabatem
Cena modelu wynosi $0.042 za milion tokenów wejściowych, a dane wyjściowe rozliczane są po zerowej stawce — i to zero nie jest stawką promocyjną, lecz artefaktem konstrukcji. Model, który generuje trzy tokeny ustrukturyzowanej odpowiedzi, nie ma objętości wyjściowej, którą można by mierzyć, więc rozliczanie za token wyjściowy nie ma się do czego przyczepić. Kształt rozliczeń to opłata za token wejściowy i decyzja. Nasz katalog przekazuje cenę katalogową dostawcy z marżą 0%, więc $0.042 to liczba TypeSafe, a nie liczba, którą ustaliliśmy, a zmiana ceny przez dostawcę byłaby aktywna tego samego dnia.
Postaw oba kształty obok siebie, a różnica nie jest procentowa. Koszt potoku generatywnego skaluje się z tym, ile model mówi: przy tej samej decyzji rozwlekła odpowiedź kosztuje więcej niż zwięzła, a model rozumowania typu chain-of-thought nalicza opłaty za tokeny, które zużywa na myślenie przed udzieleniem odpowiedzi — niezależnie od tego, czy odpowiedź staje się przez to lepsza. Koszt wywołania System One skaluje się z tym, ile mu pokażesz — czyli ze stanem i pytaniami. Zadaj jedno pytanie do długiego dokumentu, a płacisz za cały dokument. Spakuj czterdzieści pytań wobec tego samego stanu (budżet wejściowy na naszej karcie to 65 536 tokenów łącznie na stan i pytania, czyli około 64K; jeśli spotkałeś się z liczbą „około 32 000 tokenów" we wcześniejszych artykułach OrcaRouter, to budżet samego stanu, a nie konkurencyjny łączny limit), a płacisz za dokument raz i dostajesz z powrotem czterdzieści decyzji.
Dlatego właściwą jednostką dla tej klasy jest koszt na decyzję, a nie koszt na token — i dlatego licznik działa odwrotnie, niż oczekuje większość zespołów. Typowym posunięciem w generatywnej redukcji kosztów jest „sprawić, by model mówił mniej”. Tutaj nie ma nic, co można by powiedzieć mniej.

Własne liczby TypeSafe — raportowane przez dostawcę i niepowtórzone niezależnie — są wymierzone wprost w to porównanie: „193,6x szybciej, 444,6x taniej”, z przypisem „na podstawie przepływów pracy dla zadań System One (dowód)” oraz rozpisany przykład: „Koszt TypeSafe AI 0,000081 USD, ukończono w 0,114 s / Koszt LLM 0,013880 USD, ukończono w 8,566 s”. Strona główna podaje też „42 USD za miliard tokenów wejściowych” wobec „238x niższej ceny tokenów wejściowych niż Claude Fable 5.1”. Traktuj to wszystko jako argument dostawcy, a nie jako zmierzony wynik: wpis o premierze przyznaje, że „nasze publikowane ewaluacje są zazwyczaj uruchamiane z naszych laptopów na Zachodnim Wybrzeżu” oraz że „nie możemy udowodnić, że nie jest to dotowane; będziemy potrzebować długiego okresu, by udowodnić trwałość naszego cennika (który, jak oczekujemy, będzie spadać, a nie rosnąć)”. Te dwa ustępstwa pochodzą od samego dostawcy i stanowią właściwą ramę dla każdego mnożnika na stronie.
Kalibracja to druga połowa pomysłu.
Gdyby kategoria obejmowała tylko „ustrukturyzowane wyjście”, opisywałaby wywoływanie funkcji z dodatkowymi krokami. To, co czyni ją odrębną, to fakt, że każda odpowiedź przychodzi z prawdopodobieństwem, a prawdopodobieństwa są celem treningowym. TypeSafe nazywa tę metodę Reinforcement Learning for Calibrated Decisions (RLCD) — to ich termin, a nie ogólny akronim — a tabela porównawcza w poście premierowym stawia ją obok RLHF i RLVR: RLHF optymalizuje pod kątem tego, co preferują ludzcy oceniający, RLVR pod kątem wyników, które można sprawdzić programowo, a RLCD pod kątem „odpowiedzi z epistemicznie uczciwymi prawdopodobieństwami w zadaniach System One”.
Praktyczna różnica polega na tym, do czego służy prawdopodobieństwo. W potoku generatywnym oszacowanie pewności to drugie generowanie: pytasz model, jak bardzo jest pewien, a on zapisuje liczbę, która sama w sobie jest prozą o tych samych trybach awarii. Tutaj prawdopodobieństwo wraca razem z decyzją, w tym samym przebiegu, i to właśnie na nim opierasz rozgałęzienie. TypeSafe sam ujmuje korzyść tak, że model, który potrafi wykonać zadanie w 95% przypadków, ale „nie mówi, kiedy trafia w te 5%”, nie może zostać użyty do automatyzacji zadania; pewność daje ci miejsce, w którym możesz umieścić eskalację — do człowieka albo do modelu rozumującego.
Strona główna TypeSafe określa to jako „Zero halucynacji”, wyjaśniając, że każda decyzja niesie ze sobą oszacowanie pewności, dzięki czemu oprogramowanie może „działać, gdy pewność jest wysoka, i eskalować, gdy nie jest”. Przeczytaj to uważnie: to twierdzenie o oszacowaniach pewności, a nie twierdzenie, że żadna odpowiedź nigdy nie jest błędna. Nasza własna karta stanowi przeciwwagę — wskaźnik błędu na poziomie 0,49% w ciągu siedmiu dni kończących się 2026-09-30, na naszym ruchu, mierzony przez nas. Ta wartość to okno kroczące, a nie stały zestaw testowy: kilka dni wcześniej w tym samym oknie wynosiła 0,57% i znów się zmieni.
Gdzie System One znajduje się obok System Two
Słownictwo szybkie/wolne jest znacznie starsze niż TypeSafe. Pochodzi z książki Kahnemana pt. Myślenie szybkie i wolne, a już na długo przed tym było ono zapożyczane przez badaczy AI — etykietę „System 2” przypisywano modelom chain-of-thought i rozumowania deliberatywnego na długo przed powstaniem TypeSafe, a TypeSafe nie twierdzi, że ukuto którekolwiek z tych określeń. To, co zrobili, to zastosowanie tego rozróżnienia do granicy produktu, a nie do trybu promptowania.
• Model rozumowania Systemu Drugiego zużywa więcej mocy obliczeniowej, zanim odpowie, i radzi sobie lepiej z problemami, które tego wymagają. Jego wynik to nadal proza, a dodatkowe obliczenia są rozliczane jako tokeny wyjściowe.
• Model Systemu 1 w rozumieniu TypeSafe nie myśli dłużej, aby odpowiadać lepiej. Odpowiada w jednym przebiegu, a to, co poświęca na rzecz szybkości, to zdolność do wytworzenia czegokolwiek poza wartością typowaną.
• Te dwa elementy uzupełniają się w przepływie pracy, a nie konkurują ze sobą w porównaniu. Wywołanie System One obsługuje decyzje, które muszą być szybkie, tanie i czytelne; model rozumowania otrzymuje przypadki, które wskaźnik pewności oznaczył jako niepewne. To typowane wyjście sprawia, że przekazanie jest czyste — do następnego etapu przekazujesz wartość i prawdopodobieństwo, a nie zdanie do ponownego parsowania.
Śliskość słownictwa pojawia się w traktowaniu „modelu System One” jako ugruntowanej kategorii, którą przyjęli inni dostawcy. Nie ma na to dowodów i tej strony nie należy czytać jako twierdzenia, że tak jest. TypeSafe używa tego terminu na określenie własnej klasy modeli; zastrzeżenie w naszej własnej karcie mówi to samo przez przemilczenie, wymieniając jeden typ punktu końcowego dla jednego modelu. Jeśli inne laboratorium zacznie używać tego wyrażenia w odniesieniu do tej samej architektury, będzie to fakt wart odnotowania i do jego zgłoszenia będą potrzebne ich własne słowa.

Nasza karta wymienia też postrzępienie jako część uczciwej granicy, a nie jako niespodziankę: dziewięć nazwanych trybów awarii. Wpisy dotyczące odczytu dosłownego i pośredniości to te, które wynikają bezpośrednio z analogii „bardziej jak kod” — model, który odpowiada na pytanie, które napisałeś, a nie na to, które miałeś na myśli, zachowuje się jak funkcja, która zrobiła dokładnie to, co mówił kod. Z wpisem dotyczącym liczenia jest inaczej. Model, który „rozpoznaje kształt odpowiedzi, zamiast zliczać”, wcale nie przypomina kodu, dlatego rekomendacja samego TypeSafe brzmi: licz w kodzie, a tam, gdzie naprawdę potrzebna jest ocena, zadawaj jedno pytanie na pozycję i samodzielnie sumuj odpowiedzi.
Dwa ograniczenia, które kształtują projekt, a nie wynik
Oba pochodzą z tego samego miejsca: brak ciągów znaków oznacza, że nie ma czego strumieniować ani niczego wysyłać w kawałkach.
• Bez strumieniowania — pierwszy wynik to gotowa odpowiedź, więc wywołanie System One to pojedyncza odpowiedź, a nie strumień. Pytanie nie brzmi, czy może strumieniować, lecz co byłoby strumieniowane.
• Jeden kształt żądania — model jest obsługiwany przez POST /v1/systemone w naszym katalogu, a nie w kształcie chat-completions, i to jest uczciwa wersja starszego twierdzenia, że „mówi własnym kształtem żądania”. To realna różnica w sposobie jego wywoływania: na wejściu jest obiekt stanu i mapa nazwanych pytań; na wyjściu ustrukturyzowana odpowiedź na każde pytanie. Napiszesz dla niego mapper, a ponieważ dane wyjściowe są typowane, mapper stanowi całą integrację — nie ma pod nim żadnej warstwy defensywnego parsowania.
Warto wiedzieć, zanim przeprowadzisz test obciążeniowy: opóźnienie nie jest jednakowe dla wszystkich typów pytań. TypeSafe wyjaśnia dlaczego, ich własnymi słowami — „W przypadku wyborów o większej liczbie opcji stosujemy dwuetapowy system: oceniamy niezależnie, a następnie dokonujemy jawnego wyboru, stąd sporadyczne spowolnienie”. Decyzja routingu z 4 opcjami i klasyfikacja z 200 opcjami to na papierze ten sam prymityw, a w praktyce różny nakład pracy. Nasze dzienne mediany z siedmiu dni kończących się 2026-09-30 wynoszą 175, 170, 161, 170, 147, 143 ms. Jeden dzień w tym szeregu, 2026-09-28, miał p95 na poziomie 2,448 ms — prawdziwa jednodniowa wartość odstająca, która uczciwie należy do tego szeregu, ale nie oddaje charakteru usługi.

Inną rzeczą, którą warto wiedzieć przed pierwszą integracją, jest to, z czym się łączysz. Narzędzia wokół Jev są open source na licencjach MIT i Apache-2.0 — zestawy SDK dla Pythona i JavaScriptu, adapter, który udostępnia tego samego klienta opartego na zwykłych API LLM, kod workflow-evals oraz zestaw umiejętności agentowych, wszystko w publicznych repozytoriach TypeSafe, z liczbami gwiazdek i datami push, które zmieniały się tak niedawno jak 2026-09-26 i 2026-09-29. Model nie jest. Nie ma repozytorium z wagami: architektura Jev, liczba parametrów, moc obliczeniowa użyta do treningu i wagi nie zostały opublikowane, a czytelnik, który to sprawdza, nie powinien dać się zwieść trzem repozytoriom w tej organizacji, które są forkami niepowiązanych projektów — forkowi vLLM, wydaniu modelu dyfuzyjno-językowego z 2025 roku i providerowi Pulumi. Żadne z nich nie mówi nic o tym, jak zbudowano Jev. Jednozdaniowa odpowiedź brzmi: narzędzia są otwarte, a model nie.
Uruchamiając to dzisiaj, i co się zmienia dla czytelnika
Jev 1.13 jest dostępny w OrcaRouter jako typesafe/jev-1.13, osiągalny na tym samym kluczu co ponad 200 innych modeli, a cena katalogowa dostawcy jest przekazywana bez marży (0%). Praktyczna wartość tego na stronie poświęconej kategorii jest wąska i warto ją ująć dokładnie: wypróbowanie modelu System One nie wymaga już osobnego konta, osobnego klucza i osobnej faktury za model, o którym możesz jeszcze nie wiedzieć, że go chcesz. Znajduje się obok generatywnej połowy tego samego przepływu pracy — klasyfikator i generator tekstu na jednym poświadczeniu, w jednym miejscu, wraz z licznikami tego, co faktycznie wywołałeś.
Nic tutaj nie zmienia tego, czym jest ten model. Został uruchomiony 2026-09-15, a TypeSafe wciąż opisuje go jako wczesny dostęp; to, czym jest, nie zmieniło się od tego czasu. To, co zmieniło się 2026-09-24, to fakt, że czytelnik może teraz przekonać się, ile kosztuje go to w praktyce, bez uprzedniego zobowiązywania się do współpracy z drugim dostawcą. Jeśli czekałeś, żeby sprawdzić, czy ta kategoria jest warta prototypu, to właśnie to się zmieniło.
