Wygenerowana karta główna zatytułowana „Czym jest TypeSafe AI?” z podtytułem „Laboratorium stojące za Jev 1.13 – decyzje typowane, nie proza”, nad trzema opisanymi liniami: „Firma: TypeSafe AI, San Francisco”, „Model: Jev 1.13 (typesafe/jev-1.13), wydany 2026-09-15” i „Kierowany przez OrcaRouter od 2026-09-24”. Logo OrcaRouter jest złożone w prawym dolnym rogu.
Guides & Insights

Czym jest TypeSafe AI? Laboratorium stojące za Jev 1.13 podejmuje decyzje, a nie tworzy zdania

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

TypeSafe AI to małe laboratorium z San Francisco, które sprzedaje model, który nie potrafi napisać zdania, a Jev 1.13 (typesafe/jev-1.13) to właśnie ten model. Przyjmuje fragment stanu — wiadomość e-mail, wiersz logu, zgłoszenie do wsparcia, blob JSON — oraz zestaw nazwanych pytań i zwraca jedną typowaną odpowiedź na każde pytanie, każdą z własną wartością ufności. Bez prozy, bez kodu, bez wyjaśnień i bez okna czatu. Sam model został wydany 2026-09-15, więc nie jest nowy i nic tutaj nie jest historią premiery: ta strona istnieje z powodu mniejszej, możliwej do datowania zmiany. W dniu 2026-09-24 OrcaRouter dodał typesafe/jev-1.13 do swojego katalogu i otworzył kartę modelu pod własnym adresem, co było pierwszym razem, gdy Jev można było wywołać przez bramę innej firmy, a nie tylko przez własny punkt końcowy TypeSafe. To jest to wydarzenie, na dzień 2026-09-30 ma ono sześć dni, i jest powodem, dla którego czytelnik, który nie ma jeszcze umowy z TypeSafe, może teraz umieścić model System One na tym samym kluczu co modele generatywne, obok których ma działać. Wszystko inne na tej stronie to tło dotyczące firmy, która go stworzyła.

Uczciwe ujęcie kwestii czasu, bo ma to znaczenie dla tego, jak wiele z tego jest zweryfikowane: Jev zadebiutował ponad dwa tygodnie temu i jest ogólnie dostępny od 2026-09-21, kiedy TypeSafe usunął listę oczekujących. W siedmiodniowym oknie mieści się zmiana routingu, a nie model. Jeśli przyszedłeś tu, oczekując recenzji premiery, premiera już się odbyła, a kilka innych tekstów ją omówiło.

Strona firmowa z manifestem i bez diagramu architektury

TypeSafe opisuje siebie, we własnym opisie meta, jako „laboratorium AI budujące natywną dla maszyn infrastrukturę inteligencji do automatyzacji”, z systemami „zaprojektowanymi do podejmowania decyzji w oprogramowaniu”. Jego strona główna jest oznaczona Wersja 0.01, a w stopce widnieje „Made in SF”. Istnieje manifest argumentujący, że najkrótsza droga do zmiany gospodarczej w kształcie AI prowadzi przez uczynienie inteligencji komponowalną, tak aby oprogramowanie mogło wywoływać osąd semantyczny w taki sam sposób, w jaki wywołuje funkcję; własne podsumowanie planu firmy to dostarczenie formy komponowalnej AI natywnej dla maszyn, następnie uczynienie jej wystarczająco niezawodną dla prawdziwej automatyzacji, a potem zaoferowanie abstrakcji wyższego poziomu, wystarczająco stabilnych, by można było na nich budować. Jej slogan to „Budujemy prod, nie Boga”. Strona zespołu wymienia trzech założycieli — Diogo Almeida jako CEO, Sasha Sheng jako COO i Erik Gafni jako CTO. To wszystko, co firma mówi o sobie: stanowisko, produkt, trzy nazwiska i żadnych liczb na temat samej firmy.

To, czego strona nie zawiera, to rzecz, po którą inżynier oceniający nową zależność sięga w pierwszej kolejności. Nie ma strony architektury, liczby parametrów, ujawnienia dotyczącego obliczeń treningowych ani karty modelu w sensie akademickim. Własny dashboard benchmarkowy TypeSafe jest wciąż oznaczony jako oczekujący. Dla firmy, której argumentacja opiera się na niezawodności, zakres ujawnień jest skąpy, i jest to fakt dotyczący tego, co zostało opublikowane, a nie oskarżenie o to, co jest ukrywane.

A headless-browser capture of the TypeSafe AI homepage as it stood on 2026-09-30. A navigation bar reads 'TypeSafe AI | Manifesto | Our Team | Docs | Sign In'. Under it a banner announces 'NO MORE WAITLIST / TypeSafe is now open to everyone' above a 'Create your account' button, next to a blog teaser reading 'TypeSafe announces System One models and Jev' with a 'Read more' link. Lower down, a section headed 'Introducing Jev - the First Public System One Model: Jev Gives AI The Properties Of Code' appears beside a 'Join Discord' button and the tagline fragment 'Intelligence beyond chat'.

System One: kategoria i dlaczego nazwa jest zapożyczona

Jev jest pierwszym z tego, co TypeSafe nazywa modelami System One. Nazwa pochodzi od podziału Daniela Kahnemana na szybkie, intuicyjne myślenie Systemu 1 i wolne, rozważne rozumowanie Systemu 2, a firma mówi o tym wprost w swoim poście zapowiadającym premierę — przyznaje też, że „myślenie Systemu 1” ma zabarwienie skłonności do błędów, i przekonuje, że modele te można uczynić bardziej niezawodnymi niż alternatywy. TypeSafe nie ukuła tego terminu i nie jest jego właścicielem.

Praktyczna treść tej kategorii to celowy podział pracy: model, który decyduje, i model, który pisze. Arytmetykę, porządkowanie dat, liczenie i porównywanie ciągów znaków należy pozostawić zwykłemu kodowi, w którym są dokładne, a ocenę semantyczną przekazać Jevowi. Potrafi odpowiedzieć na trzy typy pytań:

• noul — osąd typu prawda/fałsz, zwracany wraz ze skalibrowanym prawdopodobieństwem

• wybór — wybierz jedną z maksymalnie 255 opcji z etykietami

• wynik — oceń na uporządkowanej skali; nasza karta publikuje poziomy 2-10, a własna dokumentacja TypeSafe pokazuje przykład indeksowany od 0, więc traktuj poziomy dostawcy jako definicję, a 2-10 jako to, co publikuje karta

Każde pytanie ma własne instrukcje, a dla wyboru i oceny – własne kryteria. Żądania powyżej około 64 tys. tokenów wejściowych są odrzucane, zanim dotrą do modelu, a odpowiedzi nie są strumieniowane. Dostawca osobno dokumentuje budżet stanu — stan plus pojedyncze najdłuższe pytanie — na 32 tys. tokenów, co jest węższą wartością niż kontekst 65 536 tokenów na karcie i nie stanowi sprzeczności z nim.

Ich teza, ich własnymi słowami

TypeSafe formułuje tę tezę lepiej, niż zrobiłoby to jakiekolwiek streszczenie, więc przytaczam ją dosłownie: „LLM-y produkują słowa dla ludzi. Jev produkuje typowane decyzje i bardziej przypomina kod: niezawodny, szybki, samospójny i bezpieczny typowo”. Metoda treningowa, która za tym stoi, również jest ich autorstwa, a to termin wart precyzyjnego przypisania, bo został podchwycony gdzie indziej tak, jakby był ogólny. TypeSafe nazywa ją Reinforcement Learning for Calibrated Decisions, czyli RLCD, i przeciwstawia RLHF oraz RLVR: tamte optymalizują ludzkie preferencje lub programowo weryfikowalne nagrody, natomiast RLCD — jak ujmuje to firma — celuje w „odpowiedzi z epistemicznie uczciwymi prawdopodobieństwami w zadaniach System One”. Traktuj RLCD jako własny termin ukuty przez TypeSafe, a nie jako ugruntowany skrót w literaturze.

Liczby, od których zaczynają, i kto wybrał obciążenie pracą

Strona główna otwiera się hasłem „193,6x szybciej, 444,6x taniej”, z przypisem do przepływów pracy dla zadań System One. Pod nim znajduje się opracowany przykład: TypeSafe AI przy $0,000081 i 0,114 sekundy w porównaniu z LLM-ami przy $0,013880 i 8,566 sekundy. Niżej: „$42 za miliard tokenów wejściowych. 238x niższa cena tokenów wejściowych niż Claude Fable 5.1.” Jest też sekcja zatytułowana „Zero halucynacji”, która po bliższym przyjrzeniu się jest twierdzeniem o oszacowaniach pewności, a nie dowodem na zero błędów: każda decyzja Jev zawiera oszacowanie pewności, dzięki czemu oprogramowanie może działać, gdy pewność jest wysoka, i eskalować, gdy nie jest. Wszystkie cztery to liczby TypeSafe, uzyskane na obciążeniach wybranych przez TypeSafe, i żadna z nich nie została niezależnie zreplikowana. Sam wpis o premierze mówi, że zespół spodziewa się, iż jego 193,6x i 444,6x znajdą się w górnej części rzeczywistych korzyści, i zauważa, że przepływy pracy zbudował jego własny zespół ds. możliwości, a odpowiedzi referencyjne wygenerowały konkurencyjne modele. Nasze własne siedmiodniowe dane z serwowania tego samego modelu wskazują na współczynnik błędów na poziomie 0,49%, co jest innym pomiarem na innym obciążeniu i stanowi uczciwą przeciwwagę dla odczytywania „zera” jako wartości absolutnej.

Czego nie opublikowali

Architektura Jev, liczba parametrów, moc obliczeniowa treningu i wagi są niepublikowane, a w organizacji GitHub firmy nie ma repozytorium z wagami. Sprawdzone 2026-09-30: ta organizacja ma jedenaście publicznych repozytoriów; te istotniejsze to narzędzia, wszystkie na licencji MIT lub Apache-2.0 — repozytorium umiejętności agentowych, Python SDK, TypeScript SDK, adapter klienta typu drop-in oparty na innych API LLM, kolekcja modułów Dagger, opublikowany kod do ewaluacji przepływów pracy, węzeł n8n oraz własna strona organizacji. Liczby gwiazdek i daty push się zmieniają, więc lepiej odczytywać je na bieżąco, a nie z tej strony.

Trzy z jedenastu to forki niepowiązanych projektów: vLLM, LLaDA oraz provider Pulumi dla ClickHouse Cloud. Są to forki czyjejś pracy i nie mówią nic o tym, jak zbudowano Jev — w szczególności nic o tym, że Jev opiera się na dyfuzji. Jednozdaniowa odpowiedź na pytanie, czy Jev jest open source, brzmi: narzędzia są otwarte, a model nie.

To, co sobie przyznają

Dwa przyznania z wpisu o premierze są warte więcej niż większość zastrzeżeń dostawców, ponieważ wskazują dokładnie te miejsca, w których dowody są słabe. O cenie: „Nie możemy udowodnić, że nie jest dotowane; będziemy potrzebować długiego okresu, aby udowodnić trwałość naszego cennika (który, jak oczekujemy, będzie spadał, a nie rósł)”. O szybkości: „nasze publikowane ewaluacje są na ogół przeprowadzane z naszych laptopów na Zachodnim Wybrzeżu (tam obecnie znajduje się nasza usługa)”. Jest jeszcze trzecie, bardziej przydatne dla każdego, kto na tym buduje: w przypadku zbiorów wyboru o wysokiej kardynalności Jev uruchamia dwuetapowy system, który ocenia niezależnie, a następnie dokonuje wyraźnego wyboru, „stąd okazjonalne spowolnienie”. To dostawca wyjaśnia, dlaczego opóźnienie nie jest jednakowe dla wszystkich typów pytań, i to jest coś, czego zwykle dowiadujesz się z wątku pomocy technicznej.

Gdzie można do tego faktycznie zadzwonić na dzień dzisiejszy

Przez własne API TypeSafe, gdzie model jest ogólnie dostępny, a strona główna wciąż używa własnego określenia dostawcy „early access” — to sformułowanie jest aktualne i warto je zachować, natomiast „waitlisted” zostało wycofane: dokumentacja podaje konkretne limity operacyjne (100 tys. tokenów na sekundę, 40 żądań na sekundę, 429 z backoffem SDK po przekroczeniu któregokolwiek z nich) i nie zawiera żadnych sformułowań o liście oczekujących. A od 2026-09-24 przez OrcaRouter.

To, co udostępniamy, warto przedstawić precyzyjnie, ponieważ właśnie kształt wywołania jest tym, co się różni. Wpis w katalogu to typesafe/jev-1.13, nazwany TypeSafe: Jev 1.13, z obsługiwanym typem endpointu „systemone” — więc dostęp do niego odbywa się przez POST /v1/systemone, a nie przez kształt chat-completions OpenAI, bez strumieniowania, tekst na wejściu i ustrukturyzowany JSON na wyjściu, do około 64K tokenów wejściowych łącznie dla stanu i pytań. Wejście kosztuje $0,042 za milion tokenów, a wyjście jest rozliczane jako zero, bo nie ma tokenów wyjściowych do pomiaru: decyzja o określonym typie nie jest prozą. To cena katalogowa dostawcy przekazywana dalej, z 0% marży, na tym samym kluczu co pozostałe ponad 200 modeli w katalogu — jedno API dla ponad 200 modeli, 0% marży (cena katalogowa dostawcy przekazywana dalej, więc obniżki cen dostawcy obowiązują tu tego samego dnia). Jeśli czytasz o TypeSafe AI dlatego, że chcesz sprawdzić, czy kalibracja Jev sprawdza się na twoich własnych danych, zanim skierujesz na nią ścieżkę produkcyjną, uruchomienie tego obok modelu generatywnego, któremu już ufasz, to tani sposób, by się przekonać; przełączenie awaryjne na ten model, gdy Jev zwraca niską pewność, to tani sposób, by wdrożyć to produkcyjnie.

Nasze własne siedmiodniowe dane dotyczące obsługi dla okresu kończącego się 2026-09-30, które są naszymi liczbami z naszego własnego ruchu, a nie benchmarkiem dostawcy: p50 151 ms, p95 247 ms, około 349 tokenów wyjściowych na sekundę, wskaźnik błędów 0,49% i 76,2 mln obsłużonych tokenów. Dzienne p50 w tym okresie wynosiło 175, 170, 163, 161, 170, 147, 143 ms, więc mediana nieznacznie spada. Jeden dzień w tym szeregu, 09-28, ma p95 na poziomie 2 448 ms — prawdziwy outlier w danych, a nie norma, i nie liczba, wokół której należy planować budżet opóźnień. Te dane są odświeżane codziennie; źródłem jest karta.

A generated two-column figure card titled 'Jev 1.13 - the scoreboard', with the OrcaRouter logo composited in the bottom-right corner. The left column, headed 'LATENCY & RELIABILITY', lists 'p50 151 ms', 'p95 247 ms' and 'Error rate (7d) 0.49%'. The right column, headed 'PRICE & CONTEXT', lists 'Price $42 per billion input tokens', 'Context 65,536 tokens (32K state budget)' and 'Architecture & weights Unpublished'. A footer line reads 'Vendor figures unaudited; latency and error rate are OrcaRouter serving data, 7 days to 2026-09-30.'

Tam, gdzie model jest słaby, według TypeSafe

Dostawca publikuje stronę o nierównościach możliwości dla Jev 1.13, ostatnio zweryfikowaną 2026-09-17, która nazywa tryby awarii szczerzej niż większość materiałów premierowych. To właściwa strona do przeczytania przed budowaniem na tym modelu, a jej własna lista wygląda następująco. Jev odpowiada na pytanie, które napisałeś, a nie na to, które miałeś na myśli, więc słowa zakresowe, negacje i warunki domniemane trzeba wyrazić wprost. To nie kalkulator: radzi sobie gorzej z pytaniami matematycznymi niż semantycznymi. Czyta daty jako tekst, a nie jako uporządkowane wielkości, więc szeregowanie, luki i przynależność do okna są zawodne, a przy mieszanych formatach jest jeszcze gorzej. Podwójne przeczenia i wieloetapowe pośrednie odniesienia obniżają dokładność. Dokładność spada, gdy stan rozrasta się o nieistotne szczegóły — strona mówi, że „cierpi na rozkład kontekstu” — więc rozwiązaniem jest najpierw filtrowanie w kodzie. Stan jest traktowany jako dane, a nie domyślnie jako wrogi, więc wstrzyknięte instrukcje mogą zmieniać odpowiedzi. Niedopasowane instrukcje i kryteria mylą go. Niezmienniki strukturalne nie są gwarantowane: wyjście noul i wyjście choice nie muszą sobie odpowiadać, a pytanie plus jego negacja nie muszą sumować się do jedynki, więc nie należy przenosić progów między nimi. Nie jest też trenowany do generowania tekstu — zmuszanie go do przechodzenia przez łańcuch wyborów „nie będzie działać dobrze i będzie bardzo wolne”.

A headless-browser capture of the TypeSafe model-jaggedness page for Jev 1.13, headed '# Jev 1.13 jaggedness' with the line 'Jev isn't perfect. Here are some jagged edges we are aware of with jev-1.13. Many of these will be fixed in later versions.' and the note 'Applies to jev-1.13 - Last reviewed 2026-09-17'. Below sits a table of nine documented failure modes - literal reading, math and numbers, date and time comparison, indirection, large state full of irrelevant detail, adversarial content, contradictory instructions and criteria, common-sense structural invariants, and generation - followed by explanatory body text on literal reading, counting and math.

Jak interpretować TypeSafe AI sześć dni po zmianie routingu

Firma składa mocne, konkretne, falsyfikowalne twierdzenie: że wąski model decyzyjny może być szybszy, tańszy i bardziej godny zaufania niż ogólny w podzbiorze pracy, w którym potrzebna jest ocena, a nie akapit. Twierdzenie to jest wiarygodne i częściowo samo się potwierdza — szacunki pewności to rzeczywista różnica projektowa, cena jest realna, a opóźnienie, które mierzymy we własnym ruchu, jest tego samego rzędu co u dostawcy. Brakuje tego, co pozwoliłoby osobie z zewnątrz sprawdzić resztę: żadnej architektury, żadnych parametrów, żadnych wag, żadnego niezależnego benchmarku i ceny, o której sama firma mówi, że nie może dowieść, że jest do utrzymania. Tryby awarii są udokumentowane, co stanowi więcej, niż robi większość laboratoriów, i jest najlepszym możliwym powodem, by potraktować model poważnie.

Jeśli decydujesz, czy zwracać uwagę: uruchom Jev na danych wejściowych, które już masz oznaczone, z ukrytymi etykietami, i sprawdź, czy jego liczby pewności oddzielają przypadki, które klasyfikuje poprawnie, od tych, które klasyfikuje błędnie. Ten test kosztuje prawie nic — 0,042 USD za milion tokenów wejściowych — i jako jedyny odpowiada na pytanie, które faktycznie masz. Jeśli decydujesz, czy zaufać firmie: ujawnienia są takie, jakie są, a uczciwa odpowiedź brzmi, że dowody to obecnie słowo dostawcy plus to, co sam wygenerujesz.