
Czym jest TypeSafe AI? Laboratorium stojące za Jev 1.13 podejmuje decyzje, a nie tworzy zdania
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 349 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 208 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
TypeSafe AI to małe laboratorium z San Francisco, które sprzedaje model, który nie potrafi napisać zdania, a Jev 1.13 (typesafe/jev-1.13) to właśnie ten model. Przyjmuje fragment stanu — wiadomość e-mail, wiersz logu, zgłoszenie do wsparcia, blob JSON — oraz zestaw nazwanych pytań i zwraca jedną typowaną odpowiedź na każde pytanie, każdą z własną wartością ufności. Bez prozy, bez kodu, bez wyjaśnień i bez okna czatu. Sam model został wydany 2026-09-15, więc nie jest nowy i nic tutaj nie jest historią premiery: ta strona istnieje z powodu mniejszej, możliwej do datowania zmiany. W dniu 2026-09-24 OrcaRouter dodał typesafe/jev-1.13 do swojego katalogu i otworzył kartę modelu pod własnym adresem, co było pierwszym razem, gdy Jev można było wywołać przez bramę innej firmy, a nie tylko przez własny punkt końcowy TypeSafe. To jest to wydarzenie, na dzień 2026-09-30 ma ono sześć dni, i jest powodem, dla którego czytelnik, który nie ma jeszcze umowy z TypeSafe, może teraz umieścić model System One na tym samym kluczu co modele generatywne, obok których ma działać. Wszystko inne na tej stronie to tło dotyczące firmy, która go stworzyła.
Uczciwe ujęcie kwestii czasu, bo ma to znaczenie dla tego, jak wiele z tego jest zweryfikowane: Jev zadebiutował ponad dwa tygodnie temu i jest ogólnie dostępny od 2026-09-21, kiedy TypeSafe usunął listę oczekujących. W siedmiodniowym oknie mieści się zmiana routingu, a nie model. Jeśli przyszedłeś tu, oczekując recenzji premiery, premiera już się odbyła, a kilka innych tekstów ją omówiło.
Strona firmowa z manifestem i bez diagramu architektury
TypeSafe opisuje siebie, we własnym opisie meta, jako „laboratorium AI budujące natywną dla maszyn infrastrukturę inteligencji do automatyzacji”, z systemami „zaprojektowanymi do podejmowania decyzji w oprogramowaniu”. Jego strona główna jest oznaczona Wersja 0.01, a w stopce widnieje „Made in SF”. Istnieje manifest argumentujący, że najkrótsza droga do zmiany gospodarczej w kształcie AI prowadzi przez uczynienie inteligencji komponowalną, tak aby oprogramowanie mogło wywoływać osąd semantyczny w taki sam sposób, w jaki wywołuje funkcję; własne podsumowanie planu firmy to dostarczenie formy komponowalnej AI natywnej dla maszyn, następnie uczynienie jej wystarczająco niezawodną dla prawdziwej automatyzacji, a potem zaoferowanie abstrakcji wyższego poziomu, wystarczająco stabilnych, by można było na nich budować. Jej slogan to „Budujemy prod, nie Boga”. Strona zespołu wymienia trzech założycieli — Diogo Almeida jako CEO, Sasha Sheng jako COO i Erik Gafni jako CTO. To wszystko, co firma mówi o sobie: stanowisko, produkt, trzy nazwiska i żadnych liczb na temat samej firmy.
To, czego strona nie zawiera, to rzecz, po którą inżynier oceniający nową zależność sięga w pierwszej kolejności. Nie ma strony architektury, liczby parametrów, ujawnienia dotyczącego obliczeń treningowych ani karty modelu w sensie akademickim. Własny dashboard benchmarkowy TypeSafe jest wciąż oznaczony jako oczekujący. Dla firmy, której argumentacja opiera się na niezawodności, zakres ujawnień jest skąpy, i jest to fakt dotyczący tego, co zostało opublikowane, a nie oskarżenie o to, co jest ukrywane.

System One: kategoria i dlaczego nazwa jest zapożyczona
Jev jest pierwszym z tego, co TypeSafe nazywa modelami System One. Nazwa pochodzi od podziału Daniela Kahnemana na szybkie, intuicyjne myślenie Systemu 1 i wolne, rozważne rozumowanie Systemu 2, a firma mówi o tym wprost w swoim poście zapowiadającym premierę — przyznaje też, że „myślenie Systemu 1” ma zabarwienie skłonności do błędów, i przekonuje, że modele te można uczynić bardziej niezawodnymi niż alternatywy. TypeSafe nie ukuła tego terminu i nie jest jego właścicielem.
Praktyczna treść tej kategorii to celowy podział pracy: model, który decyduje, i model, który pisze. Arytmetykę, porządkowanie dat, liczenie i porównywanie ciągów znaków należy pozostawić zwykłemu kodowi, w którym są dokładne, a ocenę semantyczną przekazać Jevowi. Potrafi odpowiedzieć na trzy typy pytań:
• noul — osąd typu prawda/fałsz, zwracany wraz ze skalibrowanym prawdopodobieństwem
• wybór — wybierz jedną z maksymalnie 255 opcji z etykietami
• wynik — oceń na uporządkowanej skali; nasza karta publikuje poziomy 2-10, a własna dokumentacja TypeSafe pokazuje przykład indeksowany od 0, więc traktuj poziomy dostawcy jako definicję, a 2-10 jako to, co publikuje karta
Każde pytanie ma własne instrukcje, a dla wyboru i oceny – własne kryteria. Żądania powyżej około 64 tys. tokenów wejściowych są odrzucane, zanim dotrą do modelu, a odpowiedzi nie są strumieniowane. Dostawca osobno dokumentuje budżet stanu — stan plus pojedyncze najdłuższe pytanie — na 32 tys. tokenów, co jest węższą wartością niż kontekst 65 536 tokenów na karcie i nie stanowi sprzeczności z nim.
Ich teza, ich własnymi słowami
TypeSafe formułuje tę tezę lepiej, niż zrobiłoby to jakiekolwiek streszczenie, więc przytaczam ją dosłownie: „LLM-y produkują słowa dla ludzi. Jev produkuje typowane decyzje i bardziej przypomina kod: niezawodny, szybki, samospójny i bezpieczny typowo”. Metoda treningowa, która za tym stoi, również jest ich autorstwa, a to termin wart precyzyjnego przypisania, bo został podchwycony gdzie indziej tak, jakby był ogólny. TypeSafe nazywa ją Reinforcement Learning for Calibrated Decisions, czyli RLCD, i przeciwstawia RLHF oraz RLVR: tamte optymalizują ludzkie preferencje lub programowo weryfikowalne nagrody, natomiast RLCD — jak ujmuje to firma — celuje w „odpowiedzi z epistemicznie uczciwymi prawdopodobieństwami w zadaniach System One”. Traktuj RLCD jako własny termin ukuty przez TypeSafe, a nie jako ugruntowany skrót w literaturze.
Liczby, od których zaczynają, i kto wybrał obciążenie pracą
Strona główna otwiera się hasłem „193,6x szybciej, 444,6x taniej”, z przypisem do przepływów pracy dla zadań System One. Pod nim znajduje się opracowany przykład: TypeSafe AI przy $0,000081 i 0,114 sekundy w porównaniu z LLM-ami przy $0,013880 i 8,566 sekundy. Niżej: „$42 za miliard tokenów wejściowych. 238x niższa cena tokenów wejściowych niż Claude Fable 5.1.” Jest też sekcja zatytułowana „Zero halucynacji”, która po bliższym przyjrzeniu się jest twierdzeniem o oszacowaniach pewności, a nie dowodem na zero błędów: każda decyzja Jev zawiera oszacowanie pewności, dzięki czemu oprogramowanie może działać, gdy pewność jest wysoka, i eskalować, gdy nie jest. Wszystkie cztery to liczby TypeSafe, uzyskane na obciążeniach wybranych przez TypeSafe, i żadna z nich nie została niezależnie zreplikowana. Sam wpis o premierze mówi, że zespół spodziewa się, iż jego 193,6x i 444,6x znajdą się w górnej części rzeczywistych korzyści, i zauważa, że przepływy pracy zbudował jego własny zespół ds. możliwości, a odpowiedzi referencyjne wygenerowały konkurencyjne modele. Nasze własne siedmiodniowe dane z serwowania tego samego modelu wskazują na współczynnik błędów na poziomie 0,49%, co jest innym pomiarem na innym obciążeniu i stanowi uczciwą przeciwwagę dla odczytywania „zera” jako wartości absolutnej.
Czego nie opublikowali
Architektura Jev, liczba parametrów, moc obliczeniowa treningu i wagi są niepublikowane, a w organizacji GitHub firmy nie ma repozytorium z wagami. Sprawdzone 2026-09-30: ta organizacja ma jedenaście publicznych repozytoriów; te istotniejsze to narzędzia, wszystkie na licencji MIT lub Apache-2.0 — repozytorium umiejętności agentowych, Python SDK, TypeScript SDK, adapter klienta typu drop-in oparty na innych API LLM, kolekcja modułów Dagger, opublikowany kod do ewaluacji przepływów pracy, węzeł n8n oraz własna strona organizacji. Liczby gwiazdek i daty push się zmieniają, więc lepiej odczytywać je na bieżąco, a nie z tej strony.
Trzy z jedenastu to forki niepowiązanych projektów: vLLM, LLaDA oraz provider Pulumi dla ClickHouse Cloud. Są to forki czyjejś pracy i nie mówią nic o tym, jak zbudowano Jev — w szczególności nic o tym, że Jev opiera się na dyfuzji. Jednozdaniowa odpowiedź na pytanie, czy Jev jest open source, brzmi: narzędzia są otwarte, a model nie.
To, co sobie przyznają
Dwa przyznania z wpisu o premierze są warte więcej niż większość zastrzeżeń dostawców, ponieważ wskazują dokładnie te miejsca, w których dowody są słabe. O cenie: „Nie możemy udowodnić, że nie jest dotowane; będziemy potrzebować długiego okresu, aby udowodnić trwałość naszego cennika (który, jak oczekujemy, będzie spadał, a nie rósł)”. O szybkości: „nasze publikowane ewaluacje są na ogół przeprowadzane z naszych laptopów na Zachodnim Wybrzeżu (tam obecnie znajduje się nasza usługa)”. Jest jeszcze trzecie, bardziej przydatne dla każdego, kto na tym buduje: w przypadku zbiorów wyboru o wysokiej kardynalności Jev uruchamia dwuetapowy system, który ocenia niezależnie, a następnie dokonuje wyraźnego wyboru, „stąd okazjonalne spowolnienie”. To dostawca wyjaśnia, dlaczego opóźnienie nie jest jednakowe dla wszystkich typów pytań, i to jest coś, czego zwykle dowiadujesz się z wątku pomocy technicznej.
Gdzie można do tego faktycznie zadzwonić na dzień dzisiejszy
Przez własne API TypeSafe, gdzie model jest ogólnie dostępny, a strona główna wciąż używa własnego określenia dostawcy „early access” — to sformułowanie jest aktualne i warto je zachować, natomiast „waitlisted” zostało wycofane: dokumentacja podaje konkretne limity operacyjne (100 tys. tokenów na sekundę, 40 żądań na sekundę, 429 z backoffem SDK po przekroczeniu któregokolwiek z nich) i nie zawiera żadnych sformułowań o liście oczekujących. A od 2026-09-24 przez OrcaRouter.
To, co udostępniamy, warto przedstawić precyzyjnie, ponieważ właśnie kształt wywołania jest tym, co się różni. Wpis w katalogu to typesafe/jev-1.13, nazwany TypeSafe: Jev 1.13, z obsługiwanym typem endpointu „systemone” — więc dostęp do niego odbywa się przez POST /v1/systemone, a nie przez kształt chat-completions OpenAI, bez strumieniowania, tekst na wejściu i ustrukturyzowany JSON na wyjściu, do około 64K tokenów wejściowych łącznie dla stanu i pytań. Wejście kosztuje $0,042 za milion tokenów, a wyjście jest rozliczane jako zero, bo nie ma tokenów wyjściowych do pomiaru: decyzja o określonym typie nie jest prozą. To cena katalogowa dostawcy przekazywana dalej, z 0% marży, na tym samym kluczu co pozostałe ponad 200 modeli w katalogu — jedno API dla ponad 200 modeli, 0% marży (cena katalogowa dostawcy przekazywana dalej, więc obniżki cen dostawcy obowiązują tu tego samego dnia). Jeśli czytasz o TypeSafe AI dlatego, że chcesz sprawdzić, czy kalibracja Jev sprawdza się na twoich własnych danych, zanim skierujesz na nią ścieżkę produkcyjną, uruchomienie tego obok modelu generatywnego, któremu już ufasz, to tani sposób, by się przekonać; przełączenie awaryjne na ten model, gdy Jev zwraca niską pewność, to tani sposób, by wdrożyć to produkcyjnie.
Nasze własne siedmiodniowe dane dotyczące obsługi dla okresu kończącego się 2026-09-30, które są naszymi liczbami z naszego własnego ruchu, a nie benchmarkiem dostawcy: p50 151 ms, p95 247 ms, około 349 tokenów wyjściowych na sekundę, wskaźnik błędów 0,49% i 76,2 mln obsłużonych tokenów. Dzienne p50 w tym okresie wynosiło 175, 170, 163, 161, 170, 147, 143 ms, więc mediana nieznacznie spada. Jeden dzień w tym szeregu, 09-28, ma p95 na poziomie 2 448 ms — prawdziwy outlier w danych, a nie norma, i nie liczba, wokół której należy planować budżet opóźnień. Te dane są odświeżane codziennie; źródłem jest karta.

Tam, gdzie model jest słaby, według TypeSafe
Dostawca publikuje stronę o nierównościach możliwości dla Jev 1.13, ostatnio zweryfikowaną 2026-09-17, która nazywa tryby awarii szczerzej niż większość materiałów premierowych. To właściwa strona do przeczytania przed budowaniem na tym modelu, a jej własna lista wygląda następująco. Jev odpowiada na pytanie, które napisałeś, a nie na to, które miałeś na myśli, więc słowa zakresowe, negacje i warunki domniemane trzeba wyrazić wprost. To nie kalkulator: radzi sobie gorzej z pytaniami matematycznymi niż semantycznymi. Czyta daty jako tekst, a nie jako uporządkowane wielkości, więc szeregowanie, luki i przynależność do okna są zawodne, a przy mieszanych formatach jest jeszcze gorzej. Podwójne przeczenia i wieloetapowe pośrednie odniesienia obniżają dokładność. Dokładność spada, gdy stan rozrasta się o nieistotne szczegóły — strona mówi, że „cierpi na rozkład kontekstu” — więc rozwiązaniem jest najpierw filtrowanie w kodzie. Stan jest traktowany jako dane, a nie domyślnie jako wrogi, więc wstrzyknięte instrukcje mogą zmieniać odpowiedzi. Niedopasowane instrukcje i kryteria mylą go. Niezmienniki strukturalne nie są gwarantowane: wyjście noul i wyjście choice nie muszą sobie odpowiadać, a pytanie plus jego negacja nie muszą sumować się do jedynki, więc nie należy przenosić progów między nimi. Nie jest też trenowany do generowania tekstu — zmuszanie go do przechodzenia przez łańcuch wyborów „nie będzie działać dobrze i będzie bardzo wolne”.

Jak interpretować TypeSafe AI sześć dni po zmianie routingu
Firma składa mocne, konkretne, falsyfikowalne twierdzenie: że wąski model decyzyjny może być szybszy, tańszy i bardziej godny zaufania niż ogólny w podzbiorze pracy, w którym potrzebna jest ocena, a nie akapit. Twierdzenie to jest wiarygodne i częściowo samo się potwierdza — szacunki pewności to rzeczywista różnica projektowa, cena jest realna, a opóźnienie, które mierzymy we własnym ruchu, jest tego samego rzędu co u dostawcy. Brakuje tego, co pozwoliłoby osobie z zewnątrz sprawdzić resztę: żadnej architektury, żadnych parametrów, żadnych wag, żadnego niezależnego benchmarku i ceny, o której sama firma mówi, że nie może dowieść, że jest do utrzymania. Tryby awarii są udokumentowane, co stanowi więcej, niż robi większość laboratoriów, i jest najlepszym możliwym powodem, by potraktować model poważnie.
Jeśli decydujesz, czy zwracać uwagę: uruchom Jev na danych wejściowych, które już masz oznaczone, z ukrytymi etykietami, i sprawdź, czy jego liczby pewności oddzielają przypadki, które klasyfikuje poprawnie, od tych, które klasyfikuje błędnie. Ten test kosztuje prawie nic — 0,042 USD za milion tokenów wejściowych — i jako jedyny odpowiada na pytanie, które faktycznie masz. Jeśli decydujesz, czy zaufać firmie: ujawnienia są takie, jakie są, a uczciwa odpowiedź brzmi, że dowody to obecnie słowo dostawcy plus to, co sam wygenerujesz.
