
Jev 1.13 – wyjaśnienie: Dlaczego model odpowiada etykietami, a nie zdaniami
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 349 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 208 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Jev 1.13 (typesafe/jev-1.13) nie jest modelem czatu, a najszybszym sposobem, by go zrozumieć, jest przestać czytać jego specyfikację tak, jak czytasz każdą inną. TypeSafe wydało go 15 września 2026 r. jako pierwszego przedstawiciela klasy, którą firma nazywa modelami System One: przekazujesz mu fragment stanu i zestaw nazwanych pytań, a on zwraca jedną typowaną odpowiedź na każde pytanie — etykietę z listy, którą podałeś, poziom na skali, którą zdefiniowałeś, albo wartość true/false z dołączonym prawdopodobieństwem. Żadnej prozy, żadnego kodu, żadnego wyjaśnienia. To nie jest materiał premierowy. Sam model pochodzi z 15 września 2026 r., ma piętnaście dni i wykracza poza siedmiodniowe okno, które obejmuje ten blog, więc nie zasługuje na osobną stronę z okazji własnej premiery. W tym oknie wydarzyło się to, że OrcaRouter dodał typesafe/jev-1.13 do własnego katalogu 24 września 2026 r. i otworzył kartę modelu Jev 1.13 pod adresem https://www.orcarouter.ai/models/typesafe/jev-1.13 — po raz pierwszy Jev można wywoływać przez bramę zewnętrznego dostawcy, a nie tylko przez własny endpoint TypeSafe, oraz pierwsze publiczne dane o działaniu na żywo, jakie ktokolwiek spoza TypeSafe opublikował na jego temat. To zmiana, o której warto przeczytać: model stał się uruchamialny tam, gdzie wcześniej nie był.
Praktyczny wymiar tej zmiany jest niewielki i konkretny. Przed 2026-09-24 przyjęcie Jev oznaczało drugą relację z dostawcą — konto TypeSafe, klucz TypeSafe, fakturę TypeSafe i dedykowany kształt żądania, pod który trzeba było kodować. Po niej Jev działa na tym samym kluczu co reszta stosu: jedno API dla ponad 200 modeli, 0% marży (cena katalogowa dostawcy przekazywana dalej, więc obniżki cen dostawcy są tu aktywne tego samego dnia), a model jest osiągalny pod typesafe/jev-1.13 przez POST /v1/systemone. Nadal wywołujesz go w jego własnym kształcie — punkt końcowy nie jest trasą chat-completions OpenAI, a udawanie inaczej dałoby 404, a nie decyzję — ale umowa, którą podpisujesz, i klucz, który rotujesz, są tymi samymi, które już masz.
Jakim rodzajem modelu jest Jev?
Wpis TypeSafe ogłaszający premierę ujmuje to w jednym zdaniu: „Nasz pierwszy publiczny model to Jev, dostępny od dziś we wczesnym dostępie”. Wpis przedstawia następnie model jako „wywołanie funkcji inteligencji frontier: nieustrukturyzowany stan na wejściu, typowane probabilistyczne decyzje na wyjściu”. To trafny i ważny opis interfejsu, ponieważ niemal każde błędne oczekiwanie wobec Jev wynika z oceniania go jako małego modelu językowego. To nie jest mały model językowy. To model decyzyjny ze stałą gramatyką wyjścia, a gramatyka jest produktem.
Interfejs ma dokładnie dwa wejścia. Stan to materiał podlegający ocenie: e-mail, zgłoszenie do wsparcia technicznego, linia logu, rekord JSON, tablica współrzędnych gry. Pytania to mapa nazwanych elementów, z których każdy ma typ, własne instrukcje oraz — dla dwóch typów strukturalnych — własne kryteria. Każde pytanie jest oceniane względem tego samego stanu, a odpowiedzi wracają jako jeden ustrukturyzowany ładunek JSON. Dokumentacja TypeSafe opisuje pytania jako uruchamiane współbieżnie i niezależnie oraz wysuwa dwa twierdzenia, które wynikają z tego projektu, a nie z dostrajania: dodawanie pytań ledwie zmienia czas odpowiedzi, a dodawanie pytań nie powoduje degradacji kontekstu, ponieważ każde pytanie jest oceniane w izolacji, a nie w następstwie poprzednich.
Własne wytyczne projektowe TypeSafe są warte powtórzenia, ponieważ stanowią najklarowniejsze stwierdzenie, do czego służy model. Trzymaj każde pytanie atomowe i dobrze określone — „rodzaj osądu, jakiego osoba o dużej wiedzy mogłaby dokonać w kilka sekund”. Jeśli decyzja wymaga rozszerzonego rozumowania lub naprawdę łączy kilka niezależnych czynników, podziel ją na osobne pytania i połącz je ponownie we własnym kodzie. Ich przykład: zamiast jednego polecenia „oceń ten pitch startupowy”, zapytaj osobno o wielkość rynku, wykonalność techniczną i wyróżnienie, a następnie zastosuj własne wagi. Powód, dla którego to ma znaczenie, jest taki, że ważenie wtedy znajduje się we współczynniku, który możesz zmienić, zamiast w prompcie, który musisz przepisać.
Model jest zamknięty w każdym sensie, który ma znaczenie dla inżyniera analizującego ryzyko. Architektura Jev, liczba parametrów, moc obliczeniowa użyta do treningu i wagi nie zostały opublikowane. W organizacji TypeSafe na GitHubie nie ma repozytorium z wagami — jedenaście znajdujących się tam publicznych repozytoriów to narzędzia, zestawy SDK, przepływy pracy i trzy niepowiązane forki, a żadne z nich nie jest tym modelem.
„Typed” to cały produkt
Karta modelu OrcaRouter publikuje trzy prymitywy oraz — co ważne — ograniczenia dla każdego z nich. Każde pytanie, które skierujesz do Jev, ma dokładnie jeden z trzech kształtów:
• noul — osąd prawda/fałsz, zwracany jako skalibrowane prawdopodobieństwo, a nie jako sam boolean, dzięki czemu „prawdopodobnie prawda” i „z pewnością prawda” to rozróżnialne wartości.
• wybór — wybierz jedną z maksymalnie 255 oznaczonych opcji, przy czym każda opcja zawiera własny tekst kryteriów, aby model wiedział, co odróżnia twoje etykiety.
• ocena — oceń w uporządkowanej skali od 2 do 10 poziomów, przy czym definicje poziomów podane są jako kryteria.
Konsekwencją tego ograniczenia jest to, że nie ma nic do wyodrębnienia z prozy ani nic do zweryfikowania względem schematu, którego, jak miałeś nadzieję, model przestrzegał. Post inauguracyjny TypeSafe jest nietypowo bezpośredni w kwestii gwarancji: wartość „0%” niezgodności ze schematem na jego wykresach „nie jest empiryczna. Dopasowanie schematu jest gwarantowane, dlatego możemy z pewnością dodać 0% do wykresów.” Kiedy przestrzeń odpowiedzi jest zamkniętym zbiorem, który dostarczyłeś, zwrócona wartość albo należy do tego zbioru, albo nie pochodzi od modelu — nie ma trzeciego wyniku, w którym model napisał coś wiarygodnego w niewłaściwym kształcie, a twój regex po cichu to zaakceptował.
Te trzy typy są również powodem, dla którego recenzent nie może ocenić Jev w taki sposób, w jaki ocenia model czatu. Nie ma wyniku MMLU-Pro do porównania, próbki tekstu do przeczytania ani śladu rozumowania do przeanalizowania. Jedyne pytanie, które ma jakiekolwiek znaczenie, brzmi: czy wpisana odpowiedź jest poprawna i czy przypisane do niej prawdopodobieństwo jest uczciwe. Oba te elementy można zmierzyć, ale wyłącznie na podstawie twoich danych i twoich etykiet.
Jedną udokumentowaną różnicę warto zaznaczyć, a nie rozstrzygać: dokumentacja TypeSafe sama w sobie pokazuje przykład Score indeksowany od zera, podczas gdy karta OrcaRouter podaje skalę jako 2–10 poziomów. Dostawca dokumentuje poziomy; nasza karta podaje 2–10. Jeśli budujesz rubrykę na podstawie Score, odczytaj definicje poziomów z własnej odpowiedzi, zamiast zakładać indeks.
Dlaczego nie ma tokenów wyjściowych do rozliczenia?
Cennik jest najczystszym wyrazem architektury. Jev kosztuje $0.042 za milion tokenów wejściowych w OrcaRouter, a stawka za dane wyjściowe wynosi $0.000000 za milion — to nie zniżka, nie promocja na start, lecz brak mierzalnej wielkości. Model generatywny jest rozliczany za tekst, który pisze; Jev nie pisze żadnego tekstu. Zwraca etykietę, poziom i prawdopodobieństwo. Po stronie wyjściowej nie ma czego liczyć, więc nic się za to nie pobiera.
TypeSafe na swojej stronie głównej podaje tę samą liczbę z drugiej strony — „42 USD za miliard tokenów wejściowych” — i dołącza do niej twierdzenie porównawcze: „238x niższa cena wejściowa niż Claude Fable 5.1”. To porównanie, podobnie jak wszystko inne na stronie głównej, pochodzi od dostawcy i nie zostało przez nikogo powtórzone. Ale arytmetyka, na której się opiera, jest łatwa do sprawdzenia przez czytelnika na podstawie własnego rachunku — i to jest w tym przydatne. Rozmiar obciążenia decyzyjnego zależy niemal wyłącznie od tego, ile stanu wprowadzasz, a stan jest tani w sposób, w jaki generowane tokeny nie są.
Kluczowe liczby dostawcy są większe niż wiersz z ceną i zasługują na takie samo oznaczenie. TypeSafe reklamuje „193,6x szybciej, 444,6x taniej", z przypisem ograniczającym to do „przepływów pracy dla zadań System One", i publikuje pod tym opracowany przykład: TypeSafe AI za 0,000081 USD ukończone w 0,114 s wobec LLM-ów za 0,013880 USD ukończonych w 8,566 s. Sam wpis inauguracyjny przyznaje ryzyko takiego ujęcia — 193,6x i 444,6x opisano jako prawdopodobnie lokujące się „na wyższym końcu rzeczywistych korzyści" — i zauważa, że demonstracja porównawcza wykorzystała „wysoce uproszczone" zapytanie z czytelnymi dla człowieka kluczami wybranymi przez dostawcę, aby „przedstawić nasz model w korzystnym świetle". Żadna z tych liczb nie została niezależnie powtórzona, a karta benchmarkowa samego dostawcy wciąż widnieje jako oczekująca.
Co oznacza „skalibrowany” i czym jest RLCD
TypeSafe sam nazywa swoją metodę treningową: „Reinforcement Learning for Calibrated Decisions (RLCD)”. RLCD to własny termin TypeSafe, a nie ogólny akronim uczenia maszynowego, który istniał przed firmą, a jego cel optymalizacji podano w tabeli porównawczej z wpisu o premierze jako „skalibrowane decyzje: odpowiedzi z epistemicznie uczciwymi prawdopodobieństwami w zadaniach System One”. Ta sama tabela przeciwstawia je RLHF, który optymalizuje pod kątem preferencji człowieka — opracowań i odpowiedzi w czacie, które podobają się oceniającym — oraz RLVR, który optymalizuje pod kątem wyników, które można zweryfikować programowo. RLCD optymalizuje pod kątem trzeciej rzeczy: prawdopodobieństwa przypisanego temu, że odpowiedź jest trafnym stwierdzeniem własnej niepewności modelu.
W praktyce „skalibrowany” to twierdzenie o pewnościach, a nie gwarancja, że odpowiedzi są poprawne. Skalibrowany model, który podaje 0,8 na zestawie pytań, powinien mieć rację w około 80% przypadków w tym zestawie; nadal może się mylić w przypadku każdego pojedynczego pytania. To rozróżnienie to uczciwy sposób odczytania hasła na stronie głównej TypeSafe: „Zero halucynacji — każda decyzja Jev zawiera oszacowanie pewności, więc Twoje oprogramowanie może działać, gdy pewność jest wysoka, i eskalować, gdy nie jest.” To twierdzenie o oszacowaniu pewności, a nie dowód na zero błędów, a przeciwwagą są nasze własne dane: w ciągu siedmiu dni kończących się 2026-09-30 nasza karta mierzy 0,49% wskaźnika błędów w ruchu Jev przez OrcaRouter — liczba, która wcześniej w tym samym oknie wynosiła 0,57%, ponieważ jest obliczana na podstawie kroczących siedmiu dni ruchu z aktywnego placu zabaw, a nie stałego zestawu testowego. Oba fakty należą do tego samego akapitu: pewności są sednem modelu, a model nadal zawodzi w około jednym wywołaniu na dwieście w naszym ruchu.
Historia kalibracji wyjaśnia również zachowanie związane z opóźnieniem, które w przeciwnym razie wyglądałoby na błąd. W poście inauguracyjnym TypeSafe napisano: „W przypadku wyborów o większej liczbie opcji stosujemy dwuetapowy system: najpierw oceniamy niezależnie, a następnie dokonujemy jawnego wyboru, stąd sporadyczne spowolnienia”. Wybór spośród 255 opcji to nie jedno porównanie w przód; dostawca najpierw ocenia, a potem wybiera. Jeśli zobaczysz, że żądanie wobec dużego zestawu etykiet zajmuje zauważalnie więcej czasu niż noul, to jest to udokumentowany mechanizm, a nie przeciążenie.
Jak to dziś nazywasz?

W OrcaRouter model to typesafe/jev-1.13, o nazwie „TypeSafe: Jev 1.13” w katalogu, z context_length wynoszącym 65,536 tokenów i dokładnie jednym obsługiwanym typem endpointu: systemone. Wywołujesz go za pomocą POST /v1/systemone przy użyciu swojego klucza OrcaRouter, wysyłając pole model, pole state (typu ciąg znaków, obiekt lub tablica) oraz mapę questions, w której każdy wpis zawiera typ (noul, choice lub score), własne instrukcje i kryteria. Odpowiedzi to pojedynczy ustrukturyzowany ładunek JSON i nie są strumieniowane — nie ma trybu strumieniowania, który można by włączyć.
Własne sformułowanie karty dotyczące kontraktu to „tekst na wejściu, ustrukturyzowany JSON na wyjściu”, a opublikowane limity są tymi, względem których należy projektować: bez strumieniowania, do około 64 tys. tokenów wejściowych łącznie dla stanu i pytań, przy czym żądania przekraczające ten limit są odrzucane, zanim dotrą do modelu. Wpis w katalogu podaje cenę katalogową jako 0,042 USD za milion tokenów wejściowych i wskazuje stawkę za uzupełnienia jako zero. To są liczby dostawcy przekazane bez zmian — proporcjonalna postać naszego sposobu ustalania cen: 0% narzutu na stawki katalogowe dostawcy.
Dla tego modelu funkcjonują dwa budżety tokenów i nie są one ze sobą sprzeczne, więc trzymaj je osobno. Wartość 65 536 to context_length karty i jest udokumentowana jako około 64K danych wejściowych obejmujących łącznie stan oraz pytania. „Około 32 000 tokenów”, które cytują wcześniejsze artykuły OrcaRouter, to wyłącznie budżet stanu — miejsce, jakie otrzymują Twoje materiały, zanim pytania zabiorą swoją część. Jeśli ustalasz budżet żądania, budżet stanu jest liczbą, która ogranicza tworzony przez Ciebie ładunek; łączna wartość jest górnym limitem całego wywołania.
Czego Jev nie potrafi — powiedziane wprost
Nie potrafi pisać prozy, streszczać, tłumaczyć ani prowadzić rozmowy. Taki jest zamysł, a nie ograniczenie, za które trzeba przepraszać: wpis premierowy mówi, że Jev „rezygnuje z generowania ciągów znaków”, a własna strona TypeSafe poświęcona zjawisku jaggedness wymienia „Generowanie” jako nazwany tryb awarii, obok którego widnieje instrukcja „Użyj modelu generatywnego”. Wymuszona generacja jest wolna i słaba. Jeśli Twój potok wymaga pisemnego streszczenia, Jev jest niewłaściwym komponentem i żadna biegłość w tworzeniu promptów tego nie zmieni.
To nie jest zamiennik modelu generatywnego. Przepływ pracy, do którego należy Jev, obejmuje dwa modele: generatywny, który czyta, pisze i rozumuje w tekście, oraz Jev, który siedzi obok niego i wykonuje wpisywane wywołania w milisekundach. To uczciwe ujęcie każdego porównania kosztów na stronie głównej dostawcy — kolumna „LLMs” nie jest wypieranym konkurentem, lecz drugą połową tego samego systemu, a to, co czyni to zestawienie interesującym, polega na tym, że połowa decyzyjna znajduje się teraz na tym samym kluczu co połowa generatywna, a nie za własnym kontraktem.
A „skalibrowany” nie oznacza poprawności. Oznacza, że liczba przypisana do odpowiedzi ma być odczytywana jako prawdopodobieństwo. Wartość 0,62 na noul oznacza, że model mówi ci, że nie jest pewien — to użyteczna informacja, którą samo „tak/nie” by zniszczyło — i nie jest obietnicą, że „tak” jest słuszne. Logika eskalacji oparta na poziomie pewności jest zamierzonym wzorcem; traktowanie odpowiedzi jako prawdy absolutnej już nie.
Uczciwe czytanie liczb.

Każda wartość wydajności obsługi na naszej karcie pochodzi z naszego własnego ruchu przez playground OrcaRouter w kroczącym siedmiodniowym oknie, a nie z benchmarku dostawcy, a okno przesuwało się, gdy ten tekst powstawał — traktuj to jako odczyt, nie specyfikację. Za siedem dni kończących się 2026-09-30: mediana czasu do pierwszego tokenu 151 ms, p95 247 ms, przepustowość wyjściowa około 349 tokenów na sekundę, współczynnik błędów 0,49% i 76,2 mln obsłużonych tokenów. Dzienne p50 w całym oknie wynosi 175, 170, 163, 161, 170, 147 i 143 ms — łagodnie poprawiająca się linia. Wartość p95 z 09-28 wynosząca 2 448 ms to prawdziwy jednodniowy punkt odstający w tym szeregu, a podawanie jej jako normy byłoby błędem tak samo, jak całkowite jej pominięcie byłoby nieuczciwe.
Jeszcze jedno zastrzeżenie dotyczące wskaźnika ruchu: 349 tokenów wyjściowych na sekundę brzmi jak przepustowość modelu generatywnego, dopóki nie przypomnisz sobie, że Jev nie generuje żadnego tekstu. Miernik mierzy to, co nasz playground liczy po stronie odpowiedzi dla ustrukturyzowanego ładunku, i przydaje się do wykrywania degradacji między dniami, a nie do porównywania Jev z modelem konwersacyjnym.
To są nasze liczby. Liczby dostawcy to 193,6x, 444,6x, przykład obliczeniowy 0,000081 USD i porównanie 238x z Claude Fable 5.1 — wszystkie pochodzą od samego TypeSafe, żadna nie została niezależnie powtórzona, a wszystkie są ograniczone przez własne przypisy wyłącznie do przepływów zadań System One. Jedno twierdzenie o wydajności, które wysuwa TypeSafe, a które wcale nie jest benchmarkiem i jest warte więcej niż mnożniki, ma charakter strukturalny: ponieważ odpowiedzi są typowane, integracja nie ma kroku parsowania ani kroku walidacji schematu, a to koszt, który nie pojawia się w żadnej tabeli opóźnień.
Co jest otwarte, a co nie
Sprawdzono 30.09.2026 r.: organizacja TypeSafe na GitHubie opublikowała jedenaście repozytoriów. Żadne nie zawiera Jev. Te, które mają znaczenie dla programisty integrującego model, są na licencjach MIT lub Apache-2.0: skills (MIT), system-one-adapter-python (MIT, opisany jako „Drop-in zamiennik TypeSafeClient oparty na API LLM”), typesafe-sdk-js (MIT), typesafe-sdk-python (MIT), daggerverse (Apache-2.0), WorkflowEvals (Apache-2.0, z kodem workflow opublikowanym na evals.typesafe.ai), n8n-nodes-typesafe-ai (MIT), typesafe-ai.github.io i pulumi-clickhouse. Liczby gwiazdek i daty pushów się zmieniają, więc jeśli czytasz to później, sprawdź ponownie, zamiast ufać tej liście.
Trzy z jedenastu to forki niepowiązanych projektów i nie dowodzą niczego na temat tego, jak działa Jev: fork vLLM ostatnio wypchnięty w maju 2025, fork LLaDA z czerwca 2025 — LLaDA to niepowiązane wydanie dyfuzyjnego modelu językowego — oraz provider Pulumi dla ClickHouse Cloud. Kusi, by wyczytać architekturę z listy forków. Nie rób tego: nic w projekcie Jev nie wynika z tych trzech, a w szczególności Jev nie jest modelem dyfuzyjnym, choćby obecność forka LLaDA miała to sugerować.
Uczciwa odpowiedź w jednym zdaniu na pytanie „czy Jev jest open source” brzmi: narzędzia są otwarte, a model nie. To normalny układ w przypadku hostowanego modelu typu frontier i taki układ powinieneś zakładać, planując w oparciu o Jev: API z opublikowaną ceną, udokumentowanym kontraktem i nieopublikowaną liczbą parametrów.
Gdzie dostawca mówi, że Jev jest niesłowny
TypeSafe publikuje własną stronę o nierównościach dla jev-1.13, ostatnio zweryfikowaną 2026-09-17, wskazując, gdzie model zawodzi. Jest wyjątkowo szczera i to właściwe miejsce, aby rozpocząć sekcję ograniczeń, ponieważ jest to lista samego dostawcy, a nie konkurenta:
• Dosłowne odczytanie — traktuje sformułowanie dosłownie. Słowa określające zakres, przeczenia i warunki dorozumiane nie są wywnioskowywane; „odpowiada na pytanie, które zapisałeś, a nie na to, które miałeś na myśli”. Poprawka dostawcy polega na zapisaniu dokładnego warunku i kryteriów dla każdej opcji.
• Matematyka i liczby — to nie jest kalkulator i nie liczy niezawodnie. Arytmetykę zostaw w kodzie.
• Porównywanie dat i czasu — daty są odczytywane jako tekst, a nie jako uporządkowane wielkości, więc sortowanie, luki i okna czasowe bywają zawodne, a przy mieszanych formatach jest jeszcze gorzej.
• Pośredniość — podwójne przeczenia i rozumowanie wymagające wielu przeskoków obniżają dokładność. Zmniejsz liczbę przeskoków i wskazuj bezpośrednio właściwy stan.
• Duży stan pełen nieistotnych szczegółów — niezwiązana treść działa jak czynnik rozpraszający, a dokładność spada w miarę wzrostu stanu. Najpierw filtruj.
• Treść wroga — stan nie jest traktowany jako wrogi, więc wstrzyknięte instrukcje lub wprowadzające w błąd przedstawienie mogą zmienić odpowiedzi.
• Sprzeczne instrukcje i kryteria — gdy oba wymagają różnych rzeczy, model „może się zdezorientować”.
• Zdroworozsądkowe niezmienniki strukturalne — nie ma gwarancji, że P(noul) i 1 − P(not noul) będą spójne. Pytaj o każdą decyzję w jeden sposób i wymuszaj tożsamości w kodzie.
• Generowanie — już omówione, a zalecenie samego dostawcy to użycie modelu generatywnego.
Dwa z nich zasługują na podkreślenie. Ten adwersarialny ma znaczenie, ponieważ cała propozycja wartości Jev'a polega na ocenianiu niezaufanego materiału, a stan zawierający instrukcje może zmienić odpowiedź; jeśli twój stan pochodzi od użytkowników, to jest to powierzchnia ataku typu prompt injection o takim samym kształcie jak każda inna. Ten dotyczący niezmienników strukturalnych ma znaczenie, ponieważ „skalibrowany” model zachęca cię do wykonywania działań arytmetycznych na jego prawdopodobieństwach, a dostawca mówi ci, żebyś nie zakładał, że ta arytmetyka się domyka.
Do czego zobowiązuje się post o premierze, a do czego nie

Niemal każde cytowane w tym artykule twierdzenie dostawcy ma źródło na jednej stronie: własnym ogłoszeniu TypeSafe, umieszczonym w dziale Aktualności firmowe, opatrzonym datą 2026-09-15 i podpisanym przez założyciela Diogo Almeidę. Warto przeczytać je bezpośrednio — to kwestia dwóch minut — ponieważ brzmienie jednego zdania ustala warunki dla wszystkiego, co wydarzyło się od tamtej pory. „Nasz pierwszy publiczny model to Jev, dostępny już dziś w ramach wczesnego dostępu”. Wczesny dostęp to określenie samego dostawcy dotyczące dostępności na jego własnej platformie i jest to stwierdzenie węższe, niż wygląda — zobowiązuje TypeSafe do udostępniania modelu zatwierdzonym użytkownikom i nie mówi nic o tym, kto jeszcze może go udostępniać. Właśnie tę lukę zamknęło dodanie do katalogu z 2026-09-24 i dlatego karta modelu ma większe znaczenie niż post dla każdego, kto dziś ocenia Jev.
Ta sama strona równie jasno określa własne ograniczenia, dlatego została powyżej zacytowana, a nie sparafrazowana. Nie publikuje liczby parametrów, opisu architektury poza „nową architekturą modelu”, obliczeń treningowych ani repozytorium wag i nie podaje daty ani warunków ogólnej dostępności. Te braki stanowią ograniczenia planistyczne: z jednej strony API z opublikowaną ceną, z drugiej stos, którego wnętrza nie można sprawdzić. Wpis przedstawia również model na tyle uczciwie, by dało się go użyć jako specyfikację — „wywołanie funkcji inteligencji frontier: nieustrukturyzowany stan na wejściu, typizowane probabilistyczne decyzje na wyjściu” — i jest to jedyne zdanie w nim, które opisuje interfejs, a nie ambicję.
Pytania, które nasuwa ten interfejs
Co się dzieje, gdy zbiór wyboru zawiera więcej niż 255 opcji? Jest ograniczony — 255 oznaczonych opcji to maksimum w pytaniu wyboru, a dwuetapowe podejście dostawcy polegające najpierw na ocenianiu, a potem na wybieraniu jest tym, co robi wraz ze wzrostem liczności, co jest również udokumentowanym źródłem sporadycznych spowolnień przy dużych zbiorach etykiet. Jeśli Twoja taksonomia jest większa niż to, rozwiązaniem projektowym jest rozłożenie jej na kilka pytań i ponowne złożenie w kodzie, co jest tą samą radą, której TypeSafe udziela w przypadku złożonych osądów.
Czy kontekst 65 536 tokenów oznacza 65 536 tokenów stanu?Nie. Podawany budżet to około 64 tys. tokenów łącznie na stan i wszystkie pytania, a liczba „około 32 000 tokenów”, która pojawia się w starszych materiałach, to budżet samego stanu. Planuj ładunek względem wartości dla stanu, a nie względem wartości łącznej, i pamiętaj, że żądania przekraczające limit są odrzucane, zanim dotrą do modelu.
Co zrobić z tym
Jev 1.13 wart jest rzucenia okiem z jednego konkretnego powodu, a nie z powodu ogólnego. Jeśli w twoim potoku przetwarzania masz krok, który obecnie jest modelem czatu proszonym o zwrócenie etykiety i któremu ufa się, że zwróci ją w odpowiedniej formie — router, oceniający, kontrola polityki, ocena według rubryki stosowana do tysięcy rekordów — to właśnie ten krok zastępuje ten model, w cenie 0,042 USD za milion tokenów wejściowych, bez naliczania opłat po stronie wyjściowej. Jeśli masz krok, który wymaga pisemnej odpowiedzi, Jev nie jest właściwym narzędziem, a sam jego dostawca tak twierdzi.
To, co zmieniło się w ciągu ostatniego tygodnia, to nie sam model. Zmieniło się to, że wypróbowanie go przestało wymagać drugiej relacji z dostawcą. Osiem dni temu ocena Jev oznaczała osobne konto i osobną integrację; dziś to jeden identyfikator modelu na kluczu, który już obejmuje ponad 200 modeli, z ceną katalogową dostawcy przekazywaną bez zmian i wpisywanymi odpowiedziami wracającymi z tego samego miejsca co wszystko inne. W przypadku modelu tak nietypowego możliwość przetestowania go na własnych etykietach bez zobowiązania się do nowej umowy w dużej mierze przesądza o decyzji.
