Wygenerowana plansza tytułowa z napisem „Jev vs Kev” nad podtytułem „Dostrojony model za 95 USD, który bije Jev w zgłoszeniach do wsparcia”, zestawiająca Jev (zamknięty, hostowany, nieujawniona architektura, 0,042 USD za milion tokenów wejściowych, wyjście bezpłatne) z Kev (Apache 2.0, bazujący na Qwen3.5, od 0,8B do 9B, około 95 USD w czasie pracy na H100).
Engineering & Research

Jev kontra Kev: Fine-tuning za 95 dolarów, który bije Jev w zgłoszeniach do wsparcia

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jared Palmer udostępnił Kev 20 września 2026 r., pięć dni po tym, jak TypeSafe AI wypuściła Jev, a ważna liczba nie znajduje się w tabeli benchmarków. Jest w README: całość kosztowała około 95 dolarów kosztów czasu H100 na Modal, plus trzy centy za wywołania API Jev użyte do wygenerowania danych ewaluacyjnych. Kev jest na licencji Apache-2.0, można go hostować samodzielnie i występuje w trzech rozmiarach zbudowanych na bazowych wagach Qwen3.5 — około 0,8B, 4B i 9B — z adapterem LoRA rangi 16 i głowicą wskaźnikową doczepioną do zamrożonej bazy, a nie modelem decyzyjnym tworzonym od zera. Odzwierciedla dokładnie API typowanych decyzji Jev: Choice, Score i Noul — wystarczająco blisko, by zachować zgodność z własnym SDK Pythona TypeSafe. Jev ze swojej strony zadebiutował 15 września 2026 r. jako zamknięty, hostowany model System One firmy TypeSafe AI, zwraca typowane odpowiedzi ze skalibrowaną pewnością i zupełnie bez tekstu, a nigdy nie ujawnił swojej architektury, liczby parametrów, nakładów obliczeniowych na trening ani wag. Porównanie to więc tak naprawdę nie jest porównaniem modeli. To test tego, ile z wartości Jev przetrwa odtworzenie w jedno popołudnie za cenę używanego laptopa.

Co tak naprawdę mówią benchmarki

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability returned with every answer, free output, and the roughly 32,000-token request budget with a 255-option Choice cap.

Najważniejsze jest to, że Kev jest blisko, a w jednym wąskim zadaniu wygrywa. Na zablokowanym zestawie testowym Kev obejmującym nowe źródła Kev-9B uzyskał 0,837 wobec 0,857 Jev. W routingu zgłoszeń pomocy technicznej na 900 zgłoszeniach — zestaw scienthoon — Kev-9B uzyskał 0,952 wobec 0,897 Jev, co jest jedynym opublikowanym wynikiem, w którym otwarta reprodukcja przewyższa model, który odtwarza. Kev wysuwa się też nieznacznie na prowadzenie w niektórych zadaniach rozpoznawania logiki. W zestawach decyzyjnych SemiF, ustrukturyzowanym zestawie 144 pytań, Jev wygrywa 0,965 do 0,917 Kev-9B.

Tam, gdzie Kev przegrywa, przegrywa dotkliwie. Dokładność poza domeną: Kev-8B na poziomie 79,6% wobec 85,7% Jev. MMLU: 70% wobec 90%. MMLU-Pro: 0,515 wobec 0,840. Arytmetyka dat z dokładnością do dnia: 60% wobec 93%. Wzorzec jest spójny — Kev jest konkurencyjny w wąskim routingu i klasyfikacji, gdzie zbiór etykiet jest mały, a domena ustalona, ale rozsypuje się przy wszystkim, co wymaga wiedzy o świecie lub wieloetapowej arytmetyki, ponieważ adapter rangi 16 na zamrożonym małym modelu bazowym nie jest miejscem, w którym mieszka wiedza o świecie.

Każda z tych liczb pochodzi z własnego harnessu Kev'a albo od zewnętrznych trackerów, a README Palmera mówi wprost, że nie jest to kontrolowane porównanie — dane treningowe Jev'a nie są ujawnione, więc nie ma sposobu, by takie porównanie zbudować. README stwierdza też, że żadne wyjścia Jev'a nie zostały użyte do treningu. Oba zastrzeżenia są tego rodzaju, że czynią te liczby bardziej wiarygodnymi, a nie mniej: osoba publikująca porównanie sama mówi ci, czego nie może ono dowieść.

Co dostajesz za $95, czego nie możesz dostać od Jev za żadną cenę

A screenshot of the Kev repository page for jaredpalmer/kev, showing the Apache-2.0 licence, the Qwen3.5 base weights, the rank-16 LoRA and pointer-head recipe, the about-$95 H100 training cost, and the README statement that no Jev outputs were used for training.

Porównanie kosztów to miejsce, w którym te dwa produkty przestają być w ogóle porównywalne. Jev kosztuje $0,042 za milion tokenów wejściowych, a tokeny wyjściowe są darmowe, co jest tanio w sposób, który naprawdę trudno pobić w przeliczeniu na wywołanie — ale to hostowane API we wczesnym dostępie z listą oczekujących, a TypeSafe poinformował, że limity mogą się zmieniać bez powiadomienia. Kev to wagi, które pobierasz. Koszt krańcowy dziesięciomilionowej klasyfikacji to twój własny prąd.

Wynikają z tego cztery rzeczy i żadna z nich nie dotyczy wyników benchmarków.

• Żadne dane nie opuszczają Twojej infrastruktury. Jev to hostowany endpoint; każdy stan, jaki do niego wyślesz — zgłoszenie do działu wsparcia, linia logu, rekord medyczny — trafia do TypeSafe. Kev działa na Twoim własnym GPU, co w przypadku obciążeń podlegających regulacjom nie jest preferencją, lecz czynnikiem rozstrzygającym.

• Bez limitów szybkości, bez listy oczekujących, bez ryzyka wycofania. Własna dokumentacja TypeSafe zauważa, że limity szybkości mogą zmienić się bez powiadomienia. Lokalny punkt kontrolny nie ma takiej klauzuli.

• Możesz go dostroić. Kev to baza do specjalizacji, a przepis LoRA, który go wytworzył, jest publiczny. Jeśli twoja taksonomia routingu ma 40 klas, z którymi żaden model ogólnego przeznaczenia nie radzi sobie dobrze, możesz trenować na własnych etykietach — dokładnie to zrobił Palmer, za koszt rzędu dziesiątek dolarów, a nie całego zespołu ML.

• Limit kontekstu możesz zmienić. Udokumentowany budżet żądań Jev’a to około 32 000 tokenów, a pola Choice są ograniczone do 255 opcji. Kev dziedziczy okno Qwen3.5, które jest znacznie większe, a limit opcji to szczegół implementacyjny twojego własnego stosu obsługi, a nie limit dostawcy.

Co Jev wciąż ma, czego Kev nie ma

Twierdzenie o kalibracji jest tym, które nie przenosi się czysto, i stanowi sedno oferty TypeSafe. Jev jest trenowany metodą, którą TypeSafe nazywa RLCD — Reinforcement Learning for Calibrated Decisions — która optymalizuje to, aby wartość pewności była uczciwa, a nie to, aby odpowiedź była preferowana. Każda odpowiedź Jev zawiera rozkład prawdopodobieństwa dla opcji, więc Twój kod może ustawiać progi: działaj automatycznie w górnym przedziale, oznaczaj w środkowym, eskaluj w dolnym.

Kev generuje ten sam typowany kształt i te same wartości prawdopodobieństwa, ponieważ API jest celowo kompatybilne. To, czy te prawdopodobieństwa są skalibrowane, to osobne pytanie, a uczciwa odpowiedź brzmi, że nikt nie opublikował diagramu niezawodności dla żadnego z tych modeli. Osobny audyt kalibracji odnotował, że Jev uzyskał 44,7% dokładności przy oczekiwanym błędzie kalibracji wynoszącym 0,325 w zadaniu ustalania priorytetów z ukrytą polityką, co sugeruje, że kalibracja w przypadku Jeva różni się znacznie w zależności od zadania, a nie jest właściwością uniwersalną — a sam TypeSafe radzi użytkownikom, aby testowali progi ufności na własnych oznaczonych przykładach, zamiast ufać opublikowanemu zachowaniu.

Inną rzeczą, którą ma Jev, jest to, że nie był trenowany na Qwen3.5. Model 9B z adapterem rangi 16 ma sufit wiedzy, a różnica w MMLU-Pro: 0,515 kontra 0,840 jest widocznym przejawem tego sufitu. Jeśli twoja decyzja o routingu czasami wymaga wiedzy, czym jest dana rzecz, większa, nieujawniona architektura Jev wykonuje pracę, której adapter Kev nie jest w stanie wykonać.

Opóźnienie i kształt wdrożenia

Udokumentowane opóźnienie end-to-end Jev wynosi 70–500 ms w porównaniu z 3–329 sekundami dla wywołań frontier LLM we własnym porównaniu TypeSafe, a dodawanie pytań do wywołania ledwie na nie wpływa, ponieważ każde pytanie jest oceniane równolegle względem jednego wspólnego odczytu stanu. Kev-9B na H100 będzie w tym samym rzędzie wielkości dla pojedynczego przejścia w przód, ale porównanie nie jest jabłkami do jabłek w żadnym kierunku: samodzielnie hostowany model 9B na współdzielonym GPU pod obciążeniem to nie to samo opóźnienie co hostowany endpoint, a hostowany endpoint to nie to samo co serwer we własnym racku. Co można powiedzieć bez zastrzeżeń, to że oba są wystarczająco szybkie do użycia w każdej turze pętli agenta oraz że opóźnienie Kev jest funkcją sprzętu, który kontrolujesz, a nie poziomu usługi, który jest ci obiecywany.

Uczciwa ocena reprodukcji

Sam fakt, że Kev w ogóle istnieje, jest dowodem dotyczącym Jev i warto to nazwać. Zamknięty model, którego zachowanie można przybliżyć w pięć dni za 95 dolarów, przez jedną osobę, na publicznych wagach bazowych, mówi coś o tym, jak duża część jego przewagi wynika z architektury, a jak duża z danych treningowych i serwowania. Nie wynika z tego, że Jev jest łatwy do zbudowania — powierzchnię API łatwo skopiować, a kalibracji już nie. Ale to oznacza, że fosą nie jest interfejs, a każdy, kto ocenia Jev pod kątem ścieżki produkcyjnej, powinien uwzględnić możliwość, że dostrojenie otwartego modelu bazowego doprowadzi go niemal do celu za ułamek zobowiązania.

Co jest również argumentem za tym, by jeszcze nie stawiać ścieżki produkcyjnej na żadne z nich. Jeśli oceniasz Jev, rozsądną postawą jest wypróbowanie go bez wiązania się z nim — a OrcaRouter nie obsługuje Jev, ponieważ model TypeSafe jest we wczesnym dostępie i mówi własnym kształtem żądań. To, co obejmujemy, to generatywna połowa przepływu pracy, w którym te modele decyzyjne się znajdują: ponad 200 modeli za jednym kluczem zgodnym z OpenAI, w cenie katalogowej dostawcy przekazywanej dalej z 0% marży, z automatycznym przełączaniem awaryjnym. Architektura dwumodelowa, w której tania warstwa decyzyjna sortuje ruch, a model generatywny obsługuje resztę, jest testowalna po naszej stronie bez drugiej umowy z dostawcą, a jeśli komponent decyzyjny okaże się źle skalibrowany na twoich danych, ścieżka przełączania awaryjnego jest tym, co powstrzymuje to przed staniem się incydentem.

Werdykt

Jeśli Twoje zadanie decyzyjne jest wąskie, o ustalonej domenie, o dużym wolumenie i wrażliwe na prywatność, Kev jest dziś wyborem, którego łatwiej bronić, i nie jest to nawet blisko — posiadasz wagi, kontrolujesz ścieżkę danych, możesz dostroić model na własnych etykietach, a w routingu zgłoszeń do wsparcia checkpoint 9B już przewyższa Jev na jego własnych opublikowanych wynikach. Jeśli Twoje zadanie decyzyjne wymaga wiedzy o świecie, wieloetapowej arytmetyki lub wartości ufności, względem której zamierzasz automatyzować, większy nieujawniony model Jev i jego trening RLCD wykonują prawdziwą pracę, a adapter Kev nie zastępuje żadnego z nich.

Jedyna rzecz, której nie rozstrzyga żadne z tych porównań, to kalibracja, ponieważ nikt nie opublikował diagramu niezawodności dla żadnego z tych modeli. Przetestuj to na własnych oznaczonych przypadkach, zanim zautomatyzujesz cokolwiek w oparciu o którykolwiek z nich — wartość pewności to ta część obu produktów, którą trzeba wypracować przy każdym wdrożeniu, a szybkość to ta część, która jest już utowarowiona.

A generated two-column scoreboard comparing Jev and Kev across the same six labelled dimensions, with a footer reading "Kev figures per its own README and harness; not a controlled comparison."