
Jev vs Kev: 지원 티켓에서 Jev를 앞서는 $95 파인튜닝
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 578 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Jared Palmer는 TypeSafe AI가 Jev를 출시한 지 5일 후인 2026년 9월 20일에 Kev를 공개했으며, 중요한 숫자는 벤치마크 표에 있지 않다. 그것은 README에 있다: 전체 비용은 Modal에서의 H100 시간으로 약 $95였고, 여기에 평가 데이터를 생성하는 데 사용된 Jev API 호출 3센트가 더해졌다. Kev는 Apache-2.0이고 자체 호스팅 가능하며, Qwen3.5 기본 가중치를 기반으로 만든 대략 0.8B, 4B, 9B의 세 가지 크기로 제공된다 — 처음부터 만든 결정 모델이 아니라 동결된 베이스에 rank-16 LoRA 어댑터와 포인터 헤드를 붙인 형태다. 그것은 Jev의 타입 지정 결정 API를 정확히 그대로 반영한다: Choice, Score, Noul이며, TypeSafe 자체 Python SDK와 호환될 만큼 충분히 가깝다. Jev는 2026년 9월 15일 TypeSafe AI의 폐쇄형 호스팅 System One 모델로 출시되었고, 보정된 신뢰도와 함께 텍스트 없이 타입 지정 답변을 반환하며, 아키텍처, 파라미터 수, 학습 컴퓨트, 가중치를 한 번도 공개하지 않았다. 따라서 이 비교는 사실상 모델 비교가 아니다. 그것은 중고 노트북 가격으로 오후 한나절 만에 재현했을 때 Jev의 가치 중 얼마나 살아남는지를 시험하는 것이다.
벤치마크가 실제로 말하는 것

헤드라인은 Kev가 바짝 따라붙었고, 하나의 좁은 과제에서는 승리한다는 것이다. Kev의 잠긴 신규 소스 테스트 세트에서 Kev-9B는 Jev의 0.857에 맞서 0.837을 기록했다. 900개 티켓에 걸친 지원 티켓 라우팅 — scienthoon 세트 — 에서 Kev-9B는 Jev의 0.897에 맞서 0.952를 기록했는데, 이는 오픈 재현이 자신이 재현한 모델을 앞선 유일한 공개 결과다. Kev는 일부 논리 인식 과제에서도 근소하게 앞선다. 144개 질문으로 구성된 구조화 세트인 SemiF 결정 세트에서는 Jev가 0.965 대 Kev-9B의 0.917로 이긴다.
Kev가 지는 경우에는 크게 진다. 도메인 외 정확도: Kev-8B가 79.6%로 Jev의 85.7%에 대비된다. MMLU: 70% 대 90%. MMLU-Pro: 0.515 대 0.840. 날짜 연산(일 단위 정밀도): 60% 대 93%. 패턴은 일관된다 — Kev는 레이블 집합이 작고 도메인이 고정된 좁은 라우팅과 분류에서는 경쟁력이 있지만, 세계 지식이나 다단계 산술이 필요한 모든 것에서는 무너진다. 왜냐하면 동결된 작은 기본 모델 위의 rank-16 어댑터는 세계 지식이 존재하는 곳이 아니기 때문이다.
그 수치들은 하나같이 Kev 자체의 하네스나 제3자 트래커에서 나온 것이며, Palmer의 README에는 그것이 통제된 비교가 아니라고 분명히 적혀 있습니다 — Jev의 학습 데이터는 공개되지 않았기에 그러한 비교를 만들 방법이 없습니다. README에는 또한 학습에 Jev의 출력이 전혀 사용되지 않았다고 명시되어 있습니다. 두 면책 문구는 모두 수치를 덜 믿을 만하게 만들기보다는 더 믿을 만하게 만드는 종류입니다: 비교를 공개하는 사람이 바로 그 비교가 무엇을 입증할 수 없는지 알려 주는 사람이기 때문입니다.
$95에 얻을 수 있지만 Jev에게서는 어떤 가격으로도 얻을 수 없는 것

비용 비교에 이르면 두 제품은 애초에 비교가 성립하지 않게 된다. Jev는 입력 토큰 100만 개당 0.042달러에 출력은 무료인데, 이는 호출당 기준으로는 정말 따라잡기 어려운 수준으로 저렴하다. 하지만 대기자 명단이 있는 호스팅형 얼리 액세스 API이며, TypeSafe는 속도 제한이 예고 없이 바뀔 수 있다고 밝혔다. Kev는 직접 다운로드하는 가중치다. 천만 번째 분류의 한계 비용은 바로 자신의 전기 요금이다.
그로부터 네 가지가 따라 나오는데, 그중 어느 것도 벤치마크 점수에 관한 것은 아닙니다.
• 데이터는 여러분의 인프라를 벗어나지 않습니다. Jev는 호스팅형 엔드포인트이며, 여러분이 Jev로 보내는 모든 상태 — 지원 티켓, 로그 라인, 의료 기록 — 는 TypeSafe로 전달됩니다. Kev는 여러분 자체 GPU에서 실행되며, 규제 대상 워크로드에서 이는 선호 사항이 아니라 결정적 요인입니다.
• 속도 제한도, 대기자 명단도, 지원 중단 위험도 없습니다. TypeSafe 자체 문서에는 속도 제한이 예고 없이 변경될 수 있다고 나와 있습니다. 로컬 체크포인트에는 그런 조항이 없습니다.
• 미세 조정할 수 있습니다. Kev는 특화를 위한 기반이며, 이를 만들어낸 LoRA 레시피는 공개되어 있습니다. 라우팅 분류 체계에 범용 모델이 잘 처리하지 못하는 클래스가 40개 있다면, 자체 레이블로 학습시킬 수 있습니다 — 이는 바로 Palmer가 한 일이며, ML 팀을 꾸리는 대신 수십 달러 규모의 비용으로 가능했습니다.
• 컨텍스트 상한은 당신이 바꿀 수 있습니다. Jev의 문서화된 요청 예산은 대략 32,000 토큰이며 Choice 필드는 255개 옵션으로 제한됩니다. Kev는 훨씬 더 큰 Qwen3.5의 윈도우를 상속받으며, 옵션 상한은 공급업체 한도가 아니라 당신의 자체 서빙 스택의 구현 세부 사항입니다.
Jev가 여전히 가지고 있는, Kev에게는 없는 것
보정(calibration) 주장은 매끄럽게 전이되지 않는 항목이며, 이는 TypeSafe 제안의 핵심입니다. Jev는 TypeSafe가 RLCD — 보정된 결정을 위한 강화 학습(Reinforcement Learning for Calibrated Decisions) — 라고 부르는 방법으로 훈련됩니다. 이 방법은 선호되는 답변을 내놓는 것이 아니라 신뢰도 값이 정직하도록 최적화합니다. 모든 Jev 답변에는 선택지에 대한 확률 분포가 함께 제공되므로, 코드에서 임계값을 설정할 수 있습니다. 상위 구간에서는 자동으로 실행하고, 중간 구간에서는 플래그를 지정하며, 하위 구간에서는 에스컬레이션합니다.
Kev는 동일한 타입화된 형태와 동일한 확률 출력을 생성합니다. API가 의도적으로 호환되도록 설계되었기 때문입니다. 그 확률들이 보정되었는지는 별개의 문제이며, 솔직한 답은 두 모델 모두에 대해 신뢰도 다이어그램을 공개한 사람이 아무도 없다는 것입니다. 별도의 보정 감사에서는 Jev가 숨겨진 정책 우선순위 작업에서 정확도 44.7%, 기대 보정 오차 0.325를 기록했다고 보고했는데, 이는 Jev의 보정이 보편적 속성이라기보다 작업에 따라 급격히 달라진다는 것을 시사합니다. 그리고 TypeSafe 자체도 사용자에게 공개된 동작을 신뢰하기보다 자신들이 레이블을 지정한 예시로 신뢰도 임계값을 테스트하라고 권고합니다.
Jev의 또 다른 점은 Qwen3.5로 학습되지 않았다는 것입니다. rank-16 어댑터를 갖춘 9B 모델에는 지식 상한선이 있으며, 0.840 대비 0.515라는 MMLU-Pro 격차는 그 상한선이 드러난 것입니다. 당신의 라우팅 결정이 때때로 어떤 대상이 무엇인지 아는 것을 필요로 한다면, Jev의 더 큰 비공개 아키텍처가 Kev의 어댑터가 할 수 없는 일을 하고 있는 것입니다.
지연 시간과 배포 형태
TypeSafe 자체 비교에서 Jev의 문서화된 엔드투엔드 지연 시간은 70–500ms인 반면, 프런티어 LLM 호출은 3–329초입니다. 그리고 호출에 질문을 추가해도 지연 시간은 거의 변하지 않습니다. 모든 질문이 상태에 대한 하나의 공유된 읽기를 기준으로 병렬로 평가되기 때문입니다. H100에서 Kev-9B는 단일 포워드 패스에 대해 같은 자릿수에 속할 것입니다. 하지만 이 비교는 어느 방향으로도 동일 조건의 비교가 아닙니다. 부하가 걸린 공유 GPU에서 자체 호스팅된 9B는 호스팅 엔드포인트와 같은 지연 시간이 아니며, 호스팅 엔드포인트는 자체 랙에 있는 장비와 같지 않습니다. 얼버무리지 않고 말할 수 있는 것은, 둘 다 에이전트 루프에서 턴별 사용에 충분히 빠르며, Kev의 지연 시간은 약속받은 서비스 수준이 아니라 여러분이 제어하는 하드웨어의 함수라는 점입니다.
복제에 대한 솔직한 평가
Kev가 존재한다는 사실 자체가 Jev에 관한 증거이며, 이는 이름 붙일 가치가 있다. 한 사람이 95달러로 5일 만에 공개 베이스 가중치 위에서 그 동작을 근사할 수 있는 폐쇄형 모델은, 그 이점 중 얼마나 많이 아키텍처에서 비롯되고 얼마나 많이 학습 데이터와 서빙에서 비롯되는지를 시사한다. 따라서 Jev를 구축하기 쉽다는 결론이 나오는 것은 아니다 — API 표면은 복사하기 쉽지만, 캘리브레이션은 그렇지 않다. 하지만 이는 해자가 인터페이스가 아니라는 뜻이며, 프로덕션 경로를 위해 Jev를 평가하는 사람이라면 누구든 오픈 베이스를 파인튜닝하는 것만으로 훨씬 적은 투자로 대부분의 길에 도달할 수 있다는 가능성을 염두에 두어야 한다.
이는 또한 아직 어느 쪽에도 프로덕션 경로를 걸지 말아야 한다는 근거이기도 합니다. Jev를 평가하고 있다면 현명한 자세는 그것에 전념하지 않은 채 시험해 보는 것이며, OrcaRouter는 Jev를 제공하지 않습니다. TypeSafe의 모델은 얼리 액세스 단계이고 자체적인 요청 형식을 사용하기 때문입니다. 저희가 지원하는 것은 이러한 의사결정 모델들이 속해 있는 워크플로의 생성형 절반입니다: 하나의 OpenAI 호환 키 뒤에서 200개 이상의 모델을 제공사 정가 그대로, 0% 마진으로 전달, 자동 페일오버 포함. 저렴한 의사결정 계층이 트래픽을 분류하고 생성형 모델이 나머지를 처리하는 2개 모델 아키텍처는 두 번째 벤더 계약 없이도 저희 쪽에서 테스트해 볼 수 있으며, 만약 그 의사결정 구성 요소가 고객님의 데이터에서 잘못 보정된 것으로 드러나더라도 페일오버 경로가 그것이 장애로 번지는 것을 막아줍니다.
판결
만약 당신의 의사결정 작업이 좁고, 고정된 도메인이며, 대용량이고, 프라이버시에 민감하다면, Kev가 오늘날 더 방어 가능한 선택이며 이는 근소한 차이가 아닙니다 — 당신은 가중치를 소유하고, 데이터 경로를 통제하며, 자체 레이블로 미세 조정할 수 있고, 지원 티켓 라우팅에서 9B 체크포인트는 이미 Jev의 자체 공개 수치에서 Jev를 능가합니다. 만약 당신의 의사결정 작업에 세계 지식, 다단계 산술, 또는 자동화 기준으로 삼을 신뢰도 값이 필요하다면, Jev의 더 큰 비공개 모델과 RLCD 훈련은 실질적인 역할을 하고 있으며, Kev의 어댑터는 둘 중 어느 것도 대체할 수 없습니다.
두 비교 중 어느 것도 해결하지 못하는 한 가지는 보정(calibration)입니다. 어느 모델에 대해서도 신뢰도 다이어그램(reliability diagram)이 공개된 적이 없기 때문입니다. 두 제품 중 하나를 자동화에 적용하기 전에, 직접 라벨링한 사례에서 이것을 테스트하세요 — 신뢰도 값은 두 제품 모두 배포할 때마다 입증해야 하는 부분이고, 속도는 이미 상품화된 부분입니다.

