
Jev vs Kev: การไฟน์ทูนราคา $95 ที่เอาชนะ Jev บนตั๋วสนับสนุน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 578 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 182 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
เจเร็ด พาล์มเมอร์ เปิดตัว Kev เมื่อวันที่ 20 กันยายน 2026 ห้าวันหลังจาก TypeSafe AI เปิดตัว Jev และตัวเลขสำคัญไม่ได้อยู่ในตารางเบนช์มาร์ก มันอยู่ใน README: ทั้งหมดใช้เงินประมาณ $95 สำหรับเวลา H100 บน Modal บวกกับค่าเรียก Jev API สามเซนต์ที่ใช้สร้างข้อมูลประเมินผล Kev เป็น Apache-2.0 โฮสต์เองได้ และมีสามขนาดที่สร้างบนน้ำหนักฐาน Qwen3.5 — ประมาณ 0.8B, 4B และ 9B — โดยมีอะแดปเตอร์ LoRA แบบ rank-16 และ pointer head ที่ยึดติดกับฐานที่แช่แข็ง แทนที่จะเป็นโมเดลตัดสินใจที่สร้างใหม่ตั้งแต่ต้น มันสะท้อน API การตัดสินใจแบบมีชนิดของ Jev อย่างแม่นยำ: Choice, Score และ Noul ใกล้เคียงพอที่จะเข้ากันได้กับ Python SDK ของ TypeSafe เอง ส่วน Jev นั้นเปิดตัวเมื่อวันที่ 15 กันยายน 2026 ในฐานะโมเดล System One แบบปิดที่โฮสต์โดย TypeSafe AI โดยส่งคืนคำตอบแบบมีชนิดพร้อมความเชื่อมั่นที่ปรับเทียบแล้วและไม่มีข้อความใด ๆ เลย และไม่เคยเปิดเผยสถาปัตยกรรม จำนวนพารามิเตอร์ พลังประมวลผลที่ใช้ฝึก หรือน้ำหนักของมัน ดังนั้นการเปรียบเทียบนี้จึงไม่ใช่การเปรียบเทียบโมเดลจริง ๆ มันคือการทดสอบว่าคุณค่าของ Jev ยังเหลืออยู่มากแค่ไหนเมื่อถูกทำซ้ำในเวลาเพียงบ่ายเดียวด้วยราคาของแล็ปท็อปมือสอง
สิ่งที่เบนช์มาร์กบอกจริง ๆ

พาดหัวข่าวคือ Kev เข้าใกล้ และในงานแคบๆ งานหนึ่งมันชนะ บนชุดทดสอบ new-source ที่ถูกล็อกของ Kev, Kev-9B ได้คะแนน 0.837 เทียบกับ 0.857 ของ Jev ในการจัดเส้นทางตั๋วสนับสนุนจาก 900 ตั๋ว — ชุด scienthoon — Kev-9B ได้คะแนน 0.952 เทียบกับ 0.897 ของ Jev ซึ่งเป็นผลลัพธ์ที่เผยแพร่เพียงหนึ่งเดียวที่การทำซ้ำแบบเปิดเอาชนะโมเดลที่มันทำซ้ำได้ Kev ยังนำหน้าเล็กน้อยในงานการจดจำตรรกะบางงาน บนชุดการตัดสินใจ SemiF ซึ่งเป็นชุดแบบมีโครงสร้าง 144 คำถาม Jev ชนะไป 0.965 ต่อ 0.917 ของ Kev-9B
ตรงจุดที่ Kev แพ้ มันแพ้อย่างย่อยยับ ความแม่นยำแบบนอกโดเมน: Kev-8B อยู่ที่ 79.6% เทียบกับ 85.7% ของ Jev MMLU: 70% เทียบกับ 90% MMLU-Pro: 0.515 เทียบกับ 0.840 การคำนวณวันที่ที่ความละเอียดระดับวัน: 60% เทียบกับ 93% รูปแบบนี้คงเส้นคงวา — Kev แข่งขันได้ในงาน routing และ classification แบบแคบ ๆ ซึ่งชุดป้ายกำกับมีขนาดเล็กและโดเมนคงที่ แต่จะแตกสลายกับสิ่งใดก็ตามที่ต้องใช้ความรู้เกี่ยวกับโลกหรือการคำนวณเลขหลายขั้นตอน เพราะอะแดปเตอร์แบบ rank-16 บนโมเดลฐานขนาดเล็กที่ถูก freeze ไม่ใช่ที่ที่ความรู้เกี่ยวกับโลกอยู่
ตัวเลขทั้งหมดเหล่านั้นมาจากชุดทดสอบของ Kev เองหรือจากตัวติดตามของบุคคลที่สาม และ README ของ Palmer ระบุไว้อย่างชัดเจนว่ามันไม่ใช่การเปรียบเทียบแบบควบคุม — ข้อมูลการฝึกของ Jev ไม่ถูกเปิดเผย ดังนั้นจึงไม่มีทางสร้างมันขึ้นมาได้ README ยังระบุด้วยว่าไม่มีเอาต์พุตของ Jev ถูกนำมาใช้ในการฝึก คำปฏิเสธความรับผิดชอบทั้งสองนี้เป็นแบบที่ทำให้ตัวเลขนั้นน่าเชื่อถือมากขึ้น ไม่ใช่น้อยลง: คนที่เผยแพร่การเปรียบเทียบคือคนที่บอกคุณว่ามันพิสูจน์อะไรไม่ได้
สิ่งที่คุณได้รับในราคา $95 ซึ่งคุณไม่สามารถได้รับจาก Jev ไม่ว่าจะราคาเท่าใด

การเปรียบเทียบต้นทุนคือจุดที่ผลิตภัณฑ์ทั้งสองเปรียบเทียบกันไม่ได้เลย Jev ราคา $0.042 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น โดยเอาต์พุตฟรี ซึ่งถูกแบบที่ยากจะเอาชนะได้จริงเมื่อคิดต่อการเรียกหนึ่งครั้ง — แต่เป็น API แบบโฮสต์ในช่วงเข้าใช้งานก่อนกำหนดที่มีรายชื่อรอ และ TypeSafe ระบุว่าขีดจำกัดอัตราการใช้งานอาจเปลี่ยนแปลงได้โดยไม่แจ้งล่วงหน้า Kev คือน้ำหนักโมเดลที่คุณดาวน์โหลดเอง ต้นทุนส่วนเพิ่มของการจำแนกครั้งที่สิบล้านคือค่าไฟของคุณเอง
สี่สิ่งที่ตามมาจากเรื่องนั้น และไม่มีข้อใดเลยที่เกี่ยวกับคะแนน benchmark
• ไม่มีข้อมูลออกจากโครงสร้างพื้นฐานของคุณ Jev เป็นปลายทางแบบโฮสต์ ทุกสถานะที่คุณส่งไป — ตั๋วสนับสนุน บรรทัดล็อก บันทึกทางการแพทย์ — จะไปที่ TypeSafe Kev ทำงานบน GPU ของคุณเอง ซึ่งสำหรับงานที่มีการควบคุมแล้ว ไม่ใช่ทางเลือก แต่เป็นปัจจัยชี้ขาด
• ไม่มีขีดจำกัดอัตรา ไม่มีรายการรอ ไม่มีความเสี่ยงจากการเลิกใช้งาน เอกสารของ TypeSafe เองระบุว่าขีดจำกัดอัตราอาจเปลี่ยนแปลงได้โดยไม่แจ้งให้ทราบ เช็กพอยต์ภายในเครื่องไม่มีข้อกำหนดเช่นนั้น
• คุณสามารถไฟน์จูนมันได้ Kev เป็นฐานสำหรับการทำให้เชี่ยวชาญเฉพาะทาง และสูตร LoRA ที่สร้างมันขึ้นมานั้นเปิดเผยต่อสาธารณะ หากอนุกรมวิธานการจัดเส้นทางของคุณมี 40 คลาสที่ไม่มีโมเดลทั่วไปตัวใดจัดการได้ดี คุณสามารถเทรนด้วยเลเบลของคุณเอง — ซึ่งเป็นสิ่งที่ Palmer ทำพอดี ด้วยค่าใช้จ่ายในระดับสิบบดอลลาร์ แทนที่จะเป็นทีม ML
• เพดานบริบทเป็นสิ่งที่คุณเปลี่ยนแปลงได้ งบประมาณคำขอที่บันทึกไว้ของ Jev อยู่ที่ประมาณ 32,000 โทเค็น และฟิลด์ Choice จำกัดที่ 255 ตัวเลือก Kev สืบทอดหน้าต่างของ Qwen3.5 ซึ่งใหญ่กว่ามาก และขีดจำกัดตัวเลือกเป็นรายละเอียดการนำไปใช้ของสแต็กการให้บริการของคุณเอง ไม่ใช่ขีดจำกัดของผู้ขาย
สิ่งที่ Jev ยังมี แต่ Kev ไม่มี
ข้อกล่าวอ้างเรื่องการคาลิเบรต (calibration) เป็นข้อที่ไม่ถ่ายโอนไปได้อย่างสะอาดนัก และมันเป็นหัวใจของข้อนำเสนอของ TypeSafe Jev ถูกฝึกด้วยวิธีที่ TypeSafe เรียกว่า RLCD — Reinforcement Learning for Calibrated Decisions — ซึ่งปรับให้เหมาะกับการที่ค่าความมั่นใจมีความซื่อสัตย์ มากกว่าการที่คำตอบเป็นที่พึงพอใจ ทุกคำตอบของ Jev มาพร้อมกับการแจกแจงความน่าจะเป็นเหนือตัวเลือกต่าง ๆ ดังนั้นโค้ดของคุณจึงสามารถกำหนดเกณฑ์ได้: ลงมือทำโดยอัตโนมัติในแถบบน, ติดธงในแถบกลาง, ส่งต่อในแถบล่าง
Kev สร้างรูปแบบที่มีการระบุชนิดเดียวกันและเอาต์พุตความน่าจะเป็นเดียวกัน เนื่องจาก API ถูกออกแบบให้เข้ากันได้โดยเจตนา การที่ความน่าจะเป็นเหล่านั้นได้รับการปรับเทียบหรือไม่นั้นเป็นอีกคำถามหนึ่ง และคำตอบที่ตรงไปตรงมาคือยังไม่มีใครเผยแพร่ไดอะแกรมความน่าเชื่อถือสำหรับทั้งสองโมเดล การตรวจสอบการปรับเทียบแยกต่างหากรายงานว่า Jev ได้ความแม่นยำ 44.7% โดยมีค่าความคลาดเคลื่อนการปรับเทียบที่คาดหวัง 0.325 ในงานจัดลำดับความสำคัญตามนโยบายที่ซ่อนอยู่ ซึ่งบ่งชี้ว่าการปรับเทียบบน Jev แตกต่างกันอย่างมากตามงาน มากกว่าที่จะเป็นคุณสมบัติสากล — และ TypeSafe เองก็บอกให้ผู้ใช้ทดสอบเกณฑ์ความเชื่อมั่นกับตัวอย่างที่มีป้ายกำกับของตนเอง แทนที่จะเชื่อพฤติกรรมที่เผยแพร่
อีกสิ่งหนึ่งที่ Jev มีคือมันไม่ได้ถูกฝึกบน Qwen3.5 โมเดลขนาด 9B ที่มีอะแดปเตอร์แรงก์ 16 ย่อมมีเพดานความรู้ และช่องว่างใน MMLU-Pro ที่ 0.515 เทียบกับ 0.840 คือเพดานนั้นที่ปรากฏให้เห็น หากการตัดสินใจจัดเส้นทางของคุณบางครั้งจำเป็นต้องรู้ว่าสิ่งหนึ่งคืออะไร สถาปัตยกรรมที่ใหญ่กว่าและยังไม่เปิดเผยของ Jev กำลังทำงานบางอย่างที่อะแดปเตอร์ของ Kev ทำไม่ได้
ความหน่วงและรูปแบบการติดตั้งใช้งาน
ความหน่วงแบบ end-to-end ที่มีบันทึกไว้ของ Jev อยู่ที่ 70–500ms เมื่อเทียบกับ 3–329 วินาทีสำหรับการเรียก LLM ระดับแนวหน้าในการเปรียบเทียบของ TypeSafe เอง และการเพิ่มคำถามเข้าไปในการเรียกหนึ่งครั้งแทบไม่ทำให้ค่านั้นเปลี่ยน เพราะทุกคำถามถูกประเมินพร้อมกันโดยเทียบกับการอ่านสถานะเพียงครั้งเดียวที่ใช้ร่วมกัน Kev-9B บน H100 จะอยู่ในระดับขนาดเดียวกันสำหรับการ forward pass เพียงครั้งเดียว แต่การเปรียบเทียบนี้ไม่ใช่การเทียบกันได้ตรง ๆ ในทิศทางใดทิศทางหนึ่ง: โมเดล 9B ที่โฮสต์เองบน GPU ที่ใช้ร่วมกันภายใต้โหลดไม่ได้มีความหน่วงเท่ากับ endpoint แบบโฮสต์ และ endpoint แบบโฮสต์ก็ไม่เหมือนกับเครื่องในแร็คของคุณเอง สิ่งที่พูดได้โดยไม่ต้องอ้อมค้อมคือทั้งคู่เร็วพอสำหรับการใช้แบบต่อเทิร์นในลูปของเอเจนต์ และความหน่วงของ Kev ขึ้นอยู่กับฮาร์ดแวร์ที่คุณควบคุม มากกว่าระดับบริการที่คุณได้รับสัญญาไว้
การตีความที่ตรงไปตรงมาเกี่ยวกับการจำลอง
การที่ Kev มีอยู่จริงนั้นเป็นหลักฐานเกี่ยวกับ Jev และเป็นเรื่องที่ควรค่าแก่การเอ่ยถึง โมเดลแบบปิดที่พฤติกรรมสามารถถูกประมาณได้ในห้าวันด้วยงบ 95 ดอลลาร์ โดยคนคนเดียว บนน้ำหนักฐานสาธารณะ กำลังบอกอะไรบางอย่างกับคุณว่า ความได้เปรียบของมันมาจากสถาปัตยกรรมมากแค่ไหน และมาจากข้อมูลฝึกกับการให้บริการมากแค่ไหน แต่ก็ไม่ได้หมายความว่าการสร้าง Jev นั้นง่าย — ผิว API นั้นคัดลอกได้ง่าย แต่การปรับคาลิเบรตไม่ใช่ แต่มันหมายความว่าคูเมืองไม่ใช่อินเทอร์เฟซ และใครก็ตามที่ประเมิน Jev สำหรับเส้นทางสู่การผลิต ควรคิดเผื่อความเป็นไปได้ที่การไฟน์จูนฐานแบบเปิดจะพาไปได้เกือบถึงเป้าหมาย ด้วยความมุ่งมั่นเพียงเศษเสี้ยว
ซึ่งนั่นก็เป็นเหตุผลของการยังไม่เดิมพันเส้นทางโปรดักชันกับตัวใดตัวหนึ่งด้วย หากคุณกำลังประเมิน Jev ท่าทีที่สมเหตุสมผลคือการลองใช้โดยไม่ผูกมัด และ OrcaRouter ไม่ให้บริการ Jev เพราะโมเดลของ TypeSafe อยู่ในช่วง early-access และใช้รูปแบบคำขอของตัวเอง สิ่งที่เราครอบคลุมคือครึ่งที่เป็นงานสร้างเนื้อหาของเวิร์กโฟลว์ที่โมเดลตัดสินใจเหล่านี้อยู่ภายใน: โมเดลกว่า 200 รายการภายใต้คีย์เดียวที่เข้ากันได้กับ OpenAI ในราคาตามรายการของผู้ให้บริการซึ่งส่งต่อโดยบวกเพิ่ม 0% พร้อมการสลับสำรองอัตโนมัติ สถาปัตยกรรมแบบสองโมเดลที่ชั้นการตัดสินใจราคาถูกจัดเรียงทราฟฟิกและโมเดลแบบเจเนอเรทีฟจัดการส่วนที่เหลือนั้นทดสอบได้จากฝั่งเราโดยไม่ต้องมีสัญญากับผู้ขายรายที่สอง และหากองค์ประกอบการตัดสินใจถูกปรับเทียบได้ไม่ดีกับข้อมูลของคุณ เส้นทางการสลับสำรองคือสิ่งที่หยุดไม่ให้เรื่องนั้นกลายเป็นเหตุการณ์ผิดปกติ
คำตัดสิน
ถ้างานตัดสินใจของคุณมีขอบเขตแคบ อยู่ในโดเมนตายตัว มีปริมาณสูง และอ่อนไหวต่อความเป็นส่วนตัว Kev คือตัวเลือกที่ป้องกันได้มากกว่าในวันนี้ และไม่ใช่การเปรียบเทียบที่สูสีกันเลย — คุณเป็นเจ้าของเวต คุณควบคุมเส้นทางข้อมูล คุณไฟน์จูนด้วยป้ายกำกับของคุณเองได้ และในงานจัดเส้นทางตั๋วสนับสนุน เช็กพอยต์ 9B ก็เอาชนะ Jev ด้วยตัวเลขที่ Jev เองเผยแพร่แล้ว หากงานตัดสินใจของคุณต้องใช้ความรู้รอบโลก การคำนวณหลายขั้นตอน หรือค่าความเชื่อมั่นที่คุณตั้งใจจะนำไปใช้กับระบบอัตโนมัติ โมเดลที่ยังไม่เปิดเผยและมีขนาดใหญ่กว่าของ Jev กับการฝึก RLCD ของมันกำลังทำงานจริง และอะแดปเตอร์ของ Kev ไม่สามารถใช้แทนสิ่งใดในสองสิ่งนั้นได้
สิ่งหนึ่งที่การเปรียบเทียบทั้งสองแบบยังไม่ได้ข้อสรุปคือการสอบเทียบ เพราะยังไม่มีใครเผยแพร่แผนภาพความน่าเชื่อถือของโมเดลใดในสองตัวนี้เลย จงทดสอบเรื่องนี้กับเคสที่มีป้ายกำกับของคุณเองก่อนจะนำไปใช้แบบอัตโนมัติกับตัวใดตัวหนึ่ง — ค่าความเชื่อมั่นคือส่วนของผลิตภัณฑ์ทั้งสองที่ต้องพิสูจน์ให้ได้ในแต่ละการนำไปใช้งาน และความเร็วคือส่วนที่กลายเป็นสินค้าพื้นฐานที่มีอยู่ทั่วไปแล้ว

