การ์ดฮีโร่ที่สร้างขึ้นชื่อ 'TypeSafe AI คืออะไร?' พร้อมคำบรรยายรอง 'ห้องแล็บเบื้องหลัง Jev 1.13 - การตัดสินใจแบบมีชนิด ไม่ใช่ข้อความร้อยเรียง' เหนือบรรทัดที่มีป้ายกำกับสามบรรทัด: 'บริษัท: TypeSafe AI, ซานฟรานซิสโก', 'โมเดล: Jev 1.13 (typesafe/jev-1.13) เปิดตัว 2026-09-15' และ 'จัดเส้นทางบน OrcaRouter ตั้งแต่ 2026-09-24' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

TypeSafe AI คืออะไร? แล็บเบื้องหลัง Jev 1.13 ตัดสินใจ ไม่ใช่สร้างประโยค

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

TypeSafe AI เป็นห้องแล็บเล็ก ๆ ในซานฟรานซิสโกที่ขายโมเดลซึ่งเขียนประโยคไม่ได้ และ Jev 1.13 (typesafe/jev-1.13) คือโมเดลที่ว่านี้ มันรับข้อมูลสถานะหนึ่งชิ้น — อีเมล บรรทัดล็อก ทิกเก็ตฝ่ายสนับสนุน หรือก้อน JSON — พร้อมชุดคำถามที่ตั้งชื่อไว้ แล้วคืนคำตอบที่มีชนิดข้อมูลกำกับหนึ่งคำตอบต่อหนึ่งคำถาม โดยแต่ละคำตอบมีค่าความเชื่อมั่นของตัวเอง ไม่มีข้อความร้อยเรียง ไม่มีโค้ด ไม่มีคำอธิบาย และไม่มีกล่องแชต ตัวโมเดลเปิดตัวเมื่อ 2026-09-15 ดังนั้นมันจึงไม่ใช่ของใหม่ และไม่มีอะไรในหน้านี้ที่เป็นเรื่องราวการเปิดตัว: หน้านี้มีอยู่เพราะการเปลี่ยนแปลงเล็ก ๆ ที่ระบุวันที่ได้ เมื่อ 2026-09-24 OrcaRouter ได้เพิ่ม typesafe/jev-1.13 เข้าในแคตตาล็อกของตน และเปิดการ์ดโมเดลที่ที่อยู่ของตัวเอง ซึ่งเป็นครั้งแรกที่ Jev สามารถถูกเรียกผ่านเกตเวย์ของบุคคลที่สามได้ แทนที่จะผ่านเฉพาะเอนด์พอยต์ของ TypeSafe เองเท่านั้น นั่นคือเหตุการณ์ดังกล่าว มันมีอายุได้หกวัน ณ วันที่ 2026-09-30 และเป็นเหตุผลที่ผู้อ่านซึ่งยังไม่มีสัญญากับ TypeSafe ตอนนี้สามารถวางโมเดล System One ไว้บนคีย์เดียวกับโมเดลเชิงสร้างที่มันถูกออกแบบมาให้อยู่เคียงข้างได้ ทุกอย่างอื่นในหน้านี้เป็นข้อมูลภูมิหลังเกี่ยวกับบริษัทที่สร้างมันขึ้นมา

การวางกรอบเรื่องเวลาอย่างตรงไปตรงมา เพราะมันสำคัญต่อว่าเนื้อหาส่วนนี้ได้รับการยืนยันมากน้อยเพียงใด: Jev เปิดตัวไปแล้วมากกว่าสองสัปดาห์ และพร้อมใช้งานทั่วไปตั้งแต่ 2026-09-21 เมื่อ TypeSafe ถอดรายชื่อรอออก สิ่งที่อยู่ในช่วงเวลาเจ็ดวันคือการเปลี่ยนแปลงการกำหนดเส้นทาง ไม่ใช่ตัวโมเดล หากคุณมาที่นี่โดยคาดหวังบทวิจารณ์การเปิดตัว การเปิดตัวได้เกิดขึ้นแล้ว และบทความอื่นอีกหลายชิ้นก็ได้ครอบคลุมเรื่องนั้นไปแล้ว

หน้าเพจของบริษัทที่มีแถลงการณ์และไม่มีแผนภาพสถาปัตยกรรม

TypeSafe อธิบายตัวเองในเมตาเดสคริปชันของตัวเองว่าเป็น "ห้องแล็บ AI ที่สร้างโครงสร้างพื้นฐานด้านปัญญาประดิษฐ์แบบ machine-native สำหรับระบบอัตโนมัติ" โดยมีระบบที่ "ออกแบบมาเพื่อตัดสินใจภายในซอฟต์แวร์" โฮมเพจของบริษัทประทับว่า Version 0.01 และส่วนท้ายระบุว่า "Made in SF" มีแถลงการณ์ที่โต้แย้งว่าเส้นทางที่สั้นที่สุดไปสู่การเปลี่ยนแปลงทางเศรษฐกิจที่ขับเคลื่อนด้วย AI คือการทำให้ปัญญาประดิษฐ์สามารถประกอบกันได้ (composable) เพื่อให้ซอฟต์แวร์สามารถเรียกใช้การตัดสินเชิงความหมาย (semantic judgement) ได้เหมือนกับการเรียกใช้ฟังก์ชัน สรุปแผนของบริษัทเองคือการส่งมอบรูปแบบของ AI แบบ machine-native ที่ composable ได้ จากนั้นทำให้มันเชื่อถือได้มากพอสำหรับระบบอัตโนมัติจริง แล้วจึงเสนอ abstractions ระดับสูงที่เสถียรพอที่จะนำมาซ้อนทับกัน สโลแกนของบริษัทคือ "เรากำลังสร้าง prod ไม่ใช่พระเจ้า" หน้าทีมระบุชื่อผู้ก่อตั้งสามคน — Diogo Almeida เป็น CEO, Sasha Sheng เป็น COO และ Erik Gafni เป็น CTO นั่นคือทั้งหมดที่บริษัทกล่าวเกี่ยวกับตัวเอง: จุดยืน ผลิตภัณฑ์ ชื่อสามชื่อ และไม่มีตัวเลขใดๆ เกี่ยวกับบริษัทเอง

สิ่งที่เว็บไซต์ไม่มีคือสิ่งที่วิศวกรที่กำลังประเมิน dependency ใหม่จะเอื้อมไปหยิบมาดูก่อนเป็นอันดับแรก ไม่มีหน้าสถาปัตยกรรม ไม่มีจำนวนพารามิเตอร์ ไม่มีการเปิดเผยพลังประมวลผลที่ใช้ในการฝึก และไม่มี model card ในความหมายทางวิชาการ แดชบอร์ด benchmark ของ TypeSafe เองก็ยังถูกทำเครื่องหมายว่ารอดำเนินการ สำหรับบริษัทที่จุดขายตั้งอยู่บนความน่าเชื่อถือ การเปิดเผยข้อมูลจึงเบาบาง และนั่นเป็นข้อเท็จจริงเกี่ยวกับสิ่งที่ได้รับการเผยแพร่ ไม่ใช่ข้อกล่าวหาเกี่ยวกับสิ่งที่ถูกปิดบัง

A headless-browser capture of the TypeSafe AI homepage as it stood on 2026-09-30. A navigation bar reads 'TypeSafe AI | Manifesto | Our Team | Docs | Sign In'. Under it a banner announces 'NO MORE WAITLIST / TypeSafe is now open to everyone' above a 'Create your account' button, next to a blog teaser reading 'TypeSafe announces System One models and Jev' with a 'Read more' link. Lower down, a section headed 'Introducing Jev - the First Public System One Model: Jev Gives AI The Properties Of Code' appears beside a 'Join Discord' button and the tagline fragment 'Intelligence beyond chat'.

System One: หมวดหมู่ และเหตุใดจึงยืมชื่อนี้มา

Jev เป็นรุ่นแรกของสิ่งที่ TypeSafe เรียกว่า System One models ชื่อนี้มาจากการแบ่งของ Daniel Kahneman ระหว่างการคิดแบบ System 1 ที่รวดเร็วและใช้สัญชาตญาณ กับการใช้เหตุผลแบบ System 2 ที่ช้าและไตร่ตรอง และโพสต์เปิดตัวของบริษัทก็ระบุเช่นนั้นโดยตรง — พร้อมยอมรับว่า "System 1 thinking" มีนัยแฝงถึงความผิดพลาดได้ง่าย และโต้แย้งว่าโมเดลเหล่านี้สามารถทำให้เชื่อถือได้มากกว่าทางเลือกอื่น ๆ TypeSafe ไม่ได้เป็นผู้บัญญัติคำนี้และไม่ได้เป็นเจ้าของคำนี้

เนื้อหาเชิงปฏิบัติของหมวดหมู่นี้คือการแบ่งงานกันอย่างจงใจ: โมเดลหนึ่งที่ตัดสินใจ และโมเดลหนึ่งที่เขียน คุณควรเก็บการคำนวณ การเรียงลำดับวันที่ การนับ และการเปรียบเทียบสตริงไว้ในโค้ดธรรมดา ซึ่งเป็นสิ่งที่แม่นยำตรงไปตรงมา และมอบการตัดสินใจเชิงความหมายให้ Jev มีคำถามสามประเภทที่มันสามารถตอบได้:

• noul — การตัดสินค่าจริง/เท็จ ที่ส่งกลับพร้อมความน่าจะเป็นที่ปรับคาลิเบรตแล้ว

• ตัวเลือก — เลือกหนึ่งตัวเลือกจากตัวเลือกที่มีป้ายกำกับสูงสุด 255 ตัวเลือก

• คะแนน — ให้คะแนนบนสเกลที่มีลำดับ; การ์ดของเราเผยแพร่ระดับตั้งแต่ 2-10 และเอกสารของ TypeSafe เองแสดงตัวอย่างแบบ 0-indexed ดังนั้นให้ถือว่าระดับของผู้ให้บริการเป็นคำนิยาม และ 2-10 เป็นสิ่งที่การ์ดเผยแพร่

แต่ละคำถามมีคำสั่งของตัวเอง และสำหรับตัวเลือกและคะแนนก็มีเกณฑ์ของตัวเอง คำขอที่เกินประมาณ 64K โทเคนอินพุตจะถูกปฏิเสธก่อนที่จะไปถึงโมเดล และการตอบกลับจะไม่ถูกสตรีม ผู้ขายจัดทำเอกสารแยกต่างหากเกี่ยวกับงบสถานะ — สถานะบวกกับคำถามที่ยาวที่สุดเพียงข้อเดียว — ไว้ที่ 32K โทเคน ซึ่งเป็นตัวเลขที่แคบกว่าคอนเท็กซ์ 65,536 โทเคนบนการ์ด และไม่ได้ขัดแย้งกับคอนเท็กซ์นั้น

ข้อโต้แย้งหลักของพวกเขา ในคำพูดของพวกเขาเอง

TypeSafe กล่าวถึงข้อเสนอหลักได้ดีกว่าบทสรุปใด ๆ ดังนั้นนี่คือข้อความแบบคำต่อคำ: “LLMs ผลิตคำพูดให้ผู้คน Jev ผลิตการตัดสินใจแบบมีชนิดข้อมูล และเป็นเหมือนโค้ดมากกว่า: เชื่อถือได้ รวดเร็ว สอดคล้องในตัวเอง และปลอดภัยเชิงชนิดข้อมูล” วิธีการฝึกอบรมที่อยู่เบื้องหลังสิ่งนั้นก็เป็นของพวกเขาเช่นกัน และเป็นคำที่ควรระบุที่มาให้แม่นยำ เพราะมันถูกนำไปใช้ที่อื่นราวกับว่าเป็นคำทั่วไป TypeSafe เรียกมันว่า Reinforcement Learning for Calibrated Decisions หรือ RLCD และเปรียบเทียบให้เห็นความต่างจาก RLHF และ RLVR: โดยที่สิ่งเหล่านั้นปรับให้เหมาะสมกับความชอบของมนุษย์หรือรางวัลที่ตรวจสอบได้โดยโปรแกรม RLCD มุ่งเป้า ตามถ้อยคำของบริษัท ไปที่ “คำตอบที่มีความน่าจะเป็นที่ซื่อตรงเชิงญาณวิทยาบนงาน System One” ให้ถือว่า RLCD เป็นคำที่ TypeSafe บัญญัติขึ้นเอง ไม่ใช่ตัวย่อที่ได้รับการยอมรับในวรรณกรรม

ตัวเลขที่พวกเขานำมาเป็นอันดับแรก และใครเป็นคนเลือกปริมาณงาน

หน้าแรกขึ้นต้นด้วย “เร็วขึ้น 193.6 เท่า และถูกกว่า 444.6 เท่า” โดยมีเชิงอรรถชี้ไปที่เวิร์กโฟลว์สำหรับงาน System One ด้านล่างลงมาเป็นตัวอย่างที่มีการคำนวณให้ดู: TypeSafe AI ที่ $0.000081 และ 0.114 วินาที เทียบกับ LLM ที่ $0.013880 และ 8.566 วินาที ถัดลงไปอีกคือ “$42 ต่อโทเคนอินพุตหนึ่งพันล้านโทเคน ราคาอินพุตต่ำกว่า Claude Fable 5.1 อยู่ 238 เท่า” และมีส่วนหัวข้อ “การหลอนเป็นศูนย์” ซึ่งเมื่อตรวจสอบดูแล้วเป็นข้ออ้างเกี่ยวกับการประมาณค่าความมั่นใจ มากกว่าจะเป็นการพิสูจน์ว่าไม่มีข้อผิดพลาดเลย: ทุกการตัดสินใจของ Jev มีการประมาณค่าความมั่นใจกำกับ ดังนั้นซอฟต์แวร์จึงสามารถลงมือทำเมื่อความมั่นใจสูง และส่งต่อเมื่อความมั่นใจไม่สูง ตัวเลขทั้งสี่นี้เป็นตัวเลขของ TypeSafe บนเวิร์กโหลดที่ TypeSafe เลือกเอง และไม่มีตัวเลขใดถูกทำซ้ำโดยอิสระเลย โพสต์เปิดตัวเองระบุว่าทีมคาดว่า 193.6 เท่าและ 444.6 เท่าของบริษัทจะอยู่ปลายบนของช่วงผลประโยชน์ในโลกจริง และระบุว่าเวิร์กโฟลว์เหล่านี้สร้างโดยทีมด้านขีดความสามารถของตัวเอง โดยมีคำตอบอ้างอิงที่สร้างโดยโมเดลคู่แข่ง ข้อมูลการให้บริการเจ็ดวันของเราเองบนโมเดลเดียวกันวัดอัตราความผิดพลาดไว้ที่ 0.49% ซึ่งเป็นการวัดที่แตกต่างบนเวิร์กโหลดที่แตกต่าง และเป็นน้ำหนักถ่วงที่ซื่อสัตย์ต่อการตีความคำว่า “ศูนย์” ว่าเป็นค่าสัมบูรณ์

สิ่งที่พวกเขายังไม่ได้เผยแพร่

สถาปัตยกรรม จำนวนพารามิเตอร์ ทรัพยากรคำนวณที่ใช้ฝึก และเวตของ Jev ยังไม่ถูกเปิดเผย และไม่มีรีโพซิทอรีเวตอยู่ในองค์กร GitHub ของบริษัท ตรวจสอบเมื่อ 2026-09-30 องค์กรนั้นมีรีโพซิทอรีสาธารณะ 11 แห่ง;รายการที่มีเนื้อหาสำคัญคือเครื่องมือ ซึ่งใช้สัญญาอนุญาต MIT หรือ Apache-2.0 ทั้งหมด ได้แก่ รีโป agent-skills, Python SDK, TypeScript SDK, อะแดปเตอร์ไคลเอนต์แบบเสียบใช้ได้ทันทีที่ทำงานบน LLM API อื่น ๆ, ชุดโมดูล Dagger, โค้ดประเมินเวิร์กโฟลว์ที่เผยแพร่แล้วบางส่วน, โหนด n8n และเว็บไซต์ขององค์กรเอง จำนวนดาวและวันที่ push เปลี่ยนแปลงได้ ดังนั้นควรดู ณ วันที่นั้น ๆ ไม่ใช่อ่านจากหน้านี้

สามในสิบเอ็ดเป็นฟอร์กของโปรเจกต์ที่ไม่เกี่ยวข้องกัน: vLLM, LLaDA และผู้ให้บริการ Pulumi สำหรับ ClickHouse Cloud พวกมันเป็นฟอร์กจากผลงานของคนอื่น และไม่ได้บอกอะไรเกี่ยวกับวิธีที่ Jev ถูกสร้างขึ้น — โดยเฉพาะอย่างยิ่ง ไม่ได้บอกอะไรเกี่ยวกับการที่ Jev ใช้ diffusion เป็นพื้นฐาน คำตอบแบบบรรทัดเดียวสำหรับคำถามว่า Jev เป็นโอเพนซอร์สหรือไม่ คือ เครื่องมือนั้นเปิด แต่โมเดลนั้นไม่เปิด

สิ่งที่พวกเขายอมให้ตัวเอง

คำยอมรับสองข้อจากโพสต์เปิดตัวมีค่ามากกว่าข้อแม้ของผู้ขายส่วนใหญ่ เพราะมันระบุจุดที่หลักฐานอ่อนแอได้อย่างตรงจุด ในเรื่องราคา: “เราพิสูจน์ไม่ได้ว่ามันไม่ได้ถูกอุดหนุน; เราจะต้องอาศัยระยะยาวเพื่อพิสูจน์ความยั่งยืนของราคาของเรา (ซึ่งเราคาดว่าจะลดลง ไม่ใช่เพิ่มขึ้น)” ในเรื่องความเร็ว: “การประเมินที่เราเผยแพร่มักรันจากแล็ปท็อปของเราบนชายฝั่งตะวันตก (นี่คือที่ที่บริการของเราตั้งอยู่ในปัจจุบัน)” ยังมีข้อที่สามที่มีประโยชน์กว่าสำหรับใครก็ตามที่สร้างต่อยอดบนสิ่งนี้: สำหรับชุดตัวเลือกที่มีคาร์ดินาลิตี้สูง Jev ใช้ระบบสองขั้นตอนที่ให้คะแนนอย่างอิสระแล้วจึงตัดสินใจเลือกอย่างชัดเจน “จึงทำให้เกิดความช้าลงเป็นครั้งคราว” นั่นคือผู้ขายที่กำลังอธิบายว่าทำไมความหน่วงจึงไม่คงที่ในทุกประเภทคำถาม และมันเป็นประเภทของสิ่งที่คุณมักเรียนรู้จากกระทู้สนับสนุน

ที่ที่คุณสามารถโทรได้จริง ณ วันนี้

ผ่าน API ของ TypeSafe เอง ซึ่งโมเดลพร้อมใช้งานทั่วไป และหน้าแรกยังคงใช้คำว่า "early access" ของผู้ให้บริการเอง — ถ้อยคำนั้นยังใช้อยู่ในปัจจุบันและควรค่าแก่การคงไว้ ส่วน "waitlisted" ถูกยกเลิกไปแล้ว: เอกสารเผยแพร่ขีดจำกัดการดำเนินงานที่ชัดเจน (100K โทเคนต่อวินาที, 40 คำขอต่อวินาที, 429 พร้อมการ backoff ของ SDK เมื่อเกินค่าใดค่าหนึ่ง) และไม่มีข้อความเกี่ยวกับรายการรอเลย และตั้งแต่ 2026-09-24 ผ่าน OrcaRouter

สิ่งที่เราให้บริการนั้นควรค่าแก่การระบุให้ชัดเจน เพราะรูปแบบการเรียกใช้งานคือส่วนที่แตกต่างออกไป รายการในแค็ตตาล็อกคือ typesafe/jev-1.13 ชื่อ TypeSafe: Jev 1.13 โดยมีประเภทเอนด์พอยต์ที่รองรับคือ "systemone" — ดังนั้นจึงเข้าถึงผ่าน POST /v/systemone แทนที่จะเป็นรูปแบบ chat-completions ของ OpenAI, ไม่สตรีมมิง, ข้อความเข้าและ JSON แบบมีโครงสร้างออก, รองรับโทเคนอินพุตสูงสุดประมาณ 64K เมื่อรวม state และคำถามเข้าด้วยกัน อินพุตราคา $0.042 ต่อล้านโทเคน และเอาต์พุตคิดค่าบริการที่ศูนย์ เพราะไม่มีโทเคนเอาต์พุตให้วัด: การตัดสินใจแบบมีชนิดไม่ใช่ข้อความร้อยเรียง นั่นคือราคาตามรายการของผู้ให้บริการที่ส่งผ่านตรง ที่มาร์กอัป 0% บน คีย์เดียวกับโมเดลอื่นอีกกว่า 200 โมเดลในแค็ตตาล็อก — API เดียวสำหรับกว่า 200 โมเดล มาร์กอัป 0% (ราคาตามรายการของผู้ให้บริการส่งผ่านตรง การลดราคาของผู้ขายจึงมีผลที่นี่ในวันเดียวกัน). หากเหตุผลที่คุณอ่านเกี่ยวกับ TypeSafe AI คือคุณอยากรู้ว่าการคาลิเบรตของ Jev ยังใช้ได้กับข้อมูลของคุณเองหรือไม่ ก่อนที่คุณจะกำหนดเส้นทางโปรดักชันไปที่มัน การรันมันเคียงข้างโมเดลเชิงสร้างที่คุณเชื่อถืออยู่แล้วคือวิธีที่ประหยัดในการหาคำตอบ; การสลับไปใช้โมเดลนั้นเมื่อความเชื่อมั่นของ Jev ตอบกลับมาต่ำ คือวิธีที่ประหยัดในการนำขึ้นใช้งาน.

ตัวเลขการให้บริการเจ็ดวันของเราสำหรับช่วงที่สิ้นสุดวันที่ 2026-09-30 ซึ่งเป็นตัวเลขจากทราฟฟิกของเราเอง ไม่ใช่ benchmark ของผู้ขาย: p50 151 ms, p95 247 ms, ประมาณ 349 โทเคนเอาต์พุตต่อวินาที, อัตราความผิดพลาด 0.49% และให้บริการ 76.2M โทเคน ค่า p50 รายวันตลอดช่วงนั้นอยู่ที่ 175, 170, 163, 161, 170, 147, 143 ms ดังนั้นค่ามัธยฐานจึงค่อย ๆ ลดลงเล็กน้อย วันหนึ่งในชุดข้อมูลนี้ คือ 09-28 มี p95 ที่ 2,448 ms — เป็นค่าผิดปกติจริงในข้อมูล ไม่ใช่ค่าปกติ และไม่ใช่ตัวเลขที่ควรใช้วางแผนงบประมาณความหน่วง ค่าเหล่านี้โรลรายวัน; การ์ดคือแหล่งข้อมูล

A generated two-column figure card titled 'Jev 1.13 - the scoreboard', with the OrcaRouter logo composited in the bottom-right corner. The left column, headed 'LATENCY & RELIABILITY', lists 'p50 151 ms', 'p95 247 ms' and 'Error rate (7d) 0.49%'. The right column, headed 'PRICE & CONTEXT', lists 'Price $42 per billion input tokens', 'Context 65,536 tokens (32K state budget)' and 'Architecture & weights Unpublished'. A footer line reads 'Vendor figures unaudited; latency and error rate are OrcaRouter serving data, 7 days to 2026-09-30.'

จุดที่โมเดลยังอ่อนแอ ตามที่ TypeSafe ระบุ

ผู้ขายเผยแพร่หน้าแสดงความขรุขระสำหรับ Jev 1.13 ซึ่งตรวจทานล่าสุดเมื่อ 2026-09-17 โดยระบุโหมดความล้มเหลวอย่างตรงไปตรงมามากกว่าสื่อเปิดตัวส่วนใหญ่ เป็นหน้าที่เหมาะสมที่จะอ่านก่อนสร้างต่อยอดบนโมเดล และรายการของหน้าเองมีดังนี้ Jev ตอบคำถามที่คุณเขียน ไม่ใช่คำถามที่คุณตั้งใจจะถาม ดังนั้นคำที่กำหนดขอบเขต คำปฏิเสธ และเงื่อนไขโดยนัยจึงต้องระบุให้ชัดเจน มันไม่ใช่เครื่องคิดเลข: มันให้ผลแย่กว่าในคำถามเชิงคณิตศาสตร์เมื่อเทียบกับคำถามเชิงความหมาย มันอ่านวันที่เป็นข้อความ ไม่ใช่เป็นปริมาณที่มีลำดับ ดังนั้นการจัดลำดับ ช่องว่าง และการเป็นสมาชิกของวินโดว์จึงไม่น่าเชื่อถือ และจะแย่ลงเมื่อมีรูปแบบผสมกัน คำปฏิเสธซ้อนและการอ้อมหลายช่วงทำให้ความแม่นยำลดลง ความแม่นยำลดลงเมื่อสถานะเติบโตขึ้นด้วยรายละเอียดที่ไม่เกี่ยวข้อง — หน้าเพจกล่าวว่ามัน "ประสบกับ context rot" — ดังนั้นการกรองในโค้ดก่อนจึงเป็นวิธีแก้ สถานะถูกมองเป็นข้อมูล ไม่ใช่เป็นภัยคุกคามโดยค่าเริ่มต้น ดังนั้นคำสั่งที่ถูกฉีดเข้ามาจึงสามารถเปลี่ยนคำตอบได้ คำสั่งและเกณฑ์ที่ไม่สอดคล้องกันทำให้มันสับสน ค่าคงที่เชิงโครงสร้างไม่ได้รับประกัน: เอาต์พุตแบบ noul และเอาต์พุตแบบ choice ไม่จำเป็นต้องสอดคล้องกัน และคำถามบวกคำปฏิเสธของมันไม่จำเป็นต้องรวมกันได้หนึ่ง ดังนั้นจึงไม่ควรพอร์ตค่าเกณฑ์ระหว่างทั้งสอง และมันไม่ได้ถูกฝึกมาให้สร้างข้อความ — การบังคับให้มันทำงานผ่านตัวเลือกที่เชื่อมต่อกันเป็นลูกโซ่ "จะไม่ทำงานได้ดีและจะช้ามาก"

A headless-browser capture of the TypeSafe model-jaggedness page for Jev 1.13, headed '# Jev 1.13 jaggedness' with the line 'Jev isn't perfect. Here are some jagged edges we are aware of with jev-1.13. Many of these will be fixed in later versions.' and the note 'Applies to jev-1.13 - Last reviewed 2026-09-17'. Below sits a table of nine documented failure modes - literal reading, math and numbers, date and time comparison, indirection, large state full of irrelevant detail, adversarial content, contradictory instructions and criteria, common-sense structural invariants, and generation - followed by explanatory body text on literal reading, counting and math.

วิธีอ่าน TypeSafe AI เมื่อผ่านไปหกวันของการเปลี่ยนแปลงการกำหนดเส้นทาง

บริษัทกำลังสร้างข้อกล่าวอ้างที่หนักแน่น เจาะจง และสามารถพิสูจน์ว่าผิดได้: ว่าโมเดลการตัดสินใจแบบแคบสามารถเร็วกว่า ถูกกว่า และน่าเชื่อถือกว่าโมเดลทั่วไป ในงานส่วนย่อยที่คุณต้องการการตัดสินใจมากกว่าย่อหน้าหนึ่งย่อหน้า ข้อกล่าวอ้างนี้สมเหตุสมผลและมีหลักฐานในตัวเองบางส่วน — การประมาณค่าความเชื่อมั่นเป็นความแตกต่างในการออกแบบที่แท้จริง ราคาก็เป็นของจริง และเวลาแฝงที่เราวัดจากทราฟฟิกของเราเองก็อยู่ในระดับเดียวกันกับของผู้ขาย สิ่งที่ขาดหายไปคือส่วนที่จะทำให้คนนอกตรวจสอบส่วนที่เหลือได้: ไม่มีสถาปัตยกรรม ไม่มีพารามิเตอร์ ไม่มีน้ำหนัก ไม่มีการทดสอบมาตรฐานที่เป็นอิสระ และราคาที่บริษัทเองบอกว่าไม่สามารถพิสูจน์ได้ว่ายั่งยืน โหมดความล้มเหลวได้รับการบันทึกไว้ ซึ่งมากกว่าที่แล็บส่วนใหญ่ทำ และเป็นเหตุผลที่ดีที่สุดเพียงข้อเดียวที่ควรให้ความสำคัญกับโมเดลนี้อย่างจริงจัง

ถ้าคุณกำลังตัดสินใจว่าจะให้ความสนใจหรือไม่: ให้รัน Jev กับอินพุตที่คุณมีป้ายกำกับอยู่แล้ว โดยซ่อนป้ายกำกับไว้ แล้วดูว่าตัวเลขความมั่นใจของมันแยกกรณีที่มันทำถูกออกจากกรณีที่มันทำผิดได้หรือไม่ การทดสอบนั้นแทบไม่มีค่าใช้จ่ายที่ $0.042 ต่ออินพุตโทเคนหนึ่งล้าน และเป็นเพียงการทดสอบเดียวที่ตอบคำถามที่คุณมีอยู่จริง ๆ ถ้าคุณกำลังตัดสินใจว่าจะเชื่อใจบริษัทหรือไม่: การเปิดเผยข้อมูลก็เป็นอย่างที่มันเป็น และคำตอบที่ซื่อสัตย์คือ หลักฐานในตอนนี้มีเพียงคำพูดของผู้ขายบวกกับอะไรก็ตามที่คุณสร้างขึ้นมาเอง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube