
Jev vs Laya: 33 มิลลิวินาทีบน T4 และเส้นฐานแบบสุ่ม
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
การ์ดโมเดลของ Laya มีประโยคที่ตัดสินการเปรียบเทียบนี้ และมันเขียนขึ้นโดยคนที่สร้าง Laya ขึ้นมา “Laya เป็นฐานที่เร็วสำหรับนำไปปรับให้เชี่ยวชาญเฉพาะทาง ไม่ใช่เอนจินตัดสินใจแบบ zero-shot” Convai Innovations เปิดตัว Laya เมื่อวันที่ 18 กันยายน 2026 สามวันหลังจากที่ TypeSafe AI เปิดตัว Jev ภายใต้ Apache 2.0 พร้อมน้ำหนักบน Hugging Face และ pip install laya เป็นจุดเข้าใช้งาน มันตอบคำถามแบบมีชนิดใน forward pass ครั้งเดียวโดยไม่มีการถอดรหัสทีละโทเคน ซึ่งเป็นเดิมพันทางสถาปัตยกรรมแบบเดียวกับที่ Jev ทำ ข้อกล่าวอ้างเด่นคือความหน่วง p50 ที่ 32.8 มิลลิวินาทีต่อการตัดสินใจบน Tesla T4 โดยนำเสนอว่าเร็วกว่าค่า p50 ที่เผยแพร่ของ Jev ซึ่งอยู่ที่ 236–276ms ผ่าน hosted API ของมันราว 7.8 เท่า ข้อกล่าวอ้างนี้เป็นจริง และมันยังวัดสองสิ่งที่แตกต่างกัน — GPU ในเครื่องเทียบกับการเรียกผ่านเครือข่าย — และภาพความแม่นยำที่อยู่ข้างใต้คือส่วนที่ควรกำหนดว่าคุณจะดาวน์โหลดมันหรือไม่ แบบ zero-shot Laya ทำคะแนน 0.362 บน benchmark typed-decisions ของ TypeSafe การเดาสุ่มทำคะแนน 0.318 ค่าฐาน majority-class ทำคะแนน 0.461 Laya แบบพร้อมใช้ อยู่ใกล้การเดาสุ่มมากกว่าค่าฐานพื้นฐานทั่วไป
Laya จริง ๆ แล้วคืออะไร

Laya มาพร้อมเช็กพอยต์สองตัวที่อยู่เบื้องหลังเราเตอร์ในตัว ซึ่งจะส่งแต่ละอินพุตไปยังเช็กพอยต์ที่เหมาะสม เช็กพอยต์ภาษาอังกฤษคือ ModernBERT-large ที่มีพารามิเตอร์ 421M และบริบท 512 โทเค็น ส่วนตัวแปรหลายภาษาคือ mmBERT-base ที่มีพารามิเตอร์ 322M และหน้าต่าง 1,024 โทเค็นครอบคลุมมากกว่า 100 ภาษา ทั้งสองเป็นแบบไม่ออโตรีเกรสซีฟ: การส่งผ่านไปข้างหน้าครั้งเดียวจะคืนคำตอบ ดังนั้นจึงไม่มีลูปถอดรหัส ไม่มี JSON ให้แยกวิเคราะห์ และไม่มีช่องว่างให้ส่งข้อความออกมานอกชนิดที่ประกาศไว้ คุณสมบัติข้อหลังนี้เป็นการรับประกันเชิงโครงสร้างแบบเดียวกับที่ Jev เสนอ แต่มาถึงจากคนละทิศทาง และมีคุณค่าจริง ๆ สำหรับใครก็ตามที่เคยเขียนลอจิกการลองใหม่รอบโมเดลที่บางครั้งลืมปิดปีกกา
Jev เป็นโมเดลคู่แบบปิด: โมเดล System One ตัวแรกของ TypeSafe AI เปิดตัวเมื่อวันที่ 15 กันยายน 2026 ให้บริการแบบโฮสต์และเป็น early access พร้อมพริมิทีฟที่มีชนิดกำกับสามแบบ — Choice จากรายการที่คุณจัดหาให้, Score บนเกณฑ์การให้คะแนนแบบมีลำดับ และ Noul ซึ่งเป็นข้ออ้างแบบใช่/ไม่ใช่ที่มีความน่าจะเป็นแบบคาลิเบรตแล้ว คำถามทั้งหมดถูกประเมินแบบขนานเทียบกับการอ่านสถานะร่วมกันเพียงครั้งเดียว เอาต์พุตฟรีเพราะไม่มีโทเคนเอาต์พุต และอินพุตราคา 0.042 ดอลลาร์ต่อล้านโทเคน สถาปัตยกรรม จำนวนพารามิเตอร์ และคอมพิวต์ที่ใช้ฝึกไม่ถูกเปิดเผย และ TypeSafe กล่าวว่ารายละเอียดเหล่านี้ถูกเก็บเป็นความลับอย่างหวงแหน โดยอาจมีเปเปอร์ตามมาภายหลัง
คำกล่าวอ้างเรื่องเลเทนซี เมื่อวัดอย่างถูกต้อง
ค่า p50 32.8ms ของ Laya บน T4 เป็นตัวเลขจริงและเป็นค่าที่ดี การเปรียบเทียบ 7.8x กับ 236–276ms ของ Jev คือจุดที่ต้องระมัดระวัง และการ์ดของ Laya เองก็ตรงไปตรงมาอย่างผิดปกติเกี่ยวกับสาเหตุว่า ตัวเลขของ Jev เป็นตัวเลขที่เผยแพร่โดยบุคคลที่สามซึ่ง Convai ไม่เคยวัดด้วยตนเอง และการเปรียบเทียบนี้จับการ forward pass บน GPU ภายในเครื่องมาเทียบกับ API call แบบโฮสต์ซึ่งรวมเวลาไป-กลับของเครือข่ายและการเข้าคิว เมื่อตัดเครือข่ายออก การเปรียบเทียบเชิงสถาปัตยกรรมจะอยู่ระหว่างโมเดล single-pass สองตัว โดยตัวหนึ่งมี 421M พารามิเตอร์ และอีกตัวมีขนาดที่ไม่เปิดเผยซึ่ง TypeSafe ไม่เคยเผยแพร่
ยังมีตัวเลขการทำแบตช์ที่น่าทราบ: ที่แบตช์ขนาดสิบ Laya รายงานว่าใช้เวลา 7.2 มิลลิวินาทีต่อคำถาม นั่นคือลักษณะของผลิตภัณฑ์นี้ Laya ถูกสร้างมาให้รันในเครื่องแบบปริมาณมาก และพอร์ตจากชุมชนที่ทำงานบนอุปกรณ์อย่าง laya-mlx ก็ขยายความสามารถนั้นไปสู่ Apple Silicon ข้อกล่าวอ้างแบบไวรัลว่า "เร็วกว่า Jev 50 เท่า" ไม่ได้รับการสนับสนุนจากเบนช์มาร์กที่โครงการเผยแพร่เอง และการนำเสนออย่างตรงไปตรงมาคือช่องว่างขนาดใหญ่ระหว่างในเครื่องกับคลาวด์ ซึ่งส่วนหนึ่งเป็นเรื่องสถาปัตยกรรม และอีกส่วนหนึ่งก็เป็นเพียงความแตกต่างระหว่าง GPU ของคุณกับ API ของคนอื่น
สิ่งที่ตัวเลขความแม่นยำบอก ตามลำดับ
นี่คือจุดที่การเปรียบเทียบเริ่มไม่เป็นผลดีอีกต่อไป และควรวางให้เห็นตามลำดับ เพราะลำดับนั้นสำคัญ
• Zero-shot บนเบนช์มาร์ก typed-decisions ของ TypeSafe — Laya 0.362, สุ่ม 0.318, คลาสส่วนใหญ่ 0.461, Jev 0.727. Laya สูงกว่าการเดาสุ่มและต่ำกว่าค่าพื้นฐานแบบง่าย
• ผ่านการไฟน์จูนบนชุดฝึกของ benchmark เอง — Laya 0.766 เทียบกับ Jev 0.727 Laya ชนะ และชัยชนะนี้มาจากเช็กพอยต์ที่เคยเห็นข้อมูลฝึกของ benchmark ซึ่งทำให้มันเป็นข้อความเกี่ยวกับการไฟน์จูน ไม่ใช่เกี่ยวกับโมเดลฐาน
• การจำแนกเจตนา Banking77 ซึ่งชุดตัวเลือกมีขนาดใหญ่ — Laya 0.425 เทียบกับ 0.870 ของ Jev Laya มีประสิทธิภาพลดลงอย่างรวดเร็วเมื่อมีตัวเลือกเกินประมาณ 20 รายการ และ Choice fields ของ Jev มีเอกสารระบุว่ารองรับได้ถึง 255 รายการก่อนที่จะต้องใช้รูปแบบการให้คะแนนแบบสองขั้นตอน
• การสอบเทียบ (Calibration) — Laya มาพร้อมกับค่าความคลาดเคลื่อนการสอบเทียบที่คาดหวังเฉลี่ยที่ 0.466 โดยจะดีขึ้นเป็น 0.081 ก็ต่อเมื่อปรับ temperature ใหม่แยกตามประเภทคำถาม Jev ถูกฝึกด้วยวิธีการที่ TypeSafe เรียกว่า RLCD (Reinforcement Learning for Calibrated Decisions) และให้คำตอบทุกข้อพร้อมการแจกแจงความน่าจะเป็น — แม้ว่า TypeSafe จะแนะนำให้ผู้ใช้ตรวจสอบเกณฑ์บนข้อมูลที่มีป้ายกำกับของตนเองด้วย และการตรวจสอบอิสระครั้งหนึ่งพบว่าการสอบเทียบของ Jev แปรผันอย่างรุนแรงไปตามงาน
รูปแบบนี้ชัดเจนไม่มีกำกวม Laya เป็นฐานที่แข็งแกร่งสำหรับการ fine-tune และเป็นเอนจินตัดสินใจแบบ zero-shot ที่อ่อนแอ และตัวมันเองก็บอกเช่นนั้น Jev เป็นเอนจินตัดสินใจแบบ zero-shot ที่แข็งแกร่ง ซึ่งการสอบเทียบยังต้องได้รับการตรวจสอบต่อการนำไปใช้ในแต่ละครั้ง สิ่งเหล่านี้เป็นผลิตภัณฑ์ที่แตกต่างกันด้วยโครงสร้างราคาที่แตกต่างกัน และการเลือกระหว่างทั้งสองส่วนใหญ่เป็นคำถามว่าคุณมีข้อมูลที่มีป้ายกำกับและลูปการฝึกหรือไม่
การคำนวณต้นทุนไม่ได้มีรูปแบบเดียวกับของ Jev
Jev ราคา $0.042 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น โดยเอาต์พุตฟรี ซึ่งเท่ากับ $42 ต่อพันล้าน และการเรียกขนาดสูงสุดภายใต้งบประมาณคำขอ ~32,000 โทเค็นตามที่ระบุในเอกสาร มีค่าใช้จ่ายต่ำกว่าหนึ่งเซนต์มาก การทดสอบอิสระของ Every ทำการตัดสิน 777 รายการจากเอกสาร 37 ฉบับ ด้วยค่าใช้จ่ายประมาณหนึ่งในสี่ของเซนต์
ค่าใช้จ่ายต่อการเรียกของ Laya เป็นศูนย์ที่ส่วนเพิ่มและไม่เป็นศูนย์โดยรวม และยอดรวมก็ไม่น้อย โมเดลขนาด 421 ล้านพารามิเตอร์บน T4 นั้นใช้งานได้ในราคาถูกแต่ก็ยังต้องใช้ GPU และขั้นตอนการปรับแต่งละเอียดที่ทำให้ Laya แข่งขันได้คือจุดที่ค่าใช้จ่ายจริงอยู่ — การติดป้ายข้อมูล การรันฝึก ชุดเครื่องมือประเมิน และการปรับ temperature ใหม่แยกตามประเภทคำถาม ซึ่งทำให้ค่าความคลาดเคลื่อนของการปรับเทียบลดจาก 0.466 เหลือ 0.081 สำหรับอนุกรมวิธานแบบคงที่ที่ไม่เปลี่ยนแปลง นั่นคือค่าใช้จ่ายครั้งเดียวที่คืนทุนเมื่อใช้ในปริมาณมาก สำหรับอนุกรมวิธานที่คลาดเคลื่อน มันเป็นค่าใช้จ่ายที่เกิดซ้ำ และ baseline zero-shot ของ Jev ที่ 0.727 ก็กลายเป็นข้อเสนอที่ดีกว่ามาก
มีต้นทุนที่สามที่มองข้ามได้ง่าย: เช็กพอยต์ภาษาอังกฤษของ Laya มีหน้าต่างบริบทขนาด 512 โทเคน นั่นไม่ใช่โมเดลตัดสินใจที่มีงบบริบทเล็ก — มันคือโมเดลตัดสินใจที่ออกแบบมาให้พอดีกับหนึ่งย่อหน้า งบคำขอประมาณ 32,000 โทเคนของ Jev นั้นใหญ่กว่าถึงหกสิบเท่า และแม้แต่จำนวนนั้นก็ยังต่ำกว่าโมเดลเชิงสร้างที่ทั้งสองถูกนำไปตั้งราคาเทียบด้วยอยู่หนึ่งลำดับขนาด หากสถานะของคุณเป็นเธรดสนับสนุนมากกว่าข้อความสนับสนุน หน้าต่างของโมเดลทั้งสองก็ไม่ใช่ข้อจำกัดที่คุณควรปรับให้เหมาะกับมัน
คำถามเรื่องการปรับใช้คือความแตกต่างที่แท้จริง

ข้อโต้แย้งที่แข็งแกร่งที่สุดของ Laya ไม่ใช่เรื่องความหน่วง แต่คือเวต Apache 2.0 บน Hugging Face ซึ่งหมายความว่าการตัดสินใจไม่เคยออกจากโครงสร้างพื้นฐานของคุณ และเอนด์พอยต์ก็ไม่มีขีดจำกัดอัตราเลย สำหรับการตัดสินใจจัดเส้นทางที่อิงจากเวชระเบียน เอกสารทางกฎหมาย หรือประวัติบัญชีของลูกค้า นั่นไม่ใช่แค่ความชอบ — มันคือปัจจัยชี้ขาด และไม่มีเอนด์พอยต์แบบโฮสต์ใดในราคาใดที่จะชนะข้อโต้แย้งนั้นได้ Jev ของ TypeSafe อยู่ในช่วงเข้าใช้งานก่อนกำหนดและมีรายชื่อรอ และเอกสารของมันเองระบุว่าขีดจำกัดอัตราอาจเปลี่ยนแปลงได้โดยไม่แจ้งให้ทราบ
ข้อโต้แย้งอีกด้านคือสิ่งที่คุณต้องยอมสละไป สถาปัตยกรรมขนาดใหญ่ที่ไม่เปิดเผยของ Jev กำลังทำหน้าที่ในสิ่งที่พารามิเตอร์ 421M ของ Laya ทำไม่ได้: ช่องว่าง zero-shot ที่ 0.727 เทียบกับ 0.362 และช่องว่าง Banking77 ที่ 0.870 เทียบกับ 0.425 ต่างก็เป็นตัวชี้วัดว่ามีความรู้อยู่ในโมเดลมากเพียงใดก่อนที่คุณจะเทรนมัน คำตอบของ Laya คือคุณต้องป้อนความรู้นั้นเองผ่าน fine-tuning และในโดเมนแคบที่ตายตัว คำตอบนั้นใช้ได้ — ผลลัพธ์ fine-tuned ที่ 0.766 คือหลักฐาน
ตำแหน่งที่ชั้นการตัดสินใจตั้งอยู่ในสแตกจริง
โมเดลทั้งสองไม่สร้างข้อความ ดังนั้นจึงไม่มีตัวใดเป็นทั้งหมดของเวิร์กโฟลว์ใด ๆ รูปแบบที่ทั้งสองถูกออกแบบมาสำหรับคือสองโมเดล ได้แก่ ชั้นการตัดสินใจที่ทำการเรียกแบบมีชนิด และโมเดลเชิงสร้างที่จัดการส่วนที่ต้องใช้ถ้อยคำ โค้ด หรือคำอธิบาย OrcaRouter ไม่ให้บริการ Jev หรือ Laya — Jev เป็น endpoint แบบ early-access ของ TypeSafe และ Laya เป็นเวตที่คุณรันเอง — แต่ครึ่งที่เป็นโมเดลเชิงสร้างของรูปแบบนั้นคือสิ่งที่เราครอบคลุมพอดี: โมเดล 200+ ตัวภายใต้คีย์เดียวที่เข้ากันได้กับ OpenAI ที่ราคาตามรายการของผู้ให้บริการ ส่งผ่านโดยบวกกำไร 0% ดังนั้นการเปลี่ยนแปลงราคาจากผู้ขายจึงมีผลฝั่งเราในวันเดียวกัน สถาปัตยกรรมแบบสองโมเดลนี้ทดสอบได้โดยไม่ต้องมีสัญญากับผู้ขายรายที่สอง และด้วยการสลับไปใช้สำรองอัตโนมัติ เส้นทางของโมเดลเชิงสร้างจะไม่กลายเป็นจุดล้มเหลวจุดเดียว ขณะที่คุณตัดสินใจว่าชั้นการตัดสินใจราคาถูกนั้นปรับเทียบดีพอที่จะรันอัตโนมัติด้วยหรือไม่
คำตัดสิน
หากคุณมีการจัดหมวดหมู่ที่ตายตัวและแคบ มีตัวอย่างที่มีป้ายกำกับ และมีข้อกำหนดด้านความเป็นส่วนตัวหรือความหน่วงที่ตัด API แบบโฮสต์ออกไป Laya คือตัวเลือกที่ปกป้องได้ง่ายกว่า และตัวเลขจากการ fine-tune ก็สนับสนุนข้อนี้ หากคุณต้องการให้การตัดสินใจทำงานได้ทันทีโดยไม่ต้องตั้งค่า หากชุดตัวเลือกของคุณมีเกินยี่สิบหมวดหมู่ หรือหากสถานะยาวกว่าหนึ่งย่อหน้า การ์ดโมเดลของ Laya เองบอกคุณว่ามันไม่ใช่ผลิตภัณฑ์สำหรับงานนั้น — และคะแนน zero-shot 0.362 เมื่อเทียบกับเส้นฐาน majority 0.461 คือตัวเลขที่ควรจดจำไว้เมื่อมีคนยกตัวเลขความหน่วง 7.8x มาอ้างกับคุณ
สิ่งที่ทั้งสองมีร่วมกันนั้นมีประโยชน์ยิ่งกว่าสิ่งที่ทำให้ทั้งสองแตกต่างกัน ทั้งคู่ขจัดข้อผิดพลาดประเภทที่เกิดจากรูปแบบผลลัพธ์ แต่ไม่ได้ทำอะไรกับประเภทที่เกิดจากการตัดสินใจ ทั้งคู่ให้ค่าความน่าจะเป็นมาด้วยกัน และไม่มีตัวใดมีไดอะแกรมความน่าเชื่อถือที่เผยแพร่ไว้ซึ่งคุณจะเชื่อได้โดยไม่ต้องตรวจสอบ ทดสอบการปรับเทียบค่าความเชื่อมั่นกับเคสที่มีป้ายกำกับของคุณเองก่อนที่จะนำระบบใดระบบหนึ่งไปทำงานอัตโนมัติ — ความหน่วงกลายเป็นเรื่องธรรมดาไปแล้ว ส่วนค่าความเชื่อมั่นคือส่วนที่ต้องพิสูจน์ให้ได้ในแต่ละการติดตั้งใช้งาน

