
Laya vs Kev: สองสูตรสำหรับโมเดลการตัดสินใจในท้องถิ่น
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ตัวเลขที่มีประโยชน์ที่สุดในการเปรียบเทียบ Laya กับ Kev คือใบเสร็จ Jared Palmer เทรนตระกูล Kev ด้วยค่าใช้จ่ายราว 95 ดอลลาร์สำหรับเวลา H100 บน Modal บวกกับค่าเรียก API อีกประมาณสามเซนต์สำหรับข้อมูลประเมินผล และเผยแพร่สูตรควบคู่ไปกับเวตต์ Convai Innovations เลือกเส้นทางอีกแบบกับ Laya: เปิดตัวเมื่อ 18 กันยายน 2026 ห่างจาก Jev ของ TypeSafe AI สามวัน ใช้สัญญาอนุญาต Apache 2.0 เวตต์อยู่บน Hugging Face มีจุดเข้าใช้งาน pip install laya และไม่มีไปป์ไลน์การเทรน — เป็นเช็กพอยต์ ModernBERT-large ภาษาอังกฤษขนาด 421M, mmBERT-base หลายภาษาขนาด 322M และเราเตอร์ที่เลือกใช้ระหว่างสองตัว Kev คือตระกูลของโมเดลเล็กสามตัวที่ขนาด 0.8B, 4B และ 9B แต่ละตัวประกอบด้วยฐานที่แช่แข็ง บวกกับอะแดปเตอร์ LoRA แรงด์ 16 และพอยน์เตอร์เฮดขนาดเล็ก ทั้งสองแบบตอบคำถามที่มีชนิดกำกับในฟอร์เวิร์ดพาสเดียว และทั้งคู่ไม่สร้างข้อความ การตัดสินใจเลือกระหว่างสองสิ่งนี้แท้จริงแล้วคือการตัดสินใจว่าคุณอยากเป็นเจ้าของสิ่งใด: เช็กพอยต์หรือสูตร
สิ่งที่แต่ละโปรเจกต์กำลังส่งมอบจริง ๆ
Laya มาพร้อม inference เช็กพอยต์ภาษาอังกฤษเป็นตัวเข้ารหัสแบบสองทิศทางที่มีหน้าต่าง 512 โทเคน; ตัวที่รองรับหลายภาษาครอบคลุมกว่า 100 ภาษา ด้วยหน้าต่าง 1,024 โทเคน และทำงานได้เร็วกว่าประมาณสองเท่า; เราเตอร์ตรวจจับระบบตัวอักษรได้ภายในไม่ถึงครึ่งมิลลิวินาที มันตอบ choice, score และ noul — การเลือกจากรายการ ระดับที่คาดหวังบนรูบริกที่มีลำดับ และความน่าจะเป็นที่ปรับเทียบแล้วว่าข้อกล่าวอ้างเป็นจริง มีเช็กพอยต์ที่สาม laya-typed-decisions, ซึ่งเป็นแบ็กโบน 421M ตัวเดียวกันที่ไฟน์จูนบนส่วนการฝึกของเบนช์มาร์ก typed-decisions การ์ดโมเดลของ Convai เองมีประโยคที่ควรกำกับวิธีอ่านตัวเลข Laya ทุกตัว: "Laya เป็นฐานที่รวดเร็วสำหรับการปรับให้เชี่ยวชาญ ไม่ใช่เอนจินตัดสินใจแบบ zero-shot"


Kev เปิดตัววิธีการหนึ่ง Repository ของโครงการบันทึก decision-v7 ไว้: สอง epoch บนตัวอย่าง 10,000 รายการที่ดึงมาจากชุดข้อมูลสาธารณะสิบชุด ตัวอย่างนโยบายที่สร้างขึ้น 896 รายการ และตัวอย่าง 1,680 รายการที่สร้างจากโครงสร้างกฎที่สร้างขึ้น 60 โครงสร้าง เฮดให้คะแนนตัวเลือกแต่ละตัวที่ป้อนมาเทียบกับโทเคน decideของคำถาม แล้วทำ softmax กับผลลัพธ์ เนื่องจากเช็กพอยต์ Qwen3.5 ผสม attention เข้ากับเลเยอร์ Gated DeltaNet แบบ recurrent ที่ไม่สนใจ attention mask คำถามแต่ละข้อจึงรันเป็นแถวของตัวเอง โดยสถานะที่ใช้ร่วมกันถูกคำนวณเพียงครั้งเดียวและแคชไว้ — นี่คือวิธีที่โมเดลทำให้คำถามแต่ละข้อแยกจากกันโดยไม่ต้องเสียค่าพรีฟิลใหม่ต่อคำถามหนึ่งข้อ Kev เลียนแบบสัญญา /v1/systemoneสาธารณะของ TypeSafe ดังนั้นไคลเอนต์ TypeSafe SDK ที่มีอยู่สามารถชี้ไปที่เซิร์ฟเวอร์ Kev ภายในเครื่องได้โดยเปลี่ยน base URL README ระบุว่าไม่มีการใช้เอาต์พุตของ Jev ในการฝึก
รูปแบบความล้มเหลวทั้งสองแบบแตกต่างกัน และนั่นคือเรื่องราวที่แท้จริง
โมเดลทั้งสองแพ้ให้ Jev ในงานที่ต้องอาศัยความรู้ แต่พวกมันแพ้ในลักษณะที่ต้องใช้แนวทางบรรเทาที่แตกต่างกัน
จุดอ่อนที่เผยแพร่ของ Laya เกี่ยวกับรูปร่างของอินพุต บนเบนช์มาร์ก typed-decisions ของ TypeSafe มันทำคะแนนได้ 0.362 แบบ zero-shot เทียบกับ 0.318 สำหรับการเดาสุ่ม และ 0.461 สำหรับ baseline แบบ majority-class — ใกล้เคียงกับการเดาสุ่มมากกว่าคำตอบง่าย ๆ เมื่อมีตัวเลือกเกินประมาณยี่สิบตัว มันก็เริ่มพัง: 0.425 บน Banking77 เทียบกับ 0.870 ของ Jev มันไวต่อลำดับมากพอที่การกลับลำดับตัวเลือกเฉย ๆ ทำให้ความแม่นยำลดลง 13.75 จุดในการทดสอบโดยบุคคลที่สามครั้งหนึ่ง เหลืออัตราการตอบเหมือนเดิม 42.5% และเช็กพอยต์ที่จัดส่งมานั้นมาพร้อมค่าอุณหภูมิที่ไม่ถูกต้อง — ไลบรารีจะแจ้งเตือนเมื่อนำเข้า ซึ่งหมายความว่าตัวเลขการสอบเทียบบนการ์ด ซึ่งเป็นค่าความคลาดเคลื่อนการสอบเทียบที่คาดหวังที่ 0.466 คือตัวเลขที่คุณได้จริงก่อนจะรีฟิต การรีฟิตตามประเภทคำถามทำให้ลดลงเหลือ 0.081 แต่นั่นเป็นงานที่คุณทำ ไม่ใช่งานที่ไฟล์ที่ดาวน์โหลดมาทำ มีความล้มเหลวด้านหลายภาษาที่เผยแพร่ซึ่งควรอ่านให้ครบถ้วน: บนอักษรที่ไม่ใช่ละติน เช็กพอยต์ภาษาอังกฤษมั่นใจเกินจริงอย่างร้ายแรง โดยตัวอย่างภาษาเขมรแสดงความแม่นยำ 0.000 ที่ความมั่นใจเฉลี่ย 0.952
จุดอ่อนที่เผยแพร่ของ Kev เกี่ยวกับความรู้และการคำนวณ Kev-9B ทำคะแนน 0.837 ในการทดสอบแหล่งข้อมูลใหม่ที่ล็อกไว้ของตัวเอง — 0.832 สำหรับรุ่น 4B และ 0.668 สำหรับรุ่น 0.8B — และประมาณ 0.822 นอกโดเมนบน dev split เทียบกับ 0.857 ของ Jev ช่องว่างจะปรากฏในจุดที่ต้องใช้ความรู้รอบโลก: MMLU ประมาณ 70% เทียบกับ 90% ของ Jev, MMLU-Pro 0.515 เทียบกับ 0.840 และการคำนวณวันที่ที่แม่นยำระดับวัน 60% เทียบกับ 93% บนชุด routing แบบป้ายกำกับคงที่ขนาดแคบ Kev ชนะ — การประเมิน routing ของตั๋วสนับสนุนให้ Kev-9B อยู่ที่ 0.952 เทียบกับ 0.897 ของ Jev — แต่ผู้เขียนระบุชัดเจนว่านี่คือฮาร์เนสของเขาเอง ข้อมูลฝึกของ Jev ไม่เปิดเผย และด้วยเหตุนี้จึงไม่สามารถสร้างการเปรียบเทียบแบบควบคุมได้ Kev ยังคงมั่นใจเกินไปกับแหล่งข้อมูลใหม่; การตั้งค่า KEV_TEMPERATURE=2.0 ลดข้อผิดพลาดที่มั่นใจจาก 8.7% เหลือ 4.4% ในการทดสอบของโครงการเอง ซึ่งบ่งบอกว่าค่าเริ่มต้นไม่ใช่ค่าที่ปลอดภัย
การแปลเชิงปฏิบัติ: ความล้มเหลวของ Laya เกิดจากชุดออปชันและรูปแบบพรอมป์ต์ของคุณ และคุณแก้ได้ด้วยการ fine-tuning และ refitting ความล้มเหลวของ Kev เกิดจากคำถามที่ต้องใช้ข้อเท็จจริง และคุณแก้ได้โดยจำกัดขอบเขตโมเดลให้ทำ routing และ classification และย้ายการเรียกที่ต้องพึ่งพาความรู้ไปไว้ที่อื่น ไม่มีวิธีแก้ใดเป็นเพียง config flag
สิ่งที่ต้องมีเพื่อให้บริการพวกเขา
• ฮาร์ดแวร์ — Laya: เอนโคดเดอร์ 421M/322M ใช้งานบน CPU ได้อย่างน่าเชื่อถือสำหรับปริมาณงานต่ำ และใช้หน่วยความจำ resident ต่ำกว่าหนึ่งกิกะไบต์สำหรับพอร์ต MLX บน Apple silicon Kev: 0.8B ถึง 9B โดยรุ่น 9B ต้องใช้ GPU CUDA แบบ BF16 และสถาปัตยกรรม Qwen3.5 ต้องใช้ flash-linear-attentionบน CUDA และ ROCm
• เวลาแฝง — Laya: 32.8ms p50 ต่อการตัดสินใจบน Tesla T4, 7.2ms ต่อคำถามที่แบทช์ 10 Kev: ประมาณ 300ms สำหรับคำถามที่พิมพ์ห้าข้อจากโมเดล 4B บน Mac 32GB ใน bf16, ประมาณ 40ms บน H100
• ขีดจำกัดสูงสุด — Laya: หน้าต่างภาษาอังกฤษ 512 โทเคน, หลายภาษา 1,024 โทเคน Kev: การเลือกจาก 1–255 ตัวเลือก, คะแนนจาก 2–255 ระดับ, โทเคนสถานะการฝึก 384 โทเคน โดยมี 8,192 โทเคนเมื่อให้บริการ
• เซิร์ฟเวอร์ — Laya: Python แบบอินโพรเซส พร้อมพอร์ตจากชุมชนสำหรับ ONNX, Go และ Apple MLX Kev: เซิร์ฟเวอร์ภายในเครื่องที่ผูกกับ 127.0.0.1 โดยไม่มีการยืนยันตัวตน, SDK บน npm และอะแดปเตอร์ LangChain และ LlamaIndex
• สัญญาอนุญาต — Apache 2.0 สำหรับทั้งสอง
หมายเหตุด้านการดำเนินงานสองข้อที่ไม่ปรากฏในตัวเลขพาดหัว เซิร์ฟเวอร์ของ Kev เป็นแบบคำขอเดียวและไม่มีการยืนยันตัวตนโดยการออกแบบ — มันเป็นไซด์คาร์ภายในเครื่อง ไม่ใช่สิ่งที่คุณจะเปิดให้เข้าถึงจากภายนอก และความหน่วงของ Mac ของ Kev ก็แย่กว่าความหน่วงของ H100 อย่างมีนัยสำคัญ เนื่องจากเคอร์เนล DeltaNet แบบเร็วยังไม่มีสำหรับ MLX ซึ่งเป็นรายละเอียดประเภทที่เปลี่ยนคำกล่าวอ้าง "รันในเครื่อง" ให้กลายเป็นคำกล่าวอ้าง "รันในเครื่องบนฮาร์ดแวร์ที่เหมาะสม"
ครึ่งเชิงกำเนิดของรูปแบบ
โมเดลทั้งสองนี้มีอยู่เพื่อแทนที่การเรียกใช้หนึ่งอย่างเฉพาะเจาะจง: การเรียกใช้ LLM ที่คุณทำขึ้นเพียงเพื่อให้ได้ป้ายกำกับหรือความน่าจะเป็นกลับมา พวกมันไม่ได้แทนที่การเรียกใช้ที่คุณต้องการข้อความร้อยเรียงจริงๆ ระบบสนับสนุนที่ใช้ Kev-9B ในการจัดเส้นทางตั๋วยังคงต้องการโมเดลเพื่อสรุปเธรดและร่างการตอบกลับ และโมเดลนั้นจะไม่ใช่ 9B LoRA ที่มี pointer head
นั่นคือรอยต่อที่ OrcaRouter เข้ามาเสียบอยู่ ไม่ใช่การอ้างว่าเราโฮสต์สิ่งใดสิ่งหนึ่งในสองสิ่งนี้ ทั้ง Laya และ Kev ไม่ได้อยู่ในรายการโมเดลของเรา — พวกมันคือเวตที่คุณดาวน์โหลดเอง — และบทความนี้จะทำให้เข้าใจผิดหากสื่อเป็นนัยเช่นนั้น สิ่งที่อยู่ในรายการคือโมเดลเชิงสร้างกว่า 200 รายการที่อยู่เบื้องหลังคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียว ในราคาตามรายการของผู้ให้บริการ ซึ่งส่งผ่านโดยไม่บวกเพิ่ม 0% หากคุณใช้ Kev เพื่อตัดสินว่าคำขอควรอยู่ในการสรุประดับใดจากสามระดับ หรือใช้ Laya เพื่อให้คะแนนว่าคำตอบร่างนั้นยอมรับได้หรือไม่ ฝั่งเชิงสร้างของทั้งสองลูปก็คือปลายทางเดียวที่มีการ failover อัตโนมัติ แทนที่จะต้องมีสัญญาฉบับที่สองและ SDK ตัวที่สอง routing DSL คือชิ้นส่วนที่เข้ากับสถาปัตยกรรมแบบ decision-model ได้อย่างเป็นธรรมชาติที่สุด: ประกอบโมเดลราคาถูกและโมเดลราคาแพงเข้าเป็นการเรียกครั้งเดียว แล้วให้เอาต์พุตของ decision model เป็นตัวเลือกสาขา
สิ่งที่ควรดูต่อไป
ช่องว่างในหลักฐานนี้เหมือนกันสำหรับทั้งคู่ และไม่มีโครงการใดในสองโครงการนี้ที่จะปิดช่องว่างนั้นได้ ยังไม่มีใครรัน Laya และ Kev บนอินพุตที่เหมือนกันทุกไบต์ด้วยพรอมป์ต์เดียวกัน ลำดับตัวเลือกเดียวกัน และการไล่กวาดค่าเกณฑ์ความมั่นใจชุดเดียวกัน ชัยชนะเด่น ๆ ของ Laya มาจากฮาร์เนสของตัวเอง; ข้ออ้างเรื่องความเกือบเท่าเทียมของ Kev มาจากฮาร์เนสของผู้เขียนของมัน; การตรวจสอบการสอบเทียบที่พบว่าการสอบเทียบของ Jev แปรผันอย่างรุนแรงตามงาน — ความแม่นยำ 44.7% และค่าความคลาดเคลื่อนการสอบเทียบที่คาดหวัง 0.325 บนงานจัดลำดับความสำคัญแบบนโยบายซ่อนเร้น — เป็นของบุคคลที่สาม และทั้ง Laya และ Kev ยังไม่เคยได้รับการตรวจสอบแบบนั้น จนกว่าจะมีใครสักคนทำมัน ตัวเลขข้างต้นเป็นตัวเลขที่ดีที่สุดเท่าที่มีอยู่ และไม่สามารถนำมาเปรียบเทียบกันได้
หากคุณกำลังตัดสินใจวันนี้: เลือก Kev ถ้าคุณต้องการโมเดลจัดเส้นทางที่ใช้งานได้ภายในสัปดาห์นี้บน GPU ที่คุณเช่าอยู่แล้ว และยอมรับว่ามันจะไม่รู้บางเรื่อง เลือก Laya ถ้าข้อมูลนำเข้าของคุณมีหลายภาษา หรืองบประมาณฮาร์ดแวร์ของคุณคือแล็ปท็อป และให้ตั้งงบสำหรับการปรับละเอียดเป็นส่วนหนึ่งของโครงการ แทนที่จะเป็นงานปรับให้เหมาะสมในภายหลัง ไม่ว่าจะทางใด จงวัดผลบนข้อมูลที่คุณติดป้ายกำกับเองก่อนที่คุณจะวางเกณฑ์ความเชื่อมั่นไว้หน้าทราฟฟิกโปรดักชัน — ทั้งสองโครงการ ในเอกสารของตนเอง บอกให้คุณทำเช่นนั้น

