การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับการเปรียบเทียบ Laya กับ von ซึ่งมีคำบรรยายย่อยของบทความนี้เองและบรรทัดส่วนท้ายที่ระบุว่าตัวเลขของฝ่ายใดเป็นข้อมูลที่ผู้ขายรายงาน และฝ่ายใดเป็นข้อมูลจากบุคคลที่สาม
Engineering & Research

Laya กับ von: เมื่อเบนช์มาร์กจากผู้ขายไม่สามารถถ่ายโอนได้

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

งานจำแนกประเภทคอมมิตที่มีป้ายกำกับที่เป็นไปได้หกป้าย โดยการเดาจะได้ 8.3% และ von ทำได้ 26.7% งานกำหนดเส้นทางไฟล์ที่โมเดลเดียวกันทำได้ 8.8% ซึ่งแทบไม่เหนือกว่าการเดา งานไบนารีเรื่องขอบเขตการเปลี่ยนแปลงที่มีค่า AUC 0.513 ซึ่งเป็นการทอยเหรียญ ตัวเลขเหล่านั้นมาจากการประเมินของบุคคลที่สามต่อ von — โมเดล System One โอเพนซอร์สจาก wfzyx ซึ่งเป็นเอนโคเดอร์ ModernBERT-Large ขนาด 395M ที่เผยแพร่ภายใต้ Apache 2.0 เมื่อวันที่ 18 กันยายน 2026 วันเดียวกับ Laya ของ Convai Innovations บนเบนช์มาร์ก jabr v2 ของ von เอง ภาพกลับตรงกันข้าม: ความแม่นยำมาโคร 71.5% จาก 49 งานและ 869 กรณี, การกำหนดเส้นทางแบบทางเลือกที่ 83.4%, และผล ViZDoom ที่ 9.38 การสังหารเฉลี่ยในเวลาไม่ถึง 18ms เทียบกับ Jev ของ TypeSafe AI ที่ 5.62 การสังหารและประมาณ 115ms ตัวเลขทั้งสองชุดเป็นของจริง ช่องว่างระหว่างตัวเลขทั้งสองชุดเป็นสิ่งที่มีประโยชน์ที่สุดที่ใครๆ ก็เคยเผยแพร่เกี่ยวกับหมวดหมู่โมเดลนี้ และมันใช้ได้กับ Laya ด้วยเช่นกัน

สองโมเดล สองแบ็กโบน หนึ่งโหมดความล้มเหลวร่วมกัน

von และ Laya ใกล้เคียงกันในเชิงสถาปัตยกรรม ด้วยเหตุนี้ปัญหาการถ่ายโอน (transfer problem) จึงเป็นมุมมองที่เหมาะสมสำหรับการเปรียบเทียบทั้งสอง ทั้งคู่เป็นเอนโคเดอร์แบบ non-autoregressive ที่สร้างขึ้นบน ModernBERT: von มี 395M พารามิเตอร์ ส่วนเช็กพอยต์ภาษาอังกฤษของ Laya มี 421M ทั้งคู่เปิดให้ใช้ primitive สามอย่างชุดเดียวกัน — choice จากรายการที่จัดเตรียมไว้ score บนรูบริกที่มีลำดับ noul ในฐานะความน่าจะเป็นแบบคาลิเบรตของค่า yes — และทั้งคู่ใช้งานรูปแบบ wire /v1/systemone เพื่อให้ไคลเอนต์ที่เขียนมาสำหรับ Jev ของ TypeSafe ชี้ไปยังเซิร์ฟเวอร์ภายในเครื่องแทนได้ ทั้งคู่ใช้สัญญาอนุญาต Apache 2.0 ทั้งคู่คืนค่าความน่าจะเป็นแทนที่จะเป็นข้อความ และไม่มีลูปการถอดรหัสให้เกิดการหลอน (hallucination) ได้

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

ความแตกต่างอยู่ที่เรื่องราวการฝึก von ถูกพรีเทรนบนโทเค็น 2 ล้านล้านโทเค็นของข้อความเว็บทั่วไป เอกสารทางเทคนิค และโค้ด จากนั้นจึงไฟน์จูนบนคลังข้อมูลหลายโดเมนที่สมดุลประมาณ 290,000 ตัวอย่าง ครอบคลุมเวิร์กโฟลว์ด้านปฏิบัติการและองค์กร ความปลอดภัยและ DevOps ความปลอดภัยและการกลั่นกรองนโยบาย ภาษาศาสตร์ การคัดแยก และการให้เหตุผลเชิงปฏิปักษ์ การฝึกหลังการฝึกใช้ Reinforcement Learning with Calibration Distribution โดยลดองค์ประกอบของเอนโทรปีไขว้และคะแนนไบรเออร์ด้วยแลมบ์ดาที่ 0.5 และการปรับขนาดอุณหภูมิลู่เข้าที่ T=1.1692 เช็คพอยต์ภาษาอังกฤษของ Laya คือ ModernBERT-large ที่ไฟน์จูนสำหรับรูปแบบการตัดสินใจแบบมีชนิด พร้อมหน้าต่าง 512 โทเค็น ควบคู่กับเช็คพอยต์หลายภาษาขนาด 322M mmBERT-base ที่ครอบคลุมกว่า 100 ภาษาที่อยู่เบื้องหลังเราเตอร์ และค่า p50 32.8ms ต่อการตัดสินใจที่เผยแพร่บน Tesla T4

โหมดความล้มเหลวร่วมคือทั้งคู่เป็นเอนโคเดอร์ที่ถูกฝึกมาให้สร้างผลลัพธ์ ไม่ใช่ตัวให้เหตุผล README ของ von เองก็ระบุชัดเจนว่ามันกำหนดเป้าหมายไปที่ไปป์ไลน์ที่ไวต่อความหน่วง ซึ่งโมเดล autoregressive ทำให้เกิดความหน่วง 500–2,000ms และข้อผิดพลาดในการแยกวิเคราะห์สคีมาที่ไม่แน่นอน กรอบแนวคิดนั้นบอกคุณว่ามันมีไว้สำหรับอะไร: การจำแนกประเภทที่รวดเร็ว แน่นอน และปรับเทียบทางสถิติ มันไม่ได้บอกคุณว่ามันจะได้ผลกับการจำแนกประเภทของคุณ และการวัดประสิทธิภาพแบบอิสระคือสิ่งที่เกิดขึ้นเมื่อมีคนตรวจสอบ

อ่าน benchmark ของ von อย่างตรงไปตรงมา

ผลลัพธ์ของ jabr v2 ถูกเผยแพร่โดยเจ้าของเองและยังไม่ได้รับการตรวจสอบอย่างอิสระ และโครงสร้างของเบนช์มาร์กก็สำคัญพอ ๆ กับคะแนน งาน 49 งานและ 869 เคสถือเป็นความกว้างที่สมเหตุสมผลสำหรับการประเมินโมเดลสำหรับการตัดสินใจ และความแม่นยำแบบมาโคร 71.5% เป็นตัวเลขที่แข็งแกร่งสำหรับเอนโคเดอร์ขนาด 395M การแยกตามโดเมนคือจุดที่ให้ข้อมูลเชิงลึก: การคัดแยกอาการอยู่ที่ 100.0% บริการภายในบ้านอยู่ที่ 95.7% การจัดเส้นทางระดับเมืองอยู่ที่ 94.7% การจัดเส้นทางแบบเลือกโดยรวมอยู่ที่ 83.4% นั่นคือกลุ่มงานที่คอร์ปัสฝึกอบรมถูกสร้างขึ้นโดยเน้นเป็นหลัก — README อธิบายข้อมูล fine-tuning ว่าเป็นเวิร์กโฟลว์ด้านปฏิบัติการและองค์กร ความปลอดภัยและ DevOps การกลั่นกรองด้านความปลอดภัยและนโยบาย ภาษาศาสตร์ การคัดแยก และการให้เหตุผลเชิงปฏิปักษ์ คะแนนสูงในด้านการคัดแยกอาการเป็นข้อบ่งชี้ว่าโมเดลเรียนรู้โดเมนการคัดแยก ไม่ได้เรียนรู้ที่จะจำแนกประเภท

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

ผลลัพธ์ของ ViZDoom เป็นผลลัพธ์ที่ถูกอ้างถึงมากที่สุด และสมควรได้รับการอ่านอย่างรอบคอบ ค่าเฉลี่ยการสังหาร 9.38 ครั้งใน "Defend the Center" ใช้ 8 ซีด แบบ zero-shot จากข้อความฉากที่มีโครงสร้าง ที่ความหน่วงต่ำกว่า 18 มิลลิวินาที เทียบกับ 5.62 ครั้งของ Jev ที่ประมาณ 115 มิลลิวินาที — เป็นการปรับปรุง +66.9% นี่เป็นผลลัพธ์ที่น่าทึ่ง และยังเป็นสภาพแวดล้อมเกมที่ขับเคลื่อนด้วยข้อความที่มีโครงสร้าง ซึ่งนโยบายรีเฟล็กซ์ที่รวดเร็วนั้นเป็นรูปแบบที่เหมาะสมพอดี การวางกรอบกระบวนทัศน์ System One ของโครงการ — รีเฟล็กซ์ ขนาน ดีเทอร์มินิสติก ปรับเทียบเชิงสถิติ — เป็นคำอธิบายที่ตรงไปตรงมาของสิ่งที่งานนั้นให้รางวัล

จากนั้นการประเมินโดยบุคคลที่สามได้รัน von กับงานจำแนกประเภทคอมมิต การจัดเส้นทางไฟล์ การตรวจจับฟีเจอร์ และการให้คะแนนความกว้างของการเปลี่ยนแปลง และมันแพ้ให้กับเส้นฐานแบบคีย์เวิร์ดและ regex ในบางงานเหล่านั้น ค่า AUC ที่ 0.513 บนงานไบนารีเป็นตัวเลขที่ชัดที่สุด: เท่ากับการโยนเหรียญ จากโมเดลที่การคาลิเบรตถูกปรับจูนเป็น T=1.1692 และ README อ้างว่ามีค่า expected calibration error ใกล้เคียงอุดมคติ ทั้งสองอย่างสามารถเป็นจริงได้พร้อมกัน โมเดลหนึ่งอาจคาลิเบรตได้ดีบนการแจกแจงที่มันถูกฝึก และไร้ประโยชน์บนการแจกแจงที่มันไม่เคยเห็น — และที่จริงแล้ว การคาลิเบรตที่ดีบนการแจกแจงที่ผิดนั้นแย่กว่าการคาลิเบรตที่แย่อย่างเห็นได้ชัด เพราะตัวเลขความเชื่อมั่นดูน่าเชื่อถือ

การทดสอบเดียวกันนี้ใช้กับ Laya

Laya ได้รับการทดลองในรูปแบบหนึ่ง และผลลัพธ์ก็สอดคล้องกับของ von ในเกณฑ์มาตรฐาน typed-decisions ของ TypeSafe Laya ทำคะแนนได้ 0.362 ในแบบ zero-shot เทียบกับ 0.318 สำหรับการสุ่ม และ 0.461 สำหรับ majority-class baseline — ใกล้เคียงกับโอกาสสุ่มมากกว่าคำตอบแบบง่าย ๆ การ์ดโมเดลของมันเองระบุข้อสรุปว่า: "Laya เป็นฐานที่เร็วสำหรับการปรับแต่งเฉพาะทาง ไม่ใช่เครื่องมือตัดสินใจแบบ zero-shot" เมื่อเกินประมาณยี่สิบตัวเลือก ประสิทธิภาพจะลดลงอย่างรวดเร็ว โดยได้ 0.425 บน Banking77 เทียบกับ 0.870 ของ Jev ในการทดสอบโดยบุคคลที่สามครั้งหนึ่งกับข้อความเร่งด่วน 100 ข้อความของ Mars-base Jev ได้ 100/100 และ Laya ได้ 53/100 ในเกณฑ์มาตรฐาน browser-agent มันทำงานสำเร็จ 0 จาก 50 งาน โดยประกาศว่าเสร็จสิ้นก่อนเวลาอันควรใน 33 ครั้ง ซึ่ง 17 ครั้งเกิดขึ้นก่อนที่จะลงมือทำอะไรเลย — แม้ว่าผู้เขียนเกณฑ์มาตรฐานจะตั้งข้อสังเกตว่ามันถูกฝึกมาสำหรับงานที่ต้องใช้ดุลยพินิจ เช่น ตั๋วสนับสนุนและใบแจ้งหนี้ ไม่ใช่การนำทาง ซึ่งเป็นการระบุขอบเขตมากกว่าคำตัดสิน

จุดที่ Laya ต่างจาก von อยู่ที่สิ่งที่แต่ละโครงการอ้างเกี่ยวกับตัวเอง Convai เผยแพร่ตัวเลข zero-shot ที่ไม่น่าประทับใจ และค่า expected calibration error ที่ 0.466 บนการ์ดโมเดล ข้าง ๆ กับค่า 0.081 ที่ได้จากการรีฟิตอุณหภูมิแยกตามประเภทคำถาม README ของ von เผยแพร่ตัวเลข jabr v2 ที่น่าประทับใจและชัยชนะใน ViZDoom ทั้งสองโครงการซื่อสัตย์เกี่ยวกับสิ่งที่ทำ มีเพียงหนึ่งในนั้นที่นำด้วย benchmark ที่โมเดลทำได้แย่ นั่นเป็นข้อสังเกตเกี่ยวกับแหล่งที่มา ไม่ใช่ข้อกล่าวหา — แต่ถ้าคุณกำลังเลือกระหว่างสองโครงการนี้จากหลักฐานที่เผยแพร่ โปรดทราบว่าคุณกำลังเปรียบเทียบโครงการที่แสดงตัวเลขที่อ่อนแอของตัวเองให้คุณเห็น กับอีกโครงการหนึ่งที่คุณต้องไปหาตัวเลขที่อ่อนแอของมันจากที่อื่นเอง

การเปรียบเทียบสเปก ทีละมิติ

• แกนหลัก — Laya: ModernBERT-large 421M ภาษาอังกฤษ, mmBERT-base 322M หลายภาษา. ของ: ModernBERT-Large 395M.

• ภาษา — Laya: 100+ ผ่าน multilingual checkpoint และ router. von: อังกฤษ โดยไม่มี multilingual checkpoint เผยแพร่.

• หน้าต่างบริบท — Laya: 512 โทเค็นภาษาอังกฤษ, 1,024 โทเค็นหลายภาษา. von: ไม่ได้เผยแพร่ในข้อกำหนดเดียวกัน; เคส jabr v2 เป็นการตัดสินใจแบบมีโครงสร้างที่สั้น.

• ความหน่วง — Laya: 32.8ms p50 บน T4, 7.2ms ต่อคำถามที่ batch 10. von: อ้างว่าต่ำกว่า 15ms ถึงต่ำกว่า 25ms, ต่ำกว่า 18ms ในการรัน ViZDoom.

• ความแม่นยำที่มีการรายงาน — Laya: 0.362 แบบ zero-shot, 0.766 เมื่อ fine-tune บน split ของ benchmark เอง, 0.425 บน Banking77. von: 71.5% macro จาก 49 งานของ jabr v2, 83.4% สำหรับ choice routing และ 26.7% สำหรับ commit type ในการทดสอบอิสระ

• การสอบเทียบ — Laya: ECE 0.466 ตอนเปิดตัว, 0.081 หลังการปรับตั้งอุณหภูมิใหม่แยกตามประเภทคำถาม von: ปรับสเกลอุณหภูมิเป็น T=1.1692 ระหว่างการฝึกภายหลังด้วย RLCD โดยอ้างว่ามี ECE ใกล้เคียงอุดมคติบนการกระจายของตัวเอง

• การให้บริการ — Laya: pip install laya พร้อมพอร์ตชุมชนสำหรับ ONNX, Go และ Apple MLX ส่วน von: SDK สำหรับ Python และ TypeScript, เซิร์ฟเวอร์ HTTP ผ่าน von serve รวมถึงพรีเซ็ตที่จัดแพ็กเกจมาให้พร้อมใช้สำหรับการคัดแยกตั๋ว ความปลอดภัยอีเมล การกลั่นกรอง และการคัดแยกเหตุการณ์ด้านความปลอดภัย

• ฮาร์ดแวร์ — Laya: CPU, CUDA และ Apple MPS จาก: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS และ CPU แบบหลายเธรด

• สัญญาอนุญาต — Apache 2.0 สำหรับทั้งสอง

ส่วนที่โดดเด่นอย่างแท้จริงของฟอน

รูปแบบที่ประกอบกันได้ของ von เป็นสิ่งที่มีการพูดถึงน้อยที่สุดในรีโพซิทอรีของมัน การควบคุมด้วยความเชื่อมั่น (confidence gating) การส่งต่อเส้นทาง (route dispatch) การให้คะแนนแบบผสม (composite scoring) และการจัดเส้นทางแบบสองขั้นตอน (two-stage routing) ถูกจัดส่งมาเป็นรูปแบบที่มีชื่อเรียก ควบคู่ไปกับพรีเซ็ตต่าง ๆ — การคัดแยกตั๋ว ความปลอดภัยของอีเมล การกลั่นกรอง การคัดแยกเหตุการณ์ด้านความปลอดภัย — และสิ่งเหล่านี้ถอดรหัสสถาปัตยกรรมที่โมเดลสำหรับตัดสินใจต้องการจริงในการใช้งานจริง การเรียก choiceเพียงครั้งเดียวไม่ค่อยเป็นระบบทั้งหมด รูปแบบที่มีประโยชน์คือเราเตอร์ขั้นแรกที่ราคาถูก ซึ่งส่งต่อไปยังขั้นที่สองที่เชี่ยวชาญ พร้อมกับเกตความเชื่อมั่นที่ยกระดับกรณีที่ไม่แน่นอนให้สูงขึ้น von จัดส่งสิ่งนี้เป็นรูปแบบที่มีเอกสารกำกับไว้ แทนที่จะปล่อยให้คุณจัดการเอง

เรื่องนี้สอดคล้องพอดีกับสิ่งที่ OrcaRouter ทำในฝั่งเจเนอเรทีฟ ซึ่งควรพูดให้ชัดเจนเพราะสองครึ่งของแพตเทิร์นนี้มักถูกสร้างโดยทีมที่ต่างกัน ทั้ง von และ Laya ไม่ได้โฮสต์อยู่บน OrcaRouter — ทั้งคู่เป็นเวตที่คุณดาวน์โหลดไปรันเอง และไม่มีอะไรตรงนี้ที่ควรตีความเป็นข้ออ้างว่าเราให้บริการโมเดลเหล่านี้ สิ่งที่อยู่ในรายการของเราคืออีกครึ่งหนึ่ง นั่นคือโมเดลเจเนอเรทีฟ 200+ ตัวที่อยู่หลังคีย์เดียวซึ่งเข้ากันได้กับ OpenAI ในราคาตามรายการของผู้ให้บริการ ส่งผ่านโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ให้บริการลดราคา บิลของคุณก็สะท้อนราคานั้นในวันเดียวกันแทนที่จะรอถึงรอบต่ออายุ หาก confidence gate ของ von ตัดสินว่า 4% ของคำขอจำเป็นต้องใช้โมเดลระดับแนวหน้า routing DSL คือสิ่งที่ประกอบการตัดสินใจนั้นให้กลายเป็นการเรียกครั้งเดียวแทนที่จะเป็นสองสัญญาและสอง SDK และ automatic failover คือสิ่งที่ทำให้เส้นทางที่มีค่าใช้จ่ายสูงไม่กลายเป็นจุดล้มเหลวจุดเดียว

จะทำอย่างไรกับสองโมเดลที่ต่างก็ล้มเหลวเมื่ออยู่นอกการแจกแจงข้อมูลที่ใช้ฝึก

ข้อสรุปในทางปฏิบัติจากการประเมิน von ไม่ใช่ว่า von เป็นโมเดลที่ไม่ดี แต่เป็นว่า ความแม่นยำที่เผยแพร่ของโมเดลสำหรับการตัดสินใจเป็นเพียงคำกล่าวอ้างเกี่ยวกับการกระจายข้อมูลที่ใช้ฝึก และวิธีเดียวที่จะรู้ว่าปัญหาของคุณอยู่ในช่วงการกระจายนั้นหรือไม่ คือการทดสอบมัน ตาราง benchmark ใน README ของ von เองเปรียบเทียบตัวเองกับ GLiNER2, Qwen3.5 4B ที่ปรับละเอียดแล้ว, Laya และ Jev ของ TypeSafe ในด้านขนาด ความแม่นยำ ความหน่วง และการโฮสติ้ง — ซึ่งเป็นตารางที่มีประโยชน์ และยังเป็นตารางที่รายการความแม่นยำทุกตัวยกเว้นรายการเดียวมาจากชุดทดสอบของผู้เขียนเอง

ระหว่างสองตัวเลือก: เลือก von หากคุณต้องการชุดโดเมนที่เผยแพร่กว้างกว่า ฟุตพรินต์ที่เล็กกว่าเล็กน้อย รูปแบบการเสิร์ฟที่สร้างไว้ล่วงหน้าสำหรับการคัดกรองและการกลั่นกรอง และหลักฐานจาก ViZDoom ว่ามันจัดการการตัดสินใจจากข้อความแบบมีโครงสร้างที่รวดเร็วได้ดี เลือก Laya หากคุณต้องการอินพุตหลายภาษา — von ไม่มีเช็กพอยต์หลายภาษา และตัวแปร mmBERT ขนาด 322M ของ Laya ครอบคลุมมากกว่า 100 ภาษา — หรือหากตัวเลข 32.8ms บน T4 และหน้าต่างภาษาอังกฤษขนาด 512 โทเคนเข้ากับเวิร์กโหลดของคุณ ไม่ควรเลือกตัวใดเลยโดยไม่ใช้เวลาหนึ่งบ่ายในการติดป้ายกำกับตัวอย่างไม่กี่ร้อยรายการจากทราฟฟิกของคุณเองและรันทั้งสองตัวเทียบกับตัวอย่างเหล่านั้น เอกสารของทั้งสองโปรเจกต์เองก็ชี้ให้คุณไปที่การทดลองนั้น และผลลัพธ์จากบุคคลที่สามของ von คือสิ่งที่เกิดขึ้นเมื่อไม่มีใครรันมัน

สิ่งเดียวที่จะเปลี่ยนการเปรียบเทียบนี้คือการประเมินแบบจับคู่บนอินพุตที่เหมือนกัน พร้อมแผนภาพความน่าเชื่อถือสำหรับแต่ละโมเดล สิ่งนี้ยังไม่มีอยู่ จนกว่าจะมี การจัดอันดับอย่างซื่อสัตย์ก็คือจัดตามคุณภาพของหลักฐานมากกว่าตามคะแนน: Laya เผยแพร่ตัวเลขที่แย่ที่สุดของตนออกมาแล้ว von เผยแพร่ตัวเลขที่ดีที่สุดของตนออกมา และการทดสอบอิสระของ von ก็เป็นสิ่งที่ใกล้เคียงที่สุดที่ทั้งสองฝ่ายมีต่อการตรวจสอบจากภายนอก

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube