การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับการเปรียบเทียบ Laya กับ Nimble ซึ่งมีคำบรรยายรองของบทความนี้เอง และบรรทัดส่วนท้ายที่ระบุว่าตัวเลขของฝ่ายใดมาจากผู้ขาย และฝ่ายใดมาจากบุคคลที่สาม
Engineering & Research

Laya vs Nimble: ข้อมูลแบบคอนทราสต์เทียบกับเอนโคเดอร์ที่เร็วกว่า

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Laya และ Nimble เป็นโมเดลตัดสินใจแบบโอเพนเวตสองตัวที่ผู้พัฒนาอธิบายวิธีสร้างได้มากที่สุด และคำอธิบายของพวกเขาก็ไม่ตรงกันว่าความยากอยู่ตรงไหน Convai Innovations เปิดตัว Laya เมื่อวันที่ 18 กันยายน 2026 ภายใต้ Apache 2.0 — เช็กพอยต์ภาษาอังกฤษ ModernBERT-large ขนาด 421M, เช็กพอยต์หลายภาษาของ mmBERT-base ขนาด 322M ที่ครอบคลุมกว่า 100 ภาษา, เราเตอร์ระหว่างทั้งสองที่มีเวลาใต้หนึ่งมิลลิวินาที และค่า p50 32.8ms ต่อการตัดสินใจบน Tesla T4 ที่เผยแพร่ไว้ Bespoke Labs สร้าง Nimble เป็นการฟাইনทูนแบบ LoRA บน Qwen3.5-9B ภายใต้ Apache 2.0 และอธิบายว่าเป็น “Jev เวอร์ชันโอเพนซอร์ส” — ได้แรงบันดาลใจจาก Jev ของ TypeSafe AI แต่ไม่ได้ใช้ทั้งน้ำหนัก สถาปัตยกรรม หรือการกลั่นเอาต์พุตของมัน คำตอบของ Convai ต่อปัญหาความแม่นยำคือความเร็วและฐานที่ฟাইনทูนได้ คำตอบของ Bespoke คือข้อมูลการฝึก ความแตกต่างนั้นควรค่าแก่ความสนใจมากกว่าช่องว่างความแม่นยำ 3 จุดที่ปรากฏในตารางผลลัพธ์หลัก

ข้ออ้างที่แต่ละโครงการกำลังเสนอจริงๆ

ข้อกล่าวอ้างของ Laya เป็นเรื่องเชิงสถาปัตยกรรม มันเป็นแบบ non-autoregressive ในความหมายเคร่งครัด — เป็น encoder แบบสองทิศทาง ไม่มีลูปถอดรหัส ไม่มี JSON ให้แยกวิเคราะห์ ไม่มีช่องว่างให้เปล่งข้อความนอกชนิดที่ประกาศไว้ การรับประกันเชิงโครงสร้างนั้นเป็นแบบเดียวกับที่ Jev เสนอ โดยมาถึงจากทิศทางที่ต่างออกไป และมันมีค่าอย่างแท้จริงสำหรับใครก็ตามที่เคยเขียนลอจิก retry ครอบโมเดลที่บางครั้งลืมปิดวงเล็บปีกกา ต้นทุนก็คือ encoder ขนาด 421M ที่มีหน้าต่าง 512 โทเคน และไม่มี generative pretraining อยู่เบื้องหลังนั้นไม่ได้รู้อะไรมากนัก Convai บอกไว้เช่นนั้นบนการ์ดโมเดลว่า "Laya เป็นฐานที่เร็วสำหรับนำไปปรับให้เชี่ยวชาญเฉพาะทาง ไม่ใช่เครื่องยนต์ตัดสินใจแบบ zero-shot"

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Nimble repository on GitHub, showing the description "Local typed decisions, contrastive data curation, and model evaluation", the README heading "Bespoke Nimble - Data, Model, Recipe for an open Jev", the contrastive example where changing one fact flips the correct answer, and the 2,676-example training split against the frozen 324 held-out set.

Nimble กล่าวอ้างเกี่ยวกับข้อมูล วิธีการของ Bespoke คือการคัดสรรแบบเปรียบเทียบ ซึ่งดัดแปลงมาจากงาน Bespoke-MiniCheck ก่อนหน้าของทีม: เขียนตัวอย่างที่เกือบเหมือนกันสองตัวอย่างซึ่งแตกต่างกันใน "ข้อเท็จจริงโฟกัส" หนึ่งอย่าง โดยที่ป้ายกำกับที่ถูกต้องพลิกไปมา ขั้นตอนการทำงานมีสี่ขั้นตอนที่ระบุไว้ — ตรวจสอบว่ากฎการตัดสินใจสามารถนำไปสู่คำตอบที่แตกต่างกันได้จริงหรือไม่ สร้างคู่โดยการเปลี่ยนคำไม่เกินแปดคำ ตรวจสอบทั้งสองตัวอย่างด้วยการเรียกโมเดลแยกกันบวกกับการตรวจสอบแบบลบแต่ละประโยค และสร้างป้ายกำกับในโค้ดโดยเก็บเฉพาะคู่ที่มีป้ายกำกับแตกต่างกันจริง เป้าหมายไม่ใช่ตัวอย่างที่มากขึ้นแต่เป็นตัวอย่างที่คมชัดขึ้น: บังคับให้โมเดลเรียนรู้ว่าหลักฐานใดควรเปลี่ยนการตัดสินใจ นั่นเป็นทฤษฎีที่แตกต่างว่าเหตุใดโมเดลการตัดสินใจขนาดเล็กจึงล้มเหลว และเป็นทฤษฎีที่น่าสนใจกว่าคะแนนความแม่นยำอีกจุดหนึ่ง

สิ่งที่ตัวเลขที่เผยแพร่นั้นสนับสนุนจริง ๆ

Nimble รายงานความสอดคล้อง 90.12% กับป้ายอ้างอิงบนตัวอย่างที่กันไว้จำนวน 324 ตัวอย่าง เทียบกับ 93.21% สำหรับ Jev, 66.36% สำหรับโมเดลฐาน Qwen3.5-9B ที่ไม่ได้ปรับแต่ง และ 84.88% สำหรับ Qwen3.8 ขนาด 27B ที่ไม่ได้ปรับแต่ง โดยรายงานค่ามัธยฐานราว 106ms บน H100 และค่ามัธยฐาน 444ms บน M5 Pro ที่มีหน่วยความจำ 64GB นั่นเป็นตัวเลขจากฮาร์เนสของ Bespoke เอง ชุดประเมินขนาด 324 ตัวอย่างเป็นส่วนที่ต้องชั่งน้ำหนักอย่างระมัดระวัง และตัวโครงการเองก็บอกเหตุผลว่าทำไม: ตัวอย่างเหล่านี้ครอบคลุม 6 จาก 10 ตระกูลแหล่งข้อมูลการฝึก ตัวอย่างเหล่านี้ถูกสร้างและตรวจสอบโดยโมเดลโดยไม่มีการตรวจทานจากมนุษย์ ดังนั้นการนำไปใช้กับหมวดหมู่ที่ไม่เคยเห็นจึงยังไม่ได้รับการพิสูจน์ เมื่อโมเดลถูกฝึกด้วยวิธีการคัดสรรข้อมูล แล้วประเมินบนส่วนแบ่งที่กันไว้ของการกระจายข้อมูลที่คัดสรรชุดเดียวกัน ตัวเลขความแม่นยำเป็นคำกล่าวเกี่ยวกับความสอดคล้องภายในของวิธีการนั้น ไม่ใช่เกี่ยวกับทราฟฟิกของคุณ

ตัวเลขของ Laya มาจากอีกด้านหนึ่ง บนเบนช์มาร์ก typed-decisions ของ TypeSafe มันได้คะแนน 0.362 แบบ zero-shot — การสุ่มได้ 0.318, ค่าพื้นฐานของคลาสส่วนใหญ่คือ 0.461 — และ 0.766 เมื่อ fine-tuned บนชุดฝึกของเบนช์มาร์กเอง บน Banking77 ซึ่งมี 77 ป้ายกำกับ มันได้คะแนน 0.425 เทียบกับ 0.870 ของ Jev ซึ่งเป็นตัวอย่างที่ชัดที่สุดของเพดานหลายตัวเลือกของมัน บน AG News ที่มีสี่ป้ายกำกับ มันได้ 0.950 เทียบกับ 0.910 ของ Jev; บน DAIR Emotion ที่มีหกป้ายกำกับ ได้ 0.595 เทียบกับ 0.480 ค่าความคลาดเคลื่อนการสอบเทียบ (calibration error) ของมันเริ่มต้นที่ 0.466 และลดลงเป็น 0.081 หลังจากการปรับอุณหภูมิ (temperature refitting) แยกตามประเภทคำถาม การทดสอบโดยบุคคลที่สามหนึ่งครั้งกับข้อความเร่งด่วน Mars-base 100 ข้อความ พบว่า Jev ได้ 100/100 และ Laya ได้ 53/100 และในการประเมิน agent-tool-call แบบอิสระ Laya ทำได้ 100% refusal recall กับการเรียกที่อันตราย แต่ทำได้เพียงโดยการทำเครื่องหมายทุกอย่าง ซึ่งเป็นความล้มเหลวด้าน precision ที่ถูกแต่งตัวให้ดูเหมือนชัยชนะด้านความปลอดภัย

เมื่อวางชุดตัวเลขสองชุดไว้ข้างกัน การตีความอย่างซื่อตรงก็คือตัวเลขเหล่านั้นวัดสิ่งที่แตกต่างกัน 90.12% ของ Nimble คือความสอดคล้องกับป้ายอ้างอิงที่ Nimble คัดสรรเอง ส่วน 0.362 ของ Laya คือเกณฑ์มาตรฐานที่ Laya ไม่ได้สร้างขึ้นเอง ไม่มีตัวเลขใดใช้เปรียบเทียบข้ามบริบทได้

การปรับเทียบ: จุดเดียวที่ทั้งสองโปรเจกต์ตรงไปตรงมาอย่างผิดปกติ

นี่คือจุดที่ทั้งสองโครงการใกล้เคียงกันมากที่สุดในเชิงจิตวิญญาณ และแตกต่างกันมากที่สุดในเชิงผลลัพธ์

README ของ Bespoke เตือนไว้อย่างชัดเจนว่าความน่าจะเป็นของ Nimble นั้นเป็น logits ที่ผ่านการทำ softmax-normalize เหนือตัวเลือกที่ให้มา ไม่ใช่อัตราความถูกต้องที่ผ่านการคาลิเบรต — ค่า 0.9 ไม่ได้หมายความว่าถูกต้อง 90% โดยแนะนำให้เพิ่มตัวเลือก "none of the above" เพราะหากคำตอบที่ถูกต้องไม่อยู่ในตัวเลือกใด ๆ ตัวเลือกหนึ่งก็ยังชนะอยู่ดี ในการประเมินใหม่ที่มี 3,880 ระเบียน ครอบคลุม 13 ชุดย่อย Jev มีความคลาดเคลื่อนของการคาลิเบรตที่รายงานต่ำกว่าใน 11 จาก 13 ชุดย่อย และมีคะแนน Brier ต่ำกว่าใน 10 จาก 13 ดังนั้นความสอดคล้องของป้ายกำกับที่ใกล้เคียงกันไม่ได้หมายความถึงคุณภาพของความน่าจะเป็นที่ใกล้เคียงกัน และ Bespoke ก็บอกเช่นนั้น

การเปิดเผยของ Convai เป็นภาพสะท้อนกลับด้าน: ค่าความคลาดเคลื่อนการสอบเทียบที่คาดหวัง 0.466 อยู่บนการ์ด ถัดจาก 0.081 ที่การปรับอุณหภูมิใหม่ตามประเภทคำถามให้ผลออกมา ไม่มีโครงการใดส่งมอบโมเดลที่คุณสามารถนำค่าความเชื่อมั่นไปใช้ได้โดยไม่ต้องทำงานเพิ่ม ทั้งคู่บอกคุณเรื่องนี้เป็นลายลักษณ์อักษร หากคุณกำลังสร้างเกณฑ์ความเชื่อมั่น — ปล่อยอัตโนมัติเมื่อสูงกว่า 0.95 ส่งต่อเมื่อต่ำกว่า 0.7 — เอกสารจากผู้เขียนทั้งสองกำลังบอกคุณสิ่งเดียวกัน: จงตั้งเกณฑ์จากข้อมูลที่มีป้ายกำกับของคุณเองก่อน

การเปรียบเทียบ ทีละมิติ

• แกนหลัก — Laya: ModernBERT-large เอนโคเดอร์ 421M, แบบสองทิศทาง, ไม่มีการฝึกก่อนแบบสร้างสรรค์ Nimble: Qwen3.5-9B พร้อมการปรับละเอียด LoRA, ยังคงฐานแบบสร้างสรรค์ไว้

• ภาษา — Laya: 100+ ภาษาผ่านเช็คพอยต์แบบหลายภาษาขนาด 322M Nimble: ภาษาอังกฤษ

• งบประมาณพรอมต์ — Laya: 512 โทเคนภาษาอังกฤษ, 1,024 สำหรับหลายภาษา Nimble: สูงสุด 2,048 โทเคนต่อพรอมต์, ใช้เฉพาะสคีมาแบบแบน, enum จำกัดไม่เกิน 26 ตัวเลือกต่อฟิลด์

• ความเร็ว — Laya: 32.8ms p50 บน T4, 7.2ms ต่อคำถามเมื่อแบตช์ที่ 10 Nimble: ประมาณ 106ms ค่ามัธยฐานบน H100, 444ms บน M5 Pro 64GB

• ฮาร์ดแวร์ — Laya: CPU, CUDA และ Apple MPS; ใช้หน่วยความจำค้างในเครื่องต่ำกว่าหนึ่งกิกะไบต์บนพอร์ต MLX. Nimble: BF16 CUDA GPU สำหรับตัวเลขที่ระบุ โดยรองรับเส้นทาง MLX และ CUDA

• ความแม่นยำที่รายงาน — Laya: 0.362 ในแบบ zero-shot, 0.766 ในแบบ fine-tuned, 0.425 บน Banking77. Nimble: 90.12% จากตัวอย่าง held-out ที่คัดสรร 324 ตัวอย่าง เทียบกับ 93.21% ของ Jev

• วิธีการ — Laya: เน้นสถาปัตยกรรมก่อน แล้วปรับละเอียดต่อการติดตั้งใช้งานแต่ละครั้ง Nimble: การคัดสรรข้อมูลแบบคอนทราสต์ เผยแพร่เป็นสูตร

• สัญญาอนุญาต — Apache 2.0 สำหรับทั้งสอง

ข้อจำกัดสองข้อในรายการนั้นสมควรอ่านซ้ำอีกครั้งก่อนที่คุณจะตัดสินใจใช้ Nimble: ขีดจำกัด 26 ตัวเลือกต่อ enum และเพดานพรอมป์ต์ 2,048 โทเคนของ Nimble เป็นขีดจำกัดสคีมาแบบตายตัว ไม่ใช่ประสิทธิภาพที่ลดลง — หากอนุกรมวิธานของคุณมีป้ายกำกับสี่สิบป้าย หรือพรอมป์ต์ของคุณมีเอกสารยาว Nimble ก็เป็นเครื่องมือที่ไม่เหมาะสม ไม่ว่าความแม่นยำจะดีเพียงใด และ Nimble ให้คะแนนแต่ละฟิลด์อย่างอิสระ ดังนั้นกฎความสอดคล้องระหว่างฟิลด์ใด ๆ — "ถ้า A เป็นจริง แล้ว B ต้องเป็นเท็จ" — ต้องอยู่ในโค้ดของคุณ ไม่ใช่ในโมเดล

ทำไมสูตรข้อมูลจึงเป็นอาร์ติแฟกต์ที่พกพาได้ง่ายกว่า

นี่คือข้อโต้แย้งเพื่อสนับสนุน Nimble ที่ตารางความแม่นยำมองข้ามไป Bespoke ได้เผยแพร่ไปป์ไลน์การคัดสรรข้อมูล ไม่ใช่แค่ค่าน้ำหนักเท่านั้น หากปัญหาการตัดสินใจของคุณมีอนุกรมวิธานแบบตายตัว และคุณสามารถเขียนกฎออกมาได้ วิธีการแบบคอนทราสต์เป็นสิ่งที่คุณรันบนข้อมูลของคุณเองด้วยข้อเท็จจริงโฟกัสของคุณเองได้ บนโมเดลฐานใดก็ตามที่คุณต้องการ LoRA ขนาด 9B ถือเป็นการสาธิตวิธีการพอ ๆ กับเป็นผลิตภัณฑ์

ความสามารถในการพกพาของ Laya นั้นแตกต่างและเสริมกัน เพราะมันมีขนาดเล็ก เพราะมันทำงานบน CPU และเพราะมีการพอร์ต ONNX และ MLX ทำให้ Laya เป็นโมเดลที่คุณสามารถใส่ไว้ในโปรเซสที่ไม่มี GPU และไม่มีเครือข่ายได้ ในเบนช์มาร์ก browser-agent ของบุคคลที่สาม Laya ทำสำเร็จ 0 จาก 50 งาน และประกาศว่าเสร็จสิ้นก่อนกำหนดในการลอง 33 ครั้ง — แต่ผู้เขียนเบนช์มาร์กระบุว่ามันถูกฝึกมาสำหรับงานที่ต้องใช้วิจารณญาณ เช่น ตั๋วสนับสนุน ใบแจ้งหนี้ และการตรวจสอบร่องรอยของเอเจนต์ ไม่ใช่การนำทาง ให้อ่านผลลัพธ์นั้นเป็นคำแถลงขอบเขตมากกว่าคำตัดสิน และมันสอดคล้องกับการวางกรอบของทั้งสองโครงการ: สิ่งเหล่านี้เป็นองค์ประกอบสำหรับการตัดสินใจประเภทเฉพาะ ไม่ใช่เอเจนต์ทั่วไป

ทั้ง Laya และ Nimble ไม่ใช่โมเดลที่โฮสต์อยู่บน OrcaRouter ทั้งสองเป็นเวทที่คุณรันเอง และไม่มีอะไรในบทความนี้ที่ควรอ่านเป็นการอ้างว่าเราให้บริการทั้งสอง เหตุผลที่ผลิตภัณฑ์ routing ถูกหยิบยกขึ้นมาเลย ก็เป็นเหตุผลเดียวกับที่มันถูกหยิบยกขึ้นมาในสถาปัตยกรรมของโมเดลตัดสินใจใด ๆ: โมเดลตัดสินใจตอบคำเรียกหนึ่งครั้ง และแอปพลิเคชันที่อยู่รอบ ๆ ก็ยังต้องการข้อความบรรยาย ไปป์ไลน์ที่ใช้ Nimble ในการให้คะแนนว่าฉบับร่างเป็นไปตามข้อกำหนดหรือไม่ และใช้ Laya ในการจัดเส้นทางข้อยกเว้น ก็ยังต้องใช้โมเดล generative ในการเขียนฉบับร่างนั้น การเก็บครึ่ง generative นั้นไว้บน endpoint เดียวที่เข้ากันได้กับ OpenAI — โมเดล 200+ ตัว, ราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยมี markup 0% ดังนั้นการลดราคาของผู้ขายจึงมีผลในวันเดียวกัน, การ failover อัตโนมัติข้ามผู้ให้บริการ — หมายความว่าชั้นการตัดสินใจสามารถสลับได้โดยไม่ต้องแตะสัญญาของชั้น generative

คำตัดสิน และการทดลองที่จะเปลี่ยนคำตัดสินนั้น

เลือก Nimble หากอนุกรมวิธานของคุณคงที่และแคบ อินพุตของคุณเป็นภาษาอังกฤษและสั้น คุณมี GPU และคุณต้องการสูตรข้อมูลพอ ๆ กับตัวโมเดล เลือก Laya หากคุณต้องการอินพุตหลายภาษา งบเวลาต่ำกว่า 40 มิลลิวินาที หรือกระบวนการที่ไม่มี GPU เลย — และคิดต้นทุนการปรับละเอียด (fine-tuning) รวมไว้ตั้งแต่แรก เพราะเช็กพอยต์แบบ zero-shot ต่ำกว่า baseline พื้นฐาน และการ์ดโมเดลก็ระบุไว้เช่นนั้น

การทดลองที่จะชี้ขาดเรื่องนี้คือการประเมินแบบจับคู่บนทราฟฟิกจริง: อินพุตเดียวกัน ชุดตัวเลือกเดียวกัน เกณฑ์ความเชื่อมั่นเดียวกัน ประเมินเทียบกับป้ายกำกับโดยมนุษย์ พร้อมแผนภาพความน่าเชื่อถือสำหรับแต่ละโมเดล เอกสารของ Nimble เองเตือนว่าค่าความน่าจะเป็นของมันไม่ใช่อัตราความถูกต้อง และการ์ดของ Laya รายงานความคลาดเคลื่อนของการปรับเทียบที่ 0.466 ก่อนการรีฟิต ดังนั้นแผนภาพนั้นคือชิ้นงานที่จะบอกคุณได้จริง ๆ ว่าควรนำโมเดลใดไปไว้หน้าโปรดักชัน ไม่มีโครงการใดเผยแพร่แผนภาพดังกล่าว และไม่มีโครงการใดเผยแพร่ของอีกฝ่าย สร้างมันบนข้อมูลของคุณเองก่อนที่คุณจะกำหนดเกณฑ์

A generated two-column scoreboard comparing Laya and Nimble across backbone, languages, prompt budget, label agreement, latency and licence, with a footer reading "Nimble's 90.12% is agreement with its own curated labels; Laya figures per its model card."
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube