
Laya vs Nimble: ข้อมูลแบบคอนทราสต์เทียบกับเอนโคเดอร์ที่เร็วกว่า
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
Laya และ Nimble เป็นโมเดลตัดสินใจแบบโอเพนเวตสองตัวที่ผู้พัฒนาอธิบายวิธีสร้างได้มากที่สุด และคำอธิบายของพวกเขาก็ไม่ตรงกันว่าความยากอยู่ตรงไหน Convai Innovations เปิดตัว Laya เมื่อวันที่ 18 กันยายน 2026 ภายใต้ Apache 2.0 — เช็กพอยต์ภาษาอังกฤษ ModernBERT-large ขนาด 421M, เช็กพอยต์หลายภาษาของ mmBERT-base ขนาด 322M ที่ครอบคลุมกว่า 100 ภาษา, เราเตอร์ระหว่างทั้งสองที่มีเวลาใต้หนึ่งมิลลิวินาที และค่า p50 32.8ms ต่อการตัดสินใจบน Tesla T4 ที่เผยแพร่ไว้ Bespoke Labs สร้าง Nimble เป็นการฟাইনทูนแบบ LoRA บน Qwen3.5-9B ภายใต้ Apache 2.0 และอธิบายว่าเป็น “Jev เวอร์ชันโอเพนซอร์ส” — ได้แรงบันดาลใจจาก Jev ของ TypeSafe AI แต่ไม่ได้ใช้ทั้งน้ำหนัก สถาปัตยกรรม หรือการกลั่นเอาต์พุตของมัน คำตอบของ Convai ต่อปัญหาความแม่นยำคือความเร็วและฐานที่ฟাইনทูนได้ คำตอบของ Bespoke คือข้อมูลการฝึก ความแตกต่างนั้นควรค่าแก่ความสนใจมากกว่าช่องว่างความแม่นยำ 3 จุดที่ปรากฏในตารางผลลัพธ์หลัก
ข้ออ้างที่แต่ละโครงการกำลังเสนอจริงๆ
ข้อกล่าวอ้างของ Laya เป็นเรื่องเชิงสถาปัตยกรรม มันเป็นแบบ non-autoregressive ในความหมายเคร่งครัด — เป็น encoder แบบสองทิศทาง ไม่มีลูปถอดรหัส ไม่มี JSON ให้แยกวิเคราะห์ ไม่มีช่องว่างให้เปล่งข้อความนอกชนิดที่ประกาศไว้ การรับประกันเชิงโครงสร้างนั้นเป็นแบบเดียวกับที่ Jev เสนอ โดยมาถึงจากทิศทางที่ต่างออกไป และมันมีค่าอย่างแท้จริงสำหรับใครก็ตามที่เคยเขียนลอจิก retry ครอบโมเดลที่บางครั้งลืมปิดวงเล็บปีกกา ต้นทุนก็คือ encoder ขนาด 421M ที่มีหน้าต่าง 512 โทเคน และไม่มี generative pretraining อยู่เบื้องหลังนั้นไม่ได้รู้อะไรมากนัก Convai บอกไว้เช่นนั้นบนการ์ดโมเดลว่า "Laya เป็นฐานที่เร็วสำหรับนำไปปรับให้เชี่ยวชาญเฉพาะทาง ไม่ใช่เครื่องยนต์ตัดสินใจแบบ zero-shot"


Nimble กล่าวอ้างเกี่ยวกับข้อมูล วิธีการของ Bespoke คือการคัดสรรแบบเปรียบเทียบ ซึ่งดัดแปลงมาจากงาน Bespoke-MiniCheck ก่อนหน้าของทีม: เขียนตัวอย่างที่เกือบเหมือนกันสองตัวอย่างซึ่งแตกต่างกันใน "ข้อเท็จจริงโฟกัส" หนึ่งอย่าง โดยที่ป้ายกำกับที่ถูกต้องพลิกไปมา ขั้นตอนการทำงานมีสี่ขั้นตอนที่ระบุไว้ — ตรวจสอบว่ากฎการตัดสินใจสามารถนำไปสู่คำตอบที่แตกต่างกันได้จริงหรือไม่ สร้างคู่โดยการเปลี่ยนคำไม่เกินแปดคำ ตรวจสอบทั้งสองตัวอย่างด้วยการเรียกโมเดลแยกกันบวกกับการตรวจสอบแบบลบแต่ละประโยค และสร้างป้ายกำกับในโค้ดโดยเก็บเฉพาะคู่ที่มีป้ายกำกับแตกต่างกันจริง เป้าหมายไม่ใช่ตัวอย่างที่มากขึ้นแต่เป็นตัวอย่างที่คมชัดขึ้น: บังคับให้โมเดลเรียนรู้ว่าหลักฐานใดควรเปลี่ยนการตัดสินใจ นั่นเป็นทฤษฎีที่แตกต่างว่าเหตุใดโมเดลการตัดสินใจขนาดเล็กจึงล้มเหลว และเป็นทฤษฎีที่น่าสนใจกว่าคะแนนความแม่นยำอีกจุดหนึ่ง
สิ่งที่ตัวเลขที่เผยแพร่นั้นสนับสนุนจริง ๆ
Nimble รายงานความสอดคล้อง 90.12% กับป้ายอ้างอิงบนตัวอย่างที่กันไว้จำนวน 324 ตัวอย่าง เทียบกับ 93.21% สำหรับ Jev, 66.36% สำหรับโมเดลฐาน Qwen3.5-9B ที่ไม่ได้ปรับแต่ง และ 84.88% สำหรับ Qwen3.8 ขนาด 27B ที่ไม่ได้ปรับแต่ง โดยรายงานค่ามัธยฐานราว 106ms บน H100 และค่ามัธยฐาน 444ms บน M5 Pro ที่มีหน่วยความจำ 64GB นั่นเป็นตัวเลขจากฮาร์เนสของ Bespoke เอง ชุดประเมินขนาด 324 ตัวอย่างเป็นส่วนที่ต้องชั่งน้ำหนักอย่างระมัดระวัง และตัวโครงการเองก็บอกเหตุผลว่าทำไม: ตัวอย่างเหล่านี้ครอบคลุม 6 จาก 10 ตระกูลแหล่งข้อมูลการฝึก ตัวอย่างเหล่านี้ถูกสร้างและตรวจสอบโดยโมเดลโดยไม่มีการตรวจทานจากมนุษย์ ดังนั้นการนำไปใช้กับหมวดหมู่ที่ไม่เคยเห็นจึงยังไม่ได้รับการพิสูจน์ เมื่อโมเดลถูกฝึกด้วยวิธีการคัดสรรข้อมูล แล้วประเมินบนส่วนแบ่งที่กันไว้ของการกระจายข้อมูลที่คัดสรรชุดเดียวกัน ตัวเลขความแม่นยำเป็นคำกล่าวเกี่ยวกับความสอดคล้องภายในของวิธีการนั้น ไม่ใช่เกี่ยวกับทราฟฟิกของคุณ
ตัวเลขของ Laya มาจากอีกด้านหนึ่ง บนเบนช์มาร์ก typed-decisions ของ TypeSafe มันได้คะแนน 0.362 แบบ zero-shot — การสุ่มได้ 0.318, ค่าพื้นฐานของคลาสส่วนใหญ่คือ 0.461 — และ 0.766 เมื่อ fine-tuned บนชุดฝึกของเบนช์มาร์กเอง บน Banking77 ซึ่งมี 77 ป้ายกำกับ มันได้คะแนน 0.425 เทียบกับ 0.870 ของ Jev ซึ่งเป็นตัวอย่างที่ชัดที่สุดของเพดานหลายตัวเลือกของมัน บน AG News ที่มีสี่ป้ายกำกับ มันได้ 0.950 เทียบกับ 0.910 ของ Jev; บน DAIR Emotion ที่มีหกป้ายกำกับ ได้ 0.595 เทียบกับ 0.480 ค่าความคลาดเคลื่อนการสอบเทียบ (calibration error) ของมันเริ่มต้นที่ 0.466 และลดลงเป็น 0.081 หลังจากการปรับอุณหภูมิ (temperature refitting) แยกตามประเภทคำถาม การทดสอบโดยบุคคลที่สามหนึ่งครั้งกับข้อความเร่งด่วน Mars-base 100 ข้อความ พบว่า Jev ได้ 100/100 และ Laya ได้ 53/100 และในการประเมิน agent-tool-call แบบอิสระ Laya ทำได้ 100% refusal recall กับการเรียกที่อันตราย แต่ทำได้เพียงโดยการทำเครื่องหมายทุกอย่าง ซึ่งเป็นความล้มเหลวด้าน precision ที่ถูกแต่งตัวให้ดูเหมือนชัยชนะด้านความปลอดภัย
เมื่อวางชุดตัวเลขสองชุดไว้ข้างกัน การตีความอย่างซื่อตรงก็คือตัวเลขเหล่านั้นวัดสิ่งที่แตกต่างกัน 90.12% ของ Nimble คือความสอดคล้องกับป้ายอ้างอิงที่ Nimble คัดสรรเอง ส่วน 0.362 ของ Laya คือเกณฑ์มาตรฐานที่ Laya ไม่ได้สร้างขึ้นเอง ไม่มีตัวเลขใดใช้เปรียบเทียบข้ามบริบทได้
การปรับเทียบ: จุดเดียวที่ทั้งสองโปรเจกต์ตรงไปตรงมาอย่างผิดปกติ
นี่คือจุดที่ทั้งสองโครงการใกล้เคียงกันมากที่สุดในเชิงจิตวิญญาณ และแตกต่างกันมากที่สุดในเชิงผลลัพธ์
README ของ Bespoke เตือนไว้อย่างชัดเจนว่าความน่าจะเป็นของ Nimble นั้นเป็น logits ที่ผ่านการทำ softmax-normalize เหนือตัวเลือกที่ให้มา ไม่ใช่อัตราความถูกต้องที่ผ่านการคาลิเบรต — ค่า 0.9 ไม่ได้หมายความว่าถูกต้อง 90% โดยแนะนำให้เพิ่มตัวเลือก "none of the above" เพราะหากคำตอบที่ถูกต้องไม่อยู่ในตัวเลือกใด ๆ ตัวเลือกหนึ่งก็ยังชนะอยู่ดี ในการประเมินใหม่ที่มี 3,880 ระเบียน ครอบคลุม 13 ชุดย่อย Jev มีความคลาดเคลื่อนของการคาลิเบรตที่รายงานต่ำกว่าใน 11 จาก 13 ชุดย่อย และมีคะแนน Brier ต่ำกว่าใน 10 จาก 13 ดังนั้นความสอดคล้องของป้ายกำกับที่ใกล้เคียงกันไม่ได้หมายความถึงคุณภาพของความน่าจะเป็นที่ใกล้เคียงกัน และ Bespoke ก็บอกเช่นนั้น
การเปิดเผยของ Convai เป็นภาพสะท้อนกลับด้าน: ค่าความคลาดเคลื่อนการสอบเทียบที่คาดหวัง 0.466 อยู่บนการ์ด ถัดจาก 0.081 ที่การปรับอุณหภูมิใหม่ตามประเภทคำถามให้ผลออกมา ไม่มีโครงการใดส่งมอบโมเดลที่คุณสามารถนำค่าความเชื่อมั่นไปใช้ได้โดยไม่ต้องทำงานเพิ่ม ทั้งคู่บอกคุณเรื่องนี้เป็นลายลักษณ์อักษร หากคุณกำลังสร้างเกณฑ์ความเชื่อมั่น — ปล่อยอัตโนมัติเมื่อสูงกว่า 0.95 ส่งต่อเมื่อต่ำกว่า 0.7 — เอกสารจากผู้เขียนทั้งสองกำลังบอกคุณสิ่งเดียวกัน: จงตั้งเกณฑ์จากข้อมูลที่มีป้ายกำกับของคุณเองก่อน
การเปรียบเทียบ ทีละมิติ
• แกนหลัก — Laya: ModernBERT-large เอนโคเดอร์ 421M, แบบสองทิศทาง, ไม่มีการฝึกก่อนแบบสร้างสรรค์ Nimble: Qwen3.5-9B พร้อมการปรับละเอียด LoRA, ยังคงฐานแบบสร้างสรรค์ไว้
• ภาษา — Laya: 100+ ภาษาผ่านเช็คพอยต์แบบหลายภาษาขนาด 322M Nimble: ภาษาอังกฤษ
• งบประมาณพรอมต์ — Laya: 512 โทเคนภาษาอังกฤษ, 1,024 สำหรับหลายภาษา Nimble: สูงสุด 2,048 โทเคนต่อพรอมต์, ใช้เฉพาะสคีมาแบบแบน, enum จำกัดไม่เกิน 26 ตัวเลือกต่อฟิลด์
• ความเร็ว — Laya: 32.8ms p50 บน T4, 7.2ms ต่อคำถามเมื่อแบตช์ที่ 10 Nimble: ประมาณ 106ms ค่ามัธยฐานบน H100, 444ms บน M5 Pro 64GB
• ฮาร์ดแวร์ — Laya: CPU, CUDA และ Apple MPS; ใช้หน่วยความจำค้างในเครื่องต่ำกว่าหนึ่งกิกะไบต์บนพอร์ต MLX. Nimble: BF16 CUDA GPU สำหรับตัวเลขที่ระบุ โดยรองรับเส้นทาง MLX และ CUDA
• ความแม่นยำที่รายงาน — Laya: 0.362 ในแบบ zero-shot, 0.766 ในแบบ fine-tuned, 0.425 บน Banking77. Nimble: 90.12% จากตัวอย่าง held-out ที่คัดสรร 324 ตัวอย่าง เทียบกับ 93.21% ของ Jev
• วิธีการ — Laya: เน้นสถาปัตยกรรมก่อน แล้วปรับละเอียดต่อการติดตั้งใช้งานแต่ละครั้ง Nimble: การคัดสรรข้อมูลแบบคอนทราสต์ เผยแพร่เป็นสูตร
• สัญญาอนุญาต — Apache 2.0 สำหรับทั้งสอง
ข้อจำกัดสองข้อในรายการนั้นสมควรอ่านซ้ำอีกครั้งก่อนที่คุณจะตัดสินใจใช้ Nimble: ขีดจำกัด 26 ตัวเลือกต่อ enum และเพดานพรอมป์ต์ 2,048 โทเคนของ Nimble เป็นขีดจำกัดสคีมาแบบตายตัว ไม่ใช่ประสิทธิภาพที่ลดลง — หากอนุกรมวิธานของคุณมีป้ายกำกับสี่สิบป้าย หรือพรอมป์ต์ของคุณมีเอกสารยาว Nimble ก็เป็นเครื่องมือที่ไม่เหมาะสม ไม่ว่าความแม่นยำจะดีเพียงใด และ Nimble ให้คะแนนแต่ละฟิลด์อย่างอิสระ ดังนั้นกฎความสอดคล้องระหว่างฟิลด์ใด ๆ — "ถ้า A เป็นจริง แล้ว B ต้องเป็นเท็จ" — ต้องอยู่ในโค้ดของคุณ ไม่ใช่ในโมเดล
ทำไมสูตรข้อมูลจึงเป็นอาร์ติแฟกต์ที่พกพาได้ง่ายกว่า
นี่คือข้อโต้แย้งเพื่อสนับสนุน Nimble ที่ตารางความแม่นยำมองข้ามไป Bespoke ได้เผยแพร่ไปป์ไลน์การคัดสรรข้อมูล ไม่ใช่แค่ค่าน้ำหนักเท่านั้น หากปัญหาการตัดสินใจของคุณมีอนุกรมวิธานแบบตายตัว และคุณสามารถเขียนกฎออกมาได้ วิธีการแบบคอนทราสต์เป็นสิ่งที่คุณรันบนข้อมูลของคุณเองด้วยข้อเท็จจริงโฟกัสของคุณเองได้ บนโมเดลฐานใดก็ตามที่คุณต้องการ LoRA ขนาด 9B ถือเป็นการสาธิตวิธีการพอ ๆ กับเป็นผลิตภัณฑ์
ความสามารถในการพกพาของ Laya นั้นแตกต่างและเสริมกัน เพราะมันมีขนาดเล็ก เพราะมันทำงานบน CPU และเพราะมีการพอร์ต ONNX และ MLX ทำให้ Laya เป็นโมเดลที่คุณสามารถใส่ไว้ในโปรเซสที่ไม่มี GPU และไม่มีเครือข่ายได้ ในเบนช์มาร์ก browser-agent ของบุคคลที่สาม Laya ทำสำเร็จ 0 จาก 50 งาน และประกาศว่าเสร็จสิ้นก่อนกำหนดในการลอง 33 ครั้ง — แต่ผู้เขียนเบนช์มาร์กระบุว่ามันถูกฝึกมาสำหรับงานที่ต้องใช้วิจารณญาณ เช่น ตั๋วสนับสนุน ใบแจ้งหนี้ และการตรวจสอบร่องรอยของเอเจนต์ ไม่ใช่การนำทาง ให้อ่านผลลัพธ์นั้นเป็นคำแถลงขอบเขตมากกว่าคำตัดสิน และมันสอดคล้องกับการวางกรอบของทั้งสองโครงการ: สิ่งเหล่านี้เป็นองค์ประกอบสำหรับการตัดสินใจประเภทเฉพาะ ไม่ใช่เอเจนต์ทั่วไป
ทั้ง Laya และ Nimble ไม่ใช่โมเดลที่โฮสต์อยู่บน OrcaRouter ทั้งสองเป็นเวทที่คุณรันเอง และไม่มีอะไรในบทความนี้ที่ควรอ่านเป็นการอ้างว่าเราให้บริการทั้งสอง เหตุผลที่ผลิตภัณฑ์ routing ถูกหยิบยกขึ้นมาเลย ก็เป็นเหตุผลเดียวกับที่มันถูกหยิบยกขึ้นมาในสถาปัตยกรรมของโมเดลตัดสินใจใด ๆ: โมเดลตัดสินใจตอบคำเรียกหนึ่งครั้ง และแอปพลิเคชันที่อยู่รอบ ๆ ก็ยังต้องการข้อความบรรยาย ไปป์ไลน์ที่ใช้ Nimble ในการให้คะแนนว่าฉบับร่างเป็นไปตามข้อกำหนดหรือไม่ และใช้ Laya ในการจัดเส้นทางข้อยกเว้น ก็ยังต้องใช้โมเดล generative ในการเขียนฉบับร่างนั้น การเก็บครึ่ง generative นั้นไว้บน endpoint เดียวที่เข้ากันได้กับ OpenAI — โมเดล 200+ ตัว, ราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยมี markup 0% ดังนั้นการลดราคาของผู้ขายจึงมีผลในวันเดียวกัน, การ failover อัตโนมัติข้ามผู้ให้บริการ — หมายความว่าชั้นการตัดสินใจสามารถสลับได้โดยไม่ต้องแตะสัญญาของชั้น generative
คำตัดสิน และการทดลองที่จะเปลี่ยนคำตัดสินนั้น
เลือก Nimble หากอนุกรมวิธานของคุณคงที่และแคบ อินพุตของคุณเป็นภาษาอังกฤษและสั้น คุณมี GPU และคุณต้องการสูตรข้อมูลพอ ๆ กับตัวโมเดล เลือก Laya หากคุณต้องการอินพุตหลายภาษา งบเวลาต่ำกว่า 40 มิลลิวินาที หรือกระบวนการที่ไม่มี GPU เลย — และคิดต้นทุนการปรับละเอียด (fine-tuning) รวมไว้ตั้งแต่แรก เพราะเช็กพอยต์แบบ zero-shot ต่ำกว่า baseline พื้นฐาน และการ์ดโมเดลก็ระบุไว้เช่นนั้น
การทดลองที่จะชี้ขาดเรื่องนี้คือการประเมินแบบจับคู่บนทราฟฟิกจริง: อินพุตเดียวกัน ชุดตัวเลือกเดียวกัน เกณฑ์ความเชื่อมั่นเดียวกัน ประเมินเทียบกับป้ายกำกับโดยมนุษย์ พร้อมแผนภาพความน่าเชื่อถือสำหรับแต่ละโมเดล เอกสารของ Nimble เองเตือนว่าค่าความน่าจะเป็นของมันไม่ใช่อัตราความถูกต้อง และการ์ดของ Laya รายงานความคลาดเคลื่อนของการปรับเทียบที่ 0.466 ก่อนการรีฟิต ดังนั้นแผนภาพนั้นคือชิ้นงานที่จะบอกคุณได้จริง ๆ ว่าควรนำโมเดลใดไปไว้หน้าโปรดักชัน ไม่มีโครงการใดเผยแพร่แผนภาพดังกล่าว และไม่มีโครงการใดเผยแพร่ของอีกฝ่าย สร้างมันบนข้อมูลของคุณเองก่อนที่คุณจะกำหนดเกณฑ์

