
Laya vs Decider: เอนโคเดอร์ 421M กับ Mixture 35B
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
Laya และ Decider ต่างเป็นโมเดลตัดสินใจแบบเปิดน้ำหนัก (open-weight) ที่ไม่ใช่ออโตรีเกรสซีฟ (non-autoregressive) ซึ่งตอบคำถามแบบกำหนดชนิดคำตอบได้ — ไม่ว่าจะเป็นตัวเลือกจากรายการที่ให้มา คะแนนบนเกณฑ์ที่จัดลำดับไว้ หรือความน่าจะเป็นแบบใช่/ไม่ใช่ — ภายใน forward pass เพียงครั้งเดียว และทั้งสองอยู่คนละปลายสุดของสเปกตรัมขนาด Convai Innovations เปิดตัว Laya เมื่อวันที่ 18 กันยายน 2026 ภายใต้สัญญาอนุญาต Apache 2.0 ประกอบด้วยเอ็นโคดเดอร์ ModernBERT-large ขนาด 421M สำหรับภาษาอังกฤษที่หน้าต่าง 512 โทเคน เช็กพอยต์หลายภาษา mmBERT-base ขนาด 322M ที่หน้าต่าง 1,024 โทเคนซึ่งครอบคลุมกว่า 100 ภาษา และเราเตอร์ที่ตรวจจับระบบอักษรแล้วส่งต่อไปยังตัวที่เหมาะสม ตระกูล Decider ของ Mapika มีตั้งแต่ decider-0.8b และ decider-2b บนฐานแบบเจเนอเรทีฟขนาดเล็ก ไปจนถึง decider-35b-a3b ซึ่งเป็น mixture-of-experts ขนาด 35B ที่มีพารามิเตอร์ทำงานจริงราว 3B ทั้งคู่ดาวน์โหลดได้ฟรี และทั้งคู่ส่งคืนค่าความน่าจะเป็นแทนที่จะเป็นข้อความ เหตุผลที่ทั้งสองใช้แทนกันไม่ได้ไม่ใช่ตัวเลขความแม่นยำที่บทความส่วนใหญ่มักยกขึ้นมาก่อน
สองตระกูล หนึ่งการเดิมพันเชิงสถาปัตยกรรม

ข้อสมมติร่วมกันคือ การตัดสินใจไม่จำเป็นต้องมีลูปการถอดรหัส โมเดลเชิงสร้างที่ถูกถามว่า “ทิกเก็ตนี้เป็นคำขอคืนเงินหรือไม่?” ต้องปล่อยโทเคนออกมา และในทันทีที่มันปล่อยโทเคน คุณต้องดูแลการแยกวิเคราะห์ การตรวจสอบสคีมา และเส้นทางการลองใหม่สำหรับครั้งเดียวในสองร้อยครั้งที่มันลืมเครื่องหมายปีกกา ทั้ง Laya และ Decider ต่างข้ามขั้นตอนนั้นโดยอ่านคำตอบโดยตรงจากการ forward pass เพียงครั้งเดียว — Laya จากเอนโคเดอร์แบบสองทิศทาง และ Decider จาก logits ของโทเคนตัวเลือกที่กำกับด้วยตัวอักษร ณ ช่องคำตอบเฉพาะในพรอมป์ต์
นั่นคือจุดที่ความคล้ายคลึงกันสิ้นสุดลง Laya เป็นตัวเข้ารหัสขนาดเล็กสองตัวที่อยู่เบื้องหลังเราเตอร์ภาษา ซึ่งเป็นสิ่งที่ทำให้มันได้หน้าต่างภาษาอังกฤษขนาด 512 โทเคน และหน้าต่างหลายภาษาขนาด 1,024 โทเคน ที่จำนวนพารามิเตอร์ 421M และ 322M ส่วน Decider ยังคงโครงหลักแบบเจเนอเรทีฟไว้ และเพิ่มส่วนอ่านผลลัพธ์ไว้ด้านบน: decider-2b คือการปรับละเอียดแบบมีผู้สอนของ Qwen3.5-2B-Base ตามด้วยรอบเสริมแรงที่คำนึงถึงการคาลิเบรชันบนงานเบราว์เซอร์สดและเกมที่แม่นยำ ขณะที่ decider-35b-a3b ตรึงผู้เชี่ยวชาญที่ถูกจัดเส้นทางไว้และฝึกเมทริกซ์บล็อกด้วย Muon ผลที่ตามมาในทางปฏิบัติคือ Decider สืบทอดความรู้เกี่ยวกับโลกของแบบจำลองภาษา ส่วน Laya ไม่ ผลอีกประการหนึ่งคือ Decider สืบทอดรอยเท้าทรัพยากรของแบบจำลองภาษา

เอกสารของ Mapika เองระบุว่า decider-2b ใช้เวลามัธยฐาน 18 มิลลิวินาทีต่อการตัดสินใจหนึ่งครั้งบน B300 ในโหมด bf16 แบบแบตช์เดียว โดยไม่ใช้ CUDA graphs หรือการคอมไพล์ และ decider-35b-a3b ใช้เวลา 41 มิลลิวินาทีบนการตั้งค่าเดียวกัน บน GH200 ที่มีบริบทตั๋วซัพพอร์ตราว 230 โทเคนและคำถามแบบพิมพ์สามถึงห้าข้อ โครงการเดียวกันรายงานว่า 49 มิลลิวินาทีในโหมด eager, 4.0 มิลลิวินาทีเมื่อใช้ CUDA graphs และ torch.compile และประมาณ 1,370 การตัดสินใจต่อวินาทีที่แบตช์ 32 ตัวเลขเหล่านั้นเป็นตัวเลขที่ผู้ขายเผยแพร่จากเอกสารของโครงการเอง ไม่ใช่การวัดที่เป็นอิสระ ตัวเลขพาดหัวของ Laya ก็เผยแพร่โดยผู้ขายเช่นกัน: 32.8 มิลลิวินาที p50 ต่อการตัดสินใจบน Tesla T4 และ 7.2 มิลลิวินาทีต่อคำถามที่ขนาดแบตช์ 10
คำถามเรื่องการสอบเทียบ ซึ่งสองโครงการตอบในสเกลที่แตกต่างกัน
Calibration คือค่าที่สำคัญที่สุดสำหรับโมเดลเพื่อการตัดสินใจ เพราะจุดประสงค์ทั้งหมดของการคืนค่าความน่าจะเป็นก็คือ จะมีคนที่อยู่ปลายน้ำกำหนดเกณฑ์กับค่านั้น นี่ก็เป็นจุดที่การเปรียบเทียบ Laya กับ Decider โดยตรงจะทำให้คุณเข้าใจผิด
Laya มาพร้อมกับค่าความคลาดเคลื่อนการคาลิเบรตที่คาดหวัง (expected calibration error) เท่ากับ 0.466 บนการ์ดโมเดลของตัวเอง และการ์ดระบุตรง ๆ ว่าการปรับ temperature ใหม่แยกตามประเภทคำถามจะทำให้ค่านั้นกลายเป็น 0.081 นี่เป็นการเปิดเผยที่ซื่อสัตย์อย่างผิดปกติ และยังหมายความว่า checkpoint ที่จัดส่งมานั้นไม่ใช่ชิ้นงานที่ผ่านการคาลิเบรตแล้ว ตัวเลขที่คุณได้มาแบบพร้อมใช้คือ 0.466
Decider รายงานบนเครื่องมือที่แตกต่างไปโดยสิ้นเชิง Decision Index — กระดานผู้นำแบบเปิดที่รันการทำซ้ำแบบเปิดทุกครั้งของ Jev มากกว่า 132,422 คำขอ — จัดอันดับ decider-35b-a3b ไว้ที่อันดับสี่โดยรวมที่ 54.3 ตามหลัง Jev ที่ 59.5 และรายงานว่ามันเป็นตัวที่ปรับเทียบได้ดีที่สุดใน 32 รายการ ด้วยความคลาดเคลื่อนในการปรับเทียบ 3.1 จุด และคำตอบผิด 0.4% ที่ความเชื่อมั่นที่ระบุ 95%+ decider-2b รายงาน 8.8 จุดและ 0.9% นั่นเป็นตัวเลขที่เผยแพร่บนกระดานผู้นำ และ 3.1 จุดบน ten-bin ECE ของ Index ไม่ใช่การวัดแบบเดียวกับ 0.466 ของ Laya ในการประเมินของตัวเอง การนำมาไว้ข้างกันในตารางจะเป็นข้อผิดพลาดแบบเทียบแอปเปิลกับส้มที่แต่งตัวเป็นความเข้มงวด สิ่งที่คุณพูดได้ก็คือผู้เขียน Decider เลือกที่จะให้วัดบนกระดานผู้นำของบุคคลที่สาม และผู้เขียน Laya เลือกที่จะเผยแพร่ตัวเลขการปรับเทียบที่อ่อนแอที่สุดของตัวเอง ทั้งคู่ยังไม่ได้รับการตรวจสอบจากฮาร์เนสของอีกฝ่าย
จุดที่แต่ละตัวชนะ ในแต่ละมิติ
• แบ็กโบน — Laya: เอนโคเดอร์ ModernBERT-large ขนาด 421M แบบสองทิศทาง ตัวตัดสินใจ: ฐานแบบเจเนอเรทีฟ Qwen3.5, 0.8B ถึง 35B-A3B
• ภาษา — Laya: 100+ ผ่านเช็กพอยต์หลายภาษาขนาด 322M ที่อยู่เบื้องหลังเราเตอร์ Decider: เฉพาะภาษาอังกฤษ โดยระบุว่าเป็นข้อจำกัด
• หน้าต่างบริบท — Laya: 512 โทเคนสำหรับภาษาอังกฤษ, 1,024 สำหรับหลายภาษา. Decider: รับอินพุตได้สูงสุด 32k, ฝึกไว้ที่ 16k บนเจเนอเรชัน v6, ตรวจสอบถึง 30k.
• เพดานของชุดตัวเลือก — Laya: ประสิทธิภาพลดลงอย่างรวดเร็วเมื่อมีตัวเลือกเกินประมาณ 20 รายการ โดยได้ 0.425 บน Banking77 เทียบกับ 0.870 ของ Jev. Decider: Choice รองรับตัวเลือกที่มีชื่อ 2 ถึง 255 รายการ, Score รองรับระดับที่อธิบายไว้ 2 ถึง 10 ระดับ.
• ความแม่นยำแบบ zero-shot — Laya: 0.362 บนเบนช์มาร์ก typed-decisions ต่ำกว่าเส้นฐาน majority-class ที่ 0.461 Decider: ไม่ได้เผยแพร่เป็นตัวเลข zero-shot; โครงการรายงานผลลัพธ์เฉพาะงานแทน
• การปรับเทียบ — Laya: ECE 0.466 เมื่อจัดส่ง, 0.081 หลังการปรับอุณหภูมิใหม่ตามประเภทคำถาม Decider: 3.1 คะแนนบน Decision Index สำหรับ 35B ดีที่สุดใน 32 รายการ
• การให้เหตุผล — Laya: ไม่มี โดยโครงสร้าง Decider: ไม่มี ระบุไว้อย่างชัดเจน — มันเป็นเพียงผลลัพธ์จากการจับคู่รูปแบบ ไม่ใช่ตัวให้เหตุผล
• สัญญาอนุญาต — Apache 2.0 สำหรับทั้งสอง
รายละเอียดอีกอย่างเกี่ยวกับ Decider ที่ควรรู้ก่อนจะเลือกใช้: โปรเจกต์นี้เตือนว่าการเลือกเรกคอร์ดหนึ่งรายการออกจากอาร์เรย์ JSON ที่ยาว ๆ ตามตำแหน่งเป็นกรณีที่อ่อนแอ และแนะนำให้อ้างอิงเรกคอร์ดด้วยคีย์ นั่นคือข้อจำกัดแบบที่คุณจะรู้ได้ก็ต่อเมื่อได้ลองรันมันจริง ๆ
ค่าใช้จ่ายที่คุณต้องเสียในการรันอันใดอันหนึ่ง
โปรไฟล์ต้นทุนของ Laya เป็นโครงการปรับแต่งละเอียด โมเดลมีขนาดเล็กพอที่จะรันบน CPU ของแล็ปท็อปสำหรับงานปริมาณงานต่ำ แต่คะแนน zero-shot ของเช็กพอยต์ภาษาอังกฤษที่จัดส่งมานั้นต่ำกว่า baseline พื้นฐาน ซึ่งหมายความว่าการนำ Laya มาใช้ก็คือการรับงานสร้างชุดข้อมูลที่มีป้ายกำกับ ปรับแต่งละเอียด และปรับ temperature ใหม่ตามประเภทคำถาม ผลตอบแทนคือเมื่อคุณทำมันเสร็จแล้ว ชิ้นงานจะมีขนาด 421M พารามิเตอร์ และตอบกลับภายในไม่กี่สิบมิลลิวินาทีบน T4 laya-typed-decisions เช็กพอยต์ที่ Convai ปรับแต่งละเอียดเองนั้นไปถึง 0.766 บนชุดฝึกของ benchmark — ตัวเลขนี้บอกอะไรได้มากเกี่ยวกับการปรับแต่งละเอียดมากกว่าเกี่ยวกับโมเดลฐาน และการ์ดก็ระบุไว้เช่นนั้น
โปรไฟล์ต้นทุนของ Decider คือการตัดสินใจด้านการให้บริการ คุณกำลังเลือกว่าจะเช่า GPU มากแค่ไหน และตระกูลโมเดลนี้ให้ตัวเลือกที่ปรับได้จริงแก่คุณ: 18ms บน 2B เทียบกับ 41ms บน 35B-A3B โดยโมเดลที่ใหญ่กว่าจะให้ความรู้และความสามารถด้านการให้เหตุผลที่มากกว่าบน GPQA, GSM8K, CRUXEval และ MMLU ซึ่งรุ่นเล็กไม่มี ถ้างานของคุณมีขอบเขตแคบและป้ายกำกับของคุณคงที่ decider-2b คือเครื่องที่ราคาถูกกว่า ถ้างานของคุณต้องการให้โมเดลรู้สิ่งต่างๆ คุณก็ต้องจ่ายสำหรับโมเดลแบบผสม (mixture)
OrcaRouter เหมาะตรงไหน — และไม่เหมาะตรงไหน
ทั้ง Laya และ Decider ไม่ใช่โมเดลที่โฮสต์ให้บริการอยู่บน OrcaRouter คุณดาวน์โหลดเวตและรันมันเอง และไม่มีอะไรในนี้ที่จะเปลี่ยนข้อเท็จจริงนั้น สิ่งที่เปลี่ยนไปคืออีกครึ่งหนึ่งของแพตเทิร์น โมเดลการตัดสินใจแบบมีชนิดข้อมูลแทบไม่เคยเป็นแอปพลิเคชันทั้งหมดด้วยตัวมันเอง ต้องมีอะไรบางอย่างคอยอ่านตั๋ว สรุปเธรด หรือร่างคำตอบที่การตัดสินใจนั้นกำกับอยู่ ครึ่งนั้นคือการเรียกแบบ generative และเป็นครึ่งที่ OrcaRouter ถูกสร้างมาเพื่อรองรับ — โมเดล 200+ ตัวอยู่เบื้องหลังคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียว ในราคาราคาตามรายการของผู้ให้บริการที่ส่งผ่านด้วยมาร์กอัป 0% ดังนั้นเมื่อผู้ขายลดราคา มันจะไปอยู่ในบิลของคุณในวันเดียวกัน แทนที่จะรอถึงการต่อสัญญาครั้งถัดไป ถ้าคุณกำลัง fine-tune เช็กพอยต์ของ Laya เทียบกับเอาต์พุตของโมเดลแนวหน้า หรือจัดเส้นทางระหว่าง decider-2b สำหรับการคัดแยก กับโมเดลขนาดใหญ่สำหรับ 4% ที่ยาก การเก็บฝั่ง generative ไว้บนเอนด์พอยต์เดียวหมายความว่าฝั่งการตัดสินใจกับฝั่งการสร้างไม่จำเป็นต้องมีสองสัญญาและสอง SDK การ failover อัตโนมัติครอบคลุมกรณีที่โมเดลใหญ่เป็นส่วนที่ล่มไป
เลือกอันไหนดี
เลือก Laya หากข้อมูลนำเข้าของคุณมีหลายภาษา ป้ายกำกับของคุณมีไม่กี่ป้าย งบความหน่วงของคุณอยู่ในหลักสิบมิลลิวินาทีบนฮาร์ดแวร์ระดับปานกลาง และคุณพร้อมที่จะทำ fine-tune — เพราะคุณจะต้องทำอย่างแน่นอน เลือก Decider หากข้อมูลนำเข้าของคุณเป็นภาษาอังกฤษ คุณต้องการให้โมเดลนำความรู้ทั่วไปบางส่วนเข้ามาประกอบการตัดสินใจ และคุณอยากเลือกขนาดโมเดลมากกว่าที่จะรันไปป์ไลน์การฝึก หากชุดตัวเลือกของคุณมีเกินยี่สิบป้ายกำกับ โปรดอ่านตัวเลข Banking77 ของ Laya ก่อนตัดสินใจ หากข้อมูลนำเข้าของคุณเป็นเอกสาร JSON ขนาดยาวที่คุณอ้างอิงตามตำแหน่ง โปรดอ่านข้อจำกัดที่ระบุไว้ของ Decider ก่อนตัดสินใจ
การเปรียบเทียบที่จะชี้ขาดเรื่องนี้ได้จริง — ทั้งสองโมเดลบนอินพุตที่เหมือนกันทุกไบต์ พรอมป์ต์เดียวกัน ลำดับตัวเลือกเดียวกัน การกวาดค่าธรณีเดียวกัน — ยังไม่มี จนกว่าจะมี จุดยืนที่ซื่อสัตย์คือ Laya มีเส้นต้นทุนที่ดีกว่า และ Decider มีหลักฐานการคาลิเบรตที่ดีกว่า และทั้งสองยังอยู่ในระยะเริ่มต้นมากพอที่การประเมินที่คุณสร้างจากข้อมูลของคุณเองจะมีค่ามากกว่าตัวเลขที่เผยแพร่ของทั้งสองโปรเจกต์

