การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Microsoft-Decision-1 vs Laya พร้อมคำบรรยายว่า ความครอบคลุมภาษาเทียบกับความยาวบริบท โดยมีชิประบุว่า 25 ภาษาที่รองรับ vs 100+ ภาษา, บริบท 32,768 โทเคน vs หน้าต่าง 1,024 โทเคน, API แบบโฮสต์เท่านั้น vs น้ำหนักโมเดล Apache-2.0 และส่วนท้ายที่ระบุว่าตัวเลขของผู้ให้บริการทั้งสองรายเป็นข้อมูลที่รายงานเอง
Engineering & Research

Microsoft-Decision-1 vs Laya: 25 ภาษาผ่าน API, 100+ ภาษาผ่านการดาวน์โหลด 322MB

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

นับจำนวนภาษาก็ดูเหมือนผลตัดสินจะชัดเจนแล้ว Microsoft-Decision-1 ซึ่งเปิดให้ใช้งานทั่วไปบน Microsoft Foundry ตั้งแต่วันที่ 8 ตุลาคม 2026 ระบุภาษาที่รองรับไว้ 25 ภาษา และกล่าวอย่างตรงไปตรงมาว่าความครอบคลุม คุณภาพ และการปรับคาลิเบรต "อาจแตกต่างกันไปตามภาษา" พร้อมระบุว่าภาษาที่ไม่ใช่ภาษาอังกฤษและโดยเฉพาะภาษาที่มีทรัพยากรต่ำเป็นพื้นที่ที่ประสิทธิภาพต่ำกว่า Laya ซึ่งเผยแพร่โดย Convai Innovations เมื่อวันที่ 18 กันยายน 2026 ภายใต้สัญญาอนุญาต Apache 2.0 อธิบายตัวเองว่าเป็นแบบหลายภาษาครอบคลุมกว่า 100 ภาษา และรายงานว่า 45 จาก 51 ภาษาที่ทดสอบยังคงใช้งานได้เมื่อใช้การจัดเส้นทาง เทียบกับ 23 จาก 51 สำหรับรุ่นพี่ที่รองรับเฉพาะภาษาอังกฤษ ตัวหนึ่งเป็นโมเดล 9B อยู่เบื้องหลังเอนด์พอยต์ Azure ที่มีคอนเท็กซ์ 32,768 โทเคน ส่วนอีกตัวเป็นตัวจำแนกประเภทที่มีพารามิเตอร์ 421 ล้าน ทำงานที่ 32.8 มิลลิวินาทีต่อการตัดสินใจบน Tesla T4 ตัวเดียวโดยไม่เสียค่าใช้จ่าย ทั้งสองไม่ยอมเขียนโทเคนใด ๆ และทั้งคู่คืนค่าความน่าจะเป็นเหนือตัวเลือกที่คุณกำหนดเอง

แต่ถ้าอ่านการ์ดโมเดลทั้งสองใบให้ครบถ้วน จำนวนภาษาก็จะเลิกเป็นตัวเลขที่น่าสนใจ สิ่งที่น่าสนใจคือเรื่องราวการปรับเทียบที่อยู่เบื้องหลังต่างหาก และสองโครงการนี้เล่าเรื่องนั้นไปในทิศทางที่ตรงกันข้าม

Laya เปิดเผยตัวเลขที่ทำให้การตลาดของตัวเองดูน่าอึดอัด

การ์ดโมเดล Laya ระบุไว้ในส่วนข้อจำกัดของมันเองว่า checkpoint ฐานให้คะแนน 0.362 แบบ zero-shot บน benchmark typed-decisions ซึ่งต่ำกว่า baseline majority-class ที่ 0.461 นั่นคือการ์ดที่บอกคุณว่าโมเดลของมันแย่กว่าการเดา "คำตอบที่พบบ่อยที่สุด" ในแบบทดสอบนั้น นอกจากนี้ยังระบุว่า checkpoint ฐานแบบ zero-shot ให้ผลใกล้เคียงระดับการเดาสุ่ม ว่าตัวเลขพาดหัว 0.766 ของ typed-decisions ต้องอาศัยการ fine-tune บน split ของ benchmark นั้นเอง ว่าคำถามประเภทคะแนนแบบลำดับเป็น primitive ที่อ่อนแอที่สุด (SST-5 0.372) ว่าคำถามแบบเลือกที่มี cardinality สูงมีปัญหาเพราะ 77 ตัวเลือกทำให้เหลือเพียงราวสามถึงสี่โทเคนต่อตัวเลือก ว่าnoulสามารถทำตาม label ของตัวเองได้ และว่าaction.act_probabilityฟิลด์นี้ "ยังไม่มีสัญญาณที่ใช้งานได้" ที่ AUROC 0.30 ประโยคสรุปของ Convai เองคือประโยคที่ควรนำไปใช้ในการประเมินใด ๆ: Laya เป็นฐานที่เร็วสำหรับการปรับให้เชี่ยวชาญ ไม่ใช่เครื่องตัดสินใจแบบ zero-shot

ความตรงไปตรงมาแบบนั้นมีค่ามากกว่าที่คุณคิด เพราะมันบอกคุณได้อย่างชัดเจนว่า Laya มีไว้ทำอะไร มันคือเอนโคเดอร์ที่คุณปรับละเอียดบนป้ายกำกับของคุณเอง สถาปัตยกรรมทั้งหมดถูกสร้างขึ้นเพื่อให้สคีมาใหม่ไม่ต้องฝึกใหม่ แต่การทำงานได้ดีกับงานใดงานหนึ่งนั้นต้องฝึก เมื่อใช้ในลักษณะนั้น ตัวเลขที่เผยแพร่ก็แข็งแกร่ง: 0.766 เทียบกับ 0.727 ของ Jev บนการตัดสินใจแบบมีประเภทหลังการปรับละเอียด, AG News 0.950 เทียบกับ 0.910, DAIR Emotion 0.595 เทียบกับ 0.480 และ ECE 0.081 เทียบกับ 0.246 ของ Jev พร้อมหมายเหตุที่ตรงไปตรงมาว่ามันมาพร้อมความมั่นใจเกินจริงและต้องปรับ temperature ใหม่ ซึ่งเลื่อนค่าเฉลี่ย ECE จาก 0.466 ไปเป็น 0.081

Microsoft เผยแพร่ระเบียบวิธีและปิดบังผลลัพธ์

หน้า Foundry ของ Microsoft-Decision-1 ทำแบบฝึกหัดเดียวกันในทิศทางตรงกันข้าม โดยอธิบายการประเมินไว้อย่างละเอียด — เบนช์มาร์กการตัดสินใจทั้งแบบสาธารณะและแบบชุมชน รวมถึงชุดข้อมูลภายในที่กันไว้สำหรับทดสอบ, เมตริกซึ่งรวมถึงความแม่นยำและความคลาดเคลื่อนในการปรับเทียบ, การสลับลำดับตัวเลือก, การทดสอบทางสถิติแบบจับคู่, การใช้ฮาร์เนสเดียวกันสำหรับโมเดลที่นำมาเปรียบเทียบ — และรายงานว่าโมเดลนี้ "มีประสิทธิภาพทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" พร้อมระบุจุดแข็ง (การให้เหตุผล, การนำกฎไปใช้, ความทนทานต่อการจัดรูปแบบพรอมป์ต์) และจุดอ่อน (ความรู้เฉพาะทางในโดเมน, ภาษาที่ไม่ใช่ภาษาอังกฤษ)

แล้วมันก็ไม่แสดงอะไรออกมาเลย ไม่มีตัวเลขความแม่นยำ ไม่มีค่าคลาดเคลื่อนการคาลิเบรต ไม่มีตารางรายเบนช์มาร์ก ข้อจำกัดที่รายงานเองนั้นเป็นเรื่องจริงและมีประโยชน์ — คะแนนเปลี่ยนไปตามถ้อยคำและการจัดลำดับตัวเลือก คำถามที่ตั้งกรอบไว้ไม่ดีก็ยังให้คะแนนออกมาอยู่ดี การคาลิเบรตแม่นยำที่สุดกับประเภทงานที่คุ้นเคย ไม่มีการสร้างคำอธิบาย — แต่รายการข้อจำกัดไม่ใช่การวัดผล ดังนั้นการแลกเปลี่ยนนี้จึงชัดเจนผิดปกติ: Laya ให้ตัวเลขที่คุณสามารถลองหักล้างด้วยข้อมูลของคุณเอง และ Microsoft ให้จุดยืนด้านการปฏิบัติตามข้อกำหนดกับบริบทขนาด 32K ที่คุณใส่เอกสารยาว ๆ เข้าไปได้

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

ความแตกต่างของขนาดให้อะไรได้จริง

ความเล็กของ Laya ไม่ใช่การประนีประนอมในที่นี้ แต่คือการออกแบบ เพราะตัวเลือกทุกตัวถูกให้คะแนนที่โทเคน [MASK] ของตัวเอง และผ่าน softmax เหนือตัวเลือกของคำถามนั้น พื้นที่คำตอบจึงถูกประกอบขึ้น ณ เวลาที่ร้องขอ แทนที่จะฝังตายตัวไว้ในหัวคำศัพท์ — นี่คือเหตุผลว่าทำไมสคีมาที่คุณคิดขึ้นบ่ายนี้จึงไม่ต้องฝึกใหม่ และทำไมโมเดลจึงพอดีกับพารามิเตอร์ 322 ถึง 421 ล้านตัว เช็กพอยต์หลายภาษาทำงานเร็วกว่าเช็กพอยต์ภาษาอังกฤษประมาณ 2.2 เท่า เราเตอร์ตรวจจับสคริปต์ได้ในเวลาไม่ถึงครึ่งมิลลิวินาที และอัตราการประมวลผลแบบแบตช์ทำได้ถึง 103 ถึง 332 คำถามต่อวินาทีบน T4 หนึ่งตัว สำหรับงานที่ต้องให้คะแนนทุกตั๋ว ทุกเอกสารที่ค้นคืนมา หรือทุกการดำเนินการที่เสนอ อัตราการประมวลผลนั้นคือจุดเด่น ไม่ใช่จำนวนพารามิเตอร์

ต้นทุนของการออกแบบนั้นก็เจาะจงพอ ๆ กัน และควรค่าแก่การกล่าวเทียบกับทางเลือกของ Microsoft เช็กพอยต์ภาษาอังกฤษใช้หน้าต่าง 512 โทเค็น ส่วนตัวหลายภาษาใช้ 1,024 และขยายได้ถึง 8K Microsoft-Decision-1 ใช้ 32,768 กระทู้สนับสนุนแบบยาว สัญญาฉบับเต็ม หรือเอกสารนโยบายหลายหน้า ไม่พอดีกับหน้าต่างของ Laya เลย และความเร็วไม่ว่าจะมากเพียงใดก็ชดเชยการตัดทอนข้อมูลไม่ได้ Laya ตอบชุดคำถามหนึ่งชุดต่อฟอร์เวิร์ดพาสหนึ่งครั้ง โดยมีงบโทเค็นที่ระบุไว้ต่อตัวเลือก ส่วน Microsoft ระบุการเรียกใช้เพียงครั้งเดียวด้วยโทเค็นสูงสุด 32K โดยไม่มีเพดานต่อคำถาม และจุดอ่อนทางการแข่งขันของ Laya ในฐานะตัวจำแนกประเภทก็เป็นสิ่งที่ควรรู้ไว้: มันทำคะแนนได้ 0.425 บน Banking77 เทียบกับ 0.870 ของ Jev ซึ่งเป็นปัญหาจำแนกเจตนาแบบละเอียดและมีจำนวนคลาสสูงประเภทที่พาสเฉพาะทางมีความสำคัญมากที่สุด

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

การเปรียบเทียบต้นทุนที่ไม่ได้คิดต่อโทเคน

Laya ใช้งานได้ฟรี ณ จุดที่ใช้งาน — โฮสต์เองได้ ใช้ Apache 2.0 ระบุต้นทุนแบบโฮสต์เองไว้ที่ "$0" — และราคาที่แท้จริงของมันคือการรัน fine-tuning ที่คุณต้องจ่ายให้มันก่อนที่มันจะเก่งในงานของคุณ Microsoft-Decision-1 เป็น Foundry API แบบโฮสต์ที่มีอัตราคิดค่าตามโทเคนซึ่งไม่ได้พิมพ์ไว้บนหน้าโมเดล ไม่มีเวตให้ดาวน์โหลด ไม่มีเส้นทาง fine-tuning และปิดการทำ batch inference ไว้ อันหนึ่งเป็นโปรเจกต์ติดป้ายข้อมูลที่ต้องลงทุนล่วงหน้า อีกอันเป็นการเรียกใช้ที่คิดค่าตามปริมาณ อันไหนถูกกว่ากันขึ้นอยู่กับปริมาณทั้งหมด และจุดตัดขาดนั้นสูงมาก: เอนโคเดอร์ขนาด 421M ที่ให้คะแนนได้ 300 รายการต่อวินาทีบน T4 ที่เช่า เป็นเรื่องยากมากที่จะเอาชนะในแง่ต่อการตัดสินใจหนึ่งครั้ง เมื่อมันถูกเทรนแล้ว

นี่คือจุดที่ OrcaRouter ได้รับตำแหน่งของตนในไปป์ไลน์ที่สร้างขึ้นบนโมเดลใดโมเดลหนึ่ง และเป็นเพียงฝั่งการสร้างเท่านั้น เราไม่ได้โฮสต์ทั้ง Microsoft-Decision-1 และ Laya: ทั้งคู่คืนค่าความน่าจะเป็นแทนข้อความ ไม่มีตัวใดอยู่ในแคตาล็อกของเรา และเอนด์พอยต์สำหรับให้คะแนนไม่ใช่เป้าหมายของ chat-completions สิ่งที่เราให้บริการคือโมเดลที่สร้างสิ่งที่ถูกให้คะแนน — ร่างคำตอบ การเรียกเครื่องมือที่เสนอ หรือคำตอบที่เป็นตัวเลือกซึ่งหัวแบบ fine-tuned ของ Laya จะตัดสินในภายหลัง นั่นคือโมเดลมากกว่า 200 รายการที่อยู่เบื้องหลังคีย์เดียวที่เข้ากันได้กับ OpenAIในราคาตามรายการของผู้ให้บริการที่ส่งผ่านด้วยมาร์กอัป 0% พร้อมการสลับไปใช้เส้นทางสำรองอัตโนมัติเมื่อเส้นทางการให้บริการเส้นทางหนึ่งเสื่อมประสิทธิภาพ ในลูปที่ให้คะแนนทุกอย่างที่มันสร้าง การเรียกเพื่อสร้างคือส่วนที่อาจล้มเหลว และการสลับไปใช้เส้นทางสำรองคือสิ่งที่ทำให้คิวการให้คะแนนมีงานป้อนอยู่เสมอ

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

เลือกอันไหนดี

เลือก Laya หากการตัดสินใจของคุณเข้ามาในหลายภาษา หากปริมาณงานของคุณสูงพอที่การคิดราคาต่อโทเคนจะมีความสำคัญ หากคุณมีป้ายกำกับและเวลาหนึ่งสัปดาห์สำหรับการไฟน์จูน หรือหากคุณต้องรันการให้คะแนนบนฮาร์ดแวร์ภายในขอบเขตของคุณเอง ยอมรับหน้าต่าง 512 ถึง 1,024 โทเคน และความจริงที่ว่าเช็กพอยต์ฐานจะใกล้เคียงกับการเดาสุ่มจนกว่าคุณจะปรับให้เชี่ยวชาญ และคุณจะได้โมเดลการตัดสินใจที่ตรงไปตรงมาว่าเป็นเพียงจุดเริ่มต้น

เลือก Microsoft-Decision-1 หากอินพุตของคุณเป็นเอกสารยาวแทนที่จะเป็นทิกเก็ต หากด่านการดีพลอยของคุณคือการยืนยันตัวตนผ่าน Azure การเรียกเก็บเงินแบบรวมศูนย์ และชุด Responsible AI แทนที่จะเป็นการดาวน์โหลด หาก 25 ภาษาครอบคลุมทราฟฟิกของคุณ หรือหากคุณไม่อยากเป็นเจ้าของโมเดลเองเลย ยอมรับไว้เลยว่าคุณจะต้องวาดเส้นโค้งคาลิเบรชันเส้นแรกด้วยตัวเอง และเผื่อเวลาไว้หนึ่งบ่ายกับตัวอย่างที่มีป้ายกำกับเพื่อทำสิ่งนั้น — เพราะต่างจาก Laya ตัวนี้จะไม่ยื่นตัวเลข ECE ให้คุณเอาไว้โต้แย้ง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube