
Microsoft-Decision-1 vs Laya: 25 ภาษาผ่าน API, 100+ ภาษาผ่านการดาวน์โหลด 322MB
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
นับจำนวนภาษาก็ดูเหมือนผลตัดสินจะชัดเจนแล้ว Microsoft-Decision-1 ซึ่งเปิดให้ใช้งานทั่วไปบน Microsoft Foundry ตั้งแต่วันที่ 8 ตุลาคม 2026 ระบุภาษาที่รองรับไว้ 25 ภาษา และกล่าวอย่างตรงไปตรงมาว่าความครอบคลุม คุณภาพ และการปรับคาลิเบรต "อาจแตกต่างกันไปตามภาษา" พร้อมระบุว่าภาษาที่ไม่ใช่ภาษาอังกฤษและโดยเฉพาะภาษาที่มีทรัพยากรต่ำเป็นพื้นที่ที่ประสิทธิภาพต่ำกว่า Laya ซึ่งเผยแพร่โดย Convai Innovations เมื่อวันที่ 18 กันยายน 2026 ภายใต้สัญญาอนุญาต Apache 2.0 อธิบายตัวเองว่าเป็นแบบหลายภาษาครอบคลุมกว่า 100 ภาษา และรายงานว่า 45 จาก 51 ภาษาที่ทดสอบยังคงใช้งานได้เมื่อใช้การจัดเส้นทาง เทียบกับ 23 จาก 51 สำหรับรุ่นพี่ที่รองรับเฉพาะภาษาอังกฤษ ตัวหนึ่งเป็นโมเดล 9B อยู่เบื้องหลังเอนด์พอยต์ Azure ที่มีคอนเท็กซ์ 32,768 โทเคน ส่วนอีกตัวเป็นตัวจำแนกประเภทที่มีพารามิเตอร์ 421 ล้าน ทำงานที่ 32.8 มิลลิวินาทีต่อการตัดสินใจบน Tesla T4 ตัวเดียวโดยไม่เสียค่าใช้จ่าย ทั้งสองไม่ยอมเขียนโทเคนใด ๆ และทั้งคู่คืนค่าความน่าจะเป็นเหนือตัวเลือกที่คุณกำหนดเอง
แต่ถ้าอ่านการ์ดโมเดลทั้งสองใบให้ครบถ้วน จำนวนภาษาก็จะเลิกเป็นตัวเลขที่น่าสนใจ สิ่งที่น่าสนใจคือเรื่องราวการปรับเทียบที่อยู่เบื้องหลังต่างหาก และสองโครงการนี้เล่าเรื่องนั้นไปในทิศทางที่ตรงกันข้าม
Laya เปิดเผยตัวเลขที่ทำให้การตลาดของตัวเองดูน่าอึดอัด
การ์ดโมเดล Laya ระบุไว้ในส่วนข้อจำกัดของมันเองว่า checkpoint ฐานให้คะแนน 0.362 แบบ zero-shot บน benchmark typed-decisions ซึ่งต่ำกว่า baseline majority-class ที่ 0.461 นั่นคือการ์ดที่บอกคุณว่าโมเดลของมันแย่กว่าการเดา "คำตอบที่พบบ่อยที่สุด" ในแบบทดสอบนั้น นอกจากนี้ยังระบุว่า checkpoint ฐานแบบ zero-shot ให้ผลใกล้เคียงระดับการเดาสุ่ม ว่าตัวเลขพาดหัว 0.766 ของ typed-decisions ต้องอาศัยการ fine-tune บน split ของ benchmark นั้นเอง ว่าคำถามประเภทคะแนนแบบลำดับเป็น primitive ที่อ่อนแอที่สุด (SST-5 0.372) ว่าคำถามแบบเลือกที่มี cardinality สูงมีปัญหาเพราะ 77 ตัวเลือกทำให้เหลือเพียงราวสามถึงสี่โทเคนต่อตัวเลือก ว่าnoulสามารถทำตาม label ของตัวเองได้ และว่าaction.act_probabilityฟิลด์นี้ "ยังไม่มีสัญญาณที่ใช้งานได้" ที่ AUROC 0.30 ประโยคสรุปของ Convai เองคือประโยคที่ควรนำไปใช้ในการประเมินใด ๆ: Laya เป็นฐานที่เร็วสำหรับการปรับให้เชี่ยวชาญ ไม่ใช่เครื่องตัดสินใจแบบ zero-shot
ความตรงไปตรงมาแบบนั้นมีค่ามากกว่าที่คุณคิด เพราะมันบอกคุณได้อย่างชัดเจนว่า Laya มีไว้ทำอะไร มันคือเอนโคเดอร์ที่คุณปรับละเอียดบนป้ายกำกับของคุณเอง สถาปัตยกรรมทั้งหมดถูกสร้างขึ้นเพื่อให้สคีมาใหม่ไม่ต้องฝึกใหม่ แต่การทำงานได้ดีกับงานใดงานหนึ่งนั้นต้องฝึก เมื่อใช้ในลักษณะนั้น ตัวเลขที่เผยแพร่ก็แข็งแกร่ง: 0.766 เทียบกับ 0.727 ของ Jev บนการตัดสินใจแบบมีประเภทหลังการปรับละเอียด, AG News 0.950 เทียบกับ 0.910, DAIR Emotion 0.595 เทียบกับ 0.480 และ ECE 0.081 เทียบกับ 0.246 ของ Jev พร้อมหมายเหตุที่ตรงไปตรงมาว่ามันมาพร้อมความมั่นใจเกินจริงและต้องปรับ temperature ใหม่ ซึ่งเลื่อนค่าเฉลี่ย ECE จาก 0.466 ไปเป็น 0.081
Microsoft เผยแพร่ระเบียบวิธีและปิดบังผลลัพธ์
หน้า Foundry ของ Microsoft-Decision-1 ทำแบบฝึกหัดเดียวกันในทิศทางตรงกันข้าม โดยอธิบายการประเมินไว้อย่างละเอียด — เบนช์มาร์กการตัดสินใจทั้งแบบสาธารณะและแบบชุมชน รวมถึงชุดข้อมูลภายในที่กันไว้สำหรับทดสอบ, เมตริกซึ่งรวมถึงความแม่นยำและความคลาดเคลื่อนในการปรับเทียบ, การสลับลำดับตัวเลือก, การทดสอบทางสถิติแบบจับคู่, การใช้ฮาร์เนสเดียวกันสำหรับโมเดลที่นำมาเปรียบเทียบ — และรายงานว่าโมเดลนี้ "มีประสิทธิภาพทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" พร้อมระบุจุดแข็ง (การให้เหตุผล, การนำกฎไปใช้, ความทนทานต่อการจัดรูปแบบพรอมป์ต์) และจุดอ่อน (ความรู้เฉพาะทางในโดเมน, ภาษาที่ไม่ใช่ภาษาอังกฤษ)
แล้วมันก็ไม่แสดงอะไรออกมาเลย ไม่มีตัวเลขความแม่นยำ ไม่มีค่าคลาดเคลื่อนการคาลิเบรต ไม่มีตารางรายเบนช์มาร์ก ข้อจำกัดที่รายงานเองนั้นเป็นเรื่องจริงและมีประโยชน์ — คะแนนเปลี่ยนไปตามถ้อยคำและการจัดลำดับตัวเลือก คำถามที่ตั้งกรอบไว้ไม่ดีก็ยังให้คะแนนออกมาอยู่ดี การคาลิเบรตแม่นยำที่สุดกับประเภทงานที่คุ้นเคย ไม่มีการสร้างคำอธิบาย — แต่รายการข้อจำกัดไม่ใช่การวัดผล ดังนั้นการแลกเปลี่ยนนี้จึงชัดเจนผิดปกติ: Laya ให้ตัวเลขที่คุณสามารถลองหักล้างด้วยข้อมูลของคุณเอง และ Microsoft ให้จุดยืนด้านการปฏิบัติตามข้อกำหนดกับบริบทขนาด 32K ที่คุณใส่เอกสารยาว ๆ เข้าไปได้

ความแตกต่างของขนาดให้อะไรได้จริง
ความเล็กของ Laya ไม่ใช่การประนีประนอมในที่นี้ แต่คือการออกแบบ เพราะตัวเลือกทุกตัวถูกให้คะแนนที่โทเคน [MASK] ของตัวเอง และผ่าน softmax เหนือตัวเลือกของคำถามนั้น พื้นที่คำตอบจึงถูกประกอบขึ้น ณ เวลาที่ร้องขอ แทนที่จะฝังตายตัวไว้ในหัวคำศัพท์ — นี่คือเหตุผลว่าทำไมสคีมาที่คุณคิดขึ้นบ่ายนี้จึงไม่ต้องฝึกใหม่ และทำไมโมเดลจึงพอดีกับพารามิเตอร์ 322 ถึง 421 ล้านตัว เช็กพอยต์หลายภาษาทำงานเร็วกว่าเช็กพอยต์ภาษาอังกฤษประมาณ 2.2 เท่า เราเตอร์ตรวจจับสคริปต์ได้ในเวลาไม่ถึงครึ่งมิลลิวินาที และอัตราการประมวลผลแบบแบตช์ทำได้ถึง 103 ถึง 332 คำถามต่อวินาทีบน T4 หนึ่งตัว สำหรับงานที่ต้องให้คะแนนทุกตั๋ว ทุกเอกสารที่ค้นคืนมา หรือทุกการดำเนินการที่เสนอ อัตราการประมวลผลนั้นคือจุดเด่น ไม่ใช่จำนวนพารามิเตอร์
ต้นทุนของการออกแบบนั้นก็เจาะจงพอ ๆ กัน และควรค่าแก่การกล่าวเทียบกับทางเลือกของ Microsoft เช็กพอยต์ภาษาอังกฤษใช้หน้าต่าง 512 โทเค็น ส่วนตัวหลายภาษาใช้ 1,024 และขยายได้ถึง 8K Microsoft-Decision-1 ใช้ 32,768 กระทู้สนับสนุนแบบยาว สัญญาฉบับเต็ม หรือเอกสารนโยบายหลายหน้า ไม่พอดีกับหน้าต่างของ Laya เลย และความเร็วไม่ว่าจะมากเพียงใดก็ชดเชยการตัดทอนข้อมูลไม่ได้ Laya ตอบชุดคำถามหนึ่งชุดต่อฟอร์เวิร์ดพาสหนึ่งครั้ง โดยมีงบโทเค็นที่ระบุไว้ต่อตัวเลือก ส่วน Microsoft ระบุการเรียกใช้เพียงครั้งเดียวด้วยโทเค็นสูงสุด 32K โดยไม่มีเพดานต่อคำถาม และจุดอ่อนทางการแข่งขันของ Laya ในฐานะตัวจำแนกประเภทก็เป็นสิ่งที่ควรรู้ไว้: มันทำคะแนนได้ 0.425 บน Banking77 เทียบกับ 0.870 ของ Jev ซึ่งเป็นปัญหาจำแนกเจตนาแบบละเอียดและมีจำนวนคลาสสูงประเภทที่พาสเฉพาะทางมีความสำคัญมากที่สุด

การเปรียบเทียบต้นทุนที่ไม่ได้คิดต่อโทเคน
Laya ใช้งานได้ฟรี ณ จุดที่ใช้งาน — โฮสต์เองได้ ใช้ Apache 2.0 ระบุต้นทุนแบบโฮสต์เองไว้ที่ "$0" — และราคาที่แท้จริงของมันคือการรัน fine-tuning ที่คุณต้องจ่ายให้มันก่อนที่มันจะเก่งในงานของคุณ Microsoft-Decision-1 เป็น Foundry API แบบโฮสต์ที่มีอัตราคิดค่าตามโทเคนซึ่งไม่ได้พิมพ์ไว้บนหน้าโมเดล ไม่มีเวตให้ดาวน์โหลด ไม่มีเส้นทาง fine-tuning และปิดการทำ batch inference ไว้ อันหนึ่งเป็นโปรเจกต์ติดป้ายข้อมูลที่ต้องลงทุนล่วงหน้า อีกอันเป็นการเรียกใช้ที่คิดค่าตามปริมาณ อันไหนถูกกว่ากันขึ้นอยู่กับปริมาณทั้งหมด และจุดตัดขาดนั้นสูงมาก: เอนโคเดอร์ขนาด 421M ที่ให้คะแนนได้ 300 รายการต่อวินาทีบน T4 ที่เช่า เป็นเรื่องยากมากที่จะเอาชนะในแง่ต่อการตัดสินใจหนึ่งครั้ง เมื่อมันถูกเทรนแล้ว
นี่คือจุดที่ OrcaRouter ได้รับตำแหน่งของตนในไปป์ไลน์ที่สร้างขึ้นบนโมเดลใดโมเดลหนึ่ง และเป็นเพียงฝั่งการสร้างเท่านั้น เราไม่ได้โฮสต์ทั้ง Microsoft-Decision-1 และ Laya: ทั้งคู่คืนค่าความน่าจะเป็นแทนข้อความ ไม่มีตัวใดอยู่ในแคตาล็อกของเรา และเอนด์พอยต์สำหรับให้คะแนนไม่ใช่เป้าหมายของ chat-completions สิ่งที่เราให้บริการคือโมเดลที่สร้างสิ่งที่ถูกให้คะแนน — ร่างคำตอบ การเรียกเครื่องมือที่เสนอ หรือคำตอบที่เป็นตัวเลือกซึ่งหัวแบบ fine-tuned ของ Laya จะตัดสินในภายหลัง นั่นคือโมเดลมากกว่า 200 รายการที่อยู่เบื้องหลังคีย์เดียวที่เข้ากันได้กับ OpenAIในราคาตามรายการของผู้ให้บริการที่ส่งผ่านด้วยมาร์กอัป 0% พร้อมการสลับไปใช้เส้นทางสำรองอัตโนมัติเมื่อเส้นทางการให้บริการเส้นทางหนึ่งเสื่อมประสิทธิภาพ ในลูปที่ให้คะแนนทุกอย่างที่มันสร้าง การเรียกเพื่อสร้างคือส่วนที่อาจล้มเหลว และการสลับไปใช้เส้นทางสำรองคือสิ่งที่ทำให้คิวการให้คะแนนมีงานป้อนอยู่เสมอ

เลือกอันไหนดี
เลือก Laya หากการตัดสินใจของคุณเข้ามาในหลายภาษา หากปริมาณงานของคุณสูงพอที่การคิดราคาต่อโทเคนจะมีความสำคัญ หากคุณมีป้ายกำกับและเวลาหนึ่งสัปดาห์สำหรับการไฟน์จูน หรือหากคุณต้องรันการให้คะแนนบนฮาร์ดแวร์ภายในขอบเขตของคุณเอง ยอมรับหน้าต่าง 512 ถึง 1,024 โทเคน และความจริงที่ว่าเช็กพอยต์ฐานจะใกล้เคียงกับการเดาสุ่มจนกว่าคุณจะปรับให้เชี่ยวชาญ และคุณจะได้โมเดลการตัดสินใจที่ตรงไปตรงมาว่าเป็นเพียงจุดเริ่มต้น
เลือก Microsoft-Decision-1 หากอินพุตของคุณเป็นเอกสารยาวแทนที่จะเป็นทิกเก็ต หากด่านการดีพลอยของคุณคือการยืนยันตัวตนผ่าน Azure การเรียกเก็บเงินแบบรวมศูนย์ และชุด Responsible AI แทนที่จะเป็นการดาวน์โหลด หาก 25 ภาษาครอบคลุมทราฟฟิกของคุณ หรือหากคุณไม่อยากเป็นเจ้าของโมเดลเองเลย ยอมรับไว้เลยว่าคุณจะต้องวาดเส้นโค้งคาลิเบรชันเส้นแรกด้วยตัวเอง และเผื่อเวลาไว้หนึ่งบ่ายกับตัวอย่างที่มีป้ายกำกับเพื่อทำสิ่งนั้น — เพราะต่างจาก Laya ตัวนี้จะไม่ยื่นตัวเลข ECE ให้คุณเอาไว้โต้แย้ง
