
Microsoft-Decision-1: โมเดล Microsoft ที่ตอบด้วยตัวเลขแทนที่จะเป็นประโยค
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 79 tok/s
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
Microsoft-Decision-1 มีบรรทัดหนึ่งในโมเดลการ์ดของมันที่ไม่มีโมเดล Microsoft ตัวอื่นเคยมีมาก่อน: ไม่ได้ออกแบบมาสำหรับการสร้างข้อความ โมเดลนี้เปิดให้ใช้ทั่วไปบน Microsoft Foundry เมื่อ 8 ตุลาคม 2026 และมันเป็นการจำกัดขอบเขตอย่างจงใจว่าภาษาโมเดลมีไว้เพื่ออะไร คุณป้อนสถานการณ์และคำถามพร้อมรายการคำตอบที่กำหนดตายตัว — ใช่/ไม่ใช่ ชุดตัวเลือกหลายข้อ มาตรวัดระดับ เกณฑ์ให้คะแนน — แล้วมันจะคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วสำหรับแต่ละตัวเลือก ไม่มีข้อความร้อยเรียง ไม่มีคำอธิบาย ไม่มีช่องเหตุผล ผลลัพธ์คือตัวเลข JSON เท่านั้น มันสร้างบนQwen3.5-9B ซึ่ง Microsoft ฝึกเพิ่มเติมภายหลัง และ Microsoft กล่าวว่าจะเปลี่ยนฐานของโมเดลไปยังแบ็กโบนอื่นในภายหลัง โดยระบุชื่อ MAI และโมเดลพันธมิตรอื่น ๆ
นั่นเป็นผลิตภัณฑ์ที่แปลกกว่าที่ฟังครั้งแรก ตำแหน่งการแข่งขันของ Microsoft ในปี 2026 ตั้งอยู่บนโมเดลแชตระดับแนวหน้าและบน Copilot และ Microsoft-Decision-1 ตรงข้ามกับทั้งสองอย่าง: ตัวให้คะแนนขนาดกลางที่ใช้เฉพาะทาง งานทั้งหมดของมันคือบอกแอปพลิเคชันว่าตัวเลือกใดของคุณเองมีแนวโน้มจะถูกต้องที่สุด และมันมั่นใจแค่ไหน คำถามที่น่าสนใจไม่ใช่ว่ามันเก่งเรื่องการเขียนหรือไม่ — มันแย่เรื่องนั้นอย่างชัดเจนและไม่ได้พยายามด้วยซ้ำ — แต่คือว่าการแจกแจงความน่าจะเป็นเหนือตัวเลือกต่าง ๆ เป็นองค์ประกอบพื้นฐานที่มีประโยชน์กว่าสำหรับเวิร์กโหลดที่องค์กรต่าง ๆ รันจริงหรือไม่ เมื่อเทียบกับโมเดลอเนกประสงค์อีกตัวที่มีโหมด JSON
สิ่งที่มันทำอย่างแม่นยำ
สัญญาคือหนึ่งการเรียกเข้า หนึ่งการแจกแจงออก Microsoft ระบุรูปแบบคำถามที่รองรับ ได้แก่ ใช่/ไม่ใช่ หลายตัวเลือก การให้คะแนน การจำแนกประเภท และอิงตามรูบริก ทุกตัวเลือกจะได้รับคะแนน โมเดลทำงานในการเรียกใช้ครั้งเดียวบนอินพุตขนาดไม่เกิน 32K โทเค็น — 32,768 คือหน้าต่างบริบทที่ระบุไว้ — และเพดานในทางปฏิบัติคืออินพุตบวกกับชุดตัวเลือก ไม่ใช่งบประมาณการสร้าง เพราะไม่มีการสร้าง
กรณีการใช้งานที่เผยแพร่แล้วคือสิ่งที่ทีมแพลตฟอร์มจะจดจำได้ทันที:
• การประเมินผลลัพธ์ที่สร้างโดย AI — ให้คะแนนคำตอบที่สร้างขึ้นเทียบกับเกณฑ์ที่กำหนดไว้ หรือตัดสินว่าคำตอบนั้นมีหลักฐานที่ได้รับมารองรับหรือไม่
• การจำแนกประเภทและการกำหนดเส้นทาง — จำแนกคำขอ ตัดสินความเกี่ยวข้อง คัดแยกคิว เลือกสาขาของเวิร์กโฟลว์
• แนวป้องกันของเอเจนต์ — ให้คะแนนการเรียกใช้เครื่องมือหรือการดำเนินการของเอเจนต์ที่เสนอ ก่อนที่แอปพลิเคชันที่ผสานรวมจะอนุญาตให้ดำเนินการ
• การคัดกรองความปลอดภัยของเนื้อหาการคัดกรองความปลอดภัยของเนื้อหาเทียบกับเกณฑ์ที่แอปพลิเคชันกำหนด แทนที่จะเป็นนโยบายตายตัวของผู้ขาย
• ความเกี่ยวข้องของการค้นหาและเอกสาร — ตัดสินว่าเอกสารที่ค้นคืนมาตรงกับคำถามที่ให้มาหรือไม่
• ระบบอัตโนมัติตามค่าความเชื่อมั่น — ยอมรับผลลัพธ์ที่มีค่าความเชื่อมั่นสูงโดยอัตโนมัติ และส่งต่อส่วนที่เหลือให้มนุษย์ดำเนินการ
ตัวเลือกการไม่ตอบเป็นรายละเอียดที่น่าสังเกต Microsoft สนับสนุนตัวเลือกอย่าง “บอกไม่ได้” อย่างชัดเจนเมื่อหลักฐานที่ให้มาไม่เพียงพอ ซึ่งเป็นความแตกต่างระหว่างตัวให้คะแนนที่ปรับเทียบแล้วกับตัวที่เพียงแค่มีความมั่นใจ และเนื่องจากคะแนนถูกส่งกลับมาเป็นตัวเลข เกณฑ์การยกระดับจึงเป็นการตัดสินใจของคุณเอง — คุณกำหนดว่า 0.7 จะส่งเรื่องให้คนตรวจ และ 0.95 จะไม่ส่ง
สิ่งที่มันจะไม่ทำ
Microsoft ระบุข้อยกเว้นอย่างชัดเจนเป็นพิเศษ และข้อยกเว้นเหล่านี้สำคัญกว่าตรายการคุณสมบัติสำหรับใครก็ตามที่กำลังประเมินขนาดของสิ่งนี้สำหรับไปป์ไลน์จริง Microsoft-Decision-1 ไม่ได้ถูกออกแบบมาสำหรับการสร้างข้อความ การตอบคำถามแบบปลายเปิด การสนทนา การแปล หรือการสรุปความ อีกทั้งไม่ได้มีไว้สำหรับงานที่ไม่มีคำถามแบบปิดและชุดตัวเลือกคำตอบที่กำหนดไว้ หรือสำหรับงานที่ต้องใช้ความรู้ที่ไม่มีอยู่ในอินพุต รองรับเฉพาะข้อความเท่านั้น: ไม่มีภาพ เสียง หรือวิดีโอทั้งขาเข้าและขาออก และไม่มีการอธิบายหรือเหตุผลประกอบ
เมื่ออ่านสิ่งเหล่านั้นประกอบกัน จะปรากฏเส้นแบ่งที่สะดุดล้มได้ง่าย นี่ไม่ใช่แชตบอตที่คุณขอให้จำแนกสิ่งต่างๆ ได้ด้วย และไม่ใช่เครื่องมือสรุปที่คุณสามารถติดคะแนนเข้าไปได้ มันคือฟังก์ชันให้คะแนนที่มีงบโทเคน กรอบของทีมเอง — ที่ว่ามันไม่ควรเป็นผู้ตัดสินใจอัตโนมัติแต่เพียงผู้เดียวในการตัดสินใจที่มีผลสำคัญเกี่ยวกับผู้คน และไม่ควรเป็นพื้นฐานเดียวสำหรับการตัดสินใจที่เกี่ยวข้องกับสินเชื่อ การจ้างงาน ที่อยู่อาศัย ประกัน การศึกษา การดูแลสุขภาพ สิทธิทางกฎหมาย "หรือโดเมนที่มีผลสำคัญในทำนองเดียวกัน" — ชี้ไปในทางเดียวกัน มันถูกออกแบบมาให้อยู่ข้างๆ การตัดสินใจ ไม่ใช่เป็นตัวการตัดสินใจเอง

สถานการณ์ของ benchmark คือเรื่องที่ไม่มีใครอยากพิมพ์
ไม่มีตัวเลขใด ๆ หน้าแค็ตตาล็อก Microsoft Foundry สำหรับ Microsoft-Decision-1 มีแท็บ Benchmarks และแท็บนั้นไม่มีตัวเลขใด ๆ เลย สิ่งที่พบในนั้นแทนคือย่อหน้าอธิบายวิธีการและข้อกล่าวอ้างเชิงคุณภาพว่า โมเดลนี้ "ถูกประเมินบนเกณฑ์มาตรฐานการตัดสินใจสาธารณะและของชุมชน และบนชุดทดสอบภายในที่กันไว้ซึ่งไม่ได้ใช้ในการฝึก" Microsoft รายงานว่าโมเดล "มีประสิทธิภาพทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยวิธีการเดียวกัน" และเมตริกที่ใช้คือความแม่นยำ ความคลาดเคลื่อนของการปรับเทียบ recall ด้านความปลอดภัย อัตราผลบวกลวง และความสอดคล้องด้านความเป็นธรรม โดยมีการสลับลำดับตัวเลือกและใช้การทดสอบทางสถิติแบบจับคู่

นั่นคือคำอธิบายระเบียบวิธีวิจัยที่จริงจัง ซึ่งแนบมากับผลลัพธ์ที่เผยแพร่เป็นศูนย์ หมายความว่าข้อกล่าวอ้างเรื่องประสิทธิภาพทุกข้อเกี่ยวกับ Microsoft-Decision-1 ในปัจจุบันเป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่มีใครทำซ้ำได้ และจุดยืนที่ซื่อตรงสำหรับใครก็ตามที่ประเมินมันคือ การสอบเทียบ (calibration) — คุณสมบัติเดียวที่ทำให้ค่าความน่าจะเป็นมีประโยชน์ได้จริง — ยังไม่ได้รับการตรวจสอบยืนยันจากภายนอก Microsoft บริษัทระบุจุดที่เชื่อว่าโมเดลแข็งแกร่งที่สุดและอ่อนแอที่สุด ซึ่งมีประโยชน์กว่าคะแนนพาดหัวข่าว โดยแข็งแกร่งที่สุดในด้านการให้เหตุผล การใช้กฎ และความทนทานต่อรูปแบบของพรอมป์ต์ แข่งขันได้ในด้านการจำแนกประเภท การค้นคืน ความเป็นธรรม การใช้เครื่องมือ และงานหลายภาษาส่วนใหญ่ และอ่อนแอกว่าในงานที่ต้องใช้ความรู้เฉพาะสาขา
ข้อจำกัดที่รายงานด้วยตนเองน่าอ่านก่อนรายการคุณสมบัติ คะแนนอาจเปลี่ยนแปลงไปตามถ้อยคำและการจัดลำดับตัวเลือก และคำถามที่ตั้งไว้ไม่ดีก็ยังให้คะแนนออกมา การสอบเทียบจะแม่นยำที่สุดกับประเภทงานที่คุ้นเคย อาจอาศัยความรู้ที่ล้าสมัย และไม่ให้คำอธิบายใด ๆ เกี่ยวกับความครอบคลุมหลายภาษา: มี 25 ภาษาที่ระบุว่ารองรับ รวมถึงภาษาญี่ปุ่น เกาหลี อาหรับ เวียดนาม ไทย ตุรกี ฮินดี เบงกาลี สวาฮิลี ฮีบรู เปอร์เซีย และยูเครน แต่ Microsoft ระบุว่าความครอบคลุม คุณภาพ และการสอบเทียบ "อาจแตกต่างกันไปตามภาษา" และระบุว่าภาษาที่ไม่ใช่ภาษาอังกฤษ — โดยเฉพาะภาษาที่มีทรัพยากรต่ำ — เป็นพื้นที่ที่ประสิทธิภาพต่ำ โมเดลพื้นฐาน Qwen3.5-9B รองรับมากกว่า 200 ภาษา; โมเดลที่ผ่านการฝึกเพิ่มเติมรองรับเพียงหนึ่งในสี่ของจำนวนนั้น
คุณได้มันมาอย่างไร และมันมีค่าใช้จ่ายเท่าไร
Microsoft-Decision-1 เผยแพร่เป็น API แบบโฮสต์ใน Microsoft Foundry ภายใต้กลุ่มผลิตภัณฑ์ "Direct from Azure" ไม่มีการเผยแพร่น้ำหนักโมเดล — นี่ไม่ใช่รุ่น open-weights และไม่มีที่เก็บ Hugging Face สำหรับดาวน์โหลด แอปพลิเคชันใดก็ตามที่สามารถส่งคำขอ HTTPS ได้สามารถผสานการทำงานโดยใช้ endpoints ของ Foundry และการรับรองความถูกต้อง Azure มาตรฐาน รายการการปรับใช้แสดงตัวเลือกแบบ serverless และ unified-endpoint บนแบบจ่ายตามการใช้งานจริงหรือ provisioned throughput แบบจอง, SKU มาตรฐาน, โดยปิดใช้งาน batch inference และการเปิดเผยข้อมูลการฝึกอบรมรายงานว่าชุดข้อมูลการฝึกอบรมถูกใช้ครั้งแรกในเดือนกันยายน 2026 โดยการเก็บรวบรวมยังดำเนินอยู่
ราคาไม่ได้ถูกเผยแพร่บนหน้าโมเดล ช่องราคาของแคตตาล็อกเชื่อมต่อไปยังหน้าราคาโมเดลของ Microsoft แทนที่จะแสดงอัตราอินพุตและเอาต์พุต ดังนั้นค่าใช้จ่ายต่อโทเคนของการเรียกใช้ Decision-1 จึงเป็นสิ่งที่คุณต้องไปค้นหาในหน้าราคาของ Azure หรืออ่านจากใบเรียกเก็บเงิน นั่นเป็นช่องว่างที่แท้จริงสำหรับใครก็ตามที่พยายามจำลองต้นทุนต่อการตัดสินใจในปริมาณมาก และมันคุ้มค่าที่จะพูดให้ชัดเจนแทนการประมาณการ สองสิ่งที่น่ารู้เมื่อคุณกำหนดราคามัน: 0% ของค่าใช้จ่ายคือโทเคนเอาต์พุต เพราะไม่มีเลย และการอนุมานแบบแบตช์ถูกปิด ดังนั้นคุณไม่สามารถตัดจำหน่ายการรันการให้คะแนนแบบกลุ่มผ่านช่องทางแบตช์ได้เหมือนที่คุณทำกับโมเดลแบบสร้างสรรค์
จุดที่ OrcaRouter เข้ามาเกี่ยวข้องในเรื่องนี้คืออีกด้านหนึ่งของการเรียก เราไม่ได้โฮสต์ Microsoft-Decision-1 และมันไม่ได้อยู่ในแคตตาล็อกของเรา — โมเดลที่คืนค่าความน่าจะเป็นแทนที่จะเป็นข้อความ ไม่ใช่โมเดลที่คุณจะส่ง chat completions ไปให้ สิ่งที่เรามีคือครึ่งหนึ่งของรูปแบบที่ทำการสร้างจริง ๆ: โมเดลที่เขียนเกณฑ์การให้คะแนน ร่างคำตอบที่เป็นตัวเลือก หรือสร้างการเรียกเครื่องมือที่ Decision-1 นำไปให้คะแนน โมเดลเหล่านั้นอยู่เบื้องหลังคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียว ซึ่งมีโมเดลมากกว่า 200 รายการในราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยมีมาร์กอัป 0% ดังนั้นหากผู้ขายลดราคาโมเดลผู้ตัดสิน ฝั่งเราก็จะมีผลทันทีในวันเดียวกัน หากคุณกำลังสร้างลูปการประเมินที่โมเดลหนึ่งเขียนและอีกโมเดลหนึ่งให้คะแนน การเรียกให้คะแนนจะไปที่ Microsoft และการเรียกเพื่อสร้างสามารถไปที่ใดก็ได้ — รวมถึงผ่าน routing DSL ซึ่งประกอบโมเดลหลายตัวเข้าด้วยกันเป็นการเรียกครั้งเดียวเมื่อคุณต้องการคณะกรรมการแทนที่จะเป็นผู้ตัดสินคนเดียว

ทำไม scorer จึงเป็นการเดิมพันที่แตกต่างจากแชตบอตที่ดีกว่า
รูปแบบที่ Microsoft กำลังขายอยู่นี้มีอยู่แล้วในที่เปิด Intern-Decision-4B ของ InternLM, d1-3B ของ Liquid AI, Laya ของ Convai Innovations และตระกูล Kev จาก Jared Palmer ต่างก็ส่งคืนการแจกแจงที่ปรับเทียบแล้วบนตัวเลือกที่ให้มาโดยไม่สร้างข้อความ และส่วนใหญ่เป็นเวต Apache-2.0 ที่คุณสามารถรันบนฮาร์ดแวร์ของตัวเองได้ฟรี ข้อเสนอของ Microsoft แตกต่างในสามประการที่ไม่ได้ขึ้นกับเบนช์มาร์ก: มันเป็น API แบบมีผู้ให้บริการจัดการที่มีการยืนยันตัวตน การเรียกเก็บเงิน และการกำกับดูแลของ Azure ติดมาด้วย จึงเข้ากับเส้นทางการจัดซื้อจัดจ้างขององค์กร ซึ่งการดาวน์โหลดจาก Hugging Face ไม่เข้ากับเส้นทางนั้น; ฐานของมันเป็นโมเดลขนาด 9B ซึ่งใหญ่กว่าส่วนใหญ่ในกลุ่มนั้น; และมันมาพร้อมการประเมิน Responsible AI และวิธีการประเมินที่มีเอกสารประกอบ ซึ่งบ่อยครั้งเป็นข้อกำหนดที่ต้องผ่านจริงสำหรับการนำไปใช้ในสภาพแวดล้อมที่มีการกำกับดูแล
สิ่งที่มันไม่มีมาด้วยคือตัวเลข เมื่อเทียบกับคู่แข่งแบบเปิดที่เผยแพร่คะแนน Brier และค่าความคลาดเคลื่อนของการสอบเทียบที่คาดหวัง — ตัวเลขสองตัวที่บอกคุณว่าเมื่อระบบบอก 0.8 มันหมายถึง 0.8 จริงหรือไม่ — Microsoft กลับเผยแพร่เพียงระเบียบวิธี แต่ไม่เผยแพร่ผลลัพธ์ จนกว่าจะมีการทดสอบการสอบเทียบโดยอิสระ วิธีใช้ Microsoft-Decision-1 ที่ป้องกันตัวได้คือวิธีที่เอกสารของมันเองแนะนำ: ตรวจสอบความถูกต้องกับข้อมูลที่เป็นตัวแทนของกรณีการใช้งานของคุณ กำหนดเกณฑ์จากต้นทุนของข้อผิดพลาดของคุณ ใส่ตัวเลือกการงดตอบไว้เสมอ สุ่มลำดับตัวเลือกในกรณีที่ลำดับอาจทำให้คำตอบเอนเอียง และมีมนุษย์อยู่ในวงจรสำหรับเรื่องที่มีนัยสำคัญ นั่นเป็นคำแนะนำที่ดีสำหรับระบบให้คะแนนใด ๆ และเป็นคำแนะนำที่ดีเป็นพิเศษสำหรับระบบที่ไม่มีใครนอกบริษัทเคยวัดการสอบเทียบของมัน
