การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Microsoft-Decision-1 พร้อมคำบรรยายว่า 'โมเดลให้คะแนนการตัดสินใจที่คืนค่าความน่าจะเป็นแทนประโยค' โดยมีป้ายที่ระบุ Microsoft Foundry เปิดให้ใช้งานทั่วไป 8 ตุลาคม 2026 และชิปที่ระบุว่า โมเดลฐาน 9B, บริบท 32,768 โทเคน, ไม่แจกจ่ายเวต และข้อความเท่านั้น ไม่มีการสร้าง
Guides & Insights

Microsoft-Decision-1: โมเดล Microsoft ที่ตอบด้วยตัวเลขแทนที่จะเป็นประโยค

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Microsoft-Decision-1 มีบรรทัดหนึ่งในโมเดลการ์ดของมันที่ไม่มีโมเดล Microsoft ตัวอื่นเคยมีมาก่อน: ไม่ได้ออกแบบมาสำหรับการสร้างข้อความ โมเดลนี้เปิดให้ใช้ทั่วไปบน Microsoft Foundry เมื่อ 8 ตุลาคม 2026 และมันเป็นการจำกัดขอบเขตอย่างจงใจว่าภาษาโมเดลมีไว้เพื่ออะไร คุณป้อนสถานการณ์และคำถามพร้อมรายการคำตอบที่กำหนดตายตัว — ใช่/ไม่ใช่ ชุดตัวเลือกหลายข้อ มาตรวัดระดับ เกณฑ์ให้คะแนน — แล้วมันจะคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วสำหรับแต่ละตัวเลือก ไม่มีข้อความร้อยเรียง ไม่มีคำอธิบาย ไม่มีช่องเหตุผล ผลลัพธ์คือตัวเลข JSON เท่านั้น มันสร้างบนQwen3.5-9B ซึ่ง Microsoft ฝึกเพิ่มเติมภายหลัง และ Microsoft กล่าวว่าจะเปลี่ยนฐานของโมเดลไปยังแบ็กโบนอื่นในภายหลัง โดยระบุชื่อ MAI และโมเดลพันธมิตรอื่น ๆ

นั่นเป็นผลิตภัณฑ์ที่แปลกกว่าที่ฟังครั้งแรก ตำแหน่งการแข่งขันของ Microsoft ในปี 2026 ตั้งอยู่บนโมเดลแชตระดับแนวหน้าและบน Copilot และ Microsoft-Decision-1 ตรงข้ามกับทั้งสองอย่าง: ตัวให้คะแนนขนาดกลางที่ใช้เฉพาะทาง งานทั้งหมดของมันคือบอกแอปพลิเคชันว่าตัวเลือกใดของคุณเองมีแนวโน้มจะถูกต้องที่สุด และมันมั่นใจแค่ไหน คำถามที่น่าสนใจไม่ใช่ว่ามันเก่งเรื่องการเขียนหรือไม่ — มันแย่เรื่องนั้นอย่างชัดเจนและไม่ได้พยายามด้วยซ้ำ — แต่คือว่าการแจกแจงความน่าจะเป็นเหนือตัวเลือกต่าง ๆ เป็นองค์ประกอบพื้นฐานที่มีประโยชน์กว่าสำหรับเวิร์กโหลดที่องค์กรต่าง ๆ รันจริงหรือไม่ เมื่อเทียบกับโมเดลอเนกประสงค์อีกตัวที่มีโหมด JSON

สิ่งที่มันทำอย่างแม่นยำ

สัญญาคือหนึ่งการเรียกเข้า หนึ่งการแจกแจงออก Microsoft ระบุรูปแบบคำถามที่รองรับ ได้แก่ ใช่/ไม่ใช่ หลายตัวเลือก การให้คะแนน การจำแนกประเภท และอิงตามรูบริก ทุกตัวเลือกจะได้รับคะแนน โมเดลทำงานในการเรียกใช้ครั้งเดียวบนอินพุตขนาดไม่เกิน 32K โทเค็น — 32,768 คือหน้าต่างบริบทที่ระบุไว้ — และเพดานในทางปฏิบัติคืออินพุตบวกกับชุดตัวเลือก ไม่ใช่งบประมาณการสร้าง เพราะไม่มีการสร้าง

กรณีการใช้งานที่เผยแพร่แล้วคือสิ่งที่ทีมแพลตฟอร์มจะจดจำได้ทันที:

• การประเมินผลลัพธ์ที่สร้างโดย AI — ให้คะแนนคำตอบที่สร้างขึ้นเทียบกับเกณฑ์ที่กำหนดไว้ หรือตัดสินว่าคำตอบนั้นมีหลักฐานที่ได้รับมารองรับหรือไม่

• การจำแนกประเภทและการกำหนดเส้นทาง — จำแนกคำขอ ตัดสินความเกี่ยวข้อง คัดแยกคิว เลือกสาขาของเวิร์กโฟลว์

• แนวป้องกันของเอเจนต์ — ให้คะแนนการเรียกใช้เครื่องมือหรือการดำเนินการของเอเจนต์ที่เสนอ ก่อนที่แอปพลิเคชันที่ผสานรวมจะอนุญาตให้ดำเนินการ

• การคัดกรองความปลอดภัยของเนื้อหาการคัดกรองความปลอดภัยของเนื้อหาเทียบกับเกณฑ์ที่แอปพลิเคชันกำหนด แทนที่จะเป็นนโยบายตายตัวของผู้ขาย

• ความเกี่ยวข้องของการค้นหาและเอกสาร — ตัดสินว่าเอกสารที่ค้นคืนมาตรงกับคำถามที่ให้มาหรือไม่

• ระบบอัตโนมัติตามค่าความเชื่อมั่น — ยอมรับผลลัพธ์ที่มีค่าความเชื่อมั่นสูงโดยอัตโนมัติ และส่งต่อส่วนที่เหลือให้มนุษย์ดำเนินการ

ตัวเลือกการไม่ตอบเป็นรายละเอียดที่น่าสังเกต Microsoft สนับสนุนตัวเลือกอย่าง “บอกไม่ได้” อย่างชัดเจนเมื่อหลักฐานที่ให้มาไม่เพียงพอ ซึ่งเป็นความแตกต่างระหว่างตัวให้คะแนนที่ปรับเทียบแล้วกับตัวที่เพียงแค่มีความมั่นใจ และเนื่องจากคะแนนถูกส่งกลับมาเป็นตัวเลข เกณฑ์การยกระดับจึงเป็นการตัดสินใจของคุณเอง — คุณกำหนดว่า 0.7 จะส่งเรื่องให้คนตรวจ และ 0.95 จะไม่ส่ง

สิ่งที่มันจะไม่ทำ

Microsoft ระบุข้อยกเว้นอย่างชัดเจนเป็นพิเศษ และข้อยกเว้นเหล่านี้สำคัญกว่าตรายการคุณสมบัติสำหรับใครก็ตามที่กำลังประเมินขนาดของสิ่งนี้สำหรับไปป์ไลน์จริง Microsoft-Decision-1 ไม่ได้ถูกออกแบบมาสำหรับการสร้างข้อความ การตอบคำถามแบบปลายเปิด การสนทนา การแปล หรือการสรุปความ อีกทั้งไม่ได้มีไว้สำหรับงานที่ไม่มีคำถามแบบปิดและชุดตัวเลือกคำตอบที่กำหนดไว้ หรือสำหรับงานที่ต้องใช้ความรู้ที่ไม่มีอยู่ในอินพุต รองรับเฉพาะข้อความเท่านั้น: ไม่มีภาพ เสียง หรือวิดีโอทั้งขาเข้าและขาออก และไม่มีการอธิบายหรือเหตุผลประกอบ

เมื่ออ่านสิ่งเหล่านั้นประกอบกัน จะปรากฏเส้นแบ่งที่สะดุดล้มได้ง่าย นี่ไม่ใช่แชตบอตที่คุณขอให้จำแนกสิ่งต่างๆ ได้ด้วย และไม่ใช่เครื่องมือสรุปที่คุณสามารถติดคะแนนเข้าไปได้ มันคือฟังก์ชันให้คะแนนที่มีงบโทเคน กรอบของทีมเอง — ที่ว่ามันไม่ควรเป็นผู้ตัดสินใจอัตโนมัติแต่เพียงผู้เดียวในการตัดสินใจที่มีผลสำคัญเกี่ยวกับผู้คน และไม่ควรเป็นพื้นฐานเดียวสำหรับการตัดสินใจที่เกี่ยวข้องกับสินเชื่อ การจ้างงาน ที่อยู่อาศัย ประกัน การศึกษา การดูแลสุขภาพ สิทธิทางกฎหมาย "หรือโดเมนที่มีผลสำคัญในทำนองเดียวกัน" — ชี้ไปในทางเดียวกัน มันถูกออกแบบมาให้อยู่ข้างๆ การตัดสินใจ ไม่ใช่เป็นตัวการตัดสินใจเอง

A single-column generated scoreboard for Microsoft-Decision-1 with six rows: base model Qwen3.5-9B post-trained by Microsoft; weights hosted API only and not distributed; context window 32,768 tokens; output calibrated JSON probabilities with zero output tokens; published benchmarks none, methodology only; status generally available on Microsoft Foundry on October 8 2026. A footer line reads that all figures are Microsoft-reported and not independently reproduced.

สถานการณ์ของ benchmark คือเรื่องที่ไม่มีใครอยากพิมพ์

ไม่มีตัวเลขใด ๆ หน้าแค็ตตาล็อก Microsoft Foundry สำหรับ Microsoft-Decision-1 มีแท็บ Benchmarks และแท็บนั้นไม่มีตัวเลขใด ๆ เลย สิ่งที่พบในนั้นแทนคือย่อหน้าอธิบายวิธีการและข้อกล่าวอ้างเชิงคุณภาพว่า โมเดลนี้ "ถูกประเมินบนเกณฑ์มาตรฐานการตัดสินใจสาธารณะและของชุมชน และบนชุดทดสอบภายในที่กันไว้ซึ่งไม่ได้ใช้ในการฝึก" Microsoft รายงานว่าโมเดล "มีประสิทธิภาพทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยวิธีการเดียวกัน" และเมตริกที่ใช้คือความแม่นยำ ความคลาดเคลื่อนของการปรับเทียบ recall ด้านความปลอดภัย อัตราผลบวกลวง และความสอดคล้องด้านความเป็นธรรม โดยมีการสลับลำดับตัวเลือกและใช้การทดสอบทางสถิติแบบจับคู่

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text states that it is a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, that it is built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, that it will also rebase on other models including MAI and OpenAI, and lists quick facts: publisher Microsoft, type Text classification and Zero shot classification, lifecycle Generally available (GA), context window 32768, and a Pricing field that links out rather than printing a rate.

นั่นคือคำอธิบายระเบียบวิธีวิจัยที่จริงจัง ซึ่งแนบมากับผลลัพธ์ที่เผยแพร่เป็นศูนย์ หมายความว่าข้อกล่าวอ้างเรื่องประสิทธิภาพทุกข้อเกี่ยวกับ Microsoft-Decision-1 ในปัจจุบันเป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่มีใครทำซ้ำได้ และจุดยืนที่ซื่อตรงสำหรับใครก็ตามที่ประเมินมันคือ การสอบเทียบ (calibration) — คุณสมบัติเดียวที่ทำให้ค่าความน่าจะเป็นมีประโยชน์ได้จริง — ยังไม่ได้รับการตรวจสอบยืนยันจากภายนอก Microsoft บริษัทระบุจุดที่เชื่อว่าโมเดลแข็งแกร่งที่สุดและอ่อนแอที่สุด ซึ่งมีประโยชน์กว่าคะแนนพาดหัวข่าว โดยแข็งแกร่งที่สุดในด้านการให้เหตุผล การใช้กฎ และความทนทานต่อรูปแบบของพรอมป์ต์ แข่งขันได้ในด้านการจำแนกประเภท การค้นคืน ความเป็นธรรม การใช้เครื่องมือ และงานหลายภาษาส่วนใหญ่ และอ่อนแอกว่าในงานที่ต้องใช้ความรู้เฉพาะสาขา

ข้อจำกัดที่รายงานด้วยตนเองน่าอ่านก่อนรายการคุณสมบัติ คะแนนอาจเปลี่ยนแปลงไปตามถ้อยคำและการจัดลำดับตัวเลือก และคำถามที่ตั้งไว้ไม่ดีก็ยังให้คะแนนออกมา การสอบเทียบจะแม่นยำที่สุดกับประเภทงานที่คุ้นเคย อาจอาศัยความรู้ที่ล้าสมัย และไม่ให้คำอธิบายใด ๆ เกี่ยวกับความครอบคลุมหลายภาษา: มี 25 ภาษาที่ระบุว่ารองรับ รวมถึงภาษาญี่ปุ่น เกาหลี อาหรับ เวียดนาม ไทย ตุรกี ฮินดี เบงกาลี สวาฮิลี ฮีบรู เปอร์เซีย และยูเครน แต่ Microsoft ระบุว่าความครอบคลุม คุณภาพ และการสอบเทียบ "อาจแตกต่างกันไปตามภาษา" และระบุว่าภาษาที่ไม่ใช่ภาษาอังกฤษ — โดยเฉพาะภาษาที่มีทรัพยากรต่ำ — เป็นพื้นที่ที่ประสิทธิภาพต่ำ โมเดลพื้นฐาน Qwen3.5-9B รองรับมากกว่า 200 ภาษา; โมเดลที่ผ่านการฝึกเพิ่มเติมรองรับเพียงหนึ่งในสี่ของจำนวนนั้น

คุณได้มันมาอย่างไร และมันมีค่าใช้จ่ายเท่าไร

Microsoft-Decision-1 เผยแพร่เป็น API แบบโฮสต์ใน Microsoft Foundry ภายใต้กลุ่มผลิตภัณฑ์ "Direct from Azure" ไม่มีการเผยแพร่น้ำหนักโมเดล — นี่ไม่ใช่รุ่น open-weights และไม่มีที่เก็บ Hugging Face สำหรับดาวน์โหลด แอปพลิเคชันใดก็ตามที่สามารถส่งคำขอ HTTPS ได้สามารถผสานการทำงานโดยใช้ endpoints ของ Foundry และการรับรองความถูกต้อง Azure มาตรฐาน รายการการปรับใช้แสดงตัวเลือกแบบ serverless และ unified-endpoint บนแบบจ่ายตามการใช้งานจริงหรือ provisioned throughput แบบจอง, SKU มาตรฐาน, โดยปิดใช้งาน batch inference และการเปิดเผยข้อมูลการฝึกอบรมรายงานว่าชุดข้อมูลการฝึกอบรมถูกใช้ครั้งแรกในเดือนกันยายน 2026 โดยการเก็บรวบรวมยังดำเนินอยู่

ราคาไม่ได้ถูกเผยแพร่บนหน้าโมเดล ช่องราคาของแคตตาล็อกเชื่อมต่อไปยังหน้าราคาโมเดลของ Microsoft แทนที่จะแสดงอัตราอินพุตและเอาต์พุต ดังนั้นค่าใช้จ่ายต่อโทเคนของการเรียกใช้ Decision-1 จึงเป็นสิ่งที่คุณต้องไปค้นหาในหน้าราคาของ Azure หรืออ่านจากใบเรียกเก็บเงิน นั่นเป็นช่องว่างที่แท้จริงสำหรับใครก็ตามที่พยายามจำลองต้นทุนต่อการตัดสินใจในปริมาณมาก และมันคุ้มค่าที่จะพูดให้ชัดเจนแทนการประมาณการ สองสิ่งที่น่ารู้เมื่อคุณกำหนดราคามัน: 0% ของค่าใช้จ่ายคือโทเคนเอาต์พุต เพราะไม่มีเลย และการอนุมานแบบแบตช์ถูกปิด ดังนั้นคุณไม่สามารถตัดจำหน่ายการรันการให้คะแนนแบบกลุ่มผ่านช่องทางแบตช์ได้เหมือนที่คุณทำกับโมเดลแบบสร้างสรรค์

จุดที่ OrcaRouter เข้ามาเกี่ยวข้องในเรื่องนี้คืออีกด้านหนึ่งของการเรียก เราไม่ได้โฮสต์ Microsoft-Decision-1 และมันไม่ได้อยู่ในแคตตาล็อกของเรา — โมเดลที่คืนค่าความน่าจะเป็นแทนที่จะเป็นข้อความ ไม่ใช่โมเดลที่คุณจะส่ง chat completions ไปให้ สิ่งที่เรามีคือครึ่งหนึ่งของรูปแบบที่ทำการสร้างจริง ๆ: โมเดลที่เขียนเกณฑ์การให้คะแนน ร่างคำตอบที่เป็นตัวเลือก หรือสร้างการเรียกเครื่องมือที่ Decision-1 นำไปให้คะแนน โมเดลเหล่านั้นอยู่เบื้องหลังคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียว ซึ่งมีโมเดลมากกว่า 200 รายการในราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยมีมาร์กอัป 0% ดังนั้นหากผู้ขายลดราคาโมเดลผู้ตัดสิน ฝั่งเราก็จะมีผลทันทีในวันเดียวกัน หากคุณกำลังสร้างลูปการประเมินที่โมเดลหนึ่งเขียนและอีกโมเดลหนึ่งให้คะแนน การเรียกให้คะแนนจะไปที่ Microsoft และการเรียกเพื่อสร้างสามารถไปที่ใดก็ได้ — รวมถึงผ่าน routing DSL ซึ่งประกอบโมเดลหลายตัวเข้าด้วยกันเป็นการเรียกครั้งเดียวเมื่อคุณต้องการคณะกรรมการแทนที่จะเป็นผู้ตัดสินคนเดียว

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

ทำไม scorer จึงเป็นการเดิมพันที่แตกต่างจากแชตบอตที่ดีกว่า

รูปแบบที่ Microsoft กำลังขายอยู่นี้มีอยู่แล้วในที่เปิด Intern-Decision-4B ของ InternLM, d1-3B ของ Liquid AI, Laya ของ Convai Innovations และตระกูล Kev จาก Jared Palmer ต่างก็ส่งคืนการแจกแจงที่ปรับเทียบแล้วบนตัวเลือกที่ให้มาโดยไม่สร้างข้อความ และส่วนใหญ่เป็นเวต Apache-2.0 ที่คุณสามารถรันบนฮาร์ดแวร์ของตัวเองได้ฟรี ข้อเสนอของ Microsoft แตกต่างในสามประการที่ไม่ได้ขึ้นกับเบนช์มาร์ก: มันเป็น API แบบมีผู้ให้บริการจัดการที่มีการยืนยันตัวตน การเรียกเก็บเงิน และการกำกับดูแลของ Azure ติดมาด้วย จึงเข้ากับเส้นทางการจัดซื้อจัดจ้างขององค์กร ซึ่งการดาวน์โหลดจาก Hugging Face ไม่เข้ากับเส้นทางนั้น; ฐานของมันเป็นโมเดลขนาด 9B ซึ่งใหญ่กว่าส่วนใหญ่ในกลุ่มนั้น; และมันมาพร้อมการประเมิน Responsible AI และวิธีการประเมินที่มีเอกสารประกอบ ซึ่งบ่อยครั้งเป็นข้อกำหนดที่ต้องผ่านจริงสำหรับการนำไปใช้ในสภาพแวดล้อมที่มีการกำกับดูแล

สิ่งที่มันไม่มีมาด้วยคือตัวเลข เมื่อเทียบกับคู่แข่งแบบเปิดที่เผยแพร่คะแนน Brier และค่าความคลาดเคลื่อนของการสอบเทียบที่คาดหวัง — ตัวเลขสองตัวที่บอกคุณว่าเมื่อระบบบอก 0.8 มันหมายถึง 0.8 จริงหรือไม่ — Microsoft กลับเผยแพร่เพียงระเบียบวิธี แต่ไม่เผยแพร่ผลลัพธ์ จนกว่าจะมีการทดสอบการสอบเทียบโดยอิสระ วิธีใช้ Microsoft-Decision-1 ที่ป้องกันตัวได้คือวิธีที่เอกสารของมันเองแนะนำ: ตรวจสอบความถูกต้องกับข้อมูลที่เป็นตัวแทนของกรณีการใช้งานของคุณ กำหนดเกณฑ์จากต้นทุนของข้อผิดพลาดของคุณ ใส่ตัวเลือกการงดตอบไว้เสมอ สุ่มลำดับตัวเลือกในกรณีที่ลำดับอาจทำให้คำตอบเอนเอียง และมีมนุษย์อยู่ในวงจรสำหรับเรื่องที่มีนัยสำคัญ นั่นเป็นคำแนะนำที่ดีสำหรับระบบให้คะแนนใด ๆ และเป็นคำแนะนำที่ดีเป็นพิเศษสำหรับระบบที่ไม่มีใครนอกบริษัทเคยวัดการสอบเทียบของมัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube