การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Microsoft-Decision-1 กับ Liquid AI d1-3B โดยมีคำบรรยายว่า 'โมเดลการตัดสินใจเพียงสองตัวเดียวที่เห็นตรงกันเรื่องหน้าต่างบริบท' พร้อมชิปที่ระบุว่า 32,768 โทเคนทั้งสองแบบ, ข้อความล้วนกับข้อความ รูปภาพ และเสียง, 25 ภาษากับ 16 ภาษา, API แบบโฮสต์กับน้ำหนัก lfm1.0 และส่วนท้ายระบุว่าตัวเลขของผู้ให้บริการทั้งสองรายเป็นข้อมูลที่รายงานเองและยังไม่ได้ตรวจสอบ
Guides & Insights

Microsoft-Decision-1 vs Liquid AI d1-3B: หน้าต่าง 32K เดียวกัน แต่สองความหมายที่ต่างกัน

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

อย่างน้อยสักครั้งที่สเปกตรงกัน Microsoft-Decision-1ซึ่งเปิดให้ใช้ทั่วไปบน Microsoft Foundry ตั้งแต่ 8 ตุลาคม 2026 รองรับบริบท 32,768 โทเคน เช่นเดียวกับ Liquid AI d1-3Bที่อัปโหลดขึ้น Hugging Face เมื่อวันที่ 5 ตุลาคม 2026 และถูกประกาศโดย Liquid AI สองวันถัดมา ทั้งคู่รับสถานะหนึ่งพร้อมชุดคำถามแบบมีชนิด — ใช่/ไม่ใช่, การเลือกจากตัวเลือกที่มีชื่อ, ตำแหน่งบนสเกลที่มีลำดับ — และทั้งคู่ตอบในฟอร์เวิร์ดพาสเดียวด้วยการแจกแจงความน่าจะเป็นแทนข้อความที่สร้างขึ้น; Laya, Intern-Decision-4B, Kev และคนอื่น ๆ ในกลุ่มเฉพาะทางนี้เห็นไม่ตรงกันเรื่องความยาวบริบท ดังนั้นนี่จึงเป็นคู่เดียวที่มิติด้านนั้นหายไป และการเปรียบเทียบต้องโต้แย้งกันด้วยปัจจัยอื่น

สิ่งที่แตกต่างออกไปนั้นกลายเป็นช่องทางอินพุต โมเดลของไมโครซอฟต์เป็นแบบข้อความล้วนอย่างชัดเจน: มัน "ไม่รับหรือสร้างเนื้อหาภาพ เสียง หรือวิดีโอ" ส่วนของ Liquid AI มีตัวเข้ารหัสภาพ SigLIP2 NaFlex ขนาด 400 ล้านพารามิเตอร์บนแกนภาษาขนาด 2.6B พารามิเตอร์ และมีพารามิเตอร์รวมทั้งหมด 3.12 พันล้านพารามิเตอร์ และมันถูกสร้างขึ้นมาเพื่อสิ่งที่ไมโครซอฟต์ตัดออกไปพอดี — การให้คะแนนภาพหน้าจอ ฟอร์มที่สแกน หรือเฟรมจากกล้องเทียบกับคำถามที่กำหนดไว้ ความแตกต่างนั้น บวกกับความต่างด้านสัญญาอนุญาตที่ไม่เกี่ยวกับความสามารถเลย คือทั้งหมดของการเปรียบเทียบครั้งนี้

ตรงที่ทั้งสองเห็นตรงกัน ซึ่งมากกว่าที่คุณจะ

• หน้าต่างบริบท — 32,768 โทเคนสำหรับ Microsoft-Decision-1 และ 32,768 โทเคนสำหรับ Liquid AI d1-3B

• รูปแบบเอาต์พุต — ความน่าจะเป็นที่ปรับเทียบแล้วสำหรับตัวเลือกที่ให้มา ทั้งสองโมเดลไม่ได้สร้างข้อความ และตัวนับการใช้งานของ Liquid AI รายงานข้อเท็จจริงนี้เป็น output_tokens: 0.

• ประเภทคำถาม — ทั้งแบบเลือกเอกสาร คะแนนแบบเรียงลำดับ และแบบไบนารีใช่/ไม่ใช่ และทั้งสองแบบให้คุณกำหนดชุดตัวเลือกต่อคำขอได้ แทนที่จะต้องฝึกหัวคำศัพท์ใหม่

• การงดตอบ — Microsoft ระบุตัวเลือกการงดตอบอย่างชัดเจน เช่น "ไม่สามารถบอกได้"; สคีมา Decision Index ของ Liquid AI ก็รองรับเช่นเดียวกันผ่านชุดตัวเลือกของมัน

• การอนุมานแบบรอบเดียว — หนึ่งการเรียกต่อการตัดสินใจในทั้งสองฝั่ง ซึ่งเป็นสิ่งที่ทำให้ไม่ว่าจะเลือกวิธีใดก็ใช้งานได้จริงในปริมาณงานระดับไปป์ไลน์

การที่สองโมเดลเห็นตรงกันในข้อจำกัดสองข้อที่ยากที่สุดของเฉพาะทางนี้ถือว่าน่าหยุดคิด หน้าต่าง 32K คือสิ่งที่ทำให้ตัวให้คะแนนการตัดสินใจใช้งานได้กับสัญญาฉบับเต็ม นโยบายหลายหน้า หรือเธรดสนับสนุนยาว ๆ ส่วนเช็กพอยต์ Laya ภาษาอังกฤษขนาด 512 โทเคนและข้อจำกัดจำนวนคำถามต่อการเรียกใช้ของ Intern-Decision-4B ทำไม่ได้ ถ้าข้อมูลนำเข้าของคุณสั้น สิ่งในสาขานี้ส่วนใหญ่ใช้แทนกันได้ และการตัดสินใจจะอยู่ที่โฮสติ้ง ถ้าข้อมูลนำเข้าของคุณยาว ตัวเลือกในสาขานี้จะแคบลงเหลือสองตัวนี้

ความรู้สึกที่หนึ่งในพวกเขาเท่านั้นที่มี

Liquid AI d1-3B เป็นมัลติโมดัล และแผนผังโมเดลก็แสดงสายเลือดให้เห็นอย่างชัดเจน: LFM2.5-2.6B-Base จากนั้น LFM2.5-VL-3B จากนั้น d1-3B ที่ผ่านการฝึกภายหลังสำหรับการตัดสินใจที่ปรับเทียบแล้วในรอบเดียว รูปภาพเข้าผ่านตัวเข้ารหัส SigLIP2 NaFlex และการ์ดรายงานค่าเฉลี่ย 74.1 จากเกณฑ์มาตรฐานรูปภาพสาธารณะสิบเอ็ดรายการ เทียบกับ 73.9 สำหรับโมเดลวิชันพื้นฐาน — ดังนั้นการปรับแต่งการตัดสินใจจึงไม่ได้ทำให้คุณภาพการมองเห็นลดลง นอกจากนี้ยังรายงานการทดลองย้อนกลับ: ถอดรูปภาพออกแล้ว คำถามเดียวกันลดลงเหลือ 45.1 ซึ่งเป็นหลักฐานที่ชัดเจนที่สุดที่คุณจะได้ว่า ช่องทางการรับรู้เป็นส่วนที่รับน้ำหนักจริง ไม่ใช่แค่ของประดับ

Microsoft-Decision-1 ไม่มีสิ่งที่เทียบเคียงได้ และการละเว้นนี้เป็นเจตนา ไม่ใช่เพราะยังทำไม่เสร็จ การ์ดของ Microsoft ระบุการใช้งานที่อยู่นอกขอบเขต ได้แก่ การสร้างข้อความ การตอบคำถามแบบเปิดกว้าง การสนทนา การแปล และการสรุปความ และระบุแยกต่างหากว่าโมเดลนี้รองรับเฉพาะข้อความ สำหรับไปป์ไลน์ที่ต้องให้คะแนนภาพหน้าจอของแบบฟอร์มเทียบกับเกณฑ์รูบริก หรือตัดสินว่าภาพจากกล้องมีเหตุการณ์ด้านความปลอดภัยหรือไม่ นั่นคือจุดหยุดที่แท้จริง — ไม่มีวิศวกรรมพรอมป์ต์ใดกู้คืนมอดาลิตีที่โมเดลไม่เคยได้รับมาได้

จำนวนภาษากลับเป็นไปในทางตรงกันข้าม และนี่คือความแตกต่างที่แท้จริงประการที่สอง Microsoft-Decision-1 ระบุ 25 ภาษาที่รองรับ และบริษัทก็เปิดเผยอย่างตรงไปตรงมาว่าความครอบคลุม คุณภาพ และการปรับเทียบ "อาจแตกต่างกันไปตามภาษา" โดยระบุว่าภาษาที่ไม่ใช่ภาษาอังกฤษและโดยเฉพาะภาษาที่มีทรัพยากรต่ำเป็นพื้นที่ที่ประสิทธิภาพต่ำกว่า Liquid AI d1-3B ระบุ 16 ภาษา ในด้านความกว้าง Microsoft เหนือกว่าในทางทฤษฎี แต่ในด้านความซื่อสัตย์เกี่ยวกับความหมายของความกว้าง ผู้ขายทั้งสองรายพูดคล้ายกัน และไม่มีรายใดเผยแพร่การปรับเทียบรายภาษา

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

แท็บ benchmark อีกแล้ว

หน้า Foundry ของ Microsoft-Decision-1 มีแท็บ Benchmarks พร้อมส่วนระเบียบวิธีและไม่มีตัวเลขใด ๆ: ชุดทดสอบมาตรฐานการตัดสินใจสาธารณะและของชุมชน รวมถึงชุดข้อมูลภายในแบบ held-out เมตริกที่ครอบคลุมความแม่นยำและความคลาดเคลื่อนของการปรับเทียบ มีการสลับลำดับตัวเลือก การทดสอบทางสถิติแบบจับคู่ และข้อกล่าวอ้างว่าโมเดลนี้ "มีประสิทธิภาพทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และเหนือกว่าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" ไม่มีอะไรให้ตรวจสอบ ไม่มีอะไรให้ทำซ้ำ

Liquid AI d1-3B เผยแพร่คะแนน 48.57 บน Decision Index 0.2.1 — และข้อกำหนดกำกับสำคัญยิ่งกว่าตัวเลข เพราะ Decision Index เป็นดัชนีของ Liquid AI เอง และ d1-3B ก็เป็นโมเดลของ Liquid AI เอง มันเป็นผลที่ผู้ขายให้คะแนนบนเกณฑ์มาตรฐานที่ผู้ขายจัดทำขึ้น โดยบริษัทวางตำแหน่งว่าเป็นโมเดลตัดสินใจที่ดีที่สุดในกลุ่มต่ำกว่า 10B และนำหน้าโมเดล 35B บนมาตรวัดเดียวกัน ให้ถือ 48.57 เป็นข้อกล่าวอ้างเชิงทิศทาง ไม่ใช่ตัวเลขที่ผ่านการตรวจสอบ ถัดจากนั้น การ์ดระบุการประเมินรูปแบบการตัดสินใจภายในที่มีค่าเฉลี่ย 77.1, SQuAD 2.0 ที่ 85.3, PAWS-X ที่ 76.9 และ DecisionBench 71.8 — ซึ่งทั้งหมดเป็นการรายงานเอง และการวางกรอบว่า "ต่ำกว่า 10B" ก็เป็นข้อกำหนดกำกับที่แท้จริง ไม่ใช่การหลบเลี่ยง เพราะโมเดลนี้มีขนาด 3.12B

ดังนั้น คำถามเรื่องการปรับเทียบจึงได้คำตอบในแบบเดียวกับที่เกิดขึ้นทั่วทั้งสาขานี้: Liquid AI ให้ตัวเลขที่สร้างจากสเกลของตัวเอง Microsoft ให้ระเบียบวิธีแต่ไม่มีตัวเลข และทั้งสองก็ไม่ได้ให้การวัดจากบุคคลที่สามที่เป็นอิสระแก่คุณ ตัวเลขการปรับเทียบเพียงตัวเดียวที่จะมีความสำคัญต่อการนำไปใช้งานของคุณ คือตัวเลขที่คุณคำนวณบนข้อมูลที่มีป้ายกำกับของคุณเอง

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

การให้บริการ ใบอนุญาต และสิ่งที่คุณกำลังซื้อจริง ๆ

ความหน่วงของ d1-3B ถูกเปิดเผย และนั่นคือเหตุผลที่โมเดลนี้มีอยู่ 8 มิลลิวินาทีต่อการตัดสินใจบน RTX 4090, 9 บน AMD MI325X ด้วยปริมาณงานแบบ packed ที่ 475 และ 1,106 ต่อวินาทีที่ 64 สถานะ บนฮาร์ดแวร์ Edge: 30 มิลลิวินาทีบน Apple M5 Pro, 16 มิลลิวินาทีบน Jetson AGX Thor, 26 มิลลิวินาทีบน Jetson AGX Orin 64 GB, 50 มิลลิวินาทีบน Orin Nano Microsoft-Decision-1 ไม่เปิดเผยตัวเลขความหน่วงเลย และตัวเลือกที่มีมาแต่การออกแบบ — Foundry API แบบโฮสต์ที่คิดค่าบริการตามการใช้งานจริงหรือ provisioned throughput แบบจองไว้ โดยปิดการทำอินเฟอเรนซ์แบบแบตช์ — หมายความว่าคุณต้องวัดผ่านการปรับใช้ของคุณเอง นั่นไม่ใช่ช่องว่างเล็ก ๆ สำหรับโมเดลที่จุดประสงค์ทั้งหมดคือการถูกเรียกหนึ่งครั้งต่อเอกสารที่ดึงมาหรือการดำเนินการที่เสนอ

สัญญาอนุญาตคือจุดที่ทั้งสองแตกต่างกันอย่างน่าประหลาดใจ Liquid AI d1-3B ถูกติดแท็กเป็น lfm1.0 ไม่ใช่ Apache 2.0 — สัญญาอนุญาตตระกูลเดียวกับส่วนที่เหลือของสาย LFM ของ Liquid ซึ่งมีเงื่อนไขการใช้งานที่สัญญาอนุญาตแบบผ่อนปรนไม่มี หากการตรวจสอบทางกฎหมายของคุณตีความว่า "เข้ากันได้กับ OpenAI โดยไม่มีเงื่อนไขผูกมัด" นี่ไม่ใช่แบบนั้น และควรอ่านก่อนที่โมเดลจะเปิดตัว ไม่ใช่หลังจากนั้น Microsoft-Decision-1 ไม่มีค่าน้ำหนักใด ๆ เลย: มันเป็นเอนด์พอยต์ที่โฮสต์อยู่ภายใต้พอร์ตโฟลิโอ Direct from Azure โดยมีการยืนยันตัวตนของ Azure การเรียกเก็บเงินแบบรวม ไม่มีการดาวน์โหลด และคำถามเรื่องสัญญาอนุญาตถูกแทนที่ด้วยข้อตกลงการให้บริการ ทั้งสองโมเดลไม่สามารถทำไฟน์ทูนผ่านเส้นทางที่ผู้ขายระบุในเอกสารได้ ซึ่งเป็นข้อจำกัดที่คมชัดที่สุดสำหรับโมเดลตัดสินใจ — ตัวให้คะแนนที่คุณปรับให้เข้ากับป้ายกำกับของคุณเองไม่ได้ ก็คือตัวให้คะแนนที่คุณแก้ไขโหมดข้อผิดพลาดของมันไม่ได้ ทำได้เพียงหลบเลี่ยงไปรอบ ๆ

การกำหนดเส้นทางเลี่ยงโมเดลเหล่านี้คือจุดที่ OrcaRouter เข้ามาเกี่ยวข้องในรูปแบบนี้ และอยู่เพียงด้านเดียวของมันเท่านั้น เราไม่ได้โฮสต์ทั้ง Microsoft-Decision-1 และ Liquid AI d1-3B: ทั้งสองไม่ได้คืนข้อความ ทั้งสองไม่ได้อยู่ในแคตตาล็อกของเรา และ endpoint สำหรับให้คะแนนความน่าจะเป็นก็ไม่ใช่เป้าหมายแบบ chat-completions สิ่งที่เรามีคือครึ่งหนึ่งที่ใช้สร้างของลูป — โมเดลที่ร่างคำตอบที่ตัวให้คะแนนของคุณจะให้เกรด ดึงฟิลด์ที่ตัวให้คะแนนของคุณจะตัดสิน หรือเสนอการดำเนินการที่ตัวให้คะแนนของคุณจะอนุมัติ นั่นคือโมเดลมากกว่า 200 รายการภายใต้คีย์เดียวที่เข้ากันได้กับ OpenAI ในราคาตามที่ผู้ให้บริการประกาศไว้ ส่งผ่านโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ให้บริการเปลี่ยนราคา ฝั่งเราก็อัปเดตทันทีในวันเดียวกัน และการ failover อัตโนมัติครอบคลุมการเรียกสร้างในลูปที่ไม่มีความหน่วงเหลือพอจะลองใหม่

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

สองตัวเลือกที่ชัดเจน และอีกอันที่ไม่ใกล้เคียง

เลือก Liquid AI d1-3B หากมีสิ่งใดในไปป์ไลน์ของคุณที่เป็นภาพ การคัดแยกสกรีนช็อต การดึงข้อมูลจากฟอร์ม การจัดเส้นทาง QA เชิงภาพ ผู้กลั่นกรองที่ให้คะแนนเฟรมจากกล้อง — Microsoft-Decision-1 ไม่สามารถถูกทำให้ทำสิ่งนี้ได้ และ d1-3B ถูกสร้างขึ้นมาเพื่อสิ่งนี้ โดยมีเบนช์มาร์กด้านวิชันที่เผยแพร่เพื่อสนับสนุนข้อกล่าวอ้าง เลือกใช้เช่นกันหากคุณต้องการการทำอินเฟอเรนซ์ที่เอดจ์ซึ่งวัดได้เป็นสิบมิลลิวินาทีบน Jetson หรือแล็ปท็อป หากคุณต้องการให้โมเดลอยู่บนฮาร์ดแวร์ของคุณเอง หรือหากใบอนุญาตที่คุณอ่านได้ก็เพียงพอสำหรับที่ปรึกษากฎหมายของคุณ

เลือก Microsoft-Decision-1หากอินพุตของคุณเป็นข้อความ เอกสารของคุณยาว ด่านของคุณคือการจัดซื้อจัดจ้าง — การยืนยันตัวตน Azure การเรียกเก็บเงินแบบรวม การประเมิน Responsible AI ผู้ขายที่ต้อง escalate ไปหา — หรือทราฟฟิกของคุณครอบคลุมมากกว่า 16 ภาษาที่ d1-3B ระบุไว้ ยอมรับว่าการที่มันไม่มีตัวเลข latency และไม่มีตาราง benchmark หมายความว่าสองสัปดาห์แรกของคุณกับมันคือการวัด ไม่ใช่การผสานรวม

กรณีเดียวที่ไม่ได้สูสีเลยคืองานด้านมัลติโมดัล เพราะในกรณีนั้น ทางเลือกได้ถูกกำหนดไว้แล้วตั้งแต่ตอนที่ Microsoft เขียนคำว่า "text-only" ลงใน model card

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube