
Microsoft-Decision-1 vs Liquid AI d1-3B: หน้าต่าง 32K เดียวกัน แต่สองความหมายที่ต่างกัน
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
อย่างน้อยสักครั้งที่สเปกตรงกัน Microsoft-Decision-1ซึ่งเปิดให้ใช้ทั่วไปบน Microsoft Foundry ตั้งแต่ 8 ตุลาคม 2026 รองรับบริบท 32,768 โทเคน เช่นเดียวกับ Liquid AI d1-3Bที่อัปโหลดขึ้น Hugging Face เมื่อวันที่ 5 ตุลาคม 2026 และถูกประกาศโดย Liquid AI สองวันถัดมา ทั้งคู่รับสถานะหนึ่งพร้อมชุดคำถามแบบมีชนิด — ใช่/ไม่ใช่, การเลือกจากตัวเลือกที่มีชื่อ, ตำแหน่งบนสเกลที่มีลำดับ — และทั้งคู่ตอบในฟอร์เวิร์ดพาสเดียวด้วยการแจกแจงความน่าจะเป็นแทนข้อความที่สร้างขึ้น; Laya, Intern-Decision-4B, Kev และคนอื่น ๆ ในกลุ่มเฉพาะทางนี้เห็นไม่ตรงกันเรื่องความยาวบริบท ดังนั้นนี่จึงเป็นคู่เดียวที่มิติด้านนั้นหายไป และการเปรียบเทียบต้องโต้แย้งกันด้วยปัจจัยอื่น
สิ่งที่แตกต่างออกไปนั้นกลายเป็นช่องทางอินพุต โมเดลของไมโครซอฟต์เป็นแบบข้อความล้วนอย่างชัดเจน: มัน "ไม่รับหรือสร้างเนื้อหาภาพ เสียง หรือวิดีโอ" ส่วนของ Liquid AI มีตัวเข้ารหัสภาพ SigLIP2 NaFlex ขนาด 400 ล้านพารามิเตอร์บนแกนภาษาขนาด 2.6B พารามิเตอร์ และมีพารามิเตอร์รวมทั้งหมด 3.12 พันล้านพารามิเตอร์ และมันถูกสร้างขึ้นมาเพื่อสิ่งที่ไมโครซอฟต์ตัดออกไปพอดี — การให้คะแนนภาพหน้าจอ ฟอร์มที่สแกน หรือเฟรมจากกล้องเทียบกับคำถามที่กำหนดไว้ ความแตกต่างนั้น บวกกับความต่างด้านสัญญาอนุญาตที่ไม่เกี่ยวกับความสามารถเลย คือทั้งหมดของการเปรียบเทียบครั้งนี้
ตรงที่ทั้งสองเห็นตรงกัน ซึ่งมากกว่าที่คุณจะ
• หน้าต่างบริบท — 32,768 โทเคนสำหรับ Microsoft-Decision-1 และ 32,768 โทเคนสำหรับ Liquid AI d1-3B
• รูปแบบเอาต์พุต — ความน่าจะเป็นที่ปรับเทียบแล้วสำหรับตัวเลือกที่ให้มา ทั้งสองโมเดลไม่ได้สร้างข้อความ และตัวนับการใช้งานของ Liquid AI รายงานข้อเท็จจริงนี้เป็น output_tokens: 0.
• ประเภทคำถาม — ทั้งแบบเลือกเอกสาร คะแนนแบบเรียงลำดับ และแบบไบนารีใช่/ไม่ใช่ และทั้งสองแบบให้คุณกำหนดชุดตัวเลือกต่อคำขอได้ แทนที่จะต้องฝึกหัวคำศัพท์ใหม่
• การงดตอบ — Microsoft ระบุตัวเลือกการงดตอบอย่างชัดเจน เช่น "ไม่สามารถบอกได้"; สคีมา Decision Index ของ Liquid AI ก็รองรับเช่นเดียวกันผ่านชุดตัวเลือกของมัน
• การอนุมานแบบรอบเดียว — หนึ่งการเรียกต่อการตัดสินใจในทั้งสองฝั่ง ซึ่งเป็นสิ่งที่ทำให้ไม่ว่าจะเลือกวิธีใดก็ใช้งานได้จริงในปริมาณงานระดับไปป์ไลน์
การที่สองโมเดลเห็นตรงกันในข้อจำกัดสองข้อที่ยากที่สุดของเฉพาะทางนี้ถือว่าน่าหยุดคิด หน้าต่าง 32K คือสิ่งที่ทำให้ตัวให้คะแนนการตัดสินใจใช้งานได้กับสัญญาฉบับเต็ม นโยบายหลายหน้า หรือเธรดสนับสนุนยาว ๆ ส่วนเช็กพอยต์ Laya ภาษาอังกฤษขนาด 512 โทเคนและข้อจำกัดจำนวนคำถามต่อการเรียกใช้ของ Intern-Decision-4B ทำไม่ได้ ถ้าข้อมูลนำเข้าของคุณสั้น สิ่งในสาขานี้ส่วนใหญ่ใช้แทนกันได้ และการตัดสินใจจะอยู่ที่โฮสติ้ง ถ้าข้อมูลนำเข้าของคุณยาว ตัวเลือกในสาขานี้จะแคบลงเหลือสองตัวนี้
ความรู้สึกที่หนึ่งในพวกเขาเท่านั้นที่มี
Liquid AI d1-3B เป็นมัลติโมดัล และแผนผังโมเดลก็แสดงสายเลือดให้เห็นอย่างชัดเจน: LFM2.5-2.6B-Base จากนั้น LFM2.5-VL-3B จากนั้น d1-3B ที่ผ่านการฝึกภายหลังสำหรับการตัดสินใจที่ปรับเทียบแล้วในรอบเดียว รูปภาพเข้าผ่านตัวเข้ารหัส SigLIP2 NaFlex และการ์ดรายงานค่าเฉลี่ย 74.1 จากเกณฑ์มาตรฐานรูปภาพสาธารณะสิบเอ็ดรายการ เทียบกับ 73.9 สำหรับโมเดลวิชันพื้นฐาน — ดังนั้นการปรับแต่งการตัดสินใจจึงไม่ได้ทำให้คุณภาพการมองเห็นลดลง นอกจากนี้ยังรายงานการทดลองย้อนกลับ: ถอดรูปภาพออกแล้ว คำถามเดียวกันลดลงเหลือ 45.1 ซึ่งเป็นหลักฐานที่ชัดเจนที่สุดที่คุณจะได้ว่า ช่องทางการรับรู้เป็นส่วนที่รับน้ำหนักจริง ไม่ใช่แค่ของประดับ
Microsoft-Decision-1 ไม่มีสิ่งที่เทียบเคียงได้ และการละเว้นนี้เป็นเจตนา ไม่ใช่เพราะยังทำไม่เสร็จ การ์ดของ Microsoft ระบุการใช้งานที่อยู่นอกขอบเขต ได้แก่ การสร้างข้อความ การตอบคำถามแบบเปิดกว้าง การสนทนา การแปล และการสรุปความ และระบุแยกต่างหากว่าโมเดลนี้รองรับเฉพาะข้อความ สำหรับไปป์ไลน์ที่ต้องให้คะแนนภาพหน้าจอของแบบฟอร์มเทียบกับเกณฑ์รูบริก หรือตัดสินว่าภาพจากกล้องมีเหตุการณ์ด้านความปลอดภัยหรือไม่ นั่นคือจุดหยุดที่แท้จริง — ไม่มีวิศวกรรมพรอมป์ต์ใดกู้คืนมอดาลิตีที่โมเดลไม่เคยได้รับมาได้
จำนวนภาษากลับเป็นไปในทางตรงกันข้าม และนี่คือความแตกต่างที่แท้จริงประการที่สอง Microsoft-Decision-1 ระบุ 25 ภาษาที่รองรับ และบริษัทก็เปิดเผยอย่างตรงไปตรงมาว่าความครอบคลุม คุณภาพ และการปรับเทียบ "อาจแตกต่างกันไปตามภาษา" โดยระบุว่าภาษาที่ไม่ใช่ภาษาอังกฤษและโดยเฉพาะภาษาที่มีทรัพยากรต่ำเป็นพื้นที่ที่ประสิทธิภาพต่ำกว่า Liquid AI d1-3B ระบุ 16 ภาษา ในด้านความกว้าง Microsoft เหนือกว่าในทางทฤษฎี แต่ในด้านความซื่อสัตย์เกี่ยวกับความหมายของความกว้าง ผู้ขายทั้งสองรายพูดคล้ายกัน และไม่มีรายใดเผยแพร่การปรับเทียบรายภาษา

แท็บ benchmark อีกแล้ว
หน้า Foundry ของ Microsoft-Decision-1 มีแท็บ Benchmarks พร้อมส่วนระเบียบวิธีและไม่มีตัวเลขใด ๆ: ชุดทดสอบมาตรฐานการตัดสินใจสาธารณะและของชุมชน รวมถึงชุดข้อมูลภายในแบบ held-out เมตริกที่ครอบคลุมความแม่นยำและความคลาดเคลื่อนของการปรับเทียบ มีการสลับลำดับตัวเลือก การทดสอบทางสถิติแบบจับคู่ และข้อกล่าวอ้างว่าโมเดลนี้ "มีประสิทธิภาพทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และเหนือกว่าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" ไม่มีอะไรให้ตรวจสอบ ไม่มีอะไรให้ทำซ้ำ
Liquid AI d1-3B เผยแพร่คะแนน 48.57 บน Decision Index 0.2.1 — และข้อกำหนดกำกับสำคัญยิ่งกว่าตัวเลข เพราะ Decision Index เป็นดัชนีของ Liquid AI เอง และ d1-3B ก็เป็นโมเดลของ Liquid AI เอง มันเป็นผลที่ผู้ขายให้คะแนนบนเกณฑ์มาตรฐานที่ผู้ขายจัดทำขึ้น โดยบริษัทวางตำแหน่งว่าเป็นโมเดลตัดสินใจที่ดีที่สุดในกลุ่มต่ำกว่า 10B และนำหน้าโมเดล 35B บนมาตรวัดเดียวกัน ให้ถือ 48.57 เป็นข้อกล่าวอ้างเชิงทิศทาง ไม่ใช่ตัวเลขที่ผ่านการตรวจสอบ ถัดจากนั้น การ์ดระบุการประเมินรูปแบบการตัดสินใจภายในที่มีค่าเฉลี่ย 77.1, SQuAD 2.0 ที่ 85.3, PAWS-X ที่ 76.9 และ DecisionBench 71.8 — ซึ่งทั้งหมดเป็นการรายงานเอง และการวางกรอบว่า "ต่ำกว่า 10B" ก็เป็นข้อกำหนดกำกับที่แท้จริง ไม่ใช่การหลบเลี่ยง เพราะโมเดลนี้มีขนาด 3.12B
ดังนั้น คำถามเรื่องการปรับเทียบจึงได้คำตอบในแบบเดียวกับที่เกิดขึ้นทั่วทั้งสาขานี้: Liquid AI ให้ตัวเลขที่สร้างจากสเกลของตัวเอง Microsoft ให้ระเบียบวิธีแต่ไม่มีตัวเลข และทั้งสองก็ไม่ได้ให้การวัดจากบุคคลที่สามที่เป็นอิสระแก่คุณ ตัวเลขการปรับเทียบเพียงตัวเดียวที่จะมีความสำคัญต่อการนำไปใช้งานของคุณ คือตัวเลขที่คุณคำนวณบนข้อมูลที่มีป้ายกำกับของคุณเอง

การให้บริการ ใบอนุญาต และสิ่งที่คุณกำลังซื้อจริง ๆ
ความหน่วงของ d1-3B ถูกเปิดเผย และนั่นคือเหตุผลที่โมเดลนี้มีอยู่ 8 มิลลิวินาทีต่อการตัดสินใจบน RTX 4090, 9 บน AMD MI325X ด้วยปริมาณงานแบบ packed ที่ 475 และ 1,106 ต่อวินาทีที่ 64 สถานะ บนฮาร์ดแวร์ Edge: 30 มิลลิวินาทีบน Apple M5 Pro, 16 มิลลิวินาทีบน Jetson AGX Thor, 26 มิลลิวินาทีบน Jetson AGX Orin 64 GB, 50 มิลลิวินาทีบน Orin Nano Microsoft-Decision-1 ไม่เปิดเผยตัวเลขความหน่วงเลย และตัวเลือกที่มีมาแต่การออกแบบ — Foundry API แบบโฮสต์ที่คิดค่าบริการตามการใช้งานจริงหรือ provisioned throughput แบบจองไว้ โดยปิดการทำอินเฟอเรนซ์แบบแบตช์ — หมายความว่าคุณต้องวัดผ่านการปรับใช้ของคุณเอง นั่นไม่ใช่ช่องว่างเล็ก ๆ สำหรับโมเดลที่จุดประสงค์ทั้งหมดคือการถูกเรียกหนึ่งครั้งต่อเอกสารที่ดึงมาหรือการดำเนินการที่เสนอ
สัญญาอนุญาตคือจุดที่ทั้งสองแตกต่างกันอย่างน่าประหลาดใจ Liquid AI d1-3B ถูกติดแท็กเป็น lfm1.0 ไม่ใช่ Apache 2.0 — สัญญาอนุญาตตระกูลเดียวกับส่วนที่เหลือของสาย LFM ของ Liquid ซึ่งมีเงื่อนไขการใช้งานที่สัญญาอนุญาตแบบผ่อนปรนไม่มี หากการตรวจสอบทางกฎหมายของคุณตีความว่า "เข้ากันได้กับ OpenAI โดยไม่มีเงื่อนไขผูกมัด" นี่ไม่ใช่แบบนั้น และควรอ่านก่อนที่โมเดลจะเปิดตัว ไม่ใช่หลังจากนั้น Microsoft-Decision-1 ไม่มีค่าน้ำหนักใด ๆ เลย: มันเป็นเอนด์พอยต์ที่โฮสต์อยู่ภายใต้พอร์ตโฟลิโอ Direct from Azure โดยมีการยืนยันตัวตนของ Azure การเรียกเก็บเงินแบบรวม ไม่มีการดาวน์โหลด และคำถามเรื่องสัญญาอนุญาตถูกแทนที่ด้วยข้อตกลงการให้บริการ ทั้งสองโมเดลไม่สามารถทำไฟน์ทูนผ่านเส้นทางที่ผู้ขายระบุในเอกสารได้ ซึ่งเป็นข้อจำกัดที่คมชัดที่สุดสำหรับโมเดลตัดสินใจ — ตัวให้คะแนนที่คุณปรับให้เข้ากับป้ายกำกับของคุณเองไม่ได้ ก็คือตัวให้คะแนนที่คุณแก้ไขโหมดข้อผิดพลาดของมันไม่ได้ ทำได้เพียงหลบเลี่ยงไปรอบ ๆ
การกำหนดเส้นทางเลี่ยงโมเดลเหล่านี้คือจุดที่ OrcaRouter เข้ามาเกี่ยวข้องในรูปแบบนี้ และอยู่เพียงด้านเดียวของมันเท่านั้น เราไม่ได้โฮสต์ทั้ง Microsoft-Decision-1 และ Liquid AI d1-3B: ทั้งสองไม่ได้คืนข้อความ ทั้งสองไม่ได้อยู่ในแคตตาล็อกของเรา และ endpoint สำหรับให้คะแนนความน่าจะเป็นก็ไม่ใช่เป้าหมายแบบ chat-completions สิ่งที่เรามีคือครึ่งหนึ่งที่ใช้สร้างของลูป — โมเดลที่ร่างคำตอบที่ตัวให้คะแนนของคุณจะให้เกรด ดึงฟิลด์ที่ตัวให้คะแนนของคุณจะตัดสิน หรือเสนอการดำเนินการที่ตัวให้คะแนนของคุณจะอนุมัติ นั่นคือโมเดลมากกว่า 200 รายการภายใต้คีย์เดียวที่เข้ากันได้กับ OpenAI ในราคาตามที่ผู้ให้บริการประกาศไว้ ส่งผ่านโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ให้บริการเปลี่ยนราคา ฝั่งเราก็อัปเดตทันทีในวันเดียวกัน และการ failover อัตโนมัติครอบคลุมการเรียกสร้างในลูปที่ไม่มีความหน่วงเหลือพอจะลองใหม่

สองตัวเลือกที่ชัดเจน และอีกอันที่ไม่ใกล้เคียง
เลือก Liquid AI d1-3B หากมีสิ่งใดในไปป์ไลน์ของคุณที่เป็นภาพ การคัดแยกสกรีนช็อต การดึงข้อมูลจากฟอร์ม การจัดเส้นทาง QA เชิงภาพ ผู้กลั่นกรองที่ให้คะแนนเฟรมจากกล้อง — Microsoft-Decision-1 ไม่สามารถถูกทำให้ทำสิ่งนี้ได้ และ d1-3B ถูกสร้างขึ้นมาเพื่อสิ่งนี้ โดยมีเบนช์มาร์กด้านวิชันที่เผยแพร่เพื่อสนับสนุนข้อกล่าวอ้าง เลือกใช้เช่นกันหากคุณต้องการการทำอินเฟอเรนซ์ที่เอดจ์ซึ่งวัดได้เป็นสิบมิลลิวินาทีบน Jetson หรือแล็ปท็อป หากคุณต้องการให้โมเดลอยู่บนฮาร์ดแวร์ของคุณเอง หรือหากใบอนุญาตที่คุณอ่านได้ก็เพียงพอสำหรับที่ปรึกษากฎหมายของคุณ
เลือก Microsoft-Decision-1หากอินพุตของคุณเป็นข้อความ เอกสารของคุณยาว ด่านของคุณคือการจัดซื้อจัดจ้าง — การยืนยันตัวตน Azure การเรียกเก็บเงินแบบรวม การประเมิน Responsible AI ผู้ขายที่ต้อง escalate ไปหา — หรือทราฟฟิกของคุณครอบคลุมมากกว่า 16 ภาษาที่ d1-3B ระบุไว้ ยอมรับว่าการที่มันไม่มีตัวเลข latency และไม่มีตาราง benchmark หมายความว่าสองสัปดาห์แรกของคุณกับมันคือการวัด ไม่ใช่การผสานรวม
กรณีเดียวที่ไม่ได้สูสีเลยคืองานด้านมัลติโมดัล เพราะในกรณีนั้น ทางเลือกได้ถูกกำหนดไว้แล้วตั้งแต่ตอนที่ Microsoft เขียนคำว่า "text-only" ลงใน model card
