การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Microsoft-Decision-1 เทียบกับ Intern-Decision-4B พร้อมคำบรรยายใต้ภาพว่า 'ผู้ให้คะแนนสองราย รายหนึ่งมีตัวเลข และอีกรายหนึ่งไม่มี' โดยมีชิปที่ระบุ 9B เทียบกับ 4B, API แบบโฮสต์ เทียบกับน้ำหนักแบบเปิด, ไม่มีเกณฑ์มาตรฐานที่เผยแพร่ เทียบกับ Brier 0.347 และ ECE 0.065 และส่วนท้ายระบุแหล่งที่มาโดยระบุว่าตัวเลขของ Microsoft ยังไม่ถูกทำซ้ำ และตัวเลขของ InternLM เป็นข้อมูลที่ผู้ขายรายงาน
Guides & Insights

Microsoft-Decision-1 กับ Intern-Decision-4B: ตัวหนึ่งเผยแพร่การสอบเทียบของตน อีกตัวหนึ่งเผยแพร่ระเบียบวิธีของตน

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วางMicrosoft-Decision-1 ไว้ข้าง ๆ Intern-Decision-4B แล้วคุณจะได้การเปรียบเทียบที่ตัดสินกันด้วยความสามารถน้อยกว่าด้วยสิ่งที่ผู้ขายแต่ละรายยอมเปิดเผย โมเดลของ Microsoft เปิดให้ใช้งานทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026: ใช้ฐาน Qwen3.5-9B ผ่านการฝึกหลังการฝึกโดย Microsoft รองรับเฉพาะข้อความ คอนเท็กซ์ 32,768 โทเคน ไม่เผยแพร่เวต และมีระเบียบวิธีประเมินที่อธิบายความแม่นยำ ความคลาดเคลื่อนของการคาลิเบรต และการทดสอบทางสถิติแบบจับคู่ — แต่ไม่มีผลลัพธ์เลยแม้แต่รายการเดียว ส่วน Intern-Decision-4B ของ InternLM ถูกอัปโหลดขึ้น Hugging Face เมื่อวันที่ 26 กันยายน 2026 เวลา 05:36:37 UTC โดยไม่มีประกาศใด ๆ รองรับอยู่เบื้องหลัง ถูก fine-tune มาจาก Qwen3.5-4B รับได้ทั้งภาพและข้อความ ทำงานใน 44 มิลลิวินาทีบน RTX 4090 ตัวเดียว และแสดงตารางตัวเลข Brier และ expected calibration error อย่างครบถ้วน ทั้งสองคืนค่าการกระจายความน่าจะเป็นเหนือตัวเลือกที่คุณป้อนให้ มีเพียงตัวเดียวเท่านั้นที่บอกคุณได้ว่ามันทำได้ดีแค่ไหน

การกลับกันนั้น — การที่โมเดลที่ใหญ่กว่าและมีทุนหนากว่ากลับเป็นตัวที่ไม่โปร่งใส — คือรูปร่างทั้งหมดของการเปรียบเทียบนี้ และมันตัดสินใจเลือกสำหรับทีมส่วนใหญ่ได้เร็วกว่าบรรทัดสเปกใด ๆ

ตัวเลขเดียวที่แยกพวกเขาออกจากกัน

InternLM รายงานค่า Brier 0.347 และ ECE 0.065 สำหรับ Intern-Decision-4B ทั่วชุดเบนช์มาร์กของมัน โดยมีคะแนนเฉลี่ย 90.02 จาก Jevbench-Easy (100.00), Jevbench-Original (98.61), Jevbench-Hard (73.87), Typed Decision (80.55), ToolACE (96.45), AG News (90.82) และ WildJailBreak (89.86) นี่เป็นตัวเลขที่ผู้ขายรายงานบนฮาร์เนสของผู้ขายเอง และแถว Jevbench โดยเฉพาะเป็นตระกูลเบนช์มาร์กของโครงการเอง — ควรอ่านเป็น self-assessment ไม่ใช่การตรวจสอบอิสระ แต่พวกมันเป็นตัวเลขที่ระบุสเกลไว้ และ ECE โดยเฉพาะคือค่าที่บอกคุณว่า 0.8 ที่ส่งคืนมานั้นควรค่าแก่การนำไปปฏิบัติหรือไม่

Microsoft ไม่ได้เผยแพร่สิ่งที่เทียบเท่า แท็บ Benchmarks บนหน้าแค็ตตาล็อกของ Microsoft-Decision-1 อธิบายสิ่งที่ถูกวัดและอ้างว่าโมเดลนี้ "ทำงานได้ทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" โดยระบุจุดแข็งที่สุด ได้แก่ การให้เหตุผล การนำกฎไปใช้ และความทนทานต่อรูปแบบพรอมป์ต์ ส่วนจุดอ่อนที่สุดคือความรู้เฉพาะด้าน ไม่มี Brier ไม่มี ECE ไม่มีตารางความแม่นยำ หากการตัดสินใจนำไปใช้ของคุณต้องอาศัยตัวเลขการปรับเทียบก่อนจึงจะกำหนดขนาดเกณฑ์การยกระดับได้ โมเดลสองตัวนี้ตัวหนึ่งมอบตัวเลขนั้นให้คุณ ส่วนอีกตัวขอให้คุณวัดด้วยตัวเอง

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

จุดที่สัญญาทั้งสองฉบับแตกต่างกันจริง

เมื่อมองเผิน ๆ โมเดลเหล่านี้รับการเรียกแบบเดียวกัน คุณส่งสถานะ สคีมาของคำถามที่มีชื่อ และชุดตัวเลือกคงที่เข้ามา แล้วคุณจะได้ความน่าจะเป็นต่อตัวเลือกกลับไป โดยไม่มีข้อความที่สร้างขึ้นแม้แต่โทเคนเดียว ความแตกต่างจะปรากฏที่ขอบของสัญญานั้น

• โมดัลลิตี — Microsoft-Decision-1 เป็นแบบข้อความล้วนอย่างชัดเจน และไม่รับหรือสร้างเนื้อหารูปภาพ เสียง หรือวิดีโอ ส่วน Intern-Decision-4B สามารถรับรูปภาพเพิ่มเติมพร้อมกับ state ได้ โดยรับได้สูงสุดแปดรูปต่อการเรียกหนึ่งครั้ง ซึ่งเป็นเหตุผลที่ทำให้มันเป็นตัวเลือกสำหรับการคัดแยกภาพหน้าจอ การตรวจสอบเลย์เอาต์เอกสาร และการจัดเส้นทางงานตรวจสอบคุณภาพเชิงภาพ

• จำนวนข้อคำถาม — InternLM ระบุว่ามี 1 ถึง 16 คำถามต่อการเรียก แต่ละคำถามมีตัวเลือกได้สูงสุด 62 ตัวเลือก ครอบคลุมสามประเภทฟิลด์ (choice, score, noul) Microsoft ระบุรูปแบบต่าง ๆ — ใช่/ไม่ใช่, ปรนัย, การให้คะแนน, การจำแนกประเภท, รูบริก — และการเรียกใช้ครั้งเดียวสูงสุด 32K โทเค็น แต่ไม่ได้ระบุเพดานจำนวนคำถามต่อการเรียก

• บริบท — Microsoft ระบุ 32,768 โทเค็น การ์ดของ Intern-Decision-4B ระบุขีดจำกัดในรูปของจำนวนคำถาม ตัวเลือก และรูปภาพ แทนที่จะเป็นตัวเลขบริบทเพียงตัวเดียว ดังนั้นคุณจึงไม่สามารถเทียบทั้งสองบนตัวเลขเพียงตัวเดียวได้

• การเผยแพร่ — Microsoft-Decision-1 เป็น Foundry API ที่โฮสต์ให้บริการ; ไม่มีการเผยแพร่ค่าน้ำหนักของโมเดล และไม่มีให้ดาวน์โหลด Intern-Decision-4B อยู่ภายใต้ Apache-2.0 บน Hugging Face โดยคงสัญญาอนุญาต Qwen จากต้นทางไว้เป็น LICENSE-QWEN, ซึ่งหมายความว่าต้องคงสัญญาอนุญาตนั้นและประกาศของต้นทางไว้ หากคุณเผยแพร่ต่อ

• โครงสร้างต้นทุน — น้ำหนักของ InternLM ไม่มีค่าใช้จ่ายในการรัน และระบุไว้ที่ 44.16 ms ค่าเฉลี่ย, 44.60 ms ค่า P95 บนการ์ด RTX 4090 หนึ่งใบ ราคาต่อโทเคนของ Microsoft ไม่ได้แสดงไว้บนหน้าเพจของโมเดลเลย

• การกำกับดูแล — Microsoft ส่งมอบการประเมิน Responsible AI แนวปฏิบัติในการปรับใช้ที่มีเอกสารประกอบ และข้อจำกัดยกเว้นที่ชัดเจน (ไม่ใช่สำหรับการสร้างข้อความ การถามตอบแบบเปิดกว้าง การสนทนา การแปล หรือการสรุปความ; ไม่ให้เป็นผู้ตัดสินใจอัตโนมัติเพียงลำพังในการตัดสินใจที่มีนัยสำคัญเกี่ยวกับผู้คน) InternLM ส่งมอบการ์ดโมเดล (model card) ที่เปิดเผยที่มาอย่างตรงไปตรงมา — น้ำหนักที่ "ปรับเปลี่ยนโดยการปรับจูนการตัดสินใจ" — และไม่มีสิ่งใดที่ใกล้เคียงกับชุดเอกสารด้านการปฏิบัติตามข้อกำหนด

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

延迟数字难以比较的两个截然不同的原因

Microsoft-Decision-1 ไม่ได้เผยแพร่ตัวเลข latency ดังนั้นจึงไม่มีอะไรจะนำไปวางข้างค่าเฉลี่ย 44.16 ms ของ InternLM ได้ นั่นไม่ใช่การละเว้นเล็กน้อยสำหรับ workload นี้ โมเดลเหล่านี้มีอยู่เพื่อถูกเรียกหลายครั้งภายใน pipeline — ครั้งต่อเอกสารที่ดึงมา ครั้งต่อ tool call ที่เสนอ ครั้งต่อ response ที่กำลังถูกให้คะแนน — และความแตกต่างระหว่างสี่การตัดสินใจต่อวินาทีกับสี่สิบคือความแตกต่างระหว่างการให้คะแนนตัวอย่างหนึ่งชิ้นกับการให้คะแนนทุกสิ่ง ตัวเลขของ InternLM นั้นทำได้จริงในวันนี้บนฮาร์ดแวร์ที่คุณเช่าเป็นรายชั่วโมงได้ ส่วนของ Microsoft ต้องวัดผ่านการดีพลอย Foundry ของคุณเอง และรูปแบบการดีพลอยที่คุณเลือก (pay-as-you-go serverless เทียบกับ provisioned throughput) จะเปลี่ยนมันมากกว่าตัวโมเดลเสียอีก

นี่คือจุดที่ครึ่งหนึ่งของรูปแบบของ OrcaRouter เข้ามาเกี่ยวข้อง และเป็นครึ่งฝ่ายสร้างเท่านั้น เราไม่ได้โฮสต์ Microsoft-Decision-1 หรือ Intern-Decision-4B — โมเดลที่คืนค่าความน่าจะเป็นแทนข้อความไม่ใช่สิ่งที่คุณจะกำหนดเส้นทาง chat completions ไปให้ และทั้งสองก็ไม่ปรากฏในแคตตาล็อกของเรา สิ่งที่อยู่เบื้องหลังคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียวของเราคือพูลโมเดลมากกว่า 200 โมเดลที่ทำหน้าที่เขียน: พรอมป์ต์ของผู้ตัดสินที่ร่างโดยโมเดลหนึ่ง คำตอบแคนดิเดตที่สร้างโดยอีกสองโมเดล การเรียกใช้เครื่องมือที่ได้คะแนนก่อนที่จะรันราคาตามรายการของผู้ให้บริการถูกส่งผ่านด้วยมาร์กอัป 0% ดังนั้นการลดราคาของตัวสร้างจึงมีผลในฝั่งเราวันเดียวกัน และการสลับไปใช้สำรองอัตโนมัติช่วยให้ฝั่งการสร้างของวงจรการให้คะแนนยังทำงานอยู่เมื่อผู้ให้บริการรายเดียวเสื่อมประสิทธิภาพ — ซึ่งสำคัญกว่าปกติตรงนี้ เพราะไปป์ไลน์ที่ให้คะแนนทุกอย่างที่เห็นไม่มีช่องว่างให้ลองใหม่เมื่อการเรียกหยุดชะงัก

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

ใครควรรับอันไหน

เลือก Intern-Decision-4B หากข้อใดข้อหนึ่งต่อไปนี้เป็นจริง: คุณต้องให้คะแนนทั้งภาพและข้อความ, คุณต้องมีค่าการปรับเทียบก่อนที่จะส่งมอบได้, คุณต้องการตัวเลือกในการรันโมเดลบนฮาร์ดแวร์ของคุณเองภายในขอบเขตที่คุณควบคุม, หรือคุณต้องการ fine-tune มัน ประเด็นสุดท้ายควรค่าแก่การเน้นเป็นพิเศษ — ตัวให้คะแนนแบบ open-weights ขนาด 4B ที่มี wrapper พร้อมเอกสารประกอบ เป็นโมเดลที่คุณสามารถปรับให้เข้ากับป้ายกำกับของคุณเองได้ และ Microsoft-Decision-1 เป็น API แบบโฮสต์ที่ไม่มีเส้นทางสำหรับ fine-tuning และไม่มีน้ำหนักให้ปรับ

เลือก Microsoft-Decision-1หากอุปสรรคคือการจัดซื้อจัดจ้างมากกว่าประสิทธิภาพ เพราะคุณต้องมีระบบยืนยันตัวตนของ Azure การเรียกเก็บเงินแบบรวมศูนย์ ธรรมาภิบาล และการประเมิน Responsible AI จากผู้ขาย ก่อนที่สิ่งใดจะขึ้นสู่โปรดักชัน และคุณต้องมีบริบท 32K สำหรับเอกสารยาว ซึ่งข้อจำกัดต่อการเรียกใช้ในแต่ละครั้งของรุ่น 4B ทำให้ยุ่งยากขึ้น การที่มันไม่มีผลการวัดประสิทธิภาพที่เผยแพร่ถือเป็นต้นทุนที่แท้จริง แต่มันเป็นต้นทุนที่คุณปลดทิ้งได้ภายในบ่ายเดียว ด้วยการรันชุดข้อมูลที่ติดป้ายกำกับของคุณเองผ่านทั้งสองโมเดลแล้วเปรียบเทียบ ECE — ซึ่งนั่นก็เป็นสิ่งที่คุณจะทำอยู่แล้วก่อนที่จะเชื่อตารางของผู้ขายรายใดรายหนึ่ง

คำตอบที่ชวนกระอักกระอ่วนคือ ทั้งสองอย่างนี้มีต้นทุนต่ำพอที่จะทดสอบได้ จนแทบไม่คุ้มที่จะถกเถียงกันตั้งแต่แรก Intern-Decision-4B ต้องการ GPU ที่คุณน่าจะมีอยู่แล้ว Microsoft-Decision-1 ต้องการการดีพลอยบน Foundry และตัวอย่างการตัดสินใจที่คุณติดป้ายกำกับเองสักชุดหนึ่ง ลองรันข้อมูลของคุณผ่านทั้งสองแบบ คำนวณคาลิเบรชันบนเซตย่อยที่สำคัญกับคุณ แล้วให้ตัวเลขเป็นตัวตัดสิน — ซึ่งนั่นก็เหมาะเจาะอย่างยิ่ง เพราะเป็นสิ่งที่โมเดลเหล่านี้มีไว้เพื่อทำโดยแท้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube