
Microsoft-Decision-1 กับ Intern-Decision-4B: ตัวหนึ่งเผยแพร่การสอบเทียบของตน อีกตัวหนึ่งเผยแพร่ระเบียบวิธีของตน
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
วางMicrosoft-Decision-1 ไว้ข้าง ๆ Intern-Decision-4B แล้วคุณจะได้การเปรียบเทียบที่ตัดสินกันด้วยความสามารถน้อยกว่าด้วยสิ่งที่ผู้ขายแต่ละรายยอมเปิดเผย โมเดลของ Microsoft เปิดให้ใช้งานทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026: ใช้ฐาน Qwen3.5-9B ผ่านการฝึกหลังการฝึกโดย Microsoft รองรับเฉพาะข้อความ คอนเท็กซ์ 32,768 โทเคน ไม่เผยแพร่เวต และมีระเบียบวิธีประเมินที่อธิบายความแม่นยำ ความคลาดเคลื่อนของการคาลิเบรต และการทดสอบทางสถิติแบบจับคู่ — แต่ไม่มีผลลัพธ์เลยแม้แต่รายการเดียว ส่วน Intern-Decision-4B ของ InternLM ถูกอัปโหลดขึ้น Hugging Face เมื่อวันที่ 26 กันยายน 2026 เวลา 05:36:37 UTC โดยไม่มีประกาศใด ๆ รองรับอยู่เบื้องหลัง ถูก fine-tune มาจาก Qwen3.5-4B รับได้ทั้งภาพและข้อความ ทำงานใน 44 มิลลิวินาทีบน RTX 4090 ตัวเดียว และแสดงตารางตัวเลข Brier และ expected calibration error อย่างครบถ้วน ทั้งสองคืนค่าการกระจายความน่าจะเป็นเหนือตัวเลือกที่คุณป้อนให้ มีเพียงตัวเดียวเท่านั้นที่บอกคุณได้ว่ามันทำได้ดีแค่ไหน
การกลับกันนั้น — การที่โมเดลที่ใหญ่กว่าและมีทุนหนากว่ากลับเป็นตัวที่ไม่โปร่งใส — คือรูปร่างทั้งหมดของการเปรียบเทียบนี้ และมันตัดสินใจเลือกสำหรับทีมส่วนใหญ่ได้เร็วกว่าบรรทัดสเปกใด ๆ
ตัวเลขเดียวที่แยกพวกเขาออกจากกัน
InternLM รายงานค่า Brier 0.347 และ ECE 0.065 สำหรับ Intern-Decision-4B ทั่วชุดเบนช์มาร์กของมัน โดยมีคะแนนเฉลี่ย 90.02 จาก Jevbench-Easy (100.00), Jevbench-Original (98.61), Jevbench-Hard (73.87), Typed Decision (80.55), ToolACE (96.45), AG News (90.82) และ WildJailBreak (89.86) นี่เป็นตัวเลขที่ผู้ขายรายงานบนฮาร์เนสของผู้ขายเอง และแถว Jevbench โดยเฉพาะเป็นตระกูลเบนช์มาร์กของโครงการเอง — ควรอ่านเป็น self-assessment ไม่ใช่การตรวจสอบอิสระ แต่พวกมันเป็นตัวเลขที่ระบุสเกลไว้ และ ECE โดยเฉพาะคือค่าที่บอกคุณว่า 0.8 ที่ส่งคืนมานั้นควรค่าแก่การนำไปปฏิบัติหรือไม่
Microsoft ไม่ได้เผยแพร่สิ่งที่เทียบเท่า แท็บ Benchmarks บนหน้าแค็ตตาล็อกของ Microsoft-Decision-1 อธิบายสิ่งที่ถูกวัดและอ้างว่าโมเดลนี้ "ทำงานได้ทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" โดยระบุจุดแข็งที่สุด ได้แก่ การให้เหตุผล การนำกฎไปใช้ และความทนทานต่อรูปแบบพรอมป์ต์ ส่วนจุดอ่อนที่สุดคือความรู้เฉพาะด้าน ไม่มี Brier ไม่มี ECE ไม่มีตารางความแม่นยำ หากการตัดสินใจนำไปใช้ของคุณต้องอาศัยตัวเลขการปรับเทียบก่อนจึงจะกำหนดขนาดเกณฑ์การยกระดับได้ โมเดลสองตัวนี้ตัวหนึ่งมอบตัวเลขนั้นให้คุณ ส่วนอีกตัวขอให้คุณวัดด้วยตัวเอง

จุดที่สัญญาทั้งสองฉบับแตกต่างกันจริง
เมื่อมองเผิน ๆ โมเดลเหล่านี้รับการเรียกแบบเดียวกัน คุณส่งสถานะ สคีมาของคำถามที่มีชื่อ และชุดตัวเลือกคงที่เข้ามา แล้วคุณจะได้ความน่าจะเป็นต่อตัวเลือกกลับไป โดยไม่มีข้อความที่สร้างขึ้นแม้แต่โทเคนเดียว ความแตกต่างจะปรากฏที่ขอบของสัญญานั้น
• โมดัลลิตี — Microsoft-Decision-1 เป็นแบบข้อความล้วนอย่างชัดเจน และไม่รับหรือสร้างเนื้อหารูปภาพ เสียง หรือวิดีโอ ส่วน Intern-Decision-4B สามารถรับรูปภาพเพิ่มเติมพร้อมกับ state ได้ โดยรับได้สูงสุดแปดรูปต่อการเรียกหนึ่งครั้ง ซึ่งเป็นเหตุผลที่ทำให้มันเป็นตัวเลือกสำหรับการคัดแยกภาพหน้าจอ การตรวจสอบเลย์เอาต์เอกสาร และการจัดเส้นทางงานตรวจสอบคุณภาพเชิงภาพ
• จำนวนข้อคำถาม — InternLM ระบุว่ามี 1 ถึง 16 คำถามต่อการเรียก แต่ละคำถามมีตัวเลือกได้สูงสุด 62 ตัวเลือก ครอบคลุมสามประเภทฟิลด์ (choice, score, noul) Microsoft ระบุรูปแบบต่าง ๆ — ใช่/ไม่ใช่, ปรนัย, การให้คะแนน, การจำแนกประเภท, รูบริก — และการเรียกใช้ครั้งเดียวสูงสุด 32K โทเค็น แต่ไม่ได้ระบุเพดานจำนวนคำถามต่อการเรียก
• บริบท — Microsoft ระบุ 32,768 โทเค็น การ์ดของ Intern-Decision-4B ระบุขีดจำกัดในรูปของจำนวนคำถาม ตัวเลือก และรูปภาพ แทนที่จะเป็นตัวเลขบริบทเพียงตัวเดียว ดังนั้นคุณจึงไม่สามารถเทียบทั้งสองบนตัวเลขเพียงตัวเดียวได้
• การเผยแพร่ — Microsoft-Decision-1 เป็น Foundry API ที่โฮสต์ให้บริการ; ไม่มีการเผยแพร่ค่าน้ำหนักของโมเดล และไม่มีให้ดาวน์โหลด Intern-Decision-4B อยู่ภายใต้ Apache-2.0 บน Hugging Face โดยคงสัญญาอนุญาต Qwen จากต้นทางไว้เป็น LICENSE-QWEN, ซึ่งหมายความว่าต้องคงสัญญาอนุญาตนั้นและประกาศของต้นทางไว้ หากคุณเผยแพร่ต่อ
• โครงสร้างต้นทุน — น้ำหนักของ InternLM ไม่มีค่าใช้จ่ายในการรัน และระบุไว้ที่ 44.16 ms ค่าเฉลี่ย, 44.60 ms ค่า P95 บนการ์ด RTX 4090 หนึ่งใบ ราคาต่อโทเคนของ Microsoft ไม่ได้แสดงไว้บนหน้าเพจของโมเดลเลย
• การกำกับดูแล — Microsoft ส่งมอบการประเมิน Responsible AI แนวปฏิบัติในการปรับใช้ที่มีเอกสารประกอบ และข้อจำกัดยกเว้นที่ชัดเจน (ไม่ใช่สำหรับการสร้างข้อความ การถามตอบแบบเปิดกว้าง การสนทนา การแปล หรือการสรุปความ; ไม่ให้เป็นผู้ตัดสินใจอัตโนมัติเพียงลำพังในการตัดสินใจที่มีนัยสำคัญเกี่ยวกับผู้คน) InternLM ส่งมอบการ์ดโมเดล (model card) ที่เปิดเผยที่มาอย่างตรงไปตรงมา — น้ำหนักที่ "ปรับเปลี่ยนโดยการปรับจูนการตัดสินใจ" — และไม่มีสิ่งใดที่ใกล้เคียงกับชุดเอกสารด้านการปฏิบัติตามข้อกำหนด

延迟数字难以比较的两个截然不同的原因
Microsoft-Decision-1 ไม่ได้เผยแพร่ตัวเลข latency ดังนั้นจึงไม่มีอะไรจะนำไปวางข้างค่าเฉลี่ย 44.16 ms ของ InternLM ได้ นั่นไม่ใช่การละเว้นเล็กน้อยสำหรับ workload นี้ โมเดลเหล่านี้มีอยู่เพื่อถูกเรียกหลายครั้งภายใน pipeline — ครั้งต่อเอกสารที่ดึงมา ครั้งต่อ tool call ที่เสนอ ครั้งต่อ response ที่กำลังถูกให้คะแนน — และความแตกต่างระหว่างสี่การตัดสินใจต่อวินาทีกับสี่สิบคือความแตกต่างระหว่างการให้คะแนนตัวอย่างหนึ่งชิ้นกับการให้คะแนนทุกสิ่ง ตัวเลขของ InternLM นั้นทำได้จริงในวันนี้บนฮาร์ดแวร์ที่คุณเช่าเป็นรายชั่วโมงได้ ส่วนของ Microsoft ต้องวัดผ่านการดีพลอย Foundry ของคุณเอง และรูปแบบการดีพลอยที่คุณเลือก (pay-as-you-go serverless เทียบกับ provisioned throughput) จะเปลี่ยนมันมากกว่าตัวโมเดลเสียอีก
นี่คือจุดที่ครึ่งหนึ่งของรูปแบบของ OrcaRouter เข้ามาเกี่ยวข้อง และเป็นครึ่งฝ่ายสร้างเท่านั้น เราไม่ได้โฮสต์ Microsoft-Decision-1 หรือ Intern-Decision-4B — โมเดลที่คืนค่าความน่าจะเป็นแทนข้อความไม่ใช่สิ่งที่คุณจะกำหนดเส้นทาง chat completions ไปให้ และทั้งสองก็ไม่ปรากฏในแคตตาล็อกของเรา สิ่งที่อยู่เบื้องหลังคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียวของเราคือพูลโมเดลมากกว่า 200 โมเดลที่ทำหน้าที่เขียน: พรอมป์ต์ของผู้ตัดสินที่ร่างโดยโมเดลหนึ่ง คำตอบแคนดิเดตที่สร้างโดยอีกสองโมเดล การเรียกใช้เครื่องมือที่ได้คะแนนก่อนที่จะรันราคาตามรายการของผู้ให้บริการถูกส่งผ่านด้วยมาร์กอัป 0% ดังนั้นการลดราคาของตัวสร้างจึงมีผลในฝั่งเราวันเดียวกัน และการสลับไปใช้สำรองอัตโนมัติช่วยให้ฝั่งการสร้างของวงจรการให้คะแนนยังทำงานอยู่เมื่อผู้ให้บริการรายเดียวเสื่อมประสิทธิภาพ — ซึ่งสำคัญกว่าปกติตรงนี้ เพราะไปป์ไลน์ที่ให้คะแนนทุกอย่างที่เห็นไม่มีช่องว่างให้ลองใหม่เมื่อการเรียกหยุดชะงัก

ใครควรรับอันไหน
เลือก Intern-Decision-4B หากข้อใดข้อหนึ่งต่อไปนี้เป็นจริง: คุณต้องให้คะแนนทั้งภาพและข้อความ, คุณต้องมีค่าการปรับเทียบก่อนที่จะส่งมอบได้, คุณต้องการตัวเลือกในการรันโมเดลบนฮาร์ดแวร์ของคุณเองภายในขอบเขตที่คุณควบคุม, หรือคุณต้องการ fine-tune มัน ประเด็นสุดท้ายควรค่าแก่การเน้นเป็นพิเศษ — ตัวให้คะแนนแบบ open-weights ขนาด 4B ที่มี wrapper พร้อมเอกสารประกอบ เป็นโมเดลที่คุณสามารถปรับให้เข้ากับป้ายกำกับของคุณเองได้ และ Microsoft-Decision-1 เป็น API แบบโฮสต์ที่ไม่มีเส้นทางสำหรับ fine-tuning และไม่มีน้ำหนักให้ปรับ
เลือก Microsoft-Decision-1หากอุปสรรคคือการจัดซื้อจัดจ้างมากกว่าประสิทธิภาพ เพราะคุณต้องมีระบบยืนยันตัวตนของ Azure การเรียกเก็บเงินแบบรวมศูนย์ ธรรมาภิบาล และการประเมิน Responsible AI จากผู้ขาย ก่อนที่สิ่งใดจะขึ้นสู่โปรดักชัน และคุณต้องมีบริบท 32K สำหรับเอกสารยาว ซึ่งข้อจำกัดต่อการเรียกใช้ในแต่ละครั้งของรุ่น 4B ทำให้ยุ่งยากขึ้น การที่มันไม่มีผลการวัดประสิทธิภาพที่เผยแพร่ถือเป็นต้นทุนที่แท้จริง แต่มันเป็นต้นทุนที่คุณปลดทิ้งได้ภายในบ่ายเดียว ด้วยการรันชุดข้อมูลที่ติดป้ายกำกับของคุณเองผ่านทั้งสองโมเดลแล้วเปรียบเทียบ ECE — ซึ่งนั่นก็เป็นสิ่งที่คุณจะทำอยู่แล้วก่อนที่จะเชื่อตารางของผู้ขายรายใดรายหนึ่ง
คำตอบที่ชวนกระอักกระอ่วนคือ ทั้งสองอย่างนี้มีต้นทุนต่ำพอที่จะทดสอบได้ จนแทบไม่คุ้มที่จะถกเถียงกันตั้งแต่แรก Intern-Decision-4B ต้องการ GPU ที่คุณน่าจะมีอยู่แล้ว Microsoft-Decision-1 ต้องการการดีพลอยบน Foundry และตัวอย่างการตัดสินใจที่คุณติดป้ายกำกับเองสักชุดหนึ่ง ลองรันข้อมูลของคุณผ่านทั้งสองแบบ คำนวณคาลิเบรชันบนเซตย่อยที่สำคัญกับคุณ แล้วให้ตัวเลขเป็นตัวตัดสิน — ซึ่งนั่นก็เหมาะเจาะอย่างยิ่ง เพราะเป็นสิ่งที่โมเดลเหล่านี้มีไว้เพื่อทำโดยแท้
